当前位置:首页 > 科技资讯 > 正文

揭秘ChatGPT背后的工程师:从清华到OpenAI的强化学习之旅

ChatGPT背后的男人:揭秘中国工程师在OpenAI的强化学习之旅

智东西最新报道,ChatGPT背后的一位中国工程师——OpenAI核心贡献者翁家翌,近日在AI播客WhynotTV Podcast接受独家专访,首次详细讲述了自己从清华少年到OpenAI infra骨干的传奇经历。

揭秘ChatGPT背后的工程师:从清华到OpenAI的强化学习之旅 ChatGPT OpenAI 翁家翌 强化学习 第1张

作为强化学习与后训练(Post-Training)系统的关键工程师,翁家翌深度参与了GPT-3.5、GPT-4、GPT-5等核心模型的训练,其搭建的infra系统已成为OpenAI内部大模型训练与迭代的基础底座,也是ChatGPT持续进化的关键支撑。

在这场长达两个多小时的对谈中,翁家翌不仅披露了OpenAI内部Post-Training系统的构建逻辑,还解释了OpenAI为何能持续产出爆款模型。

他还分享了他对AGI定义、OpenAI不“open”批评以及内部人才流动加剧等现象的第一手观察。

面对科技巨头抛来的橄榄枝,他为何最终选择了OpenAI?谈及职业方向,他又为何自称“卖铲子里最面向客户的那位”,并立下目标“我要最大化我在OpenAI Blog上出现的次数”?这场对谈,给出了答案。

01.从“卖铲子”到主导Post-Training,他是OpenAI模型背后的基础构建者

在OpenAI内部,几乎每一个大型模型的发布名单里,都能看到翁家翌的名字,他主导搭建了OpenAI强化学习后训练(Post-Training)阶段的核心基础设施。

每发一个大的release,每发一个大的模型,我的名字就得放上去。”他说,“因为大家都在用整个Post-Training infra去训练RHF的模型。”

他说自己“是卖铲子里最面向客户的那位”,因为强化学习模块处在整个基础设施栈的最顶端。他还给自己的职业生涯设定过一个指标:“我要最大化我在OpenAI Blog上出现的次数。”

面对年轻人,他的建议仍是:持续投入工程建设,而不是学术研究。他不避讳地说:“长远来看,我还是觉得现代学术界应该要被重构。”在他看来,如果目标是进入工业界,最重要的是匹配真实的工作需求,“AI Lab最缺的其实就是Infra人才,infra是个无底洞。

02.他为ChatGPT模型搭建后训练系统,也在重构下一代Infra

ChatGPT 3.5正式发布之前,OpenAI内部其实已开始在GPT-4上验证强化学习后训练(RLHF)流程的可行性。

翁家翌回忆,当时他负责的正是RLHF训练Pipeline的整体搭建:旧的infra是跑不动的,我在新infra上调通了第一版,先在4上做通,再迁回3.5。这套Post-Training系统随后被用于整个ChatGPT系列模型的训练中。

03.他在福建省队拿下“唯一一块铜牌”,叩开清华大门

面对“你小时候是个什么样的小孩”的问题,翁家翌从奥数讲起。他在数学上展现出超常的直觉能力,常常别人还在计算时他就已经写完了答案。

04.他在清华开源作业、修校园网Bug,误打误撞走进了强化学习

进入高校后,如果要说清华生活里最“出圈”的事,是翁家翌给把所有的作业都开源了。

05.那些看似“折腾”的科研尝试,成了他走向OpenAI的“前传”

自此,翁家翌开启了他的第一个科研项目:在一个上世纪90年代的游戏中训练神经网络,让智能体在固定地图里完成从出生点到终点的任务。

06.他用两个项目“做慈善”:天授与tuixue online,一炮而红

“我不想发paper,觉得没有意义。”翁家翌坦言。对他来说,多一篇少一篇论文并没有意义。“我申请已经够用了。”

07.加入OpenAI之前,他已彻底想清楚:要工程,不要“炼丹”

2020年,翁家翌远程开始了CMU的硕士课程。也正是在这段时期,他开始准备找工作。

08.OpenAI还“Open”吗?从AGI定义到组织焦虑,翁家翌给出答案

在翁家翌看来,“Agent”和“强化学习的post-training”之间没有本质差别。“它们本质上是一个东西。”他认为,在技术路径上,环境变化是主要区别。

09.如果AI真的能预测未来,人类该不该按下暂停键

在这段对话的最后,话题转向了一个更抽象的问题:如果让AI去解决一个世界难题,翁家翌最想做的是什么。他给出的答案是如何预测未来。