ChatGPT背后的男人:揭秘中国工程师在OpenAI的强化学习之旅
智东西最新报道,ChatGPT背后的一位中国工程师——OpenAI核心贡献者翁家翌,近日在AI播客WhynotTV Podcast接受独家专访,首次详细讲述了自己从清华少年到OpenAI infra骨干的传奇经历。
作为强化学习与后训练(Post-Training)系统的关键工程师,翁家翌深度参与了GPT-3.5、GPT-4、GPT-5等核心模型的训练,其搭建的infra系统已成为OpenAI内部大模型训练与迭代的基础底座,也是ChatGPT持续进化的关键支撑。
在这场长达两个多小时的对谈中,翁家翌不仅披露了OpenAI内部Post-Training系统的构建逻辑,还解释了OpenAI为何能持续产出爆款模型。
他还分享了他对AGI定义、OpenAI不“open”批评以及内部人才流动加剧等现象的第一手观察。
面对科技巨头抛来的橄榄枝,他为何最终选择了OpenAI?谈及职业方向,他又为何自称“卖铲子里最面向客户的那位”,并立下目标“我要最大化我在OpenAI Blog上出现的次数”?这场对谈,给出了答案。
在OpenAI内部,几乎每一个大型模型的发布名单里,都能看到翁家翌的名字,他主导搭建了OpenAI强化学习后训练(Post-Training)阶段的核心基础设施。
“每发一个大的release,每发一个大的模型,我的名字就得放上去。”他说,“因为大家都在用整个Post-Training infra去训练RHF的模型。”
他说自己“是卖铲子里最面向客户的那位”,因为强化学习模块处在整个基础设施栈的最顶端。他还给自己的职业生涯设定过一个指标:“我要最大化我在OpenAI Blog上出现的次数。”
面对年轻人,他的建议仍是:持续投入工程建设,而不是学术研究。他不避讳地说:“长远来看,我还是觉得现代学术界应该要被重构。”在他看来,如果目标是进入工业界,最重要的是匹配真实的工作需求,“AI Lab最缺的其实就是Infra人才,infra是个无底洞。”
ChatGPT 3.5正式发布之前,OpenAI内部其实已开始在GPT-4上验证强化学习后训练(RLHF)流程的可行性。
翁家翌回忆,当时他负责的正是RLHF训练Pipeline的整体搭建:旧的infra是跑不动的,我在新infra上调通了第一版,先在4上做通,再迁回3.5。这套Post-Training系统随后被用于整个ChatGPT系列模型的训练中。
面对“你小时候是个什么样的小孩”的问题,翁家翌从奥数讲起。他在数学上展现出超常的直觉能力,常常别人还在计算时他就已经写完了答案。
进入高校后,如果要说清华生活里最“出圈”的事,是翁家翌给把所有的作业都开源了。
自此,翁家翌开启了他的第一个科研项目:在一个上世纪90年代的游戏中训练神经网络,让智能体在固定地图里完成从出生点到终点的任务。
“我不想发paper,觉得没有意义。”翁家翌坦言。对他来说,多一篇少一篇论文并没有意义。“我申请已经够用了。”
2020年,翁家翌远程开始了CMU的硕士课程。也正是在这段时期,他开始准备找工作。
在翁家翌看来,“Agent”和“强化学习的post-training”之间没有本质差别。“它们本质上是一个东西。”他认为,在技术路径上,环境变化是主要区别。
在这段对话的最后,话题转向了一个更抽象的问题:如果让AI去解决一个世界难题,翁家翌最想做的是什么。他给出的答案是如何预测未来。
本文由主机测评网于2026-06-13发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647314.html