史上最强模型Claude Opus 4.5发布后,全面碾压了人类顶尖工程师,Anthropic公司不得不放弃招聘笔试!现在,Anthropic已将内部考题开源。
就在不久前,人类程序员最后的堡垒被彻底撼动。
Anthropic公司曾准备了一份极难笔试考题,要求应聘者在家完成。
然而,随着Claude Opus 4.5的横空出世,这些考卷变得毫无意义。应聘者轻松应对,无需费心思考。
如今,Anthropic被迫开源了旧版试题,并向全世界发出求助:我们该如何真正测试出人类的编程能力?
作为告别,Anthropic选择将最初版本的测试题发布,作为大众公开挑战。
地址:https://github.com/anthropics/original_performance_takehome
在这个测试题中,候选人需逐步进行多核并行优化、SIMD向量化、VLIW指令打包优化,并用Perfetto trace做分析。
他们依然相信:在无限时间下,最强人类依然能超越Claude的极限。
同时他们强调:如果哪个人类能击败Claude Opus 4.5,请务必联系Anthropic!
在AI时代,我们该如何进行软件工程师的面试?
Anthropic在这篇博客里,进行了深入探索。
博客地址:https://www.anthropic.com/engineering/AI-resistant-technical-evaluations
曾几何时,Anthropic有一套完美的筛选考题。
但随着AI能力的指数级提升,今天的完美试题可能明天就被新模型秒杀。
例如,自2024年初起,他们的性能工程团队一直在用这套题:要求候选人为一个模拟加速器优化代码。
这套题在1000多名面试者中,筛出了几十个最顶尖的工程师。正是这些人点亮了Anthropic的Trainium集群,发布了从Claude 3 Opus至今的每一个模型。
然而,每个新版本的Claude都在让这套题失效。
2023年11月,Anthropic准备发布Claude Opus 3。
新的TPU和GPU集群就位,大Trainium集群即将上线。公司在算力上的投入是过去的数倍,但性能工程师却严重紧缺。
为此,Anthropic公司绩效优化团队负责人Tristan Hume在Twitter上发帖求贤。虽然收到了大量简历,但标准的面试流程太耗时了。
于是,他花了两个星期设计了一个Take-home测试,精准识别出真正硬核的候选人。
为了设计出一个有趣且能吸引候选人的测试工具,Tristan Hume做了精心策划。
相比现场面试,这种形式在评估性能工程技能上更有优势:
另外,Tristan还构建了一个Python模拟器,模拟了一个具有TPU特征的假加速器。
最初的效果非常好。一位得分遥遥领先的候选人入职后,立即开始优化算子并解决了一个阻碍发布的编译器Bug。
到了25年5月,Claude 3.7 Sonnet已经进化到让一半的候选人只需把题丢给它就能拿高分。
当Tristan拿到Claude Opus 4.5的预发布版本时,眼睁睁看着Claude Code跑了两小时。它像老练的工程师一样解决了初始瓶颈和常规微优化。
本文由主机测评网于2026-06-14发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647509.html