技能(Skills)的火爆,预示着新的Agent范式即将来临……
无需借助Skills,无需在GitHub上翻阅项目、寻找工具,只需将需求抛给Agent,它便能一边执行任务,一边创造所需的工具。
是的,这些Agent完全无需人类干预,无需向AI师傅递送扳手、搬运梯子。
工作中所需的任何工具,Agent都能直接「进化」出来。
以Gemini 3 Pro为后端,在极端评测HLE(Humanity’s Last Exam)中一骑绝尘,仅次于GPT5.2-Pro智能体。
在几个高难度评测集中,与官方未披露方法的含工具使用结果相比,其得分高了将近20分。
甚至还是一次性完成的。
这是最近新发表的一篇论文。
发现这篇论文,是因为前几天看到了一个演示。
第一眼看上去,只是一个普通的交互场景:用户提出需求,将一串提示(Prompt)抛给Agent。
找出2023届毕业生中,哪些州的ACT考试参与率达到或超过50%,且平均综合分数在20分及以上。并给出这些州中,各州学生达到科学基准的比例。
然后Agent开始分析、规划任务,挑选可能会用到的工具。
到目前为止,一切都很正常。
但说实话,这个演示选的任务并不好,太开放,不像现有工具能一次性解决,可能需要多次迭代对话。
果然出问题了,工具不够用,无法继续下去。
等一下……
它怎么开始自己造工具了??用错了还能修复?
这有点过于魔幻了。感觉就像动物园里,前一秒还躺着剥香蕉的猩猩,突然一个跟头翻起来,开始钻木取火了。
我赶紧把论文翻出来,从头到尾扒了一遍。
不看没事,这一看,扒出来一堆更让人细思极恐的细节。
这家伙,居然靠这种方式,在只有一次答题机会的5个评测集中,造了128个工具!!
是的,从零开始,一个一个捏到了128个。
简直是天崩开局。
更惨的是,研究人员还一上来就把它扔进了地狱级的Benchmark—HLE(Humanity’s Last Exam)上,与基于GPT、Claude、Gemini的Agent怪物同台竞争。
不过,意料之外的事情发生了。
遇到「打」不过的题目,这家伙居然会自己造武器。
一路打怪,一路合成装备。
等刷完HLE两千多道题时,它已经悄悄攒了97把大宝剑。
怎么做到的?
研究团队用了一种全新框架——原位自进化(In-situ Self-evolving Agent)。
仔细研究了一下,发现行业其实一直在做自进化(Self-evolving Agent),但和原位自进化是两回事。
...(中间部分省略)...
本文由主机测评网于2026-06-15发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647630.html