智东西2月20日消息,今日凌晨,谷歌正式揭晓其新一代旗舰模型Gemini 3.1 Pro的神秘面纱。据谷歌发布的基准测试数据,这款最强复杂任务处理模型在12项测试中力压群雄,包括Gemini 3 Pro、Claude Opus 4.6、Claude Sonnet 4.6、GPT-5.2等模型,荣获榜首。
谷歌DeepMind团队大幅提升了Gemini 3.1 Pro的推理能力。在业界公认的ARC-AGI-2通用智能基准测试中,Gemini 3.1 Pro取得了77.1%的高分,超越Claude、GPT等模型,成绩更是实现了对Gemini 3 Pro的翻倍提升。
去年9月加入谷歌DeepMind的清华物理系传奇人物姚顺宇(Shunyu Yao)也发文宣布了新模型的诞生,并豪言“更强大的Gemini模型正以势不可挡之势涌现”。
通过以下这一经典的“鹈鹕骑自行车SVG动画”对比,我们可以直观地感受到新模型在能力提升上的飞跃。右侧的Gemini 3.1 Pro生成的鹈鹕身体结构、骑行姿态自然流畅,自行车细节完整,比Gemini 3 Pro的生成结果更符合物理常识,更像一个完整的动画场景。
为Gemini 3.1开发SVG生成功能的清华校友Jiao Sun在X上评论说“无比自豪”。
即日起,Google AI Pro、Ultra订阅用户可在Gemini应用、AI助手NotebookLM中体验Gemini 3.1 Pro。免费用户可向Gemini 3.1 Pro提问两次。开发者和企业用户则可以在AI Studio、Antigravity、Vertex AI、Gemini Enterprise、Gemini CLI及Android Studio的Gemini API预览版中试用该模型。
Gemini 3.1 Pro预览版的API价格沿用分级计费模式,与上一代Gemini 3 Pro预览版相同。提示词在20万token以内,每百万token输入价格2美元(约合人民币14元),输出价格12美元(约合人民币83元);提示词超过20万token,每百万token输入价格4美元(约合人民币28元),输出价格18美元(约合人民币124元)。
核心升级聚焦复杂任务处理能力
多模态理解与高级推理能力再升级
根据博客透露的信息,Gemini 3.1 Pro的核心升级集中在复杂任务处理能力上。新模型在高级推理、多模态理解和复杂项目生成方面表现更为出色,能够更从容地应对高难度工作场景。模型发布后,社区迅速展开了实测。
知名AI博主Chetaslua展示了其用Gemini 3.1 Pro一次性安装Windows 11 WebOS的成果。
Chetaslua在帖中直言:“上次我分享类似案例时还非常困难,现在已经变成常态。有了智能体系统,我们几乎可以用这个模型做任何事。”
他之前也发过用Gemini 3.0 Pro生成Windows Web操作系统的视频,两个视频放在一起对比,效果提升非常明显。
Gemini 3.1 Pro生成的系统界面有完整应用图标、开始菜单样式布局以及基础窗口交互逻辑,整体形态更接近一个可运行的轻量级操作系统。
相比之下,之前3.0 Pro生成的系统形态相对简陋,一些基础桌面交互和系统级应用缺失。
另一组更偏工程化的案例显示,有开发者用Gemini 3.1 Pro在浏览器中直接生成并运行了一个可交互的VoxelWeb项目,形态类似“我的世界”式3D沙盒。