【导读】谷歌Google DeepMind近日宣布,其最新能力Agentic Vision将为Gemini 3 Flash赋予前所未有的‘法眼’。
令人惊讶的是,Google DeepMind为Gemini 3 Flash增添了一个重量级新能力:Agentic Vision(智能体视觉)。(这是否是对DeepSeek-OCR2的强烈回应?)
这项技术彻底改变了大语言模型理解世界的方式:
从过去的‘猜测’转变为现在的‘深度调查’。
该能力由Google DeepMind团队推出,核心产品经理Rohan Doshi表示,传统AI模型在处理图片时,往往只是静态观察。
如果图片里的细节太小,比如微处理芯片上的序列号或者远处模糊的路牌,模型往往只能依靠‘猜测’。
而Agentic Vision引入了一个‘思考-行动-观察’(Think-Act-Observe)的闭环:
模型不再是被动接收像素,而是会根据用户需求,主动编写Python代码来操纵图像。
这一能力直接让Gemini 3 Flash在各类视觉基准测试中实现了5%到10%的性能飞跃。
DeepMind探索的方法可概括为:利用代码执行作为视觉推理的工具,将被动的视觉理解转化为主动的智能体过程。
这意味着什么呢?目前最先进的模型通常是一次性处理图像。
但Agentic Vision引入了一个循环:
1. 思考(Think):模型分析用户查询和初始图像,制定多步计划。
2. 行动(Act):模型生成并执行Python代码来主动操纵图像(如裁剪、旋转、标注)或分析图像(如运行计算、计数边界框等)。
3. 观察(Observe):变换后的图像被追加到模型的上下文窗口中。这允许模型在生成最终响应之前,以更好的上下文检查新数据。
通过API中启用代码执行,开发者可以解锁许多新行为。
Google AI Studio中的演示应用已经展示了这一点。
1. 缩放与检查(Zooming and inspecting)
Gemini 3 Flash被训练为在检测到细粒度细节时进行隐式缩放。
PlanCheckSolver.com是一个AI驱动的建筑计划验证平台,通过启用Gemini 3 Flash的代码执行功能来迭代检查高分辨率输入,将准确率提高了5%。
后台日志视频展示了这个智能体过程:Gemini 3 Flash生成Python代码来裁剪和分析特定的补丁(例如屋顶边缘或建筑部分)作为新图像。
通过将这些裁剪图追加回其上下文窗口,模型在视觉上确立其推理,以确认是否符合复杂的建筑规范。
2. 图像标注(Image annotation)
Agentic Vision允许模型通过标注图像与环境交互。
Gemini 3 Flash不仅仅是描述它看到的内容,还可以执行代码直接在画布上绘制以确立其推理。
在下面的例子中,模型被要求数Gemini应用中一只手上的数字。
为了避免计数错误,它使用Python在它识别的每个手指上绘制边界框和数字标签。
这种‘视觉草稿纸’确保其最终答案是基于像素级的完美理解。
Agentic Vision今天已通过Google AI Studio和Vertex AI中的Gemini API提供。
本文由主机测评网于2026-06-16发表在主机测评网_免费VPS_免费云服务器_免费独立服务器,如有疑问,请联系我们。
本文链接:https://www.vpshk.cn/20260647802.html