当前位置:首页 > 科技资讯 > 正文

Google DeepMind:Agentic Vision重塑视觉AI新境界

【导读】谷歌Google DeepMind近日宣布,其最新能力Agentic Vision将为Gemini 3 Flash赋予前所未有的‘法眼’。

令人惊讶的是,Google DeepMind为Gemini 3 Flash增添了一个重量级新能力:Agentic Vision(智能体视觉)。(这是否是对DeepSeek-OCR2的强烈回应?)

这项技术彻底改变了大语言模型理解世界的方式:

从过去的‘猜测’转变为现在的‘深度调查’。

Google DeepMind:Agentic Vision重塑视觉AI新境界 Agentic Vision Gemini 3 Flash DeepMind 视觉AI 第1张

该能力由Google DeepMind团队推出,核心产品经理Rohan Doshi表示,传统AI模型在处理图片时,往往只是静态观察。

如果图片里的细节太小,比如微处理芯片上的序列号或者远处模糊的路牌,模型往往只能依靠‘猜测’。

而Agentic Vision引入了一个‘思考-行动-观察’(Think-Act-Observe)的闭环:

模型不再是被动接收像素,而是会根据用户需求,主动编写Python代码来操纵图像。

Google DeepMind:Agentic Vision重塑视觉AI新境界 Agentic Vision Gemini 3 Flash DeepMind 视觉AI 第2张

这一能力直接让Gemini 3 Flash在各类视觉基准测试中实现了5%到10%的性能飞跃。

Google DeepMind:Agentic Vision重塑视觉AI新境界 Agentic Vision Gemini 3 Flash DeepMind 视觉AI 第3张

Agentic Vision:智能体视觉新前沿

DeepMind探索的方法可概括为:利用代码执行作为视觉推理的工具,将被动的视觉理解转化为主动的智能体过程。

这意味着什么呢?目前最先进的模型通常是一次性处理图像。

但Agentic Vision引入了一个循环:

1. 思考(Think):模型分析用户查询和初始图像,制定多步计划。

2. 行动(Act):模型生成并执行Python代码来主动操纵图像(如裁剪、旋转、标注)或分析图像(如运行计算、计数边界框等)。

3. 观察(Observe):变换后的图像被追加到模型的上下文窗口中。这允许模型在生成最终响应之前,以更好的上下文检查新数据。

Google DeepMind:Agentic Vision重塑视觉AI新境界 Agentic Vision Gemini 3 Flash DeepMind 视觉AI 第4张

Agentic Vision实战

通过API中启用代码执行,开发者可以解锁许多新行为。

Google AI Studio中的演示应用已经展示了这一点。

1. 缩放与检查(Zooming and inspecting)

Gemini 3 Flash被训练为在检测到细粒度细节时进行隐式缩放。

PlanCheckSolver.com是一个AI驱动的建筑计划验证平台,通过启用Gemini 3 Flash的代码执行功能来迭代检查高分辨率输入,将准确率提高了5%。

后台日志视频展示了这个智能体过程:Gemini 3 Flash生成Python代码来裁剪和分析特定的补丁(例如屋顶边缘或建筑部分)作为新图像。

通过将这些裁剪图追加回其上下文窗口,模型在视觉上确立其推理,以确认是否符合复杂的建筑规范。

Google DeepMind:Agentic Vision重塑视觉AI新境界 Agentic Vision Gemini 3 Flash DeepMind 视觉AI 第5张

2. 图像标注(Image annotation)

Agentic Vision允许模型通过标注图像与环境交互。

Gemini 3 Flash不仅仅是描述它看到的内容,还可以执行代码直接在画布上绘制以确立其推理。

在下面的例子中,模型被要求数Gemini应用中一只手上的数字。

为了避免计数错误,它使用Python在它识别的每个手指上绘制边界框和数字标签。

这种‘视觉草稿纸’确保其最终答案是基于像素级的完美理解。

Google DeepMind:Agentic Vision重塑视觉AI新境界 Agentic Vision Gemini 3 Flash DeepMind 视觉AI 第6张

如何上手

Agentic Vision今天已通过Google AI Studio和Vertex AI中的Gemini API提供。

服务器教程性价比服务器