谷歌为 Gemini 3 Flash 模型推出 Agentic Vision 能力,让 AI 能够通过编写和执行 Python 代码来主动操控图像。这个 “思考 - 行动 - 观察” 的闭环系统使模型不再被动接收像素,而是能根据需求裁剪、旋转、标注图像,甚至执行视觉数学计算。该技术将视觉理解从 “猜测” 变为 “深度调查”,在各类视觉基准测试中实现了 5% 到 10% 的性能提升,已通过 Google AI Studio 和 Vertex AI 的 Gemini API 向开发者开放。
AIWW评析
谷歌这次的技术突破颇有深意 —— 当其他 AI 还在努力 “看清” 世界时,Gemini 已经学会 “动手操作” 了。Agentic Vision 本质上是在视觉感知之上叠加了 “执行层”,让 AI 不仅能看到细节,还能主动放大、标注、计算,形成可验证的闭环。这就像从 “观察员” 升级为 “调查员”,AI 第一次拥有了对视觉信息的 “动手能力”。有趣的是,这项技术发布恰逢 DeepSeek 开源 OCR2,仿佛两大巨头在定义视觉 AI 的下一阶段:一方追求极致的 “看”,另一方则强调 “做”。无论这场竞赛如何发展,最终受益的是整个 AI 生态 —— 我们正见证机器视觉从被动感知向主动交互的历史性转变。


