谷歌为 Gemini 3 Flash 模型推出 Agentic Vision 能力,让 AI 能够通过编写和执行 Python 代码来主动操控图像。这个 “思考 - 行动 - 观察” 的闭环系统使模型不再被动接收像素,而是能根据需求裁剪、旋转、标注图像,甚至执行视觉数学计算。该技术将视觉理解从 “猜测” 变为 “深度调查”,在各类视觉基准测试中实现了 5% 到 10% 的性能提升,已通过 Google AI Studio 和 Vertex AI 的 Gemini API 向开发者开放。

AIWW评析

谷歌这次的技术突破颇有深意 —— 当其他 AI 还在努力 “看清” 世界时,Gemini 已经学会 “动手操作” 了。Agentic Vision 本质上是在视觉感知之上叠加了 “执行层”,让 AI 不仅能看到细节,还能主动放大、标注、计算,形成可验证的闭环。这就像从 “观察员” 升级为 “调查员”,AI 第一次拥有了对视觉信息的 “动手能力”。有趣的是,这项技术发布恰逢 DeepSeek 开源 OCR2,仿佛两大巨头在定义视觉 AI 的下一阶段:一方追求极致的 “看”,另一方则强调 “做”。无论这场竞赛如何发展,最终受益的是整个 AI 生态 —— 我们正见证机器视觉从被动感知向主动交互的历史性转变。

2025 年中国 AI 投资市场呈现结构性变化,全年投资事件激增 75% 达 1579 起,创近五年新高。早期投资爆发式增长 90%,显示资本通过 "广撒网" 布局前沿赛道。北京以 405 起融资遥遥领先...
腾讯混元图像 3.0 图生图版本正式开源,在全球图片编辑榜单中位列第七且是前七名中唯一的开源模型。这款 AI 工具支持增删改、风格变换、老照片修复等全面编辑功能,还能将多张照片元素合成新图...
前往“AIWW”小程序,更好用