谷歌 Gemini 2.0 与 Project Astra:多模态 Agent 走向系统级

原生多模态,不是拼接

Gemini 2.0 从底子是原生多模态:文本、图像、音频、视频进来都是同一套表示,模型能直接跨模态推理,而不是先转成文字再处理。配套的 Agent 能力可以调用搜索、代码执行等工具,自己规划步骤完成任务。

文本图像音频视频工具
任意到任意 + 能动手

Project Astra:摄像头即入口

Astra 演示的是一种持续在线的视觉助手:你拿着手机,它看着你看到的世界,能回答「我刚才把钥匙放哪了」「这个零件叫什么」。这把多模态从「上传一张图问问题」推进到「实时看着你的环境对话」。

  • Deep Research:自动检索多源资料写成带引用的报告。
  • Gemini Live:低延迟语音对话,可被打断、能感知语气。
  • 融入搜索与 Workspace,文档表格里直接调多模态理解。

意味着什么

当模型既能看懂世界、又能调用工具,产品的竞争焦点就从「单点准确率」变成「端到端把事办成」。对开发者来说,多模态不再是独立功能,而是 Agent 的默认输入方式。

多模态竞争的下一站,是「能行动」而不是「能识别」。