
原生多模态,不是拼接
Gemini 2.0 从底子是原生多模态:文本、图像、音频、视频进来都是同一套表示,模型能直接跨模态推理,而不是先转成文字再处理。配套的 Agent 能力可以调用搜索、代码执行等工具,自己规划步骤完成任务。
Project Astra:摄像头即入口
Astra 演示的是一种持续在线的视觉助手:你拿着手机,它看着你看到的世界,能回答「我刚才把钥匙放哪了」「这个零件叫什么」。这把多模态从「上传一张图问问题」推进到「实时看着你的环境对话」。
- Deep Research:自动检索多源资料写成带引用的报告。
- Gemini Live:低延迟语音对话,可被打断、能感知语气。
- 融入搜索与 Workspace,文档表格里直接调多模态理解。
意味着什么
当模型既能看懂世界、又能调用工具,产品的竞争焦点就从「单点准确率」变成「端到端把事办成」。对开发者来说,多模态不再是独立功能,而是 Agent 的默认输入方式。
多模态竞争的下一站,是「能行动」而不是「能识别」。