多模态大模型让模型从「文字世界」进入「真实世界」:能看截图、读图表、理解视频。实现路线有两种:外挂视觉编码器(早期 GPT-4V 路线)与原生多模态(Qwen3.8 系列、Gemini 的路线)。
两条技术路线
- 外挂编码器:把图像/音频转成 Token 喂给语言模型,实现简单、升级快
- 原生多模态:模型从预训练阶段就同时见文本、图像、视频,理解更连贯、幻觉更少
典型能力
- 读图表与截图:财务报表、架构图、UI 截图直接问
- 文档解析:PDF / PPT / 扫描件转结构化信息
- 视频理解:抽帧分析、检索关键片段
- 创作类:文生图、图生视频的「理解」端
选型要点
- 本地部署看显存:原生多模态 27B 级 4bit 量化约 17GB,24GB 显存可跑
- API 看价格与上下文:多模态输入按图/视频 Token 计费,长视频成本高
- 任务区分:读图问答选多模态 API;批量文档解析优先 OCR + RAG 更便宜
判断一个模型是不是「真多模态」,就看它能否理解图中位置关系、多张图对比,而不只是给图片打个标签。