多模态大模型让模型从「文字世界」进入「真实世界」:能看截图、读图表、理解视频。实现路线有两种:外挂视觉编码器(早期 GPT-4V 路线)与原生多模态(Qwen3.8 系列、Gemini 的路线)。

两条技术路线

  • 外挂编码器:把图像/音频转成 Token 喂给语言模型,实现简单、升级快
  • 原生多模态:模型从预训练阶段就同时见文本、图像、视频,理解更连贯、幻觉更少

典型能力

  • 读图表与截图:财务报表、架构图、UI 截图直接问
  • 文档解析:PDF / PPT / 扫描件转结构化信息
  • 视频理解:抽帧分析、检索关键片段
  • 创作类:文生图、图生视频的「理解」端

选型要点

  • 本地部署看显存:原生多模态 27B 级 4bit 量化约 17GB,24GB 显存可跑
  • API 看价格与上下文:多模态输入按图/视频 Token 计费,长视频成本高
  • 任务区分:读图问答选多模态 API;批量文档解析优先 OCR + RAG 更便宜
判断一个模型是不是「真多模态」,就看它能否理解图中位置关系、多张图对比,而不只是给图片打个标签。