多模态模型(Multimodal Model)指能够理解并生成多种类型数据的模型:既能看图片、也能读文字、还能处理音频视频。它们大多是在大语言模型基础上,额外接入了视觉/音频编码器训练而成。
典型能力
- 图像理解:识别图片内容、读图表、数物体、做截图分析
- 文档解析:从 PDF、扫描件、PPT 中提取信息并回答问题
- 音视频理解:转写、总结、定位视频片段
- 跨模态生成:根据一句话生成图片(文生图)、根据图片生成描述等
常见误区
「多模态」不等于「文生图」:文生图模型(如 Midjourney、Stable Diffusion)只负责图片生成,而 GPT-4o、Gemini、Claude、Qwen-VL 等属于能「看图说话」的理解型多模态模型。
实际应用上,多模态能力最常用在知识库问答、发票/合同解析、课件整理和视频内容检索等场景。