首个多模态模型上线
8 月 31 日,DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT License 开源。
公开内容包含模型文件、Tokenizer、Prompt Encoding 参考实现,以及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。
定位与状态
- DeepSeek V4 系列首款原生支持图片输入的视觉模型
- 官方明确标注为「Exp」实验版本
- 8 月 21 日已上线 DeepSeek API 平台
从纯文本扩展到原生视觉输入,V4 系列的多模态路线正式起跑。