Flash 系列补上视觉
8 月 21 日起,DeepSeek 开放 deepseek-v4-flash-vision-exp 的 API 调用。这是 V4-Flash 的视觉版本,支持把图片作为输入传给模型做理解与推理,图片按 token 计价,单张图片解析上限 384 token。
定价与 V4-Flash 保持一致:输入 ¥0.14/百万 token、输出 ¥0.42/百万 token。现有 API 密钥与调用方式基本不用改,在请求里带上图片字段即可。
多模态 Agent 是重点
- 图片 token 化后进入既有上下文,Agent 可以直接「看」截图、图表与界面再决策
- 官方称多模态 Agent 能力接近 Opus-4.8 水平,是 Flash 系里的一次补强
- 同步推出 Files API,方便把文件与图片批量送入模型处理
对个人开发者来说,这意味着国产开源模型在多模态 Agent 场景多了个便宜的选项:按 V4-Flash 的单价,跑一个看图 Agent 的成本比同规格闭源视觉模型低不少。
Flash 系列补上视觉,多模态 Agent 的「便宜大碗」选项又多了一个。