首次在 API 开放图像输入
8 月 21 日,DeepSeek 宣布全新的多模态视觉理解模型 V4-Flash-Vision-Exp 上线 DeepSeek API 平台,开启多模态 API 服务,这也是 DeepSeek 首次在 API 中开放图像输入。
官方介绍,这是一个实验性质的模型:在纯文本能力(Agent、推理、世界知识等)上,它与 DeepSeek-V4-Flash 正式版持平;在需要视觉理解的 Agent Benchmark 上,相比 V4-Flash 实现大幅跃升,多模态 Agent 能力已接近 Opus-4.8。
- API 中通过 model='deepseek-v4-flash-vision-exp' 访问,图片转换为 token 后按 token 计费,单张图片最多占 384 tokens,计费价格与 V4-Flash 一致
- 同步推出 Files API:开发者可先上传图片文件,之后通过 file_id 在不同请求中引用同一文件,无需重复上传
- 官方演示了在 Agent 框架下生成商业定制 PPT、对 DeepSeek Harness 官网二次创作、制作前端动效 Demo 等场景
同一天,DeepSeek Harness 更新至 v0.1.1-rc.1,DeepSeek 模型适配器新增该多模态模型选项,支持配置原生图片请求,/goal、/plan 等命令可接收图文输入,@ 菜单可引用文件和会话。
从只能读文字到能看图,国产模型的多模态 API 竞争在 8 月明显提速。