DeepSeek 的模型家族覆盖「通用对话、推理、代码、数学、多模态」等几乎所有主流方向,且全部开源。

  • DeepSeek-V3:通用基座模型,2024 年 12 月发布,总参数 6710 亿(MoE,每 token 激活 370 亿),支持 128K 长上下文,生成速度从 V2 的 20 TPS 提升至 60 TPS
  • DeepSeek-R1:推理旗舰,2025 年 1 月发布,通过强化学习获得长思维链推理能力,数学与代码对标 OpenAI o1;另有 R1-Zero(纯 RL 实验版)、R1-32B / R1-8B(小尺寸蒸馏版,可本地运行)
  • DeepSeek-Coder:代码专用模型,V2 版本在 DeepSeek-V2 基础上额外预训练 6 万亿 tokens 代码数据,支持 338 种编程语言
  • DeepSeek-Math:数学推理专用模型
  • DeepSeek-VL / VL2:视觉语言模型,可同时理解图像与文本
  • Janus-Pro-7B:统一多模态理解与生成模型,2025 年 1 月推出,支持文生图与识图

怎么选模型

  • 日常问答、写作、翻译、文件处理 → 网页版默认 V3 即可
  • 数学题、代码调试、复杂逻辑分析 → 开启 R1(深度思考模式)
  • 生成代码为主 → 优先 DeepSeek-Coder 或通过 API 指定 code 模型
  • 本地离线运行 → 选 R1 蒸馏小尺寸(1.5B / 7B / 8B / 14B / 32B),按显卡显存决定
  • 图像理解或文生图 → 用 Janus-Pro 或 VL 系列
选型口诀:通用用 V3,烧脑用 R1,写码用 Coder,本地用蒸馏小模型。