DeepSeek-V4-Flash 正式版 7 月 31 日上线公测,OpenRouter 数据显示它已登顶全球调用量榜首——周调用 8.83 万亿 Token,环比增长 570%。原因很简单:Agent 能力大幅增强,单任务成本约 0.03 美元,是 Claude Fable 5 的 1/100。这个教程教你从零搭建一个基于 DeepSeek 的 AI 编程助手。

为什么选 DeepSeek V4 Flash

  • 成本极低:输入 ¥1/百万 Token,输出 ¥2/百万 Token,一个中等项目全天的 AI 辅助费用不到 1 元
  • Agent 能力强:V4-Flash 正式版重点升级了 Agent 和代码能力,支持 Function Calling 和多步规划
  • API 兼容 OpenAI 格式:现有 OpenAI SDK 直接改 base_url 就能用,迁移成本几乎为零
  • 上下文 128K:足以处理中型项目的完整文件

第一步:申请 API Key

DeepSeek API 的申请流程非常简单:

  1. 访问 platform.deepseek.com,注册账号(支持手机号和邮箱)
  2. 进入「API Keys」页面,点击「创建 API Key」,复制保存(只显示一次)
  3. 充值:最低 ¥10 起充,按量付费,余额可在控制台实时查看
  4. 查看模型列表:确认 deepseek-chat(V4-Flash)可用

注意:DeepSeek 的 API 兼容 OpenAI 格式,base_url 是 https://api.deepseek.com/v1,模型名用 deepseek-chat。

第二步:搭建命令行编程助手

先装 OpenAI SDK(DeepSeek 兼容这个 SDK):

pip install openai

然后写一个最简单的对话脚本:

from openai import OpenAI

client = OpenAI(
    api_key="你的key",
    base_url="https://api.deepseek.com/v1"
)

response = client.chat.completions.create(
    model="deepseek-chat",
    messages=[
        {"role": "system", "content": "你是一个专业的编程助手,回答简洁准确。"},
        {"role": "user", "content": "用 Python 写一个快速排序"}
    ],
    stream=True
)

for chunk in response:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")

运行后你会看到流式输出——DeepSeek 的响应速度很快,首 Token 延迟通常在 1 秒以内。

第三步:集成到 VS Code

不需要装额外插件,用 Continue(开源 AI 编程助手)即可接入 DeepSeek:

  1. 在 VS Code 扩展市场搜索「Continue」并安装
  2. 打开 Continue 配置文件(~/.continue/config.json)
  3. 添加 DeepSeek 作为自定义模型
{
  "models": [{
    "title": "DeepSeek V4 Flash",
    "provider": "openai",
    "model": "deepseek-chat",
    "apiBase": "https://api.deepseek.com/v1",
    "apiKey": "你的key"
  }]
}

保存后,在 Continue 侧边栏选择「DeepSeek V4 Flash」模型,就可以用 Ctrl+L 呼出对话、Ctrl+I 行内补全了。

第四步:构建自动修 Bug 的 Agent

V4-Flash 正式版最强的就是 Agent 能力。我们来写一个能自动读取报错、定位代码、提出修复方案的 Agent:

import subprocess, json

def run_agent(error_msg, project_dir):
    """读取报错 → 分析原因 → 给出修复方案"""
    # 1. 让 AI 分析报错
    analysis = client.chat.completions.create(
        model="deepseek-chat",
        messages=[{
            "role": "user",
            "content": f"项目目录: {project_dir}\n报错信息:\n{error_msg}\n\n"
                       f"1. 分析报错原因\n2. 列出可能涉及的文件\n3. 给出修复方案"
        }],
        tools=[{
            "type": "function",
            "function": {
                "name": "read_file",
                "description": "读取项目中的文件",
                "parameters": {
                    "type": "object",
                    "properties": {
                        "path": {"type": "string", "description": "文件路径"}
                    },
                    "required": ["path"]
                }
            }
        }]
    )
    return analysis

这个 Agent 收到报错后会自主决定读取哪些文件,然后给出修复方案。整个过程无需人工干预,一次调用成本不到 1 分钱。

第五步:成本对比和优化

来算一笔账。假设你的项目每天需要 200 次 AI 交互,平均每次输入 2000 Token、输出 1000 Token:

  • DeepSeek V4 Flash:输入 ¥0.4 + 输出 ¥0.4 = ¥0.8/天,月费约 ¥24
  • GPT-5.5:输入 $1 + 输出 $5 = $6/天,月费约 $180(约 ¥1300)
  • Claude Opus 5:输入 $3 + 输出 $15 = $18/天,月费约 $540(约 ¥3900)
  • 结论:DeepSeek 的月费是 GPT-5.5 的 1/54,是 Claude Opus 5 的 1/162

优化技巧:用 system prompt 约束输出格式(比如要求只返回代码不返回解释),可以减少 50% 以上的输出 Token 消耗。对于重复性任务,把常用上下文做成 system message 而不是每次重新发。

第六步:进阶 — 多 Agent 协作

V4-Flash 的 Function Calling 能力让多 Agent 协作变得简单。你可以搭建一个「规划 Agent + 执行 Agent」的流水线:规划 Agent 负责拆解任务和分配,执行 Agent 负责具体编码和测试。参考蚂蚁 Ling-3.0-flash 的思路——规划层用大模型,执行层用轻量模型,成本最优。

AI 编程助手的月费从 ¥3900 降到 ¥24,这不只是省钱——是让独立开发者和小团队也能用得起 AI 辅助开发了。