会议录音自动变纪要:Whisper 转写 + 大模型拽出待办

为什么不直接用会议软件自带的转写

很多会议工具转写要付费、要上传录音,还只给一大段文字,看完还是不知道谁该干啥。本地 Whisper 转完,再让大模型把“结论、待办、负责人、时间”拽出来,一份能直接转发的纪要就出来了,全程不上云。

第一步:转写

pip install -U openai-whisper
whisper meeting_record.mp3 --model small --language Chinese --output_format txt

模型选 small 性价比高;会议人声清晰用 base 也行。--output_format txt 直接给纯文本,方便下一步喂给模型。要保留时间轴就用 vtt。

第二步:让大模型整理成纪要

别让模型编,只让它从转写稿里摘。给一个明确模板,输出结论 / 待办 / 负责人 / 截止时间四块。

import requests
txt = open("meeting_record.txt").read()
prompt = f"""你是会议纪要助手。根据下面的转写稿,输出:
1. 核心结论(3 条内)
2. 待办事项(每条含:事情、负责人、截止时间)
3. 遗留问题
只基于原文,不要编造。
转写稿:
{txt}"""
r = requests.post("http://localhost:11434/api/generate",
    json={"model": "qwen2.5:7b", "prompt": prompt, "stream": False})
print(r.json()["response"])

模型用本地 Ollama 的 qwen2.5 就行,长会议换 14b 更准。这段拼起来就是个可复用的小脚本,参数化录音路径即可。

录音文件Whisper转写大模型整理结构化纪要
录音 → 转写 → 大模型 → 纪要

进阶:直接出带时间戳的待办

转写时加 --output_format vtt 保留时间轴,再让模型把“谁在 12:30 说了什么”对应到待办,纪要就能点时间回听,复盘更准。

几个踩过的坑

  • 多人同时说话转写会串,尽量用带方向性的麦克风或会后单独补一句。
  • 长录音超过模型上下文,先按静音切段再分别整理。
  • 中文标点错乱时加 --language Chinese 通常能修好。
省事做法:把这两步拼成一个 .py,参数化录音路径,会后再也不用手写纪要。