
为什么不直接用会议软件自带的转写
很多会议工具转写要付费、要上传录音,还只给一大段文字,看完还是不知道谁该干啥。本地 Whisper 转完,再让大模型把“结论、待办、负责人、时间”拽出来,一份能直接转发的纪要就出来了,全程不上云。
第一步:转写
pip install -U openai-whisper
whisper meeting_record.mp3 --model small --language Chinese --output_format txt模型选 small 性价比高;会议人声清晰用 base 也行。--output_format txt 直接给纯文本,方便下一步喂给模型。要保留时间轴就用 vtt。
第二步:让大模型整理成纪要
别让模型编,只让它从转写稿里摘。给一个明确模板,输出结论 / 待办 / 负责人 / 截止时间四块。
import requests
txt = open("meeting_record.txt").read()
prompt = f"""你是会议纪要助手。根据下面的转写稿,输出:
1. 核心结论(3 条内)
2. 待办事项(每条含:事情、负责人、截止时间)
3. 遗留问题
只基于原文,不要编造。
转写稿:
{txt}"""
r = requests.post("http://localhost:11434/api/generate",
json={"model": "qwen2.5:7b", "prompt": prompt, "stream": False})
print(r.json()["response"])模型用本地 Ollama 的 qwen2.5 就行,长会议换 14b 更准。这段拼起来就是个可复用的小脚本,参数化录音路径即可。
进阶:直接出带时间戳的待办
转写时加 --output_format vtt 保留时间轴,再让模型把“谁在 12:30 说了什么”对应到待办,纪要就能点时间回听,复盘更准。
几个踩过的坑
- 多人同时说话转写会串,尽量用带方向性的麦克风或会后单独补一句。
- 长录音超过模型上下文,先按静音切段再分别整理。
- 中文标点错乱时加 --language Chinese 通常能修好。
省事做法:把这两步拼成一个 .py,参数化录音路径,会后再也不用手写纪要。