ffmpeg 在 AI 工作流里的 6 个实用招数(抽音频/切段/转码/烧字幕)

ffmpeg 是 AI 视频流水线的基础设施

模型不直接吃视频文件。先把视频拆成音频、片段、合适分辨率,喂给 Whisper / 合成模型,最后再拼回去。ffmpeg 就是做这些预处理的瑞士军刀,而且完全本地、零成本。

6 个最常用的命令

# 1. 抽音频(给 Whisper 用)
ffmpeg -i in.mp4 -vn -acodec libmp3lame out.mp3

# 2. 截取某一段(如 1:00-2:00)
ffmpeg -ss 00:01:00 -to 00:02:00 -i in.mp4 clip.mp4

# 3. 改分辨率(竖屏短视频)
ffmpeg -i in.mp4 -vf scale=1080:-1 out.mp4

# 4. 烧录字幕(见字幕那篇)
ffmpeg -i in.mp4 -vf subtitles=sub.srt out.mp4

# 5. 简单降噪(人声更干净)
ffmpeg -i in.wav -af "highpass=f=200,lowpass=f=3000" out.wav

# 6. 按列表拼接多个片段
ffmpeg -f concat -i list.txt -c copy merged.mp4

list.txt 内容每行写 file 'clip1.mp4' 这样。这些命令都能丢进 Python 的 subprocess 或 n8n 的命令行节点,组成全自动流水线。

视频文件抽音频/切段/转码喂给 Whisper合成成片
ffmpeg 预处理 → AI → 合成

几个坑

  • 没装 libmp3lame:用 -acodec copy 只抽原音频,或先装编码器。
  • -ss 放 -i 前面是「快速定位」,放后面是「精确解码」,长视频用前面更快。
  • Windows 路径有空格要加引号。