
ffmpeg 是 AI 视频流水线的基础设施
模型不直接吃视频文件。先把视频拆成音频、片段、合适分辨率,喂给 Whisper / 合成模型,最后再拼回去。ffmpeg 就是做这些预处理的瑞士军刀,而且完全本地、零成本。
6 个最常用的命令
# 1. 抽音频(给 Whisper 用)
ffmpeg -i in.mp4 -vn -acodec libmp3lame out.mp3
# 2. 截取某一段(如 1:00-2:00)
ffmpeg -ss 00:01:00 -to 00:02:00 -i in.mp4 clip.mp4
# 3. 改分辨率(竖屏短视频)
ffmpeg -i in.mp4 -vf scale=1080:-1 out.mp4
# 4. 烧录字幕(见字幕那篇)
ffmpeg -i in.mp4 -vf subtitles=sub.srt out.mp4
# 5. 简单降噪(人声更干净)
ffmpeg -i in.wav -af "highpass=f=200,lowpass=f=3000" out.wav
# 6. 按列表拼接多个片段
ffmpeg -f concat -i list.txt -c copy merged.mp4list.txt 内容每行写 file 'clip1.mp4' 这样。这些命令都能丢进 Python 的 subprocess 或 n8n 的命令行节点,组成全自动流水线。
几个坑
- 没装 libmp3lame:用 -acodec copy 只抽原音频,或先装编码器。
- -ss 放 -i 前面是「快速定位」,放后面是「精确解码」,长视频用前面更快。
- Windows 路径有空格要加引号。