媒体播放器通用框架 FFmpeg 推出 AI 语音识别功能，可自动生成字幕

2025-08-14 23:12:01 神评论

FFmpeg 是一个流行的开源媒体播放器通用框架，现在包含了一个新的 af_whisper 音频工具，可以直接在 FFmpeg 生态系统中实现自动语音识别（ASR）。

该工具使用了 whisper.cpp 库，为媒体处理工作流程添加了一个 AI 模型，允许进行灵活的音频转译文本，包括选择 AI 模型、指定语言以及设置输出格式，如文本、SRT 或 JSON。

该工具可以处理预录制的文件和实时音频流，用户还可以使用语音激活检测（VAD）来提高转写的准确性和效率。

该工具还支持 GPU 加速，可以显著加快转写过程。对于用户来说，这一功能取代了对外部、多步骤转写过程的需求，将任务整合到一个高效的单命令行工作流程中。

【来源：IT之家】

关于,FFmpeg,AI,语音识别的新闻

今日热点

热点预告：魔兽12.0上线！剑灵怀旧服重磅更新

《魔兽世界》12.0至暗之夜抢先体验《生化危机9：安魂曲》发售

微软游戏CEO退休，但接棒的是AI部门印裔女高管

《仁王3》发售两周销量破100万《死或生》新作女性角色引争议

Wan网页游戏免费玩