核心功能 / 音频转译
音视频转写与双语时间线
视频语音模块支持将现场录音、网络视频链接深度解析转译。通过 STT 语音解码引擎,为你的学术公开课、长篇技术沙龙或语音备忘提供分秒精确的对照字幕和提炼总结。
转译与总结核心工作流
- 多路提取:优先捕获平台内自带的官方中文或英文字幕。若无字幕,自动唤醒后台
yt-dlp执行音频多流提取。 - 高保真切片:使用本地
ffmpeg动态判定静音区间并切割音频,确保转译并发效率最大化。 - 多模态 STT 解码:将处理后的语音分段推送至已配置的 STT(语音转文字)模型,还原带情绪和口语纠偏的文字。
- 生成多维大纲:根据段落逻辑大纲、专业术语定义及可行动待办(Todos),形成系统的视频学习备忘卡片。
基础系统依赖配置
| 底层依赖 | 工作任务 | 安装与排查建议 |
|---|---|---|
| STT 模型 API | 对下载或录制的本地音频进行语音转文本的深度运算。 | 推荐使用 Openai Whisper 兼容接口或国内高性价比大模型。 |
| yt-dlp 脚本 | 多平台视频无感下载,音频层独立捕获。 | 保持定期运行 yt-dlp -U 以适配最新的播放防盗链限制。 |
| ffmpeg 二进制 | 负责音频格式转换、长音轨自动断点分片及体积压缩。 | 确保将 ffmpeg 所在目录的绝对路径手动追加到了系统的环境变量 PATH 中。 |