视频语音

核心功能 / 音频转译

音视频转写与双语时间线

视频语音模块支持将现场录音、网络视频链接深度解析转译。通过 STT 语音解码引擎,为你的学术公开课、长篇技术沙龙或语音备忘提供分秒精确的对照字幕和提炼总结。

转译与总结核心工作流

  1. 多路提取:优先捕获平台内自带的官方中文或英文字幕。若无字幕,自动唤醒后台 yt-dlp 执行音频多流提取。
  2. 高保真切片:使用本地 ffmpeg 动态判定静音区间并切割音频,确保转译并发效率最大化。
  3. 多模态 STT 解码:将处理后的语音分段推送至已配置的 STT(语音转文字)模型,还原带情绪和口语纠偏的文字。
  4. 生成多维大纲:根据段落逻辑大纲、专业术语定义及可行动待办(Todos),形成系统的视频学习备忘卡片。

基础系统依赖配置

底层依赖工作任务安装与排查建议
STT 模型 API对下载或录制的本地音频进行语音转文本的深度运算。推荐使用 Openai Whisper 兼容接口或国内高性价比大模型。
yt-dlp 脚本多平台视频无感下载,音频层独立捕获。保持定期运行 yt-dlp -U 以适配最新的播放防盗链限制。
ffmpeg 二进制负责音频格式转换、长音轨自动断点分片及体积压缩。确保将 ffmpeg 所在目录的绝对路径手动追加到了系统的环境变量 PATH 中。