跳转至

ExtractAudio 视频音轨分离与音频格式提取节点

节点核心功能 (What is it?)

ExtractAudio 节点用于从输入的视频流中一键剥离、提取内置的独立音频轨道(Audio Track),并将其封装导出为高质量的纯音频文件工件(AudioUrlArtifact)。它原生支持包括 MP3、WAV、AAC、FLAC、OGG、M4A 在内的全套音频编码格式,并兼具流拷贝直通(Copy)与高保真重编码双重模式。

典型适用场景 (When would I use it?)

在以下情况下使用 ExtractAudio 节点:

  • 从视频素材中分离伴音,以便接入下游的语音转文字(STT,如 Whisper 或 TranscribeAudio 节点);
  • 将视频中的演讲、网课或播客提取为便于移动端随时收听的纯音频广播文件;
  • 将视频音轨转换为专业后期混音软件所需的无损无压缩 WAV/FLAC 格式;
  • 剥离原声背景音乐或对声音进行降噪、均衡等声学深度处理;
  • 借助 copy 零开销模式在毫秒级内完成无损音频无缝抓取。

使用指南 (How to use it)

基础配置流程 (Basic Setup)

  1. 在工作流画布中添加 ExtractAudio 节点。
  2. 将视频输入源连接至 video 输入插槽。
  3. 选择所需的导出音频格式(audio_format)与音质比特率(audio_quality)。
  4. 将剥离提取出的 extracted_audio 输出引脚连接至下游音频处理或转录节点。

参数输入插槽 (Parameters)

视频输入源

  • video:待提取音轨的目标视频流(原生支持 VideoArtifact 与 VideoUrlArtifact)。

音频格式与质量参数

  • audio_format:导出的音频封装格式下拉菜单:
    • mp3(默认):全平台与各种设备兼容性最佳,通用首选;
    • wav:非压缩 PCM 线性原始音频,保真度最高,AI 语音识别首选;
    • aac:现代高效有损压缩标准,音质优于同码率 MP3;
    • flac:无损压缩格式,兼顾高保真与相对较小的存储体积;
    • ogg:开源高质量音频格式;
    • m4a:苹果生态深度优化的标准音频格式。
  • audio_quality:音频输出比特率及压缩质量策略:
    • high(128k 比特率,默认):适合大多数音乐与高质量人声;
    • medium(96k 比特率):针对纯人声对话优化,文件体积适中;
    • low(64k 比特率):极致压缩小体积,适用于网络带宽严苛环境;
    • copy(无损直通流拷贝):不执行二次重编码,直接将原视频封装中的原生音频流完整复制剥离,速度最快,音质 100% 绝对无损。

输出引脚 (Outputs)

  • extracted_audio:提取完成并格式化封装的音频工件(AudioUrlArtifact)。
  • logs:详细的音轨探测与流提取进度执行日志。

音频格式与音质选型专家指南 (Audio Guide)

格式 / 模式 核心技术优势 推荐业务场景
copy 模式 零重编码、无算力消耗、毫秒级导出、100% 保真 仅需分离音频且不需要强制改变格式的场景
WAV (PCM) 零压缩失真、完美保留微弱辅音与呼吸细节 接入 Whisper、语音情感识别或专业 DAW 混音
MP3 (high) 跨平台、全系统、浏览器及移动端 100% 兼容 通用播客、音频分享、Web 播放
FLAC 数学无损压缩,体积比 WAV 缩减约 40%–50% 广播级无损母带数字存档

典型工作流示例 (Example)

从视频中分离人声并接入语音转文字 AI 管线:

  1. 在画布中添加 ExtractAudio 节点。
  2. 将待转录的视频接入其 video 参数插槽。
  3. 将 audio_format 设为 wav,audio_quality 设为 high,确保语音转录的最佳声学清晰度。
  4. 将 extracted_audio 输出引脚连接至 TranscribeAudio 节点的 audio 输入端。
  5. 即可全自动将视频中的原声对白转换为带时间戳的高精度文本字幕文稿。

关键技术特性 (Important Notes)

  • 音轨智能探测:底层会自动调用探针探测视频内部是否包含有效的 Audio Stream;
  • 零开销极速直通:选用 copy 时无需启动复杂的编码器计算,哪怕数小时的超长大电影也能在秒级内分离出完整音轨;
  • 全格式视频容器兼容:全面支持 MP4、MKV、MOV、AVI、FLV、WebM 等主流视听容器。

常见问题与排查 (Common Issues)

  • 报错 "No audio stream found":表明输入的视频文件本身就是静音无音轨视频,请核实原片是否带有声音。
  • 超长文件处理:对于数个 G 的超长视频,重编码为 MP3 会经历一段转码耗时,可在节点面板的 logs 参数中实时观察进度。