跳转至

TranscribeAudio 语音转录与音频转文字识别节点

节点核心功能 (What is it?)

TranscribeAudio 节点利用 OpenAI 强大的多模态与语音大模型,将输入的音频文件自动转换为高精度的纯文本。它全面支持主流语音识别模型(如 Whisper 及 GPT-4o 系列专属转录模型),既支持独立模型直连配置,也支持挂载预定义的 Agent 智能体驱动执行转写任务。

典型适用场景 (When would I use it?)

在以下情况下使用该节点:

  • 将口述语音信号自动识别并转化为文字(Speech-to-Text);
  • 为播客、会议记录或录音文件批量生成高精度文字副本;
  • 从外部音频片段中提取文字信息;
  • 搭建语音指令解析与多模态自动化工作流。

使用指南 (How to use it)

基础配置流程 (Basic Setup)

  1. 在工作流画布中添加 TranscribeAudio 节点。
  2. 将音频数据源(如来自 Microphone 或 LoadAudio 节点)接入 audio 输入插槽。
  3. 从下拉列表中选取所需的语音转写模型,或接入已配置好的 Agent。
  4. 运行节点,在 output 引脚即可提取转换生成的结构化文本。

参数输入插槽 (Parameters)

  • agent(可选):用于执行转写逻辑的预定义智能体对象。
  • model:用于语音转录的目标模型版本(默认推荐 "gpt-4o-mini-transcribe"):
    • gpt-4o-mini-transcribe:高性价比、高响应速度的现代多语言转写模型;
    • gpt-4o-transcribe:高精度、强上下文推理转写模型;
    • whisper-1:经典的通用语音识别大模型。
  • audio(必填):待转录的源音频工件(AudioUrlArtifact)。
  • output:转录生成的文本结果展示插槽。

输出引脚 (Outputs)

  • output:从音频中精准识别并还原出来的结构化纯文本字符串。
  • agent:用于执行本次转写的智能体实例对象(便于继续向后串联链式调用)。

典型工作流示例 (Example)

完整的麦克风录音并自动识别文本管线:

  1. 添加 Microphone 节点采集人声录音。
  2. 将 Microphone 的 audio 引脚连入 TranscribeAudio 节点的 audio 输入端。
  3. 选择 model 为 "gpt-4o-mini-transcribe"。
  4. 运行工作流,语音内容即刻被转为文字。
  5. 将 output 文本连入 DisplayText 查看识别内容,或继续传入 Agent 执行语义理解或问答。

关键技术特性 (Important Notes)

  • 凭证依赖:运行环境中必须配置有效的 OpenAI 官方密钥(环境变量 OPENAI_API_KEY)。
  • 多模型矩阵:提供 gpt-4o-mini-transcribe、gpt-4o-transcribe 以及经典的 whisper-1 等多样化算法选项。
  • 转录保真度:识别精度高度受音频清晰度、环境底噪、说话人发音及语言种类的影响。

常见问题与排查 (Common Issues)

  • 缺少 API Key (Missing API Key):确保已在系统环境变量中正确注入 OPENAI_API_KEY。
  • 未接入有效音频 (No Audio Provided):请检查上游节点(如 LoadAudio 或 Microphone)是否已成功生成并传递音频文件。
  • 识别准确率欠佳:尝试切换为 gpt-4o-transcribe 高阶模型,或在输入前改善录音设备的硬件收音环境。