TranscribeAudio 语音转录与音频转文字识别节点
节点核心功能 (What is it?)
TranscribeAudio 节点利用 OpenAI 强大的多模态与语音大模型,将输入的音频文件自动转换为高精度的纯文本。它全面支持主流语音识别模型(如 Whisper 及 GPT-4o 系列专属转录模型),既支持独立模型直连配置,也支持挂载预定义的 Agent 智能体驱动执行转写任务。
典型适用场景 (When would I use it?)
在以下情况下使用该节点:
- 将口述语音信号自动识别并转化为文字(Speech-to-Text);
- 为播客、会议记录或录音文件批量生成高精度文字副本;
- 从外部音频片段中提取文字信息;
- 搭建语音指令解析与多模态自动化工作流。
使用指南 (How to use it)
基础配置流程 (Basic Setup)
- 在工作流画布中添加 TranscribeAudio 节点。
- 将音频数据源(如来自
Microphone或LoadAudio节点)接入audio输入插槽。 - 从下拉列表中选取所需的语音转写模型,或接入已配置好的 Agent。
- 运行节点,在
output引脚即可提取转换生成的结构化文本。
参数输入插槽 (Parameters)
- agent(可选):用于执行转写逻辑的预定义智能体对象。
- model:用于语音转录的目标模型版本(默认推荐
"gpt-4o-mini-transcribe"):gpt-4o-mini-transcribe:高性价比、高响应速度的现代多语言转写模型;gpt-4o-transcribe:高精度、强上下文推理转写模型;whisper-1:经典的通用语音识别大模型。
- audio(必填):待转录的源音频工件(
AudioUrlArtifact)。 - output:转录生成的文本结果展示插槽。
输出引脚 (Outputs)
- output:从音频中精准识别并还原出来的结构化纯文本字符串。
- agent:用于执行本次转写的智能体实例对象(便于继续向后串联链式调用)。
典型工作流示例 (Example)
完整的麦克风录音并自动识别文本管线:
- 添加
Microphone节点采集人声录音。 - 将
Microphone的audio引脚连入TranscribeAudio节点的audio输入端。 - 选择
model为"gpt-4o-mini-transcribe"。 - 运行工作流,语音内容即刻被转为文字。
- 将
output文本连入DisplayText查看识别内容,或继续传入Agent执行语义理解或问答。
关键技术特性 (Important Notes)
- 凭证依赖:运行环境中必须配置有效的 OpenAI 官方密钥(环境变量
OPENAI_API_KEY)。 - 多模型矩阵:提供
gpt-4o-mini-transcribe、gpt-4o-transcribe以及经典的whisper-1等多样化算法选项。 - 转录保真度:识别精度高度受音频清晰度、环境底噪、说话人发音及语言种类的影响。
常见问题与排查 (Common Issues)
- 缺少 API Key (Missing API Key):确保已在系统环境变量中正确注入
OPENAI_API_KEY。 - 未接入有效音频 (No Audio Provided):请检查上游节点(如
LoadAudio或Microphone)是否已成功生成并传递音频文件。 - 识别准确率欠佳:尝试切换为
gpt-4o-transcribe高阶模型,或在输入前改善录音设备的硬件收音环境。