《实时语音模型进入 API:边听边推理、翻译与转写》
三款语音模型将实时对话、工具调用、翻译与低延迟转写能力带入 API,把语音从转文本升级为实时交互
🧠 agentic reading|1️⃣ 精准输入
导语
OpenAI 同时推出三款实时音频模型,把语音从简单的呼叫-响应推向能“边听边推理、边翻译边转写、边对话边执行工具”的交互界面。GPT-Realtime-2 带来 GPT-5 级推理能力,GPT-Realtime-Translate 覆盖 70+ 输入语言的实时翻译,GPT-Realtime-Whisper 提供流式低延迟转写。
1. 语音正在成为产品界面的三种模式
开发者围绕语音 AI 构建了三种新兴模式。Voice-to-action:用户描述需求,系统推理并调用工具完成任务(如 Zillow 的房源搜索 + 预约看房);Systems-to-voice:软件将上下文转化为实时语音指引(如旅行 App 主动播报航班延误与换乘路线);Voice-to-voice:AI 帮助跨语言实时对话(如德国电信的多语言客服)。三种模式可叠加——Priceline 正在探索用语音管理整个旅程。
2. GPT-Realtime-2:推理与工具调用
我的笔记
✍️ 写下你的想法,自由记录即可。如果没有灵感,试着回答上方的费曼输出问题。
登录后可记笔记
登录后可保存笔记、高亮、划线和批注。