OpenAI 在 2026 年 5 月 7 日 发布了新一代实时语音 API,进一步推动语音从“人机对话入口”升级为“企业业务交互入口”。这次更新推出了 3 个核心模型,分别面向实时语音理解与执行、实时多语言翻译,以及低延迟语音转写,能够帮助企业更自然地构建客服、销售、培训、会议、出海服务等语音场景。
其中,GPT-Realtime-2 是这次更新的重点。它不仅能够实时听懂用户语音,还具备更强的推理、上下文理解和工具调用能力,可以在对话过程中持续处理复杂任务,例如查询信息、调用系统、响应用户改口或打断,并用更符合场景的语气进行反馈。对于企业来说,这意味着语音助手不再只是“回答问题”,而是可以进一步承担业务办理、流程协同和实时服务的角色。
另外两个模型分别覆盖企业全球化和效率场景。GPT-Realtime-Translate 支持 70+ 种输入语言和 13 种输出语言,适合跨语言客服、国际销售、活动服务和教育培训等场景;GPT-Realtime-Whisper 则专注于低延迟语音转写,可用于实时字幕、会议纪要、直播转写和语音驱动的业务流程。
从应用模式来看,OpenAI 这次也明确了企业语音智能的 3 个方向:一是“语音直接驱动业务动作”,二是“系统主动通过语音提供服务和提醒”,三是“跨语言实时语音交互”。这些能力已经在房产、通信、视频和旅游等行业开始验证,说明实时语音 AI 正在从演示型能力走向可落地的生产力工具。
在企业最关心的安全与合规方面,文章提到 Realtime API 提供多层安全防护机制,支持开发者叠加自有安全策略,并支持欧盟数据驻留,同时纳入企业级隐私承诺。这意味着企业在推动语音智能落地时,可以同时兼顾业务体验、数据合规与风险控制。
如果用一句话概括,这次更新释放出的信号非常清晰:语音 AI 正在从“更自然的交互方式”演进为“可直接嵌入企业业务系统的实时智能能力”,对客服中心、跨境业务、会议协作、培训支持和智能助手场景都有很强的参考价值.
