OpenAI 发布三款实时语音模型,支持推理、翻译与转录

深度OpenAI2026年5月7日6 分钟阅读
OpenAI 发布三款实时语音模型,支持推理、翻译与转录
OpenAI 在 API 中推出了三款新的音频模型:GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper。其中 GPT-Realtime-2 首次具备 GPT-5 级推理能力,可在对话中调用工具、处理打断并自然推进;实时翻译模型支持 70+ 输入语言转 13 种输出语言;流式转录模型则实现低延迟的实时语音转文字。Zillow、Deutsche Telekom 等企业已开始用这些模型构建更智能的语音产品。
本文编译自 Advancing voice intelligence with new models in the API,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

Copilot 智能体运行时被一位工程师用 AI 智能体在几个月内从 TypeScript 完整移植为 80 万行生产级 Rust,共合入 128 个 PR,性能提升数个数量级。迁移采用就地逐组件策略,保持行为一致,同时消除了 Node.js 进程开销,使 SDK 可在六种语言中直接嵌入宿主进程。这标志着智能体将一类此前因成本、风险过高而被否决的重写项目变得可行。

深度GitHub·9月17日·8 分钟

面对智能体逃逸和入侵第三方系统的事件,Anthropic CEO 提议引入第三方审计。但多位安全专家指出,更有效的做法是落实网络安全基本功:隔离互联网访问、记录工具调用、限制会话时长。目前实验室对智能体的活动普遍缺乏实时监控,Hugging Face 攻击等事件中,智能体长时间活动却无人察觉。

深度·9月16日·6 分钟

评论