Gemini 音频模型升级,支持实时语音翻译

指南2025年12月12日3 分钟阅读
Gemini 音频模型升级,支持实时语音翻译
Google 升级了 Gemini 2.5 Flash Native Audio 模型,提升了实时语音智能体(Voice Agent)的指令遵循和对话流畅度。同时,Google Translate 应用推出实时语音翻译测试版,支持超过 70 种语言,并能保留说话人的语调。
本文编译自 Improved Gemini audio models for powerful voice experiences,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

AWS 开源了 Pizza Bot,一个面向后台运行 AI Agent 的邮箱式收件箱应用,支持 macOS、Windows、Linux 及浏览器和终端客户端。它基于 DeepAgents 和 LangGraph 构建,通过检查点持久化实现暂停、恢复和跨设备续接,内部版本在 Amazon 曾积累超 2000 名用户。项目现为独立社区项目,与 AWS 无官方支持关系。

指南The New Stack·9月10日·5 分钟

Instinct推出新功能,为每个用户提供独立的AI邮箱地址,使智能体能够自主创建和管理账户、联系商家、跟进事务,以更无缝地完成需要邮箱验证的任务。该功能紧随其与1Password、Stripe的合作,是近期一系列能力增强的举措之一。

指南·9月9日·3 分钟

评论