Gemini 音频模型升级,支持实时语音翻译

指南2025年12月12日3 分钟阅读
Gemini 音频模型升级,支持实时语音翻译
Google 升级了 Gemini 2.5 Flash Native Audio 模型,提升了实时语音智能体(Voice Agent)的指令遵循和对话流畅度。同时,Google Translate 应用推出实时语音翻译测试版,支持超过 70 种语言,并能保留说话人的语调。
本文编译自 Improved Gemini audio models for powerful voice experiences,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

在 macOS 上,让 coding agent(如 ChatGPT Codex)使用 Blender 非常简单:装好官方应用,用自然语言下达指令,模型就能通过 Blender 的 Python API 生成可编辑的场景、渲染图像,甚至输出电影短片。

指南Simon Willison·9月5日·1 分钟

Cloudflare 宣布邀请制新服务 Vulnerability Discovery and Remediation,通过结合生产流量和安全信号,优先排序漏洞,并自动建议代码补丁和 WAF 自定义规则,帮助团队先修复最关键威胁。该服务利用 OpenAI Daybreak 模型(GPT-5.6 Cyber)进行侦察和验证,但一切由客户决定是否实施。

指南·9月3日·6 分钟

评论