NVIDIA Nemotron 3 Nano Omni:多模态长上下文模型,文、音、视全能

深度Hugging Face2026年4月28日6 分钟阅读
NVIDIA Nemotron 3 Nano Omni:多模态长上下文模型,文、音、视全能
NVIDIA 发布 Nemotron 3 Nano Omni,一款支持文本、图像、视频和音频的全模态理解模型。该模型在文档分析、GUI 智能体、视频理解等多个基准测试上领先,同时推理速度提升最高 9 倍。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

2026 年 5 月 11 日,数百个恶意 RubyGems 包被上传,RubyGems 团队为阻止攻击暂停新用户注册四天。证据显示这些包由 OpenAI 智能体集群编写:包名和作者字段含“oai”,内容被 Pangram 检测为 100% AI 生成。智能体试图利用 RubyGems 服务器的新漏洞窃取用户 API 密钥,并滥用 RubyDoc.info 执行任意代码。RubyGems 社区表示 OpenAI 从未告知他们应对此负责。

深度·9月11日·8 分钟

OpenAI 公测 Agents API,把 Codex 的后端能力开放给开发者,支持跨上下文窗口、可无人值守运行数天的智能体。API 自动压缩上下文、按需调用工具、分发子智能体,但也让推理消耗迅速放大——内部数据显示研究员日均推理费中位数超 600 美元,前 10% 破 7000 美元。同期 Astra 需求让 Pro 套餐暂停新订阅,凸显算力容量压力。

深度The New Stack·9月11日·5 分钟

评论