资讯
AI Agent Skills 生态的最新动态、教程和深度分析
共 1509 篇文章
AI Agent Skills 生态的最新动态、教程和深度分析
共 1509 篇文章
AutoJudge 是一种基于任务特定损失性推测解码的 LLM 推理加速方法。它自动挖掘关键 token 不匹配,训练微型分类器,在验证阶段接受“不重要”的不匹配 token,从而增加每个周期接受的 token 数量。实验显示,在数学推理和代码生成任务上,AutoJudge 能实现 1.5-2 倍加速,且准确率下降极小。
Together AI 宣布其推理平台在多项基准测试中实现最快输出速度,对 GPT-OSS、Qwen3、Kimi-K2 等模型性能提升显著。关键创新包括针对 NVIDIA Blackwell 架构优化的内核、近乎无损的量化技术以及可扩展的推测解码训练流水线。
AnyLanguageModel 是一个 Swift 包,旨在简化苹果平台上 LLM 的集成。它基于苹果 Foundation Models 框架的 API,支持包括本地 Core ML、MLX、llama.cpp 和云端 OpenAI、Anthropic 在内的多种模型提供商。通过包特性(Package Traits)按需引入依赖,并扩展了图像支持等原生框架暂缺的功能。
Gemini 3 Pro 在 Terminal-Bench 2.0 工具调用测试中获得 54.2% 高分,支持通过自然语言提示生成完整应用。新推出的 Google Antigravity 平台允许开发者作为架构师,与跨编辑器、终端和浏览器自主运行的智能体协作。模型现已在 Google AI Studio 和 Vertex AI 提供预览,输入 Token 定价为每百万 2 美元。
Gemini 3 在 LMArena、Humanity's Last Exam 等关键基准测试中取得突破性成绩,支持 100 万 token 上下文窗口,并引入 Deep Think 模式以处理更复杂问题。开发者可通过多种平台立即开始构建。
SIMA 2 是 DeepMind 研发的下一代多世界智能体,核心整合了 Gemini 模型,具备复杂推理、多语言理解和自我改进能力。它在《ASKA》、《MineDojo》等未训练游戏中表现出色,并能适应由 Genie 3 生成的全新虚拟世界。
Together AI 推出了一套完整的语音 AI 栈,涵盖流式语音转文本、无服务器文本转语音和高质量转录模型。该架构针对生产级语音代理优化,实现了亚秒级延迟、高精度转录和可扩展性能,开发者可通过 API 快速集成。
本文探讨了大语言模型评估与基准测试的重要性,并详细阐述了优质基准测试应具备的五大原则:难度、多样性、实用性、可复现性和数据纯净性。文章结合具体案例和图表,说明了这些原则如何影响对模型能力的真实判断。
本文介绍了一种不依赖时序差分(TD)学习的强化学习新算法。该算法基于“分而治之”范式,通过递归分割轨迹来更新价值函数,有效解决了长序列任务中的误差累积问题。在OGBench基准测试中,该算法在复杂任务上超越了传统方法。
MiniMax M2 智能体在复杂任务中表现出色,其成功源于对泛化问题的重新思考。团队强调,智能体需要具备交错思考能力,以应对长时任务和外部扰动;真正的泛化是关于整个操作空间的扰动适应,而不仅仅是工具扩展。
gpt-oss-safeguard 模型通过后训练从 gpt-oss 模型衍生而来,专注于基于策略推理的内容标注任务。报告评估了其安全性能,并与基础模型进行对比。更多关于 gpt-oss 模型架构的信息,可参考原始模型卡片。
Collinear TraitMix 与 Together Evals 集成,通过模拟不同人格特征(如不耐烦、困惑)的多轮对话,自动评估智能体在真实场景下的表现,生成可用于再训练的高保真数据。
T5Gemma 是一系列基于 Gemma 2 框架的编码器-解码器大语言模型,通过模型适应技术构建。它在质量与推理效率的权衡上表现出色,在 GSM8K 和 DROP 等任务上超越原版模型。谷歌已发布多个预训练和指令调优的检查点供社区使用。
Gemma 3n 采用移动优先架构,通过 MatFormer、Per-Layer Embeddings 和 KV Cache Sharing 等技术实现高效推理。模型支持 140 种语言文本和 35 种语言多模态理解,并集成了新的音频编码器和 MobileNet-V5 视觉编码器。开发者可通过 Hugging Face、Ollama 等工具立即开始构建。
Gemini 2.5 Flash-Lite 现已稳定发布,成为 Gemini 2.5 家族中最快、成本最低的模型。它支持 100 万 token 上下文窗口,具备多模态能力,并在多个基准测试中表现优于前代。文章还列举了 Satlyt、HeyGen 等公司的实际应用案例。
Genie 3 是世界模型领域的重要进展,实现了实时交互和环境一致性。它能模拟物理属性、自然世界、动画虚构及历史场景,为具身智能体研究提供丰富训练环境。目前模型仍存在动作空间有限、交互时长受限等挑战,正以研究预览形式开放给部分学者和创作者。
Gemini Robotics 1.5包含一个负责高级规划和推理的模型(Gemini Robotics-ER 1.5)和一个负责执行具体动作的模型(Gemini Robotics 1.5),两者协同工作以完成复杂的多步骤物理任务。新模型在多项基准测试中达到SOTA水平,并内置了安全考量。
CodeMender 结合 Gemini Deep Think 模型,通过高级程序分析和多智能体系统,自动生成高质量安全补丁。它不仅能修复漏洞,还能主动重写代码使用更安全的数据结构和 API。