资讯
AI Agent Skills 生态的最新动态、教程和深度分析
共 1509 篇文章
AI Agent Skills 生态的最新动态、教程和深度分析
共 1509 篇文章
Kaggle Game Arena 是一个新的开源 AI 评测平台,通过让模型在策略游戏(如国际象棋)中对抗来评估其智能水平。游戏环境能避免传统基准测试的答案记忆和分数饱和问题,提供更动态、可验证的性能指标。平台采用全循环赛制确保结果统计稳健,并计划未来扩展至围棋、扑克等更多游戏。
Gemma 3 270M 是一个专为任务特定微调设计的紧凑模型,在 IFEval 基准测试中表现出色,支持 INT4 量化以降低部署成本。它适用于高吞吐量任务、对延迟和成本敏感的场景,以及需要快速迭代或保护用户隐私的应用。
VaultGemma是基于Gemma 2架构、完全使用差分隐私预训练的开源10亿参数大模型。研究团队通过建立新的缩放定律,量化了模型大小、批次大小与隐私噪声之间的权衡关系,为高效训练隐私保护模型提供了路线图。
Gemini 2.5 Computer Use 模型基于 Gemini 2.5 Pro 构建,专为智能体与用户界面交互设计。它通过新的 computer_use 工具在 API 中暴露能力,支持点击、输入等操作,并在安全方面内置了防护措施。模型现已开放预览。
OpenEnv Hub 旨在为智能体开发提供标准化环境,支持训练和部署。社区可通过 Hub 构建、分享和探索环境,并遵循 OpenEnv 0.1 规范。项目已集成 TRL、TorchForge 等工具,未来计划扩展兼容性。
Together AI 通过与 Runware 合作,整合了 40 多款图像和视频生成模型,覆盖从 Sora 2 到 Veo 3.0 等多种选择。平台提供统一的 API、认证和计费,旨在简化多模态应用开发流程,并支持游戏、广告、教育等实际生产场景。
CrewAI 开源框架发布 1.0 正式版,已累计执行 14 亿次智能体自动化任务,服务 60% 的财富 500 强企业。新版本增强了复杂系统支持、提供了稳定的 API、原生免费追踪功能以及统一的 CLI。
ATLAS 是首个运行时自学习的推测解码系统,通过静态与自适应推测器协同工作,在 DeepSeek-V3.1 上达到 500 TPS。系统能根据实时流量动态调整,特别适合代码编辑、RL 训练等场景,性能随使用持续优化。
CrewAI AMP 定位为智能体操作系统,提供快速构建、安全控制和跨组织扩展能力。平台支持代码或无代码构建,集成内存、安全护栏(Guardrails)和流程管理,已在金融、消费品和科技行业验证规模化应用。
文章展示了如何利用推测解码和深度剪枝技术,加速 Qwen3-8B 模型在 Intel® Core™ Ultra 平台上的推理性能。优化后的模型已集成到 🤗smolagents 库中,可用于构建高效的本地 AI 智能体。
本文介绍了 Smol2Operator 项目,通过两阶段训练将 SmolVLM2-2.2B-Instruct 模型从零基础培养成具备 GUI 感知和认知能力的智能体。第一阶段统一了异构数据集的动作空间,第二阶段则增强模型的推理能力。
SyGra 是一个用于构建和转换大语言模型(LLM)与小语言模型(SLM)训练数据的低代码框架。它通过统一的执行框架(Harness)简化了复杂数据集的生成流程,支持 vLLM、Hugging Face TGI 等多种推理后端。开发者可以用它加速模型对齐、节省工程时间,并专注于提示工程(Prompt Engineering)。
Gaia2 是 GAIA 基准的升级版,专注于交互行为和复杂性管理,在模拟智能手机环境中评估智能体。配套的 ARE 框架提供结构化追踪和调试功能,支持自定义扩展。团队已用多个主流模型完成评测,结果显示时间敏感任务仍是当前最大挑战。
本文详细介绍了 transformers 库为支持 GPT-OSS 模型所做的升级,包括零构建内核、MXFP4 量化、张量并行等新特性。这些优化不仅适用于 GPT-OSS,也能惠及 transformers 中的其他模型。
Together AI 宣布其平台现已支持微调 Hugging Face Hub 上的任何兼容 LLM,大幅降低了模型定制化的门槛。开发者只需指定一个基础模型作为配置模板,即可微调自己选中的 Hugging Face 模型,并可将结果模型自动推送回 Hub。该功能已帮助 Slingshot AI、Parsed 等团队加速了模型开发流程。
本文介绍了 Hugging Face 开发的 Jupyter Agent,这是一个能让 LLM 在 Jupyter Notebook 环境中执行代码的智能体。团队通过简化执行框架(Harness)和构建高质量训练数据管道,成功将 Qwen3-4B 模型在 DABStep 基准测试简单任务上的准确率从 44.4% 提升到 59.7%。
EmbeddingGemma 基于 Gemma3 架构改造为双向编码器,拥有 2K 上下文窗口和 768 维输出,支持按需截断至 512/256/128 维以节省资源。文章详细展示了其在 Sentence Transformers、LangChain 等框架中的使用方法,并通过医疗数据集微调案例证明其领域适应能力可超越更大模型。
CrewAI 入选 2025 年 IA40 榜单,与 OpenAI、Anthropic 等巨头并列第 7 位,是榜单中唯一的智能体管理平台(AMP)。公司凭借约 2000 万美元融资实现这一里程碑,强调其产品在易用性、可靠性和可扩展性上的优势。创始人表示这只是开始,将继续推动智能体劳动力(Agentic Workforce)的行业定义。