资讯
AI Agent Skills 生态的最新动态、教程和深度分析
找到 538 篇文章
AI Agent Skills 生态的最新动态、教程和深度分析
找到 538 篇文章
文章基于CrewAI处理20亿次智能体工作流的经验,分析了企业从演示到生产系统的主要障碍。核心发现包括:信任需要在生产中建立、架构选择影响巨大、完整技术栈决定实施速度。
本文是 Codex 技术解析系列的第一篇,聚焦于智能体循环的工作原理。文章详细解释了 Codex CLI 如何通过 Responses API 编排模型、工具和提示,并管理上下文窗口以完成软件任务。
人机协同(HITL)让需要 99.9% 准确率或合规审批的用例得以部署。CrewAI 开源框架通过 @human_feedback 装饰器原生支持 HITL,企业版 AMP 则提供了邮件通知、智能路由、SLA 追踪等生产级控制平面功能。
AssetOpsBench 是一个针对工业资产运维的 AI 智能体基准测试系统,包含大规模数据集和多维度评估框架。测试发现,当前主流模型在复杂多智能体协调和工具调用准确性上仍面临挑战,且无一达到部署就绪的 85 分阈值。
本文是 NVIDIA 在 CES 2026 上演示的智能体构建教程的第一部分。它详细介绍了如何将推理模型、视觉模型、语音合成与 Reachy Mini 机器人结合,使用 NeMo Agent Toolkit 进行编排,打造一个私有的、可交互的桌面助手。
当前AI智能体行业普遍存在架构问题,导致许多项目无法进入生产环境。文章提出了智能体系统(Agentic Systems)架构模式,通过确定性主干(Flows)控制流程结构,在关键步骤引入智能(从单次LLM调用到多智能体协作)。DocuSign等企业已采用此架构,在提升业务指标的同时大幅缩短处理时间。
CUGA 是一个开源的、可配置的通用 AI 智能体,旨在解决现有智能体框架在复杂工作流中的脆弱性和工具误用问题。它支持多种推理模式、计算机使用和多工具集成,并已与 Langflow 和 Hugging Face Spaces 集成,方便开发者快速上手。
DeepMath 是一个轻量级数学推理智能体,结合了小型 Python 执行器与经过 GRPO 微调的 LLM。它旨在将确定性计算卸载到安全执行器中,并训练模型偏好简洁、面向计算的推理轨迹。评估表明,该智能体在减少输出长度的同时,通常能提高准确性。
SIMA 2 是 DeepMind 研发的下一代多世界智能体,核心整合了 Gemini 模型,具备复杂推理、多语言理解和自我改进能力。它在《ASKA》、《MineDojo》等未训练游戏中表现出色,并能适应由 Genie 3 生成的全新虚拟世界。
Together AI 推出了一套完整的语音 AI 栈,涵盖流式语音转文本、无服务器文本转语音和高质量转录模型。该架构针对生产级语音代理优化,实现了亚秒级延迟、高精度转录和可扩展性能,开发者可通过 API 快速集成。
MiniMax M2 智能体在复杂任务中表现出色,其成功源于对泛化问题的重新思考。团队强调,智能体需要具备交错思考能力,以应对长时任务和外部扰动;真正的泛化是关于整个操作空间的扰动适应,而不仅仅是工具扩展。
Collinear TraitMix 与 Together Evals 集成,通过模拟不同人格特征(如不耐烦、困惑)的多轮对话,自动评估智能体在真实场景下的表现,生成可用于再训练的高保真数据。
Gemini Robotics 1.5包含一个负责高级规划和推理的模型(Gemini Robotics-ER 1.5)和一个负责执行具体动作的模型(Gemini Robotics 1.5),两者协同工作以完成复杂的多步骤物理任务。新模型在多项基准测试中达到SOTA水平,并内置了安全考量。
CodeMender 结合 Gemini Deep Think 模型,通过高级程序分析和多智能体系统,自动生成高质量安全补丁。它不仅能修复漏洞,还能主动重写代码使用更安全的数据结构和 API。
OpenEnv Hub 旨在为智能体开发提供标准化环境,支持训练和部署。社区可通过 Hub 构建、分享和探索环境,并遵循 OpenEnv 0.1 规范。项目已集成 TRL、TorchForge 等工具,未来计划扩展兼容性。
CrewAI AMP 定位为智能体操作系统,提供快速构建、安全控制和跨组织扩展能力。平台支持代码或无代码构建,集成内存、安全护栏(Guardrails)和流程管理,已在金融、消费品和科技行业验证规模化应用。
文章展示了如何利用推测解码和深度剪枝技术,加速 Qwen3-8B 模型在 Intel® Core™ Ultra 平台上的推理性能。优化后的模型已集成到 🤗smolagents 库中,可用于构建高效的本地 AI 智能体。
本文介绍了 Smol2Operator 项目,通过两阶段训练将 SmolVLM2-2.2B-Instruct 模型从零基础培养成具备 GUI 感知和认知能力的智能体。第一阶段统一了异构数据集的动作空间,第二阶段则增强模型的推理能力。