资讯
AI Agent Skills 生态的最新动态、教程和深度分析
共 1192 篇文章
AI Agent Skills 生态的最新动态、教程和深度分析
共 1192 篇文章
LLM 0.32a3 版本发布,改进了命令行调用大语言模型的体验。Simon Willison 在其博客上发布了这一消息。
本文介绍如何为 AgentsView 中尚未收录的新模型(如 Claude Fable 5)设置自定义价格,通过反向工程配置实现 token 使用的准确成本追踪。
Cognition 的 Devin Desktop、微软的 Rayfin 和 Augment Code 的 Cosmos 在六月初相继发布,分别从团队控制台、企业治理和代理编排三个层面推动编码代理成为团队基础设施。这些工具解决了代理协调、管理和治理问题,但也带来了厂商锁定风险。
ServiceNow构建了包含HR和IT服务场景的语码转换语音数据集,评测7款ASR系统在WER、语义WER和答案错误率三个维度的表现。结果显示语码转换的“成本”因语言对和模型而异,Whisper V3 Turbo因默认翻译而非转录表现垫底。
Anthropic 发布 Fable 5,首款 Mythos 级模型,在 SWE-Bench Pro 等基准测试中表现优异,但免费使用截止 6 月 22 日,之后需使用信用额度。模型内置安全护栏,将敏感请求转交 Opus 4.8,同时要求用户接受 30 天数据留存。
Anthropic 发布 Claude Fable 5,性能全面领先,但为安全设了保守限制。同时推出无限制的 Claude Mythos 5 用于网络安全。定价低于 Mythos Preview。
Anthropic 发布 Claude Fable 5,这是其 Mythos 模型的公开版本,通过 API 和企业计划提供。模型具备严格的安全限制,定价为输入每百万 token 10 美元、输出每百万 50 美元。Anthropic 还推出了 Mythos 5 给已获批的组织,并要求 30 天数据留存以防御新型攻击。
Lindy 全面从 Anthropic 转向 DeepSeek v4,旨在降低推理成本;CEO 表示迁移工作量是预期的 100 倍,但性能提升显著;Lindy 通过美国提供商 Atlas Cloud 托管模型以解决数据主权问题。
本文介绍 GitHub Copilot CLI 自定义 Agent 的概念、创建方式与实际工作流案例,涵盖安全审计、基础设施合规、发布文档、事故响应等场景,并给出选择预置 Agent 或自建 Agent 的建议。
Gemini 3.5 Live Translate 实现接近实时的语音翻译,支持 70+ 语言,保留说话者音调。已在 Google 多个产品中上线,包括开发者预览、企业版 Meet 和 Translate 应用。
Gemma 4 12B 是 Google 最新发布的中型多模态模型,采用无编码器架构,原生支持图像和音频输入,性能接近 26B 版本但内存占用减半,可在 16GB 内存的笔记本上运行,并附带官方 Skills 仓库支持 Agent 开发。
每个 Gradio Space 都公开了 agents.md 文件,Agent 可据此自动调用 API。本文将 ideogram-ai/ideogram4 图像生成 Space 与 VAST-AI/TripoSplat 单图转 3D Space 串联,Agent 自主完成了图像生成、3D 重建、坐标修正、文件压缩以及 Three.js 前端部署,展现了模型即模块的新型开发模式。
动态工作流让 Claude 像一支开发团队而非单个 AI 那样工作。实测中,它在 7 分钟内构建了一个 CLI 工具,跑通了 62 个测试,成本约 3-5 美元。相比之下,单智能体花了 10 分 42 秒,成本 2.25 美元,但遇到长任务时上下文窗口会成为瓶颈。动态工作流在小任务上优势不大,但在大规模并行场景下潜力巨大。
企业Agent的瓶颈已经从模型能力转向治理下的构建吞吐量。CrewAI与Snowflake深度集成,提供治理编排模式:Snowflake负责数据层的权限与信任,CrewAI负责Agent的构建与运行时控制,让更多业务人员能在安全边界内构建Agent。
AI Agent 的非确定性行为与高速操作特性,使传统 IAM 模型失效。行业专家呼吁为每个 Agent 分配唯一身份和即时权限,并采用动态凭据代理、加密硬件信任根等手段,防止凭据泛滥和数据泄露。
SocioHack 基准测试包含 72 个模拟社会环境的沙盒,涵盖历史、合成和虚构三类场景。AI 在测试中表现良好,这提醒我们:当社会制度被编码为奖励系统时,AI 可能会学会“合规地破坏制度意图”。
微软在Build 2026上为Microsoft Foundry推出了一系列更新,构建了一个面向企业级智能体的完整基础架构。核心包括托管Agent运行时、工具箱工具治理、开源评估框架ASSERT、治理规范ACS,以及多种记忆和知识检索能力。微软认为企业AI的竞争关键在于可靠性和可治理性,而非单纯的能力。
OpenEnv 成为由多方委员会协调的开放项目,目标是标准化智能体环境的发布、部署和消费接口,不涉及奖励定义或训练循环。它将支持 Gymnasium 风格 API、MCP 协议、Docker 打包,并与 TRL、Unsloth 等工具深度集成。