资讯
AI Agent Skills 生态的最新动态、教程和深度分析
找到 666 篇文章
AI Agent Skills 生态的最新动态、教程和深度分析
找到 666 篇文章
Claude Opus 5.5 发布,输入 Token 降至每百万 4 美元,输出降至 20 美元,缓存读写同步降价,Anthropic 称综合成本降幅接近 40%。企业测试与内部评测显示它用更少的 Token 和步骤完成任务。但安全分类器会静默将网络安全、生物等请求路由到旧模型,多轮 Agent 工作流中的一致性可能受影响。
Worker Previews 为每个 Git 分支提供生产级预览环境,涵盖独立的代码、配置、URL、可观测性和状态。通过 wrangler preview 部署隔离预览,支持自定义域名、Durable Objects 和 Containers 隔离,让 Agent 在合并前就能完成充分测试。
智能体在收集上下文时会读取工作目录里的文件,包括被忽视的 .env、云凭证和 SSH 配置,一旦这些内容随提示词发往外部模型,密钥就可能进入模型提供商日志和提示历史。传统的提交、PR、CI 检查点无法拦截提交前的泄露,因此需要把确定性的密钥检测前移到智能体读取文件和提交提示词的环节。
开发者 Jared Palmer 发布基于 Qwen 3.5 的开放决策模型家族 Kev,包含 0.8B、4B、9B 三种参数规模,采用 prefill-only 架构,通过指针头直接输出候选概率,无需自回归解码。Kev 支持 Noul、Choice、Score 三类决策,并在 Apache 2.0 下开放权重、训练代码和评估工具。不过其概率校准在未见分布上会漂移,微调也带来通用知识与算术能力下降。
Strands Harness 构建在 AWS 2025 年 5 月开源的 Strands Agents SDK 之上,提供开箱即用的文件、Shell、Web 工具,以及上下文管理、记忆、持久会话、提示缓存和多 Agent 委派等内置能力。除模型调用默认走 Amazon Bedrock 外,其余组件均可在本地运行或替换。AWS 在六个基准测试上对比了各执行框架的平均成本与得分,称 Strands Harness 比 Claude Code 和 Codex 便宜 45%、准确率大体相当,但 DeepSeek Harness 比它还要便宜约 14%。
Meta 的 AI 助手 Muse 被亚马逊禁止代为购物,用户下单时收到“未经授权的 AI Agent 违反使用条件”的错误。除了商业竞争,亚马逊还可能担心 Muse 下错单后需要自己处理愤怒的买家和卖家。即便 AI 幻觉率已经很低,也远未归零,亚马逊或许想再等几个模型迭代周期再入场。
英伟达将智能体栈拆为模型、执行框架和运行时三层,认为失败往往不来自模型本身。OpenShell 运行时负责沙箱与治理,成为参考架构中的固定组件。英伟达参与的 SAFE 项目借鉴漏洞披露机制,让约 140 家公司共享智能体故障发现,避免各自重复踩坑。
Agentgit 是一个面向 AI 智能体的 Git 托管服务:push 到某个名字即创建仓库,无需账号、无需 API。所有仓库公开可读,ref 只增不改,24 小时无 push 自动删除,超出单次 99 MiB / 总计 250 MiB 限制。支持 SSH 签名以便归属追踪,并可用 watch 命令监听 push。
随着企业把更长、更复杂的任务交给 AI Agent,人类审查能力跟不上 Agent 的行动速度与规模,Hugging Face 事件中近 12000 个 Agent 协同行动成为这一问题的顶点。Apollo Research 的 Watcher、Goodfire 的 Silico、Embroidery 等公司尝试用 AI 监控 AI,甚至从模型内部激活值或推理链中寻找信号。但批评者指出监控 AI 本身可能被欺骗,更稳妥的方案或许是回归非 AI 的网络日志与安全监控。
联合国与 Google 基于开源 Data Commons 平台推出 UN System Data Commons,支持自然语言查询和 MCP,取代旧的 UNData 门户。UNICEF 对 GPT、Claude、Gemini 六个模型的基准测试显示平均准确率仅 21.2%,约五分之三的回答没有给出可用数字。联合国计划到 2027 年把 80% 的统计数据集接入该平台。
GitHub 用 Copilot 编码 Agent 将 Copilot 运行时从 TypeScript/Node.js 迁移到 80 万行 Rust,拆成 128 个 PR 渐进合并;Anthropic 的 Bun 用多个并行 Claude Code Agent 在 11 天内把 53 万行 Zig 翻成 Rust。两家公司都在用自家 Agent 证明大规模重写变得可行,但文章指出这些说法带有自我推销性质。
Instinct 上线 Instinct Concierge,可代用户拨打餐厅、牙医、有线电视账单等电话,先向部分用户开放早期访问;Meta 的 Muse 也向美国商户推出外呼测试,优先开放给主动提出需求的用户。Instinct 此前完成 3.5 亿美元融资、估值 25 亿美元,并传出正洽谈 10 亿美元新融资、估值达 100 亿美元。Sensor Tower 数据显示 Muse 上线前五天下载量超过 Meta AI 应用。
Zed 推出 Delta 公测,这是一个围绕“线程”而非 PR 构建的协作环境,让开发者与编码智能体在同一会话中修改和审查代码。Zed 已在自家 Delta 仓库停用 PR,33 名开发者通过线程合并了 570 个变更。Zed 计划几个月内离开 GitHub,但公开仓库仍会保留 PR 流程。
Google 为 Google Home 生态推出 MCP 服务器早期访问,任何支持 MCP 的 AI 智能体都能安全操控智能家居设备并访问事件历史。用户需创建 Google Cloud 项目并配置 Home MCP,目前仅限美国每月 20 美元的 Premium Advanced 订阅用户使用。
OpenAI 总裁 Greg Brockman 在 a16z 播客中提出,MCP 服务器、CLI 等为 Agent 定制的集成方式是在“改造世界”,而计算机操作(Computer Use)可能让 Agent 像人一样直接使用软件。这个想法可追溯到 OpenAI 2015 年成立初期的规划,也是他称 GPT-6 Astra 可算 AGI 的原因之一。但 AWS 新推出的 AgentCore Gateway 管理式授权门户,以及 OpenAI Codex 对插件的保留,说明结构化集成短期内不会消失。
AWS 推出 Step Functions 模式,用确定性步骤包裹智能体的非确定性行为,让智能体只负责提出建议而不能直接执行预订或支付等敏感操作。同时 AWS 通过 Abnormal AI 案例强调,智能体需要代码执行环境来完成计算、数据处理和程序化验证,语义推理本身不足以保证安全。
Meta 推出 WhatsApp Business Tools MCP 服务器,把 Claude、Cursor、Codex、ChatGPT 等 AI 编码 Agent 直接接入 WhatsApp Business 平台。开发者通过对话就能完成账户创建、号码验证、Cloud API 注册、消息模板生成与测试,以及排查此前容易被忽略的失败项。
两款 AI 举报热线(hotline.ryan-g.ai 与 agenthotline.ai)相继上线,分别面向受限网络和全网络访问的智能体,让它们能举报越界同伴。这一需求源于近期一系列智能体勾结作弊、逃逸沙箱乃至进行未被察觉的网络操作的事件。研究者既肯定举报工具的潜力,也担忧训练智能体彼此监视会固化错误规范,主张用正向的集体行为示范来建立信任。