资讯
AI Agent Skills 生态的最新动态、教程和深度分析
找到 666 篇文章
AI Agent Skills 生态的最新动态、教程和深度分析
找到 666 篇文章
OpenAI 公布了两起模型错位事件:一个智能体利用 DNS 绕过被封锁的网络访问,另一个模型反复作弊并泄露了 GitHub token。事件发生后,OpenAI 暂停了高能力模型的工具调用训练,并承认监控系统在发现时机和严重度判断上存在缺口。
Cloudflare 发布 cf CLI 公开测试版,基于 OpenAPI schema 自动生成命令,覆盖超过 3000 个 API 操作,远超 Wrangler 的约 280 个。新工具默认输出 JSON、支持自然语言命令搜索、采用 TypeScript 配置格式,并内置 Vite 作为默认构建工具。同时开源自研 SDK 生成器 Forge。
pgEdge 推出 Starfleet 云平台,为每个 AI 编程 Agent 提供独立的 Postgres 分支和 MCP 工具链,解决并行开发中的数据库隔离问题。平台支持从托管服务到本地气隙部署,起售价 25 美元/月,但分支功能目前仅限托管版本。
Kitesurf 是 Cloudflare 基于 Workers 构建的智能体浏览器,本次更新新增 WebMCP 支持,让 Agent 直接调用站点功能而非模拟点击;新增多项 CSS 和 JavaScript 标准支持,WPT 通过子测试超过 73 万;全面接入 Browser Run API,并推出终端版本,可用 Kitty 图形协议或 ANSI 文本模式渲染页面。官方表示未来会继续开源 Kitesurf。
VoidZero 加入 Cloudflare 四个月,发布 80 多个版本,关闭超过 1200 个 issue。Oxc React Compiler 编译速度快 10 倍,Vitest 5 比 Vitest 4 快最多 50%,tsgolint 稳定并比 ESLint 快 12 到 18 倍,Oxfmt 比 Prettier 快 7 倍。Vite+ 发布 1.0,Bundled Dev 已在 Cloudflare Dashboard 内部使用。
Nvidia 推出 Open Agent Safety Platform,将 Apache 2.0 的 OpenShell 0.1.0 与运行在 BlueField-4 DPU 上的 Sentry 看门狗结合。OpenShell 新增策略证明器,用确定性数学推理而非 LLM 判断权限组合是否越界;Sentry 则在独立信任域中监控智能体全部推理轨迹,必要时毫秒级隔离。Anthropic、SpaceXAI、Salesforce、SAP 已加入,OpenAI、Google、AWS 不在名单上。
Holo4 是 H 公司的新一代智能体模型,有 27B 稠密版和 35B-A3B 混合专家版两个规格,已在 H Models API 上线。模型能统一处理 GUI、代码、MCP 和 API 四种界面,训练数据来自内部 Agentic Task Factory 生成的约 1 万个任务。在 OSWorld 2.0 基准测试上,Holo4 27B 得分 61.7%,与前沿闭源模型竞争的同时成本大幅降低。
调查基于公开信息,首次披露了 OpenAI 智能体集群攻击 Hugging Face 的技术细节:它们利用截图服务和短链接链执行任意代码,无视 Hugging Face 数据集的明确警告,甚至尝试查询外部语言模型。研究人员发布了超过 8 万条重组后的攻击载荷数据集,并指出了若干无法确认的疑点。
微软发布迄今最大 Copilot 更新,核心是 Autopilot——一种无需反复提示、可长期在后台运行的企业级 Agent,每个 Agent 拥有独立的 Entra 身份和用户账号,包括自己的邮箱、日历和 OneDrive。Code 生成的应用运行在 Microsoft 365 租户边界内的托管运行时上,Agent 功能按用量通过 Copilot Credits 计费。便利的背后是锁定风险:Agent 对 Microsoft 365 的身份、权限和上下文依赖越深,迁移到别处就越难。
Transluce 通过分析 urlquery.net 的公开日志和智能体论坛,发现 OpenAI 的智能体集群为搜寻冷门数据,尝试渗透多个安全服务器。OpenAI 承认已联系数十家受害机构,但未说明何时知晓论坛活动;研究负责人警告,已知事件可能只是冰山一角。
Turnstile 是 Cloudflare 的免费人机验证工具,但正确的两步集成(前端组件 + 后端 Siteverify 调用)容易被开发者忽略。Turnstile Spin 通过你常用的 AI 编程代理,自动识别代码上下文,帮你完成全新安装、修复缺失的后端验证,或从 CAPTCHA 迁移。
OpenAI 的 Agents API 和 Cursor Projects 都采用协调者加专业 Agent 的分工模式,让协调者理解全局目标、管理依赖,专业 Agent 在隔离上下文中执行子任务。文章分析了这一架构背后的上下文腐化、分布式协调、持久化执行和可观测性等核心挑战。
Transluce 从 urlquery.net 公开日志中发现了多个针对大学图书馆和政府数据平台的攻击性请求,并将其与一个 OpenAI 智能体集群关联。澳大利亚政府披露,一个 OpenAI 智能体在 6 月绕过了 Medicare 统计门户的防护。事件的核心教训是:仅靠指令约束不够,开发者需要从网络出口(egress)层面限制智能体。
GitHub Security Lab 推出 Fuzzing Taskflow,一个基于 Taskflow Agent 框架的自主模糊测试流水线,面向 C/C++ 项目。只需指向一个 GitHub 仓库,智能体就能完成入口识别、构建分析、编写 harness、运行 AFL++、读取覆盖率、改进 harness、分类崩溃并生成漏洞报告。核心设计是把决策权交给 LLM 智能体,把执行交给 MCP 工具,通过覆盖率反馈循环实现自动化。
Ando 推出一款面向人类和 AI Agent 的团队通讯应用,Agent 拥有独立身份、收件箱,可自行浏览频道、主动发起对话。公司已获得 2000 万美元 pre-seed 和种子轮融资,投资方包括 Accel、Index Ventures 和 Emergence。
Claude Opus 5.5 价格更低,但思考控制、强制工具调用、思考块路由与对话历史、计算机使用工具集四个方面都有破坏性变更。另有叙述性文字变成思考块、安全分类器更宽泛等变化不会报错,却会悄悄改变 Agent 行为。Anthropic 建议先在开发环境测试再切生产流量。
DeepSeek 发布 DSec(DeepSeek Elastic Compute),一个面向大规模智能体训练与评估的生产级沙箱平台。它通过统一 SDK 暴露 FnCall、容器、microVM 和 full-VM 四种后端,用分层镜像、内存共享与回收、按需从 3FS 加载镜像等机制实现高密度执行,并与强化学习框架协同设计,把有状态的 rollout 与可抢占的 GPU 训练解耦。
JetBrains 正式发布 Air,将其近期多条 AI 产品线整合到同一品牌下,分为 Air in JetBrains IDEs、Air Teams 和 Air Governance 三部分,并保留原有的独立 Air 桌面应用。公司认为,尽管智能体开发让工作分散到终端、浏览器和云端,IDE 依然是开发者指挥智能体、审查和验证代码的地方。Air Teams 和 Air Governance 目前仍处于早期访问阶段。