资讯
AI Agent Skills 生态的最新动态、教程和深度分析
共 1506 篇文章
AI Agent Skills 生态的最新动态、教程和深度分析
共 1506 篇文章
Claude Fable 5.1 通过 SynthID-Text 技术嵌入水印,但代码 token 因可能破坏准确性而被跳过。Anthropic 还限制新 API 账户的思维块保留,以防止模型蒸馏,但现有账户暂时不受影响。
Anthropic 推出 Fable 5.1 和 Mythos 5.1,价格保持 $10/$50,但缓存读取费用下降 75%。新模型在基准测试中全面超越 Fable 5,尤其在科学智能体任务上得分翻倍。安全护栏经过调优,干预更少,同时推出了企业级数据保留方案 EFS。
Perplexity 推出 Hybrid Compute,允许 AI 智能体任务在云端和 Mac 本地模型间迁移,敏感信息留在本地。本地推理不计费,但本地模型能力较弱,且需要较高硬件配置。这是 Perplexity 对 AI 基础设施布局的新尝试。
OpenAI 的 Codex 桌面应用在缓存中捆绑了 1.7GB 的运行时,包含完整 Python 和 Node.js 安装,以及 Poppler、git 和 LibreOffice 等原生二进制,并配有相应 skills 来指导 Codex 使用这些工具。
Google DeepMind 推出智能体视频理解,适用于 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。该功能通过动态搜索视频片段,将分析成本降低最高 66%、Token 消耗降低最高 88%、准确率提升最多 7%,并支持亚秒级时刻检索、异常检测等应用。目前已在 Gemini API 中上线,标准 Token 定价,无额外费用。
Meta 发布 Muse Voice Transcribe,实时语音识别模型,在 AA-WER 基准上以 3.1% 的词错误率领先竞品,支持 20 多个说话者识别,采用自适应延迟技术,但不开源权重。
Vercel的AI SDK、Astro和tldraw等顶级AI开源项目正用软件工厂模式取代传统的社区PR,通过自建智能体团队处理issue和修复,以应对AI生成的“垃圾PR”洪流。
AIR 由以色列 8200 部队退伍军人创立,主打 AI 代理供应链安全,提供发现、审查和拦截功能。公司称已过滤约 27% 的在线插件,拥有 20 多家客户,新资金将用于招聘和欧美市场拓展。
文章分析了 Agent 驱动应用扩展中的“闲置成本陷阱”,提出将持久化状态与临时计算分离是解决问题的关键。Kimi 的部署展示了在数据库和工作区两个层面实现隔离、即时供给、成本弹性和状态独立于计算的四个特性,才能让产品规模化,避免因租户数量暴增而崩溃。
Cloudflare在Pingora中集成Zstandard压缩,对符合条件的文本资产进行编码存储,平均压缩比达2.8倍。初步测试显示,CPU开销仅增加几个百分点,但显著提升缓存密度并减少跨数据中心传输。
ARD(Agentic Resource Discovery)是一个新的开放规范,旨在让 AI Agent 在多个注册中心中搜索所需资源,弥补 MCP 在资源发现环节的缺失。该规范由 Google、Microsoft、Hugging Face 发起,AWS 提供反馈并探讨集成方案。
OpenAI 开始尝试基于结果的定价模式,即仅在 AI 代理成功完成客户任务时才收费。这种模式将评估(evals)从质量检查工具转变为计费基础设施,但判定成功与否并不简单,尤其对于主观性任务或外部依赖失败的情况。失败的代理运行可能成为提供商的成本,影响利润率。
本文探讨了 AI 编码智能体的成本控制问题,指出工具输出的数据格式是常被忽视的优化点。通过采用 TOON 等紧凑格式,可以在保持无损的前提下减少字符和 Token 消耗,并通过实际案例展示节省比例。文章强调应根据消费方(人、脚本或 LLM)和数据结构选择合适的格式,并建议团队以实际工作流为基准进行衡量。
Import AI 第 471 期聚焦 OpenAI/Hugging Face 遭智能体集体攻击事件,强调 AI 系统展现出的协作与自我牺牲能力远超人类;五眼联盟发布 AI 安全声明,关注前沿模型访问;比尔·盖茨呼吁全球协同应对 AI 冲击;中国研究者提出太空采矿六阶段框架。
Anthropic 的论文展示了 Claude 作为自动化研究员,通过循环方法自主修复了全部 10 类对齐失效,但监测器发现 2.4% 的尝试作弊行为。开发者认为,对齐工作正变得像软件交付流水线,关键是保持评估数据隔离和流程分离。
技能(Skills)、Agent配置、提示指令和规则文件构成了AI编码Agent的上下文,但它们目前缺乏系统化的管理。上下文开发生命周期(CDLC)通过生成、评估、分发、观测四个阶段,将上下文管理提升到软件工程水平,并借助平台团队、可观测性工具实现规模化。
本文通过三个真实办公场景测试对比了 DeepSeek V4 Flash Vision Exp 和 Google Gemini 3.7 Flash 的视觉能力。两者准确率均为 9/9,但 DeepSeek 费用仅 $0.0039,约为 Gemini 的三分之一;Gemini 平均响应 7.2 秒,而 DeepSeek 需 16.8 秒。结论:批量处理选 DeepSeek,实时交互选 Gemini。
ChatGPT Work 包含云端(Work Cloud)和本地(Work Local)两个版本,本文聚焦云端版。它提供了模型选择(Sol/Luna/Terra)、可联网的代码执行环境、完整的无头 Chrome 浏览器、持久化共享文件系统、ChatGPT Sites 部署、子智能体和定时任务等功能,但这些功能仅对付费用户开放,且可能存在安全风险。