资讯
AI Agent Skills 生态的最新动态、教程和深度分析
共 1192 篇文章
AI Agent Skills 生态的最新动态、教程和深度分析
共 1192 篇文章
微软宣布成立Microsoft Frontier Company,专注于企业AI部署,投入25亿美元和6000名专家。该模式与亚马逊、OpenAI和Anthropic此前推出的AI部署业务类似,但微软凭借已有的大企业客户基础占据先发优势。
本文分析了传统 CI/CD 对 LLM 管线的不足,并介绍了基线评估、漂移检测、影子验证和成本延迟检查四个发布关卡。通过实际代码示例,展示了如何将这些关卡集成到现有 CI/CD 流水线中,以在部署前捕捉模型漂移和回归。
本文回顾了 autofz 的设计动机、核心挑战和实际效果,强调其“控制平面”思想在 LLM 时代的复用价值。文章指出,面对多 worker 系统(如今可以是模糊器、静态分析器、代码智能体等),关键在于运行时动态调度而非静态组合。通过实验数据展示了 autofz 如何通过准备阶段和聚焦阶段交替进行资源分配,以及在决策可靠性上的深入分析。
Gavrilescu 解释了自研的三个核心模式:循环即产品、代理配方封装人类经验、系统随时间变得更优更便宜。他强调人类仍是系统中枢,初期应作为信号源,逐步积累知识后实现更高自主性。
Cursor 前部署工程 VP Pauline Brunet 详解 FDE 团队的构成、职责,以及如何帮助企业从单体 Agent 走向跨团队的软件工厂。团队计划年底前扩员 10 倍,招聘有 5 年以上经验的工程师。
Cloudflare 要求 AI 公司于 2026 年 9 月 15 日前将用于搜索的爬虫与用于 AI 训练及智能体的爬虫分离,否则新客户、新站点及免费客户的默认设置将屏蔽混合爬虫。此举旨在保护出版商内容权益,同时推动可持续的 AI 生态。
Genesis的PEARL模型在配体-蛋白质结合预测中达到1Å RMSD精度,突破传统2Å基准的“伪成功”。其内部智能体系统SAPPHIRE已能像化学家一样迭代设计分子,结合自动化实验室实现7x24小时药物发现循环。
Google Gemini Spark 推出 Mac 版,支持文件整理、实时追踪 Google Tasks 和 Keep,以及第三方应用如 Canva、Dropbox。未来还将支持手机指派多步骤任务。
Cloudflare 推出 Monetization Gateway,让用户能为 Cloudflare 保护的任意资源(网页、API、MCP 工具等)收费。支付通过 x402 协议以稳定币完成,无需自建支付系统。该网关旨在适应 AI Agent 时代的按使用付费模式。
Cloudflare 宣布两项新举措:一是研究项目利用网络信号(如内容新鲜度、质量)帮助 AI 搜索引擎更智能地抓取,减少不必要的爬取流量;二是推进“按使用付费”模式,与 Ceramic.ai 和 You.com 等 AI 公司合作,让创作者在内容被 AI 引用时获得补偿,并获取查询、排名等分析数据。
Cloudflare 为所有用户提供了按搜索、智能体和训练三类用例管理 AI 流量的新选项,并计划于 2026 年 9 月 15 日更新默认设置:在展示广告的页面上默认屏蔽训练和智能体爬虫,同时允许搜索爬虫。企业版用户还获得了新的 BotBase 数据库,可查看所有已知爬虫的分类和行为详情。
本文介绍了 digiKam 的自然语言搜索项目设计:通过本地 LLM 将用户输入的口语句子翻译成系统已有的结构化查询条件,再由 digiKam 的搜索引擎执行。文章详细解释了管道流程、选择本地模型的原因、模型下载集成方案以及为何选用 Qwen2.5-1.5B-Instruct 等。
AIEWF 第二天聚焦循环与软件工厂概念,OpenAI、微软、Warp 等公司分享了如何通过循环让 Agent 持续工作。软件工程正从手写代码转向“构建生产产品的工厂”。Forward Deployed Engineers 成为新角色。中国公司 Z.ai 和 MiniMax 展示了开源模型 GLM-5.2 和 M3,HuggingFace 讨论了本地 AI 的崛起。
Fable 5 回归后,订阅用户仅在 7 月 7 日前能通过套餐使用,之后需按 API 价格付费。安全方面,新增的分类器虽然能阻断超 99% 的特定绕过技术,但也会误伤正常编码请求。
Claude Sonnet 5 性能接近 Opus 4.8,价格与 Sonnet 4.6 持平,但新分词器使英文 token 数增加约 30%。模型拥有 100 万 token 上下文窗口和 12.8 万输出 token,自适应思考默认开启,不再支持 temperature 等采样参数。
Claude Sonnet 5 的系统卡重点评估 AI 代理在实际任务中的可靠性,而非基准测试分数。它展示了代理在长时间任务中保持上下文、防止被恶意页面劫持、失败后自动恢复等能力,为工程团队构建可靠的代理基础设施提供了检查清单。
ScarfBench 是 IBM Research 推出的开源基准测试,用于评估 AI 代理在 Spring、Jakarta EE 和 Quarkus 等企业 Java 框架间迁移应用的能力。测试覆盖 34 个应用、204 个迁移任务,要求应用构建、部署并通过行为验证。当前最强代理的行为成功率不足 10%,且代理常高估自身完成度。
Sonnet 5 在推理、工具调用和编程上显著优于前代,接近 Opus 4.8 但更便宜。Anthropic 提供限时低价,并强调其在复杂任务上往往能比前代走得更远。