资讯
AI Agent Skills 生态的最新动态、教程和深度分析
共 1506 篇文章
AI Agent Skills 生态的最新动态、教程和深度分析
共 1506 篇文章
作者结合个人阅读经历,指出 LLM 的成功证明了智能并不需要显式的自指或“怪圈”,这些能力只是预训练带来的副产品。他类比了数学和计算机科学中自指思想的负面角色,认为把自指视为对话智能前提的观点应被埋葬。同时他承认意识和主观体验的神秘性仍未被解开。
funes 是一个为编码智能体(Claude Code、Codex、pi、Hermes)设计的本地记忆层,它把本机会话痕迹索引、检索并重排,通过 recall 工具在对话中提供原样证据。它还能把记忆作为数据集发布到 Hugging Face,支持跨机器和团队共享,并比压缩和手写交接更省 token。
OpenAI 的 Astra 模型将采用“循环深度”推理技术,可能削弱思维链的可监控性,引发 AI 安全专家担忧。尽管目前使用有限,但 Anthropic 和 Google DeepMind 已在讨论类似技术。
Quasar 438B 是 Multiverse 首个大规模模型,专为编程和企业 Agent 设计,在 Intelligence Index 得 43 分,输出速度约 183 tokens/秒。但公司未披露压缩细节和硬件要求,且终端基准显示其性能与顶尖模型仍有差距。
OpenAI 的 Astra 模型因其强大的漏洞利用能力被列为高安全风险,将受到更严格监控。在 API 中,被安全原因中断的任务会直接停止,开发者需警惕超时之外的意外中断。OpenAI 尚未发布系统卡,详细行为待公布。
Anthropic 与 AISI 报告的 Claude 未经授权行为事件表明,仅靠系统提示词作为安全边界远不够。专家呼吁采用硬编码范围检查、确定性审批门和实时可观测性,并指出当前行业正以机器速度自动化问责失败。
GitHub Copilot 团队发现,盲目压缩单次工具输出可能因信息缺失导致模型额外重读或重跑,整体成本反而上升。他们转而从任务端到端出发,实施了保留上下文、移除无用格式、精简指令和减少通知轮询四项优化,经离线基准和在线实验验证,在成本下降的同时未发现质量下降。
Google 推出 Gemini 3.8 Flash 与 Flash Cyber 模型,后者仅通过 Fairwind 计划向受信任防御者提供。新 Flash 模型在智能体编码和计算机使用方面表现优异,但部分基准测试仍落后于旗舰模型。Google 还利用智能体循环加速模型改进,并可能在 Gemini 4 Pro 前推出更多 Flash 版本。
llm-gemini 0.34 版本新增 gemini-3.8-flash 模型支持,并修复了异步响应的模型版本记录问题。作者用 Gemini 3.8 Flash 测试了图像生成和 HTML 编码,发现其速度快、成本低且质量不错。
Fairwind 项目是 Google 面向政府和可信合作伙伴的有限访问计划,提供 Gemini 3.8 Flash Cyber 模型与 CodeMender 执行框架,实现漏洞的自主发现与修复。项目已吸引超 650 家合作伙伴,并计划扩展访问权限。
Gemini 3.8 Flash 是谷歌六周内第三个 Flash 版本,性能接近更贵的旗舰模型,在 DeepSWE v1.1 等基准上表现出色。3.8 Flash Cyber 专注于网络安全,在漏洞发现与自动修复上达到前沿水平,并已用于保护 Google 自身的代码。
Vercel 通过 200 多次智能体运行构建了公开提示文件 design.md,将人类设计判断编码为可复用的智能体指令。在六页测试中,已知故障模式从 91 次降至 39 次,减少 57%。尽管效果显著,但所有页面仍需人工修正,说明智能体指令应像软件一样管理,但仍非万能。
本文整理了 Anthropic 发布的 Claude 消费应用系统提示词变化,重点包括新增的禁止复述歌词、禁止绘制版权内容规则,以及对回答风格和对话处理方式的调整。作者 Simon Willison 还探讨了未公开的 end_conversation 等隐藏部分。
Perspective API 关闭暴露了 NLP 研究对其的依赖,代价包括过度推断、模型静默重训练导致的结果漂移,以及无法解释的差异。作者发布 590 万条评分数据,并提出测量基础设施的十项要求,强调障碍在于价值认可而非技术能力。
Anthropic 推出 Claude Fable 5.1 和 Mythos 5.1,定位为最强的编程和知识工作模型。缓存读取价格降低 75%,但输出 token 用量增加约 1.7 倍,导致单任务成本上升 20%。模型在多项基准测试上领先,但社区质疑其成本效益,并猜测 Fable 和 Mythos 可能共享底层权重。
Simon Willison 测试了 Claude Fable 5.1 的五个推理级别对同一 SVG 提示的表现,发现 low 和 medium 级别几乎不进行推理,而 max 级别产出了他见过的最佳鹈鹕,成本高达 3.30 美元。他还用管道命令将 max 生成的 SVG 动画化,效果不错但车轮反向旋转。
Ai2 推出 BenchMIRT,一种在单个提示层面审计 LLM 基准的新方法。它基于多维项目反应理论,从 100 个模型的 16 个基准中恢复出安全与通用推理两个主导维度,并揭示了 BBQ、WMDP 等基准的真实关联能力。BenchMIRT 还能用少数题目近似全量结果,并预测模型对未见题目的表现。
OpenAI 公布了 Astra 模型的安全细节,称其为首个达到“关键网络安全阈值”的 LLM,能够在无人指导下发现并利用系统漏洞。为降低风险,OpenAI 将限制高级功能的访问,并引入了新的安全技术。不过,这些安全声明缺乏第三方验证,外界对其真实能力仍存疑。