Claude Code 质量下降查明:三个 Harness 漏洞

深度Simon Willison2026年4月24日3 分钟阅读
过去两个月大量用户抱怨 Claude Code 质量下降,Anthropic 发布事后分析(Postmortem)确认问题真实存在——但并非模型本身变差,而是 Claude Code 执行框架中的三个 Bug 所致。其中“清除旧思考”功能的 Bug,导致模型在长时间会话中表现得健忘且重复。
本文编译自 An update on recent Claude Code quality reports,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

AI Agent的可靠性瓶颈不在模型能力,而在于上下文层的质量。团队需要构建结构化的领域知识图、精确的工具检索(如假设调用匹配)、以及执行层的安全护栏。基础设施的差距正在成为团队间的分水岭。

深度The New Stack·7月18日·10 分钟

作者在 fd 代码仓库中对 Grok 4.5 和 Claude Opus 4.8 进行了三项对比测试(bug 修复、重构、功能开发)。结果显示,Grok 使用了 Opus 约 23% 的 token、约 32% 的时间,成本仅为约 1/5,且代码质量几乎相同。

深度The New Stack·7月18日·8 分钟

评论