我用Claude做一切,但Grok 4.5测试让我重新思考

深度The New Stack2026年7月18日8 分钟阅读
我用Claude做一切,但Grok 4.5测试让我重新思考
xAI 宣称 Grok 4.5 在编码任务上能用不到 Opus 4.8 四分之一的 token 达到相近效果。作者在同一个 Rust 仓库中给两个模型布置了三个任务,结果令人意外:Grok 确实用更少的 token、更短的时间和更低的成本完成了相同的工作。
本文编译自 I trust Claude for everything. This test made me rethink that.,版权归原作者所有。

觉得有用?分享给更多人

获取每周 AI 工具精选

工具推荐、实战教程和生态洞察,每周更新。

相关文章

ElevenLabs 的托管 MCP 连接器让 Claude 能检查、修改生产环境中的 ElevenAgents 语音代理。虽然提供了 OAuth 登录和双重访问控制,但确认界面无法保证更改后的代理仍按预期工作。CLI 和 API 提供的测试与版本控制流程,可能是更安全的选择。

深度The New Stack·8月17日·5 分钟

本文剖析 Agent Plugins 1.0.0 规范的局限:它只标准化组件位置,而将行为语义交给 Agent Skills 和 MCP 规范(均出自 Anthropic,但未参与治理)。文中指出兼容性矩阵的弹性、模式与规范冲突、命名空间逃逸、凭据和可执行文件的可移植性陷阱,并对 v1.1 提出改进建议。

深度The New Stack·8月17日·9 分钟

评论