Google 的 Decoupled DiLoCo:让 AI 训练跨数据中心更抗造
深度2026年4月22日4 分钟阅读
训练大模型时,一个芯片故障就可能导致整个训练停滞。Google 的新架构 Decoupled DiLoCo 通过将训练拆分为多个“孤岛”,实现了异步训练,即使部分硬件失效,系统也能继续高效运行,且性能不降。在跨 4 个美国区域的测试中,该架构仅需 2-5 Gbps 带宽,训练速度比传统同步方法快 20 倍。
觉得有用?分享给更多人
觉得有用?分享给更多人
Y Combinator 支持的 Specific Labs 发布 Real-SWE 基准测试,用真实公司的私有代码库考察 AI 编程智能体,避免公开代码被训练数据污染。Claude Fable 5.1 搭配 Claude Code 以 38.8% 的成功率排名第一,但仍有超过六成的任务失败。测试中 10 个任务中有 6 个成功率低于 15%,一个分析流缩减任务在 64 次尝试中无人解决。
MCP 在 2025 年快速生产化后暴露出多起安全事件,根因都指向过宽的权限范围与缺失的身份模型。文章主张把范围(scope)、身份(identity)、生命周期(lifetime)作为一次性统一评估,用动态临时凭证替代固定永久 Token,并让 Agent 拥有独立于调用者的身份。