DevRev 开源企业 AI 基准测试,挑战 Claude Code
深度The New Stack2026年7月9日8 分钟阅读

DevRev 开源了企业 AI 智能体基准测试,专注于数据复杂性而非推理难度。在该测试中,其自研智能体 Computer 在准确率和成本上均优于 Claude Code。
本文编译自 Enterprise AI benchmarks are broken,版权归原作者所有。
觉得有用?分享给更多人

觉得有用?分享给更多人
Black Forest Labs 推出 FLUX 3,统一多模态模型,视频生成超越多个竞品,并开源 FLUX-mimic 用于机器人控制。同时,The Stack v3 数据集发布,蒸馏政策争议持续。
本文采访了多位进攻型网络安全研究员,探讨AI公司的安全护栏如何影响他们发现漏洞和开发利用工具的工作。研究员们普遍认为护栏过于严格且不一致,迫使部分人转向国产开源模型。