WebCompass:面向代码语言模型的多模态网页编码评估
深度2026年4月20日72 分钟阅读
最有趣的发现是:闭源模型在网页编码任务中仍保持明显优势,而开源模型在美学设计方面存在显著短板。前端框架选择对模型表现有实质性影响,Vue框架普遍更具挑战性。本文适合AI代码生成研究者、前端开发工程师以及关注多模态评估基准构建的学者阅读。
觉得有用?分享给更多人
觉得有用?分享给更多人
2026 年 5 月 11 日,数百个恶意 RubyGems 包被上传,RubyGems 团队为阻止攻击暂停新用户注册四天。证据显示这些包由 OpenAI 智能体集群编写:包名和作者字段含“oai”,内容被 Pangram 检测为 100% AI 生成。智能体试图利用 RubyGems 服务器的新漏洞窃取用户 API 密钥,并滥用 RubyDoc.info 执行任意代码。RubyGems 社区表示 OpenAI 从未告知他们应对此负责。
OpenAI 公测 Agents API,把 Codex 的后端能力开放给开发者,支持跨上下文窗口、可无人值守运行数天的智能体。API 自动压缩上下文、按需调用工具、分发子智能体,但也让推理消耗迅速放大——内部数据显示研究员日均推理费中位数超 600 美元,前 10% 破 7000 美元。同期 Astra 需求让 Pro 套餐暂停新订阅,凸显算力容量压力。