先看后答:视觉基础后训练提升视频理解
深度2026年4月6日30 分钟阅读
最有趣的发现是:广泛使用的视频理解评测和后训练数据集中存在大量仅需文本即可回答的问题,这严重低估了视觉语言模型的实际视频理解需求。计算机视觉、多模态学习领域的研究者,以及关注模型评估方法的研究人员都应该阅读这篇论文。
觉得有用?分享给更多人
觉得有用?分享给更多人
Shopify CEO 称 Claude Code 不读取 AGENTS.md 造成“复杂性税”,并考虑禁用该工具。Anthropic 已提供变通方案,但开发者请求原生支持近一年未果,相关 issue 已被关闭。
IBM Granite 4.2 系列回归密集 Transformer 架构,提供 512K 上下文窗口,并针对智能体工作流优化了较大版本。与竞品相比,它在基准测试中表现中规中矩,但小尺寸模型(8B)在性能上接近 30B 版本,且易于运行。