论文
AI 前沿论文中文翻译与导读,覆盖智能体、多模态、具身智能等方向
AI 前沿论文中文翻译与导读,覆盖智能体、多模态、具身智能等方向
本文提出 CoREB,一个抗污染、多任务的代码检索与重排序基准,涵盖文本到代码、代码到文本、代码到代码三个任务。实验发现短关键词查询导致所有模型性能崩溃,而微调的 CoREB-Reranker 首次在所有任务上取得一致提升,弥补了现有研究忽视重排序环节的缺陷。
Flow-OPD提出首个统一在线策略蒸馏框架,用于流匹配文本到图像模型的后训练对齐。通过两阶段策略和流式冷启动方案,将多个单奖励教师模型的知识蒸馏到单个学生模型中,并引入流形锚点正则化防止美学退化。在SD3.5 Medium上,GenEval分数从63提升至92,OCR准确率从59提升至94,实现了超越教师的效果。
本文揭示了基于组的策略梯度优化方法具有共同的几何结构:隐式定义响应单纯形上的目标分布并通过一阶近似进行投影。为此,提出列表策略优化(LPO),通过将近端RL目标限制在响应单纯形上并执行精确散度最小化,显式进行目标投影。LPO在多样推理任务和LLM骨干上相比典型策略梯度基线持续提升训练性能,同时保持优化稳定性和响应多样性。
本文提出世界动作模型(WAMs)这一新兴范式,将世界模型与视觉-语言-动作(VLA)模型融合,统一预测状态建模与动作生成。通过系统梳理现有方法,构建了级联和联合两类WAMs的分类体系,并从数据生态、评估协议等角度全面分析,指出该领域的关键架构权衡与未来方向。
RubricEM提出评分准则不仅是最终评估工具,更是策略执行、评判反馈和智能体记忆的共享接口。通过分阶段策略分解与反思式元策略演化,在四项长程研究基准上,8B参数模型性能超越同类开源模型,接近专有深度研究系统。
本文提出AutoTTS框架,将测试时缩放策略的发现过程自动化,通过构建控制空间和提供廉价反馈的环境,无需手动设计启发式规则。在数学推理基准上,自动发现的策略在准确率-成本权衡上超越手工基线,且仅需39.9美元和160分钟。该方法可泛化到未见基准和模型规模,降低了大模型推理优化的门槛。
作者提出DRoRAE方法,通过轻量融合模块自适应聚合视觉编码器的中间层特征,而非仅用最后一层。在ImageNet-256上,重建rFID从0.57降至0.29,生成FID从1.74提升至1.65,并发现融合容量与重建质量的对数线性缩放定律。
本文提出潜空间到像素空间(L2P)迁移范式,利用预训练潜扩散模型的中间层知识,仅训练浅层网络实现高效像素生成。该方法无需真实数据,仅使用潜扩散模型生成的合成图像,8块GPU即可完成训练,并支持原生4K超高清生成。实验表明,L2P在极小训练开销下达到与源模型相当的性能。
HumanNet 是一个包含一百万小时人体活动视频的大规模语料库,涵盖第一人称和第三人称视角、细粒度动作、物体交互及长期行为,并提供丰富的交互注释。实验表明,使用 HumanNet 中的 1000 小时第一人称视频进行持续训练,效果优于使用 100 小时真实机器人数据,证明人体视频可成为机器人数据的可扩展替代方案。
MemPrivacy提出了一种在边缘设备上识别敏感词、替换为结构化占位符,再在云端处理记忆、本地恢复原始值的方法,实现了隐私保护与记忆效用的平衡。在覆盖200用户、5.2万隐私实例的基准测试中,该方法在隐私提取上超越GPT-5.2和Gemini-3.1-Pro,并将效用损失控制在1.6%以内。这项工作为边缘-云环境中安全性、实用性和用户透明度的部署提供了新思路。
提出Skill1框架,通过单一任务奖励信号协同进化技能选择、使用和蒸馏三种能力。在ALFWorld和WebShop上优于现有方法,验证了协同进化机制的有效性。
Cola DLM 提出了一种层次化潜在扩散语言模型,通过文本VAE学习稳定的文本到潜在映射,利用块因果DiT在连续空间中建模全局语义先验,最后通过条件解码生成文本。实验表明,该模型在8个基准测试中与约2B参数的GPT-2和LLaDA基线相当或更优,且具有良好的扩展性,为非自回归文本生成提供了新范式。