How to Train a Critic Stably and Efficiently
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
如何稳定且高效地训练评价模型
机构 * National University of Singapore(新加坡国立大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出BPCO流程稳定高效训练评价模型,在数学推理任务上,其优于基线,且采样1个响应时可匹配或超过基于组的GRPO基线。
ReWorld:具有长程记忆的交互式世界模型
机构 * HKUST(GZ)(香港科技大学(广州)) ; ATH, Alibaba(阿里巴巴 ATH 实验室)
AI总结 ReWorld通过训练分离、推理约束解决交互式世界模型的控制与记忆矛盾,结合混合注意力等技术,在三轴评估中优于6种模型,实现长程视频生成与记忆。
Comments 21 pages, 9 figures. Project page: this https URL (https://zhifeichen097.github.io/ReWorld/)
SWE Refactor Bench:编码智能体能完成长周期的全仓库栈迁移吗?
机构 * Navers Lab(Navers实验室) ; Tsinghua University(清华大学)
AI总结 本研究推出SWE Refactor Bench基准,通过三阶段评估发现前沿编码智能体仅5.4%能完成全仓库迁移,且迁移完整性与行为正确性是不同能力,该基准可作为可靠全仓库迁移编码智能体的测试平台。
EG-ARSA:适用于低资源场景的基于专家知识的开放视觉道路安全审计模型
机构 * Bangladesh University of Engineering and Technology (BUET)(孟加拉工程技术大学(BUET))
AI总结 针对中低收入国家道路安全审计的资源限制,提出EGD框架,构建BD-ARSA数据集和EG-ARSA模型,实验显示其性能优于310亿参数教师模型及Gemini-2.5-Flash,为低资源场景道路安全审计提供有效方案。
Prime Agent:一种自改进的RLM管控框架
机构 * Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; Prime Intellect
AI总结 Prime Agent是一款开源RLM管控框架,通过标准化流程提升模型长周期能力,在ARC-AGI-3等任务中大幅提升性能,支持编码等工作流与并行化任务。
Comments 16 pages, 10 figures. Technical report. Code: this https URL (https://github.com/PrimeIntellect-ai/prime-agent)
ConvergeFlow:可收敛至词元嵌入的语言流模型
机构 * Chinese University of Hong Kong(香港中文大学) ; University of Michigan(密歇根大学)
AI总结 本研究提出ConvergeFlow,一种嵌入空间的基于流的语言模型,通过约束数据预测器至词元嵌入凸包实现可收敛性,无需交叉熵解码器,在OpenWebText上取得与现有模型相当的性能,展现了基于流范式的语言建模潜力。
FixAnything:基于视频生成先验的3D一致性渲染优化
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 FixAnything是一款复用预训练视频生成模型、仅需轻量微调的单一模型,可修复3DGS、NeRF等四种3D表示的渲染伪影,实现3D一致性渲染,替代多个专用优化管线。
Comments Appearing in ECCV 2026. Project page: this https URL (https://fix-anything.github.io)
AI辅助如何影响人类技能发展:一项基于逻辑谜题学习的研究
机构 * University of California, Irvine(加利福尼亚大学欧文分校)
AI总结 该研究通过逻辑谜题实验发现,AI辅助会削弱人类长期技能发展,独立问题解决努力对技能提升更关键,低AI请求成本会增加AI使用频率且降低后续无辅助表现。
Comments Accepted at Human-AI Complementarity and Alignment (HCOMP) 2026
预测下肢骨折或髋关节置换术后老年人与功能恢复和社交孤立相关的多种临床结局
机构 * Liwa University(利瓦大学) ; University of Toronto(多伦多大学) ; University Health Network(大学健康网络) ; United Arab Emirates University(阿联酋大学) ; American University of the Middle East(中东美国大学)
AI总结 该研究基于MAISON-LLF数据集构建多输出回归模型,用NODE算法联合预测下肢骨折或髋关节置换术后老年人的5项临床结局,效果优于单输出模型,可辅助评估其功能恢复与社交参与。
EarthVerse:面向动态地球系统与自然灾害的科学智能体基准测试
机构 * NUIST(南京信息工程大学) ; HKU(香港大学) ; McGill(麦吉尔大学) ; HKUST(GZ)(香港科技大学(广州)) ; Georgia Tech(佐治亚理工学院) ; NUS(新加坡国立大学) ; Tsinghua(清华大学) ; Griffith(格里菲斯大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; MIT(麻省理工学院)
AI总结 EarthVerse是面向动态地球系统与自然灾害的科学智能体基准,含405项任务,评估25个智能体系统,发现其存在跨环节一致性不足问题,为科学可靠性测量提供可复现基础。
研究视觉语言模型(VLMs)中的关系推理
机构 * ETH Zurich(苏黎世联邦理工学院)
AI总结 本研究以Qwen3-VL-4B为对象,构建含几何形状的合成数据集,探究VLMs的关系推理能力,发现其结合了真正视觉推理与基于语言线索的捷径策略。
当名称跨越文字体系:面向蒙古世界历史实体对齐的来源基准
机构 * University of Amsterdam(阿姆斯特丹大学) ; Amsterdam UMC(阿姆斯特丹大学医学中心)
AI总结 针对蒙古世界历史实体对齐的MHER基准,证实来源基准证据可大幅提升对齐准确率,且仅名称输入在同名异义案例中表现极差,仅上下文信息与Qwen3-8B的名称处理存在特定问题。
Comments 38 pages, 4 figures, 7 tables. arXiv preprint
用于基于文本的人员异常搜索的动作对齐检索与成对多模态重排序
机构 * University of Science, VNU-HCM(胡志明市国家大学科学大学) ; Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学)
AI总结 针对基于文本的人员异常搜索中现有方法的局限,提出ActPair三阶段由粗到细框架,结合动作对齐检索与成对多模态重排序,在PAB测试集取得最优结果且可有效迁移至新数据集。
Comments Accepted to the AI City workshop @ ECCV 2026
基于SVD的典型性图用于视觉Transformer的分布外检测
机构 * University of Bologna(博洛尼亚大学) ; ARCES(先进计算机科学与工程研究中心) ; DEI(电子、信息与生物工程系)
AI总结 该研究提出基于SVD的典型性图方法,推导PAS与MLSV分数,在未重新训练或接触OOD数据的情况下,于ViT-B/16微调CIFAR-100任务上实现了有竞争力的分布外检测性能。
通过安全方向惩罚缓解推理诱导的不一致性
机构 * University of Toronto(多伦多大学) ; King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 针对推理微调引发LLM安全退化的RIM问题,本文提出安全方向惩罚(SDP)方法,通过定位安全决策层并惩罚安全方向位移,在Qwen2.5系列模型上实现安全与推理性能的平衡。
Comments 28 pages, 4 figures
SRPO:用于长程推理的自反思策略优化
机构 * School of artificial intelligence, Wuhan University(武汉大学人工智能学院) ; School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)
AI总结 本研究提出 SRPO 框架,将人类的自反思能力内化到 LLMs 中,无需额外模型即可将稀疏监督转化为密集训练信号,在数学推理等基准上以高数据效率取得了最先进性能。
Comments Accepted to ICML 2026
GeoWAM:面向自动驾驶的视觉几何世界动作模型
机构 * Uber AV Labs(优步自动驾驶实验室) ; Case Western Reserve University(凯斯西储大学)
AI总结 该研究提出 GeoWAM,一种用于自动驾驶的视觉几何世界动作模型,通过预训练预测未来场景几何来学习动力学,经评估其生成的驾驶策略比图像基方案更强,确立未来几何预测为自动驾驶有效预训练目标。
结合约束大语言模型重排序的多模态语义扩展用于对话式音乐推荐
机构 * National Institute of Technology Kurukshetra(库鲁克谢特拉国家技术学院) ; Queen Mary University of London(伦敦玛丽女王大学)
AI总结 该研究针对ACM RecSys 2026挑战赛提出三阶段多模态对话音乐推荐系统,经优化后在Blind B获0.3213综合分,发现约束大语言模型注入的会话数量对Blind A的nDCG有显著影响。
侧扫声呐的几何驱动光声配准与视角不变反射率映射
机构 * Computer Vision and Robotics Research Institute (ViCOROB)(计算机视觉与机器人研究学院(ViCOROB)) ; University of Girona(赫罗纳大学)
AI总结 针对侧扫声呐的光声配准难题,提出几何驱动框架,结合SfM、FBR算法与逆朗伯模型等技术,生成高精度多模态数据集,为底栖生境自监督学习奠定基础。
依意图行动:为视觉-语言-动作模型提炼行为意图
机构 * POSTECH(浦项科技大学) ; GSAI, POSTECH(浦项科技大学人工智能学院) ; IME, POSTECH(浦项科技大学工程学院)
AI总结 本文针对视觉-语言-动作(VLA)模型动作解码器未明确行为语义目标的问题,提出INDI方法提炼行为级意图,在多个基准及真实任务中显著提升了GR00T-N1.7的性能。
Comments Project page: this https URL (https://leesangoh.github.io/indi-project-page/)
怪异泛化与涌现失配的威胁模型研究
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
AI总结 本文研究怪异泛化(WG)的威胁模型,发现WG程度依赖数据集组成、语言及评估问题集,预训练熟悉数据的WG程度更高,认为WG是需谨慎数据工程的对抗性威胁。
有何玄机?评估视觉-语言模型的时间一致性
机构 * University of Copenhagen(哥本哈根大学)
AI总结 本研究提出TimeCatch基准,发现视觉-语言模型可检测单帧异常但难整合跨帧信息,在时间异常检测上表现接近随机水平。
Comments 17 pages, ACL format
MetaCaster:用于轻量级时间序列预测器小样本端到端学习的元调控优化智能体
机构 * University of Houston(休斯顿大学) ; NEC Labs(NEC实验室) ; University of Waterloo(滑铁卢大学) ; University of Connecticut(康涅狄格大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Singapore Management University(新加坡管理大学)
AI总结 针对资源受限场景下轻量级时间序列预测器小样本学习的困境,提出MetaCaster多智能体框架,可高效训练专用预测器,在18个数据集等实验中兼顾数据、计算效率与预测性能。
Comments Accepted by EMNLP 2026
RAD:规则增强型关系异常检测
机构 * Vanderbilt University(范德堡大学)
AI总结 研究人员针对关系异常检测中展平数据丢失结构及难融入符号证据的问题,提出RAD方法,结合图表示学习与规则信号,在多基准任务中较现有方法取得更优异常检测性能。
基于多样性的主动学习:主动学习选择的度量空间评估
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 该研究评估贪心K中心在多种度量空间中用于主动学习选择的性能,发现将未标注实例映射到带熵加权的预测概率空间时效果最优。
面向弹性空间机器人的无奖励持续适应
机构 * University of Luxembourg(卢森堡大学)
AI总结 针对空间机器人硬件退化导致传统控制策略失效的问题,提出无奖励持续学习框架,利用隐态世界模型使智能体无需奖励即可适应环境,在三类模拟任务中验证了方法有效性。
Comments Accepted for publication at the Third Conference on AI in and for Space (SPAICE 2026) | The source code is available at this https URL (https://github.com/AndrejOrsula/space_robotics_bench)
刻画必要失败者以解释锦标赛中的失败者
机构 * Institut de Recherche en Informatique de Toulouse (IRIT)(图卢兹计算机科学研究所) ; Université de Toulouse(图卢兹大学) ; Université Toulouse Capitole(图卢兹第一大学)
AI总结 该研究通过定义破坏性最小支撑集,刻画六种锦标赛解下候选人成为必要失败者或可能获胜者的情形,确定最小支撑集规模并给出计算算法,以解释锦标赛中候选人未被选中的原因。
Comments This paper is the extended version of Contet, Grandi, Mengin. Characterizing Necessary Losers to Explain Tournaments Losers. In: Proceedings of the 9th International Conference on Algorithmic Decision Theory (ADT) (2026)
AT-ADD:面向鲁棒全类型音频深度伪造检测的基准与挑战赛
机构 * Communication University of China(中国传媒大学) ; Ant Group(蚂蚁集团) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing Institute of Technology(北京理工大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出AT-ADD基准与挑战赛,设双赛道分别评估鲁棒语音深度伪造检测与全类型音频深度伪造检测,官方基线及获胜系统取得对应性能,同时揭示泛化关键及未解决问题。
用于放疗中危及器官分割质量保证的图像条件扩散模型
机构 * UCL Hawkes Institute(UCL霍克斯研究所) ; University College London(伦敦大学学院) ; National Physical Laboratory(英国国家物理实验室) ; University College London Hospital(伦敦大学学院医院) ; National Radiotherapy Trials Quality Assurance Group(国家放射治疗试验质量保证组) ; Mount Vernon Hospital(芒特弗农医院) ; University of Manchester(曼彻斯特大学)
AI总结 该研究针对放疗中危及器官分割审阅耗时主观的问题,对比VAE框架与图像条件分割扩散模型,发现后者能更一致地定位细微边界错误,为分割质量保证提供了有前景的框架。
Comments Submitted to the MICCAI 2026 UNSURE Workshop
ChebBooster:一种基于切比雪夫启发式外推的无训练高效扩散Transformer推理方法
机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) ; School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)
AI总结 本文提出无训练外推框架ChebBooster,基于切比雪夫多项式理论解耦为离线预计算与轻量在线阶段,在三种DiT模型上实现最高3.68倍延迟加速,优于现有无训练基线。