Perception-Aware Policy Optimization for Multimodal Reasoning
面向多模态推理的感知意识策略优化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出PAPO算法,通过引入隐式感知损失提升多模态推理性能,实现4.4%-17.5%的基准提升,尤其在视觉依赖性强的任务中表现更佳。
高校专区
面向多模态推理的感知意识策略优化
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出PAPO算法,通过引入隐式感知损失提升多模态推理性能,实现4.4%-17.5%的基准提升,尤其在视觉依赖性强的任务中表现更佳。
迈向多范数训练的通用认证鲁棒性
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出CURE框架,通过多范数训练方法提升模型对多种扰动的鲁棒性,实验显示在多个数据集上提升了联合鲁棒性。
Comments Accepted by TMLR 2026
面对动态个体偏好:通过配对微调解决冲突的人类价值观
机构 * Rutgers University—New Brunswick(罗杰斯大学—新布伦斯维克分校) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出Preference-Paired Fine-Tuning框架,通过Value Conflict Dilemma数据集解决动态个体偏好冲突问题,实验显示其在多选分类和开放生成任务中表现优异,优于传统方法。
Comments 20 pages, 13 figures
Thought-Retriever: 不只是检索原始数据,为记忆增强型智能体检索思想
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出Thought-Retriever,一种无需受上下文长度限制的算法,使LLM能基于任意长外部数据生成输出。通过利用历史查询生成的中间响应,构建长期记忆,提升回答能力。
Journal ref Transactions on Machine Learning Research (TMLR), 04/2026
知识并非静态:面向语言模型的顺序感知超图RAG
机构 * Texas A&M University(德克萨斯大学A&M分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; The University of Kansas(堪萨斯大学)
AI总结 本文提出顺序感知超图RAG(OKH-RAG),通过将顺序作为结构属性,改进传统RAG方法,提升对顺序敏感任务的推理能力。
通过ArcDeck实现叙事驱动的论文到幻灯片生成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Middle East Technical University(中东技术大学)
AI总结 本文提出ArcDeck框架,通过结构化叙事重建任务提升论文到幻灯片生成的逻辑连贯性,引入ArcBench基准测试,实验表明显式话语建模与角色特定代理协调显著提升生成演示的叙事流畅度和逻辑性。
Comments Project webpage: https://arcdeck.org/
DRPG(分解、检索、计划、生成):一种用于学术反驳的代理框架
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出DRPG框架,通过分解评审、检索证据、计划反驳策略和生成回应四个步骤,提升学术反驳的自动化水平,实验表明其性能超越现有方法并达到人类水平。
验证的多样性:理解大型语言模型中的验证动态
机构 * Salesforce AI Research(Salesforce AI研究院) ; Dartmouth College(达特茅斯学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 研究大型语言模型中验证动态,分析问题难度、生成器能力及验证器生成能力三个维度,发现验证有效性与问题难度相关,优化TTS应用中的基本验证策略。
Comments ICLR 2026