Learn Hard Problems During RL with Reference Guided Fine-tuning
在强化学习中学习难题问题:基于参考的微调
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.LG
AI总结 ReGFT通过利用人类参考解决方案合成积极轨迹,提升RL在数学推理中的性能和训练效率。
Comments 15 pages, 5 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
在强化学习中学习难题问题:基于参考的微调
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.LG
AI总结 ReGFT通过利用人类参考解决方案合成积极轨迹,提升RL在数学推理中的性能和训练效率。
Comments 15 pages, 5 figures
迷失在翻译中:语言如何重新对齐视觉以实现跨物种病理学
机构 * Thomas Jefferson High School for Science and Technology(泰勒斯·杰弗里斯高中科学与技术学校)
专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过引入语义锚定机制,利用语言对齐解决跨物种病理学中的视觉-语言对齐问题,提升模型在跨物种任务中的性能。
Comments 27 pages, 6 figures, 7 tables. Code and data available at https://github.com/ekansh-arora0/cross-species-pathology
缺失的是:大型语言模型输出的可解释评分
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)
AI总结 本文提出WIM评分系统,通过自然语言反馈生成可解释的评分,提升大型语言模型输出的可解释性和学习信号质量。
Comments 22 pages
Dr. Seg: 通过感知导向设计重新审视GRPO训练用于视觉大语言模型
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 Dr.Seg通过感知导向设计重新审视GRPO训练,提出简单框架提升视觉任务性能
SAMPO-Path: 分段意图对齐的偏好优化用于病理基础模型分段
机构 * School of Biomedical Engineering and Technological Innovation, Fudan university, Shanghai, China.(生物医学工程与技术创新学院,复旦大学,上海,中国)
专题命中 后训练与偏好优化 :foundation model(title,abstract);preference optimization(title,abstract)
AI总结 SAMPO-Path通过偏好优化框架提升病理图像分割的准确性和临床意图一致性。
Comments 15 pages, 9 tables, 8 figures
VISA: 通过屏蔽适应进行价值注入以实现个性化大语言模型对齐
机构 * Peking University(北京大学)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 VISA通过屏蔽适应机制,有效缓解大语言模型对齐税,实现精细化价值观对齐与语义完整性保持。
OPPO: 通过管道重叠加速基于PPO的RLHF
机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 OPPO通过管道重叠技术提升基于PPO的RLHF训练效率,加速训练过程并提高GPU利用率
OSPO: 以对象为中心的自我改进偏好优化用于文本到图像生成
机构 * Korea University(韩国大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)
AI总结 OSPO通过自构造对象中心偏好数据和对象加权损失,提升文本到图像生成中对象级对齐和保真度,优于现有自我改进方法和专门扩散模型。
Comments 11 pages, 6 figures
BandPO: 通过概率感知边界弥合信任区域与比率裁剪用于大语言模型强化学习
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 BandPO通过概率感知边界解决大语言模型强化学习中的探索瓶颈,提升性能并缓解熵崩溃问题。
Comments Code available at https://github.com/OpenMOSS/BandPO.git
SarcasmMiner:一种双轨后训练框架,用于鲁棒的音频视觉讽刺推理
机构 * Speech Technology Lab, University of Groningen, The Netherlands(格罗宁根大学语音技术实验室,荷兰) ; Center for Language and Cognition, University of Groningen, The Netherlands(格罗宁根大学语言与认知中心,荷兰)
专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL
AI总结 SarcasmMiner通过双轨蒸馏和组相对策略优化提升多模态讽刺检测性能,实现F1值显著提升。
当弱大语言模型自信发言时,偏好对齐会变得更强大
机构 * EPFL(苏黎世联邦理工学院) ; Sharif University of Technology(谢赫·穆吉加布大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 本文提出CW-PO框架,利用弱LLM的置信度加权实现更高效的偏好对齐,仅用20%的人类标注即可超越传统方法。
Comments 32 pages, 8 figures, International Conference on Learning Representations 2026
基于强化学习后训练的混合奖励:注入经典动作顺序
机构 * University of Michigan(密歇根大学)
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出在强化学习后训练中引入混合奖励,通过结合稀疏任务奖励和顺序奖励,提升模型对经典求解顺序的适应能力,无需修改监督数据或架构。
用偏好替代参数:异构视觉-语言模型的联邦对齐
专题命中 后训练与偏好优化 :language model(title);foundation model(abstract);分类 cs.AI
AI总结 本文提出MoR框架,通过用偏好替代参数实现异构视觉-语言模型的联邦对齐,提升泛化、鲁棒性和跨客户端适应性。
Comments Due to the need for substantial revisions, the authors believe that the paper should be retracted first.A revised version may be resubmitted
为什么RLHF对齐是浅层的?一种梯度分析
机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)
专题命中 后训练与偏好优化 :RLHF(title);分类 cs.CL、cs.LG
AI总结 本文通过梯度分析揭示RLHF对齐浅层的原因,提出有害信息概念并设计新的目标以实现深层对齐。
CoRPO:在GRPO中添加正确性偏差以提高泛化能力
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 CoRPO通过引入正确性偏差改进GRPO,提升模型在跨领域任务中的泛化能力与推理稳定性。
VRM:教奖励模型理解真实人类偏好
机构 * Southeast University, Nanjing, China(东南大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 VRM通过建模人类偏好判断的评估过程,利用变分推断技术提升对真实人类偏好的捕捉能力。
VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Microsoft Research(微软研究院)
专题命中 后训练与偏好优化 :SFT(abstract);preference optimization(abstract);分类 cs.LG
AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。
Comments Accepted to ICLR 2026
超越前缀:基于图记忆的交叉注意力用于大型语言模型的知识图谱补全
机构 * Peking University(北京大学) ; Dalian University of Technology(大连理工大学) ; King’s College London(伦敦国王学院) ; Peng Cheng Laboratory(鹏城实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文提出图记忆调优方法,通过深度交叉注意力机制提升大型语言模型在知识图谱补全任务中的表现。
INMS: 基于大语言模型的智能体中的记忆共享
机构 * Rutgers University(罗格斯大学)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 INMS通过异步交互范式实现多智能体间的动态记忆共享,提升开放性场景下的智能体性能。
加性多步马尔可夫链与大语言模型中维度灾难
机构 * A. Ya. Usikov Institute for Radiophysics and Electronics Ukrainian Academy of Science(A. Ya. Usikov 无线电物理与电子研究所 乌克兰科学院)
专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL
AI总结 本文提出加性多步马尔可夫链模型,用于近似大语言模型动态,通过分解条件概率减少高阶马尔可夫过程的组合爆炸问题。
Comments 10 pages, 3 figures
ReFusion:一种具有并行自回归解码的扩散大语言模型
专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG
AI总结 ReFusion通过整合序列重组到因果注意框架中,实现并行解码和高效生成,显著提升性能和速度,缩小与传统自回归模型的差距。
MioHint: 利用大语言模型进行白盒API测试
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 MioHint利用大语言模型提升白盒API测试效率,实现更高的代码覆盖和突变准确性
Comments Accepted by ICSE 2026 (research track)
自适应记忆准入控制用于大语言模型代理
机构 * Workday AI
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI
AI总结 提出自适应记忆准入控制框架,通过分解记忆价值因素提升大语言模型代理的长期记忆管理效率与可靠性。
僵尸代理:通过自我强化注入实现自我演化大语言模型代理的持续控制
机构 * School of Computing National University of Singapore(计算学院新加坡国立大学)
专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI
AI总结 研究提出僵尸代理攻击,通过自我强化注入实现对自我演化大语言模型代理的持续控制,揭示内存演化可将一次间接注入转化为持久妥协,表明单一会话提示过滤防御不足。
Comments Published as a workshop paper in Lifelong Agent @ ICLR 2026
LLEMA:基于LLM的多目标材料发现进化搜索
机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) ; Center of Integrated Nanotechnologies, Sandia National Laboratories(桑迪亚国家实验室集成纳米技术中心)
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 LLEMA结合大语言模型与进化规则,通过多目标优化提升材料发现效率,实现高命中率和稳定性质的候选材料生成。
Comments ICLR 2026
GIT-BO:基于表格基础模型的高维贝叶斯优化
专题命中 长上下文与记忆 :foundation model(title,abstract)
AI总结 GIT-BO通过结合表格基础模型和主动子空间机制,在高维空间中实现更高效的贝叶斯优化,优于现有GP方法。
超越上下文窗口:基于事实的记忆与长上下文LLM在持久代理中的成本性能分析
机构 * Bricks Technology
专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文比较了基于事实的记忆系统与长上下文LLM在持久代理中的性能,发现记忆系统在成本上更具优势,尤其在长上下文下更经济。
Comments 15 pages, 1 figure
VSPrefill:用于长上下文预填充的垂直斜线稀疏注意力与轻量级索引
机构 * School of Computer Science and Technology(计算机科学与技术学院)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 VSPrefill通过轻量级索引和垂直斜线结构提升长上下文预填充效率,实现高精度与高速度的平衡。
通过无答案上下文进行查询消歧:在人类最后一场考试中性能翻倍
机构 * National Institute of Standards and Technology(国家标准与技术研究院) ; University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 长上下文与记忆 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 通过无答案上下文重写问题以减少歧义,显著提升模型在Humanity's Last Exam上的准确性。
FlashAttention-4:异构硬件扩展下的算法与内核流水线协同设计
机构 * Princeton University(普林斯顿大学) ; Meta ; Colfax Research(Colfax研究公司) ; NVIDIA(NVIDIA公司) ; Georgia Tech(佐治亚理工学院) ; Together AI
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 FlashAttention-4通过异构硬件扩展下的算法与内核流水线协同设计,提升B200 GPU上的注意力计算效率。