arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 33 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 33 篇

2606.22305 2026-06-23 cs.CL 新提交 91%

Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning

以合适的速度学习:自适应数据调度改进大语言模型强化学习

Zicheng Xu, Ruixuan Zhang, Yu-Neng Chuang, Xiuyi Lou, Hoang Anh Duy Le, Oren Gal, Alexander S. Szalay, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(莱斯大学) University of Haifa(海法大学) Workato University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对LLM强化学习后训练中均匀采样忽视数据语义和策略变化的问题,提出自适应数据调度框架ADS,通过语义聚类和策略边界样本选择实现双层级调度,在三个LLM和七个推理基准上平均准确率提升5.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17385 2026-06-23 cs.LG cs.AI 版本更新 91%

Strengthening LLMs for Tabular Prediction with Structural Priors

利用结构先验增强LLM在表格预测中的能力

Pengxiang Cai, Zihao Gao, Wanchen Lian, Guocong Li, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出PRPO方法,通过列排列不变性和两级优势估计将表格结构先验融入LLM后训练,使8B模型在139个OpenML数据集上达到与强监督基线竞争的性能,零样本设置下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10999 2026-06-23 cs.CL 版本更新 90%

KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering

KBQA-R1:强化大语言模型用于知识库问答

Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Shu Wu, Bowen Song, Zilei Wang, Weiqiang Wang, Liang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出KBQA-R1框架,通过强化学习(GRPO)将知识库问答建模为多轮决策过程,并引入参考拒绝采样(RRS)解决冷启动问题,在多个基准上取得最优性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23038 2026-06-23 cs.LG cs.AI 新提交 90%

EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

EvoRubrics:通过对抗性协同进化为LLM强化学习提供动态评分准则作为奖励

Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Zheng Li, Jinyang Zhang, Zhijing Wu, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Peking University Information Technology Institute, Tianjin Binhai(北京大学滨海信息技术研究院) Research Institute, GRGBanking Equipment Co., Ltd.(广电运通金融电子股份有限公司研究院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出EvoRubrics框架,通过策略LLM与评分准则生成器的对抗性协同进化,在训练中动态调整奖励标准,解决静态评分准则导致的奖励饱和与策略欺骗问题,实验表明其优于静态和动态基线,且自监督变体也能有效提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03058 2026-06-23 cs.LG cs.AI cs.CL 版本更新 90%

VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training

VRPO: 重新思考价值建模以实现大语言模型后训练中噪声监督下的鲁棒强化学习

Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Honor Device Co., Ltd(荣耀设备有限公司) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对强化学习中噪声监督导致策略不稳定问题,提出VRPO框架,通过熵和困惑度辅助损失及变分信息瓶颈增强价值模型,使其能过滤噪声并生成可靠优势估计,在多项任务上优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21090 2026-06-23 cs.AI cs.LG 新提交 89%

Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training

自我改进可能导致自我退化:LLM自我训练的兴起与崩溃失败模式

Jianzhe Lin

机构 * MetaAI

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM自我训练中pass@1先升后降的崩溃模式,发现非跨任务遗忘而是策略过度优化,提出CARE、ES和GRPO三种控制方法,在Qwen-2.5模型上验证效果。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21943 2026-06-23 cs.LG cs.AI 新提交 88%

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning

LLM上的模块化强化学习:从MDP创建到探索与学习

Zhao Yang, Yuxuan Jiang, Ting-Chih Chen, Lincen Yang, Annie Wong, Chao Gao, Jacob E. Kooi, Zhong Li, Jiayang Shi, Kevin Qiu, Qi Huang, Xinrui Zu, Shiping Yang, Hengyuan Zhang, Ngai Wong, Filip Ilievski, Shujian Yu, Aske Plaat, Zhaochun Ren, Mark Hoogendoorn, Vincent François-Lavet

机构 * VU Amsterdam(阿姆斯特丹自由大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Leiden University(莱顿大学) University of Warsaw(华沙大学) Simon Fraser University(西蒙菲莎大学) The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文系统梳理LLM后训练中的强化学习方法,从MDP构建、探索策略到学习范式,揭示当前方法分布不均,指出价值函数、离策略AC及自举法等领域存在研究空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21458 2026-06-23 cs.LG 新提交 88%

Post-Training Speech Enhancement Language Models with Perceptual Rewards

基于感知奖励的语音增强语言模型后训练

Frédéric Berdoz, Luca A. Lanzendörfer, Antonis Asonitis, Roger Wattenhofer

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 提出使用组序列策略优化(GSPO)结合多指标感知奖励对自回归语音增强语言模型进行后训练,直接优化非可微质量指标,在DNS2020基准上达到最优,且多奖励优化优于单指标变体。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21089 2026-06-23 cs.AI 新提交 87%

Repeated post-training is not Self-improving: Diagnosing Scientific Amnesia in Continual DPO Pipelines

重复后训练并非自我改进:诊断持续DPO流水线中的科学健忘症

Jianzhe Lin, Fei Wang, Xiaolin Li, Rajeshkumar Golani, Jubin Chheda

机构 * MetaAI

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title);分类 cs.AI

AI总结 针对工业LLM团队在持续DPO训练中遇到的性能退化问题,本文提出“科学健忘症”概念,并设计诊断套件、基于程序的流水线及基准测试,通过对比五种策略发现,结论高度依赖流水线设置和评估设计。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04477 2026-06-23 cs.LG 版本更新 86%

Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

基于数据的探索:面向人类反馈的在线强化学习

Zhen-Yu Zhang, Yuting Tang, Jiandong Zhang, Lanjihong Ma, Masashi Sugiyama

机构 * Center for Advanced Intelligence Project, RIKEN(日本理化学研究所先进智能研究中心) Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院) Northeastern University(东北大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出数据依赖探索的偏好优化方法(DEPO),利用历史数据构建不确定性奖励,鼓励探索高价值区域,理论证明其数据依赖的遗憾界更紧,实验表明样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04389 2026-06-23 cs.CL cs.AI 版本更新 86%

Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

安全并非普遍:大语言模型对齐中的选择性安全陷阱

Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho

机构 * Advanced Knowledge Center for Immersive Technologies(沉浸式技术先进知识中心) Federal University of Goiás(戈亚斯联邦大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究揭示大语言模型在安全对齐中的选择性安全陷阱,通过MiJaBench基准测试发现安全防御存在人口统计学层级差异,通过DPO优化实现跨群体的安全泛化。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16689 2026-06-23 eess.SP cs.NI 版本更新 86%

Against the Monolithic Wireless World Model: Why NextG Needs Composable and Agentic Intelligence

反对单一无线世界模型:为什么NextG需要可组合和代理智能

Aladin Djuhera, Farhan Ahmed, Vlad C. Andrei, Swanand Ravindra Kadhe, Alecio Binotto, Haris Gacanin, Holger Boche

专题命中 后训练与偏好优化 :LLM(summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文指出无线领域缺乏等同于LLM的数据基础,主张采用可组合和代理智能架构以实现可部署的AI原生网络。

Journal ref ICML 2026 Workshop on AI and ML for NextG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20740 2026-06-23 cs.CL cs.LG 新提交 82%

VeriBound: PAC-Bayesian Generalization Bounds for Process Reward Models Trained with Formal Verification Tools

VeriBound: 使用形式验证工具训练的过程奖励模型的PAC-Bayesian泛化界

Amirul Rahman, Mohammed Sabih Alsharari

机构 * University of Malaya(马来亚大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对形式验证工具标注的过程奖励模型(PRM)缺乏理论解释的问题,提出VeriBound框架,给出PAC-Bayesian泛化界、样本复杂度、收敛速率及下游Best-of-K性能的误差传播界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24551 2026-06-23 cs.CV 版本更新 82%

PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation

PhyGDPO: 物理感知的分组直接偏好优化以实现物理一致的文本到视频生成

Yuanhao Cai, Kunpeng Li, Menglin Jia, Jialiang Wang, Junzhe Sun, Feng Liang, Weifeng Chen, Felix Juefei-Xu, Chu Wang, Ali Thabet, Xiaoliang Dai, Xuan Ju, Alan Yuille, Ji Hou

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰霍普金斯大学) Meta BizAI(Meta商业人工智能)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract)

AI总结 提出PhyAugPipe构建大规模物理增强数据集PhyVidGen-135K,并设计PhyGDPO框架,利用分组Plackett-Luce模型和物理引导奖励机制,实现物理一致的文本到视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01624 2026-06-23 cs.CV 版本更新 82%

PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards

PISCES: 基于最优传输对齐奖励的无标注文本到视频后训练

Minh-Quan Le, Gaurav Mittal, Cheng Zhao, David Gu, Dimitris Samaras, Mei Chen

机构 * Microsoft(微软) Stony Brook University(石溪大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract)

AI总结 提出PISCES算法,通过双重最优传输对齐奖励模块,无需人工标注即可提升文本生成视频的质量和语义对齐,在VBench上超越现有方法。

Comments Accepted to ICML 2026. Project page and code: https://roar-ai.github.io/pisces/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22652 2026-06-23 cs.LG stat.ML 新提交 81%

A Markov Chain Approach to Preference Alignment

一种偏好对齐的马尔可夫链方法

Takuya Koriyama, Tengyuan Liang

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.LG

AI总结 提出MCHF方法,通过直接利用成对偏好定义马尔可夫核实现生成模型对齐,理论证明其几何收敛速度由非传递结构量决定,并与NLHF和RLHF方法建立统一视角。

Comments 48 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13154 2026-06-23 cs.CL 版本更新 81%

The Alignment Veto: How Safety Training Suppresses Cultural Knowledge in LLMs

对齐否决:安全训练如何压制LLM中的文化知识

Pardis Sadat Zahraei, Gokhan Tur, Dilek Hakkani-Tür, Ehsaneddin Asgari

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学)

专题命中 后训练与偏好优化 :LLM(title_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究对齐训练与语言模型编码的文化价值观冲突时的内部机制,发现模型内部logit分布仍反映人类调查数据,但输出被压制,称为“对齐否决”,并区分了压制失败与表征偏差失败,揭示了安全税在国家间的不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02451 2026-06-23 cs.LG cs.AI 版本更新 81%

Active Causal Experimentalist (ACE): Learning Intervention Strategies via Direct Preference Optimization

主动因果实验者 (ACE): 通过直接偏好优化学习干预策略

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学波德分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ACE框架,将实验设计建模为顺序策略,利用直接偏好优化从干预对比较中学习,在合成、物理和经济数据上以等干预预算取得70-71%的提升,并自主发现碰撞机制需集中干预父变量的理论策略。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22995 2026-06-23 cs.LG cs.AI cs.CL 新提交 80%

Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

组图策略优化用于长程智能体强化学习

Yunan Wang, Minghui Song, Zihan Zhang, Shaohan Huang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Peking University(北京大学) Microsoft Corporation(微软公司)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出G2PO算法,通过构建全局状态转移图并引入组聚合状态值估计和边中心优势估计,解决长程智能体强化学习中的奖励稀疏和信用分配粗粒度问题,在WebShop等基准上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07855 2026-06-23 cs.LG cs.AI cs.CL 版本更新 80%

DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)

DPO 解绑:你的训练算法在人类选择理论中实际上是解耦的(且其损失函数的凸性并非必需)

Wenxuan Zhou, Shujian Zhang, Brice Magdalou, John Lambert, Ehsan Amid, Richard Nock, Andrew Hard

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) Work done while at Google DeepMind(在谷歌深Mind的工作) CEE-M, Univ Montpellier, CNRS, INRAE, Institut Agro(CEE-M,蒙彼利埃大学,CNRS,INRAE,农业研究所)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了DPO与人类选择理论的深层联系,证明其损失函数凸性并非必需,并扩展了非凸损失、任意人类选择模型嵌入等新特性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12691 2026-06-23 cs.RO cs.AI 版本更新 79%

ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training

ALOE: 面向视觉-语言-动作模型后训练的动作级离策略评估

Rushuai Yang, Hecheng Wang, Zhichao Wu, Chiming Liu, Xiaohan Yan, Xuan Du, Shuoyu Yue, Chuheng Zhang, Yunlong Wang, Yongcheng Liu, Lizhe Qi, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Nanjing University(南京大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 提出ALOE框架,通过离策略评估直接估计当前策略的价值,结合分块时序差分和保守值聚合,改善稀疏奖励下的信用分配,在四项真实世界操作任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10310 2026-06-23 cs.AI cs.CY cs.HC q-bio.NC 版本更新 77%

Positive Alignment: Artificial Intelligence for Human Flourishing

积极对齐:人工智能促进人类繁荣

Ruben Laukkonen, Seb Krier, Chloé Bakalar, Shamil Chandaria, Morten Kringelbach, Adam Elwood, Daniel Ford, Fernando Rosas, Maty Bohacek, Matija Franklin, Nenad Tomašev, Stephanie Chan, Verena Rieser, Roma Patel, Michael Levin, Arun Rao

机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) Google DeepMind(谷歌DeepMind) LIFE OpenAI Anthropic University of California, Los Angeles(加州大学洛杉矶分校) Aily Labs(Aily实验室) Stanford University(斯坦福大学) Tufts University(塔夫茨大学) Positive AI Labs(积极AI实验室) Department of Informatics, University of Sussex(Sussex大学信息学系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02561 2026-06-23 cs.CV cs.AI 版本更新 77%

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

机构 * Stanford University(斯坦福大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Microsoft(微软公司)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。

Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)

Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21498 2026-06-23 cs.AI cs.LG 新提交 76%

Balancing Performance and Diversity in GRPO Autoregressive Text-to-Image Post-Training

平衡GRPO自回归文本到图像后训练中的性能与多样性

Yuanhao Chiang, Hongbo Duan, Chunru Yang, Jiahua Pei, Yi Liu, Xueqian Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG

AI总结 针对自回归文本到图像生成中人类偏好对齐问题,提出统一f-散度框架,理论分析不同散度对策略优化的影响,实验证明JS散度在性能与多样性间取得最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24198 2026-06-23 cs.CL cs.AI cs.CE cs.LG cs.MA 版本更新 75%

Rewarding the Scientific Process: Process-Level Reward Modeling for Agentic Data Analysis

奖励科学过程:面向代理数据分析的过程级奖励建模

Zhisong Qiu, Shuofei Qiao, Kewei Xu, Yuqi Zhu, Lun Du, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DataPRM,一种环境感知的生成过程奖励模型,通过主动验证和反思意识的三元奖励策略,提升动态数据分析任务中代理的性能,实验表明其在多个基准测试中表现优异。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21413 2026-06-23 cs.CL cs.LG 新提交 73%

CAT-Translate: Building Compact Open-Source Models for Japanese-English Translation

CAT-Translate: 构建用于日英翻译的紧凑型开源模型

Yuu Jinnai

机构 * CyberAgent

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 针对特定语言对开发专用翻译模型是否值得?本文通过两阶段监督微调和多目标GRPO训练紧凑型模型(0.8B-7B参数),在真实场景基准上超越大型多语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23595 2026-06-23 cs.AI 新提交 70%

SPIRAL: Learning to Search and Aggregate

SPIRAL: 学习搜索与聚合

Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li, Omar Shaikh, Yoonho Lee, Dorsa Sadigh, Chelsea Finn, Noah Goodman

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出SPIRAL框架,通过强化学习联合训练语言模型在推理时使用顺序推理、并行采样和聚合三种原语,实现端到端优化,显著提升推理计算扩展效率。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21830 2026-06-23 cs.LG 新提交 70%

Mat-Pref: Verifiable-Reward Training Improves Compositional Reasoning in Inorganic Materials

Mat-Pref: 可验证奖励训练提升无机材料中的组合推理能力

Sarrah R. Mikhail Leung, Taehan Kim, Jeongbin Park

机构 * University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 提出Mat-Pref基准,通过可验证奖励强化学习(GRPO)提升无机材料组合推理,在结构泛化和属性迁移上超越大模型。

Comments 10 pages, 4 figures, Accepted at ICML AI4Physics 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21045 2026-06-23 cs.CR cs.LG 新提交 57%

OVIG: Optimistic Verification of AI Training Integrity via Gradient Signals

OVIG: 通过梯度信号乐观验证AI训练完整性

Hongxu Su, Jianzhu Yao, Huan Zhang, Xuechao Wang, Pramod Viswanath

机构 * Princeton University(普林斯顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 提出OVIG框架,利用异构重放校准的梯度差异经验边界,通过乐观采样和步长参数审计外包训练完整性,在多种攻击下保持0%攻击成功率,存储和传输开销降低1996倍。

Comments 18 pages, 7 figures, 11 tables. Submitted to IEEE Symposium on Security and Privacy (S&P)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20244 2026-06-23 cs.CV cs.AI 新提交 57%

SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

SPOT-E:基于视觉聚光灯的冻结VLM测试时熵整形

Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑工业大学) Sagenic Tech Zhejiang University(浙江大学) vivo Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 提出SPOT-E方法,通过测试时熵整形和视觉聚光灯,解决VLM在证据密集型任务中因忽视局部关键证据而表现不佳的问题,无需重新训练即可提升定位与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏