arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 470 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 470 篇

2608.11787 2026-08-13 cs.CL cs.AI cs.LG 新提交 75%

GRPO for Financial Advice Generation: Outperforming Commercial LLMs under CATE Evaluation

用于金融建议生成的GRPO:在CATE评估下优于商用大语言模型

Ofir Ben Shoham, Shrutendra Harsola, Vignesh Subrahmaniam, Shravan Mohan, Yakov Gazman, Oded Vainas

机构 * Intuit(英图易(金融科技公司))

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究将金融建议生成建模为强化学习问题,用GRPO微调开放权重大语言模型,经独立于评判者的CATE审计,其毛利润提升约为最强商用基线的两倍,表现优于商用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04788 2026-08-06 cs.LG cs.AI cs.CL 新提交 75%

Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

带有观测校准自蒸馏的智能体强化学习

Yi Yang, Cong Qin, Xiaodan Liu, Chishui Chen, Qing Dong, Yan Zhang, Cao Liu, Zhao Yang, Lu Pan, Jiaye Lin, Yi Feng

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对智能体强化学习的混淆问题,提出OCSD方法,通过对比两类回放视图推导观测残差,在高不确定步骤调制GRPO更新,在三类任务和多模型规模上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交 75%

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01354 2026-08-04 cs.CV 新提交 75%

PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

PixVL:通过统一掩码-文本一致性循环进行像素级多模态大语言模型的自监督训练

Yicheng Xiao, Haoxuan Ma, Caorui Li, Yucheng Wu, Weijie Wang, Haoxiao Wang, Shuang Chen, Fan Yang, Haiyun Guo, Jinqiao Wang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 PixVL作为自监督后训练框架,通过统一掩码-文本一致性循环及语义验证等策略,解决像素级MLLMs的优化干扰问题,同时提升区域理解与分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28509 2026-07-31 cs.CV 新提交 75%

RefCaptioner: Multi-Reference Image-Grounded Video Captioning

RefCaptioner:多参考图像接地的视频字幕生成

Tengfei Liu, Yang Shi, Yuran Wang, Xiaohan Zhang, Yuqing Wen, Yuqi Tang, Qixun Wang, Zhuoran Zhang, Xuanyu Zhu, Weihong Lin, Xinlei Yu, Yujie Wei, Xinwei Long, Fengxiang Wang, Xinlong Chen, Yue Ding, Jialu Chen, Haotian Wang, Yuanxing Zhang

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出多参考图像接地的视频字幕生成新任务,构建语料库与MRVBench基准,提出RefCaptioner框架,实验证实其性能最优且生成字幕更忠实。

Comments https://github.com/pkucs-Ltf/RefCaptioner

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23963 2026-07-28 cs.SE 新提交 75%

RESTOR: Automated Test Oracle Generation for RESTful APIs via Reinforcement Learning

RESTOR:通过强化学习自动生成RESTful API的测试预言机

Xun Zhou, Zhen Dong, Mingyu Ren, Qiang Li, JunJie Li, Sifan Wang, Xiaolong Yu, Chaofeng Sha, Xin Peng

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对RESTful API测试中定义可靠测试预言机的挑战,Restor框架利用强化学习,通过数据增强管道微调大语言模型生成测试断言,在工业数据集和生产工作流程中表现出色,提升测试用例采用率并减少人工QA工作。

Comments Accepted to ISSTA 2026. 22 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08572 2026-07-10 cs.CV 新提交 75%

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

Switch-Reasoner:通过强化学习在多任务混合中学习何时思考

Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye

机构 * Wuhan University(武汉大学) Xiaomi Inc(小米公司) Wuhan University of Technology(武汉理工大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对多模态大语言模型在异构多任务中“先思考后回答”范式的低效及训练后学习何时思考不稳定的问题,提出基于GRPO的Switch-Reasoner框架,通过双层调节机制实现推理模式自适应选择,实验验证其能减少不必要推理并平衡准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07554 2026-07-09 quant-ph 新提交 75%

RubriQ: Rubric-Guided Group Relative Policy Optimization for Constraint-Aware Quantum Circuit Synthesis

RubriQ:用于约束感知量子电路合成的基于规则的组相对策略优化

Ziqing Guo, Ziwen Pan

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对量子电路合成瓶颈,RubriQ框架将其作为大语言模型代码生成任务,用组相对策略优化,以程序化规则为奖励函数,集成CUDA-Q模拟,在基准任务和量子处理器上表现出色,建立高性能计算驱动管道大规模生成容错电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23190 2026-07-09 eess.AS cs.SD 新提交 75%

FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech

FlowTTS-GRPO:基于流匹配的文本转语音的多目标奖励优化的在线强化学习

Haoxu Wang, Biao Tian, Weiqin Li, Xiang Lv, Han Zhao, Xiangang Li

机构 * Tongyi Lab, Alibaba Group, China(通义实验室,阿里巴巴集团,中国)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出FlowTTS-GRPO在线强化学习框架,通过将ODE轨迹转换为SDE路径,直接微调流匹配模型,并采用加权奖励组合、省略无分类器引导等优化,在CosyVoice 3.0和F5-TTS上提升了说话人相似度和感知质量。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32038 2026-07-01 cs.CL cs.AI cs.LG 新提交 75%

Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision

内省耦合:尽管监督固定,自我解释训练仍追踪行为变化

Zifan Carl Guo, Laura Ruis, Jacob Andreas, Belinda Z. Li

机构 * MIT EECS(麻省理工学院电气工程与计算机科学系)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究训练语言模型生成解释时,固定反事实解释数据集如何使模型产生内省性解释,追踪自身行为变化,无需更新监督。

Comments 32 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27305 2026-06-26 cs.CV 新提交 75%

Sculpting NeRF Geometry: Human-Preference Fine-Tuning of a 3D-Aware Face GAN

雕刻NeRF几何:基于人类偏好的3D感知人脸GAN微调

Archer Moore, Mingming Gong, Liam Hodgkinson

机构 * School of Mathematics and Statistics, The University of Melbourne(墨尔本大学数学与统计学院)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);pretraining(abstract)

AI总结 提出直接对辐射场密度值进行人类偏好强化学习微调,无需网格或形状先验,显著改善3D人脸几何,在74.4%的成对比较中用户偏好微调后的几何。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08815 2026-06-09 cs.AI cs.CL cs.LG 新提交 75%

Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

推理的动量:策略优化中的密集内在信号

Hao Chen, Zhanming Shen, Liyao Li, Yanyu Chen, Xuhang Zhu, Xiaomeng Hu, Qi Zhang, Ru Peng, Xiaoyu Shen, Haobo Wang, Junbo Zhao

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Eastern Institute of Technology(东方理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对GRPO在长链推理中因二元奖励导致的零优势崩溃和幻觉确定性失败模式,提出ISPO方法,通过内在信号密集化奖励,在三个基模型和五个数学推理基准上持续优于基线。

Comments 14 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28829 2026-08-03 cs.NI cs.LG 新提交 74%

When Unlearning Fails: Reliable Data Deletion under Post-Training in Agent Networks

当遗忘失效时:智能体网络后训练下的可靠数据删除

Zihao Ding, Jun Huang, Liang Dong

专题命中 后训练与偏好优化 :post-training(title);分类 cs.LG

AI总结 针对自改进联邦智能体网络后训练时数据删除易出现影响回声的问题,提出MUTE方法,经实验验证其可在保障任务效用的同时降低行为泄漏且通信开销更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12062 2026-08-13 cs.CL cs.AI 新提交 73%

Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations

偏好树优化:通过前瞻模拟增强面向目标的对话

Lior Baruch, Moshe Butman, Kfir Bar, Doron Friedman

机构 * Reichman University(赖希曼大学) School of Computer Science(计算机科学学院) School of Communications(传播学院)

专题命中 后训练与偏好优化 :preference optimization(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出偏好树优化(PTO)框架,结合带前瞻的偏好树与直接偏好优化(DPO),在动机访谈领域通过虚拟患者等模拟对话生成偏好数据,训练的对话智能体在关键指标上优于基线。

Comments 13 pages, 4 figures. Accepted at an ICLR 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11967 2026-08-13 cs.LG cs.AI 新提交 73%

LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

LoongReflect:通过全局视角蒸馏提升搜索智能体的长程反思能力

Zhixin Zhang, Xinke Jiang, Zhibang Yang, Weixuan Xu, Guohong Qiu, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LoongReflect是将反思表述为记忆控制策略的训练框架,通过双信号通道结合全局视角蒸馏与结果导向GRPO优化,在多跳检索增强生成和数学推理任务上提升了搜索智能体的长程反思能力。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01556 2026-08-04 cs.LG cs.AI 新提交 73%

Rethinking Personalized Reward Modeling for LLMs under Preference Heterogeneity via Group-Debiased Federated Learning

基于组去偏联邦学习的偏好异质性下大语言模型个性化奖励建模反思

Seongyoon Kim, Boryeong Cho, Jihwan Oh, Seokhyun Chung, Se-Young Yun

机构 * Institute of Engineering Research, Korea University(韩国大学工程研究所) Kim Jaechul Graduate School of AI, KAIST(韩国科学技术院金在哲人工智能研究生院) Industrial Management Engineering, Korea University(韩国大学产业管理工程学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大语言模型个性化奖励建模的偏好异质性问题,提出FedGD方法,通过组去偏的客户端采样抵消组不平衡影响,实现无需预先知晓潜在组的有效个性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00584 2026-08-04 cs.CV cs.AI cs.LG 新提交 73%

Element-Aware Group Learning for E-Commerce Image Generation

面向电商图像生成的元素感知组学习

Jingtong Chen, Jiahui Wang, Xue Zhao, ShaoGuo Liu, Minghao Li

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29363 2026-08-03 eess.AS cs.AI cs.LG cs.SD 新提交 73%

Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens

基于低帧率高维连续标记的稳定自回归语音生成

Yi Luo, Rongzhi Gu, Jixun Yao

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对自回归语音生成的序列长度、表征容量与长时稳定性平衡难题,本文提出Locodec编解码器与MP-ELD流匹配框架,实现高保真、高可预测性且稳定的长时语音合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28127 2026-07-31 cs.CL cs.LG q-fin.ST q-fin.TR 新提交 73%

FinSMART: Financial Sentiment Analysis for Algorithmic Trading through Market-Aligned Reinforcement Learning

FinSMART:基于市场对齐强化学习的算法交易金融情感分析

Giorgos Iacovides, Wuyang Zhou, Danilo Mandic

机构 * Imperial College London(帝国理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 FinSMART是首个基于市场对齐强化学习的金融情感分析框架,通过市场感知数据过滤与非对称交易奖励优化情感信号,在交易回报等指标上较基线提升220%,可自适应市场动态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27631 2026-07-31 cs.AI cs.CL 新提交 73%

ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

ReDiPPO:用于数学推理的参考引导值校准与差异感知标记重加权

Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对数学推理中PPO的标记级信用分配难题,ReDiPPO引入参考引导评判器并通过值估计差异重加权标记优势,提升值估计精度且优于PPO、DAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26862 2026-07-30 cs.LG cs.AI 新提交 73%

ReCo: Reweighting GRPO Against Distributional Concentration

ReCo:针对分布集中问题的GRPO重加权方法

Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO过度关注高概率响应导致推理覆盖度下降的问题,提出ReCo重加权方法,在多个数学推理基准上提升了大k值下的Pass@k表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22996 2026-07-28 cs.CL cs.AI 新提交 73%

Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning

超越直接回答:通过启发式强化学习将教育大语言模型调整为苏格拉底式引导者

Xiaokun Wang, Siyu Song, Wentao Liu, Xiaodong Zou

机构 * East China Normal University(华东师范大学) Shanghai Chuangjie Situo Information Technology Co., Ltd.(上海创杰思拓信息技术有限公司) Shanghai Normal University(上海师范大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对教育场景中LLMs直接作答问题,提出HeuristicEdu两阶段管道,经监督热身和GRPO,利用特定对话及启发式奖励训练Qwen2.5 - 7B,提升了支架有效性,降低关键词泄漏,表明规模并非引发苏格拉底行为的唯一因素。

Comments 12 pages, 2 figures, 5 tables; includes an appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21619 2026-07-27 cs.CL cs.AI 新提交 73%

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19331 2026-07-22 cs.LG cs.AI 新提交 73%

ISO: An RLVR-Native Optimization Stack

ISO:一种原生 RLVR 的优化栈

Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UIUC(伊利诺伊大学香槟分校) Emory University(埃默里大学) Together AI(联合人工智能公司) Recursive Superintelligence Inc(递归超级智能公司) ELLIS Institute Tübingen(图宾根埃利斯研究所)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究 RLVR 中缺失的优化层,提出等谱优化(ISO)框架,包括离线的 ISO-Merger 和在线的 ISO-Optimizer。通过光谱继承,在推理和编码任务中,用更少训练步骤提高准确率,为 RLVR 优化层问题提供了具体解决方案。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19313 2026-07-22 cs.LG cs.AI 新提交 73%

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18470 2026-07-22 cs.LG cs.AI 新提交 73%

RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts

RRPO:基于分层条件展开的参考相对策略优化

Yuxin Xiong, Xunyi Jiang, Rohan Surana, Xintong Li, Sheldon Yu, Nikki Lijing Kuang, Ryan A. Rossi, Jingbo Shang, Tong Yu, Julian McAuley, Junda Wu

机构 * University of California San Diego(加利福尼亚大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究提出RRPO,通过参考相对对比比较推广GRPO。用分层条件展开构建锚集,训练投影头定义对比优势,在策略优化中评估。不依赖任务真实验证器,在多种设置下有竞争力,优于弱监督基线,监督微调后有额外收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11172 2026-07-14 cs.AI cs.LG 新提交 73%

STAMP: Provenance-Guided Credit Assignment for Deep Search Agents

STAMP:深度搜索智能体的溯源引导信用分配

Ke Xu, Han Xu, Xinran Chen, Yuqian Wang, Zhixuan Li, Xiaojian Liu, Changwo Wu, Jianqiang Xia, Yuchen Li

机构 * Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究深度搜索智能体强化学习中奖励-信用不匹配问题,提出STAMP方法,通过基于参考的验证器和首次曝光归因确定信用,经符号保留优势调制注入信用,实验表明该方法能提升GRPO基线分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11053 2026-07-14 cs.CL cs.AI 新提交 73%

Flout at Your Own Risk: LLMs Struggle with Pragmatic Cooperativity Under Epistemic Asymmetry

自担风险:在认知不对称下大语言模型在语用合作方面存在困难

Hannah VanderHoeven, Abhijnan Nath, Nikhil Krishnaswamy

机构 * Situated Grounding and Natural Language (SIGNAL) Lab(情境基础与自然语言(SIGNAL)实验室)

专题命中 后训练与偏好优化 :post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在多方协作任务部分信息条件下的语用推理能力,形式化协作认知不对称概念,评估其作为说话者和倾听者合作能力,发现虽有一定语用能力但信息不完整时仍有挑战,部分失败模式与格赖斯准则违反有关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01490 2026-07-03 cs.LG cs.AI 新提交 73%

Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

不要让收益消失:解析强化学习中的策略梯度权重

Juliette Decugis, Sean O'Brien, Francis Bach, Gabriel Synnaeve, Taco Cohen

机构 * FAIR at Meta(Meta FAIR) Inria, Ecole Normale Supérieure(法国国家信息与自动化研究所,巴黎高等师范学院) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出FADE方法,通过动态调整优势函数的正负和难度权重,解决RL训练不稳定和多样性崩溃问题,在7B和32B模型上分别提前20k和2k步达到最佳pass@1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 73%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏