arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 257 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 257 篇

2506.01692 2026-07-13 cs.AI cs.LG 版本更新 88%

A Descriptive and Normative Theory of Human Beliefs in RLHF

基于人类反馈强化学习中的人类信念描述性与规范性理论

Sylee Dandekar, Shripad Deshmukh, Frank Chiu, W. Bradley Knox, Scott Niekum

机构 * College of Information and Computer Sciences University of Massachusetts Amherst(信息与计算机科学学院 马萨诸塞大学阿姆赫斯特分校) Department of Computer Science The University of Texas at Austin(计算机科学系 德州大学奥斯汀分校)

专题命中 后训练与偏好优化 :RLHF(title,summary_cn);分类 cs.AI、cs.LG

AI总结 研究 RLHF 中人类信念作用,提出新偏好模型,通过人类和综合实验,证实人类对智能体能力信念影响偏好,指出减少信念与能力不匹配可提升 RLHF 并给出新实践方向。

Comments Published at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07468 2026-07-07 cs.LG cs.CL cs.MA 版本更新 88%

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型

Mickel Liu, Liwei Jiang, Yancheng Liang, Simon Shaolei Du, Yejin Choi, Tim Althoff, Natasha Jaques

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01561 2026-06-16 cs.AI cs.LG 版本更新 88%

S-SPPO: Semantic-Calibrated Self-Play Preference Optimization

S-SPPO:语义校准的自对弈偏好优化

Xiwen Chen, Wenhui Zhu, Jingjing Wang, Peijie Qiu, Zhipeng Wang, Huayu Li, ZhengXiao He, Xuanzhao Dong, Prayag Tiwari, Mingkun Xu, Yujian Xiong, Feng Luo, Abolfazl Razi, Brendan Hogan Rappazzo, Anderson Schneider, Yuriy Nevmyvaka

机构 * University of Arizona, USA(亚利桑那大学) Arizona State University, USA(亚利桑那州立大学) Now at Google LLC, work done at Rice University(现就职于谷歌公司,曾就职于里士大学) Clemson University, USA(克莱姆森大学) Washington University in St. Louis, USA(圣路易斯华盛顿大学) Halmstad University, Sweden(哈姆斯塔德大学) Guangdong Institute of Intelligence Science and Technology, China(广东智能科学与技术研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对自对弈偏好优化(SPPO)中因偏好预测过度自信导致策略退化的问题,提出双空间语义校准框架S-SPPO,通过语义门控监督校准和潜在排斥表示校准,在保持博弈结构的同时提升对齐性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03077 2026-06-11 cs.LG cs.AI cs.DC 版本更新 88%

Libra: Efficient Resource Management for Agentic RL Post-Training

Libra:面向智能体强化学习后训练的高效资源管理

Kaiwen Chen, Xin Tan, Jingzong Li, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hang Seng University of Hong Kong (2018)(香港恒生大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对智能体强化学习中长尾、非平稳工作负载带来的资源管理挑战,提出Libra系统,通过周期性全局资源规划器和因果驱动多级反馈队列调度器,实现GPU分配优化和请求调度,最高提升3倍吞吐量和2.5倍收敛速度。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24937 2026-07-28 cs.AI cs.CL cs.IR cs.LG 版本更新 88%

The Hitchhiker's Guide to Agentic AI: From Foundations to Systems

《智能体AI的搭车指南:从基础到系统》

Haggai Roitman

机构 * Haggai Roitman

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。

Comments version 1.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06343 2026-06-10 cs.LG cs.AI cs.CL 版本更新 88%

When Distance Distracts: Representation Distance Bias in BT-Loss for Reward Models

当距离干扰:BT损失中表示距离偏差对奖励模型的影响

Tong Xie, Andrew Bai, Yuanhao Ban, Yunqi Hong, Haoyu Li, Cho-Jui Hsieh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 分析BT损失中表示距离导致的梯度偏差,提出NormBT自适应归一化方案,提升奖励模型在细粒度区分上的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13434 2026-07-29 cs.CL 版本更新 87%

$M^2PO$: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation

$M^2PO$:用于机器翻译的多视角多对偏好优化

Hao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, xiangxiang Zeng, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对机器翻译中主流方法受误导性奖励信号影响的问题,提出$M^2PO$框架,通过双视角机制和多对目标优化偏好,实验证明该框架能使模型性能提升,超越开源基线并接近专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13952 2026-07-16 cs.SD cs.AI eess.AS 版本更新 87%

LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement

基于大语言模型的强化学习音频视觉语音增强

Chih-Ning Chen, Jen-Cheng Hou, Hsin-Min Wang, Shao-Yi Chien, Yu Tsao, Fan-Gang Zeng

机构 * Department of Electrical Engineering, National Taiwan University, Taiwan(台湾大学电子工程系) Research Center for Information Technology Innovation, Academia Sinica, Taiwan(中央研究院资讯科技创新研究中心) Center for Hearing Research, University of California Irvine, USA(加州大学尔湾分校听力研究中心)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的可解释奖励模型的音频视觉语音增强框架,利用语言模型生成语音增强的自然语言描述,并通过情感分析模型转换为评分作为PPO奖励,提升语音质量评估效果。

Comments 6 pages, 4 figures, Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00327 2026-06-25 cs.IR cs.AI 版本更新 87%

DynamicPO: Dynamic Preference Optimization for Recommendation

DynamicPO:基于推荐的动态偏好优化

Xingyu Hu, Kai Zhang, Jiancan Wu, Shuli Wang, Chi Wang, Wenshuai Chen, Yinhua Zhu, Haitao Wang, Xingxing Wang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Meituan(美团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DynamicPO框架,通过动态边界负样本选择和双边距动态beta调整,解决偏好优化崩溃问题,提升推荐准确性。

Comments DASFAA 2026 Best Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06133 2026-08-04 cs.SE cs.AI cs.LG cs.LO 版本更新 87%

TLA-Prover: Verifiable TLA+ Specification Synthesis via Preference-Optimized Low-Rank Adaptation

TLA-Prover: 通过偏好优化低秩适配实现可验证的 TLA+ 规范合成

Eric Spencer, Arslan Bisharat, Brian Ortiz, Khushboo Bhadauria, Mujtaba Nazari, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约拉芝加哥大学计算机科学系)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出 TLA-Prover 模型,结合监督微调和基于修复的组相对策略优化,在 TLC 模型检查器上实现 TLA+ 规范合成,Gold/Diamond 级别通过率达 30%,约为未调优基线的 3.5 倍。

Comments 12 pages, 5 tables, 3 figures. In Proceedings at the 21st International Conference on Software Technologies (ICSOFT 2026)

Journal ref ICSOFT 2026, pp. 627-636, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08048 2026-07-07 cs.IR cs.AI cs.CL 版本更新 87%

TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance

TaoSR-AGRL:用于电子商务搜索相关性的自适应引导强化学习框架

Jianhui Yang, Yiming Jin, Pengkun Jiao, Chenhe Dong, Zerui Huang, Shaowei Yao, Xiaojiang Zhou, Dan Ou, Haihong Tang

机构 * Tsinghua University(清华大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 电商搜索中查询-产品相关性预测很关键,现有方法有局限。提出TaoSR-AGRL框架,通过规则感知奖励塑造和自适应引导重放两大创新,提升模型推理能力,在实验中表现优于基线,已成功部署。

Comments Accepted to The Web Conference (WWW) 2026, Industry Track, Oral

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), 2026, pp. 7955-7966

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03070 2026-06-24 cs.LG cs.AI 版本更新 87%

ASymPO: Asymmetric-Scale Policy Optimization for Asynchronous LLM Post-Training Without Behavior Information

ASymPO: 用于异步大语言模型后训练的非对称尺度策略优化(无需行为信息)

Zehua Liu, Yuxuan Yao, Xiaojin Fu, Tao Zhong, Mingxuan Yuan

机构 * Huawei Technologies(华为技术)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);分类 cs.AI、cs.LG

AI总结 针对异步强化学习中陈旧响应导致的分布漂移问题,提出非对称尺度策略优化(ASymPO),通过归一化每个响应的令牌损失来恢复零和平衡,无需行为策略概率。

Comments incorrect proofs in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08494 2026-08-12 cs.CV 版本更新 87%

Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation

面向临床增强型医疗报告生成的语言对齐与视觉 grounded 的偏好优化

Qiang Hu, Yuxuan Luo, Yingjie Guo, Hao Wang, Qimei Wang, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 针对现有医疗报告生成方法的临床事实错误与视觉-语言对齐不足问题,提出DPO-Clin框架,通过ECD模块、M²DPO及反事实偏好数据构建提升模型可靠性,在多医学数据集上取得优异性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09207 2026-08-06 cs.DC 版本更新 87%

Bidirectional Resource Scheduling for Disaggregated and Asynchronous RL Post-Training

用于解耦和异步强化学习后训练的双向资源调度

Zhiqiang Tan, Maoxin Wang, Sijie Wang, Yiming Yin, Qiang Wang, Xiaowen Chu, Shaohuai Shi

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文针对不同RL设置和工作负载下资源常空闲的问题,提出BiDiRL架构,通过开发热切换运行时、基于时间性能建模的规划器及双向调度器,减少资源空闲,在32-GPU测试平台上显著提高RL训练吞吐量。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05547 2026-08-06 cs.CL cs.AI cs.LG 版本更新 87%

Multi-Task GRPO: Reliable LLM Reasoning Across Tasks

多任务GRPO:跨任务的可靠大语言模型推理

Shyam Sundhar Ramesh, Xiaotong Ji, Matthieu Zimmer, Sangwoong Yoon, Zhiyong Wang, Haitham Bou Ammar, Aurelien Lucchi, Ilija Bogunovic

机构 * UCL Department of EEE(伦敦大学学院电子工程系) UCL Centre for AI(伦敦大学学院人工智能中心) Huawei Noah’s Ark Lab(华为诺亚实验室) UNIST Graduate School of AI(延世大学人工智能研究生院) University of Edinburgh(爱丁堡大学) University of Basel(巴塞尔大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MT-GRPO算法,通过动态调整任务权重和比例保持采样器,提升多任务场景下大语言模型的可靠推理性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00846 2026-07-08 cs.CL 版本更新 86%

Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模

Zicheng Kong, Dehua Ma, Zhenbo Xu, Alven Yang, Yiwei Ru, Haoran Wang, Zixuan Zhou, Fuqing Bie, Liuyu Xiang, Huijia Wu, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ShiFang Technology Inc.(ShiFang科技公司)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09910 2026-06-25 cs.CL 版本更新 86%

Learning to Erase Private Knowledge from Multi-Documents for Retrieval-Augmented Large Language Models

学习从多文档中擦除私有知识以用于检索增强型大语言模型

Yujing Wang, Jinwen Chen, Hainan Zhang, Liang Pang, Yongxin Tong, Binghui Guo, Hongwei Zheng, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) School of Artificial Intelligence, Beihang University, China(北京航空航天大学人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究所) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院)

专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL

AI总结 提出Eraser4RAG,通过构建全局知识图谱、划分私有与公共子图并微调Flan-T5重写文档,结合PPO优化,有效擦除用户定义的私有知识,保留公共知识,防御去匿名化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04477 2026-06-23 cs.LG 版本更新 86%

Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

基于数据的探索:面向人类反馈的在线强化学习

Zhen-Yu Zhang, Yuting Tang, Jiandong Zhang, Lanjihong Ma, Masashi Sugiyama

机构 * Center for Advanced Intelligence Project, RIKEN(日本理化学研究所先进智能研究中心) Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院) Northeastern University(东北大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出数据依赖探索的偏好优化方法(DEPO),利用历史数据构建不确定性奖励,鼓励探索高价值区域,理论证明其数据依赖的遗憾界更紧,实验表明样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20083 2026-07-24 cs.LG cs.AI 版本更新 86%

Co-Evolving LLM Evaluators and Policies via DynamicRubric

通过动态评分标准共同进化大语言模型评估器和策略

Beining Wang, Weihang Su, Hongtao Tian, Hao Kong, Tao Yang, Ting Yao, Qingyi Pan, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于评估器反馈优化大语言模型时因策略改进导致的优化瓶颈问题,提出DynamicRubric框架,通过生成加权评分标准项实现评估器与策略共同进化,实验证明该框架提升了评估器性能及策略效果,并已成功应用于微信搜索。

Comments add online model info (approved)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18239 2026-07-24 cs.LG cs.AI 版本更新 86%

Towards Disentangled Preference Optimization Dynamics: Suppress the Loser, Preserve the Winner

朝着解耦偏好优化动态:压制失败者,保留胜利者

Wei Chen, Yubing Wu, Junmei Yang, Delu Zeng, Qibin Zhao, John Paisley, Min Chen, Zhou Wang

机构 * South China University of Technology(南方科技大学) Columbia University(哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出奖励校准方法,通过解耦带宽条件实现压制失败者并保留胜利者的优化动态,提升了下游性能。

Journal ref International Conference on Machine Learning(ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20140 2026-07-13 cs.AI cs.LG 版本更新 86%

HiPO: Hierarchical Preference Optimization for Adaptive Reasoning in LLMs

HiPO:用于大语言模型自适应推理的分层偏好优化

Darsh Kachroo, Arjun Prasaath Anbazhagan, Adriana Caraeni, Brennan Lagasse, Kevin Zhu

机构 * Vellore Institute of Technology(维洛雷理工学院) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Northwestern University(西北大学) Yale University(耶鲁大学) Algoverse AI Research(Algoverse AI研究)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HiPO通过分层优化提升大语言模型在复杂推理任务中的表现,结合偏好优化与结构化推理的优势,实现更高效的训练和更一致的输出。

Comments 12 pages, 4 figures, 6 tables. Includes ablation study across Qwen2.5-7B-Instruct and Llama-3.1-8B-Instruct on 5 math reasoning benchmarks (GSM8K, MATH500, Minerva, AIME24, Gaokao2023). GPT-4.1 used for structured evaluation of reasoning quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04389 2026-06-23 cs.CL cs.AI 版本更新 86%

Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

安全并非普遍:大语言模型对齐中的选择性安全陷阱

Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho

机构 * Advanced Knowledge Center for Immersive Technologies(沉浸式技术先进知识中心) Federal University of Goiás(戈亚斯联邦大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究揭示大语言模型在安全对齐中的选择性安全陷阱,通过MiJaBench基准测试发现安全防御存在人口统计学层级差异,通过DPO优化实现跨群体的安全泛化。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18037 2026-07-07 cs.LG cs.AI cs.CL 版本更新 86%

Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards

梯度正则化减轻基于人类反馈和可验证奖励的强化学习中的奖励作弊

Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Mila(蒙特利尔大学Mila)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于人类反馈或可验证奖励的强化学习中奖励作弊问题,提出用梯度正则化使训练偏向奖励更准确区域,理论推导并实证验证,还改进方法,结果显示其比KL惩罚表现更好。

Comments Accepted at ICML 2026, 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16689 2026-06-23 eess.SP cs.NI 版本更新 86%

Against the Monolithic Wireless World Model: Why NextG Needs Composable and Agentic Intelligence

反对单一无线世界模型:为什么NextG需要可组合和代理智能

Aladin Djuhera, Farhan Ahmed, Vlad C. Andrei, Swanand Ravindra Kadhe, Alecio Binotto, Haris Gacanin, Holger Boche

专题命中 后训练与偏好优化 :LLM(summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文指出无线领域缺乏等同于LLM的数据基础,主张采用可组合和代理智能架构以实现可部署的AI原生网络。

Journal ref ICML 2026 Workshop on AI and ML for NextG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07315 2026-06-08 cs.CL cs.AI cs.LG cs.SE 版本更新 86%

SWE-IF: Aligning Code Evaluation with Human Preference

SWE-IF: 使代码评估与人类偏好对齐

Ming Zhong, Xiang Zhou, Ting-Yun Chang, Qingze Wang, Nan Xu, Xiance Si, Dan Garrette, Shyam Upadhyay, Jeremiah Liu, Jiawei Han, Benoit Schillings, Jiao Sun

机构 * Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SWE-IF基准,通过可验证指令分类法VeriCode评估代码指令遵循能力,发现指令遵循是区分LLM代码质量的关键,与功能正确性结合更能匹配人类偏好。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01715 2026-08-04 cs.AI 版本更新 85%

Distributionally Robust Listwise Preference Optimization

分布鲁棒列表偏好优化

Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

机构 * The University of Hong Kong(香港大学) Yale University(耶鲁大学) Purdue University(普渡大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对列表偏好排序标签不确定性,提出点态全变差鲁棒Plackett-Luce目标,将内层最大化简化为排序,在离线和在线设置中均具有理论保证,实验表明能保持干净标签性能并提升噪声鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00025 2026-08-04 cs.CL 版本更新 85%

TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation

TAB-PO:面向Token关键结构化生成的具有Token级自适应障碍的偏好优化

Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Sreeraj Ramachandran, Elyas Irankhah, Aimee Kendall Roundtree

机构 * Yale University(耶鲁大学) Texas State University(德克萨斯州立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 针对结构化预测中偏好与拒绝对象仅少数token不同导致的梯度稀释和token侵蚀问题,提出基于混淆感知偏好构建和Token级自适应障碍的TAB-PO方法,在SciERC任务上显著提升关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13315 2026-07-23 cs.CL 版本更新 85%

Meta-Learning Preferences for Multilingual LLM Alignment

多语言语言模型对齐的元学习偏好

Jiaying Lin, Seongho Son, Nam Phuong Tran, Long Tran-thanh, Ilija Bogunovic, Debmalya Mandal

机构 * University of Warwick(华威大学) University College London(伦敦大学学院) University of Basel(巴塞尔大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对多语言环境下低资源语言对齐数据不足问题,提出元学习框架,利用其他语言偏好数据学习可转移初始化,经理论和实验验证,该方法在极低资源设置下比基线方法胜率最多提高28%,且在多场景表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02374 2026-07-15 cs.AI 版本更新 85%

DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models

DRIFTLENS: 测量个性化语言模型中记忆引发的推理漂移

Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract_cn);post-training(abstract);分类 cs.AI

AI总结 提出DRIFTLENS框架,通过将推理步骤映射到价值类别并比较有无用户属性记忆的轨迹,量化个性化语言模型中的推理漂移,发现记忆会引发中等至大的推理变化,且现有后训练方法仅部分缓解。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07150 2026-06-12 cs.LG cond-mat.mtrl-sci 版本更新 85%

PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design

PLaID++: 一种用于定向无机材料设计的偏好对齐语言模型

Andy Xu, Rohan Desai, Larry Wang, Ethan Ritz, Gabriel Hope

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 提出PLaID++,通过对称性感知的Wyckoff文本表示和温度缩放熵正则化,结合可验证奖励的强化学习,实现稳定、新颖且满足空间群属性的晶体生成,比先前方法效率提高约50%。

Comments Code available at https://github.com/andaero/PLaID, model weights at https://huggingface.co/HOPE-Lab-HMC/PLaID

详情

展开后加载摘要…

URL PDF HTML 收藏