arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-01 至 2026-07-01 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 16 篇

2606.31309 2026-07-01 cs.CR cs.AI cs.LG 新提交 93%

CSO-LLM: Class Subspace Orthogonalization for Post-Training Backdoor Detection and Trigger Inversion in LLMs

CSO-LLM:用于LLM训练后后门检测与触发器反转的类子空间正交化

Zhengxing Li, David J. Miller, Guangmingmei Yang, George Kesidis

机构 * Penn State University(宾夕法尼亚州立大学) Anomalee Inc.(Anomalee公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 提出CSO框架,通过类子空间正交化增强LLM后门检测的敏感性和特异性,并实现隐式黑名单功能,在连续和离散空间中均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31252 2026-07-01 cs.AI 新提交 92%

Embodied CAD: Solver-Grounded LLM Agents for Parametric B-Rep Assembly Modeling

具身CAD:基于求解器的LLM代理用于参数化B-Rep装配建模

Fumin Liu, Haoyu Zhou, Fei Hao, Lin Yang

机构 * Nanjing University(南京大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Embodied CAD框架,通过分层技能库和求解器反馈,让LLM代理迭代生成并修复参数化B-Rep装配模型,实现高可执行率和任务完成率。

Comments This paper contains 12 pages, 7 figures. This is an original unpublished manuscript submitted to the arXiv preprint server, with no prior publication or conference presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10895 2026-07-01 cs.AI 版本更新 90%

LLM-Empowered Agentic MAC Protocols: A Dynamic Stackelberg Game Approach

LLM赋能的智能MAC协议:一种动态Stackelberg博弈方法

Renxuan Tan, Rongpeng Li, Fei Wang, Chenghui Peng, Shaoyun Wu, Zhifeng Zhao, Honggang Zhang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院) Huawei Technologies Company Ltd.(华为技术有限公司) Zhejiang Lab(之江实验室) Zhejiang University(浙江大学) Macau University of Science and Technology(澳门科技大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种博弈论LLM赋能的多智能体深度强化学习框架,将上行传输建模为动态多追随者Stackelberg博弈,通过PPO协调LLM驱动代理合成自适应语义MAC协议,实现无需重训的泛化,吞吐量提升77.6%,公平性提升65.2%。

Comments This work has been submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29805 2026-07-01 cs.CV 版本更新 85%

Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation

更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO AI中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12893 2026-07-01 cs.CV cs.AI cs.LG cs.NE stat.ML 版本更新 84%

Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models

文本到图像模型强化学习后训练的有限差分流优化

David McAllister, Miika Aittala, Tero Karras, Janne Hellsten, Angjoo Kanazawa, Timo Aila, Samuli Laine

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种在线强化学习变体,通过采样配对轨迹并将流速度拉向更优图像方向来降低模型更新方差,将整个采样过程视为单一动作,实现更快的收敛和更高的输出质量与提示对齐。

Comments Code available at https://github.com/NVlabs/finite-difference-flow-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30851 2026-07-01 cs.CL cs.AI cs.DB 新提交 82%

Test-Time Verification for Text-to-SQL via Outcome Reward Models

基于结果奖励模型的文本到SQL测试时验证

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommaso Di Noia

机构 * Polytechnic University of Bari(巴里理工大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出结果奖励模型(ORM)作为学习型语义评分函数,用于Text-to-SQL的测试时验证,通过自动化候选生成和执行标签训练ORM,在BIRD和Spider基准上优于执行优先和多数投票方法。

Comments Accepted to the SURGeLLM Workshop at ACL 2026, San Diego, US

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31575 2026-07-01 cs.AI 新提交 81%

Which Tokens Matter? Adaptive Token Selection for RLVR with the Relative Surprisal Index

哪些Token重要?基于相对惊讶指数的自适应Token选择用于RLVR

Outongyi Lv, Yanzhao Zheng, Yuanwei Zhang, Zhenghao Huang, Xingjun Wang, Baohua Dong, Hangcheng Zhu, Yingda Chen

机构 * ModelScope Team(ModelScope团队) Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出相对惊讶指数(RSI)度量,通过自适应Token过滤方法RSI-S解决RLVR中高熵与低概率Token的矛盾,在AIME和AMC基准上提升avg@32准确率2-3个百分点。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01682 2026-07-01 cs.CL 版本更新 81%

The Bidirectional Process Reward Model

双向过程奖励模型

Lingyin Zhang, Jun Gao, Xiaoxue Ren, Ziqiang Cao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Biomedical Basic Research Center of Jiangsu, Soochow University(苏州大学江苏省生物医学基础研究中心) School of Software Technology, Zhejiang University(浙江大学软件学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出双向过程奖励模型(BiPRM),通过并行左右评估流和门控机制融合分数,仅增加0.3%参数和5%延迟,在推理质量上平均提升10.6%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17461 2026-07-01 cs.CV 版本更新 80%

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

AR-CoPO: 利用对比策略优化对齐自回归视频生成

Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(InnoHK下的CPII)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract)

AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32038 2026-07-01 cs.CL cs.AI cs.LG 新提交 75%

Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision

内省耦合:尽管监督固定,自我解释训练仍追踪行为变化

Zifan Carl Guo, Laura Ruis, Jacob Andreas, Belinda Z. Li

机构 * MIT EECS(麻省理工学院电气工程与计算机科学系)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究训练语言模型生成解释时,固定反事实解释数据集如何使模型产生内省性解释,追踪自身行为变化,无需更新监督。

Comments 32 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 73%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06734 2026-07-01 cs.LG cs.AI 版本更新 73%

Corruption Robust Offline Reinforcement Learning with Human Feedback

具有人类反馈的鲁棒离线强化学习

Debmalya Mandal, Andi Nika, Parameswaran Kamalaruban, Adish Singla, Goran Radanović

机构 * University of Warwick(华威大学) Max-Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究离线环境下人类反馈强化学习的数据鲁棒性,提出基于置信集和悲观策略的鲁棒方法,首次提供可证明的鲁棒性保证。

Comments Updated Algorithm 1 and the Proof of Theorem 3.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17917 2026-07-01 cs.LG cs.AI cs.CR 版本更新 62%

Not Every Time and Frequency Need to Be Forgotten in Diffusion Unlearning

并非所有时间和频率都需要在扩散遗忘中被遗忘

Jinseong Park, Mijung Park

机构 * Korea Institute for Advanced Study(韩国高等研究院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 提出选择性遗忘扩散模型中的时间和频率,通过理论分析分布失真与遗忘-效用权衡,在多种设置下实现更高遗忘成功率和生成质量。

Comments ICML 2026 Workshop FoGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31660 2026-07-01 physics.chem-ph cond-mat.mtrl-sci 新提交 50%

Contrastive Regularization of Machine Learning Potentials

机器学习势的对比正则化

Dimitrios Tzivrailis, Georgios Sotiropoulos, Alberto Rosso, Eiji Kawasaki

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对机器学习势在采样时产生虚假低能态的问题,提出对比正则化MSE(CRMSE),通过KL散度对比项修正分布,使采样恢复物理构象,在MD17分子上达到近定量精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02503 2026-07-01 q-bio.NC 50%

Individual-specific precision neuroimaging of learning-related plasticity

个体特异性精确神经影像学中的学习相关可塑性研究

Simon Leipold, Ryssa Moffat

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出一种个体特异性精确方法,通过高频采集高质量神经影像数据,追踪个体神经变化,结合行为测量和多模态技术,提升对学习轨迹的敏感度和个性化技能学习的理解。

Journal ref Neuroscience & Biobehavioral Reviews (2026), 188, 106824

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19506 2026-07-01 cs.CV 版本更新 50%

Bridging Information Asymmetry: A Hierarchical Framework for Deterministic Blind Face Restoration

弥合信息不对称:一种降低不确定性的分层盲脸修复框架

Zhengjian Yao, Jiakui Hu, Kaiwen Li, Hangzhou He, Xinliang Zhang, Shuang Zeng, Lei Zhu, Yanye Lu

机构 * Biomedical Engineering Department, College of Future Technology, Peking University(北京大学未来技术学院生物医学工程系) Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 提出Pref-Restore分层框架,通过语义信息增强、纹理保真对齐和保真约束偏好优化,降低盲脸修复中的不确定性,实现身份敏感的高保真重建。

Comments Accepted by TPAMI2026

详情

展开后加载摘要…

URL PDF HTML 收藏