arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 17 篇

2603.28416 2026-03-31 cs.LG cs.AI 88%

Evolutionary Discovery of Reinforcement Learning Algorithms via Large Language Models

通过大语言模型发现强化学习算法的进化方法

Alkis Sygkounas, Amy Loutfi, Andreas Persson

机构 * Machine Perception and Interaction Lab, Örebro University(厄勒布鲁大学机器感知与交互实验室)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于进化算法发现强化学习算法的方法,通过搜索可执行的更新规则来发现新的算法,并通过超参数优化提升性能,实验表明其在多个基准上表现优异。

Comments accepted at GECCO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03192 2026-03-31 cs.CV cs.CL cs.LG 88%

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉

Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani

机构 * University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。

Comments CVPR 2026. Project Page: https://mod-dpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27226 2026-03-31 cs.CL 87%

Rethinking Easy-to-Hard: Limits of Curriculum Learning in Post-Training for Deductive Reasoning

重新思考易到难:在后训练中课程学习在演绎推理中的局限性

Maximilian Mordig, Andreas Opedal, Weiyang Liu, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) ETH Zürich(苏黎世联邦理工学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本研究系统评估了课程学习在LLM后训练中的影响,发现基于难度的训练顺序在准确性及响应长度上无显著优势,挑战了课程学习在演绎推理中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27375 2026-03-31 cs.CV 82%

Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models

弥合可验证奖励下的视觉表征与强化学习在大视觉-语言模型中的应用

Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) Huawei(华为) HKUST (GZ)(香港科技大学(广州))

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract)

AI总结 本文提出KAWHI机制,通过整合结构化视觉信息提升大视觉-语言模型的多模态推理性能,改进现有统一奖励优化方法。

Comments Homepage: \url{https://kawhiiiileo.github.io/KAWHI_PAGE/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22601 2026-03-31 cs.LG cs.CV 79%

$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models

$ϕ$-DPO:面向大多模态模型持续学习的公平性直接偏好优化方法

Thanh-Dat Truong, Huu-Thien Tran, Jackson Cothren, Bhiksha Raj, Khoa Luu

机构 * CVIU Lab, University of Arkansas(阿肯色大学 CVIU 实验室) Dep. of Geosciences, University of Arkansas(阿肯色大学地球科学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出$ϕ$-DPO框架,通过直接偏好优化缓解持续学习中的灾难性遗忘问题,并解决数据不平衡导致的公平性问题,实验表明其在多个基准上表现优异。

Comments Accepted to CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27693 2026-03-31 cs.CV cs.AI cs.LG cs.MA cs.MM 79%

LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation

LVRPO:基于GRPO的语言-视觉对齐用于多模态理解和生成

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系,美国) Department of Machine Learning, MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学机器学习系,阿联酋) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(汉阳大学ERICA校区人工智能系,韩国)

专题命中 后训练与偏好优化 :foundation model(abstract);pretraining(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVRPO框架,通过GRPO显式对齐语言和视觉表示,提升多模态理解和生成性能,无需辅助编码器或人工目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24984 2026-03-31 cs.CV 78%

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

MoE-GRPO:通过强化学习优化基于专家混合的视觉-语言模型

Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 本文提出MoE-GRPO,通过强化学习优化视觉-语言模型中的专家路由,提升专家选择多样性,缓解专家过拟合问题。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28765 2026-03-31 cs.CL 77%

Adaptive Block-Scaled Data Types

自适应块缩放数据类型

Jack Cook, Hyemin S. Lee, Kathryn Le, Junxian Guo, Giovanni Traverso, Anantha P. Chandrakasan, Song Han

机构 * Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出自适应块缩放数据类型,通过动态选择整数和浮点表示以减少量化误差,在4位量化中实现更低的训练损失和更高的任务准确性。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19413 2026-03-31 cs.LG cs.AI cs.CV 73%

UniGame: Turning a Unified Multimodal Model Into Its Own Adversary

UniGame: 将统一多模态模型转变为自身对手

Zhaolong Su, Wang Lu, Hao Chen, Sharon Li, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Independent(独立研究者) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 UniGame通过自对抗框架提升多模态模型的一致性与鲁棒性,显著增强理解、生成和对抗鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02225 2026-03-31 math.OC 71%

Human-in-the-loop: Real-time Preference Optimization

人机协同:实时偏好优化

Wenbin Wang, Wenjie Xu, Colin N. Jones

专题命中 后训练与偏好优化 :preference optimization(title)

AI总结 本文提出一种实时反馈优化控制器,通过成对比较反馈优化用户效用,保证最优性和闭环稳定性,通过随机探索信号估计下降方向,并通过数值实验验证理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07738 2026-03-31 cs.LG cs.CV 70%

From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training

从探索到利用:一种两阶段熵RLVR方法用于噪声容忍的多模态大语言模型训练

Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Senkang Hu, Ziyi Guan, Jason Chun Lok Li, Lai Man Po

机构 * Independent Researcher(独立研究者) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Hong Kong University of Science and Technology(香港科技大学) University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种两阶段熵优化方法,通过探索阶段提升输出多样性,利用阶段提高预测准确性,增强噪声容忍能力,实验证明在不同模型和任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27184 2026-03-31 cs.CV 67%

Incentivizing Temporal-Awareness in Egocentric Video Understanding Models

激励时间感知的自体视频理解模型

Zhiyang Xu, Tian Qin, Bowen Jin, Zhengfeng Lai, Meng Cao, Lifu Huang, Peng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) Apple(苹果公司) Harvard University(哈佛大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UC Davis(加州大学戴维斯分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出TGPO算法,通过强化学习提升多模态大语言模型在自体视频理解中的时间感知能力,实验表明其在时间接地和因果连贯性方面优于现有方法。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05548 2026-03-31 cs.LG cs.AI 62%

Unveiling Implicit Advantage Symmetry: Why GRPO Struggles with Exploration and Difficulty Adaptation

揭示隐含的优势对称性:为什么GRPO在探索和适应难度上遇到困难

Zhiqi Yu, Zhangquan Chen, Mengting Liu, Heye Zhang, Liangqiong Qu

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文指出GRPO在探索和适应难度上的瓶颈源于隐含的优势对称性,提出不对称GRAE方法提升探索效率和学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28673 2026-03-31 cs.LG cs.CR cs.DC 57%

FL-PBM: Pre-Training Backdoor Mitigation for Federated Learning

FL-PBM:联邦学习中的预训练后门缓解

Osama Wehbi, Sarhad Arisdakessian, Omar Abdel Wahab, Azzam Mourad, Hadi Otrok, Jamal Bentahar

机构 * Polytechnique Montréal(蒙特利尔理工学院) Khalifa University(哈利法大学) Concordia Institute for Information Systems Engineering, Concordia University(康考迪亚大学康考迪亚信息系统工程研究所)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出FL-PBM,一种在联邦学习中预训练阶段主动过滤恶意数据的机制,通过PCA提取特征、GMM聚类识别恶意样本及针对性模糊技术,有效降低后门攻击成功率,同时保持模型准确率。

Comments 12 pages, 3 figures, 1 table, 2 algorithms, Regular Journal Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28069 2026-03-31 cs.CV cs.AI 57%

MolmoPoint: Better Pointing for VLMs with Grounding Tokens

MolmoPoint:通过接地标记提升VLMs的指针能力

Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出MolmoPoint,通过直接选择包含目标概念的视觉标记来改进VLMs的指针机制,提升图像、GUI和视频指针任务性能,并提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27482 2026-03-31 cs.CV cs.AI 57%

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

差分反馈:为视觉语言模型强化学习生成多模态过程级监督

Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu, Yaozong Zheng, Yafei Liu, Yeling Peng, Youwei Wang, Sibo Wang, Huiming Yang, Linglin Liao, Shunzhi Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28162 2026-03-31 cs.CV 50%

ColorFLUX: A Structure-Color Decoupling Framework for Old Photo Colorization

ColorFLUX:一种用于旧照片着色的结构-颜色解耦框架

Bingchen Li, Zhixin Wang, Fan Li, Jiaqi Xu, Jiaming Guo, Renjing Pei, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 后训练与偏好优化 :preference optimization(abstract)

AI总结 本文提出基于生成扩散模型FLUX的新型旧照片着色框架,通过结构-颜色解耦策略和改进的直接偏好优化策略,提升旧照片着色的准确性与质量。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏