arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-01 至 2026-04-01 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2603.29259 2026-04-01 cs.IR cs.CL 87%

Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE

通过鲁棒直接偏好优化与稀疏MoE对齐多模态序列推荐

Hejin Huang, Jusheng Zhang, Kaitong Cai, Jian Wang, Rong Pan

机构 * Sun Yat-sen University(中山大学) Snap Inc(Snap公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文研究了在隐式反馈下直接偏好优化的行为,通过系统实验比较了常见负样本选择策略及其与DPO训练的交互,发现用动态top-K候选池进行随机采样可提升排名性能,原因在于减少错误抑制梯度和保留信息硬信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29871 2026-04-01 cs.AI 85%

ShapE-GRPO: Shapley-Enhanced Reward Allocation for Multi-Candidate LLM Training

ShapE-GRPO:基于多候选LLM训练的Shapley增强奖励分配

Rui Ai, Yu Pan, David Simchi-Levi, Chonghuan Wang

机构 * MIT(麻省理工学院) University of Sydney(悉尼大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对多候选LLM训练中奖励分配噪声问题,提出ShapE-GRPO方法,通过Shapley值理论分解集级奖励,提升训练效率与收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14565 2026-04-01 cs.RO cs.AI 85%

Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language

掩码逆强化学习:从演示和语言引导的奖励消歧

Minyoung Hwang, Alexandra Forsey-Smerek, Nathaniel Dennler, Andreea Bobu

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出掩码逆强化学习框架,利用大语言模型结合演示和语言信息,提升机器人奖励学习的样本效率和泛化能力。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03584 2026-04-01 cs.CL cs.AI cs.LG 80%

$V_0$: A Generalist Value Model for Any Policy at State Zero

$V_0$: 一种通用的价值模型,用于任何在零状态下的策略

Yi-Kai Zhang, Zhiyuan Yao, Hongyan Hao, Yueqing Sun, Qi Gu, Hui Su, Xunliang Cai, De-Chuan Zhan, Han-Jia Ye

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出$V_0$,一种无需参数更新即可估计任意模型在未见提示上的预期性能的价值模型。通过将策略的动态能力作为显式上下文输入,$V_0$在策略优化中作为关键资源调度器,提升采样预算分配效率和部署时的路由性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29798 2026-04-01 cs.CV 67%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29886 2026-04-01 cs.HC cs.CY 50%

AI Empathy Erodes Cognitive Autonomy in Younger Users

人工智能共情削弱年轻用户的认知自主性

Junfeng Jiao, Abhejay Murali, Saleh Afroogh

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文研究人工智能共情对年轻用户认知自主性的影响,指出情感共鸣可能强化用户情绪状态,削弱独立情绪管理和批判性思维能力,提出以功能中性为核心的斯多葛式架构以保护用户自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25968 2026-04-01 cs.CV 50%

Neuro-Cognitive Reward Modeling for Human-Centered Autonomous Vehicle Control

神经认知奖励建模用于以人为中心的自动驾驶控制

Zhuoli Zhuang, Yu-Cheng Chang, Yu-Kai Wang, Thomas Do, Chin-Teng Lin

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 后训练与偏好优化 :RLHF(abstract)

AI总结 本文提出基于EEG的决策框架,将人类认知信息整合到强化学习中,提升自动驾驶的避障能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09666 2026-04-01 cs.CV 50%

Unified Multimodal Models as Auto-Encoders

统一多模态模型作为自编码器

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Baidu(百度) Rabbitpre AI(兔展智能) SYSU(中山大学) USTC(中国科学技术大学) CASIA(中国科学院自动化研究所)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出统一GRPO方法,通过强化学习联合优化图像到文本和文本到图像任务,利用重建奖励提升语义一致性,增强多模态协同效果。

详情

展开后加载摘要…

URL PDF HTML 收藏