arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-20 至 2026-03-20 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2603.18606 2026-03-20 cs.SE 92%

SQL-Commenter: Aligning Large Language Models for SQL Comment Generation with Direct Preference Optimization

SQL-Commenter: 通过直接偏好优化对齐大型语言模型以生成SQL注释

Lei Yu, Peng Wang, Jingyuan Zhang, Xin Wang, Jia Xu, Li Yang, Changzhi Deng, Jiajia Ma, Fengjun Zhang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

AI总结 本文提出SQL-Commenter,通过构建复杂SQL查询数据集、持续预训练和直接偏好优化,提升SQL注释生成的准确性和质量,在Spider和Bird基准测试中优于现有方法。

Comments Accepted to ICPC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18773 2026-03-20 cs.LG cs.AI 88%

Automatic Configuration of LLM Post-Training Pipelines

大语言模型后训练流程的自动配置

Channe Chwa, Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoPipe框架,通过学习历史运行数据和贝叶斯优化,有效配置大语言模型后训练流程,减少计算成本并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18411 2026-03-20 cs.CL cs.AI cs.LG 88%

TARo: Token-level Adaptive Routing for LLM Test-time Alignment

TARo: 令牌级自适应路由用于大语言模型测试时间对齐

Arushi Rai, Qiang Zhang, Hanqing Zeng, Yunkai Zhang, Dipesh Tamboli, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang

机构 * Meta University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 TARo通过令牌级自适应路由在推理时引导冻结的LLM进行结构化推理,提升推理性能达22.4%,并在医疗和指令遵循任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18736 2026-03-20 cs.LG cs.AI cs.CL stat.ML 87%

CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks

CausalRM:基于观察性用户反馈的因果理论奖励建模用于RLHF

Hao Wang, Licheng Pan, Zhichao Chen, Chunyuan Zheng, Zhixuan Chu, Xiaoxi Li, Yuan Lu, Xinggao Liu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CausalRM框架,通过因果理论处理观察性用户反馈中的噪声和偏见问题,提升RLHF任务性能,实验显示在WildGuardMix和HarmBench上分别提升49.2%和32.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18258 2026-03-20 cs.LG cs.AI 86%

Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization

在对数空间中进行锐度感知最小化以高效提升直接偏好优化

Haocheng Luo, Zehang Deng, Thanh-Toan Do, Mehrtash Harandi, Dinh Phung, Trung Le

机构 * Monash University(墨尔本大学) Swinburne University of Technology(斯威本科技大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出logits-SAM方法,通过在对数空间中建模坐标动态,缓解直接偏好优化中的挤压效应,提升模型性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18850 2026-03-20 cs.CV 78%

HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models

HORNet:基于任务引导的帧选择用于视觉语言模型的视频问答

Xiangyu Bai, Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 HORNet通过轻量级策略优化,显著减少视频输入帧数和VLM处理时间,同时提升问答质量与时间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18756 2026-03-20 cs.LG cs.AI cs.CL 75%

Are complicated loss functions necessary for teaching LLMs to reason?

复杂损失函数是否必要用于教LLM进行推理?

Gabriele Carrino, Andrea Sassella, Nicolo Brunello, Federico Toschi, Mark James Carman

机构 * DEIB, Politecnico di Milano(米兰理工学院DEIB学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析GRPO发现负反馈对训练至关重要,PPO风格约束非必需,提出简化版RGRA在数学基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18683 2026-03-20 cs.LG cs.AI cs.CL 75%

HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning

HISR: 基于 hindsight 信息的分段过程奖励用于多轮代理强化学习

Zhicong Lu, Zichuan Lin, Wei Jia, Changyuan Tian, Deheng Ye, Peiguang Li, Li Jin, Nayu Liu, Guangluan Xu, Wei Feng

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文脉) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HISR方法,通过hindsight信息调节分段过程奖励,提升多轮代理强化学习中的信用分配可靠性,实验验证了方法的有效性。

Comments Submitted to ACL 2026 on Jan 5, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO 75%

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏