arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-27 至 2026-03-27 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2603.25284 2026-03-27 cs.AI 87%

SliderQuant: Accurate Post-Training Quantization for LLMs

SliderQuant: 针对LLMs的准确后训练量化

Shigeng Wang, Chao Li, Yangyuxuan Kang, Jiawei Fan, Zhonghong Ou, Anbang Yao

机构 * Intel Labs China(英特尔中国研究院) BUPT(北京邮电大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SliderQuant框架,通过分层滑动量化方法优化不同层的量化敏感性,提升LLM在不同位宽下的精度。

Comments This work is accepted to ICLR 2026. Code is available at https://github.com/deep-optimization/SliderQuant

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25145 2026-03-27 cs.CV cs.LG 70%

Learning to Rank Caption Chains for Video-Text Alignment

学习排名图注链以实现视频-文本对齐

Ansel Blume, Burak Uzkent, Shalini Chaudhuri, Garin Kessler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon Prime Video(亚马逊Prime Video)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 本文提出通过重复图注退化生成大规模挑战性图注链,改进视频-文本对齐的排名优化方法,优于二元DPO并在长形式内容生成中表现更优,需对视觉编码器进行微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24849 2026-03-27 cs.HC cs.AI cs.CV cs.CY 70%

Gaze patterns predict preference and confidence in pairwise AI image evaluation

注视模式预测成对AI图像评估中的偏好和信心

Nikolas Papadopoulos, Shreenithi Navaneethan, Sheng Bai, Ankur Samanta, Paul Sajda

机构 * Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :RLHF(abstract);preference optimization(abstract);分类 cs.AI

AI总结 研究通过眼动追踪揭示成对AI图像评估中的偏好形成过程,发现注视模式能预测二元选择和信心,表明眼动数据能提供与偏好注释质量相关的隐含信号。

Comments This paper has been accepted to ACM ETRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25183 2026-03-27 cs.CL 57%

Cross-Preference Learning for Sentence-Level and Context-Aware Machine Translation

跨偏好学习用于句子级和上下文感知机器翻译

Ying Li, Xinglin Lyu, Junhui Li, Jinlong Yang, Hengchao Shang, Min Zhang, Shimin Tao, Daimeng Wei

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Huawei Translation Services Center(华为翻译服务中心)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL

AI总结 本文提出跨偏好学习框架,通过整合内在和跨条件偏好,提升句子级和上下文感知机器翻译的互补效益,实验显示在多个任务中翻译质量与鲁棒性均有提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 57%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 后训练与偏好优化 :SFT(abstract);分类 cs.CL

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25685 2026-03-27 cs.RO cs.CV 50%

Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning

持久的机器人世界模型:通过强化学习稳定多步 rollout

Jai Bardhan, Patrik Drozdik, Josef Sivic, Vladimir Petrik

机构 * Czech Institute of Informatics, Robotics and Cybernetics, Czech Technical University in Prague(捷克理工大学,捷克信息学、机器人学与控制论研究所)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文通过强化学习方法改进机器人世界模型,解决多步预测中误差累积问题,提出自回归rollout训练方案和多视角视觉反馈奖励,提升预测精度和稳定性,实现在DROID数据集上的state-of-the-art表现。

Comments 34 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04033 2026-03-27 cs.CV 50%

Thinking with Frames: Generative Video Distortion Evaluation via Frame Reward Model

基于框架的思考:通过帧奖励模型生成视频失真评估

Yuan Wang, Borui Liao, Huijuan Huang, Jinda Lu, Ouxiang Li, Kuien Liu, Meng Wang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出REACT框架,通过帧级奖励模型评估生成视频的结构性失真,结合人类偏好数据集和高效合成流程,提升视频生成质量评估的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏