arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2603.15616 2026-03-17 cs.CV 78%

GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering

GlyphPrinter: 基于区域分组的直接偏好优化用于精确的视觉文本渲染

Xincheng Shuai, Ziye Li, Henghui Ding, Dacheng Tao

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(大数据研究院,计算机科学与人工智能学院,复旦大学) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,计算与数据科学学院,南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 本文提出GlyphPrinter,通过区域分组直接偏好优化提升文本渲染的字形准确性,引入区域级字形偏好标注和区域优化目标,有效解决复杂或非领域字符的字形误差问题。

Comments CVPR 2026, Project Page: https://henghuiding.com/GlyphPrinter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11089 2026-03-13 cs.SD cs.MM eess.AS 78%

V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation

V2A-DPO:面向视频到音频生成的多偏好优化

Nolan Chan, Timmy Gang, Yongqian Wang, Yuzhe Liang, Dingdong Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 V2A-DPO通过多偏好优化提升视频到音频生成的质量,结合AudioScore评分系统和课程学习策略,在VGGSound数据集上实现了优于DDPO和预训练基线的性能。

Comments Accepted at ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07624 2026-03-10 cs.RO 78%

GeoLoco: Leveraging 3D Geometric Priors from Visual Foundation Model for Robust RGB-Only Humanoid Locomotion

GeoLoco: 利用视觉基础模型中的3D几何先验实现稳健的纯RGB人形机器人运动

Yufei Liu, Xieyuanli Chen, Hainan Pan, Chenghao Shi, Yanjie Chen, Kaihong Huang, Zhiwen Zeng, Huimin Lu

专题命中 后训练与偏好优化 :foundation model(title,abstract)

AI总结 GeoLoco通过利用视觉基础模型的3D几何先验,实现纯RGB驱动的人形机器人稳健运动,解决仿真到现实迁移难题。

Comments 8 pages, 6 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05611 2026-03-10 cs.CV 78%

FLARE: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving

FLARE: 从视觉-语言模型中学习未来感知的潜在表示以实现自动驾驶

Chengen Xie, Chonghao Sima, Tianyu Li, Bin Sun, Junjie Wu, Zhihui Hao, Hongyang Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) OpenDriveLab at The University of Hong Kong(香港大学OpenDrive实验室) Li Auto Inc.(Li汽车公司)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 FLARE通过自监督的未来特征预测目标,从大规模未标记数据中学习鲁棒驾驶表示,无需语言监督,提升自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16434 2026-02-27 cs.RO 78%

From Prompts to Printable Models: Support-Effective 3D Generation via Offset Direct Preference Optimization

从提示到可打印模型:通过偏移直接偏好优化实现支持有效的3D生成

Chenming Wu, Xiaofan Li, Chengkai Dai

机构 * Axiswise Ltd.(Axiswise有限公司) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 SEG通过偏移直接偏好优化实现支持有效的3D生成,显著减少支撑材料使用并提升打印可制造性。

Comments Accepted by IEEE Robotics and Automation Letters 2026, preprint version by authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05301 2026-01-29 cs.CV 78%

SeedVR2: One-Step Video Restoration via Diffusion Adversarial Post-Training

SeedVR2: 通过扩散对抗后训练实现一步视频修复

Jianyi Wang, Shanchuan Lin, Zhijie Lin, Yuxi Ren, Meng Wei, Zongsheng Yue, Shangchen Zhou, Hao Chen, Yang Zhao, Ceyuan Yang, Xuefeng Xiao, Chen Change Loy, Lu Jiang

机构 * Nanyang Technological University(南洋理工大学) ByteDance Seed(字节跳动实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 SeedVR2通过引入自适应窗口注意力机制和改进的损失函数,实现高分辨率视频修复的一步式高效修复方法。

Comments Camera Ready of ICLR2026. Project page: https://iceclear.github.io/projects/seedvr2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07483 2026-01-13 cs.CV 78%

FocalOrder: Focal Preference Optimization for Reading Order Detection

FocalOrder:阅读顺序检测中的焦点偏好优化

Fuyuan Liu, Dianyu Yu, He Ren, Nayu Liu, Xiaomian Kang, Delai Qiu, Fa Zhang, Genpeng Zhen, Shengping Liu, Jiaen Liang, Wei Huang, Yining Wang, Junnan Zhu

机构 * Unisound AI Technology Co.Ltd(Unisound人工智能技术有限公司) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Beihang University(北航大学) School of Computer Science and Technology, Tiangong University(技术学院,天津大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 FocalOrder通过焦点偏好优化解决阅读顺序检测中位置差异问题,提升复杂文档结构处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03044 2026-01-07 cs.RO 78%

SOP: A Scalable Online Post-Training System for Vision-Language-Action Models

SOP:一种可扩展的在线后训练系统用于视觉-语言-动作模型

Mingjie Pan, Siyuan Feng, Qinglin Zhang, Xinchen Li, Jianheng Song, Chendi Qu, Yi Wang, Chuankang Li, Ziyu Xiong, Zhi Chen, Yi Liu, Jianlan Luo

机构 * Agibot Research(Agibot研究机构) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 SOP系统通过在线分布式后训练提升视觉-语言-动作模型在现实世界中的性能,实现高效可靠的多任务适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02900 2026-01-07 cs.SD eess.AS 78%

SPO-CLAPScore: Enhancing CLAP-based alignment prediction system with Standardize Preference Optimization, for the first XACLE Challenge

SPO-CLAPScore: 通过标准化偏好优化提升基于CLAP的对齐预测系统,用于首次XACLE挑战

Taisei Takano, Ryoya Yoshida

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 本文提出SPO-CLAPScore方法,通过标准化偏好优化和听众筛选提升基于CLAP的音频-文本对齐预测性能,在XACLE挑战中取得第六名。

Comments https://github.com/ttakano398/SPO-CLAPScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15159 2026-01-01 cs.CV 78%

OnlineVPO: Align Video Diffusion Model with Online Video-Centric Preference Optimization

OnlineVPO: 对齐视频扩散模型与在线视频中心偏好优化

Jiacheng Zhang, Jie Wu, Weifeng Chen, Yatai Ji, Xuefeng Xiao, Weilin Huang, Kai Han

机构 * The University of Hong Kong(香港大学) ByteDance Project Page(字节跳动项目)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 OnlineVPO通过改进反馈源和调节方法,提出一种针对视频扩散模型的高效偏好学习框架,提升视频生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15009 2025-12-18 cs.CV 78%

Model Agnostic Preference Optimization for Medical Image Segmentation

无模型偏好优化用于医学图像分割

Yunseong Nam, Jiwon Jang, Dongkyu Won, Sang Hyun Park, Soopil Kim

机构 * DGIST, School of Undergrad Studies(DGIST研究生院) DGIST, Department of Robotics and Mechatronics Engineering(DGIST机器人与机电工程系) DGIST, Division of Intelligent Robot(DGIST智能机器人系)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 MAPO通过Dropout驱动的随机分割假设实现无模型偏好优化,提升医学图像分割的边界遵循性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14490 2025-12-17 cs.IR 78%

PushGen: Push Notifications Generation with LLM

PushGen: 基于LLM的推送通知生成

Shifu Bie, Jiangxia Cao, Zixiao Luo, Yichuan Zou, Lei Liang, Lu Zhang, Linxun Chen, Zhaojie Liu, Xuanping Li, Guorui Zhou, Kaiqiao Zhan, Kun Gai

专题命中 后训练与偏好优化 :LLM(title,abstract)

AI总结 PushGen通过可控提示技术和奖励模型,实现高质量推送通知生成,已应用于大规模用户场景。

Comments Accepted by WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13262 2025-12-16 cs.RO cs.CV 78%

Post-Training and Test-Time Scaling of Generative Agent Behavior Models for Interactive Autonomous Driving

生成代理行为模型在交互式自动驾驶中的训练和测试时间缩放

Hyunki Seong, Jeong-Kyun Lee, Heesoo Myeong, Yongho Shin, Hyun-Mook Cho, Duck Hoon Kim, Pranav Desai, Monu Surana

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出GRBO和Warm-K两种方法,用于提升交互式自动驾驶中生成代理行为模型的训练和测试时间性能,提高安全性和鲁棒性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11306 2025-12-16 cs.DC 78%

RollMux: Phase-Level Multiplexing for Disaggregated RL Post-Training

RollMux:基于分拆强化学习后训练的阶段级多路复用

Tianyuan Wu, Lunxi Cao, Yining Wei, Wei Gao, Yuheng Zhao, Dakai An, Shaopan Xiong, Zhiqiang Lv, Ju Huang, Siran Yang, Yinghao Yu, Jiamang Wang, Lin Qu, Wei Wang

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 RollMux通过跨集群编排优化强化学习后训练的资源利用,提升效率1.84倍,实现100%服务等级目标。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16763 2025-12-16 cs.CV 78%

Self-Rewarding Large Vision-Language Models for Optimizing Prompts in Text-to-Image Generation

自奖励的大型视觉-语言模型用于优化文本到图像生成中的提示

Hongji Yang, Yucheng Zhou, Wencheng Han, Jianbing Shen

机构 * University of Macau(澳门大学)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 本文提出了一种自奖励的大型视觉-语言模型框架,用于优化文本到图像生成中的提示,通过统一求解器和奖励模型实现自我改进,实验表明其优于其他方法。

Comments Accepted by ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06424 2025-12-04 cs.CV 78%

Margin-aware Preference Optimization for Aligning Diffusion Models without Reference

基于边界的偏好优化:无需参考的扩散模型对齐

Jiwoo Hong, Sayak Paul, Noah Lee, Kashif Rasul, James Thorne, Jongheon Jeong

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 本文提出MaPO,一种无需参考的扩散模型对齐方法,通过优化偏好输出与非偏好输出之间的边界,提升T2I任务的适应性能,减少训练时间并优于现有方法。

Comments Accepted to AAAI 2026 Main Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03317 2025-12-03 cs.CV 78%

Diffusion-SDPO: Safeguarded Direct Preference Optimization for Diffusion Models

Diffusion-SDPO:用于扩散模型的受保护直接偏好优化

Minghao Fu, Guo-Hua Wang, Tianyu Cui, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 Diffusion-SDPO通过保护性更新规则提升扩散模型对人类偏好的对齐效果。

Comments The code is publicly available at https://github.com/AIDC-AI/Diffusion-SDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00425 2025-12-02 cs.CV 78%

What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards

视频生成中重力的作用:基于可验证奖励的后训练牛顿定律

Minh-Quan Le, Yuanzhi Zhu, Vicky Kalogeiton, Dimitris Samaras

机构 * Stony Brook University(石溪大学) LIX, École Polytechnique, CNRS, IPP(巴黎政治学院LIX研究所、法国国家科学研究中心、IPPP)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 NewtonRewards通过可验证奖励机制提升视频生成的物理合理性与运动流畅度。

Comments Project page: https://cvlab-stonybrook.github.io/NewtonRewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23525 2025-12-02 cs.CV 78%

Hallo4: High-Fidelity Dynamic Portrait Animation via Direct Preference Optimization

Hallo4: 通过直接偏好优化实现高保真的动态肖像动画

Jiahao Cui, Yan Chen, Mingwang Xu, Hanlin Shang, Yuxuan Chen, Yun Zhan, Zilong Dong, Yao Yao, Jingdong Wang, Siyu Zhu

机构 * Fudan University(复旦大学) Baidu Inc.(百度公司) Shanghai Innovative Institute(上海创新研究院) Nanjing University(南京大学) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 Hallo4通过直接偏好优化和时空运动调制,实现高保真的动态肖像动画生成,提升唇部同步、表情自然性和身体运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21592 2025-11-27 cs.CV 78%

MoGAN: Improving Motion Quality in Video Diffusion via Few-Step Motion Adversarial Post-Training

通过少量步骤的运动对抗性后训练提升视频扩散中的运动质量

Haotian Xue, Qi Chen, Zhonghao Wang, Xun Huang, Eli Shechtman, Jinrong Xie, Yongxin Chen

机构 * Adobe(Adobe公司) Georgia Tech(佐治亚理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 MoGAN通过运动对抗性后训练提升视频扩散模型的运动质量,无需奖励模型或人类偏好数据,在多个基准测试中显著提高了运动真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19169 2025-11-25 cs.CV 78%

Test-Time Preference Optimization for Image Restoration

测试时偏好优化用于图像恢复

Bingchen Li, Xin Li, Jiaqi Xu, Jiaming Guo, Wenbo Li, Renjing Pei, Zhibo Chen

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 本文提出测试时偏好优化方法,通过生成偏好数据和自动指标,提升图像恢复质量并适应多种任务。

Comments Accepted by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10148 2025-11-14 cs.NE 78%

UCPO: A Universal Constrained Combinatorial Optimization Method via Preference Optimization

Zhanhong Fang, Debing Wang, Jinbiao Chen, Jiahai Wang, Zizhen Zhang

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21161 2025-10-28 q-bio.BM 78%

RiboPO: Preference Optimization for Structure- and Stability-Aware RNA Design

Minghao Sun, Hanqun Cao, Zhou Zhang, Chen Wei, Liang Wang, Tianrui Jia, Zhiyuan Liu, Tianfan Fu, Xiangru Tang, Yejin Choi, Pheng-Ann Heng, Fang Wu, Yang Zhang

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

Comments 9 pages, 2 figures. Equal contribution: Minghao Sun, Hanqun Cao, Zhou Zhang. Corresponding author: Fang Wu, Yang Zhang

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19737 2025-10-23 cond-mat.mtrl-sci 78%

Accelerating Moment Tensor Potentials through Post-Training Pruning

Zijian Meng, Karim Zongo, Matthew Thoms, Ryan Eric Grant, Laurent Karim Béland

专题命中 后训练与偏好优化 :post-training(title,abstract)

Comments 16 pages, 5 figures Software available from https://github.com/RichardZJM/MTP_basis_optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18353 2025-10-22 cs.CV 78%

Ranking-based Preference Optimization for Diffusion Models from Implicit User Feedback

Yi-Lun Wu, Bo-Kai Ruan, Chiang Tseng, Hong-Han Shuai

机构 * Institute of Electrical and Computer Engineering, National Yang Ming Chiao Tung University(电子工程学院,阳明交通大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21090 2025-10-22 eess.AS 78%

Post-training for Deepfake Speech Detection

Wanying Ge, Xin Wang, Xuechen Liu, Junichi Yamagishi

专题命中 后训练与偏好优化 :post-training(title,abstract)

Comments Corrected previous implementation of EER calculation. Slight numerical changes in some of the results

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05095 2025-10-21 cs.CV 78%

SoPo: Text-to-Motion Generation Using Semi-Online Preference Optimization

Xiaofeng Tan, Hongsong Wang, Xin Geng, Pan Zhou

机构 * Department of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程系) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, Nanjing, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学))

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

Journal ref Advances in Neural Information Processing Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09056 2025-10-13 cs.CV 78%

Lesion-Aware Post-Training of Latent Diffusion Models for Synthesizing Diffusion MRI from CT Perfusion

Junhyeok Lee, Hyunwoong Kim, Hyungjin Chung, Heeseong Eom, Joon Jang, Chul-Ho Sohn, Kyu Sung Choi

机构 * College of Medicine, Seoul National University, Seoul, Republic of Korea(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Department of Biomedical Sciences, Seoul National University(首尔国立大学生物医学科学系)

专题命中 后训练与偏好优化 :post-training(title,abstract)

Comments MICCAI 2025, Lecture Notes in Computer Science Vol. 15961

Journal ref Med Image Comput Comput Assist Interv. LNCS 15961, 282-291, Springer, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06988 2025-10-09 cs.CV 78%

No MoCap Needed: Post-Training Motion Diffusion Models with Reinforcement Learning using Only Textual Prompts

Girolamo Macaluso, Lorenzo Mandelli, Mirko Bicchierai, Stefano Berretti, Andrew D. Bagdanov

机构 * University of Florence(佛罗伦萨大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25718 2025-10-01 cs.RO 78%

VLA Model Post-Training via Action-Chunked PPO and Self Behavior Cloning

Si-Cheng Wang, Tian-Yu Xiang, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Ao-Qun Jin, Zeng-Guang Hou

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏