arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2608.06125 2026-08-07 cs.CV 新提交 78%

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training

面向不确定性引导的扩散模型后训练的样本自适应潜在奖励

Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出\textsc{SURE}框架,含\textsc{SURE-LRM}与\textsc{SURE-REFL},通过样本自适应潜在奖励与不确定性引导反馈优化扩散模型,在偏好预测、SOTA性能及VBench指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00562 2026-08-04 cs.CV 新提交 78%

Beyond Token-Level Cross-Entropy: Fréchet Distributional Post-Training for Autoregressive Image Generation

超越 token 级交叉熵:用于自回归图像生成的 Fréchet 分布后训练

Jinhua Zhang, Yisong Lin, Wei Long, Shuhang Gu

机构 * UESTC(电子科技大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 该研究针对自回归图像生成器预训练与评估的目标及上下文不匹配问题,提出 FD-loss 后训练方法,在 ImageNet 256×256 任务上大幅降低 FID 与 FD_r6,提升生成质量且无额外参数或推理步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12784 2026-08-04 cs.DC 版本更新 78%

StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training

通过受滞约束的回放协调实现高效的异步RL后训练

Haoyang Li, Sheng Lin, Fangcheng Fu, Yuming Zhou, Xiaodong Ji, Yanfeng Zhao, Lefeng Wang, Jie Jiang, Bin Cui

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 StaleFlow通过受滞约束的回放协调,解决RL后训练中数据滞留与偏斜问题,提升系统吞吐量。

Comments SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16947 2026-07-21 cs.CV 新提交 78%

When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation

当物理偏好遇到语义约束:用于文本到视频生成的物理和语义直接偏好优化

Siwei Meng, Yawei Luo, Shu Zhang, Ping Liu

机构 * University of Nevada, Reno(内华达大学雷诺分校) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 文本到视频生成模型存在物理合理性与语义一致性的矛盾,提出物理和语义直接偏好优化方法(PSDPO),通过调节偏好对贡献,限制语义漂移,实现更可靠平衡,实验验证其在提高物理合理性和保持语义一致性上优于基线和现有方法。

Comments This work is accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 78%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10421 2026-07-14 eess.AS cs.SD 新提交 78%

FdAudio: MeanFlow-Anchored Fréchet-Distance Post-Training for One-Step Text-to-Audio Generation

FdAudio:用于一步文本到音频生成的均值流锚定弗雷歇距离训练后处理

Kuan-Po Huang, Bo-Ru Lu, Ho-Lam Chung, Shih-Hsin Wang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 研究针对几步采样文本到音频生成模型一步生成质量落后的问题,提出FdAudio方法,通过多表示弗雷歇距离损失优化分布,并引入均值流一致性目标防止多步退化,在几步系统中提升了一步生成质量且解决了多步退化问题。

Comments Project website: https://fdoneaudio.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02840 2026-07-07 cs.RO 新提交 78%

TACO: TActile World Model as a Self-COrrector forScalable VLA Post-Training

TACO:作为可扩展VLA训练后自校正器的触觉世界模型

Shengbang Liu, Yueru Jia, Yuyang Yan, Jiaming Liu, Xinran Zhang, Qiuxuan Feng, Yandong Guo, Shiji Zhou, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) AI 2 Robotics(人工智能与机器人研究所) Sun Yat-sen University(中山大学) Beihang University(北京航空航天大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 研究VLA模型在接触丰富任务中的问题,提出TACO框架,通过触觉感知世界模型驱动可扩展VLA训练后校正,结合多种方法提升策略,实验表明其能显著提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00483 2026-07-03 cs.RO 新提交 78%

VLM-AR3L: Vision-Language Models for Absolute and Relative Rewards in Reinforcement Learning

VLM-AR3L:用于强化学习中绝对和相对奖励的视觉-语言模型

Kuan-Chen Chen, Winston Chen, Wei-Fang Sun, Min-Chun Hu

机构 * National Tsing Hua University(国立清华大学) NVIDIA AI Technology Center (NVAITC)(英伟达AI技术中心)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 提出VLM-AR3L框架,利用视觉-语言模型从偏好标签中学习绝对和相对奖励,结合状态评估与比较监督,在多种基准任务中优于先前方法。

Comments Accepted at IJCAI 2026. Project website: https://vlm-ar3l.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23426 2026-07-03 cs.CV 版本更新 78%

Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision

直接扩散分数偏好优化:通过逐步对比策略对监督

Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) NVIDIA

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 提出DDSPO方法,通过对比策略对直接监督反向去噪步骤,无需奖励建模或人工标注,在文本-图像对齐和美学质量任务上优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29745 2026-06-30 cs.MA 78%

ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit

ECHO:基于回合信度的认知自适应语言智能体学习

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 后训练与偏好优化 :language agent(title,abstract)

AI总结 提出认知决策过程(EDP)框架,通过回合级信度分配策略梯度目标ECHO,在证据寻求任务中提升智能体的信息获取效率与认知校准能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19836 2026-06-19 cs.RO cs.CV 新提交 78%

World Engine: Towards the Era of Post-Training for Autonomous Driving

World Engine:迈向自动驾驶后训练时代

Tianyu Li, Li Chen, Caojun Wang, Haochen Liu, Kashyap Chitta, Zhenjie Yang, Yuhang Lu, Naisheng Ye, Yihang Qiu, Yufei Wang, Luoxi Zou, Jiaxin Peng, Jin Pan, Zhaoyu Su, Andrei Bursuc, Shengbo Eben Li, Andreas Geiger, Peng Su, Hongyang Li

机构 * The University of Hong Kong(香港大学) Huawei(华为) Shanghai Innovation Institute(上海创新研究院) Archon Robotics(Archon机器人) KE:SAI NVIDIA Research(NVIDIA研究) NTU(南洋理工大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 提出World Engine生成式框架,通过从真实日志重建高保真交互环境并外推安全关键变体,利用强化后训练对齐策略与安全约束,显著减少罕见安全关键场景故障,提升自动驾驶安全性。

Comments Technical Report. Project Page: https://opendrivelab.com/WorldEngine/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15651 2026-06-16 cs.CV 新提交 78%

Self-Questioning Vision-Language Models: Reinforcement Learning for Compositional Visual Reasoning

自问式视觉语言模型:用于组合视觉推理的强化学习

Saraswathy Amjith

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 提出自问式框架,通过GRPO强化学习训练VLM自动分解问题并回答子问题,提升组合视觉推理能力,在CLEVR和A-OKVQA上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10275 2026-06-10 cs.CV 新提交 78%

FoA-SR: Faithful or Aesthetic? Profile-Aware Preference Optimization for Real-World Image Super-Resolution

FoA-SR: 忠实还是美观?面向真实世界图像超分辨率的轮廓感知偏好优化

Amjad Mahdi Alqarni, Peizhong Ju

机构 * Department of Computer Science(计算机科学系) University of Kentucky(肯塔基大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 提出FoA-SR,基于偏好优化实现真实世界图像超分辨率,通过忠实和美观两种轮廓分别优化适配器,在RealSR和DIV2K上验证了可分离的恢复策略。

Comments 17 pages, 6 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09701 2026-06-09 cs.CL cs.AI cs.LG 新提交 78%

Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

学习攻击与防御:通过GRPO对语言模型进行自适应红队测试

Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich

机构 * Microsoft AI Red Team(微软AI红队) Microsoft Azure(微软Azure)

专题命中 后训练与偏好优化 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AdvGRPO框架,通过密集多通道奖励和分离优势归一化实现GRPO在攻击者-防御者联合优化中的稳定训练,产生高效可迁移攻击,防御者优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24583 2026-06-09 cs.CV 78%

Improving Vision-language Models with Perception-centric Process Reward Models

通过以感知为中心的过程奖励模型改进视觉-语言模型

Yingqian Min, Kun Zhou, Yifan Li, Yuhuan Wu, Han Peng, Yifan Du, Wayne Xin Zhao, Min Yang, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Bytedance(字节跳动) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 本文提出Perceval模型,通过token级错误定位提升视觉-语言模型的推理能力,通过感知驱动的监督策略实现细粒度训练与推理优化,实验显示在多个领域基准上显著提升性能。

Comments 8 pages

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 33099-33109

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03264 2026-06-03 cs.CV 78%

PaddleOCR-VL-1.6: Expanding the Frontier of Document Parsing with Under-Optimized Region Refinement and Progressive Post-Training

PaddleOCR-VL-1.6:通过欠优化区域精炼和渐进式后训练扩展文档解析前沿

Zelun Zhang, Hongen Liu, Suyin Liang, Yubo Zhang, Yiqing Xiang, Jiaxuan Liu, Ting Sun, Manhui Lin, Yue Zhang, Changda Zhou, Tingquan Gao, Cheng Cui, Yi Liu, Dianhai Yu, Yanjun Ma

机构 * PaddlePaddle Team, Baidu Inc.(百度公司PaddlePaddle团队)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 提出PaddleOCR-VL-1.6,通过区域感知数据优化框架识别并增强前代模型的薄弱区域,结合渐进式后训练策略,在OmniDocBench v1.6上达到96.33%的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10422 2026-06-01 cs.CV 78%

World2Act: Latent Action Post-Training from World Model Dynamics

World2Act:基于世界模型动力学的潜在动作后训练

An Dinh Vuong, Tuan Van Vo, Abdullah Sohail, Haoran Ding, Liang Ma, Xiaodan Liang, Anqing Duan, Ivan Laptev, Ian Reid

机构 * MBZUAI

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 提出World2Act框架,通过潜在空间对齐世界模型动力学与动作嵌入,避免像素级监督,在仿真和真实机器人上提升VLA策略的成功率。

Comments Updated version. Project page: https://wm2act.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22632 2026-05-22 econ.GN q-fin.EC 78%

Position: The Pre/Post-Training Boundary Should Govern IP in Industry-Academia ML Collaborations

位置:预/后训练边界应主导产业学术ML合作中的知识产权

Dirk Bergemann, Soheil Ghili, Nitzan Mekel-Bobrov

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出PBOS合同模板,通过定义预训练和后训练成果的边界来解决产业学术ML合作中的知识产权问题,主张该模板应成为默认合同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21195 2026-05-21 cs.CV 78%

RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution

RankE: 用于离散文本到图像生成的端到端后训练方法 with Decoder Co-Evolution

Siyong Jian, Siyuan Li, Luyuan Zhang, Zedong Wang, Xin Jin, Ying Li, Cheng Tan, Huan Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出RankE,一种端到端的后训练框架,通过解码器与策略的协同进化,解决离散自回归文本到图像生成中策略优化导致的潜在协变量偏移问题,同时提升图像质量和对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18719 2026-05-19 cs.CV 78%

SafeDiffusion-R1: Online Reward Steering for Safe Diffusion Post-Training

SafeDiffusion-R1: 在线奖励引导用于安全扩散后训练

Komal Kumar, Ankan Deria, Abhishek Basu, Fahad Shamshad, Hisham Cholakkal, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出了一种在线强化学习框架,通过在负样本和正样本文本提示上进行后训练,利用组相对策略优化(GRPO)解决数据稀缺和模型退化问题,引入了引导奖励机制以提高扩散模型的安全性,实验表明其在减少不适当内容和提升生成质量方面表现优异。

Comments Page 28, Image 20, Table 6

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14174 2026-05-15 cs.RO 78%

Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation

具有事后训练可达性验证的安全强化学习用于机器人导航

Qisong He, Xinmiao Huang, Jinwei Hu, Zhuoyun Li, Yi Dong, Changshun Wu, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出一种基于条件价值风险约束的强化学习框架,通过训练对高成本尾部结果敏感的策略,并在训练后利用神经网络可达性验证评估其安全边际,实验表明该方法在导航任务中实现了更高的安全验证率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10937 2026-05-12 cs.CV 78%

Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

文本到图像模型的强化后训练与超线性优势塑造

Haoyuan Sun, Jing Wang, Yuxin Song, Yu Lu, Bo Fang, Yifu Luo, Jun Yin, Pengyu Zeng, Miao Zhang, Tiantian Zhang, Xueqian Wang, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Baidu Inc.(百度公司) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Jimei University(集美大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出超线性优势塑造方法,通过信息几何视角优化文本到图像模型的后训练过程,提升训练效率和生成质量,减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08703 2026-05-12 cs.AI cs.CL cs.CV cs.LG 78%

RewardHarness: Self-Evolving Agentic Post-Training

RewardHarness: 自我进化代理的后训练

Yuxuan Zhang, Penghui Du, Bo Li, Cong Wei, Junwen Miao, Huaisong Zhang, Songcheng Cai, Yubo Wang, Dongfu Jiang, Yuyu Zhang, Ping Nie, Wenhu Chen, Changqian Yu, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Kolors Team, Kuaishou Technology(快手团队) Carnegie Mellon University(卡内基梅隆大学) University of Waterloo(滑铁卢大学) Etude AI Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.AI、cs.LG

AI总结 RewardHarness通过自我进化代理框架,利用少量人类偏好示例迭代优化工具库,实现高效图像编辑评估,准确率达47.4%,超越GPT-5 5.3个百分点。

Comments Project page: https://rewardharness.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08031 2026-05-11 cs.CV 78%

Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models

面向视觉语言模型的无对象幻觉强化反学习

Kaidi Jia, Yujie Lin, Chengyi Yang, Jiayao Ma, Jinsong Su

机构 * Xiamen University(厦门大学)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 本文提出HFRU框架,通过视觉编码器深度语义删除,结合对齐破坏与GRPO优化,实现高效反学习,减少对象幻觉,实验显示在目标识别和人脸识别任务中性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10604 2026-04-14 cs.IR cs.AI cs.CL cs.LG 78%

NSFL: A Post-Training Neuro-Symbolic Fuzzy Logic Framework for Boolean Operators in Neural Embeddings

NSFL:一种用于神经嵌入中布尔运算的后训练神经符号模糊逻辑框架

Vladi Vexler, Ofer Idan, Gil Lederman, Dima Sivov

机构 * Huawei Tel-Aviv Research Center(华为特拉维夫研究中心)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.AI、cs.LG

AI总结 NSFL框架通过适应形式t-范数和t-余范数,为神经嵌入空间提供多原子逻辑约束的计算方法,提升检索性能,实现高达81%的mAP提升。

Comments 23 pages (16 main + 7 appendix), 2 figures, 10 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01129 2026-04-02 cs.CV 78%

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00479 2026-04-02 cs.CV 78%

All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

所有道路通向罗马:激励视觉-语言模型的发散性思维

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) Shanghai AI Lab(上海人工智能实验室) GE Research(通用电气研究院)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 本文研究了强化学习在视觉-语言模型中激发发散性思维的机制,提出MUPO方法以解决GRPO的多样性崩溃问题,提升模型的多样性和可扩展性。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24984 2026-03-31 cs.CV 78%

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

MoE-GRPO:通过强化学习优化基于专家混合的视觉-语言模型

Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 本文提出MoE-GRPO,通过强化学习优化视觉-语言模型中的专家路由,提升专家选择多样性,缓解专家过拟合问题。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18850 2026-03-20 cs.CV 78%

HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models

HORNet:基于任务引导的帧选择用于视觉语言模型的视频问答

Xiangyu Bai, Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 HORNet通过轻量级策略优化,显著减少视频输入帧数和VLM处理时间,同时提升问答质量与时间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16769 2026-03-18 cs.CV 78%

GDPO-SR: Group Direct Preference Optimization for One-Step Generative Image Super-Resolution

GDPO-SR:基于群直接偏好优化的一步生成图像超分辨率

Qiaosi Yi, Shuai Li, Rongyuan Wu, Lingchen Sun, Zhengqiang Zhang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 本文提出GDPO-SR,通过整合RL方法提升一步生成图像超分辨率性能,引入噪声感知扩散模型和群相对优势计算策略,优化局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏