arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-27 至 2026-05-27 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 31 篇

2605.27354 2026-05-27 cs.LG cs.AI cs.CL 93%

Guiding LLM Post-training Data Engineering with Model Internals from Sparse Autoencoders

利用稀疏自编码器的模型内部状态指导LLM后训练数据工程

Yi Jing, Zao Dai, Jinwu Hu, Zijun Yao, Lei Hou, Juanzi Li, Xiaozhi Wang

机构 * Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出SAERL框架,通过稀疏自编码器提取模型内部状态,建模数据多样性、难度和质量,用于强化学习数据工程,提升准确率并减少训练步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07632 2026-05-27 cs.CL cs.AI cs.LG 92%

Post-training makes large language models less human-like

后训练使大型语言模型更不像人类

Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julian Coda-Forno, Can Demircan, Vittoria Dentella, Maria K. Eckstein, Noémi Éltető, Michael Franke, Thomas L. Griffiths, Fritz Günther, Susanne Haridi, Sebastian Hellmann, Stefan Herytash, Linus Hof, Eleanor Holton, Isabelle Hoxha, Zak Hussain, Akshay Jagadish, Elif Kara, Valentin Kriegmair, Evelina Leivada, Li Ji-An, Tobias Ludwig, Maximilian Maier, Marcelo G. Mattar, Marvin Mathony, Alireza Modirshanechi, Robin Na, Mariia Nadverniuk, Antonios Nasioulas, Surabhi S. Nath, Helen Niemeyer, Kate Nussenbaum, Sebastian Olschewski, Thorsten Pachur, Stefano Palminteri, Aliona Petrenco, Camille V. Phaneuf-Hadd, Angelo Pirrone, Manuel Rausch, Laura Raveling, Shashank Reddy, Milena Rmus, Evan M. Russek, Tankred Saanum, Kai Sandbrink, Louis Schiekiera, Johannes A. Schubert, Luca M. Schulze Buschoff, Nishad Singhi, Leah H. Somerville, Mikhail S. Spektor, Xin Sui, Christopher Summerfield, Mirko Thalmann, Anna I. Thoma, Taisiia Tikhomirova, Vuong Truong, Polina Tsvilodub, Konstantinos Voudouris, Kristin Witte, Shuchen Wu, Dirk U. Wulff, Hua-Dong Xiong, Songlin Xu, Lance Ying, Xinyu Zhang, Jian-Qiao Zhu, Eric Schulz

机构 * Helmholtz Munich(海德堡-慕尼黑亥姆霍兹中心) Massachusetts Institute of Technology(麻省理工学院) University of Tübingen(图宾根大学) University of Oxford(牛津大学) Stanford(斯坦福大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过引入Psych-201数据集,发现后训练(将基础模型转化为有用助手的过程)一致地降低了模型与人类行为的对齐度,且这种错位在新模型世代中加剧,而人物诱导技术无法改善个体层面的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26646 2026-05-27 cs.AI cs.CL cs.MA 89%

UnityMAS-O: A General RL Optimization Framework for LLM-Based Multi-Agent Systems

UnityMAS-O: 基于LLM的多智能体系统的通用强化学习优化框架

Yiqun Chen, Wei Yang, Erhan Zhang, Shijie Wang, Qi Liu, Zechun Niu, Bin Zhang, Haitao Li, Rui Li, Lingyong Yan, Jinyuan Feng, Biqing Qi, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出UnityMAS-O框架,将多智能体工作流作为优化单元,通过逻辑角色、图轨迹、用户定义奖励和智能体-模型映射四个核心对象解耦逻辑与物理参数,支持灵活的参数共享和奖励分配,在检索增强问答、迭代搜索和反思代码生成任务上验证了多智能体RL对手动工作流的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21883 2026-05-27 cs.CL 89%

Token-weighted Direct Preference Optimization with Attention

基于注意力的令牌加权直接偏好优化

Chengyu Huang, Zhuohang Li, Sheng-Yen Chou, Claire Cardie

机构 * Cornell University(康奈尔大学) Vanderbilt University(范德比大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Token-weighted DPO (TwDPO)方法,利用注意力机制估计令牌权重,在不增加额外训练成本的情况下提升大语言模型与人类偏好对齐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02518 2026-05-27 cs.LG cs.AI cs.CL 87%

GraphDancer: Training LLMs to Explore and Reason over Graphs via Two-Stage Curriculum Post-Training

GraphDancer: 通过两阶段课程后训练训练LLMs在图上的探索与推理

Yuyang Bai, Zhuofeng Li, Ping Nie, Jianwen Xie, Yu Zhang

机构 * Texas A&M University(德克萨斯大学A&M分校) University of Waterloo(滑铁卢大学) Lambda(Lambda公司) University of Oregon(俄勒冈大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GraphDancer两阶段后训练框架,通过图感知课程逐步增加任务难度,使LLMs学会在异构图上进行自然语言推理与函数调用交织的探索与推理,仅用3B骨干模型即在跨域基准上超越更强基线。

Comments 15 pages, Project website: https://yuyangbai.com/graphdancer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26606 2026-05-27 cs.LG cs.AI 86%

Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training

将你的展开用在关键处:基于组强化学习后训练的展开分配

Woojeong Kim, Ziyi Yang, Jing Nathan Yan, Jialu Liu

机构 * Cornell University(康奈尔大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出 Pilot-Commit 框架,通过预算感知的展开分配策略,优先将计算资源分配给高信息量的提示,从而在组策略优化中减少采样成本并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26442 2026-05-27 cs.CL cs.AI 85%

Alignment Tuning for Large Language Models: A Data-Centric Lens on Alignment Data Pipelines

大型语言模型的对齐调优:以数据为中心的对齐数据管道视角

Hwanjun Song

机构 * KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文以数据为中心,将对齐调优重构为管道设计问题,分解为响应合成、偏好评估和偏好实例化三个阶段,并基于此框架统一分类现有对齐方法,总结设计权衡与失败模式,提炼高层原则,最后指出开放挑战。

Comments Accepted at the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17218 2026-05-27 cs.CL cs.AI cs.GT 84%

Alignment Makes Language Models Normative, Not Descriptive

对齐使语言模型变得规范,而非描述性

Eilam Shapira, Moshe Tennenholtz, Roi Reichart

机构 * Technion – Israel Institute of Technology(技术离子-以色列理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 通过对比120个基础-对齐模型对在超过10,000个真实人类决策中的表现,发现对齐诱导了规范性偏差:在单轮教科书式博弈中提升预测,但在多轮战略博弈中因忽略互惠、报复等描述性动态而损害预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26958 2026-05-27 cs.CL cs.AI 82%

Tournament-GRPO: Group-Wise Tournament Rewards for Reinforcement Learning in Open-Ended Long-Form Generation

Tournament-GRPO:面向开放式长文本生成强化学习的群组锦标赛奖励

Zixuan Yang, Yiqun Chen, Wei Yang, Erhan Zhang, Zihan Shen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Jiaxin Mao

机构 * Renmin University of China(中国人民大学) University of Southern California(南加州大学) Zhejiang University(浙江大学) Xiaohongshu Inc.(小红书公司)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对开放式长文本生成中缺乏可靠参考答案和自动评估指标的问题,提出Tournament-GRPO框架,通过同一查询生成结果间的多轮锦标赛比较将基于规则的LLM评判转化为相对奖励,在Deep Research Bench上取得4.52分提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26784 2026-05-27 cs.LG cs.AI 82%

Ratio-Variance Regularized Policy Optimization

比率方差正则化策略优化

Yu Luo, Shuo Han, Yihan Hu, Lei Lv, Huaping Liu, Fuchun Sun, Jianye Hao, Dong Li

机构 * Department of Foundation Model, 2012 Labs, Huawei(华为基础模型部门,2012实验室) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出R²VPO方法,通过约束策略比率方差作为信任区域的局部近似,替代启发式裁剪,在LLM和机器人控制任务中提升性能与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20914 2026-05-27 cs.CV 82%

RISE: Reliable Improvement in Self-Evolving Vision-Language Models

RISE: 自进化视觉语言模型的可靠改进

Chaoran Xu, Yingmao Miao, Pengfei Zhang, Hao Dou, Lei Sun, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP实验室)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract)

AI总结 针对视觉语言模型自进化中角色交替粗粒度、问题质量下降和类型坍缩问题,提出RISE框架,通过细粒度角色交替、质量监督器和技能感知动态平衡实现可靠自进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25507 2026-05-27 cs.AI 79%

Credit Assignment with Resets in Language Model Reasoning

语言模型推理中带有重置的信用分配

Ankur Samanta, Akshayaa Magesh, Ayush Jain, Youliang Yu, Daniel Jiang, Kavosh Asadi, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室) Tel Aviv University(特拉维夫大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI

AI总结 提出随机重置策略优化(RRPO)和自重置策略优化(SRPO)两种方法,通过重置到中间状态并重新采样反事实延续来改进语言模型多步推理中的信用分配,SRPO在多个推理基准上优于标准GRPO和RRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26628 2026-05-27 cs.AI 79%

Tail-Aware HiFloat4: W4A4 Post-Training Quantization for Wan2.2

Tail-Aware HiFloat4: 面向Wan2.2的W4A4训练后量化

Zhanfeng Feng, Shuai Guo, Xin Di, Long Peng, Yang Cao, Zhengjun Zha

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 提出Tail-Aware HiFloat4方法,通过感知激活尾部的百分位校准和紧凑PTQ状态恢复,在HiFloat4数值格式下对Wan2.2进行W4A4训练后量化,减少罕见校准异常值的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07211 2026-05-27 cs.LG 79%

CompassDPO: Dynamics-Controlled Direct Preference Optimization for Robust Safety Alignment

CompassDPO: 用于鲁棒安全对齐的动态控制直接偏好优化

Jilong Liu, Yonghui Yang, Pengyang Shao, Wenjian Tao, Hao Zhan, Haokai Ma, Wei Qin, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 提出CompassDPO,通过隐式DPO奖励边际控制更新方向和幅度,无需外部奖励模型,在PKU-SafeRLHF等基准上提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17036 2026-05-27 cs.AI cs.LG cs.MA cs.SY eess.SY 79%

Reliability and Effectiveness of Autonomous AI Agents in Supply Chain Management

自主AI代理在供应链管理中的可靠性与有效性

Carol Xuan Long, David Simchi-Levi, Feng Zhu, Huangyuan Su, Andre P. Calmon, Flavio P. Calmon

机构 * Harvard University(哈佛大学) MIT/Purdue(麻省理工学院/普渡大学) MIT(麻省理工学院) Harvard University/Kempner Institute(哈佛大学/凯普勒研究所) Georgia Tech(佐治亚理工学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文通过MIT啤酒游戏研究多级供应链中的自主生成式AI代理,发现模型能力是性能主导因素,但平均性能掩盖可靠性风险,并引入代理牛鞭效应,提出基于GRPO的后训练框架以提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13775 2026-05-27 cs.LG cs.AI 79%

Beyond Semantics: The Unreasonable Effectiveness of Reasonless Intermediate Tokens

超越语义:无理由中间标记的不合理有效性

Karthik Valmeekam, Vardhan Palod, Kaya Stechly, Atharva Gundawar, Subbarao Kambhampati

机构 * School of Computing and AI(计算与人工智能学院) Arizona State University(亚利桑那州立大学) Amazon AGI(亚马逊人工通用智能) Yale University(耶鲁大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 通过从零训练Transformer模型于形式可验证推理轨迹,发现模型在正确与损坏轨迹上表现相似,且损坏轨迹在分布外任务上泛化更好,挑战了中间标记反映或诱导可预测推理行为的假设。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26738 2026-05-27 cs.CL 77%

KARMA: Karma-Aligned Reward Model Adaptation

KARMA:基于Karma对齐的奖励模型适应

Jared Scott, Jesse Roberts

机构 * Tennessee Tech University(田纳西科技大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出KARMA框架,利用Reddit对话数据训练奖励模型预测语境依赖的回应价值,并通过强化学习微调语言模型以提升语用能力,发现最佳奖励模型不一定带来最优对齐,且KARMA会降低事实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26491 2026-05-27 cs.LG cs.CV 77%

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models

超越成对偏好:扩散模型的列表级奖励感知对齐

Austin Wang, Jiaqi Han, Stefano Ermon, Yisong Yue

机构 * Caltech(加州理工学院) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);preference optimization(abstract);分类 cs.LG

AI总结 提出Diffusion LAIR方法,通过列表级奖励感知优化,利用连续奖励分数和所有候选图像同时优化扩散模型,在文本到图像生成等任务上超越成对偏好基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25930 2026-05-27 cs.SD 75%

CosyEdit2: Speech-Editing-Oriented Reinforcement Learning Unlocks Better Zero-Shot TTS

CosyEdit2: 面向语音编辑的强化学习解锁更好的零样本TTS

Junyang Chen, Yuhang Jia, Hui Wang, Jiaming Zhou, Yongchang Gan, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) College of Artificial Intelligence, Nankai University(南开大学人工智能学院)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 提出CosyEdit2,通过两阶段后训练框架(监督编辑初始化+基于目标语音无关数据的编辑导向GRPO)解决语音编辑与零样本TTS的局部声学一致性问题,显著提升编辑性能并增强零样本TTS能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22511 2026-05-27 cs.AI cs.CL cs.IR 73%

Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning

Search-E1: 自蒸馏驱动搜索增强推理中的自我进化

Zihan Liang, Yufei Ma, Ben Chen, Zhipeng Qian, Xuxin Zhang, Huangyu Dai, Lingtao Mao

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出Search-E1方法,通过交替使用普通GRPO和在线策略自蒸馏(OPSD),让搜索增强智能体无需外部监督或复杂模块即可自我进化,在七个QA基准上以3B模型超越所有开源基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26315 2026-05-27 cs.LG cs.AI 73%

Curriculum Learning for Safety Alignment

用于安全对齐的课程学习

Sandeep Kumar, Virginia Smith, Chhavi Yadav

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出基于课程学习的Staged-Competence框架,通过难度分级的偏好数据和渐进式参考模型更新,提升DPO安全对齐的鲁棒性,在三个模型族上平均降低16%的OOD有害响应率和20%的越狱攻击成功率。

Comments Accepted at the ICML 2026 GlobalSouthML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11056 2026-05-27 cs.LG cs.AI 73%

Where Hindsight Credit Can Reside: A Signed-Capacity View of Token Updates in RLVR

事后信用可驻留之处:RLVR中令牌更新的有符号容量视角

Yuhang He, Haodong Wu, Siyi Liu, Hongyu Ge, Hange Zhou, Keyi Wu, Zhuo Zheng, Qihong Lin, Zixin Zhong, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过条件互信息分析RLVR中令牌级信用的容量上限,提出四象限分解区分更新方向,并设计HAPO算法进行容量引导的优势重分配,提升数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26102 2026-05-27 cs.SE cs.CL 70%

SWE-Edit: Rethinking Code Editing for Efficient SWE-Agent

SWE-Edit:重新思考高效SWE智能体的代码编辑

Yikai Zhang, Jiaxin Pei, Kenan Li, Qirui Jin, Maoquan Wang, Jin Pan, Yu Kang, Shengyu Fu, Elsie Nallipogu, Junjie Hu, Yufan Huang, Zijian Jin

机构 * Microsoft(微软) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Stanford Institute for Human-Centered Artificial Intelligence (HAI), Stanford University(斯坦福大学人机交互研究所)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SWE-Edit框架,通过将代码编辑分解为查看器和编辑器两个子智能体,解决上下文耦合问题,在SWE-Bench Verified上提升解决率2.1个百分点并降低推理成本17.9%,且通过GRPO训练小模型实现高效编辑格式选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11486 2026-05-27 cs.LG 70%

Exploring the robustness of TractOracle methods in RL-based tractography

探索基于强化学习的纤维追踪中TractOracle方法的鲁棒性

Jeremi Levesque, Antoine Théberge, Maxime Descoteaux, Pierre-Marc Jodoin

机构 * Department of Computer Science, Faculty of Science, University of Sherbrooke(谢布罗克大学计算机科学系)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文通过整合强化学习的最新进展,扩展了TractOracle-RL框架,并引入迭代奖励训练(IRT)方法,实验表明基于oracle的RL方法在准确性和解剖有效性上显著优于传统纤维追踪技术。

Comments 38 pages, 8 figures. Submitted to Medical Image Analysis

Journal ref Medical Image Analysis, December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22274 2026-05-27 cs.CV 67%

CAGE-SGG: Counterfactual Active Graph Evidence for Open-Vocabulary Scene Graph Generation

CAGE-SGG:用于开放词汇场景图生成的反事实主动图证据

Suiyang Guang, Chenyu Liu, Ruohan Zhang, Siyuan Chen

机构 * Institute of Intelligent Vision and Embodied Cognition(智能视觉与具身认知研究院)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract)

AI总结 提出基于反事实关系验证的开放词汇场景图生成框架,通过分解谓词为软证据基并使用反事实验证器确保关系有视觉证据支持,从而提升可靠性、可解释性和泛化能力。

Comments This manuscript has been withdrawn by the authors because we found a methodological flaw in the formulation and evaluation of the proposed approach. The issue affects the reliability of the experimental results and the conclusions drawn from them. Therefore, the authors consider the current version unsuitable for citation or further use

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24764 2026-05-27 cs.CV 67%

World-R1: Reinforcing 3D Constraints for Text-to-Video Generation

World-R1:通过强化学习为文本到视频生成注入3D约束

Weijie Wang, Xiaoxuan He, Youping Gu, Yifan Yang, Zeyu Zhang, Yefei He, Yanbo Ding, Xirui Hu, Donny Y. Chen, Zhiyuan He, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :language model(abstract);foundation model(abstract)

AI总结 提出World-R1框架,利用强化学习(Flow-GRPO)结合3D基础模型和视觉语言模型的反馈,在不修改架构的情况下增强视频生成的3D一致性,并采用周期解耦训练策略平衡刚体几何与动态场景。

Comments ICML 2026, Project Page: https://aka.ms/world-r1, Code: https://github.com/microsoft/World-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13491 2026-05-27 cs.CV 67%

FiRe: Fine-grained Multimodal Reasoning for Enhanced Image Generation

FiRe:用于增强图像生成的细粒度多模态推理

Yongjin Kim, Yoonjin Oh, Yerin Kim, Hyomin Kim, Jeeyoung Yun, Yujung Heo, Minjun Kim, Sungwoong Kim

机构 * KT Corporation(KT公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 提出FiRe方法,通过细粒度多步推理和强化学习FiRe-GRPO,解决文本到图像生成中缺乏细粒度控制的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27117 2026-05-27 cs.AI 57%

Position: AI Safety Requires Effective Controllability

立场:AI安全需要有效可控性

Yige Li, Yunhao Feng, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Ant Group(蚂蚁集团)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出AI安全应将可控性作为首要目标,通过定义可控性、引入基准测试ControlBench并分析现有对齐机制的不足,提出以控制为中心的架构框架。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27154 2026-05-27 cs.CV 50%

Touch-R1: Reinforcing Touch Reasoning in MLLMs

Touch-R1:在多模态大语言模型中强化触觉推理

Yingxin Lai, Yafei Zhou, Fucai Zhu, Siyu Zhu, Weihao Yuan

机构 * Xiamen University(厦门大学) Great Bay University(大湾大学) Fudan University(复旦大学) Nanjing University(南京大学) Daimon Robotics(达摩机器人)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 针对触觉推理中物理属性序数性和跨传感器分布偏移的挑战,提出基于触觉接地GRPO目标训练的Touch-R1模型,在TouchReason-Bench上平均性能超过Octopi-13B和GPT-4o。

Comments Our code and data will be made public on the https://laiyingxin2.github.io/Projects

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26451 2026-05-27 cs.HC cs.CV 50%

Design First, Code Later: Aesthetically Pleasing Template-Free Slides Generation

先设计,后编码:无模板的美观幻灯片生成

Zhiyao Cui, Chenxu Wang, Shuyue Hu, Yiqun Zhang, Wenqi Shao, Qiaosheng Zhang, Zhen Wang

机构 * School of Cybersecurity, Northwestern Polytechnical University(西北工业大学网络安全学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn)

AI总结 提出DeepSlides层次化幻灯片生成流程,通过解耦设计与实现、引入SlideDesign数据集和多智能体强化学习训练范式,在无模板条件下生成高质量幻灯片。

详情

展开后加载摘要…

URL PDF HTML 收藏