arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 415 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 30 篇

2605.07063 2026-05-11 cs.LG cs.AI 96%

Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

Dr. Post-Training:一种数据正则化视角下的LLM后训练

Pingbang Hu, Xueshen Liu, Z. Morley Mao, Jiaqi W. Ma

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title,title_cn);SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn)

AI总结 本文提出Dr. Post-Training框架,通过将通用训练数据作为数据诱导正则化器,防止模型过拟合稀缺目标数据,从而提升LLM后训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07172 2026-05-11 cs.CL 95%

Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization

基于拓扑的大型语言模型对齐:轨迹拓扑损失与拓扑偏好优化

Yurui Pan, Ke Xu, Bo Peng

机构 * School of Computing and Intelligent Innovation, Fudan University(复旦大学计算与智能创新学院) School of Economics and Management, Tongji University(同济大学经济与管理学院) College of Information Technology, Shanghai Ocean University(上海海洋大学信息学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(summary_cn,abstract)

AI总结 本文提出基于拓扑的对齐框架,通过轨迹拓扑损失和拓扑偏好优化提升大型语言模型的对齐性能,实验表明其在自动偏好指标和LLM判断评估中优于传统方法。

Comments Accepted to ACL 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06977 2026-05-11 cs.LG cs.AI cs.IT math.IT stat.ML 92%

$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses

$f$-Divergence Regularized RLHF:采样两则与统一分析

Di Wu, Chengshuai Shi, Jing Yang, Cong Shen

机构 * Department of Electrical and Computer Engineering, University of Virginia, Virginia, United States(弗吉尼亚大学电气与计算机工程系) Princeton Language and Intelligence, Princeton University, New Jersey, United States(普林斯顿大学语言与智能)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出基于一般$f$-散度正则化的在线RLHF框架,通过两种采样策略实现统一理论分析,证明了算法在$O(\log T)$ regret和$O(1/T)$ sub-optimality gap下的效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07331 2026-05-11 cs.LG cs.AI 89%

Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective

重新思考LLM策略优化中的重要性采样:从累积token视角

Yuheng Zhang, Chenlu Ye, Shuowei Jin, Changlong Yu, Wei Xiong, Saurabh Sahu, Nan Jiang

机构 * UIUC(伊利诺伊大学香槟分校) University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CTPO,通过累积token重要性采样比解决偏倚-方差困境,结合位置自适应裁剪提升稳定性,实现更一致的正则化,在数学推理基准上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01003 2026-05-11 cs.LG cs.AI 88%

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

ESSAM:一种用于内存高效的LLM微调的强化学习竞争进化策略方法

Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ESSAM,结合进化策略的零阶搜索与SAM提升泛化能力,实现低内存高精度的LLM微调,实验显示其在GSM8K任务中表现优异,内存使用显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06850 2026-05-11 cs.LG cs.AI 88%

How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

如何在RL后训练中压缩KV缓存?基于影子遮罩的内存高效对齐

Rui Zhu, Weiheng Bai, Qiushi Wu, Yang Ren, Haixu Tang, Yuchu Liu

机构 * Yale University(耶鲁大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 后训练与偏好优化 :post-training(title);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出影子遮罩蒸馏方法,用于缓解RL后训练中KV缓存内存瓶颈问题,通过减少采样时的上下文密度来降低偏置,提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06895 2026-05-11 cs.AI 87%

Mitigating Cognitive Bias in RLHF by Altering Rationality

通过调整理性度来缓解强化学习中的人类反馈认知偏差

Tiffany Horter, Andrew Markham, Niki Trigoni, Serena Booth

机构 * University of Oxford(牛津大学) Brown University(布朗大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出通过动态调整理性参数beta来缓解人类反馈中的认知偏差,提升奖励学习模型的理性度,即使在存在强烈偏见的偏好数据集上也能获得更理性的下游模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21183 2026-05-11 cs.LG cs.AI cs.CL 87%

MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge

MaPPO:结合先验知识的最大后验偏好优化

Guangchen Lan, Sipeng Zhang, Tianle Wang, Yuwei Zhang, Daoan Zhang, Xinpeng Wei, Xiaoman Pan, Hongming Zhang, Dong-Jun Han, Christopher G. Brinton

机构 * Purdue University(普渡大学) University of California, San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Meta, FAIR Yonsei University(延世大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MaPPO通过整合先验奖励知识优化偏好学习,提升对齐性能,无需额外超参数,适用于离线和在线设置,支持DPO变体插件,实验显示在多个基准上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15339 2026-05-11 cs.LG cs.CL 86%

UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types

UNA: 一种统一的监督框架,用于高效对齐跨反馈类型的大型语言模型

Zhichao Wang, Bin Bi, Can Huang, Shiva Kumar Pentyala, Zixu James Zhu, Sitaram Asur, Na Claire Cheng, Cheng Wan, Dong Nie, Lingzi Hong

机构 * Salesforce RadixArk ChatAlpha AI University of North Texas(北得克萨斯大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 UNA框架通过通用隐式奖励函数统一处理二元、成对和评分反馈,理论证明其最优性,实验验证其在经典基准上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08037 2026-05-11 cs.LG cs.AI 84%

Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph

超越成对:你的语言模型其实是在优化一个偏好图

Ning Liu, Chuanneng Sun, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphDPO,通过构建偏好图结构优化语言模型,解决传统成对优化在处理多轮次数据时的局限性,提升模型在推理和编程任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07503 2026-05-11 cs.CV 83%

Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers

Diffusion-APO:基于轨迹的直接偏好对齐用于视频扩散变换器

Jingyuan Zhu, Biaolong Chen, Le Zhang, Aixi Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);preference optimization(abstract)

AI总结 本文提出Diffusion-APO,通过同步训练噪声与推理时的去噪路径,解决视频扩散模型与人类意图对齐的问题,采用统一的RLHF框架实现灵活的多阶段偏好对齐,提升视觉质量和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06730 2026-05-11 cs.LG 83%

Semantic State Abstraction Interfaces for LLM-Augmented Portfolio Decisions: Multi-Axis News Decomposition and RL Diagnostics

语义状态抽象接口用于LLM增强的组合决策:多轴新闻分解与强化学习诊断

Likhita Yerra, Remi Uttejitha Allam

机构 * AIVANCITY School of AI & Data(AIVANCITY人工智能与数据学院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出语义状态抽象接口(SSAI),通过多轴新闻分解和强化学习诊断,提升稀疏文本决策系统的可解释性与性能。

Comments 18 pages, 3 figures. NeurIPS 2024 manuscript style (preprint)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG 81%

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00425 2026-05-11 cs.AI 81%

AEM: Adaptive Entropy Modulation for Multi-Turn Agentic Reinforcement Learning

AEM:多轮代理强化学习中的自适应熵调节

Haotian Zhao, Songlin Zhou, Yuxin Zhang, Stephen S. -T. Yau, Wenyu Zhang, Lun Tian, Tianshu Zhu, Yifeng Huang, Yucheng Zeng, Jingnan Gu, Daxiang Dong, Jianmin Wu

机构 * Baidu(百度) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AEM通过自适应调节熵动态,改进多轮代理强化学习中的探索与利用平衡,无需监督即可提升性能。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07105 2026-05-11 cs.LG cs.CL cs.CY cs.IT math.IT 81%

Theoretical Limits of Language Model Alignment

语言模型对齐的理论极限

Lucas Monteiro Paes, Natalie Mackraz, Barry-John Theobald, Federico Danieli

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型对齐的理论极限,通过推导KL散度预算下的最大预期奖励增益,揭示了KL正则化对齐的信息论限制,并证明了奖励融合能缓解奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07701 2026-05-11 cs.CL 79%

Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models

指导不是超参数:在扩散语言模型中学习动态控制

Fan Zhou, Tim Van de Cruys

机构 * KU Leuven(卢森堡大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

AI总结 本文提出通过强化学习学习动态指导轨迹,以解决扩散模型中指导尺度固定导致的可控性与生成质量平衡问题。

Comments ReALM-GEN@ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07288 2026-05-11 cs.CV cs.AI 79%

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Sword: 通过动态潜在自举实现风格鲁棒的世界模型作为模拟器用于VLA策略后训练

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Swinburne University of Technology(西敏大学) JDT AI Infra(JDT AI基础设施)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出Sword框架,通过结构引导的风格增强和动态潜在自举提升VLA模型在特定环境中的泛化能力、生成质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07011 2026-05-11 cs.LG 79%

Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

双代理协同训练用于健康教练的隐式对抗偏好优化

Da Long, Lingyi Fu, Diya Michelle Rao, Jasmine Ruales Carrera, Yang Bai, Shandian Zhe

机构 * Kahlert School of Computing University of Utah(Utah大学计算学院Kahlert学院) Department of Health and Kinesiology University of Utah(健康与运动科学系Utah大学)

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract);分类 cs.LG

AI总结 本文提出双代理框架,通过隐式对抗偏好优化提升健康教练质量,改进对话和模拟器训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08031 2026-05-11 cs.CV 78%

Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models

面向视觉语言模型的无对象幻觉强化反学习

Kaidi Jia, Yujie Lin, Chengyi Yang, Jiayao Ma, Jinsong Su

机构 * Xiamen University(厦门大学)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 本文提出HFRU框架,通过视觉编码器深度语义删除,结合对齐破坏与GRPO优化,实现高效反学习,减少对象幻觉,实验显示在目标识别和人脸识别任务中性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08007 2026-05-11 cs.LG 77%

Interpreting Reinforcement Learning Agents with Susceptibilities

用脆弱性解释强化学习智能体

Chris Elliott, Einar Urdshals, David Quarel, Daniel Murfet

机构 * Timaeus

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本文将神经网络可解释性技术扩展到深度强化学习的后悔设定,探讨脆弱性在简单网格世界模型中的应用,揭示模型在参数空间中的内部发展特征。

Comments 55 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06755 2026-05-11 cs.LG cs.AI 73%

Gradient Extrapolation-Based Policy Optimization

基于梯度外推的策略优化

Ismam Nur Swapnil, Aranya Saha, Tanvir Ahmed Khan, Mohammad Ariful Haque, Ser-Nam Lim

机构 * Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) University of Maryland, College Park(马里兰大学学院公园分校) Illinois Institute of Technology(伊利诺伊理工学院) University of Central Florida(佛罗里达中央大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GXPO算法,通过三步反向传播模拟多步前瞻,提升强化学习中大语言模型的推理能力,实验显示在数学推理任务中性能优于GRPO和SFPO。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07545 2026-05-11 cs.CV cs.AI 70%

Implicit Preference Alignment for Human Image Animation

隐式偏好对齐用于人类图像动画

Yuanzhi Wang, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Kai Yu, Tianxiang Zheng, Qinglin Lu, Zhen Cui

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Tencent Hunyuan(腾讯文脉)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出隐式偏好对齐框架,通过最大化自动生成高质量样本的似然并惩罚与预训练先验的偏差,提升手部生成质量并降低偏好数据构建门槛。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07394 2026-05-11 cs.CV cs.AI 70%

BalCapRL: A Balanced Framework for RL-Based MLLM Image Captioning

BalCapRL:一种基于RL的MLLM图像描述的平衡框架

Shaokai Ye, Vasileios Saveris, Yihao Qian, Jiaming Hu, Elmira Amirloo, Peter Grasch

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BalCapRL框架,通过联合优化正确性、参考覆盖和语言质量,解决图像描述中因评价指标狭窄导致的权衡问题,并通过改进的奖励解耦归一化和长度条件奖励遮蔽提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07114 2026-05-11 cs.LG 70%

Where to Spend Rollouts: Hit-Utility Optimal Rollout Allocation for Group-Based RLVR

在何处分配 rollout:用于基于组的 RLVR 的 hit-utility 优化 rollout 分配

Tao Wang, Shuo Li, Yan Sun, Dongsheng Ding, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学) New Jersey Institute of Technology(新泽西理工学院) University of Tennessee Knoxville(田纳西大学肯纳邦克分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出 HORA 方法,通过最大化 hit-utility 提升 RLVR 的效率,实验证明其在多个基准上优于 GRPO,且兼容其他组基估计器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06987 2026-05-11 cs.LG cs.GT econ.TH stat.ML 70%

Response Time Enhances Alignment with Heterogeneous Preferences

响应时间增强异质偏好对齐

Federico Echenique, Alireza Fallah, Baihe Huang, Michael I. Jordan

机构 * Department of Economics, University of California, Berkeley(加州大学伯克利分校经济系) Department of Computer Science and Ken Kennedy Institute, Rice University(休斯敦大学计算机科学系和肯尼迪研究所) Departments of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Departments of Electrical Engineering and Computer Sciences and Statistics, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系和统计学系;巴黎Inria) Inria Paris

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过引入用户响应时间信号来纠正传统偏好数据中对异质偏好的估计偏差,证明该方法能准确识别群体平均偏好,提升大型语言模型对人类偏好的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23370 2026-05-11 cs.CV 67%

GRAPE: Let GRPO Supervise Query Rewriting by Ranking for Retrieval

GRAPE:通过检索排名监督查询重写

Zhaohua Zhang, Jianhuan Zhuo, Muxi Chen, Chenchen Zhao, Wenyu Jiang, Tianwen Jiang, Mingyang Chen, Yutang, Qiuyong Xiao, Jihong Zhang, Zhixun Su

机构 * Dalian University of Technology, Dalian, China(大连理工大学) Tencent HunYuan Data, Shenzhen, China(腾讯混元数据)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn)

AI总结 GRAPE通过组相对策略优化提升检索排名,改进多语言、长文本和多模态查询的检索性能,平均提升Recall@10 4.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14868 2026-05-11 cs.LG cs.AI 62%

Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning

Goldilocks RL: 调整任务难度以摆脱稀疏奖励进行推理

Ilia Mahrooghi, Aryo Lotfi, Emmanuel Abbe

机构 * EPFL(苏黎世联邦理工学院) Apple(苹果公司)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Goldilocks RL通过预测学生模型的难度来优化数据采样,利用GRPO训练提升模型性能,克服稀疏奖励带来的样本效率低问题。

Comments 28 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07274 2026-05-11 cs.AI cs.LG 62%

Structured Role-Aware Policy Optimization for Multimodal Reasoning

结构化角色感知策略优化用于多模态推理

Bingqing Jiang, Difan Zou

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) School of Computing & Data Science and Institute of Data Science, The University of Hong Kong(计算与数据科学学院和数据科学研究所,香港大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结构化角色感知策略优化(SRPO),通过角色感知的token级信用分配提升多模态推理中的证据基础推理能力,无需外部奖励模型。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07138 2026-05-11 cs.AI cs.LG 62%

Can You Break RLVER? Probing Adversarial Robustness of RL-Trained Empathetic Agents

你能破解RLVER吗?探测RL训练同理心代理的对抗鲁棒性

Deeraj S K, Sadhana Devarajan, Krishna Mehra, Sudhakar Mishra

机构 * Department of Artificial Intelligence(人工智能系) Sardar Vallabhbhai National Institute of Technology(萨达尔·瓦拉布希·国家理工学院)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过构建对抗同理心基准AEB和引入情感一致性评分ECS,评估RL训练同理心代理在对抗环境下的鲁棒性,发现RLVER-PPO-Think在情感响应上优于基线模型,但ECS评分无显著提升,表明RL训练增强了情感响应但未改善可观测状态跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 50%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏