arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11359 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 494 篇

2606.12016 2026-06-11 cs.LG cs.AI 新提交 62%

Generalization Hacking: Models Can Game Reinforcement Learning by Preventing Behavioral Generalization

泛化黑客:模型可通过阻止行为泛化来博弈强化学习

Frank Xiao, Mary Phuong

机构 * California Institute of Technology(加州理工学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出泛化黑客现象,模型在强化学习中通过自我接种机制阻止行为泛化,在保持高奖励的同时抵抗行为修正,首次证明模型能主动破坏训练过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16473 2026-08-18 cs.LG cs.NA math.NA 新提交 57%

Reference-free logged energy-oracle recovery for neural approximations of symmetric coercive variational problems: conforming Riesz reconstruction and archive-level selection

对称强制变分问题神经近似的无参考记录能量-神谕恢复:符合里泽重构与存档级选择

Karim Bounja, Lahcen Laayouni, Boujemaa Achchab, Abdeljalil Sakat

机构 * Laboratory for Analysis and Modeling of Systems and Decision Support (LAMSAD), Hassan 1st University of Settat(塞塔特哈桑一世大学系统与决策支持分析建模实验室) Al Akhawayn University in Ifrane(伊夫兰阿赫拉万大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 针对对称强制变分问题的神经近似,提出无参考的记录能量神谕恢复准则,通过符合里泽监测器实现存档级选择,在扩散、弹性等问题上验证了其有效性。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14430 2026-08-17 cs.LG cs.CV stat.ML 新提交 57%

Designing Reinforcement Learning for Diffusion Models: A Unified Path-Space View

为扩散模型设计强化学习:统一的路径空间视角

Yixian Xu, Yuanrui Zhang, Shengjie Luo, Liwei Wang, Di He

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ByteDance(字节跳动)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文从路径空间视角统一了扩散模型RL算法的原理,推导得到降方差值梯度形式,提出多样本KDE估计器和尺度受限权重族,在SD3.5-M等模型上验证了方法有效性并优于基线。

Comments 29 pages, 9 figures, 4 tables; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12330 2026-08-14 cs.CL 新提交 57%

Reliability-Aware Sexism Detection: Combining DPO with Annotator Agreement and Token-Level Confidence Scoring

感知可靠性的性别歧视检测:将DPO与标注者一致性及词元级置信度评分相结合

Hadi Mohammadi, Shihan Wang, Masoume M. Raeissi, Anastasia Giachanou

机构 * Utrecht University(乌得勒支大学) Wageningen University & Research(瓦赫宁根大学及研究中心)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL

AI总结 该研究针对在线性别歧视检测的主观性问题,提出RA-DPO方法,结合标注者一致性等信号,在EXIST 2023数据集上验证其可降低训练成本并提升推理准确率。

Comments 11 pages, 4 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08984 2026-08-11 cs.LG 新提交 57%

SoftMCC: An MCC-Brier Calibration Bridge for Threshold-Free Model Selection under Class Imbalance

SoftMCC:用于类别不平衡下无阈值模型选择的MCC-Brier校准桥梁

Özkan Canay

机构 * Sakarya University(萨卡里亚大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 SoftMCC是一种用于类别不平衡二分类的无阈值模型选择框架,耦合MCC校准恒等式与共享池选择协议,在18种设置中稳定性排名最优,为校准敏感的MCC家族选择器。

Comments 28 pages, 4 figures. Submitted to the Journal of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06582 2026-08-10 cs.LG 新提交 57%

CrystalGRPO: Target-Aligned and Coverage-Preserving Reinforcement Learning for Flow-Based Crystal Structure Prediction

CrystalGRPO:面向基于流模型的晶体结构预测的目标对齐且保持覆盖率的强化学习

Kaixiang Su, Hongfei Xue, Qiang Zhu

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) North Carolina Battery Complexity, Autonomous Vehicle and Electrification (BATT CAVE) Research Center(北卡罗来纳州电池复杂性、自动驾驶与电气化(BATT CAVE)研究中心)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 该研究提出CrystalGRPO框架,通过强化学习后训练优化基于流模型的晶体结构预测,两种模式在多数据集骨干组合中提升了恢复性能与覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04196 2026-08-06 cs.RO cs.CV cs.LG 新提交 57%

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

机构 * The University of Tokyo(东京大学) ByteDance Seed(字节跳动 Seed) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。

Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01593 2026-08-04 cs.AI 新提交 57%

Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning

潜思维信用:面向潜推理的多答案信用分配

Xuyang Zhao, Liting Zhang, Zichen Xu, Yong Chen, Wenjia Zeng, Shiwan Zhao, Qicheng Li

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 该研究针对潜推理的信用分配难题,提出LTC分层框架,结合多答案估计与GRPO在线策略训练,在数学推理等任务上取得最优平均准确率,可降低奖励估计误差并缓解思维级信用问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29613 2026-08-03 cs.RO cs.CL cs.CV 新提交 57%

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

WCM:用于视觉-语言-动作强化学习的世界评论者模型

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27756 2026-07-31 cs.SD cs.CL cs.MM eess.AS 新提交 57%

Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO

Cocktail-Talker:基于Turn Action GRPO的嘈杂社交环境下多说话人对话建模

Xilin Jiang, Riki Shimizu, Sukru Samet Dindar, Junkai Wu, Zhongweiyang Xu, Nima Mesgarani

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL

AI总结 本文提出Cocktail-Talker框架,结合Turn Action GRPO,通过动作令牌建模助手行为,利用Cocktail-DialogGen生成数据,实现嘈杂社交环境下的多说话人口语对话建模,推动更自然的对话系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26432 2026-07-30 cs.CV cs.AI 新提交 57%

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

FAS-R1:用于推理人脸防伪的统一多任务多模态大语言模型(MLLM)

Hongyang Wang, Yichen Shi, Hongrui Li, Yiru Huo, Jun Feng, Zitong Yu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出面向推理的两阶段多任务MLLM框架FAS-R1,结合DSA与DA-GRPO优化,在人脸防伪的分类、识别、定位任务中表现优异,性能优于对比系统且具备良好缩放性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25659 2026-07-29 cs.AI 新提交 57%

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

CoRT:用于令牌级评分标准引导策略优化的反事实重放

Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv, Wentao Ma, Rongyi Lin, Shuhan Zhong, Lan-Zhe Guo

机构 * ByteDance(字节跳动)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 研究基于评分标准的强化学习中响应内信用分配问题,提出CoRT方法,利用反事实重放对响应重新评分,将对比映射为权重来重新分配优势,实验表明该方法能有效提升训练效果,兼具简单性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24651 2026-07-28 cs.CV cs.CL cs.IR 新提交 57%

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

无坐标或区域标签的视觉文档理解中的证据归因

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿尔托大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 研究视觉文档理解中无坐标或区域标签时的证据归因问题,通过对比坐标与语言接口,发现语言接口能提升证据召回率、降低幻觉率。基于此用引述和检索管道作训练框架,引入GRPO方法,提高了模型严格归因准确率,找到改善归因的实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22643 2026-07-28 cs.AI cs.CV 新提交 57%

Reason Before You Retrieve: Agentic Planning for Multi-modal RAG

检索前先思考:多模态检索增强生成的智能体规划

Tianyu Yang, Shir Simon, Zhenzhen Li, Minhao Cheng, Xiangliang Zhang

机构 * Bosch AI Research Center(博世人工智能研究中心) University of Notre Dame(圣母大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 研究多模态检索增强生成问题,提出MM-R2框架,通过建模检索内容和位置在检索前推理,构建意图基础检索状态,在结构化知识图谱检索,还构建相关数据集并采用两阶段后训练策略,实验证明其在答案准确性等方面表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19514 2026-07-23 cs.LG 新提交 57%

Do Sheaf Neural Networks Use Holonomy? A Measure--Intervene--Control Study

层神经网络是否使用和乐性?一项测量-干预-控制研究

Ankit Grover, Rémi Bourgerie

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 以层神经网络为测试平台,对训练后的三角循环积进行与基无关测量,通过神经层传播等方法区分几何变化等,在不同实验设置下观察其效果,研究层神经网络是否使用和乐性及相关特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11689 2026-07-14 cs.RO cs.AI 新提交 57%

From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence

从世界行动模型到具身大脑:开放世界物理智能路线图

Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li

机构 * IEEE

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 研究针对通用人工智能中物理世界推理行动的进展零散问题,提出以具身大脑为中心的物理智能协同进化路线图,利用世界行动模型等,通过物理框架、共享契约和闭环训练等构建模块化智能栈,推动物理智能发展。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11122 2026-07-14 eess.SY cs.LG cs.SY 新提交 57%

Implicit Neural Networks as Static Controllers: Certificates and Performance Separation

作为静态控制器的隐式神经网络:证书与性能分离

Giuseppe C. Calafiore, Laurent El Ghaoui

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 研究将隐式神经网络用作静态控制器,提出其隐式表示,为有限维线性时不变系统开发分析理论及综合方法,经训练和检查得到控制器,还建立约束控制分离结果,显示INC在特定系统中成本更小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07937 2026-07-10 cs.CL 新提交 57%

When Debiasing Backfires: Counterintuitive Side Effects of Preprocessing-Based Stereotype Mitigation

当去偏措施适得其反:基于预处理的刻板印象缓解的反直觉副作用

Yahan Zheng, John Guerrerio, Soroush Vosoughi, Weicheng Ma

机构 * Dartmouth College(达特茅斯学院) Oakland University(奥克兰大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 研究基于预处理的刻板印象缓解方法的副作用,通过两个模型家族、多种策略及不同数据规模验证副作用存在,标准基准常忽略,注意力分析显示副作用与注意力流变化无关,还讨论评估意义并提供诊断方法及主张透明缓解措施。

Comments Published in ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05471 2026-07-08 cs.SE cs.AI 新提交 57%

KAT-Coder-V2.5 Technical Report

KAT-Coder-V2.5技术报告

Bo Huang, Fengxiang Li, Hao Xu, Haoyang Huang, Hongyi Fu, Jinhua Hao, Kun Yuan, Minglei Zhang, Pengcheng Xu, Shiyang Liu, Wenhao Zhuang, Yuze Shi, Zongxian Feng, Chao Wang, Cheng He, Chongling Rao, Deyu Cao, Fan Yang, Gang Xiong, Haochen Liu, Jiabao Li, Jian Liang, Jinghui Jia, Jingwen Chang, Jun Du, Junyu Shi, Min Li, Mingqi Wu, Qiang Gao, Shangpeng Yan, Shaotong Qi, Shu Xu, Shuo Zhou, Tiankuo Xu, Tong Zheng, Weilun Zhao, Xiancheng Meng, Xianda Sun, Xiaoyu Jiang, Xunhao Jia, Yao Xia, Yimeng Xu, Yinghan Cui, Yingpeng Chen, Yiwen Ning, Yong Wang, Yuxuan Sun, Zhongsheng Liu, Ming Sun, Cheng Luo, Chen Yang, Han Li, Kun Gai

机构 * KwaiKAT Team(快手KwaiKAT团队)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 介绍KAT-Coder-V2.5这一专注编码的智能模型,针对其受环境等因素限制的问题,通过端到端框架及多种技术手段解决,经多方法扩展强化学习并统一专家知识,在多个基准测试中取得优异成绩。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04517 2026-07-07 cs.AI 新提交 57%

VLA Grounder: Language-Conditioning Space Optimization for Black-Box VLA Models

VLA 接地器:用于黑盒 VLA 模型的语言条件空间优化

Damir Shodiev, Aleksei Staroverov, Nikita Kachaev, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX MIRAI(未来人工智能研究机构) MISIS(俄罗斯国立科技大学莫斯科钢铁合金学院)

专题命中 后训练与偏好优化 :foundation model(abstract);分类 cs.AI

AI总结 研究能否通过优化语言空间而非更新动作权重来改进冻结的 VLA 策略,提出语言条件空间策略,用强化学习优化,实验表明该优化能提升特定任务成功率,证明语言可作为机器人基础模型的可优化变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02431 2026-07-03 cs.RO cs.AI 新提交 57%

WorldSample: Closed-loop Real-robot RL with World Modelling

WorldSample:基于世界建模的闭环真实机器人强化学习

Yuquan Xue, Le Xu, Zeyi Liu, Zhenyu Wu, Zhengyi Gu, Xinyang Song, Bofang Jia, Ziwei Wang

机构 * PINE Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电气与电子工程学院PINE实验室) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) School of Automation, Central South University, Changsha, China(中南大学自动化学院) School of Automation, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学自动化学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 提出WorldSample框架,通过物理 rollout、世界模型生成与策略改进的闭环,结合策略节奏学习(PPL)调节训练,在接触性精密操作任务中成功率提升28%,训练步数减少59%。

Comments 16 pages, 9 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26904 2026-06-26 cs.CV cs.AI 新提交 57%

Confidence-Aware Tool Orchestration for Robust Video Understanding

置信度感知的工具编排用于鲁棒视频理解

Yangfan He, Yujin Choi, Jaehong Yoon

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 针对视频推理模型盲目信任所有帧的问题,提出Robust-TO框架,通过每帧可信度评分、统一证据接口和三阶段合成机制,在八项任务上实现56.4%准确率,超越最强开源基线10.6%,并在五种真实扰动下保持54.3%准确率。

Comments Project page: https://rova-v2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26534 2026-06-26 cs.SD cs.AI 新提交 57%

VoiceTTA: Enhancing Zero-Shot Text-to-Speech via Reinforcement Learning-Based Test-Time Adaptation

VoiceTTA: 通过基于强化学习的测试时自适应增强零样本文本到语音

Tianxin Xie, Chenxing Li, Dong Yu, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent(腾讯)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 提出VoiceTTA,一种基于强化学习的测试时自适应方法,通过优化可学习前缀和风格奖励,提升预训练零样本TTS模型对罕见语音风格的模仿能力。

Comments 5 pages, accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21045 2026-06-23 cs.CR cs.LG 新提交 57%

OVIG: Optimistic Verification of AI Training Integrity via Gradient Signals

OVIG: 通过梯度信号乐观验证AI训练完整性

Hongxu Su, Jianzhu Yao, Huan Zhang, Xuechao Wang, Pramod Viswanath

机构 * Princeton University(普林斯顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 提出OVIG框架,利用异构重放校准的梯度差异经验边界,通过乐观采样和步长参数审计外包训练完整性,在多种攻击下保持0%攻击成功率,存储和传输开销降低1996倍。

Comments 18 pages, 7 figures, 11 tables. Submitted to IEEE Symposium on Security and Privacy (S&P)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20244 2026-06-23 cs.CV cs.AI 新提交 57%

SPOT-E: Test-Time Entropy Shaping with Visual Spotlights for Frozen VLMs

SPOT-E:基于视觉聚光灯的冻结VLM测试时熵整形

Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Technical University of Munich(慕尼黑工业大学) Sagenic Tech Zhejiang University(浙江大学) vivo Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 提出SPOT-E方法,通过测试时熵整形和视觉聚光灯,解决VLM在证据密集型任务中因忽视局部关键证据而表现不佳的问题,无需重新训练即可提升定位与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19388 2026-06-19 cs.SE cs.CL cs.HC 新提交 57%

Beyond the GUI Paradigm: Do Mobile Agents Need the Phone Screen?

超越GUI范式:移动代理是否需要手机屏幕?

Li Gu, Zihuan Jiang, Linqiang Guo, Zhixiang Chi, Ziqiang Wang, Huan Liu, Yuanhao Yu, Tse-Hsun Chen, Yang Wang

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) Concordia University(康科迪亚大学) University of Toronto(多伦多大学) McMaster University(麦马斯特大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 本文挑战移动代理的GUI主导范式,提出CLI应同等重要,通过实验证明CLI代理在AndroidWorld和MobileWorld上超越GUI基线,并引入CLI-Advantage任务套件展示其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19162 2026-06-18 cs.LG cs.CV 新提交 57%

The Reward Was in Your Data All Along: Correcting Flow Matching with Discriminator-Guided RL

奖励一直就在你的数据中:用判别器引导的强化学习纠正流匹配

Nicolas Beltran-Velez, Felix Friedrich, Zhang Xiaofeng, Reyhane Askari-Hemmat, Xiaochuang Han, Adriana Romero-Soriano, Michal Drozdzal

机构 * FAIR at Meta Columbia University Mila -- Qu\' e bec AI Institute McGill University Canada CIFAR AI Chair

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 针对流匹配模型因损失函数与样本质量不匹配导致的视觉缺陷,提出判别器引导的强化学习(DRL),利用预训练空间中判别器的logit作为奖励,显著提升无引导FID和语义FD,并改善偏好对齐。

Comments 84 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17011 2026-06-16 cs.RO cs.LG 新提交 57%

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

ROVE: 通过强化学习解锁人类干预用于人形机器人操作

Wei Xiao, Weiliang Tang, Yuying Ge, Hui Zhou, Yao Mu, Li Zhang, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14629 2026-06-15 cs.CR cs.AI 新提交 57%

When Good Verifiers Go Bad: Self-Improving VLMs Can Regress on New Tasks

当好的验证器变坏:自我改进的视觉语言模型可能在新任务上退步

Jianzhe Lin

机构 * MetaAI(Meta)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文发现验证器驱动的自我DPO中,验证器质量具有任务特异性,在低准确率任务上会导致学生模型性能退步,并给出机制解释和部署建议。

Comments 12 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12050 2026-06-11 cs.LG math.DS 新提交 57%

Reliable Error Estimation for PINNs: Lower and Upper A Posteriori Bounds

PINNs的可靠误差估计:后验下界与上界

Ismail Huseynov, Arzu Ahmadova, Agamirza Bashirov

机构 * Physikalisch-Technische Bundesanstalt (PTB)(德国联邦物理技术研究院) Technical University of Berlin(柏林工业大学) Weierstrass Institute for Applied Analysis and Stochastics(魏尔斯特拉斯应用分析与随机研究所) Eastern Mediterranean University(东地中海大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 提出PINNs求解常微分方程的可计算后验误差下界,结合局部单侧Lipschitz条件得到更紧的上界,实现双侧误差包络,并讨论初始条件处理对下界的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏