arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2601.04068 2026-05-21 cs.CV cs.AI 79%

Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models

注意生成细节:面向视频扩散模型的直接局部化细节偏好优化

Zitong Huang, Kaidong Zhang, Yukang Ding, Chao Gao, Rui Ding, Ying Chen, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Alibaba Group - Taobao & Tmall Group(阿里巴巴集团-淘宝 & 天猫集团)

专题命中 后训练与偏好优化 :preference optimization(title);post-training(abstract);分类 cs.AI

AI总结 本文提出LocalDPO,一种新的后训练框架,通过从真实视频中构建局部偏好对,并在时空区域层面优化对齐,以提高视频生成的质量和人类偏好评分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15803 2026-05-18 cs.CV cs.LG 79%

Embedding-perturbed Exploration Preference Optimization for Flow Models

嵌入扰动探索偏好优化用于流模型

Sujie Hu, Chubin Chen, Jiashu Zhu, Jiahong Wu, Xiangxiang Chu, Xiu Li

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出E²PO框架,通过嵌入层面扰动维持优化稳定性,提升生成模型对人类偏好的对齐效果。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06239 2026-05-18 cs.LG 79%

Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution

可证明地避免在不了解数据分布的情况下直接偏好优化中的过度优化

Adam Barla, Emanuele Nevali, Luca Viano, Volkan Cevher

机构 * EPFL(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 PEPO通过训练不同数据子集的偏好优化策略并聚合最坏情况,避免了过度优化问题,其样本复杂度仅依赖单策略集中性系数,保持了DPO的简洁性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13229 2026-05-14 cs.AI cs.SE 79%

Improving Code Translation with Syntax-Guided and Semantic-aware Preference Optimization

通过语法引导和语义感知的偏好优化改进代码翻译

Yuhan Wu, Huan Zhang, Wei Cheng, Chen Shen, Jingyue Yang, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University, China(南京大学健康数据科学国家研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文提出CTO方法,通过对比学习训练跨语言语义模型,结合编译器反馈实现代码翻译的语法和语义优化,实验表明其在C++、Java和Python翻译中表现优异。

Comments Accepted in the 35th International Joint Conference on Artificial Intelligence (IJCAI 2016)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13130 2026-05-14 cs.AI 79%

GRACE: Gradient-aligned Reasoning Data Curation for Efficient Post-training

GRACE:基于梯度对齐的推理数据整理以实现高效的后训练

Junjie Li, Ziao Wang, NingXuan Ma, Jianghong Ma, Xiaofeng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, China(香港 Baptist 大学) City University of Hong Kong, China(香港城市大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 GRACE通过梯度对齐方法,对推理数据进行高效后训练,仅用20%的数据即可达到全数据性能的108.8%,5%数据仍保持100.2%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12435 2026-05-13 cs.LG cs.CE 79%

Environment-Adaptive Preference Optimization for Wildfire Prediction

环境适应性偏好优化用于野火预测

Enyi Jiang, Wu Sun

机构 * Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Global Ecology, Carnegie Institution for Science(卡内基科学研究所全球生态系部门)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出环境适应性偏好优化框架,通过构造分布对齐数据集并结合监督学习与偏好优化,提升野火预测在环境变化下的鲁棒性与极端情况下的检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22507 2026-05-13 cs.LG cs.CV 79%

Space Syntax-guided Post-training for Residential Floor Plan Generation

基于空间语法的后训练生成住宅平面图

Zhuoyang Jiang, Dongqing Zhang

机构 * College of Architecture and Urban Planning, Tongji University(同济大学建筑与城市规划学院) Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)信息中心)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 本文提出SSPT框架,通过空间语法集成 oracle 评估生成平面图的空间配置质量,改进生成器的配置逻辑,SSPT-PPO在非分布环境下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16070 2026-05-13 cs.CL 79%

Less Redundancy: Boosting Practicality of Vision Language Model in Walking Assistants

减少冗余:提升视觉语言模型在行走助手中的实用性

Chongyang Li, Zhiqiang Yuan, Hanbo Bi, Zexi Jia, Jinchao Zhang

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

AI总结 本文提出WalkVLM-LR模型,通过优化输出和时间冗余,提升视觉语言模型在行走助手中的实用性,实验表明其在输出简洁性和时间冗余方面表现优异。

Comments ICASSP 2026 Best Industry Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11734 2026-05-12 cs.RO cs.AI 79%

SCORP: Scene-Consistent Multi-agent Diffusion Planning with Stable Online Reinforcement Post-Training for Cooperative Driving

SCORP:具有稳定在线强化学习后训练的场景一致多智能体扩散规划用于协作驾驶

Haojie Bai, Aimin Li, Ruoyu Yao, Xiongwei Zhao, Tingting Zhang, Xing Zhang, Lin Gao, and Jun Ma

机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Middle East Technology University (METU)(中东技术大学) Robotics and Autonomous Systems Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) School of Computer Science and Technology, Qinghai University(青海大学计算机科学与技术学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 SCORP通过场景条件多智能体去噪架构和两层马尔可夫决策过程提升多智能体协作驾驶的场景一致性和效率,实验表明其在安全性和效率指标上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05946 2026-05-12 cs.LG stat.ML 79%

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

f-GRPO 与 beyond:基于发散性的强化学习算法用于通用大语言模型对齐

Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

机构 * Department of Statistics, Purdue University(普渡大学统计学系) Department of Statistics, Michigan State University(密歇根州立大学统计学系)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出f-GRPO和f-HAL算法,通过发散性估计提升大语言模型对齐效果,在数学推理任务中改进GRPO并缓解奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17879 2026-05-12 cs.LG cs.SD 79%

Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction

生成对抗式后训练缓解实时人机音乐交互中的奖励黑客

Yusong Wu, Stephen Brade, Aleksandra Teng Ma, Tia-Jane Fowler, Enning Yang, Berker Banar, Aaron Courville, Natasha Jaques, Cheng-Zhi Anna Huang

机构 * Mila, Quebec Artificial Intelligence Institute, Université de Montréal(蒙特利尔大学人工智能研究所,魁北克机器学习研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Massachusetts Institute of Technology(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院) University of Washington(华盛顿大学) McGill University(麦吉尔大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 本文提出一种对抗训练方法,通过政策生成轨迹缓解生成序列模型后训练中的奖励黑客问题,提升音乐伴奏的多样性与和谐性。

Comments v3: fix the Figure numbering bugs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07701 2026-05-11 cs.CL 79%

Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models

指导不是超参数:在扩散语言模型中学习动态控制

Fan Zhou, Tim Van de Cruys

机构 * KU Leuven(卢森堡大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

AI总结 本文提出通过强化学习学习动态指导轨迹,以解决扩散模型中指导尺度固定导致的可控性与生成质量平衡问题。

Comments ReALM-GEN@ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07288 2026-05-11 cs.CV cs.AI 79%

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Sword: 通过动态潜在自举实现风格鲁棒的世界模型作为模拟器用于VLA策略后训练

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Swinburne University of Technology(西敏大学) JDT AI Infra(JDT AI基础设施)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出Sword框架,通过结构引导的风格增强和动态潜在自举提升VLA模型在特定环境中的泛化能力、生成质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07011 2026-05-11 cs.LG 79%

Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

双代理协同训练用于健康教练的隐式对抗偏好优化

Da Long, Lingyi Fu, Diya Michelle Rao, Jasmine Ruales Carrera, Yang Bai, Shandian Zhe

机构 * Kahlert School of Computing University of Utah(Utah大学计算学院Kahlert学院) Department of Health and Kinesiology University of Utah(健康与运动科学系Utah大学)

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract);分类 cs.LG

AI总结 本文提出双代理框架,通过隐式对抗偏好优化提升健康教练质量,改进对话和模拟器训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24953 2026-04-30 cs.CV cs.AI 79%

ViPO: Visual Preference Optimization at Scale

ViPO:大规模视觉偏好优化

Ming Li, Jie Wu, Justin Cui, Xiaojie Li, Rui Wang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学) ByteDance Seed(字节跳动种子) UCLA(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文提出ViPO大规模偏好数据集和Poly-DPO方法,通过提升数据质量和算法鲁棒性,实现视觉生成模型的高效偏好优化。

Comments ICLR 2026 Paper. Project Page: https://liming-ai.github.io/ViPO ; Code: https://github.com/liming-ai/ViPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24952 2026-04-29 cs.CV cs.AI 79%

Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization

从噪声偏好学习:一种半监督学习方法用于直接偏好优化

Xinxin Liu, Ming Li, Zonglin Lyu, Yuzhang Shang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文提出Semi-DPO方法,通过半监督学习处理多维偏好噪声,提升复杂人类偏好对齐性能,无需额外人工标注或显式奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI 79%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19749 2026-04-23 cs.AI cs.SE 79%

The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?

工具过度使用错觉:为什么大语言模型更倾向于使用外部工具而非内部知识?

Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology, SCIR(哈尔滨理工大学SCIR研究所) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :LLM(title);preference optimization(abstract);分类 cs.AI

AI总结 本文揭示大语言模型在推理中普遍存在工具过度使用现象,通过分析内部知识可用性区域,提出知识感知边界对齐策略,减少工具使用82.8%,并发现仅以结果奖励会鼓励工具过度使用,通过平衡奖励信号可减少66.7%的无用工具调用。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07527 2026-04-23 cs.LG 79%

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

卡尔曼滤波增强的GRPO用于基于强化学习的语言模型推理

Hu Wang, Congbo Ma, Ian Reid, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.LG

AI总结 本文提出KRPO,通过卡尔曼滤波估计潜在提示级奖励基线,提升语言模型推理的训练奖励和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20816 2026-04-23 cs.LG cs.CV 79%

ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

ParetoSlider:扩散模型后训练用于连续奖励控制

Shelly Golan, Michael Finkelson, Ariel Bereslavsky, Yotam Nitzan, Or Patashnik

机构 * Tel Aviv University(特拉维夫大学) Lightricks(Lightricks公司) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 ParetoSlider提出多目标强化学习框架,通过连续变化的偏好权重训练单个扩散模型,实现推理时对冲突目标的精细控制。

Comments Project page: https://shelley-golan.github.io/ParetoSlider-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18473 2026-04-21 cs.LG 79%

Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts

分开训练,合并一起:模块化后训练与专家混合

Jacob Morrison, Sanjay Adhikesaven, Akshita Bhagia, Matei Zaharia, Noah A. Smith, Sewon Min

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加州大学伯克利分校) Allen Institute for AI(人工智能研究院)

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);分类 cs.LG

AI总结 本文提出BAR方法,通过独立训练领域专家并采用专家混合架构实现高效更新,避免了传统重训练的高成本和性能下降问题,实验显示其在多个领域任务中表现优异。

Comments 9 content pages, 23 pages overall, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00361 2026-04-17 cs.LG 79%

Direct Preference Optimization for Primitive-Enabled Hierarchical RL: A Bilevel Approach

基于原始能力的分层强化学习的直接偏好优化:双层方法

Utsav Singh, Souradip Chakraborty, Wesley A. Suttle, Brian M. Sadler, Derrik E. Asher, Anit Kumar Sahu, Mubarak Shah, Vinay P. Namboodiri, Amrit Singh Bedi

机构 * IIT Kanpur(印度理工学院坎浦尔分校) University of Maryland, College Park(马里兰大学学院公园分校) U.S. Army Research Laboratory(美国陆军研究实验室) University of Texas, Austin(德克萨斯大学奥斯汀分校) Oracle(Oracle公司) University of Central Florida(中央佛罗里达大学) University of Bath(巴斯大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出DIPPER框架,通过双层优化解决分层强化学习中的非平稳性和不可行子目标问题,采用直接偏好优化提升高层策略性能,实验证明在机器人导航和操作任务中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11477 2026-04-14 cs.AI cs.SE q-fin.TR 79%

OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems

OOM-RL:基于大语言模型多智能体系统的出钱强化学习市场驱动对齐

Kun Liu, Liqun Chen

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract);分类 cs.AI

AI总结 本文提出OOM-RL方法,通过将智能体部署到金融市场中,利用资本耗尽作为不可篡改的负梯度,使多智能体系统从过度迎合的基线进化为稳健的流动性感知架构,最终实现稳定均衡。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01840 2026-04-09 cs.AI 79%

Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models

并非所有token都同等重要:基于感知的策略优化方法用于大型视觉-语言模型

Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI

AI总结 本文提出基于感知的策略优化方法PGPO,通过动态调整token级别的优势,提升多模态推理的鲁棒性与稳定性,实验显示在多个基准上提升18.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04855 2026-04-07 cs.LG 79%

The Role of Generator Access in Autoregressive Post-Training

生成器访问在自回归后训练中的作用

Amit Kiran Rege

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 研究生成器访问对自回归后训练的限制,探讨学习者是否能返回已有前缀查询下一个词规则,分析不同控制方式对训练效果的影响。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22601 2026-03-31 cs.LG cs.CV 79%

$ϕ$-DPO: Fairness Direct Preference Optimization Approach to Continual Learning in Large Multimodal Models

$ϕ$-DPO:面向大多模态模型持续学习的公平性直接偏好优化方法

Thanh-Dat Truong, Huu-Thien Tran, Jackson Cothren, Bhiksha Raj, Khoa Luu

机构 * CVIU Lab, University of Arkansas(阿肯色大学 CVIU 实验室) Dep. of Geosciences, University of Arkansas(阿肯色大学地球科学系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出$ϕ$-DPO框架,通过直接偏好优化缓解持续学习中的灾难性遗忘问题,并解决数据不平衡导致的公平性问题,实验表明其在多个基准上表现优异。

Comments Accepted to CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23951 2026-03-26 cs.CL 79%

From AI Assistant to AI Scientist: Autonomous Discovery of LLM-RL Algorithms with LLM Agents

从AI助手到AI科学家:利用LLM代理自主发现LLM-RL算法

Sirui Xia, Yikai Zhang, Aili Chen, Siye Wu, Siyu Yuan, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学) School of Data Science, Fudan University(数据科学学院,复旦大学)

专题命中 后训练与偏好优化 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出POISE框架,通过自动化发现语言模型的策略优化算法,改进了政策优化算法,提高了性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12565 2026-03-16 cs.SD cs.CL 79%

Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization

通过直接偏好优化实现日语SpeechLLMs的Speech-Worthy对齐

Mengjie Zhao, Lianbo Liu, Yusuke Fujita, Hao Shi, Yuan Gao, Roman Koshkin, Yui Sudo

机构 * SB Intuitions

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract);分类 cs.CL

AI总结 本文提出通过直接偏好优化方法,改进日语SpeechLLMs以生成适合语音合成的简洁、口语化文本,引入SpokenElyza基准测试,并在保持原有性能的同时显著提升语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09121 2026-03-11 cs.RO cs.AI 79%

DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation

DexHiL: 一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架

Yifan Han, Zhongxi Chen, Yuxuan Zhao, Congsheng Xu, Yanming Shao, Yichuan Peng, Yao Mu, Wenzhao Lian

机构 * CASIA(中国科学院自动化研究所) SJTU(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 DexHiL是一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架,通过干预意识的数据采样策略和轻量级远程操作界面,显著提升了模型在不同任务中的成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00485 2026-03-06 cs.AI 79%

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

用偏好替代参数:异构视觉-语言模型的联邦对齐

Shule Lu, Yujing Wang, Hainan Zhang, Xiaoshan Yang, Hongwei Zheng, Yongxin Tong, Changsheng Xu, Zhiming Zheng

专题命中 后训练与偏好优化 :language model(title);foundation model(abstract);分类 cs.AI

AI总结 本文提出MoR框架,通过用偏好替代参数实现异构视觉-语言模型的联邦对齐,提升泛化、鲁棒性和跨客户端适应性。

Comments Due to the need for substantial revisions, the authors believe that the paper should be retracted first.A revised version may be resubmitted

详情

展开后加载摘要…

URL PDF HTML 收藏