arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-18 至 2026-05-18 共收录 320 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 24 篇

2605.09994 2026-05-18 cs.DC cs.LG 85%

BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training

BatchWeave: 一种用于大规模基础模型训练的一致对象存储原生数据平面

Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

机构 * Lionrock AI Lab, China Merchants Group, Hong Kong, China(狮岩人工智能实验室,中国商人集团,香港,中国) Wuhan University, Wuhan, China(武汉大学,武汉,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 BatchWeave通过版本化清单和条件对象写入协调批量发布、恢复和生命周期管理,提供一致的分布式基础模型训练数据平面,支持事务全局批量、去中心化适应提交算法,提升吞吐量和故障隔离能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05297 2026-05-18 cs.SE cs.LG 84%

Building Specialized Software-Assistant ChatBot with Graph-Based Retrieval-Augmented Generation

构建基于图的检索增强生成专用软件助手聊天机器人

Mohammed Hilel, Yannis Karmim, Jean De Bodinat, Reda Sarehane, Antoine Gillon

机构 * RAKAM AI Lemon Learning

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于图的检索增强生成框架,将企业Web应用转换为状态-动作知识图,使LLM生成基于上下文的可靠帮助,通过与RAKAM和Lemon Learning的合作,展示了工程流程、图检索设计及生产DAP工作流整合。

Comments Accepted at ICMLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15865 2026-05-18 cs.SE 83%

From Text to DSL: Evaluating Grammar-Based Model Generation Using Open LLMs

从文本到DSL:利用开源LLMs评估基于语法的模型生成

Junaid Baber, Nicolas Hili, Didier Schwab, Léo Challier, Cécilia Satrin

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了不同规模的开源LLMs在无需微调的情况下,通过少量示例提示生成符合DSL的模型的能力,验证了小型开源LLMs在MDE中的可行性。

Comments This version includes corrections to several malformed references and incorrect arXiv links that appeared in the published conference version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15474 2026-05-18 cs.IR 83%

Jobs' AI Exposure Should Be Measured from Evidence, Not Model Priors

AI 对岗位的影响应从证据而非模型先验来衡量

Luca Mouchel, Pierre Bouquet, Yossi Sheffi

专题命中 指令微调 :LLM(summary_cn,abstract);prompting(abstract)

AI总结 本文主张通过基于证据的方法测量AI对岗位的影响,而非仅依赖LLM先验。提出一个检索增强框架,利用公开权重推理和检索到的新闻和论文摘要,为O*NET 30.2中的18796个职业-任务对分配AI影响标签,优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10499 2026-05-18 math.DS cs.DM 82%

A Three-Dimensional SFT with Sparse Columns

三维稀疏列SFT

Ville Salo, Ilkka Törmä

专题命中 指令微调 :SFT(title,title_cn)

AI总结 本文构建了一个非平凡的三维有限型子移位,其投影Z-子动力学为2稀疏,即任一垂直列中最多有两个非零符号。该子移位在子动力学方向上是确定性的,因此与部分单元自动机的时间空间图集拓扑共轭。还提出了由Wang立方体定义的变体及二元字母表的子移位。

Comments 28 pages, 5 figures; this version has slightly simpler mats

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00424 2026-05-18 cs.CR cs.AI cs.MA cs.SE 81%

Skills as Verifiable Artifacts: A Trust Schema and a Biconditional Correctness Criterion for Human-in-the-Loop Agent Runtimes

技能作为可验证的成果:为有人参与的代理运行时的可信架构和双向正确性标准

Alfredo Metere

机构 * Enclawed, LLC(Enclawed公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种可信架构和双向正确性标准,用于人类参与的代理运行时,强调技能验证的重要性,以确保运行时的可信性和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15217 2026-05-18 cs.AI cs.CY cs.LG econ.GN q-fin.EC 79%

Fair outputs, Biased Internals: Causal Potency and Asymmetry of Latent Bias in LLMs for High-Stakes Decisions

公平的输出,偏见的内部:在高风险决策中LLM中的因果潜能与潜在偏见的不对称性

Jagdish Tripathy, Marcus Buckmann

机构 * Bank of England(英格兰银行)

专题命中 指令微调 :LLM(title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,尽管指令微调的语言模型在高风险决策中表现公平,但其内部表示仍保留并放大了种族相关的偏见,且这种偏见在不同群体中不对称,需通过双层测试框架进行治理。

Comments 39 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23352 2026-05-18 cs.CV cs.AI 77%

Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling

动态树RPO:通过结构化采样打破独立轨迹瓶颈

Xiaolong Fu, Lichen Ma, Zipeng Guo, ShiPing Dong, Lan Yang, Tan Lit Sin, Gaojing Zhou, Yu He, Jingling Fu, Shizhe Zhou, Junshi Huang, Jason Li

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Beijing University of Chemical Technology(北京化工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 本文提出动态树RPO,通过树状结构采样策略和动态噪声强度,提升文本到图像生成的质量与效率,同时结合层调优强化学习方法,在多个基准测试中表现出色。

Comments Fig.3 updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15916 2026-05-18 cs.LG cs.AI cs.CV 73%

LoCO: Low-rank Compositional Rotation Fine-tuning

LoCO:低秩组合旋转微调

An Nguyen, Jaesik Choi, Anh Tong

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) INEEJI

专题命中 指令微调 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 LoCO提出一种低秩组合旋转微调方法,通过低秩斜对称矩阵构建正交变换,实现高效参数微调,适用于多领域模型适应,展现优于传统正交和非正交方法的性能。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03258 2026-05-18 cs.LG cs.CL 73%

The Right Answer, the Wrong Direction: Why Transformers Fail at Counting and How to Fix It

正确的答案,错误的方向:为什么Transformer在计数上失败以及如何修复

Gabriel Garcia

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究发现Transformer在计数任务中失败是由于输出路径与所需令牌对齐问题,通过局部调整输出头和注意力机制可提升计数性能。

Comments 27 pages, 3 figures, 18 tables. Code: https://github.com/Gpgabriel25/GeometricReadoutBottleneck

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10380 2026-05-18 cs.LG cs.AI cs.CL 67%

Subgraph-level Universal Prompt Tuning

子图级通用提示微调

Junhyun Lee, Wooseong Yang, Jaewoo Kang

机构 * Korea University(韩国大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 指令微调 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出子图级通用提示微调方法,通过在子图层面分配提示特征,提升模型在不同预训练策略下的泛化能力,在42/45全场景实验中表现优于传统方法。

Journal ref Information Sciences 749 (2026) 123516

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13169 2026-05-18 cs.CV cs.AI 57%

PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World

PanoWorld:迈向360度全景世界的空间超感知

Changpeng Wang, Xin Lin, Junhan Liu, Yuheng Liu, Zhen Wang, Donglian Qi, Yunfeng Yan, Xi Chen

机构 * Zhejiang University(浙江大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学伊维特分校) The University of Hong Kong(香港大学)

专题命中 指令微调 :instruction tuning(abstract);分类 cs.AI

AI总结 本文提出PanoWorld,通过构建全景原生理解能力,解决传统多模态大模型在空间感知上的不足,通过全景空间交叉注意力机制提升3D空间推理能力,并建立PanoSpace-Bench基准测试,验证了全景原生监督的有效性。

Comments Project page: https://wcpcp.github.io/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15649 2026-05-18 cs.LG cs.NE 57%

Towards Code-Oriented LM Embeddings for Surrogate-Assisted Neural Architecture Search

面向代理辅助神经架构搜索的代码导向语言模型嵌入

Pranav Somu, Advay Balakrishnan, Stepan Kravtsov, Aaron McDaniel, Jason Zutty

机构 * Georgia Institute of Technology(佐治亚理工学院) Georgia Tech Research Institute(佐治亚理工研究 institute)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出一种低成本的代码导向语言模型嵌入策略,利用语言模型的归纳偏置,无需微调即可生成高效的架构特征提取器,实验证明其在NAS-Bench-201和einspace搜索空间中优于其他编码方式。

Comments This is an extended version of work accepted to GECCO 2026. Our code is available at https://github.com/pcsom/cole/tree/v1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15961 2026-05-18 cs.CV 50%

Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models

稀疏自编码器使CLIP模型的鲁棒且可解释的微调成为可能

Fabian Morelli, Arnas Uselis, Ankit Sonthalia, Seong Joon Oh

机构 * University of Tübingen(图宾根大学) KAIST(韩国科学技术院)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出SAE-FT方法,通过稀疏自编码器约束视觉表示的变化,实现CLIP模型的鲁棒且可解释的微调,提高下游任务性能同时保持模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15458 2026-05-18 cs.CV 50%

Video Models Can Reason with Verifiable Rewards

视频模型可以借助可验证的奖励进行推理

Tinghui Zhu, Sheng Zhang, James Y. Huang, Selena Song, Xiaofei Wen, Yuankai Li, Hoifung Poon, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Microsoft Research(微软研究院) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出VideoRLVR方法,通过规则反馈优化视频扩散模型,提升可验证推理能力,在Maze、FlowFree和Sokoban任务中优于监督微调基线,证明可验证RL能推动视频模型超越感知模仿。

Comments Website: https://darthzhu.github.io/VideoRLVR-page/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 19 篇

2505.19241 2026-05-18 cs.LG cs.AI 90%

ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment

ActiveDPO: 用于高效对齐的主动直接偏好优化

Xiaoqiang Lin, Arun Verma, Zhongxiang Dai, Daniela Rus, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联盟研究技术中心) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);preference optimization(title);large language model(abstract);language model(abstract)

AI总结 ActiveDPO通过理论支撑的非线性奖励函数选择方法,利用LLM自身参数化奖励模型,提升对齐效率和数据收集效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15464 2026-05-18 cs.LG cs.AI cs.CL 89%

GRLO: Towards Generalizable Reinforcement Learning in Open-Ended Environments from Zero

GRLO:从零开始在开放环境中的通用强化学习

Shangjian Yin, Yu Fu, Yue Dong, Zhouxing Shi

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 GRLO研究从少量交互数据中训练的RLHF在开放环境中的泛化能力,探索其对话能力是否能迁移至数学推理和代码生成等下游任务,展示出高效且低成本的训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00778 2026-05-18 cs.LG 85%

What Is Preference Optimization Doing, and Why?

偏好优化在做什么,为什么这样做?

Yue Wang, Qizhou Wang, Zizhuo Zhang, Gang Niu, Bo Han, Masashi Sugiyama

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) RIKEN AIP(理化学研究所 AIP 分室) The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文分析了偏好优化中DPO和PPO的优化动态,揭示了其算法行为差异及根本原因,探讨了正学习、负学习和损失再加权的作用,并通过消融研究验证了这些动态对优化效率和性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04909 2026-05-18 cs.LG 84%

Learning Where It Matters: Geometric Anchoring for Robust Preference Alignment

在关键领域学习:用于鲁棒偏好对齐的几何锚定

Youngjae Cho, Jongsuk Kim, Ji-Hoon Kim

机构 * PYLER KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 GAPO通过动态几何锚定机制改进偏好对齐,通过局部敏感度自适应调整偏好对重要性,减少噪声影响,提升模型鲁棒性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06062 2026-05-18 cs.CL 84%

When Importance Sampling Misallocates Credit: Asymmetric Ratios for Outcome-Supervised RL

重要采样误分配信用:用于结果监督强化学习的非对称比率

Jiakang Wang, Runze Liu, Qingpeng Cai, Lei Lin, Wenping Hu, Xiu Li, Fuzheng Zhang, Guorui Zhou, Kun Gai, Ling Pan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文揭示了在结果监督强化学习中,重要采样比率因角色转变导致正优势token与负优势token的权重失衡,提出非对称重要采样策略ASPO以纠正此问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15573 2026-05-18 cs.CL cs.LG cs.MA 82%

Response-Conditioned Parallel-to-Sequential Orchestration for Multi-Agent Systems

响应条件化的并行到顺序 orchestration 用于多智能体系统

Nurbek Tastan, Alex Iacob, Lorenzo Sani, Meghdad Kurmanji, Nicholas D. Lane, Samuel Horvath, Karthik Nandakumar

机构 * MBZUAI(马克斯·普朗克智能系统研究所) University of Cambridge(剑桥大学) Flower Labs(Flower实验室) Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Nexa框架,通过响应条件化的策略结合并行与顺序执行,减少通信和延迟同时提高最终响应准确性,展示了其通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00920 2026-05-18 cs.CL 81%

Reward Auditor: Inference on Reward Modeling Suitability in Real-World Perturbed Scenarios

奖励审计员:在现实扰动场景中对奖励建模适用性的推断

Jianxiang Zang, Yongda Wei, Ruxue Bai, Shiyu Jiang, Nijia Mo, Binhong Li, Qiang Sun, Hui Liu

机构 * School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Statistics and Data Science, Shanghai University of International Business and Economics(上海国际商务经济学院统计与数据科学学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析方向)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出奖励审计员框架,用于评估奖励模型在现实扰动场景中的适用性,通过统计显著性和效应量分析模型的可靠性与漏洞严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15803 2026-05-18 cs.CV cs.LG 79%

Embedding-perturbed Exploration Preference Optimization for Flow Models

嵌入扰动探索偏好优化用于流模型

Sujie Hu, Chubin Chen, Jiashu Zhu, Jiahong Wu, Xiangxiang Chu, Xiu Li

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出E²PO框架,通过嵌入层面扰动维持优化稳定性,提升生成模型对人类偏好的对齐效果。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06239 2026-05-18 cs.LG 79%

Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution

可证明地避免在不了解数据分布的情况下直接偏好优化中的过度优化

Adam Barla, Emanuele Nevali, Luca Viano, Volkan Cevher

机构 * EPFL(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 PEPO通过训练不同数据子集的偏好优化策略并聚合最坏情况,避免了过度优化问题,其样本复杂度仅依赖单策略集中性系数,保持了DPO的简洁性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12667 2026-05-18 cs.LG cs.AI 79%

ODRPO: Ordinal Decompositions of Discrete Rewards for Robust Policy Optimization

ODRPO:离散奖励的序分解以实现鲁棒策略优化

Nirmal Patel, Fei Wang, Inderjit S. Dhillon

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Google(谷歌)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ODRPO框架,通过将离散奖励分解为序二进制指标,减少噪声影响,提升策略优化鲁棒性,实验表明在Qwen2.5-7B和Qwen3-4B模型上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15692 2026-05-18 cs.CL cs.LG 76%

TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning

TemplateRL: 结构化模板引导的强化学习用于大语言模型推理

Jinyang Wu, Chonghua Liao, Mingkuan Feng, Shuai Zhang, Zhengqi Wen, Haoran Luo, Ling Yang, Huazhe Xu, Jianhua Tao

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Princeton University(普林斯顿大学) Shanghai AI Lab(上海人工智能实验室) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 后训练与偏好优化 :LLM(title);分类 cs.CL、cs.LG

AI总结 TemplateRL通过结构化模板引导强化学习提升大语言模型推理能力,通过MCTS构建问题解决模板库并整合到RL训练中,提高轨迹命中率并减少无效探索,实验显示在AIME和AMC上表现优于GRPO。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15224 2026-05-18 cs.AI cs.MA 70%

ICRL: Learning to Internalize Self-Critique with Reinforcement Learning

ICRL: 通过强化学习学习内化自我批评

Jianbo Lin, Xiaomin Yu, Yi Xin, Yifu Guo, Zhuosong Jiang, Zhongqi Yue, Weishi Wang, Heqing Zou, Chengwei Qin, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University(南京大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) SAP Microsoft Research(微软研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ICRL框架,通过联合训练求解器和批评者,使求解器在无外部批评时也能自我改进,提升代理和数学推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15204 2026-05-18 cs.AI 70%

SDOF: Taming the Alignment Tax in Multi-Agent Orchestration with State-Constrained Dispatch

SDOF:通过状态约束调度驯服多智能体编排中的对齐税

Zhantao Wang

机构 * Digital China(数字中国)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 SDOF通过状态约束调度框架,利用强化学习和有限状态自动机提升多智能体任务执行的准确性和可控性,验证了其在招聘系统中的有效性。

Comments 12 pages, 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15325 2026-05-18 cs.CV 67%

COPRA: Conditional Parameter Adaptation with Reinforcement Learning for Video Anomaly Detection

COPRA:基于强化学习的条件参数适应用于视频异常检测

Darryl Cherian Jacob, Xinyu Liu, Kai Wang, Pan He

机构 * Auburn University(奥本大学) Tencent Hunyuan(腾讯文元)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 COPRA通过生成输入特定的参数更新,动态适应冻结的VLM,提升视频异常检测的适应性和泛化能力,同时拓展到多选视频问答和密集标注等任务。

Comments Manuscript currently under review for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16154 2026-05-18 cs.LG cs.RO 57%

Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking

学习结果分歧之处:通过概率块掩码实现高效的VLA强化学习

Vaidehi Bagaria, Nikshep Grampurohit, Pulkit Verma

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出概率块掩码(PCM),通过选择性分配梯度计算来提升GRPO-based VLA RL的效率,实现更快的训练速度和更低的内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏