arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-15 至 2026-05-15 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 28 篇

2605.14790 2026-05-15 cs.CL cs.AI 90%

Graphs of Research: Citation Evolution Graphs as Supervision for Research Idea Generation

研究图谱:引用演化图谱作为研究想法生成的监督

Songyang Gao, Yinghui Xia, Siyi Liu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GoR方法,通过提取种子论文的2跳引用邻域,构建引用演化有向无环图,利用结构化文本提示训练LLM生成研究想法,实验表明其在想法生成任务中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13936 2026-05-15 cs.LG cs.AI cs.DC 90%

Towards the Next Frontier of LLMs, Training on Private Data: A Cross-Domain Benchmark for Federated Fine-Tuning

迈向LLM的下一个前沿:在私有数据上训练:一个跨域基准用于联邦微调

Daniel M. Jimenez-Gutierrez, Enrique Zuazua, Georgios Kellaris, Joaquin del Rio, Oleksii Sliusarenko, Xabi Uribe-Etxebarria

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过联邦学习平台在跨域基准中评估联邦微调方法,展示在隐私数据上训练LLM的可行性,对比三种参数高效微调策略,证明联邦微调在非独立同分布数据下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14442 2026-05-15 cs.CY 88%

GGBound: A Genome-Grounded Agent for Microbial Life-Boundary Prediction

GGBound:一种基于基因组的微生物生命边界预测代理

Hanbo Huang, Xuan Gong, Jing Wang, Lei Bai, Xiang Xiao, Weishu Zhao, Shiyu Liang

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);foundation model(abstract)

AI总结 本文提出GGBound代理,通过基因组条件化和工具增强的LLM,解决微生物生命边界预测问题,构建了涵盖1525种菌株的基准数据集,并通过三阶段优化流程提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18104 2026-05-15 cs.CL cs.AI cs.LG 87%

Training and Evaluating Language Models with Template-based Data Generation

基于模板的数据生成训练和评估语言模型

Yifan Zhang

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Template-based Data Generation方法,通过生成高质量数学问题及可验证解,解决大语言模型在复杂推理任务中的数据稀缺问题,并引入TemplateMath Part I: TemplateGSM数据集。

Comments Published in ICLR 2025 DATA-FM Workshop. Project Page: https://github.com/iiis-ai/TemplateMath

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11282 2026-05-15 cs.LG 86%

Vision-LLMs for Spatiotemporal Traffic Forecasting

面向时空交通预测的视觉语言模型

Ning Yang, Hengyu Zhong, Haijun Zhang, Randall Berry

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Southwest University(西南大学) Department of Computing and Communication Engineering, Beijing University of Science and Technology(北京科技大学计算机与通信工程学院) Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ST-Vision-LLM框架,将时空预测转化为视觉-语言融合问题,通过视觉编码器处理历史交通矩阵并结合高效数值编码方案,提升交通预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07118 2026-05-15 cs.CL cs.LG 86%

TRIM: Token-wise Attention-Derived Saliency for Data-Efficient Instruction Tuning

TRIM:基于令牌注意力的显著性用于数据高效的指令微调

Manish Nagaraj, Sakshi Choudhary, Utkarsh Saxena, Deepak Ravikumar, Kaushik Roy

机构 * Electrical and Computer Engineering, Purdue University(普渡大学电子与计算机工程系)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 TRIM通过令牌层面的注意力分析提升数据效率,利用少量高质量样本构建指令微调数据集,显著优于现有方法,在部分任务中甚至超越全数据微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06202 2026-05-15 cs.CV cs.AI 85%

LoRA in LoRA: Towards Parameter-Efficient Architecture Expansion for Continual Visual Instruction Tuning

LoRA in LoRA: 朝着参数高效架构扩展的方向:持续视觉指令微调

Chang Che, Ziqi Wang, Pengwan Yang, Qi Wang, Hui Ma, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LiLoRA,一种高效的持续视觉指令微调架构扩展方法,通过共享LoRA矩阵A、低秩分解矩阵B以及余弦正则化损失,提升参数效率和任务学习性能。

Comments AAAI 2026 Oral Presentation. 9 pages

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(24):19978--19986, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15077 2026-05-15 cs.CL cs.AI cs.LG 83%

Concurrency without Model Changes: Future-based Asynchronous Function Calling for LLMs

无需模型变更的并发性:面向LLMs的未来式异步函数调用

Guangyu Feng, Huanzhi Mao, Prabal Dutta, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AsyncFC框架,通过解耦LLM解码与函数执行,实现解码与执行的重叠及函数间并行,减少端到端延迟并保持任务精度,揭示LLMs具备处理未决执行结果的符号未来推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15012 2026-05-15 cs.LG cs.AI cs.CL 83%

Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance

通过随机选择的少样本引导提升可验证奖励的强化学习

Kai Yan, Alexander G. Schwing, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FEST算法,通过随机选择的少样本引导提升可验证奖励的强化学习,仅需128个演示即可获得优于基线的结果,关键在于监督信号、在线信号和衰减权重。

Comments 25 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14366 2026-05-15 cs.CL cs.LG 82%

Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

基于语义奖励的强化学习实现低资源语言扩展而不产生对齐税

Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang

机构 * Minzu University of China(中国民族大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hainan International College, Minzu University of China(中国民族大学海南国际学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于语义空间对齐的GRPO方法,通过嵌入层语义奖励优化,减少对预训练知识的破坏性干扰,提升低资源语言扩展效果。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14055 2026-05-15 cs.CL cs.AI 82%

PEML: Parameter-efficient Multi-Task Learning with Optimized Continuous Prompts

PEML:参数高效多任务学习与优化连续提示

Anjir Ahmed Chowdhury, Syed Zawad, Xiaolong Ma, Xu Dong, Feng Yan

机构 * IBM Research(IBM研究院) Argonne National Laboratory(阿贡国家实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PEML,通过优化连续提示和低秩适应实现多任务学习的高效微调,实验显示在多个基准测试中准确率提升显著。

Comments 26 pages, 8 figures, 18 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14291 2026-05-15 cs.CR cs.AI cs.CL cs.CV cs.LG 82%

To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调

Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu

机构 * School of Computing Augmented Intelligence, Arizona State University, Tempe, AZ, USA Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MMGuard,通过注入不可察觉扰动主动利用LVLM学习动态,生成不可学习示例,从而保护多模态数据免受未经授权的微调。通过最小化训练损失,扰动创建优化捷径,导致模型在推理时因噪声过拟合而性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13360 2026-05-15 cs.LG 81%

Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling

推测交互代理:构建具有异步I/O和推测性工具调用的实时代理

Coleman Hooper, Minwoo Kang, Suhong Moon, Nicholas Lee, Eric Wen, John Wawrzynek, Michael W. Mahoney, Yakun Sophia Shao, Amir Gholami, Kurt Keutzer

机构 * University of California, Berkeley(加州大学伯克利分校) ICSI LBNL(劳伦斯伯克利国家实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出推测交互代理,通过异步I/O和推测性工具调用,实现复杂多轮工具调用的实时交互,提升实时应用性能。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06431 2026-05-15 cs.LG 81%

Functional-level Uncertainty Quantification for Calibrated Fine-tuning on LLMs

功能层面的不确定性量化用于校准微调的大型语言模型

Ruijia Niu, Dongxia Wu, Rose Yu, Yi-An Ma

机构 * Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系)

专题命中 指令微调 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出UQ4CT方法,通过混合专家微调框架校准LLM微调中的功能空间不确定性,减少ECE并提升可靠性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14967 2026-05-15 cs.LG stat.ML 77%

InfoSFT: Learn More and Forget Less with Information-Aware Token Weighting

InfoSFT: 通过信息感知的标记加权学习更多并忘记更少

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);分类 cs.LG

AI总结 InfoSFT通过信息感知的标记加权方案改进监督微调,提升泛化能力并保留原有能力,适用于数学、代码和推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14323 2026-05-15 cs.LG cs.AI cs.CL 75%

Dynamic Latent Routing

动态潜在路由

Fangyuan Yu, Xin Su, Amir Abdullah

机构 * Thoughtworks AI Labs (TAILS)(Thoughtworks AI实验室(TAILS))

专题命中 指令微调 :post-training(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出动态潜在路由(DLR),通过单阶段训练联合学习离散潜在码、路由策略和模型参数,优于监督微调,在低数据微调中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14841 2026-05-15 cs.LG cs.AI 73%

GPart: End-to-End Isometric Fine-Tuning via Global Parameter Partitioning

GPart:通过全局参数划分实现端到端等距微调

Paolo Mandica, Michał Brzozowski, Zuzanna Dubanowska, Neo Christopher Chung

机构 * Samsung AI Center(三星人工智能中心) University of Warsaw(华沙大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GPart通过全局参数划分方法实现端到端等距微调,无需低秩结构,仅需一个随机投影即可高效微调模型,实现存储成本低且性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04682 2026-05-15 cs.CL cs.AI 73%

TiTok: Transfer Token-level Knowledge via Contrastive Excess to Transplant LoRA

TiTok: 通过对比超额迁移LoRA

Chanjoo Jung, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TiTok通过token级知识迁移实现有效LoRA迁移,利用源模型有无LoRA的token对比超额提取任务相关信息,无需额外模型即可选择性过滤合成数据,在多个迁移设置中实现平均+4~10%的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13907 2026-05-15 stat.ML cs.AI cs.LG 73%

AIS: Adaptive Importance Sampling for Quantized RL

AIS: 量化强化学习中的自适应重要性采样

Jiajun Zhou, Wei Shao, Lingchao Zheng, Yuwei Fan, Ngai Wong

机构 * Huawei(华为) The University of Hong Kong(香港大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIS方法,通过动态调整重要性采样强度,解决量化强化学习中 rollout 与训练不匹配导致的策略梯度偏差问题,在保持FP8加速优势的同时,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14448 2026-05-15 cs.CV cs.CL cs.IR 70%

Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture

需要时思考:基于双LoRA架构的自适应推理驱动多模态嵌入

Longxiang Zhang, Weilong Dai, Guanghao Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TWN框架,通过双LoRA架构和自适应推理机制,提升多模态嵌入效率与质量,在78个任务中达到SOTA水平,参数更少,推理成本更低。

Comments 30 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00158 2026-05-15 cs.LG 70%

Privacy Amplification in Differentially Private Zeroth-Order Optimization with Hidden States

差分隐私零阶优化中的隐私放大

Eli Chien, Wei-Ning Chen, Pan Li

机构 * Department of Electrical Engineering, National Taiwan University, Taiwan(台湾国立台湾大学电子工程系) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE), Taiwan(国立台湾大学人工智能研究中心(NTU AI-CoRE)) Microsoft, USA(微软公司) Department of Electrical and Computer Engineering, Georgia Institute of Technology, USA(佐治亚理工学院电子与计算机工程系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在差分隐私和内存约束下零阶优化的隐私放大问题,提出混合噪声机制和新耦合分析,首次获得收敛的隐状态差分隐私界。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12625 2026-05-15 cs.RO cs.CV 67%

Driving Intents Amplify Planning-Oriented Reinforcement Learning

意图驱动强化学习放大规划导向的强化学习

Hengtong Lu, Victor Shea-Jay Huang, Chengmin Yang, Pengfei Jing, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto(力 auto) Tsinghua University(清华大学) CUHK MMLab(香港大学MMLab)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文提出DIAL框架,通过两阶段方法解决连续动作策略在偏好对齐中的模式崩溃问题,通过意图引导的采样扩展分布并提升性能。

Comments Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15042 2026-05-15 cs.CV cs.AI 57%

EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration

EverAnimate:通过潜在流恢复实现分钟级人类动画

Wuyang Li, Yang Gao, Mariam Hassan, Lan Feng, Wentao Pan, Po-Chien Luan, Alexandre Alahi

机构 * EPFL(瑞士联邦理工学院)

专题命中 指令微调 :post-training(abstract);分类 cs.AI

AI总结 EverAnimate通过潜在流恢复技术,在保持视觉质量和角色身份的同时,高效生成长时域动画视频,解决了动态人类动作与静态环境之间的生成漂移问题。

Comments Project Page: https://everanimate.github.io/homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15182 2026-05-15 cs.CV 50%

Warp-as-History: Generalizable Camera-Controlled Video Generation from One Training Video

Warp-as-History:从单个训练视频生成可泛化的相机控制视频

Yifan Wang, Tong He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :post-training(abstract)

AI总结 本文提出Warp-as-History方法,通过将相机诱导的变形转化为相机变形的伪历史,实现无需训练的零样本相机轨迹生成,提升视频生成的相机顺应性和视觉质量。

Comments Project page: https://yyfz.github.io/warp-as-history/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 15 篇

2511.08565 2026-05-15 cs.CL cs.AI cs.CY 91%

Moral Susceptibility and Robustness under Persona Role-Play in Large Language Models

道德敏感性与在角色扮演下大型语言模型的鲁棒性

Davi Bastos Costa, Felippe Alves, Renato Vicente

机构 * TELUS Digital Research Hub(TELUS数字研究中心) Center for Artificial Intelligence and Machine Learning(人工智能与机器学习中心) Institute of Mathematics, Statistics and Computer Science(数学、统计与计算机科学研究所) University of São Paulo(圣保罗大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本文研究了大型语言模型在角色扮演下的道德反应,通过道德基础问卷基准测试,量化了道德敏感性和鲁棒性,揭示了模型家族对鲁棒性的影响显著,而预训练对敏感性起主导作用。

Comments Added experiments with a logit-based method and now reporting unbounded metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13935 2026-05-15 cs.LG cs.CL 88%

Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models

超越模式寻求强化学习:扩散语言模型的轨迹平衡后训练

Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

机构 * Noah’s Ark Lab(Noah’s Ark 实验室)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出TraFL方法,通过轨迹平衡目标提升扩散语言模型的后训练效果,在多个基准测试中均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23868 2026-05-15 cs.LG cs.CL 85%

GIFT: Group-Relative Implicit Fine-Tuning Integrates GRPO with DPO and UNA

GIFT: 组相对隐式微调整合GRPO与DPO和UNA

Zhichao Wang

机构 * Inflection AI

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 GIFT结合GRPO组采样、DPO隐式奖励和UNA的隐式与显式优势MSE,通过z-score标准化消除DPO隐式奖励中的不可行分区函数Z(x)和RLHF/RLVR目标中的KL系数β,以组相对隐式微调解决相同参数策略族,用提示适应的β(x)替代外部调优的β。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14483 2026-05-15 cs.AI 81%

LEMON: Learning Executable Multi-Agent Orchestration via Counterfactual Reinforcement Learning

LEMON:通过反事实强化学习学习可执行多智能体编排

Xudong Chen, Yixin Liu, Hua Wei, Kaize Ding

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LEMON通过反事实强化学习生成可执行的多智能体编排规范,整合任务特定角色、定制职责、容量级别和依赖结构,提升多智能体系统解决方案质量和执行效率。

Comments Submitted to Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15155 2026-05-15 cs.LG cs.AI cs.CL 80%

Self-Distilled Agentic Reinforcement Learning

自蒸馏代理强化学习

Zhengxi Lu, Zhiyuan Yao, Zhuowen Han, Zi-Han Wang, Jinyang Wu, Qi Gu, Xunliang Cai, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Meituan(美团) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SDAR方法,通过将OPSD作为辅助目标并保持RL为主优化,解决多轮代理中的稳定性问题,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14174 2026-05-15 cs.RO 78%

Safety-Constrained Reinforcement Learning with Post-Training Reachability Verification for Robot Navigation

具有事后训练可达性验证的安全强化学习用于机器人导航

Qisong He, Xinmiao Huang, Jinwei Hu, Zhuoyun Li, Yi Dong, Changshun Wu, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出一种基于条件价值风险约束的强化学习框架,通过训练对高成本尾部结果敏感的策略,并在训练后利用神经网络可达性验证评估其安全边际,实验表明该方法在导航任务中实现了更高的安全验证率。

详情

展开后加载摘要…

URL PDF HTML 收藏