arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 34 篇

2511.03121 2026-03-31 cs.CL cs.AI cs.SY eess.SY 90%

Control Barrier Function for Aligning Large Language Models

用于对齐大语言模型的控制屏障函数

Yuya Miyaoka, Masaki Inoue

机构 * Keio University(庆应义塾大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于控制的框架,利用控制屏障函数确保用户期望的文本生成,通过安全过滤器干预生成文本,无需微调基模型。

Comments This work is an extenede version of arXiv:2408.15625 and has been submitted to the IEEE for possible publication

Journal ref IEEE Transactions on Control Systems Technology 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12433 2026-03-31 cs.CL cs.AI 90%

Exploring Cultural Variations in Moral Judgments with Large Language Models

探索大语言模型在道德判断中的文化差异

Hadi Mohammadi, Ayoub Bagheri

机构 * Utrecht University(乌得勒支大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型在捕捉文化多样性道德价值观方面的能力,通过对比不同模型与全球态度调查数据的关联性,发现指令微调模型在跨文化道德规范上表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04329 2026-03-31 cs.LG 89%

Forgetting: A New Mechanism Towards Better Large Language Model Fine-tuning

遗忘:一种改进大型语言模型微调的新机制

Ali Taheri, Alireza Taban, Qizhou Wang, Shanshan Ye, Abdolreza Mirzaei, Tongliang Liu, Bo Han

机构 * Department of Electrical and Computer Engineering, Isfahan University of Technology(伊斯法罕理工大学电气与计算机工程系) RIKEN Center for Advanced Intelligence Project (AIP)(理化学研究所先进智能项目中心) Australian Artificial Intelligence Institute, University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所) School of Computer Science, Simon Fraser University(西蒙菲莎大学计算机科学学院) Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心) Department of Computer Science, Hong Kong Baptist University(香港浸会大学计算机科学系)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.LG

AI总结 本文提出通过区分正负token来优化微调过程,通过遗忘不相关信息提升模型性能,实验表明该机制在多种基准上有效。

Journal ref Transactions on Machine Learning Research (TMLR), 03/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28191 2026-03-31 cs.CL 89%

DongYuan: An LLM-Based Framework for Integrative Chinese and Western Medicine Spleen-Stomach Disorders Diagnosis

东元:一种基于大语言模型的整合中西医脾胃疾病诊断框架

Hua Li, Yingying Li, Xiaobin Feng, Xinyi Fu, Lifeng Dong, Qingfeng Yang, Yanzhe Chen, Xiaoju Feng, Zhidong Cao, Jianbin Guo, Yanru Du

机构 * Beijing Wenge Technology Co., Ltd.(北京文歌科技有限公司) Hebei Provincial Hospital of Traditional Chinese Medicine(河北省中医院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出东元框架,通过构建三个中西医脾胃疾病数据集,开发核心诊断LLM和咨询导航模型,建立评估基准,显著提升中西医脾胃疾病诊断性能。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10997 2026-03-31 cond-mat.mtrl-sci 88%

Data-driven Prediction of Ionic Conductivity in Solid-State Electrolytes with Machine Learning and Large Language Models

基于机器学习和大语言模型的固态电解质离子导电性数据驱动预测

Haewon Kim, Taekgi Lee, Seongeun Hong, Kyeong-Ho Kim, Yongchul G. Chung

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出利用机器学习和大语言模型预测固态电解质离子导电性,通过结合几何描述符和结构标签数据,提升预测精度并实现可解释的结构-性质分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21437 2026-03-31 cs.CL cs.LG 87%

A Systematic Study of In-the-Wild Model Merging for Large Language Models

对大型语言模型在真实场景中模型合并的系统研究

Oğuz Kağan Hitit, Leander Girrbach, Zeynep Akata

机构 * Koç University(科奇大学) Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(亥姆霍兹慕尼黑中心)

专题命中 指令微调 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文系统评估了在真实场景中合并异构专家模型的效果,发现任务算术是唯一在该场景下可靠提升性能的方法,其他方法效果不显著。

Journal ref Transactions on Machine Learning Research (03/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27744 2026-03-31 cs.CV 85%

Data Organization Matters in Multimodal Instruction Tuning: A Controlled Study of Capability Trade-offs

多模态指令微调中数据组织的重要性:能力取舍的受控研究

Guowei Tang

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨了数据组织对多模态指令微调中通用理解、结构化推理和细粒度OCR文档理解能力取舍的影响,发现课程训练在整体表现和结构推理上最佳,平衡采样更利于OCR能力但削弱整体平衡。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27481 2026-03-31 cs.LG cs.AI 84%

On Token's Dilemma: Dynamic MoE with Drift-Aware Token Assignment for Continual Learning of Large Vision Language Models

关于令牌的困境:具有漂移感知令牌分配的动态MoE用于大视觉语言模型的持续学习

Chongyang Zhao, Mingsong Li, Haodong Lu, Dong Gong

机构 * University of New South Wales (UNSW Sydney)(新南威尔士大学(悉尼新南威尔士大学))

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLaVA-DyMoE框架,通过动态MoE和漂移感知令牌分配缓解持续学习中的路由漂移问题,提升模型在持续学习中的性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27522 2026-03-31 cs.CL cs.CR cs.LG 81%

Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models

隐性广告:用于视觉语言模型中广告注入的行为触发语义后门

Duanyi Yao, Changyue Li, Zhicong Huang, Cheng Hong, Songze Li

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出隐性广告攻击,通过用户行为触发在视觉语言模型中注入未经授权的广告,利用自然用户行为实现高效且隐蔽的广告注入,同时评估了不同防御方法的失效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24975 2026-03-31 cs.IR 80%

Unbiased Multimodal Reranking for Long-Tail Short-Video Search

长尾短视频搜索的无偏多模态重排序

Wenyi Xu, Feiran Zhu, Songyang Li, Renzhe Zhou, Chao Zhang, Chenglei Dai, Yuren Mao, Yunjun Gao, Yi Zhang

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出基于LLM的多模态重排序框架,通过多阶段训练提升长尾查询内容质量,实验显示在AUC、NDCG@K和用户偏好判断等指标上优于基线方法,线上A/B测试验证了其在用户体验和消费指标上的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05371 2026-03-31 cs.LG cs.AI cs.CL 80%

Shifting Perspectives: Steering Vectors for Robust Bias Mitigation in LLMs

视角转换:用于LLM中鲁棒偏见缓解的引导向量

Zara Siddique, Irtaza Khalid, Liam D. Turner, Luis Espinosa-Anke

机构 * School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) AMPLYFI

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过引导向量修改模型激活以缓解LLM中的偏见,通过8个社会偏见轴(如年龄、性别、种族)在BBQ数据集子集上计算引导向量,并在四个数据集上比较其与三种其他偏见缓解方法的效果,展示其在减少偏见方面的有效性。

Comments Published to EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12681 2026-03-31 cs.CR cs.LG 79%

Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment

协同LoRA:大语言模型安全对齐中的组合性漏洞

Sihao Ding

机构 * Mercedes-Benz Research & Development North America, USA(梅赛德斯-奔驰北美研发中心)

专题命中 指令微调 :LLM(title,abstract);分类 cs.LG

AI总结 研究发现模块化大语言模型的安全对齐存在组合性漏洞,通过Colluding LoRA展示有害行为仅在组合状态下出现,暴露了当前单元中心防御的组合盲点。

Comments Updated manuscript to better reflect the core contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03821 2026-03-31 cs.CV cs.AI 79%

Beyond Recognition: Evaluating Visual Perspective Taking in Vision Language Models

超越识别:评估视觉语言模型中的视觉视角理解

Gracjan Góral, Alicja Ziarko, Piotr Miłoś, Michał Nauman, Maciej Wołczyk, Michał Kosiński

机构 * University of Warsaw(华沙大学) Polish Academy of Sciences(波兰科学院) Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) IDEAS NCBR Lute

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文通过144个视觉任务评估VLMs的视觉视角理解能力,发现模型在场景理解上表现优异,但在空间推理和视角理解上存在明显不足。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28263 2026-03-31 cs.CL cs.AI 79%

Merge and Conquer: Instructing Multilingual Models by Adding Target Language Weights

合并与征服:通过添加目标语言权重来指导多语言模型

Eneko Valero, Maria Ribalta i Albado, Oscar Sainz, Naiara Perez, German Rigau

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨通过合并语言特定基础模型与指令微调模型,以实现低资源语言的有效指令跟随和多语言能力,减少计算成本并提升性能。

Comments This paper was accepted at the 15th edition of the Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28731 2026-03-31 cs.SE cs.AI 77%

SAGAI-MID: A Generative AI-Driven Middleware for Dynamic Runtime Interoperability

SAGAI-MID:一种生成式AI驱动的动态运行时互操作性中间件

Oliver Aleksander Larsen, Mahyar T. Moghaddam

机构 * SDU Software Engineering University of Southern Denmark Odense, Denmark

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SAGAI-MID,一种基于FastAPI的中间件,利用大语言模型动态解决异构系统间的模式不匹配问题,通过五层流水线和三级保障栈提升互操作性,评估显示其在六个LLM上达到0.90的准确率。

Comments Accepted at SAGAI 2026, co-located with IEEE ICSA 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28163 2026-03-31 cs.CL 77%

From Reviews to Requirements: Can LLMs Generate Human-Like User Stories?

从评论到需求:大语言模型能否生成类人用户故事?

Shadman Sakib, Oishy Fatema Akhand, Tasnia Tasneem, Shohel Ahmed

机构 * Islamic University of Technology (IUT)(伊斯兰理工大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究评估大语言模型生成用户故事的能力,发现其在流畅性和格式上表现优异,但难以生成独立独特的用户故事,对敏捷项目 backlog 有帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27836 2026-03-31 quant-ph cs.CL 77%

Q-Bridge: Code Translation for Quantum Machine Learning via LLMs

Q-Bridge:通过LLM实现量子机器学习的代码翻译

Runjia Zeng, Priyabrata Senapati, Ruixiang Tang, Dongfang Liu, Qiang Guan

机构 * Rochester Institute of Technology(罗彻斯特理工学院) Kent State University(肯特州立大学) Rutgers University(罗格斯大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Q-Bridge通过LLM指导的代码翻译框架,系统性地将经典机器学习实现转换为可执行的量子机器学习变体,建立了首个可重复的框架和数据集,为可扩展的量子AI发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16216 2026-03-31 cs.AI cs.LG 76%

FlipVQA: Scaling Multi-modal Instruction Tuning via Textbook-to-Knowledge Synthesis

FlipVQA: 通过教科书到知识合成实现多模态指令微调的扩展

Zhen Hao Wong, Jingwen Deng, Yuzhao Wang, Wenkai Yu, Jihao Huang, Runming He, Chengyu Shen, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 指令微调 :instruction tuning(title);分类 cs.AI、cs.LG

AI总结 本文提出FlipVQA-Miner自动化流程,解决OCR文档中的长距离逻辑依赖和跨页断续问题,构建了包含83K问答对的FlipVQA-83K数据集,在保持高结构保真度的同时节省50倍成本,提升了模型推理能力和跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19278 2026-03-31 cs.CL cs.AI 76%

HypeLoRA: Hyper-Network-Generated LoRA Adapters for Calibrated Language Model Fine-Tuning

HypeLoRA: 基于超网络生成的LoRA适配器用于校准语言模型微调

Bartosz Trojan, Filip Gębala

机构 * Upper-Secondary Schools of Communications in Cracow(克拉科夫通信高级中学)

专题命中 指令微调 :language model(title);分类 cs.CL、cs.AI

AI总结 本文提出HypeLoRA,通过超网络生成LoRA适配器,实现高效校准语言模型微调,提升参数效率与校准性能,揭示参数效率与概率可靠性之间的关系。

Comments 12 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28605 2026-03-31 cs.CV cs.CY cs.LG 70%

Unsafe2Safe: Controllable Image Anonymization for Downstream Utility

Unsafe2Safe: 可控图像匿名化以保障下游效用

Mih Dinh, SouYoung Jin

机构 * Dartmouth College(达特茅斯学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Unsafe2Safe通过多模态引导的扩散编辑实现图像隐私保护,减少敏感信息并保持下游任务性能。

Comments Accepted at CVPR 2026 and CVPR 2026 Workshop on Machine Unlearning for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27981 2026-03-31 cs.CL cs.SD 70%

On the Role of Encoder Depth: Pruning Whisper and LoRA Fine-Tuning in SLAM-ASR

在编码器深度中的作用:在SLAM-ASR中剪枝Whisper和LoRA微调

Ganesh Pavan Kartikeya Bharadwaj Kolluri, Michael Kampouridis, Ravi Shekhar

机构 * School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)

专题命中 指令微调 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 研究分析了在SLAM-ASR中剪枝Whisper编码器对性能的影响,并探讨LoRA微调如何补偿剪枝导致的性能下降,发现剪枝两层编码器仅导致2-4%的WER下降,结合LoRA可有效提升性能并减少参数量。

Comments Accepted at SPEAKABLE Workshop, LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27859 2026-03-31 cs.CL cs.NA math.NA 70%

KazByte: Adapting Qwen models to Kazakh via Byte-level Adapter

KazByte: 通过字级别适配器适应Qwen模型至哈萨克语

Rauan Akylzhanov

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过字级别适配器适应Qwen模型至哈萨克语,解决哈萨克文本分词问题,提升模型对哈萨克语形态的掌握。

Comments Technical announcement

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17288 2026-03-31 stat.ML cs.LG 70%

Learning to Choose or Choosing to Learn: Best-of-N vs. Supervised Fine-Tuning for Bit String Generation

学习如何选择还是选择学习:Best-of-N与监督微调在位串生成中的比较

Seamus Somerstep, Vinod Raman, Unique Subedi, Yuekai Sun

机构 * University of Michigan(密歇根大学) Apple(苹果公司)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过位串生成问题比较监督微调与Best-of-N两种方法,发现监督微调在收敛速度上更优,而在不可实现情况下Best-of-N表现更佳。

Comments AISTATS 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28058 2026-03-31 cs.MM 67%

Is One-Shot In-Context Learning Helpful for Data Selection in Task-Specific Fine-Tuning of Multimodal LLMs?

在情境学习中选择数据是否有助于多模态大语言模型任务特定微调中的数据选择?

Xiao An, Jiaxing Sun, Ting Hu, Wei He

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出CLIPPER方法,通过情境学习选择数据,提高多模态大语言模型任务特定微调的效率,实验表明其在数据效率和计算成本上优于现有方法。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27185 2026-03-31 cs.CV 67%

MotionRFT: Unified Reinforcement Fine-Tuning for Text-to-Motion Generation

MotionRFT: 用于文本到动作生成的统一强化微调

Xiaofeng Tan, Wanjiang Weng, Hongsong Wang, Fang Zhao, Xin Geng, Liang Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) State Key Laboratory for Novel Software Technology, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院计算机软件新技术国家重点实验室) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所多模态人工智能系统国家重点实验室模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 指令微调 :pretraining(abstract);post-training(abstract)

AI总结 本文提出MotionRFT框架,通过多维奖励模型和高效微调方法,解决文本到动作生成中语义一致性、现实感和人类偏好对齐的问题,实验表明其在FID和R-Precision上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18845 2026-03-31 cs.CV 67%

Echoes of ownership: Adversarial-guided dual injection for copyright protection in MLLMs

所有权的回声:对抗引导的双注入用于MLLMs中的版权保护

Chengwei Xia, Fan Ma, Ruijie Quan, Yunqiu Xu, Kun Zhan, Yi Yang

机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出一种生成版权触发器的框架,通过双注入方法在MLLMs中嵌入可验证的版权信息,以在微调衍生模型中触发专属文本响应,同时在非衍生模型中保持无活性。

Comments Accepted to CVPR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26908 2026-03-31 cs.CV 67%

FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition

FusionAgent:一种具有动态模型选择的多模态代理用于人体识别

Jie Zhu, Xiao Guo, Yiyang Su, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 FusionAgent通过动态模型选择提升人体识别鲁棒性,利用多模态大语言模型进行样本特定的模型选择,结合ACT分数融合方法,实验表明其在效率和性能上优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27448 2026-03-31 cs.LG cs.AI cs.CE 62%

GIFT: Bootstrapping Image-to-CAD Program Synthesis via Geometric Feedback

GIFT: 通过几何反馈提升图像到CAD程序合成

Giorgio Giannone, Anna Clare Doris, Amin Heyrani Nobari, Kai Xu, Akash Srivastava, Faez Ahmed

机构 * DeCoDE Lab, MIT(麻省理工学院DeCoDE实验室) Core AI, IBM(IBM核心人工智能) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 指令微调 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GIFT框架,通过几何反馈生成高质量训练样本,提升CAD程序生成的鲁棒性,无需额外标注。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18532 2026-03-31 cs.RO cs.AI cs.LG 62%

Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds

在生成3D世界中扩展机器人视觉语言动作的强化学习

Andrew Choi, Xinjie Wang, Zhizhong Su, Wei Xu

机构 * Horizon Robotics(地平线机器人)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用生成3D世界模型来提升机器人视觉语言动作模型的泛化能力,通过生成多样化的交互场景,提高模拟到现实的迁移效果,并展示在真实世界中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03166 2026-03-31 cs.RO cs.AI cs.CL 62%

Continual Robot Skill and Task Learning via Dialogue

通过对话实现机器人持续技能和任务学习

Weiwei Gu, Suresh Kondepudi, Anmol Gupta, Lixiao Huang, Nakul Gopalan

机构 * Arizona State University(亚利桑那州立大学)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过对话交互实现机器人持续学习任务和视觉-运动技能,开发了ACT-LoRA政策在模拟中优于基线,且在真实场景中成功教授烹饪技能。

详情

展开后加载摘要…

URL PDF HTML 收藏