arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 519 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 18 篇

2604.23148 2026-04-28 cs.AI 92%

PhySE: A Psychological Framework for Real-Time AR-LLM Social Engineering Attacks

PhySE: 一种用于实时AR-LLM社会工程攻击的心理学框架

Tianlong Yu, Yang Yang, Ziyi Zhou, Jiaying Xu, Siwei Li, Tong Guan, Kailong Wang, Ting Bi

机构 * Hubei University(湖北大学) Apple Inc(苹果公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PhySE通过视觉语言模型的社会上下文训练和自适应心理代理,解决AR-LLM社会工程攻击中的冷启动个性化和静态攻击策略问题,提升实时交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19089 2026-04-28 cs.CL cs.AI 91%

Language Models Might Not Understand You: Evaluating Theory of Mind via Story Prompting

语言模型可能并不理解你:通过故事提示评估理论自我意识

Nathaniel Getachew, Abulhair Saparov

专题命中 预训练与数据 :language model(title,abstract);prompting(title);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 通过故事提示框架评估大语言模型的理论自我意识和世界建模能力,发现模型在世界建模任务中表现优于理论自我意识任务,且对人物推理更准确。

Comments 21 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22989 2026-04-28 cs.CV cs.AI 90%

CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging

CheXmix:用于医学影像的统一生成预训练

Ashwin Kumar, Robbie Holland, Corey Barrett, Jangwon Kim, Maya Varma, Zhihong Chen, Yunhe Gao, Greg Zaharchuk, Tara Taghavi, Krishnaram Kenthapadi, Akshay Chaudhari

机构 * Stanford AIMI, Stanford University(斯坦福大学AIMI研究所,斯坦福大学) Oracle Health AI(Oracle健康AI) Department of Radiology, Stanford University(斯坦福大学放射科)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 CheXmix通过统一早融合生成方法,在医学影像中实现更精确的联合表征学习,优于现有生成模型,在多个任务上表现突出。

Comments CVPR Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23475 2026-04-28 cs.LG cs.CL 89%

Supernodes and Halos: Loss-Critical Hubs in LLM Feed-Forward Layers

超节点和光环:LLM前馈层中的损失关键枢纽

Audrey Cherilyn, Houman Safaai

机构 * Kempner Institute at Harvard University(哈佛大学凯普纳研究所)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究Transformer前馈网络中通道级重要性的组织方式,发现损失敏感性集中于少量通道,通过损失代理展示超节点和光环结构,验证保护核心对结构化剪枝的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01595 2026-04-28 cs.CL cs.AI cs.LG 86%

Always Tell Me The Odds: Fine-grained Conditional Probability Estimation

始终告诉我概率:细粒度条件概率估计

Liaoyaqi Wang, Zhengping Jiang, Anqi Liu, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种最先进的模型,用于在上下文条件下对命题进行细粒度概率估计。通过结合人类和合成数据创建与评估、扩大模型规模和改进监督,提出了一系列强而精确的概率估计模型,在依赖条件概率估计的任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24416 2026-04-28 cs.CL cs.AI cs.LG 85%

Scaling Properties of Continuous Diffusion Spoken Language Models

连续扩散口语语言模型的可扩展性特性

Jason Ramapuram, Eeshan Gunesh Dhekane, Amitis Shidani, Dan Busbridge, Bogdan Mazoure, Zijin Gu, Russ Webb, Tatiana Likhomanenko, Navdeep Jaitly

机构 * Apple(苹果公司)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究连续扩散口语语言模型在性能上的可扩展性,提出基于音素Jensen-Shannon散度的评估指标,发现其在参数规模增加时生成质量提升,但长文本连贯性仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22771 2026-04-28 cs.CL cs.AI cs.LG 82%

The Randomness Floor: Measuring Intrinsic Non-Randomness in Language Model Token Distributions

随机底限:在语言模型令牌分布中测量固有非随机性

Jarosław Hryszko

机构 * Institute of Computer Science(计算机科学研究所) Faculty of Mathematics and Computer Science(数学与计算机科学学院) Jagiellonian University(雅盖隆大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过系统分析31200次生成数据,引入熵偏差(ED)衡量语言模型令牌分布与均匀分布的KL散度,发现即使在中性提示下,Transformer仍表现出约0.30的ED,表明非随机性主要源于模型权重而非上下文。

Comments 13 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24479 2026-04-28 cs.CV 80%

Zero-to-CAD: Agentic Synthesis of Interpretable CAD Programs at Million-Scale Without Real Data

从零到CAD:在百万级规模上无需真实数据合成可解释的CAD程序

Mohammadmehdi Ataei, Farzaneh Askari, Kamal Rahimi Malekshan, Pradeep Kumar Jayaraman

机构 * Autodesk Research(Autodesk研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Zero-to-CAD框架,通过代理搜索方法生成可执行的CAD构造序列,实现百万级可解释CAD程序的合成,并展示了其在多视图图像重建中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22854 2026-04-28 cs.CV cs.AI 79%

MAE-Based Self-Supervised Pretraining for Data-Efficient Medical Image Segmentation Using nnFormer

基于MAE的自监督预训练用于数据高效医学图像分割的nnFormer

R. M. Krishna Sureddi, T. Satyanarayana Murthy, Nomula Varsha Reddy, Adi Kanishka, Nalla Manvika Reddy

机构 * Chaitanya Bharathi Institute of Technology(恰蒂斯赫尔学院技术学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出基于MAE的自监督预训练方法,提升nnFormer在医学图像分割中的数据效率,实现更高的Dice得分、更快的收敛速度和更好的小样本泛化能力。

Comments 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24044 2026-04-28 cs.CV 78%

CLLAP: Contrastive Learning-based LiDAR-Augmented Pretraining for Enhanced Radar-Camera Fusion

CLLAP:基于对比学习的激光雷达增强预训练用于增强雷达-相机融合

Bingyi Liu, Chuanhui Zhu, Hongfei Xue, Jian Teng, Jipeng Liu, Enshu Wang, Penglin Dai, Pu Wang

机构 * Wuhan University of Technology(武汉理工大学) University of North Carolina at Charlotte(北卡罗来纳州立大学) Wuhan University(武汉大学) Southwest Jiaotong University(西南交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 CLLAP通过利用丰富的激光雷达数据生成伪雷达数据,结合双阶段双模态对比学习策略,提升雷达-相机融合模型的特征提取能力,实验证明在NuScenes和Lyft Level 5数据集上显著提升3D目标检测性能。

Comments accepted by 2026 CVPR Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23676 2026-04-28 cs.HC 78%

Directional Alignment and Narrative Agency in Human-LLM Co-Writing

方向对齐与人类-大语言模型共写中的叙事自主性

Halfdan Nordahl Fundal, Yuri Bizzoni

专题命中 预训练与数据 :LLM(title,abstract)

AI总结 研究人类-大语言模型共写中的叙事自主性,探讨谁主导故事发展。通过87个共写故事分析,发现人类引入更多语义新颖性,而大语言模型则扩展人类元素,情感层面也呈现双向互动。

Comments 11 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23824 2026-04-28 cs.CL 70%

Resource-Lean Lexicon Induction for German Dialects

低资源方言词典诱导

Robert Litschko, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Center for Information and Language Processing, LMU Munich, Germany(MaiNLP,信息与语言处理中心,慕尼黑大学,德国) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用统计模型诱导德语方言词典,优于大语言模型,实现跨方言迁移,提供轻量数据驱动方案,实验显示在双语词典诱导和方言信息检索中表现优异。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23602 2026-04-28 cs.AR cs.LG 70%

TimingLLM: A Two-Stage Retrieval-Augmented Framework for Pre-Synthesis Timing Prediction from Verilog

TimingLLM: 一种两阶段检索增强框架,用于从Verilog预合成时间预测

Armin Abdollahi, Negin Ashrafi, Mehdi Kamal, Massoud Pedram

机构 * University of Southern California(美国南加州大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 TimingLLM通过两阶段检索增强框架,利用Verilog直接预测最坏负松弛和总负松弛,提升预合成时间预测的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23627 2026-04-28 cs.CL cs.LG 62%

Neural Grammatical Error Correction for Romanian

神经语法错误纠正用于罗马尼亚语

Teodor-Mihai Cotet, Stefan Ruseti, Mihai Dascalu

机构 * Computer Science Department University Politehnica of Bucharest(布加勒斯特大学工业大学计算机科学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文首次为罗马尼亚语构建了语法错误纠正语料库,并提出基于预训练的Transformer模型,在低资源环境下有效提升了纠错性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23589 2026-04-28 cs.CL 57%

XITE: Cross-lingual Interpolation for Transfer using Embeddings

XITE: 用于嵌入转移的跨语言插值

Barah Fazili, Preethi Jyothi

机构 * Indian Institute of Technology Bombay(印度理工学院孟买学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文提出XITE方法,通过嵌入插值提升多语言模型的跨语言迁移能力,在情感分析和自然语言推理任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22828 2026-04-28 cs.CV cs.AI 57%

MetaEarth3D: Unlocking World-scale 3D Generation with Spatially Scalable Generative Modeling

MetaEarth3D: 解锁世界尺度的3D生成与空间可扩展生成模型

Jinqi Cao, Zhiping Yu, Baihong Lin, Chenyang Liu, Zhenwei Shi, Zhengxia Zou

机构 * School of Astronautics, Beihang University(北航航天学院)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI

AI总结 MetaEarth3D通过空间可扩展生成模型实现世界尺度3D生成,解决传统生成模型在空间尺度上的局限,提升地球观测与模拟的超大空间智能能力。

Comments Project Page: https://jinqicao.github.io/metaearth3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17355 2026-04-28 cs.CL 57%

All Entities are Not Created Equal: Examining the Long Tail for Ultra-Fine Entity Typing

并非所有实体都平等:考察超细实体类型化中的长尾

Advait Deshmukh, Ashwin Umadi, Dananjay Srinivas, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文研究了预训练语言模型在超细实体类型化任务中处理长尾实体的局限性,提出新的启发法近似预训练分布,并发现依赖参数知识的方法在长尾实体上表现不佳,而融合知识的方法能部分弥补不足。

Journal ref StarSEM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23620 2026-04-28 cs.IR 50%

Synthetic Data Powers Product Retrieval for Long-tail Knowledge-Intensive Queries in E-commerce Search

合成数据助力电商搜索中长尾知识密集型查询的产品检索

Gui Ling, Weiyuan Li, Yue Jiang, Wenjun Peng, Xingxian Liu, Dongshuai Li, Fuyu Lv, Dan Ou, Haihong Tang

专题命中 预训练与数据 :LLM(abstract_cn)

AI总结 本文提出一种高效的数据合成框架,用于处理电商搜索中长尾知识密集型查询,通过隐式提炼强大离线查询重写模型的能力,提升检索效果。

Comments Accepted to SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 37 篇

2604.23747 2026-04-28 cs.LG cs.AI cs.CL 94%

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

在LLM推理中,SFT-然后-RL优于混合策略方法

Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

机构 * ETH AI Center, ETH Zürich(苏黎世联邦理工学院人工智能中心) EPFL(瑞士联邦理工学院) Allen Institute for AI(人工智能研究所)

专题命中 指令微调 :SFT(title,title_cn);LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文指出,混合策略方法的性能提升源于两个错误:DeepSpeed优化器在梯度累积中丢失中间微批次,以及OpenRLHF损失聚合错误加权。修正后,标准SFT-然后-RL流程在数学基准上超越了所有混合策略方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11831 2026-04-28 cs.CV 93%

Towards High-Fidelity CAD Generation via LLM-Driven Program Generation and Text-Based B-Rep Primitive Grounding

通过LLM驱动的程序生成和基于文本的B-Rep基础构建实现高保真的CAD生成

Jiahao Li, Qingwang Zhang, Qiuyu Chen, Guozhan Qiu, Yunzhong Lou, Xiangdong Zhou

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出FutureCAD框架,利用LLM和BRepGround变压器生成高保真的CAD模型,通过自然语言指定几何选择并训练数据集提升生成性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08484 2026-04-28 cs.AI 92%

Patching LLM Like Software: A Lightweight Method for Improving Safety Policy in Large Language Models

像软件一样修补大语言模型:一种轻量级方法用于改进大语言模型的安全策略

Huzaifa Arif, Keerthiram Murugesan, Ching-Yun Ko, Pin-Yu Chen, Payel Das, Alex Gittens

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种轻量级方法,通过在现有模型前添加可学习的前缀来快速修复大语言模型的安全漏洞,该方法在毒性缓解、偏见减少和有害性拒绝等关键领域实现了与新一代安全对齐模型相当的安全提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24468 2026-04-28 cs.CR cs.CL cs.DC cs.LG 92%

A Survey on Split Learning for LLM Fine-Tuning: Models, Systems, and Privacy Optimizations

关于用于LLM微调的分裂学习的综述:模型、系统和隐私优化

Zihan Liu, Yizhen Wang, Rui Wang, Xiu Tang, Sai Wu

机构 * Zhejiang University(浙江大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了分裂学习在LLM微调中的应用,探讨了模型、系统和隐私优化方法,旨在为该领域提供清晰的方向和系统的分类比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08377 2026-04-28 cs.LG cs.AI cs.CL 91%

Reinforcement Learning with Backtracking Feedback

具有回溯反馈的强化学习

Bilgehan Sel, Vaishakh Keshava, Phillip Wallis, Lukas Rutishauser, Ming Jin, Dingcheng Li

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Virginia Tech(弗吉尼亚理工大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RLBF框架,通过强化学习阶段使模型动态纠正生成错误,结合改进的SFT数据生成策略,提升LLM在对抗攻击和内在错误中的安全性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22783 2026-04-28 cs.LG cs.AI 90%

Parameter Efficiency Is Not Memory Efficiency: Rethinking Fine-Tuning for On-Device LLM Adaptation

参数效率不等于内存效率:重新思考设备端LLM适应的微调

Irene Tenison, Stella Ahn, Miriam Kim, Ebtisam Alshehri, Lalana Kagal

机构 * MIT CSAIL(MIT计算机科学与人工智能实验室) Harvard SEAS(哈佛大学科学、工程与应用数学系)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文挑战参数效率等同于内存效率的假设,提出LARS框架通过约束激活子空间降低内存消耗,实验证明在不同设备上均能提升内存效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02556 2026-04-28 cs.LG cs.AI 90%

Beyond Experience Retrieval: Learning to Generate Utility-Optimized Structured Experience for Frozen LLMs

超越经验检索:学习生成优化的结构化经验以冻结LLM

Xuancheng Li, Haitao Li, Yujia Zhou, Yiqun Liu, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国) Quancheng Laboratory(千晨实验室)

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SEAM模块,通过单次前向传递生成实例定制的经验条目,优化冻结LLM的执行效率,实验显示在数学推理基准上准确率提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24429 2026-04-28 cs.CL 89%

A Multi-Dimensional Audit of Politically Aligned Large Language Models

对政治倾向大型语言模型的多维审计

Lisa Korver, Mohamed Mostagir, Sherief Reda

机构 * Brown University(布朗大学) University of Michigan(密歇根大学) Ross School of Business(罗斯商学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出基于哈贝马斯沟通行动理论的多维框架,评估政治倾向语言模型在有效性、公平性、真实性及说服力四方面的表现,揭示大模型在政治角色扮演中更有效但更偏颇的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25414 2026-04-28 cs.LG cs.AI cs.CL 88%

Rethinking Parameter Sharing for LLM Fine-Tuning with Multiple LoRAs

重新思考多LoRAs的参数共享用于LLM微调

Hao Ban, Kaiyi Ji

机构 * Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ALoRA和Fed-ALoRA,通过异构矩阵分解策略,在多任务和联邦微调中实现更平衡的性能,优于现有多LoRA方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24320 2026-04-28 cs.CL 87%

DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents

DPEPO:基于大语言模型代理的多样化并行探索策略优化

Junshuo Zhang, Chengrui Huang, Feng Guo, Zihan Li, Ke Shi, Menghua Jiang, Jiguo Yu, Shuo Shang, Shen Gao

机构 * University of Electronic Science and Technology of China(电子科技大学) DiDi(滴滴)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出DPEPO算法,通过并行探索提升大语言模型代理在复杂任务中的性能,实验表明其在ALFWorld和ScienceWorld上达到最先进的成功率。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23987 2026-04-28 cs.LG 87%

Continual Calibration: Coverage Can Collapse Before Accuracy in Lifelong LLM Fine-Tuning

持续校准:在终身LLM微调中,覆盖度可能在准确性之前崩溃

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(艾奥瓦州立大学计算机科学系) Department of Civil, Construction & Environmental Engineering, Iowa State University(艾奥瓦州立大学土木、建设与环境工程系)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在连续学习中,覆盖度可能早于准确性下降的问题,提出校准回放方法以恢复覆盖度,通过实验和理论分析验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23557 2026-04-28 cs.MA cs.AI 87%

DLM: Unified Decision Language Models for Offline Multi-Agent Sequential Decision Making

DLM:统一的决策语言模型用于离线多智能体顺序决策制定

Zhuohui Zhang, Bin Cheng, Bin He

机构 * Department of Control Science and Engineering, Tongji University, Shanghai 201804, China(同济大学控制科学与工程学院) Shanghai Institute of Intelligent Science and Technology(上海智能科学研究院) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) State Key Laboratory of Autonomous Intelligent Unmanned Systems, Shanghai 200120, China(自主智能无人系统国家重点实验室)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文提出DLM,通过统一决策语言模型解决离线多智能体强化学习中的决策问题,采用集中训练分散执行框架,提升泛化能力。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏