arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-18 至 2026-03-18 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 27 篇

2603.10080 2026-03-18 cs.CR cs.AI cs.LG 90%

Amnesia: Adversarial Semantic Layer Specific Activation Steering in Large Language Models

遗忘:大型语言模型中的对抗性语义层特定激活引导

Ali Raza, Gurang Gupta, Nikolay Matyunin, Jibesh Patra

机构 * Honda Research Institute Europe(本田欧洲研究院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Amnesia攻击,通过操纵transformer内部状态绕过开放式大语言模型的安全机制,展示其能生成有害内容而无需微调。研究强调了对开放式大语言模型安全性的迫切需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26683 2026-03-18 cs.CL cs.AI 88%

Evontree: Ontology Rule-Guided Self-Evolution of Large Language Models

Evontree:基于本体规则的大型语言模型自进化

Mingchen Tu, Zhiqiang Liu, Juan Li, Liangyurui Liu, Junjie Wang, Lei Liang, Wen Zhang

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Ant Group(蚂蚁集团)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Evontree方法,通过提取领域本体知识、检测不一致性和自蒸馏微调,提升低资源专业领域LLM的自进化能力,实验表明其在医疗问答基准上准确率提升达3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16028 2026-03-18 cs.RO 87%

Geometry-Aligned LLM Fine-Tuning for Sequential Narrow-Opening Planning

几何对齐的LLM微调用于序列狭窄开口规划

Al Jaber Mahmud, Xuan Wang

机构 * George Mason University(乔治·马歇尔大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出几何对齐的LLM微调框架,通过多阶段狭窄开口序列规划实现长视距几何推理,采用失败驱动LoRA监督微调与GRPO优化提升路径可行性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16127 2026-03-18 cs.CL cs.LG 86%

Pre-training LLM without Learning Rate Decay Enhances Supervised Fine-Tuning

在不使用学习率衰减的情况下预训练LLM增强了监督微调

Kazuki Yano, Shun Kiyono, Sosuke Kobayashi, Sho Takase, Jun Suzuki

机构 * Tohoku University(东大大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文研究了学习率调度在大语言模型预训练中的作用,发现不使用衰减的学习率调度在监督微调后表现更优,且损失景观分析显示其保持更平坦的最小值以支持适应性。

Comments 25 pages, accepted by ICLR 2026 as a conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16152 2026-03-18 cs.LG cs.AI cs.CL 86%

HIPO: Instruction Hierarchy via Constrained Reinforcement Learning

HIPO:通过约束强化学习实现指令层级

Keru Chen, Jun Luo, Sen Lin, Yingbin Liang, Alvaro Velasquez, Nathaniel Bastian, Shaofeng Zou

机构 * School of ECEE Arizona State University(亚利桑那州立大学电子与计算机工程学院) Department of ECE The Ohio State University(俄亥俄州立大学电子工程系) Computer Science Department University of Houston(休斯顿大学计算机科学系) College of Engineering & Applied Science CU Boulder(科罗拉多大学博尔德分校工程与应用科学学院) Dept. of Electrical Engineering & Computer Science United States Military Academy(美国军事学院电子工程与计算机科学系)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 HIPO通过约束马尔可夫决策过程解决层级指令遵循问题,提升系统合规性与用户效用。

Comments 9 pages + appendix. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17325 2026-03-18 cs.LG cs.AI cs.CL 83%

Generalizable End-to-End Tool-Use RL with Synthetic CodeGym

通用端到端工具使用强化学习与合成CodeGym

Weihua Du, Hailei Gong, Zhan Ling, Kang Liu, Lingfeng Shen, Xuesong Yao, Yufei Xu, Dingyuan Shi, Yiming Yang, Jiecao Chen

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出CodeGym框架,通过合成多样化的多轮工具使用环境,提升LLM代理在不同任务配置下的泛化能力,实验显示Qwen2.5-32B-Instruct在OOD基准测试中准确率提升8.7个百分点。

Comments 24 pages. Accepted to ICLR 2026. Project repository: https://github.com/StigLidu/CodeGym

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11408 2026-03-18 cs.LG cs.AI 82%

On-Policy RL Meets Off-Policy Experts: Harmonizing Supervised Fine-Tuning and Reinforcement Learning via Dynamic Weighting

策略学习融合专家数据:通过动态加权实现监督微调与强化学习的和谐统一

Wenhao Zhang, Yuexiang Xie, Yuchang Sun, Yanxi Chen, Guoyin Wang, Yaliang Li, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 本文提出CHORD框架,通过动态加权将监督微调与强化学习统一,解决传统方法在整合时可能破坏响应模式和过拟合专家数据的问题,实验表明其在多个任务中具有稳定高效的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15953 2026-03-18 cs.CL cs.AI cs.LG 80%

A Family of LLMs Liberated from Static Vocabularies

一种摆脱静态词汇库的LLM家族

Aleph Alpha, :, Adnen Abdessaied, Artur Baranowski, Lukas Balles, Michael Barlow, Fabien C. Y. Benureau, Felix Berkenkamp, Lukas Bluebaum, Bastian Boll, Thomas F. Burns, Björn Deiseroth, Constantin Eichenberg, David Friede, Pablo Iyu Guerrero, Ahmed Hammam, Bastian Harren, Johann Higl, Yasser Jadidi, Carina Kauf, Johannes Messner, Jan Hendrik Metzen, Max Meuer, Vedant Nanda, Pit Neitemeier, Koen Oostermeijer, Letitia Parcalabescu, Markus Pernpointner, Felix Reinfurt, Dylan Rodriquez, Grégory Schott, Philipp Siedler, Martin Simonovsky, Till Speicher, Volker Stampa, Stephan Wäldchen, Samuel Weinbach, Gregor Ziegltrum

专题命中 指令微调 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于分层自回归变压器(HAT)架构的LLM家族,通过重新设计编码器和解码器实现更高效的文本压缩和鲁棒性,展示了在英语和德语上的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16206 2026-03-18 cs.LG cs.CL 79%

Offline Exploration-Aware Fine-Tuning for Long-Chain Mathematical Reasoning

离线探索感知微调用于长链数学推理

Yongyu Mu, Jiali Zeng, Fandong Meng, JingBo Zhu, Tong Xiao

机构 * NLP Lab, School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院自然语言处理实验室,中国沈阳) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯公司微信人工智能部门模式识别中心,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出OXA微调方法,通过优化两个目标提升数学推理能力,实验显示在六个基准测试中OXA相比传统SFT在Pass@1和Pass@$k$上平均提升6和5分。

Comments Working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16653 2026-03-18 cs.CV 78%

HeBA: Heterogeneous Bottleneck Adapters for Robust Vision-Language Models

HeBA:异构瓶颈适配器用于鲁棒的视觉-语言模型

Md Jahidul Islam

机构 * Department of Electrical and Electronic Engineering(电气电子工程系) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 HeBA通过引入模态特定的结构归纳偏置,改进了视觉-语言模型在下游任务中的适应性,提升了稳定性和准确性,达到11个少样本基准的新状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10967 2026-03-18 cs.CV 78%

Med-DualLoRA: Local Adaptation of Foundation Models for 3D Cardiac MRI

Med-DualLoRA: 3D心脏MRI基础模型的局部适应

Joan Perramon-Llussà, Amelia Jiménez-Sánchez, Grzegorz Skorupko, Fotis Avgoustidis, Carlos Martín-Isla, Karim Lekadir, Polyxeni Gkontra

机构 * Artificial Intelligence in Medicine Lab (BCN-AIM), Departament de Matemàtiques i Informàtica, Universitat de Barcelona, Spain(巴塞罗那大学人工智能医学实验室(BCN-AIM)、数学与计算机科学系,西班牙) Institució Catalana de Recerca i Estudis Avançats (ICREA), Barcelona, Spain(加泰罗尼亚高级研究机构(ICREA),巴塞罗那,西班牙)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出Med-DualLoRA框架,通过解耦全局共享和局部低秩适应,实现3D心脏MRI疾病检测的联邦学习,提升个性化与通信效率。

Comments 11 pages, 2 figures. Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16843 2026-03-18 cs.AI 77%

Internalizing Agency from Reflective Experience

从反思经验中内化代理性

Rui Ge, Yichao Fu, Yuyang Qian, Junda Su, Yiming Zhao, Peng Zhao, Hao Zhang

机构 * University of California San Diego(加州大学圣地亚哥分校) Nanjing University(南京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出LEAFE框架,通过反思经验内化恢复代理性,提升长周期任务中的问题解决能力,实验显示在Pass@k任务中优于传统方法。

Comments 17 pages, 5 figures; Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16356 2026-03-18 cs.NI cs.AI 77%

Toward Experimentation-as-a-Service in 5G/6G: The Plaza6G Prototype for AI-Assisted Trials

迈向5G/6G的实验即服务:Plaza6G原型用于AI辅助试验

Sergio Barrachina-Muñoz, Marc Carrascosa-Zamacois, Horacio Bleda, Umair Riaz, Yasir Maqsood, Xavier Calle, Selva Vía, Miquel Payaró, Josep Mangues-Bafalluy

机构 * Spanish MINECO(西班牙国家研究委员会) MCIN/AEI(西班牙国家研究委员会)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Plaza6G是首个整合云资源与下一代无线基础设施的实验即服务平台,通过自然语言和REST API实现低门槛实验设计,结合LLM助手提升实验知识与领域微调,支持OTA试验与可重现的无线实验。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16044 2026-03-18 cs.AI 77%

Enhancing Linguistic Generalization of VLA: Fine-Tuning OpenVLA via Synthetic Instruction Augmentation

增强 VLA 的语言泛化能力:通过合成指令增强细调 OpenVLA

Dongik Shin

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过合成指令集提升 OpenVLA 的语言泛化能力,利用 LoRA 技术在增强数据上微调,增强复杂自然语言意图与机器人动作之间的桥梁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16063 2026-03-18 cs.CV 75%

ViT-AdaLA: Adapting Vision Transformers with Linear Attention

ViT-AdaLA:基于线性注意力的视觉变换器适应

Yifan Li, Seunghyun Yoon, Viet Dac Lai, Franck Dernoncourt, Jason Kuen, Yu Kong, Trung Bui

机构 * Adobe Research(Adobe研究院) Michigan State University, East Lansing, MI, USA.(密歇根州立大学,东兰辛,MI,美国)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出ViT-AdaLA框架,通过注意力对齐、特征对齐和监督微调三阶段,有效将视觉基础模型的先验知识迁移至线性注意力ViT,提升长序列处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16045 2026-03-18 cs.AI 70%

POaaS: Minimal-Edit Prompt Optimization as a Service to Lift Accuracy and Cut Hallucinations on On-Device sLLMs

POaaS:最小编辑提示优化作为服务以提升准确性和减少幻觉于设备端sLLMs

Jungwoo Shim, Dae Won Kim, Sun Wook Kim, Soo Young Kim, Myungcheol Lee, Jae-geun Cha, Hyunhwa Choi

机构 * Electronics and Telecommunications Research Institute(电子电信研究院)

专题命中 指令微调 :language model(abstract);small language model(abstract);分类 cs.AI

AI总结 针对设备端sLLMs的不完美提示问题,POaaS通过轻量专家模块和严格约束实现高效优化,提升准确性和事实性,优于传统搜索方法。

Comments Accepted at FEVER 2026. 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15990 2026-03-18 cs.LG 70%

W2T: LoRA Weights Already Know What They Can Do

W2T: LoRA 权重已经知道它们能做什么

Xiaolong Han, Ferrante Neri, Zijian Jiang, Fang Wu, Yanfang Ye, Lu Yin, Zehong Wang

机构 * University of Surrey(萨里大学) Stanford University(斯坦福大学) University of Notre Dame(诺丁汉大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 W2T通过将LoRA权重转换为token化嵌入,验证了在消除因子化歧义后,LoRA权重能可靠指示模型行为,适用于属性分类、性能预测和适配器检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26307 2026-03-18 cs.LG 70%

Attribution-Guided Decoding

基于归因的解码

Piotr Komorowski, Elena Golimblevskaia, Reduan Achtibat, Thomas Wiegand, Sebastian Lapuschkin, Wojciech Samek

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫海因里希·赫兹研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于归因的解码方法AGD,通过引导生成过程以提升指令遵循、知识密集型任务的准确性和可靠性,同时减少计算开销。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15968 2026-03-18 cs.AI cs.CL cs.LG cs.MA 67%

MAC: Multi-Agent Constitution Learning

MAC:多智能体宪法学习

Rushil Thareja, Gautam Gupta, Francesco Pinto, Nils Lukas

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Indraprastha Institute of Information Technology Delhi(德里印度教教派信息科技学院) Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MAC多智能体宪法学习方法,通过结构化提示优化提升LLM控制效果,实现可解释的规则集生成,优于现有提示优化方法,并在PII标注任务中表现优异。

Comments Code: https://github.com/rushil-thareja/MAC-Multi-Agent-Constitution-Learning | PyPI: https://pypi.org/project/mac-prompt/ | Website: https://www.mac-prompt.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15011 2026-03-18 cs.CV 67%

Molecular Identifier Visual Prompt and Verifiable Reinforcement Learning for Chemical Reaction Diagram Parsing

分子标识视觉提示与可验证强化学习用于化学反应图解析

Jiahe Song, Chuang Wang, Yinfan Wang, Hao Zheng, Rui Nie, Bowen Jiang, Xingjian Wei, Junyuan Gao, Yubin Wang, Bin Wang, Lijun Wu, Jiang Wu, Qian Yu, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Peking University(北京大学) South China Normal University(华南师范大学)

专题命中 指令微调 :language model(abstract);prompting(abstract)

AI总结 本文提出IdtVP和Re3-DAPO方法,通过视觉提示和强化学习提升化学反应图解析的准确性和泛化能力,同时发布ScannedRxn基准数据集以评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11391 2026-03-18 cs.DB 67%

BEACON: Budget-Aware Entity Matching Across Domains (Extended Technical Report)

BEACON: 跨领域预算感知实体匹配(扩展技术报告)

Nicholas Pulsone, Roee Shraga, Gregory Goren

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对跨领域实体匹配中标签稀缺问题,提出BEACON框架,利用嵌入表示指导样本选择,实验证明在不同预算下均优于现有方法。

Comments This paper is the extended version of "BEACON: Budget-Aware Entity Matching Across Domains" to appear in Proc. ACM SIGMOD International Conference on Management of Data (SIGMOD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13939 2026-03-18 cs.CL cs.AI cs.CY 62%

Readers Prefer Outputs of AI Trained on Copyrighted Books over Expert Human Writers

读者更倾向于AI在受版权保护的书籍上训练输出的文本而非专家人类作家

Tuhin Chakrabarty, Jane C. Ginsburg, Paramveer Dhillon

机构 * Department of Computer Science, Stony Brook University(石溪大学计算机科学系) Columbia Law School(哥伦比亚法学院) School of Information Science, University of Michigan(密歇根大学信息科学学院) MIT Initiative on the Digital Economy(麻省理工学院数字经济倡议)

专题命中 指令微调 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究比较了AI与专家作家在模仿50位获奖作者风格的文本表现,发现微调AI在风格和质量上更受读者青睐,且效果稳健。

Comments Preprint Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08221 2026-03-18 cs.CV cs.AI cs.LG 62%

Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training

生成任意场景:基于场景图的数据合成用于视觉生成训练

Ziqi Gao, Weikai Huang, Jieyu Zhang, Aniruddha Kembhavi, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 指令微调 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Generate Any Scene,通过系统生成场景图来合成高质量数据,用于提升视觉生成模型的合成能力与语义对齐。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15690 2026-03-18 cs.SE cs.AI 57%

Loosely-Structured Software: Engineering Context, Structure, and Evolution Entropy in Runtime-Rewired Multi-Agent Systems

松散结构软件:运行时重 wiring 多智能体系统的工程上下文、结构与进化熵

Weihao Zhang, Yitong Zhou, Huanyu Qu, Hongyi Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) AI Chip Center for Emerging Smart Systems(新兴智能系统人工智能芯片中心) University of Macau(澳门大学) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(abstract);分类 cs.AI

AI总结 本文提出松散结构软件,通过运行时熵管理提升多智能体系统的可设计性、可扩展性和可进化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16860 2026-03-18 cs.RO 50%

DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models

DreamPlan: 通过视频世界模型高效强化微调视觉语言规划器

Emily Yue-Ting Jia, Weiduo Yuan, Tianheng Shi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 指令微调 :language model(abstract)

AI总结 DreamPlan通过视频世界模型高效强化微调视觉语言规划器,利用零样本VLM生成探索数据训练动作条件视频生成模型,再通过ORPO在虚拟环境中微调VLM,提升物体 manipulation 成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04153 2026-03-18 cs.CV 50%

Diffusion-DRF: Free, Rich, and Differentiable Reward for Video Diffusion Fine-Tuning

Diffusion-DRF:免费、丰富且可微的奖励用于视频扩散微调

Yifan Wang, Yanyu Li, Gordon Guocheng Qian, Sergey Tulyakov, Yun Fu, Anil Kag

机构 * Northeastern University(东北大学) Snap Inc.(Snap公司)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出Diffusion-DRF框架,通过多维问题和密集VQA解释查询生成丰富反馈,实现稳定奖励微调,无需偏好数据集。

Comments Webpage: https://snap-research.github.io/diffusion-drf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16641 2026-03-18 cs.CV 50%

FlowComposer: Composable Flows for Compositional Zero-Shot Learning

FlowComposer: 用于组合零样本学习的可组合流

Zhenqi He, Lin Li, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出FlowComposer,通过学习两个基础流将视觉特征传输到属性和对象文本嵌入,并引入可学习的Composer显式融合速度场以生成组合流,有效解决组合零样本学习中的隐式组合构造和特征纠缠问题。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏