arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-22 至 2026-05-22 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 25 篇

2510.07962 2026-05-22 cs.CL cs.AI 94%

LightReasoner: Can Small Language Models Teach Large Language Models Reasoning?

LightReasoner: 小型语言模型能否教会大型语言模型推理?

Jingyuan Wang, Yankai Chen, Zhonghang Li, Chao Huang

机构 * University of Hong Kong(香港大学) University of Chicago(芝加哥大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);small language model(title);LLM(abstract,abstract_cn)

AI总结 本文提出LightReasoner框架,通过利用强专家模型与弱业余模型之间的行为差异,发现高价值推理时刻,从而提升大型语言模型的推理能力,同时减少资源消耗。

Comments Updated to ACL 2026 camera-ready version with improved method presentation, expanded related work discussion, additional analyses, and presentation refinements

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22731 2026-05-22 cs.LG cs.AI 94%

Post-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy Distillation

训练后是关于状态,而不是标记:一种状态分布视角下的SFT、RL和在线策略蒸馏

Dong Nie

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :SFT(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文从状态分布的角度研究了监督微调(SFT)、强化学习(RL)和在线策略蒸馏(OPD)等大语言模型训练后方法,发现训练状态的来源和局部性与监督信号的形式同样重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02938 2026-05-22 cs.LG cs.AI 92%

Beyond One-Size-Fits-All: Adaptive Subgraph Denoising for Zero-Shot Graph Learning with Large Language Models

超越一刀切:基于大语言模型的零样本图学习中的自适应子图去噪

Fengzhi Li, Liang Zhang, Yuan Zuo, Ruiqing Zhao, YanSong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng

机构 * JIUTIAN Research(JIUTIAN研究) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MIIT Key Laboratory of Data and Decision Intelligence(信息与决策智能重点实验室) Beihang University(北航)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本文提出GraphSSR框架,通过自适应子图提取和去噪方法,解决传统图神经网络在零样本学习中泛化能力不足的问题,提升大语言模型在图推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00139 2026-05-22 cs.AI cs.CL cs.LG stat.ME 91%

Enhancing Causal Reasoning in Large Language Models: A Causal Attribution Model for Precision Fine-Tuning

增强大语言模型中的因果推理:一种用于精确微调的因果归因模型

Hengrui Cai, Shengjie Liu, Rui Song

机构 * University of California, Irvine(加州大学尔湾分校) North Carolina State University(北卡罗来纳州立大学) Amazon(亚马逊公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种因果归因模型,通过精确微调提升大语言模型的可解释性和因果推理能力,展示了模型在不同领域中的因果发现任务中的有效性。

Comments A Python implementation of our proposed method is available at https://github.com/ncsulsj/Causal_LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02709 2026-05-22 cs.AI 91%

ATLAS: A Multi-LLM Training Framework for EvoDPO with Adaptive Reference Evolution

ATLAS:一种用于EvoDPO的多LLM训练框架,具有自适应参考进化

Ujin Jeon, Jiyong Kwon, Madison Ann Sullivan, Caleb Eunho Lee, Guang Lin

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院) Purdue University West Lafayette(韦伯州立大学) School of Mechanical Engineering(机械工程学院) Department of Mathematics(数学系) Department of Computer Science(计算机科学系) Department of Mathematics and Mechanical Engineering(数学与机械工程系)

专题命中 指令微调 :LLM(title,title_cn);preference optimization(abstract);分类 cs.AI

AI总结 本文提出ATLAS框架,通过自适应参考进化解决多LLM代理系统中固定参考模型导致的更新保守或训练停滞问题,结合支持者驱动探索与EvoDPO驱动的稳定性,提升长期评估驱动的自我改进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16984 2026-05-22 cs.CL 90%

Closing the Gap at CRAC 2026: Two-Stage Adaptation for LLM-Based Multilingual Coreference Resolution

在CRAC 2026上缩小差距:基于LLM的多语言核心指代解析的两阶段适应

Antoine Bourgois, Olga Seminck, Thierry Poibeau

机构 * Lattice (CNRS UMR 8094 & ENS-PSL & Université Sorbonne Nouvelle)(Lattice(CNRS UMR 8094 和 ENS-PSL 和 索邦学院新欧))

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出了一种基于LLM的多语言核心指代解析方法,通过两阶段适应策略,在CRAC 2026共享任务中取得了74.32的平均CoNLL F1分数,排名第一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22185 2026-05-22 cs.CV cs.LG 88%

Enhancing Multimodal Large Language Models for Safety-Critical Driving Video Analysis

增强多模态大语言模型以用于安全关键驾驶视频分析

Tomaso Trinci, Henrique Piñeiro Monteagudo, Leonardo Taccari

机构 * Verizon Connect

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本研究通过融合降采样视频帧与同步高频 telemetry 数据及专用计算机视觉模型的语义信息,提升多模态大语言模型在安全关键驾驶场景中的感知与推理能力,从而更准确地识别和描述现实驾驶中的安全关键事件。

Comments Accepted at the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21834 2026-05-22 cs.LG 87%

On-Policy Consistency Training Improves LLM Safety with Minimal Capability Degradation

基于策略的一致性训练通过最小能力退化提升大语言模型安全性

Andy Han, Kristina Fujimoto, Avidan Shah, Kiet Nguyen, Kai Xu, Chen Yueh-Han, Ilia Sucholutsky, Rico Angell

机构 * New York University(纽约大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title);分类 cs.LG

AI总结 本文提出基于策略的一致性训练(OPCT)方法,通过模型自身响应对比性提示来提升大语言模型的安全性,实验表明OPCT在抑制顺从性、防止越狱和增强安全意识方面优于传统监督微调(SFT),同时避免了SFT导致的能力退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21781 2026-05-22 cs.CL 87%

Reflective Prompt Tuning through Language Model Function-Calling

通过语言模型功能调用实现反思式提示调优

Farima Fatahi Bayat, Moin Aminnaseri, Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加穹实验室)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 本文提出了一种名为Reflective Prompt Tuning (RPT)的框架,利用语言模型功能调用模拟人类提示工程师的迭代工作流程,通过诊断函数评估目标模型,生成结构化诊断报告,并利用历史报告优化提示,从而提升提示效果和置信度校准。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22655 2026-05-22 cs.CR cs.SE 86%

Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap

细调的大语言模型理解漏洞吗?对语义陷阱的调查

Feiyang Huang, Yuqiang Sun, Fan Zhang, Ziqi Yang, Han Liu, Yang Liu

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了细调的大语言模型是否真正理解漏洞的根本原因,发现了一种称为语义陷阱的现象,并提出了一种评估框架来检测这种现象。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22356 2026-05-22 cs.CL 85%

Modeling Pathology-Like Behavioral Patterns in Language Models Through Behavioral Fine-Tuning

通过行为微调建模病理样行为模式

Nicola Milano, Davide Marocco

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) Natural and Artificial Cognition Laboratory(自然与人工认知实验室) Department of Humanities(人文学部)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本文研究了通过行为微调在语言模型中建模病理样行为模式,采用结构化决策任务进行微调,发现模型在不同上下文中产生稳定的生成分布变化,表明行为优化能影响语言生成的分布特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22823 2026-05-22 cs.CV 83%

Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs

它往哪个方向移动?视频大语言模型中方向运动盲症的诊断与克服

Jongseo Lee, Hyuntak Lee, Sunghun Kim, Sooa Kim, Jihoon Chung, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) Princeton University(普林斯顿大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文研究了视频大语言模型在理解方向运动时的盲点,提出MoDirect数据集和DeltaDirect方法,通过改进模型对方向运动的感知能力,显著提升了模型在合成和真实场景中的方向识别性能。

Comments Preprint. 59 pages, including appendix. Code: https://github.com/KHU-VLL/DeltaDirect

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15606 2026-05-22 cs.AR 80%

Spec2Cov: An Agentic Framework for Code Coverage Closure of Digital Hardware Designs

Spec2Cov: 一种用于数字硬件设计代码覆盖率闭合的代理框架

Sean Lowe, Elias Hilaneh, Alma Babbit, Nakul Gopalan, Vidya Chhabria, Aman Arora

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于代理框架的代码覆盖率闭合方法,利用大型语言模型和硬件仿真器的协同工作,自动迭代生成测试刺激以加速覆盖率闭合,并在不同复杂度的设计上实现了高达49%的覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05660 2026-05-22 cs.CR cs.AI cs.CL 79%

Optimus: A Robust Defense Framework for Mitigating Toxicity while Fine-Tuning Conversational AI

Optimus: 一种用于在微调对话AI时缓解毒性行为的稳健防御框架

Aravind Cheruvu, Shravya Kanchi, Sifat Muhammad Abdullah, Nicholas Ka-Shing Kong, Daphne Yao, Murtuza Jadliwala, Bimal Viswanath

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Optimus框架,通过整合训练无关的毒性分类方案和双重策略对齐过程,有效缓解微调过程中的毒性问题,并在有毒性分类器偏差时仍能保持高召回率,优于现有最佳防御方法StarDSS。

Comments Accepted at ACM CODASPY 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22607 2026-05-22 cs.CV 78%

Enhancing Gaze Reasoning in Vision Foundation Models for Gaze Following

增强视觉基础模型中的眼动推理以实现眼动跟随

Shijing Wang, Yaping Huang, Chaoqun Cui, David Wong, Yihua Cheng, Alexandros Neophytou, Hyung Jin Chang

机构 * Beijing Jiaotong University(北京交通大学) University of Birmingham(英国伯明翰大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) Microsoft, UK(微软公司(英国))

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出了一种新的训练机制,通过局部LoRA和锥外惩罚来增强视觉基础模型中的眼动推理,以提升眼动跟随任务的性能,特别是在目标不显著时表现更优。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22579 2026-05-22 cs.CL cs.AI stat.ML 73%

Beyond Temperature: Hyperfitting as a Late-Stage Geometric Expansion

超越温度:超拟合作为晚期几何扩展

Meimingwei Li, Yuanhao Ding, Esteban Garces Arias, Christian Heumann

机构 * Department of Statistics, LMU Munich(慕尼黑大学统计系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了超拟合现象,发现其与分布锐化不同,通过实验表明超拟合依赖于动态的上下文相关排名重排机制,并在Transformer最后一层的终端扩展中实现了特征空间的几何扩展,提出了Late-Stage LoRA方法以提升生成质量。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22501 2026-05-22 cs.CL cs.AI cs.IR 73%

BeLink: Biomedical Entity Linking Meets Generative Re-Ranking

BeLink: 生物医学实体链接结合生成性重新排序

Darya Shlyk, Stefano Montanelli, Lawrence Hunter

机构 * University of Milan(米兰大学) University of Chicago(芝加哥大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于生成模型的重新排序方法,通过指令微调提高生物医学实体链接的效率和准确性,在多个基准测试中实现了3%-24%的链接准确率提升,同时减少了推理时间。

Comments Accepted to ACM SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21993 2026-05-22 cs.AI cs.LG 73%

ECPO: Evidence-Coupled Policy Optimization for Evidence-Certified Candidate Ranking

ECPO:基于证据的策略优化用于证据认证的候选者排序

Miaobo Hu, Shuhao Hu, BoKun Wang, Yina Sa, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究了证据认证候选者排序问题,提出了一种名为ECPO的策略优化方法,通过结合排序和证据证书来提升排序效果和证据可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08389 2026-05-22 cs.CV cs.AI 70%

Decoupling Endpoint and Semantic Transition Learning for Zero-Shot Composed Image Retrieval

解耦端点与语义转换学习以实现零样本复合图像检索

Mingyu Liu, Sihan Huang, Yijia Fan, Yinlin Yan, Quan Zhang, Jian-Fang Hu, Jianhuang Lai

机构 * Sun Yat-sen University(中山大学) Guangdong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing(机器智能与先进计算重点实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种解耦端点与语义转换学习的方法DeCIR,用于零样本复合图像检索,通过构造配对的正向/反向编辑元组,训练独立的低秩文本适配器分支,并利用低秩方向合并(LRDM)将它们合并为一个可部署的适配器,从而提升了投影基于的零样本复合图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21996 2026-05-22 cs.SE cs.AI 70%

From Patches to Trajectories: Privileged Process Supervision for Software-Engineering Agents

从片段到轨迹:软件工程代理的特权过程监督

Murong Ma, Tianyu Chen, Yun Lin, Shuai Lu, Qinglin Zhu, Yeyun Gong, Zhiyong Huang, Peng Cheng, Yan Lu, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院) Shanghai Jiao Tong University(上海交通大学) King’s College London(伦敦国王学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Patches-to-Trajectories (P2T)方法,通过利用开发者撰写的参考补丁来改进软件工程代理的训练过程,提高训练效果和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22126 2026-05-22 cs.CV 67%

AesFormer: Transform Everyday Photos into Beautiful Memories

AesFormer: 将日常照片转化为美丽的记忆

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文提出AesFormer框架,通过将审美规划与图像编辑解耦,改进照片的审美质量,同时保持主体身份和场景语义,构建了包含9071对严格对齐图像对的AesRecon基准数据集。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22581 2026-05-22 cs.CV cs.AI cs.LG 62%

SceneAligner: 3D-Grounded Floorplan Localization in the Wild

SceneAligner: 在真实场景中实现基于3D的平面定位

Junhyeong Cho, Ruojin Cai, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学) Kempner Institute, Harvard University(哈佛大学 Kempner 院)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种在真实场景中实现基于3D重建的平面定位方法,通过将任务 grounding 在场景的重建3D表示中,解决了现有方法在大规模建筑和栅格化平面图中应用受限的问题。

Comments Project Page: https://Cornell-VAILab.github.io/SceneAligner

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18094 2026-05-22 eess.AS cs.SD 50%

OneVoice: One Model, Triple Scenarios-Towards Unified Zero-shot Voice Conversion

OneVoice: 一个模型,三种场景——迈向统一的零样本语音转换

Zhichao Wang, Tao Li, Wenshuo Ge, Zihao Cui, Shilei Zhang, Junlan Feng

机构 * JIUTIAN Research(钧天研究院) China Mobile(中国移动) Beijing, China(北京,中国)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出OneVoice,一种能够统一处理语音转换三种场景(语音克隆、语言保护和歌唱)的零样本框架,通过混合专家机制和双路径路由机制实现统一建模,并采用两阶段训练策略解决数据不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21710 2026-05-22 cs.RO 50%

PGDG: Physically Grounded Data Generation for Robust Bimanual Policy Learning from a Single Demonstration

PGDG: 为从单个示范中学习鲁棒双臂策略而设计的物理基础数据生成

Cunxi Dai, Haoran Chang, Aditya Nisal, Rahul Kumar, Guofei Chen, Tao Chen, Yuzhe Qin, Guanya Shi

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Dexmate

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出PGDG,一种基于物理的数据生成框架,通过零样本校准扩展单个示范为包含物理上合理、成功和多样恢复行为的紧凑数据集,从而提升双臂操作中接触丰富的行为克隆性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17640 2026-05-22 cs.CV 50%

Not All Starting Points Are Equal: Pre-trained Priors and Their Outsized Impact on Person Identification

并非所有起始点都平等:预训练先验及其在人识别人脸识别中的巨大影响

Thomas M. Metz, Matthew Q. Hill, Alice J. O'Toole

机构 * School of Behavioral and Brain Sciences(行为与脑科学学院) The University of Texas at Dallas(德克萨斯大学达拉斯分校) Richardson, Texas, USA(德克萨斯州里德利尔)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文研究了预训练方法对人识别人脸识别任务的影响,发现预训练权重在域适应过程中扮演重要先验角色,并展示了使用大视觉基础模型进行简单域适应可获得SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏