arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11585 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11585 篇

2607.11528 2026-08-06 cs.CE 版本更新 87%

HermesHFL: Incentive-Compatible Hierarchical Federated Unlearning for Dynamic LLM Fine-Tuning

HermesHFL:用于动态大语言模型微调的激励兼容分层联邦遗忘

Chenxi Sun, Minghui Liwang, Wusi He, Yuhan Su, Zhang Liu, Sai Zou, Wei Ni, Seyyedali Hosseinalipour

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对大语言模型微调中分层联邦遗忘面临的挑战,提出HermesHFL框架,通过参数高效微调支持选择性遗忘等。制定统一优化问题,开发Neogen框架解决,实验表明该框架在模型效用等多方面优于现有基线。

Comments 15pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01759 2026-08-04 cs.CR 新提交 87%

Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents

单独无害,联合有害:在自进化大语言模型智能体中利用经验组合

Bingyu Yan, Xiaoming Zhang, Chaozhuo Li, Ziyi Zhou, Yirui Qi, Litian Zhang

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出EvoBreak攻击,利用自进化LLM智能体的良性经验组合,结合BreakGym生成训练目标,在保持高无害性的同时优于现有攻击,揭示了新的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00078 2026-08-04 cs.CV 新提交 87%

Device-First Feedback: Toward Mobile-Native LLM-Driven Neural Architecture Search

设备优先反馈:面向移动端原生大语言模型驱动的神经网络架构搜索

Saif U Din, Muhammad Ahsan Hussain, Radu Timofte, Dmitry Ignatov

机构 * University of Würzburg(维尔茨堡大学) CAIDAS IFI

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出自动化移动端部署闭环流水线,针对CIFAR-10、CIFAR-100基准在三星平板验证,发现GPU微调无法保证移动端性能单调提升,需多数据集设备端测量。

Comments 11 pages, 4 figures, 4 tables. Code: https://github.com/ABrain-One/nn-gpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-07-28 cs.IR 新提交 87%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05080 2026-07-28 q-fin.TR 版本更新 87%

MM-ARC: Multimodal Adaptive Routing of Capital with Robustness-Audited Strategy Pools

MM-ARC:具有稳健性审核策略池的资本多模态自适应路由

Yang Chen, Yuchen Cao, Jacky Keung, Leilei Gan, Kun Kuang, Yueheng Jiang, Zhaozhao Ma, Jianping Zhu, Fei Wu, Jinpeng Li

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究金融交易系统如何转化多模态市场历史,提出MM-ARC方法,通过多视图在不同专家间分配资本,经稳健性审核筛选候选方案,实验显示该方法在夏普比率和最大回撤等指标上优于基线,有相对基准的支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06941 2026-07-07 cs.LG cs.AI cs.CL 版本更新 87%

Endogenous Resistance to Activation Steering in Language Models

语言模型中激活引导的内生抵抗

Alex McKenzie, Keenan Pepper, Stijn Servaes, Martin Leitgab, Murat Cubuktepe, Mike Vaiana, Diogo de Lucena, Judd Rosenblatt, Michael S. A. Graziano

机构 * University of Washington(华盛顿大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大型语言模型在任务不匹配的激活引导下能内生抵抗,通过显式重启恢复正确生成,并识别出相关稀疏自编码器潜在变量,可增强或削弱该抵抗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27999 2026-07-03 cs.CV 版本更新 87%

CLIP-AUTT: Test-Time Personalization with Action Unit Prompting for Fine-Grained Video Emotion Recognition

CLIP-AUTT: 基于动作单元提示的测试时个性化方法用于细粒度视频情绪识别

Muhammad Osama Zeeshan, Masoumeh Sharafi, Benoit Savary, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal(LIVIA, ILLS, 系统工程学院, 蒙特利尔高等技术学院) LIVIA, Dept. of Software and IT Engineering, ETS Montreal(LIVIA, 软件与IT工程学院, 蒙特利尔高等技术学院) Dept. of Computer Science, École Polytechnique(计算机科学系, 巴黎综合理工学院)

专题命中 指令微调 :prompting(title);LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract)

AI总结 本文提出CLIP-AUTT,通过动作单元提示实现测试时个性化,提升细粒度视频情绪识别的鲁棒性和个性化能力。

Comments ECCV, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00685 2026-07-02 cs.MA 新提交 87%

M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning

M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化

Haiwen Li, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);prompting(abstract)

AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29219 2026-06-05 cs.CV 87%

SalsaAgent: A multimodal embodied language model for interactive dance generation

SalsaAgent: 一种用于交互式舞蹈生成的多模态具身语言模型

Payam Jome Yazdian, Zoe Stanley, Angelica Lim

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 提出SalsaAgent语言模型,通过非语言运动令牌传递和两阶段令牌到扩散管道,生成与人类领舞者及音乐背景交互的全身萨尔萨舞蹈动作。

Comments Project page: https://pjyazdian.github.io/Salsa-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20158 2026-06-05 cs.CV 87%

Harmonious Parameter Adaptation in Continual Visual Instruction Tuning for Safety-Aligned MLLMs

在安全对齐的连续视觉指令微调中实现和谐参数适应

Ziqi Wang, Chang Che, Qi Wang, Hui Ma, Zenglin Shi, Cees G. M. Snoek, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Tsinghua University(清华大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了在安全对齐的连续视觉指令微调中如何平衡安全性和任务性能,提出了一种名为和谐参数适应(HPA)的后训练框架,通过参数分区、平衡选择和正交调整来缓解遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04986 2026-06-04 cs.CV 87%

Food-R1: A Unified Multi-Task Food Vision-Language Model with Reinforcement Learning

Food-R1: 一种基于强化学习的统一多任务食品视觉语言模型

Yu Zhu, Yongkang Li, Wenjie Zhu, Haoyi Jiang, Wenyu Liu, Wei Yang, Bin Li, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);instruction tuning(abstract)

AI总结 针对现有食品视觉语言模型依赖监督微调导致推理和泛化能力受限以及营养标注稀缺的问题,提出包含链式思维标注的大规模基准CalorieBench-80K和基于强化微调(GRPO)的统一多任务食品视觉语言模型Food-R1,在食品相关任务上持续超越强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30260 2026-05-29 cs.CL cs.AI cs.CV cs.LG 87%

How LoRA Remembers? A Parametric Memory Law for LLM Finetuning

LoRA如何记忆?大语言模型微调的参数记忆定律

Ziwen Xu, Haiwen Hong, Linsong Yu, Benglei Cui, Longtao Huang, Hui Xue, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出参数记忆定律,揭示LoRA在微调中参数与序列长度对损失降低的幂律关系,并基于此设计MemFT优化策略提升记忆保真度与效率。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27190 2026-05-27 cs.CL cs.AI cs.LG cs.SD 87%

Learning When to Think While Listening in Large Audio-Language Models

在大音频语言模型中学习何时在聆听时思考

Zhiyuan Song, Weici Zhao, Yang Xiao, Suhao Yu, Cheng Zhu, Jiatao Gu

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种可学习的等待-思考-回答控制机制,通过多奖励强化学习优化大音频语言模型在流式语音交互中的推理时机,在提升准确率的同时减少响应延迟。

Comments 19 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23039 2026-05-25 cs.CL cs.AI cs.LG 87%

Do Language Models Know What Not to Say? Causal Evidence for Statistical Preemption in LLMs

语言模型知道不该说什么吗?大语言模型中统计预占的因果证据

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过因果干预和竞争性设计,证明大语言模型通过分布竞争(统计预占)习得负面语言知识,与人类可接受性判断高度相关。

Comments Accepted at CoNLL 2026. 21 pages (9 main body + appendices and references); 4 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19859 2026-05-25 cs.CV 87%

Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models

Eyes on VLM: 视觉语言模型中注视跟随与社会性注视预测的基准测试

Hengfei Wang, Anshul Gupta, Pierre Vuillecard, Jean-Marc Odobez

机构 * Idiap Research Institute(Idiap研究机构)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出EyeVLM评估框架,通过零样本和微调方式测试视觉语言模型在注视跟随(几何视觉处理)和社会性注视预测(社交推理)两个核心任务上的能力,发现当前VLM缺乏精确的注视理解能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18104 2026-05-15 cs.CL cs.AI cs.LG 87%

Training and Evaluating Language Models with Template-based Data Generation

基于模板的数据生成训练和评估语言模型

Yifan Zhang

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Template-based Data Generation方法,通过生成高质量数学问题及可验证解,解决大语言模型在复杂推理任务中的数据稀缺问题,并引入TemplateMath Part I: TemplateGSM数据集。

Comments Published in ICLR 2025 DATA-FM Workshop. Project Page: https://github.com/iiis-ai/TemplateMath

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10606 2026-05-12 cs.CV 87%

ViSurf: Visual Supervised-and-Reinforcement Fine-Tuning for Large Vision-and-Language Models

ViSurf:面向大视觉-语言模型的视觉监督与强化微调

Yuqi Liu, Liangyu Chen, Jiazhen Liu, Mingkang Zhu, Zhisheng Zhong, Bei Yu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) Renmin University of China(中国人民大学) The Hong Kong University of Science(香港科学大学)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出ViSurf,一种融合监督微调与强化学习的单阶段方法,通过整合外部监督与内部强化提升大视觉-语言模型性能,实验表明其在多个基准上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20531 2026-05-08 cs.DC cs.AI cs.CL cs.LG 87%

Epistemic Observability in Language Models

语言模型中的认知可观察性

Tony Mason, Vaastav Anand

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 指令微调 :language model(title);RLHF(abstract,abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现语言模型在制造内容时自信度最高,证明这是观察问题而非能力问题,提出通过计算副产品提升检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11110 2026-04-29 cs.SD 87%

Ti-Audio: The First Multi-Dialectal End-to-End Speech LLM for Tibetan

Ti-Audio:首个多方言端到端藏语语音大模型

Jialing Wang, Yue Zhao, Yuhao Zhang, Jing Yu, Shaosai Li, Zhanchen Dai, Benyou Wang, Haizhou Li

机构 * Minzu University of China(中国民族大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Ti-Audio,首个多方言端到端藏语语音大模型,通过动态Q-Former适配器和温度采样策略解决低资源多方言环境下的语音识别与翻译问题,实验显示其在藏语基准测试中达到最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23121 2026-04-28 cs.RO cs.CV 87%

Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training

打破锁定:在低数据VLA后训练中保持可引导性

Suning Huang, Jiaqi Shao, Ke Wang, Qianzhong Chen, Jiankai Sun, Yanjiang Guo, Mac Schwager, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);foundation model(abstract)

AI总结 本文提出DeLock方法,通过保留视觉 grounding 和测试时对比提示指导,解决VLA策略在低数据后训练中因过度专业化导致的概念和空间锁定问题,实验证明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15974 2026-04-21 cs.CL cs.AI cs.LG 87%

BEFT: Bias-Efficient Fine-Tuning of Language Models in Low-Data Regimes

BEFT: 在低数据环境下高效优化语言模型的偏置项

Baichuan Huang, Ananth Balashankar, Amir Aminifar

机构 * Lund University(Lund 大学) Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在低数据环境下优化语言模型偏置项(b_q, b_k, b_v)对下游任务性能的影响,发现直接优化b_v能显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15484 2026-04-20 cs.IR 87%

vstash: Local-First Hybrid Retrieval with Adaptive Fusion for LLM Agents

vstash:基于自适应融合的本地优先混合检索LLM代理

Jayson Steffens

专题命中 指令微调 :LLM(title,title_cn)

AI总结 vstash通过自适应融合和自监督嵌入优化,提升LLM代理在多数据集上的检索性能,实现NDCG@10的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12148 2026-04-15 cs.CV 87%

ViLL-E: Video LLM Embeddings for Retrieval

ViLL-E:用于检索的视频大语言模型嵌入

Rohit Gupta, Jayakrishnan Unnikrishnan, Fan Fei, Sheng Liu, Son Tran, Mubarak Shah

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 ViLL-E通过引入新的嵌入生成机制,提升复杂视频处理能力,在视频检索和时间定位任务中表现优异,同时在视频问答任务中保持竞争力。

Comments Accepted at ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06501 2026-03-25 cs.SE 87%

Evaluating Language Model Applications for Identifying Solution-Related Content in Issue Report Discussions

评估语言模型在问题报告讨论中识别解决方案相关内容的应用

Antu Saha, Mehedi Sun, Oscar Chaparro

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 本文利用语言模型自动识别问题讨论中的解决方案内容,通过三种应用(嵌入、提示、微调)评估不同分类器性能,发现微调大语言模型效果最佳,且模型迁移能提升其他项目的效果。

Comments 50 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16028 2026-03-18 cs.RO 87%

Geometry-Aligned LLM Fine-Tuning for Sequential Narrow-Opening Planning

几何对齐的LLM微调用于序列狭窄开口规划

Al Jaber Mahmud, Xuan Wang

机构 * George Mason University(乔治·马歇尔大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出几何对齐的LLM微调框架,通过多阶段狭窄开口序列规划实现长视距几何推理,采用失败驱动LoRA监督微调与GRPO优化提升路径可行性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10833 2026-02-17 cs.IR cs.AI cs.CL cs.LG 87%

Training-Induced Bias Toward LLM-Generated Content in Dense Retrieval

训练诱导的对LLM生成内容的偏好在密集检索中的表现

William Xion, Wolfgang Nejdl

机构 * L3S Research Center, Hannover, Germany(汉诺威德国L3S研究中心)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究发现,密集检索中的来源偏见是训练过程诱导的,而非固有属性,通过实验揭示了不同微调策略对检索结果的影响。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12284 2026-02-16 cs.CL cs.AI cs.LG 87%

A Lightweight LLM Framework for Disaster Humanitarian Information Classification

轻量级LLM框架用于灾难人道主义信息分类

Han Jinzhen, Kim Jisung, Yang Jong Soo, Yun Hong Sik

机构 * Department of Civil, Architectural & Environment Engineering, Sungkyunkwan University(苏州市立大学土木、建筑与环境工程系) School of Geography, University of Leeds(利兹大学地理学院)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出轻量级LLM框架,通过参数高效微调实现灾难推文的人道主义信息分类和事件类型识别,展示LoRA和QLoRA在资源受限环境下的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00005 2026-02-03 cs.IR 87%

AutoBool: An Reinforcement-Learning trained LLM for Effective Automated Boolean Query Generation for Systematic Reviews

AutoBool: 一种基于强化学习训练的LLM,用于系统综述中高效的布尔查询生成

Shuai Wang, Harrisen Scells, Bevan Koopman, Guido Zuccon

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 AutoBool通过强化学习训练LLM生成高效的布尔查询,显著优于传统方法并接近专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18563 2026-01-27 cs.NI 87%

An LLM-Agent-Based Framework for Age of Information Optimization in Heterogeneous Random Access Networks

一种基于LLM代理的异构随机接入网络信息年龄优化框架

Fang Liu, Erchao Zhu, Jiedan Tan, Jingwen Tong, Taotao Wang, Shengli Zhang

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出Reflex-Core框架,通过LLM代理优化异构网络中的信息年龄,实现更高效的随机接入控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17480 2026-01-27 cs.LG cs.AI cs.CL 87%

Unintended Memorization of Sensitive Information in Fine-Tuned Language Models

在微调语言模型中意外记忆敏感信息

Marton Szep, Jorge Marin Ruiz, Georgios Kaissis, Paulina Seidl, Rüdiger von Eisenhart-Rothe, Florian Hinterwimmer, Daniel Rueckert

机构 * TUM University Hospital(慕尼黑工业大学医院) Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Computing, Imperial College London(伦敦帝国学院计算系)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示微调语言模型时意外记忆敏感信息的风险,分析影响因素并评估隐私保护方法的权衡。

Comments Accepted to EACL 2026. 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏