arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-02 至 2026-07-02 共收录 25 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 25 篇

2603.19294 2026-07-02 cs.LG cs.AI cs.CL 版本更新 94%

Maximizing Mutual Information Between Prompt and Response Improves LLM Performance With No Additional Data

最大化提示与响应之间的互信息无需额外数据即可提升LLM性能

Hyunji Nam, Haoran Li, Natasha Jaques

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出互信息偏好优化(MIPO)方法,通过对比数据增强构建偏好对,利用直接偏好优化最大化提示与响应间的点互信息,无需额外数据或外部监督即可提升LLM在个性化和可验证任务上的性能。

Comments International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24434 2026-07-02 cs.CL 版本更新 91%

LuxIT: A Luxembourgish Instruction Tuning Dataset from Monolingual Seed Data

LuxIT:从单语种子数据生成的卢森堡语指令微调数据集

Julian Valline, Cedric Lothritz, Siwen Guo, Jordi Cabot

机构 * Luxembourg Institute of Science and Technology(卢森堡科学技术研究院)

专题命中 指令微调 :LLM(summary_cn,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LuxIT数据集,通过合成高质量卢森堡语指令-回答对,提升低资源语言LLM性能,实验显示在语言考试和NLP任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00006 2026-07-02 cs.CL cs.AI 新提交 90%

Persona Without Substrate: Regime-Dependence and the LLM Individuation Problem

无基座的人格:体制依赖性与LLM个体化问题

Shuaizhi Cheng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 通过实验揭示LLM个体化问题中跨体制共指假设的漏洞,提出体制索引个体化框架,将表征内容的身份单位视为(载体,体制)对。

Comments 30 pages, 2 figures, 1 table. Replies to Beckmann & Butlin (arXiv:2604.17031)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01084 2026-07-02 cs.AI 新提交 89%

Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use

智能体能否泛化到开放世界?揭示工具使用中静态训练的脆弱性

Song-Lin Lv, Weiming Wu, Rui Zhu, Zi-Jian Cheng, Lan-Zhe Guo

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM智能体在真实场景中因查询、工具集和交互动态变化而性能下降的问题,形式化定义了开放世界工具使用问题,构建了四层层次的环境偏移框架,并通过实验揭示了监督微调和强化学习训练智能体在面对开放环境偏移时的脆弱性,提出了扰动增强微调策略以提升鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13537 2026-07-02 cs.LG cs.AI cs.CL 版本更新 89%

K-Merge: Online Continual Merging of Adapters for On-device Large Language Models

K-Merge: 面向设备端大语言模型的在线持续适配器合并

Donald Shenaj, Ondrej Bohdal, Taha Ceritli, Mete Ozay, Pietro Zanuttigh, Umberto Michieli

机构 * Samsung R&D Institute UK(三星英国研发中心) University of Pisa(比萨大学) University of Padova(帕多瓦大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对设备端大语言模型在线持续合并LoRA适配器的问题,提出一种无数据、计算高效的策略,在存储和计算受限下选择并合并新适配器,同时保持已有任务性能。

Comments ACL 2026 Main Conference, Long Paper (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10887 2026-07-02 cs.CR cs.AI 版本更新 89%

Hey, That's My Model! Introducing Chain & Hash, An LLM Fingerprinting Technique

嘿,那是我的模型!引入链与哈希,一种大语言模型指纹识别技术

Mark Russinovich, Yanan Cai, Ahmed Salem

机构 * Microsoft(微软)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于链与哈希的LLM指纹识别框架,通过加密绑定提示与响应防止碰撞,并利用随机填充和元提示配置增强鲁棒性,实现可验证的所有权证明。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21589 2026-07-02 cs.CL cs.AI 88%

Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning

Middo: 通过闭环学习提升LLM微调的模型感知动态数据优化

Zinan Tang, Xin Gao, Qizhi Pei, Zhuoshi Pan, Mengzhang Cai, Jiang Wu, Conghui He, Lijun Wu

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出Middo框架,通过闭环学习动态优化数据,提升LLM微调效果,实验显示在多个基准上平均提升7.15%的准确率。

Comments Accepted by EMNLP 2025 (Main)

Journal ref EMNLP Main (2025) 6871-6891

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17289 2026-07-02 cs.LG 版本更新 87%

REALM: Reliable Expertise-Aware Language Model Fine-Tuning from Noisy Annotations

REALM:从嘈杂标注中可靠地进行语言模型微调

Sajjad Ghiasvand, Mark Beliaev, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 REALM通过无监督学习同时学习模型参数和标注者专业能力评分,提升在噪声标注下的微调效果,实验显示其在多种任务和数据集上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00685 2026-07-02 cs.MA 新提交 87%

M2Note: Continual Evolution of Vision Language Models via Mistake Notebook Learning

M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化

Haiwen Li, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);prompting(abstract)

AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01125 2026-07-02 cs.LG math.OC 新提交 86%

ZO-Act: Efficient Zeroth-Order Fine-Tuning via One-Shot Activation-Informed Low-Rank Subspaces

ZO-Act: 通过一次性激活信息低秩子空间实现高效零阶微调

Xun Dong, Yibo Xu, Naigang Wang, Xin Li, Penghang Yin, Zi Yang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) IBM T. J. Watson Research Center(IBM托马斯·J·沃森研究中心)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出ZO-Act方法,利用输入激活构建固定低秩子空间,仅优化系数矩阵,降低扰动维度并支持Adam优化器,实现高效零阶微调,在多个LLM上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19100 2026-07-02 cs.CV 新提交 85%

AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

AMALIA-VL: 一个原生欧洲葡萄牙语开源视觉与语言模型

Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz, Afonso Simplício, Gonçalo Vinagre, Diogo Tavares, Rafael Ferreira, Inês Calvo, Inês Vieira, David Semedo, João Magalhães

机构 * NOVA School of Science and Technology(NOVA科学与技术学校) NOVA LINCS

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);preference optimization(abstract)

AI总结 针对欧洲葡萄牙语缺乏开源多模态模型的问题,提出AMALIA-VL,通过三阶段训练和葡萄牙语中心数据混合,建立强基线并开源所有资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00465 2026-07-02 cs.CV cs.CL cs.LG 新提交 84%

StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning

StochasT:基于随机轮次深度的视觉指令微调学习

Yuan Qing, Chengzhi Mao, Boqing Gong

机构 * Boston University(波士顿大学) Rutgers University(罗格斯大学)

专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对视觉指令微调中多轮训练与单轮测试不匹配的问题,提出StochasT方法,通过随机分组语言任务为不同大小的轮次深度,增强模型在单轮和多轮场景下的鲁棒性。

Comments Accepted to ECCV 2026. Project page and code: https://yuanqing-ai.github.io/StochasT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06714 2026-07-02 cs.CV 新提交 82%

Anchored, Not Graded: Vision-Language Models Fail at Slant-from-Texture Perception

锚定而非分级:视觉-语言模型在纹理倾斜感知中失败

Qian Zhang, Michal Golovanevsky, Fulvio Domini, James Tompkin

机构 * Brown University(布朗大学) Harvard University(哈佛大学)

专题命中 指令微调 :language model(title,abstract);prompting(abstract)

AI总结 研究视觉-语言模型(VLM)在纹理倾斜感知任务中的表现,发现零样本和上下文提示均产生锚定失败,仅预测少数离散角度,监督微调部分缓解但残留锚定,表明问题在于表示到输出的语言接口无法分级表达。

Comments 15 pages. Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01033 2026-07-02 cs.LG 新提交 81%

The Model Organism Lottery: Model Organism Interpretability Strongly Depends on Training Methodology

模式生物彩票:模式生物可解释性强烈依赖于训练方法

Andrzej Szablewski, Gabriel Konar-Steenberg, Raffaello Fornasiere, Nikita Menon, Stefan Heimersheim

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 研究通过七种训练方法构建54个模式生物,发现模式生物可解释性强烈依赖于训练目标、目标行为、模型架构和数据生成流程,集成训练通常比事后方法更不可解释,质疑当前模式生物作为可解释性代理的有效性。

Comments 9 pages, 9 figures, references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00417 2026-07-02 cs.CV cs.AI 新提交 79%

EO-VGGT: Orbital Ray-Conditioned 3D Foundation Models for Satellite Multi-View Reconstruction

EO-VGGT:用于卫星多视角重建的轨道光线条件化3D基础模型

Qiyan Luo, Yingdong Pi, Lekang Wen, Jie Yang, Xiaoyu Wang, Haiming Zhang, Mi Wang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Hubei Luojia Laboratory(湖北珞珈实验室)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 针对卫星遥感中透视模型与轨道几何不匹配的问题,提出EO-VGGT框架,通过几何相关约束选择、传感器射线编码器和射线指向适配器,实现冻结视角驱动模型适应轨道观测,提升多视角卫星3D重建质量。

Comments This article is submitted to journal and under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01079 2026-07-02 cs.RO 新提交 78%

Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization

我在哪里?基于视觉-语言模型的语义地图定位用于多模态定位

Suraj Borate, Aarav Shah, Madhu Vadali

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校)

专题命中 指令微调 :language model(title,abstract)

AI总结 将机器人定位重构为语义推理任务,使用微调的Qwen2.5-VL-7B模型融合摄像头、LiDAR和语义地图预测位姿,在室内数据集上达到98.23%位置精度,并展现出跨模态互补性和对新场景的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01181 2026-07-02 cs.LG cs.AI cs.CL 新提交 75%

Right in the Right Way: LM Training with Verifiable Rewards and Human Demonstrations

以正确的方式正确:结合可验证奖励和人类演示的LM训练

Mehul Damani, Isha Puri, Idan Shenfeld, Jacob Andreas

机构 * MIT EECS(麻省理工学院电气工程与计算机科学系)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出对抗生成器-判别器框架,在可验证奖励基础上加入人类演示信号,同时优化任务准确性和非可验证属性,在代码修复、故事生成等任务中提升人类相似度并减少奖励黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31092 2026-07-02 cs.LG 新提交 70%

Fora: From Weight-Space to Function-Space Protection in Capability-Preserving Fine-Tuning

Fora: 从权重空间到函数空间的保护在保持能力的微调中

Rui Zhou, Tianci Xie

机构 * Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出函数空间保护方法FORA,通过输入激活协方差的主方向投影,在微调中保留模型原有能力,实验表明优于权重空间投影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00416 2026-07-02 cs.CV 新提交 67%

DroneIQA-VLE: Multi-Task Drone Image Quality Assessment via Vision-Language Ensemble

DroneIQA-VLE:基于视觉-语言集成的多任务无人机图像质量评估

Wei Sun, Weixia Zhang, Hongjian Zhan, Mingkai Lu, Yixuan Gao, Guangtao Zhai

机构 * East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 提出DroneIQA-VLE框架,通过集成SigLIP2视觉编码器与多任务回归头以及LoRA微调的Qwen3.5-9B多模态大模型,联合预测全局、目标和背景质量分数,在ICME 2026无人机图像质量评估挑战赛中获得第二名。

Comments The model achieves 2nd place in ICME 2026 Drone-IQA Grand Challenge on Target-aware Image Quality Assessment for Low-altitude UAV Images

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00687 2026-07-02 cs.CV cs.AI cs.LG cs.PF 新提交 62%

LUMA: Benchmarking Segmentation via a Lightweight Universal Mask Adapter

LUMA: 通过轻量级通用掩码适配器进行分割基准测试

Tobias Christian Nauen, Anosh Billimoria, Federico Raue, Stanislav Frolov, Brian B. Moser, Andreas Dengel

机构 * RPTU University Kaiserslautern-Landau(凯泽斯劳滕-兰道大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 指令微调 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出轻量级通用掩码适配器(LUMA),一种与骨干无关的掩码Transformer头,通过廉价交叉注意力实现高精度分割,并基于此对20种骨干网络和11种预训练方案进行基准测试,发现高效token混合器未实现高效,预训练目标主导分割质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00634 2026-07-02 cs.LG cs.AI 新提交 62%

Loss Smoothing for Stable Adaptation Under Distribution Shift

损失平滑:分布偏移下的稳定自适应

Darshan Patil, Ekaterina Lobacheva, Razvan Pascanu, Sarath Chandar

机构 * Chandar Research Lab(Chandar 研究实验室) Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出损失平滑方法,通过在自适应初期插值源与目标训练目标,实现平滑过渡,保留有用特征,在多种分布偏移场景下提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00004 2026-07-02 cs.IR cs.AI cs.LG 新提交 62%

Why Advanced Encoders Lag on Sparse Retrieval? The Answer and an Approach to Bridging Vocabulary Gaps

为什么高级编码器在稀疏检索上落后?答案及弥合词汇鸿沟的方法

Zhichao Geng, Yang Yang

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 发现高级编码器在稀疏检索中落后于旧模型的原因是词汇鸿沟:现代分词器使用原始、区分大小写的词汇表导致语义单元冗余。提出词汇迁移框架,通过语义初始化和激活势校准解决该问题,在BEIR上取得SOTA性能。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31410 2026-07-02 cs.AI 新提交 57%

Xiaomi-GUI-0 Technical Report

Xiaomi-GUI-0 技术报告

Wanxia Cao, Chengzhen Duan, Pei Fu, Pengzhi Gao, Niu Lian, Fazhan Liu, Hui Liu, Heng Qu, Qinzhuo Wu, Zhehao Yu, Tongbo Chen, Shiqi Cui, Anan Du, Shukai Jia, Yuanfa Li, Wei Liu, Yike Liu, Wenchao Lu, Zhenbo Luo, Haoyuan Sun, Jiatong Sun, Cheng Tan, Yajie Wang, Changqiao Wu, Tao Xiong, Jiahui Yang, Yuxuan Yuan, Ruoceng Zhang, Shaojie Zhang, Jian Zhu, Jian Luan, Cong Zou

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00271 2026-07-02 cs.CV cs.AI cs.RO 版本更新 57%

REALM: An RGB- and Event-Aligned Latent Manifold for Cross-Modal Perception

REALM:一种RGB和事件对齐的潜在流形用于跨模态感知

Vincenzo Polizzi, David B. Lindell, Jonathan Kelly

机构 * University of Toronto, Robotics Institute(多伦多大学机器人研究所) University of Toronto, Department of Computer Science(多伦多大学计算机科学系)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI

AI总结 REALM通过将事件表示投影到预训练的RGB基础模型潜在空间,实现跨模态感知,利用LoRA技术解锁冻结RGB主干的几何和语义先验,实现零样本应用复杂解码器。

Comments Accepted to the European Conference on Computer Vision (ECCV), Malmö, SE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00338 2026-07-02 cs.CV 新提交 50%

DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images

DroneFINE: 面向无人机图像的视觉-语言检测器的域感知参数高效微调

Ke Wu, Yanan Zhang, Yingjie Gao, Wenhao Li, Chenyu Zhou, XinZhu Ma, Jiaxin Chen, Di Huang

机构 * National College for Excellent Engineers, Beihang University, Beijing, China(北京航空航天大学优秀工程师学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室) Innovation Center for Intelligent System Cognition and Decision-Making, Beijing, China(智能系统认知与决策创新中心) Information Science Academy of China Electronics Technology Group Corporation, Beijing, China(中国电子科技集团有限公司信息科学研究院)

专题命中 指令微调 :language model(abstract)

AI总结 针对无人机图像与视觉语言模型预训练数据之间的域差异,提出包含HyperAdapter和SemanticGate的域感知参数高效微调方法,在减少可训练参数的同时达到与全微调相当的性能。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏