arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-17 至 2026-07-17 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 20 篇

2604.00259 2026-07-17 cs.CL cs.AI 91%

LLM Essay Scoring Under Holistic and Analytic Rubrics: Prompt Effects and Bias

基于整体和分析评分标准的LLM作文评分:提示效应与偏见

Filip J. Kucia, Anirban Chakraborty, Anna Wróblewska

机构 * Faculty of Mathematics and Information Science, Warsaw University of Technology(华沙理工大学数学与信息科学学院) University of Wolverhampton(伍尔弗汉普顿大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了指令微调LLM在三种开放性作文评分数据集上的表现,发现整体评分与人类一致,但分析评分存在显著偏见,尤其在低阶关注点如语法上表现更严厉,且简洁提示优于长格式提示。

Journal ref Computational Science - ICCS 2026, Lect. Notes Comput. Sci. 16789 (2026) 531-546

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14371 2026-07-17 cs.LG econ.TH stat.ML 新提交 90%

Supervised Fine-Tuning vs. In-Context Learning: An Equilibrium Analysis of LLM Personalization under Congestion

监督微调与上下文学习:拥塞下大语言模型个性化的均衡分析

Fengzhuo Zhang, Zhuoran Yang, Dirk Bergemann

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究大语言模型个性化中监督微调与上下文学习的选择问题,通过构建框架分析用户面临的统计 - 经济权衡,得出不同方法占优情况、资源消耗特性及平台策略等结论,实验与平台调研验证了相关理论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14581 2026-07-17 cs.AI cs.CV 新提交 88%

Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology

用于脑肿瘤视觉指令微调的多语言模型协作式MRI报告生成

Sinyoung Ra, Jonghun Kim, Hyunjin Park

专题命中 指令微调 :LLM(title);instruction tuning(title);large language model(abstract);language model(abstract)

AI总结 针对脑肿瘤缺乏配对3D成像 - 文本数据问题,提出用多语言模型协作创建3D图像 - 文本数据集,构建VLM将MRI扫描转换为令牌并与文本指令对齐,该方法在报告生成等任务中表现优于其他方法,有助于脑肿瘤诊断治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14530 2026-07-17 cs.LG 版本更新 87%

Code Correctness Is Linearly Decodable from LLM Hidden States Before Generation

LLM隐藏状态中的代码正确性信号:生成前探测与修复几何

Carlo Di Cicco

机构 * Independent researcher(独立研究员)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过残差化方法,发现Qwen3-4B-Instruct模型在生成前隐藏状态可线性解码代码正确性(AUC 0.931),但修复成功的方向性信号在控制上下文协变量后消失,揭示了方法学上的正负结果。

Comments 7 pages, 4 tables. Code, data, and analysis scripts available at https://github.com/CarloDiCicco/ReasoningLab

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14605 2026-07-17 cs.CL cs.CY 新提交 85%

Investigating first-language bias in LLM-based automated essay scoring: A cross-prompt evaluation of an open-weight AI-model on TOEFL essays

研究基于大语言模型的自动作文评分中的母语偏见:对托福作文的开放权重人工智能模型进行跨提示评估

John Maurice Gayed

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究基于大语言模型的自动作文评分中母语偏见,用LoRA适配的开放权重模型Gemma-3-27B-it,在托福作文语料库测试其跨提示泛化和母语评分效果,发现有评分偏移,实现了较高等级一致性,是首次此类大规模L1公平性分析。

Comments 21 pages, 2 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14895 2026-07-17 cs.LG cs.CL 新提交 84%

Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

利用指令微调与合并实现推理模型适配

Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究如何利用大量未使用的监督微调数据提升推理语言模型性能,先对模型进行经典指令微调,再与原始推理模型合并,该技术在多领域提升了模型性能且成本效益高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14163 2026-07-17 q-bio.QM cs.CV cs.LG 新提交 83%

A vision foundation model for single-cell biology via spatial gene cartography

通过空间基因制图构建单细胞生物学的视觉基础模型

Ridvan Yesiloglu, Sakib Mostafa, James Zou, Ash Alizadeh, Jiajun Wu, Lei Xing, Ehsan Adeli, Md Tauhidul Islam

机构 * Stanford University(斯坦福大学) Stanford University School of Medicine(斯坦福大学医学院)

专题命中 指令微调 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究提出scVision视觉基础模型,利用最优传输将基因布局成图像,通过掩码图像建模预训练视觉Transformer。该模型在零样本评估中表现出色,能无监督恢复基因程序,在多研究整合中效果好,还证明基因布局位置携带信号,重塑单细胞表示学习为视觉问题。

Comments 54 pages, 34 figures, 10 tables, including supplementary information. Project page: https://islamlab.org/scvision

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14111 2026-07-17 cs.CL cs.AI 新提交 79%

Introspection Fine-Tuning (IFT): Training Small LLMs to Introspect

内省微调(IFT):训练小型语言模型进行内省

Ely Hahami, Ishaan Sinha, Lavik Jain

机构 * Harvard College(哈佛大学)

专题命中 指令微调 :language model(abstract);small language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究小型语言模型内省能力,提出句子定位和强度比较评估范式,发现小模型有内省能力且随规模提升,引入内省微调(IFT),能提高模型内省能力,还表明内省能力可训练,对AI透明度和对齐有意义。

Comments 9 pages (excluding appendices / references), 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08208 2026-07-17 cs.CL 版本更新 72%

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

用于多语言双说话者对话语音的基于语音分离引导的Qwen-ASR适配

Hao Wu, RongQi Han, Zhen Wang, Wei Liang, Wei Xu

专题命中 指令微调 :SLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对多语言双说话者对话语音,设计了结合语音分离前端与适配Qwen3-ASR-1.7B识别器的系统。通过多步微调及强化学习适配ASR模型,在挑战赛中取得较好成绩,消融实验显示各部分对提升性能和鲁棒性的作用。

Comments Accepted by Interspeech 2026 MLC-SLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21751 2026-07-17 cs.LG 版本更新 70%

Models Can Model, But Can't Bind: Structured Grounding in Text-to-Optimization

模型可以建模,但无法绑定:文本到优化中的结构化 grounding

Zhiqi Gao, Albert Ge, Alexander Berenbeim, Nathaniel D. Bastian, Frederic Sala

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) United States Military Academy(美国军事学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究了文本到优化任务中建模与绑定两个关键能力的分离性,发现随着实例数据增长,模型准确性下降,提出BIND方法通过结构化文件外部化数据来提升绑定性能,验证了绑定专精模型在不同优化类别中的优势。

Comments Accepted to COLM 2026. Code and data: https://github.com/SprocketLab/Text2Opt-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10593 2026-07-17 cs.AI cs.DB cs.IR 版本更新 70%

QDA-SQL: Questions Enhanced Dialogue Augmentation for Multi-Turn Text-to-SQL

QDA-SQL:用于多轮文本到SQL的问题增强对话扩充

Yinggang Sun, Ziming Guo, Haining Yu, Chuanyi Liu, Xiang Li, Bingxuan Wang, Xiangzhan Yu, Tiancheng Zhao

机构 * School of Cyberspace Science Harbin Institute of Technology Harbin, China(网络空间科学学院 哈尔滨工业大学 哈尔滨,中国) School of Computer Science(计算机科学学院) Technology Harbin University of Science(技术 哈尔滨理工大学) School of Cyberspace Science Harbin Institute of Technology, Shenzhen Shenzhen, China(网络空间科学学院 哈尔滨工业大学深圳 哈尔滨,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对多轮文本到SQL任务中微调模型面临的问题,提出QDA-SQL数据扩充方法,利用大语言模型生成多轮问答对,并引入验证和校正机制,提升了微调模型在SQL语句准确性及处理复杂问题上的能力。

Comments CAAI International Conference on Artificial Intelligence 2026 (CICAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15081 2026-07-17 cs.CR 新提交 67%

DataShield: Uncovering Risky Fine-Tuning Data Across LLMs Through Consensus Subspace Alignment

DataShield:通过共识子空间对齐揭示跨语言模型的风险微调数据

Zefeng Wu, Weiwei Qi, Jielong Chen, Tianhang Zheng, Di Hong, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对LLMs微调数据存在安全风险及现有方法局限性,提出DataShield框架,通过共识子空间对齐识别风险微调样本和响应段,经实验对比,该方法能有效降低误识率,还保留下游效用并避免特定模型风险计算。

Comments 24 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15004 2026-07-17 cs.RO 新提交 67%

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

CosFly-VLA:一种用于无人机跟踪的空间感知视觉-语言-动作模型

Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

机构 * Autel Robotics(大疆创新科技有限公司) Northeast Normal University(东北师范大学) Southern University of Science and Technology(南方科技大学) Peking University(北京大学) University of Hong Kong(香港大学)

专题命中 指令微调 :pretraining(abstract);SFT(abstract)

AI总结 针对复杂城市环境中无人机动态目标跟踪问题,提出CosFly-VLA模型,通过结构化预测接口联合定位目标、估计可见性并生成飞行动作。经多阶段训练,该模型在开环误差和闭环成功率上有显著提升,实现从可见帧模仿到空间基础动作闭环控制的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交 67%

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06237 2026-07-17 cs.LG cs.AI cs.CL 版本更新 67%

Mixtures of SubExperts for Large Language Continual Learning

用于大语言持续学习的子专家混合模型

Haeyong Kang, Hee Suk Yoon, Dahua Feng, Chang D. Yoo

专题命中 指令微调 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言持续学习中稳定性-可塑性困境及可扩展性问题,提出子专家混合模型MoSEs,通过模块化稀疏性和组合路由,平衡困境,实现知识隔离、重组扩展及亚线性增长,实验验证其性能优于基线,为持续学习基础模型提供关键归纳偏置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14275 2026-07-17 cs.AI cs.MA 新提交 57%

AI Agents Do Not Fail Alone:The Context Fails First

人工智能智能体并非独自失败:上下文首先失败

Fouad Bousetouane

机构 * The University of Chicago(芝加哥大学)

专题命中 指令微调 :LLM(abstract);分类 cs.AI

AI总结 研究人工智能智能体可靠性,通过ProofAgent-Harness评估上下文七个标准,验证上下文工程质量是智能体可靠性的领先指标,经受控研究表明上下文质量标准可预测行为结果,确立其为预检信号及可审计层。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14228 2026-07-17 cs.CV cs.AI 新提交 57%

SeeSE3: Emergence of 3D Space in Vision Features

SeeSE3:视觉特征中3D空间的出现

Caroline Chen, Sayna Ebrahimi, Fedor Kitashov, Ming-Hsuan Yang, Leonidas Guibas, Viorica Pătrăucean, Maks Ovsjanikov

机构 * Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI

AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30252 2026-07-17 cs.AI 版本更新 57%

Inoculation Adapters: Improved Selective Generalization of Capabilities with Fewer Surprising Backdoors

接种适配器:以更少的意外后门改进能力的选择性泛化

Maxime Riché, Daniel Tan, Vili Kohonen, Niels Warncke

机构 * Center on Long-term Risk(长期风险中心)

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 提出接种适配器(IA)方法,通过三步训练抑制不良特征,比接种提示更有效且引入更少后门,但保留期望特征仍具挑战。

Comments Preprint, v0.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14727 2026-07-17 cs.CV 新提交 50%

WorkDrive: Roadwork Chain of Causation for Autonomous Driving

WorkDrive:自动驾驶的道路施工因果链

Tianyi Jiang, Wen Zhang, Sihan Yang, Ming Lu, Wentao Zhang

机构 * Peking University(北京大学) Xiaomi EV(小米电动汽车)

专题命中 指令微调 :language model(abstract)

AI总结 针对自动驾驶视觉语言模型在道路施工区域的难题,提出WorkDrive框架,通过自动化多任务感知管道提取场景事实,经监督微调与强化学习,在ROADWork数据集上降低轨迹平均位移误差,实现渐进改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13790 2026-07-17 cond-mat.mtrl-sci 50%

Large-scale cooperative sulfur vacancy dynamics in two-dimensional MoS2 from machine learning interatomic potentials

二维MoS2中大规模协同硫空位动力学研究

Aaron Flötotto, Benjamin Spetzler, Rose von Stackelberg, Martin Ziegler, Erich Runge, Christian Dreßler

专题命中 指令微调 :foundation model(abstract)

AI总结 本研究通过机器学习互原子势模拟揭示了二维MoS2中大规模协同硫空位传输机制,解释了实验观测到的辐照诱导空位模式,并对比了两种MLIP框架的性能。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏