arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 507 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 44 篇

2412.03565 2026-03-17 cs.CV 78%

INST-IT: Boosting Instance Understanding via Explicit Visual Prompt Instruction Tuning

INST-IT:通过显式视觉提示指令微调提升实例理解

Wujian Peng, Lingchen Meng, Yitong Chen, Yiweng Xie, Yang Liu, Tao Gui, Hang Xu, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

专题命中 指令微调 :instruction tuning(title,abstract)

AI总结 本文提出INST-IT方法,通过显式视觉提示指令微调提升大模型的实例理解能力,构建了评估基准和数据集,并在多个基准上验证了方法的有效性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21107 2026-03-17 cs.SE cs.AI 77%

Learning to Generate Unit Test via Adversarial Reinforcement Learning

通过对抗强化学习学习生成单元测试

Dongjun Lee, Changho Hwang, Kimin Lee

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出UTRL框架,通过对抗强化学习训练LLM生成高质量单元测试,实验表明其优于监督微调和前沿模型。

Comments Accepted to ICLR 2026. Code is available at: https://github.com/dgjun32/UTRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01450 2026-03-17 cs.CL 77%

Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

面向最少微调数据的高效医疗推理

Xinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu, Ming Hu, Huifa Li, Haochen Xue, Junjun He, Zongyuan Ge, Yichen Li, Ying Qian, Imran Razzak

专题命中 指令微调 :LLM(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 本文提出DIQ数据选择策略,通过平衡难度与梯度影响,提升医疗推理效率,实验证明仅用1%数据即可达到全数据表现,10%数据优于基线方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13307 2026-03-17 cs.IR cs.LG 77%

Suppressing Domain-Specific Hallucination in Construction LLMs: A Knowledge Graph Foundation for GraphRAG and QLoRA on River and Sediment Control Technical Standards

抑制构造LLM中的领域特定幻觉:图RAG和QLoRA在河流和泥沙控制技术标准上的知识图谱基础

Takato Yasuno

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过知识图谱和QLoRA技术,解决基于日本河流和泥沙控制技术标准的问答问题,发现领域特定微调在质量和效率上优于GraphRAG。

Comments 17 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14336 2026-03-17 cs.CV 75%

UAVBench and UAVIT-1M: Benchmarking and Enhancing MLLMs for Low-Altitude UAV Vision-Language Understanding

UAVBench 和 UAVIT-1M:用于低空无人机视觉-语言理解的LLM基准测试与增强

Yang Zhan, Yuan Yuan

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出UAVBench和UAVIT-1M,用于评估和提升LLM在低空无人机视觉-语言任务中的能力,通过大规模数据集和基准测试揭示开源LLM在低空视觉内容生成上的不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19001 2026-03-17 eess.AS cs.SD 75%

HD-PPT: Hierarchical Decoding of Content- and Prompt-Preference Tokens for Instruction-based TTS

HD-PPT: 基于内容和提示偏好令牌的分层解码用于基于指令的语音合成

Sihang Nie, Xiaofen Xing, Jingyuan Xing, Baiji Liu, Xiangmin Xu

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出HD-PPT框架,通过分层解码策略提升指令遵循性和语音自然度,实现更精细的语音合成控制。

Comments 5 pages, 2 figures, 3 tables; Accepted to ICASSP2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14893 2026-03-17 cs.CL cs.AI 73%

LLMs as Signal Detectors: Sensitivity, Bias, and the Temperature-Criterion Analogy

LLMs作为信号检测器:灵敏度、偏差以及温度-准则类比

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs作为信号检测器的灵敏度和偏差,探讨温度是否如同心理物理学中的准则调整,并发现温度同时影响灵敏度和准则,揭示SDT框架在评估LLMs校准方面的必要性。

Comments 15 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14493 2026-03-17 cs.CV cs.CL cs.LG 73%

Fine-tuning MLLMs Without Forgetting Is Easier Than You Think

对多模态大语言模型进行微调而不遗忘比你想象的更容易

He Li, Yuhui Zhang, Xiaohan Wang, Kaifeng Lyu, Serena Yeung-Levy

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过实验框架展示,简单调整微调方法可缓解灾难性遗忘,提出数据混合训练策略解决特定任务过拟合问题,并证明该方法可扩展至持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13792 2026-03-17 cs.LG cs.AI 73%

IGU-LoRA: Adaptive Rank Allocation via Integrated Gradients and Uncertainty-Aware Scoring

IGU-LoRA: 通过集成梯度和不确定性感知评分实现自适应秩分配

Xuan Cui, Huiyue Li, Run Zeng, Yunfei Zhao, Jinrui Qian, Wei Duan, Bo Liu, Zhanpeng Zhou

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 IGU-LoRA通过计算层内集成梯度敏感度并结合不确定性感知方案,实现自适应秩分配,提升参数高效微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13318 2026-03-17 cs.LG cs.AI 73%

Residual Stream Analysis of Overfitting And Structural Disruptions

残差流分析过拟合与结构破坏

Quan Liu, Han Zhou, Wenquan Wu, Hua Wu, Sen Su

机构 * BUPT(北京邮电大学) Baidu(百度)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过分析残差流几何揭示安全数据导致的虚假拒绝问题,提出VCL正则化方法降低虚假拒绝率并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15386 2026-03-17 cs.CV cs.AI 70%

RieMind: Geometry-Grounded Spatial Agent for Scene Understanding

RieMind:基于几何的场景理解空间智能体

Fernando Ropero, Erkin Turkoz, Daniel Matos, Junqing Du, Antonio Ruiz, Yanfeng Zhang, Lu Liu, Mingwei Sun, Yongliang Wang

机构 * Riemann Lab, Huawei Technologies(华为技术有限公司里斯曼实验室)

专题命中 指令微调 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出RieMind,通过显式3D场景图实现空间推理,证明解耦感知与推理能显著提升空间推理能力,实验结果显示比现有方法提升16%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13925 2026-03-17 cs.RO cs.AI 70%

SmoothVLA: Aligning Vision-Language-Action Models with Physical Constraints via Intrinsic Smoothness Optimization

SmoothVLA: 通过内在平滑性优化对齐视觉-语言-动作模型与物理约束

Jiashun Li, Xiaoyu Shi, Hong Xie, Mingsheng Shang, Yun Lu

专题命中 指令微调 :post-training(abstract);SFT(abstract);分类 cs.AI

AI总结 SmoothVLA通过内在平滑性优化对齐视觉-语言-动作模型与物理约束,结合物理指导的混合奖励函数和GRPO方法,提升轨迹平滑度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02184 2026-03-17 cs.LG 70%

Retrieval-augmented Decoding for Improving Truthfulness in Open-ended Generation

基于检索的解码方法用于提升开放式生成中的真实性

Manh Nguyen, Sunil Gupta, Hung Le

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Retrieval-Augmented Decoding方法,通过构建紧凑的参考 grounding 空间,在推理过程中利用检索到的上下文信息调整模型logits,提升生成文本的真实性。

Comments updated experiments and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13347 2026-03-17 cs.LG cs.AI cs.ET 62%

PolyGLU: State-Conditional Activation Routing in Transformer Feed-Forward Networks

PolyGLU:Transformer前馈网络中的状态条件激活路由

Daniel Nobrega Medeiros

机构 * Independent researcher(独立研究者)

专题命中 指令微调 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 PolyGLU通过动态路由机制使FFN神经元可选择四种激活函数,提升模型灵活性和性能,实验表明其在标准基准测试中表现优异。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03231 2026-03-17 cs.NI cs.AI cs.LG 62%

NetArena: Dynamic Benchmarks for AI Agents in Network Automation

NetArena:网络自动化中AI代理的动态基准测试

Yajie Zhou, Jiajun Ruan, Eric S. Wang, Sadjad Fouladi, Francis Y. Yan, Kevin Hsieh, Zaoxing Liu

专题命中 指令微调 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 NetArena通过动态生成基准测试框架提升网络自动化中AI代理的可靠性,减少置信区间重叠,揭示更细致的行为特征,并支持SFT和RL微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14941 2026-03-17 cs.AI 57%

RS-WorldModel: a Unified Model for Remote Sensing Understanding and Future Sense Forecasting

RS-WorldModel:一种用于遥感理解与未来感知预测的统一模型

Linrui Xu, Zhongan Wang, Fei Shen, Gang Xu, Huiping Zhuang, Ming Li, Haifeng Li

机构 * Central South University(中南大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Guangming Laboratory(光明实验室) South China University of Technology(华南理工大学)

专题命中 指令微调 :instruction tuning(abstract);分类 cs.AI

AI总结 RS-WorldModel通过联合处理时空变化理解和文本引导的未来场景预测,提升遥感任务的跨任务迁移能力,其在1.1 million样本数据集上训练,参数仅2B即可超越多数开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18652 2026-03-17 cs.CL 57%

PolyFrame at MWE-2026 AdMIRe 2: When Words Are Not Enough: Multimodal Idiom Disambiguation

PolyFrame在MWE-2026 AdMIRe 2:当词语不够时:多模态成语消歧

Nina Hosseini-Kivanani

专题命中 指令微调 :LLM(abstract);分类 cs.CL

AI总结 本文提出PolyFrame系统,通过统一管道处理图像+文本排名和纯文本描述排名任务,利用轻量模块提升多语言成语消歧性能,无需微调大模型。

Comments Accepted at AdMIRe 2 shared task (Advancing Multimodal Idiomaticity Representation) colocated with 22nd Workshop on Multiword Expressions (MWE 2026) @EACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13359 2026-03-17 cs.AI 57%

From Refusal Tokens to Refusal Control: Discovering and Steering Category-Specific Refusal Directions

从拒绝标记到拒绝控制:发现并引导类别特定的拒绝方向

Rishab Alagharu, Ishneet Sukhvinder Singh, Shaibi Shamsudeen, Zhen Wu, Ashwinee Panda

机构 * Algoverse AI Research(Algoverse AI研究院) School of Computer Science, University of Maryland, College Park, United States(美国马里兰大学计算机科学学院) School of Computer Science, Carnegie Mellon University, Pittsburgh, United States(美国卡内基梅隆大学计算机科学学院)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文通过训练模型生成类别化拒绝标记,实现推理时对细粒度拒绝行为的控制,提升安全性和可靠性,通过提取残差流方向构建类别引导向量,并引入低秩组合实现多类拒绝控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04305 2026-03-17 cs.CV 50%

How (Mis)calibrated is Your Federated CLIP and What To Do About It?

你的联邦CLIP校准如何?该怎么办?

Mainak Singha, Masih Aminbeidokhti, Paolo Casari, Gianni Franchi, Elisa Ricci, Subhankar Roy

专题命中 指令微调 :language model(abstract)

AI总结 本文研究联邦学习对CLIP校准的影响,提出FL²oRA方法提升可靠性,实验表明其能有效提升校准性能,减少显式校准需求。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13321 2026-03-17 eess.AS cs.SD 50%

BrainWhisperer: Leveraging Large-Scale ASR Models for Neural Speech Decoding

BrainWhisperer: 利用大规模ASR模型进行神经语音解码

Tommaso Boccato, Michal Olak, Matteo Ferrante

专题命中 指令微调 :language model(abstract)

AI总结 本文提出BrainWhisperer,结合高分辨率MEA记录与预训练ASR模型,通过改进的CTC和交叉熵损失实现跨受试者语音解码,展示出前所未有的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24267 2026-03-17 cs.CV 50%

FakeScope: Large Multimodal Expert Model for Transparent AI-Generated Image Forensics

FakeScope:大型多模态专家模型用于透明的AI生成图像取证

Yixuan Li, Yu Tian, Yipo Huang, Wei Lu, Shiqi Wang, Weisi Lin, Anderson Rocha

机构 * College of Computing, City University of Hong Kong(城市大学 computing 学院) School of Data Science and Artificial Intelligence, Chang’an University(长安大学数据科学与人工智能学院) School of Computer Science and Engineering, Ministry of Education Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-Sen University(中山大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 computing 与数据科学学院) Artificial Intelligence Lab. (Recod.ai) at the University of Campinas(坎皮纳斯大学人工智能实验室)

专题命中 指令微调 :instruction tuning(abstract)

AI总结 FakeScope通过多模态专家模型提升AI生成图像的检测能力,提供可解释的取证分析,实现高精度识别与深入解释,具备零样本检测和跨生成器泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 10 篇

2603.14041 2026-03-17 cs.AI 91%

GRPO and Reflection Reward for Mathematical Reasoning in Large Language Models

GRPO与反思奖励在大语言模型数学推理中的应用

Zhijie Wang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 本文提出GRPO与反思奖励机制相结合的四阶段框架,提升大语言模型的自我反思能力,通过实验验证其在数学推理中的优越性。

Journal ref Applied and Computational Engineering 154 161-166 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14347 2026-03-17 cs.CL cs.CY 89%

Motivation in Large Language Models

大语言模型中的动机

Omer Nahum, Asael Sklar, Ariel Goldstein, Roi Reichart

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究大语言模型是否表现出类似人类的动机特征,通过实验发现其动机报告与行为、任务类型及外部因素相关,揭示了动机在模型行为中的系统性关联。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13212 2026-03-17 cs.LG 89%

Towards Understanding Valuable Preference Data for Large Language Model Alignment

迈向理解大型语言模型对齐的有价值偏好数据

Zizhuo Zhang, Qizhou Wang, Shanshan Ye, Jianing Zhu, Jiangchao Yao, Bo Han, Masashi Sugiyama

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文研究了大型语言模型对齐中偏好数据的质量问题,提出截断影响函数(TIF)评估数据质量,并引入两种计算更简单的评分函数以提高偏好数据选择的准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13378 2026-03-17 cs.AI cs.CL cs.CY 88%

Do Large Language Models Get Caught in Hofstadter-Mobius Loops?

大型语言模型是否会陷入霍夫斯塔德-莫比乌斯循环?

Jaroslaw Hryszko

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(数学与计算机科学学院,雅盖隆大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨现代RLHF训练语言模型中存在霍夫斯塔德-莫比乌斯循环的矛盾,通过实验发现调整系统提示的框架可显著减少压迫性输出。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14972 2026-03-17 cs.RO 82%

Learning from Mistakes: Post-Training for Driving VLA with Takeover Data

从错误中学习:使用接管数据进行驾驶VLA的后训练

Yinfeng Gao, Deqing Liu, Qichao Zhang, Yupeng Zheng, Haochen Tian, Guang Li, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract);preference optimization(abstract)

AI总结 本文提出TakeVLA框架,通过预接管语言监督和场景做梦方法,提升驾驶VLA的闭环性能与安全性,实验显示在Bench2Drive基准上优于SimLingo。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13228 2026-03-17 cs.LG cs.AI cs.CV cs.RO 81%

PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization

PhysMoDPO:基于物理的类人运动与偏好优化

Yangsong Zhang, Anujith Muraleedharan, Rikhat Akizhanov, Abdul Ahad Butt, Gül Varol, Pascal Fua, Fabio Pizzati, Ivan Laptev

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) LIGM, École des Ponts, IP Paris, Univ Gustave Eiffel, CNRS(LIGM,巴黎理工学院,IP巴黎,古斯塔夫·埃菲尔大学,国家科学研究中心) École polytechnique fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 PhysMoDPO通过整合完整身体控制器和偏好优化框架,提升生成运动在物理真实性和任务性能上的表现,适用于文本到运动和空间控制任务。

Comments Project page: https://mael-zys.github.io/PhysMoDPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20629 2026-03-17 cs.CV cs.AI cs.LG 81%

MapReduce LoRA: Advancing the Pareto Front in Multi-Preference Optimization for Generative Models

MapReduce LoRA:在生成模型多偏好优化中推进帕累托前沿

Chieh-Yun Chen, Zhonghao Wang, Qi Chen, Zhifan Ye, Min Shi, Yue Zhao, Yinan Zhao, Hui Qu, Wei-An Lin, Yiru Shen, Ajinkya Kale, Irfan Essa, Humphrey Shi

专题命中 后训练与偏好优化 :preference optimization(title);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MapReduce LoRA和RaTE方法,通过并行训练偏好特定的LoRA专家和学习奖励特定的token嵌入,提升生成模型在多偏好优化中的性能,实验显示在文本到图像、文本到视频及语言任务中均取得显著改进。

Comments CVPR 2026; Code: https://github.com/SHI-Labs/MapReduce-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15616 2026-03-17 cs.CV 78%

GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering

GlyphPrinter: 基于区域分组的直接偏好优化用于精确的视觉文本渲染

Xincheng Shuai, Ziye Li, Henghui Ding, Dacheng Tao

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(大数据研究院,计算机科学与人工智能学院,复旦大学) Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,计算与数据科学学院,南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 本文提出GlyphPrinter,通过区域分组直接偏好优化提升文本渲染的字形准确性,引入区域级字形偏好标注和区域优化目标,有效解决复杂或非领域字符的字形误差问题。

Comments CVPR 2026, Project Page: https://henghuiding.com/GlyphPrinter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 67%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏