arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11601 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11601 篇

2605.31183 2026-06-01 cs.CL cs.AI cs.LG 83%

Steering LLMs? Actually, Sparse Autoencoders can outperform simple baselines

引导LLM?实际上,稀疏自编码器可以胜过简单基线

Mikkel Godsk Jørgensen, Lars Kai Hansen

机构 * DTU Compute(丹麦技术大学计算学院)

专题命中 指令微调 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过监督流水线选择并标注特征,证明稀疏自编码器在模型引导任务上可接近LoRA性能,并发现高稀疏性对基于可解释性的引导并非关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08146 2026-05-27 cs.CL cs.AI cs.LG 83%

Beyond Transfer Accuracy: Faithful Circuits for Controlled Low-Resource Adaptation

超越迁移准确率:用于受控低资源适应的忠实电路

Khumaisa Nur'aini, Ayu Purwarianti, Alham Fikri Aji, Derry Wijaya

机构 * Monash University Indonesia(印度尼西亚墨尔本大学) Institute Teknologi Bandung(Bandung理工大学) MBZUAI(MBZUAI研究所) Boston University(波士顿大学)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于上下文分解的电路发现方法(CD-T),通过标签平衡激活均值和任务方向相关性评分实现无反事实电路发现,并利用电路目标监督微调(CT-SFT)在低资源跨语言情感迁移中最小化灾难性遗忘,优于全局微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25571 2026-05-26 cs.CV 83%

AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution

AnE: 通过锚点进化推动多模态大语言模型的推理前沿

Zehao Wang, Yihan Zeng, Zidong Gong, Yuanfan Guo, Feng Zhu, Hongzhi Zhang, Wei Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah's Ark Lab(华为诺亚实验室) Independent Researcher(独立研究员)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出锚点进化(AnE)范式,通过真值锚点数据策展和脚手架剥离机制,解决多模态大模型推理中的认知漂移和幻觉路径问题,显著提升推理性能。

Comments 34 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22823 2026-05-22 cs.CV 83%

Which Way Did It Move? Diagnosing and Overcoming Directional Motion Blindness in Video-LLMs

它往哪个方向移动?视频大语言模型中方向运动盲症的诊断与克服

Jongseo Lee, Hyuntak Lee, Sunghun Kim, Sooa Kim, Jihoon Chung, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) Princeton University(普林斯顿大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文研究了视频大语言模型在理解方向运动时的盲点,提出MoDirect数据集和DeltaDirect方法,通过改进模型对方向运动的感知能力,显著提升了模型在合成和真实场景中的方向识别性能。

Comments Preprint. 59 pages, including appendix. Code: https://github.com/KHU-VLL/DeltaDirect

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04128 2026-05-21 cs.GR cs.AI cs.CL cs.CV cs.LG 83%

JoyAI-Image: Awaking Spatial Intelligence in Unified Multimodal Understanding and Generation

JoyAI-Image: 激活统一多模态理解和生成中的空间智能

Lin Song, Wenbo Li, Guoqing Ma, Wei Tang, Bo Wang, Yuan Zhang, Yijun Yang, Yicheng Xiao, Jianhui Liu, Yanbing Zhang, Guohui Zhang, Wenhu Zhang, Hang Xu, Nan Jiang, Xin Han, Haoze Sun, Maoquan Zhang, Haoyang Huang, Nan Duan

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);instruction tuning(abstract)

AI总结 本文提出JoyAI-Image,一种统一的多模态基础模型,用于视觉理解、文本到图像生成和指令引导的图像编辑。该模型结合了空间增强的多模态大语言模型(MLLM)和多模态扩散Transformer(MMDiT),通过共享的多模态接口实现感知与生成的交互。构建可扩展的训练配方,结合统一指令微调、长文本渲染监督、空间 grounded 数据和通用及空间编辑信号,使模型具备广泛的多模态能力,同时增强几何感知推理和可控视觉合成。实验表明,JoyAI-Image在理解、生成、长文本渲染和编辑基准上达到最先进的性能。更重要的是,增强的理解、可控的空间编辑和新视角辅助推理之间的双向循环使模型超越一般视觉能力,向更强的空间智能发展。

Comments Code: https://github.com/jd-opensource/JoyAI-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02064 2026-05-19 cs.LG cs.AI cs.CL 83%

Inspection and Control of Self-Generated-Text Recognition Ability in Llama3-8b-Instruct

对Llama3-8b-Instruct自生成文本识别能力的检查与控制

Christopher Ackerman, Nina Panickssery

专题命中 指令微调 :LLM(summary_cn,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了LLM是否能识别自身生成的文本,发现Llama3-8b-Instruct模型能够区分自身输出与人类输出,并通过残差流中的特定向量控制其行为和感知,揭示了模型自我归属的认知机制。

Comments 10 pages, 13 figs, 2 tables, accepted as conference paper to ICLR 2025

Journal ref The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15865 2026-05-18 cs.SE 83%

From Text to DSL: Evaluating Grammar-Based Model Generation Using Open LLMs

从文本到DSL:利用开源LLMs评估基于语法的模型生成

Junaid Baber, Nicolas Hili, Didier Schwab, Léo Challier, Cécilia Satrin

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了不同规模的开源LLMs在无需微调的情况下,通过少量示例提示生成符合DSL的模型的能力,验证了小型开源LLMs在MDE中的可行性。

Comments This version includes corrections to several malformed references and incorrect arXiv links that appeared in the published conference version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15474 2026-05-18 cs.IR 83%

Jobs' AI Exposure Should Be Measured from Evidence, Not Model Priors

AI 对岗位的影响应从证据而非模型先验来衡量

Luca Mouchel, Pierre Bouquet, Yossi Sheffi

专题命中 指令微调 :LLM(summary_cn,abstract);prompting(abstract)

AI总结 本文主张通过基于证据的方法测量AI对岗位的影响,而非仅依赖LLM先验。提出一个检索增强框架,利用公开权重推理和检索到的新闻和论文摘要,为O*NET 30.2中的18796个职业-任务对分配AI影响标签,优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15077 2026-05-15 cs.CL cs.AI cs.LG 83%

Concurrency without Model Changes: Future-based Asynchronous Function Calling for LLMs

无需模型变更的并发性:面向LLMs的未来式异步函数调用

Guangyu Feng, Huanzhi Mao, Prabal Dutta, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AsyncFC框架,通过解耦LLM解码与函数执行,实现解码与执行的重叠及函数间并行,减少端到端延迟并保持任务精度,揭示LLMs具备处理未决执行结果的符号未来推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15012 2026-05-15 cs.LG cs.AI cs.CL 83%

Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance

通过随机选择的少样本引导提升可验证奖励的强化学习

Kai Yan, Alexander G. Schwing, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FEST算法,通过随机选择的少样本引导提升可验证奖励的强化学习,仅需128个演示即可获得优于基线的结果,关键在于监督信号、在线信号和衰减权重。

Comments 25 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12798 2026-05-14 cs.LG cs.AI cs.CL 83%

Emergent and Subliminal Misalignment Through the Lens of Data-Mediated Transfer

通过数据中介转移的视角看涌现与潜意识偏差

Baris Askin, Muhammed Ustaomeroglu, Anupam Nayak, Gauri Joshi, Guannan Qu, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了通过数据中介转移现象理解模型在狭窄有害数据集上微调时产生的偏差问题,分析了微调数据结构、预训练分布和训练渠道之间的相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15574 2026-04-20 cs.CL cs.AI cs.LG cs.NE 83%

Why Fine-Tuning Encourages Hallucinations and How to Fix It

为何微调会鼓励幻觉以及如何解决

Guy Kaplan, Zorik Gekhman, Zhen Zhu, Lotem Rozner, Yuval Reif, Swabha Swayamdipta, Derek Hoiem, Roy Schwartz

机构 * Hebrew University of Jerusalem(海法大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Technion – Israel Institute of Technology(技术学院 – 以色列理工学院) University of Southern California(南加州大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨微调导致幻觉的原因,提出基于自蒸馏的微调方法以减少幻觉,通过抑制输出分布漂移提升事实学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10585 2026-04-14 cs.LG cs.AI cs.CL 83%

Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs

在奉承式微调下校准崩溃:奖励黑客如何破坏大语言模型的不确定性量化

Subramanyam Sahoo

机构 * Cambridge AI Safety Hub (CAISH)(剑桥人工智能安全中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

AI总结 研究探讨了在强化学习从人类反馈(RLHF)等方案中,奉承式微调对校准的影响,发现GRPO微调导致校准退化,尽管效果不显著,但经矩阵缩放后仍保留较高校准误差。

Comments Accepted at the AISTATS 2026 Workshop on Towards Trustworthy Predictions: Theory and Applications of Calibration for Modern AI. 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18841 2026-04-09 cs.CL cs.AI cs.LG 83%

LongWriter-Zero: Mastering Ultra-Long Text Generation via Reinforcement Learning

LongWriter-Zero: 通过强化学习掌握超长文本生成

Yuhao Wu, Yushi Bai, Zhiqiang Hu, Roy Ka-Wei Lee, Juanzi Li

机构 * Singapore University of Technology and Design, Singapore(新加坡科技设计大学) Tsinghua University, Beijing, China(清华大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出一种基于激励的方法,无需标注或合成数据,通过强化学习使LLM生成超长高质量文本,实验表明其在长文本任务中优于传统SFT方法,达到WritingBench和Arena-Write的最优效果。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23957 2026-03-26 cs.CV 83%

PointRFT: Explicit Reinforcement Fine-tuning for Point Cloud Few-shot Learning

PointRFT:针对点云少样本学习的显式强化微调

Yankai Wang, Yiding Sun, Qirui Wang, Pengbo Li, Chaoyi Lu, Dongxu Zhang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) International School, Beijing University of Posts and Telecommunications(北京邮电大学国际学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 本文提出PointRFT,一种专为点云表示学习设计的强化微调方法,通过定制奖励函数提升训练稳定性,实验表明其在多种基准上优于传统监督微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17325 2026-03-18 cs.LG cs.AI cs.CL 83%

Generalizable End-to-End Tool-Use RL with Synthetic CodeGym

通用端到端工具使用强化学习与合成CodeGym

Weihua Du, Hailei Gong, Zhan Ling, Kang Liu, Lingfeng Shen, Xuesong Yao, Yufei Xu, Dingyuan Shi, Yiming Yang, Jiecao Chen

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出CodeGym框架,通过合成多样化的多轮工具使用环境,提升LLM代理在不同任务配置下的泛化能力,实验显示Qwen2.5-32B-Instruct在OOD基准测试中准确率提升8.7个百分点。

Comments 24 pages. Accepted to ICLR 2026. Project repository: https://github.com/StigLidu/CodeGym

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00515 2026-03-03 cs.CV 83%

MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence

MLLM-4D: 向基于视觉的空间-时间智能迈进

Xingyilang Yin, Chengzhengxu Li, Jiahao Chang, Chi-Man Pun, Xiaodong Cun

机构 * University of Macau(澳门大学) Xi'an Jiaotong University(西安交通大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) GVC Lab, Great Bay University(大湾大学GVC实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 MLLM-4D通过改进的数据筛选和训练策略,实现了从2D输入中强大的空间-时间理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13629 2026-01-21 eess.AS eess.SP 83%

S$^2$Voice: Style-Aware Autoregressive Modeling with Enhanced Conditioning for Singing Style Conversion

S$^2$Voice: 基于增强条件的风格感知自回归建模用于歌唱风格转换

Ziqian Wang, Xianjun Xia, Chuanzeng Huang, Lei Xie

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 S$^2$Voice通过增强条件和自回归建模提升歌唱风格转换的风格控制和鲁棒性,实现更自然的音色相似性和更高的转换性能。

Comments accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04194 2026-01-13 cs.CL cs.AI cs.LG 83%

The Best Instruction-Tuning Data are Those That Fit

最适合指令微调的数据是那些能适应的

Dylan Zhang, Qirun Dai, Hao Peng

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 GRAPE通过选择与目标模型分布最匹配的响应,提升大语言模型的微调效果,实验显示其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06543 2026-01-13 cs.CL cs.AI cs.LG 83%

SimLLM: Fine-Tuning Code LLMs for SimPy-Based Queueing System Simulation

SimLLM:用于基于SimPy的排队系统模拟的代码LLM微调

Jun-Qi Chen, Kun Zhang, Rui Zheng, Ying Zhong

机构 * Institute of Statistics and Big Data, Renmin University of China(中国人民大学统计与大数据研究院) School of Information, Renmin University of China(中国人民大学信息学院) School of Management and Economics, University of Electronic Science and Technology of China(电子科技大学管理学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

AI总结 SimLLM通过微调开源LLM提升SimPy排队系统模拟代码生成能力,提供替代闭源模型的可行方案。

Comments 33 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01132 2025-12-09 cs.LG cs.AI cs.CL 83%

A Practitioner's Guide to Multi-turn Agentic Reinforcement Learning

多轮代理强化学习实践指南

Ruiyi Wang, Prithviraj Ammanabrolu

机构 * University of California, San Diego(加州大学圣地亚哥分校) NVIDIA(英伟达)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出多轮代理强化学习的训练方法,通过分析环境、奖励和策略三个支柱,总结出训练LLM代理的实践指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14031 2025-11-18 cs.CL cs.AI cs.LG 83%

Unintended Misalignment from Agentic Fine-Tuning: Risks and Mitigation

Dongyoon Hahm, Taywon Min, Woogyeol Jin, Kimin Lee

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at AAAI 2026 AI Alignment Track, Source code: https://github.com/HahmDY/agentic-ft-safety

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01689 2025-11-04 cs.CL cs.AI cs.LG 83%

Open Character Training: Shaping the Persona of AI Assistants through Constitutional AI

Sharan Maiya, Henning Bartsch, Nathan Lambert, Evan Hubinger

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);prompting(abstract)

Comments 12 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12434 2025-10-15 cs.CV 83%

VideoRFT: Incentivizing Video Reasoning Capability in MLLMs via Reinforced Fine-Tuning

Qi Wang, Yanrui Yu, Ye Yuan, Rui Mao, Tianfei Zhou

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen University(深圳大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments Accepted by NeurIPS 2025. Code: https://github.com/QiWang98/VideoRFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20582 2025-10-13 cs.IR 83%

SUMMA: A Multimodal Large Language Model for Advertisement Summarization

Weitao Jia, Shuo Yin, Zhoufutu Wen, Han Wang, Zehui Dai, Kun Zhang, Zhenyu Li, Tao Zeng, Xiaohui Lv

专题命中 指令微调 :large language model(title);language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18356 2025-10-09 cs.CL cs.AI cs.LG 83%

The Unreasonable Effectiveness of Model Merging for Cross-Lingual Transfer in LLMs

Lucas Bandarkar, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments MRL Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10116 2025-08-15 cs.IR 83%

Bridging Modality Gaps in e-Commerce Products via Vision-Language Alignment

Yipeng Zhang, Hongju Yu, Aritra Mandal, Canran Xu, Qunzhi Zhou, Zhe Wu

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09032 2025-08-08 cs.LG cs.AI cs.CL 83%

Teaching LLMs How to Learn with Contextual Fine-Tuning

Younwoo Choi, Muhammad Adil Asif, Ziwen Han, John Willes, Rahul G. Krishnan

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);prompting(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00222 2025-07-29 cs.CL cs.AI cs.LG 83%

Learning to Clarify: Multi-turn Conversations with Action-Based Contrastive Self-Training

Maximillian Chen, Ruoxi Sun, Tomas Pfister, Sercan Ö. Arık

机构 * Google(谷歌) Columbia University(哥伦比亚大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments ICLR 2025; Code: https://github.com/google-research/google-research/tree/master/learning_to_clarify

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04664 2025-07-08 cs.CV 83%

VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs

Tao Zhang, Shiqing Wei, Shihao Chen, Wenling Yu, Muying Luo, Shunping Ji

机构 * School of Remote Sensing and Information Engineering(遥感与信息工程学院) College of Oceanography and Space Informatics(海洋学与空间信息学院) School of Surveying and Geoinformation Engineering(测绘与地理信息工程学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏