arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-18 至 2026-05-18 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 24 篇

2509.22739 2026-05-18 cs.CL cs.AI cs.LG stat.ML 93%

Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models

无痛激活导向:一种自动化、轻量级的微调大型语言模型方法

Sasha Cui, Zhongren Chen

机构 * Yale University(耶鲁大学)

专题命中 指令微调 :language model(title,abstract);post-training(title,abstract);large language model(title);SFT(abstract,abstract_cn)

AI总结 本文提出Painless Activation Steering,一种自动化方法,无需人工干预即可利用标注数据提升模型性能,尤其在行为任务中表现优异,但对智能任务效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15635 2026-05-18 cs.CL 92%

Evaluating Chinese Ambiguity Understanding in Large Language Models

评估大型语言模型中的中文歧义理解

Junwen Mo, Yuanzhi Lu, Yifang Xue, Ke Xu, Hideki Nakayama

机构 * Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);instruction tuning(abstract)

AI总结 本文设计了首个基于潜在歧义理论的中文歧义数据集CHA-Gen,评估了LLM在歧义检测中的表现,揭示了模型在歧义识别中的常见失败模式及语义不确定性量化结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16113 2026-05-18 cs.CL cs.AI 92%

DebiasRAG: A Tuning-Free Path to Fair Generation in Large Language Models through Retrieval-Augmented Generation

DebiasRAG: 通过检索增强生成实现大型语言模型中公平生成的无调优路径

Rui Chu, Bingyin Zhao, Thanh Quoc Hung Le, Duy Cao Hoang, Huawei Lin, Ping Li, Weijie Zhao, Khoa D Doan, Yingjie Lao

机构 * Huawei(华为)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DebiasRAG,一种基于检索增强生成的无调优动态查询特定去偏框架,通过生成查询特定去偏候选、构建上下文候选池和梯度更新去偏引导上下文重排序三阶段,提升生成公平性并保留LLM固有属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15393 2026-05-18 cs.LG 91%

LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling

LPDS:通过逻辑保持难度扩展评估LLM鲁棒性

Philipp Mondorf, Samuel J. Bell, Jesse Dodge, Dieuwke Hupkes

机构 * FAIR at Meta(Meta 的 FAIR 部门) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LPDS框架,通过系统搜索逻辑保持变化来评估LLM鲁棒性,发现难度增加导致性能下降,且微调困难变体能获得更一致的鲁棒性提升。

Comments 41 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15412 2026-05-18 cs.CE cs.AI cs.CL 90%

From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery

从反馈循环到政策更新:基于强化微调的LLM驱动的alpha因子发现

Lingzhe Zhang, Tong Jia, Yunpeng Zhai, Zixuan Xie, Chiming Duan, Minghua He, Philip S. Yu, Ying Li

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出QuantEvolver框架,通过强化微调将可执行量化评估转化为策略更新,提升LLM在alpha因子发现中的表现,生成高质量且互补的因子池。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16179 2026-05-18 cs.CV 90%

MAgSeg: Segmentation of Agricultural Landscapes in High-Resolution Satellite Imagery using Multimodal Large Language Models

MAgSeg:利用多模态大语言模型对高分辨率卫星图像进行农业景观分割

Piyush Tiwary, Utkarsh Ahuja, Depanshu Sani, Aishwarya Jayagopal, Sagar Gubbi, Subhashini Venugopalan, Alok Talekar, Vaibhav Rajan

机构 * Google DeepMind(谷歌DeepMind) Google(谷歌) Indian Institute of Science(印度科学研究院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);post-training(abstract)

AI总结 本文提出MAgSeg,一种无需视觉解码器的多模态大语言模型分割方法,有效解决南半球农业景观分割中的碎片化地块、高类内方差和标注数据稀缺问题,实现高效农业环境制图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15394 2026-05-18 cs.LG cs.AI stat.ML 88%

Representation Without Reward: A JEPA Audit for LLM Fine-Tuning

无奖励的表示:用于LLM微调的JEPA审计

Biswa Sengupta

机构 * LLM Suite group of JP Morgan Chase and its affiliates(JP摩根士丹利 LLC 集团及其附属机构)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文探讨了在无奖励设定下,通过JEPA架构学习更有效的表示方法,测试了多种辅助项在自然语言到正则表达式生成任务中的表现,发现某些辅助项在特定统计检验下显著,但整体效果不显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02597 2026-05-18 cs.CV cs.AI 86%

Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs

视觉即理解:解锁因果注意力以实现模态互注意力用于多模态大语言模型

Wei-Yao Wang, Zhao Wang, Helen Suzuki, Yoshiyuki Kobayashi

机构 * Sony Group Corporation, Tokyo, Japan(索尼集团,日本东京)

专题命中 指令微调 :foundation model(abstract,abstract_cn);instruction tuning(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出模态互注意力机制,通过解锁因果注意力,提升多模态理解性能,无需额外参数,在12个基准测试中平均提升6.2%。

Comments ICML 2026. Code is available at https://github.com/sony/aki

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01679 2026-05-18 cs.LG cs.AI cs.CL 86%

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling

融合监督学习与强化学习微调的前缀采样

Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov

机构 * ILCC, University of Edinburgh(爱丁堡大学ILCC) Fudan University(复旦大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) ILLC, University of Amsterdam(阿姆斯特丹大学ILLC)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Prefix-RFT方法,结合示范数据与探索学习,通过数学问题验证其有效性,超越了单独SFT和RFT以及混合策略方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09994 2026-05-18 cs.DC cs.LG 85%

BatchWeave: A Consistent Object-Store-Native Data Plane for Large Foundation Model Training

BatchWeave: 一种用于大规模基础模型训练的一致对象存储原生数据平面

Ting Sun, Junjie Zhang, Xiao Yan, Songxin Zhang, Zhuoyang Song, Jingyi Xi, Zunyao Mao, Bingyi Jing, Jiaxing Zhang, Zejian Xie

机构 * Lionrock AI Lab, China Merchants Group, Hong Kong, China(狮岩人工智能实验室,中国商人集团,香港,中国) Wuhan University, Wuhan, China(武汉大学,武汉,中国) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 BatchWeave通过版本化清单和条件对象写入协调批量发布、恢复和生命周期管理,提供一致的分布式基础模型训练数据平面,支持事务全局批量、去中心化适应提交算法,提升吞吐量和故障隔离能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05297 2026-05-18 cs.SE cs.LG 84%

Building Specialized Software-Assistant ChatBot with Graph-Based Retrieval-Augmented Generation

构建基于图的检索增强生成专用软件助手聊天机器人

Mohammed Hilel, Yannis Karmim, Jean De Bodinat, Reda Sarehane, Antoine Gillon

机构 * RAKAM AI Lemon Learning

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于图的检索增强生成框架,将企业Web应用转换为状态-动作知识图,使LLM生成基于上下文的可靠帮助,通过与RAKAM和Lemon Learning的合作,展示了工程流程、图检索设计及生产DAP工作流整合。

Comments Accepted at ICMLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15865 2026-05-18 cs.SE 83%

From Text to DSL: Evaluating Grammar-Based Model Generation Using Open LLMs

从文本到DSL:利用开源LLMs评估基于语法的模型生成

Junaid Baber, Nicolas Hili, Didier Schwab, Léo Challier, Cécilia Satrin

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了不同规模的开源LLMs在无需微调的情况下,通过少量示例提示生成符合DSL的模型的能力,验证了小型开源LLMs在MDE中的可行性。

Comments This version includes corrections to several malformed references and incorrect arXiv links that appeared in the published conference version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15474 2026-05-18 cs.IR 83%

Jobs' AI Exposure Should Be Measured from Evidence, Not Model Priors

AI 对岗位的影响应从证据而非模型先验来衡量

Luca Mouchel, Pierre Bouquet, Yossi Sheffi

专题命中 指令微调 :LLM(summary_cn,abstract);prompting(abstract)

AI总结 本文主张通过基于证据的方法测量AI对岗位的影响,而非仅依赖LLM先验。提出一个检索增强框架,利用公开权重推理和检索到的新闻和论文摘要,为O*NET 30.2中的18796个职业-任务对分配AI影响标签,优于零样本基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10499 2026-05-18 math.DS cs.DM 82%

A Three-Dimensional SFT with Sparse Columns

三维稀疏列SFT

Ville Salo, Ilkka Törmä

专题命中 指令微调 :SFT(title,title_cn)

AI总结 本文构建了一个非平凡的三维有限型子移位,其投影Z-子动力学为2稀疏,即任一垂直列中最多有两个非零符号。该子移位在子动力学方向上是确定性的,因此与部分单元自动机的时间空间图集拓扑共轭。还提出了由Wang立方体定义的变体及二元字母表的子移位。

Comments 28 pages, 5 figures; this version has slightly simpler mats

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00424 2026-05-18 cs.CR cs.AI cs.MA cs.SE 81%

Skills as Verifiable Artifacts: A Trust Schema and a Biconditional Correctness Criterion for Human-in-the-Loop Agent Runtimes

技能作为可验证的成果:为有人参与的代理运行时的可信架构和双向正确性标准

Alfredo Metere

机构 * Enclawed, LLC(Enclawed公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种可信架构和双向正确性标准,用于人类参与的代理运行时,强调技能验证的重要性,以确保运行时的可信性和可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15217 2026-05-18 cs.AI cs.CY cs.LG econ.GN q-fin.EC 79%

Fair outputs, Biased Internals: Causal Potency and Asymmetry of Latent Bias in LLMs for High-Stakes Decisions

公平的输出,偏见的内部:在高风险决策中LLM中的因果潜能与潜在偏见的不对称性

Jagdish Tripathy, Marcus Buckmann

机构 * Bank of England(英格兰银行)

专题命中 指令微调 :LLM(title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,尽管指令微调的语言模型在高风险决策中表现公平,但其内部表示仍保留并放大了种族相关的偏见,且这种偏见在不同群体中不对称,需通过双层测试框架进行治理。

Comments 39 pages, 16 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23352 2026-05-18 cs.CV cs.AI 77%

Dynamic-TreeRPO: Breaking the Independent Trajectory Bottleneck with Structured Sampling

动态树RPO:通过结构化采样打破独立轨迹瓶颈

Xiaolong Fu, Lichen Ma, Zipeng Guo, ShiPing Dong, Lan Yang, Tan Lit Sin, Gaojing Zhou, Yu He, Jingling Fu, Shizhe Zhou, Junshi Huang, Jason Li

机构 * Sun Yat-sen University(中山大学) Tsinghua University(清华大学) Beijing University of Chemical Technology(北京化工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 本文提出动态树RPO,通过树状结构采样策略和动态噪声强度,提升文本到图像生成的质量与效率,同时结合层调优强化学习方法,在多个基准测试中表现出色。

Comments Fig.3 updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15916 2026-05-18 cs.LG cs.AI cs.CV 73%

LoCO: Low-rank Compositional Rotation Fine-tuning

LoCO:低秩组合旋转微调

An Nguyen, Jaesik Choi, Anh Tong

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) INEEJI

专题命中 指令微调 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 LoCO提出一种低秩组合旋转微调方法,通过低秩斜对称矩阵构建正交变换,实现高效参数微调,适用于多领域模型适应,展现优于传统正交和非正交方法的性能。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03258 2026-05-18 cs.LG cs.CL 73%

The Right Answer, the Wrong Direction: Why Transformers Fail at Counting and How to Fix It

正确的答案,错误的方向:为什么Transformer在计数上失败以及如何修复

Gabriel Garcia

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究发现Transformer在计数任务中失败是由于输出路径与所需令牌对齐问题,通过局部调整输出头和注意力机制可提升计数性能。

Comments 27 pages, 3 figures, 18 tables. Code: https://github.com/Gpgabriel25/GeometricReadoutBottleneck

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10380 2026-05-18 cs.LG cs.AI cs.CL 67%

Subgraph-level Universal Prompt Tuning

子图级通用提示微调

Junhyun Lee, Wooseong Yang, Jaewoo Kang

机构 * Korea University(韩国大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 指令微调 :prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出子图级通用提示微调方法,通过在子图层面分配提示特征,提升模型在不同预训练策略下的泛化能力,在42/45全场景实验中表现优于传统方法。

Journal ref Information Sciences 749 (2026) 123516

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13169 2026-05-18 cs.CV cs.AI 57%

PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World

PanoWorld:迈向360度全景世界的空间超感知

Changpeng Wang, Xin Lin, Junhan Liu, Yuheng Liu, Zhen Wang, Donglian Qi, Yunfeng Yan, Xi Chen

机构 * Zhejiang University(浙江大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学伊维特分校) The University of Hong Kong(香港大学)

专题命中 指令微调 :instruction tuning(abstract);分类 cs.AI

AI总结 本文提出PanoWorld,通过构建全景原生理解能力,解决传统多模态大模型在空间感知上的不足,通过全景空间交叉注意力机制提升3D空间推理能力,并建立PanoSpace-Bench基准测试,验证了全景原生监督的有效性。

Comments Project page: https://wcpcp.github.io/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15649 2026-05-18 cs.LG cs.NE 57%

Towards Code-Oriented LM Embeddings for Surrogate-Assisted Neural Architecture Search

面向代理辅助神经架构搜索的代码导向语言模型嵌入

Pranav Somu, Advay Balakrishnan, Stepan Kravtsov, Aaron McDaniel, Jason Zutty

机构 * Georgia Institute of Technology(佐治亚理工学院) Georgia Tech Research Institute(佐治亚理工研究 institute)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出一种低成本的代码导向语言模型嵌入策略,利用语言模型的归纳偏置,无需微调即可生成高效的架构特征提取器,实验证明其在NAS-Bench-201和einspace搜索空间中优于其他编码方式。

Comments This is an extended version of work accepted to GECCO 2026. Our code is available at https://github.com/pcsom/cole/tree/v1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15961 2026-05-18 cs.CV 50%

Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models

稀疏自编码器使CLIP模型的鲁棒且可解释的微调成为可能

Fabian Morelli, Arnas Uselis, Ankit Sonthalia, Seong Joon Oh

机构 * University of Tübingen(图宾根大学) KAIST(韩国科学技术院)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出SAE-FT方法,通过稀疏自编码器约束视觉表示的变化,实现CLIP模型的鲁棒且可解释的微调,提高下游任务性能同时保持模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15458 2026-05-18 cs.CV 50%

Video Models Can Reason with Verifiable Rewards

视频模型可以借助可验证的奖励进行推理

Tinghui Zhu, Sheng Zhang, James Y. Huang, Selena Song, Xiaofei Wen, Yuankai Li, Hoifung Poon, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) Microsoft Research(微软研究院) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出VideoRLVR方法,通过规则反馈优化视频扩散模型,提升可验证推理能力,在Maze、FlowFree和Sokoban任务中优于监督微调基线,证明可验证RL能推动视频模型超越感知模仿。

Comments Website: https://darthzhu.github.io/VideoRLVR-page/

详情

展开后加载摘要…

URL PDF HTML 收藏