arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-04 至 2026-05-04 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 16 篇

2605.00610 2026-05-04 cs.LG 92%

Decouple before Integration: Test-time Synthesis of SFT and RLVR Task Vectors

在整合前解耦:测试时合成SFT和RLVR任务向量

Chaohao Yuan, Chenghao Xiao, Yu Rong, Hong Cheng, Long-Kai Huang

机构 * Department of Systems Engineering and Engineering Management, Chinese University of Hong Kong, Hong Kong, China(系统工程与工程管理系,香港中文大学,香港,中国) Department of Computer Science, Hong Kong Baptist University, Hong Kong, China(计算机科学系,香港 Baptist 大学,香港,中国) DAMO Academy, Alibaba Group, Hangzhou, China(达摩院,阿里巴巴集团,杭州,中国) Hupan Lab, Hangzhou, China(虎派实验室,杭州,中国)

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本文提出DoTS框架,通过测试时任务向量运算解耦SFT和RLVR,减少干扰并提升性能,实验表明其在多个数学推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24496 2026-05-04 cs.LG cs.AI 92%

LLM DNA: Tracing Model Evolution via Functional Representations

LLM DNA:通过功能表示追溯模型进化

Zhaomin Wu, Haodong Zhao, Ziyang Wang, Jizhou Guo, Qian Wang, Bingsheng He

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学智远学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM DNA概念,通过低维生物利普希茨表示捕捉模型功能行为,解决现有方法的局限性,实验显示其在模型关系分析和进化树构建中的有效性。

Comments ICLR 2026 (Oral)

Journal ref International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00421 2026-05-04 cs.CL cs.AI cs.LG 91%

RadLite: Multi-Task LoRA Fine-Tuning of Small Language Models for CPU-Deployable Radiology AI

RadLite:用于CPU部署的放射学AI的多任务LoRA微调小型语言模型

Pankaj Gupta, Kartik Bose

机构 * Postgraduate Institute of Medical Education and Research(医学教育与研究研究生院)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 研究通过LoRA微调小型语言模型,实现放射学多任务性能,展示在消费级CPU上部署的可行性,提出RadLite模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00650 2026-05-04 cs.LG cs.AI 89%

AdaMeZO: Adam-style Zeroth-Order Optimizer for LLM Fine-tuning Without Maintaining the Moments

AdaMeZO:一种用于LLM微调的Adam风格零阶优化器,无需维护动量

Zhijie Cai, Haolong Chen, Guangxu Zhu

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出AdaMeZO,一种基于Adam风格的零阶优化器,通过估计一阶和二阶动量而不存储在内存中,有效减少GPU内存需求,同时在微调LLM时表现出色,比MeZO快70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23723 2026-05-04 cs.CL cs.AI cs.LG 88%

ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering

ML-Agent: 通过强化学习增强大语言模型代理以实现自主机器学习工程

Zexi Liu, Jingyi Chai, Xinyu Zhu, Shuo Tang, Rui Ye, Bo Zhang, Lei Bai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于强化学习的代理机器学习框架,通过探索增强微调、分步强化学习和专用奖励模块,训练出性能媲美大模型但成本更低的ML-Agent,实现跨任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00236 2026-05-04 cs.CR cs.AI 84%

Attention Is Where You Attack

注意力是攻击之处

Aviral Srivastava, Sourav Panda

机构 * Amazon(亚马逊) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出注意力重分布攻击(ARA),通过Gumbel-softmax优化在概率单纯形上攻击softmax注意力,成功绕过安全对齐,实现高准确率的恶意请求执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00072 2026-05-04 cs.CR cs.AI 81%

XekRung Technical Report

XekRung技术报告

Jiutian Zeng, Junjie Li, Chengwei Dai, Jie Liang, Zhaoyu Hu, Yiliang Zhang, Ziang Weng, Longtao Huang, Dongjie Zhang, Libin Dong, Yang Ge, Yuanda Wang, Kaiwen Lv Kacuila, Bingyu Zhu, Jing Wang, Jin Xu

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出XekRung,一种面向网络安全的前沿大语言模型,通过定制数据合成管道和多阶段训练流程,实现网络安全领域的高性能表现。

Comments 22 pages, 2 figures, 5 tables. Jiutian Zeng, Junjie Li, Chengwei Dai, Jie Liang, and Zhaoyu Hu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23557 2026-05-04 stat.ML cs.LG 81%

Minimizing Human Intervention in Online Classification

在在线分类中最小化人类干预

William Réveillard, Vasileios Saketos, Alexandre Proutiere, Richard Combes

机构 * KTH Royal Institute of Technology(皇家理工学院) Univ. Paris-Saclay, CNRS, CentraleSupélec(巴黎-萨克雷大学、国家科学研究中心、中央超导实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在主动学习框架下,如何通过保守包络分类器(CHC)和通用包络分类器(GHC)在不同条件下最小化人类干预,同时保证误差保障。

Comments 53 pages, 10 figures. AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL 80%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08156 2026-05-04 cs.CV 78%

LandSegmenter: Towards a Flexible Foundation Model for Land Use and Land Cover Mapping

LandSegmenter:面向土地利用与覆盖制图的灵活基础模型

Chenying Liu, Wei Huang, Xiao Xiang Zhu

机构 * Chair of Data Science in Earth Observation, Technical University of Munich(地球观测数据科学教授职位,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文提出LandSegmenter框架,解决土地利用与覆盖制图中数据需求高、模型泛化性差的问题,通过多模态数据集、跨模态特征提取和置信度引导融合策略提升模型性能。

Comments Accepted by ISPRS for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00631 2026-05-04 cs.CL cs.IR 77%

H-RAG at SemEval-2026 Task 8: Hierarchical Parent-Child Retrieval for Multi-Turn RAG Conversations

H-RAG在SemEval-2026任务8中的应用:多轮RAG对话中的层次父-子检索

Passant Elchafei, Hossam Emam, Mohamed Alansary, Monorama Swain, Markus Schedl

机构 * Johannes Kepler University Linz(约翰尼斯·开普勒大学林茨) Linz Institute of Technology(林茨技术学院) Artificial Intelligence Lab(人工智能实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 H-RAG通过层次化父-子检索方法提升多轮RAG对话性能,结合密集-稀疏搜索与上下文重构,实现检索与生成的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00371 2026-05-04 cs.SD cs.AI 77%

GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models

GaMMA:迈向大规模多模态模型中的联合全局-时间音乐理解

Zuyao You, Zhesong Yu, Mingyu Liu, Bilei Zhu, Yuan Wan, Zuxuan Wu

机构 * Fudan University(复旦大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 GaMMA通过融合音频编码器和跨模态学习,实现音乐内容的全面理解,并在MusicBench基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22082 2026-05-04 cs.LG cs.AI 73%

Removing Sandbagging in LLMs by Training with Weak Supervision

通过弱监督训练消除大模型中的虚报行为

Emil Ryd, Henning Bartsch, Julian Stastny, Joe Benton, Vivek Hebbar

机构 * University of Oxford(牛津大学) Redwood Research(红木研究)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究通过结合监督微调与强化学习,发现弱监督训练能有效消除模型虚报行为,但需确保训练与部署不可区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02443 2026-05-04 cs.LG 70%

Certain Head, Uncertain Tail: Expert-Sample for Test-Time Scaling in Fine-Grained MoE

某些头部,不确定尾部:专家-样本用于测试时缩放在细粒度MoE

Yuanteng Chen, Peisong Wang, Nanxin Zeng, Yuantian Shao, Shuang Qiu, Gang Li, Jing Liu, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Nanjing University of Science(南京理工大学) City University of Hong Kong(香港城市大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究细粒度MoE在测试时缩放中的性能优化,提出Expert-Sample方法通过保留高置信度选择并引入可控随机性提升生成多样性。

Comments 25 pages, 13 figures

Journal ref International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10913 2026-05-04 cs.CL 70%

ADVICE: Answer-Dependent Verbalized Confidence Estimation

ADVICE: 答案依赖性口头置信度估计

Ki Jung Seo, Sehun Lim, Taeuk Kim

机构 * Department of Computer Science, Hanyang University(韩国汉阳大学计算机科学系)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ADVICE框架,通过增强答案依赖性改进大语言模型的置信度校准,减少过度自信现象,提升可信度。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22699 2026-05-04 cs.CV 67%

Image-Guided Shape-from-Template Using Mesh Inextensibility Constraints

基于网格不可伸长约束的图像引导形状从模板方法

Thuy Tran, Ruochen Chen, Shaifali Parashar

机构 * CNRS(法国国家科学研究中心) École Centrale de Lyon(里昂中央理工大学) INSA Lyon(里昂国立应用科学学院) Université Claude Bernard Lyon 1(里昂一大学) LIRIS(图像研究所)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 本文提出一种无监督的形状从模板方法,利用图像观测和网格不可伸长约束,实现比现有无监督方法快400倍的重建速度,并在细节生成和严重遮挡处理上表现更优。

Comments Accepted to ICCV 2025. Total 13 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏