arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-23 至 2026-04-23 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 16 篇

2604.14116 2026-04-23 cs.AI cs.CL 92%

TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration

TREX:通过代理驱动的树形探索自动化LLM微调

Zerun Ma, Guoqiang Wang, Xinchen Xie, Yicheng Chen, He Du, Bowen Li, Yanan Sun, Wenran Liu, Kai Chen, Yining Li

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TREX通过代理驱动的树形探索自动化LLM训练全流程,包括需求分析、文献调研、策略制定和模型训练,提升微调效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16676 2026-04-23 cs.LG cs.CL 92%

WISCA: A Lightweight Model Transition Method to Improve LLM Training via Weight Scaling

WISCA:一种轻量级模型转换方法,通过权重缩放提高LLM训练

Jiacheng Li, Jianchao Tan, Zhidong Yang, Pingwei Sun, Feiye Huo, Jiayu Qin, Xiangyu Zhang, Maoxin He, Yerui Sun, Yuchen Xie, Guangming Tan, Weile Jia, Xunliang Cai, Tong Zhao

机构 * Meituan, Beijing, China(美团,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国) Xiamen University, Xiamen, China(厦门大学,厦门,中国)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 WISCA通过优化神经网络权重模式提升LLM训练效率和模型质量,实验显示在GQA架构和LoRA微调任务中显著提升收敛质量。

Comments Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12078 2026-04-23 cs.CL cs.IR 92%

Optimizing User Profiles via Contextual Bandits for Retrieval-Augmented LLM Personalization

通过上下文老虎机优化用户资料以实现检索增强的LLM个性化

Linfeng Du, Ye Yuan, Zichen Zhao, Fuyuan Lyu, Emiliano Penaloza, Xiuying Chen, Zipeng Sun, Jikun Kang, Laurent Charlin, Xue Liu, Haolun Wu

机构 * McGill University(麦吉尔大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Université de Montréal(蒙特利尔大学) Salesforce(Salesforce公司) HEC Montréal(蒙特利尔HEC商学院) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PURPLE框架,通过上下文老虎机优化用户资料,利用Plackett-Luce模型捕捉复杂依赖,提升LLM个性化效果。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20835 2026-04-23 cs.CL 91%

Parallel-SFT: Improving Zero-Shot Cross-Programming-Language Transfer for Code RL

并行SFT:改进代码RL的零样本跨编程语言转移

Zhaofeng Wu, Shiqi Wang, Boya Peng, Anuj Goyal, Melanie Kambadur, Sebastian Ruder, Yoon Kim, Chloe Bi

机构 * Meta Superintelligence Labs(Meta超智能实验室) MIT(麻省理工学院)

专题命中 指令微调 :SFT(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本文提出零样本跨编程语言转移任务,通过并行SFT策略提升代码RL在不同语言间的迁移能力,发现通用化SFT初始化能提升模型泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15153 2026-04-23 cs.CL cs.AI 91%

Compressing Sequences in the Latent Embedding Space: $K$-Token Merging for Large Language Models

在潜在嵌入空间中压缩序列:大型语言模型的K-标记合并

Zihao Xu, John Harvill, Ziwei Fan, Yizhou Sun, Hao Ding, Hao Wang

机构 * Rutgers University(罗格斯大学) AWS AI Labs(AWS人工智能实验室) Amazon(亚马逊) Mistral AI University of California Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出K-Token Merging方法,在潜在空间中压缩序列,通过轻量编码器合并连续K个标记嵌入,实现75%的输入长度缩减,性能损失小。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20148 2026-04-23 cs.CL cs.AI cs.LG 90%

Meta-Tool: Efficient Few-Shot Tool Adaptation for Small Language Models

元工具:用于小语言模型的高效少样本工具适应

Sachin Kumar

机构 * LexisNexis, USA(LexisNexis美国公司)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过Meta-Tool研究小语言模型是否能在不复杂适应机制下实现强工具使用性能,发现超网络适应无显著提升,提示应关注提示工程与示例整理。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07050 2026-04-23 cs.IR cs.AI cs.CL cs.LG 88%

ReasonRank: Empowering Passage Ranking with Strong Reasoning Ability

ReasonRank: 通过强推理能力增强文档排序

Wenhan Liu, Xinyu Ma, Weiwei Sun, Yutao Zhu, Yuchen Li, Dawei Yin, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 分校) Baidu Inc., Beijing, China(百度公司,北京,中国) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ReasonRank,通过自动化生成推理密集型训练数据和两阶段训练方法,提升文档排序性能,实验表明其优于现有基线并具有更低延迟。

Comments 25 pages, accepted by ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10960 2026-04-23 cs.AI 84%

RAG-KT: Cross-platform Explainable Knowledge Tracing with Multi-view Fusion Retrieval Generation

RAG-KT: 跨平台可解释知识追踪的多视图融合检索生成

Zhiyi Duan, Hongyu Yuan, Rui Liu

机构 * Inner Mongolia University(内蒙古大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 RAG-KT通过多视图融合检索生成技术,解决传统知识追踪模型在跨平台迁移和解释性上的不足,提升准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20473 2026-04-23 cs.CV 80%

Video-ToC: Video Tree-of-Cue Reasoning

Video-ToC: 视频树状提示推理

Qizhong Tan, Zhuotao Tian, Guangming Lu, Jun Yu, Wenjie Pei

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 Video-ToC通过树状提示推理框架提升视频理解,引入三创新:树引导视觉提示定位、需求驱动奖励机制和自动化标注流程,验证其在视频理解与幻觉检测中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20361 2026-04-23 cs.CV 78%

Object Referring-Guided Scanpath Prediction with Perception-Enhanced Vision-Language Models

基于感知增强的视觉-语言模型的物体指称引导的注视路径预测

Rong Quan, Yantao Lai, Dong Liang, Jie Qin

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出ScanVLA模型,通过融合视觉和语言特征提升物体指称引导的注视路径预测性能,引入历史增强解码器和冻结分割LoRA辅助定位,提升预测精度且不增加计算成本。

Comments ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20720 2026-04-23 cs.LG cs.AI cs.CL 75%

COMPASS: COntinual Multilingual PEFT with Adaptive Semantic Sampling

COMPASS:持续多语言PEFT与自适应语义采样

Noah Flynn

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 COMPASS通过自适应语义采样策略,利用参数高效微调方法,在多语言任务中提升模型性能,减少跨语言干扰,实现持续学习框架以适应动态环境。

Journal ref Transactions on Machine Learning Research, 2025, https://openreview.net/forum?id=oapsbIO1Bd

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20511 2026-04-23 cs.LG cs.AI cs.CL cs.CV cs.CY 75%

CHASM: Unveiling Covert Advertisements on Chinese Social Media

CHASM:揭示中国社交媒体上的隐蔽广告

Jingyi Zheng, Tianyi Hu, Yule Liu, Zhen Sun, Zongmin Zhang, Zifan Peng, Wenhan Dong, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CHASM数据集,用于评估多模态大语言模型在检测社交媒体隐蔽广告的能力,揭示当前模型在识别隐蔽广告中的不足及改进方向。

Comments NeuIPS 2025 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03396 2026-04-23 cs.CL 74%

Breaking the Assistant Mold: Modeling Behavioral Variation in LLM Based Procedural Character Generation

打破助手模式:在基于大语言模型的程序化角色生成中建模行为变异

Maan Qraitem, Kate Saenko, Bryan A. Plummer

机构 * Boston University(波士顿大学)

专题命中 指令微调 :LLM(title);分类 cs.CL

AI总结 本文提出PersonaWeaver框架,通过解耦世界观构建与行为构建,生成更具多样性和戏剧张力的角色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20146 2026-04-23 cs.IR cs.CL 70%

SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

SAKE: 为基于地面的多模态命名实体识别的自我意识知识利用-探索

Jielong Tang, Xujie Yuan, Jiayang Liu, Jianxing Yu, Xiao Dong, Lin Chen, Yunlai Teng, Shimin Di, Jian Yin

机构 * Sun Yat-sen University(中山大学) Shandong Normal University(山东师范大学) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对开放世界社交媒体平台中长尾、快速演变和未见实体的挑战,SAKE提出一种端到端代理框架,通过自我意识推理和自适应搜索工具调用,结合内部知识利用和外部知识探索,提升多模态命名实体识别的精度与鲁棒性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20544 2026-04-23 cs.CV cs.AI 57%

Evian: Towards Explainable Visual Instruction-tuning Data Auditing

Evian:迈向可解释的视觉指令微调数据审计

Zimu Jia, Mingjie Xu, Andrew Estornell, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ByteDance Seed(字节跳动种子)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出Evian框架,通过分解评估模型响应的三大认知组件,解决数据审计中逻辑一致性与事实准确性不足的问题,验证高质量小规模数据优于大规模低质量数据。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14044 2026-04-23 cs.CV 50%

Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology

Weather-R1: 逻辑一致的强化微调用于气象中的多模态推理

Kaiyu Wu, Pucheng Han, Hualong Zhang, Naigeng Wu, Keze Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Meteorological Observatory(广东省气象局)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出Weather-R1,首个具备逻辑忠实性的气象多模态推理VLM,通过逻辑一致性奖励解决强化微调中的自相矛盾推理问题,并在WeatherQA基准上提升9.8个百分点。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 4851-4855

详情

展开后加载摘要…

URL PDF HTML 收藏