arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-12 至 2026-03-12 共收录 230 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 15 篇

2601.17923 2026-03-12 cs.AI 57%

Learning Transferable Skills in Action RPGs via Directed Skill Graphs and Selective Adaptation

通过定向技能图和选择性适应在动作RPG中学习可转移的技能

Ali Najar

机构 * Sharif University of Technology(沙斐大学)

专题命中 指令微调 :post-training(abstract);分类 cs.AI

AI总结 本文提出通过定向技能图和选择性适应方法,在动作RPG中实现技能的可转移学习,提高样本效率和适应性。

Comments 5 pages

Journal ref Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13043 2026-03-12 cs.CV cs.AI 57%

GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

GTR-Turbo:合并的检查点实际上是为代理VLM训练提供免费的教师

Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文生) Peking University(北京大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 GTR-Turbo通过合并检查点作为免费教师,提升了多模态代理训练的效率和效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18810 2026-03-12 cs.RO 50%

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

MergeVLA: 朝着通用视觉-语言-动作代理的跨技能模型合并

Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室)

专题命中 指令微调 :language model(abstract)

AI总结 MergeVLA通过设计保留模型合并性,利用稀疏激活的LoRA适配器和跨注意力机制,实现多技能任务的高效泛化。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 9 篇

2603.10279 2026-03-12 cs.LG 92%

Robust Post-Training for Generative Recommenders: Why Exponential Reward-Weighted SFT Outperforms RLHF

生成推荐系统的鲁棒性训练:为何指数奖励加权SFT优于RLHF

Keertana Chidambaram, Sanath Kumar Krishnamurthy, Qiuling Xu, Ko-Jen Hsiao, Moumita Bhattacharya

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(title,abstract);RLHF(title,abstract);分类 cs.LG

AI总结 本文提出指数奖励加权SFT方法,通过直接优化观测奖励,有效解决生成推荐系统中的鲁棒性训练问题,理论和实验证实其在噪声环境下的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10473 2026-03-12 cs.CL cs.AI 90%

Aligning Large Language Models with Searcher Preferences

将大型语言模型对齐于搜索者偏好

Wei Wu, Peilun Zhou, Liyi Chen, Qimeng Wang, Chengqiang Lu, Yan Gao, Yi Wu, Yao Hu, Hui Xiong

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Xiaohongshu Inc.(小红书公司) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SearchLLM通过分层多维奖励系统提升开放式生成搜索的鲁棒性和用户需求对齐能力,实测有效消费率提升1.03%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10009 2026-03-12 cs.LG cs.AI cs.CL 83%

Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment

面向异质偏好对齐的个性化群体相对策略优化

Jialu Wang, Heinrich Peters, Asad A. Butt, Navid Hashemi, Alireza Hashemi, Pouya M. Ghari, Joseph Hoover, James Rae, Morteza Dehghani

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07460 2026-03-12 cs.LG stat.ML 77%

Logarithmic Regret for Online KL-Regularized Reinforcement Learning

在线KL正则化强化学习的对数遗憾

Heyang Zhao, Chenlu Ye, Wei Xiong, Quanquan Gu, Tong Zhang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于乐观的KL正则化在线上下文老虎机算法,实现了对数遗憾界,并扩展到强化学习领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10535 2026-03-12 cs.LG cs.CL 73%

Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning

应对长度膨胀而不产生权衡:用于强化学习的群体相对奖励重缩放

Zichao Li, Jie Lou, Fangchen Dong, Zhiyuan Fan, Mengjie Ren, Hongyu Lin, Xianpei Han, Debing Zhang, Le Sun, Yaojie Lu, Xing Yu

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 GR$^3$通过乘法重缩放范式解决强化学习中的长度膨胀问题,实现通用、连续且奖励依赖的门控机制,有效减少冗余推理并提升训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01620 2026-03-12 cs.AI 70%

ToolRLA: Multiplicative Reward Decomposition for Tool-Integrated Agents

ToolRLA: 工具集成代理的乘法奖励分解

Pengbo Liu

专题命中 后训练与偏好优化 :post-training(abstract);SFT(abstract);分类 cs.AI

AI总结 ToolRLA通过乘法奖励分解提升工具集成代理的任务完成率、减少错误与违规,实现高效领域特定部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19442 2026-03-12 cs.CV 67%

UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment

UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准

Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi

机构 * Tsinghua University(清华大学) University College London(伦敦大学学院) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学) Zhejiang University(浙江大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Renmin University of China(中国人民大学) Southeast University(东南大学)

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract)

AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10205 2026-03-12 cond-mat.mtrl-sci cs.LG 57%

Flexible Cutoff Learning: Optimizing Machine Learning Potentials After Training

灵活截断学习:训练后优化机器学习势能

Rick Oerder, Jan Hamaekers

机构 * Institute for Numerical Simulation, University of Bonn(波恩大学数值模拟研究所) Fraunhofer Institute for Algorithms and Scientific Computing SCAI(弗劳恩霍夫算法与科学计算研究所SCAI)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 灵活截断学习通过训练后优化实现机器学习势能的精度-成本权衡优化,适用于多种应用需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20325 2026-03-12 cs.CV 50%

AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models

AD-R1: 闭环强化学习用于端到端自动驾驶的中立世界模型

Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zhesng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, University of Macau(SKL-IOTSC,澳门大学) Li Auto Inc. Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 AD-R1通过引入中立世界模型和反事实合成技术,提升自动驾驶系统在危险预测和安全控制方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 12 篇

2603.09981 2026-03-12 cs.CL 88%

Large Language Models and Book Summarization: Reading or Remembering, Which Is Better?

大语言模型与书籍摘要:阅读还是记忆,哪个更好?

Tairan Fu, Javier Conde, Pedro Reviriego, Javier Coronado-Blázquez, Nina Melero, Elena Merino-Gómez

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究比较了大语言模型在使用内部知识和完整文本生成书籍摘要的效果,发现完整文本通常能生成更详细的摘要,但某些情况下内部知识摘要表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10087 2026-03-12 cs.AR cs.DC 83%

Pooling Engram Conditional Memory in Large Language Models using CXL

在大语言模型中使用CXL进行恩格拉条件记忆池化

Ruiyang Ma, Teng Ma, Zhiyuan Su, Hantian Zha, Xinpeng Zhao, Xuchun Shang, Xingrui Yi, Zheng Liu, Zhu Cao, An Wu, Zhichong Dou, Ziqian Liu, Daikang Kuang, Guojie Luo

专题命中 长上下文与记忆 :large language model(title);language model(title)

AI总结 本文提出利用CXL内存池存储恩格拉条件记忆,以实现大语言模型的高效存储和低延迟访问。

Comments Submitted to EuroMLSys'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10006 2026-03-12 cs.CL cs.CY 79%

Adaptive Engram Memory System for Indonesian Language Model: Generative AI Based on TOBA LM for Batak and Minang Language

自适应恩格拉姆记忆系统用于印度尼西亚语言模型:基于TOBA LM的生成式AI用于巴塔克语和minang语

Hokky Situngkir, Kevin Siringoringo, Andhika Bernard Lumbantobing

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL

AI总结 TOBA-LM通过自适应恩格拉姆记忆机制,在有限资源下高效训练多语语言模型,实现快速收敛和降低计算成本。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10085 2026-03-12 cs.LG cs.AI cs.MA 79%

KernelSkill: A Multi-Agent Framework for GPU Kernel Optimization

KernelSkill:一种用于GPU内核优化的多智能体框架

Qitong Sun, Jun Han, Tianlin Li, Zhe Tang, Sheng Chen, Fei Yang, Aishan Liu, Xianglong Liu, Yang Liu

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 KernelSkill通过多智能体框架和双层记忆架构,实现高效GPU内核优化,取得显著速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10564 2026-03-12 cs.AI cs.NI 77%

Adaptive RAN Slicing Control via Reward-Free Self-Finetuning Agents

通过无奖励自我微调代理实现自适应RAN切片控制

Yuanhao Li, Haozhe Wang, Geyong Min, Nektarios Georgalas, Wang Miao

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种无奖励自我微调框架,通过内化经验实现自适应RAN切片控制,优于传统RL和LLM基agent。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10846 2026-03-12 cs.LG cs.AI cs.CL 75%

Towards Cold-Start Drafting and Continual Refining: A Value-Driven Memory Approach with Application to NPU Kernel Synthesis

迈向冷启动起草与持续细化:一种价值驱动的记忆方法及其在NPU内核合成中的应用

Yujie Zheng, Zhuo Li, Shengtao Zhang, Hanjing Wang, Junjie Sheng, Jiaqian Wang, Junchi Yan, Weinan Zhang, Ying Wen, Bo Tang, Muning Wen

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EvoKernel通过价值驱动的记忆强化学习方法,提升NPU内核合成的正确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05621 2026-03-12 cs.RO cs.AI cs.CL cs.LG cs.MA 67%

RACAS: Controlling Diverse Robots With a Single Agentic System

RACAS:通过单一代理系统控制多样化机器人

Dylan R. Ashley, Jan Przepióra, Yimeng Chen, Ali Abualsaud, Nurzhan Yesmagambet, Shinkyu Park, Eric Feron, Jürgen Schmidhuber

机构 * Center of Excellence in Generative AI, King Abdullah University of Science and Technology (KAUST), Saudi Arabia(沙特王国科学与技术大学生成人工智能卓越中心) Dalle Molle Institute for Artificial Intelligence Research (IDSIA), Switzerland(人工智能研究达勒莫利 institute) Università della Svizzera italiana (USI), Switzerland(瑞士意大利大学) Scuola universitaria professionale della Svizzera italiana (SUPSI), Switzerland(瑞士意大利专业大学) Robotics, Intelligent Systems, and Control Lab, King Abdullah University of Science and Technology (KAUST), Saudi Arabia(机器人、智能系统与控制实验室,沙特王国科学与技术大学(KAUST)) Department of Process Control, AGH University of Krakow, Poland(波兰克拉科夫AGH大学过程控制系)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RACAS通过单一代理系统实现跨平台机器人控制,无需修改代码或模型,有效降低机器人原型开发难度。

Comments 7 pages in main text + 1 page of appendices + 1 page of references, 5 figures in main text + 1 figure in appendices, 2 tables in main text; source code available at https://github.com/janprz11/robot-agnostic-control

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10291 2026-03-12 cs.AI cs.LG 62%

Hybrid Self-evolving Structured Memory for GUI Agents

混合自进化结构记忆用于GUI代理

Sibo Zhu, Wenyi Wu, Kun Zhou, Stephen Wang, Biwei Huang

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 HyMEM通过结合离散符号节点与连续轨迹嵌入,提升GUI代理的结构化记忆与自进化能力,使开源模型性能超越闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01313 2026-03-12 cs.CL cs.AI 62%

Evaluating Long-Horizon Memory for Multi-Party Collaborative Dialogues

评估多方协作对话的长周期记忆

Chuanrui Hu, Tong Li, Xingze Gao, Hongda Chen, Yi Bai, Dannong Xu, Tianwei Lin, Xiaohong Li, Yunyun Han, Jian Pei, Yafeng Deng

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EverMemBench,首个评估多方协作对话长周期记忆的基准,揭示当前系统在多跳推理、时间推理和记忆意识方面的局限性。

Comments 25 pages, 21 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10600 2026-03-12 cs.AI cs.DB cs.IR 57%

Trajectory-Informed Memory Generation for Self-Improving Agent Systems

基于轨迹的内存生成用于自改进代理系统

Gaodan Fang, Vatche Isahagian, K. R. Jayaram, Ritesh Kumar, Vinod Muthusamy, Punleuk Oum, Gegi Thomas

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本研究提出基于轨迹的内存生成框架,通过提取执行轨迹中的有效信息,提升代理在复杂任务中的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10747 2026-03-12 cs.DB 50%

Pneuma-Seeker: A Relational Reification Mechanism to Align AI Agents with Human Work over Relational Data

Pneuma-Seeker: 一种关系重构机制,用于将AI代理与关系数据上的人类工作对齐

Muhammad Imam Luthfi Balaka, John Hillesland, Kemal Badur, Raul Castro Fernandez

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 Pneuma-Seeker通过关系重构机制,将AI代理与人类工作对齐,提升数据处理的准确性和可信赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10231 2026-03-12 cs.CV 50%

OilSAM2: Memory-Augmented SAM2 for Scalable SAR Oil Spill Detection

OilSAM2: 用于可扩展SAR油污检测的内存增强型SAM2

Shuaiyu Chen, Ming Yin, Peng Ren, Chunbo Luo, Zeyu Fu

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 OilSAM2通过引入分层特征感知多尺度内存库和结构语义一致的内存更新策略,实现了对无序SAR图像中油污的高效分割。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 34 篇

2603.10313 2026-03-12 cs.CL 89%

Large language models can disambiguate opioid slang on social media

大语言模型可以区分社交媒体上的阿片类药物俚语

Kristy A. Carpenter, Issah A. Samori, Mathew V. Kiang, Keith Humphreys, Anna Lembke, Johannes C. Eichstaedt, Russ B. Altman

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 大语言模型能有效区分社交媒体上的阿片类药物俚语,提升低发病率主题的数据分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07997 2026-03-12 cs.CL 89%

BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models

BiasCause: 评估大型语言模型的社会偏见因果推理

Tian Xie, Tongxin Yin, Vaishakh Keshava, Xueru Zhang, Siddhartha Reddy Jonnalagadda

机构 * Google(谷歌) The Ohio State University(俄亥俄州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出BiasCause框架,评估LLMs在回答社会偏见问题时的因果推理,揭示其偏见产生机制及去偏策略。

Comments This work has been done when the first author is at Google. The first author is a student at the Ohio State University

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10588 2026-03-12 cs.AI cs.CL cs.LG 87%

Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning

LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究

Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Microsoft Research(微软研究院) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) CUHKSZ(香港中文大学(深圳)) THU(清华大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09980 2026-03-12 cs.LG cs.AI cs.CL 87%

Explainable LLM Unlearning Through Reasoning

通过推理实现可解释的LLM反学习

Junfeng Liao, Qizhou Wang, Shanshan Ye, Xin Yu, Ling Chen, Zhen Fang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于推理的反学习方法TRU,通过引入推理引导的反学习目标,实现更可靠且可解释的LLM反学习,同时保持模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10343 2026-03-12 eess.SP 85%

Multi-Modal Intelligent Channel Modeling: From Fine-tuned LLMs to Pre-trained Foundation Models

多模态智能信道建模:从微调大语言模型到预训练基础模型

Lu Bai, Zengrui Han, Mingran Sun, Xiang Cheng

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出多模态智能信道建模,通过微调大语言模型和预训练基础模型,实现6G无线通信的精确预测与灵活建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10055 2026-03-12 cs.LG cs.AI cs.CL 85%

Training Language Models via Neural Cellular Automata

通过神经细胞自动机训练语言模型

Dan Lee, Seungwook Han, Akarsh Kumar, Pulkit Agrawal

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过神经细胞自动机生成合成非语言数据,提升语言模型的预训练效果和推理能力。

Comments Website: https://hanseungwook.github.io/blog/nca-pre-pre-training/

详情

展开后加载摘要…

URL PDF HTML 收藏