arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-11 至 2026-03-11 共收录 232 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 17 篇

2603.09312 2026-03-11 cs.CV 75%

IntroSVG: Learning from Rendering Feedback for Text-to-SVG Generation via an Introspective Generator-Critic Framework

IntroSVG: 通过反思生成器-批评者框架从渲染反馈中学习以实现文本到SVG生成

Feiyu Wang, Jiayuan Yang, Zhiyuan Zhao, Da Zhang, Bingyu Li, Peng Liu, Junyu Gao

机构 * Fudan University(复旦大学) TeleAI Northwestern Polytechnical University(西北工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :language model(abstract);SFT(abstract);preference optimization(abstract)

AI总结 IntroSVG通过反思生成器-批评者框架,结合监督微调和直接偏好优化,实现文本到SVG生成的高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09951 2026-03-11 cs.LG cs.AI cs.SE 73%

Towards a Neural Debugger for Python

迈向Python的神经调试器

Maximilian Beck, Jonas Gehring, Jannik Kossen, Gabriel Synnaeve

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经调试器,通过模拟传统调试器实现交互式代码执行控制,提升神经模型在代码执行预测与逆向推理中的能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15447 2026-03-11 cs.LG cs.AI 62%

TSFM in-context learning for time-series classification of bearing-health status

基于时间序列基础模型的上下文学习用于滚动轴承健康状态分类

Michel Tokic, Slobodan Djukanović, Anja von Beuningen, Cheng Feng

机构 * Siemens AG Data & Artificial Intelligence(西门子AG数据与人工智能) Faculty of Mathematics Informatics and Statistics(数学信息统计系) Ludwig-Maximilians-University Munich(慕尼黑路德维希-马克西米利安大学) Faculty of Electrical Engineering(电气工程系) University of Montenegro(蒙特内格罗大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于时间序列基础模型的上下文学习方法,用于滚动轴承健康状态分类,通过伪时间序列模式预测类别概率,提升维护系统的智能化水平。

Comments Preprint. To appear in the Proceedings of the European Symposium on Artificial Neural Networks (ESANN), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08812 2026-03-11 cs.CV 50%

VisionCreator-R1: A Reflection-Enhanced Native Visual-Generation Agentic Model

VisionCreator-R1: 一种增强反思的原生视觉生成代理模型

Jinxiang Lai, Wenzhe Zhao, Zexin Lu, Hualei Zhang, Qinyu Yang, Rongwei Quan, Zhimin Li, Shuai Shao, Song Guo, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文言) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 指令微调 :SFT(abstract)

AI总结 VisionCreator-R1通过引入反射-计划联合优化方法,提升视觉生成代理在单图和多图任务中的表现,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 11 篇

2603.08640 2026-03-11 cs.SE cs.AI cs.LG 88%

PostTrainBench: Can LLM Agents Automate LLM Post-Training?

PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?

Ben Rank, Hardik Bhatnagar, Ameya Prabhu, Shira Eisenberg, Karina Nguyen, Matthias Bethge, Maksym Andriushchenko

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09206 2026-03-11 cs.CV cs.LG 85%

MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data

MM-Zero: 从零数据自我进化多模型视觉语言模型

Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He, Jing Xie, Xiaomin Wu, Zhichao Liu, Jiarui Zhang, Fuxiao Liu

机构 * University of Maryland(马里兰大学) Brown University(布朗大学) Washington University in St. Louis(圣路易斯华盛顿大学) Adobe University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Southern California(南加州大学) NVIDIA

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

AI总结 MM-Zero通过多角色框架实现VLM零数据自我进化,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22607 2026-03-11 cs.AI cs.CL 84%

From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents

从自演化合成数据到可验证奖励强化学习:训练后多轮交互工具使用智能体

Jiaxuan Gao, Jiaao Chen, Chuyi He, Shusheng Xu, Di Jin, Yi Wu

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EigenData框架,结合自演化数据代理与验证器强化学习,通过合成数据提升多轮交互工具使用智能体的训练效率和性能。

Comments Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17102 2026-03-11 cs.AI 81%

Reinforcement Learning for Self-Improving Agent with Skill Library

基于技能库的自我改进智能体强化学习

Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) AWS Agentic AI(AWS智能代理)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出SAGE框架,通过强化学习结合技能库,提升智能体在新环境中的自我改进能力,实验显示其在准确性和效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09121 2026-03-11 cs.RO cs.AI 79%

DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation

DexHiL: 一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架

Yifan Han, Zhongxi Chen, Yuxuan Zhao, Congsheng Xu, Yanming Shao, Yichuan Peng, Yao Mu, Wenzhao Lian

机构 * CASIA(中国科学院自动化研究所) SJTU(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 DexHiL是一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架,通过干预意识的数据采样策略和轻量级远程操作界面,显著提升了模型在不同任务中的成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11595 2026-03-11 cs.LG cs.AI cs.CL 75%

Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO

逐步引导策略优化:在GRPO中着色你的错误推理

Peter Chen, Xiaopeng Li, Ziniu Li, Xi Chen, Tianyi Lin

机构 * Department of Industrial Engineering and Operations Research(工业工程与运营管理系) Department of Mathematics(数学系) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Stern School of Business, New York University(纽约大学斯特恩商学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SGPO通过引入组内响应多样性,解决GRPO在所有负样本组时无法更新策略的问题,提升推理模型性能。

Comments Accepted by TMLR; 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05630 2026-03-11 cs.LG cs.CL 73%

Rewards as Labels: Revisiting RLVR from a Classification Perspective

奖励作为标签:从分类视角重新审视RLVR

Zepeng Zhai, Meilin Chen, Jiaxuan Zhao, Junlang Qian, Lei Shen, Yuan Lu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出REAL框架,将可验证奖励视为分类标签,通过改进梯度分配提升策略优化效率,实验证明其在数学推理任务中优于GRPO和DAPO等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09538 2026-03-11 cs.CV 67%

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

迈向统一多模态交错生成的群体相对策略优化

Ming Nie, Chunwei Wang, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿恒智能科技有限公司)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 本文提出基于强化学习的后训练策略,通过群体相对策略优化框架提升统一多模态模型的交错生成能力,实验表明其在质量与连贯性上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06748 2026-03-11 cs.LG cs.AI 62%

Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment

基于属性的蛋白质逆折叠与多目标偏好对齐

Xiaoyang Hou, Junqi Liu, Chence Shi, Xin Liu, Zhi Yang, Jian Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) BioGeometry Mila - Québec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔HEC商学院) CIFAR AI Research Chair(CIFAR人工智能研究主席)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ProtAlign框架,通过多目标偏好对齐提升蛋白质序列设计的开发性与结构保真度,适用于多种蛋白质设计任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13095 2026-03-11 cs.CV cs.LG 57%

ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning

ADHint: 基于难度先验的自适应提示用于强化学习

Feng Zhang, Zezhong Tan, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 ADHint通过整合难度先验,改进强化学习中的探索与模仿平衡,提升推理能力和分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12642 2026-03-11 cs.SE cs.AI quant-ph 57%

QSpark: Towards Reliable Qiskit Code Generation

QSpark:迈向可靠的Qiskit代码生成

Kiana Kheiri, Aamna Aamir, Andriy Miranskyy, Chen Ding

机构 * Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 QSpark通过GRPO和ORPO方法提升Qiskit代码生成的可靠性,在基准测试中取得显著成绩,但仍有提升空间。

Journal ref In Proceedings of the 3rd International Workshop on AI for Quantum and Quantum for AI (AIQxQIA 2025), co-located with ECAI 2025, CEUR Workshop Proceedings, Vol. 4153, Paper 6, pp. 1-12, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 12 篇

2505.14679 2026-03-11 cs.CL cs.AI cs.LG 87%

UltraEdit: Training-, Subject-, and Memory-Free Lifelong Editing in Language Models

UltraEdit: 无训练、无主题、无内存的语言模型终身编辑

Xiaojie Gu, Ziying Huang, Jia-Chen Gu, Kai Zhang

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 UltraEdit通过无训练、无主题、无内存的方法实现高效语言模型终身编辑,速度快7倍且内存占用低4倍,支持大规模编辑任务。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09297 2026-03-11 cs.IR cs.CL 85%

TA-Mem: Tool-Augmented Autonomous Memory Retrieval for LLM in Long-Term Conversational QA

TA-Mem: 用于LLM长期对话问答的工具增强自主记忆检索

Mengwei Yuan, Jianan Liu, Jing Yang, Xianyou Li, Weiran Yan, Yichao Wu, Penghao Liang

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TA-Mem通过引入工具增强的自主记忆检索框架,解决了LLM在长距离推理任务中的记忆存储问题,提升了长期对话问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09023 2026-03-11 cs.OS cs.AI cs.SE 85%

The Missing Memory Hierarchy: Demand Paging for LLM Context Windows

缺失的记忆层次:为LLM上下文窗口的需求分页

Tony Mason

机构 * University of British Columbia(不列颠哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Pichay通过需求分页技术减少LLM上下文消耗,提升内存使用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09250 2026-03-11 cs.IR 85%

Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval

唤起用户记忆:通过回忆-熟悉度适应检索个性化LLM

Yingyi Zhang, Junyi Li, Wenlin Zhang, Penyue Jia, Xianneng Li, Yichao Wang, Derong Xu, Yi Wen, Huifeng Guo, Yong Liu, Xiangyu Zhao

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 RF-Mem通过双路径记忆检索实现个性化LLM,结合回忆与熟悉度机制提升记忆检索效率和准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08993 2026-03-11 cs.SE cs.AI cs.CR cs.PL 79%

Arbiter: Detecting Interference in LLM Agent System Prompts

Arbiter:检测LLM代理系统提示中的干扰

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 Arbiter通过结合形式评估规则和多模型LLM扫描,检测LLM代理系统提示中的干扰模式,发现152个问题并揭示漏洞类别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08755 2026-03-11 cs.PL cs.AI cs.SE 77%

Turn: A Language for Agentic Computation

Turn:一种用于代理计算的语言

Muyukani Kizito

机构 * Turn Lang(Turn语言) Prescott Data(Prescott数据)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Turn是一种用于代理计算的编译型语言,通过类型安全、能力身份系统和编译时模式吸收等机制,实现对大型语言模型推断的可靠控制和安全管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08727 2026-03-11 cs.AR cs.AI cs.DC cs.PF 77%

ARKV: Adaptive and Resource-Efficient KV Cache Management under Limited Memory Budget for Long-Context Inference in LLMs

ARKV:在有限内存预算下为LLMs长上下文推理实现自适应和资源高效的KV缓存管理

Jianlong Lei, Shashikant Ilager

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ARKV通过动态分配精度级别,实现LLMs长上下文推理中的高效内存管理,减少内存使用并保持高精度。

Comments Accepted in ACM/IEEE CCGRID 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24594 2026-03-11 cs.SE cs.LO 75%

A Tale of 1001 LoC: Potential Runtime Error-Guided Specification Synthesis for Verifying Large-Scale Programs

1001行代码的故事:潜在运行时错误引导的规范合成用于验证大规模程序

Zhongyi Wang, Tengjie Lin, Mingshuai Chen, Haokun Li, Mingqi Yang, Xiao Yi, Shengchao Qin, Yixing Luo, Xiaofeng Li, Bin Gu, Liqiang Lu, Jianwei Yin

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Preguss通过结合静态分析与演绎验证,实现大规模程序的自动化形式化验证,显著提升验证效率。

Comments Accepted at OOPSLA 2026. Publication date: April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05960 2026-03-11 cs.LG 70%

Omni-Masked Gradient Descent: Memory-Efficient Optimization via Mask Traversal with Improved Convergence

全方位遮蔽梯度下降:通过遮蔽遍历实现内存高效的优化

Hui Yang, Tao Ren, Jinyang Jiang, Wan Tian, Yijie Peng

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Omni-Masked Gradient Descent通过遮蔽遍历实现内存高效的优化,提供非凸情况下改进的收敛分析和更优的迭代复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09835 2026-03-11 cs.CL 57%

Chow-Liu Ordering for Long-Context Reasoning in Chain-of-Agents

Chow-Liu 排序用于链式代理中的长上下文推理

Naman Gupta, Vaibhav Singh, Arun Iyer, Kirankumar Shiragur, Pratham Grover, Ramakrishna B. Bairi, Ritabrata Maiti, Sankarshan Damle, Shachee Mishra Gupta, Rishikesh Maurya, Vageesh D. C

机构 * Microsoft(微软)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 本文利用Chow-Liu树学习依赖结构,通过广度优先遍历优化块顺序,减少信息损失并提升长上下文推理的准确率。

Comments Published as a workshop paper at ICLR 2026 Workshop MemAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09716 2026-03-11 cs.AI 57%

AutoAgent: Evolving Cognition and Elastic Memory Orchestration for Adaptive Agents

AutoAgent:为自适应智能体演化认知与弹性记忆编排

Xiaoxing Wang, Ning Liao, Shikun Wei, Chen Tang, Feiyu Xiong

机构 * MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) Shanghai Jiao Tong University(上海交通大学) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 AutoAgent通过自我进化多智能体框架,实现动态认知演化与弹性记忆编排,提升智能体在动态环境中的适应性和任务执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09654 2026-03-11 cs.CL cs.IR 57%

Understanding the Interplay between LLMs' Utilisation of Parametric and Contextual Knowledge: A keynote at ECIR 2025

理解大型语言模型对参数知识和上下文知识的相互作用:ECIR 2025 keynote

Isabelle Augenstein

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本文探讨大型语言模型在参数知识与上下文知识之间相互作用的重要性,通过评估知识、诊断冲突及分析上下文知识特征,揭示模型内部工作机制及知识更新挑战。

Journal ref ACM SIGIR Forum, Volume 59, Issue 2, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 46 篇

2603.09481 2026-03-11 cs.AI 90%

GenePlan: Evolving Better Generalized PDDL Plans using Large Language Models

GenePlan: 利用大语言模型改进PDDL计划的进化方法

Andrew Murray, Danial Dervovic, Alberto Pozanco, Michael Cashmore

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 GenePlan利用大语言模型改进PDDL计划的进化方法,通过优化问题生成高效且低成本的通用计划器,实现了与最先进方法相近的性能。

Comments 54 pages, 4 figures. Accepted to ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24235 2026-03-11 cs.RO cs.AI 89%

SafeGen-LLM: Enhancing Safety Generalization in Task Planning for Robotic Systems

SafeGen-LLM: 提高机器人系统任务规划中的安全性泛化能力

Jialiang Fan, Weizhe Xu, Mengyu Liu, Oleg Sokolsky, Insup Lee, Fanxin Kong

机构 * University of Notre Dame(诺丁汉大学) Washington State University(华盛顿州立大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SafeGen-LLM通过两阶段框架提升机器人任务规划的安全性泛化能力,优于现有基线。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21735 2026-03-11 cs.SE cs.AI cs.CL cs.MA 86%

GateLens: A Reasoning-Enhanced LLM Agent for Automotive Software Release Analytics

GateLens: 一种增强推理能力的LLM代理用于汽车软件发布分析

Arsham Gholamzadeh Khoee, Shuai Wang, Robert Feldt, Dhasarathy Parthasarathy, Yinan Yu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GateLens是一种基于LLM的代理,通过引入关系代数作为中间表示,提升复杂表格数据分析的效率与准确性,适用于汽车软件发布分析领域。

详情

展开后加载摘要…

URL PDF HTML 收藏