arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-06 至 2026-03-06 共收录 236 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 12 篇

2603.01223 2026-03-06 cs.LG cs.CL 62%

Learn Hard Problems During RL with Reference Guided Fine-tuning

在强化学习中学习难题问题:基于参考的微调

Yangzhen Wu, Shanda Li, Zixin Wen, Xin Zhou, Ameet Talwalkar, Yiming Yang, Wenhao Huang, Tianle Cai

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 ReGFT通过利用人类参考解决方案合成积极轨迹,提升RL在数学推理中的性能和训练效率。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04405 2026-03-06 cs.CV cs.AI cs.LG 62%

Lost in Translation: How Language Re-Aligns Vision for Cross-Species Pathology

迷失在翻译中:语言如何重新对齐视觉以实现跨物种病理学

Ekansh Arora

机构 * Thomas Jefferson High School for Science and Technology(泰勒斯·杰弗里斯高中科学与技术学校)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入语义锚定机制,利用语言对齐解决跨物种病理学中的视觉-语言对齐问题,提升模型在跨物种任务中的性能。

Comments 27 pages, 6 figures, 7 tables. Code and data available at https://github.com/ekansh-arora0/cross-species-pathology

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 15 篇

2603.04429 2026-03-06 cs.CL cs.AI 91%

What Is Missing: Interpretable Ratings for Large Language Model Outputs

缺失的是:大型语言模型输出的可解释评分

Nicholas Stranges, Yimin Yang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 本文提出WIM评分系统,通过自然语言反馈生成可解释的评分,提升大型语言模型输出的可解释性和学习信号质量。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00152 2026-03-06 cs.CV cs.AI 88%

Dr. Seg: Revisiting GRPO Training for Visual Large Language Models through Perception-Oriented Design

Dr. Seg: 通过感知导向设计重新审视GRPO训练用于视觉大语言模型

Haoxiang Sun, Tao Wang, Chenwei Tang, Li Yuan, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 Dr.Seg通过感知导向设计重新审视GRPO训练,提出简单框架提升视觉任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02464 2026-03-06 cs.CV 88%

SAMPO-Path: Segmentation Intent-Aligned Preference Optimization for Pathology Foundation Model Segmentation

SAMPO-Path: 分段意图对齐的偏好优化用于病理基础模型分段

Yonghuang Wu, Wenwen Zeng, Xuan Xie, Chengqian Zhao, Guoqing Wu, Jinhua Yu

机构 * School of Biomedical Engineering and Technological Innovation, Fudan university, Shanghai, China.(生物医学工程与技术创新学院,复旦大学,上海,中国)

专题命中 后训练与偏好优化 :foundation model(title,abstract);preference optimization(title,abstract)

AI总结 SAMPO-Path通过偏好优化框架提升病理图像分割的准确性和临床意图一致性。

Comments 15 pages, 9 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04822 2026-03-06 cs.AI 87%

VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment

VISA: 通过屏蔽适应进行价值注入以实现个性化大语言模型对齐

Jiawei Chen, Tianzhuo Yang, Guoxi Zhang, Jiaming Ji, Yaodong Yang, Juntao Dai

机构 * Peking University(北京大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 VISA通过屏蔽适应机制,有效缓解大语言模型对齐税,实现精细化价值观对齐与语义完整性保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25762 2026-03-06 cs.LG 85%

OPPO: Accelerating PPO-based RLHF via Pipeline Overlap

OPPO: 通过管道重叠加速基于PPO的RLHF

Kaizhuo Yan, Yingjie Yu, Yifan Yu, Haizhong Zheng, Fan Lai

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 OPPO通过管道重叠技术提升基于PPO的RLHF训练效率,加速训练过程并提高GPU利用率

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02015 2026-03-06 cs.CV 85%

OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation

OSPO: 以对象为中心的自我改进偏好优化用于文本到图像生成

Yoonjin Oh, Yongjin Kim, Hyomin Kim, Donghwan Chi, Sungwoong Kim

机构 * Korea University(韩国大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 OSPO通过自构造对象中心偏好数据和对象加权损失,提升文本到图像生成中对象级对齐和保真度,优于现有自我改进方法和专门扩散模型。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04918 2026-03-06 cs.LG cs.AI 84%

BandPO: Bridging Trust Regions and Ratio Clipping via Probability-Aware Bounds for LLM Reinforcement Learning

BandPO: 通过概率感知边界弥合信任区域与比率裁剪用于大语言模型强化学习

Yuan Li, Bo Wang, Yufei Gao, Yuqian Yao, Xinyuan Wang, Zhangyue Yin, Xipeng Qiu

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 BandPO通过概率感知边界解决大语言模型强化学习中的探索瓶颈,提升性能并缓解熵崩溃问题。

Comments Code available at https://github.com/OpenMOSS/BandPO.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05275 2026-03-06 cs.MM cs.CL cs.SD 83%

SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning

SarcasmMiner:一种双轨后训练框架,用于鲁棒的音频视觉讽刺推理

Zhu Li, Yongjian Chen, Huiyuan Lai, Xiyuan Gao, Shekhar Nayak, Matt Coler

机构 * Speech Technology Lab, University of Groningen, The Netherlands(格罗宁根大学语音技术实验室,荷兰) Center for Language and Cognition, University of Groningen, The Netherlands(格罗宁根大学语言与认知中心,荷兰)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL

AI总结 SarcasmMiner通过双轨蒸馏和组相对策略优化提升多模态讽刺检测性能,实现F1值显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04968 2026-03-06 cs.CL cs.AI 82%

When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger

当弱大语言模型自信发言时,偏好对齐会变得更强大

Amirabbas Afzali, Myeongho Jeon, Maria Brbic

机构 * EPFL(苏黎世联邦理工学院) Sharif University of Technology(谢赫·穆吉加布大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出CW-PO框架,利用弱LLM的置信度加权实现更高效的偏好对齐,仅用20%的人类标注即可超越传统方法。

Comments 32 pages, 8 figures, International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04277 2026-03-06 cs.LG cs.AI 81%

Bootstrapped Mixed Rewards for RL Post-Training: Injecting Canonical Action Order

基于强化学习后训练的混合奖励:注入经典动作顺序

Prakhar Gupta, Vaibhav Gupta

机构 * University of Michigan(密歇根大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出在强化学习后训练中引入混合奖励,通过结合稀疏任务奖励和顺序奖励,提升模型对经典求解顺序的适应能力,无需修改监督数据或架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00485 2026-03-06 cs.AI 79%

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

用偏好替代参数:异构视觉-语言模型的联邦对齐

Shule Lu, Yujing Wang, Hainan Zhang, Xiaoshan Yang, Hongwei Zheng, Yongxin Tong, Changsheng Xu, Zhiming Zheng

专题命中 后训练与偏好优化 :language model(title);foundation model(abstract);分类 cs.AI

AI总结 本文提出MoR框架,通过用偏好替代参数实现异构视觉-语言模型的联邦对齐,提升泛化、鲁棒性和跨客户端适应性。

Comments Due to the need for substantial revisions, the authors believe that the paper should be retracted first.A revised version may be resubmitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04851 2026-03-06 cs.LG cs.CL 76%

Why Is RLHF Alignment Shallow? A Gradient Analysis

为什么RLHF对齐是浅层的?一种梯度分析

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 后训练与偏好优化 :RLHF(title);分类 cs.CL、cs.LG

AI总结 本文通过梯度分析揭示RLHF对齐浅层的原因,提出有害信息概念并设计新的目标以实现深层对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04439 2026-03-06 cs.AI cs.LG 73%

CoRPO: Adding a Correctness Bias to GRPO Improves Generalization

CoRPO:在GRPO中添加正确性偏差以提高泛化能力

Anisha Garg, Claire Zhang, Nishit Neema, David Bick, Ganesh Venkatesh, Joel Hestness

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CoRPO通过引入正确性偏差改进GRPO,提升模型在跨领域任务中的泛化能力与推理稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04974 2026-03-06 cs.CL 70%

VRM: Teaching Reward Models to Understand Authentic Human Preferences

VRM:教奖励模型理解真实人类偏好

Biao Liu, Ning Xu, Junming Yang, Hao Xu, Xin Geng

机构 * Southeast University, Nanjing, China(东南大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VRM通过建模人类偏好判断的评估过程,利用变分推断技术提升对真实人类偏好的捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02282 2026-03-06 cs.CV cs.LG 70%

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释

Kyoungjun Park, Yifan Yang, Juheon Yi, Shicheng Zheng, Yifei Shen, Dongqi Han, Caihua Shan, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 后训练与偏好优化 :SFT(abstract);preference optimization(abstract);分类 cs.LG

AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 18 篇

2510.08966 2026-03-06 cs.AI cs.CL 90%

Beyond Prefixes: Graph-as-Memory Cross-Attention for Knowledge Graph Completion with Large Language Models

超越前缀:基于图记忆的交叉注意力用于大型语言模型的知识图谱补全

Ruitong Liu, Boxu Lin, Peize Li, Siyuan Li, Yunjia Wu, Te Sun, Chaohan Wu

机构 * Peking University(北京大学) Dalian University of Technology(大连理工大学) King’s College London(伦敦国王学院) Peng Cheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出图记忆调优方法,通过深度交叉注意力机制提升大型语言模型在知识图谱补全任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09982 2026-03-06 cs.CL 89%

INMS: Memory Sharing for Large Language Model based Agents

INMS: 基于大语言模型的智能体中的记忆共享

Hang Gao, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 INMS通过异步交互范式实现多智能体间的动态记忆共享,提升开放性场景下的智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04412 2026-03-06 cs.CL 88%

Additive Multi-Step Markov Chains and the Curse of Dimensionality in Large Language Models

加性多步马尔可夫链与大语言模型中维度灾难

O. V. Usatenko, S. S. Melnyk, G. M. Pritula

机构 * A. Ya. Usikov Institute for Radiophysics and Electronics Ukrainian Academy of Science(A. Ya. Usikov 无线电物理与电子研究所 乌克兰科学院)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出加性多步马尔可夫链模型,用于近似大语言模型动态,通过分解条件概率减少高阶马尔可夫过程的组合爆炸问题。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13586 2026-03-06 cs.CL cs.AI cs.LG 86%

ReFusion: A Diffusion Large Language Model with Parallel Autoregressive Decoding

ReFusion:一种具有并行自回归解码的扩散大语言模型

Jia-Nan Li, Jian Guan, Wei Wu, Chongxuan Li

专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 ReFusion通过整合序列重组到因果注意框架中,实现并行解码和高效生成,显著提升性能和速度,缩小与传统自回归模型的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05738 2026-03-06 cs.SE 85%

MioHint: LLM-assisted Mutation for Whitebox API Testing

MioHint: 利用大语言模型进行白盒API测试

Jia Li, Jiacheng Shen, Yuxin Su, Michael R. Lyu

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 MioHint利用大语言模型提升白盒API测试效率,实现更高的代码覆盖和突变准确性

Comments Accepted by ICSE 2026 (research track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04549 2026-03-06 cs.AI cs.CL cs.MA 81%

Adaptive Memory Admission Control for LLM Agents

自适应记忆准入控制用于大语言模型代理

Guilin Zhang, Wei Jiang, Xiejiashan Wang, Aisha Behr, Kai Zhao, Jeffrey Friedman, Xu Chu, Amine Anoun

机构 * Workday AI

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 提出自适应记忆准入控制框架,通过分解记忆价值因素提升大语言模型代理的长期记忆管理效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15654 2026-03-06 cs.CR cs.AI 79%

Zombie Agents: Persistent Control of Self-Evolving LLM Agents via Self-Reinforcing Injections

僵尸代理:通过自我强化注入实现自我演化大语言模型代理的持续控制

Xianglin Yang, Yufei He, Shuo Ji, Bryan Hooi, Jin Song Dong

机构 * School of Computing National University of Singapore(计算学院新加坡国立大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 研究提出僵尸代理攻击,通过自我强化注入实现对自我演化大语言模型代理的持续控制,揭示内存演化可将一次间接注入转化为持久妥协,表明单一会话提示过滤防御不足。

Comments Published as a workshop paper in Lifelong Agent @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22503 2026-03-06 cs.LG cond-mat.mtrl-sci cs.AI cs.NE 79%

LLEMA: Evolutionary Search with LLMs for Multi-Objective Materials Discovery

LLEMA:基于LLM的多目标材料发现进化搜索

Nikhil Abhyankar, Sanchit Kabra, Saaketh Desai, Chandan K. Reddy

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系) Center of Integrated Nanotechnologies, Sandia National Laboratories(桑迪亚国家实验室集成纳米技术中心)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LLEMA结合大语言模型与进化规则,通过多目标优化提升材料发现效率,实现高命中率和稳定性质的候选材料生成。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20685 2026-03-06 cs.CE 78%

GIT-BO: High-Dimensional Bayesian Optimization with Tabular Foundation Models

GIT-BO:基于表格基础模型的高维贝叶斯优化

Rosen Ting-Ying Yu, Cyril Picard, Faez Ahmed

专题命中 长上下文与记忆 :foundation model(title,abstract)

AI总结 GIT-BO通过结合表格基础模型和主动子空间机制,在高维空间中实现更高效的贝叶斯优化,优于现有GP方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04814 2026-03-06 cs.CL 77%

Beyond the Context Window: A Cost-Performance Analysis of Fact-Based Memory vs. Long-Context LLMs for Persistent Agents

超越上下文窗口:基于事实的记忆与长上下文LLM在持久代理中的成本性能分析

Natchanon Pollertlam, Witchayut Kornsuwannawit

机构 * Bricks Technology

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了基于事实的记忆系统与长上下文LLM在持久代理中的性能,发现记忆系统在成本上更具优势,尤其在长上下文下更经济。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04460 2026-03-06 cs.LG cs.AI 73%

VSPrefill: Vertical-Slash Sparse Attention with Lightweight Indexing for Long-Context Prefilling

VSPrefill:用于长上下文预填充的垂直斜线稀疏注意力与轻量级索引

Chen Guanzhong

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VSPrefill通过轻量级索引和垂直斜线结构提升长上下文预填充效率,实现高精度与高速度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04454 2026-03-06 cs.CL cs.AI 73%

Query Disambiguation via Answer-Free Context: Doubling Performance on Humanity's Last Exam

通过无答案上下文进行查询消歧:在人类最后一场考试中性能翻倍

Michael Majurski, Cynthia Matuszek

机构 * National Institute of Standards and Technology(国家标准与技术研究院) University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 长上下文与记忆 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过无答案上下文重写问题以减少歧义,显著提升模型在Humanity's Last Exam上的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05451 2026-03-06 cs.CL 70%

FlashAttention-4: Algorithm and Kernel Pipelining Co-Design for Asymmetric Hardware Scaling

FlashAttention-4:异构硬件扩展下的算法与内核流水线协同设计

Ted Zadouri, Markus Hoehnerbach, Jay Shah, Timmy Liu, Vijay Thakkar, Tri Dao

机构 * Princeton University(普林斯顿大学) Meta Colfax Research(Colfax研究公司) NVIDIA(NVIDIA公司) Georgia Tech(佐治亚理工学院) Together AI

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FlashAttention-4通过异构硬件扩展下的算法与内核流水线协同设计,提升B200 GPU上的注意力计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏