arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 40 篇

2605.10663 2026-05-12 cs.AI 81%

Evolving-RL: End-to-End Optimization of Experience-Driven Self-Evolving Capability within Agents

Evolving-RL: 端到端优化经验驱动的自我进化能力

Zhiyuan Fan, Wenwei Jin, Feng Zhang, Bin Li, Yihong Dong, Yao Hu, Jiawei Li

机构 * Xiaohongshu Inc.(小红书公司) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出Evolving-RL框架,通过联合优化经验提取与利用能力,提升大模型在新型任务中的适应能力,实验显示在ALFWorld和Mind2Web任务中取得显著性能提升。

Comments 17pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01698 2026-05-12 cs.CL cs.LG 81%

Restoring Exploration after Post-Training: Latent Exploration Decoding for Large Reasoning Models

训练后探索恢复:大型推理模型的潜在探索解码

Wenhui Tan, Fiorenzo Parascandolo, Enver Sangineto, Jianzhong Ju, Zhenbo Luo, Qian Cao, Rita Cucchiara, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司北京MiLM Plus团队) University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米莉亚大学) University of Pisa, Italy(比萨大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Latent Exploration Decoding方法,通过累积中间后验并选择熵最大配置来提升推理模型的pass@1和pass@16准确率,同时增强强化学习中的探索能力。

Comments Project Page: https://github.com/AlbertTan404/LED

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19471 2026-05-12 cs.LG cs.AI 81%

Improving Inverse Folding for Peptide Design with Diversity-regularized Direct Preference Optimization

通过多样性正则化的直接偏好优化改进肽设计的反向折叠

Ryan Park, Darren J. Hsu, C. Brian Roland, Maria Korshunova, Chen Tessler, Shie Mannor, Olivia Viessmann, Bruno Trentini

机构 * Stanford University(斯坦福大学) NVIDIA(英伟达) Technion - Israel Institute of Technology(技术学院-以色列理工学院) Flagship Pioneering(旗领先锋) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过改进的直接偏好优化方法,结合多样性正则化和领域特定先验,提升肽设计中反向折叠模型的序列多样性和结构一致性,实验表明在OpenFold生成结构条件下,模型在结构相似度上取得显著提升。

Comments Preprint. 10 pages plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09158 2026-05-12 cs.CV 80%

FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO

FaVChat: 基于数据高效GRPO的层次提示-查询引导的面部视频理解

Fufangchen Zhao, Songbai Tan, Xuerui Qiu, Linrui Xun, Wenhao Jiang, Jinkai Zheng, Hehe Fan, Jian Gao, Danfeng Yan, Ming Li

机构 * State Key Laboratory of Networking and Switching Technology, BUPT(北京邮电大学网络与交换技术国家重点实验室) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Central South University(中南大学) Zhejiang University(浙江大学) College of communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 FaVChat通过层次化提示引导框架提取面部动态细节信息,结合数据高效GRPO策略提升学习效率,实现在面部视频理解任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11734 2026-05-12 cs.RO cs.AI 79%

SCORP: Scene-Consistent Multi-agent Diffusion Planning with Stable Online Reinforcement Post-Training for Cooperative Driving

SCORP:具有稳定在线强化学习后训练的场景一致多智能体扩散规划用于协作驾驶

Haojie Bai, Aimin Li, Ruoyu Yao, Xiongwei Zhao, Tingting Zhang, Xing Zhang, Lin Gao, and Jun Ma

机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Middle East Technology University (METU)(中东技术大学) Robotics and Autonomous Systems Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统方向) School of Computer Science and Technology, Qinghai University(青海大学计算机科学与技术学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 SCORP通过场景条件多智能体去噪架构和两层马尔可夫决策过程提升多智能体协作驾驶的场景一致性和效率,实验表明其在安全性和效率指标上优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05946 2026-05-12 cs.LG stat.ML 79%

f-GRPO and Beyond: Divergence-Based Reinforcement Learning Algorithms for General LLM Alignment

f-GRPO 与 beyond:基于发散性的强化学习算法用于通用大语言模型对齐

Rajdeep Haldar, Lantao Mei, Guang Lin, Yue Xing, Qifan Song

机构 * Department of Statistics, Purdue University(普渡大学统计学系) Department of Statistics, Michigan State University(密歇根州立大学统计学系)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.LG

AI总结 本文提出f-GRPO和f-HAL算法,通过发散性估计提升大语言模型对齐效果,在数学推理任务中改进GRPO并缓解奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17879 2026-05-12 cs.LG cs.SD 79%

Generative Adversarial Post-Training Mitigates Reward Hacking in Live Human-AI Music Interaction

生成对抗式后训练缓解实时人机音乐交互中的奖励黑客

Yusong Wu, Stephen Brade, Aleksandra Teng Ma, Tia-Jane Fowler, Enning Yang, Berker Banar, Aaron Courville, Natasha Jaques, Cheng-Zhi Anna Huang

机构 * Mila, Quebec Artificial Intelligence Institute, Université de Montréal(蒙特利尔大学人工智能研究所,魁北克机器学习研究院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) Massachusetts Institute of Technology(麻省理工学院) Georgia Institute of Technology(佐治亚理工学院) University of Washington(华盛顿大学) McGill University(麦吉尔大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 本文提出一种对抗训练方法,通过政策生成轨迹缓解生成序列模型后训练中的奖励黑客问题,提升音乐伴奏的多样性与和谐性。

Comments v3: fix the Figure numbering bugs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01643 2026-05-12 cs.LG cs.AI 79%

AI Alignment via Incentives and Correction

通过激励与修正实现AI对齐

Rohit Agarwal, Joshua Lin, Mark Braverman, Elad Hazan

机构 * Princeton University(普林斯顿大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10937 2026-05-12 cs.CV 78%

Power Reinforcement Post-Training of Text-to-Image Models with Super-Linear Advantage Shaping

文本到图像模型的强化后训练与超线性优势塑造

Haoyuan Sun, Jing Wang, Yuxin Song, Yu Lu, Bo Fang, Yifu Luo, Jun Yin, Pengyu Zeng, Miao Zhang, Tiantian Zhang, Xueqian Wang, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) Baidu Inc.(百度公司) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Jimei University(集美大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 本文提出超线性优势塑造方法,通过信息几何视角优化文本到图像模型的后训练过程,提升训练效率和生成质量,减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08703 2026-05-12 cs.AI cs.CL cs.CV cs.LG 78%

RewardHarness: Self-Evolving Agentic Post-Training

RewardHarness: 自我进化代理的后训练

Yuxuan Zhang, Penghui Du, Bo Li, Cong Wei, Junwen Miao, Huaisong Zhang, Songcheng Cai, Yubo Wang, Dongfu Jiang, Yuyu Zhang, Ping Nie, Wenhu Chen, Changqian Yu, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Kolors Team, Kuaishou Technology(快手团队) Carnegie Mellon University(卡内基梅隆大学) University of Waterloo(滑铁卢大学) Etude AI Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.AI、cs.LG

AI总结 RewardHarness通过自我进化代理框架,利用少量人类偏好示例迭代优化工具库,实现高效图像编辑评估,准确率达47.4%,超越GPT-5 5.3个百分点。

Comments Project page: https://rewardharness.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10863 2026-05-12 cs.CL 77%

DGPO: Beyond Pairwise Preferences with Directional Consistent Groupwise Optimization

DGPO: 超越成对偏好与方向一致的组级优化

Mengyi Deng, Zhiwei Li, Xin Li, Tingyu Zhu, Yulan Yuan, Zhijiang Guo, Wei Wang

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou), China(香港科学与技术大学(广州)信息中心,中国) The Hong Kong University of Science and Technology, Hong Kong SAR(香港科学与技术大学,香港特别行政区)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文提出DGPO框架,通过组级监督信号和多候选比较建模方向一致性,提升偏好优化的准确性和多样性,实验显示在多个数据集上平均提升3.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09959 2026-05-12 cs.LG cs.AI cs.CL cs.ET 75%

G-Zero: Self-Play for Open-Ended Generation from Zero Data

G-Zero:从零数据开始的自主开放生成自我学习

Chengsong Huang, Haolin Liu, Tong Zheng, Runpeng Dai, Langlin Huang, Jinyuan Li, Zongxia Li, Zhepei Wei, Yu Meng, Jiaxin Huang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Virginia(弗吉尼亚大学) University of Maryland(马里兰大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 G-Zero通过无验证器的共进化框架实现自主改进,利用Hint-δ内在奖励量化生成模型在无辅助响应与带提示响应间的预测偏移,通过GRPO训练提出者模型持续针对生成器的盲区,同时通过DPO优化生成器内部化提示引导的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05967 2026-05-12 cs.AI cs.LG stat.ML 73%

Preference Learning for AI Alignment: a Causal Perspective

偏好学习用于AI对齐:一种因果视角

Katarzyna Kobalczyk, Mihaela van der Schaar

机构 * Department of Applied Mathematics and Theoretical Physics(应用数学与理论物理系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从因果视角出发,探讨了基于偏好数据的奖励建模在对齐大语言模型与人类价值观中的关键作用,提出因果工具箱以解决因果误识别、偏好异质性和用户特定因素的混淆问题,并提出未来研究的方向。

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09548 2026-05-12 cs.CL 70%

Crosslingual On-Policy Self-Distillation for Multilingual Reasoning

跨语言在线策略自蒸馏用于多语言推理

Yihong Liu, Raoyuan Zhao, Michael A. Hedderich, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出COPSD方法,通过将高资源语言的推理行为迁移到低资源语言,提升多语言推理能力,实验显示其在17种低资源非洲语言上表现优异,优于GRPO。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09291 2026-05-12 cs.LG stat.AP 70%

dFlowGRPO: Rate-Aware Policy Optimization for Discrete Flow Models

dFlowGRPO:面向离散流模型的速率感知策略优化

Zhengyan Wan, Yidong Ouyang, Panwen Hu, Qiang Sun

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) East China Normal University(东华大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Toronto(多伦多大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出dFlowGRPO框架,用于离散流模型的强化学习,支持多种概率路径和非掩码源分布,通过轨迹概率推导和去噪马尔可夫决策过程,提升文本到图像生成和多模态理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08354 2026-05-12 cs.AI 70%

Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria

Auto-Rubric as Reward:从隐含偏好到显式多模态生成标准

Juanxi Tian, Fengyuan Liu, Jiaming Han, Yilei Jiang, Yongliang Wu, Yesheng Liu, Haodong Li, Furong Xu, Wanhua Li

机构 * Nanyang Technological University(南洋理工大学) Ant Group(蚂蚁集团) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) UIUC(伊利诺伊大学香槟分校)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Auto-Rubric as Reward框架,通过显式标准分解替代隐含权重优化,提升多模态生成模型对人类偏好的对齐效果,实验证明显式标准能更可靠地实现数据高效对齐。

Comments 28 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10899 2026-05-12 cs.CL cs.LG 62%

RubricEM: Meta-RL with Rubric-guided Policy Decomposition beyond Verifiable Rewards

RubricEM: 通过规则引导的策略分解实现超越可验证奖励的元强化学习

Gaotang Li, Bhavana Dalvi Mishra, Zifeng Wang, Jun Yan, Yanfei Chen, Chun-Liang Li, Long T. Le, Rujun Han, George Lee, Hanghang Tong, Chen-Yu Lee, Tomas Pfister

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Cloud AI Research(谷歌云人工智能研究)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.LG

AI总结 RubricEM通过规则引导的策略分解和反思元策略进化,解决深度研究代理在不可验证奖励下的训练问题,实现长周期优化和可重用经验积累。

Comments 63 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07833 2026-05-12 cs.LG cs.AI 62%

MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation

MURPHY:具有回顾性信用分配的反馈感知GRPO用于多轮代码生成

Chanakya Ekbote, Vijay Lingam, Sujay Sanghavi, Jun Huan, Behrooz Omidvar-Tehrani, Anoop Deoras, Stefano Soatto

机构 * Massachusetts Institute of Technology(麻省理工学院) AWS AI(AWS人工智能)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 MURPHY通过构建反馈条件化的rollout树,实现多轮自修正代码生成,采用最大奖励和平均奖励策略,并引入post-rollout剪枝机制,提升多轮优化效率。

Comments 21 pages, 2 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10784 2026-05-12 cs.LG 57%

MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization

MASS-DPO:多负样本主动采样用于直接策略优化

Rohan Surana, Xintong Li, Sheldon Yu, Yiran Jenny Shen, Chuhan Wang, Tong Yu, Prithviraj Ammanabrolu, Jingbo Shang, Julian McAuley, Junda Wu

机构 * UC San Diego(UC圣地亚哥大学) Adobe Research(Adobe研究院)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 MASS-DPO通过多负样本主动采样方法,在Plackett-Luce模型下扩展直接偏好优化,通过选择信息丰富的负样本子集提升策略更新效率,减少冗余梯度,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09422 2026-05-12 cs.CL cs.CV 57%

Perception Without Engagement: Dissecting the Causal Discovery Deficit in LMMs

无参与的感知:LMMs中因果发现缺陷的剖析

Jiafeng Liang, Zhihao Zhu, Zihan Zhang, Baoqi Ren, Shixin Jiang, Runxuan Liu, Tao Ren, Ming Liu, See-Kiong Ng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) National University of Singapore(新加坡国立大学) Peking University(北京大学) Harvard University(哈佛大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 本文探讨了大型多模态模型在因果发现中的缺陷,提出ProCauEval评估协议和ADPO框架,通过扰动分析揭示模型在视觉和文本模态间的依赖关系,提升视觉推理能力。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03652 2026-05-12 cs.CV cs.AI 57%

AniMatrix: An Anime Video Generation Model that Thinks in Art, Not Physics

AniMatrix:一个以艺术而非物理思考的动画视频生成模型

Tencent HY Team

机构 * Tencent HY Team(腾讯HY团队)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 AniMatrix通过双通道条件机制和三步过渡,以艺术正确性替代物理正确性,实现动画视频生成,其在五个动画生产维度上获得专业动画师的认可。

Comments 37 pages, 1 main figure (qualitative comparison), 1 TikZ architecture diagram; technical report. Model weights and inference code to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00918 2026-05-12 cs.CV cs.AI 57%

Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards

通过内在自信心奖励改进文本到图像生成

Seungwook Kim, Minsu Cho

机构 * POSTECH(POSTECH大学) RLWRLD(RLWRLD实验室) GenGenAI(GenGenAI研究院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出SOLACE框架,通过模型自身输出的重建误差生成自信心信号,用于强化学习,提升生成内容的组成、文本渲染和文本图像对齐能力。

Comments 22 pages, accepted to CVPR 2026. Project page https://wookiekim.github.io/SOLACE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08873 2026-05-12 cs.LG stat.AP stat.ML 57%

CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization

CoDistill-GRPO:一种高效的群体相对策略优化共蒸馏方法

Soo Min Kwon, Ziteng Sun, Ananda Theertha Suresh, Himanshu Jain, Sanjiv Kumar

机构 * University of Michigan, Ann Arbor(密歇根大学,安阿伯分校) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.LG

AI总结 本文提出CoDistill-GRPO,通过同时训练大模型和小模型,利用精心设计的GRPO目标提升小模型性能,减少计算开销,在数学基准上显著优于标准GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08574 2026-05-12 cs.CV cs.LG 57%

Post-hoc Selective Classification for Reliable Synthetic Image Detection

事后选择性分类用于可靠合成图像检测

Kaixiang Zheng, Jacob H. Seidman

机构 * University of Waterloo(滑铁卢大学) Reality Defender

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 本文提出ReSIDe框架,通过改进选择性分类策略提升合成图像检测在协变量偏移下的可靠性,实验显示其在常见偏移下显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13224 2026-05-12 cs.CV cs.AI 57%

Visual-ERM: Reward Modeling for Visual Equivalence

视觉-ERM:用于视觉等价性的奖励建模

Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze Liang, Jiaqi Wang, Kai Chen, Dahua Lin, Yuhang Zang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) CUHK(香港中文大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 本文提出视觉-ERM模型,通过细粒度的视觉反馈提升视觉到代码任务的奖励学习效果,实验显示其在图表到代码、表格和SVG解析任务中均取得显著提升。

Comments Project: https://github.com/InternLM/Visual-ERM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01743 2026-05-12 cs.CV 50%

Action-Guided Attention for Video Action Anticipation

基于动作的注意力机制用于视频动作预见

Tsung-Ming Tai, Sofia Casarin, Andrea Pilzer, Werner Nutt, Oswald Lanz

机构 * Free University of Bozen-Bolzano(博泽自由大学) NVIDIA(NVIDIA公司)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出Action-Guided Attention机制,通过预测动作序列引导注意力,提升视频动作预见的泛化能力与可解释性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 43 篇

2605.08581 2026-05-12 cs.LG 91%

PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design

PRISM: 通过调度-内存协同设计实现快速在线LLM服务

Xingyu Qu, Tianhao Lin, Yiqi Li, Zhiyu Chen, Sheng Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PRISM通过协同设计调度与内存管理,优化LLM服务响应时间,减少TTFT并提升缓存命中率。

Comments 25 pages, 9 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09863 2026-05-12 cs.CR cs.AI cs.CL cs.IR cs.LG 90%

Nautilus Compass: Black-box Persona Drift Detection for Production LLM Agents

Nautilus Compass:生产LLM代理的黑盒人格漂移检测

Chunxiao Wang

机构 * Yiluo Technology Co., Ltd.(亿洛科技有限公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 Nautilus Compass通过提示文本层的余弦相似度检测生产编码代理的人格漂移,无需调用LLM提取事实,实现高效且低成本的代理记忆层。

Comments 19 pages, 6 figures. MIT-licensed code + reproduction scripts at github.com/chunxiaoxx/nautilus-compass

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08468 2026-05-12 cs.CL cs.AI cs.LG 90%

PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents

PYTHALAB-MERA:基于验证的内存、检索与接受控制用于冻结LLM编码代理

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University(PythaLab,伊兹密尔技术大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PYTHALAB-MERA通过轻量级外部控制器实现验证基础的内存管理、适应性检索与延迟信用分配,提升冻结本地模型在编码任务中的验证成功率。

Comments 28 pages, 4 figures, 7 tables; local CLI artifact evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08563 2026-05-12 cs.AI 90%

Why Retrying Fails: Context Contamination in LLM Agent Pipelines

为何重试失效:LLM代理流水线中的上下文污染

Zhanfu Yang

机构 * Department of Computer Science, Rutgers University(罗格斯大学计算机科学系)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究LLM代理在多步骤工具增强任务中重试失败的上下文污染问题,提出上下文污染重试模型(CCRM),推导了五个核心结果,包括成功概率公式、重试开销定理、预算分配定理等,并通过实验证明模型的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏