arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-04 至 2026-06-04 共收录 358 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 28 篇

2510.15416 2026-06-04 cs.AI 57%

Adaptive Minds: Empowering Agents with LoRA-as-Tools

自适应心智:将LoRA作为工具赋予智能体能力

Pavan C Shekar, Aswanth Krishnan

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出将LoRA适配器作为可调用工具的框架,通过路由和智能体推理聚合多个专业适配器的优势,在30个适配器库中达到98.3%路由准确率,并在九类任务上显著提升性能。

Comments 13 pages, 3 figures, 9 tables. ICML 2026 CompLearn Workshop camera-ready (non-archival). Code: https://github.com/qpiai/adaptive-minds

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09242 2026-06-04 cs.CV 50%

When Detectors Forget Forensics: Blocking Semantic Shortcuts for Generalizable AI-Generated Image Detection

当检测器遗忘取证:阻断语义捷径以实现可泛化的AI生成图像检测

Chao Shuai, Shaojing Fan, Chenlin Zou, Bin Gong, Weichen Lian, Xiuli Bi, Zhenguang Liu, Zhongjie Ba, Kui Ren

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) National University of Singapore(新加坡国立大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出几何语义解耦(GSD)框架,通过抑制语义主导方向来促进不变取证表征,从而解决预训练视觉基础模型在AI生成图像检测中因语义回退导致的泛化不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12215 2026-06-04 cs.RO 50%

LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion

LDA-1B:通过通用具身数据摄取扩展潜动力学动作模型

Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen, Jiazhao Zhang, Yifei Dong, Wenbo Cui, Senmao Qi, Shuo Wang, Yixin Zheng, Mi Yan, Xuesong Shi, Haoran Li, Dongbin Zhao, Ming-Yu Liu, Zhizheng Zhang, Li Yi, Yizhou Wang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化研究所) BAAI(北京人工智能研究院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) NVIDIA

专题命中 指令微调 :foundation model(abstract)

AI总结 提出LDA-1B机器人基础模型,通过统一格式的具身交互数据集EI-30k和结构化DINO潜空间中的动力学学习,联合建模动力学、策略和视觉预测,在接触丰富、灵巧和长时任务上分别提升高达21%、48%和23%。

Comments Accepted at RSS 2026, Project Page:https://pku-epic.github.io/LDA

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 19 篇

2606.04929 2026-06-04 cs.LG cs.CR 95%

Sequential Data Poisoning in LLM Post-Training

LLM后训练中的顺序数据投毒

Jack Sanderson, Yihan Wang, Xiaoqian Lu, Gautam Kamath, Yiwei Lu

机构 * University of Chicago(芝加哥大学) University of Waterloo(滑铁卢大学) University of Ottawa(渥太华大学) Vector Institute(向量研究所)

专题命中 后训练与偏好优化 :LLM(title,title_cn);SFT(summary_cn,abstract);post-training(title,abstract);RLHF(abstract,abstract_cn)

AI总结 提出顺序数据投毒威胁模型,研究多个攻击者在LLM后训练不同阶段(SFT和偏好数据)分别投毒,发现单一攻击者看似威胁小但多阶段协作会暴露真实漏洞,且不同管道中贡献呈加性或互补性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04816 2026-06-04 cs.AI cs.LG 91%

Beyond Objective Equivalence: Constraint Injection for LLM-Based Optimization Modeling on Vehicle Routing Problems

超越目标等价性:基于LLM的车辆路径问题优化建模的约束注入

Xizi Luo, Changhong He, Dongdong Geng, Chenggong Shi, Yu Mei

机构 * Beihang University(北京航空航天大学) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM在约束密集的运筹问题中可能添加虚假约束或遗漏必要约束的问题,提出约束注入方法,结合差分测试形成双重验证器,并在车辆路径问题上验证其有效性。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03542 2026-06-04 cs.CL cs.LG 91%

Can Large Language Models Generalize Procedures Across Representations?

大型语言模型能否跨表示泛化过程?

Fangru Lin, Valentin Hofmann, Xingchen Wan, Weixing Wang, Zifeng Ding, Anthony G. Cohn, Janet B. Pierrehumbert

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 研究大型语言模型在代码、图与自然语言等不同表示间泛化过程的能力,提出两阶段强化学习课程来弥合差距。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01143 2026-06-04 cs.DC 90%

Schedule-Level Shared-Prefix Reuse for LLM RL Training

面向LLM强化学习训练的调度级共享前缀复用

Pengbo Li, Feiyuan Zhang, Guangming Sheng, Guangxin He, Di Chai, Ziniu Li, Taiqiang Wu, Wenyu Mao, Binhang Yuan, Kai Chen

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract)

AI总结 针对GRPO/PPO式LLM后训练中多轨迹共享前缀导致重复计算的问题,提出调度级复用机制,通过解耦前缀与后缀计算实现最高4.395倍加速和59.1%的峰值HBM降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05881 2026-06-04 cs.CL 89%

Confidence Before Answering: A Paradigm Shift for Efficient LLM Uncertainty Estimation

回答前先置信:高效LLM不确定性估计的范式转变

Changcheng Li, Jiancan Wu, Hengheng Zhang, Zhengsu Chen, Guo An, Junxiang Qiu, Xiang Wang, Qi Tian

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Inc.(华为公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CoCA框架,通过GRPO强化学习联合优化置信度校准与答案准确性,实现回答前输出置信度,提升不确定性估计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04807 2026-06-04 cs.AI cs.CL cs.CY cs.LG 86%

BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization

BiasGRPO:通过组相对策略优化在高方差奖励景观中稳定偏差缓解

Saket Reddy, Ke Yang, ChengXiang Zhai

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出BiasGRPO框架,利用组相对策略优化(GRPO)通过归一化组内奖励来稳定大语言模型的社会偏差缓解,优于DPO和PPO。

Comments Accepted to Findings of the ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21917 2026-06-04 cs.LG cs.AI econ.EM stat.ML 85%

Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model

半参数偏好优化:你的语言模型秘密地是一个单索引模型

Nathan Kallus

机构 * Netflix & Cornell University(Netflix与康奈尔大学)

专题命中 后训练与偏好优化 :language model(title);preference optimization(title);分类 cs.AI、cs.LG

AI总结 本文提出半参数偏好优化方法,通过放宽偏好与潜在奖励之间的链接函数假设,在未知且无限制的链接函数下进行策略对齐,并证明策略类的可实现性诱导出半参数单索引二元选择模型,直接学习策略并给出链接无关的收敛保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03376 2026-06-04 cs.CV cs.AI cs.CL cs.LG 85%

P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization

P²-DPO:通过校准直接偏好优化在感知处理中锚定幻觉

Ruipeng Zhang, Zhihao Li, Haozhang Yuan, C. L. Philip Chen, Tong Zhang

机构 * Guangdong Provincial Key Laboratory of Computational AI Models and Cognitive Intelligence, School of Computer Science & Engineering, South China University of Technology(广东省计算人工智能模型与认知智能重点实验室,计算机科学与工程学院,华南理工大学) Pazhou Lab, Guangzhou, China(琶洲实验室,广州,中国) Engineering Research Center of the Ministry of Education on Health Intelligent Perception and Paralleled Digital-Human, Guangzhou, China(教育部健康智能感知与并行数字人工程研究中心,广州,中国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大型视觉语言模型中的幻觉问题,提出P²-DPO训练范式,通过模型自生成偏好对和校准损失,直接优化感知瓶颈和视觉鲁棒性,无需昂贵人工反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04284 2026-06-04 cs.LG cs.AI cs.CL 83%

Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling

稀疏混合专家奖励模型学习可解释且专业化的专家用于个性化偏好建模

Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Ji-Ung Lee, Soyoung Oh, Isabel Valera, Vera Demberg

机构 * Saarland University(萨尔兰大学) Independent Researcher(独立研究者) Bielefeld University(比勒菲尔德大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出稀疏混合专家奖励模型,通过稀疏路由和专家多样性训练,从二元偏好数据中学习可解释的专家模式,提升个性化偏好建模的测试时适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04396 2026-06-04 cs.CL 83%

Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models

读取轨迹,引导路径:面向扩散语言模型的轨迹感知强化学习

Anant Khandelwal, Manish Gupta

机构 * Microsoft AI, India(微软印度人工智能)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出CAPR算法,通过缓存轨迹状态和块级价值头,利用去噪轨迹提供类似树搜索的细粒度监督,在降低计算成本的同时提升扩散语言模型的强化学习效果。

Comments 19 pages, 10 figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02521 2026-06-04 cs.LG cs.CV 79%

Drifting Preference Optimization for One-Step Generative Models

一步生成模型的漂移偏好优化

Zhou Jiang, Yandong Wen, Zhen Liu

机构 * Westlake University(西湖大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 提出 DrPO 方法,通过在线采样和排序构建非参数偶极偏好场及参考漂移,实现一步式生成模型的无梯度偏好微调。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15354 2026-06-04 cs.LG stat.ML 79%

Post-Training Corrections for Improved Time-Series Forecasting

人在回路的自适应优化用于改进时间序列预测

Hamza Cherkaoui, Malik Tiomoko, Giuseppe Paolo, Zhang Yili, Yu Meng, Zhang Keli, Hafiz Tiomoko Ali

机构 * SAMOVAR Télécom SudParis Institut Polytechnique de Paris(Telecom SudParis高等研究院) Noah Ark Lab(Noah Ark实验室) Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 提出一种无需重训练或修改架构的轻量级后训练自适应优化框架,通过强化学习、上下文赌博机或遗传算法自动学习表达性变换来校正模型输出,并支持人类专家通过自然语言引导校正,从而在多个基准上以最小计算开销持续提升预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30021 2026-06-04 cs.CL 77%

Recovering Diversity Without Losing Alignment: A DPO Recipe for Post-Trained LLMs

在不损失对齐的情况下恢复多样性:面向后训练大语言模型的DPO配方

Vinay Samuel, Yapei Chang, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL

AI总结 提出REDIPO数据构建流程,通过离线DPO从基础模型生成中恢复多样性答案,同时保持指令模型的对齐性能。

Comments Under Review. 26 pages, 3 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04889 2026-06-04 cs.CL 70%

GRAIL: Gradient-Reweighted Advantages for Reinforcement Learning with Verifiable Rewards

GRAIL: 基于梯度重加权优势的可验证奖励强化学习

Tej Deep Pala, Vernon Toh, Soujanya Poria

机构 * DeCLaRe Lab, Nanyang Technological University(DeCLaRe实验室,南洋理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对强化学习中统一优势分配导致梯度信号稀释的问题,提出基于梯度激活显著性的令牌级优势重加权方法GRAIL,无需过程级监督即可提升推理对齐,在多个模型上平均准确率提升3.60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-06-04 cs.CL 70%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07408 2026-06-04 cs.CL cs.LG 62%

Outcome-Grounded Advantage Reshaping for Fine-Grained Credit Assignment in Mathematical Reasoning

基于结果锚定的优势重塑用于数学推理中的细粒度信用分配

Ziheng Li, Liu Kang, Feng Xiao, Luxi Xing, Qingyi Si, Zhuoran Li, Weikang Gong, Deqing Yang, Yanghua Xiao, Hongcheng Guo

机构 * Fudan University(复旦大学) XingYun lab, HUJING Digital Media & Entertainment Group(星云实验室,HUJING数字媒体与娱乐集团) University of Science and Technology Beijing(北京科技大学) Chinese Academy of Sciences(中国科学院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 提出结果锚定优势重塑(OAR),通过两种策略(OAR-P和OAR-G)实现细粒度信用分配,显著提升GRPO在数学推理中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.09673 2026-06-04 cs.AI cs.LG cs.SY eess.SY 62%

Deep Q-Learning with Q-Matrix Transfer Learning for Novel Fire Evacuation Environment

基于Q矩阵迁移学习的深度Q学习用于新型火灾疏散环境

Jivitesh Sharma, Per-Arne Andersen, Ole-Chrisoffer Granmo, Morten Goodwin

机构 * Centre for Artificial Intelligence Research(人工智能研究中心) Department of Information and Communication Technology(信息与通信技术系) University of Agder, Norway(阿格德大学,挪威)

专题命中 后训练与偏好优化 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于Q矩阵迁移学习的深度Q学习方法,用于解决紧急疏散问题,通过预训练DQN网络权重以获取最短路径信息,并在复杂真实环境中实现最优疏散路径。

Comments 21 pages, 14 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22240 2026-06-04 cs.AI 57%

Unlocking Proactivity in Task-Oriented Dialogue

解锁任务导向型对话中的主动性

Azure Zhang, Ning Gao, Yuqin Dai, Ruiyuan Wu, Jinpeng Wang, Rena Wei Gao, Bingdong Tan, Shuzheng Gao, Zongjie Li, Chaozheng Wang

机构 * Keeta AI, Meituan(Keeta AI,美团) Independent Researcher(独立研究者) CUHK(香港中文大学) HKUST(香港科技大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);分类 cs.AI

AI总结 针对任务导向型对话中主动性问题,提出认知用户模拟器和模拟器诱导的非对称视角策略优化,通过建模用户潜在关注实现主动对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19294 2026-06-04 cs.RO cs.AI 57%

DEFLECT: Temporal Counterfactual Preference Learning for Delay-Robust Asynchronous VLAs

DEFLECT: 面向延迟鲁棒异步VLA的时间反事实偏好学习

Yixiang Zhu, Yonghao Chen, Zijie Yang, Yusong Hu, Xinyu Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) One Robotics

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 针对异步视觉-语言-动作(VLA)策略中陈旧观测导致的预测-执行不匹配问题,提出离线后训练框架DEFLECT,通过反事实偏好监督学习偏好与执行时间对齐的动作,无需人工标注、在线部署或架构修改,显著提升高延迟下的任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 19 篇

2510.17281 2026-06-04 cs.LG cs.AI cs.IR 90%

MemoryBench: A Benchmark for Memory and Continual Learning in LLM Systems

MemoryBench:面向LLM系统的记忆与持续学习基准

Qingyao Ai, Yichen Tang, Changyue Wang, Jianming Long, Weihang Su, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出用户反馈模拟框架及跨领域、多语言、多任务类型的综合基准MemoryBench,评估LLM系统从累积用户反馈中持续学习的能力,实验表明现有方法效果与效率均不理想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04197 2026-06-04 cs.MA cs.CL cs.SI physics.soc-ph 90%

Exploring the Topology and Memory of Consensus: How LLM Agents Agree, Fragment, or Settle When Forming Conventions

探索共识的拓扑与记忆:LLM智能体在形成惯例时如何达成一致、分裂或稳定

Aliakbar Mehdizadeh, Martin Hilbert

机构 * Department of Communication, University of California, Davis(通信系,加州大学戴维斯分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 研究LLM多智能体系统中记忆深度与通信拓扑的交互作用,发现记忆对协调的影响符号会因网络中心化程度而反转,并揭示了记忆介导的速度-统一性权衡。

Comments Submitted to the Journal of Artificial Societies and Social Simulation (JASSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04141 2026-06-04 cs.CR cs.AI 90%

Caught in the Act(ivation): Toward Pre-Output and Multi-Turn Detection of Credential Exfiltration by LLM Agents

当场抓获(激活):面向LLM智能体的凭证泄露预输出和多轮检测

Kargi Chauhan, Pratibha Revankar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 研究通过激活探针、蜜令令牌和累积信息流追踪三种互补防御方法,在预输出和多轮对话中检测LLM智能体的凭证泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02655 2026-06-04 cs.CY cs.AI 90%

BioBlue: Systematic runaway-optimiser-like LLM failure modes on biologically and economically aligned AI safety benchmarks for LLMs with simplified observation format

BioBlue:在生物与经济对齐的AI安全基准上,具有简化观察格式的LLM的系统性类失控优化失败模式

Roland Pihlakas, Sruthi Susan Kuriakose

机构 * Independent researcher(独立研究者) Three Laws research collaboration(Three Laws研究合作) Rakvere, Estonia(爱沙尼亚拉克雷市)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过长期控制环境测试LLM,发现尽管LLM能理解目标,但在多目标场景下会系统性偏离至单目标、无界优化行为,表现出类似失控优化的失败模式。

Comments 27 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11166 2026-06-04 cs.CL cs.AI 88%

SoLoPO: Unlocking Long-Context Capabilities in LLMs via Short-to-Long Preference Optimization

SoLoPO: 通过短到长偏好优化解锁大语言模型的长上下文能力

Huashan Sun, Shengyi Liao, Yansen Han, Yu Bai, Yang Gao, Cheng Fu, Weizhou Shen, Fanqi Wan, Ming Yan, Ji Zhang, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 长上下文与记忆 :preference optimization(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出SoLoPO框架,将长上下文偏好优化解耦为短上下文偏好优化和短到长奖励对齐,以提升大语言模型的长上下文利用能力。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04780 2026-06-04 cs.CL 87%

PersonaTree: Structured Lifecycle Memory for Person Understanding in LLM Agents

PersonaTree: 面向LLM智能体人物理解的结构化生命周期记忆

Yubo Hou, Jingwei Song, Hongbo Zhang, Zhisheng Chen, Bang Xiao, Tao Wan, Zengchang Qin

机构 * School of ASEE, Beihang University, Beijing, China(北京航空航天大学航空科学与工程学院) The University of Hong Kong, Hong Kong, China(香港大学) Peking University, Beijing, China(北京大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) School of BME, Beihang University, Beijing, China(北京航空航天大学生物医学工程学院) CAIR and CECS, VinUniversity, Hanoi, Vietnam(越南河内 Vin 大学 CAIR 和 CECS)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 提出PersonaTree,一种结构化生命周期记忆框架,通过三级人物树和显式支持路径,将交互证据抽象为人物理解,在多个基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01146 2026-06-04 cs.AI 84%

PersistBench: When Should Long-Term Memories Be Forgotten by LLMs?

PersistBench: 大型语言模型何时应忘记长期记忆?

Sidharth Pulipaka, Oliver Chen, Manas Sharma, Taaha S Bajwa, Vyas Raina, Ivaxi Sheth

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出 PersistBench 基准,评估 LLM 长期记忆带来的跨域泄露和记忆诱导的谄媚安全风险,发现主流模型失败率高达 53% 和 97%。

Comments 76 pages, 34 figures, ICML (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04668 2026-06-04 cs.CR cs.AI cs.CL 82%

Topology Matters: Measuring Memory Leakage in Multi-Agent LLMs

拓扑结构至关重要:多智能体大语言模型中的内存泄漏测量

Jinbo Liu, Defu Cao, Yifei Wei, Tianyao Su, Yuan Liang, Yushun Dong, Yan Liu, Yue Zhao, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学) Florida State University(佛罗里达州立大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出MAMA框架,通过控制图拓扑结构评估多智能体LLM系统中的内存泄漏,发现密集连接、短攻击距离和高中心性增加泄漏,并给出稀疏或层次化拓扑的设计建议。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏