arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-23 至 2026-04-23 共收录 287 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 16 篇

2604.20146 2026-04-23 cs.IR cs.CL 70%

SAKE: Self-aware Knowledge Exploitation-Exploration for Grounded Multimodal Named Entity Recognition

SAKE: 为基于地面的多模态命名实体识别的自我意识知识利用-探索

Jielong Tang, Xujie Yuan, Jiayang Liu, Jianxing Yu, Xiao Dong, Lin Chen, Yunlai Teng, Shimin Di, Jian Yin

机构 * Sun Yat-sen University(中山大学) Shandong Normal University(山东师范大学) University of the Chinese Academy of Sciences(中国科学院大学) Southeast University(东南大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对开放世界社交媒体平台中长尾、快速演变和未见实体的挑战,SAKE提出一种端到端代理框架,通过自我意识推理和自适应搜索工具调用,结合内部知识利用和外部知识探索,提升多模态命名实体识别的精度与鲁棒性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20544 2026-04-23 cs.CV cs.AI 57%

Evian: Towards Explainable Visual Instruction-tuning Data Auditing

Evian:迈向可解释的视觉指令微调数据审计

Zimu Jia, Mingjie Xu, Andrew Estornell, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ByteDance Seed(字节跳动种子)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出Evian框架,通过分解评估模型响应的三大认知组件,解决数据审计中逻辑一致性与事实准确性不足的问题,验证高质量小规模数据优于大规模低质量数据。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14044 2026-04-23 cs.CV 50%

Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology

Weather-R1: 逻辑一致的强化微调用于气象中的多模态推理

Kaiyu Wu, Pucheng Han, Hualong Zhang, Naigeng Wu, Keze Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Meteorological Observatory(广东省气象局)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出Weather-R1,首个具备逻辑忠实性的气象多模态推理VLM,通过逻辑一致性奖励解决强化微调中的自相矛盾推理问题,并在WeatherQA基准上提升9.8个百分点。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 4851-4855

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 14 篇

2604.20705 2026-04-23 cs.CV 91%

SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models

SSL-R1: 多模态大语言模型的自监督视觉强化后训练

Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr, Federico Tombari, Bernt Schiele

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) VIA Research Center(VIA研究中心) Google(谷歌)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract)

AI总结 SSL-R1通过自监督学习生成可验证奖励,提升多模态大语言模型的推理能力,无需人工或外部监督,有效增强视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20685 2026-04-23 cs.LG 89%

MGDA-Decoupled: Geometry-Aware Multi-Objective Optimisation for DPO-based LLM Alignment

MGDA-Decoupled:基于几何的多目标优化用于基于DPO的LLM对齐

Andor Vári-Kakas, Ji Won Park, Natasa Tagasovska

机构 * Prescient Design, CS CoE, Genentech | Roche(预见设计,计算机科学学院,基因泰克 | 罗氏)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MGDA-Decoupled算法,通过几何方法在DPO框架内实现更公平的多目标优化,实验显示其在UltraFeedback数据集上表现最优。

Comments Accepted to the Algorithmic Fairness Across Alignment Procedures and Agentic Systems Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12817 2026-04-23 cs.CL cs.AI cs.CY 86%

From Noise to Signal to Selbstzweck: Reframing Human Label Variation in the Era of Post-training in NLP

从噪声到信号到自我目的:在NLP后训练时代的重新框架化人类标签变异

Shanshan Xu, Santosh T. Y. S. S, Barbara Plank

机构 * Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系) Faculty of Law, University of Copenhagen, Denmark(丹麦哥本哈根大学法学院) Amazon(亚马逊) LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学及慕尼黑机器学习中心(MCML))

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨人类标签变异在NLP后训练时代的重要性,提出将其作为内在价值自我目的进行保护,以提升模型鲁棒性和社会技术安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13818 2026-04-23 cs.LG cs.AI cs.CL 85%

Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning

并非所有回放都有效:在大语言模型强化学习中的回放下采样

Yixuan Even Xu, Yash Savani, Fei Fang, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PODS方法,通过下采样回放来减少策略更新成本,提升学习效率。

Comments 19 pages, 10 figures, TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16399 2026-04-23 cs.LG math.OC 83%

A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning

一种用于双层强化学习的无Hessian演员-评论员算法及其在大语言模型微调中的应用

Sihan Zeng, Sujay Bhatt, Sumitra Ganesh, Alec Koppel

机构 * JPMorgan AI Research(摩根大通AI研究) Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室)

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种单循环一阶演员-评论员算法,用于解决双层优化问题,通过惩罚重述法优化双层目标,引入衰减熵正则化以实现无偏上层超梯度估计,且在特殊Polyak-Lojasiewicz条件下证明了有限时间与样本收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI 79%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19749 2026-04-23 cs.AI cs.SE 79%

The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?

工具过度使用错觉:为什么大语言模型更倾向于使用外部工具而非内部知识?

Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology, SCIR(哈尔滨理工大学SCIR研究所) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 后训练与偏好优化 :LLM(title);preference optimization(abstract);分类 cs.AI

AI总结 本文揭示大语言模型在推理中普遍存在工具过度使用现象,通过分析内部知识可用性区域,提出知识感知边界对齐策略,减少工具使用82.8%,并发现仅以结果奖励会鼓励工具过度使用,通过平衡奖励信号可减少66.7%的无用工具调用。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07527 2026-04-23 cs.LG 79%

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

卡尔曼滤波增强的GRPO用于基于强化学习的语言模型推理

Hu Wang, Congbo Ma, Ian Reid, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.LG

AI总结 本文提出KRPO,通过卡尔曼滤波估计潜在提示级奖励基线,提升语言模型推理的训练奖励和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20816 2026-04-23 cs.LG cs.CV 79%

ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

ParetoSlider:扩散模型后训练用于连续奖励控制

Shelly Golan, Michael Finkelson, Ariel Bereslavsky, Yotam Nitzan, Or Patashnik

机构 * Tel Aviv University(特拉维夫大学) Lightricks(Lightricks公司) Adobe Research(Adobe研究)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 ParetoSlider提出多目标强化学习框架,通过连续变化的偏好权重训练单个扩散模型,实现推理时对冲突目标的精细控制。

Comments Project page: https://shelley-golan.github.io/ParetoSlider-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18873 2026-04-23 cs.LG 77%

Best Policy Learning from Trajectory Preference Feedback

最佳策略学习从轨迹偏好反馈

Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

机构 * University of Southern California(南加州大学) Google(谷歌) DeepMind(深度Mind) OpenAI

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本文研究了基于偏好强化学习的最佳策略识别问题,提出PSPL算法,通过维护奖励模型和动态的后验分布,提供首个贝叶斯简单遗憾保证,并在模拟和图像生成基准中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19856 2026-04-23 cs.AR cs.AI cs.LG 73%

ChipCraftBrain: Validation-First RTL Generation via Multi-Agent Orchestration

ChipCraftBrain: 通过多智能体协调实现验证优先的RTL生成

Cagri Eryilmaz

机构 * Cagri Eryilmaz

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ChipCraftBrain通过多智能体协调和混合符号-神经架构实现验证优先的RTL生成,其核心方法包括自适应协调、混合架构、知识增强生成和分层规格分解,主要贡献是提升了RTL生成的准确性和效率。

Comments 17 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20659 2026-04-23 cs.LG cs.AI 73%

GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning

GRPO-VPS:通过可验证的过程监督增强组相对策略优化以实现有效的推理

Jingyi Wang, Lei Zhu, Tengjin Weng, Song-Li Wu, Haochen Tan, Jierun Chen, Chaofan Tao, Haoli Bai, Lu Hou, Lifeng Shang, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Shenzhen University(深圳大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GRPO-VPS,通过在推理轨迹中探测模型对正确答案的信心,改进GRPO的轨迹级反馈,实现更精准高效的策略更新,实验显示在数学和通用领域任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19857 2026-04-23 cs.LG cs.CL 62%

Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization

重新思考LVLM中的强化微调:收敛性、奖励分解与泛化

Carter Adams, Rafael Oliveira, Gabriel Almeida, Sofia Torres

机构 * Federal University of Bahia(巴伊亚联邦大学)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TA-MDP框架,分析强化微调中奖励结构对GRPO收敛性的影响,并推导奖励分解定理和泛化界限,揭示工具增强策略在分布外迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20733 2026-04-23 cs.LG 57%

Near-Future Policy Optimization

近未来策略优化

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学院大学网络安全学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出NPO方法,通过策略自身近未来状态作为辅助轨迹,平衡轨迹质量和方差成本,提升学习信号。AutoNPO自动触发干预,提升性能至63.15。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 16 篇

2604.19777 2026-04-23 cs.CL cs.AI cs.IR 92%

Self-Describing Structured Data with Dual-Layer Guidance: A Lightweight Alternative to RAG for Precision Retrieval in Large-Scale LLM Knowledge Navigation

具有双层引导的自描述结构数据:一种轻量级替代RAG的精确检索方法,用于大规模LLM知识导航

Hung Ming Liu

机构 * PARRAWA AI

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SDSR框架,通过在文件中嵌入人类编写的导航元数据,利用LLM的优先级偏差,结合双层引导策略提升大规模知识检索的精确性。

Comments 18 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07798 2026-04-23 cs.AI 92%

Lightweight LLM Agent Memory with Small Language Models

轻量级大语言模型代理记忆系统

Jiaquan Zhang, Chaoning Zhang, Shuxu Chen, Zhenzhen Huang, Pengcheng Zheng, Zhicheng Wang, Ping Guo, Fan Mo, Sung-Ho Bae, Jie Zou, Jiwei Wei, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Kyung Hee University(庆熙大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学)

专题命中 长上下文与记忆 :LLM(title,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.AI

AI总结 本文提出LightMem,利用小语言模型实现轻量级代理记忆,通过模块化记忆检索、写入和长期整合,提升效率与准确性,实验显示在LoCoMo数据集上F1值提升2.5,并具有低延迟特点。

Comments Accepted by ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20582 2026-04-23 cs.MA cs.AI cs.CL 90%

Trust, Lies, and Long Memories: Emergent Social Dynamics and Reputation in Multi-Round Avalon with LLM Agents

信任、谎言与长久记忆:在多轮阿瓦隆中的LLM代理涌现的社会动态与声誉

Suveen Ellawela

机构 * National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究LLM代理在多轮阿瓦隆游戏中社会动态与声誉的演变,发现记忆保留促进声誉形成及策略性欺骗,高推理努力提升欺骗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20261 2026-04-23 cs.AI 90%

Memory-Augmented LLM-based Multi-Agent System for Automated Feature Generation on Tabular Data

基于记忆增强的LLM多智能体系统用于表格数据自动特征生成

Fengxian Dong, Zhi Zheng, Xiao Han, Wei Chen, Jingqing Ruan, Tong Xu, Yong Chen, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University of Technology(浙江工业大学) Meituan(美团)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MALMAS系统,通过多智能体与记忆模块提升表格数据自动特征生成的效率与质量,实验验证其有效性。

Comments 16 pages (including appendix), 4 main figures, 15 tables. Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19351 2026-04-23 cs.CL 90%

DASH-KV: Accelerating Long-Context LLM Inference via Asymmetric KV Cache Hashing

DASH-KV:通过非对称KV缓存哈希加速长上下文LLM推理

Jinyu Guo, Zhihan Zhang, Yutong Li, Jiehui Xie, Md. Tamim Iqbal, Dongshen Han, Lik-Hang Lee, Sung-Ho Bae, Jie Zou, Yang Yang, Chaoning Zhang

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) The Hong Kong Polytechnic University(香港理工大学) Kyung Hee University, School of Computing(庆熙大学计算机学院)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DASH-KV通过非对称深度哈希将注意力机制近似为最近邻搜索,降低计算复杂度至线性,提升长上下文LLM推理效率并保持性能。

Comments Accepted by ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18349 2026-04-23 cs.CL 90%

HiGMem: A Hierarchical and LLM-Guided Memory System for Long-Term Conversational Agents

HiGMem:一种分层且基于LLM的长期对话代理内存系统

Shuqi Cao, Jingyi He, Fei Tan

机构 * East China Normal University(东华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HiGMem通过分层事件-对话轮次内存系统,利用事件摘要作为语义锚点,提升检索效率和证据集可靠性,优于现有方法。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Camera-ready version. 10 pages, 2 figures. Code: https://github.com/ZeroLoss-Lab/HiGMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19769 2026-04-23 cs.CL cs.AI cs.LG 88%

TTKV: Temporal-Tiered KV Cache for Long-Context LLM Inference

TTKV:面向长上下文LLM推理的时序分层KV缓存

Gradwell Dzikanyanga, Weihao Yang, Hao Huang, Donglei Wu, Shihao Wang, Wen Xia, Sanjeeb K C

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Guangzhou University(广州大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TTKV通过时序分层缓存框架优化KV存储,利用HBM和DRAM解耦快慢存储,根据时间接近性分配KV状态,减少跨层通信开销,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21394 2026-04-23 cs.CR 87%

MemoPhishAgent: Memory-Augmented Multi-Modal LLM Agent for Phishing URL Detection

MemoPhishAgent: 基于记忆的多模态大语言模型代理用于钓鱼URL检测

Xuan Chen, Hao Liu, Tao Yuan, Mehran Kafai, Piotr Habas, Xiangyu Zhang

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出MemoPhishAgent,通过整合多模态推理与记忆机制,提升钓鱼URL检测性能,实验显示其在召回率上优于现有方法,并在真实场景中实现高召回率。

Comments ACL 2026 Industry Track Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19771 2026-04-23 cs.CL cs.AI cs.IR 82%

Cognis: Context-Aware Memory for Conversational AI Agents

Cognis:面向对话AI代理的上下文感知内存

Parshva Daftari, Khush Patel, Shreyas Kapale, Jithin George, Siva Surendira

机构 * Lyzr Research(Lyzr研究)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 Cognis通过多阶段检索管道解决LLM代理缺乏持久记忆的问题,结合双存储后端和向量相似性搜索,实现智能版本追踪和时间敏感查询增强,展现先进性能。

Comments 30 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20651 2026-04-23 cs.AI 81%

CHORUS: An Agentic Framework for Generating Realistic Deliberation Data

CHORUS:生成真实辩论数据的代理框架

A. Koursaris, G. Domalis, A. Apostolopoulou, K. Kanaris, D. Tsakalidis, I. E. Livieris

机构 * Novelcore

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出CHORUS框架,通过LLM驱动的代理生成真实辩论数据,结合记忆机制和泊松过程模型,提升讨论的现实性和分析价值。

Comments This paper has been accepted for presentation at Engineering Applications and Advances of Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03690 2026-04-23 cs.SE cs.AI 81%

The OpenHands Software Agent SDK: A Composable and Extensible Foundation for Production Agents

OpenHands软件代理SDK:一种可组合且可扩展的生产代理基础

Xingyao Wang, Simon Rosenberg, Juan Michelini, Calvin Smith, Hoang Tran, Engel Nyst, Rohit Malhotra, Xuhui Zhou, Valerie Chen, Robert Brennan, Graham Neubig

机构 * MLSys 2026

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出OpenHands SDK,提供灵活的代理实现接口、安全可靠执行及用户交互接口,整合了本地到远程执行、多LLM路由和安全分析,验证了其在生产部署中的有效性。

Comments Accepted at MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20117 2026-04-23 cs.CL 77%

To Know is to Construct: Schema-Constrained Generation for Agent Memory

知即建构:基于模式约束的代理记忆生成

Lei Zheng, Weinan Song, Daili Li, Yanming Yang

机构 * UnionPay(中国银联)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SCG-MEM架构,通过模式约束生成实现记忆检索,避免结构幻觉并提升多跳推理能力,实验显示其在LoCoMo基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20006 2026-04-23 cs.CL 77%

From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents

从回忆到遗忘:个性化代理长期记忆的基准测试

Md Nayem Uddin, Kumar Shubham, Eduardo Blanco, Chitta Baral, Gengyu Wang

机构 * Arizona State University(亚利桑那州立大学) Genies University of Arizona(亚利桑那大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文提出Memora基准测试,评估个性化代理在长期对话中的记忆、推理和推荐能力,引入FAMA指标以衡量对过时记忆的依赖,发现LLM和记忆代理在处理长期记忆时存在显著不足。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏