arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4779 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4779 篇

2503.08048 2025-03-14 cs.CV cs.LG 76%

LongProLIP: A Probabilistic Vision-Language Model with Long Context Text

Sanghyuk Chun, Sangdoo Yun

专题命中 长上下文与记忆 :language model(title);分类 cs.LG;foundation model(comments)

Comments Accepted as a tiny paper at the 1st workshop of "Quantify Uncertainty and Hallucination in Foundation Models: The Next Frontier in Reliable AI" at ICLR 2025; code: https://github.com/naver-ai/prolip; models: https://huggingface.co/collections/SanghyukChun/prolip-6712595dfc87fd8597350291

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14784 2026-08-19 cs.IR cs.AI cs.CL cs.LG 交叉投稿 75%

Intent-Driven Dynamic Chunking: Segmenting Documents to Reflect Predicted Information Needs

基于意图的动态分块:使文档分块反映预测的信息需求

Christos Koutsiaris

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于意图的动态分块方法,通过预测用户查询优化文档分块,提升检索性能,尤其在长文档中效果显著。

Comments 8 pages, 4 figures. Code available at https://github.com/unseen1980/IDC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13496 2026-08-14 cs.AR 新提交 75%

YAVIN: A Unified Architecture for Secure Edge Processing in Memory

YAVIN:面向安全边缘内存处理的统一架构

Shouzhi Fang, William C. Tegge, Md Omar Faruque, Peipei Zhou, Endadul Hoque, Alex K. Jones

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn)

AI总结 针对边缘计算中多租户安全执行及内存处理的挑战,提出将TEE扩展至内存的YAVIN架构,实现后量子密码与认证加密的PIM协同设计,在量化LLM执行时获超20倍加速且开销极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05013 2026-08-06 cs.CL cs.AI cs.HC cs.LG cs.MA 新提交 75%

OneDayAgent: Towards a Long-Horizon Harness for Autonomous Agents

OneDayAgent:面向自主智能体的长程管控框架

Jingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 OneDayAgent是一种长程管控框架,可将开放式请求分解为子任务,在不同后端LLMs上实现最优性能,解决智能体的多类失效模式。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12448 2026-08-05 cs.CL cs.AI cs.LG 版本更新 75%

Uncovering Spontaneous Physics Representations in In-Context Learning

揭示上下文学习中自发形成的物理表征

Yeongwoo Song, Jaeyong Bae, Dong-Kyum Kim, Hawoong Jeong

机构 * Department of Physics, KAIST(KAIST物理系) MPI for Security and Privacy, Germany(德国安全与隐私研究所) Center for Complex Systems, KAIST(KAIST复杂系统中心)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究以动力学预测为代理任务,发现大语言模型无需物理特定监督,就能在上下文学习中自发形成与能量等物理概念对齐的表征,且该表征对预测有贡献,为ICL机制提供了物理解释。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23504 2026-07-28 cs.CV 新提交 75%

MemVLN: Episodic and Procedural Memory for Vision-and-Language Navigation

MemVLN:用于视觉与语言导航的情景记忆和程序记忆

Yuqi Liu, Shengju Qian, Tianyuan Qu, Mingxian Lin, Zixuan Wang, Xin Wang, Bei Yu, Jiaya Jia

机构 * The Chinese University of Hong Kong(香港中文大学) LIGHTSPEED(光速) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究连续环境中视觉与语言导航问题,提出MemVLN框架,利用视觉编码器、大语言模型,通过情景记忆管理和程序记忆,实现实时推理,提升导航成功率并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21361 2026-07-24 cs.MA 新提交 75%

FedAgentKE: Federated Semantic Knowledge Evolution for Heterogeneous Agents

FedAgentKE:异构智能体的联邦语义知识演化

Weihao Li, Jun Bai, Ziyang Song

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。

Comments 9 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14431 2026-07-17 cs.CL cs.AI cs.LG cs.PF 新提交 75%

Smarter and Cheaper at Once: Byte-Exact KV-Cache Grafting Turns a Frozen Small Model into a Verified-Knowledge Flywheel

一举实现更智能与更廉价:字节精确的键值缓存嫁接将冻结的小模型转变为经过验证的知识飞轮

Sietse Schelpe

机构 * Corbenic AI(Corbenic人工智能公司)

专题命中 长上下文与记忆 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究提出通过字节精确的键值缓存嫁接,在不改变权重的情况下让冻结小语言模型更强大且廉价。此方法能精确恢复知识,提升模型性能,如在AIME 2025上提高准确率,还能扩展可用上下文,减少能耗,且可验证评分。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21074 2026-07-10 cs.NI 版本更新 75%

RepLLM: Toward Automatically Reproducing Network Research Results

RepLLM:迈向自动重现网络研究结果

Yining Jiang, Yunxin Xu, Wenyun Xu, Yufan Zhu, Rui Liu, Tangtang He, Haiying Huang, Letian Zhu, Qingyu Song, Qiang Su, Lizhao You, Lu Tang, Wanjian Feng, Yuchao Zhang, Linghe Kong, Qiao Xiang, Jiwu Shu

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对计算机网络研究结果重现难题,RepLLM提出端到端多智能体框架,通过四个智能体协作及共享内存机制确保一致性,借助特定推理和调试方法解决问题,相比现有框架表现更优,能高效重现基准且减少令牌消耗。

Comments SIGCOMM'26(19 pages, 6 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07632 2026-07-09 cs.DB 新提交 75%

From Custom-Fit to Portable: Bridging the Gap Between Synthesized and Engineered GPU Query Execution

从定制适配到便携性:弥合合成与工程化GPU查询执行之间的差距

Ivan Donchev Kabadzhov, Eugenio Marinelli, Raja Appuswamy

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文针对GPU分析中合成与工程化的争论,提出SHADB框架回答合成GPU代码效果等三个问题,展示合成代码优势,分解性能差距并分类优化,将可推广优化集成到SYCLDB引擎,缩小与合成代码差距并保持相关特性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03741 2026-07-07 cs.SE 新提交 75%

Graph-Aware Fuzzing for Graph Database Management Systems

用于图数据库管理系统的图感知模糊测试

Yu Li, Qiang Hu, Yao Zhang, Junjie Wang, Hao Liu, Rui Wang, Yongqiang Lyu

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对图数据库管理系统现有测试方法不足,提出GRAF框架。通过基于级联依赖解析的图上下文感知查询生成有效多样查询,用执行状态反馈引导变异操作,提升测试效果,发现众多未知漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24432 2026-07-07 cs.CL cs.AI cs.IR cs.LG 版本更新 75%

Kwai Summary Attention Technical Report

快手总结注意力技术报告

Chenglong Chu, Guorui Zhou, Guowang Zhang, Han Li, Hao Peng, Hongtao Cheng, Hui Wang, Jian Liang, Jiangxia Cao, Kun Gai, Lingzhi Zhou, Lu Ren, Qi Zhang, Ruiming Tang, Ruitao Wang, Xinchen Luo, Yi Su, Zhiyuan Liang, Ziqi Wang, Boyang Ding, Chengru Song, Dunju Zang, Jiao Ou, Jiaxin Deng, Jijun Shi, Jinghao Zhang, Junmin Chen, Lejian Ren, Minxuan Lv, Qianqian Wang, Qigen Hu, Shiyao Wang, Siyang Mao, Tao Wang, Xingmei Wang, Zhixin Ling, Ziming Li, Zixing Zhang

机构 * Kuaishou(快手)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究长上下文能力这一重要迭代方向,针对标准softmax注意力在长序列下时间复杂度高的问题,提出新路径,通过将历史上下文压缩为可学习总结令牌降低序列建模成本,即提出快手总结注意力机制。

Comments update related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04221 2026-07-07 cs.CL cs.AI cs.LG 版本更新 75%

Context Tuning for In-Context Optimization

上下文调整用于上下文优化

Jack Lu, Ryan Teehan, Zhenbang Yang, Mengye Ren

机构 * Agentic Learning AI Lab(智能代理学习AI实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 介绍上下文调整方法,利用模型固有上下文学习能力从示例初始化可训练记忆表示并优化,提升少样本适应能力,在多基准测试中表现优于其他方法。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01002 2026-07-02 cs.CL cs.AI cs.LG 新提交 75%

Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads

Logit贡献评分识别非字面检索头

Aryo Pradipta Gema, Beatrice Alex, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学) Heriot-Watt University(赫瑞瓦特大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Logit贡献评分(LOCOS),通过OV电路输出投影到答案标记方向,识别大语言模型中执行非字面检索的注意力头,消融实验显著降低ROUGE-L而保持其他能力。

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29844 2026-06-30 cs.CL cs.AI cs.LG 75%

MATCH: Modulating Attention via In-Context Retrieval for Long-Context Transformers

MATCH: 通过上下文检索调制注意力用于长上下文Transformer

Linrui Ma, Chun Hei Lo, Xinyu Wang, Peng Lu, Xihao Yuan, Hanting Chen, Kai Han, Xinghao Chen, Chengjun Zhan, Hanlin Xu, Yichun Yin, Lifeng Shang, Feng Wen, Boxing Chen, Yufei Cui

机构 * Huawei Canada(华为加拿大) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Huawei Equal Contribution(华为同等贡献)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MATCH框架,通过高效检索系统动态集成上下文信息来增强稀疏注意力机制,在长上下文任务中提升性能并保持效率。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26511 2026-06-26 cs.CL cs.AI cs.ET cs.LG 新提交 75%

Temporal Validity in Retrieval Memory: Eliminating Stale-Fact Errors for AI Agents over Evolving Knowledge

检索记忆中的时间有效性:消除AI智能体在知识演化中的过时事实错误

Neeraj Yadav

机构 * MemStrata.dev — Called It Inc. (Enterprise)(MemStrata.dev — Called It Inc.(企业))

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对RAG无法处理知识演化导致过时事实错误的问题,提出MemStrata,通过确定性替换规则维护时间有效性,在演化知识上准确率达0.95-1.00,过时事实错误率降至~0%。

Comments 21 pages, 5 tables. Code, prompts, and evaluation datasets included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20625 2026-06-23 cs.AI cs.CL cs.LG 新提交 75%

AlphaMemo: Structured Search-Process Memory for Self-Evolving Alpha Mining Agents

AlphaMemo: 用于自我进化的Alpha挖掘智能体的结构化搜索过程记忆

Hang Yu, Zifan Zheng, Jeff Z. Pan, Tongliang Liu, Zhiyong Wang, Fengxiang He

机构 * University of Sydney(悉尼大学) University of Edinburgh(爱丁堡大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AlphaMemo,一种具有结构化搜索过程记忆的自我进化Alpha挖掘智能体,通过记录编辑模式在特定父因子上下文中的成败证据,结合置信门控残差记忆和非对称否决控制,提升样本外表现和固定预算发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14470 2026-06-23 cs.AI cs.CL cs.LG 新提交 75%

GitOfThoughts: Version-Controlled Reasoning and Agent Memory You Can Replay, Diff, and Merge

GitOfThoughts: 版本控制的推理与可回放、差异比较和合并的智能体记忆

Pavan C Shekar, Abhishek H S, Aswanth Krishnan

机构 * QpiAI

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GitOfThoughts框架,将智能体推理树存储为git仓库,实现推理的可回放、审计和合并;实验表明,对于新问题,任何记忆格式均不能可靠提升准确率,仅当检索案例与当前问题高度相似(>0.8)时才有显著提升,且收益来自答案检索而非方法迁移。

Comments 10 pages, 1 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30711 2026-06-23 cs.CL cs.AI cs.LG stat.ML 版本更新 75%

SAGE: A Novelty Gate for Efficient Memory Evolution in Agentic LLMs

SAGE: 一种用于智能体大语言模型中高效记忆演化的新颖门控机制

Sijia Wang, Dhanajit Brahma, Ricardo Henao

机构 * Duke University(杜克大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SAGE门控机制,基于von Mises-Fisher密度估计和自适应阈值,将记忆写入控制建模为新奇性检测问题,在LoCoMo上以更低成本实现最优token-F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19926 2026-06-19 cs.HC 新提交 75%

MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management

MemGUI-Agent: 一种具有主动上下文管理的端到端长时移动GUI智能体

Guangyi Liu, Gao Wu, Congxiao Liu, Pengxiang Zhao, Liang Liu, Mading Li, Qi Zhang, Mengyan Wang, Liang Guo, Yong Liu

专题命中 长上下文与记忆 :SFT(abstract,abstract_cn);prompting(abstract)

AI总结 提出MemGUI-Agent,通过主动上下文管理机制(ConAct)将上下文管理作为一等动作,解决长时任务中提示膨胀和关键信息稀释问题,在8B模型上达到最佳性能。

Comments 33 pages, 6 figures. Project page: https://memgui-agent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19746 2026-06-19 cs.DC 新提交 75%

SAC: Disaggregated KV Cache System for Sparse Attention LLMs with CXL

SAC: 面向稀疏注意力LLM的基于CXL的解耦KV缓存系统

Ruiyang Ma, Teng Ma, Junru Li, Hantian Zha, Xuchun Shang, Qingda Hu, Zheng Liu, Xinjun Yang, Tao Ma, Guojie Luo

专题命中 长上下文与记忆 :LLM(title_cn,abstract_cn)

AI总结 针对稀疏注意力模型在长上下文推理中全量KV缓存传输导致的瓶颈,提出基于CXL按需获取top-k KV条目的解耦缓存系统SAC,相比RDMA方案吞吐提升2.1倍、TTFT降低9.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16534 2026-06-17 cs.DC 新提交 75%

Generated, Parallel, Scalable? A Study of Agentic AI-Generated Julia Code on Supercomputers

生成、并行、可扩展?超级计算机上智能体AI生成的Julia代码研究

Linus Bantel, Anna-Lena Roth, Jonas Posner, Dirk Pflüger

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究智能体AI生成并行Julia代码的能力,发现小规模输入可靠但大规模扩展时出现死锁等问题,商业模型优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14881 2026-06-16 cs.DC 新提交 75%

Evaluating Gemma4 Models as AI Teaching Assistants for Introductory Parallel Programming: A DataRaceBench Study

评估 Gemma4 模型作为并行编程入门课程的 AI 助教:基于 DataRaceBench 的研究

Sabbir Hussain Meraj, Riham Chowdhury, Shimul Debnath, Wei Wang

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究评估了 Gemma4 开源模型在识别、解释和修复 OpenMP 数据竞争方面的能力,发现较大模型能覆盖大部分基准测试,但上下文提示并未一致提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18271 2026-06-10 cs.CL cs.AI cs.IR cs.LG 版本更新 75%

From Volume to Value: Preference-Aligned Memory Construction for On-Device RAG

从体积到价值:面向设备端RAG的偏好对齐记忆构建

Changmin Lee, Jaemin Kim, Taesik Gong

机构 * Department of Computer Science and Engineering, Ulsan National Institute of Science and Technology (UNIST), Ulsan, Republic of Korea(计算机科学与工程系,全州国立科学与技术研究所(UNIST),全州,韩国)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EPIC方法,通过将用户偏好作为紧凑且稳定的个人上下文形式,整合到RAG流程中,以在有限内存下提高检索与用户偏好的对齐度,从而减少内存使用并提升准确性。

Comments Accepted to ICML 2026. Code and data are available at https://github.com/UbiquitousAILab/EPIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19293 2026-06-04 cs.CL cs.AI cs.LG 75%

100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?

100-LongBench:事实上的长上下文基准是否真的在评估长上下文能力?

Wang Yang, Hongye Jin, Shaochen Zhong, Song Jiang, Qifan Wang, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) Texas A&M University(德克萨斯A&M大学) Rice University(里德大学) University of California, Los Angeles(加州大学洛杉矶分校) Meta

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有长上下文基准无法分离基线能力与真实长上下文能力、且输入长度固定等问题,提出长度可控的长上下文基准和新指标,以有效评估大语言模型的长上下文能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03430 2026-05-29 cs.MA cs.NI 75%

Scaling Multi-agent Systems: A Smart Middleware for Improving Agent Interactions

扩展多智能体系统:一种用于改善智能体交互的智能中间件

Charles Fleming, Guillaume De Saint Marc, Ramana Kompella, Peter Bosch, Vijoy Pandey

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出认知织物节点(CFN)中间件,通过强化学习和优化算法动态管理智能体间通信,在HotPotQA和MuSiQue数据集上性能提升超过10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27582 2026-05-28 cs.RO cs.CV 75%

Uni-LaViRA: Language-Vision-Robot Actions Translation for Unified Embodied Navigation

Uni-LaViRA:面向统一具身导航的语言-视觉-机器人动作翻译

Hongyu Ding, Sizhuo Zhang, Ziming Xu, Jinwen Guo, Hongxiu Liu, Xingzhi Cheng, Zixuan Chen, Haifei Qi, Duo Wang, Hao Xu, Jieqi Shi, Yifan Zhang, Jing Huo, Jian Cheng, Yang Gao, Jiebo Luo

机构 * Nanjing University(南京大学) Beihang University(北京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) BMW (Nanjing) Information Technology Co., Ltd.(宝马(南京)信息技术有限公司) University of Rochester(罗切斯特大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出Uni-LaViRA统一智能体架构,通过语言-视觉-机器人动作翻译结构,结合待办列表记忆和二次机会回溯机制,在零训练下实现四类导航任务和四种真实机器人的零样本泛化,性能匹配或超越近期训练式导航基础模型。

Comments Project page: https://xetroubadour.github.io/Uni-LaViRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19514 2026-05-28 cs.AI cs.CL cs.LG 75%

Position: The Turing-Completeness of Autoregressive Transformers Relies Heavily on Context Management

立场:自回归Transformer的图灵完备性高度依赖于上下文管理

Guanyu Cui, Zhewei Wei, Kun He

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) DEKE Lab, Renmin University of China, Beijing, China(中国人民大学北京校区DEKE实验室)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过区分固定系统和缩放族两种设置,论证了上下文管理方法对自回归Transformer计算能力的决定性影响,并指出缩放族设置下的图灵完备性证明不适用于实际部署的固定系统。

Comments Accepted to the ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12015 2026-05-28 cs.CR cs.AI cs.CL cs.LG cs.MA 75%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23959 2026-05-28 cs.CL cs.AI cs.LG 75%

HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling

HGMem:基于超图的工作记忆以改进长上下文复杂关系建模的多步RAG

Chulun Zhou, Chunkang Zhang, Guoxin Yu, Fandong Meng, Jie Zhou, Wai Lam, Mo Yu

机构 * The Chinese University of Hong Kong.(香港中文大学) Pengcheng Laboratory.(鹏城实验室) WeChat AI, Tencent(微信AI,腾讯) University of Chinese Academy of Sciences.(中国科学院大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HGMem超图工作记忆系统,通过超边表示记忆单元并渐进形成高阶交互,增强多步RAG中的全局理解和复杂推理能力。

Comments ICML 2026; Code released at https://github.com/Encyclomen/HGMem

详情

展开后加载摘要…

URL PDF HTML 收藏