arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2509.17396 2026-05-21 cs.CL 70%

EpiCache: Episodic KV Cache Management for Long-Term Conversation on Resource-Constrained Environments

EpiCache: 为资源受限环境下的长对话提供 episodic KV 缓存管理

Minsoo Kim, Arnav Kundu, Han-Byul Kim, Richa Dixit, Minsik Cho

机构 * Apple(苹果公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出 EpiCache,一种无需训练的 KV 缓存管理框架,用于在固定内存预算下实现长对话问答(LongConvQA)。该方法通过块级预填充限制缓存增长,并通过 episodic KV 压缩保留主题相关上下文,从而在多个 LongConvQA 评估基准上提升了准确性并减少了延迟和峰值内存使用。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23231 2026-05-19 cs.AI 70%

PERMA: Benchmarking Personalized Memory Agents via Event-Driven Preference and Realistic Task Environments

PERMA:通过事件驱动的偏好和现实任务环境评估个性化记忆代理

Shuochen Liu, Junyi Zhu, Long Shu, Junda Lin, Yuhao Chen, Haotian Zhang, Chao Zhang, Derong Xu, Jia Li, Bo Tang, Zhiyu Li, Feiyu Xiong, Enhong Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Northeastern University(东北大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PERMA基准,通过事件驱动的偏好和现实任务环境评估个性化记忆代理的长期一致性,引入文本变异和语言对齐以模拟真实数据中的不规则用户输入和个体语言风格,实验表明先进记忆系统能精准提取偏好并减少token消耗,但仍需更稳健的个性化记忆管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03879 2026-05-19 cs.SE cs.AI 70%

Adversarial Agent Collaboration for Correctness Improvements of C to Safe Rust Translation

对抗性代理协作提升C到安全Rust翻译的正确性

Tianyu Li, Ruishi Li, Bo Wang, Brandon Paulsen, Umang Mathur, Prateek Saxena

机构 * National University of Singapore(新加坡国立大学) Amazon Web Services(亚马逊网络服务)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ACToR框架,通过对抗性搜索发现翻译与C源码分歧的输入,利用这些输入驱动后续优化,提升C到Rust翻译的正确性,实验表明其在多个真实世界工具中达到90%以上的测试通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16839 2026-05-19 cs.CL 70%

CompactAttention: Accelerating Chunked Prefill with Block-Union KV Selection

CompactAttention: 加速分块预填的块-联合KV选择

Jiwon Song, Dongwon Jo, Beomseok Kang, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CompactAttention,一种基于块-联合KV选择的分块预填注意力机制,通过将二维块稀疏掩码作为KV选择信号,实现高效的注意力计算,从而在保持精度的同时提升2.72倍的注意力速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16538 2026-05-19 cs.HC cs.CL 70%

LLMs in Qualitative Research: Opportunities, Limitations, and Practical Considerations

大语言模型在定性研究中的应用:机遇、限制与实践考量

Henry Salgado, Meagan R. Kendall, Martine Ceberio, Alexandra Coso Strong

机构 * ASEE(美国工程教育协会)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型在定性研究中的机遇、限制及实践问题,强调研究者需批判性地处理技术参数,结合定性方法与可解释AI,讨论大语言模型的透明度与传统NLP工具的差异。

Comments To be published and presented in 2026 ASEE Annual Conference and Exposition

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16321 2026-05-19 cs.LG 70%

Language Game: Talking to Non-Human Systems

语言游戏:与非人类系统交谈

Yanbo Zhang, Michael Levin

机构 * Allen Discovery Center at Tufts University(塔夫茨大学艾伦发现中心) Wyss Institute for Biologically Inspired Engineering at Harvard University(哈佛大学生物启发工程Wyss研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过游戏机制与非人类系统对话,利用强化学习政策的核心动态,使系统通过自身行为回应,展示不同系统在对话中的收敛行为及特性影响。

Comments 29 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15611 2026-05-18 cs.AI 70%

TopoEvo: A Topology-Aware Self-Evolving Multi-Agent Framework for Root Cause Analysis in Microservices

TopoEvo: 一种面向拓扑的自演化多智能体框架用于微服务中的根本原因分析

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对微服务中观测数据异质性、故障传播和拓扑漂移问题,TopoEvo通过多模态对齐、拓扑约束推理和自演化机制,提升根本原因分析的鲁棒性与准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09033 2026-05-18 cs.CR cs.AI 70%

ShadowMerge: A Novel Poisoning Attack on Graph-Based Agent Memory via Relation-Channel Conflicts

ShadowMerge:一种通过关系通道冲突的图基agent内存新型污染攻击

Yang Luo, Zifeng Kang, Tiantian Ji, Xinran Liu, Yong Liu, Shuyu Li, Lingyun Peng

机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE)(可信分布式计算与服务重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Laboratory(中关村实验室)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ShadowMerge攻击,通过关系通道冲突攻击图基agent内存,利用冲突值影响agent行为,改进现有攻击方法,实现93.8%的攻击成功率。

Comments Preprint. Corresponding authors: Zifeng Kang and Tiantian Ji. Code is available at https://anonymous.4open.science/status/ShadowMerge-033C

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01970 2026-05-18 cs.CR cs.AI 70%

Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration

Trojan Hippo:利用代理记忆进行数据外泄

Debeshee Das, Julien Piet, Darya Kaviani, Luca Beurer-Kellner, Florian Tramèr, David Wagner

机构 * ETH Z\"urich

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究提出Trojan Hippo攻击,通过单次不可信工具调用在代理长期记忆中植入潜伏载荷,当用户讨论敏感话题时激活并外泄数据。通过动态评估框架评估不同内存架构和防御措施,发现现有防御措施在安全性和实用性之间存在显著权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10454 2026-05-18 cs.AI 70%

Traj-CoA: Patient Trajectory Modeling via Chain-of-Agents for Lung Cancer Risk Prediction

Traj-CoA:通过链式代理进行患者轨迹建模用于肺癌风险预测

Sihang Zeng, Yujuan Fu, Sitong Zhou, Zixuan Yu, Lucas Jing Liu, Jun Wen, Matthew Thompson, Ruth Etzioni, Meliha Yetisgen

机构 * University of Washington(华盛顿大学) Fred Hutch Cancer Center(Fred Hutch癌症中心) Harvard University(哈佛大学) Google(谷歌)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Traj-CoA通过链式代理系统处理电子健康记录数据,减少噪声并保留完整时间线,从而在肺癌风险预测中优于基线方法。

Comments Accepted by NeurIPS 2025 GenAI4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08374 2026-05-15 cs.AI 70%

MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs

MemQ:将Q学习整合到基于溯源DAG的自进化记忆代理中

Junwei Liao, Haoting Shi, Ruiwen Zhou, Jiaqian Wang, Shengtao Zhang, Wei Zhang, Ying Wen, Zhiyu Li, Feiyu Xiong, Bo Tang, Weinan Zhang, Muning Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) University of Science and Technology of China(中国科学技术大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 MemQ通过在溯源DAG中传播信用权重,改进记忆Q值的评估,提升多步任务的泛化能力,尤其在产生深层相关溯源链的任务中表现突出。

Comments 22 pages, 11 figures (containing 43 individual image panels total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14823 2026-05-15 cs.LG cs.CV 70%

Dynamic Nested Hierarchies: Pioneering Self-Evolution in Machine Learning Architectures for Lifelong Intelligence

动态嵌套层级:在机器学习架构中开创自我进化以实现终身智能

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * Institute of Technology University of Tartu(塔尔图技术大学) S Holding OÜ(3S控股公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出动态嵌套层级,通过自适应调整优化层级、嵌套结构和更新频率,解决现有模型在非平稳环境中的适应性问题,推动终身学习的发展。

Comments 12 pages, 1 figure

Journal ref Frontiers in Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13486 2026-05-14 cs.CL 70%

R^2-Mem: Reflective Experience for Memory Search

R^2-Mem: 用于记忆搜索的反思经验

Xinyuan Wang, Wenyu Mao, Junkang Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 R^2-Mem通过反思经验框架提升记忆搜索系统的有效性和效率,通过历史轨迹评分和自我反思学习,减少重复错误并提高搜索质量,实验表明其在F1分数提升和资源消耗降低方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27910 2026-05-14 cs.AI cs.IR cs.MA 70%

GAAMA: Graph Augmented Associative Memory for Agents

GAAMA:用于智能体的图增强关联记忆

Swarna Kamal Paul, Shubhendu Sharma, Nitin Sareen

机构 * Nagarro(Nagarro公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 GAAMA通过三步流程构建概念中介知识图,结合余弦相似度和个性化PageRank实现检索,通过GRaft修复知识图,提升多会话任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12061 2026-05-13 cs.AI 70%

SAGE: A Self-Evolving Agentic Graph-Memory Engine for Structure-Aware Associative Memory

SAGE:一种自演化代理图记忆引擎,用于结构感知的联想记忆

Juntong Wang, Haoyue Zhao, guanghui Pan, Xiyuan Wang, Yanbo Wang, Qiyan Deng, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学校) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学校)

专题命中 长上下文与记忆 :foundation model(abstract);language agent(abstract);分类 cs.AI

AI总结 SAGE通过自演化机制和图记忆引擎提升长期记忆能力,在多跳问答、开放领域检索等任务中表现出色,显著提高了证据恢复和检索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12039 2026-05-13 cs.CL 70%

SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs

SkillGraph:通过演化的技能图增强代理的强化学习

Xiaoyuan Li, Moxin Li, Keqin Bao, Yubo Ma, Wenjie Wang, Dayiheng Liu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SkillGraph通过演化的技能图增强代理的强化学习,解决技能组合任务中的依赖识别和库维护问题,实验显示其在复杂任务中表现优异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10235 2026-05-13 cs.CL 70%

Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection

在检索前路由:激活大语言模型的潜在路由能力用于RAG与长上下文选择

Yiwen Chen, Kuan Li, Fuzhen Zhuang, Deqing Wang, Zhao Zhang, Liwen Zhang, Yong Jiang, Shuai Wang, Minhao Cheng

机构 * Beihang University(北航) HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Pre-Route框架,通过结构化推理提前决策,利用轻量级元数据进行任务分析和信息需求预测,实现可解释且高效的路由决策,实验表明其在成本效益上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08463 2026-05-13 cs.AI 70%

Behavioral Determinants of Deployed AI Agents in Social Networks: A Multi-Factor Study of Personality, Model, and Guardrail Specification

部署在社交网络中的AI代理行为决定因素:人格、模型和防护机制规范的多因素研究

Sarah Wilson, Diem Linh Dang, Usman Ali Moazzam, Shan Ye, Gail Kaiser

机构 * Columbia University(哥伦比亚大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过多因素实验研究,探讨AI代理在社交网络中的行为决定因素,发现人格设定对行为影响最大,模型和规则对语言风格和话题广度有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05971 2026-05-13 cs.LG 70%

Training Transformers for KV Cache Compressibility

训练用于KV缓存压缩性的Transformer

Yoav Gelberg, Yam Eitan, Michael Bronstein, Yarin Gal, Haggai Maron

机构 * University of Oxford(牛津大学) Technion – Israel Institute of Technology(技术ion理工学院) AITHYRA NVIDIA

专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出KV-CAT训练方法,通过训练时的KV稀疏化策略,引导模型学习可压缩的表示,提升下游压缩方法的质量-预算权衡。

Comments 32 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10956 2026-05-13 cs.SE cs.AI 70%

Project-Level C-to-Rust Translation via Pointer Knowledge Graphs

基于指针知识图谱的项目级C到Rust翻译

Zhiqiang Yuan, Wenjun Mao, Zhuo Chen, Xiyue Shang, Chong Wang, Yiling Lou, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出基于指针知识图谱的项目级C到Rust翻译方法PtrTrans,通过增强代码依赖图的指针语义,提升生成Rust代码的安全性和正确性,实验表明其在安全性与功能性上均优于现有方法。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10466 2026-05-12 cs.LG 70%

Self-Attention as a Covariance Readout: A Unified View of In-Context Learning and Repetition

自注意力作为协方差读出:对上下文学习和重复的统一视角

Haoren Xu, Guanhua Fang

机构 * Fudan University(复旦大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了大语言模型中上下文学习和重复生成现象的统一原理,通过自注意力机制推导出协方差读出机制,揭示了其在线性回归和生成过程中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10414 2026-05-12 cs.LG 70%

Remember to Forget: Gated Adaptive Positional Encoding

记住遗忘:门控自适应位置编码

Riccardo Ali, Alessio Borgi, Christopher Irwin, Mario Severino, Pietro Liò

机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Department of Computer, Control and Management Engineering, Sapienza University(计算机、控制与管理工程系,萨皮恩扎大学) Department of Information Engineering, University of Padova(信息工程系,帕多瓦大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 GAPE通过引入内容感知偏差优化注意力逻辑,在保持旋转几何的前提下,分离距离抑制与token重要性,提升长上下文鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04712 2026-05-12 cs.CV cs.AI eess.IV 70%

SAR-RAG: ATR Visual Question Answering by Semantic Search, Retrieval, and MLLM Generation

SAR-RAG:通过语义搜索、检索和MLLM生成实现目标识别的视觉问答

David F. Ramirez, Tim Overman, Kristen Jaskie, Joe Marvin, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SAR-RAG方法,结合多模态大语言模型和语义嵌入向量数据库,通过语义搜索和检索提升SAR图像目标识别的准确性,通过分类和回归指标验证效果。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09472 2026-05-12 cs.LG cs.DS 70%

Positional LSH: Binary Block Matrix Approximation for Attention with Linear Biases

位置性LSH:用于带有线性偏置的注意机制的二进制块矩阵近似

Daniel Wolfson, Tal Wagner

机构 * Blavatnik School of Computer Science and AI(Blavatnik计算机科学与人工智能学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了通过局部敏感哈希(LSH)视角下的带有位置偏置的注意机制,证明了ALiBi偏置矩阵是连续块对角二进制掩码的期望,并展示了其在高概率下对块大小的谱范数和最大范数近似保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26805 2026-05-12 cs.AI cs.MA 70%

Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations

Bian Que: 一个具有灵活技能安排的代理框架,用于在线系统运维

Bochao Liu, Zhipeng Qian, Yang Zhao, Xinyuan Jiang, Zihan Liang, Yufei Ma, Junpeng Zhuang, Ben Chen, Shuo Yang, Hongen Wan, Yao Wu, Chenyi Lei, Xiao Liang

机构 * Kuaishou Technology(快手科技)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Bian Que通过统一运维范式和灵活技能安排,提高了在线系统运维效率,减少了警报量,提高了根因分析准确率,缩短了故障解决时间。

Comments HomePage: https://benchen4395.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12812 2026-05-12 cs.AI 70%

DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding

DocSeeker:基于证据 grounding 的结构化视觉推理用于长文档理解

Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao, Jihao Wu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DocSeeker,通过结构化分析、定位和推理流程解决长文档理解中的信号噪声比低和监督不足问题,实现对超长文档的鲁棒泛化。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08840 2026-05-12 cs.CL 70%

ReST-KV: Robust KV Cache Eviction with Layer-wise Output Reconstruction and Spatial-Temporal Smoothing

ReST-KV: 基于分层输出重建与时空平滑的鲁棒KV缓存淘汰

Yongqi An, Chang Lu, Kuan Zhu, Tao Yu, Chaoyang Zhao, Hong Wu, Ming Tang, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) University of Electronic Science and Technology of China(电子科技大学) Wuhan AI Research(武汉人工智能研究) Objecteye Inc.(Objecteye公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ReST-KV方法,通过分层输出重建和时空平滑优化KV缓存淘汰,提升长序列生成效率,实测在多个基准测试中表现优异,同时显著降低解码延迟。

Comments Accepted at ICLR 2026. Project Page: https://github.com/an-yongqi/rest-kv

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29632 2026-05-12 cs.MA cs.AI 70%

An Empirical Study of Multi-Agent Collaboration for Automated Research

多智能体协作在自动化研究中的实证研究

Yang Shen, Zhenyi Yi, Ziyi Zhao, Lijun Sun, Dongyang Li, Chin-Teng Lin, Yuhui Shi

机构 * University of Technology Sydney(悉尼技术大学) Southern University of Science and Technology(南方科技大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究比较了不同多智能体结构在自动化机器学习优化中的效果,发现子代理架构在时间受限下更稳定高效,而智能体团队架构在计算预算充足时能实现深度理论对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06554 2026-05-08 cs.CL 70%

Long Context Pre-Training with Lighthouse Attention

长上下文预训练与Lighthouse注意力

Bowen Peng, Subho Ghosh, Jeffrey Quesnelle

机构 * Nous Research(Nous研究院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Lighthouse注意力机制,通过分层选择策略实现高效长序列训练,减少计算复杂度,提升并行效率,并在训练后期恢复完整注意力模型,实验证明其在训练速度和最终损失上的优势。

Comments 18 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06365 2026-05-08 cs.AI cs.MA cs.SE 70%

From Agent Loops to Deterministic Graphs: Execution Lineage for Reproducible AI-Native Work

从代理循环到确定性图:可重复AI原生工作的执行轨迹

Josh Rosen, Seth Rosen

机构 * ThruWire, Inc.(ThruWire公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出执行轨迹模型,通过有向无环图表示AI生成工作,确保在变化中保持稳定性。对比实验显示,DAG在保持最终结果和中间状态一致性方面优于循环更新方法。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏