arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 271 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 271 篇

2511.18112 2026-08-10 cs.RO 版本更新 67%

EchoVLA: Robotic Vision-Language-Action Model with Synergistic Declarative Memory for Mobile Manipulation

EchoVLA:用于VLA驱动移动操作的协同声明记忆

Min Lin, Xiwen Liang, Bingqian Lin, Jingzhi Liu, Zijian Jiao, Kehan Li, Ziang Yan, Yu Sun, Weijia Liufu, Yuhan Ma, Jiarui Hu, Yuecheng Liu, Shen Zhao, Yuzheng Zhuang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University, Shenzhen, China(中山大学深圳校区) Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Huawei Noah's Ark Lab, China(华为诺亚方舟实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 EchoVLA通过协同声明记忆提升移动操作性能,结合场景与事件记忆,利用注意力融合指导基臂策略,实现高效导航与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23254 2026-07-30 cs.SE 版本更新 67%

Better Call Grep: Evaluating and Improving Grep-Like Lexical Retrieval for Repository-Level Code Completion

更好地调用Grep:评估和改进用于仓库级代码补全的类Grep词汇检索方法

Baoyi Wang, Xingliang Wang, Guochang Li, Chen Zhi, Junxiao Han, Xinkui Zhao, Nan Wang, Shuiguang Deng, Jianwei Yin

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文评估改进类Grep词汇检索,提出Naive GrepRAG基线,又结合后处理流水线的GrepRAG在代码补全任务上优于SOTA,为轻量检索支撑仓库级代码补全提供方案。

Comments ISSTA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14807 2026-07-28 cs.CV cs.RO 版本更新 67%

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN:通过分层记忆系统增强开源零样本视觉-语言导航的可靠性

Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 本文提出HiMemVLN,通过分层记忆系统提升开源零样本视觉-语言导航的可靠性,解决导航遗忘问题,实现实验环境下的性能提升。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00555 2026-07-22 cs.AR 版本更新 67%

Sim-FA: A GPGPU Simulator Framework for Fine-Grained Asynchronous Pipeline Analysis

Sim-FA:异步流水线的模拟前端

Zhongchun Zhou, Yuhang Gu, Chengtao Lai, Ya Wang, Zeyu Han, Wei Zhang, Jun Liu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出Sim-FA模拟器,用于高效支持大语言模型,通过模拟流水线实现高精度性能评估,并分析FlashAttention-3的流量估计问题。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20843 2026-07-21 cs.CL cs.AI cs.LG 版本更新 67%

HiCI: Hierarchical Construction-Integration for Long-Context Attention

HiCI:层次化构造-整合用于长上下文注意力

Xiangyu Zeng, Qi Xu, Yunke Wang, Chang Xu

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) Westlake University(西湖大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HiCI通过层次化构造-整合模块,提升长上下文注意力模型的性能,通过参数高效适应LLaMA-2,将上下文长度扩展至10万和6.4万token,并在多个基准测试中超越现有模型。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08407 2026-07-20 cs.AR cs.DC cs.ET cs.NI 版本更新 67%

Who Needs DRAM? We Have Fiber

谁需要DRAM?我们有光纤

Hannah Atmer, Yuan Yao, Thiemo Voigt, Stefanos Kaxiras

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 针对生成式AI对高性能内存需求及超大规模数据中心扩张带来的DRAM压力,提出光纤内存架构,通过考虑光纤物理特性的架构设计及相关技术应用,可消除冗余存储并大幅降低权重传输能量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07666 2026-07-20 q-bio.QM cs.MA 版本更新 67%

A hierarchical memory architecture overcomes context limits in long-horizon multi-agent computational modeling

分层内存架构克服长期多智能体计算建模中的上下文限制

Shivendra G. Tewari, Holly Kimko

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型在长期多智能体计算建模中因无状态架构受限的问题,提出Ensemble QSP多智能体框架,其分层内存架构可保持上下文稳定,经测试能自主进行药代动力学 - 药效学模型选择,提升参数恢复能力,且架构与领域无关。

Comments 19 pages, 4 figures, 2 tables. Preprint submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04809 2026-07-09 cs.SE 版本更新 67%

Watts This Smell: A Comprehensive Taxonomy of Software Energy Smells

一种经过验证的软件能耗异味分类

Mohammadjavad Mehditabar, Saurabhsingh Rajput, Tushar Sharma

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 本文提出了一种全面的软件能耗异味分类,通过系统文献综述和雪球抽样,将320种低效模式分类为12种主要能耗异味和65种根本原因。通过实证验证,发现71%的样本存在多种共存的异味,内存相关异味的修复节能效果最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10863 2026-06-29 cs.CV 版本更新 67%

Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding

超越序列距离:模态间距离不变位置编码

Lin Chen, Bolin Ni, Qi Yang, Zili Wang, Kun Ding, Ying Wang, Houwen Peng, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, China(MAIS,自动化研究所,中国科学院,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Tencent Hunyuan Team, China(腾讯文言团队,中国)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 针对多模态大模型在长上下文中的视觉衰减问题,提出模态间距离不变位置编码(DIPE),通过解耦模态间位置编码消除距离惩罚,保持视觉感知一致性,显著缓解视觉衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03374 2026-06-23 cs.RO 版本更新 67%

eMEM: A Hybrid Spatio-Temporal Memory System For Embodied Agents

eMEM:一种面向具身智能体的混合时空记忆系统

A. Haroon Rasheed, Maria Kabtoul

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 提出eMEM混合图记忆系统,通过多索引架构和分层整合管道实现具身智能体在空间、时间和语义上的高效记忆检索,并在ProcTHOR-10K基准测试中达到80.8加权平均分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09313 2026-06-17 cs.CV 版本更新 67%

Attention Sinks in Diffusion Transformers: A Causal Analysis

扩散变换器中的注意力 sinks:一种因果分析

Fangzheng Wu, Brian Summa

机构 * Department of Computer Science, Tulane University, New Orleans, LA, USA(路易斯安那州新奥尔良大学计算机科学系)

专题命中 长上下文与记忆 :language model(abstract,abstract_cn)

AI总结 研究探讨了扩散变换器中注意力 sinks 的作用,通过动态识别并抑制注意力接收者,发现其对文本-图像对齐和偏好代理影响有限,但强干预下出现特定边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10401 2026-06-11 cs.CV 版本更新 67%

CoCoSI: Collaborative Cognitive Map Construction for Spatial Intelligence

CoCoSI: 面向空间智能的协作认知地图构建

Yiming Zhang, Ruoxuan Cao, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Cornell University(康奈尔大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 提出一种即插即用的多智能体框架,通过协作构建结构化认知地图作为空间记忆,无需修改架构或额外训练即可增强预训练多模态大模型的空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19058 2026-08-14 cs.LG cs.AI 版本更新 62%

Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training

优化器状态应存于何处?内存高效的专家混合训练分层状态分配

Nuemaan Malik

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究MoE训练中优化器状态存储位置,提出SkewAdam方法,根据参数群体差异分层分配状态,大幅减少内存占用,提升训练效率,验证了优化器状态存储位置对训练效果的重要性。

Comments 12 pages, 4 figures, 9 tables. v2: adds Adam-mini discussion, learning-rate sweeps with repeated seeds for the AdamW and Adafactor baselines, and a tier ablation; corrects the attribution of the perplexity advantage between momentum and the factored estimator. Code and per-run training logs: https://github.com/nuemaan/skewadam

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28876 2026-08-13 cs.CL cs.LG 版本更新 62%

MMLA: How Memory Lets the Past Shape the Future

内存管理的长上下文注意力:可编辑请求局部记忆的初步研究

Junyi Zou, Avrova Donz

机构 * Zjydiary(智纪日记)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 提出一种混合架构,将快速循环或稀疏骨干与可编辑的请求局部记忆槽和查询时稀疏回退相结合,以解决长上下文模型中的记忆写入、覆盖和抗污染问题。

Comments 16 pages, 11 figures, 5 tables. Substantially rewritten v3: retitled and reframed as MMLA; adds an eventized architecture, trusted row assembly, hard atomic overwrite/NULL, claim-evidence mapping, PM-I2 negative results, stop rules, and a conditional roadmap. Preserves the original Llama budget-gate failure. Project: https://github.com/MMLA-org/mmla-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-11 cs.AI cs.LG 版本更新 62%

Emergence Invariance: From Symbolized Thought to Structural Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

Comments 51 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10696 2026-08-05 cs.CL cs.AI 版本更新 62%

$π$-Attention: Online Efficient Sparse Transformers for Long-Context Modeling

π-注意力:用于高效长上下文建模的周期性稀疏变换器

Pike D. Liu, Chang Liu, Yanxuan Yu

机构 * University of California - Los Angeles(加州大学洛杉矶分校) Columbia University(哥伦比亚大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出π注意力,通过周期性稀疏结构实现高效长上下文建模,相比环形注意力在接收场增长上更优,且在相同上下文长度下使用更少的GPU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31650 2026-08-04 cs.LG cs.AI 版本更新 62%

ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL

ECHO: 在智能体强化学习中通过选择性回合记忆进行剪枝行动与追踪学习

Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Baidu Inc.(百度公司) University of Science and Technology of China(中国科学技术大学)

专题命中 长上下文与记忆 :language agent(abstract);分类 cs.AI、cs.LG

AI总结 提出ECHO框架,通过选择性回合记忆和源索引重建解决长程智能体强化学习中的历史崩溃与可追踪学习问题,在BrowseComp-Plus上达到43.4%准确率,优于GRPO和SUPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17121 2026-07-31 cs.LG cs.AI 版本更新 62%

The Topological Trouble With Transformers

Transformer 的拓扑困境

Michael C. Mozer, Shoaib Ahmed Siddiqui, Rosanne Liu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了Transformer在处理序列结构时的拓扑问题,指出其纯前馈架构限制了动态状态跟踪,提出应通过递归架构转向隐含激活动态,并介绍了连续思维Transformer架构的分类方法及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02770 2026-07-27 cs.CL cs.AI 版本更新 62%

Gemma 4 Technical Report

Gemma 4技术报告

Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Aditya Chawla, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Biao Zhang, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Jakub Adamek, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Daniele Calandriello, Glenn Cameron, Charlotte Caucheteux, Rahma Chaabouni, Garima Chadha, Jetha Chan, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Sebastian Flennerhag, Takumi Fujimoto, João Gabriel Oliveira, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Tamara von Glehn, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Mayank Gupta, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Ivan Korotkov, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Vivek Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Alon Levkovitch, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Ivan Lobov, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Maciej Mikuła, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Brendan O'Donoghue, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Nicolas Perez-Nieves, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, George Scrivener, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Bobak Shahriari, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Jean Tarbouriech, Chetan Tekur, Shantanu Thakoor, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Çağlar Ünlü, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Cindy Wu, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Morteza Zadimoghaddam, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

机构 * Google DeepMind(谷歌DeepMind)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 介绍新一代Gemma 4开源多模态语言模型,通过密集和专家混合架构提升计算效率与推理能力,提出统一无编码器架构,集成思考模式,改进多方面性能,在多基准测试中有显著提升。

Comments 17 pages, 2 figures, technical report, updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10054 2026-07-21 cs.AI cs.CL 版本更新 62%

Parallel Decoder Transformer: Planner-Conditioned Latent Coordination for Model-Intrinsic Parallel Generation

并行解码器Transformer:规划引导的潜在协调用于同步并行解码

Logan Robbins

机构 * Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 并行解码器Transformer通过规划引导的潜在协调机制,实现模型内部的同步并行解码,提升多任务生成效率。

Comments Note: Updated to reflect revised architecture

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01421 2026-07-20 cs.CL cs.LG 版本更新 62%

Learn to Memorize: Scalable Continual Learning in Semiparametric Models with Mixture-of-Neighbors Induction Memory

学习记忆:基于邻居混合归纳记忆的半参数模型中的可扩展持续学习

Guangyue Peng, Tao Ge, Wen Luo, Wei Li, Houfeng Wang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Microsoft(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究半参数语言模型中记忆缺乏学习能力的问题,提出将非参数记忆重新概念化为可学习的邻居混合归纳记忆(MoNIM),融入模型信息流,经实验验证其能提升半参数语言模型的可扩展性和持续学习性能。

Comments 15 pages, 5 figures

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 28517-28531, Vienna, Austria. Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17324 2026-06-09 cs.LG cs.AI 版本更新 62%

Capacity-Controlled Global Attention for Graph Transformers

具有容量控制的全局注意力用于图变换器

Yang Liu, Dongxin Guo, Tom Zheng, Siu Ming Yiu, Liam Ning, Jikun Wu

机构 * Brain Investing Limited The University of Hong Kong(香港大学) Stellaris AI Limited

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SigGate-GT,通过在图变换器中引入可学习的sigmoid门来缓解全局注意力的保守约束,从而解决过平滑、低秩瓶颈和训练不稳定等问题,提升了多个基准测试的性能。

Comments 13 pages, 2 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08443 2026-08-14 cs.HC cs.AI 版本更新 57%

Private Etymology: Designing Relational Reuse of Shared Symbols in Long-Term Human-AI Interaction

私人词源:设计长期人机交互中共享符号的关系性复用

Miki Ueno

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 该论文提出Private Etymology关系溯源模型,整合现有思路形成持久可修正的人机关系符号单元,以支持对话智能体在长期人机交互中安全复用特定二元组的符号表达。

Comments Added a link to the Apple Watch prototype "MikasaWatch" demonstration video on 10 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15422 2026-08-10 cs.LG 版本更新 57%

DualKV: Shared-Prompt Flash Attention for Efficient RL Training with Large Rollouts and Long Contexts

DualKV: 面向高效RL训练的共享提示Flash注意力机制,支持大规模展开和长上下文

Jiading Gai, Shuai Zhang, Xiang Song, Bernie Wang, George Karypis

机构 * Amazon Web Services(亚马逊网络服务) Google(谷歌) University of Minnesota(明尼苏达大学)

专题命中 长上下文与记忆 :post-training(abstract);分类 cs.LG

AI总结 针对RL训练中共享提示重复计算问题,提出DualKV内核,通过融合CUDA前向/反向核和veRL数据流水线重排,消除提示复制,实现1.63-3.82倍策略更新加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16465 2026-08-07 cs.AI 版本更新 57%

Berkeley and Heiserman as an Unexhausted Architecture for Embodied Machine Intelligence

伯克利和海斯曼作为具身机器智能的未穷尽架构

Christopher A. Tucker

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本文以伯克利的《符号逻辑与智能机器》及海斯曼的工作为研究对象,探讨其在具身机器智能方面贡献。他们将逻辑与硬件、行为等联系,超越静态逻辑形式,为具身机器人认知架构方法提供思路,不应被视为历史终点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02870 2026-08-06 cs.LG 版本更新 57%

Maglev: Sliding Recurrent Memory

Maglev:滑动循环记忆

Bo Liu, Qiang Liu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.LG

AI总结 本文提出Maglev,一种带固定记忆的循环Transformer架构,通过耦合模型与记忆一致性损失实现训练可并行性,在验证损失及下游预训练基准上优于基线,参数共享可减少内存。

Comments Neural Architecture Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20661 2026-08-06 cs.AI 版本更新 57%

Calibrating Transformer Attention via Task-Space Sensitivity Feedback

从虚假焦点到真实精确:基于混淆的对抗性注意力学习在Transformer中

Yawei Liu

机构 * Chinese Academy of Sciences, Computer Network Information Center(中国科学院计算机网络信息中心)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出AFA机制,通过对抗性训练优化Transformer模型的注意力分布,提升情感分析任务的准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13769 2026-08-05 cs.AI cs.CE cs.NE 版本更新 57%

OR-Agent: Bridging Evolutionary Search and Structured Research for Automated Algorithm Discovery

OR-Agent:连接进化搜索与结构化研究以实现自动化算法发现

Qi Liu, Ruochen Hao, Can Li, Wanjing Ma

机构 * Key Laboratory of Road and Traffic Engineering of the Ministry of Education(教育部道路与交通工程重点实验室) College of Transportation, Tongji University(同济大学交通运输学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 OR-Agent通过结构化树形工作流和进化-系统化构想机制,实现自动化算法发现的高效探索与科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25379 2026-07-30 cs.CL 版本更新 57%

StateRAG: Typed State Contracts for Complex Retrieval-Augmented Generation

EfficientGraph-RAG:面向跨任务检索增强生成的结构化检索状态管理

Miaohe Niu, Pengxiang Li, Jingbo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Tsinghua University, China(清华大学) Kunming University of Science and Technology, China(昆明理工大学) NiuTrans Research, Shenyang, China(沈阳NiuTrans研究院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 提出EfficientGraph-RAG框架,通过显式定义检索状态(TAM、MARS、SMP三个机制)实现结构化状态管理,在多个基准上提升答案质量并降低大模型token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15548 2026-07-30 cs.LG 版本更新 57%

Dense Local Dependencies Induce Attention-Logit Explosion and Training Instability During Long-Sequence Transformer Training

密集局部依赖会在长序列Transformer训练期间引发注意力对数爆炸和训练不稳定性

Suvadeep Hajra

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本研究揭示长序列Transformer训练中注意力对数爆炸的主因是密集局部依赖,经实验验证该增长由依赖密度驱动,提出显式建模密集局部依赖的长上下文Transformer设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏