arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2601.23219 2026-05-22 cs.MA cs.AI 57%

MonoScale: Scaling Multi-Agent System with Monotonic Improvement

MonoScale: 通过单调改进扩展多智能体系统

Shuai Shao, Yixiang Liu, Bingwei Lu, Weinan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本文提出MonoScale框架,通过生成agent条件化熟悉任务、收集交互证据并将其转化为可审计的自然语言记忆,实现多智能体系统的单调性能提升,实验表明其在GAIA和Humanity's Last Exam任务中优于简单扩展和强路由固定池基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06526 2026-05-20 cs.DC cs.AI cs.AR 57%

PiKV: KV Cache Management System for Mixture of Experts

PiKV: 一种用于混合专家架构的键值缓存管理系统

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Yale University(耶鲁大学) Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出PiKV,一种专为混合专家架构设计的并行分布式键值缓存服务框架,通过专家分片缓存、PiKV路由和PiKV调度来减少缓存访问开销,并通过压缩模块降低内存使用。

Comments Github Link: https://github.com/NoakLiu/PiKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19219 2026-05-20 cs.AI 57%

SimGym: A Framework for A/B Test Simulation in E-Commerce with Traffic-Grounded VLM Agents

SimGym:一种用于电子商务A/B测试模拟的框架,使用基于流量的VLM代理

Han Li, Vibhor Malik, Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ailin Fan, Keat Yang Koay, Yuanzheng Zhu, Meysam Feghhi, Ronie Uliana, Zhaoyu Zhang, Angelo Ocana Martins, Mingyu Zhao, Francis Pelland, Jonathan Faerman, Nikolas LeBlanc, Aaron Glazer, Andrew McNamara, Zhong Wu, Lingyun Wang

机构 * Shopify

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出SimGym框架,通过基于流量的VLM代理模拟电子商务A/B测试,解决真实测试周期长、风险高等问题,验证结果显示其能快速准确预测用户行为变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16947 2026-05-19 cs.CV cs.AI 57%

LightZeroNav: Zero-Shot Vision Language Navigation in Continuous Environments Based on Lightweight VLMs

LightZeroNav: 基于轻量级VLMs的连续环境中零样本视觉语言导航

Kun Luo, Xiangyu Dong, Xiaoguang Ma, Haoran Zhao, Yaoming Zhou

机构 * Foshan Graduate School of Innovation, Northeastern University(创新研究生院,东北大学) Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学) School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北航) QingniaoAI, China(清北AI,中国)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出LightZeroNav,通过轻量级VLMs解决连续环境中零样本视觉语言导航的三大瓶颈,无需特定训练或图搜索,在RGB观测和轻量级Qwen3-VL-8B模型下实现与GPT-4o相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21185 2026-05-19 cs.LG 57%

The Diffusion Duality, Chapter II: $Ψ$-Samplers

扩散对偶性,第二章:Ψ-采样器

Justin Deschenaux, Caglar Gulcehre, Subham Sekhar Sahoo

机构 * EPFL, Lausanne, Switzerland(苏黎世联邦理工学院,洛桑分校) Microsoft AI(微软人工智能) Cornell Tech, NY(康奈尔科技)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文提出了一种通用的预测-校正采样器,用于离散扩散模型,提升了语言和图像建模的生成质量,并展示了其在训练效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15812 2026-05-18 cs.HC cs.AI 57%

Toward Natural and Companionable Virtual Agents via Cross-Temporal Emotional Modeling

通过跨时间情感建模实现自然和陪伴型虚拟代理

Feier Qin, Xiao Li, Yi Zheng, Haibin Huang, Hanyao Wang, Xiaoyu Wang, Yan Lu, Yuan Zhang

机构 * Communication University of China(中国通信大学) Microsoft Research Asia(微软亚洲研究院) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI

AI总结 本文提出CTEM框架,通过链接长期行为历史与即时情感表达,提升虚拟代理的自然性和情感和谐度,实验显示在21天的真实场景中效果显著。

Comments 21 pages, published in CHI '26

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10813 2026-05-18 cs.AI 57%

NanoResearch: Co-Evolving Skills, Memory, and Policy for Personalized Research Automation

NanoResearch: 为个性化研究自动化共进化技能、记忆与政策

Jinhang Xu, Qiyuan Zhu, Yujun Wu, Zirui Wang, Dongxu Zhang, Marcia Tian, Yiling Duan, Siyuan Li, Jingxuan Wei, Sirui Han, Yike Guo, Odin Zhang, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Zhejiang University(浙江大学) Xi'an Jiaotong University(西安交通大学) East China University of Science and Technology(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本文提出NanoResearch框架,通过三重共进化解决研究自动化中的个性化需求,提升研究效率与用户体验。

Comments 40 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03922 2026-05-18 cs.LG 57%

Online Vector Quantized Attention

在线向量量化注意

Nick Alonso, Tomas Figliolia, Beren Millidge

机构 * Zyphra

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文提出OVQ注意机制,通过稀疏内存更新提升长上下文处理能力,在保持线性计算和常数内存的同时,显著优于线性注意和SSM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14833 2026-05-15 cs.AI cs.HC 57%

Emotion-Attended Stateful Memory (EASM):The Architecture for Hyper-Personalization at Scale

情感关注状态记忆(EASM):大规模超个性化的人机交互架构

Vineet Kotecha, Vansh Gupta

机构 * divAIne Research(divAIne研究)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出EASM架构,通过长期历史、情绪信号和推断意图动态构建用户特定对话上下文,实验表明其在记忆基础、计划清晰度和情感验证方面显著优于无状态基线。

Comments 18 pages, 3 figures, 3 tables. Industry research whitepaper. Includes controlled A/B evaluation across 30 scenarios and 6 emotional categories

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13941 2026-05-15 q-bio.NC cs.AI cs.CV eess.IV 57%

Shared representations in brains and models reveal a two-route cortical organization during scene perception

大脑与模型中的共享表征揭示了场景感知期间的双路由皮层组织

Pablo Marcos-Manchón, Lluís Fuentemilla

机构 * Department of Cognition, Development and Education Psychology, Faculty of Psychology, University of Barcelona(认知、发展与教育心理学系,心理学学院,巴塞罗那大学) Institute of Neurosciences, University of Barcelona(神经科学研究所,巴塞罗那大学) Bellvitge Institute for Biomedical Research(Bellvitge生物医学研究 institute)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 研究通过7T fMRI数据揭示了场景感知中双路由皮层组织,发现视觉和语言模型在表征结构上的差异。

Comments for associate code, see https://github.com/memory-formation/convergent-transformations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13651 2026-05-14 cs.SD cs.AI 57%

NAACA: Training-Free NeuroAuditory Attentive Cognitive Architecture with Oscillatory Working Memory for Salience-Driven Attention Gating

NAACA:无训练神经听觉注意力认知架构:具有振荡工作记忆的显著性驱动注意力门控

Zhongju Yuan, Geraint Wiggins, Dick Botteldooren

机构 * WAVES Research Group, Ghent University, Gent, Belgium(根特大学WAVES研究组,比利时根特) AI Lab, Vrije Universiteit Brussel, Brussel, Belgium(布鲁塞尔自由大学AI实验室,比利时布鲁塞尔) EECS, Queen Mary University of London, London, UK(伦敦大学学院女王学院电子工程与计算机科学系,英国伦敦)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 NAACA通过振荡工作记忆实现听觉显著性过滤,提升音频理解精度并减少冗余处理,实验显示在XD-Violence数据集上AP提升17.1%。

Comments Accepted as a regular paper by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13357 2026-05-14 cs.SE cs.AI 57%

AI Harness Engineering: A Runtime Substrate for Foundation-Model Software Agents

AIHarness工程:一种用于基础模型软件代理的运行时基质

Hailin Zhong, Shengxin Zhu

机构 * Hong Kong Baptist University(香港 Baptist大学) Beijin Normal University(北京师范大学)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI

AI总结 本文提出AIHarness工程,通过运行时基质提升软件代理的工程能力,定义了十一项核心职责,并提出四层 ladder 框架和基于追踪的评估协议,以验证模型-基质-环境系统生成可验证、可归因和可维护的变更。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12294 2026-05-13 cs.AI 57%

Executable Agentic Memory for GUI Agent

可执行代理记忆用于GUI代理

Zerui Qin, Sheng Yue, Xingyuan Hua, Yongjian Fu, Ju Ren

机构 * Tsinghua University, China(清华大学, 中国) Sun Yat-sen University, China(中山大学, 中国)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出EAM,一种结构化知识图谱,通过检索与执行过程提升GUI规划的鲁棒性,实验显示其在AndroidWorld上优于现有基线模型,并显著降低token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10970 2026-05-13 cond-mat.dis-nn cs.AI 57%

Context-Gated Associative Retrieval: From Theory to Transformers

上下文门控关联检索:从理论到变换器

Moulik Choraria, Argyrios Gerogiannis, Vidhata Jayaraman, Ankur Mani, Lav R. Varshney

机构 * UIUC(伊利诺伊大学香槟分校) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Stony Brook University(石溪大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本文提出一种两阶段关联记忆架构,通过上下文门在检索前和过程中重塑能量景观,理论证明其提升检索性能,并将理论应用于变换器,验证上下文学习作为门控检索的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10870 2026-05-12 cs.AI 57%

Remember the Decision, Not the Description: A Rate-Distortion Framework for Agent Memory

记住决策,而非描述:一种面向代理记忆的速率-失真框架

Mingxi Zou, Zhihan Guo, Langzhang Liang, Zhuo Wang, Qifan Wang, Qingsong Wen, Irwin King, Lizhen Qu, Zenglin Xu

机构 * Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Meta AI AI Research Institute, Squirrel Ai Learning(Squirrel Ai Learning人工智能研究院) Monash University(墨尔本大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 长上下文与记忆 :language agent(abstract);分类 cs.AI

AI总结 本文提出一种以决策为核心的速率-失真框架,用于代理记忆管理,通过优化内存预算与决策质量的权衡,提出DeMem算法在合成数据和对话任务中提升了决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10537 2026-05-12 cs.CL 57%

Mela: Test-Time Memory Consolidation based on Transformation Hypothesis

Mela:基于转换假说的测试时记忆巩固

Lungchuan Chen

机构 * MusubiAI

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 Mela通过引入层次记忆模块HMM,实现测试时在线记忆巩固,提升语言模型在长上下文和多粒度记忆表示上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09278 2026-05-12 cs.AI 57%

EquiMem: Calibrating Shared Memory in Multi-Agent Debate via Game-Theoretic Equilibrium

EquiMem:通过博弈论均衡校准多智能体辩论中的共享内存

Yuqiao Meng, Sakshi Sunil Narvekar, Luoxi Tang, Rupali Rajendra Vaje, Yingxue Zhang, Muchao Ye, Zhaohan Xi

机构 * Binghamton University, State University of New York(宾夕法尼亚州立大学布林茅尔分校) University of Iowa(爱荷华大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 本文提出EquiMem,通过博弈论均衡校准多智能体辩论中的共享内存,解决传统方法在过滤错误信息时的不足,提升内存增强推理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02494 2026-05-12 cs.LG q-bio.NC 57%

MEG-XL: Data-Efficient Brain-to-Text via Long-Context Pre-Training

MEG-XL:通过长上下文预训练实现数据高效的脑-文本转换

Dulhan Jayalath, Oiwi Parker Jones

机构 * PNPL assets/pnpl.png , University of Oxford(PNPL资产/pnpl.png,牛津大学)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 MEG-XL通过长上下文预训练提升数据效率,利用2.5分钟的MEG上下文捕捉扩展神经上下文,优于传统方法,在脑数据词解码任务中表现更优。

Comments Published as a conference paper at ICML 2026. 19 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08217 2026-05-12 cs.LG cs.IR 57%

Retrieval Mechanisms Surpass Long-Context Scaling in Time Series Forecasting

检索机制在时间序列预测中超越长上下文扩展

Rishi Ahuja, Kumar Prateek, Simranjit Singh, Vijay Kumar

机构 * Department of Information Technology, Dr. B.R. Ambedkar National Institute of Technology(德拉·B.R.阿姆贝卡尔国家理工学院信息科技系)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 研究通过ETTh1基准测试发现,长上下文模型在时间序列预测中表现不佳,而检索增强预测方法在减少计算量的同时提升了预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08188 2026-05-12 cs.CV cs.AI 57%

Neuroscience-Inspired Analyses of Visual Interestingness in Multimodal Transformers

受神经科学启发的多模态Transformer中视觉趣味性分析

Mathis Immertreu, Fitim Abdullahu, Thomas Kinfe, Helmut Grabner, Patrick Krauss, Achim Schilling

机构 * Cognitive Computational Neuroscience Group, Patter Recognition Lab, University Erlangen-Nürnberg(认知计算神经科学组、模式识别实验室、埃尔兰根-纽伦堡大学) IDS Institut für Data Science, ZHAW School of Engineering, Winterthur, Switzerland(IDS数据科学研究所、ZHAW工程学院、温特图尔,瑞士) Mannheim Center for Neuromodulation and Neuroprosthetics, University Hospital Mannheim, Heidelberg University(曼海姆神经调制与神经假体中心、曼海姆大学医院、海德堡大学) BGU Ludwigshafen, Germany(BGU路易斯港,德国) Physics and Cognition Group, MCNN, University Hospital Mannheim, Heidelberg University(物理与认知组、MCNN、曼海姆大学医院、海德堡大学) NeuroAI and BCI Group, MCNN, University Hospital Mannheim, Heidelberg University(神经AI与BCI组、MCNN、曼海姆大学医院、海德堡大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 研究通过多模态视觉语言模型Qwen3-VL-8B探讨视觉趣味性编码机制,发现CI信息可从最终层嵌入中线性解码,揭示了无监督下视觉趣味性的结构化编码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00814 2026-05-11 cs.CV cs.AI 57%

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

持久视觉记忆:在大型视觉-语言模型中维持感知以实现深度生成

Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Zefeng He, Muxin Fu, Daizong Liu, Wei-Long Zheng, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tongji University(同济大学) Wuhan University(武汉大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出PVM模块,通过增强视觉证据的持续访问能力,解决LVLMs中视觉信号稀释问题,提升复杂推理任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22766 2026-05-11 cs.LG 57%

Sparse Attention as Compact Kernel Regression

稀疏注意力作为紧凑核回归

Saul Santos, Nuno Gonçalves, Daniel C. McNamee, Marcos Treviso, André F. T Martins

机构 * Instituto Superior Técnico & Instituto de Telecomunicações, Universidade de Lisboa, Portugal(里斯本大学理工学院及电信研究所,葡萄牙) Champalimaud Research, Lisbon, Portugal(Champalimaud研究,葡萄牙里斯本) TransPerfect, Lisbon, Portugal(TransPerfect,葡萄牙里斯本) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,美国匹兹堡)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文通过核理论将稀疏注意力与紧凑核回归联系起来,揭示了ReLU和sparsemax注意力与Epanechnikov核回归的关系,并展示了核方法在注意力设计中的应用。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06416 2026-05-08 cs.CL 57%

MiA-Signature: Approximating Global Activation for Long-Context Understanding

MiA-Signature:近似全局激活以实现长上下文理解

Yuqing Li, Jiangnan Li, Mo Yu, Zheng Lin, Weiping Wang, Jie Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Pattern Recognition Center, WeChat AI, Tencent(微信AI模式识别中心) Hunyuan Team, Tencent(腾讯文心一言团队)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL

AI总结 本文提出MiA-Signature,通过压缩表示近似全局激活对下游处理的影响,提升长上下文理解任务的性能。

Comments This is a work in progress; we will continue to revise and improve the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04334 2026-05-08 cs.CV cs.LG 57%

Submanifold Sparse Convolutional Networks for Automated 3D Segmentation of Kidneys and Kidney Tumours in Computed Tomography

子流形稀疏卷积网络用于计算机断层扫描中肾脏及肾肿瘤的自动三维分割

Saúl Alonso-Monsalve, Leigh H. Whitehead, Adam Aurisano, Lorena Escudero Sanchez

机构 * ETH Zürich, Institute for Particle Physics and Astrophysics(苏黎世联邦理工学院,粒子物理与天体物理研究所) University of Cambridge, Department of Physics(剑桥大学,物理系) University of Cincinnati, Department of Physics(辛辛那提大学,物理系) University of Cambridge, Department of Radiology(剑桥大学,放射学系)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 本文提出基于体素稀疏化和子流形稀疏卷积网络的两阶段3D分割方法,用于提高CT图像中肾脏及肿瘤的分割效率与精度,实验表明其在速度和内存使用上均优于现有方法。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26774 2026-04-30 cs.CV cs.AI 57%

MemOVCD: Training-Free Open-Vocabulary Change Detection via Cross-Temporal Memory Reasoning and Global-Local Adaptive Rectification

MemOVCD:基于跨时间记忆推理和全局局部自适应校正的无训练开放词汇变化检测

Zuzheng Kuang, Honghao Chang, Boqiang Liang, Haoqian Wang, Lijun He, Fan Li, Haixia Bi

机构 * School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI

AI总结 MemOVCD通过跨时间记忆推理和全局局部自适应校正,解决开放词汇变化检测中时间耦合不足和局部碎片化问题,验证了其在多基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25562 2026-04-29 cs.CR cs.AI 57%

SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents

SnapGuard: 基于截图的轻量级提示注入检测方法

Mengyao Du, Han Fang, Haokai Ma, Jiahao Chen, Kai Xu, Quanjun Yin, Ee-Chien Chang

机构 * National University of Defense Technology(国防科技大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 针对基于截图的网络代理面临的提示注入攻击问题,提出SnapGuard方法,通过视觉稳定指标和文本信号分析实现高效检测,达到F1得分0.75,速度提升8倍。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26554 2026-04-29 cs.LG stat.ML 57%

Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory

谱优化器在关联记忆学习中的容量扩展分析

Juno Kim, Eshaan Nichani, Denny Wu, Alberto Bietti, Jason D. Lee

机构 * UC Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) New York University(纽约大学) Flatiron Institute(Flatiron研究所)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文研究了谱优化器在关联记忆问题中的性能,发现Muon的存储容量显著超过SGD,且在仅使用一阶信息时可与牛顿法匹配。通过实验验证了预测的扩展规律,为更实际的语言建模任务提供了理论基础。

Comments 84 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03269 2026-04-28 cs.CV cs.LG 57%

LoGeR: Long-Context Geometric Reconstruction with Hybrid Memory

LoGeR:长上下文几何重建与混合记忆

Junyi Zhang, Charles Herrmann, Junhwa Hur, Chen Sun, Ming-Hsuan Yang, Forrester Cole, Trevor Darrell, Deqing Sun

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 LoGeR通过混合记忆模块实现长序列的高精度3D重建,无需后优化,有效解决长视频中的上下文一致性问题,优于现有方法。

Comments Project page: https://LoGeR-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00130 2026-04-28 cs.MA cs.AI math.DS 57%

Agentic Hives: Equilibrium, Indeterminacy, and Endogenous Cycles in Self-Organizing Multi-Agent Systems

代理蜂群:自组织多智能体系统中的均衡、不确定性与内生循环

Jean-Philippe Garnier

机构 * BrainiaK

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出代理蜂群框架,研究自组织多智能体系统中人口动态、均衡存在性及内生循环等核心问题,通过多部门增长理论证明七个分析结果,构建参数空间治理工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22678 2026-04-27 cs.CL 57%

BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

BERAG:基于贝叶斯集成的检索增强生成用于基于知识的视觉问答

Jinghong Chen, Jingbiao Mei, Guangyu Yang, Bill Byrne

机构 * Department of Engineering(工程系)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 BERAG通过将语言模型条件于单个检索文档而非单一上下文,解决检索增强生成中文档贡献不明和长上下文中的信息丢失问题,提升视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏