arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 772 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 37 篇

2608.08300 2026-08-11 cs.AI cs.CL 新提交 85%

Mitigating Over-Personalization in LLMs via Structured Memory

通过结构化内存缓解大型语言模型(LLM)中的过度个性化问题

Hakeem Hannoon, Andrew Zhao, Mihir Narayan, Sharvin Goyal, Ivaxi Sheth

机构 * University of Saskatchewan(萨斯喀彻温大学) University of California–Irvine(加州大学欧文分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Obra D. Tompkins High School(奥布拉·D.汤普金斯高中)

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 该研究针对内存增强LLM的跨域泄漏和内存诱导谄媚问题,提出推理时按领域划分内存的结构化呈现方法,在PersistBench七个模型上平均降低8.8%跨域泄漏且保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11665 2026-08-11 cs.NE cs.AI 84%

Beyond LLMs, Sparse Distributed Memory, and Neuromorphics <A Hyper-Dimensional SRAM-CAM "VaCoAl" for Ultra-High Speed, Ultra-Low Power, and Low Cost>

超越LLM、稀疏分布式记忆和神经形态计算:一种用于超高速、超低功耗和低成本的超维SRAM-CAM“VaCoAl”

Hiroyuki Chuma, Kanji Otsuka, Yoichi Sato

机构 * Hitotsubashi University(立命馆大学) Meisei University(立命馆大学) Shuhari System(Shuhari系统)

专题命中 长上下文与记忆 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VaCoAl算法,通过超维计算和伽罗瓦域扩散,在SRAM/DRAM-CAM上实现可逆、可审计的多跳推理,解决灾难性遗忘和绑定问题,并在维基数据上验证了其路径依赖的STDP式选择机制。

Comments 58 pages, 4 figure, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08684 2026-08-11 cs.LG cs.AI 新提交 82%

RippleKV: Cross-Layer KV Cache Allocation via Perturbation Propagation

RippleKV:基于扰动传播的跨层KV缓存分配

Dongjie Xu, Kai Qian, Julius, Weijie Shi, Yuxuan Sun, Minghua Tang, Fenglei Jin, Hanchi Dong, Jiajie Xu

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 针对长上下文LLM推理的KV缓存分配问题,提出RippleKV方法,通过层值缓存扰动敏感性分配预算,在LongBench上的匹配缓存预算下实现了最高平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08236 2026-08-11 cs.AI cs.CL 新提交 82%

LatticeMind: A Conflict-Aware Memory Primitive for Multi-Agent Systems

LatticeMind:面向多智能体系统的冲突感知记忆原语

Heng Zhou, Lian Zhang, Yutao Fan, Tiancheng He, Siki Chen, Hejia Geng, Philip Torr, Zhenfei Yin

机构 * University of Science and Technology of China(中国科学技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai AI Laboratory(上海人工智能实验室) Beijing University of Posts and Telecommunications(北京邮电大学) University of Oxford(牛津大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出冲突感知记忆原语LatticeMind,解决多智能体LLM系统的主张信任决策问题,在ConflictBank评估中准确率达0.97,显著优于基线, ablation验证了其核心组件的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02508 2026-08-11 cs.LG cs.CL 版本更新 82%

RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States

RoMeRL:通过降阶效用状态平衡自进化智能体记忆中的反馈覆盖与记忆-奖励陷阱

Yi Yang, Zhennan Chen, Yihong Zhuang, Tiehan Fan, Yinan Chen, Jian Li, Jian Yang, Ying Tai

机构 * Nanjing University(南京大学) Xiamen University(厦门大学) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 RoMeRL通过降阶效用状态解决自进化LLM智能体记忆的反馈分散与记忆-奖励陷阱问题,在ALFWorld等基准上显著提升任务性能、降低记忆规模与LLM调用

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09184 2026-08-11 cs.AI 新提交 81%

Agentic Router: An Execution-Grounded Continual Learning Approach With Memory

智能体路由器:一种基于执行的带记忆的持续学习方法

Yuxuan Chen, Rongpeng Li, Zhifeng Zhao, Yuntao Liu, Xing Xu, Honggang Zhang

机构 * Zhejiang University(浙江大学) Zhejiang Lab(之江实验室) State Grid Hebei Electric Power Co., Ltd.(国网河北省电力有限公司) Macau University of Science and Technology(澳门科技大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对CLI-based SONiC操作,提出基于执行的双路径后果感知智能体,通过生成动作、预测后果、重排序选择,提升可行动作覆盖度与执行成功率,两条路径互补增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08795 2026-08-11 cs.CR cs.CL 新提交 81%

Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection

迈向元认知少样本间接提示注入:基于结果条件反射的策略抽象

Sihan Hou, Xinmeng Hou, Zhijun Zhang, Zehao Wang, Xuhong Ren, Sibo Qin, Kuntharrgyal Khysru, Qing Guo

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SAVOR方法,将攻击适配转向离线策略蒸馏,仅需一次目标智能体查询,在多基准与模型上攻击成功率显著优于现有方法,且记忆可跨防御迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08446 2026-08-11 cs.AI 新提交 81%

TRACE-Memory: Public-Conditioned Retrieval and Utility-Aware Evidence Admission for Personalized Generation

TRACE-Memory:用于个性化生成的公共条件检索与效用感知证据接纳

Jing Wang, Zhu Wang, Yifan Guo, Yulong Yang, Yunji Liang

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对个性化生成系统中记忆使用的效用问题,提出TRACE-Memory两阶段框架,经多阶段训练后在三类数据集的4500个任务上表现优于多种记忆使用方法,支持选择性个性化。

Comments 9 pages, 4 figures, and 6 tables. Submitted to the 41st AAAI Conference on Artificial Intelligence (AAAI 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07429 2026-08-11 cs.AI 版本更新 79%

TEPA: Revoking Stale Memories for Conflict-Robust Language Agents

TEPA:撤销过时记忆以构建冲突鲁棒的语言智能体

Yan Zhou, Yue Ouyang, Kaiyang Zheng, Suncheng Xiang

专题命中 长上下文与记忆 :language agent(title,abstract);分类 cs.AI

AI总结 该研究针对语言智能体的记忆污染问题,提出TEPA可撤销证据记忆机制,经多场景实验证实其能有效避免过时记忆干扰,性能优于仅追加、最后写入获胜等机制。

Comments 14 pages, 9 figures; includes supplementary material. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13643 2026-08-11 cs.CV 版本更新 78%

Adversarially Robust Few-Shot Anomaly Detection with Vision Foundation Models

基于视觉基础模型的对抗鲁棒小样本异常检测

Akib Mohammed Khan, Bartosz Krawczyk

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 长上下文与记忆 :foundation model(title,abstract)

AI总结 该研究针对视觉基础模型的小样本异常检测场景,提出无需训练骨干网络的对抗鲁棒方法,经实验在多数据集上提升了对抗检测性能,且保持较高干净准确率。

Comments Accepted to BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13884 2026-08-11 cs.AI 版本更新 77%

Experience Memory Graph: One-Shot Error Correction for Agents

经验记忆图:智能体的一次性错误纠正

Wenjun Wang, Yuchen Fang, Fengrui Liu, Zibo Liang, Kai Zheng

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体在复杂任务中易出错且难恢复的问题,提出经验记忆图框架,将失败恢复转化为图匹配问题,训练时提取相关子图和路径存储,测试时指导智能体,实验证明其性能优于现有基线且无需测试时反复试验。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07622 2026-08-11 cs.AI cs.IR cs.LG 新提交 76%

Controlled Memory Interference in Continual LLM Agents

持续大型语言模型智能体中的可控记忆干扰

Ao Ding, Hongzong LI, Shiqin Tang, Li Zhang, Liang Chen, Xuyang Chen, Zi Liang

机构 * China University of Geosciences (Beijing)(中国地质大学(北京)) Northwestern Polytechnical University(西北工业大学) The Hong Kong University of Science and Technology(香港科技大学) Chinese Academy of Sciences(中国科学院) The Hong Kong Polytechnic University(香港理工大学) École polytechnique fédérale de Lausanne(洛桑联邦理工学院) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI、cs.LG

AI总结 本研究提出可控记忆干扰(CMI)框架,揭示记忆进化受经验相互作用影响,为持续大型语言模型智能体的记忆系统提供诊断与学习方法,提升记忆更新区分度与任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07663 2026-08-11 cs.CV cs.AI cs.CL 新提交 73%

Keep It Simple: Multi-Key Episodic Memory Retrieval for Ultra-Long Video Understanding

保持简洁:用于超长视频理解的多键情景记忆检索

Yeeun Choi, Youngbeom Yoo, Joon-Young Lee, Hyolim Kang, Seon Joo Kim

机构 * Yonsei University(延世大学) Adobe Research(奥多比研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对超长视频理解的两阶段范式需求,提出MERIT框架,通过多键表示与按需时间扩展实现精准检索,在三个长视频基准数据集上取得最优性能。

Comments Accepted to ECCV 2026 (Oral). Project Page: https://choi-yeeun.github.io/MERIT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25975 2026-08-11 cs.LG cs.AI cs.IT math.IT 版本更新 73%

Rethinking KV Cache Eviction via a Unified Information-Theoretic Objective

重新思考通过统一信息论目标的KV缓存淘汰

Jiaming Yang, Chenwei Tang, Liangli Zhen, Jiancheng Lv

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国) Institute of High Performance Computing, A STAR, Singapore(高性能计算研究院,新加坡)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CapKV方法,通过信息论原理优化KV缓存淘汰,提升内存效率与生成质量。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09046 2026-08-11 cs.CL cs.CY 新提交 70%

Measuring the Tokenization Premium: A Cost Audit for Underserved Language Communities

标记化溢价的衡量:服务不足语言社区的成本审计

Avijit Roy, Proma Roy, Hrishitva Patel

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过构建标记化公平审计(TEA)基准,测量了孟加拉语、印地语等5种语言的标记化溢价,发现标记化会给服务不足语言社区带来经济和功能障碍,凸显需重视标记化的公平性。

Comments Accepted at IJCAI 2026 Workshop (https://lm4uc.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08569 2026-08-11 cs.AI cs.SD 新提交 70%

VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference

VoxZip:面向长上下文音频推理的语义锚定时序KV缓存压缩

Wenxu Jia, Dongjie Fu, Xize Cheng, Fangming Feng, Linjun Li, Wenshi Chen, Yingming Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学) Meituan(美团)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对语音大语言模型长上下文推理的KV缓存内存瓶颈,提出无训练两阶段语义锚定框架VoxZip,在多音频基准上实现高效压缩,维持高性能并提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08077 2026-08-11 cs.AI cs.MA cs.RO 新提交 70%

Explore, Map, Remember, Decide: Are Embodied VLMs Ready for Safety-Critical Scenarios?

探索、建图、记忆、决策:具身视觉语言模型是否已准备好应对安全关键场景?

Gabriele La Malfa, Nitay Alon, Emanuele La Malfa, Reuth Mirsky, Stefan Sarkadi

专题命中 长上下文与记忆 :language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文扩展ToS框架为EMRD流程,评估VLMs在安全关键场景下的空间理解与决策能力,发现其决策依赖文本先验、空间推理受低光照影响,且记忆与人类认知存在根本差异,存在对齐风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07915 2026-08-11 cs.LG 新提交 70%

SPECTRA: Pushing the KV Cache Beyond the 2-Bit Cliff via Spectral Transform Coding

SPECTRA:通过谱变换编码将KV缓存推向2比特极限之外

Jiamu Zhang, Liang Wu, Kelly Wan, Hanjie Chen, Liangjie Hong

机构 * Nokia(诺基亚) Rice University(莱斯大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SPECTRA是一种无需训练的KV缓存压缩编解码器,通过谱变换编码将比特预算集中于关键通道,在Llama-3.1-8B等模型上实现最高12倍压缩,突破2比特极限,提升长上下文处理能力

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28126 2026-08-11 cs.AI 版本更新 70%

ConMem: Contribution-Aware Memory for Long-Horizon Manufacturing Inspection Logs

ConMem:面向长周期制造检查日志的贡献感知记忆

Bingchen Liu, Yuanyuan Fang, Lei Liu, Guangyuan Dong, Xing Fu, Yuanyuan Gao, Shuyue Wei, Xin Li, Xiangtian Meng

机构 * Shandong University(山东大学) Boston University(波士顿大学) North China Electric Power University(华北电力大学) National University of Singapore(新加坡国立大学) Joint SDU-NTU Centre for Artificial Intelligence Research (C-FAIR), Shandong University(山东大学-南洋理工大学人工智能联合研究中心(C-FAIR)) Rizhao Steel Holding Group Co., Ltd.(日照钢铁控股集团有限公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对长周期制造检查日志的早期风险筛查需求,提出ConMem贡献感知记忆框架,通过Shapley风格评估保留高价值证据,在真实数据集上实现76.0% QA准确率,大幅减少输入token数与响应时间,可有效保留弱早期信号并提供预警。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01916 2026-08-11 cs.AI 版本更新 70%

ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair

ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复

Chiwang Luk, Matin Mohammad Najafi, Zhifeng Jia, Wei Yang, Xiuchang Li, Jinwei Zhu, Yang Ren, Lei Chen, Gao Cong

机构 * Huawei(华为) HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21379 2026-08-11 cs.NE cs.AI 版本更新 70%

How to Build Marcus's Algebraic Mind: Algebro-Deterministic Substrate over Galois Fields

如何构建马库斯的代数心智:基于伽罗瓦域的代数确定性介质

Hiroyuki Chuma, Kanji Otsuk, Yoichi Sato

机构 * Institute of Innovation Research, Hitotsubashi University(立命馆大学创新研究所) Meisei University(立命馆大学) Shuhari System(Shuhari系统)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于伽罗瓦域的代数确定性介质,实现了马库斯提出的三种认知架构核心要素,并展示了该架构在逻辑推理和语义区分方面的应用。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02704 2026-08-11 cs.CL 版本更新 70%

InfMem: Learning System-2 Memory Control for Long-Context Agent

InfMem: 面向长上下文智能体的系统2记忆控制

Xinyu Wang, Mingze Li, Peng Lu, Xiao-Wen Chang, Lifeng Shang, Jinping Li, Fei Mi, Prasanna Parthasarathi, Yufei Cui

机构 * McGill University(麦吉尔大学) Noah's Ark Lab(诺亚实验室)

专题命中 长上下文与记忆 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 InfMem通过预思考-检索-写作协议实现系统2风格的控制,有效提升超长文档推理的准确率并减少推理时间。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09181 2026-08-11 cs.SE cs.CR 新提交 67%

Memoir: Learning, Verifying, and Evolving False-Positive Memories for Static Application Security Testing Tools

Memoir:针对静态应用安全测试工具的误报记忆学习、验证与演化

Shenyuan Guan, Qiaodan Hou, Yanjun Chen, Xincheng Wen, Jia Feng, Keke Lian, Cuiyun Gao

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 本研究针对SAST工具的误报问题,提出Memoir框架,通过构建与演化语义记忆实现误报识别,在CWE-Bench-Java上表现优异,且记忆库可跨工具泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08995 2026-08-11 cs.MA 新提交 67%

Muscle Memory for Agents: Compile not Merely Retrieve

智能体的肌肉记忆:编译而非仅检索

Pouya Ghiasnezhad Omran, Soujanya Lanka, Qin Zhang, Tanya Dixit

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn)

AI总结 本文提出将重复用户意图编译为专用专家智能体的肌肉记忆范式,通过四阶段流水线实现,在90个场景中专家触发时胜率达88.9%,优于传统检索模式,为智能体记忆设计提供新方向。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08075 2026-08-11 cs.IR cs.CV cs.MM 新提交 67%

Search over the Visual World: Persistent Visual Memory, Layered Indexes, and Source-Grounded Evidence

视觉世界的搜索:持久视觉记忆、分层索引与基于源的证据

Sankalp Nagaonkar, Rohit Garg, Ankit Raj, Ashish Choithani, Ashutosh Trivedi

专题命中 长上下文与记忆 :foundation model(abstract);pretraining(abstract)

AI总结 该研究针对智能体持续观测视觉数据的场景,提出基于持久视觉记忆等的视频检索基础设施模型,经9800+查询对比,通用组件流水线在Recall@1/@3/@10上优于商业视频原生引擎

Comments 33 pages, 5 figures, 17 tables. Technical report. Benchmark configurations and reproduction instructions: https://github.com/video-db/search-over-the-visual-world

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09508 2026-08-11 physics.app-ph cond-mat.mtrl-sci 新提交 67%

200 mm Wafer-Scale Monolithic 3D Integration of Atomic Layer-Deposited Oxide Semiconductors

200毫米晶圆级原子层沉积氧化物半导体的单片三维集成

Chang Niu, Linjia Long, Luqi Zheng, Shuting Du, Jian-Yu Lin, Kisoo Nam, Zehao Lin, Chang Liu, Juanjuan Lu, Haiyan Wang, Haitong Li, Peide D. Ye

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本研究实现200毫米晶圆级三层ALD InOx基器件的M3D集成,开发四层三维存算一体加速器,为下一代AI硬件提供可扩展且兼容CMOS的平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16573 2026-08-11 cs.NE 版本更新 67%

How to Build Marcus's Algebraic Mind: From Thagard's Brain--Mind Viewpoint

如何构建马库斯的代数思维:从萨伽德的脑-心观点出发

Hiroyuki Chuma, Kanji Otsuka, Yoichi Sato

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 该研究从萨伽德的脑-心观点出发,探讨如何构建马库斯的代数思维。提出VaCoAl和PyVaCoAl架构,其绑定操作具有可逆等特性,能填补马库斯代数思维组件空缺,消除卷积退化,还通过相关主张阐述了能力、必要性及自身立场。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-11 cs.AI cs.LG 版本更新 62%

Emergence Invariance: From Symbolized Thought to Structural Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

Comments 51 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08081 2026-08-11 cs.NE cs.LG 新提交 57%

RotaryQuant: Fitting 120B MoE Models on Consumer Hardware via Fused Compressed-Space Attention

RotaryQuant:通过融合压缩空间注意力在消费级硬件上运行1200亿参数的混合专家模型

Anthony. Lui, Mohamed. Elsaied, N. P. Savani

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 RotaryQuant通过三轴压缩系统及IsoQuant等技术,在消费级硬件上实现1200亿参数MoE模型的高效运行,内存占用低且性能损失极小。

Comments 9 Pages, 9 Tables, Initial submission into NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07943 2026-08-11 cs.AI 新提交 57%

Locating Failure in Multi-Page Visually Rich Document Understanding: An Empirical Attribution

多页视觉丰富文档理解中的故障定位:实证归因

Lewei Xu, Yihao Ding, Zihan Xu, Daniel Yitian Su, Daochang Liu, Siwen Luo, Yifan Peng, Wei Liu

机构 * The University of Western Australia(西澳大利亚大学) The University of Melbourne(墨尔本大学) Weill Cornell Medicine(威尔康奈尔医学院)

专题命中 长上下文与记忆 :prompting(abstract);分类 cs.AI

AI总结 该研究针对MP-VRDU的错误答案,分离出表示、选择、推理三种故障模式,发现视觉信息不可替代、缺失页面影响准确率等结果,给出固定计算预算下的系统构建指导。

详情

展开后加载摘要…

URL PDF HTML 收藏