arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

共收录 830
2508.06526 2026-05-20 cs.DC cs.AI cs.AR

PiKV: KV Cache Management System for Mixture of Experts

PiKV: 一种用于混合专家架构的键值缓存管理系统

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Yale University(耶鲁大学) Columbia University(哥伦比亚大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出PiKV,一种专为混合专家架构设计的并行分布式键值缓存服务框架,通过专家分片缓存、PiKV路由和PiKV调度来减少缓存访问开销,并通过压缩模块降低内存使用。

Comments Github Link: https://github.com/NoakLiu/PiKV

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19357 2026-05-20 cs.CL

SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models

SciCustom: 一个用于大型语言模型科学能力定制评估的框架

Yiyang Gu, Junwei Yang, Junyu Luo, Ye Yuan, Bin Feng, Yingce Xia, Shufang Xie, Kaili Liu, Bohan Wu, Qi Shi, Haoran Li, Beier Xiao, Zhiping Xiao, Xiao Luo, Weizhi Zhang, Philip S. Yu, Zequn Liu, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(多媒体信息处理国家重点实验室,计算机学院,PKU-Anker LLM实验室,北京大学) Zhongguancun Academy(中关村学院) IDEA Xidian University(西安电子科技大学) Peking University(北京大学) University of Washington(华盛顿大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 本文提出SciCustom框架,通过从大规模科学数据中自定义构建基准,评估LLM在特定科学任务中的能力,无需专家标注或合成问题生成,展示了细粒度科学能力差异。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19324 2026-05-20 cs.LG

BrainDyn: A Sheaf Neural ODE for Generative Brain Dynamics

BrainDyn: 一种用于生成脑动态的sheaf神经ODE

Siddharth Viswanath, Panayiotis Ketonis, Chen Liu, Michael Perlmutter, Dhananjay Bhaskar, Smita Krishnaswamy

机构 * Yale University(耶鲁大学) Boise State University(博伊西州立大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出BrainDyn,一种基于sheaf神经ODE的模型,用于生成脑动态,通过LSTM编码脑区活动历史,利用sheaf拉普拉斯算子促进信息传递,实现跨模态的强预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19270 2026-05-20 cs.CL

DECOR: Auditing LLM Deception via Information Manipulation Theory

DECOR:通过信息操纵理论审计大语言模型的欺骗行为

Linyue Cai, Samuel Yeh, Jwala Dhamala, Rahul Gupta, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Amazon(亚马逊)

AI总结 本文提出DECOR框架,基于信息操纵理论,通过细粒度审计实现对大语言模型欺骗行为的有效检测,展示了其在单轮和多轮欺骗检测中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18855 2026-05-20 cs.LG cs.CV

Delta Attention Residuals

Delta Attention Residuals

Cheng Luo, Zefan Cai, Junjie Hu

机构 * Independent Researcher(独立研究者) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出Delta Attention Residuals,通过在残差连接中引入对每个子层引入的变化(delta)进行注意力机制,解决了传统注意力残差中因累积隐藏状态冗余导致的路由崩溃问题,从而提升模型跨层选择信息的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18652 2026-05-19 cs.CV

MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents

MementoGUI: 学习代理多模态记忆控制以实现长周期GUI代理

Ziyun Zeng, Hang Hua, Bocheng Zou, Mu Cai, Rogerio Feris, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出MementoGUI,一种学习代理多模态记忆控制框架,用于提升长周期GUI代理的任务状态维持能力,通过模块化记忆控制和可扩展的数据管道提高记忆检索和决策效率。

Comments Preprint, 15 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18530 2026-05-19 cs.CL cs.AI cs.LG stat.ML

Continuous Diffusion Scales Competitively with Discrete Diffusion for Language

连续扩散在语言领域中能与离散扩散竞争性地扩展

Zhihan Yang, Wei Guo, Shuibai Zhang, Subham Sekhar Sahoo, Yongxin Chen, Arash Vahdat, Morteza Mardani, John Thickstun

机构 * NVIDIA & Cornell(NVIDIA与康奈尔大学) NVIDIA & Georgia Tech(NVIDIA与佐治亚理工学院) UW-Madison(威斯康星大学麦迪逊分校) MBZUAI-IFM(梅兰德大学-IFM) Cornell(康奈尔大学)

AI总结 本文研究了连续扩散模型在语言建模中的扩展能力,通过改进Plaid模型构建RePlaid,证明连续扩散模型在计算效率和性能上可与离散模型竞争,并提供了理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17681 2026-05-19 cs.RO

PRIME: Physically-consistent Robotic Inertial and Motion Estimation for Legged and Humanoid Robots

PRIME: 为四足机器人和人形机器人提供物理一致的机器人惯性与运动估计

Jiarong Kang, Kunzhao Ren, Tao Pang, Xiaobin Xiong

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Shanghai Innovation Institute(上海创新研究院)

AI总结 该研究提出PRIME方法,通过结合可微接触动力学和光滑互补约束,实现从 onboard 传感器数据中获得物理一致的运动轨迹和惯性参数估计,从而提升机器人运动估计的准确性。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17626 2026-05-19 cs.LG cs.SE

Verifier-Guided Code Translation via Meta-Step Decoding

通过元步骤解码实现验证器引导的代码翻译

Tianyang Zhou, Somesh Jha, Mihai Christodorescu, Kirill Levchenko, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google(谷歌)

AI总结 本研究提出了一种元步骤解码框架DTV,通过在生成过程中整合验证器调用,提高了代码翻译的通过率,同时减少了token的使用。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17316 2026-05-19 cs.LG cs.AI

Learning Higher-Order Structure from Incomplete Spatiotemporal Data: Multi-Scale Hypergraph Laplacians with Neural Refinement

从不完整时空数据中学习高阶结构:具有神经细化的多尺度超图拉普拉斯算子

Keshu Wu, Sixu Li, Zihao Li, Zhiwen Fan, Xiaopeng Li, Yang Zhou

机构 * Texas A&M University(德克萨斯大学A&M分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出了一种多尺度超图拉普拉斯(MSHL)框架,通过两阶段方法从不完整时空观测中学习高阶结构。该方法通过发现阶段构建多尺度超图,并在细化阶段引入条件残差网络,以处理高阶关系中的残差特征,从而在交通网络中实现了更准确的缺失数据填补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17262 2026-05-19 cs.CV

EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准

Zeyu Wang, Chang Liu, Eduardus Tjitrahardja, Yuntao Wang, Borislav Pavlov, Fangfei Gou, Jose Manuel Davila, Dai Shi, Ran Xu, Yue Pan, Jiayi Tan, Shuting Chang, Qi Wang, Jinzhao Li, Jiacheng Hua, Yifei Huang, Jingwei Sun, Yu Zhang, Liuxin Zhang, Guocai Yao, Jia Jia, Yin Li, Qianying Wang, Yuanchun Shi, Miao Liu

机构 * Tsinghua University(清华大学) Tongji University(同济大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学) Lenovo Group(联想集团) Peking University(北京大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 本文提出EgoIntrospect数据集,用于研究用户中心内部状态推理,通过自注释揭示用户与AI助手的交互意图,评估多模态大语言模型在从注视观察中推理用户内部状态的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17338 2026-05-19 cs.SE cs.CL

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

精确调试基准:你的模型是在调试还是重生成?

Wang Bill Zhu, Miaosen Chai, Shangshang Wang, Yejia Liu, Song Bian, Honghua Dong, Willie Neiswanger, Robin Jia

机构 * University of Southern California(南加州大学) Microsoft(微软) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Toronto(多伦多大学)

AI总结 本文提出PDB基准,评估LLM调试能力,发现前沿模型调试精度低,即使受指令引导也难以达到高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16085 2026-05-19 cond-mat.mtrl-sci cs.CV

Machine Learning Enabled Graph Analysis of Particulate Composites: Application to Solid-state Battery Cathodes

机器学习赋能的颗粒复合材料分析:应用于固态电池正极

Zebin Li, Shimao Deng, Yijin Liu, Jia-Mian Hu

机构 * Department of Materials Science and Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校材料科学与工程系) Walker Department of Mechanical Engineering, University of Texas at Austin(德克萨斯大学奥斯汀分校沃克机械工程系)

AI总结 本文提出一种基于机器学习的框架,将多模态X射线图像转化为拓扑感知图,用于分析颗粒复合材料的微观结构与性能关系,以固态电池正极为例验证了三相交点和离子/电子传导通道的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09148 2026-05-19 stat.ML cs.LG math.OC

A Randomized Algorithm for Sparse PCA based on the Basic SDP Relaxation

基于基本SDP松弛的稀疏PCA随机算法

Alberto Del Pia, Dekun Zhou

机构 * Department of Industrial and Systems Engineering & Wisconsin Institute for Discovery, University of Wisconsin-Madison(工业与系统工程系及威斯康星大学麦迪逊分校威斯康星发现研究所)

AI总结 本文提出基于基本SDP松弛的稀疏PCA随机近似算法,通过构造确定性和随机性解并输出最优解,实现高概率下的稀疏性常数近似比,并在特定条件下保证近似比受对数约束。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16598 2026-05-19 cs.MA cs.AI

GRASP: Graph Agentic Search over Propositions for Multi-hop Question Answering

GRASP:基于命题的图代理搜索用于多跳问答

Stockton Jenkins, Ramya Korlakai Vinayak, Junjie Hu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 GRASP通过分解多跳查询为依赖感知计划,实现多跳问答中的高准确率与低token使用。在MuSiQue、2WikiMultihopQA和HotpotQA上,GRASP在开放语料检索和长文本推理设置中均表现优异,且token使用更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15399 2026-05-18 cs.LG cs.AI cs.NA math.NA physics.comp-ph

Breakeven complexity: A new perspective on neural partial differential equation solvers

突破性复杂度:神经偏微分方程求解器的新视角

Yijing Zhang, Nicholas Roberts, Tanya Marwah, Mikhail Khodak

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind)

AI总结 本文提出突破性复杂度评估框架,考虑神经求解器的前期成本与传统求解器的低保真度成本,分析不同PDE求解器在复杂问题中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15185 2026-05-15 cs.CV cs.AI

Quantitative Video World Model Evaluation for Geometric-Consistency

几何一致性定量视频世界模型评估

Jiaxin Wu, Yihao Pi, Yinling Zhang, Yuheng Li, Xueyan Zou

机构 * Tsinghua University - IEI Lab(清华大学-IEI实验室) UW-Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究院)

AI总结 本文提出PDI-Bench框架,通过分割与点跟踪获取物体中心观测,利用单目重建获取3D坐标,计算投影几何残差以评估生成视频的几何一致性,揭示视频生成器的特定失败模式。

Comments 12 pages, 5 figures. Project page : https://pdi-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15181 2026-05-15 cs.CV

From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing

从计划到像素:学习计划与协调以实现开放性图像编辑

Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

AI总结 本文提出一种长期视图图像编辑框架,通过规划器生成结构化原子分解和协调器选择工具和区域执行每一步,结合视觉语言判断者提供基于结果的奖励,提升编辑的连贯性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14911 2026-05-15 cs.RO

Chrono-Gymnasium: An Open-Source, Gymnasium-Compatible Distributed Simulation Framework

Chrono-Gymnasium:一个开源、兼容Gymnasium的分布式模拟框架

Bocheng Zou, Harry Zhang, Khailanii Slaton, Jingquan Wang, Derrick Ruan, Huzaifa Mustafa Unjhawala, Radu Serban, Dan Negrut

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 Chrono-Gymnasium通过分布式计算框架提升高保真多体动力学模拟的效率,支持机器人导航和行星着陆器优化,减少计算时间而不牺牲物理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14350 2026-05-15 cs.LG

Distributionally Robust Multi-Task Reinforcement Learning via Adaptive Task Sampling

通过自适应任务采样实现分布鲁棒多任务强化学习

Nicholas E. Corrado, Wenyuan Huang, Josiah P. Hanna

机构 * Computer Sciences Department(计算机科学系) University of Wisconsin – Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出DRATS算法,通过自适应优先采样未被解决的任务,提升多任务强化学习的数据效率和最差任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12662 2026-05-14 cs.LG q-bio.GN

scShapeBench: Discovering geometry from high dimensional scRNAseq data

scShapeBench: 从高维scRNAseq数据中发现几何结构

Andrew J Steindl, João Felipe Rocha, Brian Tshilengi Di Bassinga, Zachary Warren, Matthew Scicluna, César Miguel Valdez Córdova, Shabarni Gupta, Leire Torices, Daniel Neumann, Timothy J. Mann, Ihuan Gunawan, Dhananjay Bhaskar, John G Lock, Christine L Chaffer, Guy Wolf, Smita Krishnaswamy

机构 * Yale University(耶鲁大学) Mila / Université de Montréal(Mila / 蒙特利尔大学) Garvan Institute of Medical Research(Garvan医学研究机构) School of Biomedical Sciences, University of New South Wales(新南威尔士大学生物医学科学学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 scShapeBench通过合成和专家标注的单细胞数据集,提供高维数据形状检测的基准,结合扩散几何提取Reeb图,改进拓扑-aware评估指标,优于PAGA和Mapper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19208 2026-05-14 cs.CL cs.LG

How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability

Transformer 如何学习关联令牌:梯度主导项带来机制性可解释性

Shawn Im, Changdae Oh, Zhen Fang, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Technology Sydney(悉尼技术大学)

AI总结 研究通过梯度主导项分析了注意力语言模型中语义关联的形成机制,揭示了权重的闭式表达及其对文本统计的反映。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18245 2026-05-14 cs.LG cs.AI

Scaling Laws Meet Model Architecture: Toward Inference-Efficient LLMs

参数规模与模型架构的交汇:迈向推理高效的大型语言模型

Song Bian, Tao Yu, Shivaram Venkataraman, Youngsuk Park

机构 * UW-Madison(威斯康星大学麦迪逊分校) Amazon Web Services(亚马逊网络服务)

AI总结 本文研究了模型架构因素如何影响推理成本与准确性,提出条件缩放定律并验证了其有效性,结果表明优化架构在相同训练预算下提升了准确率和推理吞吐量。

Comments 32 pages, 27 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12541 2026-05-14 eess.SP cs.AI cs.LG

PG-LRF: Physiology-Guided Latent Rectified Flow for Electro-Hemodynamic PPG-to-ECG Generation

PG-LRF:基于生理的潜在修正流用于电-血流PPG到ECG生成

Xiaoda Wang, Minxiao Wang, Kaiqiao Han, Defu Cao, Ching Chang, Yidan Shi, Runze Yan, Xiao Luo, Yan Liu, Xiao Hu, Yizhou Sun, Wei Wang, Carl Yang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Nell Hodgson Woodruff School of Nursing, Emory University(埃默里大学Nell Hodgson Woodruff护理学院) Department of Computer Science, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系) Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计系)

AI总结 本文提出PG-LRF框架,通过结合电-血流模拟器和生理感知自编码器,生成符合生理学的ECG信号,提升PPG到ECG的生成质量及心血管疾病分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11136 2026-05-13 cs.AI

EVOCHAMBER: Test-Time Co-evolution of Multi-Agent System at Individual, Team, and Population Scales

EVOCHAMBER:在个体、团队和种群层面进行多智能体系统的测试时间共进化

Yaolun Zhang, Tianyi Xu, Shengyu Dai, Zhenwen Shao, Qingyun Wu, Huazheng Wang

机构 * Oregon State University(俄勒冈州立大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johnson & Johnson(强生公司) Pennsylvania State University(宾夕法尼亚州立大学) AG2AI, Inc.(AG2AI公司)

AI总结 EVOCHAMBER通过在多智能体系统中实现测试时间共进化,解决了传统方法在跨智能体学习和专业化保留上的不足,通过协作梦境协议和群体生命周期操作,在不同任务流上实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10877 2026-05-12 cs.CL cs.IR

Neural at ArchEHR-QA 2026: One Method Fits All: Unified Prompt Optimization for Clinical QA over EHRs

神经网络在ArchEHR-QA 2026中的应用:一种方法适用于所有:面向电子健康记录的临床问答的统一提示优化

Abrar Majeedi, Viswanatha Reddy Gajjala, Sai Prasanna Teja Reddy Bogireddy, Siddhant Rai

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Chicago(芝加哥大学) Independent Researcher(独立研究员)

AI总结 本文提出Neural1.5方法,通过分阶段的提示优化提升电子健康记录中的临床问答性能,实现多任务统一优化,展现系统性提示优化的有效性。

Comments Accepted to CL4Health @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10194 2026-05-12 cs.AI cs.LG

TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment

TRACE:通过令牌路由自我对策略对齐来聚焦关键位置

Jiaxuan Wang, Xuan Ouyang, Zhiyu Chen, Yulan Hu, Zheng Pan, Xin Li, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学)

AI总结 TRACE通过令牌路由自我对齐方法,在关键位置进行知识蒸馏,减少冗余梯度影响,提升长周期数学任务表现,优于GRPO并保持外部基准性能。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23928 2026-05-12 cs.CL

The Astonishing Ability of Large Language Models to Parse Jabberwockified Language

大型语言模型解析jabberwockified语言的惊人能力

Gary Lupyan, Senyi Yang

机构 * Department of Psychology, University of Wisconsin-Madison(威斯康星大学麦迪逊分校心理学系)

AI总结 本研究展示大型语言模型能从严重退化的英文文本中恢复意义,通过替换内容词为无意义字符串的文本,模型能生成接近原文的常规英文,揭示了语法结构对词汇意义的强约束作用。

Comments Submitted to the 2026 Annual Meeting of the Cognitive Science Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09675 2026-05-12 cs.AI cs.MA

CodeClinic: Evaluating Automation of Coding Skills for Clinical Reasoning Agents

CodeClinic:评估临床推理代理的编码技能自动化

Timothy Ossowski, Xinchi Liu, Danyal Maqbool, Vaibhav Dhanuka, Sheng Zhang, Hoifung Poon, Majid Afshar, Tyler Bradshaw, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

AI总结 CodeClinic通过MIMIC-IV构建基准,评估LLM代理是否能合成和组合可重用的临床技能,而非依赖固定工具库,包含纵向ICU监控和组合信息检索任务,提升多步推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09490 2026-05-12 cs.CL cs.AR cs.LG

Not All Thoughts Need HBM: Semantics-Aware Memory Hierarchy for LLM Reasoning

并非所有思考都需要HBM:面向LLM推理的语义感知内存层次结构

Aojie Yuan, Tianqi Shen, Dajun Zhang

机构 * University of Southern California(南加州大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出一种语义感知内存层次结构,通过累积注意力评分将token分为四个层级,减少HBM占用并提升推理准确性,实验表明仅3%的淘汰率可保持91%的GSM8K准确率。

Comments Preprint. 14 pages + appendix. Under review at AdaptFM Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏