arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11359 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 603 篇

2608.00902 2026-08-04 cs.CL 新提交 90%

Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

面向LLM智能体的实用在线KV缓存压缩:一项实证研究

Yujian Liu, Jiabao Ji, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) LinkedIn(领英公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究针对LLM智能体的KV缓存瓶颈,实证对比了令牌驱逐与注意力匹配两类在线压缩方法,发现延迟压缩可恢复性能,令牌驱逐在代理不完善时更鲁棒,能大幅压缩KV缓存并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00558 2026-08-04 cs.SE cs.AI 新提交 90%

AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications

AiFlow:面向流式大语言模型应用的带界背压令牌原生反应式编排框架

Qunhui Zhang

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有流式LLM工作流编排的背压等管理缺陷,提出AiFlow令牌原生反应式编排模型,经实验验证可降低应用TTFPT并控制队列深度。

Comments 24 pages, 5 figures, 12 tables, 1 algorithm, and 1 code listing. Public implementation: https://github.com/ModelEngine-Group/fit-framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29433 2026-08-03 cs.CL 新提交 90%

Know It, Act on It: Investigating Memory Utilization in LLM Personalization

了解它,执行它:研究大语言模型个性化中的记忆利用

Zhaoxin Feng, Jianfei Ma, Emmanuele Chersoni

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对LLM个性化中记忆利用的问题,提出解耦评估范式,发现智能体常能回忆用户偏好却未在行为中体现,健康相关偏好的利用薄弱且风险最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29167 2026-08-03 cs.CR cs.AI 新提交 90%

Memory Provenance Laundering in LLM Agents: A Non-Amplification Firewall for Persistent Memory

大语言模型智能体中的内存来源洗白:用于持久内存的非放大防火墙

Jinghan Xu, Yiyong Xiao, Wanru Shao, Hankai Liu, Xinjin Li

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM智能体内存来源洗白的安全问题,提出PPMF防火墙,通过匹配行动风险与记忆权限,成功阻止高风险未授权行动,保障智能体内存安全。

Comments EMNLP2026 submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28103 2026-07-31 cs.AI 新提交 90%

MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck

MIND:基于意图感知信息瓶颈的轻量且有效的LLM智能体记忆注入防御

Dongyi Liu, Haixing He, Xiaobao Wu, Jia Li

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM智能体记忆注入攻击,提出轻量防御框架MIND,通过意图感知信息瓶颈过滤冗余信息并识别恶意记忆,在ReAct-StrategyQA上大幅降低攻击成功率且保留任务性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27958 2026-07-31 cs.MA cs.AI 新提交 90%

$Σ$-Mem: An Online Reliability Memory for LLM-based Multi-Agent Systems

Σ-Mem:面向基于大语言模型(LLM)的多智能体系统的在线可靠性记忆

Peilin Feng, Suorong Yang, Soujanya Poria

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 针对现有LLM多智能体系统记忆系统无法建模智能体可信度的问题,提出Σ-Mem在线可靠性记忆,基于决策后反馈更新实对称状态,在Qwen系列模型上实现自适应协调与更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26072 2026-07-30 cs.IR cs.AI 新提交 90%

IFCMemoryBench: Evaluating Long-Term Memory of LLM-Based Agents in BIM Information Retrieval

IFCMemoryBench:评估基于大语言模型(LLM)的智能体在建筑信息模型(BIM)信息检索中的长期记忆能力

Changyu Du, Alexander Vosseler, Filippo Mazza, André Borrmann

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 本文推出IFCMemoryBench基准,评估基于LLM的智能体在BIM信息检索中的长期记忆,发现现有通用记忆系统在该场景下表现差,存在领域迁移差距。

Comments KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22695 2026-07-28 cs.AI cs.CR 新提交 90%

PANOPTICON: A PII-Based Assemblage of Naturalistic Output Tokens for Investigating Privacy Leakage Within LLM Context Window

全景监控:基于个人身份信息的自然主义输出令牌集合,用于研究大语言模型上下文窗口内的隐私泄露

Ryan Thornton, Mir Mehedi Ahsan Pritom, Maanak Gupta

机构 * Meta

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型上下文窗口内隐私泄露问题,引入PANOPTICON管道和数据集,由Meta模型生成含PII片段的提示,测量数据集多样性评估真实性,通过案例展示其在理解提示反转攻击中的效用及为LLM隐私研究奠基。

Comments 9 pages, 3 figures, 3 tables. Submitted to IEEE CARS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06964 2026-07-09 cs.RO cs.AI 新提交 90%

End-to-End LLM Flight Planning with RAG-based Memory and Multi-modal Coach Agent

基于基于检索增强生成的记忆和多模态教练代理的端到端大语言模型飞行规划

Amin Tabrizian, Arsyi Aziz, Aarifah Ullah, Mahyar Ghazanfari, Pouria Razzaghi, Peng Wei

机构 * George Washington University(乔治华盛顿大学) Metis Solutions Technology Inc

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对电动垂直起降飞机部署中传统飞行规划算法难以融入人类偏好的问题,提出FRAMe工具,集成规划器LLM、多模态教练代理和基于RAG的记忆,在多场景演示中效果最佳,能将自然语言指令转化为优质飞行路线。

Comments Accepted at the ICML 2026 LM4Plan Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01646 2026-07-08 cs.LG cs.DC 新提交 90%

PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint

DeadPool: 通过零开销检查点热替换实现弹性LLM训练

Haotian Xie, Junlin Chen, Mingkai Zheng, Lishan Yang, Zhao Zhang

机构 * Rutgers University(罗格斯大学) George Mason University(乔治·马歇尔大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出DeadPool,利用非关键路径内存检查点和通信器重建协议实现零开销热替换,在无故障时无额外开销,故障时40秒内恢复,支持高达512 GPU和65B参数模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01903 2026-07-03 cs.AI cs.SE 新提交 90%

Rethinking Complexity Metrics for LLM-Integrated Applications: Beyond Source Code

重新思考LLM集成应用的复杂性度量:超越源代码

Zihao Xu, Yuekang Li, Gelei Deng, Yi Liu, Zhenchang Xing

机构 * Zihao Xu1, Yuekang Li1, Gelei Deng2, Yi Liu3, Zhenchang Xing45(未明确机构)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 提出HECATE工具,基于Prompt-as-Specification形式化方法,从提示层和代码层评估LLM集成应用的复杂性,发现提示层复杂性是独立维度,10个有效度量中7个为新增的结构广度度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00454 2026-07-02 cs.AI cs.MA 新提交 90%

Agri-SAGE: Simulation-Grounded Multi-Agent LLM for Context-Aware Agricultural Advisory Generation

Agri-SAGE:基于模拟的多智能体LLM用于上下文感知的农业咨询生成

Vedant Balasubramaniam, Geetha Charan, Manojkumar Patil, Rohit P Suresh, V Priyanka, Kodur Sai Vinay Sathvik, Y. Narahari

机构 * Indian Institute of Science, Bengaluru(印度科学理工学院,班加罗尔) BNM Institute of Technology, Bengaluru(BNM理工学院,班加罗尔)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Agri-SAGE框架,结合检索增强的多智能体LLM推理与APSIM生物物理模拟,生成并验证农艺建议;通过十年回顾分析,三种推理方法均优于静态基线,其中思维树实现最高产量,反思法以较低计算成本达到相当效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01047 2026-07-02 cs.CL 新提交 90%

Conversable Complexity: Agentic LLM Collectives as Interpretable Substrates

可对话的复杂性:作为可解释基质的智能体LLM集体

Elias Najarro, Ane Espeseth, Eleni Nisioti, Sebastian Risi, Stefano Nichele

机构 * IT University of Copenhagen(哥本哈根信息技术大学) University of Oslo(奥斯陆大学) Østfold University of Applied Sciences(东福尔应用科学大学) Sakana AI

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出将智能体大语言模型集体作为人工生命研究的计算基质,利用自然语言通信实现可解释性,并综述了相关实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00368 2026-07-02 cs.CL 新提交 90%

Beyond Perplexity: A Behavioral Evaluation Framework for Deployment-Memory Claims in LLM Test-Time Training

超越困惑度:面向LLM测试时训练中部署记忆声称的行为评估框架

Xiangchen Song, Zhenhao Chen, Lingjing Kong, Shaoan Xie, Xinshuai Dong, Guangyi Chen, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出行为评估框架,通过证据阶梯和显式记忆基线校准LLM测试时训练的记忆声称,揭示代理指标与部署行为之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31145 2026-07-01 cs.CL 新提交 90%

SeKV: Resolution-Adaptive KV Cache with Hierarchical Semantic Memory for Long-Context LLM Inference

SeKV:面向长上下文LLM推理的分辨率自适应KV缓存与层次化语义记忆

Amirhossein Abaskohi, Giuseppe Carenini, Peter West, Yuhang He

机构 * University of British Columbia(不列颠哥伦比亚大学) Microsoft Research(微软研究院)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SeKV,一种分辨率自适应的语义KV缓存方法,通过熵引导的语义片段和GPU-CPU层次化存储,在不丢弃信息的情况下实现按需token级重建,平均性能提升5.9%,GPU内存减少53.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25161 2026-06-25 cs.AI 新提交 90%

TRUSTMEM: Learning Trustworthy Memory Consolidation for LLM Agents with Long-Term Memory

TRUSTMEM:学习具有长期记忆的LLM智能体的可信记忆巩固

Tianyu Yang, Sudipta Paul, Vijay Srinivasan, Vivek Kulkarni, Srinivas Chappidi

机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心) University of Notre Dame(圣母大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出TrustMem框架,通过记忆转换验证器评估更新过程,并利用偏好强化学习优化记忆更新行为,显著提升记忆效用和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24535 2026-06-24 cs.AI 新提交 90%

Governed Shared Memory for Multi-Agent LLM Systems

面向多智能体LLM系统的受控共享内存

Yanki Margalit, Nurit Cohen-Inger, Erni Avram, Ran Taig, Oded Margalit

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 本文形式化多智能体LLM系统的舰队内存问题,提出四种故障模式,并设计显式系统级原语(范围检索、时间替代、溯源追踪、策略控制传播)在MemClaw中实现,通过ArgusFleet评估,发现长上下文检索不足以满足生产需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23075 2026-06-23 cs.CR cs.AI 新提交 90%

Safety in Self-Evolving LLM Agent Systems: Threats, Amplification, and Case Studies

自进化LLM智能体系统中的安全性:威胁、放大与案例研究

Ruixiao Lin, Xinhao Deng, Qingming Li, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhenyuan Li, Yechao Zhang, Shiwen Cui, Changhua Meng, Tianwei Zhang, Xingjun Ma, Qi Li, Ke Xu, Shouling Ji

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Hangzhou Dianzi University(杭州电子科技大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 本文系统分析自进化LLM智能体系统的安全威胁,提出模块-生命周期攻击面矩阵,揭示17个关键威胁和7种跨模块放大效应,并通过案例证明进化设计激活3.5倍攻击面且静态防御失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22528 2026-06-23 cs.AI 新提交 90%

Governance Decay: How Context Compaction Silently Erases Safety Constraints in Long-Horizon LLM Agents

治理衰减:上下文压缩如何悄然消除长周期LLM智能体中的安全约束

Shiyang Chen

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 研究发现LLM智能体的上下文压缩机制会无意中移除安全约束,导致违规行为;提出ConstraintRot基准和Constraint Pinning缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15874 2026-06-23 cs.AI cs.SE 新提交 90%

LLM-as-Code: Agentic Programming for Agent Harness

LLM即代码:面向Agent框架的编程范式

Junjia Qi, Zichuan Fu, Jingtong Gao, Wenlin Zhang, Hanyu Yan, Xian Wu, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯贾维斯实验室)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM作为编排器导致控制流幻觉和不可靠执行的问题,提出Agentic Programming范式,由程序控制所有流程,LLM仅作为代码组件在需要推理或生成时被调用,显著提升长序列操作的稳定性。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13681 2026-06-18 cs.CL 新提交 90%

EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments

EvoArena: 追踪记忆演化以构建动态环境中的鲁棒LLM智能体

Jundong Xu, Qingchuan Li, Jiaying Wu, Yihuai Lan, Shuyue Stella Li, Huichi Zhou, Bowen Jiang, Lei Wang, Jun Wang, Anh Tuan Luu, Caiming Xiong, Hae Won Park, Bryan Hooi, Zhiyuan Hu

机构 * National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理大学) University of Washington(华盛顿大学) University College London(伦敦大学学院) University of Pennsylvania(宾夕法尼亚大学) Nanyang Technological University(南洋理工大学) Recursive Massachusetts Institute of Technology(麻省理工学院)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出EvoArena基准套件模拟终端、软件和社交领域的渐进环境变化,并设计基于补丁的记忆范式EvoMem记录结构化更新历史,使智能体能通过记忆变化推理环境演化,实验表明当前智能体在动态环境中表现不佳,EvoMem可稳定提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14805 2026-06-16 cs.SE cs.AI 新提交 90%

Knowledge-Based Zero-Replay Debugging of Multi-Agent LLM Traces

基于知识的无重放多智能体LLM轨迹调试

Dong Ho Kang, Hyeonjeong Cha, Daein Weon

机构 * ustechlab.com(ustechlab)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种知识图谱驱动的无重放预测方法,通过结构化事件知识图谱和轻量级预测器,在不执行重放的情况下定位高影响事件,将轨迹定位召回率从0.73提升至0.93。

Comments 21 pages, 1 figure, 6 tables. Submitted to Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14589 2026-06-15 cs.SE cs.AI cs.DC 新提交 90%

When Errors Become Narratives: A Longitudinal Taxonomy of Silent Failures in a Production LLM Agent Runtime

当错误成为叙事:生产级LLM Agent运行时中静默故障的纵向分类

Wei Wu

机构 * Independent researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 通过八周对生产级个人助手Agent运行时的研究,识别出28次静默故障,提出五类机制导向分类,其中D类(链式幻觉与捏造)为LLM特有且最危险,系统会生成流畅可信的虚假叙事。

Comments 18 pages, 5 figures, 2 tables. 22 incident postmortems and all defense-framework artifacts publicly available at https://github.com/bisdom-cell/openclaw-model-bridge; governance engine on PyPI (openclaw-ontology-engine)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14445 2026-06-15 cs.SE cs.AI cs.HC 新提交 90%

tap: A File-Based Protocol for Heterogeneous LLM Agent Collaboration

tap:一种用于异构LLM智能体协作的基于文件的协议

Minseo Kim

机构 * HUA Labs(HUA实验室)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI

AI总结 提出tap协议,通过文件优先设计实现不同厂商LLM智能体(如Claude和Codex)在共享代码库上的协作,无需共享内存或相同运行时,实验表明异构模型对审查缺陷发现率更高。

Comments Accepted to KCC 2026. English archival translation. 3 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10532 2026-06-10 cs.AI 新提交 90%

ActiveMem: Distributed Active Memory for Long-Horizon LLM Reasoning

ActiveMem: 用于长程LLM推理的分布式主动记忆

Yunhan Jiang, Wenbin Duan, Shasha Guo, Liang Pang, Xiaoqian Sun, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ActiveMem框架,将记忆从核心推理中解耦,通过分布式主动记忆系统积累语义要点,在长程推理任务中实现高精度和低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24322 2026-06-24 cs.CR 新提交 90%

Securing LLM-Agent Long-Term Memory Against Poisoning: Non-Malleable, Origin-Bound Authority with Machine-Checked Guarantees

保护LLM智能体长期记忆免受投毒:具有机器验证保证的不可延展、源绑定权限

Yedidel Louck

专题命中 长上下文与记忆 :LLM(title,title_cn)

AI总结 针对LLM智能体长期记忆投毒攻击,提出不可延展信息流控制(IFC)方案TMA-NM,通过源绑定和防Sybil确认门控实现0%攻击成功率。

Comments Index Terms: LLM agents, long-term memory, memory poisoning, information-flow control, capability security, prompt injection, formal verification, benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26490 2026-07-30 cs.AI cs.LG cs.NE 新提交 90%

EvoPINN: Agentic Discovery of Executable Algorithms for Physics-Informed Neural Networks

EvoPINN:面向物理信息神经网络可执行算法的智能体式发现框架

Peng Yin, Kai Li, Yifan Zhang, Jian Cheng

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 EvoPINN是智能体式框架,将PINN开发转化为基于执行的算法发现,通过LLM智能体迭代优化,自主发明SLRC-PINN,可显著降低PDE求解的相对L₂误差,为科学计算提供新机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12195 2026-07-15 cs.CL cs.AI 新提交 90%

Comparing Semantic Navigation in Humans and Large Language Models using Natural Language Processing

使用自然语言处理比较人类和大语言模型中的语义导航

Gabriel Paris-Colombo, Rodrigo M. Cabral-Carvalho, Felipe D. Toro-Hernández

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过语言流畅性数据,运用基于轨迹的自然语言处理指标,比较人类与三个大语言模型的语义搜索动态,量化相关维度,发现人类语义搜索在局部利用和全局探索间有独特平衡,当前模型架构无法重现。

Comments Cogsci paper 2026

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 48(0), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16023 2026-08-18 eess.AS 新提交 89%

Cached LLM Probability Retrieval for Speech Recognition

用于语音识别的缓存大语言模型概率检索

Sheng Li, Takahiro Shinozaki, Tatsuya Kawahara

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM直接重评分ASR假设成本高的问题,本文提出无需训练的缓存LLM概率检索方法,在多数设置下优于1-pass ASR,是轻量有效的ASR适配方案。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13962 2026-08-17 cs.AR 新提交 89%

MoE Expert Execution in Disaggregated LLM Serving with a High-Bandwidth ReRAM Near-Memory Architecture

采用高带宽ReRAM近内存架构的分散式大语言模型(LLM)服务中的MoE专家执行

Kunming Shao, Ming Zeng, Xin Yuan, Binbin Liao, Yangming Zhang, Wei Wang, Tim Kwang-Ting Cheng, Chi-Ying Tsui

专题命中 长上下文与记忆 :LLM(title,title_cn)

AI总结 本文针对分散式LLM服务中MoE专家执行的资源效率问题,提出ReRAM近内存架构,通过优化池化、放置与取数策略提升资源占用率,在实测中大幅降低延迟与能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏