arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4738 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4738 篇

2608.11919 2026-08-13 cs.CL 新提交 88%

LazyTrain: Limited-resource Allocation toward Zero-waste Yield Optimization in Large Language Model Training

LazyTrain:面向大语言模型训练零浪费产出优化的有限资源分配方案

Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) IDEA Research(IDEA研究院) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LazyTrain是面向大语言模型训练的优化层,将相关问题建模为混合整数调度问题,结合Hybrid 8位算子,在H800、RTX 3090实验中提升算力、批次大小与准确率。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10705 2026-08-11 cs.CL 版本更新 88%

PRISM-$Δ$: Differential Subspace Steering for Prompt Highlighting in Large Language Models

Prism-$Δ$:用于大语言模型中快速突出的差分子空间操控

Yuyao Ge, Shenghua Liu, Yiwei Wang, Baolong Bi, Lingrui Mei, Jiayu Yao, Jiafeng Guo, Xueqi Cheng

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PRISM-$Δ$通过差分子空间操控提升大语言模型的提示突出效果,实现更高的生成质量与更低的资源消耗。

Comments 24 pages, 8 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03067 2026-08-07 cs.CL 版本更新 88%

Activation-Guided Neuron Intervention to Induce Alzheimer's-Related Computational Language Phenotypes in a Large Language Model

激活引导的神经元干预以在大型语言模型中诱导阿尔茨海默病相关的计算语言表型

Rui He, Ercong Nie, Hong Jiang, Iris E. Sommer, Philipp Homan, Wolfram Hinzen

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究基于Qwen3-8B构建激活引导干预框架,通过缩放权重调节AD相关神经元,发现放大该神经元会导致多认知域功能损伤,减弱则多保留性能,为AD计算表型提供了概念验证。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19857 2026-07-23 cs.CV cs.AI 新提交 88%

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

用于流式航空视频中小目标理解的内存增强多模态大语言模型

Penglei Sun, Yehua Huang, Zhuoli Tao, Xiang Li, Runwei Guan, Yaoxian Song, Kaiyong Zhao, Henghui Ding, Bo Han, Yang Yang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Freiburg(弗莱堡大学) Hangzhou City University(杭州城市大学) XGRIDS(XGRIDS公司) Fudan University(复旦大学) Hong Kong Baptist University(香港浸会大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对流式航空视频中小目标理解难题,提出像素级开放词汇数据集DroneEyes,以及含语义感知令牌路由器和分层内存库的多模态大语言模型SkyAnchor,从数据和方法角度应对挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05969 2026-07-16 cs.CL 版本更新 88%

MemDefrag: Latent Memory Defragmentation for Large Language Models

MemDefrag:大语言模型的潜在内存碎片整理

Ruiyi Yan, Zhuoyuan Mao, Yiwen Guo

机构 * Kyoto University(京都大学) LIGHTSPEED Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对大语言模型潜在内存更新时因编码问题致性能降,提出MemDefrag框架,利用中间层追踪信号整理内存碎片、超容时用信息引导遗忘机制,实验显示其在知识保留等方面优于其他模型且泛化性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15026 2026-07-16 cs.OS cs.AI cs.PF 版本更新 88%

TuxBot: Semantic-Aware Online OS Tuning with Large Language Models

SemaTune: 基于大语言模型的语义感知在线操作系统调优

Georgios Liargkovas, Mihir Nitin Joshi, Hubertus Franke, Kostis Kaffes

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SemaTune通过语义感知的在线操作系统调优框架,利用大语言模型进行有限制的指导,提升稳定状态下的性能,通过快速和慢速循环更新配置并验证,实现比传统方法更高的性能提升。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10559 2026-07-14 cs.AI 新提交 88%

Large language model agents accelerate inverse design of metal-organic frameworks for gas separation

大语言模型智能体加速用于气体分离的金属有机框架的逆设计

Zhaolin Hu, Hehe Fan, Wangyihan Guo, Meng Xu, Chenhao Rao, Qiwei Yang, Yi Yang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究旨在加速金属有机框架用于气体分离的逆设计。提出LEMO智能体框架,结合多种技术,经迭代循环指导搜索。在分离任务中评估,相比基线有优势,丰富候选、提性能、保多样,还经实验筛选实现合成与表征,证明大语言模型智能体可加速MOF发现。

Comments 19 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06595 2026-07-09 cs.CR cs.AI 新提交 88%

When Agents Remember Too Much: Memory Poisoning Attacks on Large Language Model Agents

当智能体记忆过多时:对大语言模型智能体的内存中毒攻击

George Torres, Sharad Shrestha, Satyajayant Misra

机构 * George Torres3(乔治·托雷斯(第三作者)) Sharad Shrestha1(沙拉德·什雷斯塔(第一作者)) Satyajayant Misra4(萨蒂亚扬特·米什拉(第四作者))

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究大语言模型驱动的个人智能体因缺乏内存安全治理存在安全漏洞,提出攻击向量GhostWriter,实现近98%注入率和约60%激活率,还提出AM-Sentry缓解技术,显著降低GhostWriter成功率并保持智能体效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20196 2026-06-29 cs.AI 版本更新 88%

Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning

面向选择性多模态大语言模型遗忘的良性记忆遗忘

Zhen Zeng, Leijiang Gu, Zhangling Duan, Feng Li, Cees G. M. Snoek, Meng Wang, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型隐私泄露问题,提出S-MLLMUn Bench基准和SMFA框架,实现精确删除敏感知识同时保持模型基础能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11957 2026-06-24 cs.CL 版本更新 88%

PEARL: Self-Evolving Assistant for Time Management with Reinforcement Learning

PEARL: 基于强化学习的自我进化时间管理助手

Bingxuan Li, Jeonghwan Kim, Cheng Qian, Xiusi Chen, Eitan Anzenberg, Niran Kundapur, Heng Ji

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Viven

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);language agent(abstract)

AI总结 针对日历冲突解决任务,提出PEARL框架,通过外部偏好记忆和逐轮奖励优化,显著降低LLM代理的错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23164 2026-06-23 cs.CL 新提交 88%

Same question, different history: language, national identity, and credit in large language models

相同问题,不同历史:语言、国家认同与大型语言模型中的归因

William Guey, Pierrick Bougault, Wei Zhang, Vitor D. de Moura, José O. Gomes

机构 * Tsinghua University(清华大学) Federal University of Rio de Janeiro(里约热内卢联邦大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大型语言模型在21项有争议的发明/发现中,查询语言如何系统性地影响不同国家主张者的出现频率,揭示语言作为激活不同国家历史版本的开关,产生系统性不同的国家记忆。

Comments 27 pages (main text and Supplementary Information combined), 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10251 2026-06-23 math.NA cs.LG cs.NA stat.ML 版本更新 88%

Numerical stability analysis of large language models

大型语言模型的数值稳定性分析

Stanislav Budzinskiy, Wenyi Fang, Longbin Zeng, Philipp Petersen

机构 * Faculty of Mathematics(数学系) University of Vienna(维也纳大学) Huawei Technologies(华为技术)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文通过混合精度分析推导Transformer推理的条件数和前向误差界,比较LayerNorm与RMSNorm在极端异常值下的稳定性,并量化注意力汇聚对扰动敏感性的影响,发现数值稳定性由权重幅度与残差流增长共同决定。

Comments Major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18271 2026-06-15 cs.LG 88%

Memory-Augmented Architecture for Long-Term Context Handling in Large Language Models

具有长时上下文处理能力的大型语言模型记忆增强架构

Haseeb Ullah Khan Shinwari, Muhammad Usama

机构 * Newton AI Lab(牛顿AI实验室) School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出一种记忆增强架构,通过动态检索、更新和剪枝过去交互信息,提升大型语言模型的长时上下文处理能力,实验表明该方法能有效提高上下文连贯性、降低内存开销并提升响应质量。

Journal ref IEEE Transactions on Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10694 2026-06-10 cs.CL 新提交 88%

REAL: A Reasoning-Enhanced Graph Framework for Long-Term Memory Management of LLMs

REAL: 一种增强推理的图框架用于LLM的长期记忆管理

Keer Lu, Liwei Chen, Guoqing Jiang, Zhiheng Qin, Yunhuai Liu, Wentao Zhang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Kuaishou Technology(快手科技) Center for Data Science, Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院数据科学中心)

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出REAL框架,通过构建时序和置信度感知的有向属性图,采用非破坏性更新和混合束搜索检索,解决LLM长期记忆中的关系缺失、事实覆盖和查询被动问题,平均性能提升22.72%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09125 2026-06-09 cs.CR cs.AI 新提交 88%

Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges

多模态大语言模型中的隐私风险揭示:任务特定漏洞与缓解挑战

Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究揭示了多模态大语言模型在处理图像和文本时存在的隐私泄露风险,通过构建MM-Privacy数据集评估了不同任务下的披露风险与保留风险,并强调了任务不一致性对隐私风险的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08397 2026-06-09 cs.CL cs.IR 新提交 88%

TrustMargin: Training-Free Arbitration between Parametric Memory and Retrieved Evidence in Large Language Models

TrustMargin: 大语言模型中参数化记忆与检索证据之间的无训练仲裁

Jingyan Xu, Hong Shi, Yi Shan, Penghui Liu, Yunhao Bai, Ningyuan Li, Xueyang Liu

机构 * Peking University(北京大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对大语言模型在知识问答中参数记忆与检索证据冲突的问题,提出无训练仲裁层TrustMargin,利用模型自身似然度评分选择更可信的答案,无需微调或外部评判。

Comments 13 pages, 6 figures, 9 tables. Code and data are available at https://github.com/mojixu/TrustMargin.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26256 2026-05-27 cs.AI 88%

Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions

个性化具身多模态大语言模型代理在长期用户交互中的应用

Jeongeun Lee, Chanyoung Park, Dongha Lee

机构 * Yonsei University(延世大学) KAIST(韩国科学技术院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出POLAR框架,通过多模态知识图谱记忆机制增强具身代理在长期交互中的个性化能力,显著提升多步推理和用户上下文跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21539 2026-05-22 cs.LG 88%

DualOptim+: Bridging Shared and Decoupled Optimizer States for Better Machine Unlearning in Large Language Models

DualOptim+: 联合与解耦优化器状态的桥梁以提升大语言模型中的机器反遗忘

Xuyang Zhong, Qizhang Li, Yiwen Guo, Chen Liu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出DualOptim+,一种改进大语言模型中机器反遗忘的新优化框架,通过引入基础状态和delta状态,有效平衡遗忘与保留目标,同时提出8位量化变体以减少内存开销,实验表明其在多个任务中均表现出色。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08437 2026-05-19 cs.CL 88%

Large Language Models and Impossible Language Acquisition: "False Promise" or an Overturn of our Current Perspective towards AI

大语言模型与不可能的语言习得:"虚假承诺"或对当前人工智能观点的颠覆

Ziyan Wang, Longlong Ma

机构 * New Talent Academy(新人才学院) Institute of Software, University of Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过实验探讨大语言模型学习可能与不可能语言的能力,发现GPT-2模型在自然语言任务上表现优于不可能语言任务,而LSTM模型则无显著差异,挑战了Chomsky对AI的理性主义基础观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12357 2026-05-13 cs.AI 88%

$δ$-mem: Efficient Online Memory for Large Language Models

$δ$-mem: 高效的大型语言模型在线内存

Jingdi Lei, Di Zhang, Junxian Li, Weida Wang, Kaixuan Fan, Xiang Liu, Qihan Liu, Xiaoteng Ma, Baian Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Mind Lab Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出$δ$-mem机制,通过紧凑的在线状态与注意力计算直接耦合,提升模型在长文本任务中的表现,无需全微调或替换backbone。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02757 2026-04-21 cs.LG math.OC stat.ML 88%

ConMeZO: Adaptive Descent-Direction Sampling for Gradient-Free Finetuning of Large Language Models

ConMeZO:适应性下降方向采样用于大语言模型的梯度自由微调

Lejs Deen Behric, Liang Zhang, Bingcong Li, Kiran Koshy Thekumparampil

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Amazon AGI Labs(亚马逊人工智能实验室)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 ConMeZO通过适应性方向采样加速大语言模型微调的收敛速度,保留低内存足迹,比MeZO快2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17377 2026-04-21 cs.CL 88%

AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language Models

AnchorMem: 基于关联上下文的锚定事实用于构建大语言模型的记忆

Zhanyu Shen, Sijie Cheng, Zhicheng Guo, Weiqin Wang, Yile Wang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出AnchorMem,通过锚定事实与关联上下文构建大语言模型的记忆系统,解决传统方法依赖总结导致信息丢失的问题,实验表明其在LoCoMo基准上表现优异。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16734 2026-04-21 cs.CV cs.AI 88%

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

降低现代多模态大语言模型流水线的峰值内存使用

Junwan Kim, Hyunkyung Bae

机构 * New York University(纽约大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05091 2026-04-08 cs.CL cs.DC cs.OS 88%

MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU

MegaTrain:在单块GPU上以全精度训练1000亿参数以上的大型语言模型

Zhengqing Yuan, Hanchi Sun, Lichao Sun, Yanfang Ye

机构 * University of Notre Dame(圣母大学) Lehigh University(里海大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MegaTrain通过在主机内存中存储参数和优化器状态,利用GPU作为临时计算引擎,实现了在单块GPU上以全精度训练超大规模语言模型,并在120B参数模型训练中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29252 2026-04-01 cs.CV cs.AI 88%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15800 2026-03-18 cs.CV cs.CL cs.CR 88%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09981 2026-03-12 cs.CL 88%

Large Language Models and Book Summarization: Reading or Remembering, Which Is Better?

大语言模型与书籍摘要:阅读还是记忆,哪个更好?

Tairan Fu, Javier Conde, Pedro Reviriego, Javier Coronado-Blázquez, Nina Melero, Elena Merino-Gómez

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究比较了大语言模型在使用内部知识和完整文本生成书籍摘要的效果,发现完整文本通常能生成更详细的摘要,但某些情况下内部知识摘要表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19747 2026-03-10 cs.CL cs.AR 88%

HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecture

HaLoRA: 基于混合计算-内存架构的硬件感知低秩适应法用于大型语言模型

Taiqiang Wu, Chenchen Ding, Wenyong Zhou, Yuxin Cheng, Xincheng Feng, Shuqi Wang, Wendong Xu, Chufan Shi, Zhengwu Liu, Ngai Wong

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 HaLoRA通过在混合计算-内存架构中部署低秩适应,利用RRAM和SRAM实现高效能和高精度的LLM微调。

Comments 22 pages, Accepted by TODAES (ACM Transactions on Design Automation of Electronic Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04412 2026-03-06 cs.CL 88%

Additive Multi-Step Markov Chains and the Curse of Dimensionality in Large Language Models

加性多步马尔可夫链与大语言模型中维度灾难

O. V. Usatenko, S. S. Melnyk, G. M. Pritula

机构 * A. Ya. Usikov Institute for Radiophysics and Electronics Ukrainian Academy of Science(A. Ya. Usikov 无线电物理与电子研究所 乌克兰科学院)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出加性多步马尔可夫链模型,用于近似大语言模型动态,通过分解条件概率减少高阶马尔可夫过程的组合爆炸问题。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21862 2026-02-26 cs.CL 88%

Personalized Graph-Empowered Large Language Model for Proactive Information Access

面向主动信息获取的个性化图增强大语言模型

Chia Cheng Chang, An-Zi Yen, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science(计算机科学系) Information Engineering National Taiwan University Taipei, Taiwan(信息工程国立台湾大学台北市) Department of Computer Science National Yang Ming Chiao Tung University Hsinchu, Taiwan(计算机科学国立阳明交通大学新竹市) Institute of Information Science Academia Sinica Taipei, Taiwan(信息科学研究所台湾学术院台北市) Information Engineering AI Research Center (AINTU) National Taiwan University Taipei, Taiwan(信息工程人工智能研究中心(AINTU)国立台湾大学台北市)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型和个性化知识图谱的主动信息获取框架,通过精炼决策过程提升用户对遗忘事件的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏