arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4738 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4738 篇

2602.17183 2026-02-20 cs.SE cs.AI 88%

Robustness and Reasoning Fidelity of Large Language Models in Long-Context Code Question Answering

大语言模型在长上下文代码问答中的鲁棒性与推理可信度

Kishan Maharaj, Nandakishore Menon, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了大语言模型在长上下文代码问答中的鲁棒性和推理可信度,通过不同设置测试发现模型在面对干扰信息时表现脆弱,揭示了现有评估的局限性。

Comments 11 pages, 4 Figures, 5 Tables, Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15344 2026-02-18 cs.LG 88%

ER-MIA: Black-Box Adversarial Memory Injection Attacks on Long-Term Memory-Augmented Large Language Models

ER-MIA:针对长时记忆增强大语言模型的黑盒对抗性记忆注入攻击

Mitchell Piehl, Zhaohan Xi, Zuobin Xiong, Pan He, Muchao Ye

机构 * Department of Computer Science, The University of Iowa(爱荷华大学计算机科学系) School of Computing, State University of New York at Binghamton(纽约州立大学布法罗分校计算机学院) Department of Computer Science, University of Nevada, Las Vegas(内华达大学拉斯维加斯分校计算机科学系) Department of Computer Science(计算机科学系) Software Engineering, Auburn University(阿伯茨罕大学软件工程系)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 ER-MIA针对长时记忆增强LLM的基于相似性的检索机制提出黑盒对抗性记忆注入攻击,揭示了系统层面的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08294 2026-02-10 cs.CL 88%

When Does Context Help? Error Dynamics of Contextual Information in Large Language Models

何时上下文有助于?大型语言模型中上下文信息的误差动态

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che, Yang Deng

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出统一理论框架,分析上下文信息对Transformer模型误差动态的影响,通过几何条件和范数约束揭示上下文校正的必要条件,并通过实验验证提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17098 2026-02-03 cs.CR cs.AI 88%

Can Transformer Memory Be Corrupted? Investigating Cache-Side Vulnerabilities in Large Language Models

Transformer记忆能否被破坏?调查大型语言模型中的缓存侧漏洞

Elias Hossain, Swayamjit Saha, Somshubhra Roy, Ravi Prasad

机构 * College of Engineering and Computer Science, University of Central Florida(中央佛罗里达大学工程与计算机科学学院) Department of Computer Science and Engineering, Mississippi State University(密苏里州立大学计算机科学与工程系) Department of Electrical and Computer Engineering, North Carolina State University(北卡罗来纳州立大学电子与计算机工程系)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出恶意令牌注入框架,揭示了大型语言模型缓存中的安全漏洞,通过扰动缓存关键向量影响模型输出和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21744 2026-01-30 cs.CL 88%

Temporal Guidance for Large Language Models

时间指导用于大语言模型

Hong-Kai Zheng, Piji Li

机构 * College of Artificial Intelligence, MIIT Key Laboratory of Pattern Analysis(人工智能学院,模式分析与机器智能关键实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education, Nanjing University of Aeronautics(脑机智能技术关键实验室,教育部,南京航空航天大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出时间指导策略,通过多令牌预测和轻量级投影器提升大语言模型生成质量,同时保持低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19828 2026-01-15 cs.CL cs.MA 88%

Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning

Memory-R1: 通过强化学习增强大语言模型代理以管理并利用记忆

Sikuan Yan, Xiufeng Yang, Zuchao Huang, Ercong Nie, Zifeng Ding, Zonggen Li, Xiaowen Ma, Jinhe Bi, Kristian Kersting, Jeff Z. Pan, Hinrich Schütze, Volker Tresp, Yunpu Ma

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) University of Cambridge(剑桥大学) University of Hong Kong(香港大学) Technical University of Darmstadt(达姆施塔特技术大学) University of Edinburgh(爱丁堡大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 Memory-R1通过强化学习框架,使大语言模型具备主动管理与利用外部记忆的能力,有效提升长跨度推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07403 2026-01-13 cs.CL 88%

LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction

LongEmotion: 测量大语言模型在长上下文交互中的情感智能

Weichu Liu, Jing Xiong, Yuxuan Hu, Zixuan Li, Minghuan Tan, Ningning Mao, Hui Shen, Wendong Xu, Chaofan Tao, Min Yang, Chengming Li, Lingpeng Kong, Ngai Wong

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) The University of Hong Kong(香港大学) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Beijing Normal University(北京师范大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03417 2026-01-08 cs.CL 88%

Implicit Graph, Explicit Retrieval: Towards Efficient and Interpretable Long-horizon Memory for Large Language Models

隐式图,显式检索:迈向高效且可解释的长周期记忆 для 大语言模型

Xin Zhang, Kailai Yang, Hao Li, Chenyue Li, Qiyu Wei, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LatentGraphMem结合隐式图记忆与显式子图检索,实现高效且可解释的长周期记忆,提升大语言模型的推理能力与可解释性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02819 2026-01-07 cs.CL 88%

Punctuation-aware Hybrid Trainable Sparse Attention for Large Language Models

具有标点意识的混合可训练稀疏注意力机制用于大语言模型

Junxiang Qiu, Shuo Wang, Zhengsu Chen, Hengheng Zhang, Jinda Lu, Changcheng Li, Qi Tian

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Inc.(华为公司)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PHSA通过利用标点符号作为语义边界锚点,提出了一种混合可训练稀疏注意力机制,有效减少信息损失并提升大语言模型的长上下文处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24969 2026-01-01 cond-mat.stat-mech cs.CL physics.bio-ph q-bio.NC 88%

Large language models and the entropy of English

大语言模型与英语的熵

Colin Scheibner, Lindsay M. Smith, William Bialek

机构 * Joseph Henry Laboratories of Physics(乔赛亚·亨利物理实验室) Princeton Center for Theoretical Science(普林斯顿理论科学中心) Lewis--Sigler Institute for Integrative Genomics(刘易斯-西格尔整合基因组学研究所) Princeton University(普林斯顿大学) Initiative for the Theoretical Sciences(理论科学倡议) The CUNY Graduate Center(纽约市立大学研究生中心)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过大语言模型揭示英语文本中长程结构的熵特性及依赖关系

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20719 2025-11-27 cs.AI cs.IT eess.SP math.IT 88%

Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models

在基于大语言模型的代理AI无线局域网中学习多接入点协调

Yifan Fan, Le Liang, Peng Liu, Xiao Li, Ziyang Guo, Qiao Lan, Shi Jin, Wen Tong

机构 * School of Information Science and Engineering(信息科学与工程学院) Purple Mountain Laboratories(紫金山实验室) Wireless Technology Lab, 2012 Labs, Huawei Technologies Co., Ltd(无线技术实验室,2012实验室,华为技术有限公司)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的代理AI无线局域网框架,通过动态协作实现多接入点协调,提升无线网络性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00489 2025-11-04 cs.CL 88%

ToM: Leveraging Tree-oriented MapReduce for Long-Context Reasoning in Large Language Models

Jiani Guo, Zuchao Li, Jie Wu, Qianren Wang, Yun Li, Lefei Zhang, Hai Zhao, Yujiu Yang

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University, Wuhan, China(武汉大学人工智能学院) Tsinghua University(清华大学) Cognitive AI Lab(认知人工智能实验室) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机学院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18395 2025-10-22 cs.AI 88%

Memory-Augmented State Machine Prompting: A Novel LLM Agent Framework for Real-Time Strategy Games

Runnan Qi, Yanan Ni, Lumin Jiang, Zongyuan Li, Kuihua Huang, Xian Guo

机构 * National University of Defense Technology(国防科技大学) Nankai University(南开大学)

专题命中 长上下文与记忆 :LLM(title,abstract);prompting(title,abstract);分类 cs.AI

Comments 10 pages, 4 figures, 1 table, 1 algorithm. Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06436 2025-10-22 cs.AI 88%

Tree of Agents: Improving Long-Context Capabilities of Large Language Models through Multi-Perspective Reasoning

Song Yu, Xiaofei Xu, Ke Deng, Li Li, Lin Tian

机构 * School of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院) School of Information Technology, Murdoch University(默多克大学信息科技学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) University of Technology Sydney(悉尼技术大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13349 2025-10-20 cs.CL 88%

Event Segmentation Applications in Large Language Model Enabled Automated Recall Assessments

Ryan A. Panela, Alex J. Barnett, Morgan D. Barense, Björn Herrmann

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17670 2025-08-28 cs.CL 88%

CoCoA: Confidence and Context-Aware Adaptive Decoding for Resolving Knowledge Conflicts in Large Language Models

Anant Khandelwal, Manish Gupta, Puneet Agrawal

机构 * Microsoft(微软)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to EMNLP'25, Main. 21 pages, 17 tables, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09071 2025-08-25 cs.CL 88%

Exploration of Plan-Guided Summarization for Narrative Texts: the Case of Small Language Models

Matt Grenander, Siddharth Varia, Paula Czarnowska, Yogarshi Vyas, Kishaloy Halder, Bonan Min

机构 * AWS AI Labs(AWS人工智能实验室) School of Informatics, University of Edinburgh(信息学院,爱丁堡大学)

专题命中 长上下文与记忆 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

Comments Accepted to the 7th Workshop on Narrative Understanding (WNU), co-located with NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09919 2025-08-12 cs.CV cs.AI 88%

B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens

Zhuqiang Lu, Zhenfei Yin, Mengwei He, Zhihui Wang, Zicheng Liu, Zhiyong Wang, Kun Hu

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) International School of Information Science and Engineering, Dalian University of Technology(大连理工大学信息科学与工程国际学院) Advanced Micro Devices(先进微器件公司) School of Science, Edith Cowan University(埃迪斯科文大学科学学院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted by ICCV2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04392 2025-07-09 cs.AI 88%

AgentSafe: Safeguarding Large Language Model-based Multi-agent Systems via Hierarchical Data Management

Junyuan Mao, Fanci Meng, Yifan Duan, Miao Yu, Xiaojun Jia, Junfeng Fang, Yuxuan Liang, Kun Wang, Qingsong Wen

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Squirrel Ai Learning

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08049 2025-07-08 cs.CL 88%

EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding

Ao Li, Longwei Xu, Chen Ling, Jinghui Zhang, Pengwei Wang

机构 * Shandong University(山东大学) Xi’an Jiaotong University(西安交通大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03477 2025-07-08 cs.AI 88%

REAL: Benchmarking Abilities of Large Language Models for Housing Transactions and Services

Kexin Zhu, Yang Han

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18036 2025-06-24 cs.CL 88%

Markov-Enhanced Clustering for Long Document Summarization: Tackling the 'Lost in the Middle' Challenge with Large Language Models

Aziz Amari, Mohamed Achref Ben Ammar

机构 * National Institute of Applied Science and Technology (INSAT), University of Carthage, Tunis, Tunisia(应用科学与技术国家研究所(INSAT),卡塔赫纳大学,突尼斯)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref AIAI 2025, IFIP AICT, vol. 757, Springer, 2025, pp. 182-195

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00773 2025-06-04 cs.CL 88%

Dynamic Chunking and Selection for Reading Comprehension of Ultra-Long Context in Large Language Models

Boheng Sheng, Jiacheng Yao, Meicong Zhang, Guoxiu He

机构 * East China Normal University(华东师范大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06594 2025-06-03 cs.CL 88%

Beyond Decoder-only: Large Language Models Can be Good Encoders for Machine Translation

Yingfeng Luo, Tong Zheng, Yongyu Mu, Bei Li, Qinghong Zhang, Yongqi Gao, Ziqiang Xu, Peinan Feng, Xiaoqian Liu, Tong Xiao, Jingbo Zhu

机构 * NLP Lab, Northeastern University, Shenyang, China(东北大学自然语言处理实验室) NiuTrans Research, Shenyang, China(NiuTrans研究院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to ACL Findings 2025. Please cite the ACL version. Code and data are available at: https://github.com/NiuTrans/LaMaTE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22921 2025-05-30 cs.CL 88%

Structured Memory Mechanisms for Stable Context Representation in Large Language Models

Yue Xing, Tao Yang, Yijiashun Qi, Minggu Wei, Yu Cheng, Honghui Xin

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13515 2025-04-21 cs.SE cs.AI 88%

Large Language Models for Validating Network Protocol Parsers

Mingwei Zheng, Danning Xie, Xiangyu Zhang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19050 2025-03-26 cs.DC cs.AI 88%

Mist: Efficient Distributed Training of Large Language Models via Memory-Parallelism Co-Optimization

Zhanda Zhu, Christina Giannoula, Muralidhar Andoorveedu, Qidong Su, Karttikeya Mangalam, Bojian Zheng, Gennady Pekhimenko

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments Accepted by EuroSys 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01330 2025-03-04 cs.CL 88%

WeightedKV: Attention Scores Weighted Key-Value Cache Merging for Large Language Models

Jian Yuan, Ziwei He, Haoli Bai, Jingwen Leng, Bo Jiang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07222 2025-02-12 cs.LG 88%

A Memory Efficient Randomized Subspace Optimization Method for Training Large Language Models

Yiming Chen, Yuan Zhang, Yin Liu, Kun Yuan, Zaiwen Wen

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15269 2025-01-28 cs.LG cs.CR cs.CV 88%

Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink

Yining Wang, Mi Zhang, Junjie Sun, Chenyue Wang, Min Yang, Hui Xue, Jialing Tao, Ranjie Duan, Jiexi Liu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

Comments USENIX Security 2025

详情

展开后加载摘要…

URL PDF HTML 收藏