arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

1910.10487 2019-10-24 cs.CL cs.LG stat.ML 62%

Memory-Augmented Recurrent Networks for Dialogue Coherence

David Donahue, Yuanliang Meng, Anna Rumshisky

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

Comments Honors project, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.06764 2019-10-16 cs.LG cs.AI stat.ML 62%

Stabilizing Transformers for Reinforcement Learning

Emilio Parisotto, H. Francis Song, Jack W. Rae, Razvan Pascanu, Caglar Gulcehre, Siddhant M. Jayakumar, Max Jaderberg, Raphael Lopez Kaufman, Aidan Clark, Seb Noury, Matthew M. Botvinick, Nicolas Heess, Raia Hadsell

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.01470 2019-07-03 cs.LG cs.CL stat.ML 62%

Augmenting Self-attention with Persistent Memory

Sainbayar Sukhbaatar, Edouard Grave, Guillaume Lample, Herve Jegou, Armand Joulin

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.09324 2019-06-25 cs.CL cs.AI cs.SI 62%

Automatic Conditional Generation of Personalized Social Media Short Texts

Ziwen Wang, Jie Wang, Haiqian Gu, Fei Su, Bojin Zhuang

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

Comments published in PRICAI 2018

Journal ref In: Geng X., Kang BH. (eds) PRICAI 2018: Trends in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.01216 2019-04-08 cs.LG cs.CL stat.ML 62%

Disentangling Language and Knowledge in Task-Oriented Dialogs

Dinesh Raghu, Nikhil Gupta, Mausam

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

Comments Published in NAACL-HLT 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.08214 2019-03-01 cs.CL cs.LG cs.NE 62%

Dual Rectified Linear Units (DReLUs): A Replacement for Tanh Activation Functions in Quasi-Recurrent Neural Networks

Fréderic Godin, Jonas Degrave, Joni Dambre, Wesley De Neve

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.12754 2018-10-31 cs.LG cs.CL cs.NE stat.ML 62%

Recurrent Attention Unit

Guoqiang Zhong, Guohua Yue, Xiao Ling

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.06695 2018-10-17 cs.CL cs.LG stat.ML 62%

Exploring the Use of Attention within an Neural Machine Translation Decoder States to Translate Idioms

Giancarlo D. Salton, Robert J. Ross, John D. Kelleher

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.05916 2018-09-18 cs.LG cs.CL stat.ML 62%

Curriculum-Based Neighborhood Sampling For Sequence Prediction

James O' Neill, Danushka Bollegala

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.02836 2018-09-11 cs.NE cs.CL cs.LG 62%

Context-Free Transductions with Neural Stacks

Yiding Hao, William Merrill, Dana Angluin, Robert Frank, Noah Amsel, Andrew Benz, Simon Mendelsohn

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

Comments To appear in the proceedings of the Analyzing and Interpreting Neural Networks for NLP workshop at EMNLP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01229 2018-09-06 cs.LG cs.CL stat.ML 62%

t-Exponential Memory Networks for Question-Answering Machines

Kyriakos Tolias, Sotirios Chatzis

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1806.00628 2018-06-05 cs.NE cs.CL cs.LG 62%

A Novel Framework for Recurrent Neural Networks with Enhancing Information Processing and Transmission between Units

Xi Chen, Zhihong Deng, Gehui Shen, Ting Huang

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.08793 2018-03-26 cs.SE cs.CL cs.LG 62%

Exploring the Naturalness of Buggy Code with Recurrent Neural Networks

Jack Lanchantin, Ji Gao

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1801.10308 2018-02-01 cs.CL cs.LG 62%

Nested LSTMs

Joel Ruben Antony Moniz, David Krueger

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

Comments Accepted at ACML 2017

Journal ref Proceedings of the Ninth Asian Conference on Machine Learning, PMLR 77:530-544, 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.07316 2017-12-21 cs.CL cs.LG stat.ML 62%

A Flexible Approach to Automated RNN Architecture Generation

Martin Schrimpf, Stephen Merity, James Bradbury, Richard Socher

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.00077 2017-08-02 stat.ML cs.CL cs.LG 62%

Bayesian Sparsification of Recurrent Neural Networks

Ekaterina Lobacheva, Nadezhda Chirkova, Dmitry Vetrov

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

Comments Published in Workshop on Learning to Generate Natural Language, ICML, 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.02222 2017-06-08 cs.LG cs.CL stat.ML 62%

Gated Recurrent Neural Tensor Network

Andros Tjandra, Sakriani Sakti, Ruli Manurung, Mirna Adriani, Satoshi Nakamura

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

Comments Accepted at IJCNN 2016 URL : http://ieeexplore.ieee.org/document/7727233/

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.09893 2016-11-01 cs.CL cs.LG 62%

LightRNN: Memory and Computation-Efficient Recurrent Neural Networks

Xiang Li, Tao Qin, Jian Yang, Tie-Yan Liu

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

Comments NIPS 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.03002 2016-06-10 cs.NE cs.AI cs.CL 62%

MuFuRU: The Multi-Function Recurrent Unit

Dirk Weissenborn, Tim Rocktäschel

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1510.02693 2016-01-07 cs.NE cs.CL cs.LG 62%

Feedforward Sequential Memory Neural Networks without Recurrent Feedback

ShiLiang Zhang, Hui Jiang, Si Wei, LiRong Dai

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

Comments 4 pages, 1figure

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.02078 2015-11-18 cs.LG cs.CL cs.NE 62%

Visualizing and Understanding Recurrent Networks

Andrej Karpathy, Justin Johnson, Li Fei-Fei

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

Comments changing style, adding references, minor changes to text

详情

展开后加载摘要…

URL PDF HTML 收藏
1503.01838 2015-06-09 cs.CL cs.LG cs.NE 62%

Encoding Source Language with Convolutional Neural Network for Machine Translation

Fandong Meng, Zhengdong Lu, Mingxuan Wang, Hang Li, Wenbin Jiang, Qun Liu

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

Comments Accepted as a full paper at ACL 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1402.1128 2014-02-06 cs.NE cs.CL cs.LG stat.ML 62%

Long Short-Term Memory Based Recurrent Neural Network Architectures for Large Vocabulary Speech Recognition

Haşim Sak, Andrew Senior, Françoise Beaufays

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25299 2025-10-01 cs.AI cs.HC cs.MA 61%

ID-RAG: Identity Retrieval-Augmented Generation for Long-Horizon Persona Coherence in Generative Agents

Daniel Platnick, Mohamed E. Bengueddache, Marjan Alirezaie, Dava J. Newman, Alex ''Sandy'' Pentland, Hossein Rahnama

机构 * Flybits Labs, Creative Ai Hub(Flybits实验室,创意人工智能中心) Toronto Metropolitan University(多伦多 Metropolitan 大学) Massachusetts Institute of Technology(麻省理工学院) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI;LLM(comments)

Comments Accepted to LLAIS 2025: Workshop on LLM-Based Agents for Intelligent Systems, at ECAI 2025, 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19920 2026-08-21 cs.CL 新提交 57%

Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

学习如何遗忘:面向长上下文稀疏注意力的微调

Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

机构 * Amazon Web Services(亚马逊网络服务) University of Amsterdam(阿姆斯特丹大学) Amazon(亚马逊) Technical University Berlin(柏林工业大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本文提出一种适配任意KV缓存策略的稀疏注意力模型微调方法,仅需中等硬件预算,性能优于精确注意力训练模型,还提供H2O稀疏注意力高效实现及开源库KeysAndValues支持。

Comments 39 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19723 2026-08-21 cs.CV cs.CL 新提交 57%

StreamSoccer: Event-Driven Memory for Streaming Soccer Commentary

StreamSoccer:用于流式足球解说的事件驱动记忆

Chenxi Shao, Bozhong Wang, Jiaxin Huang, Zhao Liu, Sunwei Zhu, Tianxin Hang, Gaoqi He, Yang Li, Changbo Wang

机构 * Migu Video Technology Co., Ltd.(咪咕视讯科技有限公司) South China University of Technology(华南理工大学) East China Normal University(华东师范大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本研究提出StreamSoccer,一种用于流式足球解说的事件驱动系统,通过建模事件生命周期实现多时间范围解说,在数据集评估中取得优异性能且计算开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12616 2026-08-21 cs.AI cs.MM 版本更新 57%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Shiqin Wang, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Zheng Wang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments This work was accepted by WISE2026. 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18592 2026-08-20 cs.LG 新提交 57%

Infrared Universality of Collective Dynamics across Transformer and State-Space Architectures

Transformer与状态空间架构间集体动力学的红外普适性

Byung Gyu Chae

机构 * Electronics and Telecommunications Research Institute(电子通信研究院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本研究发现Transformer与Mamba架构虽微观机制不同,却存在相近的近边际慢模动力学,其集体红外组织具有普适性,为认知场理论提供了独立验证。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17288 2026-08-19 cs.CL 新提交 57%

Q-Interference: Memory-Efficient Phase-Aware Quantum-Inspired Attention

Q-干涉:内存高效的相位感知量子启发注意力机制

Emama Nahid, Tahmid Imtiaz Imu, Huayue Gu, Liran Ma, Zhipeng Cai, Honghui Xu

机构 * Kennesaw State University(肯尼索州立大学) Miami University(迈阿密大学) Georgia State University(佐治亚州立大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本研究提出Q-Interference,一种内存高效的相位感知量子启发注意力机制,通过精确三角分解避免大型中间张量,适配GPT架构,在基准实验中训练稳定且内存优势显著。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17148 2026-08-19 cs.CR cs.AI 新提交 57%

Authorization Before Context: A Model-Neutral Audience Boundary Against Cross-Audience Memory Leakage in Agentic Systems

上下文之前的授权:一种针对智能体系统中跨受众记忆泄露的模型无关受众边界

Sibo Liu

专题命中 长上下文与记忆 :language agent(abstract);分类 cs.AI

AI总结 本研究针对智能体系统的跨受众记忆泄露问题,提出模型无关的受众边界方法,通过反单调授权规则确保未授权事实不进入上下文,在合成数据集上验证了其有效性。

Comments 13 pages, 3 figures. Author preprint. Accepted for presentation at AdvML-Frontiers x CoTMA, a non-archival workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏