arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2311.13565 2023-11-23 cs.CL cs.AI cs.IR 73%

Drilling Down into the Discourse Structure with LLMs for Long Document Question Answering

Inderjeet Nair, Shwetha Somasundaram, Apoorv Saxena, Koustava Goswami

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to the Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00802 2023-11-08 stat.ML cs.CL cs.LG 73%

Birth of a Transformer: A Memory Viewpoint

Alberto Bietti, Vivien Cabannes, Diane Bouchacourt, Herve Jegou, Leon Bottou

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.20088 2023-10-31 cs.CV cs.CL cs.LG 73%

Improving CLIP Training with Language Rewrites

Lijie Fan, Dilip Krishnan, Phillip Isola, Dina Katabi, Yonglong Tian

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10882 2023-08-22 cs.AI cs.CL 73%

Giraffe: Adventures in Expanding Context Lengths in LLMs

Arka Pal, Deep Karkhanis, Manley Roberts, Samuel Dooley, Arvind Sundararajan, Siddartha Naidu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07229 2023-08-03 cs.CL cs.LG 73%

Mass-Editing Memory in a Transformer

Kevin Meng, Arnab Sen Sharma, Alex Andonian, Yonatan Belinkov, David Bau

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 18 pages, 11 figures. Code and data at https://memit.baulab.info

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.07051 2023-07-17 cs.CL cs.IR cs.LG 73%

Making the Most Out of the Limited Context Length: Predictive Power Varies with Clinical Note Type and Note Section

Hongyi Zheng, Yixin Zhu, Lavender Yao Jiang, Kyunghyun Cho, Eric Karl Oermann

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Our code is publicly available on GitHub (https://github.com/nyuolab/EfficientTransformer)

Journal ref Association for Computational Linguistics - Student Research Workshop, 2023, pages 104-108

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10998 2023-06-21 cs.LG cs.AI cs.PL cs.SE 73%

RepoFusion: Training Code Models to Understand Your Repository

Disha Shrivastava, Denis Kocetkov, Harm de Vries, Dzmitry Bahdanau, Torsten Scholak

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12369 2023-05-23 cs.CV cs.AI cs.LG 73%

HIINT: Historical, Intra- and Inter- personal Dynamics Modeling with Cross-person Memory Transformer

Yubin Kim, Dong Won Lee, Paul Pu Liang, Sharifa Algohwinem, Cynthia Breazeal, Hae Won Park

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01650 2022-12-06 cs.CL cs.LG 73%

Global memory transformer for processing long documents

Arij Al Adel

专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments 10 pages, 4 figures, 5 tables. Published in neuroinformatics 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.02662 2022-07-12 cs.CL cs.AI 73%

Imagined versus Remembered Stories: Quantifying Differences in Narrative Flow

Maarten Sap, Anna Jafarpour, Yejin Choi, Noah A. Smith, James W. Pennebaker, Eric Horvitz

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Equal contribution from Sap and Jafarpour; in review; version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.09737 2022-05-11 cs.CL cs.AI 73%

Learning to Repair: Repairing model output errors after deployment using a dynamic memory of feedback

Niket Tandon, Aman Madaan, Peter Clark, Yiming Yang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments NAACL 2022 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.01540 2021-11-04 cs.LG cs.CL 73%

Luna: Linear Unified Nested Attention

Xuezhe Ma, Xiang Kong, Sinong Wang, Chunting Zhou, Jonathan May, Hao Ma, Luke Zettlemoyer

专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Camera-Ready version in NeurIPS 2021. 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.07974 2021-08-30 cs.LG cs.CL 73%

A review of on-device fully neural end-to-end automatic speech recognition algorithms

Chanwoo Kim, Dhananjaya Gowda, Dongsoo Lee, Jiyeon Kim, Ankur Kumar, Sungsoo Kim, Abhinav Garg, Changwoo Han

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted as an invited paper to the Asilomar Conference on Signals, Systems, and Computers 2020. Figures are slightly updated in Aug. 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03101 2025-08-11 cs.CL 72%

Single-Pass Document Scanning for Question Answering

Weili Cao, Jianyou Wang, Youze Zheng, Longtian Bao, Qirui Zheng, Taylor Berg-Kirkpatrick, Ramamohan Paturi, Leon Bergen

机构 * Laboratory for Emerging Intelligence(新兴智能实验室) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 长上下文与记忆 :language model(abstract,comments);large language model(abstract);分类 cs.CL

Comments Published at Conference on Language Modeling (COLM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12665 2025-07-18 cs.SE cs.AI cs.HC 72%

Single Conversation Methodology: A Human-Centered Protocol for AI-Assisted Software Development

Salvador D. Escobedo

机构 * Stefanini(斯蒂法尼)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI;LLM(comments)

Comments Style reviewed by a LLM for improving clarity and English syntax

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新 71%

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

专题命中 长上下文与记忆 :language model(title)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07121 2026-01-28 cs.CV 71%

Decoding Visual Experience and Mapping Semantics through Whole-Brain Analysis Using fMRI Foundation Models

通过fMRI基础模型进行全脑分析解码视觉体验并映射语义

Yanchen Wang, Adam Turnbull, Tiange Xiang, Yunlong Xu, Sa Zhou, Adnan Masoud, Shekoofeh Azizi, Feng Vankee Lin, Ehsan Adeli

机构 * Department of Psychiatry and Behavioral Sciences, Stanford University(精神病学与行为科学系,斯坦福大学) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Neurobiology, University of Chicago(神经生物学系,芝加哥大学) Google DeepMind(谷歌DeepMind)

专题命中 长上下文与记忆 :foundation model(title)

AI总结 本文提出基于fMRI基础模型的全脑分析方法,通过解码视觉体验提升对视觉处理的理解,实现超越传统视觉皮层的解码能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14945 2025-12-16 cs.CV 71%

3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation

用于场景一致的摄像机可控视频生成的3D场景提示

JoungBin Lee, Jaewoo Jung, Jisang Han, Takuya Narihira, Kazumi Fukuda, Junyoung Seo, Sunghwan Hong, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sony AI(索尼人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Sony Group Corporation(索尼集团)

专题命中 长上下文与记忆 :prompting(title)

AI总结 3DScenePrompt通过双时空条件化和3D场景记忆实现场景一致且可控的视频生成,提升生成质量与摄像机控制精度。

Comments Project page : https://cvlab-kaist.github.io/3DScenePrompt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10679 2025-10-14 cs.CV 71%

MSM-Seg: A Modality-and-Slice Memory Framework with Category-Agnostic Prompting for Multi-Modal Brain Tumor Segmentation

Yuxiang Luo, Qing Xu, Hai Huang, Yuqi Ouyang, Zhen Chen, Wenting Duan

机构 * Graduate School of Information, Production and Systems, Waseda University, Japan(信息、生产与系统研究生院,早稻田大学,日本) School of Computer Science, University of Lincoln, UK(林肯大学计算机科学学院,英国) University of Nottingham, UK(诺丁汉大学,英国) University of Nottingham Ningbo China, China(宁波诺丁汉大学,中国) College of Electrical Engineering and Information, Northeast Agricultural University, Harbin, China(电气工程与信息学院,东北农业大学,中国) College of Computer Science, Sichuan University, Chengdu, China(计算机科学学院,四川大学,中国) Yale University, New Haven, CT 06510, USA(耶鲁大学,美国) School of Engineering and Physical Science, University of Lincoln, Lincoln LN6 7TS, UK(工程与物理科学学院,林肯大学,英国)

专题命中 长上下文与记忆 :prompting(title)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20215 2025-07-29 cs.MA 71%

MLC-Agent: Cognitive Model based on Memory-Learning Collaboration in LLM Empowered Agent Simulation Environment

Ming Zhang, Yiling Xuan, Qun Ma, Yuwei Guo

专题命中 长上下文与记忆 :LLM(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.02162 2025-03-05 eess.AS cs.SD 71%

Language model integration based on memory control for sequence to sequence speech recognition

Jaejin Cho, Shinji Watanabe, Takaaki Hori, Murali Karthick Baskar, Hirofumi Inaguma, Jesus Villalba, Najim Dehak

专题命中 长上下文与记忆 :language model(title)

Comments 4 pages, 1 figure, 5 tables, ICASSP 2019, A notice added to the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18703 2024-10-25 cs.SE 71%

Whose fault is it anyway? SILC: Safe Integration of LLM-Generated Code

Peisen Lin, Yuntong Zhang, Andreea Costea, Abhik Roychoudhury

专题命中 长上下文与记忆 :LLM(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.04137 2020-06-25 cs.SE 71%

Corrigendum and Supplement to "Improve Language Modelling for Code Completion through Learning General Token Repetition of Source Code (with Optimized Memory)"

Yixiao Yang

专题命中 长上下文与记忆 :language model(title)

Comments This paper contains the supplement to the implementation details of the origin paper

详情

展开后加载摘要…

URL PDF HTML 收藏
q-bio/0609051 2009-12-01 q-bio.PE physics.soc-ph 71%

Search for bottleneck effects in Penna ageing and Schulze language model

Krzysztof Malarz, Dietrich Stauffer

专题命中 长上下文与记忆 :language model(title)

Comments RevTeX4, 2 pages, 2 figures with 3 eps files

Journal ref Adv. Complex Syst. 11 (2008) 165

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10828 2026-08-21 cs.AI 版本更新 70%

The First Drop of Ink: Nonlinear Impact of Distracting Information in Long-Context Reasoning

第一滴墨水:误导信息在长上下文推理中的非线性影响

Muhan Gao, Zih-Ching Chen, Kuan-Hao Huang

机构 * Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA NVIDIA AI Technology Center, NVIDIA Corporation, Santa Clara, CA, USA

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了误导信息在长上下文推理中的非线性影响,发现误导信息比例增加时,性能在初期急剧下降,后续变化较小。通过理论和实证分析,揭示了误导信息对注意力的 disproportionate 影响,并指出过滤收益主要来自减少上下文长度而非去除误导信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18677 2026-08-20 cs.AI cs.CY 新提交 70%

Sanyu Studio: A Multi-Agent System for Art-Historical Narrative Construction

三语工作室:用于艺术史叙事构建的多智能体系统

Zhaoxi Wei, Hongye Yang, Shuyuan Tian

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出Sanyu Studio多智能体系统,将321幅常玉油画建模为具备特定机制的智能体,经7天工作坊验证,其可在历史证据有限时放大人类能动性,为公众提供艺术史解读的交互式入口。

Comments 12 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01916 2026-08-20 cs.AI 版本更新 70%

ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair

ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复

Chiwang Luk, Matin Mohammad Najafi, Zhifeng Jia, Wei Yang, Xiuchang Li, Jinwei Zhu, Yang Ren, Lei Chen, Gao Cong

机构 * Huawei(华为) HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00418 2026-08-20 cs.HC cs.AI 70%

Significant Other AI: Identity, Memory, and Emotional Regulation as Long-Term Relational Intelligence

重要他人AI:身份、记忆与情绪调节作为长期关系智能

Sung Park

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SO-AI作为关系AI的新领域,旨在通过身份、记忆和情绪调节等功能,增强人与AI的长期关系稳定性。

Journal ref 2026 7th International Conference on Machine Learning and Human-Computer Interaction (MLHMI), pp. 151-155, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17534 2026-08-19 cs.CL 新提交 70%

ArborMem: Navigating Interaction States with Memory Forests

ArborMem:用记忆森林导航交互状态

Zongwei Lv, Yuemeng Xu, Yilun Yao, Siyi Ding, Xinyu Tan, Yaoming Li, Guangxiang Zhao, Weihong Lin, Lin Sun, Xiangzheng Zhang, Tong Yang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ArborMem是一种在线记忆框架,将对话表示为可导航的交互状态森林,在LongMemEval等基准上优于最强基线,还引入了分支结构诊断基准BranchMemEval。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16889 2026-08-18 cs.RO cs.AI cs.CV 新提交 70%

Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory

不要放弃BATON:通过智能体子任务探索和感知转换的记忆实现长程机器人操作

Bingxin Xu, Yuzhang Shang, Emilio Ferrara

机构 * University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对长程机器人操作的误差累积与子任务转换问题,提出BATON方法,通过子任务探索与感知转换记忆,在RoboMemArena基准上提升任务成功率11.6%、累计成功率14.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏