arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2605.10993 2026-05-13 cs.RO 50%

ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models

ECHO:面向视觉-语言-动作模型的连续层次记忆

Yanbin Hu, Jin Cui, Jiayi Lu, Ruixuan Yang, Jun Ye, Boran Zhao, Xingyu Chen, Xuguang Lan, Pengju Ren

机构 * School of Software, Xi’an Jiaotong University(西安交通大学软件学院) School of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室,人工智能与机器人研究院)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出ECHO框架,通过连续层次空间提升视觉-语言-动作模型在长周期任务中的表现,实现高效经验检索与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10936 2026-05-12 cs.CV 50%

Personal Visual Context Learning in Large Multimodal Models

个人视觉上下文学习在大型多模态模型中

Zihui Xue, Ami Baid, Sangho Kim, Mi Luo, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 本文提出个人视觉上下文学习(Personal VCL)以解决个性化查询,通过Personal-VCL-Bench评估,发现现有模型在利用视觉证据和聚合多视觉观察方面存在显著不足,提出Agentic Context Bank方法提升性能。

Comments Project website: https://vision.cs.utexas.edu/projects/PersonalVCL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00678 2026-05-04 cs.CV 50%

Foundation AI Models for Aerosol Optical Depth Estimation from PACE Satellite Data

基于PACE卫星数据的气溶胶光学深度估计的基础AI模型

Zahid Hassan Tushar, Sanjay Purushotham

机构 * IEEE Service Center(IEEE服务中心)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出ViTCG模型,通过融合空间和光谱信息,有效降低气溶胶光学深度估计的误差,实验显示比现有模型减少62%的均方误差。

Comments 5 pages, 4 figures, to appear in 2026 IEEE International Geoscience and Remote Sensing Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05959 2026-04-30 cs.CV 50%

OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer

OVGGT:O(1)常数成本流式视觉几何变换器

Si-Yu Lu, Po-Ting Chen, Hui-Che Hsu, Sin-Ye Jhong, Wen-Huang Cheng, Yung-Yao Chen

机构 * National Taiwan University(国立台湾大学) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 OVGGT通过自选择缓存和动态锚点保护,在固定内存预算下实现长视频流式处理,取得最佳3D几何精度。

Comments Project page: https://vaisr.github.io/OVGGT/ Code: https://github.com/VAISR/OVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24893 2026-04-29 cs.CV 50%

Interactive Episodic Memory with User Feedback

具有用户反馈的交互式事件记忆

Nikesh Subedi, Loris Bazzani, Ziad Al-Halah

机构 * University of Utah(犹他大学) University of Verona(威尼斯大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出EM-QnF任务,通过用户反馈和补充信息提升事件记忆查询的准确性,引入FALM模块实现高效交互式优化,优于现有方法并在现实场景中表现良好。

Comments Accepted to CVPR 2026. Project Page: https://nsubedi11.github.io/refocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06974 2026-04-27 cs.RO cs.CV 50%

FeudalNav: A Simple Framework for Visual Navigation

FeudalNav: 一种用于视觉导航的简单框架

Faith Johnson, Bryan Bo Cao, Shubham Jain, Ashwin Ashok, Kristin Dana

机构 * Rutgers University(罗格斯大学) Stony Brook University(石溪大学) Georgia State University(佐治亚州立大学)

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 本文提出FeudalNav框架,通过分层结构实现导航决策,利用视觉相似性构建隐空间记忆模块,无需地图即可在新环境中导航,并通过人机交互提升导航性能。

Comments 8 Pages, 6 figures and 4 tables. arXiv admin note: substantial text overlap with arXiv:2411.09893, arXiv:2402.12498

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20530 2026-04-22 cs.RO cs.CV 50%

Memory Over Maps: 3D Object Localization Without Reconstruction

记忆超越映射:无需重建的3D物体定位

Rui Zhou, Xander Yap, Jianwen Cao, Allison Lau, Boyang Sun, Marc Pollefeys

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Microsoft(微软)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出无需重建的3D物体定位方法,通过轻量级视觉记忆实现快速场景索引,显著降低预处理成本,验证了基于图像的场景记忆可替代密集3D重建。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15577 2026-04-22 cs.CV 50%

MoonSeg3R: Monocular Online Zero-Shot Segment Anything in 3D with Reconstructive Foundation Priors

MoonSeg3R: 单目在线零样本三维实例分割与重建基础先验

Zhipeng Du, Duolikun Danier, Jan Eric Lenssen, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出MoonSeg3R,通过引入自监督查询精炼模块、3D查询索引记忆和CUT3R状态分布token,实现单目在线零样本三维实例分割,性能媲美RGB-D系统。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18271 2026-04-21 cs.RO 50%

EmbodiedLGR: Integrating Lightweight Graph Representation and Retrieval for Semantic-Spatial Memory in Robotic Agents

EmbodiedLGR:整合轻量级图表示与检索用于机器人代理中的语义-空间记忆

Paolo Riva, Leonardo Gargani, Matteo Frosi, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering (DEIB), Politecnico di Milano(电子、信息与生物工程系(DEIB),米兰理工大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出EmbodiedLGR-Agent,通过参数高效VLM构建语义-空间记忆,实现高效的环境记忆表示与检索,实验证明其在推理和查询时间上达到SOTA,且在实际部署中表现出良好的实用性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13671 2026-04-17 cs.CV 50%

AgentIAD: Agentic Industrial Anomaly Detection via Adaptive Memory Augmentation

AgentIAD: 通过自适应记忆增强的代理工业异常检测

Junwen Miao, Penghui Du, Yingying Fan, Yi Liu, Yu Wang, Runze He, Lida Huang, Yan Wang

机构 * AIR, Tsinghua University(清华大学AIR) Etude AI Stony Brook University(石溪大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出AgentIAD框架,通过统一的动作空间实现迭代工业检测,利用视觉记忆和检索记忆进行多轮感知-行动推理,提升异常检测准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14925 2026-04-13 cs.SE 50%

CODEPROMPTZIP: Code-specific Prompt Compression for Retrieval-Augmented Generation in Coding Tasks with LMs

CODEPROMPTZIP:用于编码任务中基于检索的生成的代码特定提示压缩

Pengfei He, Shaowei Wang, Tse-Hsun Chen

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出CodePromptZip框架,通过程序分析识别代码token类型并进行消融分析,训练小型LM实现灵活压缩,提升编码任务性能。

Comments Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07901 2026-04-10 cs.CV 50%

PanoSAM2: Lightweight Distortion- and Memory-aware Adaptions of SAM2 for 360 Video Object Segmentation

PanoSAM2:轻量级的失真和内存感知的SAM2改进用于360视频对象分割

Dingwen Xiao, Weiming Zhang, Shiqi Wen, Lin Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 本文提出PanoSAM2,通过改进SAM2以应对360视频中的失真和内存问题,提升分割可靠性,同时保持用户友好的提示设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06773 2026-04-09 cs.HC 50%

MemoryDiorama: Generating Dynamic 3D Diorama from Everyday Photos for Memory Recall

MemoryDiorama:从日常照片生成动态3D场景以增强记忆回忆

Keiichi Ihara, Tianle Li, Yasuhisa Shiino, Ryo Suzuki

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 MemoryDiorama通过整合LLM场景分析与3D生成技术,将日常照片转化为动态3D场景,提升记忆回忆的丰富性与生动性。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06506 2026-04-09 cs.CR cs.SE 50%

Guiding Symbolic Execution with Static Analysis and LLMs for Vulnerability Discovery

通过静态分析和LLMs引导符号执行以发现漏洞

Md Shafiuzzaman, Achintya Desai, Wenbo Guo, Tevfik Bultan

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 SAILOR结合静态分析与LLM合成自动构建符号执行Harness,通过三个阶段发现内存安全漏洞,实验表明其在大规模代码库中显著提升漏洞检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00503 2026-04-08 cs.CV 50%

PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training

PET-DINO:将视觉线索统一到Grounding DINO中通过提示增强训练

Weifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li, Yuhuan Lin, Hanqiu Deng, Wenbing Tao, Yong Liu, Chengjie Wang

机构 * YouTu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技可灵团队)

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 PET-DINO通过提示增强训练策略,统一视觉线索到Grounding DINO中,提升零样本目标检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26788 2026-04-08 cs.RO cs.CV 50%

ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation

ReMemNav:一种重新思考和记忆增强的零样本物体导航框架

Feng Wu, Wei Zuo, Wenliang Yang, Jun Xiao, Yang Liu, Xinhua Zeng

机构 * Fudan University(复旦大学) Tongji University(同济大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 ReMemNav通过整合全景语义先验和事件记忆,改进了零样本物体导航中的空间推理和决策,提升了成功率和探索效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00181 2026-04-08 cs.CV cs.CR 50%

From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection

从证据到判决:一种基于智能体的AI生成图像检测框架

Mengfei Liang, Yiting Qu, Yukun Jiang, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出AIFo框架,通过多智能体协作进行多阶段取证分析,整合逆向图像搜索、元数据提取等工具,实现高准确率的AI生成图像检测。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04108 2026-04-07 cs.CV 50%

Hypothesis Graph Refinement: Hypothesis-Driven Exploration with Cascade Error Correction for Embodied Navigation

假设图细化:基于假设的探索与级联错误校正的具身导航

Peixin Chen, Guoxi Zhang, Jianwei Ma, Qing Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Peking University(北京大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出HGR框架,通过假设节点的可修改性实现具身导航中的定向探索,并通过级联校正系统性地纠正错误。实验显示HGR在GOAT-Bench和QA基准上均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11848 2026-04-07 cs.HC 50%

Compass vs Railway Tracks: Unpacking User Mental Models for Communicating Long-Horizon Work to Humans vs. AI

指南针与铁轨:解析用户心理模型以向人类和AI传达长期任务

Savvas Petridis, Michael Xieyang Liu, Alexander J. Fiannaca, Carrie J. Cai, Michael Terry

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 研究探讨用户如何向人类和AI传达长期任务,发现人类协作如指南针,AI则需铁轨般的明确指令,提出设计未来AI系统的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02431 2026-04-06 cs.IR 50%

SelRoute: Query-Type-Aware Routing for Long-Term Conversational Memory Retrieval

SelRoute:基于查询类型的长期对话记忆检索路由

Matthew McKee

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 SelRoute通过根据查询类型选择专用检索管道提升长期对话记忆检索效果,实验显示其在多个基准测试中表现优异,但存在推理密集型检索任务的失败模式。

Comments 12 pages, 12 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02317 2026-04-03 cs.CV 50%

A Simple Baseline for Streaming Video Understanding

流媒体视频理解的简单基线

Yujiao Shen, Shulin Tian, Jingkang Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出SimpleStream基线,通过滑动窗口仅使用最近N帧输入现成的VLM,在OVO-Bench和StreamingBench上表现优异,揭示了长上下文对性能的非线性影响及感知与记忆的权衡。

Comments Project page: https://simple-stream.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01869 2026-04-03 cs.CV 50%

GeoAI Agency Primitives

地理人工智能代理原语

Akram Zaytar, Rohan Sawahn, Caleb Robinson, Gilles Q. Hacheme, Girmaw A. Tadesse, Inbal Becker-Reshef, Rahul Dodhia, Juan Lavista Ferres

机构 * Microsoft AI for Good Lab(微软人工智能公益实验室) NASA Harvest

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出9个原语用于地理人工智能代理层,解决GIS实践中迭代协作的缺失问题,通过基准测试提升人类生产力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00965 2026-04-02 math.NA cs.NA 50%

Understanding Transformers and Attention Mechanisms: An Introduction for Applied Mathematicians

理解Transformer和注意力机制:面向应用数学家的入门

Michel Fabrice Serret

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文为应用数学家介绍Transformer架构中的注意力机制,涵盖文本向量编码、多头注意力、Transformer结构及其变体,以及降低计算和内存成本的现代方法。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00945 2026-04-02 cs.CY 50%

A Visionary Look at Vibe Researching

对Vibe研究的前瞻性展望

Yebo Feng, Yang Liu

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文探讨了Vibe研究范式,结合人类指导与AI代理,提出多智能体架构、记忆、工具使用等方法,分析其技术限制与社会影响,为负责任的采用提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29962 2026-04-02 cs.CV 50%

SurgTEMP: Temporal-Aware Surgical Video Question Answering with Text-guided Visual Memory for Laparoscopic Cholecystectomy

SurgTEMP:基于文本引导的视觉记忆的时序感知手术视频问答系统用于腹腔镜胆囊切除术

Shi Li, Vinkle Srivastav, Nicolas Chanel, Saurav Sharma, Nabani Banik, Lorenzo Arboit, Kun Yuan, Pietro Mascagni, Nicolas Padoy

机构 * University of Strasbourg(斯特拉斯堡大学) CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) ICube, UMR7357(ICube实验室,UMR7357)

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 SurgTEMP通过文本引导的视觉记忆和时序感知模块,提升手术视频问答的性能,其核心方法是构建层次化的视觉记忆并采用手术能力进步训练方案,从而在复杂手术场景中实现更准确的问答与评估。

Comments 29 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22150 2026-04-01 cs.CV 50%

Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions

视觉语言模型是感知还是记忆?通过经典视觉错觉探测视觉感知与记忆

Xiaoxiao Sun, Mingyang Li, Kun Yuan, Min Woo Sun, Mark Endo, Shengguang Wu, Changlin Li, Yuhui Zhang, Zeyu Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) University of Strasbourg(斯特拉斯堡大学) Technical University of Munich(慕尼黑工业大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文通过经典视觉错觉研究视觉语言模型的感知与记忆机制,提出VI-Probe框架,揭示不同模型对视觉变化的响应来源,挑战单一原因观点。

Comments 26 pages, 31 figures, 13 tables. Project Page: https://sites.google.com/view/vi-probe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21562 2026-03-24 cs.CV 50%

Exploring Multimodal Prompts For Unsupervised Continuous Anomaly Detection

探索多模态提示用于无监督连续异常检测

Mingle Zhou, Jiahui Liu, Jin Wan, Gang Li, Min Li

机构 * Key Laboratory of Computing Power Network(计算能力网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东科学院)) Shandong Provincial Key Laboratory of Computing Power Internet(山东省计算能力互联网重点实验室) Service Computing, Shandong Fundamental Research Center for Computer Science(服务计算,山东省计算机基础研究中心) Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学)

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 本文提出基于多模态提示的无监督连续异常检测框架,通过持续多模态提示记忆库和缺陷语义引导自适应融合机制提升检测精度与鲁棒性,实验表明在MVTec AD和VisA数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21460 2026-03-24 cs.HC 50%

Tell Me What I Missed: Interacting with GPT during Recalling of One-Time Witnessed Events

告诉我我错过了什么:在回忆一次目睹事件时与GPT互动

Suifang Zhou, Qi Gong, Ximing Shen, Ray LC

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 研究探讨了在回忆一次性目睹事件时,用户如何与GPT交互,发现默认模式下用户更信任GPT输出,而引导模式下用户回忆与主观清晰度更一致,且不同条件下对事件中人物的合法性评价也不同。

Comments 19 pages, 9 figures, CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08935 2026-03-24 cs.RO cs.CV 50%

Expand Your SCOPE: Semantic Cognition over Potential-Based Exploration for Embodied Visual Navigation

拓展你的SCOPE:基于潜在探索的语义认知用于具身视觉导航

Ningnan Wang, Weihuang Chen, Liming Chen, Haoxuan Ji, Zhongyu Guo, Xuchong Zhang, Hongbin Sun

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出SCOPE框架,通过利用前沿信息驱动潜在探索,提升具身视觉导航中的决策质量与目标相关性,实验表明其在准确性和泛化能力上优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09525 2026-03-24 cs.DC cs.OS 50%

TrEnv-X: Transparently Share Serverless Execution Environments Across Different Functions and Nodes

TrEnv-X:跨不同函数和节点透明共享无服务器执行环境

Jialiang Huang, Teng Ma, Zheng Liu, Sixing Lin, Kang Chen, Jinlei Jiang, Xia Liao, Yingdi Shan, Yongwei Wu, Ning Zhang, Mengting Lu, Tao Ma, Haifeng Gong, Mingxing Zhang

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 TrEnv-X通过整合无服务器平台与操作系统及CXL/RDMA远程内存池,实现跨函数的可重用沙箱和内存模板,降低创建开销并提升内存弹性,实验表明其在P99延迟和内存使用上均有显著提升。

Comments Accepted by ACM Transactions on Computer Systems (TOCS)

详情

展开后加载摘要…

URL PDF HTML 收藏