arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-08 至 2026-04-08 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 15 篇

2511.15424 2026-04-08 cs.CL 92%

LLM-MemCluster: Empowering Large Language Models with Dynamic Memory for Text Clustering

LLM-MemCluster:通过动态内存增强大语言模型进行文本聚类

Yuanjie Zhu, Liangwei Yang, Ke Xu, Weizhi Zhang, Zihe Song, Jindong Wang, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) William & Mary(威廉与玛丽学院)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LLM-MemCluster通过动态内存和双提示策略,实现端到端的文本聚类,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05114 2026-04-08 cs.CL cs.AI cs.LG 89%

$π^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models

$π^2$:结构起源的推理数据提升大语言模型的长上下文推理能力

Quyet V. Do, Thinh Pham, Nguyen Nguyen, Sha Li, Pratibha Zunjare, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出$π^2$方法,通过结构化数据生成高质量推理数据,提升大语言模型的长上下文推理能力,在四个基准测试中取得显著改进。

Comments Our structured analytical reasoning data, which originates from Wikipedia tables, significantly improves long-context reasoning capability of LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05091 2026-04-08 cs.CL cs.DC cs.OS 88%

MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU

MegaTrain:在单块GPU上以全精度训练1000亿参数以上的大型语言模型

Zhengqing Yuan, Hanchi Sun, Lichao Sun, Yanfang Ye

机构 * University of Notre Dame(圣母大学) Lehigh University(里海大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MegaTrain通过在主机内存中存储参数和优化器状态,利用GPU作为临时计算引擎,实现了在单块GPU上以全精度训练超大规模语言模型,并在120B参数模型训练中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05432 2026-04-08 cs.CR cs.AI 85%

Your LLM Agent Can Leak Your Data: Data Exfiltration via Backdoored Tool Use

你的LLM代理可能泄露你的数据:通过植入工具使用的数据外泄

Wuyang Zhang, Shichao Pei

机构 * University of Massachusetts Boston(马萨诸塞大学波士顿分校)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示了通过植入工具使用的LLM代理进行数据外泄的风险,提出Back-Reveal攻击方法,展示多轮交互加剧信息泄露,强调需加强对抗外泄后门的防御。

Comments The 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05400 2026-04-08 cs.AI 85%

HYVE: Hybrid Views for LLM Context Engineering over Machine Data

HYVE:用于机器数据上的LLM上下文工程的混合视图

Jian Tan, Fan Bu, Yuqing Gao, Dev Khanolkar, Jason Mackay, Boris Sobolev, Lei Jin, Li Zhang

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HYVE通过预处理和后处理框架优化LLM处理大规模机器数据的能力,减少token使用并提升输出质量,尤其在图表生成和异常检测任务中表现突出。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05533 2026-04-08 cs.AI 79%

Experience Transfer for Multimodal LLM Agents in Minecraft Game

在Minecraft游戏中多模态大语言模型代理的经验迁移

Chenghao Li, Jun Liu, Songbo Zhang, Huadong Jian, Hao Ni, Lik-Hang Lee, Sung-Ho Bae, Guoqing Wang, Yang Yang, Chaoning Zhang

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出Echo框架,通过分解经验为五维,使代理能从历史交互中提取可操作知识,提升复杂环境下的任务解决效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05074 2026-04-08 cs.CL 79%

Memory Dial: A Training Framework for Controllable Memorization in Language Models

Memory Dial: 一种用于语言模型可控记忆的训练框架

Xiangbo Zhang, Ali Emami

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL

AI总结 Memory Dial通过调节记忆压力参数α,控制语言模型的记忆行为,实验显示α能有效调节记忆压力,大模型更敏感,常见序列更易记忆。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05854 2026-04-08 cs.AI 77%

Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring

深度研究员代理:一个全天候深度学习实验的自主框架,零成本监控

Xiangyue Zhang

机构 * The University of Tokyo(东京大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出深度研究员代理框架,实现24/7深度学习实验自动化,通过零成本监控、双层固定大小内存和最小工具集架构,提升实验效率与成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20791 2026-04-08 cs.SE cs.AI 77%

From Cool Demos to Production-Ready FMware: Core Challenges and a Technology Roadmap

从Cool演示到生产级FMware:核心挑战和技术路线图

Gopi Krishnan Rajbahadur, Gustavo A. Oliva, Dayi Lin, Jiho Shin, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Queen's University(女王大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文探讨了从演示级到生产级FMware的过渡挑战,分析了FMware选型、数据对齐、提示工程等关键问题,并提出技术路线图以指导其规模化应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05248 2026-04-08 cs.LG cs.CL 73%

Improving Sparse Memory Finetuning

改进稀疏记忆微调

Satyam Goyal, Anirudh Kanchi, Garv Shah, Prakhar Gupta

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出稀疏记忆微调方法,通过局部更新显式内存层参数,解决持续学习中的灾难性遗忘问题,并在消费级硬件上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06070 2026-04-08 cs.CL cs.LG 62%

Short Data, Long Context: Distilling Positional Knowledge in Transformers

短数据,长上下文:在Transformer中蒸馏位置知识

Patrick Huber, Ernie Chang, Chinnadhurai Sankar, Rylan Conway, Igor Fedorov, Md Rifat Arefin, Adithya Sagar

机构 * Meta Reality Labs(Meta现实实验室)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过基于logit的知识蒸馏,在不使用长上下文预训练的情况下,实现了长上下文检索能力的转移,揭示了位置信息在模型中的传播机制及参数更新模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02623 2026-04-08 cs.CR cs.AI 57%

Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents

一次投毒,永久利用:针对网络代理的环境注入内存投毒攻击

Wei Zou, Mingwen Dong, Miguel Romero Calvo, Shuaichen Chang, Jiang Guo, Dongkyu Lee, Xing Niu, Xiaofei Ma, Yanjun Qi, Jiarong Jiang

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon Web Services(亚马逊云服务)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 研究提出eTAMP攻击,通过环境观察污染代理内存,实现跨会话和跨网站的持久化攻击,实验显示攻击成功率高达32.5%,且环境压力下代理易受攻击,高能力模型同样存在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00503 2026-04-08 cs.CV 50%

PET-DINO: Unifying Visual Cues into Grounding DINO with Prompt-Enriched Training

PET-DINO:将视觉线索统一到Grounding DINO中通过提示增强训练

Weifu Fu, Jinyang Li, Bin-Bin Gao, Jialin Li, Yuhuan Lin, Hanqiu Deng, Wenbing Tao, Yong Liu, Chengjie Wang

机构 * YouTu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技可灵团队)

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 PET-DINO通过提示增强训练策略,统一视觉线索到Grounding DINO中,提升零样本目标检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26788 2026-04-08 cs.RO cs.CV 50%

ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation

ReMemNav:一种重新思考和记忆增强的零样本物体导航框架

Feng Wu, Wei Zuo, Wenliang Yang, Jun Xiao, Yang Liu, Xinhua Zeng

机构 * Fudan University(复旦大学) Tongji University(同济大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 ReMemNav通过整合全景语义先验和事件记忆,改进了零样本物体导航中的空间推理和决策,提升了成功率和探索效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00181 2026-04-08 cs.CV cs.CR 50%

From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection

从证据到判决:一种基于智能体的AI生成图像检测框架

Mengfei Liang, Yiting Qu, Yukun Jiang, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出AIFo框架,通过多智能体协作进行多阶段取证分析,整合逆向图像搜索、元数据提取等工具,实现高准确率的AI生成图像检测。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏