arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-16 至 2026-03-16 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 7 篇

2603.12272 2026-03-16 cs.CL cs.LG 90%

ActTail: Global Activation Sparsity in Large Language Models

ActTail:大语言模型中的全局激活稀疏性

Wenwen Hou, Xinyuan Song, Shiwei Liu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ActTail方法,基于Heavy-Tailed Self-Regularization理论,通过计算每个投影的经验谱密度得到重尾指数,实现基于投影的稀疏性分配,提升大语言模型在高稀疏率下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23863 2026-03-16 cs.CL 83%

SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models

SPELL: 自我扮演强化学习用于进化长上下文语言模型

Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出SPELL框架,通过自我扮演问答和验证角色实现长上下文推理的无监督优化,实验显示其在多个基准上优于传统微调方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17023 2026-03-16 cs.DC cs.SE 82%

LLM-HPC++: Evaluating LLM-Generated Modern C++ and MPI+OpenMP Codes for Scalable Mandelbrot Set Computation

LLM-HPC++: 评估LLM生成的现代C++和MPI+OpenMP代码用于可扩展的曼德勃罗集计算

Patrick Diehl, Noujoud Nader, Deepti Gupta

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文评估了LLM生成的C++和MPI+OpenMP代码在曼德勃罗集计算中的性能,发现ChatGPT-4和5在语法精度和可扩展性方面表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12414 2026-03-16 cs.LG cs.CR 57%

SpectralGuard: Detecting Memory Collapse Attacks in State Space Models

SpectralGuard: 在状态空间模型中检测内存崩溃攻击

Davi Bonetto

机构 * Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 研究针对状态空间模型中的内存崩溃攻击问题,提出SpectralGuard方法,通过监测谱稳定性提升模型安全性,实现高检测率和低延迟。

Comments 24 pages, 10 figures. Code, dataset, and demo: https://github.com/DaviBonetto/spectralguard

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22954 2026-03-16 cs.AI 57%

Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents

达尔文戈德尔机器:自我改进代理的开放性进化

Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI

AI总结 本文提出达尔文戈德尔机器,通过迭代修改自身代码并验证改进,实现自我提升,提升代码能力并在多个基准测试中取得显著成绩。

Comments Code at https://github.com/jennyzzt/dgm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12759 2026-03-16 cs.CV 50%

SAP: Segment Any 4K Panorama

SAP: 4K全景任意分割

Lutao Jiang, Zidong Cao, Weikai Chen, Xu Zheng, Yuanhuiyi Lyu, Zhenyang Li, Zeyu HU, Yingda Yin, Keyang Luo, Runze Zhang, Kai Yan, Shengju Qian, Haidi Fan, Yifan Peng, Xin Wang, Hui Xiong, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LIGHTSPEED The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出SAP模型,通过将全景分割转化为固定轨迹视角视频分割,实现4K高分辨率全景实例分割,合成183440张4K全景图像并提升零样本mIoU性能。

Comments Project Page: https://lutao2021.github.io/SAP_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12608 2026-03-16 cs.IR cs.HC 50%

InterDeepResearch: Enabling Human-Agent Collaborative Information Seeking through Interactive Deep Research

InterDeepResearch:通过交互式深度研究实现人机协作的信息检索

Bo Pan, Lunke Pan, Yitao Zhou, Qi Jiang, Zhen Wen, Minfeng Zhu, Wei Chen

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出InterDeepResearch系统,通过交互式深度研究框架提升人机协作信息检索效率,实验证明其在性能和用户研究支持方面具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏