arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-29 至 2026-04-29 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 12 篇

2604.25847 2026-04-29 math.OC cs.AI cs.LG 90%

From Soliloquy to Agora: Memory-Enhanced LLM Agents with Decentralized Debate for Optimization Modeling

从独白到广场:基于去中心化辩论的记忆增强型LLM代理用于优化建模

Jianghao Lin, Zi Ling, Chenyu Zhou, Tianyi Xu, Ruoqing Jiang, Zizhuo Wang, Dongdong Ge

机构 * Antai College of Economics and Management(上海交通大学安泰经济管理学院) University of Chicago Booth School of Business(芝加哥大学布斯商学院) The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳)) School of Economics and Management(清华大学经济管理学院)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agora-Opt框架,结合去中心化辩论与读写记忆库,实现优化建模的模块化代理系统,通过去中心化辩论协议实现多代理团队的协同优化,提升建模可靠性。

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25135 2026-04-29 cs.CL 86%

FAMA: Failure-Aware Meta-Agentic Framework for Open-Source LLMs in Interactive Tool Use Environments

FAMA:面向交互工具使用环境的开源大语言模型失败意识元代理框架

Amir Saeidi, Venkatesh Mishra, Souradeep Mukhopadhyay, Gaowen Liu, Ali Payani, Jayanth Srinivasa, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Cisco Research(思科研究)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FAMA框架通过分析基线代理的失败轨迹识别常见错误,并利用 orchestration 机制激活专门的代理来针对性解决失败问题,实验显示在开源LLM上性能提升达27%。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19684 2026-04-29 cs.CR 82%

LLM-Assisted Authentication and Fraud Detection

基于大语言模型的认证与欺诈检测

Emunah S-S. Chan, Aldar C-F. Chan

专题命中 长上下文与记忆 :LLM(title,abstract)

AI总结 本文提出基于大语言模型的认证机制和欺诈检测流水线,通过语义判断和文档分段提升认证准确率,减少欺诈误报,验证了大语言模型在安全流程中的应用价值。

Comments 20 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24905 2026-04-29 cs.MA cs.AI 81%

MultiHedge: Adaptive Coordination via Retrieval-Augmented Control

MultiHedge:通过检索增强控制实现自适应协调

Feliks Bańka, Jarosław A. Chudziak

机构 * The Faculty of Electronics and Information Technology(电子与信息技术学院)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出MultiHedge框架,通过检索增强的LLM协调提升模块化决策系统的鲁棒性,实验表明记忆增强比单纯扩大模型规模更有效。

Comments 8 pages, 2 figures. Accepted to the 26th International Conference on Computational Science (ICCS 2026), to appear in Springer LNCS proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08816 2026-04-29 cs.IR cs.AI 81%

MemRec: Collaborative Memory-Augmented Agentic Recommender System

MemRec:协同记忆增强的代理推荐系统

Weixin Chen, Yuhan Zhao, Jingyuan Huang, Zihe Ye, Clark Mingxuan Ju, Tong Zhao, Neil Shah, Li Chen, Yongfeng Zhang

机构 * Hong Kong Baptist University(香港 Baptist大学) Rutgers University(罗格斯大学) Snap Inc.(Snap公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MemRec通过引入协同记忆机制,解决传统推荐系统中记忆隔离导致的上下文过载问题,通过轻量级语言模型管理动态记忆图谱,提升推荐精度与效率。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12087 2026-04-29 cs.CL 81%

BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding

BLASST: 通过Softmax阈值实现动态阻塞注意力稀疏性

Jiayi Yuan, Cameron Shinn, Kai Xu, Jingze Cui, George Klimiashvili, Guangxuan Xiao, Perkz Zheng, Bo Li, Yuxin Zhou, Zhouhai Ye, Weijie You, Tian Zheng, Dominic Brown, Pengbo Wang, Markus Hoehnerbach, Richard Cai, Julien Demouth, John D. Owens, Xia Hu, Song Han, Timmy Liu, Huizi Mao

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 长上下文与记忆 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BLASST通过Softmax阈值实现动态稀疏注意力机制,提升LLM长上下文推理效率,无需训练,减少预计算,优化硬件支持,实现1.52x和1.48x的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24809 2026-04-29 cs.LG cs.AI 73%

Nautile-370M: Spectral Memory Meets Attention in a Small Reasoning Model

Nautile-370M:在小推理模型中融合频谱记忆与注意力

Maixent Chenebaux

专题命中 长上下文与记忆 :language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 Nautile-370M是一款3.7亿参数的小语言模型,通过融合频谱记忆与注意力机制,在有限参数和推理预算下实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05030 2026-04-29 cs.CL cs.AI cs.LG 67%

Phase-Associative Memory: Sequence Modeling in Complex Hilbert Space

相关联记忆:复杂希尔伯特空间中的序列建模

Gowrav Vishwakarma, Christopher J. Agostino

机构 * Xavoc Technocrats Pvt.\ Ltd., , India

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出相关联记忆(PAM)模型,利用复杂值序列建模在复杂希尔伯特空间中实现更有效的语言建模,通过对比实值和复值架构,发现复值架构在参数规模增加时具有更快的改进速度。

Comments submitting to APS Open Science, 13 pages, 3 figure, code and training logs available at https://github.com/gowrav-vishwakarma/qllm2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07499 2026-04-29 cs.CL cs.AI cs.LG 67%

When Thoughts Meet Facts: Reusable Reasoning for Long-Context LMs

当思维遇见事实:长上下文语言模型的可重用推理

Soyeong Jeong, Taehee Jung, Sung Ju Hwang, Joo-Kyung Kim, Dongyeop Kang

机构 * KAIST(韩国科学技术院) Amazon(亚马逊) University of Minnesota(明尼苏达大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Thought Templates用于长上下文语言模型的可重用推理,通过迭代更新策略提升多跳推理能力,并展示其在多种基准测试中的优越表现。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25562 2026-04-29 cs.CR cs.AI 57%

SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents

SnapGuard: 基于截图的轻量级提示注入检测方法

Mengyao Du, Han Fang, Haokai Ma, Jiahao Chen, Kai Xu, Quanjun Yin, Ee-Chien Chang

机构 * National University of Defense Technology(国防科技大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 针对基于截图的网络代理面临的提示注入攻击问题,提出SnapGuard方法,通过视觉稳定指标和文本信号分析实现高效检测,达到F1得分0.75,速度提升8倍。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26554 2026-04-29 cs.LG stat.ML 57%

Sharp Capacity Scaling of Spectral Optimizers in Learning Associative Memory

谱优化器在关联记忆学习中的容量扩展分析

Juno Kim, Eshaan Nichani, Denny Wu, Alberto Bietti, Jason D. Lee

机构 * UC Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) New York University(纽约大学) Flatiron Institute(Flatiron研究所)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本文研究了谱优化器在关联记忆问题中的性能,发现Muon的存储容量显著超过SGD,且在仅使用一阶信息时可与牛顿法匹配。通过实验验证了预测的扩展规律,为更实际的语言建模任务提供了理论基础。

Comments 84 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24893 2026-04-29 cs.CV 50%

Interactive Episodic Memory with User Feedback

具有用户反馈的交互式事件记忆

Nikesh Subedi, Loris Bazzani, Ziad Al-Halah

机构 * University of Utah(犹他大学) University of Verona(威尼斯大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出EM-QnF任务,通过用户反馈和补充信息提升事件记忆查询的准确性,引入FALM模块实现高效交互式优化,优于现有方法并在现实场景中表现良好。

Comments Accepted to CVPR 2026. Project Page: https://nsubedi11.github.io/refocus

详情

展开后加载摘要…

URL PDF HTML 收藏