arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-14 至 2026-04-14 共收录 589 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 13 篇

2603.18806 2026-04-14 cs.AI 88%

dTRPO: Trajectory Reduction in Policy Optimization of Diffusion Large Language Models

dTRPO:扩散大语言模型策略优化中的轨迹缩减

Wenxuan Zhang, Lemeng Wu, Changsheng Zhao, Ernie Chang, Mingchen Zhuge, Zechun Liu, Andy Su, Hanxian Huang, Jun Chen, Chong Zhou, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Wei Wen

机构 * Meta AI

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出dTRPO,通过减少轨迹概率计算成本提升扩散大语言模型的策略优化效果,实验显示在STEM、编程和指令遵循任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10480 2026-04-14 cs.AI 87%

Tracing the Roots: A Multi-Agent Framework for Uncovering Data Lineage in Post-Training LLMs

追溯根源:一种多智能体框架,用于揭示训练后LLM的数据血缘

Yu Li, Xiaoran Shang, Qizhi Pei, Yun Zhu, Xin Gao, Honglin Lin, Zhanping Zhong, Zhuoshi Pan, Zheng Liu, Xiaoyang Wang, Conghui He, Dahua Lin, Feng Zhao, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出多智能体框架,用于揭示训练后LLM的数据血缘,识别数据集演化图谱中的结构模式与系统问题,构建血缘感知的多样化数据集。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24251 2026-04-14 cs.SI 87%

GRAPHIA: Harnessing Social Graph Data to Enhance LLM-Based Social Simulation

GRAPHIA:利用社交图数据增强基于LLM的社会模拟

Jiarui Ji, Zehua Zhang, Zhewei Wei, Bin Tong, Guan Wang, Bo Zheng

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 GRAPHIA通过强化学习利用社交图数据作为LLM训练的监督信号,提升社会模拟的微观和宏观对齐效果,实验显示其在多个真实网络中显著提高预测精度和社会现象复制能力。

Comments accepted by ACL26 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10996 2026-04-14 cs.CL cs.AI cs.CE 86%

When Valid Signals Fail: Regime Boundaries Between LLM Features and RL Trading Policies

当有效信号失效时:LLM特征与强化学习交易策略之间的制度边界

Zhengzhe Yang

机构 * Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM生成连续数值特征是否能提升强化学习交易代理性能,发现有效特征在分布偏移时会引入噪声,影响策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11259 2026-04-14 cs.AI cs.CR 85%

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

基于轨迹诱导的偏好优化的移动GUI代理隐私个性化

Zhixin Lin, Jungang Li, Dongliang Xu, Shidong Pan, Yibo Shi, Yuchi Liu, Yuecong Min, Yue Yao

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) New York University(纽约大学) Xi'an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究移动GUI代理的隐私个性化问题,提出轨迹诱导偏好优化方法,通过偏好强度加权和填充门机制提升隐私保护与任务执行效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06416 2026-04-14 cs.LG cs.AI cs.HC 81%

Influencing Humans to Conform to Preference Models for RLHF

影响人类以符合偏好模型的强化学习从人类反馈

Stephane Hatgis-Kessell, W. Bradley Knox, Serena Booth, Peter Stone

机构 * Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学) Sony AI(索尼AI)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过三项人类研究,探讨如何通过干预使人类偏好更符合预期模型,提升RLHF奖励函数对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11477 2026-04-14 cs.AI cs.SE q-fin.TR 79%

OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems

OOM-RL:基于大语言模型多智能体系统的出钱强化学习市场驱动对齐

Kun Liu, Liqun Chen

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract);分类 cs.AI

AI总结 本文提出OOM-RL方法,通过将智能体部署到金融市场中,利用资本耗尽作为不可篡改的负梯度,使多智能体系统从过度迎合的基线进化为稳健的流动性感知架构,最终实现稳定均衡。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09855 2026-04-14 cs.AI cs.CL cs.GT econ.GN q-fin.EC 79%

Instructing LLMs to Negotiate using Reinforcement Learning with Verifiable Rewards

通过可验证奖励的强化学习指导大语言模型进行谈判

Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao, Lei Lei, Yuheng Zhang, Yisong Yue, David Simchi-Levi

机构 * Purdue University(普渡大学) California Institute of Technology(加州理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了通过可验证奖励的强化学习训练大语言模型进行谈判的有效性,揭示了四阶段战略演化,展示了训练后的模型在谈判中提取剩余价值的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10604 2026-04-14 cs.IR cs.AI cs.CL cs.LG 78%

NSFL: A Post-Training Neuro-Symbolic Fuzzy Logic Framework for Boolean Operators in Neural Embeddings

NSFL:一种用于神经嵌入中布尔运算的后训练神经符号模糊逻辑框架

Vladi Vexler, Ofer Idan, Gil Lederman, Dima Sivov

机构 * Huawei Tel-Aviv Research Center(华为特拉维夫研究中心)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.CL、cs.AI、cs.LG

AI总结 NSFL框架通过适应形式t-范数和t-余范数,为神经嵌入空间提供多原子逻辑约束的计算方法,提升检索性能,实现高达81%的mAP提升。

Comments 23 pages (16 main + 7 appendix), 2 figures, 10 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19731 2026-04-14 cs.CL 77%

Preference Learning Unlocks LLMs' Psycho-Counseling Skills

偏好学习解锁大语言模型的心理咨询技能

Mian Zhang, Shaun M. Eack, Zhiyu Zoey Chen

机构 * Department of Computer Science, University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) School of Social Work, University of Pittsburgh(匹兹堡大学社会工作学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出专业评估原则构建偏好数据集,用于提升LLM在心理咨询中的响应能力,实验表明该数据集能有效提升模型表现,最佳模型在对比中胜率高达87%。

Comments ACL 2026 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-04-14 cs.AI 77%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07972 2026-04-14 cs.AI 70%

SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance

SHE:面向电商搜索相关性的分步混合检验强化学习框架

Pengkun Jiao, Yiming Jin, Jianhui Yang, Chenhe Dong, Zerui Huang, Shaowei Yao, Xiaojiang Zhou, Dan Ou, Haihong Tang

机构 * Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出SHE框架,通过分步奖励策略优化提升电商搜索相关性预测的逻辑一致性与准确性,优于SFT、DPO等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11521 2026-04-14 cs.LG cs.CV 57%

Continuous Adversarial Flow Models

连续对抗流模型

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan

机构 * ByteDance Seed(字节跳动Seed)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出连续对抗流模型,通过对抗目标训练,改进了流匹配的均方误差准则,提升样本与目标分布的对齐性,适用于现有流匹配模型的后训练,显著降低FID分数并提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 24 篇

2604.11462 2026-04-14 cs.AI 85%

Escaping the Context Bottleneck: Active Context Curation for LLM Agents via Reinforcement Learning

突破上下文瓶颈:通过强化学习实现LLM代理的主动上下文精修

Xiaozhe Li, Tianyi Lyu, Yizhao Yang, Liang Shan, Siyi Yang, Ligao Zhang, Zhuoyi Huang, Qingwen Liu, Yang Li

机构 * Tongji University(同济大学) Stanford University(斯坦福大学) CurrentsAI Research(CurrentsAI 研究院)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出一种解耦上下文管理和任务执行的框架,通过强化学习训练轻量级策略模型ContextCurator,有效减少工作内存中的信息熵,提升LLM在长周期任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17001 2026-04-14 cs.CL cs.IR 85%

PersonalAI: A Systematic Comparison of Knowledge Graph Storage and Retrieval Approaches for Personalized LLM agents

PersonalAI:个性化大语言模型中知识图谱存储与检索方法的系统比较

Mikhail Menschikov, Dmitry Evseev, Victoria Dochkina, Ruslan Kostoev, Ilia Perepechkin, Petr Anokhin, Nikita Semenov, Evgeny Burnaev

机构 * Skoltech(斯科尔科沃科学技术学院) Public Joint Stock Company “Sberbank of Russia”(俄罗斯联邦储蓄银行) AIRI(人工智能研究所)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于知识图谱的灵活外部记忆框架,通过自动构建和更新图谱提升个性化LLM代理的长期交互能力,通过多种检索机制验证了不同配置在不同任务中的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11378 2026-04-14 cs.AI cs.SY eess.SY 83%

From Agent Loops to Structured Graphs:A Scheduler-Theoretic Framework for LLM Agent Execution

从代理循环到结构化图:一个用于LLM代理执行的调度理论框架

Hu Wei

专题命中 长上下文与记忆 :LLM(title,abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SGH框架,通过将控制流显式化为静态DAG,解决代理循环的隐式依赖、无限恢复循环和调试困难问题,同时分析可控性、表达性和可实现性之间的权衡。

Comments 51 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10161 2026-04-14 cs.SD 82%

From Speech to Profile: A Protocol-Driven LLM Agent for Psychological Profile Generation

从语音到档案:一种基于协议的LLM代理用于心理档案生成

Xingjian Yang, Yudong Yang, Zhixing Guo, Yongjie Zhou, Nan Yan, Lan Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences(中国科学院生物医学成像科学与系统重点实验室)

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出StreamProfile框架,通过增量处理咨询语音,提取证据并生成可追溯的心理档案,有效避免幻觉和长上下文遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11297 2026-04-14 cs.LG cs.AI cs.CL 80%

The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping

过去并非过去:记忆增强的动态奖励塑造

Yang Liu, Enxi Wang, Yufei Gao, Weixin Zhang, Bo Wang, Zhiyuan Zeng, Yikai Zhang, Yining Zheng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MEDS框架,通过整合历史行为信号改进奖励设计,提升大语言模型的探索多样性与性能,实验显示在多个数据集上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22361 2026-04-14 cs.CL cs.AI cs.LG 80%

MERMAID: Memory-Enhanced Retrieval and Reasoning with Multi-Agent Iterative Knowledge Grounding for Veracity Assessment

MERMAID:基于多智能体迭代知识接地的记忆增强检索与推理用于真实性评估

Yupeng Cao, Chengyang He, Yangyang Yu, Ping Wang, K. P. Subbalakshmi

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MERMAID通过整合智能体驱动搜索、结构化知识表示和持久记忆模块,提升事实核查和主张验证的效率与一致性,实现检索、推理与记忆的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11610 2026-04-14 cs.CL 79%

Self-Evolving LLM Memory Extraction Across Heterogeneous Tasks

跨异质任务的自演化大语言模型记忆提取

Yuqing Yang, Tengxiao Liu, Wang Bill Zhu, Taiwei Shi, Linxin Song, Robin Jia

机构 * University of Southern California(南加州大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出BEHEMOTH基准,通过集群-based策略CluE提升跨异质任务的记忆提取效果,实验显示CluE在异质任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02473 2026-04-14 cs.AI 79%

Diagnosing Retrieval vs. Utilization Bottlenecks in LLM Agent Memory

诊断LLM代理记忆中的检索与利用瓶颈

Boqin Yuan, Yue Su, Kun Yao

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) Carnegie Mellon University(卡内基梅隆大学) University of North Carolina(北卡罗来纳大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 本文通过3x3实验分析写入策略、检索方法和记忆利用行为对性能的影响,发现检索方法是主要瓶颈,且原始分块存储在无需LLM调用时表现优异。

Comments Accepted at the MemAgents Workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10352 2026-04-14 cs.AI cs.OS cs.SE 79%

ClawVM: Harness-Managed Virtual Memory for Stateful Tool-Using LLM Agents

ClawVM: 用于状态ful工具使用的LLM代理的抓取管理虚拟内存

Mofasshara Rafique, Laurent Bindschaedler

机构 * Independent Researcher(独立研究员) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 ClawVM通过管理状态为类型化的页面,实现状态的可靠存储与回写,解决了状态丢失和回写失败的问题,提升了LLM代理的稳定性和可审计性。

Comments 8 pages, 1 figure, 10 tables; accepted at EuroMLSys '26 (6th Workshop on Machine Learning and Systems, co-located with EuroSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21316 2026-04-14 cs.LG cs.AI cs.DC cs.ET cs.PF 79%

Deep Optimizer States: Towards Scalable Training of Transformer Models Using Interleaved Offloading

深度优化状态:通过交错卸载实现变压器模型的可扩展训练

Avinash Maurya, Jie Ye, M. Mustafa Rafique, Franck Cappello, Bogdan Nicolae

机构 * Rochester Institute of Technology(罗切斯特理工学院) Illinois Institute of Technology(伊利诺伊理工学院) Argonne National Laboratory(阿贡国家实验室)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出深度优化状态技术,通过交错卸载优化器状态到主机内存,提升GPU和CPU的利用效率,实验显示比现有方法快2.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10661 2026-04-14 cs.SE cs.AI 77%

DynamicsLLM: a Dynamic Analysis-based Tool for Generating Intelligent Execution Traces Using LLMs to Detect Android Behavioural Code Smells

DynamicsLLM:基于动态分析的工具,利用LLMs生成智能执行轨迹以检测Android行为代码异味

Houcine Abdelkader Cherief, Florent Avellaneda, Naouel Moha

机构 * École de technologie supérieure(高等技术学院) Université du Québec à Montréal(魁北克大学蒙特利尔分校)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DynamicsLLM,利用LLMs生成智能执行轨迹以检测Android行为代码异味,通过混合方法提高小活动应用的覆盖范围,并在333个应用上验证效果,显著提升代码异味检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09747 2026-04-14 cs.CR cs.AI 77%

ADAM: A Systematic Data Extraction Attack on Agent Memory via Adaptive Querying

ADAM:通过自适应查询对代理记忆进行系统性数据提取攻击

Xingyu Lyu, Jianfeng He, Ning Wang, Yidan Hu, Tao Li, Danjue Chen, Shixiong Li, Yimin Chen

机构 * University of Massachusetts Lowell, USA(马萨诸塞大学洛厄尔分校) Amazon, USA(亚马逊) University of South Florida, USA(南佛罗里达大学) Rochester Institute of Technology, USA(罗切斯特理工学院) Purdue University, USA(普渡大学) North Carolina State University, USA(北卡罗来纳州立大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ADAM攻击,通过估计受害者代理内存的数据分布和熵引导查询策略,提升隐私泄露效果,实验显示其攻击成功率高达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17934 2026-04-14 cs.CL cs.AI 73%

AtlasKV: Augmenting LLMs with Billion-Scale Knowledge Graphs in 20GB VRAM

AtlasKV:在20GB VRAM中通过十亿级知识图谱增强大语言模型

Haoyu Huang, Hong Ting Tsang, Jiaxin Bai, Xi Peng, Gong Zhang, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学) Theory Lab, Huawei(华为理论实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AtlasKV,一种通过十亿级知识图谱增强大语言模型的方法,利用子线性时间与内存复杂度实现高效知识整合,无需外部检索模块或长上下文先验。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10426 2026-04-14 cs.CL cs.AI 73%

CodaRAG: Connecting the Dots with Associativity Inspired by Complementary Learning

CodaRAG: 通过互补学习启发的关联性连接点

Cheng-Yen Li, Xuanjun Chen, Claire Lin, Wei-Yu Chen, Wenhua Nie, Hung-Yi Lee, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CodaRAG通过互补学习系统启发,提出了一种将碎片化信息整合为稳定记忆基础,通过多维路径遍历图结构,消除超关联噪声,提升检索和生成精度的框架。

Comments Preprint, Submitted to ACM TIST

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23516 2026-04-14 cs.CL cs.AI cs.IR 73%

MSA: Memory Sparse Attention for Efficient End-to-End Memory Model Scaling to 100M Tokens

MSA:内存稀疏注意力用于高效端到端内存模型扩展至100M标记

Yu Chen, Runkai Chen, Sheng Yi, Xinda Zhao, Xiaohong Li, Jianjin Zhang, Jun Sun, Chuanrui Hu, Yunyun Han, Lidong Bing, Yafeng Deng, Tianqiao Chen

机构 * Evermind Shanda Group(盛大集团) Peking University(北京大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MSA,一种高效的端到端可训练内存模型框架,通过可扩展稀疏注意力和文档级RoPE实现线性复杂度,支持从16K到100M标记的扩展,同时保持稳定性,且在100M标记推理中实现2xA800 GPU的高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05505 2026-04-14 cs.CL 70%

FlashMem: Distilling Intrinsic Latent Memory via Computation Reuse

FlashMem: 通过计算复用提炼内在潜在记忆

Yubo Hou, Zhisheng Chen, Tao Wan, Zengchang Qin

机构 * School of ASEE, Beihang University(北京航空航天大学ASEE学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) School of BME, Beijing Advanced Innovation Center for BME, Beihang University(北京航空航天大学生物医学工程学院/北京生物医学工程高精尖创新中心) CAIR and CECS, VinUniversity(VinUniversity计算与人工智能研究中心/计算机工程与计算机科学系)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FlashMem通过计算复用直接从临时推理状态提炼内在记忆,消除冗余重参数化,提升推理效率和持久认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10110 2026-04-14 cs.AI 70%

Trust Your Memory: Verifiable Control of Smart Homes through Reinforcement Learning with Multi-dimensional Rewards

相信你的记忆:通过多维奖励的强化学习实现智能家庭的可验证控制

Kai-Yuan Guo, Jiang Wang, Renjie Zhao, Tianyi Wang, Wandong Mao, Yu Gao, Mou Xiao Feng, Yi Xu

机构 * AI Research Center, Midea Group(美的集团人工智能研究中心)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MemHomeLife和MemHome基准,通过多维奖励强化学习提升智能家庭的记忆驱动设备控制能力,解决现有方法在评估和方法论上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏