arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 507 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 10 篇

2512.22170 2026-03-17 cs.LG cs.CV 57%

SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性

Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 19 篇

2603.14646 2026-03-17 cs.AI 89%

Dynamic Theory of Mind as a Temporal Memory Problem: Evidence from Large Language Models

动态心智理论作为时间记忆问题:来自大语言模型的证据

Thuy Ngoc Nguyen, Duy Nhat Phan, Cleotilde Gonzalez

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究探讨了动态心智理论作为时间延伸表征记忆问题,发现大语言模型在跟踪信念轨迹方面存在挑战,揭示了记忆与干扰机制在社会推理中的影响。

Comments 8 pages, 4 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14517 2026-03-17 cs.AI cs.LG 88%

Learning to Forget: Sleep-Inspired Memory Consolidation for Resolving Proactive Interference in Large Language Models

学习遗忘:受睡眠启发的记忆巩固用于缓解大语言模型中的前瞻性干扰

Ying Xie

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SleepGate框架,通过引入学习睡眠周期和三个机制缓解大语言模型中的前瞻性干扰,理论分析显示其将干扰范围从O(n)降至O(log n)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13289 2026-03-17 cs.LG cs.AI 86%

RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse

RelayCaching: 通过解码KV缓存重用加速LLM协作

Yingsheng Geng, Yuchong Gao, Weihong Wu, Guyue Liu, Jiang Liu

机构 * Beijing University of Posts(北京邮电大学) Tsinghua University, Beijing, China(清华大学) University of Electronic Science(电子科学大学) Peking University, Beijing, China(北京大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RelayCaching方法,通过重用前序代理的解码阶段KV缓存,在多代理LLM系统中减少冗余预填充计算,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06922 2026-03-17 cs.LG 83%

NerVE: Nonlinear Eigenspectrum Dynamics in LLM Feed-Forward Networks

NerVE:大型语言模型中前馈网络的非线性特征谱动态

Nandan Kumar Jha, Brandon Reagen

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 NerVE通过四个互补指标分析LLM中FFN的信息流动,揭示非线性特性对潜在空间利用的影响,验证了优化器几何对方差再注入的作用,适用于多种架构和优化器配置。

Comments Accepted to ICLR 2026. Project page: https://nerve-eigenspectrum.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14588 2026-03-17 cs.AI cs.IR cs.LG 81%

SuperLocalMemory V3: Information-Geometric Foundations for Zero-LLM Enterprise Agent Memory

SuperLocalMemory V3:信息几何基础用于零LLM企业代理记忆

Varun Pratap Bhardwaj

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于信息几何的零LLM企业代理记忆系统,通过信息几何度量、黎曼流形动力学和细胞sheaf模型,提升记忆检索与一致性,实验显示在LoCoMo基准上性能提升显著。

Comments 43 pages, 5 figures, 9 tables, 3 appendices. Code: https://github.com/qualixar/superlocalmemory. Zenodo DOI: 10.5281/zenodo.19038659

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13644 2026-03-17 cs.AI 77%

StatePlane: A Cognitive State Plane for Long-Horizon AI Systems Under Bounded Context

StatePlane:一种适用于受限上下文的长期智能系统认知状态平面

Sasank Annapureddy, John Mulcahy, Anjaneya Prasad Thamatani

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 StatePlane通过认知状态管理实现长期智能,无需扩展上下文窗口或重新训练模型,适用于多会话任务。

Comments 5 pages, 1 figure, 3 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13414 2026-03-17 cs.SE cs.AI 77%

Neuro-Symbolic Generation and Validation of Memory-Aware Formal Function Specifications

神经符号生成与验证内存感知的形式函数规范

Liao Zhang, Tong Chen, Xiwei Wu, Qi Liu, Xiyu Zhai, Xinqi Wang, Qinxiang Cao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) School of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程学院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出神经符号框架,通过自然语言描述和函数签名生成内存感知的形式函数规范,结合符号证明器和验证工具链迭代优化,提升形式规范的正确性与语法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15280 2026-03-17 cs.AI 70%

Advancing Multimodal Agent Reasoning with Long-Term Neuro-Symbolic Memory

通过长期神经符号记忆推进多模态代理推理

Rongjie Jiang, Jianwei Wang, Gengda Zhao, Chengyang Luo, Kai Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出NS-Mem框架,结合神经记忆与符号结构,提升多模态代理的推理能力,实验证明其在推理准确率上优于纯神经记忆系统。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14212 2026-03-17 cs.AI 70%

Memory as Asset: From Agent-centric to Human-centric Memory Management

记忆作为资产:从以代理为中心到以人类为中心的记忆管理

Yanqi Pan, Qinghao Huang, Weihao Yang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出以人类为中心的记忆管理范式,通过个人记忆存储、智能进化层和去中心化记忆交换网络,构建持续增长的知识基础架构,推动可扩展的人类中心AGI系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14050 2026-03-17 cs.NE 67%

A Theory of Appropriateness That Accounts for Norms of Rationality

一种考虑理性规范的适当性理论

Joel Z. Leibo, Alexander Sasha Vezhnevets, Manfred Diaz, John P. Agapiou, William A. Cunningham, Peter Sunehag, Logan Cross, Raphael Koster, Stanley M. Bileschi, Minsuk Chang, Iyad Rahwan, Simon Osindero, James A. Evans

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出一种以社会为基础的规范适当性理论,通过预训练的具有类大语言模型认知架构的个体生成行为,解释人类规范的上下文依赖性、任意性等特征,挑战传统理性选择理论。

Comments 39 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13412 2026-03-17 cs.CV 67%

WAT: Online Video Understanding Needs Watching Before Thinking

WAT:在线视频理解需要先观看再思考

Zifan Han, Hongbo Sun, Jinglin Xu, Canhui Tang, Yulong Lei, Xuchong Zhang, Hongbin Sun, Zhongjiang He, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology Beijing(北京科技大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13258 2026-03-17 cs.LG cs.AI cs.SE 62%

Your Code Agent Can Grow Alongside You with Structured Memory

你的代码代理可以与你一同成长,借助结构化记忆

Yi-Xuan Deng, Xiaoqin Liu, Yi Zhang, Guo-Wei Yang, Shuojin Yang

机构 * Tsinghua University(清华大学)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。

Comments Code Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15599 2026-03-17 cs.LG 57%

SmartSearch: How Ranking Beats Structure for Conversational Memory Retrieval

SmartSearch: 排序如何超越结构进行对话记忆检索

Jesper Derehag, Carlos Calva, Timmy Ghiurau

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.LG

AI总结 SmartSearch通过确定性流程从无结构对话历史中检索,利用实体发现规则和排序融合阶段,无需结构化和学习策略,在低资源下实现高召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14669 2026-03-17 cs.AI 57%

RenderMem: Rendering as Spatial Memory Retrieval

RenderMem:将渲染作为空间记忆检索

JooHyun Park, HyeongYeop Kang

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14597 2026-03-17 q-bio.NC cs.AI 57%

D-MEM: Dopamine-Gated Agentic Memory via Reward Prediction Error Routing

D-MEM:通过奖励预测误差路由的多巴胺门控代理记忆

Yuru Song, Qi Xin

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 D-MEM通过奖励预测误差路由实现多巴胺门控代理记忆,减少token消耗并提升多跳推理和对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13676 2026-03-17 cs.AI 57%

TheraAgent: Multi-Agent Framework with Self-Evolving Memory and Evidence-Calibrated Reasoning for PET Theranostics

TheraAgent:具有自我进化记忆和证据校准推理的多智能体框架用于PET治疗诊断

Zhihao Chen, Jiahui Wang, Yizhou Chen, Xiaozhong Ji, Xiaobin Hu, Jimin Hong, Wolfram Andreas Bosbach, Axel Rominger, Ali Afshar-Oromieh, Hongming Shan, Kuangyu Shi

机构 * Fudan University(复旦大学) University of Bern(伯尔尼大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 TheraAgent通过自我进化记忆和证据校准推理,解决PET治疗诊断中数据稀缺、信息异构和证据推理的问题,实现75.7%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13360 2026-03-17 cs.CV cs.LG 57%

Graph2Video: Leveraging Video Models to Model Dynamic Graph Evolution

图2视频:利用视频模型建模动态图演变

Hua Liu, Yanbin Wei, Fei Xing, Tyler Derr, Haoyu Han, Yu Zhang

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.LG

AI总结 本文提出Graph2Video框架,通过将目标链接的时序邻域视为视频帧序列,利用视频模型捕捉局部和长时动态,提升链接预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16443 2026-03-17 cs.CV 50%

VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences

VGGT-Long:分块、循环、对齐——在千米级长RGB序列上推动VGGT的极限

Kai Deng, Zexin Ti, Jiawei Xu, Jian Yang, Jin Xie

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出VGGT-Long,通过分块处理、重叠对齐和轻量循环闭合优化,解决现有模型的可扩展性瓶颈,实现千米级户外环境的单目3D重建。

Comments IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14002 2026-03-17 cs.HC cs.SD 50%

LightBeam: An Accurate and Memory-Efficient CTC Decoder for Speech Neuroprostheses

LightBeam: 一种准确且内存高效的CTC解码器用于语音神经假体

Ebrahim Feghhi, Junlin Hu, Nima Hadidi, Jonathan C. Kao

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出LightBeam,一种无需WFST的CTC解码器,仅需10GB内存即可在Brain-to-Text'24和'25基准上实现最佳性能,通过延迟融合集成LLM,无需大N-gram语言模型。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理与问题求解 94 篇

2602.20722 2026-03-17 cs.AI 89%

Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning

缓冲区很重要:在大语言模型推理中释放离策略强化学习的潜力

Xu Wan, Yansheng Wang, Wenqi Huang, Mingyang Sun

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出BAPO框架,通过动态选择训练批次和保证策略改进下限,提升大语言模型训练效率,实验显示在数学、规划和视觉推理任务中平均提升12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15375 2026-03-17 cs.SE 89%

Formalizing and validating properties in Asmeta with Large Language Models (Extended Abstract)

在Asmeta中形式化和验证属性的大型语言模型(扩展摘要)

Andrea Bombarda, Silvia Bonfanti, Angelo Gargantini, Nico Pellegrinelli

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文探讨将大型语言模型集成到Asmeta框架中,帮助用户定义、形式化、解释和验证时间属性,通过示例展示这种集成的可行性与潜在优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14676 2026-03-17 stat.ME stat.ML 89%

Scalable Text-Embedding-informed Cognitive Diagnosis of Large Language Models

可扩展的基于文本嵌入的认知诊断用于大语言模型

Jia Liu, Zhiyu Xu, Yuqi Gu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出将心理测量学中的认知诊断模型(CDM)适应于大语言模型评估,通过多维离散能力配置文件实现细粒度诊断,并利用文本嵌入信息构建先验,提高高维估计的稳定性。

Comments 34 pages of main text, 12 pages of appendix, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00410 2026-03-17 cs.LG 88%

Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models

共奖励:用于大型语言模型中激发推理的稳定自监督强化学习

Zizhuo Zhang, Jianing Zhu, Xinmu Ge, Zihua Zhao, Zhanke Zhou, Xuan Li, Xiao Feng, Jiangchao Yao, Bo Han

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出Co-rewarding框架,通过引入互补监督提升训练稳定性,通过对比一致性和模型蒸馏方法,在多个数学推理基准上实现性能提升,尤其在Llama-3.2-3B-Instruct上表现突出。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13266 2026-03-17 cs.AI 88%

Multi-hop Reasoning and Retrieval in Embedding Space: Leveraging Large Language Models with Knowledge

嵌入空间中的多跳推理与检索:利用大型语言模型与知识

Lihui Liu

机构 * Wayne State University(韦恩州立大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出EMBRAG框架,通过生成基于知识图谱的逻辑规则并在嵌入空间中推理,提升知识图谱问答任务的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16125 2026-03-17 cs.PL cs.SE 88%

LPO: Discovering Missed Peephole Optimizations with Large Language Models

LPO:利用大语言模型发现遗漏的窥视优化

Zhenyang Xu, Hongxu Xu, Yongqiang Tian, Xintong Zhou, Chengnian Sun

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LPO框架,结合大语言模型与形式验证技术,发现此前遗漏的窥视优化,实验显示其在LLVM中发现大量有效优化。

Comments Accepted at ASPLOS 2026

Journal ref Proc. 31st ACM Intl. Conf. on Architectural Support for Programming Languages and Operating Systems (ASPLOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13791 2026-03-17 cs.CL 87%

DeceptGuard :A Constitutional Oversight Framework For Detecting Deception in LLM Agents

DeceptGuard :一个宪法监督框架用于检测LLM代理中的欺骗行为

Snehasis Mukhopadhyay

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出DeceptGuard框架,通过比较三种监控机制,结合Coot-aware和激活探针监控,显著提升检测性能,并提出HYBRID-CONSTITUTIONAL集成方法,实现更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13230 2026-03-17 cs.CL 87%

Slang Context-based Inference Enhancement via Greedy Search-Guided Chain-of-Thought Prompting

基于贪心搜索的链式推理提示的俚语推理增强

Jinghan Cao, Qingyang Ren, Xiangyun Chen, Xinjin Li, Haoxiang Gao, Yu Zhao

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出一种基于贪心搜索的链式推理框架,通过改进小语言模型的推理能力,提升俚语解释的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13287 2026-03-17 cs.LG cs.AI 86%

From Stochastic Answers to Verifiable Reasoning: Interpretable Decision-Making with LLM-Generated Code

从随机答案到可验证推理:利用LLM生成代码的可解释决策

Anirudh Jaidev Mahesh, Ben Griffin, Fuat Alican, Joseph Ternasky, Zakari Salifu, Kelvin Amoaba, Yagiz Ihlamur, Aaron Ontoyin Yin, Aikins Laryea, Afriyie Samuel, Yigit Ihlamur

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Oxford(牛津大学) Vela Research(Vela研究公司) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将LLM视为代码生成器而非实例评估器,通过生成可执行决策逻辑提升决策可解释性与可重复性,在创业资本创始人筛选中实现更高精度与可验证性。

Comments 12 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15371 2026-03-17 cs.AI cs.NI 85%

Brain-Inspired Graph Multi-Agent Systems for LLM Reasoning

受脑启发的图多智能体系统用于LLM推理

Guangfu Hao, Yuming Dai, Xianzhe Qin, Shan Yu

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出受人类认知全局工作理论启发的BIGMAS系统,通过动态图结构和共享工作区提升多步推理能力,实验表明其在多个LLM上均优于现有多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏