arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-25 至 2026-05-25 共收录 274 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 20 篇

2605.23194 2026-05-25 cs.LG cs.AI 81%

Scalable Heterogeneous Graph Foundation Models for Data-Driven Optimal Power Flow in Smart Grids

面向智能电网数据驱动最优潮流问题的可扩展异构图基础模型

Massimiliano Lupo Pasini, Yijiang Li, Kibaek Kim, Teja Kuruganti

机构 * Computational Sciences and Engineering Division, Oak Ridge National Laboratory(橡树岭国家实验室计算科学与工程部) Mathematics and Computer Science Division, Argonne National Laboratory(阿贡国家实验室数学与计算机科学部) UT-Battelle, LLC(UT-巴特勒公司)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出基于HydraGNN的可扩展异构图神经网络工作流,用于数据驱动最优潮流代理建模和基础模型开发,保留电网异质结构并支持大规模分布式训练与微调。

Comments 10 pages, 6 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23168 2026-05-25 cs.CR cs.AI cs.LG 79%

PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs

PoisonForge: 面向指令微调LLM的任务级定向投毒基准

Luze Sun, Anshuman Suri, Harsh Chaudhari, Cristina Nita-Rotaru, Alina Oprea

机构 * Department of Computer Science(计算机科学系)

专题命中 指令微调 :LLM(title_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出PoisonForge基准,通过参数化四维威胁(偏差类型、投毒模式、出现次数、目标输出长度)评估12个开源LLM在1%投毒预算下的任务级投毒攻击成功率,发现11个模型ASR超过70%且非目标任务泄露低于0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23883 2026-05-25 cs.CV cs.AI 77%

PGT: Procedurally Generated Tasks for improving visual grounding in MLLMs

PGT: 用于提升多模态大语言模型视觉定位的程序化生成任务

Rim Assouel, Amir Bar, Michal Drozdzal, Adriana Romero-Soriano

机构 * Mila - Qu\'ebec AI Institute FAIR at Meta Superintelligence Labs McGill University Canada CIFAR AI Chair

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 提出程序化生成任务(PGT)框架,通过叠加几何基元生成密集监督信号,解耦视觉定位能力与语义先验,显著提升多模态大语言模型在细粒度理解任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14642 2026-05-25 cs.CL 77%

Speak-to-Structure: Evaluating LLMs in Open-domain Natural Language-Driven Molecule Generation

Speak-to-Structure:评估大语言模型在开放域自然语言驱动的分子生成中的表现

Jiatong Li, Junxian Li, Weida Wang, Yunqing Liu, Changmeng Zheng, Yatao Bian, Dongzhan Zhou, Xiao-yong Wei, Qing Li

机构 * Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 提出Speak-to-Structure基准,通过分子编辑、优化和定制生成任务评估大语言模型在开放域自然语言驱动分子生成中的创造性能力,并引入OpenMolIns指令微调数据集使Llama3.1-8B超越GPT-4o等模型。

Comments Accepted by KDD 2026. Our codes and datasets are fully accessible through the https://github.com/phenixace/S2-TOMG-Bench and https://huggingface.co/datasets/phenixace/S2-TOMG-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17261 2026-05-25 cs.LG 74%

AGZO: Activation-Guided Zeroth-Order Optimization for LLM Fine-Tuning

AGZO:用于大语言模型微调的激活引导零阶优化

Wei Lin, Yining Jiang, Qingyu Song, Qiao Xiang, Hong Xu

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong(香港中文大学计算机科学与工程系) Xiamen University, China(厦门大学)

专题命中 指令微调 :LLM(title);分类 cs.LG

AI总结 提出激活引导零阶优化方法AGZO,利用前向传播中的激活结构限制扰动到低秩子空间,在保持低内存的同时提升更新方向与真实梯度的余弦相似度,缩小与一阶微调的性能差距。

Comments 21 pages in total, including 9 pages of main text, with 4 figures and 3 tables Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23147 2026-05-25 cs.CL cs.AI 73%

As X, Do Y: How Persona and Task Combine in Instruction-Tuned LLMs

作为X,做Y:角色和任务如何在指令微调LLM中结合

Eric Xu

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :LLM(title_cn);分类 cs.CL、cs.AI

AI总结 本文研究指令微调LLM中角色提示的加性分解结构,发现角色和任务在残差流中通过部分正交方向贡献,但该结构不意味着提示可压缩,因为角色条件化行为依赖于分布式提示/KV机制。

Comments 12 pages, 1 figure. Code: https://github.com/xuy/localized-additive-composition

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21692 2026-05-25 cs.AI 70%

TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning

TCAP: 面向MLLM微调中无监督后门检测的三组件注意力分析

Mingzu Liu, Hao Fang, Runmin Cong

机构 * School of Control Science and Engineering, Shandong University, Jinan, China(控制科学与工程学院,山东大学,济南,中国) Key Laboratory of Industrial Intelligent Systems, Shandong Province, China(山东省工业智能系统重点实验室,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对微调即服务中的后门攻击,提出基于三组件注意力分布差异的无监督防御框架TCAP,通过高斯混合模型和EM投票聚合检测中毒样本。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23859 2026-05-25 eess.AS 67%

Natural Yet Challenging to Detect: Robust In-the-Wild TTS through EMA and Dual-Scoring Prompt Selection -- Submission for WildSpoof 2026 TTS Track

自然但难以检测:通过EMA和双评分提示选择实现鲁棒的野外TTS——WildSpoof 2026 TTS赛道提交

Renhe Sun, Jiayi Zhou, Haolin He, Yueying Feng, Jian Liu

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出F5-TTS-DPS模型,通过集成指数移动平均(EMA)和利用大语言模型进行双评分提示选择,在野外数据上生成自然且难以检测的语音,在WildSpoof挑战中取得最佳反欺骗性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28767 2026-05-25 cs.CV 67%

Gen-Searcher: Reinforcing Agentic Search for Image Generation

Gen-Searcher: 强化搜索代理用于图像生成

Kaituo Feng, Manyuan Zhang, Shuang Chen, Yunlong Lin, Kaixuan Fan, Yilei Jiang, Hongyu Li, Dian Zheng, Chenyang Wang, Xiangyu Yue

机构 * MMLab, CUHK(CUHK的MMLab) UCLA(加州大学洛杉矶分校) UC Berkeley(加州大学伯克利分校) Meituan Home(美团家庭)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 提出Gen-Searcher,首个通过多跳推理和搜索收集文本知识与参考图像的搜索增强图像生成代理,结合SFT和强化学习训练,显著提升生成质量。

Comments Project page: https://gen-searcher.vercel.app Code: https://github.com/tulerfeng/Gen-Searcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14634 2026-05-25 cs.SE 67%

Documentation-Guided Agentic Codebase Migration from C to Rust

文档引导的从 C 到 Rust 的智能代码库迁移

Minh Le-Anh, Anh Nguyen Hoang, Bach Le, Nghi D. Q. Bui

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 提出 RustPrint 框架,通过文档引导的智能体协调,实现仓库级别的 C 到 Rust 迁移,在编译性、特征保留和测试通过率上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23171 2026-05-25 cs.LG cs.AI stat.ML 66%

Understanding and Improving Noisy Embedding Techniques in Instruction Finetuning

理解与改进指令微调中的噪声嵌入技术

Abhay Yadav

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 指令微调 :language model(abstract,journal_ref);分类 cs.AI、cs.LG

AI总结 本文通过理论和实证分析澄清了均匀噪声与高斯噪声在嵌入微调中的性能差异,并提出一种使用对称噪声的新方法SymNoise,在LLaMA-2-7B模型上显著提升了AlpacaEval得分,优于现有方法NEFTune。

Comments arXiv admin note: substantial text overlap with arXiv:2312.01523

Journal ref IEEE International Conference on Language Modeling (COLM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02087 2026-05-25 cs.AI 57%

Model Spec Midtraining: Improving How Alignment Training Generalizes

模型规范中期训练:改进对齐训练的泛化能力

Chloe Li, Nevan Wichers, Sara Price, Samuel Marks, Jon Kutasov

机构 * Anthropic

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出模型规范中期训练(MSM),通过在预训练后、对齐微调前用合成文档训练模型学习规范内容,从而引导模型从后续演示数据中泛化,有效降低代理失调率并提升对齐泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05997 2026-05-25 cs.CV 50%

4DThinker: Thinking with 4D Imagery for Dynamic Spatial Understanding

4DThinker: 用4D图像进行动态空间理解的思考

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li, Xin Xie, ZiDong Wang, Mingze Sun, Shuang Chen, Hongyu Li, Xiaobin Hu, Ruqi Huang

机构 * Tsinghua University, SIGS(清华大学 SIGS) Meituan(美团) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) LMMs-Lab(LMMs实验室) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :language model(abstract)

AI总结 提出4DThinker框架,通过动态潜在心理图像(在连续隐藏空间中模拟场景演化)增强视觉语言模型的动态空间推理能力,并引入无标注数据生成、动态图像微调及4D强化学习,在多个基准上超越强基线。

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 11 篇

2603.06610 2026-05-25 cs.LG 92%

CapTrack: Multifaceted Evaluation of Forgetting in LLM Post-Training

CapTrack: 大语言模型后训练中遗忘的多方面评估

Lukas Thede, Stefan Winzeck, Zeynep Akata, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森路透基础研究) Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Munich Center for Machine Learning (MCML), Technical University Munich(慕尼黑机器学习中心(MCML),慕尼黑技术大学) Imperial College London(伦敦帝国理工学院)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出CapTrack框架,通过行为分类和评估套件系统分析LLM后训练中的遗忘现象,发现遗忘不仅限于参数知识,还涉及鲁棒性和默认行为的显著漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23825 2026-05-25 cs.LG cs.AI 91%

It's the humans, not the data: Geopolitical bias in LLMs originates in post-training, amplified by the language of the prompt

是人类,而非数据:LLM中的地缘政治偏见源于后训练,并通过提示语言放大

Stuart Bladon, Brinnae Bent

机构 * Alibaba(阿里巴巴) seven AI labs(七家人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title_cn,abstract);post-training(title,abstract);language model(abstract);prompting(abstract)

AI总结 研究发现大语言模型的地缘政治偏见主要源于后训练阶段而非预训练,且偏见方向与模型开发者所在国一致,提示语言会放大该偏见。

Comments 12 pages, 6 figures, 2 tables, 3 appendices. Code and scenario bank: https://github.com/recozers/LLM-Bias

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23463 2026-05-25 eess.AS 89%

StepAudio 2.5 Technical Report

StepAudio 2.5 技术报告

Bin Lin, Bo Zhao, Boyong Wu, Chao Yan, Chen Wu, Cheng Yi, Chengyuan Yao, Daijiao Liu, Fei Tian, Feng Tian, Haiyang Sun, Haoyang Zhang, Jiangjie Zhen, Jinglan Gong, Jun Chen, Li Xie, Peilin Li, Peng Yang, Pengfei Tan, Qingjian Lin, Runze Li, Shenghua Hu, Siyi Zhou, Wenwen Qu, Xiangyu Li, Xiangyu Tony Zhang, Xuerui Yang, Yang Yang, Yechang Huang, Yu Fu, Yuchu Luo, Yuxin Li, Yuxin Zhang, Zhengyan Sheng, Brian Li, Chang Zeng, Changlin Zhang, Chen Geng, Chenghao Dong, Chengli Feng, Dan Zhou, Danni Wan, Di Chen, Die Zhang, Dongqing Pang, Guanglong Yang, Guoqiang Hu, Huangxi Zhu, Jianzheng Gao, Jinghua Liang, Jinmei Wan, Junjie Yuan, Kang An, Lei Lei, Limin Zhong, Lun Cai, Mengqiang Ren, Min Xu, Mingliang Li, Mingxiao Li, Na Wang, Qiang Tong, Qiaoling Huang, Qingfu Du, Rui Wang, Shengchen Zhou, Shi Qiu, Shihao Peng, Shiliang Yang, Siqi Tu, Tianjiao Deng, Ting Xu, Tong Wang, WeiMing Niu, Wuxun Xie, Xianwei Zhang, Xianyu Feng, Xiaojia Liu, Xing Chen, Xiongbin Wu, Yan Wu, Yang Li, Yi Liu, Yifan Zhang, Yile Liu, Yongshen Long, Yu Luo, Yuanhao Ding, Yuhao Wang, Yuhe Yin, Yunfang Xu, Yuxiang Yang, Zhiguo Huang, Zhiyue Wu, Zichao Li, Zichao Zhou, Daxin Jiang, Future Li, Gang Yu, Xiangyu Zhang, Yibo Zhu

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出统一音频语言基础模型StepAudio 2.5,通过任务定制的RLHF后训练和专用解码策略,在ASR、TTS和实时口语交互三项任务上达到或超越专用系统水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23398 2026-05-25 cs.IR 85%

TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization

TPMM-DPO:轨迹感知偏好引导的模型合并用于迭代直接偏好优化

Lingling Fu, Yongfu Xu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对迭代DPO中噪声累积导致的过优化和性能退化问题,提出TPMM-DPO方法,通过将迭代策略模型序列视为优化轨迹并自适应融合,构建更平滑鲁棒的参考模型,从而提升训练稳定性和生成质量。

Comments 11 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23244 2026-05-25 cs.LG 84%

Convex Optimization for Alignment and Preference Learning on a Single GPU

单GPU上的对齐与偏好学习的凸优化

Miria Feng, Mert Pilanci

机构 * Department of Electrical Engineering, Stanford University, California, United States(斯坦福大学电气工程系,加州,美国)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出COALA算法,利用凸优化重表述消除参考模型,在单GPU上高效训练,性能与DPO相当但计算量仅为其17.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23652 2026-05-25 cs.AI 81%

One Policy, Infinite NPCs: Persona-Traceable Shared RL Policies for Scalable Game Agents

一个策略,无限NPC:用于可扩展游戏智能体的可追溯共享RL策略

Yoosung Hong

机构 * Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一种基于冻结LLM嵌入的条件共享强化学习策略pcsp,实现大规模NPC的个性化控制,在300人生活模拟基准上零样本身份识别提升17倍,推理速度比LLM策略快22倍。

Comments 18 pages, 15 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23522 2026-05-25 cs.LG cs.AI cs.CV 76%

Precise: SDE-Consistent Stochastic Sampling for RL Post-Training of Flow-Matching Models

Precise: 用于流匹配模型强化学习后训练的SDE一致随机采样

Jade Zou, Tao Huang, Weijie Kong, Junzhe Li, Yue Wu, Qi Tian, Jiangfeng Xiong, Jianwei Zhang, Liefeng Bo, Zhao Zhong

机构 * Peking University(北京大学) Tencent Hunyuan(腾讯文言)

专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG

AI总结 针对流匹配模型强化学习后训练中的随机采样问题,提出Precise采样器,通过平衡探索与稳定性的SDE调度和冻结干净潜变量后验均值的近似方法,实现SDE一致性,显著提升奖励优化速度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11146 2026-05-25 cs.CV cs.AI 70%

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

超越基于VLM的奖励:扩散原生潜在奖励建模

Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

机构 * The Hong Kong University of Science Huawei Hong Kong AI Framework \& Data Technologies Lab Tsinghua University The Australian National University

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 提出扩散原生潜在奖励模型DiNa-LRM,直接在噪声扩散状态上进行偏好学习,通过噪声校准Thurstone似然和推理时噪声集成,实现高效且鲁棒的奖励建模。

Comments Accepted by ICML 2026. Code: https://github.com/HKUST-C4G/diffusion-rm

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12455 2026-05-25 cs.CV 67%

Mitigating Object Hallucinations via Sentence-Level Early Intervention

通过句子级早期干预缓解对象幻觉

Shangpin Peng, Senqiao Yang, Li Jiang, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 提出SENTINEL框架,通过句子级早期干预和领域内偏好学习,无需人工标注即可显著减少多模态大语言模型的对象幻觉,并在幻觉和通用能力基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05202 2026-05-25 cs.CV 50%

GT-SVJ: Generative-Transformer-Based Self-Supervised Video Judge For Efficient Video Reward Modeling

GT-SVJ: 基于生成式Transformer的自监督视频评判器用于高效视频奖励建模

Shivanshu Shekhar, Uttaran Bhattacharya, Raghavendra Addanki, Mehrab Tanjim, Somdeb Sarkhel, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Inc.(Adobe公司)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 提出GT-SVJ,通过将视频生成模型重新用作能量模型,并利用对比目标训练,实现高效、时间感知的视频质量评估,在少量标注下达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13056 2026-05-25 eess.SY cs.SY 50%

Simultaneous Online System Identification and Control using Composite Adaptive Lyapunov-Based Deep Neural Networks

基于复合自适应李雅普诺夫深度神经网络的在线系统辨识与同步控制

Omkar Sudhir Patil, Emily J. Griffis, Wanjiku A. Makumi, Warren E. Dixon

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 针对非线性系统,提出一种基于李雅普诺夫稳定性分析的深度神经网络在线自适应更新方法,同时实现系统辨识与轨迹跟踪,并保证跟踪误差、状态导数估计误差和网络权重估计误差一致最终有界。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 14 篇

2508.10016 2026-05-25 cs.CL 92%

Training-Free Multimodal Large Language Model Orchestration

免训练的多模态大语言模型编排

Tianyu Xie, Yuexiao Ma, Yuhang Wu, Wang Chen, Jiayi Ji, Tat-Seng Chua, Xiawu Zheng, Rongrong Ji

机构 * Media Analytics and Computing Lab, Xiamen University, Xiamen, China(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University, Xiamen, China(厦门大学人工智能研究院) School of Informatics, Xiamen University, Xiamen, China(厦门大学信息学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出一种免训练编排框架LLM Orchestration,通过LLM控制器、文本中心跨模态记忆和统一交互层集成现成模态专家,实现低开销、可扩展的多模态输入输出系统。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19310 2026-05-25 cs.LG cs.AI 92%

MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels

MemReward: 基于图的经验记忆用于有限标签下的LLM奖励预测

Tianyang Luo, Tao Feng, Zhigang Hua, Yan Xie, Shuang Yang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MemReward框架,利用图神经网络在少量标签下将奖励从标注样本传播到未标注样本,实现混合奖励获取策略,在数学、问答和代码生成任务上接近Oracle性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11243 2026-05-25 cs.LG cs.CL 90%

Evaluating Memory Structure in LLM Agents

评估LLM智能体中的记忆结构

Alina Shutova, Alexandra Olenina, Ivan Vinogradov, Anton Sinitsin

机构 * HSE University(莫斯科国立高等经济学院) Yandex YSDA New Economic School(新经济学院)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出StructMemEval基准测试,通过结构化记忆任务(如交易账本、待办事项列表、树结构等)评估LLM智能体组织长期记忆的能力,发现简单检索增强LLM难以胜任,而记忆智能体在提示下可解决,但现代LLM在无提示时无法自主识别记忆结构。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21270 2026-05-25 cs.CL cs.AI cs.CV 82%

Sparser Block-Sparse Attention via Token Permutation

通过令牌置换实现更稀疏的块稀疏注意力

Xinghao Wang, Pengyu Wang, Dong Zhang, Chenkun Tan, Shaojun Zhou, Zhaoxiang Liu, Shiguo Lian, Fangxu Liu, Kai Song, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种基于令牌置换的块稀疏注意力方法(PBS-Attn),通过利用注意力的置换性质增加块级稀疏性,在长上下文预填充中实现高达2.75倍的端到端加速,同时保持模型精度接近全注意力基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23723 2026-05-25 cs.AI 81%

MemAudit: Post-hoc Auditing of Poisoned Agent Memory via Causal Attribution and Structural Anomaly Detection

MemAudit:通过因果归因和结构异常检测对中毒代理记忆进行事后审计

Zhewen Tan, Yilun Yao, Huiyan Jin, Wenhan Yu, Guoan Wang, Mengyuan Fan, liang lu, Feng Liu, Xiangzheng Zhang, Duohe Ma, Tong Yang, Lin Sun

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Qiyuan Tech(齐元科技) Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MemAudit框架,结合反事实记忆影响评分和记忆一致性图,对记忆增强型LLM代理中的恶意注入记忆进行事后因果审计,显著降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23170 2026-05-25 cs.CL cs.AI cs.LG 80%

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

长上下文LLM中的位置失败:推理基准测试中的盲点

Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Central South University of Forestry and Technology(中央林业科技大学)

专题命中 长上下文与记忆 :LLM(title_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 通过提出上下文旋转评估(CRE)框架,系统控制任务位置、填充内容和上下文长度,揭示了长上下文推理基准测试中因任务位置变化导致的模型性能显著下降,并发现填充-答案干扰是主要错误模式。

Comments 20 pages, 1 figure, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏