arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-21 至 2026-08-21 共收录 247 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 20 篇

2608.07267 2026-08-21 cs.AI cs.CV cs.RO 版本更新 70%

WNM-3D: A World Navigation Model with 3D Scene Conditioning for Closed-Loop VLN

WNM-3D:一种用于闭环视觉语言导航的带3D场景条件的世界导航模型

Yuehao Huang, Yunzi Wu, Xiaotao Zhang, Xinhai Li, Jiankun Dong, Jiajun Lv, Chi Zhang, Chenjia Bai, Yong Liu, Xuelong Li

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 该研究提出带3D场景条件的WNM-3D模型,通过几何编码器与适配器整合场景上下文,经多阶段训练后在GN-Bench等数据集上的闭环导航性能优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19355 2026-08-21 cs.MM cs.CV 新提交 67%

GRACE: Grounded Reasoning via Adapter Composition and Evidence-Aware Calibration for Educational Visual Question Answering

GRACE:基于适配器组合与证据感知校准的教育视觉问答的接地推理

Xinjin Li, Yudi Xia, Xi Zhao, Yiliu Xu, Yining Liu, Cheng Lu, Yujian Long, Yu Ma, Jinghan Cao, Liang Fan, Yeyun Xu

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 针对教育视觉问答的问题-选项捷径问题,提出GRACE框架,利用结构化教育状态实现参数高效多模态适配,在ScienceQA上提升了多项准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20290 2026-08-21 cs.AI cs.CL 新提交 62%

Phantom Gains: Auditing Self-Improvement Against a Measured Null

幻影增益:针对可测量零假设的自我改进审计

Cheng Xu, Nan Yan, Liming Chen, M-Tahar Kechadi

机构 * University College Dublin(都柏林大学学院) Georgia Institute of Technology(佐治亚理工学院) Dalian University of Technology(大连理工大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对Qwen3-8B的LoRA自训练开展审计,发现测量伪影会反转改进结论,提出用逐问题精确检验替代自然阈值修复,还揭示外部蒸馏与自训练的不同效果及自训练的破坏作用。

Comments Code and evaluation artifacts are available at this https URL (https://github.com/chengxuphd/phantom-gains)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20054 2026-08-21 cs.AI cs.LG cs.MA 新提交 62%

What You Can't See Is What You Learn: Restricted Evidence Visibility Favors Compositional Generalization in Shared-Genome Language-Model Societies

你看不见的是你所学的:受限证据可见性有利于共享基因组语言模型社群中的组合泛化

Narcis Marincat

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究受限证据可见性对共享基因组语言模型社群的影响,发现受限可见性可显著提升组合泛化能力,虽未通过完整预注册测试,但利于形成可重用的值索引接口。

Comments 16 pages, 3 figures, 5 tables. Code and evaluation records: this https URL (https://github.com/tokenosopher/populus-evidence-partitioning); checkpoints: this https URL (https://huggingface.co/tokenosopher/populus-evidence-partitioning-checkpoints)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19490 2026-08-21 cs.RO cs.CV cs.LG 新提交 57%

Fine-Tuning VLAs with Self-Demonstrated Generative Control for Multi-Task Manipulation

通过自演示生成控制对视觉-语言动作(VLA)模型进行微调以实现多任务操作

Prachi Garg, Steve Xing, Prahit Yaugand, Saurabh Gupta, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :pretraining(abstract);分类 cs.LG

AI总结 本文针对VLA模型部署到新机器人时因硬件不匹配导致性能下降的问题,提出自监督方法生成在线交互rollout数据微调VLA模型,使模型在目标机器人上同时具备先验任务能力、指令遵循能力与高效学习新技能的能力。

Comments Project Page: this https URL (https://self-supervised-control.pages.dev/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17034 2026-08-21 cs.LG 版本更新 57%

Agents unlock new capabilities through Switching LoRA Adapters as a Tool (SLAaaT)

智能体通过切换LoRA适配器作为工具(SLAaaT)解锁新能力

Kenneth Ge

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 该研究针对后训练导致的灾难性遗忘问题,提出让智能体在轨迹中途切换专用LoRA适配器的SLAaaT方法,实验显示其可解决新问题、自主切换策略且能力损耗低,在任务能力和token使用上优于生成子智能体的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19637 2026-08-21 cs.CV 新提交 50%

TextRefine: Improving Textual Fidelity, Spatial Placement, and Glyph Rendering for Text Editing in Product Posters

TextRefine:提升产品海报文本编辑中的文本保真度、空间位置与字形渲染

Honglie Wang, Jia Sun, Zijun Li, Junlong Wu, Pengcheng Wei, Jiyuan Wang, Yongrui Heng, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao, Yan-Ming Zhang

专题命中 指令微调 :post-training(abstract)

AI总结 研究针对产品海报文本编辑中通用模型的缺陷,提出TextRefine框架与OpenTextEdit数据集,在文本保真度、位置可靠性等指标上优于基线方法,提升了产品海报文本编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19613 2026-08-21 cs.RO cs.CV 新提交 50%

What Matters for Latent Actions in Robot Learning

机器人学习中隐式动作的关键影响因素

Xizhou Bu, Qingda Hu, Lei Zhou, Lingfeng Zhang, Yingbo Tang, Zihao Liu, Xinyi Tao, Zhiqiang Ma, Qingqiu Huang, Chufeng Tang, Hongbo Wang, Jing Zhang, Jiayi Ma, Hangjun Ye, Wei Li, Xiaoshuai Hao

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Guangdong Provincial Key Laboratory of Computility Microelectronics, Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机微科学与技术学院、广东省计算微电子重点实验室) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) Suzhou Evans Intelligent Technology Co., Ltd.(苏州伊文斯智能科技有限公司) Morphi Intelligence Technology Co., Ltd.(墨飞智能科技有限公司) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Xiaomi EV(小米汽车)

专题命中 指令微调 :language model(abstract)

AI总结 本研究通过统一框架整合代表性隐式动作模型,系统探究41种设计选择,发现用隐式动作微调视觉语言模型主干可为下游机器人操纵策略学习提供更强初始化。

Comments Project page: this https URL (https://carldegio.github.io/latent_action.github.io)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 10 篇

2608.11922 2026-08-21 cs.CL cs.IR cs.LG 版本更新 90%

LODESTAR: Robust Entropy-Based Answer Selection in Retrieval-Augmented Generation for Question Answering -- Directing Frozen-LLM Entropy with a Reinforcement-Learned Prompt Polarizer under Misleading Passages

LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错

Hung-Chun Hsu, Po-Jen Ko, Che-Cheng Wu, Li-Yang Chang, Chuan-Ju Wang

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20099 2026-08-21 cs.MA cs.CL cs.LG 新提交 87%

Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design

奖励引导自回归图生成的高效多智能体通信拓扑设计

Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal Bouvry

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对多智能体系统通信拓扑设计中 token 消耗过高的问题,本文提出 RGA-Designer 方法,通过结合 RLHF 训练奖励模型微调图生成器,在保持任务准确率的同时降低了 token 消耗。

Comments Full version of extended abstract accepted at ICONIP 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19598 2026-08-21 cs.CV cs.AI cs.CL cs.MM 新提交 86%

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

PEA-DPO:用于多模态大语言模型对齐的感知增强型直接偏好优化

Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型偏好优化存在的视觉不敏感性问题,提出PEA-DPO框架,利用视觉偏好信号缓解该问题,提升多模态对齐效果并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19808 2026-08-21 cs.LG 新提交 83%

FAR-DPO: Feasibility-Aware and Robust Direct Preference Optimization for Cyclic Peptide Design

FAR-DPO:用于环肽设计的可行性感知与鲁棒直接偏好优化

Guofeng Zhang, Rong Han, Xiaoyu Wang, Zhiyun Li, Zongbo Han, Xiaohong Liu, Guangyu Wang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 FAR-DPO是一种架构无关的环肽设计框架,通过可行性感知偏好构建与难度感知分组鲁棒优化,在CPSea LNR基准测试中提升了环肽设计的可行性与结合性能。

Comments 16 pages, 6 figures, and 7 tables. Includes supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19842 2026-08-21 cs.AI 新提交 81%

SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning

SAPO:用于智能体强化学习的单回滚自回归策略优化

Dayang Liang, Lang Feng, Bo An, Yunlong Liu

机构 * Xiamen University(厦门大学) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究针对智能体强化学习现有方法的三大局限,提出SAPO框架,其共享策略与价值函数的自回归主干,结合广义优势估计器,在ALFWorld、WebShop任务上性能优于PPO和GRPO,内存与计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20011 2026-08-21 cs.AI cs.CV 新提交 79%

Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking

流偏好优化中的流形漂移:奖励黑客的根本原因

Yansen Han, Shengyi Liao, Yuanxing Zhang, Pengfei Wan, Tao Lin

机构 * Zhejiang University(浙江大学) Kuaishou Technology(快手科技) Westlake University(西湖大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文针对流偏好优化中流形漂移导致奖励黑客的问题,提出ThermoDPO及其加权变体,在玩具基准和SD3.5-M数据集上均取得优于FlowDPO等方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19982 2026-08-21 cs.CR 新提交 78%

COPA: Continual Preference Optimization for Adaptive Prompt Injection Defense

COPA:用于自适应提示注入防御的持续偏好优化

Roshan Sood, Onat Gungor, Tajana Rosing

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 该研究提出COPA框架,将提示注入防御视为终身学习问题,通过GRPO优化和边际加权经验回放实现持续防御,使攻击成功率最高降低6.3倍、平均降低4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19595 2026-08-21 cs.IR 新提交 75%

SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce

SSR-GRPO:将监督与语义标识符集成到强化学习中用于电商领域的密集检索

Guangxin Song, Xing Fang, Mingmin Jin, Jing Wang, Bokang Wang, Zhentao Song, Junjie Bai, Jianbo Zhu

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对电商嵌入检索的语义处理难题,提出SSR-GRPO模型,通过双视角相关性评估、难负样本挖掘等策略优化R-GRPO,经实验验证有效并已部署于大规模电商平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19540 2026-08-21 cs.LG cs.CV 新提交 57%

Continuous Adversarial MeanFlow Transfer

Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18607 2026-08-21 cs.CV 版本更新 50%

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

机构 * Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。

Comments 19 pages, 7 figures, 8 tables. Code: this https URL (https://github.com/ShareLab-SII/VA-Judger)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 14 篇

2608.20274 2026-08-21 cs.AI cs.CL 新提交 90%

Break It Down, Pass It On: Cross-Task Skill Transfer in LLM Agents

分解与传递:大语言模型智能体的跨任务技能迁移

Yiyang Feng, Biddut Sarker Bijoy, Niranjan Balasubramanian, Jiawei Zhou

机构 * Stony Brook University(石溪大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究探究LLM智能体跨任务技能迁移的可靠性,对比任务级与子任务级、文本与代码两种技能格式,提出结合特异性与抽象性的技能效用分数,发现子任务级文本技能迁移效果更优,可用于诊断技能记忆。

Comments 34 pages, 28 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19993 2026-08-21 cs.AI 新提交 90%

Optimal Skill Selection for LLM Agents with Provable Bicriteria Guarantees

具备可证明双准则保证的大语言模型智能体最优技能选择

Yu Chen, Ruishuo Chen, Xun Wang, Zhuoran Li, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences Tsinghua University(清华大学交叉信息研究院)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体的技能选择问题,提出了具备可证明双准则保证的BPS算法,在BigCodeBench变体上实现了更高任务成功率且标记使用更少的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20202 2026-08-21 cs.AI cs.CL cs.CY cs.DB cs.LG 新提交 89%

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use

MemTrapBench:大语言模型记忆使用中认知陷阱的基准测试

Mengru Wang, Haozhe Luo, Zhenqian Xu, Zhixiang Cui, Haoming Xu, Qu Yang, Jizhan Fang, Junfeng Fang, Ningyu Zhang

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究人员提出MemTrapBench基准测试,发现现有LLM记忆策略存在认知陷阱致性能下降,进而提出AdaptiveMem方法可缓解该问题并提升标准记忆基准性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19621 2026-08-21 cs.CL 新提交 89%

Mitigating Identity Essentialism in LLM Agents with Longitudinal Life Trajectories

通过纵向生活轨迹缓解大语言模型智能体中的本质主义身份偏差

Hexi Wang, Yujia Zhou, Bangde Du, Weihang Su, Xinyuan Cao, Qingyi Pan, Qingyao Ai, Yueyue Wu, Min Zhang, Yiqun Liu

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM智能体存在的身份本质主义偏差导致组内反应同质化的问题,提出LifeMem纵向记忆框架,在Add Health等数据集上验证其可提升与人类数据的一致性。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19564 2026-08-21 cs.CL 新提交 89%

Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM Agents

记住、验证还是询问?大语言模型智能体中记忆承诺的跨家族评估

Baichuan Li, Junyi Yao, Zihao Zheng

机构 * Southern Methodist University(南卫理公会大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);prompting(abstract);分类 cs.CL

AI总结 本研究通过MCB数据集评估LLM智能体的记忆承诺,发现模型验证事实变化更可靠,策略提示可降低错误持久率,少样本提示能提升部分任务准确率,但澄清召回率仍较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19758 2026-08-21 cs.CL 新提交 87%

FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving

FlashPrefill V2:面向长上下文大语言模型服务的块稀疏预填充注意力机制

Qihang Fan, Huaibo Huang, Zhiying Wu, Bingning Wang, Ran He

机构 * MAIS&NLPR, CASIA(中国科学院自动化研究所多模态人工智能系统与国家重点实验室) UCAS(中国科学院大学) WeChat, Tencent(腾讯微信)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FlashPrefill V2通过均值校正、适配FlashAttention-3/4的算子设计及原生支持分页KV缓存等,在128K上下文长度下为长上下文LLM服务提供了高效的块稀疏预填充注意力方案,加速比显著。

Comments FlashPrefill V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00554 2026-08-21 q-fin.TR cs.CL q-fin.CP 版本更新 86%

ContestTrade: A Multi-Agent Trading System Based on Internal Contest Mechanism

ContestTrade:一种基于内部竞争机制的多智能体交易系统

Li Zhao, Rui Sun, Zuoyou Jiang, Bo Yang, Yuxiao Bai, Mengting Chen, Jing Li, Zuo Bai

机构 * Stepfun FinStep

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对基于LLM的智能体在金融交易中决策受市场信息影响的问题,提出ContestTrade多智能体交易系统,通过“量化 - 预测 - 分配”竞争机制及两个专业团队协作,在A股回测中取得较好收益和风险调整绩效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19652 2026-08-21 cs.AI cs.CL 新提交 82%

Can Agent Memory Systems Track Evolving State?

智能体记忆系统能否追踪演化状态?

Xinyi Fan, Miri Liu, Ruozhen Yang, Siru Ouyang, Jiawei Han

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM智能体记忆系统的状态追踪能力不足问题,构建StateMemBench基准,提出StateMem方法,可显著提升当前状态准确率,且作为轻量包装器适配现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01548 2026-08-21 cs.AI cs.LG 版本更新 81%

LLM Capability Limits: Static Emergence and Dynamic Boundary Control

涌现不变性:从符号化思维到结构控制

Yi Liu

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19857 2026-08-21 cs.LG cs.CR 新提交 74%

Inadvertent Context Leakage in Language Models

语言模型中的无意上下文泄漏

Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri, Sanjam Garg, Saeed Mahloujifar

机构 * FAIR, Meta Superintelligence Labs(Meta超级智能实验室FAIR) University of California, Berkeley(加利福尼亚大学伯克利分校) Google DeepMind(谷歌DeepMind)

专题命中 长上下文与记忆 :language model(title);分类 cs.LG

AI总结 该研究发现语言模型的上下文窗口会无意泄漏敏感用户信息,提出自适应攻击方法,在8个专有模型上验证了2、4位数秘密的重建准确率,还展示了两种实际攻击方式,指出泄漏是模型能力的副产品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10828 2026-08-21 cs.AI 版本更新 70%

The First Drop of Ink: Nonlinear Impact of Distracting Information in Long-Context Reasoning

第一滴墨水:误导信息在长上下文推理中的非线性影响

Muhan Gao, Zih-Ching Chen, Kuan-Hao Huang

机构 * Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA NVIDIA AI Technology Center, NVIDIA Corporation, Santa Clara, CA, USA

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了误导信息在长上下文推理中的非线性影响,发现误导信息比例增加时,性能在初期急剧下降,后续变化较小。通过理论和实证分析,揭示了误导信息对注意力的 disproportionate 影响,并指出过滤收益主要来自减少上下文长度而非去除误导信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19920 2026-08-21 cs.CL 新提交 57%

Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

学习如何遗忘:面向长上下文稀疏注意力的微调

Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

机构 * Amazon Web Services(亚马逊网络服务) University of Amsterdam(阿姆斯特丹大学) Amazon(亚马逊) Technical University Berlin(柏林工业大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本文提出一种适配任意KV缓存策略的稀疏注意力模型微调方法,仅需中等硬件预算,性能优于精确注意力训练模型,还提供H2O稀疏注意力高效实现及开源库KeysAndValues支持。

Comments 39 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏