arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-12 至 2026-08-12 共收录 361 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 15 篇

2608.10126 2026-08-12 cs.LG cs.AI cs.CL 新提交 92%

Procedural Fairness Failures in RLHF from Preference Averaging

来自偏好平均的RLHF中的程序公平性失败

M P V S Gopinadh, Karthik Kamuju, Kummari Avinash, John Joshua, Srinivasa Raju Rudraraju

机构 * Vishnu Institute of Technology(维什努理工学院)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究指出标准RLHF因偏好平均引发程序公平性失败,提出PA-RLHF分开优化不同偏好模式,提升了对齐准确率并缩小了群体公平差距,对大模型和智能体系统有重要意义。

Comments 4 pages, Accepted at the ICLR 2026 Workshop on Algorithmic Fairness Across Alignment Procedures and Agentic Systems (AFAA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10209 2026-08-12 cs.AI 新提交 90%

Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes

评估条件化训练:让模型泛化到更强的监督机制

Alec Harris, Kasey Corra, Archie Chaudhury, Yixiong Hao

机构 * AI Safety Initiative at Georgia Tech(佐治亚理工学院AI安全倡议) University of Chicago(芝加哥大学)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出ECT后训练框架,作为SFT、PPO的附加组件,通过关联反馈保真度提升不完美反馈下的模型性能,在新闻生成和算术任务中验证其可改善目标行为。

Comments 16 pages, 7 figures. Accepted at the Agent Behavior Workshop at COLM 2026. Code: https://github.com/evaluationconditionedtraining/Evaluation-Conditioned-Training

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23102 2026-08-12 cs.AI cs.CL 版本更新 89%

Multiplayer Nash Preference Optimization

多玩家纳什偏好优化

Fang Wu, Xu Huang, Weihao Xuan, Zhiwei Zhang, Yijia Xiao, Guancheng Wan, Xiaomin Li, Bing Hu, Peng Xia, Jure Leskovec, Yejin Choi

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所智能系统研究中心) Pennsylvania State University(宾夕法尼亚州立大学) University of California, Los Angeles(加州大学洛杉矶分校) Harvard University(哈佛大学) UNC–Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出多玩家纳什偏好优化框架,扩展了传统的两玩家纳什对齐方法,通过引入多玩家博弈机制,提升对复杂非传递性人类偏好的对齐能力,并在多个基准测试中表现更优。

Journal ref ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18401 2026-08-12 cs.CL 版本更新 89%

CAPO: Critic-Guided Action-Aligned Policy Optimization for Advancing LLM Agent Capabilities

StepPO: 面向智能体强化学习的步骤对齐策略优化

Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Chunli Liu, Shijin Wang, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract_cn)

AI总结 提出StepPO,一种步骤级策略优化方法,通过将智能体强化学习从token级MDP重构为步骤级MDP并引入步骤级信用分配,以解决现有算法在智能体决策粒度上的不匹配问题,在多跳问答等任务上优于多种RL算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08494 2026-08-12 cs.CV 版本更新 87%

Linguistically-Aligned and Visually-Grounded Preference Optimization for Clinically-Augmented Medical Report Generation

面向临床增强型医疗报告生成的语言对齐与视觉 grounded 的偏好优化

Qiang Hu, Yuxuan Luo, Yingjie Guo, Hao Wang, Qimei Wang, Qiang Li, Zhiwei Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 针对现有医疗报告生成方法的临床事实错误与视觉-语言对齐不足问题,提出DPO-Clin框架,通过ECD模块、M²DPO及反事实偏好数据构建提升模型可靠性,在多医学数据集上取得优异性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11152 2026-08-12 cs.DC cs.LG 新提交 86%

Scheduling Mixed RL Rollouts Beyond Prefix Locality

超越前缀局部性的混合强化学习回滚调度

Zetao Hong, Song Yuan, Yuanhao Ding, Yibo Zhu, Daxin Jiang, Zhibin Wang, Chen Tian

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对混合RL回滚调度的异构性问题,提出MISA-T策略,在多基准实验中显著提升回滚吞吐量并降低平均轮次时间,同时维持缓存命中率与工作负载混合比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10196 2026-08-12 cs.LG cs.AI 新提交 84%

ELMER: Evolutionary Language Model that Explores and Refines

ELMER:探索与优化的进化语言模型

Matthew Siper, Ahmed Khalifa, Julian Togelius

机构 * New York University(纽约大学) University of Malta(马耳他大学)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出进化语言模型 ELMER,通过微调 Qwen3-8B 并结合 oDPO 优化,实现自然语言策略搜索与编译,提升进化搜索效率,证明语言可作为可执行程序空间的可引导搜索表示。

Comments Submitted to AAAI Conference 2026, 8 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09887 2026-08-12 cs.CL 版本更新 77%

Overconfident and Blind to Details: Fixing Prompt Insensitivity with Abductive Preference Learning

过度自信且忽视细节:通过归纳偏好学习修复提示不敏感

Yijin Ni, Simon Yu, Peng Qi

机构 * Georgia Institute of Technology(佐治亚理工学院) Northeastern University(东北大学) Uniphore(Uniphore公司)

专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出归纳偏好学习方法,通过优化归纳策略提升模型对罕见提示的敏感度,显著提高在VLMBias和Inverse-IFEval基准测试中的性能。

Comments 26 pages, 15 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06128 2026-08-12 cs.AI 版本更新 70%

Contextual Information Policy Optimization for Search Agents

面向搜索智能体的上下文信息策略优化

Xingyu Guo, Wei Chen, Linlin Yang, Baochang Zhang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有搜索智能体方法存在的先验驱动推理问题,提出CIPO框架,通过回合级信用分配对齐策略与证据使用,无需额外标注或奖励模型,在7个基准上性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03888 2026-08-12 cs.SD cs.AI 版本更新 70%

IndexTTS 2.5 Technical Report

IndexTTS 2.5 技术报告

Yunpei Li, Xun Zhou, Jinchao Wang, Lu Wang, Yong Wu, Siyi Zhou, Yiquan Zhou, Yining Wang, Yaogen Yang, Zhetao Hu, Shiyao Duan, Jiacheng Xu, Jingchen Shu, Bin Xia

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 IndexTTS 2.5通过四方面改进提升了多语言支持、推理速度和合成质量,实现了更广泛的语言覆盖和情感语调复制。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10959 2026-08-12 cs.CV cs.CR 新提交 67%

Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs

一旦投毒,任意受控:视觉语言模型(VLM)中的可编程后门

Tao Lin, Gaojie Jin, Zongxin Liu, Peng Wu, Lijia Yu

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 该研究提出一种向VLM植入可编程后门的方法,通过启发式投毒策略和特征空间触发器隐写,可在推理时动态选择未见过的目标字幕并触发对应输出,攻击成功率高且能规避部分防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11205 2026-08-12 cs.CV 新提交 50%

AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

AdvFD:通过对抗性Fréchet距离损失提升视觉生成性能

Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

机构 * Peking University(北京大学) KlingAI(可灵AI)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究提出AdvFD算法,通过补充静态Fréchet损失的对抗学习表示并引入真实特征白化,解决Fréchet攻击问题,提升了JiT、pMF等骨干网络的单步生成器后训练性能。

Comments Project Page: https://gasaiyu.github.io/AdvFD-page/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长上下文与记忆 20 篇

2409.03381 2026-08-12 cs.CL cs.AI 88%

CogniDual Framework: Self-Training Large Language Models within a Dual-System Theoretical Framework for Improving Cognitive Tasks

Yongxin Deng, Xihe Qiu, Xiaoyu Tan, Chao Qu, Jing Pan, Yuan Cheng, Yinghui Xu, Wei Chu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Journal ref IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2025), pp. 1-5

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11034 2026-08-12 cs.DC cs.LG 新提交 87%

SCOUT: Symmetric Consensus Outlier Detection for Failure Localization in LLM Pre-Training

SCOUT:用于大语言模型预训练中故障定位的对称共识异常检测

Zhuang Wang

专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.LG

AI总结 SCOUT是用于LLM预训练故障定位的统一运行时框架,基于等价副本严格多数共识识别异常,可与主流大模型训练框架集成,解决现有诊断方法的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08348 2026-08-12 cs.CL 版本更新 87%

Bayesian-Agent: Posterior-Guided Skill Evolution Across LLM Agent Harnesses

Bayesian-Agent:面向LLM Agent框架的后验引导技能演化

Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Wenjie Zhang, Zhichao Shi, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Bayesian-Agent框架,将可复用技能视为假设,通过后验分布指导技能演化(如修补、拆分、压缩等),在多个基准上显著提升性能,表明Agent技能演化应视为后验引导的框架优化。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10676 2026-08-12 cs.AI 新提交 86%

Self-Correcting Long-Horizon Search Agents via Tree-Structured Memory

基于树状记忆的自修正长程搜索智能体

Aijun Yang, Qianxue Guo, Ziyi Huang, Yuxuan Chen, Shiyou Qian, Jian Cao

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ReTree树状记忆机制,解决LLM搜索智能体的上下文增长与错误推理问题,在四个基准上优于Full-Trajectory ReAct,准确率最高提升25.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10260 2026-08-12 cs.AI 新提交 85%

Interpreting Language Model Hidden States at Scale

大规模语言模型隐藏状态的解释

Jordan Pettyjohn, Mansi Sakarvadia, Nathaniel Hudson, Daniel McKenzie, Kyle Chard, Ian Foster

专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.AI

AI总结 研究人员提出OmniLens,一种可适配任意模型宽度激活的Lens方法,通过低秩翻译器和Subset-KL技术降低成本,在LLaMA-3.3-70B上构建482个Lens集成,以更低成本复现提示注入检测等案例研究的关键结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26598 2026-08-12 cs.MA cs.AI cs.CL 版本更新 82%

Living-Harness Is an Interactive-Agent Evolver

Living-Harness:一种交互式智能体演化器

Yuetian Du, Yucheng Wang, He Xu, Jiexu Xu, Shanwen Tan, Bing Zhao, Boyu Yang, Zhijie Xu, Ming Kong, Hu Wei, Jie Liu, Qiang Zhu

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出自演化智能体harness Living-Harness,基于Evolution-SOP生成两类过程性知识,在8个交互式环境中大幅提升Pass@1,支持跨模型主干复用演化后的harness状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10795 2026-08-12 cs.AI cs.NE 新提交 81%

EvoMem: Memory-Augmented Evolution for Code Optimization

EvoMem:用于代码优化的记忆增强进化算法

Viktor Volkov, Valentin Khrulkov, Andrey V. Galichin, Danil Sivtsov, Nikita Glazkov, Olga Volkova, Konstantin Pchelin, Iaroslav Bespalov, Dmitry V. Dylov, Petr Anokhin, Ivan Oseledets

机构 * AXXX Lomonosov Moscow State University(莫斯科罗蒙诺索夫国立大学) Applied AI Institute(应用人工智能研究院)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 EvoMem是用于LLM驱动的进化程序搜索的持久记忆架构,可捕获复用变异知识,在多任务基准测试中提升了目标指标或搜索速度,减少冗余探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11990 2026-08-12 cs.LG cs.AI 版本更新 81%

Time-Series Foundation Model Embeddings for Remaining Useful Life Estimation

用于剩余使用寿命估计的时间序列基础模型嵌入

Amir El-Ghoussani, Michele De Vita, Ronald Naumann, Vasileios Belagiannis

机构 * University of Erlangen-Nuremberg(埃尔朗根-纽伦堡大学) Siemens AG(西门子股份公司)

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出冻结预训练时间序列基础模型Chronos-2作为骨干,结合轻量回归头进行剩余寿命预测,在工业传感器数据上优于多种基线方法。

Comments Accepted to EUSIPCO 2026, 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13205 2026-08-12 cs.CL cs.AI cs.LG 版本更新 78%

Adaptive Filtering of the KV Cache: Diagnosing and Correcting Structural-Role Bias in LLM Inference

KV缓存的自适应过滤:诊断和纠正大语言模型推理中的结构角色偏差

Soumil Mandal

专题命中 长上下文与记忆 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型推理中KV缓存问题,通过反事实实验确定抑制KEY令牌是最佳过滤方法,采用无重新训练、基于角色的条件分配缩小与H2O方法差距,15MB线性角色探测器提供标签且推理成本可忽略。

Comments 6 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21106 2026-08-12 cs.AI 版本更新 77%

AttriMem: Attribution-Guided Process Feedback for Agent Memory Construction

AttriMem:用于智能体记忆学习的归因引导过程反馈

Qinfeng Li, Yuntai Bao, Xinyan Yu, Hongze Chen, Yanming Liu, Huifeng Zhu, Yier Jin, Jintao Chen, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究针对LLM智能体有效构建记忆难的问题,提出AttriMem框架,通过用token级对最终答案贡献的局部奖励增强全局结果奖励,以学习记忆构建策略,实验表明该框架性能优于多种基线,具有泛化性且稳定了RL优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18446 2026-08-12 cs.CL cs.LG 版本更新 73%

UT-ACA: Uncertainty-Triggered Adaptive Context Allocation for Long-Context Inference

UT-ACA:基于不确定性触发的自适应上下文分配用于长上下文推理

Lang Zhou, Shuxuan Li, Zhuohao Li, Shi Liu, Zhilin Zhao, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institude(深圳环城区域研究所) Southern University of Science and Technology(南方科技大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 UT-ACA通过动态调整上下文窗口,减少长上下文推理中的上下文使用量,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10949 2026-08-12 cs.CV cs.CL 新提交 70%

StreamFlow: Dynamic Memory Flows for Streaming Video Understanding

StreamFlow:用于流视频理解的动态内存流

Muxin Fu, Yifan Zhang, Wentao Zhang, Fangming Guo, Qian Chen, Guibin Zhang, Shuicheng Yan, Bo An

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10502 2026-08-12 cs.AI 新提交 70%

From Faulty Memories to Corrected Actions: Dependency-Guided Rollback Repair for Memory-Augmented Agents

从错误记忆到修正行动:记忆增强智能体的依赖引导回滚修复

Caili Yu, Yiqi Wang, Jiaqi Zhang, Yiqun Duan, Mingkai Zheng, Zhangkai Wu, Kaize Shi, Taotao Cai

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对记忆增强智能体的错误记忆问题,提出依赖引导回滚修复方法,在150案例受控基准和50案例改编测试中,均优于对比方法,实现了更优的记忆恢复效果与成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10402 2026-08-12 cs.LG cs.DC 新提交 70%

TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling

TideRL:通过就绪感知调度提升智能体强化学习的有效吞吐量

Yanyu Ren, Xizheng Wang, Xiao Liu, Bowen Lv, Hanchen Zhang, Shudan Zhang, Hanyu Lai, Shuai Wang, Li Chen, Dan Li, Jie Tang

机构 * Tsinghua University(清华大学) Zhongguancun Laboratory(中关村实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TideRL是一种就绪感知弹性RL系统,通过CTB、RA²P和ERS技术,在多轮智能体工作负载上大幅提升RL训练有效吞吐量,同时优化KV缓存命中率、训练时间和等待时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10021 2026-08-12 cs.CL 新提交 70%

Position Encoding in Transformers: From Absolute and Relative Methods to Rotary Position Embeddings and Long-Context Scaling

Transformer中的位置编码:从绝对与相对方法到旋转位置嵌入及长上下文扩展

Jiguo Li

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本技术综述梳理 Transformer 各类位置编码方法,推导 RoPE 原理并对比不同方法特性,研究长上下文扩展方案,明确长上下文泛化能力需多任务评估。

Comments 14 pages, a cookbook for students and junior researchers

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07440 2026-08-12 cs.AI 版本更新 70%

Blast Radius

爆炸半径

MY Pitsane, Hope Mogale

机构 * Algorithm Reconnaissance Division(算法侦察部) Mankind Research Labs(人类研究实验室) North-West University(西北大学) University of Pretoria(比勒陀利亚大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对智能体编码的令牌浪费问题,提出Blast Radius内存管理层,结合NECROPHORESIS与RDM实现可逆上下文驱逐,在7个OpenAI模型上降低令牌消耗17%-26%,提升编码可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19748 2026-08-12 cs.AI cs.MA 版本更新 70%

Memory-Augmented Reinforcement Learning Agent for CAD Generation

具有记忆增强的强化学习代理的CAD生成

Yin Xiaolong, Liu Yu, Shen Jiahang, Lu Xingyu, Ni Jingzhe, Fan Fengxiao, Sang Fan

机构 * Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种记忆增强的强化学习框架,用于生成CAD模型,通过引入强化学习进行检索和策略优化,有效避免了检索陷阱,提高了复杂CAD模型生成的成功率和几何一致性。

Comments We are withdrawing this manuscript because we have identified issues in the current analysis that require substantial revision. Until these issues are resolved, we do not consider the present version suitable for citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10296 2026-08-12 cs.CL 新提交 57%

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

基础的裂痕:看似微小的架构选择会影响长上下文扩展

Amanda Bertsch, Luca Soldaini, Matthew R. Gormley, Graham Neubig, Hannaneh Hajishirzi, Kyle Lo, Dirk Groeneveld

机构 * Ai2 Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.CL

AI总结 该研究发现,Olmo、Llama、Qwen等稠密模型系列的四个微小架构决策会复合降低长上下文性能,结合三个及以上选择可使性能降47%,经17万余GPU小时训练发布OlmPool,其部分模型长上下文性能优于Llama 3。

Comments 29 pages; accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏