arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-15 至 2026-06-15 共收录 81 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 4 篇

2601.22108 2026-06-15 cs.LG cs.AI 版本更新 89%

Learning What to Predict: Downstream-Guided Task Design for Continued Pretraining

学习预测什么:下游引导的持续预训练任务设计

Shuqi Ke, Giulia Fanti

机构 * Department of ECE(电子工程系) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,summary_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出V-pretraining方法,通过轻量级任务设计器为无标签批次构建目标或视图,利用下游损失的一阶减少作为反馈,指导自监督更新,提升目标能力而不损害泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20086 2026-06-15 cs.CL 版本更新 86%

OLaPh: Optimal Language Phonemizer

OLaPh: 最优语言音素化器

Johannes Wirth

机构 * Institute for Information Systems at Hof University of Applied Sciences(霍夫应用科学大学信息学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出OLaPh混合框架,结合多语言词典、NLP技术和统计子词分割,在WikiPron基准上显著优于基线,并通过LLM合成语料探索神经泛化能力。

Comments 12 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26759 2026-06-15 cs.LG 版本更新 79%

Time Series Causal Discovery via Context-Conditioned and Causality-Augmented Pretraining

基于上下文条件与因果增强预训练的时间序列因果发现

Biao Ouyang, Tengxue Zhang, Zhihao Zhuang, Yang Shu, Chenjuan Guo, Bin Yang

机构 * East China Normal University(东华师范大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出PTCD框架,通过上下文条件建模和可迁移因果增强的预训练范式,提升跨任务时间序列因果发现的泛化能力,在多个真实OOD数据集上因果发现和根因识别表现优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05213 2026-06-15 eess.AS 版本更新 50%

BabAR: from phoneme recognition to developmental measures of young children's speech production

BabAR:从音素识别到幼儿语音产出的发展性测量

Marvin Lavechin, Elika Bergelson, Roger Levy

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出跨语言音素识别系统BabAR,利用多语种儿童语音语料库TinyVox训练,通过预训练和上下文微调提升性能,自动测量与发育评估一致。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 7 篇

2601.05106 2026-06-15 cs.AI cs.CL cs.LG 版本更新 90%

Token-Level LLM Collaboration via FusionRoute

通过融合路由实现令牌级LLM协作

Nuoya Xiong, Yuhang Zhou, Hanqing Zeng, Zhaorun Chen, Furong Huang, Shuchao Bi, Lizhu Zhang, Zhuokai Zhao

机构 * [cs.AI](计算机科学与人工智能)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FusionRoute框架,通过轻量级路由器在解码步骤中选择最合适的专家并补充对数几率以优化下一个令牌分布,解决了单个通用模型在多个领域表现不佳的问题,同时在多个基准测试中优于其他方法。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02995 2026-06-15 cs.CR cs.AI cs.IR cs.LG 版本更新 88%

Patcher: Post-Hoc Patching of Backdoored Large Language Models

Patcher: 后门大型语言模型的事后修补

Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(北得克萨斯大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Patcher框架,仅利用单个失败案例和模型参数,通过基于梯度的显著性定位后门触发器,并采用约束微调消除触发-响应关联,同时保持模型效用。

Comments To appear in the USENIX Security Symposium, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09737 2026-06-15 cs.LG cs.AI 版本更新 87%

STaR-DRO: Stateful Tsallis Reweighting for Group-Robust Structured Prediction

STaR-DRO: 面向群体鲁棒结构化预测的状态化Tsallis重加权

Samah Fodeh, Ganesh Puthiaraju, Elyas Irankhah, Afshan Khan, Sreeraj Ramachandran, Linhai Ma, Srivani Talakokkul, Sarah Schellhorn

机构 * Yale University(耶鲁大学) Yale School of Medicine(耶鲁医学院)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出STaR-DRO框架,结合Tsallis镜像上升和稀疏entmax映射,仅对持续困难群体上权重,在结构化预测中提升标签准确性和鲁棒性,在EPPC Miner任务上相比SFT和标准DRO分别提升F1分数1.08和2.20。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04976 2026-06-15 cs.CV cs.AI 版本更新 86%

3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding

3D-RFT:基于视频的3D场景理解的强化微调

Xiongkun Linghu, Jiangyong Huang, Baoxiong Jia, Siyuan Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出3D-RFT框架,将可验证奖励的强化学习(RLVR)扩展到视频3D感知与推理,通过直接优化评估指标(如3D IoU和F1分数)提升性能,4B模型超越8B模型。

Comments Accepted at ICML 2026. Project page: https://3d-rft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06196 2026-06-15 cs.CL cs.HC 版本更新 86%

EiCAP: Beyond Fluency, Probing and Improving Emotional Intelligence in LLMs via Psychologically Grounded Multi-Turn Dialogue

EiCAP:超越流畅性,通过心理学基础的多轮对话探究和提升大语言模型的情感智能

Nizi Nazar, Pardis Sadat Zahraei, Dilek Hakkani-Tür, Natasa Milic-Frayling, Ehsaneddin Asgari

机构 * Qatar Computing Research Institute (QCRI), Hamad Bin Khalifa University(卡塔尔计算研究所(QCRI),哈马德·本·卡伊夫大学) University of Illinois Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于心理学六层情感智能分类法的EiCAP框架,包含评估基准EiCAP-Bench和微调语料EiCAP-SFT,发现通用对话微调不提升情感智能,而基于情感智能的LoRA微调显著提升模型在所有24个子类别上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03120 2026-06-15 cs.LG cs.AI 版本更新 82%

Quantized Evolution Strategies: High-precision Fine-tuning of Quantized LLMs at Low-precision Cost

量化进化策略:以低精度代价实现量化大语言模型的高精度微调

Yinggan Xu, Kajetan Schweighofer, Risto Miikkulainen, Xin Qiu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Cognizant AI Lab(Cognizant AI实验室) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出量化进化策略(QES),通过集成累积误差反馈和无状态种子重放,直接在量化空间进行全参数微调,无需反向传播,显著优于现有零阶微调方法。

Comments Added more tasks and baselines

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23638 2026-06-15 cs.LG cs.AI 版本更新 73%

FedRot-LoRA: Mitigating Rotational Misalignment in Federated LoRA

FedRot-LoRA: 缓解联邦LoRA中的旋转偏移

Haoran Zhang, Dongjun Kim, Seohyeon Cha, Haris Vikalo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FedRot-LoRA框架,通过正交变换对齐客户端更新以减少子空间不匹配,提升联邦LoRA在异质数据下的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 3 篇

2602.04879 2026-06-15 cs.LG cs.AI cs.CL 版本更新 92%

Rethinking the Trust Region in LLM Reinforcement Learning

重新思考LLM强化学习中的信任区域

Penghui Qi, Xiangxin Zhou, Zichen Liu, Tianyu Pang, Chao Du, Min Lin, Wee Sun Lee

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对PPO在LLM微调中因词表大导致的训练不稳定问题,提出基于策略散度直接约束的DPPO算法,并引入高效近似方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23847 2026-06-15 q-fin.GN cs.LG q-fin.TR 版本更新 91%

Detecting Lookahead Bias in LLM Forecasts

检测LLM预测中的前瞻偏差

Zhenyu Gao, Wenxi Jiang, Yutong Yan

机构 * Department of Finance, CUHK Business School(CUHK商学院金融系)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出统计程序检测大语言模型经济预测中的前瞻偏差,通过日期回忆查询估计前瞻倾向(LAP),并验证LAP与预测交互项在精度回归中的显著性,应用于新闻标题和财报电话会议预测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14169 2026-06-15 cs.LG cs.AI cs.CL 版本更新 88%

Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling

基于枢轴驱动重采样的LLM强化学习深度密集探索

Yiran Guo, Zhongjian Qiao, Yingqi Xie, Jie Liu, Dan Ye, Ruiqing Zhang, Shuang Qiu, Lijie Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) City University of Hong Kong(香港城市大学) Baidu(百度)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型强化学习中探索效率低的问题,提出深度密集探索(DDE)策略,通过识别失败轨迹中的可恢复枢轴状态并局部密集重采样,结合双流优化目标,在数学推理基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 3 篇

2603.23530 2026-06-15 cs.CL cs.AI cs.LG 版本更新 91%

Did You Forget What I Asked? Prospective Memory Failures in Large Language Models

你忘记我问什么了吗?大型语言模型中的前瞻记忆失败

Avni Mittal

机构 * University of Washington(华盛顿大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过认知心理学中的前瞻记忆视角,发现大型语言模型在执行复杂任务时,格式化指令的遵从率下降2-21%,并提出了显著性增强格式来恢复遵从性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29640 2026-06-15 cs.AI 版本更新 87%

VikingMem: A Memory Base Management System for Stateful LLM-based Applications

VikingMem:面向有状态LLM应用的记忆库管理系统

Jiajie Fu, Junwen Chen, Mengzhao Wang, Aoxiang He, Maojia Sheng, Xiangyu Ke, Yifan Zhu, Yunjun Gao

机构 * Zhejiang University(浙江大学)

专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出记忆库(Memory Base)数据管理范式,并基于VikingDB向量引擎实现VikingMem系统,通过事件与实体抽象、主题时间线压缩和时间加权召回,在长期记忆基准上提升检索效果达30%。

Comments Accepted by VLDB26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21335 2026-06-15 cs.LG cs.CL 版本更新 85%

Sub-Token Routing for KV Cache Compression

子令牌路由用于KV缓存压缩

Wei Jiang, Wei Wang

机构 * Futurewei Technologies(未来智科)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出子令牌路由方法,在保留令牌内对值向量分组并选择性保留,与令牌级压缩互补,在LLM和VLM中提升压缩性能。

Comments 17 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 16 篇

2603.05167 2026-06-15 cs.CL cs.AI 版本更新 92%

C2-Faith: Benchmarking LLM Judges for Causal and Coverage Faithfulness in Chain-of-Thought Reasoning

C2-Faith: 为思维链推理中的因果和覆盖忠实性基准测试LLM评判者

Avni Mittal, Rauno Arike

机构 * SPARAI

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出C2-Faith基准,通过因果和覆盖两个维度评估LLM评判者对思维链推理过程忠实性的判断能力,发现模型在错误定位和覆盖评分上存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03108 2026-06-15 cs.AI 版本更新 90%

EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

EvoTrainer: 协同进化LLM策略与训练框架以实现自主智能体强化学习

Guhong Chen, Yingcheng Shi, Yongbin Li, Binhua Li, Xander Xu, Hu Wei, Shiwen Ni, Min Yang, Jieping Ye

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团) Alibaba Group(阿里巴巴集团) SUAT(深圳大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出EvoTrainer框架,通过协同进化LLM策略和训练端框架,基于经验反馈自动诊断、修正并积累可复用技能,在数学推理、编程竞赛和仓库级软件工程任务上匹配或超越人工设计的RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26760 2026-06-15 cs.IR 版本更新 89%

Factorized Latent Reasoning for LLM-based Recommendation

基于分解潜在推理的LLM推荐方法

Tianqi Gao, Chengkai Huang, Zihan Wang, Cao Liu, Ke Zeng, Lina Yao

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对现有潜在推理方法用单向量表示用户意图难以捕捉多面偏好的问题,提出分解潜在推理框架,通过多因子注意力模块解耦偏好因子,结合正则化与强化学习提升推荐性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19945 2026-06-15 cs.CR 版本更新 89%

Multi-LLM Energy Reasoning for Binary-Free Zero-Day IoT Detection

多LLM能量推理用于无二进制零日物联网检测

Saeid Jamshidi, Foutse Khomh, Kawser Wazed Nafi, Omar Abdul-Wahab, Martine Bellaïche

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 提出一种无需二进制文件、架构无关的方法,通过三LLM推理架构和能量感知符号负载模型,利用高层描述符估计零日漏洞可能性,模拟评估显示高风险条件下预测概率提升20-35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17892 2026-06-15 cs.LG cs.AI 版本更新 88%

LEPO: Latent Reasoning Policy Optimization for Large Language Models

LEPO:面向大语言模型的潜在推理策略优化

Yuyan Zhou, Jiarui Yu, Hande Dong, Zhezheng Hao, Hong Wang, Jianqing Zhang, Qiang Lin

机构 * Tencent(腾讯) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 LEPO通过引入Gumbel-Softmax在大语言模型中实现可控的随机性,提升其探索能力与强化学习兼容性,通过直接在连续潜在表示上应用强化学习,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18419 2026-06-15 cs.LG cs.CL stat.ML 版本更新 86%

Knowing When to Quit: A Principled Framework for Dynamic Abstention in LLM Reasoning

知道何时退出:LLM推理中动态弃权的原则性框架

Hen Davidov, Nachshon Cohen, Oren Kalinsky, Yaron Fairstein, Guy Kushilevitz, Ram Yazdi, Patrick Rebeschini

机构 * Hebrew University of Jerusalem(特拉维夫大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出一个基于正则化强化学习框架的动态弃权原则,通过价值函数与弃权奖励的比较来决定是否提前终止推理,在数学推理和毒性避免任务上优于现有方法。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07368 2026-06-15 cs.LG cs.AI 版本更新 86%

Distributional Biases in Post-Training: A Markovian Analysis of Reasoning Trajectories

后训练中的分布偏差:推理轨迹的马尔可夫分析

Dake Bu, Wei Huang, Andi Han, Atsushi Nitanda, Bo Xue, Qingfu Zhang, Hau-San Wong, Taiji Suzuki

机构 * City University of Hong Kong(香港城市大学) Center for Advanced Intelligence Project, RIKEN(RIKEN高级智能研究中心) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR)(A*STAR的CFAR和IHPC) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :post-training(title,abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 通过马尔可夫链模型分析后训练策略(如RLVR和ORM/PRM)如何强化高概率路径而遗忘稀有但关键的推理步骤,并证明探索策略(如拒绝简单实例和KL正则化)有助于保留稀有CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05150 2026-06-15 cs.CL cs.AI 版本更新 86%

Chronological Thinking in Full-Duplex Spoken Dialogue Language Models

全双工口语对话语言模型中的时间顺序思考

Donghang Wu, Haoyang Zhang, Chen Chen, Tianyu Zhang, Fei Tian, Xuerui Yang, Gang Yu, Hexin Liu, Nana Hou, Yuchen Hu, Eng Siong Chng

机构 * Nanyang Technological University(南洋理工大学) StepFun Mila

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Chronological Thinking机制,让全双工对话模型在听用户说话时增量推理,不增加延迟,提升响应质量。

Comments Accepted by SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12992 2026-06-15 cs.LG cs.AI cs.CL stat.ML 版本更新 86%

Fractured Chain-of-Thought Reasoning

断裂链式思维推理

Baohao Liao, Hanze Dong, Yuhui Xu, Doyen Sahoo, Christof Monz, Junnan Li, Caiming Xiong

机构 * University of Amsterdam(阿姆斯特丹大学) eBay Microsoft(微软) Google Research(谷歌研究) Salesforce

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出断裂采样策略,通过截断推理链、调整轨迹数和解数,在推理时实现精度与成本的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05017 2026-06-15 cs.CV cs.CL 版本更新 85%

Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings

通过细化文本嵌入缓解大型视觉语言模型中的幻觉

Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) Capital One

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对大型视觉语言模型因过度依赖文本先验而忽视视觉线索导致的幻觉问题,提出一种简单有效的视觉特征融入方法,通过学习视觉信息化的文本嵌入来平衡注意力分布,显著降低幻觉并提升多模态推理能力。

Comments Accepted at The 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05407 2026-06-15 cs.AI 版本更新 84%

PRISM: Perception Reasoning Interleaved for Sequential Decision Making

PRISM: 感知与推理交错用于序列决策

Mohamed Salim Aissi, Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome

机构 * Institut National de la Recherche Scientifique (INRS)(国家科学研究院)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 提出PRISM框架,通过动态问答流水线紧密耦合视觉语言模型(VLM)和语言模型(LLM),实现任务驱动的感知,在ALFWorld和R2R基准上显著超越现有图像模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22954 2026-06-15 cs.CL cs.AI 版本更新 84%

Residual Context Diffusion Language Models

残差上下文扩散语言模型

Yuezhou Hu, Harman Singh, Monishwaran Maheswaran, Haocheng Xi, Coleman Hooper, Jintao Zhang, Aditya Tomar, Michael W. Mahoney, Sewon Min, Mehrdad Farajtabar, Kurt Keutzer, Amir Gholami, Chenfeng Xu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出残差上下文扩散(RCD)模块,通过回收丢弃令牌的上下文残差提高扩散语言模型的解码效率,在长/短CoT任务上以极少额外计算提升准确率4-11个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08324 2026-06-15 cs.LG 版本更新 81%

Towards Efficient Large Language Reasoning Models via Extreme-Ratio Chain-of-Thought Compression

通过极端比例思维链压缩实现高效大型语言推理模型

Yuntian Tang, Bohan Jia, Wenxuan Huang, Lianyue Zhang, Jiao Xie, Wenxi Li, Wei Li, Jie Hu, Xinghao Chen Rongrong Ji, Shaohui Lin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 提出Extra-CoT框架,通过极端比例压缩思维链、混合比例监督微调和约束层次化比率策略优化,在显著减少推理令牌的同时保持甚至提升推理准确率。

Comments Accepted to ICML 2026. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏