arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1921 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1921 篇

2607.28405 2026-07-31 cs.AI cs.LG 新提交 73%

QuantWAMs: Calibrating at the Right Granularity for World Action Models

QuantWAMs:为世界动作模型校准至合适粒度

Jiacheng Zhou, Jinfan Lv, Ruixuan Li, Longtai Zhang, Yan Wang, Wenqiang Zhang, Lizhe Qi

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)

专题命中 效率与部署 :post-training(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出QuantWAMs框架,通过三种校准策略优化后训练量化,在WAMs上实现内存大幅降低与速度提升,同时保持与FP16接近的性能,验证了部署可行性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28022 2026-07-31 cs.LG cs.AI 新提交 73%

Flux-OPD: On-Policy Distillation with Evolving Contexts

Flux-OPD:基于演化上下文的在线策略蒸馏

Yuran Wang, Zekun Wang, Bohan Zeng, Ruixu Zhang, Wenxuan Liu, Liu Yang, Yifan Dai, Yang Shi, Bozhou Li, Chengzhuo Tong, Daili Hua, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team(KLING团队) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对开放域大语言模型训练缺乏可验证奖励的问题,提出Flux-OPD范式,利用演化上下文作为监督,通过分解反向KL目标优化,在开放域任务上性能优于现有OPD范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24555 2026-07-28 cs.LG cs.AI 新提交 73%

LOCKS: Page-Local Compact Key Summaries for Efficient Long-Context Decoding

LOCKS:用于高效长上下文解码的页面局部紧凑键摘要

Junsung Hwang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对长上下文解码中KV缓存瓶颈问题,提出LOCKS方法,为页面提供局部紧凑键摘要,通过重建对数its、估计注意力质量等操作,仅关注顶部页面,在多种任务中表现出色,显著降低解码延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22961 2026-07-28 cs.LG cs.CL 新提交 73%

Verbalized Particle Posterior: Bayesian Inference over Natural Language Hypotheses

语言化粒子后验:对自然语言假设的贝叶斯推断

Yan Zhang, Shikan Lian, Shibo Li

机构 * Florida State University(佛罗里达州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究针对语言化机器学习无不确定性度量等问题,提出语言化粒子后验方法,通过维护自然语言假设粒子并更新预测,在回归等基准测试中表现优于单个VML运行,能消除灾难性单运行失败,且后验可检查。

Comments 26 pages, 10 tables, 2 algorithms; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20791 2026-07-24 cs.AI cs.CL 新提交 73%

Refusal-Gated Decoding: Preserving Refusal Behavior Under High-Temperature Sampling

拒绝门控解码:在高温采样下保留拒绝行为

Phillip Howard, Xin Su, Allen Roush, Manikandan Ravikiran, Amir Abdullah

机构 * Thoughtworks

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究高温采样下大语言模型拒绝行为受温度影响的问题,提出顺序解码方法,能在高温时保留模型贪婪解码拒绝响应且延迟小,经实验在三个基准数据集上保留91 - 99%的拒绝行为,不影响安全提示高温响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20467 2026-07-24 cs.AI cs.LG 新提交 73%

DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding

DC-Leap:通过草稿引导的连续跳跃解码实现无训练的dLLMs加速

Yanhua Jiao, Tianyi Wu, Xiaoxi Sun, Yulin Li, HuiLing Zhen, Libo Qin, Baotian Hu, Zhuotao Tian, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对dLLMs并行解码中因保守置信阈值致效率低的问题,提出DC-Leap框架。其采用动态连续验证策略消除JPDE,结合草稿引导解码机制。实验表明该框架能大幅加速dLLMs,长序列生成加速显著,且保证生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20434 2026-07-24 cs.CL cs.AI 新提交 73%

Break Through the Compression Bottleneck: From Theory to Practice

突破压缩瓶颈:从理论到实践

Xiusheng Huang, Lu Wang, Yequan Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型压缩瓶颈问题,通过数学证明和实验验证低秩分解与量化非正交,组合会致性能降,进而提出对角粘合方法(DAM),可有效结合二者并减轻性能损失,为相关研究奠定基础。

Comments 18 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19353 2026-07-23 cs.AI cs.LG 新提交 73%

Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX

在英特尔 TDX 下对 NVIDIA H100 上的机密 GPU 推理进行基准测试

Wei Wang, Abdul Hyee Waqas, Burns Smith

机构 * Mozilla

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究在英特尔 TDX 下 NVIDIA H100 GPU 上,比较标准与机密计算模式对语言模型推理的影响。通过两个模型实验,测量多项指标,发现机密模式会使首次令牌时间增加、全局令牌吞吐量下降,较大模型更早饱和,为容量规划提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19223 2026-07-22 cs.LG cs.CL 新提交 73%

AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters

AdaFlash:通过策略蒸馏扩散草稿器实现自适应推测解码

Yu-Yang Qian, Hao-Cong Wu, Chen Chen, Jiacheng Sun, Zhenhua Dong, Peng Zhao, Zhi-Hua Zhou

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Huawei Foundation Model Dept(华为基础模型部)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对扩散草稿器在推测解码中存在的问题,提出AdaFlash框架,包含基于策略蒸馏算法和自适应长度头,有效降低方差,实验证明该框架能提高推理速度,尤其在高并发场景中吞吐量显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17283 2026-07-21 cs.AI cs.LG 新提交 73%

Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware

无损但不免费:消费级硬件上推测性解码的实证剖析

Param Chordiya

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型单流自回归解码受内存带宽限制问题,核心方法是推测性解码,通过小草稿模型与目标模型配合及拒绝采样规则重构计算。在苹果硅笔记本上实证研究五种配置,验证分布等效性,揭示加速与减速原因,表明该方法在特定条件下才有效。

Comments 15 pages, 5 figures, 4 tables. Code, benchmark harness, and all result artifacts: https://github.com/ParamChordiya/speculative_decoding_engine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16248 2026-07-21 cs.LG cs.AI 新提交 73%

High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration

通过局部分布恢复实现高精度低比特 KV 缓存量化

Gradwell Dzikanyanga, Yanqi Pan, Weihao Yang, Donglei Wu, Wen Xia, Hao Huang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究长上下文大语言模型推理中 KV 缓存量化问题,提出局部分布恢复技术,实现 DGAP。该技术可检测高风险步骤并恢复 top-K 候选分布,实验证明在 Llama-3.1-8B 等模型上能提升准确率、降低分布漂移,保持低比特缓存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16246 2026-07-21 cs.LG cs.AI 新提交 73%

Let the Data Decide: Supervision Analysis, Capability Trade-offs, and Adaptive Objective Routing in Continued Pre-Training via Off-Policy Distillation

让数据决定:通过离策略蒸馏进行持续预训练中的监督分析、能力权衡和自适应目标路由

Jiangan Yuan, Zhixuan Li, Han Xu

机构 * Baidu Inc.(百度公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究离策略蒸馏中训练数据、目标参数化和模型能力的相互作用,通过分解问题进行“目标到能力”和“数据到目标”分析,引入诊断指标量化张力,探讨自适应目标路由,表明有效路由取决于信号质量,将持续预训练重构为监督设计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15161 2026-07-17 cs.LG cs.CL 新提交 73%

On-Policy Delta Distillation

策略内增量蒸馏

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 效率与部署 :instruction tuning(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究基于策略内蒸馏,引入新的增量信号作为蒸馏奖励,提出策略内增量蒸馏方法。实验表明该方法能显著改进策略内蒸馏,使推理语言模型在短训练期内表现出色,优于传统方法。

Comments 19 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14506 2026-07-17 cs.LG cs.AI 新提交 73%

Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习的非空泛化界限

Yuxuan Zhu, Rohan Alur, Daniel Kang

机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) MIT(麻省理工学院) Bridgewater AIA Labs(布里奇沃特人工智能实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对具有可验证奖励的强化学习在十亿参数规模下泛化性差的问题,通过将PAC-贝叶斯压缩界限与Gumbel-max重参数化技巧结合,并提出渐进式RLVR框架,在多领域建立非空泛化界限,性能优于基础模型且接近微调模型。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14107 2026-07-17 cs.CL cs.AI 新提交 73%

Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs

北极星:用于扩散语言模型高效推理的漂移感知缓存校准和令牌承诺

Mingyu Lee, Akshat Ramachandran, Souvik Kundu, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel AI Group(英特尔人工智能集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对扩散语言模型推理效率受双向注意力和静态阈值影响的问题,提出北极星框架,利用令牌表示漂移信号,由北极星缓存和北极星提交两组件构成,大幅提升了模型在准确性-吞吐量方面的表现及解码并行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13399 2026-07-16 cs.CL cs.LG 新提交 73%

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

揭开在线策略蒸馏的神秘面纱:作用、问题及调控

Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 效率与部署 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究在线策略蒸馏的作用、问题及调控,阐明其为探索催化剂,揭示师生不匹配和长度利用问题,提出优势裁剪和对数尺度压缩调控,实验表明良好调控的信号质量决定OPD中成功探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13078 2026-07-16 cs.CR cs.AI cs.LG 新提交 73%

Operational Evidence Gaps for LLMs in Fraud Detection and Trust-and-Safety Workflows

大语言模型在欺诈检测和信任与安全工作流程中的操作证据差距

Keyur Gabani

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究LLMs用于欺诈检测等信任与安全工作流程时的操作证据差距。通过对相关操作源编码调查发现证据失衡,欺诈任务部分大但缺乏关键证据。贡献了FORTE框架和部署证据清单,确定支持LLMs部署所需研究。

Comments 22 pages, 3 figures, 6 tables. Ancillary files include the evidence matrix, search note, and numeric claim check

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12696 2026-07-15 cs.CL cs.AI cs.DC 新提交 73%

Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts

更少专家,更快解码:用于专家混合模型的成本感知推测解码

Jincheng Xie, Runheng Liu, Heyan Huang, Yawen Ling, Hanbin Dai, Yu Zheng, Wen Hu

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大规模专家混合模型推理效率受专家激活模式影响的问题,提出成本感知推测解码框架EcoSpec,通过纳入预测的边际专家激活成本进行草稿选择,在多个模型和基准测试中减少活跃专家足迹、提高解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11399 2026-07-14 cs.CL cs.AI 新提交 73%

Agentic Routing: The Harness-Native Data Flywheel

智能体路由:原生执行框架的数据飞轮

Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang

机构 * TokenRhythm Technologies(TokenRhythm科技公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型智能体中模型选择问题,提出原生执行框架智能体路由范式,依执行框架状态选模型,其决策产生的数据记录形成数据飞轮,经实例化验证,表明该路由不仅控成本,更是智能体训练的数据引擎。

Comments Code: https://github.com/opensquilla/opensquilla

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10803 2026-07-14 cs.LG cs.AI 新提交 73%

Weight-Adjusted Gradients Reveal Parameter Importance and Failure Modes in LLMs

权重调整梯度揭示大语言模型中的参数重要性和失效模式

Shrestha Datta, Hongfu Liu, Anshuman Chhabra

机构 * University of South Florida(南佛罗里达大学) Brandeis University(布兰迪斯大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型中参数重要性,提出权重调整梯度(WAG)方法,通过捕捉权重与梯度相互作用识别关键参数,揭示新的相互作用关系,展示其在多应用中的效用,为模型分析、调试和控制提供统一方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09936 2026-07-14 cs.LG cs.AI cs.CR 新提交 73%

SMETA-ZSL:Semantic Meta-Alignment for Zero-Shot Threat Classification

SMETA-ZSL:用于零样本威胁分类的语义元对齐

Ivan Alejandro Montoya Sanchez, Anantaa Kotal, Aritran Piplai

机构 * The University of Texas at El Paso(德克萨斯大学艾尔帕索分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对网络安全新威胁无标注数据问题,提出SMETA-ZSL方法,通过对比微调、情景元学习和知识蒸馏等,从重叠语言描述学习语义原型并对齐行为特征,实现跨可见-未见类别的泛化,在7个基准测试中性能远超先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09791 2026-07-14 cs.LG cs.CL 新提交 73%

Gauge dependence and structured-output corruption in sign-branched repetition penalties: measurements across models, inference stacks, and alternative repetition controls

符号分支重复惩罚中的规范依赖性和结构化输出损坏:跨模型、推理堆栈和替代重复控制的测量

Peter Hollows

专题命中 效率与部署 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 研究符号分支重复惩罚中规范依赖性和结构化输出损坏问题,发现其惩罚定义不明确且损坏输出,将惩罚应用于归一化对数概率可消除这些问题,给出了相关机制、测量及归一化变体。

Comments 8 pages, 2 figures, 4 tables. Code, data, per-stack survey and git genealogy: https://github.com/captainpete/repetition-penalty-gauge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08779 2026-07-13 cs.LG cs.AI 新提交 73%

Signed Symmetric Quantization for Few-Bit Integers

用于少比特整数的带符号对称量化

Ian Colbert, Eashan Dash, Pablo Monteagudo-Lago, Juan Amboage, Srinidhi N, Giuseppe Franco, Nicholas J. Fraser, Arun Ramachandran

机构 * AMD(超威半导体公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究少比特整数量化问题,提出带符号对称量化方法,通过有原则的符号选择规则放置额外可表示值,保持对称量化运行时特征,理论分析其在量化误差上有条件最优,实证验证在模型上有效果提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08690 2026-07-10 cs.LG cs.AI 新提交 73%

A Practical Investigation of Training-free Relaxed Speculative Decoding

无训练的松弛推测解码的实践研究

Guoxuan Xia, Luka Ribar, Paul Balanca

机构 * Graphcore(Graphcore公司)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究无训练的松弛推测解码技术,统一现有方法于共享框架,在当代环境下基准测试,发现松弛需大量能力评估,且许多方法依赖良好语言模型作为起草器,不适用于轻量级专用多令牌预测起草器。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10358 2026-07-10 cs.LG cs.AI 新提交 73%

KG-SoftMAP: Soft Knowledge-Graph Priors for Bayesian Network Structure Learning from Sparse Discrete Data

KG-SoftMAP: 基于软知识图谱先验的稀疏离散数据贝叶斯网络结构学习

Guoliang Xu, James E. Corter

机构 * Columbia University(哥伦比亚大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对稀疏离散数据中贝叶斯网络结构学习困难的问题,提出KG-SoftMAP方法,将加权有向知识图谱编码为软先验,结合BDeu评分与logit形式先验最大化MAP目标,在合成与真实数据上显著提升结构恢复性能。

Comments 12 pages, 2 figures, 4 tables; includes a 24-page technical supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05541 2026-07-08 cs.LG cs.AI 新提交 73%

Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation

具有跨情节记忆和策略蒸馏的自我审查强化学习

Muhammad Zain Amin, Kibele Sebnem Yildirim

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中环境反馈稀疏或延迟问题,提出自我审查强化学习框架,通过策略梯度优化自我审查,经选择性蒸馏内化改进到基础策略,用跨情节记忆保留成功审查,在GSM8K基准上评估,该框架优于基线且学习效率更高。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05399 2026-07-08 cs.CL cs.AI cs.DC 新提交 73%

Benchmarking KV-Cache Optimizations across Task Quality and System Performance for Long-Context Serving

针对长上下文服务,跨任务质量和系统性能对KV缓存优化进行基准测试

Nikita Agrawal, Ruben Mayer

机构 * University of Bayreuth(拜罗伊特大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究长上下文服务中KV缓存优化,通过工作负载感知基准评估多种优化机制,测量多项指标。发现仅压缩率不能预测性能,不同机制表现各异,为长上下文服务系统提供工作负载感知的KV缓存机制选择及部署指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04079 2026-07-07 cs.CV cs.AI cs.LG 新提交 73%

Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

看一次就够了?用于3D问答的在线几何感知令牌剪枝

Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun

机构 * National Tsing Hua University(国立清华大学) Industrial Technology Research Institute ITRI(工业技术研究院) University of Toronto(多伦多大学) Atmanity Inc(Atmanity公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对3D问答中多模态大语言模型推理成本高的问题,提出在线令牌剪枝方法,利用深度和相机姿态投影到体素空间,识别重叠区域并剪枝冗余令牌,减少令牌使用,提升效率和性能。

Comments published at ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03093 2026-07-07 cs.CL cs.AI 新提交 73%

Don't Wait to Reply: Towards Responsive yet Thoughtful Dialogue through Proactive Thinking

不要等待回复:通过主动思考实现响应迅速且深思熟虑的对话

Ante Wang, Jiaqi Fu, Xuanyi Chen, Ruotian Ma, Zhaopeng Tu, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Tencent(腾讯)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型被动思考导致对话延迟问题,提出主动思考框架,介绍无训练基线,通过模拟实时对话流基准测试,证明该方法提升交互效率且不损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02234 2026-07-03 cs.AI cs.LG 新提交 73%

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

纯化OPSD:在不失去思考能力的情况下进行在线自我蒸馏

Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学) Jilin University(吉林大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对在线自我蒸馏(OPSD)在长链思维推理模型中失效的问题,通过分解教师监督信号,发现参考诱导成分导致死记硬背,提出基于点互信息的参考隔离方法,在保持模型认知行为的同时提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏