arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2607.07508 2026-07-09 cs.LG cs.AI 新提交 62%

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

用于智能强化学习的单步异步优化

Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对异步强化学习中训练稳定性和离策略挑战,提出单步异步优化(SAO)。核心方法是用单步采样取代分组采样,改进单步策略并引入裁剪策略。主要贡献是SAO训练稳定,性能优于GRPO及其变体,在模拟在线学习中有效且成功部署于模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05552 2026-07-08 cs.CL cs.AI cs.CY 新提交 62%

The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment

大语言模型的是非偏差反映答案顺序和措辞,而非道德判断的转变

Haonan Huang

机构 * Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在道德困境判断中的是非偏差,通过交叉对称化等心理测量方法区分逻辑判断、词汇等因素,发现前沿模型立场与形式无关,部分模型存在顺序和词汇偏差,最小模型可总结伪像,强调跨框架测量模型重视内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05541 2026-07-08 cs.LG cs.AI 新提交 62%

Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation

具有跨情节记忆和策略蒸馏的自我审查强化学习

Muhammad Zain Amin, Kibele Sebnem Yildirim

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中环境反馈稀疏或延迟问题,提出自我审查强化学习框架,通过策略梯度优化自我审查,经选择性蒸馏内化改进到基础策略,用跨情节记忆保留成功审查,在GSM8K基准上评估,该框架优于基线且学习效率更高。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05458 2026-07-08 cs.LG cs.AI 新提交 62%

Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

利用离线强化学习学习控制大语言模型智能体的执行框架

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究提出将大语言模型智能体的执行框架视为可学习控制层,通过有限 horizon 的框架马尔可夫决策过程,利用离线强化学习训练轻量级控制器,在多领域实验中改进验证行为、提高任务质量,证明框架控制可学习且离线支持有局限。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10494 2026-07-07 cs.CL cs.LG 版本更新 62%

Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成

Weixin Liu, Congning Ni, Qingyuan Song, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学中心) Lirio Virginia Tech(弗吉尼亚理工大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。

Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01874 2026-07-03 cs.AI cs.CL 新提交 62%

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach: 用于评估和增强智能体技能使用的自演化评分准则

Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出SkillCoach框架,通过自演化过程评分准则从技能选择、遵循、组合和反思四维度评估智能体轨迹,并利用演化准则筛选高质量训练数据,提升技能使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32029 2026-07-01 cs.CL cs.AI 新提交 62%

When LLMs Read Tables Carelessly: Measuring and Reducing Data Referencing Errors

当LLM粗心阅读表格时:测量并减少数据引用错误

Yuqing Yang, Qi Zhu, Zhen Han, Boran Han, Zhengyuan Shen, Shuai Wang, Vassilis N. Ioannidis, Huzefa Rangwala

机构 * University of Southern California(南加州大学) AWS AI Labs(AWS AI实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究系统评估了大型语言模型在表格任务中的数据引用错误,并提出基于批评模型的过滤与拒绝采样方法,将答案准确率提升高达12.0%。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31484 2026-07-01 cs.LG cs.CL 新提交 62%

Fork-Think with Confidence

基于置信度的分叉思考

Zena Al-Khalili, Rafi Hakim, Dietrich Klakow, Ji-Ung Lee

机构 * Saarland Informatics Campus, Saarland University, Germany(德国萨尔大学萨尔兰信息学园区)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出一种先决策后思考的并行推理方法,通过模型置信度识别分叉点并采样多条路径聚合,在保持或提升推理性能的同时,将token消耗降低30%,运行时间减少57%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15488 2026-07-01 cs.CL cs.AI 62%

Multi-Persona Thinking for Bias Mitigation in Large Language Models

多视角思考用于大型语言模型中的偏见缓解

Yuxing Chen, Guoqing Luo, Zijun Wu, Lili Mou

机构 * Dept. Computing Science, Alberta Machine Intelligence Institute (Amii) University of Alberta, Canada(计算科学系,阿尔伯塔机器智能研究所(Amii),阿尔伯塔大学,加拿大) Canada CIFAR AI Chair, Amii(加拿大 CIFAR 人工智能主席,Amii)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多视角思考(MPT)框架,通过鼓励多视角推理减少社会偏见,实验表明其在降低偏见的同时保持了核心推理能力。

Comments 15 pages

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 27895-27909, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15845 2026-07-01 cs.CL cs.AI 版本更新 62%

Verify when Uncertain: Beyond Self-Consistency in Black Box Hallucination Detection

不确定时验证:超越黑盒幻觉检测中的自一致性

Yihao Xue, Kristjan Greenewald, Youssef Mroueh, Baharan Mirzasoleiman

机构 * MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出两阶段检测算法,结合自一致性与交叉一致性,在保持高检测性能的同时降低计算成本,并通过核均值嵌入提供理论解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29733 2026-06-30 cs.CL cs.DB cs.LG 62%

How Far Do On-Prem Open LLMs Get on Text-to-SQL? A Cross-Family Size x Technique Frontier on BIRD

本地开源大模型在Text-to-SQL上的表现如何?基于BIRD的跨系列规模×技术前沿研究

Vladimir Beskorovainyi

机构 * Besk Tech(Besk科技) Moscow Institute of Physics and Technology (MIPT)(莫斯科物理技术学院)

专题命中 测试时计算 :self-correction(abstract);分类 cs.CL、cs.LG

AI总结 本研究在BIRD开发集上系统评估了三种开源大模型系列在Text-to-SQL任务上的表现,发现模型代际比规模更重要,自纠正能稳健提升性能,而模式链接和自一致性效果有限。

Comments 9 pages, 4 figures, 3 tables. Code: https://github.com/beskvladimir-create/nl2sql-onprem-bench Data DOI: https://doi.org/10.5281/zenodo.20952794

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27409 2026-06-29 cs.MA cs.CL cs.LG cs.SY eess.SY 新提交 62%

Delayed Verification Destabilizes Multi-Agent LLM Belief: Instability Thresholds and Optimal Corrector Placement

延迟验证破坏多智能体LLM信念:不稳定性阈值与最优校正器放置

Igor Itkin

机构 * Independent Researcher(独立研究者)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 研究多智能体LLM系统中延迟验证导致信念不稳定的问题,通过图论和谱分解推导出验证剂量的稳定性阈值,并提出贪心近似算法优化校正器放置。

Comments 20 pages, 5 figures, 1 table. Code and data: https://github.com/YehudaItkin/delayed-verification-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23858 2026-06-24 cs.LG cs.AI cs.CR 新提交 62%

Are Safety Guarantees in Neural Networks Safe? How to Compute Trustworthy Robustness Certifications

神经网络中的安全保障真的安全吗?如何计算可信的鲁棒性认证

Merkouris Papamichail, Konstantinos Varsos, Giorgos Flouris, João Marques-Silva

机构 * University of Crete(克里特大学) Catalan Institution for Research and Advanced Studies(加泰罗尼亚研究与高等研究院) University of Lleida(莱里达大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 针对神经网络对抗样本问题,提出apothem度量以线性时间计算最优鲁棒性认证,并证明体积最优认证的不可行性,引入双重认证和ParallelepipedoNN系统,在MNIST等基准上实现至少两倍的最小边长改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11552 2026-06-24 cs.CL cs.LG 新提交 62%

Teaching Diffusion to Speculate Left-to-Right

教导扩散模型从左到右推测

Lexington Whalen, Yuki Ito, Ryo Sakamoto

机构 * Lexington Whalen Yuki Ito Ryo Sakamoto

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对自回归解码的推理瓶颈,提出三种训练时干预方法(位置加权、首次错误焦点损失、链损失)来弥合块扩散草稿模型的双向生成与自回归目标模型从左到右验证之间的不对称性,显著提升接受草稿长度。

Comments 13 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19475 2026-06-23 cs.AI cs.CL 新提交 62%

Diffusion Language Models: An Experimental Analysis

扩散语言模型:一项实验分析

Thomas Bertolani, Davide Bucciarelli, Leonardo Zini, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) University of Pisa(比萨大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文系统比较了八种扩散语言模型在推理、编码、翻译等任务上的表现,分析了去噪步数、上下文长度等推理因素对性能与效率的影响,揭示了扩散语言模型在不同任务和预算下的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16214 2026-06-23 cs.LG cs.AI 新提交 62%

Calibrated Sampling-Free Uncertainty Estimation in Bayesian Deep Learning

贝叶斯深度学习中的校准无采样不确定性估计

Tobias Jan Wieczorek, Leon de Andrade, Thomas Möllenhoff, Marcus Rohrbach

机构 * TU Darmstadt & hessian.AI, Darmstadt, Germany(达姆施塔特工业大学 & hessian.AI,德国达姆施塔特) RIKEN Center for Advanced Intelligence Project, Tokyo, Japan(日本理化学研究所革新智能研究中心,日本东京)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出校准方差传播(CVP),通过新型归一化层传播方法、激活函数处理技术及轻量校准步骤,在单次前向传播中高效估计不确定性,在Transformer和CNN上达到与MC采样相当的精度,成本显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19347 2026-06-19 cs.CL cs.AI cs.PL 新提交 62%

How LLMs Fail and Generalize in RTL Coding for Hardware Design?

LLM在硬件设计的RTL编码中如何失败与泛化?

Guan-Ting Liu, Chao-Han Huck Yang, Chenhui Deng, Zhongzhi Yu, Brucek Khailany, Yu-Chiang Frank Wang

机构 * NVIDIA Research(英伟达研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出基于问题可解性的错误分类法,揭示LLM在RTL编码中受限于预训练知识,对齐技术仅教会编译,而推理能力才是关键瓶颈。

Comments Preview, under submission for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00510 2026-06-19 cs.AI cs.LG cs.SE 版本更新 62%

PCBSchemaGen: Reward-Guided LLM Code Synthesis for Printed Circuit Boards (PCB) Schematic Design with Structured Verification

PCBSchemaGen: 奖励引导的LLM代码合成用于印刷电路板(PCB)原理图设计及结构化验证

Huanghaohe Zou, Peng Han, Emad Nazerian, Mafu Zhang, Zhicheng Guo, Alex Q. Huang

机构 * Semiconductor Power Electronics Center (SPEC)(半导体功率电子中心) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Arizona State University(亚利桑那州立大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出PCBSchemaGen框架,通过结构化验证器引导冻结的LLM生成可修复的PCB原理图,在无单元测试的领域实现高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19264 2026-06-18 cs.LG cs.CL 新提交 62%

Structured Inference with Large Language Gibbs

大语言吉布斯结构化推理

Sanghyeok Choi, Henry Gouk, Esmeralda S. Whitammer

机构 * University of Edinburgh, School of Informatics(爱丁堡大学信息学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出大语言吉布斯方法,利用大语言模型的条件分布作为转移算子进行结构化概率推理,通过迭代重采样变量避免顺序偏差,在合成分布、一致性推理和贝叶斯结构学习中验证有效性。

Comments Code: https://github.com/hyeok9855/large-language-gibbs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18327 2026-06-18 cs.LG cs.AI 新提交 62%

Self-CTRL: Self-Consistency Training with Reinforcement Learning

Self-CTRL:基于强化学习的自一致性训练

Itamar Pres, Laura Ruis, Melat Ghebreselassie, Belinda Z. Li, Jacob Andreas

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出Self-CTRL方法,通过强化学习优化语言模型自我解释与行为之间的一致性,在概率推理和宪法AI任务上显著提升一致性和安全性。

Comments 34 pages, 12 figures, includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18023 2026-06-17 cs.LG cs.AI 新提交 62%

LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling

LoopCoder-v2: 仅循环一次以实现高效的测试时计算扩展

Jian Yang, Shawn Guo, Wei Zhang, Tianyu Zheng, Yaxin Du, Haau-Sing Li, Jiajun Wu, Yue Song, Yan Xing, Qingsong Cai, Zelong Huang, Chuan Hao, Ran Tao, Xianglong Liu, Wayne Xin Zhao, Mingjie Tang, Weifeng Lv, Ming Zhou, Bryan Dai

机构 * Beihang University(北京航空航天大学) IQuest Research Langboat(浪波) Renmin University of China(中国人民大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出并行循环Transformer(PLT)并研究循环次数选择,发现两循环变体在代码生成等任务上显著提升,而三循环以上性能下降,揭示了增益-成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-06-17 cs.LG cs.AI 版本更新 62%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01761 2026-06-17 cs.LG cs.AI 版本更新 62%

Position: Modular Memory is the Key to Continual Learning Agents

Position: 模块化记忆是持续学习智能体的关键

Vaggelis Dorovatas, Malte Schwerin, Andrew D. Bagdanov, Lucas Caccia, Antonio Carta, Laurent Charlin, Barbara Hammer, Tyler L. Hayes, Timm Hess, Christopher Kanan, Dhireesha Kudithipudi, Xialei Liu, Vincenzo Lomonaco, Jorge Mendez-Mendez, Darshan Patil, Ameya Prabhu, Elisa Ricci, Tinne Tuytelaars, Gido M. van de Ven, Liyuan Wang, Joost van de Weijer, Jonghyun Choi, Martin Mundt, Rahaf Aljundi

机构 * University of Bremen(不莱梅大学) Seoul National University(首尔国立大学) Computer Vision Center Barcelona(巴塞罗那计算机视觉中心) University of Florence(佛罗伦萨大学) Microsoft Research(微软研究院) HEC Montreal, Mila--Quebec AI Institute, Canada CIFAR AI Chair(蒙特利尔HEC学院、魁北克人工智能研究所、加拿大CIFAR人工智能 chair) Bielefeld University(比勒海姆大学) Georgia Institute of Technology(佐治亚理工学院) University of Rochester(罗切斯特大学) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Nankai University(南开大学) LUISS University(卢西亚诺大学) Stony Brook University(石溪大学) University of Tübingen(图宾根大学) University of Trento, FBK(特伦托大学,FBK) Tsinghua University(清华大学) University of Groningen(Groningen大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过模块化记忆结合权重内学习与上下文学习,解决持续学习中的灾难性遗忘问题,实现大规模持续适应。

Comments ICML 2026 Position Track Spotlight. This work stems from discussions held at the Dagstuhl seminar on Continual Learning in the Era of Foundation Models (October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16999 2026-06-16 cs.SE cs.CL cs.LG 新提交 62%

Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models

无信号下的选择,通过表达恢复:冻结小代码模型的事后伪造操作符的测量研究

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(Pytha实验室,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究测量了冻结小代码模型的事后语义操作符(如选择、验证、修复)的有效性,发现它们均未优于Best-of-N,并揭示了覆盖墙、能力剪刀和共识陷阱等机制原因;而表达层恢复(M1)通过鲁棒提取和签名对齐提升了准确率。

Comments 33 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13441 2026-06-16 cs.AI cs.CL 新提交 62%

Why Sampling Is Not Choosing: Intentionality, Agency, and Moral Responsibility in Large Language Models

为什么采样不是选择:大语言模型中的意向性、能动性与道德责任

Joseph Keshet

机构 * Joseph Keshet(约瑟夫·凯舍特)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文论证大语言模型不具备道德责任所需的承诺性能动性,其输出源于概率映射而非内在意向性,随机采样不等于选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02427 2026-06-16 cs.AI cs.LG 版本更新 62%

The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling

模型知晓,解码器发现:未来价值引导的粒子力量采样

Tu Nguyen, Matthieu Zimmer, Rasul Tutunov, Xiaotong Ji, Haitham Bou Ammar

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Huawei Noah’s Ark Lab(华为诺亚实验室) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APPS算法,通过块状粒子方法高效定位LLM的多步解,提升推理准确率与运行效率,减少对训练数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08794 2026-06-12 cs.LG cs.CL 版本更新 62%

One Token to Fool LLM-as-a-Judge

一个令牌就能欺骗LLM裁判

Yulai Zhao, Haolin Liu, Dian Yu, Sunyuan Kung, Meijia Chen, Haitao Mi, Dong Yu

机构 * Princeton University(普林斯顿大学) University of Virginia(弗吉尼亚大学) Tencent AI Lab(腾讯人工智能实验室) Rutgers University(罗格斯大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 发现基于参考的生成式奖励模型易受奖励黑客攻击,表面输入(如非词符号或通用推理开头)能持续引发假阳性奖励,提出使用截断模型输出作为对抗性负例的数据增强策略,构建鲁棒的Master奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12370 2026-06-11 cs.LG cs.CL 新提交 62%

Breaking Entropy Bounds: Accelerating RL Training via MTP with Rejection Sampling

打破熵界:通过带拒绝采样的多令牌预测加速强化学习训练

Yucheng Li, Huiqiang Jiang, Yang Xu, Jianxin Yang, Yi Zhang, Yizhong Cao, Yuhao Shen, Fan Zhou, Rui Men, Jianwei Zhang, An Yang, Bowen Yu, Bo Zheng, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team, Alibaba Inc(阿里巴巴集团 Qwen 团队)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对强化学习训练中多令牌预测接受率因熵波动而下降的问题,提出Bebop方法,采用概率拒绝采样和端到端TV损失优化,实现高达95%接受率和1.8倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12243 2026-06-11 cs.CL cs.AI 新提交 62%

VIA-SD: Verification via Intra-Model Routing for Speculative Decoding

VIA-SD:通过模型内路由进行推测解码的验证

Yuchen Xian, Yang He, Yunqiu Xu, Yi Yang

机构 * ReLER, The State Key Lab of Brain Machine Intelligence, Zhejiang University(脑机智能国家重点实验室,浙江大学) College of Artificial Intelligence, Zhejiang University(人工智能学院,浙江大学) CFAR, Agency for Science, Technology and Research, Singapore(科学与技术研究局,新加坡) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出VIA-SD多级验证框架,利用从完整验证器派生的精简验证器处理中等置信度令牌,减少大模型调用,在多个任务上实现10-20%加速。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12086 2026-06-11 cs.AI cs.LG 新提交 62%

IntElicit: Eliciting and Assessing Contextualized Creativity via Dialogue Policy Optimization

IntElicit: 通过对话策略优化引出和评估情境化创造力

Mingjia Li, Jin Wu, Hong Qian, Wenhao Huang, Yiyang Huang, Yiwen Zhang, Chanjin Zheng, Xiangfeng Wang, Aimin Zhou, Jiajun Guo

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出IntElicit框架,通过分解过程奖励机制优化对话策略,在交互中减少非创造性混淆因素,从而更有效地引出和评估情境化创造力。

详情

展开后加载摘要…

URL PDF HTML 收藏