arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2602.07774 2026-06-24 cs.IR cs.AI 版本更新 79%

GR2: Generative Reasoning Re-ranker

生成式推理重排序器

Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Wenlin Chen, Santanu Kolay, Sandeep Pandey, Hamed Firooz, Luke Simon

机构 * Meta AI

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出GR2框架,利用大语言模型的推理能力进行推荐重排序,通过语义ID编码、推理轨迹监督微调和强化学习优化,在Recall@5和NDCG@5上超越现有方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04579 2026-06-23 cs.AI 版本更新 79%

SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

SCI-PRM:用于科学推理验证的工具感知过程奖励模型

Xiangyu Zhao, Henry Hengyuan Zhao, Yiheng Wang, Wanghan Xu, Yuhao Zhou, Qinglong Cao, Zhiwang Zhou, Lei Bai, Wenlong Zhang, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Tongji University(同济大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 针对科学推理中工具使用和事实一致性问题,提出Sci-PRM模型,通过构建包含工具链轨迹的数据集SCIPRM70K并训练过程奖励模型,在测试时扩展和强化学习中提供细粒度监督,提升基础模型性能。

Comments Accepted by KDD 2026 AI4Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23248 2026-06-19 cs.AI 版本更新 79%

Mitigating Legibility Tax with Decoupled Prover-Verifier Games

通过解耦证明者-验证者游戏减轻可读性代价

Yegon Kim, Juho Lee

机构 * KAIST(韩国科学技术院)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 提出解耦证明者-验证者游戏(DPVG),通过分离正确性与可检查性训练一个翻译器模型,将固定求解器的解转化为可检查形式,在保持答案正确性的同时提高可检查性,解决了可读性代价问题。

Comments ICLR 2026 Workshop Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15633 2026-06-18 cs.LG 新提交 79%

Formalizing and Mitigating Structural Distortion in LLM Attention for Graph Reasoning

形式化并缓解大语言模型注意力中的结构失真以实现零样本图推理

Donald Loveland, Puja Trivedi, Ari Weinstein, Edward W Huang, Danai Koutra

机构 * University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文形式化了大语言模型处理文本属性图时因图线性化导致的结构失真机制,并提出轻量级推理时修改方法GaLA,通过校正注意力偏差提升零样本图推理性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11609 2026-06-11 cs.CL 新提交 79%

Multi-Agent Reasoning with Adaptive Worker Allocation for Stance Detection

基于自适应工人分配的多智能体推理用于立场检测

Meysam Sabbaghan, Arman Zareian Jahromi, Doina Caragea

机构 * Kansas State University(堪萨斯州立大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出一种Manager-Worker多智能体框架,通过自适应分配工人智能体进行推理级合成,而非标签级投票,在隐式和上下文依赖的立场检测上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02240 2026-06-10 cs.CL 版本更新 79%

Lightweight Latent Reasoning for Narrative Tasks

面向叙事任务的轻量级潜在推理

Alexander Gurung, Esmeralda S. Whitammer, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) CIFAR Fellow

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出LiteReason方法,通过轻量级推理投影器生成连续潜在令牌,在强化学习中动态切换潜在与离散推理,将推理长度减少77-92%,同时保持接近非潜在RL的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08545 2026-06-09 cs.CL cs.SE 新提交 79%

Ishigaki-IDS: An Open-Weight Verifier-Aware Model for Information Delivery Specification Drafting in Building Information Modeling

Ishigaki-IDS:一种面向建筑信息模型中信息交付规范起草的开放权重验证器感知模型

Ryo Kanazawa, Koyo Hidaka, Teppei Miyamoto, Takayuki Kato, Tomoki Ando, Chenguang Wang, Dayuan Jiang, Naofumi Fujita, Shuhei Saitoh, Atomu Kondo, Koki Arakawa, Daiho Nishioka

机构 * ONESTRUCTION Inc.(ONESTRUCTION公司) AWS GenAI Innovation Center(AWS生成式AI创新中心)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 针对BIM项目中IDS编写瓶颈,提出开放权重LLM Ishigaki-IDS,结合持续预训练、监督微调和基于验证器奖励的强化学习,生成可通过外部验证器检查的IDS草案,在基准上显著优于基线,并减少54.7%工作时间。

Comments 8 pages, 2 figures, 5 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08501 2026-06-09 cs.CL 新提交 79%

Back on Track: Aligning Rewards and States for Reasoning in Diffusion Large Language Models

重回正轨:在扩散大语言模型中对齐奖励与状态以进行推理

Yawen Shao, Jie Xiao, Kai Zhu, Yu Liu, Hongchen Luo, Xueyang Fu, Yang Cao, Wei Zhai, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tongyi Lab(通义实验室) Northeastern University(东北大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 针对扩散大语言模型强化学习中过程奖励与状态轨迹的双重错位问题,提出PAPO框架,通过步骤感知过程奖励和熵引导历史重演实现对齐,在四个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07950 2026-06-09 cs.LG 新提交 79%

The Easy, the Hard, and the Learnable: Confidence and Difficulty-Adaptive Policy Optimization for LLM Reasoning

简单、困难与可学习:面向LLM推理的置信度与难度自适应策略优化

Zhanke Zhou, Xiangyu Lu, Chentao Cao, Brando Miranda, Tongliang Liu, Bo Han, Sanmi Koyejo

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) Stanford University(斯坦福大学) Sydney AI Centre, The University of Sydney(悉尼大学人工智能中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 针对GRPO训练中均匀采样导致计算效率低的问题,提出CoDaPO方法,通过置信度和难度自适应重加权与重采样,在固定预算下提升可学习问题的发现,在12个基准上优于现有RL方法。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07856 2026-06-09 cs.LG 新提交 79%

Teacher-Free Self-Training Amplifies but Does Not Compound: A Pass@$K$ Crossover on a Free-Verifier Domain

无教师自训练放大但不复合:自由验证器域上的 Pass@$K$ 交叉

Igor Lima Strozzi

机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 在自由验证器域上,使用无教师自训练(STaR)和批评者指导的选择,发现自训练放大模型能力但不复合,通过 Pass@$K$ 交叉诊断证实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03092 2026-06-09 cs.AI 版本更新 79%

The Shadow Price of Reasoning: Economic Perspective on Optimal Budget Allocation for LLMs

推理的影子价格:LLM最优预算分配的经济学视角

Xu Wan, Speed Zhu, Jianwei Cai, Guang Chen, XiMing Huang, Wiggin Zhou, Mingyang Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文从经济学视角将推理预算分配建模为全局约束优化问题,提出基于影子价格的CLEAR方法,通过理性放弃和资源再分配,在资源稀缺下显著提升总token成本与平均准确率的帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03603 2026-06-03 cs.CV cs.CL 79%

World Models Meet Language Models: On the Complementarity of Concrete and Abstract Reasoning

世界模型遇见语言模型:论具体推理与抽象推理的互补性

Yucheng Zhou, Wei Tao, Yiwen Guo, Jianbing Shen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出受控具体推理框架及PF-OPSD方法,通过结合世界模型的视觉模拟与多模态大语言模型的抽象推理,在空间前瞻和开放域物理预测任务上提升性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01464 2026-06-02 cs.CL 79%

Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models

跨语言自一致性:面向语言模型的多语言推理

Ahmed Elhady, Eneko Agirre, Mikel Artetxe

机构 * HiTZ Center, University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心) Reka AI

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出无监督强化学习方法,通过强制模型对跨语言等价问题产生相同答案来增强多语言推理,在MGSM上平均提升21.7%,并展现出强泛化能力。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00660 2026-06-02 cs.CL 79%

FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search

FineVerify: 通过细粒度自验证扩展智能搜索的测试时计算

James Xu Zhao, Hui Chen, Bryan Hooi, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL

AI总结 提出FineVerify细粒度自验证框架,将问题分解为可检查的子问题,对候选答案逐项验证并聚合得分,在四个智能搜索基准上显著优于标准扩展基线。

Comments 8+18 pages, 6 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10219 2026-05-29 cs.AI 79%

Cognitive Pivot Points and Visual Anchoring: Unveiling and Rectifying Hallucinations in Multimodal Reasoning Models

认知支点与视觉锚定:揭示并纠正多模态推理模型中的幻觉

Zhe Qian, Yanbiao Ma, Zhuohan Ouyang, Zhonghua Wang, Zhongxing Xu, Fei Luo, Xinyu Liu, Zongyuan Ge, Yike Guo, Jungong Han

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 龙城人工智能学院) South China Agricultural University(华南农业大学) South China Normal University(华南师范大学) Monash University(莫纳什大学) Jishou University(吉首大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多模态大推理模型在长链推理中易产生幻觉的问题,提出V-STAR训练范式,通过分层视觉注意力奖励和强制反思机制,将视觉锚定引入推理过程以减轻幻觉。

Comments TPAMI under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25507 2026-05-27 cs.AI 79%

Credit Assignment with Resets in Language Model Reasoning

语言模型推理中带有重置的信用分配

Ankur Samanta, Akshayaa Magesh, Ayush Jain, Youliang Yu, Daniel Jiang, Kavosh Asadi, Kaveh Hassani, Paul Sajda, Jalaj Bhandari, Yonathan Efroni

机构 * Meta AI Columbia University(哥伦比亚大学) Meta Superintelligence Labs(Meta超智能实验室) Tel Aviv University(特拉维夫大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出随机重置策略优化(RRPO)和自重置策略优化(SRPO)两种方法,通过重置到中间状态并重新采样反事实延续来改进语言模型多步推理中的信用分配,SRPO在多个推理基准上优于标准GRPO和RRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26172 2026-05-27 cs.LG 79%

ARBITER: Reasoning Trajectory Basins and Majority Vote Failures in Test-Time Sampling

ARBITER:测试时采样中的推理轨迹盆地与多数投票失败

Meng Cai, Lars Kulik, Farhana Choudhury

机构 * School of Computing and Information Systems(计算与信息系统学院) University of Melbourne(墨尔本大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文发现语言模型测试时采样的推理轨迹会聚集成少数“推理盆地”,导致多数投票选择最稳定而非最准确的盆地,并提出ARBITER方法通过保守加性证据修正共识,从样本池中恢复部分正确性。

Comments Preprint. 34 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13502 2026-05-27 cs.CL 79%

Using reasoning LLMs to extract SDOH events from clinical notes

使用推理型大语言模型从临床笔记中提取社会健康决定因素事件

Ertan Dogan, Kunyu Yu, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine(流行病学与公共卫生系,韦尔·科恩医学中心)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出一种基于推理型大语言模型的提示工程方法,通过四个模块(简洁提示、少样本学习、自一致性机制和后处理)从临床笔记中提取结构化SDOH事件,取得0.866的微平均F1分数,展示了简单实现与强性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24998 2026-05-26 cs.CL 79%

Better, Faster: Harnessing Self-Improvement in Large Reasoning Models

更好、更快:利用大型推理模型的自我改进

Qihuang Zhong, Liang Ding, Juhua Liu, Bo Du, Leszek Rutkowski, Dacheng Tao

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Alibaba Group, China(中国阿里巴巴集团) School of Computer Science, Wuhan University, China(武汉大学计算机学院) AGH University of Science and Technology, Poland(波兰AGH科学与技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 针对自我改进训练中数据不平衡和过度思考问题,提出HSIR方法,通过验证后退出采样和内在多样性评分提升推理性能与效率。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21810 2026-05-22 cs.AI cs.MA 79%

Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents

Trace2Skill: 验证器引导的技能进化用于长上下文EDA代理

Zijian Du, Nathaniel Pinckney

机构 * NVIDIA

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过验证器引导的技能进化提升硬件代理在复杂验证问题上的性能,无需RTL专用模型微调,通过密集验证器反馈实现任务通过率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19376 2026-05-21 cs.AI 79%

Generative Recursive Reasoning

生成性递归推理

Junyeob Baek, Mingyu Jo, Minsu Kim, Mengye Ren, Yoshua Bengio, Sungjin Ahn

机构 * KAIST(韩国科学技术院) Mila – Québec AI Institute(魁北克人工智能研究所) New York University(纽约大学) Université de Montréal(蒙特利尔大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Gram框架,通过将递归潜在推理转化为概率多轨迹计算,解决了传统递归推理模型的确定性问题,实现了条件推理和无条件生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17626 2026-05-19 cs.LG cs.SE 79%

Verifier-Guided Code Translation via Meta-Step Decoding

通过元步骤解码实现验证器引导的代码翻译

Tianyang Zhou, Somesh Jha, Mihai Christodorescu, Kirill Levchenko, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google(谷歌)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本研究提出了一种元步骤解码框架DTV,通过在生成过程中整合验证器调用,提高了代码翻译的通过率,同时减少了token的使用。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22297 2026-05-19 cs.CL 79%

Learning from Self-Debate: Preparing Reasoning Models for Multi-Agent Debate

从自我辩论中学习:为多智能体辩论准备推理模型

Chenxi Liu, Yanshuo Chen, Ruibo Chen, Tianyi Xiong, Tong Zheng, Heng Huang

机构 * Department of Computer Science(计算机科学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SDRL框架,通过自我辩论训练使模型具备独立问题解决能力和多智能体辩论中的多样化推理处理能力,实验表明其在多辩论协议和智能体配置下均能提升多智能体辩论性能和单模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17104 2026-05-19 cs.AI 79%

Scientific Logicality Enriched Methodology for LLM Reasoning: A Practice in Physics

具有科学逻辑性的方法论:LLM推理的实践:物理学

Zhaoxin Yu, Nan Xu, Kun Chen, Jiahao Zhao, Lei Wang, Wenji Mao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China Beijing Wenge Technology Co., Ltd, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种增强科学逻辑性的方法论,旨在提升LLM在科学推理中的逻辑正确性与任务表现,通过物理学中的多样逻辑结构和形式化进行实践验证。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12987 2026-05-19 cs.CL 79%

Leveraging Multimodal Self-Consistency Reasoning in Coding Motivational Interviewing for Alcohol Use Reduction

利用多模态自一致性推理进行编码动机访谈以减少酒精使用

Guangzeng Han, James G. Murphy, Benjamin O. Ladd, Xiaolei Huang, Brian Borsari

机构 * Department of Computer Science, University of Memphis(密苏里大学计算机科学系) Veterans Affairs Health Care System(退伍军人事务医疗系统) Department of Psychiatry and Behavioral Sciences, University of California San Francisco(旧金山大学精神病学与行为科学系) Department of Psychology, University of Memphis(密苏里大学心理学系) Department of Psychology, Washington State University Vancouver(华盛顿州立大学温哥华分校心理学系)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出基于音频语言模型的自动动机访谈编码方法,通过多模态自一致性推理提升编码鲁棒性,实验显示其在准确率、精确率和召回率上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02427 2026-05-15 cs.LG 79%

Embedding Perturbation may Better Reflect Intermediate-Step Uncertainty in LLM Reasoning

嵌入扰动可能更好地反映大语言模型推理中的中间步骤不确定性

Qihao Wen, Jiahao Wang, Yang Nan, Pengfei He, Ravi Tandon, Han Xu

机构 * University of Arizona(亚利桑那大学) Michigan State University(密歇根州立大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究了大语言模型推理中中间步骤不确定性的量化方法,发现基于嵌入扰动的指标在不确定性评估中表现更优,具有更高的效率和简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13501 2026-05-14 cs.AR cs.LG 79%

Reward-Weighted On-Policy Distillation with an Open Property-Equivalence Verifier for NL-to-SVA Generation

基于开放属性等价验证器的奖励加权在线策略蒸馏用于自然语言到SVA生成

Qingyun Zou, Yingze Li, Tianen Liu, Bingsheng He, Weng-Fai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本文提出RWOPD方法,通过开放属性等价检查器提升SVA生成性能,使模型在多个评估指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10762 2026-05-12 cs.CV cs.AI 79%

GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs

GridProbe: 为长视频VLMs中的自适应测试时间计算进行后验探测

Mohamed Eltahir, Lama Ayash, Ali Habibullah, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡尔斯塔德大学科学与技术学院) Department of Computer Science, Edge Hill University(埃奇希尔大学计算机科学系)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.AI

AI总结 GridProbe通过后验探测方法在无需训练的情况下选择相关帧,减少注意力成本,同时保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09853 2026-05-12 cs.LG 79%

Exploration-Driven Optimization for Test-Time Large Language Model Reasoning

基于探索的优化用于测试时大语言模型推理

Changhao Li, Yuchen Zhuang, Chenxiao Gao, Haotian Sun, Rushi Qiang, Chao Zhang, Bo Dai

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出EDO框架,通过扩展奖励偏差探索目标到迭代后训练,提升大语言模型推理中的探索与利用平衡,实验表明ED-iDPO和ED-GRPO在推理能力和多样性上优于基线模型。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08776 2026-05-12 cs.AI 79%

Reasoning Compression with Mixed-Policy Distillation

基于混合策略蒸馏的推理压缩

Han Yang, Mingyan Wu, Bailan He, Zeyu Cao, Sikuan Yan, Kevin Qinghong Lin, Zifeng Ding

机构 * Technical University of Munich(慕尼黑技术大学) GESIS – Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) Northeastern University(东北大学) LMU Munich(慕尼黑大学) Siemens AG(西门子股份公司) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Mina AI

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出混合策略蒸馏框架,通过从大模型压缩推理轨迹到小模型,有效减少token使用并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏