arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-11 至 2026-08-11 共收录 319 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 32 篇

2608.08503 2026-08-11 cs.AI cs.CL 新提交 92%

MathShikkha: A Controlled Study of Answer-Only and Chain-of-Thought Supervision for Bangla Mathematical Reasoning in Small Language Models

MathShikkha:针对小型语言模型孟加拉语数学推理的仅答案与思维链监督对照研究

Rahma Simin Ali, Jawad Hossain

机构 * University at Albany(奥尔巴尼大学)

专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究构建含GPT-5.4推理依据的孟加拉语数学数据集MathShikkha,微调4个4B-7B模型,发现CoT监督对域内强骨干无增益但提升弱模型,域外及BanglaMATH基准上均优于仅答案,核心益处为语言贴合度、可审核推理及域外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16097 2026-08-11 cs.LG cs.AI cs.CL 版本更新 82%

Understanding Reasoning from Pretraining to Post-Training

理解从预训练到训练后阶段的推理

Jingyan Shen, Ang Li, Salman Rahman, Yifan Sun, Micah Goldblum, Matus Telgarsky, Pavel Izmailov

机构 * New York University(纽约大学) Modal Labs(模态实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究强化学习在大语言模型从预训练到训练后阶段对推理的作用,以国际象棋为测试平台,按标准流程训练模型,发现预训练损失可预测RL后性能,RL奖励曲线斜率与预训练令牌有关,还揭示RL对SFT策略的影响,且在数学领域也有相同模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27201 2026-08-11 cs.CL cs.AI cs.LG 版本更新 82%

Path-Lock Expert: Separating Reasoning Mode in Hybrid Thinking via Architecture-Level Separation

路径锁定专家:通过架构层面分离实现混合思维中的推理模式分离

Shouren Wang, Wang Yang, Chuang Ma, Debargha Ganguly, Vikash Singh, Chaoda Song, Xinpeng Li, Xianxuan Long, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) NII LLMC, Japan(日本NII LLMC) Michigan State University(密歇根州立大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Path-Lock Expert,通过架构层面分离推理与非推理模式,减少推理泄漏,提升非推理模式的准确性和简洁性。

Comments 38 pages, 12 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09128 2026-08-11 cs.CL cs.AI cs.MA 新提交 81%

Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments

Social Gym与SPaRTan:通过多智能体游戏锦标赛对LLM社会推理进行基准测试与改进

Keyu He, Xuhui Zhou, Maarten Sap

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究推出Social Gym多智能体社会游戏环境与SPaRTan自博弈反思迁移方法,前者可客观基准测试LLM社会推理,后者可提升GPT-5-mini的弱角色表现,为改进LLM社会推理提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23333 2026-08-11 cs.LG cs.CL 版本更新 81%

Process Supervision of Confidence Margin for Calibrated LLM Reasoning

校准大语言模型推理的置信度边际过程监督

Liaoyaqi Wang, Chunsheng Zuo, William Jurayj, Benjamin Van Durme, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出RLCM框架,通过增强的边际过程奖励优化正确性和置信度可靠性,提升模型校准性能并保持准确性,同时实现更高效的置信度加权聚合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05164 2026-08-11 cs.LG cs.AI 版本更新 81%

Not All Turns Are Equally Hard: Adaptive Thinking Budgets For Efficient Multi-Turn Reasoning in Agents

并非所有转折都同样困难:为高效多轮推理的自适应思维预算

Neharika Jali, Anupam Nayak, Gauri Joshi

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TAB方法,通过自适应预算分配提升多轮推理效率,在数学推理基准中实现更高的准确率与token节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06465 2026-08-11 cs.CL cs.AI 版本更新 81%

Multi-objective Evolutionary Merging Enables Efficient Reasoning Models

多目标进化融合实现高效推理模型

Mario Iacobelli, Adrian Robert Minut, Tommaso Mencattini, Donato Crisostomi, Andrea Santilli, Iacopo Masi, Emanuele Rodolà

机构 * Sapienza University of Rome(罗马大学) Independent Researcher(独立研究员) EPFL(瑞士联邦理工学院洛桑) NVIDIA(英伟达)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Evo-L2S框架,通过多目标优化解决长到短推理问题,减少生成推理轨迹长度同时保持或提升推理准确性。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18587 2026-08-11 cs.LG cs.AI stat.ML 版本更新 81%

An Expectation-Maximization Perspective on Reinforcement Learning for LLM Reasoning

面向大语言模型推理的强化学习的期望最大化视角

Tianbing Xu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出EM策略梯度(EMPG)框架,将大语言模型推理的强化学习转化为期望最大化问题,在简化优化流程的同时,在GSM8K、MATH Hard数据集上取得与GRPO相当或更优的性能,且能生成更简洁的结构化推理轨迹。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08889 2026-08-11 cs.AI 新提交 79%

LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing

用于主观任务的大语言模型推理:失败模式、缓解措施与动态推理路由

Juncheng Dong, Ding Tong, Ishan Gupta, Yuyan Wang

机构 * Duke University(杜克大学) Netflix(网飞公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对主观任务中LLM推理的失败模式,提出带条件长度惩罚的后训练算法缓解推理崩溃,还发现推理风格不匹配是主观验证误差主因,给出算法补丁与架构蓝图。

Comments 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17593 2026-08-11 cs.CL 版本更新 79%

From Chains to DAGs: Probing the Graph Structure of Reasoning in LLMs

从链到DAG:探测语言模型推理中的图结构

Tianjun Zhong, Linyang He, Ziyang Li, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨语言模型内部推理是否以有向无环图形式存在,通过设计探针验证DAG结构在各层的出现,并发现中间层具有最强的结构恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18077 2026-08-11 cs.CL 版本更新 79%

Sparks of Cooperative Reasoning: LLMs as Strategic Hanabi Agents

合作推理的火花:LLMs作为战略汉诺塔代理

Mahesh Ramesh, Kaousheik Jayakumar, Aswinkumar Ramkumar, Pavan Thodima, Aniket Rege, Emmanouil-Vasileios Vlatakis-Gkaragkounis

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了在不完全信息下多智能体系统的合作推理挑战,通过汉诺塔游戏评估不同LLM模型在策略沟通和状态跟踪中的表现,展示了模型在协作游戏中的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05940 2026-08-11 cs.CL 版本更新 79%

R3S: Refining and Recovering Reinforcement Signals for Multilingual Understanding and Reasoning

通过翻译-推理联合训练实现自我改进的多语言长推理

Junxiao Liu, Zhijun Wang, Yixiao Li, Zhejian Lai, Liqian Huang, Xin Huang, Xue Han, Junlan Feng, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) University of Tübingen(图宾根大学) China Mobile Communications Company Limited Research Institute(中国移动通信集团有限公司研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TRIT通过整合翻译训练提升多语言长推理能力,在MMATH上超越基线7个百分点,提升答案正确性和语言一致性。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19990 2026-08-11 cs.LG 版本更新 79%

Rethinking Reasoning with MDLMs: Early Exits, Post-hoc Reasoning, and Beyond

重新思考MDLM的推理:早期退出、事后推理及其他

Zachary Horvitz, Raghav Singhal, Hao Zou, Carles Domingo-Enrich, Zhou Yu, Rajesh Ranganath, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学) Department of Computer Science, New York University(纽约大学计算机科学系) Microsoft Research(微软研究院) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出“推理即填充”技术,基于掩码扩散语言模型(MDLMs)实现早期退出、事后推理等能力,在GSM8k数据集上微调LLaDA-8B-Base提升准确率14.9%,证明MDLM训练目标对推理有显著优势。

Comments COLM 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07742 2026-08-11 cs.CV 新提交 78%

BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试

Saim Rehman, Muhammad Shafique

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 数学推理 :reasoning(title,abstract)

AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09351 2026-08-11 cs.LG cs.AI stat.ML 新提交 74%

Test-Time Augmentation for LLMs: When Input Diversity Beats Output Diversity at Matched Compute

大语言模型的测试时增强:在计算资源匹配时输入多样性优于输出多样性

Nikita Kozodoi, Zainab Afolabi, Jack Butler

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 数学推理 :reasoning(abstract,comments);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出测试时增强(TTA),经匹配计算对比发现,中端大语言模型采用语义复述的TTA策略,比自洽性更高效地将计算转化为准确率,每美元准确率约为自洽性的1.8倍。

Comments Published at the COLM 2026 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20244 2026-08-11 cs.CL cs.AI 版本更新 73%

Hybrid Policy Distillation for LLMs

混合策略蒸馏用于大语言模型

Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu

机构 * Department of Computer Science(计算机科学系) Engineering, Shanghai Jiao Tong University(上海交通大学工程学院) Shanghai Innovation Institute(上海创新研究院) Large Language Department, Tencent(腾讯大语言部门)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出混合策略蒸馏方法,结合正反KL散度优势,提升模型生成能力和效率,验证了其在多种任务中的有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08964 2026-08-11 cs.LG 新提交 70%

Math-Vision Diagrams: A Comprehensive Benchmark for Evaluating LLM Mathematical Diagram Generation Capabilities

数学视觉图表:评估大型语言模型数学图表生成能力的综合基准

Harish Kashyap, Kiran Byadarhaly, Sriram Chakaravarthy, Sanyukta Tuti, Aryan Mistry

机构 * Pandita AI Inc.(潘迪塔人工智能公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本研究推出首个专门评估LLMs数学图表生成能力的基准Math-Vision Diagrams,涵盖文本到代码与图像范式,测试发现LLMs在该任务上存在困难,相关资源将开源。

Comments Accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09805 2026-08-11 cs.LG cs.AI cs.CL 新提交 67%

Parameter Exploration for RLVR via Variational Learning

基于变分学习的RLVR参数探索

Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych

机构 * INSAIT, Sofia University “St. Kliment Ohridski”(INSAIT,圣克莱门特奥赫里德斯基索非亚大学) National Research Center for Applied Cybersecurity ATHENE(ATHENE国家应用网络安全研究中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对LLM强化学习的探索问题,提出参数空间探索思路,引入3PO方法,在OLMo-3-1025-7B等模型的数学推理等任务上,以相近计算成本相比GRPO提升性能,减少训练中的异常分组与轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07528 2026-08-11 cs.AI cs.CL cs.LG 新提交 67%

The Knowing-Saying Gap: When Probes See Errors that Confidence Misses

知-言差距:当探测模型发现错误而置信度未察觉时

Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现线性探测模型能精准检测语言模型的上下文破坏,但无法可靠预测最终答案正确性,推翻了相关假设,表明基于探测模型的监控需结合模型与错误类型的路由策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01952 2026-08-11 cs.CL cs.AI cs.LG 版本更新 67%

WebChoreArena: Evaluating Web Browsing Agents on Realistic Tedious Web Tasks

WebChoreArena:在现实繁琐网页任务上评估网页浏览智能体

Atsuyuki Miyai, Zaiying Zhao, Kazuki Egashira, Atsuki Sato, Tatsumi Sunada, Shota Onohara, Hiromasa Yamanishi, Mashiro Toyooka, Kunato Nishina, Ryoma Maeda, Kiyoharu Aizawa, Toshihiko Yamasaki

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出WebChoreArena,作为WebArena的扩展,包含532个耗时300多小时开发的繁琐网页任务,从大规模记忆、计算、长期记忆三维度评估网页浏览智能体,实验显示其能清晰衡量LLM进展且难度高于WebArena。

Comments COLM2026. Project Page: https://webchorearena.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09893 2026-08-11 cs.CL cs.AI 新提交 62%

Fusion Training for Mathematical Generalization in Large Language Models

大型语言模型中数学泛化的融合训练

Congfeng Cao, Pengyu Zhang, Jelke Bloem

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对思维模式融合(TMF)训练动态开展系统性研究,揭示两种模式间的非对称相互作用与负相关关系,为设计TMF训练设置提供指导。

Comments ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09836 2026-08-11 cs.AI cs.CL 新提交 62%

Mismatch Matters: On-Policy Distillation Beyond Token Agreement

失配很重要:超越token一致性的在线蒸馏

Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对在线蒸馏存在的退化一致性失效问题,提出TIDE方法修正师生失配,在数学推理基准上显著提升性能、缩短响应长度并减少格式错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09745 2026-08-11 cs.LG cs.AI stat.ML 新提交 62%

SR-OPSD: Self-Referenced On-Policy Self-Distillation

SR-OPSD:自引用同策略自蒸馏

Zhuo Sun, Entong Li, Yanlong Zhao, Xiaoyuan Cheng, Wenxuan Yuan, Kaiyu Li, Che Liu, Huihang Liu, Harrison Bo Hua Zhu, Li Zeng

机构 * Shanghai University of Finance and Economics(上海财经大学) Imperial College London(伦敦帝国学院) University of Science and Technology of China(中国科学技术大学) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对同策略自蒸馏的优化不稳定问题,提出SR-OPSD方法,通过几何插值结合Rényi散度优化蒸馏目标,在多任务大语言模型实验中取得最优或竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08726 2026-08-11 cs.LG cs.AI 新提交 62%

PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation

PAST:基于完整学生轨迹的特权适配用于在线策略自蒸馏

Yangyang Feng, Zhuoyan Feng, Junlan Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PAST将完整学生轨迹作为OPSD教师的额外特权信息,通过前向KL蒸馏等方法优化教师,在三个数学推理基准上使Avg@12宏观平均值较Vanilla OPSD提升5.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11505 2026-08-11 cs.LG cs.AI 版本更新 62%

Proxy OPD: On-Policy Distillation with Transferable Relative Proxy Update

代理探索与可重用引导:基于代理引导更新信号的模块化大语言模型训练后范式

Daocheng Fu, Rong Wu, Yu Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Xuemeng Yang, Yong Liu, Botian Shi, Yu Qiao

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型训练后优化信号耦合问题,提出PUST框架,通过代理模型探索、提取并传输相对改进信号,解耦更新信号探索与分布对齐,减少计算开销,支持异步处理与跨模型转移,提升训练后范式的模块化、可重用性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22510 2026-08-11 cs.LG cs.AI 版本更新 62%

Shattered Compositionality: Counterintuitive Learning Dynamics of Transformers for Arithmetic

破碎的组合性:变换器在算术中的反直觉学习动态

Xingyu Zhao, Darsh Sharma, Rheeya Uppaal, Yiqiao Zhong

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现变换器在学习算术任务时表现出反直觉的组合性,其学习动态受训练数据相关性影响而非因果或程序性组合。

Comments 37 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09332 2026-08-11 cs.LG 新提交 57%

Hallucinations and Constraints : Regulating surgical workflow recognition beyond accuracy

幻觉与约束:超越准确率的手术工作流程识别调控

John S. H. Baxter, Pierre Jannin

机构 * Université de Rennes(雷恩大学) Inserm(法国国家健康与医学研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究针对医学图像处理中AI的幻觉问题,提出用线性时序逻辑谓词结合概率图模型调控,在机器人辅助子宫切除术阶段识别中准确率提约10%且消除多数拓扑错误。

Comments 11 pages, 1 figure, 1 table, accepted to the MICCAI 2026 Workshop on Fairness, Regulation, and Ethics (FAIMI-BRIDGE-EPIMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09119 2026-08-11 cs.AI 新提交 57%

Motif 3: Technical Report

Motif 3:技术报告

Junghwan Lim, Joon Son Chung, Sungmin Lee, Wai Ting Cheung, Gihun Cho, Minsu Ha, Sangho Kang, Beomgyu Kim, Dongseok Kim, Jangwoong Kim, Taehyun Kim, Taewhan Kim, Jeesoo Lee, Jeongdoo Lee, Junhyeok Lee, Dongpin Oh, Hyeyeon Cho, Dahye Choi, Jaeheui Her, Hanbin Jung, Changjin Kang, Minjae Kim, Youngrok Kim, Hyukjin Kweon, Hongjoo Lee, Yeongjae Park, Bokki Ryu

机构 * Motif Technologies(Motif科技公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究推出仅解码器的MoE语言模型Motif 3,采用GDLA等技术,经万亿token预训练及多阶段后训练,在长上下文、推理等任务上性能与领先开源模型相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08888 2026-08-11 cs.AI 新提交 57%

Full-bandwidth transformer

全带宽Transformer

Xi Wang, Ziyang Cai, Zheng Zhan, Harry Dong, Ying Fan, Gustavo de Rosa, Tim Pearce, John Langford

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) Princeton University(普林斯顿大学) Microsoft(微软公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出全带宽Transformer,通过潜在反馈拓宽解码步骤间的垂直反馈通道,经训练验证其在多项任务上性能提升,且解码开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06296 2026-08-11 cs.LG 版本更新 57%

On-Policy Self-Distillation without Any Supervision

无任何监督的在线策略自蒸馏

Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos

机构 * UC San Diego(加州大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) University of Maryland, College Park(马里兰大学帕克分校) ByteDance(字节跳动)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出无监督在线策略自蒸馏(U-OPSD),仅用模型自身生成结果实现在线策略自蒸馏,在多数学基准上优于基础模型,部分场景超越OPSD、GRPO等监督方法。

Comments Project page at https://williamium3000.github.io/u-opsd/ and code at https://github.com/williamium3000/u-opsd

详情

展开后加载摘要…

URL PDF HTML 收藏