arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2313 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 150 篇

2604.07822 2026-08-12 cs.CL cs.AI cs.LG 版本更新 82%

Loop, Think, & Generalize: Implicit Reasoning in Recurrent-Depth Transformers

循环、思考与泛化:递归深度变换器中的隐式推理

Harsh Kohli, Srinivasan Parthasarathy, Huan Sun, Yuekun Yao

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了隐式推理能力,探讨了递归深度变换器在系统泛化和深度扩展中的作用,发现其能有效提升多跳推理能力,但过度递归会导致泛化能力下降。

Comments 21 pages, 21 figures. Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06861 2026-08-07 cs.AI cs.CL cs.LG 版本更新 82%

Test-Time Scaling in Reasoning Models Is Not Effective for Knowledge-Intensive Tasks Yet

推理模型在知识密集型任务中的测试时间扩展效果有限

James Xu Zhao, Bryan Hooi, See-Kiong Ng

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现测试时间扩展在知识密集型任务中效果有限,主要因模型回答意愿和确认偏见导致幻觉增加,且无法提升真实答案的信息量。

Comments COLM 2026. 10+27 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22281 2026-06-17 cs.CV cs.AI cs.CL cs.LG cs.RO 版本更新 82%

ThinkJEPA: Empowering Latent World Models with Large Vision-Language Reasoning Model

ThinkJEPA:赋予潜在世界模型大型视觉-语言推理能力

Haichao Zhang, Yijiang Li, Shwai He, Tushar Nagarajan, Mingfei Chen, Jianglin Lu, Ang Li, Yun Fu

机构 * Northeastern University(东北大学) University of California San Diego(加州大学圣地亚哥分校) University of Maryland(马里兰大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Washington(华盛顿大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ThinkJEPA框架,结合密集JEPA分支与稀疏VLM思考者分支,通过分层金字塔表示提取模块,实现细粒度运动建模与长程语义引导,在手部操作轨迹预测任务上超越基线。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21214 2026-08-05 cs.CL cs.AI 版本更新 81%

Self-Guided Adaptive Safety Alignment: Synthesizing and Internalizing Guidelines in Reasoning Models

自引导防御:通过合成指南实现推理模型的自适应安全对齐

Yuhang Wang, Yanxu Zhu, Jiaming Zhang, Dongyuan Lu, Jitao Sang

机构 * Beijing Key Lab of Traffic Data Analysis and Mining(北京交通大数据分析与挖掘重点实验室) Beijing Jiaotong University(北京交通大学) School of Information Technology and Management(信息科技与管理学院) University of International Business and Economics(国际经济贸易大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SGASA框架,通过合成指南实现推理模型的自适应安全对齐,提升对抗性提示防御能力并减少对良性请求的拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23614 2026-08-03 cs.CR cs.AI cs.LG hep-th 版本更新 81%

DualityCert: Verifier-Gated Language-Model Repair of Broken Duality Claims in Quantum Field Theory

DualityCert:量子场论中对偶性声明修复的验证器门控语言模型

Xingyang Yu

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对量子场论中对偶性声明修复,提出DualityCert验证器。语言模型代理接收错误声明编辑至通过验证,在预注册基准测试中,验证器门控重试等策略在不同模型上有不同表现,各获胜策略都用低成本证书,还发布了相关内容。

Comments 17 pages, 2 figures, 9 tables. v2: added reference and note on concurrent related work. Code, benchmark, and all per-attempt records: https://github.com/xingyang-yu/QFTCert

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21787 2026-07-14 cs.CL cs.AI 版本更新 81%

PiCSAR: Probabilistic Confidence Selection And Ranking for Reasoning Chains

PiCSAR:基于推理链的概率置信度选择与排序

Joshua Ong Jun Leang, Zheng Zhao, Aryo Pradipta Gema, Sohee Yang, Wai-Chung Kwan, Xuanli He, Wenda Li, Pasquale Minervini, Eleonora Giunchiglia, Shay B. Cohen

机构 * Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 PiCSAR通过联合对数似然度评估推理链和最终答案的置信度,无需训练即可提升大语言模型和推理模型的准确性,在多个基准测试中表现优异。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07532 2026-06-23 cs.LG cs.AI 版本更新 81%

Neural Concept Verifier: Scaling Prover-Verifier Games via Concept Encodings

神经概念验证器:通过概念编码扩展证明者-验证者博弈

Berkant Turan, Suhrab Asadulla, David Steinmann, Kristian Kersting, Wolfgang Stammer, Sebastian Pokutta

机构 * Zuse Institute Berlin, Germany AI \& ML Lab, Computer Science Department, TU Darmstadt Hessian Center for AI (hessian.AI) Lab1141 German Research Center for AI (DFKI) Institute of Mathematics, Technische Universit\"at Berlin, Germany Max Planck Institute for Informatics, SIC

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 提出神经概念验证器(NCV)框架,结合概念编码与证明者-验证者博弈,实现高维输入的可验证分类,优于传统方法并缓解捷径行为。

Comments 28 pages, 5 figures, 12 tables, revised references. An earlier version of this work was presented at the ICML 2025 Workshop on Actionable Interpretability

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17892 2026-06-15 cs.LG cs.AI 版本更新 81%

LEPO: Latent Reasoning Policy Optimization for Large Language Models

LEPO:面向大语言模型的潜在推理策略优化

Yuyan Zhou, Jiarui Yu, Hande Dong, Zhezheng Hao, Hong Wang, Jianqing Zhang, Qiang Lin

机构 * Tencent(腾讯) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 LEPO通过引入Gumbel-Softmax在大语言模型中实现可控的随机性,提升其探索能力与强化学习兼容性,通过直接在连续潜在表示上应用强化学习,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04671 2026-06-15 cs.CL cs.LG 版本更新 81%

Reward-SQL: Boosting Text-to-SQL via Stepwise Execution-Aware Reasoning and Process-Supervised Rewards

Reward-SQL:通过逐步执行感知推理和过程监督奖励提升Text-to-SQL

Yuxin Zhang, Meihao Fan, Ju Fan, Mingyang Yi, Yuyu Luo, Guoliang Li, Bin Wu, Wenchao Zhou

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Alibaba Cloud Computing(阿里云 computing)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 针对强化学习在Text-to-SQL中缺乏逐步执行感知推理和过程级奖励的问题,提出CoCTE框架和Reward-SQL方法,通过中间视图验证、结构化CTE及过程奖励模型,显著提升复杂查询的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03292 2026-06-09 cs.CL cs.AI cs.IR 版本更新 81%

From Conflict to Consensus: Boosting Medical Reasoning via Multi-Round Agentic RAG

从冲突到共识:通过多轮代理RAG提升医疗推理

Wenhao Wu, Zhentao Tang, Yafu Li, Shixiong Kai, Mingxuan Yuan, Zhenhong Sun, Chunlin Chen, Zhi Wang

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MA-RAG框架,通过多轮代理循环迭代优化外部证据和内部推理历史,提升医疗复杂推理能力,实验显示在7个医疗问答基准上表现优于现有方法。

Comments 27 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12700 2026-08-19 cs.LG cs.AR cs.DC 版本更新 79%

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法

Rishi Shah, Rishav Shrestha

机构 * E3A Healthcare(E3A医疗公司)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。

Comments 20 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12399 2026-08-18 cs.LG stat.ML 版本更新 79%

ROC-n-reroll: How verifier imperfection affects test-time scaling

ROC-n-reroll:验证器缺陷对测试时缩放的影响

Florian E. Dorner, Yatong Chen, André F. Cruz, Fanny Yang

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck ETH Center for Learning Systems(马克斯·普朗克ETH学习系统中心) Max Planck Institute for Intelligent Systems, Tübingen(图宾根马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.LG

AI总结 本工作针对测试时缩放中验证器缺陷的理论空白,证明相关方法的实例级精度由验证器ROC曲线几何刻画,经Qwen、LLaMA模型在指定数据集上验证,得出RS与BoN在不同计算条件下的性能规律。

Comments 47 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17188 2026-08-12 cs.AI 版本更新 79%

UPAIR: Diagnosing Reasoning States via Uncertainty-Progress Alignment for Selective Intervention

你的模型是在思考还是停滞不前?PUMA:通过相位动量对齐诊断推理病理学

Cheng Yan, Zhijun Fan, Guangyang Ye, Fan Xu, Xiang Xia, Yawei Wang, Wuyang Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究大型推理模型测试时的“过度思考”问题,提出相位动量对齐假设并构建认知能量模型,引入PUMA框架,通过分层诊断架构区分主动探索与被动停滞,在多基准实验中优于现有基线,实现更好的准确性-效率权衡和跨域泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19341 2026-07-21 cs.CV cs.CL cs.SD 版本更新 79%

Native Active Perception as Reasoning for Omni-Modal Understanding

原生主动感知作为全模态理解的推理

Zhenghao Xing, Ruiyang Xu, Yuxuan Wang, Jinzheng He, Ziyang Ma, Qize Yang, Yunfei Chu, Jin Xu, Junyang Lin, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出OmniAgent,一种基于POMDP迭代观察-思考-行动循环的原生全模态智能体,通过主动感知将推理复杂度与视频时长解耦,在多个基准上达到开源模型最优性能。

Comments Accepted at ICML 2026. Code and models: https://github.com/harryhsing/omniagent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00726 2026-07-13 cs.AI 版本更新 79%

Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs

潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为

Jiakang Li, Guanyu Zhu, Can Jin, Chenxi Huang, Dexu Yu, Ronghao Chen, Yang Zhou, Hongwu Peng, Xuanqi Lan, Dimitris N. Metaxas, Youhua Li

机构 * Rutgers University(罗格斯大学) South China Agricultural University(华南农业大学) Columbia University(哥伦比亚大学) Fenz.AI QuantaAlpha Adobe Santa Clara University(圣克拉拉大学) City University of Hong Kong(香港城市大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出潜在奖励引导(LRS)框架,通过优化稀疏自编码器潜在状态隐式促进认知行为,利用最终答案正确性训练潜在奖励模型估计中间状态质量,并在推理时提供状态特定的修正方向,实验表明该方法能提升推理性能并修复原始推理错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23440 2026-07-10 cs.CL cs.IR 版本更新 79%

Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning

截断步骤级采样与过程奖励用于检索增强推理

Chris Samarinas, Haw-Shiuan Chang, Hamed Zamani

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出SLATE方法,通过截断步骤级采样和密集过程奖励解决检索增强推理中的信用分配问题,实验表明其在多跳任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08187 2026-07-01 cs.AI 版本更新 79%

Improving LLM Reasoning with Homophily-aware Structural and Semantic Text-Attributed Graph Compression

利用同质性感知的结构和语义文本属性图压缩提升LLM推理能力

Zijun Di, Bin Lu, Huquan Kang, Luoyi Fu, Jiaxin Ding, Xiaoying Gan, Lei Zhou, Xinbing Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出HS2C框架,通过结构熵最小化进行全局层次划分以识别同质社区,并利用检测到的结构同质性指导LLM进行差异化语义聚合,在10个节点级和7个图级基准上同时提升压缩率和推理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07774 2026-06-24 cs.IR cs.AI 版本更新 79%

GR2: Generative Reasoning Re-ranker

生成式推理重排序器

Mingfu Liang, Yufei Li, Jay Xu, Kavosh Asadi, Xi Liu, Shuo Gu, Kaushik Rangadurai, Frank Shyu, Shuaiwen Wang, Song Yang, Zhijing Li, Jiang Liu, Mengying Sun, Fei Tian, Xiaohan Wei, Chonglin Sun, Jacob Tao, Shike Mei, Wenlin Chen, Santanu Kolay, Sandeep Pandey, Hamed Firooz, Luke Simon

机构 * Meta AI

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 提出GR2框架,利用大语言模型的推理能力进行推荐重排序,通过语义ID编码、推理轨迹监督微调和强化学习优化,在Recall@5和NDCG@5上超越现有方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04579 2026-06-23 cs.AI 版本更新 79%

SCI-PRM: A Tool Aware Process Reward Model for Scientific Reasoning Verification

SCI-PRM:用于科学推理验证的工具感知过程奖励模型

Xiangyu Zhao, Henry Hengyuan Zhao, Yiheng Wang, Wanghan Xu, Yuhao Zhou, Qinglong Cao, Zhiwang Zhou, Lei Bai, Wenlong Zhang, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Tongji University(同济大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 针对科学推理中工具使用和事实一致性问题,提出Sci-PRM模型,通过构建包含工具链轨迹的数据集SCIPRM70K并训练过程奖励模型,在测试时扩展和强化学习中提供细粒度监督,提升基础模型性能。

Comments Accepted by KDD 2026 AI4Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23248 2026-06-19 cs.AI 版本更新 79%

Mitigating Legibility Tax with Decoupled Prover-Verifier Games

通过解耦证明者-验证者游戏减轻可读性代价

Yegon Kim, Juho Lee

机构 * KAIST(韩国科学技术院)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI

AI总结 提出解耦证明者-验证者游戏(DPVG),通过分离正确性与可检查性训练一个翻译器模型,将固定求解器的解转化为可检查形式,在保持答案正确性的同时提高可检查性,解决了可读性代价问题。

Comments ICLR 2026 Workshop Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02240 2026-06-10 cs.CL 版本更新 79%

Lightweight Latent Reasoning for Narrative Tasks

面向叙事任务的轻量级潜在推理

Alexander Gurung, Esmeralda S. Whitammer, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) CIFAR Fellow

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出LiteReason方法,通过轻量级推理投影器生成连续潜在令牌,在强化学习中动态切换潜在与离散推理,将推理长度减少77-92%,同时保持接近非潜在RL的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03092 2026-06-09 cs.AI 版本更新 79%

The Shadow Price of Reasoning: Economic Perspective on Optimal Budget Allocation for LLMs

推理的影子价格:LLM最优预算分配的经济学视角

Xu Wan, Speed Zhu, Jianwei Cai, Guang Chen, XiMing Huang, Wiggin Zhou, Mingyang Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 本文从经济学视角将推理预算分配建模为全局约束优化问题,提出基于影子价格的CLEAR方法,通过理性放弃和资源再分配,在资源稀缺下显著提升总token成本与平均准确率的帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08010 2026-07-15 cs.CV 版本更新 78%

CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

CASHEW: 通过迭代轨迹聚合稳定多模态推理

Chaoyu Li, Fei Tao, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学) NewsBreak

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 提出CASHEW框架,通过迭代聚合多候选推理轨迹并利用视觉验证过滤幻觉步骤,以及其强化学习变体CASHEW-RL,显著提升多模态推理的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23231 2026-07-14 cs.CV 版本更新 78%

Unlocking Multilingual Reasoning Capability of LLMs and LVLMs through Representation Engineering

通过表示工程解锁大语言模型和大视觉语言模型的多语言推理能力

Qiming Li, Xiaocheng Feng, Yixuan Ma, Zekai Ye, Ruihan Chen, Xiachong Feng, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 研究针对LLMs和LVLMs在多语言推理中英语表现优于低资源语言的问题,提出无训练的推理时方法MRRE,通过在特定层注入两个预计算向量增强多语言推理能力,实验证明该方法有效提升非英语推理及输入输出语言一致性。

Comments ACL2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02918 2026-07-10 cs.CV 版本更新 78%

Zoom-IQA: Image Quality Assessment with Reliable Region-Aware Reasoning

Zoom-IQA:基于可靠区域感知推理的图像质量评估

Guoqiang Liang, Jianyi Wang, Zhonghua Wu, Shangchen Zhou, Chen Change Loy

机构 * S-Lab, Nanyang Technological University, Singapore(S实验室,南洋理工大学,新加坡) SenseTime Research(商汤科技研究院)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 研究图像质量评估问题,提出基于视觉语言模型的Zoom-IQA,通过两阶段训练管道,包括监督微调与强化学习,有效减轻标注偏差,提升了模型在鲁棒性、可解释性和泛化性方面的表现,在下游任务中也展现出有效性。

Comments ECCV 2026, Project Page: https://ethanliang99.github.io/ZOOMIQA-Projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11500 2026-07-07 cs.CR 版本更新 78%

ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning

ARMOR:通过精细推理对齐安全的大语言模型

Zhengyue Zhao, Yingzi Ma, Somesh Jha, Marco Pavone, Patrick McDaniel, Chaowei Xiao

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 研究大语言模型安全问题,针对现有方法不足,提出ARMOR,通过三步推理管道提取核心恶意意图并验证,开发ARMOR-Think提升性能,在防御越狱攻击上效果显著。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05256 2026-07-03 cs.CV 版本更新 78%

Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA

Shan Ning, Longtian Qiu, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心) Lingang Laboratory(临港实验室)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 提出Wiki-R1框架,通过可控课程数据生成和课程采样策略,结合强化学习激励MLLMs在KB-VQA中的推理能力,在Encyclopedic VQA和InfoSeek上取得新SOTA。

Comments Accepted by ICLR 26, code and weights are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25702 2026-06-19 cs.CL 版本更新 77%

S2D2: Fast Decoding for Diffusion LLMs via Training-Free Self-Speculation

S2D2:通过免训练自我推测实现扩散LLM的快速解码

Ligong Han, Hao Wang, Han Gao, Kai Xu, Akash Srivastava

机构 * Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Iowa State University(爱荷华州立大学) Core AI, IBM(IBM核心AI)

专题命中 测试时计算 :test-time compute(abstract);verifier(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出S2D2,一种免训练的自我推测解码框架,通过将块扩散模型在块大小为1时变为自回归模型,实现草稿与验证角色复用,在不增加训练或测试计算下提升解码速度与准确性。

Comments Code is available at https://github.com/phymhan/S2D2

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11403 2026-08-18 cs.AI cs.CL cs.LG 版本更新 76%

When Self-Consistency Backfires: Majority Vote Hurts the Majority of Hard Science Problems for Small LLMs

当自我一致性适得其反:对于小型大型语言模型,多数投票会损害大多数硬科学问题

Utkarsh Bahuguna

机构 * Scaler School of Technology(斯凯勒科技学院)

专题命中 测试时计算 :reasoning(abstract,comments);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现,多数投票的自我一致性方法会损害小型指令微调模型在多数硬科学问题上的准确率,其核心机制是置信度与正确性不匹配,且无验证器门控方法可提升该问题下的准确率。

Comments 19 pages, 5 figures, 4 tables. v1 accepted at the COLM 2026 Workshop on Efficient Reasoning; v2 additions are not peer reviewed. v2 revises rather than extends: Section 4.4's mechanism claim is replaced and one Discussion sentence withdrawn. All v1 results, tables and pre-registered verdicts are unchanged. Adds the answer-token margin result, a serverless reasoning wall, and ten disclosures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24937 2026-07-28 cs.AI cs.CL cs.IR cs.LG 版本更新 75%

The Hitchhiker's Guide to Agentic AI: From Foundations to Systems

《智能体AI的搭车指南:从基础到系统》

Haggai Roitman

机构 * Haggai Roitman

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。

Comments version 1.3

详情

展开后加载摘要…

URL PDF HTML 收藏