arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1990 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1990 篇

2511.14275 2026-04-02 cs.CL 70%

Let the Model Distribute Its Doubt: Confidence Estimation through Verbalized Probability Distribution

让模型分配其怀疑:通过 verbalized 概率分布进行置信度估计

Ante Wang, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过生成 verbalized 概率分布提升置信度估计,系统实验显示其在多个 LLM 和任务中表现优异,推理效率高且计算节省显著,但也揭示了特定任务的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22784 2026-03-25 cs.LG 70%

Caterpillar of Thoughts: The Optimal Test-Time Algorithm for Large Language Models

思维 caterpillar:大型语言模型的最优测试时间算法

Amir Azarmehr, Soheil Behnezhad, Alma Ghafari

机构 * Northeastern University(东北大学)

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出Caterpillar of Thoughts算法,通过理论分析证明最优算法生成caterpillar树,从而减少生成次数并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09677 2026-03-16 cs.AI 70%

The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs

持续扩展的幻觉回报:衡量LLM的长周期执行

Akshit Sinha, Arvindh Arun, Shashwat Goel, Steffen Staab, Jonas Geiping

机构 * University of Cambridge(剑桥大学) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) University of Southampton(南安普顿大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文通过分析LLM在长周期任务中的执行能力,揭示了持续扩展LLM并非必然导致回报递减,而是执行能力的提升能显著改善长周期任务表现。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12724 2026-03-16 cs.LG 70%

SciDesignBench: Benchmarking and Improving Language Models for Scientific Inverse Design

SciDesignBench: 科学逆向设计的语言模型基准测试与改进

David van Dijk, Ivan Vrkic

机构 * CellType Inc.(CellType公司)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.LG

AI总结 本文提出SciDesignBench,通过520个模拟器支撑任务评估语言模型在科学逆向设计中的表现,发现模拟反馈对不同设计周期有不同影响,并引入RLSF训练方法提升模型性能。

Comments 35 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23863 2026-03-16 cs.CL 70%

SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models

SPELL: 自我扮演强化学习用于进化长上下文语言模型

Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出SPELL框架,通过自我扮演问答和验证角色实现长上下文推理的无监督优化,实验显示其在多个基准上优于传统微调方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 70%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15156 2026-02-18 cs.AI 70%

Panini: Continual Learning in Token Space via Structured Memory

Panini:通过结构化记忆在令牌空间中实现持续学习

Shreyas Rajesh, Pavan Holur, Mehmet Yigit Turali, Chenda Duan, Vwani Roychowdhury

机构 * ucla(加州大学洛杉矶分校)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 Panini通过结构化记忆在令牌空间中实现持续学习,提升推理效率和准确性。

Comments 35 pages, code available at: https://github.com/roychowdhuryresearch/gsw-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14910 2026-02-17 cs.AI 70%

Position: Introspective Experience from Conversational Environments as a Path to Better Learning

位置:对话环境中的反思经验作为更好学习的路径

Claudiu Cristian Musat, Jackson Tolins, Diego Antognini, Jingling Li, Martin Klissarov, Tom Duerig

机构 * Google DeepMind(谷歌DeepMind)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 本文提出通过对话环境中的反思经验提升学习效果,强调社会互动对推理能力的培养作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09555 2026-02-12 cs.CL 70%

Advancing Block Diffusion Language Models for Test-Time Scaling

推进块扩散语言模型用于测试时间扩展

Yi Lu, Deyang Kong, Jianing Wang, Linsen Guo, Xue Wang, Qi Guo, Tao Gui, Xuanjing Huang, Wei Ye, Shikun Zhang, Wei Wang

机构 * Fudan University(复旦大学) Peking University(北京大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出BACD和TCCF方法,提升块扩散语言模型在测试时间扩展中的推理效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09501 2026-02-11 cs.CL 70%

Where-to-Unmask: Ground-Truth-Guided Unmasking Order Learning for Masked Diffusion Language Models

Where-to-Unmask: 基于真实情况引导的去掩码顺序学习用于掩码扩散语言模型

Hikaru Asano, Tadashi Kozuno, Kuniaki Saito, Yukino Baba

机构 * The University of Tokyo, Tokyo, Japan(东京大学)

专题命中 测试时计算 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 本文提出Gt-Margin方法,通过真实标记计算去掩码顺序,提升MDLM在逻辑推理任务中的生成质量。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09438 2026-02-11 cs.CL 70%

Breaking the Pre-Sampling Barrier: Activation-Informed Difficulty-Aware Self-Consistency

突破预采样障碍:基于激活的难度感知自一致性

Taewoong Yoon, Geunyeong Jeong, Geon Park, Sihyeong Yeom, Harksoo Kim

机构 * Konkuk University(韩国康克大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 ACTSC通过利用神经元激活信号构建轻量级难度估计探针,无需额外调用或预采样,有效降低推理成本并保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00380 2026-02-10 cs.CL 70%

Clause-Internal or Clause-External? Testing Turkish Reflexive Binding in Adapted versus Chain of Thought Large Language Models

内部短语还是外部短语?测试土耳其反身代词在适应型与思维链大型语言模型中的绑定

Sercan Karakaş

机构 * University of Chicago(芝加哥大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究通过对比两种大型语言模型,探讨土耳其反身代词在不同模型中的绑定行为差异,揭示模型架构和训练数据对指代依赖表示的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05570 2026-02-06 cs.AI 70%

TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space?

TangramSR: 视觉-语言模型能否在连续几何空间中推理?

Yikun Zong, Cheston Tan

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 TangramSR通过测试时自我改进框架,结合上下文学习和奖励循环,提升视觉-语言模型在连续几何空间中的推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20312 2026-02-03 cs.CL 70%

SAPO: Self-Adaptive Process Optimization Makes Small Reasoners Stronger

SAPO:自适应过程优化使小型推理器更强

Kaiyuan Chen, Guangmin Zheng, Jin Wang, Xiaobing Zhou, Xuejie Zhang

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 SAPO通过自适应过程优化方法,有效缩小推理器与验证器之间的差距,提升小型语言模型在数学和代码任务中的性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20659 2026-01-29 cs.CL cs.MA 70%

A Dialectic Pipeline for Improving LLM Robustness

辩证管道用于提升大语言模型鲁棒性

Sara Candussio

机构 * Università degli Studi di Trieste(特里埃斯特大学)

专题命中 测试时计算 :chain-of-thought(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出一种辩证管道,通过自我对话提升大语言模型的鲁棒性,有效减少幻觉并提高输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15816 2026-01-23 eess.SY cs.AI cs.SY 70%

Virtual Traffic Police: Large Language Model-Augmented Traffic Signal Control for Unforeseen Incidents

虚拟交通警察:基于大语言模型的交通信号控制用于突发事件

Shiqi Wei, Qiqing Wang, Kaidi Yang

机构 * Department of Civil and Environmental Engineering, National University of Singapore(环境与土木工程系,新加坡国立大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的交通信号控制框架,通过虚拟交通警察代理实时调整信号控制器参数,提升应对突发事件的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12748 2026-01-21 cs.CL 70%

Towards Robust Process Reward Modeling via Noise-aware Learning

通过噪声感知学习实现鲁棒的过程奖励建模

Bin Xie, Bingbing Xu, Xueyun Tian, Yilin Chen, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院)

专题命中 测试时计算 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出噪声感知迭代训练框架,通过两阶段方法缓解噪声监督问题,提升过程奖励模型的步骤正确性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25014 2026-01-01 cs.LG cs.CC 70%

Diffusion Language Models are Provably Optimal Parallel Samplers

扩散语言模型是可证明最优的并行采样器

Haozhe Jiang, Nika Haghtalab, Lijie Chen

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文证明了通过链式思维和修订,扩散语言模型能够以最优步骤和空间复杂度模拟并行采样算法,从而提升其作为高效并行采样器的理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12042 2025-12-16 cs.CL 70%

Benchmarking Contextual Understanding for In-Car Conversational Systems

车载对话系统上下文理解评估

Philipp Habicht, Lev Sorokin, Abdullah Saydemir, Ken E. Friedl, Andrea Stocco

机构 * Humboldt University of Berlin(柏林洪堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过LLM和提示技术评估车载对话系统上下文理解,发现非推理模型在成本效率上表现最佳,DeepSeek-R1达到高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23436 2025-12-01 cs.AI 70%

Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent

迈向持续智能增长:在SuperIntelliAgent中实现自我训练、持续学习和双尺度记忆

Jianzhe Lin, Zeyu Pan, Yun Zhu, Ruiqi Song, Jining Yang

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 SuperIntelliAgent通过自我训练和双尺度记忆实现持续智能增长,利用可训练学习者与推理验证者配对,提升偏好对齐和学习效果。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22775 2025-10-28 cs.CL cs.SE 70%

Scalable Supervising Software Agents with Patch Reasoner

Junjielong Xu, Boyin Tan, Xiaoyuan Liu, Chao Peng, Pengfei Gao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10264 2025-10-14 cs.CV cs.AI 70%

MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs

Haonan Ge, Yiwei Wang, Ming-Hsuan Yang, Yujun Cai

机构 * Department of Computer Science and Engineering, University of California at Merced(计算机科学与工程系,加州大学默塞德分校)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03149 2025-10-06 cs.LG cs.DS 70%

Taming Imperfect Process Verifiers: A Sampling Perspective on Backtracking

Dhruv Rohatgi, Abhishek Shetty, Donya Saless, Yuchen Li, Ankur Moitra, Andrej Risteski, Dylan J. Foster

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01591 2025-10-03 cs.CL 70%

CLUE: Non-parametric Verification from Experience via Hidden-State Clustering

Zhenwen Liang, Ruosen Li, Yujun Zhou, Linfeng Song, Dian Yu, Xinya Du, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Notre Dame(诺丁汉大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22558 2025-10-03 cs.AI 70%

StepORLM: A Self-Evolving Framework With Generative Process Supervision For Operations Research Language Models

Chenyu Zhou, Tianyi Xu, Jianghao Lin, Dongdong Ge

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01245 2025-10-01 cs.AI cs.MA cs.OS 70%

Towards Agentic OS: An LLM Agent Framework for Linux Schedulers

Yusheng Zheng, Yanpeng Hu, Wei Zhang, Andi Quinn

机构 * UC Santa Cruz, CA, USA(加州大学圣克ruz分校) University of Connecticut(康涅狄格大学) ShanghaiTech University(上海科技大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

Journal ref MLforSystem 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23152 2025-09-30 cs.LG 70%

Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers

Zhicheng Yang, Zhijiang Guo, Yinya Huang, Yongxin Wang, Yiwei Wang, Xiaodan Liang, Jing Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) ETH AI Center, ETH Zurich(苏黎世联邦理工学院人工智能中心) University of California, Merced(加州大学默塞德分校) Sun Yat-sen University(中山大学) MBZUAI(穆罕默德·本·拉希德·阿勒马克图姆智能研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.LG

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06870 2025-09-09 cs.CL 70%

The Majority is not always right: RL training for solution aggregation

Wenting Zhao, Pranjal Aggarwal, Swarnadeep Saha, Asli Celikyilmaz, Jason Weston, Ilia Kulikov

机构 * FAIR at Meta(Meta旗下的FAIR)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13465 2025-08-20 cs.AI 70%

LM Agents May Fail to Act on Their Own Risk Knowledge

Yuzhi Tang, Tianxiao Li, Elizabeth Li, Chris J. Maddison, Honghua Dong, Yangjun Ruan

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11371 2025-07-16 cs.LG cs.MA 70%

Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs

Gabriel Bo, Koa Chang, Justin Gu

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏