arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-27 至 2026-03-27 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 7 篇

2512.08985 2026-03-27 cs.CV 85%

Verifier Threshold: An Efficient Test-Time Scaling Approach for Image Generation

验证阈值:一种高效的测试时间扩展方法用于图像生成

Vignesh Sundaresha, Akash Haridas, Vikram Appia, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD(超威半导体公司) Stony Brook University(石溪大学)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);test-time compute(abstract)

AI总结 本文提出Verifier-Threshold方法,通过自动重新分配测试时间计算,提升图像生成模型的效率,在GenEval基准上实现2-4倍的计算时间减少。

Comments ICLR 2026 ReALM-Gen and DeLTa

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24844 2026-03-27 cs.LG cs.AI cs.CL 82%

Reaching Beyond the Mode: RL for Distributional Reasoning in Language Models

超越模式:语言模型中的分布推理强化学习

Isha Puri, Mehul Damani, Idan Shenfeld, Marzyeh Ghassemi, Jacob Andreas, Yoon Kim

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多答案强化学习方法,使语言模型在推理时能生成多个可能的假设并评估其置信度,提升多样性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00141 2026-03-27 cs.CV cs.AI cs.LG eess.IV 79%

From Scale to Speed: Adaptive Test-Time Scaling for Image Editing

从尺度到速度:面向图像编辑的自适应测试时间缩放

Xiangyan Qu, Zhenlong Yuan, Jing Tang, Rui Chen, Datao Tang, Meng Yu, Lei Sun, Yancheng Bai, Xiangxiang Chu, Gaopeng Gou, Gang Xiong, Yujun Cai

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) AMAP, Alibaba Group(阿里巴巴集团高德地图) University of Queensland(昆士兰大学)

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ADE-CoT框架,通过动态资源分配、编辑特定验证和深度优先停止策略,提升图像编辑效率与性能,实验显示在同等采样预算下性能优于现有方法。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17501 2026-03-27 cs.LG cs.AI 73%

The Limits of Inference Scaling Through Resampling

通过重采样实现推理扩展的极限

Benedikt Stroebl, Sayash Kapoor, Arvind Narayanan

机构 * Princeton University(普林斯顿大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究指出,重采样方法在验证器不完美时存在根本限制,无法降低误报率,从而限制了推理扩展的准确性,无论计算资源如何。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25063 2026-03-27 cs.HC cs.AI cs.GR cs.LG 62%

TopoPilot: Reliable Conversational Workflow Automation for Topological Data Analysis and Visualization

TopoPilot:拓扑数据分析和可视化可靠对话工作流自动化

Nathaniel Gorski, Shusen Liu, Bei Wang

机构 * University of Utah(犹他大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 TopoPilot通过双代理架构和系统性防护机制,实现复杂科学可视化工作流的可靠自动化,其在1000次多轮对话中成功率达99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24840 2026-03-27 cs.CL 57%

Prune as You Generate: Online Rollout Pruning for Faster and Better RLVR

在生成过程中剪枝:用于更快更好RLVR的在线回滚剪枝

Haobo Xu, Sirui Chen, Ruizhong Qiu, Yuchen Yan, Chen Luo, Monica Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出arrol方法,通过在生成过程中剪枝回滚,提高RLVR的训练效率和准确性,实验显示在Qwen-3和LLaMA-3.2模型上平均准确率提升2.30至2.99,训练速度提升1.7倍,测试时扩展性提升8.33。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24676 2026-03-27 cs.AI cond-mat.dis-nn cond-mat.stat-mech physics.bio-ph physics.soc-ph 57%

When Is Collective Intelligence a Lottery? Multi-Agent Scaling Laws for Memetic Drift in LLMs

集体智慧何时是一场彩票?LLM中膜etic漂移的多智能体缩放定律

Hidenori Tanaka

机构 * CBS–NTT Program in Physics of Intelligence(物理智能中心-NTT项目) Center for Brain Science(脑科学中心) Harvard University(哈佛大学) Physics of Artificial Intelligence Group(人工智能物理研究组) NTT Research, Inc.(NTT研究公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究通过QSG模型揭示LLM多智能体系统中集体共识的形成机制,发现共识可能由膜etic漂移驱动,提出基于群体规模、通信带宽等因素的缩放定律。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏