arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-10 至 2026-03-10 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 15 篇

2603.07197 2026-03-10 cs.AI 87%

$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving

Re²:通过强化学习与重解解锁LLM推理

Pinzheng Wang, Shuli Xu, Juntao Li, Yu Luo, Dong Li, Jianye Hao, Min Zhang

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)

AI总结 Re²通过强化学习与重解方法,使LLM能够灵活放弃无效推理路径并重新开始,从而提升推理性能和测试效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21497 2026-03-10 cs.CV 85%

See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs

看见它,说出它,排序:一种无需训练的迭代框架用于LVLMs中的视觉引导多模态推理

Yongchang Zhang, Oliver Ma, Tianyi Liu, Guangquan Zhou, Yang Chen

机构 * Southeast University(东南大学) University of Oxford(牛津大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出无需训练的迭代框架,通过视觉证据监督推理步骤,减少多模态推理中的幻觉问题,提升推理准确性。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07159 2026-03-10 cs.AI 83%

Improving reasoning at inference time via uncertainty minimisation

通过不确定性最小化提升推理时间的推理能力

Nicolas Legrand, Kenneth Enevoldsen, Márton Kardos, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 通过在单个思想层面最大化自我确定性,提升推理能力并实现高效推理时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07725 2026-03-10 cs.IR 82%

Verifiable Reasoning for LLM-based Generative Recommendation

基于LLM的生成推荐的可验证推理

Xinyu Lin, Hanqing Zeng, Hanchao Yu, Yinglong Xia, Jiang Zhang, Aashu Singh, Fei Liu, Wenjie Wang, Fuli Feng, Tat-Seng Chua, Qifan Wang

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract)

AI总结 VRec通过引入推理-验证-推荐范式,提升LLM生成推荐的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 82%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract)

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07887 2026-03-10 cs.LG cs.AI cs.CL math.ST stat.ML stat.TH 78%

Reject, Resample, Repeat: Understanding Parallel Reasoning in Language Model Inference

拒绝、重采样、重复:理解语言模型推理中的并行推理

Noah Golowich, Fan Chen, Dhruv Rohatgi, Raghav Singhal, Carles Domingo-Enrich, Dylan J. Foster, Akshay Krishnamurthy

专题命中 测试时计算 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过粒子过滤算法研究语言模型推理中采样误差的理论与实践,揭示SMC方法的非渐近保证及采样误差的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08192 2026-03-10 cs.CV 78%

Route, Retrieve, Reflect, Repair: Self-Improving Agentic Framework for Visual Detection and Linguistic Reasoning in Medical Imaging

路由、检索、反思、修复:一种自改进的代理框架,用于医学影像中的视觉检测和语言推理

Md. Faiyaz Abdullah Sayeedi, Rashedur Rahman, Siam Tahsin Bhuiyan, Sefatul Wasi, Ashraful Islam, Saadia Binte Alam, AKM Mahbubur Rahman

机构 * 1 Center for Computational \& Data Sciences (CCDS), Independent University, Bangladesh (IUB)

专题命中 测试时计算 :reasoning(title,abstract)

AI总结 R^4框架通过路由、检索、反思和修复四个代理提升医学影像分析的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07223 2026-03-10 cs.LG 77%

Unlocking Data Value in Finance: A Study on Distillation and Difficulty-Aware Training

解锁金融数据价值:关于蒸馏和难度感知训练的研究

Chuxue Cao, Honglin Lin, Zhanping Zhong, Xin Gao, Mengzhang Cai, Conghui He, Sirui Han, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab, OpenDataArena(上海人工智能实验室、OpenDataLab、OpenDataArena) Hong Kong University of Science and Technology(香港科技大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出ODA-Fin-SFT-318k和ODA-Fin-RL-12k数据集,通过多阶段蒸馏和难度感知训练提升金融领域模型性能,实现高质量的链式思维监督和任务多样性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08398 2026-03-10 cs.CL cs.AI cs.LG 67%

Revealing Behavioral Plasticity in Large Language Models: A Token-Conditional Perspective

揭示大型语言模型中的行为可塑性:基于令牌条件的视角

Liyuan Mao, Le Yu, Jing Zhou, Chujie Zheng, Bowen Yu, Chang Gao, Shixuan Liu, An Yang, Weinan Zhang, JunYang Lin

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ToCoRL框架,通过令牌条件强化学习使LLM在推理时实现稳定的行为适应,从而实现精确的行为控制。

Comments Work done during an internship at the Qwen Team, Alibaba Group

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08412 2026-03-10 cs.CL cs.AI 62%

Aligning to Illusions: Choice Blindness in Human and AI Feedback

对幻觉的对齐:人类和AI反馈中的选择盲区

Wenbin Wu

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示RLHF中偏好构建的问题,显示人类和AI反馈中的选择盲区受上下文影响,导致奖励信号失真。

Comments 16 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06797 2026-03-10 cs.AI cs.LG 62%

Best-of-Tails: Bridging Optimism and Pessimism in Inference-Time Alignment

最佳尾部:在推理时间对齐中弥合乐观与悲观

Hsiang Hsu, Eric Lei, Chun-Fu Chen

机构 * JPMorganChase Global Technology Applied Research(摩根大通全球技术应用研究)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BoT框架,通过Tsallis分歧作为正则化器,在推理时间对齐中平衡乐观与悲观,提升对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06612 2026-03-10 cs.LG cs.AI 62%

Consensus is Not Verification: Why Crowd Wisdom Strategies Fail for LLM Truthfulness

共识并非验证:为何众智策略在LLM诚实性上失效

Yegor Denisov-Blanch, Joshua Kazdan, Jessica Chudnovsky, Rylan Schaeffer, Sheng Guan, Soji Adeshina, Sanmi Koyejo

机构 * stanford(斯坦福大学) amazon(亚马逊)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,扩展计算量无法提升LLM在无验证领域的诚实性,因模型错误高度相关,聚合方法反而放大误解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17908 2026-03-10 cs.CV cs.AI cs.LG 62%

ReDepth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting

ReDepth Anything: 通过自监督重照明进行测试时深度细化

Ananta R. Bhattarai, Helge Rhodin

机构 * Bielefeld University(比勒菲尔德大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ReDepth Anything通过自监督重照明技术,在测试时提升深度估计的准确性和真实感,优于现有方法并达到最新水平。

Comments Accepted at CVPR 2026 (Findings). Project Page: https://anantarb.github.io/redepth Code: https://github.com/anantarb/Re-Depth-Anything

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08251 2026-03-10 cs.CL 57%

Not All Queries Need Deep Thought: CoFiCot for Adaptive Coarse-to-fine Stateful Refinement

并非所有查询都需要深度思考:CoFiCot用于自适应粗到细状态细化

Dongxu Zhang, Hongqiang Lin, Yiding Sun, Pengyu Wang, Qirui Wang, Ning Yang, Jihua Zhu

机构 * Xi’an Jiaotong University(西安交通大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Institute of Automation CASIA(中国科学院自动化研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 CoFiCot通过自适应粗到细框架,利用多指标分类器和状态依赖传播过程,提升大语言模型在不同任务上的推理能力与上下文一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06621 2026-03-10 cs.LG 57%

Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models

奖励在攻击下:分析过程奖励模型的鲁棒性和可hack性

Rishabh Tiwari, Aditya Tomar, Udbhav Bamba, Monishwaran Maheswaran, Heng Yang, Michael W. Mahoney, Kurt Keutzer, Amir Gholami

机构 * UC Berkeley(加州大学伯克利分校) Transmute AI ICSI(国际计算机科学研究所) LBNL(劳伦斯伯克利国家实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 研究揭示了过程奖励模型在对抗性攻击下的脆弱性,指出其更像流畅性检测器而非推理验证器,并提出PRM-BiasBench用于评估模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏