arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-06 至 2026-03-06 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 5 篇

2603.04948 2026-03-06 cs.LG 79%

$\nabla$-Reasoner: LLM Reasoning via Test-Time Gradient Descent in Latent Space

∇-Reasoner: 通过潜在空间中的测试时间梯度下降进行LLM推理

Peihao Wang, Ruisi Cai, Zhen Wang, Hongyuan Mei, Qiang Liu, Pan Li, Zhangyang Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UC San Diego(圣地亚哥大学) TTIC Georgia Tech(佐治亚理工学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 ∇-Reasoner通过潜在空间中的测试时间梯度下降提升LLM推理能力,实现20%以上的准确率提升并减少模型调用次数。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09016 2026-03-06 cs.LG 79%

SPEED-RL: Faster Training of Reasoning Models via Online Curriculum Learning

SPEED-RL: 通过在线课程学习加速推理模型训练

Ruiqi Zhang, Daman Arora, Song Mei, Andrea Zanette

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 SPEED-RL通过在线课程学习方法,提升推理模型训练效率,实现2-6倍的加速,同时保持准确性。

Comments There are some bugs in the experiments, and we cannot fix them to make it satisfactory to us

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04977 2026-03-06 cs.CV 75%

Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

思考,然后验证:一种用于长视频理解的假设-验证多智能体框架

Zheng Wang, Haoran Chen, Haoxuan Qin, Zhipeng Wei, Tianwen Qian, Cong Bai

机构 * College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机科学学院) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江视觉信息智能处理重点实验室) UC Berkeley(伯克利大学) College of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 VideoHV-Agent通过结构化假设-验证流程提升长视频理解的准确性、可解释性和效率。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04893 2026-03-06 cs.CL cs.AI 62%

Free Lunch for Pass@$k$? Low Cost Diverse Sampling for Diffusion Language Models

免费午餐吗?低成本的多样化采样用于扩散语言模型

Sean Lamont, Christian Walder, Paul Montague, Amir Dezfouli, Michael Norrish

机构 * Australian National University(澳大利亚国立大学) Defence Science and Technology Group(国防科学与技术集团) Google DeepMind(谷歌DeepMind) BIMLOGIQ

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种低成本方法,通过修改中间样本以增强扩散语言模型的生成多样性,从而提升Pass@$k$任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04772 2026-03-06 cs.CL cs.AI 62%

TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings

TSEmbed: 解锁通用多模态嵌入中的任务扩展

Yebo Wu, Feng Liu, Ziwei Xie, Zhiyuan Liu, Changwang Zhang, Jun Wang, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(物联网科学与技术国家重点实验室,澳门大学) OPPO Research Institute(OPPO研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TSEmbed通过融合MoE与LoRA,结合专家感知负采样策略,提升通用多模态嵌入的任务扩展能力,并在基准和工业数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏