arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-02 至 2026-06-02 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 16 篇

2605.11374 2026-06-02 cs.LG cs.CL cs.IR 84%

Test-Time Compute for Frozen Embedding Models through Agentic Program Search

冻结嵌入模型在测试时通过智能体程序搜索的计算

Han Xiao

机构 * Jina AI by Elastic(Jina AI 由 Elastic 提供)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种智能体程序搜索方法,通过大语言模型编写程序操作冻结编码器API,在推理时提升小嵌入模型的检索质量,无需训练参数且跨任务迁移。

Comments 15 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17045 2026-06-02 cs.CV cs.AI cs.LG 84%

Video Reasoning without Training

无需训练的视频推理

Deepak Sridhar, Kartikeya Bhardwaj, Jeya Pradha Jeyaraj, Nuno Vasconcelos, Ankita Nayak, Harris Teague

机构 * Qualcomm AI Research(高通AI研究) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出V-Reason方法,利用输出分布熵作为信号,通过轻量级控制器在推理时自适应调整值缓存,无需强化学习或微调即可提升视频推理性能。

Comments CVPR Findings 2026. Project Page https://deepaksridhar.github.io/vreason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04718 2026-06-02 cs.CL cs.AI 84%

T1: Tool-integrated Verification for Test-time Compute Scaling in Small Language Models

T1:小语言模型测试时计算扩展的工具集成验证

Minki Kang, Jongwon Jeong, Jaewoong Cho

机构 * KAIST(韩国科学技术院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) KRAFTON

专题命中 测试时计算 :test-time compute(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 针对小语言模型在测试时扩展中验证能力不足的问题,提出T1框架,通过外部工具过滤候选输出后由小语言模型进行最终验证,显著提升验证准确率和测试时扩展性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13602 2026-06-02 cs.CV cs.LG 83%

Towards Sparse Video Understanding and Reasoning

迈向稀疏视频理解与推理

Chenwei Xu, Zhen Ye, Shang Wu, Weijian Li, Zihan Wang, Zhuofan Xia, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Johns Hopkins University(约翰霍普金斯大学) Dolby Laboratories(杜比实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 提出一种多轮视频问答代理,通过稀疏帧选择、状态摘要和早期停止机制,在减少帧数和令牌数的同时提升准确率。

Comments Accepted to CVPR 2026. Project page: https://sparsevideounderstanding.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01080 2026-06-02 cs.LG cs.AI 81%

ThinkSwitch: Context Distillation with LoRA and Weight Interpolation for Specific-Purpose Reasoning Tasks

ThinkSwitch:基于LoRA和权重插值的上下文蒸馏用于特定目的推理任务

Dhruv Saini, Rohan Pandey

机构 * bellevue High School(贝尔维尤高中) DigitalOcean

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ThinkSwitch方法,通过QLoRA蒸馏和球面权重插值协同训练指令模型和思考模型,在AIME 2026和PubMedQA上分别提升指令模型10/30→20/30和13/30→18/30,思考模型14/30→22/30和18/30→25/30,仅需15个训练提示和$2.86成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01464 2026-06-02 cs.CL 79%

Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models

跨语言自一致性:面向语言模型的多语言推理

Ahmed Elhady, Eneko Agirre, Mikel Artetxe

机构 * HiTZ Center, University of the Basque Country (UPV/EHU)(巴斯克大学HiTZ中心) Reka AI

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 提出无监督强化学习方法,通过强制模型对跨语言等价问题产生相同答案来增强多语言推理,在MGSM上平均提升21.7%,并展现出强泛化能力。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00660 2026-06-02 cs.CL 79%

FineVerify: Scaling Test-Time Compute with Fine-Grained Self-Verification for Agentic Search

FineVerify: 通过细粒度自验证扩展智能搜索的测试时计算

James Xu Zhao, Hui Chen, Bryan Hooi, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL

AI总结 提出FineVerify细粒度自验证框架,将问题分解为可检查的子问题,对候选答案逐项验证并聚合得分,在四个智能搜索基准上显著优于标准扩展基线。

Comments 8+18 pages, 6 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01104 2026-06-02 cs.CV 78%

Adaptive Dense Evidence Refinement for Video Relational Reasoning for VRR-QA Challenge

自适应密集证据精炼用于视频关系推理:VRR-QA挑战

Yuyang Sun, Yongliang Wu, Xingyu Zhu, Yuxia Chen, Zhenxiang Jiang, Yangguang Ji, Wenbo Zhu, Yanxi Shi, Jay Wu, Shuo Wang, Xu Yang

机构 * Southeast University(东南大学) National University of Singapore(国立新加坡大学) Independent Researcher(独立研究员) Opus AI Research(Opus AI研究) University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(title);verifier(abstract)

AI总结 提出一种自适应测试时计算系统,通过轻量视图识别不稳定问题并路由到高预算密集证据模块,在VRR-QA测试集上达到90.07%平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30290 2026-06-02 cs.LG cs.AI cs.CL 75%

Self-Trained Verification for Training- and Test-Time Self-Improvement

自训练验证用于训练和测试时的自我改进

Chen Henry Wu, Aditi Raghunathan

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自训练验证(STV)方法,通过让验证器模仿参考解决方案下的自身版本,解决自我改进中验证器瓶颈问题,在测试时显著提升验证-细化循环,在训练时通过验证器在环训练(ViL)进一步提升生成器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24919 2026-06-02 cs.CV 67%

Agentic AI for Remote Sensing: Technical Challenges and Research Directions

Agentic AI 在遥感中的应用:技术挑战与研究方向

Muhammad Akhtar Munir, Muhammad Umer Sheikh, Akashah Shabbir, Muhammad Haris Khan, Fahad Khan, Xiao Xiang Zhu, Begüm Demir, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract)

AI总结 本文指出遥感中的多步分析工作流存在结构性的地理空间约束,提出面向地球观测的原生智能体设计原则,包括结构化地理空间状态、工具感知推理、验证器引导执行和有效性感知学习评估。

Comments 31 pages. Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00755 2026-06-02 cs.CL cs.LG 62%

Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning

内化温度:面向强化学习的同策略自蒸馏作为策略加热器

Xuewei Yang, Jiachen Yu, Jie Wu, Shaoning Sun, Junjie Wang, Yujiu Yang

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出温度缩放同策略自蒸馏(TS-OPSD),通过将温度探索效应内化到模型参数中,缓解强化学习中的熵崩溃问题,无需外部教师或额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00971 2026-06-02 cs.CL 57%

HypothesisMed: Inference-Time Answer Fusion and Structured Hypothesis-Space Reporting for Biomedical Question Answering

HypothesisMed:生物医学问答中的推理时答案融合与结构化假设空间报告

Md Motaleb Hossen Manik, Ge Wang

机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系雷士打理工学院) Department of Biomedical Engineering Rensselaer Polytechnic Institute(生物医学工程系雷士打理工学院)

专题命中 测试时计算 :chain-of-thought(abstract);分类 cs.CL

AI总结 提出HypothesisMed推理时可靠性流水线,通过答案融合和SPACE标签(有效/不完整/矛盾)提升生物医学多项选择问答的准确率、可解析性和结构化可靠性报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00739 2026-06-02 cs.LG 57%

Score $\times$ Decoder: A Unified View of Unsupervised Inference-Time Scaling for Hallucination Mitigation

Score × Decoder:无监督推理时缩放缓解幻觉的统一视角

Yun-Chen Cheng, Che-Yu Lin, Cheng-Lin Yang

机构 * CyCraft AI Lab, Taiwan(CyCraft人工智能实验室,台湾)

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

AI总结 本文提出Score×Decoder框架,通过配对四种内在分数(困惑度、对比度、幂分布似然、自验证)与三种解码族(优化、采样、共识),在无监督条件下选择最佳组合以缓解大语言模型幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00328 2026-06-02 cs.LG 57%

KG-Guard: Graph-Based Hallucination Detection for Knowledge Base Question Answering

KG-Guard: 基于图的知识库问答幻觉检测

Albert Sawczyn, Piotr Bielak, Tomasz Kajdanowicz

机构 * Department of Artificial Intelligence(人工智能系) Wroclaw University of Science and Technology(波兹南科技大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 针对知识库问答中LLM的幻觉问题,提出一种轻量级图框架,将问答实例构建为增强图,通过图编码器和MLP分类器检测幻觉答案节点,在三个基准上取得最高F1并显著提升下游KBQA性能。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07109 2026-06-02 cs.AI 57%

Vision Language Models Cannot Reason About Physical Transformation

视觉语言模型无法推理物理变换

Dezhi Luo, Yijiang Li, Maijunxian Wang, Tianwei Zhao, Bingyang Wang, Siheng Wang, Pinyuan Feng, Pooyan Rahmanzadehgervi, Ziqiao Ma, Hokin Deng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文通过构建ConservationBench基准,评估112个视觉语言模型在物理守恒任务上的表现,发现模型在动态场景中无法维持物理属性的变换不变性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03719 2026-06-02 cs.CL 57%

BranPO: Scalable Contrastive Branch Sampling for Long-Horizon Agentic Reinforcement Learning

BranPO:面向长程智能体强化学习的可扩展对比分支采样

Yubao Zhao, Weiquan Huang, Sudong Wang, Ruochen Zhao, Chen Chen, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :planning(abstract);分类 cs.CL

AI总结 针对长程智能体强化学习中轨迹级奖励稀疏且信用分配困难的问题,提出一种无值函数方法BranPO,通过截断轨迹并重采样延续构建对比分支,实现局部对比监督,无需密集奖励。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏