arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 384 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 26 篇

2601.21164 2026-05-12 cs.AI 86%

Concise Geometric Description as a Bridge: Unleashing the Potential of LLM for Plane Geometry Problem Solving

简洁几何描述作为桥梁:释放LLM在平面几何问题求解中的潜力

Jingyun Wang, Dian Li, Xiaohan Wang, Gang Liu, Jiahong Yan, Guoliang Kang

机构 * Beihang University(北航大学)

专题命中 视觉空间推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出通过训练多模态大语言模型解释器生成几何描述,再利用通用LLM进行推理,以解决平面几何问题。通过设计CDL匹配奖励机制,提升生成几何描述的效率,并在新构建的Formalgeo7k-Rec-CoT数据集上验证了方法的有效性。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03916 2026-05-12 cs.CV cs.CE cs.CL cs.LG 84%

SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?

SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?

Azmine Toushik Wasi, Wahid Faisal, Abdur Rahman, Mahfuz Ahmed Anik, Munem Shahriar, Mohsin Mahmud Topu, Sadia Tasnim Meem, Rahatun Nesa Priti, Sabrina Afroz Mitu, Md. Iqramul Hoque, Shahriyar Zaman Ridoy, Mohammed Eunus Ali, Majd Hawasly, Mohammad Raza, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory(计算智能与运筹实验室) Shahjalal University of Science and Technology(沙赫jalal科技大学) BRAC University(BRAC大学) North South University(北南大学) Monash University(墨尔本大学) Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 SpatiaLab通过真实场景下的空间推理任务评估视觉-语言模型的能力,揭示其在复杂空间关系、深度感知和3D几何方面的不足。

Comments Accepted to ICLR 2026 (https://openreview.net/forum?id=fWWUPOb0CT). 92 Pages. 42 Figures and 29 Tables

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15879 2026-05-12 cs.CV cs.AI cs.CL 82%

GRIT: Teaching MLLMs to Think with Images

GRIT: 教授大语言模型通过图像思考

Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) UC Santa Barbara(加州大学圣芭芭拉分校) eBay

专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 GRIT提出一种基于图像和文本的 grounded reasoning 方法,通过强化学习实现高效训练,使大语言模型生成视觉基础的推理链。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08735 2026-05-12 cs.CV 82%

CollabVR: Collaborative Video Reasoning with Vision-Language and Video Generation Models

CollabVR: 基于视觉-语言和视频生成模型的协作视频推理

Joowon Kim, Seungho Shin, Joonhyung Park, Eunho Yang

机构 * KAIST(韩国科学技术院) Kyung Hee University(庆熙大学) AITRICS

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 CollabVR通过结合视觉-语言模型与视频生成模型,在步骤级实现协作视频推理,提升多步任务性能,并在基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09218 2026-05-12 cs.CV cs.AI cs.LG cs.RO 81%

Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models

Flame3D: 无需3D特定训练的3D场景零样本组合推理

Sagar Bharadwaj, Ziyong Ma, Anurag Ghosh, Srinivasan Seshan, Anthony Rowe

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 Flame3D通过可组合的空间工具和训练自由框架,实现3D场景的零样本组合推理,支持动态空间合成和外部数据整合,展示了在ScanQA和Compose3D上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01345 2026-05-12 cs.CV cs.AI cs.LG 81%

The Perceptual Bandwidth Bottleneck in Vision-Language Models: Active Visual Reasoning via Sequential Experimental Design

视觉语言模型中的感知带宽瓶颈:通过顺序实验设计实现主动视觉推理

Anjie Liu, Ziqin Gong, Yan Song, Yuxiang Chen, Xiaolong Liu, Hengtong Lu, Kaike Zhang, Chen Wei, Jun Wang

机构 * The Hong Kong University of Science(香港科学与技术大学) University College London, London, United Kingdom(伦敦大学学院, 英国伦敦) ShanghaiTech University, Shanghai, China(上海科技大学, 中国上海) AI Lab, The Yangtze River Delta, China(人工智能实验室, 长江三角洲, 中国)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过顺序贝叶斯最优实验设计实现主动视觉推理,解决视觉语言模型中感知带宽瓶颈问题,提升高分辨率视觉推理能力。

Comments 27 pages, 5 figures, accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08201 2026-05-12 cs.LG cs.AI cs.CV 81%

Weakly Supervised Concept Learning for Object-centric Visual Reasoning

弱监督概念学习用于以对象为中心的视觉推理

Sparsh Tiwari, Bettina Finzel, Gesina Schwalbe

机构 * University of Lübeck(吕贝克大学) University of Bamberg(巴马克大学) University of Ulm(乌尔姆大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种高效的弱监督方案,结合槽式架构和VAE实现对象中心推理任务中的符号 grounding,减少监督至1%并提升域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10106 2026-05-12 cs.CV cs.AI 79%

ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models

ViSRA:一种基于视频的空间推理代理用于多模态大语言模型

Tingshu Mou, Jiabo He, Renying Wang, Ce Liu, Hao Yang, Tiehua Zhang, Jingjing Chen, Xingjun Ma

机构 * Fudan University(复旦大学) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) Tongji University(同济大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12812 2026-05-12 cs.AI 79%

DocSeeker: Structured Visual Reasoning with Evidence Grounding for Long Document Understanding

DocSeeker:基于证据 grounding 的结构化视觉推理用于长文档理解

Hao Yan, Yuliang Liu, Xingchen Liu, Yuyi Zhang, Minghui Liao, Jihao Wu, Wei Chen, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Inc.(华为公司)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出DocSeeker,通过结构化分析、定位和推理流程解决长文档理解中的信号噪声比低和监督不足问题,实现对超长文档的鲁棒泛化。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09153 2026-05-12 cs.RO cs.AI 79%

Beyond Self-Play: Hierarchical Reasoning for Continuous Motion in Closed-Loop Traffic Simulation

超越自我博弈:闭合环路交通模拟中的层次化推理

Weifan Zhang, Xiaofeng Zhao, Adel Bazzi, Mingrui Li, Yifan Wei, Dengfeng Sun

机构 * School of Aeronautics and Astronautics, Purdue University(普渡大学航空航天学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种层次化架构,结合高层多智能体交互推理与底层连续轨迹生成,以提升闭合环路交通模拟中代理的可扩展性和行为真实性,实验表明其在控制平滑性和安全性方面优于自我博弈和被动模仿基线。

Comments Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10002 2026-05-12 cs.CV 78%

Med-StepBench: A Hierarchical Reasoning Framework for Evaluating Hallucinations in Medical Vision-Language Models

Med-StepBench:一种用于评估医学视觉-语言模型幻觉的分层推理框架

Minh Khoi Nguyen, Dai Lam Le, Amir Reza Jafari, Tuan Dung Nguyen, Mai Hong Son, Mai Huy Thong, Quang Huy Nguyen, Thanh Trung Nguyen, Reza Farahbakhsh, Noel Crespi, Phi Le Nguyen

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,越南科学与技术大学) SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris, France(SAMOVAR,法国电信南巴黎学院,巴黎理工学院) Military Central Hospital, Vietnam(越南108军中心医院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出Med-StepBench,首个针对3D肿瘤PET/CT图像的分步幻觉检测基准,通过12000张图像和100万对图像-陈述数据,揭示了现有VLMs在多步临床推理中的系统性缺陷。

Comments Accepted at IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09053 2026-05-12 cs.CV 78%

LCGNav: Local Candidate-Aware Geometric Enhancement for General Topological Planning in Vision-Language Navigation

LCGNav: 本地候选感知的几何增强以实现连续环境中的通用拓扑规划

Jiankun Peng, Jianyuan Guo, Yiguang Yang, Yue Liu, Jiashuang Yan, Ying Xu

机构 * The Aerospace Information Research Institute, Chinese Academy of Sciences, Beijing(中国科学院航空航天信息研究所,北京) The School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing(中国科学院大学电子电气与通信工程学院,北京) The Department of Computer Science, City University of Hong Kong, Hong Kong, SAR, China(香港城市大学计算机科学系,香港特别行政区,中国)

专题命中 视觉空间推理 :planning(title,abstract)

AI总结 LCGNav通过本地几何增强框架解决连续环境视觉语言导航中局部深度信息冗余和候选前沿关注不足的问题,提升拓扑规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09693 2026-05-12 cs.CV cs.AI cs.LG 62%

Do multimodal models imagine electric sheep?

多模态模型是否想象出电羊?

Santhosh Kumar Ramakrishnan, Carl Vondrick, Raja Giryes, Philipp Krähenbühl, Vladlen Koltun

机构 * Apple(苹果公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现多模态模型在解决空间谜题时会形成心理图像,通过微调Qwen3.5 VLM解决多种视觉推理任务,发现动作序列预测能提升解谜准确率,尤其在需要空间推理的任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11824 2026-05-12 cs.AI cs.LG 62%

Revis: Sparse Latent Steering to Mitigate Object Hallucination in Large Vision-Language Models

Revis: 通过稀疏潜在引导缓解大视觉-语言模型中的物体幻觉

Jialin Wu, Wei Shi, Han Shen, Peigui Qi, Kunsheng Tang, Zhicong Huang, Binghao Wang, Zhou Yang

机构 * Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Revis通过潜在空间几何学提取纯视觉信息向量,采用校准策略在抑制发生深度进行稀疏干预,有效降低物体幻觉率19%,同时保持推理能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10817 2026-05-12 cs.AI 57%

CLEF: EEG Foundation Model for Learning Clinical Semantics

CLEF:用于学习临床语义的EEG基础模型

Peng Cao, Ali Mirzazadeh, Jong Woo Lee, Aleksandar Videnovic, Dina Katabi

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里奇沃特医院) Massachusetts General Hospital, Harvard Medical School(哈佛医学院麻省总医院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CLEF,一种基于临床场景的长上下文EEG基础模型,通过对比学习将EEG会话与神经科报告和结构化电子健康记录对齐,提升了EEG解读的临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10407 2026-05-12 cs.LG 57%

Identified-Set Geometry of Distributional Model Extraction under Top-$K$ Censored API Access

分布模型提取的识别集几何:在Top-K被剪裁API访问下的研究

Wenhua Nie, ZiCheng Zhu, Jianan Wu, Binhan Luo, Haoran Zheng, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文研究了在Top-K被剪裁API访问下分布恢复的限制,提出了识别集的总变差直径公式,并通过实验展示了不同提取方法在任务性能上的层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09993 2026-05-12 cs.LG 57%

Learning Graph Foundation Models on Riemannian Graph-of-Graphs

在黎曼图-图上学习图基础模型

Haokun Liu, Zezhong Ding, Xike Xie

机构 * School of Biomedical Engineering, University of Science and Technology of China (USTC), Suzhou, Jiangsu, China(生物医学工程学院,中国科学技术大学(USTC),苏州,江苏,中国) Data Darkness Lab, Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu, China(Data Darkness实验室,苏州市先进研究院,USTC,苏州,江苏,中国) School of Artificial Intelligence and Data Science, USTC, Hefei, Anhui, China(人工智能与数据科学学院,USTC,合肥,安徽,中国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出R-GFM,一种基于黎曼图-图的图基础模型,通过多尺度图-图结构建模,提升结构域泛化性能,在多个数据集上取得最佳表现,下游任务相对提升达49%。

Comments This paper has been accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI 57%

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05045 2026-05-12 cs.CV cs.CL 57%

When Relations Break: Analyzing Relation Hallucination in Vision-Language Model Under Rotation and Noise

关系破裂:在旋转和噪声下的视觉语言模型关系幻觉分析

Philip Wootaek Shin, Ajay Narayanan Sridhar, Sivani Devarapalli, Rui Zhang, Jack Sampson, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了旋转和噪声对视觉语言模型关系推理的影响,发现轻微扰动显著降低模型性能,提示需更鲁棒的几何感知模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08816 2026-05-12 cs.AI cs.CY 57%

Mirror, Mirror on the Wall: Can VLM Agents Tell Who They Are at All?

镜中镜:视觉语言模型代理是否真的能辨认自己?

Filippo Ziliotto, Ciro Beneduce, Bruno Lepri, Luciano Serafini, Massimiliano Luca, Tommaso Campari

机构 * University of Padova(帕多瓦大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) University of Trento(特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨视觉语言模型是否能通过镜像识别自身,通过设计3D基准测试评估其自我识别能力,发现更强的模型能利用镜像信息进行行动,而较弱的模型则无法正确提取自身相关信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10564 2026-05-12 cs.CV cs.RO 50%

DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving

DeepSight: 通过潜在状态预测实现长视距世界建模的端到端自动驾驶

Lingjun Zhang, Changjie Wu, Linzhe Shi, Jiangyang Li, Jiaxin Liu, Lei Yang, Hang Zhang, Mu Xu, Hong Wang

机构 * Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团Amap) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出通过鸟瞰图空间预测连续未来帧的潜在语义特征,实现长视距世界建模,并引入高效适应性文本推理机制提升复杂场景下的驾驶性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 50%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 视觉空间推理 :verifier(abstract)

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10118 2026-05-12 cs.RO 50%

Plan in Sandbox, Navigate in Open Worlds: Learning Physics-Grounded Abstracted Experience for Embodied Navigation

沙盒计划,开放世界导航:学习物理基础的抽象经验以实现具身导航

Zhixuan Shen, Jiawei Du, Ziyu Guo, Han Luo, Lilan Peng, Joey Tianyi Zhou, Haonan Luo, Tianrui Li

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University, China(计算机与人工智能学院,西南交通大学,中国) Centre for Frontier AI Research A*STAR, Singapore(前沿人工智能研究A*STAR中心,新加坡) School of Computer Science, University of Leeds, UK(计算机科学学院,利兹大学,英国)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SAGE框架,通过物理基础的语义抽象学习,提升具身导航性能,在A-EQA任务中取得53.21%的成功率,且在物理室内机器人部署中表现良好。

Comments 28 pages, 15 figures, Extended Version of accepted ICML 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09449 2026-05-12 cs.CV 50%

SpaceMind++: Toward Allocentric Cognitive Maps for Spatially Grounded Video MLLMs

SpaceMind++:迈向空间感知认知地图的视频多模态大语言模型

Bo Gu, Zhikang Zhang, Zizhuang Wei, Zhenyuan Chen, Lingyun Li, Zhuoyi Song

机构 * Fudan University(复旦大学) Huawei(华为) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SpaceMind++通过构建体素化认知地图,实现空间一致性的视觉推理,提升视频多模态大语言模型在3D环境中的表现。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 30 篇

2605.08283 2026-05-12 cs.LG cs.AI cs.CL 86%

HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control

HTPO: 通过分层令牌级目标控制实现探索-利用平衡的策略优化

Xincheng Yao, Ruoqi Li, Cheng Chen, Daoxin Zhang, Yi Wu, Yao Hu, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Xiaohongshu Inc.(小红书公司) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院)

专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);test-time compute(abstract)

AI总结 本文提出HTPO算法,通过分层划分响应令牌为功能组,设计专用优化目标以平衡探索与利用,实验验证其在推理基准上的优越性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06527 2026-05-12 cs.AI 85%

HyPER: Bridging Exploration and Exploitation for Scalable LLM Reasoning with Hypothesis Path Expansion and Reduction

HyPER:通过假设路径扩展与缩减实现可扩展的大语言模型推理中的探索与利用平衡

Shengxuan Qiu, Haochen Huang, Shuzhang Zhong, Pengfei Zuo, Meng Li

机构 * Institute for Artificial Intelligence, Peking University, Beijing(北京大学人工智能研究院) Huawei(华为) School of Integrated Circuits, Peking University, Beijing(北京大学集成电路学院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);test-time compute(abstract);分类 cs.AI

AI总结 HyPER通过动态扩展-缩减控制问题优化多路径解码,提升推理准确性与计算效率,实验显示在不同基准上准确率提升8-10%,token使用减少25-40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10366 2026-05-12 cs.AI 83%

EGL-SCA: Structural Credit Assignment for Co-Evolving Instructions and Tools in Graph Reasoning Agents

EGL-SCA:图推理代理中协同指令与工具的结构信用分配

Zike Yuan, Yukun Cao, Han Zhang, Jianzhi Yan, Le Liu, Cai ke, Yue Yu, Hui Wang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Technology(计算机科学与技术学院)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出EGL-SCA框架,通过结构信用分配机制协同优化指令与工具,提升图推理代理的结构正确性与执行效率,实验显示其在四个基准测试中达到92.0%的平均成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09931 2026-05-12 cs.CL cs.AI 81%

PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning

PruneTIR: 在推理时工具调用剪枝以实现有效且高效的工具集成推理

Luan Zhang, Dandan Song, Zhijing Wu, Zhengyu Chen, Chen Zhang, Yuhang Tian, Huipeng Ma, Chenhao Li, Changzhi Zhou, Xudong Li, Shuhao Zhang

机构 * School of Computer Science and Technology, Beijing Institute of Technology, China(北京理工大学计算机科学与技术学院) School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院) Independent, China(独立)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出PruneTIR框架,通过剪枝轨迹、重采样工具调用和暂停工具使用,提升已有工具能力LLM的推理能力,减少工作上下文长度并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21743 2026-05-12 cs.AI cs.LG 81%

Retrieval-of-Thought: Efficient Reasoning via Reusing Thoughts

思想检索:通过重用思想实现高效推理

Ammar Ahmed, Azal Ahmad Khan, Ayaan Ahmad, Sheng Di, Zirui Liu, Ali Anwar

机构 * Department of Computer Science and Engineering, University of Minnesota(明尼苏达大学计算机科学与工程系) Department of Computer Science and Engineering, University of California Santa Cruz(加州大学圣克鲁兹分校计算机科学与工程系) Argonne National Laboratory(阿贡国家实验室)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出RoT方法,通过重用先前推理步骤构建动态模板,减少冗余探索,提升推理效率,实验显示输出token减少40%,延迟降低82%,成本降低59%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10762 2026-05-12 cs.CV cs.AI 79%

GridProbe: Posterior-Probing for Adaptive Test-Time Compute in Long-Video VLMs

GridProbe: 为长视频VLMs中的自适应测试时间计算进行后验探测

Mohamed Eltahir, Lama Ayash, Ali Habibullah, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡尔斯塔德大学科学与技术学院) Department of Computer Science, Edge Hill University(埃奇希尔大学计算机科学系)

专题命中 测试时计算 :test-time compute(title);reasoning(abstract);分类 cs.AI

AI总结 GridProbe通过后验探测方法在无需训练的情况下选择相关帧,减少注意力成本,同时保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏