arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3328 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3328 篇

2602.05382 2026-02-06 cs.CV cs.LG 79%

VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs

VRIQ:评估和分析视觉推理IQ的VLMs基准测试

Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

机构 * University of Southern California, Los Angeles, USA(美国南加州大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 VRIQ基准测试评估了VLMs的视觉推理能力,发现其在抽象推理任务中表现薄弱,主要源于感知限制,提出细粒度诊断方法以改进多模态系统中的视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03038 2026-02-04 cs.CV cs.AI 79%

Bongards at the Boundary of Perception and Reasoning: Programs or Language?

Bongards在感知与推理边界上的问题:程序还是语言?

Cassidy Langenfeld, Claas Beger, Gloria Geng, Wasu Top Piriyakulkij, Keya Hu, Yewen Pu, Kevin Ellis

机构 * Cornell University(康奈尔大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种神经符号方法,利用大语言模型和贝叶斯优化解决Bongard问题,通过生成参数化程序化表示来提升视觉推理能力。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03026 2026-02-04 cs.AI cs.MA 79%

Visual Reasoning over Time Series via Multi-Agent System

通过多智能体系统进行时间序列的视觉推理

Weilin Ruan, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MAS4TS通过多智能体系统实现时间序列的视觉推理,利用分析-推理-执行范式,结合视觉语言模型和工具链,提升时间序列任务的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04575 2026-01-30 cs.AI 79%

Scaling Behavior Cloning Improves Causal Reasoning: An Open Model for Real-Time Video Game Playing

规模行为克隆提升因果推理:一个用于实时视频游戏播放的开放模型

Yuguang Yue, Irakli Salia, Samuel Hunt, Chris Green, Wenzhe Shi, Jonathan J Hunt

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出了一种开放的训练方法,通过扩大模型和数据规模提升因果推理能力,展示了在实时视频游戏中的高性能表现。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19204 2026-01-28 cs.AI cs.CV 79%

MATA: A Trainable Hierarchical Automaton System for Multi-Agent Visual Reasoning

MATA:一种用于多智能体视觉推理的可训练分层自动机系统

Zhixi Cai, Fucai Ke, Kevin Leo, Sukai Huang, Maria Garcia de la Banda, Peter J. Stuckey, Hamid Rezatofighi

机构 * Monash University(墨尔本大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MATA是一种基于分层自动机的多智能体系统,通过可训练超智能体选择最优智能体进行视觉推理,实现高效任务解决。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11020 2026-01-27 cs.CV cs.AI 79%

GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation

GeoVLMath: 通过跨模态奖励增强视觉-语言模型中的几何推理以辅助线创建

Shasha Guo, Liang Pang, Xi Wang, Yanling Wang, Huawei Shen, Jing Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GeoVLMath通过跨模态奖励模型提升视觉-语言模型在复杂立体几何问题中的几何推理能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16394 2026-01-26 cs.CV cs.AI 79%

ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation

ResAgent:基于熵的先验点发现与视觉推理的指称表达分割

Yihao Wang, Jusheng Zhang, Ziyi Tang, Keze Wang, Meng Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ResAgent通过熵引导的点发现和视觉推理方法,提升指称表达分割的准确性与效率。

Comments 23 pages, 7gigures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05665 2026-01-22 cs.CL cs.CV 79%

Interleaved Latent Visual Reasoning with Selective Perceptual Modeling

交错的潜在视觉推理与选择性感知建模

Shuai Dong, Siyuan Wang, Xingyu Liu, Chenglin Li, Haowen Hou, Zhongyu Wei

机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) Shanghai Innovation Institute(上海创新研究院) University of Southern California(南加州大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 ILVR通过交错潜在视觉表示与文本生成,实现动态状态演变与精确感知建模的统一,提升多模态推理性能。

Comments 18 pages, 11 figures. Code available at https://github.com/XD111ds/ILVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11644 2026-01-21 cs.CV cs.AI 79%

Predicting When to Trust Vision-Language Models for Spatial Reasoning

预测何时信任视觉-语言模型进行空间推理

Muhammad Imran, Yugyung Lee

机构 * University of Missouri Kansas City(密苏里大学堪萨斯城分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出一种基于视觉的置信度估计框架,通过几何验证提升VLM空间推理的可靠性,实验显示其在BLIP-2和CLIP上的AUROC显著优于文本方法基线。

Comments 9 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25142 2026-01-21 cs.AI 79%

Visual serial processing deficits explain divergences in human and VLM reasoning

视觉序列处理缺陷解释了人类与VLM推理之间的差异

Nicholas Budny, Kia Ghods, Declan Campbell, Raja Marjieh, Amogh Joshi, Sreejan Kumar, Jonathan D. Cohen, Taylor W. Webb, Thomas L. Griffiths

机构 * Princeton Neuroscience Institute(普林斯顿神经科学研究所) Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Psychology, Université de Montréal(蒙特利尔大学心理学系) Mila - Quebec AI Institute(魁北克AI研究所) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究发现视觉语言模型在视觉序列处理能力上存在缺陷,导致其在不同领域中的推理表现与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00070 2026-01-19 cs.RO cs.AI 79%

Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics

Robot-R1: 通过强化学习提升机器人中的具身推理

Dongyoung Kim, Sumin Park, Huiwon Jang, Jinwoo Shin, Jaehyung Kim, Younggyo Seo

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学) UC Berkeley(加州大学伯克利分校) RLWRLD

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Robot-R1通过强化学习提升机器人中的具身推理,优于SFT方法并超越GPT-4o在低级动作控制推理任务中

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10254 2026-01-16 cs.AI 79%

NoReGeo: Non-Reasoning Geometry Benchmark

NoReGeo:非推理几何基准

Irina Abdullaeva, Anton Vasiliuk, Elizaveta Goncharova, Temurbek Rahmatullaev, Zagorulko Ivan, Maxim Kurkin, Andrey Kuznetsov

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 NoReGeo基准评估LLMs在不依赖推理或代数计算的情况下对几何问题的理解能力,发现即使先进模型在二分类任务中也仅达65%准确率,揭示了当前LLMs在几何认知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09879 2026-01-16 cs.CV cs.AI 79%

MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation

MedVL-SAM2:一种统一的3D医学视觉-语言模型,用于多模态推理和基于提示的分割

Yang Xing, Jiong Wu, Savas Ozdemir, Ying Zhang, Yang Yang, Wei Shao, Kuang Gong

机构 * Department of Biomedical Engineering, University of Florida(佛罗里达大学生物医学工程系) Department of Radiology, University of Florida(佛罗里达大学放射学系) Research Computing, University of Florida(佛罗里达大学研究计算中心) Department of Medicine, University of Florida(佛罗里达大学医学系) Department of Radiology, UC San Francisco(旧金山大学放射学系)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MedVL-SAM2是一种统一的3D医学多模态模型,通过联合训练实现报告生成、VQA和多任务分割的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08811 2026-01-14 cs.CV cs.AI 79%

Reasoning Matters for 3D Visual Grounding

推理在3D视觉定位中至关重要

Hsiang-Wei Huang, Kuang-Ming Chen, Wenhao Chai, Cheng-Yen Yang, Jen-Hao Cheng, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种自动合成3D视觉定位数据的管道,并引入了在仅使用1.6%训练数据下表现优于现有方法的Reason3DVG-8B模型,证明了推理在3D视觉定位中的重要性。

Comments 2025 CVPR Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05172 2026-01-12 cs.CV cs.AI 79%

CoV: Chain-of-View Prompting for Spatial Reasoning

CoV:基于视角链的立体推理

Haoyu Zhao, Akide Liu, Zeyu Zhang, Weijie Wang, Feng Chen, Ruihan Zhu, Gholamreza Haffari, Bohan Zhuang

机构 * ZIP Lab, Zhejiang University(浙江大学ZIP实验室) Monash University(墨尔本大学) AIML, Adelaide University(阿德莱德大学AIML)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CoV通过链式视角提示方法提升3D具身问答中的空间推理能力,无需额外训练。

Comments Code link https://github.com/ziplab/CoV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22836 2026-01-09 cs.AI 79%

Rethinking the Text-Vision Reasoning Imbalance in MLLMs through the Lens of Training Recipes

通过训练食谱的视角重新思考MLLMs中的文本-视觉推理不平衡

Guanyu Yao, Qiucheng Wu, Yang Zhang, Zhaowen Wang, Handong Zhao, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室) Adobe Research(Adobe研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过分析训练食谱,提出减少多模态大语言模型中文本与视觉推理不平衡的方法,旨在提升视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02346 2026-01-06 cs.AI 79%

Falcon-H1R: Pushing the Reasoning Frontiers with a Hybrid Model for Efficient Test-Time Scaling

Falcon-H1R:通过高效推理扩展的混合模型推动推理前沿

Falcon LLM Team, Iheb Chaabane, Puneesh Khanna, Suhail Mohmad, Slim Frikha, Shi Hu, Abdalgader Abubaker, Reda Alami, Mikhail Lubinets, Mohamed El Amine Seddik, Hakim Hacid

机构 * Falcon LLM Team(Falcon LLM团队)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Falcon-H1R通过高效推理优化和混合模型设计,在保持模型规模的同时实现高效推理性能的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06259 2025-12-29 cs.CV cs.AI 79%

SIFThinker: Spatially-Aware Image Focus for Visual Reasoning

SIFThinker: 基于空间的图像聚焦用于视觉推理

Zhangquan Chen, Ruihui Zhao, Chuwei Luo, Mingze Sun, Xinlei Yu, Yangyang Kang, Ruqi Huang

机构 * ByteDance(字节跳动)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SIFThinker通过结合深度增强的边界框和自然语言,提升视觉推理中的空间理解和细粒度感知能力。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11006 2025-12-24 cs.CV cs.AI 79%

Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation

细粒度指令引导的图推理用于视觉-语言导航

Yaohua Liu, Xinyuan Song, Yunfu Deng, Yifan Xie, Binkai Ou, Yan Zhong

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Tsinghua University(清华大学) Innovation and Research and Development Department, BoardWare Information System Company(BoardWare信息系统公司创新与研发部) School of Mathematics, Peking University(北京大学数学学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出细粒度指令引导的图推理框架OIKG,通过解耦角度与视觉提示并增强空间表示,提升视觉-语言导航中指令理解和跨模态对齐能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16698 2025-12-19 cs.AI cs.CG 79%

Do Multi-Agents Solve Better Than Single? Evaluating Agentic Frameworks for Diagram-Grounded Geometry Problem Solving and Reasoning

多智能体表现更优吗?评估用于图示引导几何问题解决与推理的智能体框架

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Mohammad Nehad Alam, Proma Hossain Progga, Swakkhar Shatabda

机构 * BRAC University(布拉克大学) United International University(国际联合大学) Center for Computational & Data Sciences(计算与数据科学中心) Independent University, Bangladesh(孟加拉国独立大学) Spectrum Software & Consulting Ltd(Spectrum软件与咨询有限公司)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了多智能体框架在图示引导几何问题解决中的表现,发现其对开源模型有明显提升,但对闭源模型效果有限,且并非普遍最优。

Comments Accepted to the ARR October 2025 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16237 2025-12-19 cs.AI 79%

Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis

通过程序化数据合成提升大规模语言模型的空间推理能力

Zhi Helu, Huang Jingjing, Xu Wang, Xu Yangbin, Zhang Wanyue, Jiang Baoyang, Deng Shirui, Zhu Liang, Li Fangfang, Zhao Tiejun, Lin Yankai, Yao Yuan

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院电子学研究所) Renmin University of China(中国人民大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SPRITE通过程序化数据合成生成高质量空间推理数据,提升大规模语言模型的空间推理能力,并在多个基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13886 2025-12-12 cs.CL 79%

Game-RL: Synthesizing Multimodal Verifiable Game Data to Boost VLMs' General Reasoning

Game-RL: 合成多模态可验证游戏数据以提升VLMs的通用推理能力

Jingqi Tong, Jixin Tang, Hangcheng Li, Yurong Mou, Ming Zhang, Jun Zhao, Yanbo Wen, Fan Song, Jiahao Zhan, Yuyang Lu, Chaoran Tao, Zhiyuan Guo, Jizhou Yu, Tianhao Cheng, Zhiheng Xi, Changhao Jiang, Zhangyue Yin, Yining Zheng, Weifeng Ge, Guanhua Chen, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 Game-RL通过合成多模态可验证游戏数据提升VLMs的通用推理能力。

Comments 69 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09251 2025-12-11 cs.CV cs.AI 79%

GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model

GLACIA:基于多模态大语言模型的冰湖分割实例感知位置推理

Lalit Maurya, Saurabh Kaushik, Beth Tellman

机构 * Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(普森大学计算学院) Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(威斯康星大学麦迪逊分校可持续性与全球环境中心)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GLACIA通过多模态大语言模型实现冰湖分割的实例感知位置推理,提升分割精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06759 2025-12-09 cs.CV cs.AI 79%

VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors

VisChainBench: 一个多轮多图视觉推理基准,超越语言先验

Wenbo Lyu, Yingjun Du, Jinglin Zhao, Xianton Zhen, Ling Shao

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 VisChainBench是一个多轮多图视觉推理基准,通过多代理生成流水线构建,旨在评估LVLM在连续、相互依赖任务中进行多步骤视觉推理的能力。

Comments 12 pages,13figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23075 2025-12-05 cs.CV cs.AI 79%

SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models

SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理

Ruosen Zhao, Zhikang Zhang, Jialei Xu, Jiahao Chang, Dong Chen, Lingyun Li, Weijian Sun, Zizhuang Wei

机构 * Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01223 2025-12-02 cs.CV cs.AI 79%

S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

S$^2$-MLLM:通过结构指导提升多模态大语言模型在3D视觉定位中的空间推理能力

Beining Xu, Siting Zhu, Zhao Jin, Junxian Li, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 S$^2$-MLLM通过隐式空间推理提升多模态大语言模型在3D视觉定位中的空间推理能力,实现高效且准确的3D场景理解。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24693 2025-12-01 cs.SD cs.CL eess.AS 79%

STAR-Bench: Probing Deep Spatio-Temporal Reasoning as Audio 4D Intelligence

STAR-Bench:探测深度时空推理作为音频4D智能

Zihan Liu, Zhikang Niu, Qiuyang Xiao, Zhisheng Zheng, Ruoqi Yuan, Yuhang Zang, Yuhang Cao, Xiaoyi Dong, Jianze Liang, Xie Chen, Leilei Sun, Dahua Lin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 STAR-Bench通过测试音频4D智能,揭示了模型在细粒度感知和推理上的不足,为未来模型发展提供方向。

Comments Homepage: https://internlm.github.io/StarBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13361 2025-12-01 cs.CV cs.AI 79%

VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs

VLMs有隧道视野:评估领先VLMs的非局部视觉推理能力

Shmuel Berman, Jia Deng

机构 * Princeton University(普林斯顿大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了领先VLMs的非局部视觉推理能力,发现其在复杂视觉任务上表现不佳,缺乏人类核心视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21902 2025-12-01 cs.CV cs.AI 79%

PathReasoning: A multimodal reasoning agent for query-based ROI navigation on whole-slide images

PathReasoning: 一种用于基于查询的全滑片图像区域感兴趣点(ROI)导航的多模态推理代理

Kunpeng Zhang, Hanwen Xu, Sheng Wang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 PathReasoning通过多模态推理代理实现基于查询的全滑片图像ROI导航,显著提升诊断准确性与报告生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18450 2025-11-25 cs.AI 79%

ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints

ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试

Rui Xu, Dakuan Lu, Zicheng Zhao, Xiaoyu Tan, Xintao Wang, Siyu Yuan, Jiangjie Chen, Yinghui Xu

机构 * Fudan University(复旦大学) SII INF Technology(INF技术)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏