arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3352 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3352 篇

2507.17659 2025-08-14 cs.CV 78%

See the Forest and the Trees: A Synergistic Reasoning Framework for Knowledge-Based Visual Question Answering

Junjie Wang, Yunhan Tang, Yijie Wang, Zhihao Yuan, Huan Wang, Yangfan He, Bin Li

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments We are withdrawing this preprint because it is undergoing a major revision and restructuring. We feel that the current version does not convey our core contributions and methodology with sufficient clarity and accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16805 2025-08-12 cs.CV 78%

Co-VisiON: Co-Visibility ReasONing on Sparse Image Sets of Indoor Scenes

Chao Chen, Nobel Dang, Juexiao Zhang, Wenkai Sun, Pengfei Zheng, Xuhang He, Yimeng Ye, Jiasheng Zhang, Taarun Srinivas, Chen Feng

机构 * New York University(纽约大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18525 2025-08-11 cs.RO 78%

RoboTron-Nav: A Unified Framework for Embodied Navigation Integrating Perception, Planning, and Prediction

Yufeng Zhong, Chengjian Feng, Feng Yan, Fanfan Liu, Liming Zheng, Lin Ma

机构 * Meituan(美团)

专题命中 视觉空间推理 :planning(title,abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13927 2025-08-05 cs.CV 78%

Multimodal 3D Reasoning Segmentation with Complex Scenes

Xueying Jiang, Lewei Lu, Ling Shao, Shijian Lu

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00356 2025-08-04 cs.CV cs.MA 78%

Analyze-Prompt-Reason: A Collaborative Agent-Based Framework for Multi-Image Vision-Language Reasoning

Angelos Vlachos, Giorgos Filandrianos, Maria Lymperaiou, Nikolaos Spanos, Ilias Mitsouras, Vasileios Karampinis, Athanasios Voulodimos

机构 * Artificial Intelligence and Learning Systems Laboratory, National Technical University of Athens(人工智能与学习系统实验室,国家技术大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23772 2025-08-01 cs.CV 78%

SeqAffordSplat: Scene-level Sequential Affordance Reasoning on 3D Gaussian Splatting

Di Li, Jie Feng, Jiahao Chen, Weisheng Dong, Guanbin Li, Yuhui Zheng, Mingtao Feng, Guangming Shi

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17382 2025-07-28 q-bio.NC cs.CV 78%

Unraveling the geometry of visual relational reasoning

Jiaqi Shang, Gabriel Kreiman, Haim Sompolinsky

机构 * Program in Neuroscience, Harvard Medical School(神经科学项目,哈佛医学院) Boston Children’s Hospital, Harvard Medical School(波士顿儿童医院,哈佛医学院) Center for Brains, Minds, and Machines(大脑、心智与机器中心) Edmond and Lily Safra Center for Brain Sciences, Hebrew University(埃德蒙与莉莉·萨弗脑科学中心,希伯来大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 27 pages, 7 figures, 8 SI figures, 2 SI tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15804 2025-07-11 cs.CV 78%

STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs

Zongzhao Li, Zongyang Ma, Mingze Li, Songyou Li, Yu Rong, Tingyang Xu, Ziqi Zhang, Deli Zhao, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) DAMO Academy, Alibaba Group, Hangzhou, China(阿里云达摩院) Hupan Lab, Hangzhou, China(杭州华普实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06719 2025-07-10 cs.CV cs.RO 78%

A Neural Representation Framework with LLM-Driven Spatial Reasoning for Open-Vocabulary 3D Visual Grounding

Zhenyang Liu, Sixiao Zheng, Siyu Chen, Cairong Zhao, Longfei Liang, Xiangyang Xue, Yanwei Fu

机构 * Fudan University, Shanghai Innovation Institute(复旦大学) Zhejiang University(浙江大学) Tongji University(同济大学) NeuHelium Co., Ltd(NeuHelium公司) Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05798 2025-07-09 cs.CV 78%

SPADE: Spatial-Aware Denoising Network for Open-vocabulary Panoptic Scene Graph Generation with Long- and Local-range Context Reasoning

Xin Hu, Ke Qin, Guiduo Duan, Ming Li, Yuan-Fang Li, Tao He

机构 * The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省 Ubiquitous Intelligence and Trusted Services 重点实验室) Monash University(墨尔本大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04699 2025-07-08 cs.CV 78%

A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets

Zexi Jia, Chuanwei Huang, Hongyan Fei, Yeshuang Zhu, Zhiqiang Yuan, Ying Deng, Jiapei Zhang, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc, China(腾讯公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02978 2025-07-08 cs.CV 78%

Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models

Jiahuan Zhang, Shunwen Bai, Tianheng Wang, Kaiwen Guo, Kai Han, Guozheng Rao, Kaicheng Yu

机构 * Autolab, Westlake University(Autolab,西拉丘吉大学) Tianjin University(天津大学) Zhejiang University(浙江大学) Capital Normal University(首都师范大学) University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23352 2025-07-01 cs.CV 78%

GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields

Shunsuke Yasuki, Taiki Miyanishi, Nakamasa Inoue, Shuhei Kurita, Koya Sakamoto, Daichi Azuma, Masato Taki, Yutaka Matsuo

机构 * Rikkyo University(立命馆大学) University of Tokyo(东京大学) ATR(ATR研究所) Institute of Science Tokyo(东京科学研究院) National Institute of Informatics(国家信息研究所) NII LLMC(日本信息处理学会LLMC) Sony Semiconductor Solutions(索尼半导体解决方案)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23120 2025-07-01 cs.CV 78%

Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation

Zhenhua Ning, Zhuotao Tian, Shaoshuai Shi, Guangming Lu, Daojing He, Wenjie Pei, Li Jiang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21924 2025-06-30 cs.CV 78%

SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding

Zhao Jin, Rong-Cheng Tu, Jingyi Liao, Wenhao Sun, Xiao Luo, Shunyu Liu, Dacheng Tao

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17545 2025-06-24 cs.CV 78%

Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations

Zhihao Yuan, Shuyi Jiang, Chun-Mei Feng, Yaolun Zhang, Shuguang Cui, Zhen Li, Na Zhao

机构 * FNii-Shenzhen, CUHKSZ(FNii深圳,香港科技大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16701 2025-06-23 cs.CV 78%

Language-driven Description Generation and Common Sense Reasoning for Video Action Recognition

Xiaodan Hu, Chuhang Zou, Suchen Wang, Jaechul Kim, Narendra Ahuja

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon.com LLC(亚马逊公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04623 2025-06-20 cs.CV eess.AS 78%

EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning

Zhenghao Xing, Xiaowei Hu, Chi-Wing Fu, Wenhai Wang, Jifeng Dai, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14233 2025-06-18 cs.RO 78%

Narrate2Nav: Real-Time Visual Navigation with Implicit Language Reasoning in Human-Centric Environments

Amirreza Payandeh, Anuj Pokhrel, Daeun Song, Marcos Zampieri, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) Department of Information Sciences and Technology, George Mason University(信息科学与技术系,乔治·马歇尔大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24718 2025-06-10 cs.CV 78%

Reinforcing Video Reasoning with Focused Thinking

Jisheng Dang, Jingze Wu, Teng Wang, Xuanhui Lin, Nannan Zhu, Hongbo Chen, Wei-Shi Zheng, Meng Wang, Tat-Seng Chua

机构 * Sun Yat-sen University(中山大学) Lanzhou University(兰州大学) University of Hong Kong(香港大学) Hefei University of Technology(合肥工业大学) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04837 2025-06-06 cs.CV 78%

OpenMaskDINO3D : Reasoning 3D Segmentation via Large Language Model

Kunshen Zhang

机构 * Wuhan University(武汉大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Project Page: https://github.com/Zhangkuns/OpenMaskDINO3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10042 2025-06-05 cs.CV 78%

EscapeCraft: A 3D Room Escape Environment for Benchmarking Complex Multimodal Reasoning Ability

Ziyue Wang, Yurui Dong, Fuwen Luo, Minyuan Ruan, Zhili Cheng, Chi Chen, Peng Li, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) School of Management, Fudan University, Shanghai, China(管理学院,复旦大学,上海,中国)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01371 2025-06-03 cs.CV 78%

SVQA-R1: Reinforcing Spatial Reasoning in MLLMs via View-Consistent Reward Optimization

Peiyao Wang, Haibin Ling

机构 * Department of Computer Science, Stony Brook University(计算机科学系,石板溪大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24257 2025-06-02 cs.CV 78%

Out of Sight, Not Out of Context? Egocentric Spatial Reasoning in VLMs Across Disjoint Frames

Sahithya Ravi, Gabriel Sarch, Vibhav Vineet, Andrew D. Wilson, Balasaravanan Thoravi Kumaravel

机构 * University of British Columbia(不列颠哥伦比亚大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Research, Redmond WA(微软研究院(红mond, WA))

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00954 2025-05-29 cs.CV 78%

Hypo3D: Exploring Hypothetical Reasoning in 3D

Ye Mao, Weixun Luo, Junpeng Jing, Anlan Qiu, Krystian Mikolajczyk

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 24 pages, 15 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20777 2025-05-28 cs.CV 78%

TACO: Think-Answer Consistency for Optimized Long-Chain Reasoning and Efficient Data Learning via Reinforcement Learning in LVLMs

Zhehan Kan, Yanlin Liu, Kun Yin, Xinghua Jiang, Xin Li, Haoyu Cao, Yinsong Liu, Deqiang Jiang, Xing Sun, Qingmin Liao, Wenming Yang

机构 * Tencent YouTu Lab(腾讯YouTu实验室)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16517 2025-05-27 cs.RO cs.CV 78%

ManipLVM-R1: Reinforcement Learning for Reasoning in Embodied Manipulation with Large Vision-Language Models

Zirui Song, Guangxian Ouyang, Mingzhe Li, Yuheng Ji, Chenxi Wang, Zixiang Xu, Zeyu Zhang, Xiaoqing Zhang, Qian Jiang, Zhenhao Chen, Zhongzhi Li, Rui Yan, Xiuying Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德·本·扎耶德人工智能大学) ByteDance(字节跳动) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Australia National University(澳大利亚国立大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 14pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16663 2025-05-23 cs.CV cs.MM 78%

CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation

Haihong Hao, Mingfei Han, Changlin Li, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01805 2025-05-22 cs.CV 78%

SpaceR: Reinforcing MLLMs in Video Spatial Reasoning

Kun Ouyang, Yuanxin Liu, Haoning Wu, Yi Liu, Hao Zhou, Jie Zhou, Fandong Meng, Xu Sun

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) Nanyang Technological University(南洋理工大学) WeChat AI, Tencent Inc., China(微信AI,腾讯公司,中国)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11907 2025-05-20 cs.CV 78%

Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?

Zihao Dongfang, Xu Zheng, Ziqiao Weng, Yuanhuiyi Lyu, Danda Pani Paudel, Luc Van Gool, Kailun Yang, Xuming Hu

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏