arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3328 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3328 篇

2504.20024 2025-06-11 cs.CV 82%

SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning

Wufei Ma, Yu-Cheng Chou, Qihao Liu, Xingrui Wang, Celso de Melo, Jianwen Xie, Alan Yuille

机构 * DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室) Lambda Inc(Lambda公司)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

Comments Project page: https://spatial-reasoner.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16770 2025-05-26 cs.CV 82%

RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs

Meng-Hao Guo, Xuanyu Chu, Qianrui Yang, Zhe-Han Mo, Yiqing Shen, Pei-lin Li, Xinjie Lin, Jinnian Zhang, Xin-Sheng Chen, Yi Zhang, Kiyohiro Nakayama, Zhengyang Geng, Houwen Peng, Han Hu, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan X(腾讯文英实验室) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract)

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14432 2025-05-05 cs.CV 82%

Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models

Yuhao Dong, Zuyan Liu, Hai-Long Sun, Jingkang Yang, Winston Hu, Yongming Rao, Ziwei Liu

机构 * S-Lab, NTU(NTU的S-Lab) Tencent(腾讯) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01754 2025-03-21 cs.CV 82%

SDRT: Enhance Vision-Language Models by Self-Distillation with Diverse Reasoning Traces

Guande Wu, Huan Song, Yawei Wang, Qiaojing Yan, Yijun Tian, Lin Lee Cheong, Panpan Xu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04384 2025-02-10 cs.CL cs.AI cs.LG cs.SY eess.SY 82%

Enhancing Reasoning to Adapt Large Language Models for Domain-Specific Applications

Bo Wen, Xin Zhang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024 Workshop AFM (Adaptive Foundation Models: Evolving AI for Personalized and Efficient Learning)

Journal ref https://neurips.cc/virtual/2024/104981

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09024 2025-01-17 cs.CV cs.HC cs.RO 82%

Social-LLaVA: Enhancing Robot Navigation through Human-Language Reasoning in Social Spaces

Amirreza Payandeh, Daeun Song, Mohammad Nazeri, Jing Liang, Praneel Mukherjee, Amir Hossain Raj, Yangzhe Kong, Dinesh Manocha, Xuesu Xiao

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08861 2025-01-16 cs.CV 82%

Generative Planning with 3D-vision Language Pre-training for End-to-End Autonomous Driving

Tengpeng Li, Hanli Wang, Xianfei Li, Wenlong Liao, Tao He, Pai Peng

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15876 2024-12-24 cs.CV 82%

Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation

Shaofei Huang, Rui Ling, Hongyu Li, Tianrui Hui, Zongheng Tang, Xiaoming Wei, Jizhong Han, Si Liu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02655 2024-12-04 cs.RO cs.SY eess.SY 82%

LLM-Enhanced Path Planning: Safe and Efficient Autonomous Navigation with Instructional Inputs

Pranav Doma, Aliasghar Arab, Xuesu Xiao

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09822 2024-11-19 cs.RO 82%

SEEK: Semantic Reasoning for Object Goal Navigation in Real World Inspection Tasks

Muhammad Fadhil Ginting, Sung-Kyun Kim, David D. Fan, Matteo Palieri, Mykel J. Kochenderfer, Ali-akbar Agha-Mohammadi

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

Journal ref Proc. of Robotics: Science and Systems 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13438 2024-10-31 cs.CV 82%

SpatialPIN: Enhancing Spatial Reasoning Capabilities of Vision-Language Models through Prompting and Interacting 3D Priors

Chenyang Ma, Kai Lu, Ta-Ying Cheng, Niki Trigoni, Andrew Markham

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

Comments NeurIPS 2024; Project Page: https://dannymcy.github.io/zeroshot_task_hallucination/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07053 2024-10-04 cs.CV 82%

Multimodal Self-Instruct: Synthetic Abstract Image and Visual Reasoning Instruction Using Language Model

Wenqi Zhang, Zhenglin Cheng, Yuanyu He, Mengna Wang, Yongliang Shen, Zeqi Tan, Guiyang Hou, Mingqian He, Yanna Ma, Weiming Lu, Yueting Zhuang

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

Comments The paper is accepted by EMNLP-24. Code: https://github.com/zwq2018/Multi-modal-Self-instruct dataset: https://huggingface.co/datasets/zwq2018/Multi-modal-Self-instruct Leaderboard: https://multi-modal-self-instruct.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19666 2024-07-30 cs.CV 82%

Take A Step Back: Rethinking the Two Stages in Visual Reasoning

Mingyu Zhang, Jiting Cai, Mingyu Liu, Yue Xu, Cewu Lu, Yong-Lu Li

专题命中 视觉空间推理 :reasoning(title,abstract);logical reasoning(abstract)

Comments ECCV 2024, Project page: https://mybearyzhang.github.io/projects/TwoStageReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12884 2024-07-23 cs.CV 82%

HYDRA: A Hyper Agent for Dynamic Compositional Visual Reasoning

Fucai Ke, Zhixi Cai, Simindokht Jahangard, Weiqing Wang, Pari Delir Haghighi, Hamid Rezatofighi

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

Comments Accepted by ECCV2024. Project page: https://hydra-vl4ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07544 2024-06-27 cs.CV cs.AI cs.CL cs.LG 82%

Situational Awareness Matters in 3D Vision Language Reasoning

Yunze Man, Liang-Yan Gui, Yu-Xiong Wang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments CVPR 2024. Project Page: https://yunzeman.github.io/situation3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18252 2024-06-18 cs.CV cs.AI cs.CL cs.LG cs.MM 82%

Beyond Embeddings: The Promise of Visual Table in Visual Reasoning

Yiwu Zhong, Zi-Yuan Hu, Michael R. Lyu, Liwei Wang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project page: https://github.com/LaVi-Lab/Visual-Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04566 2024-06-10 cs.CL cs.AI cs.LG 82%

SpaRC and SpaRP: Spatial Reasoning Characterization and Path Generation for Understanding Spatial Reasoning Capability of Large Language Models

Md Imbesat Hassan Rizvi, Xiaodan Zhu, Iryna Gurevych

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ACL 2024 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14705 2024-04-24 cs.CV 82%

Think-Program-reCtify: 3D Situated Reasoning with Large Language Models

Qingrong He, Kejun Lin, Shizhe Chen, Anwen Hu, Qin Jin

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03507 2024-02-07 cs.AI cs.CL cs.LG 82%

Neural networks for abstraction and reasoning: Towards broad generalization in machines

Mikel Bober-Irizar, Soumya Banerjee

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 32 pages main text, 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16650 2023-09-29 cs.RO cs.CV 82%

ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning

Qiao Gu, Alihusein Kuwajerwala, Sacha Morin, Krishna Murthy Jatavallabhula, Bipasha Sen, Aditya Agarwal, Corban Rivera, William Paul, Kirsty Ellis, Rama Chellappa, Chuang Gan, Celso Miguel de Melo, Joshua B. Tenenbaum, Antonio Torralba, Florian Shkurti, Liam Paull

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)

Comments Project page: https://concept-graphs.github.io/ Explainer video: https://youtu.be/mRhNkQwRYnc

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16395 2023-08-01 cs.CV cs.AI cs.CL cs.LG 82%

Bridging the Gap: Exploring the Capabilities of Bridge-Architectures for Complex Visual Reasoning Tasks

Kousik Rajesh, Mrigank Raman, Mohammed Asad Karim, Pranit Chawla

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.05226 2023-01-13 cs.CV cs.AI cs.CL cs.LG 82%

See, Think, Confirm: Interactive Prompting Between Vision and Language Models for Knowledge-based Visual Reasoning

Zhenfang Chen, Qinhong Zhou, Yikang Shen, Yining Hong, Hao Zhang, Chuang Gan

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.08587 2021-12-17 cs.CV cs.AI cs.CL cs.LG cs.MM 82%

SGEITL: Scene Graph Enhanced Image-Text Learning for Visual Commonsense Reasoning

Zhecan Wang, Haoxuan You, Liunian Harold Li, Alireza Zareian, Suji Park, Yiqing Liang, Kai-Wei Chang, Shih-Fu Chang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments AAAI 2022

Journal ref AAAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.10300 2021-07-23 cs.CV cs.AI cs.CL cs.LG cs.MM eess.IV 82%

iReason: Multimodal Commonsense Reasoning using Videos and Natural Language with Interpretability

Aman Chadha, Vinija Jain

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.12354 2020-05-19 cs.CV cs.AI cs.CL cs.LG 82%

Touchdown: Natural Language Navigation and Spatial Reasoning in Visual Street Environments

Howard Chen, Alane Suhr, Dipendra Misra, Noah Snavely, Yoav Artzi

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments arXiv admin note: text overlap with arXiv:1809.00786

Journal ref Published in CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04917 2026-06-19 cs.CV cs.AI cs.CL 版本更新 82%

Vero: An Open RL Recipe for General Visual Reasoning

Vero: 通用视觉推理的开放RL配方

Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Vero系列开放视觉语言模型,通过构建600K样本数据集Vero-600K和任务路由奖励,在30个基准测试中平均提升2.9-5.4点,Vero-Qwen3I-8B超越Qwen3-VL-8B-Thinking 3.8点。

Comments Project page: https://vero-reasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13562 2026-01-21 cs.AI cs.CV cs.LG 82%

Reasoning is a Modality

推理是一种模态

Zhiguang Liu, Yi Shang

机构 * University of Missouri - Columbia(密苏里大学哥伦比亚分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种新的视觉推理方法,通过分离控制器和工作区令牌,实现了更高效的规则执行,从而在ARC任务中取得优于人类和先前方法的准确率。

Comments Code access: https://github.com/lz7fd/Reasoning_is_a_Modality

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01525 2024-07-18 cs.CV cs.AI cs.CL 82%

ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities

Chenming Zhu, Tai Wang, Wenwei Zhang, Kai Chen, Xihui Liu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ECCV 2024. A comprehensive and hierarchical 3D reasoning grounding benchmark in the era of foundation models. Project page: https://zcmax.github.io/projects/ScanReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.00363 2023-03-23 cs.CL cs.AI cs.CV 82%

Visual Spatial Reasoning

Fangyu Liu, Guy Emerson, Nigel Collier

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments TACL camera-ready version; code and data available at https://github.com/cambridgeltl/visual-spatial-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03401 2026-06-29 cs.HC cs.AI cs.CV 版本更新 81%

Can LLMs Reason About Attention? Towards Zero-Shot Analysis of Multimodal Classroom Behavior

LLMs能否进行注意力推理?多模态课堂行为的零样本分析

Nolan Platt, Sehrish Nizamani, Alp Tural, Elif Tural, Saad Nizamani, Andrew Katz, Yoonje Lee, Nada Basit

机构 * Virginia Tech(弗吉尼亚理工大学) University of Virginia(弗吉尼亚大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.AI

AI总结 本文提出一个隐私保护的分析流程,利用OpenPose和Gaze-LLE提取学生注意力信息,并通过QwQ-32B-Reasoning进行零样本分析,探讨LLMs在多模态行为理解中的潜力与局限。

Comments 8 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏