arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3361 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3361 篇

2412.14171 2025-07-04 cs.CV 67%

Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces

Jihan Yang, Shusheng Yang, Anjali W. Gupta, Rilyn Han, Li Fei-Fei, Saining Xie

机构 * New York University(纽约大学) Yale University(耶鲁大学) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

Comments Project page: https://vision-x-nyu.github.io/thinking-in-space.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17221 2025-06-26 cs.CV 67%

VLN-R1: Vision-Language Navigation via Reinforcement Fine-Tuning

Zhangyang Qi, Zhixiong Zhang, Yizhou Yu, Jiaqi Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments project page: vlnr1.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16205 2025-06-19 cs.CR cs.AI cs.CL cs.LG 67%

LLMs can be Dangerous Reasoners: Analyzing-based Jailbreak Attack on Large Language Models

Shi Lin, Hongming Yang, Rongchang Li, Xun Wang, Changting Lin, Wenpeng Xing, Meng Han

机构 * Zhejiang Gongshang University(浙江工商大学) Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10069 2025-06-18 cs.RO cs.CV 67%

SmartWay: Enhanced Waypoint Prediction and Backtracking for Zero-Shot Vision-and-Language Navigation

Xiangyu Shi, Zerui Li, Wenqi Lyu, Jiatong Xia, Feras Dayoub, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning at the University of Adelaide(澳大利亚机器学习研究所(阿德莱德大学))

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments Accepted by IROS 2025. Project website: https://sxyxs.github.io/smartway/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10966 2025-06-13 cs.RO 67%

GENMANIP: LLM-driven Simulation for Generalizable Instruction-Following Manipulation

Ning Gao, Yilun Chen, Shuai Yang, Xinyi Chen, Yang Tian, Hao Li, Haifeng Huang, Hanqing Wang, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06487 2025-06-10 cs.RO 67%

BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation

Zibo Zhou, Yue Hu, Lingkai Zhang, Zonglin Li, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16310 2025-05-29 cs.CV 67%

Functionality understanding and segmentation in 3D scenes

Jaime Corsetti, Francesco Giuliari, Alice Fasoli, Davide Boscaini, Fabio Poiesi

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Trento(特伦托大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

Comments CVPR 2025 Highlight. Camera ready version. 20 pages, 12 figures, 7 tables. Fixed typo in Eq.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03757 2025-05-09 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding

Yunze Man, Shuhong Zheng, Zhipeng Bao, Martial Hebert, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024. Project page: https://yunzeman.github.io/lexicon3d Github: https://github.com/YunzeMan/Lexicon3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13966 2025-03-19 cs.CV cs.RO 67%

FlexVLN: Flexible Adaptation for Diverse Vision-and-Language Navigation Tasks

Siqi Zhang, Yanyuan Qiao, Qunbo Wang, Longteng Guo, Zhihua Wei, Jing Liu

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11794 2025-03-18 cs.CV cs.AI cs.CL cs.LG 67%

Semantic-Clipping: Efficient Vision-Language Modeling with Semantic-Guidedd Visual Selection

Bangzheng Li, Fei Wang, Wenxuan Zhou, Nan Xu, Ben Zhou, Sheng Zhang, Hoifung Poon, Muhao Chen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08330 2025-03-12 cs.RO 67%

KiteRunner: Language-Driven Cooperative Local-Global Navigation Policy with UAV Mapping in Outdoor Environments

Shibo Huang, Chenfan Shi, Jian Yang, Hanlin Dong, Jinpeng Mi, Ke Li, Jianfeng Zhang, Miao Ding, Peidong Liang, Xiong You, Xian Wei

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06313 2025-03-11 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Advancing Autonomous Vehicle Intelligence: Deep Learning and Multimodal LLM for Traffic Sign Recognition and Robust Lane Detection

Chandan Kumar Sah, Ankit Kumar Shaw, Xiaoli Lian, Arsalan Shahid Baig, Tuopu Wen, Kun Jiang, Mengmeng Yang, Diange Yang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08202 2025-02-19 cs.CV cs.AI cs.CL cs.LG 67%

What Makes a Maze Look Like a Maze?

Joy Hsu, Jiayuan Mao, Joshua B. Tenenbaum, Noah D. Goodman, Jiajun Wu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00358 2025-01-10 cs.CV 67%

Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding

Yue Fan, Xiaojian Ma, Rongpeng Su, Jun Guo, Rujie Wu, Xi Chen, Qing Li

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments project page: https://embodied-videoagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02938 2024-11-06 cs.RO 67%

Multi-Modal 3D Scene Graph Updater for Shared and Dynamic Environments

Emilio Olivastri, Jonathan Francis, Alberto Pretto, Niko Sünderhauf, Krishan Rana

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments This paper has been accepted at the Workshop on Lifelong Learning for Home Robots at the 8th Conference on Robot Learning (CoRL 2024), Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18722 2024-10-15 cs.RO cs.CV 67%

Towards Open-World Grasping with Large Vision-Language Models

Georgios Tziafas, Hamidreza Kasaei

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments 8th Conference on Robot Learning (CoRL 2024), Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08189 2024-10-11 cs.CV cs.RO 67%

SG-Nav: Online 3D Scene Graph Prompting for LLM-based Zero-shot Object Navigation

Hang Yin, Xiuwei Xu, Zhenyu Wu, Jie Zhou, Jiwen Lu

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

Comments Accepted to NeurIPS 2024. Project page: https://bagh2178.github.io/SG-Nav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11801 2024-08-22 cs.CV 67%

Story3D-Agent: Exploring 3D Storytelling Visualization with Large Language Models

Yuzhou Huang, Yiran Qin, Shunlin Lu, Xintao Wang, Rui Huang, Ying Shan, Ruimao Zhang

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract)

Comments Project page: https://yuzhou914.github.io/Story3D-Agent/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06094 2024-07-12 cs.CV cs.AI cs.CL cs.LG 67%

Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding

Mu Cai, Zeyi Huang, Yuheng Li, Utkarsh Ojha, Haohan Wang, Yong Jae Lee

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15852 2024-07-02 cs.CV cs.RO 67%

NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation

Jiazhao Zhang, Kunyu Wang, Rongtao Xu, Gengze Zhou, Yicong Hong, Xiaomeng Fang, Qi Wu, Zhizheng Zhang, He Wang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments Accepted by Robotics: Science and Systems (RSS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12289 2024-06-26 cs.CV 67%

DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models

Xiaoyu Tian, Junru Gu, Bailin Li, Yicheng Liu, Yang Wang, Zhiyong Zhao, Kun Zhan, Peng Jia, Xianpeng Lang, Hang Zhao

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments Project Page: https://tsinghua-mars-lab.github.io/DriveVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00449 2024-05-02 cs.LG cs.AI cs.CL cs.IR cs.NE 67%

RAG-based Explainable Prediction of Road Users Behaviors for Automated Driving using Knowledge Graphs and Large Language Models

Mohamed Manzour Hussien, Angie Nataly Melo, Augusto Luis Ballardini, Carlota Salinas Maldonado, Rubén Izquierdo, Miguel Ángel Sotelo

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19696 2024-05-01 cs.CV cs.AI cs.CL cs.LG 67%

Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners

Chun Feng, Joy Hsu, Weiyu Liu, Jiajun Wu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments CVPR 2024. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06405 2024-04-12 cs.AI cs.CG cs.CL cs.LG 67%

Wu's Method can Boost Symbolic AI to Rival Silver Medalists and AlphaGeometry to Outperform Gold Medalists at IMO Geometry

Shiven Sinha, Ameya Prabhu, Ponnurangam Kumaraguru, Siddharth Bhat, Matthias Bethge

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in Progress. Released for wider feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04242 2024-04-08 cs.CV cs.AI cs.CL cs.LG 67%

Physical Property Understanding from Language-Embedded Feature Fields

Albert J. Zhai, Yuan Shen, Emily Y. Chen, Gloria X. Wang, Xinlei Wang, Sheng Wang, Kaiyu Guan, Shenlong Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments CVPR 2024. Project page (with code): https://ajzhai.github.io/NeRF2Physics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15637 2024-03-26 cs.RO 67%

CoNVOI: Context-aware Navigation using Vision Language Models in Outdoor and Indoor Environments

Adarsh Jagan Sathyamoorthy, Kasun Weerakoon, Mohamed Elnoor, Anuj Zore, Brian Ichter, Fei Xia, Jie Tan, Wenhao Yu, Dinesh Manocha

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract)

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08244 2024-03-22 cs.RO 67%

Language and Sketching: An LLM-driven Interactive Multimodal Multitask Robot Navigation Framework

Weiqin Zu, Wenbin Song, Ruiqing Chen, Ze Guo, Fanglei Sun, Zheng Tian, Wei Pan, Jun Wang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01248 2024-03-05 cs.CV cs.AI cs.CL cs.LG 67%

SceneCraft: An LLM Agent for Synthesizing 3D Scene as Blender Code

Ziniu Hu, Ahmet Iscen, Aashi Jain, Thomas Kipf, Yisong Yue, David A. Ross, Cordelia Schmid, Alireza Fathi

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12728 2024-03-05 cs.CV cs.AI cs.CL cs.IR cs.LG 67%

Modality-Aware Integration with Large Language Models for Knowledge-based Visual Question Answering

Junnan Dong, Qinggang Zhang, Huachi Zhou, Daochen Zha, Pai Zheng, Xiao Huang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages,3 figures and 1 page appendix; The processed graphs and codes will be avalibale

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17793 2024-02-29 cs.AI cs.CL cs.LG 67%

A Surprising Failure? Multimodal LLMs and the NLVR Challenge

Anne Wu, Kianté Brantley, Yoav Artzi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏