arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2406.08451 2025-08-04 cs.CV 50%

GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices

Quanfeng Lu, Wenqi Shao, Zitao Liu, Lingxiao Du, Fanqing Meng, Boxuan Li, Botong Chen, Siyuan Huang, Kaipeng Zhang, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视觉空间推理 :reasoning(abstract)

Comments 22 pages, 14 figures, ICCV 2025, a cross-app GUI navigation dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20216 2025-08-01 cs.CV 50%

Dual-Stream Global-Local Feature Collaborative Representation Network for Scene Classification of Mining Area

Shuqi Fan, Haoyi Wang, Xianju Li

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted to IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21778 2025-07-30 cs.CV 50%

AU-LLM: Micro-Expression Action Unit Detection via Enhanced LLM-Based Feature Fusion

Zhishu Liu, Kaishen Yuan, Bo Zhao, Yong Xu, Zitong Yu

机构 * Great Bay University(大湾大学) Harbin Institute of Technology , Shenzhen(哈尔滨工业大学(深圳))

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21493 2025-07-30 cs.GR 50%

BANG: Dividing 3D Assets via Generative Exploded Dynamics

Longwen Zhang, Qixuan Zhang, Haoran Jiang, Yinuo Bai, Wei Yang, Lan Xu, Jingyi Yu

专题命中 视觉空间推理 :reasoning(abstract)

Comments Homepage: https://sites.google.com/view/bang7355608

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13985 2025-07-30 cs.CV 50%

DreamScene: 3D Gaussian-based End-to-end Text-to-3D Scene Generation

Haoran Li, Yuli Tian, Kun Lan, Yong Liao, Lin Wang, Pan Hui, Peng Yuan Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科学理工大学) University of Helsinki(赫尔辛基大学) Aarhus University(奥胡斯大学)

专题命中 视觉空间推理 :planning(abstract)

Comments Extended version of ECCV 2024 paper "DreamScene"

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19860 2025-07-29 cs.RO cs.MA cs.SY eess.SY 50%

Homotopy-aware Multi-agent Navigation via Distributed Model Predictive Control

Haoze Dong, Meng Guo, Chengyi He, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(先进制造与机器人学院,北京大学) School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北航)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16466 2025-07-29 cs.HC 50%

SceneLoom: Communicating Data with Scene Context

Lin Gao, Leixian Shen, Yuheng Zhao, Jiexiang Lan, Huamin Qu, Siming Chen

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13629 2025-07-29 cs.CV 50%

FreeQ-Graph: Free-form Querying with Semantic Consistent Scene Graph for 3D Scene Understanding

Chenlu Zhan, Yufei Zhang, Gaoang Wang, Hongwei Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Biomedical Engineering and Instrument Science, Zhejiang University(浙江大学生物医学工程与仪器科学学院) Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合学院)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14683 2025-07-29 cs.CV 50%

Emerging Properties in Unified Multimodal Pretraining

Chaorui Deng, Deyao Zhu, Kunchang Li, Chenhui Gou, Feng Li, Zeyu Wang, Shu Zhong, Weihao Yu, Xiaonan Nie, Ziang Song, Guang Shi, Haoqi Fan

机构 * ByteDance Seed(字节跳动种子) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) Monash University(墨尔本大学) Hong Kong University of Science and Technology(香港科学与技术大学) UC Santa Cruz(加州大学圣克ruz分校)

专题命中 视觉空间推理 :reasoning(abstract)

Comments 37 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19232 2025-07-28 cs.CV 50%

Event-Driven Storytelling with Multiple Lifelike Humans in a 3D Scene

Donggeun Lim, Jinseok Bae, Inwoo Hwang, Seungmin Lee, Hwanhee Lee, Young Min Kim

机构 * Seoul National University(首尔国立大学) Chung-Ang University(Chung-Ang 大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments 16 pages, project page: https://rms0329.github.io/Event-Driven-Storytelling/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20289 2025-07-22 cs.CV 50%

VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection

Zeyi Huang, Yuyang Ji, Anirudh Sundara Rajan, Zefan Cai, Wen Xiao, Haohan Wang, Junjie Hu, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Microsoft(微软) UIUC(伊利诺伊大学香槟分校)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15475 2025-07-22 cs.CV 50%

Cube: A Roblox View of 3D Intelligence

Foundation AI Team, Kiran Bhat, Nishchaie Khanna, Karun Channa, Tinghui Zhou, Yiheng Zhu, Xiaoxia Sun, Charles Shang, Anirudh Sudarshan, Maurice Chu, Daiqing Li, Kangle Deng, Jean-Philippe Fauconnier, Tijmen Verhulsdonck, Maneesh Agrawala, Kayvon Fatahalian, Alexander Weiss, Christian Reiser, Ravi Kiran Chirravuri, Ravali Kandur, Alejandro Pelaez, Akash Garg, Michael Palleschi, Jessica Wang, Skylar Litz, Leon Liu, Anying Li, David Harmon, Derek Liu, Liangjun Feng, Denis Goupil, Lukas Kuczynski, Jihyun Yoon, Naveen Marri, Peiye Zhuang, Yinan Zhang, Brian Yin, Haomiao Jiang, Marcel van Workum, Thomas Lane, Bryce Erickson, Salil Pathare, Kyle Price, Steve Han, Yiqing Wang, Anupam Singh, David Baszucki

机构 * Foundation AI Team(基础人工智能团队)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Our code and model weights can be found at: https://github.com/Roblox/cube

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12123 2025-07-17 cs.CV 50%

Open-Vocabulary Indoor Object Grounding with 3D Hierarchical Scene Graph

Sergey Linok, Gleb Naumov

机构 * Moscow Institute of Physics and Technology(莫斯科物理技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

Comments 13 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09195 2025-07-15 cs.SD eess.AS 50%

Towards Spatial Audio Understanding via Question Answering

Parthasaarathy Sudarsanam, Archontis Politis

机构 * Audio Research Group, Tampere University, Tampere, Finland(塔尔皮奥大学音频研究组)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08367 2025-07-14 cs.CV cs.SY eess.SY 50%

Understanding Driving Risks using Large Language Models: Toward Elderly Driver Assessment

Yuki Yoshihara, Linjing Jiang, Nihan Karatas, Hitoshi Kanamori, Asuka Harada, Takahiro Tanaka

机构 * Institutes of Innovation for Future Society, Nagoya University, Japan(面向未来的创新研究所,名古屋大学,日本)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08617 2025-07-10 cs.CV 50%

OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning

Zhaochen Su, Linjie Li, Mingyang Song, Yunzhuo Hao, Zhengyuan Yang, Jun Zhang, Guanjie Chen, Jiawei Gu, Juntao Li, Xiaoye Qu, Yu Cheng

机构 * Soochow University(苏州大学) Microsoft(微软) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02600 2025-07-04 cs.RO 50%

ArtGS:3D Gaussian Splatting for Interactive Visual-Physical Modeling and Manipulation of Articulated Objects

Qiaojun Yu, Xibin Yuan, Yu jiang, Junting Chen, Dongzhe Zheng, Ce Hao, Yang You, Yixing Chen, Yao Mu, Liu Liu, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(国立新加坡大学) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Hefei University of Technology(合肥工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01800 2025-07-03 cs.CV cs.MM 50%

HCNQA: Enhancing 3D VQA with Hierarchical Concentration Narrowing Supervision

Shengli Zhou, Jianuo Zhu, Qilin Huang, Fangjing Wang, Yanfu Zhang, Feng Zheng

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学,深圳,中国) College of William and Mary, Williamsburg, VA 23185, USA(威廉玛丽学院,威廉斯堡,VA 23185,美国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICANN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23309 2025-07-02 eess.IV cs.CV 50%

SurgTPGS: Semantic 3D Surgical Scene Understanding with Text Promptable Gaussian Splatting

Yiming Huang, Long Bai, Beilei Cui, Kun Yuan, Guankun Wang, Mobarak I. Hoque, Nicolas Padoy, Nassir Navab, Hongliang Ren

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Shenzhen Research Institute, CUHK, Shenzhen, China(深圳研究学院) Technical University of Munich, Munich, Germany(慕尼黑技术大学) University of Strasbourg & IHU Strasbourg, Strasbourg, France(斯特拉斯堡大学及斯特拉斯堡IHU) University College London, London, United Kingdom(伦敦大学学院)

专题命中 视觉空间推理 :planning(abstract)

Comments MICCAI 2025. Project Page: MICCAI-2025-SurgTPGS/" target="_blank" rel="noopener">https://lastbasket.github.io/MICCAI-2025-SurgTPGS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00348 2025-07-01 cs.CV 50%

Vision Technologies with Applications in Traffic Surveillance Systems: A Holistic Survey

Wei Zhou, Li Yang, Lei Zhao, Runyu Zhang, Yifan Cui, Hongpu Huang, Kun Qie, Chen Wang

机构 * School of Automation, Nanjing University of Science and Technology(南京理工大学自动化学院) School of Transportation, Southeast University(东南大学交通学院) Beijing Laboratory of General Aviation Technology, Beijing University of Civil Engineering and Architecture(北京建筑大学通用航空技术实验室)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21250 2025-06-27 cs.RO 50%

ACTLLM: Action Consistency Tuned Large Language Model

Jing Bi, Lianggong Bruce Wen, Zhang Liu, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Corning Inc.(康宁公司)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20134 2025-06-26 cs.CV 50%

From 2D to 3D Cognition: A Brief Survey of General World Models

Ningwei Xie, Zizi Tian, Lei Yang, Xiao-Ping Zhang, Meng Guo, Jie Li

机构 * China Mobile Research Institute(中国移动研究院) Shenzhen Ubiquitous Data Enabling Key Lab, Shenzhen International Graduate School, Tsinghua University(深圳无处不在数据赋能重点实验室、深圳国际研究生院、清华大学)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19639 2025-06-25 cs.CV 50%

HOIverse: A Synthetic Scene Graph Dataset With Human Object Interactions

Mrunmai Vivek Phatak, Julian Lorenz, Nico Hörmann, Jörg Hähner, Rainer Lienhart

机构 * Computer Vision Lab Universität Augsburg(计算机视觉实验室,乌尔姆大学) Organic Computing Lab Universität Augsburg(有机计算实验室,乌尔姆大学)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16401 2025-06-23 cs.CY cs.CV 50%

TrajSceneLLM: A Multimodal Perspective on Semantic GPS Trajectory Analysis

Chunhou Ji, Qiumeng Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 视觉空间推理 :reasoning(abstract)

Comments Under review for ACM SIGSPATIAL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10295 2025-06-23 cs.RO 50%

ControlMTR: Control-Guided Motion Transformer with Scene-Compliant Intention Points for Feasible Motion Prediction

Jiawei Sun, Chengran Yuan, Shuo Sun, Shanze Wang, Yuhang Han, Shuailei Ma, Zefan Huang, Anthony Wong, Keng Peng Tee, Marcelo H. Ang

机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系) College of Information Science and Engineering, Northeastern University(东北大学信息科学与工程学院) Moovita Pte Ltd(Moovita公司)

专题命中 视觉空间推理 :planning(abstract)

Journal ref 2024 IEEE 27th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02566 2025-06-23 eess.IV cs.CV 50%

Enhancing Weakly Supervised 3D Medical Image Segmentation through Probabilistic-aware Learning

Runmin Jiang, Zhaoxin Fan, Junhao Wu, Lenghan Zhu, Xin Huang, Tianyang Wang, Heng Huang, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Towson University(托森大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) University of Maryland(马里兰大学)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16010 2025-06-23 cs.HC 50%

SimuPanel: A Novel Immersive Multi-Agent System to Simulate Interactive Expert Panel Discussion

Xiangyang He, Jiale Li, Jiahao Chen, Yang Yang, Mingming Fan

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15096 2025-06-19 cs.RO 50%

DyNaVLM: Zero-Shot Vision-Language Navigation System with Dynamic Viewpoints and Self-Refining Graph Memory

Zihe Ji, Huangxuan Lin, Yue Gao

机构 * SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎精英技术研究所) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) MoE Key Lab of Artificial Intelligence and AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能与AI研究所)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13762 2025-06-17 cs.RO cs.CV 50%

Touch begins where vision ends: Generalizable policies for contact-rich manipulation

Zifan Zhao, Siddhant Haldar, Jinda Cui, Lerrel Pinto, Raunaq Bhirangi

机构 * New York University Shanghai(纽约大学上海分校) New York University(纽约大学) Honda Research(本田研究)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11852 2025-06-16 eess.IV 50%

3D Skin Segmentation Methods in Medical Imaging: A Comparison

Martina Paccini, Giuseppe Patanè

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏