arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2503.20382 2025-03-27 cs.CV 50%

RSRWKV: A Linear-Complexity 2D Attention Mechanism for Efficient Remote Sensing Vision Task

Chunshan Li, Rong Wang, Xiaofei Yang, Dianhui Chu

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20020 2025-03-27 cs.RO 50%

Gemini Robotics: Bringing AI into the Physical World

Gemini Robotics Team, Saminda Abeyruwan, Joshua Ainslie, Jean-Baptiste Alayrac, Montserrat Gonzalez Arenas, Travis Armstrong, Ashwin Balakrishna, Robert Baruch, Maria Bauza, Michiel Blokzijl, Steven Bohez, Konstantinos Bousmalis, Anthony Brohan, Thomas Buschmann, Arunkumar Byravan, Serkan Cabi, Ken Caluwaerts, Federico Casarini, Oscar Chang, Jose Enrique Chen, Xi Chen, Hao-Tien Lewis Chiang, Krzysztof Choromanski, David D'Ambrosio, Sudeep Dasari, Todor Davchev, Coline Devin, Norman Di Palo, Tianli Ding, Adil Dostmohamed, Danny Driess, Yilun Du, Debidatta Dwibedi, Michael Elabd, Claudio Fantacci, Cody Fong, Erik Frey, Chuyuan Fu, Marissa Giustina, Keerthana Gopalakrishnan, Laura Graesser, Leonard Hasenclever, Nicolas Heess, Brandon Hernaez, Alexander Herzog, R. Alex Hofer, Jan Humplik, Atil Iscen, Mithun George Jacob, Deepali Jain, Ryan Julian, Dmitry Kalashnikov, M. Emre Karagozler, Stefani Karp, Chase Kew, Jerad Kirkland, Sean Kirmani, Yuheng Kuang, Thomas Lampe, Antoine Laurens, Isabel Leal, Alex X. Lee, Tsang-Wei Edward Lee, Jacky Liang, Yixin Lin, Sharath Maddineni, Anirudha Majumdar, Assaf Hurwitz Michaely, Robert Moreno, Michael Neunert, Francesco Nori, Carolina Parada, Emilio Parisotto, Peter Pastor, Acorn Pooley, Kanishka Rao, Krista Reymann, Dorsa Sadigh, Stefano Saliceti, Pannag Sanketi, Pierre Sermanet, Dhruv Shah, Mohit Sharma, Kathryn Shea, Charles Shu, Vikas Sindhwani, Sumeet Singh, Radu Soricut, Jost Tobias Springenberg, Rachel Sterneck, Razvan Surdulescu, Jie Tan, Jonathan Tompson, Vincent Vanhoucke, Jake Varley, Grace Vesom, Giulia Vezzani, Oriol Vinyals, Ayzaan Wahid, Stefan Welker, Paul Wohlhart, Fei Xia, Ted Xiao, Annie Xie, Jinyu Xie, Peng Xu, Sichun Xu, Ying Xu, Zhuo Xu, Yuxiang Yang, Rui Yao, Sergey Yaroshenko, Wenhao Yu, Wentao Yuan, Jingwei Zhang, Tingnan Zhang, Allan Zhou, Yuxiang Zhou

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18746 2025-03-25 cs.CV 50%

Linguistics-aware Masked Image Modeling for Self-supervised Scene Text Recognition

Yifei Zhang, Chang Liu, Jin Wei, Xiaomeng Yang, Yu Zhou, Can Ma, Xiangyang Ji

专题命中 视觉空间推理 :reasoning(abstract)

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09006 2025-03-25 cs.HC 50%

From Interaction to Impact: Towards Safer AI Agents Through Understanding and Evaluating Mobile UI Operation Impacts

Zhuohao Jerry Zhang, Eldon Schoop, Jeffrey Nichols, Anuj Mahajan, Amanda Swearngin

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07411 2025-03-24 cs.CV cs.MM 50%

EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering

Sheng Zhou, Junbin Xiao, Qingyun Li, Yicong Li, Xun Yang, Dan Guo, Meng Wang, Tat-Seng Chua, Angela Yao

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15091 2025-03-20 cs.RO cs.CV 50%

Intelligent Spatial Perception by Building Hierarchical 3D Scene Graphs for Indoor Scenarios with the Help of LLMs

Yao Cheng, Zhe Han, Fengyang Jiang, Huaizhen Wang, Fengyu Zhou, Qingshan Yin, Lei Wei

专题命中 视觉空间推理 :planning(abstract)

Comments accepted by WRC SARA 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11989 2025-03-20 cs.RO 50%

Dynamic Open-Vocabulary 3D Scene Graphs for Long-term Language-Guided Mobile Manipulation

Zhijie Yan, Shufei Li, Zuoxu Wang, Lixiu Wu, Han Wang, Jun Zhu, Lijiang Chen, Jihong Liu

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted by IEEE Robotics and Automation Letters (RA-L), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13642 2025-03-20 cs.SE 50%

A Multi-Agent Approach to Fault Localization via Graph-Based Retrieval and Reflexion

Md Nakhla Rafi, Dong Jae Kim, Tse-Hsun Chen, Shaowei Wang

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14304 2025-03-19 eess.IV cs.CV 50%

RoMedFormer: A Rotary-Embedding Transformer Foundation Model for 3D Genito-Pelvic Structure Segmentation in MRI and CT

Yuheng Li, Mingzhe Hu, Richard L. J. Qiu, Maria Thor, Andre Williams, Deborah Marshall, Xiaofeng Yang

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14161 2025-03-19 cs.CV 50%

CoSpace: Benchmarking Continuous Space Perception Ability for Vision-Language Models

Yiqi Zhu, Ziyue Wang, Can Zhang, Peng Li, Yang Liu

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10630 2025-03-19 cs.CV cs.RO 50%

UniGoal: Towards Universal Zero-shot Goal-oriented Navigation

Hang Yin, Xiuwei Xu, Lingqing Zhao, Ziwei Wang, Jie Zhou, Jiwen Lu

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to CVPR 2025. Project page: https://bagh2178.github.io/UniGoal/

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07308 2025-03-18 cs.CV 50%

Counterfactual Vision-and-Language Navigation via Adversarial Path Sampling

Tsu-Jui Fu, Xin Eric Wang, Matthew Peterson, Scott Grafton, Miguel Eckstein, William Yang Wang

专题命中 视觉空间推理 :reasoning(abstract)

Comments ECCV'20 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16412 2025-03-18 cs.RO 50%

SARO: Space-Aware Robot System for Terrain Crossing via Vision-Language Model

Shaoting Zhu, Derun Li, Linzhan Mou, Yong Liu, Ningyi Xu, Hang Zhao

专题命中 视觉空间推理 :reasoning(abstract)

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09758 2025-03-14 cs.RO cs.MA 50%

Multi-Agent LLM Actor-Critic Framework for Social Robot Navigation

Weizheng Wang, Ike Obi, Byung-Cheol Min

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07933 2025-03-14 cs.CV 50%

From Slices to Sequences: Autoregressive Tracking Transformer for Cohesive and Consistent 3D Lymph Node Detection in CT Scans

Qinji Yu, Yirui Wang, Ke Yan, Dandan Zheng, Dashan Ai, Dazhou Guo, Zhanghexuan Ji, Yanzhou Su, Yun Bian, Na Shen, Xiaowei Ding, Le Lu, Xianghua Ye, Dakai Jin

专题命中 视觉空间推理 :planning(abstract)

Comments Technical report (11 pages plus supplementary)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08474 2025-03-12 cs.RO 50%

Collaborative Dynamic 3D Scene Graphs for Open-Vocabulary Urban Scene Understanding

Tim Steinke, Martin Büchner, Niclas Vödisch, Abhinav Valada

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08165 2025-03-12 cs.CV 50%

Multimodal Generation of Animatable 3D Human Models with AvatarForge

Xinhang Liu, Yu-Wing Tai, Chi-Keung Tang

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06219 2025-03-11 cs.CV 50%

VLScene: Vision-Language Guidance Distillation for Camera-Based 3D Semantic Scene Completion

Meng Wang, Huilong Pi, Ruihui Li, Yunchuan Qin, Zhuo Tang, Kenli Li

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accept by AAAI-2025(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13573 2025-03-11 cs.RO 50%

Human-Robot Cooperative Distribution Coupling for Hamiltonian-Constrained Social Navigation

Weizheng Wang, Chao Yu, Yu Wang, Byung-Cheol Min

专题命中 视觉空间推理 :planning(abstract)

Comments ICRA2025

Journal ref ICRA2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15505 2025-03-10 cs.RO 50%

Discovering Object Attributes by Prompting Large Language Models with Perception-Action APIs

Angelos Mavrogiannis, Dehao Yuan, Yiannis Aloimonos

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04034 2025-03-07 cs.CV 50%

GaussianGraph: 3D Gaussian-based Scene Graph Generation for Open-world Scene Understanding

Xihan Wang, Dianyi Yang, Yu Gao, Yufeng Yue, Yi Yang, Mengyin Fu

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.09715 2025-03-06 cs.CV 50%

ARM3D: Attention-based relation module for indoor 3D object detection

Yuqing Lan, Yao Duan, Chenyi Liu, Chenyang Zhu, Yueshan Xiong, Hui Huang, Kai Xu

专题命中 视觉空间推理 :reasoning(abstract)

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02111 2025-03-05 cs.RO 50%

NavG: Risk-Aware Navigation in Crowded Environments Based on Reinforcement Learning with Guidance Points

Qianyi Zhang, Wentao Luo, Boyi Liu, Ziyang Zhang, Yaoyuan Wang, Jingtai Liu

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20041 2025-03-05 cs.CV cs.RO 50%

3D-AffordanceLLM: Harnessing Large Language Models for Open-Vocabulary Affordance Detection in 3D Worlds

Hengshuo Chu, Xiang Deng, Qi Lv, Xiaoyang Chen, Yinchuan Li, Jianye Hao, Liqiang Nie

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11087 2025-03-05 cs.CV 50%

Locality Alignment Improves Vision-Language Models

Ian Covert, Tony Sun, James Zou, Tatsunori Hashimoto

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICLR 2025 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03878 2025-03-04 cs.CV 50%

SPARTUN3D: Situated Spatial Understanding of 3D World in Large Language Models

Yue Zhang, Zhiyang Xu, Ying Shen, Parisa Kordjamshidi, Lifu Huang

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05748 2025-02-28 cs.RO 50%

Autonomous Guidewire Navigation for Robot-assisted Endovascular Interventions: A Knowledge-Driven Visual Guidance Approach

Wentao Liu, Weijin Xu, Xiaochuan Li, Bowen Liang, Ziyang He, Mengke Zhu, Jingzhou Song, Huihua Yang, Qingsheng Lu

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05075 2025-02-24 cs.CV 50%

DeepInteraction++: Multi-Modality Interaction for Autonomous Driving

Zeyu Yang, Nan Song, Wei Li, Xiatian Zhu, Li Zhang, Philip H. S. Torr

专题命中 视觉空间推理 :planning(abstract)

Comments Journal extension of NeurIPS 2022. arXiv admin note: text overlap with arXiv:2208.11112

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18295 2025-02-19 cs.CV 50%

Intent3D: 3D Object Detection in RGB-D Scans Based on Human Intention

Weitai Kang, Mengxue Qu, Jyoti Kini, Yunchao Wei, Mubarak Shah, Yan Yan

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13785 2025-02-18 cs.CV 50%

A Spatiotemporal Approach to Tri-Perspective Representation for 3D Semantic Occupancy Prediction

Sathira Silva, Savindu Bhashitha Wannigama, Gihan Jayatilaka, Muhammad Haris Khan, Roshan Ragel

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to the 2025 Workshop on Machine Learning for Autonomous Driving at AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏