arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2501.02863 2025-02-12 cs.SE 50%

Beyond Pass or Fail: Multi-Dimensional Benchmarking of Foundation Models for Goal-based Mobile UI Navigation

Dezhi Ran, Mengzhou Wu, Hao Yu, Yuetong Li, Jun Ren, Yuan Cao, Xia Zeng, Haochuan Lu, Zexin Xu, Mengqian Xu, Ting Su, Liangchao Yao, Ting Xiong, Wei Yang, Yuetang Deng, Assaf Marron, David Harel, Tao Xie

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05396 2025-02-11 eess.IV cs.CV 50%

A Novel Convolutional-Free Method for 3D Medical Imaging Segmentation

Canxuan Gang

专题命中 视觉空间推理 :planning(abstract)

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20551 2025-02-10 cs.RO 50%

UniAff: A Unified Representation of Affordances for Tool Usage and Articulation with Vision-Language Models

Qiaojun Yu, Siyuan Huang, Xibin Yuan, Zhengkai Jiang, Ce Hao, Xin Li, Haonan Chang, Junbo Wang, Liu Liu, Hongsheng Li, Peng Gao, Cewu Lu

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19457 2025-02-10 cs.RO 50%

A Parameter-Efficient Tuning Framework for Language-guided Object Grounding and Robot Grasping

Houjian Yu, Mingen Li, Alireza Rezazadeh, Yang Yang, Changhyun Choi

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted for ICRA 2025. Project page: https://sites.google.com/umn.edu/etog-etrg/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18594 2025-01-31 cs.CV 50%

Foundational Models for 3D Point Clouds: A Survey and Outlook

Vishal Thengane, Xiatian Zhu, Salim Bouzerdoum, Son Lam Phung, Yunpeng Li

专题命中 视觉空间推理 :reasoning(abstract)

Comments Initial submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20631 2025-01-28 cs.CV 50%

Slow Perception: Let's Perceive Geometric Figures Step-by-step

Haoran Wei, Youyang Yin, Yumeng Li, Jia Wang, Liang Zhao, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11327 2025-01-24 cs.CV 50%

ClawMachine: Learning to Fetch Visual Tokens for Referential Comprehension

Tianren Ma, Lingxi Xie, Yunjie Tian, Boyu Yang, Qixiang Ye

专题命中 视觉空间推理 :reasoning(abstract)

Comments ICLR 2025. Code is available at github.com/martian422/ClawMachine

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10733 2025-01-23 cs.CV 50%

A CNN-Transformer for Classification of Longitudinal 3D MRI Images -- A Case Study on Hepatocellular Carcinoma Prediction

Jakob Nolte, Maureen M. J. Guichelaar, Donald E. Bouman, Stephanie M. van den Berg, Maryam Amir Haeri

专题命中 视觉空间推理 :planning(abstract)

Comments Submitted for publication to Biomedical Signal Processing and Control; Incorrect notation corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12128 2025-01-22 cs.RO cs.HC 50%

Evaluating Efficiency and Engagement in Scripted and LLM-Enhanced Human-Robot Interactions

Tim Schreiter, Jens V. Rüppel, Rishi Hazra, Andrey Rudenko, Martin Magnusson, Achim J. Lilienthal

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted as a Late-Breaking Report to the 2025, 20th ACM/IEEE International Conference on Human-Robot Interaction (HRI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09624 2025-01-22 cs.CV cs.RO 50%

GenEx: Generating an Explorable World

Taiming Lu, Tianmin Shu, Junfei Xiao, Luoxin Ye, Jiahao Wang, Cheng Peng, Chen Wei, Daniel Khashabi, Rama Chellappa, Alan Yuille, Jieneng Chen

专题命中 视觉空间推理 :planning(abstract)

Comments Website: GenEx.world

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09167 2025-01-17 cs.CV cs.RO 50%

Embodied Scene Understanding for Vision Language Models via MetaVQA

Weizhen Wang, Chenda Duan, Zhenghao Peng, Yuxin Liu, Bolei Zhou

专题命中 视觉空间推理 :reasoning(abstract)

Comments for the project webpage, see https://metadriverse.github.io/metavqa

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06946 2025-01-14 cs.RO 50%

Learning Implicit Social Navigation Behavior using Deep Inverse Reinforcement Learning

Tribhi Kathuria, Ke Liu, Junwoo Jang, X. Jessie Yang, Maani Ghaffari

专题命中 视觉空间推理 :reasoning(abstract)

Comments 8 pages, Submitted to IEEE Robotics and Automation Letters (RAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11210 2025-01-13 cs.CV 50%

ViPOcc: Leveraging Visual Priors from Vision Foundation Models for Single-View 3D Occupancy Prediction

Yi Feng, Yu Han, Xijing Zhang, Tanghui Li, Yanting Zhang, Rui Fan

专题命中 视觉空间推理 :reasoning(abstract)

Comments accepted to AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11559 2025-01-10 cs.CV 50%

Semi-supervised 3D Semantic Scene Completion with 2D Vision Foundation Model Guidance

Duc-Hai Pham, Duc-Dung Nguyen, Anh Pham, Tuan Ho, Phong Nguyen, Khoi Nguyen, Rang Nguyen

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted at AAAI2025. Project Page: https://vinairesearch.github.io/SemiSSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20742 2024-12-31 cs.CV 50%

UniRS: Unifying Multi-temporal Remote Sensing Tasks through Vision Language Models

Yujie Li, Wenjia Xu, Guangzuo Li, Zijian Yu, Zhiwei Wei, Jiuniu Wang, Mugen Peng

专题命中 视觉空间推理 :reasoning(abstract)

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20233 2024-12-31 cs.MA 50%

Decentralized Unlabeled Multi-Agent Navigation in Continuous Space

Stepan Dergachev, Konstantin Yakovlev

专题命中 视觉空间推理 :planning(abstract)

Comments This is a pre-print of the paper accepted to ICR 2024. It contains 16 pages, 5 figures, 1 table

Journal ref In: International conference on interactive collaborative robotics. pp. 186-200. Springer (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19920 2024-12-31 cs.CV 50%

Not all Views are Created Equal: Analyzing Viewpoint Instabilities in Vision Foundation Models

Mateusz Michalkiewicz, Sheena Bai, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan

专题命中 视觉空间推理 :reasoning(abstract)

Comments 8 pages + 3 pages of references. 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05985 2024-12-30 cs.RO 50%

Topo-Field: Topometric mapping with Brain-inspired Hierarchical Layout-Object-Position Fields

Jiawei Hou, Wenhao Guan, Longfei Liang, Jianfeng Feng, Xiangyang Xue, Taiping Zeng

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16418 2024-12-24 cs.CV 50%

Revisiting MLLMs: An In-Depth Analysis of Image Classification Abilities

Huan Liu, Lingyu Xiao, Jiangjiang Liu, Xiaofan Li, Ze Feng, Sen Yang, Jingdong Wang

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01644 2024-12-24 cs.HC 50%

InsightLens: Augmenting LLM-Powered Data Analysis with Interactive Insight Management and Navigation

Luoxuan Weng, Xingbo Wang, Junyu Lu, Yingchaojie Feng, Yihan Liu, Haozhe Feng, Danqing Huang, Wei Chen

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to IEEE TVCG (PacificVis 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00220 2024-12-24 cs.CV 50%

A Dual-Attention Learning Network with Word and Sentence Embedding for Medical Visual Question Answering

Xiaofei Huang, Hongfang Gong

专题命中 视觉空间推理 :reasoning(abstract)

Journal ref IEEE Transactions on Medical Imaging, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12502 2024-12-18 cs.CV 50%

Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues

Yan Zhang, Gangyan Zeng, Huawen Shen, Daiqing Wu, Yu Zhou, Can Ma

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06442 2024-12-13 cs.CV cs.RO 50%

QueSTMaps: Queryable Semantic Topological Maps for 3D Scene Understanding

Yash Mehan, Kumaraditya Gupta, Rohit Jayanti, Anirudh Govil, Sourav Garg, Madhava Krishna

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted at 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) as Oral Presentation. Also presented at the 2nd Workshop on Open-Vocabulary 3D Scene Understanding (OpenSUN3D) at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08859 2024-12-13 cs.CV 50%

ViUniT: Visual Unit Tests for More Robust Visual Programming

Artemis Panagopoulou, Honglu Zhou, Silvio Savarese, Caiming Xiong, Chris Callison-Burch, Mark Yatskar, Juan Carlos Niebles

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07518 2024-12-11 cs.CV 50%

Hallucination Elimination and Semantic Enhancement Framework for Vision-Language Models in Traffic Scenarios

Jiaqi Fan, Jianhua Wu, Hongqing Chu, Quanbo Ge, Bingzhao Gao

专题命中 视觉空间推理 :chain-of-thought(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10799 2024-12-10 cs.CV 50%

Towards Foundation Models for 3D Vision: How Close Are We?

Yiming Zuo, Karhan Kayan, Maggie Wang, Kevin Jeon, Jia Deng, Thomas L. Griffiths

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to 3DV 2025. Update 12/09/24: Change the benchmark name to UniQA-3D, add link to code

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05526 2024-12-09 cs.RO 50%

Benchmarking Neural Radiance Fields for Autonomous Robots: An Overview

Yuhang Ming, Xingrui Yang, Weihan Wang, Zheng Chen, Jinglun Feng, Yifan Xing, Guofeng Zhang

专题命中 视觉空间推理 :planning(abstract)

Comments 32 pages, 5 figures, 8 tables

Journal ref Engineering Applications of Artificial Intelligence, Volume 140, 15 January 2025, 109685

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15714 2024-11-26 cs.CV 50%

ROOT: VLM based System for Indoor Scene Understanding and Beyond

Yonghui Wang, Shi-Yong Chen, Zhenxing Zhou, Siyi Li, Haoran Li, Wengang Zhou, Houqiang Li

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09823 2024-11-18 cs.CV 50%

Architect: Generating Vivid and Interactive 3D Scenes with Hierarchical 2D Inpainting

Yian Wang, Xiaowen Qiu, Jiageng Liu, Zhehuan Chen, Jiting Cai, Yufei Wang, Tsun-Hsuan Wang, Zhou Xian, Chuang Gan

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18336 2024-11-06 cs.CV 50%

DeBaRA: Denoising-Based 3D Room Arrangement Generation

Léopold Maillard, Nicolas Sereyjol-Garros, Tom Durand, Maks Ovsjanikov

专题命中 视觉空间推理 :reasoning(abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏