arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2502.17425 2025-02-25 cs.CV cs.LG 57%

Introducing Visual Perception Token into Multimodal Large Language Model

Runpeng Yu, Xinyin Ma, Xinchao Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16690 2025-02-25 cs.AI 57%

From Text to Space: Mapping Abstract Spatial Models in LLMs during a Grid-World Navigation Task

Nicolas Martorell

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14004 2025-02-20 cs.CV cs.AI 57%

ME-CPT: Multi-Task Enhanced Cross-Temporal Point Transformer for Urban 3D Change Detection

Luqi Zhang, Haiping Wang, Chong Liu, Zhen Dong, Bisheng Yang

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11427 2025-02-18 cs.CL cs.CV 57%

Do we Really Need Visual Instructions? Towards Visual Instruction-Free Fine-tuning for Large Vision-Language Models

Zikang Liu, Kun Zhou, Wayne Xin Zhao, Dawei Gao, Yaliang Li, Ji-Rong Wen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11913 2025-02-17 cs.AI cs.RO 57%

On-Board Vision-Language Models for Personalized Autonomous Vehicle Motion Control: System Design and Real-World Validation

Can Cui, Zichong Yang, Yupeng Zhou, Juntong Peng, Sung-Yeon Park, Cong Zhang, Yunsheng Ma, Xu Cao, Wenqian Ye, Yiheng Feng, Jitesh Panchal, Lingxi Li, Yaobin Chen, Ziran Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments arXiv admin note: substantial text overlap with arXiv:2410.15281

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09587 2025-02-14 cs.LG cs.RO 57%

Rolling Ahead Diffusion for Traffic Scene Simulation

Yunpeng Liu, Matthew Niedoba, William Harvey, Adam Scibior, Berend Zwartsenberg, Frank Wood

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

Comments Accepted to Workshop on Machine Learning for Autonomous Driving at AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00708 2025-02-04 cs.CV cs.AI 57%

PhiP-G: Physics-Guided Text-to-3D Compositional Scene Generation

Qixuan Li, Chao Wang, Zongjin He, Yan Peng

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments 13 pages.8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16300 2025-01-28 cs.CV cs.AI 57%

Large Models in Dialogue for Active Perception and Anomaly Detection

Tzoulio Chamiti, Nikolaos Passalis, Anastasios Tefas

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Accepted to International Conference of Pattern Recognition (ICPR 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09041 2025-01-17 cs.CV cs.CL 57%

Generative Visual Commonsense Answering and Explaining with Generative Scene Graph Constructing

Fan Yuan, Xiaoyuan Fang, Rong Quan, Jing Li, Wei Bi, Xiaogang Xu, Piji Li

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03879 2025-01-08 cs.CV cs.AI 57%

CL3DOR: Contrastive Learning for 3D Large Multimodal Models via Odds Ratio on High-Resolution Point Clouds

Keonwoo Kim, Yeongjae Cho, Taebaek Hwang, Minsoo Jo, Sangdo Han

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03722 2025-01-08 cs.CV cs.AI 57%

Self-adaptive vision-language model for 3D segmentation of pulmonary artery and vein

Xiaotong Guo, Deqian Yang, Dan Wang, Haochen Zhao, Yuan Li, Zhilin Sui, Tao Zhou, Lijun Zhang, Yanda Meng

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03700 2025-01-08 cs.CV cs.AI 57%

AuxDepthNet: Real-Time Monocular 3D Object Detection with Depth-Sensitive Features

Ruochen Zhang, Hyeung-Sik Choi, Dongwook Jung, Phan Huy Nam Anh, Sang-Ki Jeong, Zihao Zhu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23242 2025-01-06 cs.AI 57%

A little less conversation, a little more action, please: Investigating the physical common-sense of LLMs in a 3D embodied environment

Matteo G. Mecattaf, Ben Slater, Marko Tešić, Jonathan Prunty, Konstantinos Voudouris, Lucy G. Cheke

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 25 pages, 4 figures; v2: Added AFMR Acknowledgment

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05840 2025-01-03 cs.CL 57%

MMEvol: Empowering Multimodal Large Language Models with Evol-Instruct

Run Luo, Haonan Zhang, Longze Chen, Ting-En Lin, Xiong Liu, Yuchuan Wu, Min Yang, Minzheng Wang, Pengpeng Zeng, Lianli Gao, Heng Tao Shen, Yunshui Li, Xiaobo Xia, Fei Huang, Jingkuan Song, Yongbin Li

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19595 2024-12-30 cs.RO cs.AI 57%

SocRATES: Towards Automated Scenario-based Testing of Social Navigation Algorithms

Shashank Rao Marpally, Pranav Goyal, Harold Soh

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02989 2024-12-30 cs.RO cs.AI 57%

Learning Semantic Traversability with Egocentric Video and Automated Annotation Strategy

Yunho Kim, Jeong Hyun Lee, Choongin Lee, Juhyeok Mun, Donghoon Youm, Jeongsoo Park, Jemin Hwangbo

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Accepted to IEEE Robotics and Automation Letters (RA-L) 2024, First two authors contributed equally

Journal ref IEEE Robotics and Automation Letters (Volume: 9, Issue: 11, November 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11061 2024-12-30 cs.CV cs.AI cs.RO 57%

PhotoBot: Reference-Guided Interactive Photography via Natural Language

Oliver Limoyo, Jimmy Li, Dmitriy Rivkin, Jonathan Kelly, Gregory Dudek

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments In Proceedings of the IEEE/RSJ International Conference on Intelligent Robotics and Systems (IROS'24), Abu Dhabi, UAE, Oct. 14-18, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16270 2024-12-24 cs.AI cs.HC 57%

MetaScientist: A Human-AI Synergistic Framework for Automated Mechanical Metamaterial Design

Jingyuan Qi, Zian Jia, Minqian Liu, Wangzhi Zhan, Junkai Zhang, Xiaofei Wen, Jingru Gan, Jianpeng Chen, Qin Liu, Mingyu Derek Ma, Bangzheng Li, Haohui Wang, Adithya Kulkarni, Muhao Chen, Dawei Zhou, Ling Li, Wei Wang, Lifu Huang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13187 2024-12-19 cs.CV cs.LG 57%

HandsOnVLM: Vision-Language Models for Hand-Object Interaction Prediction

Chen Bao, Jiarui Xu, Xiaolong Wang, Abhinav Gupta, Homanga Bharadhwaj

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11258 2024-12-17 cs.RO cs.AI cs.CV 57%

GaussianProperty: Integrating Physical Properties to 3D Gaussians with LMMs

Xinli Xu, Wenhang Ge, Dicong Qiu, ZhiFei Chen, Dongyu Yan, Zhuoyun Liu, Haoyu Zhao, Hanfeng Zhao, Shunsi Zhang, Junwei Liang, Ying-Cong Chen

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 17 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10605 2024-12-17 cs.CV cs.AI 57%

MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration

Yanbo Ding, Shaobin Zhuang, Kunchang Li, Zhengrong Yue, Yu Qiao, Yali Wang

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10455 2024-12-17 cs.CV cs.AI cs.CG 57%

Geo-LLaVA: A Large Multi-Modal Model for Solving Geometry Math Problems with Meta In-Context Learning

Shihao Xu, Yiyang Luo, Wei Shi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10402 2024-12-17 cs.AI cs.RO 57%

TANGO: Training-free Embodied AI Agents for Open-world Tasks

Filippo Ziliotto, Tommaso Campari, Luciano Serafini, Lamberto Ballan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10348 2024-12-16 cs.CV cs.AI 57%

A dual contrastive framework

Yuan Sun, Zhao Zhang, Jorge Ortiz

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12498 2024-12-16 cs.CV cs.LG cs.RO 57%

Feudal Networks for Visual Navigation

Faith Johnson, Bryan Bo Cao, Ashwin Ashok, Shubham Jain, Kristin Dana

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18938 2024-12-04 cs.CV cs.AI 57%

From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding

Heqing Zou, Tianze Luo, Guiyang Xie, Victor, Zhang, Fengmao Lv, Guangcong Wang, Junyang Chen, Zhuochen Wang, Hansheng Zhang, Huaijian Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19589 2024-12-02 cs.CL 57%

Can Large Language Models Reason about the Region Connection Calculus?

Anthony G Cohn, Robert E Blackwell

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments 13 pages. arXiv admin note: text overlap with arXiv:2309.15577

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15027 2024-11-25 cs.RO cs.AI cs.HC 57%

Time is on my sight: scene graph filtering for dynamic environment perception in an LLM-driven robot

Simone Colombani, Luca Brini, Dimitri Ognibene, Giuseppe Boccignone

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02423 2024-11-06 cs.HC cs.AI 57%

Development of CODO: A Comprehensive Tool for COVID-19 Data Representation, Analysis, and Visualization

Biswanath Dutta, Debanjali Bain

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 15 pages, 4 figures, journal

Journal ref Journal of Information and Knowledge, Vol. 61, no. 5, pp. 245-253 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07433 2024-11-05 cs.CV cs.AI 57%

Controllable Navigation Instruction Generation with Chain of Thought Prompting

Xianghao Kong, Jinyu Chen, Wenguan Wang, Hang Su, Xiaolin Hu, Yi Yang, Si Liu

专题命中 视觉空间推理 :chain-of-thought(abstract);分类 cs.AI

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏