arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3352 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3352 篇

2507.18033 2025-12-29 cs.RO cs.AI 70%

OpenNav: Open-World Navigation with Multimodal Large Language Models

OpenNav: 基于多模态大语言模型的开放世界导航

Mingfeng Yuan, Letian Wang, Steven L. Waslander

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究 institute) University of Toronto Robotics Institute(多伦多大学机器人研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OpenNav利用多模态大语言模型实现开放世界导航,通过生成价值图增强机器人空间理解,并在真实场景中验证其鲁棒性。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19024 2025-12-23 cs.RO cs.AI 70%

IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments

IndoorUAV:在连续室内环境中进行视觉-语言无人机导航的基准测试

Xu Liu, Yu Liu, Hanshuo Qiu, Yang Qirong, Zhouhui Lian

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 IndoorUAV通过构建室内无人机视觉-语言导航基准,结合多模态推理和任务分解,为长视距和短视距导航提供高质量数据与模型支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02631 2025-12-03 cs.LG 70%

SeeNav-Agent: Enhancing Vision-Language Navigation with Visual Prompt and Step-Level Policy Optimization

SeeNav-Agent: 通过视觉提示和分步策略优化增强视觉语言导航

Zhengcheng Wang, Zichuan Lin, Yijun Yang, Haobo Fu, Deheng Ye

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 SeeNav-Agent通过视觉提示和分步策略优化提升视觉语言导航性能,实验显示其在导航成功率上优于现有模型。

Comments 12 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17808 2025-12-02 cs.LG 70%

Remote Sensing-Oriented World Model

面向遥感的世界模型

Yuxi Lu, Biao Wu, Zhidong Li, Kunqi Li, Chenya Huang, Huacan Wang, Qizhen Lan, Ronghao Chen, Ling Chen, Bin Liang

机构 * University of Technology Sydney (UTS)(悉尼技术大学) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出首个面向遥感的世界模型框架,通过RemoteBAGEL模型在RSWISE基准上实现空间推理的高效外推。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05227 2025-11-04 cs.RO cs.CV cs.LG cs.MM cs.SY eess.SY 70%

NavigScene: Bridging Local Perception and Global Navigation for Beyond-Visual-Range Autonomous Driving

Qucheng Peng, Chen Bai, Guoxiang Zhang, Bo Xu, Xiaotong Liu, Xiaoyin Zheng, Chen Chen, Cheng Lu

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22030 2025-10-28 eess.IV cs.AI cs.CV 70%

ReXGroundingCT: A 3D Chest CT Dataset for Segmentation of Findings from Free-Text Reports

Mohammed Baharoon, Luyang Luo, Michael Moritz, Abhinav Kumar, Sung Eun Kim, Xiaoman Zhang, Miao Zhu, Mahmoud Hussain Alabbad, Maha Sbayel Alhazmi, Neel P. Mistry, Lucas Bijnens, Kent Ryan Kleinschmidt, Brady Chrisler, Sathvik Suryadevara, Sri Sai Dinesh Jaliparthi, Noah Michael Prudlo, Mark David Marino, Jeremy Palacio, Rithvik Akula, Di Zhou, Hong-Yu Zhou, Ibrahim Ethem Hamamci, Scott J. Adams, Hassan Rayhan AlOmaish, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) SSM Health, St. Louis, MO(SSM健康系统,圣路易斯,密苏里州) Saint Louis University School of Medicine(圣路易斯大学医学院) Icahn School of Medicine at Mount Sinai(西奈山医院伊坎医学院) National Strategic Technology Research Institute, Seoul National University Hospital(首尔国立大学医院国家战略技术研究机构) Brigham and Women’s Hospital(布里金和妇女医院) Chest Radiology Division, Medical Imaging Department, King Abdullah Specialized Children’s Hospital(国王阿卜杜勒阿齐兹特殊儿童医院放射科,医学成像部门) King Abdulaziz Medical City, Ministry of National Guard Health Affairs(国王阿卜杜勒阿齐兹医疗城,国民卫队卫生事务部)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05020 2025-10-28 cs.RO cs.AI 70%

Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial-Ground Robotic System

Haokun Liu, Zhaoqi Ma, Yunong Li, Junichiro Sugihara, Yicheng Chen, Jinjie Li, Moju Zhao

机构 * DRAGON Lab at Department of Mechanical Engineering, The University of Tokyo(东京大学机械工程系DRAGON实验室)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 18 pages, 10 figures

Journal ref Advanced Intelligent Systems, Oct. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21955 2025-10-27 cs.CV cs.AI 70%

Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs

Insu Lee, Wooje Park, Jaeyun Jang, Minyoung Noh, Kyuhong Shim, Byonghyo Shim

专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.AI

Comments Accepted to NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25528 2025-10-22 cs.CV cs.AI cs.RO 70%

LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models

Pranav Saxena, Avigyan Bhattacharya, Ji Zhang, Wenshan Wang

机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,K.K Birla Goa校区) Carnegie Mellon University, Robotics Institute(卡内基梅隆大学,机器人研究所)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments Human-aware Embodied AI Workshop @ IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02838 2025-10-22 cs.AI 70%

I-Design: Personalized LLM Interior Designer

Ata Çelen, Guo Han, Konrad Schindler, Luc Van Gool, Iro Armeni, Anton Obukhov, Xi Wang

机构 * ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

Journal ref Computer Vision - ECCV 2024 Workshops, Lecture Notes in Computer Science (LNCS), vol. 15624, pp. 217-234, Springer, Cham, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15065 2025-10-15 cs.LG cs.RO 70%

HEAL: An Empirical Study on Hallucinations in Embodied Agents Driven by Large Language Models

Trishna Chakraborty, Udita Ghosh, Xiaopan Zhang, Fahim Faisal Niloy, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25139 2025-09-30 cs.AI cs.CV cs.MM 70%

Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs

Yue Zhang, Tianyi Ma, Zun Wang, Yanyuan Qiao, Parisa Kordjamshidi

机构 * Michigan State University(密歇根州立大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Adelaide(阿德莱德大学)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21928 2025-09-29 cs.RO cs.AI 70%

SAGE: Scene Graph-Aware Guidance and Execution for Long-Horizon Manipulation Tasks

Jialiang Li, Wenzheng Wu, Gaojing Zhang, Yifan Han, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ShanghaiTech University(上海科技大学) University of Sussex(Sussex大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12446 2025-09-25 cs.MA cs.AI 70%

PromptSculptor: Multi-Agent Based Text-to-Image Prompt Optimization

Dawei Xiang, Wenyan Xu, Kexin Chu, Tianqi Ding, Zixu Shen, Yiming Zeng, Jianchang Su, Wei Zhang

机构 * University of Connecticut(康涅狄格大学) Central University of Finance and Economics(中央财经大学) Baylor University(贝勒大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16721 2025-09-23 cs.CV cs.AI cs.RO 70%

Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding

Haoyuan Li, Rui Liu, Hehe Fan, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 19 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18042 2025-09-19 cs.CV cs.AI 70%

VLM-E2E: Enhancing End-to-End Autonomous Driving with Multimodal Driver Attention Fusion

Pei Liu, Haipeng Liu, Haichao Liu, Xin Liu, Jinxin Ni, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Li Auto Inc.(Li汽车公司) the School of Aeronautics and Astronautics, Xiamen University(厦门大学航空航天学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05578 2025-09-09 cs.AI cs.RO 70%

OccVLA: Vision-Language-Action Model with Implicit 3D Occupancy Supervision

Ruixun Liu, Lingyu Kong, Derun Li, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究所) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02278 2025-09-03 cs.GR cs.AI cs.MM 70%

Think2Sing: Orchestrating Structured Motion Subtitles for Singing-Driven 3D Head Animation

Zikai Huang, Yihan Zhou, Xuemiao Xu, Cheng Xu, Xiaofen Xing, Jing Qin, Shengfeng He

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) South China University of Technology(华南理工大学) Guangdong Engineering Center for Large Model and GenAI Technology(广东省大模型与生成式人工智能技术工程中心) Guangdong Provincial Key Lab of Computational Intelligence and Cyberspace Information(广东省计算智能与网络信息重点实验室) Centre for Smart Health, Hong Kong Polytechnic University(香港理工大学智能健康研究中心) CAS-Hong Kong Joint Laboratory for Multimodal Medical Molecular Imaging(中国科学院-香港联合多模态医学分子成像联合实验室) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) Pazhou Lab, Guangzhou, Guangdong, China(广州琶洲实验室) School of Computing and Information Systems, Singapore Management University(新加坡国立大学计算机与信息系统学院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00210 2025-09-03 cs.CV cs.AI 70%

Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment

Jinzhou Tang, Jusheng zhang, Sidi Liu, Waikit Xiu, Qinhan Lv, Xiying Li

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16602 2025-08-26 cs.HC cs.AI 70%

An Embodied AR Navigation Agent: Integrating BIM with Retrieval-Augmented Generation for Language Guidance

Hsuan-Kung Yang, Tsu-Ching Hsiao, Ryoichiro Oka, Ryuya Nishino, Satoko Tofukuji, Norimasa Kobori

机构 * Woven by Toyota, Inc., Japan(丰田公司,日本)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 11 pages, 9 figures, accepted to IEEE ISMAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09839 2025-06-12 cs.CV cs.AI cs.RO 70%

OctoNav: Towards Generalist Embodied Navigation

Chen Gao, Liankai Jin, Xingyu Peng, Jiazhao Zhang, Yue Deng, Annan Li, He Wang, Si Liu

机构 * Beihang University(北航大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 视觉空间推理 :reasoning(abstract);CoT(abstract);分类 cs.AI

Comments 31 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16498 2025-05-23 cs.RO cs.AI 70%

Human-like Semantic Navigation for Autonomous Driving using Knowledge Representation and Large Language Models

Augusto Luis Ballardini, Miguel Ángel Sotelo

机构 * Computer Engineering Department, University of Alcalá(阿尔卡拉大学计算机工程系)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 7 pages, 5 figures, submitted for IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09427 2025-05-16 cs.LG cs.RO 70%

SafePath: Conformal Prediction for Safe LLM-Based Autonomous Navigation

Achref Doula, Max Mühlhäuser, Alejandro Sanchez Guinea

机构 * Technical University of Darmstadt(德累斯顿技术大学) NTT Data(NTT数据)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15280 2025-04-29 cs.CV cs.CL 70%

Seeing from Another Perspective: Evaluating Multi-View Understanding in MLLMs

Chun-Hsiao Yeh, Chenyu Wang, Shengbang Tong, Ta-Ying Cheng, Ruoyu Wang, Tianzhe Chu, Yuexiang Zhai, Yubei Chen, Shenghua Gao, Yi Ma

机构 * UC Berkeley(加州大学伯克利分校) TranscEngram NYU(纽约大学) University of Oxford(牛津大学) UC Davis(加州大学戴维斯分校) HKU(香港大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments Project page: https://danielchyeh.github.io/All-Angles-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02193 2025-03-12 cs.CV cs.AI 70%

LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models

Fan-Yun Sun, Weiyu Liu, Siyi Gu, Dylan Lim, Goutam Bhat, Federico Tombari, Manling Li, Nick Haber, Jiajun Wu

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments CVPR 2025, project website: https://ai.stanford.edu/~sunfanyun/layoutvlm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14669 2025-02-26 cs.CL 70%

AlphaMaze: Enhancing Large Language Models' Spatial Intelligence via GRPO

Alan Dao, Dinh Bach Vu

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18733 2025-02-03 cs.RO cs.AI 70%

Integrating LMM Planners and 3D Skill Policies for Generalizable Manipulation

Yuelei Li, Ge Yan, Annabella Macaluso, Mazeyu Ji, Xueyan Zou, Xiaolong Wang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16698 2025-01-29 cs.CL cs.CV cs.RO 70%

3D-MoE: A Mixture-of-Experts Multi-modal LLM for 3D Vision and Pose Diffusion via Rectified Flow

Yueen Ma, Yuzheng Zhuang, Jianye Hao, Irwin King

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07035 2024-12-31 cs.CL cs.CV 70%

Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models

Yue Zhang, Ziqiao Ma, Jialu Li, Yanyuan Qiao, Zun Wang, Joyce Chai, Qi Wu, Mohit Bansal, Parisa Kordjamshidi

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments Authors contributed equally to this work, and supervisors contributed equal advising to this work; GitHub repository: https://github.com/zhangyuejoslin/VLN-Survey-with-Foundation-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04168 2024-10-18 cs.AI 70%

Perceive, Reflect, and Plan: Designing LLM Agent for Goal-Directed City Navigation without Instructions

Qingbin Zeng, Qinglong Yang, Shunan Dong, Heming Du, Liang Zheng, Fengli Xu, Yong Li

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏