arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2509.00969 2025-09-10 cs.CV 50%

Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors

Xiangchen Wang, Jinrui Zhang, Teng Wang, Haigang Zhang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) The University of Hong Kong(香港大学) Shenzhen Polytechnic University(深圳职业技术大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments 17 pages, 8 figures, EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21853 2025-09-09 cs.RO 50%

Skill-Nav: Enhanced Navigation with Versatile Quadrupedal Locomotion via Waypoint Interface

Dewei Wang, Chenjia Bai, Chenhui Li, Jiyuan Shi, Yan Ding, Chi Zhang, Bin Zhao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :planning(abstract)

Comments 17pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04326 2025-09-05 cs.CV 50%

Efficient Odd-One-Out Anomaly Detection

Silvio Chito, Paolo Rabino, Tatiana Tommasi

机构 * Politecnico di Torino(托斯尼亚理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted at ICIAP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01658 2025-09-03 cs.RO 50%

MoTo: A Zero-shot Plug-in Interaction-aware Navigation for General Mobile Manipulation

Zhenyu Wu, Angyuan Ma, Xiuwei Xu, Hang Yin, Yinan Liang, Ziwei Wang, Jiwen Lu, Haibin Yan

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted to CoRL 2025. Project Page: https://gary3410.github.io/MoTo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01232 2025-09-03 cs.CV 50%

FantasyHSI: Video-Generation-Centric 4D Human Synthesis In Any Scene through A Graph-based Multi-Agent Framework

Lingzhou Mu, Qiang Wang, Fan Jiang, Mengchao Wang, Yaqi Fan, Mu Xu, Kai Zhang

专题命中 视觉空间推理 :planning(abstract)

Comments https://fantasy-amap.github.io/fantasy-hsi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21539 2025-09-01 cs.CV 50%

HCCM: Hierarchical Cross-Granularity Contrastive and Matching Learning for Natural Language-Guided Drones

Hao Ruan, Jinliang Lin, Yingxin Lai, Zhiming Luo, Shaozi Li

机构 * Department of Artificial Intelligence, Xiamen University(人工智能学院,厦门大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted by ACM MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20034 2025-08-28 cs.HC 50%

FlyMeThrough: Human-AI Collaborative 3D Indoor Mapping with Commodity Drones

Xia Su, Ruiqi Chen, Jingwei Ma, Chu Li, Jon E. Froehlich

专题命中 视觉空间推理 :planning(abstract)

Comments Accepted at UIST 2025, 14 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19967 2025-08-28 cs.CV 50%

Assessing the Geolocation Capabilities, Limitations and Societal Risks of Generative Vision-Language Models

Oliver Grainge, Sania Waheed, Jack Stilgoe, Michael Milford, Shoaib Ehsan

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to AAAI Fall Symposium 2025 on AI Trustworthiness and Risk Assessment for Challenging Contexts (ATRACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16974 2025-08-26 cs.CV 50%

Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding

Leilei Guo, Antonio Carlos Rivera, Peiyu Tang, Haoxuan Ren, Zheyu Song

机构 * Zhongkai University of Agriculture and Engineering(仲恺农业工程大学) EDP University of Puerto Rico: San Sebastian(波多黎各圣塞巴斯蒂安EDP大学)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24180 2025-08-26 cs.CV cs.HC 50%

Navi-plus: Managing Ambiguous GUI Navigation Tasks with Follow-up Questions

Ziming Cheng, Zhiyuan Huang, Junting Pan, Zhaohui Hou, Mingjie Zhan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) SenseTime Research(商汤科技研究院) MMLab, CUHK(CUHK的MMLab)

专题命中 视觉空间推理 :self-correction(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14527 2025-08-26 cs.CV 50%

Adversarial Generation and Collaborative Evolution of Safety-Critical Scenarios for Autonomous Vehicles

Jiangfan Liu, Yongkang Guo, Fangzhi Zhong, Tianyuan Zhang, Zonglei Jing, Siyuan Liang, Jiakai Wang, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) Zhongguancun Laboratory(中关村实验室) Henan University of Science and Technology(河南科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15232 2025-08-22 cs.CV 50%

AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation

Ruipu Wu, Yige Zhang, Jinyu Chen, Linjiang Huang, Shifeng Zhang, Xu Zhou, Liang Wang, Si Liu

机构 * Beihang University(北京航空航天大学) Sangfor Technologies Inc.(深信服科技有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06484 2025-08-21 cs.GR cs.CV 50%

3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds

Fan-Yun Sun, Shengguang Wu, Christian Jacobsen, Thomas Yim, Haoming Zou, Alex Zook, Shangru Li, Yu-Hsin Chou, Ethem Can, Xunlei Wu, Clemens Eppner, Valts Blukis, Jonathan Tremblay, Jiajun Wu, Stan Birchfield, Nick Haber

机构 * Stanford University(斯坦福大学) Nvidia Research(英伟达研究)

专题命中 视觉空间推理 :reasoning(abstract)

Comments project website: https://ai.stanford.edu/~sunfanyun/3d-generalist/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12916 2025-08-19 cs.RO 50%

RoboRetriever: Single-Camera Robot Object Retrieval via Active and Interactive Perception with Dynamic Scene Graph

Hecheng Wang, Jiankun Ren, Jia Yu, Lizhe Qi, Yunquan Sun

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24039 2025-08-19 cs.CV cs.HC 50%

Foundation Models for Zero-Shot Segmentation of Scientific Images without AI-Ready Data

Shubhabrata Mukherjee, Jack Lang, Obeen Kwon, Iryna Zenyuk, Valerie Brogden, Adam Weber, Daniela Ushizima

机构 * Lawrence Berkeley National Laboratory(伯克利国家实验室) University of California, Irvine(加州大学尔湾分校) University of California, Berkeley(加州大学伯克利分校) Covalent Metrology(协力计量)

专题命中 视觉空间推理 :reasoning(abstract)

Comments This paper has been accepted for presentation at the 59th International Conference on Parallel Processing (ICPP 2025), DRAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10567 2025-08-15 cs.CV cs.RO 50%

SpaRC-AD: A Baseline for Radar-Camera Fusion in End-to-End Autonomous Driving

Philipp Wolters, Johannes Gilg, Torben Teepe, Gerhard Rigoll

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 视觉空间推理 :planning(abstract)

Comments 8 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23009 2025-08-15 cs.CV 50%

MusiXQA: Advancing Visual Music Understanding in Multimodal Large Language Models

Jian Chen, Wenye Ma, Penghang Liu, Wei Wang, Tengwei Song, Ming Li, Chenguang Wang, Jiayu Qin, Ruiyi Zhang, Changyou Chen

专题命中 视觉空间推理 :reasoning(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14729 2025-08-14 cs.CV 50%

HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation

Xin Zhou, Dingkang Liang, Sifan Tu, Xiwu Chen, Yikang Ding, Dingyuan Zhang, Feiyang Tan, Hengshuang Zhao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MEGVII Technology(梅格维七科技) Mach Drive(马奇驱动) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted by ICCV 2025. The code is available at https://github.com/LMD0311/HERMES

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09061 2025-08-13 cs.CV 50%

VLM-3D:End-to-End Vision-Language Models for Open-World 3D Perception

Fuhao Chang, Shuxin Li, Yabei Li, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院) School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院) Meituan, China(美团(中国))

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08821 2025-08-13 cs.CV 50%

3DFroMLLM: 3D Prototype Generation only from Pretrained Multimodal LLMs

Noor Ahmed, Cameron Braunstein, Steffen Eger, Eddy Ilg

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21055 2025-08-13 cs.CV 50%

What Changed and What Could Have Changed? State-Change Counterfactuals for Procedure-Aware Video Representation Learning

Chi-Hsi Kung, Frangil Ramirez, Juhyung Ha, Yi-Ting Chen, David Crandall, Yi-Hsuan Tsai

机构 * Indiana University(印第安纳大学) National Yang-Ming Chiao-Tung University(国家阳明交通大学) Atmanity Inc.(Atmanity公司)

专题命中 视觉空间推理 :reasoning(abstract)

Comments 16 pages, 4 figures

Journal ref International Conference on Computer Vision, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05750 2025-08-13 cs.RO cs.CV 50%

Semantic Mapping in Indoor Embodied AI -- A Survey on Advances, Challenges, and Future Directions

Sonia Raychaudhuri, Angel X. Chang

专题命中 视觉空间推理 :reasoning(abstract)

Journal ref Transactions on Machine Learning Research. (ISSN) 2835-885. 2025-08

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07089 2025-08-12 cs.CV cs.RO 50%

ForeSight: Multi-View Streaming Joint Object Detection and Trajectory Forecasting

Sandro Papais, Letian Wang, Brian Cheong, Steven L. Waslander

机构 * University of Toronto(多伦多大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06826 2025-08-12 cs.HC 50%

AdjustAR: AI-Driven In-Situ Adjustment of Site-Specific Augmented Reality Content

Nels Numan, Jessica Van Brummelen, Ziwen Lu, Anthony Steed

专题命中 视觉空间推理 :reasoning(abstract)

Comments 4 pages, 1 figure, ACM UIST 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00624 2025-08-12 cs.CV 50%

VideoSAVi: Self-Aligned Video Language Models without Human Supervision

Yogesh Kulkarni, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视觉空间推理 :reasoning(abstract)

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04598 2025-08-07 cs.RO 50%

$NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything

Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Haoxiang Fu, Xinyu Zheng, Pengwei Wang, Zhongyuan Wang, Wenbo Ding, Shanghang Zhang

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03725 2025-08-07 cs.CV 50%

A Large Language Model Powered Integrated Circuit Footprint Geometry Understanding

Yida Wang, Taiting Lu, Runze Liu, Lanqing Yang, Yifan Yang, Zhe Chen, Yuehai Wang, Yixin Liu, Kaiyuan Lin, Xiaomeng Chen, Dian Ding, Yijie Li, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

机构 * Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Binghamton University(布ingham顿大学)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18450 2025-08-07 cs.CV 50%

3DGraphLLM: Combining Semantic Graphs and Large Language Models for 3D Scene Understanding

Tatiana Zemskova, Dmitry Yudin

机构 * AIRI MIPT(莫斯科国立普希金俄语学院)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02645 2025-08-05 cs.CV 50%

Evaluating Variance in Visual Question Answering Benchmarks

Nikitha SR

机构 * Media and Data Science Research Lab, Adobe(媒体与数据科学研究实验室,Adobe)

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted in ICCV 2025 Workshop on What's Next in Multimodal Foundational Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01465 2025-08-05 cs.CV 50%

EfficientGFormer: Multimodal Brain Tumor Segmentation via Pruned Graph-Augmented Transformer

Fatemeh Ziaeetabar

机构 * School of Mathematics, Statistics and Computer Science, College of Science, University of Tehran(数学、统计与计算机科学学院,科学学院,德黑兰大学) University of Tehran(德黑兰大学)

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏