arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2509.06465 2025-09-12 cs.LG cs.CE q-bio.BM 57%

CAME-AB: Cross-Modality Attention with Mixture-of-Experts for Antibody Binding Site Prediction

Hongzong Li, Jiahao Ma, Zhanpeng Shi, Rui Xiao, Fanming Jin, Ye-Fan Hu, Hangjun Che, Jian-Dong Huang

机构 * Generative AI Research and Development Center The Hong Kong University of Science and Technology(生成式人工智能研究与发展中心 香港科学大学) MILES The University of Hong Kong(MILES 香港大学) College of Veterinary Medicine Jilin University(吉林大学兽医学院) School of Chemistry and Chemical Engineering South China University of Technology(华南理工大学化学与化工学院) School of Biomedical Sciences The University of Hong Kong(香港大学生物医学科学学院) Computational Immunology Centre BayVax Biotech Limited(计算免疫学中心 BayVax 生物技术有限公司) College of Electronic and Information Engineering Southwest University(西南大学电子与信息工程学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07815 2025-09-12 cs.RO cs.CV cs.LG 57%

Imagine, Verify, Execute: Memory-guided Agentic Exploration with Vision-Language Models

Seungjae Lee, Daniel Ekpo, Haowen Liu, Furong Huang, Abhinav Shrivastava, Jia-Bin Huang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

Comments Project webpage: https://ive-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01378 2025-09-03 cs.MA cs.AI cs.RO 57%

RALLY: Role-Adaptive LLM-Driven Yoked Navigation for Agentic UAV Swarms

Ziyao Wang, Rongpeng Li, Sizhao Li, Yuming Xiang, Haiping Wang, Zhifeng Zhao, Honggang Zhang

机构 * Hangzhou Institute for Advanced Study, UCAS(杭州高等研究机构,中国科学院大学) Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) Macau University of Science and Technology(澳门科学理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02730 2025-09-03 cs.CV cs.CL cs.RO 57%

DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes

Zhaowei Wang, Hongming Zhang, Tianqing Fang, Ye Tian, Yue Yang, Kaixin Ma, Xiaoman Pan, Yangqiu Song, Dong Yu

机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) Tencent AI Lab(腾讯AI实验室) Robotics X, Tencent(腾讯机器人实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉空间推理 :CoT(abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00676 2025-09-03 cs.CV cs.LG 57%

LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model

Xiyao Wang, Chunyuan Li, Jianwei Yang, Kai Zhang, Bo Liu, Tianyi Xiong, Furong Huang

机构 * University of Maryland College Park(马里兰大学 College Park 分校) The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15695 2025-09-01 cs.LG 57%

SimuGen: Multi-modal Agentic Framework for Constructing Block Diagram-Based Simulation Models

Xinxing Ren, Qianbo Zang, Zekun Guo

机构 * Brunel University of London(伦敦布鲁内尔大学) SnT, Université du Luxembourg(卢森堡大学SnT分校) University of Hull(霍尔姆斯大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20188 2025-08-29 cs.CV cs.LG 57%

Grounding Multimodal Large Language Models with Quantitative Skin Attributes: A Retrieval Study

Max Torop, Masih Eskandar, Nicholas Kurtansky, Jinyang Liu, Jochen Weber, Octavia Camps, Veronica Rotemberg, Jennifer Dy, Kivanc Kose

机构 * Northeastern University(东北大学) Memorial Sloan Kettering Cancer Center(纪念斯隆凯特琳癌症中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18381 2025-08-27 cs.CL 57%

Language-Specific Layer Matters: Efficient Multilingual Enhancement for Large Vision-Language Models

Yuchun Fan, Yilin Wang, Yongyu Mu, Lei Huang, Bei Li, Xiaocheng Feng, Tong Xiao, Jingbo Zhu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17198 2025-08-26 cs.AI 57%

From reactive to cognitive: brain-inspired spatial intelligence for embodied agents

Shouwei Ruan, Liyuan Wang, Caixin Kang, Qihui Zhu, Songming Liu, Xingxing Wei, Hang Su

机构 * Department of Computer Science and Technology, Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab(计算机科学与技术系、人工智能研究院、BNRist中心、清华-博世联合机器学习中心、THBI实验室) Institute of Artificial Intelligence(人工智能研究院) Department of Psychological and Cognitive Sciences(心理学与认知科学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 40 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14276 2025-08-21 cs.CV cs.AI 57%

Tooth-Diffusion: Guided 3D CBCT Synthesis with Fine-Grained Tooth Conditioning

Said Djafar Said, Torkan Gholamalizadeh, Mostafa Mehdipour Ghazi

机构 * Pioneer Centre for AI, Department of Computer Science, University of Copenhagen Research(先锋人工智能中心、计算机科学系、哥本哈根大学研究)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments MICCAI 2025 Workshop on Oral and Dental Image Analysis (ODIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11286 2025-08-18 cs.RO cs.AI cs.CV 57%

Scene Graph-Guided Proactive Replanning for Failure-Resilient Embodied Agent

Che Rin Yu, Daewon Chae, Dabin Seo, Sangwon Lee, Hyeongwoo Im, Jinkyu Kim

机构 * Korea University(韩国大学) KT (Korea Telecom) R&D Center(KT(韩国电信)研发中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11093 2025-08-18 cs.RO cs.AI cs.HC 57%

Utilizing Vision-Language Models as Action Models for Intent Recognition and Assistance

Cesar Alan Contreras, Manolis Chiou, Alireza Rastegarpanah, Michal Szulik, Rustam Stolkin

机构 * University of Birmingham(伯明翰大学) Queen Mary University of London(伦敦大学女王学院) Aston University(阿斯顿大学) United Kingdom National Nuclear Laboratory Ltd.(英国国家核实验室有限公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments Accepted at Human-Centered Robot Autonomy for Human-Robot Teams (HuRoboT) at IEEE RO-MAN 2025, Eindhoven, the Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10012 2025-08-15 cs.CL 57%

Guided Navigation in Knowledge-Dense Environments: Structured Semantic Exploration with Guidance Graphs

Dehao Tao, Guangjie Liu, Weizheng, Yongfeng Huang, Minghu jiang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10778 2025-08-15 cs.CV cs.AI 57%

Warehouse Spatial Question Answering with LLM Agent

Hsiang-Wei Huang, Jen-Hao Cheng, Kuang-Ming Chen, Cheng-Yen Yang, Bahaa Alattar, Yi-Ru Lin, Pyongkun Kim, Sangwon Kim, Kwangju Kim, Chung-I Huang, Jenq-Neng Hwang

机构 * Information Processing Lab, University of Washington, USA(华盛顿大学信息处理实验室) Electronics and Telecommunications Research Institute, South Korea(韩国电子电信研究院) National Center for High-performance Computing, Taiwan(台湾高性能计算国家研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 1st Place Solution of the 9th AI City Challenge Track 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02095 2025-08-08 cs.CV cs.AI 57%

VLM4D: Towards Spatiotemporal Awareness in Vision Language Models

Shijie Zhou, Alexander Vilesov, Xuehai He, Ziyu Wan, Shuwang Zhang, Aditya Nagachandra, Di Chang, Dongdong Chen, Xin Eric Wang, Achuta Kadambi

机构 * UCLA(美国大学洛杉矶分校) Microsoft(微软公司) UCSC(加州大学圣塔克拉拉分校) USC(美国大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments ICCV 2025, Project Website: https://vlm4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03009 2025-08-06 cs.CV cs.AI 57%

Enhancing Long Video Question Answering with Scene-Localized Frame Grouping

Xuyi Yang, Wenhao Zhang, Hongbo Jin, Lin Liu, Hongbo Xu, Yongwei Nie, Fei Yu, Fei Ma

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11859 2025-08-06 cs.CV cs.CL 57%

Defining and Evaluating Visual Language Models' Basic Spatial Abilities: A Perspective from Psychometrics

Wenrui Xu, Dalin Lyu, Weihang Wang, Jie Feng, Chen Gao, Yong Li

机构 * School of Architecture, Tsinghua University(清华大学建筑学院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) BNRist, Tsinghua University(清华大学BNRist)

专题命中 视觉空间推理 :chain-of-thought(abstract);分类 cs.CL

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics. Volume 1: Long Papers (2025) 11571-11590

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18937 2025-08-05 cs.CV cs.CL 57%

Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description

Mahmoud Ahmed, Junjie Fei, Jian Ding, Eslam Mohamed Bakr, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡斯特大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19516 2025-08-05 cs.RO cs.LG 57%

Boosting Robotic Manipulation Generalization with Minimal Costly Data

Liming Zheng, Feng Yan, Fanfan Liu, Chengjian Feng, Yufeng Zhong, Lin Ma

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00213 2025-08-04 cs.CV cs.LG 57%

SAM-PTx: Text-Guided Fine-Tuning of SAM with Parameter-Efficient, Parallel-Text Adapters

Shayan Jalilian, Abdul Bais

机构 * University of Regina(里纳大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23698 2025-08-01 cs.RO cs.AI 57%

Scalable Multi-Task Reinforcement Learning for Generalizable Spatial Intelligence in Visuomotor Agents

Shaofei Cai, Zhancun Mu, Haiwen Xia, Bowei Zhang, Anji Liu, Yitao Liang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23272 2025-08-01 cs.CV cs.AI 57%

Towards Affordable Tumor Segmentation and Visualization for 3D Breast MRI Using SAM2

Solha Kang, Eugene Kim, Joris Vankerschaver, Utku Ozbulak

机构 * Center for Biosystems and Biotech Data Science, Ghent University Global Campus, Incheon, Republic of Korea(生物系统与生物技术数据科学中心,格罗宁根大学全球校园,韩国Incheon) Department of Mathematics, Computer Science and Statistics, Ghent University, Ghent, Belgium(数学、计算机科学与统计学系,格罗宁根大学,比利时Ghent) IDLab, Department of Electronics and Information Systems, Ghent University, Ghent, Belgium(IDLab,电子与信息系统系,格罗宁根大学,比利时Ghent)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments Accepted for publication in the 28th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI), 2nd Deep Breast Workshop on AI and Imaging for Diagnostic and Treatment Challenges in Breast Care (DeepBreath), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20850 2025-07-29 cs.RO cs.AI 57%

Free Energy-Inspired Cognitive Risk Integration for AV Navigation in Pedestrian-Rich Environments

Meiting Dang, Yanping Wu, Yafei Wang, Dezong Zhao, David Flynn, Chongfeng Wei

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18678 2025-07-28 cs.CV cs.AI 57%

Towards Scalable Spatial Intelligence via 2D-to-3D Data Lifting

Xingyu Miao, Haoran Duan, Quanhao Qian, Jiuniu Wang, Yang Long, Ling Shao, Deli Zhao, Ran Xu, Gongjie Zhang

机构 * Durham University(杜ham大学) DAMO Academy, Alibaba Group(达摩院,阿里集团) Tsinghua University(清华大学) UCAS-Terminus AI Lab(北航-terminate人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments ICCV 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01655 2025-07-22 cs.RO cs.AI 57%

Stimulating Imagination: Towards General-purpose "Something Something Placement"

Jianyang Wu, Jie Gu, Xiaokang Ma, Fangzhou Qiu, Chu Tang, Jingmin Chen

机构 * Rightly Robotics(Rightly机器人)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 7 pages, accepted to the 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13858 2025-07-21 cs.CL 57%

InTraVisTo: Inside Transformer Visualisation Tool

Nicolò Brunello, Davide Rigamonti, Andrea Sassella, Vincenzo Scotti, Mark James Carman

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10500 2025-07-15 cs.RO cs.AI cs.CV cs.HC 57%

Scene-Aware Conversational ADAS with Generative AI for Real-Time Driver Assistance

Kyungtae Han, Yitao Chen, Rohit Gupta, Onur Altintas

机构 * InfoTech Labs, Toyota Motor North America(丰田北美信息科技实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06184 2025-06-30 cs.CV cs.AI cs.CE cs.HC cs.MA 57%

PEACE: Empowering Geologic Map Holistic Understanding with MLLMs

Yangyu Huang, Tianyi Gao, Haoran Xu, Qihao Zhao, Yang Song, Zhipeng Gui, Tengchao Lv, Hao Chen, Lei Cui, Scarlett Li, Furu Wei

机构 * Microsoft Research(微软研究院) Chinese Academy of Geological Sciences(中国地质科学研究院) Wuhan University(武汉大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08704 2025-06-30 cs.CV cs.AI 57%

Beyond the Hype: A dispassionate look at vision-language models in medical scenario

Yang Nan, Huichi Zhou, Xiaodan Xing, Guang Yang

机构 * Bioengineering Department and Imperial-X, Imperial College London(生物工程部门和Imperial-X,帝国理工学院伦敦分校) GSK, Artificial Intelligence and Machine Learning(GSK,人工智能与机器学习) Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里托尼医院) School of Biomedical Engineering and Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19498 2025-06-25 cs.RO cs.AI 57%

T-Rex: Task-Adaptive Spatial Representation Extraction for Robotic Manipulation with Vision-Language Models

Yiteng Chen, Wenbo Li, Shiyi Wang, Huiping Zhuang, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(智能工程学院,华南理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

Comments submitted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏