arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3352 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3352 篇

2402.05472 2024-02-09 cs.CV 78%

Question Aware Vision Transformer for Multimodal Reasoning

Roy Ganz, Yair Kittenplon, Aviad Aberdam, Elad Ben Avraham, Oren Nuriel, Shai Mazor, Ron Litman

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17240 2024-01-23 cs.CV 78%

LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model

Senqiao Yang, Tianyuan Qu, Xin Lai, Zhuotao Tian, Bohao Peng, Shu Liu, Jiaya Jia

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Typo fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13335 2023-12-27 cs.CV cs.MM 78%

Multi-modal Large Language Model Enhanced Pseudo 3D Perception Framework for Visual Commonsense Reasoning

Jian Zhu, Hanli Wang, Miaojing Shi

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08083 2023-12-14 cs.CV 78%

VCD: Visual Causality Discovery for Cross-Modal Question Reasoning

Yang Liu, Ying Tan, Jingzhou Luo, Weixing Chen

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 12 pages, 6 figures. arXiv admin note: substantial text overlap with arXiv:2207.12647

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03726 2023-09-08 cs.CV 78%

Interpretable Visual Question Answering via Reasoning Supervision

Maria Parelli, Dimitrios Mallis, Markos Diomataris, Vassilis Pitsikalis

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01073 2023-09-06 cs.CV 78%

Spatial and Visual Perspective-Taking via View Rotation and Relation Reasoning for Embodied Reference Understanding

Cheng Shi, Sibei Yang

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments ECCV 2022. Code: http://github.com/ChengShiest/REP-ERU

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09119 2023-08-21 cs.CV 78%

ICAR: Image-based Complementary Auto Reasoning

Xijun Wang, Anqi Liang, Junbang Liang, Ming Lin, Yu Lou, Shan Yang

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17919 2023-04-03 cs.RO 78%

Grounding Object Relations in Language-Conditioned Robotic Manipulation with Semantic-Spatial Reasoning

Qian Luo, Yunfei Li, Yi Wu

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments AAAI 2023 RL Ready for Production Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15796 2023-03-29 cs.CV 78%

KERM: Knowledge Enhanced Reasoning for Vision-and-Language Navigation

Xiangyang Li, Zihan Wang, Jiahao Yang, Yaowei Wang, Shuqiang Jiang

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted by CVPR 2023. The code is available at https://github.com/XiangyangLi20/KERM

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09410 2023-03-17 cs.CV 78%

Narrator: Towards Natural Control of Human-Scene Interaction Generation via Relationship Reasoning

Haibiao Xuan, Xiongzheng Li, Jinsong Zhang, Hongwen Zhang, Yebin Liu, Kun Li

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Project page: http://cic.tju.edu.cn/faculty/likun/projects/Narrator

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.13296 2023-01-02 cs.CV 78%

VQA and Visual Reasoning: An Overview of Recent Datasets, Methods and Challenges

Rufai Yusuf Zakari, Jim Wilson Owusu, Hailin Wang, Ke Qin, Zaharaddeen Karami Lawal, Yuezhou Dong

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09329 2022-12-20 cs.CV 78%

SrTR: Self-reasoning Transformer with Visual-linguistic Knowledge for Scene Graph Generation

Yuxiang Zhang, Zhenbo Liu, Shuai Wang

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03866 2022-12-09 cs.CV 78%

Learning Action-Effect Dynamics for Hypothetical Vision-Language Reasoning Task

Shailaja Keyur Sampat, Pratyay Banerjee, Yezhou Yang, Chitta Baral

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments 11 pages, 9 figures; Accepted at Findings of EMNLP 2022. arXiv admin note: substantial text overlap with arXiv:2212.03433

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09646 2022-11-18 cs.CV 78%

Language Conditioned Spatial Relation Reasoning for 3D Object Grounding

Shizhe Chen, Pierre-Louis Guhur, Makarand Tapaswi, Cordelia Schmid, Ivan Laptev

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted in NeurIPS 2022; Project website: https://cshizhe.github.io/projects/vil3dref.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.01319 2022-09-07 cs.RO cs.HC 78%

Kinova Gemini: Interactive Robot Grasping with Visual Reasoning and Conversational AI

Hanxiao Chen, Jiankun Wang, Max Q. -H. Meng

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09265 2022-06-23 cs.CV 78%

SAViR-T: Spatially Attentive Visual Reasoning with Transformers

Pritish Sahu, Kalliopi Basioti, Vladimir Pavlovic

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14576 2021-11-30 cs.CV 78%

Recurrent Vision Transformer for Solving Visual Reasoning Problems

Nicola Messina, Giuseppe Amato, Fabio Carrara, Claudio Gennaro, Fabrizio Falchi

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.00910 2021-10-05 cs.RO cs.SY eess.SY 78%

AI based Algorithms of Path Planning, Navigation and Control for Mobile Ground Robots and UAVs

Jian Zhang

专题命中 视觉空间推理 :planning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.06325 2021-07-15 cs.CV 78%

Graphhopper: Multi-Hop Scene Graph Reasoning for Visual Question Answering

Rajat Koner, Hang Li, Marcel Hildebrandt, Deepan Das, Volker Tresp, Stephan Günnemann

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments arXiv admin note: text overlap with arXiv:2007.01072

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.06925 2020-07-15 cs.CV 78%

A Graph-based Interactive Reasoning for Human-Object Interaction Detection

Dongming Yang, Yuexian Zou

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted by IJCAI 2020. SOLE copyright holder is IJCAI (international Joint Conferences on Artificial Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.07883 2020-04-02 cs.CV 78%

Vision-Language Navigation with Self-Supervised Auxiliary Reasoning Tasks

Fengda Zhu, Yi Zhu, Xiaojun Chang, Xiaodan Liang

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.02701 2019-09-09 cs.CV 78%

Visual Semantic Reasoning for Image-Text Matching

Kunpeng Li, Yulun Zhang, Kai Li, Yuanyuan Li, Yun Fu

专题命中 视觉空间推理 :reasoning(title,abstract)

Comments Accepted to ICCV 2019 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
1312.2822 2013-12-11 cs.RO 78%

3D Maps Registration and Path Planning for Autonomous Robot Navigation

Konstantinos Charalampous, Ioannis Kostavelis, Dimitrios Chrysostomou, Angelos Amanatiadis, Antonios Gasteratos

专题命中 视觉空间推理 :planning(title,abstract)

Comments 3 pages, 6 figures, IROS'13 Workshop on Robots and Sensors integration in future rescue INformation system (ROSIN'13)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12743 2026-08-14 cs.AI 新提交 77%

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

空间记忆智能体:用于空间智能的基于经验的过程记忆

Haokai Zhang, Yuhang Ding, Yunshu Zhou, Xinze Du, Shengtao Zhang, Zhiyue Zhao, Yuling Xi, Hao Chen

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);verifier(abstract);分类 cs.AI

AI总结 该研究提出SMA框架,让冻结VLM智能体无需外部空间工具,通过无参数更新自进化提升空间推理,在多基准和模型上表现最优,提供了空间自进化的实用路径。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 77%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18624 2026-07-17 cs.RO cs.AI cs.CV 版本更新 77%

REST: Receding Horizon Explorative Steiner Tree for Zero-Shot Object-Goal Navigation

REST:基于零样本目标导航的视界探索Steiner树

Shuqi Xiao, Maani Ghaffari, Chengzhong Xu, Hui Kong

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(智能城市物联网国家重点实验室,澳门大学) University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 REST通过构建开放词汇3D地图、生成以代理为中心的路径树以及利用LLM推理选择最佳路径,在多个基准测试中实现了高成功率和高效路径效率。

Comments Accepted to IROS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08375 2026-07-10 cs.CV cs.AI 新提交 77%

WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving

WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型

Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song

机构 * Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21740 2026-05-26 cs.AI 77%

SMDD-Bench: Can LLMs Solve Real-World Small Molecule Drug Design Tasks?

SMDD-Bench: 大语言模型能否解决真实世界的小分子药物设计任务?

Kevin Han, Renfei Zhang, Kathy Wei, Hamed Mahdavi, Niloofar Mireshghallah, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学) Stealth Pennsylvania State University(隐形宾夕法尼亚州立大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出SMDD-Bench基准,通过502个多轮长时任务实例评估LLM在真实小分子药物设计中的表现,发现最优模型GPT5.4仅解决40.2%任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22364 2026-04-15 cs.RO cs.AI 77%

BINDER: Instantly Adaptive Mobile Manipulation with Open-Vocabulary Commands

BINDER: 基于开放词汇命令的即时自适应移动操作

Seongwon Cho, Daechul Ahn, Donghyun Shin, Hyeonbeom Choi, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) ECE, ASRI and IPAI in SNU(SNU的电子工程系、先进机器人研究所和智能感知与人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract,abstract_cn);planning(abstract);分类 cs.AI

AI总结 BINDER通过分离战略规划与连续环境监控,结合多模态大语言模型和视频大语言模型,实现动态环境下的高效移动操作,提升鲁棒性和适应性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19798 2026-04-06 cs.SD cs.CL eess.AS 77%

Borderless Long Speech Synthesis

无边界的长语音合成

Xingchen Song, Di Wu, Dinghao Zhou, Pengyu Cheng, Hongwu Ding, Yunchao He, Jie Wang, Shengfan Shen, Sixiang Lv, Lichun Fan, Hang Su, Yifeng Wang, Shuai Wang, Meng Meng, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., China(小米公司MiLM Plus,中国) Nanjing University, China(南京大学,中国) WeNet Open Source Community(WeNet开源社区)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出无边界的长语音合成框架,通过统一能力集实现多说话人合成和长文本生成,采用全局-句子-token注释策略和连续分词器提升指令遵循能力,构建分层控制协议栈实现多模态输入到结构化生成命令的转换。

详情

展开后加载摘要…

URL PDF HTML 收藏