arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 499 信号源:cs.CV, cs.GR, cs.RO

1. 空间理解 499 篇

2607.15176 2026-07-22 cs.AI cs.CL cs.HC 版本更新 50%

Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy

用于科学可视化素养的多模态大语言模型基准测试

Patrick Phuoc Do, Chau M. Ta, Chaoli Wang

机构 * University of Notre Dame(圣母大学)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 研究对六个多模态大语言模型进行科学可视化素养基准测试,涵盖多种技术和任务类型。通过封闭世界协议评估闭源和开源模型,与人类参与者数据对比。发现模型表现不均,Gemini最强,开源模型低于人类基线,明确SciVis素养对评估多模态AI系统的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14588 2026-07-17 cs.HC 新提交 50%

Conversational Tactile Data Interfaces: Co-Designing Accessible Data Experiences with Blind Users Using Refreshable Tactile Displays and Conversational AI

对话式触觉数据接口:使用可刷新触觉显示器和对话式人工智能与盲人用户共同设计无障碍数据体验

Samuel Reinders, Munazza Zaib, Bongshin Lee, Ingrid Zukerman, Matthew Butler, Thien Autran, Sascha Cowley, Francois Jacobs, Lizhen Qu, Kim Marriott

专题命中 空间理解 :spatial understanding(abstract)

AI总结 研究针对盲人或视力低下者数据可视化问题,通过与盲人共同设计师协同设计,创建结合可刷新触觉显示器与对话代理的CTDI(Graphy系统),贡献设计知识与建议,得出分层展示等关键发现。

Comments Accepted to be presented at IEEE VIS 2026 and published in IEEE TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10822 2026-07-14 cs.LG 新提交 50%

Graph Neural Networks for RFID-Based Spatial Geometry Inference in Spatial AI Systems

空间人工智能系统中基于 RFID 的空间几何推理的图神经网络

Curtis Shull, Merrick Green, Roy Rucker

专题命中 空间理解 :spatial understanding(abstract)

AI总结 针对室内空间理解难题,本文提出基于图神经网络的学习框架,整合信号强度等数据构建图表示,通过 GNN 训练预测空间几何模式,如线性轨迹等,为室内定位等提供新方法。

Comments 38 pages, 10 figures. Introduces a Graph Neural Network framework for RFID-based spatial geometry inference using indoor floorplan semantics and digital twin representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03530 2026-07-07 cs.AI 新提交 50%

MentalThink: Shaping Thoughts in Mental SVG World

MentalThink:在心理SVG世界中塑造思想

Kangheng Lin, Jisheng Yin, Dingming Li, En Yu, Yana Wei, Han Zhou, Liang Zhao, Hongyu Zhou, Hongbo Peng, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Jingyu Wang

专题命中 空间理解 :spatial understanding(abstract)

AI总结 介绍MentalThink视觉符号推理范式,核心是think-with-SVG管道,通过两阶段训练框架实例化,在空间理解和推理基准测试中性能优越,为动态视角获取等提供可视化工作区。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23717 2026-06-24 eess.IV 新提交 50%

SpaCE: Rethinking Spatial Capacity and Generalization in Multi-Frame Multimodal Large Language Models

SpaCE: 重新思考多帧多模态大语言模型中的空间容量与泛化能力

Mariana Costa, Camila Ferreira, Alberlucia Rafael Soarez, Alejandro Torres

专题命中 空间理解 :spatial understanding(abstract)

AI总结 提出SpaCE理论框架,证明多帧空间推理的信息论上界、样本复杂度界、PAC-Bayes泛化界,并刻画显式3D表示与隐式推理的偏差-方差权衡,在多个基准上验证了理论紧致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06147 2026-06-05 cs.AI 50%

WorldFly: A World-Model-Based Vision-Language-Action Model for UAV Navigation

WorldFly: 基于世界模型的视觉-语言-动作模型用于无人机导航

Shengtao Zheng, Kai Li, Weichen Zhang, Yu Meng, Chen Gao, Xinlei Chen, Yong Li, Xiao-Ping Zhang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) BNRist, Tsinghua University(清华大学北京研究院)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 提出WorldFly框架,通过双分支耦合流匹配机制联合生成未来视频预测和导航动作,解决城市峡谷中严重遮挡和视角剧变下的无人机导航问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20006 2026-05-20 cs.AI 50%

GeoX: Mastering Geospatial Reasoning Through Self-Play and Verifiable Rewards

GeoX:通过自我对战和可验证奖励掌握地理空间推理

Kyeongjin Ahn, Seungeon Lee, Krishna P. Gummadi, Meeyoung Cha

机构 * KAIST(韩国科学技术院) MPI-SP(马克斯·普朗克研究所) MPI-SWS(马克斯·普朗克研究所)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文提出GeoX框架,通过自我对战和可验证奖励解决图像 grounded 的复杂空间问题,无需大规模人工标注数据,提升了基础视觉语言模型在地理空间理解上的性能。

Comments 26 pages,12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14641 2026-04-17 cs.AI 50%

Learning to Draw ASCII Improves Spatial Reasoning in Language Models

学习绘制ASCII图提高语言模型的空间推理能力

Shiyuan Huang, Li Liu, Jincheng He, Leilani H. Gilpin

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文通过Text2Space数据集研究语言模型通过构造视觉布局提升空间推理能力,发现构造与理解训练结合可显著增强空间推理,并在外部基准上验证了其泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14637 2026-04-17 cs.HC 50%

Touching Space: Accessible Map Exploration Through Conversational Audio-Haptic Interaction

触碰空间:通过对话式音频-触觉交互实现可访问的地图探索

Li Liu, Jiaming Qu, Marc Jowell Bagaoisan, David T. Lee, Leilani H. Gilpin

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文提出Touching Space系统,通过触觉和音频反馈帮助视障人士构建环境认知地图,支持在普通硬件上实现空间探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11202 2026-04-14 cs.AR cs.LG 50%

CapBench: A Multi-PDK Dataset for Machine-Learning-Based Post-Layout Capacitance Extraction

CapBench:一种用于基于机器学习的后布局电容提取的多PDK数据集

Hector R. Rodriguez, Jiechen Huang, Wenjian Yu

机构 * Department of Computer Science \& Technology, BNRist, Tsinghua University Beijing China Department of Computer Science \& Technology, BNRist, Tsinghua University

专题命中 空间理解 :point cloud(abstract)

AI总结 CapBench通过多PDK数据集支持基于机器学习的电容提取研究,包含61855个3D窗口用于迁移学习和可扩展性研究,评估了10种机器学习架构,展示了精度与速度的权衡。

Comments Accepted at the 63rd ACM/IEEE Design Automation Conference (DAC '26). 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10690 2026-04-14 cs.AI 50%

Do LLMs Build Spatial World Models? Evidence from Grid-World Maze Tasks

大型语言模型构建空间世界模型了吗?基于网格世界迷宫任务的证据

Weijiang Li, Yilin Zhu, Rajarshi Das, Parijat Dube

机构 * University of Notre Dame(圣母大学) Columbia University(哥伦比亚大学) MQube Cognition(MQube认知实验室)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文通过迷宫任务评估LLM的空间理解能力,发现其空间推理依赖于表示形式而非任务类型,表明LLM缺乏稳健的空间世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10517 2026-04-14 cs.AI 50%

From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning

从感知到规划:通过课程学习进化自主任务导向的空间时间推理

Xiaoda Yang, Yuxiang Liu, Shenzhou Gao, Can Wang, Jingyang Xue, Lixin Yang, Yao Mu, Tao Jin, Shuicheng Yan, Zhimeng Zhang, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tianjin University(天津大学) Qingdao University(青岛大学) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文提出EgoTSR框架,通过课程学习提升任务导向的空间时间推理能力,解决静态感知和动态环境中的时空幻觉问题,实验显示其在长周期推理任务中准确率达92.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07296 2026-04-10 cs.CL 50%

OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence

OpenSpatial: 一种原则性的数据引擎,以赋能空间智能

Jianhui Liu, Haoze Sun, Wenbo Li, Yanbing Zhang, Rui Yang, Zhiliang Zhu, Yijun Yang, Shenghe Zheng, Nan Jiang, Jiaxiu Jiang, Haoyang Huang, Tien-Tsin Wong, Nan Duan, Xiaojuan Qi

机构 * Joy Future Academy(京东探索研究院) The University of Hong Kong(香港大学) Monash University(莫纳什大学)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文提出OpenSpatial数据引擎,通过构建五类基础任务的空间数据层次,生成高质量大规模数据集,提升空间推理性能,并系统分析数据属性对空间感知的影响。

Comments Code: https://github.com/VINHYU/OpenSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00296 2026-04-02 cs.HC 50%

NeuroVase: A Tangible Mobile Augmented Reality Learning System for Neurovascular Anatomy and Stroke Education

NeuroVase:一种用于神经血管解剖和中风教育的可触摸移动增强现实学习系统

Bahar Jahani, Matsanga Leyila Kaseka, Marta Kersten-Oertel, Yiming Xiao

专题命中 空间理解 :spatial understanding(abstract)

AI总结 NeuroVase通过可触摸卡片和AR技术提供交互式神经血管解剖学习,提升中风教育的效率和用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15409 2026-03-17 cs.CL 50%

SEA-Vision: A Multilingual Benchmark for Comprehensive Document and Scene Text Understanding in Southeast Asia

SEA-Vision:面向东南亚的多语言综合文档和场景文本理解基准

Pengfei Yue, Xingran Zhao, Juntao Chen, Peng Hou, Wang Longchao, Jianghang Lin, Shengchuan Zhang, Anxiang Zeng, Liujuan Cao

机构 * Xiamen University, China(厦门大学,中国) Shopee, China(Shopee,中国) Tongji University, China(同济大学,中国)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 SEA-Vision提出一个多语言基准,用于评估文档解析和文本中心视觉问答,涵盖11种东南亚语言,包含15234页文档和7496对问答对,揭示多语言文档理解的差距。

Comments Accepted By CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02724 2026-03-04 cs.SD cs.LG 50%

Single Microphone Own Voice Detection based on Simulated Transfer Functions for Hearing Aids

基于模拟传输函数的单麦克风自身语音检测

Mathuranathan Mayuravaani, W. Bastiaan Kleijn, Andrew Lensen, Charlotte Sørensen

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文提出基于模拟传输函数的单麦克风自身语音检测方法,通过数据增强和层次化微调提升模型泛化能力,实现高准确率的OVD应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02498 2026-03-04 cs.HC 50%

Improving Low-Vision Chart Accessibility via On-Cursor Visual Context

通过光标视觉上下文提高低视力图表的可访问性

Yotam Sechayk, Hennes Rave, Max Rädler, Mark Colley, Zhongyi Zhou, Ariel Shamir, Takeo Igarashi

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文提出两种基于指针的交互方法,通过提供视觉上下文提高低视力者访问图表的能力,同时平衡视觉负荷。

Comments CHI '26, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14442 2026-02-17 cs.HC 50%

Touching Movement: 3D Tactile Poses for Supporting Blind People in Learning Body Movements

触觉运动:3D触觉姿势用于支持视障人士学习身体运动

Kengo Tanaka, Xiyue Wang, Hironobu Takagi, Yoichi Ochiai, Chieko Asakawa

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本研究通过3D打印人体模型帮助视障人士更有效地学习身体运动,实验显示该方法在理解速度、准确性及学习动机方面优于传统教学方法。

Comments Accepted to TEI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02624 2026-01-07 cs.HC 50%

EgoLog: Ego-Centric Fine-Grained Daily Log with Ubiquitous Wearables

EgoLog:基于普及式可穿戴设备的以自我为中心的细粒度日常日志

Lixing He, Bufang Yang, Di Duan, Zhenyu Yan, Guoliang Xing

专题命中 空间理解 :spatial understanding(abstract)

AI总结 EgoLog通过融合音频与IMU数据及LLM推理,实现了基于普及式可穿戴设备的细粒度日常日志识别,提升了场景和活动识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24532 2026-01-01 cs.AI cs.CL 50%

From Building Blocks to Planning: Multi-Step Spatial Reasoning in LLMs with Reinforcement Learning

从积木到规划:通过强化学习在LLMs中实现多步骤空间推理

Amir Tahmasbi, Sadegh Majidi, Kazem Taram, Aniket Bera

机构 * Department of Computer Science(计算机科学系)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 本文提出了一种两阶段方法,通过强化学习在LLMs中实现多步骤空间推理,通过微调和LoRA适配器提升模型在结构环境中的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16237 2025-12-19 cs.AI 50%

Scaling Spatial Reasoning in MLLMs through Programmatic Data Synthesis

通过程序化数据合成提升大规模语言模型的空间推理能力

Zhi Helu, Huang Jingjing, Xu Wang, Xu Yangbin, Zhang Wanyue, Jiang Baoyang, Deng Shirui, Zhu Liang, Li Fangfang, Zhao Tiejun, Lin Yankai, Yao Yuan

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院电子学研究所) Renmin University of China(中国人民大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学)

专题命中 空间理解 :spatial understanding(abstract)

AI总结 SPRITE通过程序化数据合成生成高质量空间推理数据,提升大规模语言模型的空间推理能力,并在多个基准测试中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10418 2025-11-14 cs.DB 50%

CityVerse: A Unified Data Platform for Multi-Task Urban Computing with Large Language Models

Yaqiao Zhu, Hongkai Wen, Mark Birkin, Man Luo

专题命中 空间理解 :spatial understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18905 2025-11-12 cs.AI 50%

How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective

Songsong Yu, Yuxin Chen, Hao Ju, Lianjie Jia, Fuxi Zhang, Shaofei Huang, Yuhan Wu, Rundi Cui, Binghao Ran, Zaibin Zhang, Zhedong Zheng, Zhipeng Zhang, Yifan Wang, Lin Song, Lijun Wang, Yanwei Li, Ying Shan, Huchuan Lu

机构 * ARC Lab, Tencent PCG(腾讯PCG部门ARC实验室) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 空间理解 :spatial understanding(abstract)

Comments a comprehensive visual spatial reasoning evaluation tool, 25 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06344 2025-11-11 cs.CL cs.AI 50%

TimeSense:Making Large Language Models Proficient in Time-Series Analysis

Zhirui Zhang, Changhua Pei, Tianyi Gao, Zhe Xie, Yibo Hao, Zhaoyang Yu, Longlong Xu, Tong Xiao, Jing Han, Dan Pei

机构 * Tsinghua University(清华大学) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ZTE Corporation(中兴通讯)

专题命中 空间理解 :spatial understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03478 2025-11-06 cs.HC 50%

SVG Decomposition for Enhancing Large Multimodal Models Visualization Comprehension: A Study with Floor Plans

Jeongah Lee, Ali Sarvghad

专题命中 空间理解 :spatial understanding(abstract)

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24706 2025-10-29 cs.CL cs.AI cs.HC cs.SE 50%

ComboBench: Can LLMs Manipulate Physical Devices to Play Virtual Reality Games?

Shuqing Li, Jiayi Yan, Chenyu Niu, Jen-tse Huang, Yun Peng, Wenxuan Wang, Yepang Liu, Michael R. Lyu

机构 * Chinese University of Hong Kong(香港中文大学) Southern University of Science and Technology(南方科技大学)

专题命中 空间理解 :spatial understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22798 2025-10-28 cs.CL cs.LG 50%

VEHME: A Vision-Language Model For Evaluating Handwritten Mathematics Expressions

Thu Phuong Nguyen, Duc M. Nguyen, Hyotaek Jeon, Hyunwook Lee, Hyunmin Song, Sungahn Ko, Taehwan Kim

专题命中 空间理解 :spatial understanding(abstract)

Comments EMNLP 2025. Project Website: https://vehme.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20198 2025-10-24 cs.CL cs.AI 50%

Stuck in the Matrix: Probing Spatial Reasoning in Large Language Models

Maggie Bai, Ava Kim Cohen, Eleanor Koss, Charlie Lichtenbaum

专题命中 空间理解 :spatial understanding(abstract)

Comments 20 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05542 2025-10-08 cs.SD cs.CL eess.AS 50%

Sci-Phi: A Large Language Model Spatial Audio Descriptor

Xilin Jiang, Hannes Gamper, Sebastian Braun

机构 * Columbia University(哥伦比亚大学) Microsoft Research(微软研究院)

专题命中 空间理解 :spatial understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21919 2025-09-29 cs.SD eess.AS 50%

Text2Move: Text-to-moving sound generation via trajectory prediction and temporal alignment

Yunyi Liu, Shaofan Yang, Kai Li, Xu Li

专题命中 空间理解 :spatial understanding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏