arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2607.08798 2026-07-13 cs.GR cs.CV 新提交 50%

GReFEM: Multimodal LLMs as Zero-Shot Semantic Assistants for Physics-Guided 3D Mesh Refinement

GReFEM:多模态大语言模型作为用于物理引导的3D网格细化的零样本语义助手

Kartik Bali, Mahish K. Guru, Christian J Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling(材料系统建模研究所) Helmholtz Zentrum Hereon(海德堡研究中心Hereon) Institute of Material and Process Design(材料与加工设计研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究探索多模态大语言模型能否作为有限元网格细化的零样本几何代理,引入GReFEM框架及orthoViews视图选择模块,经实证评估发现其展示出强大零样本能力,能准确遵循复杂指令,比盲目启发式方法更精确,定义了基础模型在自动模拟中作为语义助手的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12322 2026-07-13 cs.CV 版本更新 50%

Zero-shot 3D General Obstacle Detection via Multimodal Foundation Models and Geometry

通过多模态基础模型和几何进行零样本3D通用障碍物检测

Tamás Matuszka, Péter Hajas, Dávid Szeghy

机构 * aiMotive

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对自动驾驶中通用障碍物检测难题,提出结合多模态基础模型与几何推理的免训练零样本方法,能精准定位达100米,借基础模型先验提升召回率,还可实现可扩展自动标注。

Comments Accepted to CVPR 2026 AUTOPILOT Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07880 2026-07-10 cs.CV 新提交 50%

GIRAF: Towards Generalizable Human Interactions with Articulated Objects

GIRAF:迈向与关节物体的可泛化人类交互

Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye

机构 * Meta

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对合成与关节物体的逼真全身人类交互难题,现有模型有局限。本文提出文本条件扩散模型,通过以物体为中心的表示、混合域训练策略和基于接触的增强方案应对挑战,实验证明其对未见物体配置泛化能力强,超越现有方法。

Comments 12 pages, 6 figures, 3 tables. Accepted at the Third Workshop on Human Motion Generation (HuMoGen), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 50%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新 50%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21133 2026-07-09 cs.RO 版本更新 50%

Humanoid Whole-Body Manipulation via Active Spatial Brain and Generalizable Action Cerebellum

通过主动空间大脑和可泛化动作小脑的人形全身 manipulation

Zhizhao Liang, Yi-Lin Wei, Xuhang Chen, Mu Lin, Yi-Xiang He, Zhexi Luo, Jun-Hui Liu, Kun-Yu Lin, Wei-Shi Zheng

机构 * School of Computer Science(计算机科学学院) Engineering, Sun Yat-sen University(工程学院,中山大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种通用的人形 locomotion-manipulation 框架,通过主动空间大脑和可泛化动作小脑来解决复杂3D环境中空间理解困难和动作生成泛化困难的问题,展示了在多种任务和环境中的强性能。

Comments Project page: https://leungchaos.github.io/Humanoid-Whole-Body-Manipulation-via-Active-Spatial-Brain-and-Generalizable-Action-Cerebellum/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06564 2026-07-08 cs.RO cs.CV 新提交 50%

Lift3D-VLA: Lifting VLA Models to 3D Geometry and Dynamics-Aware Manipulation

Lift3D-VLA:将VLA模型提升到3D几何和动力学感知操纵

Jiaming Liu, Qingpo Wuwu, Nuowei Han, Hao Chen, Zhuoyang Liu, Fan Fei, Yueru Jia, Chenyang Gu, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * Peking University(北京大学) CUHK(香港中文大学) AI² Robotics(智平方科技)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对VLA模型在物理环境操纵中几何理解和空间推理不足的问题,提出Lift3D-VLA框架。通过增强2D模型提升策略、GC-MAE自监督框架及分层时间动作建模,提升模型3D几何和动力学感知能力,在模拟和现实任务中取得更好效果。

Comments 14 pages, 7 figures. Project website: https://lift3dvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13808 2026-07-08 cs.CV 版本更新 50%

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

VisCoP:用于视觉语言模型视频域适应的视觉探测

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学查塔努加分校) Elorian AI(Elorian人工智能公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对视觉语言模型在新领域性能下降问题,提出参数高效的VisCoP框架,通过可学习视觉探测器增强视觉编码器,在多种适应设置下评估,该框架优于现有策略,能有效适应新领域且保留源域能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05348 2026-07-07 cs.CV cs.RO 新提交 50%

Beyond Isolated Objects: Relationship-aware Open Vocabulary Scene Understanding via 3D Scene Graph Analysis

超越孤立对象:基于3D场景图分析的关系感知开放词汇场景理解

Xianhao Chen, Jiarui Hu, Yuanbo Yang, Xiyu Zhang, Tengyue Wang, Hujun Bao, Guofeng Zhang, Zhaopeng Cui

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Zhejiang University(浙江大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对现有开放词汇3D理解方法忽略对象关系的问题,提出RelGraphOV框架,通过3D场景图与自适应门控双流式图注意力网络,提升场景理解性能与泛化性。

Comments Project Page: https://cxavireh.github.io/relgraphov-projectpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04860 2026-07-07 cs.CV cs.HC 新提交 50%

PAGE: Towards Practical Human-level Gaze Target Estimation

PAGE:迈向实用的人类水平注视目标估计

Zhoutong Ye, Chengwen Zhang, Zhaibin Cui, Mingze Sun, Jiaqi Liu, Xiangwu Li, Qingyang Wan, Chang Liu, Xutong Wang, Huan-ang Gao, Yu Mei, Chun Yu, Yuanchun Shi

机构 * Tsinghua University(清华大学) Jinan University(暨南大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出PaGE模型明确建模场景与头部特征交互,以大ViT-H+骨干模型为教师,在更大更多样未标注数据集上蒸馏轻量级学生模型,提升注视估计性能,缩小人机差距且便于实际部署。

Comments Project page: https://PaGE-26.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04352 2026-07-07 cs.CV 新提交 50%

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach

无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法

Yaxuan Li, Jiarui Zeng, Shaofei Huang, Zhedong Zheng

机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04057 2026-07-07 cs.CV cs.RO 新提交 50%

PreSIST: Vision-Language-Informed Object Persistence Prediction in Open-World Scenes

PreSIST:开放世界场景中视觉-语言信息的对象持久性预测

Amanda Adkins, Tarunvidyut Ravisankar, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) National Science Foundation(美国国家科学基金会) ARO(美国陆军研究办公室) Amazon(亚马逊公司) JP Morgan(摩根大通公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究长期部署机器人对环境变化的推理,提出PreSIST方法,通过对象属性和场景上下文估计实例级持久性先验,结合概率持久性过滤器预测对象未来姿态,有两种变体,实验表明优于基线。

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03616 2026-07-07 cs.RO 新提交 50%

ROBOCYCLE: Autonomous Dual-Arm Robotic Manipulation and Coordination for Recycling Applications

ROBOCYCLE:用于回收应用的自主双臂机器人操作与协调

Rubén de J. Hilario-Cruz, Jesus A. García-González, Enrique Coronado, Arturo E. Cerón-López

机构 * Tecnologico de Monterrey, School of Engineering and Sciences, Department of Computer Science(墨西哥蒙特雷理工大学工程学院与科学学院计算机科学系) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 针对城市垃圾处理难题,介绍ROBOCYCLE平台,集成多视图RGB-D感知、基于变压器的实例分割及6自由度抓取规划,有效处理不规则和可变形垃圾,取得高成功率,为现实环境自主垃圾管理提供方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01885 2026-07-07 cs.CV 新提交 50%

Diversity-aware View Partitioning for Scalable VGGT

面向可扩展VGGT的多样性感知视图划分

Jinsoo Park, Donggyu Choi, Ahyun Seo, Minsu Cho, Jeany Son

机构 * POSTECH(浦项科技大学) GIST(光州科学技术院) KAIST(韩国科学技术院) RLWRLD

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对VGGT在大量视图下注意力计算成本高且冗余视图降低性能的问题,提出基于视觉差异和空间分散的图划分方法,将视图组织为多样性感知的平衡块,减少冗余注意力交互,提升相机位姿估计、多视图深度预测和3D重建性能。

Comments 34 pages, 11 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01812 2026-07-03 cs.CE 新提交 50%

TO-Master: an LLM-agent framework for automated topology optimization

TO-Master:用于自动化拓扑优化的大语言模型智能体框架

Haoju Lin, Wenchang Zhang, Weipeng Xu, Xiang Li, Tian Xu, Tianju Xue

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出TO-Master框架,利用大语言模型智能体将有限元拓扑优化转化为对话式工作流,通过自然语言指令自动完成几何处理、网格生成、边界条件设置和优化求解,无需用户编写代码。

Comments 29 pages, 10 figures, 2 tables; submitted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 50%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01079 2026-07-02 cs.RO 新提交 50%

Where Am I? Semantic Map Grounding via Vision-Language Models for Multi-Modal Localization

我在哪里?基于视觉-语言模型的语义地图定位用于多模态定位

Suraj Borate, Aarav Shah, Madhu Vadali

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 将机器人定位重构为语义推理任务,使用微调的Qwen2.5-VL-7B模型融合摄像头、LiDAR和语义地图预测位姿,在室内数据集上达到98.23%位置精度,并展现出跨模态互补性和对新场景的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00255 2026-07-02 cs.IT math.IT 新提交 50%

SLM, LLM or Agentic AI? Toward Intelligent UAV-Enabled WPT Systems in Low-Altitude Economy Networks

SLM、LLM 还是 Agentic AI?面向低空经济网络中智能无人机赋能WPT系统

Feibo Jiang, Li Dong, Lei Mao, Kezhi Wang, Xianbin Wang, Abbas Jamalipour

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究在资源受限动态环境下,利用小语言模型(SLM)和基于大语言模型(LLM)的Agentic AI框架优化无人机无线充电(WPT)路径与能量,实现低复杂度、低延迟和高能效。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23365 2026-07-02 cs.CV 版本更新 50%

SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

SpatialMosaic:一个多视角VLM数据集用于部分可见性

Kanghee Lee, Jungi Hong, Sion Lee, Injae Lee, Minseok Kwak, Kwonyoung Ryu, Jaesik Park

机构 * Seoul National University(首尔大学) University College London(伦敦大学学院) Kyung Hee University(庆熙大学) POSTECH(浦项科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SpatialMosaic数据集,通过多视角图像生成2M问答对,引入SpatialMosaic-Bench基准测试,结合3D重建模型的混合框架提升空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06254 2026-07-02 cs.CV cs.RO eess.IV 版本更新 50%

NOVA: Next-step Open-Vocabulary Autoregression for 3D Multi-Object Tracking in Autonomous Driving

NOVA:自动驾驶中3D多目标跟踪的下一步开放词汇自回归

Kai Luo, Xu Wang, Rui Fan, Kailun Yang

机构 * College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与运载工程学院) State Key Laboratory of Intelligent Autonomous Systems, Tongji University(同济大学智能自主系统国家重点实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出NOVA方法,通过自回归关联将3D多目标跟踪转化为轨迹条件时空语义序列完成,利用大语言模型实现开放词汇泛化,在nuScenes等数据集上显著提升新类别跟踪性能。

Comments Accepted to IROS 2026. Code will be available at https://github.com/xifen523/NOVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19326 2026-07-02 cs.CV 版本更新 50%

MonoMSK: Monocular 3D Musculoskeletal Dynamics Estimation

MonoMSK: 单目3D肌肉骨骼动力学估计

Farnoosh Koleini, Hongfei Xue, Ahmed Helmy, Pu Wang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出MonoMSK混合框架,结合数据驱动与物理仿真,从单目视频估计生物力学真实的3D人体运动(运动学与动力学),通过ODE仿真和逆动力学实现高精度运动与力估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30608 2026-07-01 cs.CV 版本更新 50%

UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image

UnfoldArt: 从文本或图像零样本恢复完整关节式3D物体

Mohamed el Amine Boudjoghra, Ivan Laptev, Angela Dai

机构 * Technical University of Munich(慕尼黑工业大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出首个辩论驱动代理方法,结合视觉语言模型和视频生成先验,从文本或图像零样本重建关节式3D物体的结构、运动与隐藏几何。

Comments Project page: https://aminebdj.github.io/unfoldart

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30678 2026-07-01 physics.chem-ph physics.bio-ph physics.ed-ph 新提交 50%

NanoVer: An open-source framework for interactive molecular dynamics in extended reality (iMD-XR) on commodity hardware

NanoVer: 一个用于在消费级硬件上进行扩展现实交互式分子动力学(iMD-XR)的开源框架

Mark D. Wonnacott, Luis Ernesto Toledo Castro, Harry J. Stroud, Ludovica Aisa, Mohamed Dhouioui, Rhoslyn Roebuck Williams, Denis Protopopov, Sila Sobrado, David R. Glowacki

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文介绍NanoVer,一个开源框架,允许多人共处同一虚拟空间,以原子级精度实时操控柔性3D分子结构的分子动力学模拟,支持消费级独立XR硬件,并实现多客户端通信与多种任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18747 2026-07-01 cs.CV 版本更新 50%

URoPE: Universal Relative Position Embedding across Geometric Spaces

URoPE: 在几何空间中实现通用的相对位置嵌入

Yichen Xie, Depu Meng, Chensheng Peng, Yihan Hu, Quentin Herau, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition(应用直觉) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 URoPE扩展了RoPE,使模型能在不同视角或维度的几何空间中处理位置信息,适用于多任务如视图合成、3D检测等,提升模型在几何推理中的表现。

Comments Accepted by ECCV 2026. Code is available: https://urope-pe.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16271 2026-07-01 cs.CV 版本更新 50%

VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment

VIGOR: 面向视频几何的时序生成对齐奖励

Tengjiao Yin, Jinglei Shi, Heng Guo, Xi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉空间推理 :verifier(abstract)

AI总结 提出基于几何的奖励模型,利用预训练几何基础模型通过跨帧重投影误差评估多视图一致性,以点方式计算误差,并引入几何感知采样策略,通过后训练和推理时优化对齐视频扩散模型,提升生成视频的几何一致性。

Comments Project Page: https://vigor-geometry-reward.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23721 2026-07-01 cs.RO cs.CV 版本更新 50%

StemVLA:An Open-Source Vision-Language-Action Model with Future 3D Spatial Geometry Knowledge and 4D Historical Representation

StemVLA:一种融合未来3D空间几何知识与4D历史表示的开源视觉-语言-动作模型

Jiasong Xiao, Yutao She, Kai Li, Yuyang Sha, Ziang Cheng

机构 * Ricoh Software Research Center(理光软件研究中心) YZH Engineering Technology (Beijing) Co., Ltd.(易智赫工程技术(北京)有限公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出StemVLA框架,通过显式建模未来3D空间结构和历史4D时空表示,提升机器人操作任务中的空间推理与长时决策能力,在LIBERO基准上平均准确率达92.0%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11270 2026-07-01 cs.CV 版本更新 50%

Φeat: Physically Grounded Material Feature Representation

Φeat: 物理基础的材料特征表示

Giuseppe Vecchio, Adrien Kaiser, Claudia Cuttano, Rouffet Romain, Rosalie Martin, Elena Garces, Tamy Boubekeur

机构 * Adobe Research, France(Adobe研究院(法国))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出Φeat视觉骨干网络,通过对比同一材料在不同光照和几何下的观测,学习对材料身份敏感的表征,提升材料选择与分类等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30638 2026-06-30 cs.CV 50%

Open-Vocabulary and Referring Segmentation for 3D Gaussians Using 2D Detectors

开放词汇与指代分割:利用2D检测器实现3D高斯

Jameel Hassan, Yasiru Ranasinghe, Vishal Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出GaussDet方法,利用离散的2D开放词汇检测器与指代表达能力,通过视图聚合语义标签分布实现3D场景的开放词汇分割和指代分割,在零样本设置下显著提升指代分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30404 2026-06-30 cs.RO 50%

HUMEMBR: Learning Human Routines for Predictive Embodied Navigation

HUMEMBR:学习人类日常行为以进行预测性具身导航

Samira Huber, Klaas Pelzer, Duc M. Nguyen, Xuesu Xiao, Sören Pirk

机构 * Kiel University, Germany(德国基尔大学) George Mason University, USA(美国乔治·马歇尔大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出HUMEMBR系统,通过连续记忆构建与并行检索机制,实现基于人类日常行为的具身问答和导航,相比全上下文LLM基线在长时推理上更高效。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30014 2026-06-30 cs.CV 50%

Shell-Supervised Gaussian Splatting for Urban Real-to-Sim Reconstruction

壳监督高斯溅射用于城市真实到仿真重建

Yuan Yang, Peijun Lu, Fangzhou Lu, Sai Fan, Siqi Yan, Chenyuan Zhang, Haobo Liang, Yichen Wang

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出壳监督高斯溅射框架,利用外部立面结构壳作为几何监督,通过掩码门控损失优化高斯重建,提升城市立面几何一致性。

Comments 10 pages main paper, 2 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏