arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

3D 视觉

三维重建、NeRF、Gaussian Splatting、点云和空间智能。

共收录 497 信号源:cs.CV, cs.GR, cs.RO

1. 空间理解 497 篇

2603.28178 2026-04-21 cs.CV 57%

ToLL: Topological Layout Learning with Asymmetric Cross-View Structural Distillation for 3D Scene Graph Generation Pretraining

ToLL: 基于非对称跨视图结构蒸馏的拓扑布局学习用于3D场景图生成预训练

Yucheng Huang, Luping Ji, Xiangwei Jiang, Wen Li, Mao Ye

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出ToLL框架,通过拓扑几何推理和结构多视图增强,解决3D场景图生成预训练中的几何捷径问题,提升场景图生成质量。

Comments Under Reivew

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12676 2026-04-21 cs.CV cs.AI 57%

BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections

BridgeEQA:用于真实桥梁检查的虚拟具身代理

Subin Varghese, Joshua Gao, Asad Ur Rahman, Vedhus Hoskere

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出BridgeEQA基准,通过200个真实桥梁场景和2200个开放词汇问题对,评估具身记忆问答能力,引入Image Citation Relevance指标,并提出EMVR模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11600 2026-04-17 cs.CV 57%

Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language

几何解析:一种统一形式语言用于平面和立体几何的图表解析

Peijie Wang, Ming-Liang Zhang, Jun Cao, Chao Deng, Dekang Ran, Hongda Sun, Pi Bu, Xuan Zhang, Yingyao Wang, Jun Song, Bo Zheng, Fei Yin, Cheng-Lin Liu

机构 * MAIS, Institute of Automation of Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出一种统一形式语言,结合平面和立体几何,构建了GDP-29K数据集,通过监督微调与可验证奖励的强化学习提升几何解析性能,提升MLLMs的几何推理能力。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09531 2026-04-13 cs.CV cs.AI cs.CL 57%

VisionFoundry: Teaching VLMs Visual Perception with Synthetic Images

VisionFoundry: 通过合成图像教授VLMs的视觉感知

Guanyu Zhou, Yida Yin, Wenhao Chai, Shengbang Tong, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出VisionFoundry,通过任务关键词生成合成数据,提升VLMs在空间理解和视角识别等视觉感知任务上的性能,构建了包含10k图像-问题-答案三元组的VQA数据集,并在多个基准测试中取得显著提升。

Comments Project Page: https://zlab-princeton.github.io/VisionFoundry/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17732 2026-04-10 cs.CV cs.AI cs.LG 57%

RQR3D: Reparametrizing the regression targets for BEV-based 3D object detection

RQR3D:基于鸟瞰图的3D目标检测的回归目标重新参数化

Ozsel Kilinc, Cem Tarhan

机构 * Amazon Lab 126(亚马逊126实验室) Togg/Trutek AI Team(Togg/Trutek人工智能团队)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出RQR3D方法,通过重新参数化回归目标将旋转目标检测转化为关键点回归任务,实现高效且准确的3D目标检测,适用于自动驾驶场景。

Comments To appear in proceedings of CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21714 2026-04-09 cs.CV 57%

AstraNav-World: World Model for Foresight Control and Consistency

AstraNav-World:面向前瞻性控制与一致性的世界模型

Jintao Chen, Junjun Hu, Haochen Bai, Minghua Luo, Xinda Xue, Botao Ren, Chengyu Bai, Shichao Xie, Ziyi Chen, Fei Liu, Zedong Chu, Xiaolong Wu, Mu Xu, Shanghang Zhang

机构 * Amap Alibaba(高德阿里巴巴)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出AstraNav-World,通过统一的概率框架联合推理未来视觉状态与动作序列,提升开放动态环境中的导航轨迹精度与成功率,实验表明其在真实场景中具备零样本适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04933 2026-04-07 cs.CV 57%

PointTPA: Dynamic Network Parameter Adaptation for 3D Scene Understanding

PointTPA:用于3D场景理解的动态网络参数适应

Siyuan Liu, Chaoqun Zheng, Xin Zhou, Tianrui Feng, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 PointTPA通过动态网络参数适应提升3D场景理解,采用SNG和DPP方法生成输入感知参数,实现参数高效且在ScanNet上取得78.4% mIoU。

Comments Accepted by CVPR 2026. The code is available at https://github.com/H-EmbodVis/PointTPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27183 2026-04-02 cs.CV 57%

Communicating about Space: Language-Mediated Spatial Integration Across Partial Views

关于空间的交流:通过语言介导的空间整合跨部分视图

Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru, Aishwarya Agrawal

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) IIIT Hyderabad(海得拉巴国际信息技术学院)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 研究探讨多模态大语言模型能否通过对话整合不同视角,发现其在识别共享锚点物体上表现较好,但在关系推理和全局地图构建上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00818 2026-04-01 cs.AI cs.CV 57%

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理

Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Tongji University(同济大学) Ruijin Hospital(瑞金医院) Technical University of Munich(慕尼黑工业大学) Zhejiang University(浙江大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 Med-CMR通过细粒度分解医疗多模态推理能力,设计挑战性任务并覆盖广泛高质量数据,评估18种先进大语言模型,发现GPT-5在多项选择题和开放性评分中表现最佳,但专业医疗大语言模型并不总能超越强通用模型,长尾泛化成为主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27970 2026-03-31 cs.CV 57%

AffordMatcher: Affordance Learning in 3D Scenes from Visual Signifiers

AffordMatcher: 从视觉符号中学习3D场景中的 affordance

Nghia Vu, Tuong Do, Khang Nguyen, Baoru Huang, Nhat Le, Binh Xuan Nguyen, Erman Tjiputra, Quang D. Tran, Ravi Prakash, Te-Chuan Chiu, Anh Nguyen

机构 * University of Liverpool(利物浦大学) AIOZ Ltd.(AIOZ有限公司) National Tsing Hua University(国立清华大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Western Australia(西澳大学) Indian Institute of Science(印度科学理工学院) NVIDIA(英伟达)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 本文提出AffordMatcher,通过结合点云和图像实例,利用视觉符号实现更精确的affordance区域识别,基于大规模数据集验证了方法有效性。

Comments 14 pages. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27294 2026-03-31 cs.CV 57%

Class-Distribution Guided Active Learning for 3D Occupancy Prediction in Autonomous Driving

基于类分布的主动学习用于自动驾驶中的3D占用预测

Wonjune Kim, In-Jae Lee, Sihwan Hwang, Sanmin Kim, Dongsuk Kum

机构 * KAIST(韩国科学技术院) Seoul National University(首尔大学) Kookmin University(国民大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出一种基于类分布的主动学习框架,通过三种互补标准选择训练样本,以解决自动驾驶中3D占用预测的类别不平衡和标注成本问题,实现在仅42.4%标注数据下达到26.62 mIoU的性能。

Comments IEEE RA-L 2026

Journal ref IEEE Robotics and Automation Letters (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23864 2026-03-26 cs.CV 57%

See, Remember, Explore: A Benchmark and Baselines for Streaming Spatial Reasoning

看见、记忆、探索:面向流式空间推理的基准与基线

Yuxi Wei, Wei Huang, Qirui Chen, Lu Hou, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Yinwang Intelligent Technology Co. Ltd.(云网智能技术有限公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出S3-Bench基准,通过流式空间问答与主动探索解决传统方法在长时序推理和主动感知方面的不足,并提出AMF-VLM模型在压缩内存与主动探索方面实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23523 2026-03-26 cs.CL cs.RO 57%

Do 3D Large Language Models Really Understand 3D Spatial Relationships?

三维大语言模型真的能理解三维空间关系吗?

Xianzheng Ma, Tao Sun, Shuai Chen, Yash Bhalgat, Jindong Gu, Angel X Chang, Iro Armeni, Iro Laina, Songyou Peng, Victor Adrian Prisacariu

机构 * VGG(视觉信息组) University of Oxford(牛津大学) Stanford University(斯坦福大学) Simon Fraser University(西蒙弗雷泽大学) Google DeepMind(谷歌DeepMind)

专题命中 空间理解 :3D vision(abstract);分类 cs.RO

AI总结 本文挑战了3D-LLM对三维空间关系的理解能力,提出Real-3DQA基准测试,发现现有模型在去除简单线索后表现不佳,并提出3D重加权训练目标以提升空间推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23023 2026-03-25 cs.CV 57%

Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps

Cog3DMap:基于3D认知地图的多视角视觉语言推理

Chanyoung Gwak, Yoonwoo Jeong, Byungwoo Jeon, Hyunseok Lee, Jinwoo Shin, Minsu Cho

机构 * POSTECH KAIST(韩国科学技术院) RLWRLD

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出Cog3DMap框架,通过构建显式的3D记忆,使多视角图像中的每个token都具备语义和几何信息,从而提升多模态大语言模型的空间推理能力。

Comments Project Page: https://cog3dmap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22760 2026-03-25 cs.RO 57%

SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation

SG-VLA:学习空间接地的视觉-语言-动作模型用于移动操作

Ruisen Tu, Arth Shukla, Sohyun Yoo, Xuanlin Li, Junxi Li, Jianwen Xie, Hao Su, Zhuowen Tu

机构 * UC San Diego(南加洲大学) Lambda, Inc(Lambda公司)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 本文提出SG-VLA模型,通过辅助任务协同训练和多模态输入增强,提升移动操作中视觉-语言-动作模型的空间感知与表征能力,实现在家庭环境中更高效的物体抓取与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22279 2026-03-24 cs.CV cs.AI 57%

3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing

3D-Layout-R1: 为语言指导的空间编辑进行结构化推理

Haoyu Zhen, Xiaolong Li, Yilin Zhao, Han Zhang, Sifei Liu, Kaichun Mo, Chuang Gan, Subhashree Radhakrishnan

机构 * NVIDIA UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22174 2026-03-24 cs.HC cs.RO 57%

Feasibility of Augmented Reality-Guided Robotic Ultrasound with Cone-Beam CT Integration for Spine Procedures

增强现实引导的机器人超声与锥束CT整合在脊柱手术中的可行性

Tianyu Song, Felix Pabst, Feng Li, Yordanka Velikova, Miruna-Alexandra Gafencu, Yuan Bi, Ulrich Eck, Nassir Navab

机构 * Chair for Computer Aided Medical Procedures(CAMP), Technical University of Munich(TUM)(计算机辅助医疗程序系(CAMP),慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 本文提出一种基于光学透视增强现实的机器人系统,结合锥束CT与超声成像,提升脊柱手术中针具定位的准确性和效率,降低认知负荷。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22057 2026-03-24 cs.CV 57%

SpatialBoost: Enhancing Visual Representation through Language-Guided Reasoning

SpatialBoost: 通过语言引导的推理增强视觉表示

Byungwoo Jeon, Dongyoung Kim, Huiwon Jang, Insoo Kim, Jinwoo Shin

机构 * KAIST(韩国科学技术院) RLWRLD NAVER Cloud(NAVER云)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 SpatialBoost通过将3D空间知识转化为语言描述,增强预训练视觉编码器的空间感知能力,提升3D感知和通用视觉任务性能。

Comments 35 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21051 2026-03-24 cs.RO 57%

Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation

皮层策略:一种双流视图变换器用于机器人操作

Xuening Zhang, Qi Lv, Xiang Deng, Miao Zhang, Xingbo Liu, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shandong Jianzhu University(山东建筑大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.RO

AI总结 本文提出Cortical Policy,通过双流视图变换器提升机器人操作中的空间和动态推理能力,实验证明其在复杂任务中的优越性。

Comments Published as a conference paper at ICLR 2026. 10 pages, 4 figures. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20662 2026-03-24 cs.AI cs.CV 57%

Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning

空间中的注意:VLM头部在空间推理中的功能角色

Xueqi Ma, Shuo Yang, Yanbei Jiang, Shu Liu, Zhenzhen Liu, Jiayang Ao, Xingjun Ma, Sarah Monazam Erfani, James Bailey

机构 * The University of Melbourne(墨尔本大学) Australian National University(澳大利亚国立大学) Fudan University(复旦大学) Monash University(莫纳什大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文研究VLM中注意力头部在空间推理中的作用,通过机制可解释性视角分析其功能,提出CogVSR数据集并开发探针框架,揭示注意力头部在空间推理中的稀疏性和关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17541 2026-03-19 cs.CV 57%

Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models

时间收益,空间代价:重新审视多模态大语言模型中的视频微调

Linghao Zhang, Jungang Li, Yonghua Hei, Sicheng Tao, Song Dai, Yibo Yan, Zihao Dongfang, Weiting Liu, Chenxi Qin, Hanqian Li, Xin Zou, Jiahao Zhang, Shuhang Xun, Haiyun Jiang, Xuming Hu

机构 * SJTU(上海交通大学) HKUST(GZ)(香港科技大学(珠海)) HKUST(香港科技大学) CityU(城市大学) FDU(复旦大学) HIT(哈尔滨工业大学) TJU(天津大学)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文研究了视频微调对多模态大语言模型视觉能力的影响,发现视频性能提升的同时,静态图像表现可能受限,提出混合帧策略以缓解空间与时间理解的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16253 2026-03-18 cs.CV 57%

Open-Vocabulary Octree-Graph for 3D Scene Understanding

开放词汇八叉树图用于3D场景理解

Zhigang Wang, Yifei Su, Chenhui Li, Dong Wang, Yan Huang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) CASIA TeleAI

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 本文提出Octree-Graph,通过CGSM和IFA算法获取3D实例及语义特征,构建适应性八叉树结构以高效表示场景,实验表明其在多种任务中具有广泛适用性和有效性。

Comments Accepted by ICCV25. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13024 2026-03-17 cs.CV 57%

Learning 2D Invariant Affordance Knowledge for 3D Affordance Grounding

学习2D不变的可供性知识以实现3D可供性定位

Xianqiang Gao, Pingrui Zhang, Delin Qu, Dong Wang, Zhigang Wang, Yan Ding, Bin Zhao

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 本文提出MIFAG框架,通过多视角交互图像提取不变可供性知识,提升3D对象可供性定位的泛化能力。

Comments Accepted by AAAI 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12255 2026-03-13 cs.CV cs.LG 57%

Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training

空间-TTT:基于流式视觉的空间智能与测试时训练

Fangfu Liu, Diankun Wu, Jiawei Chi, Yimo Cai, Yi-Hsin Hung, Xumin Yu, Hao Li, Han Hu, Yongming Rao, Yueqi Duan

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 Spatial-TTT通过测试时训练实现流式视觉空间智能,采用混合架构和空间预测机制,提升长时间视频中的空间理解和组织能力。

Comments Project Page: https://liuff19.github.io/Spatial-TTT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10370 2026-03-12 cs.CV 57%

GeoSense: Internalizing Geometric Necessity Perception for Multimodal Reasoning

GeoSense: 内化几何必要性感知以实现多模态推理

Ruiheng Liu, Haihong Hao, Mingfei Han, Xin Gu, Kecheng Zhang, Changlin Li, Xiaojun Chang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 GeoSense通过内化几何必要性感知,提升多模态推理的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26251 2026-03-12 cs.CV 57%

Seeing Space and Motion: Enhancing Latent Actions with Geometric and Dynamic Awareness for Vision-Language-Action Models

感知空间与运动:通过几何和动态意识增强潜在动作以提升视觉-语言-动作模型

Zhejia Cai, Yandan Yang, Xinyuan Chang, Shiyi Liang, Ronghan Chen, Feng Xiong, Mu Xu, Ruqi Huang

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出Farsighted-LAM和SSM-VLA框架,通过几何和动态意识增强视觉-语言-动作模型,提升动作建模的鲁棒性和可解释性。

Comments 8 pages, correct errors, clarify details

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06985 2026-03-10 cs.CV 57%

Perception-Aware Multimodal Spatial Reasoning from Monocular Images

视感知-aware的多模态空间推理从单目图像

Yanchun Cheng, Rundong Wang, Xulei Yang, Alok Prakash, Daniela Rus, Marcelo H Ang, ShiJie Li

机构 * NUS, Singapore(新加坡国立大学) NTU, Singapore(新加坡国立大学) MIT, US(麻省理工学院) A*STAR, Singapore(新加坡科技研究局)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 本文提出了一种感知-aware的多模态推理框架,通过统一标记空间联合处理视觉证据和文本推理,提升单目图像空间推理的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06973 2026-03-10 cs.CV 57%

T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding

T2SGrid: 视频时间定位的时空网格化

Chaohong Guo, Yihan He, Yongwei Nie, Fei Ma, Xuemiao Xu, Chengjiang Long

机构 * South China University of Technology(南方科技大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Bytedance Inc(字节跳动公司)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 T2SGrid通过将视频时间理解转化为空间理解任务,利用网格化技术提升视频时间定位的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16160 2026-03-10 cs.CV 57%

Video2Layout: Recall and Reconstruct Metric-Grounded Cognitive Map for Spatial Reasoning

Video2Layout: 重建用于空间推理的度量基础认知图

Yibin Huang, Wang Xu, Wanyue Zhang, Helu Zhi, Jingjing Huang, Yangbin Xu, Yangang Sun, Conghui Zhu, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)

专题命中 空间理解 :spatial understanding(abstract);分类 cs.CV

AI总结 Video2Layout通过重建度量基础的空间布局,提升多模态大语言模型在空间推理中的性能,其方法结合监督微调与强化微调,实现更精确的空间认知图构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20476 2026-02-25 cs.CV 57%

SceMoS: Scene-Aware 3D Human Motion Synthesis by Planning with Geometry-Grounded Tokens

SceMoS:通过基于几何的令牌规划进行场景感知的3D人体运动合成

Anindita Ghosh, Vladislav Golyanik, Taku Komura, Philipp Slusallek, Christian Theobalt, Rishabh Dabral

机构 * DFKI(德累斯顿人工智能研究所) MPI for Informatics(信息研究所) Saarland Informatics Campus(萨尔州信息校园) University of Hong Kong(香港大学)

专题命中 空间理解 :point cloud(abstract);分类 cs.CV

AI总结 SceMoS通过基于几何的令牌规划,利用2D场景表示实现高效且逼真的3D人体运动合成,减少50%以上可训练参数,提升物理真实性和接触精度。

Comments 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏