arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8660 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8660 篇

2608.08016 2026-08-11 cs.CV 新提交 70%

EgoTrack3D: A Modular Framework for Egocentric 3D Object Tracking

EgoTrack3D:一种用于第一人称视角三维目标跟踪的模块化框架

Jan Kulik, Bjarni Dagur Thor Karason, Yung-Hsu Yang, Boyang Sun, Marc Pollefeys, Xi Wang

机构 * ETH Zürich(苏黎世联邦理工学院) Microsoft Research(微软研究院) TUM(慕尼黑工业大学) MCML(慕尼黑计算与机器学习中心)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 EgoTrack3D是一种模块化框架,可从第一人称视角RGB视频重建动态三维场景,在ADT数据集上较基线提升11% PCL,还能在退化观测下维持准确空间表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21141 2026-08-10 cs.CV 版本更新 70%

SynthRender and I-AsSET: Open-Source Framework and Dataset for Bidirectional Sim-Real Transfer in Industrial Object Perception

SynthRender 和 IRIS:用于工业物体感知双向仿真-现实迁移的开源框架和数据集

Jose Moises Araya-Martinez, Thushar Tom, Adrián Sanchis Reig, Pablo Rey Valiente, Jens Lambrecht, Jörg Krüger

机构 * Technical University Berlin, Industrial Automation Technology(柏林技术大学,工业自动化技术) Mercedes-Benz AG, Future Manufacturing Technologies(梅赛德斯-奔驰公司,未来制造技术) Technical University Braunschweig, Institute for Cognitive Robotics(不伦瑞克技术大学,认知机器人研究所)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出SynthRender和IRIS,通过合成数据生成与结构化评估,系统研究双向仿真-现实迁移,提供32类数据集和CAD模型,实现高效合成训练与工业应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03166 2026-08-05 cs.AI 新提交 70%

Adversarial Stress Testing of Role-Playing Language Agents using Multi-Agent Evaluation

基于多智能体评估的角色扮演语言智能体的对抗性压力测试

Saqib Shouqi, Abdullah Nazly, Januki Wanniarachchi, Ravisha De Alwis

专题命中 机器人数据与评测 :manipulation(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出模块化多智能体平台,通过多轮对话对角色扮演语言智能体开展对抗性压力测试,揭示单策略测试无法发现的故障模式,相关成果作为开源平台发布以支持AI安全。

Comments 8 pages, 1 figure, 7 tables; accepted and presented at ADScAI Conference 2026, University of Moratuwa, Sri Lanka

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02811 2026-08-05 cs.RO cs.SY eess.SY 新提交 70%

Staying on Spec: Real-Time Monitoring under Uncertainty with a Maritime Case Study

保持规范:面向不确定性下实时监控的海事案例研究

Elizabeth Dietrich, Hanna Krasowski, Emir Cem Gezer, Roger Skjetne, Asgeir Johan Sørensen, Murat Arcak

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种利用数据驱动可达集的实时监控框架,将其应用于海事导航,经仿真与硬件实验验证,该框架在不确定性下可实现稳健监控,风险检测性能优于现有方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27549 2026-07-31 cs.RO cs.AI cs.CV cs.LG 新提交 70%

Cross-Embodiment Transfer via Behavior-Aligned Representations

基于行为对齐表征的跨具身迁移

Ajay Sridhar, Jensen Gao, Jonathan Yang, Jean Mercat, Suneel Belkhale, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本研究提出在视觉-语言-动作模型中采用行为对齐表征,开发仿真基准验证其可提升跨具身迁移,使真实机器人任务完成进度提升28%。

Comments Project page: https://ajaysridhar.com/barx/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10117 2026-07-31 cs.RO 70%

Do Visual-Language Grid Maps Capture Latent Semantics?

Matti Pekkanen, Tsvetomila Mihaylova, Francesco Verdoja, Ville Kyrki

机构 * School of Electrical Engineering, Aalto University(奥卢大学电气工程学院)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO

Comments IROS 2025

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 4059-4066

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13337 2026-07-30 cs.RO 70%

Invisible Servoing: a Visual Servoing Approach with Return-Conditioned Latent Diffusion

Bishoy Gerges, Barbara Bazzana, Nicolò Botteghi, Youssef Aboudorra, Antonio Franchi

机构 * Robotics and Mechatronics group, Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(特文特大学机器人与机电组,电气工程、数学与计算机科学学院) Department of Applied Mathematics, University of Twente(特文特大学应用数学系) Department of Computer, Control and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、控制与管理工程系)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO

Journal ref 2025 International Conference on Unmanned Aircraft Systems (ICUAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27852 2026-07-23 cs.GR cs.CV 版本更新 70%

ClothTransformer: Unified Latent-Space Transformers for Scalable Cloth Simulation

ClothTransformer: 用于可扩展布料模拟的统一潜空间变换器

Yu Zhang, Yidi Shao, Wenqi Ouyang, Yushi Lan, Zhexin Liang, Chengrui Wu, Xudong Xu, Xingang Pan

机构 * S-Lab, Nanyang Technological University, Singapore(新加坡南洋理工大学S实验室,南洋理工大学,新加坡) Feeling AI University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出ClothTransformer,通过将布料模拟重构为潜空间中的自回归序列建模,使用统一Transformer架构处理多种场景,实现比现有方法低4-9倍的误差,并引入可扩展潜空间公式和穿透自由数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18840 2026-07-22 cs.RO 新提交 70%

WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

WorldScape Policy 2.0:通过推理增强记忆实现可控的世界行动建模

Haisheng Su, Zongdai Liu, Xin Jin, Haoxuan Dou, Chengming Hu, Baorun Li, Zhanwang Liu, Ruiyan Xu, Jianjie Fang, Xin Zhang, Zhenjie Yang, Xue Yang, Chen Gao, Junchi Yan, Yong Li, Wei Wu

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究针对现有世界行动模型的局限,提出WorldScape Policy 2.0,用推理增强记忆,构建相关数据集,实现从高级指令自主规划及基于细粒度文本等的可控执行,在模拟和现实平台实验中展现出在多方面的卓越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13586 2026-07-21 cs.CV 版本更新 70%

UniPhysGen: Unified Physical Grounding for Simulation-Ready 3D Assets

UniPhysGen:用于可模拟3D资产的统一物理基础

Xian Li, Rong Wei, Lujie Yang, Haolin Huang, Junyuan Fang, Siliang Tang, Jun Xiao, Rui Tang, Juncheng Li

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(众核科技公司) University of Electronic Science and Technology of China(电子科技大学)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 研究针对现有3D资产缺乏统一物理语义问题,提出UniPhys框架及UniPhysGen模型,通过联合推理关节语义和固有物理属性,减轻几何捷径偏差,经实验验证其性能先进,生成资产可用于机器人模拟环境。

Comments 39 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06787 2026-07-21 cs.RO cs.SY eess.SY 版本更新 70%

Digital-physical testbed for ship autonomy studies in the Marine Cybernetics Laboratory basin

海洋控制实验室流域船舶自主研究的数字物理试验台

Emir Cem Gezer, Mael Korentin Ivan Moreau, Anders Sandneseng Høgden, Dong Trong Nguyen, Roger Skjetne, Asgeir Sørensen

机构 * Department of Marine Technology, Norwegian University of Science and Technology - NTNU(海洋技术系,挪威科学技术大学 - NTNU)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对MASS算法测试难题,开发数字物理试验台,含小型模型船等设施,建立从低保真到高保真的设计验证流程,能实现不同尺度验证,展示了其在船舶自主GNC算法测试上的进展与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15278 2026-07-17 cs.CV 新提交 70%

Hierarchical Denoising For Multi-Step Visual Reasoning

用于多步视觉推理的分层去噪

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) The Hong Kong University of Science and Technology(香港科技大学) Beihang University(北京航空航天大学) Fuzhou University(福州大学) Muka Robotics(木卡机器人)

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.CV

AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12818 2026-07-16 cs.CV 版本更新 70%

Breaking Déjà Vu: Independent Auditing of Visual Place Recognition through Vision-Language Reasoning

打破似曾相识:通过视觉语言推理对视觉场所识别进行独立审计

Sania Waheed, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) School of Electrical Engineering and Computer Science, Queensland University of Technology(昆士兰科技大学电气工程与计算机科学学院) School of Computer Science and Electronic Engineering, University of Essex(埃塞克斯大学计算机科学与电子工程学院)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 研究针对视觉场所识别中图像匹配阈值在环境变化下不可靠的问题,引入视觉场所识别审计框架,利用视觉语言模型通过联合推理评估检索匹配,经实验验证该方法有效提升召回率并降低误接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06796 2026-07-15 cs.RO 版本更新 70%

RoboDesign1M: A Large-scale Dataset for Robot Design Understanding

RoboDesign1M:用于机器人设计理解的大规模数据集

Tri Le, Toan Nguyen, Quang Tran, Quang Nguyen, Baoru Huang, Hoan Nguyen, Minh Nhat Vu, Tung D. Ta, Anh Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Liverpool(利物浦大学) University of Information Technology(信息技术大学) Automation & Control Institute(自动化与控制研究所) Department of Creative Informatics(创意信息系) Faculty of Environment and Information Studies(环境与信息科学系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 针对机器人设计领域缺乏大规模数据集的问题,介绍了含100万个样本的RoboDesign1M数据集,提出半自动数据收集管道,经多项实验评估,该数据集可推动机器人设计理解研究及相关自动化发展。

Comments 8 pages, accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11397 2026-07-14 cs.RO 新提交 70%

WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos

WALA:从带动作标签的演示和无动作视频中学习可执行的潜在动作

Jiahao Liu, Zhongpu Xia, Shuai Tian, Huangrui Li, Yuhang Zheng, Ning Ma, Xin Fu, Xiaotian Liu, Jing Li, Yixian Li, ShangQing Zhou, Zebin Xing, Linbo Wang, Chaoyue Li, Haoran Li, Dongbin Zhao

机构 * CASIA(中国科学院自动化所) Anyverse Dynamics(Anyverse动力学公司) UCAS(中国科学院大学) NUS(新加坡国立大学) XJYLU(西安交通大学利物浦大学)

专题命中 机器人数据与评测 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 研究从带动作标签演示和无动作视频学习可执行潜在动作的问题,提出WALA框架,先预训练语义几何潜在动作模型,策略训练时编码器和解码器协同,由多方面联合监督潜在动作,实验证明其提升了机器人策略性能和泛化能力。

Comments Project page: https://liujiahao2077.github.io/WALA.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10892 2026-07-14 cs.RO 新提交 70%

A Single Diffusion-Policy Controller for Multi-Task Block Pushing with Zero-Shot Sim-to-Real Transfer

用于多任务块推的单扩散策略控制器,具有零样本模拟到现实转移

Haitong Ma, Haldun Balim, Yang Hu, Bo Dai, Na Li

机构 * Harvard University(哈佛大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究旨在用强化学习从零训练单扩散策略用于多任务块推,提出含简单策略损失函数的框架,结合反向课程生成等应对探索挑战,评估其在不同条件下零样本从模拟到现实的转移能力,证明该流程有效。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新 70%

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21649 2026-07-14 cs.CV 70%

Seeing Isn't Orienting: A Cognitively Informed Hierarchical Benchmark for Object Orientation in MLLMs

看到并不等于定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yan, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

机构 * Boston University(波士顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出DORI基准,揭示多模态大语言模型在定向理解上的不足,发现其在角度估计和方向跟踪方面存在系统性缺陷,对机器人控制和3D场景重建有重要启示。

Comments Paper accepted to ECCV 2026 (Main Track). Previously, this version appeared as arXiv:2603.11410 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07972 2026-07-10 cs.RO 新提交 70%

In vivo feasibility study of humanoid robots in surgery

人形机器人在手术中的体内可行性研究

Zekai Liang, Nikita Thareja, Peihan Zhang, Calvin Joyce, Soofiyan Atar, Florian Richter, Garth Jacobsen, Shanglei Liu, Ryan Broderick, Michael Yip

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究评估人形机器人用于腹腔镜手术任务的可行性,开发基于人形机器人的腹腔镜远程操作框架,通过多种评估量化其技术可行性等,为手术应用中当前人形机器人的能力和局限性提供基于证据的评估,突出前景与关键挑战。

Journal ref Nature (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06383 2026-07-08 cs.RO 新提交 70%

Towards Real-World Applications with an Autonomous Powered Wheelchair

迈向具有自主动力轮椅的现实世界应用

Simone Arreghini, Alessandro Giusti, Alex Bordini, Enrico Ferrara, Giovanni Fulgoni, Antonio Paolillo

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(达勒莫勒人工智能研究所(IDSIA),瑞士意大利语区大学 - 瑞士南部应用科学与艺术大学) Genny Factory(Genny工厂)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 针对动力轮椅自主性有限等问题,研究通过在商用自平衡轮椅上集成自主感知、手势交互和导航等技术构建概念验证原型,并在叫车和跟人等应用中展示,凸显自主与辅助结合潜力及可行性,也指出技术挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05363 2026-07-07 cs.AI 新提交 70%

SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints

SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04610 2026-07-07 cs.RO 新提交 70%

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

RoboVista:评估用于各种机器人应用的视觉语言模型

Shuangyu Xie, Kaiyuan Chen, Ziyang Chen, Simeon Adebola, Yixuan Huang, Zehan Ma, Tianshuang Qiu, Wentao Yuan, Dhruv Shah, Pannag R. Sanketi, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 研究针对机器人多样应用,提出模块化评估框架Robot Question Answering及基准RoboVista,其源于真实机器人系统等,含多任务类型VQA实例,实验表明现有视觉语言模型有差距,且与现实任务执行相关。

Comments Accepted to RSS 2026. Project website: https://berkeleyautomation.github.io/robovista/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03470 2026-07-07 cs.CV 新提交 70%

PhysMirror: Physics-Aware Mirror Object Generation

物理镜像:物理感知镜像对象生成

Xuan-Bach Mai, Duy-Phuc Nguyen, Quoc-Van Le, Tam V. Nguyen, Thanh-Toan Do, Huu Le, Duong-Van Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City(胡志明市科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学) University of Dayton(代顿大学) Monash University(莫纳什大学) VinFast(VinFast公司) VinUniversity(Vin大学)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 针对现代文本到图像扩散模型合成物理精确镜像反射的挑战,提出物理感知生成框架PhysMirror,通过3D空间先验执行投影几何,引入评估指标,实验表明其在反射精度等方面优于基线。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09458 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新 70%

SilvaScenes: Tree Detection and Species Classification from Under-Canopy Images in Natural Forests

SilvaScenes:自然森林冠层下图像中的树木检测与物种分类

David-Alexandre Duclos, William Guimont-Martin, Gabriel Jeanson, Arthur Larochelle-Tremblay, Martine Lapointe, Théo Defosse, Frédéric Moore, Philippe Nolet, François Pomerleau, Philippe Giguère

机构 * Northern Robotics Laboratory, Université Laval(北方机器人实验室,拉瓦尔大学) Département des sciences du bois et de la forêt, Université Laval(林业与木材科学系,拉瓦尔大学) Institut des Sciences de la Forêt tempérée, Université du Québec en Outaouais(温带森林科学研究所,魁北克outsouais大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对深度学习发展下森林自动化需求,提出SilvaScenes数据集,用于自然森林冠层下图像的树种实例分割,评估显示树干分割可行,物种分割有挑战,还指出关键问题及图像分辨率的作用。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24009 2026-07-03 cs.GR cs.AI cs.CV cs.LG cs.RO 版本更新 70%

Learning 3D-Gaussian Simulators from RGB Videos

从RGB视频学习3D高斯模拟器

Mikel Zhobro, Andreas René Geist, Georg Martius

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出3DGSim,一种从多视角RGB视频直接学习物理交互的3D模拟器,统一了3D场景重建、粒子动力学预测和视频合成,能泛化到未见过的多体交互和新场景编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交 70%

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract);分类 cs.CV

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31086 2026-07-01 cs.CV 新提交 70%

CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction

CasaMaestro:用于房屋级3D重建的多视角全景图

Yuzhou Ji, Xiaotian Yang, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)

专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.CV

AI总结 提出CasaMaestro模型,仅需20-50张稀疏多视角室内全景图,即可直接预测度量深度和相机位姿,实现全屋快速点云重建,是首个支持房屋级重建的多视角全景模型。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30151 2026-06-30 cs.RO 70%

AERIS: Aerial-Edge Role-Driven Intelligence at Runtime via Orchestrated Language-Model Swarm

AERIS: 通过编排语言模型群在运行时实现空中边缘角色驱动智能

Jiabin Lou, Haopeng Wang, Xinyu Liu, Yu Zhang, Rongye Shi, Wenjun Wu

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出AERIS框架,通过编排专用小语言模型和轻量感知控制模块,在边缘实现空中平台的长时指令分解与实时闭环运行。

Comments 10 pages, 11 figures. Preprint version of the submitted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02742 2026-06-30 cs.CV 70%

Consistent Yet Wrong: Evidence Insensitivity in Spatial Vision-Language Models

一致但错误:空间视觉-语言模型中的证据不敏感性

S Divakar Bhat, Toshihiko Yamasaki

机构 * The University of Tokyo, Japan(东京大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 通过引入ViewDiag多视图评估协议,发现现代视觉-语言模型在空间推理中表现出跨视角一致但错误的现象,表明其预测主要源于先验驱动而非证据敏感推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17969 2026-06-30 cs.CV 70%

E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes

E3VS-Bench:一个用于3D高斯散射场景中视角依赖主动感知的基准

Koya Sakamoto, Taiki Miyanishi, Daichi Azuma, Shuhei Kurita, Shu Morikuni, Naoya Chiba, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo, Japan(东京大学) National Institute of Informatics, Japan(日本信息处理学会) The University of Osaka, Japan(大阪大学) Advanced Telecommunications Research Institute International, Japan(国际先进电信研究机构)

专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);分类 cs.CV

AI总结 E3VS-Bench通过5自由度视角控制,评估在真实3D环境中视角依赖现象的主动感知能力,测试模型在多视角探索中的表现。

Comments Project page: https://k0uya.github.io/e3vs-proj/

详情

展开后加载摘要…

URL PDF HTML 收藏