arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8660 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8660 篇

1610.03518 2026-06-04 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

Transfer from Simulation to Real World through Learning Deep Inverse Dynamics Model

通过学习深度逆动力学模型实现仿真到现实世界的迁移

Paul Christiano, Zain Shah, Igor Mordatch, Jonas Schneider, Trevor Blackwell, Joshua Tobin, Pieter Abbeel, Wojciech Zaremba

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出通过学习深度逆动力学模型,在仿真与现实世界之间实现控制策略的迁移,解决仿真与现实差异导致的性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02956 2026-06-03 cs.CV cs.LG cs.RO 67%

The Road Ahead in Autonomous Driving: The KITScenes Multimodal Dataset

自动驾驶的未来之路:KITScenes多模态数据集

Richard Schwarzkopf, Fabian Immel, Alexander Blumberg, Jonas Merkert, Nils Rack, Kaiwen Wang, Fabian Konstantinidis, Julian Truetsch, Carlos Fernandez, Annika Bätz, Kevin Rösch, Marlon Steiner, Willi Poh, Yinzhe Shen, Royden Wagner, Felix Hauser, Dominik Strutz, Jaime Villa, Gleb Stepanov, Holger Caesar, Ömer Şahin Taş, Frank Bieder, Jan-Hendrik Pauls, Christoph Stiller

机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University Charles III of Madrid(马德里第三大学) Delft University of Technology(代尔夫特理工大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出KITScenes多模态数据集,通过高保真传感器和完整HD地图,解决现有数据集在传感器精度、地图完整性和地理多样性上的不足,并引入四个基准推动空间学习。

Comments 28 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02951 2026-06-03 cs.RO cs.AI cs.CL cs.CV cs.HC 67%

SCOPE: Real-Time Natural Language Camera Agent at the Edge

SCOPE:边缘实时自然语言相机代理

Nikolaj Hindsbo, Sina Ehsani, Pragyana Mishra

机构 * Armada AI

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出SCOPE模块化代理,用于自然语言控制的PTZ相机,在边缘部署实现实时感知、规划与控制,并通过仿真和物理实验评估延迟、准确性和错误模式。

Comments 9 pages, 4 figures, 6 tables. Accepted at HRI '26 (21st ACM/IEEE International Conference on Human-Robot Interaction), Edinburgh, Scotland, March 16--19, 2026. Code: https://github.com/HindsboNikolaj/SCOPE

Journal ref Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24965 2026-05-26 cs.CV cs.AI cs.LG 67%

Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection

视觉基础模型在面部深度伪造检测中的跨域泛化极限

Ibrahim Delibasoglu

机构 * Department of Software Engineering, Faculty of Computer and Information Sciences(软件工程系,计算机与信息科学学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文通过系统评估三种视觉基础模型(RoPE-ViT、DINOv3、NVIDIA C-RADIOv4-H)在DF40基准上的线性探测性能,揭示了它们在面部深度伪造检测中的跨域泛化极限,发现基础模型对全脸合成保持高判别力,但对局部编辑技术存在根本性边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22493 2026-05-22 cs.LG cs.AI cs.RO 67%

Understanding Multimodal Failure in Action-Chunking Behavioral Cloning

理解动作分块行为克隆中的多模态失败

Lorenzo Mazza, Massimiliano Datres, Ariel Rodriguez, Sebastian Bodenstedt, Gitta Kutyniok, Stefanie Speidel

机构 * NCT-Dresden(NCT-德累斯顿)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究行为克隆在多模态情况下失败的机制,分析不同多模态参数化在动作分块策略中的不同失效方式,并提出通过调整正则化程度和改进生成策略来提升鲁棒性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20856 2026-05-21 cs.RO cs.AI cs.LG 67%

DISC: Decoupling Instruction from State-Conditioned Control via Policy Generation

DISC: 通过策略生成解耦指令与状态条件控制

Hanxiang Ren, Pei Zhou, Xunzhe Zhou, Yanchao Yang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) TranscEngram

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 DISC通过策略生成解耦指令与状态条件控制,解决了任务状态耦合导致的观察泄漏问题,并在多个基准测试中表现出色,证明了语言生成的策略参数驱动行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV 67%

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22801 2026-05-19 cs.RO cs.AI cs.LG 67%

Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving

释放扩散模型在端到端自动驾驶中的潜力

Yinan Zheng, Tianyi Tan, Bin Huang, Enguang Liu, Ruiming Liang, Jianlin Zhang, Jianwei Cui, Guang Chen, Kun Ma, Hangjun Ye, Long Chen, Ya-Qin Zhang, Xianyuan Zhan, Jingjing Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文通过大规模实车数据和道路测试,系统研究了扩散模型在端到端自动驾驶中的规划能力,提出Hyper Diffusion Planner框架,实现10倍性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11265 2026-05-13 cs.CV cs.AI cs.LG 67%

DenseTRF: Texture-Aware Unsupervised Representation Adaptation for Surgical Scene Dense Prediction

DenseTRF: 基于纹理的无监督表示适应用于外科场景密集预测

Guiqiu Liao, Matjaž Jogan, Daniel A. Hashimoto

机构 * GRASP Laboratory, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) PCASO Laboratory, Department of Surgery, University of Pennsylvania(宾夕法尼亚大学外科PCASO实验室) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出DenseTRF框架,通过基于纹理的关注机制学习纹理感知的表示,提升外科场景密集预测的跨分布泛化能力。

Comments Accepted to 29th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23629 2026-05-12 cs.GR 67%

From Visual Synthesis to Interactive Worlds: Toward Production-Ready 3D Asset Generation

从视觉合成到交互世界:迈向可生产3D资产生成

Jiafeng Wu, Zhuofan Lou, Jian Liu, Dazhao Du, Chunchao Guo, Song Guo

专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract)

AI总结 本文探讨了从孤立视觉形状到可部署的结构化资产的3D内容生成进展,分析了游戏开发、AI、世界模拟等对3D资产的需求,提出基于资产生产流程的分类方法,评估现有方法的生成质量和可用性,并指出数据质量、生成可控性等挑战。

Comments Preprint. Jiafeng Wu and Zhuofan Lou contributed equally. Project page: https://christinebobby.github.io/production-ready-3d-survey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08136 2026-05-12 cs.CV cs.AI cs.RO 67%

Benchmarking ResNet Backbones in RT-DETR: Impact of Depth and Regularization under environmental conditions

在RT-DETR中评估ResNet主干:环境条件下深度和正则化的影响

Pamela Barboza, Víctor Castelli, Belén Pereira, Ricardo Grando, Bruna de Vargas, Augusto Calfani

机构 * Robotics and Artificial Intelligence Laboratory, Technological University of Uruguay(机器人与人工智能实验室,乌拉圭技术大学) Artificial Intelligence Laboratory, Technological University of Uruguay(人工智能实验室,乌拉圭技术大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文评估RT-DETR在环境和超参数变化下的圆物体检测性能,比较了四种ResNet主干在不同丢弃率下的置信度和准确率,发现ResNet50在光照变化中表现最佳,ResNet34在背景变化中表现最佳。

Comments Accepted at the International Conference on Data Science, Technology and Applications (DATA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20349 2026-04-23 eess.SP 67%

Descriptor: A Hybrid Indoor and Indoor-Outdoor Positioning Multi-Technology Dataset (HYMN)

描述:一种混合室内外定位多技术数据集(HYMN)

Muhammad Ammad, Albrecht Michler, Paul Schwarzbach, Jonas Ninnemann, Hagen Ußler, Oliver Michler

专题命中 机器人数据与评测 :navigation(abstract,abstract_cn)

AI总结 HYMN数据集结合五种定位技术,涵盖室内外过渡场景,支持多传感器融合和无缝定位研究,克服单一技术限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18468 2026-04-21 cs.CV cs.AI cs.GR cs.LG 67%

Asset Harvester: Extracting 3D Assets from Autonomous Driving Logs for Simulation

资产收割者:从自动驾驶日志中提取3D资产用于模拟

Tianshi Cao, Jiawei Ren, Yuxuan Zhang, Jaewoo Seo, Jiahui Huang, Shikhar Solanki, Haotian Zhang, Mingfei Guo, Haithem Turki, Muxingzi Li, Yue Zhu, Sipeng Zhang, Zan Gojcic, Sanja Fidler, Kangxue Yin

机构 * NVIDIA

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出Asset Harvester,通过图像到3D模型的端到端流程,将稀疏的现实日志中物体观测转换为完整的模拟资产,结合大规模数据整理、几何感知预处理和鲁棒训练方案,解决自动驾驶数据中的稀疏视角等挑战。

Comments NVIDIA white paper. The project page: https://research.nvidia.com/labs/sil/projects/asset-harvester/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18463 2026-04-21 cs.AI cs.LG cs.RO 67%

Using large language models for embodied planning introduces systematic safety risks

使用大型语言模型进行具身规划引入了系统性的安全风险

Tao Zhang, Kaixian Qu, Zhibin Li, Jiajun Wu, Marco Hutter, Manling Li, Fan Shi

机构 * ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院) Stanford University(斯坦福大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。

Comments Project page: https://despite-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07826 2026-04-21 cs.CV cs.LG cs.RO 67%

R3D2: Realistic 3D Asset Insertion via Diffusion for Autonomous Driving Simulation

R3D2:通过扩散实现自动驾驶模拟中的真实3D资产插入

William Ljungbergh, Bernardo Taveira, Wenzhao Zheng, Adam Tonderski, Chensheng Peng, Fredrik Kahl, Christoffer Petersson, Michael Felsberg, Kurt Keutzer, Masayoshi Tomizuka, Wei Zhan

机构 * Zenseact Linköping University(林哈尔大学) Chalmers University(查尔姆斯理工大学) UC Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 R3D2是一种轻量级单步扩散模型,用于在现有场景中实时生成真实3D资产,通过训练学习真实集成,提升自动驾驶模拟的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11757 2026-04-14 cs.RO cs.AI cs.CV 67%

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27573 2026-03-31 cs.GR 67%

SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion

SPREAD:通过几何感知扩散进行空间-物理推理

Minzhang Li, Kuixiang Shao, Xuebing Li, Yuyang Jiao, Yinuo Bai, Hengan Zhou, Sixian Shen, Jiayuan Gu, Jingyi Yu

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract)

AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18532 2026-03-31 cs.RO cs.AI cs.LG 67%

Scaling Sim-to-Real Reinforcement Learning for Robot VLAs with Generative 3D Worlds

在生成3D世界中扩展机器人视觉语言动作的强化学习

Andrew Choi, Xinjie Wang, Zhizhong Su, Wei Xu

机构 * Horizon Robotics(地平线机器人)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出利用生成3D世界模型来提升机器人视觉语言动作模型的泛化能力,通过生成多样化的交互场景,提高模拟到现实的迁移效果,并展示在真实世界中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV 67%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01547 2026-03-24 cs.CV cs.AI cs.LG 67%

Vision-language models lag human performance on physical dynamics and intent reasoning

视觉-语言模型在物理动态和意图推理上仍逊于人类表现

Tianjun Gu, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan, Athanasios V

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Agder(阿格德大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17318 2026-03-23 cs.RO cs.AI cs.CE cs.LG physics.app-ph 67%

FORWARD: Dataset of a forwarder operating in rough terrain

FORWARD:在崎岖地形中操作的前送机数据集

Mikael Lundbäck, Erik Wallin, Carola Häggström, Mattias Nyström, Andreas Grönlund, Mats Richardson, Petrus Jönsson, William Arnvik, Lucas Hedström, Arvid Fälldin, Martin Servin

机构 * Umeå University(乌梅亚大学) Swedish University of Agricultural Sciences(瑞典农业科学大学) Skogforsk, Swedish Forest Research Institute(森林研究所,瑞典)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文介绍了FORWARD数据集,包含在瑞典中部两个森林地区崎岖地形中操作的前送机的高分辨率多模态数据,用于开发森林机械的交通性、感知和自主控制算法。

Comments 33 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16868 2026-03-18 cs.CV cs.AI cs.RO 67%

MessyKitchens: Contact-rich object-level 3D scene reconstruction

MessyKitchens: 密集接触的物体级3D场景重建

Junaid Ahmed Ansari, Ran Ding, Fabio Pizzati, Ivan Laptev

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出MessyKitchens数据集和Multi-Object Decoder方法,提升复杂场景中物体级3D重建的精度与物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15847 2026-03-18 cs.CV cs.LG cs.RO 67%

FEEL (Force-Enhanced Egocentric Learning): A Dataset for Physical Action Understanding

FEEL(力增强的自我中心学习):一个用于物理动作理解的数据集

Eadom Dessalene, Botao He, Michael Maynord, Yonatan Tussa, Pavan Mantripragada, Yianni Karabati, Nirupam Roy, Yiannis Aloimonos

机构 * University of Maryland, College Park, USA(马里兰大学 College Park 分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 FEEL数据集结合了自定义压阻手套收集的力测量与自我中心视频,通过力驱动物理交互,用于接触理解与动作表征学习,取得最佳分割结果并提升跨任务迁移性能。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11453 2026-03-17 cs.CV cs.AI cs.RO 67%

Beyond Frame-wise Tracking: A Trajectory-based Paradigm for Efficient Point Cloud Tracking

超越帧级跟踪:一种基于轨迹的高效点云跟踪范式

BaiChen Fan, Yuanxi Cui, Jian Li, Qin Wang, Shibo Zhao, Muqing Cao, Sifan Zhou

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出基于轨迹的跟踪范式TrajTrack,通过隐式学习历史轨迹提升跟踪精度,实现高效且鲁棒的3D单目标跟踪。

Comments Acceptted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13033 2026-03-16 cs.CV cs.LG cs.RO 67%

ESPIRE: A Diagnostic Benchmark for Embodied Spatial Reasoning of Vision-Language Models

ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准

Yanpeng Zhao, Wentao Ding, Hongtao Li, Baoxiong Jia, Zilong Zheng

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13027 2026-03-16 cs.CV cs.AI cs.LG 67%

SortScrews: A Dataset and Baseline for Real-time Screw Classification

SortScrews:一种用于实时螺钉分类的数据集和基线

Tianhao Fu, Bingxuan Yang, Juncheng Guo, Shrena Sribalan, Yucheng Chen

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Project Neura UTMIST Amplimit

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出SortScrews数据集,用于解决工业自动化中螺钉分类问题,通过标准化采集设置获取6种螺钉类型和背景类图像,采用EfficientNet-B0和ResNet-18进行迁移学习,验证了在小数据集下可控采集条件下的有效学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11554 2026-03-13 cs.CV cs.AI cs.RO 67%

MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks

MANSION: 多楼层语言到3D场景生成用于长周期任务

Lirong Che, Shuo Wen, Shan Huang, Chuang Wang, Yuzhe Yang, Gregory Dudek, Xueqian Wang, Jian Su

机构 * Tsinghua University(清华大学) AgiBot McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11400 2026-03-13 cs.RO cs.AI cs.LG 67%

Deployment-Time Reliability of Learned Robot Policies

部署时学习机器人策略的可靠性

Christopher Agia

机构 * STANFORD UNIVERSITY(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文研究了如何通过部署时机制提升学习机器人策略的可靠性,提出运行时监控、数据驱动的可解释性框架及长周期任务执行方法,以应对部署中的分布偏移、误差叠加和复杂依赖性问题。

Comments Stanford University PhD dissertation, 2026. 182 pages, 37 figures. Available from Stanford Digital Repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08483 2026-03-11 cs.CV cs.AI cs.LG 67%

X-AVDT: Audio-Visual Cross-Attention for Robust Deepfake Detection

X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力

Youngseo Kim, Kwan Yun, Seokhyeon Hong, Sihun Cha, Colette Suhjung Koo, Junyong Noh

机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01549 2026-03-11 cs.CV cs.AI cs.RO 67%

Pri4R: Learning World Dynamics for Vision-Language-Action Models with Privileged 4D Representation

Pri4R: 通过特权4D表示学习视觉-语言-动作模型的世界动态

Jisoo Kim, Jungbin Cho, Sanghyeok Chu, Ananya Bal, Jinhyung Kim, Gunhee Lee, Sihaeng Lee, Seung Hwan Kim, Bohyung Han, Hyunmin Lee, Laszlo A. Jeni, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) LG AI Research(LG人工智能研究) Yonsei University(延世大学) Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 Pri4R通过特权4D表示学习视觉-语言-动作模型的世界动态,提升操控任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏