arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8657 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8657 篇

2512.19178 2026-07-24 cs.RO cs.AI 版本更新 73%

Vision-Language-Policy Model for Dynamic Robot Task Planning

用于动态机器人任务规划的视觉-语言-策略模型

Jin Wang, Kim Tien Ly, Jacques Cloete, Jin Jin, Nikos Tsagarakis, Ioannis Havoutis

机构 * Dynamic Robot Systems Group, Oxford Robotics Institute, University of Oxford(牛津大学机器人研究所动态机器人系统组) Humanoids and Human-Centered Mechatronics (HHCM), Istituto Italiano di Tecnologia(意大利技术研究所人形与以人为中心的机电系统)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对机器人在非结构化环境中自然语言命令与自主执行衔接难题,提出基于视觉-语言模型的VLP框架,能解释指令、整合推理生成行为策略,还可动态调整策略,实验证明其有强大规划自主性和跨实体泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16146 2026-07-20 cs.RO cs.CV 新提交 73%

VTLoc: Learning-based Tactile Contact Localization in Visual Point Clouds

VTLoc:基于学习的视觉点云中触觉接触定位

Zhiyuan Wu, Zhuo Chen, Shan Luo

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究视觉与触觉融合的接触定位问题,提出VTLoc框架,通过几何多模态对齐模块和迭代定位更新器,利用视觉点云从触觉读数定位接触点,在新基准上减少对应模糊性,改善单触接触定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14182 2026-07-17 cs.RO cs.AI 新提交 73%

Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control

用于动态人形机器人全身控制的语义音频驱动理解

J. M. A. Marcelo, M. Brienza, E. Bugli, L. Comito, D. Nardi, D. D. Bloisi, V. Suriani

机构 * Sapienza University of Rome(罗马第一大学) International University of Rome(罗马国际大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对人形机器人自主性和动态环境响应受限问题,提出语义音频驱动的多模态编排框架,通过处理音频流、结合音乐与语音输入及强化学习控制,验证了该方法在模拟和实体机器人上的有效性。

Comments Accepted at 29th Robocup International Symposium, held on July 6th, 2026 in Incheon, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06824 2026-07-16 cs.RO cs.LG 版本更新 73%

CaLiSym: Learning Symplectic Dynamics of Real-World Systems through Structured Canonical Lifts

CaLiSym:通过结构化规范提升学习现实世界系统的辛动力学

Aristotelis Papatheodorou, Pranav Vaidhyanathan, Natalia Ares, Ioannis Havoutis, Gerard J. Milburn

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) School of Mathematics and Physics, University of Sussex(萨塞克斯大学数学与物理系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 研究针对物理学习局限,引入CaLiSym框架,通过结构化规范提升将辛学习扩展到含能量动量交换的机器人系统。用广义岭SympNet预测器实例化,实验表明该方法能改进分布外自回归预测,保持辛形式,为现实机器人系统提供几何保持动力学模型。

Comments 19 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08503 2026-07-15 cs.CV cs.GR cs.RO eess.IV 版本更新 73%

Spherical-GOF: Geometry-Aware Panoramic Gaussian Opacity Fields for 3D Scene Reconstruction

球面-GOF:面向3D场景重建的几何感知全景高斯不透明场

Zhe Yang, Guoqiang Zhao, Sheng Wu, Kai Luo, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 Spherical-GOF通过球面高斯不透明场实现全景图像的高效渲染,提升3D场景重建的几何一致性和光度质量。

Comments Accepted to IEEE/RSJ IROS 2026. The source code and dataset will be released at https://github.com/1170632760/Spherical-GOF

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08127 2026-07-10 cs.CV cs.RO 新提交 73%

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

通过时间比率理解和缓解视频动作泛化差距

Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao

机构 * Georgia Tech(佐治亚理工学院) Amazon FAR(亚马逊FAR)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究视频动作泛化差距,引入时间比率(TR),通过TR衡量动作头对未来潜在展开的依赖程度,提出推理时自适应引导方法,利用TR特性缓解组合泛化差距。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05869 2026-07-08 cs.RO cs.CV 新提交 73%

GraspIT: A Dataset Bridging the Sim-to-Real gap and back for Validated Grasping SE(3) Pose Generation

GraspIT:一个弥合模拟与现实差距并用于验证抓取SE(3)姿态生成的数据集

Paul Koch. Adem Karakurt, André Sers

机构 * Fraunhofer IPK(弗劳恩霍夫研究所)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对新型物体抓取,提出GraspIT数据集。通过在Isaac Sim中对桌面场景进行物理滑动测试标注,经Real↔Sim循环反向投影到真实场景。贡献约31.6万个带注释RGBD帧集及开源工具,可用于桌面操作策略学习等。

Comments Preprint, release soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01001 2026-07-02 cs.CV cs.AI 版本更新 73%

EgoSim: Egocentric World Simulator for Embodied Interaction Generation

EgoSim:用于具身交互生成的视角世界模拟器

Jinkun Hao, Mingda Jia, Ruiyan Wang, Hongrui Zhu, Jiafei Cao, Xihui Liu, Ran Yi, Lizhuang Ma, Jiangmiao Pang, Xudong Xu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 EgoSim通过建模可更新的世界状态,解决现有视角模拟器在3D grounding和动态更新上的不足,生成空间一致的交互视频并支持跨具身迁移。

Comments Project Page: egosimulator.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31073 2026-07-01 cs.AI cs.MA cs.RO 新提交 73%

MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning

MultiUAV-Plat:面向多无人机协同任务规划的LLM平台、基准测试与框架

Sheng Zhang, Qinglin Li, Yuechao Zang, Xueqin Huang, Yijia Fu, Cheng Zhu

机构 * National Key Laboratory of Information Systems Engineering, National University of Defense Technology(国防科技大学信息系统工程国家重点实验室)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出MultiUAV-Plat平台与基准测试,以及Agent4Drone框架,通过LLM驱动的工具交互实现多无人机协同任务规划,在任务通过率等指标上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15443 2026-07-01 cs.RO cs.AI 版本更新 73%

A Scalable Whole-body Motion Transfer via Implicit Kinodynamic Motion Retargeting

可扩展的全身运动迁移:基于隐式动力学运动重定向

Xingyu Chen, Hanyu Wu, Sikai Wu, Mingliang Zhou, Diyun Xiang, Haodong Zhang, Yangchen Zhou, Yukang Gao, Yi Gu, Renjing Xu

机构 * HKUST(GZ)(香港科技大学(广州)) ETH Zurich(苏黎世联邦理工学院) Zhejiang University(浙江大学) Xiaomi Robotics Lab(小米机器人实验室)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出隐式动力学运动重定向(IKMR),利用骨架图卷积双自编码器将人体与机器人运动映射到共享拓扑潜空间,结合物理信息精炼实现高速、鲁棒的运动数据转换,解决噪声与计算瓶颈。

Comments RSS 2026 Workshop. Webpage: https://cybercal.github.io/webpage.ikmr

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08811 2026-06-30 cs.CV cs.RO 73%

TUGS: Physics-based Compact Representation of Underwater Scenes by Tensorized Gaussian

TUGS: 基于物理的紧凑表示法用于水下场景的张量高斯表示

Shijie Lian, Ziyi Zhang, Hua Li, Laurence Tianruo Yang, Mengyu Ren, Debin Liu, Wenhui Wu

机构 * Huazhong University of Science and Technology(华中科技大学) Zhongguancun Academy(中关村学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhengzhou University(郑州大学) Hainan University(海南大学) Shenzhen University(深圳大学)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出TUGS,一种基于物理模型的紧凑水下3D表示法,通过物理建模复杂水下光场,实现高效高质量的水下图像渲染,实验表明其在有限参数下能取得优越的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15757 2026-06-23 cs.RO cs.AI 版本更新 73%

You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector

你有一张金票:用单一噪声向量改进生成式机器人策略

Omkar Patil, Ondrej Biza, Thomas Weng, Karl Schmeckpeper, Wil Thomason, Xiaohan Zhang, Kausik Sivakumar, Robin Walters, Nakul Gopalan, Sebastian Castro, Stephen Hart, Eric Rosen

机构 * Robotics and AI Institute(机器人与人工智能研究所) Arizona State University(亚利桑那州立大学) Northeastern University(东北大学)

专题命中 机器人数据与评测 :manipulation(abstract);robot policy(abstract);分类 cs.RO、cs.AI

AI总结 提出用固定初始噪声替换高斯采样,通过蒙特卡洛搜索找到“金票”,无需训练即可提升预训练扩散/流匹配策略在46/51个任务中的成功率,最高提升55%。

Comments 34 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21886 2026-06-23 cs.RO cs.AI 版本更新 73%

From Discrete Plans to Real-World Execution: A World-Model-Driven Framework for Execution-Aware Multi-Agent Path Finding

从离散规划到真实世界执行:一种面向执行感知的多智能体路径规划的世界模型驱动框架

Jingtian Yan, Shuai Zhou, He Jiang, Stephen F. Smith, Jiaoyang Li

机构 * IEEE Publication Technology Group(IEEE出版技术组)

专题命中 机器人数据与评测 :world model(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出ExecTimeNet世界模型预测离散MAPF方案在物理机器人上的执行状态,并基于此构建REMAP框架和ESADG优化方法,在仿真和实物实验中分别减少高达21%和15.3%的执行延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20209 2026-06-19 cs.RO cs.AI 新提交 73%

FlowMaps: Modeling Long-Term Multimodal Object Dynamics with Flow Matching

FlowMaps: 使用流匹配建模长期多模态物体动态

Francesco Argenziano, Miguel Saavedra-Ruiz, Sacha Morin, Charlie Gauthier, Daniele Nardi, Liam Paull

机构 * Sapienza University of Rome(罗马大学) Université de Montréal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出FlowMaps模型,通过潜在流匹配学习物体位置的多模态时空分布,预测动态物体未来位置,提升机器人在变化家庭环境中的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16898 2026-06-16 cs.CV cs.AI 新提交 73%

Semantic Flip: Synthetic OOD Generation for Robust Refusal in Embodied Question Answering and Spatial Localization

Semantic Flip: 用于具身问答和空间定位中鲁棒拒绝的合成OOD生成

Dongbin Na, Chanwoo Kim, Giyun Choi, Dooyoung Hong

机构 * RGA Inc.(RGA公司)

专题命中 机器人数据与评测 :embodied agent(abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 提出Semantic Flip框架,通过合成辅助OOD样本训练轻量拒绝模块,使冻结的视觉语言模型在无外部OOD标注下实现鲁棒拒绝,在具身问答和空间定位基准上优于强提示基线。

Comments 18 pages, 3 figures. Code and data: https://github.com/ndb796/SemanticFlip ; project page: https://ndb796.github.io/SemanticFlip

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13497 2026-06-12 cs.RO cs.CV 新提交 73%

SPARC: Reliable Spatial Annotations from Robot Demonstrations at Scale

SPARC:来自机器人演示的可靠空间标注

Nils Blank, Paul Mattes, Maximilian Xiling Li, Jakub Suliga, Thomas Roth, Moritz Reuss, Pankhuri Vanjani, Rudolf Lioutikov

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) NVIDIA(英伟达) Robotics Institute Germany(德国机器人研究所)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出SPARC框架,利用机器人任务的时空结构生成可靠性评分,自动标注演示中的空间信息,减少噪声标签并保留更多有用样本,在物体定位基准上优于纯检测基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12207 2026-06-11 cs.RO cs.AI 新提交 73%

Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends

具身基准构建的智能自动化:流程、具身、模拟器与趋势

Jinshan Lai, Jianwei Hu, Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Tingxuan Huang, Xi Ren, Qiang Ma

机构 * University of Electronic Science and Technology of China(电子科技大学) Qiyuan Lab(启元实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文综述具身智能基准构建的五阶段流程,分析从人工到自动化再到智能体闭环的转变,指出自动化将成本转向验证与治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09081 2026-06-04 cs.LG cs.AI 73%

FactoryNet: A Large-Scale Dataset toward Industrial Time-Series Foundation Models

FactoryNet:面向工业时间序列基础模型的大规模数据集

Karim Othman, Jonas Petersen, Matei Ignuta-Ciuncanu, Camilla Mazzoleni, Federico Martelli, Alessandro Lombardi, Riccardo Maggioni, Philipp Petersen

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 提出首个工业时间序列通用预训练语料库FactoryNet,通过统一模式实现跨实体零样本迁移和高效异常检测。

Comments Accepted at AI4Physics and FMSD, ICML 2026. Code: https://github.com/Forgis-Labs/FactoryNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03994 2026-06-03 cs.CV cs.RO 73%

SimuScene: Simulation-Ready Compositional 3D Scene Reconstruction from a Single Image

SimuScene: 从单张图像重建仿真就绪的组合式3D场景

Inhee Lee, Sangwon Baik, Sungjoo Kim, Hyeonwoo Kim, Hyunsoo Cha, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出SimuScene,一种将物理仿真融入形状和布局估计的组合式3D重建流水线,通过物理引擎诊断重建错误并驱动修正,生成稳定且仿真就绪的场景。

Comments Project Page: https://snuvclab.github.io/SimuScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08438 2026-06-02 cs.CV cs.AI 73%

A Survey of 3D Reconstruction with Event Cameras

事件相机三维重建综述

Chuanzhi Xu, Haoxian Zhou, Langyi Chen, Haodong Chen, Zeke Zexi Hu, Zhicheng Lu, Ying Zhou, Vera Chung, Qiang Qu, Weidong Cai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文首次全面综述了基于事件相机的三维重建方法,按输入模态(立体、单目、多模态)和重建技术(几何、深度学习、神经渲染如NeRF和3DGS)分类,并讨论了数据集、评估、表示和动态场景重建等挑战。

Comments This survey has been accepted for publication in the Computational Visual Media Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21007 2026-06-01 cs.CV cs.RO 73%

LiteViLNet: Lightweight Vision-LiDAR Fusion Network for Efficient Road Segmentation

LiteViLNet: 轻量级视觉-激光雷达融合网络用于高效道路分割

Daojie Peng, Bingtao Wang, Fulong Ma, Liang Zhang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Shandong University(山东大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出轻量级多模态网络LiteViLNet,通过双流编码器、深度可分离卷积和多尺度特征融合模块,在KITTI数据集上以14.04M参数达到96.36% MaxF,实现精度与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06687 2026-05-26 cs.CV cs.CL cs.ET cs.MM cs.RO 73%

TimeSpot: Benchmarking Geo-Temporal Understanding in Vision-Language Models in Real-World Settings

TimeSpot: 在真实世界场景中评估视觉语言模型的地理时间理解能力

Azmine Toushik Wasi, Shahriyar Zaman Ridoy, Koushik Ahamed Tonmoy, Kinga Tshering, S. M. Muhtasimul Hasan, Wahid Faisal, Tasnim Mohiuddin, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory (CIOL), Bangladesh(计算智能与运筹实验室(CIOL),孟加拉国) Shahjalal University of Science and Technology (SUST), Sylhet, Bangladesh(沙赫jalal科学与技术大学(SUST),沙赫里尔,孟加拉国) North South University (NSU), Dhaka, Bangladesh(北南大学(NSU),达卡,孟加拉国) Qatar Computing Research Institute (QCRI), Doha, Qatar(卡塔尔计算研究中心(QCRI),多哈,卡塔尔)

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 提出TimeSpot基准,通过1,455张全球图像评估视觉语言模型在时间属性(季节、月份、时段、日光相位)和地理属性(大洲、国家、气候带、环境类型、经纬度)上的推理能力,发现现有模型性能低下,尤其时间推理不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25210 2026-05-26 cs.LG cs.AI stat.ML 73%

Multi-Objective Learning for Diffusion Models: A Statistical Theory under Semi-Supervised Learning

扩散模型的多目标学习:半监督学习下的统计理论

Ziheng Cheng, Yixiao Huang, Hanlin Zhu, Haoran Geng, Somayeh Sojoudi, Jitendra Malik, Pieter Abbeel, Xin Guo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 针对扩散模型在多目标学习中因模型容量增大导致统计成本高的问题,提出半监督两阶段训练方法,利用未标记数据通过伪样本蒸馏,证明所需配对样本量仅取决于专家模型复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01629 2026-05-14 cs.LG cs.RO cs.SY eess.SY 73%

AdaptNC: Adaptive Nonconformity Scores for Conformal Prediction under Distribution Shift

AdaptNC: 适应性非符合分数用于分布偏移下的符合预测

Renukanandan Tumu, Aditya Singh, Rahul Mangharam

机构 * Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出AdaptNC框架,通过联合在线调整非符合分数参数和符合阈值,解决分布偏移下的预测区域保守问题,实验表明其在保持覆盖率的同时显著减少预测区域体积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07325 2026-05-11 cs.RO cs.AI 73%

CSR: Infinite-Horizon Real-Time Policies with Massive Cached State Representations

CSR:具有大规模缓存状态表示的无限时间 horizon 实时策略

Robin Karlsson, Go Suzui

机构 * GODOT Inc(GODOT公司) Graduate School of Informatics, Nagoya University(名古屋大学信息研究生院)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CSR框架,通过优化KV缓存重用和异步状态协调算法,实现大规模LLM在机器人中的实时应用,显著降低延迟并提升性能。

Comments Extended Technical Report for Paper Accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03992 2026-04-30 cs.CV cs.AI 73%

Value-Guided Iterative Refinement and the DIQ-H Benchmark for Evaluating VLM Robustness

基于价值引导的迭代精炼与DIQ-H基准:评估VLM鲁棒性的新方法

Hanwen Wan, Zexin Lin, Yixuan Deng, Xiaoqiang Ji

机构 * The School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) The School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) The Shenzhen Institute of Artificial Intelligence and Robotics for Society, Shenzhen, China(深圳人工智能与机器人社会研究院)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 本文提出DIQ-H基准和VIR框架,通过模拟真实世界压力源评估VLM在连续序列中的鲁棒性,提升误差恢复和伦理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20714 2026-04-30 cs.CV cs.AI 73%

Inferix: A Block-Diffusion based Next-Generation Inference Engine for World Simulation

Inferix:基于块扩散的下一代世界模拟推理引擎

Inferix Team, Tianyu Feng, Yizeng Han, Jiahao He, Yuanyu He, Xi Lin, Teng Liu, Hanfeng Lu, Jiasheng Tang, Wei Wang, Zhiyuan Wang, Jichao Wu, Mingyang Yang, Yinghao Yu, Zeyu Zhang, Bohan Zhuang

机构 * Inferix Team(Inferix 团队)

专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 Inferix 是一种基于块扩散的下一代推理引擎,通过优化半自回归解码过程实现沉浸式世界合成,支持交互式视频流和性能分析,结合 LV-Bench 提供高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23580 2026-04-28 cs.RO cs.AI 73%

PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement

PhysCodeBench: 通过自校正多代理细化进行3D场景的物理感知符号模拟基准测试

Tianyidan Xie, Peiyu Wang, Yuyi Qian, Yuxuan Wang, Rui Ma, Ying Tai, Song Wu, Qian Wang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Skywork AI Jilin University(吉林大学) JIUTIAN Research(JIUTIAN研究院) Tianjin University(天津大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文提出PhysCodeBench,首个评估物理感知符号模拟的基准,包含700个手动构建的样本,通过自校正多代理框架SMRF实现67.7分的性能,优于现有模型31.4分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23432 2026-04-28 cs.CV cs.AI 73%

Sphere-Depth: A Benchmark for Depth Estimation Methods with Varying Spherical Camera Orientations

球面深度:一种用于具有变化球面相机姿态的深度估计方法的基准

Soulayma Gazzeh, Giuseppe Mazzola, Liliana Lo Presti, Marco La Cascia

机构 * Department of Engineering, University of Palermo, Palermo, Italy(帕尔梅罗大学工程系)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Sphere-Depth基准,评估单目深度估计模型在球面图像中的鲁棒性,通过模拟相机姿态扰动和深度校准误差协议,发现即使专门处理球面图像的模型在姿态变化下也表现不佳。

Comments Preprint

Journal ref CAIP 2025, LNCS, vol 15621. Springer (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21192 2026-04-24 cs.RO cs.AI 73%

How VLAs (Really) Work In Open-World Environments

视觉-语言-动作模型(VLAs)在开放世界环境中的实际运作方式

Amir Rasouli, Yangzheng Wu, Zhiyuan Li, Rui Heng Yang, Xuan Zhao, Charles Eret, Sajjad Pakdamansavoji

机构 * Noah’s Ark Laboratory, Huawei Technologies Canada(华为加拿大技术有限公司诺亚实验室)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文探讨了VLAs在开放世界环境中的实际运作,指出现有评估方法可能忽视安全性问题,并提出改进的评估协议以更准确衡量复杂交互场景中的性能。

Comments 8 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏