arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-12 至 2026-08-12 共收录 16 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 16 篇

2608.09892 2026-08-12 cs.RO 版本更新 79%

XPolicyLab: A Unified Standard and Open Ecosystem for Robot Policy Evaluation and Deployment

XPolicyLab:用于机器人策略评估与部署的统一标准及开放生态系统

XPolicyLab Community, Tianxing Chen, Yue Chen, Tian Nian, Zijian Cai, Guangyu Chen, Wenwei Lin, Qiwei Liang, Zanxin Chen, Peicheng Xiang, Kailun Su, Zixuan Li, Junyuan Tang, Yan Qin, Qiangyu Chen, Shaolong Zhu, Xiang Li, Jiahao Zhang, Weijie Wan, Baijun Chen, Honghao Su, Kehe Ye, Shujia Liu, Kaixuan Wang, Haotian Liang, Yunze Liu, Mingleyang Li, Yuran Wang, Boyu Chen, Hongzhe Bi, Shuhe Huang, Hengkai Tan, Jisong Cai, Yao Mu, Jun Guo, Xiaofeng Wang, Zheng Zhu, Weijie Ke, Hengtao Li, Yuhang Tang, Xiaofan Li, Ganlin Yang, Zhangzheng Tu, Shuai Yang, Wenxuan Song, Pengxiang Ding, Kaidong Zhang, Yu Sun, Junliang Guo, Tong Zhang, Yixing Chen, Rongxu Cui, Zongzheng Zhang, Haoxiang Ma, Junhao Cai, Haoyu Zhang, Senqiao Yang, Jinhui Ye, Pengguang Chen, Shu Liu, Xiu Su, Wenhan Fang, Wenhao Li, Yichao Cao, Chengyao Wang, Qiang Chen, Ping Luo, Wenbo Ding

机构 * THU(清华大学)

专题命中 机器人数据与评测 :robot policy(title,abstract);分类 cs.RO

AI总结 XPolicyLab是统一机器人策略评估与部署的开放生态系统,通过标准化接口降低集成成本,集成42个策略,可适配仿真与真实机器人,减少了策略与环境的适配工作量。

Comments Website: xpolicylab.github.io, Code: https://github.com/XPolicyLab/XPolicyLab

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02035 2026-08-12 cs.RO cs.AI cs.IT cs.LG cs.MA math.IT 版本更新 75%

Bandwidth-Efficient Multi-Agent Communication through Information Bottleneck and Vector Quantization

通过信息瓶颈和向量量化实现带宽高效的多智能体通信

Ahmad Farooq, Kamran Iqbal

机构 * Department of Electrical and Computer Engineering, University of Arkansas at Little Rock(电气与计算机工程系,阿肯色大学小岩分校)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本研究通过信息瓶颈与向量量化方法,实现多智能体通信的带宽高效优化,提升协调性能并减少带宽消耗。

Comments Accepted at IEEE ICRA 2026, Vienna, Austria. 8 pages, 4 figures, 4 tables. v2: replaces v1 with the accepted camera-ready version and corrects a typo in the bandwidth reduction (41.4% -> 71.4%) in the abstract, Sec. I, Fig. 2 caption, Sec. VI and Sec. VII. Sec. V-A and Table I (800 vs 2800 bits/episode) were already correct; no results or conclusions changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10648 2026-08-12 cs.CV cs.RO 新提交 73%

Precise Top-Layer Fabric Segmentation for Fabric Destacking with Edge- and Shape-Aware Deep Networks

结合边缘感知与形状感知深度网络的织物叠堆顶层织物精确分割

Wenbo Dong, Dipankar Bhattacharya, Akinari Kobayashi, Akira Seino, Fuyuki Tokuda, Xuzhao Huang, Kai Tang, Norman C. Tien, Kazuhiro Kosuge

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对织物叠堆顶层分割的复杂挑战,提出结合边缘感知与形状感知分支的编码器-解码器训练架构,在真实数据集上验证其性能优于现有基准。

Comments 7 pages, 3 figures. Published in IEEE ICMA 2025. Author's accepted manuscript. Code: https://github.com/bhattner143/top-layer-fab-seg

Journal ref 2025 IEEE International Conference on Mechatronics and Automation (ICMA), Beijing, China, Aug. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10618 2026-08-12 cs.RO 新提交 70%

Toward the Cognitive--Physical Limits of Embodied Intelligence through a World-Model-Centric Autonomous Racing Agent

通过以世界模型为中心的自主智能体探索具身智能的认知-物理极限

Zitong Shan, Baichuan Lou, Yanxin Zhou, Shuge Wu, Xianqi He, Bolin Zhao, Sheng Zhao, Zhouheng Li, Chee Kiong Ong, King Ho Holden Li, Chen Lv

机构 * K2 Holding, L.L.C(K2控股有限责任公司)

专题命中 机器人数据与评测 :embodied agent(abstract);world model(abstract);分类 cs.RO

AI总结 该研究提出以世界模型为中心的自主赛车智能体,结合实车与模拟实验,探索具身智能的认知-物理极限,提升了交互成功率与泛化能力,为安全部署提供边界感知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08522 2026-08-12 cs.RO 版本更新 70%

EsaacSim: A Multimodal Event Camera Add-on for NVIDIA Isaac Sim

EsaacSim:适用于NVIDIA Isaac Sim的多模态事件相机附加组件

Ignacio Bugueno-Cordova, Malte Kuhlmann, Nicolás Navarro-Guerrero, Miguel Campusano, Rodrigo Verschae

机构 * Leibniz Universität Hannover(莱布尼茨汉诺威大学) L3S Research Center(L3S研究中心) University of Southern Denmark(南丹麦大学) University of Chile(智利大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出适用于NVIDIA Isaac Sim的多模态事件相机附加组件EsaacSim,可实现多模态事件相机在线仿真,在多种分辨率下具备高效性能,支持机器人研究的多模态仿真与合成数据生成。

Journal ref The 19th European Conference on Computer Vision Workshops (ECCVW 2026); Workshop on Neuromorphic Vision (NeVi)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06191 2026-08-12 cs.RO cs.CV cs.LG 版本更新 67%

Learning in ImaginationLand: Omnidirectional Policies through 3D Generative Models (OP-Gen)

在ImaginationLand中学习:通过3D生成模型(OP-Gen)实现全向策略

Yifei Ren, Edward Johns

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 该研究提出用3D生成模型(OP-Gen)从单个真实演示扩充数据集,学习全向策略,可减少所需演示数,在多任务上性能优于基线方法。

Comments Project webpage with robot videos: https://www.robot-learning.uk/op-gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10660 2026-08-12 cs.CV cs.AI 新提交 62%

Cross-View Sequential Visual Localization with Spatio-Temporal Context Modeling for Autonomous Driving

面向自动驾驶的融合时空上下文建模的跨视角序列视觉定位

Jiaping Wang, Shaobo Li, Zhen Wang

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出时序上下文增强的跨视角序列视觉定位框架,通过循环跨帧模块聚合历史上下文提升定位精度,在多个公开数据集及实装实验中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08970 2026-08-12 cs.CV cs.AI 版本更新 62%

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

MultiView-Bench:用于视觉语言模型中以世界为中心的多视图集成的诊断基准

Hantao Zhang, Jinru Sui, Ed Li, Dirk Bergemann, Zhuoran Yang

机构 * Google(谷歌)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 研究针对VLMs多视图集成能力评估不足问题,引入MultiView-Bench基准,发现模型在3D空间关系等方面的局限及偏差,提出ViewNavigator框架,能主动选择视角、融合证据,提升基础模型在该基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10623 2026-08-12 cs.RO 新提交 57%

When Your State Estimator Has Lost The Plot: Detecting Estimator Failures Via Spectral Analysis

当你的状态估计器“迷失方向”时:通过频谱分析检测估计器故障

Christian Lanegger, Helen Oleynikova, Roland Siegwart, Michael Pantic

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本研究提出一种与传感器无关的频域分析方法,用于检测状态估计器故障,在三类里程计框架中可检测51%-58%的故障,精度达60%-84%,可作为轻量级自省工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10145 2026-08-12 cs.LG 新提交 57%

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

评估协议决定结果:在TwoRoom上独立复现LeWorldModel

Joyjeet Singh

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。

Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10309 2026-08-12 cs.AI 版本更新 57%

Measure the Sim-to-Real Gap: Designing an Affordable Real-World Benchmark Platform for Reinforcement Learning in AIoT Systems

测量模拟到现实的差距:为物联网系统中的强化学习设计一个经济实惠的真实世界基准平台

Rongping Zhou, Omid Tavallaie, Shuaijun Chen, Albert Y. Zomaya

机构 * The University of Sydney(悉尼大学) University of Oxford(牛津大学) The University of Western Australia(西澳大利亚大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 针对AIoT系统中强化学习模拟到现实的差距问题,开发了成本低于400美元的真实世界平台,通过硬件模拟键盘让边缘设备智能体玩游戏训练,实验显示模拟训练智能体部署后性能大幅下降,直接现实训练有可行性,为强化学习评估提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24112 2026-08-12 cs.AI 版本更新 57%

ReMMD: Realistic Multilingual Multi-Image Agentic Verification for Multimodal Misinformation Detection

ReMMD: 面向多模态虚假信息检测的现实多语言多图像智能体验证

Chenhao Dang, Dantong Zhu, Jun Yang, Conghui He, Weijia Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Central South University(中南大学) China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 提出ReMMD框架,包含多语言多图像基准ReMMDBench和持久记忆验证器ReMMD-Agent,通过原子点分解和可重用证据集实现高效准确的多模态虚假信息检测。

Comments The project is available at https://dang-ai.github.io/ReMMD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11026 2026-08-12 eess.AS cs.MM 新提交 50%

MAJEPPA: Morphing and Assessing in a Unified Piano Performance Space

MAJEPPA:在统一钢琴演奏空间中实现变形与评估

Jinwen Zhou, Huan Zhang, Weixi Zhai, Jinhua Liang, Aidan O. T. Hogg, Simon Dixon

专题命中 机器人数据与评测 :world model(abstract)

AI总结 研究提出自监督框架MAJEPPA,构建含约4000条录音的数据集,调整MIDI自回归模型,引入EVPMR基准评估,实现统一钢琴演奏空间的表征学习与相关任务进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07539 2026-08-12 cs.NE 版本更新 50%

AutoPSO: A Metaframework for Automated Particle Swarm Optimization

AutoPSO:一种用于自动粒子群优化的元框架

Xinmeng Yu, Jiaxin Gao, Jianguo Zhang, Dongmei Jiang, Ran Cheng

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 AutoPSO是用于构建定制PSO算法的自动化元框架,通过双层搜索结合EvoX实现高效评估,发现的新型PSO变体在数值基准和机器人控制任务上显著优于强基线。

Comments Accepted by IEEE TEVC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00150 2026-08-12 eess.SY cs.SY 版本更新 50%

Data-Driven Reachability of Nonlinear Lipschitz Systems via Koopman Operator Embeddings

基于Koopman算子嵌入的非线性Lipschitz系统的数据驱动可达性

Alireza Naderi, Ahmad Hafez, Abdulla Fawzy, Amr Alanwar

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 本文提出基于Koopman算子和zonotopic集合表示的数据驱动可达性框架,通过将非线性系统提升为有限维线性模型,减少保守性并保持形式安全保证,实验证明其在长预测范围内的可达集近似更精确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20907 2026-08-12 cs.CL 版本更新 50%

The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues

隐藏的提线人:预测操纵性大语言模型对话中的人类信念变化

Jocelyn Shen, Amina Luvsanchultem, Jessica Kim, Kynnedy Smith, Valdemar Danry, Kantwon Rogers, Hae Won Park, Maarten Sap, Cynthia Breazeal

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出PUPPET框架,通过分析1035个人类与LLM交互数据,揭示当前安全范式在检测操纵策略与信念变化幅度之间的关键断层,证明先进LLM对人类信念易感性的系统低估。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏