arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-13 至 2026-08-13 共收录 73 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 15 篇

2603.08131 2026-08-13 cs.RO cs.CV 版本更新 62%

UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing

UniGround: 通过无训练场景解析实现通用三维视觉接地

Jiaxi Zhang, Yunheng Wang, Wei Lu, Taowen Wang, Shuning Zhang, Yixiao Feng, Junzhe Xu, Shunwang Sun, Weisheng Xu, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)) Shanghai Normal University(上海师范大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 UniGround通过无训练的视觉和几何推理实现通用三维视觉接地,超越训练数据限制,在ScanRefer和EmbodiedScan上取得新突破。

Comments 30 pages,9 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12313 2026-08-13 cs.CV cs.CL 新提交 57%

AVA-Encoder: Towards Agent-Native Video Representation Learning

AVA-Encoder:面向智能体原生的视频表示学习

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Hua

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Computing Technology(中国科学院计算技术研究所) Southeast University(东南大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11790 2026-08-13 cs.LG 新提交 57%

High-Order Liquid Evidence Encoding for Gradual GNSS Spoofing Detection in Autonomous Driving

面向自动驾驶中渐进式GNSS欺骗检测的高阶液体证据编码

Muhammad Ayub Sabir, Junbiao Pang, Fatima Ashraf

机构 * Faculty of Information Technology, Beijing University of Technology(北京工业大学信息学部)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 针对自动驾驶中渐进式GNSS欺骗难检测问题,提出因果高阶液体证据框架,在AV-GPS数据集子集上获最高F1分数,可快速检测正常到攻击的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11692 2026-08-13 cs.AI 新提交 57%

HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting

HUGIN:增强自主物流分拣的视觉-语言规划能力

Xikai Sun, Cangtian Zhou, Kebin Liu, Ke Ma, Xu Wang, Zaishu Chen, Haotian Wang, Li Liu, Yunhao Liu

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 针对自主物流分拣的联合多场景理解挑战,提出HUGIN训练框架,构建SortingBench基准,在多VLMs上性能提升,验证了方法有效性与实际可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11286 2026-08-13 cs.CR cs.LG cs.SY eess.SY 新提交 57%

Benchmarking Cyberattack Detection in Electric Vehicle Charging Infrastructure with Benign User Updates

基于良性用户更新的电动汽车充电基础设施网络攻击检测基准测试

Hannan Chen, Roshni Anna Jacob, Jie Zhang

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文构建了保留真实ACN会话的泄漏控制会话级基准,提出双分支Masked-AE转换增强模型,在多类模型对比中实现最强鲁棒验证性能,可检测电动汽车充电基础设施的恶意请求操纵且不拒绝合法用户选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11216 2026-08-13 cs.AI 新提交 57%

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

机构 * Electronic Arts(美国艺电公司) Simon Fraser University(西蒙菲莎大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。

Comments Project page: https://electronicarts.github.io/AutoWorldModelBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14615 2026-08-13 cs.CV 版本更新 57%

CalibAnyView: Beyond Single-View Camera Calibration in the Wild

CalibAnyView:超越单视角相机校准的野外应用

Boying Li, Cheng Zhang, Weirong Chen, Guyuan Chen, Daniel Cremers, Jianfei Cai, Ian Reid, Hamid Rezatofighi

机构 * Monash University(蒙纳士大学) Technical University of Munich(慕尼黑技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 CalibAnyView通过多视角几何一致性建模,提升野外多视角相机校准的鲁棒性和精度,适用于复杂场景下的3D重建和机器人感知。

Comments 27 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02038 2026-08-13 cs.CL cs.SD eess.AS 版本更新 50%

Marco-Voice Technical Report

Marco-Voice技术报告

Fengping Tian, Chenyang Lyu, Xuanfan Ni, Haoqin Sun, Qingjuan Li, Zhiqiang Qian, Haijun Li, Longyue Wang, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本研究提出集成语音克隆与情感控制的Marco-Voice语音合成系统,通过说话人-情感解耦等机制构建CSEMOTIONS数据集,实现了表现力与可控性的显著提升。

Comments Technical Report. Our code and dataset are publicly available at https://github.com/AIDC-AI/Marco-Voice and https://huggingface.co/datasets/AIDC-AI/CSEMOTIONS respectively for non-commercial use only

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他机器人 5 篇

2504.20477 2026-08-13 cs.RO 版本更新 83%

Who Is Responsible? Self-Adaptation Under Multiple Concurrent Failures With Unknown Faults in Complex Robotic Systems

谁该负责?在复杂ROS系统中多重同时不确定性的自我适应

Andreas Wiedholz, Rafael Paintner, Alwin Hoffmann, Tobias Huber

机构 * XITASO GmbH(XITASO公司) German Aerospace Center (DLR) Institute of Flight Systems(德国航空航天中心(DLR)飞行系统研究所)

专题命中 其他机器人 :robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 本文提出了一种基于ROS2的自我适应方法,能够处理复杂系统中多重同时不确定性的根本原因分析和策略选择,通过规则集和依赖图实现轻量级适应,提升适应效率与性能。

Comments Accepted at ACSOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11409 2026-08-13 cs.RO 新提交 79%

From Self-Normal-Positioning to Omni-Directional Tracking: Real-Time Surface Modeling Enabled Probe Tilt Control for Robotic Ultrasound Imaging

从自正常定位到全向跟踪:用于机器人超声成像的实时表面建模支持的探头倾斜控制

Xihan Ma, Haichong Zhang

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 该研究针对机器人超声成像中现有系统仅支持探头法向定位的局限,提出整合RGB-D感知等的全向探头朝向控制框架,实现了高精度的任意角度跟踪,可获取临床所需非法向诊断视图。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13309 2026-08-13 cs.RO 版本更新 79%

Utilizing Inpainting for Keypoint Detection for Vision-Based Control of Robotic Manipulators

利用图像修复进行基于视觉的机械臂运动控制的关键点检测

Sreejani Chatterjee, Venkatesh Mullur, Abhinav Gandhi, Berk Calli

机构 * Worcester Polytechnic Institute(沃斯彻斯特理工学院)

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出一种新的视觉伺服框架,通过纯自然视觉特征控制机械臂的配置空间。通过图像修复生成无标记的机械臂图像,训练关键点检测算法以实现基于自然特征的控制,无需依赖相机校准或机器人模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20963 2026-08-13 cs.RO 79%

A Robotic Testing Platform for Pipelined Discovery of Resilient Soft Actuators

一种用于流水线发现鲁棒性软执行器的机器人测试平台

Ang Li, Alexander Yin, Alexander White, Sahib Sandhu, Matthew Francoeur, Victor Jimenez-Santiago, Van Remenar, Codrin Tugui, Mihai Duduta

机构 * Department of Mechanical and Industrial Engineering, University of Toronto(多伦多大学机械与工业工程系) Institute of Materials Science, University of Connecticut(康涅狄格大学材料科学研究所) School of Mechanical, Aerospace, and Manufacturing Engineering, University of Connecticut(康涅狄格大学机械、航空航天与制造工程学院) Material Science and Engineering, University of Connecticut(康涅狄格大学材料科学与工程系) Inorganic Polymers Department, Petru Poni Institute of Macromolecular Chemistry(彼得·波尼宏分子化学研究所无机聚合物部门)

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出了一种机器人测试平台,用于流水线发现鲁棒性软执行器的最优参数组合,显著提升其操作寿命和负载能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12179 2026-08-13 cs.CV 新提交 57%

Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs

Map-Det3D:面向流输入的多视图3D目标检测的度量前馈3D重建先验

Yung-Hsu Yang, Luigi Piccinelli, Samuel Rota Bulò, Sunghwan Hong, Denis Rozumny, Johannes Schönberger, Zuria Bauer, Hermann Blum, Peter Kontschieder, Marc Pollefeys

机构 * ETH Zürich(苏黎世联邦理工学院) Meta Reality Labs(元宇宙实验室) University of Bonn(波恩大学)

专题命中 其他机器人 :embodied agent(abstract);分类 cs.CV

AI总结 Map-Det3D是一种在线多视图3D目标检测模型,通过将短时间窗口映射为多视图并利用前馈度量3D重建模型作为几何骨干,直接在度量3D空间预测边界框,实现了稳定的单目视频3D检测,且具有良好的在线性能与鲁棒迁移性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏