arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-13 至 2026-08-13 共收录 15 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 15 篇

2608.11901 2026-08-13 cs.RO 新提交 83%

DaViNCi: A Dataset Towards Outdoor Vision-and-Language Navigation with Continuous Actions and Dynamic Elements

DaViNCi:面向包含连续动作与动态元素的户外视觉语言导航的数据集

Zihao Xie, Pingrui Lai, Yitong Wu, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出首个同时包含连续动作与动态元素的户外视觉语言导航数据集DaViNCi,通过实验验证其挑战性,为推动户外VLN向更真实环境发展提供实用支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11246 2026-08-13 cs.AI cs.LG cs.RO 新提交 82%

Towards the Harness of Embodied Agents

迈向具身智能体的管控

Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。

Comments Project page: https://eit-hai.github.io/thea

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11431 2026-08-13 cs.RO 版本更新 80%

A Generalized Theory of Load Distribution in Redundantly-actuated Robotic Systems

冗余驱动机器人系统中载荷分布的通用理论

Joshua Flight, Clément Gosselin

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出冗余驱动机器人系统中载荷分布的通用理论,推导了高效力合成与分析解,并指出现有方法的不足,通过示例展示改进效果。

Comments 23 pages, 15 figures. Submitted to The International Journal of Robotics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19985 2026-08-13 cs.CV 版本更新 70%

Vision-Reasoning-Guided Occlusion Removal from Light Fields

视觉推理引导的光场遮挡去除

Mohamed Youssef, Oliver Bimber

机构 * Johannes Kepler University(约翰·开普勒大学)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出结合光场积分与视觉语言模型的框架,通过多视图融合和语义先验恢复被遮挡场景,在合成和真实数据上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05474 2026-08-13 cs.CV 版本更新 70%

3D Scene Generation: A Survey

3D场景生成:一项综述

Haozhe Xie, Beichen Wen, Zhaoxi Chen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 本综述系统梳理3D场景生成的四大范式方法,分析其技术基础与挑战,展望物理感知生成等方向,为该领域发展提供参考。

Comments Accepted by IJCV. Project Page: https://github.com/hzxie/Awesome-3D-Scene-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12358 2026-08-13 cs.CV cs.AI cs.RO 67%

From Prompts to Pavement: LMMs-based Agentic Behavior-Tree Generation Framework for Autonomous Vehicles

从提示到道路:基于大语言模型的代理行为树生成框架用于自动驾驶车辆

Omar Y. Goba, Ahmed Y. Gado, Catherine M. Elias, Ahmed Hussein

机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大·冯·洪堡大学(开罗分校)计算机科学与工程系,埃及) C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室(车辆系统中的认知驾驶研究),开罗,埃及) IAV GmbH, Berlin, Germany(IAV GmbH,柏林,德国)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出了一种基于大语言模型和多模态视觉模型的代理行为树生成框架,用于自动驾驶车辆在复杂环境中自适应导航。该框架通过链式符号提示评估场景关键性,通过上下文学习构建高层子目标,并通过生成器合成可执行的BT子树,实现了在CARLA+Nav2模拟中对突发障碍物(如道路堵塞)的成功绕行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11564 2026-08-13 cs.CV cs.RO 新提交 62%

Repurposing RGB-based Foundation Model for Depth Estimation on Thermal Images Using Hierarchical Supervision

利用分层监督将基于RGB的基础模型重新用于热图像的深度估计

Jie Hong, Tingtian Li, Xuesong Li, Xiao Li

机构 * The University of Hong Kong(香港大学) Commonwealth Scientific and Industrial Research Organisation (CSIRO)(英联邦科学与工业研究组织)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对热图像深度估计中RGB基础模型分层表示利用不足的问题,提出RGB-HS框架,通过分层监督和基于图像质量的标记加权对齐,在基准上实现了有竞争力的性能。

Comments Accepted in IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08131 2026-08-13 cs.RO cs.CV 版本更新 62%

UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing

UniGround: 通过无训练场景解析实现通用三维视觉接地

Jiaxi Zhang, Yunheng Wang, Wei Lu, Taowen Wang, Shuning Zhang, Yixiao Feng, Junzhe Xu, Shunwang Sun, Weisheng Xu, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)) Shanghai Normal University(上海师范大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 UniGround通过无训练的视觉和几何推理实现通用三维视觉接地,超越训练数据限制,在ScanRefer和EmbodiedScan上取得新突破。

Comments 30 pages,9 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12313 2026-08-13 cs.CV cs.CL 新提交 57%

AVA-Encoder: Towards Agent-Native Video Representation Learning

AVA-Encoder:面向智能体原生的视频表示学习

Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun, Zhijing Zhang, Bingnan Li, Shuqi Gu, Kan Ren, Jiaming Liu, Ruihua Hua

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Computing Technology(中国科学院计算技术研究所) Southeast University(东南大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11790 2026-08-13 cs.LG 新提交 57%

High-Order Liquid Evidence Encoding for Gradual GNSS Spoofing Detection in Autonomous Driving

面向自动驾驶中渐进式GNSS欺骗检测的高阶液体证据编码

Muhammad Ayub Sabir, Junbiao Pang, Fatima Ashraf

机构 * Faculty of Information Technology, Beijing University of Technology(北京工业大学信息学部)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 针对自动驾驶中渐进式GNSS欺骗难检测问题,提出因果高阶液体证据框架,在AV-GPS数据集子集上获最高F1分数,可快速检测正常到攻击的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11692 2026-08-13 cs.AI 新提交 57%

HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting

HUGIN:增强自主物流分拣的视觉-语言规划能力

Xikai Sun, Cangtian Zhou, Kebin Liu, Ke Ma, Xu Wang, Zaishu Chen, Haotian Wang, Li Liu, Yunhao Liu

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 针对自主物流分拣的联合多场景理解挑战,提出HUGIN训练框架,构建SortingBench基准,在多VLMs上性能提升,验证了方法有效性与实际可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11286 2026-08-13 cs.CR cs.LG cs.SY eess.SY 新提交 57%

Benchmarking Cyberattack Detection in Electric Vehicle Charging Infrastructure with Benign User Updates

基于良性用户更新的电动汽车充电基础设施网络攻击检测基准测试

Hannan Chen, Roshni Anna Jacob, Jie Zhang

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文构建了保留真实ACN会话的泄漏控制会话级基准,提出双分支Masked-AE转换增强模型,在多类模型对比中实现最强鲁棒验证性能,可检测电动汽车充电基础设施的恶意请求操纵且不拒绝合法用户选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11216 2026-08-13 cs.AI 新提交 57%

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

机构 * Electronic Arts(美国艺电公司) Simon Fraser University(西蒙菲莎大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。

Comments Project page: https://electronicarts.github.io/AutoWorldModelBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14615 2026-08-13 cs.CV 版本更新 57%

CalibAnyView: Beyond Single-View Camera Calibration in the Wild

CalibAnyView:超越单视角相机校准的野外应用

Boying Li, Cheng Zhang, Weirong Chen, Guyuan Chen, Daniel Cremers, Jianfei Cai, Ian Reid, Hamid Rezatofighi

机构 * Monash University(蒙纳士大学) Technical University of Munich(慕尼黑技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 CalibAnyView通过多视角几何一致性建模,提升野外多视角相机校准的鲁棒性和精度,适用于复杂场景下的3D重建和机器人感知。

Comments 27 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02038 2026-08-13 cs.CL cs.SD eess.AS 版本更新 50%

Marco-Voice Technical Report

Marco-Voice技术报告

Fengping Tian, Chenyang Lyu, Xuanfan Ni, Haoqin Sun, Qingjuan Li, Zhiqiang Qian, Haijun Li, Longyue Wang, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本研究提出集成语音克隆与情感控制的Marco-Voice语音合成系统,通过说话人-情感解耦等机制构建CSEMOTIONS数据集,实现了表现力与可控性的显著提升。

Comments Technical Report. Our code and dataset are publicly available at https://github.com/AIDC-AI/Marco-Voice and https://huggingface.co/datasets/AIDC-AI/CSEMOTIONS respectively for non-commercial use only

详情

展开后加载摘要…

URL PDF HTML 收藏