arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-20 至 2026-04-20 共收录 41 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8 篇

2604.15805 2026-04-20 cs.RO cs.AI 86%

From Seeing to Simulating: Generative High-Fidelity Simulation with Digital Cousins for Generalizable Robot Learning and Evaluation

从感知到模拟:利用数字亲属进行生成高保真模拟,用于可推广的机器人学习与评估

Jasper Lu, Zhenhao Shen, Yuanfei Wang, Shugao Liu, Shengqiang Xu, Shawn Xie, Jingkai Xu, Feng Jiang, Jade Yang, Chen Xie, Ruihai Wu

机构 * Peking University(北京大学) Lightwheel

专题命中 机器人数据与评测 :robot learning(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种生成框架,将真实世界全景映射到高保真模拟场景,并通过语义和几何编辑合成多样化的亲属场景,结合高质量物理引擎和真实资产,支持交互式操作任务,并通过多房间拼接构建一致的大规模环境,验证了平台的保真度和数据扩展对泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10916 2026-04-20 cs.CV cs.AI 73%

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16054 2026-04-20 cs.CV cs.AI 62%

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准

Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu

机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) Microsoft Research(微软研究院) IIT Hyderabad(IIT海得拉巴)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16022 2026-04-20 cs.AI cs.LG cs.MA 62%

SocialGrid: A Benchmark for Planning and Social Reasoning in Embodied Multi-Agent Systems

SocialGrid:一种用于具身多智能体系统规划与社交推理的基准测试

Hikaru Shindo, Hanzhao Lin, Lukas Helff, Patrick Schramowski, Kristian Kersting

机构 * Technical University of Darmstadt(达姆施塔特技术大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) Lab1141(Lab1141实验室) Centre for Cognitive Science, Darmstadt(达姆施塔特认知科学中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 SocialGrid通过评估LLM在具身多智能体环境中的规划、任务执行与社交推理能力,揭示了现有模型在任务完成和社交推理上的不足,并提供规划 oracle 和竞争排行榜以促进改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24058 2026-04-20 eess.SP cs.AI cs.LG 62%

PULSE: Privileged Knowledge Transfer from Rich to Deployable Sensors for Embodied Multi-Sensory Learning

PULSE:从丰富到可部署传感器的特权知识转移以实现具身多感官学习

Zihan Zhao, Kaushik Pendiyala, Masood Mortazavi, Ning Yan

机构 * University of California San Diego(加州大学圣迭戈分校) University of California Davis(加州大学戴维斯分校) IC Lab, Futurewei Technologies Inc.(未来科技公司IC实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.LG

AI总结 PULSE框架通过从信息丰富的教师传感器向更廉价的部署传感器转移知识,解决具身智能系统中传感器不对称问题,实现多感官学习。

Comments v2: Accepted at the CVPR 2026 Workshop on Sense of Space. 8 pages main content + references + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15857 2026-04-20 cs.CV 57%

AHS: Adaptive Head Synthesis via Synthetic Data Augmentations

AHS: 通过合成数据增强实现自适应头部合成

Taewoong Kang, Hyojin Jang, Sohyun Jeong, Seunggi Moon, Gihwi Kim, Hoon Jin Jung, Jaegul choo

机构 * KAIST(韩国国立科学技术院) Korea University(韩国大学) FLIPTION

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出AHS方法,通过合成数据增强解决头部合成中视角和表情多样性的限制,提升真实场景下的泛化能力。

Comments CVPR 2026, Project Page : https://keh0t0.github.io/AHS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15823 2026-04-20 cs.CV 57%

Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions

像人类一样看电影:面向具身陪伴的视角中心情绪理解

Ze Dong, Hao Shi, Zejia Gao, Zhonghua Yi, Kaiwei Wang, Lin Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学, 新加坡) Zhejiang University, China(浙江大学, 中国) Ant Group, China(蚂蚁集团, 中国) MirrorMe, China(MirrorMe, 中国)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出EgoScreen-Emotion基准数据集,用于视角中心电影情绪理解,通过多标签标注和长上下文模型提升跨域泛化能力,实验显示基于传统电影数据的模型在真实视角观看场景中性能显著下降。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09943 2026-04-20 cs.MS cs.SC physics.chem-ph physics.comp-ph quant-ph 50%

SeQuant Framework for Symbolic and Numerical Tensor Algebra. I. Core Capabilities

SeQuant框架用于符号和数值张量代数。I. 核心功能

Bimal Gaudel, Robert G. Adam, Ajay Melekamburath, Conner Masteran, Nakul Teke, Azam Besharatnik, Andreas Köhn, Edward F. Valeev

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 SeQuant框架结合符号计算与数值计算,通过图论张量网络简化张量表达式,优化Wick定理应用,并支持非协变张量网络及参数依赖张量模式,实现符号与数值计算的无缝集成。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他机器人 3 篇

2604.16067 2026-04-20 cs.LG cs.CV 62%

AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning

AEGIS:锚定强化梯度隔离用于知识保留的视觉-语言-动作微调

Guransh Singh

机构 * Independent Researcher(独立研究者)

专题命中 其他机器人 :robotic(abstract);分类 cs.CV、cs.LG

AI总结 本文提出AEGIS方法,通过层间梯度投影保留预训练的视觉问答能力,避免因梯度不对称导致的性能下降,无需额外数据或缓冲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03875 2026-04-20 cs.RO 57%

COVER:COverage-VErified Roadmaps for Fixed-time Motion Planning in Continuous Semi-Static Environments

覆盖验证的固定时间运动规划路标:连续半静态环境中的路标规划

Niranjan Kumar Ilampooranan, Constantinos Chamzas

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute (WPI)(机器人工程系,沃斯特理工学院(WPI))

专题命中 其他机器人 :robotic(abstract);分类 cs.RO

AI总结 本文提出COVER框架,通过增量构建覆盖验证的路标,为半静态环境提供固定时间内的运动规划解决方案,展示了更广的问题空间覆盖和更高的查询成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15314 2026-04-20 cs.HC cs.AI 57%

Modeling of ASD/TD Children's Behaviors in Interaction with a Virtual Social Robot During a Music Education Program Using Deep Neural Networks

利用深度神经网络对自闭症儿童和典型发育儿童与虚拟社交机器人互动中的行为进行建模

Armin Tandiseh, Morteza Memari, Alireza Taheri

机构 * Social and Cognitive Robotics Laboratory, Sharif University of Technology(沙里夫科技大学社会与认知机器人实验室)

专题命中 其他机器人 :robotics(abstract);分类 cs.AI

AI总结 研究利用深度神经网络开发系统,通过音乐教育程序中与虚拟社交机器人的互动,对自闭症和典型发育儿童的行为进行评估和建模,系统在区分两种儿童群体和生成相似情境下的行为模式方面表现出高准确率。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏