arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-04-03 至 2026-04-03 共收录 57 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 17 篇

2604.01276 2026-04-03 astro-ph.SR astro-ph.HE 50%

Geomagnetic Storm Impacts On The Ionosphere Over Türkiye During Solar Cycle 25: Focusing On The May 2024 Storm

地磁场风暴对土耳其上层大气的影响:聚焦2024年5月风暴

Ege Eraydın, Seval Taşdemir, Deniz Cennet Çınar, Songül Özırmak, Remziye Canbay

专题命中 具身导航 :navigation(abstract)

AI总结 研究分析了太阳第25周期期间地磁场风暴对中纬度地区电离层的影响,重点探讨了风暴时间异常与电子密度增强等现象,强调了空间天气监测的重要性。

Comments 14 pages, 10 figures, 1 table, accepted for publication by Aegean Journal of Theoretical, Computational and Applied Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 6 篇

2604.01605 2026-04-03 cs.CV cs.RO 81%

F3DGS: Federated 3D Gaussian Splatting for Decentralized Multi-Agent World Modeling

F3DGS:联邦3D高斯点云用于去中心化多智能体世界建模

Morui Zhu, Mohammad Dehghani Tezerjani, Mátyás Szántó, Márton Vaitkus, Song Fu, Qing Yang

机构 * University of North Texas(北德克萨斯大学) Budapest University of Technology and Economics(布达佩斯技术与经济大学)

专题命中 具身推理 :world model(title);robotic(abstract);分类 cs.RO、cs.CV

AI总结 F3DGS通过联邦学习实现去中心化多智能体3D重建,利用共享几何框架和可见性感知聚合解决部分观测问题,实现分布式优化。

Comments Accepted to the CVPR 2026 SPAR-3D Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01607 2026-04-03 cs.DC cs.AI 79%

ModTrans: Translating Real-world Models for Distributed Training Simulator

ModTrans:用于分布式训练模拟器的现实世界模型翻译

Yi Lyu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 ModTrans通过将现实世界模型转换为分布式训练模拟器输入,解决了现有模拟器无法导入真实模型的问题,降低了ML研究者的使用门槛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01765 2026-04-03 cs.CV cs.AI cs.RO 67%

DriveDreamer-Policy: A Geometry-Grounded World-Action Model for Unified Generation and Planning

DriveDreamer-Policy: 一种基于几何的世界-动作模型用于统一生成与规划

Yang Zhou, Xiaofeng Wang, Hao Shao, Letian Wang, Guosheng Zhao, Jiangnan Shao, Jiagang Zhu, Tingdong Yu, Zheng Zhu, Guan Huang, Steven L. Waslander

机构 * GigaAI University of Toronto(多伦多大学) CUHK MMLab(香港中文大学多媒体实验室)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出DriveDreamer-Policy,结合深度生成、未来视频生成与运动规划,通过几何感知的世界表示提升生成与规划的连贯性与准确性。

Comments 11 pages, 4 figures; Project Website: https://drivedreamer-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02289 2026-04-03 cs.CV cs.AI 62%

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02097 2026-04-03 cs.CV cs.LG 62%

LatentUM: Unleashing the Potential of Interleaved Cross-Modal Reasoning via a Latent-Space Unified Model

LatentUM:通过潜在空间统一模型释放交错跨模态推理的潜力

Jiachun Jin, Zetong Zhou, Xiao Yang, Hao Zhang, Pengfei Liu, Jun Zhu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出LatentUM,通过共享语义潜在空间实现跨模态推理与生成,提升计算效率并减少编码器偏差,取得视觉空间规划基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01359 2026-04-03 cs.AI 57%

Semantic Modeling for World-Centered Architectures

面向世界中心架构的语义建模

Andrei Mantsivoda, Darya Gavrilina

专题命中 具身推理 :world model(abstract);分类 cs.AI

AI总结 本文提出世界中心多智能体系统(WMAS)作为传统智能体中心架构的替代方案,通过共享世界模型实现语义一致性、可解释性和长期稳定性,并介绍了Ontobox平台作为其实现。

Comments 15 pages, 1 figure, MathAI conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 5 篇

2603.27346 2026-04-03 cs.RO cs.AI cs.LG 89%

D-SPEAR: Dual-Stream Prioritized Experience Adaptive Replay for Stable Reinforcement Learning in Robotic Manipulation

D-SPEAR:双流优先经验自适应回放用于稳定机器人操作的强化学习

Yu Zhang, Karl Mason

机构 * School of Computer Science University of Galway Galway, Ireland

专题命中 模仿学习与强化学习 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI、cs.LG;robotics(comments)

AI总结 本文提出D-SPEAR双流优先经验自适应回放框架,通过分离actor和critic采样并维护共享回放缓冲区,利用优先回放提升价值学习效率,低误差过渡稳定策略优化,在机器人操作任务中优于SAC、TD3等基线方法。

Comments Accepted at IEEE 11th International Conference on Control and Robotics Engineering (ICCRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23205 2026-04-03 cs.CV 83%

EmbodMocap: In-the-Wild 4D Human-Scene Reconstruction for Embodied Agents

EmbodMocap: 野外4D人体-场景重建用于具身智能体

Wenjia Wang, Liang Pan, Huaijin Pi, Yuke Lou, Xuqian Ren, Yifan Wu, Zhouyingcheng Liao, Lei Yang, Rishabh Dabral, Christian Theobalt, Taku Komura

机构 * The University of Hong Kong(香港大学) Tampere University(坦佩雷大学) The Chinese University of Hong Kong(香港中文大学) Max-Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 模仿学习与强化学习 :embodied agent(title,abstract);embodied AI(abstract);分类 cs.CV

AI总结 本文提出EmbodMocap,利用两部移动iPhone实现低成本、便携式的人体-场景重建,通过联合校准双RGB-D序列,在无静态相机和标记的情况下实现日常环境中的度量尺度和场景一致的重建,提升具身智能研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15789 2026-04-03 cs.RO 70%

Emergent Dexterity via Diverse Resets and Large-Scale Reinforcement Learning

通过多样重置和大规模强化学习实现涌现的灵巧性

Patrick Yin, Tyler Westenbroek, Zhengyu Zhang, Joshua Tran, Ignacio Dagnino, Eeshani Shilamkar, Numfor Mbiziwo-Tiapo, Simran Bagaria, Xinlei Liu, Galen Mullins, Andrey Kolobov, Abhishek Gupta

机构 * University of Washington(华盛顿大学) NVIDIA(英伟达) Microsoft Research(微软研究院)

专题命中 模仿学习与强化学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出OmniReset框架,通过模拟器重置和固定超参数,实现单奖励函数解决广泛灵巧操作任务,提升鲁棒性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02226 2026-04-03 cs.AI cs.LG 62%

When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning

何时提问:用于强化学习的不确定性门控语言帮助

Juarez Monteiro, Nathan Gavenski, Gianlucca Zuin, Adriano Veloso

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ASK方法,通过结合小型语言模型和训练好的RL策略,提升模型在分布外任务中的泛化能力,通过不确定性门控机制选择性利用语言模型进行决策,实验显示其在迁移任务中表现稳健。

Comments In Proceedings of International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16705 2026-04-03 cs.RO cs.LG 62%

Olaf: Bringing an Animated Character to Life in the Physical World

奥拉夫:将动画角色带入现实世界

David Müller, Espen Knoop, Dario Mylonopoulos, Agon Serifi, Michael A. Hopkins, Ruben Grandia, Moritz Bächer

机构 * Disney Research Imagineering(迪士尼研究与工程)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文通过强化学习结合动画参考,使奥拉夫在现实世界中活动,采用软泡沫裙隐藏不对称腿部,利用球形和平面连杆实现动作控制,并通过温度输入和额外奖励减少过热风险,验证了其在仿真和硬件中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 1 篇

2510.13714 2026-04-03 eess.IV cs.AI cs.CV cs.LG 67%

DeDelayed: Deleting Remote Inference Delay via On-Device Correction

DeDelayed:通过设备端校正删除远程推断延迟

Dan Jacobellis, Mateen Ulhaq, Fabien Racapé, Hyomin Choi, Neeraja J. Yadwadkar

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) InterDigital

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出DeDelayed系统,通过设备端与远程模型协同推断,降低视频处理延迟,提升实时视频分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 10 篇

2604.01659 2026-04-03 cs.RO 79%

AURA: Multimodal Shared Autonomy for Real-World Urban Navigation

AURA:多模态共享自主控制用于真实世界城市导航

Yukai Ma, Honglin He, Selina Song, Wayne Wu, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO

AI总结 AURA通过将城市导航分解为高层人类指令和低层AI控制,减少人工操作负担,提升导航稳定性,并在真实世界中实现44%的接管减少。

Comments 17 pages, 18 figures, 4 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22652 2026-04-03 cs.RO cs.CV 79%

Pixel Motion Diffusion is What We Need for Robot Control

我们为机器人控制需要像素运动扩散

E-Ro Nguyen, Yichi Zhang, Kanchana Ranasinghe, Xiang Li, Michael S. Ryoo

机构 * Stony Brook University(石溪大学)

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 DAWN框架通过结构化像素运动表示连接高层运动意图与底层机器人动作,实现端到端可训练系统,展示多任务性能和现实迁移能力。

Comments Accepted to CVPR 2026. Project page: https://eronguyen.github.io/DAWN

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01570 2026-04-03 cs.RO 70%

Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior

通过可行动作邻域先验提升视觉-语言-动作微调

Haochen Niu, Kanyu Zhang, Shuyu Yin, Qinghai Guo, Peilin Liu, Fei Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies(华为技术有限公司)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出FAN引导正则化方法,通过调整模型输出分布以匹配FAN几何特性,提升VLA适应的样本效率和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02107 2026-04-03 cs.RO 57%

HyVGGT-VO: Tightly Coupled Hybrid Dense Visual Odometry with Feed-Forward Models

HyVGGT-VO:紧密耦合的混合密集视觉里程计与前馈模型

Junxiang Pan, Lipu Zhou, Baojie Chen

机构 * School of Instrument Science and Opto-electronics Engineering, Beihang University(北京航空航天大学仪器科学与光电工程学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出HyVGGT-VO框架,结合稀疏VO的高效计算与前馈模型的密集重建能力,实现高效实时姿态估计与密集重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29966 2026-04-03 cs.CV 57%

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22193 2026-04-03 cs.CV 57%

PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎

Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao

机构 * Peking University(北京大学) Tsinghua University(清华大学) BAAI(北京智源人工智能研究院) SJTU(上海交通大学) Eastern Institute of Technology(东方理工高等研究院) University of Cambridge(剑桥大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。

Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02141 2026-04-03 cs.GR cs.CG 50%

Topology-First B-Rep Meshing

以拓扑优先的B-Rep网格化

YunFan Zhou, Daniel Zint, Nafiseh Izadyar, Michael Tao, Daniele Panozzo, Teseo Schneider

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本文提出以拓扑优先的B-Rep网格化方法,通过强制保持B-Rep拓扑结构,实现网格生成的拓扑正确性,避免传统方法中因几何近似导致的拓扑错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11556 2026-04-03 eess.SP 50%

ACCOR: Attention-Enhanced Complex-Valued Contrastive Learning for Occluded Object Classification Using mmWave Radar IQ Signals

ACCOR:基于毫米波雷达IQ信号的增强注意力复杂值对比学习用于遮挡物体分类

Stefan Hägele, Adam Misik, Constantin Patsch, Eckehard Steinbach

专题命中 机器人数据与评测 :robotic(abstract)

AI总结 本文提出ACCOR,一种基于复杂值对比学习的增强注意力方法,利用毫米波雷达IQ信号实现遮挡物体分类,通过复杂值CNN、多头注意力层和混合损失提升分类性能,实验显示在64GHz和67GHz频段均取得较高准确率。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01023 2026-04-03 eess.SY cs.SY eess.SP 50%

Approximating Analytically-Intractable Likelihood Densities with Deterministic Arithmetic for Optimal Particle Filtering

用确定性算术近似解析不可行的似然密度以实现最优粒子滤波

Orestis Kaparounakis, Yunqi Zhang, Phillip Stanley-Marbell

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本文提出一种新的粒子滤波方法,通过确定性计算平台近似任意似然密度,提升实时处理效率和精度,实验显示其在速度和精度上均优于传统蒙特卡洛方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23824 2026-04-03 cs.CL 50%

Reviewing Scientific Papers for Critical Problems With Reasoning LLMs: Baseline Approaches and Automatic Evaluation

利用推理LLM审查科学论文中的关键问题:基线方法与自动评估

Tianmai M. Zhang, Neil F. Abernethy

机构 * University of Washington(华盛顿大学)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出利用推理LLM作为论文质量检查器,介绍基线方法和自动评估框架,通过arXiv论文验证方法,并评估其在识别科学论文关键错误中的性能。

Comments Accepted and presented at NeurIPS 2025 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他机器人 4 篇

2604.01708 2026-04-03 cs.RO cs.AI 81%

OpenGo: An OpenClaw-Based Robotic Dog with Real-Time Skill Switching

OpenGo: 基于OpenClaw的具备实时技能切换的机器人狗

Hanbing Li, Xuewei Cao, Zhiwen Zeng, Yuhan Wu, Yanyong Zhang, Yan Xia

专题命中 其他机器人 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出OpenGo,一种基于OpenClaw的机器人狗,具备实时根据场景和任务切换技能的能力,通过可定制技能库、技能调度器和自学习框架实现技能的自主组织与切换。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01991 2026-04-03 cs.RO cs.SY eess.SY 70%

Integrated Identification of Collaborative Robots for Robot Assisted 3D Printing Processes

协作机器人在机器人辅助3D打印过程中的集成识别

Alessandro Dimauro, Davide Tebaldi, Fabio Pini, Luigi Biagiotti, Francesco Leali

机构 * Department of Engineering “Enzo Ferrari”, University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学“恩佐·法拉利”工程系)

专题命中 其他机器人 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于模型的集成识别方法,用于识别协作机器人、执行器和控制器的参数,以提高机器人辅助3D打印过程的精度和误差预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07197 2026-04-03 cs.RO 61%

COMPAct: Computational Optimization and Automated Modular design of Planetary Actuators

COMPAct:机器人执行器的计算优化与自动化模块化设计

Aman Singh, Deepak Kapa, Suryank Joshi, Shishir Kolathaya

机构 * Indian Institute of Science (IISc)(印度科学研究所) Indian Institute of Technology Roorkee(印度理工学院罗基分校)

专题命中 其他机器人 :robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出COMPAct框架,通过系统优化齿轮箱参数并自动化执行器CAD设计,实现执行器的高效设计与3D打印,实验验证了不同齿轮箱类型在效率、背隙和刚度上的性能差异。

Comments 8 pages, 9 Figures, 2 tables; first two authors contributed equally; published in 2026 IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01801 2026-04-03 physics.optics physics.app-ph 50%

Compressive hyperspectral phasor imaging with single-pixel detection for spectral tasks

压缩式超光谱相位成像单像素检测用于光谱任务

Jiaqi Song, Baolei Liu, Muchen Zhu, Yao Wang, Yue Yu, Zhaohua Yang, Xiaolan Zhong, Fan Wang

专题命中 其他机器人 :robotics(abstract)

AI总结 本文提出一种压缩式超光谱相位成像单像素检测方法,通过二维相位图直接生成像素级光谱任务,减少数据量并提升低光照下分类精度。

Comments 18 pages, 6 figures, 56 references

详情

展开后加载摘要…

URL PDF HTML 收藏