arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-23 至 2026-03-23 共收录 54 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 17 篇

2603.19820 2026-03-23 cs.DS 50%

Range-Based Set Reconciliation via Range-Summarizable Order-Statistics Stores

基于范围的集合同步 via 可范围总结的顺序统计存储

Elvio G. Amparore

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种基于范围的集合同步方法,通过递归比较连续范围的摘要来同步有序集合,并设计了可范围总结的顺序统计存储结构以降低局部计算成本,通过实验验证了其在持久化内存中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19665 2026-03-23 cs.IR 50%

GenFacet: End-to-End Generative Faceted Search via Multi-Task Preference Alignment in E-Commerce

GenFacet:通过多任务偏好对齐的端到端生成方法实现电商多维搜索

Zhouwei Zhai, Min Yang, Jin Li

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出GenFacet,一种端到端生成框架,通过多任务偏好对齐提升电商多维搜索效果,实验证明显著提升点击率和转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19556 2026-03-23 cs.MA 50%

Planning Autonomous Vehicle Maneuvering in Work Zones Through Game-Theoretic Trajectory Generation

通过博弈论轨迹生成实现自动驾驶车辆在作业区的 maneuvering 规划

Mayar Nour, Atrisha Sarkar, Mohamed H. Zaki

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出博弈论框架用于生成自动驾驶车辆在作业区的轨迹,通过建模变道为车辆间的非合作博弈,平衡安全、进度和交通稳定性,减少冲突频率35%。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 5 篇

2603.19675 2026-03-23 cs.CV cs.RO 81%

DynFlowDrive: Flow-Based Dynamic World Modeling for Autonomous Driving

DynFlowDrive: 基于流的动态世界建模用于自动驾驶

Xiaolu Liu, Yicong Li, Song Wang, Junbo Chen, Angela Yao, Jianke Zhu

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出DynFlowDrive,通过流基于的动力学建模提升自动驾驶中的场景预测可靠性,引入稳定性感知的多模式轨迹选择策略,实验证明在nuScenes和NavSim基准上效果显著。

Comments 18 pages, 6 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20048 2026-03-23 eess.SP cs.LG 79%

Structured Latent Dynamics in Wireless CSI via Homomorphic World Models

通过同态世界模型在无线CSI中实现结构化潜在动态

Salmane Naoumi, Mehdi Bennis, Marwa Chafii

机构 * Engineering Division, New York University (NYU), Abu Dhabi, UAE.(纽约大学阿布扎克分校工程系) Center for Wireless Communications, University of Oulu, Finland.(奥卢大学无线通信中心) NYU WIRELESS, NYU Tandon School of Engineering, New York, USA.(纽约大学无线技术实验室,纽约大学坦顿工程学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本文提出一种自监督框架,通过建模CSI的时间演变,在紧凑的潜在空间中学习无线信道的预测和结构化表示,利用JEPA学习动作条件的潜在动态,通过同态更新提升几何一致性和组合性,实验表明其在保持拓扑和预测未来嵌入方面优于基线方法。

Comments ACCEPTED FOR PUBLICATION IN IEEE INTERNATIONAL CONFERENCE ON COMMUNICATIONS (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19708 2026-03-23 cs.CV 79%

WorldAgents: Can Foundation Image Models be Agents for 3D World Models?

WorldAgents: 2D基础图像模型是否能作为3D世界模型的智能体?

Ziya Erkoç, Angela Dai, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文探讨2D基础图像模型是否具备3D世界生成能力,提出多智能体架构实现3D世界合成,通过实验验证2D模型能生成一致且逼真的3D世界。

Comments Webpage: https://ziyaerkoc.com/worldagents/ Video: https://www.youtube.com/watch?v=Mj2FqqhurdI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18202 2026-03-23 cs.LG cs.AI cs.RO 78%

R2-Dreamer: Redundancy-Reduced World Models without Decoders or Augmentation

R2-Dreamer:无需解码器或增强的冗余减少世界模型

Naoki Morihira, Amal Nahar, Kartik Bharadwaj, Yasuhiro Kato, Akinobu Hayashi, Tatsuya Harada

机构 * Honda R&D Co., Ltd.(本田研发株式会社) The University of Tokyo(东京大学) RIKEN AIP(日本科学技术研究院(RIKEN)先进研究所(AIP))

专题命中 具身推理 :world model(title);分类 cs.RO、cs.AI、cs.LG

AI总结 R2-Dreamer提出一种无需解码器或增强的基于模型的强化学习框架,通过自监督目标作为内部正则化器,提高表示鲁棒性,训练速度更快且在多个任务中表现优异。

Comments 20 pages, 12 figures, 2 tables

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05786 2026-03-23 cs.CV cs.AI 62%

How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM

如何使LLM具备3D能力?LLM中空间推理的综述

Jirong Zha, Yuxuan Fan, Xiao Yang, Chen Gao, Xinlei Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))

专题命中 具身推理 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。

Comments 9 pages, 5 figures

Journal ref IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 模仿学习与强化学习 3 篇

2509.19080 2026-03-23 cs.RO cs.AI 92%

World4RL: Diffusion World Models for Policy Refinement with Reinforcement Learning for Robotic Manipulation

World4RL: 基于扩散世界模型的强化学习政策精修框架用于机器人操作

Zhennan Jiang, Kai Liu, Yuxin Qin, Shuai Tian, Yupeng Zheng, Mingcai Zhou, Chao Yu, Haoran Li, Dongbin Zhao

机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) Beijing Zhongke Huiling Robot Technology Co(北京中科创联机器人技术有限公司) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);world model(title,abstract);robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 World4RL通过扩散世界模型提升机器人操作政策的精修效果,采用高保真模拟环境进行端到端政策优化,优于模仿学习及其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19685 2026-03-23 cs.AI cs.LG cs.MA 62%

A Subgoal-driven Framework for Improving Long-Horizon LLM Agents

一种用于提升长周期LLM代理的子目标驱动框架

Taiyi Wang, Sian Gooding, Florian Hartmann, Oriana Riva, Edward Grefenstette

机构 * Google DeepMind(谷歌DeepMind)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出子目标分解规划框架和MiRA强化学习框架,通过实时规划和密集奖励信号提升LLM在长周期任务中的表现,成功率达到43.0%。

Comments 50 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19370 2026-03-23 cs.RO 57%

VAMPO: Policy Optimization for Improving Visual Dynamics in Video Action Models

VAMPO:通过改进视频动作模型的视觉动态进行策略优化

Zirui Ge, Pengxiang Ding, Baohua Yin, Qishen Wang, Zhiyong Xie, Yemin Wang, Jinbo Wang, Hengtao Li, Runze Suo, Wenxuan Song, Han Zhao, Shangke Lyu, Zhaoxin Fan, Haoang Li, Ran Cheng, Cheng Chi, Huibin Ge, Yaozhi Luo, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Xiamen University(厦门大学) University of Sussex(Sussex大学) Tianjin University(天津大学) Wuhan University(武汉大学) Hebei University of Technology(河北工业大学) Nanjing University(南京大学) Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) South China University of Technology(华南理工大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 VAMPO通过策略优化直接提升视频动作模型的视觉动态,结合GRPO和非对抗性奖励,在多种模拟和真实任务中提升任务相关视觉动态,增强下游动作生成和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 1 篇

2412.17861 2026-03-23 cs.RO 57%

From Vocal Instructions to Household Tasks: The Inria TIAGo++ in the euROBIN Service Robots Coopetition

从语音指令到家庭任务:Inria TIAGo++在euROBIN服务机器人竞赛中的应用

Fabio Amadio, Clemente Donoso, Dionis Totsila, Raphael Lorenzo, Quentin Rouxel, Olivier Rochel, Enrico Mingo Hoffman, Jean-Baptiste Mouret, Serena Ivaldi

机构 * Inria/LORIA

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO

AI总结 本文介绍了Inria团队在euROBIN竞赛中使用的集成机器人系统,通过改进TIAGo++平台实现自主和远程操作模式,并结合LLM进行指令理解和任务规划,解决了服务机器人部署中的实际问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 12 篇

2603.20077 2026-03-23 cs.CV cs.RO eess.IV 81%

A Unified Platform and Quality Assurance Framework for 3D Ultrasound Reconstruction with Robotic, Optical, and Electromagnetic Tracking

一种用于具有机器人、光学和电磁追踪的3D超声重建的统一平台和质量保证框架

Lewis Howell, Manisha Waterston, Tze Min Wah, James H. Chandler, James R. McLaughlan

机构 * School of Computer Science, University of Leeds(利兹大学计算机科学学院) School of Electronic and Electrical Engineering, University of Leeds(利兹大学电子与电气工程学院) St James’s University Hospital, Leeds Teaching Hospitals NHS Trust(利兹教学医院,利兹教学医院国家健康服务信托基金) Leeds Institute of Medical Research, University of Leeds(利兹医学研究所,利兹大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种统一平台和质量保证框架,用于评估机器人、光学和电磁追踪的3D超声重建的体积准确性和可重复性,通过定制的仿生体评估不同扫描速度和入射角下的追踪性能,实现了高精度的3D重建和验证。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23571 2026-03-23 cs.RO cs.AI cs.CV cs.LG 77%

RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation

RobotArena ∞:通过现实到模拟的翻译实现可扩展的机器人评估

Yash Jangir, Yidi Zhang, Pang-Chi Lo, Kashu Yamazaki, Chenyu Zhang, Kuan-Hsun Tu, Tsung-Wei Ke, Lei Ke, Yonatan Bisk, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(国立台湾大学)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出RobotArena Infinity框架,通过模拟环境与在线人类反馈,解决机器人政策评估中的劳动密集型、安全性差等问题,实现可扩展的视觉-语言-动作评估。

Comments Website: https://robotarenainf.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12180 2026-03-23 cs.CL cs.AI 74%

Strategic Navigation or Stochastic Search? How Agents and Humans Reason Over Document Collections

策略导航还是随机搜索?智能体和人类如何在文档集合上进行推理

Łukasz Borchmann, Jordy Van Landeghem, Michał Turski, Shreyansh Padarha, Ryan Othniel Kearns, Adam Mahdi, Niels Rogge, Clémentine Fourrier, Siwei Han, Huaxiu Yao, Artemis Llabrés, Yiming Xu, Dimosthenis Karatzas, Hao Zhang, Anupam Datta

机构 * Snowflake\,AI\,Research University\,of\,Oxford Computer\,Vision\,Center

专题命中 机器人数据与评测 :navigation(title);分类 cs.AI

AI总结 本文通过MADQA基准测试,探讨智能体与人类在文档检索中的策略性推理与随机搜索差异,揭示最佳智能体在准确性上接近人类,但依赖暴力搜索而非有效策略规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19616 2026-03-23 cs.CV 70%

UniPR: Unified Object-level Real-to-Sim Perception and Reconstruction from a Single Stereo Pair

UniPR: 一种统一的基于单立体对的物体级实拍到仿真感知与重建框架

Chuanrui Zhang, Yingshuang Zou, ZhengXian Wu, Yonggen Ling, Yuxiao Yang, Ziwei Wang

机构 * NTU(国立新加坡大学) Tencent Robotics X(腾讯机器人实验室) Futian Laboratory(福田实验室) HKUST(香港科技大学) THU(清华大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出UniPR,一种端到端的物体级实拍到仿真感知与重建框架,通过几何约束解决尺度模糊问题,消除了对类别特定规范的依赖,并通过大规模立体数据集LVS6D提升研究效率和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14460 2026-03-23 cs.RO 70%

Learning Discrete Abstractions for Visual Rearrangement Tasks Using Vision-Guided Graph Coloring

通过视觉引导的图着色学习视觉排列任务的离散抽象

Abhiroop Ajith, Constantinos Chamzas

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出通过结合结构约束和注意力引导的视觉距离,学习视觉排列任务的离散图结构抽象,以支持高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17318 2026-03-23 cs.RO cs.AI cs.CE cs.LG physics.app-ph 67%

FORWARD: Dataset of a forwarder operating in rough terrain

FORWARD:在崎岖地形中操作的前送机数据集

Mikael Lundbäck, Erik Wallin, Carola Häggström, Mattias Nyström, Andreas Grönlund, Mats Richardson, Petrus Jönsson, William Arnvik, Lucas Hedström, Arvid Fälldin, Martin Servin

机构 * Umeå University(乌梅亚大学) Swedish University of Agricultural Sciences(瑞典农业科学大学) Skogforsk, Swedish Forest Research Institute(森林研究所,瑞典)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文介绍了FORWARD数据集,包含在瑞典中部两个森林地区崎岖地形中操作的前送机的高分辨率多模态数据,用于开发森林机械的交通性、感知和自主控制算法。

Comments 33 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19936 2026-03-23 cs.CV cs.RO 62%

LIORNet: Self-Supervised LiDAR Snow Removal Framework for Autonomous Driving under Adverse Weather Conditions

LIORNet:一种用于恶劣天气条件下自动驾驶的自监督激光雷达雪清除框架

Ji-il Park, Inwook Shim

机构 * Ministry of National Defense(国防 ministry) Department of Smart Mobility Engineering(智能移动工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出LIORNet,通过自监督学习和多物理统计线索生成伪标签,有效区分噪声点与环境结构,提升恶劣天气下激光雷达感知的准确性和鲁棒性。

Comments 14 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06344 2026-03-23 cs.CV cs.LG 62%

Hyper-STTN: Hypergraph Augmented Spatial-Temporal Transformer Network for Trajectory Prediction

Hyper-STTN:基于超图的时空变换网络用于轨迹预测

Weizheng Wang, Baijian Yang, Sungeun Hong, Wenhai Sun, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(普渡大学应用与创意计算学院) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(印第安纳大学布卢明顿分校计算机科学系和智能系统工程系) Department of Applied Artificial Intelligence, Sungkyunkwan University(成均馆大学应用人工智能系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Hyper-STTN,通过构建多尺度超图和时空变换器,有效建模人群轨迹预测中的群体和个体交互,实验表明其优于现有方法。

Comments To appear in ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24129 2026-03-23 cs.RO cs.CV 62%

Mash, Spread, Slice! Learning to Manipulate Object States via Visual Spatial Progress

Mash, Spread, Slice! 通过视觉空间进展学习操控物体状态

Priyanka Mandikal, Jiaheng Hu, Shivin Dass, Sagnik Majumder, Roberto Martín-Martín, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 SPARTA框架首次统一处理物体状态变化任务,通过空间进展和物体中心变化生成结构化策略观察和密集奖励,提升机器人操控效率和准确性。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19654 2026-03-23 cs.CV 57%

GravCal: Single-Image Calibration of IMU Gravity Priors with Per-Sample Confidence

GravCal:单图像IMU重力先验校准

Haichao Zhu, Qian Zhang

机构 * UC Riverside(加州大学河滨分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 GravCal通过单图像校准IMU重力先验,结合残差修正和图像估计,提升重力方向精度,减少角误差。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19607 2026-03-23 cs.CV 57%

Physion-Eval: Evaluating Physical Realism in Generated Video via Human Reasoning

Physion-Eval:通过人类推理评估生成视频的物理真实性

Qin Zhang, Peiyu Jing, Hong-Xing Yu, Fangqiang Ding, Fan Nie, Weimin Wang, Yilun Du, James Zou, Jiajun Wu, Bing Shuai

机构 * Physion Labs(Physion实验室) Stanford University(斯坦福大学) MIT(麻省理工学院) Harvard University(哈佛大学) Character AI

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出Physion-Eval基准,通过专家人类推理评估生成视频的物理真实性,揭示当前视频生成模型在物理关键场景中存在显著缺陷,83.3%的外向视角和93.5%的内向视角视频存在可识别的物理错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14977 2026-03-23 cs.RO 57%

ReMAP-DP: Reprojected Multi-view Aligned PointMaps for Diffusion Policy

ReMAP-DP:基于重投影多视角对齐点地图的扩散策略

Xinzhang Yang, Renjun Wu, Jinyan Liu, Xuesong Li

机构 * School of Computer Science, Beijing Institute of Technology, China(北京理工大学计算机科学学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出ReMAP-DP框架,结合标准化视角重投影与结构感知双流扩散策略,解决2D视觉表示在3D空间感知上的不足,提升机器人在多样化任务中的精度与鲁棒性。

Comments fix some typos

详情

展开后加载摘要…

URL PDF HTML 收藏