arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-23 至 2026-07-23 共收录 15 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 4 篇

2607.18709 2026-07-23 cs.RO 版本更新 92%

RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation

RoboInter1.5:用于具身世界建模和机器人操作的整体中间表示套件

Ziqin Wang, Hao Li, Weijun Wang, Junhao Cai, Jia Zeng, Yilun Chen, Jiangmiao Pang, Si Liu

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 研究针对现有机器人数据集问题,基于RoboInter1.0提出RoboInter1.5套件,含多种中间表示资源及相关任务,通过广泛评估证明其为中间表示提供统一时空框架,将其作为双向接口,规范动作空间并约束物理模拟器潜在展开。

Comments 28 pages. arXiv admin note: substantial text overlap with arXiv:2602.09973

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04401 2026-07-23 cs.RO cs.CV 版本更新 62%

Quantile Transfer for Reliable Operating Point Selection in Visual Place Recognition

视觉地点识别中可靠操作点选择的分位数迁移

Dhyey Manish Rajani, Michael Milford, Tobias Fischer

机构 * QUT Centre for Robotics(昆士兰理工大学机器人中心) School of Electrical Engineering and Robotics(电气工程与机器人学院) Queensland University of Technology(昆士兰理工大学)

专题命中 机器人操作 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 提出一种通过分位数归一化迁移阈值的方法,自动选择视觉地点识别系统的操作点,在100%精度下最大化召回率,无需手动调参。

Comments Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14047 2026-07-23 cs.RO cs.HC cs.SY eess.SY 版本更新 57%

Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment

PhysClaw-0:一种通过语言修正实现机器人自主的共生智能体系统

Boyuan Wang, Zhenyuan Zhang, Zhiqin Yang, Peijun Gu, Shuya Wang, Xiaofeng Wang, Xianghui Ze, Yifan Chang, Guosheng Zhao, Jiangnan Shao, Guan Huang, Hengyu Liu, Yonggang Zhang, Wei Xue, Chunyuan Guan, Chenglin Pu, Yike Guo, Xingang Wang, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong University of Science and Technology(香港科技大学) University of Leeds(利兹大学) Cornell University(康奈尔大学) Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) The Chinese University of Hong Kong(香港中文大学) FAWTD(一汽技术开发部)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 研究针对自主数据收集问题,提出PhysClaw-0共生智能体系统,通过跨轮保留和重用修正、自主收集验证等方式,在真实机器人测试中减少人力时间,提高成功率,并提升验证者与人类一致性。

Comments WebPage: https://open-gigaai.github.io/Zero2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07608 2026-07-23 cond-mat.mtrl-sci 版本更新 50%

Orbital Hall Effect Enables Field-Free Magnetization Reversal in Ferrimagnets without Additional Conversion Layer

轨道霍尔效应实现了无需额外转换层的亚铁磁体无场磁化反转

Zelalem Abebe Bekele, Kun Lei, Xiukai Lan, Xiangyu Liu, Hui Wen, Weihao Li, Yongcheng Deng, Wenkai Zhu, Kaiming Cai, Kaiyou Wang

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究利用Mo/CoGd器件中Mo层的局域轨道霍尔电流,通过面内对称性破缺产生z极化阻尼类扭矩,CoGd兼具转换与自开关功能,实现无场电流诱导的亚铁磁确定性开关,突出轨道霍尔电流在节能磁化开关上的潜力。

Comments We are withdrawing this manuscript because our current analysis has revealed serious analytical issues that render the main conclusions invalid. We intend to thoroughly revise the methodology and submit a corrected version in the future

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 3 篇

2605.31119 2026-07-23 cs.RO cs.LG 版本更新 73%

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

不要愚弄我两次:通过经验驱动推理在野外适应逆境

Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 具身导航 :robotics(abstract);embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05458 2026-07-23 cs.RO 版本更新 61%

Counterfactual Reasoning and Environment Design for Active Preference Learning

主动偏好学习的反事实推理与环境设计

Yi-Shiuan Tung, Bradley Hayes, Alessandro Roncone

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robot learning(comments)

AI总结 研究机器人主动偏好学习中现有方法的不足,提出CRED方法,通过联合优化环境设计和轨迹选择,利用反事实推理生成轨迹,经实验验证该方法能改善奖励学习并在不同环境有效泛化。

Comments RSS 2025 Workshop on Human-in-the-Loop Robot Learning: Teaching, Correcting, and Adapting

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22649 2026-07-23 cs.CV 版本更新 57%

Interactive Medical-SAM2 GUI: A Napari-based semi-automatic annotation tool for medical images

交互式医学-SAM2 GUI:基于Napari的半自动标注工具用于医学图像

Woojae Hong, Jong Ha Hwang, Jiyong Chung, Joongyeon Choi, Hyunggun Kim, Yong Hwy Kim

机构 * Department of Biomechatronic Engineering, Sungkyunkwan University(生物机电工程系,全州大学) Department of Neurosurgery, Seoul National University Hospital, Seoul National University College of Medicine(神经外科,首尔国立大学医院,首尔国立大学医学院)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 交互式医学-SAM2 GUI 提供基于Napari的本地工作流,实现高效的3D医学图像半自动标注与导出功能。

Comments Planning to submit JOSS (Journal of Open Source Software)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 1 篇

2512.02473 2026-07-23 cs.CV cs.LG 版本更新 84%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV、cs.LG

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 1 篇

2606.27355 2026-07-23 cs.RO 版本更新 57%

RouterVLA: Budgeted Commissioning and Expert Onboarding for Growing VLA Pools

RouterVLA:将冒烟测试转化为异构VLA选择的监督信号

Xingyu Ren, Chugang Yi, Youran Sun

机构 * The Chinese University of Hong Kong(香港中文大学) University of Maryland, College Park(马里兰大学 College Park 分校) Tsinghua University(清华大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO

AI总结 提出RouterVLA方法,利用预部署评估的冒烟测试记录来监督异构VLA策略的选择,通过结果分离的交叉拟合和透明规则,在LIBERO-Plus数据集上将保留集成功率提升14.64个百分点。

Comments v2: revised title, updated author list, restructured the experiments

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 5 篇

2607.15330 2026-07-23 cs.RO cs.CV 版本更新 84%

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories

小米机器人1:利用超过10万小时的真实世界轨迹扩展视觉语言动作模型

Xiaomi Robotics Team, Jun Guo, Piaopiao Jin, Jason Li, Peiyan Li, Yingyan Li, Futeng Liu, Wanli Peng, Optimus Qin, Yifei Su, Nan Sun, Qiao Sun, Runze Suo, Heyun Wang, Yunhong Wang, Rujie Wu, Caoyu Xia, Lina Zhang, Jack Zhao, Guoliang Chen, Wenlong Chen, Xinze He, Bin Li, Qing Li, Zhuorong Li, Heng Qu, Wenxuan Song, Diyun Xiang, Yifan Xie, Peiran Xu, Hangjun Ye, Wen Ye, Han Zhao, Quanyun Zhou

机构 * Xiaomi Robotics(小米机器人)

专题命中 机器人数据与评测 :robotics(title,abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 研究提出小米机器人1这一视觉语言动作模型,采用两阶段训练方法,预训练利用大量真实轨迹赋予模型能力,后训练使其与机器人实体及指令对齐。该模型在多基准测试中表现优异,能有效微调,建立新的最先进水平。

Comments Project page: https://robotics.xiaomi.com/xiaomi-robotics-1.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05669 2026-07-23 cs.RO cs.SY eess.SY 版本更新 79%

Dynamic Multi-Agent Pickup and Delivery in Robotic Cellular Warehousing Systems

机器人化仓储系统中的动态多智能体取送货

Cheng Ren, Ming Li, Xinping Guan, George Q. Huang

机构 * Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(工业与系统工程系,香港理工大学) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 针对订单内部SKU动态追加的仓库场景,首次形式化动态多智能体取送货问题,提出两种基于令牌传递的事件触发在线重规划算法,显著降低订单流时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27852 2026-07-23 cs.GR cs.CV 版本更新 70%

ClothTransformer: Unified Latent-Space Transformers for Scalable Cloth Simulation

ClothTransformer: 用于可扩展布料模拟的统一潜空间变换器

Yu Zhang, Yidi Shao, Wenqi Ouyang, Yushi Lan, Zhexin Liang, Chengrui Wu, Xudong Xu, Xingang Pan

机构 * S-Lab, Nanyang Technological University, Singapore(新加坡南洋理工大学S实验室,南洋理工大学,新加坡) Feeling AI University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出ClothTransformer,通过将布料模拟重构为潜空间中的自回归序列建模,使用统一Transformer架构处理多种场景,实现比现有方法低4-9倍的误差,并引入可扩展潜空间公式和穿透自由数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02694 2026-07-23 cs.CV cs.AI 版本更新 62%

DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning

DocShield:通过证据导向的智能代理推理实现AI文档安全

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Weibin Yao, Joey Tianyi Zhou, Jianshu Li, Ying Yan

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)计算与先进机器人中心及高性能计算研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出DocShield框架,通过视觉-逻辑联合推理解决文档伪造检测问题,采用CCT机制和多任务奖励优化,提升检测准确性和解释性,实验显示其在多个基准测试中表现优异。

Comments 10 pages, 4 figures, 5 tables. Preprint. arXiv admin note: text overlap with arXiv:2512.21482

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16900 2026-07-23 cs.AI 版本更新 57%

Environment-free Synthetic Data Generation for API-Calling Agents

用于 API 调用智能体的无环境合成数据生成

Seanie Lee, Sanjoy Chowdhury, Chao Jiang, Cheng-Yu Hsieh, Ting-Yao Hu, Alexander T Toshev, Oncel Tuzel, Raviteja Vemulapalli

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 研究针对训练 API 调用 LLM 智能体数据收集瓶颈问题,提出无环境合成数据生成方法,利用 LLMs 生成任务、响应等,经评判器过滤轨迹,在相关基准上评估,结果表明此方法可有效训练智能体,是实用可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他机器人 1 篇

2603.21831 2026-07-23 cs.RO math.DG 版本更新 57%

Directional Mollification for Knot-Preserving $C^{\infty}$ Smoothing of Polygonal Chains with Explicit Curvature Bounds

方向 mollification 用于保持结的 $C^{\infty}$ 平滑化多边链及其显式曲率界

Alfredo González-Calvin, Juan F. Jiménez, Héctor García de Marina

机构 * Dept. of Computer Architecture and Automation, Faculty of Physics, Complutense University of Madrid(马德里康普顿斯大学物理学院计算机体系结构与自动化系)

专题命中 其他机器人 :robotics(abstract);分类 cs.RO

AI总结 本文提出方向 mollification 操作,用于在保持顶点的情况下对多边链进行 $C^{\infty}$ 平滑,提供显式曲率界和局部可控性,适用于几何建模和需要严格结保真的应用。

Comments Under review in AMC

详情

展开后加载摘要…

URL PDF HTML 收藏