arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 566 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 566 篇

2607.18231 2026-07-21 cs.RO 新提交 83%

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

FM-VLA:用于接触丰富操作中视觉-语言-动作模型的基于力的记忆

Ruicheng Li, Qixiu Li, Ruichun Ma, Yu Deng, Lin Luo, Zhiying Du, Jianfeng Xiang, Huizhi Liang, Ruicheng Wang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院) Fudan University(复旦大学) USTC(中国科学技术大学)

专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 研究针对视觉-语言-动作模型在接触丰富操作中的时间上下文推理问题,提出FM-VLA模型,通过基于力的记忆编码及投影,利用累积接触事件历史指导操作,在相关任务上评估,轻量级力记忆表现出色,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08448 2026-07-16 cs.RO 版本更新 83%

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

利用VLA:通过记忆引导智能体将冻结的视觉语言动作模型转化为可靠的操作原语

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

机构 * Tsinghua University(清华大学) Striding AI(驰行人工智能公司) Purdue University(普渡大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Infinigence AI(英飞智研人工智能公司) Zhongguancun Academy(中关村学院) Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人基础模型 :manipulation(title,abstract);navigation(abstract);分类 cs.RO

AI总结 研究语言条件下操作问题,提出Harness VLA框架,将冻结VLA与分析原语库结合,通过学习操作范围扩展预训练VLA,在多种扰动操作任务中相比基线有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02865 2026-07-07 cs.RO 新提交 83%

DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning

DREAMSTEER:潜在世界模型可在部署期间引导VLA策略,无需任何微调

Hanchen Cui, Sergio Arnaud, Arjun Majumdar, Daniel Dugas, Elie Aljalbout, Karthik Desingh, Krishna Murthy Jatavallabhula, Franziska Meier

机构 * Fundamental AI Research (FAIR), Meta(基础人工智能研究(FAIR),Meta公司) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 机器人基础模型 :world model(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 研究针对预训练视觉语言动作(VLA)策略在部署时分布偏移的问题,提出DREAMSTEER框架,利用潜在世界模型和价值模型引导策略,无需微调或修改参数,提升了任务成功率和指令遵循准确率。

Comments 19 pages, 12 figures. Project page: https://dream-steer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24182 2026-07-07 cs.RO 版本更新 83%

$M^2$-VLA: Boosting Vision-Language Models for Generalizable Manipulation via Layer Mixture and Meta-Skills

$M^2$-VLA:通过层混合与元技能提升视觉语言模型的通用操控能力

Siyao Xiao, Yuhong Zhang, Zhifang Liu, Zihan Gao, Jingye Zhang, Sinwai Choo, Dake Zhong, Mengzhe Wang, Xiao Lin, Xianfeng Zhou, Jia Jia, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,清华大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) College of Intelligent Robotics and Advanced Manufacturing, Fudan University, Shanghai, China(智能机器人与先进制造学院,复旦大学,上海,中国) Synapath

专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出$M^2$-VLA,通过层混合和元技能模块提升视觉语言模型在机器人操控中的泛化能力,实验验证了其在模拟和现实环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30613 2026-06-30 cs.RO 83%

Sequential Planning via Anchored Robotic Keypoints

基于锚定机器人关键点的顺序规划

Bryce Grant, Aryeh Rothenberg, Logan Senning, Zonghe Chua, Zach Patterson, Peng Wang

机构 * Department of Electrical, Computer, and Systems Engineering(电气、计算机与系统工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 提出SPARK,一种无训练神经符号操作系统,通过单一Gemini调用生成类型化行为树,结合SAM3的替代提示检测和恢复循环,在LIBERO-PRO上达到43.7%,超越CaP-Agent0和VLA基线。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09337 2026-06-17 cs.RO 版本更新 83%

TORL-VLA: Tactile Guided Online Reinforcement Learning for Contact-Rich Manipulation

TORL-VLA:触觉引导的在线强化学习用于接触丰富操作

Huaihang Zheng, Yi Yang, Kai Ma, Shenglin Xu, Tian Xie, Guozheng Li, Xiangyu Wang, Yiren Ma, Si Liu, Yinian Mao, Baoxu Liu

机构 * Meituan(美团) Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学) State Key Lab of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS(中国科学院自动化研究所多模态人工智能系统国家重点实验室) China University of Mining and Technology (Beijing)(中国矿业大学(北京))

专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出TORL-VLA框架,结合触觉反馈与在线强化学习,通过触觉导出的力矩感知VLA预测参考动作,并利用轻量在线RL模块优化动作,解决接触条件变化时的策略适应问题,在长时接触任务中提升成功率和执行效率。

Comments Project page: https://torl-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05773 2026-06-05 cs.RO 83%

PiL-World: A Chunk-Wise World Model for VLA Policy-in-the-Loop Evaluation

PiL-World: 用于VLA策略环内评估的块式世界模型

Chong Ma, Taiyi Su, Jian Zhu, Jianjun Zhang, Zitai Huang, Yi Xu, Hanli Wang

机构 * Tongji University(同济大学) AIRC, Midea Group(美的集团人工智能研究院)

专题命中 机器人基础模型 :world model(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 提出PiL-World,一种块式世界模型,通过交替VLA推理和世界模型预测实现闭环评估,无需真实机器人执行,显著降低成功率估计误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13255 2026-04-27 cs.RO 83%

Policy Contrastive Decoding for Robotic Foundation Models

基于机器人基础模型的策略对比解码

Shihan Wu, Xu Luo, Ji Zhang, Junlin Xie, Jingkuan Song, Heng Tao Shen, Lianli Gao

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Southwest Jiaotong University(西南交通大学) Tongji University(同济大学)

专题命中 机器人基础模型 :robotic(title,abstract);robot policy(abstract);分类 cs.RO

AI总结 本文提出Policy Contrastive Decoding方法,通过对比原始与物体遮挡的视觉输入,提升机器人策略的泛化能力,实验表明其在仿真和现实环境中均有效。

Comments ICLR 2026. Project website: https://koorye.github.io/PCD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21531 2026-02-26 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 83%

LiLo-VLA: Compositional Long-Horizon Manipulation via Linked Object-Centric Policies

LiLo-VLA:通过链接的对象为中心策略实现组合长周期操控

Yue Yang, Shuo Cheng, Yu Fang, Homanga Bharadhwaj, Mingyu Ding, Gedas Bertasius, Daniel Szafir

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 LiLo-VLA通过链接的对象为中心策略实现长周期操控,通过模块化框架实现零样本泛化,提升机器人任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19859 2026-01-30 cs.RO 83%

Unifying Perception and Action: A Hybrid-Modality Pipeline with Implicit Visual Chain-of-Thought for Robotic Action Generation

统一感知与行动:一种融合模态的管道,具有隐式视觉推理链的机器人行动生成

Xiangkai Ma, Lekai Xing, Han Zhang, Wenzhong Li, Sanglu Lu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 VITA通过融合视觉和动作的共享潜在空间,实现机器人行动生成的统一感知与行动,提升了多个任务的成功率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25122 2025-10-30 cs.RO 83%

NanoVLA: Routing Decoupled Vision-Language Understanding for Nano-sized Generalist Robotic Policies

Jiahong Chen, Jing Wang, Long Chen, Chuwei Cai, Jinghui Lu

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Alberta(阿尔伯塔大学) Xiaomi EV(小米电动车) Northeastern University(东北大学)

专题命中 机器人基础模型 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19958 2025-08-29 cs.RO 83%

Long-VLA: Unleashing Long-Horizon Capability of Vision Language Action Model for Robot Manipulation

Yiguo Fan, Pengxiang Ding, Shuanghao Bai, Xinyang Tong, Yuyang Zhu, Hongchao Lu, Fengqi Dai, Wei Zhao, Yang Liu, Siteng Huang, Zhaoxin Fan, Badong Chen, Donglin Wang

专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

Comments Accepted to CoRL 2025; Github Page: https://long-vla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11827 2025-04-17 cs.RO 83%

Towards Forceful Robotic Foundation Models: a Literature Survey

William Xie, Nikolaus Correll

专题命中 机器人基础模型 :robotic(title);manipulation(abstract);robot foundation model(abstract);分类 cs.RO

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12963 2024-07-03 cs.RO cs.AI cs.CL cs.CV cs.LG 83%

AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents

Michael Ahn, Debidatta Dwibedi, Chelsea Finn, Montse Gonzalez Arenas, Keerthana Gopalakrishnan, Karol Hausman, Brian Ichter, Alex Irpan, Nikhil Joshi, Ryan Julian, Sean Kirmani, Isabel Leal, Edward Lee, Sergey Levine, Yao Lu, Isabel Leal, Sharath Maddineni, Kanishka Rao, Dorsa Sadigh, Pannag Sanketi, Pierre Sermanet, Quan Vuong, Stefan Welker, Fei Xia, Ted Xiao, Peng Xu, Steve Xu, Zhuo Xu

专题命中 机器人基础模型 :robotic(title);robot learning(abstract);分类 cs.RO、cs.AI、cs.CV

Comments 26 pages, 9 figures, ICRA 2024 VLMNM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15840 2026-05-11 cs.RO cs.CV 82%

Large Video Planner Enables Generalizable Robot Control

大视频规划器实现通用机器人控制

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Harvard(哈佛大学)

专题命中 机器人基础模型 :robotics(abstract);robot learning(abstract);robot foundation model(abstract);robotic(abstract)

AI总结 本文提出利用大规模视频预训练构建通用机器人基础模型,通过生成视频计划实现跨任务和环境的泛化控制,并在真实机器人上验证了其可行性。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08464 2025-10-10 cs.RO cs.LG 82%

Don't Run with Scissors: Pruning Breaks VLA Models but They Can Be Recovered

Jason Jabbour, Dong-Ki Kim, Max Smith, Jay Patrikar, Radhika Ghosal, Youhui Wang, Ali Agha, Vijay Janapa Reddi, Shayegan Omidshafiei

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06836 2026-06-08 cs.RO cs.AI cs.CV 新提交 82%

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

像飞行员一样思考:细粒度长时程无人机导航

Xiangyi Zheng, Xiangyu Wang, Qinan Liao, Zimu Tang, Yue Liao, Dongyue Lyu, Guodong Wang, Junjie Liu, Si Liu

机构 * Colab Beihang University(北航) Meituan(美团) National University of Singapore(新加坡国立大学)

专题命中 机器人基础模型 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出FLIGHT基准和FLIGHT VLA异步架构,通过低频飞行员推理VLM与高频扩散动作模型解耦,实现无人机长时程语义指令下的平滑连续飞行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03941 2026-07-07 cs.RO 新提交 81%

WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control

WSA$_1$:用于可泛化机器人控制的以3D为中心的世界-空间-动作模型

Jiahao Jiang, Jianing Zhang, Zhenhan Yin, Ruidong Chen, Sen Wang, Zhaoshu Yu, Pengpeng Zeng, Xiaofeng Cao, Xuanhan Wang, Jingkuan Song, Heng Tao Shen

机构 * Tongji University(同济大学) Shanghai Innovation Institution(上海创新机构) Shanghai Magic(上海魔星) Koala Uran Project(考拉铀项目)

专题命中 机器人基础模型 :embodied AI(abstract);manipulation(abstract);robot foundation model(abstract);robotic(abstract)

AI总结 研究针对当前机器人基础模型缺乏物理动力学推理等问题,提出以3D为中心的世界-空间-动作建模范式构建WSA$_1$模型,能学习3D世界感知视觉思维并建模约束,提升泛化能力且数据高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02501 2026-08-11 cs.RO cs.CV cs.OS 版本更新 81%

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

Embodied.cpp:面向异构机器人的具身AI模型可移植推理运行时

Ling Xu, Borui Li, Hao Wu, Chuyu Han, Xiangyu Li, Mohan Hua, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang

机构 * Southeast University(东南大学) Nanjing University(南京大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 机器人基础模型 :embodied AI(title,abstract);分类 cs.RO、cs.CV

AI总结 提出Embodied.cpp,一个基于C++的可移植推理运行时,通过五层架构支持多速率执行、延迟优先融合推理和可扩展接口,在异构机器人上高效部署VLA和世界动作模型。

Comments 18 pages, 2 figures, Project website: https://github.com/SEU-PAISys/Embodied.cpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01690 2026-08-04 cs.RO cs.AI 新提交 81%

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

ProtoAct:将湿实验室协议转化为具身机器人动作

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

专题命中 机器人基础模型 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05122 2026-07-07 cs.CV cs.RO 新提交 81%

Green for Go, Red for No: Visual Grounding via Semantic Segmentation for VLA Navigation Policies

绿色代表可行,红色代表不可行:通过语义分割实现视觉基础以用于VLA导航策略

Adrian Szvoren, Dimitrios Kanoulas, Nilufer Tuptuk

专题命中 机器人基础模型 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究VLA导航策略的视觉基础,提出基于实时分割的方法,用SegFormer突出可通行与不可通行区域,评估两种变体,结果表明视觉基础可降误差,对长指令效果更佳,还能作为轨迹长度正则化器。

Comments Accepted for RSS 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06904 2026-06-11 cs.RO cs.CV 版本更新 81%

ActionMap: Robot Policy Learning via Voxel Action Heatmap

ActionMap: 基于体素动作热图的机器人策略学习

Pei Yang, Hai Ci, Yanzhe Chen, Qi Lv, Han Cai, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) NVIDIA(英伟达)

专题命中 机器人基础模型 :robot policy(title);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 提出ActionMap,一种将动作空间建模为体素热图的动作解码器,替代现有VLA模型中的单点预测器,在LIBERO仿真和真实Franka操作中提升性能和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00515 2026-06-02 cs.RO cs.AI cs.SY eess.SY 81%

PaCo-VLA: Passivity-Shielded Compliance Prior for Contact-Rich Vision-Language-Action Manipulation

PaCo-VLA: 用于富接触视觉-语言-动作操控的被动屏蔽柔顺先验

Haofan Cao, Zhaoyang Li, Zhichao You, Liang Guo, Tianrui Li

机构 * Southwest Jiaotong University(西南交通大学) University of Leeds(莱斯特大学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出PaCo-VLA框架,通过被动屏蔽将VLA模型输出转化为任务级柔顺建议,并利用能量罐和边界检查防止无效预测绕过底层接触物理,实现安全精确的富接触操控。

Comments Under review, code will be available soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12090 2026-05-13 cs.RO cs.CL cs.CV 81%

World Action Models: The Next Frontier in Embodied AI

世界动作模型:具身AI的下一个前沿

Siyin Wang, Junhao Shi, Zhaoyang Fu, Xinzhe He, Feihong Liu, Chenchen Yang, Yikang Zhou, Zhaoye Fei, Jingjing Gong, Jinlan Fu, Mike Zheng Shou, Xuanjing Huang, Xipeng Qiu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 机器人基础模型 :embodied AI(title);world model(abstract);分类 cs.RO、cs.CV

AI总结 本文探讨了具身AI中的世界动作模型(WAMs),通过整合环境动态预测模型,统一预测状态建模与动作生成,提出结构化分类体系并分析数据生态,为该领域提供系统性综述。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11114 2026-05-13 cs.RO cs.AI 81%

SEVO: Semantic-Enhanced Virtual Observation for Robust VLA Manipulation via Active Illumination and Data-Centric Collection

SEVO:语义增强的虚拟观察用于通过主动照明和数据导向收集的鲁棒VLA操作

Tianchonghui Fang, Yuan Zhuang, Fei Miao

机构 * School of Computing, University of Connecticut(康奈尔大学计算学院)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 SEVO通过主动照明和数据导向收集提升跨环境操作鲁棒性,采用三机制改进观察,实现95%和83%的成功率,在新环境中转移率达85%和75%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07288 2026-05-11 cs.CV cs.AI 81%

Sword: Style-Robust World Models as Simulators via Dynamic Latent Bootstrapping for VLA Policy Post-Training

Sword: 通过动态潜在自举实现风格鲁棒的世界模型作为模拟器用于VLA策略后训练

Jiaxuan Gao, Yongjian Guo, Zhong Guan, Wen Huang, Wanlun Ma, Xi Xiao, Junwu Xiong, Sheng Wen

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Swinburne University of Technology(西敏大学) JDT AI Infra(JDT AI基础设施)

专题命中 机器人基础模型 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 本文提出Sword框架,通过结构引导的风格增强和动态潜在自举提升VLA模型在特定环境中的泛化能力、生成质量和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24086 2026-04-28 cs.RO cs.AI 81%

AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation

AsyncShield: 一种异步云边协同的边缘适配器用于异步云边VLA导航

Kai Yang, Zedong Chu, Yingnan Guo, Zhengbo Wang, Shichao Xie, Yanfen Shen, Xiaolong Wu, Xing Li, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团地图部门) Beijing Jiaotong University(北京交通大学)

专题命中 机器人基础模型 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出AsyncShield,通过确定性物理白盒空间映射替代传统黑盒时间序列预测,解决云边异步导航中时空对齐问题,提升导航鲁棒性和安全性。

Comments 9 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17834 2026-04-28 cs.RO cs.AI 81%

Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control

生成控制作为优化:用于自适应和鲁棒机器人控制的时间无条件流匹配

Zunzhe Zhang, Runhan Huang, Yicheng Liu, Shaoting Zhu, Linzhan Mou, Hang Zhao

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院) Department of Computer Science, Princeton University, New Jersey, US(普林斯顿大学计算机科学系) Galaxea Inc., Beijing, China(Galaxea公司)

专题命中 机器人基础模型 :robotic(title,abstract);分类 cs.RO、cs.AI

AI总结 GeCO通过将动作合成转化为迭代优化,解决了传统流匹配在状态复杂度上计算效率低的问题,实现了自适应的计算分配和无监督的安全检测。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15483 2026-04-28 cs.LG cs.RO 81%

$π_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities

$π_{0.7}$: 一种可定向的通用机器人基础模型与涌现能力

Physical Intelligence, Bo Ai, Ali Amin, Raichelle Aniceto, Ashwin Balakrishna, Greg Balke, Kevin Black, George Bokinsky, Shihao Cao, Thomas Charbonnier, Vedant Choudhary, Foster Collins, Ken Conley, Grace Connors, James Darpinian, Karan Dhabalia, Maitrayee Dhaka, Jared DiCarlo, Danny Driess, Michael Equi, Adnan Esmail, Yunhao Fang, Chelsea Finn, Catherine Glossop, Thomas Godden, Ivan Goryachev, Lachlan Groom, Haroun Habeeb, Hunter Hancock, Karol Hausman, Gashon Hussein, Victor Hwang, Brian Ichter, Connor Jacobsen, Szymon Jakubczak, Rowan Jen, Tim Jones, Gregg Kammerer, Ben Katz, Liyiming Ke, Mairbek Khadikov, Chandra Kuchi, Marinda Lamb, Devin LeBlanc, Brendon LeCount, Sergey Levine, Xinyu Li, Adrian Li-Bell, Vladislav Lialin, Zhonglin Liang, Wallace Lim, Yao Lu, Enyu Luo, Vishnu Mano, Nandan Marwaha, Aikys Mongush, Liam Murphy, Suraj Nair, Tyler Patterson, Karl Pertsch, Allen Z. Ren, Gavin Schelske, Charvi Sharma, Baifeng Shi, Lucy Xiaoyang Shi, Laura Smith, Jost Tobias Springenberg, Kyle Stachowicz, Will Stoeckle, Jiaming Tang, Jimmy Tanner, Shalom Tekeste, Marcel Torne, Kyle Vedder, Quan Vuong, Anna Walling, Haohuan Wang, Jason Wang, XuDong Wang, Chris Whalen, Samuel Whitmore, Blake Williams, Charles Xu, Sukwon Yoo, Lili Yu, Wuming Zhang, Zhuoyang Zhang, Ury Zhilinsky

机构 * Physical Intelligence

专题命中 机器人基础模型 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 $π_{0.7}$通过多样化的上下文条件训练,实现跨环境任务执行与零样本泛化,支持多阶段任务和复杂操作,如咖啡机操作,性能媲美专门强化学习微调模型。

Comments Website: https://www.pi.website/blog/pi07

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18791 2026-04-22 cs.LG cs.AI 81%

HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation

HELM:增强型长时程记忆用于视觉-语言-动作操控

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.AI、cs.LG

AI总结 HELM通过解决记忆、验证和恢复三大缺陷,提升长时程视觉-语言-动作任务性能,其核心贡献是学习的State Verifier在任务成功率上显著优于传统方法。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏