arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-12 至 2026-06-12 共收录 40 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 16 篇

2606.13677 2026-06-12 cs.RO cs.AI cs.CV cs.LG 新提交 85%

Mana: Dexterous Manipulation of Articulated Tools

Mana: 铰接工具的灵巧操作

Zhao-Heng Yin, Guanya Shi, Pieter Abbeel, C. Karen Liu

机构 * UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) Stanford University(斯坦福大学) Amazon FAR(亚马逊FAR)

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Mana框架,将灵巧操作重解释为动画问题,通过粗到细的流水线自动生成操作轨迹,实现铰接工具的零样本仿真到现实迁移。

Comments Project Page: https://zhaohengyin.github.io/mana

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08765 2026-06-12 cs.RO cs.CV 新提交 84%

RGB-S: Image-Aligned Tactile Saliency for Robust Dexterous Manipulation

RGB-S: 用于鲁棒灵巧操作的图像对齐触觉显著性

Shengcheng Luo, Kefei Wu, Xiaoying Zhou, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

机构 * ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出RGB-S框架,通过正向运动学和相机标定将触觉传感器位置投影到RGB图像平面,生成力调制高斯显著性图,显式对齐触觉与视觉,在严重遮挡下灵巧操作成功率提升26.7个百分点。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13601 2026-06-12 cs.RO cs.SY eess.SY 新提交 83%

MCR-Bionic Hand: Anatomical Structural Priors for Dexterous Manipulation

MCR-Bionic Hand: 用于灵巧操作的解剖结构先验

Haosen Yang, Guowu Wei

机构 * University of Salford(索尔福德大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出MCR-Bionic Hand,一种基于人体手部解剖结构先验的仿生机械手,通过结构智能实现低维控制到灵巧操作的映射,在接触密集型任务中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13279 2026-06-12 cs.RO 新提交 83%

See Selectively, Act Adaptively: Dual-Level Structural Decomposition for Bimanual Robot Manipulation

选择性观察,适应性行动:双水平结构分解用于双臂机器人操作

Yoon-Ji Choi, Young-Chae Son, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出基于双水平结构分解的双臂操作VLA框架,通过视觉选择路由和动作专家混合机制分别处理视觉相关性和双臂交互模式,在模拟和真实任务中成功率分别提升27.7%和43.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13394 2026-06-12 cs.RO 新提交 79%

GeoHAT: Geometry-Adaptive Hybrid Action Transformer for Mobile Manipulation

GeoHAT: 几何自适应混合动作Transformer用于移动操作

Xiangyu Zhu, Renjun Wu, Luzhou Ge, Jinyan Liu, Xuesong Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出GeoHAT框架,通过轻量级傅里叶空间编码器注入几何信息,并采用混合全身动作解码器分解机械臂与基座动作,在ManiSkill-HAB基准上成功率提升23.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13352 2026-06-12 cs.RO 新提交 79%

Low cost, easily manufactured, highly flexible strain and touch sensitive fiber for robotics applications

低成本、易制造、高柔性应变与触觉传感纤维用于机器人应用

Christian Diaz Herrera, Srushti Raste, Simin Liu, Miles Modeste, Jiyang, Yin, Katelyn McCall, Yuxing Jared Yao, Roopkamal Chahal, Simon Chidley, Trung Ha, T. David Westmoreland, Sonia Roberts

机构 * Wesleyan University(卫斯理大学)

专题命中 机器人操作 :robotics(title);robotic(abstract);分类 cs.RO

AI总结 提出一种仅用廉价商用部件和工具快速制造的导电纤维,兼具电阻应变传感和电容触觉传感功能,实验验证其在机器人抓取、姿态估计和近场跟踪中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13232 2026-06-12 cs.RO 新提交 79%

WT-UMI: Tactile-based Whole-Body Manipulation via Force-Supervised Contact-Aware Planning

WT-UMI: 基于触觉的全身操控通过力监督的接触感知规划

Jaehwi Jang, Zhaoyuan Gu, Alfred Cueva, Zimeng Chai, Junjie Sheng, Thong Nguyen, Himank Galundia, Yifan Wu, Huishu Xue, Isaac Legene, Ojas Mediratta, Davin Doan, Andrew Collins, Sarah Sadegh, KyoungMok Kim, Rishita Dhalbisoi, Zun Chen, Ye Zhao

机构 * The Institute for Robotics and Intelligent Machines, Georgia Institute of Technology(机器人与智能机械研究所,佐治亚理工学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出WT-UMI系统,结合人体演示与遥操作数据,通过力监督规划器预测末端执行器位姿和接触力轨迹,并利用触觉导纳控制器提升全身操控性能。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12759 2026-06-12 cs.RO 新提交 79%

Sparse2Act: Learning Action-Aligned Sparse 3D Representations for Cross-Domain Robot Manipulation

Sparse2Act: 学习跨域机器人操作的动作对齐稀疏3D表示

Yu Guo, Chang Yu, Siyu Ma, Yunuo Chen, Yin Yang, Ying Nian Wu, Chenfanfu Jiang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣迭戈分校) University of Utah(犹他大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出Sparse2Act框架,通过动作对齐的掩码稀疏3D编码预训练,实现跨域机器人操作,在LIBERO-10上达86.9%成功率,并支持域迁移和sim-to-real。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13080 2026-06-12 physics.optics 新提交 78%

Intelligent Perception Assisted Light Modulation for real-time and program-free nanofabrication and particle manipulation

智能感知辅助光调制用于实时无编程纳米制造和粒子操控

Weixin Zhu, Hanyu Guo, Chen Zhang, Fang Yang, Ce Zhang, Lijing Zhong, Jianrong Qiu, Kaige Wang, Jintao Bai, Wei Zhao

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 提出智能感知辅助光调制技术,通过实时手势识别与动态空间光调制实现无编程激光束控制,用于纳米制造(最小特征尺寸280 nm)和细胞操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11767 2026-06-12 cs.RO cs.AI 新提交 73%

Blind Dexterous Grasping via Real2Sim2Real Tactile Policy Learning

通过真实到仿真到真实触觉策略学习的盲操作灵巧抓取

Shengcheng Luo, Xiyan Huang, Zhe Xu, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

机构 * ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出一种结合Real2Sim触觉校准、布局感知触觉编码器和触觉条件扩散策略的框架,实现仅依赖触觉的灵巧手盲抓取,在真实机器人上对20个物体达到27%成功率。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12954 2026-06-12 cs.RO 新提交 70%

Towards Reliable Sequential Object Picking in Clutter: The Runner-up Solution to RGMC 2025

面向杂乱环境中的可靠顺序物体抓取:RGMC 2025 亚军方案

Wei Yu, Xidan Zhang, Ziyi Zheng, Weijie Kong, Huixu Dong

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 针对杂乱环境中的顺序物体抓取任务,提出集成硬件-软件流水线,结合多功能夹爪设计与物体分布及遮挡关系新表示,实现高效识别、搜索与顺序抓取,获RGMC 2025亚军。

Comments First, Second and Third Coauthor contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12604 2026-06-12 cs.RO 新提交 70%

EgoEngine: From Egocentric Human Videos to High-Fidelity Dexterous Robot Demonstrations

EgoEngine:从自我中心人类视频到高保真灵巧机器人演示

Yangcen Liu, Shuo Cheng, Xinchen Yin, Woo Chul Shin, Alfred Cueva, Yiran Yang, Zhenyang Chen, Chuye Zhang, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) Tsinghua University(清华大学)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出EgoEngine框架,通过视觉和动作桥接,将自我中心人类视频转化为高保真机器人数据,首次实现零样本灵巧策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10683 2026-06-12 cs.RO cs.AI cs.CV 新提交 67%

UniDexTok: A Unified Dexterous Hand Tokenizer from Real Data

UniDexTok:基于真实数据的统一灵巧手分词器

Dong Fang, Youjun Wu, Yuanxin Zhong, Rui Zhang, Yunlong Wang, Xiaosong Jia, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Hefei University of Technology(合肥工业大学) Rimbot Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出统一灵巧手模型(UDHM)将人手和机器人手状态映射到共享22自由度语义接口,并基于此开发UniDexTok,一种免重定向的状态分词器,学习基于真实关节状态的离散token,实现异构灵巧手的统一表示,误差降低98%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13282 2026-06-12 cs.AI 新提交 57%

ERTS: Adversarial Robustness Testing of Ethical AI via Semantic Perturbation in a Bounded Consequence Space

ERTS: 通过有界后果空间中的语义扰动进行伦理AI的对抗鲁棒性测试

Pratyush Chaudhari

机构 * Pratyush Chaudhari(普拉蒂什·查德哈里)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出伦理鲁棒性测试系统(ERTS),通过有界伦理后果空间、语义扰动和领域自适应评估,测试AI在伦理推理中的对抗鲁棒性,实验表明仅33%模型通过测试。

Comments 8 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12586 2026-06-12 cs.CR 新提交 50%

Beyond Attack Success Rate: Examining Trigger Leakage in Vision-Language Agentic Systems

超越攻击成功率:视觉-语言智能系统中的触发器泄漏研究

Jiamin Chang, Salil Kanhere, Piotr Koniusz, Jason, Xue, Hammond Pearce

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出“触发器泄漏”概念,量化视觉-语言智能系统中后门触发器在视觉或语义相近输入下意外激活隐藏行为的风险,并引入邻域泄漏率(NLR)指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13257 2026-06-12 cond-mat.str-el cond-mat.mes-hall 新提交 50%

Selective stabilization of antiferromagnetic orders in FeTe films via local strain engineering

FeTe薄膜中反铁磁序的局域应变工程选择性稳定

Hao Xu, Jing Jiang, Xuesong Gai, Haicheng Lin, Kai Liu, Zhong-Yi Lu, Kai Chang, Chong Liu

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过扫描隧道显微镜和密度泛函理论计算,发现局域单轴应变可在FeTe薄膜中选择性稳定双共线或二聚体反铁磁序,并首次实验实现长程二聚体反铁磁序。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 9 篇

2606.13494 2026-06-12 cs.RO cs.CV 新提交 84%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12603 2026-06-12 cs.RO cs.AI 新提交 84%

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

从模仿到对齐:面向长距离人行道导航的人类偏好流策略

Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出FlowPilot,一种仅使用单目RGB相机的无地图导航策略,通过锚定流匹配进行预训练,并引入人类偏好学习实现对齐,在长距离人行道导航中提升鲁棒性和社会合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12550 2026-06-12 cs.RO cs.AI 新提交 81%

Foresight: Iterative Reasoning About Clues that Matter for Navigation

Foresight: 关于导航关键线索的迭代推理

Arthur Zhang, Carl Qi, Donne Su, Xiangyun Meng, Amy Zhang, Joydeep Biswas

机构 * UT Austin(德克萨斯大学奥斯汀分校) FieldAI

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 提出Foresight框架,利用微调VLM交替提出和批评图像空间运动计划,通过人类反馈学习奖励模型进行强化学习后训练,实现无地图导航中稀疏语言指令下的迭代运动优化,任务成功率提升37%。

Comments 22 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13190 2026-06-12 cs.RO cs.HC 新提交 79%

Multi-Modal Multi-Agent Robotic Cognitive Alignment enabled by Non-Invasive Consumer Brain Computer Interfaces: A Proof of Concept Exploration

基于非侵入式消费级脑机接口的多模态多智能体机器人认知对齐:概念验证探索

Nataliya Kosmyna, Liz Jenkins, Anoop K. Sinha

机构 * GOOGLE(谷歌) Paradigms of Intelligence(智能范式) Cambridge, MA, United States(马萨诸塞州剑桥市,美国) Mountain View, CA, United States(加利福尼亚州山景城,美国)

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO

AI总结 提出一种框架,利用消费级脑机接口监测脑电信号,在高认知负荷时延迟智能体通信,实现认知对齐的多智能体交互,初步验证了实时信号处理、大语言模型与机器人结合的可行性。

Comments 19 pages, 9 figures, for associated video, see https://youtu.be/0Tav-G87XGs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12579 2026-06-12 cs.RO 新提交 72%

G-MAPP: GPU-accelerated Multi-Agent Planning and Perception for Reactive Motion Generation

G-MAPP: 基于GPU加速的多智能体规划与感知用于反应式运动生成

Tanmay Bishnoi, Riddhiman Laha, Tobias Löw, Jose Alex Chandy, Luis F. C. Figueredo, Sami Haddadin

机构 * Department of Electrical, Computer, and Biomedical Engineering, Toronto Metropolitan University(多伦多都会大学电气、计算机与生物医学工程系) Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所) Institute for Experiential Robotics, Northeastern University(东北大学体验式机器人研究所) Idiap Research Institute(Idiap 研究所) EPFL(瑞士联邦理工学院洛桑) CHART Group at the School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院 CHART 小组) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身导航 :robotics(abstract,journal_ref);world model(abstract);分类 cs.RO

AI总结 提出GPU加速的框架,通过并行状态探索和紧密耦合感知-动作循环,实现非结构化环境中的实时反应式运动生成,在7自由度机器人上达到5倍加速并成功避障。

Comments The implementation is available at: https://github.com/chart-research/g-mapp

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7516-7523, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13488 2026-06-12 cs.CV 新提交 70%

Point-Wise Geometry-Aware Transformer for Partial-to-Full Point Cloud Registration in Computer-Assisted Surgery

面向计算机辅助手术中部分到完整点云配准的点级几何感知Transformer

Siyu Zhou, Zhongliang Jiang

机构 * The Chair for Computer Aided Medical Procedures, Technical University of Munich(慕尼黑工业大学计算机辅助医疗程序教席) The University of Hong Kong(香港大学)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出GAPR-Net,一种结合卷积与Transformer的粗到细框架,通过交叉注意力融合局部与全局信息,并设计变换不变的点级几何特征,在四个骨骼数据集上实现94.2%配准召回率、1.992mm RMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13366 2026-06-12 cs.CV cs.MM 新提交 57%

Dual-Constrained Diffusion Image Compression for Operational Rate-Distortion-Perception Optimization

双约束扩散图像压缩用于操作率失真感知优化

Sanxin Jiang, Jiro Katto, Heming Sun

机构 * Shanghai University of Electric Power(上海电力大学) Waseda University(早稻田大学) Institute of Science Tokyo(东京科学大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 提出DCIC框架,结合学习编解码器和基于扩散的解码器,通过联合失真和等幂约束实现率失真感知帕累托前沿的连续导航,无需额外码率开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12852 2026-06-12 cs.AI 新提交 57%

WISE: A Long-Horizon Agent in Minecraft with Why-Which Reasoning

WISE:具有Why-Which推理的Minecraft长时域智能体

Renmin Cheng, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身导航 :embodied agent(abstract);分类 cs.AI

AI总结 提出WISE框架,通过因果事件图增强情景记忆并解耦what-where-when与which-why推理,结合机会主义任务调度和多尺度探索,显著提升长时域稀疏任务的成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13612 2026-06-12 cs.CR 新提交 50%

Beyond the IT Checklist: Engineering a Reasonable Standard of Care for Cyber Safety

超越IT检查清单:为网络安全设计合理的注意标准

Matthew E. Jablonski, Linton Wells, Kathryn B. Laskey, F. Brett Berlin

专题命中 具身导航 :navigation(abstract)

AI总结 本文通过分析292份关键基础设施政策文件,指出当前以IT合规为中心的网络安全方法不足以应对网络物理系统的安全风险,并提出基于危险特定可追溯性、结构化保证案例和网络弹性工程的现代化注意标准。

Comments 6 pages, 2 figures, Accepted for publication and presentation the Cyber Safety Summit, Washington, D.C., 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 3 篇

2606.12783 2026-06-12 cs.AI 新提交 83%

A Tutorial on World Models and Physical AI

世界模型与物理AI教程

Il-Seok Oh

机构 * Department of Computer Science and Artificial Intelligence/CAIIT, Jeonju, Jeonbuk, South Korea(韩国全北全州计算机科学与人工智能系/CAIIT)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);分类 cs.AI

AI总结 本文提出统一框架,区分显式与隐式世界模型,并探讨其在机器人、自动驾驶等物理AI领域的应用,以及迈向通用人工智能的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12979 2026-06-12 cs.LG 新提交 79%

EPM-JEPA: Operator-Side Experience Modulation in JEPA-Family World Models

EPM-JEPA:JEPA系列世界模型中的算子侧经验调制

Vedant Pandya

机构 * School of Artificial Intelligence and Data Engineering (SAIDE), Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校人工智能与数据工程学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出EPM-JEPA,通过LoRA在权重层面调制预测器,以应对测试时动态偏移;实验表明其优于无记忆基线,但效果弱于预期,并揭示了三种独立动力学过程。

Comments 16 pages, 5 figures, 9 tables, 5 code listings. Pre-registered experimental study with mechanism analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12780 2026-06-12 cs.LG cs.CL 新提交 79%

ProPlay: Procedural World Models for Self-Evolving LLM Agents

ProPlay: 用于自我进化LLM智能体的程序化世界模型

Yijun Ma, Zehong Wang, Yiyang Li, Ziming Li, Xiaoguang Guo, Weixiang Sun, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(圣母大学) University of Connecticut(康涅狄格大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出ProPlay程序化世界模型,通过程序级预演和因果过程图,使LLM智能体在部分可观测环境中自我进化,无需外部监督。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 3 篇

2606.12956 2026-06-12 cs.RO 新提交 79%

SERF: Spatiotemporal Environment and Robot Feature Map for Long-Horizon Mobile Manipulation

SERF:面向长时域移动操作任务的时空环境与机器人特征地图

Sunghwan Kim, Byeonghyun Pak, Kehan Long, Yulun Tian, Nikolay Atanasov

机构 * UC San Diego(加州大学圣地亚哥分校) Agency for Defense Development(国防发展局) SceniX Inc.(SceniX公司) University of Michigan(密歇根大学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 提出SERF地图,将环境与机器人身体表示为共享潜空间中的神经点,并在线更新,作为VLA模型的状态输入,提升长时域移动操作中的推理能力,在BEHAVIOR-1K上优于纯图像基线。

Comments Project page: https://existentialrobotics.org/serf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12859 2026-06-12 cs.RO 新提交 79%

AIR-VLA+: Decoupling Movement and Manipulation via Cascaded Dual-Action Decoders with Asymmetric MoE for Aerial Robots

AIR-VLA+: 通过级联双动作解码器与非对称MoE解耦空中机器人的移动与操作

Jianli Sun, Bin Tian, Qiyao Zhang, Zijian Liu, Yutong Wang, Zhiyong Cui, Bai Li, Yisheng Lv, Yonglin Tian

机构 * The Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) Information Science, East China Normal University(华东师范大学信息科学)

专题命中 机器人基础模型 :manipulation(title,abstract);分类 cs.RO

AI总结 针对空中机器人移动与操作在动作尺度、动力学和控制目标上的显著差异,提出级联双动作解码器与非对称MoE架构,实现解耦协调控制,在AIR-VLA基准上取得48.0平均分,任务完成度提升80.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏