arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-06-29 至 2026-06-29 共收录 48 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2606.25939 2026-06-29 cs.RO 新提交 79%

DeformGen: Dynamics-Based Topology Augmentation for Deformable Manipulation Policy Learning

DeformGen: 基于动力学的拓扑增强用于可变形操作策略学习

Zili Lin, Wenyao Zhang, Yuyang Zhang, Zekun Qi, Junyan Lin, Hanxin Zhu, Jiaolong Yang, Zhibo Chen, Yao Mu, Xiaokang Yang, Xin Jin, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Microsoft Research(微软研究院)

专题命中 机器人学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出DeformGen框架,通过局部物理扰动和动力学前向模拟生成拓扑一致的可变形状态,并利用变形场扭曲转移操作轨迹,联合增强状态分布与操作行为,提升可变形操作策略学习。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 11 篇

2606.28128 2026-06-29 cs.CV cs.AI cs.RO 新提交 90%

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

PhysisForcing:面向机器人操作的物理增强世界模拟器

Peiwen Zhang, Yufan Deng, Shangkun Sun, Juncheng Ma, Duomin Wang, Jonas Du, Zilin Pan, Ye Huang, Hao Liang, Songyan Huang, Ruihua Zhang, Enze Xie, Ming-Yu Liu, Daquan Zhou

机构 * Peking University(北京大学) NVIDIA(英伟达)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对视频生成模型在机器人操作模拟中物理不稳定的问题,提出PhysisForcing框架,通过像素级轨迹对齐和语义级关系对齐损失联合优化,显著提升物理一致性,在多个基准上改进基础模型,并提高下游策略成功率。

Comments Github: https://github.com/DAGroup-PKU/PhysisForcing Project website: https://dagroup-pku.github.io/PhysisForcing.github.io/#

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28133 2026-06-29 cs.RO cs.CV 新提交 84%

Translation as a Bridging Action: Transferring Manipulation Skills from Humans to Robots

翻译作为桥接动作:将操作技能从人类迁移到机器人

Sijin Chen, Kaixuan Jiang, Haixin Shi, Yanhui Wang, Weiheng Zhong, Haosheng Li, Bo Jiang, Yuxiao Liu, Xihui Liu

机构 * HKU-MMLab(香港大学多媒体实验室) ByteDance Seed(字节跳动Seed)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);分类 cs.RO、cs.CV

AI总结 提出以相对手腕平移作为桥接动作表示,结合π₀类视觉-语言-动作模型,从人类数据中迁移操作技能到双臂平行夹爪机器人,有效提升迁移效果并随数据量扩展。

Comments Project Page: https://translation-as-a-bridging-action.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28323 2026-06-29 cs.RO cs.AI cs.CV cs.LG 新提交 83%

DexCompose: Reusing Dexterous Policies for Multi-Task Manipulation with a Single Hand

DexCompose: 利用单只手复用灵巧策略进行多任务操作

Dihong Huang, Zhenyu Wei, Zhuxiu Xu, Yunchao Yao, Sikai Li, Mingyu Ding

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出DexCompose框架,通过手指级动作所有权和双残差模块,解决灵巧操作中多任务组合时的冲突问题,在16个复合任务上平均成功率达77.4%。

Comments Project page: https://devon018.github.io/DexCompose-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28192 2026-06-29 cs.RO 新提交 83%

PA-BiCoop: A Primary-Auxiliary Cooperative Framework for General Bimanual Manipulation

PA-BiCoop: 一种通用双臂操作的主辅协作框架

Bai Qicheng, Wang Ziru, Ma Teli, Dai Guang, Wang Jingdong, Wang Mengmeng

机构 * SGIT AI Lab, State Grid Corporation of China(国家电网公司SGIT人工智能实验室) The Hong Kong University of Science and Technology, Guangzhou(香港科技大学(广州)) Baidu Research, Beijing, China(百度研究院) Zhejiang University of Technology, Hangzhou(浙江工业大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出PA-BiCoop框架,通过动态主辅臂角色分配和共享编码器-双解码器结构,实现双臂协调操作,在仿真和真实任务中平均性能提升超48%。

Comments ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27676 2026-06-29 cs.RO 新提交 79%

CWI: Composite Humanoid Whole-Body Imitation System for Loco-manipulation

CWI: 复合型人形机器人全身模仿系统用于移动操作

Wenqi Ge, Junde Guo, Zhen Fu, Shunpeng Yang, Jiayu Chen, Hua Chen

机构 * LimX Dynamics The University of Hong Kong(香港大学) School of Automation and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学自动化与智能制造学院) Hong Kong University of Science and Technology(香港科技大学) ZJU-UIUC Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出CWI框架,通过解耦上下半身动作捕捉数据,结合对抗性运动先验和多评论家架构,实现人形机器人稳定移动与灵巧操作的全身协调控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27566 2026-06-29 cs.RO 新提交 70%

Spacecraft Fiducial Marker for Autonomous Rendezvous, Proximity Operations, and Docking

用于自主交会、近距离操作和对接的航天器基准标记

Ravi Kumar Thakur, Matouš Vrba, Martin Saska

机构 * Department of Cybernetics, Faculty of Electrical Engineering, Czech Technical University in Prague(捷克理工大学电气工程学院控制论系)

专题命中 机器人操作 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 针对现有基准标记在近距离操作中易丢失的问题,提出基于Spidron递归自相似图案的AstraTag标记,结合GRS编码和TPS重映射,在曲面航天器上实现更高检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28104 2026-06-29 cs.CV cs.LG 新提交 62%

Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training

跨视角多模态视觉评估框架用于中医康复训练

Francis Xiatian Zhang, Hao Yao, Shengxuan Chen, Hong Zhu, Hongxiao Jia, Sisi Zheng, Hubert P. H. Shum

机构 * Department of Computer Science, Durham University(杜伦大学计算机科学系) Institute for Regeneration and Repair, The University of Edinburgh(爱丁堡大学再生与修复研究所) Ningbo Hospital of Traditional Chinese Medicine(宁波市中医院) Department of Rehabilitation Medicine, The Gulou Hospital of Traditional Chinese Medicine(南京市鼓楼区中医院康复医学科)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 提出跨视角多模态视觉评估框架CME-AQA,融合视觉-姿态信息,利用第一人称和第三人称视频提升推理鲁棒性,在中医康复训练动作质量评估中取得优于基线10%的加权F1提升。

Comments Published in IEEE Transactions on Neural Systems and Rehabilitation Engineering, 2026

Journal ref IEEE Transactions on Neural Systems and Rehabilitation Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27581 2026-06-29 cs.RO cs.AI 新提交 62%

SceneBot: Contact-Prompted General Humanoid Whole Body Tracking with Scene-Interaction

SceneBot: 接触提示的通用人形全身跟踪与环境交互

Sirui Chen, Shibo Zhao, Zhen Wu, Jiaman Li, Guanya Shi, C. Karen Liu

机构 * Stanford(斯坦福大学) Amazon FAR(亚马逊 FAR) CMU(卡内基梅隆大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出SceneBot框架,通过接触标签和事后场景重建,统一处理自由空间运动、地形穿越和全身操作,实现复杂长时任务。

Comments 15 pages 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28270 2026-06-29 cs.AI cs.MA 新提交 57%

Agent-Native Immune System: Architecture, Taxonomy, and Engineering

智能体原生免疫系统:架构、分类与工程

Bo Shen, Lifeng Chang, Tianyuan Wei, Yunpeng Li, Feng Shi, Yichen Han, Peijie Gao, Shiyi Kuang, Xin Chang, Dehui Li

机构 * Novo Ordo for AI

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 提出智能体原生免疫系统(ANIS),一种嵌入智能体认知循环的生物启发式内生防御架构,通过六层免疫塔、统一病毒疫苗分类和元认知自动化骨干实现运行时动态防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27773 2026-06-29 cs.CV 新提交 57%

ModaFlow: Modality-Aware Flow Matching for High-Fidelity Virtual Try-On

ModaFlow: 模态感知流匹配实现高保真虚拟试穿

Xiangyu Sai, Meysam Madadi, Sergio Escalera, Yong Xu

机构 * South China University of Technology(华南理工大学) Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Guangdong Provincial Key Laboratory of Multimodal Big Data Intelligent Analysis(广东省多模态大数据智能分析重点实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 提出ModaFlow框架,通过模态感知引导、正则化损失和掩码操作策略,在虚拟试穿中实现衣物细节与人体几何的精确对齐,FID降低约30%。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27928 2026-06-29 hep-th hep-ph physics.comp-ph 新提交 50%

$\texttt{SMaSH}$ : Simplify Massive Spinor Helicity

$\ exttt{SMaSH}$: 简化大规模旋量螺旋度

Aakash Kumar, Arnab Rudra, Rahul Shaw

专题命中 机器人操作 :manipulation(abstract)

AI总结 提出SMaSH,一个Mathematica包,用于四维时空中的旋量螺旋度计算,支持有质量粒子、显式小群指标、离壳变量,并集成高能极限、离散对称性检查、接触项和规范不变性验证。

Comments 136 pages, 1 figure. Mathematica files are included in the ancillary file. Github link for the package is https://github.com/aakash-kmr/SMaSH

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 8 篇

2606.27871 2026-06-29 cs.RO 新提交 83%

LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

LocalNav: 蒸馏前沿视觉语言模型与具身强化学习用于设备端物体目标导航

Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno

机构 * Center for Project-Based Learning(项目学习中心) Integrated Systems Laboratory(集成系统实验室)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 提出蒸馏策略将大型VLM的空间语义推理迁移至轻量级本地VLM,结合E-RLVR与令牌生成正则化,在嵌入式设备上实现低延迟物体目标导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27929 2026-06-29 cs.RO 新提交 81%

When Multi-Robot Systems Meet Agentic AI:Towards Embodied Collective Intelligence

当多机器人系统遇见智能体AI:迈向具身集体智能

Yuxuan Yan, Yuanyuan Jia, Qianqian Yang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息与电子工程学院)

专题命中 具身导航 :robotics(abstract);embodied AI(abstract);embodied agent(abstract);navigation(abstract)

AI总结 本文提出具身集体智能(ECI)范式,通过共感知、共行动和共演化使机器人团队共享世界上下文、任务进度和技能经验,并以导航实验验证共享世界记忆继承的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27783 2026-06-29 q-bio.NC cs.LG cs.NE 新提交 57%

CANNs: A Toolkit for Research on Continuous Attractor Neural Networks

CANNs:连续吸引子神经网络研究工具包

Sichao He, Aiersi Tuerhong, Shangjun She, Tianhao Chu, Yuling Wu, Junfeng Zuo, Si Wu

机构 * School of Psychological and Cognitive Sciences, Peking–Tsinghua Center for Life Sciences, PKU-IDG/McGovern Institute for Brain Research, Center of Quantitative Biology(心理与认知科学学院,北京清华大学生命科学中心,北京大学IDG/麦克戈文脑科学研究院,定量生物学中心)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 提出统一连续吸引子神经网络(CANN)研究流程的开源工具包,包含Python库、Rust加速后端和吸引子结构分析器,支持从仿真到实验数据分析的完整工作流。

Comments Code: https://github.com/Routhleck/canns ; Rust backend: https://github.com/Routhleck/canns-lib

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27964 2026-06-29 cs.CV 新提交 57%

Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control

Directing the World: 具有组合式人体-相机控制的快速自回归视频生成

Haoyuan Wang, Yabo Chen, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

专题命中 具身导航 :world model(abstract);分类 cs.CV

AI总结 提出一种快速自回归框架,通过解耦控制学习并保持统一视频先验,实现人体运动和相机轨迹的组合控制,支持稳定长程生成与高视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27897 2026-06-29 cs.CV cs.HC 新提交 57%

A Multi-Attribute Latent Space for Visual Analysis of Watches

用于手表视觉分析的多属性潜在空间

Kai Lawonn, Tobias Günther, Monique Meuschke

机构 * Leipzig University(莱比锡大学) ScaDS.AI Dresden/Leipzig(ScaDS.AI 德累斯顿/莱比锡) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔兰根-纽伦堡弗里德里希-亚历山大大学) Otto von Guericke University of Magdeburg(马格德堡奥托·冯·格里克大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 提出一种多属性潜在空间模型与交互式可视化系统,通过分离表盘颜色、设计等属性图并融合UMAP,支持手表集合的开放式探索与比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27656 2026-06-29 eess.SY cs.RO cs.SY 新提交 57%

Characterizing Driver Interactions with Autonomous Vehicles via Response Maps

通过响应图刻画驾驶员与自动驾驶车辆的交互

Dave Broaddus, Rachel DiPirro, Chishang, Yang, Dan Calderone, Wendy Ju, Meeko Oishi

机构 * University of New Mexico(新墨西哥大学) Cornell Tech(康奈尔科技)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文基于博弈论中的响应图概念,利用驾驶模拟器数据线性表示驾驶员行为,发现驾驶员加速行为可被响应图捕获,且对自动驾驶车辆的让行、不让行和响应行为有显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23959 2026-06-29 cs.CL cs.LG 新提交 57%

Does My Embedding Reflect That $A = B$? Evaluating Mathematical Equivalence in Embedding Models

我的嵌入是否反映了 $A = B$?评估嵌入模型中的数学等价性

Jiaying Ye, Samarth Rao, Leo Carlin, Kedar Chintalapati, Saharsh Bhargava, Rachit Jaiswal, Michael Zhou, Jared Darlington, Jiahe Lu, Jarod Alper, Vasily Ilin, Henry Kvinge

机构 * University of Washington(华盛顿大学) Axiom Math Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 针对当前嵌入模型无法识别数学等价陈述的问题,提出MELD数据集和对比学习方法,使嵌入能对齐不同形式化的数学表述。

Comments 18 pages, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27865 2026-06-29 cs.IR 新提交 50%

From Bootstrapping to Sequence Modeling: A Unified Generative Framework for Personalized Landing-Page Modeling

从引导到序列建模:个性化落地页建模的统一生成框架

Fan Li, Chang Meng, Jiaqi Fu, Shuchang Liu, Tianke Zhang, Xueliang Wang, Xiaoqiang Feng, Yongqi Liu, Kaiqiao Zhan

专题命中 具身导航 :navigation(abstract)

AI总结 针对现有强化学习方法在个性化落地页建模中的马尔可夫假设局限和时序差分学习误差累积问题,提出基于决策变换器的统一生成框架GLAN,通过全局-局部视角建模用户跨日消费动态和会话级细粒度信号,在快手平台上线后DAU和用户生命周期分别提升0.158%和0.108%。

Comments arXiv admin note: text overlap with arXiv:2507.23459

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 5 篇

2606.27575 2026-06-29 cs.CV 新提交 85%

Perceptual 3D Simulation With Physical World Modeling

基于物理世界建模的感知3D仿真

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);manipulation(abstract);分类 cs.CV

AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28127 2026-06-29 cs.CL cs.AI cs.LG 新提交 81%

From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond

从令牌到状态:LLM作为世界模型的特例及其连续路径

Paul Dubois

机构 * Paul Dubois(保罗·杜博伊斯)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文论证LLM是世界模型的退化特例,并提出从NTP到JEPA的连续谱系,逐步放松LLM约束,同时探讨其可扩展性挑战。

Comments 10 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27681 2026-06-29 cs.LG cs.CL 新提交 79%

Textual Belief States for World Models: Identifiable Representation Learning Under Strict Mediation

用于世界模型的文本信念状态:严格中介下的可识别表示学习

Xiang Gao, Kaiwen Dong, Yuguang Yao, Padmaja Jonnalagedda, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出严格中介原则解决LLM中历史旁路导致的潜在状态不可识别问题,引入离散文本潜在状态和因子化GRPO方法,在TextWorld和ScienceWorld上实现表示质量和滚动性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27644 2026-06-29 cs.CV 新提交 79%

CascadeOcc: Rethinking 3D Occupancy World Models with Cascaded VQ Representations

CascadeOcc: 用级联VQ表示重新思考3D占用世界模型

Kyumin Hwang, Wonhyeok Choi, Jaeyeul Kim, Jihun Park, Daehee Park, Sunghoon Im

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 提出CascadeOcc,一种通过级联向量量化机制在自回归框架中利用占用表示内在结构层次,实现从粗到细的3D场景预测和运动规划,在4D占用预测和运动规划基准上取得优越性能。

Comments Accepted to IEEE Signal Processing Letters (SPL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26964 2026-06-29 cs.AI cs.CV 新提交 73%

Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds

Look-Before-Move:动态3D故事世界中的叙事驱动世界视觉注意力

Jiaming Bian, Bingliang Li, Yuehao Wu, Pichao Wang, Zhi Wang, Hailan Ma, Huadong Mo, Zhenhong Sun

专题命中 具身推理 :embodied AI(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 提出Look-Before-Move框架,通过语义观察合约、蒙特卡洛视点搜索和语义轨迹接地,在动态3D故事世界中实现叙事驱动的视觉注意力规划,提升主体感知、意图一致性和轨迹质量。

Comments 25 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 6 篇

2606.27872 2026-06-29 cs.RO cs.AI 新提交 84%

S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation

S$^2$-VLA:面向长时程操作的基于状态空间的视觉-语言-动作模型

Zhipeng Xie, Zongyi Han, Xiangyi Wei, Shiliang Sun, Yang Li, Jing Zhao

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院海底科学国家重点实验室)

专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对长时程操作任务中累积误差导致性能下降的问题,提出S$^2$-VLA框架,通过状态空间引导的自适应注意力机制动态融合视觉、语言和动作信息,在LIBERO等基准上超越7B模型。

Comments Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交 84%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 机器人基础模型 :robot foundation model(title);manipulation(abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27755 2026-06-29 cs.RO cs.AI 新提交 73%

Drop-Then-Recovery: How Redundant Are Vision-Language-Action Models?

丢弃-再恢复:视觉-语言-动作模型有多冗余?

Guoheng Sun, Kaixi Feng, Shwai He, Xiaochuan Gong, Yexiao He, Ziyao Wang, Zheyu Shen, Wanghao Ye, Ramana Rao Kompella, Gaowen Liu, Ang Li

机构 * University of Maryland, College Park(马里兰大学帕克分校) Cisco Research(思科研究院)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 通过提出Drop-Then-Recovery分析协议和GateProbe敏感性指标,发现VLA模型中语言骨干高度冗余,而视觉和动作路径对移除更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27807 2026-06-29 cs.RO 新提交 70%

SpikeVLA: Vision-Language-Action Models with Spiking Neural Networks

SpikeVLA:基于脉冲神经网络的视觉-语言-动作模型

Ruiqi Song, Dujun Nie, Siyu Teng, Baiyong Ding, Xiaotong Zhang, Dong Li, Chenming Zhang, Yuchen Li, Hangbin Wu, Long Chen

专题命中 机器人基础模型 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出SpikeVLA,一种脉冲VLA架构,通过事件驱动稀疏计算降低能耗,在导航和机器人控制任务中保持竞争力,适用于低功耗实时具身智能。

Comments Accepted by ICML 2026. 16 pages, 9 figures

Journal ref Proceedings of the 43rd International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27663 2026-06-29 cs.RO 新提交 57%

Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization

直接动作头注入接地3D点实现空间与任务泛化

Shiang-Feng Tsai, Jin-Cheng Jhang, Yen-Ling Tai, Jia-Hong Lai, Shih-Yun Wong, KangTung-Hsu, Yi-Ting Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出轻量级模块,将3D点表示的接地信号通过自适应层归一化直接注入VLA模型的动作头,在LIBERO-PRO上显著提升空间和任务泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏