arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-06 至 2026-08-06 共收录 50 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2608.04842 2026-08-06 cs.RO cs.GR 新提交 70%

RORA: Realistic Object Reconstruction with Articulation

RORA:带关节运动的真实物体重建

Hyesung Lee, Youngseon Lee, Kyutae Lee, Dongjun Lee, Yongseok Lee

机构 * Seoul National University(首尔大学) DGIST(大邱庆北科学技术院)

专题命中 机器人学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 本研究提出RORA端到端管线,可从单个静态物体视频输入重建带精确关节运动的仿真就绪资产,在PartNet-Mobility-V0数据集和真实物体上取得良好效果,可用于机器人学习的实时灵巧手操作任务。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 14 篇

2608.04042 2026-08-06 cs.RO 新提交 88%

Kitchen Robotic Manipulation utilizing Foundation Models

基于基础模型的厨房机器人操作

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

机构 * Kumoh National Institute of Technology(金乌国立技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO;robotics(comments)

AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。

Comments Intelligent Service Robotics (ISR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05042 2026-08-06 cs.RO 新提交 83%

BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation

BridgeVLA++:一种面向三维操作的数据高效、可泛化且内存增强的视觉-语言-动作框架

Peiyan Li, Yuze Zhu, Yixiang Chen, Qisen Ma, Yuan Xu, Jiabing Yang, He Guan, Yan Huang, Hongtao Wu, Xiao Ma, Tao Kong, Liang Wang, Tieniu Tan

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FiveAges ByteDance Seed(字节跳动种子实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出内存增强的三维VLA框架BridgeVLA++,通过新增时空记忆架构,在保留原模型数据效率与泛化能力的同时,提升了记忆相关操作性能,且在多任务与真实平台上验证了其有效性。

Comments This work has been submitted to the IEEE TPAMI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04196 2026-08-06 cs.RO cs.CV cs.LG 新提交 82%

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

SiMDex:挖掘相似的自我中心视频以实现跨 embodiment 的灵巧操作

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato

机构 * The University of Tokyo(东京大学) ByteDance Seed(字节跳动 Seed) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 该研究提出SiMDex框架,通过三层流程从海量自我中心人类视频中挖掘与任务相关的子集,用于VLA后训练,仅用少量样本便显著提升了机器人灵巧操作的成功率,证明选择性数据整理更有效。

Comments 12 pages, 4 figures. Project page: https://lin-nie.github.io/SiMDex/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04425 2026-08-06 cs.RO 新提交 79%

SSC: A Verifiable Structured Representation for Bimanual Manipulation Labelling

SSC:用于双手操作标注的可验证结构化表示

Yupu Lu, Shuang Wu, Sihan Chen, Ruihua Han, Yichen Zhang, Marcus Kalander, Jia Pan

机构 * Artificial Intelligence Laboratory (Leibniz)(莱布尼茨人工智能实验室)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 针对操作标注的自然语言难验证、刚性模板过度分割问题,提出SSC结构化表示,在BEHAVIOR-1K上验证其逻辑与内容补全功能,评估13个VL模型并报告标注异常。

Comments 8 main pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04365 2026-08-06 cs.LG cs.CR cs.CY 新提交 79%

Manipulation-Proof Oblivious Audits against Deceptive Model Providers

针对欺骗性模型提供者的防操纵遗忘审计

Augustin Godinot, Sofiane Azogagh, Julien Ferry, Sébastien Gambs

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.LG

AI总结 本文提出新型防操纵遗忘审计协议,利用私有信息检索机制提升审计对模型提供者操纵行为的可检测性,实验验证其有效实用。

Comments This work has been accepted for publication at the 2026 AAAI/ACM Conference on AI, Ethics, and Society (AIES)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04798 2026-08-06 cs.HC 新提交 78%

Reference-Based Manipulation: A Framework and Pipeline for Multimodal Spatial Reasoning

基于参考的操作:多模态空间推理的框架与流程

Yangyang He, Zhuangze Hou, Yonglin Chen, Can Liu

专题命中 机器人操作 :manipulation(title,abstract)

AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。

Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04933 2026-08-06 cs.RO 新提交 74%

Mimir: A Neuro-Symbolic Memory System with Dynamic Grounding for Embodied Agents in Interactive Environments

Mimir:面向交互环境中具身智能体的、具备动态 grounding 的神经符号记忆系统

Haoming Xu, Zhenlin He, Hengyi Wang, Jiafeng Xu, Hao Dong

专题命中 机器人操作 :embodied agent(title);分类 cs.RO

AI总结 本文提出Mimir,一种分离世界与任务记忆并具备动态grounding的神经符号记忆系统,在EB-ALFRED、EB-Habitat等具身任务中显著提升了智能体的长程执行成功率。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04673 2026-08-06 cs.CV cs.RO 新提交 73%

Differential 6-DOF Pose Estimation with Provable First-Order Immunity to Camera Calibration Errors

抗相机标定误差的可证一阶差分6自由度位姿估计

Yueqiang Zhang, Liang Deng, Yi Zhang, Baoqiong Wang, Wenjun Chen, Shuixin Pan, Yulan Guo, Qifeng Yu

机构 * Shenzhen University(深圳大学) Sun Yat-sen University(中山大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出差分6-DOF位姿估计方法,避免独立绝对位姿估计,可证抗一阶相机外参误差,在微运动估计上优于PnP等方法,单目、双目求解器精度与效率优异。

Comments 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04300 2026-08-06 cs.HC 新提交 71%

An immersive micro-manipulation system using real-time 3D imaging microscope and 3D operation interface for high-speed and accurate micro-manipulation

采用实时三维成像显微镜与三维操作界面的沉浸式显微操作系统,用于高速精准的显微操作

Kenta Yokoe, Tadayoshi Aoyama, Toshiki Fujishiro, Masaru Takeuchi, Yasuhisa Hasegawa

专题命中 机器人操作 :manipulation(title)

AI总结 针对辅助生殖技术中胚胎学家短缺的问题,提出结合实时3D成像显微镜与3D操作界面的沉浸式显微操作系统,经实验验证可提升移液管操作的速度与精准度。

Comments Published version. Originally published in ROBOMECH Journal (Springer, Open Access, CC BY 4.0)

Journal ref ROBOMECH Journal, vol. 9, article 16 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05003 2026-08-06 quant-ph 新提交 71%

Universal linear manipulation via routing and projective measurements

基于路由和投影测量的通用线性操控

Alessio Baldazzi, Sonia Mazzucchi, Lorenzo Pavesi

专题命中 机器人操作 :manipulation(title)

AI总结 本研究提出基于路由和投影测量的方案,以最少元件实现通用线性幺正变换,推广至多光子散射玻色采样实验,且测试了其在损耗和相位噪声下的鲁棒性。

Comments 44 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04996 2026-08-06 cs.RO 新提交 70%

DreamWAM: Beyond RGB Future Prediction for World Action Models

DreamWAM:超越RGB未来预测的世界动作模型

Shanglin Yuan, Weiheng Zhao, Xin Shi, Haoyi Jiang, Xianda Guo, Liu Liu, Wenyu Liu, Wei Sui, Xinggang Wang

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO

AI总结 DreamWAM通过结构化超越RGB的世界建模,在LIBERO及真实操作任务中提升了世界动作模型的鲁棒性与成功率,相关代码模型已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05101 2026-08-06 cs.CV cs.MM 新提交 57%

HexMIL: Hierarchical Attention MIL for Ante-Hoc Explainable Detection of AI-Manipulated CT Volumes

HexMIL:用于AI篡改CT体积事前可解释检测的分层注意力多实例学习

Orazio Pontorno, Luca Guarnera, Zahid Akhtar, Sebastiano Battiato

机构 * University of Catania(卡塔尼亚大学) State University of New York Polytechnic Institute(纽约州立大学理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 HexMIL是一种无掩码的医疗深度伪造检测器,采用分层注意力多实例学习,利用二元体积级监督实现AI篡改CT体积的事前可解释检测,在跨生成器泛化任务中性能优于基线。

Comments Accepted at ACM Multimedia 2026 (MM '26)

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04707 2026-08-06 cs.HC 新提交 50%

LiverPlan: A Stage-Adaptive Immersive Visual Analytics Framework for Anatomical Liver Surgical Planning

LiverPlan:用于解剖性肝手术规划的阶段自适应沉浸式视觉分析框架

Qixuan Liu, Shi Qiu, Xiwen Wu, Yuqi Tong, Yinqiao Wang, Ruiyang Li, Jialun Pei, Shengdong Zhao, Chi-Wing Fu, Pheng-Ann Heng

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究提出LiverPlan阶段自适应沉浸式视觉分析框架,解决现有2D桌面肝手术规划工具的三大局限,经8名外科医生的对照研究,该框架可显著提升规划效率、降低认知负担并优化安全标准的主动优化。

Comments VIS 2026, to appear in TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04475 2026-08-06 cs.HC 新提交 50%

Super-Gaussian: Interactive Scene Editing for 3D Gaussian Splatting and NLI-Based Volume Visualization in Virtual Reality

超高斯:虚拟现实中面向三维高斯溅射与基于自然语言交互的体可视化的交互式场景编辑

Suemin Jeon, Kaiyuan Tang, Chaoli Wang, Won-Ki Jeong

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究针对VR中体可视化的渲染成本与交互问题,提出Super-Gaussian框架,结合三维高斯溅射、特征感知聚类、分层选择-细化工作流与NLI,实现高效直观的体数据交互编辑与分析

Comments IEEE VIS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 8 篇

2608.05078 2026-08-06 cs.RO 新提交 79%

SpikingNav: Robust Embodied Navigation with Spiking Neural Policies

SpikingNav:基于脉冲神经网络策略的鲁棒具身导航

Jiahong Zhang, Sijun Shen, Dehua Wu, Yifan Lin, Xuechen Xia, Xu Chu, Youhui Zhang, GuoqiLi

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出SpikingNav脉冲导航框架,含SSE与SPN,在PointNav、ObjectNav任务中,其参数更少、计算量更低,鲁棒性优于匹配的ANN基线,且可部署于Thruster-V2芯片。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04825 2026-08-06 cs.RO 新提交 79%

Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation

飞行前深思熟虑:面向无人机“看见并到达”导航的视觉引导空间深思熟虑

Fanfu Xue, En Yu, Bohang Liu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对无人机“看见并到达”导航中语义-控制失配问题,提出视觉-语言航路点预测框架DBFly,通过空间机动决策链、隐式飞行走廊和感知终端收敛的停止策略,使成功率较SOTA基线平均提升25.07个百分点。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04732 2026-08-06 eess.SY cs.AI cs.RO cs.SY 新提交 62%

Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control

在安全Actor-Critic最优控制中融合自适应经验回放与在线不确定性估计

Mahshad Rastegarmoghaddam, Davoud Nikkhouy, Shima Samadzadeh

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 该研究在安全Actor-Critic最优控制中提出融合自适应经验回放与在线不确定性估计的集成架构,在二维机器人导航任务的测试中,该集成配置在极端压力测试下实现零接触且全部种子到达目标,性能优于仅移除不确定性估计的配置。

Comments Code, deterministic seeds, data, figures, and protocol files are archived at https://doi.org/10.5281/zenodo.21515850 and https://github.com/SDNT8810/safe-actor-critic-aer-ue-reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04905 2026-08-06 cs.RO 新提交 57%

PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3

PRIMAL3:基于强化学习与模仿的多智能体路径规划——利用LaCAM3

Chengyang He, Tanishq Duhan, Gadiel Sznaier Camps, Fangyuan Wang, Yuhong Cao, Jiankai Sun, Ge Sun, Mac Schwager, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 PRIMAL3是整合强化学习、LaCAM3等的超大规模多智能体路径规划框架,性能优于现有基线,可扩展至10万智能体,能部署于物理机器人系统

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04723 2026-08-06 cs.RO 新提交 57%

A Vision-based Control Framework for Real-time Autonomous UUV Operations

用于实时自主水下航行器(UUV)作业的基于视觉的控制框架

Erik Tjærand Frøland, Marco Job, Md Ether Deowan, Eleni Kelasidi

机构 * NTNU(挪威科技大学) Oceaneering AS(奥星海洋公司)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 提出一种用于动态复杂水下环境中UUV的基于视觉的控制框架,可实现实时定位、导航与建图,经合成数据集验证及实船测试,性能实时且鲁棒,支持海洋机器人现场部署完成水下关键任务。

Comments Accepted to IFAC WC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04420 2026-08-06 cs.RO 新提交 57%

SCOPE: Field-of-View-Aware Path Planning in Unknown 3D Environments via Safety-Volume Certification

SCOPE:通过安全体积认证在未知三维环境中感知视场的路径规划

Junbin Yuan, Muqing Cao, Yunwoo Lee, Brady Moon, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Brigham Young University(杨百翰大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 SCOPE是一种在未知3D环境中规划路径的框架,通过安全体积认证实现视场感知,可到达所有目标、减少任务时间,真实机器人演示验证其有效性。

Comments Project website: https://yuanjunbin.github.io/scope-planner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04807 2026-08-06 cs.IR 新提交 50%

WatchLens: A Configurable Platform for Online Video Recommendation Experiments

WatchLens:用于在线视频推荐实验的可配置平台

Deogyong Kim, Dongha Lee

专题命中 具身导航 :navigation(abstract)

AI总结 WatchLens是一款开源可配置平台,可在单一工作流中关联在线视频推荐策略与用户播放等行为,通过模块化架构实现灵活配置,支持会话级效果比较,为在线视频推荐研究提供可复现的单服务器部署方案。

Comments 6 pages, 3 figures. Accepted to RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04574 2026-08-06 cs.CL 新提交 50%

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

当记忆“说谎”:VLM智能体中空间记忆过时的实证研究

Yushi Sun, Yanjie Zhang

机构 * Tencent LIGHTSPEED(腾讯光速工作室)

专题命中 具身导航 :navigation(abstract)

AI总结 该研究通过动态FrozenLake测试平台,探究了VLM智能体的空间记忆过时问题,发现文本可解性不代表视觉接地、信任过时记忆存在安全隐患、审核无法完全消除差距,明确了相关核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 4 篇

2608.04653 2026-08-06 cs.CV cs.RO 新提交 81%

Overcoming Statistical Bias in Action-Controllable World Models

克服动作可控世界模型中的统计偏差

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对动作可控世界模型的统计偏差问题,提出CoCo反事实一致性框架,结合ARC、DE评估指标及Mini-SSMB数据集,在多项任务上提升了动作可控性与视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05070 2026-08-06 cs.CV 新提交 79%

HelloWorld: Enabling Socially Interactive Characters in Video World Models

HelloWorld:在视频世界模型中实现具有社交互动性的角色

Liangyang Ouyang, Ruicong Liu, Xuangeng Chu, Kaipeng Zhang, Yoichi Sato

机构 * The University of Tokyo(东京大学) Alaya Lab(阿莱亚实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 该研究提出HelloWorld视频世界模型,通过自蒸馏流水线和训练模块实现角色与用户的社交互动,构建含400样本的基准,其互动质量优于基线且保持顶尖图像美学。

Comments Project page: https://github.com/AlayaLab/HelloWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04378 2026-08-06 cs.SD cs.LG eess.AS 新提交 79%

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

助力音乐协同创作智能体“良好聆听”:用于理解与生成的分层自监督世界模型

Scott H. Hawley

机构 * Belmont University(贝尔蒙特大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 本研究提出分层自监督世界模型,通过Swin V2编码器与条件流匹配模型构建协同音乐创作智能体,提升了和弦与调式检测准确率,可快速生成音乐建议并支持交互演示。

Comments 20 pages, 14 figures. A 6-page version was submitted to the NeurIPS 2026 Creative AI Track. Supplemental website with listening examples: https://drscotthawley.github.io/midi-rae-jepa-son/. Live demo: https://drscotthawley-midi-rae-jepa-son.hf.space/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04412 2026-08-06 cs.CV 新提交 57%

muSync-GS: Physics-Synchronized Driving Video Synthesis for Weather and Geometric Road Hazards

muSync-GS:面向天气与几何道路危险场景的物理同步驾驶视频合成方法

Yang Chen, Yicheng Zhu, Tao Li, Zilin Bian

机构 * Rochester Institute of Technology(罗切斯特理工学院) City University of Hong Kong(香港城市大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 muSync-GS是一种物理同步驾驶视频合成框架,通过耦合天气、道路几何编辑与车辆动力学,在12个CarSim案例上实现了车辆状态的精准预测与场景同步。

Comments 42 pages, 14 figures; includes an appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 3 篇

2608.04428 2026-08-06 cs.AR cs.LG 新提交 79%

Deltoris: Enabling Real-time VLA Inference in Embodied AI via Bit-level Sparsity and Speculative Inference

Deltoris:通过比特级稀疏性和推测性推理实现具身AI中的实时VLA推理

Zheng Liu, Zeyu Guo, Zihan Liu, Anbang Wu, Han Zhao, Fangxin Liu, Zhezhi He, Yinhe Han, Jingwen Leng, Minyi Guo, Yiming Gan, Yu Feng

专题命中 机器人基础模型 :embodied AI(title,abstract);分类 cs.LG

AI总结 Deltoris作为算法-硬件协同设计框架,通过时间感知比特级稀疏性、推测性推理及定制加速器,实现具身AI中实时VLA推理,加速比显著且精度相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04396 2026-08-06 cs.CV 新提交 70%

CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention

CofactVLA:通过反事实干预消除视觉-语言-动作模型的混淆

Yan Zhang, Yinan Wu, Haoran Duan, Jungong Han

机构 * Tsinghua University(清华大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 针对VLA模型的视觉优先与因果混淆问题,提出CofactVLA框架,通过OPG和CCR机制消除视觉混淆,在仿真基准和真实机器人实验中均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04633 2026-08-06 cs.RO 新提交 57%

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Mind-VLA:面向视觉-语言-动作模型的指令感知空间表示对齐方法

Xingyu Ding, Yuzhong Zhao, Yang Wu, Chaoyang Zhao, Chunhai Zhao, Yifan Zhang, Jian Cheng

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文针对现有VLA方法忽略指令指定目标物体3D几何的问题,提出Mind-VLA方法,通过对齐目标物体相关特征实现指令感知3D理解,在LIBERO、CALVIN及真实机器人遮挡任务上性能显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏