arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 266 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 266 篇

2607.06256 2026-07-16 cs.RO 版本更新 85%

Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition

诊断智能体编排的视觉-语言-动作技能组合中的语义切换失败

Ke Rui, Yushen Zuo, Jiawei Wang, Haoran Jia, Jinming Ma, Weitao Zhou, Minglei Li

机构 * SimpleAI

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 研究智能体编排的视觉-语言-动作技能组合中的语义切换失败问题,通过智能体编排执行框架,调用基于π0.5的技能检查点,在两种初始状态分布下评估,发现单技能与长期任务成功率差距大,为未来技能库改进提供诊断依据。

Journal ref RSS SemRob Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23128 2026-07-08 cs.RO 版本更新 85%

$π_0$-EqM: Equilibrium Matching for Closed-Loop Vision-Language-Action Control

$\pi_0$-EqM:闭环视觉-语言-动作控制的均衡匹配

Huanming Liu, Congsheng Xu, Jianmin Ji, Yao Mu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出$\pi_0$-EqM,用均衡匹配解码器替换$\pi_0$中的流匹配专家,在固定预算下提升机器人操作成功率,并发现残差与成功率之间的非单调关系。

Comments Preprint. 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08706 2026-06-16 cs.RO 版本更新 85%

OmniVTLA: Vision-Tactile-Language-Action Models with Semantic-Aligned Tactile Sensing

OmniVTLA:具有语义对齐触觉感知的视觉-触觉-语言-动作模型

Zhengxue Cheng, Yiqian Zhang, Anni Tang, Keyu Wang, Wenkang Zhang, Haoyu Li, Hengdi Zhang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕辛尼科技)

专题命中 VLA模型 :action model(title);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出OmniVTLA架构,通过双路径触觉编码器框架和语义对齐触觉ViT,结合新数据集ObjTac,显著提升机器人操作中接触密集任务的成功率和轨迹平滑度。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L). ObjTac dataset: https://readerek.github.io/Objtac.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12659 2026-08-04 cs.RO cs.AI 版本更新 85%

Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

Jetson-PI:通过前瞻对齐异步推理实现机载实时机器人控制

Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

机构 * Peking University(北京大学) AIRS(无合适中文名,保留英文) PrimeBot Research Institute(PrimeBot 研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究针对低功耗机载设备部署VLA模型的挑战,提出Jetson-PI方法。通过训练轻量级未来校正模块解决感知-执行未对齐,引入基于置信度的调度优化减少反应时间,辅以系统级加速,实验显示其显著提升控制频率和成功率。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07383 2026-07-20 cs.RO cs.LG 版本更新 85%

RhinoVLA Technical Report

RhinoVLA 技术报告

Huixi Technology, :, Chen Zhang, Chenyang Zhou, Guanglei Ding, Guanghui He, Haibin Gao, Jiajia Chen, Jianyong Zhang, Lianyi Yu, Ningyi Xu, Ping Xu, Qingchen Li, Yingjun Hu, Yijia Zhang, Yuxi Liu

机构 * Huixi Intelligence(慧溪智能)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 针对边缘硬件上VLA模型部署延迟问题,提出RhinoVLA,通过令牌高效骨干、连续动作专家和统一接口实现实时闭环控制,在Huixi R1上达到11.69 Hz推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06904 2026-06-11 cs.RO cs.CV 版本更新 85%

ActionMap: Robot Policy Learning via Voxel Action Heatmap

ActionMap: 基于体素动作热图的机器人策略学习

Pei Yang, Hai Ci, Yanzhe Chen, Qi Lv, Han Cai, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) NVIDIA(英伟达)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出ActionMap,一种将动作空间建模为体素热图的动作解码器,替代现有VLA模型中的单点预测器,在LIBERO仿真和真实Franka操作中提升性能和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04527 2026-08-10 cs.RO 版本更新 84%

Retrieve in Time, Correct in Frequency

及时检索,频率校正

Yuze Fan, Yue Cao, Pengjie Gao, Haojia Gao, Guangqiu Guo, Ziyue Zhang, Junbo Tan, Bokui Chen, Zhuo Zou, Xueqian Wang

机构 * Research Institute of Tsinghua University in Shenzhen(清华大学深圳研究院) Everwise-Tech Co., Ltd.(恒智慧科技有限公司) Tongji University(同济大学) Fudan University(复旦大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 该研究针对冻结 VLA 策略长 horizon 操作的误差问题,提出无需训练的 RTCF 框架,通过渐进式记忆对齐和低频残差转移,在 LIBERO 实验中提升了操作成功率且延迟极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20633 2026-08-07 cs.RO 版本更新 84%

Reinforcing Action Policies by Prophesying

通过预言强化行动策略

Jiahui Zhang, Ze Huang, Chun Gu, Zipei Ma, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。

Comments https://LogosRoboticsGroup.github.io/ProphRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01755 2026-08-05 cs.AI 版本更新 84%

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

用于自动驾驶视觉语言模型可验证推理的未来轨迹延迟暴露

Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu, Hao Geng, Xiaozhi Chen, Yikun Ban, Deqing Wang

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.AI

AI总结 该研究针对自动驾驶VLA模型的轨迹锚定偏差问题,提出AD-MCQ规划框架与DEFT-RLVR方法,将未来轨迹转化为决策后验证目标,提升了自动驾驶推理能力并保留了通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04600 2026-07-13 cs.RO 版本更新 84%

Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data

行动、感知、行动:从大规模自我中心人类数据中学习主动感知

Jialiang Li, Yi Qiao, Yunhan Guo, Changwen Chen, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(人工智能学院,上海交通大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 研究如何让机器人在无约束环境中实现可泛化操作,提出CoMe - VLA框架,利用大规模人类自我中心数据学习主动感知,集成认知辅助头和双轨记忆系统,经三个阶段训练模型,实验证明该方法在多场景长期任务中有强鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24892 2026-07-09 cs.CV 版本更新 84%

X-Foresight: A Joint Vision-Action Causal Forecasting Network via Predictive World Modeling

X-Foresight:一种通过预测世界建模的联合视觉-动作因果预测网络

Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu, Yuan Lin, Junhong Zhou, Ruixin Liu, Liu Yang, Yutong Zheng, Zhenli Zhang, Sean Li, Chaoda Zheng, Boyang Wang, Tenglong, Gu, Zhuangzhuang Ding, Pengkun Zheng, Yu Zhang, Xianming Liu

机构 * PWM Team(PWM团队) XPeng Inc.(XPeng公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.CV

AI总结 提出X-Foresight,一种将预测世界模型直接集成到VLA架构中的方法,通过长程分块自回归策略和课程学习,联合学习世界建模与实时动作控制,以解决视频预测中的低熵冗余和长程因果建模难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16207 2026-06-16 cs.RO 版本更新 84%

IVRA: Improving Visual-Token Relations for Robot Action Policy with Training-Free Hint-Based Guidance

IVRA: 通过无需训练的提示引导改善机器人动作策略的视觉-令牌关系

Jongwoo Park, Kanchana Ranasinghe, Jinhyeok Jang, Cristina Mata, Yoo Sung Jang, Michael S Ryoo

机构 * Stony Brook University(石溪大学) ETRI(电子技术研究院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出IVRA方法,利用模型内置视觉编码器的亲和力提示,无需额外编码器或重训练,在推理时调整视觉-令牌交互以增强空间理解,在多种VLA架构和任务上提升操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10860 2026-08-14 cs.RO cs.CV 版本更新 84%

Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

Flex-$π$:具备计算灵活性的多流世界-动作模型

Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

机构 * University of Washington(华盛顿大学) Allen Institute for AI(艾伦人工智能研究所)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究提出Flex-$π$多流世界-动作模型,利用冻结的视频生成VAE实现多模态监督,通过混合专家Transformer与每流丢弃机制提升效率,在双臂操作任务上性能优于基线模型且运行更快。

Comments Project page: https://flex-pi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05903 2026-08-10 cs.CV cs.RO 版本更新 84%

Robust-WAM: Bridging Generative Pretraining and Semantic Foresight in World-Action Models

Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻

Haodong Yan, Junfeng Li, Junjie He, Zhide Zhong, MingMing Yu, Wenxuan Song, Jiaguan Zhu, Yangyang Zheng, Yuqiao Du, Jiadi You, Yingjie Cai, Xu Yan, Guanyi Zhao, Bingbing Liu, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beihang University(北京航空航天大学) Huawei Foundation Model Department(华为基础模型部门)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-07-14 cs.RO cs.AI cs.CL cs.CV 版本更新 83%

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17659 2026-07-16 cs.CV cs.RO 版本更新 83%

When Vision Overrides Language: Evaluating and Mitigating Counterfactual Failures in VLAs

当视觉超越语言:评估和缓解VLAs中的反事实失败

Yu Fang, Yuchun Feng, Dong Jing, Jiaqi Liu, Yue Yang, Zhenyu Wei, Daniel Szafir, Mingyu Ding

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出CAG方法,通过双分支推理方案缓解VLAs中的反事实失败,提升语言跟随和任务成功率。

Comments Website: https://vla-cf.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08023 2026-08-13 cs.RO 版本更新 83%

4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields

4D-WAM:通过轨迹场将时空感知注入世界动作模型

Lishan Yang, Wenxuan Song, Xi Wang, Pingyue Sheng, Zheng Fang, Ziyang Zhou, Junjie He, Haodong Yan, Jiayi Chen, Nan Sun, Qiao Sun, Pengwei Wang, Lingqiao Liu, Yan Wang, Yuxiang Gao, Feras Dayoub, Haoang Li

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00793 2026-08-07 cs.RO 版本更新 83%

DynamicWAM: Dual-Path Motion Conditioning for World-Action Models in Dynamic Manipulation

DynamicWAM:面向动态操作的世界-动作模型的双路径运动条件机制

Yunfan Lou, Hewen Gao, Xiyu Zhu, Zhuoran Qiao, Xuan Han, Yifan Yang, Yifan Ye, Boxian Yao, Zhibo Pang

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 针对现有世界-动作模型在动态场景中运动感知与响应控制不足的问题,提出采用双路径运动条件机制的DynamicWAM,在DOMINO数据集及12项真实世界任务中均显著优于基线方法。

Comments 18 pages, 9 figures. Project page: https://dynamicwam.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04999 2026-07-31 cs.RO cs.AI cs.LG 版本更新 83%

CLAM: Continuous Latent Action Models for Robot Learning from Unlabeled Demonstrations

CLAM:基于未标记演示的连续潜在动作模型用于机器人学习

Anthony Liang, Pavel Czempin, Matthew M. Hong, Yutai Zhou, Jingzhen Wang, Erdem Biyik, Stephen Tu

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 CLAM通过连续潜在动作标签和联合训练动作解码器,有效解决复杂连续控制任务中未标记数据的学习问题,实现在DMControl和MetaWorld等基准及真实机器人上的性能提升。

Comments Latent Action Models, Self-supervised Pretraining, Learning from Videos

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03682 2026-08-17 cs.AI cs.RO 版本更新 82%

PhyAI: Real-Time Physical AI at the Edge, Scalable Rollouts in the Cloud

PhyAI:边缘端实时物理人工智能,云端可扩展部署

Chenghua Wang, Daliang Xu, Dongqi Cai, Duojin Sun, Hao Zhang, Haoze Qian, Huaiyuan Zhang, Jinshuo Cui, Junbo Cui, Kezhao Zhao, Longxi Gao, Mengwei Xu, Rongjie Yi, Ruixin Liu, Shangguang Wang, Tam Sikyuen, Tianyue Zhang, Weikai Xie, Xuanzhe Liu, Yingying Qin, Yiwen Lu, Yuan Yao, Yuezhi Zu, Yunhan Guo, Yuxin Zheng, Ziqi Guo

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对物理AI多部署场景推理程序不统一的问题,提出PhyAI推理引擎,实现多模型跨端部署,在多个基准上取得1.40-4.65倍加速,还引入控制时间屋顶线分析模型特性。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12936 2026-07-17 cs.RO cs.AI 版本更新 82%

Pipette: An Embodied Simulation Platform, Benchmark, and Data-Efficient Augmentation Framework for Wet-Lab Robotics

面向湿实验室机器人的具身仿真平台、基准测试及数据高效增强框架

Zhe Liu, Huanbo Jin, Zhaohui Du, Zhe Wang, Dongzhan Zhou, Minting Pan, He Xu, Peijia Li, Jiaming Gu, Quan Lu, Qi Wang, Bin Ji, Ting Xiao

机构 * Key Laboratory of Smart Manufacturing in Energy Chemical Process Ministry of Education(能源化工过程智能制造国家重点实验室) Department of Computer Science and Engineering(计算机科学与工程系) Department of Laboratory Medicine(实验室医学系) Shanghai Jiao Tong University School of Medicine(上海交通大学医学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.AI

AI总结 提出Pipette平台,包含可编辑资产、仿真数据增强管道和11任务基准测试,将30次演示的VLA成功率从44.1%提升至74.7%。

Comments 19 pages, 19figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28545 2026-07-03 cs.RO cs.CV 版本更新 82%

ManipArena: Comprehensive Real-world Evaluation of Reasoning-Oriented Generalist Robot Manipulation

ManipArena: 通用机器人操作的综合现实世界评估

Yu Sun, Meng Cao, Yang Ping, Kaidong Zhang, Qingxuan Chen, Rongtao Xu, Liangwang Ruan, Xuecheng Chen, Dongxiu Liu, Yunxiao Yan, Zunnan Xu, Runze Xu, Charles Yang, Peilun Zhang, Xiaofan Li, Ruyi Gan, Liang Ma, Yuehao Yin, Jincheng Yu, Lufang Chen, Yuxin Liang, Peng Zhai, Hao Wang, Ivan Laptev, Ian Reid, Qian Wang, Xiaodan Liang

机构 * SYSU(中山大学) X SQUARE ROBOT MBZUAI(穆罕默德·本·扎耶德人工智能大学) Thsinghua University(清华大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 ManipArena通过标准化框架解决现有评估不足问题,提供真实场景下的多任务测试与多级泛化能力,支持长时移动操作与传感诊断,促进视觉-语言-动作模型和世界模型的发展。

Comments Technical report for CVPR 2026 Challenge ManipArena

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05226 2026-06-24 cs.RO cs.AI 版本更新 82%

Reward-Centered ReST-MCTS: A Robust Decision-Making Framework for Robotic Manipulation in High Uncertainty Environments

以奖励为中心的ReST-MCTS:高不确定性环境下机器人操作的鲁棒决策框架

Xibai Wang

机构 * Xibai Wang(王西拜)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.AI

AI总结 提出Reward-Centered ReST-MCTS框架,通过分解中间反馈为中心信号并引导搜索,解决高不确定性环境下MCTS因稀疏奖励和噪声导致的决策脆弱性问题,实验验证其在同骨干VLA上的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08283 2026-07-16 cs.RO 版本更新 81%

TFP: Temporally Conditioned Memory-Fusion Policies for Visuomotor Learning

TFP:用于视觉运动学习的时间条件记忆融合策略

Yushen Liang, Yue Peng, Baosheng Jin, Tianluo Zhang, Xinyu Zhang, Shuyi Zhou, Zhuoran Chen, Xinqi Liu, Shenji Wan

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO

AI总结 研究针对视觉运动学习中阶段依赖操作问题,提出时间条件记忆融合策略(TFP),通过维护任务进展信念并注入动作解码器来改进VLA策略,在多个任务上提升成功率,证明紧凑且对事件敏感的记忆动态可优化VLA策略。

Comments Accepted to the SemRob 2026 Workshop at Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07491 2026-07-15 cs.RO 版本更新 81%

Smooth Operator: A Real-Time Sampling-Based Algorithm for Kinematic Hand Retargeting

平滑算子:一种基于实时采样的运动学手部重定向算法

Robert Jomar Malate, Erik Bauer, Norica Bacuieti, Stefanos Charalambous, Elvis Nava, Robert K. Katzschmann, Benedek Forrai

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) mimic robotics(模仿机器人公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对基于梯度的手部重定向算法易收敛到不同局部最小值影响数据质量的问题,提出基于采样的无梯度重定向方法SBR,经模拟和真实用户研究评估,其总体任务成功率最高且显著降低操作员疲劳,为灵巧操作提供高效重定向器及基准测试方法。

Comments Minor cosmetic updates to figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11521 2026-08-14 cs.RO cs.AI 版本更新 81%

Keep the Future, Drop the Rollout: RIFT for World Action Models

保留未来,放弃展开:面向世界动作模型的RIFT

Chushan Zhang, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文针对世界动作模型部署延迟问题,提出RIFT方法,通过学习的预期标记一次构建未来K/V缓存,在LIBERO、RoboTwin 2.0任务上实现高成功率且大幅降低动作块延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00836 2026-08-13 cs.RO cs.AI cs.SY eess.SY 版本更新 81%

From World Models to World Action Models: A Concise Tutorial for Robotics

从世界模型到世界动作模型:面向机器人学的简明教程

Xiaoxiong Zhang, Xiong Zeng, Wei Zhang

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本教程提出世界模型作为动作条件预测模型的设计空间视图,分类为观测空间和状态空间模型,并引入世界动作模型,总结四种代表性范式,为具身预测与控制提供结构化分类。

Comments Project page: https://clearlab-sustech.github.io/WorldModelSurvey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13738 2026-08-12 cs.CV cs.AI 版本更新 81%

Ablation-Corrected Evaluation of Attribution Maps in Echocardiographic Ejection-Fraction Models

解剖结构忠实但时间上盲目:超声心动图左心室射血分数估计的归因审核

Hyunkyung Han, Min Jung Kim

机构 * School of Integrated Medicine, Yonsei University(延世大学统合医学院) Department of Radiology, Research Institute of Radiologic Science, Yonsei University College of Medicine(延世大学医学院放射科学研究所放射科)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究超声心动图左心室射血分数估计模型的归因,微调VideoMAE Transformer和R(2+1)D CNN两个回归器,用多指标审核发现模型空间忠实但时间盲目,强调空间忠实不代表时间忠实,警示XAI验证并呼吁时间感知训练评估。

Comments 12 pages, 4 figures. v2: the chance level is now measured rather than computed, which corrects the ratios reported in v1. Adds a composition-matched ablation with an equal-area control, a reliability estimate for it, an ablation-derived score to report alongside overlap, seed repetition, and pediatric validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10180 2026-08-11 cs.RO cs.AI 版本更新 81%

ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception

ActiveFly-Bench:将具身问答与视觉-语言-动作对齐用于空中具身感知

Weichen Zhang, Shiquan Yu, Yinan Zhu, Peizhi Tang, Shilong Ji, Zhiyuan Deng, Tianyi Lyu, Haoyang Wang, Xin Zeng, Chen Gao, Yong Li, Xinlei Chen

机构 * Tsinghua University(清华大学) Manifold AI(流形人工智能)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 介绍用于无人机具身感知的ActiveFly-Bench基准测试,它分解主动感知为三个层次任务,收集数据集,开发集成视觉语言推理与细粒度控制的ActiveFly智能体,实验表明当前无人机智能体有困难,该基准成为具身空中智能新测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27677 2026-07-14 cs.RO cs.CV 版本更新 81%

DIM-WAM: World-Action Modeling with Diverse Historical Event Memory

DIM-WAM:基于多样化历史事件记忆的世界-动作建模

Kai Wang, Zhaopeng Gu, Yixiang Chen, Yuan Xu, Qisen Ma, Jiabing Yang, Zhaowen Li, Yan Huang, Liang Wang, Peng Su

机构 * NLPR, CASIA(中国科学院自动化研究所模式识别国家重点实验室) Yinwang Intelligent Technology(银旺智能科技) FiveAges(五龄科技)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出DIM-WAM,一种记忆增强的世界-动作模型,通过多尺度历史上下文、局部未来动态和全局任务进度解决长期遗忘问题,在RMBench和真实机器人任务上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏