arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9810 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9139 篇

2510.01068 2026-03-11 cs.RO cs.LG 73%

Compose Your Policies! Improving Diffusion-based or Flow-based Robot Policies via Test-time Distribution-level Composition

制定你的策略!通过测试时的分布级组合改进扩散型或流型机器人策略

Jiahang Cao, Yize Huang, Hanzhong Guo, Rui Zhang, Mu Nan, Weijian Mai, Jiaxu Wang, Hao Cheng, Jingkai Sun, Gang Han, Wen Zhao, Qiang Zhang, Yijie Guo, Qihao Zheng, Chunfeng Song, Xiao Li, Ping Luo, Andrew F. Luo

机构 * The University of Hong Kong(香港大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出无需训练的通用策略组合方法,通过测试时分布级组合提升机器人策略性能。

Comments Accepted to ICLR 2026. Project Page: https://sagecao1125.github.io/GPC-Site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03739 2026-03-05 cs.CV cs.AI 73%

PROSPECT: Unified Streaming Vision-Language Navigation via Semantic--Spatial Fusion and Latent Predictive Representation

PROSPECT:通过语义-空间融合和潜在预测表示实现统一的流式视觉-语言导航

Zehua Fan, Wenqi Lyu, Wenxuan Song, Linge Zhao, Yifei Yang, Xi Wang, Junjie He, Lida Huang, Haiyan Liu, Bingchuan Sun, Guangjun Bao, Xuanyao Mao, Liang Xu, Yan Wang, Feng Gao

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) University of Adelaide(阿德莱德大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Jiaotong University(北京交通大学) AIR Wuxi Innovation Center, Tsinghua University(清华大学无锡创新中心) Lenovo(联想集团)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 PROSPECT通过语义-空间融合和潜在预测表示,实现统一的流式视觉-语言导航,提升环境动态和空间结构的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01465 2026-03-03 cs.RO cs.AI 73%

Non-Markovian Long-Horizon Robot Manipulation via Keyframe Chaining

非马尔可夫长时间 horizon 机器人操作 via 关键帧链

Yipeng Chen, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(技术悉尼大学) University of Electronic Science and Technology of China(电子科学与技术大学) Advanced Institute of Big Data(大数据先进研究院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Keyframe-Chaining VLA框架,通过提取和链接关键历史帧,解决长horizon机器人操作中的非马尔可夫依赖问题,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01441 2026-03-03 cs.CV cs.RO 73%

Unifying Language-Action Understanding and Generation for Autonomous Driving

统一语言-动作理解与生成以实现自动驾驶

Xinyang Wang, Qian Liu, Wenjie Ding, Zhao Yang, Wei Li, Chang Liu, Bailin Li, Kun Zhan, Xianpeng Lang, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Li Auto

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 LinkVLA通过统一语言和动作令牌及两步生成方法,提升自动驾驶中语言-动作一致性和效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00732 2026-03-03 cs.RO cs.CV 73%

UniHM: Unified Dexterous Hand Manipulation with Vision Language Model

UniHM: 一体化的视觉语言模型用于统一的灵巧手操作

Zhenhao Zhang, Jiaxin Liu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) InstAdapt

专题命中 VLA模型 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.CV

AI总结 UniHM通过统一的视觉语言模型实现灵巧手操作,利用开放词汇指令提升泛化能力和物理可行性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22010 2026-02-26 cs.RO cs.CV 73%

World Guidance: World Modeling in Condition Space for Action Generation

世界引导:在条件空间中进行世界建模以生成动作

Yue Su, Sijin Chen, Haixin Shi, Mingyu Liu, Zhengshen Zhang, Ningyuan Huang, Weiheng Zhong, Zhengbang Zhu, Yuxiao Liu, Xihui Liu

机构 * The University of Hong Kong(香港大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 WoG通过在条件空间中建模未来观测,提升视觉-语言-动作模型的动作生成能力与泛化性能。

Comments Project Page: https://selen-suyue.github.io/WoGNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07555 2026-02-10 cs.CV cs.AI 73%

VISOR: VIsual Spatial Object Reasoning for Language-driven Object Navigation

VISOR:基于语言驱动的对象导航的视觉空间对象推理

Francesco Taioli, Shiping Yang, Sonia Raychaudhuri, Marco Cristani, Unnat Jain, Angel X Chang

机构 * Polytechnic of Turin(都灵理工大学) Simon Fraser University(Simon Fraser大学) University of Verona(威尼斯大学) University of Reykjavik(雷克雅未克大学) University of California, Irvine(加州大学尔湾分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 VISOR提出了一种紧凑的3B参数VLA智能体,通过显式图像基础推理实现人类般的具身推理,提升对象识别和动作选择的可解释性、泛化能力和导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02454 2026-02-03 cs.RO cs.AI 73%

World-Gymnast: Training Robots with Reinforcement Learning in a World Model

World-Gymnast: 在世界模型中用强化学习训练机器人

Ansh Kumar Sharma, Yixiang Sun, Ninghao Lu, Yunzhe Zhang, Jiarao Liu, Sherry Yang

机构 * New York University(纽约大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 World-Gymnast通过在世界模型中进行强化学习微调,有效提升真实机器人性能,比监督学习和软件模拟更具优势。

Comments https://world-gymnast.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00096 2026-02-03 cs.CV cs.AI 73%

Mirage2Matter: A Physically Grounded Gaussian World Model from Video

Mirage2Matter: 从视频构建一个物理基础的高斯世界模型

Zhengqing Gao, Ziwen Li, Xin Wang, Jiaxin Huang, Zhenyang Ren, Mingkai Shao, Hanlue Zhang, Tianyu Huang, Yongkang Cheng, Yandong Guo, Runqi Lin, Yuanyuan Wang, Tongliang Liu, Kun Zhang, Mingming Gong

机构 * MBZUAI AI$^2$Robotics(AI²Robotics) The University of Sydney(悉尼大学) Carnegie Mellon University(卡内基梅隆大学) The University of Melbourne(墨尔本大学)

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 Mirage2Matter通过视频重建物理基础的世界模型,利用3D高斯点云和生成模型实现高保真具身训练数据生成,提升具身智能的可扩展性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14133 2026-02-02 cs.RO cs.CV 73%

TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers

TwinBrainVLA: 通过非对称Transformer混合释放通用视觉语言模型在具身任务中的潜力

Bin Yu, Shijie Lian, Xiaopeng Lin, Yuliang Wei, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Xinming Wang, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢集团智能计算研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) CASIA(中国科学院自动化研究所) DeepCybo

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 TwinBrainVLA通过非对称Transformer混合机制,利用冻结的通用视觉语言模型和可训练的专家路径,实现机器人任务中的具身智能提升。

Comments GitHub: https://github.com/ZGC-EmbodyAI/TwinBrainVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05580 2026-01-29 cs.AI cs.RO 73%

MetaVLA: Unified Meta Co-training For Efficient Embodied Adaption

MetaVLA:统一的元学习协同训练用于高效的具身适应

Chen Li, Zhantao Yang, Han Zhang, Fangyi Chen, Chenchen Zhu, Anudeepsekhar Bolimera, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta Reality Labs, USA(Meta现实实验室(美国))

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 MetaVLA通过统一的元学习协同训练方法,实现高效的具身适应,提升任务泛化能力并降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20276 2025-12-24 cs.AI cs.RO 73%

ActionFlow: A Pipelined Action Acceleration for Vision Language Models on Edge

ActionFlow:面向边缘设备的视觉语言模型流水线动作加速

Yuntao Dai, Hang Gu, Teng Wang, Qianyu Cheng, Yifei Zheng, Zhiyong Qiu, Lei Gong, Wenqi Lou, Xuehai Zhou

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州市先进研究院,中国科学技术大学) IEIT SYSTEMS Co., Ltd.(IEIT SYSTEMS公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 ActionFlow通过跨请求流水线策略提升边缘设备上VLA模型的推理速度,实现2.55倍的FPS提升,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18477 2025-12-23 cs.RO cs.CV 73%

STORM: Search-Guided Generative World Models for Robotic Manipulation

STORM:基于搜索的生成世界模型用于机器人操作

Wenjun Lin, Jensen Zhang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 STORM通过结合生成模型与搜索算法,实现了机器人操作中的时空推理,显著提升了任务成功率和环境适应能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02190 2025-12-23 cs.RO cs.LG 73%

cVLA: Towards Efficient Camera-Space VLAs

cVLA:迈向高效的相机空间VLA

Max Argus, Jelena Bratulic, Houman Masnavi, Maxim Velikanov, Nick Heppert, Abhinav Valada, Thomas Brox

机构 * University of Freiburg(弗赖堡大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 cVLA通过利用视觉语言模型在2D图像上的性能,提出了一种高效预测机器人轨迹的VLA方法,具备良好的仿真到现实迁移能力。

Comments 20 pages, 10 figures; CoRL 2025 Workshop on Generalizable Priors for Robot Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12796 2025-12-19 cs.CV cs.AI 73%

DriveVLA-W0: World Models Amplify Data Scaling Law in Autonomous Driving

DriveVLA-W0:世界模型放大数据扩展定律在自动驾驶中的应用

Yingyan Li, Shuyao Shang, Weisong Liu, Bing Zhan, Haochen Wang, Yuqi Wang, Yuntao Chen, Xiaoman Wang, Yasong An, Chufeng Tang, Lu Hou, Lue Fan, Zhaoxiang Zhang

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences (CASIA)(国家工程实验室、自动化研究所、中国科学院(CASIA)) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 DriveVLA-W0通过世界建模预测未来图像,提升自动驾驶中数据扩展定律,实现更高效的驾驶智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07472 2025-12-09 cs.RO cs.LG 73%

Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation

可及场干预:使VLAs在机器人操作中摆脱记忆陷阱

Siyu Xu, Zijian Wang, Yunke Wang, Chenghao Xia, Tao Huang, Chang Xu

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) John Hopcropt Center for Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学中心)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本研究提出可及场干预(AFI)方法,通过引入3D空间可及场提升VLA在机器人操作中对分布变化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19861 2025-12-02 cs.CV cs.RO 73%

GigaWorld-0: World Models as Data Engine to Empower Embodied AI

GigaWorld-0:世界模型作为数据引擎赋能具身AI

GigaWorld Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jiagang Zhu, Kerui Li, Mengyuan Xu, Qiuping Deng, Siting Wang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yankai Wang, Yu Cao, Yifan Chang, Yuan Xu, Yun Ye, Yang Wang, Yukun Zhou, Zhengyuan Zhang, Zhehao Dong, Zheng Zhu

机构 * GigaWorld Team(GigaWorld团队)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 GigaWorld-0通过整合视频生成与3D建模技术,构建统一的数据引擎,生成高质量具身交互数据,提升VLA模型在现实任务中的性能。

Comments Project Page: https://giga-world-0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11478 2025-12-01 cs.RO cs.CV 73%

Rethinking Progression of Memory State in Robotic Manipulation: An Object-Centric Perspective

重新思考机器人操作中记忆状态的演进:以对象为中心的视角

Nhat Chung, Taisei Hanyu, Toan Nguyen, Huy Le, Frederick Bumgarner, Duy Minh Ho Nguyen, Khoa Vo, Kashu Yamazaki, Chase Rainwater, Tung Kieu, Anh Nguyen, Ngan Le

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Embodied-SlotSSM框架,用于解决机器人操作中非马尔可夫推理问题,通过槽位状态空间建模和关系编码器实现时间可扩展的视觉-语言-动作推理。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22134 2025-12-01 cs.CV cs.RO 73%

DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action

DualVLA: 通过推理与行动部分解耦构建通用具身代理

Zhen Fang, Zhuoyang Liu, Jiaming Liu, Hao Chen, Yu Zeng, Shiting Huang, Zehui Chen, Lin Chen, Shanghang Zhang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) CUHK(香港大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 DualVLA通过推理与行动部分解耦,提升通用具身代理的行动与多模态理解平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14499 2025-11-19 cs.CV cs.RO 73%

Enhancing End-to-End Autonomous Driving with Risk Semantic Distillaion from VLM

Jack Qin, Zhitao Wang, Yinan Zheng, Keyu Chen, Yang Zhou, Yuanxin Zhong, Siyuan Cheng

机构 * Tsinghua University(清华大学) Laboratories, Huawei Technologies(华为技术有限公司2012实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23318 2025-11-17 cs.CV cs.AI 73%

FastDriveVLA: Efficient End-to-End Driving via Plug-and-Play Reconstruction-based Token Pruning

Jiajun Cao, Qizhe Zhang, Peidong Jia, Xuhui Zhao, Bo Lan, Xiaoan Zhang, Zhuo Li, Xiaobao Wei, Sixiang Chen, Liyun Li, Xianming Liu, Ming Lu, Yang Wang, Shanghang Zhang

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10518 2025-11-14 cs.CV cs.RO 73%

SemanticVLA: Semantic-Aligned Sparsification and Enhancement for Efficient Robotic Manipulation

Wei Li, Renshan Zhang, Rui Shao, Zhijian Fang, Kaiwen Zhou, Zhuotao Tian, Liqiang Nie

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

Comments Accepted to AAAI 2026 (Oral), Project Page: https://github.com/JiuTian-VL/SemanticVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06619 2025-11-11 cs.RO cs.AI 73%

How Do VLAs Effectively Inherit from VLMs?

Chuheng Zhang, Rushuai Yang, Xiaoyu Chen, Kaixin Wang, Li Zhao, Yi Chen, Jiang Bian

机构 * Microsoft Research(微软研究院) The Hong Kong University of Science(香港科学大学) Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17148 2025-11-05 cs.RO cs.CV 73%

DiffVLA++: Bridging Cognitive Reasoning and End-to-End Driving through Metric-Guided Alignment

Yu Gao, Anqing Jiang, Yiru Wang, Wang Jijun, Hao Jiang, Zhigang Sun, Heng Yuwen, Wang Shuo, Hao Zhao, Sun Hao

机构 * RIX, Bosch(博世研究院) AIR, Tsinghua University(清华大学人工智能研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23763 2025-11-04 cs.RO cs.CL cs.CV 73%

RoboOmni: Proactive Robot Manipulation in Omni-modal Context

Siyin Wang, Jinlan Fu, Feihong Liu, Xinzhe He, Huangxuan Wu, Junhao Shi, Kexin Huang, Zhaoye Fei, Jingjing Gong, Zuxuan Wu, Yu-Gang Jiang, See-Kiong Ng, Tat-Seng Chua, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26406 2025-10-31 cs.RO cs.AI 73%

Human-in-the-loop Online Rejection Sampling for Robotic Manipulation

Guanxing Lu, Rui Zhao, Haitao Lin, He Zhang, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Tencent Robotics X(腾讯机器人实验室)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24161 2025-10-29 cs.AI cs.MM cs.RO 73%

BLM$_1$: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning

Wentao Tan, Bowen Wang, Heng Zhi, Chenyu Liu, Zhe Li, Jian Liu, Zengrong Lin, Yukun Dai, Yipeng Chen, Wenjie Yang, Enci Xie, Hao Xue, Baixu Ji, Chen Xu, Zhibin Wang, Tianshi Wang, Lei Zhu, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21860 2025-10-28 cs.RO cs.AI 73%

Butter-Bench: Evaluating LLM Controlled Robots for Practical Intelligence

Callum Sharrock, Lukas Petersson, Hanna Petersson, Axel Backlund, Axel Wennström, Kristoffer Nordström, Elias Aronsson

机构 * Andon Labs(安登实验室)

专题命中 VLA模型 :vision language action(abstract);VLA(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21817 2025-10-28 cs.RO cs.CL cs.LG 73%

VITA-E: Natural Embodied Interaction with Concurrent Seeing, Hearing, Speaking, and Acting

Xiaoyu Liu, Chaoyou Fu, Chi Yan, Chu Wu, Haihan Gao, Yi-Fan Zhang, Shaoqi Dong, Cheng Qian, Bin Luo, Xiuyong Yang, Guanwu Li, Yusheng Cai, Yunhang Shen, Deqiang Jiang, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云图实验室) CASIA(中国科学院自动化研究所) Fourier Intelligence Inc.(傅里叶智能公司)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

Comments Homepage: https://lxysl.github.io/VITA-E/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11660 2025-10-15 cs.RO cs.AI 73%

ManiAgent: An Agentic Framework for General Robotic Manipulation

Yi Yang, Kefan Gu, Yuqing Wen, Hebei Li, Yucheng Zhao, Tiancai Wang, Xudong Liu

机构 * Beijing University of Technology(北京理工大学) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学) Dexmal

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

Comments 8 pages, 6 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏