On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation
工业机器人操作中视觉语言动作模型的LoRA微调效率研究
Finn Ferchau, Daniel Pommer, Cristian Axenie
机构
*
Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡乔治·西蒙·欧姆应用技术大学)
;
Siemens AG(西门子股份公司)
;
Fraunhofer Institute for Integrated Circuits (IIS)(弗劳恩霍夫集成电路研究所)
Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision
通过结构化阶段和关键帧监督改进视觉-语言-动作模型微调
Yuan Xu, Yixiang Chen, Kai Wang, Jiabing Yang, Peiyan Li, Qisen Ma, Yan Huang, Liang Wang
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)多模态人工智能系统国家重点实验室(MAIS))
;
FiveAges
Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think
微调视觉-语言-动作模型所需的层数比你想象的少
Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tung M. Luu, Tuan Dam, Vu Duong, Trung Le, Nghi D. Q. Bui, Minh Vu, Tran Nguyen Le, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien
机构
*
Center for AI Research, VinUniversity(VinUniversity人工智能研究中心)
;
VinRobotics
;
University of Arkansas(阿肯色大学)
;
Technical University of Denmark(丹麦技术大学)
;
Hanoi University of Science and Technology(河内科技大学)
;
KAIST(韩国科学技术院)
;
Monash University(莫纳什大学)
;
Oldenburg University(奥尔登堡大学)
;
DFKI(德国人工智能研究中心)
;
University of Stuttgart(斯图加特大学)
;
IMPRS-IS(国际马克斯·普朗克智能系统研究学院)
;
Stanford University(斯坦福大学)
;
Technische Universität Darmstadt(达姆施塔特工业大学)
Flow Control: Steering Vision-Language-Action Models with Simple Real-Time Inputs
流控制:通过简单实时输入引导视觉-语言-动作模型
Jonathan C. Kao, Jason Chan, Andy Wang
机构
*
Departments of Electrical and Computer Engineering, Computer Science, and Neurobiology, University of California, Los Angeles(电气与计算机工程系、计算机科学系和神经生物学系,加州大学洛杉矶分校)
;
Department of Computer Science University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)
UAOR: Uncertainty-aware Observation Reinjection for Vision-Language-Action Models
UAOR: 面向视觉-语言-动作模型的不确定性感知观测重注入
Jiabing Yang, Yixiang Chen, Yuan Xu, Peiyan Li, Zichen Wen, Bowen Fang, Tao Yu, Xiangnan Wu, Qisen Ma, Kai Wang, Ziheng He, Yingda Li, Zhengbo Zhang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新技术实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
FiveAges(五代)
机构
*
Peking University(北京大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
The Chinese University of Hong Kong(香港中文大学)
;
Knowin AI
LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization
LIBERO-PRO:超越记忆的视觉-语言-动作模型鲁棒与公平评估
Xueyang Zhou, Yangming Xu, Guiyao Tie, Yongchao Chen, Guowen Zhang, Duanfeng Chu, Pan Zhou, Lichao Sun
机构
*
Huazhong University of Science and Technology(华中科技大学)
;
College of AI, Tsinghua University(清华大学人工智能学院)
;
Wuhan University of Technology(武汉理工大学)
;
Lehigh University(莱斯大学)
机构
*
College of Automotive Engineering(汽车工程学院)
;
The National Key Laboratory of Automotive Chassis Integration and Bionics(汽车底盘集成与生物力学国家级重点实验室)
;
ReeFocus AI Technology(ReeFocus人工智能技术)
Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding
通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型
Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le
机构
*
University of Arkansas(阿拉巴马大学)
;
National University of Singapore(新加坡国立大学)
;
TU Wien(维也纳技术大学)
;
Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校)
;
University of Stuttgart(斯图加特大学)
;
University of Liverpool(利物浦大学)