arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2205.15237 2022-05-31 cs.CV cs.CL cs.LG 81%

VLUE: A Multi-Task Benchmark for Evaluating Vision-Language Models

Wangchunshu Zhou, Yan Zeng, Shizhe Diao, Xinsong Zhang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

Comments ICML 2022, Benchmark website at https://vlue-benchmark.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04954 2025-08-06 cs.CV 80%

CAD-MLLM: Unifying Multimodality-Conditioned CAD Generation With MLLM

Jingwei Xu, Chenyu Wang, Zibo Zhao, Wen Liu, Yi Ma, Shenghua Gao

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学) Transcengram DeepSeek AI University of Hong Kong(香港大学)

专题命中 其他VLM :MLLM(title,abstract);分类 cs.CV

Comments Project page: https://cad-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新 80%

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26775 2026-08-04 cs.LG cs.AI cs.CL cs.CV 80%

Learning to Select Visual In-Context Demonstrations

学习选择视觉上下文示例

Eugene Lee, Yu-Chi Lin, Jiajie Diao

机构 * University of Cincinnati(辛辛那提大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出LSD方法,通过强化学习构建最优演示集,提升多模态大语言模型在视觉回归任务中的表现,揭示了学习选择在视觉上下文学习中的必要性。

Comments 21 pages, 12 figure, accepted to Computer Vision and Pattern Recognition Conference (CVPR) 2026 Findings Track

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 9455-9465) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16491 2026-06-16 cs.RO 新提交 80%

HATS: A Human-Agent Teleoperation System for Multi-Arm Data Collection

HATS:用于多臂数据收集的人-智能体遥操作系统

Zesen Lin, Jian-Jian Jiang, Haoming Cen, Xiao-Ming Wu, Dandan Zhang, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) Imperial College London(帝国理工学院)

专题命中 其他VLM :MLLM(summary_cn,abstract)

AI总结 提出HATS系统,由单操作员借助MLLM智能体控制两主臂和两辅助臂,实现高效多臂数据收集,性能媲美双人专家团队。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15781 2026-04-20 cs.HC 80%

ReVis: Towards Reusable Image-Based Visualizations with MLLMs

ReVis:面向基于图像的可视化可重用性的方法

Xiaolin Wen, Changlin Li, Manusha Karunathilaka, Can Liu, Fangzhuo Jin, Yong Wang

专题命中 其他VLM :MLLM(summary_cn,abstract)

AI总结 ReVis通过引入领域特定语言和MLLM管道,实现复杂可视化的灵活重用,支持分解与再现,并通过交互界面实现数据更新与编码定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07584 2026-08-11 cs.CV 新提交 79%

ComplexityWorld: Benchmarking Vision-Language Models on Verifiable Visual Decision Making

ComplexityWorld:面向可验证视觉决策的视觉语言模型基准测试

Ningxin Pan, Hanyu Li, Yehui Tang

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究推出COMPLEXITYWORLD基准测试VLMs在可验证视觉决策任务上的表现,发现多数模型在直接推理下验证器接受率不足40%,且存在视觉到决策的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20269 2026-08-07 cs.CR cs.AI 版本更新 79%

Text Steganography with Dynamic Codebook and Multimodal Large Language Model

基于动态代码本和多模态大语言模型的文本隐写术

Jianxin Gao, Ruohan Lei, Wanli Peng

机构 * China Agricultural University(中国农业大学)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文提出一种基于动态代码本和多模态大语言模型的文本隐写术,通过共享会话配置和多模态模型构建动态代码本,设计加密隐写映射并引入反馈优化机制,提升隐写术的安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03358 2026-08-05 cs.CL cs.CV 新提交 79%

ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models

ArtECulture:评测多模态大语言模型中的文化条件视觉情感理解

Xiaolin Chen, Xuemeng Song, Wenhao Shi, Xianjing Han, Mong-Li Lee, Wynne Hsu

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 针对现有视觉情感理解方法忽略文化差异的问题,提出ArtECulture基准与检索增强型文化条件情感理解框架,评估多模态大语言模型在该任务上的表现并验证框架的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31513 2026-07-28 cs.CV 版本更新 79%

Personalize Your Large Vision-language Models With In-context Prompt Tuning

用上下文提示调优个性化你的大型视觉语言模型

Yanshu Li, Jiaqian Li, Kuai Yu, Xi Xiao, Dongfang Liu, Tianyang Wang, Ruixiang Tang

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Purdue University(普渡大学) Rutgers University(罗格斯大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 提出上下文提示调优(ICPT)方法,通过轻量投影模块从多参考图像中提取细粒度视觉语义并转化为连续提示,结合几何正则化解决环境偏差和跨概念干扰,实现高效个性化。

Comments Accepted at ECCV 2026, 27 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07544 2026-07-28 cs.AI 版本更新 79%

From Pixels to Prompts: Vision-Language Models

从像素到提示:视觉-语言模型

Khang Nhat Hoang Vo

机构 * MBZUAI

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

AI总结 本文探讨了视觉-语言模型的发展历程,旨在提供清晰的认知框架,帮助读者理解该领域的核心概念和应用,而非罗列所有数据集和模型变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18613 2026-07-21 q-bio.NC cs.CL cs.CV 版本更新 79%

The Illusion-Illusion: Vision Language Models See Illusions Where There Are None

错觉-错觉:视觉语言模型在不存在错觉的地方看到错觉

Tomer Ullman

机构 * Harvard University(哈佛大学)

专题命中 其他VLM :vision language model(title,abstract);分类 cs.CV

AI总结 研究通过给视觉语言模型呈现不应引发处理错误的‘错觉-错觉’,发现许多模型会误将其视为错觉,揭示了模型存在基本处理错误,此失败是文献中更广泛失败的一部分。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14935 2026-07-17 cs.CV 新提交 79%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 其他VLM :MLLM(title,abstract);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09029 2026-07-13 cs.CV 新提交 79%

MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models

MOSAIC:用于高效异构视觉语言模型的自适应层间组合

Yuncheng Yang, Feiyang Ye, Shixian Luo, Yinna Zhu, Lianlei Shan, Wangcai Zhao, Kuo Zhang, Yan Chen, Yong Wu, Yan Xie

机构 * LiAuto Inc.(理想汽车公司)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对视觉语言模型中异构结构依赖手工静态混合模式的问题,提出硬件感知搜索方法MOSAIC,通过多目标混合整数规划确定最优配置,并引入两阶段参数恢复过程,提升了模型推理效率且降低训练成本。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23102 2026-07-07 eess.IV cs.CV 版本更新 79%

Region-Aware Multimodal Large Language Model via SlowFast Tokenization and Pseudo-Mask Guidance for 3D CT Report Generation

区域感知多模态大语言模型:基于慢快标记化与伪掩码引导的3D CT报告生成

Sunggu Kyung, Jinyoung Seo, Hyunseok Lim, Dongyeong Kim, Hyungbin Park, Jimin Sung, Jihyun Kim, Wooyoung Jo, Yoojin Nam, Namkug Kim

机构 * Department of Convergence Medicine, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院融合医学系) University of Ulsan College of Medicine, Seoul, Republic of Korea(韩国首尔蔚山大学医学院) Department of Radiology and Research Institute of Radiology, University of Ulsan College of Medicine, Asan Medical Center, Seoul, Republic of Korea(韩国首尔峨山医疗中心蔚山大学医学院放射科与放射学研究所)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 提出MedRegion-CT框架,通过区域慢快标记器联合建模全局与细粒度信息、伪掩码引导关注诊断关键区域、结构化病变信息提示,实现高质量CT报告生成,在多项指标上达到最优。

Comments Accepted to ECCV 2026. 15 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02370 2026-06-23 cs.CV 版本更新 79%

Cultural Counterfactuals: Evaluating Cultural Biases in Large Vision-Language Models with Counterfactual Examples

文化反事实:用反事实示例评估大型视觉语言模型中的文化偏见

Phillip Howard, Xin Su, Kathleen C. Fraser

机构 * Thoughtworks University of Ottawa(Ottawa大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 提出文化反事实数据集(近6万张反事实图像),通过图像编辑模型将不同人口特征的人置于真实文化背景中,量化大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18347 2026-06-09 cs.CL cs.AI 版本更新 79%

Multilingual Training and Evaluation Resources for Vision-Language Models

面向视觉语言模型的多语言训练和评估资源

Daniela Baiamonte, Elena Fano, Matteo Gabburo, Stefano Simonazzi, Leonardo Rigutini, Andrea Zugarini

机构 * Villanova.ai Aithlas

专题命中 其他VLM :vision-language model(title);vision language model(abstract);分类 cs.AI

AI总结 本文提出跨五种欧洲语言的视觉语言模型训练与评估资源,通过再生与翻译方法生成高质量多语言数据,验证多语言数据在非英语基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03454 2026-05-20 cs.CV 79%

Contextualized Visual Personalization in Vision-Language Models

基于上下文的视觉个性化在视觉-语言模型中

Yeongtak Oh, Sangwon Yu, Junsung Park, Han Cheol Moon, Jisoo Mok, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(电气电子工程系,首尔国立大学,首尔,韩国) Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, Korea(人工智能交叉学科项目,首尔国立大学,首尔,韩国)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于上下文的视觉个性化方法,通过强化学习和生成增强技术改进视觉-语言模型的个性化图像描述能力,并通过诊断评估验证了模型对视觉上下文的真实利用,展示了CoViP在下游个性化任务中的全面提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16090 2026-05-18 cs.CR cs.CV 79%

A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation

针对大视觉-语言模型的跨模态提示注入攻击:仅图像扰动

Hao Yang, Zhuo Ma, Yang Liu, Yilong Yang, Guancheng Wang, JianFeng Ma

机构 * Xidian University(西安电子科技大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出CrossMPI攻击,通过仅图像扰动实现跨模态提示注入,改进模型隐藏状态空间优化并采用层选择策略与距离递减扰动策略,有效提升攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08063 2026-05-18 cs.CV 79%

SkyLink: A Large Vision-Language Model Driven Re-ranking Framework for Cross-View UAV geolocalization

SkyLink:一种由大型视觉-语言模型驱动的跨视图无人机地理定位重排序框架

Bowen Liu, Pengyue Jia, Wanyu Wang, Derong Xu, Jiawei Cheng, Jiancheng Dong, Xiao Han, Zimo Zhao, Chao Zhang, Bowen Yu, Fangyu Hong, Xiangyu Zhao

机构 * Department of Data Science, City University of Hong Kong, Hong Kong(香港城市大学数据科学系) Information Systems, City University of Hong Kong, Hong Kong(香港城市大学信息系统系) College of Computer Science and Technology, Zhejiang University of Technology, Zhejiang(浙江工业大学计算机科学与技术学院)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出SkyLink框架,利用大型视觉-语言模型建模无人机与卫星视图间的视觉语义关系,通过引入关系感知损失提升跨视图地理定位的排序效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21360 2026-05-14 cs.CV 79%

Prototype-Based Test-Time Adaptation of Vision-Language Models

基于原型的测试时间适应性视觉-语言模型

Zhaohong Huang, Yuxin Zhang, Wenjing Liu, Fei Chao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception(多媒体可信感知关键实验室) Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China(高效计算,中华人民共和国教育部,厦门大学,361005,中国)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出基于原型的测试时间适应方法PTA,通过类特定知识原型积累测试样本知识,提高效率并实现跨领域图像识别和点云分析的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13080 2026-05-14 cs.CV 79%

Learning to See What You Need: Gaze Attention for Multimodal Large Language Models

学习你需要看到的东西:多模态大语言模型的注视注意力

Junha Song, Byeongho Heo, Geonmo Gu, Jaegul Choo, Dongyoon Han, Sangdoo Yun

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出Gaze Attention机制,使多模态大语言模型在生成过程中选择性关注任务相关的视觉区域,减少冗余计算并提升聚焦效果,实验表明其在图像和视频理解任务中性能优于密集注意力基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07512 2026-05-11 cs.CV 79%

Hierarchical Dual-Subspace Decoupling for Continual Learning in Vision-Language Models

层次双子空间解耦用于视觉-语言模型中的持续学习

Mengxin Qin, Xiang Zhang, Kun Wei, Xu Yang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西电电子工程学院)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出HDSD框架,通过分解参数空间和结构化参数分解,减少子空间干扰和参数漂移,提升视觉-语言模型持续学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07494 2026-05-11 cs.CV 79%

DIMoE-Adapters: Dynamic Expert Evolution for Continual Learning in Vision-Language Models

DIMoE-Adapters:动态专家进化用于视觉语言模型的持续学习

Mengxin Qin, Xiang Zhang, Xi Wang, Kun Wei, Xu Yang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出DIMoE-Adapters框架,通过动态专家进化方法平衡持续学习中的稳定性与可塑性,解决多领域任务增量学习中的领域迁移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27553 2026-05-01 cs.CV 79%

Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models

揭示视觉文本风格对大型视觉语言模型生成的基于属性的描述的影响

Xiaomeng Wang, Martha Larson, Zhengyu Zhao

机构 * Radboud University(拉博德大学) Xi'an Jiaotong University(西安交通大学)

专题命中 其他VLM :visual language model(title,abstract);分类 cs.CV

AI总结 研究视觉文本风格如何影响大型视觉语言模型对概念属性的描述,发现即使正确识别概念,文本风格仍会影响模型输出,推动风格感知评估与缓解。

Comments Accepted by ICMR 2026. Code is available at https://github.com/XiaomengWang-AI/The-Impact-of-Visual-Text-style-on-Attribute-based-Descriptions-Produced-by-LVLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02452 2026-04-29 cs.CV 79%

Personalization Toolkit: Training Free Personalization of Large Vision Language Models

个性化工具包:无需训练的大型视觉语言模型个性化

Soroush Seifi, Vaggelis Dorovatas, Matteo Cassinelli, Fabien Despinoy, Daniel Olmeda Reino, Rahaf Aljundi

机构 * Toyota Motor Europe(丰田欧洲公司)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出无需训练的LVLM个性化方法,通过预训练视觉基础模型提取特征,结合检索增强生成技术实现多概念个性化,适用于图像和视频。

Comments Accepted at Transactions on Machine Learning Research (TMLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17941 2026-04-21 cs.CV cs.CL 79%

From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models

从头到神经元:多任务视觉-语言模型中的因果归因与操控

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出HONES框架,通过任务相关的注意力头来评估神经元的因果贡献,改进多任务视觉-语言模型中神经元的归因与操控,提升模型性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22583 2026-03-25 cs.CV cs.RO 79%

A vision-language model and platform for temporally mapping surgery from video

一种用于手术时间映射的视觉-语言模型和平台

Dani Kiyasseh

机构 * Halsted AI

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出Halsted模型,基于Halsted手术图谱实现手术行为映射,提供更全面且高效的解决方案,并开发Halsted平台使外科医生能自动映射自身手术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21484 2026-03-24 cs.CV 79%

Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models

哪些概念需要遗忘以及如何拒绝?分解概念以在大视觉-语言模型中实现持续反学习

Hyundong Jin, Dongyoon Han, Eunwoo Kim

机构 * Chung-Ang University(Chung-Ang大学) NAVER AI Lab(NAVER AI实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出一种持续反学习框架,通过分解删除目标中的视觉和文本概念,生成基于细粒度描述的拒绝响应,以提升反学习效果和保持通用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16344 2026-03-20 cs.RO cs.AI 79%

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配

Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) University of Toronto(多伦多大学) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏