arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2506.08933 2025-06-11 cs.CV 70%

What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities

Wendong Bu, Yang Wu, Qifan Yu, Minghe Gao, Bingchen Miao, Zhenkui Zhang, Kaihang Pan, Yunfei Li, Mengze Li, Wei Ji, Juncheng Li, Siliang Tang, Yueting Zhuang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICML 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03126 2025-06-04 cs.CV 70%

AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation

Lu Qiu, Yizhuo Li, Yuying Ge, Yixiao Ge, Ying Shan, Xihui Liu

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Project released at: https://qiulu66.github.io/animeshooter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24441 2025-06-02 cs.CV 70%

SORCE: Small Object Retrieval in Complex Environments

Chunxu Liu, Chi Xie, Xiaxu Chen, Wei Li, Feng Zhu, Rui Zhao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Sensetime Research(商汤科技研究院) Tongji University(同济大学) Beijing Institute of Technology(北京理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Project Page: https://github.com/MCG-NJU/SORCE

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02980 2025-06-02 cs.CV 70%

GPT4Point: A Unified Framework for Point-Language Understanding and Generation

Zhangyang Qi, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang, Dahua Lin, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04620 2025-05-08 cs.CV 70%

On Path to Multimodal Generalist: General-Level and General-Bench

Hao Fei, Yuan Zhou, Juncheng Li, Xiangtai Li, Qingshan Xu, Bobo Li, Shengqiong Wu, Yaoting Wang, Junbao Zhou, Jiahao Meng, Qingyu Shi, Zhiyuan Zhou, Liangtao Shi, Minghe Gao, Daoan Zhang, Zhiqi Ge, Weiming Wu, Siliang Tang, Kaihang Pan, Yaobo Ye, Haobo Yuan, Tao Zhang, Tianjie Ju, Zixiang Meng, Shilin Xu, Liyu Jia, Wentao Hu, Meng Luo, Jiebo Luo, Tat-Seng Chua, Shuicheng Yan, Hanwang Zhang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments ICML'25, 305 pages, 115 tables, 177 figures, project page: https://generalist.top/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13995 2025-04-22 cs.CV 70%

Scaling LLaNA: Advancing NeRF-Language Understanding Through Large-Scale Training

Andrea Amaduzzi, Pierluigi Zama Ramirez, Giuseppe Lisanti, Samuele Salti, Luigi Di Stefano

机构 * CVLAB, University of Bologna(CV实验室,博洛尼亚大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Under submission. Project page at https://andreamaduzzi.github.io/llana/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21257 2025-03-26 cs.RO cs.CV 70%

RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete

Yuheng Ji, Huajie Tan, Jiayu Shi, Xiaoshuai Hao, Yuan Zhang, Hengyuan Zhang, Pengwei Wang, Mengdi Zhao, Yao Mu, Pengju An, Xinda Xue, Qinghang Su, Huaihai Lyu, Xiaolong Zheng, Jiaming Liu, Zhongyuan Wang, Shanghang Zhang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09703 2025-03-25 cs.CV 70%

MagicQuill: An Intelligent Interactive Image Editing System

Zichen Liu, Yue Yu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Wen Wang, Zhiheng Liu, Qifeng Chen, Yujun Shen

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Code and demo available at https://magic-quill.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10120 2025-03-14 cs.CV eess.IV 70%

Hybrid Agents for Image Restoration

Bingchen Li, Xin Li, Yiting Lu, Zhibo Chen

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06063 2025-03-11 cs.CV 70%

Multi-Layer Visual Feature Fusion in Multimodal LLMs: Methods, Analysis, and Best Practices

Junyan Lin, Haoran Chen, Yue Fan, Yingqi Fan, Xin Jin, Hui Su, Jinlan Fu, Xiaoyu Shen

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09367 2025-03-10 cs.CV 70%

Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs

Zijia Zhao, Haoyu Lu, Yuqi Huo, Yifan Du, Tongtian Yue, Longteng Guo, Bingning Wang, Weipeng Chen, Jing Liu

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08234 2025-02-13 cs.CV 70%

Learning Human Skill Generators at Key-Step Levels

Yilu Wu, Chenhui Zhu, Shuai Wang, Hanlin Wang, Jing Wang, Zhaoxiang Zhang, Limin Wang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05901 2025-01-14 cs.CV 70%

Valley2: Exploring Multimodal Models with Scalable Vision-Language Design

Ziheng Wu, Zhenghao Chen, Ruipu Luo, Can Zhang, Yuan Gao, Zhentao He, Xian Wang, Haoran Lin, Minghui Qiu

专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18060 2024-12-25 cs.CV 70%

An Ensemble Approach to Short-form Video Quality Assessment Using Multimodal LLM

Wen Wen, Yilin Wang, Neil Birkbeck, Balu Adsumilli

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17077 2024-12-24 cs.AI 70%

SubstationAI: Multimodal Large Model-Based Approaches for Analyzing Substation Equipment Faults

Jinzhi Wang, Qinfeng Song, Lidong Qian, Haozhou Li, Qinke Peng, Jiangbo Zhang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11767 2024-12-17 cs.CV 70%

IDEA-Bench: How Far are Generative Models from Professional Designing?

Chen Liang, Lianghua Huang, Jingwu Fang, Huanzhang Dou, Wei Wang, Zhi-Fan Wu, Yupeng Shi, Junge Zhang, Xin Zhao, Yu Liu

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17323 2024-11-27 cs.CV 70%

InsightEdit: Towards Better Instruction Following for Image Editing

Yingjing Xu, Jie Kong, Jiazhi Wang, Xiao Pan, Bo Lin, Qiang Liu

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11840 2024-11-25 cs.CV 70%

LLaNA: Large Language and NeRF Assistant

Andrea Amaduzzi, Pierluigi Zama Ramirez, Giuseppe Lisanti, Samuele Salti, Luigi Di Stefano

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Under review. Project page: https://andreamaduzzi.github.io/llana/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05600 2024-10-29 cs.CV 70%

GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing

Zhenyu Wang, Aoxue Li, Zhenguo Li, Xihui Liu

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments NeurIPS 2024 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08683 2024-10-14 cs.CV 70%

SEED-Story: Multimodal Long Story Generation with Large Language Model

Shuai Yang, Yuying Ge, Yang Li, Yukang Chen, Yixiao Ge, Ying Shan, Yingcong Chen

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Our models, codes and datasets are released in https://github.com/TencentARC/SEED-Story

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09045 2024-10-10 cs.CV 70%

AMSNet: Netlist Dataset for AMS Circuits

Zhuofu Tao, Yichen Shi, Yiru Huo, Rui Ye, Zonghang Li, Li Huang, Chen Wu, Na Bai, Zhiping Yu, Ting-Jung Lin, Lei He

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19103 2024-05-30 cs.CR cs.LG 70%

Voice Jailbreak Attacks Against GPT-4o

Xinyue Shen, Yixin Wu, Michael Backes, Yang Zhang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04007 2024-05-08 cs.CV 70%

SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing

Yuying Ge, Sijie Zhao, Chen Li, Yixiao Ge, Ying Shan

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Technical Report; Dataset released in https://huggingface.co/datasets/AILab-CVC/SEED-Data-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11401 2024-01-23 cs.CV 70%

LLMRA: Multi-modal Large Language Model based Restoration Assistant

Xiaoyu Jin, Yuan Shi, Bin Xia, Wenming Yang

专题命中 其他VLM :vision language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00698 2023-10-03 cs.CV cs.HC 70%

Comics for Everyone: Generating Accessible Text Descriptions for Comic Strips

Reshma Ramaprasad

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted at CLVL: 5th Workshop On Closing The Loop Between Vision And Language (ICCV 2023 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27938 2026-07-31 cs.HC 新提交 67%

VizPilot: Automated Onboarding for SVG-based Composite Visualizations using Multimodal LLMs

VizPilot:基于多模态大语言模型的SVG复合可视化自动引导系统

Nishaanthini Gnanavel, Yong Wang

专题命中 其他VLM :multimodal large language model(abstract,abstract_cn)

AI总结 VizPilot是基于多模态大语言模型的SVG复合可视化自动引导工具,通过双模块实现自动生成交互式引导,经评估可降低创作工作量并减轻用户认知负荷,提升复合可视化可用性。

Comments Accepted by IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05121 2026-06-30 cs.CL cs.SD eess.AS 67%

The NTNU System at the S&I Challenge 2025 SLA Open Track

NTNU系统在S&I挑战2025 SLA开放赛道中的表现

Hong-Yun Lin, Tien-Hong Lo, Yu-Hsuan Fang, Jhen-Ke Lin, Chung-Chun Wang, Hao-Chien Lu, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学) Department of Computer Science and Information Engineering(计算机科学与信息工程系) Institute of AI Interdisciplinary Applied Technology(人工智能跨学科应用技术研究所)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出整合W2V与Phi-4多模态大语言模型的系统,通过分数融合策略提升SLA评估性能,在Speak & Improve Challenge 2025中取得第二名,RMSE为0.375。

Comments submitted to the ISCA SLaTE-2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23611 2026-06-23 cs.CV cs.AI cs.LG 新提交 67%

Data Selection Through Iterative Self-Filtering for Vision-Language Settings

面向视觉-语言场景的迭代自过滤数据选择

Andrei Liviu Nicolicioiu, Sarvjeet Singh Ghotra, Morgane M. Moss, Aaron Courville

机构 * Mila, Université de Montréal(蒙特利尔大学Mila实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出一种自举式方法,通过迭代训练CLIP模型并自选择改进的数据混合,无需额外数据或预训练模型即可提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04588 2026-06-04 cs.CL 67%

VCIFBench: Evaluating Complex Instruction Following for Video Understanding

VCIFBench:评估视频理解中的复杂指令遵循能力

Huangchen Xu, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(知识驱动人机智能工程研究中心,吉林大学) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 提出VCIFBench基准,通过混合验证流水线评估多模态大模型在视频理解中遵循内容、格式、风格和结构约束的复杂指令能力,实验表明联合约束满足仍具挑战,DPO训练可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16848 2026-05-19 cs.CV cs.AI cs.CL cs.LG 67%

Thinking with Patterns: Breaking the Perceptual Bottleneck in Visual Planning via Pattern Induction

基于模式的思考:通过模式诱导突破视觉规划中的感知瓶颈

Yichang Jian, Boyuan Xiao, Zhenyuan Huang, Yifei Peng, Yao-Xiang Ding

机构 * State Key Lab of CAD& CG(CAD与CG国家重点实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过模式诱导的方法,利用模式推理和模式诱导策略,使视觉语言模型在视觉规划任务中实现更高效和准确的感知与推理,解决传统模型在复杂输入下的感知瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏