arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2308.10554 2023-08-22 cs.CV 57%

Improving Diversity in Zero-Shot GAN Adaptation with Semantic Variations

Seogkyu Jeon, Bei Liu, Pilhyeon Lee, Kibeom Hong, Jianlong Fu, Hyeran Byun

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to ICCV 2023 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09089 2023-08-21 cs.SD cs.CV cs.IR cs.MM eess.AS 57%

Bridging High-Quality Audio and Video via Language for Sound Effects Retrieval from Visual Queries

Julia Wilkins, Justin Salamon, Magdalena Fuentes, Juan Pablo Bello, Oriol Nieto

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments WASPAA 2023. Project page: https://juliawilkins.github.io/sound-effects-retrieval-from-video/. 4 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08754 2023-08-21 cs.CV 57%

Fine-grained Text and Image Guided Point Cloud Completion with CLIP Model

Wei Song, Jun Zhou, Mingjie Wang, Hongchen Tan, Nannan Li, Xiuping Liu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06038 2023-08-21 cs.CV 57%

Diverse Data Augmentation with Diffusions for Effective Test-time Prompt Tuning

Chun-Mei Feng, Kai Yu, Yong Liu, Salman Khan, Wangmeng Zuo

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Proceedings of the IEEE/CVF International Conference on Computer Vision 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03685 2023-08-08 cs.CV 57%

Learning Concise and Descriptive Attributes for Visual Recognition

An Yan, Yu Wang, Yiwu Zhong, Chengyu Dong, Zexue He, Yujie Lu, William Wang, Jingbo Shang, Julian McAuley

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12964 2023-08-07 cs.CV 57%

Text-based Person Search without Parallel Image-Text Data

Yang Bai, Jingyao Wang, Min Cao, Chen Chen, Ziqiang Cao, Liqiang Nie, Min Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16125 2023-08-03 cs.CL cs.CV 57%

SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension

Bohao Li, Rui Wang, Guangzhi Wang, Yuying Ge, Yixiao Ge, Ying Shan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Technical Report; Project released at: https://github.com/AILab-CVC/SEED-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12980 2023-07-25 cs.CV 57%

A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models

Jindong Gu, Zhen Han, Shuo Chen, Ahmad Beirami, Bailan He, Gengyuan Zhang, Ruotong Liao, Yao Qin, Volker Tresp, Philip Torr

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13223 2023-07-12 cs.CV 57%

Exploring Structured Semantic Prior for Multi Label Recognition with Incomplete Labels

Zixuan Ding, Ao Wang, Hui Chen, Qiang Zhang, Pengzhang Liu, Yongjun Bao, Weipeng Yan, Jungong Han

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16529 2023-06-30 cs.IR cs.AI cs.DL 57%

Multimodal Search on Iconclass using Vision-Language Pre-Trained Models

Cristian Santini, Etienne Posthumus, Mary Ann Tan, Oleksandra Bruns, Tabea Tietz, Harald Sack

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08226 2023-06-16 cs.CV cs.GR 57%

CLIPXPlore: Coupled CLIP and Shape Spaces for 3D Shape Exploration

Jingyu Hu, Ka-Hei Hui, Zhengzhe liu, Hao Zhang, Chi-Wing Fu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19924 2023-06-02 cs.CV 57%

Joint Adaptive Representations for Image-Language Learning

AJ Piergiovanni, Anelia Angelova

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments T4V Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.18203 2023-06-01 cs.CV 57%

Concept Decomposition for Visual Exploration and Inspiration

Yael Vinker, Andrey Voynov, Daniel Cohen-Or, Ariel Shamir

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments https://inspirationtree.github.io/inspirationtree/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06602 2023-04-14 cs.CV 57%

A-CAP: Anticipation Captioning with Commonsense Knowledge

Duc Minh Vo, Quoc-An Luong, Akihiro Sugimoto, Hideki Nakayama

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14186 2023-04-04 stat.ML cs.LG 57%

TRAK: Attributing Model Behavior at Scale

Sung Min Park, Kristian Georgiev, Andrew Ilyas, Guillaume Leclerc, Aleksander Madry

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07075 2022-12-15 cs.CV cs.CL 57%

Cross-Modal Similarity-Based Curriculum Learning for Image Captioning

Hongkuan Zhang, Saku Sugawara, Akiko Aizawa, Lei Zhou, Ryohei Sasano, Koichi Takeda

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03267 2022-12-08 cs.CV 57%

NeRDi: Single-View NeRF Synthesis with Language-Guided Diffusion as General Image Priors

Congyue Deng, Chiyu "Max'' Jiang, Charles R. Qi, Xinchen Yan, Yin Zhou, Leonidas Guibas, Dragomir Anguelov

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02936 2022-12-08 cs.CV 57%

M-VADER: A Model for Diffusion with Multimodal Context

Samuel Weinbach, Marco Bellagente, Constantin Eichenberg, Andrew Dai, Robert Baldock, Souradeep Nanda, Björn Deiseroth, Koen Oostermeijer, Hannah Teufel, Andres Felipe Cruz-Salinas

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 22 pages, 14 figures, 2 tables, fixed figure 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11720 2022-12-06 cs.CV cs.CL 57%

Multitask Vision-Language Prompt Tuning

Sheng Shen, Shijia Yang, Tianjun Zhang, Bohan Zhai, Joseph E. Gonzalez, Kurt Keutzer, Trevor Darrell

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.13188 2022-10-25 cs.CV 57%

Dissecting Deep Metric Learning Losses for Image-Text Retrieval

Hong Xuan, Xi Chen

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2201.11307

Journal ref WACV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.08919 2022-07-19 cs.CV 57%

EMScore: Evaluating Video Captioning via Coarse-Grained and Fine-Grained Embedding Matching

Yaya Shi, Xu Yang, Haiyang Xu, Chunfeng Yuan, Bing Li, Weiming Hu, Zheng-Jun Zha

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments cvpr2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.05912 2022-06-14 cs.CV 57%

INDIGO: Intrinsic Multimodality for Domain Generalization

Puneet Mangla, Shivam Chandhok, Milan Aggarwal, Vineeth N Balasubramanian, Balaji Krishnamurthy

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.08535 2022-05-18 cs.CV 57%

AvatarCLIP: Zero-Shot Text-Driven Generation and Animation of 3D Avatars

Fangzhou Hong, Mingyuan Zhang, Liang Pan, Zhongang Cai, Lei Yang, Ziwei Liu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments SIGGRAPH 2022; Project Page https://hongfz16.github.io/projects/AvatarCLIP.html Codes available at https://github.com/hongfz16/AvatarCLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.04312 2020-08-31 cs.CV cs.CL 57%

Learning to Scale Multilingual Representations for Vision-Language Tasks

Andrea Burns, Donghyun Kim, Derry Wijaya, Kate Saenko, Bryan A. Plummer

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ECCV 2020 accepted spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1909.07459 2020-07-28 cs.CV 57%

Bridging Visual Perception with Contextual Semantics for Understanding Robot Manipulation Tasks

Chen Jiang, Martin Jagersand

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09708 2026-07-28 eess.AS 版本更新 50%

Adapting a Text-to-Audio Model for Room Impulse Response Generation

为房间脉冲响应生成适应文本到音频模型

Kirak Kim, Sungyoung Kim

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文提出利用预训练文本到音频模型生成房间脉冲响应,通过视觉语言模型提取声学描述解决数据稀缺问题,验证大规模生成音频先验在该任务中的有效性。

Comments Accepted to IWAENC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19830 2026-07-23 cs.CL 新提交 50%

VizRAG: Enhancing Retrieval-Augmented Generation with Hypergraph Visualization

VizRAG:通过超图可视化增强检索增强生成

Yanbin Wei, Yang Chen, Renling Gan, Ziru Liu, Xinyu Fu, Chun Kang, Ning Lu, Rui Liu, Yu Zhang, James Kwok

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究院) Beihang University(北京航空航天大学)

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 研究旨在增强检索增强生成,核心方法是通过视觉线索将超图感知整合到RAG系统中,引入VizRAG支持视觉超图结构感知,实验证明该方法显著优于基线,验证了超图可视化用于RAG系统的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10201 2026-07-21 cs.GR 版本更新 50%

B-repLer: Language-guided Editing of CAD Models

B-repLer:CAD模型的语言引导编辑

Yilin Liu, Niladri Shekhar Dutt, Changjian Li, Niloy J. Mitra

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 研究语言引导的CAD编辑问题,提出B-repLer框架直接连接自然语言与CAD模型编辑,绕过构建历史,还引入数据集,展示其自动生成等方法,能对复杂CAD形状准确执行复杂编辑。

Comments Accepted by SIGGRAPH 2026; Project page at https://yilinliu77.github.io/brepler.github.io Code at https://github.com/yilinliu77/Brepler

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13147 2026-07-16 cs.SI 新提交 50%

How You Ask Shapes What You Get: Auditing Breast-Cancer Misinformation in TikTok Search

你如何通过提问来获取信息:审核TikTok搜索中的乳腺癌错误信息

Pooriya Jamie, Homa Hosseinmardi, Rezvaneh Rezapour, Aria Pessianzadeh, Patricia A. Ganz, Amir Ghasemian

专题命中 其他VLM :vision-language model(abstract)

AI总结 研究TikTok搜索中用户查询框架对乳腺癌错误信息曝光的影响,通过受控实验发现查询框架与错误信息曝光紧密相关,替代医学查询错误信息返回率高,医学信息查询也有错误信息,强调审核查询驱动搜索系统的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11633 2026-07-14 cs.RO 新提交 50%

Breaking the 15% Barrier: A Real-World Data-Driven System for Proactive Social Robot Triggered by User Nonverbal Cues

突破15%的障碍:一个由用户非语言线索触发的、用于主动社交机器人的真实世界数据驱动系统

Yuga Yano, Yuki Okafuji, Ryo Miyoshi, Sanae Yamashita, Yoshiki Ohira

机构 * Kyushu Institute of Technology(九州工业大学) CyberAgent(CyberAgent公司) The University of Osaka(大阪大学)

专题命中 其他VLM :vision-language model(abstract)

AI总结 研究零售商店中服务机器人交互,发现非语言行为触发机器人话语占比15.3%。通过分析客户行为定义非语言线索,开发识别器和对话框架,能基于非语言线索实现主动机器人响应,还进行了离线评估和展示在线原型。

Comments 8 pages, accepted as a conference paper for IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS2026)

详情

展开后加载摘要…

URL PDF HTML 收藏