arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2506.16716 2025-06-23 cs.HC 50%

V-CASS: Vision-context-aware Expressive Speech Synthesis for Enhancing User Understanding of Videos

Qixin Wang, Songtao Zhou, Zeyu Jin, Chenglin Guo, Shikun Sun, Xiaoyu Qin

专题命中 其他VLM :vision-language model(abstract)

Comments Accepted by IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14445 2025-06-18 cs.IR 50%

Vela: Scalable Embeddings with Voice Large Language Models for Multimodal Retrieval

Ruofan Hu, Yan Xia, Minjie Hong, Jieming Zhu, Bo Chen, Xiaoda Yang, Minghui Fang, Tao Jin

专题命中 其他VLM :multimodal large language model(abstract)

Comments Accepted by Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19510 2025-06-17 cs.CL 50%

Making LLMs Better Many-to-Many Speech-to-Text Translators with Curriculum Learning

Yexing Du, Youcheng Pan, Ziyang Ma, Bo Yang, Yifan Yang, Keqi Deng, Xie Chen, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

专题命中 其他VLM :multimodal large language model(abstract)

Comments Accepted in ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03360 2025-06-05 cs.CL cs.CY cs.SI 50%

A Multimodal, Multilingual, and Multidimensional Pipeline for Fine-grained Crowdsourcing Earthquake Damage Evaluation

Zihui Ma, Lingyao Li, Juan Li, Wenyue Hua, Jingxiao Liu, Qingyuan Feng, Yuki Miura

机构 * New York University(纽约大学) University of South Florida(佛罗里达州立大学) Google LLC(谷歌公司) University of California, Santa Barbara(加州大学圣巴巴拉分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他VLM :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21389 2025-05-28 cs.CL 50%

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs

Xuanwen Ding, Chengjun Pan, Zejun Li, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 其他VLM :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10714 2025-05-27 cs.CL 50%

GeoGrid-Bench: Can Foundation Models Understand Multimodal Gridded Geo-Spatial Data?

Bowen Jiang, Yangxinyu Xie, Xiaomeng Wang, Jiashu He, Joshua Bergerson, John K Hutchison, Jordan Branham, Camillo J Taylor, Tanwi Mallick

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17599 2025-03-14 cs.CL 50%

MEDA: Dynamic KV Cache Allocation for Efficient Multimodal Long-Context Inference

Zhongwei Wan, Hui Shen, Xin Wang, Che Liu, Zheda Mai, Mi Zhang

专题命中 其他VLM :multimodal large language model(abstract)

Comments NAACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11354 2025-03-06 cs.HC 50%

What Social Media Use Do People Regret? An Analysis of 34K Smartphone Screenshots with Multimodal LLM

Longjie Guo, Yue Fu, Xiran Lin, Xuhai "Orson" Xu, Yung-Ju Chang, Alexis Hiniker

专题命中 其他VLM :multimodal large language model(abstract)

Comments Accepted as a CHI 2025 Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01358 2025-03-04 cs.HC 50%

RemiHaven: Integrating "In-Town" and "Out-of-Town" Peers to Provide Personalized Reminiscence Support for Older Drifters

Xuechen Zhang, Changyang He, Peng Zhang, Hansu Gu, Ning Gu, Qi Shen, Zhan Hu, Tun Lu

专题命中 其他VLM :multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13576 2025-02-25 cs.CL cs.IR 50%

FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research

Jiajie Jin, Yutao Zhu, Guanting Dong, Yuyao Zhang, Xinyu Yang, Chenghao Zhang, Tong Zhao, Zhao Yang, Zhicheng Dou, Ji-Rong Wen

专题命中 其他VLM :multimodal large language model(abstract)

Comments The paper is accepted by WWW2025 Resource Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13766 2025-02-20 cs.CL 50%

GIMMICK -- Globally Inclusive Multimodal Multitask Cultural Knowledge Benchmarking

Florian Schneider, Carolin Holtermann, Chris Biemann, Anne Lauscher

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12852 2025-02-19 cs.CL 50%

MVL-SIB: A Massively Multilingual Vision-Language Benchmark for Cross-Modal Topical Matching

Fabian David Schmidt, Florian Schneider, Chris Biemann, Goran Glavaš

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18940 2025-02-17 cs.HC 50%

Amuse: Human-AI Collaborative Songwriting with Multimodal Inspirations

Yewon Kim, Sung-Ju Lee, Chris Donahue

专题命中 其他VLM :multimodal large language model(abstract)

Comments Published as a conference paper at CHI 2025. Project page: https://yewon-kim.com/amuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08193 2025-02-13 cs.CR 50%

Typographic Attacks in a Multi-Image Setting

Xiaomeng Wang, Zhengyu Zhao, Martha Larson

专题命中 其他VLM :vision-language model(abstract)

Comments Accepted by NAACL2025. Our code is available at https://github.com/XiaomengWang-AI/Typographic-Attacks-in-a-Multi-Image-Setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09013 2025-01-31 cs.CL 50%

The Impact of Visual Information in Chinese Characters: Evaluating Large Models' Ability to Recognize and Utilize Radicals

Xiaofeng Wu, Karl Stratos, Wei Xu

专题命中 其他VLM :vision-language model(abstract)

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07051 2025-01-14 cs.RO cs.HC 50%

ROSAnnotator: A Web Application for ROSBag Data Analysis in Human-Robot Interaction

Yan Zhang, Haoqi Li, Ramtin Tabatabaei, Wafa Johal

专题命中 其他VLM :multimodal large language model(abstract)

Comments Accepted to HRI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20632 2024-12-31 cs.RO cs.HC 50%

EVOLVE: Emotion and Visual Output Learning via LLM Evaluation

Jordan Sinclair, Christopher Reardon

专题命中 其他VLM :vision-language model(abstract)

Comments This work was presented at the WARN, Weighing the Benefits of Autonomous Robot Personalization, workshop at the 33rd IEEE RO-MAN 2024 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14769 2024-12-20 cs.CL 50%

PsyDraw: A Multi-Agent Multimodal System for Mental Health Screening in Left-Behind Children

Yiqun Zhang, Xiaocui Yang, Xiaobai Li, Siyuan Yu, Yi Luan, Shi Feng, Daling Wang, Yifei Zhang

专题命中 其他VLM :multimodal large language model(abstract)

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14210 2024-12-20 cs.HC cs.CY cs.SI 50%

Mobilizing Waldo: Evaluating Multimodal AI for Public Mobilization

Manuel Cebrian, Petter Holme, Niccolo Pescetelli

专题命中 其他VLM :multimodal large language model(abstract)

Comments 11 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07619 2024-12-11 cs.CL 50%

DRUM: Learning Demonstration Retriever for Large MUlti-modal Models

Ellen Yi-Ge, Jiechao Gao, Wei Han, Wei Zhu

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18908 2024-12-04 cs.HC 50%

DuetML: Human-LLM Collaborative Machine Learning Framework for Non-Expert Users

Wataru Kawabe, Yusuke Sugano

专题命中 其他VLM :MLLM(abstract)

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06078 2024-11-27 cs.RO cs.SY eess.SY 50%

PEERNet: An End-to-End Profiling Tool for Real-Time Networked Robotic Systems

Aditya Narayanan, Pranav Kasibhatla, Minkyu Choi, Po-han Li, Ruihan Zhao, Sandeep Chinchali

专题命中 其他VLM :vision language model(abstract)

Comments Accepted at IROS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10880 2024-11-15 cs.CL 50%

Exploring the Potential of Multimodal LLM with Knowledge-Intensive Multimodal ASR

Minghan Wang, Yuxia Wang, Thuy-Trang Vu, Ehsan Shareghi, Gholamreza Haffari

专题命中 其他VLM :multimodal large language model(abstract)

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17152 2024-10-23 cs.IR cs.CL 50%

Improving Pinterest Search Relevance Using Large Language Models

Han Wang, Mukuntha Narayanan Sundararaman, Onur Gungor, Yu Xu, Krishna Kamath, Rakesh Chalasani, Kurchi Subhra Hazra, Jinfeng Rao

专题命中 其他VLM :visual language model(abstract)

Comments CIKM 2024 Workshop on Industrial Recommendation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11838 2024-10-15 cs.RO cs.HC 50%

The Conversation is the Command: Interacting with Real-World Autonomous Robot Through Natural Language

Linus Nwankwo, Elmar Rueckert

专题命中 其他VLM :vision-language model(abstract)

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11941 2024-09-19 cs.RO 50%

GauTOAO: Gaussian-based Task-Oriented Affordance of Objects

Jiawen Wang, Dingsheng Luo

专题命中 其他VLM :vision-language model(abstract)

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06413 2024-09-18 cs.RO cs.CL math.OC 50%

Foundation Models to the Rescue: Deadlock Resolution in Connected Multi-Robot Systems

Kunal Garg, Songyuan Zhang, Jacob Arkin, Chuchu Fan

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15335 2024-07-23 eess.SP 50%

Addressing Out-of-Distribution Challenges in Image Semantic Communication Systems with Multi-modal Large Language Models

Feifan Zhang, Yuyang Du, Kexin Chen, Yulin Shao, Soung Chang Liew

专题命中 其他VLM :MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08882 2024-07-15 cs.HC 50%

Emerging Practices for Large Multimodal Model (LMM) Assistance for People with Visual Impairments: Implications for Design

Jingyi Xie, Rui Yu, He Zhang, Sooyeon Lee, Syed Masum Billah, John M. Carroll

专题命中 其他VLM :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07588 2024-07-02 cs.MM cs.CL 50%

AIM: Let Any Multi-modal Large Language Models Embrace Efficient In-Context Learning

Jun Gao, Qian Qiao, Ziqiang Cao, Zili Wang, Wenjie Li

专题命中 其他VLM :MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏