arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1565 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1565 篇

2411.01511 2024-11-05 cs.MA cs.CL 78%

Integration of Large Vision Language Models for Efficient Post-disaster Damage Assessment and Reporting

Zhaohui Chen, Elyas Asadi Shamsabadi, Sheng Jiang, Luming Shen, Daniel Dias-da-Costa

专题命中 其他VLM :vision language model(title,abstract)

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10701 2024-10-15 cs.CL 78%

MIND: Multimodal Shopping Intention Distillation from Large Vision-language Models for E-commerce Purchase Understanding

Baixuan Xu, Weiqi Wang, Haochen Shi, Wenxuan Ding, Huihao Jing, Tianqing Fang, Jiaxin Bai, Xin Liu, Changlong Yu, Zheng Li, Chen Luo, Qingyu Yin, Bing Yin, Long Chen, Yangqiu Song

专题命中 其他VLM :vision-language model(title,abstract)

Comments EMNLP 2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13022 2024-10-11 cs.CL cs.MM 78%

SoMeLVLM: A Large Vision Language Model for Social Media Processing

Xinnong Zhang, Haoyu Kuang, Xinyi Mou, Hanjia Lyu, Kun Wu, Siming Chen, Jiebo Luo, Xuanjing Huang, Zhongyu Wei

专题命中 其他VLM :vision language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01165 2024-08-13 cs.CL 78%

LITE: Modeling Environmental Ecosystems with Multimodal Large Language Models

Haoran Li, Junqi Liu, Zexian Wang, Shiyuan Luo, Xiaowei Jia, Huaxiu Yao

专题命中 其他VLM :multimodal large language model(title,abstract)

Comments COLM camera-ready version. Code is released at https://github.com/hrlics/LITE

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07717 2024-08-09 cs.RO 78%

Reflectance Estimation for Proximity Sensing by Vision-Language Models: Utilizing Distributional Semantics for Low-Level Cognition in Robotics

Masashi Osada, Gustavo A. Garcia Ricardez, Yosuke Suzuki, Tadahiro Taniguchi

专题命中 其他VLM :vision-language model(title,abstract)

Comments 24 pages, 13 figures, submitted to Advanced Robotics Special Issue on Real-World Robot Applications of the Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21762 2024-08-01 cs.RO 78%

ReplanVLM: Replanning Robotic Tasks with Visual Language Models

Aoran Mei, Guo-Niu Zhu, Huaxiang Zhang, Zhongxue Gan

专题命中 其他VLM :visual language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14688 2024-06-19 cs.CL 78%

Taiyi-Diffusion-XL: Advancing Bilingual Text-to-Image Generation with Large Vision-Language Model Support

Xiaojun Wu, Dixiang Zhang, Ruyi Gan, Junyu Lu, Ziwei Wu, Renliang Sun, Jiaxing Zhang, Pingjian Zhang, Yan Song

专题命中 其他VLM :vision-language model(title,abstract)

Comments Taiyi-Diffusion-XL Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15983 2023-08-01 cs.MM 78%

Instance-Wise Adaptive Tuning and Caching for Vision-Language Models

Chunjin Yang, Fanman Meng, Shuai Chen, Mingyu Liu, Runtong Zhang

专题命中 其他VLM :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11619 2023-04-25 cs.CV cs.AI cs.LG 78%

SATIN: A Multi-Task Metadataset for Classifying Satellite Imagery using Vision-Language Models

Jonathan Roberts, Kai Han, Samuel Albanie

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.02872 2015-11-11 cs.CV cs.AI cs.LG 78%

Visual Language Modeling on CNN Image Representations

Hiroharu Kato, Tatsuya Harada

专题命中 其他VLM :visual language model(title);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15752 2026-07-20 cs.CV 新提交 77%

Personalized Image Aesthetic Assessment via Preference-rich Sample Mining and Cohort Merging

通过偏好丰富样本挖掘和群组合并进行个性化图像美学评估

Zhichao Yang, Tianjiao Gu, Zhixianhe Zhang, Xiangfei Sheng, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究个性化图像美学评估问题,提出基于多模态大语言模型的PRAC方法,通过偏好丰富样本挖掘和美学共鸣群组合并建模个体美学偏好,经实验验证该方法优于现有技术。

Comments The paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19915 2026-06-19 cs.CV 新提交 77%

SpatialSV: Internalizing Interpretable 3D Spatial Awareness in MLLMs via Task-Oriented Visual Supervision

SpatialSV: 通过任务导向的视觉监督在多模态大语言模型中内化可解释的3D空间感知

Jiayu Tang, Yuchen Zhou, Chao Gou

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)

专题命中 其他VLM :MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SpatialSV框架,通过任务导向的视觉监督将MLLM的2D特征提升为显式3D表示(深度图、相机姿态、点云),实现可解释的3D空间感知内化,无需外部工具,并在半监督设置中展现强泛化能力。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22208 2026-06-09 cs.CV 版本更新 77%

EvoIR-Agent: Self-Evolving Image Restoration Agentic System via Experience-Driven Learning

EvoIR-Agent: 通过经验驱动学习实现自进化图像修复智能体

Kailin Zhuang, Jiawei Wu, Zhi Jin

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出EvoIR-Agent,通过经验驱动学习解决图像修复中经验不足导致的规划失败问题,通过构建分层经验池和自进化机制提升修复性能和效率,实验表明其在全参考指标上表现优异,且在性能与效率之间取得显著平衡。

Comments Temporarily withdrawn for institutional clearance and compliance review. A revised version will be uploaded once the process is finalized

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03920 2026-06-03 cs.CV 77%

Benchmarking Visual State Tracking in Multimodal Video Understanding

多模态视频理解中的视觉状态追踪基准测试

Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk Choi, Ellis Brown, Oscar Michel, Boyang Zheng, Jinwoo Shin, Saining Xie

机构 * New York University(纽约大学) KAIST(韩国科学技术院)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。

Comments Website: https://vision-x-nyu.github.io/vstat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14569 2026-06-03 cs.CL cs.LG 77%

Social Caption: Evaluating Social Understanding in Multimodal Models

Social Caption: 评估多模态模型的社会理解能力

Leena Mathur, Bhaavanaa Thumu, Youssouf Kebe, Louis-Philippe Morency

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.LG

AI总结 提出基于交互理论的SOCIAL CAPTION框架,从社会推理、整体社会分析和定向社会分析三个维度评估多模态大语言模型的社会理解能力,并分析影响性能的因素。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30131 2026-05-29 cs.CL cs.CV 77%

CCS: Clinical Consensus Selection for Radiology Report Generation

CCS:放射学报告生成的临床共识选择

Xi Zhang, Yingshu Li, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) School of Electrical and Computer Engineering, University of Sydney(悉尼大学电气与计算机工程学院) Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出CCS框架,通过采样多个候选报告并选择临床共识最高的一个,以改进放射学报告生成在推理时的质量。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27449 2026-05-28 cs.IR cs.AI 77%

Checking Fact with Better Retrieval: Dynamic Contrastive Learning for Evidence Retrieval

用更好的检索核查事实:用于证据检索的动态对比学习

Zhongtian Hua, Yi Luo, Meijia Yu, Yingjie Han

机构 * Zhengzhou University(郑州大学) Henan University of Science and Technology(河南科技大学)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 提出动态自适应对比学习方法DACLR,通过事件级特征提取、两阶段检索和动态对比损失优化,提升多模态证据检索的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06115 2026-05-11 cs.AI 77%

CrossCult-KIBench: A Benchmark for Cross-Cultural Knowledge Insertion in MLLMs

CrossCult-KIBench:一种用于多模态大语言模型跨文化知识插入的基准测试

Zhen Zeng, Leijiang Gu, Feng Li, Jing Yu, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(民族语言智能分析与安全治理国家重点实验室,中央民族大学) School of Information Engineering, Minzu University of China(中央民族大学信息工程学院)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出CrossCult-KIBench基准测试,用于评估跨文化知识插入的有效性及非目标文化的影响,通过9800个图像场景测试不同语言文化的适应性,提出MCKI方法并揭示了当前模型在文化适应与行为保持间的平衡难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13511 2026-05-04 cs.CV cs.IR 77%

Adapting MLLMs for Nuanced Video Retrieval

为精细化视频检索适应大语言模型

Piyush Bagad, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种统一嵌入模型,通过对比损失微调文本训练的多模态大语言模型,以处理视频检索中的时间、否定和多模态细微差别,实现最先进的检索性能。

Comments 38 Pages. Project page at http://bpiyush.github.io/tara-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29602 2026-08-03 cs.CL cs.AI cs.CV cs.HC 新提交 76%

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

FriendBench:人类与多模态大语言模型的二元熟悉度推理基准

Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin

机构 * Fluid Concepts Research(流体概念研究机构)

专题命中 其他VLM :multimodal large language model(title);分类 cs.CV、cs.AI

AI总结 该研究推出FriendBench基准,通过20秒二元破冰对话片段推断两人熟悉度,对比7家公司26个模型与人类的表现,发现模型与人类准确率无统计差异但先验倾向不同,且仅人类能从可见行为中获益,同时发布了相关资源。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17823 2026-05-19 cs.CV cs.AI 76%

Why We Look Where We Look: Emergent Human-like Fixations of a Foveated Visual Language Model Maximizing Scene Understanding

为什么我们看那里:一种最大化场景理解的视网膜视觉语言模型表现出的人类样注视模式

Shravan Murlidaran, Ziqi Wen, Sana Shehabi, Miguel P. Eckstein

机构 * Psychological & Brain Sciences, University of California, Santa Barbara(加州大学圣芭芭拉分校心理学与脑科学系) Electrical and Computer Engineering, University of California, Santa Barbara(加州大学圣芭芭拉分校电气与计算机工程系) Computer Science, University of California, Santa Barbara(加州大学圣芭芭拉分校计算机科学系)

专题命中 其他VLM :visual language model(title);分类 cs.CV、cs.AI

AI总结 研究探讨了人类自由观看时注视模式的形成机制,发现最大化场景理解的视网膜视觉语言模型能够产生类似人类的注视模式,表明这种模式可能是优化场景理解的副产品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11898 2025-11-18 cs.CV cs.AI 76%

Prompt Triage: Structured Optimization Enhances Vision-Language Model Performance on Medical Imaging Benchmarks

Arnav Singhvi, Vasiliki Bikia, Asad Aali, Akshay Chaudhari, Roxana Daneshjou

机构 * Stanford University, Department of Computer Science, Stanford, CA, USA(斯坦福大学计算机科学系) Stanford University, Department of Biomedical Data Science, Stanford, CA, USA(斯坦福大学生物医学数据科学系) Stanford University, Stanford Institute for Human-Centered Artificial Intelligence, Stanford, CA, USA(斯坦福大学人类中心人工智能研究所) Stanford University, School of Medicine, Department of Dermatology, Stanford, CA, USA(斯坦福大学医学院皮肤科系) Stanford University, Department of Radiology, Stanford, CA, USA(斯坦福大学放射科)

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12854 2025-08-19 cs.AI cs.CL cs.CV cs.HC cs.MM 76%

E3RG: Building Explicit Emotion-driven Empathetic Response Generation System with Multimodal Large Language Model

Ronghao Lin, Shuai Shen, Weipeng Hu, Qiaolin He, Aolin Xiong, Li Huang, Haifeng Hu, Yap-peng Tan

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Desay SV Automotive Co., Ltd(德赛西威汽车有限公司) Pazhou Laboratory(琶洲实验室)

专题命中 其他VLM :multimodal large language model(title);分类 cs.CV、cs.AI

Comments Accepted at ACM MM 2025 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05804 2025-06-18 cs.CV cs.AI 76%

InkSight: Offline-to-Online Handwriting Conversion by Teaching Vision-Language Models to Read and Write

Blagoj Mitrevski, Arina Rak, Julian Schnitzler, Chengkun Li, Andrii Maksai, Jesse Berent, Claudiu Musat

机构 * Google DeepMind(谷歌DeepMind) EPFL(苏黎世联邦理工学院)

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI

Comments Accepted by Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06581 2025-03-28 cs.AI cs.CV 76%

Vision language models are blind: Failing to translate detailed visual features into words

Pooyan Rahmanzadehgervi, Logan Bolton, Mohammad Reza Taesiri, Anh Totti Nguyen

专题命中 其他VLM :vision language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12077 2025-03-18 cs.CV cs.AI 76%

V-Stylist: Video Stylization via Collaboration and Reflection of MLLM Agents

Zhengrong Yue, Shaobin Zhuang, Kunchang Li, Yanbo Ding, Yali Wang

专题命中 其他VLM :MLLM(title);分类 cs.CV、cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08042 2025-01-15 cs.CV cs.AI 76%

Exploring visual language models as a powerful tool in the diagnosis of Ewing Sarcoma

Alvaro Pastor-Naranjo, Pablo Meseguer, Rocío del Amor, Jose Antonio Lopez-Guerrero, Samuel Navarro, Katia Scotlandi, Antonio Llombart-Bosch, Isidro Machado, Valery Naranjo

专题命中 其他VLM :visual language model(title);分类 cs.CV、cs.AI

Comments 11 pages, 5 figures, 2 tables. Oral presentation at KES-InMed 2024 held in Madeira, Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08405 2025-01-10 cs.CV cs.AI 76%

AgroGPT: Efficient Agricultural Vision-Language Model with Expert Tuning

Muhammad Awais, Ali Husain Salem Abdulla Alharthi, Amandeep Kumar, Hisham Cholakkal, Rao Muhammad Anwer

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI

Comments Accepted at WACV, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14366 2024-12-20 cs.CV cs.AI 76%

Surrealistic-like Image Generation with Vision-Language Models

Elif Ayten, Shuai Wang, Hjalmar Snoep

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI

Comments 2023 Joint international Scientific conferences on AI and Machine Learning (BNAIC-BeNeLearn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09704 2024-10-15 cs.CV cs.LG 76%

EchoPrime: A Multi-Video View-Informed Vision-Language Model for Comprehensive Echocardiography Interpretation

Milos Vukadinovic, Xiu Tang, Neal Yuan, Paul Cheng, Debiao Li, Susan Cheng, Bryan He, David Ouyang

专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG

Comments 30 pages, 3 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏