arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7314 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7314 篇

2509.25564 2025-10-01 cs.CV 83%

FishNet++: Analyzing the capabilities of Multimodal Large Language Models in marine biology

Faizan Farooq Khan, Yousef Radwan, Eslam Abdelrahman, Abdulwahab Felemban, Aymen Mir, Nico K. Michiels, Andrew J. Temple, Michael L. Berumen, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Red Sea Research Center, KAUST(红海研究中心,KAUST) Tübingen University(图宾根大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 3 figures 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21788 2025-09-29 cs.CV 83%

MIRG-RL: Multi-Image Reasoning and Grounding with Reinforcement Learning

Lihao Zheng, Jiawei Chen, Xintian Shen, Hao Ma, Tao Wei

机构 * Li Auto Inc.(利亚 Auto 公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06899 2025-09-25 cs.CL cs.AI 83%

VisualTrap: A Stealthy Backdoor Attack on GUI Agents via Visual Grounding Manipulation

Ziang Ye, Yang Zhang, Wentao Shi, Xiaoyu You, Fuli Feng, Tat-Seng Chua

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) East China University of Science and Technology(东华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.AI

Comments Accepted in COLM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09595 2025-09-18 cs.CV 83%

Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis

Yikang Ding, Jiwen Liu, Wenyuan Zhang, Zekun Wang, Wentao Hu, Liyuan Cui, Mingming Lao, Yingchao Shao, Hui Liu, Xiaohan Li, Ming Chen, Xiaoqiang Liu, Yu-Shen Liu, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视觉定位与Grounding :grounding(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Technical Report. Project Page: https://klingavatar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02573 2025-09-16 cs.CV 83%

Remote Sensing SpatioTemporal Vision-Language Models: A Comprehensive Survey

Chenyang Liu, Jiafan Zhang, Keyan Chen, Man Wang, Zhengxia Zou, Zhenwei Shi

机构 * Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(航空航天智能科学与技术系,航天学院,北航) Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education, China(航天器设计优化与动态仿真技术重点实验室,教育部,中国) College of Computer Science, Inner Mongolia University(计算机科学学院,内蒙古大学) Shen Yuan Honors College of Beihang University(盛元荣誉学院,北航)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV

Comments Published in IEEE Geoscience and Remote Sensing Magazine

Journal ref IEEE Geoscience and Remote Sensing Magazine, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08336 2025-09-15 cs.CV 83%

Talk2PC: Enhancing 3D Visual Grounding through LiDAR and Radar Point Clouds Fusion for Autonomous Driving

Runwei Guan, Jianan Liu, Ningwei Ouyang, Shaofeng Liang, Daizong Liu, Xiaolou Sun, Lianqing Zheng, Ming Xu, Yutao Yue, Guoqiang Mao, Hui Xiong

机构 * Thrust of Artificial Intelligence, Hong Kong University of Science and Technology (Guangzhou), China(香港理工大学(广州)人工智能研究所) Mononai AI, Sweden(蒙诺人工智能) College of Computer Science and Technology, China University of Petroleum (East China)(中国石油大学(华东)计算机科学与技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) School of Automation, Southeast University(东南大学自动化学院) College of Science and Engineering, James Cook University(詹姆斯库克大学科学与工程学院) School of Transportation, Southeast University(东南大学交通运输学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08008 2025-09-11 cs.SI cs.AI cs.MM 83%

A New Dataset and Benchmark for Grounding Multimodal Misinformation

Bingjian Yang, Danni Xu, Kaipeng Niu, Wenxuan Liu, Zheng Wang, Mohan Kankanhalli

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(多媒体软件国家工程研究中心,计算机科学学院,武汉大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学) School of Computer Science, Peking University(计算机科学学院,北京大学) State Key Laboratory for Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract);分类 cs.AI

Comments 6 pages, 5 figures, ACM Multimedia 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04758 2025-09-08 cs.CV 83%

Dynamic Group Detection using VLM-augmented Temporal Groupness Graph

Kaname Yokoyama, Chihiro Nakatani, Norimichi Ukita

机构 * Toyota Technological Institute(丰田技术研究所)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 10 pages, Accepted to ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03800 2025-09-05 cs.CV 83%

MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting

Yuheng Li, Yenho Chen, Yuxiang Lai, Jike Zhong, Vanessa Wildman, Xiaofeng Yang

机构 * Department of Biomedical Engineering(生物医学工程系) Georgia Institute of Technology(佐治亚理工学院) Department of Machine Learning(机器学习系) Department of Radiation Oncology(放射肿瘤科) Emory University School of Medicine(埃默里大学医学院) University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20830 2025-08-29 cs.CV 83%

Estimating 2D Keypoints of Surgical Tools Using Vision-Language Models with Low-Rank Adaptation

Krit Duangprom, Tryphon Lambrou, Binod Bhattarai

机构 * University of Aberdeen(阿伯丁大学)

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted to MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09625 2025-08-27 cs.CV cs.CL 83%

Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment

Xiaoxu Xu, Yitian Yuan, Qiudan Zhang, Wenhui Wu, Zequn Jie, Lin Ma, Xu Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Meituan Inc.(美团公司) College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) Guangdong Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17976 2025-08-26 cs.CV eess.IV 83%

Propose and Rectify: A Forensics-Driven MLLM Framework for Image Manipulation Localization

Keyang Zhang, Chenqi Kong, Hui Liu, Bo Ding, Xinghao Jiang, Haoliang Li

机构 * Department of Electrical Engineering, City University of Hong Kong(香港城市大学电子工程系) Rapid-Rich Object Search (ROSE) Lab, School of Electrical and Electronic Engineering, Nanyang Technology University(南洋理工大学电子与电气工程学院快速丰富对象搜索(ROSE)实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :MLLM(title);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16974 2025-08-26 cs.CV 83%

Hierarchical Contextual Grounding LVLM: Enhancing Fine-Grained Visual-Language Understanding with Robust Grounding

Leilei Guo, Antonio Carlos Rivera, Peiyu Tang, Haoxuan Ren, Zheyu Song

机构 * Zhongkai University of Agriculture and Engineering(仲恺农业工程大学) EDP University of Puerto Rico: San Sebastian(波多黎各圣塞巴斯蒂安EDP大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04562 2025-08-22 cs.GR cs.CV 83%

Handle-based Mesh Deformation Guided By Vision Language Model

Xingpeng Sun, Shiyang Jia, Zherong Pan, Kui Wu, Aniket Bera

机构 * Purdue University(普渡大学) LightSpeed Studios University of California San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07925 2025-08-12 cs.CV 83%

TAG: A Simple Yet Effective Temporal-Aware Approach for Zero-Shot Video Temporal Grounding

Jin-Seop Lee, SungJoon Lee, Jaehan Ahn, YunSeok Choi, Jee-Hyong Lee

机构 * Sungkyunkwan University(顺天大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06317 2025-08-11 cs.CV 83%

Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Temporal Grounding

Jian Hu, Zixu Cheng, Shaogang Gong, Isabel Guan, Jianye Hao, Jun Wang, Kun Shao

机构 * Queen Mary University of London(伦敦女王学院) Hong Kong University of Science and Technology(香港科学与技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04572 2025-08-07 cs.CV 83%

Knowledge to Sight: Reasoning over Visual Attributes via Knowledge Decomposition for Abnormality Grounding

Jun Li, Che Liu, Wenjia Bai, Mingxuan Liu, Rossella Arcucci, Cosmin I. Bercea, Julia A. Schnabel

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国学院) University of Trento(特伦托大学) Helmholtz AI and Helmholtz Munich(海德堡人工智能与海德堡慕尼黑) King’s College London(伦敦国王学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04389 2025-08-07 cs.AI 83%

GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning

Weitai Kang, Bin Lei, Gaowen Liu, Caiwen Ding, Yan Yan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Minnesota(明尼苏达大学) Cisco Research(思科研究)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15542 2025-08-05 cs.CV 83%

HOLa: Zero-Shot HOI Detection with Low-Rank Decomposed VLM Feature Adaptation

Qinqian Lei, Bo Wang, Robby T. Tan

机构 * National University of Singapore(国立新加坡大学) University of Mississippi(密苏里大学) ASUS Intelligent Cloud Services (AICS)(ASUS智能云服务(AICS))

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12332 2025-07-23 cs.CV 83%

MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs

Yunqiu Xu, Linchao Zhu, Yi Yang

机构 * ReLER Lab, CCAI Zhejiang University(ReLER实验室,中国浙江大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15285 2025-07-22 cs.CV 83%

In-context Learning of Vision Language Models for Detection of Physical and Digital Attacks against Face Recognition Systems

Lazaro Janier Gonzalez-Soler, Maciej Salwowski, Christoph Busch

机构 * da/sec - Biometrics and Security Research Group(da/sec生物识别与安全研究组) Technical University of Denmark(丹麦技术大学)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV

Comments Submitted to IEEE-TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03770 2025-07-18 cs.CR cs.AI 83%

JailDAM: Jailbreak Detection with Adaptive Memory for Vision-Language Model

Yi Nian, Shenzhe Zhu, Yuehan Qin, Li Li, Ziyi Wang, Chaowei Xiao, Yue Zhao

机构 * University of Southern California(南加州大学) University of Toronto(多伦多大学) University of Maryland(马里兰大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :vision-language model(title);VLM(abstract);multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06510 2025-07-10 cs.CV 83%

Bilateral Collaboration with Large Vision-Language Models for Open Vocabulary Human-Object Interaction Detection

Yupeng Hu, Changxing Ding, Chang Sun, Shaoli Huang, Xiangmin Xu

机构 * South China University of Technology(南方科技大学) Tencent AI Lab(腾讯人工智能实验室) Foshan University(佛山大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06232 2025-07-09 cs.CV 83%

Challenging Vision-Language Models with Surgical Data: A New Dataset and Broad Benchmarking Study

Leon Mayer, Tim Rädsch, Dominik Michael, Lucas Luttner, Amine Yamlahi, Evangelia Christodoulou, Patrick Godau, Marcel Knopp, Annika Reinke, Fiona Kolbinger, Lena Maier-Hein

机构 * organization= German Cancer Research Center (DKFZ) Heidelberg, Div. Intelligent Medical Systems , country= Germany organization= National Center for Tumor Diseases (NCT), NCT Heidelberg , country= Germany Data Science School for Health , country= Germany organization= Medical Faculty, Heidelberg University , country= Germany organization= Faculty of Mathematics Computer Science, Heidelberg University , country= Germany organization= Weldon School of Biomedical Engineering, Purdue University , city= West Lafayette , state= IN , country= USA organization= Regenstrief Center for Healthcare Engineering (RCHE), Purdue University , city= West Lafayette , state= IN , country= USA organization= Department of Biostatistics Health Data Science, Richard M. Fairbanks School of Public Health, Indiana University School of Medicine , city= Indianapolis , state= IN , country= USA organization= Department of Surgery, Indiana University School of Medicine , city= Indianapolis , state= IN , country= USA organization= Department of Visceral, Thoracic Vascular Surgery, University Hospital Faculty of Medicine Carl Gustav Carus, TUD Dresden University of Technology , city= Dresden , country= Germany

专题命中 视觉定位与Grounding :vision-language model(title);vision language model(abstract);visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02664 2025-07-08 cs.CV 83%

AIGI-Holmes: Towards Explainable and Generalizable AI-Generated Image Detection via Multimodal Large Language Models

Ziyin Zhou, Yunpeng Luo, Yuanchen Wu, Ke Sun, Jiayi Ji, Ke Yan, Shouhong Ding, Xiaoshuai Sun, Yunsheng Wu, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Tencent YouTu Lab(腾讯YouTu实验室)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22375 2025-06-30 cs.CV 83%

Exploiting Vision Language Model for Training-Free 3D Point Cloud OOD Detection via Graph Score Propagation

Tiankai Chen, Yushu Li, Adam Goodge, Fei Teng, Xulei Yang, Tianrui Li, Xun Xu

机构 * School of Computing and Artificial Intelligence,Southwest Jiaotong University(计算机与人工智能学院,西南交通大学) South China University of Technology(华南理工大学) Institute for infocomm research, A*STAR(信息通信研究所,A*STAR)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21924 2025-06-30 cs.CV 83%

SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding

Zhao Jin, Rong-Cheng Tu, Jingyi Liao, Wenhao Sun, Xiao Luo, Shunyu Liu, Dacheng Tao

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23131 2025-06-19 cs.CV 83%

RefChartQA: Grounding Visual Answer on Chart Images through Instruction Tuning

Alexander Vogel, Omar Moured, Yufan Chen, Jiaming Zhang, Rainer Stiefelhagen

机构 * CV:HCI lab, Karlsruhe Institute of Technology, Germany.(CV:HCI实验室,卡尔斯鲁厄理工学院,德国) CVG, ETH, Switzerland.(CVG,瑞士联邦理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(abstract);分类 cs.CV

Comments Accepted by ICDAR 2025. All models and code will be publicly available at https://github.com/moured/RefChartQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05061 2025-06-17 cs.CV 83%

Test-time Contrastive Concepts for Open-world Semantic Segmentation with Vision-Language Models

Monika Wysoczańska, Antonin Vobecky, Amaia Cardiel, Tomasz Trzciński, Renaud Marlet, Andrei Bursuc, Oriane Siméoni

机构 * Warsaw University of Technology(华沙技术大学) CIIRC CTU Prague(布拉格CTU计算机科学与机器人研究所) FEE CTU Prague(布拉格CTU电子工程系) Tooploox LIGM, École des Ponts et Chaussées, IP Paris, CNRS, France(法国巴黎理工学院LIGM研究所) Université Grenoble Alpes(格勒诺布尔大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

Comments TMLR camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10465 2025-06-13 cs.CV 83%

MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models

Yu Huang, Zelin Peng, Yichen Zhao, Piao Yang, Xiaokang Yang, Wei Shen

机构 * Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine, Hangzhou, Zhejiang, China(放射科、浙江大学医学院附属第一医院、浙江大学医学院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

Comments †: Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏