arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2510.24010 2025-10-29 cs.CV cs.AI cs.LG 67%

Mars-Bench: A Benchmark for Evaluating Foundation Models for Mars Science Tasks

Mirali Purohit, Bimal Gajera, Vatsal Malaviya, Irish Mehta, Kunal Kasodekar, Jacob Adler, Steven Lu, Umaa Rebbapragada, Hannah Kerner

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) School of Earth and Space Exploration, Arizona State University(地球与空间探索学院,亚利桑那州立大学) Jet Propulsion Laboratory, California Institute of Technology(喷气推进实验室,加州理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15963 2025-10-28 cs.CV cs.AI cs.LG 67%

ESCA: Contextualizing Embodied Agents via Scene-Graph Generation

Jiani Huang, Amish Sethi, Matthew Kuo, Mayank Keoliya, Neelay Velingker, JungHo Jung, Ser-Nam Lim, Ziyang Li, Mayur Naik

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted as a Spotlight Paper at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22521 2025-10-28 cs.CV cs.AI cs.IR cs.LG 67%

Open Multimodal Retrieval-Augmented Factual Image Generation

Yang Tian, Fan Liu, Jingyuan Zhang, Wei Bi, Yupeng Hu, Liqiang Nie

机构 * Shandong University(山东大学) National University of Singapore(新加坡国立大学) Kuaishou Technology(快手科技) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18111 2025-10-14 cs.LG cs.AI cs.CV 67%

Prompt Optimization Meets Subspace Representation Learning for Few-shot Out-of-Distribution Detection

Faizul Rakib Sayem, Shahana Ibrahim

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07513 2025-10-10 cs.LG cs.AI cs.CV cs.DB 67%

MLLM4TS: Leveraging Vision and Multimodal Language Models for General Time-Series Analysis

Qinghua Liu, Sam Heshmati, Zheda Mai, Zubin Abraham, John Paparrizos, Liu Ren

机构 * The Ohio State University(俄亥俄州立大学) Bosch Research North America(博世北美研究)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17931 2025-10-07 cs.CV cs.AI cs.LG 67%

AutoMiSeg: Automatic Medical Image Segmentation via Test-Time Adaptation of Foundation Models

Xingjian Li, Qifeng Wu, Adithya S. Ubaradka, Yiran Ding, Colleen Que, Runmin Jiang, Jianhua Xing, Tianyang Wang, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Brown University(布朗大学) National Institute of Technology Karnataka(印度卡纳塔克国家理工学院) University of Pittsburgh(匹兹堡大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01004 2025-10-02 cs.CV cs.AI cs.LG 67%

TextCAM: Explaining Class Activation Map with Text

Qiming Zhao, Xingjian Li, Xiaoyu Cao, Xiaolong Wu, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15772 2025-10-01 cs.SD cs.CL eess.AS 67%

MIKU-PAL: An Automated and Standardized Multi-Modal Method for Speech Paralinguistic and Affect Labeling

Yifan Cheng, Ruoyi Zhang, Jiatong Shi

机构 * Santa Clara, CA, USA(美国圣克拉拉) Carnegie Mellon University(卡内基梅隆大学) Huazhong University of Science and Technology(华中科技大学) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract)

Comments Accepted by Interspeech

Journal ref Proc. of Interspeech2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23281 2025-09-30 cs.RO 67%

Preventing Robotic Jailbreaking via Multimodal Domain Adaptation

Francesco Marchiori, Rohan Sinha, Christopher Agia, Alexander Robey, George J. Pappas, Mauro Conti, Marco Pavone

机构 * University of Padova(帕多瓦大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学) Örebro University(奥雷布罗大学) NVIDIA Research(NVIDIA研究)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments Project page: https://j-dapt.github.io/. 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21979 2025-09-30 cs.CL 67%

Pearl: A Multimodal Culturally-Aware Arabic Instruction Dataset

Fakhraddin Alwajih, Samar M. Magdy, Abdellah El Mekki, Omer Nacar, Youssef Nafea, Safaa Taher Abdelfadil, Abdulfattah Mohammed Yahya, Hamzah Luqman, Nada Almarwani, Samah Aloufi, Baraah Qawasmen, Houdaifa Atou, Serry Sibaee, Hamzah A. Alsayadi, Walid Al-Dhabyani, Maged S. Al-shaibani, Aya El Aatar, Nour Qandos, Rahaf Alhamouri, Samar Ahmad, Mohammed Anwar Al-Ghrawi, Aminetou Yacoub, Ruwa AbuHweidi, Vatimetou Mohamed Lemin, Reem Abdel-Salam, Ahlam Bashiti, Aisha Alansari, Ahmed Ashraf, Nora Alturayeif, Alcides Alcoba Inciarte, Adel Ammar, Abdelrahim A. Elmadany, Mohamedou Cheikh Tourad, Ismail Berrada, Mustafa Jarrar, Shady Shehata, Muhammad Abdul-Mageed

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments https://github.com/UBC-NLP/pearl

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.12881 2025-09-29 cs.CL 67%

TEXT2AFFORD: Probing Object Affordance Prediction abilities of Language Models solely from Text

Sayantan Adak, Daivik Agrawal, Animesh Mukherjee, Somak Aditya

机构 * IIT, Kharagpur(印度Kharagpur理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments Accepted at Conference on Computational Natural Language Learning 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14119 2025-09-26 cs.CV cs.AI cs.CL cs.LG 67%

NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining

Maksim Kuprashevich, Grigorii Alekseenko, Irina Tolstykh, Georgii Fedorov, Bulat Suleimanov, Vladimir Dokholyan, Aleksandr Gordeev

机构 * R&D Department, SALUTEDEV(SALUTEDEV 研发部)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14967 2025-09-22 cs.RO cs.HC 67%

Affordance-Based Disambiguation of Surgical Instructions for Collaborative Robot-Assisted Surgery

Ana Davila, Jacinto Colan, Yasuhisa Hasegawa

机构 * Nagoya University, Japan(名古屋大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments To be presented at the 1st Workshop on Intelligent Cobodied Assistance and Robotic Empowerment (iCARE). 2025 Conference on Robot Learning (CoRL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12876 2025-09-17 cs.CL cs.MM 67%

Benchmarking and Improving LVLMs on Event Extraction from Multimedia Documents

Fuyu Xing, Zimu Wang, Wei Wang, Haiyang Zhang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(先进技术学院,西安交通大学利物浦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments Accepted at INLG 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02915 2025-09-04 cs.CL 67%

English Pronunciation Evaluation without Complex Joint Training: LoRA Fine-tuned Speech Multimodal LLM

Taekyung Ahn, Hosung Nam

机构 * Enuma, Inc.(Enuma公司) Korea University(韩国大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20537 2025-09-01 cs.RO 67%

CoRI: Communication of Robot Intent for Physical Human-Robot Interaction

Junxiang Wang, Emek Barış Küçüktabak, Rana Soltani Zarrin, Zackory Erickson

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments To be published in Proceedings of the 9th Conference on Robot Learning (CoRL). 34 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09767 2025-08-20 cs.RO 67%

DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting

Ce Hao, Kelvin Lin, Zhiwei Xue, Siyuan Luo, Harold Soh

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Smart Systems Institute, NUS(NUS智能系统研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

Journal ref IEEE Robotics and Automation Letters ( Volume: 10, Issue: 10, October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11886 2025-08-19 cs.CV cs.AI cs.CL cs.LG eess.IV 67%

EVTP-IVS: Effective Visual Token Pruning For Unifying Instruction Visual Segmentation In Multi-Modal Large Language Models

Wenhui Zhu, Xiwen Chen, Zhipeng Wang, Shao Tang, Sayan Ghosh, Xuanzhao Dong, Rajat Koner, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) LinkedIn Corporation(领英公司) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20411 2025-07-29 cs.CL 67%

CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning

George Ibrahim, Rita Ramos, Yova Kementchedjhieva

机构 * Department of Natural Language Processing, MBZUAI(自然语言处理部门,MBZUAI) INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments Published as a conference paper at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17379 2025-07-24 cs.RO 67%

Language-Conditioned Open-Vocabulary Mobile Manipulation with Pretrained Models

Shen Tan, Dong Zhou, Xiangyu Shao, Junqiao Wang, Guanghui Sun

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

Comments IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10087 2025-07-15 cs.RO 67%

Foundation Model Driven Robotics: A Comprehensive Review

Muhammad Tayyab Khan, Ammar Waheed

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(德克萨斯农工大学J. Mike Walker ’66机械工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09174 2025-07-15 cs.CL 67%

RAMA: Retrieval-Augmented Multi-Agent Framework for Misinformation Detection in Multimodal Fact-Checking

Shuo Yang, Zijian Yu, Zhenzhe Ying, Yuqin Dai, Guoqing Wang, Jun Lan, Jinfeng Xu, Jinze Li, Edith C. H. Ngai

机构 * The University of Hong Kong(香港大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23122 2025-07-01 cs.CL cs.CY 67%

Decoding Memes: Benchmarking Narrative Role Classification across Multilingual and Multimodal Models

Shivam Sharma, Tanmoy Chakraborty

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15425 2025-06-19 cs.CL 67%

Understanding GUI Agent Localization Biases through Logit Sharpness

Xingjian Tao, Yiwei Wang, Yujun Cai, Zhicheng Yang, Jing Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) University of California, Merced(加州大学梅德福分校) The University of Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19267 2025-06-11 cs.CL cs.AI cs.CV cs.LG 67%

VIST-GPT: Ushering in the Era of Visual Storytelling with LLMs?

Mohamed Gado, Towhid Taliee, Muhammad Memon, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg, Germany(计算机视觉实验室,CAIDAS,乌尔姆大学,德国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05414 2025-06-09 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 67%

SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing

Mingfei Chen, Zijun Cui, Xiulong Liu, Jinlin Xiang, Caleb Zheng, Jingyuan Li, Eli Shlizerman

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Project website with demo videos: https://zijuncui02.github.io/SAVVY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01344 2025-06-03 cs.CL 67%

Follow the Flow: Fine-grained Flowchart Attribution with Neurosymbolic Agents

Manan Suri, Puneet Mathur, Nedim Lipka, Franck Dernoncourt, Ryan A. Rossi, Vivek Gupta, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Adobe Research(Adobe研究) ASU(亚利桑那州立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20070 2025-06-03 cs.CV cs.AI cs.CL cs.LG 67%

Exploring Compositional Generalization of Multimodal LLMs for Medical Imaging

Zhenyang Cai, Junying Chen, Rongsheng Wang, Weihong Wang, Yonglin Deng, Dingjie Song, Yize Chen, Zixu Zhang, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13123 2025-05-20 cs.CV cs.AI cs.LG 67%

Just Dance with $π$! A Poly-modal Inductor for Weakly-supervised Video Anomaly Detection

Snehashis Majhi, Giacomo D'Amicantonio, Antitza Dantcheva, Quan Kong, Lorenzo Garattoni, Gianpiero Francesca, Egor Bondarev, Francois Bremond

机构 * INRIA Côte d’Azur University(科西嘉-阿兹尔大学) Woven by Toyota(丰田编织公司) Toyota Motor Europe(丰田欧洲公司) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03757 2025-05-09 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Lexicon3D: Probing Visual Foundation Models for Complex 3D Scene Understanding

Yunze Man, Shuhong Zheng, Zhipeng Bao, Martial Hebert, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

Comments NeurIPS 2024. Project page: https://yunzeman.github.io/lexicon3d Github: https://github.com/YunzeMan/Lexicon3D

详情

展开后加载摘要…

URL PDF HTML 收藏