arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2409.18073 2024-09-27 cs.AI cs.CL cs.LG 62%

Infer Human's Intentions Before Following Natural Language Instructions

Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao, Natasha Jaques

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13496 2024-09-23 cs.CV cs.AI 62%

DAP-LED: Learning Degradation-Aware Priors with CLIP for Joint Low-light Enhancement and Deblurring

Ling Wang, Chen Wu, Lin Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09177 2024-09-17 cs.CV cs.CL cs.LG 62%

Transformer with Controlled Attention for Synchronous Motion Captioning

Karim Radouane, Sylvie Ranwez, Julien Lagarde, Andon Tchechmedjiev

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07683 2024-09-13 cs.CV cs.AI 62%

Open-Vocabulary Remote Sensing Image Semantic Segmentation

Qinglong Cao, Yuntian Chen, Chao Ma, Xiaokang Yang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01695 2024-09-06 cs.CL cs.AI cs.LG 62%

Language-Guided World Models: A Model-Based Approach to AI Control

Alex Zhang, Khanh Nguyen, Jens Tuyls, Albert Lin, Karthik Narasimhan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments SpLU-RoboNLP workshop at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02084 2024-09-04 cs.RO cs.CV cs.LG 62%

GraspSplats: Efficient Manipulation with 3D Feature Splatting

Mazeyu Ji, Ri-Zhao Qiu, Xueyan Zou, Xiaolong Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Project webpage: https://graspsplats.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14895 2024-08-29 cs.AI cs.CL cs.CV 62%

VHAKG: A Multi-modal Knowledge Graph Based on Synchronized Multi-view Videos of Daily Activities

Shusaku Egami, Takahiro Ugai, Swe Nwe Nwe Htun, Ken Fukuda

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 5 pages, 4 figures, accepted by CIKM2024 Resource Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14236 2024-08-27 cs.CL cs.AI cs.LG 62%

DSTI at LLMs4OL 2024 Task A: Intrinsic versus extrinsic knowledge for type classification

Hanna Abi Akl

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 4 figures, accepted for the LLMs4OL challenge at the International Semantic Web Conference (ISWC) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08677 2024-08-19 cs.LG cs.AI 62%

Neural Reward Machines

Elena Umili, Francesco Argenziano, Roberto Capobianco

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05905 2024-08-14 cs.CV cs.AI 62%

Weakly Supervised Video Anomaly Detection and Localization with Spatio-Temporal Prompts

Peng Wu, Xuerong Zhou, Guansong Pang, Zhiwei Yang, Qingsen Yan, Peng Wang, Yanning Zhang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACMMM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03160 2024-08-14 cs.CV cs.AI 62%

User-in-the-loop Evaluation of Multimodal LLMs for Activity Assistance

Mrinal Verghese, Brian Chen, Hamid Eghbalzadeh, Tushar Nagarajan, Ruta Desai

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05772 2024-08-13 cs.CV cs.AI 62%

An analysis of HOI: using a training-free method with multimodal visual foundation models when only the test set is available, without the training set

Chaoyi Ai

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03468 2024-08-13 cs.MM cs.AI cs.CV 62%

MultiHateClip: A Multilingual Benchmark Dataset for Hateful Video Detection on YouTube and Bilibili

Han Wang, Tan Rui Yang, Usman Naseem, Roy Ka-Wei Lee

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 3 figures, ACM Multimedia 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02158 2024-08-12 cs.CV cs.LG 62%

Radar Spectra-Language Model for Automotive Scene Parsing

Mariia Pushkareva, Yuri Feldman, Csaba Domokos, Kilian Rambach, Dotan Di Castro

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01536 2024-08-09 cs.CL cs.AI cs.LG 62%

Laying Anchors: Semantically Priming Numerals in Language Modeling

Mandar Sharma, Rutuja Murlidhar Taware, Pravesh Koirala, Nikhil Muralidhar, Naren Ramakrishnan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments Accepted to the findings of NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03452 2024-08-05 cs.CV cs.LG 62%

Multimodal Guidance Network for Missing-Modality Inference in Content Moderation

Zhuokai Zhao, Harish Palani, Tianyi Liu, Lena Evans, Ruth Toner

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

Comments ICME 2024 Camera Ready. Code is available at https://github.com/zhuokaizhao/multimodal-guidance-network

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21267 2024-08-01 cs.RO cs.AI cs.CV 62%

DEF-oriCORN: efficient 3D scene understanding for robust language-directed manipulation without demonstrations

Dongwon Son, Sanghyeon Son, Jaehyung Kim, Beomjoon Kim

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17291 2024-07-25 cs.HC cs.AI cs.CL cs.CV 62%

How Good (Or Bad) Are LLMs at Detecting Misleading Visualizations?

Leo Yu-Ho Lo, Huamin Qu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments To be presented at IEEE VIS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17553 2024-07-23 cs.AI cs.CL cs.CV cs.HC 62%

OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web

Raghav Kapoor, Yash Parag Butala, Melisa Russak, Jing Yu Koh, Kiran Kamble, Waseem Alshikh, Ruslan Salakhutdinov

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15770 2024-07-16 cs.CV cs.CL cs.LG 62%

ChEX: Interactive Localization and Region Description in Chest X-rays

Philip Müller, Georgios Kaissis, Daniel Rueckert

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07532 2024-07-16 cs.CV cs.AI cs.CL 62%

Interfacing Foundation Models' Embeddings

Xueyan Zou, Linjie Li, Jianfeng Wang, Jianwei Yang, Mingyu Ding, Junyi Wei, Zhengyuan Yang, Feng Li, Hao Zhang, Shilong Liu, Arul Aravinthan, Yong Jae Lee, Lijuan Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments CODE: https://github.com/UX-Decoder/FIND

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13556 2024-07-15 cs.CV cs.AI 62%

Find n' Propagate: Open-Vocabulary 3D Object Detection in Urban Environments

Djamahl Etchegaray, Zi Huang, Tatsuya Harada, Yadan Luo

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments To appear in ECCV 2024. Source code: https://github.com/djamahl99/findnpropagate

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08585 2024-07-12 cs.RO cs.AI cs.LG 62%

HACMan++: Spatially-Grounded Motion Primitives for Manipulation

Bowen Jiang, Yilin Wu, Wenxuan Zhou, Chris Paxton, David Held

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07296 2024-07-11 physics.med-ph cs.AI cs.CV 62%

Large Language Model-Augmented Auto-Delineation of Treatment Target Volume in Radiation Therapy

Praveenbalaji Rajendran, Yong Yang, Thomas R. Niedermayr, Michael Gensheimer, Beth Beadle, Quynh-Thu Le, Lei Xing, Xianjin Dai

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05657 2024-07-11 cs.AI cs.CL cs.LG 62%

Agent Lumos: Unified and Modular Training for Open-Source Language Agents

Da Yin, Faeze Brahman, Abhilasha Ravichander, Khyathi Chandu, Kai-Wei Chang, Yejin Choi, Bill Yuchen Lin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments Accepted to ACL 2024 Main Conference; Camera Ready. Project website: https://allenai.github.io/lumos/

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.03105 2024-07-10 cs.AI cs.CV 62%

MetaCOG: A Hierarchical Probabilistic Model for Learning Meta-Cognitive Visual Representations

Marlene D. Berke, Zhangir Azerbayev, Mario Belledonne, Zenna Tavares, Julian Jara-Ettinger

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments 23 pages, 7 figures, UAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.11905 2024-07-09 cs.AI cs.LG cs.RO 62%

Grounded Relational Inference: Domain Knowledge Driven Explainable Autonomous Driving

Chen Tang, Nishan Srishankar, Sujitha Martin, Masayoshi Tomizuka

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 19 pages, 15 figures, IEEE Transactions on Intelligent Transportation Systems (T-ITS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02625 2024-07-04 eess.IV cs.CV cs.LG 62%

Lung-CADex: Fully automatic Zero-Shot Detection and Classification of Lung Nodules in Thoracic CT Images

Furqan Shaukat, Syed Muhammad Anwar, Abhijeet Parida, Van Khanh Lam, Marius George Linguraru, Mubarak Shah

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01907 2024-07-03 cs.CV cs.LG 62%

The Solution for the ICCV 2023 Perception Test Challenge 2023 -- Task 6 -- Grounded videoQA

Hailiang Zhang, Dian Chao, Zhihao Guan, Yang Yang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10952 2024-06-25 cs.CL cs.AI cs.LG 62%

LMDX: Language Model-based Document Information Extraction and Localization

Vincent Perot, Kai Kang, Florian Luisier, Guolong Su, Xiaoyu Sun, Ramya Sree Boppana, Zilong Wang, Zifeng Wang, Jiaqi Mu, Hao Zhang, Chen-Yu Lee, Nan Hua

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏