arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2301.10410 2023-09-19 cs.CL cs.AI cs.DB cs.IR cs.LG 62%

One Model for All Domains: Collaborative Domain-Prefix Tuning for Cross-Domain NER

Xiang Chen, Lei Li, Shuofei Qiao, Ningyu Zhang, Chuanqi Tan, Yong Jiang, Fei Huang, Huajun Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06828 2023-09-14 cs.CV cs.LG 62%

UniBrain: Universal Brain MRI Diagnosis with Hierarchical Knowledge-enhanced Pre-training

Jiayu Lei, Lisong Dai, Haoyun Jiang, Chaoyi Wu, Xiaoman Zhang, Yao Zhang, Jiangchao Yao, Weidi Xie, Yanyong Zhang, Yuehua Li, Ya Zhang, Yanfeng Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04321 2023-09-12 cs.AI cs.CL cs.CV cs.RO 62%

ARNOLD: A Benchmark for Language-Grounded Task Learning With Continuous States in Realistic 3D Scenes

Ran Gong, Jiangyong Huang, Yizhou Zhao, Haoran Geng, Xiaofeng Gao, Qingyang Wu, Wensi Ai, Ziheng Zhou, Demetri Terzopoulos, Song-Chun Zhu, Baoxiong Jia, Siyuan Huang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments The first two authors contributed equally; 20 pages; 17 figures; project availalbe: https://arnold-benchmark.github.io/ ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05162 2023-09-12 cs.CL cs.AI cs.CV 62%

Collecting Visually-Grounded Dialogue with A Game Of Sorts

Bram Willemsen, Dmytro Kalpakchi, Gabriel Skantze

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments Published at LREC 2022

Journal ref Proceedings of the Thirteenth Language Resources and Evaluation Conference (LREC 2022), pages 2257-2268, Marseille, France. European Language Resources Association

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00035 2023-09-04 cs.CV cs.AI 62%

FACET: Fairness in Computer Vision Evaluation Benchmark

Laura Gustafson, Chloe Rolland, Nikhila Ravi, Quentin Duval, Aaron Adcock, Cheng-Yang Fu, Melissa Hall, Candace Ross

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09179 2023-08-29 cs.CV cs.AI 62%

Pretrained Language Models as Visual Planners for Human Assistance

Dhruvesh Patel, Hamid Eghbalzadeh, Nitin Kamra, Michael Louis Iuzzolino, Unnat Jain, Ruta Desai

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV、cs.AI

Comments Accepted at ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03241 2023-08-22 cs.CV cs.LG 62%

PØDA: Prompt-driven Zero-shot Domain Adaptation

Mohammad Fahes, Tuan-Hung Vu, Andrei Bursuc, Patrick Pérez, Raoul de Charette

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted to ICCV 2023, Project Page: https://astra-vision.github.io/PODA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13181 2023-08-15 cs.LG cs.CV 62%

Sample-Specific Debiasing for Better Image-Text Models

Peiqi Wang, Yingcheng Liu, Ching-Yun Ko, William M. Wells, Seth Berkowitz, Steven Horng, Polina Golland

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments Machine Learning for Healthcare Conference 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07304 2023-08-11 cs.CV cs.AI 62%

CLIP-Count: Towards Text-Guided Zero-Shot Object Counting

Ruixiang Jiang, Lingbo Liu, Changwen Chen

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03269 2023-08-08 cs.CL cs.AI cs.LG 62%

Simple Rule Injection for ComplEx Embeddings

Haodi Ma, Anthony Colas, Yuejie Wang, Ali Sadeghian, Daisy Zhe Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.08914 2023-08-08 cs.LG cs.CL cs.CV 62%

$C^3$: Compositional Counterfactual Contrastive Learning for Video-grounded Dialogues

Hung Le, Nancy F. Chen, Steven C. H. Hoi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments 24th Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16019 2023-08-01 cs.CV cs.LG cs.LO 62%

Fuzzy Logic Visual Network (FLVN): A neuro-symbolic approach for visual features matching

Francesco Manigrasso, Lia Morra, Fabrizio Lamberti

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted for publication at ICIAP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17555 2023-07-24 cs.CY cs.AI cs.LG 62%

Factoring the Matrix of Domination: A Critical Review and Reimagination of Intersectionality in AI Fairness

Anaelia Ovalle, Arjun Subramonian, Vagrant Gautam, Gilbert Gee, Kai-Wei Chang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments To appear at AIES 2023

Journal ref 2023 AAAI/ACM Conference on AI, Ethics, and Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04838 2023-07-20 cs.CV cs.LG 62%

CREPE: Learnable Prompting With CLIP Improves Visual Relationship Prediction

Rakshith Subramanyam, T. S. Jayram, Rushil Anirudh, Jayaraman J. Thiagarajan

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01158 2023-07-20 cs.LG cs.AI cs.MA 62%

Theory of Mind as Intrinsic Motivation for Multi-Agent Reinforcement Learning

Ini Oguntola, Joseph Campbell, Simon Stepputtis, Katia Sycara

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments To appear at ICML 2023 Workshop on Theory of Mind

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04895 2023-07-12 cs.AI cs.LG 62%

Learning to Solve Constraint Satisfaction Problems with Recurrent Transformer

Zhun Yang, Adam Ishay, Joohyung Lee

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 22 pages. The Eleventh International Conference on Learning Representations (ICLR 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01848 2023-07-07 cs.CV cs.AI cs.RO 62%

Embodied Task Planning with Large Language Models

Zhenyu Wu, Ziwei Wang, Xiuwei Xu, Jiwen Lu, Haibin Yan

专题命中 视觉定位与Grounding :LLaVA(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://gary3410.github.io/TaPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14060 2023-06-27 cs.CV cs.CL cs.LG 62%

DesCo: Learning Object Recognition with Rich Language Descriptions

Liunian Harold Li, Zi-Yi Dou, Nanyun Peng, Kai-Wei Chang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13224 2023-06-22 cs.CV cs.CL cs.LG 62%

Peekaboo: Text to Image Diffusion Models are Zero-Shot Segmentors

Ryan Burgert, Kanchana Ranasinghe, Xiang Li, Michael S. Ryoo

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments 19 pages; contains appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06149 2023-06-13 cs.CV cs.AI 62%

Read, look and detect: Bounding box annotation from image-caption pairs

Eduardo Hugo Sanchez

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05240 2023-06-09 cs.CL cs.AI cs.CV 62%

Dealing with Semantic Underspecification in Multimodal NLP

Sandro Pezzelle

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments To appear in the Proceedings of ACL 2023 (main conference). 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03802 2023-06-07 cs.CV cs.AI 62%

Learning to Ground Instructional Articles in Videos through Narrations

Effrosyni Mavroudi, Triantafyllos Afouras, Lorenzo Torresani

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments 17 pages, 4 figures and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09941 2023-06-05 cs.CL cs.AI cs.CY cs.LG 62%

"I'm fully who I am": Towards Centering Transgender and Non-Binary Voices to Measure Biases in Open Language Generation

Anaelia Ovalle, Palash Goyal, Jwala Dhamala, Zachary Jaggers, Kai-Wei Chang, Aram Galstyan, Richard Zemel, Rahul Gupta

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Journal ref 2023 ACM Conference on Fairness, Accountability, and Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.06448 2023-05-31 cs.AI cs.LG 62%

RLang: A Declarative Language for Describing Partial World Knowledge to Reinforcement Learning Agents

Rafael Rodriguez-Sanchez, Benjamin A. Spiegel, Jennifer Wang, Roma Patel, Stefanie Tellex, George Konidaris

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15765 2023-05-26 cs.CV cs.AI 62%

Language-Guided 3D Object Detection in Point Cloud for Autonomous Driving

Wenhao Cheng, Junbo Yin, Wei Li, Ruigang Yang, Jianbing Shen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.11981 2023-05-10 cs.CL cs.AI cs.LG 62%

On Reality and the Limits of Language Data: Aligning LLMs with Human Norms

Nigel H. Collier, Fangyu Liu, Ehsan Shareghi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 9 pages; data available, see https://sites.google.com/site/nhcollier/projects/art

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.12519 2023-05-09 cs.CL cs.CV cs.LG 62%

GlyphDiffusion: Text Generation as Image Generation

Junyi Li, Wayne Xin Zhao, Jian-Yun Nie, Ji-Rong Wen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01040 2023-05-03 cs.CV cs.AI 62%

CLIP-S$^4$: Language-Guided Self-Supervised Semantic Segmentation

Wenbin He, Suphanut Jamonnak, Liang Gou, Liu Ren

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.05339 2023-04-11 cs.GR cs.CV cs.HC cs.LG 62%

A Comprehensive Review of Data-Driven Co-Speech Gesture Generation

Simbarashe Nyatsanga, Taras Kucherenko, Chaitanya Ahuja, Gustav Eje Henter, Michael Neff

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted for EUROGRAPHICS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03135 2023-04-07 cs.CV cs.AI cs.MM 62%

VLPD: Context-Aware Pedestrian Detection via Vision-Language Semantic Self-Supervision

Mengyin Liu, Jie Jiang, Chao Zhu, Xu-Cheng Yin

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏