arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2406.08819 2024-06-19 cs.LG cs.AI stat.ML 62%

AIM: Attributing, Interpreting, Mitigating Data Unfairness

Zhining Liu, Ruizhong Qiu, Zhichen Zeng, Yada Zhu, Hendrik Hamann, Hanghang Tong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 12 pages, 6 figures, accepted by ACM SIGKDD 2024. Webpage: https://github.com/ZhiningLiu1998/AIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10961 2024-06-18 cs.CV cs.AI cs.CY 62%

Open-Vocabulary X-ray Prohibited Item Detection via Fine-tuning CLIP

Shuyang Lin, Tong Jia, Hao Wang, Bowen Ma, Mingyuan Li, Dongyue Chen

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03479 2024-06-17 cs.LG cs.AI 62%

DRED: Zero-Shot Transfer in Reinforcement Learning via Data-Regularised Environment Design

Samuel Garcin, James Doran, Shangmin Guo, Christopher G. Lucas, Stefano V. Albrecht

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments To appear in ICML 2024. A preliminary version of this work (arXiv:2310.03494) was presented at the ALOE workshop, NeurIPS 2023. arXiv admin note: text overlap with arXiv:2310.03494

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08009 2024-06-13 cs.CV cs.AI cs.RO 62%

OpenObj: Open-Vocabulary Object-Level Neural Radiance Fields with Fine-Grained Understanding

Yinan Deng, Jiahui Wang, Jingyu Zhao, Jianyu Dou, Yi Yang, Yufeng Yue

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 7figures. Project Url: https://openobj.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00345 2024-06-04 cs.CV cs.LG 62%

DeCoOp: Robust Prompt Tuning with Out-of-Distribution Detection

Zhi Zhou, Ming Yang, Jiang-Xin Shi, Lan-Zhe Guo, Yu-Feng Li

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted by ICML 2024. Code is available at: https://wnjxyk.github.io/DeCoOp

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19616 2024-06-04 cs.AI cs.CL cs.LG 62%

Easy Problems That LLMs Get Wrong

Sean Williams, James Huckle

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments AutogenAI Ltd. GitHub Repo: https://github.com/autogenai/easy-problems-that-llms-get-wrong

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20991 2024-06-03 cs.CV cs.LG 62%

Hard Cases Detection in Motion Prediction by Vision-Language Foundation Models

Yi Yang, Qingwen Zhang, Kei Ikemura, Nazre Batool, John Folkesson

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.LG

Comments IEEE Intelligent Vehicles Symposium (IV) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18414 2024-05-29 cs.CL cs.AI cs.LG cs.SI 62%

Don't Forget to Connect! Improving RAG with Graph-based Reranking

Jialin Dong, Bahare Fatemi, Bryan Perozzi, Lin F. Yang, Anton Tsitsulin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11397 2024-05-21 cs.LG cs.AI cs.SY eess.SY 62%

Preparing for Black Swans: The Antifragility Imperative for Machine Learning

Ming Jin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09783 2024-05-17 cs.LG cs.AI cs.CE 62%

LLM and Simulation as Bilevel Optimizers: A New Paradigm to Advance Physical Scientific Discovery

Pingchuan Ma, Tsun-Hsuan Wang, Minghao Guo, Zhiqing Sun, Joshua B. Tenenbaum, Daniela Rus, Chuang Gan, Wojciech Matusik

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04180 2024-05-08 cs.LG cs.CV 62%

Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models

Zhixuan Chu, Lei Zhang, Yichen Sun, Siqiao Xue, Zhibo Wang, Zhan Qin, Kui Ren

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.LG

Comments arXiv admin note: text overlap with arXiv:2306.08302, arXiv:2403.05131 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07661 2024-05-08 cs.CV cs.CL cs.LG cs.MM 62%

CLIP as RNN: Segment Countless Visual Concepts without Training Endeavor

Shuyang Sun, Runjia Li, Philip Torr, Xiuye Gu, Siyang Li

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.LG

Comments To appear in CVPR 2024. Project page: https://torrvision.com/clip_as_rnn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07761 2024-05-08 cs.CV cs.AI cs.RO 62%

Amodal Optical Flow

Maximilian Luz, Rohit Mohan, Ahmed Rida Sekkat, Oliver Sawade, Elmar Matthes, Thomas Brox, Abhinav Valada

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02305 2024-05-07 cs.CV cs.AI cs.CL eess.IV 62%

Inserting Faces inside Captions: Image Captioning with Attention Guided Merging

Yannis Tevissen, Khalil Guetari, Marine Tassel, Erwan Kerleroux, Frédéric Petitpont

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01970 2024-05-07 cs.CV cs.AI 62%

FMGS: Foundation Model Embedded 3D Gaussian Splatting for Holistic 3D Scene Understanding

Xingxing Zuo, Pouya Samangouei, Yunwen Zhou, Yan Di, Mingyang Li

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Project page: https://xingxingzuo.github.io/fmgs

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02985 2024-04-30 cs.CV cs.LG 62%

Applying Unsupervised Semantic Segmentation to High-Resolution UAV Imagery for Enhanced Road Scene Parsing

Zihan Ma, Yongshang Li, Ronggui Ma, Chen Liang

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06866 2024-04-30 cs.CL cs.AI cs.LG 62%

Health-LLM: Large Language Models for Health Prediction via Wearable Sensor Data

Yubin Kim, Xuhai Xu, Daniel McDuff, Cynthia Breazeal, Hae Won Park

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00843 2024-04-29 cs.IR cs.AI cs.CL cs.LG 62%

Large Language Models are Learnable Planners for Long-Term Recommendation

Wentao Shi, Xiangnan He, Yang Zhang, Chongming Gao, Xinyue Li, Jizhi Zhang, Qifan Wang, Fuli Feng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15946 2024-04-25 cs.CV cs.AI eess.IV 62%

Mammo-CLIP: Leveraging Contrastive Language-Image Pre-training (CLIP) for Enhanced Breast Cancer Diagnosis with Multi-view Mammography

Xuxin Chen, Yuheng Li, Mingzhe Hu, Ella Salari, Xiaoqian Chen, Richard L. J. Qiu, Bin Zheng, Xiaofeng Yang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09941 2024-04-16 cs.CV cs.AI 62%

Evolving Interpretable Visual Classifiers with Large Language Models

Mia Chiquier, Utkarsh Mall, Carl Vondrick

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09248 2024-04-16 cs.LG cs.AI cs.CL 62%

Knowledgeable Agents by Offline Reinforcement Learning from Large Language Model Rollouts

Jing-Cheng Pang, Si-Hang Yang, Kaiyuan Li, Jiaji Zhang, Xiong-Hui Chen, Nan Tang, Yang Yu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05603 2024-04-09 cs.CV cs.AI 62%

Self-Explainable Affordance Learning with Embodied Caption

Zhipeng Zhang, Zhimin Wei, Guolei Sun, Peng Wang, Luc Van Gool

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01409 2024-04-03 cs.CV cs.AI cs.MM 62%

OVFoodSeg: Elevating Open-Vocabulary Food Image Segmentation via Image-Informed Textual Representation

Xiongwei Wu, Sicheng Yu, Ee-Peng Lim, Chong-Wah Ngo

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments CVPR 2024; 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00323 2024-04-02 cs.CV cs.LG 62%

CLIP-driven Outliers Synthesis for few-shot OOD detection

Hao Sun, Rundong He, Zhongyi Han, Zhicong Lin, Yongshun Gong, Yilong Yin

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19046 2024-03-29 cs.CV cs.AI 62%

LITA: Language Instructed Temporal-Localization Assistant

De-An Huang, Shijia Liao, Subhashree Radhakrishnan, Hongxu Yin, Pavlo Molchanov, Zhiding Yu, Jan Kautz

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03788 2024-03-29 cs.SE cs.AI cs.LG stat.ME 62%

Toward a Theory of Causation for Interpreting Neural Code Models

David N. Palacio, Alejandro Velasco, Nathan Cooper, Alvaro Rodriguez, Kevin Moran, Denys Poshyvanyk

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments Accepted to appear in IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18690 2024-03-28 cs.CV cs.AI 62%

Annolid: Annotate, Segment, and Track Anything You Need

Chen Yang, Thomas A. Cleland

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13614 2024-03-26 cs.CV cs.AI 62%

HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction Data

Qifan Yu, Juncheng Li, Longhui Wei, Liang Pang, Wentao Ye, Bosheng Qin, Siliang Tang, Qi Tian, Yueting Zhuang

专题命中 视觉定位与Grounding :LLaVA(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13551 2024-03-21 cs.CV cs.LG 62%

Ground-A-Score: Scaling Up the Score Distillation for Multi-Attribute Editing

Hangeol Chang, Jinho Chang, Jong Chul Ye

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12547 2024-03-20 cs.RO cs.CV cs.LG 62%

PGA: Personalizing Grasping Agents with Single Human-Robot Interaction

Junghyun Kim, Gi-Cheon Kang, Jaein Kim, Seoyun Yang, Minjoon Jung, Byoung-Tak Zhang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments 8 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏