arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2505.22096 2025-05-29 cs.CL cs.AI cs.LG 62%

Knowledge Base Construction for Knowledge-Augmented Text-to-SQL

Jinheon Baek, Horst Samulowitz, Oktie Hassanzadeh, Dharmashankar Subramanian, Sola Shirai, Alfio Gliozzo, Debarun Bhattacharjya

机构 * KAIST(韩国科学技术院) IBM Research(IBM研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06861 2025-05-28 cs.RO cs.AI cs.CV 62%

Efficient Robotic Policy Learning via Latent Space Backward Planning

Dongxiu Liu, Haoyi Niu, Zhihao Wang, Jinliang Zheng, Yinan Zheng, Zhonghong Ou, Jianming Hu, Jianxiong Li, Xianyuan Zhan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20254 2025-05-27 cs.LG cs.AI cs.CL stat.ML 62%

Position: Mechanistic Interpretability Should Prioritize Feature Consistency in SAEs

Xiangchen Song, Aashiq Muhamed, Yujia Zheng, Lingjing Kong, Zeyu Tang, Mona T. Diab, Virginia Smith, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) MBZUAI(穆斯林人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20090 2025-05-23 cs.AI cs.IR cs.LG 62%

Spark: A System for Scientifically Creative Idea Generation

Aishik Sanyal, Samuel Schapiro, Sumuk Shashidhar, Royce Moon, Lav R. Varshney, Dilek Hakkani-Tur

机构 * Spiral Works Univ. Illinois, Urbana-Champaign(伊利诺伊大学,厄巴纳-香槟分校) University of Michigan(密歇根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments Accepted at ICCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18047 2025-05-23 cs.CV cs.LG 62%

Progressive Local Alignment for Medical Multimodal Pre-training

Huimin Yan, Xian Yang, Liang Bai, Jiye Liang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments We are currently revising the methodology described in the manuscript to improve its clarity. We have decided to withdraw the current version until a more robust and complete version is ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01109 2025-05-23 cs.CV cs.LG 62%

SOOD-ImageNet: a Large-Scale Dataset for Semantic Out-Of-Distribution Image Classification and Semantic Segmentation

Alberto Bacchin, Davide Allegro, Stefano Ghidoni, Emanuele Menegatti

机构 * Department of Information Engineering, University of Padova(信息工程系,帕多瓦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepeted as long paper at "The 3rd Workshop for Out-of-Distribution Generalization in Computer Vision Foundation Models", ECCV 2024

Journal ref ECCV 2024 Workshops. ECCV 2024. Lecture Notes in Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12373 2025-05-20 cs.GR cs.CV cs.LG 62%

Modeling Aesthetic Preferences in 3D Shapes: A Large-Scale Paired Comparison Study Across Object Categories

Kapil Dev

机构 * RMIT University(拉筹伯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments 11 pages, 8 figures, submitted to IEEE Transactions on Visualization and Computer Graphics (TVCG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09926 2025-05-20 cs.CV cs.AI 62%

AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection

Bin-Bin Gao, Yue Zhou, Jiangtao Yan, Yuezhi Cai, Weixi Zhang, Meng Wang, Jun Liu, Yong Liu, Lei Wang, Chengjie Wang

机构 * Tencent YouTu Lab(腾讯优图实验室) Siemens AG(西门子股份公司) Technical University of Munich(慕尼黑技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 27 pages, 15 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10664 2025-05-19 cs.CV cs.AI 62%

CLIP Embeddings for AI-Generated Image Detection: A Few-Shot Study with Lightweight Classifier

Ziyang Ou

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Rochester(罗切斯特大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 5 figures, not submitted to any conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09265 2025-05-15 cs.CV cs.AI 62%

MetaUAS: Universal Anomaly Segmentation with One-Prompt Meta-Learning

Bin-Bin Gao

机构 * Tencent YouTu Lab(腾讯优图实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08234 2025-05-14 cs.CV cs.AI cs.CR 62%

Removing Watermarks with Partial Regeneration using Semantic Information

Krti Tallam, John Kevin Cava, Caleb Geniesse, N. Benjamin Erichson, Michael W. Mahoney

机构 * International Computer Science Institute(国际计算机科学研究所) School of Computing and Augmented Intelligence(计算与增强智能学院) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) Department of Statistics(统计学系) University of California at Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07637 2025-05-13 cs.CL cs.AI cs.LG 62%

Chronocept: Instilling a Sense of Time in Machines

Krish Goel, Sanskar Pandey, KS Mahadevan, Harsh Kumar, Vishesh Khadaria

机构 * ProjectEndgame

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18653 2025-05-13 cs.CV cs.AI 62%

When SAM2 Meets Video Camouflaged Object Segmentation: A Comprehensive Evaluation and Adaptation

Yuli Zhou, Guolei Sun, Yawei Li, Guo-Sen Xie, Luca Benini, Ender Konukoglu

机构 * Computer Vision Laboratory, ETH Zürich(苏黎世联邦理工学院计算机视觉实验室) Integrated System Laboratory, ETH Zürich(苏黎世联邦理工学院集成系统实验室) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments Technical report. Accepted by Visual Intelligence. Code is released at https://github.com/zhoustan/SAM2-VCOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03380 2025-05-07 cs.CV cs.AI eess.IV 62%

Reinforced Correlation Between Vision and Language for Precise Medical AI Assistant

Haonan Wang, Jiaji Mao, Lehan Wang, Qixiang Zhang, Marawan Elbatel, Yi Qin, Huijun Hu, Baoxun Li, Wenhui Deng, Weifeng Qin, Hongrui Li, Jialin Liang, Jun Shen, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, HKUST(香港科技大学电子与计算机工程系) Department of Radiology, Guangdong Provincial Key Laboratory of Malignant Tumor Epigenetics and Gene Regulation, Sun Yat-Sen Memorial Hospital, Sun Yat-Sen University(中山大学放射科、广东省恶性肿瘤表观遗传与基因调控重点实验室、中山纪念医院) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02537 2025-05-07 cs.LG cs.AI stat.ML 62%

Advancing Constrained Monotonic Neural Networks: Achieving Universal Approximation Beyond Bounded Activations

Davide Sartor, Alberto Sinigaglia, Gian Antonio Susto

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18805 2025-04-29 cs.CL cs.AI cs.LG 62%

Stealing Creator's Workflow: A Creator-Inspired Agentic Framework with Iterative Feedback Loop for Improved Scientific Short-form Generation

Jong Inn Park, Maanas Taneja, Qianwen Wang, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments Project page: https://minnesotanlp.github.io/scitalk-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16072 2025-04-23 cs.CV cs.AI 62%

Describe Anything: Detailed Localized Image and Video Captioning

Long Lian, Yifan Ding, Yunhao Ge, Sifei Liu, Hanzi Mao, Boyi Li, Marco Pavone, Ming-Yu Liu, Trevor Darrell, Adam Yala, Yin Cui

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Project page: https://describe-anything.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14151 2025-04-22 cs.CV cs.AI cs.RO 62%

Locate 3D: Real-World Object Localization via Self-Supervised Learning in 3D

Sergio Arnaud, Paul McVay, Ada Martin, Arjun Majumdar, Krishna Murthy Jatavallabhula, Phillip Thomas, Ruslan Partsey, Daniel Dugas, Abha Gejji, Alexander Sax, Vincent-Pierre Berges, Mikael Henaff, Ayush Jain, Ang Cao, Ishita Prasad, Mrinal Kalakrishnan, Michael Rabbat, Nicolas Ballas, Mido Assran, Oleksandr Maksymets, Aravind Rajeswaran, Franziska Meier

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13122 2025-04-18 cs.CV cs.LG 62%

VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models

Haojian Huang, Haodong Chen, Shengqiong Wu, Meng Luo, Jinlan Fu, Xinya Du, Hanwang Zhang, Hao Fei

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments Code and Data: https://github.com/HaroldChen19/VistaDPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19653 2025-04-17 cs.CV cs.AI 62%

OpenSDI: Spotting Diffusion-Generated Images in the Open World

Yabin Wang, Zhiwu Huang, Xiaopeng Hong

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00698 2025-04-15 cs.CL cs.AI cs.LG 62%

Command A: An Enterprise-Ready Large Language Model

Team Cohere, :, Aakanksha, Arash Ahmadian, Marwan Ahmed, Jay Alammar, Milad Alizadeh, Yazeed Alnumay, Sophia Althammer, Arkady Arkhangorodsky, Viraat Aryabumi, Dennis Aumiller, Raphaël Avalos, Zahara Aviv, Sammie Bae, Saurabh Baji, Alexandre Barbet, Max Bartolo, Björn Bebensee, Neeral Beladia, Walter Beller-Morales, Alexandre Bérard, Andrew Berneshawi, Anna Bialas, Phil Blunsom, Matt Bobkin, Adi Bongale, Sam Braun, Maxime Brunet, Samuel Cahyawijaya, David Cairuz, Jon Ander Campos, Cassie Cao, Kris Cao, Roman Castagné, Julián Cendrero, Leila Chan Currie, Yash Chandak, Diane Chang, Giannis Chatziveroglou, Hongyu Chen, Claire Cheng, Alexis Chevalier, Justin T. Chiu, Eugene Cho, Eugene Choi, Eujeong Choi, Tim Chung, Volkan Cirik, Ana Cismaru, Pierre Clavier, Henry Conklin, Lucas Crawhall-Stein, Devon Crouse, Andres Felipe Cruz-Salinas, Ben Cyrus, Daniel D'souza, Hugo Dalla-Torre, John Dang, William Darling, Omar Darwiche Domingues, Saurabh Dash, Antoine Debugne, Théo Dehaze, Shaan Desai, Joan Devassy, Rishit Dholakia, Kyle Duffy, Ali Edalati, Ace Eldeib, Abdullah Elkady, Sarah Elsharkawy, Irem Ergün, Beyza Ermis, Marzieh Fadaee, Boyu Fan, Lucas Fayoux, Yannis Flet-Berliac, Nick Frosst, Matthias Gallé, Wojciech Galuba, Utsav Garg, Matthieu Geist, Mohammad Gheshlaghi Azar, Ellen Gilsenan-McMahon, Seraphina Goldfarb-Tarrant, Tomas Goldsack, Aidan Gomez, Victor Machado Gonzaga, Nithya Govindarajan, Manoj Govindassamy, Nathan Grinsztajn, Nikolas Gritsch, Patrick Gu, Shangmin Guo, Kilian Haefeli, Rod Hajjar, Tim Hawes, Jingyi He, Sebastian Hofstätter, Sungjin Hong, Sara Hooker, Tom Hosking, Stephanie Howe, Eric Hu, Renjie Huang, Hemant Jain, Ritika Jain, Nick Jakobi, Madeline Jenkins, JJ Jordan, Dhruti Joshi, Jason Jung, Trushant Kalyanpur, Siddhartha Rao Kamalakara, Julia Kedrzycki, Gokce Keskin, Edward Kim, Joon Kim, Wei-Yin Ko, Tom Kocmi, Michael Kozakov, Wojciech Kryściński, Arnav Kumar Jain, Komal Kumar Teru, Sander Land, Michael Lasby, Olivia Lasche, Justin Lee, Patrick Lewis, Jeffrey Li, Jonathan Li, Hangyu Lin, Acyr Locatelli, Kevin Luong, Raymond Ma, Lukáš Mach, Marina Machado, Joanne Magbitang, Brenda Malacara Lopez, Aryan Mann, Kelly Marchisio, Olivia Markham, Alexandre Matton, Alex McKinney, Dominic McLoughlin, Jozef Mokry, Adrien Morisot, Autumn Moulder, Harry Moynehan, Maximilian Mozes, Vivek Muppalla, Lidiya Murakhovska, Hemangani Nagarajan, Alekhya Nandula, Hisham Nasir, Shauna Nehra, Josh Netto-Rosen, Daniel Ohashi, James Owers-Bardsley, Jason Ozuzu, Dennis Padilla, Gloria Park, Sam Passaglia, Jeremy Pekmez, Laura Penstone, Aleksandra Piktus, Case Ploeg, Andrew Poulton, Youran Qi, Shubha Raghvendra, Miguel Ramos, Ekagra Ranjan, Pierre Richemond, Cécile Robert-Michon, Aurélien Rodriguez, Sudip Roy, Sebastian Ruder, Laura Ruis, Louise Rust, Anubhav Sachan, Alejandro Salamanca, Kailash Karthik Saravanakumar, Isha Satyakam, Alice Schoenauer Sebag, Priyanka Sen, Sholeh Sepehri, Preethi Seshadri, Ye Shen, Tom Sherborne, Sylvie Shang Shi, Sanal Shivaprasad, Vladyslav Shmyhlo, Anirudh Shrinivason, Inna Shteinbuk, Amir Shukayev, Mathieu Simard, Ella Snyder, Ava Spataru, Victoria Spooner, Trisha Starostina, Florian Strub, Yixuan Su, Jimin Sun, Dwarak Talupuru, Eugene Tarassov, Elena Tommasone, Jennifer Tracey, Billy Trend, Evren Tumer, Ahmet Üstün, Bharat Venkitesh, David Venuto, Pat Verga, Maxime Voisin, Alex Wang, Donglu Wang, Shijian Wang, Edmond Wen, Naomi White, Jesse Willman, Marysia Winkels, Chen Xia, Jessica Xie, Minjie Xu, Bowen Yang, Tan Yi-Chern, Ivan Zhang, Zhenyu Zhao, Zhoujie Zhao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08748 2025-04-15 cs.IR cs.AI cs.CL cs.ET cs.LG 62%

A Survey of Multimodal Retrieval-Augmented Generation

Lang Mei, Siyu Mo, Zhihan Yang, Chong Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08386 2025-04-14 cs.LG cs.AI cs.IR stat.ML 62%

PCA-RAG: Principal Component Analysis for Efficient Retrieval-Augmented Generation

Arman Khaledian, Amirreza Ghadiridehkordi, Nariman Khaledian

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04517 2025-04-08 cs.CV cs.AI 62%

Enhance Then Search: An Augmentation-Search Strategy with Foundation Models for Cross-Domain Few-Shot Object Detection

Jiancheng Pan, Yanxing Liu, Xiao He, Long Peng, Jiahao Li, Yuze Sun, Xiaomeng Huang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09921 2025-04-07 cs.CV cs.AI 62%

Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level

Andong Deng, Tongjia Chen, Shoubin Yu, Taojiannan Yang, Lincoln Spencer, Yapeng Tian, Ajmal Saeed Mian, Mohit Bansal, Chen Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17233 2025-04-04 cs.AI cs.LG 62%

ICPL: Few-shot In-context Preference Learning via LLMs

Chao Yu, Qixin Tan, Hong Lu, Jiaxuan Gao, Xinting Yang, Yu Wang, Yi Wu, Eugene Vinitsky

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16872 2025-04-02 cs.LG cs.CV 62%

Lie Detector: Unified Backdoor Detection via Cross-Examination Framework

Xuan Wang, Siyuan Liang, Dongping Liao, Han Fang, Aishan Liu, Xiaochun Cao, Yu-liang Lu, Ee-Chien Chang, Xitong Gao

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22747 2025-04-01 cs.LG cs.AI cs.ET 62%

LeForecast: Enterprise Hybrid Forecast by Time Series Intelligence

Zheng Tan, Yiwen Nie, Wenfa Wu, Guanyu Zhang, Yanze Liu, Xinyuan Tian, Kailin Gao, Mengya Liu, Qijiang Cheng, Haipeng Jiang, Yingzheng Ma, Wei Zheng, Yuci Zhu, Yuanyuan Sun, Xiangyu Lei, Xiyu Guan, Wanqing Huang, Shouming Liu, Xiangquan Meng, Pengzhan Qu, Chao Yang, Jiaxuan Fan, Yuan He, Hongsheng Qi, Yangzhou Du

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05869 2025-03-25 cs.CV cs.AI cs.RO 62%

Believing is Seeing: Unobserved Object Detection using Generative Models

Subhransu S. Bhattacharjee, Dylan Campbell, Rahul Shome

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments IEEE/CVF Computer Vision and Pattern Recognition 2025; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00774 2025-03-25 cs.CL cs.AI cs.IR cs.LG 62%

Context Retrieval via Normalized Contextual Latent Interaction for Conversational Agent

Junfeng Liu, Zhuocheng Mei, Kewen Peng, Ranga Raju Vatsavai

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments 2023 IEEE International Conference on Data Mining Workshops (ICDMW)

Journal ref 2023 IEEE International Conference on Data Mining Workshops (ICDMW)

详情

展开后加载摘要…

URL PDF HTML 收藏