arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7314 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7314 篇

2405.09981 2024-05-17 cs.CV 86%

Adversarial Robustness for Visual Grounding of Multimodal Large Language Models

Kuofeng Gao, Yang Bai, Jiawang Bai, Yong Yang, Shu-Tao Xia

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title);分类 cs.CV

Comments ICLR 2024 Workshop on Reliable and Responsible Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00633 2026-08-11 cs.CV cs.AI 版本更新 86%

From Alignment to Synthesis Contrastive Volumetric Grounding for Text-to-CT Generation

从对齐到合成:用于文本到CT生成的对比体 grounding

Daniele Molino, Camillo Maria Caruso, Filippo Ruffini, Paolo Soda, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV、cs.AI

AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04726 2026-08-06 cs.AI cs.CV 新提交 86%

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

当提示词成为像素:面向多模态推理的提示词-区域定位

Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型在视觉化任务语义场景下的准确率下降问题,提出提示词-区域定位方法,有效提升了基准测试准确率且无需OCR或区域元数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00435 2026-07-29 cs.CV cs.AI 版本更新 86%

Detect Before You Leap: Mirage Detection in Vision-Language Models

在跳跃前检测:视觉语言模型中的幻象检测

Sayeed Shafayet Chowdhury, Md. Shaown Miah, S. M. Taiabul Haque, Syed Ishtiaque Ahmed

机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型在缺乏视觉证据时产生自信但无根据回答的幻象问题,提出文本条件层内对齐方法,通过分析视觉编码器各层补丁令牌与问题嵌入的对齐轨迹,结合像素统计、零样本域路由和结构化自评估,实现高精度预响应幻象检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00202 2026-07-20 cs.CV cs.AI 86%

Vision-Language Model Purified Semi-Supervised Semantic Segmentation for Remote Sensing Images

面向遥感图像的视觉-语言模型纯化半监督语义分割

Shanwen Wang, Xin Sun, Danfeng Hong, Fei Zhou

机构 * Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) School of Automation, Southeast University(自动化学院,东南大学) College of Oceanography and Space Informatics, China University of Petroleum (East China)(海洋与空间信息学院,中国石油大学(华东))

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出SemiEarth模型,通过引入视觉-语言模型的伪标签纯化结构,提升遥感图像半监督语义分割的性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10826 2026-07-14 cs.CV cs.AI cs.GR 新提交 86%

3D-DefectBench: A Controlled Factorial Study of Vision-Language Model Evaluation Pipelines for Fine-Grained 3D Generation Defects

3D-缺陷基准:用于细粒度3D生成缺陷的视觉语言模型评估管道的控制因子研究

Zhenyu Zhao, Nanshan Jia, Jihyeon Je, Yifu Tang, Alvin Chan, Michael Spedden, Michael V. Palleschi, Sui Huang, Jingshen Wang, Zeyu Zheng

机构 * Roblox Corporation(罗布乐思公司) Berkeley AI Research Lab & Department of Industrial Engineering and Operations Research, University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究实验室及工业工程与运筹学系) Computer Science Department, Stanford University(斯坦福大学计算机科学系) Division of Biostatistics, University of California, Berkeley(加州大学伯克利分校生物统计学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究基于视觉语言模型的3D缺陷检测管道评估,引入3D-DefectBench基准框架,通过平衡因子设计改变多个管道因素进行实验,发现模型选择影响最大,各因素相互作用,还得出一些协议表现及评判与人工标注对比情况等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30170 2026-07-09 cs.MM cs.CV cs.LG 版本更新 86%

Unveiling the Visual Counting Bottleneck in Vision-Language Models

揭示视觉语言模型中的视觉计数瓶颈

Xingzhou Pang, Yifan Hou, Junling Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV、cs.LG

AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08467 2026-07-07 cs.CV cs.LG eess.IV 版本更新 86%

Zero-Shot Distracted Driver Detection via Vision Language Models with Double Decoupling

基于双解耦视觉语言模型的零样本分心驾驶员检测

Takamichi Miyata, Sumiko Miyata, Andrew Morris

机构 * Chiba Institute of Technology(千叶工业大学) Institute of Science Tokyo(东京科学大学) Loughborough University(拉夫堡大学)

专题命中 视觉定位与Grounding :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 提出一种主体解耦框架,通过提取驾驶员外观嵌入并从图像嵌入中移除其影响,再结合度量投影正交化文本嵌入,实现零样本分心驾驶检测,显著提升实际场景性能。

Comments Accepted to IEEE 15th International Symposium on Communication Systems, Networks and Digital Signal Processing (CSNDSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30632 2026-06-30 cs.RO cs.AI cs.CV 86%

GROW$^2$: Grounding Which and Where for Robot Tool Use

GROW$^2$:为机器人工具使用确定哪个物体和哪个部位

Yuhong Deng, Yuyao Liu, David Hsu

机构 * National University of Singapore(新加坡国立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出GROW$^2$方法,通过分层语义和几何接地实现开放世界工具选择与部位定位,在零样本泛化中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29023 2026-06-30 cs.CV cs.AI 86%

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification

基于二级跟踪和强化学习验证的多模态大模型高效时空定位

Tianshu Zhang, Yan Wang, Ji Qi, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出一种从帧级到秒级跟踪的流水线,结合跨秒平滑、链式思维轨迹合成和强化学习优化,在长视频中实现高效且准确的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06696 2026-06-08 cs.CV cs.AI 新提交 86%

MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models

MMBU: 大规模多模态生物医学理解基准,用于探测视觉语言模型的感知能力

Ryan D'Cunha, Alejandro Lozano, Xiaoxiao Sun, Daniel Vela Jarquin, Min Woo Sun, Josiah Aklilu, James Burgess, Yuhui Zhang, Ryan Nayebi, Paola Avila, Robayo, Jin Ye, Ming Hu, Zhongying Deng, Junjun He, Xin Chen, Yue Yao, Robert Tibshirani, Jeffrey J. Nirschl, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Instituto Tecnológico de Monterrey(蒙特雷技术学院) Monash University(墨尔本大学) University of Cambridge(剑桥大学) Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract_cn);vision-language model(title);分类 cs.CV、cs.AI

AI总结 提出MMBU基准,涵盖35个子模态,通过分类、定位和检测任务系统评估VLM在生物医学领域的视觉感知和泛化能力,发现高准确率可能掩盖感知缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06925 2026-05-21 cs.CV cs.AI 86%

Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition

视觉-语言模型是否准备好进行饮食评估?探索AI驱动的食品图像识别的下一个前沿

Sergio Romero-Tapiador, Ruben Tolosana, Blanca Lacruz-Pleguezuelos, Laura Judith Marcos Zambrano, Guadalupe X. Bazán, Isabel Espinosa-Salinas, Julian Fierrez, Javier Ortega-Garcia, Enrique Carrillo de Santa Pau, Aythami Morales

机构 * Biometrics and Data Pattern Analytics Lab, Universidad Autonoma de Madrid(生物度量与数据模式分析实验室,马德里自治大学) IMDEA Food, CEI UAM+CSIC(IMDEA食品,CEI UAM+CSIC)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文评估了六种先进的视觉-语言模型在不同层次上的食品识别能力,提出了一个新的评估指标,并展示了FoodNExTDB数据库在饮食评估中的应用潜力。

Comments Accepted at IEEE/CVF Computer Vision and Pattern Recognition Conference workshops 2025 (CVPRw) 10 pages, 4 figures, 2 tables

Journal ref 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10769 2026-05-12 cs.CV cs.AI 86%

MPerS: Dynamic MLLM MixExperts Perception-Guided Remote Sensing Scene Segmentation

MPerS: 动态多模态大语言模型混合专家感知引导的遥感场景分割

Ziyi Wang, Xianping Ma, Ziyao Wang, Hongyang Zhang, Man On Pun

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Southwest Jiaotong University(西南交通大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出MPerS方法,通过设计多提示生成高质量遥感描述,结合DINOv3提取视觉特征,利用动态混合专家模块和语言查询引导注意力实现精准分割。

Comments Accepted to CVPR 2026 Findings. 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12424 2026-04-15 cs.CL cs.AI cs.CV 86%

Decoding by Perturbation: Mitigating MLLM Hallucinations via Dynamic Textual Perturbation

解码中的扰动:通过动态文本扰动缓解多模态大语言模型的幻觉

Sihang Jia, Shuliang Liu, Songbo Yang, Yibo Yan, Xin Zou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 视觉定位与Grounding :MLLM(title);grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Decoding by Perturbation方法,通过动态文本扰动缓解多模态大语言模型的幻觉问题,通过控制文本干预减少语言先验的影响,提升解码稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20314 2026-03-24 cs.CV cs.LG 86%

VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs

VGS-Decoding:基于视觉 grounding 分数的解码方法用于医疗 VLM 中的幻觉抑制

Govinda Kolli, Adinath Madhavrao Dukre, Behzad Bozorgtabar, Dwarikanath Mahapatra, Imran Razzak

机构 * MBZUAI Rajiv Gandhi University of Knowledge Technologies(拉贾·甘地知识技术大学) Aarhus University(奥胡斯大学) Khalifa University(卡里玛大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 本文提出 VGS-Decoding 方法,通过视觉 grounding 分数指导解码以减少医疗 VLM 的幻觉问题,实验表明在多个数据集上取得了显著提升,且仅引入2倍推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16934 2026-03-19 cs.CV cs.AI 86%

AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding

AgriChat:一种用于农业图像理解的多模态大语言模型

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AgriChat,一种基于多模态大语言模型的农业图像理解系统,通过整合视觉描述与网络增强的科学检索,生成农业基准数据集,提升农业领域的模型鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12071 2026-03-17 cs.CV cs.AI 86%

LoV3D: Grounding Cognitive Prognosis Reasoning in Longitudinal 3D Brain MRI via Regional Volume Assessments

LoV3D:通过区域体积评估在纵向3D脑MRI中实现认知预后推理

Zhaoyang Jiang, Zhizhong Fu, David McAllister, Yunsoo Kim, Honghan Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 LoV3D通过纵向3D脑MRI的区域体积评估,实现认知预后推理,其核心方法是结合3D视觉-语言模型,通过区域解剖评估、纵向对比和诊断输出,提高诊断准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23806 2026-03-02 cs.CV cs.AI 86%

See, Act, Adapt: Active Perception for Unsupervised Cross-Domain Visual Adaptation via Personalized VLM-Guided Agent

看见、行动、适应:通过个性化VLM引导代理的主动感知用于无监督跨域视觉适应

Tianci Tang, Tielong Cai, Hongwei Wang, Gaoang Wang

机构 * Zhejiang University, Hangzhou, China(浙江大学)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 Sea$^2$通过智能姿态控制代理实现无监督跨域视觉适应,利用现成感知模型提升视觉任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08177 2026-02-19 cs.CV cs.AI 86%

MedReasoner: Reinforcement Learning Drives Reasoning Grounding from Clinical Thought to Pixel-Level Precision

MedReasoner: 通过强化学习实现从临床思维到像素级精度的推理 grounding

Zhonghao Yan, Muxi Diao, Yuxuan Yang, Ruoyan Jing, Jiayuan Xu, Kaizhou Zhang, Lele Yang, Yanxi Liu, Kongming Liang, Zhanyu Ma

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 MedReasoner 通过强化学习实现从临床推理到像素级精度的医学影像 grounding,提出统一医学推理 grounding 任务和 U-MRG-14K 数据集,展示其在医学影像分析中的优越性能。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18878 2025-12-23 cs.CV cs.AI 86%

CrashChat: A Multimodal Large Language Model for Multitask Traffic Crash Video Analysis

CrashChat: 一种多模态大语言模型用于多任务交通事故视频分析

Kaidi Liang, Ke Li, Xianbiao Hu, Ruwen Qin

机构 * Stony Brook University(石溪大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 CrashChat是一种多模态大语言模型,用于多任务交通事故视频分析,通过任务解耦和分组策略提升事故识别、定位等任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10691 2025-12-12 cs.AI cs.CV 86%

Enhancing Radiology Report Generation and Visual Grounding using Reinforcement Learning

通过强化学习增强放射学报告生成和视觉基础识别

Benjamin Gundersen, Nicolas Deperrois, Samuel Ruiperez-Campillo, Thomas M. Sutter, Julia E. Vogt, Michael Moor, Farhad Nooralahzadeh, Michael Krauthammer

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过强化学习和思考机制提升放射学报告生成和视觉基础识别的性能,展示了在医学VLMs中RL作为SFT的有效补充。

Comments 10 pages main text (3 figures, 3 tables), 31 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01979 2025-12-02 cs.AI cs.CL cs.CV 86%

Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback

Chain-of-Ground: 通过迭代推理和参考反馈提升GUI定位

Aiden Yiliu Li, Bizhi Yu, Daoan Lei, Tianhe Ren, Shilong Liu

机构 * University College London(伦敦大学学院) Chico Future AI Lab(芝加哥未来人工智能实验室) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Chain-of-Ground通过迭代推理和参考反馈提升GUI定位,实现68.4的准确率,并在现实世界界面中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12220 2025-11-18 cs.CV cs.LG 86%

Suppressing VLM Hallucinations with Spectral Representation Filtering

Ameen Ali, Tamim Zoabi, Lior Wolf

机构 * Tel Aviv University(特拉维夫大学)

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);LLaVA(abstract);grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12638 2025-11-18 cs.CV cs.AI 86%

edgeVLM: Cloud-edge Collaborative Real-time VLM based on Context Transfer

Chen Qian, Xinran Yu, Zewen Huang, Danyang Li, Qiang Ma, Fan Dang, Xuan Ding, Guangyong Shang, Zheng Yang

机构 * Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学) Inspur Yunzhou Industrial Internet Co., Ltd(Inspur云洲工业互联网有限公司)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18711 2025-11-12 cs.CV cs.AI 86%

RSVG-ZeroOV: Exploring a Training-Free Framework for Zero-Shot Open-Vocabulary Visual Grounding in Remote Sensing Images

Ke Li, Di Wang, Ting Wang, Fuyu Dong, Yiming Zhang, Luyao Zhang, Xiangyu Wang, Shaofeng Li, Quan Wang

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments This work is accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25528 2025-10-22 cs.CV cs.AI cs.RO 86%

LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models

Pranav Saxena, Avigyan Bhattacharya, Ji Zhang, Wenshan Wang

机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,K.K Birla Goa校区) Carnegie Mellon University, Robotics Institute(卡内基梅隆大学,机器人研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Human-aware Embodied AI Workshop @ IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16017 2025-10-21 cs.CV cs.AI cs.CL cs.RO 86%

InfraGPT Smart Infrastructure: An End-to-End VLM-Based Framework for Detecting and Managing Urban Defects

Ibrahim Sheikh Mohamed, Abdullah Yahya Abdullah Omaisan

机构 * Independent Researchers(独立研究者)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23236 2025-09-30 cs.CV cs.AI 86%

Self-Consistency as a Free Lunch: Reducing Hallucinations in Vision-Language Models via Self-Reflection

Mingfei Han, Haihong Hao, Jinxing Zhou, Zhihui Li, Yuhui Zheng, Xueqing Deng, Linjie Yang, Xiaojun Chang

机构 * Department of Computer Vision, Mohamed Bin Zayed University of Artificial Intelligence(计算机视觉系,Mohamed Bin Zayed人工智能大学) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Bytedance Seed(字节跳动种子) School of Computer Science, Qinghai Normal University(计算机科学学院,青海师范大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04908 2025-09-08 cs.AI cs.CL cs.CV cs.HC 86%

SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing

Hongyi Jing, Jiafu Chen, Chen Rao, Ziqiang Dang, Jiajie Teng, Tianyi Chu, Juncheng Mo, Shuo Fang, Huaizhong Lin, Rui Lv, Chenguang Ma, Lei Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15867 2025-09-04 cs.CV cs.AI 86%

TruthLens: Visual Grounding for Universal DeepFake Reasoning

Rohit Kundu, Shan Jia, Vishal Mohanty, Athula Balachandran, Amit K. Roy-Chowdhury

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏