arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-19 至 2026-03-19 共收录 25 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 25 篇

2603.16934 2026-03-19 cs.CV cs.AI 86%

AgriChat: A Multimodal Large Language Model for Agriculture Image Understanding

AgriChat:一种用于农业图像理解的多模态大语言模型

Abderrahmene Boudiaf, Irfan Hussain, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AgriChat,一种基于多模态大语言模型的农业图像理解系统,通过整合视觉描述与网络增强的科学检索,生成农业基准数据集,提升农业领域的模型鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17441 2026-03-19 cs.CV cs.AI 84%

AdaZoom-GUI: Adaptive Zoom-based GUI Grounding with Instruction Refinement

AdaZoom-GUI: 基于自适应缩放的GUI定位与指令细化

Siqi Pei, Liang Tang, Tiaonan Duan, Long Chen, Shuxian Li, Kaer Huang, Yanzhe Jing, Yiqiang Yan, Bo Zhang, Chenghao Jiang, Borui Zhang, Jiwen Lu

机构 * Lenovo Research(联想研究院) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AdaZoom-GUI框架,通过指令细化模块和条件缩放策略提升GUI定位精度与指令理解,构建高质量数据集并采用GRPO训练模型,实现在高分辨率GUI理解中的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16931 2026-03-19 cs.CV cs.AI 81%

Script-to-Slide Grounding: Grounding Script Sentences to Slide Objects for Automatic Instructional Video Generation

脚本到幻灯片接地:将脚本句子接地到幻灯片对象以实现自动教学视频生成

Rena Suzuki, Masato Kikuchi, Tadachika Ozono

机构 * Nagoya Institute of Technology(名古屋技术大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出Script-to-Slide Grounding任务,利用大语言模型实现脚本与幻灯片对象的自动接地,实验显示F1分数达0.924,为自动化幻灯片视频编辑奠定基础。

Comments The 21st International Conference on E-Service and Knowledge Management (ESKM 2025-Winter)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17647 2026-03-19 cs.CV 79%

Part-Aware Open-Vocabulary 3D Affordance Grounding via Prototypical Semantic and Geometric Alignment

面向部分的开放词汇3D功能接地 via 语义和几何对齐

Dongqiang Gou, Xuming He

机构 * ShanghaiTech University(上海科技大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出一种双阶段跨模态框架,通过增强语义和几何表示,解决开放词汇3D功能接地中的语义一致性、几何对齐和开放词汇泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17079 2026-03-19 cs.CV 79%

ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models

ACE-LoRA:图注意上下文增强用于医疗视觉-语言模型的参数高效适应

M. Arda Aydın, Melih B. Yilmaz, Aykut Koç, Tolga Çukur

机构 * Bilkent University(比尔肯特大学) National Magnetic Resonance Research Center (UMRAM)(国家磁共振研究所以及UMRAM)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ACE-LoRA框架,通过整合LoRA模块和ACE-HGNN模块,提升医疗VLM的零样本泛化能力,解决领域特异性与泛化能力的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17307 2026-03-19 cs.CV cs.AI 79%

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

Symphony:一种受认知启发的多智能体系统用于长视频理解

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kuaishou Technology(快手科技) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Symphony多智能体系统,通过模拟人类认知模式,提升长视频理解任务的推理能力,实验显示在多个基准测试中表现优异。

Comments Accepted by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17228 2026-03-19 cs.CV cs.AI cs.LG 75%

From Drop-off to Recovery: A Mechanistic Analysis of Segmentation in MLLMs

从丢弃到恢复:对MLLMs分割能力的机理分析

Boyong Wu, Sanghwan Kim, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过逐层线性探测评估MLLMs整个流程,揭示适配器导致的分割表示下降及LLM层通过注意力机制逐步恢复的机制,为未来分割模型设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17173 2026-03-19 cs.CV cs.AI 73%

Generalist Multimodal LLMs Gain Biometric Expertise via Human Salience

通用多模态大语言模型通过人类显著性获得生物特征专家能力

Jacob Piland, Byron Dowling, Christopher Sweet, Adam Czajka

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文研究通用多模态大语言模型在隐私约束下通过人类显著性信息实现虹膜攻击检测的可行性,实验表明其在虹膜攻击检测中优于传统CNN模型和人工评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16932 2026-03-19 cs.CV cs.AI 73%

Look Where It Matters: High-Resolution Crops Retrieval for Efficient VLMs

关注关键区域:为高效视觉语言模型的高分辨率作物检索

Nimrod Shabtay, Moshe Kimhi, Artem Spector, Sivan Haray, Ehud Rivlin, Chaim Baskin, Raja Giryes, Eli Schwartz

机构 * IBM Research(IBM研究院) Tel-Aviv University(特拉维夫大学) Technion(技术学院) Ben-Gurion University(本· Gurion大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 AwaRes通过低分辨率全局视图和工具调用实现准确与效率的平衡,自动构建监督数据并结合复合奖励训练框架,提升视觉语言模型的检索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06933 2026-03-19 cs.CE cs.CL cs.HC 71%

TxSum: User-Centered Ethereum Transaction Understanding with Micro-Level Semantic Grounding

TxSum: 基于微粒语义锚定的用户导向以太坊交易理解

Zifan Peng, Jingyi Zheng, Yule Liu, Huaiyu Jia, Qiming Ye, Jingyu Liu, Xufeng Yang, Mingchen Li, Qingyuan Gong, Xuechao Wang, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) University of North Texas(北卡罗来纳州立大学) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出TxSum任务,通过构建187个复杂以太坊交易数据集,引入MATEX框架提升交易解释质量,使用户对复杂交易的理解率从52.9%提升至76.5%,恶意交易拒绝率提升至88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17826 2026-03-19 cs.SE cs.AI 70%

FailureMem: A Failure-Aware Multimodal Framework for Autonomous Software Repair

FailureMem: 一种面向故障的多模态框架用于自主软件修复

Ruize Ma, Yilei Jiang, Shilin Zhang, Zheng Ma, Yi Feng, Vincent Ng, Zhi Wang, Xiangyu Yue, Chuanyi Li, Lewei Lu

机构 * Nanjing University(南京大学) SenseTime(秒速) The Chinese University of Hong Kong(香港中文大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 视觉定位与Grounding :visual reasoning(abstract);grounding(abstract);分类 cs.AI

AI总结 本文提出FailureMem框架,通过融合工作流代理、主动感知工具和故障记忆库,提升多模态自动程序修复的效率与准确性,实验表明其在GUI修复任务中解决率提升3.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11005 2026-03-19 cs.CV 70%

Draft and Refine with Visual Experts

草稿与润色:借助视觉专家

Sungheon Jeong, Ryozo Masukawa, Jihong Park, Sanggeon Yun, Wenjun Huang, Hanning Chen, Mahdi Imani, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学) MOLOCO

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出DnR框架,通过可视化专家反馈提升模型视觉利用能力,减少幻觉并提高多模态系统可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17831 2026-03-19 cs.AI 57%

RPMS: Enhancing LLM-Based Embodied Planning through Rule-Augmented Memory Synergy

RPMS:通过规则增强的记忆协同提升基于LLM的具身规划

Zhenhang Yuan, Shenghai Yuan, Lihua Xie

机构 * School of Electrical & Electronic Engineering(电子与电气工程学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出RPMS架构,通过结构化规则检索、轻量信念状态和规则优先仲裁解决LLM在封闭世界具身环境中的失效问题,显著提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17761 2026-03-19 cs.CV 57%

Evidence Packing for Cross-Domain Image Deepfake Detection with LVLMs

跨领域图像深度伪造检测中的证据打包与大视觉语言模型

Yuxin Liu, Fei Wang, Kun Li, Yiqi Nie, Junjie Chen, Zhangling Duan, Zhaohong Jia

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) IAI, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) United Arab Emirates University(阿拉伯联合酋长国大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SCEP框架,通过证据驱动推理提升跨领域图像深度伪造检测性能,无需微调大视觉语言模型,有效识别伪造线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17753 2026-03-19 cs.CV 57%

PC-CrossDiff: Point-Cluster Dual-Level Cross-Modal Differential Attention for Unified 3D Referring and Segmentation

PC-CrossDiff:点-簇双级跨模态微分注意力用于统一的3D指称与分割

Wenbin Tan, Jiawen Lin, Fangyong Wang, Yuan Xie, Yong Xie, Yachao Zhang, Yanyun Qu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出PC-CrossDiff框架,通过双级跨模态微分注意力解决复杂多物体场景中指称理解和分割的挑战,提升3D视觉定位的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17746 2026-03-19 cs.CV 57%

Concept-to-Pixel: Prompt-Free Universal Medical Image Segmentation

概念到像素:无提示通用医学图像分割

Haoyun Chen, Fenghe Tang, Wenxin Ma, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences Medicine, University of Science Technology of China (USTC), Hefei, Anhui 230026, China Center for Medical Imaging, Robotics, Analytic Computing \& Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu 215123, China Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123, China State Key Laboratory of Precision

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出C2P框架,通过分离解剖学知识为几何和语义表示,利用多模态大语言模型生成语义令牌,并引入几何令牌约束,实现无提示的通用医学图像分割,实验表明其在多种模态和数据集上表现优异。

Comments 32 pages, code is available at: https://github.com/Yundi218/Concept-to-Pixel

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06313 2026-03-19 cs.CV 57%

WMoE-CLIP: Wavelet-Enhanced Mixture-of-Experts Prompt Learning for Zero-Shot Anomaly Detection

WMoE-CLIP:小波增强的专家混合提示学习用于零样本异常检测

Peng Chen, Chao Huang

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, Shenzhen(中山大学深圳校区计算机科学与技术学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出WMoE-CLIP方法,通过小波分解提取多频图像特征并结合变分自编码器提升提示适应性,引入语义感知的专家混合模块,有效提升零样本异常检测性能。

Journal ref ICASSP 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17540 2026-03-19 cs.IR cs.LG 57%

Deploying Semantic ID-based Generative Retrieval for Large-Scale Podcast Discovery at Spotify

在Spotify上部署基于语义ID的生成检索用于大规模播客发现

Edoardo D'Amico, Marco De Nadai, Praveen Chandar, Divita Vohra, Shawn Lin, Max Lefarov, Paul Gigioli, Gustavo Penha, Ilya Kopysitsky, Ivo Joel Senese, Darren Mei, Francesco Fabbri, Oguz Semerci, Yu Zhao, Vincent Tang, Brian St. Thomas, Alexandra Ranieri, Matthew N. K. Smith, Aaron Bernkopf, Bryan Leung, Ghazal Fazelnia, Mark VanMiddlesworth, Timothy Christopher Heath, Petter Pehrson Skiden, Alice Y. Wang, Doug J. Cole, Andreas Damianou, Maya Hristakeva, Reid Wilbur, Tarun Chillara, Vladan Radosavljevic, Pooja Chitkara, Sainath Adapa, Juan Elenter, Bernd Huber, Jacqueline Wood, Saaketh Vedantam, Jan Stypka, Sandeep Ghael, Martin D. Gould, David Murgatroyd, Yves Raimond, Mounia Lalmas, Paul N. Bennett

机构 * Spotify

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 本文提出GLIDE模型,通过语义ID实现播客推荐,结合语义、上下文和用户状态,提升用户发现新播客和非习惯性流媒体体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17520 2026-03-19 cs.CV 57%

PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation

PCA-Seg:重新审视开放词汇语义和部分分割中的成本聚合

Jianjian Yin, Tao Chen, Yi Chen, Gensheng Pei, Xiangbo Shu, Yazhou Yao, Fumin Shen

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Normal University(南京师范大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) University of Electronic Science and Technology of China(电子科技大学) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出PCA-Seg方法,通过并行成本聚合缓解类级语义与空间上下文之间的知识干扰,提升开放词汇语义和部分分割性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV 57%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17357 2026-03-19 cs.CR cs.AI 57%

WebPII: Benchmarking Visual PII Detection for Computer-Use Agents

WebPII:用于计算机使用代理的视觉个人身份信息检测基准测试

Nathan Zhao

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.AI

AI总结 本文提出WebPII基准测试,用于评估计算机使用代理中的视觉PII检测。该基准测试包含44,865个标注的电商UI图像,设计了三个关键特性:扩展的PII分类、前瞻性检测和可扩展的生成方法。实验表明,这些设计提高了在不同界面中的检测能力和对新页面类型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17063 2026-03-19 cs.AI 57%

Transformers are Bayesian Networks

Transformer 是贝叶斯网络

Gregory Coppola

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文证明Transformer本质上是贝叶斯网络,通过五种方式展示了其与信念传播的联系,并验证了其在概率估计和推理中的正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16875 2026-03-19 cs.HC cs.AI 57%

Attention Guidance through Video Script: A Case Study of Object Focusing on 360° VR Video Tours

通过视频脚本进行注意力引导:360°VR视频导览中物体聚焦的案例研究

Paulo Vitor Santana Silva, Arthur Ricardo Sousa Vitória, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho

机构 * AKCIT Federal University of Goiás(戈亚斯联邦大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过结合Grounding Dino和Segment Anything模型,利用视频脚本引导用户注意力,提升360°VR视频导览的用户体验。

Journal ref SVR 2024: Proceedings of the 26th Symposium on Virtual and Augmented Reality

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17806 2026-03-19 cs.HC 50%

Building a "-Sensitive Design" Methodology from Political Philosophies or Ideologies

从政治哲学或意识形态构建‘-敏感设计’方法论

Anthony Maocheia-Ricci, Edith Law

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出‘-敏感设计’方法论,结合政治或意识形态价值规范设计过程,通过依赖敏感设计实例展示其应用,并呼吁拓展哲学与设计结合的研究领域。

Comments Position paper for the CHIdeology workshop at CHI 2026, Barcelona. https://ideologies.digital

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17659 2026-03-19 cs.SE 50%

From Symbol to Meaning: Ontological and Philosophical Reflections on Large Language Models in Information Systems Engineering

从符号到意义:关于大语言模型在信息系统工程中的本体论与哲学反思

José Palazzo Moreira de Oliveira

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 大语言模型标志着信息系统工程理论基础的转折点,本文探讨其如何重构语言、意义与系统设计的关系,强调需建立透明且伦理一致的框架以尊重人类中心的知识过程。

Comments This paper constitutes a substantially extended version of a conference article to be published in the proceedings of the International Conference on Enterprise Information Systems ICEIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏