arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-26 至 2026-03-26 共收录 16 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 16 篇

2603.23067 2026-03-26 cs.CV 89%

MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding

MLLM-HWSI: 一种用于分层全滑动图像理解的多模态大语言模型

Basit Alawode, Arif Mahmood, Muaz Khalifa Al-Radi, Shahad Albastaki, Asim Khan, Muhammad Bilal, Moshira Ali Abdalla, Mohammed Bennamoun, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系) Information Technology University(信息技术大学) KAU(卡乌大学) University of the Western Australia(西澳大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出MLLM-HWSI,一种分层全滑动图像级多模态大语言模型,通过四级尺度对齐视觉特征与病理语言,提升解释性证据接地推理能力,在六个CPath任务上取得新SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23676 2026-03-26 cs.AI cs.RO 85%

Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement

将视觉与语言接地于3D遮罩以实现长周期箱子整理

Ashish Malik, Caleb Lowe, Aayam Shrestha, Stefan Lee, Fuxin Li, Alan Fern

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出RAMP-3D模型,通过3D遮罩的序列预测实现长周期3D箱子整理任务,优于2D VLM基线,证明基于遮罩的反应策略在长周期规划中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23972 2026-03-26 cs.CL cs.IR 71%

Grounding Arabic LLMs in the Doha Historical Dictionary: Retrieval-Augmented Understanding of Quran and Hadith

以多哈历史词典为基础 grounding Arabic LLMs:检索增强的古兰经和圣训理解

Somaya Eltanbouly, Samer Rashwani

机构 * College of Islamic Studies, Hamad bin Khalifa University(哈马德·本·哈利法大学伊斯兰学院)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出基于多哈历史词典的检索增强生成框架,提升阿拉伯语LLM对历史宗教文本的理解能力,实验表明在Fanar和ALLaM模型上准确率超过85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24454 2026-03-26 cs.CV 70%

Unleashing Vision-Language Semantics for Deepfake Video Detection

释放视觉-语言语义以进行深度伪造视频检测

Jiawen Zhu, Yunqi Miao, Xueyi Zhang, Jiankang Deng, Guansong Pang

机构 * Singapore Management University(新加坡管理学院) The University of Warwick(沃里克大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VLAForge框架,通过ForgePerceiver增强视觉感知并引入身份感知VLA评分,利用跨模态语义提升深度伪造检测的判别能力。

Comments 14 pages, 7 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23517 2026-03-26 cs.LG cs.AI cs.CL cs.SC 62%

Beyond Accuracy: Introducing a Symbolic-Mechanistic Approach to Interpretable Evaluation

超越准确度:引入符号-机械方法进行可解释性评估

Reza Habibi, Darian Lee, Magy Seif El-Nasr

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出符号-机械方法,通过结合任务相关符号规则与机械可解释性,评估模型在小数据下的泛化能力,揭示传统准确度指标无法检测的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15087 2026-03-26 cs.CV cs.CL cs.LG 62%

Phrase-Instance Alignment for Generalized Referring Segmentation

短语-实例对齐用于通用指称分割

E-Ro Nguyen, Hieu Le, Dimitris Samaras, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳州立大学 Charlotte 分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出通过短语-实例对齐解决通用指称分割问题,通过实例级推理和POA损失实现精确对应,提升分割性能。

Comments Accepted to PVUW - CVPR 2026 Workshop. Webpage: https://eronguyen.github.io/InstAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24166 2026-03-26 cs.CV 57%

Heuristic-inspired Reasoning Priors Facilitate Data-Efficient Referring Object Detection

启发式推理先验促进数据高效的指代物体检测

Xu Zhang, Zhe Chen, Jing Zhang, Dacheng Tao

机构 * The University of Sydney(悉尼大学) La Trobe University(拉特罗布大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出HeROD框架,通过注入启发式推理先验提升数据稀缺条件下的指代物体检测性能,实验表明其在低数据和少样本场景下优于现有基线。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24057 2026-03-26 cs.CV 57%

Beyond Semantic Priors: Mitigating Optimization Collapse for Generalizable Visual Forensics

超越语义先验:缓解可泛化视觉取证中的优化崩溃

Jipeng Liu, Haichao Shi, Siyu Xing, Rong Yin, Xiao-Yu Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Science and Technology, Beihang University(北京航空航天大学信息与科学学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CoRIT模型,通过对比梯度代理和三种无训练策略缓解优化崩溃,提升跨领域和通用伪造检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01540 2026-03-26 cs.CV 57%

FlashVGGT: Efficient and Scalable Visual Geometry Transformers with Compressed Descriptor Attention

FlashVGGT: 高效且可扩展的视觉几何变换器与压缩描述符注意力

Zipeng Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出FlashVGGT,通过压缩描述符注意力机制解决传统自注意力的可扩展性问题,实现高效多视角图像三维重建,实验表明其在精度和效率上优于VGGT。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24535 2026-03-26 cs.CL cs.CY 50%

Representation Learning to Study Temporal Dynamics in Tutorial Scaffolding

基于表示学习研究教程支架的动态过程

Conrad Borchers, Jiayi Zhang, Ashish Gurung

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过对话语义对齐分析,揭示了教程支架中任务对齐和时间模式的系统差异,证明角色特定语义对齐能预测教学进展。

Comments Accepted as short paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21686 2026-03-26 cs.MA 50%

Is AI Ready for Multimodal Hate Speech Detection? A Comprehensive Dataset and Benchmark Evaluation

人工智能是否准备好进行多模态仇恨言论检测?一个全面的数据集和基准评估

Rui Xing, Qi Chai, Jie Ma, Jing Tao, Pinghui Wang, Shuming Zhang, Xinping Wang, Hao Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract)

AI总结 本文提出M^3数据集,通过七种专门代理生成细粒度仇恨标签和理由,揭示现有多模态模型在处理真实世界语境时的不足,强调需发展上下文感知的多模态架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24021 2026-03-26 cs.RO 50%

QuadFM: Foundational Text-Driven Quadruped Motion Dataset for Generation and Control

QuadFM: 用于生成与控制的四足运动基础数据集

Li Gao, Fuzhi Yang, Jianhui Chen, Liu Liu, Yao Zheng, Yang Cai, Ziqiao Li

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 QuadFM 是首个大规模高保真四足运动数据集,包含11784个运动片段,涵盖多种运动、交互和情绪表达行为,支持语言驱动的运动生成与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23938 2026-03-26 cs.CL 50%

OmniACBench: A Benchmark for Evaluating Context-Grounded Acoustic Control in Omni-Modal Models

OmniACBench:一种评估多模态模型上下文感知语音控制的基准

Seunghee Kim, Bumkyu Park, Kyudan Jung, Joosung Lee, Soyoon Kim, Jeonghoon Kim, Taeuk Kim, Hwiyeol Jo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST AI(韩国科学技术院人工智能研究所) NAVER Cloud(NAVER云)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 OmniACBench评估多模态模型在上下文感知语音生成中的能力,通过语音速率、音调等六种特征验证,揭示模型在多模态整合中的瓶颈及三种常见失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23828 2026-03-26 cs.SE cs.HC 50%

Bridging the Interpretation Gap in Accessibility Testing: Empathetic and Legal-Aware Bug Report Generation via Large Language Models

弥合可访问性测试中的解释鸿沟:通过大语言模型生成共情且法律意识的缺陷报告

Ryoya Koyama, Zhiyao Wang, Devi Karolita, Jialong Li, Kenji Tei

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出HEAR框架,通过语义切片和视觉定位重建UI上下文,注入残疾导向的人设并多层推理,生成共情且法律意识的缺陷报告,提升非专业人士对用户伤害和合规风险的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01287 2026-03-26 cs.CR 50%

Compliance as a Trust Metric

合规作为信任度量

Wenbo Wu, George Konstantinidis

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过新型自动化合规引擎ACE,将合规性作为定量动态信任度量,通过量化模型评估违规严重性,实现更透明、可问责的TRMS。

Journal ref Financial Cryptography and Data Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24856 2026-03-26 econ.TH cs.AR cs.CE cs.ET 50%

Advances in Agentic AI: Back to the Future

代理AI的进展:回到未来

Sergio Alvarez-Telena, Marta Diez-Fernandez

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文探讨代理AI与算法化领域的融合,提出清晰的概念定义和分析框架,回顾过去十年的方法和技术进展,并提出M1和M2的架构概念,为未来二十年的研究和转型制定计划。

详情

展开后加载摘要…

URL PDF HTML 收藏