arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-23 至 2026-02-23 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 9 篇

2602.17826 2026-02-23 cs.AI cs.LG cs.SC 81%

Ontology-Guided Neuro-Symbolic Inference: Grounding Language Models with Mathematical Domain Knowledge

本体引导的神经符号推理:通过数学领域知识 grounding 语言模型

Marcelo Labre

机构 * Advanced Institute for Artificial Intelligence (AI2)(人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过引入形式化数学本体,提升语言模型在数学推理任务中的可靠性,验证了神经符号方法在增强形式化 grounding 方面的潜力与挑战。

Comments Submitted to NeuS 2026. Supplementary materials and code: https://doi.org/10.5281/zenodo.18665030

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18031 2026-02-23 cs.CV cs.AI cs.LG 78%

ViGText: Deepfake Image Detection with Vision-Language Model Explanations and Graph Neural Networks

ViGText: 基于视觉-语言模型解释和图神经网络的深度伪造图像检测

Ahmad ALBarqawi, Mahmoud Nazzal, Issa Khalil, Abdallah Khreishah, NhatHai Phan

机构 * New Jersey Institute of Technology(新泽西理工学院) Old Dominion University(旧 Dominion 大学)

专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

AI总结 ViGText结合视觉-语言模型解释和图神经网络,提升深度伪造检测的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17677 2026-02-23 cs.LG cs.CL cs.RO 77%

Reducing Text Bias in Synthetically Generated MCQAs for VLMs in Autonomous Driving

减少自动驾驶VLMs中合成生成MCQA的文本偏差

Sutej Kulgod, Sean Ye, Sanchit Tanwar, Christoffer Heckman

机构 * Zoox, Inc.(Zoox公司)

专题命中 视觉定位与Grounding :vision language model(abstract);VLM(abstract);grounding(abstract);分类 cs.LG

AI总结 本文提出方法减少自动驾驶VLMs中合成生成MCQA的文本偏差,通过解耦正确答案与语言痕迹并采用课程学习策略,使模型依赖视觉基础以提升感知理解能力。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10164 2026-02-23 cs.AI cs.SC 57%

Two Constraint Compilation Methods for Lifted Planning

用于提升规划的两种约束编译方法

Periklis Mantenoglou, Luigi Bonassi, Enrico Scala, Pedro Zuidberg Dos Martires

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出两种无需地面化的约束编译方法,用于提升大规模规划问题的效率和规范简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17913 2026-02-23 cs.DB cs.AI 57%

From Lossy to Verified: A Provenance-Aware Tiered Memory for Agents

从损失到验证:一种面向代理的分层内存

Qiming Zhu, Shunian Chen, Rui Yu, Zhehao Wu, Benyou Wang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 TierMem 提出了一种面向代理的分层内存框架,通过双层内存结构在推理时分配证据,以降低 token 消耗和延迟,提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17799 2026-02-23 cs.CV 57%

Enabling Training-Free Text-Based Remote Sensing Segmentation

无需训练的基于文本的遥感分割

Jose Sosa, Danila Rukhovich, Anis Kacem, Djamila Aouada

机构 * SnT, University of Luxembourg(SnT,卢森堡大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本研究提出无需额外训练的遥感分割方法,结合对比和生成型VLMs与SAM,实现零样本开放词汇语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18203 2026-02-23 q-bio.BM 50%

Metrology of Complexity and Implications for the Study of the Emergence of Life

复杂性的计量及其对生命起源研究的启示

Sara Imari Walker

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过分子组装理论测量分子复杂性,以研究生命起源的物理机制,并推动跨学科的统一研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16206 2026-02-23 cs.HC 50%

The Agony of Opacity: Foundations for Reflective Interpretability in AI-Mediated Mental Health Support

透明的痛苦:面向人工智能辅助心理健康支持的反思可解释性基础

Sachin R. Pendse, Darren Gergle, Rachel Kornfield, Kaylee Kruzan, David Mohr, Jessica Schleider, Jina Suh, Annie Wescott, Jonah Meyerhoff

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种面向人工智能辅助心理健康支持的反思可解释性方法,旨在提升用户对模型输出的理解和自主性,以应对严重心理困扰的特殊需求。

Comments Accepted to IASEAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18145 2026-02-23 cs.CL 50%

Detecting Contextual Hallucinations in LLMs with Frequency-Aware Attention

基于频率感知注意力的LLM幻觉检测

Siya Qi, Yudong Chen, Runcong Zhao, Qinglin Zhu, Zhanghao Hu, Wei Liu, Yulan He, Zheng Yuan, Lin Gui

机构 * Department of Informatics, King's College London, UK(伦敦国王学院信息学院) Department of Statistics, University of Warwick, UK(沃里克大学统计系) School of Computer Science, The University of Sheffield, UK(谢菲尔德大学计算机科学学院) The Alan Turing Institute, UK(艾伦·图灵研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种基于频率感知注意力的轻量级幻觉检测方法,通过分析生成过程中注意力的高频成分,有效识别幻觉token,提升了LLM在上下文生成中的可靠性。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏