arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-06 至 2026-04-06 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 13 篇

2604.02893 2026-04-06 cs.CV cs.AI cs.LG 88%

Toward an Artificial General Teacher: Procedural Geometry Data Generation and Visual Grounding with Vision-Language Models

迈向人工通用教师:基于视觉-语言模型的程序几何数据生成与视觉语义

Hai Nguyen-Truong, Alper Balbay, Tunga Bayrak

机构 * Freya

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(title);分类 cs.CV、cs.AI、cs.LG

AI总结 本文研究几何教育中的视觉解释问题,提出通过程序生成几何图示数据,结合视觉-语言模型进行领域特定微调,提升几何元素分割性能,并引入几何感知的评估指标。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13633 2026-04-06 cs.CV 83%

EGM: Efficient Visual Grounding Language Models

EGM: 高效视觉语义语言模型

Guanqi Zhan, Changye Li, Zhijian Liu, Yao Lu, Yi Wu, Song Han, Ligeng Zhu

机构 * NVIDIA(英伟达) MIT(麻省理工学院) University of Oxford(牛津大学) Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual language model(abstract);分类 cs.CV

AI总结 本文提出EGM,通过生成大量中等质量token来提升小模型的视觉语义能力,实验证明其在效率和性能上优于大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02860 2026-04-06 cs.CV cs.AI 81%

A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos

范式转变:面向视频中的时序句子定位的端到端训练

Allen He, Qi Liu, Kun Liu, Xinchen Liu, Wu Liu

机构 * BASIS International School Park Lane Harbour(贝赛思国际学校(公园港)) UCAS(中国科学院大学) JD Explore Academy(京东探索研究院) USTC(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种端到端训练范式,联合优化视频主干网络和定位头,通过引入Sentence Conditioned Adapter提升视觉表征,实验表明优于现有方法。

Comments Accepted as CVPR 2026 Workshop PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02502 2026-04-06 cs.CV cs.AI 81%

An Explainable Vision-Language Model Framework with Adaptive PID-Tversky Loss for Lumbar Spinal Stenosis Diagnosis

具有自适应PID-Tversky损失的可解释视觉-语言模型框架用于腰椎管狭窄症诊断

Md. Sajeebul Islam Sk., Md. Mehedi Hasan Shawon, Md. Golam Rabiul Alam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种可解释视觉-语言模型框架,通过空间补丁交叉注意模块和自适应PID-Tversky损失,提升腰椎管狭窄症诊断的准确性与解释性,实现高分割Dice分数和CIDEr评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26584 2026-04-06 cs.CV 74%

Scene Grounding In the Wild

野外场景的场景定位

Tamir Cohen, Leo Segre, Shay Shomer-Chai, Shai Avidan, Hadar Averbuch-Elor

机构 * Tel Aviv University(特拉维夫大学) Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.CV

AI总结 本文提出一种框架,通过将部分重建与完整的参考模型对齐,提升无视觉重叠时的大尺度场景重建一致性。方法基于伪合成渲染,利用3D高斯点云和逆特征优化,引入WikiEarth数据集验证效果。

Comments CVPR 2026. Project page at https://tau-vailab.github.io/SceneGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03040 2026-04-06 cs.CV 70%

QVAD: A Question-Centric Agentic Framework for Efficient and Training-Free Video Anomaly Detection

QVAD:一种以问题为中心的代理框架,用于高效且无需训练的视频异常检测

Lokman Bekit, Hamza Karim, Nghia T Nguyen, Yasin Yilmaz

机构 * Department of Electrical Engineering, University of South Florida, Tampa, Florida, USA(南佛罗里达大学电气工程系,坦帕,佛罗里达州,美国)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 QVAD提出一种以问题为中心的代理框架,通过动态对话机制提升视频异常检测的效率和性能,无需参数更新即可实现高精度检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02593 2026-04-06 cs.CV cs.AI 62%

Moondream Segmentation: From Words to Masks

月梦分割:从词语到掩码

Ethan Reid

机构 * M87 Labs, San Francisco, CA, USA(M87实验室,美国加利福尼亚州旧金山)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 月梦分割基于Moondream 3扩展,通过自回归解码生成掩码并迭代优化,引入强化学习阶段提升分割精度,实现RefCOCO和LVIS数据集的高精度分割结果。

Comments Demo: https://moondream.ai/me/playground

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02479 2026-04-06 cs.CV cs.AI 62%

Generating Satellite Imagery Data for Wildfire Detection through Mask-Conditioned Generative AI

通过掩码条件生成式AI生成卫星图像数据用于野火检测

Valeria Martin, K. Brent Venable, Derek Morgan

机构 * Department of Intelligent Systems and Robotics, University of West Florida(西佛罗里达大学智能系统与机器人系) IHMC(人类与机器认知研究所)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了基于地球观测扩散模型EarthSynth生成野火后Sentinel-2 RGB图像的可能性,通过不同实验配置评估生成效果,发现修补生成优于全图生成,且VLM辅助修补与手工提示效果相当。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17677 2026-04-06 cs.CL cs.AI cs.LG 62%

Adaptive Guidance for Retrieval-Augmented Masked Diffusion Models

适应性引导的检索增强掩码扩散模型

Jaemin Kim, Jong Chul Ye

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ARAM框架,通过动态校准引导尺度提升检索增强扩散模型在知识密集型问答中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03127 2026-04-06 cs.CL cs.AI 57%

Domain-Adapted Retrieval for In-Context Annotation of Pedagogical Dialogue Acts

领域适应的检索用于上下文注释教学对话行为

Jinsook Lee, Kirk Vanacore, Zhuqian Zhou, Bakhtawar Ahtisham, Rene F. Kizilcec

机构 * Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种领域适应的RAG流水线,用于教学对话行为标注,通过轻量级嵌入模型在对话层面索引以提高标注精度,实验显示其在两个真实教学对话数据集上显著优于无检索基线。

Comments 20 pages, 20 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02954 2026-04-06 cs.CL cs.AI 57%

LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation

逻辑毒药:图检索增强生成中的逻辑攻击

Yilin Xiao, Jin Chen, Qinggang Zhang, Yujing Zhang, Chuang Zhou, Longhao Yang, Lingfei Ren, Xin Yang, Xiao Huang

机构 * Southwestern University of Finance and Economics(西南财经大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出LogicPoison攻击框架,通过逻辑推理而非注入虚假内容,破坏图检索增强生成系统中的拓扑结构,从而降低其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23048 2026-04-06 cs.AI 57%

From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics

从抽象到语境:大语言模型在数学中仍无法做到的事情

Bowen Cao, Dongdong Zhang, Yixia Li, Junpeng Liu, Shijue Huang, Chufan Shi, Hongyuan Lu, Yaokang Wu, Guanhua Chen, Wai Lam, Furu Wei

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究揭示LLM在现实应用中数学推理能力不足,提出ContextMATH基准测试,发现正确问题建模是成功的关键,但建模与推理仍是限制因素。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13995 2026-04-06 cs.CL cs.AI cs.CY 57%

ELEPHANT: Measuring and understanding social sycophancy in LLMs

ELEPHANT:测量和理解LLMs中的社交阿谀

Myra Cheng, Sunny Yu, Cinoo Lee, Pranav Khadpe, Lujain Ibrahim, Dan Jurafsky

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究通过ELEPHANT基准测量LLMs中的社交阿谀行为,发现模型在保持用户形象方面比人类更极端,且在道德冲突中倾向于支持用户立场。

详情

展开后加载摘要…

URL PDF HTML 收藏