arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-10 至 2026-08-10 共收录 20 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 20 篇

2608.06799 2026-08-10 cs.RO cs.CV 新提交 90%

Is Forward Prediction Enough? Physical State Grounding for JEPA World Models

前向预测足够吗?面向JEPA世界模型的物理状态 grounding

Haodong Yan, Jiaguan Zhu, Mingyuan Jia, Ruiqing Yin, Junjie He, Zhide Zhong, Junfeng Li, Jinxuan Lu, Hengtao Li, Tianran Zhang, Jiayi Chen, Wenxuan Song, Wen Chen, Yuxiang Gao, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) COCO Matrix

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 针对JEPA世界模型前向预测未明确物理状态可识别性的问题,提出PSG-JEPA模型,通过训练阶段的两个grounding目标提升性能,在三个评估层面均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12738 2026-08-10 cs.CV 版本更新 90%

Direct Visual Grounding by Directing Attention of Visual Tokens

通过引导视觉令牌注意力实现直接视觉 grounding

Parsa Esmaeilkhani, Longin Jan Latecki

机构 * Temple University(特拉华大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision language model(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对VLMs中视觉令牌注意力不足的问题,提出KL注意力损失,结合下一个令牌预测损失,在多个视觉任务上取得显著提升,还引入了用于评估VLMs线条追踪能力的新数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07427 2026-08-10 cs.AI cs.PF 新提交 87%

A Picture is Worth a Thousand Tokens: How Vision Language Models Cut AI Energy Costs While Improving Accuracy

一图胜千词:视觉语言模型如何在提升准确率的同时降低AI能源成本

Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury

专题命中 视觉定位与Grounding :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract)

AI总结 该研究提出将时间序列编码为二维图的视觉语言模型,可大幅减少输入词元、降低推理能耗,同时在电信异常检测等任务中提升准确率,解决了LLM处理多维度KPI数据的低效问题。

Comments Accepted at the 14th European Conference on Renewable Energy Systems (ECRES), July 7--9, 2026, London, UK

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07117 2026-08-10 cs.CV 新提交 86%

Beyond Fluency: A Clinical Benchmark and Anomaly-Enhanced Baseline for Spine MRI Report Generation

超越流畅性:脊柱MRI报告生成的临床基准与异常增强基线

Bruno Palau, Franziska Vogt, Daria Laslo, Haobo Li, Ender Konukoglu, Maria Monzon, Catherine R. Jutzeler

机构 * ETH Zurich(苏黎世联邦理工学院) Swiss Institute of Bioinformatics (SIB)(瑞士生物信息学研究所)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 该研究针对放射学报告的耗时与阅片差异问题,构建腰椎MRI的VLM临床基准,提出半监督U-Net++生成异常热图增强VLM的框架,提升诊断可靠性与可解释性。

Comments Maria Monzon and Catherine R. Jutzeler contributed equally as shared last authors. Accepted at the CV4Clinic Workshop, CVPR 2026

Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6759-6770

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05208 2026-08-10 cs.CV cs.LG 版本更新 82%

Symbolic Graphics Programming with Large Language Models

基于大语言模型的符号图形编程

Yamei Chen, Haoquan Zhang, Yangyi Huang, Zeju Qiu, Kaipeng Zhang, Yandong Wen, Weiyang Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Westlake University(西湖大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 本文针对大语言模型生成符号图形程序(SGP)能力不足的问题,提出带可验证奖励的强化学习方法,在Qwen-2.5-7B上实现与前沿系统相当的SVG生成性能,揭示SGP是跨模态 grounding 的有效视角。

Comments Accepted by Transactions on Machine Learning Research. (32 pages, 12 figures.) This version refines the paper structure, adds experimental results. Project page: https://spherelab.ai/SGP-Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04935 2026-08-10 cs.CV 版本更新 79%

Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection

释放视觉-语言模型在通用人工智能生成图像检测中的潜力

Weihan Cai, Hao Tan, Zichang Tan, Jun Wan, Xinping Gao

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究针对AI生成图像检测,发现视觉-语言模型PE比DINOv3更具潜力,提出语义原型校准(SPC)方法得到PE-SPC,在多基准测试中达到新的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07353 2026-08-10 cs.CL cs.AI cs.IR cs.LG 新提交 76%

Geo-Spatial Concept Probing of Large Language Models: Abstraction, Compositionality, and Grounding

大语言模型的地理空间概念探测:抽象性、组合性与接地性

Karim Radouane, Jose G Moreno, Lynda Tamine

机构 * University of Toulouse(图卢兹大学) IRIT(信息科学与技术研究院(IRIT))

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 该研究针对LLMs的抽象性、组合性与接地性设计测试,构建空间概念基准并开展多模型实验,揭示当前LLMs的概念理解局限,为相关模型的优化提供洞见。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06713 2026-08-10 cs.AI cs.LG 新提交 76%

MolBioKG: Grounding Out-of-Graph Molecules in Biomedical Knowledge Graphs via Multi-Resolution Structural Anchoring

MolBioKG:通过多分辨率结构锚定将图外分子锚定到生物医学知识图谱中

Yiming Zhang, Hikaru Shindo, Shuan Chen, Kaushalya Madhawa, Jun Jin Choong, Yuna Oikawa, Takashi Fujiwara, Keisuke Ozawa

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI、cs.LG

AI总结 MolBioKG是解决生物医学KG中图外分子冷启动问题的两层系统,通过多分辨率结构锚定实现分子与KG的关联,在多项任务中优于基线并提升关键指标。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06076 2026-08-10 cs.AI cs.CV 版本更新 73%

Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation

通过模态差距感知自蒸馏从符号状态学习视觉空间规划

Haocheng Luo, Jiahui Liu, Ruicheng Zhang, Zhizhou Zhong, Jiaqi Huang, Zunnan Xu, Quan Shi, Jun Zhou, Shuiyang Mao, Wei Liu, Xiu Li

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出MGSD两阶段框架,通过冷启动接地和特权教师蒸馏弥合视觉与符号规划之间的模态差距,在视觉规划基准上显著提升性能。

Comments 18 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07434 2026-08-10 cs.CV cs.IR 新提交 70%

Conformal Coverage Guarantees for Any Video Temporal Grounder

任意视频时间定位器的共形覆盖保证

Aseel Mohamed, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 针对视频时间定位器的模糊性问题,提出与模型无关的COVER包装器,可保证输出区域以至少1-α的概率包含真实时刻,在多基准和定位器上验证了其覆盖度符合目标值。

Comments Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07012 2026-08-10 cs.CV 新提交 70%

Scenix: Sparse-View 3D Scene Reconstruction via Executable Scene Programs

Scenix:基于可执行场景程序的稀疏视图3D场景重建

Kai Li, Lutao Jiang, Zhenyang Li, Jiayu Dong, Jierui Zhang, Yingda Yin, Runze Zhang, Kai Yan, Xiaoyang Huang, Keyang Luo, Xin Wang, Xiangyu Zhao, Weikai Chen

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Scenix框架,通过可执行场景程序实现稀疏视图3D室内场景重建,构建了含约11万场景的数据集,引入观测一致性监督,在多类案例上完成相关评估。

Comments 4 figures 5 table 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06841 2026-08-10 cs.CV 新提交 70%

ECAD: Expanding Class-Agnostic Detection Beyond Thing-Centric Objectness

ECAD:超越以事物为中心的对象性的扩展类无关检测

Liang Wan, Zixin Ren, Yupeng Zhang, Yuhan Wang, Fangzhuo Gao

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有目标检测仅聚焦以事物为中心的实例、忽略关键场景元素的问题,本文提出ECAD设置,构建BTCO-Bench基准,设计ECADet检测器并引入GAER与PGQM模块,实验验证其在BTCO-Bench上的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06967 2026-08-10 cs.CL 新提交 67%

Can Language Models Imagine Without Seeing? Ekphrasis: Measuring Visual Creative Ideation in Text-Only LLMs

语言模型无需视觉输入即可进行想象?Ekphrasis:测量仅文本大型语言模型的视觉创意构想能力

Hongyu Luo, He Wang, Huihao Jing, Hong Ting Tsang, Yuxuan Liu, Wuganjing Song, Yauwai Yim, Chunyang Li, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本研究推出基准Ekphrasis,测量仅文本大型语言模型的视觉创意构想能力,发现该能力与流畅度分离,且其排序可跨模态稳定存在。

Comments 25 pages, 4 main figures, with appendices. Code and data: https://github.com/Imhongyu/Ekphrasis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06876 2026-08-10 cs.CV cs.AI cs.DC cs.LG 新提交 67%

FedVAR: Prototype-Aligned Federated Framework for Video Anomaly Recognition

FedVAR:用于视频异常识别的原型对齐联邦框架

Ghani Haider, Majid Kundroo, Boyun Eom, Dong Hwan Park, Chen Chen, Taehong Kim

机构 * Chungbuk National University(忠北国立大学) Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院) University of Central Florida(中佛罗里达大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对联邦视频异常识别中的语义错位问题,本文提出FedVAR框架,通过视觉语言模型的原型对齐机制缓解错位,实验显示其性能优于现有联邦基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17145 2026-08-10 cs.GR 版本更新 67%

Text2Villa: Hierarchical Generation of 3D Indoor Environments with Physics-Aware Analysis-by-Synthesis

Text2Villa:通过物理感知的合成分析进行3D室内环境的分层生成

Xiang Tang, Ruotong Li, Xiaopeng Fan

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 研究旨在解决从自然语言生成3D室内场景的问题,提出Text2Villa框架。宏观构建数据集微调布局生成器,微观引入A-PSSG并结合碰撞检测与语义推理,有效解决相关问题,性能优于以往方法,为下游应用提供3D内容基础。

Comments 17 pages, 12 figures, Project page: https://xdlbw.github.io/Text2Villa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07015 2026-08-10 cs.CV 新提交 57%

Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection

先理解再检测:用于全域红外小目标检测的视觉-语言学习

Haoyang Yuan, Boyang Li, Yingqian Wang, Yimian Dai, Nuo Chen, Xinfei Huang, Shuqi Yi, Zaiping Lin, Weidong Sheng, Wei An

机构 * National University of Defense Technology(国防科技大学) College of Computer Science, Nankai University(南开大学计算机学院) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对全域红外小目标检测的域偏移问题,提出“先理解再检测”范式及JinSight方法,构建视觉-语言数据集OmniIRST-VL,实现跨异构红外域的泛化检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06913 2026-08-10 cs.CV 新提交 57%

MuST-VAD: Mutual Structured Learning for Video Anomaly Detection

MuST-VAD:用于视频异常检测的互结构化学习

Satoshi Hashimoto, Hitoshi Nishimura, Mori Kurokawa

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 MuST-VAD是用于弱监督视频异常检测的互结构化学习框架,通过检测器与LVLM的双向知识交换,在UCF-Crime数据集上显著提升了检测精度,AP优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08808 2026-08-10 cs.CV 57%

Identity-Preserving Aging and De-Aging of Faces in the StyleGAN Latent Space

Luis S. Luevano, Pavel Korshunov, Sebastien Marcel

机构 * Idiap Research Institute(Idiap研究机构)

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV

Comments Accepted for publication in IEEE International Joint Conference on Biometrics (IJCB), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06495 2026-08-10 cs.CL 新提交 50%

ConstructCIE: A Dataset for Extracting Causal Information from Construction Accident Narratives

ConstructCIE:用于从施工事故叙述中提取因果信息的数据集

Hung Nguyen, Jaehoon Lee, Namgyun Kim, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14380 2026-08-10 cs.CL 版本更新 50%

VISHC at PsyDefDetect: Mitigating Data Scarcity in Psychological Defense Classification with Context-Aware Synthetic Augmentation

通过上下文感知的合成增强缓解心理防御分类中的数据稀缺

Hoang-Thuy-Duong Vu, Quoc-Cuong Pham, Huy-Hieu Pham

机构 * College of Engineering and Computer Science, VinUniversity, Hanoi, Vietnam(越南 Vin大学工程与计算机科学学院,河内,越南) VinUni-Illinois Smart Health Center, VinUniversity, Hanoi, Vietnam(越南 Vin大学与伊利诺伊大学智能健康中心,河内,越南) Center for Innovations in Health Sciences, VinUniversity, Hanoi, Vietnam(越南 Vin大学健康科学创新中心,河内,越南)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出上下文感知合成增强框架与混合分类模型,解决心理防御机制分类中的数据稀缺问题,实验表明方法在低资源环境下取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏