arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-20 至 2026-07-20 共收录 19 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 19 篇

2607.15517 2026-07-20 cs.CV cs.AI 新提交 89%

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试

Bibesh Pyakurel, M. G. Sarwar Murshed

机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。

Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00202 2026-07-20 cs.CV cs.AI 86%

Vision-Language Model Purified Semi-Supervised Semantic Segmentation for Remote Sensing Images

面向遥感图像的视觉-语言模型纯化半监督语义分割

Shanwen Wang, Xin Sun, Danfeng Hong, Fei Zhou

机构 * Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) School of Automation, Southeast University(自动化学院,东南大学) College of Oceanography and Space Informatics, China University of Petroleum (East China)(海洋与空间信息学院,中国石油大学(华东))

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出SemiEarth模型,通过引入视觉-语言模型的伪标签纯化结构,提升遥感图像半监督语义分割的性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 86%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15942 2026-07-20 cs.CV cs.LG 新提交 84%

More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe

以少胜多:一种简单方法构建的大规模遥感视觉语言模型

Stefan Maria Ailuro, Mario Markov, Mohammad Mahdi, Luc Van Gool, Danda Pani Paudel

机构 * INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”信息与自动化研究所)

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 研究针对遥感视觉语言模型,质疑架构专业化必要性,提出通用模型经大规模跨数据和任务训练可获好性能。核心方法是用单一语言策略及多任务强化学习框架训练。主要贡献是在多基准测试中取得竞争力结果,证明数据规模更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15374 2026-07-20 cs.CV 新提交 83%

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

通过强化学习进行推理引导的部件级视觉定位

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15556 2026-07-20 cs.CV 新提交 79%

When Can Test-Time Adaptation Help Zero-Shot CT Vision-Language Models?

测试时自适应何时能帮助零样本CT视觉语言模型?

Ailar Mahdizadeh, Puria Azadi Moghadam, Xiangteng He, Leonid Sigal

机构 * University of British Columbia(英属哥伦比亚大学) Vector Institute(向量研究所)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 研究零样本3D CT视觉语言模型中测试时自适应(TTA)的作用,通过控制诊断分析表明其具有条件性,引入CARVE方法,在基础模型有判别力时能带来一致改进,确立多标签TTA问题及CARVE为基数感知解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04539 2026-07-20 cs.CL cs.AI 版本更新 74%

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization

RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性

Qiming Bao, Juho Leinonen, Paul Denny, Michael J. Witbrock

机构 * University of Auckland(奥克兰大学) Aalto University(阿alto大学)

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15778 2026-07-20 cs.CV cs.AI 新提交 62%

Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding

用于多事件长视频理解的模块化动态粒度视频语言模型

Wei Feng, Xin Wang, Yu-Wei Zhan, Yuwei Zhou, Wenwu Zhu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对长视频理解中视觉令牌预算与多事件捕捉的矛盾问题,提出MoD-VLLM框架,含正-负视频片段定位和模块化动态粒度反射模块,结合动态粒度强化学习策略,在多事件长视频基准测试中显著优于现有基线。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15847 2026-07-20 cs.CL cs.AI 新提交 57%

CAMMAR: Culture-Aware Matryoshka for Metaphorical Arabic Representations

CAMMAR:用于隐喻阿拉伯语表示的文化感知套娃

Suzan Awinat, Alfonso Ortega del Puente

机构 * Autonomous University of Madrid (UAM)(马德里自治大学) IE University(IE大学) Oviedo University(奥维耶多大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究针对阿拉伯语语言模型语义模糊问题,提出CAMMAR框架,通过分阶段语义课程组织意义到嵌套子空间,基于词汇与隐喻表示距离产生隐喻性几何度量,在新数据集上评估,有监督时检测隐喻效果好,还发现基于形态学词根有提升。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15717 2026-07-20 cs.CV cs.GR 新提交 57%

Per-Stroke Temporal Control for Text-to-Motion via Action Units and Action-Detection Guidance

通过动作单元和动作检测引导实现文本到运动的逐笔画时间控制

Euijun Jung, Youngki Lee

机构 * Seoul National University(首尔国立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 研究文本到运动模型中笔画落点时间不可靠问题,引入动作单元,通过轻量级门控适配器构建主干并利用无训练分类器梯度消除误差,在StrokeBench上测量,提高了正确放置单个笔画比率,核心帧成为可控轴。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15615 2026-07-20 cs.CV 新提交 57%

Region-Grounded Vision-Language Learning for Detection-Guided Mammographic Lesion Classification

用于检测引导的乳腺钼靶病变分类的区域基础视觉语言学习

Zhengbo Zhou, Jiren Li, Dooman Arefan, Margarita Zuley, Shandong Wu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 针对乳腺钼靶病变分类,提出区域基础视觉语言学习方法,先通过区域-文本对比预训练对齐特征,引入多组件目标减轻偏差,再联合优化辅助病变检测头,实验表明该方法在多设置下性能优于相关方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15331 2026-07-20 cs.CV 新提交 57%

Training-Free Open-Vocabulary 3D Point-Cloud Segmentation on the Generalized Few-Shot Benchmark

广义少样本基准上的无训练开放词汇3D点云分割

Silas kwabla Gah, Ebenezer Owusu

机构 * University of Ghana(加纳大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 研究广义少样本3D点云分割问题,提出无训练方法,用冻结的3D视觉语言模型与概念分割器,通过跨视图一致性协调,在ScanNet200和ScanNet++基准上提升新类mIoU,且无需少样本支持,效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29538 2026-07-20 cs.SE cs.AI 版本更新 57%

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

RESOURCE2SKILL: 从人类创建的多模态资源中提取可执行智能体技能

Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu, Kai Qiu, Yue Dong, Ji Li, Chong Luo

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) Microsoft(微软)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出RESOURCE2SKILL框架,从教程视频、代码库、文章等人类多模态资源中提取可执行技能,构建分层多模态技能维基,提升智能体在七个领域的任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15948 2026-07-20 cs.SE 新提交 50%

TARS: A Theory-of-Mind Agent for Personalized In-IDE Code Comprehension

TARS:用于个性化IDE内代码理解的心理理论智能体

Leopoldo Todisco, Antonio Della Porta, Stefano Lambiase, Fabio Palomba

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究针对代码理解中LLM助手的不足,提出TARS智能体,基于心理理论范式,剖析开发者特点并调整解释,通过检索增强生成联系项目文档。实验表明它能提升效率、降低认知负荷,解释更适配开发者。

Comments Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15566 2026-07-20 cs.HC 新提交 50%

Physiological Prior-Driven Label Enhancement for Cross-Subject EEG Emotion Recognition

用于跨主体脑电情感识别的生理先验驱动标签增强

Hongyu Zhu, Lin Chen, Yuming Fu, Mounim A. El-Yacoubi, Mingsheng Shang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对跨主体脑电情感识别中标签噪声问题,提出PhyDA框架,通过生理噪声量化器和数据自适应标签细化器,统一神经生理先验与数据驱动的标签细化,实验证明该方法显著优于基线,具有可解释性和鲁棒性。

Comments Submitted; 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15544 2026-07-20 cs.CL 新提交 50%

EpiNarrate: Agentic Generation of Grounded Narratives from Epidemiological Scenario Projections

EpiNarrate:基于流行病学情景预测的有智能体的叙事生成

Rituparna Datta, Srini Venkatramanan, Bryan L. Lewis, Yiqi Su, Harry Hochheiser, Lucie Contamin, Parantapa Bhattacharya, Naren Ramakrishnan, Anil Vullikanti

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute(生物复杂性研究所) Virginia Tech(弗吉尼亚理工大学) University of Pittsburgh(匹兹堡大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究旨在生成公共卫生叙事,提出EpiNarrate框架,将数值推理与自然语言生成分离,通过提取情景轴、构建数据集等步骤,经实验验证该模型能生成事实依据更充分、覆盖范围更广且风格类似专家报告的叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15535 2026-07-20 cond-mat.mtrl-sci 新提交 50%

Symbolic Predicate-Guided Language Agents for Inverse Design of Perovskite Oxides

用于钙钛矿氧化物逆设计的符号谓词引导语言智能体

Dong Hyeon Mok, Seoin Back, Victor Fung, Guoxiang Hu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究钙钛矿氧化物逆设计,引入 DSL 引导策略,将自然语言规则转化为符号谓词,开发 ORCHESTRA 框架。该策略能增强 LLM 智能体推理能力,无需大量特定任务数据集或额外训练,提升材料设计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10113 2026-07-20 cs.CY cs.HC 版本更新 50%

Dark Personality Traits and Online Toxicity: Linking Self-Reports to Reddit Activity

黑暗人格特质与在线毒性:将自我报告与Reddit活动联系起来

Aldo Cerulli, Benedetta Tessa, Giuseppe La Selva, Oronzo Mazzeo, Lorenzo Cima, Lucia Monacis, Stefano Cresci

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究探讨了黑暗人格特质与在线行为之间的关系,发现自我报告的不文明互动与黑暗人格特质相关,但计算特征无法可靠预测人格特质。

Comments Article published in Computers in Human Behavior. Please cite the published version

Journal ref Computers in Human Behavior, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17723 2026-07-20 q-fin.GN 版本更新 50%

LR-Robot: A Unified Supervised Intelligent Framework for Real-Time Systematic Literature Reviews with Large Language Models

LR-Robot:一种结合大语言模型的实时系统性文献综述统一监督智能框架

Wei Wei, Jin Zheng, Zining Wang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出LR-Robot框架,结合AI与专家监督,实现系统性文献综述的多维分类、关系映射和细粒度主题演化分析,通过期权定价案例展示其在文献综合中的应用与效果。

Comments I've uploaded an updated paper and now it's already on arXiv (arXiv:2604.14793)

详情

展开后加载摘要…

URL PDF HTML 收藏