arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-12 至 2026-08-12 共收录 101 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 21 篇

2608.10525 2026-08-12 cs.CV cs.AI 新提交 62%

Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

动态上下文适配器:将历史信息高效注入视觉-语言模型

Yuhang Song, Bor-Jiun Lin, Jiaxu Liu, Te-Chuan Chiu, Anh Nguyen, Chun-Yi Lee

机构 * University of Liverpool(利物浦大学) National Tsinghua University(国立清华大学) Imperial College London(伦敦帝国学院) National Taiwan University(国立台湾大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉-语言模型整合历史上下文时的计算与信息损失问题,提出动态上下文适配器(DCA),实现高效历史注入,降低注意力FLOPs超25%、内存13%,提升长时序任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13738 2026-08-12 cs.CV cs.AI 版本更新 62%

Ablation-Corrected Evaluation of Attribution Maps in Echocardiographic Ejection-Fraction Models

解剖结构忠实但时间上盲目:超声心动图左心室射血分数估计的归因审核

Hyunkyung Han, Min Jung Kim

机构 * School of Integrated Medicine, Yonsei University(延世大学统合医学院) Department of Radiology, Research Institute of Radiologic Science, Yonsei University College of Medicine(延世大学医学院放射科学研究所放射科)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究超声心动图左心室射血分数估计模型的归因,微调VideoMAE Transformer和R(2+1)D CNN两个回归器,用多指标审核发现模型空间忠实但时间盲目,强调空间忠实不代表时间忠实,警示XAI验证并呼吁时间感知训练评估。

Comments 12 pages, 4 figures. v2: the chance level is now measured rather than computed, which corrects the ratios reported in v1. Adds a composition-matched ablation with an equal-area control, a reliability estimate for it, an ablation-derived score to report alongside overlap, seed repetition, and pediatric validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04009 2026-08-12 cs.CV cs.AI 版本更新 62%

Token-Based Detection of Spurious Correlations in Vision Transformers

基于Token的视觉Transformer虚假相关性检测

Solha Kang, Esla Timothy Anzaku, Wesley De Neve, Arnout Van Messem, Joris Vankerschaver, Francois Rameau, Utku Ozbulak

机构 * Center for Biosystems and Biotech Data Science(生物系统与生物技术数据科学中心) Ghent University Global Campus(根特大学全球校区) State University of New York Korea(纽约州立大学韩国分校) Department of Mathematics(数学系) Université de Liège(列日大学) Department of Applied Mathematics, Computer Science and Statistics(应用数学、计算机科学与统计学系) Ghent University(根特大学) Department of Electronics and Information Systems(电子与信息系统系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出基于Token的诊断流程,通过留一Token移除法检测视觉Transformer中的虚假相关性,经ImageNet等实验验证了方法的有效性,还探讨了虚假信号的来源及相关案例。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 57%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10497 2026-08-12 cs.CV 新提交 57%

SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception

SapiensID 2.0:将人类识别基础模型与人类感知对齐

Yiyang Su, Jie Zhu, Feng Liu, Anil K. Jain, Xiaoming Liu

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 该研究针对现有人类识别模型与人类感知脱节的问题,提出兼具语义与时间感知的SapiensID 2.0框架,通过多项技术实现最优识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13661 2026-08-12 cs.CV 版本更新 57%

Fine-grained CLIP fine-tuning with self-annotated region alignment

基于自标注区域对齐的细粒度CLIP微调

Chenyang Zhao, Wei Lin, Janet H. Hsiao, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Hong Kong University of Science & Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对CLIP在细粒度表示上的局限,提出SFF-CLIP方法,仅用图像-文本对输入,通过运行时区域-短语对齐方案提升其细粒度表示能力,在相关任务中性能显著提升且维持原CLIP图像级任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21944 2026-08-12 cs.LG 版本更新 57%

Clarity: The Flexibility-Interpretability Trade-Off in Sparsity-aware Concept Bottleneck Models

Clarity:稀疏性感知概念瓶颈模型中的灵活性与可解释性权衡

Konstantinos P. Panousis, Diego Marcos

机构 * Department of Statistics, University of Economics and Business(经济与商业大学统计系) UMR TETIS, Inria, EVERGREEN, University of Montpellier(蒙彼利埃大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

AI总结 研究探讨了概念瓶颈模型中稀疏性对语义对齐的影响,提出Clarity指标衡量下游性能与概念激活稀疏性和精度的相互作用,通过实验揭示灵活性与可解释性之间的关键权衡。

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 4 篇

2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新 80%

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10932 2026-08-12 cs.CV cs.AI 新提交 62%

Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation

基于几何知识蒸馏的时序锚定组合式相机运动理解

Dazhao Du, Shiyan Du, Jian Liu, Yongjian Yu, Bohai Gu, Tao Han, Hualuo Liu, Eric Liu, Yujia Zhang, Xi Chen, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10706 2026-08-12 cs.CV cs.MM 新提交 57%

MMArt A Multi-Perspective Multimodal Dataset for Visual Art Understanding

MMArt:用于视觉艺术理解的多视角多模态数据集

Shuai Wang, Wangyuan Ding, Yixian Shen, Jia-Hong Huang, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) College of Business and Economics, University of Johannesburg(约翰内斯堡大学经济与商学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对现有艺术数据集单视角局限,推出含74234幅WikiArt画作的多视角多模态数据集MMArt,通过分析各视角特性证实多视角设计的必要性,为视觉艺术理解提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10154 2026-08-12 cs.CL cs.AI 新提交 57%

Multimodal Item Parameter Estimation using Simulated Response Probabilitie

基于模拟响应概率的多模态题目参数估计

Christopher Ormerod, YoungKoung Kim

机构 * College Board(大学理事会)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 本研究基于Qwen3.5微调多模态大语言模型,利用含图像与文本的多项选择题训练语料,通过学习学生能力相关的选择概率,实现了题目参数的准确估计。

Comments Submitted and Accepted for AIME-Con 2026

详情

展开后加载摘要…

URL PDF HTML 收藏