arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-10 至 2026-03-10 共收录 130 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 25 篇

2603.07163 2026-03-10 cs.CV 57%

PromptGate Client Adaptive Vision Language Gating for Open Set Federated Active Learning

PromptGate:面向开放集联邦主动学习的客户端自适应视觉语言门控

Adea Nesturi, David Dueñas Gaviria, Jiajun Zeng, Shadi Albarqouni

机构 * University of Bonn(波恩大学) University Hospital Bonn(波恩大学医院) Clinic for Diagnostic and Interventional Radiology(诊断与介入放射科诊所)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 PromptGate通过动态视觉语言模型门控框架提升开放集联邦主动学习的标注效率,实现高纯度和高召回率的样本筛选。

Comments 3 Figures, 2 Tables, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07039 2026-03-10 cs.AI 57%

Self-Supervised Multi-Modal World Model with 4D Space-Time Embedding

具有4D空间-时间嵌入的自监督多模态世界模型

Lance Legel, Qin Huang, Brandon Voelker, Daniel Neamati, Patrick Alan Johnson, Favyen Bastani, Jeff Rose, James Ryan Hennessy, Robert Guralnick, Douglas Soltis, Pamela Soltis, Shaowen Wang

机构 * Ecological Intelligence Lab(生态智能实验室) School of Complex Adaptive Systems(复杂适应系统学院) University of Houston(休斯顿大学) Geosensing Systems Engineering & Sciences Lab(传感系统工程与科学实验室) Stanford University(斯坦福大学) Allen Institute for Artificial Intelligence(人工智能研究院) Spatial Intelligence Lab(空间智能实验室) Department of Computer Science(计算机科学系) Georgia Institute of Technology(佐治亚理工学院) Florida Museum of Natural History(佛罗里达自然历史博物馆) University of Florida(佛罗里达大学) NSF Institute for Geospatial Understanding(国家科学基金会地理理解研究所) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 DeepEarth通过4D空间-时间嵌入实现自监督多模态世界模型,在生态预测中取得最佳性能。

Comments 8 pages, 5 figures, 1 table. Presented at 2026 World Modeling Workshop, Mila Quebec

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06700 2026-03-10 cs.CV 57%

SIQA: Toward Reliable Scientific Image Quality Assessment

SIQA:迈向可靠的科学图像质量评估

Wenzhe Li, Liang Chen, Junying Wang, Yijing Guo, Ye Shen, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * TongJi University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08303 2026-03-10 cs.HC 50%

Do Models See in Line with Human Vision? Probing the Correspondence Between LVLM Representations and EEG Signals

模型的视觉感知是否与人类视觉一致?探测LVLM表示与EEG信号之间的对应关系

Xin Xiao, Yang Lei, Haoyang Zeng, Xiao Sun, Xinyi Jiang, Yu Tian, Hao Wu, Kaiwen Wei, Jiang Zhong

专题命中 VLM训练与架构 :vision language model(abstract)

AI总结 本文通过EEG信号分析,揭示了LVLM的视觉表示与人类大脑的对应关系,发现中间层与EEG活动对齐,多模态架构提升大脑对齐性,且视觉表现强的模型EEG相似性更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14106 2026-03-10 cs.CL 50%

Stealth Fine-Tuning: Efficiently Breaking Alignment in RVLMs Using Self-Generated CoT

隐形微调:通过自动生成的CoT打破RVLMs的对齐

Le Yu, Zhengyue Zhao, Yawen Zheng, Yunhao Liu

机构 * Machine Intelligence Laboratory, Sichuan University(四川大学人工智能实验室) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Department of Automation, Tsinghua University(清华大学自动化系) Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 本文提出隐形微调方法,通过分段干扰和自动生成输出,有效绕过RVLMs的安全对齐防御,实现更高的ASR性能同时保持推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 5 篇

2603.08069 2026-03-10 cs.CV 83%

Synthetic Defect Image Generation for Power Line Insulator Inspection Using Multimodal Large Language Models

利用多模态大语言模型生成合成缺陷图像用于电力线路绝缘子检测

Xuesong Wang, Caisheng Wang

机构 * Department of Electrical and Computer Engineering, Wayne State University(电气与计算机工程系,韦恩州立大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 利用多模态大语言模型生成合成缺陷图像,提升电力线路绝缘子缺陷识别的准确率和数据效率。

Comments Submitted to Engineering Applications of Artificial Intelligence, Feb. 16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14613 2026-03-10 cs.CL cs.AI cs.CV 81%

Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models

多模态、多任务、多标准自动评估与视觉语言模型

Masanari Ohi, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

机构 * Institute of Science Tokyo(东京科学研究所) MBZUAI NII LLMC(日本国立信息与通信技术研究所语言模型中心)

专题命中 其他VLM :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HarmonicEval,一种无需参考的多任务多标准自动评估指标,通过聚合标准评分提升与人类判断的相关性,并构建MMHE基准测试多任务场景下的评估泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08668 2026-03-10 cs.RO 78%

Exp-Force: Experience-Conditioned Pre-Grasp Force Selection with Vision-Language Models

Exp-Force:基于视觉-语言模型的经验条件预抓取力选择

Siqi Shang, Minchao Huang, Bill Fan, Lillian Chin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他VLM :vision-language model(title,abstract)

AI总结 Exp-Force通过经验条件框架利用视觉-语言模型实现基于单张图像的预抓取力选择,显著提升了抓取力的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06991 2026-03-10 cs.SD cs.LG 70%

Adaptive Discovery of Interpretable Audio Attributes with Multimodal LLMs for Low-Resource Classification

基于多模态大语言模型的低资源音频分类中可解释属性的自适应发现

Kosuke Yoshimura, Hisashi Kashima

机构 * Kyoto University(京都大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 本文提出利用多模态大语言模型自适应发现可解释音频属性,提升低资源音频分类的效率和准确性。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08060 2026-03-10 cs.HC 50%

CinemaWorld: Generative Augmented Reality with LLMs and 3D Scene Generation for Movie Augmentation

CinemaWorld: 基于 LLM 和 3D 场景生成的生成增强现实用于电影增强

Keiichi Ihara, DaeHo Lee, Manato Abe, Hye-Young Jo, Ryo Suzuki

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 CinemaWorld 利用 LLM 和 3D 场景生成技术,通过增强现实将电影内容与现实环境结合,提升观影沉浸感和娱乐性。

Comments 13 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏