arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-12 至 2026-05-12 共收录 174 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 43 篇

2605.10228 2026-05-12 cs.MM 67%

FLARE: Full-Modality Long-Video Audiovisual Retrieval Benchmark with User-Simulated Queries

FLARE:全模态长视频音频视觉检索基准测试与用户模拟查询

Qijie You, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhenhao Wong, Wentao Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 FLARE基准测试通过全模态长视频和用户模拟查询,评估视频检索在多模态大语言模型中的表现,揭示用户查询对模型行为的影响及音频语言对齐的关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10343 2026-05-12 cs.CV cs.AI 62%

EvoStreaming: Your Offline Video Model Is a Natively Streaming Assistant

EvoStreaming: 你的离线视频模型本质上是一个原生流式助手

Zichen Wen, Boxue Yang, Junlong Ke, Jiajie Huang, Chenfei Liao, Junxi Wang, Xuyang Liu, Linfeng Zhang

机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Fudan University(复旦大学)

专题命中 VLM训练与架构 :InternVL(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EvoStreaming框架,通过自演化方法使离线视频模型适应流式助手任务,仅需1000个自生成样本即可提升RealStreamEval评分,并保持离线性能。

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09827 2026-05-12 cs.CV cs.AI 62%

Fashion Florence: Fine-Tuning Florence-2 for Structured Fashion Attribute Extraction

Fashion Florence:基于Florence-2的结构化时尚属性提取微调

Anushree Berlia

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Fashion Florence,通过LoRA微调Florence-2模型,实现从服装图像中提取结构化时尚属性。模型在iMaterialist Fashion数据集上训练,生成包含类别、颜色、材质、风格和场合标签的JSON输出,适用于下游推荐和检索系统。

Comments Model: https://huggingface.co/anushreeberlia/fashion-florence

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08560 2026-05-12 cs.CV cs.AI 62%

ZAYA1-VL-8B Technical Report

ZAYA1-VL-8B 技术报告

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

机构 * Zyphra

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 ZAYA1-VL-8B 是基于内部语言模型 ZAYA1-8B 构建的紧凑多专家视觉语言模型,在多个图像理解、推理和计数基准上超越了 Qwen2.5-VL-3B、PLM-3B 和 MolmoE-1B 等模型。

Comments 20 pages, 7 figures, 3 appendices (with 31 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19774 2026-05-12 cs.LG 57%

If Concept Bottlenecks are the Question, are Foundation Models the Answer?

如果概念瓶颈是问题,那么基础模型是答案吗?

Nicola Debole, Pietro Barbiero, Francesco Giannini, Andrea Passerini, Stefano Teso, Emanuele Marconato

机构 * DISI, University of Trento(特伦托大学DISI实验室) IBM Research Zurich(IBM瑞士苏黎世研究实验室) Faculty of Sciences, Scuola Normale Superiore(科学学院,正则大学) CIMeC, University of Trento(特伦托大学CIMeC实验室)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

AI总结 本文研究了基础模型在概念瓶颈模型中的影响,发现其在不同任务中与专家标注存在差异,且概念准确性与质量不强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09982 2026-05-12 cs.CV 57%

ERASE: Eliminating Redundant Visual Tokens via Adaptive Two-Stage Token Pruning

ERASE: 通过自适应两阶段令牌剪枝消除冗余视觉令牌

Yuna Lee, Kyoungho Min, Yulhwa Kim

机构 * Department of Electrical and Computer Engineering, Sungkyunkwan University, Republic of Korea(电气与计算机工程系,成均馆大学,大韩民国) Department of Semiconductor Systems Engineering, Sungkyunkwan University, Republic of Korea(半导体系统工程系,成均馆大学,大韩民国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出ERASE框架,通过自适应两阶段令牌剪枝方法减少冗余视觉令牌,实验证明在85%的令牌剪枝率下,模型准确率保持在89.46%。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 57%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09606 2026-05-12 cs.CR cs.CV 57%

On the Generation and Mitigation of Harmful Geometry in Image-to-3D Models

关于图像到3D模型中有害几何的生成与缓解

Yule Liu, Yilong Yang, Jiale Teng, Hanze Jia, Zeren Luo, Jingyi Zheng, Zifan Peng, Ke Li, Yifan Liao, Zhen Sun, Jiaheng Wei, Yang Liu, Zhuo Ma, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Xidian University(西安电子科技大学) Zhejiang University(浙江大学) Wuhan University(武汉大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 研究探讨了图像到3D模型生成有害几何的风险及缓解方法,通过系统评估发现当前模型能有效重建有害几何,但现有防护措施存在不足,提出堆叠防御策略以降低有害几何留存率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09242 2026-05-12 eess.IV cs.CV 57%

Cross-Modal Semantic-Enhanced Diffusion Framework for Diabetic Retinopathy Grading

跨模态语义增强的扩散框架用于糖尿病视网膜病变分级

Yiqun Wang

机构 * School of Software Engineering Beijing Jiaotong University(软件工程学院 北京交通大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CLIP引导语义扩散框架,通过整合视觉-语言预训练与扩散概率建模,解决糖尿病视网膜病变分级中的细粒度病变模式区分、分布差异和临床语义知识利用问题。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00327 2026-05-12 cs.AI cs.HC 57%

SayNext-Bench: Why Do LLMs Struggle with Next-Utterance Anticipation?

SayNext-Bench:为什么LLMs在下一句预测中挣扎?

Yueyi Yang, Haotian Liu, Fang Kang, Mengqi Zhang, Zheng Lian, Hao Tang, Haoyu Chen

机构 * University of Oulu(奥卢大学) College of William and Mary(威廉与玛丽学院) Tongji University(同济大学) Peking University(北京大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.AI

AI总结 研究探讨LLM在人类对话中的下一句预测能力,指出人类可通过多模态线索预测,而LLM表现不足。提出SayNext-Bench基准,结合多模态数据集和评估框架,开发SayNext-Chat模型,证明其在多层面优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21677 2026-05-12 cs.LG cs.SE 57%

Prophecy: Inferring Formal Properties from Neuron Activations

预言:从神经元激活推断形式属性

Divya Gopinath, Corina S. Pasareanu, Muhammad Usman

机构 * NASA Ames(NASA阿姆斯研究中心) KBR(KBR公司) CMU(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 Prophecy通过分析神经网络内部层的神经元激活状态,自动推断前馈网络的形式属性,适用于不同模型和输出属性的验证与监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09338 2026-05-12 cs.IR 50%

A General Framework for Multimodal LLM-Based Multimedia Understanding in Large-Scale Recommendation Systems

多模态大语言模型在大规模推荐系统中的通用框架

Yiming Zhu, Xu Liu, Ziyun Xu, Zheng Wu, Joena Zhang, Sirius Chen, Chenheli Hua, Silvester Yao, Qichao Que, Wentao Shi, Junfeng Pan, Linhong Zhu

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出一个通用框架,利用多模态大语言模型提升多媒体内容理解,通过三部分架构实现内容解析、特征提取和系统集成,实验证明在推荐系统中提升了AUC和在线指标。

Comments Accepted by SIGIR 2026 short

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01008 2026-05-12 cs.CL 50%

MARS-SQL: A multi-agent reinforcement learning framework for Text-to-SQL

MARS-SQL: 一种用于文本到SQL的多智能体强化学习框架

Haolin Yang, Jipeng Zhang, Zhitao He, Alexander Zhou, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 MARS-SQL通过多智能体框架解决文本到SQL任务中的逻辑与模式对齐问题,采用生成代理与验证机制提升交互学习效果,实现77.84%和89.75%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08924 2026-05-12 cs.CE 50%

PPI2Text: Captioning Protein-Protein Interactions with Coordinate-Aligned Pair-Map Decoding

PPI2Text:基于坐标对齐的配对映射解码进行蛋白质-蛋白质相互作用描述

Xiao Fei, Sarah Almeida Carneiro, Yang Zhang, Lawrence P. Petalidis, Achilleas Tsortos, Costas Bouyioukos, Michalis Vazirgiannis

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 PPI2Text通过自由文本描述蛋白质-蛋白质相互作用,利用ESM3编码器和Qwen3解码器生成更丰富的表达,提升可解释性和文献整合能力,同时引入PaCo-RoPE位置编码和PPI2Text-Dataset数据集,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08847 2026-05-12 cs.CL 50%

EmoS: A High-Fidelity Multimodal Benchmark for Fine-grained Streaming Emotional Understanding

EmoS:一种高保真多模态基准,用于细粒度流式情感理解

Pengze Guo, Jingxi Liang, Zhiwen Xie, Qifeng Wang, Derek F. Wong

机构 * NLP(自然语言处理) CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学学院,澳门大学CT实验室) School of Computer Science, Central China Normal University(Central China Normal University计算机科学学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出EmoS基准,通过严格过滤静态片段与动态流式独白子集结合,解决现有数据集在生态效度和噪声方面的不足,提升多模态大语言模型在情感识别和共情模型训练中的性能。

Comments acl - 2026 main accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08725 2026-05-12 cs.AR cs.PF 50%

Single 32-bit Sub-Channel DDR5 DIMMs: Architecture, Performance Bounds, and Standardisation

单32位子通道DDR5 DIMM:架构、性能界限与标准化

Chih-Hua Ke

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文探讨了DDR5内存子通道架构,分析了单子通道DIMM在性能和标准化方面的挑战与贡献。

Comments 10 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09933 2026-05-12 cs.IR 50%

A Voronoi Cell Formulation for Principled Token Pruning in Late-Interaction Retrieval Models

基于Voronoi单元的原理化令牌修剪方法:用于晚期交互检索模型

Yash Kankanampati, Yuxuan Zong, Nadi Tomeh, Benjamin Piwowarski, Joseph Le Roux

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 本文提出基于超空间几何的Voronoi单元方法,用于原理化修剪晚期交互检索模型中的令牌嵌入,通过保留检索质量的同时减少索引存储开销。

Comments Accepted at SIGIR 2026 Full Paper Track; 11 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12286 2026-05-12 q-bio.GN cs.CL 50%

Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer

不再有间隙:通过一个分词器实现零间隙多模态整合

Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang

机构 * Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室) Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文提出One Tokenizer,通过统一词汇实现多模态无缝整合,克服传统架构的几何模态间隙问题,提升生物推理性能。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 6 篇

2605.10576 2026-05-12 cs.CV cs.AI 81%

SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models

SenseBench: 一个用于遥感低级视觉感知与描述的大型视觉-语言模型基准

Chen Zhong, Xiao An, Jiaxing Sun, Zihan Gui, Guangyi Yang, Wei He

机构 * Wuhan University(武汉大学) Shanghai Artificial Intelligent Laboratory(上海人工智能实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SenseBench,首个专为遥感低级视觉感知与描述设计的基准,通过物理基础的分层分类体系,评估29种先进VLMs在遥感降质识别中的性能,揭示领域先验偏差、多退化崩溃、流畅性幻觉及感知-描述反转效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10247 2026-05-12 cs.CV cs.AI 81%

LPT: Less-overfitting Prompt Tuning for Vision-Language Model

LPT: 降低过拟合的提示微调用于视觉-语言模型

Chenhao Ding, Xinyuan Gao, Songlin Dong, Jizhou Han, Qiang Wang, Zhengdong Zhou, Yuhang He, Yihong Gong

机构 * IEEE(国际电气电子工程师协会)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LPT框架,通过CLIP过滤细粒度前景信息并引入结构保持和层级logit约束,提升视觉-语言模型的泛化能力并缓解过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10012 2026-05-12 cs.HC cs.CR 67%

Sketch-based Access Control: A Multimodal Interface for Translating User Preferences into Intent-Aligned Policies

基于草图的访问控制:一种多模态接口,用于将用户偏好转化为意图对齐的策略

Kyzyl Monteiro, Sauvik Das

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 本文提出SBAC系统,结合草图和多模态大语言模型,帮助用户逐步完善访问策略,发现潜在问题并验证策略行为。

Comments 27 pages including appendix; 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 57%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09954 2026-05-12 cs.RO cs.CV 57%

JODA: Composable Joint Dynamics for Articulated Objects

JODA:可组合的联合动力学用于连杆物体

Tianhong Gao, Cheng Yu, Yinghao Xu, Mengyu Chu

机构 * Peking University(北京大学) Ant Group, Robbyant(蚂蚁集团,Robbyant)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 JODA通过结构化三通道场生成关节级动力学,结合视觉和语言模型推断并优化关节动力学,实现可控的连杆物体动力学建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10501 2026-05-12 cs.DC 50%

Accelerating Compound LLM Training Workloads with Maestro

通过Maestro加速复合大语言模型训练工作负载

Xiulong Yuan, Hongqing Chen, Jiaxuan Peng, Fan Zhou, Zhixiang Ruan, Zekun Wang, Bo Zheng, Rui Men, Haiquan Wang, Zhipeng Zhang, Langshi Chen, Man Yuan, Jiaqi Gao, Zhengping Qian, Junyang Lin, Yong Li, Wei Lin, Junhua Wang, Jingren Zhou

专题命中 其他VLM :MLLM(abstract)

AI总结 本文提出Maestro框架,针对复合LLM训练中的静态异构性和动态不规则性,通过分段图重构和波前调度算法提升硬件利用率,减少40%的GPU消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏