arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-01 至 2026-04-01 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 12 篇

2511.08917 2026-04-01 cs.HC cs.CV 84%

"It's trained by non-disabled people": Evaluating How Image Quality Affects Product Captioning with Vision-Language Models

由非残障人士训练的模型:评估图像质量如何影响产品描述生成

Kapil Garg, Xinru Tang, Jimin Heo, Dwayne R. Morgan, Darren Gergle, Erik B. Sudderth, Anne Marie Piper

机构 * University of California, Irvine(加州大学尔湾分校) Northwestern University(西北大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,comments);分类 cs.CV

AI总结 研究评估图像质量对视觉语言模型生成产品描述准确性的影响,发现图像质量下降会导致模型性能显著降低,提出改进模型可靠性的建议。

Comments Published at CHI 2026; Honorable Mention for Best Paper (Top 5%). Dataset available at: https://github.com/Accessibility-Research-Collective-UCI/image-quality-vlm-chi26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11919 2026-04-01 cs.CV 83%

TimeSenCLIP: A Time Series Vision-Language Model for Remote Sensing

TimeSenCLIP: 一种用于遥感的时序视觉-语言模型

Pallavi Jain, Diego Marcos, Dino Ienco, Roberto Interdonato, Tristan Berchoux

机构 * Mediterranean Agronomic Institute of Montpellier - CIHEAM-IAMM(地中海农艺研究所蒙彼利埃分校 - CIHEAM-IAMM) Inria(法国国家信息与自动化研究所) INRAE(法国国家农业、食品与环境研究院) Cirad(法国农业国际合作研究发展中心) UMR TETIS(TETIS 联合研究单位) Univ. of Montpellier(蒙彼利埃大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出TimeSenCLIP,一种轻量级遥感时序视觉-语言模型,通过跨视图时间对比框架对多光谱Sentinel-2时序与地理标记地面影像对齐,无需文本标注,强调时序和光谱信号,探索单像素时序信息在多种任务中的有效性。

Comments Accepted (ISPRS Journal of Photogrammetry and Remote Sensing)

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing Volume 236, June 2026, Pages 99-119

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29676 2026-04-01 cs.LG cs.CL cs.CV 81%

A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models

大型视觉-语言模型的全面信息分解分析

Lixin Xiu, Xufang Luo, Hideki Nakayama

机构 * The University of Tokyo(东京大学) Microsoft Research(微软研究院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文通过信息分解方法分析大型视觉-语言模型的信息谱,揭示任务模式和模型策略,为模型设计提供新视角。

Comments Accepted at ICLR 2026. Project page: https://riishin.github.io/pid-lvlm-iclr26/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08829 2026-04-01 cs.CV cs.AI 81%

InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models

InfiniteVL: 融合线性与稀疏注意力以实现高效率、无限输入的视觉-语言模型

Hongyuan Tao, Bencheng Liao, Shaoyu Chen, Haoran Yin, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Horizon Robotics(地平线机器人)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 InfiniteVL通过融合线性与稀疏注意力机制,实现高效率和无限输入的视觉-语言模型,提升解码速度和长上下文处理能力。

Comments 20 pages, 8 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15713 2026-04-01 cs.CV 79%

DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

DiffusionVL: 将任意自回归模型转化为扩散视觉语言模型

Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);分类 cs.CV

AI总结 本文提出DiffusionVL,通过高效扩散微调将预训练自回归模型转化为扩散视觉语言模型,实现高效生成和性能提升。

Comments 12 pages, 4 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24680 2026-04-01 cs.CV 70%

ReDiPrune: Relevance-Diversity Pre-Projection Token Pruning for Efficient Multimodal LLMs

ReDiPrune:基于相关性与多样性的预投影令牌剪枝用于高效的多模态大语言模型

An Yu, Ting Yu Tsai, Zhenfei Zhang, Weiheng Lu, Felix X. -F. Ye, Ming-Ching Chang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Peking University(北京大学)

专题命中 VLM训练与架构 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 ReDiPrune是一种无需训练的预投影令牌剪枝方法,通过选择信息丰富的视觉令牌提升多模态大语言模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01228 2026-04-01 cs.CV 70%

Towards Policy-Adaptive Image Guardrail: Benchmark and Method

面向政策适应的图像防护:基准与方法

Caiyong Piao, Zhiyuan Yan, Haoming Xu, Yunzhen Zhao, Kaiqing Lin, Feiyang Xu, Shuigeng Zhou

机构 * Fudan University(复旦大学) Tencent(腾讯) Peking University(北京大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出SafeGuard-VL方法,通过强化学习与可验证奖励提升图像防护的政策适应能力,并通过SafeEditBench基准测试验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29852 2026-04-01 cs.GR cs.AI cs.CV 62%

VectorGym: A Multitask Benchmark for SVG Code Generation, Sketching, and Editing

VectorGym:一个多任务基准用于SVG代码生成、草图和编辑

Juan Rodriguez, Haotian Zhang, Abhay Puri, Tianyang Zhang, Rishav Pramanik, Meng Lin, Xiaoqing Xie, Marco Terral, Darsh Kaushik, Aly Shariff, Perouz Taslakian, Spandana Gella, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli

机构 * ServiceNow Research(ServiceNow 研究院) Mila, Quebec AI Institute(Mila 魁北克人工智能研究所) Columbia University(哥伦比亚大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Stony Brook University(石溪大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Minzu University of China(中央民族大学) University of Waterloo(滑铁卢大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能讲席) Computer Vision Center(计算机视觉中心)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 VectorGym提出一个涵盖SVG生成、复杂编辑和视觉理解的多任务基准,通过专家标注解决现有基准的不足,采用多任务强化学习方法,训练出性能领先的Qwen3-VL模型,公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29258 2026-04-01 cs.CV cs.AI 62%

Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding

Omni-NegCLIP:通过前层对比微调增强CLIP以实现全面否定理解

Jingqi Xu

机构 * University of Southern California(南加州大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Omni-NegCLIP,通过修改CLIP的InfoNCE损失函数,改进其对存在性和缺失性否定表达的理解能力,实验显示在否定任务中性能提升显著,且不牺牲图像-文本检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29211 2026-04-01 cs.AI cs.CL cs.CV 62%

Xuanwu: Evolving General Multimodal Models into an Industrial-Grade Foundation for Content Ecosystems

玄武:将通用多模态模型演进为内容生态系统工业级基础模型

Zhiqian Zhang, Xu Zhao, Xiaoqing Xu, Guangdong Liang, Weijia Wang, Xiaolei Lv, Bo Li, Jun Gao

机构 * Computational Intelligence Dept, Hello Group Inc(Hello Group Inc. 计算智能部)

专题命中 VLM训练与架构 :InternVL(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Xuanwu VL-2B,通过三阶段训练流程平衡业务专精与通用能力,实现7项多模态指标平均67.90分,7项业务审核任务召回率94.38%,在对抗性OCR场景中超越Gemini-2.5-Pro。

Comments 41 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29631 2026-04-01 cs.CV cs.DC cs.IR 57%

Storing Less, Finding More: How Novelty Filtering Improves Cross-Modal Retrieval on Edge Cameras

存储更少,查找更多:新颖性过滤如何改进边缘摄像头上的跨模态检索

Sherif Abdelwahab

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种流式检索架构,通过边缘设备的epsilon-net过滤器保留语义新颖帧,构建去噪嵌入索引,并结合跨模态适配器和云重排序器,提升边缘摄像头跨模态检索性能。

Comments 6 pages, 3 figures, 5 tables; supplementary video included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19910 2026-04-01 cs.CV 57%

Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

通过半监督率减少实现多模态表示学习的通用类别发现

Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。

Comments 15 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏