arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-20 至 2026-04-20 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 10 篇

2604.15628 2026-04-20 cs.CV cs.CL cs.IR cs.LG cs.MM 91%

SIMMER: Cross-Modal Food Image--Recipe Retrieval via MLLM-Based Embedding

SIMMER:通过基于MLLM的嵌入进行跨模态食物图像-食谱检索

Keisuke Gomi, Keiji Yanai

机构 * The University of Electro-Communications(电通大学)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出SIMMER,利用基于MLLM的嵌入模型VLM2Vec,通过统一编码器处理食物图像和食谱文本,设计定制化提示模板和数据增强策略,实现跨模态检索的高精度。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16264 2026-04-20 cs.CV cs.LG 81%

Information Router for Mitigating Modality Dominance in Vision-Language Models

信息路由器用于缓解视觉-语言模型中的模态主导问题

Seulgi Kim, Mohit Prabhushankar, Ghassan AlRegib

机构 * OLIVES at the Center for Signal Information Processing CSIP, School of Electrical

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出MoIR信息路由器,通过在融合前减少信息差异,缓解视觉-语言模型中模态主导问题,提升鲁棒性和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11490 2026-04-20 cs.AI cs.CL cs.CV 81%

Anthropogenic Regional Adaptation in Multimodal Vision-Language Model

人为区域适应于多模态视觉-语言模型

Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, Amit Agarwal, Manuel Antonio Rufino, Carlos Rafael Catalan, Muhammad Reza Qorib, Vicky Feliren, Holy Lovenia, Aye Hninn Khine, Frederikus Hudi, David Anugraha, Alham Fikri Aji, Romrawin Chumpu, Viet-Thanh Pham, Minghan Wang, Mohamed Fazli Imam, Ruochen Zhang, Joseph Marvin Imperial, Khumaisa Nur'aini, Do Xuan Long, Musa Izzanardi Wijanarko, Joel Ruben Antony Moniz, Patrick Amadeus Irawan, Hanif Muhammad Zhafran, Isaiah Flores, Salsabila Zahirah Pranida, Jun Kevin, Jostin Jerico Rosal, Patricia Nicole Monderin, Kun Kerdthaisong, Ahmad Mustafid, My Chiffon Nguyen, Natchapon Jongwiriyanurak, Siva Worajitwannakul, Haochen Li, Adrian Xuan Wei Lim, Bin Wang, Muhammad Ravi Shulthan Habibi, Lynnette Hui Xian Ng, Mithil Bangera, Yeshil Bangera, Priyaranjan Pattnayak, Dun Li Chan, Sherissa Caren Djuniwar, Cho Chan Myei Oo, Hee Ming Shan

机构 * Cohere SEACrowd AI Singapore Universiti Teknologi PETRONAS Oracle Carnegie Mellon University(卡内基梅隆大学) Monash University, Indonesia(莫纳什大学(印尼)) King Mongkut’s University of Technology Thonburi(泰国孔敬大学) Nara Institute of Science and Technology(奈良科学技術大學) Stanford University(斯坦福大学) MBZUAI National University of Singapore(新加坡国立大学) Monash University, Australia(莫纳什大学(澳大利亚)) Brown University(布朗大学) University of Bath(巴斯大学) Mila - Quebec AI Institute(蒙特利尔AI研究所) Institut Teknologi Bandung(Bandung 工程技术大学) Ateneo de Manila University(马尼拉亚特内奥大学) Universitas Pelita Harapan(Pelita Harapan 大学) Seoul National University of Science and Technology(首尔科学技术大学) Thammasat University(泰国 Thammasat 大学) Independent(独立) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) MiroMind AI University of Indonesia(印度尼西亚大学) University of New Haven(纽黑文大学) INTI International University and Colleges(INTI 国际大学和学院) Binus University(Binus 大学) National University Philippines(菲律宾国家大学) ThoughtFull

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出人为区域适应框架,通过地理通用化简化方法提升多模态模型在特定区域的文化相关性,实验显示在东南亚地区提升5-15%的同时保持全球性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15703 2026-04-20 cs.CV 79%

P3T: Prototypical Point-level Prompt Tuning with Enhanced Generalization for 3D Vision-Language Models

P3T: 用于3D视觉-语言模型的增强泛化原型点级提示微调

Geunyoung Jung, Soohong Kim, Kyungwoo Song, Jiyoung Jung

机构 * Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系) Department of Applied Statistics, Yonsei University(延世大学应用统计系)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出P3T,一种针对3D视觉-语言模型的高效提示微调方法,通过点级提示器和文本提示器提升模型泛化能力,并引入原型损失减少类别内方差,实验表明其在分类和少样本学习中表现优异。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15871 2026-04-20 cs.CV cs.AI 73%

UniEditBench: A Unified and Cost-Effective Benchmark for Image and Video Editing via Distilled MLLMs

UniEditBench: 一种统一且成本效益高的图像和视频编辑基准,通过压缩的多模态大语言模型

Lifan Jiang, Tianrun Wu, Yuhang Pei, Chenyang Wang, Boxi Wu, Deng Cai

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 UniEditBench提出统一的图像和视频编辑基准,支持基于重建和指令驱动的方法,通过压缩的多模态大语言模型提供多维评分,减少部署成本并提高评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12193 2026-04-20 cs.CV 70%

VeRVE: Versatile Retrieval for Videos via Unified Embeddings

VeRVE:通过统一嵌入实现视频的多功能检索

Shaunak Halbe, Bhagyashree Puranik, Jayakrishnan Unnikrishnan, Kushan Thakkar, Vimal Bhat, Toufiq Parag

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊) Keystone AI

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出VeRVE框架,结合语义和时刻级检索能力,支持复杂多模态查询,通过对比对齐视觉和文本嵌入实现高效检索,优于其他多模态大语言模型方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15780 2026-04-20 cs.LG cs.CL 70%

Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs

裁剪不安全的票据:一种资源高效的更安全且更稳健的大语言模型框架

Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种资源高效的剪枝框架,通过识别并移除与不安全行为相关的参数,减少不安全生成并提高对抗鲁棒性,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14605 2026-04-20 cs.CV 70%

Towards Design Compositing

面向设计合成

Abhinav Mahajan, Abhikhya Tripathy, Sudeeksha Reddy Pala, Vaibhav Methi, K J Joseph, Balaji Vasan Srinivasan

机构 * Carnegie Mellon University(卡内基梅隆大学) IIT Kharagpur(印度理工学院哈里科特) IIT Kanpur(印度理工学院坎普尔) Adobe Research(Adobe研究)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出GIST,一种无需训练的身份保持图像合成器,用于提升组件到设计流程中的视觉和谐与美学质量。

Comments Accepted to CVEU workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13061 2026-04-20 cs.CL cs.AI 57%

Token Statistics Reveal Conversational Drift in Multi-turn LLM Interaction

令牌统计揭示多轮LLM交互中的对话漂移

Wael Hafez, Amir Nazeri

机构 * Semarx Research LLC(Semarx研究公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 研究通过令牌频率统计监测对话一致性,提出Bipredictability指标,验证其在多轮交互中的有效性,显示结构监控可补充语义评估。

Comments 13 Pages, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20210 2026-04-20 cs.CL cs.AI 57%

CRoCoDiL: Continuous and Robust Conditioned Diffusion for Language

CRoCoDiL:连续且稳健的语言条件扩散

Roy Uziel, Omer Belhasin, Itay Levy, Akhiad Bercovich, Ran El-Yaniv, Ran Zilberstein, Michael Elad

机构 * NVIDIA

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出CRoCoDiL,通过连续语义空间改进扩散模型,实现更高质量和更快的文本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏