arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 46073 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4651 篇

2604.18032 2026-04-21 cs.CV 57%

CFSR: Geometry-Conditioned Shadow Removal via Physical Disentanglement

CFSR:通过物理解耦实现几何条件下的阴影去除

Pan Wang, Yihao Hu, Xiujin Liu, Hang Wang

机构 * University of Science and Technology of China(科学技术大学) University of Michigan - Ann Arbor(密歇根大学安娜堡分校) Sun Yat-sen University(中山大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出CFSR框架,通过物理约束恢复过程解决传统阴影去除网络缺乏物理可解释性的问题,结合3D几何信息与大规模基础模型语义,有效弥合2D-3D领域差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17915 2026-04-21 cs.CV 57%

OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models

OneDrive: 统一的多范式驾驶与视觉-语言-动作模型

Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA School of Artificial Intelligence, University of Chinese Academy of Sciences AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University Voyager Research, Didi Chuxing School of Information Science(多模态人工智能系统国家重点实验室,中国科学院自动化所人工智能学院,中国科学院大学,AutoLab,上海交通大学人工智能学院,Voyager Research,滴滴出行,信息科学与技术学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于预训练视觉语言模型的统一自动驾驶框架,通过单一Transformer解码器整合异构解码行为,实现多任务联合优化,实验表明在nuScenes和NAVSIM上取得最优性能,且推理效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17896 2026-04-21 cs.LG cs.AI cs.RO 57%

Can Explicit Physical Feasibility Benefit VLA Learning? An Empirical Study

显式物理可行性能否促进VLA学习?一项实证研究

Yubai Wei, Chen Wu, Hashem Haghbayan

机构 * Department of Computing, University of Turku(图尔库大学计算机系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究显式物理可行性监督对VLA学习的影响,提出几何基础可行性目标并集成到扩散基VLA策略训练中,实验证明其能提升物理可靠性和任务性能,增强低数据下的学习效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17748 2026-04-21 cs.CV 57%

Source-Free Domain Adaptation with Vision-Language Prior

无源领域适应与视觉-语言先验

Song Tang, Yunxiang Bai, Wenxin Su, Mao Ye, Jianwei Zhang, Xiatian Zhu

机构 * Institute of Machine Intelligence(机器智能研究所) University of Shanghai for Science and Technology(上海科技大学) Department of Informatics(信息学院) Universität Hamburg(汉堡大学) European Molecular Biology Laboratory(欧洲分子生物学实验室) School of Computer Science and Engineering(计算机科学与工程学院) University of Electronic Science and Technology of China(电子科技大学) TAMS Group(多模态系统技术组) Surrey Institute for People-Centred Artificial Intelligence(萨里大学以人为本的人工智能研究所) Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音与信号处理中心) University of Surrey(萨里大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DIFO++方法,利用视觉-语言模型进行无源领域适应,通过定制和知识蒸馏减少领域差距,提升目标域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17147 2026-04-21 cs.CV cs.RO 57%

ScenarioControl: Vision-Language Controllable Vectorized Latent Scenario Generation

ScenarioControl: 基于视觉-语言的向量化潜在场景生成

Lili Gao, Yanbo Xu, William Koch, Samuele Ruffino, Luke Rowe, Behdad Chalaki, Dmitriy Rivkin, Julian Ost, Roger Girgis, Mario Bijelic, Felix Heide

机构 * Torc Robotics(Torc机器人公司) Princeton University(普林斯顿大学) Mila

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ScenarioControl通过视觉-语言控制机制生成多样且真实的3D场景,结合向量化潜在空间和跨全局控制机制,实现对道路布局和交通状况的精细控制,支持长时程驾驶场景延续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02618 2026-04-21 cs.CV 57%

Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs

注意你选择负样本的方式:在使用VLMs进行OOD检测时追求距离一致性

Zhikang Xu, Qianqian Xu, Zitai Wang, Cong Hua, Sicong Li, Zhiyong Yang, Qingming Huang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出InterNeg框架,通过统一的跨模态距离增强提升OOD检测性能,实验显示在ImageNet和Near-OOD基准上取得显著改进。

Comments Accepted by the main track of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16248 2026-04-20 cs.CV 57%

Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

视觉-语言模型在何处失效?面向图像地理定位的世界尺度分析

Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文评估了多种先进视觉-语言模型在国家层面图像地理定位中的表现,揭示了模型在粗粒度地理定位中的潜力及当前模型在细粒度地理线索捕捉上的局限。

Comments Accepted to the CVPR EarthVision 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16067 2026-04-20 cs.LG cs.CV 57%

AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning

AEGIS:锚定强化梯度隔离用于知识保留的视觉-语言-动作微调

Guransh Singh

机构 * Independent Researcher(独立研究者)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出AEGIS方法,通过层间梯度投影保留预训练的视觉问答能力,避免因梯度不对称导致的性能下降,无需额外数据或缓冲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27759 2026-04-20 cs.CV 57%

When Surfaces Lie: Exploiting Wrinkle-Induced Attention Shift to Attack Vision-Language Models

当表面欺骗:利用褶皱诱导的注意力转移攻击视觉-语言模型

Chengyin Hu, Xuemeng Sun, Jiaju Han, Qike Zhang, Xiang Chen, Xin Wang, Yiwei Wei, Jiahua Long

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种参数化结构扰动方法,通过构建多尺度褶皱场和整合位移场扭曲与表面一致的外观变化,以攻击视觉-语言模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04585 2026-04-17 cs.CV 57%

SAM3-I: Segment Anything with Instructions

SAM3-I: 基于指令的分割

Jingjing Li, Yue Feng, Yuchen Guo, Jincai Huang, Wei Ji, Qi Bi, Yongri Piao, Miao Zhang, Xiaoqi Zhao, Qiang Chen, Shihao Zou, Huchuan Lu, Li Cheng

机构 * University of Alberta(阿尔伯塔大学) Tencent WeChat(腾讯微信) Northwestern University(西北大学) SUSTech(四川大学) Yale University(耶鲁大学) Utrecht University(乌得勒支大学) Dalian University of Technology(大连理工大学) SIAT, Chinese Academy of Sciences(中科院深圳先进技术研究院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 SAM3-I通过整合概念级 grounding 和指令级推理,提升分割性能,支持复杂自然语言指令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13788 2026-04-16 cs.RO cs.CV 57%

Failure Identification in Imitation Learning Via Statistical and Semantic Filtering

通过统计和语义过滤进行模仿学习中的故障识别

Quentin Rolland, Fabrice Mayran de Chamisso, Jean-Baptiste Mouret

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) Inria, CNRS, Université de Lorraine, LORIA(Inria,CNRS,洛林大学,LORIA) Bleu Robotics(Bleu机器人)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FIDeL模块,结合统计和语义过滤技术,提升机器人模仿学习中的故障检测性能,通过多模态数据集BotFails验证其有效性。

Comments 8 pages, Appendix coming soon, accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12966 2026-04-15 cs.CV 57%

Boosting Visual Instruction Tuning with Self-Supervised Guidance

通过自监督指导提升视觉指令微调

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome, Spyros Gidaris

机构 * Sorbonne Universite, CNRS, ISIR, F-75005 Paris, France(索邦大学、国家科学研究中心、ISIR、法国巴黎75005) Institut universitaire de France (IUF)(法国国家科学院(IUF))

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种轻量方法,通过加入少量视觉基础自监督任务提升MLLMs的视觉推理能力,无需人工标注或架构修改,有效提升视觉中心评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12115 2026-04-15 cs.CV 57%

HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models

HTDC: 通过犹豫触发的微分校准缓解大视觉-语言模型中的幻觉

Xinyun Liu

机构 * Sichuan University(四川大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HTDC,一种无需训练的解码框架,通过检测层间犹豫信号,仅在易出错步骤激活校准,有效抑制幻觉并保持任务准确性。

Comments 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12096 2026-04-15 cs.AI 57%

LLM-HYPER: Generative CTR Modeling for Cold-Start Ad Personalization via LLM-Based Hypernetworks

LLM-HYPER:基于大语言模型的超网络生成CTR模型用于冷启动广告个性化

Luyi Ma, Wanjia Sherry Zhang, Zezhong Fan, Shubham Thakur, Kai Zhao, Kehui Yao, Ayush Agarwal, Rahul Iyer, Jason Cho, Jianpeng Xu, Evren Korpeoglu, Sushant Kumar, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出LLM-HYPER框架,利用大语言模型作为超网络生成CTR估计器参数,通过少样本链式思维提示实现冷启动广告个性化,实验表明其在NDCG@10上优于基线方法55.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11868 2026-04-15 cs.CV 57%

MedConcept: Unsupervised Concept Discovery for Interpretability in Medical VLMs

MedConcept: 医学视觉语言模型中的无监督概念发现以实现可解释性

Md Rakibul Haque, KM Arefeen Sultan, Tushar Kataria, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah Scientific Computing(犹他大学计算学校科学计算) Imaging Institute, University of Utah(犹他大学影像研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 MedConcept通过无监督方法发现医学VLMs中的潜在概念,并利用临床可验证的文本语义进行解释,提供定量评估协议和三个概念评分以评估模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11576 2026-04-14 cs.CV 57%

Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

微调如你预训练:提升视觉语言模型零样本对抗鲁棒性

Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Xi’an Jiaotong University(西安交通大学) University of Oxford(牛津大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出AdvFLYP方法,通过遵循CLIP预训练过程的训练配方,利用网络上收集的图像-文本对生成对抗样本,并通过对比损失匹配文本,提升视觉语言模型的零样本对抗鲁棒性。

Comments Accepted to CVPR Findings Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03765 2026-04-14 cs.CV 57%

ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs

ITIScore: 一种图像到文本到图像评分框架,用于评估多模态大语言模型的图像描述能力

Zitong Xu, Huiyu Duan, Shengyao Qin, Guangyu Yang, Guangji Ma, Xiongkuo Min, Ke Gu, Guangtao Zhai, Patrick Le Callet

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic and Science Technology of China(电子科技大学) Beijing University of Technology(北京工业大学) Institut Universitaire de France (IUF), University of Nantes(法国大学研究院(IUF),南特大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ICBenchmark图像描述基准,包含12类内容和2K图像生成的40K短长描述,提出ITIScore自动评估指标,通过图像到文本到图像框架衡量描述质量,实验显示其与人类判断一致且具有强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10000 2026-04-14 cs.CV 57%

SwinTextUNet: Integrating CLIP-Based Text Guidance into Swin Transformer U-Nets for Medical Image Segmentation

SwinTextUNet:将基于CLIP的文本引导整合到Swin Transformer U-Nets中用于医学图像分割

Ashfak Yeafi, Parthaw Goswami, Md Khairul Islam, Ashifa Islam Shamme

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SwinTextUNet,结合CLIP文本嵌入与Swin Transformer U-Net,提升医学图像分割的鲁棒性和准确性,在QaTaCOV19数据集上取得86.47%的Dice和78.2%的IoU成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09749 2026-04-14 cs.CV 57%

See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment

看清真相:公平关注提升 groundedness 并减少 hallucination 在视觉语言对齐中

Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学,阿布扎比,阿联酋) King Fahd University of Petroleum and Minerals, Dhahran, Saudi Arabia(法赫德国王石油矿产大学,达兰,沙特阿拉伯) Macquarie University, Sydney, Australia(麦考瑞大学,悉尼,澳大利亚) University of Surrey, Guildford, United Kingdom(萨里大学,吉尔福德,英国) University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DOP-OBC方法,通过公平分配注意力减少视觉语言对齐中的幻觉问题,提升生成的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08877 2026-04-13 cs.CV 57%

Harnessing Weak Pair Uncertainty for Text-based Person Search

利用弱对不确定性进行基于文本的人检索

Jintao Sun, Zhedong Zheng, Gangyi Ding

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Faculty of Science and Technology, University of Macau(澳门大学科技学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出利用弱正样本不确定性提升文本驱动的人检索性能,通过引入不确定性估计和正则化模块,有效利用弱正样本,实验表明在三个数据集上mAP提升显著。

Comments 39 pages, 15 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07997 2026-04-10 cs.CV 57%

Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environments

少样本增量式动态室内环境3D物体检测

Yun Zhu, Jianjun Qian, Jian Yang, Jin Xie, Na Zhao

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FI3Det框架,利用视觉语言模型学习未见类别知识,通过VLM引导模块和多模态原型模块实现高效3D感知,在ScanNet V2和SUN RGB-D数据集上取得显著提升。

Comments Accepted by CVPR 2026

Journal ref CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07814 2026-04-10 cs.CV 57%

AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models

AgriChain:基于视觉的专家验证推理用于可解释的农业视觉语言模型

Hazza Mahmood, Yongqiang Yu, Rao Anwer

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AgriChain数据集,通过专家验证的推理链提升农业视觉语言模型的准确性和可解释性,实验表明其在植物病害诊断中优于多个基线模型。

Comments 9 pages

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07518 2026-04-10 cs.CL 57%

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

分解、观察与推理:用于视觉语言模型的强化潜在推理

Mengdan Zhu, Senhao Cheng, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DLR框架,通过动态分解查询、提取连续视觉潜在表示和基于 grounded rationales 推理,提升视觉语言模型在复杂视觉推理中的表现,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20231 2026-04-10 cs.RO cs.CV 57%

UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models

UniLACT:基于深度的RGB潜在动作学习用于视觉-语言-动作模型

Manish Kumar Govind, Dominick Reilly, Pu Wang, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 UniLACT通过引入深度感知的潜在预训练,提升视觉-语言-动作模型的空间先验能力,实验表明其在模拟和现实任务中优于基于RGB的潜在动作方法。

Comments https://manishgovind.github.io/unilact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18787 2026-04-10 cs.CV cs.LG 57%

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01840 2026-04-09 cs.AI 57%

Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models

并非所有token都同等重要:基于感知的策略优化方法用于大型视觉-语言模型

Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于感知的策略优化方法PGPO,通过动态调整token级别的优势,提升多模态推理的鲁棒性与稳定性,实验显示在多个基准上提升18.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05900 2026-04-08 cs.CV 57%

AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis

AICA-Bench:全面评估VLMs在情感图像内容分析中的能力

Dong She, Xianrong Yao, Liqun Chen, Jinghe Yu, Yang Gao, Zhanpeng Jin

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AICA-Bench基准,通过情感理解、推理和生成三个任务评估VLMs在情感图像分析中的能力,发现其在强度校准和描述深度方面存在不足,并提出GAT提示方法提升性能。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18117 2026-04-08 cs.CV 57%

Online In-Context Distillation for Low-Resource Vision Language Models

在线上下文蒸馏用于低资源视觉语言模型

Zhiqi Kang, Rahaf Aljundi, Vaggelis Dorovatas, Karteek Alahari

机构 * Inria(法国国家信息与自动化研究所) Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出在线上下文蒸馏方法,通过小模型与强教师模型协作,利用稀疏演示高效缩小性能差距,提升小模型性能达33%,在低资源条件下实现与零样本性能相当的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04579 2026-04-08 cs.CV 57%

Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation

Firebolt-VL: 通过跨模态调制实现高效的视觉-语言理解

Quoc-Huy Trinh, Mustapha Abdullahi, Bo Zhao, Debesh Jha

机构 * Aalto University(阿尔托大学) University of South Dakota(南达科他大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Firebolt-VL模型,通过替换Transformer解码器为液态基础模型解码器,并引入Token-Grid相关模块,提升视觉语义理解效率与精度。

Comments arXiv admin note: substantial text overlap with arXiv:2511.11177

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00727 2026-04-08 cs.LG cs.CR cs.CV 57%

Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP

扰动与恢复:用于从CLIP中有效移除后门的微调

Naman Deep Singh, Francesco Croce, Matthias Hein

机构 * University of Tübingen & Tübingen AI Center(蒂宾根大学 & 蒂宾根人工智能中心) EPFL(瑞士联邦理工学院洛桑)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出PAR机制,通过微调有效移除CLIP中的后门,实验表明其在不同编码器和攻击类型上均能保持良好性能,且无需真实训练数据。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏