arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2601.20796 2026-05-27 cs.CL cs.LG 57%

Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers

解析多模态上下文学习:现代Transformer中的模态不对称性与电路动力学

Yiran Huang, Karsten Roth, Quentin Bouniot, Wenjia Xu, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) DeepMind(深Mind) Beijing University of Posts(北京邮电大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 通过可控实验,研究现代Transformer中多模态上下文学习的基本机制,发现模态间学习不对称性,并揭示其背后的归纳式电路机制。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02360 2026-05-27 cs.CV cs.CL 57%

LaRe: Latent Refocusing for Multimodal Reasoning

LaRe: 用于多模态推理的潜在重聚焦

Jizheng Ma, Xiaofei Zhou, Geyuan Zhang, Yanlong Song, Han Yan

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出LaRe范式,在潜在空间内进行视觉重聚焦,结合语义增强训练,在提升推理准确率的同时大幅减少推理所需token数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25821 2026-05-26 cs.CV 57%

[CLS] is Not Enough: Multi-Label Recognition via Patch-Level Inference and Adaptive Aggregation

[CLS] 还不够:基于补丁级推理与自适应聚合的多标签识别

Akang Wang, Xili Deng, Zhanxuan Hu, Yi Zhao, Yonghang Tai, Huafeng Li

机构 * Yunnan Normal University, Kunming, China(云南师范大学,昆明,中国) Kunming University of Science and Technology, Kunming, China(昆明理工大学,昆明,中国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对CLIP等视觉语言模型在多标签识别中因[CLS]全局表征不足的问题,提出PIAA框架,通过补丁级推理和自适应聚合实现无训练的多标签识别,在NUS-WIDE上mAP提升超6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25799 2026-05-26 cs.CV 57%

Addressing Exacerbated Attention Sink for Source-Free Cross-Domain Few-Shot Learning

应对源自由跨域小样本学习中加剧的注意力汇聚问题

Shuai Yi, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对跨域小样本学习中标准微调加剧注意力汇聚导致判别性下降的问题,提出基于令牌动态重加权的方法抑制简单令牌依赖并增强困难令牌学习,实现新最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25708 2026-05-26 cs.CV cs.CL cs.ET 57%

CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning

CMAP: 面向多域任务增量学习的跨模态自适应提示

Sriram Mandalika

机构 * Hasso Plattner Institute(霍普斯·普拉特纳研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对多域任务增量学习,提出跨模态自适应提示方法,利用CLIP文本嵌入空间进行任务路由、置信度估计和编码器适应,在MTIL基准上超越现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10548 2026-05-26 cs.CV 57%

Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding

Blink: 动态视觉令牌分辨率增强多模态理解

Yuchen Feng, Zhenyu Zhang, Naibin Gu, Yilong Chen, Peng Fu, Zheng Lin, Shuohuan Wang, Yu Sun, Hua Wu, Weiping Wang, Haifeng Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc(百度公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出Blink框架,通过注意力引导的令牌超分辨率和动态丢弃机制,在单次前向传播中模拟人类眨眼式扫描,提升多模态大语言模型的视觉感知能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24172 2026-05-26 cs.AI 57%

EPPC-OASIS: Ontology-Aware Adaptation and Structured Inference Refinement for Electronic Patient-Provider Communication Mining in Secure Messages

EPPC-OASIS:面向安全消息中电子患者-提供者通信挖掘的本体感知适应与结构化推理精炼

Samah Fodeh, Sreeraj Ramachandran, Elyas Irankhah, Muhammad Arif, Afshan Khan, Ganesh Puthiaraju, Linhai Ma, Srivani Talakokkul, Jordan Alpert, Sarah Schellhorn

机构 * Yale University(耶鲁大学) Cleveland Clinic Lerner College of Medicine of Case Western Reserve University, Cleveland Clinic(克利夫兰医学中心勒纳医学院,克利夫兰医学中心) Medical Oncology, Yale School of Medicine(耶鲁医学院医学肿瘤学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 提出EPPC-OASIS框架,通过本体感知的Wasserstein对齐目标增强微调,并结合推理精炼步骤,从安全消息中自动提取结构化EPPC编码,在多个语言模型上取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22869 2026-05-25 cs.LG 57%

FuRA: Full-Rank Parameter-Efficient Fine-Tuning with Spectral Preconditioning

FuRA: 基于谱预条件的全秩参数高效微调

Yequan Zhao, Ruijie Zhang, Liyan Tan, Niall Moran, Tong Qin, Zheng Zhang

机构 * University of California at Santa Barbara(加州大学圣芭芭拉分校) Amazon Lab126(亚马逊实验室126)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.LG

AI总结 提出FuRA方法,通过块张量列车分解实现全秩谱预条件,在保持参数效率的同时提升微调性能,在LLM和VLM任务上优于全微调和LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22651 2026-05-22 cs.CV 57%

What Does the Caption Really Say? Counterfactual Phrase Intervention for Compositional Data Selection in Vision-Language Pretraining

图中标签真的在说些什么?用于视觉语言预训练中组合数据选择的反事实短语干预

Hyejin Go, Semi Lee, Hyesong Choi

机构 * Soongsil University(顺斯尔大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文研究了在视觉语言预训练中如何通过反事实短语干预来改进组合数据选择,提出了CPI方法以解决现有方法中全局过滤信号失效的问题,从而提升模型在关系识别任务上的表现。

Comments 11 pages, 2 figures, 4 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22484 2026-05-22 cs.CV 57%

Supervised Classification Heads as Semantic Prototypes: Unlocking Vision-Language Alignment via Weight Recycling

监督分类头作为语义原型:通过权重重用解锁视觉-语言对齐

David Méndez, Roberto Confalonieri, Natalia Díaz Rodríguez

机构 * Department of Computer Science and Artificial Intelligence, DaSCI Institute, University of Granada, Granada, Spain(计算机科学与人工智能系,DaSCI研究所,格拉纳达大学,格拉纳达,西班牙) Department of Mathematics ``Tullio Levi-Civita'', University of Padova, Padova, Italy(托里利-西维塔数学系,帕多瓦大学,帕多瓦,意大利)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出利用预训练视觉模型的分类头作为语义原型,通过权重重用实现视觉-语言对齐,提升跨模态检索、零样本和少样本分类任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20107 2026-05-22 cs.CV cs.CL cs.IR 57%

Structural Anchor Pruning: Training-Free Multi-Vector Compression for Visual Document Retrieval

结构锚点剪枝:用于视觉文档检索的无训练多向量压缩

Zhuchenyang Liu, Ziyu Hu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出结构锚点剪枝(SAP),一种无需训练的多向量压缩方法,通过保留评分、指导窗口选择和视觉入度中心性评分三个组件,在不进行模型参数调整的情况下,实现了超过90%的视觉token剪枝同时保持NDCG@5超过90%的性能。

Comments methodology revision and new title

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21300 2026-05-21 cs.CV 57%

Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens

通过强调图像负样本token减少LVLMs中的物体幻觉

Meng Shen, Minghao Wu, Deepu Rajan

机构 * Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过强调图像负样本token来减少LVLMs中的物体幻觉问题,提出调整不同token的训练权重和数据过滤策略以控制幻觉。

Comments 20 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21121 2026-05-21 cs.CV cs.GR 57%

ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation

ROAR-3D: 为高保真3D生成实现任意视角路由

Hanxiao Sun, Mingxin Yang, Shuhui Yang, Zebin He, Xintong Han, Hongbo Fu, Chunchao Guo, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tencent Hunyuan(腾讯文生)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出ROAR-3D方法,通过改进预训练单视角模型以支持任意数量的未置位图像,利用视图路由和双流注意力设计实现高效的多视角3D生成,显著提升生成质量并支持测试时视角扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20147 2026-05-20 cs.CV 57%

PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset

PixVerve:通过大规模高质量数据集将原生超高清图像生成推至100MP

Haojun Chen, Haoyang He, Chengming Xu, Qingdong He, Junwei Zhu, Yabiao Wang, Zhucun Xue, Xianfang Zeng, Zhennan Chen, Xiaobin Hu, Hao Zhao, Yong Liu, Jiangning Zhang, Dacheng Tao

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出PixVerve-95K数据集,通过精心设计的数据管道构建,包含95K张高分辨率图像和七维标注,用于推动超高清图像生成技术,通过三种训练方案将T2I基础模型扩展到100MP生成,并建立PixVerve-Bench评估协议。

Comments Project page is available at https://haojunchen663.github.io/projects/PixVerve/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19833 2026-05-20 cs.SD cs.AI cs.CL cs.MM eess.AS 57%

Mega-ASR: Towards In-the-wild^2 Speech Recognition via Scaling up Real-world Acoustic Simulation

Mega-ASR: 通过扩大现实世界声学模拟实现野外语音识别

Zhifei Xie, Kaiyu Pang, Haobin Zhang, Deheng Ye, Xiaobin Hu, Shuicheng Yan, Chunyan Miao

机构 * NTU(国立新加坡大学) NUS(新加坡国立大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出Mega-ASR,一种统一的野外语音识别框架,结合可扩展的复合数据构建与渐进的声学到语义优化,通过在7种经典声学现象和54种物理上合理的复合场景上训练,显著提升了在恶劣环境下的语音识别性能。

Comments Project page: https://xzf-thu.github.io/Mega-ASR/. Code, models, and dataset will be released. A robust ASR framework targeting in-the-wild and compositional acoustic scenarios where conventional ASR systems fail

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19752 2026-05-20 cs.LG 57%

MSAlign: Aligning Molecule and Mass Spectra Foundation Models for Metabolite Identification

MSAlign: 用于代谢物鉴定的分子和质谱基础模型对齐方法

Paul Krzakala, Gabriel Melo, Camille Lançon, Charlotte Laclau, Rémi Flamary, Etienne Thévenot, Florence d'Alché-Buc

机构 * LTCI, Télécom Paris & CMAP, Ecole Polytechnique, Institut Polytechnique de Paris(LTCI,巴黎电信学院及巴黎高等技术学院的联合机构,CMAP,巴黎高等理工学院,巴黎高等技术学院) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎高等技术学院) CEA, INRAE, MetaboHUB, Université Paris-Saclay(CEA,国家核能研究中心,法国农业研究机构,代谢组学枢纽,巴黎萨克雷大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本研究提出MSAlign方法,通过多模态对齐技术对齐分子和质谱基础模型,以提高代谢物鉴定的准确性,并解决了数据分割策略中的分布偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17989 2026-05-19 cs.CL cs.AI 57%

Predictive Prefetching for Retrieval-Augmented Generation

检索增强生成的预测预取

Wuyang Zhang, Shichao Pei

机构 * Department of Computer Science, University of Massachusetts Boston(马萨诸塞大学波士顿分校计算机科学系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种先进的异步检索框架,通过预测检索触发时机和所需信息,以减少延迟并提高生成效率,同时保持回答质量。

Comments Accepted by Forty-third International Conference on Machine Learning ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17949 2026-05-19 cs.CV 57%

SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning

SkyNative: 一种面向遥感视觉证据推理的原生多模态框架

Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Jiashun Zhu, Jiasen Hu, Lang Sun, Weipeng Zhang, Jiaqi Liu, Xu Na, Haoran Liu, Weijie Zhang, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SkyNative,一种原生多模态框架,通过去除预训练视觉骨干,直接在语言模型token空间中表示图像为原始patch tokens,以提升遥感图像的细粒度空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17071 2026-05-19 cs.AI 57%

AnchorDiff: Topology-Aware Masked Diffusion with Confidence-based Rewriting for Radiology Report Generation

AnchorDiff: 基于拓扑结构的掩码扩散模型与基于置信度的重写方法用于放射学报告生成

Shiying Yu, Jielei Wang, Guoming Lu

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出AnchorDiff,一种首个结合临床锚点的掩码扩散框架,用于生成放射学报告。该方法通过拓扑感知训练策略和推理时的重写策略,有效缓解了固定顺序自回归解码的局限性,实现了最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23180 2026-05-19 cs.CV 57%

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

GaussianDWM: 基于3D高斯场景表示的统一场景理解和多模态生成驱动世界模型

Tianchen Deng, Xuefeng Chen, Yi Chen, Qu Chen, Yuyao Xu, Lijin Yang, Le Xu, Yu Zhang, Bo Zhang, Wuxiong Huang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MEGVII Technology(商汤科技) Mach Drive

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于3D高斯表示的统一驱动世界模型框架,实现3D场景理解和多模态生成,并通过语言引导采样策略和双条件生成模型提升生成效果,实验验证其在nuScenes和NuInteract数据集上的优越性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15961 2026-05-18 cs.CV 57%

Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models

稀疏自编码器使CLIP模型的鲁棒且可解释的微调成为可能

Fabian Morelli, Arnas Uselis, Ankit Sonthalia, Seong Joon Oh

机构 * University of Tübingen(图宾根大学) KAIST(韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SAE-FT方法,通过稀疏自编码器约束视觉表示的变化,实现CLIP模型的鲁棒且可解释的微调,提高下游任务性能同时保持模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15836 2026-05-18 cs.RO cs.AI 57%

GAP: Geometric Anchor Pre-training for Data-Efficient Visuomotor Learning of Manipulation Tasks

GAP:用于操作任务数据高效视觉运动学习的几何锚预训练

Davide Buoso, Andrea Protopapa, Stefano Di Carlo, Francesca Pistilli, Giuseppe Averta

机构 * Department of Control and Computer Engineering, Polytechnic University of Turin(控制与计算机工程系,都灵理工大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出GAP,通过预训练空间适配器生成稳定的几何锚点,提升在稀疏数据下的视觉运动策略学习性能,实验显示其在多个任务中优于其他方法。

Comments Project webpage at https://lambdavi.github.io/gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15621 2026-05-18 cs.CV 57%

LRCP: Low-Rank Compressibility Guided Visual Token Pruning for Efficient LVLMs

LRCP: 低秩压缩性引导的视觉标记修剪用于高效的LVLMs

Hongyu Lu, Feng Zhang, Wenwei Jin, Huanling Hu, Tianjun Shi, Shikai Jiang, Yao Hu, Jiawei Li

机构 * Xiaohongshu(小红书) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出LRCP,通过低秩压缩性引导视觉标记修剪,有效减少视觉语言模型的推理成本,实现94.7%的图像理解性能保留和88.9%的标记减少。

Comments The paper includes 11 figures, multiple tables, comprehensive experimental results on 11 image understanding benchmarks and 3 video benchmarks, with extensive ablation studies and qualitative visualizations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15307 2026-05-18 cs.GR cs.CV cs.MM cs.SD 57%

Sound Sparks Motion: Audio and Text Tuning for Video Editing

声音激发动作:用于视频编辑的音频和文本微调

AmirHossein Naghi Razlighi, Aryan Mikaeili, Ali Mahdavi-Amiri, Daniel Cohen-Or, Yiorgos Chrysanthou

机构 * University of Cyprus(塞浦路斯大学) Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) CYENS Center Of Excellence(CYENS卓越中心)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Sound Sparks Motion框架,通过测试时调整音频视觉生成模型的多模态条件信号,实现视频动作编辑,无需训练,通过音频潜在和文本条件残差扰动促进动作修改,同时利用视觉语言模型反馈提升编辑效果。

Comments Project Page: https://amirhossein-razlighi.github.io/Sound_Sparks_Motion

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14833 2026-05-15 cs.AI cs.HC 57%

Emotion-Attended Stateful Memory (EASM):The Architecture for Hyper-Personalization at Scale

情感关注状态记忆(EASM):大规模超个性化的人机交互架构

Vineet Kotecha, Vansh Gupta

机构 * divAIne Research(divAIne研究)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出EASM架构,通过长期历史、情绪信号和推断意图动态构建用户特定对话上下文,实验表明其在记忆基础、计划清晰度和情感验证方面显著优于无状态基线。

Comments 18 pages, 3 figures, 3 tables. Industry research whitepaper. Includes controlled A/B evaluation across 30 scenarios and 6 emotional categories

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14750 2026-05-15 cs.CR cs.AI 57%

EVA: Editing for Versatile Alignment against Jailbreaks

EVA:针对对抗性攻击的多功能对齐编辑

Yi Wang, Hongye Qiu, Yue Xu, Sibei Yang, Zhan Qin, Minlie Huang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Sun Yat-sen University(中山大学) State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI

AI总结 本文提出EVA框架,通过直接模型编辑提升安全对齐,有效中和有害行为,实验显示其在LLMs和VLMs中对抗攻击效果优于现有方法。

Comments IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14594 2026-05-15 cs.CV cs.GR 57%

TOPOS: High-Fidelity and Efficient Industry-Grade 3D Head Generation

TOPOS: 高保真且高效的工业级3D人脸生成

Bojun Xiong, Zoubin Bi, Xinghui Peng, Yunmu Wang, Junchen Deng, Jun Liang, Jing Li, Bowen Cai, Huan Fu

机构 * HUJING Digital Media & Entertainment Group(华景数字媒体与娱乐集团)

专题命中 VLM训练与架构 :MLLM(abstract_cn);分类 cs.CV

AI总结 TOPOS框架通过统一拓扑结构实现单图像条件下的3D人脸生成,生成具有固定拓扑的高保真人脸网格,提升顶点级对应一致性,优于传统方法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14310 2026-05-15 cs.CV 57%

CoRDS: Coreset-based Representative and Diverse Selection for Streaming Video Understanding

CoRDS:基于核心集的代表性与多样性选择用于流视频理解

Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CoRDS方法,通过核心集选择优化流视频理解中的缓存压缩,提升代表性与多样性,优于传统启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07459 2026-05-15 cs.CV 57%

DAPL: Integration of Positive and Negative Descriptions in Text-Based Person Search

DAPL: 文本基于人物搜索中正负描述的整合

Yuchuan Deng, Zhanpeng Hu, Zijie Xin, Chuang Deng, Qijun Zhao

机构 * Sichuan University(四川大学) Renmin University of China(中国人民大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 DAPL通过整合正负描述提升文本基于人物搜索中视觉-语言模型的解释准确性,结合DIAC和SIAM学习,引入DTS损失以平衡视觉与文本嵌入的粗细粒度对齐,提升匹配精度和鲁棒性。

Journal ref 2025 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13835 2026-05-14 cs.CV 57%

Unlocking Patch-Level Features for CLIP-Based Class-Incremental Learning

解锁基于CLIP的类增量学习中的补丁级特征

Hao Sun, Zi-Jun Ding, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SPA方法,通过利用CLIP的补丁级语义信息提升类增量学习性能,通过生成类级语义描述引导补丁特征选择,并利用最优传输对齐语义特征,有效缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏