arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-13 至 2026-05-13 共收录 19 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 19 篇

2605.11939 2026-05-13 cs.CV 85%

Cluster-Aware Neural Collapse Prompt Tuning for Long-Tailed Generalization of Vision-Language Models

面向长尾泛化的眼视觉-语言模型集群感知神经崩溃提示微调

Boyang Guo, Liang Li, Lin Peng, Yuhan Gao, Xichun Sheng, Chenggang Yan

机构 * Hangzhou Dianzi University(杭州电子科技大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) The Hong Kong Polytechnic University(香港理工大学) Macao Polytechnic University(澳门理工学院) Zhejiang Provincial Key Laboratory of Low Altitude Ubiquitous Networking Technology, HDU(浙江省低空 ubiquitous 网络技术重点实验室,HDU)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出集群感知神经崩溃提示微调方法,通过优化提示微调视觉-语言模型的长尾类判别能力,提升模型在类别不平衡数据集上的泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02955 2026-05-13 cs.CV 85%

MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models

MotionBench: 视觉语言模型视频细粒度运动理解的基准测试与改进

Wenyi Hong, Yean Cheng, Zhuoyi Yang, Weihan Wang, Lefan Wang, Xiaotao Gu, Shiyu Huang, Yuxiao Dong, Jie Tang

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 MotionBench针对视觉语言模型在细粒度视频运动理解方面的不足,提出综合评估基准,通过六类运动导向问题类型评估模型运动层面感知能力,并提出Through-Encoder融合方法提升模型对有限序列长度内细粒度运动的感知。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05408 2026-05-13 cs.CV cs.AI 84%

See the past: Time-Reversed Scene Reconstruction from Thermal Traces Using Visual Language Models

回望过去:利用视觉语言模型从热迹中进行时间反转场景重建

Kebin Contreras, Luis Toscano-Palomino, Mauro Dalla Mura, Jorge Bacca

机构 * Physics School, Universidad Industrial de Santander, Colombia(圣安德烈大学物理系,哥伦比亚) Department of Computer Science, Universidad Industrial de Santander, Colombia(圣安德烈大学计算机科学系,哥伦比亚) GIPSA-Lab, Université Grenoble Alpes, CNRS, Grenoble INP, Grenoble, France(格拉斯实验室,格勒诺布尔阿尔卑斯大学,CNRS,格勒诺布尔INP,法国) Institut Universitaire de France (IUF), France(法国国家科学院(IUF))

专题命中 VLM训练与架构 :visual language model(title);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出利用视觉语言模型和约束扩散过程,从热迹中恢复过去几秒钟的场景状态,展示了时间反转成像的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11716 2026-05-13 cs.AI 79%

SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

SafeSteer: 多模态大语言模型中的解码级防御机制

Xinyi Zeng, Xue Yang, Jingyuan Zhang, Huanqian Yan, Xiang Chen, Kaiwen Wei, Hankun Kang, Yu Tian

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Chongqing University(重庆大学) Wuhan University(武汉大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI

AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22414 2026-05-13 cs.CV 77%

LucidFlux: Caption-Free Photo-Realistic Image Restoration via a Large-Scale Diffusion Transformer

LucidFlux:一种无需图像描述的高质量图像修复方法

Song Fei, Tian Ye, Lujia Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 LucidFlux通过大规模扩散变压器实现无描述图像修复,引入轻量双分支条件器和自适应调制方案,提升几何精度与纹理恢复,优于开源和商业基线。

Comments Project Page: https://w2genai-lab.github.io/LucidFlux

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11693 2026-05-13 cs.AI 77%

Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity

超越文本的衡量:通过质量、对齐和多样性评估多模态摘要

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算学院)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出MM-Eval框架,整合文本质量、跨模态对齐和视觉多样性评估,通过学习聚合模型优化多模态摘要的综合评价,揭示事实一致性对整体质量的关键作用。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11477 2026-05-13 cs.CV 77%

LDDR: Linear-DPP-Based Dynamic-Resolution Frame Sampling for Video MLLMs

LDDR:基于线性DPP的动态分辨率帧采样用于视频MLLMs

Jingfeng Chen, Jiawen Qian, Wendi Deng, Yinuo Guo, Jiaqi Yu, Sicong Leng, Raghuveer Thirukovalluru, Bhuwan Dhingra

机构 * Carnegie Mellon University(卡内基梅隆大学) Individual Researcher(个人研究员) National University Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Duke University(杜克大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出LDDR框架,通过任务条件特征空间中查询感知的DPP帧选择,在有限视觉token预算下提升视频理解,实现3倍速度提升,并通过组DPP重要性度量动态分配分辨率,优于现有基线方法。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11959 2026-05-13 cs.CV cs.CL 74%

Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models

基于视觉语言模型的指令视频多模态抽象摘要

Maham Nazir, Muhammad Aqeel, Richong Zhang, Francesco Setti

机构 * Beihang University, Beijing, China(北航大学,北京,中国) University of Verona, Italy(威尼斯大学,意大利)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 本文提出ClipSum框架,利用冻结的CLIP视觉语言特征进行指令视频摘要,通过显式时间建模和维度自适应融合,实现视觉与语言的语义对齐,实验显示其在YouCook2数据集上表现优于传统方法。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12375 2026-05-13 cs.LG cs.AI 73%

Agent-Based Post-Hoc Correction of Agricultural Yield Forecasts

基于代理的农业产量预测事后修正

Matthew Beddows, Aiden Durrant, Georgios Leontidis

机构 * School of Natural and Computing Sciences(自然与计算科学学院) University of Aberdeen(阿伯丁大学) School of Computing Sciences(计算科学学院) University of East Anglia(东安格利亚大学) Department of Physics and Technology(物理与技术系) UiT The Arctic University of Norway(北欧大学(UiT))

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种结构化的LLM代理框架,用于事后修正现有模型预测,通过编码农业领域知识提升预测准确性,在草莓和玉米数据集上显著降低MAE和MASE。

Comments 21 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11864 2026-05-13 cs.IR cs.AI cs.CV cs.MM 73%

Very Efficient Listwise Multimodal Reranking for Long Documents

非常高效的长文档多模态重排序方法

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute (MTRI)(马杰拉技术研究院(MTRI))

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出ZipRerank,通过轻量级查询-图像早期交互机制和单次前向传递消除自回归解码,实现高效多模态重排序,实验表明其在MMDocIR基准上性能优异且显著降低LLM推理延迟。

Comments To appear in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22663 2026-05-13 cs.CV 70%

AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model

AIA: 重新思考统一多模态模型中的架构解耦策略

Dian Zheng, Manyuan Zhang, Hongyu Li, Kai Zou, Hongbo Liu, Ziyu Guo, Kaituo Feng, Yexin Liu, Ying Luo, Hongsheng Li

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan(美团) USTC(中国科学技术大学) TJU(天津大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出AIA损失函数,通过学习任务特定的多模态交互模式,缓解任务冲突而不依赖模型解耦,提升生成与理解性能。

Comments Project page: https://zhengdian1.github.io/AIA-project/ Code: https://github.com/zhengdian1/AIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11048 2026-05-13 cs.RO cs.AI 70%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11659 2026-05-13 cs.CV cs.AI 62%

Reviving In-domain Fine-tuning Methods for Source-Free Cross-domain Few-shot Learning

复兴领域内微调方法以适用于无源跨领域少样本学习

Yaze Zhao, Yicong Liu, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究跨领域少样本学习中领域内微调方法的性能,发现LoRA等适配器方法优于提示方法,提出Semantic Probe框架提升模态对齐和类别分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12500 2026-05-13 cs.CV 57%

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

SenseNova-U1:基于NEO-unify架构的多模态理解和生成统一范式

Haiwen Diao, Penghao Wu, Hanming Deng, Jiahao Wang, Shihao Bai, Silei Wu, Weichen Fan, Wenjie Ye, Wenwen Tong, Xiangyu Fan, Yan Li, Yubo Wang, Zhijie Cao, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Yuwei Niu, Yue Zhu, Bo Liu, Chengguang Lv, Haojia Yu, Haozhe Xie, Hongli Wang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jingcheng Ni, Junxiang Xu, Kaihuan Liang, Lianqiang Shi, Linjun Dai, Linyan Wang, Oscar Qian, Peng Gao, Pengfei Liu, Qingping Sun, Rui Shen, Ruisi Wang, Shengnan Ma, Shuang Yang, Siyi Xie, Siying Li, Tianbo Zhong, Xiangli Kong, Xuanke Shi, Yang Gao, Yongqiang Yao, Yves Wang, Zhengqi Bai, Zhengyu Lin, Zixin Yin, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 SenseNova-U1通过NEO-unify架构实现多模态理解与生成的统一,展示了在文本理解、视觉语言感知、知识推理、代理决策和空间智能等任务中的表现,同时在X2I合成、图文生成和视觉语言生成中表现出色。

Comments Project page: https://github.com/OpenSenseNova/SenseNova-U1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20899 2026-05-13 cs.CV 57%

Concepts in Motion: Temporal Concept Bottleneck Model for Interpretable Video Classification

动态概念:可解释视频分类的时序概念瓶颈模型

Patrick Knab, Sascha Marton, Philipp J. Schubert, Drago Guggiana, Christian Bartelt

机构 * Technical University of Clausthal(Clausthal 技术大学) Ramblr.ai Research(Ramblr.ai 研究)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出MoTIF模型,通过时间接地的概念激活序列进行视频分类,利用时序自注意力机制建模概念的出现时间和贡献,提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11753 2026-05-13 cs.AI 57%

Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention

迈向基于视觉的多模态摘要:通过跨模态Transformer和门控注意力

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出SPeCTrA-Sum框架,通过深度视觉处理器和轻量视觉相关性预测器实现文本摘要与图像选择,提升多模态摘要的视觉连贯性与准确性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11334 2026-05-13 cs.LG cs.CL cs.IR 57%

VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference

VERDI:基于验证的LLM裁判的单次调用置信度估计方法

Jasmine Qi, Danylo Dantsev, Muyang Sun

机构 * Indeed Inc(Indeed公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 VERDI通过分解推理过程提取置信度信号,无需额外调用,提升验证型LLM裁判的可信度评估。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06950 2026-05-13 cs.CV cs.CL 57%

READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling

READ:基于部分视频-语言对齐的递归适配器用于低资源视频-语言建模的参数高效迁移学习

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Khoi Le, Zhiyuan Hu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出READ框架,通过递归计算和部分最优传输对齐,提升低资源视频-语言建模任务的性能,优于现有迁移学习方法。

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11516 2026-05-13 cs.NI 50%

Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN

智能体应取代窄预测AI作为6G AI-RAN的协调者

Pranshav Gajjar, Vijay K Shah

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。

详情

展开后加载摘要…

URL PDF HTML 收藏