arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-13 至 2026-05-13 共收录 99 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 19 篇

2605.11048 2026-05-13 cs.RO cs.AI 70%

ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching

ForceFlow: 通过接触驱动的流匹配学习感知与行动

Shuoheng Zhang, Yifu Yuan, Hongyao Tang, Yan Zheng, Qiaojun Yu, Pengyi Li, Guowei Huang, Helong Huang, Xingyue Quan, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah's Ark Lab(华为诺亚实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ForceFlow框架,通过融合力信号与多模态信息,提升机器人在复杂接触任务中的鲁棒性和泛化能力,实验显示其在六个真实任务中成功率提升37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11659 2026-05-13 cs.CV cs.AI 62%

Reviving In-domain Fine-tuning Methods for Source-Free Cross-domain Few-shot Learning

复兴领域内微调方法以适用于无源跨领域少样本学习

Yaze Zhao, Yicong Liu, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究跨领域少样本学习中领域内微调方法的性能,发现LoRA等适配器方法优于提示方法,提出Semantic Probe框架提升模态对齐和类别分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12500 2026-05-13 cs.CV 57%

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

SenseNova-U1:基于NEO-unify架构的多模态理解和生成统一范式

Haiwen Diao, Penghao Wu, Hanming Deng, Jiahao Wang, Shihao Bai, Silei Wu, Weichen Fan, Wenjie Ye, Wenwen Tong, Xiangyu Fan, Yan Li, Yubo Wang, Zhijie Cao, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Yuwei Niu, Yue Zhu, Bo Liu, Chengguang Lv, Haojia Yu, Haozhe Xie, Hongli Wang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jingcheng Ni, Junxiang Xu, Kaihuan Liang, Lianqiang Shi, Linjun Dai, Linyan Wang, Oscar Qian, Peng Gao, Pengfei Liu, Qingping Sun, Rui Shen, Ruisi Wang, Shengnan Ma, Shuang Yang, Siyi Xie, Siying Li, Tianbo Zhong, Xiangli Kong, Xuanke Shi, Yang Gao, Yongqiang Yao, Yves Wang, Zhengqi Bai, Zhengyu Lin, Zixin Yin, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 SenseNova-U1通过NEO-unify架构实现多模态理解与生成的统一,展示了在文本理解、视觉语言感知、知识推理、代理决策和空间智能等任务中的表现,同时在X2I合成、图文生成和视觉语言生成中表现出色。

Comments Project page: https://github.com/OpenSenseNova/SenseNova-U1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20899 2026-05-13 cs.CV 57%

Concepts in Motion: Temporal Concept Bottleneck Model for Interpretable Video Classification

动态概念:可解释视频分类的时序概念瓶颈模型

Patrick Knab, Sascha Marton, Philipp J. Schubert, Drago Guggiana, Christian Bartelt

机构 * Technical University of Clausthal(Clausthal 技术大学) Ramblr.ai Research(Ramblr.ai 研究)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出MoTIF模型,通过时间接地的概念激活序列进行视频分类,利用时序自注意力机制建模概念的出现时间和贡献,提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11753 2026-05-13 cs.AI 57%

Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention

迈向基于视觉的多模态摘要:通过跨模态Transformer和门控注意力

Abid Ali, Diego Molla-Aliod, Usman Naseem

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出SPeCTrA-Sum框架,通过深度视觉处理器和轻量视觉相关性预测器实现文本摘要与图像选择,提升多模态摘要的视觉连贯性与准确性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11334 2026-05-13 cs.LG cs.CL cs.IR 57%

VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference

VERDI:基于验证的LLM裁判的单次调用置信度估计方法

Jasmine Qi, Danylo Dantsev, Muyang Sun

机构 * Indeed Inc(Indeed公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 VERDI通过分解推理过程提取置信度信号,无需额外调用,提升验证型LLM裁判的可信度评估。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06950 2026-05-13 cs.CV cs.CL 57%

READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling

READ:基于部分视频-语言对齐的递归适配器用于低资源视频-语言建模的参数高效迁移学习

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Khoi Le, Zhiyuan Hu, Cong-Duy Nguyen, See-Kiong Ng, Luu Anh Tuan

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出READ框架,通过递归计算和部分最优传输对齐,提升低资源视频-语言建模任务的性能,优于现有迁移学习方法。

Comments Accepted at AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11516 2026-05-13 cs.NI 50%

Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN

智能体应取代窄预测AI作为6G AI-RAN的协调者

Pranshav Gajjar, Vijay K Shah

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 1 篇

2605.11722 2026-05-13 cs.CV cs.LG 62%

EPIC: Efficient Predicate-Guided Inference-Time Control for Compositional Text-to-Image Generation

EPIC: 用于组合文本到图像生成的高效谓词引导推理控制

Sunung Mun, Sunghyun Cho, Jungseul Ok

机构 * Graduate School of Artificial Intelligence, POSTECH(人工智能研究生院,POSTECH) Department of Computer Science & Engineering, POSTECH(计算机科学与工程系,POSTECH)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.LG

AI总结 EPIC通过谓词引导的搜索方法提升组合式文本到图像生成的准确性,减少计算成本,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏