arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-28 至 2026-05-28 共收录 111 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 11 篇

2605.27916 2026-05-28 cs.CV cs.CL 86%

OphIn-500K: Curating Web-Scale Visual Instructions for Scaling Ophthalmic Multimodal Large Language Models

OphIn-500K:策划网络规模的视觉指令以扩展眼科多模态大语言模型

Xuanzhao Dong, Wenhui Zhu, Xiwen Chen, Hao Wang, Xin Li, Yujian Xiong, Jiajun Cheng, Jingjing Wang, Xiaobing Yu, Haiyu Wu, Shao Tang, Zhipeng Wang, Langechuan Liu, Shan Lin, Oana Dumitrascu, Yalin Wang

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of Notre Dame(诺特丹大学) Florida State University(佛罗里达州立大学) Rice University(里德大学) NVIDIA(英伟达) Mayo Clinic(梅奥诊所)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 提出OphIn-Engine流水线从网络视频中构建高质量眼科指令数据,生成包含50万+指令实例的OphIn-500K数据集,并基于此开发眼科专用多模态大语言模型OphIn-VL,在多项任务上超越现有通用医学和专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07574 2026-05-28 cs.CV cs.CL 86%

ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention

ViCA:仅视觉交叉注意力的高效多模态大语言模型

Wenjie Liu, Hao Wu, Xin Qiu, Xudong Wang, Yingqi Fan, Yihan Zhang, Anhao Zhao, Yunpu Ma, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院、东部技术研究院) Munich Center for Machine Learning, LMU Munich(慕尼黑机器学习中心、慕尼黑大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 提出ViCA架构,通过仅视觉交叉注意力减少视觉令牌计算,在保持98%准确率的同时将视觉计算降至4%,实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27932 2026-05-28 cs.CV cs.AI cs.CL cs.CR cs.LG 82%

When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?

当图文推理遇上安全:什么决定了多模态越狱鲁棒性?

Yuan Tian, Bing Hu, Fang Wu, Xiaomin Li, Binghang Lu, Neil Zhenqiang Gong

机构 * Independent Researcher(独立研究者) Stanford University(斯坦福大学) Harvard University(哈佛大学) Purdue University(普渡大学) Duke University(杜克大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文研究多模态大语言模型中不同图文推理范式对越狱鲁棒性的影响,发现显式图像工具交互能显著降低攻击成功率,并通过引入图像工具安全向量框架从表征层面解释其机制。

Comments 17 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27894 2026-05-28 cs.CV 79%

Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs

面向不完整多模态输入的统一视觉-语言模型

Xiang Fang, Wanlong Fang, Changshuo Wang, Keke Tang, Daizong Liu, Siyi Wang, Wei Ji

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院) Guangzhou University(广州大学) Wuhan University(武汉大学) Nanjing University(南京大学)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 针对视频-语言模型在传感器失效导致模态不完整数据下的训练-测试不一致问题,提出首个统一的不完整视频-语言模型作为即插即用模块,提升多模态任务性能。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22655 2026-05-28 cs.AI cs.CV cs.MM 75%

Text-Only Data Synthesis for Vision Language Model Training

仅文本数据合成用于视觉语言模型训练

Xiaomin Yu, Wenjie Zhang, Ziyue Qiao, Chengwei Qin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Great Bay University(大湾大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出一个跨集成的三阶段多模态数据合成框架,仅从文本生成高质量多模态训练数据,用于视觉语言模型的预训练和指令微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28239 2026-05-28 cs.CV 70%

Learning to Label: A Reinforced Self-Evolving Framework for Semi-supervised Referring Expression Segmentation

学习标注:一种用于半监督指代表达分割的强化自进化框架

Runlong Cao, Ying Zang, Chuanwei Zhou, Tianrun Chen, Tong Zhang, Zhen Cui, Chunyan Xu

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Information Engineering, Huzhou Normal University(湖州师范学院信息工程学院) School of Artificial Intelligence, Nanjing University of Posts and Telecommunications(南京邮电大学人工智能学院) National Key Laboratory of Tibetan Language Intelligence(藏语智能国家重点实验室) Zhejiang University(浙江大学) Beijing Normal University(北京师范大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出L2L框架,通过强化学习将伪标签构建转化为可学习的决策过程,结合多模态大模型提取先验,实现半监督指代表达分割的联合优化。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28023 2026-05-28 cs.CV cs.AI cs.CL cs.MM 70%

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

VCap: 用于弱到强视觉字幕的超几何奖励

Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang, Yankai Yang, Yancheng Long, Yiyang Fan, Xuanyu Zheng, Haonan Fan, Kaiyu Jiang, Tianke Zhang, Changyi Liu, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Chinese Academy of Sciences(中国科学院) Kuaishou Technology(快手科技)

专题命中 图文多模态 :MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出VCap,一种证人-裁判奖励机制,通过超几何分布级别的精度验证视觉信号中参考字幕与策略生成字幕之间的事实一致性,实现弱到强泛化,在多个图像和视频字幕基准上超越SOTA模型。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21165 2026-05-28 cs.CL cs.CV 62%

Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional Dialects

多种方言,多种语言,一种文化视角:评估多语言视觉语言模型对孟加拉文化的理解,涵盖历史关联语言和地区方言

Nurul Labib Sayeedi, Md. Faiyaz Abdullah Sayeedi, Shubhashis Roy Dipta, Rubaya Tabassum, Ariful Ekraj Hridoy, Mehraj Mahmood, Mahbub E Sobhani, Md. Tarek Hasan, Swakkhar Shatabda

机构 * United International University(国际联合大学) BRAC University(布拉塔克大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出 BanglaVerse 基准,通过手工标注图像和扩展至多种语言及方言,评估多语言视觉语言模型在孟加拉文化理解中的表现,发现标准孟加拉语评估高估模型能力,方言变化导致性能下降,文化知识缺失是主要瓶颈。

Comments https://labib1610.github.io/BanglaVerse/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28741 2026-05-28 cs.CV 57%

Self-Prophetic Decoding to Unlock Visual Search in LVLMs

自预言解码以解锁LVLM中的视觉搜索

Zhendong He, Qiyuan Dai, Guanbin Li, Liang Lin, Sibei Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ShanghaiTech University(上海科技大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出SeProD框架,通过自预言解码利用预训练模型的内在单步能力,以无训练、即插即用的方式增强LVLM在多步视觉搜索中的连贯推理,在4个基准的12个分割上一致提升性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28115 2026-05-28 cs.AI 57%

CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models

CIVIC: 面向高效视觉语言模型的端到端序列紧凑性

Fengze Yang, Bo Yu, Xuewen Luo, Cathy Liu, Chenxi Liu

机构 * Department of Civil & Environmental Engineering(土木与环境工程系) University of Utah(犹他大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出CIVIC框架,通过路径一致的紧凑视觉推理,在视觉编码器、投影层、LLM预填充和KV缓存中保持紧凑序列表示,减少非连续内存访问和局部合并开销,在Qwen3-VL架构上实现KV缓存内存降至约三分之一并降低端到端推理延迟,同时通过文本对齐KL蒸馏和自适应空间保留下限保持精度。

Comments 11 pages, 6 figures, 2 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21046 2026-05-28 cs.CV cs.RO 57%

CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification

CogVLA: 通过指令驱动路由与稀疏化实现认知对齐的视觉-语言-动作模型

Wei Li, Renshan Zhang, Rui Shao, Jie He, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出CogVLA框架,通过指令驱动路由和稀疏化机制,在LIBERO基准和真实机器人任务上以2.5倍训练成本降低和2.8倍推理延迟降低实现97.4%和70.0%的成功率。

Comments Accepted to NeurIPS 2025, Project Page: https://jiutian-vl.github.io/CogVLA-page

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 8 篇

2605.28192 2026-05-28 cs.AI 89%

Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning

面向多跳音视频推理的主动全模态感知代理

Ke Xu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对多跳音视频推理中证据稀疏且跨模态分布的问题,提出MOV-Bench基准和AOP-Agent代理框架,通过分层全模态记忆与观察-反思-重规划循环实现主动感知,显著提升开源全模态大模型在长视频和推理密集型问题上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28805 2026-05-28 cs.CL cs.AI cs.CV cs.LG 82%

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

OmniVerifier-M1: 具有显式结构化重校准的多模态元验证器

Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling Yang

机构 * Tsinghua University(清华大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学) Microcyto Princeton University(普林斯顿大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出OmniVerifier-M1,通过符号化元验证(如边界框)和解耦强化学习,实现多模态大模型的可靠细粒度验证与动态区域级自校正。

Comments ICML 2026. Project: https://github.com/Cominclip/OmniVerifier

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28101 2026-05-28 cs.SD cs.AI cs.MM 81%

EigeNet: Geometry-Informed Multi-Modal Learning for Few-shot Novel View RIR Prediction

EigeNet:几何信息引导的多模态学习用于少样本新视角RIR预测

Chong Jing, Zitong Lan, Junan Zhang, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM

AI总结 提出EIGENET框架,通过跨视角交替注意力Transformer和几何信息调制块,结合多任务学习,实现少样本新视角房间脉冲响应预测,达到最先进性能。

Comments Code available on https://github.com/FEAfeatherTHER/EigeNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17233 2026-05-28 cs.LG cs.SD eess.AS 79%

Semantic-Aware Interpretable Multimodal Music Auto-Tagging

语义感知可解释多模态音乐自动标注

Andreas Patakis, Vassilis Lyberatos, Spyridon Kantarelis, Edmund Dervakos, Giorgos Stamou

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 提出一种利用多模态音乐特征组和期望最大化算法实现可解释音乐自动标注的方法,在保持竞争性能的同时提供决策过程透明度。

Comments Accepted at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27741 2026-05-28 cs.CL 77%

Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization

逃离语言先验:通过模态感知策略优化缓解音频推理中的后期模态崩溃

Cihan Xiao, Yiwen Shao, Chenxing Li, Xiang He, Zhenwen Liang, Steve Yves, Sanjeev Khudanpur, Liefeng Bo

机构 * Johns Hopkins University(约翰霍普金斯大学) Tencent Hunyuan(腾讯文言)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CL

AI总结 针对多模态大语言模型在强化学习后训练中因统一策略梯度忽略模态依赖性而导致的后期模态崩溃问题,提出模态感知策略优化(MAPO)框架,通过模态相关性掩码和辅助注意力损失分支动态聚焦梯度并维持跨模态推理,在复杂音频推理基准上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03328 2026-05-28 cs.CR 71%

GuardReasoner-Omni: A Reasoning-based Multi-modal Guardrail for Text, Image, Video, and Audio

GuardReasoner-Omni:一种基于推理的多模态护栏,适用于文本、图像、视频和音频

Zhenhao Zhu, Yue Liu, Yanpei Guo, Wenjie Qu, Cancan Chen, Yufei He, Yibo Li, Yulin Chen, Tianyi Wu, Huiying Xu, Xinzhong Zhu, Jiaheng Zhang

专题命中 音频语音多模态 :multi-modal(title)

AI总结 提出GuardReasoner-Omni,一种基于推理的多模态护栏模型,通过两阶段训练(SFT和RL)在3B和7B参数规模上实现对文本、图像、视频和音频数据的有效审核,性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28714 2026-05-28 eess.AS 70%

VAANI: Capturing the language landscape for an inclusive digital India

VAANI:为包容性数字印度捕捉语言景观

Sujith Pulikodan, Abhayjeet Singh, Agneedh Basu, Nihar Desai, Pavan Kumar J, Pranav D Bhat, Raghu Dharmaraju, Ritika Gupta, Sathvik Udupa, Saurabh Kumar, Sumit Sharma, Visruth Sanka, Dinesh Tewari, Harsh Dhand, Amrita Kamat, Sukhwinder Singh, Shikhar Vashishth, Partha Talukdar, Raj Acharya, Prasanta Kumar Ghosh

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出大规模多模态数据集VAANI,覆盖印度165个地区、105种语言,通过图像提示收集自发语音并严格质控,旨在推动包容性语音技术发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27838 2026-05-28 cs.SD 50%

Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text

Dasheng AudioGen: 从文本生成连贯音频场景的统一模型

Jiahao Mei, Heinrich Dinkel, Yadong Niu, Xingwei Sun, Gang Li, Yifan Liao, Jiahao Zhou, Junbo Zhang, Jian Luan, Mengyue Wu

机构 * X-LANCE Lab, Shanghai Jiao Tong University, Shanghai, China(上海交通大学XLANCE实验室,上海,中国) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司MiLM Plus,北京,中国)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出Dasheng AudioGen统一框架,通过结构化多视角描述和高维统一语义-声学表示,实现从文本到混合音频场景的端到端生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 11 篇

2605.24302 2026-05-28 cs.CV 83%

Cross-Modal Action Recognition in Egocentric Video Using Mamba: Integrating RGB and Hand Skeleton Streams via CLS Token Fusion Strategies

基于Mamba的第一人称视频跨模态动作识别:通过CLS令牌融合策略整合RGB和手部骨架流

Juan Ignacio Bustos Gorostegui, Maria Elena Buemi

机构 * Univ. of Buenos Aires. Faculty of Exact and Natural Sciences. Dept. of Computer Science (DC)(布宜诺斯艾利斯大学。精确与自然科学学院。计算机科学系) CONICET-Univ. of Buenos Aires. Institute of Computer Sciences (ICC)(布宜诺斯艾利斯大学CONICET联合体。计算机科学研究所)

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出一种基于Mamba的跨模态架构,通过四种CLS令牌融合策略(朴素、平均、加权和基于上下文)整合RGB视频和手部骨架数据,在H2O数据集上平均策略达到最佳性能,Top-1准确率在Tiny配置下提升超10%。

Comments 4 pages , 2 figures , Egovis2026 , CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27737 2026-05-28 cs.CV 79%

Bounded-Compute Multimodal Regression for Product-Rating Prediction

有界计算多模态回归用于产品评分预测

William Leach, Ru He, Sizhuo Ma, Yizhen Jia, Min Cao, Jian Wang, Rick Cao

机构 * Snap Inc.

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对严格延迟预算下的标量回归任务,提出一种有界计算适配方法,通过替换语言模型头为轻量MLP并固定输入,在LoViF 2026挑战赛中实现高效多模态回归。

Comments Accepted to the LoViF Workshop at CVPR 2026. 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27451 2026-05-28 cs.CV 79%

From Affect to Complex Behavior: Advancing Multimodal Human-Centered AI at the 10th ABAW Workshop & Competition

从情感到复杂行为:第十届ABAW研讨会与竞赛推进多模态以人为中心的人工智能

Dimitrios Kollias, Panagiotis Tzirakis, Alan Cowen, Stefanos Zafeiriou, Irene Kotsia, Eric Granger, Marco Pedersoli, Simon Bacon, Jens Madsen, Soufiane Belharbi, Muhammad Haseeb Aslam, Chunchang Shao, Guanyu Hu

机构 * Queen Mary University of London(伦敦皇后玛丽大学) Hume AI Google Deepmind(谷歌DeepMind) Imperial College London(伦敦帝国理工学院) Cogitat LIVIA ILLS ETS Montreal(蒙特利尔ETS) Concordia University(Concordia大学) Xi’an Jiaotong University(西安交通大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文介绍了第十届ABAW研讨会与竞赛,通过多模态挑战和论文,推动真实环境下人类情感与行为的建模、分析和理解。

Comments accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28604 2026-05-28 cs.CV cs.AI 73%

Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification

挖掘多模态时空线索用于视频重要人物识别

Xiao Wang, Minglei Yang, Bin Yang, Wenke Huang, Zheng Wang, Xin Xu, Mang Ye

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System, Wuhan University of Science and Technology(湖北省智能信息处理与实时工业系统重点实验室) School of Computer Science, National Engineering Research Center for Multimedia Software, Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机科学学院,国家多媒体软件工程技术研究中心,湖北省多媒体与网络通信工程重点实验室,武汉大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对视频中人物重要性随时间变化的问题,提出VIP-Net框架,通过多模态时空线索融合与时间重要性矫正,在Temporal-VIP数据集上达到67.3%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13748 2026-05-28 cs.CL cs.CV 73%

RMPL: Relation-aware Multi-task Progressive Learning with Stage-wise Training for Multimedia Event Extraction

RMPL:基于关系感知的多任务渐进学习与分阶段训练的多媒体事件抽取

Yongkang Jin, Jianwen Luo, Jingjing Wang, Jianmin Yao, Yu Hong

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 提出RMPL框架,通过分阶段训练结合单模态事件抽取和多模态关系抽取的异构监督,在低资源条件下实现多媒体事件抽取,并在M2E2基准上取得一致改进。

Comments Accepted by ACM ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28687 2026-05-28 cs.SD physics.med-ph 71%

Cross-modal characterization of infant cry: validation of a chest-surface accelerometer in extracting acoustic vocal function measures

婴儿哭声的跨模态表征:胸表加速度计在提取声学发声功能测量中的验证

Winko W. An, Saketh Sundar, Lisa Yankowitz, Daryush D. Mehta, Carol L. Wilkinson

机构 * Division of Developmental Medicine, Boston Children’s Hospital(发育医学部,波士顿儿童医院) Harvard Medical School(哈佛医学院) Harvard University(哈佛大学) Children’s Hospital of Philadelphia(费城儿童医院) Center for Laryngeal Surgery and Voice Rehabilitation, Massachusetts General Hospital(嗓音康复中心,麻省总医院)

专题命中 视频多模态 :cross-modal(title)

AI总结 本研究验证了胸表加速度计在婴儿哭声分析中的有效性,发现其能可靠捕获基频和抖动等声学特征,为噪声鲁棒且保护隐私的临床研究提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28544 2026-05-28 cs.CV 57%

DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving

DriveWAM: 视频生成先验实现自动驾驶的可扩展世界-动作建模

Chen Shi, Jinrui Xu, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 提出DriveWAM,通过将预训练视频扩散Transformer适配为自回归视频-动作策略,并引入场景演化驾驶引导和选择性KV记忆,实现可扩展的世界-动作建模,在NAVSIM和PhysicalAI基准上取得强规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28397 2026-05-28 cs.CV 57%

Adaptive Temporal Gating of Longitudinal Magnetic Resonance Imaging for Alzheimer's Prediction

用于阿尔茨海默病预测的纵向磁共振成像自适应时间门控

Alireza Moayedikia, Sara Fin, Alicia Troncoso Lora, Uffe Kock Wiil

机构 * organization= School of Business Law Entrepreneurship, Swinburne University of Technology , city= Melbourne , state= VIC , country= Australia organization= Australian Regenerative Medicine Institute, Monash University , city= Melbourne , state= VIC , country= Australia organization= Data Science \& Big Data Lab, Universidad Pablo de Olavide , city= Seville , country= Spain organization= The Maersk Mc-Kinney M ller Institute, University of Southern Denmark , city= Odense , country= Denmark

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出TAF-Net混合CNN-Transformer架构,通过自适应时间门控融合纵向3D MRI的时空表示,在MCI-to-AD转化预测中仅用结构MRI即达到最优性能,接近需多模态数据的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27920 2026-05-28 cs.CV 57%

Rethinking Video-Language Model from the Language Input Perspective

从语言输入角度重新思考视频-语言模型

Xiang Fang, Wanlong Fang, Changshuo Wang, Xiaoye Qu, Daizong Liu

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院) Huazhong University of Science and Technology(华中科技大学) Wuhan University(武汉大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文从语言输入角度出发,提出一种即插即用的框架,通过生成正负文本、属性文本推理和自加权损失,提升视频-语言模型的性能。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27800 2026-05-28 cs.CV 57%

CuriosAI Submission to the CASTLE Challenge at EgoVis 2026

CuriosAI 在 EgoVis 2026 CASTLE 挑战赛中的提交

Yuto Kanda, Hayato Tanoue, Takayuki Hori

机构 * SoftBank Corp(软银公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对600多小时多视角自我中心视频的185道选择题,提出SVA(搜索-验证-回答)三阶段流水线和TMKG(时间多模态知识图谱)两种方法,SVA达到0.50准确率并作为最终提交。

Comments The 4th place solution for the CASTLE Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23137 2026-05-28 eess.IV cs.CV 57%

STAMBRIDGE: Spectral-Temporal Amplitude-aware Mid-Feature Bridge for EEG Visual Decoding

STAMBRIDGE:用于脑电视觉解码的谱时幅度感知中间特征桥

Jiahe Meng, Weiming Zeng, Yueyang Li, Bo Chai, Hongjie Yan, Zhiguo Zhang, Wai Ting Siok, Nizhuan Wang

机构 * Lab of Digital Image and Intelligent Computation, Shanghai Maritime University(数字图像与智能计算实验室,上海 Maritime 大学) Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系,香港理工大学) Department of Neurology, Affiliated Lianyungang Hospital of Xuzhou Medical University(神经内科,徐州医学院附属连云港医院) Institute of Computing and Intelligence, Harbin Institute of Technology Shenzhen(计算与智能研究所,哈尔滨工业大学深圳研究院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 提出STAMBRIDGE两阶段框架,通过谱时幅度感知调制(STAM)提取稳健脑电特征,并利用中间特征语义桥(MFSB)实现稳定的跨模态对齐,在THINGS-EEG基准上取得34.50% Top-1和65.95% Top-5的200路零样本检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏