arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 320 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 320 篇

2607.11939 2026-07-15 cs.CV 新提交 79%

TSCA-Net: Temporal-Spatial Clique Attention for Interpretable Multimodal Pedestrian Trajectory Prediction

TSCA-Net:用于可解释多模态行人轨迹预测的时空团块注意力

Md Mustafizur Rahman, Guangchao Yang, A F M Abdun Noor, Md Imam Ahasan, Md Mahfuzur Rahman, Md Ariful Islam

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对拥挤环境中行人轨迹预测难题,提出TSCA-Net框架,含时空团块注意力、跨行人团块势、自适应KAN网格细化三个模块,经实验验证其性能最优,消融研究证实模块互补作用。

Comments 10 pages, 4 figures, 4 tables. Submitted to the IEEE International Conference on Data Mining (ICDM) 2026, Applied Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10206 2026-07-14 cs.RO cs.AI 新提交 79%

Source-Lifted Flow Matching for Intervenable Multimodal Imitation

用于可干预多模态模仿的源提升流匹配

He Zhang, Ying Sun, Pengteng Li, Ziyang Chen, Yiren Zhao, Ziyang Rao, Weiyu Guo, Yandong Guo, Hui Xiong

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究提出源提升流匹配(SL - FM)解决多模态模仿学习中流匹配策略随机性被动问题,核心机制为正交源提升,实验表明其能将被动源随机性转化为可操作变量,提升多模态控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09955 2026-07-14 cs.LG cs.AI 新提交 79%

A Foundation Model for Multimodal Event Sequences in Financial Applications

金融应用中多模态事件序列的基础模型

Nikita Rusakov, Vladislav Meshkov, Konstantin Zorin, Gleb Zaripov, Alexander Uglov, Alexey Vasilev, Anton Klenitskiy

机构 * Sber(俄罗斯储蓄银行) Sber AI Lab(俄罗斯储蓄银行人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究金融应用中多模态事件序列预测建模,提出预训练基础变压器模型统一多源事件成序列,经下一个事件预测学习通用表示,结合现有特征训练轻量级神经模型用于多下游任务,优于传统模型并减少开发开销且已应用取得业务改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04117 2026-07-07 cs.LG cs.CV 新提交 79%

GlacierCastAI: Predicting Glacier Retreat from Multi-Modal Satellite Imagery and Climate Signals

GlacierCastAI:从多模态卫星图像和气候信号预测冰川退缩

Arunkumar Ramachandran

机构 * Independent Researcher(独立研究者)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 研究将冰川边界预测重构为多模态时空预测问题,融合多源数据,用特定架构预测冰川边界,对比传统基线及实验条件,发现气候信号有预测信息,深度学习模型优于传统基线。

Comments 6 pages, 5 figures. Code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31187 2026-07-01 cs.CV 新提交 79%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28089 2026-06-29 cs.CV 新提交 79%

RPM-Distill: Physiology-guided Adaptive Cross-modal Distillation for Robust Remote Physiological Measurement

RPM-Distill:生理引导的自适应跨模态蒸馏用于鲁棒的远程生理测量

Jiyao Wang, Qingyong Hu, Duoxun Tang, Xiao Yang, Kaishun Wu, Jiangbo Yu

机构 * McGill University(麦吉尔大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出RPM-Distill框架,利用训练时的雷达信号通过频域蒸馏指导视频模型,提升光照、肤色和运动变化下的远程心率估计鲁棒性,在挑战性条件下MAE降低81%,相关性提升21%。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27576 2026-06-29 cs.CV 新提交 79%

DeLux: Cross-Modal Local Artifact Restoration in Video Using Neuromorphic Data

DeLux: 利用神经形态数据进行视频中的跨模态局部伪影修复

Bartosz Stachowiak, Dariusz Brzezinski

机构 * Institute of Computing Science, Poznan University of Technology(波兹南技术大学计算机科学学院)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出DeLux,一种利用神经形态事件流作为结构先验,引导RGB视频中光照伪影检测与修复的跨模态修复方法,在合成和真实数据上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24187 2026-06-25 cs.CV 新提交 79%

Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling

面向多模态大语言模型的长视频快速有效理解:自适应准高斯采样

Kun Zhang, Chenxin Fang, Tao Chen, Baiyang Song, Yunhang Shen, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出自适应无训练帧采样方法AdaQ,基于高斯分布3-σ规则动态调整采样区间,在仅用64帧下使Qwen3-VL-8B平均超越GPT4o 15.8%,显著提升长视频理解的鲁棒性和效率。

Comments NeurIPS 2026 submission. 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24404 2026-06-24 cs.CV 新提交 79%

Modality-Aware Out-of-Distribution Detection for Multi-Modal Action Recognition

面向多模态动作识别的模态感知分布外检测

Lars Doorenbos, Duc Manh Vu, Serdar Ozsoy, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习和人工智能研究所)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出一种后处理混合检测器,利用多模态与单模态预测关系及特征空间得分,在推理时显式考虑模态信息,提升多模态分布外检测性能。

Comments Accepted at ECCV '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24248 2026-06-24 cs.CV 新提交 79%

M^2C-EvDet: Multi-Domain Multi-Order Cross-Modal Knowledge Distillation for Event-based Object Detection

M^2C-EvDet:面向事件目标检测的多域多阶跨模态知识蒸馏

Wei Bao, Siqi Li, Shouan Pan, Yi Xie, Yue Gao

机构 * BNRist, THUIBCS, BLBCI, School of Software, Tsinghua University(清华大学软件学院、北京信息科学与技术国家研究中心、清华-英特尔先进计算与智能技术联合研究中心、北京国家区块链与物联网技术研究中心) Yangtze Delta Region Institute, Tsinghua University(清华大学长三角研究院) School of Economics and Management, Beijing Forestry University(北京林业大学经济管理学院)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 提出M^2C-EvDet框架,通过频率学习和超图计算,结合自适应频率解耦特征蒸馏和多阶关系蒸馏,缩小事件数据与帧数据在目标检测上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23593 2026-06-23 cs.RO cs.CV 新提交 79%

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery

机器人辅助手术中的实时多模态活动感知错误检测

Seyed Hamid Reza Roodabeh, Zongyu Li, Homa Alemzadeh

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出统一框架,利用视频、运动学数据和文本提示等多模态输入,通过活动提示和活动感知视觉嵌入,在JIGSAWS和SAR-RARP50数据集上分别提升F1分数达5%和16.6%。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20209 2026-06-19 cs.RO cs.AI 新提交 79%

FlowMaps: Modeling Long-Term Multimodal Object Dynamics with Flow Matching

FlowMaps: 使用流匹配建模长期多模态物体动态

Francesco Argenziano, Miguel Saavedra-Ruiz, Sacha Morin, Charlie Gauthier, Daniele Nardi, Liam Paull

机构 * Sapienza University of Rome(罗马大学) Université de Montréal(蒙特利尔大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出FlowMaps模型,通过潜在流匹配学习物体位置的多模态时空分布,预测动态物体未来位置,提升机器人在变化家庭环境中的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19682 2026-06-19 cs.CV 新提交 79%

Vortex: Multi-Modal Fusion System for Intelligent Video Retrieval

Vortex: 面向智能视频检索的多模态融合系统

Duc-Tho Nguyen, Hieu-Hoc Tran-Minh, Khanh-Hoa Lam, Hoang-Nhut Ly, Huu-Phuc Huynh, Thanh-Tien Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国立大学胡志明市理科大学) Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 提出Vortex系统,融合自适应关键帧提取、多模态元数据生成及混合检索策略(CLIP与SigLIP2的倒数秩融合),结合Rocchio反馈和多阶段时序搜索,在比赛中取得优异成绩。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16580 2026-06-16 cs.LG cs.CV 新提交 79%

Multi-Modal Spatio-Temporal Graph Neural Network with Mixture of Experts for Soil Organic Carbon Prediction

基于专家混合的多模态时空图神经网络用于土壤有机碳预测

Daniele Mos, Felipe Drummond, Anton Bossenbroek, Soufiane el Khinifri

机构 * Spatialise B.V.

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出SpTGNN,一种多模态时空图神经网络,通过异构图注意力、微调基础模型特征提取和稀疏专家混合融合,结合异方差回归与深度集成的不确定性量化,在三个区域数据集上优于XGBoost基线。

Comments Paper is 27 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15026 2026-06-16 cs.CL 新提交 79%

Deep Temporal Modeling and Ensemble Fusion for Multimodal Emotion Recognition from Physiological Signals

基于生理信号的深度时间建模与集成融合多模态情感识别

Desta Haileselassie Hagos, Saurav Keshari Aryal, Patrick Ymele-Leki, Anietie Andy, Legand L. Burge

机构 * Howard University(霍华德大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究评估LSTM、TCN和Transformer在WESAD数据集上的多模态情感识别性能,通过消融实验和传感器级早期融合,并采用晚期融合集成策略,最终集成方法达到98.91%准确率和98.56%宏F1分数。

Comments Accepted for publication in the 17th ACM International Conference on Bioinformatics, Computational Biology and Health Informatics (ACM BCB 2026). DOI: https://doi.org/10.1145/3807503.3819363

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14049 2026-06-15 cs.SD cs.CV 新提交 79%

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

FoleyGenEx: 统一视频到音频生成,具备多模态控制、时间对齐与语义精度

Shiyao Wang, Xijuan Zeng, Hui Wang, Shiwan Zhao, Feng Deng, Chen Zhang, Yong Qin

机构 * Academy for Advanced Interdisciplinary Studies, Nankai University(南开大学前沿交叉学科研究院) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出FoleyGenEx统一框架,通过条件注入、多模态动态掩码和副词数据增强,实现视频到音频生成中多模态控制、帧级时间对齐与细粒度语义的同步合成。

Comments Accepted by INTERSPEECH 2026

Journal ref INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12195 2026-06-11 cs.CV 新提交 79%

InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning

InternVideo3: 用多模态上下文推理代理化基础模型

Ziang Yan, Sheng Xia, Jiashuo Yu, Yue Wu, Tianxiang Jiang, Songze Li, Kanghui Tian, Yicheng Xu, Yinan He, Kai Chen, Limin Wang, Yu Qiao, Yi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出InternVideo3框架,通过多模态上下文推理(MCR)和高效KV缓存压缩方法M^2LA,增强长视频理解与迭代交互能力,在多个基准上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11953 2026-06-11 cs.CL 新提交 79%

Decoding Multimodal Cues: Unveiling the Implicit Meaning Behind Hateful Videos

解码多模态线索:揭示仇恨视频背后的隐含意义

Junyu Lu, Deyi Ji, Liqun Liu, Xiaokun Zhang, Youlin Wu, Roy Ka-Wei Lee, Peng Shu, Huan Yu, Jie Jiang, Bo Xu, Liang Yang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Tencent(腾讯) City University of Hong Kong(香港城市大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 提出IARE框架,通过信息增强和推理优化实现可解释的仇恨视频检测,在Ex-HateMM和Ex-ImpliHateVid数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09907 2026-06-10 cs.LG cs.AI 新提交 79%

LongMoE: Longitudinal Multimodal Learning via Trajectory-Aware Mixture-of-Experts

LongMoE:基于轨迹感知的混合专家模型的纵向多模态学习

Maxx Richard Rahman, Prakhar Kumar, Wolfgang Maass

机构 * German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出LongMoE框架,通过上下文感知插补、注意力标记化、轨迹感知编码和稀疏MoE路由,联合解决临床多模态学习中模态缺失和纵向动态两大挑战,在ADNI等数据集上验证了鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19528 2026-07-23 cs.CV cs.AI 新提交 79%

D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models

D3VL:利用语言模型从3D时间序列数据和视频中理解驾驶场景

Heesang Han, A. Lynn Abbott, Abhijit Sarkar

机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学布拉德利电气与计算机工程系) Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) Sanghani Center for Artificial Intelligence and Data Analytics(桑哈尼人工智能与数据分析中心)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对自动驾驶中多模态大语言模型,提出D3VL框架,整合2D和3D时间序列数据,回答交通场景相关问题,在KITTI问答数据集上性能提升11%,并引入Waymo QA数据集扩展以评估模型在多样驾驶条件下处理3D和时间序列数据的能力。

Comments Accepted to IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22870 2026-06-23 cs.CV cs.AI 新提交 79%

VideoLatent: Video-Language Learning via Latent Self-Forcing

VideoLatent: 通过潜在自强制进行视频-语言学习

Zi-Yuan Hu, Zicong Tang, Shijia Huang, Yanyang Li, Michael R. Lyu, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI(微图AI)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12857 2026-08-14 cs.HC 新提交 78%

PolyPresentation: A Multimodal AI Platform for Slide-Aware Iterative Presentation Practice

PolyPresentation:一种面向幻灯片感知迭代演示练习的多模态AI平台

Chen Chen, Jihao Li, Zhiyuan Wen, Tianhui Zhang, Di Zou, Jiannong Cao

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 该研究针对现有AI演示排练工具缺乏幻灯片关联与迭代练习规划支持的问题,推出PolyPresentation多模态AI平台,经20次学术演示对比验证其能提供更优的演示改进支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07730 2026-08-11 cs.NI 新提交 78%

FedSceneX: Time-to-Target Orchestration for Same-Scene Multimodal Federated Edge Learning

FedSceneX:面向同场景多模态联邦边缘学习的目标时间编排

Dhe Yeong Tchalla, Beining Wu, Jun Huang, Shuyang Gu, Qiang Duan

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 FedSceneX针对同场景多模态联邦边缘学习的轮次耗时不固定问题,提出VHP优化方法,在nuScenes基准测试中缩短每轮次活跃时间,20小时预算内准确率最高且保持全部四种模态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04368 2026-08-06 cs.LG 新提交 78%

EvtGraph: Event-Adaptive Compression for Sparse Temporal Graph Learning in Multimodal Time Series

EvtGraph:面向多模态时间序列稀疏时序图学习的事件自适应压缩方法

Ziqian Wang, Tingxiong Xiao, Yuxiao Cheng, Jinli Suo

机构 * Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本研究针对多模态时序数据均匀离散化效率低的问题,提出EvtGraph框架,通过事件自适应压缩等技术实现预算约束下的高效图学习,在多模态临床等基准上性能优于基线且效率显著提升。

Comments 9 page, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22264 2026-07-27 cs.LG 新提交 78%

Autoregressive EHR Foundation Models with Multimodal Inputs

具有多模态输入的自回归电子健康记录基础模型

Yuxuan Liu, Joshua Placidi, Jinpei Han, Alfred John Balston, Marek Rei, A. Aldo Faisal

专题命中 视频多模态 :multimodal(title);multi-modal(abstract)

AI总结 研究在自回归电子健康记录基础模型中纳入多模态的方法,通过特定模态潜在压缩和门控交叉注意力框架,研究压缩单模态序列及预训练编码器选择对性能的影响,实验表明精心设计架构及临床评估的必要性。

Comments 5 pages excluding references and supplements, 2 figures and 2 tables, Proceedings of the Workshop on Structured Data for Health at the 43rd International Conference on Machine Learning, Seoul, South Korea

Journal ref ICML2026 workshop on Structured Data for Health (SD4H)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16662 2026-07-21 cs.LG 新提交 78%

Multimodal Attention-based Deep Learning for Emergency Triage with Electronic Health Records

基于多模态注意力的深度学习用于电子健康记录的急诊分诊

Hazqeel Afyq Athaillah Kamarul Aryffin, Kamarul Aryffin Baharuddin, Mohd Halim Mohd Noor

机构 * Hospital Universiti Sains Malaysia(马来西亚理科大学医院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 研究旨在提出多模态深度学习架构用于急诊分诊,利用自注意力捕捉特征关系,处理表格和文本数据。用马来西亚理科大学医院急诊科数据集验证,该模型比基线模型在准确率、F-1分数和ROC AUC上均有提升,展现出预测分诊决策的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11570 2026-07-14 cs.RO cs.HC 新提交 78%

ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions

ERR@HRI 3.0 挑战赛:人机交互中错误与预期的多模态检测

Maria Teresa Parreira, Micol Spitale, Maia Stiber, Shiye Cao, Amama Mahmood, Chien-Ming Huang, Hatice Gunes, Wendy Ju

机构 * Cornell University(康奈尔大学) Microsoft Research(微软研究院) Johns Hopkins University(约翰霍普金斯大学) University of Cambridge(剑桥大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 ERR@HRI 3.0 挑战赛提供自然场景视频数据集,供研究者开发多模态机器学习模型检测人机交互错误与预期,三个团队提交的有效模型超卷积神经网络基线,为构建相关检测系统提供了数据、任务、基线及结果等参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09114 2026-07-13 cs.CV cs.AI cs.MM 新提交 78%

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms

基于事件流的多模态视频异常检测:一个基准数据集和算法

Peipei Zhu, Yueqing Niu, Lin Zhu, Guanchong Niu, Yang Yu, Zheng Li

机构 * College of Pharmaceutical Engineering of Traditional Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学中药制药工程学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究院) State Key Laboratory of Component-based Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学组分中药国家重点实验室)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.AI、cs.MM

AI总结 该研究针对视频异常检测在复杂条件下的局限性,提出EVAD框架,利用事件相机与传统视频。构建大规模基准数据集,设计对比多模态预训练框架及自适应融合模块,实验验证了该方法在现实场景中检测VAD的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08073 2026-07-10 cs.LG eess.SP 新提交 78%

Cross-Modal Generative Framework for Signal Translation from Fetal-Maternal Electrocardiograms to Fetal Doppler Waveforms

用于从胎儿-母亲心电图到胎儿多普勒波形信号转换的跨模态生成框架

Tongli Su, Alireza Rafiei, Marly van Assen, Reza Sameni, Gari D. Clifford, Faezeh Marzbanrad, Nasim Katebi

机构 * Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) Monash University(莫纳什大学)

专题命中 视频多模态 :cross-modal(title,abstract)

AI总结 该研究针对胎儿-母亲心血管系统关系建模问题提出跨模态生成框架,结合扩张卷积、跨模态注意力及自注意力,经训练可从双导联心电图合成多普勒包络,降低误差,量化母婴耦合贡献,推进了相关计算建模及胎儿评估。

Comments Accepted for oral presentation at IEEE EMBC 2026. 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26626 2026-06-26 cs.HC 新提交 78%

Reviving Reflection-in-Action: Instilling Designerly Thinking in AI-Supported Ideation through Multimodal Prompting

复兴反思行动:通过多模态提示在AI支持的构思中注入设计思维

Samangi Wadinambiarachchi, Jenny Waycott, Greg Wadley

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 针对当前AI创造力支持工具主要依赖文本提示的局限,提出SketchifAI原型,通过多模态输入(文本、草图、草图加标签)增强设计学生的表达意图、创造力支持和发散思维,发现草图模态提升流畅性但用户偏好文本,探讨如何通过草图反思保留设计技能。

Comments ACM Creativity and Cognition 2026 conference (C&C'26)

详情

展开后加载摘要…

URL PDF HTML 收藏