arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-09 至 2026-07-09 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 9 篇

2607.07091 2026-07-09 cs.CV cs.AI 新提交 81%

AT-Attn: Temporal-Aware Cross-Attention for Longitudinal Multimodal Alzheimer's Disease Diagnosis

AT-Attn:用于纵向多模态阿尔茨海默病诊断的时间感知交叉注意力机制

Xinyue Du, Yibo Liu, Zhenglei Zhou, Xuancheng Yao, Weimin Zhong, Qiuhui Chen

机构 * Xinyue Du1, Yibo Liu2, Zhenglei Zhou3, Xuancheng Yao2, Weimin Zhong1, Qiuhui Chen14(未知)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对纵向AD诊断中多模态信息整合难题,提出AT-Attn框架,结合多种技术整合MRI与临床信息,在患者级五折交叉验证中,该模型多项指标优于单模态和简单融合基线,为AD诊断提供临床相关补充信息。

Comments Submitted to IEEE BIBM 2026. 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26772 2026-07-09 cs.CV cs.AI cs.CY 版本更新 81%

From Content to Audience: A Multimodal Annotation Framework for Broadcast Television Analytics

从内容到受众:一种多模态注释框架用于广播电视分析

Paolo Cupini, Francesco Pierri

机构 * Dipartimento di Elettronica, Informazione e Bioingegneria, Politecnico di Milano, Italy(意大利米兰理工大学电子、信息与生物工程系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种多模态注释框架,用于广播电视内容分析,通过构建特定领域的基准测试,评估不同管道架构在广播新闻中的表现,展示了框架在受众分析中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09385 2026-07-09 cs.CV 版本更新 79%

EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation

EventVGGT:探索跨模态蒸馏以实现一致的基于事件的深度估计

Yinrui Ren, Jinjing Zhu, Kanghao Chen, Zhuoxiao Li, Jing Ou, Zidong Cao, Tongyan Hua, Peilun Shi, Yingchun Fu, Wufan Zhao, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(珠海)) CUHK(香港中文大学) SCNU(华南师范大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 EventVGGT通过跨模态蒸馏实现一致的基于事件的深度估计,有效提升深度预测精度和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06996 2026-07-09 cs.HC 新提交 71%

Multimodal Smart Glove for Sign Language Recognition Using Deep Learning

基于深度学习的用于手语识别的多模态智能手套

Anh Thu Nguyen Ngoc, Tam Phong Truong, Thai Anh Nguyen Duong, Vu Linh Nguyen, Manh Duong Phung

专题命中 视频多模态 :multimodal(title)

AI总结 研究旨在解决手语识别系统实际部署难题,提出集成可穿戴传感与深度学习的智能手套系统,利用柔性传感器、IMU及摄像头采集数据,经LSTM网络处理,准确率约95%,模型转换后可实时推理,证明系统用于手语翻译的可行性。

Comments In Proceedings of IFToMM International Symposium on Robotics and Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03834 2026-07-09 cs.RO 版本更新 67%

Let the Dynamics Flow: Stable Flow Matching Dynamical Systems

让动力学流动:稳定的流匹配动力系统

Rodrigo Pérez-Dattari, Francisco Leiva, Andrea Testa, Leonel Rozo, Javier Ruiz del Solar, Noémie Jaquier

机构 * Department of Robotics, Perception, and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院) Advanced Mining Technology Center (AMTC) and Department of Electrical Engineering, Universidad de Chile(先进采矿技术中心(AMTC)和电气工程系,智利大学) Bosch Center for Artificial Intelligence, Renningen, Germany(博世人工智能中心,德国Renningen) Italian Institute of Artificial Intelligence (AI4I), Turin, Italy(意大利人工智能研究所(AI4I),意大利都灵)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 提出稳定流匹配动力系统(SFMDS)框架,通过流匹配参数化动力系统并施加李雅普诺夫稳定性约束,实现稳定、可扩展、多模态的机器人运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07292 2026-07-09 cs.CV cs.AI 新提交 62%

CarbonCLIP: Enhance Carbon Prediction from Satellite Imagery via Integrated Street-View Semantics and Temporal Context Training

CarbonCLIP:通过集成街景语义和时间上下文训练增强卫星图像的碳排放预测

Zeru Yang, Fang-Ying Gong, Steve H. L. Yim, Chau Yuen

机构 * Energy Research Institute at NTU(国立理工学院能源研究所) Interdisciplinary Graduate Programme(跨学科研究生项目) School of Electrical and Electronic Engineering(电气电子工程学院) School of Public Administration and Policy(公共管理与政策学院) Asian School of the Environment(亚洲环境学院) Center for Climate Change and Environmental Health(气候变化与环境健康中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对城市碳排放预测难题,CarbonCLIP提出多模态蒸馏框架,通过双分支对比学习,利用街景语义和时间上下文训练增强卫星图像碳排放预测,实验证明该方法优于基线,为卫星碳建模提供有力支持。

Comments Accepted by IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing. 21 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07518 2026-07-09 cs.CV 新提交 57%

Learning to Unify Deformable Shape and Texture Representations for Cardiac Video Classification

学习统一可变形形状和纹理表示用于心脏视频分类

Tonmoy Hossain, Miaomiao Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对心脏视频分类,现有方法简单拼接形状与纹理特征未充分利用互补性。本文提出新模型,在综合空间学习时间特征,设计双向交叉注意力融合特征,能动态调整贡献,在CMR视频数据集上达最优性能,提高了可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07001 2026-07-09 cs.CV 新提交 57%

Ego-Human Motion Prediction with 3D-Aware LLM

基于3D感知语言模型的自我-人类运动预测

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06875 2026-07-09 cs.CV cs.LG 新提交 57%

Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild

Video2Reaction:将视频映射到自然环境中的观众反应分布

Trang Nguyen, Sidong Zhang, Shiv Shankar, Gauri Jagatap, Deepak Chandran, Andrea Fanelli, Madalina Fiterau

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在通过Video2Reaction数据集实现视频到观众反应分布预测,开发仅用开源语言模型的两阶段多智能体管道,建立基准,发现预训练模型零样本失败,微调可提升性能,但任务仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏