arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-02 至 2026-07-02 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 10 篇

2605.00271 2026-07-02 cs.CV cs.AI cs.RO 版本更新 81%

REALM: An RGB- and Event-Aligned Latent Manifold for Cross-Modal Perception

REALM:一种RGB和事件对齐的潜在流形用于跨模态感知

Vincenzo Polizzi, David B. Lindell, Jonathan Kelly

机构 * University of Toronto, Robotics Institute(多伦多大学机器人研究所) University of Toronto, Department of Computer Science(多伦多大学计算机科学系)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 REALM通过将事件表示投影到预训练的RGB基础模型潜在空间,实现跨模态感知,利用LoRA技术解锁冻结RGB主干的几何和语义先验,实现零样本应用复杂解码器。

Comments Accepted to the European Conference on Computer Vision (ECCV), Malmö, SE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28369 2026-07-02 cs.IR cs.AI 版本更新 79%

Multimodal and Multiscale Spatial-Temporal Semantic Search and Recommendation with AI Foundation Models

基于AI基础模型的多模态与多尺度时空语义搜索与推荐

Yuanyuan Tian, Wenwen Li, Xiao Chen, Michael Brook, Michael Brubaker, Anna Liljedahl, Chitta Baral

机构 * School of Geographical Sciences and Urban Planning, Arizona State University(地理科学与城市规划学院,亚利桑那州立大学) Alaska Native Tribal Health Consortium(阿拉斯加原住民部落健康联盟) Woodwell Climate Research Center(伍德沃德气候研究中心) School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出融合大语言模型和视觉-语言模型的框架,通过CAMERA算法融合文本与视觉信息生成更丰富嵌入,以及ASTRA算法结合尺度依赖的时空相关性与语义相似性进行重排序,在环境事件文档检索中优于单模态方法。

Comments 17 pages, accepted for publication in the ACM Transactions on Spatial Algorithms and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10180 2026-07-02 cs.CV 版本更新 74%

TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval

TCMA:面向无人机跨模态文本-视频检索的文本条件多粒度对齐

Zixu Zhao, Yang Zhan, Yunhao Li, Yan Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学)

专题命中 视频多模态 :cross-modal(title);分类 cs.CV

AI总结 针对无人机视频检索中数据集粗粒度、冗余标注问题,构建细粒度多样化标注数据集DVTMD,并提出文本条件多粒度对齐框架TCMA,实现全局-局部多层级对齐,在无人机文本-视频检索任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00858 2026-07-02 cs.CV cs.LG 新提交 70%

MoVA: Learning Asymmetric Dual Projections for Modular Long Video-Text Alignment

MoVA: 面向模块化长视频-文本对齐的非对称双投影学习

Peiyuan Zhu, Shaoan Xie, Zijian Li, Yifan Shen, Namrata Deka, Harsh Shrivastava, Guangyi Chen, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 针对视频-文本对比学习中时间错位和语义不对称问题,提出MoVA框架,通过非对称双投影(文本侧自适应选择帧感知子空间,视频侧解缠文本相关视觉概念)实现灵活对齐,在多个任务上超越现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00902 2026-07-02 cs.CV 新提交 57%

MG-RWKV: Multi-Grained Context-Aware RWKV for Temporal Forgery Localization

MG-RWKV:用于时序伪造定位的多粒度上下文感知RWKV

Jingchen Ni, Cangjin Yu, Dan Jiang, Quan Zhang, Keyu Lv, Shannan Yan, Linyue Pan, Ke Zhang, Chun Yuan

机构 * Tsinghua University(清华大学) Soochow University(苏州大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

AI总结 提出MG-RWKV框架,利用RWKV的数据依赖状态演化实现O(T)复杂度的全序列处理,通过双向RWKV、多粒度专家混合和跨粒度一致性机制,在低计算成本下达到时序伪造定位任务的最优性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00654 2026-07-02 cs.CV 新提交 57%

Linguistic Relative Policy Optimization for Video Anomaly Reasoning

语言相对策略优化用于视频异常推理

Jiaxu Leng, Jiankang Zheng, Mengjingcheng Mo, Zhanjie Wu, Haosheng Chen, Ji Gan, Xinbo Gao

机构 * Chongqing College of Artificial Intelligence(重庆人工智能学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出语言相对策略优化(LRPO),通过从多个推理轨迹中提取群体相对语义优势,构建语言表达的异常经验先验,无需参数更新即可引导模型输出,在无调参设置下显著超越现有方法。

Comments Accepted at ICML 2026; 18 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00410 2026-07-02 cs.CV cs.LG 新提交 57%

MindAU: EEG-Conditioned Facial Action Unit Editing via Dual-Stream Manifold Alignment

MindAU: 基于双流流形对齐的脑电条件面部动作单元编辑

Zhenhang Li, Xin Zhou, Hao Deng, Lijun Yin

机构 * Binghamton University(宾汉姆顿大学) Massachusetts General Hospital(马萨诸塞综合医院) Harvard Medical School(哈佛医学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出MindAU框架,通过双流流形对齐将EEG特征与AU文本语义和视觉位移对齐,实现高保真身份保持的面部动作单元编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00124 2026-07-02 cs.CV 新提交 57%

Segmenting, Fast and Slow: Real-Time Open-Vocabulary Video Instance Segmentation with Dual-Path Processing

分割,快与慢:双路径处理的实时开放词汇视频实例分割

Luca Barsellotti, Martin Sundermeyer, Mattia Segu, Nikita Araslanov, Muhammad Ferjad Naeem, Marcella Cornia, Yongqin Xian, Maxim Berman

机构 * Google TU Munich(谷歌慕尼黑分校) Munich Center for Machine Learning University of Modena(慕尼黑机器学习中心莫德纳大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出SegFS双流快慢框架,通过稀疏关键帧的开放词汇对象模型预测实例表示,并在特征空间条件化轻量快速网络,实现高效时域传播,在保持分割性能的同时将延迟降低至MOBIUS的1/14。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31529 2026-07-02 cs.CV 版本更新 57%

SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence

SVI-Bench: 一个用于战略视频智能的动态微世界

Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo Torresani, Gedas Bertasius

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Northeastern University(东北大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SVI-Bench,一个基于团队体育动态微世界的大规模基准,通过四个层级(动态场景理解、因果推理、战略模拟、智能体合成)的9个任务评估视频智能从感知到战略规划的能力,发现模型在感知任务上表现良好但在认知层级上性能急剧下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04198 2026-07-02 cs.CV cs.RO 版本更新 57%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏