arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-17 至 2026-04-17 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 12 篇

2604.15312 2026-04-17 cs.CV 79%

Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo

双向跨模态提示用于事件-帧不对称立体

Ninghui Xu, Fabio Tosi, Lihui Wang, Jiawei Han, Luca Bartolomei, Zhiting Yao, Matteo Poggi, Stefano Mattoccia

机构 * School of Instrument Science and Engineering, Southeast University, State Key Lab of Comprehensive PNT Network and Equipment Technology, Key Lab of Micro-Inertial Instrument and Advanced Navigation Technology, MOE(仪器科学与工程学院,东南大学,综合PNT网络与设备技术国家重点实验室,微惯性仪器与先进导航技术重点实验室,教育部) Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学) College of Computer Science and Software Engineering, Hohai University(计算机科学与软件工程学院,河海大学) Beijing Institute of Technology(北京理工大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出Bi-CMPStereo框架,通过双向跨模态提示利用语义和结构特征实现稳健匹配,提升高速运动和复杂光照下的3D感知性能。

Comments CVPR 2026. Code URL: https://github.com/xnh97/Bi-CMPStereo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14766 2026-04-17 eess.SP cs.AI 79%

Temporal Cross-Modal Knowledge-Distillation-Based Transfer-Learning for Gas Turbine Vibration Fault Detection

基于时间跨模态知识蒸馏的转移学习用于燃气轮机振动故障检测

Ali Bagheri Nejad, Mahdi Aliyari-Shoorehdeli, Abolfazl Hasanzadeh

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出基于时间跨模态知识蒸馏的转移学习框架,解决燃气轮机振动故障检测中时间上下文不足和数据稀缺问题,提升特征分离度和诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15602 2026-04-17 cs.CV 79%

TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?

TennisTV: 多模态大语言模型能否理解网球发球?

Zhongyuan Bao, Lejun Zhang

机构 * New York University(纽约大学) Tandon School of Engineering(坦顿工程学院) Shanghai, China(上海,中国) New York, USA(纽约,美国)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 TennisTV是首个全面评估网球视频理解的基准,通过模拟发球过程中的连续击球事件,评估17种大语言模型在网球视频理解中的表现,发现帧采样密度需平衡且需提升时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05418 2026-04-17 cs.CV cs.AI 79%

VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG

VideoStir:通过时空结构化和意图感知的RAG理解长视频

Honghao Fu, Miao Xu, Yiwei Wang, Dailing Zhang, Jun Liu, Yujun Cai

机构 * University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校) Institute of Automation, CAS(中国科学院自动化研究所) Lancaster University(兰卡斯特大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VideoStir通过构建时空图和意图相关性评分器,改进长视频RAG框架,实现基于意图的结构化推理,无需辅助信息即可竞争现有最佳基线。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04567 2026-04-17 cs.CV 77%

All Changes May Have Invariant Principles: Improving Ever-Shifting Harmful Meme Detection via Design Concept Reproduction

所有变化可能都有不变原则:通过设计概念再现改进永动有害迷因检测

Ziyou Jiang, Mingyang Li, Junjie Wang, Yuekai Huang, Jie Huang, Zhiyuan Chang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory Institute of Software Chinese Academy of Sciences(软件研究所信息集成系统技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出RepMD方法,通过设计概念再现检测不断变化的有害迷因,利用攻击树定义设计概念图,并指导多模态大语言模型提高检测准确率。

Comments 19 pages, 11 figures, 9 tables accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14630 2026-04-17 cs.CV cs.LG 74%

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation

CMTM:跨模态令牌调制用于无监督视频对象分割

Inseok Jeon, Suhwan Cho, Minhyeok Lee, Seunghoon Lee, Minseok Kang, Jungho Lee, Chaewon Park, Donghyeong Kim, Sangyoun Lee

机构 * Yonsei University, Republic of Korea(延世大学,韩国)

专题命中 视频多模态 :cross-modal(title);分类 cs.CV

AI总结 本文提出CMTM方法,通过跨模态令牌调制增强外观与运动提示的交互,实现高效的多模态信息传播,取得最佳性能。

Comments 6 pages, 5 figures. Accepted to IEEE ICIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13426 2026-04-17 cs.CV cs.AI 73%

Event-Adaptive State Transition and Gated Fusion for RGB-Event Object Tracking

事件自适应状态转移与门控融合用于RGB-事件对象跟踪

Jinlin You, Muyu Li, Xudong Zhao

机构 * Dalian University of Technology(大连理工大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MambaTrack框架,通过动态状态空间模型解决RGB-事件跟踪中静态状态转移矩阵导致的跨模态融合鲁棒性下降问题,引入事件自适应状态转移和门控投影融合模块,提升稀疏与密集事件流的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15308 2026-04-17 cs.CV 57%

RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework

RAD-2: 在生成器-判别器框架中扩展强化学习

Hao Gao, Shaoyu Chen, Yifan Zhu, Yuehao Song, Wenyu Liu, Qian Zhang, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 RAD-2提出了一种生成器-判别器框架,通过扩散生成器生成轨迹候选并利用RL优化判别器评估长期驾驶质量,从而提升闭环规划的稳定性与安全性,实验显示碰撞率降低56%。

Comments Project page: https://hgao-cv.github.io/RAD-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19130 2026-04-17 cs.MM 57%

Dual-Stream Decoupled Learning for Temporal Consistency and Speaker Interaction in AVSD

双流解耦学习用于AVSD中的时间一致性和说话人交互

Junhao Xiao, Shun Feng, Zhiyu Wu, Jinghan Yu, Haibiao Yao, Zhiyuan Ma, Jianjun Li, Youjun Bao, Yi Chen

专题命中 视频多模态 :audio-visual(abstract);分类 cs.MM

AI总结 本文提出D$^2$Stream双流框架,通过解耦时间连续性和人际交互任务,提升AVSD性能,实现95.6%的mAP和更广的泛化能力。

Comments Submitted to ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00998 2026-04-17 cs.CV 57%

Large Vision Model-Guided Masked Low-Rank Approximation for Ground-Roll Attenuation

大视觉模型引导的掩码低秩近似用于地面滚动生成消减

Jiacheng Liao, Feng Qian, Ziyin Fan, Yongjian Guo

机构 * School of Information and Communication Engineering, Center for Information Geoscience, University of Electronic Science and Technology of China(信息与通信工程学院,信息科学研究院,电子科学与技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于大视觉模型引导的掩码低秩近似框架,通过多模态提示生成精细掩码,结合全局和局部低秩约束,有效消减地面滚动生成并抑制信号泄漏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17493 2026-04-17 physics.plasm-ph 50%

DustNET: enabling machine learning and AI models of dusty plasmas

DustNET: 使尘埃等离子体的机器学习和人工智能模型成为可能

Zhehui Wang, Justin C. Burton, Niklas Dormagen, Cheng-Ran Du, Yan Feng, John E. Foster, Susan S. Glenn, Max Klein, Christina A. Knapek, Lorin Matthews, André Melzer, Edward Thomas, Chuji Wang, Jalaan Avritte, Shan Chang, Neeraj Chaubey, Pubuduni Ekanayaka, John A. Goree, Truell Hyde, Chen Liang, Zhuang Liu, Zhuang Ma, Ilya Nemenman, Elon Price, A. S. Schmitz, Mike Schwarz, Saikat C. Thakur, M. H. Thoma, Hubertus M. Thomas, L. Wimmer, Wei Yang, Zimu Yang, Xiaoman Zhang

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文探讨了DustNET框架,通过整合实验、模拟和合成数据,利用机器学习和人工智能方法,实现尘埃等离子体的多尺度预测和不确定性量化。

Comments 61 pages, 35 figures, 490+ references

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01728 2026-04-17 cs.RO cs.LG cs.LO 50%

Constrained Decoding for Safe Robot Navigation Foundation Models

安全机器人导航基础模型的约束解码

Parv Kapoor, Akila Ganlath, Michael Clifford, Changliu Liu, Sebastian Scherer, Eunsuk Kang

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出SafeDec框架,通过约束解码确保机器人导航基础模型满足信号时间逻辑规范,提升安全性和行动生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏