arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-08 至 2026-07-08 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 8 篇

2607.05971 2026-07-08 cs.MM cs.SD 新提交 83%

Multimodal Video-to-Music Recommendation via Semantic Retrieval and Temporal Reranking

通过语义检索和时间重排实现多模态视频到音乐推荐

Seungheon Doh, Minhee Lee, Sangmoon Lee, Ben Sangbae Chon, Juhan Nam

机构 * Graduate School of Culture Technology, KAIST(韩国釜山科学技术大学文化科技研究生院) Gaudio Lab, Inc(Gaudio实验室)

专题命中 视频多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM

AI总结 提出用于视频到音乐推荐的两阶段框架VTMR,第一阶段通过全局嵌入检索语义兼容候选,第二阶段关注时间序列重排。实验显示该框架能提升推荐效果,人类偏好研究表明其在总体偏好上与商业基线相当,音乐质量优于生成基线。

Comments Accepted for publication at The Machine Learning for Audio workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05093 2026-07-08 cs.CV 新提交 70%

Video-Text Temporal Localization via Multi-Scale Convolution and Dynamic Routing

通过多尺度卷积和动态路由实现下一代网络的语义视频通信

Gengtian Shi, Jinze Yu, Chenhao Wu, Shaofei Wang, Eiji Fukuzawa, Junjie Tang, Hiroshi Onoda, Jiang Liu

机构 * Graduate School of Fundamental Science and Engineering, Waseda University(早稻田大学基础科学与工程研究生院) Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成人工智能创新中心) Amazon(亚马逊)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对视频流量增长需求,提出语义视频通信框架,用多尺度时间卷积编码器捕捉运动模式,基于胶囊的动态路由机制优化关联,多任务学习统一组件,在实验中取得显著改进。

Comments Accepted at the AAAI 2026 Workshop on AI for Time Series (AI4TS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01884 2026-07-08 cs.AI 版本更新 70%

EVA-Net: Subject-Independent EEG Motor Decoding with Video-Derived Motor Priors

EVA-Net: 基于视频衍生运动先验的跨被试脑电运动解码

Ziyuan Li, Yueru Sun, Yimeng Zhang

机构 * South China University of Technology(华南理工大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出EVA-Net两阶段框架,利用动作视频作为语义先验,通过跨模态对比学习和对齐减少个体差异,实现跨被试脑电运动解码,在EEGMMI上取得8.66%的LOSO准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08435 2026-07-08 cs.CV cs.AI 版本更新 62%

HST-HGN: Heterogeneous Spatial-Temporal Hypergraph Networks with Bidirectional State Space Models for Global Fatigue Assessment

HST-HGN:基于双向状态空间模型的异构空间-时间超图网络用于全局疲劳评估

Changdao Chen, Qinqiuhong Ye, Hao Chen, Jinyu Wang

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HST-HGN,通过双向状态空间模型和异构空间-时间超图网络,有效建模长程时序依赖,实现对驾驶员疲劳的高效评估,兼顾判别力与计算效率,适用于实时车载边缘部署。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05994 2026-07-08 cs.CV 新提交 57%

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

SparseCtrl-HOI:用于人机交互视频生成的稀疏时间控制

Shenbo Xie, Mingrui Cai, Xu Yang, Yifei Liu, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对人机交互视频生成中建模物理动力学及时空协调复杂、现有方法依赖密集指导成本高且影响多样性的问题,提出SparseCtrl-HOI框架,用关键帧结合新机制和模块控制,构建数据集,降低标注开销,提升直播电商视频质量。

Comments ECCV 2026, Project Page: https://mpi-lab.github.io/SparseCtrl-HOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05855 2026-07-08 cs.LG cs.AI 新提交 57%

Unsupervised Anomaly Detection of Information Operations Users via Behavioral and Language Patterns

通过行为和语言模式对信息操作用户进行无监督异常检测

Sishun Liu, Sajal Halder, Ke Deng, Yan Wang, Xiuzhen Zhang

机构 * RMIT University(皇家墨尔本理工大学) Macquarie University(麦考瑞大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对社交媒体网络信息操作检测难题,提出无监督方法TENSOR,利用多模态数据,通过训练时间点过程捕捉异常行为模式,并引入新证据函数调整输出,在五个真实数据集上表现优于基线。

Comments Accepted at ECML/PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13808 2026-07-08 cs.CV 版本更新 57%

VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models

VisCoP:用于视觉语言模型视频域适应的视觉探测

Dominick Reilly, Manish Kumar Govind, Le Xue, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学查塔努加分校) Elorian AI(Elorian人工智能公司)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型在新领域性能下降问题,提出参数高效的VisCoP框架,通过可学习视觉探测器增强视觉编码器,在多种适应设置下评估,该框架优于现有策略,能有效适应新领域且保留源域能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06215 2026-07-08 quant-ph cond-mat.mes-hall 新提交 50%

Coherence Estimation Beyond the Liouvillian Gap in a Finite Nonequilibrium System

有限非平衡系统中超越刘维尔间隙的相干性估计

Sonali Brahma, Trishna Kalita, Himangshu Prabal Goswami

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究有限量子系统与热库相互作用时热库诱导相干性的估计,通过分析刘维尔本征谱证明最优传感窗口源于模式竞争,刘维尔间隙倒数与最优传感时间无一般缩放关系,耦合系统到量子腔可转变为稳态资源。

Comments Suggestions on references are welcome along with other suggestions or comments

详情

展开后加载摘要…

URL PDF HTML 收藏