arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-20 至 2026-07-20 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 12 篇

2607.15689 2026-07-20 cs.CV 新提交 89%

Efficient Frame Selection for Long Videos at Test Time with Attention-Based MLLM Selectors

基于注意力的MLLM选择器在测试时对长视频进行高效帧选择

Yilin Wang, Xiangxi Zheng, Dongxing Mao, Linjie Li, Zhengyuan Yang, Ping Yu, Rui Yan, Yuan Yao, Alex Jinpeng Wang

机构 * ZJU(浙江大学) NJU(南京大学) CSU(中南大学) Microsoft(微软公司) NJUST(南京理工大学)

专题命中 视频多模态 :MLLM(title,title_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 85%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 视频多模态 :MLLM(summary_cn,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15794 2026-07-20 cs.CV cs.AI 新提交 84%

On the Geometry of Learned Representations in Event-Based Multi-Modal Egomotion Estimation

基于事件的多模态自我运动估计中学习表征的几何结构研究

Stefano Silvestrini, Michele Ceresoli

机构 * Politecnico di Milano(米兰理工大学)

专题命中 视频多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究基于事件的多模态自我运动估计中多模态网络的几何结构,通过跨模态注意力架构融合多模态信号并训练,分析潜在空间几何和注意力动态,揭示相关特性,架起分析估计理论与数据驱动融合的桥梁。

Comments 5 pages, 3 figures, to be published in SPAICE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15361 2026-07-20 hep-ex 新提交 71%

Mitigating Detector Ageing Effects with Graph-Based Multi-Modal Track Reconstruction at Belle II

在 Belle II 中使用基于图的多模态轨道重建减轻探测器老化效应

Lea Reuter, Tristan Brandes, Giacomo De Pietro, Torben Ferber

专题命中 视频多模态 :multi-modal(title)

AI总结 研究 Belle II 探测器老化对轨道寻找的影响,采用基于图神经网络的算法,将轨道寻找设为全局关系聚类问题,经全探测器模拟评估性能,结果显示该算法在探测器老化时能提高鲁棒性,稳定跟踪性能。

Comments proceedings for Connecting The Dots 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16193 2026-07-20 cs.CV 新提交 70%

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

认识自我,理解世界:用于基于多模态大语言模型的无人机时空推理的双认知基准测试

Like Liu, Zhengzheng Xu, Haitao He, Hongzhe Li, Shuchang Zhang, Dian Shao

机构 * Northwestern Polytechnical University(西北工业大学) China University of Petroleum(中国石油大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 该研究针对多模态大语言模型在无人机场景双认知能力评估不足的问题,提出UAV-DualCog基准测试,涵盖图像和视频任务,通过自动化管道构建数据,评估发现现有模型存在瓶颈,该基准测试有价值。

Comments 11 pages, 4 figures, 7 tables. Project website: https://uav-dualcog.lozumi.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15038 2026-07-20 cs.CV 版本更新 70%

Video = World + Event Stream

视频 = 世界 + 事件流

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 研究提出Wan-Streamer v0.3,将视频视为世界加事件流,据此有通用预训练任务,应用于实时全双工视听交互,保留v0.2运行点,为实时下游任务提供能力。

Comments website: https://wan-streamer.com/v0.3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15768 2026-07-20 cs.CV cs.AI 新提交 62%

GeoChrono: Benchmarking and Rethinking Long-Term Temporal Understanding in Remote Sensing

GeoChrono:遥感中长期时间理解的基准测试与重新思考

Yujie Li, Jiancheng Pan, Zhiwei Wei, Jiuniu Wang, Mugen Peng, Wenjia Xu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Hunan Normal University(湖南师范大学) City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究针对遥感中长期时间理解缺乏系统评估的问题,引入ChronoBench基准。基于评估结果提出GeoChrono模型,设计相关编码器和压缩器并构建训练数据集,该模型在基准测试中性能领先,压缩器有效减少视觉令牌。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30534 2026-07-20 cs.CV 版本更新 57%

Orca: The World is in Your Mind

Orca: 世界在你心中

Yihao Wang, Yuheng Ji, Mingyu Cao, Yanqing Shen, Runze Xiao, Huaihai Lyu, Senwei Xie, Euan Liu, Klara Tian, Tianfeng Long, Yichi Zhang, Zhengliang Cai, Ruike Chen, Jifan Zhao, Ruochuan Shi, Zihan Tang, Jing Lyu, Wenxing Tan, Ningbo Zhang, Yangtao Hu, Yuming Gao, Xiansheng Chen, Junkai Zhao, Congsheng Xu, Boan Zhu, Ziqi Wang, Yupu Feng, Qiongqiong Zhang, Yingli Zhao, Yulong Ao, Shaoxuan Xie, You Liu, Guocai Yao, Leiduo Zhang, Xiaodan Liu, Yunyan Zhang, Yance Jiao, Xinyan Yang, Jiaxing Wei, Xu Liu, Tengfei Pan, Shaokai Nie, Chunlei Men, Sen Cui, Xiaojie Jin, Hongyang Li, Jianlan Luo, Yao Mu, Yunchao Wei, Jun Yan, Hang Zhao, Xiaolong Zheng, Jiaming Li, Yonghua Lin, Tiejun Huang, Zhongyuan Wang, Pengwei Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Orca通用世界基础模型,通过无意识学习和有意识学习两种互补范式,从多模态世界信号中学习统一的世界潜在空间,并支持文本生成、图像预测和具身动作生成等下游任务。

Comments Project page: https://orca-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15628 2026-07-20 eess.IV 新提交 50%

MSTF-Net: A UAV-Oriented Multi-Spectral Video Segmentation Method via Modality-Robust, Scale-Adaptive, and Consistent Fusion

MSTF-Net:一种通过模态稳健、尺度自适应和一致融合的面向无人机的多光谱视频分割方法

Chenwei Wang, Zhida Wang, Zelin Li, Elif Ozden-Yenigun, Houde Liu

专题命中 视频多模态 :cross-modal(abstract)

AI总结 研究针对无人机多光谱视频分割面临的模态融合困境和时间变化问题,提出MSTF-Net框架,通过模态稳健、尺度自适应融合有效建模跨模态融合与时间一致性,在公共数据集实验中取得出色分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16050 2026-07-20 cs.LG 新提交 50%

DELUGE: Towards Continental-Scale Daily Pluvial Flood Damage Prediction via Interpretable Conditioning on Foundation Model Embeddings

DELUGE:通过基础模型嵌入的可解释条件实现大陆尺度每日暴雨洪水灾害预测

Yuya Kawakami, Daniel Cayan, Dongyu Liu, Kwan-Liu Ma, Tom Corringham

机构 * University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对美国暴雨洪水难预测及现有方法局限问题,提出DELUGE多模态深度学习框架,通过对特定单元格建模,利用参数模块结合基础模型嵌入实现可解释预测,在PR - AUC指标上优于基线,且该条件设定方案可用于其他地理空间预测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15880 2026-07-20 cs.RO cs.LG 新提交 50%

Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation

用于泛化到未见机器人操作的动力学感知元模仿

Zhenduo Shang, Xiyao Liu, Bohan Li, Xudong Wang, Teng Ren, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所机器人学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Shenyang University of Technology(沈阳工业大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对机器人模仿学习的数据稀缺与环境泛化问题,提出动力学感知元模仿(DAMI)框架,通过整合元学习、引入视觉运动轨迹模块等方法,有效捕捉任务动力学,在模拟和真实场景实验中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14194 2026-07-20 eess.SP cs.LG cs.SY eess.SY 版本更新 50%

Boosted Enhanced Quantile Regression Neural Networks with Spatiotemporal Permutation Entropy for Complex System Prognostics

增强型分位数回归神经网络与时空排列熵用于复杂系统预测

David J Poland

机构 * University of Hertfordshire(赫特福德大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种基于时空排列熵分析与增强型分位数回归神经网络的新型框架,用于模式预测和系统预测。通过结合基于熵的复杂性度量与先进神经架构,实现多维系统复杂动态模式的理解,提升预测精度和不确定性量化能力。

Comments Preliminary version of a predictive maintenance framework using spiking neural networks and entropy-based analysis. To be expanded in future publications with hardware implementations and real-time drift detection modules. arXiv admin note: substantial text overlap with arXiv:2501.05087

详情

展开后加载摘要…

URL PDF HTML 收藏