arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-04 至 2026-08-04 共收录 19 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 19 篇

2608.02324 2026-08-04 cs.CV 新提交 83%

Implicit Neural Representations for Multimodal Longitudinal Image Imputation and Interpolation

用于多模态纵向图像插补与插值的隐式神经表示

Sina Wendrich, Lukas Förner, Zoe Reinke, Kartikay Tehlan, Ansgar Berlis, Michael Frühwald, Matthias Wagner, Thomas Wendler

机构 * University Hospital Augsburg(奥格斯堡大学医院) University of Augsburg(奥格斯堡大学) Technical University of Munich(慕尼黑工业大学) Bavarian Cancer Research Center (BZKF)(巴伐利亚癌症研究中心) Swabian Children’s Cancer Center(施瓦本儿童癌症中心)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 该研究针对临床纵向MRI数据缺失等问题,提出条件隐式神经表示模型,经儿科脑肿瘤数据验证,可显著改进插值效果,置信度估计可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01827 2026-08-04 cs.CV cs.AI 新提交 81%

DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents

DeepVoyager-VL:为长视野多模态智能体激励视觉在环搜索

Huanyao Zhang, Jiepeng Zhou, Runhao Zhao, Yanzhe Shan, Jiaoyang Chen, Bowen Zhou, Bo Li, Fang Wang, Jialong Wu, Zhengwei Tao, Lang Mei, Xiaohan Yu, Liyan Liu, Chong Chen, Wentao Zhang

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学(广州)) NUDT(中国人民解放军国防科技大学) OUC(中国海洋大学) HITSZ(哈尔滨工业大学(深圳)) Huawei Cloud BU(华为云业务部)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有多模态深度搜索忽视视觉中间推理作用的局限,提出DeepVoyager-VL框架,构建多模态事件图合成数据,设计智能体框架实现主动视觉获取,经10个基准实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04227 2026-08-04 cs.AI cs.HC 版本更新 79%

Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks

Pro²Assist:面向长程流程任务的、基于多模态自我中心感知的步骤感知主动式辅助系统

Lilin Xu, Bufang Yang, Siyang Jiang, Kaiwei Liu, Kaiyuan Hou, Yuang Fan, Hongkai Chen, Zhenyu Yan, Xiaofan Jiang

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本研究提出Pro²Assist,一种基于多模态自我中心感知的步骤感知主动式辅助系统,通过AR眼镜感知与持续推理提升长程流程任务辅助效果,在动作理解与主动时机准确率上优于基线,获多数用户认可。

Comments To appear in IMWUT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00847 2026-08-04 cs.CV 新提交 79%

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking

模型作为工具:用于统一多模态视觉跟踪的智能体协调框架

Wenrui Cai, Yuzhe Li, Qingjie Liu, Yunhong Wang

机构 * Beihang University(北京航空航天大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。

Comments 21 pages, 15 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00309 2026-08-04 cs.SE cs.AI 新提交 79%

OrEdge: Efficient Multi-Modal Anomaly Detection in Distributed Software Systems via Orthogonal-Domain Learning

OrEdge:基于正交域学习的分布式软件系统高效多模态异常检测

Amr M. Zaki, Farhoud Jafari Kaleibar, Honggeun Ji, Komal Sarda, Marin Litoiu

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 OrEdge是基于正交域学习的轻量级多模态异常检测框架,通过OrEdgeCore重构模块,在微服务数据集上实现了高精度,且模型参数仅9.6K,推理延迟较现有方法降低一个数量级以上,可高效部署于边缘设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21337 2026-08-04 cs.LG cs.AI 版本更新 79%

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

DataClaw0: 从原始流中智能定制多模态数据

Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng, Xiangyang Luo, Zhiheng Ma, Yihong Gong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳理工大学) Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出DataClaw0模型,通过两阶段流水线将生成语义合成锚定于确定性事实锚点,结合SFT与GRPO实现复杂数据精炼意图的对齐,首个数据精炼基准验证其高效性。

Comments add base model: Qwen3.5-27B

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09154 2026-08-04 cs.CV cs.AI cs.MM 67%

A Hybrid Deterministic Framework for Named Entity Extraction in Broadcast News Video

一种混合确定性框架用于广播新闻视频中的命名实体提取

Andrea Filiberto Lucas, Dylan Seychell

机构 * Dept. of Artificial Intelligence University of Malta Msida, Malta(人工智能系 马耳他大学 Msida)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出一种混合确定性框架,用于自动提取广播新闻视频中的个人姓名,通过可解释的模块化管道实现高精度和可追溯性,适用于新闻媒体信息提取任务。

Comments 7 pages, 5 figures. Accepted for publication at the 2026 IEEE Conference on Artificial Intelligence (CAI)

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), 2026, pp. 1134-1139

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01980 2026-08-04 cs.CV cs.AI 新提交 62%

AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

AdaThinkV:面向令牌高效视频推理的自适应思维

Jingqi Tian, Haoji Zhang, Lin Chen, Hongbo Jin, Haonan Xu, Tianrui Zhu, Xingming Shui, Shilin Ma, Wenjing Yang, Yansong Tang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01354 2026-08-04 cs.CV 新提交 57%

PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

PixVL:通过统一掩码-文本一致性循环进行像素级多模态大语言模型的自监督训练

Yicheng Xiao, Haoxuan Ma, Caorui Li, Yucheng Wu, Weijie Wang, Haoxiao Wang, Shuang Chen, Fan Yang, Haiyun Guo, Jinqiao Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 PixVL作为自监督后训练框架,通过统一掩码-文本一致性循环及语义验证等策略,解决像素级MLLMs的优化干扰问题,同时提升区域理解与分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01302 2026-08-04 cs.CV 新提交 57%

Beyond Symmetric Fusion: Exploiting Task-Dependent Modality Strengths for RGB-Event Small Object Detection

超越对称融合:利用任务相关的模态优势进行RGB-事件小目标检测

Ziheng Wang, Chaolang Li, Yutong Yang, Xiaohan Xu, Chongxiang Yang, Hengxuan Zhong, Zhen Liang, Pengwen Dai

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对现有RGB-事件检测器的对称融合设计缺陷,提出AERODet模型,通过SURE和TDSR实现任务相关的模态利用,在FRED和NeRDD数据集上取得最优性能,FRED挑战性拆分提升10.7 mAP点。

Comments 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00371 2026-08-04 cs.CV 新提交 57%

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22973 2026-08-04 cs.CV 版本更新 57%

mmSimPrior: Learning Simulation Priors for Data-Efficient and Generalizable Real-World Radar-based Human Motion Reconstruction

mmSimPrior:学习用于数据高效的真实世界可泛化雷达人体运动重建的模拟先验

Cheng Guo, Qiming Cao, Shengkai Xu, Haoyu Xie, Kaixiang Su, Pu Wang, Hongfei Xue

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对毫米波雷达人体运动重建中数据收集成本高及模拟训练模型迁移差的问题,提出mmSimPrior框架,将知识分解为先验,经多模态编码器等训练,构建数据集并设无重叠设置,实验证明其在降低MPJPE上有显著效果。

Comments 19 pages, 11 figures, including supplementary material. Project page: https://ch3ngguo.github.io/mmsimprior/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06872 2026-08-04 cs.CV 版本更新 57%

Ensemble Deep Learning Approaches for AI-Altered Video Detection

用于人工智能篡改视频检测的集成深度学习方法

Laiba Khan, Hung-Mao Wu, Wei Lin, Frank Bi, Yousef Abdelhadi, Joshua Jung

机构 * Department of Mathematical and Computational Sciences, University of Toronto Mississauga(多伦多大学密西沙加分校数学与计算科学系) Department of Mathematical and Computational Sciences, University of Toronto(多伦多大学数学与计算科学系) University of Toronto(多伦多大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对人工智能篡改视频检测难题,开发多模态深度伪造检测系统,结合音频视觉分析,用模型集成及均值平均、堆叠等策略组合分数,提升检测鲁棒性与性能,凸显对未见篡改泛化的挑战,平均准确率约70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01095 2026-08-04 cs.CV cs.LG 版本更新 57%

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

NarrativeTrack: 评估实体中心推理在叙事理解中的表现

Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma, Gargi Chakraborty

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。

Comments Project Page: https://github.com/apple/ml-NarrativeTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12147 2026-08-04 cs.CV 版本更新 57%

EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next

EgoIntent: 一种用于理解‘是什么、为什么和下一步’的以自我为中心的步级基准

Ye Pan, Chi Kit Wong, Yuanhuiyi Lyu, Hanqian Li, Chenfei Liao, Jiahao Huo, Lutao Jiang, Zixin Zhang, Jiacheng Chen, Yuqian Fu, Xu Zheng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 EgoIntent基准旨在通过步级意图理解解决以自我为中心视频中对‘是什么、为什么和下一步’的细粒度理解难题,包含15种日常生活场景,评估模型在三个维度上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15038 2026-08-04 cs.AI 版本更新 57%

LADY: Linear Attention for Autonomous Driving Efficiency without Transformers

LADY:用于自动驾驶效率的线性注意力,无需Transformer

Jihao Huang, Xi Xia, Zhiyuan Li, Tianle Liu, Jingke Wang, Junbo Chen, Tengju Ye

机构 * Udeer AI Zhejiang University(浙江大学) Yuanshi Intelligence(元世智能)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 LADY是首个基于线性注意力的端到端自动驾驶生成模型,通过常数时间与内存复杂度实现高效长时序建模与跨模态交互。

Comments Accepted by IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08065 2026-08-04 cs.AI 57%

STGDPM:Vessel Trajectory Prediction with Spatio-Temporal Graph Diffusion Probabilistic Model

Jin Wenzhe, Tang Haina, Zhang Xudong

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments This paper has been ACCEPTED as a FULL PAPER at DASFAA 2025

Journal ref Database Systems for Advanced Applications (DASFAA 2025), Lecture Notes in Computer Science, vol. 15987, pp. 571-586, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01773 2026-08-04 q-bio.NC 新提交 50%

NeuroWorld: A Latent Brain World Model for Stimulus-Conditioned Human Brain Dynamics

NeuroWorld:用于刺激条件下人脑动力学的潜在脑世界模型

Zijian Dong, Jianxiong Zhou, Kwun Kei Ng, Jan Paolo Macapinlac Balagtas, Zhizhou Li, Zijiao Chen, Juan Helen Zhou

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对现有脑编码模型的时间约束缺陷,提出首个脑世界模型NeuroWorld,通过两阶段方法在三个fMRI基准上实现了更优的脑活动多步预测性能,为脑活动因果预测提供了新框架。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13489 2026-08-04 eess.SP 版本更新 50%

Feasibility of simultaneous EEG-fMRI at 0.55 T: Recording, Denoising, and Functional Mapping

0.55T下同时进行EEG-fMRI可行性的研究:记录、去噪与功能映射

Parsa Razmara, Takfarinas Medani, Majid Abbasi Sisara, Anand A. Joshi, Rui Chen, Woojae Jeong, Ye Tian, Krishna S. Nayak, Richard M. Leahy

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究证明在0.55T下同时进行EEG-fMRI的可行性,通过去噪和功能映射展示了多模态神经成像的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏