arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4728 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4728 篇

2602.23410 2026-05-18 cs.LG cs.AI eess.SP q-bio.NC 57%

Brain-OF: An Omnifunctional Foundation Model for fMRI, EEG and MEG

Brain-OF:一种适用于fMRI、EEG和MEG的多功能基础模型

Hanning Guo, Hanwen Bi, Farah Abdellatif, Andrei Galbenus, Jon. N. Shah, Abigail Morrison, Jürgen Dammers

机构 * INM-4, Forschungszentrum Jülich, Germany(Jülich 研究中心 INM-4 实验室,德国) Department of Computer Science(计算机科学系) Software Engineering, RWTH Aachen University, Germany(软件工程,亚琛工业大学,德国) INM-7, Forschungszentrum Jülich, Germany(Jülich 研究中心 INM-7 实验室,德国) Institute of Systems Neuroscience, Heinrich Heine University, Germany(系统神经科学研究所,海因里希·海涅大学,德国) Department of Neurology, RWTH Aachen University, Germany(神经病学系,亚琛工业大学,德国) JARA-BRAIN-Translational Medicine, Germany(JARA-BRAIN 转化医学,德国) INM–11, JARA, Forschungszentrum Jülich, Germany(JARA-INM-11 实验室,Jülich 研究中心,德国) IAS-6, Forschungszentrum Jülich, Germany(IAS-6 实验室,Jülich 研究中心,德国) Department of Psychiatry, Psychotherapy and Psychosomatics, RWTH Aachen University, Germany(精神病学、心理治疗和精神病理学系,亚琛工业大学,德国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 Brain-OF通过联合预训练fMRI、EEG和MEG数据,解决多模态数据语义异质性和分辨率差异问题,提升跨模态数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15342 2026-05-18 cs.CV cs.LG 57%

Minerva-Ego: Spatiotemporal Hints for Egocentric Video Understanding

Minerva-Ego:眼动视频理解的空间时间提示

Arsha Nagrani, Jasper Uijilings, Shyamal Buch, Tobias Weyand, Sudheendra Vijayanarasimhan, Bo Hu, Ramin Mehran, David A Ross, Cordelia Schmid

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Minerva-Ego基准,通过多步骤多模态问题和密集标注的时空推理轨迹评估眼动视频理解模型,发现提示'何时何地'显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12622 2026-05-15 cs.RO cs.CV 57%

Action Emergence from Streaming Intent

从流式意图中涌现动作

Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto Tsinghua University(清华大学) CUHK

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出流式意图方法,通过连续思维链生成语义合适且安全的动作,实现自动驾驶中长尾交通场景的自主决策。

Comments Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14607 2026-05-15 cs.CV cs.CY 57%

ViMU: Benchmarking Video Metaphorical Understanding

ViMU:视频隐喻理解基准测试

Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ViMU旨在评估视频理解模型对隐含意义的识别能力,通过多模态证据推理,解决现有模型对隐喻、讽刺和社会意义理解不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08374 2026-05-15 cs.AI 57%

MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs

MemQ:将Q学习整合到基于溯源DAG的自进化记忆代理中

Junwei Liao, Haoting Shi, Ruiwen Zhou, Jiaqian Wang, Shengtao Zhang, Wei Zhang, Ying Wen, Zhiyu Li, Feiyu Xiong, Bo Tang, Weinan Zhang, Muning Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) University of Science and Technology of China(中国科学技术大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 MemQ通过在溯源DAG中传播信用权重,改进记忆Q值的评估,提升多步任务的泛化能力,尤其在产生深层相关溯源链的任务中表现突出。

Comments 22 pages, 11 figures (containing 43 individual image panels total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19973 2026-05-15 cs.NI cs.AI 57%

A Tutorial on Cognitive Biases in Agentic AI-Driven 6G Autonomous Networks

面向6G自主网络的智能偏差教程

Hatim Chergui, Farhad Rezazadeh, Merouane Debbah, Christos Verikoukis

机构 * i2CAT Foundation(i2CAT基金会) Hostelworld Group(Hostelworld集团) Technical University of Catalonia (UPC)(技术大学(加泰罗尼亚)) Khalifa University of Science and Technology(卡里玛大学) ISI/ATH University of Patras(帕特拉大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了在6G自主网络中因人类设计引入的认知偏差问题,通过两个案例展示如何利用智能体AI缓解锚定偏差和时间偏差,提升网络管理和边缘计算的效率与节能效果。

Comments 26 pages, 18 figures, 4 tables, link to source code available. Accepted at IEEE OJCOMS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13857 2026-05-15 cs.GR cs.CV cs.LG 57%

MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation

MoZoo:释放视频扩散在动物毛发和肌肉模拟中的潜力

Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li

机构 * tabular c 1 Tsinghua University 2 University of Glasgow 3 The Chinese University of Hong Kong 4 HUIJING Digital Media \& Entertainment Group 2mm Project Page: tabular

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MoZoo通过引入Role-Aware RoPE和Asymmetric Decoupled Attention,实现高保真动物视频生成,同时构建了MoZoo-Data和MoZooBench进行评估,提升了毛发和肌肉动态模拟的效率与质量。

Comments Github Page:https://dongxialiu15.github.io/MoZoo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12725 2026-05-14 cs.CV 57%

Is Video Anomaly Detection Misframed? Evidence from LLM-Based and Multi-Scene Models

视频异常检测是否被错误地框架化?来自基于大语言模型和多场景模型的证据

Furkan Mumcu, Michael J. Jones, Anoop Cherian, Yasin Yilmaz

机构 * University of South Florida(佛罗里达州立大学) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文探讨视频异常检测是否应关注单场景、空间感知和可解释性,以捕捉环境中的正常结构,而非依赖多场景模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11993 2026-05-13 cs.CL 57%

Towards Visually-Guided Movie Subtitle Translation for Indic Languages

面向视觉引导的电影字幕翻译:用于印地语等语言

Tarun Chintada, Kshetrimayum Boynao Singh, Asif Ekbal

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Indian Institute of Technology Patna(印度理工学院帕纳布分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文研究了视觉引导的电影字幕翻译,针对低资源印地语等语言,提出两种轻量视觉锚定策略,发现时间错位是长视频的主要障碍,而选择性视觉锚定能有效提升翻译质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11782 2026-05-13 cs.CV 57%

Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision

面向低视力人群的基于VQA的事件地图城市风险感知导航

Antoni Valls, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息技术研究所,CSIC-UPC)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于视觉问答的事件地图框架,利用视觉语言模型进行行人场景描述和危险识别,通过三级查询结构实现细粒度场景理解,生成风险感知导航地图,验证多模态大语言模型在助视导航中的有效性。

Comments 10 pages, 6 figures, submitted to IEEE T-ITS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07552 2026-05-13 cs.CV 57%

VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network

VIMCAN: 基于混合Mamba-交叉注意力网络的视觉-惯性3D人体姿态估计

Zepeng Yang, Junxuan Bai, Hao Li, Ju Dai, Junjun Pan, Yongfeng Yin, Bin Li

机构 * Beihang University(北航) Peng Cheng Laboratory(鹏城实验室) Capital University of Physical Education and Sports(首都体育学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VIMCAN结合Mamba的高效序列建模与交叉注意力的空间推理,实现RGB关键点与穿戴式IMU数据的鲁棒融合,取得更优精度和实时推理性能。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09310 2026-05-12 cs.AI q-fin.PM 57%

Beyond ESG Scores: Learning Dynamic Constraints for Sequential Portfolio Optimization

超越ESG评分:为序列投资组合优化学习动态约束

Xin Li, Yan Ke, Longbing Cao

机构 * Macquarie University(麦考瑞大学) The University of Queensland(昆士兰大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出MACF和MACF-X方法,通过动态证据输入和三头分解,减少尾部ESG预算压力并保持竞争力,改进了序列投资组合优化中的ESG约束处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01824 2026-05-12 cs.CV 57%

STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering

STRIVE:结构化时空探索用于视频问答的强化学习

Emad Bahrami, Olga Zatsarynna, Parth Pathak, Sunando Sengupta, Juergen Gall, Mohsen Fayyaz

机构 * University of Bonn(波恩大学) Microsoft(微软) Meta Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 STRIVE通过构建多时空变体和联合归一化提升视频问答的奖励信号,采用重要性感知采样机制增强策略更新稳定性,实验表明在多个大模型上提升了视频推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13434 2026-05-12 cs.LG cs.AI 57%

EventTSF: Event-Aware Non-Stationary Time Series Forecasting

EventTSF: 基于事件的非平稳时间序列预测

Yunfeng Ge, Ming Jin, Yiji Zhao, Hongyan Li, Bo Du, Chang Xu, Shirui Pan

机构 * Griffith University, Australia(澳大利亚格里菲斯大学) Xidian University, China(西安电子科技大学) Yunnan University, China(云南大学) Microsoft Research Asia, China(微软亚洲研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出EventTSF框架,通过分步扩散整合时间序列与文本事件,解决非平稳时间序列预测中的多模态交互问题,实验显示在7个数据集上优于12个基线模型。

Comments Accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08685 2026-05-12 cs.LG cs.AI 57%

Event Fields: Learning Latent Event Structure for Waveform Foundation Models

事件场:学习隐式事件结构用于波形基础模型

Li Na, Yuanyun Zhang, Shi Li

机构 * University of Science and Technology of China(中国科学技术大学) Columbia University(哥伦比亚大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种新的波形基础模型,通过将生理时间序列建模为隐式事件过程的实现,而非传统序列表示。该方法通过自监督学习框架,促使波形的随机分割和时间频率投影之间的一致性,提升模型对信号扰动的鲁棒性并保持事件层面的组织结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08625 2026-05-12 cs.LG cs.AI 57%

Reasoning-Aware Training for Time Series Forecasting

面向时间序列预测的推理感知训练

Md Atik Ahamed, Mihir Parmar, Palash Goyal, Chun-Liang Li, Qiang Cheng, Tomas Pfister, Jinsung Yoon

机构 * Google(谷歌) University of Kentucky(肯塔基大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出STRIDE框架,通过将LLM推理注入到时间序列基础模型的连续嵌入空间中,提升数值预测的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08003 2026-05-11 cs.CV 57%

SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere

SphereVAD: 基于单位超球面几何推断的无训练视频异常检测

Chao Huang, Penfei Wei, Wei Wang, Jie Wen, Zhihua Wang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SphereVAD通过几何推断在单位超球面上实现无训练视频异常检测,利用预训练多模态大语言模型的中间层特征,通过Frechet均值中心化、Holistic Scene Attention和vMF引导的球面几何拉近技术,实现零样本异常识别。

Comments 48 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15840 2026-05-11 cs.RO cs.CV 57%

Large Video Planner Enables Generalizable Robot Control

大视频规划器实现通用机器人控制

Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

机构 * MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校) Harvard(哈佛大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用大规模视频预训练构建通用机器人基础模型,通过生成视频计划实现跨任务和环境的泛化控制,并在真实机器人上验证了其可行性。

Comments 29 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02371 2026-05-11 cs.CR cs.AI cs.DC 57%

Federated Spatiotemporal Graph Learning for Passive Attack Detection in Smart Grids

联邦时空图学习用于智能电网中的被动攻击检测

Bochra Al Agha, Razane Tajeddine

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于图的多模态检测器,通过融合物理层和行为指标检测智能电网中的被动攻击,采用联邦学习框架提升鲁棒性,实现高准确率和低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06537 2026-05-08 cs.CV 57%

MedHorizon: Towards Long-context Medical Video Understanding in the Wild

MedHorizon:迈向真实场景下的长上下文医学视频理解

Bodong Du, Bowen Liu, Yang Yu, Xinpeng Ding, Zhiheng Wu, Shuning Wang, Shuo Nie, Naiming Liu, Qifeng Chen, Yangqiu Song, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Baidu Inc.(百度公司) Xidian University(西安电子科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MedHorizon提出一个真实场景下的长上下文医学视频理解基准,通过稀疏证据和多跳临床推理评估,揭示当前系统在完整流程理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05950 2026-05-08 cs.CL 57%

Lightweight Stylistic Consistency Profiling: Robust Detection of LLM-Generated Textual Content for Multimedia Moderation

轻量级风格一致性剖析:面向多媒体审核的LLM生成文本稳健检测

Siyuan Li, Aodu Wulianghai, Xi Lin, Xibin Yuan, Qinghua Mao, Guangyan Li, Xiang Chen, Jun Wu, Jianhua Li

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出LiSCP方法,通过结合离散风格特征与连续语义信号,提升对抗环境下的LLM生成文本检测鲁棒性,实现在多领域中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05912 2026-05-08 cs.LG cs.CV 57%

From Drops to Grid: Noise-Aware Spatio-Temporal Neural Process for Rainfall Estimation

从水滴到网格:面向噪声的时空神经过程用于降雨估计

Rafael Pablos Sarabia, Joachim Nyborg, Morten Birk, Ira Assent

机构 * Dept. Comp. Sc., Aarhus University(计算机科学系,奥胡斯大学) Cordulus

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出DropsToGrid方法,通过融合噪声天气站的时间序列与雷达空间信息,生成高分辨率降雨场,有效处理降雨的偏态、局部性和噪声问题,提升不确定性量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18753 2026-05-08 cs.LG cs.AI 57%

Handling and Interpreting Missing Modalities in Patient Clinical Trajectories via Autoregressive Sequence Modeling

通过自回归序列建模处理和解释患者临床轨迹中的缺失模态

Andrew Wang, Ellie Pavlick, Ritambhara Singh

机构 * Brown University(布朗大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文通过自回归序列建模方法处理医疗数据中缺失模态的问题,提出对比预训练目标并验证了其在MIMIC-IV和eICU数据集上的有效性,提升了模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20079 2026-05-08 cs.CL 57%

Predicting States of Understanding in Explanatory Interactions Using Cognitive Load-Related Linguistic Cues

利用与认知负荷相关的语言线索预测解释互动中的理解状态

Yu Wang, Olcay Türk, Angela Grimminger, Hendrik Buschmeier

机构 * Faculty of Linguistics Literary Studies, Bielefeld University, Bielefeld, Germany Faculty of Arts Humanities, Paderborn University, Paderborn, Germany \| SFB/Transregio 318 ‘Constructing Explainability’, Bielefeld \& Paderborn, Germany

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过分析对话中说话者和听者的语言特征,探讨如何预测听者的理解状态。通过MUNDEX语料库的统计分析,发现认知负荷相关的语言线索与听者理解水平相关,使用三种语言线索和文本特征可提升预测效果。

Journal ref Proceedings of the 15th Language Resources and Evaluation Conference (LREC 2026), pp. 11368-11378

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17622 2026-05-08 cs.HC cs.CL cs.IR 57%

Memento: Towards Proactive Visualization of Everyday Memories with Personal Wearable AR Assistant

Memento:面向日常记忆主动可视化的人体可穿戴AR助手

Yoonsang Kim, Yalong Yang, Arie E. Kaufman

机构 * Stony Brook University(石溪大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 Memento通过捕捉用户语音查询及时空活动上下文,主动关联兴趣与情境,利用AR实现日常记忆的持续可视化,提升沉浸式应用体验。

Comments 8 pages, 5 figures. This is the author's version of the article that appeared at the IEEE Conference on Virtual Reality and 3D User Interfaces Abstracts and Workshops (IEEE VRW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01498 2026-05-05 cs.CV 57%

Towards Visual Query Localization in the 3D World

面向3D世界的视觉查询定位

Liang Peng, Bohan Tan, Zhipeng Zhang, Haobo Li, Yifan Jiao, Xingping Dong, Libo Zhang

机构 * Wuhan University(武汉大学) AutoLab, SAI, Shanghai Jiao Tong University(AutoLab、SAI、上海交通大学) Anyverse Dynamics University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文首次提出3D多模态视觉查询定位基准3DVQL,包含2002个序列和17万帧数据,通过点云、RGB图像和深度图像多模态数据提升研究灵活性,并提出LaF算法提升性能。

Comments Accepted to CVPR 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00495 2026-05-04 cs.SD cs.CV 57%

MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

MMAudio-LABEL: 通过音频生成实现静音视频的音频事件标注

Kazuya Tateishi, Akira Takahashi, Atsuo Hiroe, Hirofumi Takeda, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MMAudio-LABEL框架,通过联合生成音频和帧对齐的声学事件预测,提升静音视频的音频事件标注精度,实验显示在起始点检测和材料分类任务中性能显著提升。

Comments Accepted to the CVPR 2026 Sight and Sound Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00444 2026-05-04 cs.CV 57%

Scaling Video Understanding via Compact Latent Multi-Agent Collaboration

通过紧凑潜在多智能体协作实现视频理解的扩展

Kerui Chen, Jinglu Wang, Jianrong Zhang, Ming Li, Yan Lu, Hehe Fan

机构 * Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学) Guanming Lab(冠明实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MACF框架,通过解耦智能体感知预算与全局视频复杂度,实现可扩展的视频理解,保持视觉保真度,并在多种视频理解基准上优于现有方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00078 2026-05-04 cs.RO cs.CV cs.LG 57%

Being-H0.7: A Latent World-Action Model from Egocentric Videos

Being-H0.7: 一种从第一人称视频中学习的潜在世界-动作模型

Hao Luo, Wanpeng Zhang, Yicheng Feng, Sipeng Zheng, Haiweng Xu, Chaoyi Xu, Ziheng Xi, Yuhui Fu, Zongqing Lu

机构 * BeingBeyond Team(BeingBeyond团队)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Being-H0.7,通过在感知与动作之间插入可学习的潜在查询,实现未来感知的VLA策略,无需生成未来帧,提升预测效率与部署性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00050 2026-05-04 cs.LG cs.CV 57%

Learning physically grounded traffic accident reconstruction from public accident reports

从公共事故报告中学习物理基础的交通事故重建

Yanchen Guan, Haicheng Liao, Chengyue Wang, Zhenning Li

机构 * State Key Laboratory of Internet of Things for Smart City(物联网智能城市国家重点实验室) Department of Civil Engineering(土木工程系) Department of Computer and Information Science(计算机与信息科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于公共报告和现场测量的参数化多模态学习框架,构建了6217个真实事故案例数据集CISS-REC,实现了交通事故重建的高保真度,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏