arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4721 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4721 篇

2604.26247 2026-04-30 cs.IR cs.AI 79%

TimeMM: Time-as-Operator Spectral Filtering for Dynamic Multimodal Recommendation

TimeMM: 时域作为算子的动态多模态推荐谱过滤

Wei Yang, Rui Zhong, Zihan Lin, Xiaodan Wang, Cheng Chen, Huan Ren, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 TimeMM通过时域算子谱过滤框架,解决动态多模态推荐中用户兴趣非平稳性问题,引入自适应谱过滤和模态感知路由,提升推荐性能与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18662 2026-04-30 cs.RO cs.AI 79%

M2R2: MultiModal Robotic Representation for Temporal Action Segmentation

M2R2:多模态机器人表示用于时序动作分割

Daniel Sliwowski, Dongheui Lee

机构 * Autonomous Systems Lab, Technische Universität Wien (TU Wien)(自主系统实验室,维也纳技术大学) Institute of Robotics and Mechatronics, German Aerospace Center (DLR)(机器人与机电研究所,德国航空航天中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出M2R2多模态特征提取器,结合本体感知和体外感知信息,解决时序动作分割中多模态特征复用难题,并在三个机器人数据集上取得新突破。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25584 2026-04-29 cs.AI 79%

DualFact+: A Multimodal Fact Verification Framework for Procedural Video Understanding

DualFact+: 一种用于过程视频理解的多模态事实验证框架

Cennet Oguz, Yasser Hamidullah, Josef van Genabith, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland Informatics Campus(萨尔兰信息学校区)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 DualFact+通过双层多模事实验证框架,针对过程视频描述中的概念事实和上下文事实进行评估,揭示了多模态事实 grounding 的挑战。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23173 2026-04-28 cs.CV 79%

One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition

一个身份,多种角色:多模态实体指代用于增强视频情境识别

Balaji Darur, Amanmeet Garg, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad, India(IIIT海得拉尔学院计算机视觉研究所,印度) Amazon Prime Video, Seattle(亚马逊Prime视频,西雅图)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态实体指代(MEC)方法,通过结合文本和视频信息提升视频情境识别的准确性和一致性,实验结果显示在描述和视觉定位方面均取得显著提升。

Comments Accepted to CVPR 2026 Findings. Project Page: https://katha-ai.github.io/projects/cinemec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21094 2026-04-28 cs.CV 79%

EMCompress: Video-LLMs with Endomorphic Multimodal Compression

EMCompress: 具有端态多模态压缩的视频大语言模型

Zheyu Fan, Jiateng Liu, Yuji Zhang, Zihan Wang, Yi R. Fung, Manling Li, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出端态多模态压缩(EMC)作为视频问答的结构约束充分统计问题,通过端态变换保持答案不变性,提升视频语言理解的训练和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21235 2026-04-24 cs.LG cs.CL stat.ME 79%

Learning Dynamic Representations and Policies from Multimodal Clinical Time-Series with Informative Missingness

从具有信息性缺失的多模态临床时间序列中学习动态表示和策略

Zihan Liang, Ziwen Pan, Ruoxuan Xiong

机构 * Emory University(埃默里大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出了一种多模态临床时间序列患者表示学习框架,利用信息性缺失来提升治疗策略学习和患者预后预测性能。

Comments Findings of ACL 2026 (30 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07295 2026-04-23 cs.RO cs.AI 79%

Learning Multi-Modal Whole-Body Control for Real-World Humanoid Robots

多模态全身控制学习用于现实世界的人形机器人

Pranay Dugar, Aayam Shrestha, Fangzhou Yu, Bart van Marum, Alan Fern

机构 * Collaborative Robotics and Intelligent Systems Institute (CoRIS)(协同机器人与智能系统研究所)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态全身控制器,通过统一接口实现多样化的人形机器人行为控制,展示了在仿真和真实世界中的有效性。

Comments Website: https://masked-humanoid.github.io/mhc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16367 2026-04-21 cs.CY cs.AI 79%

Talk, Walk, and Market Response: Multimodal Measurement of AI Washing and Its Capital Market Consequences in China

讲话、行走与市场反应:多模态测量AI洗绿及其资本市场后果在中国

Wen Zhanjie, Guo Jingqiao

机构 * School of Economics and Trade, Guangdong University of Finance(广东金融学院经济贸易学院) Department of Computer Science, Faculty of Science, Hong Kong Baptist University(香港 Baptist 大学科学学院计算机科学系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过多模态方法测量中国AI洗绿现象,发现其对资本市场的负面影响,揭示了AI投资与实际创新之间的关系及市场反应机制。

Comments 18 pages, 3 figures, 7 tables, academic research paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15127 2026-04-20 cs.MM 79%

MCSC-Bench: Multimodal Context-to-Script Creation for Realistic Video Production

MCSC-Bench:多模态情境到脚本创建用于真实视频制作

Huanran Hu, Zihui Ren, Dingyi Yang, Liangyu Chen, Qixiang Gao, Tiezheng Ge, Qin Jin

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出MCSC任务,通过多模态输入和用户指令生成结构化视频脚本,并引入首个大规模MCSC数据集MCSC-Bench,包含11K+标注视频,支持全面评估材料选择、叙事规划和条件脚本生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15312 2026-04-17 cs.CV 79%

Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo

双向跨模态提示用于事件-帧不对称立体

Ninghui Xu, Fabio Tosi, Lihui Wang, Jiawei Han, Luca Bartolomei, Zhiting Yao, Matteo Poggi, Stefano Mattoccia

机构 * School of Instrument Science and Engineering, Southeast University, State Key Lab of Comprehensive PNT Network and Equipment Technology, Key Lab of Micro-Inertial Instrument and Advanced Navigation Technology, MOE(仪器科学与工程学院,东南大学,综合PNT网络与设备技术国家重点实验室,微惯性仪器与先进导航技术重点实验室,教育部) Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学) College of Computer Science and Software Engineering, Hohai University(计算机科学与软件工程学院,河海大学) Beijing Institute of Technology(北京理工大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出Bi-CMPStereo框架,通过双向跨模态提示利用语义和结构特征实现稳健匹配,提升高速运动和复杂光照下的3D感知性能。

Comments CVPR 2026. Code URL: https://github.com/xnh97/Bi-CMPStereo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14766 2026-04-17 eess.SP cs.AI 79%

Temporal Cross-Modal Knowledge-Distillation-Based Transfer-Learning for Gas Turbine Vibration Fault Detection

基于时间跨模态知识蒸馏的转移学习用于燃气轮机振动故障检测

Ali Bagheri Nejad, Mahdi Aliyari-Shoorehdeli, Abolfazl Hasanzadeh

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出基于时间跨模态知识蒸馏的转移学习框架,解决燃气轮机振动故障检测中时间上下文不足和数据稀缺问题,提升特征分离度和诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15602 2026-04-17 cs.CV 79%

TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?

TennisTV: 多模态大语言模型能否理解网球发球?

Zhongyuan Bao, Lejun Zhang

机构 * New York University(纽约大学) Tandon School of Engineering(坦顿工程学院) Shanghai, China(上海,中国) New York, USA(纽约,美国)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 TennisTV是首个全面评估网球视频理解的基准,通过模拟发球过程中的连续击球事件,评估17种大语言模型在网球视频理解中的表现,发现帧采样密度需平衡且需提升时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12335 2026-04-15 cs.CV cs.LG 79%

All in One: A Unified Synthetic Data Pipeline for Multimodal Video Understanding

一站式:一个多模态视频理解统一合成数据管道

Tanzila Rahman, Renjie Liao, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(向量人工智能研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出统一合成数据管道,用于生成多模态视频数据,支持多种任务格式,提升模型推理能力,并在视频物体计数、视觉问答和分割任务中验证了其有效性。

Comments 8 Pages, 4 Tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09326 2026-04-13 cs.RO cs.CV 79%

Multimodal Anomaly Detection for Human-Robot Interaction

多模态异常检测用于人机交互

Guilherme Ribeiro, Iordanis Antypas, Leonardo Bizzaro, João Bimbo, Nuno Cruz Garcia

机构 * LASIGE Faculty of Sciences U. Lisboa, Portugal Dep. of Information Engineering University of Padova Padova, Italy

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MADRI框架,通过将视频流转换为语义特征向量进行基于重建的异常检测,并结合机器人内部传感器数据和场景图,提升人机协作中多模态异常检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08418 2026-04-10 cs.RO cs.AI 79%

Exploring Temporal Representation in Neural Processes for Multimodal Action Prediction

探索神经过程在多模态动作预测中的时间表示

Marco Gabriele Fedozzi, Yukie Nagai, Francesco Rea, Alessandra Sciutti

机构 * DIBRIS Department, University of Genoa(热那亚大学DIBRIS系) CONTACT Unit, Italian Institute of Technology(意大利理工学院CONTACT单元) International Research Center for Neurointelligence, The University of Tokyo(东京大学国际神经智能研究中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究了条件神经过程在机器人自监督多模态动作预测中的应用,提出改进的DMBN-PTE模型以提升时间信息表示的鲁棒性。

Comments Submitted to the AIC 2023 (9th International Workshop on Artificial Intelligence and Cognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08062 2026-04-10 cs.HC cs.AI 79%

From Gaze to Guidance: Interpreting and Adapting to Users' Cognitive Needs with Multimodal Gaze-Aware AI Assistants

从注视到引导:通过多模态注视感知AI助手解读和适应用户认知需求

Valdemar Danry, Javier Hernandez, Andrew Wilson, Pattie Maes, Judith Amores

机构 * Microsoft Research(微软研究院) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于注视的多模态LLM助手,通过眼动追踪提升用户阅读行为评估的准确性与个性化,实验表明其能有效提升信息回忆能力并提高交互效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04614 2026-04-09 cs.LG cs.AI 79%

A Clinical Point Cloud Paradigm for In-Hospital Mortality Prediction from Multi-Level Incomplete Multimodal EHRs

一种用于院内死亡预测的临床点云范式:从多级不完整多模态电子健康记录

Bohao Li, Tao Zou, Junchen Ye, Yan Gong, Bowen Du

机构 * Beihang University(北京航空航天大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HealthPoint范式,通过统一的4D空间表示多级不完整多模态EHRs,引入低秩关系注意力机制和分层交互策略,实现灵活的事件级交互与细粒度自监督,提升模态恢复和未标记数据利用效率,实验表明其在风险预测中性能优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05079 2026-04-08 cs.CV 79%

SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

SVAgent:通过跨模态多智能体协作实现故事线引导的长视频理解

Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang, Yingfang Yuan

机构 * BCML, Heriot-Watt University(赫瑞瓦特大学BCML) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 SVAgent通过跨模态多智能体协作,利用故事线引导实现视频问答的高效理解,提升推理鲁棒性和答案一致性。

Comments Published in CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04239 2026-04-07 cs.LG cs.AI q-bio.QM 79%

Good Rankings, Wrong Probabilities: A Calibration Audit of Multimodal Cancer Survival Models

好的排名,错误的概率:多模态癌症生存模型的校准审计

Sajad Ghawami

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 研究评估了多模态癌症生存模型的校准性,发现其生存概率未经过校准,提出通过Post-hoc Platt缩放可减少误校准,但不改变区分能力。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03685 2026-04-07 cs.CV 79%

DSERT-RoLL: Robust Multi-Modal Perception for Diverse Driving Conditions with Stereo Event-RGB-Thermal Cameras, 4D Radar, and Dual-LiDAR

DSERT-RoLL:多模态感知用于多样驾驶条件的鲁棒性,结合立体事件-RGB-热成像相机、4D雷达和双光雷达

Hoonhee Cho, Jae-Young Kang, Yuhwan Jeong, Yunseo Yang, Wonyoung Lee, Youngho Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab, KAIST(韩国科学技术院视觉智能实验室)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出DSERT-RoLL数据集,结合立体事件、RGB和热成像相机以及4D雷达和双光雷达,涵盖多样的天气和光照条件,提供精确的2D和3D边界框及轨迹ID,支持跨传感器组合的公平比较,提升新型传感器的数据可用性,并建立统一的3D和2D基准,促进传感器性能的系统研究。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00318 2026-04-07 cs.CV 79%

Chain-of-Frames: Advancing Video Understanding in Multimodal LLMs via Frame-Aware Reasoning

链式帧:通过帧感知推理推进多模态大语言模型的视频理解

Sara Ghazanfari, Francesco Croce, Nicolas Flammarion, Prashanth Krishnamurthy, Farshad Khorrami, Siddharth Garg

机构 * New York University(纽约大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种单阶段视频LLM,通过显式引用相关帧减少推理中的时间不一致性,利用COF-DATA数据集提升视频理解性能,发现合成数据显著提升模型准确率。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19851 2026-04-02 cs.CV 79%

Towards Online Multi-Modal Social Interaction Understanding

面向在线多模态社交交互理解

Xinpeng Li, Shijian Deng, Bolin Lai, Weiguo Pian, James M. Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出在线多模态社交交互理解问题,通过历史信息实现多模态社交交互理解,采用多模态大语言模型框架,引入多对话者预测和社交感知视觉提示,实现三个任务的最优性能。

Comments Accepted to Transactions on Machine Learning Research (TMLR). Project page: https://sampson-lee.github.io/online-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27690 2026-03-31 cs.CV 79%

Customized Visual Storytelling with Unified Multimodal LLMs

基于统一多模态大语言模型的定制化视觉叙事

Wei-Hua Li, Cheng Sun, Chu-Song Chen

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出VstoryGen框架,整合文本描述与角色背景参考,实现定制化故事生成。通过参数高效提示微调电影数据,增强电影多样性。建立两个新基准测试,评估多模态叙事的连贯性、文本-视觉对齐和镜头类型控制。

Comments Paper accepted to the CVPR 2026 Workshop on Generative AI for Storytelling (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27531 2026-03-31 cs.CV 79%

OmniColor: A Unified Framework for Multi-modal Lineart Colorization

OmniColor: 一种多模态线稿上色的统一框架

Xulu Zhang, Haoqian Du, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 OmniColor提出一种统一框架,通过空间对齐和语义参考信号分类,提升线稿上色的可控性、视觉质量和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26699 2026-03-31 eess.SP cs.CV cs.LG 79%

EMPD: An Event-based Multimodal Physiological Dataset for Remote Pulse Wave Detection

EMPD:基于事件的多模态生理数据集用于远程脉波检测

Qian Feng, Pengfei Li, Rongshan Gao, Jiale Xu, Rui Gong, Yidi Li

机构 * College of Computer Science and Technology, Taiyuan University of Technology(太原理工大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 EMPD数据集通过事件相机和临床级脉氧仪采集多模态数据,用于提升非接触式生理监测算法的鲁棒性,支持高时间精度的脉波检测。

Comments 12 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25420 2026-03-27 cs.CV 79%

VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents

VideoWeaver:多模态多视角视频到视频转换用于具身智能体

George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Yang Bai, Liudi Yang, Ziyuan Liu

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Ludwig Maximilian University of Munich(慕尼黑大学) University of Freiburg(弗莱堡大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VideoWeaver是首个多视角视频到视频转换框架,通过共享4D潜在空间实现多视角一致性,支持动态相机运动和不同视角的自回归合成,提升具身智能体在真实环境中的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24636 2026-03-27 cs.LG cs.AI 79%

DyMRL: Dynamic Multispace Representation Learning for Multimodal Event Forecasting in Knowledge Graph

DyMRL: 动态多空间表征学习用于知识图谱中的多模态事件预测

Feng Zhao, Kangzheng Liu, Teng Peng, Yu Yang, Guandong Xu

机构 * Huazhong University of Science and Technology(华中科技大学) Centre for Learning, Teaching and Technology(学习、教学与技术中心) The Education University of Hong Kong(香港教育大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 DyMRL通过动态多空间表征学习,解决多模态知识动态获取与融合问题,提升事件预测性能。

Comments Accepted to The ACM Web Conference 2026 (WWW '26). This version is published under a CC BY license

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22313 2026-03-25 cs.LG cs.AI 79%

A Multi-Modal CNN-LSTM Framework with Multi-Head Attention and Focal Loss for Real-Time Elderly Fall Detection

一种集成多头注意力和聚焦损失的多模态CNN-LSTM框架用于实时老年人跌倒检测

Lijie Zhou, Luran Wang

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态深度学习框架MultiModalFallDetector,结合多尺度CNN、多传感器数据融合、多头注意力机制和聚焦损失,实现高精度实时老年人跌倒检测,实验表明其在SisFall数据集上达到98.7的F1分数,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21778 2026-03-24 cs.CV 79%

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20351 2026-03-24 cs.CR cs.AI 79%

MANA: Towards Efficient Mobile Ad Detection via Multimodal Agentic UI Navigation

MANA:通过多模态代理UI导航实现高效的移动广告检测

Yizhe Zhao, Yongjian Fu, Zihao Feng, Hao Pan, Yongheng Deng, Yaoxue Zhang, Ju Ren

机构 * Department of Computer Science and Technology(计算机科学与技术系) University of Southern California(南加州大学) Shanghai Jiao Tong University(上海交通大学) State Key Laboratory of Internet Architecture(互联网架构国家重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MANA框架,通过整合多种信号实现高效移动广告检测,提升准确率和效率,有效识别隐蔽恶意广告。

详情

展开后加载摘要…

URL PDF HTML 收藏