arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2603.01412 2026-03-04 cs.CV 57%

UETrack: A Unified and Efficient Framework for Single Object Tracking

UETrack: 一种高效的单目标跟踪统一框架

Ben Kang, Jie Zhao, Xin Chen, Wanting Geng, Bin Zhang, Lu Zhang, Dong Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 UETrack提出了一种高效的单目标跟踪框架,通过令牌池混合机制和目标感知蒸馏策略,实现多模态场景下的高效跟踪性能。

Comments This paper was accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01926 2026-03-03 cs.IR cs.CV 57%

MealRec: Multi-granularity Sequential Modeling via Hierarchical Diffusion Models for Micro-Video Recommendation

MealRec: 基于分层扩散模型的多粒度序列建模用于微视频推荐

Xinxin Dong, Haokai Ma, Yuze Zheng, Yongfu Zha, Yonghui Yang, Xiaodong Wang

机构 * National University of Defense Technology(国防科技大学) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MealRec通过分层扩散模型实现多粒度序列建模,解决微视频推荐中的偏好无关表示和模态冲突问题,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01839 2026-03-03 cs.CV cs.RO 57%

LEAR: Learning Edge-Aware Representations for Event-to-LiDAR Localization

LEAR: 为事件到LiDAR定位学习边缘感知表示

Kuangyi Chen, Jun Zhang, Yuxi Hu, Yi Zhou, Friedrich Fraundorfer

机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,技术大学格拉茨) School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 LEAR通过联合估计边缘结构和密集事件深度流场,解决事件与LiDAR对齐难题,提升GPS受限环境下的定位精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01545 2026-03-03 cs.CV 57%

Training-Free Spatio-temporal Decoupled Reasoning Video Segmentation with Adaptive Object Memory

无需训练的时空解耦推理视频分割与自适应对象记忆

Zhengtong Zhu, Jiaqing Fan, Zhixuan Liu, Fanzhang Li

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出无需训练的时空解耦推理视频分割方法SDAM,通过自适应对象记忆模块和时空解耦技术实现稳定的时间传播,优于现有微调方法。

Comments Accept by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00467 2026-03-03 cs.CV 57%

High Dynamic Range Imaging Based on an Asymmetric Event-SVE Camera System

基于非对称事件-SVE相机系统的高动态范围成像

Pengju Sun, Banglei Guan, Jing Tao, Zhenbao Yu, Xuanyu Bai, Yang Shang, Qifeng Yu

机构 * College of Aerospace Science and Engineering(航空航天科学与工程学院) National University of Defense Technology(国防科技大学) Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation(湖南省图像测量与视觉导航重点实验室)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于非对称事件-SVE相机系统的高动态范围成像系统,通过跨模态对齐和计算融合技术提升高动态场景下的成像性能。

Comments This paper has been accepted by Optics Express

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20034 2026-03-03 cs.RO cs.CV 57%

Digital and Robotic Twinning for Validation of Proximity Operations and Formation Flying

数字与机器人双胞胎用于近距操作与编队飞行的验证

Z. Ahmed, E. Bates, P. Francesch Huc, S. Y. W. Low, A. Golan, T. Bell, A. Rizza, S. D'Amico

机构 * Stanford University(斯坦福大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种混合双胞胎框架,用于验证航天器GNC系统在近距操作和编队飞行中的性能。

Journal ref 2026 Rocky Mountain AAS GN&C Conference, Breckenridge, Colorado

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23784 2026-03-02 cs.LG cs.AI q-fin.CP q-fin.TR 57%

TradeFM: A Generative Foundation Model for Trade-flow and Market Microstructure

TradeFM: 一种用于交易流和市场微观结构的生成基础模型

Maxime Kawawa-Beaudan, Srijan Sood, Kassiani Papasotiriou, Daniel Borrajo, Manuela Veloso

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 TradeFM是一种基于生成Transformer的市场微观结构基础模型,通过学习大规模交易数据实现跨资产泛化,有效捕捉市场特征并提升合成数据生成与交易策略研究能力。

Comments 29 pages, 17 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23152 2026-02-27 cs.AI 57%

The Trinity of Consistency as a Defining Principle for General World Models

一致性三元组作为一般世界模型的定义原则

Jingxuan Wei, Siyuan Li, Yuhang Xu, Zheng Sun, Junjie Jiang, Hexuan Jin, Caijun Jia, Honghao He, Xinglong Xu, Xi bai, Chang Yu, Yumou Liu, Junnan Zhu, Xuanhe Zhou, Jintao Chen, Xiaobin Hu, Shancheng Pang, Bihui Yu, Ran He, Zhen Lei, Stan Z. Li, Conghui He, Shuicheng Yan, Cheng Tan

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一致性三元组作为定义通用世界模型的原则,通过系统回顾多模态学习的演变,引入CoW-Bench基准测试,明确未来发展方向。

Comments 119 pages, 50 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23141 2026-02-27 cs.CV 57%

No Labels, No Look-Ahead: Unsupervised Online Video Stabilization with Classical Priors

无标签、无前瞻:基于经典先验的无监督在线视频稳定化

Tao Liu, Gang Wan, Kan Ren, Shibo Wen

机构 * School of Electronic and Optical Engineering, Nanjing University of Science and Technology(南京理工大学电子与光学工程学院) College of Geoexploration Science and Technology, Jilin University(吉林大学地球探测科学与技术学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于经典先验的无监督在线视频稳定化方法,通过多线程缓冲机制解决数据有限、可控性差和硬件效率低的问题,并在无人机夜间遥感等场景中取得优于现有方法的性能。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22963 2026-02-27 cs.AI 57%

FactGuard: Agentic Video Misinformation Detection via Reinforcement Learning

FactGuard:通过强化学习进行代理视频虚假信息检测

Zehao Li, Hongwei Yu, Hao Jiang, Qiang Sheng, Yilong Xu, Baolong Bi, Yang Li, Zhenlong Yuan, Yujun Cai, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) University of Science and Technology Beijing(北京科技大学) The University of Queensland, Brisbane, Australia(昆士兰大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 FactGuard通过强化学习和代理框架,提升视频虚假信息检测的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10195 2026-02-27 cs.LG cs.AI hep-th 57%

Versor: A Geometric Sequence Architecture

Versor:一种几何序列架构

Truong Minh Huy, Edward Hirst

机构 * Trương Minh Huy Independent Researcher(Trương Minh Huy 独立研究者) Instituto de Matemática, Estatística e Computação Científica University of Campinas (UNICAMP), Brazil(巴西坎皮纳斯大学数学、统计与科学计算研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 Versor通过共形几何代数实现结构泛化和高效任务处理,优于Transformer等基线模型。

Comments 19+28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22514 2026-02-27 cs.RO cs.AI cs.SY eess.SY 57%

SignVLA: A Gloss-Free Vision-Language-Action Framework for Real-Time Sign Language-Guided Robotic Manipulation

SignVLA:一种无 gloss 的视觉-语言-动作框架,用于实时 sign language 引导的机器人操作

Xinyu Tan, Ningwei Bai, Harry Gardener, Zhengyang Zhong, Luoyu Zhang, Liuhaichen Yang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * Department of Computer Science, University College London (UCL)(计算机科学系,伦敦大学学院(UCL))

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 SignVLA 提出了一种无 gloss 的视觉-语言-动作框架,用于实时手语引导的机器人操作,通过几何归一化、时间平滑和词汇精炼提升多模态交互的稳定性和可扩展性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22285 2026-02-27 cs.LG cs.AI 57%

Early Risk Stratification of Dosing Errors in Clinical Trials Using Machine Learning

利用机器学习进行临床试验中给药错误风险的早期风险分层

Félicien Hêche, Sohrab Ferdowsi, Anthony Yazdani, Sara Sansaloni-Pastor, Douglas Teodoro

机构 * Department of Radiology and Medical Informatics University of Geneva(放射学与医学信息学系,日内瓦大学) Actelion Pharmaceuticals Ltd(阿克泰隆制药有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出利用机器学习对临床试验中给药错误风险进行早期分层,通过融合结构化和非结构化数据,结合概率校准技术,实现可解释的风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22142 2026-02-26 cs.CV 57%

WeaveTime: Stream from Earlier Frames into Emergent Memory in VideoLLMs

WeaveTime: 从早期帧中流式传输以形成涌现记忆在视频LLMs中

Yulin Zhang, Cheng Shi, Sibei Yang

机构 * ShanghaiTech University(上海科技大学) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算科学与数据科学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 WeaveTime通过引入时间重建目标和动态关注缓存,提升视频LLMs在流式场景中的时间感知能力,减少延迟并提高准确性。

Comments Accepted at CVPR 2026 (preview; camera-ready in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21137 2026-02-25 cs.CV 57%

UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

UDVideoQA: 一个用于城市动态多对象时空推理的交通视频问答数据集

Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 UDVideoQA是一个用于城市动态多对象时空推理的交通视频问答数据集,通过统一标注流程生成28K问题-答案对,评估视觉定位和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17372 2026-02-25 cs.CV 57%

Tree crop mapping of South America reveals links to deforestation and conservation

南美树作物制图揭示与森林砍伐和保护的联系

Yuchang Jiang, Anton Raichuk, Xiaoye Tong, Vivien Sainte Fare Garnot, Daniel Ortiz-Gonzalo, Dan Morris, Konrad Schindler, Jan Dirk Wegner, Maxim Neumann

机构 * Google DeepMind(谷歌DeepMind) EcoVision Lab, DM3L, University of Zurich(EcoVision实验室、DM3L、苏黎世大学) University of Zurich(苏黎世大学) University of Copenhagen(哥本哈根大学) Google Research(谷歌研究) ETH Zürich(苏黎世联邦理工学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本研究通过高分辨率树作物制图揭示南美树作物与森林砍伐的联系,为制定有效且公平的保护政策提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19004 2026-02-24 cs.CV 57%

MoBind: Motion Binding for Fine-Grained IMU-Video Pose Alignment

MoBind:用于细粒度IMU-视频姿态对齐的运动绑定

Duc Duy Nguyen, Tat-Jun Chin, Minh Hoai

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 MoBind通过层次对比学习框架实现IMU与视频姿态的细粒度对齐,提升跨模态检索与动作识别性能。

Comments 8 pages, 6 tables, 7 figures, accepted to CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18716 2026-02-24 cs.RO cs.AI 57%

Temporal Action Representation Learning for Tactical Resource Control and Subsequent Maneuver Generation

战术资源控制与后续机动生成的时序动作表示学习

Hoseong Jung, Sungil Son, Daesol Cho, Jonghae Park, Changhyun Choi, H. Jin Kim

机构 * Seoul National University(首尔国立大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 TART通过时序动作表示学习框架,有效整合资源使用与机动生成,提升有限资源下的战术决策能力。

Comments ICRA 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18258 2026-02-23 cs.RO cs.CV 57%

RoEL: Robust Event-based 3D Line Reconstruction

RoEL: 基于事件的稳健3D线条重建

Gwangtak Bae, Jaeho Shin, Seunggu Kang, Junho Kim, Ayoung Kim, Young Min Kim

机构 * Dept. of Electrical and Computer Engineering, Seoul National University(电子与计算机工程系,首尔国立大学) Dept. of Future Automotive Mobility, Seoul National University(未来汽车移动系,首尔国立大学) Dept. of Mechanical Engineering, Seoul National University(机械工程系,首尔国立大学) University of Michigan(密歇根大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 RoEL通过稳健的3D线条重建方法,提升事件相机在复杂环境中的映射与姿态估计性能。

Comments IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17231 2026-02-20 cs.CV 57%

HiMAP: History-aware Map-occupancy Prediction with Fallback

HiMAP: 基于历史的无跟踪地图占用预测与回退

Yiming Xu, Yi Yang, Hao Cheng, Monika Sester

机构 * Institute of Cartography and Geoinformatics, Leibniz University Hannover(莱比锡大学汉诺威分校制图与地理信息学研究所) Institute of Information Processing, Leibniz University Hannover(莱比锡大学汉诺威分校信息处理研究所) Faculty of Geo-Information Science and Earth Observation, University of Twente(埃因霍温大学地球信息科学与地球观测系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 HiMAP通过无需跟踪的轨迹预测框架,在MOT失败时提供可靠预测,实现无ID的高精度未来轨迹生成。

Comments Accepted in 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08822 2026-02-19 cs.RO cs.AI 57%

FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency

FreqPolicy: 通过频率一致性实现高效的基于流的视觉-运动策略

Yifei Su, Ning Liu, Dong Chen, Zhen Zhao, Kun Wu, Meng Li, Zhiyuan Xu, Zhengping Che, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) NLPR, MAIS, Institute of Automation of Chinese Academy of Sciences(神经语言处理实验室、人工智能研究所、中国科学院自动化研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 FreqPolicy通过频率一致性约束提升基于流的视觉-运动策略的效率与质量,实现高效、高质量的动作生成。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15782 2026-02-18 cs.CV 57%

Meteorological data and Sky Images meets Neural Models for Photovoltaic Power Forecasting

气象数据与天空图像融合神经模型用于光伏功率预测

Ines Montoya-Espinagosa, Antonio Agudo

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出融合天空图像、光伏历史数据和气象数据的神经模型,提升光伏功率预测的准确性与鲁棒性,支持更高效的电网运行和太阳能管理。

Comments CAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15397 2026-02-18 cs.RO cs.AI 57%

ActionCodec: What Makes for Good Action Tokenizers

ActionCodec:什么使好的动作分词器成为可能

Zibin Dong, Yicheng Liu, Shiduo Zhang, Baijun Ye, Yifu Yuan, Fei Ni, Jingjing Gong, Xipeng Qiu, Hang Zhao, Yinchuan Li, Jianye Hao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Tianjin University(天津大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出ActionCodec,通过信息论原则提升动作分词性能,实现无需机器人预训练的VLA模型新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15329 2026-02-18 cs.CV 57%

EventMemAgent: Hierarchical Event-Centric Memory for Online Video Understanding with Adaptive Tool Use

EventMemAgent: 基于分层事件中心记忆的在线视频理解与自适应工具使用

Siwei Wen, Zhangcheng Wang, Xingjian Zhang, Lei Huang, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) Paradigm Inc.(4Paradigm公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 EventMemAgent通过分层事件中心记忆和自适应工具使用,解决在线视频理解中长程推理与细粒度细节的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10807 2026-02-18 cs.CV 57%

Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models

提示到摘要:基于大语言和视频模型的零样本语言引导视频摘要

Mario Barbara, Alaa Maalouf

机构 * Department of Computer Science, the University of Haifa(哈ifa大学计算机科学系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出一种基于大语言和视频模型的零样本视频摘要方法,通过提示生成用户引导的摘要,无需训练数据,优于现有无监督和监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14653 2026-02-17 cs.CL 57%

Is Information Density Uniform when Utterances are Grounded on Perception and Discourse?

当话语基于感知和话语进行 grounding 时,信息密度是否均匀?

Matteo Gay, Coleman Haley, Mario Giulianelli, Edoardo Ponti

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究首次探讨了基于感知和话语的视觉环境对信息密度均匀性的影响,发现 grounding 能提高信息分布的均匀性,并在话语单元开始处产生最大的惊奇度降低。

Comments Accepted as main paper at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14214 2026-02-17 cs.CV 57%

HiVid: LLM-Guided Video Saliency For Content-Aware VOD And Live Streaming

HiVid: 基于大语言模型的视频显著性识别用于内容感知点播与直播

Jiahui Chen, Bo Peng, Lianchen Jia, Zeyu Zhang, Tianchi Huang, Lifeng Sun

机构 * Tsinghua University(清华大学) The Australian National University(澳大利亚国立大学) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 HiVid利用大语言模型生成内容感知的视频显著性权重,提升点播和直播的QoE性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13496 2026-02-17 cs.CY cs.AI 57%

Future of Edge AI in biodiversity monitoring

边缘AI在生物多样性监测中的未来

Aude Vuilliomenet, Kate E. Jones, Duncan Wilson

机构 * The Bartlett Centre for Advanced Spatial Analysis, Faculty of the Built Environment, University College London(大学学院) Centre for Biodiversity and Environment Research, Department of Genetics, Evolution and Environment, University College London(大学学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文研究了边缘AI在生物多样性监测中的应用,分析了不同系统类型及其权衡,强调了跨学科合作的重要性。

Comments 41 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22335 2026-02-13 cs.RO cs.CV 57%

UP-SLAM: Adaptively Structured Gaussian SLAM with Uncertainty Prediction in Dynamic Environments

UP-SLAM:适应性结构高斯SLAM与动态环境中的不确定性预测

Wancai Zheng, Linlin Ou, Jiajie He, Libo Zhou, Xinyi Yu, Yan Wei

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 UP-SLAM通过并行框架解耦跟踪与建图,利用概率八叉树和不确定性估计器提升动态环境中的SLAM性能。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08828 2026-02-10 cs.CV 57%

VideoVeritas: AI-Generated Video Detection via Perception Pretext Reinforcement Learning

VideoVeritas:通过感知预设强化学习实现AI生成视频检测

Hao Tan, Jun Lan, Senyuan Shi, Zichang Tan, Zijian Yu, Huijia Zhu, Weiqiang Wang, Jun Wan, Zhen Lei

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VideoVeritas通过感知预设强化学习提升AI生成视频检测性能,整合细粒度感知与事实推理,采用时空定位和自监督计数提升检测效果。

Comments Project: https://github.com/EricTan7/VideoVeritas

详情

展开后加载摘要…

URL PDF HTML 收藏