arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2502.00702 2025-12-11 cs.HC cs.NI cs.SD eess.AS eess.IV 57%

CardioLive: Empowering Video Streaming with Online Cardiac Monitoring

CardioLive: 通过在线心脏监测增强视频流媒体

Sheng Lyu, Ruiming Huang, Sijie Ji, Yasar Abbas Ur Rehman, Lan Ma, Chenshu Wu

机构 * Department of Computer Science, The University of Hong Kong, Hong Kong SAR(香港大学计算机科学系) TCL AI Lab, Hong Kong SAR(TCL人工智能实验室)

专题命中 视频多模态 :audio-visual(abstract);分类 eess.AS

AI总结 CardioLive通过在线心脏监测技术,在视频流媒体中实现对生理信息的提取与分析,提升远程医疗和情感计算等应用的性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06301 2025-12-10 cs.AI 57%

Large Language Models and Their Applications in Roadway Safety and Mobility Enhancement: A Comprehensive Review

大语言模型及其在道路安全与出行提升中的应用:全面综述

Muhammad Monjurul Karim, Yan Shi, Shucheng Zhang, Bingzhang Wang, Mehrdad Nasri, Yinhai Wang

机构 * Department of Civil and Environmental Engineering, University of Washington(土木与环境工程系,华盛顿大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了大语言模型在道路安全与出行提升中的应用,探讨其在交通领域的适应策略及面临的挑战。

Journal ref Artificial Intelligence for Transportation, 1, 100004, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05524 2025-12-09 cs.CV 57%

VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation

VOST-SGG:基于视觉语言模型的一阶段时空场景图生成

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VOST-SGG通过整合视觉语言模型的常识推理能力,提出了一种基于多模态特征和双源查询初始化的一阶段时空场景图生成方法,实现了对视频中对象及其关系的高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14861 2025-12-09 cs.AI 57%

LabOS: The AI-XR Co-Scientist That Sees and Works With Humans

LabOS:能够看见并与人类协作的AI-XR共科学家

Le Cong, David Smerkous, Xiaotong Wang, Di Yin, Zaixi Zhang, Ruofan Jin, Yinkai Wang, Michal Gerasimiuk, Ravi K. Dinesh, Alex Smerkous, Lihan Shi, Joy Zheng, Ian Lam, Xuekun Wu, Shilong Liu, Peishan Li, Yi Zhu, Ning Zhao, Meenal Parakh, Simran Serrao, Imran A. Mohammad, Chao-Yeh Chen, Xiufeng Xie, Tiffany Chen, David Weinstein, Greg Barbone, Belgin Caglar, John B. Sunwoo, Fuxin Li, Jia Deng, Joseph C. Wu, Sanfeng Wu, Mengdi Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 LabOS是一种通过多模态感知和增强现实实现人机协作的AI系统,能实时协助科学家进行实验,推动实验室向智能协作环境发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06674 2025-12-09 cs.CV 57%

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

RunawayEvil: 对图像到视频生成模型的劫持

Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan

机构 * PRLab, Nanjing University(南京大学PRLab) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07978 2025-12-08 cs.CV 57%

Martian World Model: Controllable Video Synthesis with Physically Accurate 3D Reconstructions

火星世界模型:可控视频合成与物理准确的3D重建

Longfei Li, Zhiwen Fan, Wenyan Cong, Xinhang Liu, Yuyang Yin, Matt Foutter, Panwang Pan, Chenyu You, Yue Wang, Zhangyang Wang, Yao Zhao, Marco Pavone, Yunchao Wei

机构 * BJTU(北京工业大学) UT Austin(德克萨斯大学奥斯汀分校) HKUST(香港科技大学) Stanford University(斯坦福大学) XMU(厦门大学) SBU(雪城大学) USC(南加州大学) NVIDIA(英伟达)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出M3arsSynth和MarsGen,通过物理准确的3D重建生成逼真的火星视频,提升任务模拟与机器人训练的可视化效果。

Comments Project Page: https://marsgenai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03918 2025-12-04 cs.CV 57%

UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework

UniMo:基于自回归框架统一2D视频与3D人体运动

Youxin Pang, Yong Zhang, Ruizhi Shao, Xiang Deng, Feng Gao, Xu Xiaoming, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniMo通过自回归框架统一2D视频与3D人体运动,实现同时生成与理解,提升多模态联合建模能力。

Comments https://carlyx.github.io/UniMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03837 2025-12-04 cs.CV 57%

Heatmap Pooling Network for Action Recognition from RGB Videos

用于RGB视频中动作识别的热图池化网络

Mengyuan Liu, Jinfu Liu, Yongkang Jiang, Bin He

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家通用人工智能重点实验室,北京大学深圳研究生院) Imaging Department, DJI Technology Co., Ltd(大疆技术创新有限公司影像部) TongJi University(同济大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种用于视频中动作识别的热图池化网络,通过反馈池化模块提取稳健且简洁的人体特征,并结合多模态数据提升识别性能。

Comments Final Version of IEEE Transactions on Pattern Analysis and Machine Intelligence

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03687 2025-12-04 cs.CV 57%

Active Visual Perception: Opportunities and Challenges

主动视觉感知:机遇与挑战

Yian Li, Xiaoyu Guo, Hao Zhang, Shuiwang Li, Xiaowei Dai

机构 * College of Computer Science and Engineering, Guilin University of Technology(桂林理工大学计算机科学与工程学院) New Engineering Industry College, Putian University(莆田大学新工程产业学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨了主动视觉感知在复杂环境中的应用与挑战,分析了其在机器人、自动驾驶等领域的潜力及面临的实时处理与多模态整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03580 2025-12-04 cs.CV cs.CR 57%

Dynamic Optical Test for Bot Identification (DOT-BI): A simple check to identify bots in surveys and online processes

动态光学测试用于机器人识别(DOT-BI):一种简单的检查以在调查和在线过程中识别机器人

Malte Bleeker, Mauro Gotsch

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 DOT-BI通过利用人类对运动的感知来识别自动化系统,通过隐藏数字的动态特性区分人类与机器人,实验表明其在调查和在线过程中具有高识别率和良好的用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05661 2025-12-04 cs.CV 57%

Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation

基于语言的面向对象两阶段方法用于场景图预见

Xiaomeng Zhu, Changwei Wang, Haozhe Wang, Xinyu Liu, Fangzhen Lin

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁大学) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(跨学科研究学院,香港科学与技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于语言的面向对象两阶段方法,通过时间一致性正则化预测对象集动态和关系轨迹,显著提升视频场景图预见性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01312 2025-12-02 cs.CV 57%

IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval

IVCR-200K: 一个大规模多轮对话基准数据集用于交互视频语料检索

Ning Han, Yawen Zeng, Shaohua Long, Chengqing Li, Sijie Yang, Dun Tan, Jianfeng Dong, Jingjing Chen

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Zhejiang Gongshang University(浙江工商大学) Fudan University(复旦大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出IVCR-200K数据集及基于多模态大语言模型的框架,用于交互视频语料检索,提升多轮对话式交互效果。

Comments Accepted by SIGIR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01298 2025-12-02 cs.CV 57%

TBT-Former: Learning Temporal Boundary Distributions for Action Localization

TBT-Former:基于时间边界分布的学习用于动作定位

Thisara Rathnayaka, Uthayasanker Thayasivam

机构 * Dept. of Computer Science \& Engineering University of Moratuwa Sri Lanka

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 TBT-Former通过改进的Transformer架构和边界分布回归头,提升动作定位性能,实现THUMOS14和EPIC-Kitchens 100数据集上的新高。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00953 2025-12-02 cs.CV 57%

Adaptive Evidential Learning for Temporal-Semantic Robustness in Moment Retrieval

自适应证据学习用于时刻检索中的时序-语义鲁棒性

Haojian Huang, Kaijing Ma, Jin Chen, Haodong Chen, Zhou Wu, Xianghao Zang, Han Fang, Chao Ban, Hao Sun, Mulin Chen, Zhongjiang He

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DEMR框架,通过引入RFF模块和几何正则化器,提升时刻检索中对复杂视频场景的适应性与鲁棒性。

Comments Accepted by AAAI 2026, 10 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23477 2025-12-01 cs.CV 57%

Video-CoM: Interactive Video Reasoning via Chain of Manipulations

Video-CoM:通过操作链进行交互式视频推理

Hanoona Rasheed, Mohammed Zumri, Muhammad Maaz, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) University of California Merced(加州梅尔 Ced 大学) Google Research(谷歌研究院) Linköping University(林奈大学) Australian National University(澳大利亚国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-CoM通过操作链实现交互式视频推理,提升视频理解任务的性能和可解释性

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11423 2025-12-01 cs.AI 57%

CURENet: Combining Unified Representations for Efficient Chronic Disease Prediction

CURENet:结合统一表示以实现高效的慢性疾病预测

Cong-Tinh Dao, Nguyen Minh Thao Phan, Jun-En Ding, Chenwei Wu, David Restrepo, Dongsheng Luo, Fanyi Zhao, Chun-Chieh Liao, Wen-Chih Peng, Chi-Te Wang, Pei-Fu Chen, Ling Chen, Xinglong Ju, Feng Liu, Fang-Ming Hung

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Can Tho University(Cần Thơ 大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Michigan(密歇根大学) Massachusetts Institute of Technology(麻省理工学院) Florida International University(佛罗里达国际大学) Southern Utah University(南方犹他大学) Far Eastern Memorial Hospital(东方纪念医院) Yuan Ze University(元智大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 CURENet通过整合多模态EHR数据,利用LLMs和Transformer编码器提升慢性疾病预测的准确率,达到94%以上的预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19637 2025-12-01 cs.CV 57%

Enhanced Partially Relevant Video Retrieval through Inter- and Intra-Sample Analysis with Coherence Prediction

通过互样本分析和内样本分析增强部分相关视频检索

Junlong Ren, Gangjian Zhang, Yu Hu, Jian Shu, Hui Xiong, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种增强部分相关视频检索的方法,通过互样本分析和内样本分析,结合时间一致性预测模块,提升视频与文本查询的语义对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02364 2025-12-01 eess.AS 57%

State-of-the-art Embeddings with Video-free Segmentation of the Source VoxCeleb Data

最先进的无视频分割源 VoxCeleb 数据嵌入

Sara Barahona, Ladislav Mošner, Themos Stafylakis, Oldřich Plchot, Junyi Peng, Lukáš Burget, Jan Černocký

专题命中 视频多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出了一种无需视频分割的说话人嵌入提取方法,利用弱标注数据训练提取器,实现了最先进的说话人验证性能,并提供了无需视觉的替代数据集创建方案。

Comments Accepted at the IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22036 2025-12-01 cs.CL cs.LG 57%

ResearchArcade: Graph Interface for Academic Tasks

ResearchArcade: 用于学术任务的图界面

Jingjun Xu, Chongshan Lin, Haofei Yu, Tao Feng, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL

AI总结 ResearchArcade是一种基于图的学术任务接口,通过统一多源数据和多模态信息,提升机器学习模型在学术研究中的性能与应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17490 2025-11-27 cs.CV 57%

Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination

Video-R4:通过视觉沉思强化文本丰富的视频推理

Yolo Y. Tang, Daiki Shimada, Hang Hua, Chao Huang, Jing Bi, Rogerio Feris, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Sony Group Corporation(索尼集团) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-R4通过视觉沉思机制提升文本丰富视频的推理能力,采用多阶段学习框架实现像素基础的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01533 2025-11-27 cs.CV 57%

ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models

ReasonAct: 为小模型在细粒度视频推理中的渐进训练

Jiaxin Liu, Zhaolu Kang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ReasonAct通过三阶段训练提升小模型细粒度视频推理性能,实现比基线更高的准确率和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19882 2025-11-26 cs.CV 57%

ChessMamba: Structure-Aware Interleaving of State Spaces for Change Detection in Remote Sensing Images

ChessMamba: 结构感知的多时态空间交错用于遥感图像变化检测

Lei Ding, Tong Liu, Xuanguang Liu, Xiangyun Liu, Haitao Guo, Jun Lu

机构 * Information Engineering University(信息工程大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ChessMamba通过结构感知的交错状态空间建模,提升多时态遥感图像变化检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12959 2025-11-26 cs.CV 57%

Time-step Mixup for Efficient Spiking Knowledge Transfer from Appearance to Event Domain

时间步混合用于从外观域到事件域的高效脉冲知识转移

Yuqi Xie, Shuhan Ye, Yi Yu, Chong Wang, Qixin Zhang, Jiazhen Xu, Le Shen, Yuanbin Qian, Jiangbo Qian, Guoqi Li

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出时间步混合知识转移方法,通过细粒度混合策略和模态感知辅助学习目标,实现从外观到事件域的高效脉冲神经网络知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19236 2025-11-25 cs.RO cs.AI 57%

SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control

SENTINEL:一种用于人形机器人全身控制的端到端语言-动作模型

Yuxuan Wang, Haobin Jiang, Shiqing Yao, Ziluo Ding, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 SENTINEL是一种端到端语言-动作模型,通过直接映射语言指令和本体感觉输入到低层动作,实现人形机器人全身控制,并支持多模态扩展。

Comments 23 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18920 2025-11-25 cs.CV 57%

EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models

EventSTU: 基于事件的高效空间-时间理解用于视频大语言模型

Wenhao Xu, Xin Dong, Yue Li, Haoyuan Shi, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 EventSTU通过事件引导的方法,高效处理视频大语言模型的空间-时间理解,实现显著的计算效率提升和性能优化。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18814 2025-11-25 cs.CV 57%

DetAny4D: Detect Anything 4D Temporally in a Streaming RGB Video

DetAny4D: 在流式RGB视频中实现任意4D检测

Jiawei Hou, Shenghao Zhang, Can Wang, Zheng Gu, Yonggen Ling, Taiping Zeng, Xiangyang Xue, Jingbo Zhang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 DetAny4D通过端到端框架实现流式RGB视频中任意4D物体检测,提升时间稳定性和检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18700 2025-11-25 cs.MM 57%

When Top-ranked Recommendations Fail: Modeling Multi-Granular Negative Feedback for Explainable and Robust Video Recommendation

当顶级推荐失效时:建模多粒度负面反馈以实现可解释且稳健的视频推荐

Siran Chen, Boyu Chen, Chenyun Yu, Yi Ouyang, Cheng Lei, Chengxiang Zhuo, Zang Li, Yali Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出ENF框架和S-GRPO算法,通过多粒度负面反馈建模提升视频推荐的可解释性和鲁棒性,实验表明在负面反馈预测和用户满意度提升方面效果显著。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16669 2025-11-25 cs.CV 57%

Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO

视频作答:联合GRPO预测并生成下一个视频事件

Junhao Cheng, Liang Hou, Xin Tao, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VANS通过联合GRPO方法,利用强化学习对齐视觉-语言模型与视频扩散模型,实现视频下一个事件预测任务的高精度视频生成与描述生成。

Comments Project page: https://video-as-answer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18382 2025-11-25 cs.CV 57%

ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access

ViMix-14M:一个经过精心整理的多源视频-文本数据集,具有长形式、高质量的描述和无爬虫访问

Timing Yang, Sucheng Ren, Alan Yuille, Feng Wang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ViMix-14M是一个经过精心整理的多源视频-文本数据集,提供无爬虫访问、高质量描述和长形式文本,用于提升视频生成和多模态任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17943 2025-11-25 cs.CV 57%

SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System

SciEducator: 基于Deming循环多智能体系统的科学视频理解与教育

Zhiyu Xu, Weilong Yan, Yufei Shi, Xin Meng, Tao He, Huiping Zhuang, Ming Li, Hehe Fan

机构 * Jinan University(济南大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) South China University of Technology(华南理工大学) Guangming Laboratory(光明实验室) Zhejiang University(浙江大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SciEducator通过Deming循环多智能体系统实现科学视频的自演化理解与教育,生成多模态教学内容并超越现有大语言模型和视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏