arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4729 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4729 篇

2506.06097 2026-03-17 cs.CV 57%

VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning

VideoChat-A1: 通过镜头链推理实现长视频的思考

Zikang Wang, Boyu Chen, Zhengrong Yue, Yi Wang, Yu Qiao, Limin Wang, Yali Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14750 2026-03-17 cs.CV 57%

Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localization

基于面部引导的弱监督时间情感定位边界增强

Cailing Han, Zhangbin Li, Jinxing Zhou, Wei Qian, Jingjing Hu, Yanghao Zhou, Zhangling Duan, Dan Guo

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FSENet框架,通过面部特征引导情感定位,解决弱监督时间情感定位中的边界不精确问题,实现跨不同标注设置的高泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-03-17 cs.CV 57%

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14401 2026-03-17 cs.RO cs.CV 57%

OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer

OCRA:基于3D和触觉先验的人到机器人动作迁移的物体中心学习

Kuanning Wang, Ke Fan, Yuqian Fu, Siyu Lin, Hu Luo, Daniel Seita, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 OCRA通过结合3D和触觉先验,利用多视角视频和先进模型重建物体中心3D点云,生成稳健的机器人操作动作,实验表明其在视觉和视觉-触觉任务中优于现有方法。

Comments Project page: https://sressers.github.io/OCRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14361 2026-03-17 cs.CV 57%

BROTHER: Behavioral Recognition Optimized Through Heterogeneous Ensemble Regularization for Ambivalence and Hesitancy

BROTHER: 通过异质性集成正则化优化行为识别以应对矛盾与犹豫

Alexandre Pereira, Bruno Fernandes, Pablo Barros

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BROTHER框架,通过异质集成正则化方法,结合视觉、音频和语言数据,提升对矛盾与犹豫等复杂行为状态的识别能力,采用PSO硬投票集成策略,实现宏F1分数达0.7465。

Comments 5 pages, 2 figures, 3 tables, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ABAW10th, CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14300 2026-03-17 cs.CV 57%

Show Me When and Where: Towards Referring Video Object Segmentation in the Wild

展示时间与地点:迈向野外的指称视频对象分割

Mingqi Gao, Jinyu Yang, Jingnan Luo, Xiantong Zhen, Jungong Han, Giovanni Montana, Feng Zheng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种新的野外指称视频对象分割任务,引入了包含更多时长和场景的YoURVOS数据集,并提出OMFormer方法以实现高效的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14245 2026-03-17 cs.LG cs.AI 57%

GoldenStart: Q-Guided Priors and Entropy Control for Distilling Flow Policies

GoldenStart: 基于Q引导先验和熵控制的流策略蒸馏

He Zhang, Ying Sun, Hui Xiong

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出GoldenStart方法,通过Q引导先验和显式熵控制,改进流匹配策略的生成起点和探索能力,实现在连续控制任务中高效且具有探索性的策略。

Comments 23 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01804 2026-03-17 cs.CV 57%

V-CORE: Temporally Consistent Video Understanding for Video-LLM

V-CORE:面向视频大语言模型的时序一致视频理解

Zhengjian Kang, Qi Chen, Rui Liu, Kangtong Mo, Xingyu Zhang, Xiaoyu Deng, Ye Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 V-CORE通过引入显式时序约束提升视频理解性能,采用可学习空间聚合和因果感知时间投影器,有效解决视频时序一致性问题,在多个基准测试中取得显著成果。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19554 2026-03-17 cs.CV 57%

Harvest Video Foundation Models via Efficient Post-Pretraining

通过高效后预训练收获视频基础模型

Yizhuo Li, Kunchang Li, Yinan He, Yi Wang, Yali Wang, Limin Wang, Yu Qiao, Ping Luo

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种高效框架,通过随机丢弃视频片段和遮蔽文本来从图像基础模型中获取视频基础模型,提升了训练效率并强化了跨模态融合,实验表明其在多种视频-语言任务中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13412 2026-03-17 cs.CV 57%

WAT: Online Video Understanding Needs Watching Before Thinking

WAT:在线视频理解需要先观看再思考

Zifan Han, Hongbo Sun, Jinglin Xu, Canhui Tang, Yulong Lei, Xuchong Zhang, Hongbin Sun, Zhongjiang He, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology Beijing(北京科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07976 2026-03-17 cs.RO cs.CV 57%

VLD: Visual Language Goal Distance for Reinforcement Learning Navigation

VLD:用于强化学习导航的视觉语言目标距离

Lazar Milikic, Manthan Patel, Jonas Frey

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(瑞士联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VLD学习框架,通过解耦感知学习与策略学习,利用大规模视频数据训练距离预测器,提升机器人导航性能与现实迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12480 2026-03-16 cs.RO cs.AI 57%

One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies

一步流策略:用于快速视觉-运动策略的自蒸馏

Shaolong Li, Lichao Sun, Yongchao Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一步流策略,通过自蒸馏实现高保真单步动作生成,无需预训练教师模型,有效提升动作生成速度和控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03464 2026-03-13 cs.CL 57%

Prompting Underestimates LLM Capability for Time Series Classification

提示低估了LLM在时间序列分类中的能力

Dan Schumacher, Erfan Nourbakhsh, Rocky Slavin, Anthony Rios

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过对比提示输出与线性探针,揭示LLM在时间序列分类中的实际能力被提示评估低估,且早期Transformer层能有效捕捉时间序列信息。

Comments 8 pages + Appendix and References, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11439 2026-03-13 cs.CV 57%

Stay in your Lane: Role Specific Queries with Overlap Suppression Loss for Dense Video Captioning

Stay in your Lane: 角色特定查询与重叠抑制损失用于密集视频描述

Seung Hyup Baek, Jimin Lee, Hyeongkeun Lee, Jae Won Cho

机构 * Konkuk University(韩国康 kuk 大学) Sejong University(世宗大学) KAIST(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出角色特定查询与重叠抑制损失,用于解决密集视频描述中的多任务干扰和时间冗余问题,通过分离定位与描述任务并增强语义一致性,提升描述精度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11423 2026-03-13 cs.CV 57%

Beyond Single-Sample: Reliable Multi-Sample Distillation for Video Understanding

超越单样本:面向视频理解的可靠多样本蒸馏

Songlin Li, Xin Zhu, Zechao Guan, Peipeng Chen, Jian Yao

机构 * University of Electronic Science and Technology of China & Robotics Center(电子科技大学 & 机器人中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出R-MSD方法,通过任务自适应教师池和对抗蒸馏目标提升视频理解任务的蒸馏稳定性,实验显示在多个基准上优于单样本蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22433 2026-03-13 cs.CV 57%

SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition

SkeletonAgent: 一种基于骨架的动作识别代理交互框架

Hongda Liu, Yunfan Liu, Changlu Wang, Yunlong Wang, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(神经信息处理研究室,自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 SkeletonAgent通过Questioner和Selector两个代理连接识别模型与LLM,提升基于骨架的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07071 2026-03-11 cs.CV 57%

VirtueBench: Evaluating Trustworthiness under Uncertainty in Long Video Understanding

VirtueBench: 在长视频理解中评估在不确定性下的可信度

Xueqing Yu, Bohan Li, Yan Li, Zhenheng Yang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 VirtueBench通过评估模型在不确定性下的可信度,揭示了长视频理解中模型拒绝行为的差异及可靠性问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07660 2026-03-10 cs.CV 57%

Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

Holi-Spatial: 将视频流转化为整体3D空间智能

Yuanyuan Gao, Hao Li, Yifei Liu, Xinhao Ji, Yuning Gong, Yuanjun Liao, Fangfu Liu, Manyuan Zhang, Yuchen Yang, Dan Xu, Xue Yang, Huaxi Huang, Hongjie Zhang, Ziwei Liu, Xiao Sun, Dingwen Zhang, Zhihang Zhong

机构 * Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Sichuan University(四川大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Holi-Spatial通过自动化方法构建大规模多模态3D空间数据集,提升空间推理任务的模型性能。

Comments project page: https://visionary-laboratory.github.io/holi-spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08942 2026-03-10 cs.LG cs.AI 57%

Language in the Flow of Time: Time-Series-Paired Texts Weaved into a Unified Temporal Narrative

时间之流中的语言:将时间序列配对文本编织成统一的时间叙事

Zihao Li, Xiao Lin, Zhining Liu, Jiaru Zou, Ziwei Wu, Lecheng Zheng, Dongqi Fu, Yada Zhu, Hendrik Hamann, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta IBM Research(IBM研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出TaTS框架,将时间序列配对文本作为辅助变量,提升多模态时间序列预测性能。

Comments ICLR 2026, 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06732 2026-03-10 cs.CV 57%

HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos

HERO: 分层嵌入-细化用于视频中开放词汇时间句接地

Tingting Han, Xinsong Tao, Yufei Yin, Min Tan, Sicheng Zhao, Zhou Yu

机构 * Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院) Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 HERO提出一种分层嵌入-细化框架,用于视频中开放词汇时间句接地,通过多级语义建模和跨模态细化提升视频与语言的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05923 2026-03-09 cs.CL cs.HC 57%

Learning Next Action Predictors from Human-Computer Interaction

从人机交互中学习下一步动作预测器

Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi, Yikun Chi, Nick Haber, Thomas Robinson, Nilam Ram, Byron Reeves, Sherry Yang, Michael S. Bernstein, Diyi Yang

机构 * Stanford University(斯坦福大学) Hasso Plattner Institute(哈索普拉特纳研究所) New York University(纽约大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。

Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04461 2026-03-09 cs.CV 57%

UniTS: Unified Spatio-Temporal Generative Model for Remote Sensing

UniTS:面向遥感的统一时空生成模型

Yuxiang Zhang, Shunlin Liang, Wenyuan Li, Han Ma, Jianglei Xu, Yichuan Ma, Jiangwei Xie, Wei Li, Mengmeng Zhang, Ran Tao, Xiang-Gen Xia

机构 * Jockey Club STEM Laboratory of Quantitative Remote Sensing(裘英俊STEM实验室(定量遥感)) Department of Geography, the University of Hong Kong(香港大学地理系) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息电子学院) Beijing Key Laboratory of Fractional Signals and Systems(北京分数信号与系统重点实验室) Department of Electrical and Computer Engineering, University of Delaware(德雷塞尔大学电气与计算机工程系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniTS提出了一种统一时空生成模型,整合时间序列重建、云去除、语义变化检测和预测等任务,通过自适应条件注入和时空感知调节器提升多模态生成质量,有效应对复杂环境挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05554 2026-03-09 cs.CV cs.IR 57%

RED: Robust Event-Guided Motion Deblurring with Modality-Specific Disentanglement

RED: 基于事件引导的鲁棒运动去模糊化与模态特定解耦

Yihong Leng, Siming Zheng, Jinwei Chen, Bo Li, Jiaojiao Li, Peng-Tao Jiang

机构 * Xidian University(西安电子科技大学) vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 RED通过事件引导的鲁棒运动去模糊化方法,结合模态特定解耦与选择性融合,提升模糊图像的清晰度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11245 2026-03-09 cs.CV 57%

NarrLV: Towards a Comprehensive Narrative-Centric Evaluation for Long Video Generation

NarrLV: 向长视频生成的综合性叙事导向评估迈进

X. Feng, H. Yu, M. Wu, S. Hu, J. Chen, C. Zhu, J. Wu, X. Chu, K. Huang

机构 * UCAS CASIA(中国科学院自动化研究所) AMAP, Alibaba Group(阿里云实验室) NTU(国立科技大学) PKU(北京大学)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 NarrLV是首个针对长视频生成模型的综合性叙事评估基准,通过引入时间叙事原子和基于MLLM的评估指标,全面评估模型在叙事表达上的能力。

Comments Project Page: https://amap-ml.github.io/NarrLV-Website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02282 2026-03-06 cs.CV cs.LG 57%

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释

Kyoungjun Park, Yifan Yang, Juheon Yi, Shicheng Zheng, Yifei Shen, Dongqi Han, Caihua Shan, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04222 2026-03-05 cs.RO cs.AI 57%

PRAM-R: A Perception-Reasoning-Action-Memory Framework with LLM-Guided Modality Routing for Adaptive Autonomous Driving

PRAM-R:一种具有LLM引导模态路由的感知-推理-行动-记忆框架,用于自适应自动驾驶

Yi Zhang, Xian Zhang, Saisi Zhao, Yinglei Song, Chengdong Wu, Nenad Petrovic, Alois Knoll

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 PRAM-R通过LLM引导的模态路由和分层记忆模块,实现高效自适应的多模态感知,提升自动驾驶的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04057 2026-03-05 cs.RO cs.AI 57%

Sim2Sea: Sim-to-Real Policy Transfer for Maritime Vessel Navigation in Congested Waters

Sim2Sea: 用于拥挤水域船舶导航的仿真到现实策略迁移

Xinyu Cui, Xuanfa Jin, Xue Yan, Yongcheng Zeng, Luoyang Sun, Siying Wei, Ruizhi Zhang, Jian Zhao, Haifeng Zhang, Jun Wang

机构 * Institute of Automation, CAS(中国科学院自动化研究所) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) University College London(伦敦大学学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 Sim2Sea通过GPU加速模拟器、双流时空策略和领域随机化方案,实现了拥挤水域中船舶自主导航的仿真到现实策略迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03985 2026-03-05 cs.CV 57%

RIVER: A Real-Time Interaction Benchmark for Video LLMs

RIVER:面向视频大语言模型的实时交互基准

Yansong Shi, Qingsong Zhao, Tianxiang Jiang, Xiangyu Zeng, Yi Wang, Limin Wang

机构 * School of Information Science And Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) State Key Lab of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 RIVER基准通过引入实时交互任务框架,改进视频大语言模型的实时交互能力,提升长期记忆与未来感知表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16677 2026-03-05 cs.CV cs.LG cs.RO eess.IV 57%

Segment-to-Act: Label-Noise-Robust Action-Prompted Video Segmentation Towards Embodied Intelligence

基于动作的视频分割:面向具身智能的标签噪声鲁棒动作引导分割

Wenxin Li, Kunyu Peng, Di Wen, Ruiping Liu, Mengfei Duan, Kai Luo, Kailun Yang

机构 * School of Artificial Intelligence and Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University, China(人工智能与机器人学院及机器人视觉感知与控制技术国家工程研究中心,湖南大学,中国) Institute for Anthropomatics and Robotics, Karlsruhe Institute of Technology, Germany(人机学与机器人研究所,卡尔斯鲁厄理工学院,德国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本研究首次探索基于动作的视频对象分割在标签噪声下的鲁棒性,引入两种噪声类型并提出并行掩码头机制以提升分割性能。

Comments Accepted to ICRA 2026. The established benchmark and source code will be made publicly available at https://github.com/mylwx/ActiSeg-NL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02470 2026-03-04 cs.IT cs.LG cs.MM eess.IV math.IT 57%

Video TokenCom: Textual Intent-Guided Multi-Rate Video Token Communications with UEP-Based Adaptive Source-Channel Coding

视频令牌通信:基于UEP的自适应源信道编码的文本意图引导多速率视频令牌通信

Jingxuan Men, Mahdi Boloursaz Mashhadi, Ning Wang, Yi Ma, Mike Nilsson, Rahim Tafazolli

机构 * GIC & 6GIC, Institute for Communication Systems (ICS), University of Surrey(5GIC与6GIC,通信系统研究所(ICS),塞夫尔大学) Smart Internet Lab, University of Bristol(智能互联网实验室,布里斯托尔大学) British Telecom Research Lab, BT Group plc(英国电信研究实验室,BT集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出基于UEP的自适应源信道编码的视频令牌通信框架,通过文本意图引导的多速率视频通信提升语义保真度和传输效率。

详情

展开后加载摘要…

URL PDF HTML 收藏