arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-10 至 2026-03-10 共收录 28 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2510.11549 2026-03-10 cs.CV 57%

ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?

ODI-Bench: MLLMs能否理解沉浸式全向环境?

Liu Yang, Huiyu Duan, Ran Tao, Juntao Cheng, Sijing Wu, Yunhao Li, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) Tianjin University(天津大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 ODI-Bench旨在评估多模态大语言模型对全向图像沉浸环境的理解能力,通过定制基准和Omni-CoT方法提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06263 2026-03-10 cs.CV 57%

iLLaVA: An Image is Worth Fewer Than 1/3 Input Tokens in Large Multimodal Models

iLLaVA: 图像的价值少于三分之一的输入标记在大型多模态模型中

Lianyu Hu, Liqing Gao, Fanhua Shang, Liang Wan, Wei Feng

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Computer Science and Technology, Tiangong University(天津工大学计算机科学与技术学院) Key Research Center for Surface Monitoring and Analysis of Relics, State Administration of Cultural Heritage(文物表面监测与分析关键研究中心,国家文物局)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 iLLaVA通过联合优化图像编码器和LLM,减少冗余标记并提升吞吐量,实现更高效的多模态模型性能。

Comments Accepted by ICLR2026,code is released at https://github.com/hulianyuyy/iLLaVA

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 7 篇

2603.08028 2026-03-10 cs.CV cs.MM 84%

Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades

通过文本到骨骼级联实现可控的复杂人类运动视频生成

Ashkan Taghipour, Morteza Ghahremani, Zinuo Li, Hamid Laga, Farid Boussaid, Mohammed Bennamoun

机构 * Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) Munich Center for Machine Learning (MCML) and Technical University of Munich (TUM)(慕尼黑机器学习中心(MCML)和技术大学慕尼黑(TUM)) School of Information Technology, Murdoch University(信息科技学院,墨尔本大学) Department of Electrical, Electronics and Computer Engineering, The University of Western Australia(电子、电子与计算机工程系,西澳大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出通过文本到骨骼级联框架生成可控复杂人类运动视频,解决文本条件模糊和姿态控制成本高的问题,引入合成数据集并展示模型在多个指标上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00586 2026-03-10 cs.CV 79%

WildActor: Unconstrained Identity-Preserving Video Generation

WildActor: 无约束身份保持视频生成

Qin Guo, Tianyu Yang, Xuanhua He, Fei Shen, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Dan Xu

机构 * The Hong Kong University of Science(香港科学与技术大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 WildActor通过不对称注意力机制和视点自适应采样策略,在无约束视角下实现身份保持的人类视频生成。

Comments Project Page: https://wildactor.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07028 2026-03-10 cs.CR cs.CV 79%

Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking

两个框架至关重要:一种针对文本到视频模型劫持的时序攻击

Moyang Chen, Zonghao Ying, Wenzhuo Xu, Quancheng Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

机构 * College of Science, Mathematics and Technology, Wenzhou-Kean University(科学、数学与技术学院,温州市凯恩大学) State Key Laboratory of Complex & Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) AI Security Lab(360人工智能安全实验室)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出TFM攻击方法,通过碎片化提示和隐式替换,提高文本到视频模型的劫持效果,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12719 2026-03-10 cs.CV 79%

S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation

S2DiT:用于移动流媒体视频生成的 Sandwich Diffusion Transformer

Lin Zhao, Yushu Wu, Aleksei Lebedev, Dishani Lahiri, Meng Dong, Arpit Sahni, Michael Vasilkovsky, Hao Chen, Ju Hu, Aliaksandr Siarohin, Sergey Tulyakov, Yanzhi Wang, Anil Kag, Yanyu Li

机构 * Snap Inc. Northeastern University(东北大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 S2DiT 通过高效注意力机制和 2-in-1 深度学习框架,在移动设备上实现高质量、高速度的流式视频生成。

Comments https://snap-research.github.io/S2DiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08648 2026-03-10 cs.CV 57%

CAST: Modeling Visual State Transitions for Consistent Video Retrieval

CAST:为一致视频检索建模视觉状态转换

Yanqing Liu, Yingcheng Liu, Fanghong Dong, Budianto Budianto, Cihang Xie, Yan Jiao

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) Google(谷歌)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 CAST通过建模视觉状态转换,提升视频检索的一致性和连贯性,适用于多种视觉-语言嵌入空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07192 2026-03-10 cs.CV 57%

FastSTAR: Spatiotemporal Token Pruning for Efficient Autoregressive Video Synthesis

FastSTAR: 空间时间令牌修剪用于高效的自回归视频合成

Sungwoong Yune, Suheon Jeong, Joo-Young Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 FastSTAR通过时空令牌修剪和部分更新机制,实现高效视频生成,在保持质量的同时提升处理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00481 2026-03-10 cs.HC 50%

From Performers to Creators: Understanding Retired Women's Perceptions of Technology-Enhanced Dance Performance

从表演者到创作者:理解退休女性对技术增强舞蹈表演的认知

Danlin Zheng, Xiaoying Wei, Chao Liu, Quanyu Zhang, Jingling Zhang, Shihui Guo, Mingming Fan

专题命中 视频生成 :video generation(abstract)

AI总结 本文通过交互式舞蹈技术与AI生成内容,帮助退休女性克服年龄相关限制,提升舞台表现并成为表演共创者。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 8 篇

2510.08131 2026-03-10 cs.CV 85%

Real-Time Motion-Controllable Autoregressive Video Diffusion

实时可控的自回归视频扩散

Kesen Zhao, Jiaxin Shi, Beier Zhu, Junbao Zhou, Xiaolong Shen, Yuan Zhou, Qianru Sun, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) Xmax.AI Ltd(Xmax.AI有限公司) Zhejiang University(浙江大学) Singapore Management University(新加坡国立大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 AR-Drag是一种基于强化学习的实时图像到视频生成模型,通过自回归机制和轨迹奖励模型实现高效运动控制,提升视频生成质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08703 2026-03-10 cs.CV 84%

HiAR: Efficient Autoregressive Long Video Generation via Hierarchical Denoising

HiAR:通过分层去噪实现高效的自回归长视频生成

Kai Zou, Dian Zheng, Hongbo Liu, Tiankai Hang, Bin Liu, Nenghai Yu

专题命中 视频扩散模型 :video generation(title);long video(title);分类 cs.CV

AI总结 HiAR通过分层去噪框架在保持时间连续性的同时减少误差传播,实现高效长视频生成。

Comments Project page: https://jacky-hate.github.io/HiAR/ Code: https://github.com/Jacky-hate/HiAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04016 2026-03-10 cs.CV 83%

S$^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation

S$^2$Q-VDiT: 精确量化视频扩散变换器与显著数据和稀疏令牌蒸馏

Weilun Feng, Haotong Qin, Chuanguang Yang, Xiangqi Li, Han Yang, Yuqi Li, Zhulin An, Libo Huang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 S$^2$Q-VDiT通过显著数据选择和稀疏令牌蒸馏提升视频扩散变换器的量化性能,实现无损压缩和加速推理。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02919 2026-03-10 cs.CV cs.AI cs.LG 79%

Interpretable Motion-Attentive Maps: Spatio-Temporally Localizing Concepts in Video Diffusion Transformers

可解释的运动注意力图:在视频扩散变换器中进行时空定位概念

Youngjun Jun, Seil Kang, Woojung Han, Seong Jae Hwang

机构 * Yonsei University(延世大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种可解释的运动注意力图方法,通过时空定位运动概念,提升视频扩散变换器的可解释性与定位能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14357 2026-03-10 cs.CV cs.LG 79%

Vid2World: Crafting Video Diffusion Models to Interactive World Models

Vid2World: 构建视频扩散模型以交互式世界模型

Siqiao Huang, Jialong Wu, Qixing Zhou, Shangchen Miao, Mingsheng Long

机构 * Tsinghua University(清华大学) Chongqing University(重庆大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 Vid2World通过因果化视频扩散模型,提升其在交互式世界建模中的可控性和生成能力,适用于机器人操作、游戏模拟和开放世界导航等多种领域。

Comments Project page: http://knightnemo.github.io/vid2world/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23681 2026-03-10 cs.CV 79%

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

QuantSparse: 通过模型量化和注意力稀疏化全面压缩视频扩散变换器

Weilun Feng, Chuanguang Yang, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michele Magno, Yongjun Xu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York, USA(纽约城市学院,纽约城市大学,美国) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 QuantSparse通过结合模型量化和注意力稀疏化,实现视频扩散变换器的高效压缩,提升性能并减少存储与推理时间。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07700 2026-03-10 cs.CV cs.AI 57%

TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward

TDM-R1: 通过非可微奖励强化少步扩散模型

Yihong Luo, Tianyang Hu, Weijian Luo, Jing Tang

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) hi-Lab, Xiaohongshu Inc(小红书实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 TDM-R1通过非可微奖励强化少步扩散模型,提升文本到图像生成性能

Comments https://luo-yihong.github.io/TDM-R1-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06623 2026-03-10 cs.LG 50%

Advances in GRPO for Generation Models: A Survey

生成模型中GRPO的进展:综述

Zexiang Liu, Xianglong He, Yangguang Li

机构 * SJTU(上海交通大学) THU(清华大学) CUHK(香港大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文综述了流GRPO在生成模型中的应用与进展,探讨了方法论改进和跨模态扩展,强调其作为通用对齐框架的重要性及未来挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2512.03034 2026-03-10 cs.CV 70%

MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation

MAViD:一种多模态框架用于音频-视觉对话理解和生成

Youxin Pang, Jiajun Liu, Lingfeng Tan, Yong Zhang, Feng Gao, Xiang Deng, Zhuoliang Kang, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 视频问答 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 MAViD提出了一种多模态框架,通过Conductor-Creator架构实现音频-视觉对话的理解与生成,结合自回归和扩散模型提升长时多模态内容生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 1 篇

2505.10238 2026-03-10 cs.CV 57%

MTVCraft: Tokenizing 4D Motion for Arbitrary Character Animation

MTVCraft: 4D运动分词用于任意角色动画

Yanbo Ding, Xirui Hu, Zhizhi Guo, Yan Zhang, Xinrui Wang, Zhixiang He, Chi Zhang, Yali Wang, Xuelong Li

机构 * Shenzhen Key Laboratory of Computer Vision and Pattern Recognition, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳计算机视觉与模式识别重点实验室,深圳先进技术研究院,中国科学院,深圳,中国) Institute of Artificial Intelligence (TeleAI), China Telecom, Beijing, China(人工智能研究所(TeleAI),中国电信,北京,中国) School of Computer Science and Technology, Xi’an Jiaotong University, Xi’an, China(计算机科学与技术学院,西安交通大学,西安,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 MTVCraft通过直接建模4D运动序列,实现任意角色动画,提升运动控制灵活性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 4 篇

2508.09486 2026-03-10 cs.CV cs.AI cs.MM 84%

Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding

视频-EM:面向长视频理解的事件中心型片段记忆

Yun Wang, Long Zhang, Jingren Liu, Jiaqi Yan, Zhanjie Zhang, Jiahao Zheng, Ao Ma, Run Ling, Xun Yang, Dapeng Wu, Xiangyu Chen, Xuelong Li

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Tianjin University(天津大学) Nanjing University(南京大学) Zhejiang University(浙江大学) The Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI))

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 Video-EM通过事件中心型片段记忆框架,将长视频问答转化为事件构建与记忆细化,提升长视频理解的连贯性与可靠性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06664 2026-03-10 cs.CV cs.AI 83%

Accelerating Video Generation Inference with Sequential-Parallel 3D Positional Encoding Using a Global Time Index

通过全局时间索引的序列-并行3D位置编码加速视频生成推理

Chao Yuan, Pan Li

专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 通过全局时间索引的序列-并行3D位置编码优化视频生成推理,实现亚秒首帧延迟和近实时性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08620 2026-03-10 cs.CV 57%

StreamReady: Learning What to Answer and When in Long Streaming Videos

StreamReady: 在长视频流中学习何时回答

Shehreen Azad, Vibhav Vineet, Yogesh Singh Rawat

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学) Microsoft Research(微软研究院)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

AI总结 StreamReady通过引入答案准备度评分,统一时间推理与及时回答,实现对长视频流中何时回答的高效学习与准确判断。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06971 2026-03-10 cs.CV 57%

SurgCUT3R: Surgical Scene-Aware Continuous Understanding of Temporal 3D Representation

SurgCUT3R: 术场景感知的连续时间3D表示理解

Kaiyuan Xu, Fangzhou Hong, Daniel Elson, Baoru Huang

机构 * The Hamlyn Centre for Robotic Surgery, Imperial College London(机器人手术中心,帝国理工学院伦敦分校) S-Lab, College of Computing and Data Science, Nanyang Technological University(S实验室, computing and Data Science学院,南洋理工大学) Department of Computer Science, University of Liverpool(计算机科学系,利物浦大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 SurgCUT3R通过数据生成、混合监督和分层推理框架,解决手术场景中3D重建的准确性和效率问题,实现稳健的重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 视频数据与评测 4 篇

2603.07401 2026-03-10 cs.CV 57%

VIVECaption: A Split Approach to Caption Quality Improvement

VIVECaption:一种改进标题质量的分步方法

Varun Ananth, Baqiao Liu, Haoran Cai

机构 * Adobe Inc.(Adobe公司)

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06732 2026-03-10 cs.CV 57%

HERO: Hierarchical Embedding-Refinement for Open-Vocabulary Temporal Sentence Grounding in Videos

HERO: 分层嵌入-细化用于视频中开放词汇时间句接地

Tingting Han, Xinsong Tao, Yufei Yin, Min Tan, Sicheng Zhao, Zhou Yu

机构 * Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院) Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)

专题命中 视频数据与评测 :video-language(abstract);分类 cs.CV

AI总结 HERO提出一种分层嵌入-细化框架,用于视频中开放词汇时间句接地,通过多级语义建模和跨模态细化提升视频与语言的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06672 2026-03-10 cs.CV cs.AI 57%

Does Semantic Noise Initialization Transfer from Images to Videos? A Paired Diagnostic Study

语义噪声初始化能否从图像迁移到视频?一项配对诊断研究

Yixiao Jing, Chaoyu Zhang, Zixuan Zhong, Peizhou Huang

专题命中 视频数据与评测 :text-to-video(abstract);分类 cs.CV

AI总结 该研究探讨了语义噪声初始化在文本到视频生成中的有效性,发现其在时间相关维度有小幅度提升,但整体效果与基线相当,建议采用提示级评估和噪声空间分析作为标准方法。

Comments 8 pages, 1 figure. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction & Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01528 2026-03-10 cs.CV cs.AI cs.RO 57%

DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving

DrivingGen:自主驾驶中生成视频世界模型的综合性基准

Yang Zhou, Hao Shao, Letian Wang, Zhuofan Zong, Hongsheng Li, Steven L. Waslander

机构 * University of Toronto(多伦多大学) CUHK MMLab(香港中文大学MMLab)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 DrivingGen提出首个综合性基准,用于评估生成驾驶世界模型的视觉真实性、轨迹合理性、时间一致性和可控性,揭示通用与专用模型间的权衡。

Comments ICLR 2026 Poster; Project Website: https://drivinggen-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他视频模型 1 篇

2603.08202 2026-03-10 cs.CV cs.AI 57%

MM-TS: Multi-Modal Temperature and Margin Schedules for Contrastive Learning with Long-Tail Data

MM-TS: 多模态温度和边距调度用于长尾数据的对比学习

Siarhei Sheludzko, Dhimitrios Duka, Bernt Schiele, Hilde Kuehne, Anna Kukleva

机构 * University of Bonn(波恩大学) MPI for Informatics, SIC(信息研究所) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) MIT-IBM Watson AI Lab(麻省理工-IBM Watson人工智能实验室)

专题命中 其他视频模型 :video-language(abstract);分类 cs.CV

AI总结 MM-TS通过动态温度和边距调度提升多模态对比学习在长尾数据上的性能,实现InfoNCE和最大边距方法的统一。

Comments 18 pages, 11 figures. Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏