arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-16 至 2026-03-16 共收录 68 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 10 篇

2603.13163 2026-03-16 cs.CV cs.LG 79%

Towards Faithful Multimodal Concept Bottleneck Models

迈向可信的多模态概念瓶颈模型

Pierre Moreau, Emeline Pineau Ferrand, Yann Choho, Benjamin Wong, Annabelle Blangero, Milan Bhan

机构 * Ekimetrics Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) Télécom Paris(巴黎电信学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出f-CBM框架,通过可微泄漏损失和Kolmogorov-Arnold网络预测头,解决多模态场景下的概念检测与泄漏问题,实现任务准确度、概念检测和泄漏减少的最佳平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02435 2026-03-16 cs.AI cs.LG 70%

VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings

VL-KGE:视觉-语言模型与知识图谱嵌入的结合

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。

Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16201 2026-03-16 cs.CV 70%

Visual Alignment of Medical Vision-Language Models for Grounded Radiology Report Generation

医学视觉-语言模型的视觉对齐以实现基于基础的放射学报告生成

Sarosij Bose, Ravi K. Rajendran, Biplob Debnath, Konstantinos Karydis, Amit K. Roy-Chowdhury, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美洲实验室) University of California, Riverside(加州大学河滨分校)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出VALOR方法,通过临床指导文本推理和自监督视觉推理解决医学报告生成中的视觉幻觉问题,提升生成质量与临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12832 2026-03-16 cs.CV cs.AI 62%

Hierarchical Dual-Change Collaborative Learning for UAV Scene Change Captioning

层次化双变化协作学习用于无人机场景变化描述

Fuhai Chen, Pengpeng Huang, Junwen Wu, Hehong Zhang, Shiping Wang, Xiaoguang Ma, Xuri Ge

机构 * Fuzhou University(福州大学) Shandong University(山东大学) Foshan Graduate School of Innovation, Northeastern University(佛山创新研究生学院,东北大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出无人机场景变化描述任务,旨在生成动态空中影像语义变化的自然语言描述。通过层次化双变化协作学习方法,结合动态自适应布局变换器和层次化跨模态方向一致性校准,提升对视角变化的敏感度,实现在移动视角下的场景变化描述。

Comments 20 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18632 2026-03-16 cs.CV cs.AI 62%

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

用3D思考:从有限视角出发的几何想象引导的空间推理

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Meituan(美团) National University of Singapore(新加坡国立大学) Beihang University(北航) LMMs-Lab(LMMs实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。

Comments 25 pages, 17 figures

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03627 2026-03-16 cs.CL cs.AI 62%

Partially Recentralization Softmax Loss for Vision-Language Models Robustness

部分重校正softmax损失用于视觉-语言模型鲁棒性

Hao Wang, Jinzhe Jiang, Xin Zhang, Chen Li

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出部分重校正softmax损失,通过限制top K softmax输出提升预训练多模态模型的对抗鲁棒性,实验显示细调后模型对主流攻击更具鲁棒性。

Comments The study described in Section 4 was conducted without required institutional review board approval. The paper is withdrawn pending completion of the approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12998 2026-03-16 cs.CV 57%

A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks

为跨模态和任务提供具有实用保障的视觉-语言模型去偏方法

Tangzheng Lian, Guanyu Hu, Yijing Ren, Dimitrios Kollias, Oya Celiktutan

机构 * King’s College London(伦敦国王学院) Queen Mary University of London(伦敦女王学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种无需标注数据的训练自由去偏方法,在跨模态空间中获得帕累托最优公平性,同时保持有限的实用性损失,实验显示其在多种公平度量和任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12659 2026-03-16 cs.CV 57%

AVION: Aerial Vision-Language Instruction from Offline Teacher to Prompt-Tuned Network

AVION:从离线教师到提示调优网络的空域视觉-语言指令

Yu Hu, Jianyang Gu, Hao Liu, Yue Cao, Jozsef Hamari, Zheng Liu, Mohsen Zardadi

机构 * The University of British Columbia, Okanagan(不列颠哥伦比亚大学奥克兰分校) The Ohio State University(俄亥俄州立大学) TerraSense Analytics(TerraSense分析)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 AVION提出一种知识蒸馏框架,通过构建语义丰富的文本原型和轻量级提示,提升视觉语言模型在遥感图像中的适应能力,提升少样本分类和跨模态检索性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05869 2026-03-16 cs.CV 57%

PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues

PatchCue: 通过基于补丁的视觉提示增强视觉语言模型推理

Yukun Qi, Pei Fu, Hang Li, Yuhan Liu, Chao Jiang, Bin Qin, Zhenbo Luo, Jian Luan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PatchCue,一种基于补丁的视觉提示方法,通过两阶段训练提升VLMs的视觉推理能力,在多项任务中表现优于像素级和点级提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22645 2026-03-16 cs.CV 57%

GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes

GeoZero:从零开始激励地理空间场景的推理

Di Wang, Shunyu Liu, Wentao Jiang, Fengxiang Wang, Yi Liu, Xiaolei Qin, Zhiming Luo, Chaoyang Zhou, Haonan Guo, Jing Zhang, Bo Du, Dacheng Tao, Liangpei Zhang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 GeoZero通过构建两个数据集和A$^2$GRPO方法,使大语言模型在无预定义推理链监督下实现地理空间推理,提升了遥感任务的推理多样性和准确性。

Comments Code, data, and models are available at https://github.com/MiliLab/GeoZero

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2603.13056 2026-03-16 cs.CV cs.AI 86%

Team RAS in 10th ABAW Competition: Multimodal Valence and Arousal Estimation Approach

团队RAS在第10届ABAW竞赛中的表现:多模态valence和arousal估计方法

Elena Ryumina, Maxim Markitantov, Alexandr Axyonov, Dmitry Ryumin, Mikhail Dolgushin, Denis Dresvyanskiy, Alexey Karpov

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡联邦研究中心) ITMO University(ITMO大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态方法,用于在真实环境中估计valence和arousal。结合面部、行为和音频模态,利用GRADA、Transformer、Qwen3-VL-4B-Instruct和Mamba等技术,实现跨模态融合,最终在Aff-Wild2数据集上达到0.658的CCC值。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11647 2026-03-16 cs.MM cs.CV cs.SD 86%

OmniForcing: Unleashing Real-time Joint Audio-Visual Generation

OmniForcing:释放实时联合音频视觉生成

Yaofeng Su, Yuming Li, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Ying Li, Zezhong Qian, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索学院) Fudan University(复旦大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出OmniForcing框架,通过因果蒸馏将双向扩散模型转化为高保真流式自回归生成器,解决双流架构中的训练不稳定问题,实现25FPS的实时生成性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2603.12848 2026-03-16 cs.CV cs.AI 81%

Team LEYA in 10th ABAW Competition: Multimodal Ambivalence/Hesitancy Recognition Approach

团队LEYA在第10届ABAW竞赛中的多模态矛盾/犹豫识别方法

Elena Ryumina, Alexandr Axyonov, Dmitry Sysoev, Timur Abdulkadirov, Kirill Almetov, Yulia Morozova, Dmitry Ryumin

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡联邦科研中心) HSE University(俄罗斯高等经济学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种多模态方法用于视频级矛盾/犹豫识别,结合场景、面部、音频和文本四种模态,通过融合模型提升识别性能,实验显示多模态融合优于单一模态方法。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12746 2026-03-16 cs.CV 79%

Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World

动态思维:多模态大语言模型如何感知、跟踪和推理物理4D世界的动态

Yuzhi Huang, Kairun Wen, Rongxin Gao, Dongxuan Liu, Yibin Lou, Jie Wu, Jing Xu, Jian Zhang, Zheng Yang, Yunlong Lin, Chenxin Li, Panwang Pan, Junbin Lu, Jingyan Jiang, Xinghao Ding, Yue Huang, Zhi Wang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Dyn-Bench基准测试,评估多模态大语言模型在动态场景中的时空推理和动态物体感知能力,发现现有模型难以同时保持强性能,而结构化整合方法显著提升其动态感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16788 2026-03-16 cs.CV cs.AI 76%

Towards Explainable AI: Multi-Modal Transformer for Video-based Image Description Generation

迈向可解释AI:基于视频的图像描述生成的多模态Transformer

Lakshita Agarwal, Bindu Verma

专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.AI

AI总结 本文提出一种多模态Transformer框架,结合文本和视觉模态生成视频描述,通过ResNet50提取视频特征并结合GPT-2模型,提升描述质量和可解释性。

Journal ref 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12382 2026-03-16 cs.CV cs.AI 73%

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

SPARROW:在像素级视频MLLM中学习空间精度和时间参照一致性

Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SPARROW通过引入目标特定跟踪特征和双提示设计,提升视频像素级理解的空间精度和时间一致性,基于30646个视频和45231对问答对的数据集,实现六个基准测试的显著改进。

Comments Accepted at CVPR 2026; Project page: https://risys-lab.github.io/SPARROW; Repository: https://github.com/RISys-Lab/SPARROW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12938 2026-03-16 cs.CV cs.AI 62%

Thinking in Streaming Video

流式视频思考

Zikang Liu, Longteng Guo, Handong Li, Ru Zhen, Xingjian He, Ruyi Ji, Xiaoming Ren, Yanhao Zhang, Haonan Lu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心,OPPO公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ThinkStream框架,通过Watch-Think-Speak范式实现流式视频推理,采用RCSM压缩内存和流式强化学习提升效率,实验表明其在多个流式视频基准上性能优越且低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12480 2026-03-16 cs.RO cs.AI 57%

One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies

一步流策略:用于快速视觉-运动策略的自蒸馏

Shaolong Li, Lichao Sun, Yongchao Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一步流策略,通过自蒸馏实现高保真单步动作生成,无需预训练教师模型,有效提升动作生成速度和控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2602.05474 2026-03-16 cs.IR cs.AI 74%

LLM-driven Multimodal Recommendation

基于大语言模型的多模态推荐

Yicheng Di

专题命中 跨模态检索 :multimodal(title);分类 cs.AI

AI总结 本文提出LMMRec框架,通过建模用户动机提升推荐系统的可解释性和说服力,实验表明其在三个真实数据集上效果显著。

Comments There are some writing errors in our methods section that need to be corrected. We will then add extensive experiments and rewrite the Introduction and related work sections

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15098 2026-03-16 cs.CV 57%

Uni-Parser Technical Report

统一解析器技术报告

Xi Fang, Haoyi Tao, Shuwen Yang, Chaozheng Huang, Suyang Zhong, Haocheng Lu, Han Lyu, Junjie Wang, Xinyu Li, Linfeng Zhang, Guolin Ke

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 Uni-Parser是一种面向科学文献和专利的工业级文档解析引擎,具备高吞吐量、高精度和低成本优势,采用模块化架构实现多模态细粒度对齐,支持大规模部署和扩展,适用于文献检索、摘要生成及化学结构提取等下游应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 15 篇

2603.13098 2026-03-16 cs.RO cs.CV 83%

SldprtNet: A Large-Scale Multimodal Dataset for CAD Generation in Language-Driven 3D Design

SldprtNet:一个大规模多模态数据集,用于语言驱动的3D设计CAD生成

Ruogu Li, Sikai Li, Yao Mu, Mingyu Ding

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出SldprtNet数据集,用于语义驱动的CAD建模、几何深度学习和多模态模型训练,包含242,000个工业零件,提供多种3D模型格式,并结合图像与文本生成自然语言描述。

Comments Accept by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12707 2026-03-16 cs.LG cs.AI cs.DC 83%

Cost-Efficient Multimodal LLM Inference via Cross-Tier GPU Heterogeneity

通过跨层级GPU异构性实现高效的多模态大语言模型推理

Donglin Yu

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出通过跨层级GPU异构性优化多模态大语言模型推理,减少跨设备传输复杂度,提升吞吐量并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17476 2026-03-16 cs.CV 83%

The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts

一致性陷阱:当MLLM编写的叙述利用被篡改的视觉上下文

Yuchen Zhang, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出AMD框架,通过Artifact Pre-perception Encoding策略和Manipulation-Oriented Reasoning,解决MLLM生成的多模态欺骗检测问题,验证了其在跨领域测试中的优越性能。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12793 2026-03-16 cs.CV cs.AI 81%

Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation

Cheers:解耦补丁细节与语义表示以实现统一的多模态理解和生成

Yichen Zhang, Da Peng, Zonghao Guo, Zijian Zhang, Xuesong Yang, Tong Sun, Shichu Sun, Yidan Zhang, Yanghao Li, Haiyan Zhao, Wang Xu, Qi Shi, Yangang Sun, Chi Chen, Shuo Wang, Yukun Yan, Xu Han, Qiang Ma, Wei Ke, Liang Wang, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Cheers通过解耦补丁细节与语义表示,实现统一的多模态理解和生成,提升图像生成的保真度,并在多个基准测试中表现优异,同时实现4倍的token压缩效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12581 2026-03-16 eess.IV cs.AI cs.CV 81%

Multiscale Structure-Guided Latent Diffusion for Multimodal MRI Translation

多尺度结构引导的潜在扩散模型用于多模态MRI翻译

Jianqiang Lin, Zhiqiang Shen, Peng Cao, Jinzhu Yang, Osmar R. Zaiane, Xiaoli Liu

机构 * Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程系,沈阳,中国) Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室,东北大学,沈阳,中国) National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心,沈阳,中国) Amii, University of Alberta, Edmonton, Alberta, Canada(阿尔伯塔大学阿米人工智能研究所,埃德蒙顿,阿尔伯塔,加拿大) AiShiWeiLai AI Research, Beijing, China(人工智能研究(北京)有限公司,北京,中国)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MSG-LDM框架,通过多尺度特征空间分离风格与结构信息,提升多模态MRI翻译的结构一致性与纹理细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13070 2026-03-16 cs.CV 79%

Mitigating Memorization in Text-to-Image Diffusion via Region-Aware Prompt Augmentation and Multimodal Copy Detection

通过区域感知提示增强和多模态复制检测缓解文本到图像扩散中的记忆化

Yunzhuo Chen, Jordan Vice, Naveed Akhtar, Nur Al Hasan Haldar, Ajmal Mian

机构 * The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) Curtin University(科廷大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出区域感知提示增强和多模态复制检测方法,通过增强提示多样性与检测复制行为,提升文本到图像扩散模型的生成质量与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08820 2026-03-16 cs.CV 79%

Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing

Omni-Video 2:基于MLLM条件扩散模型的统一视频生成与编辑扩展

Hao Yang, Zhiyu Tan, Jia Gong, Luozheng Qin, Hesen Chen, Xiaomeng Yang, Yuqing Sun, Yuetan Lin, Mengping Yang, Hao Li

专题命中 多模态生成 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出Omni-Video 2,通过连接预训练多模态大语言模型与视频扩散模型,实现视频生成与编辑的统一。核心方法是利用MLLM生成明确的目标描述以指导生成过程,并通过轻量适配器高效注入多模态条件token,提升复杂编辑任务性能。

Comments Technical Report, Project: https://howellyoung-s.github.io/Omni-Video2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14327 2026-03-16 cs.CV 79%

MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer

MoVieDrive:基于多模态多视角视频扩散变换器的城市场景合成

Guile Wu, David Huang, Dongfeng Bai, Bingbing Liu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Toronto(多伦多大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出MoVieDrive,通过多模态多视角视频扩散变换器生成城市驾驶场景视频,实现多模态数据生成与可控生成。

Comments CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14041 2026-03-16 cs.CV cs.AI 62%

BitDance: Scaling Autoregressive Generative Models with Binary Tokens

BitDance: 通过二进制令牌扩展自回归生成模型

Yuang Ai, Jiaming Han, Shaobin Zhuang, Weijia Mao, Xuefeng Hu, Ziyan Yang, Zhenheng Yang, Yali Wang, Huaibo Huang, Xiangyu Yue, Hao Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 BitDance通过二进制令牌生成高熵表示,结合二进制扩散头和next-patch扩散方法,实现高效图像生成,达到最佳FID分数并显著提升推理速度。

Comments Code and models: https://github.com/shallowdream204/BitDance

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19577 2026-03-16 cs.CV 57%

MaDiS: Taming Masked Diffusion Language Models for Sign Language Generation

MaDiS:驯服掩码扩散语言模型用于手语生成

Ronglai Zuo, Rolandos Alexandros Potamias, Qi Sun, Evangelos Ververas, Jiankang Deng, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出MaDiS,一种基于掩码扩散的语言模型,用于手语生成,通过双向依赖捕捉和高效并行多令牌生成,提升生成效率和质量,同时引入三级交叉模态预训练方案和混合部分嵌入层,实现多层级手语表示。

详情

展开后加载摘要…

URL PDF HTML 收藏