arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 199 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 27 篇

2508.00782 2026-03-17 cs.GR cs.AI cs.CV cs.MM cs.SD eess.AS 70%

SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation

SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成

Kien T. Pham, Yingqing He, Yazhou Xing, Qifeng Chen, Long Chen

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。

Comments The 33rd ACM Multimedia Conference (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18328 2026-03-17 cs.CV cs.AI 62%

Virtual Full-stack Scanning of Brain MRI via Imputing Any Quantised Code

通过填补任意量化代码实现脑部MRI的虚拟全栈扫描

Yicheng Wu, Tao Song, Zhonghua Wu, Jin Ye, Zongyuan Ge, Wenjia Bai, Zhaolin Chen, Jianfei Cai

专题命中 多模态生成 :any-to-any(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CodeBrain框架,通过区域级全栈代码预测解决MRI模态缺失问题,提升数据完整性和临床实用性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14207 2026-03-17 cs.CV cs.AI 62%

DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution

DualTSR:统一的双扩散变压器用于场景文本图像超分辨率

Axi Niu, Kang Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DualTSR通过统一的双扩散目标解决文本图像超分辨率中的文本先验依赖和复杂架构问题,采用单多模态Transformer骨干网络,实现视觉与文本信息的交互,提升超分辨率效果与文本保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15271 2026-03-17 cs.CV 57%

Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models

Flash-Unified: 一种无需训练且任务感知的加速框架用于原生统一模型

Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Chicago(芝加哥大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FlashU框架,通过任务感知的网络剪枝和动态层跳过,减少统一模型的计算冗余,提升生成和理解任务的推理速度,实验表明在Show-o2数据集上加速1.78至2.01倍,保持SOTA性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14948 2026-03-17 cs.CV 57%

Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation

弥合场景生成与规划:通过统一视觉与运动表示进行驾驶世界模型

Xingtai Gui, Meijie Zhang, Tianyi Yan, Wencheng Han, Jiahao Gong, Feiyang Tan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Afari Intelligent Drive(Afari智能驾驶)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出WorldDrive框架,通过统一视觉与运动表示弥合场景生成与规划之间的差距,利用轨迹感知驾驶世界模型和未来感知奖励器提升自动驾驶规划性能。

Comments 16 pages, 9 figures. The code is available at https://github.com/TabGuigui/WorldDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10910 2026-03-17 cs.CL 57%

GLM-OCR Technical Report

GLM-OCR 技术报告

Shuaiqi Duan, Yadong Xue, Weihan Wang, Zhe Su, Huan Liu, Sheng Yang, Guobing Gan, Guo Wang, Zihan Wang, Shengdong Yan, Dexin Jin, Yuxuan Zhang, Guohong Wen, Yanfeng Wang, Yutao Zhang, Xiaohan Zhang, Wenyi Hong, Yukuo Cen, Da Yin, Bin Chen, Wenmeng Yu, Xiaotao Gu, Jie Tang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 GLM-OCR 是一种高效紧凑的多模态模型,结合了CogViT视觉编码器和GLM语言解码器,通过多令牌预测机制提升OCR效率,适用于文档理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14063 2026-03-17 cs.CV 57%

Semantic Context Matters: Improving Conditioning for Autoregressive Models

语义上下文至关重要:改进自回归模型的条件化

Dongyang Jin, Ryan Xu, Jianhao Zeng, Rui Lan, Yancheng Bai, Lei Sun, Xiangxiang Chu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SCAR方法,通过压缩语义前缀和语义对齐指导提升自回归模型的条件化能力,实现更高质量的图像编辑和可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14702 2026-03-17 cs.CV 57%

Fractal Autoregressive Depth Estimation with Continuous Token Diffusion

分形自回归深度估计与连续令牌扩散

Jinchang Zhang, Xinrou Kang, Guoyu Lu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种分形视觉自回归扩散框架,通过粗到细的自回归生成过程改进单目深度估计,采用多尺度特征融合和连续空间去噪扩散损失提升跨模态条件化效果,同时通过分形递归架构和不确定性感知共识聚合方案提高计算效率与预测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14505 2026-03-17 cs.CV 57%

Unlocking the Latent Canvas: Eliciting and Benchmarking Symbolic Visual Expression in LLMs

解锁潜在画布:在LLMs中引发和评估符号视觉表达

Yiren Zheng, Shibo Li, Jiaming Liu, Haofan Wang, Yiren Song

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文通过ASCII艺术格式揭示LLMs的潜在视觉能力,提出SVE-ASCII框架,构建ASCIIArt-7K数据集,并展示生成训练如何提升视觉理解,建立文本基视觉智能的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14112 2026-03-17 cs.CV 57%

Revisiting the Perception-Distortion Trade-off with Spatial-Semantic Guided Super-Resolution

重新审视基于空间-语义引导的超分辨率中的感知-失真权衡

Dan Wang, Haiyan Sun, Shan Du, Z. Jane Wang, Zhaochong An, Serge Belongie, Xinrui Cui

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpaSemSR框架,通过空间-语义引导减少失真并提升感知质量,实验显示在多个基准上实现了更优的感知-失真平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13969 2026-03-17 cs.CV eess.IV 57%

Leveraging a Statistical Shape Model for Efficient Generation of Annotated Training Data: A Case Study on Liver Landmarks Segmentation

利用统计形状模型实现高效标注训练数据生成:肝脏标志点分割的案例研究

Denis Krnjaca, Lorena Krames, Werner Nahm

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用统计形状模型生成大量标注数据的方法,用于深度学习的肝脏标志点分割,显著提高了分割效率并减少了手动标注的工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13956 2026-03-17 cs.AI 57%

EviAgent: Evidence-Driven Agent for Radiology Report Generation

EviAgent:基于证据的放射学报告生成代理

Tuoshi Qi, Shenshen Bu, Yingfei Xiang, Zhiming Dai

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 EviAgent通过引入多维视觉专家和检索机制,解决放射学报告生成中的透明性与证据支持问题,实验表明其在多个数据集上优于通用和专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13386 2026-03-17 cs.CV 57%

Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers

基于布局的可控病理图像生成与上下文扩散变换器

Yuntao Shou, Xiangyong Cao, Qian Zhao, Deyu Meng

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于布局的可控病理图像生成方法,通过多代理LVLM注释框架构建精细临床对齐的监督数据,提出IC-DiT模型整合空间布局、文本描述和视觉嵌入,实现高保真生成与强空间可控性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13375 2026-03-17 cs.CV cs.LG 57%

InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization

InfiniteDance: 可扩展的3D舞蹈生成以实现真实场景泛化

Ronghui Li, Zhongyuan Hu, Li Siyao, Youliang Zhang, Haozhe Xie, Mingyuan Zhang, Jie Guo, Xiu Li, Ziwei Liu

机构 * Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出InfiniteDance,通过扩大数据与模型设计,实现可扩展的3D舞蹈生成,解决了真实场景下的泛化问题。

Comments project page: https://infinitedance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14056 2026-03-17 cs.RO cs.SY eess.SY 50%

Amortizing Trajectory Diffusion with Keyed Drift Fields

通过键控漂移场实现轨迹扩散的 amortization

Gokul Puthumanaillam, Melkior Ornik

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出键控漂移策略,通过单步推理实现轨迹扩散行为,保留多样候选计划生成和实时控制循环中的状态条件能力,降低规划延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15746 2026-03-17 cs.LG cond-mat.mtrl-sci 50%

A Unified Generative-Predictive Framework for Deterministic Inverse Design

一种统一的生成-预测框架用于确定性反向设计

Reza T. Batley, Sourav Saha

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出Janus框架,结合编码器-解码器与预测性KHRONOS 头,解决异质材料微结构反向设计问题,实现高效物理引导的生成与预测。

Journal ref AIAA SciTech Forum, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13839 2026-03-17 cs.CE 50%

NetSpatial: Spatially Conditional Traffic Generation for Cellular Planning and Operations

NetSpatial: 基于空间条件的蜂窝网络生成用于蜂窝规划与运营

Shiyuan Zhang, Jiale Du, Yuanwei Liu, Kaibin Huang, Hongyang Du

专题命中 多模态生成 :multimodal(abstract)

AI总结 NetSpatial通过空间条件生成蜂窝网络流量,结合多模态城市数据,实现部署规划与运营决策,实验显示其在流量预测和能效方面有显著优势。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13265 2026-03-17 cs.LG 50%

Knowledge, Rules and Their Embeddings: Two Paths towards Neuro-Symbolic JEPA

知识、规则及其嵌入:迈向神经符号JEPA的两条路径

Yongchao Huang, Hassan Raza

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出双向神经符号框架RiJEPA,通过能量约束和多模态双编码架构注入归纳偏置,重塑表示流形,实现几何逻辑盆地;并通过连续可微逻辑替代离散规则,实现连续规则发现,提升生成与推理能力。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 40 篇

2603.14951 2026-03-17 cs.CV 85%

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

专题命中 多模态评测 :MLLM(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15020 2026-03-17 cs.CV cs.CL 84%

MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal

MER-Bench:多模态表情包再解释的综合基准

Yiqi Nie, Fei Wang, Junjie Chen, Kun Li, Yudi Cai, Dan Guo, Chenglong Li, Meng Wang

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文提出MER-Bench,一个用于多模态表情包再解释的综合基准,通过多模态大语言模型评估结构保持、语义一致性和情感转换,揭示现有系统在约束满足上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13238 2026-03-17 cs.CV cs.CL 84%

KazakhOCR: A Synthetic Benchmark for Evaluating Multimodal Models in Low-Resource Kazakh Script OCR

KazakhOCR: 一种用于评估多模态模型在低资源库尔德语手写体OCR中的合成基准

Henry Gagnier, Sophie Gagnier, Ashwin Kirubakaran

机构 * Pittsford Sutherland High School(皮茨福德萨瑟兰高中) Edison Academy Magnet School(埃德ison学院磁性学校)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 本文构建了包含7219张图像的合成OCR数据集,用于评估多模态大语言模型在低资源库尔德语手写体OCR和语言识别中的性能,发现传统OCR在字符错误率上优于MLLMs。

Comments Accepted to AbjadNLP @ EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15467 2026-03-17 cs.CV 83%

Evaluating Time Awareness and Cross-modal Active Perception of Large Models via 4D Escape Room Task

通过4D逃脱房间任务评估大模型的时间意识和跨模态主动感知

Yurui Dong, Ziyue Wang, Shuyun Lu, Dairu Liu, Xuechen Liu, Fuwen Luo, Peng Li, Yang Liu

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出4D逃脱房间任务,用于评估大模型在时间变化和不可逆条件下跨模态感知和时间意识的能力,发现模型在多模态整合中存在模态偏差和能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15117 2026-03-17 cs.CL 83%

MMKU-Bench: A Multimodal Update Benchmark for Diverse Visual Knowledge

MMKU-Bench:一种多模态更新基准,用于多样化视觉知识

Baochen Fu, Yuntao Du, Cheng Chang, Baihao Jin, Wenzhi Deng, Muhao Xu, Hongmei Yan, Weiye Song, Yi Wan

机构 * Shandong University, Jinan, China(山东大学,济南,中国)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出MMKU-Bench,用于评估多模态知识更新,包含25k以上知识实例和49k张图像,涵盖更新知识和未知知识两种场景,评估SFT、RLHF和KE等方法,发现SFT和RLHF易遗忘,KE保留能力但更新有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13099 2026-03-17 cs.AI cs.CV cs.IR cs.MM 82%

Beyond Final Answers: CRYSTAL Benchmark for Transparent Multimodal Reasoning Evaluation

超越最终答案:CRYSTAL基准用于透明多模态推理评估

Wayner Barrios, SouYoung Jin

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 CRYSTAL基准通过可验证的中间步骤评估多模态推理,提出Match F1和Ordered Match F1两个指标,揭示模型在推理顺序、精度与召回率上的系统性缺陷,并引入CPR和CPR-Curriculum提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05264 2026-03-17 cs.CV cs.AI 81%

Towards Balanced Multi-Modal Learning in 3D Human Pose Estimation

迈向3D人体姿态估计中多模态学习的平衡

Mengshi Qi, Jiaxuan Peng, Xianlin Zhang, Huadong Ma

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种平衡多模态学习方法,利用RGB、LiDAR、毫米波和WiFi数据,通过Shapley值算法评估模态贡献并解决模态不平衡问题,提升复杂环境下3D姿态估计性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14559 2026-03-17 cs.CV cs.AI cs.IR 81%

A comprehensive multimodal dataset and benchmark for ulcerative colitis scoring in endoscopy

一种全面的多模态数据集和基准用于内镜溃疡性结肠炎评分

Noha Ghatwary, Jiangbei Yue, Ahmed Elgendy, Hanna Nagdy, Ahmed Galal, Hayam Fathy, Hussein El-Amin, Venkataraman Subramanian, Noor Mohammed, Gilberto Ochoa-Ruiz, Sharib Ali

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个包含专家标注的MES和UCEIS评分及临床描述的多中心多分辨率数据集,结合双评分指标和专家生成的图像描述,为开发具有临床意义的多模态算法提供新机遇。

Comments 11

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13886 2026-03-17 cs.CV cs.AI 81%

Multi-Modal Character Localization and Extraction for Chinese Text Recognition

多模态字符定位与提取用于中文文本识别

Qilong Li, Chongsheng Zhang

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LER方法,通过解耦字符并考虑中文复杂结构,提升中英文文本识别性能,实验表明在大规模中文和英文基准上均取得显著成果。

Comments On January 08th, 2026, this paper has been accepted by the IEEE Transactions on Multimedia journal. To appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13590 2026-03-17 cs.CV cs.AI 81%

Opportunistic Cardiac Health Assessment: Estimating Phenotypes from Localizer MRI through Multi-Modal Representations

机会性心脏健康评估:通过多模态表示从局部定位MRI估计表型

Busra Nur Zeybek, Özgün Turgut, Yundi Zhang, Jiazhen Pan, Robert Graf, Sophie Starck, Daniel Rueckert, Sevgi Gokce Kafali

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与健康中的研究所,慕尼黑技术大学(TUM)和TUM大学医院) Department of Diagnostic and Interventional Neuroradiology, School of Medicine, TUM University Hospital(诊断与介入神经放射科,医学院,TUM大学医院) Department of Computing, Imperial College London(计算学院,伦敦帝国学院) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出C-TRIP框架,通过融合局部定位MRI、ECG和表格数据,利用低成本信息预测心脏表型,提升心脏健康评估的可及性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13427 2026-03-17 cs.CV cs.AI 81%

MIBench: Evaluating LMMs on Multimodal Interaction

MIBench: 评估大多模态模型在多模态交互中的能力

Yu Miao, Zequn Yang, Yake Wei, Ziheng Chen, Haotian Ni, Haodong Duan, Kai Chen, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学人工智能学院,北京,中国) Beijing Key Laboratory of Research on Large Models(大型模型研究关键实验室) Beihang University, Beijing, China(北京航空航天大学,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MIBench通过多模态交互三元组评估大模型在多模态任务中的能力,发现模型在多模态交互上存在局限性,易受文本干扰,且在基础协同能力上表现不足。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10722 2026-03-17 cs.CV cs.AI 81%

UAV traffic scene understanding: A regulation embedded multi-modal network and a unified benchmark

无人机交通场景理解:一种嵌入监管的多模态网络和一个统一的基准

Yu Zhang, Zhicheng Zhao, Ze Luo, Chenglong Li, Jin Tang

机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing 100190, China(中国科学院计算机网络信息中心,北京100190,中国) University of Chinese Academy of Sciences, Beijing 100190, China(中国科学院大学,北京100190,中国) Anhui Provincial Key Laboratory of Multi-modal Cognitive Computation, Anhui University, Hefei 230601, China(安徽省多模态认知计算重点实验室,安徽大学,合肥230601,中国) Information Materials and Intelligent Sensing Laboratory of Anhui Province, Anhui University, Hefei 230601, China(安徽省信息材料与智能感知实验室,安徽大学,合肥230601,中国)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MTCNet多模态交通认知网络,通过原型引导知识嵌入模块和质量感知光谱补偿模块,提升无人机交通场景理解的鲁棒性,并构建首个大规模光学-热红外基准Traffic-VQA。

详情

展开后加载摘要…

URL PDF HTML 收藏