arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4946 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4946 篇

2507.04678 2026-04-10 cs.CV 79%

ChangeBridge: Spatiotemporal Image Generation with Multimodal Controls for Remote Sensing

ChangeBridge: 多模态控制下的遥感时空图像生成

Zhenghui Zhao, Chen Wu, Xiangyong Cao, Di Wang, Hongruixuan Chen, Datao Tang, Liangpei Zhang, Zhuo Zheng

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy(中关村学院) Graduate School of Frontier Sciences, The University of Tokyo(东京大学新领域创成科学研究科) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ChangeBridge模型,通过多模态事件控制生成时空一致的遥感图像,解决了现有方法在跨时间变化建模上的不足,提升了土地利用规划和变化检测任务的数据生成能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06870 2026-04-09 cs.CV 79%

RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details

RefineAnything: 多模态区域特定细化以实现完美局部细节

Dewei Zhou, You Li, Zongxin Yang, Yi Yang

机构 * RELER, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室、人工智能研究所) DBMI, HMS, Harvard University(哈佛大学医学院生物医学信息学系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出区域特定图像细化方法,通过多模态扩散模型实现局部细节恢复,同时保持非编辑区域不变,引入边界一致性损失和Focus-and-Refine策略提升效果。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV 79%

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03323 2026-04-08 cs.GR cs.CV cs.HC cs.LG cs.SD 79%

Listen to Rhythm, Choose Movements: Autoregressive Multimodal Dance Generation via Diffusion and Mamba with Decoupled Dance Dataset

聆听节奏,选择动作:通过扩散与Mamba实现多模态舞蹈生成的自回归方法

Oran Duan, Yinghua Shen, Yingzhu Lv, Luyang Jie, Yaxin Liu, Qiong Wu

机构 * Communication University of China(中国传媒大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出LRCM框架,通过解耦舞蹈数据集实现多模态指导的扩散模型,结合Mamba模块实现流畅的长序列自回归生成,展示了在多模态输入和长序列生成中的潜力。

Comments 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04630 2026-04-07 cs.CV 79%

Multimodal Backdoor Attack on VLMs for Autonomous Driving via Graffiti and Cross-Lingual Triggers

通过涂鸦和跨语言触发器对自动驾驶VLMs进行多模态后门攻击

Jiancheng Wang, Lidan Liang, Yong Wang, Zengzhen Su, Haifeng Xia, Yuanting Yan, Wei Wang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GLA攻击方法,利用自然触发器在自动驾驶场景中实现隐蔽稳定的后门攻击,实验显示仅需10%污染率即可达到90%攻击成功率且无误报,同时提升模型性能指标,揭示了自动驾驶VLMs的安全威胁。

Comments This is a submission to the "Pattern Analysis and Applications". The manuscript includes 14 pages and 6 figures. All authors have approved the submission, and there is no conflict of interest to declare

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02477 2026-04-06 cs.CV cs.LG 79%

Guideline2Graph: Profile-Aware Multimodal Parsing for Executable Clinical Decision Graphs

Guideline2Graph:面向可执行临床决策图的多模态解析

Onur Selim Kilic, Yeti Z. Gurbuz, Cem O. Yaldiz, Afra Nawar, Etrit Haxholli, Ogul Can, Eli Waxman

机构 * Georgia Institute of Technology(佐治亚理工学院) MetaDialog Infuse Inc(Infuse公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态解析方法,通过拓扑感知分块、接口约束分块生成和溯源保留的全局聚合,将完整指南证据转换为可执行临床决策支持图。实验表明,该方法在前列腺指南基准上显著提升了精度和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00550 2026-04-02 cs.AI 79%

BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery

BloClaw:面向下一代科学发现的全能多模态智能工作空间

Yao Qin, Yangyang Yan, Jinhua Pang, Xiaoming Zhang

机构 * AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部) Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室) First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出BloClaw,一种多模态操作系统,通过XML-Regex路由协议、运行时状态拦截沙箱和状态驱动动态视口UI三大创新,提升科学计算助手的鲁棒性和自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05097 2026-04-02 cs.GR cs.CV 79%

Pulp Motion: Framing-aware multimodal camera and human motion generation

纸浆运动:面向场景的多模态摄像机和人体运动生成

Robin Courant, Xi Wang, David Loiseaux, Marc Christie, Vicky Kalogeiton

机构 * LIX, École Polytechnique, CNRS, IPP(LIX,巴黎综合理工学院,法国国家科学研究中心,巴黎文理研究大学) Inria Saclay(法国国家信息与自动化研究所萨克雷中心) Inria, IRISA, Univ Rennes, CNRS(法国国家信息与自动化研究所,IRISA,雷恩大学,法国国家科学研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文首次将人体运动与摄像机轨迹生成联合建模,通过投影人体关节到摄像机生成屏幕构图,实现一致的屏幕构图并提升生成精度,同时引入PulpMotion数据集和辅助采样方法,实验表明方法在生成屏幕一致的人体-摄像机运动和文本对齐方面效果显著。

Comments Project page: https://www.lix.polytechnique.fr/vista/projects/2025_pulpmotion_courant/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV 79%

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28088 2026-03-31 cs.CV 79%

GEMS: Agent-Native Multimodal Generation with Memory and Skills

GEMS:基于记忆与技能的代理原生多模态生成

Zefeng He, Siyuan Huang, Xiaoye Qu, Yafu Li, Tong Zhu, Yu Cheng, Yang Yang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) CUHK(香港中文大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 GEMS通过引入代理循环、记忆和技能组件,提升多模态生成在复杂指令和专业任务中的性能,使轻量级模型在GenEval2中超越现有最佳模型。

Comments Project Page: https://gems-gen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23165 2026-03-31 cs.CV 79%

DyaDiT: A Multi-Modal Diffusion Transformer for Socially Favorable Dyadic Gesture Generation

DyaDiT:一种多模态扩散变换器,用于生成社会有利的双人手势

Yichen Peng, Jyun-Ting Song, Siyeol Jung, Ruofan Liu, Haiyang Liu, Xuangeng Chu, Ruicong Liu, Erwin Wu, Hideki Koike, Kris Kitani

机构 * Institute of Science Tokyo(东京科学大学) UNIST(蔚山科学技术院) Shanda AI Research Tokyo(盛大人工智能研究院东京) The University of Tokyo(东京大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 DyaDiT通过多模态扩散变换器生成适合社会互动的双人手势,利用双人音频信号和社交上下文令牌,融合双方信息并编码运动先验,实现更自然的交互。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08673 2026-03-31 cs.CV 79%

Thinking with Camera: A Unified Multimodal Model for Camera-Centric Understanding and Generation

通过摄像头思考:一个统一的多模态模型用于以摄像头为中心的理解与生成

Kang Liao, Size Wu, Zhonghua Wu, Linyi Jin, Chao Wang, Yikai Wang, Fei Wang, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab) SenseTime Research(商汤科技研究院) University of Michigan(密歇根大学) Max-Planck Institute for Informatics(马克斯·普朗克信息学研究所)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Puffin模型,通过将摄像头视为语言,实现以摄像头为中心的多模态理解与生成,结合语言回归和扩散生成,提升空间感知能力,实验表明其在跨视角任务中表现优异。

Comments Accepted by ICLR2026. Project Page: https://kangliao929.github.io/projects/puffin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12554 2026-03-31 cs.CV 79%

Multimodal Graph Network Modeling for Human-Object Interaction Detection with PDE Graph Diffusion

基于PDE图扩散的多模态图网络建模用于人-物交互检测

Wenxuan Ji, Haichao Shi, Xiao-Yu Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于PDE图扩散的多模态图网络模型,通过四阶段图结构建模人-物交互任务,利用白盒PDE扩散方程实现信息传播,并引入变分信息挤压机制优化CLIP提取的多模态特征,实验表明在HICO-DET和V-COCO基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27332 2026-03-31 cs.CV 79%

Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models

因互惠而不安全:生成-理解耦合如何在统一多模态模型中损害安全性

Kaishen Wang, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究探讨了统一多模态模型中生成与理解之间的互惠关系可能成为安全漏洞的根源,提出RICE攻击方法,揭示了跨功能互惠对安全性的负面影响。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05422 2026-03-31 cs.CV 79%

ParaUni: Enhance Generation in Unified Multimodal Model with Reinforcement-driven Hierarchical Parallel Information Interaction

ParaUni: 通过强化驱动的分层并行信息交互增强统一多模态模型的生成

Jiangtong Tan, Lin Liu, Jie Huanng, Xiaopeng Zhang, Qi Tian, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部类脑智能感知与认知重点实验室) Huawei Inc.(华为技术有限公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 ParaUni通过并行提取多层视觉语言模型特征并结合强化学习动态调整机制,提升统一多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15702 2026-03-30 cs.IT cs.CV cs.NI math.IT 79%

Editable-DeepSC: Reliable Cross-Modal Semantic Communications for Facial Editing

可编辑的深度语义通信:面向面部编辑的可靠跨模态语义通信

Bin Chen, Wenbo Yu, Qinshan Zhang, Tianqu Zhuang, Hao Wu, Yong Jiang, Shu-Tao Xia

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出Editable-DeepSC,一种用于面部编辑的跨模态语义通信方法,通过联合编辑-信道编码和SNR感知信道编码,提升传输效率与编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25565 2026-03-27 cs.CV 79%

GeoHeight-Bench: Towards Height-Aware Multimodal Reasoning in Remote Sensing

GeoHeight-Bench:迈向遥感中基于高度的多模态推理

Xuran Hu, Zhitong Xiong, Zhongcheng Hong, Yifang Ban, Xiaoxiang Zhu, Wufan Zhao

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Technical University of Munich(慕尼黑工业大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GeoHeight-Bench,通过构建高度感知的遥感理解评估框架,解决现有多模态模型在复杂遥感几何和灾害场景中忽略垂直维度的问题,提出数据生成管道和基准测试,并验证高度感知的重要性。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11827 2026-03-27 cs.CV 79%

Multimodal classification of Radiation-Induced Contrast Enhancements and tumor recurrence using deep learning

基于深度学习的多模态放射性对比增强和肿瘤复发分类

Robin Peretzke, Marlin Hanstein, Maximilian Fischer, Lars Badhi Wessel, Obada Alhalabi, Sebastian Regnery, Andreas Kudak, Maximilian Deng, Tanja Eichkorn, Philipp Hoegen Saßmannshausen, Fabian Allmendinger, Jan-Hendrik Bolten, Philipp Schröter, Christine Jungk, Jürgen Peter Debus, Peter Neher, Laila König, Klaus Maier-Hein

机构 * Deutsches Krebsforschungszentrum (DKFZ)(德国癌症研究中心) Heidelberg University(海德堡大学) Heidelberg University Hospital(海德堡大学医院) Research Campus M2OLIE(M2OLIE研究园区) German Cancer Consortium (DKTK)(德国癌症联盟) Universitätsklinikum Heidelberg(海德堡大学医院) Heidelberger Institut für Radioonkologie (HIRO)(海德堡放射肿瘤学研究所) National Center for Tumor Diseases (NCT)(国家肿瘤疾病中心) Heidelberger Ionenstrahl-Therapiezentrum (HIT)(海德堡离子束治疗中心) Universitätsklinikum Heidelberg, Neurochirurgie(海德堡大学医院神经外科)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出RICE-NET模型,利用纵向MRI数据与放疗剂量分布,通过常规T1加权MRI实现自动病变分类,实验显示在92名患者中达到0.92的F1分数,证明多模态深度学习在神经肿瘤学中的诊断潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23617 2026-03-26 cs.CV 79%

M3T: Discrete Multi-Modal Motion Tokens for Sign Language Production

M3T:用于手语生成的离散多模态运动令牌

Alexandre Symeonidis-Herzig, Jianhe Low, Ozge Mercanoglu Sincan, Richard Bowden

机构 * CVSSP, University of Surrey, United Kingdom(CVSSP,萨里大学,英国)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出M3T,一种基于多模态运动词汇的自回归Transformer,通过结合FLAME的丰富表情空间与SMPL-X身体模型,实现手语生成中手、脸和口部动作的高质量表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23386 2026-03-25 cs.CV cs.GR cs.RO 79%

SIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLM

SIMART: 通过MLLM将单体网格分解为可模拟的关节化资产

Chuanrui Zhang, Minghan Qin, Yuang Wang, Baifeng Xie, Hang Li, Ziwei Wang

机构 * ByteDance Seed(字节跳动种子) NTU(国立台湾大学)

专题命中 多模态生成 :MLLM(title,abstract);分类 cs.CV

AI总结 SIMART通过统一的MLLM框架实现部分级分解和运动学预测,减少3D令牌数量,提升多部分组装的保真度,并在PartNet-Mobility和野外AIGC数据集上取得最佳性能,支持物理仿真的机器人模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22509 2026-03-25 cs.CV 79%

Sketch2CT: Multimodal Diffusion for Structure-Aware 3D Medical Volume Generation

Sketch2CT:多模态扩散用于结构感知的3D医学体积生成

Delin An, Chaoli Wang

机构 * University of Notre Dame(诺特大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Sketch2CT通过结合用户提供的2D草图和文本描述,利用多模态扩散框架生成结构一致的3D医学体积,提升生成质量与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03334 2026-03-25 cs.CV 79%

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07946 2026-03-25 cs.LG cs.AI cs.ET 79%

Bringing Multi-Modal Multi-Task Federated Foundation Models to Education Domain: Prospects and Challenges

将多模态多任务联邦基础模型引入教育领域:前景与挑战

Kasra Borazjani, Naji Khosravan, Rajeev Sahay, Bita Akram, Seyyedali Hosseinalipour

机构 * University at Buffalo –SUNY, Department of Electrical Engineering(布法罗大学–纽约州立大学,电气工程系) Adobe Research(Adobe研究) University of California – San Diego, Department of Electrical and Computer Engineering(加州大学圣地亚哥分校,电气与计算机工程系) NC State University, Department of Computer Science(北卡罗来纳州立大学,计算机科学系)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态多任务联邦基础模型(FedFMs)用于教育领域,旨在解决隐私保护、个性化和公平性问题,同时探讨未来研究方向和开放挑战。

Comments 12 pages, 2 figures

Journal ref Frontiers in Artificial Intelligence, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14145 2026-03-24 cs.DC cs.AI 79%

DIP: Efficient Large Multimodal Model Training with Dynamic Interleaved Pipeline

DIP: 一种高效的大规模多模态模型训练方法,采用动态交错流水线

Zhenliang Xue, Hanpeng Hu, Xing Chen, Yimin Jiang, Yixin Song, Zeyu Mi, Yibo Zhu, Daxin Jiang, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems(并行与分布式系统研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DIP框架,通过分离不同模态计算和动态分割输入数据,提升大规模多模态模型训练效率,实验显示吞吐量提升达97.3%。

Comments To be published in ASPLOS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20781 2026-03-24 cs.CL 79%

Code-MIE: A Code-style Model for Multimodal Information Extraction with Scene Graph and Entity Attribute Knowledge Enhancement

Code-MIE: 一种基于代码风格的多模态信息提取模型,结合场景图和实体属性知识增强

Jiang Liu, Ge Qiu, Hao Fei, Dongdong Xie, Jinbo Li, Fei Li, Chong Teng, Donghong Ji

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部与可信计算重点实验室,教育部,武汉大学计算机科学与工程学院) University of Oxford(牛津大学) Wuhan Second Ship Design and Research Institute(武汉第二船舶设计研究所) China United Network Communications Co., Ltd. Research Institute(中国联合网络通信有限公司研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出Code-MIE框架,通过统一代码理解和生成解决多模态信息提取问题,引入实体属性、场景图和文本参数,提升结构化信息提取性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19598 2026-03-23 cs.CV 79%

FlowScene: Style-Consistent Indoor Scene Generation with Multimodal Graph Rectified Flow

FlowScene: 多模态图校正流驱动的风格一致室内场景生成

Zhifei Yang, Guangyao Zhai, Keyang Lu, YuYang Yin, Chao Zhang, Zhen Xiao, Jieyi Long, Nassir Navab, Yikai Wang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Technical University of Munich(慕尼黑技术大学) Beijing Jiaotong University(北京交通大学) Beijing Digital Native Digital City Research Center(北京数字原生数字城市研究院) Theta Labs, Inc.(Theta Labs公司) Beijing Normal University(北京师范大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 FlowScene通过多模态图校正流模型生成风格一致的室内场景,实现对布局、形状和纹理的精细控制,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18505 2026-03-20 cs.CV 79%

From Snapshots to Symphonies: The Evolution of Protein Prediction from Static Structures to Generative Dynamics and Multimodal Interactions

从快照到交响曲:蛋白质预测从静态结构到生成动态和多模态交互的演变

Jingzhi Chen, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文综述了人工智能在蛋白质科学中的范式转变,探讨了多模态表示、静态预测优化、生成框架、异质相互作用预测及功能推断等核心方法,指出现存瓶颈并展望未来方向。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15228 2026-03-18 cs.CV 79%

HYDRA: Unifying Multi-modal Generation and Understanding via Representation-Harmonized Tokenization

HYDRA:通过表征协调的标记化统一多模态生成与理解

Xuerui Qiu, Yutao Cui, Guozhen Zhang, Junzhe Li, JiaKui Hu, Xiao Zhang, Yang Li, Songtao Liu, Miles Yang, Yu Shi, Zhao Zhong, Liefeng Bo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文英) Zhongguancun Academy(中关村学院) Nanjing University(南京大学) Peking University(北京大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 HYDRA通过表征协调的标记化统一多模态生成与理解,提出了一种新的统一框架,在单一参数空间内整合感知与生成,实验表明其在视觉重建和生成任务中均取得新突破。

Comments Work in progress: We are actively scaling up the models. More updates coming soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19117 2026-03-18 cs.CV physics.optics 79%

3M-TI: High-Quality Mobile Thermal Imaging via Calibration-free Multi-Camera Cross-Modal Diffusion

3M-TI: 通过无校准多相机跨模态扩散实现高质量移动热成像

Minchong Chen, Xiaoyun Yuan, Junzhe Wan, Jianing Zhang, Jun Zhang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能联合实验室,人工智能研究院,上海交通大学) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出3M-TI,一种无需校准的多相机跨模态扩散框架,通过跨模态自注意力模块提升热成像的分辨率和细节,验证其在实际应用中的优越性能。

Comments Accepted by CVPR 2026, Code: https://github.com/work-submit/3MTI, Project page: https://lab.xiaoyunyuan.net/index.html?project=3m-ti

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15724 2026-03-18 cs.LG cs.AI 79%

Meta-TTRL: A Metacognitive Framework for Self-Improving Test-Time Reinforcement Learning in Unified Multimodal Models

Meta-TTRL:一种用于统一多模态模型中自改进测试时间强化学习的元认知框架

Lit Sin Tan, Junzhe Chen, Xiaolong Fu, Lichen Ma, Junshi Huang, Jianzhong Shi, Yan Li, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 Meta-TTRL通过元认知信号实现测试时间参数优化,提升统一多模态模型的自改进能力,在文本到图像生成任务中取得显著成果。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏