arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 27 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 27 篇

2511.18333 2026-03-17 cs.CV 83%

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06251 2026-03-17 cs.SE cs.AI 83%

DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation

DesignBench: 一个全面的基于MLLM的前端代码生成基准测试

Jingyu Xiao, Ming Wang, Man Ho Lam, Yuxuan Wan, Junliang Liu, Yintong Huo, Michael R. Lyu

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 DesignBench针对MLLM在前端工程中的应用,提出多框架、多任务的评估基准,涵盖生成、编辑和修复三个任务,通过900个网页样本分析模型性能,揭示框架特定限制和任务瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13587 2026-03-17 cs.AI cs.CV 81%

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

突破SFT平台:面向图表到代码生成的多模态结构强化学习

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Liming Zheng, Yufeng Zhong, Lin Ma

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态结构强化学习(MSRL)以突破SFT平台,通过大规模实验构建最大训练语料库,并采用双阶段课程训练策略,提升图表到代码生成的高阶指标。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12207 2026-03-17 cs.CV 79%

Mixture of States: Routing Token-Level Dynamics for Multimodal Generation

状态混合:用于多模态生成的路由令牌级动态

Haozhe Liu, Ding Liu, Mingchen Zhuge, Zijian Zhou, Tian Xie, Sen He, Yukang Yang, Shuming Liu, Yuren Cong, Jiadong Guo, Hongyu Xu, Ke Xu, Kam-Woh Ng, Juan C. Pérez, Juan-Manuel Pérez-Rúa, Tao Xiang, Wei Liu, Shikun Liu, Jürgen Schmidhuber

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MoS,一种多模态扩散模型的融合范式,通过灵活的状态交互融合模态。核心是可学习的令牌路由器,通过时间步和输入依赖的交互对模态隐藏状态进行去噪,实现令牌级特征与扩散轨迹的精确对齐。

Comments Accepted to CVPR 2026; Homepage: https://haozheliu-st.github.io/mos-homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24267 2026-03-17 cs.CV 79%

FakeScope: Large Multimodal Expert Model for Transparent AI-Generated Image Forensics

FakeScope:大型多模态专家模型用于透明的AI生成图像取证

Yixuan Li, Yu Tian, Yipo Huang, Wei Lu, Shiqi Wang, Weisi Lin, Anderson Rocha

机构 * College of Computing, City University of Hong Kong(城市大学 computing 学院) School of Data Science and Artificial Intelligence, Chang’an University(长安大学数据科学与人工智能学院) School of Computer Science and Engineering, Ministry of Education Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-Sen University(中山大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 computing 与数据科学学院) Artificial Intelligence Lab. (Recod.ai) at the University of Campinas(坎皮纳斯大学人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 FakeScope通过多模态专家模型提升AI生成图像的检测能力,提供可解释的取证分析,实现高精度识别与深入解释,具备零样本检测和跨生成器泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14199 2026-03-17 cond-mat.mtrl-sci 78%

Millimeter-Scale, Atomically Controlled 2D Topological Insulators Revealed by Multimodal Spectroscopy

毫米级、原子级控制的二维拓扑绝缘体通过多模式光谱揭示

Woojoo Lee, Qiang Gao, Yufei Zhao, Hui Li, Albert Tsui, Yichao Zhang, Yunhe Bai, Haoran Lin, Khanh Duy Nguyen, Gabriele Berruto, Gangbin Yan, Jianchen Dang, Tongyao Wu, Hossein Rokni, Thomas S. Marchese, Ying Shirley Meng, Chao-Xing Liu, Xiao-Xiao Zhang, Chong Liu, Pinshane Y. Huang, Mark C. Hersam, Binghai Yan, Shuolong Yang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究通过多模式光谱揭示了毫米级原子级控制的二维拓扑绝缘体,展示了Bi2Te3和MnBi2Te4/Bi2Te3异质结构的电子结构和拓扑边缘态,验证了其作为稳健二维拓扑绝缘体的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13440 2026-03-17 cs.LG cs.IT math.IT 78%

Improving Channel Estimation via Multimodal Diffusion Models with Flow Matching

通过多模态扩散模型与流匹配改进信道估计

Xiaotian Fan, Xingyu Zhou, Le Liang, Xiao Li, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Purple Mountain Laboratories(紫金山实验室)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出基于流匹配和扩散变压器的多模态信道估计框架MultiCE-Flow,通过融合LiDAR、相机和位置数据生成语义条件,利用稀疏试点作为结构条件,实现高保真信道重建,优于传统方法和生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20054 2026-03-17 cs.CV 77%

Marmot: Object-Level Self-Correction via Multi-Agent Reasoning

Marmot:通过多智能体推理实现对象级自校正

Jiayang Sun, Hongbo Wang, Jie Cao, Huaibo Huang, Ran He

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 Marmot通过多智能体推理实现对象级自校正,提升图像文本对齐的准确性,解决多对象场景中计数、属性和空间关系的校正问题。

Journal ref Machine Intelligence Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 73%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.MM

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00782 2026-03-17 cs.GR cs.AI cs.CV cs.MM cs.SD eess.AS 70%

SpA2V: Harnessing Spatial Auditory Cues for Audio-driven Spatially-aware Video Generation

SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成

Kien T. Pham, Yingqing He, Yazhou Xing, Qifeng Chen, Long Chen

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。

Comments The 33rd ACM Multimedia Conference (MM '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18328 2026-03-17 cs.CV cs.AI 62%

Virtual Full-stack Scanning of Brain MRI via Imputing Any Quantised Code

通过填补任意量化代码实现脑部MRI的虚拟全栈扫描

Yicheng Wu, Tao Song, Zhonghua Wu, Jin Ye, Zongyuan Ge, Wenjia Bai, Zhaolin Chen, Jianfei Cai

专题命中 多模态生成 :any-to-any(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CodeBrain框架,通过区域级全栈代码预测解决MRI模态缺失问题,提升数据完整性和临床实用性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14207 2026-03-17 cs.CV cs.AI 62%

DualTSR: Unified Dual-Diffusion Transformer for Scene Text Image Super-Resolution

DualTSR:统一的双扩散变压器用于场景文本图像超分辨率

Axi Niu, Kang Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 DualTSR通过统一的双扩散目标解决文本图像超分辨率中的文本先验依赖和复杂架构问题,采用单多模态Transformer骨干网络,实现视觉与文本信息的交互,提升超分辨率效果与文本保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15271 2026-03-17 cs.CV 57%

Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models

Flash-Unified: 一种无需训练且任务感知的加速框架用于原生统一模型

Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Chicago(芝加哥大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FlashU框架,通过任务感知的网络剪枝和动态层跳过,减少统一模型的计算冗余,提升生成和理解任务的推理速度,实验表明在Show-o2数据集上加速1.78至2.01倍,保持SOTA性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14948 2026-03-17 cs.CV 57%

Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation

弥合场景生成与规划:通过统一视觉与运动表示进行驾驶世界模型

Xingtai Gui, Meijie Zhang, Tianyi Yan, Wencheng Han, Jiahao Gong, Feiyang Tan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Afari Intelligent Drive(Afari智能驾驶)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出WorldDrive框架,通过统一视觉与运动表示弥合场景生成与规划之间的差距,利用轨迹感知驾驶世界模型和未来感知奖励器提升自动驾驶规划性能。

Comments 16 pages, 9 figures. The code is available at https://github.com/TabGuigui/WorldDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10910 2026-03-17 cs.CL 57%

GLM-OCR Technical Report

GLM-OCR 技术报告

Shuaiqi Duan, Yadong Xue, Weihan Wang, Zhe Su, Huan Liu, Sheng Yang, Guobing Gan, Guo Wang, Zihan Wang, Shengdong Yan, Dexin Jin, Yuxuan Zhang, Guohong Wen, Yanfeng Wang, Yutao Zhang, Xiaohan Zhang, Wenyi Hong, Yukuo Cen, Da Yin, Bin Chen, Wenmeng Yu, Xiaotao Gu, Jie Tang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 GLM-OCR 是一种高效紧凑的多模态模型,结合了CogViT视觉编码器和GLM语言解码器,通过多令牌预测机制提升OCR效率,适用于文档理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14063 2026-03-17 cs.CV 57%

Semantic Context Matters: Improving Conditioning for Autoregressive Models

语义上下文至关重要:改进自回归模型的条件化

Dongyang Jin, Ryan Xu, Jianhao Zeng, Rui Lan, Yancheng Bai, Lei Sun, Xiangxiang Chu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SCAR方法,通过压缩语义前缀和语义对齐指导提升自回归模型的条件化能力,实现更高质量的图像编辑和可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14702 2026-03-17 cs.CV 57%

Fractal Autoregressive Depth Estimation with Continuous Token Diffusion

分形自回归深度估计与连续令牌扩散

Jinchang Zhang, Xinrou Kang, Guoyu Lu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种分形视觉自回归扩散框架,通过粗到细的自回归生成过程改进单目深度估计,采用多尺度特征融合和连续空间去噪扩散损失提升跨模态条件化效果,同时通过分形递归架构和不确定性感知共识聚合方案提高计算效率与预测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14505 2026-03-17 cs.CV 57%

Unlocking the Latent Canvas: Eliciting and Benchmarking Symbolic Visual Expression in LLMs

解锁潜在画布:在LLMs中引发和评估符号视觉表达

Yiren Zheng, Shibo Li, Jiaming Liu, Haofan Wang, Yiren Song

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文通过ASCII艺术格式揭示LLMs的潜在视觉能力,提出SVE-ASCII框架,构建ASCIIArt-7K数据集,并展示生成训练如何提升视觉理解,建立文本基视觉智能的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14112 2026-03-17 cs.CV 57%

Revisiting the Perception-Distortion Trade-off with Spatial-Semantic Guided Super-Resolution

重新审视基于空间-语义引导的超分辨率中的感知-失真权衡

Dan Wang, Haiyan Sun, Shan Du, Z. Jane Wang, Zhaochong An, Serge Belongie, Xinrui Cui

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpaSemSR框架,通过空间-语义引导减少失真并提升感知质量,实验显示在多个基准上实现了更优的感知-失真平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13969 2026-03-17 cs.CV eess.IV 57%

Leveraging a Statistical Shape Model for Efficient Generation of Annotated Training Data: A Case Study on Liver Landmarks Segmentation

利用统计形状模型实现高效标注训练数据生成:肝脏标志点分割的案例研究

Denis Krnjaca, Lorena Krames, Werner Nahm

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用统计形状模型生成大量标注数据的方法,用于深度学习的肝脏标志点分割,显著提高了分割效率并减少了手动标注的工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13956 2026-03-17 cs.AI 57%

EviAgent: Evidence-Driven Agent for Radiology Report Generation

EviAgent:基于证据的放射学报告生成代理

Tuoshi Qi, Shenshen Bu, Yingfei Xiang, Zhiming Dai

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 EviAgent通过引入多维视觉专家和检索机制,解决放射学报告生成中的透明性与证据支持问题,实验表明其在多个数据集上优于通用和专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13386 2026-03-17 cs.CV 57%

Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers

基于布局的可控病理图像生成与上下文扩散变换器

Yuntao Shou, Xiangyong Cao, Qian Zhao, Deyu Meng

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于布局的可控病理图像生成方法,通过多代理LVLM注释框架构建精细临床对齐的监督数据,提出IC-DiT模型整合空间布局、文本描述和视觉嵌入,实现高保真生成与强空间可控性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13375 2026-03-17 cs.CV cs.LG 57%

InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization

InfiniteDance: 可扩展的3D舞蹈生成以实现真实场景泛化

Ronghui Li, Zhongyuan Hu, Li Siyao, Youliang Zhang, Haozhe Xie, Mingyuan Zhang, Jie Guo, Xiu Li, Ziwei Liu

机构 * Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出InfiniteDance,通过扩大数据与模型设计,实现可扩展的3D舞蹈生成,解决了真实场景下的泛化问题。

Comments project page: https://infinitedance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14056 2026-03-17 cs.RO cs.SY eess.SY 50%

Amortizing Trajectory Diffusion with Keyed Drift Fields

通过键控漂移场实现轨迹扩散的 amortization

Gokul Puthumanaillam, Melkior Ornik

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出键控漂移策略,通过单步推理实现轨迹扩散行为,保留多样候选计划生成和实时控制循环中的状态条件能力,降低规划延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15746 2026-03-17 cs.LG cond-mat.mtrl-sci 50%

A Unified Generative-Predictive Framework for Deterministic Inverse Design

一种统一的生成-预测框架用于确定性反向设计

Reza T. Batley, Sourav Saha

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出Janus框架,结合编码器-解码器与预测性KHRONOS 头,解决异质材料微结构反向设计问题,实现高效物理引导的生成与预测。

Journal ref AIAA SciTech Forum, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13839 2026-03-17 cs.CE 50%

NetSpatial: Spatially Conditional Traffic Generation for Cellular Planning and Operations

NetSpatial: 基于空间条件的蜂窝网络生成用于蜂窝规划与运营

Shiyuan Zhang, Jiale Du, Yuanwei Liu, Kaibin Huang, Hongyang Du

专题命中 多模态生成 :multimodal(abstract)

AI总结 NetSpatial通过空间条件生成蜂窝网络流量,结合多模态城市数据,实现部署规划与运营决策,实验显示其在流量预测和能效方面有显著优势。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13265 2026-03-17 cs.LG 50%

Knowledge, Rules and Their Embeddings: Two Paths towards Neuro-Symbolic JEPA

知识、规则及其嵌入:迈向神经符号JEPA的两条路径

Yongchao Huang, Hassan Raza

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出双向神经符号框架RiJEPA,通过能量约束和多模态双编码架构注入归纳偏置,重塑表示流形,实现几何逻辑盆地;并通过连续可微逻辑替代离散规则,实现连续规则发现,提升生成与推理能力。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏