arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-27 至 2026-03-27 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 15 篇

2603.25108 2026-03-27 cs.CV 83%

MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

MSRL: 通过多阶段强化学习扩展生成多模态奖励建模

Chenglong Wang, Yifu Huo, Yang Gan, Qiaozhi He, Qi Meng, Bei Li, Yan Wang, Junfu Liu, Tianhua Zhou, Jingbo Zhu, Tong Xiao

机构 * Northeastern University, Shenyang, China(东北大学(沈阳)) ByteDance(字节跳动)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MSRL方法,通过多阶段强化学习在有限多模态数据下扩展生成多模态奖励模型,提升视觉理解和生成任务性能,无需额外标注数据。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24821 2026-03-27 cs.CV cs.AI 81%

Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation

明闪奥米:一种稀疏、统一的多模态感知与生成架构

Inclusion AI, :, Bowen Ma, Cheng Zou, ChengKun Du, Canxiang Yan, Chunxiang Jin, Chunjie Shen, Chenyu Lian, Chengxiang Fan, Dandan Zheng, Fudong Wang, Furong Xu, Guangming Yao, Haohao Liu, Han Peng, Jun Zhou, Junluan Xia, Jingdong Chen, Jianing Li, Jianxin Sun, Jianjiang Zhu, Jianping Jiang, Jinpeng Ou, Jun Peng, Jin Peng, Kaixiang Ji, Li Tang, Libin Wang, Lixiang Ru, Longhua Tan, Lu Ma, Lan Wang, Mochen Bai, Minghong Cai, Mingxue Yang, Ning Gao, Qingpei Guo, Qinglong Zhang, Qiang Xu, Qin Zhao, Rui Liu, Ruijie Xiong, Ruobing Zheng, Sirui Gao, Shaoxiong Lin, Tao Zhang, Tianqi Li, Tinghao Liu, Tongli Wang, Taoye Huang, Weilong Chai, Xiaomei Wang, Xiaolong Wang, Xiaojian Liu, Xiao Lu, Xiaoyu Li, Xingning Dong, Xuzheng Yu, Xuezhi Wang, Yi Yuan, Yuting Gao, Yuting Xiao, Yunxiao Sun, Yipeng Chen, Yifan Mao, Yifei Wu, Yongjie Lyu, Yingying Zhang, YuQian Li, Ziping Ma, Zhiqiang Fang, Zhihao Qiu, Ziyuan Huang, Zizheng Yang, Zhengyu He

机构 * Inclusion AI Ant Group(Inclusion AI蚂蚁集团)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Ming-Flash-Omni基于稀疏的MoE变体Ling-Flash-2.0,实现高效扩展和多模态统一智能,展现强多模态理解与生成能力,接近AGI水平。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL 81%

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25565 2026-03-27 cs.CV 79%

GeoHeight-Bench: Towards Height-Aware Multimodal Reasoning in Remote Sensing

GeoHeight-Bench:迈向遥感中基于高度的多模态推理

Xuran Hu, Zhitong Xiong, Zhongcheng Hong, Yifang Ban, Xiaoxiang Zhu, Wufan Zhao

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Technical University of Munich(慕尼黑工业大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GeoHeight-Bench,通过构建高度感知的遥感理解评估框架,解决现有多模态模型在复杂遥感几何和灾害场景中忽略垂直维度的问题,提出数据生成管道和基准测试,并验证高度感知的重要性。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11827 2026-03-27 cs.CV 79%

Multimodal classification of Radiation-Induced Contrast Enhancements and tumor recurrence using deep learning

基于深度学习的多模态放射性对比增强和肿瘤复发分类

Robin Peretzke, Marlin Hanstein, Maximilian Fischer, Lars Badhi Wessel, Obada Alhalabi, Sebastian Regnery, Andreas Kudak, Maximilian Deng, Tanja Eichkorn, Philipp Hoegen Saßmannshausen, Fabian Allmendinger, Jan-Hendrik Bolten, Philipp Schröter, Christine Jungk, Jürgen Peter Debus, Peter Neher, Laila König, Klaus Maier-Hein

机构 * Deutsches Krebsforschungszentrum (DKFZ)(德国癌症研究中心) Heidelberg University(海德堡大学) Heidelberg University Hospital(海德堡大学医院) Research Campus M2OLIE(M2OLIE研究园区) German Cancer Consortium (DKTK)(德国癌症联盟) Universitätsklinikum Heidelberg(海德堡大学医院) Heidelberger Institut für Radioonkologie (HIRO)(海德堡放射肿瘤学研究所) National Center for Tumor Diseases (NCT)(国家肿瘤疾病中心) Heidelberger Ionenstrahl-Therapiezentrum (HIT)(海德堡离子束治疗中心) Universitätsklinikum Heidelberg, Neurochirurgie(海德堡大学医院神经外科)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出RICE-NET模型,利用纵向MRI数据与放疗剂量分布,通过常规T1加权MRI实现自动病变分类,实验显示在92名患者中达到0.92的F1分数,证明多模态深度学习在神经肿瘤学中的诊断潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20060 2026-03-27 cs.CV cs.RO 74%

MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving

MeanFuser: 一种基于MeanFlow的高效多模态轨迹生成与自适应重构方法用于端到端自动驾驶

Junli Wang, Yinan Zheng, Xueyi Liu, Zebin Xing, Pengfei Li, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Zhongpu Xia, Long Chen, Qichao Zhang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xiaomi EV(小米汽车) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院)

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

AI总结 本文提出MeanFuser,通过引入Gaussian Mixture Noise、MeanFlow Identity和轻量级ARM模块,实现了高效且鲁棒的多模态轨迹生成与自适应重构,提升了端到端自动驾驶的性能和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13303 2026-03-27 cs.CV 70%

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00141 2026-03-27 cs.CV cs.AI cs.LG eess.IV 62%

From Scale to Speed: Adaptive Test-Time Scaling for Image Editing

从尺度到速度:面向图像编辑的自适应测试时间缩放

Xiangyan Qu, Zhenlong Yuan, Jing Tang, Rui Chen, Datao Tang, Meng Yu, Lei Sun, Yancheng Bai, Xiangxiang Chu, Gaopeng Gou, Gang Xiong, Yujun Cai

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) AMAP, Alibaba Group(阿里巴巴集团高德地图) University of Queensland(昆士兰大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ADE-CoT框架,通过动态资源分配、编辑特定验证和深度优先停止策略,提升图像编辑效率与性能,实验显示在同等采样预算下性能优于现有方法。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24965 2026-03-27 cs.CV cs.AI 62%

Self-Corrected Image Generation with Explainable Latent Rewards

可解释性潜在奖励的自校正图像生成

Yinyi Luo, Hrishikesh Gokhale, Marios Savvides, Jindong Wang, Shengfeng He

机构 * Carnegie Mellon University(卡内基梅隆大学) Singapore Management University(新加坡管理大学) William & Mary(威廉与玛丽学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出xLARD框架,利用多模态大语言模型通过可解释性潜在奖励指导生成,改进语义对齐和视觉保真度,同时保持生成先验。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25711 2026-03-27 cs.CV 57%

Seeing to Ground: Visual Attention for Hallucination-Resilient MDLLMs

视觉注意:用于抗幻觉的MDLLMs

Vishal Narnaware, Animesh Gupta, Kevin Zhai, Zhenyi Wang, Mubarak Shah

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VISAGE框架,通过校准解码器目标来减少多模态幻觉,通过空间熵分析提升视觉基础性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25462 2026-03-27 cs.RO cs.AI 57%

Temporally Decoupled Diffusion Planning for Autonomous Driving

时间解耦的扩散规划用于自动驾驶

Xiang Li, Bikun Wang, John Zhang, Jianjun Wang

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出时间解耦扩散模型(TDDM),通过噪声掩码方法解决动态城市环境中即时安全与长期目标的平衡问题,改进轨迹生成并提升复杂场景下的规划性能。

Comments icaps

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25118 2026-03-27 cs.CV 57%

AnyDoc: Enhancing Document Generation via Large-Scale HTML/CSS Data Synthesis and Height-Aware Reinforcement Optimization

AnyDoc:通过大规模HTML/CSS数据合成和高度感知强化优化提升文档生成

Jiawei Lin, Wanrong Zhu, Vlad I Morariu, Christopher Tensmeyer

机构 * Xi’an Jiaotong University(西安交通大学) Adobe Research(Adobe研究院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 AnyDoc通过大规模HTML/CSS数据合成和高度感知强化优化,实现多文档生成任务,包含265206个样本,覆盖111类和32种风格,提升文档生成性能。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12200 2026-03-27 cs.CV 57%

CompBench: Benchmarking Complex Instruction-guided Image Editing

CompBench:复杂指令引导图像编辑的基准测试

Bohan Jia, Wenxuan Huang, Yuntian Tang, Junbo Qiao, Jincheng Liao, Shaosheng Cao, Fei Zhao, Zhaopeng Feng, Zhouhong Gu, Zhenfei Yin, Lei Bai, Wanli Ouyang, Lin Chen, Fei Zhao, Yao Hu, Zihan Wang, Yuan Xie, Shaohui Lin

机构 * East China Normal University(华东师范大学) Xiaohongshu Inc.(小红书) KLATASDS, MOE, China(中国教育部统计与数据科学重点实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Fudan University(复旦大学) University of Oxford(牛津大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 CompBench旨在解决现有图像编辑基准测试对任务复杂度简化的问题,通过引入复杂指令引导的图像编辑基准,评估模型在精细操控能力上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24938 2026-03-27 cs.CV 57%

Infinite Gaze Generation for Videos with Autoregressive Diffusion

视频无限 gaze 生成的自回归扩散模型

Jenna Kang, Colin Groth, Tong Wu, Finley Torrens, Patsorn Sangkloy, Gordon Wetzstein, Qi Sun

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种自回归扩散模型,用于生成任意长度视频的无限 horizon 原始 gaze,通过在 saliency-aware 视觉潜在空间中条件化,提升长程时空准确性和轨迹真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25481 2026-03-27 cs.RO 50%

LILAC: Language-Conditioned Object-Centric Optical Flow for Open-Loop Trajectory Generation

LILAC:基于语言的物体中心光学流用于开环轨迹生成

Motonari Kambara, Koki Seno, Tomoya Kaichi, Yanan Wang, Komei Sugiura

机构 * Keio University(庆应义塾大学) KDDI Research Inc.(KDDI研究所)

专题命中 多模态生成 :cross-modal(abstract)

AI总结 本文提出LILAC模型,通过结合视觉与语言信息生成物体中心光学流,并转化为6自由度机械臂轨迹,实验显示其在多个基准和实际物体操作中表现更优。

Comments Accepted to IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏