arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4932 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4932 篇

2605.17907 2026-05-19 cs.CV cs.AI 81%

One Model to Translate Them All: Universal Any-to-Any Translation for Heterogeneous Collaborative Perception

一个模型翻译它们所有:面向异构协作感知的通用任意到任意翻译

Yang Li, Weize Li, Quan Yuan, Congzhang Shao, Guiyang Luo, Yunqi Ba, Xuanhan Zhu, Xinyuan Ding, Xiaoyuan Fu, Jinglin Li

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 多模态生成 :any-to-any(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UniTrans,一种通用任意到任意特征模态翻译模型,通过预训练一组翻译专家参数并学习其组合系数来实现零样本翻译,从而在OPV2V-H和DAIR-V2X数据集上实现了优于现有方法的性能。

Comments 19 pages, accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01593 2026-05-19 cs.CV cs.MM 81%

Beyond Patches: Global-aware Autoregressive Model for Multimodal Few-Shot Font Generation

超越补丁:面向多模态少样本字体生成的全局感知自回归模型

Haonan Cai, Yuxuan Luo, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学轩计算机技术研究所) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出GAR-Font,一种多模态少样本字体生成的自回归框架,通过全局感知分词器、多模态风格编码器和后处理流程,提升了字体生成的全局风格一致性和质量。

Comments 28 pages, Accepted as CVPR 2026 Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22151 2026-05-18 cs.CV cs.CL 81%

MultiMat: Multimodal Program Synthesis for Procedural Materials using Large Multimodal Models

MultiMat: 多模态程序合成用于基于过程的材料生成

Jonas Belouadi, Tamy Boubekeur, Adrien Kaiser

机构 * University of Mannheim(曼海姆大学) Adobe Research(Adobe研究)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 MultiMat利用大规模多模态模型实现多模态程序合成,提升生成过程材料图的效率与视觉质量,优于纯文本基线方法。

Comments Accepted at ICLR 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22317 2026-05-15 cs.LG cs.AI cs.CV 81%

LangPrecip: Language-Aware Multimodal Precipitation Nowcasting

LangPrecip: 基于语言的多模态降水现在预报

Xudong Ling, Chaorong Li, Tianxi Huang, Qian Dong, Guiduo Duan

机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science(智能协同计算实验室,电子科学科技大学) School of Computer Science(计算机科学学院) Technology (School of Artificial Intelligence), Yibin University(技术(人工智能学院),宜宾大学) College of Humanities(人文学院) General Education, Chengdu Textile College(通识教育,成都纺织学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LangPrecip框架,通过将气象文本作为语义运动约束,结合雷达信息进行降水演变预测,提升预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11363 2026-05-13 cs.CV cs.CL 81%

PresentAgent-2: Towards Generalist Multimodal Presentation Agents

PresentAgent-2: 向通用多模态展示代理迈进

Wei Wu, Ziyang Xu, Zeyu Zhang, Yang Zhao, Hao Tang

机构 * Peking University(北京大学) La Trobe University(拉特罗布大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 PresentAgent-2通过多模态资源收集与生成,实现基于用户查询的交互式展示视频生成,支持单人叙述、多人讨论及观众互动三种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06699 2026-05-11 eess.IV cs.AI cs.CV cs.LG 81%

Multimodal synthesis of MRI and tabular data with diffusion in a joint latent space via cross-attention

通过交叉注意力在联合潜在空间中利用扩散模型进行MRI和表格数据的多模态合成

Daniel Mensing, Jan Kapar, Jochen G. Hirsch, Matthias Günther, Horst Hahn, Marvin N. Wright

机构 * Fraunhofer Institute for Digital Medicine MEVIS(弗劳恩霍夫数字医学研究所MEVIS) Leibniz Institute for Prevention Research and Epidemiology – BIPS(莱比锡预防研究与流行病学研究所 – BIPS) Faculty of Mathematics and Computer Science, University of Bremen(不莱梅大学数学与计算机科学学院) Faculty of Physics and Electrical Engineering, University of Bremen(不莱梅大学物理与电气工程学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种多模态潜在扩散模型,通过交叉注意力在共享潜在空间中联合生成MRI和临床表格数据,验证了在单一扩散框架中联合建模MRI和混合类型表格数据的可行性。

Journal ref Proc. SPIE 13925, Medical Imaging 2026: Image Processing, 139252D (April 03, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06096 2026-05-08 cs.CL cs.CV 81%

Uncovering Entity Identity Confusion in Multimodal Knowledge Editing

揭示多模态知识编辑中的实体身份混淆

Shu Wu, Xiaotian Ye, Xinyu Mou, Dongsheng Liu, Xiaohan Wang, Mengqi Zhang

机构 * New Laboratory of Pattern Recognition (NLPR)(模式识别新实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS)(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing University of Posts and Telecommunications(北京邮电大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Huazhong University of Science and Technology(华中科技大学) Shandong University(山东大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文研究多模态知识编辑中实体身份混淆问题,发现现有方法无法区分图像-实体绑定与实体-实体关系,导致模型错误关联。通过构建EC-Bench基准测试,提出约束编辑阶段以提升绑定准确性,从而减少混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05781 2026-05-08 cs.CV cs.AI 81%

Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

通过理解监督引导统一多模态模型的视觉生成

Zeyu Liu, Zanlin Ni, Yang Yue, Cheng Da, Huan Yang, Di Zhang, Kun Gai, Gao Huang

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手技术团队)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UNO框架,通过将理解作为监督信号引导生成,提升多模态模型在图像生成与编辑中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01144 2026-05-05 cs.CV cs.AI 81%

Semantic Context-aware mOdality fUsion Transformer (SCOUT): A Context-Aware Multimodal Transformer for Concept-Grounded Pathology Report Generation

语义上下文感知的多模态融合变换器(SCOUT):一种基于概念的多模态变换器,用于病理报告生成

Suryakant Singh, Saarthak Kapse, Joel Saltz, Prateek Prasanna

机构 * Stony Brook University(石桥大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SCOUT通过整合局部组织学模式、整张滑片上下文和专家编纂的语义描述符,实现病理报告生成的语义上下文感知,提升临床相关性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.05231 2026-05-01 cs.CV cs.AI 81%

Culture-inspired Multi-modal Color Palette Generation and Colorization: A Chinese Youth Subculture Case

文化启发的多模态配色生成与配色:一个中国青年亚文化案例

Yufan Li, Jinggang Zhuo, Ling Fan, Harry Jiannan Wang

机构 * Tongji University(同济大学) Tezign.com Ltd.(Tezign.com有限公司) University of Delaware(德雷塞尔大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文通过构建基于中国青年亚文化的配色数据集,提出多模态生成框架,实现具有亚文化特色的配色方案,通过用户研究验证其有效性。

Comments accepted by the 3rd IEEE Workshop on Artificial Intelligence for Art Creation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09547 2026-04-30 cs.CV cs.AI 81%

GoViG: Goal-Conditioned Visual Navigation Instruction Generation via Multimodal Reasoning

GoViG:通过多模态推理实现目标条件视觉导航指令生成

Fengyi Wu, Yifei Dong, Yilong Dai, Guangyu Chen, Qifeng Wu, Huiting Huang, Hang Wang, Qi Dai, Alexander G. Hauptmann, Zhi-Qi Cheng

机构 * University of Washington(华盛顿大学) The Hong Kong Polytechnic University(香港理工大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GoViG任务,通过多模态推理生成基于初始和目标状态的视觉导航指令,采用自回归多模态大语言模型提升空间准确性和语言清晰度,提出两种多模态推理策略并构建R2R-Goal数据集验证方法有效性。

Comments Accepted to ACL 2026 Findings. 22 pages, 12 figures, Code: https://github.com/F1y1113/GoViG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25299 2026-04-29 cs.CV cs.AI 81%

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19902 2026-04-23 cs.CV cs.AI cs.LG 81%

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

MMCORE:多模态连接与表征对齐的潜在嵌入

Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18091 2026-04-21 cs.CL cs.CV 81%

Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts

具有文化意识的幽默标题生成:跨文化多模态幽默生成

Run Xu, Lu Li, Rongzhao Zhang, Jie Xu

机构 * Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出一种多模态幽默生成任务,通过文化意识标题生成模型在不同文化背景下生成幽默标题,改进了文化背景下的图像相关性、语境适配性和幽默质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17319 2026-04-21 cs.CV cs.CL 81%

E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition

E2E-GMNER:端到端生成式 grounded 多模态命名实体识别

Meng Zhang, Jinzhong Ning, Xiaolong Wu, Hongfei Lin, Yijia Zhang

机构 * Dalian Maritime University(大连海事大学) Dalian University of Technology(大连理工大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出E2E-GMNER,通过端到端生成框架统一实体识别、语义类型预测和视觉定位,采用链式推理和GRBP提升鲁棒性,实验证明其在多模态命名实体识别任务中表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13540 2026-04-16 cs.CV cs.AI 81%

Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding

统一多模态模型的免费午餐:通过内在理解的反思校正增强生成

Yibo Jiang, Tao Wu, Rui Jiang, Yehao Lu, Chaoxiang Cai, Zequn Qin, Xi Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science(计算机科学学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出UniRect-CoT框架,通过反思校正提升统一多模态模型的生成能力,利用内部知识校正中间结果,增强生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13236 2026-04-16 cs.CV cs.AI eess.IV 81%

SemiFA: An Agentic Multi-Modal Framework for Autonomous Semiconductor Failure Analysis Report Generation

SemiFA:一种用于自主半导体故障分析报告生成的代理多模态框架

Shivam Chand Kaushik

机构 * School of Artificial Intelligence and Data Engineering (SAIDE)(人工智能与数据工程学院) Indian Institute of Technology Jodhpur(印度理工学院贾尔普尔)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 SemiFA通过多代理语言图框架实现自主生成半导体故障分析报告,利用多模态数据融合提升根因分析精度,首次整合SECS/GEM设备 telemetry 进行自动化报告生成。

Comments 11 pages, 6 figures, 8 tables. Dataset available at https://huggingface.co/datasets/ShivamChand/SemiFA-930. Code available at https://github.com/Shivamckaushik/SemiFA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10949 2026-04-14 cs.CV cs.AI 81%

Pseudo-Unification: Entropy Probing Reveals Divergent Information Patterns in Unified Multimodal Models

伪统一:熵探测揭示统一多模态模型中分歧的信息模式

Songlin Yang, Xianghao Kong, Anyi Rao

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究揭示统一多模态模型中伪统一现象的根源,通过信息论方法分析输入编码和输出生成,发现模态不对称编码和响应模式分裂是导致分歧的主要原因,强调信息流一致性对真实多模态协同的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11435 2026-04-10 cs.CV cs.AI 81%

The Persistence of Cultural Memory: Investigating Multimodal Iconicity in Diffusion Models

文化记忆的延续:探究扩散模型中的多模态图标性

Maria-Teresa De Rosa Palmini, Eva Cetinic

机构 * University of Zurich(苏黎世大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究扩散模型在文化共享视觉参考提示下的泛化与记忆模糊性,提出CRT指标评估模型对文化参考的识别与实现能力,揭示模型行为依赖于对参考的识别与再现方式,推动评估向更丰富的语境理解发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05497 2026-04-08 cs.AI cs.CV 81%

Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

Thinking Diffusion: 通过惩罚和引导在扩散多模态语言模型中抑制和引导视觉推理

Keuntae Kim, Mingyu Kang, Yong Suk Choi

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文针对扩散多模态语言模型在视觉推理中生成过早答案的问题,提出位置与步数惩罚和视觉推理引导方法,提升推理准确率并加快推理速度。

Comments CVPR 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04570 2026-04-08 cs.CV cs.CL 81%

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

通过视频思考:视频生成作为一种有前途的多模态推理范式

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14949 2026-04-08 cs.CL cs.CV cs.LG 81%

DialectGen: Benchmarking and Improving Dialect Robustness in Multimodal Generation

DialectGen:多模态生成中方言鲁棒性评估与改进

Yu Zhou, Sohyun An, Haikang Deng, Da Yin, Clark Peng, Cho-Jui Hsieh, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文通过构建涵盖六种英语方言的大型基准,评估多模态生成模型在方言输入下的表现,提出一种通用编码器策略提升方言鲁棒性,同时保持标准美式英语性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15772 2026-04-01 cs.CV cs.AI 81%

Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models

理解与生成:多模态模型中的优化困境导航

Sen Ye, Mengde Xu, Shuyang Gu, Di He, Liwei Wang, Han Hu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Tencent(腾讯) Center for Data Science, Peking University(北京大学数据科学中心) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出R3框架,通过将生成任务分解为生成-理解-生成的多步骤过程,缓解生成与理解之间的优化困境,提升生成效果和理解能力。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29029 2026-04-01 cs.CV cs.AI 81%

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas(北德克萨斯大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11483 2026-03-31 cs.CV cs.AI 81%

ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation

ImAgent:一种统一的多模态代理框架,用于测试时间可扩展的图像生成

Kaishen Wang, Ruibo Chen, Tong Zheng, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 ImAgent通过统一的多模态代理框架,在测试时间实现高效的图像生成扩展,通过内部推理、生成和自评估模块提升图像质量和语义一致性。

Comments 8 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26348 2026-03-30 cs.CV cs.AI 81%

Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification

反思以获取信息:通过信息增益驱动的验证提升多模态推理

Shuai Lv, Chang Liu, Feng Tang, Yujie Yuan, Aojun Zhou, Kui Zhang, Xi Yang, Yangqiu Song

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部) The Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出VRE框架,通过信息增益驱动的自我进化训练,提升多模态大语言模型的推理准确性和感知可靠性,减少幻觉,尤其在长链任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24821 2026-03-27 cs.CV cs.AI 81%

Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation

明闪奥米:一种稀疏、统一的多模态感知与生成架构

Inclusion AI, :, Bowen Ma, Cheng Zou, ChengKun Du, Canxiang Yan, Chunxiang Jin, Chunjie Shen, Chenyu Lian, Chengxiang Fan, Dandan Zheng, Fudong Wang, Furong Xu, Guangming Yao, Haohao Liu, Han Peng, Jun Zhou, Junluan Xia, Jingdong Chen, Jianing Li, Jianxin Sun, Jianjiang Zhu, Jianping Jiang, Jinpeng Ou, Jun Peng, Jin Peng, Kaixiang Ji, Li Tang, Libin Wang, Lixiang Ru, Longhua Tan, Lu Ma, Lan Wang, Mochen Bai, Minghong Cai, Mingxue Yang, Ning Gao, Qingpei Guo, Qinglong Zhang, Qiang Xu, Qin Zhao, Rui Liu, Ruijie Xiong, Ruobing Zheng, Sirui Gao, Shaoxiong Lin, Tao Zhang, Tianqi Li, Tinghao Liu, Tongli Wang, Taoye Huang, Weilong Chai, Xiaomei Wang, Xiaolong Wang, Xiaojian Liu, Xiao Lu, Xiaoyu Li, Xingning Dong, Xuzheng Yu, Xuezhi Wang, Yi Yuan, Yuting Gao, Yuting Xiao, Yunxiao Sun, Yipeng Chen, Yifan Mao, Yifei Wu, Yongjie Lyu, Yingying Zhang, YuQian Li, Ziping Ma, Zhiqiang Fang, Zhihao Qiu, Ziyuan Huang, Zizheng Yang, Zhengyu He

机构 * Inclusion AI Ant Group(Inclusion AI蚂蚁集团)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Ming-Flash-Omni基于稀疏的MoE变体Ling-Flash-2.0,实现高效扩展和多模态统一智能,展现强多模态理解与生成能力,接近AGI水平。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL 81%

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21732 2026-03-25 cs.CL cs.AI 81%

HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation

HUMORCHAIN: 基于理论的多阶段推理用于可解释的多模态幽默生成

Jiajun Zhang, Shijia Luo, Ruikang Zhang, Qi Su

机构 * Peking University(北京大学) Ocean University of China(海洋大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出HUMORCHAIN框架,通过整合视觉语义解析、基于幽默和心理学的推理及细调判别器,实现可解释的多模态幽默生成,实验表明其在人类幽默偏好、Elo/BT评分和语义多样性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16576 2026-03-18 cs.CV cs.AI cs.CR cs.LG 81%

REFORGE: Multi-modal Attacks Reveal Vulnerable Concept Unlearning in Image Generation Models

REFORGE:多模态攻击揭示图像生成模型中的脆弱概念反向学习

Yong Zou, Haoran Li, Fanxiao Li, Shenyang Wei, Yunyun Dong, Li Tang, Wei Zhou, Renyang Liu

机构 * Yunnan University(云南大学) Northeastern University(东北大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 REFORGE通过对抗性图像提示评估图像生成模型反向学习的鲁棒性,揭示现有方法的持续漏洞,提出更高效的多模态对抗攻击策略。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏