arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4932 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4932 篇

2602.20161 2026-02-25 cs.CV 83%

Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device

Mobile-O: 移动设备上的统一多模态理解和生成

Abdelrahman Shaker, Ahmed Heakl, Jaseel Muhammad, Ritesh Thawkar, Omkar Thawakar, Senmao Li, Hisham Cholakkal, Ian Reid, Eric P. Xing, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Linköping University(利尔贝里大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Mobile-O是一款在移动设备上实现统一多模态理解和生成的高效模型,通过紧凑架构和创新训练方法,在性能和速度上均优于现有模型。

Comments Project page: https://amshaker.github.io/Mobile-O/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19497 2026-02-24 cs.CV 83%

MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

MICON-Bench: 多图像上下文图像生成的基准测试与增强

Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 MICON-Bench通过六个任务评估多图像上下文生成能力,并提出DAR机制提升生成质量与连贯性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17558 2026-02-20 cs.CV 83%

RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward

RetouchIQ: 基于指令的图像修复MLLM代理与通用奖励模型

Qiucheng Wu, Jing Shi, Simon Jenni, Kushal Kafle, Tianyu Wang, Shiyu Chang, Handong Zhao

机构 * Adobe Research(Adobe研究院)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 RetouchIQ通过通用奖励模型提升指令基于图像编辑的语义一致性和感知质量,展现灵活可解释的编辑能力。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04614 2026-02-16 cs.AI cs.LG 83%

XGeM: A Multi-Prompt Foundation Model for Multimodal Medical Data Generation

XGeM:一种多提示基础模型,用于多模态医学数据生成

Daniele Molino, Francesco Di Feola, Eliodoro Faiella, Deborah Fazzini, Domiziana Santucci, Linlin Shen, Valerio Guarrasi, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与介入部门,生物医学工程与辐射物理,乌梅大学) Department of Diagnostic Imaging and Stereotactic Radiosurgey, Centro Diagnostico Italiano S.p.A.(诊断影像与立体放射外科部门,意大利诊断中心股份有限公司) Department of Radiology and Interventional Radiology, Fondazione Policlinico Universitario Campus Bio-Medico(放射科与介入放射科,大学医学中心生物医学校园基金会) Research Unit of Radiology and Interventional Radiology, Department of Medicine and Surgery, Università Campus Bio-Medico di Roma(放射科与介入放射科研究单位,医学与外科系,罗马生物医学大学) College of Computer Science and Software Engineering, Shenzhen University(计算机科学与软件工程学院,深圳大学)

专题命中 多模态生成 :multimodal(title,abstract);any-to-any(abstract);分类 cs.AI

AI总结 XGeM是一种多模态生成模型,通过多提示训练策略实现灵活的医学数据合成,解决多模态数据生成中的临床一致性与数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16944 2026-02-12 cs.CV 83%

Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception

捕捉细节:用于细粒度MLLM感知的自蒸馏RoI预测器

Yuheng Shi, Xiaohuan Pei, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) City University of Hong Kong(香港城市大学)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出SD-RPN,通过自蒸馏方法提升MLLM细粒度感知的效率和准确性。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01769 2026-02-04 cs.LG cs.AI 83%

IRIS: Implicit Reward-Guided Internal Sifting for Mitigating Multimodal Hallucination

IRIS: 隐式奖励引导的内部筛选以缓解多模态幻觉

Yuanshuai Li, Yuping Yan, Jirui Han, Fei Ming, Lingjuan Lv, Yaochu Jin

机构 * Department of Artificial Intelligence, Westlake University, Hangzhou, China(人工智能系,西湖大学,杭州,中国) Sony Research, Sony(索尼研究,索尼)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 IRIS通过隐式奖励引导内部筛选,有效缓解多模态大语言模型的幻觉问题,无需外部反馈且性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02140 2026-02-03 cs.CL 83%

Quantifying the Gap between Understanding and Generation within Unified Multimodal Models

量化统一多模态模型中理解与生成之间的差距

Chenlong Wang, Yuhang Chen, Zhihan Hu, Dongping Chen, Wenhu Chen, Sarah Wiegreffe, Tianyi Zhou

机构 * University of Maryland(马里兰大学) University of Waterloo(滑铁卢大学) MBZUAI

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本研究通过GapEval基准量化统一多模态模型中理解与生成能力的差距,揭示当前模型仅实现表面层次的统一,而非深度认知融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14174 2026-01-29 cs.LG cs.AI 83%

Physics-Guided Multimodal Transformers are the Necessary Foundation for the Next Generation of Meteorological Science

物理引导的多模态Transformer是下一代气象科学的必要基础

Jing Han, Hanting Chen, Kai Han, Xiaomeng Huang, Wenjun Xu, Dacheng Tao, Ping Zhang

机构 * School of Artificial Intelligence, Beijing University of Posts Huawei Noah's Ark Lab Department of Earth System Science, Tsinghua University College of Computing \& Data Science, Nanyang Technological University State Key Laboratory of Networking Switching Technology, Beijing University of Posts

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出通过物理引导的多模态Transformer构建下一代气象科学的统一范式,以提升模型的科学一致性和物理约束能力。

Comments Perspective article

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12198 2026-01-19 cs.CV 83%

ViSTA: Visual Storytelling using Multi-modal Adapters for Text-to-Image Diffusion Models

ViSTA: 基于多模态适配器的文本到图像扩散模型用于视觉叙事

Sibo Dong, Ismail Shaheen, Maggie Shen, Rupayan Mallick, Sarah Adel Bargal

机构 * Department of Computer Science, Georgetown University(计算机科学系,乔治城大学)

专题命中 多模态生成 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 ViSTA通过多模态历史适配器提升文本到图像扩散模型在视觉叙事中的生成一致性与文本对齐能力。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04706 2026-01-09 cs.CV 83%

Forge-and-Quench: Enhancing Image Generation for Higher Fidelity in Unified Multimodal Models

锻造与淬火:提升统一多模态模型中图像生成的高保真度

Yanbing Zeng, Jia Wang, Hanghang Ma, Junqiang Wu, Jie Zhu, Xiaoming Wei, Jie Hu

机构 * Meituan(美团)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Forge-and-Quench框架,通过利用理解模型增强生成图像的保真度和细节,提升多模态模型的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18947 2025-12-23 cs.CV 83%

OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language Model

OpenHOI: 基于多模态大语言模型的开放世界手-物体交互合成

Zhenhao Zhang, Ye Shi, Lingxiao Yang, Suting Ni, Qi Ye, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 OpenHOI通过多模态大语言模型实现开放世界手-物体交互合成,能生成长周期操控序列并处理复杂语言指令。

Comments Accepted by NeurIPS 2025 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17640 2025-12-22 cs.CV 83%

Generative Human-Object Interaction Detection via Differentiable Cognitive Steering of Multi-modal LLMs

通过可微认知引导的多模态大语言模型进行生成式人类-物体交互检测

Zhaolin Cai, Huiyu Duan, Zitong Xu, Fan Li, Zhi Liu, Jing Liu, Wei Shen, Xiongkuo Min, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) Xi’an Jiao Tong University(西安交通大学) Shandong University(山东大学) Tianjin University(天津大学)

专题命中 多模态生成 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出GRASP-HO框架,通过可微认知引导的多模态大语言模型实现生成式人类-物体交互检测,解决封闭集分类与开放词汇生成之间的监督不匹配问题,实现判别感知与生成推理的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15261 2025-12-18 cs.CV 83%

MMMamba: A Versatile Cross-Modal In Context Fusion Framework for Pan-Sharpening and Zero-Shot Image Enhancement

MMMamba: 一种多功能跨模态在上下文融合框架用于全色锐化和零样本图像增强

Yingying Wang, Xuanhua He, Chen Wu, Jialing Huang, Suiyun Zhang, Rui Liu, Xinghao Ding, Haoxuan Che

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 MMMamba通过跨模态在上下文融合框架实现全色锐化和零样本图像增强,结合Mamba架构和多模态交错扫描机制,提升跨模态交互能力与计算效率。

Comments \link{Code}{https://github.com/Gracewangyy/MMMamba}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10750 2025-12-12 cs.CV 83%

LDP: Parameter-Efficient Fine-Tuning of Multimodal LLM for Medical Report Generation

LDP:多模态大语言模型在医疗报告生成中的参数高效微调

Tianyu Zhou, Junyi Tang, Zehui Li, Dahong Qian, Suncheng Xiang

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 LDP通过多模态大语言模型和参数高效微调技术,提升结肠镜息肉诊断报告的准确性和效率,显著降低训练成本并获得专家评分。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20427 2025-12-11 cs.CV 83%

Seedream 4.0: Toward Next-generation Multimodal Image Generation

Seedream 4.0:迈向下一代多模态图像生成

Team Seedream, :, Yunpeng Chen, Yu Gao, Lixue Gong, Meng Guo, Qiushan Guo, Zhiyao Guo, Xiaoxia Hou, Weilin Huang, Yixuan Huang, Xiaowen Jian, Huafeng Kuang, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yanzuo Lu, Zhengxiong Luo, Tongtong Ou, Guang Shi, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Wenxu Wu, Yonghui Wu, Xin Xia, Xuefeng Xiao, Shuang Xu, Xin Yan, Ceyuan Yang, Jianchao Yang, Zhonghua Zhai, Chenlin Zhang, Heng Zhang, Qi Zhang, Xinyu Zhang, Yuwei Zhang, Shijia Zhao, Wenliang Zhao, Wenjia Zhu

机构 * ByteDance(字节跳动)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 Seedream 4.0通过高效多模态框架实现文本到图像生成、图像编辑和多图像组合,展示卓越的多模态能力与高效推理性能。

Comments Seedream 4.0/4.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07166 2025-12-09 cs.CV 83%

When Privacy Meets Recovery: The Overlooked Half of Surrogate-Driven Privacy Preservation for MLLM Editing

当隐私与恢复相遇: surrogate驱动的隐私保护在MLLM编辑中的被忽视的一半

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui Li, Shiqi Wang, Sam Kwong

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出SPPE数据集和统一方法,通过引导生成任务实现隐私恢复,平衡隐私保护与MLLM可用性。

Comments 9 pages,7figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05853 2025-12-09 cs.CV 83%

VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack

通过视觉推理序列攻击对多模态大语言模型进行劫持

Shiji Zhao, Shukun Xiong, Yao Huang, Yan Jin, Zhenyu Wu, Jiyang Guan, Ranjie Duan, Jialing Tao, Hui Xue, Xingxing Wei

机构 * Alibaba Group(阿里巴巴集团) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 VRSA通过视觉推理序列攻击方法,针对多模态大语言模型的视觉模态进行劫持,提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO 83%

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04222 2025-12-05 cs.CV 83%

ReasonX: MLLM-Guided Intrinsic Image Decomposition

ReasonX: 基于多模态大语言模型的内在图像分解

Alara Dirik, Tuanfeng Wang, Duygu Ceylan, Stefanos Zafeiriou, Anna Frühstück

机构 * Imperial College London(伦敦帝国学院) Adobe Research(Adobe研究院)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 ReasonX通过多模态大语言模型提供相对比较监督,提升内在图像分解的泛化能力与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02895 2025-12-04 cs.CV 83%

MindGPT-4ov: An Enhanced MLLM via a Multi-Stage Post-Training Paradigm

MindGPT-4ov: 一种通过多阶段训练范式增强的多模态大语言模型

Wei Chen, Chaoqun Du, Feng Gu, Wei He, Qizhen Li, Zide Liu, Xuhao Pan, Chang Ren, Xudong Rao, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Yufei Zheng, Chunpeng Zhou, Pan Zhou, Xuhan Zhu

机构 * MindGPT-4o Team(MindGPT-4o 团队) Li Auto Inc.(利汽车公司)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 MindGPT-4ov通过多阶段训练范式提升多模态大语言模型的性能与泛化能力,实现低成本高效率的训练与部署。

Comments 33 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00261 2025-12-02 cs.CV 83%

UniDiff: Parameter-Efficient Adaptation of Diffusion Models for Land Cover Classification with Multi-Modal Remotely Sensed Imagery and Sparse Annotations

UniDiff: 用于多模态遥感影像和稀疏标注的土地覆盖分类的扩散模型参数高效适应

Yuzhen Hu, Saurabh Prasad

机构 * University of Houston(休斯敦大学)

专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 UniDiff通过参数高效的方法适应扩散模型,实现多模态遥感数据在稀疏标注下的有效分类与融合。

Comments Camera-ready for WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07565 2025-12-01 cs.CV 83%

OpenDance: Multimodal Controllable 3D Dance Generation with Large-scale Internet Data

OpenDance: 基于大规模互联网数据的多模态可控3D舞蹈生成

Jinlu Zhang, Zixi Kang, Libin Liu, Jianlong Chang, Qi Tian, Feng Gao, Yizhou Wang

机构 * Peking University(北京大学) Huawei Cloud(华为云)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 OpenDance通过构建大规模舞蹈数据集和提出统一的可控生成框架,实现了多模态的3D舞蹈生成,支持音乐、文本、关键点和轨迹等多种条件控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20520 2025-11-26 cs.CV 83%

HBridge: H-Shape Bridging of Heterogeneous Experts for Unified Multimodal Understanding and Generation

HBridge: 通过非对称H形架构桥接异构专家以实现统一的多模态理解和生成

Xiang Wang, Zhifei Zhang, He Zhang, Zhe Lin, Yuqian Zhou, Qing Liu, Shiwei Zhang, Yijun Li, Shaoteng Liu, Haitian Zheng, Jason Kuen, Yuehuan Wang, Changxin Gao, Nong Sang

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 HBridge通过非对称H形架构,优化异构专家的模态先验利用,提升多模态生成效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19343 2025-11-25 cs.CV 83%

Syn-GRPO: Self-Evolving Data Synthesis for MLLM Perception Reasoning

Syn-GRPO:面向多模态大语言模型感知推理的自进化数据合成

Qihan Huang, Haofei Zhang, Rong Wei, Yi Wang, Rui Tang, Mingli Song, Jie Song

机构 * Zhejiang University(浙江大学) Manycore Tech Inc.(Manycore科技公司)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 Syn-GRPO通过自进化数据合成提升多模态大语言模型的感知推理能力,采用数据服务器与GRPO工作流协同生成高质量多样化训练数据,实验验证其在视觉感知任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18714 2025-11-25 cs.AI cs.CY 83%

MAGMA-Edu: Multi-Agent Generative Multimodal Framework for Text-Diagram Educational Question Generation

MAGMA-Edu:多智能体生成多模态框架用于文本-图表教育问题生成

Zhenyu Wu, Jian Li, Hua Huang

机构 * School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 MAGMA-Edu通过多智能体框架实现教育问题生成,提升文本与图像的一致性,达到多模态教育内容生成的新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16917 2025-11-24 cs.CV 83%

UniModel: A Visual-Only Framework for Unified Multimodal Understanding and Generation

UniModel: 一种仅依赖视觉的统一多模态理解和生成框架

Chi Zhang, Jiepeng Wang, Youming Wang, Yuanzhi Liang, Xiaoyan Yang, Zuoxin Li, Haibin Huang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究所)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniModel通过统一模型、任务和表示,在单一视觉空间中实现多模态理解和生成的统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22946 2025-11-21 cs.CV 83%

LightFusion: A Light-weighted, Double Fusion Framework for Unified Multimodal Understanding and Generation

LightFusion: 一种轻量级、双融合框架用于统一多模态理解和生成

Zeyu Wang, Zilong Chen, Chenhui Gou, Feng Li, Chaorui Deng, Deyao Zhu, Kunchang Li, Weihao Yu, Haoqin Tu, Haoqi Fan, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) Tsinghua University(清华大学) Monash University(墨尔本大学) ByteDance Seed Project(字节跳动种子项目)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 LightFusion通过双融合机制实现轻量级多模态理解和生成,仅用350亿个标记训练即在多个基准测试中取得优异成绩。

Comments Preprint. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09611 2025-11-19 cs.CV 83%

MMaDA-Parallel: Multimodal Large Diffusion Language Models for Thinking-Aware Editing and Generation

Ye Tian, Ling Yang, Jiongfan Yang, Anran Wang, Yu Tian, Jiani Zheng, Haochen Wang, Zhiyang Teng, Zhuochen Wang, Yinjie Wang, Yunhai Tong, Mengdi Wang, Xiangtai Li

机构 * Peking University(北京大学) ByteDance(字节跳动) Princeton University(普林斯顿大学) CASIA(中国科学院自动化研究所) The University of Chicago(芝加哥大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments Project Page: https://tyfeld.github.io/mmadaparellel.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03137 2025-11-06 cs.AI 83%

Using Multi-modal Large Language Model to Boost Fireworks Algorithm's Ability in Settling Challenging Optimization Tasks

Shipeng Cen, Ying Tan

机构 * School of Intelligence Science Technology, Institute for Artificial Intellignce, Peking University, Beijing, China Technology, Institute for Artificial Intellignce, National Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China

专题命中 多模态生成 :multi-modal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16888 2025-11-05 cs.CV 83%

Uniworld-V2: Reinforce Image Editing with Diffusion Negative-aware Finetuning and MLLM Implicit Feedback

Zongjian Li, Zheyuan Liu, Qihui Zhang, Bin Lin, Feize Wu, Shenghai Yuan, Zhiyuan Yan, Yang Ye, Wangbo Yu, Yuwei Niu, Shaodong Wang, Xinhua Cheng, Li Yuan

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏