arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 199 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 33 篇

2603.13412 2026-03-17 cs.CV 57%

WAT: Online Video Understanding Needs Watching Before Thinking

WAT:在线视频理解需要先观看再思考

Zifan Han, Hongbo Sun, Jinglin Xu, Canhui Tang, Yulong Lei, Xuchong Zhang, Hongbin Sun, Zhongjiang He, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology Beijing(北京科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07976 2026-03-17 cs.RO cs.CV 57%

VLD: Visual Language Goal Distance for Reinforcement Learning Navigation

VLD:用于强化学习导航的视觉语言目标距离

Lazar Milikic, Manthan Patel, Jonas Frey

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(瑞士联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VLD学习框架,通过解耦感知学习与策略学习,利用大规模视频数据训练距离预测器,提升机器人导航性能与现实迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24310 2026-03-17 cs.RO 56%

World In Your Hands: A Large-Scale and Open-Source Ecosystem for Learning Human-Centric Manipulation in the Wild

世界在你手中:一个大规模且开源的生态系统,用于在真实世界中学习以人类为中心的操纵

Yupeng Zheng, Jichao Peng, Weize Li, Yuhang Zheng, Xiang Li, Yujie Jin, Julong Wei, Guanhua Zhang, Ruiling Zheng, Ming Cao, Songen Gu, Zhenhong Zou, Kaige Li, Ke Wu, Mingmin Yang, Jiahao Liu, Pengfei Li, Hengjie Si, Feiyu Zhu, Wang Fu, Likun Wang, Ruiwen Yao, Jieru Zhao, Yilun Chen, Wenchao Ding

专题命中 视频多模态 :multimodal(abstract,comments)

AI总结 本文提出World In Your Hands,一个包含1000小时真实人类操纵数据的开源生态系统,通过高精度运动捕捉和多模态数据提升机器人在杂乱环境中的操作成功率。

Comments This dataset represents the first large-scale collection of real-world, human-centric multimodal data integrating vision, language, tactile sensing, and action (VLTA) Github: https://github.com/tars-robotics/World-In-Your-Hands

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14397 2026-03-17 cs.RO 50%

eNavi: Event-based Imitation Policies for Low-Light Indoor Mobile Robot Navigation

eNavi:基于事件的模仿策略用于低光室内移动机器人导航

Prithvi Jai Ramesh, Kaustav Chanda, Krishna Vinod, Joseph Raj Vishal, Yezhou Yang, Bharatesh Chakravarthi

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出eNavi,通过结合RGB和事件数据的多模态策略提升低光环境下机器人导航的鲁棒性,实验显示融合模型在未见低光条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14388 2026-03-17 eess.SY cs.SY 50%

Context-Aware Adaptive Shared Control for Magnetically-Driven Bimanual Dexterous Micromanipulation

具有情境感知的自适应共享控制用于磁驱动双臂灵巧微 manipulation

Yongchen Wang, Kangyi Lu, Lan Wei, Dandan Zhang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出Bi-CAST框架,通过融合多模态信息实现双臂磁力微 manipulation的自适应共享控制,提升复杂结构中的导航精度与效率,减少碰撞和工作负荷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14182 2026-03-17 cs.RO cs.HC 50%

Towards Equitable Robotic Furnishing Agents for Aging-in-Place: ADL-Grounded Design Exploration

迈向老年人独立生活中的公平机器人家具代理:基于日常活动的设计探索

Hansoo Lee, Changhee Seo, Subin Park, Sonya S. Kwak

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文探讨了在老年人独立生活背景下,通过基于日常活动的设计探索,开发公平的机器人家具代理,以减少认知和身体负担,提升老年人福祉。

Comments Accepted at the ACM/IEEE International Conference on Human-Robot Interaction (HRI) 2026 Workshop: Equitable Robotics for Wellbeing (Eq-RW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01116 2026-03-17 cs.LG 50%

Eliciting Chain-of-Thought Reasoning for Time Series Analysis using Reinforcement Learning

通过强化学习激发时间序列分析的链式推理

Felix Parker, Nimeesha Chan, Chi Zhang, Kimia Ghobadi

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出COUNTS框架,通过强化学习训练LLM进行时间序列任务的链式推理,提升复杂时间数据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13781 2026-03-17 cs.RO 50%

KoopmanFlow: Spectrally Decoupled Generative Control Policy via Koopman Structural Bias

KoopmanFlow: 通过Koopman结构偏差实现谱解耦的生成控制策略

Chengsi Yao, Ge Wang, Kai Kang, Shenhao Yan, Jiahao Yang, Fan Feng, Honghao Cai, Xianxian Zeng, Rongjun Chen, Yiming Zhao, Yatong Han, Xi Li

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出KoopmanFlow,一种基于Koopman结构偏差的生成控制策略,通过统一多模态潜在空间和视觉上下文,分离全局稳定运动与高频局部修正,提升接触密集任务中的控制精度和参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 13 篇

2603.13537 2026-03-17 cs.IR cs.LG 82%

AMES: Approximate Multi-modal Enterprise Search via Late Interaction Retrieval

AMES:基于晚期交互检索的近似多模态企业搜索

Tony Joseph, Carlos Pareja, David Lopes Pegna, Abhishek Singh

机构 * Apple(苹果公司)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);cross-modal(abstract)

AI总结 AMES通过晚期交互检索架构实现多模态企业搜索,无需架构重设计,利用多向量编码器将文本、图像和视频嵌入共享空间,实验显示其在可扩展的Solr系统中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15341 2026-03-17 cs.AI cs.HC cs.MA 79%

Intelligent Co-Design: An Interactive LLM Framework for Interior Spatial Design via Multi-Modal Agents

智能协同设计:一种基于多模态代理的交互式LLM框架用于室内空间设计

Ren Jian Lim, Rushi Dai

机构 * Hong Kong Center for Construction Robotics(香港建设机器人中心)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的多模态多代理框架,通过自然语言描述和图像动态生成3D设计,提升用户参与度和设计效率。

Comments 25 pages, 20 figures; accepted for publication in the Proceedings of ACADIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19554 2026-03-17 cs.LG cs.AI 79%

CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning

CARE:对比锚定反射用于可验证多模态推理

Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 CARE通过对比锚定反射框架,将错误转化为监督信号,提升多模态推理的准确性和训练平滑度,在六个可验证视觉推理基准上提升4.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11750 2026-03-17 q-bio.QM cs.LG 78%

PRISM: Enhancing Protein Inverse Folding through Fine-Grained Retrieval on Structure-Sequence Multimodal Representations

PRISM:通过结构-序列多模态表示的细粒度检索增强蛋白质反向折叠

Sazan Mahbub, Souvik Kundu, Eric P. Xing

机构 * Carnegie Mellon University(卡内基梅隆大学) GenBio AI(基因组生物人工智能) Intel(英特尔)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 PRISM通过结构-序列多模态表示的细粒度检索提升蛋白质反向折叠性能,结合混合自交叉注意力解码器,实现更高效的序列生成与折叠预测。

Comments Published as a conference paper at International Conference on Learning Representation (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09894 2026-03-17 cs.AI cs.CY cs.LG 70%

Beyond AlphaEarth: Toward Human-Centered Geospatial Foundation Models via POI-Guided Contrastive Learning

超越AlphaEarth:通过POI引导对比学习实现以人为中心的地理空间基础模型

Junyuan Liu, Quan Qin, Guangsheng Dong, Xinglei Wang, Jiazhuang Feng, Zichao Zeng, Tao Cheng

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出AETHER框架,通过POI引导的多模态对齐,将AlphaEarth与以人为中心的城市分析结合,提升地理空间表示的可解释性与语言可访问性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05197 2026-03-17 cs.AI cs.CL cs.CV 69%

QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering

QA-Dragon:面向知识密集型视觉问答的查询感知动态RAG系统

Zhuohang Jiang, Pangjing Wu, Xu Yuan, Wenqi Fan, Qing Li

专题命中 跨模态检索 :multimodal(abstract,journal_ref);分类 cs.CV、cs.CL、cs.AI

AI总结 QA-Dragon通过引入领域路由器和搜索路由器,实现多模态、多轮和多跳推理,提升复杂视觉问答任务的推理性能,实验显示其在单源、多源和多轮任务中均优于基线模型。

Comments The source code for our system is released in https://github.com/jzzzzh/QA-Dragon

Journal ref 2025 KDD Cup Workshop for Multimodal Retrieval Augmented Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 62%

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14170 2026-03-17 cs.IR cs.AI cs.CL 62%

Citation-Enforced RAG for Fiscal Document Intelligence: Cited, Explainable Knowledge Retrieval in Tax Compliance

引用强化的财政文档智能:在税务合规中的引用、可解释知识检索

Akhil Chandra Shanivendra

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种引用强化的RAG框架,用于财政文档智能,强调可解释性和可审计性,通过源优先的摄入策略和引用强制机制提升税务合规中的引用准确性与解释性。

Comments 22 pages, 3 figures. Applied AI systems paper focused on citation-enforced RAG and abstention for fiscal document intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14541 2026-03-17 cs.AI cs.IR 57%

Expert Mind: A Retrieval-Augmented Architecture for Expert Knowledge Preservation in the Energy Sector

专家思维:一种用于能源领域专家知识保留的检索增强架构

Diego Ezequiel Cervera

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Expert Mind系统,通过RAG、大语言模型和多模态技术,解决能源领域专家知识流失问题,提升知识传递效率与入职效率。

Comments 6 pages, 1 figure, conceptual architecture paper on retrieval-augmented expert knowledge systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13660 2026-03-17 cs.CV 57%

Learning Generalizable 3D Medical Image Representations from Mask-Guided Self-Supervision

从掩码引导自监督学习中学习通用的3D医学图像表示

Yunhe Gao, Yabin Zhang, Chong Wang, Jiaming Liu, Maya Varma, Jean-Benoit Delbrouck, Akshay Chaudhari, Curtis Langlotz

机构 * Stanford University(斯坦福大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MASS方法,通过掩码引导自监督学习,学习通用的医学图像表示,实现了在不同数据集上的高效分割和分类任务。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19621 2026-03-17 cs.CV 57%

Exemplar Med-DETR: Toward Generalized and Robust Lesion Detection in Mammogram Images and beyond

示例医学DETR:迈向乳腺X线图像及其他图像中的通用和稳健病变检测

Sheethal Bhat, Bogdan Georgescu, Adarsh Bhandary Panambur, Mathias Zinnen, Tri-Thien Nguyen, Awais Mansoor, Karim Khalifa Elbarbary, Siming Bayer, Florin-Cristian Ghesu, Sasa Grbic, Andreas Maier

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出Exemplar Med-DETR,一种多模态对比检测器,通过交叉注意力和内在衍生的类特定示例特征实现基于特征的检测,展示了在多种影像模态上的卓越性能。

Comments I am asking for a withdrawal of the paper as I did not have institutional approval to release this paper right now

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14822 2026-03-17 cs.IR 50%

A Survey of Model Architectures in Information Retrieval

信息检索中模型架构的综述

Zhichao Xu, Fengran Mo, Zhiqi Huang, Crystina Zhang, Puxuan Yu, Bei Wang, Jimmy Lin, Vivek Srikumar

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文综述了信息检索中模型架构的发展,重点探讨了特征提取的骨干模型和端到端的相关性估计系统,分析了传统术语检索模型向神经网络方法的转变,以及Transformer架构和大语言模型的影响。

Comments TMLR camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13774 2026-03-17 cs.DB 50%

AgenticScholar: Agentic Data Management with Pipeline Orchestration for Scholarly Corpora

AgenticScholar: 基于管道编排的代理数据管理用于学术语料

Hai Lan, Tingting Wang, Zhifeng Bao, Guoliang Li, Daomin Ji, Ge Lee, Feng Luo, Zi Huang, Hailang Qiu, Gang Hua

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 本文提出AgenticScholar系统,整合结构化知识表示层、LLM中心混合查询规划层和统一执行层,实现多模态学术数据的端到端推理,有效提升学术数据管理的效率和可解释性。

Comments 54 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 27 篇

2511.18333 2026-03-17 cs.CV 83%

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06251 2026-03-17 cs.SE cs.AI 83%

DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation

DesignBench: 一个全面的基于MLLM的前端代码生成基准测试

Jingyu Xiao, Ming Wang, Man Ho Lam, Yuxuan Wan, Junliang Liu, Yintong Huo, Michael R. Lyu

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 DesignBench针对MLLM在前端工程中的应用,提出多框架、多任务的评估基准,涵盖生成、编辑和修复三个任务,通过900个网页样本分析模型性能,揭示框架特定限制和任务瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13587 2026-03-17 cs.AI cs.CV 81%

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

突破SFT平台:面向图表到代码生成的多模态结构强化学习

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Liming Zheng, Yufeng Zhong, Lin Ma

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出多模态结构强化学习(MSRL)以突破SFT平台,通过大规模实验构建最大训练语料库,并采用双阶段课程训练策略,提升图表到代码生成的高阶指标。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12207 2026-03-17 cs.CV 79%

Mixture of States: Routing Token-Level Dynamics for Multimodal Generation

状态混合:用于多模态生成的路由令牌级动态

Haozhe Liu, Ding Liu, Mingchen Zhuge, Zijian Zhou, Tian Xie, Sen He, Yukang Yang, Shuming Liu, Yuren Cong, Jiadong Guo, Hongyu Xu, Ke Xu, Kam-Woh Ng, Juan C. Pérez, Juan-Manuel Pérez-Rúa, Tao Xiang, Wei Liu, Shikun Liu, Jürgen Schmidhuber

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MoS,一种多模态扩散模型的融合范式,通过灵活的状态交互融合模态。核心是可学习的令牌路由器,通过时间步和输入依赖的交互对模态隐藏状态进行去噪,实现令牌级特征与扩散轨迹的精确对齐。

Comments Accepted to CVPR 2026; Homepage: https://haozheliu-st.github.io/mos-homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24267 2026-03-17 cs.CV 79%

FakeScope: Large Multimodal Expert Model for Transparent AI-Generated Image Forensics

FakeScope:大型多模态专家模型用于透明的AI生成图像取证

Yixuan Li, Yu Tian, Yipo Huang, Wei Lu, Shiqi Wang, Weisi Lin, Anderson Rocha

机构 * College of Computing, City University of Hong Kong(城市大学 computing 学院) School of Data Science and Artificial Intelligence, Chang’an University(长安大学数据科学与人工智能学院) School of Computer Science and Engineering, Ministry of Education Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-Sen University(中山大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 computing 与数据科学学院) Artificial Intelligence Lab. (Recod.ai) at the University of Campinas(坎皮纳斯大学人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 FakeScope通过多模态专家模型提升AI生成图像的检测能力,提供可解释的取证分析,实现高精度识别与深入解释,具备零样本检测和跨生成器泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14199 2026-03-17 cond-mat.mtrl-sci 78%

Millimeter-Scale, Atomically Controlled 2D Topological Insulators Revealed by Multimodal Spectroscopy

毫米级、原子级控制的二维拓扑绝缘体通过多模式光谱揭示

Woojoo Lee, Qiang Gao, Yufei Zhao, Hui Li, Albert Tsui, Yichao Zhang, Yunhe Bai, Haoran Lin, Khanh Duy Nguyen, Gabriele Berruto, Gangbin Yan, Jianchen Dang, Tongyao Wu, Hossein Rokni, Thomas S. Marchese, Ying Shirley Meng, Chao-Xing Liu, Xiao-Xiao Zhang, Chong Liu, Pinshane Y. Huang, Mark C. Hersam, Binghai Yan, Shuolong Yang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究通过多模式光谱揭示了毫米级原子级控制的二维拓扑绝缘体,展示了Bi2Te3和MnBi2Te4/Bi2Te3异质结构的电子结构和拓扑边缘态,验证了其作为稳健二维拓扑绝缘体的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13440 2026-03-17 cs.LG cs.IT math.IT 78%

Improving Channel Estimation via Multimodal Diffusion Models with Flow Matching

通过多模态扩散模型与流匹配改进信道估计

Xiaotian Fan, Xingyu Zhou, Le Liang, Xiao Li, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Purple Mountain Laboratories(紫金山实验室)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出基于流匹配和扩散变压器的多模态信道估计框架MultiCE-Flow,通过融合LiDAR、相机和位置数据生成语义条件,利用稀疏试点作为结构条件,实现高保真信道重建,优于传统方法和生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20054 2026-03-17 cs.CV 77%

Marmot: Object-Level Self-Correction via Multi-Agent Reasoning

Marmot:通过多智能体推理实现对象级自校正

Jiayang Sun, Hongbo Wang, Jie Cao, Huaibo Huang, Ran He

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV

AI总结 Marmot通过多智能体推理实现对象级自校正,提升图像文本对齐的准确性,解决多对象场景中计数、属性和空间关系的校正问题。

Journal ref Machine Intelligence Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 73%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.MM

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏