arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-10 至 2026-03-10 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 16 篇

2603.08069 2026-03-10 cs.CV 83%

Synthetic Defect Image Generation for Power Line Insulator Inspection Using Multimodal Large Language Models

利用多模态大语言模型生成合成缺陷图像用于电力线路绝缘子检测

Xuesong Wang, Caisheng Wang

机构 * Department of Electrical and Computer Engineering, Wayne State University(电气与计算机工程系,韦恩州立大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 利用多模态大语言模型生成合成缺陷图像,提升电力线路绝缘子缺陷识别的准确率和数据效率。

Comments Submitted to Engineering Applications of Artificial Intelligence, Feb. 16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07540 2026-03-10 cs.CV cs.AI 81%

How Long Can Unified Multimodal Models Generate Images Reliably? Taming Long-Horizon Interleaved Image Generation via Context Curation

统一多模态模型能可靠生成图像多长?通过上下文筛选驯服长周期交错图像生成

Haoyu Chen, Qing Liu, Yuqian Zhou, He Zhang, Zhaowen Wang, Mengwei Ren, Jingjing Ren, Xiang Wang, Zhe Lin, Lei Zhu

机构 * The Hong Kong University of Science(香港科学与技术大学) Adobe Research(Adobe研究) Huazhong University of Science(华中科技大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出UniLongGen,通过动态筛选模型记忆以提升长周期图像生成的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24099 2026-03-10 cs.CV 79%

Unified Multi-Modal Interactive & Reactive 3D Motion Generation via Rectified Flow

通过修正流实现统一的多模态交互与反应3D运动生成

Prerit Gupta, Shourya Verma, Ananth Grama, Aniket Bera

机构 * Department of Computer Science Purdue University(计算机科学系 哈佛大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 DualFlow通过修正流实现多模态双人运动生成,提升运动质量与节奏同步性。

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11662 2026-03-10 cs.AI cs.CL cs.LG cs.MA cs.RO 73%

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差

Moises Andrade, Joonhyuk Cha, Brandon Ho, Vriksha Srihari, Karmesh Yadav, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。

Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15205 2026-03-10 cs.CV 70%

Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation

利用幻觉减少可提示分割中的手动提示依赖

Jian Hu, Jiayi Lin, Junchi Yan, Shaogang Gong

机构 * Queen Mary University of London(伦敦大学玛丽女王学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ProMaC框架,通过利用MLLM幻觉挖掘任务相关信息,提升分割精度与遮罩生成效果。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08059 2026-03-10 cs.CV cs.AI 62%

ImageEdit-R1: Boosting Multi-Agent Image Editing via Reinforcement Learning

ImageEdit-R1: 通过强化学习提升多智能体图像编辑

Yiran Zhao, Yaoqi Ye, Xiang Liu, Michael Qizhe Shieh, Trung Bui

机构 * National University of Singapore(新加坡国立大学) Adobe Research(Adobe研究)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 ImageEdit-R1通过强化学习实现多智能体图像编辑,提升复杂指令下的编辑效果与上下文感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19195 2026-03-10 cs.CV cs.AI 62%

Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks

重新思考驾驶世界模型作为感知任务的合成数据生成器

Kai Zeng, Zhanqian Wu, Kaixin Xiong, Xiaobao Wei, Xiangyu Guo, Zhenxin Zhu, Kalok Ho, Lijun Zhou, Bohan Zeng, Ming Lu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Wentao Zhang

机构 * Peking University(北京大学) Xiaomi EV(小米电动车) Huazhong University of Science and Technology(华中科技大学) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Zhongguancun Academy(中关村学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Dream4Drive通过生成高质量的合成数据提升自动驾驶感知任务性能

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00790 2026-03-10 cs.CV cs.AI 62%

LD-RPS: Zero-Shot Unified Image Restoration via Latent Diffusion Recurrent Posterior Sampling

LD-RPS:通过潜势扩散递归后验采样实现零样本统一图像修复

Huaqiu Li, Yong Wang, Tongwen Huang, Hailang Huang, Haoqian Wang, Xiangxiang Chu

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里云(AMAP))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LD-RPS通过潜势扩散递归后验采样实现零样本统一图像修复,结合多模态模型和轻量模块提升修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08589 2026-03-10 cs.CV 57%

CARE-Edit: Condition-Aware Routing of Experts for Contextual Image Editing

CARE-Edit:基于条件的专家路由用于上下文图像编辑

Yucheng Wang, Zedong Wang, Yuetong Wu, Yue Ma, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 CARE-Edit通过条件感知的专家路由提升上下文图像编辑的性能和稳定性

Comments Accepted by CVPR 2026. Project page: https://care-edit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07940 2026-03-10 hep-ex cs.AI 57%

AI Agents, Language, Deep Learning and the Next Revolution in Science

人工智能代理、语言、深度学习与科学的下一次革命

Ke Li, Beijiang Liu, Bruce Mellado, Changzheng Yuan, Zhengde Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于深度学习的智能代理作为科学方法的下一次进化,通过多代理推理框架在粒子物理中实现科学发现的扩展与知识生产的革新。

Comments This perspective paper is accepted by Frontier of Physics

Journal ref Front. Phys., 2026, 21(9): 096401

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07430 2026-03-10 cs.CV 57%

Disentangled Textual Priors for Diffusion-based Image Super-Resolution

解耦文本先验用于基于扩散的图像超分辨率

Lei Jiang, Xin Liu, Xinze Tong, Zhiliang Li, Jie Liu, Jie Tang, Gangshan Wu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 DTPSR通过解耦文本先验提升基于扩散的图像超分辨率性能,引入空间层次和频率语义两个维度,实现高感知质量和强泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07144 2026-03-10 cs.CV 57%

CanoVerse: 3D Object Scalable Canonicalization and Dataset for Generation and Pose

CanoVerse: 3D对象可扩展规范化的数据集用于生成和姿态

Li Jin, Yuchen Yang, Weikai Chen, Yujie Wang, Dehao Hao, Tanghui Jia, Yingda Yin, Zeyu Hu, Runze Zhang, Keyang Luo, Li Yuan, Long Quan, Xin Wang, Xueying Qin

机构 * SDU(1 南开大学) LIGHTSPEED(2 LIGHTSPEED) UNC Chapel Hill(3 匹兹堡大学柴尔德斯分校) HKUST(4 香港理工大学) PKU(5 北京大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 CanoVerse通过大规模规范3D数据集提升3D生成稳定性,实现跨模态检索与零样本点云方向估计

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07093 2026-03-10 cs.CV 57%

Facial Expression Generation Aligned with Human Preference for Natural Dyadic Interaction

面向自然双人互动的人类偏好对齐的面部表情生成

Xu Chen, Rui Gao, Xinjie Zhang, Haoyu Zhang, Che Sun, Zhi Gao, Yuwei Wu, Yunde Jia

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于人类反馈的面部表情生成方法,通过动作学习和强化学习策略实现自然双人互动中与人类偏好的对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06623 2026-03-10 cs.LG 50%

Advances in GRPO for Generation Models: A Survey

生成模型中GRPO的进展:综述

Zexiang Liu, Xianglong He, Yangguang Li

机构 * SJTU(上海交通大学) THU(清华大学) CUHK(香港大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文综述了流GRPO在生成模型中的应用与进展,探讨了方法论改进和跨模态扩展,强调其作为通用对齐框架的重要性及未来挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04436 2026-03-10 cs.RO cs.SY eess.SY 50%

PAD-TRO: Projection-Augmented Diffusion for Direct Trajectory Optimization

PAD-TRO: 用于直接轨迹优化的投影增强扩散模型

Jushan Chen, Santiago Paternain

机构 * Department of Electrical, Computer, and Systems Engineering, Rensselaer Polytechnic Institute(电气、计算机与系统工程系,罗切斯特理工学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 PAD-TRO提出了一种基于模型的扩散方法,通过无梯度投影机制直接生成状态序列,实现了在四旋翼航点导航中零动态可行性误差和更高的成功率。

Comments Final manuscript. Accepted for publication at the 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09889 2026-03-10 cs.RO 50%

Diffusion-SAFE: Diffusion-Native Human-to-Robot Driving Handover for Shared Autonomy

Diffusion-SAFE: 基于扩散模型的人机协同驾驶交接机制

Yunxin Fan, Monroe Kennedy

专题命中 多模态生成 :multimodal(abstract)

AI总结 Diffusion-SAFE通过基于扩散模型的闭环框架实现安全的人机协同驾驶交接,支持从演示中直接进行安全评估和计划生成,实验显示在模拟和真实赛车中均取得高交接成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏