arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-14 至 2026-05-14 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2605.12584 2026-05-14 cs.LG cs.AI 83%

Towards Robust Federated Multimodal Graph Learning under Modality Heterogeneity

面向模态异质性的鲁棒联邦多模态图学习

Sirui Zhang, Haonan Wang, Xunkai Li, Zekai Chen, Shumeng Li, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出FedMPO,通过拓扑感知的跨模态生成和可靠性感知的聚合,解决联邦多模态图学习中模态缺失和异质性问题,实验表明在高缺失和非IID设置下性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01908 2026-05-14 cs.CV 81%

Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning

基于推理的编辑:基于假设指令的图像编辑与视觉推理

Qingdong He, Xueqin Chen, Chaoyi Wang, Yanjie Pan, Xiaobin Hu, Zhenye Gan, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Tencent Youtu Lab(腾讯云图实验室) Sichuan University(四川大学) University of the Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Reason50K数据集和ReasonBrain框架,通过多模态大语言模型和扩散模型实现复杂隐含指令的图像编辑,提升视觉推理能力。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13309 2026-05-14 eess.SP 78%

SimART: A Unified and Open Real-world Multimodal Simulation Platform for 6G Integrated Sensing and Communication

SimART:一个统一的开放现实多模态仿真平台用于6G集成感知与通信

Kang Yan, Yuqi Cao, Jiaqi Li, Luping Xiang, Kun Yang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 SimART通过整合机器人学、光线追踪和无线评估引擎,提供一个可重复的多模态仿真平台,支持6G集成感知与通信的多方面需求,包括场景构建和信道知识图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13502 2026-05-14 eess.SP 71%

A Multi-Modal Intelligent U2V Channel Model for 6G Sensing-Communication Integration

一种面向6G感知通信一体化的多模智能U2V信道模型

Shuo Wang, Zengrui Han, Lu Bai, Xiang Cheng

专题命中 多模态生成 :multi-modal(title)

AI总结 本文提出一种基于三维散射体预测的新型U2V信道模型,通过构建宽车道场景下的高保真混合感知通信集成U2V仿真数据集,设计了3D-SPADE算法,利用LiDAR点云准确预测散射体分布,提升了动态U2V场景的建模精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13729 2026-05-14 cs.CV cs.AI 62%

Coordinating Multiple Conditions for Trajectory-Controlled Human Motion Generation

轨迹控制的人体运动生成

Deli Cai, Haoyang Ma, Changxing Ding

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) Pazhou Lab(琶洲实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMC框架,通过分治策略协调文本和轨迹条件,解决现有方法中文本与轨迹冲突及冗余表示导致的不稳定问题,实验显示其在控制精度和运动质量上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14104 2026-05-14 cs.RO cs.CV 57%

When Backdoors Meet Partial Observability: Attacking Real-World Reinforcement Learning

当后门遇见部分可观测性:攻击现实世界的强化学习

Tairan Huang, Qingqing Ye, Yulin Jin, Jiawei Lian, Yaxin Xiao, Yi Wang, Haibo Hu

机构 * Department of Electrical and Electronic Engineering(电气与电子工程系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DGBA框架,针对现实世界强化学习中部分可观测性问题,通过扩散引导后门攻击实现稳定攻击激活,实验表明其优于现有方法且不影响正常任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05376 2026-05-14 cs.CV 57%

GeomHair: Reconstruction of Hair Strands from Colorless 3D Scans

GeomHair:从无色3D扫描中重建发丝

Rachmadio Noval Lazuardi, Artem Sevastopolsky, Egor Zakharov, Matthias Niessner, Vanessa Sklyarova

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种从无色3D扫描直接重建发丝的方法,通过多模态发丝方向提取,结合神经网络2D线检测器和扩散先验,构建了Strands400数据集,支持下游任务和CG工作流。

Comments 15 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06021 2026-05-14 stat.ML cs.LG cs.NA math.NA math.PR 50%

Diffusion Model's Generalization Can Be Characterized by Inductive Biases toward a Data-Dependent Ridge Manifold

扩散模型的泛化能力可以通过数据依赖的ridge流形的归纳偏差来表征

Ye He, Yitong Qiu, Molei Tao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文研究扩散模型泛化能力的几何机制,通过引入时间依赖的log-density ridge流形,揭示生成样本在流形附近的运动规律,并通过实验验证了其在多模态数据和MNIST中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏