arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-23 至 2026-04-23 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 10 篇

2602.13669 2026-04-23 cs.CV 83%

EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation

EchoTorrent: 向快速、持续和流式多模态视频生成迈进

Rang Meng, Weipeng Wu, Yuming Li, Chenguang Ma

机构 * Ant Group(蚂蚁集团)

专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出EchoTorrent框架,通过四重设计提升多模态视频生成的效率与稳定性,实现快速、持续和流式生成,增强时空一致性与音频唇同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20434 2026-04-23 cs.IR 82%

Discrete Preference Learning for Personalized Multimodal Generation

离散偏好学习用于个性化多模态生成

Yuting Zhang, Ying Sun, Dazhong Shen, Ziwei Xie, Feng Liu, Changwang Zhang, Xiang Liu, Jun Wang, Hui Xiong

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出DPPMG框架,通过离散偏好模型学习多模态偏好并注入生成器,解决连续偏好与离散输入的矛盾及模态不一致问题,实验证明生成的多模态内容一致且个性化。

Comments be accepted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19902 2026-04-23 cs.CV cs.AI cs.LG 81%

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

MMCORE:多模态连接与表征对齐的潜在嵌入

Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20796 2026-04-23 cs.CV 79%

LLaDA2.0-Uni: Unifying Multimodal Understanding and Generation with Diffusion Large Language Model

LLaDA2.0-Uni:通过扩散大语言模型统一多模态理解和生成

Inclusion AI, Tiwei Bie, Haoxing Chen, Tieyuan Chen, Zhenglin Cheng, Long Cui, Kai Gan, Zhicheng Huang, Zhenzhong Lan, Haoquan Li, Jianguo Li, Tao Lin, Qi Qin, Hongjun Wang, Xiaomei Wang, Haoyuan Wu, Yi Xin, Junbo Zhao

机构 * AGI Research Center, Inclusion AI(AGI研究中心,Inclusion AI)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 LLaDA2.0-Uni结合全语义离散分词器、MoE-based dLLM和扩散解码器,实现多模态理解和生成,通过SigLIP-VQ离散化视觉输入,提升推理效率,支持交错生成与推理,展现强大的图像生成与编辑能力。

Comments LLaDA2.0-Uni Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20715 2026-04-23 cs.CV 79%

GeoRelight: Learning Joint Geometrical Relighting and Reconstruction with Flexible Multi-Modal Diffusion Transformers

GeoRelight: 基于灵活多模态扩散变换器的联合几何重照明与重建

Yuxuan Xue, Ruofan Liang, Egor Zakharov, Timur Bagautdinov, Chen Cao, Giljoo Nam, Shunsuke Saito, Gerard Pons-Moll, Javier Romero

机构 * Codec Avatars Lab, Meta(Meta编码器动画实验室) University of Tübingen(图宾根大学) Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学院,萨尔兰信息校园)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出GeoRelight,通过联合解决几何重建与重照明问题,利用iNOD和混合数据训练方法提升性能,优于传统顺序模型和忽略几何的系统。

Comments CVPR 2026 Highlight; Project page: https://yuxuan-xue.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10647 2026-04-23 cs.RO 78%

OmniUMI: Towards Physically Grounded Robot Learning via Human-Aligned Multimodal Interaction

OmniUMI: 通过人对齐的多模态交互实现物理基础的机器人学习

Shaqi Luo, Yuanyuan Li, Youhao Hu, Chenhao Yu, Chaoran Xu, Jiachen Zhang, Guocai Yao, Tiejun Huang, Ran He, Zhongyuan Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) MAIS & NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 OmniUMI通过人对齐的多模态交互实现物理基础的机器人学习,整合视觉、触觉和力觉数据,提升接触密集操作的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11931 2026-04-23 cs.RO 78%

MATT-Diff: Multimodal Active Target Tracking by Diffusion Policy

MATT-Diff:基于扩散策略的多模态主动目标跟踪

Saida Liu, Nikolay Atanasov, Shumon Koga

机构 * Department of Computer Science and Systems Engineering, Kobe University(神户大学计算机科学与系统工程系) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电子与计算机工程系)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出MATT-Diff,一种基于扩散策略的多模态主动多目标跟踪控制策略,通过视觉Transformer和注意力机制实现多目标跟踪与再获取。

Comments Camera-ready version for L4DC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02644 2026-04-23 cs.AI 57%

D2PPO: Diffusion Policy Policy Optimization with Dispersive Loss

D2PPO:带有分散损失的扩散策略策略优化

Guowei Zou, Weibing Li, Hejun Wu, Yukun Qian, Yuhang Wang, Haitao Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出D2PPO,通过引入分散损失正则化来解决扩散策略中表示崩溃问题,提升复杂机器人操控任务的性能,实验表明其在预训练和微调中均取得显著改进。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(22): 18891-18899, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20749 2026-04-23 cs.AI 57%

Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation

何处与何物:在情境对话推荐中推理动态和隐性偏好

Dongding Lin, Jian Wang, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SiPeR框架,通过场景转换估计和贝叶斯逆推推理,提升情境对话推荐的准确性和响应质量。

Comments Accpeted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20370 2026-04-23 cs.LG stat.ML 50%

Cold-Start Forecasting of New Product Life-Cycles via Conditional Diffusion Models

通过条件扩散模型进行新产品生命周期的冷启动预测

Ruihan Zhou, Zishi Zhang, Jinhui Han, Yijie Peng, Xiaowei Zhang

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出CDLF模型,利用静态描述、参考轨迹和新观察数据预测新产品生命周期,解决冷启动问题,提升预测准确性与概率预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏