arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-03 至 2026-04-03 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2604.02289 2026-04-03 cs.CV cs.AI 73%

Omni123: Exploring 3D Native Foundation Models with Limited 3D Data by Unifying Text to 2D and 3D Generation

Omni123:通过统一文本到2D和3D生成探索有限3D数据的3D原生基础模型

Chongjie Ye, Cheng Cao, Chuanyu Pan, Yiming Hao, Yihao Zhi, Yuanming Hu, Xiaoguang Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK(SZ)(香港中文大学(深圳)理工学院) Meshy AI

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Omni123通过统一文本到2D和3D生成,利用文本-图像-3D的跨模态一致性作为隐式约束,提升3D生成的几何一致性与语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24458 2026-04-03 cs.CV 57%

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

OmniWeaving:迈向统一视频生成的自由组合与推理

Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin Long, Shixue Zhang, Haiyi Qiu, Tan Wang, Zheqi Lv, Yue Wu, Liefeng Bo, Siliang Tang, Zhao Zhong

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OmniWeaving模型,通过大规模预训练数据学习多模态组合与推理能力,引入IntelligentVBench基准测试,展示其在开放源码统一视频生成中的领先性能。

Comments 32 pages, 22 figures. Project Page: https://omniweaving.github.io. Github: https://github.com/Tencent-Hunyuan/OmniWeaving. Model: https://huggingface.co/tencent/HY-OmniWeaving

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01964 2026-04-03 cs.CV 57%

Automated Prostate Gland Segmentation in MRI Using nnU-Net

使用nnU-Net进行MRI中前列腺的自动分割

Pablo Rodriguez-Belenguer, Gloria Ribas, Javier Aquerreta Escribano, Rafael Moreno-Calatayud, Leonor Cerda-Alberich, Luis Marti-Bonmati

机构 * Biomedical Imaging Research Group (GIBI230), Instituto de Investigación Sanitaria La Fe, Valencia, Spain(生物医学影像研究组(GIBI230),拉菲健康研究所,巴伦西亚,西班牙)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于nnU-Net的深度学习方法,利用多模态MRI数据实现前列腺自动分割,通过交叉验证和外部验证显示其高精度和泛化能力,优于通用工具。

Comments 9 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01600 2026-04-03 cs.AI 57%

MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

MM-ReCoder:通过强化学习和自我校正推进图表到代码生成

Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal, Songyao Jiang, Davide Modolo

机构 * Brown University(布朗大学) Amazon AGI(亚马逊AGI)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 MM-ReCoder通过强化学习和自我校正机制提升图表到代码生成能力,其两阶段多轮自我校正策略基于Group Relative Policy Optimization,提升代码准确性和可执行性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01421 2026-04-03 cs.CV 57%

EgoFlow: Gradient-Guided Flow Matching for Egocentric 6DoF Object Motion Generation

EgoFlow:基于梯度的流匹配用于第一人称6自由度物体运动生成

Abhishek Saroha, Huajian Zeng, Xingxing Zuo, Daniel Cremers, Xi Wang

机构 * TU München(慕尼黑工业大学) MCML(慕尼黑机器学习中心) ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoFlow,通过多模态第一人称观察生成物理合理的物体运动轨迹,结合Mamba-Transformer-Perceiver架构和梯度引导推理,提升运动生成的准确性和物理真实性。

Comments CVPR 2026: https://abhi-rf.github.io/egoflow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01361 2026-04-03 cs.CV 57%

IGLOSS: Image Generation for Lidar Open-vocabulary Semantic Segmentation

IGLOSS:面向激光雷达开放词汇语义分割的图像生成

Nermin Samet, Gilles Puy, Renaud Marlet

机构 * LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM, 巴黎高科桥梁学院, 古斯塔夫·埃菲尔大学, 法国国家科学研究中心)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 本文提出一种新的方法,用于3D汽车激光雷达数据的零样本开放词汇语义分割。通过文本生成图像创建原型,利用2D视觉基础模型提取3D网络特征,实现点云标注,方法在nuScenes和SemanticKITTI上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16804 2026-04-03 cs.CV 57%

InTraGen: Trajectory-controlled Video Generation for Object Interactions

InTraGen:基于轨迹的视频生成用于物体交互

Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院) Sun Yat-sen University(中山大学) Aalborg University(奥尔堡大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出InTraGen,通过引入四个新数据集和轨迹质量度量指标,改进多物体交互场景的轨迹引导视频生成,提升视觉真实性和定量性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01567 2026-04-03 cs.RO 50%

AnchorVLA: Anchored Diffusion for Efficient End-to-End Mobile Manipulation

AnchorVLA:基于锚定扩散的高效端到端移动操作

Jia Syuen Lim, Zhizhen Zhang, Peter Bohm, Brendan Tidd, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室) Robotics and Autonomous Systems Group, CSIRO(CSIRO机器人与自主系统组)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出AnchorVLA,一种基于扩散的VLA策略,通过锚定扩散头在局部去噪以保留多模态动作生成,减少推理成本并提高移动操作的稳定性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏