arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2603.21295 2026-03-24 cs.CV 57%

Text-Image Conditioned 3D Generation

文本-图像条件的3D生成

Jiazhong Cen, Jiemin Fang, Sikuang Li, Guanjun Wu, Chen Yang, Taoran Yi, Zanwei Zhou, Zhikuan Bao, Lingxi Xie, Wei Shen, Qi Tian

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室、人工智能学院、计算机科学学院、上海交通大学) Huawei Inc.(华为公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出结合文本和图像条件的3D生成方法,通过跨模态互补性提升生成质量,引入TIGON模型实现高效融合。

Comments CVPR 2026. Project page: https://jumpat.github.io/tigon-page Code: https://github.com/Jumpat/tigon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21176 2026-03-24 cs.CV 57%

GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing

GIDE: 解锁扩散大语言模型用于精确无训练图像编辑

Zifeng Zhu, Jiaming Han, Jiaxiang Zhao, Minnan Luo, Xiangyu Yue

机构 * Xi'an Jiaotong University MMLab, The Chinese University of Hong Kong(西安交通大学MMLab,香港中文大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出GIDE框架,通过离散噪声逆向机制实现无训练图像编辑,支持多种指令并保持背景不变,实验表明其在语义正确性和感知质量上显著优于现有方法。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13733 2026-03-24 cs.RO cs.AI cs.LG 57%

Implicit Maximum Likelihood Estimation for Real-time Generative Model Predictive Control

隐式最大似然估计用于实时生成模型预测控制

Grayson Lee, Minh Bui, Shuzi Zhou, Yankai Li, Mo Chen, Ke Li

机构 * School of Computing Science, Simon Fraser University(计算科学系,西蒙弗雷泽大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出隐式最大似然估计(IMLE)作为生成模型的替代方法,实现快速推理和强模式覆盖,适用于实时MPC任务。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20188 2026-03-23 cs.CV 57%

Wildfire Spread Scenarios: Increasing Sample Diversity of Segmentation Diffusion Models with Training-Free Methods

野火蔓延场景:通过无训练方法增加分割扩散模型的样本多样性

Sebastian Gerard, Josephine Sullivan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出通过无训练方法提升分割扩散模型样本多样性,验证了粒子引导和SPELL等技术在野火蔓延场景中的有效性,提升了HM IoU指标。

Comments Accepted at NLDL 2026. This version contains small corrections compared to the initial publication, see appendix for details

Journal ref Proceedings of the 7th Northern Lights Deep Learning Conference (NLDL), PMLR, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19970 2026-03-23 cs.LG cs.AI 57%

Graph2TS: Structure-Controlled Time Series Generation via Quantile-Graph VAEs

Graph2TS: 通过分位数图变分自编码器实现结构控制的时间序列生成

Shaoshuai Du, Joze M. Rozanec, Andy Pimentel, Ana-Lucia Varbanescu

机构 * Informatics Institute, University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学信息学院) Computer Architecture for Embedded Systems, University of Twente, Enschede, The Netherlands(特文特大学嵌入式系统计算机架构) Laboratory of Artificial Intelligence, Institute Jozef Stedan, Ljubljana, Slovenia(乔泽夫·斯特达安研究所人工智能实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出Graph2TS,通过分位数图变分自编码器实现时间序列生成,通过结构与残差分离提升分布保真度和时序对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19752 2026-03-23 cs.CV 57%

PhysNeXt: Next-Generation Dual-Branch Structured Attention Fusion Network for Remote Photoplethysmography Measurement

PhysNeXt:下一代双分支结构注意力融合网络用于远程光体积脉搏波测记测量

Junzhe Cao, Bo Zhao, Zhiyi Niu, Dan Guo, Yue Sun, Haochen Liang, Yong Xu, Zitong YU

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Hefei University of Technology(合肥工业大学) Macao Polytechnic University(澳门理工学院)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 PhysNeXt通过融合视频帧和STMap表示,结合时空差分建模单元和跨模态交互模块,提升rPPG信号提取的鲁棒性,实验表明其在挑战性条件下具有更稳定和精细的信号恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV 57%

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19053 2026-03-20 cs.CV cs.GR 57%

SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

SwiftTailor: 基于几何图像表示的高效3D服装生成

Phuc Pham, Uy Dieu Tran, Binh-Son Hua, Phong Nguyen

机构 * Qualcomm AI Research(高通AI研究) Trinity College Dublin(都柏林大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SwiftTailor框架,通过紧凑的几何图像表示统一缝纫图案推理与几何网格合成,提升3D服装生成的效率与精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04614 2026-03-20 cs.CV 57%

HyperAlign: Hyperbolic Entailment Cones for Adaptive Text-to-Image Alignment Assessment

HyperAlign:基于双曲蕴含几何的自适应文本到图像对齐评估

Wenzhi Chen, Bo Hu, Leida Li, Lihuo He, Wen Lu, Xinbo Gao

机构 * Chongqing University of Posts and Telecommunications(重庆邮电大学) Xidian University(西安电子科技大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 HyperAlign基于双曲蕴含几何提出自适应文本到图像对齐评估框架,通过CLIP提取欧几里得特征并映射到双曲空间,设计动态监督蕴含建模机制和自适应调制回归器,实现对图像-文本对齐的高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17735 2026-03-19 cs.CV 57%

TAPESTRY: From Geometry to Appearance via Consistent Turntable Videos

TAPESTRY:从几何到外观 via 一致的旋转台视频

Yan Zeng, Haoran Jiang, Kaixin Yao, Qixuan Zhang, Longwen Zhang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) Deemos Technology(德莫斯科技)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 TAPESTRY通过基于显式3D几何的视频扩散方法生成高保真旋转台视频,用于驱动纹理合成和神经渲染,实现高质量3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12220 2026-03-19 cs.CV 57%

TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation

TechImage-Bench: 基于评分标准的技术图像生成评估

Minheng Ni, Zhengyuan Yang, Yaowen Zhang, Linjie Li, Chung-Ching Lin, Kevin Lin, Zhendong Wang, Xiaofei Wang, Shujie Liu, Lei Zhang, Wangmeng Zuo, Lijuan Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft Project Website(微软项目网站)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TechImage-Bench,通过评分标准评估技术图像生成,发现现有模型在科学准确性上存在显著差距,并展示评分标准对改进图像生成的监督作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17131 2026-03-19 cs.CV 57%

SMAL-pets: SMAL Based Avatars of Pets from Single Image

基于SMAL的宠物单图像生成高保真可编辑3D宠物化身

Piotr Borycki, Joanna Waczyńska, Yizhe Zhu, Yongqiang Gao, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) Huawei(华为)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SMAL-pets框架,通过混合架构结合3D高斯溅射与SMAL参数模型,实现单图像生成高质量可编辑宠物3D化身,支持通过文本提示进行外观和行为编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22496 2026-03-19 cs.CV 57%

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

MLLMs关注什么以及依赖什么:解释自回归标记生成

Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) College of Computing and Data Science, NTU(NTU 计算与数据科学学院) Huawei(华为) School of Flexible Electronics, SYSU(SYSU 灵活电子学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(Sun Yat-sen 大学深圳校区计算机科学与技术学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EAGLE框架,通过轻量级黑盒方法解释MLLMs的自回归标记生成,量化语言先验和感知证据的影响,提升模型可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16392 2026-03-18 cs.CV 57%

DermaFlux: Synthetic Skin Lesion Generation with Rectified Flows for Enhanced Image Classification

DermaFlux:基于修正流的合成皮肤病变生成用于增强图像分类

Stathis Galanakis, Alexandros Koliousis, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) Northeastern University London, UK(伦敦东北大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 DermaFlux通过生成临床相关的皮肤病变图像,提升二分类性能,实验表明其在小数据集上提升6%,在合成数据上提升9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16373 2026-03-18 cs.CV 57%

Semantic One-Dimensional Tokenizer for Image Reconstruction and Generation

语义一维分词器用于图像重建与生成

Yunpeng Qu, Kaidong Zhang, Yukang Ding, Ying Chen, Jian Wang

机构 * Tsinghua University, Beijing, China(清华大学,北京,中国) Alibaba Group, Beijing, China(阿里巴巴集团,北京,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SemTok,一种语义一维分词器,通过压缩2D图像为1D离散token实现高效图像重建,采用三重创新框架提升生成效果。

Comments 18 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16372 2026-03-18 cs.CV 57%

InViC: Intent-aware Visual Cues for Medical Visual Question Answering

InViC:面向医疗视觉问答的意图感知视觉线索

Zhisong Wang, Ziyang Chen, Zanting Ye, Hongze Zhu, Yefeng Zheng, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University, Xi’an 710072, China(集成空天地海大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学,西安710072,中国) Westlake University(西湖大学) Southern Medical University(南方医科大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出InViC框架,通过引入Cue Tokens Extraction模块和两阶段微调策略,提升医疗视觉问答中意图对齐的视觉证据利用,验证了瓶颈化训练在提高可信度上的有效性。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16139 2026-03-18 cs.CV 57%

Rethinking UMM Visual Generation: Masked Modeling for Efficient Image-Only Pre-training

重新思考UMM视觉生成:面向高效图像-only预训练的掩码建模

Peng Sun, Jun Xie, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出IOMM框架,通过两阶段训练提升UMM视觉生成效率与性能,实验显示其在GenEval和WISE上优于现有基线。

Comments https://github.com/LINs-lab/IOMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15975 2026-03-18 cs.CV 57%

UMO: Unified In-Context Learning Unlocks Motion Foundation Model Priors

UMO:统一上下文学习解锁运动基础模型先验

Xiaoyan Cong, Zekun Li, Zhiyang Dou, Hongyu Li, Omid Taheri, Chuan Guo, Abhay Mittal, Sizhe An, Taku Komura, Wojciech Matusik, Michael J. Black, Srinath Sridhar

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) Meta Reality Lab(Meta现实实验室) Max-Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Hong Kong(香港大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 UMO通过统一框架解锁运动基础模型先验,支持多种跨模态和上下文生成任务,提升文本到运动合成性能。

Comments Project Page: https://oliver-cong02.github.io/UMO.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21435 2026-03-18 cs.CV 57%

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

融合理解与生成的交错分析-草稿思维

Shengqiong Wu, Bobo Li, Xinkai Wang, Xiangtai Li, Lei Cui, Furu Wei, Shuicheng Yan, Hao Fei, Tat-seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AD-Loop机制,通过交错分析与草稿操作提升视觉语言模型的理解与生成能力,实验表明其在多个基准测试中表现优异,具备良好的迁移性。

Comments 28 pages, 17 figures, 6 tables, ICLR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15271 2026-03-17 cs.CV 57%

Flash-Unified: A Training-Free and Task-Aware Acceleration Framework for Native Unified Models

Flash-Unified: 一种无需训练且任务感知的加速框架用于原生统一模型

Junlong Ke, Zichen Wen, Boxue Yang, Yantai Yang, Xuyang Liu, Chenfei Liao, Zhaorun Chen, Shaobo Wang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Sichuan University(四川大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Chicago(芝加哥大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FlashU框架,通过任务感知的网络剪枝和动态层跳过,减少统一模型的计算冗余,提升生成和理解任务的推理速度,实验表明在Show-o2数据集上加速1.78至2.01倍,保持SOTA性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14948 2026-03-17 cs.CV 57%

Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation

弥合场景生成与规划:通过统一视觉与运动表示进行驾驶世界模型

Xingtai Gui, Meijie Zhang, Tianyi Yan, Wencheng Han, Jiahao Gong, Feiyang Tan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Afari Intelligent Drive(Afari智能驾驶)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出WorldDrive框架,通过统一视觉与运动表示弥合场景生成与规划之间的差距,利用轨迹感知驾驶世界模型和未来感知奖励器提升自动驾驶规划性能。

Comments 16 pages, 9 figures. The code is available at https://github.com/TabGuigui/WorldDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10910 2026-03-17 cs.CL 57%

GLM-OCR Technical Report

GLM-OCR 技术报告

Shuaiqi Duan, Yadong Xue, Weihan Wang, Zhe Su, Huan Liu, Sheng Yang, Guobing Gan, Guo Wang, Zihan Wang, Shengdong Yan, Dexin Jin, Yuxuan Zhang, Guohong Wen, Yanfeng Wang, Yutao Zhang, Xiaohan Zhang, Wenyi Hong, Yukuo Cen, Da Yin, Bin Chen, Wenmeng Yu, Xiaotao Gu, Jie Tang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 GLM-OCR 是一种高效紧凑的多模态模型,结合了CogViT视觉编码器和GLM语言解码器,通过多令牌预测机制提升OCR效率,适用于文档理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14063 2026-03-17 cs.CV 57%

Semantic Context Matters: Improving Conditioning for Autoregressive Models

语义上下文至关重要:改进自回归模型的条件化

Dongyang Jin, Ryan Xu, Jianhao Zeng, Rui Lan, Yancheng Bai, Lei Sun, Xiangxiang Chu

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SCAR方法,通过压缩语义前缀和语义对齐指导提升自回归模型的条件化能力,实现更高质量的图像编辑和可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14702 2026-03-17 cs.CV 57%

Fractal Autoregressive Depth Estimation with Continuous Token Diffusion

分形自回归深度估计与连续令牌扩散

Jinchang Zhang, Xinrou Kang, Guoyu Lu

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种分形视觉自回归扩散框架,通过粗到细的自回归生成过程改进单目深度估计,采用多尺度特征融合和连续空间去噪扩散损失提升跨模态条件化效果,同时通过分形递归架构和不确定性感知共识聚合方案提高计算效率与预测稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14505 2026-03-17 cs.CV 57%

Unlocking the Latent Canvas: Eliciting and Benchmarking Symbolic Visual Expression in LLMs

解锁潜在画布:在LLMs中引发和评估符号视觉表达

Yiren Zheng, Shibo Li, Jiaming Liu, Haofan Wang, Yiren Song

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文通过ASCII艺术格式揭示LLMs的潜在视觉能力,提出SVE-ASCII框架,构建ASCIIArt-7K数据集,并展示生成训练如何提升视觉理解,建立文本基视觉智能的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14112 2026-03-17 cs.CV 57%

Revisiting the Perception-Distortion Trade-off with Spatial-Semantic Guided Super-Resolution

重新审视基于空间-语义引导的超分辨率中的感知-失真权衡

Dan Wang, Haiyan Sun, Shan Du, Z. Jane Wang, Zhaochong An, Serge Belongie, Xinrui Cui

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpaSemSR框架,通过空间-语义引导减少失真并提升感知质量,实验显示在多个基准上实现了更优的感知-失真平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13969 2026-03-17 cs.CV eess.IV 57%

Leveraging a Statistical Shape Model for Efficient Generation of Annotated Training Data: A Case Study on Liver Landmarks Segmentation

利用统计形状模型实现高效标注训练数据生成:肝脏标志点分割的案例研究

Denis Krnjaca, Lorena Krames, Werner Nahm

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出利用统计形状模型生成大量标注数据的方法,用于深度学习的肝脏标志点分割,显著提高了分割效率并减少了手动标注的工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13956 2026-03-17 cs.AI 57%

EviAgent: Evidence-Driven Agent for Radiology Report Generation

EviAgent:基于证据的放射学报告生成代理

Tuoshi Qi, Shenshen Bu, Yingfei Xiang, Zhiming Dai

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 EviAgent通过引入多维视觉专家和检索机制,解决放射学报告生成中的透明性与证据支持问题,实验表明其在多个数据集上优于通用和专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13386 2026-03-17 cs.CV 57%

Layout-Guided Controllable Pathology Image Generation with In-Context Diffusion Transformers

基于布局的可控病理图像生成与上下文扩散变换器

Yuntao Shou, Xiangyong Cao, Qian Zhao, Deyu Meng

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于布局的可控病理图像生成方法,通过多代理LVLM注释框架构建精细临床对齐的监督数据,提出IC-DiT模型整合空间布局、文本描述和视觉嵌入,实现高保真生成与强空间可控性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13375 2026-03-17 cs.CV cs.LG 57%

InfiniteDance: Scalable 3D Dance Generation Towards in-the-wild Generalization

InfiniteDance: 可扩展的3D舞蹈生成以实现真实场景泛化

Ronghui Li, Zhongyuan Hu, Li Siyao, Youliang Zhang, Haozhe Xie, Mingyuan Zhang, Jie Guo, Xiu Li, Ziwei Liu

机构 * Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出InfiniteDance,通过扩大数据与模型设计,实现可扩展的3D舞蹈生成,解决了真实场景下的泛化问题。

Comments project page: https://infinitedance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏