arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2508.03199 2026-02-03 cs.CL 57%

Beyond Content: How Grammatical Gender Shapes Visual Representation in Text-to-Image Models

超越内容:语法性别如何塑造文本到图像模型中的视觉表示

Muhammed Saeed, Shaina Raza, Ashmal Vayani, Muhammad Abdul-Mageed, Ali Emami, Shady Shehata

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 研究揭示语法性别对文本到图像模型中视觉表示的显著影响,通过跨语言实验展示不同语法性别对性别表示的系统性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00463 2026-02-03 cs.CV 57%

PSGS: Text-driven Panorama Sliding Scene Generation via Gaussian Splatting

PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成

Xin Zhang, Shen Chen, Jiale Zhou, Lei Li

机构 * East China University of Science and Technology(东华大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。

Comments Accepted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00042 2026-02-03 eess.SP cs.AI 57%

JSR-GFNet: Jamming-to-Signal Ratio-Aware Dynamic Gating for Interference Classification in future Cognitive Global Navigation Satellite Systems

JSR-GFNet: 针对未来认知全球导航卫星系统干扰分类的干扰-信号比感知动态门控

Zhihan Zeng, Hongyuan Shu, Kaihe Wang, Lu Chen, Amir Hussian, Yanjun Huang, Junchu Zhao, Yue Xiu, Zhongpei Zhang

机构 * National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(中国电子科技大学无线通信国家重点实验室) University of Electronic Science and Technology of China(中国电子科技大学) Shanghai Aerospace Electronic Technology Institute(上海航天电子技术研究所) Shanghai Key Laboratory of Collaborative Computing in Spacial Heterogeneous Networks (CCSN)(上海空间异构网络协同计算重点实验室) Anhui Science and Technology University(安徽科技大学) University of Oxford(牛津大学) Shanghai Xiaoyuan Innovation center(上海小元创新中心)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 JSR-GFNet通过结合相位敏感的IQ样本与STFT频谱图,利用动态门控机制提升GNSS干扰分类的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23121 2026-02-02 cs.MM 57%

An Automatic Deep Learning Approach for Trailer Generation through Large Language Models

基于大语言模型的自动 trailers 生成方法

Roberto Balestri, Pasquale Cascarano, Mirko Degli Esposti, Guglielmo Pescatore

专题命中 多模态生成 :multimodal(abstract);分类 cs.MM

AI总结 本文提出基于大语言模型的自动化 trailers 生成方法,通过多模态策略提升 trailers 的视觉吸引力和叙事体验。

Comments 2024 9th International Conference on Frontiers of Signal Processing (ICFSP)

Journal ref ICFSP, Paris, France, 2024, pp. 93-100

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22455 2026-02-02 cs.CV 57%

ScribbleSense: Generative Scribble-Based Texture Editing with Intent Prediction

ScribbleSense: 基于生成的涂鸦纹理编辑与意图预测

Yudi Zhang, Yeming Geng, Lei Zhang

机构 * School of Computer Science, Beijing Institute of Technology(计算机学院,北京理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 ScribbleSense通过结合多模态大语言模型和图像生成模型,实现了基于生成的涂鸦纹理编辑与意图预测,提升交互式编辑性能。

Comments Accepted by IEEE TVCG. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07222 2026-02-02 cs.CV 57%

Omni-View: Unlocking How Generation Facilitates Understanding in Unified 3D Model based on Multiview images

Omni-View: 通过多视角图像解锁生成如何促进理解的统一3D模型

JiaKui Hu, Shanshan Zhao, Qing-Guo Chen, Xuerui Qiu, Jialun Liu, Zhao Xu, Weihua Luo, Kaifu Zhang, Yanye Lu

机构 * Institute of Medical Technology(医学技术研究所) Alibaba International Digital Commerce Group(阿里巴巴国际数字商务集团) CASIA TeleAI

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 Omni-View通过多视角图像实现3D场景的理解与生成,结合纹理和几何模块,提升3D场景建模性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02507 2026-01-30 cs.CV cs.RO 57%

Keeping it Local, Tiny and Real: Automated Report Generation on Edge Computing Devices for Mechatronic-Based Cognitive Systems

保持本地化、小巧和现实:面向机电认知系统的边缘计算设备自动化报告生成

Nicolas Schuler, Lea Dewald, Jürgen Graf

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于边缘计算设备的自动化报告生成方法,利用本地模型实现多模态传感器数据处理,以提升机电认知系统在不同环境中的评估效率与隐私保护。

Comments 6 pages, 4 figures, 1 table; accepted for MECATRONICS-REM 2025 International Conference, PARIS, FRANCE December 3-5 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21669 2026-01-30 cs.LG cs.AI 57%

Expected Return Causes Outcome-Level Mode Collapse in Reinforcement Learning and How to Fix It with Inverse Probability Scaling

预期回报导致强化学习中的结果层面模式崩溃及如何通过逆概率缩放修复它

Abhijeet Sinha, Sundari Elango, Dianbo Liu

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出逆概率缩放方法,通过修正预期回报目标来解决强化学习中的结果层面模式崩溃问题,有效提升多模式策略优化的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21517 2026-01-30 cs.CV 57%

HERS: Hidden-Pattern Expert Learning for Risk-Specific Vehicle Damage Adaptation in Diffusion Models

HERS:隐藏模式专家学习用于扩散模型中特定风险车辆损伤适应

Teerapong Panboonyuen

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 HERS通过领域特定专家学习提升扩散模型中车辆损伤生成的保真度与可控性,提高保险领域应用的安全性与可靠性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17323 2026-01-30 cs.CV 57%

SkyReels-V3 Technique Report

SkyReels-V3 技术报告

Debang Li, Zhengcong Fei, Tuanhui Li, Yikun Dou, Zheng Chen, Jiangping Yang, Mingyuan Fan, Jingtao Xu, Jiahua Wang, Baoxuan Gu, Mingshan Chang, Wenjing Cai, Yuqiang Xie, Binjie Mao, Youqiang Zhang, Nuo Pang, Hao Zhang, Yuzhe Jin, Zhiheng Xu, Dixuan Lin, Guibin Chen, Yahui Zhou

机构 * SkyReels Team(SkyReels 团队)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 SkyReels-V3 提出三种视频生成范式,通过多模态上下文学习框架实现高质量视频生成,涵盖图像到视频、视频扩展和音频引导生成,达到接近闭源系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04589 2026-01-30 cs.CV 57%

MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing

MiLDEdit: 基于推理的多层设计文档编辑

Zihao Lin, Wanrong Zhu, Jiuxiang Gu, Jihyung Kil, Christopher Tensmeyer, Lin Zhang, Shilong Liu, Ruiyi Zhang, Lifu Huang, Vlad I. Morariu, Tong Sun

机构 * University of California, Davis(加州大学戴维斯分校) Adobe(Adobe公司) UW-Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 MiLDEdit通过引入基于推理的多层文档编辑代理,实现了对多层设计文档的精准编辑,显著超越现有方法,建立了该领域的首个强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25731 2026-01-30 cs.CV 57%

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

LaTo:基于地标token化的扩散变换器用于精细的人脸编辑

Zhenghao Zhang, Ziying Zhang, Junchao Liao, Xiangyu Meng, Qiang Hu, Siyu Zhu, Xiaoyun Zhang, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里云计算) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LaTo通过地标token化扩散变换器实现精细的人脸编辑,提升身份保持与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20520 2026-01-29 cs.CV 57%

Context Tokens are Anchors: Understanding the Repetition Curse in dMLLMs from an Information Flow Perspective

上下文标记是锚点:从信息流的角度理解dMLLMs中的重复诅咒

Qiyan Zhao, Xiaofeng Zhang, Shuochen Chang, Qianyu Chen, Xiaosong Yuan, Xuhang Chen, Luoqi Liu, Jiajun Zhang, Xu-Yao Zhang, Da-Han Wang

机构 * SJTU(上海交通大学) CASIA(中国科学院自动化研究所) NTU(国立台湾大学) Meitu (China) Limited(美图公司) XMUT(新疆大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 CoTA通过增强上下文标记注意力和引入惩罚项缓解dMLLMs中的重复问题,提升解码性能。

Comments Accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20260 2026-01-29 cs.CV 57%

Reversible Efficient Diffusion for Image Fusion

可逆高效扩散用于图像融合

Xingxin Xu, Bing Cao, DongDong Li, Qinghua Hu, Pengfei Zhu

机构 * School of New Media and Communication, Tianjin University(新媒体与传播学院,天津大学) School of Artificial Intelligence, Tianjin University(人工智能学院,天津大学) Low-Altitude Intelligence Laboratory, Xiong’an National Innovation Center(低空智能实验室,雄安国家创新中心) Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创蓝天科技有限公司) National University of Defense Technology(国防科技大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出可逆高效扩散模型,通过显式监督提升图像融合的生成能力,解决传统扩散模型在融合任务中的细节损失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05150 2026-01-29 cs.CV 57%

TwinFlow: Realizing One-step Generation on Large Models with Self-adversarial Flows

TwinFlow: 在大模型上实现一步生成的自对抗流

Zhenglin Cheng, Peng Sun, Jianguo Li, Tao Lin

机构 * Inclusion AI Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 TwinFlow 提出了一种无需预训练教师模型和标准对抗网络的一步生成框架,实现了在大模型上高效生成,提升了推理效率并降低了计算成本。

Comments arxiv v1, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19484 2026-01-28 cs.CV 57%

Dynamic Worlds, Dynamic Humans: Generating Virtual Human-Scene Interaction Motion in Dynamic Scenes

动态世界,动态人类:生成动态场景中的虚拟人类-场景交互动作

Yin Wang, Zhiying Leng, Haitian Liu, Frederick W. B. Li, Mu Li, Xiaohui Liang

机构 * Beihang University(北航大学) University of Durham(达勒姆大学) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) Zhongguancun Laboratory(中关村实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Dyn-HSI架构,通过动态视觉导航、分层经验记忆和人-场景交互扩散模型,生成高质量的动态场景中人-场景交互动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18997 2026-01-28 cs.CV cs.LG 57%

Anatomically-aware conformal prediction for medical image segmentation with random walks

解剖学感知的符合预测用于带有随机游走的医学图像分割

Mélanie Gaillochet, Christian Desrosiers, Hervé Lombaert

机构 * École de Technologie Supérieure Mila - Quebec AI Institute Polytechnique Montréal

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出RW-CP方法,通过随机游走扩散不确定性,提升医学图像分割的解剖学一致性与预测稳定性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17733 2026-01-27 cs.CV cs.GR 57%

Flatten The Complex: Joint B-Rep Generation via Compositional $k$-Cell Particles

扁平化复杂:通过组合k-cell粒子进行联合B-Rep生成

Junran Lu, Yuanqi Li, Hengji Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于组合k-cell粒子的B-Rep生成方法,通过解耦层次结构实现拓扑与几何的联合生成,提升生成模型的精度和可编辑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15876 2026-01-26 cs.AI 57%

EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience

EvoCUA:通过可扩展的合成经验学习来进化计算机使用代理

Taofeng Xue, Chong Peng, Mianqiu Huang, Linsen Guo, Tiancheng Han, Haozhe Wang, Jianing Wang, Xiaocheng Zhang, Xin Yang, Dengchang Zhao, Jinrui Ding, Xiandi Ma, Yuchen Xie, Peng Pei, Xunliang Cai, Xipeng Qiu

机构 * Meituan(美团) Fudan University(复旦大学) Tongji University(同济大学) The Hong Kong University of Science and Technology(香港理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 EvoCUA通过可扩展的合成经验学习进化计算机使用代理,实现更高性能和通用性。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19913 2026-01-26 cs.CV 57%

Coupled Physics-Gated Adaptation: Spatially Decoding Volumetric Photochemical Conversion in Complex 3D-Printed Objects

耦合物理门控适应:在复杂3D打印物体中空间解码体积分子转换

Maryam Eftekharifar, Churun Zhang, Jialiang Wei, Xudong Cao, Hossein Heidari

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出耦合物理门控适应方法,通过空间解码实现复杂3D打印物体中体积分子转换的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16208 2026-01-23 cs.CV 57%

Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders

通过表征自编码器扩展文本到图像扩散变换器

Shengbang Tong, Boyang Zheng, Ziteng Wang, Bingda Tang, Nanye Ma, Ellis Brown, Jihan Yang, Rob Fergus, Yann LeCun, Saining Xie

机构 * New York University(纽约大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 通过扩展表征自编码器实现更高效的大规模文本到图像生成,RAE在预训练和微调中均优于VAE,且具有更快的收敛速度和更好的生成质量。

Comments website: https://rae-dit.github.io/scale-rae/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16024 2026-01-23 cs.CV 57%

PAINT: Pathology-Aware Integrated Next-Scale Transformation for Virtual Immunohistochemistry

PAINT: 用于虚拟免疫组化病理学的路径感知集成下尺度转换

Rongze Ma, Mengkang Lu, Zhenyu Xiang, Yongsheng Pan, Yicheng Wu, Qingjie Zeng, Yong Xia

机构 * School of Computer Science and Engineering, Northwestern Polytechnical University(计算机科学与工程学院,西北工业大学) Monash University(墨尔本大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 PAINT通过结构优先的自回归框架,提升虚拟免疫组化合成的结构保真度和临床应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15729 2026-01-23 cs.RO cs.AI cs.SY eess.SY 57%

DualShield: Safe Model Predictive Diffusion via Reachability Analysis for Interactive Autonomous Driving

DualShield: 通过可达性分析实现交互式自动驾驶的安全模型预测扩散

Rui Yang, Lei Zheng, Ruoyu Yao, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科学与技术大学(广州))

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 DualShield通过可达性分析实现交互式自动驾驶的安全模型预测扩散,结合前瞻性指导和反应性安全防护,提升安全性和任务效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15578 2026-01-23 cs.NI cs.AI cs.LG cs.RO 57%

MapViT: A Two-Stage ViT-Based Framework for Real-Time Radio Quality Map Prediction in Dynamic Environments

MapViT:一种基于视觉Transformer的两阶段框架,用于动态环境中实时无线电质量地图预测

Cyril Shih-Huan Hsu, Xi Li, Lanfranco Zanzi, Zhiheng Yang, Chrysa Papagianni, Xavier Costa Pérez

机构 * Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学院) NEC Laboratories Europe(NEC欧洲实验室) i2CAT Foundation(i2CAT基金会) Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级研究机构(ICREA))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 MapViT通过两阶段ViT框架实现实时动态环境中无线信号质量预测,结合预训练和微调方法提升准确性和效率,适用于资源受限的移动机器人场景。

Comments This paper has been accepted for publication at IEEE International Conference on Communications (ICC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08893 2026-01-23 cs.LG cs.CL 57%

Spectral Generative Flow Models: A Physics-Inspired Replacement for Vectorized Large Language Models

谱生成流模型:一种受物理启发的向量大语言模型替代方案

Andrew Kiruluta

机构 * UC Berkeley(伯克利大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 谱生成流模型通过物理启发的连续场演化机制,替代传统向量大语言模型,实现长程一致性、多模态通用性和物理结构归纳偏置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13846 2026-01-21 cs.AI cs.CY cs.LG 57%

Virtual Urbanism: An AI-Driven Framework for Quantifying Urban Identity. A Tokyo-Based Pilot Study Using Diffusion-Generated Synthetic Environments

虚拟城市主义:一种基于AI的量化城市身份框架。以东京为基础的试点研究,使用扩散生成的合成环境

Glinskaya Maria

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出虚拟城市主义框架,利用AI生成合成环境量化城市身份,通过东京试点研究验证其有效性,揭示核心身份形成元素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02314 2026-01-21 cs.IT cs.AI math.IT 57%

Large AI Models for Wireless Physical Layer

大规模人工智能模型用于无线物理层

Jiajia Guo, Yiming Cui, Shi Jin, Jun Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) National Mobile Communications Research Laboratory, Southeast University(国家移动通信研究中心,东南大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出利用大规模人工智能模型改进无线物理层通信,通过预训练模型和专用模型策略提升性能与适应性,并探讨未来研究方向。

Comments A collection of paper on Large AI Models for wireless physical layer can be found at https://github.com/AI4Wireless/LAM4PHY_6G

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19498 2026-01-21 cs.CL 57%

DomainCQA: Crafting Knowledge-Intensive QA from Domain-Specific Charts

DomainCQA: 从领域特定图表中构建知识密集型问答

Yujing Lu, Ling Zhong, Jing Yang, Weiming Li, Peng Wei, Yongheng Wang, Manni Duan, Qing Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 DomainCQA通过构建领域特定图表问答基准测试,提升多模态大语言模型在视觉理解和知识密集型推理方面的能力。

Comments 83 pages, 59 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12326 2026-01-21 cs.CV 57%

EmoKGEdit: Training-free Affective Injection via Visual Cue Transformation

EmoKGEdit: 无训练情感注入 via 视觉线索转换

Jing Zhang, Bingjie Fan

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 EmoKGEdit通过构建多模态情感关联知识图谱,实现无训练的精确情感注入,有效分离情感属性与布局特征,提升图像情感编辑的保真度和结构一致性。

Comments 11pages,10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11074 2026-01-21 cs.CV 57%

Evaluating Latent Generative Paradigms for High-Fidelity 3D Shape Completion from a Single Depth Image

评估用于从单个深度图像生成高保真3D形状补全的潜在生成范式

Matthias Humt, Ulrich Hillenbrand, Rudolph Triebel

机构 * German Aerospace Center(德国航空航天中心) TU Munich(慕尼黑技术大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文比较了扩散模型和自回归模型在单个深度图像生成高保真3D形状补全任务中的性能,发现扩散模型在连续潜在空间中表现更优,而自回归模型在离散潜在空间中可匹敌或超越扩散模型。

Comments 16 pages, 4 figures, 19 tables. To appear in 3DV 2026. Project page: https://hummat.github.io/2026-3dv-genz/

详情

展开后加载摘要…

URL PDF HTML 收藏