arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-07 至 2026-07-07 共收录 243 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2603.12506 2026-07-07 cs.CV cs.AI cs.LG 版本更新 88%

Naïve PAINE: Lightweight Text-to-Image Generation Improvement with Prompt Evaluation

朴素PAINE:通过提示评估改进文本到图像生成

Joong Ho Kim, Nicholas Thai, Souhardya Saha Dip, Dong Lao, Keith G. Mills

机构 * LSU ATHENA Lab(LSU ATHENA实验室) LSU Vision Lab(LSU视觉实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出朴素PAINE改进扩散模型生成质量,利用文本到图像偏好基准,从初始噪声和给定提示直接预测图像质量,选择高质量噪声传入扩散模型,提供反馈且轻量,实验表明其在基准测试中优于现有方法。

Comments Code available at https://github.com/LSU-ATHENA/Naive-PAINE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03046 2026-07-07 cs.CV 新提交 84%

Text-to-Image Generation for Projector-Camera System Registration

用于投影仪-相机系统配准的文本到图像生成

Xinyu Chen, Yuqi Li, Jiabao Li, Pinyan Tang, Chong Wang, Aditi Majumder

机构 * Ningbo University(宁波大学) University of California, Irvine(加利福尼亚大学欧文分校)

专题命中 文生图 :image generation(title);text-to-image(title);分类 cs.CV

AI总结 针对投影仪-相机系统配准中现有方法的局限,提出基于深度神经网络的方法,从文本提示生成自然图像,增强配准精度,经实验验证该方法实用有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22545 2026-07-07 cs.CV cs.AI 版本更新 57%

SFL-Net: Source-Factorized Latent Representation Learning for Multi-Contrast MRI to Tau-PET Synthesis

基于部分信息分解指导的解耦量化半UNet的多模态T1加权和FLAIR MRI生成可解释的tau-PET

Agamdeep S. Chopra, Caitlin Neher, Tianyi Ren, Juampablo E. Heras Rivera, Hesamoddin Jahanian, Mehmet Kurt

机构 * Department of Mechanical Engineering, University of Washington(华盛顿大学机械工程系) Department of Radiology, University of Washington(华盛顿大学放射学系)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种可解释的多模态图像合成框架,通过部分信息分解指导的解耦量化半UNet生成tau-PET,结合向量量化编码器和半UNet解码器,实现了在ADNI-3和OASIS-3数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04339 2026-07-07 cs.LG cs.AI cs.CR 新提交 50%

One Framework for All: Cross-Modal Membership Inference for Generative Models

一框架适用于所有:生成模型的跨模态成员推理

Dayong Ye, Tainqing Zhu, Kun Gao, Junhao Liu, Yichuan Chen, Shuai Zhou, Hengzhu Liu, Bo Liu, Wanlei Zhou

专题命中 文生图 :text-to-image(abstract)

AI总结 研究生成模型的跨模态成员推理问题,基于生成模型输出分布可近似训练数据分布的特性,在共享嵌入空间建模,通过似然比测试推理,贡献统一框架,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 5 篇

2607.03562 2026-07-07 cs.CV 新提交 57%

XPlainVerse: A Million-Scale Benchmark for Explainable Deepfake Detection

XPlainVerse:用于可解释深度伪造检测的百万规模基准测试

Abhijeet Narang, Kartik Kuckreja, Shreya Ghosh, Muhammad Haris Khan, Jianfei Cai, Abhinav Dhall

机构 * Monash University(墨尔本大学) MBZUAI(穆斯林人工智能研究所) The University of Queensland(昆士兰大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对深度伪造检测模型解释缺乏视觉依据的问题,引入XPlainVerse基准测试,含百万图像及多阶段验证流程,提出新评估指标,能支持可信赖、可解释模型的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19073 2026-07-07 cs.CV 新提交 57%

Taming I2V models for Image HOI Editing: A Cognitive Benchmark and Agentic Self-Correcting Framework

驯服I2V模型用于图像HOI编辑:认知基准与智能体自校正框架

Jiayi Gao, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(国家健康数据科学研究院,北京大学,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出HOI-Edit基准和SCPE框架,利用I2V模型的时间生成能力进行动态人-物交互编辑,通过自校正提示迭代优化,实现与SOTA竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22607 2026-07-07 cs.CV 版本更新 57%

Dress-ED: Instruction-Guided Editing for Virtual Try-On and Try-Off

Dress-ED:基于指令的虚拟试穿和试脱编辑

Davide Lobba, Fulvio Sanguigni, Bin Ren, Marcella Cornia, Rita Cucchiara, Nicu Sebe

机构 * University of Modena(摩德纳大学) University of Trento(特伦托大学) University of Pisa(比萨大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Dress-ED数据集,首次统一了虚拟试穿、试脱和文本引导的服装编辑,包含146k个样本,涵盖外观和结构修改,提供统一的多模态扩散框架作为指令驱动的VTON和VTOFF基线。

Comments Accepted at ECCV 2026. Project page at https://aimagelab.github.io/Dress-ED/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13770 2026-07-07 cs.CV 版本更新 57%

CDST: Color Disentangled Style Transfer for Universal Style Reference Customization

CDST:用于通用风格参考定制的颜色解缠风格迁移

Shiwen Zhang, Zhuowei Chen, Lang Chen, Yanze Wu

机构 * ByteDance(字节跳动)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 介绍CDST这种新颖高效的双流风格迁移训练范式,能分离颜色与风格,推理时免调参实现通用风格迁移,首次免调参解决带风格和内容参考的特征保留风格迁移问题,实验证明效果达最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13771 2026-07-07 cs.CV 版本更新 57%

AppAgent: Multimodal Agents as Smartphone Users

AppAgent:作为智能手机用户的多模态智能体

Chi Zhang, Zhao Yang, Jiaxuan Liu, Yanda Li, Yucheng Han, Xin Chen, Zebiao Huang, Bin Fu, Gang Yu

机构 * Tencent(腾讯)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 介绍基于大语言模型的多模态智能体框架,通过简化动作空间操作智能手机应用,无需系统后端访问,经自主探索或观察人类示范学习,能执行复杂任务,测试验证其处理多种高级任务的能力。

Comments Accepted to CHI 2025, project page is https://appagent-official.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 192 篇

2607.03752 2026-07-07 cs.CV cs.AI cs.CL cs.MA 新提交 92%

EmCom-Diffusion: Probing Visual Reflection in Emergent Languages via Image Generation

EmCom-Diffusion:通过图像生成探究新兴语言中的视觉反射

Haruumi Omoto, Tadahiro Taniguchi

机构 * Graduate School of Informatics, Kyoto University, Kyoto, Japan(京都大学信息学研究科) Research Organization of Science and Technology, Ritsumeikan University, Shiga, Japan(立命馆大学科学技术研究机构)

专题命中 扩散模型 :diffusion(title,title_cn);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 研究新兴语言编码输入视觉内容程度的问题,提出EmCom-Diffusion框架,直接测量视觉反射,通过微调文本到图像扩散模型,以重建图像与原图的感知相似性评分,验证其优于现有指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03180 2026-07-07 cs.CV 新提交 89%

FairFlow: Demystifying and Mitigating Stereotype Bias in Text-to-Image Diffusion Transformers

FairFlow:揭开文本到图像扩散变换器中刻板印象偏差的面纱并减轻其影响

Chen Chen, Yuanmin Huang, Zhenfei Zhang, Mi Zhang, Xiaohan Zhang, Yun Xiong, Xiaoyu You, Min Yang

机构 * Fudan University(复旦大学) East China University of Science and Technology(华东理工大学)

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究文本到图像扩散变换器中刻板印象偏差问题,通过机理分析找到偏差根源,提出FairFlow框架,能有效中和刻板印象偏差,实现公平与保真平衡,且推理开销小、对复杂提示鲁棒。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03899 2026-07-07 cs.CV 新提交 88%

DICT: Data Injection and Contrastive Trajectory Refinement for Conditional Image Generation with Diffusion Models

DICT:用于扩散模型条件图像生成的数据注入和对比轨迹细化

Chunnan Shang, Xin Zhang, Zhizhong Wang, Hongwei Wang

机构 * Zhejiang University(浙江大学)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 针对条件图像生成,提出DICT方法。通过数据注入将噪声扰动条件信号融入早期去噪阶段,结合对比轨迹细化,在统一扩散框架下提升生成质量,且无需引入任务相关架构,跨任务转移效果好。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08303 2026-07-07 cs.CV 版本更新 88%

SnapGen++: Unleashing Diffusion Transformers for Efficient High-Fidelity Image Generation on Edge Devices

SnapGen++:释放扩散变压器以在边缘设备上进行高效高保真图像生成

Dongting Hu, Aarush Gupta, Magzhan Gabidolla, Arpit Sahni, Huseyin Coskun, Yanyu Li, Yerlan Idelbayev, Ahsan Mahmood, Aleksei Lebedev, Dishani Lahiri, Anujraaj Goyal, Ju Hu, Mingming Gong, Sergey Tulyakov, Anil Kag

机构 * Snap Inc. University of Melbourne(墨尔本大学) MBZUAI

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 针对扩散变压器在边缘设备部署的高成本问题,提出高效DiT框架。通过紧凑架构、弹性训练框架和知识引导的分布匹配蒸馏,在资源受限下实现变压器级生成质量,可在多样硬件上部署。

Comments Project page: https://snap-research.github.io/snapgenplusplus/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22699 2026-07-07 cs.CV 版本更新 88%

Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer

Z-Image: 一种基于单流扩散Transformer的高效图像生成基础模型

Image Team, Huanqia Cai, Sihan Cao, Ruoyi Du, Peng Gao, Aiming Hao, Steven Hoi, Zhaohui Hou, Shijie Huang, Dengyang Jiang, Yuming Jiang, Xin Jin, Liangchen Li, Zhen Li, Zhong-Yu Li, David Liu, Dongyang Liu, Qilong Wu, Feng Yu, Zechao Zhan, Chi Zhang, Shifeng Zhang, Ruikai Zhou, Shilin Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 提出Z-Image,一种6B参数的高效图像生成基础模型,采用可扩展单流扩散Transformer架构,通过优化数据基础设施和训练流程,仅用314K H800 GPU小时完成训练,性能媲美顶级商业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02211 2026-07-07 cs.CV 版本更新 87%

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

TexTailor:用于多模态扩散变压器的推理时文本引导剪裁

Binglei Li, Mengping Yang, Zhiyu Tan, Junping Zhang, Hao Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 研究基于变压器的扩散模型中不同模块与文本条件的交互。通过系统管道分析各模块功能,提出推理时逐块文本引导剪裁方法,提升文本图像对齐,有多种下游应用,实验表明优于基线。

Comments To appear in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09740 2026-07-07 cs.CV cs.AI 版本更新 85%

ELBO-T2IAlign: A Generic ELBO-Based Method for Calibrating Pixel-level Text-Image Alignment in Diffusion Models

ELBO-T2IAlign:一种基于通用ELBO的方法,用于校准扩散模型中的像素级文本-图像对齐

Qin Zhou, Zhiyang Zhang, Jinglong Wang, Xiaobin Li, Jing Zhang, Qian Yu, Lu Sheng, Dong Xu

机构 * School of Software, Beihang University(北航软件学院) College of Computer and Cyber Security, Hebei Normal University(河北师范大学计算机与网络安全学院) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 研究利用零样本指称图像分割评估扩散模型像素级图像与文本对齐,分析训练数据偏差导致的不对齐问题,提出ELBO-T2IAlign方法校准像素-文本对齐,无需额外标注等,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01803 2026-07-07 cs.CV cs.GR cs.RO 新提交 84%

PixGS: Pixel-Space Diffusion for Direct 3D Gaussian Splat Generation

PixGS: 像素空间扩散用于直接三维高斯泼溅生成

Cao Duy, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 提出单阶段管道PixGS,利用像素空间扩散从文本或图像直接生成高质量3D高斯泼溅,避免潜在压缩伪影,并引入表面法线、深度和高频结构监督,在单张A100 GPU上1秒内生成,性能超越现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06577 2026-07-07 cs.CV 版本更新 84%

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

全模态扩散:基于掩码离散扩散的统一多模态理解与生成

Lijiang Li, Zuwei Long, Yunhang Shen, Heting Gao, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云科技实验室) CASIA(中国科学院自动化研究所)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 受离散扩散模型在多领域成功应用启发,提出全模态扩散模型,基于掩码离散扩散模型构建,统一文本、语音和图像的理解与生成,用统一模型直接捕捉离散多模态令牌联合分布,性能优于现有多模态系统。

Comments Accepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05274 2026-07-07 cs.CV 新提交 83%

Erasing Without Collateral Damage: Precise Concept Removal in Diffusion Models

无附带损害擦除:扩散模型中的精确概念移除

Parth Upman, Nishita Jain, Shreyank N Gowda

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对无训练概念擦除易损害相关非目标概念的问题,提出CARE闭式算子,在交叉注意力值空间实现精确擦除,无模型微调,可更好保留非目标概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04801 2026-07-07 cs.CV 新提交 83%

LILAC: Layer-Wise Independent LoRAs and Cascaded Conditioning for Multi-Concept Customization of Diffusion Models

LILAC:用于扩散模型多概念定制的分层独立LoRAs和级联条件处理

Marian Lupascu, Sebastian Ripa, Mihai Trascau, Mariana-Iuliana Georgescu, Ionut Mironica

机构 * Adobe Research, Romania(罗马尼亚Adobe研究院) Department of Computer Science, University of Bucharest, Romania(罗马尼亚布加勒斯特大学计算机科学系) International Computer High School of Bucharest, Romania(罗马尼亚布加勒斯特国际计算机高中)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究个性化文本到图像扩散模型渲染特定主题的难题,提出LILAC框架,通过分层独立训练低秩适配器并级联条件处理,避免参数干扰,无需联合训练,线性扩展且与主干无关,效果良好。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04461 2026-07-07 cs.CV 新提交 83%

Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models

Flash-BoN:扩散模型推理时缩放的即时草稿

Ruchit Rawal, Reza Shirkavand, Sayak Paul, Yuxin Wen, Heng Huang, Yizheng Chen, Tom Goldstein, Gowthami Somepalli

机构 * University of Maryland, College Park(美国马里兰大学帕克分校) Hugging Face(拥抱脸)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像生成推理时缩放,对比简单BoN与引导搜索方法,发现简单BoN在实际评估中表现良好。提出Flash-BoN,结合多种加速方法生成草稿候选,经多阶段验证选最有潜力的优化,在多基准和模型规模下优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03831 2026-07-07 cs.CV cs.AI 新提交 83%

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

扩散分类器如何做出决策?以偏差为中心的评估

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi

机构 * K. N. Toosi University of Technology(伊朗科技大学) Amirkabir University of Technology(伊朗阿米尔卡比尔理工大学) The University of Tokyo(东京大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究扩散分类器如何决策,通过ASOB-Bench从属性绑定、大小顺序偏差和背景依赖三维度评估,发现其偏差特征与视觉语言模型不同,为构建更稳健模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03517 2026-07-07 cs.LG cs.CV 新提交 83%

Mixture-of-Gaussians-Guided Schedule Design for Brownian Bridge Diffusion Models

用于布朗桥扩散模型的高斯混合引导调度设计

Ron Levi, Michael Elad

机构 * Technion, Israel(以色列理工学院)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(abstract);分类 cs.CV

AI总结 研究为布朗桥扩散模型开发调度设计框架,基于高斯混合先验分析其反向动力学,得出理想后验和去噪器,据此制定两个调度设计目标,揭示权衡并证明通用调度存在,实验验证其价值。

Comments 66 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03397 2026-07-07 cs.AI cs.CV 新提交 83%

Efficient bias mitigation in T2I diffusion models using Concept Graphs

使用概念图在文本到图像扩散模型中有效减轻偏差

Mansi, Avinash Kori, Francesco Leofante

机构 * Department of Computing Imperial College London(伦敦帝国理工学院计算系)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像扩散模型偏差问题,提出基于概念图对齐的CO-ALIGN方法,在模型内部概念本体上操作,能有效减轻偏差并保留生成完整性,性能优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03256 2026-07-07 cs.CV 新提交 83%

A Decomposable Probe for Few-Step Diffusion Models: Prompt, Latent, and Score Selectivity across Backbone Families and Distillation Paradigms

用于少步扩散模型的可分解探测器:跨主干家族和蒸馏范式的提示、潜在和分数选择性

Patrick Mu Haojie

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究少步蒸馏扩散模型质量差距,用可分解探测器沿三层在三种模式六种强度下注入扰动,报告选择性比率。结果表明不同层读取不同因素,潜在层是整流流主干的近二元探测器。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02563 2026-07-07 cs.CV cs.AI cs.HC 新提交 83%

Attention Dynamics in Diffusion Models: A Visual Analytics Framework for Human-AI Collaboration

扩散模型中的注意力动态:用于人机协作的视觉分析框架

Yiran Xiao, George Legrady

机构 * University of California, Santa Barbara(美国加利福尼亚大学圣巴巴拉分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对扩散模型语义结构难以解释问题,提出视觉分析框架,通过整合定量测度与数据驱动阶段识别,对注意力动态进行结构化分析,助力人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20971 2026-07-07 cs.CV 新提交 83%

UNITY: Attention Flow Networks for Adaptive Conditioning in Diffusion

UNITY: 用于扩散模型中自适应条件化的注意力流网络

Aryan Das, Koushik Biswas, Moloud Abdar, Vinay Kumar Verma

机构 * VIT Bhopal, India(印度VIT布巴尔学院) IIIT Delhi, India(印度德里理工学院) The University of Queensland, Australia(澳大利亚昆士兰大学) IIT Kanpur, India(印度坎普尔理工学院)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出UNITY,一种两阶段训练范式,通过可变形注意力流网络实现多模态条件共享与专化,在保持图像保真度的同时显著降低推理延迟和内存消耗。

Comments Acccepted in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22972 2026-07-07 cs.CV 版本更新 83%

WorldMesh: Generating Navigable Multi-Room 3D Scenes via Mesh-Conditioned Image Diffusion

WorldMesh: 通过网格条件图像扩散生成可导航的多房间3D场景

Manuel-Andreas Schneider, Angela Dai

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 扩散模型 :diffusion(title);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出WorldMesh方法,通过网格条件图像扩散生成大规模多房间3D场景,结合结构化网格与真实外观合成,实现高丰富度和多样性的3D环境生成。

Comments Accepted to ECCV 2026. Project page: https://mschneider456.github.io/world-mesh/ Video: https://www.youtube.com/watch?v=MKMEbPT38-s Code: https://github.com/mschneider456/worldmesh

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14504 2026-07-07 cs.LG cs.AI cs.CV 版本更新 83%

Trust-Region Noise Search for Black-Box Alignment of Diffusion and Flow Models

基于信任区域的噪声搜索用于扩散和流模型的黑盒对齐

Niklas Schweiger, Daniel Cremers, Karnik Ram

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种基于信任区域的噪声搜索算法,用于对扩散和流模型进行黑盒对齐,通过优化噪声样本实现更好的生成效果,适用于多种生成任务。

Comments Preprint (shorter version accepted at ICLR ReaLM-GEN workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01651 2026-07-07 cs.CV 版本更新 83%

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏