arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 3019 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 196 篇

2606.09699 2026-06-09 cs.CV 新提交 79%

Cranio-Diff: Diffusion-based Cross-domain Craniofacial Reconstruction with 2D X-ray Skull Guidance and Structural Identity Constraints

Cranio-Diff: 基于扩散的跨模态颅面重建,利用二维X射线颅骨引导和结构身份约束

Ravi Shankar Prasad, Naresh Gurjar, Shashank Baghel, Chirag, Dinesh Singh

机构 * Indian Institute of Technology Mandi(印度理工学院曼迪分校) CSVTU Bhilai(恰蒂斯加尔邦斯瓦米·维韦卡南达技术大学比莱分校)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Cranio-Diff扩散框架,通过ControlNet的颅骨条件结构引导和生物特征文本条件,从2D X射线颅骨图像重建跨模态人脸,解决结构身份对齐问题,在120名受试者的颅面数据集上优于现有方法。

Comments 14 pages, 7 figures, BMVC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18637 2026-07-22 cs.RO cs.LG 新提交 78%

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

用于逼真且可控的视觉交通场景生成的端到端条件扩散

Jingzheng Li, Yufei Ge, Zhijun Chen, Qianren Mao, Zizhe Wang, Binhang Qi, Bing Li, Keyu Chen, Baochang Zhang, Xianglong Liu, Philip S Yu

机构 * Zhongguancun Laboratory(中关村实验室) Tianjin University(天津大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) State Key Laboratory of Software Development Environment(软件开发环境国家重点实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 研究如何生成逼真且可控的视觉交通场景,提出端到端条件扩散框架E2E-CDiff,基于前视图视觉观察联合去噪未来运动状态等,减轻规划控制不匹配,实验表明其在可控性与逼真性权衡上表现良好,还能引发挑战性交互,作为自我规划器有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10243 2026-07-14 cs.RO cs.SY eess.SY 新提交 78%

Diffusion-Residual Model Predictive Steering Control for Vehicle Stabilization at the Limit of Handling under Model Uncertainty

模型不确定性下车辆极限操控时基于扩散残差模型预测的转向控制实现车辆稳定

Bongsob Song

机构 * Ajou University(韩国亚洲大学)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 研究在模型不确定性下车辆极限操控时的稳定问题,核心方法是用条件扩散残差模型学习不确定性并应用于控制器参考值和约束,主要贡献是降低峰值侧滑、恢复低摩擦操控方向稳定性,且算法运行高效。

Comments 16 pages, 6 figures, 7 tables. Submitted to IEEE Transactions on Control Systems Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16345 2026-06-16 math.OC cs.SY eess.SY 新提交 78%

Output-Feedback Boundary Control of Reaction--Diffusion PDEs on Arbitrary Lipschitz Domains: A Target-Domain Approach

任意Lipschitz域上反应-扩散PDE的输出反馈边界控制:一种目标域方法

Rafael Vazquez

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出一种域扩展框架,通过将不规则域嵌入已知稳定设计的目标域(如球或矩形),实现任意有界Lipschitz域上反应-扩散方程的输出反馈边界镇定,并保证适定性和指数稳定性。

Comments Preprint submitted to IEEE Transactions on Automatic Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08946 2026-06-16 stat.CO physics.chem-ph physics.comp-ph 新提交 78%

A Diffusion Monte Carlo algorithm employing depth first traversal and a stack instead of a swarm

一种采用深度优先遍历和栈而非群体的扩散蒙特卡罗算法

Bastiaan J. Braams

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出基于深度优先遍历和栈的扩散蒙特卡罗算法(DMCD),通过栈管理分裂历史,相比传统广度优先群体方法更节省内存,并统一了特征值问题与线性方程问题的算法处理。

Comments 12 pages. The code in the original (v1) Arxiv submission could randomly get trapped in a cycle where the same walker is all the time restarted with ever decreasing weight. The issue is described and addressed in this (v2) submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15819 2026-06-16 cs.CV cs.AI 新提交 77%

SACE: Concept Erasure at the Semantic Singularity in Visual Autoregressive Models

SACE: 视觉自回归模型中的语义奇点概念擦除

Siya Yang, Nanxiang Jiang, Zhaoxin Fan, Yunfeng Diao

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对视觉自回归模型应用现有擦除技术导致语义崩溃和视觉伪影的问题,提出语义奇点公理并通过增量语义显著性分析验证,进而引入首个尺度感知的概念擦除框架SACE,在首尺度耦合熵正则化擦除目标与恢复性保存损失,实现精确概念擦除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14025 2026-06-15 cs.CV 新提交 77%

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

GarmentSketch:大规模草图到时尚基准

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。

Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06601 2026-06-08 cs.CV cs.AI cs.LG 新提交 77%

Direct 3D-Aware Object Insertion via Decomposed Visual Proxies

通过分解视觉代理实现直接3D感知物体插入

Jingbo Gong, Yikai Wang, Yushi Lan, Yuhao Wan, Ziheng Ouyang, Rui Zhao, Ming-Ming Cheng, Qibin Hou, Chen Change Loy

机构 * Google(谷歌) Black Forest Labs(黑森林实验室)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出DIRECT框架,通过分解外观、几何和上下文引导,实现可控制3D姿态的物体插入,在几何可控性和视觉质量上优于现有方法。

Comments ICML 2026; Project Page: https://gong1130.github.io/DIRECT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08741 2026-07-10 cs.GR cs.CV cs.LG cs.RO 新提交 76%

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

ARDY:用于交互式人体运动生成的具有混合表示的自回归扩散

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

机构 * NVIDIA(英伟达) ETH Zürich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(title);分类 cs.CV、cs.GR

AI总结 研究旨在解决交互式应用中人体运动生成问题,提出ARDY框架,采用混合表示和两阶段自回归变压器去噪器,能通过在线文本提示和运动学约束实现高保真运动生成,经评估验证了有效性和实用性。

Comments ACM Transactions on Graphics (SIGGRAPH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09357 2026-08-11 cs.CV 新提交 74%

ControlRadio: Prompt-Driven Controllable Diffusion for Cross-Modal Radio Map Generation

ControlRadio:用于跨模态无线电地图生成的提示驱动可控扩散模型

Kangjun Liu, Xiying Pan, Shuhang Zhang, Xiang Xiang, Ke Chen, Yaowei Wang

机构 * Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 可控生成 :diffusion(title);分类 cs.CV

AI总结 ControlRadio是一种可控生成框架,可根据自然语言描述和环境布局生成无线电地图,在不同城市场景中精度和泛化能力领先,计算时间较传统方法减少四个数量级以上,为无线环境建模提供新范式。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26016 2026-07-09 cs.CV 新提交 74%

MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation

MIMFlow:将掩码图像建模与归一化流集成用于端到端图像生成

Yang Chen, Xiaowei Xu, Shuai Wang, Xinwen Zhang, Qiushi Guo, Tiezheng Ge, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Alibaba Group(阿里巴巴集团) Shanghai AI Lab(上海人工智能实验室)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 提出MIMFlow框架,通过VAE编码器从掩码图像推断语义潜在变量,使归一化流专注于低频语义流形,解码器处理高频合成,解决NF容量瓶颈,在ImageNet 256×256上达到71.3%线性探测精度和2.50 FID。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31029 2026-07-01 cs.CV 新提交 74%

TerraDiT-$Ω$: Unified Spatial Control for Satellite Image Synthesis with Any Geospatial Primitive

TerraDiT-$\Omega$:任意地理基元的卫星图像合成统一空间控制

Brian Wei, Srikumar Sastry, Daniel Cher, Eric Xing, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 可控生成 :image synthesis(title);分类 cs.CV

AI总结 提出TerraDiT-Ω框架,通过几何感知局部注意力机制,支持从任意原生地理基元(多边形、折线、边界框、点)直接生成卫星图像,在多种控制格式下优于密集和稀疏控制基线,并提升下游任务性能。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18780 2026-06-18 cs.CV cs.CL cs.MM 新提交 73%

SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction

SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强

Quanjiang Guo, Chong Mu, Jiazhou Pan, Ming Jia, Ling Tian, Hui Gao, Zhao Kang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV、cs.MM

AI总结 提出语义锚定对齐增强框架SAMA,通过构建结构化语义锚引导多专家多模态大模型生成高保真文本,并利用锚保留扩散机制合成图像,结合双约束过滤模块,在低资源多模态信息抽取任务中显著提升性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06498 2026-06-08 cs.GR cs.CV 新提交 73%

Semantic-Structural Alignment for Generative Pictorial Charts

生成式图形图表的语义-结构对齐

Zhida Sun, Yulin Zhang, Zheng Gu, Min Lu, Bongshin Lee, Daniel Cohen-Or, Hui Huang

机构 * Visual Computing Research Center (VCC), College of Computer Science and Software Engineering (CSSE) Shenzhen University China(视觉计算研究中心(VCC)、计算机科学与软件工程学院(CSSE)深圳大学中国)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 提出一种生成式框架,通过多模态扩散变压器中的结构对齐和语义对齐机制,实现兼具艺术表现力和结构保真度的图形图表自动合成。

Comments 11 pages, 17 figures, Accepted to ACM TOG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09171 2026-06-12 cs.HC 新提交 71%

sketch-plot: Progressive Editing for Text-to-Image Academic Figures

sketch-plot:文本到图像学术图形的渐进式编辑

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Tingfeng Lan, Jiale Lao, Wei Chen

专题命中 可控生成 :text-to-image(title)

AI总结 提出sketch-plot系统,通过三层渐进式编辑流水线(PNG、可编辑拼图、SVG)实现文本生成学术图形的精确编辑,用户按需选择编辑层级,避免全局重绘。

Comments 6 pages, 3 figures. Submitted to the KDD 2026 Workshop on AI Data Scientist

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16100 2026-08-18 cs.CV cs.NI 新提交 70%

TISC: A Text-Driven Image Semantic Communication System for Faithful Reconstruction

TISC:用于忠实重建的文本驱动图像语义通信系统

Feifan Zhang, Yuyang Du, Xiaoyan Liu, Soung Chang Liew

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出文本驱动图像语义通信框架TISC,通过树结构属性语义提取(TSASE)和初始噪声优化(INO)机制解决现有方法的语义损失与重建忠实度不足问题,经多数据集实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13478 2026-08-14 cs.CV 新提交 70%

MapRoute++: Surrogate-Guided Semantic Routing for Visual Concept Unlearning

MapRoute++:用于视觉概念遗忘的代理引导语义路由

Ashok Urlana, L. D. M. S. Sai Teja, Vivek Hruday Kavuri, Ponnurangam Kumaraguru

机构 * IIIT Hyderabad(印度信息技术学院海得拉巴分校) TCS Research(塔塔咨询服务公司研究院) NIT Silchar(锡尔卡尔国家理工学院)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对Genμ 2.0挑战视觉概念遗忘任务,在MapRoute基础上引入新训练目标、概念表示及语义路由,使模型在保留相关概念的同时提升概念移除效果,在官方基准上超越SOTA基线12.1%

Comments Accepted at Unlearning and Model Editing Workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12806 2026-08-14 cs.CV cs.AI 新提交 70%

Erase but Preserve: Controllable Removal of Copyrighted Animation Characters via Optimized Semantic Anchors

擦除但保留:通过优化语义锚点实现版权动画角色的可控移除

Qiao Li, Xiaomeng Fu, Wangjia Yu, Runze He, Baisen Wang, Jiao Dai, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型的动画角色版权问题,本文提出基于优化语义锚点的可控擦除方法,实现了更优的擦除效果与图像保真度,支持多目标移除与模型迁移。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11537 2026-08-13 cs.CV cs.AI cs.LG eess.IV 新提交 70%

Generative Semantic Segmentation via an Observable Semantic-Image Interface and Hierarchical Generator Evidence Alignment

基于可观测语义-图像接口与分层生成器证据对齐的生成式语义分割

Weize Cai, Yongqi Dong, Zhida Shao, Zixin Fu

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出Semantic Prism框架,通过可观测语义-图像接口与分层生成器证据对齐实现生成式语义分割,在Cityscapes等数据集上提升了分割精度与像素误差排名性能。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06878 2026-08-10 cs.CV 新提交 70%

ControlRef: Efficient Layout-Guided Multi-Instance Generation via Anchored 4D-RoPE

ControlRef:基于锚定4D-RoPE的高效布局引导多实例生成

Yunkai Yang, Yudong Zhang, Xinying Chen, Haoyuan Liang, Yizhuo Niu, Jinshuai Cheng, Kunquan Zhang, Liziyue Fang, Weitao Wan, Runmin Dong

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 ControlRef是一种高效布局引导多实例合成框架,通过UILC注意力掩码与锚定4D-RoPE提升空间对齐,在保证视觉保真度和定位精度的同时大幅降低推理延迟与内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06836 2026-08-10 cs.CV 新提交 70%

GOPI: Generation-Oriented 3D Pose Inference for Furniture Insertion from Single-View RGB-D Indoor Scenes

GOPI:面向生成的单视图RGB-D室内场景家具插入的3D位姿推理

Ruifeng Zhai, Renjie Liu, Guangrun Wang, Liang Lin

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 可控生成 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本研究针对单视图RGB-D室内场景家具插入的不确定性问题,提出两阶段框架GOPI,通过数据驱动迭代推理实现合理3D位姿估计,结合几何引导生成策略,在3D放置和图像合成任务上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05745 2026-08-07 cs.CV cs.AI 新提交 70%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08879 2026-07-13 cs.CV 新提交 70%

Decoupled Illumination Priors for Spatially Controllable Multi-View Indoor Scene Relighting

用于空间可控多视图室内场景重光照的解耦光照先验

Chenjian Gao, Linning Xu, Tianfan Xue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港研发平台下的CPII)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 研究室内场景重光照问题,提出Lume-Palette框架,通过将重光照解耦为光照蒸馏和投射两阶段,并引入不对称多视图条件策略,实现了逼真、空间可控且多视图一致的重光照效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06445 2026-07-08 cs.CV cs.AI 新提交 70%

Analysis-by-Proxy: Localization Signals in VLMs Operating as Condition Encoders

代理分析:作为条件编码器的视觉语言模型中的定位信号

Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik

机构 * Tel Aviv University, Tel Aviv, Israel(特拉维夫大学) Google DeepMind(谷歌DeepMind)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 研究视觉语言模型(VLMs)作条件编码器时编辑管道定位性能差的问题,引入代理分析框架,通过训练代理模型分析VLM中间表示来揭示编码定位信息的表示,发现现有条件提取策略缺陷,为条件架构设计提供新思路。

Comments Accepted as a Spotlight at the ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06162 2026-07-08 cs.CV 新提交 70%

High-Resolution Artwork Outpainting with Global Blueprint Guidance and Layout Control

基于全局蓝图引导和布局控制的高分辨率艺术作品外绘画

Junha Kim, Hyunjoon Park, Donghyeon Cho

机构 * Hanyang University(汉阳大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 研究针对高分辨率艺术作品外绘画存在的问题,提出全局蓝图引导的两阶段扩散框架,通过布局适配器生成蓝图并提取特征,并行合成局部补丁,实现高效合成与布局控制,提升视觉保真度、语义一致性并减少推理时间。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31077 2026-07-02 cs.CV 新提交 70%

AnyMatch: Supercharging Universal Multi-Modal Image Matching with Large-Scale Single-View Images

AnyMatch: 利用大规模单视图图像增强通用多模态图像匹配

Meng Yang, Zizhuo Li, Linfeng Tang, Fan Fan, Jiayi Ma

机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) School of Robotics, Wuhan University(武汉大学机器人学院)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出AnyMatch框架,利用单视图图像生成多模态训练数据,通过单目深度估计、3D重投影、扩散修复和跨模态图像翻译合成几何一致的多视图多模态图像对,构建大规模数据集Any-syn,显著提升多模态匹配网络的泛化性和鲁棒性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31204 2026-07-01 cs.CV 新提交 70%

AC3S: Adaptive Conditioning for 3D-Aware Synthetic Data Generation

AC3S: 面向3D感知合成数据生成的自适应条件控制

Eric Ji, Qiran Hu, Wufei Ma, Sarthak Jain, Yingying Li, Minh N. Do, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学) College of Engineering and Computer Science, VinUniversity(VinUniversity工程与计算机科学学院)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出AC3S框架,通过自适应条件控制模块调节ControlNet强度,结合多智能体视觉语言模型生成3D感知提示,实现高质量、结构对齐的合成图像生成。

Comments Accepted by ECCV 2026. Project page: https://ac3s.cvmlgroup.web.illinois.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22527 2026-06-23 cs.CV 新提交 70%

Trajectory Forcing: Structure-First Generation with Controllable Semantic Trajectories

轨迹强制:具有可控语义轨迹的结构优先生成

Merve Kocabas, Gege Gao, Bernhard Schölkopf, Andreas Geiger

机构 * University of Tübingen(图宾根大学) ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute(ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出轨迹强制框架,将生成过程组织为从全局布局到细节的语义阶段,每个阶段产生可解码的潜在状态,支持局部编辑,实现结构优先的可控图像合成。

Comments Project page: https://mervekocabas.github.io/TrajectoryForcing/

Journal ref Proceedings of the European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12012 2026-06-11 cs.CV 新提交 70%

FitVTON: Fit-aware Virtual Try-On via Body-Garment Size Control

FitVTON: 通过身体-服装尺寸控制实现合身感知的虚拟试穿

Yiqun Ning, Ao Shen, Chenhang He, Lei Zhang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Nuvatech

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 针对现有虚拟试穿忽略物理合身性的问题,提出FitVTON模型,通过结构化文本提示编码服装-身体尺寸,并引入辅助头预测服装和暴露身体掩膜,结合纹理校正阶段,在真实数据集FittingEffect3K上验证了尺寸准确性和形状保持的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05478 2026-08-07 cs.GR cs.CL cs.CV cs.HC cs.LG cs.MM 新提交 67%

GenGA: Editable and Data-Grounded Graphical Abstract Generation for Academic Papers

GenGA:面向学术论文的可编辑且基于数据的图形摘要生成

Takuro Kawada, Shunsuke Kitada, Hitoshi Iyatomi

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.GR、cs.MM

AI总结 GenGA是一种直接生成矢量格式图形摘要的框架,可实现便捷的元素级编辑,其编辑简易性优于传统方法,且在简洁性和语义对齐上超过人工生成的图形摘要,还提出了量化编辑简易性的SIC指标。

Comments 20 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏