arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 184 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 184 篇

2606.22945 2026-06-23 cs.GR cs.CV 新提交 86%

Controllable Texture Tiling with Transformed RoPE-Enhanced Diffusion Models

可控纹理平铺:基于变换RoPE增强扩散模型

Junrong Huang, Zhiyuan Zhang, Rui Tang, Hongbo Fu, Jnig Liao

机构 * City University of Hong Kong(香港城市大学) Manycore Tech Inc.(Manycore科技公司) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 可控生成 :diffusion(title,abstract);image editing(abstract);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 提出基于扩散变换器的可控纹理平铺框架,通过坐标变换旋转位置编码实现精确平铺控制,并利用分离注意力掩码保持参考纹理结构,同时与场景光照几何无缝融合。

Comments The code and dataset are publicly accessible at https://github.com/junrongh/ControlTile

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12829 2026-08-14 cs.CV 新提交 85%

Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers

语义引导用于可控生成:多模态扩散Transformer中的无调优概念擦除

Qiao Li, Xiaomeng Fu, Yuanshu Zhao, Qipeng Wang, Jiao Dai, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 可控生成 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 该研究针对MM-DiTs的安全风险,提出一种无调优的概念擦除方法,通过在MM-DiT中间模块构建引导向量注入模型,实现高效鲁棒的概念擦除,性能优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31147 2026-07-01 cs.CV 新提交 85%

WaterGen: Decoupling Scene and Medium in Underwater Image Generation

WaterGen:水下图像生成中的场景与介质解耦

Jiayi Wu, Tianfu Wang, Tianyi Xiong, Dehao Yuan, Xiaomin Lin, Md Jahidul Islam, Cornelia Fermuller, Christopher Metzler, Yiannis Aloimonos

机构 * University of Maryland(马里兰大学) University of South Florida(南佛罗里达大学) University of Florida(佛罗里达大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出WaterGen方法,通过解耦场景生成和介质建模,在潜在扩散框架下生成大规模、真实、多样的水下图像,提升下游恢复和分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06751 2026-08-10 cs.CV cs.AI 新提交 83%

Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text to Image Generation

超越《星夜》:面向艺术家基础的文本到图像生成的捷径感知控制状态规划

Kuan Xing, Ye Wang, Changyi Gan, Yuheng Li, Thao Nguyen, Yi Chang, Yilin Wang

机构 * Jilin University(吉林大学) Adobe(奥多比公司) University of Wisconsin(威斯康星大学)

专题命中 可控生成 :image generation(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 该研究针对艺术家基础的文本到图像生成存在的捷径偏差问题,提出 Atelier 框架,结合 ArtIntentBench 基准测试,提升了风格保真度与结构保留度,减少了捷径替换。

Comments 47 pages, 13 figures, including appendices. Kuan Xing and Ye Wang contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00083 2026-08-04 cs.CV 新提交 83%

Beyond Edge Maps: Wavelet-Domain Conditioning for Multi-Adapter Map-to-Satellite Diffusion

超越边缘图:面向多适配器地图到卫星扩散的小波域条件控制

Arisha Prasain

机构 * Tribhuvan University(特里布文大学) Pulchowk Engineering Campus(普尔乔克工程校区)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对资源匮乏地区卫星底图缺失问题,提出基于OSM栅格地图和SWT子带的多适配器ControlNet扩散框架,在尼泊尔数据集和Pix2Pix基准上验证了其合成卫星图像的有效性。

Comments 10 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04691 2026-07-07 cs.CV 新提交 83%

From Open Loop to Closed Loop: A Test-Time Iterative Optimization Framework for Reference-Consistent Image Generation

从开环到闭环:用于参考一致图像生成的测试时迭代优化框架

Baixuan Zhao, Xinyu Zhang, Huayu Zheng, Shuaicheng Liu, Xiongkuo Min, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) University of Electronic Science and Technology of China(电子科技大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出测试时迭代优化框架,将参考一致图像生成转为闭环动态跟踪问题,用改进PID算法驱动传感器-控制器架构,迭代优化潜在控制信号,该方法无训练、模型无关且与现有扩散管道无缝集成。

Comments 24 pages, 15 figures. Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22477 2026-06-23 cs.CV 新提交 83%

Physically-guided Image Generation for Multi-Projection Mapping

多投影映射的物理引导图像生成

Xingyun Liu, Yuqi Li, Jinhui Xiang, Pinyan Tang, Chong Wang

机构 * Ningbo University(宁波大学)

专题命中 可控生成 :image generation(title);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对投影映射中理想化2D生成与物理约束不匹配的问题,提出统一可控的物理引导生成框架ConPhyG,支持合作与对抗两种范式,通过注入多维物理先验或数值优化实现几何对齐、色域利用和语义保真度的显著提升。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07638 2026-06-09 cs.CV cs.AI 新提交 83%

Anchor-Conditioned Compositional Control for Landscape Image Generation

基于锚点条件的景观图像生成组合控制

Gadha Lekshmi P, Govind Arun, Rohith Syam, Ahmed Elgammal

机构 * Rutgers University–New Brunswick(罗格斯大学新布朗斯维克分校) University of Maryland–College Park(马里兰大学帕克分校) University of Technology Sydney(悉尼科技大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出锚点条件微调框架,通过解耦交叉注意力机制注入四维组合锚点向量,实现景观图像生成中的组合控制,在水平线检测和三分法对齐上取得最优性能。

Comments Accepted to the International Conference on Computational Creativity, ICCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23679 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 81%

Semantic Browsing: Controllable Diversity for Image Generation

语义浏览:图像生成的可控多样性

Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 可控生成 :image generation(title);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 针对文本到图像模型生成多样性不足且缺乏语义结构的问题,提出一种在文本层面引入多样性的方法,通过视觉语言模型和代理工作流实现用户可导航的语义变化空间。

Comments ECCV 2026. Project page: https://saradorfman1.github.io/SemanticBrowsing-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11884 2026-08-13 quant-ph cs.AI cs.CV 新提交 79%

CoQui: A Coordinate-Conditioned Quantum Implicit Generative Adversarial Network for End-to-End Image Generation

CoQui:用于端到端图像生成的坐标条件量子隐式生成对抗网络

Xue Yang, Rigui Zhou, ShiZheng Jia, Dax Enshan Koh, Siong Thye Goh, Young-Wook Cho, YaoChong Li, Xuezhi Ma, Hongyu Chen, Xin Wang

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本研究提出CoQui量子隐式生成对抗网络,通过坐标条件隐式函数学习解决现有QGAN的局限,在更少量子比特下于基准数据集实现优于FRQI、PQWGAN及经典基线的图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20924 2026-07-24 cs.CV 新提交 79%

MagicMakeup: A Region-Controllable Diffusion Transformer for High-Fidelity Makeup-Transfer

MagicMakeup:用于高保真妆容转移的区域可控扩散Transformer

Ziyi Wang, Siming Zheng, Yang Yang, Shusong Xu, Hao Zhang, Bo Li, Changqing Zou, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) vivo BlueImage Lab(vivo蓝图像实验室)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 研究妆容转移中区域可控性等难题,提出MagicMakeup框架,基于空间约束和概念解缠结,用令牌对齐区域门控和跨模态感知指导实现精确编辑与概念澄清,设计数据生成管道并建立基准,提升了多方面性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16409 2026-07-21 cs.CV cs.AI cs.LG 新提交 79%

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models

思考、规划、绘制:统一模型中用于可控图像生成的布局感知推理

Junhao Liu, Jian-Wei Zhang, Tao Huang, Miles Yang, Zhao Zhong, Liefeng Bo

机构 * Tencent(腾讯) Peking University(北京大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 研究针对统一多模态大语言模型在可控图像生成中难以遵循复杂空间指令的问题,提出ATLAS框架,采用“思考、规划、绘制”范式及布局共享表示,经强化学习提升性能,在图像生成等任务中效果显著,还支持相关编辑与多模态基础,并引入评估基准。

Comments 22 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16286 2026-07-21 cs.CV cs.AI cs.LG 新提交 79%

Depth Estimators Are Implicit Neural Fields for 3D Scene Geometry Inpainting and Reconstruction

深度估计器是用于3D场景几何修复和重建的隐式神经场

Yingzhao Jian, Zihao Lin, Hehe Fan

机构 * College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院)

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

AI总结 针对现实世界场景数据3D几何不完整问题,提出神经深度场(NDF),将深度估计器视为场景级隐式场解决问题,通过单测试时优化实现,实验表明其在3D场景几何修复中性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04303 2026-07-07 cs.CV 新提交 79%

AquaStereo: Enabling Underwater Stereo Matching via Depth-Conditioned Diffusion and Geometry Self-Distillation

AquaStereo:通过深度条件扩散和几何自蒸馏实现水下立体匹配

Qizhe Wei, Yingping Liang, Shaodi You, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 针对水下立体匹配中数据稀缺和特征退化问题,提出AquaStereo框架。用深度条件扩散渲染水下立体对,结合自蒸馏策略,提升水下立体匹配的鲁棒性和零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31918 2026-07-03 cs.CV 新提交 79%

DriveWeaver: Point-Conditioned Video Inpainting for Controllable Vehicle Insertion in Autonomous Driving Simulation

DriveWeaver: 基于点云条件的视频修复用于自动驾驶仿真中的可控车辆插入

Junzhe Jiang, Zipei Ma, Zijie Pan, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV

AI总结 提出DriveWeaver框架,通过点云条件视频修复实现自动驾驶仿真中可控车辆插入,解决光照不一致和3D资产依赖问题,支持大规模场景增强。

Comments Accepted at ECCV 2026, Project Page: https://github.com/LogosRoboticsGroup/DriveWeaver

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00609 2026-07-02 cs.CV 新提交 79%

Diffusion-Based Multi-Class Normality for OOD Detection: An Application to CDP Authentication

基于扩散的多类正态性用于OOD检测:在CDP认证中的应用

Bolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim-Junior

机构 * CNRS(法国国家科学研究中心) INSA Lyon(里昂国立应用科学学院) LIRIS, UMR 5205(LIRIS实验室,UMR 5205)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出扩散多类正态性框架,用单一条件ControlNet训练于多类真实CDP,通过重构误差检测伪造,并引入双模板掩码提升性能。

Comments IEEE International Conference on Advanced Visual And Signal-Based Systems, Aug 2026, Lecce, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31924 2026-07-01 cs.CV 新提交 79%

InstanceControl: Controllable Complex Image Generation without Instance Labeling

InstanceControl: 无需实例标注的可控复杂图像生成

Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) HUAWEI Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 提出InstanceControl方法,利用视觉语言模型自动建立文本与视觉条件间的实例对应,无需人工标注,通过自适应掩码细化策略实现复杂多实例场景的精确可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31537 2026-07-01 cs.CV cs.MA 新提交 79%

DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation

DataEvolver: 面向文本丰富图像生成的自我进化多智能体数据构建

Siyu Yan, Yizhen Gao, Yilin Wang, Dongxing Mao, Alex Jinpeng Wang

机构 * Central South University(中南大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 提出DataEvolver,一种自我进化的多智能体框架,通过反馈驱动策略迭代优化数据构建,显著提升文本丰富图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15889 2026-06-16 cs.CV 新提交 79%

SiGnature: Explicit Motion Diffusion for Stylized Semantic Gesture

SiGnature: 显式运动扩散用于风格化语义手势

Adi Rosenthal, Tomer Koren, Nadav Shaked, Doron Friedman, Ariel Shamir

机构 * Reichman University(赖希曼大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出SiGnature框架,通过显式关节旋转空间和免训练推理机制JMI,实现语义手势的精准控制与说话人风格的高保真保持,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09699 2026-06-09 cs.CV 新提交 79%

Cranio-Diff: Diffusion-based Cross-domain Craniofacial Reconstruction with 2D X-ray Skull Guidance and Structural Identity Constraints

Cranio-Diff: 基于扩散的跨模态颅面重建,利用二维X射线颅骨引导和结构身份约束

Ravi Shankar Prasad, Naresh Gurjar, Shashank Baghel, Chirag, Dinesh Singh

机构 * Indian Institute of Technology Mandi(印度理工学院曼迪分校) CSVTU Bhilai(恰蒂斯加尔邦斯瓦米·维韦卡南达技术大学比莱分校)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Cranio-Diff扩散框架,通过ControlNet的颅骨条件结构引导和生物特征文本条件,从2D X射线颅骨图像重建跨模态人脸,解决结构身份对齐问题,在120名受试者的颅面数据集上优于现有方法。

Comments 14 pages, 7 figures, BMVC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18637 2026-07-22 cs.RO cs.LG 新提交 78%

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

用于逼真且可控的视觉交通场景生成的端到端条件扩散

Jingzheng Li, Yufei Ge, Zhijun Chen, Qianren Mao, Zizhe Wang, Binhang Qi, Bing Li, Keyu Chen, Baochang Zhang, Xianglong Liu, Philip S Yu

机构 * Zhongguancun Laboratory(中关村实验室) Tianjin University(天津大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) State Key Laboratory of Software Development Environment(软件开发环境国家重点实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 研究如何生成逼真且可控的视觉交通场景,提出端到端条件扩散框架E2E-CDiff,基于前视图视觉观察联合去噪未来运动状态等,减轻规划控制不匹配,实验表明其在可控性与逼真性权衡上表现良好,还能引发挑战性交互,作为自我规划器有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10243 2026-07-14 cs.RO cs.SY eess.SY 新提交 78%

Diffusion-Residual Model Predictive Steering Control for Vehicle Stabilization at the Limit of Handling under Model Uncertainty

模型不确定性下车辆极限操控时基于扩散残差模型预测的转向控制实现车辆稳定

Bongsob Song

机构 * Ajou University(韩国亚洲大学)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 研究在模型不确定性下车辆极限操控时的稳定问题,核心方法是用条件扩散残差模型学习不确定性并应用于控制器参考值和约束,主要贡献是降低峰值侧滑、恢复低摩擦操控方向稳定性,且算法运行高效。

Comments 16 pages, 6 figures, 7 tables. Submitted to IEEE Transactions on Control Systems Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16345 2026-06-16 math.OC cs.SY eess.SY 新提交 78%

Output-Feedback Boundary Control of Reaction--Diffusion PDEs on Arbitrary Lipschitz Domains: A Target-Domain Approach

任意Lipschitz域上反应-扩散PDE的输出反馈边界控制:一种目标域方法

Rafael Vazquez

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出一种域扩展框架,通过将不规则域嵌入已知稳定设计的目标域(如球或矩形),实现任意有界Lipschitz域上反应-扩散方程的输出反馈边界镇定,并保证适定性和指数稳定性。

Comments Preprint submitted to IEEE Transactions on Automatic Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08946 2026-06-16 stat.CO physics.chem-ph physics.comp-ph 新提交 78%

A Diffusion Monte Carlo algorithm employing depth first traversal and a stack instead of a swarm

一种采用深度优先遍历和栈而非群体的扩散蒙特卡罗算法

Bastiaan J. Braams

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出基于深度优先遍历和栈的扩散蒙特卡罗算法(DMCD),通过栈管理分裂历史,相比传统广度优先群体方法更节省内存,并统一了特征值问题与线性方程问题的算法处理。

Comments 12 pages. The code in the original (v1) Arxiv submission could randomly get trapped in a cycle where the same walker is all the time restarted with ever decreasing weight. The issue is described and addressed in this (v2) submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15819 2026-06-16 cs.CV cs.AI 新提交 77%

SACE: Concept Erasure at the Semantic Singularity in Visual Autoregressive Models

SACE: 视觉自回归模型中的语义奇点概念擦除

Siya Yang, Nanxiang Jiang, Zhaoxin Fan, Yunfeng Diao

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对视觉自回归模型应用现有擦除技术导致语义崩溃和视觉伪影的问题,提出语义奇点公理并通过增量语义显著性分析验证,进而引入首个尺度感知的概念擦除框架SACE,在首尺度耦合熵正则化擦除目标与恢复性保存损失,实现精确概念擦除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14025 2026-06-15 cs.CV 新提交 77%

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

GarmentSketch:大规模草图到时尚基准

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。

Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06601 2026-06-08 cs.CV cs.AI cs.LG 新提交 77%

Direct 3D-Aware Object Insertion via Decomposed Visual Proxies

通过分解视觉代理实现直接3D感知物体插入

Jingbo Gong, Yikai Wang, Yushi Lan, Yuhao Wan, Ziheng Ouyang, Rui Zhao, Ming-Ming Cheng, Qibin Hou, Chen Change Loy

机构 * Google(谷歌) Black Forest Labs(黑森林实验室)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出DIRECT框架,通过分解外观、几何和上下文引导,实现可控制3D姿态的物体插入,在几何可控性和视觉质量上优于现有方法。

Comments ICML 2026; Project Page: https://gong1130.github.io/DIRECT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08741 2026-07-10 cs.GR cs.CV cs.LG cs.RO 新提交 76%

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

ARDY:用于交互式人体运动生成的具有混合表示的自回归扩散

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

机构 * NVIDIA(英伟达) ETH Zürich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(title);分类 cs.CV、cs.GR

AI总结 研究旨在解决交互式应用中人体运动生成问题,提出ARDY框架,采用混合表示和两阶段自回归变压器去噪器,能通过在线文本提示和运动学约束实现高保真运动生成,经评估验证了有效性和实用性。

Comments ACM Transactions on Graphics (SIGGRAPH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09357 2026-08-11 cs.CV 新提交 74%

ControlRadio: Prompt-Driven Controllable Diffusion for Cross-Modal Radio Map Generation

ControlRadio:用于跨模态无线电地图生成的提示驱动可控扩散模型

Kangjun Liu, Xiying Pan, Shuhang Zhang, Xiang Xiang, Ke Chen, Yaowei Wang

机构 * Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Peking University(北京大学) Huazhong University of Science and Technology(华中科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 可控生成 :diffusion(title);分类 cs.CV

AI总结 ControlRadio是一种可控生成框架,可根据自然语言描述和环境布局生成无线电地图,在不同城市场景中精度和泛化能力领先,计算时间较传统方法减少四个数量级以上,为无线环境建模提供新范式。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26016 2026-07-09 cs.CV 新提交 74%

MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation

MIMFlow:将掩码图像建模与归一化流集成用于端到端图像生成

Yang Chen, Xiaowei Xu, Shuai Wang, Xinwen Zhang, Qiushi Guo, Tiezheng Ge, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Alibaba Group(阿里巴巴集团) Shanghai AI Lab(上海人工智能实验室)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 提出MIMFlow框架,通过VAE编码器从掩码图像推断语义潜在变量,使归一化流专注于低频语义流形,解码器处理高频合成,解决NF容量瓶颈,在ImageNet 256×256上达到71.3%线性探测精度和2.50 FID。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏