arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2603.12261 2026-06-11 cs.LG cs.AI cs.CV 版本更新 70%

The Latent Color Subspace: Emergent Order in High-Dimensional Chaos

潜在颜色子空间:高维混沌中的涌现秩序

Mateusz Pach, Jessica Bader, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文揭示了FLUX.1变分自编码器潜在空间中颜色表示的HSL结构,并提出一种无需训练的闭式潜在空间操作方法,实现对生成图像颜色的预测与显式控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00967 2026-06-09 cs.CV 版本更新 70%

MedSyn2: Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts

通过文本和语义定义的分割提示灵活控制3D CT生成

Weicheng Dai, Chenyu Wang, Binxu Li, Shantanu Ghosh, Afrooz Zandifar, Christina LeBedis, Kayhan Batmanghelich

机构 * Boston University School of Engineering(波士顿大学工程学院) Stanford University(斯坦福大学) University of Pittsburgh Medical Center(匹兹堡大学医学中心) Boston University School of Medicine(波士顿大学医学院)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一种灵活的多模态框架,通过文本和可选分割提示控制3D CT生成,实现高分辨率、解剖一致且可控的体数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20329 2026-06-05 cs.CV cs.AI 70%

Image Generators are Generalist Vision Learners

图像生成器是通用视觉学习者

Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut

机构 * Google(谷歌)

专题命中 可控生成 :image generation(abstract);generative vision(abstract);分类 cs.CV

AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。

Comments Project Page: http://vision-banana.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30904 2026-06-01 cs.CV 70%

MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

MergeTok: 通过令牌合并实现统一连续和离散视觉令牌化

Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wang

机构 * Tsinghua University(清华大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学) OPPO Shanghai AI Lab(上海人工智能实验室)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出MergeTok统一令牌化器,通过令牌合并技术联合优化连续VAE和离散VQ令牌化器,实现高保真重建与语义可控离散表示的兼顾。

Comments 11 pages (main text), 7 figures. Preprint. Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08555 2026-05-28 cs.CV 70%

VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning

VideoCanvas: 通过上下文条件化从任意时空补丁进行统一视频补全

Minghong Cai, Qiulin Wang, Zongli Ye, Wenze Liu, Quande Liu, Weicai Ye, Xintao Wang, Pengfei Wan, Kun Gai, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手技术有限公司Kling团队)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出VideoCanvas框架,通过混合条件化策略(空间上使用零填充全帧画布编码,时间上使用Temporal RoPE插值)实现任意时空视频补全的统一任务,无需修改或重新训练VAE。

Comments Project page: https://onevfall.github.io/project_page/videocanvas

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14799 2026-05-27 cs.CV cs.CR cs.SI 70%

Can Visual Mamba Improve AI-Generated Image Detection? An In-Depth Investigation

视觉Mamba能否提升AI生成图像检测?一项深入研究

Mamadou Keita, Wassim Hamidouche, Hessen Bougueffa Eutamene, Abdelmalik Taleb-Ahmed, Xianxun Zhu, Abdenour Hadid

机构 * Laboratory of IEMN, CNRS, Centrale Lille, UMR 8520, Univ. Polytechnique Hauts-de-France(伊姆纳实验室,国家科学研究中心,里尔中央理工大学,UMR 8520,法国高等技术大学) Khalifa University(卡利法大学) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi(索邦人工智能中心,索邦大学阿布扎克分校)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究系统评估了Vision Mamba模型在AI生成图像检测中的性能,与CNN、ViT和VLM检测器进行对比,分析了准确性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19117 2026-05-26 cs.CV 70%

PrITTI: Primitive-based Generation of Controllable and Editable 3D Semantic Urban Scenes

PrITTI: 基于基元的可控可编辑3D语义城市场景生成

Christina Ourania Tze, Daniel Dauner, Yiyi Liao, Dzmitry Tsishkou, Andreas Geiger

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Zhejiang University(浙江大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) KE:SAI - Kyutai ELLIS Scalable Autonomous Intelligence(KE:SAI - 韩国ELLIS可扩展自主智能)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出PrITTI,一种利用矢量化对象基元和栅格化地面表面的混合表示,通过潜在扩散模型实现高质量、可控且可编辑的3D语义城市场景生成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19554 2026-05-20 cs.CV 70%

Self-Creative Text-to-Object Generation using Semantic-Aware Spatial Weighting

基于语义感知空间加权的自创文本到物体生成

Yue Yu, Haibo Chen, Shuo Chen, Jian Yang, Jun Li

机构 * Nanjing University of Science and Technology(南京理工大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种自创扩散模型SCDiff,通过学习空间加权模块和视觉-语义混合损失模块,提升文本到图像生成的创意性和语义对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01248 2026-05-11 cs.CV 70%

NS-Net: Decoupling CLIP Semantic Information through NULL-Space for Generalizable AI-Generated Image Detection

NS-Net:通过NULL空间解耦CLIP语义信息以实现通用的AI生成图像检测

Jiazhen Yan, Fan Wang, Weiwei Jiang, Ziqiang Li, Zhangjie Fu

机构 * Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(数字取证工程研究中心,教育部,南京信息科技大学) University of Macau(澳门大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出NS-Net,通过NULL空间投影解耦CLIP视觉特征中的语义信息,结合对比学习捕捉真实与生成图像的分布差异,提升AI生成图像检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18875 2026-05-08 cs.CV 70%

Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation

稀疏视频生成2:通过语义感知排列加速视频生成

Shuo Yang, Haocheng Xi, Yilong Zhao, Muyang Li, Jintao Zhang, Han Cai, Yujun Lin, Xiuyu Li, Chenfeng Xu, Jianfei Chen, Song Han, Kurt Keutzer, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) MIT(麻省理工学院) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 可控生成 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SVG2框架,通过语义感知排列提升视频生成的准确性和效率,实现生成质量与效率的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24459 2026-04-28 cs.CV 70%

TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering

TextGround4M:一种对齐提示的布局感知文本渲染数据集

Dongxing Mao, Yilin Wang, Linjie Li, Zhengyuan Yang, Alex Jinpeng Wang

机构 * Central South University(中南大学) Zhejiang University(浙江大学) Microsoft Research(微软研究院)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出TextGround4M数据集,通过细粒度布局监督提升文本生成的准确性,引入轻量训练策略和布局评估指标,验证了布局感知在文本到图像生成中的重要性。

Comments aaai poster; Project page: https://dongxingmao.github.io/TextGround4M.github.io/

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, vol. 40, no. 10, pp. 7918-7926, Mar. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23540 2026-04-28 cs.CV 70%

Oracle Noise: Faster Semantic Spherical Alignment for Interpretable Latent Optimization

Oracle Noise: 更快的语义球面对齐用于可解释的潜在优化

Haosen Li, Wenshuo Chen, Lei Wang, Shaofeng Liang, Haozhe Jia, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Griffith University & Data61/CSIRO(格里菲斯大学及Data61/CSIRO)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Oracle Noise框架,通过将噪声初始化重新定义为语义驱动的优化,严格限制在黎曼流形上,以提升文本到图像扩散模型的语义对齐效率和图像质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15829 2026-04-20 cs.CV cs.CR 70%

Beyond Text Prompts: Precise Concept Erasure through Text-Image Collaboration

超越文本提示:通过文本图像协作实现精确概念消除

Jun Li, Lizhi Xiong, Ziqiang Li, Weiwei Jiang, Zhangjie Fu, Yong Li, Guo-Sen Xie

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) Southeast University(东南大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出TICoE框架,通过连续凸概念流形和分层视觉表征学习,实现精确且忠实的概念消除,同时保留无关语义和视觉内容,并引入基于保真度的评估策略,实验表明其在概念消除精度和内容保真度上优于现有方法。

Comments 25 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19840 2026-04-20 cs.CV 70%

GenHSI: Controllable Generation of Human-Scene Interaction Videos

GenHSI: 可控生成人类-场景交互视频

Zekun Li, Rui Zhou, Rahul Sajnani, Xiaoyan Cong, Daniel Ritchie, Srinath Sridhar

机构 * Brown University(布朗大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 GenHSI提出一种无需训练的可控生成长人类-场景交互视频方法,通过剧本写作、预可视化和动画三阶段生成3D-aware视频,保留人物身份并提供合理交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13938 2026-04-16 cs.CV 70%

ASTRA: Enhancing Multi-Subject Generation with Retrieval-Augmented Pose Guidance and Disentangled Position Embedding

ASTRA:通过检索增强的姿势引导和解纠缠位置嵌入增强多主体生成

Tianze Xia, Zijian Ning, Zonglin Zhao, Mingjia Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 ASTRA通过检索增强的姿势引导和解纠缠位置嵌入,解决多主体生成中身份与姿势结构的分离问题,提升姿态一致性和身份保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12622 2026-04-15 cs.CV cs.AI cs.NI 70%

Efficient Semantic Image Communication for Traffic Monitoring at the Edge

边缘交通监控中的高效语义图像通信

Damir Assylbek, Nurmukhammed Aitymbetov, Marko Ristin, Dimitrios Zorbas

机构 * Nazarbayev University, School of Engineering & Digital Sciences(纳扎尔拜耶夫大学工程与数字科学学院) Zurich University of Applied Sciences (ZHAW)(苏黎世应用科学大学(ZHAW))

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出MMSD和SAMR两种语义图像通信管道,通过压缩和加密实现高效传输,同时保持视觉信息。MMSD用语义表示替代原始图像,SAMR通过语义重要性选择性抑制区域,两者均采用边缘轻量处理与服务器重计算的异构架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05761 2026-04-08 cs.CV 70%

Improving Controllable Generation: Faster Training and Better Performance via $x_0$-Supervision

提升可控生成:通过$x_0$监督实现更快训练和更好性能

Amadou S. Sangare, Adrien Maglo, Mohamed Chaouch, Bertrand Luvison

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,法国原子能委员会,信息与系统实验室)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文通过分析去噪动态,提出$x_0$监督方法,提升可控扩散模型的收敛速度和生成质量,实验显示收敛速度提升2倍,视觉质量和条件准确性均得到改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08277 2026-03-30 cs.CV cs.AI 70%

PISCO: Precise Video Instance Insertion with Sparse Control

PISCO:具有稀疏控制的精确视频实例插入

Xiangbo Gao, Renjie Li, Xinghao Chen, Yuheng Wu, Suofei Feng, Qing Yin, Zhengzhong Tu

机构 * Stanford University(斯坦福大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出PISCO模型,通过稀疏关键帧控制实现精确视频实例插入,解决传统视频编辑中对空间时间定位、物理一致性及动态保持的挑战,采用变量信息引导和分布保持时间遮罩技术提升生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24078 2026-03-26 cs.CV 70%

PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generation

PosterIQ: 一份面向海报理解和生成的设计视角基准

Yuheng Feng, Wen Zhang, Haodong Duan, Xingxing Zou

机构 * The Hong Kong Polytechnic University(香港理工大学) Snapchat Inc.(Snapchat公司) ByteDance Seed(字节跳动种子)

专题命中 可控生成 :diffusion(abstract);generative vision(abstract);分类 cs.CV

AI总结 PosterIQ 是一个设计驱动的海报理解与生成基准,包含7765个图像注释实例和822个生成提示,评估了最先进的MLLMs和扩散生成器,揭示了视觉层次、字体语义等领域的差距。

Comments CVPR 2026, Project Page: https://github.com/ArtmeScienceLab/PosterIQ-Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12793 2026-03-16 cs.CV cs.AI 70%

Cheers: Decoupling Patch Details from Semantic Representations Enables Unified Multimodal Comprehension and Generation

Cheers:解耦补丁细节与语义表示以实现统一的多模态理解和生成

Yichen Zhang, Da Peng, Zonghao Guo, Zijian Zhang, Xuesong Yang, Tong Sun, Shichu Sun, Yidan Zhang, Yanghao Li, Haiyan Zhao, Wang Xu, Qi Shi, Yangang Sun, Chi Chen, Shuo Wang, Yukun Yan, Xu Han, Qiang Ma, Wei Ke, Liang Wang, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 Cheers通过解耦补丁细节与语义表示,实现统一的多模态理解和生成,提升图像生成的保真度,并在多个基准测试中表现优异,同时实现4倍的token压缩效率。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17558 2026-02-20 cs.CV 70%

RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward

RetouchIQ: 基于指令的图像修复MLLM代理与通用奖励模型

Qiucheng Wu, Jing Shi, Simon Jenni, Kushal Kafle, Tianyu Wang, Shiyu Chang, Handong Zhao

机构 * Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 RetouchIQ通过通用奖励模型提升指令基于图像编辑的语义一致性和感知质量,展现灵活可解释的编辑能力。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16664 2026-02-19 cs.CV 70%

Unpaired Image-to-Image Translation via a Self-Supervised Semantic Bridge

无配对图像到图像翻译的自监督语义桥

Jiaming Liu, Felix Petersen, Yunhe Gao, Yabin Zhang, Hyojin Kim, Akshay S. Chaudhari, Yu Sun, Stefano Ermon, Sergios Gatidis

机构 * Stanford University(斯坦福大学) LLNL(劳伦斯利弗莫尔国家实验室) Johns Hopkins University(约翰霍普金斯大学)

专题命中 可控生成 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出自监督语义桥框架,通过整合外部语义先验实现无配对图像到图像翻译的高保真度,提升医学图像合成效果。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11000 2026-02-13 cs.CV 70%

ContextGen: Contextual Layout Anchoring for Identity-Consistent Multi-Instance Generation

ContextGen: 基于情境布局锚定的多实例生成

Ruihang Xu, Dewei Zhou, Fan Ma, Yi Yang

机构 * ReLER Lab, CCAI, Zhejiang University(ReLER实验室、中国计算机学会、浙江大学)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 ContextGen通过情境布局锚定和身份一致性注意力机制,实现多实例生成中的布局控制与身份一致性,首次构建了IMIG-100K数据集并取得新突破。

Comments Project Page: https://nenhang.github.io/ContextGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11440 2026-02-13 cs.CV 70%

Ctrl&Shift: High-Quality Geometry-Aware Object Manipulation in Visual Generation

Ctrl&Shift: 视觉生成中高质量的几何感知物体操控

Penghui Ruan, Bojia Zi, Xianbiao Qi, Youze Huang, Rong Xiao, Pichao Wang, Jiannong Cao, Yuhui Shi

机构 * The Hong Kong Polytechnic University(香港理工大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) IntelliFusion Inc.(IntelliFusion公司) University of Electronic Science and Technology of China(电子科技大学) NVIDIA

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 Ctrl&Shift通过端到端扩散框架实现高质量几何感知物体操控,无需显式3D建模,兼顾细粒度控制与现实泛化能力。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22961 2026-02-02 cs.CV 70%

Improving Supervised Machine Learning Performance in Optical Quality Control via Generative AI for Dataset Expansion

通过生成式人工智能扩展数据集以提升光学质量控制中的监督机器学习性能

Dennis Sprute, Hanna Senke, Holger Flatt

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文通过生成式人工智能扩展数据集,提升光学质量控制中监督机器学习的性能,使用Stable Diffusion实现4.6%的分割性能提升。

Comments Accepted at 19th CIRP Conference on Intelligent Computation in Manufacturing Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19433 2026-01-28 cs.CV 70%

RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming

RoamScene3D: 通过自适应物体感知漫游实现沉浸式文本到3D场景生成

Jisheng Chu, Wenrui Li, Rui Zhao, Wangmeng Zuo, Shifeng Chen, Xiaopeng Fan

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Nanyang Technological University(南洋理工大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 RoamScene3D通过自适应物体感知漫游实现沉浸式文本到3D场景生成,结合语义推理和几何约束提升场景一致性与逼真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17673 2026-01-27 cs.CV cs.AI 70%

Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing

Uni-RS: 一种用于遥感的具有空间忠实性的统一理解和生成模型

Weiyu Zhang, Yuan Hu, Yong Li, Yu Liu

机构 * Institute of Remote Sensing and Geographic Information System, School of Earth and Space Sciences, Peking University(遥感与地理信息系统研究所,地球与空间科学学院,北京大学) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(土木与环境工程系,香港科学与技术大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Uni-RS通过空间布局规划、空间感知查询监督和图像描述空间布局变化,提升遥感文本到图像生成的空间忠实性,同时保持多模态理解任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23245 2026-01-05 cs.CV 70%

ASemConsist: Adaptive Semantic Feature Control for Training-Free Identity-Consistent Generation

ASemConsist: 基于自适应语义特征控制的无训练身份一致生成

Shin Seong Kim, Minjung Shin, Hyunin Cho, Youngjung Uh

机构 * Yonsei University(延世大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 ASemConsist通过自适应语义特征控制实现无训练身份一致生成,提升文本到图像生成的一致性和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22984 2025-12-30 cs.CV 70%

Reverse Personalization

反向个性化

Han-Wei Kung, Tuomas Varanka, Nicu Sebe

机构 * University of Trento(特伦托大学) University of Oulu(奥卢大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出反向个性化框架,通过条件扩散反向技术实现面部匿名化,支持属性可控的匿名化,平衡身份移除、属性保留和图像质量。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22653 2025-12-30 cs.CV 70%

Visual Autoregressive Modelling for Monocular Depth Estimation

单目深度估计的视觉自回归建模

Amir El-Ghoussani, André Kaup, Nassir Navab, Gustavo Carneiro, Vasileios Belagiannis

机构 * Friedrich-Alexander University Erlangen-Nuremberg, Germany(埃朗根-纽伦堡弗里德里希-亚历山大大学) Technical University of Munich, Germany(慕尼黑技术大学) University of Surrey, United Kingdom(萨里大学)

专题命中 可控生成 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出基于视觉自回归先验的单目深度估计方法,通过自回归阶段和分类器自由引导实现高效深度估计,适用于室内和户外场景。

详情

展开后加载摘要…

URL PDF HTML 收藏