arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4210 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4210 篇

2601.14207 2026-03-03 cs.GR cs.CV 62%

Copy-Trasform-Paste: Zero-Shot Object-Object Alignment Guided by Vision-Language and Geometric Constraints

复制-变换-粘贴:由视觉-语言和几何约束引导的零样本物体-物体对齐

Rotem Gatenyo, Ohad Fried

机构 * Reichman University(雷查曼大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种基于视觉-语言和几何约束的零样本物体-物体对齐方法,通过可微分渲染器优化相对姿态,实现语义忠实且物理合理的3D对齐。

Comments GitHub Page: https://rotemgat.github.io/CopyTransformPaste/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20367 2026-02-18 cs.GR cs.CV 62%

DreamAnywhere: Object-Centric Panoramic 3D Scene Generation

DreamAnywhere: 基于对象的全景3D场景生成

Edoardo Alberto Dominici, Jozef Hladky, Floor Verhoeven, Lukas Radl, Thomas Deixelberger, Stefan Ainetter, Philipp Drescher, Stefan Hauswiesner, Arno Coomans, Giacomo Nazzaro, Konstantinos Vardis, Markus Steinberger

机构 * Huawei Technologies(华为技术有限公司) Graz University of Technology(格拉茨技术大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

AI总结 DreamAnywhere通过模块化系统实现快速生成和原型设计3D场景,提升新视角合成的连贯性并实现高质量图像输出。

Comments WACV 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14841 2026-02-18 cs.GR cs.CV 62%

Towards Geometric and Textural Consistency 3D Scene Generation via Single Image-guided Model Generation and Layout Optimization

面向几何与纹理一致性的单图像引导模型生成与布局优化的3D场景生成

Xiang Tang, Ruotong Li, Xiaopeng Fan

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Suzhou Research Institute(哈尔滨工业大学苏州研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

AI总结 本文提出一种三阶段框架,通过单图像引导的模型生成和空间布局优化,实现具有高几何准确性和纹理保真的3D场景生成。

Comments 14 pages, 9 figures, Project page: https://xdlbw.github.io/sing3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06101 2026-02-09 eess.IV cs.CV cs.MM 62%

ALIEN: Analytic Latent Watermarking for Controllable Generation

ALIEN: 基于可控生成的分析潜在水印

Liangqi Lei, Keke Gai, Jing Yu, Qi Wu

机构 * Beijing Institute of Technology, Beijing, China(北京理工大学) School of Information Engineering, Minzu University of China, Beijing, China(中国民族大学信息工程学院) School of Computer Science, The University of Adelaide, Adelaide, Australia(阿德莱德大学计算机科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 ALIEN提出了一种基于可控生成的分析潜在水印方法,通过时间依赖调节系数实现可控的水印嵌入,实验结果显示其在多个质量指标和鲁棒性方面均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05013 2026-02-06 cs.GR cs.CV 62%

Untwisting RoPE: Frequency Control for Shared Attention in DiTs

解开RoPE:多模态和共享注意力中的频率控制

Aryan Mikaeili, Or Patashnik, Andrea Tagliasacchi, Daniel Cohen-Or, Ali Mahdavi-Amiri

机构 * Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) University of Toronto(多伦多大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文通过分析RoPE的频率结构,提出方法调节RoPE频率带以实现更符合语义的共享注意力,从而有效控制风格迁移与内容复制的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03826 2026-02-04 cs.CV cs.GR 62%

Continuous Control of Editing Models via Adaptive-Origin Guidance

通过自适应起源引导实现编辑模型的连续控制

Alon Wolf, Chen Katzir, Kfir Aberman, Or Patashnik

机构 * Tel Aviv University, Decart.ai(特拉维夫大学,Decart.ai) Tel Aviv University(特拉维夫大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出AdaOr方法,通过自适应调整指导起源实现编辑模型的连续强度控制,提升编辑过程的平滑性和一致性。

Comments Project page at https://adaor-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06279 2026-01-30 cs.CV cs.AI cs.GR cs.MA 62%

NoiseNCA: Noisy Seed Improves Spatio-Temporal Continuity of Neural Cellular Automata

NoiseNCA: 噪声种子提升神经细胞自动机的时空连续性

Ehsan Pajouheshgar, Yitao Xu, Sabine Süsstrunk

机构 * School of Computer and Communication Sciences, EPFL, Switzerland(计算机与通信科学学院,瑞士联邦理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 NoiseNCA通过引入噪声种子提升神经细胞自动机的时空连续性,实现对模式形成速度和尺度的连续控制,拓展了NCA在动态系统中的应用。

Comments 9 pages, 12 figures

Journal ref ALIFE 2024: Proceedings of the 2024 Artificial Life Conference July 22-26, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18451 2026-01-27 cs.CV cs.AI cs.LG cs.MM cs.SD 62%

3DGesPolicy: Phoneme-Aware Holistic Co-Speech Gesture Generation Based on Action Control

3DGesPolicy: 基于动作控制的音素感知整体语义手势生成

Xuanmeng Sha, Liyun Zhang, Tomohiro Mashita, Naoya Chiba, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Osaka Electro-Communication University(大阪电讯大学) Osaka University(大阪大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 3DGesPolicy通过基于动作控制的框架,结合音素感知和多模态信号融合,实现了更自然且高度语音对齐的整体语义手势生成。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16869 2026-01-21 cs.GR cs.CV 62%

Controllable Video Generation: A Survey

可控视频生成:综述

Yue Ma, Kunyu Feng, Zhongyuan Hu, Xinyu Wang, Yucheng Wang, Mingzhe Zheng, Bingyuan Wang, Qinghe Wang, Xuanhua He, Hongfa Wang, Chenyang Zhu, Hongyu Liu, Yingqing He, Zeyu Wang, Zhifeng Li, Xiu Li, Sirui Han, Yike Guo, Wei Liu, Dan Xu, Linfeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology(Guang Zhou)(香港科技大学(广州)) Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Tencent(腾讯)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文综述了可控视频生成领域,探讨了视频扩散模型中的控制机制及不同控制信号类型的方法分类。

Comments project page: https://github.com/mayuelala/Awesome-Controllable-Video-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04634 2025-12-03 cs.GR cs.AI cs.CV cs.LG 62%

Walk Before You Dance: High-fidelity and Editable Dance Synthesis via Generative Masked Motion Prior

先走再跳舞:通过生成性遮蔽动作先验实现高保真可编辑舞蹈合成

Foram N Shah, Parshwa Shah, Muhammad Usama Saleem, Ekkasit Pinyoanuntapong, Pu Wang, Hongfei Xue, Ahmed Helmy

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

AI总结 本研究提出一种生成性遮蔽动作先验模型,实现高保真且可编辑的舞蹈合成,通过多塔结构提升动作生成质量与编辑能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12168 2025-12-02 cs.CV cs.GR 62%

Sketch-guided Cage-based 3D Gaussian Splatting Deformation

基于草图的基于笼子的3D高斯点扩散变形

Tianhao Xie, Noam Aigerman, Eugene Belilovsky, Tiberiu Popa

机构 * Concordia University(康科德大学) Université de Montréal(蒙特利尔大学) Mila(Mila研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种基于草图的3D GS变形系统,结合笼子变形与神经雅可比场,实现对3D模型几何的精细控制,并通过实验展示其在静态模型动画化中的应用。

Comments 10 pages, 9 figures, accepted at WACV 26, project page: https://tianhaoxie.github.io/project/gs_deform/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21146 2025-11-27 cs.MM cs.CV cs.SD 62%

AV-Edit: Multimodal Generative Sound Effect Editing via Audio-Visual Semantic Joint Control

AV-Edit: 通过音频-视觉语义联合控制实现多模态生成式声音效果编辑

Xinyue Guo, Xiaoran Yang, Lipan Zhang, Jianxuan Yang, Zhao Wang, Jian Luan

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 AV-Edit通过联合利用视觉、音频和文本语义,实现多模态生成式声音效果编辑,提升音频编辑的精度和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12935 2025-11-19 cs.CV cs.AI cs.GR 62%

PFAvatar: Pose-Fusion 3D Personalized Avatar Reconstruction from Real-World Outfit-of-the-Day Photos

Dianbing Xi, Guoyuan An, Jingsen Zhu, Zhijian Liu, Yuan Liu, Ruiyuan Zhang, Jiayuan Lu, Yuchi Huo, Rui Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09558 2025-11-13 cs.RO cs.AI cs.CV cs.GR cs.LG 62%

IFG: Internet-Scale Guidance for Functional Grasping Generation

Ray Muxin Liu, Mingxuan Li, Kenneth Shaw, Deepak Pathak

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Website at https://ifgrasping.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07633 2025-11-12 cs.CV cs.MM 62%

T-GVC: Trajectory-Guided Generative Video Coding at Ultra-Low Bitrates

Zhitao Wang, Hengyu Man, Wenrui Li, Xingtao Wang, Xiaopeng Fan, Debin Zhao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10999 2025-10-28 cs.CV cs.AI cs.CL cs.MM 62%

ControlText: Unlocking Controllable Fonts in Multilingual Text Rendering without Font Annotations

Bowen Jiang, Yuan Yuan, Xinyi Bai, Zhuoqun Hao, Alyson Yin, Yaojie Hu, Wenyu Liao, Lyle Ungar, Camillo J. Taylor

机构 * University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学) University of California, Irvine(加州大学伊藤分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

Comments The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP) Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21682 2025-10-27 cs.CV cs.GR 62%

WorldGrow: Generating Infinite 3D World

Sikuang Li, Chen Yang, Jiemin Fang, Taoran Yi, Jia Lu, Jiazhong Cen, Lingxi Xie, Wei Shen, Qi Tian

机构 * MoE Key Lab of Artificial Intelligence, School of Computer Science, SJTU(人工智能前沿实验室,计算机科学学院,上海交通大学) Huawei Inc.(华为公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV、cs.GR

Comments Project page: https://world-grow.github.io/ Code: https://github.com/world-grow/WorldGrow

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16833 2025-10-21 cs.CV cs.GR 62%

From Mannequin to Human: A Pose-Aware and Identity-Preserving Video Generation Framework for Lifelike Clothing Display

Xiangyu Mu, Dongliang Zhou, Jie Hou, Haijun Zhang, Weili Guan

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14976 2025-10-17 cs.CV cs.GR cs.RO 62%

Ponimator: Unfolding Interactive Pose for Versatile Human-human Interaction Animation

Shaowei Liu, Chuan Guo, Bing Zhou, Jian Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Accepted to ICCV 2025. Project page: https://stevenlsw.github.io/ponimator/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13131 2025-10-16 cs.CV cs.MM 62%

OS-HGAdapter: Open Semantic Hypergraph Adapter for Large Language Models Assisted Entropy-Enhanced Image-Text Alignment

Rongjun Chen, Chengsi Yao, Jinchang Ren, Xianxian Zeng, Peixian Wang, Jun Yuan, Jiawen Li, Huimin Zhao, Xu Lu

机构 * School of Computer Science, Guangdong Polytechnic Normal University(广东 polytechnic 正规大学计算机学院)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03207 2025-10-16 cs.CV cs.GR 62%

MotionAgent: Fine-grained Controllable Video Generation via Motion Field Agent

Xinyao Liao, Xianfang Zeng, Liao Wang, Gang Yu, Guosheng Lin, Chi Zhang

机构 * Nanyang Technological University(南洋理工大学) StepFun Westlake University(西湖大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11567 2025-10-14 cs.CV cs.GR cs.LG 62%

A Framework for Low-Effort Training Data Generation for Urban Semantic Segmentation

Denis Zavadski, Damjan Kalšan, Tim Küchler, Haebom Lee, Stefan Roth, Carsten Rother

机构 * Computer Vision and Learning Lab, IWR, Heidelberg University, Germany(海德堡大学计算机视觉与学习实验室) AIMMO, Republic of Korea(韩国AIMMO) Department of Computer Science, TU Darmstadt, Germany(图宾根大学计算机科学系) Zuse School ELIZA, Germany(德国Zuse学校ELIZA) Hessian Center for AI (hessian.AI), Germany(黑森人工智能中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06060 2025-10-08 cs.MM cs.AI cs.CV 62%

Controllable Audio-Visual Viewpoint Generation from 360° Spatial Information

Christian Marinoni, Riccardo Fosco Gramaccioni, Eleonora Grassucci, Danilo Comminiello

机构 * Sapienza University of Rome, Italy(罗马大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05829 2025-10-08 cs.SD cs.CV cs.LG cs.MM eess.AS 62%

FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders

Riccardo Fosco Gramaccioni, Christian Marinoni, Eleonora Grassucci, Giordano Cicchetti, Aurelio Uncini, Danilo Comminiello

机构 * Dept. Information Engineering, Electronics and Telecommunications (DIET), Sapienza University of Rome(信息工程、电子与电信系(DIET),罗马萨皮恩扎大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

Comments Acepted at IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08366 2025-09-30 cs.GR cs.CV 62%

In-2-4D: Inbetweening from Two Single-View Images to 4D Generation

Sauradip Nag, Daniel Cohen-Or, Hao Zhang, Ali Mahdavi-Amiri

机构 * Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments SIGGRAPH ASIA 2025; Project page at https://in-2-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10403 2025-09-25 cs.CV cs.CL cs.IR cs.MM 62%

CLOSP: A Unified Semantic Space for SAR, MSI, and Text in Remote Sensing

Daniele Rege Cambrin, Lorenzo Vaiani, Giuseppe Gallipoli, Luca Cagliero, Paolo Garza

机构 * Politecnico di Torino(托斯大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14476 2025-09-22 cs.CV cs.AI cs.MM 62%

AToken: A Unified Tokenizer for Vision

Jiasen Lu, Liangchen Song, Mingze Xu, Byeongjoo Ahn, Yanjun Wang, Chen Chen, Afshin Dehghan, Yinfei Yang

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02278 2025-09-03 cs.GR cs.AI cs.MM 62%

Think2Sing: Orchestrating Structured Motion Subtitles for Singing-Driven 3D Head Animation

Zikai Huang, Yihan Zhou, Xuemiao Xu, Cheng Xu, Xiaofen Xing, Jing Qin, Shengfeng He

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) South China University of Technology(华南理工大学) Guangdong Engineering Center for Large Model and GenAI Technology(广东省大模型与生成式人工智能技术工程中心) Guangdong Provincial Key Lab of Computational Intelligence and Cyberspace Information(广东省计算智能与网络信息重点实验室) Centre for Smart Health, Hong Kong Polytechnic University(香港理工大学智能健康研究中心) CAS-Hong Kong Joint Laboratory for Multimodal Medical Molecular Imaging(中国科学院-香港联合多模态医学分子成像联合实验室) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) Pazhou Lab, Guangzhou, Guangdong, China(广州琶洲实验室) School of Computing and Information Systems, Singapore Management University(新加坡国立大学计算机与信息系统学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.GR、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09012 2025-09-03 cs.CV cs.AI cs.CL cs.MM 62%

Multimodal LLMs Can Reason about Aesthetics in Zero-Shot

Ruixiang Jiang, Changwen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV、cs.MM

Comments ACM MM 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15842 2025-08-28 cs.CV cs.GR 62%

DiffArtist: Towards Structure and Appearance Controllable Image Stylization

Ruixiang Jiang, Changwen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

Comments Accepted to ACM MM 2025, Homepage: https://DiffusionArtist.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏