arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2602.21593 2026-02-26 cs.LG cs.CR cs.CV 57%

Breaking Semantic-Aware Watermarks via LLM-Guided Coherence-Preserving Semantic Injection

破坏语义感知水印:通过LLM引导的保持连贯性语义注入

Zheng Gao, Xiaoyu Li, Zhicheng Bao, Xiaoyan Feng, Jiaojiao Jiang

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CSI攻击,利用LLM引导的语义操纵破坏语义水印的绑定,揭示当前语义水印设计在面对LLM驱动的语义扰动时的安全漏洞。

Comments Accepted by The Web Conference 2026 (Short Paper Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21365 2026-02-26 cs.CV cs.AI cs.LG eess.IV 57%

Towards Controllable Video Synthesis of Routine and Rare OR Events

面向常规和罕见OR事件可控视频合成

Dominik Schneider, Lalithkumar Seenivasan, Sampath Rapuri, Vishalroshan Anil, Aiza Maksutova, Yiqing Shen, Jan Emily Mangulabnan, Hao Ding, Jose L. Porras, Masaru Ishii, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Technical University Munich(慕尼黑技术大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种可控视频合成框架,用于生成手术室中常规和罕见事件,以支持环境智能模型的发展。

Comments Accepted to IPCAI 2026 and submitted to IJCARs

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21188 2026-02-25 cs.CV 57%

Human Video Generation from a Single Image with 3D Pose and View Control

从单张图像生成人类视频:结合3D姿态和视角控制

Tiantian Wang, Chun-Han Yao, Tao Hu, Mallikarjun Byrasandra Ramalinga Reddy, Ming-Hsuan Yang, Varun Jampani

机构 * Electrical Engineering and Computer Science, University of California, Merced, CA 95343, United States.(电子工程与计算机科学系,加州大学默塞德分校) Stability AI, Los Angeles, CA 90067, United States.(Stability AI)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HVG模型,通过3D姿态和视角控制从单张图像生成高质量多视角人类视频,解决了衣物褶皱和时空一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21175 2026-02-25 cs.CV 57%

Seeing Through Words: Controlling Visual Retrieval Quality with Language Models

通过文字看见:利用语言模型控制视觉检索质量

Jianglin Lu, Simon Jenni, Kushal Kafle, Jing Shi, Handong Zhao, Yun Fu

机构 * Adobe Research(Adobe研究部) Northeastern University(东北大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 通过生成语言模型扩展短查询并控制图像质量,提升视觉检索效果和可控性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20377 2026-02-25 cs.GR 57%

Directly from Alpha to Omega: Controllable End-to-End Vector Floor Plan Generation

从Alpha到Omega:可控的端到端向量平面生成

Shidong Wang, Renato Pajarola

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

AI总结 CE2EPlan通过端到端可控模型直接从数据学习平面设计,提升生成质量与多样性,接近人类设计师的灵活性。

Comments accepted to IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20079 2026-02-24 cs.CV 57%

SemanticNVS: Improving Semantic Scene Understanding in Generative Novel View Synthesis

SemanticNVS: 提高生成式新视角合成中的语义场景理解

Xinya Chen, Christopher Wewer, Jiahao Xie, Xinting Hu, Jan Eric Lenssen

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Germany(马克斯·普朗克研究所信息学院,萨尔兰州信息学院,德国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SemanticNVS通过整合预训练语义特征提取器,提高生成式新视角合成中远距离视角下的生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19937 2026-02-24 cs.CV 57%

Learning Positive-Incentive Point Sampling in Neural Implicit Fields for Object Pose Estimation

在神经隐式场中学习正激励点采样用于物体姿态估计

Yifei Shi, Boyan Wan, Xin Xu, Kai Xu

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Computer Science, National University of Defense Technology(计算机科学学院,国防科技大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出结合SO(3)-等价卷积隐式网络和正激励点采样策略的方法,提升物体姿态估计的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19358 2026-02-24 cs.CV 57%

Referring Layer Decomposition

提及层分解

Fangyi Chen, Yaojie Shen, Lu Xu, Ye Yuan, Shu Zhang, Yulei Niu, Longyin Wen

机构 * Intelligent Editing Team, Intelligent Creation, ByteDance(字节跳动智能创作部)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 提及层分解任务通过预测RGBA层实现精确的视觉内容控制,结合大规模数据集和评估协议,提升图像编辑和生成的可控性与质量。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14720 2026-02-24 cs.CV 57%

ShapeShift: Text-to-Mosaic Synthesis via Semantic Phase-Field Guidance

ShapeShift: 通过语义相场指导实现文本到马赛克合成

Vihaan Misra, Peter Schaldenbrand, Jean Oh

机构 * Carnegie Mellon University USA(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ShapeShift通过语义相场指导实现文本到马赛克合成,结合语义指导与可行性约束解决,提升排列的语义清晰性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18817 2026-02-24 cs.CV 57%

HeRO: Hierarchical 3D Semantic Representation for Pose-aware Object Manipulation

HeRO:用于姿态感知物体操作的分层3D语义表示

Chongyang Xu, Shen Cheng, Haipeng Li, Haoqiang Fan, Ziliang Feng, Shuaicheng Liu

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Dexmal

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HeRO通过分层语义场结合几何与语义,提升姿态感知操作的控制策略,实现多个任务的成功率提升。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18422 2026-02-23 cs.CV 57%

Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

生成现实:基于交互式视频生成的人本世界模拟

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) NYU Shanghai(纽约大学上海分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。

Comments Project page here: https://codeysun.github.io/generated-reality

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18282 2026-02-23 cs.CV 57%

DEIG: Detail-Enhanced Instance Generation with Fine-Grained Semantic Control

DEIG:细节增强的实例生成与细粒度语义控制

Shiyan Du, Conghan Yue, Xinyu Cheng, Dongyu Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DEIG通过细粒度语义控制生成多实例场景,提升空间一致性与语义准确性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15922 2026-02-19 cs.RO cs.CV cs.LG 57%

World Action Models are Zero-shot Policies

世界动作模型是零样本策略

Seonghyeon Ye, Yunhao Ge, Kaiyuan Zheng, Shenyuan Gao, Sihyun Yu, George Kurian, Suneel Indupuru, You Liang Tan, Chuning Zhu, Jiannan Xiang, Ayaan Malik, Kyungmin Lee, William Liang, Nadun Ranawaka, Jiasheng Gu, Yinzhen Xu, Guanzhi Wang, Fengyuan Hu, Avnish Narayan, Johan Bjorck, Jing Wang, Gwanghyun Kim, Dantong Niu, Ruijie Zheng, Yuqi Xie, Jimmy Wu, Qi Wang, Ryan Julian, Danfei Xu, Yilun Du, Yevgen Chebotar, Scott Reed, Jan Kautz, Yuke Zhu, Linxi "Jim" Fan, Joel Jang

机构 * NVIDIA

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamZero通过世界动作模型实现零样本策略,有效提升机器人在新任务和环境中的泛化能力,同时支持跨身体转移和少样本适应。

Comments Project page: https://dreamzero0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17091 2026-02-19 cs.CV cs.AI cs.LG 57%

Ctrl-GenAug: Controllable Generative Augmentation for Medical Sequence Classification

Ctrl-GenAug: 可控生成增强用于医学序列分类

Xinrui Zhou, Yuhao Huang, Haoran Dou, Shijing Chen, Ao Chang, Jia Liu, Weiran Long, Jian Zheng, Erjiao Xu, Jie Ren, Alejandro F. Frangi, Ruobing Huang, Jun Cheng, Xiaomeng Li, Wufeng Xue, Dong Ni

机构 * National-Regional Key Technology Engineering Laboratory for Medical Ultrasound(国家级区域医疗超声关键技术工程实验室) School of Biomedical Engineering(生物医学工程学院) Medical School(医学院) Shenzhen University(深圳大学) Medical UltraSound Image Computing (MUSIC) Lab(医学超声图像计算(MUSIC)实验室) School of Artificial Intelligence(人工智能学院) The Hong Kong University of Science and Technology(香港科学与技术大学) Department of Electronic and Computer Engineering(电子与计算机工程系) The University of Manchester(曼彻斯特大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学第三附属医院) Longgang District People’s Hospital of Shenzhen(深圳龙岗区人民医院) The Second Affiliated Hospital of The Chinese University of Hong Kong(香港中文大学第二附属医院) School of Biomedical Engineering and Informatics(生物医学工程与信息学学院) NIHR Manchester Biomedical Research Centre(NIHR曼彻斯特生物医学研究中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Ctrl-GenAug通过可控生成增强方法提升医学序列分类性能,解决语义和序列可控性不足及噪声样本问题。

Comments Accepted by International Journal of Computer Vision, 30 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13159 2026-02-18 cs.CV 57%

Digital Twin Generation from Visual Data: A Survey

从视觉数据生成数字孪生:一项调查

Andrew Melnik, Benjamin Alt, Giang Nguyen, Artur Wilkowski, Maciej Stefańczyk, Qirui Wu, Sinan Harms, Helge Rhodin, Manolis Savva, Michael Beetz

机构 * University of Bremen(不莱梅大学) Warsaw University of Technology(华沙技术大学) Bielefeld University(比勒菲尔德大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文综述了从视觉数据生成数字孪生的最新方法,探讨了多种技术及其挑战,为实际应用提供了全面的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05100 2026-02-16 cs.CE cs.CV cs.SC 57%

Rule-Based Spatial Mixture-of-Experts U-Net for Explainable Edge Detection

基于规则的时空专家混合U-Net可解释边缘检测

Bharadwaj Dogga, Kaaustaaub Shankar, Gibin Raju, Wilhelm Louw, Kelly Cohen

机构 * Ph.D. Candidate, AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Research Student, AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Postdoctoral Researcher, Department of Multidisciplinary Engineering, TA\&M University, \ Station, TX 77843, USA e-mail: Research Associate AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail: Director AI Bio Lab, Digital Futures, University of Cincinnati, \ , OH 45221, USA e-mail

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 基于规则的时空专家混合U-Net通过融合深度语义特征与启发式边缘信号,实现边缘检测的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12401 2026-02-16 cs.CV 57%

ZeroDiff++: Substantial Unseen Visual-semantic Correlation in Zero-shot Learning

ZeroDiff++: 零样本学习中显著的未见视觉-语义相关性

Zihan Ye, Shreyank N Gowda, Kaile Du, Weijian Luo, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室,中国科学院大学) School of Computer Science, the University of Nottingham(诺丁汉大学计算机学院) Southeast University(东南大学) hi-lab of Xiaohongshu Inc(小红书公司hi实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ZeroDiff++通过扩散生成框架提升零样本学习中视觉-语义相关性,解决虚假相关性和数据稀缺问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00741 2026-02-16 eess.IV cs.CV 57%

LesionDiffusion: Towards Text-controlled General Lesion Synthesis

LesionDiffusion:面向文本控制的通用病变合成

Wenhui Lei, Henrui Tian, Linrui Dai, Hanyu Chen, Xiaofan Zhang

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The First Hospital of China Medical University(中国医科大学第一医院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 LesionDiffusion通过文本控制生成3D CT影像中的病变及掩码,提升病变分割性能,支持多种病变类型和器官,优于现有方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12160 2026-02-13 cs.CV 57%

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

DreamID-Omni: 一体化框架用于可控的人-centric音频视频生成

Xu Guo, Fulong Ye, Qichao Sun, Liyang Chen, Bingchuan Li, Pengze Zhang, Jiawei Liu, Songtao Zhao, Qian He, Xiangwang Hou

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamID-Omni提出了一种统一框架,通过双层解耦策略和多任务训练方案,实现对可控人-centric音频视频生成的高效控制。

Comments Project: https://guoxu1233.github.io/DreamID-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13757 2026-02-13 eess.IV cs.CV cs.LG 57%

Improving the Plausibility of Pressure Distributions Synthesized from Depth Image through Generative Modeling

通过生成模型提升从深度图像合成压力分布的可信度

Neevkumar Manavar, Hanno Gerd Meyer, Joachim Waßmuth, Barbara Hammer, Axel Schneider

机构 * Hochschule Bielefeld, Interaktion(比勒菲尔德应用科学大学,交互学院) CITEC, Bielefeld University(比勒菲尔德大学,CITEC研究中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过生成模型提升从深度图像合成压力分布的可信度,采用ILS和WOL增强物理一致性,对比实验显示其在性能和效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10173 2026-02-12 cs.CV 57%

ArtisanGS: Interactive Tools for Gaussian Splat Selection with AI and Human in the Loop

ArtisanGS: 带有AI和人机协作的高斯点选择交互工具

Clement Fuji Tsang, Anita Hu, Or Perel, Carsten Kolve, Maria Shugrina

机构 * NVIDIA NVIDIA Canada(NVIDIA 加拿大) University of Toronto Canada(多伦多大学 加拿大) NVIDIA France(NVIDIA 法国) University of Toronto(多伦多大学) Institute for Clarity in Documentation Dublin Ohio USA(文档清晰研究所 俄亥俄州 大致) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University Doimukh Arunachal Pradesh India(拉吉夫·甘地大学 亚当穆克 阿鲁纳恰尔邦 印度) Tsinghua University Haidian Qu Beijing Shi China(清华大学 海淀区 北京市 中国) Palmer Research Laboratories San Antonio Texas USA(帕勒研究中心 肯塔基州 威斯康星州 美国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ArtisanGS通过交互式工具实现高斯点选择与分割,结合AI与人工干预,提供灵活的局部编辑功能,适用于真实场景中的可控编辑。

Comments 12 pages, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10350 2026-02-11 cs.CV 57%

Benchmarking 3D Human Pose Estimation Models under Occlusions

在遮挡下评估3D人体姿态估计模型的基准测试

Filipa Lino, Carlos Santiago, Manuel Marques

机构 * Institute for Systems and Robotics, LARSyS(系统机器人研究所、LARSyS)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文评估了九种3D人体姿态估计模型在遮挡条件下的鲁棒性,发现所有模型在遮挡下性能下降,尤其是扩散模型表现不佳,揭示了当前模型在遮挡处理上的关键限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09425 2026-02-11 cs.CV cs.LG 57%

Bridging the Modality Gap in Roadside LiDAR: A Training-Free Vision-Language Model Framework for Vehicle Classification

弥合道路激光雷达的模态差距:一种无需训练的视觉-语言模型框架用于车辆分类

Yiqiao Li, Bo Shang, Jie Wei

机构 * Department of Civil Engineering, City College of New York(城市学院土木工程系) Department of Computer Science, City College of New York(城市学院计算机科学系)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的视觉-语言模型框架,用于解决道路激光雷达中稀疏点云与密集图像之间的模态差距问题,实现细粒度车辆分类。

Comments 12 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18862 2026-02-11 cs.CV cs.AI 57%

TAMMs: Change Understanding and Forecasting in Satellite Image Time Series with Temporal-Aware Multimodal Models

TAMMs: 卫星图像时间序列中基于时序感知的多模态模型用于变化理解和预测

Zhongbin Guo, Yuhao Wang, Ping Jian, Chengzhi Li, Xinyue Chen, Zhen Yang, Ertai E

机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 TAMMs通过时序感知多模态模型统一执行卫星图像时间序列中的变化理解和未来预测,提升长程时间动态建模能力。

Comments Published as a conference paper at The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06159 2026-02-10 cs.CV 57%

Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving

驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征

Xuyang Chen, Conglang Zhang, Chuanheng Fu, Zihao Yang, Kaixuan Zhou, Yizhi Zhang, Jianan He, Yanfeng Zhang, Mingwei Sun, Zengmao Wang, Zhen Dong, Xiaoxiao Long, Liqiu Meng

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Hilbert Research Center(华为希利伯特研究中心) Huawei Riemann Lab(华为里曼实验室) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。

Comments Project website https://albertchen98.github.io/DwD-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08068 2026-02-10 cs.CV 57%

ReRoPE: Repurposing RoPE for Relative Camera Control

ReRoPE:将RoPE用于相对相机控制

Chunyang Li, Yuanbo Yang, Jiahao Shao, Hongyu Zhou, Katja Schwarz, Yiyi Liao

机构 * Zhejiang University(浙江大学) Independent Researcher(独立研究者)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReRoPE通过将RoPE用于相对相机控制,实现可控视频生成,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06419 2026-02-09 cs.CV 57%

Learning Human Visual Attention on 3D Surfaces through Geometry-Queried Semantic Priors

通过几何查询的语义先验学习人类在3D表面上的视觉注意

Soham Pahari, Sandeep C. Kumain

机构 * UPES Dehradun(德里敦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SemGeo-AttentionNet,通过几何查询语义先验,有效建模人类在3D表面的视觉注意,实现了显著性检测与扫描路径生成的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06042 2026-02-06 cs.LG cs.CV 57%

Pseudo-Invertible Neural Networks

伪可逆神经网络

Yamit Ehrlich, Nimrod Berman, Assaf Shocher

机构 * Ben-Gurion University(本·古里安大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出伪可逆神经网络,用于解决非线性逆问题,通过非线性反向投影实现零样本逆向生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05966 2026-02-06 cs.CV cs.AI 57%

LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation

LSA:局部语义对齐用于增强交通视频生成中的时间一致性

Mirlan Karimov, Teodora Spasojevic, Markus Braun, Julian Wiederer, Vasileios Belagiannis, Marc Pollefeys

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ETH Zurich(苏黎世联邦理工学院) Friedrich-Alexander University Erlangen-Nuremberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LSA通过局部语义对齐提升交通视频生成的时间一致性,无需外部控制信号。

Comments Accepted to IEEE IV 2026. 8 pages, 3 figures. Code available at https://github.com/mirlanium/LSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05534 2026-02-06 cs.CV 57%

SSG: Scaled Spatial Guidance for Multi-Scale Visual Autoregressive Generation

SSG: 多尺度视觉自回归生成的缩放空间引导

Youngwoo Shin, Jiwan Hur, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SSG通过缩放空间引导方法,在无需训练的情况下提升多尺度视觉自回归生成的保真度和多样性,同时保持低延迟。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏