arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-16 至 2026-03-16 共收录 72 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2603.12749 2026-03-16 cs.CV cs.CR cs.LG 57%

SLICE: Semantic Latent Injection via Compartmentalized Embedding for Image Watermarking

SLICE: 通过 compartmentalized 编码的语义潜在注入实现图像水印

Zheng Gao, Yifan Yang, Xiaoyu Li, Xiaoyan Feng, Haoran Fan, Yang Song, Jiaojiao Jiang

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SLICE通过将图像语义分解为四个因素并精确锚定到初始高斯噪声区域,实现鲁棒的语义水印验证,有效检测和定位语义篡改,实验表明其在对抗攻击中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12648 2026-03-16 cs.CV 57%

From Sparse to Dense: Multi-View GRPO for Flow Models via Augmented Condition Space

从稀疏到密集:通过增强条件空间的多视图GRPO用于流模型

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室) Adobe Research(Adobe研究实验室) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) CPII under InnoHK Project(InnoHK项目下的CPII)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出多视图GRPO,通过增强条件空间探索样本间关系,提升文本到图像流模型的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12482 2026-03-16 cs.CV 57%

CalliMaster: Mastering Page-level Chinese Calligraphy via Layout-guided Spatial Planning

CalliMaster:通过布局引导的空间规划掌握页面级中文书法

Tianshuo Xu, Tiantian Hong, Zhifei Chen, Fei Chao, Ying-cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Faculty of Engineering and IT, University of Technology Sydney(悉尼大学工程与信息学院) Xiamen University(厦门大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CalliMaster框架,通过解耦空间规划与内容合成,解决页面级书法生成中精度与布局的平衡问题,支持可控生成与编辑,扩展至文物修复与鉴定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00547 2026-03-16 cs.CV cs.AI 57%

Motion Dreamer: Boundary Conditional Motion Reasoning for Physically Coherent Video Generation

Motion Dreamer:基于物理一致视频生成的边界条件运动推理

Tianshuo Xu, Zhifei Chen, Leyi Wu, Hao Lu, Yuying Chen, Lihui Jiang, Bingbing Liu, Yingcong Chen

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出Motion Dreamer框架,通过分离运动推理与视觉合成,解决视频生成中边界条件运动推理的问题,提升运动合理性与视觉真实性。

Comments The authors have decided to withdraw this article due to the following reasons identified after publication: Experimental Errors: Significant inaccuracies were discovered in the experimental results concerning segmentation and depth estimation. Authorship Disputes: In addition to the technical issues, there are unresolved disagreements regarding the author sequence and contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15369 2026-03-16 eess.IV cs.AI 50%

OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation

OpenVision 3: 一种用于理解和生成的统一视觉编码器家族

Letian Zhang, Sucheng Ren, Yanqing Liu, Xianhang Li, Zeyu Wang, Yuyin Zhou, Huaxiu Yao, Zeyu Zheng, Weili Nie, Guilin Liu, Zhiding Yu, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) JHU(约翰霍普金斯大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 可控生成 :image generation(abstract)

AI总结 本文提出OpenVision 3,通过统一视觉表示实现图像理解和生成。核心架构将VAE压缩的图像潜在特征输入ViT编码器,同时训练其输出以支持重建和语义学习,从而在共享潜在空间中实现良好泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 1 篇

2508.12019 2026-03-16 astro-ph.CO 50%

Mitigating point-source contamination in CMB polarization: a Generalized Point Spread Function fitting approach

减轻CMB偏振中的点源污染:一种广义点扩散函数拟合方法

Yi-Ming Wang, Wen-Zheng Chen, Yang Liu, Si-Yu Li, Hong Li

专题命中 图像修复 :inpainting(abstract)

AI总结 本文提出了一种广义点扩散函数拟合方法,用于减少CMB偏振中的点源污染,有效降低张量-标量比r的估计偏差。

Comments 33 pages,13 figures

Journal ref JCAP 03 (2026) 042

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2603.12873 2026-03-16 cs.CV 57%

TRACE: Structure-Aware Character Encoding for Robust and Generalizable Document Watermarking

TRACE:面向结构的字符编码用于鲁棒且可泛化的文档水印

Jiale Meng, Jie Zhang, Runyi Hu, Zhe-Ming Lu, Tianwei Zhang, Yiming Li

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 TRACE通过扩散模型实现结构感知的局部字符编码,提升文档水印的鲁棒性和泛化能力,实验显示其在PSNR和提取精度上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12513 2026-03-16 cs.CV 57%

MemRoPE: Training-Free Infinite Video Generation via Evolving Memory Tokens

MemRoPE:通过演化记忆标记实现无训练的无限视频生成

Youngrae Kim, Qixin Hu, C. -C. Jay Kuo, Peter A. Beerel

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 MemRoPE通过演化记忆标记和在线RoPE索引机制,解决长视频生成中的时间一致性、视觉保真度和主体一致性问题,实现无训练的无限视频生成。

Comments 9 pages main, 3 pages references, 6 pages appendix. Project page: https://memrope.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 4 篇

2509.15342 2026-03-16 cs.CV 83%

LowDiff: Efficient Diffusion Sampling with Low-Resolution Condition

LowDiff: 基于低分辨率条件的高效扩散采样

Jiuyi Xu, Qing Jin, Meida Chen, Andrew Feng, Yang Sui, Yangming Shi

机构 * Colorado School of Mines(科罗拉多矿学院) Independent Researcher(独立研究者) University of Southern California Institute for Creative Technologies(南加州大学创意技术研究所) Rice University(里士满大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 LowDiff通过级联方法生成逐步提升的高分辨率图像,利用统一模型逐步细化图像,实现更高效的扩散采样,提升生成效率和质量。

Comments 16 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12635 2026-03-16 cs.LG nlin.CD physics.flu-dyn 78%

Adaptive Diffusion Posterior Sampling for Data and Model Fusion of Complex Nonlinear Dynamical Systems

自适应扩散后向采样用于复杂非线性动力系统的数据与模型融合

Dibyajyoti Chakraborty, Hojin Kim, Romit Maulik

机构 * College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) School of Mechanical Engineering, Purdue University(普渡大学机械工程学院)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出一种基于生成机器学习的替代模型,利用深度学习扩散模型进行长周期湍流预测,通过多步自回归扩散目标提升稳定性,并结合多尺度图变压器架构处理复杂几何,实现传感器优化布置与数据同化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12689 2026-03-16 cond-mat.soft cond-mat.stat-mech 50%

Memory-aware acceleration of orientational dynamics in nanoparticle suspensions

具有记忆性的纳米颗粒悬浮液取向动力学加速

Miguel Ibáñez, Raúl A. Rica-Alarcón, María L. Jiménez

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究通过实验和理论分析,揭示了纳米颗粒取向动力学中的记忆效应,并提出抑制慢速松弛模式的协议,从而显著减少弛豫时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12480 2026-03-16 cs.RO cs.AI 50%

One-Step Flow Policy: Self-Distillation for Fast Visuomotor Policies

一步流策略:用于快速视觉-运动策略的自蒸馏

Shaolong Li, Lichao Sun, Yongchao Chen

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出一步流策略,通过自蒸馏实现高保真单步动作生成,无需预训练教师模型,有效提升动作生成速度和控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏