arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-13 至 2026-03-13 共收录 6 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 6 篇

2510.26796 2026-03-13 cs.CV cs.GR 81%

See4D: Pose-Free 4D Generation via Auto-Regressive Video Inpainting

See4D: 通过自回归视频修复实现无姿态4D生成

Dongyue Lu, Ao Liang, Tianxin Huang, Xiao Fu, Yuyang Zhao, Baorui Ma, Liang Pan, Wei Yin, Lingdong Kong, Wei Tsang Ooi, Ziwei Liu

机构 * NUS(新加坡国立大学) HKU(香港大学) CUHK(香港中文大学) THU(清华大学) Shanghai AI Lab(上海人工智能实验室) Horizon Robotics(地平线机器人) NTU(国立科技大学)

专题命中 可控生成 :inpainting(title,abstract);分类 cs.CV、cs.GR

AI总结 See4D通过自回归视频修复实现无姿态4D生成,提升从随意视频到4D世界建模的实用性。

Comments Eurographics2026; 26 pages; 21 figures; 3 tables; project page: https://see-4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12146 2026-03-13 cs.CV cs.AI cs.LG cs.MM 62%

FlashMotion: Few-Step Controllable Video Generation with Trajectory Guidance

FlashMotion: 通过轨迹引导的少步可控视频生成

Quanhao Li, Zhen Xing, Rui Wang, Haidong Cao, Qi Dai, Daoguo Dong, Zuxuan Wu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 FlashMotion通过轨迹引导和蒸馏方法实现了少步可控视频生成,提升了视频质量和轨迹准确性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12250 2026-03-13 cs.CV 57%

DVD: Deterministic Video Depth Estimation with Generative Priors

DVD:利用生成先验的确定性视频深度估计

Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Jing He, Zixin Zhang, Haodong Li, Yihao Liang, Kanghao Chen, Bin Ren, Xu Zheng, Shuai Yang, Kun Zhou, Yinchuan Li, Nicu Sebe, Ying-Cong Chen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DVD通过确定性方法将预训练视频扩散模型转化为单次通过深度回归器,解决视频深度估计中的生成与判别模型权衡问题,实现零样本性能提升并释放开源训练套件。

Comments Project: https://dvd-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12108 2026-03-13 cs.CV 57%

EvoTok: A Unified Image Tokenizer via Residual Latent Evolution for Visual Understanding and Generation

EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成

Yan Li, Ning Liao, Xiangyu Zhao, Shaofeng Zhang, Xiaoxing Wang, Yifan Yang, Junchi Yan, Xue Yang

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Corporation(微软公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11695 2026-03-13 cs.CV cond-mat.mtrl-sci 57%

PolyCrysDiff: Controllable Generation of Three-Dimensional Computable Polycrystalline Material Structures

PolyCrysDiff: 可控生成三维可计算多晶材料结构

Chi Chen, Tianle Jiang, Xiaodong Wei, Yanming Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PolyCrysDiff通过条件潜在扩散框架实现了可计算的多晶材料三维微结构可控生成,有效提升了晶粒属性控制精度,为多晶材料的优化设计提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09487 2026-03-13 cs.CV 57%

Semantic-Aware Reconstruction Error for Detecting AI-Generated Images

语义感知的重建误差用于检测AI生成图像

Ju Yeon Kang, Jaehong Park, Semin Kim, Ji Won Yoon, Nam Soo Kim

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出语义感知的重建误差(SARE)用于检测AI生成图像,通过分析图像与描述词引导重建间的语义差异,提升跨生成模型的检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏