arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-23 至 2026-07-23 共收录 3 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 3 篇

2607.19923 2026-07-23 cs.CV 新提交 57%

WearWow: Native 2K Multi-Garment Virtual Try-On via Adaptive Token Packing and Preference Alignment

WearWow:通过自适应令牌打包和偏好对齐实现原生2K多服装虚拟试穿

Xujie Zhang, Runyan Du, Song Chang, Jiang Li, Dongliang Shao, Liping Wu, Wei Luo, Xiaochao Qu, Luoqi Liu, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Meitu Lab(美图实验室)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究针对原生2K多服装虚拟试穿难题,提出WearWow框架。用自适应2D令牌打包减轻内存爆炸,多维试穿奖励系统纠正纹理退化,还构建高质量数据集。实验证明该框架在原生2K多服装合成上达新水平,超越现有商业基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21618 2026-07-23 cs.CV 版本更新 57%

4DGS360: 360° Gaussian Reconstruction of Dynamic Objects from a Single Video

4DGS360:从单个视频中进行动态物体的360度高斯重建

Jae Won Jang, Yeonjin Chang, Wonsik Shin, Juhwan Cho, Nojun Kwak

机构 * Seoul National University(首尔国立大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出4DGS360框架,通过3D原生初始化解决动态物体360度重建中的几何模糊问题,结合优化实现一致的4D重建,并引入iPhone360基准测试集验证方法有效性。

Comments Accepted to ECCV 2026. Project page: https://jaewon040.github.io/4dgs360/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02473 2026-07-23 cs.CV cs.LG 版本更新 57%

WorldPack: Dynamic Frame Compression for Long-context Video World Modeling

WorldPack:用于长上下文视频世界建模的动态帧压缩

Yuta Oshima, Yusuke Iwasawa, Masahiro Suzuki, Yutaka Matsuo, Hiroki Furuta

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 研究针对长上下文视频世界建模中时空一致生成的挑战,提出WorldPack视频世界模型,通过轨迹打包和几何选择机制,基于3D空间相关性动态分配压缩率,扩展有效上下文,在相关数据集上优于基线,提升空间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏