arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-11 至 2026-06-11 共收录 74 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 61 篇

2408.11657 2026-06-11 astro-ph.SR 50%

Variability and stellar pulsation incidence in Am/Fm stars using TESS and Gaia data

利用TESS和Gaia数据研究Am/Fm星的变异性及恒星脉动发生率

Oliver Durfeldt-Pedros, Victoria Antoci, Barry Smalley, Simon Murphy, Natalia Posilek, Ewa Niemczura

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究利用TESS和Gaia数据分析Am/Fm星的脉动特性,发现51%的恒星无变异性,25%为脉动Am/Fm星,17%显示二元性或自转调制,7%为食双星,脉动类型包括γ Doradus、δ Scuti及混合型,揭示Am/Fm星的脉动行为多样性。

Comments 14 pages, 12 figures Accepted A&A 19/08/2024 Stellar catalogues available online: https://github.com/Durfeldt/AmStars_Catalogues

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10119 2026-06-11 physics.optics cond-mat.dis-nn 版本更新 50%

Modeling scattering matrix containing evanescent modes for wavefront shaping applications in disordered media

包含倏逝模式的散射矩阵建模及其在无序介质波前整形中的应用

Michael Raju, Baptiste Jayet, Stefan Andersson-Engels

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出开源标量波传输模型,通过扩展Fisher-Lee关系包含倏逝模式,估计无序介质的广义散射矩阵,并演示最优相位共轭波前聚焦倏逝模式时传输值为2/3的普适现象。

Comments Manuscript accepted in Physical Review Research

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2606.12012 2026-06-11 cs.CV 新提交 70%

FitVTON: Fit-aware Virtual Try-On via Body-Garment Size Control

FitVTON: 通过身体-服装尺寸控制实现合身感知的虚拟试穿

Yiqun Ning, Ao Shen, Chenhang He, Lei Zhang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Nuvatech

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 针对现有虚拟试穿忽略物理合身性的问题,提出FitVTON模型,通过结构化文本提示编码服装-身体尺寸,并引入辅助头预测服装和暴露身体掩膜,结合纹理校正阶段,在真实数据集FittingEffect3K上验证了尺寸准确性和形状保持的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12261 2026-06-11 cs.LG cs.AI cs.CV 版本更新 70%

The Latent Color Subspace: Emergent Order in High-Dimensional Chaos

潜在颜色子空间:高维混沌中的涌现秩序

Mateusz Pach, Jessica Bader, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * University of California, Berkeley(加州大学伯克利分校) University of Toronto(多伦多大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文揭示了FLUX.1变分自编码器潜在空间中颜色表示的HSL结构,并提出一种无需训练的闭式潜在空间操作方法,实现对生成图像颜色的预测与显式控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12217 2026-06-11 cs.CV cs.AI cs.RO 新提交 57%

Making Foresight Actionable: Repurposing Representation Alignment in World Action Models

使远见可操作:在世界动作模型中重新利用表示对齐

Lu Qiu, Yizhuo Li, Yi Chen, Yuying Ge, Yixiao Ge, Xihui Liu

机构 * The University of Hong Kong(香港大学) XPENG Robotics(小鹏机器人)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.07269 2026-06-11 math.AP 版本更新 50%

Hamilton-Jacobi-Bellman Equations in Random Geometries: Homogenization on Continuum Percolation Clusters

连续渗流簇上的Hamilton-Jacobi-Bellman方程的随机均匀化

Rodrigo Bazaes, Alexander Mielke, Chiranjib Mukherjee

专题命中 可控生成 :diffusion(abstract)

AI总结 研究连续渗流簇上退化随机Hamilton-Jacobi-Bellman方程的均匀化性质,利用Hamiltonian的强制性和相对熵结构,结合连续渗流随机几何,证明了几乎必然的均匀化结果。

Comments Completely revised manuscript, some earlier assumptions corrected; the revised assumptions are now sharp and apply to a substantially broader class of models, large parts of the proofs have been rewritten and are new

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2606.11783 2026-06-11 cs.CV 新提交 57%

A Comprehensive Ecosystem for Open-Domain Customized Video Generation

开放域定制视频生成的综合生态系统

Jingxu Zhang, Yuqian Hong, Daneul Kim, Kai Qiu, Qi Dai, Jianmin Bao, Yifan Yang, Xiaoyan Sun, Chong Luo

机构 * University of Science and Technology of China(科学技术大学) Microsoft Research Asia(微软亚洲研究院) Seoul National University(首尔国立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出百万级数据集PexelsCustom-1M和参数高效框架CustoMDiT,仅用8%额外参数实现定制视频生成,并构建千类基准OpenCustom,开源整个生态系统。

Comments 5 pages, 3 figures, 4 tables. Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11670 2026-06-11 cs.CV cs.AI 新提交 57%

ARGUS: Stacked Multi-View Identity Mosaic Injection for Subject-Preserving Video Generation

ARGUS: 堆叠多视角身份马赛克注入用于主体保持的视频生成

Zijie Meng, Jiwen Liu, Yufei Liu, Chengzhuo Tong, Xiaoqiang Liu, Yuanxing Zhang, Yulong Xu, Pengfei Wan

机构 * Peking University(北京大学) Kuaishou Technology(快手科技) Xiamen University(厦门大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ARGUS框架,通过堆叠多视角身份马赛克注入(SMII)将身份表示为紧凑动态分布,结合MLLM身份导演、无交叉对反事实训练等模块,在主体保持视频生成中达到SOTA。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2601.22725 2026-06-11 cs.CV cs.AI 版本更新 57%

OpenVTON-Bench: A Large-Scale High-Resolution Benchmark for Controllable Virtual Try-On Evaluation

OpenVTON-Bench:用于可控虚拟试穿评估的大规模高分辨率基准

Jin Li, Tao Chen, Kai Wen, Siqi Yin, Shuai Jiang, Weijie Wang, Jingwen Luo, Chenhui Wu

机构 * Renxing Intelligence, Hangzhou, China Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 提出OpenVTON-Bench,包含约10万对高分辨率图像,通过DINOv3聚类和Gemini描述构建,并设计多模态评估协议,沿五个维度衡量试穿质量,与人类判断高度一致。

Comments Under review for the NeurIPS 2026 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27303 2026-06-11 eess.SP 版本更新 50%

Point Spread Function Optimization for Communication-assisted UAV-borne MIMO TomoSAR

面向通信辅助的无人机载MIMO TomoSAR的点扩展函数优化

Pouya Fakharizadeh, Mohamed-Amine Lahmeri, Gerhard Krieger, Robert Schober

专题命中 图像生成评测 :image generation(abstract)

AI总结 针对无人机载MIMO合成孔径雷达层析成像系统,提出基于粒子群优化的联合无人机编队与卸载功率分配方法,以最小化点扩展函数旁瓣水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 4 篇

2606.12072 2026-06-11 cs.CV 新提交 57%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11363 2026-06-11 cs.CV 新提交 57%

NSVQ: Mitigating Codebook Collapse by Stabilizing Encoder Drift in Vector Quantization

NSVQ: 通过稳定向量量化中的编码器漂移缓解码本崩溃

Hao Lu, Yongxin Guo, Onur Koyun, Zhengjie Zhu, Abbas Alili, Metin N. Gurcan

机构 * Wake Forest University School of Medicine(维克森林大学医学院) Advocate Health(倡导健康)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出NSVQ训练策略,通过非平稳嵌入损失、码本替换和分阶段编码器冻结,缓解大码本VQ中的码本崩溃,在ImageNet-1k上提升重建质量并保持100%码本利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10820 2026-06-11 cs.LG cs.AI cs.CL 版本更新 50%

K-Forcing: Joint Next-K-Token Decoding via Push-Forward Language Modeling

K-Forcing:通过前推语言建模进行联合下一K词解码

Zhiwei Tang, Yuanyu He, Yizheng Han, Wangbo Zhao, Jiasheng Tang, Fan Wang, Bohan Zhuang

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出K-Forcing范式,通过前推映射将自回归模型蒸馏为单次前向传播生成多个未来词,实现2.4-3.5倍加速,质量损失小。

Comments Code: https://github.com/alibaba-damo-academy/K-Forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13753 2026-06-11 math.AP 版本更新 50%

Strong solution for polymeric fluid-structure interaction with small initial acceleration

具有小初始加速度的聚合物流体-结构相互作用的强解

Prince Romeo Mensah

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 针对三维-三维-二维耦合的溶质-溶剂-结构三态系统,通过解耦和不动点论证构造了强解的唯一高阶正则性,并证明了移动域上Stokes问题的最大正则性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏