arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-15 至 2026-06-15 共收录 73 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 55 篇

2601.02030 2026-06-15 physics.atm-clus 50%

Coexistence of close packed structures in large substrate-free Ar-Kr clusters according to THEED data

在大尺寸无基底Ar-Kr簇中紧密排列结构的共存

O. G. Danylchenko, O. P. Konotop

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过THEED技术研究了Ar-Kr单组分和二组分簇的相组成,发现簇尺寸阈值与组分无关,且大于该阈值的簇具有fcc-hcp双相结构,组分浓度在各相中相同。

Comments 16 pages, 3 figures

Journal ref Fiz. Nyzk. Temp. 52 (2026) 66-71

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02695 2026-06-15 cs.LG cs.AI 版本更新 50%

RAMAC: Multimodal Risk-Aware Offline Reinforcement Learning and the Role of Behavior Regularization

RAMAC: 多模态风险感知离线强化学习及行为正则化的作用

Kai Fukazawa, Kunal Mundada, Iman Soltani

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出RAMAC框架,结合分布性评论家与生成式演员(如扩散模型),通过条件风险价值与行为克隆的复合目标实现离线强化学习中的风险敏感学习,抑制分布外动作并提升CVaR。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15366 2026-06-15 cond-mat.stat-mech 版本更新 50%

Analytical Theory of Chiral Active Particle Transport in a Fluctuating Density Field

手性活性粒子在涨落密度场中输运的解析理论

Jayam Joshi, Abhra Puitandy, Shradha Mishra

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对三维手性活性布朗粒子在涨落密度场中的输运,建立了闭式解析理论,推导了均方位移和时变扩散率的精确表达式,揭示了手性与密度耦合对定向持久性和动力学交叉的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09087 2026-06-15 cs.LG math.PR q-bio.NC stat.ML 50%

Spiking Neural Models for Decision-Making Tasks with Learning

基于学习的脉冲神经模型用于决策任务

Sophie Jaffard, Giulia Mezzadri, Patricia Reynaud-Bouret, Etienne Tanré

机构 * Cognition and Decision Lab, Columbia University(认知与决策实验室,哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种生物合理性的脉冲神经网络模型,结合学习机制和多变量Hawkes过程,用于决策任务,通过耦合DDM与Poisson计数器模型,推导出带有相关噪声的DDM,并设计在线分类任务验证模型预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18275 2026-06-15 cond-mat.soft 版本更新 50%

Optimal Translocation of Living \& Active Filaments in Confinement

受限空间中活性和活性细丝的最优转运

Marin Vatin, Rosa Sinaasappel, Renske Kamping, Chantal Valeriani, Emanuele Locatelli, Antoine Deblais

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过蠕虫模型和活性细丝模拟,发现活性与重定向共同控制受限空间中的逃逸,且中间温度下转运效率最高。

Comments 10 pages, 6 figures plus 8 pages, 8 figures supplemental

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 2 篇

2606.14025 2026-06-15 cs.CV 新提交 77%

GarmentSketch: Large-scale Sketch-to-Fashion Benchmark

GarmentSketch:大规模草图到时尚基准

Duong-Duy-Khang Bui, Minh-Tan Pham, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 为解决时尚草图到图像合成缺乏大规模配对数据的问题,构建了包含26249对草图-文本描述的GarmentSketch数据集,并基于多模态大模型与人工精炼生成描述,评估了现有生成模型的性能。

Comments ICCCI 2026. Project page: https://khangbdd.github.io/garmentsketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14255 2026-06-15 cs.RO 新提交 50%

ReactVLA: Fast and Lightweight Reactive Robot Manipulation via Improved Mean Flow Action Generation

ReactVLA: 通过改进的平均流动作生成实现快速轻量级反应式机器人操作

Yanzhao Guo, Wenkai Chen, Jianwei Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, Universität Hamburg(汉堡大学信息学系多模态系统技术方面(TAMS))

专题命中 可控生成 :diffusion(abstract)

AI总结 提出ReactVLA框架,结合改进的平均流动作生成器和注意力残差机制,实现轻量低延迟的实时机器人操作,在模拟和真实任务中性能提升达1.65倍,推理速度提升4倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2606.13809 2026-06-15 cs.CV 新提交 70%

Compressing Image Style Training into a Single Model Forward

将图像风格训练压缩为单次模型前向传播

Zhongjie Duan, Yingda Chen

机构 * ModelScope Team, Alibaba Group(阿里巴巴集团 ModelScope 团队)

专题命中 个性化与一致性 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出i2L框架,通过单次前向传播预测LoRA权重,实现高效风格迁移,避免逐风格优化,在风格保真度、提示对齐和感知质量上超越现有基线。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14162 2026-06-15 cs.CV 新提交 57%

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling

VideoWeave: 通过联合几何-视频建模解锁视频生成中的几何一致性

Xunzhi Xiang, Zixuan Duan, Yabo Chen, Zhengxuan Wei, Guiyu Zhang, Zixiao Gu, Zhe Gao, Haibin Huang, Chi Zhang, Qi Fan, Xuelong Li

机构 * Nanjing University(南京大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出VideoWeave,一种在潜在空间后训练框架,利用隐式几何模型特征约束生成分布,缓解几何重建误差,提升视频几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 1 篇

2606.14334 2026-06-15 cs.LG math.DG 新提交 50%

Riemannian Metric Matching for Scalable Geometric Modeling of Distributions

黎曼度量匹配:面向分布的可扩展几何建模

Jacob Bamberger, Adam Gosztolai, Pierre Vandergheynst, Michael Bronstein, Iolo Jones

机构 * University of Cambridge(剑桥大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出黎曼度量匹配框架,通过神经网络学习数据的黎曼几何,利用carré du champ算子的条件期望形式实现样本级训练和恒定成本推理,在精度相当或更优下速度提升400倍。

Comments ICML 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 2 篇

2606.13992 2026-06-15 q-fin.MF q-fin.PR 新提交 50%

Group Quantization and Mellin Representations of the Heston Model

Heston模型的群量子化和Mellin表示

Santiago Garcia

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 通过构造Heston随机波动率模型的提升局部李群胚,给出其仿射变换结构的几何解释,并恢复特征函数和Riccati方程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12280 2026-06-15 cs.LG 新提交 50%

Holding the FP8 Quality Ceiling at 8-Bit Weights and Activations: INT8 and GGUF Post-Training Quantization of Ideogram 4.0 for Consumer GPUs

在8位权重和激活下保持FP8质量上限:Ideogram 4.0的INT8和GGUF后训练量化用于消费级GPU

Deep Gandhi, Ali Asaria, Tony Salomone

机构 * Transformer Lab

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文对Ideogram 4.0模型进行INT8 W8A8量化,在无FP8张量核心的Ampere GPU上达到FP8质量水平,并优于NF4,同时GGUF Q4_K在质量-内存前沿上成为帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2606.13679 2026-06-15 cs.CV 新提交 57%

InterleaveThinker: Reinforcing Agentic Interleaved Generation

InterleaveThinker: 强化智能体交错生成

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Meituan(美团) CUHK IMIXR(香港中文大学IMIXR实验室)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 提出首个多智能体管线InterleaveThinker,通过规划器和评论家智能体使现有图像生成器具备交错生成能力,并利用GRPO强化单步指令修正,显著提升生成性能。

Comments Project Page: https://zhengdian1.github.io/InterleaveThinker-proj/ Code: https://github.com/zhengdian1/InterleaveThinker

详情

展开后加载摘要…

URL PDF HTML 收藏