arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-08 至 2026-06-08 共收录 78 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 59 篇

2512.06087 2026-06-08 cond-mat.dis-nn 50%

Anderson localization of quantum droplets in disordered potentials

量子滴在无序势中的安德森局域化

Zohra Mehri, Abdeaali Boudjemaa

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了一维量子滴在类斑点势中的安德森局域化现象,通过广义格鲁宁-皮塔耶夫斯基方程计算了滴状物宽度、密度分布、扩散指数和系数以及局域化长度,发现强无序强度下出现超扩散到亚扩散的异常扩散行为,并发现临界无序强度以上滴状物发生安德森局域化。

Comments 5 pages, 6 figures

Journal ref Chaos, Solitons & Fractals 208, 118138 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18678 2026-06-08 astro-ph.GA astro-ph.HE 版本更新 50%

CRexit: how different cosmic ray transport modes affect thermal instability in the circumgalactic medium

CRexit:不同宇宙射线传输模式如何影响星系际介质中的热不稳定性

Matthias Weber, Timon Thomas, Christoph Pfrommer, Ruediger Pakmor

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过3D模拟探讨宇宙射线传输模式对冷云热不稳定性的影响,发现CR逃逸时间与云坍缩时间比是关键因素,高分辨率模拟避免了低分辨率导致的错误云结构。

Comments 20 pages and 17 figures in main text; submitted to A&A

Journal ref A&A 698, A125 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16212 2026-06-08 cond-mat.soft 版本更新 50%

Mesoscale simulation model for odd fluids

介观尺度奇流体模拟模型

Yuxing Jiao, Mingcheng Yang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种高效粗粒模拟方法,用于研究具有时间反演对称性破缺的奇流体,推导了其输运系数并验证了模型的准确性,为研究奇流体的异常输运现象提供了新途径。

Comments 6 pages, 4 figures

Journal ref Phys. Rev. E, 113, 055102 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2606.06601 2026-06-08 cs.CV cs.AI cs.LG 新提交 77%

Direct 3D-Aware Object Insertion via Decomposed Visual Proxies

通过分解视觉代理实现直接3D感知物体插入

Jingbo Gong, Yikai Wang, Yushi Lan, Yuhao Wan, Ziheng Ouyang, Rui Zhao, Ming-Ming Cheng, Qibin Hou, Chen Change Loy

机构 * Google(谷歌) Black Forest Labs(黑森林实验室)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出DIRECT框架,通过分解外观、几何和上下文引导,实现可控制3D姿态的物体插入,在几何可控性和视觉质量上优于现有方法。

Comments ICML 2026; Project Page: https://gong1130.github.io/DIRECT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06498 2026-06-08 cs.GR cs.CV 新提交 73%

Semantic-Structural Alignment for Generative Pictorial Charts

生成式图形图表的语义-结构对齐

Zhida Sun, Yulin Zhang, Zheng Gu, Min Lu, Bongshin Lee, Daniel Cohen-Or, Hui Huang

机构 * Visual Computing Research Center (VCC), College of Computer Science and Software Engineering (CSSE) Shenzhen University China(视觉计算研究中心(VCC)、计算机科学与软件工程学院(CSSE)深圳大学中国)

专题命中 可控生成 :diffusion(abstract);image editing(abstract);分类 cs.CV、cs.GR

AI总结 提出一种生成式框架,通过多模态扩散变压器中的结构对齐和语义对齐机制,实现兼具艺术表现力和结构保真度的图形图表自动合成。

Comments 11 pages, 17 figures, Accepted to ACM TOG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07244 2026-06-08 cs.RO cs.AI cs.CV 新提交 57%

Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation

超越航点:面向视觉语言导航的轨迹中心航点范式

Haoxiang Shi, Xiang Deng, Haoyu Zhang, Qiaohui Chu, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出轨迹航点范式,通过TSDF引导的扩散策略预测可执行轨迹,解决VLN-CE中航点不可达与规划控制不一致问题,在基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07117 2026-06-08 cs.CV cs.AI 新提交 57%

Native3D: End-to-End 3D Scene Generation via Unified Mesh-Texture Modeling and Semantic Alignment

Native3D: 通过统一网格纹理建模与语义对齐的端到端3D场景生成

Yibo Liu, Ziwei Zhang, Haozhou Pang, Menghao Li, Lanshan He, Gan Qi

机构 * Kuaishou GameMind Lab(快手游戏大脑实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Native3D,首个完全绕过2D中间表示的端到端3D场景生成框架,通过统一网格纹理联合表示和3D表示对齐损失,解决几何结构失真和纹理细节退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06901 2026-06-08 cs.CV 新提交 57%

LUCID: Learning Unified Control for Image Deflaring and Exposure Mastery in Nighttime Photography

LUCID:夜间摄影中图像去眩光与曝光控制的统一学习

Tingyu Yang, Yuan Cheng, Xiaoyun Yuan

机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家实验室) AI Institute(人工智能研究所) School of Computer Science(计算机科学学院) School of Biomedical Engineering(生物医学工程学院) School of Artificial Intelligence(人工智能学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出LUCID统一框架,通过眩光解缠模块和扩散驱动模块联合处理夜间图像中的眩光和噪声,并引入四模式训练实现可控恢复,支持HDR重建,性能优于现有方法。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15354 2026-06-08 cs.LG 版本更新 50%

Controllable Molecular Generative Foundation Models

可控分子生成基础模型

Yihan Zhu, Yuhan Liu, Weijiang Li, Tengfei Luo, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出CoMole,一种基于基团感知图扩散的统一框架,结合强化学习优化条件反向策略,在材料与药物设计的九个目标上均实现最优可控性,MAE最高降低48.2%,且无需规则修正。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 2 篇

2606.07115 2026-06-08 cs.CV cs.GR 新提交 62%

3DMorph: Single-Image-Guided Local 3D Shape Editing and Morphing

3DMorph: 单图引导的局部3D形状编辑与变形

Tobias Preintner, Yunfei Deng, Phillip Müller, Sebastian Illing, Adrian König, Thomas Bäck, Elena Raponi, Niki van Stein

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV、cs.GR

AI总结 提出无训练框架3DMorph,通过单张编辑图像自动定位并转移2D修改到3D局部区域,同时支持中间形状生成,在Delta3D基准上优于现有方法。

Comments Accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07090 2026-06-08 cs.CV 新提交 57%

Detecting Temporally Localized Manipulations in Authentic Video Streams

检测真实视频流中的时间局部操纵

Okan Umur, Ali Emre Güşlü, Ibrahim Delibasoglu

机构 * Okan Umur Ali Emre Güşlü Ibrahim Delibasoglu

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 针对真实视频中插入短时逼真操纵片段难以检测的问题,提出新数据集并评估两种方法:基于DINOv3特征的线性探针和连续帧相似性方法,建立初步基准。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 2 篇

2606.07185 2026-06-08 cs.CV 新提交 57%

AdaTok: Self-Budgeting Image Tokenization with Quality-Preserving Dynamic Tokens

AdaTok: 具有质量保持动态令牌的自预算图像令牌化

Xiaocheng Lu, Yuxi Chen, Jie Zhang, Jian Liu, Jingcai Guo, Fangqi Zhu, Tao Han, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出AdaTok,一种自预算离散一维令牌化器,通过表示-分配协同设计(优先表示学习和自适应令牌分配)实现图像自适应令牌数量,在保持重建质量的同时减少平均令牌数。

Comments Preprint; 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15287 2026-06-08 cs.CV 版本更新 57%

Consistency-Preserving Diverse Video Generation

保持一致性的多样化视频生成

Xinshuang Liu, Runfa Blark Li, Truong Nguyen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出一种联合采样框架,在保持时间一致性的同时提高文本到视频生成中批次内视频的多样性,通过轻量级潜在空间模型避免视频解码和反向传播。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 1 篇

2605.07496 2026-06-08 cs.RO 版本更新 78%

PathPainter: Transferring the Generalization Ability of Image Generation Models to Embodied Navigation

PathPainter:将图像生成模型的泛化能力迁移至具身导航

Yijin Wang, Yuru Tian, Xijie Huang, Weiqi Gai, Mo Zhu, Xin Zhou, Yuze Wu, Fei Gao

机构 * Tsinghua University(清华大学)

专题命中 图像生成评测 :image generation(title,abstract)

AI总结 提出利用鸟瞰图作为全局先验的导航系统,通过图像生成模型理解自然语言意图并生成可通行掩码,结合跨视图定位消除里程计漂移,在无人机平台上完成160米室外长距离导航。

Comments Work in the progress. 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 4 篇

2606.06712 2026-06-08 cs.CL cs.AI 新提交 78%

Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation

数据高效的自回归到扩散语言模型通过策略内蒸馏

Xingyu Su, Jacob Helwig, Shubham Parashar, Atharv Chagi, Lakshmi Jotsna, Degui Zhi, James Caverlee, Dileep Kalathil, Shuiwang Ji

机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯大学阿马尔科分校计算机科学与工程系) Department of Bioinformatics and Systems Medicine, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校生物信息学与系统医学系) Department of Electrical and Computer Engineering, Texas A&M University(德克萨斯大学阿马尔科分校电气与计算机工程系)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 提出策略内扩散语言模型(OPDLM),通过策略内蒸馏将自回归模型转换为扩散语言模型,解决分布偏移和训练-推理不匹配问题,实现15倍至7000倍更少训练数据下的强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07481 2026-06-08 cs.LG 新提交 50%

Drifting Models for Surrogate Flow Modeling

用于代理流建模的漂移模型

Chris R. Jung, Markus Dörr, Natalie Jüngling, Jennifer Niessner, Adam T. Müller, Nicolaj C. Stache

机构 * Center for Machine Learning (ZML)(机器学习中心(ZML)) Institute for Flow in Additively Manufactured Porous Structures (ISAPS)(添加剂制造多孔结构流动研究所(ISAPS)) Heilbronn University of Applied Sciences(海德堡应用科学大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出条件漂移框架,在VAE潜空间中进行漂移并利用标签感知掩码对齐边界条件,实现高质量单步生成,速度比迭代扩散快两个数量级。

Comments Accepted to the 2nd International Symposium AI and Fluid Mechanics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06789 2026-06-08 physics.plasm-ph 新提交 50%

Flow-Regulated Suprathermal Particle Acceleration in Weakly Collisional Astrophysical Plasmas

弱碰撞天体等离子体中的流调控超热粒子加速

Ji-Hoon Ha, Elena S. Volnova

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 利用一维Fokker-Planck框架研究弱碰撞等离子体中超热粒子群的形成,引入系统性速度空间漂移项描述流驱动的净能量化,发现速度空间扩散主导超热尾形成,而流漂移调控其效率和谱特性。

Comments 15 pages, 6 figures, Accepted for publication in JETP

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09580 2026-06-08 cs.RO cs.LG 版本更新 50%

SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows

SERNF: 通过动作块评论家和归一化流实现样本高效的真实世界灵巧策略微调

Chenyu Yang, Denis Tarasov, Davide Liconti, Romain Guntz, Hehui Zheng, Robert K. Katzschmann

机构 * Soft Robotics Lab, D-MAVT(软机器人实验室,D-MAVT) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出SERNF框架,结合归一化流策略和动作块评论家,实现真实世界灵巧操作策略的样本高效微调,解决多模态动作分布和信用分配问题。

Comments https://srl-ethz.github.io/SERNF/

详情

展开后加载摘要…

URL PDF HTML 收藏