arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-19 至 2026-08-19 共收录 78 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 64 篇

2608.15826 2026-08-19 math.NA 版本更新 50%

Robust Block Preconditioning for 3D nonlinear steady-state radiation transport equations

三维非线性稳态辐射输运方程的鲁棒块预处理方法

Yunpan Ma, Lingxiao Li, Changhui Yao

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对带热扩散项的三维非线性稳态辐射输运方程,该研究基于离散纵标法构建三种不同耦合近似的块预条件子,结合Newton-Krylov求解器,经数值实验验证其网格无关性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21108 2026-08-19 math.NA 版本更新 50%

A stability-preserving polytopal discontinuous Galerkin method for the Fisher-Kolmogorov model with applications to neurodegenerative disease modelling

一种用于Fisher-Kolmogorov模型的保持稳定性的多面体间断Galerkin方法及其在神经退行性疾病中的应用

Paola Francesca Antonietti, Francesca Bonizzoni, Mattia Corti, Nicola De March, Salvatore Di Noto, Francesco Regazzoni

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究针对神经退行性疾病中广泛使用的Fisher-Kolmogorov模型,在离散层面解非负性不保的问题,采用多边形和多面体网格上的间断Galerkin方法及Crank-Nicolson格式,推导稳定性和误差估计,经实验验证方法具高阶精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08642 2026-08-19 cs.CL 版本更新 50%

DominoTree: Conditional Tree-Structured Drafting with Domino for Speculative Decoding

DominoTree:使用Domino进行条件树结构草稿的推测性解码

Saw S. Lin (Zhiqi Zhang), Jyh-Shing Roger Jang

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与资讯工程学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究提出DominoTree,一种无需训练的最佳优先草稿树,利用Domino的条件非因式分解校正评分。在Qwen3-4B等基准测试中,相比自回归解码加速显著,接受长度高,用GPU原生构建器保持低成本,在吞吐量上优于多种方法。

Comments 32 pages, 2 figures, 16 tables. Code: this https URL (https://github.com/slin-zhq/Domino-Tree)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31057 2026-08-19 math.ST math.PR 版本更新 50%

Tail-corrected semiparametric inference for regime-switching jump diffusions

具有未知Lévy密度的机制转换跳跃扩散的两阶段半参数推断

Yuzhong Cheng

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对机制转换跳跃扩散模型,提出两阶段半参数方法:第一阶段用截断高斯拟似然估计参数,第二阶段用核平滑估计Lévy密度,并建立渐近性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20560 2026-08-19 cs.LG cs.AI 版本更新 50%

How Transparent is DiffusionGemma?

DiffusionGemma 的透明度如何?

Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthooran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveira, Rohin Shah, Neel Nanda

机构 * Google(谷歌)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究DiffusionGemma在连续潜空间中的推理透明度,通过变量透明度和算法透明度分解,发现可解释的令牌瓶颈将不透明串行深度降至Gemma 4的1.1倍,并揭示扩散特有现象。

Comments 20 main text pages and 6 pages of references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12499 2026-08-19 cs.RO 版本更新 50%

Action-Effect Memory Pretraining for Robot Manipulation

动作-效应记忆预训练用于机器人操作

Yijing Zhou, Qiwei Liang, Sitong Zhuang, Jiaxi Li, Xianpeng Wang, Boyang Cai, Yunyang Mo, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出AEM框架,通过视觉-动作历史掩码建模学习紧凑时间表征,提升机器人操作在部分可观测环境下的性能,优于单帧预训练和帧堆叠方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06323 2026-08-19 cs.RO 版本更新 50%

VOLT: Vision and Language Trajectory Segmentation for Faster-than-Demonstration Policies

VOLT: 面向超演示速度策略的视觉与语言轨迹分割

Robert Ramirez Sanchez, Daniel J. Evans, Dylan P. Losey, Siddarth Jain

机构 * Collab , Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, VA 24061(机械工程系,弗吉尼亚理工学院,布莱克斯堡,VA 24061) Mitsubishi Electric Research Laboratories ( MERL ), Cambridge, MA 02139(三菱电机研究实验室(MERL),剑桥,MA 02139)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出VOLT方法,通过视觉与语言线索对演示轨迹进行分割,选择性下采样安全加速部分,保留需要精细操作的慢速段,从而训练出比演示更快的机器人策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20226 2026-08-19 cs.LG eess.SY 版本更新 50%

Parametric and Generative Forecasts of EPEX Day-Ahead Energy Market Curves

EPEX日前能源市场曲线的参数化和生成式预测

Julian Gutierrez, Redouane Silvente

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校) CREST, ENSAE, Institut Polytechnique de Paris(CREST、ENSAE、巴黎理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究EPEX日前能源市场曲线预测,提出参数化和生成式两种方法,参数方法用极端梯度提升,生成方法用条件去噪扩散概率模型,通过曲线重建和存储优化问题评估,生成式方法在存储应用中有更好表现。

Comments 40 pages, 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03035 2026-08-19 quant-ph cond-mat.str-el 版本更新 50%

Who can compete with quantum computers? Lecture notes on quantum inspired tensor networks computational techniques

谁能与量子计算机竞争?基于张量网络的量子启发式计算技术讲义

Xavier Waintal, Chen-How Huang, Christoph W. Groth

专题命中 扩散模型 :diffusion(abstract)

AI总结 本讲义系统介绍张量网络核心算法(MPS/MPO),强调其作为超大矩阵线性代数工具,涵盖DMRG、TCI等算法,并展示在量子计算模拟、量子退火和偏微分方程求解中的应用。

Comments 65 pages, 92 figures. Set of lectures given at the Jyväskylä summer school during August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22046 2026-08-19 astro-ph.SR astro-ph.GA 版本更新 50%

The Cooling of Old White Dwarfs in 47 Tucanae

47仙女座球状星团中老白矮星的冷却

Leesa Fleury, Harvey Richer, Jeremy Heyl

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过哈勃空间望远镜观测分析47仙女座球状星团中白矮星的冷却过程,探讨元素扩散处理和氢包层厚度对白矮星冷却模型的影响,发现较厚的氢包层模型更符合观测数据。

Comments 23 pages, 13 figures, published in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 3 篇

2608.17559 2026-08-19 cs.CV 新提交 57%

MSEditor: Toward Consistent Multi-Shot Video Editing

MSEditor:面向一致性多镜头视频编辑

Kunyu Feng, Yue Ma, Bingyuan Wang, Yuefeng Wang, Zhiyuan Qin, Hao Cheng, Hao Li, Qifeng Chen, Zeyu Wang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 针对多镜头视频编辑的身份漂移与累积误差问题,提出首个专用框架MSEditor,通过监督适配器与跨镜头打包策略实现一致性编辑,在基准上性能优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16299 2026-08-19 cs.CV 版本更新 57%

Repurposing 3D Generative Model for Autoregressive Layout Generation

将3D生成模型重新利用于自回归布局生成

Haoran Feng, Yifan Niu, Zehuan Huang, Yang-Tian Sun, Yuxin Peng, Lu Sheng

机构 * School of Software, Beihang University(北航软件学院) Tsinghua University(清华大学) University of Hong Kong(香港大学) Tencent Hunyuan(腾讯文英) Peking University(北京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LaviGen框架,利用3D生成模型直接在3D空间中生成布局,通过自回归过程建模几何关系和物理约束,提升3D场景的物理合理性与效率。

Comments this https URL (https://fenghora.github.io/LaviGen-Page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22782 2026-08-19 cs.CV 版本更新 57%

Know3D: Prompting 3D Generation with Knowledge from Vision-Language Models

Know3D: 通过视觉-语言模型的知识提示3D生成

Wenyue Chen, Wenjue Chen, Peng Li, Qinghe Wang, Xu Jia, Heliang Zheng, Rongfei Jia, Yuan Liu, Ronggang Wang

机构 * Peking University(北京大学) Math Magic(数学魔术) The Hong Kong University of Science and Technology(香港科学与技术大学) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) Dalian University of Technology(大连理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。

Comments ECCV2026 page: this https URL (https://xishuxishu.github.io/Know3D.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2607.22924 2026-08-19 cs.CV 版本更新 57%

Layering Virtual Try-On

分层虚拟试穿

Chun Feng, Bowei Chen, Mengyi Shan, Ira Kemelmacher-Shlizerman

机构 * University of Washington(华盛顿大学)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 研究针对现实中服装分层搭配的虚拟试穿难题,提出LVTON方法。先通过自动数据生成管道训练获取一般VTON先验知识,再在专用数据集微调学习分层逻辑,在LVTON基准及传统VTON基准上取得优异成果,展现零样本能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 3 篇

2608.01035 2026-08-19 cs.RO cs.AI cs.CV 版本更新 79%

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

WAM-Diff2:面向高效自动驾驶视觉-语言-动作(VLA)的分层自回归到扩散蒸馏

Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 WAM-Diff2通过三阶段分层蒸馏策略,将预训练自回归VLA模型转化为高效扩散模型,缓解暴露偏差、实现与基线相当性能,解码速度提升2.8倍,结合系统级优化后达15.1倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17995 2026-08-19 cs.CV 新提交 57%

AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation

AViTS:用于高效动态分辨率生成的自适应时空令牌选择

Haoran Qin, Zhengan Yan, Shikang Zheng, Xiaobing Tu, Jiacheng Liu, Yuqi Lin, Chang Zou, JinShan Liu, Peiliang Cai, Xiantao Zhang, Jinkui Ren, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) Jilin University(吉林大学) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对扩散变换器动态分辨率采样的冗余计算问题,提出AViTS框架,通过时空重要性感知的选择性上采样减少冗余,在FLUX等模型上实现显著加速且与其他优化技术兼容

Comments Accepted to ECCV 2026. 20 pages including appendix. Code: this https URL (https://github.com/QHR69/AViTS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17022 2026-08-19 math.PR math.AP 新提交 50%

Sharp hypocoercive convergence estimates for underdamped Langevin dynamics with specular reflection

Hengrong Du, Qi Feng, Lingjiong Zhu

专题命中 效率与蒸馏 :diffusion(abstract)

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他图像生成 1 篇

2601.13901 2026-08-19 astro-ph.IM 版本更新 50%

Prospecting MeerKAT Continuum Data for Enigmatic Radio Sources with Unsupervised Vector-Quantised Variational Autoencoders

利用无监督向量量化变分自编码器探测恩igmatic射电源的MeerKAT连续数据

Fernando L. Ventura, Kshitij Thorat, Anna Bosman, Roger Deane, Christopher Cleghorn

专题命中 其他图像生成 :image generation(abstract)

AI总结 利用无监督向量量化变分自编码器探测MeerKAT连续数据中的异常射电源,提升大规模数据搜索效率。

Comments 12 pages, 14 figures, submitted to RAS Techniques and Instruments

详情

展开后加载摘要…

URL PDF HTML 收藏