arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-20 至 2026-07-20 共收录 27 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 23 篇

2607.15846 2026-07-20 cs.AR 新提交 82%

DSTAR: Accelerating Diffusion Transformers via Spatial and Temporal Redundancy Reduction

DSTAR:通过减少空间和时间冗余加速扩散变换器

Chi Zhang, Jieru Zhao, Yu Feng, Chen Zhang, Quan Chen, Minyi Guo

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 研究针对扩散变换器多迭代推理低效耗能问题,提出软硬件协同设计框架DSTAR。算法上用细粒度混合精度量化和稀疏注意力重用机制,架构上设计专用硬件加速器,经评估在多个典型DiTs上实现显著延迟加速和节能,且不降低精度。

Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15650 2026-07-20 cs.CV 新提交 79%

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

DiTango:基于选择性注意力状态重用的经济高效并行扩散生成

Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) University of Science and Technology Beijing(北京科技大学) PJlab(PJ实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对扩散变换器并行化技术在多节点环境下通信开销大的问题,提出DiTango框架,通过选择性注意力状态机制及锚点引导的状态选择规划器等,在多节点设置中实现加速并保持生成质量。

Journal ref The 35th International Symposium on High-Performance Parallel and Distributed Computing (HPDC'26), July 13--16, 2026, Cleveland, OH, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15585 2026-07-20 cs.MM 新提交 79%

SPEED: One-Step Pixel Diffusion for High-quality Video Frame Interpolation

SPEED:用于高质量视频帧插值的单步像素扩散

Zihao Zhang, Haoyu Zhao, Siqian Yang, Yidi Wu, Yudong Jiang, Zuxuan Wu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.MM

AI总结 研究针对视频帧插值中现有扩散模型的问题,提出SPEED单步像素扩散框架。采用渐进多阶段架构、仅噪声更新注意力机制和漂移感知时间步采样策略,实现高质量单步推理,在多个基准测试中性能超越现有方法。

Comments ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15527 2026-07-20 cs.CV 新提交 79%

Physics-aware Masked Diffusion-based Flood Simulation for Urban Fisheye Disaster Detection

基于物理感知的掩码扩散的洪水模拟用于城市鱼眼灾害检测

Sodtavilan Odonchimed, Tsogt Enkhbayar, Oyunzul Munkhtamga, Munkhjargal Gochoo

机构 * The University of Tokyo(东京大学) Mongolian University of Science and Technology(蒙古科技大学) United Arab Emirates University(阿联酋大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现实中洪水数据短缺及鱼眼图像失真致高精度洪水模拟难的问题,提出PhysFlood系统,利用扩散模型从单张鱼眼图像合成逼真洪水,可自由控制生成多样场景,实验证明其模拟图像有逼真度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15693 2026-07-20 q-bio.NC cs.AI 新提交 78%

Toward a mechanistic understanding of inference in visual cortex and diffusion models

迈向对视觉皮层和扩散模型中推理的机制性理解

Zeyu Yun, Alexander Belsten, Dasheng Bi, Zahra Kadkhodaie, Yubei Chen, Bruno A. Olshausen

机构 * Dept. of Electrical Engineering and Computer Science, UC Berkeley(加州大学伯克利分校电气工程与计算机科学系) Helen Wills Neuroscience Institute, UC Berkeley(加州大学伯克利分校海伦·威尔斯神经科学研究所) Herbert Wertheim School of Optometry and Vision Science, UC Berkeley(加州大学伯克利分校赫伯特·韦特海姆视觉科学学院) Redwood Center for Theoretical Neuroscience, UC Berkeley(加州大学伯克利分校红木理论神经科学中心) Flatiron Institute(Flatiron研究所) Dept. of Electrical and Computer Engineering, UC Davis(加州大学戴维斯分校电气与计算机工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究旨在理解视觉皮层和扩散模型中推理,提出基于稀疏编码的模型,用去噪分数匹配等训练,其性能出色,能揭示递归动力学机制,还能断开部分潜在变量与视觉输入连接,连接神经科学与机器学习领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16090 2026-07-20 cs.LG cs.AI 新提交 78%

DADiff: Diffusion-Driven Cross-Domain Policy Adaptation for Reinforcement Learning

DADiff:用于强化学习的扩散驱动跨域策略适应

Hanyang Chen, Anirudh Satheesh, Longchao Da, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究强化学习中跨域策略适应问题,提出基于扩散的DADiff框架,利用源域和目标域生成轨迹差异估计动态不匹配,开发奖励修改和数据选择变体,实验表明该方法性能优于现有方法,有效解决动态不匹配。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15809 2026-07-20 eess.SY cs.SY 新提交 78%

From Similarity to Feasibility: Diffusion-Refined Retrieval-Augmented Generation for Distribution Network Optimization

从相似性到可行性:用于配电网优化的扩散细化检索增强生成

Yuxuan Chen, Haipeng Xie, Shuo Dai, Ruoyi Xu, Zhaohong Bie

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对配电网优化中传统方法的不足,提出GridRAG框架,通过将场景特征与最优解嵌入联合空间,检索相似历史场景,并用扩散模块细化解,实现跨场景通用且加速求解,相比基线有显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15773 2026-07-20 cs.LG 新提交 78%

From Diffusion to Reaction-Diffusion: A Dynamical-Systems View of Oversmoothing in Hypergraph Neural Networks

从扩散到反应扩散:超图神经网络中过平滑的动力系统视角

Zhiheng Zhou, Mengyao Zhou, Yancheng Chen, Dengyi Zhao, Xingqin Qi, Guiying Yan

机构 * School of Mathematics and Statistics, Shandong University, Weihai(山东大学(威海)数学与统计学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究超图神经网络过平滑问题,从动力系统视角出发,提出反应扩散框架HNRD,通过定义算子解释消息传递为扩散过程,分析得出过平滑是能量耗散现象,HNRD能补偿耗散稳定变化,实验证明其优于基线,为深度超图架构设计提供框架。

Comments 17 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15655 2026-07-20 cs.CL cs.LG 新提交 78%

Adaptive Multi-Step Lookahead Decoding for Diffusion Language Models

扩散语言模型的自适应多步前瞻解码

Yingqian Cui, Wei Deng, Lantao Mei, Hang Li, Charu C. Aggarwal, Hui Liu, Yue Xing

机构 * Michigan State University(密歇根州立大学) Morgan Stanley(摩根士丹利) IBM T.J. Watson Research Center(IBM 托马斯·J·沃森研究中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对扩散语言模型解码,提出自适应多步前瞻框架AdaLook,基于候选分数方差动态决定是否继续展开及进行分支扩展,避免不必要的深度展开,实验证明其在准确性和解码步骤权衡上优于现有一步前瞻解码方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15592 2026-07-20 cs.AI 新提交 78%

MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion

MGDT:具有关系自适应专家混合的MLLM引导扩散变压器用于多模态知识图谱补全

Xu Hou, Meiyu Liang, Wei Huang, Yawen Li, Zhe Xue, Wu Liu, Guanhua Ye, Lei Shi, Kangkang Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Communication University of China(中国传媒大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究多模态知识图谱补全问题,提出MGDT框架,先通过RASR-MoE模块选路径、抑干扰,再用MLLM对齐表示,最后KGDT去噪生成,实验证明该框架在三个基准数据集上性能优于基线。

Comments 8pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15485 2026-07-20 cs.LG math.PR stat.ML 新提交 78%

Diffusion models recover accurate mixture weights despite score function insensitivity

扩散模型即使在得分函数不敏感的情况下也能恢复准确的混合权重

Andrew Dennehy, Ramchandran Muthukumar, Rebecca Willett, Nisha Chandramoorthy

机构 * University of Chicago(芝加哥大学) Data Science Institute(数据科学研究所) Department of Computer Science(计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究基于得分的生成模型在多模态分布中恢复混合权重的问题,通过定义扩散得分敏感性指数,证明其控制目标分布参数估计准确性,还展示了噪声调度对敏感性及模式放大的影响,此框架可用于恢复目标分布的定性参数。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15903 2026-07-20 math.PR math.AP 新提交 78%

Uniqueness for nonlinear Fokker-Planck equations with general diffusion terms and their associated nonlinear Markov processes

具有一般扩散项的非线性福克 - 普朗克方程及其相关非线性马尔可夫过程的唯一性

Viorel Barbu, Yuqi Li, Michael Röckner

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究具有非对角扩散项的非线性福克 - 普朗克方程分布解唯一性,证明温和解在更大类中唯一,扩展以往结果,还证相关线性化方程唯一性,应用于麦克凯恩 - 弗拉索夫随机微分方程,建立\(L^{\infty}\)估计并证明其解的路径律构成非线性马尔可夫过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15692 2026-07-20 math.DS nlin.PS 新提交 78%

Constructing far-from-equilibrium patterns in a cross-diffusion vegetation-autotoxicity model

在交叉扩散植被自毒模型中构建远离平衡态模式

Annalisa Iuorio, Cinzia Soresina, Frits Veerman

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究利用几何奇异摄动理论,在受毒性影响的植物生长交叉扩散模型中构建稳态、周期、前沿型远离平衡态模式,扩展一维模式分析技术,证明其单参数族存在性,并依临界流形形状确定前沿型模式出现条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16190 2026-07-20 cs.CV 新提交 57%

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation

FVAttn:用于视频生成的具有运行时负载均衡的自适应稀疏注意力

Hao Liu, Chenghuan Huang, Ye Huang, Zhiying Wen, Hao Liu, Mohan Zhang, Chen Li, Ziyang Ma, Jing Lyu, Jiangsu Du

机构 * Tencent Inc.(腾讯公司) Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频生成中自注意力瓶颈问题,提出FVAttn方法,通过Top-$p$路由等技术及运行时负载均衡等策略,提升自适应稀疏注意力分布式执行效率,降低负载不平衡,实现注意力和推理加速,且视频质量有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15898 2026-07-20 cs.CV cs.AI cs.LG cs.RO 新提交 57%

Orbis 2: A Hierarchical World Model for Driving

Orbis 2:一种用于驾驶的分层世界模型

Sudhanshu Mittal, Arian Mousakhan, Silvio Galesso, Karim Farid, Jonannes Dienert, Rajat Sahay, Thomas Brox

机构 * University of Freiburg(弗莱堡大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对当前世界模型不足提出分层驾驶世界模型,跨两层分解预测,结合扩散强制预训练和教师强制微调,在长距离生成保真度等多方面取得领先成果。

Comments Project page: https://lmb-freiburg.github.io/orbis2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15849 2026-07-20 cs.CV cs.AI 新提交 57%

Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation

用于逼真自回归视频生成的测试时噪声引导适应

Dimitrios Karageorgiou, Symeon Papadopoulos, Ioannis Kompatsiaris, Efstratios Gavves

机构 * Information Technologies Institute, CERTH(信息技术研究所,希腊研究与技术中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对自回归视频扩散模型误差积累问题,提出TANGO方法,通过噪声引导优化避免模型陷入终点,在VBench上有显著改进,降低了弗雷歇视频距离。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15667 2026-07-20 cs.CV 新提交 57%

PE-Field 4D: Video Generation Models as Canvas

PE-Field 4D:作为画布的视频生成模型

Yunpeng Bai, Haoxiang Li, Qixing Huang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Pixocial Technology(皮克社交科技)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究视频生成中扩散变换器控制场景几何形状的挑战,通过重新审视位置编码作用,引入几何感知交叉注意力机制及相关编码方案,构建可控视频生成框架,提升视点相关编辑任务的空间可控性且保留模型生成先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16132 2026-07-20 math.AP math.PR 新提交 50%

Fluctuation dynamics in randomly advected Navier-Stokes equations below critical scaling

低于临界标度的随机平流纳维 - 斯托克斯方程中的涨落动力学

Arnaud Debussche, Martina Hofmanová

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究随机平流纳维 - 斯托克斯方程,引入双参数模型族。在完全亚临界情形下证明大数定律,二维中更强假设下确定主导涨落,给出解的收敛情况及涨落特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15934 2026-07-20 math.NA cs.NA 新提交 50%

A Projected Drift-Randomized Milstein Method for SDEs with Non-differentiable and Super-linear Drift Coefficients

一种用于具有不可微和超线性漂移系数的随机微分方程的投影漂移随机化米尔斯坦方法

Shuai Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对不可微且超线性增长漂移系数的随机微分方程,提出投影漂移随机化米尔斯坦方法,通过纳入漂移投影扩展方法,在特定条件下建立稳定性估计与残差界,实现L2意义下一阶强收敛,数值实验验证了收敛率与适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15841 2026-07-20 math.AP cs.NA math.NA 新提交 50%

Recovery of a Measure-valued Source in the Heat Equation from Sparse Boundary Measurements

从稀疏边界测量中恢复热方程中的测度值源

Ulysse Dalmasso, Siyu Cen, Yavar Kian

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究从稀疏边界测量中唯一确定测度值源的逆源问题,结合正则性等分析工具及数值研究,将相关文献从点源或\(L^2\)源扩展到一般拉东测度,实现点源和曲线上源的重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15334 2026-07-20 physics.comp-ph 新提交 50%

Loss of positive definiteness is a symptom, not the cause, of high-Weissenberg-number breakdown

正定的丧失是高魏森贝格数崩溃的症状,而非原因

Yuan Yu, Lanjin Lian, Feiyang Chu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究高魏森贝格数下数值崩溃问题,推导不定状态定量理论,通过多种测试和分析得出正定丧失非崩溃必要充分条件,离散耦合路径起决定作用,违反是分辨率指标并提供监测器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15492 2026-07-20 physics.med-ph nlin.CD physics.bio-ph 新提交 50%

Differentiable Cardiac Electrophysiology Simulations for Dynamical State and Parameter Estimation

用于动态状态和参数估计的可微心脏电生理模拟

Adarsh Pashikanti, Shrey Chowdhary, Alex Ho, Weizhen Li, Emilia Entcheva, Jan Christoph

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究心脏电生理模拟,提出可微模拟方法,通过定义损失函数并经基于梯度的优化最小化,结合有限差分法和平滑粒子流体动力学方法,能学习参数恢复动态,可应用于多种数据,有助于心律异常诊断及心脏个性化模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15785 2026-07-20 cond-mat.dis-nn cond-mat.mes-hall 新提交 50%

A Flickering Resonance Degeneracy on Entropy-Ruled Charge Transport in the Extended Hopping Sites for Biological Systems: Role of Static-to-Dynamic Disorder Transition

生物系统扩展跳跃位点中熵主导电荷传输的闪烁共振简并:静态到动态无序转变的作用

K. Navamani, M. Pavalamuthu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究生物系统电荷传输,提出闪烁共振耦合熵主导电荷传输理论,用于计算转移速率和扩散迁移率,考虑动态无序相关简并对电子转移速率和扩散迁移率的影响,揭示超快动力学和简并情况下迁移率的转变。

Comments 18 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 2 篇

2607.15711 2026-07-20 cs.CV cs.AI 新提交 79%

Efficient Difficulty-Aware Dynamic Routing for Diffusion-Based Real-World Image Super-Resolution

基于扩散的真实世界图像超分辨率的高效难度感知动态路由

Xue Wu, Kang Zhao, Kafeng Wang, Jianfei Chen, Jingwei Xin, Nannan Wang, Xinbo Gao

专题命中 图像修复 :diffusion(title,abstract);分类 cs.CV

AI总结 研究基于扩散的真实世界图像超分辨率方法的局限,提出难度感知动态路由(DDR)策略,设计难度估计器并构建不同容量网络,实验证明该模型相比现有方法在效率和有效性上更具优势。

Comments ICML 2026 under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15482 2026-07-20 cs.LG 新提交 78%

Inpainting Insights: Elevating Visual XAI with Photorealistic Perturbations

图像修复见解:通过逼真的扰动提升视觉可解释人工智能

Josef Lindl, Mariana Chaves, Damien Garreau

机构 * Julius-Maximilians-Universität Würzburg(维尔茨堡大学) University of Groningen(格罗宁根大学)

专题命中 图像修复 :inpainting(title,abstract)

AI总结 针对机器学习模型行为难解释问题,通过调整LIME,利用生成式图像修复改进基于扰动的图像解释,获得更逼真样本,提升了解释质量。

Comments Preprint accepted at XAIE4 (ICPR 2026). 15 pages, 5 figures, 4 tables. Code available at: https://github.com/jo01123/LILI and https://github.com/m-chaves/LIME

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2607.15643 2026-07-20 math.NA cs.NA 新提交 50%

Penalty-scaling effects in nonsymmetric interior-penalty DG discretizations of viscous rotating shallow-water equations

粘性旋转浅水方程非对称内罚 DG 离散化中的罚标度效应

Xue Zhang, Jingmin Xia, Xu Qian

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 研究粘性旋转浅水方程非对称内罚 DG 离散化中内罚参数标度的影响,通过局部 Lax--Friedrichs 通量近似双曲项,比较$\beta = 1$和$\beta = 3$,建立相关性质,经测试表明标准标度在精度-成本折衷上表现更好。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他图像生成 1 篇

2607.15686 2026-07-20 cs.AI 新提交 50%

S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and Generation

S1-Omni:用于科学理解、预测和生成的统一多模态推理模型

Jiahao Zhao, Junyi Liu, Lifeng Xu, Nan Xu, Qingli Wang, Qingxiao Li, Tianle Chen, Xiaoyu Wu, Yawen Zheng, Zikai Wang, Guanming Liu, Hequn Zhou, Jingyi Wang, Jingyuan Shu, Keqi Wang, Li He, Songyang Diao, Wenhui Xu, Xinyu Ren, Yaqin Fan, Yujin Zhou, Zhanao Yao

机构 * ScienceOne AI(科学一号人工智能) Wenge AI(文阁人工智能)

专题命中 其他图像生成 :image generation(abstract)

AI总结 研究针对科学人工智能模型能力分散问题,提出S1-Omni统一多模态推理模型,基于科学数据统一表示、知识对齐和解码三个核心组件,经训练和评估,在多基准测试中表现出色优于同类模型,为统一科学建模提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏