arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-01 至 2026-07-01 共收录 119 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 91 篇

2606.31574 2026-07-01 cs.CV cs.AI cs.LG 新提交 57%

Temperature Field Reconstruction of Tungsten Monoblock Divertor on EAST using Physics-aware Neural Operator Transformer

基于物理感知神经算子Transformer的EAST钨单体偏滤器温度场重建

Zikang Yan, Xiao Wang, Qingquan Yang, Zhendong Yang, Gaoting Chen, Zehua Chen, Bo Jiang, Jin Tang, Guosheng Xu

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Institute of Plasma Physics, Chinese Academy of Sciences(中国科学院等离子体物理研究所) Tongling University(铜陵学院) College of Physics, Donghua University(东华大学物理学院) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对偏滤器温度场实时重建需求,提出物理感知神经算子Transformer(PNOT),通过图注意力捕捉空间物理依赖、物理感知算子聚合相似物理条件点、梯度约束Sobolev正则化保持物理一致性,实现高精度快速重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31095 2026-07-01 cs.CV 新提交 57%

Do Not Break the Vessels: Structure-Preserving Mean Flow for Vascular Image Translation

不要破坏血管:用于血管图像翻译的结构保持平均流

Changjin Sun, Zhuo Hu, Kaini Wang, Baixuan Wu, Shuo Gao, Runan Zheng, Cheng Xue, Yudong Zhang, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Zhejiang University(浙江大学) Suzhou Microclear Medical Instruments Co.(苏州微清医疗器械有限公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出结构保持平均流(SPMF)框架,通过拓扑不变传输和正交约束,在扩散模型中保持血管结构,并在NIRII-to-2PF和眼底数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31018 2026-07-01 cs.CV 新提交 57%

WarpI2I: Image Warping for Image-to-Image Translation

WarpI2I:用于图像到图像翻译的图像扭曲

Shen Zheng, Anurag Ghosh, Gaurav Parmar, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于显著性的扭曲-反扭曲框架,通过重新分配空间表示至显著区域,在不增加潜在分辨率的情况下保留图像细节,适用于人体重光照、驾驶场景翻译等任务。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30968 2026-07-01 cs.CV 新提交 57%

PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising

PhotoQuilt: 通过引导式分块去噪实现无训练任意分辨率的光马赛克

Koorosh Roohi, Javad Rajabi, Andrew Fleet, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Samsung Research(三星研究院) KITE Research Institute(KITE研究所) Queen’s University(女王大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PhotoQuilt框架,通过引导式分块去噪过程,在无需训练的情况下生成任意分辨率的光马赛克,兼顾全局结构与局部细节,并避免二次注意力成本。

Comments 17 pages, 9 figures. Project page: https://kooroshrh.github.io/photo-quilt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30849 2026-07-01 cs.CV cs.SD eess.AS 新提交 57%

SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation

SyncCache: 利用非对称动力学实现快速音频驱动肖像动画

Juncheng Ma, Yuxuan Du, Yanan Sun, Zhening Xing, Changlin Li, Zhenyu Tang, Bo Li, Peng-Tao Jiang, Li Yuan, Daquan Zhou, Yonghong Tian

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Shanghai AI Laboratory(上海人工智能实验室) Tencent Hunyuan(腾讯混元) vivo

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SyncCache,一种针对DiT肖像动画的无训练缓存加速方法,通过空间非对称探测和模态解耦缓存利用非对称动力学,实现高达4.12倍加速且保持视觉保真度和音频对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30807 2026-07-01 cs.RO cs.CR cs.CV 新提交 57%

Off the Rails: Hijacking the Scoring Head in Generative End-to-End Driving Planners with Safety-Violating Adversarial Perturbations

脱轨:利用违反安全的对抗扰动劫持生成式端到端驾驶规划器的评分头

Halima Bouzidi, Mboutidem Ekemini Mkpong, Haoyu Liu, Mohammad Abdullah Al Faruque

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对生成式端到端自动驾驶规划器中评分头的攻击面,提出Derail对抗框架,通过安全违规目标扰动使轨迹选择从安全候选翻转为不安全候选,评分下降39-80%,碰撞率高达50%。

Comments 23 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22905 2026-07-01 cs.CV 新提交 57%

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatar: 用于一致且意图感知的虚拟形象的实时流式视频生成

Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能科技(北京)有限公司) Wuhan University(武汉大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出InteractiveAvatar框架,通过自回归蒸馏实现实时无限流式生成,利用长短视觉记忆机制保持视觉一致性,并设计推理反应模块实现意图感知交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15305 2026-07-01 cs.CV 新提交 57%

CoMNet: A MedNeXt-CorrDiff Framework for Multi-Site Brain Tumor Segmentation

CoMNeT: 一种用于体积脑肿瘤分割的MedNeXt-CorrDiff框架

Michael L. Evans, MD Fayaz Bin Hossen, MD Shibly Sadique, Walia Farzana, Khan M. Iftekharuddin

机构 * Old Dominion University(欧道明大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出CoMNeT框架,结合3D卷积分割模型MedNeXt与校正扩散后处理CorrDiff,通过集成学习提升胶质瘤分割精度,在UTSW-Glioma数据集上取得优于基线模型的Dice分数。

Comments 15 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09100 2026-07-01 cs.CV cs.RO 版本更新 57%

Physically Grounded 3D Generative Reconstruction under Hand Occlusion using Proprioception and Multi-Contact Touch

基于本体感知和多接触触觉的物理 grounded 的 3D 生成重建在手部遮挡下

Gabriele Mario Caddeo, Pasquale Marra, Lorenzo Natale

机构 * Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种多模态、物理 grounded 的方法,用于在严重手部遮挡下进行度量尺度的无遮挡物体重建和姿态估计,通过本体感知和多接触触觉信号提升重建精度和物理一致性。

Comments 29 pages, 10 figures, Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16271 2026-07-01 cs.CV 版本更新 57%

VIGOR: VIdeo Geometry-Oriented Reward for Temporal Generative Alignment

VIGOR: 面向视频几何的时序生成对齐奖励

Tengjiao Yin, Jinglei Shi, Heng Guo, Xi Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于几何的奖励模型,利用预训练几何基础模型通过跨帧重投影误差评估多视图一致性,以点方式计算误差,并引入几何感知采样策略,通过后训练和推理时优化对齐视频扩散模型,提升生成视频的几何一致性。

Comments Project Page: https://vigor-geometry-reward.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05851 2026-07-01 cs.CV 版本更新 57%

VS3R: Robust Full-frame Video Stabilization via Deep 3D Reconstruction

VS3R:基于深度三维重建的鲁棒全帧视频稳定

Muhua Zhu, Xinhao Jin, Xinping Wang, Yu Zhang, Yifei Xue, Tie Ji, Yizhen Lao

机构 * Hunan University(湖南大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出VS3R框架,结合前馈三维重建与生成式视频扩散,通过联合估计相机参数、深度和掩码,并引入混合稳定渲染模块和稳定驱动扩散模型,实现高保真全帧视频稳定,在鲁棒性和视觉质量上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31991 2026-07-01 cs.LG cs.AI 新提交 50%

Amplifying Membership Signal Through Chained Regeneration

通过链式再生放大成员信号

Wojciech Łapacz, Stanisław Pawlak

机构 * Warsaw University of Technology(华沙理工大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出MADreMIA框架,利用链式再生迭代轨迹增强生成模型的成员推断和数据集推理攻击,在低误报率下提升信号强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31576 2026-07-01 cs.LG 新提交 50%

Introduction to Stochastic Differential Equations for Generative Machine Learning: A Variational Perspective

生成式机器学习中的随机微分方程导论:变分视角

Ole Winther, Paul Jeha, Sander Dieleman, Andriy Mnih, Manfred Opper, Andrea Dittadi

机构 * Department of Biology, University of Copenhagen(哥本哈根大学生物系) Department of Applied Mathematics and Computer Science, Technical University of Denmark(丹麦技术大学应用数学与计算机科学系) Google DeepMind(谷歌DeepMind) Technical University of Berlin (TU Berlin)(柏林工业大学) Technical University of Munich(慕尼黑工业大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文从变分视角出发,介绍常微分和随机微分方程在生成式机器学习中的应用,推导ELBO,并统一讨论扩散模型、分数匹配和流匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31334 2026-07-01 cs.AI 新提交 50%

Optimization Algorithms for Joint OFDM Waveform Design and RIS Configuration in 6G Networks: From Convex Relaxation to Foundation Models

面向6G网络的联合OFDM波形设计与RIS配置的优化算法:从凸松弛到基础模型

Ahmet Kaplan

机构 * Istanbul Medipol University(伊斯坦布尔梅迪波尔大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 综述2021-2026年间78篇联合OFDM-RIS优化工作,将其分为四类范式,发现基于ML的方法在推理速度上比模型方法快2-4个数量级,并指出六个开放挑战。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31128 2026-07-01 cs.SD cs.AI cs.CL eess.AS 新提交 50%

UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling

UniSAE:通过离散音素后验图建模实现说话人、情感和低级内容的统一语音属性编辑

Chuanbo Zhu, Wuyou Zhou, Rongxiu Zhong, Shilei Zhang, Kun Qian, Yike Guo, Wei Xue

机构 * China Mobile Science and Technology(中国移动科学技术) Beijing Institute of Technology(北京理工大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出UniSAE统一框架,通过离散音素后验图(DPPG)表示语音内容,支持从子音素到词级的说话人、情感和内容编辑,并采用扩散解码器生成语音。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30813 2026-07-01 cs.LG cs.AI 新提交 50%

Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization

梯度平滑:耦合逐层更新以改进优化

Haoming Meng, Anton Sugolov, Vardan Papyan

机构 * Vector Institute(向量研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出深度梯度增强框架,通过窗口平滑算子沿深度方向变换优化器更新,在不改变模型架构或训练目标下提升多种架构和任务的优化与泛化性能。

Comments Published in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30749 2026-07-01 cs.RO 新提交 50%

From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation

从抓取到灵巧:大规模抓取预训练用于灵巧操作

Ying Yuan, Xinyu Liu, Sriram Krishna, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种层次化模仿学习框架,利用大规模灵巧抓取数据集预训练低级控制器,再微调于下游工具使用任务,在仿真和真实实验中显著提升成功率。

Comments Project page: https://yingyuan0414.github.io/grasp2dexterity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28936 2026-07-01 math.AP 版本更新 50%

Hydrodynamic limit from nonlinear Fokker--Planck to barotropic Euler equations

从非线性Fokker-Planck到正压Euler方程的流体动力学极限

José A. Carrillo, Dowan Koo

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对退化扩散的非线性Fokker-Planck方程,利用相对熵方法和广义对数Sobolev不等式,建立了到正压Euler方程(含幂律压力)的流体动力学极限。

Comments 24 pages; fixed typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31146 2026-07-01 q-bio.PE math.PR 新提交 50%

Persistence, Thresholds, and Trait Composition in a Regulated Mutation-Selection Model

受调控的突变-选择模型中的持久性、阈值和性状组成

Phil. Pollett

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究一个受突变、选择和密度依赖调控的双性状种群模型,通过大种群极限确定灭绝、持久性和长期性状组成的阈值条件,并揭示突变、选择和资源限制如何共同塑造生态持久性和进化结果。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31431 2026-07-01 math.OC math.PR 新提交 50%

Exponential rate of convergence of relative value iteration algorithms for ergodic controls of diffusions

扩散过程遍历控制的相对值迭代算法指数收敛速率

Sumith Reddy Anugu, Guodong Pang

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对扩散过程在均匀指数稳定条件下的遍历成本和遍历风险敏感成本问题,提出基于偏微分方程修正的离散时间相对值迭代算法,并证明在加权上确界范数下具有指数收敛速率。

Comments This manuscript is 35 pages in length

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31057 2026-07-01 math.ST math.PR stat.TH 新提交 50%

Two-stage semiparametric inference for regime-switching jump diffusions with unknown Lévy densities

具有未知Lévy密度的机制转换跳跃扩散的两阶段半参数推断

Yuzhong Cheng

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对机制转换跳跃扩散模型,提出两阶段半参数方法:第一阶段用截断高斯拟似然估计参数,第二阶段用核平滑估计Lévy密度,并建立渐近性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30972 2026-07-01 math.NA cs.NA 新提交 50%

Local Gevrey regularity and Quasi-Monte Carlo quadrature for PDEs parameterized on non-compact domains

非紧致域参数化PDE的局部Gevrey正则性与拟蒙特卡罗求积

Dinh Dũng, Tùng Lê, Alexey Chernov

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对非紧致域上扩散系数具有局部Gevrey正则性的参数化椭圆PDE,证明弱解的局部Gevrey正则性,并基于此建立拟蒙特卡罗求积的收敛率,结合有限元离散误差给出完整误差分析。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31656 2026-07-01 cond-mat.soft physics.comp-ph 新提交 50%

Mesoscopic simulations of linear and ring polymer solutions with explicit hydrodynamics under good and poor solvent conditions

良溶剂和不良溶剂条件下具有显式流体动力学相互作用的线性和环形聚合物溶液的介观模拟

Ashish Kumar Singh, Angelo Rosa

专题命中 扩散模型 :diffusion(abstract)

AI总结 采用耗散粒子动力学模拟研究稀溶液中线性和环形聚合物的结构动力学,发现溶剂质量主导组织与输运,拓扑效应较弱。

Comments 10 pages, 8 figures, submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30922 2026-07-01 cond-mat.other 新提交 50%

An Interaction Language Model: Mechanism Discovery from Statistical Patterns of Physical Interactions

交互语言模型:从物理交互的统计模式中发现机制

Triparna Ganguly, Hanqi Jiang, Xinliang Li, Yi Pan, Junhao Chen, Miyuki Karunathilaka, Tianming Liu, Yohannes Abate

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出交互语言模型(ILM),通过统计学习物理交互的依赖关系,推断交互路径、识别缺失步骤并预测下一步交互,在分子扩散任务中实现可审计的机制发现。

Comments Corresponding authors: Tianming Liu, Yohannes Abate

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30858 2026-07-01 cond-mat.mes-hall physics.chem-ph 新提交 50%

Carbon encapsulation of levitated Au nanoparticles

悬浮金纳米颗粒的碳包覆

Joyce E. Coppock, Sunghyun Kim, B. E. Kane

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究高真空中激光脉冲加热悬浮金纳米颗粒时形成的蒸发屏障,发现其源于表面石墨烯层的生长,并受气体环境调控。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31327 2026-07-01 nucl-th astro-ph.HE hep-th physics.plasm-ph 新提交 50%

Relativistic magnetohydrodynamics from kinetic theory

从动理学理论出发的相对论磁流体动力学

Khwahish Kushwah

专题命中 扩散模型 :diffusion(abstract)

AI总结 基于相对论Boltzmann-Vlasov方程和14矩近似,推导了强电磁场下相对论耗散磁流体动力学的因果二阶方程,揭示了磁场诱导的各向异性输运和耗散振荡。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09204 2026-07-01 cs.RO cs.LG 版本更新 50%

Flow-Opt: Scalable Centralized Multi-Robot Trajectory Optimization with Flow Matching and Differentiable Optimization

Flow-Opt: 用于多机器人轨迹优化的可扩展集中式方法,结合流匹配与可微优化

Simon Idoko, Prajyot Jadhav, Arun Kumar Singh

机构 * University of Tartu(塔尔图大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出Flow-Opt,通过生成模型与可微优化提升集中式多机器人轨迹优化的计算效率,实现快速生成数十机器人在复杂环境中的平滑轨迹,并支持批量处理与多样化路径生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14750 2026-07-01 cond-mat.mtrl-sci 版本更新 50%

Morphological Transition: From Meanders to Mound Structures

形态转变:从蛇形图案到丘陵结构

Marta A. Chabowska, Hristina Popova, Magdalena A. Załuska-Kotur

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过晶界元胞自动机模型探讨了平表面和倾斜表面在生长过程中从蛇形图案到三维丘陵结构的形态演变,揭示了能量壁垒与质子扩散的竞争作用。

Comments 14 pages, 11 figures + supplementary materials

Journal ref Acta Materialia 316, 122477 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14410 2026-07-01 eess.SY cs.SY math.OC 版本更新 50%

Integrated Investment and Policy Planning for Power Systems via Differentiable Scenario Generation

通过可微场景生成实现电力系统的投资与政策规划整合

Robert Mieth

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种方法,联合优化电力系统容量规划决策与政策投资,通过可微场景生成技术提升规划模型的求解效率。

Comments Accepted to PowerUp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09344 2026-07-01 cs.SD eess.AS 版本更新 50%

DialogueSidon: Recovering Full-Duplex Dialogue Tracks from In-the-Wild Dialogue Audio

DialogueSidon: 从真实场景对话音频中恢复全双工对话轨道

Wataru Nakata, Yuki Saito, Kazuki Yamauchi, Emiru Tsunoo, Hiroshi Saruwatari

机构 * The University of Tokyo(东京大学) National Institute of Advanced Industrial Science and Technology (AIST)(国立研究开发法人产业技术综合研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 DialogueSidon通过联合恢复与分离降质单通道对话音频,提升识别与分离质量,并实现更快推理。

Comments 12 pages, 2 figures, Accepted to SIGDIAL2026

详情

展开后加载摘要…

URL PDF HTML 收藏