arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-16 至 2026-06-16 共收录 184 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 142 篇

2606.15534 2026-06-16 cs.CV 新提交 57%

Track2View: 4D-Consistent Camera-Controlled Video Generation via Paired 3D Point Tracks

Track2View: 通过配对3D点轨迹实现4D一致的相机控制视频生成

Feng Qiao, Zhaochong An, Zhexiao Xiong, Serge Belongie, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) University of Copenhagen(哥本哈根大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Track2View,利用配对3D点轨迹为视频扩散变压器提供显式时空对应,实现新视角视频渲染,在视觉质量、视角同步和相机精度上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14988 2026-06-16 cs.GR 新提交 57%

Toward Richer Material Generation via Procedural Data Enhancement

通过程序化数据增强实现更丰富的材质生成

Yunchen Yu, Jacob Munkberg, Jon Hasselgren, Chris Cummings, Steve Marschner, Andrea Weidlich

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 提出一种程序化数据增强方法,将简单PBR材质的单瓣GGX镜面反射扩展为多层模型,以捕获更丰富的非漫反射效果,并通过神经材质编码和扩散模型生成实现更丰富的材质生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14972 2026-06-16 cs.CV 新提交 57%

ReGenHuman: Re-Generating Human Appearances for Realistic Full-Body Video Anonymization

ReGenHuman: 重新生成人体外观以实现逼真的全身视频匿名化

Adam Sun, Eshaan Barkataki, Arnold Milstein, Gordon Wetzstein, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出ReGenHuman,首个同时实现逼真、时间一致且天生匿名的全身视频匿名化流水线,采用“重新生成而非编辑”范式,利用结构条件微调视频扩散模型合成人体区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14759 2026-06-16 cs.CV cs.AI 新提交 57%

Temporally Consistent and Controllable Video Generation of 2D Cine CMR via Latent Space Motion Modeling

基于潜在空间运动建模的二维电影心脏磁共振时序一致且可控视频生成

Yiheng Cao, Gustavo Andrade-Miranda, Jiatian Zhang, Guillaume Sallé, Xin Gao

机构 * Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(苏州生物医学工程与技术研究所,中国科学院) SyCoIA, IMT Mines Ales(SyCoIA,IMT Mines Ales)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种文本到视频生成方法,通过解耦心脏空间结构与时间运动,利用微调扩散模型合成初始帧,再以心脏相位嵌入条件化潜在流模型生成完整运动,实现高时序一致性和解剖可控性。

Journal ref ISBI 2026 - IEEE International Symposium on Biomedical Imaging, Apr 2026, London, United Kingdom. pp.1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09150 2026-06-16 cs.CV 新提交 57%

Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions

Ultra Flash: 将实时流式视频生成扩展到高分辨率

Luxury, Jie Huang, Zihao Fan, Xiaoxiao Ma, Jun-hao Zhuang, Yuming Li, Zeyue Xue, Siming Fu, Haoran Li, Mingchen Zhong, Guohui Zhang, Shichen Ma, Yijun Liu, Jiaqi Shi, Yanwen Ma, Yaofeng Su, Haoyu Wang, Yaowei Li, Songchun Zhang, Weiyang Jin, Yuxuan Bian, Shiyi Zhang, Haojun Xu, Shuai Lu, Xin Han, Wei Tang, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索研究院) USTC(中国科学技术大学) PKU(北京大学) THU(清华大学) BUAA(北京航空航天大学) FDU(复旦大学) HKUST(香港科技大学) HKU(香港大学) CUHK(香港中文大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Ultra Flash级联框架,通过架构保持的超分辨率训练、因果流式潜在上采样器和高分辨率解码器、以及级联优化方案,在单GPU上实现1K分辨率约30 FPS和2K分辨率约18 FPS的实时高分辨率流式视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06176 2026-06-16 cs.CV 版本更新 57%

RQUL-UIE: Revitalizing Quality-Unstable Labels for Underwater Image Enhancement via In-Dataset Self-Supervision

RQUL-UIE: 通过数据集内自监督重振质量不稳定标签用于水下图像增强

Haochen Hu, Yanrui Bin, Chih-yung Wen, Bing Wang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于扩散模型的数据集内自监督学习策略,通过评估标签质量并量化噪声级别进行分步去噪监督,结合傅里叶细化网络,有效利用不稳定标签提升水下图像增强质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29509 2026-06-16 cs.CV 版本更新 57%

KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing

KGEdit: 面向无训练精确视频生成与编辑的歧义感知知识图谱

Mingshu Cai, Miao Zhang, Chenghe Yang, Yixuan Li, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University, Japan(日本早稻田大学) College of Computer Engineering, Jimei University(集美大学计算机工程学院) Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出KGEdit框架,通过构建歧义感知知识图谱和结构化语义注入模块,解决文本到视频扩散模型中的语义歧义、概念绑定错误和跨帧不一致问题,实现无需额外训练的精确视频生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19876 2026-06-16 cs.CV 版本更新 57%

Structural Energy Guidance for View-Consistent Text-to-3D Generation

基于结构能量的视图一致文本到3D生成

Qing Zhang, Jinguang Tong, Jing Zhang, Jie Hong, Xuesong Li

机构 * Australian National University(澳大利亚国立大学) CSIRO(澳大利亚国家科学委员会) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文针对基于扩散模型的文本到3D生成中视图不一致问题,提出无需训练的SEGS框架,通过在U-Net特征的PCA子空间中构建结构能量并注入去噪过程,提升多视图一致性,实验表明有效降低Janus率并提升视图一致性评分。

Comments arXiv admin note: substantial text overlap with arXiv:2508.16917

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25371 2026-06-16 q-bio.QM cs.CV 版本更新 57%

PhyloSDF: Phylogenetically-Conditioned Neural Generation of 3D Skull Morphology via Residual Flow Matching

PhyloSDF: 基于系统发育条件的残差流匹配神经生成3D颅骨形态

Kaikwan Lau, Gary P. T. Choi

机构 * Department of Mathematics(数学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PhyloSDF模型,结合系统发育一致性损失和残差条件流匹配,从少量样本生成符合系统发育关系的3D颅骨形态,在达尔文雀数据集上优于扩散模型和标准流匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06212 2026-06-16 cs.CV cs.AI 版本更新 57%

Akasha 2: Hamiltonian State Space Duality and Visual-Language Joint Embedding Predictive Architectur

Akasha 2: 哈密顿状态空间对偶与视觉-语言联合嵌入预测架构

Yani Meziani

机构 * Independent AI Researcher(独立AI研究员) Québec (QC), Canada(魁北克(QC),加拿大)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出 Akasha 2 多模态架构,结合哈密顿状态空间对偶与视觉-语言联合嵌入预测,通过稀疏混合哈密顿专家和哈密顿流匹配实现超低延迟视频预测与合成,在保持能量守恒下取得 SOTA 性能。

Comments No supporting claims were validated in this automated agentic R&D research run

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17588 2026-06-16 cs.CV cs.CL 版本更新 57%

Dual-branch Prompting for Multimodal Machine Translation

双分支提示用于多模态机器翻译

Jie Wang, Zhendong Yang, Liansong Zong, Xiaobo Zhang, Dexian Wang, Ji Zhang

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Computer and Software Engineering, Xihua University(西华大学计算机与软件工程学院) School of Intelligent Medicine, Chengdu University of Traditional Chinese Medicine(成都中医药大学针灸推拿学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于扩散模型的双分支提示框架D2P-MMT,利用重建图像过滤视觉噪声,通过分布对齐损失提升鲁棒翻译性能。

Comments This manuscript has been fully accepted and published by ACM Transactions on Multimedia Computing, Communications, and Applications (ACM TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12572 2026-06-16 cs.CV 版本更新 57%

Through-Foliage Surface-Temperature Reconstruction for Early Wildfire Detection

面向早期野火检测的穿透植被地表温度重建

Mohamed Youssef, Lukas Brunner, Klaus Rundhammer, Gerald Czech, Oliver Bimber

机构 * Department of Computer Science, Johannes Kepler University(计算机科学系,约翰尼斯·开普勒大学) Fire Brigade St. Agatha(圣阿加塔消防队) Upper Austria Fire Brigade Headquarter(上奥地利消防队总部)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 结合信号处理与机器学习,通过合成孔径传感和视觉状态空间模型从模糊数据中恢复热信号,实现无人机自动野火监测,在模拟和实地实验中显著降低温度重建误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04486 2026-06-16 cs.CV cs.AI cs.LG 版本更新 57%

Efficient Flow Matching using Latent Variables

使用潜在变量的高效流匹配

Anirban Samaddar, Yixuan Sun, Viktor Nilsson, Sandeep Madireddy

机构 * Argonne National Laboratory(阿贡国家实验室) KTH Royal Institute of Technology(皇家理工学院)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 提出Latent-CFM方法,利用预训练深度潜在变量模型提取数据特征作为条件,提升流匹配模型的训练效率和生成质量,在图像和物理场生成任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16846 2026-06-16 cs.LG cs.AI 新提交 50%

Deep Q-Learning on Hölder Spaces

Hölder空间上的深度Q学习

Qian Qi

机构 * Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究连续时间随机控制中Q学习的算子核心,通过分析扩散设置下Bellman最优性目标的正则性和逼近复杂度,提出适应混合正则性的张量积DeepONet架构,并给出显式逼近和资源界限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16702 2026-06-16 cond-mat.mtrl-sci physics.chem-ph 新提交 50%

Activated Migration of Localized Ligand-Field Excitons in Atomically Thin CrCl3

原子薄层CrCl3中局域配体场激子的激活迁移

Hyesun Kim, Renlong Liu, Sangho Yoon, Hyunjong Lim, Takashi Taniguchi, Kenji Watanabe, Jonghwan Kim, Changgu Lee, Sunmin Ryu

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究CrCl3中配体场激子的迁移机制,发现其有效面外扩散率为4.5×10⁻⁶ cm²/s,激活能130 meV,且与晶格弛豫耦合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16618 2026-06-16 eess.SP 新提交 50%

Acoustic, VOC, and Multimodal Stress Source Localization in the Internet of Plants

植物物联网中的声学、VOC和多模态胁迫源定位

Ahmet B. Kilic, Ozgur B. Akan

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一种两阶段粗到细定位流程,结合声学到达时间差多边定位和VOC弥散格林函数模型,实现植物网络中胁迫源的空间定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16572 2026-06-16 cs.RO 新提交 50%

Steering Generative Reinforcement Learning into Stable Robotic Controller

将生成式强化学习引导至稳定机器人控制器

Yixuan Wang, Shutong Ding, Ke Hu, Tianxiang Gui, Jingya Wang, Ye Shi

机构 * ShanghaiTech University(上海科技大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出SteerGenPO框架,通过潜在空间强化学习将训练好的生成式策略转化为鲁棒的确定性机器人控制器,在Isaac Lab和Unitree G1任务上优于基线方法,实现更稳定的推理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16514 2026-06-16 quant-ph physics.flu-dyn 新提交 50%

Fully Quantum Algorithm for the 1-dimensional linear Lattice Boltzmann Method

一维线性格子玻尔兹曼方法的全量子算法

Mohammed Bediche, Matthijs van Waveren, Denis Ricot, Pierre Sagaut

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一维线性对流扩散方程的格子玻尔兹曼方法全量子算法,仅需算法结束时一次测量,相比混合量子经典算法减少了测量次数,并在量子模拟器和133量子比特系统上验证。

Journal ref In: Barbaresco, F., Gerin, F. (eds) Quantum Engineering Sciences and Technologies for Industry and Services. QUEST-IS 2025. Communications in Computer and Information Science, vol 2744. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16430 2026-06-16 math.AP 新提交 50%

Convergence to self-similarity for a degenerate parabolic equation with fast-growing spatially-dependent absorption

具有快速增长空间依赖吸收的退化抛物方程的自相似收敛性

Razvan Gabriel Iagar, Philippe Laurençot

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究吸收-扩散方程在m>1且σ>σ0时非负解的大时间行为,证明所有解在自相似变量下收敛到唯一稳态解,并给出通用上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16315 2026-06-16 math.AP math.OC 新提交 50%

Nonlinear kinetic Fokker-Planck equations as gradient flows of the free energy

非线性动力学Fokker-Planck方程作为自由能的梯度流

Giovanni Brigati, Guillaume Carlier, Jean Dolbeault, Filippo Quattrocchi

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究非齐次动力学方程,通过自由能泛函的梯度流解释,并推广JKO格式到非线性动力学方程族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16251 2026-06-16 math.NA cs.NA math.AP 新提交 50%

Topological spectral gap, multiscale Weyl's law, and homogenization in high-contrast PDEs

拓扑谱隙、多尺度Weyl律及高对比PDE中的均匀化

Eric T. Chung, Lijian Jiang, Yajun Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出统一抽象变分与拓扑框架,刻画高对比多尺度PDE的谱隙与特征值分布,证明谱隙位置由高对比夹杂局部零空间维数决定,并建立多尺度Weyl律。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16006 2026-06-16 cond-mat.mtrl-sci 新提交 50%

Confined Oxygen-Vacancy Migration Drives Ferroelectric Switching

受限氧空位迁移驱动铁电开关

Hyeonhu Bae, Binghai Yan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过第一性原理计算发现,Bi2SeO5中的氧空位在SeO3单元内受限迁移,产生可开关的极化,解释了其反常铁电性。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15975 2026-06-16 physics.chem-ph cond-mat.mtrl-sci physics.app-ph 新提交 50%

High-sensitivity hydrogen gas permeation: system development, sample preparation, and influence of testing variables

高灵敏度氢气渗透:系统开发、样品制备及测试变量的影响

R. Li, A. Zafra, Z. D. Harris, E. Martínez-Pañeda

专题命中 扩散模型 :diffusion(abstract)

AI总结 开发高灵敏度氢气渗透系统,研究表面状态、压力、温度等变量对氢渗透的影响,揭示表面氧化物在室温下主导控制氢渗透,优化条件下氢传输遵循体扩散控制行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15692 2026-06-16 eess.IV 新提交 50%

A Surface-based Multimodal Framework for Multitask Analysis in Alzheimer's Disease

基于表面的多模态框架用于阿尔茨海默病的多任务分析

Shuo Huang, Jianwei Zhang, Lujia Zhong, Jiaxin Yue, Yihao Xia, Xinkai Wang, Yonggang Shi

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一种增强的球形数据驱动多模态框架,通过球形扩散模型生成配对皮层厚度和Tau PET SUVR数据,结合对比学习和上下文学习,实现多任务分类与回归,在ADNI数据集上优于六种基线模型。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15637 2026-06-16 cs.LG 新提交 50%

HAPI-EP: Towards Hybrid, Adaptive, and Predictive Digital Twins of Cardiac Electrophysiology

HAPI-EP:迈向混合、自适应和预测性的心脏电生理数字孪生

Sumeet Vadhavkar, Xiajun Jiang, Yubo Ye, Maryam Toloubidokhti, Linwei Wang

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出HAPI框架,通过物理集成灰盒模型、元学习快速自适应和条件生成模型,构建可识别、强预测性的心脏电生理数字孪生。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15612 2026-06-16 math.AP 新提交 50%

Trichotomy dynamics of a free boundary model for biological invasion

生物入侵自由边界模型的三分动力学

Hongkai Cao, Yihong Du, Wenjie Ni, Xiaoyan Zhang

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究一类新型自由边界反应扩散方程,其中入侵前沿可进退,完全分类了单稳、双稳和燃烧型非线性下的长期动力学,揭示了三种情景:成功扩散、有限时间消失和过渡态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15571 2026-06-16 physics.comp-ph cs.NA math.NA 新提交 50%

Liquid Random Feature Methods for Time-Dependent Partial Differential Equations

时间依赖偏微分方程的液体随机特征方法

Jiale Linghu, Yangshuai Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出液体随机特征方法(L-RFM),通过将静态时间激活替换为闭式液体时间常数响应,引入采样松弛尺度,在保持线性最小二乘求解器简单性的同时,提高对刚性、色散或多尺度时间依赖PDE的有限特征逼近精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15482 2026-06-16 stat.ML cs.LG 新提交 50%

Ricci-Filtration: Boosting Retrieval-Augmented Generation Reranker to Query-Answer Tasks by Discrete Ricci Flow

Ricci-Filtration:通过离散Ricci流提升检索增强生成重排序器在查询-答案任务中的性能

Tian Qin, Wei-Min Huang

机构 * Tian Qin(田琴) Wei-Min Huang(黄伟民)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出基于离散曲率和Ricci流的几何重排序增强方法Ricci-Filtration,通过建模查询与检索块为网络并利用曲率过滤噪声块,显著提升RAG生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15452 2026-06-16 cs.LG math.AT q-fin.RM stat.ML 新提交 50%

PHINN: Persistent Homology Inspired Neural Network for Rare-Event Time Series Generation

PHINN: 基于持久同构的稀有事件时间序列生成神经网络

Emre Yusuf, Ren Takahashi, Jayabrata Bhaduri

机构 * Defense.Codes (a DBA of CapaCloud Corp)(Defense.Codes(CapaCloud Corp 的商用名))

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出PHINN框架,利用动态Betti曲线作为条件信号和持久景观损失保持同调一致性,在金融、流行病和多模态基准上拓扑保真度优于统计和扩散基线。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15442 2026-06-16 stat.ML cs.LG 新提交 50%

The Reverse Telescoping Coordinate System for Positive Definite Matrices: Geometry, Computation, and Generative Modeling

正定矩阵的反向望远镜坐标系:几何、计算与生成建模

Anindya Bhadra

机构 * Purdue University(普渡大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出一种新的无约束坐标系,通过反向望远镜映射表示对称正定矩阵,实现雅可比仅依赖对数行列式、矩阵与逆矩阵的符号表示,并设计分裂体积-形状流模型用于生成建模。

详情

展开后加载摘要…

URL PDF HTML 收藏