arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1299 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 1299 篇

2606.06176 2026-06-16 cs.CV 版本更新 57%

RQUL-UIE: Revitalizing Quality-Unstable Labels for Underwater Image Enhancement via In-Dataset Self-Supervision

RQUL-UIE: 通过数据集内自监督重振质量不稳定标签用于水下图像增强

Haochen Hu, Yanrui Bin, Chih-yung Wen, Bing Wang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于扩散模型的数据集内自监督学习策略,通过评估标签质量并量化噪声级别进行分步去噪监督,结合傅里叶细化网络,有效利用不稳定标签提升水下图像增强质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29509 2026-06-16 cs.CV 版本更新 57%

KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing

KGEdit: 面向无训练精确视频生成与编辑的歧义感知知识图谱

Mingshu Cai, Miao Zhang, Chenghe Yang, Yixuan Li, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University, Japan(日本早稻田大学) College of Computer Engineering, Jimei University(集美大学计算机工程学院) Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出KGEdit框架,通过构建歧义感知知识图谱和结构化语义注入模块,解决文本到视频扩散模型中的语义歧义、概念绑定错误和跨帧不一致问题,实现无需额外训练的精确视频生成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19876 2026-06-16 cs.CV 版本更新 57%

Structural Energy Guidance for View-Consistent Text-to-3D Generation

基于结构能量的视图一致文本到3D生成

Qing Zhang, Jinguang Tong, Jing Zhang, Jie Hong, Xuesong Li

机构 * Australian National University(澳大利亚国立大学) CSIRO(澳大利亚国家科学委员会) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文针对基于扩散模型的文本到3D生成中视图不一致问题,提出无需训练的SEGS框架,通过在U-Net特征的PCA子空间中构建结构能量并注入去噪过程,提升多视图一致性,实验表明有效降低Janus率并提升视图一致性评分。

Comments arXiv admin note: substantial text overlap with arXiv:2508.16917

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25371 2026-06-16 q-bio.QM cs.CV 版本更新 57%

PhyloSDF: Phylogenetically-Conditioned Neural Generation of 3D Skull Morphology via Residual Flow Matching

PhyloSDF: 基于系统发育条件的残差流匹配神经生成3D颅骨形态

Kaikwan Lau, Gary P. T. Choi

机构 * Department of Mathematics(数学系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PhyloSDF模型,结合系统发育一致性损失和残差条件流匹配,从少量样本生成符合系统发育关系的3D颅骨形态,在达尔文雀数据集上优于扩散模型和标准流匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06212 2026-06-16 cs.CV cs.AI 版本更新 57%

Akasha 2: Hamiltonian State Space Duality and Visual-Language Joint Embedding Predictive Architectur

Akasha 2: 哈密顿状态空间对偶与视觉-语言联合嵌入预测架构

Yani Meziani

机构 * Independent AI Researcher(独立AI研究员) Québec (QC), Canada(魁北克(QC),加拿大)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出 Akasha 2 多模态架构,结合哈密顿状态空间对偶与视觉-语言联合嵌入预测,通过稀疏混合哈密顿专家和哈密顿流匹配实现超低延迟视频预测与合成,在保持能量守恒下取得 SOTA 性能。

Comments No supporting claims were validated in this automated agentic R&D research run

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17588 2026-06-16 cs.CV cs.CL 版本更新 57%

Dual-branch Prompting for Multimodal Machine Translation

双分支提示用于多模态机器翻译

Jie Wang, Zhendong Yang, Liansong Zong, Xiaobo Zhang, Dexian Wang, Ji Zhang

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Computer and Software Engineering, Xihua University(西华大学计算机与软件工程学院) School of Intelligent Medicine, Chengdu University of Traditional Chinese Medicine(成都中医药大学针灸推拿学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于扩散模型的双分支提示框架D2P-MMT,利用重建图像过滤视觉噪声,通过分布对齐损失提升鲁棒翻译性能。

Comments This manuscript has been fully accepted and published by ACM Transactions on Multimedia Computing, Communications, and Applications (ACM TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12572 2026-06-16 cs.CV 版本更新 57%

Through-Foliage Surface-Temperature Reconstruction for Early Wildfire Detection

面向早期野火检测的穿透植被地表温度重建

Mohamed Youssef, Lukas Brunner, Klaus Rundhammer, Gerald Czech, Oliver Bimber

机构 * Department of Computer Science, Johannes Kepler University(计算机科学系,约翰尼斯·开普勒大学) Fire Brigade St. Agatha(圣阿加塔消防队) Upper Austria Fire Brigade Headquarter(上奥地利消防队总部)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 结合信号处理与机器学习,通过合成孔径传感和视觉状态空间模型从模糊数据中恢复热信号,实现无人机自动野火监测,在模拟和实地实验中显著降低温度重建误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04486 2026-06-16 cs.CV cs.AI cs.LG 版本更新 57%

Efficient Flow Matching using Latent Variables

使用潜在变量的高效流匹配

Anirban Samaddar, Yixuan Sun, Viktor Nilsson, Sandeep Madireddy

机构 * Argonne National Laboratory(阿贡国家实验室) KTH Royal Institute of Technology(皇家理工学院)

专题命中 扩散模型 :image generation(abstract);分类 cs.CV

AI总结 提出Latent-CFM方法,利用预训练深度潜在变量模型提取数据特征作为条件,提升流匹配模型的训练效率和生成质量,在图像和物理场生成任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04260 2026-06-12 cs.CV cs.AI 版本更新 57%

Proto-LeakNet: Towards Signal-Leak Aware Attribution in Synthetic Human Face Imagery

Proto-LeakNet:面向合成人脸图像中信号泄漏感知的归因方法

Claudio Giusti, Luca Guarnera, Sebastiano Battiato

机构 * Department of Mathematics and Computer Science(数学与计算机科学系) University of Catania(卡塔尼亚大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Proto-LeakNet,利用扩散模型中的信号泄漏痕迹,结合闭集分类与密度开集评估,实现可解释的生成器归因,在闭集上训练后对未见生成器也有效。

Comments 44 pages, 27 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08073 2026-06-11 cs.CV cs.LG 版本更新 57%

Physics-Driven Spatiotemporal Modeling for AI-Generated Video Detection

物理驱动的时空建模用于AI生成视频检测

Shuhai Zhang, ZiHao Lian, Jiahao Yang, Daiyuan Li, Guoxuan Pang, Feng Liu, Bo Han, Shutao Li, Mingkui Tan

机构 * South China University of Technology(华南理工大学) University of Science and Technology of China(中国科学技术大学) Key Laboratory of Big Data and Intelligent Robot, Ministry of Education(教育部大数据与智能机器人重点实验室) Pazhou Lab(琶洲实验室) University of Melbourne(墨尔本大学) Hunan University(湖南大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于概率流守恒的物理驱动AI生成视频检测范式,通过归一化时空梯度(NSG)统计量捕捉物理异常,结合预训练扩散模型估计NSG,并利用最大均值差异(MMD)进行检测,在Recall和F1-Score上分别提升16.00%和10.75%。

Comments Accepted at NeurIPS 2025 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20850 2026-06-10 cs.CV cs.RO 版本更新 57%

Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves

Glove2Hand:从多模态传感手套合成自然的手-物体交互

Xinyu Zhang, Ziyi Kou, Chuan Qin, Mia Huang, Ergys Ristani, Ankit Kumar, Lele Chen, Kun He, Abdeslam Boularias, Li Guan

机构 * Meta Reality Labs(Meta现实实验室) Rutgers University(罗格斯大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Glove2Hand框架,将多模态传感手套视频转化为逼真的裸手,并保留物理交互动态;引入3D高斯手模型和扩散手恢复器,创建HandSense数据集,提升下游任务性能。

Comments CVPR 2026 Highlight. This version includes the motion retarget process in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23286 2026-06-09 cs.CV cs.AI cs.LG 版本更新 57%

VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation

VideoGPA: 通过几何先验知识蒸馏实现3D一致的视频生成

Hongyang Du, Junjie Ye, Xiaoyan Cong, Runhao Li, Jingcheng Ni, Aman Agarwal, Zeqi Zhou, Zekun Li, Randall Balestriero, Yue Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 VideoGPA通过几何先验知识蒸馏提升视频生成的3D一致性,利用数据高效的自监督框架引导视频扩散模型,显著增强时间稳定性、几何合理性与运动一致性。

Comments 8 pages, 5 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05175 2026-06-09 cs.CV 版本更新 57%

Enhancing Adversarial Robustness with Signed Distance Fields for Harmonizing Geometric Invariance and Texture

利用符号距离场增强对抗鲁棒性以协调几何不变性与纹理

Zhe Li, Bernhard Kainz

机构 * Department AIBE, FAU Erlangen-Nürnberg(AIBE部门,埃朗根-纽伦堡大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出GeoTexPuri框架,通过符号距离场将离散图像掩码转化为连续空间场,在训练中融合几何与纹理特征,实现高效对抗净化,在ImageNet上取得84.79%干净准确率和83.52%鲁棒准确率。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03528 2026-06-09 cs.CV 版本更新 57%

Coop-WD: Cooperative Perception with Weighting and Denoising for Robust V2V Communication

Coop-WD:具有加权和去噪的协作感知用于鲁棒V2V通信

Chenguang Liu, Jianjun Chen, Yunfei Chen, Yubei He, Zhuangkun Wei, Hongjian Sun, Haiyan Lu, Qi Hao

机构 * Department of Engineering, Durham University(工程系,达勒姆大学) Faculty of Engineering and Information Technology, University of Technology, Sydney(工程与信息技术学院,悉尼技术大学) Research Institute of Trustworthy Autonomous Systems, Southern University of Science and Technology(可信自主系统研究院,南方科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对V2V通信损伤对协作感知的影响,提出联合加权与去噪框架Coop-WD,通过自监督对比模型和条件扩散概率模型分层增强特征,并设计高效变体Coop-WD-eco降低计算开销,在各类信道下优于传统方法。

Comments submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15946 2026-06-09 cs.SD cs.GR eess.AS 版本更新 57%

EnchantDance: Unveiling the Potential of Music-Driven Dance Movement

EnchantDance: 揭示音乐驱动舞蹈动作的潜力

Bo Han, Teng Zhang, Zeyu Ling, Feilin Han

机构 * Zhejiang University(浙江大学) Tongji University(同济大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.GR

AI总结 提出EnchantDance框架,通过构建舞蹈潜在空间和扩散模型,结合大规模数据集ChoreoSpectrum3D和音乐流派预测网络,提升舞蹈生成的质量、多样性和一致性。

Comments Project Page: https://fluide1022.github.io/EnchantDance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06042 2026-06-08 cs.CV 版本更新 57%

LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing

LoomVideo: 统一多模态输入到视频生成与编辑

Jianzong Wu, Hao Lian, Jiongfan Yang, Dachao Hao, Ye Tian, Yunhai Tong, Jingyuan Zhu, Biaolong Chen, Qiaosong Qi, Aixi Zhang, Wanggui He, Mushui Liu, Jinlong Liu, Pipei Huang, Hao Jiang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出LoomVideo,一种5B参数的高效统一架构,通过多模态大语言模型和零开销Scale-and-Add条件机制,实现视频生成与编辑,显著降低计算复杂度并加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06002 2026-06-08 cs.CV 版本更新 57%

Global-Local Monte Carlo Tree Search in Vision-Language Models for Text-to-3D Indoor Scene Generation

面向文本到3D室内场景生成的视觉-语言模型中的全局-局部蒙特卡洛树搜索

Mengshi Qi, Wei Deng, Xianlin Zhang, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种全局-局部蒙特卡洛树搜索方法,通过分层场景表示和PRM引导的MCTS解决文本到3D室内场景生成中的错误传播问题,并构建新基准数据集3DTindo-bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18050 2026-07-28 astro-ph.HE astro-ph.GA gr-qc 版本更新 56%

A Semi-Analytical Loss Cone Theory for Tidal Disruption Event Rates Around Kerr Black Holes

克尔黑洞潮汐瓦解事件率的半解析损失锥理论

Wenkang Xin

专题命中 扩散模型 :diffusion(abstract,comments)

AI总结 提出首个半解析框架,将自旋依赖的损失锥边界纳入潮汐瓦解事件率理论,通过新潮汐张量形式计算倾角相关阈值,并推导出闭合形式的捕获分数,发现全局TDE率对黑洞自旋不敏感。

Comments 69 pages, 6 figures. MMathPhys dissertation, University of Oxford, Trinity 2026. v2: Added links to supporting code and fixed integration order in producing Figure 3.1(a). Expanded Appendices B and C to include energy diffusion. Main results are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12712 2026-08-17 quant-ph 版本更新 50%

Parity Floors in Quantum Denoisers: A Closed-Form Benchmark for Fixed-Map Denoising Networks

量子去噪器中的奇偶基底:固定映射去噪网络的闭式基准

Jaeuk Kim

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出CoupledPhaseTexture基准,证明深度1的RY+CNOT+Pauli-Z去噪网络存在奇偶基底,揭示奇偶性是限制固定量子特征映射去噪器性能的关键结构约束。

Comments 12 pages, 1 figure, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11388 2026-08-17 cond-mat.mtrl-sci 版本更新 50%

Many-Body Destabilization of Intermediate Oxygen-Hole States

中间氧空穴态的多体失稳

Anirudh Adavi, Kayahan Saritas, Ming Lei, Das Pemmaraju, Paul R. C. Kent, Iwnetim I. Abate

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文采用扩散量子蒙特卡罗方法研究层状Na₂₋ₓMn₃O₇中氧空穴态,发现杂化泛函对能量排序的预测失效,局域氧极化子为更低能态,该体系可作为氧空穴极化子的严格基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23551 2026-08-17 cs.MS math.NA physics.comp-ph 版本更新 50%

Hyper-reduction methods for accelerating nonlinear finite element simulations: open source implementation and reproducible benchmarks

超减缩方法用于加速非线性有限元模拟:开源实现和可重复基准测试

Axel Larsson, Minji Kim, Chris Vales, Sigrid Adriaenssens, Dylan Matthew Copeland, Youngsoo Choi, Siu Wun Cheung

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了超减缩方法在非线性有限元模拟中的应用,通过开源工具评估了不同方法的准确性和效率,揭示了问题特性和时间积分方法对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07580 2026-08-17 cs.LG stat.ML 版本更新 50%

Generative Modeling with Bayesian Sample Inference

基于贝叶斯采样推断的生成建模

Marten Lienen, Marcel Kollovieh, Stephan Günnemann

机构 * School of Computation, Information Technology \& Munich Data Science Institute, Technical University of Munich

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种基于贝叶斯采样推断的生成模型,通过迭代高斯后验推断提升样本质量,并在ImageNet32上优于BFNs和变分扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22022 2026-08-17 math.NA 版本更新 50%

A High-Accuracy Symplectic Scheme for a nonlinear transport problem

非线性输运问题的高精度辛格式

Farjana Siddiqua, Catalin Trenchea

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对可建模色谱法的非齐次边界条件平流-扩散-反应问题,采用辛单步隐式中点法和有限元法,完成稳定性、误差分析及全离散解存在性证明,数值测试验证了理论结果。

Comments 33 pages, 5 Figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19178 2026-08-17 math.NA physics.plasm-ph 版本更新 50%

A noise-robust Monte Carlo method for electric field calculations in EMC3

用于EMC3中电场计算的抗噪声蒙特卡罗方法

William De Deyn, Ruben De Wolf, Vince Maes, Giovanni Samaey

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对EMC3代码电场计算的噪声问题,将蒙特卡罗梯度近似扩展至二维,提出抗噪声电场计算方法,经数值实验验证其方差增长慢于有限差分,为EMC3电场求解提供概念验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02916 2026-08-17 cs.SD cs.LG 版本更新 50%

SALSA-V: Shortcut-Augmented Long-form Synchronized Audio from Videos

SALSA-V:基于视频的捷径增强式长同步音频生成模型

Amir Dellali, Luca A. Lanzendörfer, Florian Grötschla, Roger Wattenhofer

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 SALSA-V是一种多模态视频转音频生成模型,通过掩码扩散目标和捷径损失实现长音频同步高保真生成,仅需8步采样即可快速生成,性能优于现有SOTA,可用于专业音频合成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02595 2026-08-17 math.NA math.AP 版本更新 50%

Numerical methods for fully nonlinear degenerate diffusions

完全非线性退化扩散的数值方法

Edgard A. Pimentel, Ercília Sousa

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对退化完全非线性椭圆型方程及相关传输型自由边界问题,提出有限差分方法,通过正则化程序克服困难并证明收敛性,经数值实验支撑,方法可扩展至更广泛非变分问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06429 2026-08-17 cond-mat.stat-mech 版本更新 50%

Mean-squared displacement and variance for confined Brownian motion

Yi Liao, Xiao-Bo Gong

专题命中 扩散模型 :diffusion(abstract)

Comments 18 pages, 4 figurea

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03357 2026-08-17 cond-mat.stat-mech cond-mat.soft physics.bio-ph 版本更新 50%

Asymptotically exact scattering theory of the Kuramoto-Vicsek model

Kuramoto-Vicsek模型的渐近精确散射理论

Thomas Ihle, Horst-Holger Boltz, Rüdiger Kürsten, Benjamin Lindner

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对Kuramoto-Vicsek模型,突破平均场假设,采用单侧分子混沌假设解析计算低密度下粒子散射,其理论结果与模拟吻合,还推导了高密区噪声关联及正对齐强度下的Boltzmann碰撞算子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10383 2026-08-14 cs.RO 版本更新 50%

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations

基于单视图观测的真实场景中大型物体的双臂协同灵巧抓取

Ziming Li, Mingxuan Wu, Jiaqi Zhang, Hongfei Li, Yan Gan, Deqiang Ouyang, Ning Wang

机构 * The University of Auckland(奥克兰大学) Chongqing University(重庆大学) Southwest University(西南大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对机器人双臂抓取大型物体的挑战,提出含多模态数据集、DDPM模块及执行策略的真实场景双臂抓取框架,实验表明其对未见物体抓取成功率高。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07070 2026-08-14 physics.soc-ph cs.AI 版本更新 50%

Coordinated incentives in AI-generated misinformation governance

AI生成虚假信息治理中的协同激励机制

Qin Li, Gui Zhang, Minyu Feng, Matjaz Perc, Attila Szolnoki

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过三方演化博弈模型发现,仅靠单边监管或市场激励无法遏制AI生成虚假信息,需协同监管奖惩、企业声誉损失及用户激励的政策组合实现有效治理。

Journal ref Humanities and Social Sciences Communications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏