arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-19 至 2026-05-19 共收录 214 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 161 篇

2605.16486 2026-05-19 stat.ML astro-ph.IM cs.LG 78%

StAD: Stein Amortized Divergence for Fast Likelihoods with Diffusion and Flow

StAD:基于Stein算子的 amortized 散度用于具有扩散和流的快速似然

Gurjeet Jagwani, Stephen Thorp, Sinan Deger, Hiranya Peiris

机构 * Institute of Astronomy(天文研究所) Kavli Institute for Cosmology, University of Cambridge, Cambridge, UK(剑桥大学卡文迪许实验室,剑桥,英国) Research Computing Services, University of Cambridge, Cambridge, UK(剑桥大学研究计算服务) The Oskar Klein Centre, Department of Physics, Stockholm University, Stockholm, SE(斯德哥尔摩大学物理系奥斯卡·克莱因中心) Cavendish Laboratory, Department of Physics, University of Cambridge, Cambridge, UK(剑桥大学物理系卡文迪许实验室)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出StAD方法,利用Langevin-Stein算子预测和学习PF-ODE的散度,无需计算雅可比矩阵,提升了似然预测的效率和稳定性。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16391 2026-05-19 eess.SP cs.AI cs.LG cs.RO 78%

Overcoming the Intrinsic Performance Limitations of MEMS IMU via Diffusion-Based Generative Learning

通过扩散生成学习克服MEMS惯性测量单元的固有性能限制

Jiarui Lv, Feng Zhu, Xiaohong Zhang

机构 * School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Hubei Luojia Laboratory, Wuhan University(湖北珞珈实验室) Chinese Antarctic Center of Surveying and Mapping, Wuhan University(中国极地测绘南极科考中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散的生成学习框架,利用低成本IMU数据生成高保真虚拟IMU数据,提升定位和姿态估计性能,并在空中测绘中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16342 2026-05-19 cs.LG cs.AI cs.CL 78%

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

DACA-GRPO:去噪感知的信用分配用于扩散语言模型中的强化学习

Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

机构 * The Ohio State University(俄亥俄州立大学) Apple(苹果公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DACA-GRPO,通过引入去噪进度评分和分层掩码似然,改进扩散语言模型中强化学习的信用分配,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16337 2026-05-19 cond-mat.stat-mech cond-mat.soft physics.bio-ph 78%

Anomalous Diffusion as Structural Memory: An Extended Structural Dynamics Approach

异常扩散作为结构记忆:一种扩展的结构动力学方法

Patrick BarAvi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出扩展结构动力学方法,揭示生物系统中亚扩散现象源于不完整相空间的投影,通过结构实体的完整自由度分析,推导出亚扩散指数与分子灵活性的关系,并验证了结构动力学在复杂介质中的实验一致性。

Comments he ESD framework has been peer reviewed in the context of plasma transport (BarAvi 2026c, Transport Phenomena, De Gruyter Brill, in press)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17500 2026-05-19 cs.LG cs.CV 77%

The Silent Brush: Evaluating Artistic Style Leakage in AI Art Generation

沉默的画笔:评估AI艺术生成中的艺术风格泄露

Ninad Joshi, Ashutosh Ranjan, Vivek Srivastava, Shirish Karande

机构 * TCS Research(TCS研究)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);text-to-image(abstract);分类 cs.CV

AI总结 本文研究了AI艺术生成中由于模型学习并复现艺术风格而产生的无意风格复现问题,提出了一种评估方法Art Arena,用于衡量艺术作品的编码强度、交互情况以及在无明确提示的情况下风格特征的重现频率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16789 2026-05-19 cs.CV 77%

Accelerating Rectified Flow Models via Trajectory-Aware Caching

通过轨迹感知缓存加速修正流模型

Xiao Liu, Kai Liu, Naiyang Guan, Hongliang Lu, Zhixin Wang, Zhikai Chen, Renjing Pei, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Academy of Military Science(军事科学院) Huawei Technologies Ltd(华为技术有限公司)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出TACache框架,通过轨迹感知缓存技术,在无需训练的情况下加速生成高保真图像和视频,通过分解速度场并补偿误差,实现更高的采样速度。

Comments 22 pages,14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18150 2026-05-19 cs.AI 75%

Whispers in the Noise: Surrogate-Guided Concept Awakening via a Multi-Agent Framework

噪声中的低语:通过多智能体框架引导的代理觉醒

Mengyu Sun, Ziyuan Yang, Zunlong Zhou, Junxu Liu, Haibo Hu, Yi Zhang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);diffusion(abstract)

AI总结 本文研究了在黑盒约束下如何通过多智能体框架从预训练模型中恢复被擦除的概念,提出了一种无需训练的代理方法,通过引导噪声状态来实现可控的觉醒,展示了当前概念擦除方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18390 2026-05-19 cs.CV 74%

Vision Foundation Models as Generalist Tokenizers for Image Generation

视见过滤模型作为图像生成的通用标记器

Anlin Zheng, Qi Han, Xin Wen, Chuofan Ma, Lanxi Gong, Gang Yu, Xiangyu Zhang, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) StepFun

专题命中 扩散模型 :image generation(title);分类 cs.CV

AI总结 本文提出了一种基于冻结视见过滤模型(VFM)的通用图像标记器VFMTok,通过区域自适应量化框架和语义重建目标,提升了图像生成的质量和效率,同时在离散和连续潜在空间中实现了高保真度的类别条件合成。

Comments 4 figures and 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04870 2026-05-19 cs.CV 74%

Diffusion-Based sRGB Real Noise Generation via Prompt-Driven Noise Representation Learning

基于扩散的sRGB真实噪声生成:通过提示驱动的噪声表示学习

Jaekyun Ko, Dongjin Kim, Soomin Lee, Guanghui Wang, Tae Hyun Kim

机构 * Department of Computer Science, Hanyang University(翰阳大学计算机科学系) Mobile Experience (MX) Division, Samsung Electronics(三星电子移动体验部门) Department of Computer Science, Toronto Metropolitan University(多伦多 Metropolitan 大学计算机科学系)

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 本文提出Prompt-Driven Noise Generation框架,通过学习提示特征生成真实噪声图像,无需依赖相机元数据,提升噪声合成的通用性和应用性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17107 2026-05-19 stat.ML cs.LG math.OC math.PR 71%

Diffusion-Based Stochastic Operator Networks for Uncertainty Quantification in Stochastic Partial Differential Equations

基于扩散的随机算子网络用于随机偏微分方程中的不确定性量化

Phuoc-Toan Huynh, Richard Archibald, Feng Bao

机构 * Department of Mathematics, Florida State University(佛罗里达州立大学数学系) Computer Science and Mathematics Division, Oak Ridge National Laboratory(橡树岭国家实验室计算机科学与数学 division)

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出了一种新的框架,用于随机偏微分方程(SPDEs)解算子的不确定性量化。尽管SPDEs在建模具有不确定性的复杂物理系统中起着核心作用,但其实际应用通常需要指定模型不确定性的幅度和结构,而这些通常是未知且难以从噪声测量中推断出来的。为此,本文开发了一种随机算子学习框架,直接从噪声数据中学习,并输出均值解场和不确定性量化。所提出的方法,即随机算子网络(SON),通过结合深度算子网络(DeepONet)的结构与随机神经网络(SNNs)来建模随机性并实现概率预测。训练过程通过最小化一种哈密顿型损失并使用随机最大原理优化所得目标进行。在多个不确定性源下的基准SPDEs上的数值实验展示了所提出方法在捕捉解结构和量化预测不确定性方面的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16310 2026-05-19 cs.CE 71%

Perturbative Analytical Framework for Thermal Wave Diffusion in Non-linear Building Envelopes

热波扩散非线性建筑围护结构的 perturbative 分析框架

Corentin Guigot

专题命中 扩散模型 :diffusion(title)

AI总结 本文提出基于连续空间Riccati方程的频域框架,通过递归导纳映射限制指数增长,解决热波扩散中非线性问题,提升建筑能源管理中模型预测控制的效率与精度。

Journal ref Journal of Building Performance Simulation, 2026, pp.1-20

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18233 2026-05-19 cs.CV 70%

Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos

增强无列车无限帧生成以实现一致的长视频

X. Feng, J. Zhu, M. Wu, C. Chen, F. Mao, H. Guo, J. Wu, X. Chu, K. Huang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(复杂系统认知与决策智能重点实验室,中国科学院自动化研究所,北京,中国) AMAP, Alibaba Group, Beijing, China(AMAP,阿里巴巴集团,北京,中国)

专题命中 扩散模型 :diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MIGA方法,通过两阶段对齐机制和双一致性增强机制,解决训练与推理不匹配和长时一致性维持的问题,从而提升长视频生成效果。

Comments Accepted by ICML 2026~

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15487 2026-05-19 cs.LG cs.CV eess.IV 70%

Learning Normalized Energy Models for Linear Inverse Problems

学习归一化能量模型以解决线性逆问题

Nicolas Zilberstein, Santiago Segarra, Eero Simoncelli, Florentin Guth

机构 * Rice University(里士满大学) Flatiron Institute(Flatiron研究所) New York University(纽约大学)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出了一种新的能量模型,用于解决线性逆问题,通过引入基于协方差的正则化项来提高不同测量条件下的一致性,从而计算出归一化的后验密度,无需额外训练或微调,同时实现了能量引导的自适应采样、无偏的Metropolis-Hastings修正步骤以及通过贝叶斯规则估计退化算子。

Comments ICML 2026

Journal ref Int'l Conf Machine Learning (ICML), Jul 2026. https://openreview.net/forum?id=PlFJwgaaDK

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01030 2026-05-19 cs.CV 70%

Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model

Lotus-2: 通过强大的图像生成模型推进几何密集预测

Jing He, Haodong Li, Mingzhi Sheng, Ying-Cong Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Lotus-2,一种两阶段确定性框架,用于稳定、准确和精细的几何密集预测,通过充分利用预训练生成先验,实现了单目深度估计和表面法线预测的新状态-of-the-art结果。

Comments v3: Fixed some typos. Project page: https://lotus-2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16515 2026-05-19 cs.CV cs.LG 70%

SeamCam: Quantifying Seamless Camouflage via Multi-Cue Visual Detectability

SeamCam:通过多线索视觉可探测性量化无缝伪装

Amin Karimi Monsefi, Abolfazl Meyarian, Mridul Khurana, Shuheng Wang, Pouyan Navard, Cheng Zhang, Anuj Karpatne, Wei-Lun Chao, Rajiv Ramnath

机构 * The Ohio State University(俄亥俄州立大学) Path Robotics, USA(Path Robotics公司) Virginia Tech(弗吉尼亚理工大学) Boston University(波士顿大学)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 SeamCam通过将伪装评估转化为视觉定位问题,提出了一种量化动物伪装效果的指标,通过人类实验验证其有效性,并展示了其在扩散模型训练中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08971 2026-05-19 physics.comp-ph astro-ph.IM cs.DC 67%

HARD: A Performance Portable Radiation Hydrodynamics Code based on FleCSI Framework

HARD:基于FleCSI框架的性能可移植辐射流体动力学代码

Julien Loiseau, Hyun Lim, Andrés Yagüe López, Mammadbaghir Baghirzade, Shihab Shahriar Khan, Yoonsoo Kim, Sudarshan Neopane, Alexander Strack, Farhana Taiyebah, Benjamin K. Bergen

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 HARD基于FleCSI框架开发了一个开源的高性能压缩流体动力学模拟代码,支持辐射扩散耦合,通过多后端运行时(如Legion、MPI和HPX) orchestration 实现性能可移植性,并提供回归测试套件确保科学可靠性。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17991 2026-05-19 cs.SD cs.AI 67%

Stable Audio 3

稳定音频3

Zach Evans, Julian D. Parker, Matthew Rice, CJ Carr, Zack Zukowski, Josiah Taylor, Jordi Pons

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract)

AI总结 稳定音频3提出了一种快速的潜在扩散模型家族,用于可变长度音频生成和编辑,通过高效的潜在空间生成和对抗训练提升了生成质量和效率。

Comments Training code: https://github.com/Stability-AI/stable-audio-tools Inference and weights: http://github.com/Stability-AI/stable-audio-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07272 2026-05-19 cs.CV cs.GR 62%

VideoNeuMat: Neural Material Extraction from Generative Video Models

VideoNeuMat: 从生成视频模型中提取神经材料

Bowen Xue, Saeed Hadadan, Zheng Zeng, Fabrice Rousselle, Zahra Montazeri, Milos Hasan

机构 * University of Manchester(曼彻斯特大学) NVIDIA(NVIDIA公司) University of California Santa Barbara(加州大学圣巴bara分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 VideoNeuMat通过两阶段流程从视频扩散模型中提取可重用的神经材料,利用可控相机和光照轨迹生成材料样本视频,并通过大型重建模型重建紧凑的神经材料,实现超越合成训练数据的现实感和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18467 2026-05-19 cs.CV 57%

InstructAV2AV: Instruction-Guided Audio-Video Joint Editing

InstructAV2AV:基于指令的音频视频联合编辑

Haojie Zheng, Yixin Yang, Siqi Yang, Shuchen Weng, Boxin Shi

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出InstructAV2AV,首个端到端的指令引导音频视频联合编辑框架,通过构建大规模音频视频编辑数据集InsAVE-80K和改进的生成模型,实现了更高质量的音频视频联合编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18101 2026-05-19 cs.CV cs.AI 57%

SENSE: Satellite-based ENergy Synthesis for Sustainable Environment

SENSE: 基于卫星的能源合成以实现可持续环境

Kailai Sun, Mingyi He, Heye Huang, Can Rong, Alok Prakash, Baoshen Guo, Shenhao Wang, Jinhua Zhao

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Florida(佛罗里达大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SENSE,一种统一的生成性城市建筑能耗框架,通过结合生成扩散模型和大规模视觉模型知识,生成高分辨率的城市卫星图像和对齐的高质量建筑能耗和高度地图,以提高城市可持续发展预测性能。

Comments Accpted by KDD 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17904 2026-05-19 cs.CV 57%

Beyond Euclidean Prototypes: Spectral Disentanglement and Geodesic Matching for Few-Shot Medical Image Segmentation

超越欧几里得原型:基于谱分解和测地匹配的少样本医学图像分割

Penghao Jia, Zhiyong Huang, Mingyang Hou, Zhi Yu, Shuai Miao, Jiahong Wang, Yan Yan

机构 * School of Microelectronics and Communication Engineering, Chongqing University(重庆大学微电子与通信工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Spectral-Geodesic Prototype Network (SGP-Net),通过谱原型银行和测地匹配器解决少样本医学图像分割中的原型纠缠和拓扑盲匹配问题,实现对形状、纹理和边界线索的解耦编码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17555 2026-05-19 cs.LG cs.CV 57%

PFlow-T: A Persistence-Driven Forward Process for Topology-Controlled Generation

PFlow-T:基于持续性的拓扑控制生成过程

Snigdha Chandan Khilar

机构 * Independent Researcher(独立研究者)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PFlow-T,一种基于持续性的前向过程生成模型,通过持续同调来控制拓扑结构,实现了对Betti数的生成和处理非分布任务的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17504 2026-05-19 cs.CV cs.AI 57%

A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle

从分布视角看视觉机制可解释性:KL最小软约束原理

Guancheng Zhou, Yisi Luo, Zhengfu He, Zhenyu Jin, Xuyang Ge, Wentao Shu, Deyu Meng, Xipeng Qiu

机构 * School of Mathematics and Statistics(数学与统计学学院) Ministry of Education Key Lab of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于分布的视觉机制可解释性方法,通过KL最小化优化问题来平衡可解释性和模型忠实性,利用能量引导的扩散后验采样实现,并在DINOv3模型上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17483 2026-05-19 cs.CV 57%

On Applicability of Synthetic Datasets for Facial Expression Recognition

关于合成数据集在面部表情识别中的适用性

Ali Azmoudeh, Erdi Sarıtaş, Ömer Yıldırım, Hazım Kemal Ekenel

机构 * Department of Computer Engineering, Istanbul Technical University(伊斯坦布尔技术大学计算机工程系) Department of Informatics, University of Zurich(苏黎世大学信息学系) Division of Engineering, NYU Abu Dhabi(纽约大学阿布扎克分校工程系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文研究了合成数据集在面部表情识别中的应用,提出三种隐私保护策略来构建平衡的数据集,并通过实验验证了合成数据在缓解类别不平衡和隐私限制方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17357 2026-05-19 cs.IR cs.MM 57%

Dual-Diffusional Generative Fashion Recommendation

双扩散生成式时尚推荐

Mingzhe Yu, Lei Wu, Qianru Sun, Yunshan Ma

专题命中 扩散模型 :diffusion(abstract);分类 cs.MM

AI总结 本文提出DualFashion,一种联合建模图像和文本模态的双扩散生成式时尚推荐架构,通过结构化属性级描述和视觉装扮信息共同作为条件信号,实现个性化和可解释的推荐,同时引入文本增强微调策略提升生成多样性与跨模态知识迁移能力。

Comments Accepted by SIGIR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17198 2026-05-19 q-bio.NC cs.CV 57%

MIRAGE: Robust multi-modal architectures translate fMRI-to-image models from vision to mental imagery

MIRAGE:鲁棒的多模态架构将fMRI到图像模型从视觉扩展到心理意象

Reese Kneeland, Cesar Kadir Torrico Villanueva, Jordyn Ojeda, Shuhb Khanna, Jonathan Xu, Paul S. Scotti, Thomas Naselaris

机构 * University of Minnesota(明尼苏达大学) Medical AI Research Center (MedARC)(医学人工智能研究中心 (MedARC)) University of Sydney(悉尼大学) Stanford University(斯坦福大学) Alljoined Sophont Princeton Neuroscience Institute(普林斯顿神经科学研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MIRAGE方法,通过多模态文本和图像特征训练,实现从脑活动解码心理意象,展示了在NSD-Imagery基准上SOTA的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17042 2026-05-19 cs.CV 57%

Thermal-Only Crowd Counting with Deployment-Time Privacy Protection

仅热成像的人群计数与部署时隐私保护

Yifei Qian, Zhongliang Guo, Chun Tong Lei, Bowen Deng, Chun Pong Lau, Xiaopeng Hong, Michael P. Pound

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) School of Computer Science, University of St Andrews(斯特灵大学计算机科学学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种仅使用热成像数据的人群计数框架,通过消除RGB数据依赖,减少公共监控中隐私暴露风险,并利用深度到RGB扩散模型来缓解热成像的模糊性,提升计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16818 2026-05-19 cs.CV cs.AI 57%

Observation-Aligned Mask Priors for Learning Physical Dynamics from Authentic Occlusions

基于观测对齐的遮罩先验学习物理动态的遮罩方法

Chiyuan Ma, Zihan Zhou, Tianshu Yu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港大学(深圳))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于观测对齐的遮罩先验方法,通过学习真实的遮罩分布来构建上下文-查询分区,从而在不完整数据上训练物理动态学习。该方法利用贝叶斯流网络预训练二进制遮罩,结合全局归一化交叉熵目标生成与稀疏观测对齐的样本特定遮罩,从而避免零查询死区和局部生成崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16745 2026-05-19 cs.CV 57%

EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers

EVA01: 通过混合变换器实现统一的原生3D理解和生成

Zongyuan Yang, Mingjing Yi, Wanli Ma, Chenzhuo Fan, Bocheng Li, Baolin Liu, Yuke Lou, Yingde Song, Yongping Xiong, Zhengdong Guo, Shimu Wang

机构 * SeeleAI Team(SeeleAI团队)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出EVA01框架,通过混合变换器架构扩展多模态大语言模型的模态边界,实现原生的3D网格理解和生成以及上下文感知编辑,提升文本到3D生成的保真度和多轮几何编辑能力。

Comments 28 pages, 10 figures, 6 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16742 2026-05-19 cs.CV stat.ME 57%

Diffeomorphic Cortical Alignment via Direct Warping of Streamline Endpoints

通过直接变形纤维束端点实现的皮层对齐

Yang Xiang, Martin Cole, Zhengwu Zhang

机构 * Department of Statistics and Operations Research, The University of North Carolina at Chapel Hill(统计与运筹学系,北卡罗来纳大学教堂山分校) Department of Psychiatry, University of Rochester(精神病学系,罗切斯特大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于连接性的皮层对齐方法,通过直接操作白质纤维束端点来对齐皮层表面,以提高纤维束层面的对应性,并在主要纤维束上实现更高的连接性重叠系数和更强的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏