arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 2962 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 2264 篇

2606.27277 2026-06-26 cs.AI cs.CV 新提交 57%

EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting

EO-WM: 一种用于概率性地球观测预测的物理信息世界模型

Junwei Luo, Shuai Yuan, Zhenya Yang, Yansheng Li, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Wuhan University(武汉大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出EO-WM,一种视频扩散变换器,通过物理信息条件框架(气候基线、天气异常和累积应力)实现多光谱地球观测的概率性预测,在极端天气和季节匹配基准上优于现有方法。

Comments 28 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26916 2026-06-26 cs.CV 新提交 57%

PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation

PhysRAG: 通过检索增强生成提升视频生成中的物理感知

Kexu Cheng, Zicheng Liu, Mingju Gao, Chunhe Song, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院人工智能产业研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PhysRAG管道,利用检索增强生成(RAG)和可学习查询注入物理知识,在7K高质量视频上训练,在PhyGenBench和VBench上达到最优视觉质量和物理规则遵从性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26898 2026-06-26 cs.CV cs.LG 新提交 57%

Tractography-Driven Synthetic Data Generation for Fiber Bundle Segmentation in Tracer Histology

基于纤维束成像的示踪组织学纤维束分割合成数据生成

Kyriaki-Margarita Bintsi, Sparsh Makharia, Yaël Balbastre, Joselyn Romero Avila, Julia F. Lehman, Suzanne N. Haber, Anastasia Yendiki

机构 * Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital and Harvard Medical School(马萨诸塞总医院和哈佛医学院 Athinoula A. Martinos 生物医学影像中心) Krea University(Krea 大学) Department of Experimental Psychology, University College London(伦敦大学学院实验心理学系) Universidad Nacional Mayor de San Marcos(国立圣马科斯大学) Department of Pharmacology and Physiology, University of Rochester School of Medicine(罗切斯特大学医学院药理学与生理学系) McLean Hospital(麦克莱恩医院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出利用离体dMRI纤维束成像作为生成先验合成2D图像块,结合真实背景和域随机化训练U-Net,实现猕猴示踪组织学中纤维束的自动分割,在减少3倍标注数据下达到与现有方法相当的性能。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26507 2026-06-26 cs.HC cs.CV 新提交 57%

DanceDuo: Bridging Human Movement and AI Choreography

DanceDuo:连接人类动作与AI编舞

Gia-Cat Bui-Le, Tuong-Vy Truong-Thuy, Hai-Dang Nguyen, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国家大学胡志明市分校) Vietnam National University(越南国家大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出DanceDuo平台,利用扩散模型生成与多种音乐同步的AI编舞,并集成人体姿态估计支持用户与AI舞蹈对比,提升舞蹈练习体验。

Comments SOICT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26087 2026-06-25 cs.CV 新提交 57%

MVTrack4Gen: Multi-View Point Tracking as Geometric Supervision for 4D Video Generation

MVTrack4Gen: 多视角点跟踪作为4D视频生成的几何监督

JoungBin Lee, Jaewoo Jung, Jongmin Lee, Tongmin Kim, Hyunsung Kim, Takuya Narihira, Kazumi Fukuda, Jahyeok Koo, Jisang Han, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能学院) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出MVTrack4Gen框架,利用多视角点跟踪作为几何与运动监督信号,增强仅相机条件的新视角视频扩散模型的运动一致性和几何一致性。

Comments Project Page : https://cvlab-kaist.github.io/MVTrack4Gen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25907 2026-06-25 cs.CV 新提交 57%

In-context Region-based Drag: Drag Any Region to Any Shape

基于上下文区域的拖拽:将任意区域拖拽至任意形状

Jiacheng Sui, Tianyu Hao, Bingjie Gao, Li Niu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出ICRDrag方法,通过上下文学习框架和两种注意力正则化,实现区域级拖拽编辑,在精度和视觉保真度上显著优于现有方法。

Comments Accepted by ECCV 2026. Dataset, code, and model are available at https://github.com/bcmi/ICRDrag-Region-Drag-Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25548 2026-06-25 cs.CV cs.LG 新提交 57%

Concept Removal for Frontier Image Generative Models

前沿图像生成模型的概念移除

Aditya Kumar, Pierre Joly, Adam Dziedzic, Franziska Boenisch

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种针对前沿扩散和自回归模型(如SD3.5、Flux、Infinity)的概念移除方法,通过将内部瓶颈层替换为转码器来选择性禁用概念相关信号,实现高效概念移除并保持生成质量。

Comments Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25430 2026-06-25 cs.CV 新提交 57%

PRISM: Feed-Forward Single-Image 3D Reconstruction via Geometric Warp-Residual Modeling

PRISM: 基于几何扭曲残差建模的前馈式单图像三维重建

Zhijie Zheng, Xinhao Xiang, Jiawei Zhang

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PRISM前馈框架,将多视角潜在预测分解为无参数几何先验和可学习残差校正,无需扩散采样,推理时间仅36秒/场景,重建质量与扩散方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25300 2026-06-25 cs.CV 新提交 57%

HiFiVe: High-Fidelity Vehicle Generation Leveraging Auto-Regressive 2D Generative Priors

HiFiVe: 利用自回归2D生成先验的高保真车辆生成

Hongli Xiao, Youjian Zhang, Qi Zheng, Zhaohui Hu, Yaohui Jin, Xiaoguang Ren, Wenjing Yang, Long Lan

机构 * Bosch(博世)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出HiFiVe,一种无需训练的框架,通过施加3D几何约束锚定2D生成先验,联合增强纹理与几何,实现高保真车辆建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20300 2026-06-25 cs.CV 新提交 57%

CMDS-AD: Cross-Modal Dual-Stream Decoupling for Few-Shot Anomaly Detection

CMDS-AD: 跨模态双流解耦用于少样本异常检测

Junhao Cai, Junyu Chen, Deyu Zeng, Junhao Pang, Qiwei Liang, Xiaopin Zhong, Zongze Wu

机构 * Shenzhen University(深圳大学) Guangzhou Maritime University(广州航海学院) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出跨模态双流异常检测框架CMDS-AD,通过扩散模型生成多样本并利用低频正常估计辅助解耦高频缺陷,在1-shot设置下MVTec 3D-AD上I-AUROC提升5.7%。

Comments Accepted to ECCV 2026! Project page: https://cmds-ad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24876 2026-06-24 cs.CV 新提交 57%

FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation

FLAT: 前馈潜在三角形泼溅用于几何精确的场景生成

Orest Kupyn, Goutam Bhat, Philipp Henzler, Fabian Manhardt, Christian Rupprecht, Federico Tombari

机构 * Google Research(谷歌研究院) University of Oxford, Visual Geometry Group(牛津大学视觉几何组) TU Munich(慕尼黑工业大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出FLAT方法,首次从视频扩散潜在表示中直接解码三角形泼溅,通过射线中心旋转参数化和乘积窗口函数解决梯度流问题,在保持视觉质量的同时显著提升几何精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24516 2026-06-24 cs.CV 新提交 57%

What Do Flow-Based Inverse Solvers Approximate? A Posterior-Transport View

基于流的逆求解器近似了什么?一种后验传输视角

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(日本理化学研究所跨学科理论数学科学项目) RIKEN AIP(日本理化学研究所人工智能项目) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文从后验传输角度分析基于流的逆问题求解器,证明源分布重加权可精确采样后验,而轨迹引导方法存在偏差,并提出一种高效的修正求解器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24433 2026-06-24 cs.CV cs.AI cs.LG 新提交 57%

MedPCFM: Improving Medical Point Cloud Completion by Integrating Point Transformers and Flow Matching

MedPCFM: 通过集成点变换器和流匹配改进医学点云补全

Kamil Kwarciak, Marek Wodzinski

机构 * Department of Measurement and Electronics, AGH University of Krakow(AGH科技大学测量与电子系) Sano Centre for Computational Medicine(Sano计算医学中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出基于PTv3的流匹配方法PCFM用于医学点云补全,在三个数据集上达到最优生成性能,采样步数远少于扩散模型,且PTv3带来高达7倍的速度提升。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24361 2026-06-24 cs.CV 新提交 57%

SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks

SignNet-1M:大规模多语言手语视频数据集及下游基准

Zhewen He, Junyi Hu, Haomian Huang, Zhenhua Li, Yu-Shen Liu, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign 技术公司) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出SignNet-1M,通过3D高斯泼溅、扩散模型和后期渲染增强合成多样化手语视频,提升模型在跨视角、背景和身份等分布偏移下的泛化能力。

Comments 25 pages. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24257 2026-06-24 cs.CV 新提交 57%

3DCarGen: Scalable 3D Car Generation via 3D-consistent Multi-view Synthesis

3DCarGen: 通过3D一致的多视图合成实现可扩展的3D汽车生成

Hongli Xiao, Youjian Zhang, Yaohui Jin, Xiaoguang Ren, Wenjing Yang, Long Lan

机构 * Shanghai Jiao Tong University(上海交通大学) Academy of Military Science(军事科学院) The University of Sydney(悉尼大学) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出3DCarGen框架,利用多视图扩散模型和3D高斯泼溅,从单张真实图像生成任意数量3D一致的多视图,并通过颜色-法线联合优化重建高质量3D汽车模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24180 2026-06-24 cs.CV cs.AI 新提交 57%

Deep Learning Approaches for 3D Medical Scene Completion: From Geometric Modeling to Generative Paradigms

三维医学场景补全的深度学习方法:从几何建模到生成范式

Afifa Khaled, Said Jadid Abdulkadir, Majdy Mohamed Eltayeb Eltahir

机构 * Universiti Teknologi PETRONAS(马来西亚国油科技大学) King Khalid University(哈立德国王大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文系统综述了2016-2026年间三维场景补全技术的演进,从SSCNet的体素语义补全到结合扩散先验与高斯泼溅的实时渲染新范式,讨论了多种表示范式并提出了分类法,最后给出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24138 2026-06-24 cs.CV 新提交 57%

Sat2City v2: Native 3D City Asset Generation from a Single Satellite Image

Sat2City v2: 从单张卫星图像生成原生3D城市资产

Tongyan Hua, Dongli Wu, Jinjing Zhu, Yinrui Ren, Zhongcheng Hong, Ying-Cong Chen, Hui Xiong, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Auckland University of Technology(奥克兰理工大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Sat2City v2,利用预训练的原生结构化潜空间3D基础模型,从单张卫星图像生成具有可控外观和几何形状的纹理网格,在真实数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18872 2026-06-24 cs.CV 新提交 57%

Bridging Single Distortion Artifacts and Multifactorial Clinical Quality: Few-shot Biparametric MRI Quality Assessment via Distortion-trained Prototypical Networks

桥接单一失真伪影与多因素临床质量:基于失真训练的原型网络的少样本双参数MRI质量评估

Yucheng Tang, Alexander Ng, Wen Yan, Natasha Thorley, Pawel Rajwa, Yipei Wang, Aqua Asif, Clare Allen, Louise Dickinson, Francesco Giganti, Shonit Punwani, Daniel Alexander, Veeru Kasivisvanathan, Yipeng Hu

机构 * UCL Hawkes Institute(UCL Hawkes研究所) Department of Medical Physics and Biomedical Engineering(医学物理与生物医学工程系) University College London(伦敦大学学院) Division of Surgery and Interventional Science(外科与介入科学分会) Centre for Medical Imaging(医学成像中心) British Urology Researchers in Surgical Training (BURST)(英国泌尿外科手术培训研究人员(BURST)) Department of Radiology(放射科) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院国家健康服务信托基金) Centre of Medical Imaging, Division of Medicine(医学成像中心,医学分会) Centre for Medical Image Computing(医学图像计算中心) Department of Computer Science(计算机科学系) Department of Urology(泌尿科)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种少样本双参数原型网络,利用失真标签元训练,通过特征融合和域对齐,仅用5个样本即可预测PI-QUAL临床质量评分,解决临床数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23688 2026-06-23 cs.CV 新提交 57%

Lift4D: Harmonizing Single-View 3D Estimation for 4D Reconstruction In-the-Wild

Lift4D: 协调单视图3D估计以实现野外4D重建

Yehonathan Litman, Xiaoxuan Ma, Manan Shah, Nicolas Ugrinovic, Kris Kitani, Fernando De la Torre, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Lift4D框架,通过因果潜在条件化单视图3D模型获得时域一致的初始化,再结合遮挡感知优化和扩散先验,实现从单目视频重建动态非刚体4D场景,显著优于现有方法。

Comments Webpage, Demos: https://lift4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23473 2026-06-23 cs.CV 新提交 57%

C^2GR: Coupled Comprehensive Generative Replay for a Continually Learnable Universal Segmentation Model

C^2GR: 用于持续学习通用分割模型的耦合综合生成回放

Wei Li, Jingyang Zhang, Guoan Wang, Junzhi Ning, Yang Chen, Guang Yang, Lixu Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Stevens Institute of Technology(史蒂文斯理工学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Imperial College London(伦敦帝国学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对通用分割模型在任务增量学习中因图像外观和分割目标同时变化导致的遗忘问题,提出C^2GR框架,通过贝叶斯联合扩散和关系感知统一提示同步,合成历史任务图像-掩码对,缓解遗忘,性能仅下降2.44%。

Comments This paper has been submitted to a relevant journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23455 2026-06-23 cs.CV 新提交 57%

MeGAS: Thermomechanical Dynamic Gaussian Splatting for Thermophysical Scene Editing

MeGAS: 用于热物理场景编辑的热力学动态高斯泼溅

Zesong Yang, Yuanhang Lei, Liyuan Cui, Yihang Chen, Jiaer Huang, Boming Zhao, Peter Yichen Chen, Hujun Bao, Zhaopeng Cui

机构 * State Key Laboratory of CAD\&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) University of British Columbia(不列颠哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出MeGAS框架,将热力学相变动力学融入3D高斯泼溅,通过温度属性、热对流-扩散求解器和MPM动力学实现热物理现象的物理真实合成,并采用拓扑自适应渲染策略处理极端变形。

Comments Accepted by ECCV 2026. Project page: http://zju3dv.github.io/MeGAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22875 2026-06-23 cs.CV 新提交 57%

FedOT: Ownership Verification and Leakage Tracing via Watermarks for Federated LDMs

FedOT: 联邦潜扩散模型的所有权验证与泄露追踪水印

Wenlong Cheng, Yuan Gan, Yunqiu Xu, Jiaxu Miao

机构 * Northwest Normal University(西北师范大学) The University of Tokyo(东京大学) National University of Singapore(新加坡国立大学) Sun Yat-sen University(中山大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出FedOT框架,通过分块水印和潜向量变换解决联邦学习中潜扩散模型的所有权验证与恶意客户端泄露追踪问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22370 2026-06-23 cs.CV 新提交 57%

Towards Error-Free Long Video Generation

迈向无错误的长视频生成

Shuning Chang, Weihua Chen, Jiasheng Tang, Hao Xu, Zeyu Zhang, Hangjie Yuan, Yu Lu, Ruigang Niu, Fan Wang, Bohan Zhuang, Yi Yang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于扩散模型的长视频生成框架,通过因果注意力、KV缓存和截断修正流技术解决误差累积和属性漂移问题,实现高质量、身份一致的单镜头长视频合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22182 2026-06-23 cs.CV cs.AI 新提交 57%

Dual-Stream EEG Decoding for 3D Visual Perception

用于3D视觉感知的双流脑电解码

Ninon Lizé Masclef, Taisija Demcenko, Antonella Catanzaro, Nataliya Kosmyna

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种模仿生物视觉腹侧和背侧通路的双流脑电解码模型,通过圆形回归预测角度和EEG条件多视图扩散实现3D重建,揭示了时间动态的通道参与模式。

Comments 17 pages, 4 figures. Accepted at the Symmetry and Geometry in Neural Representations Workshop (NeurReps), NeurIPS 2025. To appear in Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22131 2026-06-23 cs.CV 新提交 57%

Feed-forward Motion In-betweening for Any 4D

任意4D的前馈运动插值

Hiroki Nishizawa, Hubert P. H. Shum, Yoshihiro Fukuhara, Hirokatsu Kataoka, Shigeo Morishima

机构 * Waseda University(早稻田大学) AIST(产业技术综合研究所) Durham University(杜伦大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于关键帧条件的前馈插值框架,利用网格VAE和MMDiT骨干的整流流模型,实现任意4D网格的快速运动插值,在DyMesh16和DyMesh32上表现优异。

Comments Video: https://youtu.be/jZAjPUtSq38?si=aXtDMDviFdfkjKUU

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22002 2026-06-23 cs.CV cs.LG 新提交 57%

One-Shot Data Selection for Medical Image Classification via Graph Coverage

基于图覆盖的医学图像分类一次性数据选择

Zahiriddin Rustamov, Nadia Badawi, Rafat Damseh, Nazar Zaki

机构 * United Arab Emirates University(阿拉伯联合酋长国大学) KU Leuven(鲁汶大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出一种基于图的一次性数据选择方法,利用预训练编码器的k近邻图构建热扩散核,通过贪婪设施位置选择最大化数据流形覆盖的子集,在五个MedMNIST数据集上优于基线方法。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21384 2026-06-23 cs.CV cs.AI 新提交 57%

EnTrust: Modeling Inter-Modal Conflict for Trustworthy Multimodal Medical Image Analysis

EnTrust: 建模模态间冲突以实现可信的多模态医学图像分析

Dwarikanath Mahapatra, Abhijit Das, Behzad Bozorgtabar, Zongyuan Ge, Sudipta Roy, Deepak Nayak, Mauricio Reyes, Imran Razzak

机构 * Khalifa University(哈利法大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Aarhus University(奥胡斯大学) Monash University(莫纳什大学) Jio University(Jio大学) NIT Jaipur(斋浦尔国立理工学院) University of Bern(伯尔尼大学) MedOS

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出EnTrust框架,通过解耦模态特征中的共享共识、特定线索和冲突信号,利用扩散模型生成假设并校准像素级不确定性,在多个医学图像分割基准上达到SOTA,校准误差降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21099 2026-06-23 cs.CV 新提交 57%

ShuffleFlow: Scalable Posterior Inference for Bayesian Inverse Imaging

ShuffleFlow: 贝叶斯逆成像的可扩展后验推断

Tianao Li, Tjitske Starkenburg, Yu Sun, Emma Alexander

机构 * Northwestern University(西北大学) Department of Physics and Astronomy, Northwestern University(西北大学物理与天文学系) NSF-Simons AI Institute for the Sky (SkAI)(NSF-Simons天空人工智能研究所) Johns Hopkins University(约翰霍普金斯大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出ShuffleFlow框架,通过像素重排、神经场编码和条件归一化流,实现大规模图像重建中可扩展的后验推断,比扩散采样器更快生成高样本数后验。

Comments Accepted to IEEE International Conference on Computational Photography (ICCP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20679 2026-06-23 cs.RO cs.AI cs.CV 新提交 57%

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

MemoryVAM:将记忆融入视频动作模型以实现机器人操作

Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nirvana Robotics(涅槃机器人) University of California, San Diego(加州大学圣迭戈分校) University of Utah(犹他大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出MemoryVAM,通过Recap-Cue模块将情景记忆注入视频世界模型策略,解决长时域操作中的非马尔可夫性问题,在LIBERO-Mem和真实机器人任务上显著提升成功率。

Comments Project page: https://MemoryVAM.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20620 2026-06-23 cs.CV math.FA 新提交 57%

A Viscosity Semigroup Framework for Stable Image Reconstruction

一种用于稳定图像重建的粘性半群框架

Arina Oberoi

机构 * Arina Oberoi(阿里娜·奥贝伊)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 基于尺度空间理论,提出粘性解框架用于退化椭圆-抛物PDE的多尺度图像表示,并构建混合重建算子,在CT间皮瘤分类任务中实现稳定高AUC。

详情

展开后加载摘要…

URL PDF HTML 收藏