arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-29 至 2026-07-29 共收录 58 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 58 篇

2607.25078 2026-07-29 cs.CV 新提交 89%

Diff-ID: Identity Consistent Facial Image Generation and Morphing via Diffusion Models

Diff-ID:通过扩散模型实现身份一致的面部图像生成与变形

Taimoor Rizwan, Sara Atito, Muhammad Awais, Zhenhua Feng, Josef Kittler

机构 * University of Surrey(萨里大学) Jiangnan University(江南大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 研究针对面部图像合成中高分辨率下身份保持难题,提出Diff-ID框架,通过自定义数据集、集成嵌入及新损失函数实现,实验表明其在身份-真实感权衡上表现出色,还展示了基于DDIM的变形管道,强调联合评估身份保持与真实感。

Comments 20 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30147 2026-07-29 cs.CV 版本更新 83%

T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

T2LDM++:一种用于真实文本到激光雷达场景生成的自条件表示引导扩散模型

Wentao Qu, Qi Zhang, Chenxu Wang, Guofeng Mei, Yongfei Liu, Xiaoshui Huang, Gim Hee Lee, Liang Xiao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Nanjing University of Science and Technology(南京理工大学) Faculty of Data Science(数据科学学院) City University of Macau(澳门城市大学) Beijing Institute of Technology(北京理工大学) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会) School of Public Health(公共卫生学院) Shanghai Jiao Tong University(上海交通大学) School of Computing(计算机学院) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对文本-激光雷达数据稀缺导致场景过平滑和可控性不足的问题,提出T2LDM++模型,通过自条件表示引导(SCRG)提供重建监督,并构建高质量基准数据集,实现几何细节丰富的激光雷达场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06421 2026-07-29 cs.CV cs.LG 版本更新 83%

FREPix: Frequency-Heterogeneous Flow Matching for Pixel-Space Image Generation

FREPix:频率异质流匹配用于像素空间图像生成

Mingfeng Lin, Jiakun Chen, Liang Han, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 FREPix通过分解低频和高频组件,设计显式生成流程,提升像素空间图像生成效果,实现1.91 FID在256×256和2.38 FID在512×512的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25503 2026-07-29 cs.CV 新提交 79%

Group Equivariant Diffusion for Anomaly Detection in Computational Cytology

用于计算细胞学异常检测的群等变扩散

Swarnadip Chatterjee, Ssharvien Kumar Sivakumar, Anirban Mukhopadhyay

机构 * Uppsala University(乌普萨拉大学) Technical University of Darmstadt(达姆施塔特工业大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 计算细胞学中恶性细胞检测难,现有方法有局限。本文提出D4等变扩散框架,通过结构和推理时的对称强制,实现变换一致的重建与稳定异常排名,在两个细胞学数据集上表现优于其他方法,降低分数方差。

Comments 11 pages, 2 figures, 1 table, 1 algorithm. Accepted for publication in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25092 2026-07-29 cs.CV 新提交 79%

MorphUNet: Alpha-Controlled Biometric Transport for Diffusion-Based Face Morphing Attacks

MorphUNet:基于扩散的人脸变形攻击的α控制生物特征传输

Taimoor Rizwan, Sara Atito, Zhenhua Feng, Muhammad Awais, Josef Kittler

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对人脸变形攻击威胁,提出MorphUNet框架,将双亲生成设为α控制生物特征传输,用可训练双亲分离双交叉注意力,经实验评估其在多个指标上表现出色,在变形攻击潜力等方面优于基线,且难被检测。

Comments 37 pages, 23 figures, 8 tables. Includes supplementary material (additional robustness analysis, CFD stress tests, and conditioning ablations) appended after the references

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13656 2026-07-29 cs.CV 版本更新 79%

FreeLit: Paired-Free Indoor Relighting via Physics-Guided Diffusion

FreeLit:通过物理引导扩散实现无配对室内重光照

Chi-En Yen, Duy-Khanh Ngo, Wen-Wei Tang, Huu-Phu Do, Wen-Hsiao Peng, Ching-Chun Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对室内场景重光照难题,提出FreeLit无配对框架,利用物理引导光照先验及重光照引导的固有稳定策略,结合面向可控性的评估指标,实现稳定、物理一致且可控的重光照,提升低光照场景下的鲁棒性,无需配对监督。

Comments Updated to the ACM Multimedia 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10431 2026-07-29 cs.AI cs.SY eess.SY 版本更新 79%

Diffusion Model-based Parameter Estimation in Dynamic Power Systems

动态电力系统中基于扩散模型的参数估计

Feiqin Zhu, Dmitrii Torbunov, Zhongjing Jiang, Tianqiao Zhao, Amirthagunaraj Yogarathnam, Yihui Ren, Meng Yue

机构 * Brookhaven National Laboratory(布鲁海文国家实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究动态电力系统中参数估计的不适定问题,提出基于联合条件扩散模型的反问题求解器,利用扩散模型随机性产生候选解,联合多观测缩小后验分布,在复合负荷模型参数化中优势明显,降低误差且能准确复制系统动态响应,提供通用框架。

Comments Updated to match the published version. Minor corrections incorporated

Journal ref Zhu, F., Torbunov, D., Jiang, Z. et al. Diffusion model-based parameter estimation in dynamic power systems. Commun Eng 5, 123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25157 2026-07-29 cs.AI 新提交 78%

PreDiff-LM: Pretrained Discrete Masked Diffusion Language Modeling with Hybrid Attention

PreDiff-LM:具有混合注意力的预训练离散掩码扩散语言模型

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Jesson Wang, Siheng Wang, Guang Yang, Haoyan Xu, Chenhao Wei, Zhengqing Yuan, Youran Shen, Yanfang Ye, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Stevens Institute of Technology(史蒂文斯理工学院) University of Notre Dame(圣母大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究离散掩码扩散语言模型中因果预训练与双向去噪协调问题,提出PreDiff-LM模型,通过混合注意力机制改进无条件困惑度等指标,在多方面优于先前扩散基线,明确与优化AR模型的差距,为预训练因果主干调整提供补充机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25060 2026-07-29 cs.LG cs.AI 新提交 78%

Lantern: Conflict-Aware Gradient Blending for Physics-Guided Diffusion Models in Calorimeter Simulation

灯笼:量热计模拟中用于物理引导扩散模型的冲突感知梯度融合

Farzana Yasmin Ahmad, Vanamala Venkataswamy, Geoffrey Fox

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute, University of Virginia(弗吉尼亚大学生物复杂性研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对量热计模拟中扩散模型物理错误及标准度量忽略相关结构问题,引入CFD,编码软样本结构为两个物理感知辅助损失,通过GradBlend结合去噪得到Lantern,实验表明其能提高相关指标,消融实验揭示不同损失对调度的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24841 2026-07-29 cs.CL cs.LG eess.SP 新提交 78%

Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising

神经形态扩散语言模型:通过稀疏性和块去噪解决计算和内存瓶颈

Dengyu Wu, Clement Ruah, Jiechen Chen, Bipin Rajendran, Osvaldo Simeone

机构 * King’s College London(伦敦国王学院) Institute for Intelligent Networked Systems (INSI), Northeastern University London(伦敦东北大学智能网络系统研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对自回归大语言模型推理低效问题,提出神经形态掩码扩散语言模型,结合块扩散与脉冲神经形态计算,利用脉冲诱导稀疏性减少参数流量和计算,开发模型分析协同效应,实验表明该模型在能源效率和吞吐量上有显著提升。

Comments Accepted for presentation at 2026 IEEE Workshop on Signal Processing Systems (SiPS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24774 2026-07-29 cs.AI 新提交 78%

Atmospheric Diffusion-Guided Spatio-Temporal Transformer for Nuclear Radiation Forecasting

用于核辐射预测的大气扩散引导时空变换器

Tengfei Lyu, Jindong Han, Hao Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Shandong University(山东大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对核辐射预测难题,引入NRFormer+时空变换器,结合非平稳时间注意力、密度自适应空间注意力与大气扩散模块,能估计气象对辐射扩散的影响并注入网络,在多基线数据集上实现高精度预测,降低突发变化平均绝对误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25586 2026-07-29 eess.SY cs.SY math.OC 新提交 78%

A Minimal Dynamical Model for Incubation-Outbreak Transitions in Social Norm Diffusion

社会规范扩散中孵化-爆发转变的最小动力学模型

Run Wang, Leonardo Cianfanelli, Giacomo Como, Wenjun Mei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究社会规范扩散的最小动力学模型,个体在三种状态转变,呈现潜伏-爆发动态模式。通过分析平衡点等条件确定产生孵化现象的非线性机制并推导潜伏期估计值,揭示由内部相互作用驱动社会变革的动力学途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25450 2026-07-29 math.OC 新提交 78%

Exact discrete-adjoint optimization of trap timing and placement in a Stieltjes-time reaction-diffusion model: A Galicia case study

斯蒂尔杰斯时间反应扩散模型中陷阱定时与放置的精确离散伴随优化:加利西亚案例研究

Francisco J. Fernández, Iván Area

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究针对斯蒂尔杰斯时间反应扩散模型的陷阱定时与放置控制问题,通过推导精确离散伴随等方法,经基准测试和实际案例验证,实现机器精度一致性及伴随加速,联合控制优于其他控制,降低诊断目标,框架可重现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25427 2026-07-29 quant-ph cs.NA math.NA 新提交 78%

A General First- and Second-Order Numerical Solver for Non-Markovian Quantum State Diffusion

非马尔可夫量子态扩散的通用一阶和二阶数值求解器

Zhenning Cai, Quanhui Zhu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究非马尔可夫开放量子系统数值模拟难题,基于线性NMQSD方程解析解构建通用辅助态框架,分离数值构建步骤,给出一阶和二阶格式及跃迁规则,经数值结果验证方法对不同情况的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25872 2026-07-29 cond-mat.str-el cond-mat.mes-hall 新提交 78%

Scaling universal Fermi network toward ground states: A diffusion-Monte-Carlo assessment

将通用费米网络扩展到基态:扩散蒙特卡罗评估

Yu-Sheng Li, Saskia Poldmaa, Tzen Ong, Ahmed Abouelkomsan, Tay-Rong Chang, Hsin Lin, Liang Fu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究将费米集神经网络架构通过变分蒙特卡罗框架扩展以找相互作用基态,经固定相扩散蒙特卡罗优化,随网络大小增加变分能量降低,能量改进趋于零,还展示了对凝胶和量子点中相互作用电子的扩展及评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25374 2026-07-29 cond-mat.stat-mech cond-mat.dis-nn cond-mat.mes-hall cond-mat.supr-con 新提交 78%

Logarithmic Aging Diffusion from a Multiplicative Event Clock: Rare Event Statistics, Ultraslow Transport, and Ensemble-Time Inequivalence

来自乘法事件时钟的对数老化扩散:稀有事件统计、超慢输运与系综 - 时间不等价

Chunyan Li, Zheng Li, Yueyan Li, Haiwen Liu, X. C. Xie

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究对数时间依赖性老化材料的潜在随机机制,提出特定对数老化过程,其事件时间具乘法性。通过事件计数等统计产生多种定律,区分不同表示,用联合可观测量一致性测试时钟,揭示系综 - 时间不等价等特性。

Comments 86 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00411 2026-07-29 cs.LG 版本更新 78%

Diffusion Disambiguation Models for Partial Label Learning

用于部分标签学习的扩散消歧模型

Jinfu Fan, Xiaohui Zhong, Kangrui Ren, Jiangnan Li, Linqing Huang, Min Gan, C. L. Philip Chen

机构 * College of Computer Science and Technology, Qingdao University(青岛大学计算机科学与技术学院) Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University(电子信息工程学院控制科学与工程系,同济大学) School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究从模糊标签学习的问题,基于扩散模型提出用于部分标签学习的扩散消歧模型(DDMP),利用实例与标签互补信息构建伪干净标签,引入过渡感知矩阵估计潜在真实标签,经实验验证了DDMP在部分标签学习中的优势。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00074 2026-07-29 cond-mat.mes-hall cond-mat.dis-nn cond-mat.stat-mech 版本更新 78%

Fractional diffusion without disorder in two dimensions

二维无无序的分数扩散

Nilotpal Chakraborty, Markus Heyl, Roderich Moessner

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究二维中简单局部约束使缺陷呈现可调亚扩散,通过冰型和二聚体型模型揭示丰富动力学现象及有效分数扩散方程,缺陷路径分形维数为5/4,该研究对人工自旋冰和量子模拟器等平台有重要意义。

Comments 5+2 pages; 5 figures. v2 is the published version

Journal ref Phys. Rev. Research 8, 033118 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24994 2026-07-29 math.AP math.DS 新提交 71%

Diffusion stabilises time-periodic solutions in conservation laws coupled to a relaxation oscillator

扩散在与松弛振子耦合的守恒律中稳定时间周期解

Julien Barré, Nils Berglund, Hiroshi Horii

专题命中 扩散模型 :diffusion(title)

AI总结 研究与快速常微分方程耦合的粘性一维守恒律,利用平均策略和谱理论方法,证明对称初始条件下小正粘性会选择唯一线性稳定的周期解,数值模拟验证结果。

Comments 54 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25902 2026-07-29 cond-mat.stat-mech 新提交 71%

Non-monotonic diffusion from nonequilibrium driving

非平衡驱动下的非单调扩散

Manish Patel, Ritwick Sarkar, Urna Basu, Debasish Chaudhuri

专题命中 扩散模型 :diffusion(title)

AI总结 研究相互作用粒子远离平衡态的随机动力学,开发统一理论框架,以周期环上被动粒子受活性粒子驱动为例,揭示有效扩散率对驱动活性的非单调依赖,定量捕捉相关系统并建立统一输运描述。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25894 2026-07-29 cs.CV 新提交 70%

TIGA: Trajectory-Injected Generative Attack against Black-box AIGC Detectors

TIGA:针对黑盒AIGC检测器的轨迹注入生成攻击

Xia Du, Zhuosen Bao, Zheng Lin, Jizhe Zhou, Jiawei Lian, Chi-man Pun, Jun Luo, Wei Ni, Symeon Chatzinotas

机构 * School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院) Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性和信任跨学科中心) School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(四川大学计算机学院机器学习与工业智能工程研究中心) PCA Laboratory, Key Laboratory of Intelligent Perception and Systems for High-Dimensional Information of Ministry of Education, School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院高维信息智能感知与系统教育部重点实验室PCA实验室) Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科技学院计算机与信息科学系) School of Engineering, Edith Cowan University(伊迪斯科文大学工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对黑盒AIGC检测器,TIGA提出无需源图像和训练的框架,通过操纵DDIM轨迹、聚合梯度及方向搜索估计目标响应,实现强大黑盒攻击性能、可转移性及高鲁棒性,且无需源图像或扩散模型再训练。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25275 2026-07-29 cs.CV cs.AI 新提交 70%

ScaleResfusion: Residual Rectified Flow based on Residual Vector Field

ScaleResfusion:基于残差向量场的残差整流流

Zhenning Shi, Chen Xu, Junhao Zhang, Kefei Zhang, Linjie Liu, Zhedong Zheng, Tao Li

机构 * Nankai University(南开大学) University of Macau(澳门大学) Csiro Data 61(联邦科学与工业研究组织数据61部) Beihang University(北京航空航天大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决现实世界图像恢复问题,提出ScaleResfusion框架,核心是残差整流流,从低质量图像出发学习残差向量场,结合知识蒸馏降低采样成本,实验证明其高效且性能优,为图像恢复提供实用可扩展方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06020 2026-07-29 cs.CV 版本更新 70%

ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition

ReSAGE-PAR:行人属性识别中生成式扩展的表征相似性评估

Pablo Ayuso-Albizu, Pablo Carballeira, Juan C. SanMiguel, Paula Moral

机构 * Universidad Autónoma de Madrid(阿隆托纳大学马德里分校)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对行人属性识别数据稀缺问题,提出ReSAGE-PAR管道,通过扩散模型生成图像并利用贝叶斯分类器验证属性,实现可扩展的高保真数据集扩展,在标准骨干网络上提升高达8.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06757 2026-07-29 cs.CV 版本更新 70%

FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching

FlowInOne:将多模态生成统一为图像输入、图像输出的流匹配

Junchao Yi, Rui Zhao, Jiahao Tang, Weixian Lei, Linjie Li, Qisheng Su, Zhengyuan Yang, Lijuan Wang, Xiaofeng Zhu, Alex Jinpeng Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Central South University(中南大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Microsoft(微软)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出FlowInOne框架,将多模态生成统一为纯视觉流匹配,通过视觉提示消除跨模态对齐瓶颈,实现文本到图像生成、布局引导编辑和视觉指令遵循的统一。

Comments Accepted by ECCV 2026. 38 Pages, 21 Figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26055 2026-07-29 cs.RO cs.AI cs.LG 新提交 67%

$π\mathbf{R}^2$: Reactive Real-time Flow Policies

$π\mathbf{R}^2$:反应式实时流策略

Sungjae Park, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract)

AI总结 研究通用操作策略反应性和实时性问题,提出$\pi\mathbf{R}^2$方法,将条件分快速和慢速通道,采用延迟自适应流调度,能在保留大型主干等的同时,让策略实时反应并提高成功率。

Comments Preprint(20 pages). Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26047 2026-07-29 cs.RO 新提交 67%

S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

S2A2:利用声学空间信息进行操作任务的视听模仿学习

Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke Kojima

机构 * Kyoto University(京都大学) RIKEN(理化学研究所) Institute of Science Tokyo(东京理科大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究利用声学信息进行操作任务的模仿学习,提出多模态框架S2A2,集成视觉与声学信息,实现多种策略集成,模拟与真实机器人实验表明其对特定任务有效且适用于现实操作。

Comments Project page: https://azuma413.github.io/projects/s2a2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18314 2026-07-29 cs.CV cs.GR cs.RO 版本更新 62%

Diff2DGS: Reliable Reconstruction of Occluded Surgical Scenes via 2D Gaussian Splatting

Diff2DGS: 通过2D高斯点散布实现遮挡手术场景的可靠重建

Tianyi Song, Danail Stoyanov, Evangelos Mazomenos, Francisco Vasconcelos

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Diff2DGS通过两阶段框架提升遮挡手术场景的3D重建精度,结合扩散模型和可学习变形模型,实现更准确的几何和外观重建。

Comments This work has been accpeted by the IEEE Robotics and Automation Letters(RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25948 2026-07-29 cs.CV cs.AI cs.LG 新提交 57%

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

MODUS:仅解码器的多模态任意到任意建模

Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。

Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31226 2026-07-29 cs.CV 版本更新 57%

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

ForgeDrive: 自动驾驶中统一视觉-动作生成的双向交叉条件

Xuchang Zhong, He Zheng, Chenxu Zhao, Tianxiong Lv, Hangqi Fan, Bohua Wang, Yushan Liu, Li Gao, Zhihao Liao, Leigang Luo, Congyang Zhao, Yang Cai

机构 * Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出ForgeDrive统一自回归扩散框架,通过“先动作后想象”范式实现视觉与动作的双向交叉条件,解决级联误差问题,在NAVSIM上优于现有规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03831 2026-07-29 cs.CV 版本更新 57%

Universal Pansharpening Model

通用全分辨率融合基础模型

Hebaixu Wang, Jing Zhang, Haonan Guo, Di Wang, Jiayi Ma, Bo Du, Liangpei Zhang

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Zhongguancun Academy(中关村学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 FoundPS是一种通用全分辨率融合基础模型,通过模态交错Transformer和潜在扩散桥梁模型实现跨传感器和场景的稳健融合,提升全分辨率融合的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏