arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-29 至 2026-07-29 共收录 25 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2606.22568 2026-07-29 cs.CV 版本更新 89%

SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion

SeFi-Image: 一种基于语义优先扩散的文本到图像基础模型

Ruoyu Feng, Jinming Liu, Yuqi Wang, Xin Cheng, Boyuan Liu, Shanglin Li, Hanshen Zhu, Wenfeng Lin, Mingyu Guo, Xin Jin

机构 * SeFi Team(SeFi 团队)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出SeFi-Image,一种基于语义优先扩散的文本到图像基础模型,在1B、2B和5B参数规模上训练,仅用125K A800 GPU小时(约Z-Image的10-20%计算量)即达到与Qwen-Image和Z-Image相当或更优的性能,并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 17 篇

2606.30147 2026-07-29 cs.CV 版本更新 83%

T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

T2LDM++:一种用于真实文本到激光雷达场景生成的自条件表示引导扩散模型

Wentao Qu, Qi Zhang, Chenxu Wang, Guofeng Mei, Yongfei Liu, Xiaoshui Huang, Gim Hee Lee, Liang Xiao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Nanjing University of Science and Technology(南京理工大学) Faculty of Data Science(数据科学学院) City University of Macau(澳门城市大学) Beijing Institute of Technology(北京理工大学) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会) School of Public Health(公共卫生学院) Shanghai Jiao Tong University(上海交通大学) School of Computing(计算机学院) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(title);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 针对文本-激光雷达数据稀缺导致场景过平滑和可控性不足的问题,提出T2LDM++模型,通过自条件表示引导(SCRG)提供重建监督,并构建高质量基准数据集,实现几何细节丰富的激光雷达场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06421 2026-07-29 cs.CV cs.LG 版本更新 83%

FREPix: Frequency-Heterogeneous Flow Matching for Pixel-Space Image Generation

FREPix:频率异质流匹配用于像素空间图像生成

Mingfeng Lin, Jiakun Chen, Liang Han, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 FREPix通过分解低频和高频组件,设计显式生成流程,提升像素空间图像生成效果,实现1.91 FID在256×256和2.38 FID在512×512的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13656 2026-07-29 cs.CV 版本更新 79%

FreeLit: Paired-Free Indoor Relighting via Physics-Guided Diffusion

FreeLit:通过物理引导扩散实现无配对室内重光照

Chi-En Yen, Duy-Khanh Ngo, Wen-Wei Tang, Huu-Phu Do, Wen-Hsiao Peng, Ching-Chun Huang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对室内场景重光照难题,提出FreeLit无配对框架,利用物理引导光照先验及重光照引导的固有稳定策略,结合面向可控性的评估指标,实现稳定、物理一致且可控的重光照,提升低光照场景下的鲁棒性,无需配对监督。

Comments Updated to the ACM Multimedia 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10431 2026-07-29 cs.AI cs.SY eess.SY 版本更新 79%

Diffusion Model-based Parameter Estimation in Dynamic Power Systems

动态电力系统中基于扩散模型的参数估计

Feiqin Zhu, Dmitrii Torbunov, Zhongjing Jiang, Tianqiao Zhao, Amirthagunaraj Yogarathnam, Yihui Ren, Meng Yue

机构 * Brookhaven National Laboratory(布鲁海文国家实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究动态电力系统中参数估计的不适定问题,提出基于联合条件扩散模型的反问题求解器,利用扩散模型随机性产生候选解,联合多观测缩小后验分布,在复合负荷模型参数化中优势明显,降低误差且能准确复制系统动态响应,提供通用框架。

Comments Updated to match the published version. Minor corrections incorporated

Journal ref Zhu, F., Torbunov, D., Jiang, Z. et al. Diffusion model-based parameter estimation in dynamic power systems. Commun Eng 5, 123 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00411 2026-07-29 cs.LG 版本更新 78%

Diffusion Disambiguation Models for Partial Label Learning

用于部分标签学习的扩散消歧模型

Jinfu Fan, Xiaohui Zhong, Kangrui Ren, Jiangnan Li, Linqing Huang, Min Gan, C. L. Philip Chen

机构 * College of Computer Science and Technology, Qingdao University(青岛大学计算机科学与技术学院) Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University(电子信息工程学院控制科学与工程系,同济大学) School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究从模糊标签学习的问题,基于扩散模型提出用于部分标签学习的扩散消歧模型(DDMP),利用实例与标签互补信息构建伪干净标签,引入过渡感知矩阵估计潜在真实标签,经实验验证了DDMP在部分标签学习中的优势。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00074 2026-07-29 cond-mat.mes-hall cond-mat.dis-nn cond-mat.stat-mech 版本更新 78%

Fractional diffusion without disorder in two dimensions

二维无无序的分数扩散

Nilotpal Chakraborty, Markus Heyl, Roderich Moessner

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究二维中简单局部约束使缺陷呈现可调亚扩散,通过冰型和二聚体型模型揭示丰富动力学现象及有效分数扩散方程,缺陷路径分形维数为5/4,该研究对人工自旋冰和量子模拟器等平台有重要意义。

Comments 5+2 pages; 5 figures. v2 is the published version

Journal ref Phys. Rev. Research 8, 033118 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06020 2026-07-29 cs.CV 版本更新 70%

ReSAGE-PAR: Representational Similarity Assessment for Generative Expansion in Pedestrian Attribute Recognition

ReSAGE-PAR:行人属性识别中生成式扩展的表征相似性评估

Pablo Ayuso-Albizu, Pablo Carballeira, Juan C. SanMiguel, Paula Moral

机构 * Universidad Autónoma de Madrid(阿隆托纳大学马德里分校)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对行人属性识别数据稀缺问题,提出ReSAGE-PAR管道,通过扩散模型生成图像并利用贝叶斯分类器验证属性,实现可扩展的高保真数据集扩展,在标准骨干网络上提升高达8.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06757 2026-07-29 cs.CV 版本更新 70%

FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching

FlowInOne:将多模态生成统一为图像输入、图像输出的流匹配

Junchao Yi, Rui Zhao, Jiahao Tang, Weixian Lei, Linjie Li, Qisheng Su, Zhengyuan Yang, Lijuan Wang, Xiaofeng Zhu, Alex Jinpeng Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Central South University(中南大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Microsoft(微软)

专题命中 扩散模型 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出FlowInOne框架,将多模态生成统一为纯视觉流匹配,通过视觉提示消除跨模态对齐瓶颈,实现文本到图像生成、布局引导编辑和视觉指令遵循的统一。

Comments Accepted by ECCV 2026. 38 Pages, 21 Figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18314 2026-07-29 cs.CV cs.GR cs.RO 版本更新 62%

Diff2DGS: Reliable Reconstruction of Occluded Surgical Scenes via 2D Gaussian Splatting

Diff2DGS: 通过2D高斯点散布实现遮挡手术场景的可靠重建

Tianyi Song, Danail Stoyanov, Evangelos Mazomenos, Francisco Vasconcelos

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 Diff2DGS通过两阶段框架提升遮挡手术场景的3D重建精度,结合扩散模型和可学习变形模型,实现更准确的几何和外观重建。

Comments This work has been accpeted by the IEEE Robotics and Automation Letters(RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31226 2026-07-29 cs.CV 版本更新 57%

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

ForgeDrive: 自动驾驶中统一视觉-动作生成的双向交叉条件

Xuchang Zhong, He Zheng, Chenxu Zhao, Tianxiong Lv, Hangqi Fan, Bohua Wang, Yushan Liu, Li Gao, Zhihao Liao, Leigang Luo, Congyang Zhao, Yang Cai

机构 * Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出ForgeDrive统一自回归扩散框架,通过“先动作后想象”范式实现视觉与动作的双向交叉条件,解决级联误差问题,在NAVSIM上优于现有规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03831 2026-07-29 cs.CV 版本更新 57%

Universal Pansharpening Model

通用全分辨率融合基础模型

Hebaixu Wang, Jing Zhang, Haonan Guo, Di Wang, Jiayi Ma, Bo Du, Liangpei Zhang

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Zhongguancun Academy(中关村学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 FoundPS是一种通用全分辨率融合基础模型,通过模态交错Transformer和潜在扩散桥梁模型实现跨传感器和场景的稳健融合,提升全分辨率融合的泛化能力和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07599 2026-07-29 cs.CV 版本更新 57%

Fundamental Recovery Bounds for SPAD Signals under Stationary Flux

SPAD信号中的扩散

Lior Dvir, Nadav Torem, Mohit Gupta, Yoav Y. Schechner

机构 * Viterbi Faculty of Electrical and Computer Engineering, Technion-Israel Institute of Technology(电气与计算机工程学院,技术学院-以色列理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出利用扩散模型表达图像先验,解决基于SPAD信号的逆问题,并探讨光子计数和检测事件时间对结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05202 2026-07-29 physics.comp-ph cs.LG 版本更新 50%

Multi-Fidelity Learning with Shallow Recurrent Decoders for Multi-Physics Applications

基于浅层循环解码器的多保真度学习在反应堆物理中的应用

Stefano Riva, Carolina Introini, J. Nathan Kutz, Antonio Cammi

机构 * Autodesk Research(Autodesk研究院) Department of Energy, Nuclear Engineering Division(能源部核工程系) Politecnico di Milano(米兰理工大学) Department of Mechanical and Nuclear Engineering and Emirates Nuclear Technology Center(机械与核工程系和阿联酋核技术中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对反应堆物理中高保真数据稀缺而低保真数据丰富的问题,提出利用浅层循环解码器将低保真模型(如点动力学)映射到高保真模型(如扩散方程),以低成本获得高保真解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10708 2026-07-29 quant-ph 版本更新 50%

Gate-Level Quantum Simulation of Nonunitary Linear Dynamics with Hybrid Oscillator-Qubit Architecture

通过混合振子-量子比特线性组合哈密顿量模拟求解量子微分方程

Elin Ranjan Das, Muqing Zheng, Rishab Dutta, Ang Li, Timothy Stavenger, Yuan Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种混合振子-量子比特方法,用于求解线性常微分方程,通过连续变量辅助模式替代离散变量辅助寄存器,减少量子比特开销,并展示其在热方程中的高保真度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19099 2026-07-29 math.AP 版本更新 50%

Weighted well-posedness and kernel stability for coercive evolution equations with measure-valued delays

扩散方程中混合测度记忆的适定性与核稳定性

Hiroki Ishizaka

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了包含历史效应的线性扩散方程,通过有限非负Borel测度统一弱形式,探讨了分布记忆和离散延迟的适定性与稳定性。

Comments Corrected and substantially revised version with a new weighted well-posedness argument and an expanded kernel-stability analysis. Title and bibliography updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01109 2026-07-29 q-fin.RM 版本更新 50%

A stochastic correlation extension of the Vasicek credit risk model

Vasicek信用风险模型的随机相关性扩展

Dhruv Bansal, Mayank Goud, Sourav Majumdar

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种Vasicek信用风险模型的随机相关性扩展,通过圆周扩散过程引入相关性风险,改进了传统模型对尾部风险的刻画能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00433 2026-07-29 cond-mat.mtrl-sci 版本更新 50%

In situ Gas-Cell Electron Microscopy Reveals Pressure-Selected Restructuring Pathways in AuRu Ammonia Catalysts

反应条件下的氨催化剂演变揭示于环境和多模式电子显微镜

Amy S. McKeown-Green, Parivash Moradifar, Zisheng Zhang, Cedric Lim, Andrew Barnum, Lin Yuan, Robert Sinclair, Frank Abild-Pedersen, Colin Ophus, Jennifer A. Dionne

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过环境和多模式电子显微镜研究,揭示了AuRu催化剂在反应条件下的结构演变机制,揭示了氢驱动的纳米空洞形成及压力对重构的影响。

Comments First two authors contributed equally to this work. First two and final author are corresponding authors. This work was conducted at Stanford University

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 可控生成 2 篇

2605.27351 2026-07-29 cs.CV 版本更新 57%

Feedforward 3D Editing Learns from Semantic-Part Transformation

前馈3D编辑从语义部分变换中学习

Jiawei Weng, Saining Zhang, Zhenxin Diao, Peishuo Li, Henghaofan Zhang, Junhao Chen, Hao Zhao

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 提出Pxform数据集和PartFlow网络,通过语义部分变换实现高质量前馈3D编辑,在几何和外观编辑基准上达到最优性能。

Comments 31 pages, 22 figures. Project Page: https://dennis-jwweng.github.io/pxform/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12109 2026-07-29 cs.RO cs.AI 版本更新 50%

InDex: Empowering VLA Models with Intent-Conditioned Arm-Hand Coordination for Dexterous Manipulation

弥合形态差距:通过意图条件微调使VLA模型适应灵巧操作

Chuanke Pang, Junyi Huang, Zhijun Zhao, Yaobing Wang, Kun Xu, Xilun Ding

机构 * Beihang University(北京航空航天大学) China Academy of Space Technology(中国空间技术研究院)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出InDex框架,通过将预训练的1-DoF平行抓取输出重用作宏观虚拟抓取意图代理,结合两阶段解耦学习架构,实现VLA模型从低自由度夹爪到高自由度灵巧手的适应,有效缓解灾难性遗忘和动作流形坍缩。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像修复 1 篇

2510.16813 2026-07-29 eess.AS 版本更新 50%

Audio dequantization using instantaneous frequency

利用瞬时频率的音频去量化

Vojtěch Kovanda, Pavel Rajmic

专题命中 图像修复 :inpainting(abstract)

AI总结 本文提出了一种基于相位感知正则化器的音频去量化方法,旨在提升音频信号在时频表示中的正弦分量连续性并减少能量损失伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 个性化与一致性 2 篇

2607.23023 2026-07-29 cs.CV 版本更新 57%

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

OmniMate:用于交互式虚拟化身的开放式实时流视听生成

Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究针对实时交互式流中生成范围未知和跨模态身份一致性退化的挑战,提出OmniMate框架,通过生成进度控制器和多参考条件模块,实现高质量、低延迟的开放式实时交互式视听虚拟化身生成及长期跨模态身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20233 2026-07-29 cs.CV 版本更新 57%

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models

使用角色-环境协调视频生成模型的电影级合成

Tianyi Xiang, Mingming He, Li Ma, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Independent Researcher(独立研究员)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出端到端视频扩散框架,通过三掩码引导和RGB-D联合去噪建模角色与环境的双向物理与光照交互,实现高质量动态视频合成。

Comments Project Page: https://cehcomposition.github.io/demo/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 图像生成评测 1 篇

2607.24016 2026-07-29 cs.CV 版本更新 57%

DailyBench: A Unified Benchmark for AI-Generated and Manipulated Images from Modern Generative Models

DailyBench:用于评估现代生成模型生成和处理的人工智能图像的统一基准

Xin Jiang, Hao Tang, Junyao Gao, Meiqi Cao, Fei Shen, Dongming Zhang, Yongdong Zhang

机构 * People’s Daily Online(人民网) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Nanjing University of Science and Technology(南京理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

AI总结 研究针对现有生成模型图像检测基准与现实差距问题,提出统一基准DailyBench,含FakeBench和ManipulationBench两个子集,通过实验揭示当前检测器鲁棒性差,凸显其可用于开发更强大的人工智能生成图像检测方法。

Comments Some errors must be corrected

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 效率与蒸馏 1 篇

2602.15355 2026-07-29 cs.CV 版本更新 79%

DAV-GSWT: Diffusion-Active-View Sampling for Data-Efficient Gaussian Splatting Wang Tiles

DAV-GSWT:基于扩散优先的主动视角采样用于数据高效的高斯溅射瓦片

Rong Fu, Jiekai Wu, Yee Tan Jia, Yang Li, Xiaowen Ma, Wangyu Wu, Simon Fong

机构 * University of Macau(澳门大学) Juntendo University(立命馆大学) Tongji University(同济大学) Renmin University of China(中国人民大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学) University of Liverpool(利物浦大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DAV-GSWT框架,利用扩散先验和主动视角采样,从少量输入观测合成高保真高斯溅射瓦片,减少数据需求并保持视觉质量和交互性能。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏