arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-19 至 2026-08-19 共收录 78 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2608.17067 2026-08-19 cs.AI 新提交 86%

DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization

DiSCO:通过分布引导的对比提示优化防御文本到图像生成

Tong Zhang, Motasem Alfarra, Carlos Hinojosa, Christos Louizos, Bernard Ghanem

机构 * Qualcomm AI Research(高通人工智能研究院) King Abdullah University of Science Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

AI总结 DiSCO是一种零样本黑盒防御模块,通过分布引导的对比提示优化,在I2P基准上分别将未防御、已防御模型的攻击成功率降低37.7%、25.13%,提升文本到图像生成的安全性且保持语义保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17203 2026-08-19 stat.ML cs.LG math.ST 新提交 67%

Expressivity In Multimodal Contrastive Learning

多模态对比学习中的表达能力

Andrew Stuart, Florian Wolf

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17564 2026-08-19 cs.CV cs.AI 新提交 57%

Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models

新概念必须进入之处:统一多模态模型中的入口门跨任务可用性

Zongyang Qiu, Yihan Wu, Kaixuan Fan, Bo Li, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Columbia University(哥伦比亚大学) CUHK(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 该研究通过分离统一多模态模型的理解与生成任务方向,发现跨任务可用性取决于概念绑定的入口层,提出的对齐目标可在极低损失下实现概念跨任务迁移。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2608.18063 2026-08-19 cs.CV 新提交 83%

EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image Editing

EditBridge:迈向忠实且高效的超高清图像编辑

Jiayi Song, Shijie Huang, Fangtai Wu, Yubo Huang, Zhenxiong Tan, Songhua Liu, Jiaming Liu, Ruihua Huang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) National University of Singapore(新加坡国立大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 针对现有扩散图像编辑模型无法高效处理超高清图像的问题,提出EditBridge扩散桥框架,通过先验引导的块级稀疏注意力机制实现4K高保真编辑,速度提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14790 2026-08-19 cs.CV 版本更新 83%

Qwen-Video-Edit: Instruction-Based Video Editing by Repurposing an Image Editing Model

Qwen-Video-Edit:通过复用图像编辑模型实现基于指令的视频编辑

Yunpeng Bai, Yossi Gandelsman, Michaël Gharbi, Qixing Huang

机构 * UT Austin(德克萨斯大学奥斯汀分校) Reve(Reve公司)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出Qwen-Video-Edit,通过复用Qwen-Image-Edit图像编辑模型,经少量适配实现基于指令的视频编辑,证明图像编辑先验可迁移至视频编辑任务。

Comments Project Page: this https URL (https://yunpeng1998.github.io/Qwen-Video-Edit-Page) Code: this https URL (https://github.com/yunpeng1998/Qwen-Video-Edit) Model: this https URL (https://huggingface.co/yunpeng1998/Qwen-Video-Edit)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14546 2026-08-19 cs.CV 版本更新 79%

CPI-Bench: A Comprehensive, Practical and Intelligent Benchmark for Real-World Image Editing

CPI-Bench:面向真实世界图像编辑的综合、实用且智能的基准测试

Qinye Zhou, Jun Zheng, Yongchao Du, Yuan Wang, Zhengrui Chen, Zuan Gao, Taihang Hu, Chao Lin, Yefeng Shen, Xingjian Wang, Zhao Wang, Zhengtao Wu, Xiaoli Xu, Zhengze Xu, Hao Yan, Denghui Yang, Yuhang Yu, Huayu Zhang, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 该研究针对现有图像编辑基准测试的局限,提出CPI-Bench这一综合实用的智能基准,其含三个核心子集,可有效区分模型性能,与人类评估偏好高度对齐,为模型优化提供指导。

Comments 13 pages, benchmark report

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 64 篇

2608.18040 2026-08-19 cs.LG cs.CV 新提交 87%

Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization

优化你的采样:基于贝叶斯优化的调优扩散采样

Travis Zhang, Christian Belardi, Justin Lovelace, Jin Peng Zhou, Saebyeol Shin, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);inpainting(abstract)

AI总结 本研究提出OYS方法,将扩散模型采样的时间步长选择作为黑盒优化问题,用贝叶斯优化直接优化目标指标,可提升多类图像生成任务性能,大幅降低推理成本且无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16923 2026-08-19 cs.SI cs.LG 新提交 87%

Network Denoising Revisited: A Ricci-Flow-Inspired Graph Diffusion Method

重访网络去噪:一种受里奇流启发的图扩散方法

Ye Fang, Chuan-Xian Ren

专题命中 扩散模型 :diffusion(title,summary_cn)

AI总结 该研究针对现有网络去噪方法忽略图非欧几里得几何的问题,提出受里奇流启发的曲率引导图扩散方法Ricci-Diffusion,经实验验证其可提升结构恢复与下游性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18019 2026-08-19 math.NA math.DS 新提交 87%

Ordered Diffusion Kernels

有序扩散核(Ordered Diffusion Kernels, ODKs)

Jack H. Soulsby, Andreas C.S. Jørgensen, Atiyo Ghosh, Vahid Shahrezaei

专题命中 扩散模型 :diffusion(title,title_cn)

AI总结 本文提出新型有序扩散核(ODKs),可近似任意伊藤SDE的无穷小生成元,通过松弛势估计为序推断实现平流与扩散解耦,经合成数据验证能准确恢复多种动力系统属性。

Comments 46 pages, 7 figures, 46 page appendix, related to work presented at ECMTB26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-19 cs.CV cs.AI 新提交 85%

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Qing Jin, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Xiaoli Xu, Zhengze Xu, Hao Yan, Yuhang Yu, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 扩散模型 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17747 2026-08-19 cs.CV 新提交 83%

TINA+: Probing Residual Visual Knowledge in Unlearned Diffusion Models via Diffusion-Consistent Text-Free Inversion

TINA+: 通过扩散一致无文本反演探测未学习的扩散模型中的残留视觉知识

Qianlong Xiang, Miao Zhang, Kun Wang, Haoyu Zhang, Junhui Hou, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) City University of Hong Kong(香港城市大学) Shenzhen Loop Area Institute(深圳河套学院) National University of Singapore(新加坡国立大学) Pengcheng Laboratory(鹏城实验室)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究提出TINA+,一种扩散一致无文本反演攻击,可探测未学习的扩散模型中残留的视觉知识,实验表明现有概念擦除方法多切断文本-图像链接而非消除视觉知识。

Comments The project page is this https URL (https://qianlong0502.github.io/TINA-Plus-Homepage/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17286 2026-08-19 cs.LG 新提交 82%

Abra: Scaling Diffusion Image Training

Abra:扩散图像训练的规模化

Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi, Jiaming Song, Shyamal Buch, Xinchen Yan

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 本研究针对文本到图像扩散模型开展系统缩放定律研究,提出Abra模型,发现其缩放规律可预测且需更多数据,相关规律可延伸至生成质量等多方面指标。

Comments 25 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16946 2026-08-19 math.PR 新提交 82%

A diffusion model for time-dependent compositional data

用于时变成分数据的扩散模型

Lu Chen, Omar De la Cruz Cabrera, Oana Mocioalca

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出了名为Dirichlet扩散(DD)的随机过程,用于建模时变成分数据的演化,证明了其解的存在性与聚合性,可用于微生物组演化的联合建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17973 2026-08-19 cs.CV 新提交 79%

LinCa: Accelerating Diffusion Models via Learnable Decomposed Feature Caching

LinCa:基于可学习分解特征缓存的扩散模型加速方法

Jinshan Liu, Haoran Qin, Xiaobing Tu, Jiacheng Liu, Jiahui Hu, Zhengan Yan, Yukun Xie, Kerui Shen, Jinkui Ren, Yuqi Lin, Xiantao Zhang, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Terminal Intelligent Computing Division, Alibaba Cloud(阿里云终端智能计算事业部) South China University of Technology(华南理工大学) Jilin University(吉林大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出LinCa框架,通过可学习可逆网络分解缓存特征并差异化预测,仅需少量额外参数即可在5-7倍加速下使扩散模型保持近无损质量,性能优于现有方法。

Comments Accepted to ECCV 2026. 28 pages including appendix. Code: this https URL (https://github.com/QHR69/LinCa)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26747 2026-08-19 cs.CV cs.LG 版本更新 79%

From Diffusion to Flow: Efficient Motion Generation in MotionGPT3

从扩散到流:在MotionGPT3中实现高效的运动生成

Jaymin Bhan, JiHong Jeon, SangYeop Jeong

机构 * Department of Applied Artificial Intelligence(应用人工智能系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文比较了扩散与校正流在MotionGPT3中的表现,发现流在训练速度、性能和效率上更具优势。

Comments ReALM-GEN Workshop ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11534 2026-08-19 cs.CV 版本更新 79%

Risk-Controllable Multi-View Diffusion for Driving Scenario Generation

可控风险多视角扩散用于驾驶场景生成

Hongyi Lin, Wenxiu Shi, Heye Huang, Dingyi Zhuang, Song Zhang, Yang Liu, Xiaobo Qu, Jinhua Zhao

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 RiskMV-DPO通过整合风险水平与物理风险建模,实现可控风险的多视角驾驶场景生成,提升3D检测性能并减少FID,推动安全导向的具身智能发展。

Comments 10 pages, 4 figures; accepted at the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE). Updated to the complete camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17796 2026-08-19 cs.CR cs.LG 新提交 78%

Diff-DDoS: Realistic Cyber-Physical Attack Synthesis and Robust Detection for 5G-Enabled CPS Using Tabular Diffusion Models

Diff-DDoS:基于表格扩散模型的5G赋能网络物理系统的逼真网络物理攻击合成与鲁棒检测

Bilal Hussain, Xiao Tang, Qinghe Du, Tan Li, Muhammad Azhar, Danista Khan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对5G赋能CPS的DDoS检测数据稀缺问题,提出Diff-DDoS三阶段框架,采用表格扩散模型生成逼真攻击并通过对抗扩散训练提升ResNet50等检测器的鲁棒性,在米兰CDR数据集上取得优异检测效果。

Comments Accepted manuscript. IEEE Transactions on Industrial Informatics, paper no. TII-26-6533. 11 pages + 9-page supplementary material (ancillary PDF). (c) 2026 IEEE. Personal use of this material is permitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17489 2026-08-19 cs.SI 新提交 78%

Structure, Topics, and Diffusion Effects of Bluesky Starter Packs

Bluesky入门包的结构、主题与扩散效应

Andrea Failla, Vander Freitas, Giulio Rossetti, Carlos Ferreira

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文对Bluesky的5万多个入门包及60多万关联用户展开大规模实证分析,刻画其结构、主题与扩散效应,发现入门包形成互联生态,纳入入门包会显著增加短期转发活动。

Comments Accepted at ASONAM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16953 2026-08-19 cs.AR 新提交 78%

DTX: A Throughput-First Training Accelerator for Diffusion and Transformer Models

DTX:一种面向扩散模型与Transformer模型的以吞吐量优先的训练加速器

Shashank

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DTX是面向扩散与Transformer模型的吞吐量优先训练加速器,通过消除循环携带依赖、采用脉动阵列等设计实现高吞吐量,在多项测试中表现优异,流片后性能优于基线方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17031 2026-08-19 math.PR 新提交 78%

A shape theorem for periodic branching diffusion

周期分支扩散的形状定理

Arturo Arellano Arias

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究证明了多维周期分支扩散的形状定理,确定粒子云归一化后收敛的渐近凸集性质,并推广了arXiv:2507.10515的方法以深化对该形状的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17357 2026-08-19 physics.med-ph 新提交 78%

LV-CARE-Diff: A Conditional Anatomy-Aware Diffusion Model for Left Ventricular Shape Reconstruction and Function Quantification from Ultra-Sparse Cine Slices

LV-CARE-Diff:用于超稀疏电影切片左心室形状重建和功能量化的条件化解剖结构感知扩散模型

Xinwang Li, Yu Lian, Bowei Liu, Yifei Jiang, Jingjing Xiao, Haiyan Ding, Xiangchuang Kong, Rui Guo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出LV-CARE-Diff模型,采用由粗到精策略,从超稀疏CMR电影切片重建左心室形状,保留96%功能量化准确率,减少73%成像时间,缩短检查时长且不牺牲定量精度。

Comments 55 pages, 11 main-text figures, 2 main-text tables; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14083 2026-08-19 quant-ph 版本更新 78%

Information-Calibrated Quantum Diffusion: Aligning Forward Noise with Reverse Recoverability

信息校准量子扩散:对齐正向噪声与反向可恢复性

Qipeng Qian, Yuntao Qian

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出信息校准量子扩散方法,引入经典-量子信息减量作为内在扩散坐标,构建结合恢复约束与分布匹配的随机学习器,在四量子比特TFIM实验中降低了Wtr指标且性能优于官方QuDDPM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14308 2026-08-19 hep-th cond-mat.stat-mech cs.LG 交叉投稿 78%

Information Spreading in Diffusion Models from Effective Field Theory

基于有效场论的扩散模型中的信息传播

Navonil Neogi, Nabil Iqbal

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究将物理学有效场论应用于带卷积架构的得分匹配扩散模型,通过玩具示例和MNIST实验证实,两点间互信息按布朗运动有效场论预测的方式增长。

Comments This work was previously presented at the Scientific Methods for Understanding Deep Learning Workshop at ICLR 2026. 14 pages + appendices. Code available at: this https URL (https://github.com/NavonilNeogi/MutualInfoEFTDiffusionModels)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16207 2026-08-19 cs.AI cs.CR 版本更新 78%

JUMP: Single-Pass Membership Inference on Fine-Tuned Diffusion Language Models

JUMP:微调扩散语言模型的单通道成员推理

Yeachan Jun, Albert No

机构 * Yonsei University(延世大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究微调离散扩散语言模型的成员推理攻击,提出JUMP单通道评分攻击,利用dLLMs任意顺序可解码性和并行可解码性,在六个MIMIR域上的微调LLaDA - 8B - Base上提升了平均ROC - AUC并改善低FPR检测,且减少查询次数。

Comments 22 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21802 2026-08-19 cs.CL 版本更新 78%

When to Plan, When to Polish: Noise Level as a Granularity Axis for Diffusion Language Models

何时规划,何时精炼:噪声水平作为扩散语言模型的粒度轴

Peihong Li, Yuanjie Shi, Yan Yan

机构 * Washington State University(华盛顿州立大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出噪声依赖粒度控制(NDGC)方法,通过噪声水平调节训练和推理的粒度,实现从粗到细的去噪,无需显式规划器或层次结构,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14645 2026-08-19 physics.optics math-ph 版本更新 78%

Paraxial diffusion-field retrieval. II. Fokker-Planck generalization of the transport-of-intensity equation

近轴扩散场检索。II. 传输强度方程的福克-平克扩展

David M. Paganin, Kaye S. Morgan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于福克-平克扩展的传输强度方程,用于改进相干流和扩散流的建模,以提升相位和扩散场的检索能力。

Comments 45 pages, 9 figures, revised and significantly extended paper to be resubmitted to Physical Review A

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14512 2026-08-19 math.AP 版本更新 78%

Sequential Exponential Lower Bounds for the Advection-Diffusion Equation with Shear Flows

具有剪切流的对流-扩散方程的指数下界

Yupei Huang, Xiaoqian Xu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有剪切流的对流-扩散方程,证明了其解的 $L^2$ 范数具有时间的指数下界,揭示了扩散对被动标量混合的抑制作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14000 2026-08-19 cs.RO 版本更新 78%

A Diffusion-Refined Planner with Reinforcement Learning Priors for Confined-Space Parking

用于狭窄空间泊车的带强化学习先验的扩散优化规划器

Mingyang Jiang, Yueyuan Li, Jiaru Zhang, Songan Zhang, Ming Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出带强化学习先验的扩散优化规划器DRIP,用于解决狭窄空间泊车规划精度不足的问题,在提升狭窄空间泊车规划性能的同时保持常规场景泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01586 2026-08-19 cs.RO cs.AI 版本更新 78%

ManiCM: Real-time 3D Diffusion Policy via Consistency Model for Robotic Manipulation

ManiCM:用于机器人操作的基于一致性模型的实时3D扩散策略

Zifeng Gao, Guanxing Lu, Tianxing Chen, Wenxun Dai, Ziwei Wang, Chao Shang, Wenbo Ding, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出ManiCM模型,通过一致性约束实现一步推理,在31项机器人操作任务上,推理速度较最优方法提升10倍且保持竞争力。

Comments this https URL (https://manicm-fast.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05819 2026-08-19 cs.LG cs.AI 版本更新 78%

Diffusion Models for Smarter UAVs: Decision-Making and Modeling

用于更智能无人机的扩散模型:决策与建模

Yousef Emami, Hao Zhou, Luis Almeida, Kai Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文探索将扩散模型(DMs)与强化学习(RL)、数字孪生(DT)集成,通过仿真验证其在四无人机集群协同任务中生成邻居速度估计值的有效性,助力智能无人机的决策与建模。

详情

展开后加载摘要…

URL PDF HTML 收藏