arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-21 至 2026-08-21 共收录 24 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2604.05853 2026-08-21 cs.CV 版本更新 79%

Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models

在像素之间阅读:一种针对文本到图像模型的 inscription 性 jailbreak 攻击

Zonghao Ying, Haowen Dai, Lianyu Hu, Zonglei Jing, Quanchen Zou, Yaodong Yang, Aishan Liu, Xianglong Liu

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出 Etch 框架,通过分解对抗提示为语义伪装、视觉空间锚定和字形编码三层,实现对文本到图像模型的 inscription 性 jailbreak 攻击,验证了现有安全机制的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07687 2026-08-21 eess.IV cs.CV 版本更新 79%

FermatSyn: SAM2-Enhanced Bidirectional Mamba with Isotropic Spiral Scanning for Multi-Modal Medical Image Synthesis

FermatSyn: 基于改进双向Mamba的多模态医学图像合成方法

Feng Yuan, Yifan Gao, Haoyue Li, Xin Gao

机构 * USTC(中国科学技术大学) SII(上海信息研究所)

专题命中 文生图 :image synthesis(title,abstract);分类 cs.CV

AI总结 FermatSyn通过改进的双向Mamba结合Fermat螺旋扫描策略,解决多模态医学图像合成中全局一致性与局部细节的平衡问题,提升合成图像质量与临床应用价值。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2501.12289 2026-08-21 cs.CV cs.AI cs.HC 版本更新 79%

Regressor-Guided Image Editing Shifts Emotion and Disengagement Timing in Social Media

回归引导的生成图像编辑通过平衡用户情绪以减少在线时间

Christoph Gebhardt, Robin Willardt, Seyedmorteza Sadat, Chih-Wei Ning, Andreas Brombach, Jie Song, Otmar Hilliges, Christian Holz

机构 * Eastern Switzerland University of Applied Sciences \& ETH Z\"urich St.Gallen Switzerland ETH Z\"urich Z\"urich Switzerland The Hong Kong University of Science Eastern Switzerland University of Applied Sciences \& ETH Z\"urich ETH Z\"urich

专题命中 图像编辑 :image editing(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出回归引导的生成图像编辑方法,通过调节图像情感影响以非强制性减少用户在线时间,实验表明该方法能平衡情绪反应并降低使用时长。

Comments 40 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 20 篇

2604.22700 2026-08-21 cs.CV 版本更新 79%

4DLoG: Generative Modeling of Neurodegenerative Brain Anatomy with 4D Longitudinal Diffusion Model

利用4D纵向扩散模型生成神经退行性脑解剖结构

Nivetha Jayakumar, Swakshar Deb, Bahram Jafrasteh, Qingyu Zhao, Miaomiao Zhang

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Radiology(放射学系) Department of Electrical and Computer Engineering, Department of Computer Science(电气与计算机工程系、计算机科学系)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种4D纵向扩散模型,用于生成神经退行性疾病的脑解剖结构,通过临床变量条件生成准确的脑部变化轨迹,验证了其在疾病分类和分割中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18400 2026-08-21 eess.IV cs.CV 版本更新 79%

Exploiting Completeness Perception with Diffusion Transformer for Unified 3D MRI Synthesis

利用扩散变换器的完整性感知实现统一的3D MRI合成

Junkai Liu, Nay Aung, Theodoros N. Arvanitis, Joao A. C. Lima, Steffen E. Petersen, Le Zhang

机构 * School of Engineering, University of Birmingham, UK(伯明翰大学工程学院) William Harvey Research Institute, Queen Mary University London, UK(女王玛丽大学伦敦威廉·哈里维研究所) Barts Heart Centre, St Bartholomew’s Hospital, Barts Health NHS Trust, UK(巴特勒心脏中心,圣巴塞洛缪医院,巴特勒健康 NHS信托) Division of Cardiology, Johns Hopkins University School of Medicine, US(约翰霍普金斯大学医学院心脏病科)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CoPeDiT模型,通过完整性感知机制提升3D MRI合成的语义一致性与鲁棒性。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15648 2026-08-21 cs.LG cs.CE cs.CV 版本更新 79%

Guided Diffusion by Optimized Loss Functions on Relaxed Parameters for Inverse Material Design

通过放松参数优化损失函数引导扩散用于逆材料设计

Jens U. Kreber, Christian Weißenfels, Joerg Stueckler

机构 * Intelligent Perception in Technical Systems Group, University of Augsburg, Germany(技术系统智能感知组,乌尔姆大学,德国) Faculty of Mathematics, Natural Science and Engineering, University of Augsburg, Germany(数学、自然科学与工程学院,乌尔姆大学,德国) Centre for Advanced Analytics and Predictive Sciences, University of Augsburg, Germany(高级分析与预测科学中心,乌尔姆大学,德国)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 通过优化损失函数引导扩散模型,用于逆材料设计,实现高效且多样化的设计生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05441 2026-08-21 cs.CV cs.LG 版本更新 79%

Decoupling High and Low Frequencies for Faithful Image Generation with Fine Details

解耦高低频以生成具有精细细节的忠实图像

Tejaswini Medi, Hsien-Yi Wang, Arianna Rampini, Margret Keuper

机构 * University of Mannheim(曼海姆大学) Autodesk AI Lab(Autodesk人工智能实验室) MPI for Informatics(信息研究所)

专题命中 扩散模型 :image generation(title);diffusion(abstract);分类 cs.CV

AI总结 该研究针对潜在生成模型难以恢复图像高频细节的问题,提出DeBaT解耦频带分词器,将其集成到潜在扩散模型后,可生成更锐利、更真实的图像样本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18764 2026-08-21 cs.IR 版本更新 78%

GateDiffInt: Gate-Mediated Controllable Diffusion and Multi-Intent LLM Distillation for User Behavior Modeling

GateDiffInt:用于用户行为建模的门控介导可控扩散与多意图大语言模型蒸馏

Jialong Duan, Zichen Zhang, Zirui Tu, Zheng Zhang, Zepeng Li, Qingyao Cui, Qinwen Wang, Yudan Liu, Luo Yang, Yao Hu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对现有排序模型难以解耦结构化意图的问题,提出GateDiffInt框架,通过可控扩散与LLM蒸馏实现意图感知表示,在公开及工业数据集和线上测试中均取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13123 2026-08-21 physics.comp-ph cond-mat.stat-mech 版本更新 78%

Using Diffusion Models to Estimate Uncertainties in Analytic Continuation

利用扩散模型估计解析延拓中的不确定性

Sagi Meir, Daniel Freedman, Barak Hirshberg

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出基于扩散模型的解析延拓框架,可量化解析延拓的不确定性,还能评估逆问题固有难度,在液态仲氢模拟数据应用中取得了良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13193 2026-08-21 physics.flu-dyn 版本更新 78%

Generating synthetic evolution of turbulent flames with an experimental data-based spatiotemporal diffusion model

用基于实验数据的时空扩散模型生成湍流火焰的合成演化

Amrit Tarur, Shivam Barwey

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究开发条件扩散模型,结合 x 预测流匹配框架及时空变压器,生成湍流火焰合成轨迹,能保留关键特征与统计一致性,还进行过渡合成外推任务,为数据稀疏环境下的数据探索提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22950 2026-08-21 stat.ML cs.LG math.ST stat.ME 版本更新 78%

Diffusion-based Denoising Beats Vanilla Score Matching in Parameter Estimation: A Theoretical Explanation

基于扩散的去噪在参数估计中优于普通得分匹配:一个理论解释

Benedikt Lütke Schwienhorst, Nadja Klein, Johannes Lederer

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过理论分析证明,对于具有分离模态的多峰分布,基于扩散的去噪得分匹配估计器(DDSME)相比普通得分匹配估计器(SME)具有更优的误差界,并解释了扩散方法优越性的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18738 2026-08-21 cs.CL 版本更新 78%

Remask, Don't Replace: Token-to-Mask Refinement in Diffusion Language Models

重新标记,而非替换:扩散大语言模型中的令牌到标记细化

Lin Yao

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhongguancun Academy(中关村学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Token-to-Mask(T2M)方法,通过重新标记可疑令牌而非覆盖来提升扩散大语言模型的准确性,在AIME 2025和CMATH上分别提升13.33和8.56个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18779 2026-08-21 cs.RO 版本更新 78%

DiffDef: A Diffusion Model for Generating Multimodal Goal Shapes From Demonstrations for Deformable Object Manipulation

DiffDef:一种用于从演示中生成可变形物体操纵的多模态目标形状的扩散模型

Bao Thach, Tanner Watts, Siyeon Kim, Britton Jordan, Mohanraj Shanthi, Shing-Hei Ho, James M. Ferguson, Tucker Hermans, Alan Kuntz

机构 * Robotics Center and Kahlert School of Computing, University of Utah(大学计算机学院和机器人中心,犹他大学) NVIDIA Corporation(英伟达公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对现有可变形物体操纵方法依赖不切实际的目标获取方式、无法处理多模态目标的问题,提出DiffDef扩散模型,学习可行目标形状分布,在仿真和两种物理机器人平台上验证其可提升任务性能。

Comments Published and presented at ICRA 2026. 8 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15955 2026-08-21 math.ST math.PR q-bio.PE 版本更新 78%

The mutual arrangement of Wright-Fisher diffusion path measures and its impact on parameter estimation

Wright-Fisher扩散路径测度的相互排列及其对参数估计的影响

Paul A. Jenkins

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究Wright-Fisher扩散路径测度的相互排列,确定其分离时间,推导突变与选择参数的联合最大似然估计量,扩展了经典结果并建立相关零一律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17125 2026-08-21 cond-mat.supr-con cond-mat.mes-hall physics.app-ph 版本更新 71%

Demonstration of a scalable all-solid-state refrigerator exploiting diffusion geometries and limiting interfacial conductances at temperatures below 1 kelvin

利用扩散几何结构和界面限域电导的可扩展全固态冰箱在1开尔文以下温度的演示

Northrop Grumman Microelectronics Design, Applications Team: Robert M. Young, Zachary Stegen, John X. Przybysz, Edward R. Engbrecht, Aaron A. Hathaway, Justin C. Hackley, Kirby B. Myers, Christian C. Thorpe, Aurelius L. Graninger, Robert Miller, Diego A. Morales, Roberto D. Carcamo, Glen Walters, Jeric P. Sarad, Nicholas F. Pleim, Seth Whitsitt, Joshua T. Shipman, Anil Erol, Melissa G. Loving, Evan Donohue, Corey A. Kegerreis, Benjamin Dalfort, Moe S. Khalil, Christopher Pinion, Randi Jaramillo, John Milinichik, Sandro J. Di Giacomo, Thomas Zodda, Nilesh Tralshawala, Gregory R. Boyd, Jonathan M. Cochran, Katherine A. Maddock, Michael P. De Feo, Aaron A.Pesetski, Marc E. Sherwin

专题命中 扩散模型 :diffusion(title)

AI总结 该研究开发了采用NIS结、含1121个SINIS单元的可扩展全固态冰箱,首次实现了低于1开尔文下对整个硅芯片的冷却,将其声子温度降至70毫开尔文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22674 2026-08-21 cs.GR cs.CV cs.HC 版本更新 62%

Text-based Tactile Graphics Generation for the Visually Impaired

为视障人士生成基于文本的触觉图形

Ruihan Gao, Joonghyuk Shin, Ava Pun, Jaesik Park, Wenzhen Yuan, Jun-Yan Zhu

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 研究为视障人士开发基于文本生成触觉图形的集成系统,引入制作感知技术,能联合生成多种元素,经评估和用户研究,结果优于基线,拓宽了生成式AI对视障群体及其他人的可及性。

Comments ECCV 2026, Project webpage: this https URL (https://ruihangao.github.io/Text2TactileGraphics/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10519 2026-08-21 cs.CV 版本更新 57%

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis

SparSTAR:用于时空自回归视频合成的稀疏注意力机制

Jongbeom Lee, Hyunwoo Yu, Jincheol Yang, Jaemin Choi, Suk-Ju Kang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17097 2026-08-21 cs.CV 版本更新 57%

HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

HarmoHOI:用于多视图手-物体交互合成的外观与3D运动协调

Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) Shadow AI(影谱科技)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对多视图手-物体交互合成难题,提出HarmoHOI统一扩散框架,用多视图扩散Transformer混合模型联合建模视频与点轨迹,结合全局运动对齐扩散确保一致性,采用混合数据学习策略,实现多视图HOI高质量合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00197 2026-08-21 math.AP math.DS math.FA 版本更新 50%

Inertial manifolds for the nonlocal parabolic problem

非局部抛物问题的惯性流形

Xiaoqing Yang, Alexandre N. Carvalho, Chunyou Sun

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对一类非局部抛物问题,提出研究其惯性流形的抽象框架,通过调整非局部项得到谱间隙条件,成功证明了正方形域上二维非局部反应扩散方程的惯性流形存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22345 2026-08-21 cond-mat.mtrl-sci 版本更新 50%

Lattice-renormalized geometric frustration drives fast ionic transport

晶格介导的几何阻挫驱动快速离子输运

Jianmin Yang, Lin Xie

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过晶格重整化自由能景观,揭示晶格软度与几何阻挫的内在联系,解释快速离子输运的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00140 2026-08-21 cs.LG cs.AI 版本更新 50%

GEM: Geometric Erasure by Contrastive Velocity Matching in Rectified Flows

整流流中对比速度匹配的几何擦除

Jonas Henry Grebe, Tobias Braun, Anna Rohrbach, Marcus Rohrbach

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出GEM框架,通过对比速度匹配实现整流流模型中的概念擦除,结合生成流网络与教师引导的流匹配,有效抑制有害内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11422 2026-08-21 math.ST math.PR 版本更新 50%

Stein's method for the matrix normal distribution

矩阵正态分布的Stein方法

Robert E. Gaunt, Frédéric Ouimet, Donald Richards

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文首次系统发展矩阵分布的Stein方法,通过矩阵Ornstein-Uhlenbeck扩散建立Stein恒等式,给出Stein方程解的半群表示及正则性估计,并应用于矩阵中心极限定理、矩阵T分布近似及协方差估计。

Comments 25 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04031 2026-08-21 quant-ph 版本更新 50%

Phase-Randomized Laser Pulse Generation at 10 GHz for Quantum Photonic Applications

10 GHz量子光子应用中的相随机化激光脉冲生成

Yuen San Lo, Adam H. Brzosko, Peter R. Smith, Robert I. Woodward, Davide G. Marangon, James F. Dynes, Sergio Juárez, Taofiq K. Paraïso, R. Mark Stevenson, Andrew J. Shields

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过结合外部自发辐射源与激光器,实现10 GHz重复率下的相位随机化激光脉冲生成,提升量子通信和随机数生成的应用性能。

Comments Accepted version, published: APL Photonics 11, 086111 (2026) 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像修复 1 篇

2606.19161 2026-08-21 cs.RO 版本更新 50%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Wanlin Li, Chenxi Xiao, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 图像修复 :inpainting(abstract)

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏