arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-12 至 2026-08-12 共收录 86 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2607.14945 2026-08-12 cs.CV 版本更新 90%

Introspective Attention Modulation for Safe Text-to-Image Generation

用于安全文本到图像生成的内省注意力调制

Basim Azam, Hossein Rahmani, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Lancaster University(兰卡斯特大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);image synthesis(abstract)

AI总结 研究基于流的文本到图像模型易产生不安全内容的问题,提出通过推理时内省调节注意力动态实现安全的方法,该方法在保持或提升质量的同时显著提高安全分数,为安全图像生成提供新途径。

Comments Accepted at ECCV 2026. 20 pages, 7 figures. Project page: https://basim-azam.github.io/iam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11002 2026-08-12 cs.CL cs.AI 新提交 86%

On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation

多语言文本到图像生成中跨语言一致性的局限性研究

Sicheng Zhang, Zhonghao Yan, Binzhu Xie, Shi Qiu, Muzammal Naseer, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(哈利法大学) Queen Mary University of London(伦敦玛丽女王大学) The Chinese University of Hong Kong(香港中文大学) The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) University of Central Florida(中佛罗里达大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

AI总结 本文针对多语言文本到图像生成的跨语言一致性局限,构建含10种语言、3.3万条提示词的LingT2I基准,经分析揭示语言相关生成规律,为开发更鲁棒的多语言T2I模型奠定基础。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10908 2026-08-12 cs.CV cs.CL 新提交 57%

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

顺序很重要:LVLMs作为图像序列时间推理的评判者

Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli, Joao Magalhaes

机构 * University of Bologna(博洛尼亚大学) NOVA School of Science and Technology(NOVA科技学院) NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。

Comments 34 pages, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 2 篇

2608.06929 2026-08-12 cs.CV cs.AI 版本更新 79%

MaskFlow: Precise, Consistent and Seamless Regional Image Editing

MaskFlow:精准、一致且无缝的区域图像编辑

Rui Xu, Yang Yong, Shunzi Yang, Ruihao Gong, Chengtao Lv

机构 * SenseTime Research(商汤科技研究院) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 MaskFlow框架通过融合掩码的流匹配目标与Soft-Poisson去接缝模块,结合MEData数据集,实现了精准可控、无缝融合的区域图像编辑,性能优于现有方法。

Comments 18 pages, 6 figures. Project page: https://reychiaro.github.io/MaskFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10870 2026-08-12 cs.CV 新提交 57%

NullEdit: Stealthy Image Protection via VLM Condition Redirection

NullEdit:通过视觉语言模型条件重定向实现隐秘图像保护

Weiyao Huang, Liqin Wang, Ziqi Sheng, Wei Lu

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 NullEdit针对VLM表示进行重定向,可隐秘抑制图像编辑且保留源内容,在基准模型上平均降低EditReward IF分数0.813,实现了高效的图像保护。

Comments 9 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 68 篇

2509.23452 2026-08-12 cs.CV cs.CL 版本更新 87%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10995 2026-08-12 cs.CV 新提交 83%

HNDiff: Haze-Noise Diffusion for Image Dehazing

HNDiff:用于图像去雾的雾霾-噪声扩散模型

Jin-Ting He, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学) National Chengchi University(国立政治大学) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出嵌入大气散射模型的HNDiff扩散框架,通过雾霾感知噪声调度器关联正向退化物理机制,反向同步去雾去噪,改进主流去雾骨干网络并在基准数据集达最优结果。

Comments Accepted to ECCV 2026. Project Page: https://jin-ting-he.github.io/HNDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05746 2026-08-12 cs.CV 版本更新 83%

HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models

HQ-DM:基于单Hadamard变换的量化感知训练用于低比特扩散模型

Shizhuo Mao, Hongtao Zou, Qihu Xie, Song Chen, Yi Kang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 HQ-DM通过单Hadamard变换提升低比特扩散模型的量化性能,显著提高Inception Score

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10173 2026-08-12 cs.CV 新提交 79%

DoseBridge: Denoising Diffusion Bridge Model for Dose Prediction in Lung Intensity-Modulated Proton Therapy

DoseBridge:用于肺调强质子治疗剂量预测的去噪扩散桥模型

Zerun Zhang, Xiaoda Cong, Xiangkun Xu, Peter Y. Chen, Xuanfeng Ding

机构 * Corewell Health William Beaumont University Hospital(Corewell Health William Beaumont大学医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对肺调强质子治疗剂量预测问题,提出DoseBridge去噪扩散桥模型,融合CT与射野几何信息,在52例患者数据上的多项指标优于对比模型,为放疗剂量预测提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10162 2026-08-12 cs.CV 新提交 79%

MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text

MAD-HOI:用于从文本生成关节手-物体交互的掩码自回归扩散模型

Ananya Bal, Kartik Sharma, Ethan Lai, Samyak Tiwari, Liza Dahiya, Chaitanya Chawla, Laszlo A. Jeni

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MAD-HOI是一种结合掩码自回归与扩散的HOI生成模型,可生成多样且符合物理规律的手-物体交互序列,支持可变长度生成、运动补全填充等功能,在ARCTIC和GRAB数据集上优于开源基线。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16188 2026-08-12 cs.CV 版本更新 79%

TEASR: Training-Efficient Any-Step Diffusion Transformer for Real-World Image Super-Resolution

teasr: 面向真实世界图像超分辨率的训练高效任意步扩散Transformer

Xiang Gao, Chenxin Zhu, Yushun Fang, Qiang Hu, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TEASR框架,通过自对抗蒸馏和时步感知矫正策略,在单一扩散模型中实现任意步采样,无需辅助教师模型,显著提升训练效率并超越现有方法。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13058 2026-08-12 cs.CV cs.AI 版本更新 79%

SynBoost: A Synergistic Framework for Fast Sampling of Diffusion Models

SynBoost:用于扩散模型快速采样的协同框架

Hu Yu, Hao Luo, Xueyang Fu, Jie Huang, Fan Wang, Feng Zhao

机构 * USTC(中国科学技术大学) DAMO Academy, Alibaba Group(阿里云达摩院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散模型采样速度慢的问题,提出无需训练的SynBoost框架,通过双误差解耦策略缓解离散化与近似误差,可与现有采样器集成并提升速度与生成质量,在少步数场景中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10983 2026-08-12 cs.IR cs.AI 新提交 78%

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

TimeRoute:面向多模态推荐的时间感知模态路由与扩散模型

Pengyu Zhang, Yangqin Jiang, Klim Zaporojets, Congfeng Cao, Paul Groth

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TimeRoute通过时间感知模态路由器和带FiLM的双流去噪扩散图重构器,解决多模态推荐的模态时间尺度不匹配问题,在三个公开数据集上提升了推荐指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10980 2026-08-12 cs.SD 新提交 78%

Measuring Cross-Cultural Style Diffusion Through Era Classification: US and Korean Popular Music

通过时代分类测量跨文化风格传播:美国与韩国流行音乐

Dasol Lee, Minhee Lee, Seonguk Ju, Daewoong Kim, Harin Lee, Dasaem Jeong

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出时代分类框架,通过CNN分类器量化美韩流行音乐的跨文化风格传播,发现1960-80年代韩流滞后美流4-5年,90年代后偏差缩小,该框架可推广至其他榜单文化对。

Comments 8 pages, 6 figures, 4 tables. Accepted at ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10941 2026-08-12 cs.LG 新提交 78%

Physics-informed Diffusion Generative Model for Time-Series Data Synthesis in Dynamic Systems

用于动态系统时间序列数据合成的物理信息扩散生成模型

Haiteng Wang, Yunfei Zhu, Tao Wang, Yikang Li, Jiabao Dong, Xiaoge Zhang, Lei Ren

机构 * Beihang University(北京航空航天大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出PhysDGM模型,将物理规则嵌入扩散生成过程以合成符合物理定律的工业时间序列,构建的440万样本数据集可提升下游任务性能并减少数据需求,助力数据稀缺环境的AI应用。

Comments 27 pages; 5 main figures and 4 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10615 2026-08-12 cs.CL 新提交 78%

Simplex Relaxation for Discrete Diffusion

离散扩散的单纯形松弛

Jinya Sakurai, Patrick Pynadath, Satoshi Hayakawa, Jaehong Yoon, Xulei Yang, Nancy F. Chen, Xun Xu

机构 * NTU Singapore(新加坡南洋理工大学) The University of Tokyo(东京大学) Purdue University(普渡大学) Institute for Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) Centre for Frontier AI Research (CFAR), A*STAR(新加坡科技研究局前沿人工智能研究中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出Simplax方法,通过单纯形松弛丰富离散扩散模型的训练目标与反向转移,在OpenWebText和数独生成任务中取得了更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10438 2026-08-12 cs.AI 新提交 78%

Continuous Interaction Diffusion: A Diffusion-Native Runtime for Asynchronous Tool-Augmented Reasoning

连续交互扩散:面向异步工具增强推理的原生扩散运行时

Yuhang Cao

机构 * Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散语言模型异步工具增强推理的局限,提出连续交互扩散架构,将工具交互整合至迭代去噪,可提升效率并减少冗余,首次聚焦只读工具。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10393 2026-08-12 cs.AI cs.RO 新提交 78%

Hidden in Plain Sight: Diffusion-Based Unrestricted Robotic Attacks on Vision-Language-Action Models

隐藏于明处:针对视觉-语言-动作模型的基于扩散的无约束机器人攻击

Jiahui Han, Yuhui Yao, Xin Wang, Jiafei Cao, Mingxuan Zhang, Danfeng Shan, Huiqi Deng, Guanchu Wang, Xia Hu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出基于扩散的无约束机器人攻击方法DURA,针对视觉-语言-动作模型生成自然对抗补丁,实验表明其性能优于现有方法,暴露了物理部署的VLA模型的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11178 2026-08-12 math.PR 新提交 78%

A submartingale for the probability of avoiding the origin in one-point interaction ground-state diffusion: $d \in \{2,3\}$

单点相互作用基态扩散中避开原点概率的次鞅:$d \in \{2,3\}$

Barkat Mian

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对二维和三维带单点势的奇异扩散,构造次鞅分析其击中原点的概率、首次击中时间分布及避开原点的条件动力学,以统一方法验证相关性质。

Comments 35 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11172 2026-08-12 math.AP 新提交 78%

A reaction-diffusion system with nonconstant diffusion coefficients: exact and numerical solutions

带有非常数扩散系数的反应-扩散系统:精确解与数值解

Roman Cherniha, Galyna Kriukova

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究带非常数扩散的Lotka-Volterra反应-扩散系统,构造多参数精确解,证明其满足零Neumann条件及存在两个稳定稳态点,用精确解求解边值问题并验证小扰动下数值解与精确解吻合度高。

Comments 21 pages, 7 figures

Journal ref Axioms, 2025, vol.14, 655

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11107 2026-08-12 math.AP 新提交 78%

Harnack-type inequalities and traveling waves for non-cooperative nonlocal diffusion systems

非合作非局部扩散系统的哈纳克型不等式与行波

Bo-Sheng Chen, Chang-Hong Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对实数域上弱耦合非局部扩散系统,建立了不依赖耦合矩阵合作性或不可约性的ℓ¹-范数哈纳克型不等式,结合重标度论证等方法,得到了一类带网络结构的非合作非局部扩散系统行波的最小波速存在性及波剖面负无穷处的精确渐近行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11055 2026-08-12 math.NA cs.NA 新提交 78%

Diffusion Quasi-Monte Carlo

Jianlong Chen, Yifeng Yu

专题命中 扩散模型 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10868 2026-08-12 cond-mat.dis-nn math-ph math.MP quant-ph 新提交 78%

Analytical Theory for Anomalous Diffusion in the Anderson Model with Heavy Tails

具有重尾跳变幅度的安德森模型中反常扩散的分析理论

Elizaveta Safonova, Aleksey Lunkin, Mikhail Feigel'man

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对具有重尾跳变幅度的非相互作用安德森模型建立反常输运分析理论,推导均方位移时间依赖关系,发现稀有跳变过程可作为单粒子机制产生反常输运,为区分两类动力学提供基准。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08086 2026-08-12 cs.CL 版本更新 78%

Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models

Archer:用于扩散语言模型高效回滚的缓存隐藏状态自适应复用方法

Xuning He, Zinan Sheng, Yongding Tao, Huanyu Liu, Ge Li, Xue Jiang, Yihong Dong

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Archer方法,通过自适应复用缓存的提示隐藏状态,在保证扩散语言模型回滚能力的同时,实现了2.57倍平均加速与33.63%最佳平均性能,还提升了Pass@1指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28560 2026-08-12 cs.RO 版本更新 78%

X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching

X-NavDP:通过组Q分数重加权匹配将导航扩散策略泛化到新行为和实体

Tianyu Yang, Yiming Zeng, Wenzhe Cai, Yuqiang Yang, Jiaqi Peng, Hui Cheng, Jiangmiao Pang, Tai Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对导航扩散策略泛化性不足的问题,提出GQRM框架对X-NavDP进行后训练,大幅提升了跨实体视觉导航的模拟与现实场景成功率。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06458 2026-08-12 hep-ph hep-ex nucl-ex 78%

Diffusion-Based Point-Cloud Generation of Heavy-Ion Events

基于扩散的重离子事件点云生成

Rita Sadek, Vinicius Mikuni, Mateusz Ploskon

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散过程和Point-Edge Transformer架构的快速高保真重离子事件生成模型,通过两阶段训练策略生成高多重性事件,并通过多种闭合检验验证模型的有效性。

Journal ref Phys. Rev. C 114, 024904 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19696 2026-08-12 cs.RO cs.AI cs.LG 版本更新 78%

Diffusion-Based Impedance Learning for Contact-Rich Manipulation Tasks

基于扩散的阻抗学习用于接触丰富的操作任务

Noah Geiger, Tamim Asfour, Neville Hogan, Johannes Lachner

机构 * Institute for Anthropomatics and Robotics, Karlsruhe Institute of Technology(人机动力学与机器人研究所,卡尔斯鲁厄技术大学) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑与认知科学系,麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散的阻抗学习框架,结合生成建模与能量一致的阻抗控制,实现接触丰富的操作任务中的高精度动态控制与任务泛化能力。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03533 2026-08-12 math.AP math-ph math.MP 版本更新 78%

Pulse-response analysis of a simple reaction-advection-diffusion equation

简单反应-对流-扩散方程的脉冲响应分析

Jiasong Zhu, Renato Feres, Donsub Rim, Gregory Yablonsky

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过分析反应-对流-扩散方程的脉冲响应,研究了对流速度对化学活性的影响,并提出通过比值确定化学活性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11527 2026-08-12 math.NA cs.NA 版本更新 78%

A compact fourth-order doubly conservative active flux method with maximum-principle-preserving limiting for degenerate convection--diffusion equations

求解退化对流-扩散方程的紧致四阶双守恒主动通量方法,兼具最大原理保持限幅特性

Junming Duan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种紧致四阶双守恒主动通量方法,用于求解退化对流-扩散方程,兼具最大原理保持限幅特性,数值实验验证了其四阶收敛性、界值保持性及对激波的精确分辨能力。

Comments 34 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22839 2026-08-12 cs.LG cs.AI 版本更新 78%

Demystifying Adversarial Robustness in Diffusion Models: Compression, Randomness, and Geometry

Liu Yuezhang, Xue-Xin Wei

机构 * UT Austin(德克萨斯大学)

专题命中 扩散模型 :diffusion(title,abstract)

Comments 28 pages, 6 figures, 7 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏