arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-12 至 2026-08-12 共收录 36 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2607.14945 2026-08-12 cs.CV 版本更新 90%

Introspective Attention Modulation for Safe Text-to-Image Generation

用于安全文本到图像生成的内省注意力调制

Basim Azam, Hossein Rahmani, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Lancaster University(兰卡斯特大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);image synthesis(abstract)

AI总结 研究基于流的文本到图像模型易产生不安全内容的问题,提出通过推理时内省调节注意力动态实现安全的方法,该方法在保持或提升质量的同时显著提高安全分数,为安全图像生成提供新途径。

Comments Accepted at ECCV 2026. 20 pages, 7 figures. Project page: https://basim-azam.github.io/iam/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2608.06929 2026-08-12 cs.CV cs.AI 版本更新 79%

MaskFlow: Precise, Consistent and Seamless Regional Image Editing

MaskFlow:精准、一致且无缝的区域图像编辑

Rui Xu, Yang Yong, Shunzi Yang, Ruihao Gong, Chengtao Lv

机构 * SenseTime Research(商汤科技研究院) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 MaskFlow框架通过融合掩码的流匹配目标与Soft-Poisson去接缝模块,结合MEData数据集,实现了精准可控、无缝融合的区域图像编辑,性能优于现有方法。

Comments 18 pages, 6 figures. Project page: https://reychiaro.github.io/MaskFlow

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 28 篇

2509.23452 2026-08-12 cs.CV cs.CL 版本更新 87%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05746 2026-08-12 cs.CV 版本更新 83%

HQ-DM: Single Hadamard Transformation-Based Quantization-Aware Training for Low-Bit Diffusion Models

HQ-DM:基于单Hadamard变换的量化感知训练用于低比特扩散模型

Shizhuo Mao, Hongtao Zou, Qihu Xie, Song Chen, Yi Kang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 HQ-DM通过单Hadamard变换提升低比特扩散模型的量化性能,显著提高Inception Score

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16188 2026-08-12 cs.CV 版本更新 79%

TEASR: Training-Efficient Any-Step Diffusion Transformer for Real-World Image Super-Resolution

teasr: 面向真实世界图像超分辨率的训练高效任意步扩散Transformer

Xiang Gao, Chenxin Zhu, Yushun Fang, Qiang Hu, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出TEASR框架,通过自对抗蒸馏和时步感知矫正策略,在单一扩散模型中实现任意步采样,无需辅助教师模型,显著提升训练效率并超越现有方法。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13058 2026-08-12 cs.CV cs.AI 版本更新 79%

SynBoost: A Synergistic Framework for Fast Sampling of Diffusion Models

SynBoost:用于扩散模型快速采样的协同框架

Hu Yu, Hao Luo, Xueyang Fu, Jie Huang, Fan Wang, Feng Zhao

机构 * USTC(中国科学技术大学) DAMO Academy, Alibaba Group(阿里云达摩院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对扩散模型采样速度慢的问题,提出无需训练的SynBoost框架,通过双误差解耦策略缓解离散化与近似误差,可与现有采样器集成并提升速度与生成质量,在少步数场景中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08086 2026-08-12 cs.CL 版本更新 78%

Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models

Archer:用于扩散语言模型高效回滚的缓存隐藏状态自适应复用方法

Xuning He, Zinan Sheng, Yongding Tao, Huanyu Liu, Ge Li, Xue Jiang, Yihong Dong

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Archer方法,通过自适应复用缓存的提示隐藏状态,在保证扩散语言模型回滚能力的同时,实现了2.57倍平均加速与33.63%最佳平均性能,还提升了Pass@1指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28560 2026-08-12 cs.RO 版本更新 78%

X-NavDP: Generalizing Navigation Diffusion Policy to Novel Behavior and Embodiments with Group Q-score Reweighted Matching

X-NavDP:通过组Q分数重加权匹配将导航扩散策略泛化到新行为和实体

Tianyu Yang, Yiming Zeng, Wenzhe Cai, Yuqiang Yang, Jiaqi Peng, Hui Cheng, Jiangmiao Pang, Tai Wang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对导航扩散策略泛化性不足的问题,提出GQRM框架对X-NavDP进行后训练,大幅提升了跨实体视觉导航的模拟与现实场景成功率。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19696 2026-08-12 cs.RO cs.AI cs.LG 版本更新 78%

Diffusion-Based Impedance Learning for Contact-Rich Manipulation Tasks

基于扩散的阻抗学习用于接触丰富的操作任务

Noah Geiger, Tamim Asfour, Neville Hogan, Johannes Lachner

机构 * Institute for Anthropomatics and Robotics, Karlsruhe Institute of Technology(人机动力学与机器人研究所,卡尔斯鲁厄技术大学) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(脑与认知科学系,麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散的阻抗学习框架,结合生成建模与能量一致的阻抗控制,实现接触丰富的操作任务中的高精度动态控制与任务泛化能力。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03533 2026-08-12 math.AP math-ph math.MP 版本更新 78%

Pulse-response analysis of a simple reaction-advection-diffusion equation

简单反应-对流-扩散方程的脉冲响应分析

Jiasong Zhu, Renato Feres, Donsub Rim, Gregory Yablonsky

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过分析反应-对流-扩散方程的脉冲响应,研究了对流速度对化学活性的影响,并提出通过比值确定化学活性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11527 2026-08-12 math.NA cs.NA 版本更新 78%

A compact fourth-order doubly conservative active flux method with maximum-principle-preserving limiting for degenerate convection--diffusion equations

求解退化对流-扩散方程的紧致四阶双守恒主动通量方法,兼具最大原理保持限幅特性

Junming Duan

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种紧致四阶双守恒主动通量方法,用于求解退化对流-扩散方程,兼具最大原理保持限幅特性,数值实验验证了其四阶收敛性、界值保持性及对激波的精确分辨能力。

Comments 34 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22839 2026-08-12 cs.LG cs.AI 版本更新 78%

Demystifying Adversarial Robustness in Diffusion Models: Compression, Randomness, and Geometry

Liu Yuezhang, Xue-Xin Wei

机构 * UT Austin(德克萨斯大学)

专题命中 扩散模型 :diffusion(title,abstract)

Comments 28 pages, 6 figures, 7 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15955 2026-08-12 math.ST math.PR q-bio.PE stat.TH 版本更新 78%

The mutual arrangement of Wright-Fisher diffusion path measures and its impact on parameter estimation

Wright-Fisher扩散路径测度的相互排列及其对参数估计的影响

Paul A. Jenkins

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究Wright-Fisher扩散路径测度的相互排列,确定其分离时间,推导突变与选择参数的联合最大似然估计量,扩展了经典结果并建立相关零一律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06237 2026-08-12 math.AP 版本更新 71%

Well-posedness of stochastic time-nonlocal telegraph equations with Hölder diffusion coefficient: hereditary phase-space lifting and novel generalized coupling method

具有Hölder扩散系数的随机时间非局部电报方程的适定性:遗传相空间提升与新型广义耦合方法

Xi Huang, Li Peng, Juan Carlos Pozo, Yong Zhou

专题命中 扩散模型 :diffusion(title)

AI总结 本文针对具有Hölder扩散系数的随机时间非局部电报方程,通过遗传相空间提升框架与新型广义耦合方法,首次证明其弱解的存在性与律唯一性,还将该框架拓展至低正则性非线性项的处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23688 2026-08-12 cs.CV 版本更新 70%

Do Protective Perturbations Really Protect Portrait Privacy under Real-world Image Transformations?

保护性扰动在现实世界图像变换下是否真的能保护肖像隐私?

Ruiqing Sun, Xingshan Yao, Zhijing Wu, Tian Lan, Chenhao Cui, Huiyang Zhao, Jialing Shi, Chen Yang, Xianling Mao

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 扩散模型 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文评估了现实世界图像变换对基于像素扰动的主动防御方法的影响,发现其有效性受挑战,并提出净化框架以去除保护性扰动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09385 2026-08-12 cs.LG cs.AI cs.CV 版本更新 57%

Imaginative Generative AI: Crossing the Entropy Wall into Worlds Beyond Imitation

想象式生成人工智能:跨越熵墙进入超越模仿的世界

Farzan Farnia, Hossein Goli, Amin Gohari

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出IGA框架,通过熵约束投影实现从模仿到想象的生成,可修复数据多样性并实现可控频谱外推,相关方法适用于DDPM等扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07864 2026-08-12 cs.CV 版本更新 57%

UniScale: Arbitrary-Scale Industrial Anomaly Generation

UniScale:任意尺度的工业异常生成

Shilei Zeng, Linxin Guan, Xurui Li, Yaohan Tang, Yu Zhou

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对工业异常检测中真实异常样本不足及小尺度异常易丢失的问题,提出UniScale框架,通过EMT策略和生成后融合去噪方法,在VisA、MVTec AD 2等数据集上显著优于现有方法。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28803 2026-08-12 cs.CV cs.LG 版本更新 57%

HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models

Ω-QVLA: 通过复合旋转和逐步缩放实现视觉-语言-动作模型的鲁棒量化

Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu

机构 * McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出Ω-QVLA,首个无需训练的后训练量化框架,通过复合SVD-Hadamard旋转和逐步DiT激活缩放量化,将VLA模型的语言骨干和扩散动作头统一压缩至W4A4精度,在LIBERO上达到或超越FP16性能,内存减少71.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02937 2026-08-12 cs.LG cs.AI cs.CE 版本更新 50%

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

Proteo-R1:用于从头蛋白质设计的推理基础模型

Fang Wu, Weihao Xuan, Heli Qi, Hanqun Cao, Heng-Jui Chang, Zeqi Zhou, Haokai Zhao, Ma Jian, Carl Ma, Yu-Chi Cheng, Kuan Pang, Xiangru Tang, Zehong Wang, Guanlue Li, Hanchen Wang, Kejun Ying, Pan Lu, Chiho Im, Seungju Han, Peng Xia, Tinson Xu, Yinxi Li, Deyao Zhu, Pheng-Ann Heng, Naoto Yokoya, Masashi Sugiyama, Li Erran Li, Jure Leskovec, Yejin Choi

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08787 2026-08-12 eess.AS 版本更新 50%

Beyond Reconstruction: Full-Context Generative DiT for Music Generation

超越重构:用于音乐生成的全上下文生成式DiT

Yunjia Li, Menglin Wu, Junyu Dai, Xinyue Fan, Xiangang Li, Haoxu Wang, Jianwei Yu, Huaicheng Zhang, Han Zhao, Weiqin Li, Yufei Shi, Cheng Wen, Sitong Zhao, Qixi Zheng, Haina Zhu, Wei Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出FullDiT模型,通过EMDC和4-CFG等技术解决混合音乐生成器的编解码器接口暴露偏差问题,其系统在多数自动指标上优于商业系统且在人工分析中排名前三。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21421 2026-08-12 cs.AI 版本更新 50%

Learning and Structurally Validating Simulation Scenario Continuations in Dynamic Graph Systems

弥合合理性与可接受性之间的差距:动态图系统的约束感知流图

Michael Romei de Socio, Gian Luca Pozzato, Alessio Merlo

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究探讨采样后符号约束对动态图系统生成轨迹建模可靠性的影响,用条件扩散模型结合外部符号层,在两个合成场景评估,表明统计合理性与结构可接受性不同,图结构复杂时符号约束处理更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19732 2026-08-12 cond-mat.mtrl-sci cond-mat.mes-hall quant-ph 版本更新 50%

A Thermodynamic-Limit Pinning Criterion for Two-Dimensional Structural Superlubricity

二维结构超润滑性的热力学钉扎判据

Li Wang, Yunjie Ye

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究二维结构超润滑性的热力学钉扎判据,通过定义完全滑动和钉扎零温度相及相关测量量,在二维离散模型中测试多种势,发现测试模型符合弹性松弛滑动状态,指出$\Lambda=1$是重构尺度非静态相判据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17002 2026-08-12 math-ph math.DS math.MP 版本更新 50%

Stochastic stability of master--slave synchronization for dissipative PDEs with Burgers-type nonlinearity

具有Burgers型非线性的耗散偏微分方程主从同步的随机稳定性及其在数据同化中的应用

Joaquín Miguez, Inés P. Mariño

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究具有Burgers型非线性的耗散偏微分方程主从同步的随机稳定性,通过傅里叶截断等方法,先证确定性同步流形局部指数稳定性,再引入噪声分析偏差,得到均方界等结果,还将其用于数据同化并与滤波器比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12489 2026-08-12 cs.IT cs.LG math.IT 版本更新 50%

Masked Neural Detection for Run-Length-Limited Channel Coding in Molecular Communication

分子通信中约束信道编码的掩码神经检测

Melih Şahin, Ozgur B. Akan

机构 * Centre for neXt Communications (CXC), Department of Engineering, University of Cambridge(下一代通讯中心(CXC)、工程系、剑桥大学) Centre for neXt Communications (CXC), Department of Electrical and Electronics Engineering, Koç University(下一代通讯中心(CXC)、电子与电气工程系、科克大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对分子通信中的扩散记忆问题,提出掩码神经检测器,结合RLIM约束码与SBRNN,在多数情况下优于未编码检测,平均增益达10.36倍,并设计RLIM定制训练掩码进一步提升性能。

Comments 5 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22005 2026-08-12 cs.IT cs.LG eess.SP math.IT 版本更新 50%

Null-Space Flow Matching for MIMO Channel Estimation in Latency-Constrained Systems

空域流匹配用于受限延迟系统的MIMO信道估计

Junjie Zhao, Guangming Liang, Xiaonan Liu, Dongzhu Liu

机构 * College of Electronic Information and Optical Engineering(电子信息与光学工程学院) University of Glasgow(格拉斯哥大学) University of Aberdeen(阿伯丁大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出空域流匹配框架,将受限试点的MIMO信道估计分解为范围空间重建和空域生成问题,通过流匹配生成先验实现高效准确的信道估计,在严格延迟约束下实现优于基模型和生成模型的性能。

Comments 6 pages, 3 figures, 19 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05612 2026-08-12 hep-ph nucl-th 版本更新 50%

Non-universality of color transparency onset in pion and kaon electroproduction

介子和kaon颜色透明度的正规范和通道依赖性形成动力学

Byung-Geel Yu, Tae Keun Choi, Kook-Jin Kong

专题命中 扩散模型 :diffusion(abstract)

AI总结 介子和kaon电产生数据揭示了颜色透明度起始的两个特征:正规范在两种反应中作用不同,且介子透明度由量子扩散模型解释,而kaon数据则显示不同的介子形成动力学。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28521 2026-08-12 math.NA cs.NA 版本更新 50%

Quantum Enhanced Numerical Homogenization

量子增强的数值均质化

Loïc Balazi, Matthias Deiml, Daniel Peterseim

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种结合经典粗尺度求解器与量子子程序的数值均质化方法,用于求解具有粗糙系数的标量线性偏微分方程,通过量子局部问题求解器高效捕捉细尺度特征,克服了量子接口的信息瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13136 2026-08-12 cs.LG 版本更新 50%

Order Matters in Retrosynthesis: Structure-aware Generation via Reaction-Center-Guided Discrete Flow Matching

retrosynthesis 中的顺序至关重要:通过反应中心引导的离散流匹配实现结构感知生成

Chenguang Wang, Zihan Zhou, Lei Bai, Tianshu Yu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出了一种结构感知的模板自由框架,通过反应中心引导的离散流匹配实现高效的 retrosynthesis 生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01743 2026-08-12 cond-mat.soft physics.bio-ph 版本更新 50%

Thermodynamically Consistent Modeling of ATP-Driven Cross-Bridge Dynamics in Muscle Contraction

具有三种状态的热力学一致的跨桥模型用于肌肉收缩

Yiwei Wang, Chun Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种具有三种状态的热力学一致跨桥模型,用于描述肌肉收缩,结合Hill循环和Huxley滑动丝机制,通过能量变分方法统一框架,展示ATP水解对力-速度关系的影响。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21756 2026-08-12 physics.flu-dyn 版本更新 50%

Modeling complex motility patterns for autophoretic microswimmers

建模复杂运动模式以实现自催化微游泳器

Anupriya Dutta Roy, Smita S. Sontakke, Arvind Kumar, Ranabir Dey, Anupam Gupta

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出了一种新的数值框架,用于建模各向同性的自催化微游泳器,通过自生成的化学梯度实现推进,无需施加几何或化学各向异性,有效捕捉非线性输运和多粒子相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏