arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-05 至 2026-08-05 共收录 60 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 1 篇

2608.03357 2026-08-05 cs.CV 新提交 79%

Can Text-to-Image Models Draw from the Right Frame of Reference?

文本到图像模型能否从正确的参考框架中生成图像?

Zheyuan Gu, Ruihang Li, Yong Huang, Yiqian Zhang, XIangzhao Hao, Jiaxin Niu, Jiahao Hu, Zhenyu Zhang

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 该研究引入FoR-T2I基准,发现现有22个T2I模型在参考框架提示下的布局理解准确率远低于相机视图提示,还提出VLM门控重写方法提升了参考框架下的生成准确率。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 3 篇

2608.03974 2026-08-05 cs.CV 新提交 79%

JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion

JoyAI-Video-Edit:基于自回归扩散的实时开放式视频编辑

Yicheng Xiao, Wenxun Dai, Xinran Qin, Lin Song, Maoquan Zhang, Hang Xu, Yukang Chen, Yitong Li, Guohui Zhang, Yuan Zhang, Xuying Zhang, Tommy Zhang, Jianlong Yuan, Peihao Li, Shuai Lu, Siming Fu, Chuyang Zhao, Xin Han, Jie Huang, Wenbo Li, Guoqing Ma, Wei Huang, Xiaojuan Qi, Haoyang Huang, Nan Duan

专题命中 图像编辑 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对实时视频编辑的低延迟、时序一致等需求,提出160亿参数的JoyAI-Video-Edit自回归扩散框架,结合多种蒸馏技术,在单张Nvidia B200 GPU上实现约30 FPS的720p视频编辑,性能优于现有流式编辑器且与离线系统相当。

Comments Code: https://github.com/jd-opensource/JoyAI-Video-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03059 2026-08-05 cs.CV 新提交 79%

RIDGE: Re-Noising with Internal Dynamic Guidance for Image Editing

RIDGE:用于图像编辑的基于内部动态引导的重加噪方法

Ruiliang Gong, Zhen Wang, Yanghao Wang, Long Chen

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 该研究针对无反转图像编辑中等位移构造的缺陷,提出RIDGE方法,通过重加噪与内部动态引导优化编辑,在多基准实验中实现了源保留、目标对齐与感知质量的良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02841 2026-08-05 cs.CV 新提交 57%

Localize, Don't Beautify: Client-Side Control of Image-Editing APIs for Cosmetic Surgery Previews

聚焦定位,而非美化:面向整容预览的图像编辑API的客户端控制

Sukhrobbek Ilyosbekov

专题命中 图像编辑 :inpainting(abstract);分类 cs.CV

AI总结 本文针对公开图像编辑API无法提供模型内部信息的问题,提出客户端通过掩码合成可实现整容预览的区域定位,在保证身份保留的同时提升编辑区域的准确性,且效果优于仅用提示词的方式。

Comments 9 pages, 7 figures, 2 tables. Pilot study; no surgeon ratings. Code and paper source: https://github.com/suxrobGM/localize-dont-beautify

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 48 篇

2608.03937 2026-08-05 cs.CV cs.CR 新提交 89%

Progressive Learning of a Diffusion-based Inpainting Model for Separating Overlapped Fingerprints

用于分离重叠指纹的基于扩散模型的修复模型的渐进式学习

Noor Hussein, Anil K. Jain, Karthik Nandakumar

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本研究针对重叠指纹分离问题,提出渐进式学习的基于扩散的修复模型,结合指纹先验与多通道条件的感知重叠修复,在公开数据集上实现了高匹配度的组成指纹重建。

Comments Accepted to IJCB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03284 2026-08-05 cs.CV cs.AI 新提交 89%

Test-Time Scaling for Safe Text-Guided Image Generation via Intermediate Clean Estimates

通过中间干净图像估计实现安全文本引导图像生成的测试时缩放

Jinya Sakurai, Shueicheng Yan, Xun Xu

专题命中 扩散模型 :diffusion(summary_cn,abstract);image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 该研究针对文本到图像扩散模型的安全问题,提出利用中间干净图像估计和稀疏边际目标的测试时缩放方法,在 Stable Diffusion 上实现了更优的安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03990 2026-08-05 cs.LG 新提交 88%

Assessment of Conditional Diffusion Model for Synthetic Histopathology Image Generation

用于合成组织病理学图像生成的条件扩散模型评估

Seyed Kahaki, Shijie Li, Weijie Chen, Nicholas Petrick

专题命中 扩散模型 :image generation(title,abstract);diffusion(title,abstract)

AI总结 本研究针对合成组织病理学图像生成的评估问题,提出基于数字病理学预训练基础模型改进的FID、IS及精确率-召回率指标,实验发现改进后的IS与下游细胞核分割性能相关性更高,且生成数据多样性对分割性能的提升作用强于单张图像视觉保真度。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03938 2026-08-05 cs.RO cs.SY eess.SY 新提交 80%

Bimanual Manipulation Within an 8 GB Budget: Zero-Copy Sensing and Quantized ACT on an Entry-Level Jetson

8 GB预算内的双臂操作:入门级Jetson上的零拷贝感知与量化ACT

Ekansh Singh, Eva Samuel, Alessandra Reneau, Ryan Schmeelk, Yashvi Gandhi

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 该研究在8 GB入门级Jetson上实现了双臂操作,采用零拷贝感知、量化ACT,发现ACT在相同演示下优于Diffusion Policy,INT8量化可大幅降低延迟且保留任务成功率。

Comments 9 pages, 8 tables. Work conducted at the Georgia Tech Research Institute (GTRI), Aerospace, Transportation and Advanced Systems Laboratory (ATAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03540 2026-08-05 cs.CV 新提交 79%

S$^3$-Diff: Structural Semantic Synergy Diffusion Model for High Fidelity Super Resolution of Pathological Images

S³-Diff:用于病理图像高保真超分辨率的结构语义协同扩散模型

Jiaming Liang, QiHui Han, Guangye Ou, Jiawen Liu, Haolin Chen, Xi Zhong, Jiazhou Chen, Xiaoqi Sheng, Hongmin Cai

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现有病理图像超分辨率技术易致形态平滑、语义漂移的问题,提出S³-Diff模型,通过SSA与SSFT实现高保真超分,性能优于现有最优方法,源代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03539 2026-08-05 cs.CV 新提交 79%

IRIS: Visual-Semantic Binding for Forgery-Resistant Watermarking of Diffusion Images

IRIS:用于扩散图像防伪造水印的视觉-语义绑定

Xiaoyan Feng, Zheng Gao, Tong Guan, Rui Bao, Bokang Zeng, Xiaoyu Li, Jiaojiao Jiang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 IRIS是一种无需训练的扩散图像防伪造水印方案,通过视觉-语义绑定抵御固定图案移植与事后再生剥离,在三个提示数据集上检测可靠且保真度优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03335 2026-08-05 cs.CV 新提交 79%

SPADE: An Input-Adaptive Sparse Attention Engine for Fast Video Diffusion Models Inference

SPADE:用于快速视频扩散模型推理的输入自适应稀疏注意力引擎

Shanghao Liu, Renze Chen, Size Zheng, Yuanqiang Liu, Yun, Liang, Hailong Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对视频扩散Transformer推理开销过高的问题,提出无训练的SPADE稀疏注意力引擎,通过三部分设计实现注意力2.26x-3.40x、端到端推理1.49x-1.80x的加速且保持生成质量。

Comments Published in the 63rd ACM/IEEE Design Automation Conference (DAC '26). 7 pages, 6 figures, 3 tables

Journal ref 63rd ACM/IEEE Design Automation Conference (DAC '26), 2026, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03082 2026-08-05 cs.CV 新提交 79%

DiverseDiT++: Quantifying, Analyzing, and Promoting Representation Diversity in Diffusion Transformers

DiverseDiT++:量化、分析与提升扩散Transformer的表示多样性

Binglei Li, Mengping Yang, Zhiyu Tan, Xiaomeng Yang, Zhizhong Huang, Junping Zhang, Hao Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对扩散Transformer(DiTs)表示学习机制不明的问题,提出加权多样性分数(WDS)指标,进而构建DiverseDiT++框架提升表示多样性,在ImageNet数据集上实现了性能提升与收敛加速。

Comments 35 pages, 32 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03566 2026-08-05 stat.ML cs.LG stat.AP stat.ME 新提交 78%

Divide-and-Conquer: Towards Generalizable Amortized Bayesian Inference for the Drift Diffusion Model

分而治之:面向漂移扩散模型的可推广摊销贝叶斯推断

Yufei Wu, Shanqing Gao, Andreas Voss, Francis Tuerlinckx

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对摊销贝叶斯推断无法推广至不同研究设计的局限,提出分而治之框架,将DDM数据集分解为成对数据片后单独推断再用共识MCMC结合,在保持与MCMC相当性能的同时大幅降低计算成本,为ABI方法提供通用优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03469 2026-08-05 stat.ML cs.LG 新提交 78%

Should the Boundary Term Be Learned in Reflected Diffusion? Conormal Trace and Reflection Masking

在反射扩散中是否应学习边界项?余法迹与反射掩蔽

Ziyue Wang, Takafumi Kanamori

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究探讨有界域反射扩散的分数学习,提出无需额外参数的超矩形等域参数化方法,发现硬反射可掩盖边界分数误差,实验验证反射频率等因素对误差分离的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03769 2026-08-05 cs.CL cs.AI 新提交 78%

MDLMPE: Distribution Aware Positional Encoding for Masked Diffusion Language Models

MDLMPE:面向掩码扩散语言模型的分布感知位置编码

Tong Ling, Hang Lei, Feng Xiao, Changhui Sun, Jiahang Xie, Hao Liu, Lu Liu, Yanlong Du

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对掩码扩散语言模型位置编码对动态标记可用性结构不敏感的问题,提出MDLMPE,通过编码标记可用性等实现分布感知,在LLaDA、DREAM等实验中性能优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03457 2026-08-05 cs.AI 新提交 78%

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

LLaDA MoE v2:扩展混合专家扩散语言模型

Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究明确MoE扩散语言模型的扩展规律,训练30B-A3B的LLaDA MoE v2,其预训练令牌量为Qwen3的65%,经微调后在多数推理编码基准上优于SDAR Chat且接近Qwen3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03260 2026-08-05 cs.LG 新提交 78%

ED-DiT: Physics-Guided Diffusion Pretraining for Transferable Molecular Representations from Electron Density

ED-DiT:用于从电子密度学习可迁移分子表示的物理引导扩散预训练

Liang Shuang, Haocheng Wang, Jiayi Song, Shuquan Ye, Ben Fei

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出ED-DiT,一种物理引导的扩散Transformer,通过电子密度点云自监督预训练学习可迁移分子表示,在6项EDBench任务及低监督场景下均优于基线,展现出良好效果。

Comments 16 pages, 9 figures, 7 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03244 2026-08-05 cs.AI 新提交 78%

UniNav: A Unified World-Action Diffusion Model for Visual Navigation

UniNav:用于视觉导航的统一世界-动作扩散模型

Changqing Zhou, Yueru Luo, Zeyu Jiang, Changhao Chen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 UniNav是统一世界-动作扩散模型,通过单扩散过程生成未来视觉观测与航路点轨迹,其变体UniNav-Fast延迟0.1秒且精度无明显下降,在导航基准上ATE优于最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03159 2026-08-05 cs.RO 新提交 78%

Accelerating Human-Aware Robot Trajectory Generation via Diffusion and Consistency Distillation

基于扩散模型与一致性蒸馏的人机感知机器人轨迹生成加速方法

Byeong-Il Ham, Hyun-Bin Kim, Kyung-Soo Kim

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究针对人机交互场景下机器人轨迹生成的约束与效率问题,结合RRT/RRT*算法、扩散模型与一致性蒸馏技术,实现了快速、低加加速度的机器人轨迹生成。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03117 2026-08-05 cs.LG 新提交 78%

Simulation-free and finite-time diffusion model

无模拟且有限时间的扩散模型

Kentaro Kaba, Masayuki Ohzeki, Yuki Sughiyama

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一种参考过程设计框架,可同时实现无模拟训练与有限时间生成,还揭示得分匹配并非扩散模型训练的基础,且条件流匹配是该框架的小噪声极限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03087 2026-08-05 cs.LG cs.AI 新提交 78%

SynEnergy: Anomaly Semantic-Guided Diffusion for Synthetic Energy Data Generation

SynEnergy:面向合成能源数据生成的异常语义引导扩散模型

Lin Jiang, Dahai Yu, Ravikumar Gelli, Guang Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出SynEnergy,一种两阶段扩散框架,通过HG-ASL提取异常语义、AS-Diff生成数据,在四个真实能源数据集上较11种基线提升异常保留与下游质量,可扩展至城市级场景。

Comments 24 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03032 2026-08-05 cs.SD 新提交 78%

DDSynth-RL: Audio Synthesizer Inversion via Discrete Diffusion with Reinforcement Learning

DDSynth-RL:结合强化学习的离散扩散音频合成器逆问题求解

Tristan Wu, Daniel Chin, Junan Zhang, Junyan Jiang, Yansen Jing, Gus Xia

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对合成器逆问题的两大挑战,提出结合掩码离散扩散与GRPO风格音频域奖励微调的DDSynth-RL方法,在Dexed上验证了其性能优势。

Comments Accepted to the 27th International Society for Music Information Retrieval Conference (ISMIR 2026). 8 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02625 2026-08-05 cs.CL cs.AI 新提交 78%

Speculative Correction: Draft-then-Refine Decoding for Diffusion Language Models

推测校正:扩散语言模型的草稿后精炼解码

Brian K Chen, Chong Wu, Kenji Kawaguchi

机构 * National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对扩散语言模型提出草稿后精炼解码方案,通过 Flash-Flash 和 Mini-Flash 配置在 GSM8K、MBPP、MATH 数据集上提升准确率并加快推理速度,为双向精炼及快速生成提供新路径。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03398 2026-08-05 cond-mat.stat-mech 新提交 78%

The intermediate scattering function of an interacting adlayer as a characteristic function: a closed-form theory of Ising lattice-gas surface diffusion

作为特征函数的相互作用吸附层中间散射函数:Ising格气表面扩散的闭式理论

S. Miret-Artés

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出了Ising格气表面扩散的闭式理论,推导了中间散射函数的闭式形式,经KMC模拟验证,可用于Na/Cu(111)和H/Pt(111)等体系的分析。

Comments 34 pages; 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03180 2026-08-05 cond-mat.stat-mech math-ph math.MP physics.class-ph quant-ph 新提交 78%

Exact Resonances Are Not Sufficient for Phonon Energy Diffusion

精确共振不足以实现声子能量扩散

Wei Lin, Yong Zhang, Hong Zhao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究指出精确共振匹配等运动学条件不足以实现声子能量扩散,需准共振维持能量扩散,且热力学与弱非线性极限不可交换,明确了声子能量扩散的动力学判据。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02916 2026-08-05 cond-mat.mes-hall cond-mat.dis-nn 新提交 78%

Chaos and Diffusion in Twisted Bilayer Graphene

扭曲双层石墨烯中的混沌与扩散

Olga Arroyo-Gascón, Manuel Pino

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文通过数值分析实验相关的扭曲双层石墨烯模型,发现公度与非公度旋转角下的有限系统均存在混沌,边界作为单粒子散射机制强于单层石墨烯,可诱导混沌与扩散。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03057 2026-08-05 cs.CV 新提交 74%

TASQ: Temporal-Adaptive Bit Sparsification Quantization for Diffusion Models

TASQ:用于扩散模型的时间自适应比特稀疏化量化

Seokho Han, Dongwei Wang, Jinhee Kim, Yiran Chen, Kang Eun Jeon, Huanrui Yang, Jong Hwan Ko

专题命中 扩散模型 :diffusion(title);分类 cs.CV

AI总结 针对扩散模型静态量化的计算开销问题,提出TASQ方法,结合时间精度引擎,在保持质量的同时显著降低执行周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03215 2026-08-05 eess.AS cs.AI cs.CL 新提交 71%

GROW: Group-Relative Advantage-Weighted On-Policy Reinforcement Learning of Autoregressive-Diffusion Text-to-Speech model

GROW:用于自回归扩散文本到语音模型的组相对优势加权在线策略强化学习

Guanrou Yang, Tian Tan, Qian Chen, Ziyang Ma, Yakun Song, Zhikang Niu, Qi Chen, Wenming Tu, Haitao Li, Shan Yang, Xie Chen

专题命中 扩散模型 :diffusion(title)

AI总结 本研究提出GROW方法,将其应用于DiTAR模型,在LibriSpeech和Seed-TTS数据集上提升TTS的WER和说话人相似度,且训练速度更快,计划开源相关代码与模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03135 2026-08-05 cs.CV cs.AI 新提交 70%

Rectify Then Diffuse: Disentangling Concepts Before Denoising Trajectory Unfolds

先校正再扩散:去噪轨迹展开前解耦概念

Ning Zhu, An Chen, Mengfei Zhao, Juntao Xu, Jingze Liang, Boyuan Gu, Liang-Jian Deng

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 针对文本到图像扩散模型多概念生成时的遗漏或合并错误,提出无训练框架RTD,通过SOD和IGR校正初始概念分配,在AE-Bench上实现组合保真度与效率的显著提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03330 2026-08-05 cs.AI 新提交 67%

Long-term Traffic Scene Prediction via Polynomial Representations in Autonomous Driving

自动驾驶中基于多项式表示的长期交通场景预测

Yue Yao

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 本研究提出基于多项式表示的自动驾驶交通场景预测模型,结合理论分析与实证验证,在标准基准上接近最优准确率,提升分布偏移下的泛化能力,生成更合理的多智能体场景,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏