arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-04 至 2026-08-04 共收录 106 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 6 篇

2608.01780 2026-08-04 cs.CV cs.AI 新提交 83%

Investigating Social Bias in Narrative Image Generation

探究叙事图像生成中的社会偏见

Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究将偏见评估框架BBG适配图像生成,对比6种T2I模型在照片、分镜、漫画生成中的偏见表现,发现叙事视觉形式中偏见更易显现,强调需用多样视觉形式评估T2I系统。

Comments Accepted to GenAI4World Workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00598 2026-08-04 cs.MM cs.CY 新提交 79%

EmergencyBias: Bias in Text-to-Image Models under Emergency Scenarios

EmergencyBias:文本到图像模型在应急场景下的偏差

Haibo Tang, Linqi Zhang, Hongxin Huan, Chenwei Lin, Xian Xu

专题命中 文生图 :text-to-image(title,abstract);分类 cs.MM

AI总结 本文定义了T2I模型在应急场景下的EmergencyBias,构建评估框架发现其存在人口统计学与行为偏差,提出ActionAlign方法可减少行为差异并保留图像质量。

Comments 15 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00973 2026-08-04 cs.CL 新提交 78%

Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems

关注差距:基于文本到图像系统中过滤器-生成器差异的零查询越狱攻击

Wanguang Li, Zhaoxin Wang, Handing Wang

专题命中 文生图 :text-to-image(title,abstract)

AI总结 该研究针对文本到图像系统的零查询越狱问题,提出基于过滤器-生成器差异的框架,通过筛选与集成进化搜索提升攻击成功率,在六个黑盒管线及商业服务上效果优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00994 2026-08-04 cs.CV cs.CL 新提交 57%

Entity-Faithful Repair of Synthetic Supervision for Zero-Shot Image Captioning

零样本图像描述中合成监督的实体忠实修复

Zhiyue Liu, Wenkai Zhou, Jian Qin, Qipeng Jiang

机构 * Guangxi University(广西大学) School of Computer, Electronics and Information(计算机与电子信息学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 针对零样本图像描述中合成监督的实体级错位问题,提出即插即用框架ReCap,通过实体级重对齐与自适应加权策略优化合成数据,在两类基准上实现最优性能。

Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026). 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00559 2026-08-04 cs.CV 新提交 57%

Test-Time Curriculum for Open-Set AIGC Detection

开放集AIGC检测的测试时课程

Yiqian Zhang, Zheyuan Gu, Xiangzhao Hao, Zefeng Zhang, Jingjia Mao, Jiahao Hu, Jiaxu Miao, Jun Yu, Zhenyu Zhang, Shuohuan Wang, Yu Sun

机构 * Baidu Inc.(百度公司)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本研究针对开放集AIGC检测的分布偏移问题,提出Test-Time Curriculum框架,结合跨尺度伪标签细化技术,构建AIGCGuard基准,经实验验证可显著提升未见生成器偏移下的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00410 2026-08-04 cs.AI cs.CL cs.CV 新提交 57%

Where did the ambiguity go? Examining how multimodal models interpret polysemous words

歧义去了哪里?探究多模态模型如何解释多义词

Jasin Cekinmez, Addison J. Wu, Raja Marjieh, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 该研究对比17个文本到图像模型和15个文本生成模型,发现多模态模型生成图像的词义多样性低于文本,揭示了基础模型在不同模态间意义表达的迁移 gap。

Comments Oral Presentation, Sci-FM Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 4 篇

2608.02059 2026-08-04 cs.CV cs.MM 新提交 81%

MIEScore: Human-Aligned Evaluation for Multi-Source Image Editing

MIEScore:面向多源图像编辑的人类对齐评估方法

Zitong Xu, Huiyu Duan, Xinyun Zhang, Weifei Xiong, Tianyi Zheng, Xiongkuo Min, Qiang Hu, Zhengxue Cheng, Bo Li, Guangtao Zhai

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV、cs.MM

AI总结 针对多源图像编辑(MIE)缺乏人类对齐评估基准的问题,研究构建了首个MIE基准MIE-Bench,并提出基于MLLM的评估模型MIEScore,其对齐人类偏好性能最优且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00736 2026-08-04 cs.CV 新提交 79%

MDTD-ArtIR: Benchmarking Image Editing and Restoration Models for Art Image Restoration under Texture-Overlay Degradations

MDTD-ArtIR:针对纹理叠加退化的艺术图像修复的图像编辑与修复模型基准测试

Mridula Vijendran, Shuang Chen, Hubert P. H. Shum

机构 * Durham University(杜伦大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本研究构建MDTD-Art基准及MDTD-Art数据集,对比各类模型,发现图像编辑模型在艺术图像修复中优于专用修复架构,结构化提示可放大其性能优势。

Comments 15 pages, 6 figures, 6 tables. Preprint submitted to Elsevier Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00584 2026-08-04 cs.CV cs.AI cs.LG 新提交 79%

Element-Aware Group Learning for E-Commerce Image Generation

面向电商图像生成的元素感知组学习

Jingtong Chen, Jiahui Wang, Xue Zhao, ShaoGuo Liu, Minghao Li

专题命中 图像编辑 :image generation(title,abstract);分类 cs.CV

AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01113 2026-08-04 cs.CV 新提交 57%

CoT-Edit: Let CoT Guide Instruction Video Editing

CoT-Edit:让思维链(CoT)指导指令视频编辑

Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出CoT-Edit的plan--guide--edit框架,以CoT增强的MLLM为规划器生成空间先验,结合扩散编辑器实现高保真指令视频编辑,性能优于多个基准方法

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 77 篇

2608.01298 2026-08-04 cs.CV cs.AI cs.LG 新提交 83%

UDT: Reconciling U-Nets and Diffusion Transformers with Data-Adaptive Token Reduction

UDT:通过数据自适应令牌缩减协调U-Net与扩散Transformer

Junno Yun, Yaşar Utku Alçalar, Mehmet Akçakaya

机构 * University of Minnesota(明尼苏达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本研究提出UDT架构,通过数据自适应令牌合并协调U-Net与DiTs,在ImageNet图像生成任务中收敛速度更快、FID指标更优,为DiTs提供了新的高效骨干网络。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00444 2026-08-04 cs.CV 新提交 83%

Reconstruction-Shift Discrimination via Mask-Guided Latent Diffusion for Medical Anomaly Detection

基于掩码引导的潜在扩散的重构-偏移判别用于医学异常检测

Yibo Wan, Jinyu Cai, Yunhe Zhang, Yi Bin, See-kiong Ng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出判别式掩码引导扩散(DMD)框架,结合自监督分类的重构-偏移判别与残差定位,在五种医学影像数据集上实现了最优的无监督医学异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00024 2026-08-04 cs.CL cs.AI 新提交 82%

Exploring More to Solve More: Boosting Diversity in Text Diffusion Models via Entropy-Based Guidance

探索更多以解决更多问题:通过基于熵的引导提升文本扩散模型的多样性

Jingwei Zhang, Haoyu Lei, Zijin Feng, Jiacheng Sun, Farzan Farnia

专题命中 扩散模型 :diffusion(title,abstract);image synthesis(abstract)

AI总结 本研究提出无训练的SAKE引导方法,通过核Gram矩阵的二阶Rényi熵动态调整文本扩散模型的采样分布,实现更优的保真度与多样性平衡,提升了代码、数学等推理任务的多样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00730 2026-08-04 cs.RO 新提交 80%

Push-Wiper: Toward General-Purpose Robotic Cleaning across Varied Stains and Surfaces with Segmented Pushing Trajectories

Push-Wiper:基于分段推动轨迹的通用机器人清洁方案,用于处理不同污渍与表面

Renhao Lu, Mingxin Wang, Chenyang Cao, Yang Yang, Guoping Pan, Kangkang Dong, Yi Cheng, Houde Liu

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Z-Lab, Zerith Robotics(Zerith机器人公司Z-Lab实验室) University of Toronto(多伦多大学)

专题命中 扩散模型 :diffusion(summary_cn,abstract)

AI总结 Push-Wiper 框架将粘性污渍清洁转化为聚合问题,通过分段推动轨迹结合 Diffusion Policy 与 ASPI 控制器,清洁得分比基线高130%,可零样本泛化至多种污渍与表面。

Comments 8 pages, 8 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01845 2026-08-04 cs.LG cs.CV 新提交 79%

WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model

WorldDynCache:用于扩散世界模型的风险控制隐式动力学近似

Leyang Chen, Junyi Wu, Shaoqiu Zhang, Yulun Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出WorldDynCache框架,通过风险估计器和提升隐式代理解决扩散世界模型推理慢的问题,在两个数据集上实现加速并取得最优生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01821 2026-08-04 cs.CV cs.LG 新提交 79%

DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models

DAVET:面向扩散视觉-语言模型的降噪感知视觉证据轨迹分配

Yongkang Zhou, Xiang Xia, Cheng Yan, Fan Xu, Wuyang Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DAVET 是一种无需训练的框架,通过根据扩散视觉-语言模型的生成状态自适应分配视觉证据,实现平均 1.55 倍加速且仅 1.86% 的平均性能下降,降低了视觉条件成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01276 2026-08-04 cs.CV 新提交 79%

Astrolabe: Spherical-Map Guidance Across Diffusion Pipelines for Full-Body Capture from Unconstrained Images

Astrolabe:跨扩散管道的球面图引导,用于从非约束图像中捕获全身信息

Shuliang Zhu, Qi Wang, Ryugo Morita, Jinjia Zhou

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Astrolabe适配器,通过球面图转换为噪声偏移引导扩散管道,在Puzzle-IOI和4D-Dress数据集上提升全身捕获的图像与几何指标,后视图图像增益显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00588 2026-08-04 cs.CV 新提交 79%

InstancePin: Instance-Addressable Layout-to-Image Diffusion via Coordinate Pinning

InstancePin:通过坐标锚定实现实例可寻址的布局到图像扩散模型

Chaoyue Wu, Yunfei Zhang, Si Wu

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出InstancePin框架,通过坐标锚定与实例感知适配器等技术,解决布局到图像扩散模型的实例纠缠问题,在Cityscapes数据集上提升了图像保真度与语义一致性。

Comments Accepted to PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00543 2026-08-04 cs.CR cs.AI cs.CV 新提交 79%

Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor

鲁棒水印与中毒模型相遇:通过隐秘后门规避扩散语义水印

Jinyuan Liu, Tianshuo Cong, Pei Li, Tianrui Wang, Xinlei He, Anyu Wang, Xiaoyun Wang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究提出GhostVAE方法,通过在VAE编码器植入隐秘后门,可在良性图像上保持94.4%的平均水印真阳性率,同时实现94.6%的平均水印规避成功率,突破了现有语义水印的安全性。

Comments To appear in USENIX Security 2026, August 12-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00486 2026-08-04 cs.CV 新提交 79%

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

DreamTraj:通过读取未渲染视频扩散隐变量生成6自由度物体轨迹

Tongsheng Ding, Zhen Luo, Yixuan Yang, Boyu Wang, Luyang Xie, Jinyu Yang, Feng Zheng

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamTraj利用含细粒度指令的MOVE数据集,从单张RGB图像和任务指令读取冻结视频扩散模型中间表示,直接解码6自由度物体轨迹,性能优于传统方法且速度提升4.6倍。

Comments 17 pages, 8 figures, 11 tables. Project page: https://whathappen0.github.io/DreamTraj/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01029 2026-08-04 cs.RO 新提交 79%

Diffusion-Based Body Schema Learning Enabling Abnormal-State Adaptation in Musculoskeletal Robots

基于扩散模型的身体模式学习:实现肌肉骨骼机器人的异常状态适应

Kento Kawaharazuka, Shuhei Ikemoto

机构 * The University of Tokyo(东京大学) Kyushu Institute of Technology(九州工业大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究针对肌肉骨骼机器人传统身体模式学习方法难以处理异常状态的问题,提出基于扩散模型的身体模式学习框架,通过仿真实验验证了其异常状态下自适应估计肌肉参数的有效性。

Comments Accepted to IEEE Robotics and Automation Letters (RA-L), website - https://haraduka.github.io/muscle-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01972 2026-08-04 eess.AS cs.AI 新提交 78%

Music Restoration via Latent Operator Optimization and Diffusion Model Priors

基于潜在算子优化与扩散模型先验的音乐修复

Michal Švento, Eloi Moliner, Valtteri Kallinen, Lauri Juvela, Vesa Välimäki, Pavel Rajmic

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出LOUDAR方法,将未知失真建模为可学习潜在算子,结合预训练音频自编码器与潜在扩散模型先验,在歌声、吉他失真修复任务上表现优于退化输入且具竞争力。

Comments Accepted to the the 27th International Society for Music Information Retrieval Conference (ISMIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02602 2026-08-04 cs.CL 新提交 78%

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

AURORA-LM:用于连续潜在扩散语言建模的统一表示自动编码

Jiajun Liang, Yucheng Liao, Yukang Cao, Jiazhe Wei, Ken Li, Wende Tan, Jiankun Zhang, ZY Cui, Jingkang Yang, Liucheng Guo, Shiqi Yang, B. Yang, Caifeng Shan, Ziwei Liu, Chenyang Si

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 AURORA-LM是一种分离文本表示构建与分布建模的连续潜在扩散语言模型,通过特定技术优化后,在OpenWebText自由生成和XSum摘要任务中性能优于同类模型。

Comments 40 pages, 17tables, project page: https://aurora-lm-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02502 2026-08-04 cs.AI 新提交 78%

CMuon: Accelerating and Stabilizing Diffusion Transformer Training via Chunked Momentum Orthogonalization

CMuon:通过分块动量正交化加速并稳定扩散Transformer的训练

Chuyan Chen, Peng Sun, Kun Yuan

机构 * Peking University(北京大学) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散Transformer训练计算成本高、普通Muon优化器存在后期收敛问题的瓶颈,提出CMuon策略,通过分块权重实现训练加速与收敛优化,在ImageNet 256上200个epoch达FID1.18,训练速度超AdamW2倍

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02438 2026-08-04 cs.AI 新提交 78%

xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

xPress:推测解码中扩散草稿模型的并行优化

Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(国际商业机器公司(IBM))

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 xPress是恢复扩散草稿模型因果依赖的并行优化方法,在Qwen3-8B的7个基准上,可提升推测解码的接受长度与端到端吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02332 2026-08-04 cs.LG cs.AI cs.SY eess.SY 新提交 78%

Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning

面向离线强化学习的带行为优势修正的扩散策略

Botao Dong, Longyang Huang, Ning Pang, Hongtian Chen

机构 * School of Chemistry, Chemical Engineering and Biotechnology, Nanyang Technological University(南洋理工大学化学、化学工程与生物技术学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对离线强化学习中分布偏移导致的Q值估计偏差问题,提出带行为优势修正的扩散策略(DPBAC)算法,结合BAC-PE与扩散模型,在D4RL任务上实现优于SOTA的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01784 2026-08-04 cs.AI cs.CL 新提交 78%

REFLEX: Rethinking MoE Inference as Refinement-Aware Compute Allocation in Diffusion Language Models

REFLEX:将MoE推理重新思考为扩散语言模型中的感知细化的计算分配

Xiang Xia, Cheng Yan, Yiming Zhang, Jiazheng Liu, Hongyu Zhang, Wuyang Zhang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 REFLEX是一种无需训练的MoE推理方法,通过粗到细的专家预算分配和前沿进度分数,在扩散语言模型中平均减少15%专家计算量,同时保持或提升生成质量,实现更优的质量-计算权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01740 2026-08-04 cs.LG cs.AI 新提交 78%

Disagree to Accelerate: Closing the Loop on Diffusion Feature Forecasts

弃权以加速:闭合扩散特征预测的循环

Yanchao Li, Jiaqing Xie, Ben Gao, Wanhao Liu, Yanbo Wang, T. Y. Tsui, Jinfei Liu, Yuqiang Li, Tianfan Fu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出无需训练的闭环控制器RACER,利用预测分歧信号调整对扩散特征预测的信任度,在多模型多数据集上实现了相同评估次数下的性能提升或同等质量下的更快采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01717 2026-08-04 cs.LG 新提交 78%

Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models

超越在线策略探索:将外部策略 rollout 整合用于扩散语言模型中的强化学习

Wonseok Lee, Jimyeong Kim, Jungmin Ko, Wonjong Rhee

机构 * Seoul National University(首尔大学) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能交叉项目) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究院) Department of Intelligence and Information, Seoul National University(首尔大学智能与信息系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对扩散大语言模型强化学习中在线策略 rollout 稀缺的问题,提出 ERILS 方法整合外部策略 rollout,在数独等任务上显著提升性能,验证了 rollout 构建与奖励处理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01093 2026-08-04 cs.SD 新提交 78%

Separate-and-Detect: Unified Drum Transcription and Stem Generation via Latent Diffusion

分离与检测:通过潜在扩散实现统一鼓转录与音轨生成

Wei-Han Hsu, Chih-Cheng Chang, Bo-Yu Chen, Li Su, Yi-Hsuan Yang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出分离与检测框架,以5音轨潜在扩散模型为前端,结合起始点分支等辅助训练,实现鼓转录与音轨生成,性能优于基线,兼具分离音轨能力。

Comments 8 pages, 3 figures, 4 tables. Accepted at the 27th International Society for Music Information Retrieval Conference (ISMIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏