arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-28 至 2026-05-28 共收录 114 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2605.27155 2026-05-28 cs.CV cs.AI 83%

Semantic Robustness Probing via Inpainting: An Interactive Tool for Safety-Critical Object Detection

通过修复进行语义鲁棒性探测:面向安全关键目标检测的交互工具

Nico Steckhan, Krutarth Prajapati, Weija Shao, Silvia Vock

机构 * Federal Institute for Occupational Safety and Health (BAuA)(联邦职业安全与健康研究所) Fraunhofer Institute for Manufacturing Engineering and Automation IPA(弗劳恩霍夫研究所(制造工程与自动化IPA))

专题命中 可控生成 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出SemProbe工具,通过扩散模型可控修复生成语义探针,支持用户自定义掩码和因素,自动评估并记录目标检测模型的鲁棒性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28491 2026-05-28 cs.CV 79%

DiscoForcing: A Unified Framework for Real-Time Audio-Driven Character Control with Diffusion Forcing

DiscoForcing:基于扩散强制的实时音频驱动角色控制统一框架

Kaiyang Ji, Bingsheng Qian, Binghuan Wu, Kangyi Chen, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 针对实时音频响应角色控制问题,提出DiscoForcing框架,结合因果音乐编码器和扩散强制序列模型,在严格因果、有限延迟的流式生成中实现音频与全身运动的稳定对齐。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28733 2026-05-28 cs.AI 71%

Utility-Aware Multimodal Contrastive Learning for Product Image Generation

效用感知的多模态对比学习用于产品图像生成

Xiaohang Feng, Yiling Xie

机构 * City University of Hong Kong(香港城市大学)

专题命中 可控生成 :image generation(title)

AI总结 提出一种效用感知的多模态对比学习框架,通过引入效用感知InfoNCE损失优化产品图像生成,使图像在语义对齐的同时提升市场需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08555 2026-05-28 cs.CV 70%

VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning

VideoCanvas: 通过上下文条件化从任意时空补丁进行统一视频补全

Minghong Cai, Qiulin Wang, Zongli Ye, Wenze Liu, Quande Liu, Weicai Ye, Xintao Wang, Pengfei Wan, Kun Gai, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手技术有限公司Kling团队)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 提出VideoCanvas框架,通过混合条件化策略(空间上使用零填充全帧画布编码,时间上使用Temporal RoPE插值)实现任意时空视频补全的统一任务,无需修改或重新训练VAE。

Comments Project page: https://onevfall.github.io/project_page/videocanvas

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28816 2026-05-28 cs.CV 57%

Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players

Gamma-World: 超越双玩家的生成式多智能体世界建模

Fangfu Liu, Kai He, Tianchang Shen, Tianshi Cao, Sanja Fidler, Yueqi Duan, Jun Gao, Igor Gilitschenski, Zian Wang, Xuanchi Ren

机构 * NVIDIA Tsinghua University(清华大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出一种生成式多智能体世界模型,通过Simplex Rotary Agent Encoding实现智能体置换等价性,并采用Sparse Hub Attention降低跨智能体注意力成本,支持多玩家交互视频生成。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/gamma-world

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27348 2026-05-28 cs.CV cs.AI 57%

When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection

当眼睛背叛AI:社交注视一致性作为AI生成图像检测的语义线索

Jihyeon Kim, Sohee Kim, Soosan Lee, Souhwan Jung, James Matthew Rehg, Hyesong Choi

机构 * School of Computer Engineering(计算机工程学院) Hoseo University(Hoseo大学) School of Electronic Engineering(电子工程学院) Soongsil University(Soongsil大学) School of Computer Science(计算机科学学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出社交注视一致性作为高层语义线索,通过构建诊断数据集、块组合描述监督和跨架构验证,证明该线索能有效检测AI生成图像,并解释其跨生成器迁移的机制。

Comments 23 pages, 2 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23192 2026-05-28 cs.CV 57%

Occlusion-Aware Physics-Semantic Keyframe Selection for Robust Video Editing

遮挡感知的物理-语义关键帧选择用于鲁棒视频编辑

Lin Liu, Zhihan Xiao, Haohang Xu, Rong Cong, Zhibo Zhang, Xiaopeng Zhang, Qi Tian

机构 * Huawei(华为) Tsinghua University(清华大学) East China Normal University(华东师范大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出一种遮挡感知的物理-语义关键帧选择框架,通过从结构完整性、跟踪稳定性和属性可见性三个角度评估候选帧,自动选择最优锚定帧,并利用双向跟踪生成时空掩码,实现鲁棒且时序一致的视频编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06928 2026-05-28 cs.CV 57%

IAR2: Improving Autoregressive Visual Generation with Semantic-Detail Associated Token Prediction

IAR2:通过语义-细节关联令牌预测改进自回归视觉生成

Ran Yi, Teng Hu, Zihan Su, Jiangning Zhang, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出IAR2框架,通过语义-细节关联双码本和分层预测机制,实现从粗到细的图像生成,在ImageNet上取得FID 1.50的领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27840 2026-05-28 eess.AS cs.AI cs.SD 50%

LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation

LoSATok: 用于跨域音频理解与生成的低维语义-声学分词器

Zhisheng Zhang, Xiang Li, Yixuan Zhou, Jing Peng, Guoyang Zeng, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院,中国) ModelBest Inc., China(ModelBest公司,中国)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出低维音频分词器LoSATok,通过语义瓶颈压缩和双级语义监督,在紧凑潜空间中联合捕获语义和声学细节,提升扩散Transformer的生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27545 2026-05-28 cs.CL 50%

PAST2HARM: A Simple Adaptive Past Tense Attack for Jailbreaking Multimodal AI

PAST2HARM:一种用于越狱多模态AI的简单自适应过去时攻击

Snehasis Mukhopadhyay

机构 * Indian Institute of Information Technology, Kalyani(印度信息技术学院,卡利安)

专题命中 可控生成 :image generation(abstract)

AI总结 提出PAST2HARM框架,通过过去时态改写和迭代升级策略,系统性地利用多模态文本到图像模型的安全漏洞,实现黑盒、无梯度的高成功率越狱攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 4 篇

2605.28324 2026-05-28 cs.CV 88%

Inpainting-Style Conditional Diffusion for Multivariable Time Series Forecasting

基于修复风格条件扩散的多变量时间序列预测

Kourosh Kiani, S. M. Muyeen

机构 * Electrical and Computer Engineering, Semnan University(半导体与计算机工程系,森南大学) Electrical Engineering Department, Qatar University(电气工程系,卡塔尔大学)

专题命中 图像修复 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 提出一种将多变量时间序列预测重构为图像修复问题的条件扩散框架,通过掩码条件扩散机制和零填充策略实现高精度短期太阳能功率预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18271 2026-05-28 cs.CV 79%

ObjFiller3D: Scaling 3D Object Inpainting to Dense Multi-View Consistency

ObjFiller3D:将3D物体修复扩展到密集多视图一致性

Haitang Feng, Xinkai Chen, Jie Liu, Jie Tang, Gangshan Wu, Beiqi Chen, Jianhuang Lai, Guangcong Wang

机构 * Nanjing University(南京大学) Great Bay University(大湾大学) Harbin Institute of Technology(哈尔滨工业大学) Sun Yat-sen University(中山大学)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 提出ObjFiller-3D方法,通过联合优化密集采样视图的时序生成、语义感知补全和循环一致性3D编码,实现高质量且一致的多视图3D物体修复与编辑。

Comments Project page: https://objfiller3d.github.io/ Code: https://github.com/objfiller3d/ObjFiller-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10334 2026-05-28 cs.CV cs.LG 57%

An analytic theory of convolutional neural network inverse problems solvers

卷积神经网络逆问题求解器的解析理论

Minh Hai Nguyen, Quoc Bao Do, Edouard Pauwels, Pierre Weiss

机构 * IRIT \& CBI, CNRS \& Université Toulouse, France Toulouse School of Economics, Université Toulouse Capitole, France

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 通过最小均方误差估计器引入平移等变性和有限感受野的归纳偏置,推导出局部等变MMSE的解析公式,并在多种逆问题、数据集和架构上验证其与神经网络输出高度一致。

Journal ref Forty-Third International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09449 2026-05-28 cs.CV 57%

RASR: Retrieval-Augmented Super Resolution for Practical Reference-based Image Restoration

RASR: 面向实际参考图像复原的检索增强超分辨率

Jiaqi Yan, Shuning Xu, Xiangyu Chen, Dell Zhang, Jiantao Zhou, Jie Tang, Gangshan Wu, Jie Liu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) State Key Laboratory of Internet of Things for Smart City(物联网智慧城市国家重点实验室) Department of Computer Science and Information Science, University of Macau(澳门大学计算机科学与信息科学系)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出检索增强超分辨率(RASR)范式,通过自动检索参考图像实现实际场景下的参考超分辨率,并构建基准数据集RASR-Flickr30及基线模型RASRNet。

Comments Accepted at ISCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2605.25378 2026-05-28 cs.CV cs.AI 70%

CollectionLoRA: Collecting 50 Effects in 1 LoRA via Multi-Teacher On-Policy Distillation

CollectionLoRA: 通过多教师在线策略蒸馏将50种效果收集到1个LoRA中

Fangtai Wu, Hailong Guo, Shijie Huang, Jiayi Song, Yubo Huang, Mushui Liu, Zhao Wang, Yunlong Yu, Jiaming Liu, Ruihua Huang

机构 * Zhejiang University(浙江大学) Qwen Applications Business Group of Alibaba(阿里巴巴Qwen应用业务组) Xi'an Jiaotong University(西安交通大学)

专题命中 个性化与一致性 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 提出CollectionLoRA框架,通过多教师在线策略蒸馏将多达50种不同效果LoRA和少步生成能力整合到单个LoRA中,解决参数干扰并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2605.27374 2026-05-28 cs.CL 82%

ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment

ICG: 通过基于MLLM的提示和个性化偏好对齐改进封面图像生成

Zhipeng Bian, Jieming Zhu, Qijiong Liu, Wang Lin, Guohao Cai, Zhaocheng Du, Jiacheng Sun, Zhou Zhao, Zhenhua Dong

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 图像生成评测 :image generation(title,abstract);diffusion(abstract)

AI总结 提出ICG框架,利用多模态大语言模型和扩散模型,通过元标记提取语义特征、用户嵌入个性化对齐及多奖励学习策略,实现高质量、个性化封面图像生成。

Comments Published in Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 12268-12278, EMNLP 2025. Official version: https://doi.org/10.18653/v1/2025.emnlp-main.617

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (Main Track) EMNLP 2025 12268-12278

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04876 2026-05-28 cs.SD 50%

ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models

ChronosAudio: 用于评估音频大语言模型的综合长音频基准

Kaiwen Luo, Liang Lin, Yibo Zhang, Moayad Aloqaily, Jialiang Tao, Dexian Wang, Zhenhong Zhou, Junwei Zhang, Kun Wang, Li Sun, Qingsong Wen

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) United Arab Emirates University(阿联酋大学) North China Electric Power University(华北电力大学) Southwest Jiaotong University(西南交通大学) Squirrel AI Learning(Squirrel AI学习)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出首个针对音频大语言模型长音频理解的多任务基准ChronosAudio,包含6大任务类别和36000个测试实例,实验发现模型存在长上下文崩溃、注意力稀释等问题,现有缓解策略仅恢复50%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 7 篇

2605.26552 2026-05-28 cs.LG cs.AI 67%

Aligning Few-Step Generative Models by Amortizing Sample-based Variational Inference

通过摊销基于样本的变分推断来对齐少步生成模型

Jaewoo Lee, Hyeongyu Kang, Dohyun Kim, Kyuil Sim, Woocheol Shin, Minsu Kim, Taeyoung Yun, Jeongjae Lee, Sanghyeok Choi, Tabitha Edith Lee, Jong Chul Ye, Jinkyoo Park

机构 * KAIST(韩国科学技术院) MongooseAI Mila – Quebec AI Institute(魁北克AI研究院) University of Edinburgh(爱丁堡大学) Université de Montréal(蒙特利尔大学) Omelet

专题命中 效率与蒸馏 :text-to-image(abstract);image synthesis(abstract)

AI总结 提出FAV框架,利用Stein变分梯度下降进行基于样本的变分推断,并通过固定点回归将粒子更新摊销到生成器参数中,实现对少步生成模型的对齐,在机器人操作和图像生成任务中优于现有方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28691 2026-05-28 cs.CV 57%

OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement Learning

OSP-Next: 结合稀疏序列并行、HiF8量化和强化学习的高效高质量视频生成

Yunyang Ge, Xianyi He, Zezhong Zhang, Bin Lin, Bin Zhu, Xinhua Cheng, Li Yuan

机构 * Peking University(北京大学) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出OSP-Next文本到视频生成模型,通过混合全稀疏注意力架构、稀疏序列并行(SSP)、HiF8量化和混合GRPO后训练,在保持高质量的同时显著提升效率,在NVIDIA H200和Ascend 950PR上实现1.5倍以上加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11755 2026-05-28 cs.LG cs.CV stat.ML 57%

One-Step Generative Modeling via Wasserstein Gradient Flows

通过Wasserstein梯度流的一步生成建模

Jiaqi Han, Puheng Li, Qiushan Guo, Renyuan Xu, Stefano Ermon, Emmanuel J. Candès

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 提出W-Flow框架,通过Wasserstein梯度流将参考分布到目标分布的演化压缩为一步生成,结合Sinkhorn散度实现高效最优传输,在ImageNet 256×256上达到1.29 FID且采样速度提升约100倍。

Comments 40 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16483 2026-05-28 cs.CV 57%

FasterVAR: Plug-and-Play Acceleration for Visual Autoregressive Models

FasterVAR:视觉自回归模型的即插即用加速

Senmao Li, Kai Wang, Salman Khan, Fahad Shahbaz Khan, Jian Yang, Yaxing Wang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院、VCIP、PCA实验室) Program of Computer Science, City University of Hong Kong (Dongguan), China(香港城市大学(东莞)计算机系,中国) City University of Hong Kong, HK SAR, China(香港城市大学,香港特别行政区,中国) Mohamed bin Zayed University of Artificial Intelligence, UAE(阿联酋Mohamed bin Zayed人工智能大学) Linkoping University, Sweden(林地平大学,瑞典) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院、PCA实验室) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 针对VAR模型在大尺度步骤计算复杂度高的问题,提出一种基于阶段感知的即插即用加速框架FasterVAR,通过保留早期关键步骤并剪枝或近似后期细节步骤,实现最高3.4倍加速且几乎无性能损失。

Comments Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28086 2026-05-28 cs.SI cs.DB 50%

Efficient Shapley-Based Influence Attribution in Social Networks

基于Shapley值的社交网络高效影响力归因

Fangzhu Shen, Amir Gilad, Sudeepa Roy

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 针对社交网络中种子节点的事前影响力公平估计问题,提出基于Shapley值的归因框架,设计多项式时间算法(单步激活)和近似算法(IC模型及时间约束变体),并证明多步传播的#P-难性。

Comments 28 pages. Accepted at SIGKDD 2026. Full version with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05673 2026-05-28 cs.RO cs.AI 50%

Rectified Schrödinger Bridge Matching for Few-Step Visual Navigation

整流薛定谔桥匹配用于少步视觉导航

Wuyang Luan, Junhui Li, Weiguang Zhao, Wenjian Zhang, Tieru Wu, Rui Ma

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science, Chongqing University(重庆大学计算机学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Changchun GenY Technology Co., Ltd.(长春GenY科技有限公司)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出整流薛定谔桥匹配(RSBM)框架,利用速度场结构不变性和线性方差减少,在仅3步积分中实现高保真生成策略,满足具身AI低延迟需求。

Comments 18 pages, 7 figures, 10 tables. Code available at https://github.com/WuyangLuan/RSBM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19079 2026-05-28 math.NA cs.NA physics.flu-dyn 50%

Efficient cell-centered nodal integral method for multi-dimensional Burgers equations

多维Burgers方程的高效单元中心节点积分法

Nadeem Ahmed, Ram Prakash Bharti, Suneet Singh

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出一种基于单元中心变量的节点积分法(CCNIM),通过两种方式近似非线性对流项,将其推广至非线性Burgers方程,实现了时空二阶精度,且比传统NIM更简洁灵活。

Comments 60 pages, 21 figures, 10 tables

Journal ref Engineering with Computers (2025) Volume 41, pages 3611 - 3649

详情

展开后加载摘要…

URL PDF HTML 收藏