arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-12 至 2026-05-12 共收录 206 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 13 篇

2605.08906 2026-05-12 physics.flu-dyn 50%

Viscoelastic control of acoustic particle migration and trapping in microchannels

粘弹性控制微通道中声学粒子迁移与捕获

T. Sujith, A. K. Sen

专题命中 可控生成 :diffusion(abstract)

AI总结 研究粘弹性流体中声学辐射力与流体诱导拖曳的竞争作用,揭示粘弹性对粒子动态的调控机制,提出通过德布罗意数和粘性扩散数控制粒子迁移与捕获的新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 2 篇

2605.08640 2026-05-12 cs.CV 70%

FlowADMM: Plug-and-play ADMM with Flow-based Renoise-Denoise Priors

FlowADMM:基于流的重噪-去噪先验的即插即用ADMM

Hendrik Sommerhoff, Michael Moeller

机构 * Computer Vision Group, University of Siegen(Siegen大学计算机视觉组)

专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出FlowADMM算法,通过将重噪-去噪操作整合到经典ADMM框架中,解决了基于流的即插即用方法的收敛性问题,并在逆问题中取得了最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08168 2026-05-12 cs.RO cs.AI cs.LG 50%

Understanding Asynchronous Inference Methods for Vision-Language-Action Models

理解面向视觉-语言-动作模型的异步推理方法

Ayoub Agouzoul

机构 * École polytechnique Systems Group, ETH Zürich(瑞士联邦理工学院系统组,苏黎世联邦理工学院)

专题命中 图像修复 :inpainting(abstract)

AI总结 本文系统比较了四种异步推理方法,评估了其在不同延迟下的性能,发现A2C2在Kinetix上表现最佳,TT-RTC在LIBERO上最稳健,IT-RTC在低延迟下表现良好但高延迟下下降,VLASH在低延迟与高延迟之间存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 5 篇

2605.09460 2026-05-12 cs.CV cs.AI 77%

When Few Steps Are Enough: Training-Free Acceleration of Identity-Preserved Generation

几步即可:无需训练的身份保持生成加速

Dongqi Zheng

机构 * FLUX Diffusion Transformer(FLUX扩散变换器) InfuseNet

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);personalized generation(abstract);分类 cs.CV

AI总结 本文提出无需训练的轻量化策略,通过替换扩散模型骨干网络和禁用分类器自由引导,显著提升身份保持生成的效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02948 2026-05-12 cs.LG cs.AI cs.SD 50%

AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation

AsymTalker:通过不对称蒸馏实现身份一致的长期说话头生成

Yuxin Lu, Jiayang Sun, Guibo Zhu, Min Cao

机构 * Soochow University(苏州大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出AsymTalker,通过时空对齐和不对称蒸馏解决长期说话头生成中的身份漂移问题,实现高保真身份一致的600秒视频生成,达到66 FPS的实时推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09096 2026-05-12 cs.LG 50%

Bridging Spectral Operator Learning and U-Net Hierarchies: SpectraNet for Stable Autoregressive PDE Surrogates

弥合谱算子学习与U-Net层次结构:SpectraNet用于稳定的自回归PDE替代模型

Enrique Hernández Noguera, Md Meftahul Ferdaus, Elias Ioup, Mahdi Abdelguerfi, Julian Simeonov

机构 * University of New Orleans(新奥尔良大学) Naval Research Laboratory(海军研究实验室)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 SpectraNet通过在U-Net层次结构中嵌入截断谱卷积,并利用Semigroup-Consistency Loss训练残差目标谱块,实现了稳定的自回归PDE替代模型,其参数量与网格无关,且在多个PDE测试中表现优于FNO。

Comments 29 pages, 9 figures. Code: https://github.com/Enrikkk/spectranet

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08638 2026-05-12 cs.RO cs.AI 50%

Geometry Guided Self-Consistency for Physical AI

基于几何的自一致性物理AI

Yinwei Dai, Zhuofu Chen, Lijie Yang, Ravi Netravali

机构 * Princeton University(普林斯顿大学)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出KeyStone方法,通过并行生成动作片段并聚类,返回最大簇的质心,提升任务成功率13.3%且无额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08454 2026-05-12 cs.LG cs.AI 50%

Recovering Physical Dynamics from Discrete Observations via Intrinsic Differential Consistency

通过内在微分一致性从离散观测中恢复物理动力学

Yuxiang Luo, Andrew Perrault

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Ohio State University(俄亥俄州立大学)

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文提出通过全局结构约束替代局部监督,训练时间条件化的secant速度场,以提升从离散观测中恢复连续时间动力学的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 5 篇

2605.10204 2026-05-12 cs.CV 57%

3DReflecNet: A Large-Scale Dataset for 3D Reconstruction of Reflective, Transparent, and Low-Texture Objects

3DReflecNet:一个大规模数据集,用于反射、透明和低纹理物体的3D重建

Zhicheng Liang, Haoyi Yu, Boyan Li, Dayou Zhang, Zijian Cao, Tianyi Gong, Junhua Liu, Shuguang Cui, Fangxin Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Capital Normal University(首都师范大学) University of Southern California(南加州大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出3DReflecNet数据集,包含超过700万张多视角图像,用于评估和推动针对反射、透明和低纹理物体的3D视觉方法,揭示现有方法在复杂材料下的局限性。

Comments This paper has been accepted by CVPR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09670 2026-05-12 cs.RO cs.CV 57%

Towards Generative Predictive Display for Vision-Based Teleoperation: A Zero-Shot Benchmark of Off-the-Shelf Video Models

面向基于视觉的遥控的生成预测显示:一种零样本基准测试的现成视频模型

Aws Khalil, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan - Dearborn(密歇根大学迪尔伯恩分校电气与计算机工程系)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种零样本基准测试,评估现成生成视频模型在短时间预测显示中的性能,发现现有模型无法在低误差、非发散误差行为和实时推断间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19748 2026-05-12 cs.CV 57%

Tstars-Tryon 1.0: Robust and Realistic Virtual Try-On for Diverse Fashion Items

Tstars-Tryon 1.0:鲁棒且逼真的虚拟试衣系统用于多样化服装物品

Mengting Chen, Zhengrui Chen, Yongchao Du, Zuan Gao, Taihang Hu, Jinsong Lan, Chao Lin, Yefeng Shen, Xingjian Wang, Zhao Wang, Zhengtao Wu, Xiaoli Xu, Zhengze Xu, Hao Yan, Mingzhou Zhang, Jun Zheng, Qinye Zhou, Xiaoyong Zhu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Taobao App(淘宝App)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出Tstars-Tryon 1.0,一种高效且逼真的虚拟试衣系统,能够处理复杂场景,支持多件衣物试穿,并在大规模部署中实现高效率和高质量输出。

Comments 24 pages, model evaluation report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00166 2026-05-12 cs.CV cs.AI 57%

Exploring the AI Obedience: Why is Generating a Pure Color Image Harder than CyberPunk?

探索AI服从性:为何生成纯色图像比CyberPunk更困难

Hongyu Li, Kuan Liu, Yuan Chen, Juntao Hu, Huimin Lu, Guanjie Chen, Xue Liu, Guangming Lu, Hong Huang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(城市大学) Chinese University of Hong Kong(香港中文大学) McGill University(麦吉尔大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 研究探讨生成纯色图像的困难源于模型在复杂场景生成中的系统性失败,提出AI服从性框架和Violin基准测试,揭示闭源模型在确定性精度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10076 2026-05-12 eess.IV cs.LG 50%

A Stability Benchmark of Generative Regularizers for Inverse Problems

生成正则化器在反问题中的稳定性基准

Alexander Denker, Johannes Hertrich, Sebastian Neumayer

机构 * Helmholtz Imaging, Deutsches Elektronen-Synchrotron DESY, Germany(德意志电子同步辐射研究中心(Helmholtz Imaging)) ENS Paris & Inria, France(巴黎高等师范学院与法国国家信息与自动化研究所) Chemnitz University of Technology, Germany(化学工业大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文评估生成正则化器在反问题中的稳定性,对比优化方法,探讨其在不同场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 13 篇

2601.22158 2026-05-12 cs.CV 83%

One-step Latent-free Image Generation with Pixel Mean Flows

无需潜在变量的一步图像生成:像素均值流

Yiyang Lu, Susie Lu, Qiao Sun, Hanhong Zhao, Zhicheng Jiang, Xianbang Wang, Tianhong Li, Zhengyang Geng, Kaiming He

机构 * MIT(麻省理工学院)

专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出像素均值流(pMF),通过分离网络输出空间与损失空间,实现无需潜在变量的一步图像生成,在ImageNet上取得优异结果。

Comments Tech report. Code at https://github.com/Lyy-iiis/pMF

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10518 2026-05-12 cs.CL cs.AI 78%

Infinite Mask Diffusion for Few-Step Distillation

无限掩码扩散用于少步蒸馏

Jaehoon Yoo, Wonjung Kim, Chanhyuk Lee, Seunghoon Hong

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出无限掩码扩散模型,通过引入随机无限状态掩码降低因子化误差下限,解决了传统掩码扩散模型在少步生成中的性能问题,并在LM1B和OpenWebText上超越现有少步蒸馏方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09536 2026-05-12 cs.CL cs.AI 78%

TAD: Temporal-Aware Trajectory Self-Distillation for Fast and Accurate Diffusion LLM

TAD: 时空感知轨迹自蒸馏用于快速准确的扩散大语言模型

Haoyang Zhou, Li Kong, Shijie Ren, Xiting Wang, Shuang Liang, Guowei Wang, Zhenxuan Pan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Ant Group(蚂蚁集团)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 TAD通过时空感知轨迹自蒸馏方法,在提升生成速度的同时保持准确性,实验表明在LLaDA上质量模型将平均准确率提升至51.6%,速度模型将AUP提升至257.1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09328 2026-05-12 cs.CV 70%

Noise-Started One-Step Real-World Super-Resolution via LR-Conditioned SplitMeanFlow and GAN Refinement

基于LR条件SplitMeanFlow和GAN精炼的噪声启动一步真实世界超分辨率

Wei Zhu, Kai Zhang, Yu Zheng, Lei Luo, Yong Guo, Jian Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) Huawei(华为)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出SMFSR框架,通过LR条件SplitMeanFlow和GAN精炼实现噪声启动的一步真实世界超分辨率,保留扩散模型的随机噪声起点并提升生成效率与真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08174 2026-05-12 cs.LG cs.AI cs.CV 70%

CERSA: Cumulative Energy-Retaining Subspace Adaptation for Memory-Efficient Fine-Tuning

CERSA:累积能量保留子空间适应用于内存高效的微调

Jingze Ge, Xue Geng, Yun Liu, Wanqi Dong, Wang Zhe Mark, Min Wu, Ngai-Man Cheung, Bharadwaj Veeravalli, Xulei Yang

机构 * National University of Singapore(新加坡国立大学) Nankai University(南开大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 CERSA通过奇异值分解保留主成分以降低内存消耗,优于现有PEFT方法,适用于多种领域模型。

Comments 10 pages, 7 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09442 2026-05-12 cs.CV cs.AI 57%

SWIFT: Prompt-Adaptive Memory for Efficient Interactive Long Video Generation

SWIFT: 用于高效交互长视频生成的提示自适应内存

Shanwen Tan, Hao Li, Jingtao Zhang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 SWIFT提出一种无需训练的多提示长视频生成框架,通过轻量级语义注入缓存和自适应动态窗口实现高效语义切换,保持时间一致性,达到22.6 FPS的高效生成速度。

Comments Code is available at https://github.com/ShanwenTan/SWIFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09302 2026-05-12 cs.LG cs.CV 57%

Discrete Langevin-Inspired Posterior Sampling

离散 Langevin 激发后验采样

Chaitanya Amballa, Sattwik Basu, Jorge Vančo Sampedro, Romit Roy Choudhury

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出离散 Langevin 激发后验采样方法,用于在离散状态空间中解决逆问题,通过梯度信息指导离散移动,实现高效的并行更新,适用于多种逆问题场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09071 2026-05-12 cs.CV 57%

Probability-Flow Distillation: Exact Wasserstein Gradient Flow for High-Fidelity 3D Generation

概率流蒸馏:用于高保真3D生成的精确Wasserstein梯度流

Rohith Ramanan, A. N. Rajagopalan

机构 * Department of Physics(物理系) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Department of Electrical Engineering(电气工程系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出概率流蒸馏,通过精确Wasserstein梯度流解决SDI的模式崩溃问题,实现高保真3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07384 2026-05-12 cs.LG 50%

StreamPhy: Streaming Inference of High-Dimensional Physical Dynamics via State Space Models

StreamPhy: 通过状态空间模型实现高维物理动态的流式推断

Panqi Chen, Yifan Sun, Shikai Fang, Xiao Fu, Lei Cheng

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of EECS,Oregon State University(俄勒冈州立大学电子工程与计算机科学学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出StreamPhy框架,通过自适应观测编码器、结构化状态空间模型和FT-FiLM解码器,实现高效准确的流式推断,实验显示其在复杂动态处理上优于现有方法,精度提升48%以上,速度提升20-100倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09148 2026-05-12 cond-mat.stat-mech 50%

Sensitivity Analysis in the Face of Rare Events

稀有事件面前的灵敏度分析

John Strahan, Todd R. Gingrich

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出结合重要抽样与马尔可夫状态模型的计算流程,用于处理稀有事件中动态可观测量及其灵敏度的估计问题,通过迭代重加权减少误差,验证了在穆勒-布朗势扩散中的过渡率灵敏度计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08975 2026-05-12 cs.AI 50%

Latency Analysis and Optimization of Alpamayo 1 via Efficient Trajectory Generation

通过高效轨迹生成分析和优化Alpamayo 1的延迟

Yunseong Jeon, Namcheol Lee, Yoonsu Lee, Jangwoon Park, Sol Ahn, Jong-Chan Kim, Seongsoo Hong

机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) Kookmin University(韩国釜山大学) Department of Electrical and Computer Engineering(电子与计算机工程系) Seoul National University(首尔国立大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文通过将Alpamayo 1从多推理改为单推理系统,减少推理延迟并保持轨迹多样性,同时通过消除不必要的复制操作和低效内核执行提升扩散动作生成效率,实现了69.23%的延迟降低。

Comments Submitted to IEEE RTCSA on March 26, 2026 (KST) Accepted on May 4, 2026 (KST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08799 2026-05-12 cs.RO 50%

ElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided Manipulation

ElasticFlow: 语言引导操作中的弹性时间 horizon 的一步物理一致策略

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆校区) Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(芬兰奥卢大学信息科技与电气工程学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 ElasticFlow通过弹性时间 horizon 机制和直接建模平均速度场,实现高效的一步映射,提升语言引导操作的物理一致性和效率。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09493 2026-05-12 cs.AI cs.LG 50%

Consensus Sampling for Safer Generative AI

共识采样用于更安全的生成式AI

Adam Tauman Kalai, Yael Tauman Kalai, Or Zamir

机构 * OpenAI MIT(麻省理工学院) Tel Aviv University(特拉维夫大学)

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 本文提出共识采样算法,通过聚合多个概率分布提升生成模型安全性,其在保证安全性的前提下有效避免分歧,通过R-鲁棒性理论保障信息泄露和对抗影响的界限,实验验证了其在合成分布和图像生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏