Viscoelastic control of acoustic particle migration and trapping in microchannels
粘弹性控制微通道中声学粒子迁移与捕获
专题命中 可控生成 :diffusion(abstract)
AI总结 研究粘弹性流体中声学辐射力与流体诱导拖曳的竞争作用,揭示粘弹性对粒子动态的调控机制,提出通过德布罗意数和粘性扩散数控制粒子迁移与捕获的新方法。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
粘弹性控制微通道中声学粒子迁移与捕获
专题命中 可控生成 :diffusion(abstract)
AI总结 研究粘弹性流体中声学辐射力与流体诱导拖曳的竞争作用,揭示粘弹性对粒子动态的调控机制,提出通过德布罗意数和粘性扩散数控制粒子迁移与捕获的新方法。
FlowADMM:基于流的重噪-去噪先验的即插即用ADMM
机构 * Computer Vision Group, University of Siegen(Siegen大学计算机视觉组)
专题命中 图像修复 :diffusion(abstract);inpainting(abstract);分类 cs.CV
AI总结 本文提出FlowADMM算法,通过将重噪-去噪操作整合到经典ADMM框架中,解决了基于流的即插即用方法的收敛性问题,并在逆问题中取得了最佳性能。
理解面向视觉-语言-动作模型的异步推理方法
机构 * École polytechnique Systems Group, ETH Zürich(瑞士联邦理工学院系统组,苏黎世联邦理工学院)
专题命中 图像修复 :inpainting(abstract)
AI总结 本文系统比较了四种异步推理方法,评估了其在不同延迟下的性能,发现A2C2在Kinetix上表现最佳,TT-RTC在LIBERO上最稳健,IT-RTC在低延迟下表现良好但高延迟下下降,VLASH在低延迟与高延迟之间存在权衡。
几步即可:无需训练的身份保持生成加速
机构 * FLUX Diffusion Transformer(FLUX扩散变换器) ; InfuseNet
专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);personalized generation(abstract);分类 cs.CV
AI总结 本文提出无需训练的轻量化策略,通过替换扩散模型骨干网络和禁用分类器自由引导,显著提升身份保持生成的效率与质量。
AsymTalker:通过不对称蒸馏实现身份一致的长期说话头生成
机构 * Soochow University(苏州大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 个性化与一致性 :diffusion(abstract)
AI总结 本文提出AsymTalker,通过时空对齐和不对称蒸馏解决长期说话头生成中的身份漂移问题,实现高保真身份一致的600秒视频生成,达到66 FPS的实时推理速度。
弥合谱算子学习与U-Net层次结构:SpectraNet用于稳定的自回归PDE替代模型
机构 * University of New Orleans(新奥尔良大学) ; Naval Research Laboratory(海军研究实验室)
专题命中 个性化与一致性 :diffusion(abstract)
AI总结 SpectraNet通过在U-Net层次结构中嵌入截断谱卷积,并利用Semigroup-Consistency Loss训练残差目标谱块,实现了稳定的自回归PDE替代模型,其参数量与网格无关,且在多个PDE测试中表现优于FNO。
Comments 29 pages, 9 figures. Code: https://github.com/Enrikkk/spectranet
基于几何的自一致性物理AI
机构 * Princeton University(普林斯顿大学)
专题命中 个性化与一致性 :diffusion(abstract)
AI总结 本文提出KeyStone方法,通过并行生成动作片段并聚类,返回最大簇的质心,提升任务成功率13.3%且无额外延迟。
通过内在微分一致性从离散观测中恢复物理动力学
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; The Ohio State University(俄亥俄州立大学)
专题命中 个性化与一致性 :diffusion(abstract)
AI总结 本文提出通过全局结构约束替代局部监督,训练时间条件化的secant速度场,以提升从离散观测中恢复连续时间动力学的精度与效率。
3DReflecNet:一个大规模数据集,用于反射、透明和低纹理物体的3D重建
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Capital Normal University(首都师范大学) ; University of Southern California(南加州大学)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 本文提出3DReflecNet数据集,包含超过700万张多视角图像,用于评估和推动针对反射、透明和低纹理物体的3D视觉方法,揭示现有方法在复杂材料下的局限性。
Comments This paper has been accepted by CVPR 2026 Oral
面向基于视觉的遥控的生成预测显示:一种零样本基准测试的现成视频模型
机构 * Department of Electrical and Computer Engineering, University of Michigan - Dearborn(密歇根大学迪尔伯恩分校电气与计算机工程系)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 本文提出一种零样本基准测试,评估现成生成视频模型在短时间预测显示中的性能,发现现有模型无法在低误差、非发散误差行为和实时推断间取得平衡。
Tstars-Tryon 1.0:鲁棒且逼真的虚拟试衣系统用于多样化服装物品
机构 * Alibaba Group(阿里巴巴集团) ; Taobao App(淘宝App)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 本文提出Tstars-Tryon 1.0,一种高效且逼真的虚拟试衣系统,能够处理复杂场景,支持多件衣物试穿,并在大规模部署中实现高效率和高质量输出。
Comments 24 pages, model evaluation report
探索AI服从性:为何生成纯色图像比CyberPunk更困难
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; City University of Hong Kong(城市大学) ; Chinese University of Hong Kong(香港中文大学) ; McGill University(麦吉尔大学)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 研究探讨生成纯色图像的困难源于模型在复杂场景生成中的系统性失败,提出AI服从性框架和Violin基准测试,揭示闭源模型在确定性精度上的优势。
生成正则化器在反问题中的稳定性基准
机构 * Helmholtz Imaging, Deutsches Elektronen-Synchrotron DESY, Germany(德意志电子同步辐射研究中心(Helmholtz Imaging)) ; ENS Paris & Inria, France(巴黎高等师范学院与法国国家信息与自动化研究所) ; Chemnitz University of Technology, Germany(化学工业大学)
专题命中 图像生成评测 :diffusion(abstract)
AI总结 本文评估生成正则化器在反问题中的稳定性,对比优化方法,探讨其在不同场景下的性能。
无需潜在变量的一步图像生成:像素均值流
机构 * MIT(麻省理工学院)
专题命中 效率与蒸馏 :image generation(title,abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出像素均值流(pMF),通过分离网络输出空间与损失空间,实现无需潜在变量的一步图像生成,在ImageNet上取得优异结果。
Comments Tech report. Code at https://github.com/Lyy-iiis/pMF
无限掩码扩散用于少步蒸馏
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 效率与蒸馏 :diffusion(title,abstract)
AI总结 本文提出无限掩码扩散模型,通过引入随机无限状态掩码降低因子化误差下限,解决了传统掩码扩散模型在少步生成中的性能问题,并在LM1B和OpenWebText上超越现有少步蒸馏方法。
TAD: 时空感知轨迹自蒸馏用于快速准确的扩散大语言模型
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) ; Ant Group(蚂蚁集团)
专题命中 效率与蒸馏 :diffusion(title,abstract)
AI总结 TAD通过时空感知轨迹自蒸馏方法,在提升生成速度的同时保持准确性,实验表明在LLaDA上质量模型将平均准确率提升至51.6%,速度模型将AUP提升至257.1。
基于LR条件SplitMeanFlow和GAN精炼的噪声启动一步真实世界超分辨率
机构 * Nanjing University of Science and Technology(南京理工大学) ; Nanjing University(南京大学) ; Huawei(华为)
专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 本文提出SMFSR框架,通过LR条件SplitMeanFlow和GAN精炼实现噪声启动的一步真实世界超分辨率,保留扩散模型的随机噪声起点并提升生成效率与真实感。
CERSA:累积能量保留子空间适应用于内存高效的微调
机构 * National University of Singapore(新加坡国立大学) ; Nankai University(南开大学) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);分类 cs.CV
AI总结 CERSA通过奇异值分解保留主成分以降低内存消耗,优于现有PEFT方法,适用于多种领域模型。
Comments 10 pages, 7 figures, supplementary material included
SWIFT: 用于高效交互长视频生成的提示自适应内存
机构 * University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 SWIFT提出一种无需训练的多提示长视频生成框架,通过轻量级语义注入缓存和自适应动态窗口实现高效语义切换,保持时间一致性,达到22.6 FPS的高效生成速度。
Comments Code is available at https://github.com/ShanwenTan/SWIFT
离散 Langevin 激发后验采样
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出离散 Langevin 激发后验采样方法,用于在离散状态空间中解决逆问题,通过梯度信息指导离散移动,实现高效的并行更新,适用于多种逆问题场景。
概率流蒸馏:用于高保真3D生成的精确Wasserstein梯度流
机构 * Department of Physics(物理系) ; Indian Institute of Technology Madras(印度理工学院马德拉斯分校) ; Department of Electrical Engineering(电气工程系)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 本文提出概率流蒸馏,通过精确Wasserstein梯度流解决SDI的模式崩溃问题,实现高保真3D生成。
StreamPhy: 通过状态空间模型实现高维物理动态的流式推断
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; School of EECS,Oregon State University(俄勒冈州立大学电子工程与计算机科学学院)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 本文提出StreamPhy框架,通过自适应观测编码器、结构化状态空间模型和FT-FiLM解码器,实现高效准确的流式推断,实验显示其在复杂动态处理上优于现有方法,精度提升48%以上,速度提升20-100倍。
稀有事件面前的灵敏度分析
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 本文提出结合重要抽样与马尔可夫状态模型的计算流程,用于处理稀有事件中动态可观测量及其灵敏度的估计问题,通过迭代重加权减少误差,验证了在穆勒-布朗势扩散中的过渡率灵敏度计算。
通过高效轨迹生成分析和优化Alpamayo 1的延迟
机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) ; Kookmin University(韩国釜山大学) ; Department of Electrical and Computer Engineering(电子与计算机工程系) ; Seoul National University(首尔国立大学)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 本文通过将Alpamayo 1从多推理改为单推理系统,减少推理延迟并保持轨迹多样性,同时通过消除不必要的复制操作和低效内核执行提升扩散动作生成效率,实现了69.23%的延迟降低。
Comments Submitted to IEEE RTCSA on March 26, 2026 (KST) Accepted on May 4, 2026 (KST)
ElasticFlow: 语言引导操作中的弹性时间 horizon 的一步物理一致策略
机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) ; Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆校区) ; Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(芬兰奥卢大学信息科技与电气工程学院)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 ElasticFlow通过弹性时间 horizon 机制和直接建模平均速度场,实现高效的一步映射,提升语言引导操作的物理一致性和效率。
Comments Accepted to Findings of ACL 2026
共识采样用于更安全的生成式AI
机构 * OpenAI ; MIT(麻省理工学院) ; Tel Aviv University(特拉维夫大学)
专题命中 效率与蒸馏 :image generation(abstract)
AI总结 本文提出共识采样算法,通过聚合多个概率分布提升生成模型安全性,其在保证安全性的前提下有效避免分歧,通过R-鲁棒性理论保障信息泄露和对抗影响的界限,实验验证了其在合成分布和图像生成中的有效性。