Inferring resource selection and utilization distributions from irregular and error-prone animal tracking data
从不规则且带有误差的动物追踪数据推断资源选择和利用分布
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出基于拉普拉斯近似的单阶段框架,通过TMB实现,同时处理测量误差和不规则采样,在模拟和独角鲸数据中优于两步法。
Comments 29 pages
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
从不规则且带有误差的动物追踪数据推断资源选择和利用分布
专题命中 扩散模型 :diffusion(abstract)
AI总结 提出基于拉普拉斯近似的单阶段框架,通过TMB实现,同时处理测量误差和不规则采样,在模拟和独角鲸数据中优于两步法。
Comments 29 pages
强耦合夸克-胶子等离子体中重 Charm 和 Charmonium 的输运
专题命中 扩散模型 :diffusion(abstract)
AI总结 本研究提出了一种基于热力学 T 矩阵相互作用的耦合 Charm-Charmonium 输运框架,用于描述强耦合 QGP 中 Charm-quark 扩散和 Charmonium 动力学。
Comments 24 pages, 17 figures
序列相互扩散的定量收敛与高斯波动:通过增量相对熵
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文研究了序列相互扩散系统的定量收敛与高斯波动,通过增量相对熵证明了路径空间熵的衰减及经验测度的收敛性,并建立了波动测度的高斯极限。
Comments 35 pages, 2 figures. We split the first version to two parts. This is the first part
纳米科学中的退相干挑战:量子相空间视角
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出基于量子相空间的框架,用于表征环境选择的指针态并建模退相干动力学,为纳米科学中的退相干问题提供新的理论工具和方法。
Comments 26 pages
MagicMakeup:用于高保真妆容转移的区域可控扩散Transformer
机构 * Zhejiang University(浙江大学) ; State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) ; vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) ; vivo BlueImage Lab(vivo蓝图像实验室)
专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV
AI总结 研究妆容转移中区域可控性等难题,提出MagicMakeup框架,基于空间约束和概念解缠结,用令牌对齐区域门控和跨模态感知指导实现精确编辑与概念澄清,设计数据生成管道并建立基准,提升了多方面性能和鲁棒性。
智能设计师:用于结构感知室内布局生成的渐进式多智能体协作
机构 * Guangdong University of Technology(广东工业大学) ; South China University of Technology(华南理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 针对室内布局生成难题,提出智能设计师这一渐进式多智能体框架,将布局生成视为迭代约束验证决策过程,通过渐进共识机制协调三个智能体,经实验验证其显著优于现有方法,提升了结构遵循和功能设计连贯性。
Comments TPAMI 2026
作为最优控制的随机量子化
专题命中 可控生成 :diffusion(abstract)
AI总结 研究将随机量子化表述为有限时间随机最优控制问题,利用可处理参考过程及参考校正终端成本,通过神经网络学习残余控制实现最优随机量子化,在多峰势和二维晶格标量\(\phi^4\)理论中取得成果,将量子化表述为控制。
Comments 7 pages, 4 figures
VPWEM:非马尔可夫视觉-运动策略与工作记忆与事件记忆
机构 * School of Computing and Data Science, University of Hong Kong(计算与数据科学学院,香港大学)
专题命中 可控生成 :diffusion(abstract)
AI总结 VPWEM通过引入工作记忆和事件记忆,提升机器人在非马尔可夫任务中的动作生成性能。
Comments Accepted to IEEE Robotics and Automation Letters (RA-L). \textcopyright 2026 IEEE
3D-GIMP:当3D高斯图像修复与PatchMatch相遇
机构 * University of Stuttgart(斯图加特大学)
专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV、cs.GR
AI总结 针对3D场景编辑中迭代扩散模型的问题,提出3D-GIMP混合范式,通过在关键参考视图进行图像修复并利用3D感知PatchMatch算法传播纹理,优先保证重建一致性,在渲染速度和视图一致性上表现更优。
Comments 15 pages
自适应身份锚定:用于视频人脸交换中合成配对监督的闭环关键帧放置
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 研究视频人脸交换缺乏自然配对监督问题,提出自适应身份锚定(AIA)方法,通过闭环反馈放置锚定并结合现实参考纹理恢复,还给出可证伪实验,有望解决合成身份漂移及过度平滑皮肤问题。
GroupVideo:多身份定制文本到视频生成
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Ant Group(蚂蚁集团)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。
KroQuant:用于扩散Transformer高效训练后量化的克罗内克结构块变换
机构 * EPFL(洛桑联邦理工学院) ; Advanced Micro Devices, Inc.(超威半导体公司)
专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV
AI总结 研究针对扩散Transformer训练后量化到W4A4质量严重下降问题,提出KroQuant方法,对激活值3个2元素块应用克罗内克结构可逆变换,存储参数少,运行快,结合离线LoRaQ权重校准,输出更接近FP参考且保持或提高图像质量。
RealVDeblur:用于通用真实世界视频去模糊的一步扩散法
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CUHK MMLab(香港中文大学多媒体实验室) ; CPII under InnoHK(创新香港研究院下的CPII) ; Tsinghua University(清华大学)
专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV
AI总结 针对真实世界视频去模糊难题,提出RealVDeblur框架。构建模糊合成管道提供数据,利用视频扩散先验恢复,采用逐帧编码并简化采样为一步生成器,还有时间窗口掩码稳定推理,在多方面表现出色且提升3D重建鲁棒性。
Comments Project page with code: https://rbjin.github.io/RealVDeblur/
SANA-Video 2.0:具有注意力残差的混合线性注意力用于高效视频生成
机构 * NVIDIA(英伟达)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 SANA-Video 2.0是一种混合视频扩散Transformer,采用混合线性-softmax注意力和块注意力残差,在单个GPU上生成高质量视频,成本大幅降低,实现可扩展长时、高分辨率视频生成,性能与大模型竞争且速度更快。
Comments 13 pages, 9 figures, 5 tables
Ms. Forcing:通过多尺度分块和注意力实现高效流视频生成
机构 * Brown University(布朗大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Meta
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 研究针对流视频生成中传统方法的不足,提出Ms. Forcing范式,通过多尺度分块和注意力调整空间粒度,引入均匀噪声水平DMD减少不匹配,该方法提升了效率,在单个H200 GPU上性能显著优于Rolling Forcing。
ETC: 通过任务感知的视觉信息蒸馏实现视觉语言模型中的极端令牌压缩
机构 * School of Remote Sensing and Information Engineering, Wuhan University(武汉大学遥感与信息工程学院)
专题命中 效率与蒸馏 :text-to-image(abstract);分类 cs.CV
AI总结 提出ETC框架,基于变分信息蒸馏原理,在减少输入令牌数量时最小化任务损失,通过文本-图像交叉注意力加权视觉特征并引入变分信息蒸馏,实现单令牌压缩下仍保持强任务性能。
DC-Leap:通过草稿引导的连续跳跃解码实现无训练的dLLMs加速
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 研究针对dLLMs并行解码中因保守置信阈值致效率低的问题,提出DC-Leap框架。其采用动态连续验证策略消除JPDE,结合草稿引导解码机制。实验表明该框架能大幅加速dLLMs,长序列生成加速显著,且保证生成质量。
立场:自然语言不应完全取代形式语言
专题命中 其他图像生成 :image generation(abstract)
AI总结 针对自然语言能否完全取代形式语言的争议,引入基于“任务特异性”的形式框架并证明“特异性交叉定理”,通过跨模态案例分析表明二者各有优势,是互补工具,倡导开发混合系统。
Comments To be published in ICML 2026 (position track)