Active Flow Matching
主动流匹配
机构 * Australian National University(澳大利亚国立大学)
专题命中 扩散模型 :diffusion(abstract)
AI总结 主动流匹配通过重新公式化变分目标,实现流上条件端点分布的梯度引导,提升高适应度区域的探索效率。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
主动流匹配
机构 * Australian National University(澳大利亚国立大学)
专题命中 扩散模型 :diffusion(abstract)
AI总结 主动流匹配通过重新公式化变分目标,实现流上条件端点分布的梯度引导,提升高适应度区域的探索效率。
关键帧引导的结构化奖励用于长周期实验室机器人强化学习
机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(科学技术大学苏州市先进研究院)
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出关键帧引导的结构化奖励方法,用于提升实验室机器人在长周期任务中的精确操作能力。
局部差分隐私用于分子通信网络
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出了一种基于扩散的分子通信网络中实现局部差分隐私的方法,通过隐私化处理用户测量数据并结合优化编码技术,提升了隐私保护下的数据聚合分析可靠性。
Comments 10 pages, 4 figures
TENG-BC:用于具有通用边界条件的神经PDE求解器的统一时间演进自然梯度
机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) ; Department of Physics, Tsinghua University, Beijing, China(清华大学物理系) ; Institute of Advanced Study, Tsinghua University, Beijing, China(清华大学advanced study研究所)
专题命中 扩散模型 :diffusion(abstract)
AI总结 TENG-BC通过统一时间演进自然梯度方法,实现对具有通用边界条件的神经PDE求解器的高精度求解,优于传统方法和PINN基线。
根部图积的燃烧
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文证明了所有梳形图满足燃烧数猜想,并确定了其燃烧数的渐进行为,提出了一个显式的贪心算法来解决该问题。
锚定与混合范数收缩在平均学习动力学中
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出了一种混合范数框架,用于分析在间歇性连通性下平均学习动力学的收敛性,通过聚合学习质量与影响扩散的相互作用实现两步收缩。
Comments 38 pages, 8 figures, 1 table
得分落地:通过去噪进行黎曼优化
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出通过去噪实现黎曼优化的方法,利用数据分布与扩散模型的分数函数连接,解决隐式流形上的优化问题。
Comments 41 pages, 9 figures
基于流形的感知源分离评估
机构 * Electrical and Computer Engineering, Technion - Israel Institute of Technology(技术学院-以色列理工学院电子与计算机工程系) ; Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
专题命中 扩散模型 :diffusion(abstract)
AI总结 本文提出基于流形学习的感知分离和匹配度量方法,用于更准确评估音频源分离系统的感知性能。
Comments Published as a conference paper at ICLR 2026
基于STL的斯托克斯量计算形状粒子的运动张量和沉降动力学
专题命中 扩散模型 :diffusion(abstract)
AI总结 该研究提出一种基于STL文件高效计算粒子运动张量和沉降动力学的方法,通过离散化粒子表面为斯托克斯量,验证了其在不同质心位置下的运动影响。
StaTS: 基于频域引导去噪器的自适应时间序列预测的频谱轨迹调度学习
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 扩散模型 :diffusion(abstract)
AI总结 StaTS通过交替更新学习噪声调度和去噪器,提升时间序列预测的结构保持和异质恢复能力。
通过文本引导的生成图像编辑与基于区域的控制改进3D场景风格化
机构 * The University of Tokyo(东京大学) ; RIKEN AIP(理化学研究所)
专题命中 可控生成 :image editing(title);inpainting(abstract);分类 cs.CV、cs.GR
AI总结 本文提出了一种改进的3D场景风格化方法,通过文本引导和基于区域的控制,提升风格一致性和视图一致性。
Comments Project Page: https://haruolabs.github.io/improved-gs-style-page/
具有延迟的连续控制状态-动作修复扩散器
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Shanghai Jiaotong University(上海交通大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 可控生成 :inpainting(title,abstract)
AI总结 SAID通过结合动力学学习和策略优化,提出了一种具有延迟的连续控制新方法,实现了最先进的性能。
基于正则化扩散的合同模型用于LAENets中的隐秘语义熵控制
专题命中 可控生成 :diffusion(title,abstract)
AI总结 本文提出基于正则化扩散的合同模型,用于LAENets中的隐秘语义熵控制,通过调整语义抽象级别提升任务信息传输可靠性。
EchoMimicV2: 向更具冲击力、简化和半身的人体动画迈进
机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 EchoMimicV2通过简化条件和引入新的Audio-Pose动态和谐化策略,实现了具有冲击力的半身人体动画,并提出了新的评估基准。
Comments CVPR2025
复制-变换-粘贴:由视觉-语言和几何约束引导的零样本物体-物体对齐
机构 * Reichman University(雷查曼大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR
AI总结 本文提出了一种基于视觉-语言和几何约束的零样本物体-物体对齐方法,通过可微分渲染器优化相对姿态,实现语义忠实且物理合理的3D对齐。
Comments GitHub Page: https://rotemgat.github.io/CopyTransformPaste/
LiftAvatar:基于运动空间的表达控制3D高斯人偶动画
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Institute of Artificial Intelligence of China Telecom(中国电信人工智能研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 LiftAvatar通过多粒度表达控制和多参考条件机制,提升3D人偶动画的质量和可控性。
Comments 19 pages, 11 figures
语义相似性是漫画理解的虚假度量:来自基准实验中幻觉的教训
专题命中 可控生成 :generative vision(abstract);分类 cs.CV
AI总结 本文提出了一项初步基准测试,评估生成视觉-语言模型在漫画解释任务中的表现,并分析了幻觉现象,强调未来研究中需加强幻觉缓解和数据整理。
Comments 8 pages, 2 figures, 3 tables. Includes link to code
通过脑交互变换器从fMRI中进行图像重建
机构 * Weizmann Institute of Science(魏茨曼科学研究所)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Brain-IT通过脑交互变换器从fMRI中实现高保真图像重建,结合高层语义和低层结构特征,提升重建精度与效率。
Comments Accepted at ICLR 2026
Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型
机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) ; Baidu Inc.(百度公司)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。
Comments ICLR 2026
SesaHand: 通过语义和结构对齐可控生成增强3D手重建
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Communication University of China(中国通信大学)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 SesaHand通过语义和结构对齐提升可控手部生成,优化3D手重建性能。
下一步视觉粒度生成
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; SenseTime Research(商汤科技研究院)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 NVG框架通过分层生成方法实现图像生成,优于VAR系列,提升FID分数并展示出良好的扩展性和潜在应用。
Comments ICLR 2026
LVTINO:用于高清视频修复的潜在视频一致性逆求解器
专题命中 图像修复 :text-to-image(abstract);diffusion(abstract);分类 cs.CV
AI总结 LVTINO是一种基于视频一致性模型的高清视频修复逆求解器,通过无需自动微分的条件机制实现高效高质量的视频重建。
Comments 30 pages, 16 figures. The Fourteenth International Conference on Learning Representations, ICLR 2026
UniTalking: 一种统一的音频-视频框架用于说话肖像生成
机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) ; School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV、cs.MM
AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。
Comments Accepted at CVPR 2026 (Findings Track)
部分耗散双曲系统衰减特性刻画
专题命中 个性化与一致性 :diffusion(abstract)
AI总结 本文通过L^p能量方法,提出新有效量Ψ(t,x),揭示部分耗散双曲系统解在dot B^{σ}_{p,1}范数下的衰减速率及耗散部分的增强衰减速率。
Comments 56 pages. Any comments or suggestions are welcome. The title "Decay character theory for partially dissipative hyperbolic systems of balance laws" has been replaced by the current title in contrast to the first version
BeautyGRPO: 通过动态路径引导和细粒度偏好建模实现面部修饰的美观对齐
机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, China(中山大学计算机科学与技术学院,深圳校区) ; vivo BlueImage Lab, vivo Mobile Communication Co., Ltd., China(vivo蓝影实验室,vivo移动通信有限公司)
专题命中 图像生成评测 :image editing(abstract);分类 cs.CV
AI总结 BeautyGRPO通过动态路径引导和细粒度偏好建模,解决面部修饰中保真度与审美偏好对齐的难题,实现更高质量的图像编辑效果。
Comments Accepted by CVPR 2026
Uni-cot: 向跨文本和视觉的统一链式推理迈进
机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 Uni-CoT通过统一的链式推理框架实现跨文本和视觉的连贯多模态推理,采用宏级和微级推理范式,提升多模态推理的效率和性能。
Comments Accepted by ICLR 2026, Project Page: https://sais-fuxi.github.io/projects/uni-cot/
COMBAT:基于行为代理训练的条件世界模型
机构 * Overworld AI ; Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分校)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 COMBAT通过在Tekken 3中训练实时动作控制的世界模型,利用扩散模型模拟动态对手,实现对玩家行为的响应性训练。
Mesh-Pro: 异步优势引导的排名偏好优化用于艺术家风格的四边形网格生成
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Tencent Hunyuan(腾讯文元) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 Mesh-Pro通过异步优势引导的排名偏好优化提升3D网格生成的训练效率和生成质量,引入了新的标记化和奖励机制,实现了艺术家风格网格的先进性能。
Comments Accepted to CVPR 2026
HorizonForge: 通过任意轨迹和任意车辆驱动场景编辑
机构 * NEC Labs America(NEC美国实验室) ; Stony Brook University(石溪大学) ; UC San Diego(圣地亚哥大学)
专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV
AI总结 HorizonForge通过任意轨迹和车辆实现驾驶场景的可控编辑,利用高斯溅射体和网格表示,结合视频扩散技术,提升生成场景的真实性和可控性。
Comments Accepted by CVPR 2026
TrueSkin: 向公平和准确的皮肤色调识别与生成迈进
机构 * Topaz Labs(Topaz实验室)
专题命中 图像生成评测 :image generation(abstract);分类 cs.CV
AI总结 TrueSkin通过系统化的皮肤色调数据集,提升模型在公平性和准确性上的表现,验证了其在识别和生成任务中的有效性。
Comments The dataset is available for download at https://drive.google.com/file/d/1_ndw5uyY4h4DLL5iGTL4bVDKdE_g_H4B/view?usp=sharing