Unbiased Diffusion Variational Inversion via Principled Posterior Matching
无偏扩散变分反演:基于原则性后验匹配
机构 * Peking University(北京大学)
AI总结 提出原则性后验匹配(PPM)框架,通过精确优化KL散度(利用Fisher散度积分)解决逆问题中模式坍塌和不确定性量化不可靠的问题,统一变分推理和摊销推理,在图像修复、超分辨荧光显微和射电干涉成像中实现高保真重建和校准的不确定性估计。
高校专区
无偏扩散变分反演:基于原则性后验匹配
机构 * Peking University(北京大学)
AI总结 提出原则性后验匹配(PPM)框架,通过精确优化KL散度(利用Fisher散度积分)解决逆问题中模式坍塌和不确定性量化不可靠的问题,统一变分推理和摊销推理,在图像修复、超分辨荧光显微和射电干涉成像中实现高保真重建和校准的不确定性估计。
LiveClawBench: 在复杂真实世界助理任务上评估大语言模型代理的基准测试
机构 * Samsung Research(三星研究院) ; HKUST (Guangzhou)(香港科技大学(广州)) ; Peking University(北京大学) ; City University of Hong Kong(香港城市大学)
AI总结 本文提出LiveClawBench基准,通过三轴复杂性框架评估LLM代理在真实世界助理任务中的表现,涵盖环境复杂性、认知需求和运行时适应性,为未来扩展提供基础。
StereoVLA:利用立体视觉增强视觉-语言-动作模型
机构 * Galbot ; CFCS, School of CS, Peking University(北京大学计算机学院CFCS) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; The University of Hong Kong(香港大学) ; Xiamen University Malaysia(厦门大学马来西亚分校) ; Southern University of Science and Technology(南方科技大学)
AI总结 提出StereoVLA,首个利用大规模合成立体数据引入丰富几何线索的VLA模型,通过几何与语义联合编码和协同训练目标,在真实实验中成功率绝对提升33.4%,并展现出对近半球视角的鲁棒性。
让语言约束几何:视觉-语言模型作为3D生成的语义和空间评判者
机构 * Peking University(北京大学) ; hi-lab, Xiaohongshu Inc.(小红书科技公司 hi-lab) ; MMLab, CUHK(香港中文大学 MMLab) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 提出VLM3D框架,利用视觉-语言模型作为可微分的语义和空间评判者,通过双查询评判信号改善文本到3D生成的语义对齐和几何一致性。
Comments arXiv admin note: substantial text overlap with arXiv:2509.15772
一种从损坏观测中训练清洁扩散模型的期望最大化算法
机构 * Academy for Advanced Interdisciplinary Studies, Peking University(北京大学前沿交叉学科研究院) ; College of Future Technology, Peking University(北京大学未来技术学院) ; National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心) ; Yuanpei College, Peking University(北京大学元培学院) ; State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)
AI总结 提出EMDiffusion,一种期望最大化方法,通过交替重建和模型更新从损坏观测中训练扩散模型,在多种成像逆任务上达到新最优。