SNCE: Geometry-Aware Supervision for Scalable Discrete Image Generation
SNCE:面向可扩展离散图像生成的几何感知监督
机构 * Adobe ; UCLA
AI总结 本文提出SNCE,一种新的训练目标,通过构建软类别分布解决大代码书离散图像生成的优化问题,提升收敛速度和生成质量。
Comments 21 pages, 4 figures
高校专区
SNCE:面向可扩展离散图像生成的几何感知监督
机构 * Adobe ; UCLA
AI总结 本文提出SNCE,一种新的训练目标,通过构建软类别分布解决大代码书离散图像生成的优化问题,提升收敛速度和生成质量。
Comments 21 pages, 4 figures
第一人称世界模型用于逼真手-物体交互合成
机构 * Texas A&M University(德克萨斯A&M大学) ; University of Minnesota(明尼苏达大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Texas at Austin(得克萨斯大学奥斯汀分校) ; Amazon(亚马逊) ; State University of New York at Stony Brook(纽约州立大学石溪分校)
AI总结 本文提出EgoHOI模型,通过动作信号模拟物理一致的交互,克服了高速头部运动、严重遮挡和高自由度手部运动带来的挑战,实验验证其有效性。
Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; UCLA(加州大学洛杉矶分校) ; Shenzhen Loop Area Institute(深圳河套学院)
AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。
Comments 31 pages, ICLR2026