RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences
RPO:通过丰富的视觉-语言偏好进行视觉生成模型微调
机构 * Columbia University(哥伦比亚大学) ; Amazon(亚马逊) ; Princeton University(普林斯顿大学) ; Capital One
AI总结 RPO通过利用视觉语言模型的丰富反馈信号,改进偏好对的编纂,从而提升视觉生成模型的微调效果。
高校专区
RPO:通过丰富的视觉-语言偏好进行视觉生成模型微调
机构 * Columbia University(哥伦比亚大学) ; Amazon(亚马逊) ; Princeton University(普林斯顿大学) ; Capital One
AI总结 RPO通过利用视觉语言模型的丰富反馈信号,改进偏好对的编纂,从而提升视觉生成模型的微调效果。
嵌入应该嵌入什么?自回归模型表示潜在生成分布
机构 * Department of Computer Science(计算机科学系) ; Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学) ; Department of Linguistics and Wu Tsai Institute(语言学系和吴泰教授研究所) ; Yale University(耶鲁大学) ; Anthropic(Anthropic公司) ; Departments of Psychology and Computer Science(心理学系和计算机科学系)
AI总结 本文探讨了自回归模型中嵌入应代表的潜在生成分布,并通过实验证明了其在不同场景下的有效性。
Comments 28 pages, 11 figures
Journal ref Transactions on Machine Learning Research. 2025. https://openreview.net/forum?id=YyMACp98Kz
CD4LM:一致性蒸馏与自适应解码用于扩散语言模型
机构 * Princeton University(普林斯顿大学) ; Advanced Micro Devices, Inc(先进微器件公司)
AI总结 CD4LM通过一致性蒸馏和自适应解码提升扩散语言模型的并行解码效率与生成质量。
Comments 33 pages, 7 figures
LinMU: 使多模态理解线性化
机构 * Princeton University(普林斯顿大学)
AI总结 LinMU通过线性复杂度设计实现多模态理解,无需二次注意力模块,提升视频处理效率。
Comments 23 pages, 7 figures
重新审视贪心模型搜索中的随机化
机构 * Department of Operations Research and Financial Engineering, Princeton University(运筹学与金融工程系,普林斯顿大学) ; Department of Statistics and Data Science, National University of Singapore(统计与数据科学系,新加坡国立大学)
AI总结 本文研究了特征子采样对贪心前向选择模型的影响,揭示了其在减少偏差和方差方面的独特作用,不同于传统收缩方法。
大语言模型与英语的熵
机构 * Joseph Henry Laboratories of Physics(乔赛亚·亨利物理实验室) ; Princeton Center for Theoretical Science(普林斯顿理论科学中心) ; Lewis--Sigler Institute for Integrative Genomics(刘易斯-西格尔整合基因组学研究所) ; Princeton University(普林斯顿大学) ; Initiative for the Theoretical Sciences(理论科学倡议) ; The CUNY Graduate Center(纽约市立大学研究生中心)
AI总结 通过大语言模型揭示英语文本中长程结构的熵特性及依赖关系
Comments 8 pages, 6 figures
MUSIC: 多步指令对比用于多轮奖励模型
机构 * Princeton University(普林斯顿大学) ; Google DeepMind(谷歌DeepMind)
AI总结 MUSIC通过多步指令对比提升多轮奖励模型的性能,有效增强多轮对话的评估能力。
PolaRiS:面向通用机器人策略的可扩展真实-仿真评估
机构 * University of Washington(华盛顿大学) ; Princeton University(普林斯顿大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Toyota Research Institute(丰田研究中心) ; University of Southern California(南加州大学) ; Cornell University(康奈尔大学)
AI总结 PolaRiS通过神经重建和数据协同训练,实现高保真度的机器人策略真实-仿真评估,提升仿真与现实的关联性并简化环境构建。
Comments Website: https://polaris-evals.github.io/
非参数加法回归的随机梯度下降
机构 * Department of Operations Research and Financial Engineering, Princeton University(运筹学与金融工程系,普林斯顿大学)
AI总结 本文提出了一种用于非参数加法回归的随机梯度下降算法,通过分阶段学习率选择实现最优风险,并在模型不规范情况下提供收敛速率保证。
机构 * Princeton University(普林斯顿大学) ; University of California(加州大学) ; University of Pennsylvania(宾夕法尼亚大学)
Comments Project Page: https://github.com/Princeton-AI2-Lab/Web-World-Models
三维形状生成中的记忆现象:一项实证研究
机构 * Princeton University(普林斯顿大学) ; Harvard University(哈佛大学)
AI总结 本文通过实证研究探讨了3D生成模型中记忆现象的影响因素,并提出减少记忆的策略以提升生成多样性。
边缘的随机稳定性:重新审视SGD的稳定性边缘
机构 * Princeton University(普林斯顿大学) ; MIT(麻省理工学院)
AI总结 该研究重新审视了SGD的稳定性边缘,揭示了小批量SGD在边缘随机稳定性下的训练机制及批量尖锐度的稳定性特性。
Comments 83 pages, 36 figures
ICONS: 视觉-语言数据选择中的影响共识
机构 * Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学) ; Google DeepMind(谷歌DeepMind) ; Allen Institute for AI(人工智能研究院)
AI总结 ICONS通过影响共识方法高效选择视觉-语言数据,保持高性能并支持多任务泛化。
通过不确定性引导的丢弃解码增强视觉-语言模型的可靠性
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Princeton University(普林斯顿大学) ; University of Chicago(芝加哥大学) ; Stony Brook University(石溪大学)
AI总结 通过不确定性引导的丢弃解码方法,有效减少视觉-语言模型的幻觉问题,提升输出的可靠性和质量。
Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025)
AInsteinBench:在科学仓库中评估编码代理的基准测试
机构 * Princeton University(普林斯顿大学)
AI总结 AInsteinBench通过评估大型语言模型在科学计算开发中的能力,提供了一个基于真实科研软件生态系统的基准测试。
GenEnv:LLM代理与环境模拟器之间的难度对齐共进化
机构 * Princeton University(普林斯顿大学) ; Columbia University(哥伦比亚大学) ; University of Michigan(密歇根大学) ; University of Chicago(芝加哥大学)
AI总结 GenEnv通过动态生成任务与代理能力对齐的共进化机制,在减少数据使用量的同时显著提升代理性能。
Comments Our codes are available at https://github.com/Gen-Verse/GenEnv
下一步嵌入预测使视觉学习更强
机构 * University of Michigan(密歇根大学) ; New York University(纽约大学) ; Princeton University(普林斯顿大学) ; University of Virginia(弗吉尼亚大学)
AI总结 本文提出NEPA方法,通过生成嵌入进行预测任务,实现强大的视觉自监督学习效果。
Comments Project Page: https://sihanxu.me/nepa
4D高斯散射作为学习到的动态系统
机构 * Princeton University(普林斯顿大学) ; Columbia University(哥伦比亚大学)
AI总结 本文提出EvoGS,将4D高斯散射视为学习到的动态系统,通过连续时间演化提升动态场景建模的效率与可控性。
统一深度谓词发明与预训练基础模型
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Computer Science and Engineering Division, University of Michigan(密歇根大学计算机科学与工程系) ; Department of Computer Science, University of Pittsburgh(匹兹堡大学计算机科学系) ; Centaur AI Institute(Centaur人工智能研究所) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)
AI总结 UniPred通过双层学习框架统一深度谓词发明与预训练基础模型,提升机器人任务的可扩展性和灵活性。
Comments 18 pages, 11 figures
超越场景:分析和缓解动作识别中的背景偏见
机构 * Westmont High School(韦斯蒙特高中) ; Princeton University(普林斯顿大学)
AI总结 本文分析了动作识别中背景偏见的问题,并提出缓解策略,通过输入分割和提示调优降低背景偏见,提升模型对人类动作的识别能力。
Comments Accepted to NeurIPS 2025 Workshops: SPACE in Vision, Language, and Embodied AI; and What Makes a Good Video: Next Practices in Video Generation and Evaluation
通过Geo-Wasserstein散度进行3D细胞过分割校正
机构 * Columbia University(哥伦比亚大学) ; Princeton University(普林斯顿大学) ; University of California, San Francisco(旧金山大学)
AI总结 本文提出Geo-Wasserstein散度用于3D细胞过分割校正,结合几何和拓扑特征提升分割质量。
Comments Accepted to WACV 2026
peek-a-boo推理:多模态大语言模型中的对比区域遮挡
机构 * Algoverse AI Research(Algoverse AI研究机构) ; Princeton University(普林斯顿大学)
AI总结 对比区域遮挡通过遮挡视觉区域并对比推理轨迹,揭示多模态大语言模型在推理过程中的依赖模式和失败模式。
腕部光体积脉图预测饮食信息
机构 * Apple(苹果公司) ; Princeton University(普林斯顿大学)
AI总结 通过训练语言模型,研究发现腕部PPG可预测饮食信息,显著提升摄入和饱腹感的AUC,为被动饮食监测提供新方法。
Comments 20 pages, 2 figures
无监督发现多视图数据中的共享与私有几何
机构 * Department of Biomedical Engineering(生物医学工程系) ; Johns Hopkins University(约翰霍普金斯大学) ; Princeton Neuroscience Institute(普林斯顿神经科学研究所) ; Princeton University(普林斯顿大学) ; Department of Psychology and Brain Sciences(心理学与脑科学系) ; University of Delaware(德雷塞尔大学) ; Center for Imaging Science(成像科学中心) ; Kavli Neurodiscovery Institute(Kavli神经发现研究所)
AI总结 SPLICE是一种无监督方法,用于发现多视图数据中的共享和私有几何结构,通过解耦潜在变量以提高解释性和鲁棒性。
FrontierCS: 蒸馏智能面临的挑战
机构 * UC Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学) ; UCSD(加州大学圣迭戈分校) ; X-camp Academy(X-camp学院) ; Georgia Tech(佐治亚理工学院) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; Nanyang Technological University(南洋理工大学) ; University of Toronto(多伦多大学) ; UIUC(伊利诺伊大学香槟分校) ; University of Michigan(密歇根大学) ; New York University(纽约大学) ; MIT(麻省理工学院)
AI总结 FrontierCS是一个针对未知最优解的计算机科学开放性问题基准测试,旨在评估模型在算法和研究任务中的推理能力,发现现有模型在复杂问题上仍需提升。
Comments Code with instruction: https://github.com/FrontierCS/Frontier-CS
多尺度跨模态映射分子、病理和放射表型在脂质缺乏型清细胞癌肾癌中的应用
机构 * Nurturing Center of Jiangsu Province for State Laboratory of AI Imaging & Interventional Radiology, Department of Radiology, Zhongda Hospital, School of Medicine, Southeast University(江苏省人工智能影像与介入放射学 state laboratory 育成中心,放射科,中大医院,东南大学) ; Department of Mechanical and Aerospace Engineering, Princeton University(机械与航空航天工程系,普林斯顿大学) ; School of Automation, Southeast University(自动化学院,东南大学) ; Department of Biomedical Engineering, Columbia University(生物医学工程系,哥伦比亚大学) ; Automation and Electrical Engineering College, Lanzhou University of Technology(自动化与电气工程学院,兰州理工大学) ; The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学附属第一医院,生命科学与医学学院,中国科学技术大学) ; Lianyungang First People’s Hospital(连云港第一人民医院) ; School of Robotics and Automation, Suzhou Campus, Nanjing University(机器人与自动化学院,南京大学苏智校区)
AI总结 本研究提出多尺度跨模态框架,用于术前识别脂质缺乏型清细胞肾癌的分子、病理和放射表型,实现非侵入性分子表型分析。
胡萝卜、棍棒还是两者都有?在竞争环境中对可持续食品选择的价格激励
机构 * Princeton University(普林斯顿大学) ; EPFL(瑞士联邦理工学院)
AI总结 本研究通过价格干预策略在竞争环境中促进可持续食品选择,发现综合方案在减少碳排放方面更有效且经济可行。
Comments 10 pages, 3 figures
ORIBA:探索基于大语言模型的对话机器人作为原创角色艺术家创造力支持工具
机构 * Computer Science Research Centre, Royal College of Art(皇家艺术学院计算机科学研究中心) ; Digital Media, School of Literature, Media, and Communication, Georgia Institute of Technology(佐治亚理工学院数字媒体系) ; Princeton University(普林斯顿大学) ; Digital Media, Georgia Institute of Technology(佐治亚理工学院数字媒体系) ; Division of Integrative Systems and Design, The Hong Kong University of Science and Technology(香港科学大学整合系统与设计 division) ; Industrial Design Department, College of Engineering, KAIST(韩国科学技术院工程学院工业设计系)
AI总结 ORIBA通过大语言模型支持原创角色艺术家的创意过程,平衡AI辅助与创意自主权。
密度估计中的最优近似因子
机构 * Google Brain(谷歌大脑) ; University of California, San Diego(加州大学圣地亚哥分校) ; Princeton University(普林斯顿大学)
AI总结 本文研究了密度估计中最优近似因子问题,通过自适应和静态方法证明在允许输出任意密度时,近似因子可降至2,展示了不当学习的优势。
代理调节器:人工智能在金融中的风险及一种基于代理的治理框架提案
机构 * Princeton University(普林斯顿大学) ; Emory University(埃默里大学) ; Bowdoin College(鲍德因学院)
AI总结 本文提出基于代理的治理框架,以应对人工智能在金融领域中的新兴风险,通过分层监管模块提升系统适应性和稳定性。