DRM: Diffusion-based Reward Model With Step-wise Guidance
DRM: 基于扩散的奖励模型与逐步引导
机构 * Peking University(北京大学) ; WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)
AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。
高校专区
DRM: 基于扩散的奖励模型与逐步引导
机构 * Peking University(北京大学) ; WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)
AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。
MSAVBench:面向多镜头音频-视频生成的全面可靠评估
机构 * Fudan University(复旦大学) ; The University of Hong Kong(香港大学) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; Zhejiang University(浙江大学) ; Peking University(北京大学)
AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。
面向低资源语言机器翻译的多示例上下文学习的实证研究
机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; Athabasca University(阿特拉斯大学) ; Peking University(北京大学) ; Howard University(霍华德大学)
AI总结 本研究实证分析多示例上下文学习在低资源语言机器翻译中的效果,发现BM25检索可大幅提升数据效率,且ICL能在微调基础上带来额外增益。
Comments 24 pages, 3 figures, 20 tables
探索信息寻求智能体整合
机构 * Peking University(北京大学) ; Tencent(腾讯)
AI总结 通过系统实证研究,比较数据级混合与参数级合并两种范式,发现参数级合并能以更低成本达到数据混合的性能,并保留跨域能力。
立场:感知之后推理意味着无视觉推理
机构 * Tsinghua University(清华大学) ; Peking University(北京大学) ; National University of Singapore(新加坡国立大学) ; Zhongguancun Academy(中关村学院) ; Nanjing University(南京大学) ; Nankai University(南开大学)
AI总结 本文质疑多模态研究中语言推理能弥补视觉缺陷的假设,提出“感知-推理”范式导致视觉推理退化为文本空间推理,并通过图灵眼测试验证文本推理无法修复感知失败,主张转向感知内的推理。