Freeform Preference Learning for Robotic Manipulation
自由形式偏好学习用于机器人操作
机构 * Stanford University(斯坦福大学)
AI总结 提出自由形式偏好学习(FPL),通过自然语言定义偏好轴并学习语言条件奖励模型,在长时域操作任务中比稀疏奖励和二元偏好方法提升38个百分点,支持行为组合与测试时策略引导。
高校专区
自由形式偏好学习用于机器人操作
机构 * Stanford University(斯坦福大学)
AI总结 提出自由形式偏好学习(FPL),通过自然语言定义偏好轴并学习语言条件奖励模型,在长时域操作任务中比稀疏奖励和二元偏好方法提升38个百分点,支持行为组合与测试时策略引导。
BioInsight: 面向交互式生物医学知识发现的多智能体编排
机构 * Peking University(北京大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Pennsylvania(宾夕法尼亚大学) ; Purdue University(普渡大学) ; Stanford University(斯坦福大学)
AI总结 提出多智能体系统BioInsight,通过交互式界面生成替代静态报告,实现疾病证据的组织、推理与可视化,在多项生物医学任务中取得最优性能。
Comments Update some experiments and contents
随机薛定谔扩散模型用于纯态集合生成
机构 * RIKEN iTHEMS ; RIKEN AIP ; South China University of Technology(华南理工大学) ; Stanford University(斯坦福大学) ; Columbia University(哥伦比亚大学)
AI总结 本文提出随机薛定谔扩散模型(SSDMs),在复射影空间CP^{d-1}上构建基于分数的生成框架,通过局部欧几里得奥本海姆-乌尔申贝格近似实现无解析过渡密度的训练,提升量子机器学习的泛化能力。
反向翻译增强的直接偏好优化用于神经机器翻译
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
AI总结 提出基于直接偏好优化的强化学习后训练框架,利用通用文本语料和专家反馈纠正神经机器翻译错误,在英德翻译任务上将COMET分数从0.703提升至0.747。
Comments 5 pages, 2 figures
用于语言模型预训练的课程引导层缩放
机构 * Stanford University(斯坦福大学)
AI总结 受人类认知发展启发,提出课程引导层缩放框架,通过渐进式层堆叠使数据难度与模型增长同步,在不同参数规模预训练并分层数据,提升模型泛化及零样本性能。
Comments Accepted to ICML 2026. Code available at https://github.com/su-karanps/cgls
重新思考推理时缩放:效率极限与语言信号
机构 * Duke University(杜克大学) ; Together AI ; University of Chicago(芝加哥大学) ; Stanford University(斯坦福大学)
AI总结 本研究分析推理时缩放的效率极限,发现非推理模型存在无法突破的推理底线,多数投票优于复杂框架,还识别出正确性的语言信号,为高效推理智能体提供了新路径。
Comments update figures, writings