arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Princeton University(普林斯顿大学)

2026-05-04 至 2026-05-04 共收录 5
2605.00347 2026-05-04 cs.LG cs.AI cs.CL

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00080 2026-05-04 cs.RO cs.CV

World Model for Robot Learning: A Comprehensive Survey

机器人学习的世界模型:全面综述

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) The University of Tokyo(东京大学) University of Oxford(牛津大学) Microsoft(微软公司) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27077 2026-05-04 cs.LG cs.AI stat.ML

Learning Rate Transfer in Normalized Transformers

归一化变换器中的学习率转移

Boris Shigida, Boris Hanin, Andrey Gromov

机构 * Meta Superintelligence Labs(Meta超智能实验室) Princeton University(普林斯顿大学)

AI总结 本文提出νGPT模型,通过结合数值实验和对齐指数,改进了超参数转移方法,实现了模型宽度、深度和token horizon上的学习率转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22271 2026-05-04 cs.LG

How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals

大语言模型如何检测并纠正自身错误:内部置信信号的作用

Dharshan Kumaran, Viorica Patraucean, Simon Osindero, Petar Veličković, Nathaniel Daw

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

AI总结 研究通过第二阶置信模型探讨大语言模型如何通过内部置信信号检测并纠正自身错误,发现PANL信号在误差检测和自我修正中起关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10990 2026-05-04 cs.GT cs.LG econ.TH math.ST stat.ML stat.TH

Statistical Impossibility and Possibility of Aligning LLMs with Human Preferences: From Condorcet Paradox to Nash Equilibrium

大语言模型与人类偏好的统计不可能性与可能性:从康德斯悖论到纳什均衡

Kaizhao Liu, Qi Long, Zhekun Shi, Weijie J. Su, Jiancong Xiao

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) Princeton University(普林斯顿大学)

AI总结 本文探讨了对齐大语言模型与人类偏好的统计限制,证明在一般概率偏好模型下,康德斯循环几乎必然存在,从而表明基于奖励的方法无法完全对齐偏好。同时,研究了非奖励方法下LLM采用混合策略的条件,证明在Luce模型下,少数群体偏好得以保留的统计可能性。

Comments Accepted for publication in the Annals of Statistics

详情

展开后加载摘要…

URL PDF HTML 收藏