On the Proper Treatment of Units in Surprisal Theory
关于在惊奇理论中正确处理单位的探讨
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Copenhagen(哥本哈根大学)
AI总结 本文探讨了在惊奇理论中正确处理语言单位的重要性,提出应明确区分单位定义与预测区域选择,并统一框架处理任意单位库。
Comments ACL 2026 (main conference)
高校专区
关于在惊奇理论中正确处理单位的探讨
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Copenhagen(哥本哈根大学)
AI总结 本文探讨了在惊奇理论中正确处理语言单位的重要性,提出应明确区分单位定义与预测区域选择,并统一框架处理任意单位库。
Comments ACL 2026 (main conference)
通过惩罚正则化实现约束探索的全局最优性
机构 * Florian Wolf: , Ilyas Fatkhullin: , Niao He: 1The Computing \& Mathematical Sciences Department, California Institute of Technology, Pasadena, CA. 2Department of Computer Science, ETH Zurich, Switzerland. 3ETH AI Center, ETH Zurich, Switzerland.
AI总结 本文提出Policy Gradient Penalty方法,通过二次惩罚正则化解决约束下的探索问题,实现全局收敛性和近优策略。
重新审视RaBitQ和TurboQuant:方法、理论和实验的对称比较
机构 * ETH Zurich(苏黎世联邦理工学院) ; Nanyang Technological University(南洋理工大学) ; University of Michigan(密歇根大学) ; Tsinghua University(清华大学) ; HKUST(香港科技大学)
AI总结 本文对比了RaBitQ和TurboQuant在方法、理论和实验证据上的表现,发现TurboQuant在内积估计、最近邻搜索和KV缓存量化任务中表现不如RaBitQ,并指出TurboQuant论文中的一些运行时间和召回率结果无法复现。
有界比率强化学习
机构 * ETH Zurich(苏黎世联邦理工学院) ; MPI for Intelligent Systems(智能系统研究所) ; University of Alberta(阿尔伯塔大学) ; Dartmouth College(达特茅斯学院) ; Balgrist University Hospital(巴尔格里斯特大学医院)
AI总结 本文提出BRRL框架,通过建立正则化约束策略优化问题,推导出分析最优解,并证明其保证性能单调提升。BPO算法通过最小化策略与BRRL最优解之间的优势加权分歧,实现稳定性和最终性能优于PPO。
Comments 23 pages, 9 figures; Project page and code available at https://bounded-ratio-rl.github.io/brrl/
对齐感知、推理、建模与交互:物理AI的综述
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Yinwang Intelligent Technology Co., Ltd.(云网智能技术有限公司) ; Peking University and Beijing International Center for Mathematical Research(北京大学和北京国际数学研究中心)
AI总结 本文综述了物理AI,探讨了理论物理推理与应用物理理解的区别,并分析了基于物理的方法如何提升AI在现实世界中的理解能力,推动更安全、可推广的AI系统。