eBandit: Kernel-Driven Reinforcement Learning for Adaptive Video Streaming
eBandit:基于内核的强化学习用于自适应视频流
机构 * University of Southern California(南加州大学)
AI总结 eBandit通过将网络监控和ABR算法选择移至Linux内核,利用eBPF实现更高效的自适应视频流传输,实验证明其在异构移动环境下能显著提升QoE。
高校专区
eBandit:基于内核的强化学习用于自适应视频流
机构 * University of Southern California(南加州大学)
AI总结 eBandit通过将网络监控和ABR算法选择移至Linux内核,利用eBPF实现更高效的自适应视频流传输,实验证明其在异构移动环境下能显著提升QoE。
SPG:用于遮蔽扩散语言模型的夹心策略梯度
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; MIT(麻省理工学院) ; USC(南加州大学) ; UCLA(加州大学洛杉矶分校)
AI总结 本文提出SPG策略梯度方法,通过同时利用真实对数似然的上下界,解决扩散大语言模型在强化学习中对齐人类偏好或任务奖励的难题,实验显示其在多个任务中表现优异。
Comments ICLR 2026
RANDPOL: 通过随机策略学习实现参数高效的端到端四足运动
机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(明希德电气与计算机工程系,南加州大学) ; Department of Aerospace & Mechanical Engineering, University of Southern California(航空航天与机械工程系,南加州大学)
AI总结 本文提出RANDPOL,一种通过随机初始化隐藏层实现参数高效端到端四足运动控制的方法,相比PPO在参数量、计算效率和性能-复杂度平衡上表现更优。
Comments 6 pages main, 7 pages total, 10 figures