arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Southern California(南加州大学)

2026-04-16 至 2026-04-16 共收录 3
2604.08791 2026-04-16 cs.NI cs.AI

eBandit: Kernel-Driven Reinforcement Learning for Adaptive Video Streaming

eBandit:基于内核的强化学习用于自适应视频流

Mahdi Alizadeh

机构 * University of Southern California(南加州大学)

AI总结 eBandit通过将网络监控和ABR算法选择移至Linux内核,利用eBPF实现更高效的自适应视频流传输,实验证明其在异构移动环境下能显著提升QoE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09541 2026-04-16 cs.CL cs.AI

SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models

SPG:用于遮蔽扩散语言模型的夹心策略梯度

Chenyu Wang, Paria Rashidinejad, DiJia Su, Song Jiang, Sid Wang, Siyan Zhao, Cai Zhou, Shannon Zejiang Shen, Feiyu Chen, Tommi Jaakkola, Yuandong Tian, Bo Liu

机构 * Meta Superintelligence Labs(Meta超智能实验室) MIT(麻省理工学院) USC(南加州大学) UCLA(加州大学洛杉矶分校)

AI总结 本文提出SPG策略梯度方法,通过同时利用真实对数似然的上下界,解决扩散大语言模型在强化学习中对齐人类偏好或任务奖励的难题,实验显示其在多个任务中表现优异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19054 2026-04-16 cs.LG

RANDPOL: Parameter-Efficient End-to-End Quadruped Locomotion via Randomized Policy Learning

RANDPOL: 通过随机策略学习实现参数高效的端到端四足运动

Zhuochen Liu, Rahul Jain, Quan Nguyen

机构 * Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California(明希德电气与计算机工程系,南加州大学) Department of Aerospace & Mechanical Engineering, University of Southern California(航空航天与机械工程系,南加州大学)

AI总结 本文提出RANDPOL,一种通过随机初始化隐藏层实现参数高效端到端四足运动控制的方法,相比PPO在参数量、计算效率和性能-复杂度平衡上表现更优。

Comments 6 pages main, 7 pages total, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏