arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

2026-07-10 至 2026-07-10 共收录 3
2607.08443 2026-07-10 cs.NI cs.AI 新提交

ADORN: Adaptive Drift handling for Open RAN using Reinforcement Learning

ADORN:使用强化学习的开放式RAN自适应漂移处理

Ashit Kumar Subudhi, Bhargav Chirumamilla, Shubham Vaishnav, Mduduzi C. Hlophe, Praveen Kumar Donta, Andrea Fumagalli, Venkateswarlu Gudepu, Koteswararao Kondepu

机构 * Indian Institute of Technology Dharwad, Karnataka, India(印度理工学院达拉德分校) University of Pretoria, Pretoria, South Africa(南非彼得里亚大学) Johns Hopkins University, USA(约翰霍普金斯大学) Stockholm University, Sweden(斯德哥尔摩大学) Open Networking Advanced Research (OpNeAR) Lab, The University of Texas at Dallas, TX, USA(开放网络高级研究实验室,德克萨斯大学达拉斯分校)

AI总结 针对开放式无线接入网络中因动态流量变化导致的模型性能下降问题,提出基于Q学习的自适应重新训练方法,通过将决策制定为马尔可夫决策过程,结合多专家长短期记忆集成,有效降低重新训练开销并维持系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08098 2026-07-10 cs.CV cs.RO 新提交

EVIS: A Physics-Grounded Event Camera Plugin for NVIDIA Isaac Sim

EVIS:用于NVIDIA Isaac Sim的基于物理的事件相机插件

Linli Shi, Ruijun Zhang, Ziyun Wang

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究针对事件相机数据收集难题,提出基于物理的EVIS插件用于NVIDIA Isaac Sim,能在模拟器内生成带标签事件流,通过特定模型和可配置设置实现实时单GPU生成,其流可供预训练网络用于下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07976 2026-07-10 cs.CL cs.AI cs.LG 新提交

When Implausible Tokens Get Reinforced: Tail-Aware Credit Calibration for LLM Reinforcement Learning

当不合理的令牌得到强化时:大语言模型强化学习的尾部感知信用校准

Xiuyi Lou, Zicheng Xu, Yu-Neng Chuang, Hoang Anh Duy Le, Zhaozhuo Xu, Guanchu Wang, Vladimir Braverman

机构 * Johns Hopkins University(约翰霍普金斯大学) Rice University(里士满大学) Workato(Workato公司) University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

AI总结 研究大语言模型强化学习中统一信用分配的问题,提出尾部感知信用校准方法TACO,通过计算尾部风险分数校准信用,抑制不良正更新,实验证明该方法优于基线,提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏