arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

2026-04-02 至 2026-04-02 共收录 8
2604.00433 2026-04-02 cs.MA cs.LG

Internal State-Based Policy Gradient Methods for Partially Observable Markov Potential Games

基于内部状态的策略梯度方法用于部分可观测马尔可夫势博弈

Wonseok Yang, Thinh T. Doan

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出基于内部状态的策略梯度方法,用于解决部分可观测马尔可夫势博弈中的多智能体强化学习问题,通过压缩累积信息以保证可扩展性,并建立非渐近收敛界。

Comments 6 pages, 2 figures. Submitted to IEEE Control Systems Letters (L-CSS) with CDC option

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00396 2026-04-02 cs.CV

VLM-in-the-Loop: A Plug-In Quality Assurance Module for ECG Digitization Pipelines

VLM-in-the-Loop:一种用于心电图数字化流程的插件质量保证模块

Jiachen Li, Shihao Li, Soovadeep Bakshi, Wei Li, Dongmei Chen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出VLM-in-the-Loop模块,通过闭环VLM反馈提升心电图数字化流程质量,显著提高判定一致性与保真度,适用于多种后端系统,实现高质量心电图数字化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00391 2026-04-02 cs.RO cs.SY eess.SY

Behavioral Score Diffusion: Model-Free Trajectory Planning via Kernel-Based Score Estimation from Data

行为得分扩散:通过核基得分估计实现无模型轨迹规划

Shihao Li, Jiachen Li, Jiamin Xu, Dongmei Chen

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出行为得分扩散(BSD),通过核加权估计直接从轨迹数据中计算扩散得分函数,无需学习模型或动力学模型,在停车场景中实现高效轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00385 2026-04-02 cs.LG

GUIDE: Reinforcement Learning for Behavioral Action Support in Type 1 Diabetes

GUIDE:用于1型糖尿病行为动作支持的强化学习

Saman Khamesian, Sri Harini Balaji, Di Yang Shi, Stephanie M. Carpenter, Daniel E. Rivera, W. Bradley Knox, Peter Stone, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) School for Engineering of Matter Transport and Energy, Arizona State University(亚利桑那州立大学物质传输与能源工程学院) Institute for Foundation of Machine Learning, The University of Texas at Austin(德克萨斯大学奥斯汀分校机器学习基础研究所) Sony AI(索尼人工智能)

AI总结 GUIDE通过强化学习框架为1型糖尿病患者提供行为建议,结合实时血糖数据和离线在线算法,提升血糖控制效果,实现85.49%的时间在目标范围内。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00213 2026-04-02 cs.RO math.OC

A Player Selection Network for Scalable Game-Theoretic Prediction and Planning

一种用于可扩展博弈论预测与规划的玩家选择网络

Tianyu Qiu, Eric Ouano, Fernando Palafox, Christian Ellis, David Fridovich-Keil

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出PSN Game框架,通过学习玩家选择网络减少博弈规模,提升预测准确性和规划安全性,同时利用目标推断网络处理信息不完全场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01114 2026-04-02 cs.LG

Dense Dynamics-Aware Reward Synthesis: Integrating Prior Experience with Demonstrations

密集动态感知奖励合成:整合先验经验与演示

Cevahir Koprulu, Po-han Li, Tianyu Qiu, Ruihan Zhao, Tyler Westenbroek, David Fridovich-Keil, Sandeep Chinchali, Ufuk Topcu

机构 * University of Texas at Austin, USA(德克萨斯大学奥斯汀分校) University of Washington, USA(华盛顿大学)

AI总结 本文提出一种系统化的奖励塑造框架,结合先验数据集和少量专家演示,生成密集动态感知奖励,加速连续控制任务的学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00179 2026-04-02 eess.SY cs.LG cs.SY

Finite-Time Analysis of Projected Two-Time-Scale Stochastic Approximation

投影双时间尺度随机逼近的有限时间分析

Yitao Bai, Thinh T. Doan, Justin Romberg

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Georgia Tech(佐治亚理工学院)

AI总结 本文研究了具有固定步长和Polyak-Ruppert平均的投影线性双时间尺度随机逼近的有限时间收敛性,推导出均方误差界,并将其分解为子空间约束误差和统计误差两部分。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00055 2026-04-02 cs.RO cs.CV cs.LG

Generalizable Dense Reward for Long-Horizon Robotic Tasks

可泛化的密集奖励用于长周期机器人任务

Silong Yong, Stephen Sheng, Carl Qi, Xiaojie Wang, Evan Sheehan, Anurag Shivaprasad, Yaqi Xie, Katia Sycara, Yesh Dattatreya

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon Robotics(亚马逊机器人) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出VLLR框架,结合外部奖励和内部奖励提升长周期机器人任务性能,通过任务分解和自信心引导实现无需人工奖励工程的高效训练。

Comments Project page: https://silongyong.github.io/vllr_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏