Agentic Critical Training
代理批判训练
机构 * University of Maryland College Park(马里兰大学学院公园分校)
AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。
Comments Project page: https://attention-is-all-i-need.github.io/ACT/
高校专区
代理批判训练
机构 * University of Maryland College Park(马里兰大学学院公园分校)
AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。
Comments Project page: https://attention-is-all-i-need.github.io/ACT/
具有神经批评者和通用策略参数化的约束马尔可夫决策过程的全局收敛性
机构 * Department of Computer Science University of Maryland College Park(计算机科学系大学马里兰大学学院公园) ; Indian Institute of Technology, Kanpur(印度理工学院坎浦尔) ; Department of Electrical Engineering Indian Institute of Technology, Kanpur(电气工程系印度理工学院坎浦尔) ; Department of Industrial Engineering Purdue University West Lafayette(工业工程系普渡大学威斯康星拉法叶)
AI总结 本文提出了一种基于神经批评者和通用策略参数化的算法,实现了约束马尔可夫决策过程的全局收敛性保障,突破了传统线性批评者方法的限制。
Comments Submitted to UAI 2026
基于成本驱动的线性二次高斯控制表示学习:第二部分
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Maryland, College Park(大学公园大学) ; Technical University Munich(慕尼黑技术大学)
AI总结 本文提出了一种基于成本驱动的线性二次高斯控制表示学习方法,通过隐式学习潜在动态来改进控制器性能。
Comments 38 pages; preliminary version appeared in IEEE CDC 2023; this is the extended journal version, with an end-to-end guarantee added
分布鲁棒自适应课程强化学习
机构 * University of Maryland College Park(马里兰大学学院公园分校) ; Purdue University West Lafayette(普渡大学西拉法叶分校)
AI总结 分布鲁棒自适应课程强化学习通过动态调整鲁棒性预算,平衡性能与鲁棒性,提升在分布偏移下的稳定性与表现。
多领域音频问答基准:面向声音内容推理
机构 * NVIDIA ; University of Maryland, College Park(马里兰大学 College Park 分校) ; University of Science and Technology of China(中国科学技术大学) ; Seoul National University(首尔国立大学) ; Adobe
AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。
Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026
基于成本驱动的线性二次高斯控制的状态表示学习:第一部分
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Maryland, College Park(马里兰大学 College Park 分校) ; Technical University Munich(慕尼黑技术大学)
AI总结 本文提出了一种基于成本驱动的方法,用于学习状态表示以解决线性二次高斯控制问题,并建立了有限样本下的保证。
Comments 51 pages; preliminary version appeared in L4DC 2023; this is the extended journal version, with an end-to-end guarantee added
ViLAM:将视觉-语言推理转化为注意力图用于社交机器人导航
机构 * Dept. of Electrical and Computer Engineering, University of Maryland, College Park, MD, USA(电气与计算机工程系,马里兰大学,College Park, MD, USA) ; Dept. of Computer Science, University of Maryland, College Park, MD, USA(计算机科学系,马里兰大学,College Park, MD, USA) ; James Clark School of Engineering, University of Maryland, College Park, MD, USA(James Clark工程学院,马里兰大学,College Park, MD, USA)
AI总结 ViLAM通过蒸馏视觉-语言模型的注意力图,提升社交机器人导航的社会适应性与导航效率。