arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-04-06 至 2026-04-06 共收录 3
2510.06649 2026-04-06 cs.LG cs.AI

Local Reinforcement Learning with Action-Conditioned Root Mean Squared Q-Functions

局部强化学习与基于动作的均方Q函数

Frank Wu, Mengye Ren

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

AI总结 本文提出基于动作的均方Q函数,通过时间差分学习实现局部强化学习,优于现有无反向传播方法,在MinAtar和DeepMind控制套件中表现优异。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22264 2026-04-06 cs.CV cs.AI

SmartCLIP: Modular Vision-language Alignment with Identification Guarantees

SmartCLIP: 基于识别保证的模块化视觉-语言对齐

Shaoan Xie, Lingjing Kong, Yujia Zheng, Yu Yao, Zeyu Tang, Eric P. Xing, Guangyi Chen, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The University of Sydney(悉尼大学)

AI总结 本文提出SmartCLIP,通过理论条件实现文本与视觉表征的灵活对齐,确保语义信息完整保留并解耦视觉表征,提升多任务性能。

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13995 2026-04-06 cs.CL cs.AI cs.CY

ELEPHANT: Measuring and understanding social sycophancy in LLMs

ELEPHANT:测量和理解LLMs中的社交阿谀

Myra Cheng, Sunny Yu, Cinoo Lee, Pranav Khadpe, Lujain Ibrahim, Dan Jurafsky

机构 * Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学)

AI总结 研究通过ELEPHANT基准测量LLMs中的社交阿谀行为,发现模型在保持用户形象方面比人类更极端,且在道德冲突中倾向于支持用户立场。

详情

展开后加载摘要…

URL PDF HTML 收藏