arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

2026-07-10 至 2026-07-10 共收录 3
2607.08768 2026-07-10 cs.CL 新提交

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks

UniClawBench:面向实际任务中主动智能体的通用基准测试

Zhekai Chen, Chengqi Duan, Kaiyue Sun, Bohao Li, Yuqing Wang, Manyuan Zhang, Xihui Liu

机构 * HKU MMLab(香港大学多媒体实验室) Meituan(美团)

AI总结 针对现有基准测试难以评估主动智能体的问题,提出UniClawBench,基于五项基础模型能力设计400个双语现实任务,采用实时评估和闭环评估策略,通过多模型框架对比展示基础模型能力和框架设计对性能的影响,还公开了基准测试和代码。

Comments Project Page: https://uniclawbench.github.io | GitHub Repo: https://github.com/HKU-MMLab/UniClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08751 2026-07-10 cs.RO 新提交

DexVerse: A Modular Benchmark for Multi-Task, Multi-Embodiment Dexterous Manipulation

DexVerse:用于多任务、多实体灵巧操作的模块化基准测试

Yunchao Yao, Zhuxiu Xu, Tianqi Zhang, Zixian Liu, Sikai Li, Zhenyu Wei, Feng Chen, Dihong Huang, Kechang Wan, Chenyang Ma, Shuqi Zhao, Shenghua Gao, Masayoshi Tomizuka, Yi Ma, Mingyu Ding

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) The University of Hong Kong(香港大学) UC Berkeley(加州大学伯克利分校)

AI总结 DexVerse是用于多任务、多实体灵巧操作的模块化基准测试,含100个任务,支持多种机器人手臂和手,可扩展且提供视觉变化等。通过对多种方法的基准测试,揭示任务泛化和视觉运动鲁棒性挑战,为通用灵巧操作提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08303 2026-07-10 cs.LG cs.DS 新提交

Learning $\mathsf{AC}^0$ under Locally Sampleable Graphical Models

在局部可采样图形模型下学习 $\mathsf{AC}^0$

Weiming Feng, Xiongxin Yang, Yixiao Yu, Yiyao Zhang

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Department of Computer Science, University of California, Santa Barbara(计算机科学系,加州大学圣芭芭拉分校) State Key Laboratory for Novel Software Technology, New Cornerstone Science Laboratory, Nanjing University(新型软件技术国家重点实验室,南京大学)

AI总结 研究在允许有效局部采样器的图形模型下学习 $\mathsf{AC}^0$ 的问题,提出通过模拟和截断经典格劳伯动力学建立新的低阶近似的方法,得到拟多项式时间学习者,还能应用于两自旋系统。

详情

展开后加载摘要…

URL PDF HTML 收藏