arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The University of Hong Kong(香港大学)

2026-02-24 至 2026-02-24 共收录 6
2602.20057 2026-02-24 cs.RO cs.AI

AdaWorldPolicy: World-Model-Driven Diffusion Policy with Online Adaptive Learning for Robotic Manipulation

AdaWorldPolicy:基于世界模型的扩散策略与在线自适应学习的机器人操控

Ge Yuan, Qiyuan Qiao, Jing Zhang, Dong Xu

机构 * The University of Hong Kong(香港大学) Beihang University(北航大学)

AI总结 AdaWorldPolicy通过结合世界模型和在线自适应学习,实现机器人操控的高效动态适应。

Comments Homepage: https://AdaWorldPolicy.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20003 2026-02-24 cs.LG cs.AI

A Secure and Private Distributed Bayesian Federated Learning Design

一种安全且私密的分布式贝叶斯联邦学习设计

Nuocheng Yang, Sihua Wang, Zhaohui Yang, Mingzhe Chen, Changchuan Yin, Kaibin Huang

机构 * Beijing Laboratory of Advanced Information Network(北京先进信息网络实验室) Beijing Key Laboratory of Network System Architecture and Convergence(北京网络系统架构与融合重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学) College of Information Science and Electronic Engineering(信息科学与电子工程学院) University of Miami(迈阿密大学) The University of Hong Kong(香港大学)

AI总结 本文提出了一种结合拜占庭鲁棒性、隐私保护和收敛加速的分布式贝叶斯联邦学习框架,通过图神经网络强化学习算法实现设备自主连接决策,提升了系统鲁棒性和效率。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19895 2026-02-24 cs.LG cs.CL

DSDR: Dual-Scale Diversity Regularization for Exploration in LLM Reasoning

DSDR:双尺度多样性正则化用于LLM推理中的探索

Zhongwei Wan, Yun Shen, Zhihao Dou, Donghao Zhou, Yu Zhang, Xin Wang, Hui Shen, Jing Xiong, Chaofan Tao, Zixuan Zhong, Peizhou Huang, Mi Zhang

机构 * The Ohio State University, USA(俄亥俄州立大学) Case Western Reserve University, USA(凯斯西储大学) The Chinese University of Hong Kong, Hong Kong(香港中文大学) Macquarie University, Australia(麦考瑞大学) University of Michigan, USA(密歇根大学) The University of Hong Kong, Hong Kong(香港大学) University College London, UK(伦敦大学学院)

AI总结 DSDR通过双尺度多样性正则化提升LLM推理中的探索能力,通过全局和局部正则化机制增强路径多样性,提高学习信号稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19372 2026-02-24 cs.RO cs.CV cs.LG

Seeing Farther and Smarter: Value-Guided Multi-Path Reflection for VLM Policy Optimization

看得更远且更聪明:基于价值引导的多路径反射用于VLM策略优化

Yanting Yang, Shenyuan Gao, Qingwen Bu, Li Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

AI总结 本研究提出了一种基于价值引导的多路径反射方法,用于提升VLM在机器人操作任务中的策略优化性能,通过解耦状态评估与动作生成,提高决策鲁棒性并减少推理时间。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18467 2026-02-24 cs.AI cs.LG

OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents

OffSeeker:在线强化学习并非构建深度研究代理的全部需求

Yuhang Zhou, Kai Zheng, Qiguang Chen, Mengkang Hu, Qingfeng Sun, Can Xu, Jingjing Chen

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯文言) The University of Hong Kong(香港大学)

AI总结 本文提出OffSeeker,通过离线训练和任务合成框架,无需在线强化学习即可构建高效深度研究代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18920 2026-02-24 cs.CL cs.AI

DeepInnovator: Triggering the Innovative Capabilities of LLMs

DeepInnovator: 激发大语言模型的创新能力

Tianyu Fan, Fengji Zhang, Yuxiang Zheng, Bei Chen, Xinyao Niu, Chengen Huang, Junyang Lin, Chao Huang

机构 * The University of Hong Kong(香港大学) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 DeepInnovator通过自动化数据提取和猜想与反驳训练范式,提升大语言模型的创新能力,实现显著优于基线的创新想法生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏