arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 132
2510.22126 2026-06-23 cs.RO 版本更新

EasyUUV: An LLM-Enhanced Universal and Lightweight Sim-to-Real Reinforcement Learning Framework for UUV Attitude Control

EasyUUV:一种用于UUV姿态控制的LLM增强通用轻量级仿真到现实强化学习框架

Guanwen Xie, Jingzehua Xu, Jiwei Tang, Yubo Huang, Zixi Wang, Shuai Zhang, Dongfang Ma, Juntian Qu, Xiaofan Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Mechanical Engineering, The University of Hong Kong(香港大学机械工程系) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) School of Civil Engineering, Southwest Jiaotong University(西南交通大学土木工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) Ocean College, Zhejiang University(浙江大学海洋学院)

AI总结 提出EasyUUV框架,结合并行强化学习与混合控制架构,并集成多模态大语言模型自适应调整参数,实现UUV姿态控制的鲁棒性和泛化性,经仿真与实船验证。

Comments 12 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03719 2026-06-23 cs.IT cs.AI cs.LG math.IT 版本更新

Over-the-Air Federated Learning: Rethinking Edge AI Through Signal Processing

空中联邦学习:通过信号处理重新思考边缘AI

Seyed Mohammad Azimi-Abarghouyi, Carlo Fischione, Kaibin Huang

机构 * School of Electrical Engineering and Computer Science, KTH Royal Institute of Technology(皇家理工学院电气工程与计算机科学学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系)

AI总结 本文从信号处理角度综述空中联邦学习(AirFL),将其分为三类(CSIT感知、盲、加权),并分析其假设、性能折衷、复杂度和部署限制,为无线边缘AI系统提供设计指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05098 2026-06-23 cs.CR cs.AI 版本更新

TIF: Learning Temporal Invariance in Android Malware Detectors

TIF:学习安卓恶意软件检测器的时间不变性

Xinran Zheng, Shuo Yang, Edith C. H. Ngai, Suman Jana, Lorenzo Cavallaro

机构 * University College London(伦敦大学学院) The University of Hong Kong(香港大学) Columbia University(哥伦比亚大学)

AI总结 针对恶意软件变种和新家族导致的分布漂移,提出时间不变训练框架TIF,通过多代理对比学习和不变梯度对齐学习稳定表征,提升检测器时间鲁棒性。

Comments Manuscript has been accepted by IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13514 2026-06-23 cs.CL cs.AI 版本更新

ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs

ProMed:基于Shapley信息增益引导的强化学习用于主动式医疗大语言模型

Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Xinke Jiang, Jinyang Zhang, Yinghao Zhu, Zheng Li, Liantao Ma, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University, China(软件工程国家工程研究中心,北京大学,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Peking University Information Technology Institute, Tianjin Binhai, China(北京大学信息技术研究所,天津滨海,中国) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

AI总结 提出ProMed框架,通过Shapley信息增益奖励引导强化学习,使医疗大语言模型从被动回答转向主动提问,在部分信息医疗基准上平均提升6.29%。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08048 2026-06-23 cs.CV 版本更新

S^2VG: 3D Stereoscopic and Spatial Video Generation via Denoising Frame Matrix

S^2VG:基于去噪帧矩阵的3D立体与空间视频生成

Peng Dai, Feitong Tan, Qiangeng Xu, Yihua Huang, David Futschik, Ruofei Du, Sean Fanello, Yinda Zhang, Xiaojuan Qi

机构 * Department of Electrical and Electronic Engineering at The University of Hong Kong(香港大学电子与电气工程系) Google(谷歌)

AI总结 提出一种无需姿态和训练的方法,利用现成单目视频生成模型,通过深度图扭曲和帧矩阵修复框架,生成时空一致的3D立体与空间视频。

Comments immersive video generation, 4D scene, spatial video, stereo video

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14792 2026-06-23 cs.CY cs.AI cs.CL 版本更新

Measuring Human Contribution in AI-Assisted Content Generation

衡量AI辅助内容生成中的人类贡献

Yueqi Xie, Tao Qi, Jingwei Yi, Xiyuan Yang, Ryan Whalen, Junming Huang, Qian Ding, Yu Xie, Xing Xie, Fangzhao Wu

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Hong Kong(香港大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学)

AI总结 针对AI辅助内容生成中人类贡献度难以量化的问题,提出基于信息论的框架,通过互信息与自信息之比计算人类信息贡献比例,实验证明能有效区分不同创意领域的人类贡献程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20034 2026-06-23 cs.CV 版本更新

Maintain Plasticity in Long-timescale Continual Test-time Adaptation

长时间尺度连续测试时自适应中的可塑性保持

Yanshuo Wang, Xuesong Li, Jinguang Tong, Jie Hong, Jun Lan, Weiqiang Wang, Huijia Zhu, Haoxing Chen

机构 * Australian National University(澳大利亚国立大学) Tiansuan Lab, Ant Group(蚂蚁集团天算实验室) Data61-CSIRO The University of Hong Kong(香港大学)

AI总结 针对连续测试时域自适应中模型可塑性随时间下降的问题,提出基于标签翻转变化的自适应收缩-恢复策略,通过自适应间隔权重重初始化保持可塑性,在多个基准上取得优异性能。

Comments Newest version at arXiv:2602.06328

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07821 2026-06-19 cs.CV cs.AI 版本更新

Mitigating Simplicity Bias in OOD Detection through Object Co-occurrence Analysis

通过对象共现分析缓解OOD检测中的简单性偏差

Boyang Dai, Chaoqi Chen, Yizhou Yu

机构 * The University of Hong Kong(香港大学) Shenzhen University(深圳大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出基于对象共现的OOD检测框架,通过解耦表示和分治策略区分近OOD,缓解简单性偏差,在多种设置下取得竞争结果。

Comments This paper has been accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01139 2026-06-18 cs.AI 版本更新

SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision

SkillRevise: 通过轨迹条件技能修订改进LLM撰写的智能体技能

Yuxuan Liu, Zhaochen Su, Lingyun Xie, Yuhao Zhang, Qing Zong, Jiahe Guo, Zhongwei Xie, Yiyan Ji, Yauwai Yim, Hongyu Luo, Xiyu Ren, Ruan Chenyu, Haoran Li, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Harbin Institute of Technology(哈尔滨工业大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Nanjing University(南京大学) The University of Hong Kong(香港大学)

AI总结 提出SkillRevise框架,通过执行证据诊断、修复原则检索和执行锚定编辑,迭代优化初始技能,在SkillsBench上将基础智能体成功率从36.05%提升至61.63%,并展现跨模型迁移性。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12567 2026-06-18 cs.CV cs.AI 版本更新

Pyramid Self-Contrastive Learning for Single-shot Test-time Ultrasound Image Denoising

金字塔自对比学习框架用于测试时超声图像去噪

Jiajing Zhang, Bingze Dai, Xi Zhang, Yue Xu, Wei-Ning Lee

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) Department of Biomedical Engineering, Duke University(达特茅斯大学生物医学工程系)

AI总结 本文提出一种纯测试时训练框架,用于单次超声图像去噪,应用于合成孔径超声,通过自对比学习分离解剖相似性和噪声随机性,提升去噪效果和结构细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19591 2026-06-18 cs.LG cs.AI 版本更新

Detecting High-Potential SMEs with Heterogeneous Graph Neural Networks

使用异构图神经网络检测高潜力中小企业

Yijiashun Qi, Hanzhe Guo, Yijiazhen Qi

机构 * University of Michigan(密歇根大学) The University of Hong Kong(香港大学)

AI总结 提出SME-HGT异构图Transformer框架,利用公开数据构建包含公司、研究主题和政府机构的异构图,预测SBIR第一阶段获奖者能否进入第二阶段,AUPRC达0.621,优于基线模型。

Comments accepted by (ICIIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08038 2026-06-18 cs.LG cs.AI cs.CV 版本更新

Generalized Kullback-Leibler Divergence Loss

广义Kullback-Leibler散度损失

Jiequan Cui, Beier Zhu, Qingshan Xu, Zhuotao Tian, Xiaojuan Qi, Bei Yu, Hanwang Zhang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 本文提出广义KL散度损失,通过解耦KL损失为加权MSE和交叉熵损失,并引入非对称优化修正和类别全局信息,在对抗训练和知识蒸馏中取得SOTA性能。

Comments TPAMI 2026, extension of our NeurIPS paper "Decoupled Kullback-Leibler Divergence Loss". arXiv admin note: substantial text overlap with arXiv:2305.13948

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22748 2026-06-17 cs.AI 版本更新

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

代理世界建模:基础、能力、定律及更远

Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang, Senqiao Yang, Wei Huang, Yeying Jin, Zhefan Rao, Jinhui Ye, Xinyu Lin, Xichen Zhang, Qisheng Hu, Shuai Yang, Leyang Shen, Wei Chow, Yifei Dong, Fengyi Wu, Quanyu Long, Bin Xia, Shaozuo Yu, Mingkang Zhu, Wenhu Zhang, Jiehui Huang, Haokun Gui, Runyi Li, Chenyu Tang, Dong Huang, Xuhang Chen, Rui Liu, Chengzu Li, Shiyi Du, Xu Huang, Haoxuan Che, Long Chen, Qifeng Chen, Wenya Wang, Wenxuan Zhang, Xiaojuan Qi, Yang Deng, Yanwei Li, Mike Zheng Shou, Zhi-Qi Cheng, See-Kiong Ng, Ziwei Liu, Philip Torr, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Chinese University of Hong Kong(香港中文大学) University of Hong Kong(香港大学) University of Washington(华盛顿大学) University of Tokyo(东京大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院) XGEN Labs(XGEN实验室)

AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02159 2026-06-17 stat.ML cs.LG 版本更新

Instrumental and Proximal Causal Inference with Gaussian Processes

基于高斯过程的工具变量和近端因果推断

Yuqi Zhang, Krikamol Muandet, Dino Sejdinovic, Edwin Fong, Siu Lun Chau

机构 * Department of Statistics and Actuarial Science, University of Hong Kong(香港大学统计与精算科学系) Rational Intelligence Lab, CISPA Helmholtz Center for Information Security(CISPA霍普夫信息安全中心理性智能实验室) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) College of Computing & Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 提出去条件高斯过程框架,用于存在未观测混杂时的因果推断,同时提供可靠的后验不确定性量化,并通过边际似然优化实现模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05163 2026-06-17 cs.CV 版本更新

4DSloMo: 4D Reconstruction for High Speed Scene with Asynchronous Capture

4DSloMo: 基于异步捕获的高速场景4D重建

Yutian Chen, Shi Guo, Tianshuo Yang, Lihe Ding, Xiuyuan Yu, Jinwei Gu, Tianfan Xue

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) NVIDIA

AI总结 提出一种仅使用低帧率相机的高速4D捕获系统,通过异步捕获方案将等效帧率提升至100-200 FPS,并利用视频扩散模型修复稀疏视图伪影,实现高质量高速4D重建。

Comments Webpage: https://openimaginglab.github.io/4DSloMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27284 2026-06-16 cs.RO cs.AI 版本更新

FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies

FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐

Xintong Hu, Xuhong Huang, Jinyu Zhang, Yutong Yao, Yuchong Sun, Qiuyue Wang, Mingsheng Li, Sicheng Xie, Yitao Liu, Junhao Chen, Yixuan Chen, Yingming Zheng, Shuai Bai, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)

AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。

Comments 26 pages, 7 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07099 2026-06-16 cs.CV 版本更新

InfoGeo: Information-Theoretic Object-Centric Learning for Cross-View Generalizable UAV Geo-Localization

InfoGeo: 面向跨视角泛化无人机地理定位的信息论目标中心学习

Hongyang Zhang, Maonan Wang, Ziyao Wang, Hongrui Yin, Man-On Pun

机构 * The University of Hong Kong(香港大学)

AI总结 提出InfoGeo框架,利用信息瓶颈理论通过目标中心结构对齐和跨视图知识约束,增强无人机跨视角地理定位在域偏移下的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19876 2026-06-16 cs.CV 版本更新

Structural Energy Guidance for View-Consistent Text-to-3D Generation

基于结构能量的视图一致文本到3D生成

Qing Zhang, Jinguang Tong, Jing Zhang, Jie Hong, Xuesong Li

机构 * Australian National University(澳大利亚国立大学) CSIRO(澳大利亚国家科学委员会) The University of Hong Kong(香港大学)

AI总结 本文针对基于扩散模型的文本到3D生成中视图不一致问题,提出无需训练的SEGS框架,通过在U-Net特征的PCA子空间中构建结构能量并注入去噪过程,提升多视图一致性,实验表明有效降低Janus率并提升视图一致性评分。

Comments arXiv admin note: substantial text overlap with arXiv:2508.16917

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28185 2026-06-16 cs.CV 版本更新

Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

新时代的视觉生成:从原子映射到智能世界建模的演进

Keming Wu, Zuhao Yang, Kaichen Zhang, Shizun Wang, Haowei Zhu, Sicong Leng, Zhongyu Yang, Qijie Wang, Sudong Wang, Ziting Wang, Zili Wang, Hui Zhang, Haonan Wang, Hang Zhou, Yifan Pu, Xingxuan Li, Fangneng Zhan, Bo Li, Lidong Bing, Yuxin Song, Ziwei Liu, Wenhu Chen, Jingdong Wang, Xinchao Wang, Xiaojuan Qi, Shijian Lu, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) University of Waterloo(滑铁卢大学) StepFun MiroMind Baidu(百度) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LMMs-Lab(LMMs实验室)

AI总结 提出五级分类法(原子生成、条件生成、上下文生成、智能生成、世界建模生成),分析流匹配、统一理解与生成模型等关键技术,并指出现有评估高估感知质量而忽视结构、时序和因果缺陷。

Comments Project Page: https://github.com/EvolvingLMMs-Lab/Evolving-Visual-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01696 2026-06-16 cs.CV cs.AI 版本更新

Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning

跨模态身份映射:通过强化学习最小化模态转换中的信息损失

Haonan Jia, Shichao Dong, Xin Dong, Zenghui Sun, Jin Wang, Jinsong Lan, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团(阿里巴巴)) The University of Hong Kong(香港大学)

AI总结 提出跨模态身份映射(CIM)框架,利用强化学习优化图像描述,通过检索一致性度量信息损失,无需额外标注,显著提升关系推理能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07883 2026-06-16 cs.AI 版本更新

ToolSelf: Unifying Task Execution and Self-Reconfiguration via Tool-Driven Emergent Adaptation

ToolSelf: 通过工具驱动的涌现适应统一任务执行与自我重构

Jingqi Zhou, Sheng Wang, Dezhao Deng, Junwen Lu, Junwei Su, Qintong Li, Jiahui Gao, Hao Wu, Jiyue Jiang, Lingpeng Kong, Dunhong Jin, Chuan Wu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出ToolSelf框架,将配置更新抽象为标准化工具接口,统一任务执行与自我重构,并采用配置感知两阶段训练(CAT)实现涌现适应性,在多种基准测试中平均超越静态配置基线28.8分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04061 2026-06-16 cs.RO cs.CV 版本更新

CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos

CLAP: 从人类视频中学习视觉-语言-动作模型的对比潜在动作预训练

Chubin Zhang, Jianan Wang, Zifeng Gao, Yue Su, Tianru Dai, Cai Zhou, Jiwen Lu, Yansong Tang

机构 * Tsinghua University(清华大学) Astribot University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

AI总结 提出CLAP框架,通过对比学习将人类视频与机器人动作词汇对齐,利用伪标签训练VLA模型,实现从人类视频到机器人执行的有效技能迁移。

Comments The code is available at: https://github.com/LinShan-Bin/OpenCLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02605 2026-06-16 cs.LG 版本更新

Towards CONUS-Wide ML-Augmented Conceptually-Interpretable Modeling of Catchment-Scale Precipitation-Storage-Runoff Dynamics

面向美国本土的机器学习增强概念可解释流域尺度降水-存储-径流动力学建模

Yuan-Heng Wang, Yang Yang, Fabio Ciulla, Hoshin V. Gupta, Charuleka Varadharajan

机构 * Earth and Environmental Science Area, Lawrence Berkeley National Lab(伯克利国家实验室地球与环境科学部) Department of Hydrology and Atmospheric Science, University of Arizona(亚利桑那大学水文学与大气科学系) School for the Environment, University of Massachusetts Boston(马萨诸塞大学波士顿分校环境学院) Department of Civil Engineering, The University of Hong Kong(香港大学土木工程系)

AI总结 本研究利用质量守恒感知机(MCP)构建机器学习增强的物理可解释流域模型,在美国本土多种水文气候条件下评估模型性能,发现基于MCP的模型在性能上与LSTM相当,强调了根据水文过程优势选择合适模型复杂度的重要性。

Comments Main text: 99 pages, 15 figures, 5 tables; Applendix: Section A-E; 2 figures; Supplementary Materials: 22 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11201 2026-06-16 cs.DB cs.AI 版本更新

Bridging the Gap: Enabling Natural Language Queries for NoSQL Databases through Text-to-NoSQL Translation

弥合差距:通过文本到NoSQL翻译实现NoSQL数据库的自然语言查询

Jinwei Lu, Jiawei Lu, Chen Zhang, Zhiqian Qin, Haodi Zhang, Yuanfeng Song, Raymond Chi-Wing Wong

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

AI总结 本文研究Text-to-NoSQL任务,提出TEND基准和SAG求解器,用于将自然语言请求翻译为MongoDB聚合管道,验证了无模式文档推理的独特挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00593 2026-06-15 cs.CV cs.LG 版本更新

Pix2Fact: When Vision Is Not Enough -- Benchmarking Fine-Grained VQA with Web Verification on High-Resolution Real-World Scenes

Pix2Fact: 当视觉不够时——基于网络验证的细粒度VQA基准测试

Yifan Jiang, Cong Zhang, Bofei Zhang, Qiaofeng Zheng, Yifan Yang, Bingzhang Wang, Yew-Soon Ong

机构 * GADE Union (Global AI Data Experts Union)(GADE联盟(全球人工智能数据专家联盟)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Cambridge University(剑桥大学) The University of Hong Kong(香港大学)

AI总结 本文提出Pix2Fact基准测试,通过高分辨率真实场景中的网络验证,评估细粒度视觉问答中的专家级视觉感知和知识搜索能力,发现现有模型在复杂任务中存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03686 2026-06-15 cs.NI cs.AI cs.LG 版本更新

Revisiting Outage for Edge Inference Systems

重新审视边缘推理系统的中断问题

Zhanwei Wang, Qunsong Zeng, Haotian Zheng, Kaibin Huang

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)

AI总结 针对边缘推理系统的端到端可靠性,提出推理中断概率框架,量化推理精度低于阈值的概率,并优化通信开销与推理可靠性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11092 2026-06-12 cs.RO cs.AI 版本更新

RoboNaldo: Accurate, Stable and Powerful Humanoid Soccer Shooting via Motion-Guided Curriculum Reinforcement Learning

RoboNaldo:通过运动引导课程强化学习实现精准、稳定且强力的人形足球射门

Yichao Zhong, Yidan Lu, Yuhang Lu, Tianyang Tang, Haoguang Mai, Yixuan Pan, Tianyu Li, Li Chen, Jingbo Wang, Zhongyu Li, Peng Lu, Hongyang Li

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Archon Robotics

AI总结 提出三阶段运动引导课程强化学习框架RoboNaldo,从单一人踢参考逐步优化射门性能,在仿真中射门误差降低48.6%、速度提升2.96倍,真实机器人上3米外平均射门误差0.73-0.86米,触球后球速达13.10米/秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21531 2026-06-12 stat.ML cs.LG stat.CO 版本更新

Adaptive generative moment matching networks for improved learning of dependence structures

自适应生成矩匹配网络用于改进依赖结构学习

Marius Hofert, Gan Yao

机构 * Department of Statistics and Actuarial Science, The University of Hong Kong(香港大学统计与精算科学系)

AI总结 提出自适应带宽选择的最大均值差异混合核用于生成矩匹配网络,通过增加核数量和早停策略提升训练性能,在copula随机数生成、高维收敛率及金融数据依赖建模中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10040 2026-06-11 cs.RO 版本更新

Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination

Efficient-WAM: 一种具有低成本未来想象能力的10亿参数世界-动作模型

Jiajun Li, Tiecheng Guo, Yifan Ye, Rongyu Zhang, Xiaowei Chi, Qianpu Sun, Ying Li, Yunfan Lou, Yan Huang, Zhihe Lu, Meng Guo, Shanghang Zhang

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Muka Robotics(Muka机器人) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

AI总结 提出Efficient-WAM,通过紧凑视频专家、稀疏视频潜变量和非对称去噪降低未来想象成本,在保持控制性能的同时实现30倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08211 2026-06-11 cs.LG 版本更新

MobileFineTuner: A Mobile-Native Framework for On-Device LLM Fine-Tuning in Real-World Embedded AI Applications

MobileFineTuner:面向真实世界嵌入式AI应用中设备端大语言模型微调的移动原生框架

Jiaxiang Geng, Lunyu Zhao, Yiyi Lu, Bing Luo

机构 * Duke Kunshan University(Duke昆山大学) The University of Hong Kong(香港大学)

AI总结 提出移动原生框架MobileFineTuner,通过C++实现资源感知训练运行时(内存高效注意力、激活检查点等),在商用手机上实现端到端LLM微调,显著降低内存压力并提升可执行性。

Comments 26 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏