arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-06-16 至 2026-06-16 共收录 22
2606.17043 2026-06-16 cs.RO cs.LG 新提交

Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

基于层级优势加权的在线RL微调VLA策略从稀疏回合结果

Tongyan Fang, Siyuan Huang, Naiyu Fang, Ganlong Zhao, Zhongjin Luo, Jianbo Liu, Xiaogang Wang, Ying Dong, Hongsheng Li

机构 * ACE Robotics Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出层级优势加权行为克隆(HABC),通过分离生存性和效率目标并自适应平衡,解决稀疏二元结果下VLA策略在线微调中的信用分配问题,在三个双臂接触任务上将成功率从12-44%提升至38-92%。

Comments Website: https://acerobotics-vla.github.io/HABC-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17022 2026-06-16 math.ST cs.LG stat.ML stat.TH 新提交

Learning the Geometry of Data: A Mathematical Review of Shape Space Analysis

学习数据的几何:形状空间分析的数学综述

Gary P. T. Choi, Khanh Dao Duc, Shira Faigenbaum-Golovin, Karen Habermann, Emmanuel Hartman, Christoph von Tycowicz, Chi Zhang, Wenjun Zhao, Felix Zhou

机构 * Department of Mathematics, The Chinese University of Hong Kong(数学系,香港中文大学) Department of Mathematics, University of British Columbia(数学系,不列颠哥伦比亚大学) Department of Mathematics, Bar-Ilan University(数学系,巴伊兰大学) Department of Statistics, University of Warwick(统计系,沃里克大学) Department of Mathematics, University of Houston(数学系,休斯顿大学) Zuse Institute Berlin(柏林Zuse研究所) Department of Biomedical Sciences, Texas A&M University(生物医学科学系,德克萨斯A&M大学) Department of Mathematics, Wake Forest University(数学系,威克森林大学) Lyda Hill Department of Bioinformatics, University of Texas Southwestern Medical Center(Lyda Hill生物信息学系,德克萨斯西南医学中心)

AI总结 本文综述形状空间分析,利用微分几何、统计学和机器学习构建从形状表示到几何感知学习的分析流程,用于表征几何数据中的非线性结构。

Comments 79 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17011 2026-06-16 cs.RO cs.LG 新提交

ROVE: Unlocking Human Interventions for Humanoid Manipulation via Reinforcement Learning

ROVE: 通过强化学习解锁人类干预用于人形机器人操作

Wei Xiao, Weiliang Tang, Yuying Ge, Hui Zhou, Yao Mu, Li Zhang, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16817 2026-06-16 cs.CL cs.IR 新提交

Understanding the Behaviors of Environment-aware Information Retrieval

理解环境感知的信息检索行为

Ruifeng Yuan, Chaohao Yuan, David Dai, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao

机构 * Fudan University(复旦大学) Alibaba DAMO Academy(阿里巴巴达摩院) Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 通过强化学习使LLM适应不同检索器的查询策略,发现不同检索器偏好不同查询风格,并提出分支式滚动技术提升训练稳定性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16802 2026-06-16 cs.AI 新提交

LabOSBench: Benchmarking Computer Use Agents for Scientific Instrument Control

LabOSBench: 科学仪器控制的计算机使用智能体基准测试

Anqi Zou, Han Deng, Chengyu Zhang, Junquan Hu, Yu Wang, Yuxiang Xing, Aokai Zhang, Hanling Zhang, Zhaoyang Liu, Ben Fei, Zhihui Wang, Wanli Ouyang

机构 * Shenzhen Loop Area Institute(深圳河套学院) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出LabOSBench基准,基于Web科学仪器模拟器评估多模态GUI智能体在仪器控制中的表现,揭示现有智能体在反馈驱动操作和长流程执行上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16771 2026-06-16 cs.LG 新提交

GD$^2$PO: Mitigating Multi-Reward Conflicts via Group-Dynamic reward-Decoupled Policy Optimization

GD$^2$PO: 通过组动态奖励解耦策略优化缓解多奖励冲突

Haotian Liu, Yihao Liu, Jingwei Ni, Siyuan Huang, Xinpeng Liu, Pengyu Cheng, Jiajun Song, Ruijin Ding, Junfeng Li, Zhechao Yu, Mengyu Zhou, Hongteng Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Renmin University of China(中国人民大学) Peking University(北京大学) ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出GD$^2$PO算法,通过冲突感知过滤机制屏蔽奖励不一致的rollout,并结合查询级重加权,解决多奖励优化中的信号抵消问题,提升RL训练效率。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16769 2026-06-16 cs.AI 新提交

Skill-to-LoRA: From Using Skills to Learning Behaviors for Token-Efficient LLM Agents

Skill-to-LoRA:从使用技能到学习行为以实现令牌高效的LLM智能体

Tianyi Zhang, Zhonghao Qi

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 提出Skill-to-LoRA方法,将技能文本转换为LoRA适配器,替代运行时注入技能文档,在SWE-Skills-Bench上提升通过率并降低令牌成本。

Comments Preprint. 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16546 2026-06-16 eess.AS cs.SD 新提交

Confidence Score Guided Incremental and Speaker Adaptive Pseudo-Labeling for Semi-Supervised Elderly Speech Recognition

置信度评分引导的增量式和说话人自适应伪标注用于半监督老年人语音识别

Chengxi Deng, Xurong Xie, Shujie Hu, Jiajun Deng, Mengzhe Geng, Youjun Chen, Huimeng Wang, Haoning Xu, Guinan Li, Xunying Liu

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Institute of Software, Chinese Academy of Sciences, China(中国科学院软件研究所) National Research Council Canada, Canada(加拿大国家研究理事会)

AI总结 提出一种置信度评分引导的增量式和说话人自适应伪标注方法,通过渐进式高质量伪标签选择和说话人自适应训练,在老年人语音识别中分别降低词错误率1.45%和字符错误率2.27%。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16539 2026-06-16 eess.AS cs.SD 新提交

Decoding while Adapting: Zero-Shot Online Speaker Adaptation via Audio-Textual Prompts for Elderly Speech Recognition

解码与自适应:基于音频-文本提示的零样本在线说话人自适应用于老年人语音识别

Chengxi Deng, Xurong Xie, Shujie Hu, Mengzhe Geng, Tianzi Wang, Youjun Chen, Huimeng Wang, Haoning Xu, Jiajun Deng, Xunying Liu

机构 * The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学) Institute of Software, Chinese Academy of Sciences, China(中国科学院软件研究所) National Research Council Canada, Canada(加拿大国家研究理事会)

AI总结 提出一种基于跨语句音频-文本提示的说话人自适应方法,实现零样本实时适应未见说话人,在老年人语音数据集上显著降低词错误率/字符错误率,并大幅提升实时因子。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16456 2026-06-16 cs.LG cs.AI 新提交

SPRI: SVD-Partitioned Residual Initialization for Data-Constrained MoE Upcycling

SPRI: 基于SVD分解残差初始化的数据受限MoE升级方法

Weiqiao Shan, Ruixiang Mao, Yuang Li, Yuhao Zhang, Yingfeng Luo, Tong Zheng, Chen Xu, Yucheng Qiao, Chunxiang Jin, Yi Yuan, Jingdong Chen, Tong Xiao, Jingbo Zhu

机构 * Northeastern University, China(东北大学) Huawei TSC, China(华为技术有限公司) CUHK-Shenzhen, China(香港中文大学(深圳)) University of Maryland, USA(马里兰大学) Harbin Engineering University, China(哈尔滨工程大学) Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) NiuTrans Research, China(小牛翻译研究中心)

AI总结 提出SPRI方法,利用预训练FFN权重的SVD分解残差初始化MoE专家,结合两阶段训练策略,在数据受限的多语言语音翻译任务中显著提升性能。

Comments 8pages, 12 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16310 2026-06-16 cs.LG cs.CL 新提交

QK-Normed MLA: QK normalization without full key caching

QK归一化MLA:无需完整键缓存的QK归一化

Yizhou Han, Yao Zhao, Jun Zhou, Longfei Li, Ruoyu Sun

机构 * The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团)

AI总结 提出QK归一化与MLA兼容的方法,通过吸收静态权重和动态标量,无需缓存完整键,在400M模型训练中降低损失并提升下游精度,解码延迟增加小于2%。

Comments 13 pages, 5 figures, conference-style manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15872 2026-06-16 cs.CL 新提交

SciOrch: Learning to Orchestrate Expert LLMs for Solving Frontier Multimodal Scientific Reasoning Tasks

SciOrch: 学习编排专家大语言模型以解决前沿多模态科学推理任务

Jingru Guo, Xiangyuan Xue, Lian Zhang, Wanghan Xu, Siki Chen, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * Imperial College London(伦敦帝国学院) The Chinese University of Hong Kong(香港中文大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 提出SciOrch框架,训练轻量级8B模型编排多个前沿大语言模型,通过MCTS和GRPO优化,在科学推理任务上超越最强单模型和多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15749 2026-06-16 cs.CV cs.AI cs.SY eess.SY 新提交

OmniTraffic: A Controllable Generation Pipeline and Benchmark for Spatio-Temporal Traffic Reasoning

OmniTraffic:面向时空交通推理的可控生成流水线与基准

Maonan Wang, Zhengyan Huang, Kemou Jiang, Yuhang Fu, Jiayue Zhu, Yuxin Cai, Xingchen Zou, Qiaosheng Zhang, Yi Yu, Ding Wang, Xi Chen, Ben M. Chen, Yuxuan Liang, Zhiyong Cui, Man On Pun, Yirong Chen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai AI Lab(上海人工智能实验室) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出OmniTraffic,一个基于12个真实路口3D重建的可控生成流水线与基准,通过8M VQA样本和3K人工验证测试集评估11个前沿MLLM,揭示拓扑与时空推理中的显著人机差距,并证明仿真数据微调可提升真实场景性能。

Comments 34 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15702 2026-06-16 math.OC cs.LG 新提交

Schattor: Schatten-family methods for deep learning optimization

Schattor:用于深度学习优化的Schatten族方法

Bohao Ma, Junyu Zhang, Chuan He

机构 * School of Data Science, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)数据科学学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Department of Mathematics, Linköping University(利乌波德大学数学系)

AI总结 提出基于Schatten范数的自适应一阶方法族Schattor,统一SGD与Muon,通过矩阵鞅矩界实现无维数平稳性保证,并开发多块扩展以自适应平衡块优化。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15285 2026-06-16 cs.RO 新提交

Acting While Understanding: Asynchronous Semantic-Action Decoupling for Real-Time Vision-Language-Action Models

理解中行动:面向实时视觉-语言-动作模型的异步语义-动作解耦

Shenhao Yan, Ge Wang, Qi Liu, Weilin Meng, Jiahao Yang, Chengsi Yao, Fan Feng, Xiaoguang Ma, Yiming Zhao, Yatong Han

机构 * Northeastern University(东北大学) Ising AI CUHK-Shenzhen(香港中文大学(深圳))

AI总结 提出异步语义-动作解耦框架,分离VLAs中的语义理解与动作生成,通过低频率语义更新和高频率动作推理实现高频闭环控制,在LIBERO和真实机器人上验证了高达35.6Hz的动作模块吞吐率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15266 2026-06-16 cs.CL 新提交

Evaluating and Preserving Lexical Stress in English-to-Chinese Speech-to-Speech Translation

评估与保留英汉语音翻译中的词汇重音

Yuchen Song, Xi Chen, Mingze Li, Satoshi Nakamura

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Shenzhen Loop Area Institute, China(深圳环域研究所)

AI总结 针对英汉语音翻译中词汇重音跨语言传递不足的问题,构建重音标注数据集和普通话重音检测器,提出跨语言重音评估指标,并微调CosyVoice3构建重音感知S2ST系统,实验表明该系统在重音翻译能力上显著优于现有系统。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15152 2026-06-16 cs.CL 新提交

Can Agents Read the Room? Benchmarking Visual Social Intelligence in Multimodal Simulation

智能体能否读懂房间气氛?多模态模拟中的视觉社交智能基准测试

Shijun Wan, Xuehai Wu, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出AgentViSS基准,通过240个场景和四项角色级任务评估多模态大模型的视觉社交智能,发现局部角色扮演接近饱和而交互调控仍困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14971 2026-06-16 cs.LG cs.AI 新提交

FastMix: Fast Data Mixture Optimization via Gradient Descent

FastMix: 通过梯度下降实现快速数据混合优化

Haoru Tan, Sitong Wu, Yanfeng Chen, Jun Xia, Ruobing Xie, Bin Xia, Xingwu Sun, Xiaojuan Qi

机构 * University of Hong Kong(香港大学) Tencent(腾讯) Chinese University of Hong Kong(香港中文大学)

AI总结 提出FastMix框架,将数据混合选择重新表述为双层优化问题,通过联合优化混合系数和模型参数,实现高效、可扩展的数据混合发现,在预训练和后训练中均优于基线方法且大幅降低搜索成本。

Journal ref ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14832 2026-06-16 cs.CL 新提交

PhoneHarness: Harnessing Phone-Use Agents through Mixed GUI, CLI, and Tool Actions

PhoneHarness: 通过混合GUI、CLI和工具操作利用手机使用代理

Chenxin Li, Zhengyao Fang, Zhengyang Tang, Pengyuan Lyu, Xingran Zhou, Xin Lai, Fei Tang, Liang Wu, Yiduo Guo, Weinong Wang, Junyi Li, Yi Zhang, Yang Ding, Huawen Shen, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯混元) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

AI总结 提出PhoneHarness,一个混合动作基准和执行框架,用于评估手机代理在可验证移动工作流中的表现,通过GUI、CLI和工具动作的组合,达到75.0%通过率,比最强基线高12.9个百分点。

Comments Project Page: https://phoneharness.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14820 2026-06-16 cs.SD cs.AI cs.CL eess.AS 新提交

Spectro-Temporal Interference Confounds Phase Encoding in Spatial Audio Foundation Models

频谱-时间干扰混淆空间音频基础模型中的相位编码

Yuxuan Chen, Haoyuan Yu, Peize He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Jilin University(吉林大学) Hunan University(湖南大学) University of Electronic Science and Technology of China(电子科技大学)

AI总结 提出基于双耳掩蔽级差的心理声学基准,评估空间自监督音频模型对微秒级耳间相位精细结构的编码能力,发现通用双耳SSL模型依赖频谱-时间干扰纹理而非真实相位计算。

Comments Accepted to INTERSPEECH 2026; 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10862 2026-06-16 cs.CV cs.AI 新提交

LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination

LIBERO-Occ:通过视角想象评估和改进场景诱导遮挡下的视觉-语言-动作模型

Taishan Li, Jiwen Zhang, Siyuan Wang, Xuanjing Huang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Chinese University of Hong Kong(香港中文大学)

AI总结 针对VLA模型在场景遮挡下性能下降的问题,提出LIBERO-Occ基准和视角想象方法,通过生成互补视图提升鲁棒性。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09150 2026-06-16 cs.CV 新提交

Ultra Flash: Scaling Real-Time Streaming Video Generation to High Resolutions

Ultra Flash: 将实时流式视频生成扩展到高分辨率

Luxury, Jie Huang, Zihao Fan, Xiaoxiao Ma, Jun-hao Zhuang, Yuming Li, Zeyue Xue, Siming Fu, Haoran Li, Mingchen Zhong, Guohui Zhang, Shichen Ma, Yijun Liu, Jiaqi Shi, Yanwen Ma, Yaofeng Su, Haoyu Wang, Yaowei Li, Songchun Zhang, Weiyang Jin, Yuxuan Bian, Shiyi Zhang, Haojun Xu, Shuai Lu, Xin Han, Wei Tang, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索研究院) USTC(中国科学技术大学) PKU(北京大学) THU(清华大学) BUAA(北京航空航天大学) FDU(复旦大学) HKUST(香港科技大学) HKU(香港大学) CUHK(香港中文大学)

AI总结 提出Ultra Flash级联框架,通过架构保持的超分辨率训练、因果流式潜在上采样器和高分辨率解码器、以及级联优化方案,在单GPU上实现1K分辨率约30 FPS和2K分辨率约18 FPS的实时高分辨率流式视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏