arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-07-08 至 2026-07-08 共收录 14
2607.06442 2026-07-08 cs.RO 新提交

SIEVE: Structure-Aware Data Selection for Imitation Learning with VLA Models

SIEVE:用于基于VLA模型的模仿学习的结构感知数据选择

Changti Wu, Bin Yu, Zhaolong Shen, Shijie Lian, Xiaopeng Lin, Cong Huang, Zhirui Zhang, Lei Zhang, Kai Chen

机构 * East China Normal University(东华师范大学) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Beihang University(北航大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) DeepCybo Training Demonstrations Policy Execution(深科博培训演示政策执行)

AI总结 研究针对VLA模型模仿学习中数据冗余等问题,提出结构感知数据选择方法SIEVE。该方法将演示视为原语和接口组合,通过发现原语、分配预算和选择轨迹来选数据,实验证明其优于基线,能在少数据少步骤下超越全数据训练。

Comments The code is available at \href{https://github.com/ChangtiWu/SIEVE}{SIEVE}

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06349 2026-07-08 cs.AI 新提交

TopoBrick: Agentic Topology Sampling of Exogenous Variables for Zero-Shot Building IoT Forecasting

TopoBrick:用于零样本建筑物联网预测的外源变量的智能拓扑采样

Xiachong Lin, Du Yin, Arian Prabowo, Hao Xue, Wen Hu, Imran Razzak, Matthew Amos, Sam Behrens, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MBZUAI(穆罕默德·本·扎耶德人工智能大学) CSIRO Energy Centre(联邦科学与工业研究组织能源中心)

AI总结 针对建筑物联网预测中现有方法的不足,提出无训练框架TopoBrick,利用建筑知识图和智能拓扑采样器选择外源变量,按部署时间可用性组织,在三座真实建筑实验中性能出色,拓扑感知采样更可靠。

Comments 12 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06306 2026-07-08 cs.SE cs.AI cs.CV 新提交

UI2App: Benchmarking Visual Interaction Inference in Executable Web Application Generation

UI2App:可执行Web应用程序生成中视觉交互推理的基准测试

Grace Man Chen, Litao Guo, Yifan Wu, Yiyu Chen, Yenchi Tseng, Sicheng Liu, Yuyu Luo, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 研究针对现有网页生成基准测试对交互能力评估不足的问题,引入UI2App基准测试,通过设计端到端管道沿四个维度评估工件,实验发现视觉与交互能力不匹配,复杂交互是瓶颈,为相关研究提供了参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06283 2026-07-08 cs.AI 新提交

Task Decomposition-Guided Reranking for Adaptive Agent Skill Retrieval

用于自适应智能体技能检索的任务分解引导重排序

Yanping Chen, Weijie Shi, Wen Yang, Jiajie Xu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 针对技能库规模增长带来的技能选择挑战,提出SkillReranker框架,通过任务和技能语义分解构建执行图,利用交叉编码器评分,在多场景实验中有效提升任务性能、减少交互步骤并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06222 2026-07-08 cs.RO 新提交

APVI-SLAM: Real-Time Acoustic-Pressure-Visual-Inertial Localization and Photorealistic Mapping System in Complex Underwater Environment

APVI-SLAM:复杂水下环境中的实时声压视觉惯性定位与真实感映射系统

Hanwen Zhang, Yipeng Zhu, Xiaopeng Guo, Huajian Huang, Sai-Kit Yeung

机构 * Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 针对水下视觉惯性SLAM在极端环境中的问题,提出APVI-SLAM系统,通过可靠性感知定位框架和滑动窗口冻结策略增强鲁棒性,用四叉树引导映射模块助力重建,还贡献数据集,实验证明其实现了实时领先的定位与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06097 2026-07-08 cs.CV cs.AI 新提交

PVCap: Towards Accurate 3D Dense Captioning via PseudoCap and VoxelCapNet

PVCap:通过伪字幕和体素字幕网络实现精确的3D密集字幕

Xiaopei Wu, Chenshu Hou, Liang Peng, Dan Xu, Binbin Lin, Xiaoshui Huang, Yuenan Hou, Yu Li, Wenxiao Wang, Haifeng Liu, Deng Cai, Wanli Ouyang

机构 * SH AI Lab(上海人工智能实验室) ZJU(浙江大学) HKUST(香港科技大学) SJTU(上海交通大学)

AI总结 研究针对3D密集字幕任务,提出PVCap方法,由PseudoCap和VoxelCapNet组成。PseudoCap通过随机混合技术增加训练样本,VoxelCapNet利用体素特征改进网络架构。实验表明该方法在两个基准上超越现有技术,提升了3D密集字幕的准确性。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05777 2026-07-08 cs.RO 新提交

Observation Quality Matters: Robust Multi-Fisheye Calibration via Failure-Oriented Analysis

观测质量至关重要:通过面向失败的分析实现鲁棒多鱼眼相机校准

Peize Liu, Zhe Tong, Chen Feng, Shaojie Shen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 研究多鱼眼相机校准难题,通过面向失败分析发现内参初始化是主因,提出CO - Calib框架,结合鲁棒目标检测器和误差分析引导帧选择器,实验表明该框架提升校准成功率、外参精度及校准稳定性。

Comments 9 pages, 7 figures, 6 tables. Code: https://github.com/HKUST-Aerial-Robotics/CO-Calib

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05765 2026-07-08 cs.CV cs.RO 新提交

Image2Sim: Scaling Embodied Navigation via Generative Neural Simulator

Image2Sim:通过生成神经模拟器扩展具身导航

Zihan Wang, Seungjun Lee, Yinghao Xu, Gim Hee Lee

机构 * National University of Singapore(新加坡国立大学) HKUST(香港科技大学)

AI总结 研究针对具身导航缺乏优质交互环境的问题,提出Image2Sim实时神经模拟框架,通过解耦3D空间锚定与观察合成构建环境,能大规模生成相关数据,训练的导航模型在基准测试中有提升且可迁移,为具身导航提供实用训练基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05759 2026-07-08 cs.DS cs.AI cs.DM 新提交

Data-dependent Evaluations for Budgeted Submodular Maximization

带预算约束的次模最大化的数据依赖评估

Lejian Zhang, Xueyan Tang, Jing Tang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(新加坡南洋理工大学计算与数据科学学院) Data Science and Analytics Thrust, The Hong Kong University of Science and Technology (Guangzhou), China(香港理工大学(广州)数据科学与分析方向)

AI总结 针对带背包约束的次模最大化问题,开发新的数据依赖上界,理论证明其优于最优解,通过真实数据集实验验证其在评估解与最优解接近程度上的优势。

Comments Extended version of a paper that will appear in ESA 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20031 2026-07-08 cs.RO cs.AI 新提交

A Neuromorphic Reinforcement Learning Framework for Efficient Pathfinding in Robotic Mobile Fulfillment Systems

一种用于机器人移动履行系统高效路径规划的神经形态强化学习框架

Junzhe Xu, Zecui Zeng, Lusong Li, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) JD Explore Academy(京东探索研究院)

AI总结 提出SDQN-RMFS框架,通过ANN到SNN的转换和硬标签知识蒸馏,在神经形态芯片上实现超低功耗路径规划,相比GPU能耗降低11281倍,延迟减少近一半。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19710 2026-07-08 cs.CV cs.LG cs.RO 版本更新

PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies

面向通用视觉-语言-动作策略的通用姿态预训练

Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu

机构 * Tencent Robotics X(腾讯机器人X) Futian Laboratory(福田实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA

Journal ref Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08760 2026-07-08 cs.LG cs.DC

FedGMI: Generative Model-Driven Federated Learning for Probabilistic Mixture Inference

FedGMI: 生成模型驱动的联邦学习用于概率混合推断

Qijun Hou, Yuchen Shi, Pingyi Fan, Khaled B. Letaief

机构 * Dept. of Electronic Engineering, BNRist, Tsinghua University(电子工程系,BNRist,清华大学) Dept. of Electronic and Computer Engineering, HKUST(电子与计算机工程系,香港科技大学)

AI总结 本文提出FedGMI框架,利用变分自编码器建模客户端数据分布的混合结构,实现结构化个性化联邦学习,提升模型性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04738 2026-07-08 cs.CR cs.LG 版本更新

Fine-Tuning Integrity for Modern Neural Networks: Structured Drift Proofs via Norm, Rank, and Sparsity Certificates

针对现代神经网络的微调完整性:通过范数、秩和稀疏性证书进行结构漂移证明

Zhenhang Shang, Yingzhe Yu, Kani Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Fine-Tuning Integrity作为控制模型演化的安全目标,通过Succinct Model Difference Proofs验证微调模型与可信基础模型的差异仅在政策定义的漂移类别内,提供零知识证明以确保更新的范数、低秩或稀疏性。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏