arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-04-07 至 2026-04-07 共收录 19
2604.04642 2026-04-07 cs.RO

WaterSplat-SLAM: Photorealistic Monocular SLAM in Underwater Environment

WaterSplat-SLAM:水下环境中的光实单目SLAM

Kangxu Wang, Shaofeng Zou, Chenxing Jiang, Yixiang Dai, Siang Chen, Shaojie Shen, Guijin Wang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Key Laboratory of Marine Robotics, Shenyang(沈阳海洋机器人重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子及计算机工程学系)

AI总结 本文提出WaterSplat-SLAM,通过语义介质过滤和语义引导渲染实现水下高保真密集映射,提升水下单目SLAM的鲁棒性与可视化效果。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04603 2026-04-07 cs.DB cs.AI

Cardinality Estimation for High Dimensional Similarity Queries with Adaptive Bucket Probing

高维相似性查询中卡数估计的自适应桶探针方法

Zhonghan Chen, Qintian Guo, Ruiyuan Zhang, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科技大学) Hong Kong Generative AI Research and Development Center (HKGAI)(香港生成式人工智能研发中心(HKGAI))

AI总结 本文提出一种轻量级框架,利用LSH分区和自适应桶探针技术,结合渐进采样和不对称距离计算,提升高维相似性查询的卡数估计精度和在线效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04573 2026-04-07 cs.ET cs.LG

SAIL: Scene-aware Adaptive Iterative Learning for Long-Tail Trajectory Prediction in Autonomous Vehicles

SAIL:面向场景的自适应迭代学习用于自动驾驶车辆的长尾轨迹预测

Bin Rao, Haicheng Liao, Chengyue Wang, Keqiang Li, Zhenning Li, Hai Yang

机构 * State Key Laboratory of Internet of Things for Smart City and Department of Civil and Environmental Engineering, University of Macau(澳门大学智慧城市物联网国家重点实验室及土木与环境工程系) State Key Laboratory of Internet of Things for Smart City and Department of Computer and Information Science, University of Macau(澳门大学智慧城市物联网国家重点实验室及计算机与信息科学系) Department of Automotive Engineering, Tsinghua University(清华大学汽车工程系) State Key Laboratory of Internet of Things for Smart City and Departments of Civil and Environmental Engineering and Computer and Information Science, University of Macau(澳门大学智慧城市物联网国家重点实验室及土木与环境工程系和计算机与信息科学系) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科技大学土木与环境工程系)

AI总结 本文提出SAIL框架,通过定义和建模轨迹的三个关键属性维度,结合属性引导增强与自适应对比学习策略,提升自动驾驶车辆在长尾场景下的轨迹预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04475 2026-04-07 cs.LG cs.AI

Discrete Prototypical Memories for Federated Time Series Foundation Models

联邦时间序列基础模型的离散原型记忆

Liwei Deng, Qingxiang Liu, Xinhe Niu, Shengchao Chen, Sheng Sun, Yuankai Wu, Guodong Long, Yuxuan Liang

机构 * Australian Artificial Intelligence Institute, University of Technology Sydney(澳大利亚人工智能研究所,悉尼科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shenzhen University(深圳大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Sichuan University(四川大学)

AI总结 本文提出FeDPM框架,通过离散原型记忆解决联邦学习中时间序列数据与文本空间语义不匹配的问题,提升模型泛化能力与效率。

Comments 13 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04383 2026-04-07 cs.AI cs.MA math.OC

Optimizing Service Operations via LLM-Powered Multi-Agent Simulation

通过LLM赋能的多智能体仿真优化服务运营

Yanyuan Wang, Xiaowei Zhang

机构 * Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

AI总结 本文提出基于LLM的多智能体仿真框架,通过建模决策依赖的不确定性,优化服务运营的稳态性能,实验证明其在可持续供应链中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06800 2026-04-07 cs.CL cs.AI cs.HC cs.MA

FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline

FURINA:通过可扩展的多智能体协作流水线实现完全可定制的角色扮演基准

Haotian Wu, Shufan Jiang, Chios Chen, Yiyang Feng, Hehai Lin, Heqing Zou, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Stony Brook University(石溪大学) Nanyang Technological University(南洋理工大学) Datawhale Org.(Datawhale 组织) Independent Researcher(独立研究者)

AI总结 本文提出FURINA-Builder,一种可扩展的多智能体协作流水线,用于构建完全可定制的角色扮演基准。该基准支持多样化的场景和提示格式,通过智能体协作评估任意角色,并发现推理能力提升的同时 hallucinations 增加的新型权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04017 2026-04-07 cs.CL

GeoBrowse: A Geolocation Benchmark for Agentic Tool Use with Expert-Annotated Reasoning Traces

GeoBrowse:一种用于代理工具使用的地理定位基准测试

Xinyu Geng, Yanjing Xiao, Yuyang Zhang, Hanwen Wang, Xinyan Liu, Rui Min, Tianqing Fang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

AI总结 GeoBrowse基准测试结合了视觉推理与知识密集型多跳查询,通过专家标注的逐步轨迹分析验证多步工具使用策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03738 2026-04-07 cs.CV

Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation

重新思考位置嵌入作为多参考和多镜头视频生成的上下文控制器

Binyuan Huang, Yuning Lu, Weinan Jia, Hualiang Wang, Mu Liu, Daiqing Yang

机构 * Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

AI总结 本文提出PoCo方法,通过引入位置嵌入作为额外的上下文控制,解决多参考和多镜头视频生成中参考混淆问题,提升跨镜头一致性和参考保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03660 2026-04-07 cs.AI

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

TableVision:一种大规模基准,用于复杂分层表格上的空间感知推理

Xiaoyu Chen, Lu Dai, Hanqing Wang, Zhuoyu Li, Wenbin Dai, Yanzong Zheng, Zhenggang Xia, Junyong Lin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出TableVision基准,通过量化分析发现复杂表格推理中的感知瓶颈,引入轨迹感知的分层任务分类,结合确定性接地流程生成6799条高保真推理轨迹,提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03592 2026-04-07 cs.CL cs.AI

Unveiling Language Routing Isolation in Multilingual MoE Models for Interpretable Subnetwork Adaptation

揭示多语言MoE模型中的语言路由隔离以实现可解释的子网络适应

Kening Zheng, Wei-Chieh Huang, Jiahao Huo, Zhonghao Li, Henry Peng Zou, Yibo Yan, Xin Zou, Jungang Li, Junzhuo Li, Hanrong Zhang, Xuming Hu, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) HKUST (Guangzhou)(香港科技大学(广州)) University of Maryland(马里兰大学)

AI总结 本文研究了多语言MoE模型中语言路由隔离现象,提出RISE框架通过识别和适应语言特定的专家子网络,提升低资源语言性能并保持其他语言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03590 2026-04-07 cs.CV

SBF: An Effective Representation to Augment Skeleton for Video-based Human Action Recognition

SBF:一种有效的表示方法用于增强基于视频的人体动作识别的骨架

Zhuoxuan Peng, Yiyi Ding, Yang Lin, S. -H. Gary Chan

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出SBF表示方法,通过引入尺度图、人体图和流图来增强骨架信息,提升动作识别精度。

Comments Accepted by ABAW2026 (CVPR Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03462 2026-04-07 cs.CV cs.GR cs.RO

SpectralSplat: Appearance-Disentangled Feed-Forward Gaussian Splatting for Driving Scenes

SpectralSplat:面向驾驶场景的外观-解耦前馈高斯点云法

Quentin Herau, Tianshuo Xu, Depu Meng, Jiezhi Yang, Chensheng Peng, Spencer Sherk, Yihan Hu, Wei Zhan

机构 * Applied Intuition The Hong Kong University of Science and Technology(香港科技大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 SpectralSplat通过前馈高斯点云法解耦场景几何与外观属性,提升驾驶场景的重建质量和可控外观迁移能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03393 2026-04-07 cs.AI

TABQAWORLD: Optimizing Multimodal Reasoning for Multi-Turn Table Question Answering

TABQAWORLD: 优化多模态推理以实现多轮表格问答

Tung Sum Thomas Kwok, Xinyu Wang, Xiaofeng Lin, Peng Lu, Chunhe Wang, Changlun Li, Hanwei Wu, Nan Tang, Elisa Kreiss, Guang Cheng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) SimpleWay

AI总结 TABQAWORLD通过联合优化表格表示与估计,提升多轮表格问答的可靠性与效率,实现4.87%的准确率提升和33.35%的推理延迟降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03299 2026-04-07 cs.CV cs.AI

MoViD: View-Invariant 3D Human Pose Estimation via Motion-View Disentanglement

MoViD:通过运动-视角解耦实现视角不变的3D人体姿态估计

Yejia Liu, Hengle Jiang, Haoxian Liu, Runxi Huang, Xiaomin Ouyang

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

AI总结 本文提出MoViD框架,通过解耦视角信息与运动特征,提升3D人体姿态估计的鲁棒性和效率,实验表明其在九个公开数据集和新收集的多视角无人机及步态分析数据集上,姿态估计误差降低24.2%,在严重遮挡下仅需60%训练数据即可保持性能,且在NVIDIA边缘设备上实现实时推理15FPS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03232 2026-04-07 cs.AI

IC3-Evolve: Proof-/Witness-Gated Offline LLM-Driven Heuristic Evolution for IC3 Hardware Model Checking

IC3-Evolve: 用于IC3硬件模型检查的自动离线LLM驱动启发式进化

Mingkai Miao, Guangyu Hu, Ziyi Yang, Hongce Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

AI总结 IC3-Evolve通过离线LLM提出小范围修正,实现IC3硬件模型检查的自动优化,确保正确性验证下的启发式改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14507 2026-04-07 cs.CV

Expanding mmWave Datasets for Human Pose Estimation with Unlabeled Data and LiDAR Datasets

通过未标记数据和LiDAR数据扩展毫米波数据集用于人体姿态估计

Zhuoxuan Peng, Boan Zhu, Xingjian Zhang, Wenying Li, S. -H. Gary Chan

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出EMDUL方法,利用未标记毫米波数据和LiDAR数据扩展现有数据集,提升人体姿态估计模型的性能和泛化能力,减少15.1%和18.9%的误差。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08392 2026-04-07 cs.RO cs.AI cs.CV

ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs

ST-BiBench:多流多模态协调在双臂具身任务中的基准测试

Xin Wu, Zhixuan Liang, Yue Ma, Mengkang Hu, Zhiyuan Qin, Xiu Li

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) HKUST(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

AI总结 本文提出ST-BiBench框架,用于评估多流多模态协调,揭示MLLMs在高阶策略与精细物理执行间的协调悖论。

Comments 42 pages, 9 figures. Project page:https://stbibench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07469 2026-04-07 cs.CV

VideoCoF: Unified Video Editing with Temporal Reasoner

VideoCoF:基于时间推理的统一视频编辑

Xiangpeng Yang, Ji Xie, Yiyuan Yang, Yue Ma, Yan Huang, Min Xu, Qiang Wu

机构 * University of Technology Sydney(悉尼科技大学) Zhejiang University(浙江大学) HKUST(香港科技大学)

AI总结 VideoCoF通过引入时间推理机制,解决视频编辑中精度与统一性的矛盾,实现无需掩码的精确区域映射和细粒度编辑,验证了方法的高效性与有效性。

Comments Accepted by CVPR 2026, Project Page: https://videocof.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14336 2026-04-07 cs.CV

ArchMap: Arch-Flattening and Knowledge-Guided Vision Language Model for Tooth Counting and Structured Dental Understanding

ArchMap:用于牙齿计数和结构牙科理解的拱形扁平化和知识引导的视觉语言模型

Bohan Zhang, Yiyi Miao, Taoyu Wu, Tong Chen, Ji Jiang, Zhuoxiao Li, Zhe Tang, Limin Yu, Jionglong Su

机构 * Xi'an Jiaotong-Liverpool University(西交利物浦大学) University of Liverpool(利物浦大学) Zhejiang University of Technology(浙江工业大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出ArchMap,一种无需训练的知识引导框架,通过几何归一化和本体引导的多模态推理,提升3D口腔扫描的结构化分析能力,实现牙齿计数、解剖分区、牙列阶段分类及临床状况识别。

Journal ref In Proceedings of the 2025 IEEE International Conference on Big Data (BigData), pp. 7529-7538, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏