arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-08-12 至 2026-08-12 共收录 7
2608.10932 2026-08-12 cs.CV cs.AI 新提交

Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation

基于几何知识蒸馏的时序锚定组合式相机运动理解

Dazhao Du, Shiyan Du, Jian Liu, Yongjian Yu, Bohai Gu, Tao Han, Hualuo Liu, Eric Liu, Yujia Zhang, Xi Chen, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tencent(腾讯)

AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10756 2026-08-12 cs.RO cs.CV 新提交

Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting

基于语义三维高斯溅射的开放词汇移动操作具身多模态定位

Huosen Ou, Dongni Song, Yuncong Wang, Tao Zhou, Yiding Ji

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Midea Group(美的集团) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文针对家庭场景开放词汇移动操作的目标定位问题,提出整合Semantic-3DGS的具身多模态框架,经50次真实机器人试验,在长 horizon、杂乱场景等任务中优于PointVLA等基线方法,提升了操作鲁棒性。

Comments 9 pages, 11 figures. Accepted to ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10628 2026-08-12 cs.CV cs.CL cs.LG 新提交

InSight-doc: Agentic Visual Perception for Long-Document Understanding

InSight-doc:面向长文档理解的智能体视觉感知框架

Kaican Li, Weiyan Xie, Lewei Yao, Jiannan Wu, Lanqing Hong, Yongxiang Huang, Nevin L. Zhang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

AI总结 本研究提出智能体视觉感知框架InSight-doc,通过自适应选择放大高分辨率区域处理长文档,经SFT+RL训练后在文档VQA任务中显著提升准确率、降低幻觉与推理延迟,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10426 2026-08-12 cs.CV 新提交

GeoSeg-OV: Bridging Geospatial Gaps with Structural Guidance for Open-Vocabulary Remote Sensing Segmentation

GeoSeg-OV:利用结构引导弥合地理空间差距的开放词汇遥感分割方法

Ruizhong Liu, Tingzhang Luo, Zaiyan Zhang, Jundong Chen, Hongruixuan Chen, Shaoguang Huang, Hongyan Zhang

机构 * School of Computer Science, China University of Geosciences(中国地质大学计算机学院) Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)系统中心) Department of Computer Science, City University of Hong Kong(香港城市大学计算机系) School of Geodesy and Geomatics, Wuhan University(武汉大学测绘学院) Data Science and AI Innovation Research Promotion Center, Shiga University(滋贺大学数据科学与人工智能创新研究促进中心)

AI总结 本文提出GeoSeg-OV,通过解耦辅助VFM特征与视觉-文本匹配,将其用作结构引导,结合SGA与CAD模块,在HRLC基准上优于当前最优方法,且具备跨域零样本泛化能力。

Comments Code and benchmark: https://github.com/zzaiyan/GeoSeg-OV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10384 2026-08-12 cs.LG 新提交

Generator-Guided Inverse Sampling for Lévy-Driven Generative Models

用于Lévy驱动生成模型的生成器引导逆采样

Tianfu Qi, Jun Wang, Jun Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文针对Lévy驱动生成模型的非局域反向过程挑战,提出生成器引导的结构化逆采样器,将动力学分解为三类分量,结合神经网络与解析分布实现高效采样,在OFDM-SISO信道估计中表现出稳健性能与良好权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10299 2026-08-12 cs.CL 新提交

Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design

智能体系统中的协同进化:迈向超越人类设计的自主进化

Qing Zong, Jiayu Liu, Junhao Shen, Zecong Tang, Linsi Wu, Yuxuan Liu, Rui Wang, Zhaowei Wang, Weiqi Wang, Cheng Qian, Xiusi Chen, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本综述聚焦智能体系统的协同进化,提出三阶段分类法梳理其发展,探讨相关开放挑战,为构建超越人类设计路径的自主智能体系统提供统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏