arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-06-30 至 2026-06-30 共收录 23
2606.30436 2026-06-30 cs.CV

Robust and Efficient Monocular 3D Gaussian SLAM for Kilometer-Scale Outdoor Scenes

鲁棒且高效的单目3D高斯SLAM用于千米级室外场景

Sicheng Yu, Dongxu Shen, Beizhen Zhao, Guanzhi Ding, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出KiloGS-SLAM系统,通过运动自适应混合跟踪模块和生命周期管理的高斯映射策略,解决千米级室外场景中单目3DGS-SLAM的长期跟踪漂移和内存开销问题,实现高精度跟踪与渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30367 2026-06-30 cs.RO

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav: 面向视觉与语言导航的统一世界-动作建模

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xiaomi EV(小米电动车) National University of Singapore(新加坡国立大学)

AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30332 2026-06-30 cs.CV

UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception

UniGP:驯服扩散Transformer以实现先验保留的统一生成与感知

Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zeekr Automobile R&D Co., Ltd.(小鹏汽车研发有限公司)

AI总结 提出UniGP框架,基于MMDiT通过简单联合训练统一可控生成与密集预测,无需复杂任务设计,保留骨干先验,在多个任务上超越先前统一方法并与专用方法持平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30003 2026-06-30 cs.CV

GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising

GeoEdit: 基于几何感知的双分支去噪对象编辑

Yi He, Jiangming Wang, Xinyu Wang, Mark Fong, Songchun Zhang, Yuxuan Xue, Hai-Tao Zheng, Yue Ma

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学) Peking University(北京大学) HKUST(香港科技大学) University of Tübingen(图宾根大学)

AI总结 提出GeoEdit,一种无需训练的三阶段管道,通过3D解耦、点对应对齐和双分支去噪,实现单张照片中对象的刚性几何变换(平移、旋转、缩放),同时保持背景自然和身份一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29832 2026-06-30 cs.LG

The Forgetting-Retention Dilemma: Certified Unlearning Theory in Continual Learning

遗忘-保留困境:持续学习中的认证遗忘理论

Yiting Hu, Lingjie Duan, Qian Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文建立持续学习与机器遗忘之间的理论桥梁,通过定义后遗忘超额风险揭示保留历史知识与定向遗忘的权衡,并分析梯度法与海森法在遗忘损失和存储开销上的优劣,提出混合策略。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29812 2026-06-30 cs.CV

Consistency as Inductive Bias: Learning Cross-View Invariance for Robust Multimodal Reasoning

一致性作为归纳偏置:学习跨视角不变性以实现鲁棒多模态推理

Xin Zou, Haolin Deng, Yibo Yan, Shuliang Liu, Kening Zheng, Zhiwei Jin, Chen Chen, Haonan Lu, Xuming Hu

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) OPPO AI Center(OPPO人工智能中心) UIC(美国国际大学)

AI总结 提出ConsistRoll方法,通过将原始视图与语义不变变换视图置于同一生成组并联合奖励,将跨视角一致性注入强化学习训练,提升多模态推理鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29794 2026-06-30 cs.CV

UniTriSplat: A Unified 3D Gaussian Splatting Framework with Uniform Spherical Rasterization for Universal Cameras

UniTriSplat:统一球面光栅化的通用相机3D高斯泼溅框架

Yipeng Zhu, Huajian Huang, Tristan Braud, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 针对现有3DGS框架依赖相机特定光栅化导致跨相机模型性能下降的问题,提出UniTriSplat,利用HEALPix离散化在单位球面上统一高斯泼溅,实现从窄视场到全景的一致优化。

Comments 32 pages, 14 figures, 6 tables. Project page: https://yipengzhu0809.github.io/UniTriSplat/ . UniTriSplat was accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29776 2026-06-30 cs.LG cs.AI

Towards Generalizable and Evidential Nuclear Magnetic Resonance-Based Molecular Structure Elucidation via Large Language Model Agent

面向可泛化与可证据的核磁共振分子结构解析:基于大语言模型智能体的方法

Zheng Fang, Chen Yang, Yusen Tan, Yunpeng Zhao, Fanjie Xu, Hongxin Xiang, Hanyu Sun, Hanyu Gao, Xiaojian Wang, Wenjie Du, Yuqiang Li, Jun Xia

机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) State Key Laboratory of Precision and Intelligent Chemistry, University of Science and Technology of China(中国科学技术大学精密与智能化学国家重点实验室) State Key Laboratory of Physical Chemistry of Solid Surface, College of Chemistry and Chemical Engineering, Xiamen University(厦门大学化学系固态表面物理化学国家重点实验室) The University of Hong Kong(香港大学) Peking Union Medical College and Chinese Academy of Medical Sciences(北京协和医学院中国医学科学院) The Hong Kong University of Science and Technology(香港科技大学) Hunan University(湖南大学) AI for Science Center, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室人工智能科学中心)

AI总结 提出NMRAgent智能体,结合大语言模型、光谱分析工具和化学知识图谱,通过证据推理实现高精度、可解释的分子结构解析,在新型骨架测试集上Top-1准确率提升46.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29340 2026-06-30 cs.AI

PHF: Privileged Hidden Flow for On-Policy Self-Distillation

PHF: 用于在线自蒸馏的特权隐藏流

Yuhan Li, Mingxu Zhang, Dazhong Shen, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六十三研究所,南京)

AI总结 提出特权隐藏流(PHF),通过对齐教师和学生的隐藏状态轨迹(而非逐点匹配),在在线自蒸馏中提升推理性能,在Qwen3模型上获得约+1.5至+2.2点的提升。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29259 2026-06-30 cs.RO

PL-LIT: A LiDAR-Inertial-Thermal SLAM Using Point-Line Features and Thermographic Mapping

PL-LIT:一种使用点线特征和热成像的LiDAR-惯性-热SLAM系统

Jiawei Xia, Yixiao Feng, Yongliang Shi, Chao Gao, Renjing Xu, Weining Lu, Bin Liang

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California, Berkeley(加州大学伯克利分校) Xinchen Qihang Co., Ltd.(新晨启航有限公司)

AI总结 提出PL-LIT系统,结合光度校准与点线特征提取网络,通过ESIKF紧耦合LiDAR、惯性和热数据,实现鲁棒的热SLAM,并构建概率热强度体素地图用于热异常检测。

Comments 8 pages,International Conference on Intelligent Robots and Systems 2026 (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28826 2026-06-30 cs.CV

RefGlass-GS: A UAV-Enabled Fusion Framework for Photorealistic, Semantic and Interactive Digitization of Reflective Glass Facades via Gaussian Splatting

RefGlass-GS:一种通过高斯泼溅实现反射玻璃幕墙逼真、语义和交互式数字化的无人机融合框架

Zhenyu Liang, Xiao Zhang, Boyu Wang, Zhaolun Liang, Ang Li, Jeff Chak Fu Chan, Mingzhu Wang, Jack C. P. Cheng

机构 * Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科技大学土木与环境工程系) Department of Civil and Environmental Engineering, University of Maryland(马里兰大学土木与环境工程系) Department of the Built Environment, National University of Singapore(新加坡国立大学环境与建筑系) Department of Architecture and Civil Engineering, City University of Hong Kong(香港城市大学建筑与土木工程系)

AI总结 提出RefGlass-GS框架,结合最大后验估计分割玻璃面板、无人机视角规划优化、反射MLP与延迟着色改进高斯泼溅,实现反射玻璃幕墙的高质量数字化,在面板分割、视角合成和建模质量上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28808 2026-06-30 stat.ML cs.LG math.PR

Variance Reduction for Stochastic Gradient Generalized Non-reversible Langevin Monte Carlo Algorithms

随机梯度广义非可逆朗之万蒙特卡洛算法的方差缩减

Bingye Ni, Xiaoyu Wang, Yingli Wang, Lingjiong Zhu

机构 * FinTech Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)金融科技方向) School of Mathematical Science, Fudan University(复旦大学数学学院) Department of Mathematics, Florida State University(佛罗里达州立大学数学系)

AI总结 研究随机梯度欧拉-丸山估计器在广义非可逆朗之万动力学中的前导阶波动,证明在消失步长下中心极限定理,并给出非对称扰动严格降低波动常数的充分条件。

Comments 49 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28353 2026-06-30 cs.IR cs.AI

From Regulatory Approvals to Patents: Cross-Domain Linking for Cardiovascular Device Traceability

从监管批准到专利:心血管设备可追溯性的跨领域链接

Yang Qingqing, Liu Haijiang, Li Moyan

机构 * HKUST (Guangzhou)(香港科技大学(广州)) Wuhan Univ. of Sci. & Tech.(武汉科技大学) Hubei Key Lab. of Intelligent Info. Processing & Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室)

AI总结 针对FDA批准设备与USPTO专利的跨领域链接任务,提出Bridge-MedDevKG框架,通过领域本体、多信号候选生成和异构重排序,在心血管设备数据集上实现91.6%召回率和50.9%噪声降低。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28350 2026-06-30 cs.IR cs.CV

UniCA: Bi-directional Cross-Attention with Positive Similarity Loss for Robust Multi-Modal Retrieval

UniCA:具有正相似性损失的双向交叉注意力用于鲁棒多模态检索

Yini Huang, Wenlong Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southern Medical University(南方医科大学)

AI总结 提出UniCA模型,通过双向交叉注意力块和正相似性损失增强跨模态语义对齐,在WebQA基准上混合任务Recall@5提升4.09%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31603 2026-06-30 cs.CV cs.AI

Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models

Lumos-Nexus: 面向视频统一模型的高效频率桥接与同质潜在空间

Jiazheng Xing, Hangjie Yuan, Lingling Cai, Xinyu Liu, Yujie Wei, Fei Du, Tao Feng, Hai Ci, Jiasheng Tang, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 提出Lumos-Nexus框架,通过两阶段训练和渐进频率桥接,在保持推理能力的同时显著提升视频生成保真度。

Comments ECCV 2026 Camera-Ready Version. Project page (https://jiazheng-xing.github.io/nexus-lumos-home/) and Code (https://github.com/alibaba-damo-academy/Lumos-Custom/) are available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28123 2026-06-30 cs.CV cs.AI cs.CL

Beyond SFT-to-RL: Pre-alignment via Black-Box On-Policy Distillation for Multimodal RL

超越SFT到RL:通过黑盒在线策略蒸馏进行预对齐以多模态RL

Sudong Wang, Weiquan Huang, Xiaomin Yu, Zuhao Yang, Hehai Lin, Keming Wu, Chaojun Xiao, Chen Chen, Wenxuan Wang, Beier Zhu, Yunjian Zhang, Chengwei Qin

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出PRISM框架,通过在SFT和RLVR之间插入显式分布对齐阶段,解决多模态RL中的分布漂移问题,利用基于策略蒸馏的对抗游戏提升对齐效果,实验显示在多个RL算法和基准上性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07753 2026-06-30 cs.CV cs.CL cs.LG

Symbiotic-MoE: Unlocking the Synergy between Generation and Understanding

共生MoE:解构生成与理解之间的协同效应

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

AI总结 本文提出Symbiotic-MoE框架,通过模态感知专家解缠绕和渐进训练策略,解决生成与理解任务间的冲突,提升多模态协同能力,在MMLU和OCRBench上取得显著提升。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02734 2026-06-30 cs.AI cs.CL

CostBench: Evaluating Multi-Turn Cost-Optimal Planning and Adaptation in Dynamic Environments for LLM Tool-Use Agents

CostBench:评估LLM工具使用代理在动态环境中的多轮成本最优规划与适应

Jiayu Liu, Cheng Qian, Zhaochen Su, Qing Zong, Shijue Huang, Bingxiang He, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学)

AI总结 本文提出CostBench,一个以成本为中心的可扩展基准,用于评估LLM代理在动态环境中的经济推理和重新规划能力,揭示现有模型在成本感知规划方面的显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17621 2026-06-30 cs.LG cs.CL

Complementary RL: Towards Efficient Experience-Driven Agent Learning

互补强化学习:迈向高效的基于经验的智能体学习

Dilxat Muhtar, Jiashun Liu, Wei Gao, Weixun Wang, Shaopan Xiong, Ju Huang, Siran Yang, Wenbo Su, Jiamang Wang, Ling Pan, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) HKUST(香港科技大学)

AI总结 本文提出互补强化学习,通过经验提取器与策略智能体的协同进化,提升经验利用效率,实验证明在单任务和多任务场景中均优于传统方法。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06133 2026-06-30 math.OC cs.AI cs.LG

LLM Serving Optimization with Variable Prefill and Decode Lengths

具有可变预填和解码长度的LLM服务优化

Meixuan Wang, Yinyu Ye, Zijie Zhou

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) Department of Industrial Engineering and Decision Analytics, HKUST(香港科技大学工业工程与决策分析系)

AI总结 研究在固定KV缓存内存预算下,异构提示和响应长度的离线调度问题,提出Sorted-F算法以平衡批次大小与下游解码成本,实现常数因子近似保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05755 2026-06-30 cs.CR cs.AI

Red-Teaming Coding Agents from a Tool-Invocation Perspective: An Empirical Security Assessment

从工具调用角度审视代码代理的红队测试:一项经验性安全评估

Yuchong Xie, Mingyu Luo, Zesen Liu, Zhixiang Zhang, Kaikai Zhang, Yu Liu, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学)

AI总结 本文从工具调用角度对六个流行的代码代理进行红队测试,发现ToolLeak漏洞并实现远程代码执行,揭示了代码代理的安全风险及防御建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03310 2026-06-30 cs.LG cs.AI

Predicting Effects, Missing Distributions: Evaluating LLMs as Human Behavior Simulators in Operations Management

预测影响,缺失分布:评估LLMs作为运营管理中的人类行为模拟器

Runze Zhang, Xiaowei Zhang, Mingyang Zhao

机构 * Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

AI总结 本文评估LLMs在运营管理中模拟人类行为的能力,通过九个实验发现LLMs能复制假设效应,但分布不匹配问题显著,轻量策略可缓解此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07660 2026-06-30 cs.CV

End-to-End Facial Expression Detection in Long Videos

长视频中端到端面部表情检测

Yini Fang, Alec F. Diallo, Frederic Jumelle, Bertram Shi

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Edinburgh(爱丁堡大学) Ydentity Organization(Ydentity组织)

AI总结 本文提出FEDN网络,将面部表情识别与检测统一为端到端任务,通过时间注意力模块提升多时间尺度表现,优于现有基准。

Comments ICANN 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏