arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-03-02 至 2026-03-02 共收录 10
2602.23937 2026-03-02 cs.RO cs.CV

Enhancing Vision-Language Navigation with Multimodal Event Knowledge from Real-World Indoor Tour Videos

通过真实世界室内游览视频的多模态事件知识增强视觉语言导航

Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Xingxing Zuo, Yaoxian Song, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(马尔代夫 bin Zayed 大学人工智能学院) Hangzhou City University(杭州城市学院)

AI总结 本文提出基于多模态事件知识的视觉语言导航增强方法,通过构建大规模时空知识图谱并结合层次检索机制,提升长视界推理和粗粒度指令处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23645 2026-03-02 cs.CV

BuildAnyPoint: 3D Building Structured Abstraction from Diverse Point Clouds

BuildAnyPoint: 从多样点云构建三维建筑结构抽象

Tongyan Hua, Haoran Gong, Yuan Liu, Di Wang, Ying-Cong Chen, Wufan Zhao

机构 * HKUST(GZ)(香港科技大学(广州)) Xi’an Jiaotong University(西安交通大学)

AI总结 BuildAnyPoint通过Loca-DiT框架从多样点云中生成结构化三维建筑抽象,提升重建的表面准确性和分布均匀性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21157 2026-03-02 cs.RO

HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning

HALO:一种用于具身多模态推理的统一视觉-语言-动作模型

Quanxin Shou, Fangqi Zhu, Shawn Chen, Puxin Yan, Zhengyang Yan, Yikun Miao, Xiaoyi Pang, Zicong Hong, Ruikai Shi, Hao Huang, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 HALO提出了一种统一的视觉-语言-动作模型,通过结合文本推理、视觉子目标预测和增强的动作预测,实现具身多模态链式推理,提升了机器人在复杂环境中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19919 2026-03-02 cs.CL cs.LG

Janus-Q: End-to-End Event-Driven Trading via Hierarchical-Gated Reward Modeling

Janus-Q:通过分层门控奖励建模实现端到端的事件驱动交易

Xiang Li, Zikai Wei, Yiyan Qi, Wanyun Zhou, Xiang Liu, Penglei Sun, Jian Guo, Yongqi Zhang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) International Digital Economy Academy(国际数字经济学院)

AI总结 Janus-Q通过分层门控奖励模型实现端到端事件驱动交易,提升金融新闻事件作为主要决策单元,提高交易决策的稳定性和盈利能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15909 2026-03-02 eess.AS cs.AI cs.DB cs.HC cs.MA cs.SD

Resp-Agent: An Agent-Based System for Multimodal Respiratory Sound Generation and Disease Diagnosis

Resp-Agent:一种基于代理的多模态呼吸声生成与疾病诊断系统

Pengfei Zhang, Tianxin Xie, Minghao Yang, Li Liu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

AI总结 Resp-Agent是一种基于代理的多模态系统,通过主动对抗课程代理和模态编织器提升呼吸声生成与疾病诊断的鲁棒性。

Comments 24 pages, 3 figures. Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07021 2026-03-02 cs.CV cs.AI

MEGS$^{2}$: Memory-Efficient Gaussian Splatting via Spherical Gaussians and Unified Pruning

MEGS$^{2}$: 通过球形高斯和统一剪枝实现内存高效的三维高斯散射

Jiarui Chen, Yikeng Chen, Yingshuang Zou, Ye Huang, Peng Wang, Yuan Liu, Yujing Sun, Wenping Wang

机构 * HKUST(香港科技大学) SZU(深圳大学) SYSU(南方科技大学) Adobe(Adobe公司) NTU(国立台湾大学) TAMU(德克萨斯大学奥斯汀分校)

AI总结 MEGS$^{2}$通过球形高斯和统一剪枝技术,实现了3DGS的内存高效压缩,显著降低内存占用并保持高质量渲染。

Comments 20 pages, 8 figures. Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23061 2026-03-02 cs.CV

Empowering Small VLMs to Think with Dynamic Memorization and Exploration

赋能小型视觉语言模型进行动态记忆与探索

Jiazhen Liu, Yuchuan Deng, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 DyME通过动态选择记忆与探索策略,提升小型视觉语言模型的推理能力。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18679 2026-03-02 cs.CV

Efficient Degradation-agnostic Image Restoration via Channel-Wise Functional Decomposition and Manifold Regularization

通过通道级功能分解和流形正则化实现高效的退化无关图像恢复

Bin Ren, Yawei Li, Xu Zheng, Yuqian Fu, Danda Pani Paudel, Hong Liu, Ming-Hsuan Yang, Luc Van Gool, Nicu Sebe

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽德人工智能大学) University of Trento(特伦托大学) ETH Zürich(苏黎世联邦理工学院) HKUST (GZ)(香港科技大学(广州)) Peking University(北京大学) University of California, Merced(加州大学默塞德分校)

AI总结 MIRAGE通过通道级功能分解和流形正则化,在高效性与性能之间取得平衡,实现退化无关图像恢复的先进性能。

Comments Accepted by ICLR'2026, All-in-One Image Restoration, low-level vision, Transformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23461 2026-03-02 cs.CV

Investigating Text Insulation and Attention Mechanisms for Complex Visual Text Generation

探究文本绝缘与注意力机制用于复杂视觉文本生成

Ying Tai, Nikai Du, Rui Xie, Zhennan Chen, Qian Wang, Zhengkai Jiang, Kai Zhang, Jian Yang

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Jiutian Research(极天研究) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 TextCrafter通过文本绝缘与注意力机制,提升复杂视觉文本生成性能,引入CVTG-2K基准测试集验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.04028 2026-03-02 cs.CV cs.RO

CO^3: Cooperative Unsupervised 3D Representation Learning for Autonomous Driving

CO³:协作无监督3D表示学习用于自动驾驶

Runjian Chen, Yao Mu, Runsen Xu, Wenqi Shao, Chenhan Jiang, Hang Xu, Zhenguo Li, Ping Luo

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Huawei Noah’s Ark Lab(华为诺亚实验室) The Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 CO³通过协作对比学习和上下文形状预测,实现无监督学习户外场景点云的3D表示,提升自动驾驶中的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏