arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-03-09 至 2026-03-09 共收录 10
2601.00092 2026-03-09 cs.CV

Spatial4D-Bench: A Versatile 4D Spatial Intelligence Benchmark

Spatial4D-Bench: 一种多功能的4D空间智能基准

Pan Wang, Yang Liu, Guile Wu, Eduardo R. Corral-Soto, Chengjie Huang, Binbin Xu, Dongfeng Bai, Xu Yan, Yuan Ren, Xingxin Chen, Yizhe Wu, Tao Huang, Wenjun Wan, Xin Wu, Pei Zhou, Xuyang Dai, Kangbo Lv, Hongbo Zhang, Yosef Fried, Aixue Ye, Bailan Feng, Zhenyu Chen, Zhen Li, Yingcong Chen, Yiyi Liao, Bingbing Liu

机构 * Pan Wang Fundation Model Dept, Huawei(王潘 基础模型部门,华为) Yang Liu Noah’s Ark Lab, Huawei(刘阳 神秘 Ark 实验室,华为) Guile Wu Noah’s Ark Lab, Huawei(吴古力 神秘 Ark 实验室,华为) Eduardo R. Corral-Soto Noah’s Ark Lab, Huawei(埃杜阿多·R·科拉尔-索托 神秘 Ark 实验室,华为) Chengjie Huang Noah’s Ark Lab, Huawei(黄成杰 神秘 Ark 实验室,华为) Binbin Xu Noah’s Ark Lab, Huawei(徐彬彬 神秘 Ark 实验室,华为) Dongfeng Bai Noah’s Ark Lab, Huawei(白东风 神秘 Ark 实验室,华为) Xu Yan Fundation Model Dept, Huawei(颜绪 基础模型部门,华为) Yuan Ren Noah’s Ark Lab, Huawei(袁仁 神秘 Ark 实验室,华为) Xingxin Chen Noah’s Ark Lab, Huawei(陈星心 神秘 Ark 实验室,华为) Yizhe Wu Fundation Model Dept, Huawei(吴义哲 基础模型部门,华为) Tao Huang Fundation Model Dept, Huawei(黄涛 基础模型部门,华为) Wenjun Wan Central Media Technology Institute, Huawei(万文军 中央媒体技术研究院,华为) Xin Wu Central Media Technology Institute, Huawei(吴新 中央媒体技术研究院,华为) Pei Zhou Central Media Technology Institute, Huawei(周佩 中央媒体技术研究院,华为) Xuyang Dai Central Media Technology Institute, Huawei(戴绪阳 中央媒体技术研究院,华为) Kangbo Lv Fundation Model Dept, Huawei(吕康博 基础模型部门,华为) Hongbo Zhang Fundation Model Dept, Huawei(张宏波 基础模型部门,华为) Yosef Fried Fundation Model Dept, Huawei(弗里德·约瑟夫 基础模型部门,华为) Aixue Ye Fundation Model Dept, Huawei(叶爱雪 基础模型部门,华为) Bailan Feng Fundation Model Dept, Huawei(冯 Bailan 基础模型部门,华为) Zhenyu Chen Fundation Model Dept, Huawei(陈振宇 基础模型部门,华为) Zhen Li CUHK-Shenzhen(李振 中山大学深圳校区) Yingcong Chen HKUST-GZ(陈应聪 香港科技大学-广东) Yiyi Liao Zhejiang University(廖亿毅 浙江大学) Bingbing Liu Fundation Model Dept, Huawei(刘冰冰 基础模型部门,华为)

AI总结 Spatial4D-Bench提出了一种多功能的4D空间智能基准,用于评估多模态大语言模型的4D空间推理能力,并揭示其在路线规划、动作识别等任务中的局限性。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06366 2026-03-09 cs.CV

OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析

Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao, Yuci Liang, Kuo Feng Hung, Hao Tang

机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) School of Computer Science, Peking University(北京大学计算机学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。

Comments 34 pages, 24 figures, conference

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06032 2026-03-09 cs.CV

StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision

StruVis: 通过结构化视觉进行推理的文本到图像生成增强

Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) East China Normal University(华东师范大学)

AI总结 StruVis通过结构化视觉引导推理,提升基于推理的文本到图像生成性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05898 2026-03-09 cs.CV

InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation

InnoAds-Composer: 电商海报生成中的高效条件组合

Yuxin Qin, Ke Cao, Haowei Liu, Ao Ma, Fengheng Li, Honghe Zhu, Zheng Zhang, Run Ling, Wei Feng, Xuanhua He, Zhanjie Zhang, Zhen Guo, Haoyi Bian, Jingjing Lv, Junjie Shen, Ching Law

机构 * JD.com, Inc.(京东公司) Chongqing University of Posts and Telecommunications(重庆邮电大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学)

AI总结 InnoAds-Composer通过单阶段框架实现对电商海报生成中主体、文本和风格的高效三条件控制,提升了生成质量并减少了计算开销。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05355 2026-03-09 cs.RO

OmniDP: Beyond-FOV Large-Workspace Humanoid Manipulation with Omnidirectional 3D Perception

OmniDP: 在超广角大工作空间中实现人形机器人的全方位3D感知

Pei Qu, Zheng Li, Yufei Jia, Ziyun Liu, Liang Zhu, Haoang Li, Jinni Zhou, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

AI总结 OmniDP通过360度全景点云感知和时间感知注意力池化机制,实现人形机器人在大工作空间中的稳健操作,优于传统深度相机方法。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00543 2026-03-09 cs.CV

Cross-Scale Pansharpening via ScaleFormer and the PanScale Benchmark

跨尺度 pansharpening 通过 ScaleFormer 和 PanScale 数据集

Ke Cao, Xuanhua He, Xueheng Li, Lingting Zhu, Yingying Wang, Ao Ma, Zhanjie Zhang, Man Zhou, Chengjun Xie, Jie Zhang

机构 * HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Xiamen University(厦门大学) Zhejiang University(浙江大学)

AI总结 本文提出 ScaleFormer 架构和 PanScale 数据集,通过跨尺度 pansharpening 方法提升多尺度场景下的图像融合质量与泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23972 2026-03-09 cs.RO

Learning Robust Control Policies for Inverted Pose on Miniature Blimp Robots

学习微型气球机器人倒置姿态的鲁棒控制策略

Yuanlin Yang, Lin Hong, Fumin Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

AI总结 本文提出了一种新型框架,通过仿真与现实映射层,实现微型气球机器人倒置姿态的鲁棒控制策略学习。

Comments Accepted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06306 2026-03-09 cs.CV cs.AI

Exploiting Spatiotemporal Properties for Efficient Event-Driven Human Pose Estimation

利用时空特性实现高效事件驱动的人体姿态估计

Haoxian Zhou, Chuanzhi Xu, Langyi Chen, Pengfei Ye, Haodong Chen, Yuk Ying Chung, Qiang Qu

机构 * The University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出利用事件流的时空特性,结合点云框架提升人体姿态估计性能,实验显示在DHP19数据集上平均MPJPE减少4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20739 2026-03-09 cs.RO cs.CV

Decision-Driven Semantic Object Exploration for Legged Robots via Confidence-Calibrated Perception and Topological Subgoal Selection

通过置信度校准感知与拓扑子目标选择实现决策驱动的语义对象探索

Guoyang Zhao, Yudong Li, Weiqing Qi, Kai Zhang, Bonan Liu, Kai Chen, Haoang Li, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou), China(机器人与自主系统方向,香港科技大学(广州)) Department of Mechanical and Energy Engineering, Southern University of Science and Technology, China(机械与能源工程系,南方科技大学)

AI总结 本文提出了一种基于视觉的决策驱动语义对象探索方法,通过置信度校准感知与拓扑子目标选择机制提升腿部机器人在开放环境中的探索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09864 2026-03-09 cs.CV

AuthFace: Towards Authentic Blind Face Restoration with Face-oriented Generative Diffusion Prior

AuthFace: 向真实盲脸修复迈进的面向面部生成扩散先验

Guoqiang Liang, Qingnan Fan, Bingtao Fu, Jinwei Chen, Hong Gu, Lin Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) Nanyang Technological University(南洋理工大学)

AI总结 AuthFace通过面向面部的生成扩散先验和摄影引导标注,实现高质量盲脸修复,提升面部细节还原和减少关键区域伪影。

Comments ACM MM 25, Codes and datasets are available at https://github.com/EthanLiang99/AuthFace

详情

展开后加载摘要…

URL PDF HTML 收藏