arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-03-23 至 2026-03-23 共收录 9
2603.20148 2026-03-23 cs.CV

Can Large Multimodal Models Inspect Buildings? A Hierarchical Benchmark for Structural Pathology Reasoning

大型多模态模型能否检查建筑?一种用于结构病理推理的分层基准

Hui Zhong, Yichun Gao, Luyan Liu, Hai Yang, Wang Wang, Haowei Zhang, Xinhu Zheng

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University(香港大学)

AI总结 本文提出DefectBench基准,评估大型多模态模型在建筑表面检测中的能力,发现其在拓扑理解和语义理解方面表现优异,但在精确定位方面存在不足,并验证了零样本生成分割的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19795 2026-03-23 cs.CV

Controllable Text-to-Motion Generation via Modular Body-Part Phase Control

通过模块化身体部位相控实现可控的文本到运动生成

Minyue Dai, Ke Fan, Anyi Rao, Jingbo Wang, Bo Dai

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) HKUST(香港科技大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

AI总结 本文提出模块化身体部位相控方法,通过紧凑的标量相界面实现局部化编辑,保留运动整体一致性,提供可控的文本到运动生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19714 2026-03-23 cs.CL

LoopRPT: Reinforcement Pre-Training for Looped Language Models

LoopRPT: 用于循环语言模型的强化预训练

Guo Tang, Shixin Jiang, Heng Chang, Nuo Chen, Yuhan Li, Huiming Fan, Jia Li, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) Tsinghua University, Beijing, China(清华大学) The Hong Kong University of Science and Technology, Guangzhou, China(香港科学与技术大学)

AI总结 本文提出LoopRPT框架,通过将下一步预测转化为推理任务,利用EMA教师参考和噪声潜在轨迹直接优化循环语言模型的中间表示,提升表示质量并实现准确度与计算量的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19657 2026-03-23 stat.ML cs.LG

Model Selection and Parameter Estimation of Multi-dimensional Gaussian Mixture Model

多维高斯混合模型的模型选择与参数估计

Xinyu Liu, Hai Zhang

机构 * Department of Mathematics, Hong Kong University of Science and Technology (HKUST)(香港科技大学数学系)

AI总结 本文研究了多维高斯混合模型的学习问题,重点在于模型阶选择和高效混合分布估计。通过建立信息论下界,提出基于阈值的估计算法,结合梯度下降方法和PCA降维,验证了方法的最优性与高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19616 2026-03-23 cs.CV

UniPR: Unified Object-level Real-to-Sim Perception and Reconstruction from a Single Stereo Pair

UniPR: 一种统一的基于单立体对的物体级实拍到仿真感知与重建框架

Chuanrui Zhang, Yingshuang Zou, ZhengXian Wu, Yonggen Ling, Yuxiao Yang, Ziwei Wang

机构 * NTU(国立新加坡大学) Tencent Robotics X(腾讯机器人实验室) Futian Laboratory(福田实验室) HKUST(香港科技大学) THU(清华大学)

AI总结 本文提出UniPR,一种端到端的物体级实拍到仿真感知与重建框架,通过几何约束解决尺度模糊问题,消除了对类别特定规范的依赖,并通过大规模立体数据集LVS6D提升研究效率和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19584 2026-03-23 cs.AI cs.SY eess.SY

PowerLens: Taming LLM Agents for Safe and Personalized Mobile Power Management

PowerLens:利用大语言模型安全且个性化地管理移动设备电源

Xingyu Feng, Chang Sun, Yuzhu Wang, Zhangbing Zhou, Chengwen Luo, Zhuangzhuang Chen, Xiaomin Ouyang, Huanqi Yang

机构 * China University of Geosciences (Beijing)(中国地质大学(北京)) Shenzhen University(深圳大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学)

AI总结 PowerLens通过利用大语言模型的常识推理,实现安全且个性化的移动电源管理。系统通过用户活动与系统参数之间的语义桥梁,生成适应个人偏好的零样本策略,通过隐式反馈学习用户偏好,无需显式配置,3-5天内收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15597 2026-03-23 cs.SD cs.CV cs.LG cs.MM eess.AS

AC-Foley: Reference-Audio-Guided Video-to-Audio Synthesis with Acoustic Transfer

AC-Foley:基于参考音频的视频到音频合成与声学迁移

Pengjun Fang, Yingqing He, Yazhou Xing, Qifeng Chen, Ser-Nam Lim, Harry Yang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Central Florida(佛罗里达中央大学)

AI总结 本文提出AC-Foley模型,通过直接利用参考音频实现精确的音频合成与声学迁移,解决传统方法在语义粒度和文本模糊性上的瓶颈,提升音频生成质量与细粒度控制能力。

Comments Accepted at ICLR 2026. 15 pages, 5 figures, add project webpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05786 2026-03-23 cs.CV cs.AI

How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM

如何使LLM具备3D能力?LLM中空间推理的综述

Jirong Zha, Yuxuan Fan, Xiao Yang, Chen Gao, Xinlei Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))

AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。

Comments 9 pages, 5 figures

Journal ref IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18048 2026-03-23 cs.AI cs.SD eess.AS

DEAF: A Benchmark for Diagnostic Evaluation of Acoustic Faithfulness in Audio Language Models

DEAF:用于音频语言模型声音忠实度诊断评估的基准

Jiaqi Xiong, Yunjia Qi, Qi Cao, Yu Zheng, Yutong Zhang, Ziteng Wang, Ruofan Liao, Weisheng Xu, Sichen Liu

机构 * University of Oxford(牛津大学) XJTLU HNU(湖南大学) CUHK(SZ)(香港中文大学(深圳)) PKU(北京大学) HKUST(GZ)(香港科技大学(广州))

AI总结 DEAF基准通过2700多个冲突刺激,评估音频语言模型对声音信号的真实处理能力,揭示模型在语音基准测试中的表现与真实声音理解间的差距。

Comments 14 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏