arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

2026-05-12 至 2026-05-12 共收录 47
2605.08744 2026-05-12 cs.GR cs.AI cs.LG

MeshFIM: Local Low-Poly Mesh Editing via Fill-in-the-Middle Autoregressive Generation

MeshFIM: 通过填入中间自回归生成实现局部低多边形网格编辑

Dingdong Yang, Jian Liu, Biwen Lei, Haohan Weng, Zhuo Chen, Song Guo, Hao Richard Zhang, Ali Mahdavi Amiri, Chunchao Guo

机构 * Tencent Hunyuan(腾讯文生) Simon Fraser University(西蒙弗雷泽大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 MeshFIM通过填入中间自回归生成方法实现局部低多边形网格编辑,解决精确边界连接、拓扑顺序保持和区域溢出抑制等挑战,提升网格修复和细化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08734 2026-05-12 cs.LG cs.AI cs.CL

AdaPreLoRA: Adafactor Preconditioned Low-Rank Adaptation

AdaPreLoRA: 带Adafactor预条件的低秩适应

Ziyun Liu, Fengmiao Bian, Jian-Feng Cai

机构 * Department of Mathematics(数学系) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 AdaPreLoRA通过Adafactor预条件器和因子空间求解方法,在低秩适应中实现更高效的优化,提升模型性能与内存效率。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06356 2026-05-12 cs.CV

SwiftI2V: Efficient High-Resolution Image-to-Video Generation via Conditional Segment-wise Generation

SwiftI2V: 通过条件分段生成实现高效的高分辨率图像到视频生成

YaoYang Liu, Yuechen Zhang, Wenbo Li, Yufei Zhao, Rui Liu, Long Chen

机构 * HKUST(香港科技大学) CUHK(香港大学) Joy Future Academy(京东探索研究院) HKU(香港大学) HUAWEI Research(华为研究)

AI总结 本文提出SwiftI2V框架,通过分段生成和双向上下文交互,在2K分辨率下实现高效图像到视频生成,相比端到端模型减少GPU时间202倍。

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01507 2026-05-12 cs.AI

MILD: Mediator Agent System with Bidirectional Perception and Multi-Layered Alignment for Human-Vehicle Collaboration

MILD:具有双向感知和多层对齐的中介代理系统用于人车协作

Jiyao Wang, Yunbiao Wang, Yubo Jiao, Xiao Yang, Dengbo He, Sasan Jafarnejad, Luis Miranda-Moreno, Raphael Frank, Jiangbo Yu

机构 * Department of Civil Engineering, McGill University(麦吉尔大学土木工程系) Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)系统中心) Interdisciplinary Centre for Security, Reliability and Trust, University of Luxembourg(卢森堡大学安全、可靠与信任跨学科中心)

AI总结 本文提出MILD系统,通过双向感知和多层对齐提升人车协作效率,采用ECPO算法确保策略符合安全规范和人类价值观,实验证明其在感知准确性和策略质量上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22003 2026-05-12 cs.RO

VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models

VP-VLA:作为视觉语言动作模型接口的视觉提示

Zixuan Wang, Yuxin Chen, Yuqi Liu, Jinhui Ye, Pengguang Chen, Changsheng Lu, Shu Liu, Bei Yu, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港大学) SmartMore(SmartMore公司)

AI总结 VP-VLA通过结构化视觉提示接口解耦高层推理与低层执行,提升空间精度和鲁棒性,实验证明优于现有端到端基线。

Comments Project page: https://visualprompt-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01194 2026-05-12 cs.CV

EMFormer: Efficient Multi-Scale Transformer for Accumulative Context Weather Forecasting

EMFormer:高效的多尺度Transformer用于累积上下文天气预测

Hao Chen, Tao Han, Jie Zhang, Song Guo, Fenghua Ling, Lei Bai

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学计算机科学与工程系) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

AI总结 本文提出EMFormer,通过单次卷积提取多尺度特征,结合累积上下文微调和复合损失函数,提升天气预测精度并减少计算开销。

Comments This paper has been accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16836 2026-05-12 cs.CV cs.CL

ColorConceptBench: A Benchmark for Probabilistic Color-Concept Understanding in Text-to-Image Models

ColorConceptBench:一种用于文本到图像模型中概率颜色-概念理解的基准

Chenxi Ruan, Yihan Hou, Yu Xiao, Guosheng Hu, Wei Zeng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) China Academy of Art(中国美术学院)

AI总结 本文提出ColorConceptBench,通过概率颜色分布系统评估颜色-概念关联,研究文本到图像模型对隐含概念如情感和视觉状态的理解能力,发现模型在抽象语义上的敏感性不足。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06673 2026-05-12 cs.CV

Detector-Empowered Video Large Language Model for Efficient Spatio-Temporal Grounding

基于检测器的视频大语言模型用于高效的时空定位

Shida Gao, Feng Xue, Xiangfeng Wang, Anlong Ming, Zhaowen Lin, Haiyang Zhang, Teng Long, Nicu Sebe, Yihua Shao, Haozhe Wang, Wei Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Trento(特伦特大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology(香港科技大学) ZTE Corporation(中兴通讯)

AI总结 本文提出DEViL模型,通过将密集空间定位任务转移给训练良好的检测器,提升视频时空定位的效率与性能,实现43.1%的m_vIoU和14.33 FPS的高效表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14045 2026-05-12 cs.CR cs.AI cs.CL

Auditing Data Membership in Reinforcement Learning With Verifiable Rewards

在强化学习中使用可验证奖励进行数据成员审计

Yule Liu, Heyi Zhang, Jinyi Zheng, Zhen Sun, Zifan Peng, Jiaheng Wei, Tianshuo Cong, Yilong Yang, Xinlei He

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Xidian University(西安电子科技大学) Wuhan University(武汉大学)

AI总结 本文提出DIBA框架,通过比较微调模型与预RLVR检查点,检测强化学习中数据暴露问题,提升审计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01352 2026-05-12 cs.LG

TAH-QUANT: Effective Activation Quantization in Pipeline Parallelism over Slow Network

TAH-QUANT: 在慢速网络下的流水线并行中有效的激活量化

Guangxin He, Yuan Cao, Yutong He, Tianyi Bai, Kai Chen, Kun Yuan, Binhang Yuan

机构 * HKUST(香港科技大学) Peking University(北京大学)

AI总结 本文提出TAH-Quant框架,通过细粒度切片量化、熵引导的自适应位分配和Hadamard变换,减少量化误差并提升训练效率,实验证明其在保持收敛性的同时提升了吞吐量和速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13451 2026-05-12 cs.RO

MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation

MapNav: 一种通过标注语义地图的新型记忆表示方法用于视觉-语言导航

Lingfeng Zhang, Xiaoshuai Hao, Qinwen Xu, Qiang Zhang, Xinyao Zhang, Pengwei Wang, Jing Zhang, Zhongyuan Wang, Shanghang Zhang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Beijing Innovation Center of Humanoid Robotics Co., Ltd.(北京人形机器人创新中心有限公司) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院)

AI总结 本文提出MapNav,通过标注语义地图替代传统历史帧,提升视觉-语言导航任务的性能,实验表明其在模拟和现实环境中均达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18798 2026-05-12 cs.LG cs.AI

Ister: Linear Transformer for Efficient Multivariate Time Series Forecasting

Ister:用于高效多变量时间序列预测的线性Transformer

Fanpu Cao, Shu Yang, Zhengjian Chen, Ye Liu, Laizhong Cui

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ShenZhen University(深圳大学) Shenzhen Energy Group Co., Ltd.(深圳能源集团有限公司) South China University of Technology(华南理工大学)

AI总结 Ister提出了一种线性复杂度的注意力机制和倒置季节趋势分解策略,提升多变量时间序列预测的准确性和效率,实验证明其在多个基准上达到最优性能。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10310 2026-05-12 cs.RO cs.SY eess.SY

Safe and Real-Time Consistent Planning for Autonomous Vehicles in Partially Observed Environments via Parallel Consensus Optimization

通过并行一致性优化实现自动驾驶车辆在部分观测环境中的安全与实时一致性规划

Lei Zheng, Rui Yang, Minzhe Zheng, Michael Yu Wang, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)机器人与自主系统方向) School of Engineering, Great Bay University(大湾大学工程学院) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科学与技术大学新兴交叉领域学院)

AI总结 本文提出CPTO方法,通过并行优化解决自动驾驶在部分观测环境中安全与一致性规划问题,采用共识安全屏障模块和分解二次规划加速计算,提升安全性和一致性。

Comments 16 pages, 7 figures

Journal ref IEEE Transactions on Intelligent Transportation Systems, vol. 27, no. 5, pp. 5174-5190, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03303 2026-05-12 cs.CL

LoRA-FA: Efficient and Effective Low Rank Representation Fine-tuning

LoRA-FA:高效且有效的低秩表示微调

Longteng Zhang, Lin Zhang, Shaohuai Shi, Xiaowen Chu, Bo Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

AI总结 本文提出LoRA-FA,通过冻结投影下矩阵A并训练投影上矩阵B,有效提升低秩适应性能,同时减少计算和内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08296 2026-05-12 cs.CV eess.SP

BenchHAR: Benchmarking Self-Supervised Learning for Generalizable Sensor-based Activity Recognition

BenchHAR: 用于通用传感器活动识别的自监督学习基准测试

Yize Cai, Rui Feng, Anlan Yu, Baoshen Guo, Zhiqing Hong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Peking University(北京大学) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟)

AI总结 BenchHAR针对传感器活动识别中数据异质性和标注数据稀缺问题,系统比较了自监督学习方法的泛化性能,发现混合范式和CNN编码器在性能上表现最佳,且增加预训练数据量能提升泛化能力。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08207 2026-05-12 cs.CV

A Breast Vision Pathology Foundation Model for Real-world Clinical Utility

乳腺病理科基础模型用于真实世界临床应用

Yingxue Xu, Zhengyu Zhang, Xiuming Zhang, Mengwei Xu, Fengtao Zhou, Yihui Wang, Jiabo Ma, Yi Xin, Danyi Li, Chengyu Lu, Zhijian Cen, Ying Tan, Qingbing Yao, Qi Wang, Zizhao Gao, Yong Zhang, Jingjing Chen, Feifei Liu, Qian Xu, Yi Dai, Hongxuan Tan, Cheng Jin, Huajun Zhou, Zhengrui Guo, Ling Liang, Hongyi Wang, Yingcong Chen, Xi Wang, Zhenhui Li, Ronald Cheong Kin Chan, Ning Mao, Muyan Cai, Zhe Wang, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学计算机科学与工程系) Department of Pathology, Nanfang Hospital, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(南方医科大学基础医学学院病理学系,广州医院) Department of Pathology, The First Affiliated Hospital, School of Medicine, Zhejiang University, Hangzhou, China(浙江大学医学院第一附属医院病理学系,杭州) State Key Laboratory of Holistic Integrative Management of Gastrointestinal Cancers, Department of Pathology, School of Basic Medicine and Xijing Hospital, Fourth Military Medical University, Xi’an, China(胃肠癌整体整合管理国家重点实验室,第四军医大学基础医学学院病理学系,西京医院)

AI总结 本文提出BRAVE模型,通过101638张乳腺全切片图像评估其在乳腺癌诊断中的临床实用性,展示了在不同阶段的病理评估中提升诊断效率和准确性的能力。

Comments 60 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08138 2026-05-12 cs.LG

DataArc-SynData-Toolkit: A Unified Closed-Loop Framework for Multi-Path, Multimodal, and Multilingual Data Synthesis

DataArc-SynData-Toolkit:多路径、多模态和多语言数据合成的统一闭环框架

Zhichao Shi, Cehao Yang, Hao Zhou, Xiaojun Wu, Huajie Li, Xuhui Jiang, Chengjin Xu, Yuanzhuo Wang, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) IDEA Research(IDEA研究院) International Digital Economy Academy(国际数字经济学院) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科研究院) Institute of Computing Technology, CAS(中国科学院计算技术研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出DataArc-SynData-Toolkit,通过统一的合成范式和模块化架构,解决现有合成数据工具在流程复杂、标准碎片化和多模态扩展性方面的不足,提升数据生成效率和质量。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏