InstanceAnimator: Multi-Instance Sketch Video Colorization
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; NUS(新加坡国立大学)
高校专区
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; NUS(新加坡国立大学)
一个十年级基准评估LLM在多轮对话中检测和遵守临床实践指南的能力
机构 * Microsoft Research Asia(微软亚洲研究院) ; Hong Kong University of Science and Technology(香港科技大学) ; Peking University(北京大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出CPGBench基准,评估LLM在多轮对话中检测和遵循临床实践指南的能力,发现多数模型在识别和遵循指南方面存在显著差距,通过人类评估验证了这一发现。
去噪与对齐:迈向无源无监督领域适应的鲁棒全景语义分割
机构 * Wuhan University(武汉大学) ; HKUST (Guangzhou)(香港科技大学(广州)) ; Wuhan University of Technology(武汉理工大学)
AI总结 本文提出DAPASS框架,通过全景置信度引导去噪和上下文分辨率对抗模块,解决无源领域适应中因几何失真和数据缺失导致的伪标签不准确问题,提升户外和室内场景的语义分割性能。
Comments Accepted to CVPR26
HGGT:从未校准图像中鲁棒且灵活的3D手形重建
机构 * University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学) ; Max-Planck-Institut für Informatik(马克斯·普朗克信息学研究所) ; Macau University of Science and Technology(澳门科技大学) ; Hong Kong University of Science and Technology(香港科技大学) ; ShanghaiTech University(上海科技大学)
AI总结 本文提出HGGT方法,通过将手形重建视为视觉-几何基础任务,首次联合推断3D手形和相机姿态,实现了从未校准视角的鲁棒性和灵活性,优于现有方法并在真实场景中表现优异。
Comments project page: https://lym29.github.io/HGGT/
组级编辑:一次操作编辑多张图像
机构 * HKUST(香港科技大学) ; THU(清华大学) ; SJTU(上海交通大学) ; University of Technology Sydney(悉尼科技大学)
AI总结 本文提出组级编辑框架,通过显式和隐式关系建立实现多图像一致修改,引入融合机制和新数据集提升编辑质量与一致性。
Comments Accepted by CVPR 2026, Project page: https://group-editing.github.io/, Github: https://github.com/mayuelala/GroupEditing
CoIn3D:重新审视配置不变的多摄像头3D目标检测
机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) ; Intelligent Transportation Thrust of the Systems Hub, HKUST(GZ)(香港科技大学(广州)系统枢纽智能交通学域) ; Amazon Alexa AI(亚马逊Alexa人工智能)
AI总结 本文提出CoIn3D框架,通过空间先验整合和摄像头感知数据增强,提升多摄像头3D目标检测在不同配置下的泛化能力。
Comments Accepted to CVPR 2026 main track
信息价值在资源受限定价中的作用
机构 * Institute for Data, Systems, and Society, Massachusetts Institute of Technology(麻省理工学院数据、系统与社会研究所) ; Department of Civil and Environmental Engineering and Operations Research Center, MIT(麻省理工学院土木与环境工程系及运筹学研究中心) ; Department of Industrial Engineering and Decision Analytics, Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)
AI总结 本文研究了在资源受限条件下,预测不确定性如何影响动态定价决策,通过线性需求、随机噪声和有限容量,证明了预测误差阈值对 regret 的影响,并展示了代理模型在降低方差中的作用。
Comments Extended version of the NeurIPS 2025 paper (arXiv:2501.14155). This version adds phase transition, surrogate-assisted variance reduction under model misspecification, and numerical experiments
OptiSAR-Net++:跨领域遥感视觉定位的大型基准和无Transformer框架
机构 * South China Normal University(华南师范大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Tongji University(同济大学) ; Shanghai Research Institute for Intelligent Autonomous Systems(上海自主智能无人系统科学中心) ; State Key Laboratory of Intelligent Autonomous Systems(智能自主系统国家重点实验室) ; Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心)
AI总结 本文提出OptiSAR-Net++,通过构建首个跨领域遥感视觉定位基准数据集,解决跨领域特征建模、计算效率和细粒度语义区分问题,提升定位精度与效率。
TopoMesh: 通过拓扑统一实现高保真的网格自编码
机构 * Tsinghua University(清华大学) ; ByteDance Seed(字节跳动种子) ; HKUST(香港科技大学)
AI总结 TopoMesh通过拓扑统一框架解决网格生成中的拓扑不匹配问题,利用稀疏体素VAE实现高保真重建,提升几何细节和锐利特征的保留能力。
Comments Accepted to CVPR 2026. Project page: https://logan0601.github.io/projects/topomesh/index.html
迈向探索性与聚焦性操控的双臂主动感知:一个新的问题、基准和策略
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出探索性与聚焦性操控(EFM)问题,建立EFM-10基准并提出双臂主动感知策略,通过主动视觉和力觉感知提升复杂操控任务的完成能力。
Comments ICRA 2026
GRPO能否提升复杂多模态表格理解?
机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) ; Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) ; Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; University of Southern California(南加州大学) ; Duke Kunshan University(杜克大学昆山分校)
AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。
Comments EMNLP 2025
Journal ref EMNLP 2025
3D动态感知操控:赋予操控策略三维前瞻性
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; JAKA Robotics Co., Ltd.(JAKA机器人有限公司)
AI总结 本文提出一种融合3D世界建模与策略学习的框架,通过引入三个自监督任务提升操控策略的3D前瞻性,实验表明在仿真和现实环境中显著提升操控性能。
Comments ICRA 2026
迭代以区分:增强零样本语音合成评估的判别性和可靠性
机构 * Nanjing University(南京大学) ; MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus实验室) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出I2D框架,通过递归合成语音提升零样本TTS评估的判别性和可靠性,实验显示其能提高系统级SRCC至0.464。
Comments submitted to Interspeech 2026, under review
3D-Mix用于VLA:一种用于将基于VGGT的3D信息整合到视觉-语言-动作模型中的即插即用模块
机构 * HIT(哈尔滨工业大学) ; ZGCA(中钢集团自动化研究院) ; ZGCI(中钢集团信息研究院) ; HUST(华中科技大学) ; HKUST(GZ)(香港科技大学(广州)) ; BUAA(北京航空航天大学) ; ECNU(华东师范大学) ; DeepCybo
AI总结 本文提出3D-Mix模块,通过语义条件门控融合机制提升视觉-语言-动作模型的3D感知能力,在标准化基准测试中实现最佳性能。
Comments 13 pages
通过人格提示增强大语言模型的劫持攻击
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Tencent(腾讯)
AI总结 本文通过遗传算法生成人格提示,有效降低大语言模型拒绝率,提升劫持攻击成功率,揭示人格提示对模型安全机制的影响。
Comments Workshop on LLM Persona Modeling at NeurIPS 2025
LGEST: 动态空间-光谱专家路由用于超分辨率图像分类
机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学信息中心(广州)) ; Faculty of Geographical Science, Beijing Normal University(北京师范大学地理学部) ; School of Electronic and Communication Engineering, Guangzhou University(广州大学电子与通信工程学院)
AI总结 本文提出LGEST框架,通过DSAE生成判别性嵌入,结合CIEM-FPN动态融合多尺度特征,利用LGES专家系统提升超分辨率图像分类性能。
基于语言的多智能体规划用于个性化和公平的参与式城市传感
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出MAPUS框架,通过语言协商实现个性化和公平的参与式城市传感,提升参与度和可持续性。
Comments 19 pages, 12 figures
边缘大语言模型有多脆弱?
机构 * China University of Geoscience Beijing(中国地质大学(北京)) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Hong Kong Polytechnic University(香港理工大学) ; Jilin University(吉林大学) ; City University of Hong Kong(香港城市大学) ; Chinese Academy of Sciences(中国科学院) ; City University of Hong Kong (Dongguan)(香港城市大学(东莞))
AI总结 研究探讨了在边缘设备上部署的量化大语言模型在查询基础上的知识提取风险,提出CLIQ框架提升语义覆盖并减少冗余,实验显示其在BERTScore、BLEU和ROUGE指标上优于原始查询,揭示了量化无法有效防护查询提取的潜在安全风险。
超越掩码:通过删除-插入过程实现高效的、灵活的扩散语言模型
机构 * HKUST(香港科技大学) ; Huawei Foundation Model Dept(华为基础模型部门) ; CUHK(香港中文大学)
AI总结 本文提出删除-插入扩散语言模型(DID),通过将token删除和插入作为离散扩散过程,提高训练和推理效率,并提供更灵活的生成机制。
Comments Accepted at ICLR 2026
扫描簇,而非像素:一种以簇为中心的高效超高清图像修复范式
机构 * National University of Defense Technology(国防科技大学) ; HKUST(GZ)(香港理工大学) ; Qilu University of Technology(青岛科技大学) ; Technical University of Munich(慕尼黑技术大学) ; TeleAI, China Telecom(TeleAI,中国电信) ; Beihang University(北航)
AI总结 本文提出C$^2$SSM,通过簇串行扫描替代像素串行扫描,实现超高清图像修复的高效处理,显著降低计算成本并取得新成果。
Comments Aceepted by CVPR26
FlashVGGT: 高效且可扩展的视觉几何变换器与压缩描述符注意力
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)
AI总结 本文提出FlashVGGT,通过压缩描述符注意力机制解决传统自注意力的可扩展性问题,实现高效多视角图像三维重建,实验表明其在精度和效率上优于VGGT。
Comments CVPR2026
统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Westlake University(西交大学) ; Zhejiang University(浙江大学) ; Monash University(墨尔本大学)
AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。
你只需要4个额外的标记:用于LLM的协同测试时间适应
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学)
AI总结 本文提出SyTTA框架,通过输入侧困惑度和输出侧预测熵的协同作用,实现无需标注数据的LLM测试时间适应,显著提升农业问答任务的性能。
Comments Under Review
GeoSketch: 一种基于神经符号的方法,用于几何多模态推理中的辅助线构造与仿射变换
机构 * Fudan University(复旦大学) ; IFLYTEK CO.LTD(若lytek有限公司) ; Zhejiang University(浙江大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Defense Technology(国防科技大学) ; Hainan University(海南大学)
AI总结 GeoSketch通过整合感知、符号推理和绘图动作模块,实现动态几何推理,提升多模态推理的准确性和解决问题的成功率。
UniFunc3D: 统一的主动空间-时间接地用于3D功能分割
机构 * The Hong Kong University of Science and Technology(香港科技大学)
AI总结 UniFunc3D通过统一框架实现3D场景功能分割,利用多模态大语言模型作为主动观察者,结合语义、时间和空间推理,提升任务分解的准确性与效率,实现优于其他方法的性能。
GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染
机构 * HKUST(香港科技大学) ; VAST(中国航空无线电电子研究所) ; Nanyang Technological University(南洋理工大学) ; Tsinghua University(清华大学) ; ShanghaiTech University(上海交通大学)
AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。
Comments Project page: https://igl-hkust.github.io/GO-Renderer
PHANTOM手
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
AI总结 PHANTOM手通过结合精确分析形状与鲁棒合规抓取,实现自由运动规划的亚度精度和连续可预测力输出,提升欠驱动手的负载与灵活性。
Comments 8 pages. Submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
PiCo:主动流形规范化的稳健机器人视觉异常检测
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
AI总结 PiCo通过主动流形规范化解决机器人视觉异常检测在多姿态和不稳定环境下的鲁棒性问题,采用分阶段机制提升几何不确定性和噪声消除能力,实验显示其在静态和闭环场景中均取得显著性能提升。
Comments 16 pages. Submitted to the European Conference on Computer Vision (ECCV) 2026
自动驾驶中的交通标志识别:数据集、基准测试与实地实验
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Lingnan University(岭大) ; Shenzhen Unity Drive Innovation Technology Co., Ltd.(深圳Unity Drive创新技术有限公司) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出TS-1M数据集及诊断基准,通过跨区域识别、稀有类别识别等挑战性任务,评估现代交通标志识别模型的性能,揭示语义对齐对泛化能力的重要性。
VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; South China Normal University(华南师范大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Science and Technology Beijing(北京科技大学) ; National University of Defense Technology(国防科技大学)
AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。
Comments 27 pages, 8 figures