Coarse-Guided Visual Generation via Weighted h-Transform Sampling
通过加权h变换采样实现粗引导的视觉生成
机构 * The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出一种基于h变换的粗引导视觉生成方法,通过调整采样步骤的概率过渡,结合噪声水平感知调度,提升生成质量与泛化能力。
高校专区
通过加权h变换采样实现粗引导的视觉生成
机构 * The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出一种基于h变换的粗引导视觉生成方法,通过调整采样步骤的概率过渡,结合噪声水平感知调度,提升生成质量与泛化能力。
FastVMT:消除视频运动迁移中的冗余
机构 * EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室) ; HKUST(香港科技大学) ; THU(清华大学) ; Meta ; ETH Zürich(苏黎世联邦理工学院)
AI总结 本文提出FastVMT,通过消除DiT架构中的运动和梯度冗余,实现视频运动迁移的加速,提升生成视频的效率而不影响视觉质量和时间一致性。
Comments Accepted by ICLR2026, Project page: fastvmt.gitHub.io, Code: https://github.com/mayuelala/FastVMT
面向目标的图像编辑通过循环一致约束
机构 * The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出FlowCycle框架,通过循环一致约束生成目标感知的中间状态,提升图像编辑的准确性和一致性。
PANTHER:超越语言的生成预训练用于序列用户行为建模
机构 * Shanghai Jiao Tong University(上海交通大学) ; WeChat Pay, Tencent(微信支付,腾讯) ; Shanghai Innovation Institute(上海创新研究院) ; City University of Hong Kong(香港城市大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 PANTHER通过生成预训练方法,结合生成与判别模型,实现用户行为序列的高效建模,提升交易预测和欺诈检测性能。
重新审视超光谱图像下的对抗训练
机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Engineering Research Center of Blockchain Application, Supervision and Management, Ministry of Education, Southeast University(东南大学教育部区块链应用监管工程研究中心) ; Purple Mountain Laboratories(紫金山实验室) ; Collaborative Innovation Center of Geospatial Technology, Wuhan University(武汉大学地理空间技术协同创新中心) ; Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)
AI总结 本文针对超光谱图像分类中对抗攻击的脆弱性问题,提出两种专为超光谱设计的对抗训练方法,以缓解对抗扰动导致的语义信息破坏。
跟随你的动作:通过高效的时空解耦微调实现视频动作迁移
机构 * HKUST(香港科技大学) ; HKUST(GZ)(香港科技大学(广州)) ; Tsinghua University(清华大学) ; XIntelligence Technology Co., Limited(星云科技股份有限公司) ; SJTU(上海交通大学)
AI总结 本文提出Follow-Your-Motion框架,通过高效的时空解耦微调方法,解决视频扩散变换器在动作迁移中的不一致性和效率问题,并引入MotionBench基准进行验证。
Comments Accepted by ICLR 2026, project page: https://follow-your-motion.github.io/
MM-DADM:多模态药物感知扩散模型用于虚拟临床试验
机构 * Zhejiang University(浙江大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出MM-DADM,一种多模态药物感知扩散模型,用于生成个性化药物诱导ECG。通过动态交叉注意模块融合外部物理知识,解决形态真实性和病理灵活性的平衡问题,并利用因果特征编码器提取纯药理表示,提升模拟准确性和召回率。
Comments Under review
专家流:通过多芯片组架构和动态专家轨迹调度加速低批次MoE推理
机构 * AI Chip Center for Emerging Smart Systems(新兴智能系统芯片中心) ; The Hong Kong University of Science and Technology(香港科技大学) ; Shanghai UniVista Industrial Software Group Co., Ltd.(上海华大九天工业软件集团有限公司)
AI总结 本文提出FSE-DP架构,通过多芯片组上的细粒度专家流调度,解决低批次MoE推理中的内存限制和负载不均问题,实现性能提升和内存节省。
无需标注的 drivable 区域和路障检测:利用 LiDAR 点云地图
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出 MADL 模块,通过 LiDAR 地图与路障检测结合,自动生成训练数据,提升 drivable 区域和路障检测的鲁棒性和准确性。
弥合可验证奖励下的视觉表征与强化学习在大视觉-语言模型中的应用
机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) ; Huawei(华为) ; HKUST (GZ)(香港科技大学(广州))
AI总结 本文提出KAWHI机制,通过整合结构化视觉信息提升大视觉-语言模型的多模态推理性能,改进现有统一奖励优化方法。
Comments Homepage: \url{https://kawhiiiileo.github.io/KAWHI_PAGE/}
管内机器人接触角引导的运动解耦设计
机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)机器人与自主系统学域) ; Department of Engineering, Shinshu University(信州大学工学部) ; College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院)
AI总结 本文提出一种管内机器人,通过接触角引导的运动解耦机制,实现轴向牵引与滚动重新定向的独立驱动,有效抑制噪声干扰,实验验证了其在垂直管道中的稳定性和高效性。
MotionCrafter: 通过4D VAE实现密集几何与运动重建
机构 * NTU(南洋理工大学) ; ARC Lab, Tencent PCG(腾讯PCG ARC Lab) ; HKUST(香港科技大学) ; CUHK(SZ)(香港中文大学(深圳)) ; Monash University(莫纳什大学)
AI总结 MotionCrafter通过4D VAE联合重建4D几何和估计密集运动,采用共享坐标系下的点云与场景流联合表示,提升重建质量。
Comments Project page: https://ruijiezhu94.github.io/MotionCrafter_Page
AppellateGen:上诉法律判决生成的基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Ocean University of China(中国海洋大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Cornell University(康奈尔大学)
AI总结 本文提出AppellateGen基准测试,包含7351个案例对,用于生成上诉阶段的法律判决,通过模拟司法流程验证模型在上诉推理中的逻辑一致性与挑战。
Comments 15 pages, 4 figures, 3 tables
NeAR:耦合神经资产-渲染堆栈
机构 * BUAA(北京航空航天大学) ; BAAI(北京智源人工智能研究院) ; FNii, CUHKSZ(香港中文大学(深圳)未来网络创新研究院) ; HKUST(香港科技大学) ; NJU(南京大学) ; UniTn(特伦托大学) ; ZJU(浙江大学) ; NTU(南洋理工大学) ; THU(清华大学) ; BNU(北京师范大学) ; SSE, CUHKSZ(香港中文大学(深圳)理工学院) ; AIR, THU(清华大学智能产业研究院)
AI总结 NeAR通过耦合资产表示与渲染器设计,提升生成质量和一致性。引入Lighting-Homogenized SLAT和光照感知解码器,实现实时可重照明的3D高斯溅射生成,优于现有方法。
Comments Accepted by CVPR 2026. The project page: https://near-project.github.io/
从探索到利用:一种两阶段熵RLVR方法用于噪声容忍的多模态大语言模型训练
机构 * Independent Researcher(独立研究者) ; The Chinese University of Hong Kong(香港中文大学) ; City University of Hong Kong(香港城市大学) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Hong Kong(香港大学)
AI总结 本文提出一种两阶段熵优化方法,通过探索阶段提升输出多样性,利用阶段提高预测准确性,增强噪声容忍能力,实验证明在不同模型和任务中均优于现有方法。
MMEdge: 通过流水线传感和编码加速设备端多模态推理
机构 * Hong Kong University of Science and Technology(香港科技大学)
AI总结 MMEdge提出一种基于流水线传感和编码的设备端多模态推理框架,通过细粒度传感和编码单元实现增量计算,结合轻量级时间聚合模块和自适应配置优化器,降低延迟并保持高精度。
Comments Code available at: https://github.com/HKUST-MINSys-Lab/MMEdge. Accepted by SenSys 2026
理解大语言模型中锚定效应的锚定作用:存在性、机制与潜在缓解方法
机构 * The Hong Kong University of Science and Technology, Guangzhou(香港科技大学(广州)) ; Independent Researcher(独立研究员)
AI总结 本文研究大语言模型是否受锚定效应影响,揭示其机制并提出缓解策略,通过SynAnchors数据集验证了LLM存在锚定偏误,浅层结构难以消除,而推理能部分缓解。
Comments Accepted by the HCAIR workshop of ICLR 2026
高效多专家模型用于基于视频的驾驶员状态和生理多任务估计在条件自动驾驶中
机构 * the Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Hong Kong(香港大学)
AI总结 本文提出VDMoE模型,通过RGB视频和远程PPG数据监测驾驶员状态,优化多专家框架以提升多模态输入下的检测效率与准确性,通过新数据集验证其在条件自动驾驶中的有效性。
LACON:从未整理数据中训练文本到图像模型
机构 * Nanjing University(南京大学) ; Microsoft Research(微软研究院) ; HKUST(香港科技大学)
AI总结 LACON通过利用未整理数据分布,将质量信号作为条件标签,提升生成质量,证明了未整理数据的价值。
超越视角泛化:多视角演示提供了什么以及如何为机器人操作合成它们
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Shenzhen University(深圳大学) ; Beijing Jiaotong University(北京交通大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
AI总结 研究通过实验验证多视角演示在机器人操作中的性能提升,揭示了多视角数据在提升泛化能力和突破单视角限制方面的优势,提出RoboNVS框架合成多视角数据以提升下游政策表现。
反思以获取信息:通过信息增益驱动的验证提升多模态推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Foundation Model Department(华为基础模型部) ; The Chinese University of Hong Kong(香港中文大学) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出VRE框架,通过信息增益驱动的自我进化训练,提升多模态大语言模型的推理准确性和感知可靠性,减少幻觉,尤其在长链任务中效果显著。
SDDF: 专门性驱动的动态聚焦用于开放词汇伪装物体检测
机构 * Shenzhen University(深圳大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出SDDF方法,通过专门性感知子描述和动态聚焦提升开放词汇伪装物体检测性能,在OVCOD-D基准上达到56.4的AP。
Comments Accepted by CVPR2026
通过平衡微调对齐大语言模型与生物医学知识
机构 * Tencent AI for Life Sciences Lab(腾讯AI生命科学实验室) ; Sun Yat-sen University(中山大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Westlake University(西湖大学) ; The Hong Kong University of Science and Technology(香港科技大学)
AI总结 本文提出平衡微调方法,通过双尺度后训练技术提升大语言模型对生物医学知识的理解与生成能力,实验表明其在医疗和生物学推理任务中优于传统方法。
多功能的感知图像超分辨率:考虑再压缩
机构 * AIR, Tsinghua University(清华大学智能产业研究院) ; AGUS Tech ; HKUST(香港科技大学) ; Kuaishou Technology(快手科技)
AI总结 本文提出VRPSR,通过将压缩建模为条件文本到图像生成,利用预训练扩散模型构建通用编码器模拟器,并提出针对感知超分辨率的训练技术,实现SR与再压缩的联合优化,取得10%-40%的比特率节省。
VG-Mapping:面向半静态场景的变分感知密度控制在线3D高斯映射
机构 * Southern University of Science and Technology(南方科技大学) ; CKS Robotics Institute, Hong Kong University of Science and Technology(香港科技大学CKS机器人研究所)
AI总结 本文提出VG-Mapping,通过变分感知密度控制策略提升半静态场景在线3D高斯映射的更新效率与渲染质量,同时构建了包含合成与真实数据的RGB-D数据集。
基于纳尔瓦启发的传感-控制框架用于小型固定翼飞机
机构 * California Institute of Technology(加州理工学院) ; Technology Innovation Institute(技术创新研究所) ; HKUST (Guangzhou)(香港科技大学(广州))
AI总结 本文提出一种生物启发的传感-控制框架,通过多孔探头和稀疏翼压传感器测量空气流,结合数据驱动校准和控制-仿射动力学模型,提升小型固定翼无人机在低速时的敏捷性与控制精度。
在未见数据分布偏移下实现稳健的预测建模:一种方法论评论
机构 * Hong Kong University of Science and Technology(香港科技大学) ; University of Notre Dame(圣母大学)
AI总结 本文通过实际客户流失案例,指出训练与测试数据分布不一致的问题,并探讨领域泛化方法,提出采用不确定性意识的预测建模方法以提升模型鲁棒性。
Comments Forthcoming in Information Systems Research
UNIC:基于神经变形场的神经服装变形用于实时穿衣角色动画
机构 * HKUST(香港科技大学) ; Waseda(早稻田大学) ; MIT(麻省理工学院) ; CMU(卡内基梅隆大学) ; HKU(香港大学) ; NTU(南洋理工大学) ; TAMU(德克萨斯农工大学)
AI总结 本文提出UNIC方法,通过实例特定的神经变形场实时动画角色服装,无需泛化到新服装,提升变形质量和训练效率。
Comments Project page: https://igl-hkust.github.io/UNIC/
GeoHeight-Bench:迈向遥感中基于高度的多模态推理
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Technical University of Munich(慕尼黑工业大学)
AI总结 本文提出GeoHeight-Bench,通过构建高度感知的遥感理解评估框架,解决现有多模态模型在复杂遥感几何和灾害场景中忽略垂直维度的问题,提出数据生成管道和基准测试,并验证高度感知的重要性。
Comments 18 pages, 4 figures
超越内容安全:大型语言模型推理漏洞的实时监控
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University of Technology(浙江工业大学)
AI总结 本文提出实时监控方法,识别大型语言模型推理过程中的安全漏洞,定义九类不安全推理行为,并通过实验验证其有效性,展示了推理安全的重要性。