DIMOS: Disentangling Instance-level Moving Object Segmentation
DIMOS: 解耦实例级运动目标分割
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 提出双解耦特征提取框架分离图像与事件模态的外观和运动信息,并通过多粒度跨模态对齐实现有效融合,在运动实例分割任务中尤其对快速运动和低光下的小目标取得最优性能。
高校专区
DIMOS: 解耦实例级运动目标分割
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 提出双解耦特征提取框架分离图像与事件模态的外观和运动信息,并通过多粒度跨模态对齐实现有效融合,在运动实例分割任务中尤其对快速运动和低光下的小目标取得最优性能。
Bayesian-Agent:面向LLM Agent框架的后验引导技能演化
机构 * IDEA Research(IDEA研究院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; DataArcTech Ltd.(DataArcTech有限公司)
AI总结 提出Bayesian-Agent框架,将可复用技能视为假设,通过后验分布指导技能演化(如修补、拆分、压缩等),在多个基准上显著提升性能,表明Agent技能演化应视为后验引导的框架优化。
Comments 20 pages, 11 figures
通过解耦概念瓶颈缓解多媒体识别中的虚假背景偏差
机构 * HKUST(GZ)(香港科技大学(广州))
AI总结 本文提出轻量解耦概念瓶颈模型LDCBM,通过滤波分组损失和联合概念监督提升视觉模式与概念的对齐,实验证明其在概念和分类准确率上优于现有CBMs,且计算复杂度更低。
DreamOmni3:基于涂鸦的编辑与生成
机构 * CUHK(香港中文大学) ; ByteDance Inc(字节跳动公司) ; HKUST(香港科技大学)
AI总结 DreamOmni3通过结合文本、图像和自由手绘涂鸦,实现更灵活的图形用户界面编辑与生成,解决了复杂编辑任务中的数据创建和框架设计问题。