Cross-Resolution Semantic Transfer for Robust Text-to-Image Retrieval in Low-Resolution Surveillance
跨分辨率语义迁移用于低分辨率监控下的鲁棒文本-图像检索
Wenjie Qian, Bin Yang, Xiao Wang, Wenke Huang, Ling Mei, Xin Xu, Mang Ye
机构
*
School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院)
;
School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University(武汉大学计算机学院,国家多媒体软件工程技术研究中心)
;
Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System, Wuhan University of Science and Technology(湖北省智能信息处理与实时工业系统重点实验室,武汉科技大学)
机构
*
Harbin Institute of Technology(哈尔滨工业大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院)
;
Nankai University(南开大学)
CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation
CCRC:面向图像变化描述与分割的变化感知描述与推理链
Jinhong Hu, Xiaoping Wang, Shuyin Huang, Guojin Zhong, Kaitai Liu, Kai Lu
机构
*
College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国)
;
Guangxi Minzu University, China(广西民族大学,中国)
;
National University of Defense Technology, China(国防科学技术大学,中国)
UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception
UniGP:驯服扩散Transformer以实现先验保留的统一生成与感知
Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
DAMO Academy, Alibaba Group(阿里云达摩院)
;
Hupan Lab(虎扑实验室)
;
Zhejiang University(浙江大学)
;
Tsinghua University(清华大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Zeekr Automobile R&D Co., Ltd.(小鹏汽车研发有限公司)
Envisage: Diffusion-Based Rhinoplasty Goal Visualization with Mask-Decomposed Evaluation
Envisage:基于扩散的鼻整形目标可视化与掩码分解评估
Mudit Agarwal, Amit D. Bhrany
机构
*
University of Washington(华盛顿大学)
;
University of Washington School of Medicine(华盛顿大学医学院)
;
Department of Otolaryngology–Head and Neck Surgery(耳鼻喉科–头颈外科部门)
X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models
X-DiffVLA:面向视觉-语言-动作模型的跨具身扩散动作头
Boyu Li, Chaoyi Xu, Haoqi Yuan, Xinrun Xu, Börje F. Karlsson, Haoran Li, Zongqing Lu, Dongbin Zhao
机构
*
SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(SKL-MAIS,自动化研究所,中国科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
BeingBeyond
;
School of Computer Science, Peking University(北京大学计算机学院)
Beyond Point Estimates for Glaucoma Visual Field Forecasting with Diffusion Models
超越点估计:基于扩散模型的青光眼视野预测
Marta Colmenar Herrera, Pablo Márquez Neila, Şerife Seda Kucur Ergünay, Martin S. Zinkernagel, Raphael Sznitman
机构
*
ARTORG Center for Biomedical Engineering Research, UniBe, Switzerland(瑞士UniBe生物医学工程研究中心ARTORG)
;
PeriVision SA, Epalinges, Switzerland(瑞士Epalinges市PeriVision公司)
;
Department of Ophthalmology, Inselspital, Bern, Switzerland(瑞士伯恩Inselspital眼科部门)
机构
*
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, China(中国科学院大学先进交叉学科学院)
;
State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, China(中国科学院脑认知与脑启发智能技术国家重点实验室)
;
School of Future Technology, University of Chinese Academy of Sciences, China(中国科学院大学未来技术学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院)