PhotoCraft: Agentic Reasoning with Hierarchical Self-Evolving Memory for Deep Image Search
PhotoCraft: 具有层次自进化记忆的深度图像搜索代理推理
Kailin Lyu, Zhiqiang Yuan, Jianwei He, Qiwei Yan, Xuanbo Su, Nanxing Hu, Yang Liu, Ce Hao, Shengqian Qin, Lianyu Hu, Jinchao Zhang, Jie Zhou
机构
*
Pattern Recognition Center, WeChat AI, Tencent Inc.(微信AI模式识别中心,腾讯公司)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Zhongguancun Academy(中关村学院)
;
Nanyang Technological University(南洋理工大学)
;
Shanghai Jiao Tong University(上海交通大学)
Mining Multi-Modality Spatio-Temporal Cues for Video Important Person Identification
挖掘多模态时空线索用于视频重要人物识别
Xiao Wang, Minglei Yang, Bin Yang, Wenke Huang, Zheng Wang, Xin Xu, Mang Ye
机构
*
School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院)
;
Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System, Wuhan University of Science and Technology(湖北省智能信息处理与实时工业系统重点实验室)
;
School of Computer Science, National Engineering Research Center for Multimedia Software, Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University(计算机科学学院,国家多媒体软件工程技术研究中心,湖北省多媒体与网络通信工程重点实验室,武汉大学)
;
College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
机构
*
Chongqing University(重庆大学)
;
Tianjin University(天津大学)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院MAIS)
;
Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局高性能计算研究所)
;
Chongqing National Data AI Research Institute, AI Research Lab(重庆国家数据AI研究院,AI研究实验室)
GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
Jeong Hun Yeo, Sangyun Chung, Sungjune Park, Dae Hoe Kim, Jinyoung Moon, Yong Man Ro
机构
*
Integrated Vision and Language Lab., School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(整合视觉与语言实验室,电气工程学院,韩国科学技术院(KAIST))
;
Visual Intelligence Research Section, Superintelligence Creative Research Laboratory, Electronics and Telecommunications Research Institute (ETRI)(视觉智能研究部,超智能创意研究实验室,电子电信研究院)
CommentsThe 1st place report of 7th LSVOS challenge RVOS track in ICCV 2025. The code is released in Sa2VA repository: https://github.com/bytedance/Sa2VA