Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding
Symphony:一种受认知启发的多智能体系统用于长视频理解
Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Kuaishou Technology(快手科技)
;
School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Wuhan University(武汉大学)
;
University of North Texas(北卡罗来纳州立大学)
;
Fudan University(复旦大学)
Evidence Packing for Cross-Domain Image Deepfake Detection with LVLMs
跨领域图像深度伪造检测中的证据打包与大视觉语言模型
Yuxin Liu, Fei Wang, Kun Li, Yiqi Nie, Junjie Chen, Zhangling Duan, Zhaohong Jia
机构
*
Anhui University(安徽大学)
;
Hefei University of Technology(合肥工业大学)
;
IAI, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)
;
United Arab Emirates University(阿拉伯联合酋长国大学)
Concept-to-Pixel: Prompt-Free Universal Medical Image Segmentation
概念到像素:无提示通用医学图像分割
Haoyun Chen, Fenghe Tang, Wenxin Ma, Shaohua Kevin Zhou
机构
*
School of Biomedical Engineering, Division of Life Sciences
;
Medicine, University of Science
;
Technology of China (USTC), Hefei, Anhui 230026, China Center for Medical Imaging, Robotics, Analytic Computing \& Learning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou, Jiangsu 215123, China Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123, China State Key Laboratory of Precision
专题命中
视觉定位与Grounding
:multimodal large language model(abstract);分类 cs.CV
Deploying Semantic ID-based Generative Retrieval for Large-Scale Podcast Discovery at Spotify
在Spotify上部署基于语义ID的生成检索用于大规模播客发现
Edoardo D'Amico, Marco De Nadai, Praveen Chandar, Divita Vohra, Shawn Lin, Max Lefarov, Paul Gigioli, Gustavo Penha, Ilya Kopysitsky, Ivo Joel Senese, Darren Mei, Francesco Fabbri, Oguz Semerci, Yu Zhao, Vincent Tang, Brian St. Thomas, Alexandra Ranieri, Matthew N. K. Smith, Aaron Bernkopf, Bryan Leung, Ghazal Fazelnia, Mark VanMiddlesworth, Timothy Christopher Heath, Petter Pehrson Skiden, Alice Y. Wang, Doug J. Cole, Andreas Damianou, Maya Hristakeva, Reid Wilbur, Tarun Chillara, Vladan Radosavljevic, Pooja Chitkara, Sainath Adapa, Juan Elenter, Bernd Huber, Jacqueline Wood, Saaketh Vedantam, Jan Stypka, Sandeep Ghael, Martin D. Gould, David Murgatroyd, Yves Raimond, Mounia Lalmas, Paul N. Bennett
PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation
PCA-Seg:重新审视开放词汇语义和部分分割中的成本聚合
Jianjian Yin, Tao Chen, Yi Chen, Gensheng Pei, Xiangbo Shu, Yazhou Yao, Fumin Shen
机构
*
Nanjing University of Science and Technology(南京理工大学)
;
Nanjing Normal University(南京师范大学)
;
Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系)
;
University of Electronic Science and Technology of China(电子科技大学)
;
State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)
CommentsThis paper constitutes a substantially extended version of a conference article to be published in the proceedings of the International Conference on Enterprise Information Systems ICEIS 2026