机构
*
Arizona State University(亚利桑那州立大学)
;
Purdue University(普渡大学)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Stanford University(斯坦福大学)
;
The Ohio State University(俄亥俄州立大学)
;
Massachusetts General Hospital(麻省总医院)
;
Harvard Medical School(哈佛医学院)
;
Virginia Polytechnic Institute(弗吉尼亚多项技术学院)
;
University of Michigan(密歇根大学)
;
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
Nanjing University(南京大学)
GEMeX-RMCoT: An Enhanced Med-VQA Dataset for Region-Aware Multimodal Chain-of-Thought Reasoning
Bo Liu, Xiangyu Zhao, Along He, Yidi Chen, Huazhu Fu, Xiao-Ming Wu
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Shenzhen University(深圳大学)
;
West China Hospital of Sichuan University(四川大学华西医院)
;
IHPC, Agency for Science, Technology and Research(科技研究局IHPC)
Multimedia-Aware Question Answering: A Review of Retrieval and Cross-Modal Reasoning Architectures
Rahul Raja, Arpita Vats
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
Boston University(波士顿大学)
专题命中
视觉问答
:grounding(abstract);分类 cs.CV、cs.LG
CommentsIn Proceedings of the 2nd ACM Workshop in AI-powered Question and Answering Systems (AIQAM '25), October 27-28, 2025, Dublin, Ireland. ACM, New York, NY, USA, 8 pages. https://doi.org/10.1145/3746274.3760393
机构
*
New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所模式识别实验室)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Kling Team, Kuaishou Technology(快手科技 Kling 团队)
;
Peking University(北京大学)
;
Nanjing University(南京大学)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.CV、cs.AI
Warehouse Spatial Question Answering with LLM Agent
Hsiang-Wei Huang, Jen-Hao Cheng, Kuang-Ming Chen, Cheng-Yen Yang, Bahaa Alattar, Yi-Ru Lin, Pyongkun Kim, Sangwon Kim, Kwangju Kim, Chung-I Huang, Jenq-Neng Hwang
机构
*
Information Processing Lab, University of Washington, USA(华盛顿大学信息处理实验室)
;
Electronics and Telecommunications Research Institute, South Korea(韩国电子电信研究院)
;
National Center for High-performance Computing, Taiwan(台湾高性能计算国家研究中心)
专题命中
视觉问答
:MLLM(abstract);分类 cs.CV、cs.AI
Comments1st Place Solution of the 9th AI City Challenge Track 3
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
Yan Zhang, Gangyan Zeng, Daiqing Wu, Huawen Shen, Binbin Li, Yu Zhou, Can Ma, Xiaojun Bi
机构
*
Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences Beijing China
;
School of Cyber Science
;
Engineering, Nanjing University of Science
;
VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University Tianjin China
;
Key Laboratory of Ethnic Language Intelligent Analysis
;
Security Governance of MOE, Minzu University of China Beijing China
;
Institute of Information Engineering, Chinese Academy of Sciences
;
School of Cyber Security, University of Chinese Academy of Sciences
;
VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University
;
Security Governance of MOE, Minzu University of China