Yejie Guo, Yunzhong Hou, Wufei Ma, Meng Tang, Ming-Hsuan Yang
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Beijing Institute of Technology(北京理工大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of California Merced(加州大学默塞德分校)
PoSh: Using Scene Graphs To Guide LLMs-as-a-Judge For Detailed Image Descriptions
PoSh:利用场景图引导LLM-as-a-Judge进行详细图像描述
Amith Ananthram, Elias Stengel-Eskin, Lorena A. Bradford, Julia Demarest, Adam Purvis, Keith Krut, Robert Stein, Rina Elster Pantalony, Mohit Bansal, Kathleen McKeown
机构
*
Columbia University(哥伦比亚大学)
;
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
The National Gallery of Art(国家艺术馆)
;
UCLA(加州大学洛杉矶分校)
;
UNC Chapel Hill(北卡罗来纳大学教堂山分校)
SurGo-R1: Benchmarking and Modeling Contextual Reasoning for Operative Zone in Surgical Video
SurGo-R1:手术视频中操作区的上下文推理基准测试与建模
Guanyi Qin, Xiaozhen Wang, Zhu Zhuo, Chang Han Low, Yuancan Xiao, Yibing Fu, Haofeng Liu, Kai Wang, Chunjiang Li, Yueming Jin
机构
*
National University of Singapore, Singapore(新加坡国立大学)
;
Southern Medical University, China(南方医科大学)
;
Guangzhou Research Translation and Innovation Institute, National University of Singapore, China(广州研究翻译与创新研究院,新加坡国立大学,中国)
机构
*
College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海交通大学医学院健康科学与技术学院)
;
Fudan University, Shanghai, China(复旦大学)
;
Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
;
Tsinghua University, Beijing, China(清华大学)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)
;
The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)
;
Ruijin Hospital, Shanghai Jiaotong University, Shanghai, China(上海交通大学瑞金医院)
专题命中
视觉推理
:grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Chatting with Images for Introspective Visual Thinking
与图像对话以进行反思性视觉思维
Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan
机构
*
NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Nanjing University(南京大学)
UrbanGraphEmbeddings: Learning and Evaluating Spatially Grounded Multimodal Embeddings for Urban Science
UrbanGraphEmbeddings: 学习和评估空间导向的多模态嵌入用于城市科学
Jie Zhang, Xingtong Yu, Yuan Fang, Rudi Stouffs, Zdravko Trivic
机构
*
National University of Singapore Department of Architecture Singapore
;
The Chinese University of Hong Kong Dept of Systems Eng. \& Eng. Mgmt. China
;
Singapore Management University School of Computing \& Info. Systems Singapore
;
National University of Singapore
;
Department of Architecture
;
The Chinese University of Hong Kong
;
Singapore Management University
CoTZero: Annotation-Free Human-Like Vision Reasoning via Hierarchical Synthetic CoT
CoTZero:通过分层合成CoT实现无标注的人类级视觉推理
Chengyi Du, Yazhe Niu, Dazhong Shen, Luxin Xu
机构
*
University of Electronic Science and Technology of China(电子科技大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong MMLab(香港中文大学 MMLab)
;
The College of Computer Science and Technology(计算机科学与技术学院)
;
Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
机构
*
Peking University(北京大学)
;
Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院)
;
National University of Singapore(新加坡国立大学)
;
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
University of Science and Technology of China(中国科学技术大学)
;
Cornell University(康奈尔大学)
;
Hong Kong Polytechnic University(香港理工大学)
;
City University of Hong Kong(香港城市大学)
专题命中
视觉推理
:visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
CommentsSubmitted to CVPR 2026. Introduces the QVLM architecture and the SQuID dataset for quantitative geospatial reasoning. Dataset DOI: 10.57967/hf/7565
机构
*
University of Manchester(曼彻斯特大学)
;
Queen Mary University of London(伦敦大学玛丽女王学院)
;
Hongkong University of Science and Technology(香港科学与技术大学)
;
Nanjing University(南京大学)
;
Dartmouth College(达特茅斯学院)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构
*
Shenzhen Stomatology Hospital (Pingshan) of Southern Medical University(南方医科大学深圳口腔医院(平山))
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
State Key Laboratory of Membrane Biology, Beijing Key Laboratory of Cardiometabolic Molecular Medicine, Institute of Molecular Medicine, National Biomedical Imaging Center, School of Future Technology, Peking University(北京大学膜生物学国家重点实验室、北京心代谢分子医学重点实验室、分子医学研究院、国家生物医学成像中心、未来技术学院)
;
Freedom AI
;
Division of Applied Oral Sciences & Community Dental Care Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院应用口腔科学与社区牙科护理系)
;
Beijing Institute of Collaborative Innovation(北京协同创新研究院)
;
National Health Data Institute, Shenzhen(深圳国家健康数据研究院)
;
Shenzhen Loop Area Institute(深圳河套学院)
;
Shenzhen Institute of Big Data(深圳大数据研究院)
专题命中
视觉推理
:multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI