AV-Master: Dual-Path Comprehensive Perception Makes Better Audio-Visual Question Answering
AV-Master:双路径综合感知实现更优的音频视觉问答
Jiayu Zhang, Shuo Ye, Qilang Ye, Xun Lin, Zihan Song, Zitong Yu
机构
*
Great Bay University(大湾区大学)
;
Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室)
;
Nankai University(南开大学)
;
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
The Chinese University of Hong Kong(香港中文大学)
ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
ClinFusion:用于整体医学理解的以视觉为中心的多模态大语言模型系统
Hangjie Yuan, Yichen Qian, Zhiwei Tang, Xianzhe Xu, Lirong Wu, Sicheng Yang, Jinwang Wang, Pengju Wang, Zhitao Zeng, Yizeng Han, Yan Xing, Shengxuan Luo, Tao Feng, Qing Xie, Weigen Yao, Yi Yang, Zuozhu Liu, Jiasheng Tang, Shaocheng Wang, Jitao Wang, Jiahong Dong, Weihua Chen, Feng Xu, Fan Wang
机构
*
DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)
;
Hupan Laboratory(湖畔实验室)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
;
Department of Radiology, The Affiliated Yangming Hospital of Ningbo University(宁波大学附属阳明医院放射科)
;
Zhejiang University-University of Illinois Urbana-Champaign Institute, Zhejiang University(浙江大学伊利诺伊大学厄巴纳香槟校区联合学院,浙江大学)
;
Hepato-Pancreato-Biliary Center, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华长庚医院肝胆胰中心,清华大学临床医学院,清华医学,清华大学)
;
School of Software, Tsinghua University(清华大学软件学院)
;
Beijing National Research Center for Information Science and Technology, Tsinghua University(清华大学北京信息科学与技术国家研究中心)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Enhancing Pathological VLMs with Cross-scale Reasoning
增强病理视觉语言模型的跨尺度推理能力
Chi Phan, Tianyi Zhang, Qiaochu Xue, Yufeng Wu, Dan Hu, Zeyu Liu, Sudong Wang, Yueming Jin
机构
*
Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)
;
PuzzleLogic Pte Ltd(PuzzleLogic私人有限公司)
;
Department of Pathology, Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院病理科暨福建省肿瘤医院)
机构
*
College of Software, Nankai University, China(南开大学软件学院)
;
The University of Hong Kong, China(香港大学)
;
NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国)
;
AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国)
;
A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)
Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization
基于LLM增强优化的无人机低空经济网络高效机载视觉-语言推理
Yang Li, Ruichen Zhang, Yinqiu Liu, Guangyuan Liu, Abbas Jamalipour, Xianbin Wang, Dong In Kim
机构
*
College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院、新加坡国立科技大学)
;
The University of Sydney, Sydney, Australia(悉尼大学、澳大利亚悉尼)
;
Department of Electrical and Computer Engineering, Western University, London, Canada(电气与计算机工程系、西方大学、加拿大伦敦)
;
Department of Electrical and Computer Engineering, Sungkyunkwan University, South Korea(电气与计算机工程系、全州大学、韩国)
DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving
DRIVESPATIAL:自动驾驶中视觉语言模型时空智能的基准
Hao Vo, Khoa Vo, Phu Loc Nguyen, Sieu Tran, Duc Minh Nguyen, Ngo Xuan Cuong, Gladys Gawugah, Sreevenkata Anjani Tishita Godavarthi, Chase Rainwater, Nghi D. Q. Bui, Anh Nguyen, Duy Minh Ho Nguyen, Ngan Le
机构
*
University of Arkansas, USA(美国阿肯色大学)
;
Google Research, Google(谷歌研究院)
;
University of Liverpool, UK(英国利物浦大学)
;
Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校)
FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding
FORGE:用于长视频理解的相关几何中的帧正交性
Ghazal Kaviani, Ghassan AlRegib
机构
*
Georgia Institute of Technology(佐治亚理工学院)
;
Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP))
;
School of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中
视觉问答
:multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG
Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge
深度专家注入用于带有领域特定知识的视网膜视觉语言模型的锚定
Shuai Lu, Meng Wang, Jia Guo, Jiawei Du, Bo Liu, Shengzhu Yang, Weihang Zhang, Huazhu Fu, Huiqi Li
机构
*
Beijing Institute of Technology, Beijing, China(北京理工大学)
;
National University of Singapore, Singapore(新加坡国立大学)
;
Tsinghua University, Beijing, China(清华大学)
;
The Hong Kong Polytechnic University, Hong Kong(香港理工大学)
专题命中
视觉问答
:vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
CommentsAccepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)
AgroOmni: A Large-Scale Multi-view Agricultural Dataset for Cross-Scale Multimodal Reasoning
AgroOmni:一个大规模多视角农业数据集用于跨尺度多模态推理
Jiarui Zhang, Junqi Hu, Zurong Mai, Yang Liu, Yuhang Chen, Shuohong Lou, Henglian Huang, Hong Cheng, Lingyuan Zhao, Jianxi Huang, Yutong Lu, Haohuan Fu, Juepeng Zheng
机构
*
Sun Yat-sen University(中山大学)
;
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
HuanTian Wisdom Technology Co., Ltd.(慧天智慧科技有限公司)
;
China Agricultural University(中国农业大学)
;
Southwest Jiaotong University(西南交通大学)
;
National Supercomputing Center in Shenzhen(深圳国家超算中心)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
视觉问答
:visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI