Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System
推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统
Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen
机构
*
Fudan University(复旦大学)
;
College of Future Information Technology(未来信息技术学院)
;
Shanghai Innovation Institute(上海创新研究院)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
视觉推理
:MLLM(title,title_cn);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结
本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
School of Advanced Interdisciplinary Sciences(先进交叉科学学院)
;
School of Electronic, Electrical and Communication Engineering(电子电气与通信工程学院)
;
Shenzhen Institutes of Advanced Technology(深圳先进技术研究院)
专题命中
视觉推理
:MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams
Diagram-MMU:面向科学图表的多模态基准测试
Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang
机构
*
Nanjing University of Science and Technology(南京理工大学)
;
Baidu Inc(百度公司)
;
AIML, Adelaide University(阿德莱德大学AIML)
;
SUTD(新加坡科技设计大学)
;
Southeast University(东南大学)
;
East China Normal University(华东师范大学)
;
University of Oxford(牛津大学)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV、cs.AI
机构
*
Hangzhou Institute for Advanced Study(杭州高等研究院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Computer Network Information Center(计算机网络信息中心)
;
Chinese Academy of Sciences(中国科学院)
机构
*
School of Software Technology, Zhejiang University(浙江大学软件学院)
;
College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)
;
School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院)
;
Graduate School of Information Science, Hokkaido University(北海道大学信息科学研究院)
专题命中
视觉推理
:multimodal large language model(abstract)
Test-Time Hallucination Control in Large Vision-Language Models
大型视觉语言模型的测试时幻觉控制
Mehran Tamjidi, Hamidreza Dastmalchi, Ali Cheraghian, Mohammadreza Alimoradijazi, Aijun An, Hossein Rahmani
机构
*
Australian National University(澳大利亚国立大学)
;
The University of New South Wales(新南威尔士大学)
;
University of Technology Sydney(悉尼科技大学)
;
York University(约克大学)
;
Lancaster University(兰卡斯特大学)