MM-UAVBench: How Well Do Multimodal Large Language Models See, Think, and Plan in Low-Altitude UAV Scenarios?
MM-UAVBench: 多模态大语言模型在低空无人机场景中的感知、推理与规划能力如何?
Shiqi Dai, Zizhi Ma, Zhicong Luo, Xuesong Yang, Yibin Huang, Wanyue Zhang, Chi Chen, Zonghao Guo, Wang Xu, Yufei Sun, Maosong Sun
机构
*
Tsinghua University(清华大学)
;
Nankai University(南开大学)
;
Northwest Polytechnical University(西北工业大学)
;
Chinese Academy of Sciences(中国科学院)
;
Harbin Institute of Technology(哈尔滨工业大学)
专题命中
视觉定位与Grounding
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
GeoViS: Geospatially Rewarded Visual Search for Remote Sensing Visual Grounding
GeoViS: 基于地理奖励的视觉搜索用于遥感视觉定位
Peirong Zhang, Yidan Zhang, Luxiao Xu, Jinliang Lin, Zonghao Guo, Fengxiang Wang, Xue Yang, Kaiwen Wei, Lei Wang
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
National University of Defense Technology(国防科技大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Chongqing University(重庆大学)
专题命中
视觉定位与Grounding
:grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV
ChartPoint: Guiding MLLMs with Grounding Reflection for Chart Reasoning
ChartPoint: 通过 grounding 反射引导 MLLMs 进行图表推理
Zhengzhuo Xu, SiNan Du, Yiyan Qi, SiwenLu, Chengjin Xu, Chun Yuan, Jian Guo
机构
*
Tsinghua University(清华大学)
;
International Digital Economy Academy(国际数字经济学院)
;
Beihang University(北航)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中
视觉定位与Grounding
:grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI
机构
*
Hong Kong Baptist University(香港 Baptist 大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
National University of Singapore(新加坡国立大学)
专题命中
视觉定位与Grounding
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
VideoTG-R1: Boosting Video Temporal Grounding via Curriculum Reinforcement Learning on Reflected Boundary Annotations
Lu Dong, Haiyu Zhang, Han Lin, Ziang Yan, Xiangyu Zeng, Hongjie Zhang, Yifei Huang, Yi Wang, Zhen-Hua Ling, Limin Wang, Yali Wang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Beihang University(北京航空航天大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Zhejiang University(浙江大学)
;
State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
;
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中
视觉定位与Grounding
:grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV
机构
*
School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
School of Computing and Information Technology, Great Bay University(大亚湾大学计算机与信息科技学院)
;
College of Computer Science, Nankai University(南开大学计算机学院)
;
School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)
;
Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)
;
National Engineering Laboratory of Big Data System Computing Technology, Shenzhen University(大数据系统计算技术国家工程实验室)
专题命中
视觉定位与Grounding
:multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV
CommentsAccepted by IEEE Transactions on Instrumentation and Measurement (TIM)
Journal refProc. IEEE International Conference on Data Mining Workshops (ICDMW 2025), Workshop on Multimodal AI (MMAI 2025), Los Angeles, USA, December 2025
When Language Model Guides Vision: Grounding DINO for Cattle Muzzle Detection
Rabin Dulal, Lihong Zheng, Muhammad Ashad Kabir
机构
*
School of Computing, Mathematics and Engineering(计算数学与工程学院)
;
Charles Sturt University(查尔斯·斯特劳特大学)
;
Gulbali Institute for Agriculture, Water and Environment(古尔巴利农业、水与环境研究所)
;
Food Agility CRC Ltd(食品敏捷性CRC有限公司)
机构
*
Department of Engineering Science, University of Oxford(工程科学系,牛津大学)
;
Department of Automation, Tsinghua University(自动化系,清华大学)
;
School of Information Science and Technology, Northwest University(信息科学与技术学院,西北大学)
专题命中
视觉定位与Grounding
:vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV