LLM-Powered Flood Depth Estimation from Social Media Imagery: A Vision-Language Model Framework with Mechanistic Interpretability for Transportation Resilience
ENC-Bench: A Benchmark for Evaluating Multimodal Large Language Models in Electronic Navigational Chart Understanding
ENC-Bench:用于评估多模态大语言模型在电子航海图理解中的基准
Ao Cheng, Xingming Li, Xuanyu Ji, Xixiang He, Qiyao Sun, Chunping Qiu, Runke Huang, Qingyong Hu
机构
*
National University of Defense Technology(国防科技大学)
;
Intelligent Game and Decision Lab(智能游戏与决策实验室)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
Benchmarking Multi-Agent LLM Architectures for Financial Document Processing: A Comparative Study of Orchestration Patterns, Cost-Accuracy Tradeoffs and Production Scaling Strategies
多代理LLM架构在金融文档处理中的基准测试:协作模式、成本准确性权衡及生产扩展策略的比较研究
Siddhant Kulkarni, Yukta Kulkarni
机构
*
Department of Computer Science and Engineering(计算机科学与工程系)
;
New York University(纽约大学)
;
New York, NY 10012(纽约市NY 10012)
机构
*
National Key Laboratory for Novel Software Technology & School of Artificial Intelligence, Nanjing University(新型软件技术国家重点实验室 & 智能科学与技术学院,南京大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shenzhen Research Institute of Big Data(大数据研究院(深圳))
;
Shenzhen Loop Area Institute(深圳河套学院)
I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes
我来了,我看到了,我解释了:在表情包中评估多模态大语言模型的隐喻意义
Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli
机构
*
MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
National Research Council Canada(加拿大国家研究委员会)
Towards Self-Evolving Benchmarks: Synthesizing Agent Trajectories via Test-Time Exploration under Validate-by-Reproduce Paradigm
迈向自演化基准:通过验证-再生产范式下的测试时间探索合成代理轨迹
Dadi Guo, Tianyi Zhou, Dongrui Liu, Chen Qian, Qihan Ren, Shuai Shao, Zhiyuan Fan, Yi R. Fung, Kun Wang, Linfeng Zhang, Jing Shao
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Hong Kong University of Science and Technology(香港科技大学)
;
University of Michigan(密歇根大学)
;
Renmin University of China(中国人民大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
Traffic Sign Recognition in Autonomous Driving: Dataset, Benchmark, and Field Experiment
自动驾驶中的交通标志识别:数据集、基准测试与实地实验
Guoyang Zhao, Weiqing Qi, Kai Zhang, Chenguang Zhang, Zeying Gong, Zhihai Bi, Kai Chen, Benshan Ma, Ming Liu, Jun Ma
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Lingnan University(岭大)
;
Shenzhen Unity Drive Innovation Technology Co., Ltd.(深圳Unity Drive创新技术有限公司)
;
The Hong Kong University of Science and Technology(香港科技大学)
机构
*
Tsinghua University(清华大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Tianjin University(天津大学)
;
Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)
;
HKUST (Guangzhou)(香港科技大学(广州))
;
National University of Defense Technology(国防科技大学)
;
Beihang University(北航)
;
Beijing Information Science and Technology University(北京信息科技大学)
;
Artificial Intelligence Institute of China Electronics Technology Group Corporation(中国电子科技集团人工智能研究院)