Empirical Evaluation of Out-Of-Distribution Performance of Tabular Foundation Models
表格基础模型的分布外性能实证评估
Malena Loza, David Chushig-Muzo, Eva Milara, Luis Bote-Curiel, Luis Estrada-Petrocelli, Felipe Grijalva
机构
*
Colegio de Ciencias e Ingenierías, Universidad San Francisco de Quito (USFQ)(基多圣弗朗西斯科大学科学与工程学院)
;
Rey Juan Carlos University(胡安·卡洛斯国王大学)
;
Facultad de Ingeniería, Universidad Latina de Panamá(巴拿马拉丁大学工程学院)
RRS-10K: A Multitask Vision-Language Model Benchmark for Rare Remote Sensing Image Interpretation
RRS-10K:用于罕见遥感图像解释的多任务视觉语言模型基准测试
Yuqiao Lai, Jiancheng Qi, Fei Wang, Yuxin Liu, Kun Li, Ye Chen, Yan Gao, Yanyan Wei
机构
*
Laboratory of Intelligent Language Processing, National University of Defense Technology(国防科技大学智能语言处理实验室)
;
Hefei University of Technology(合肥工业大学)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
;
United Arab Emirates University(阿联酋大学)
Hebaixu Wang, Jing Zhang, Haonan Guo, Di Wang, Jiayi Ma, Bo Du, Liangpei Zhang
机构
*
School of Electronic Information, Wuhan University(武汉大学电子信息学院)
;
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)
;
Zhongguancun Academy(中关村学院)
机构
*
Tsinghua University(清华大学)
;
Qwen Business Unit of Alibaba(阿里巴巴的通义业务部)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Peking University(北京大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
When Do Agent Loops Mistake Stagnation for Progress? Self-Evaluation Bias and Externally Grounded Verification in Long-Running Autonomous LLM Agent Loops
Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases
评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理
Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng
机构
*
Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院)
;
Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院)
;
Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院)
;
System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院)
;
Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学)
;
RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心)
;
Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学)
;
Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学)
;
School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学)
;
Hospital of the University of Pennsylvania(宾夕法尼亚大学医院)
;
Children’s Hospital of Philadelphia (CHOP)(费城儿童医院)
;
Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院)
;
Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校)
;
Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Journal refZang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)
机构
*
College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院)
;
School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院)
;
State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)
;
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
School of Automation, Southeast University(东南大学自动化学院)
;
Department of Geography, National University of Singapore(新加坡国立大学地理系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI