机构
*
The University of Manchester(曼彻斯特大学)
;
Stevens Institute of Technology(史蒂文斯理工学院)
;
The Fin AI(Fin AI)
;
Columbia University(哥伦比亚大学)
;
Islamic University of Technology(伊斯兰科技大学)
;
Athens University of Economics and Business(雅典经济与商业大学)
;
Archimedes, Athena Research Center(阿基米德,亚特兰蒂斯研究中心)
;
MBZUAI
;
McGill University(麦吉尔大学)
;
Mila - Quebec AI Institute(魁北克人工智能研究所)
;
Dubai Police(迪拜警察)
;
University of Melbourne(墨尔本大学)
;
Halmstad University(哈姆斯塔德大学)
;
University of Florida(佛罗里达大学)
;
ELLIS Manchester(曼彻斯特ELLIS)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
VeriEquivBench: An Equivalence Score for Ground-Truth-Free Evaluation of Formally Verifiable Code
VeriEquivBench:一种无需真实地面真相的正式可验证代码评估等价分数
Lingfei Zeng, Fengdi Che, Xuhan Huang, Fei Ye, Xu Xu, Binhang Yuan, Jie Fu
机构
*
Huazhong University of Science and Technology(华中科技大学)
;
University of Alberta(阿尔伯塔大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Hong Kong University of Science and Technology(香港科技大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中
评测与基准
:LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部)
;
School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学)
;
Tsinghua University(清华大学)
;
Peking University(北京大学)
;
University of Montreal(蒙特利尔大学)
专题命中
评测与基准
:LLM(title);large language model(abstract);language model(abstract);分类 cs.CL
Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models
评估多模态大语言模型在住院诊断中的表现:在十个前沿模型上的真实世界性能、安全性和成本
Bruce A. Bassett, Amy Rouillard, Sitwala Mundia, Michael Cameron Gramanie, Linda Camara, Ziyaad Dangor, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Ismail Kalla, Haroon Saloojee
机构
*
School of Computer Science and Applied Mathematics, University of the Witwatersrand(沃斯兰大学计算机科学与应用数学学院)
;
Wits MIND Institute, University of the Witwatersrand(沃斯兰大学Wits MIND研究所)
;
Grai Labs, Cape Town, South Africa(南非开普敦Grai实验室)
;
Faculty of Health Sciences, University of the Witwatersrand(沃斯兰大学健康科学学院)
;
South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand(南非医学研究委员会疫苗与传染病分析研究单位,沃斯兰大学健康科学学院)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey
代理强化学习用于大语言模型的景观:综述
Guibin Zhang, Hejia Geng, Xiaohang Yu, Zhenfei Yin, Zaibin Zhang, Zelin Tan, Heng Zhou, Zhongzhi Li, Xiangyuan Xue, Yijiang Li, Yifan Zhou, Yang Chen, Chen Zhang, Yutao Fan, Zihu Wang, Songtao Huang, Francisco Piedrahita-Velez, Yue Liao, Hongru Wang, Mengyue Yang, Heng Ji, Jun Wang, Shuicheng Yan, Philip Torr, Lei Bai
机构
*
University of Oxford(牛津大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
National University of Singapore(新加坡国立大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Brown University(布朗大学)
;
University College London(伦敦大学学院)
;
University of Science and Technology of China(中国科学技术大学)
;
Imperial College London(伦敦帝国学院)
;
Dalian University of Technology(大连理工大学)
;
Chinese Academy of Sciences(中国科学院)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of Georgia(佐治亚大学)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
University of California, Santa Barbara(加州大学圣塔芭芭拉分校)
;
University of Bristol(布里斯托大学)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI