机构
*
National University of Singapore(国立新加坡大学)
;
Yunnan University(云南大学)
;
The Ohio State University(俄亥俄州立大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
Jailbreaking Multimodal Large Language Models using Multi-Clip Video
使用多片段视频破解多模态大语言模型
Choongwon Kang, Seungjong Sun, Hyunmin Jun, Jang Hyun Kim
机构
*
Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学)
;
Department of Human-Artificial Intelligence Interaction, Sungkyunkwan University(人机交互系,成均馆大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
机构
*
National University of Singapore(新加坡国立大学)
;
Hefei University of Technology(合肥工业大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
ST Engineering Ltd.(ST工程有限公司)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.LG
Lessons from the Trenches on Reproducible Evaluation of Language Models
关于语言模型可重复评估的前线经验教训
Stella Biderman, Hailey Schoelkopf, Lintang Sutawika, Leo Gao, Jonathan Tow, Baber Abbasi, Alham Fikri Aji, Pawan Sasanka Ammanamanchi, Sidney Black, Jordan Clive, Anthony DiPofi, Julen Etxaniz, Benjamin Fattori, Jessica Zosa Forde, Charles Foster, Jeffrey Hsu, Mimansa Jaiswal, Wilson Y. Lee, Haonan Li, Charles Lovering, Niklas Muennighoff, Ellie Pavlick, Jason Phang, Aviya Skowron, Samson Tan, Xiangru Tang, Kevin A. Wang, Genta Indra Winata, François Yvon, Andy Zou
机构
*
MBZUAI
;
IIIT Hyderabad
;
EleutherAI
;
HiTZ Center - Ixa, UPV/EHU
;
Ivy Natal
;
University of Michigan
;
HubSpot
;
LibrAI
;
Kensho
;
Contextual AI
;
Brown University
;
New York University
;
Amazon
;
Yale University
;
HKUST
;
Sorbonne University
;
CMU
TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning
TimeSage-MT:用于评估智能时间序列推理的多轮基准测试
Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen
机构
*
University of Oxford(牛津大学)
;
VulpiVox Intelligence
;
Eindhoven University of Technology(埃因霍温理工大学)
;
Griffith University(格里菲斯大学)
;
Squirrel Ai Learning
;
East China Normal University(华东师范大学)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
POIROT: Interrogating Agents for Failure Detection in Multi-Agent Systems
POIROT: 在多智能体系统中审讯智能体以进行故障检测
Iñaki Dellibarda Varela, R. Sendra-Arranz, Pablo Romero-Sorozabal, J. M. Valverde-García, Annemarie F. Laudanski, Álvaro Gutiérrez, Eduardo Rocon, Manuel Cebrian
机构
*
Center for Automation and Robotics, Spanish National Research Council (CSIC-UPM)(自动化研究中心,西班牙国家科研 council (CSIC-UPM))
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Department of Biomedical Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学生物医学工程系,深圳,中国)
;
School of Computer Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)计算机科学与工程学院,深圳,中国)
;
Omni-Intelligence, Shenzhen, China(奥米智能,深圳,中国)
;
Shenzhen Loop Area Institute, Shenzhen, China(深圳环城研究院,深圳,中国)