K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
K-BrowseComp:基于韩国语境的网页浏览代理基准测试
Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim
机构
*
Chung-Ang University(Chung-Ang 大学)
;
KAIST(韩国科学技术院)
;
Seoul National University(首尔国立大学)
;
OnelineAI
;
NAVER Cloud AI
;
Carnegie Mellon University(卡内基梅隆大学)
Before and After Temperature: A Distributional View of Creative LLM Generation
温度前后:创造性LLM生成的分布视角
V. S. Raghu Parupudi, Harsha Ponnada, Aditi Kaushal, S. Shria Parupudi, Saiteja Dasari, Sahiti Bulusu
机构
*
University of California, San Diego(加州大学圣地亚哥分校)
;
Indian Institute of Technology, Kharagpur(印度理工学院克哈格布尔分校)
;
Delhi Technological University(德里技术大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Rutgers University(罗格斯大学)
;
Georgia Institute of Technology(佐治亚理工学院)
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
University of Glasgow(格拉斯哥大学)
;
Independent Researcher(独立研究员)
;
Corespeed Inc.(Corespeed公司)
Aditya Kumar, Zhihan Lei, Jerry Yan, Joshua W. Momo, Lauhitya Reddy, Rafael Enrique Cabrera Jimenez, Cassandra A. Cohen, Arthur Kajiyama, William W. Cohen
机构
*
Department of Computer Science, University of Cincinnati(卡内基梅隆大学计算机科学系)
;
School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
;
Independent Researcher(独立研究者)
WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction
WorldMemArena: 通过动作-世界交互评估多模态智能体记忆
Chengzhi Liu, Yuzhe Yang, Sophia Xiao Pu, Yepeng Liu, Lin Long, Yichen Guo, Nuo Chen, Zhaotian Weng, Elena Kochkina, Simerjot Kaur, Charese Smiley, Xiaomo Liu, James Zou, Sheng Liu, Yuheng Bu, Songyou Peng, Xin Eric Wang
机构
*
University of California, Santa Barbara(加州大学圣芭芭拉分校)
;
J.P. Morgan Chase(摩根大通)
;
ETH Zurich(苏黎世联邦理工学院)
;
Stanford University(斯坦福大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Carnegie Mellon University(卡内基梅隆大学)
Vision-Language Models Mistake Head Orientation for Gaze Direction: Nonverbal Conversation Cues
视觉-语言模型将头部方向误认为注视方向:非语言对话线索
Zory Zhang, Pinyuan Feng, Bingyang Wang, Tianwei Zhao, Suyang Yu, Qingying Gao, Hokin Deng, Ziqiao Ma, Yijiang Li, Dezhi Luo
机构
*
Brown University(布朗大学)
;
Columbia University(哥伦比亚大学)
;
Emory University(埃默里大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of Washington(华盛顿大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of Michigan(密歇根大学)
;
UC San Diego(圣地亚哥大学)
Representation-Centric Survey of Supervised Skeletal Action Recognition and the New Benchmark
以表示为中心的监督式骨骼动作识别综述与新基准
Yang Liu, Jiyao Yang, Madhawa Perera, Pan Ji, Dongwoo Kim, Min Xu, Tianyang Wang, Saeed Anwar, Tom Gedeon, Lei Wang, Zhenyue Qin
机构
*
School of Computing, Australian National University(澳大利亚国立大学计算学院)
;
University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
;
OPPO US Research Center(OPPO美国研究中心)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of Western Australia(西澳大利亚大学)
;
Curtin University(Curtin大学)
;
School of Engineering and Built Environment, Griffith University(格里菲斯大学工程与环境学院)
;
School of Medicine, Yale University(耶鲁大学医学院)
Benchmarking Waitlist Mortality Prediction in Heart Transplantation Through Time-to-Event Modeling using New Longitudinal UNOS Dataset
基于新的纵向UNOS数据集通过时间-事件模型对心脏移植等待名单死亡率预测进行基准测试
Yingtao Luo, Reza Skandari, Carlos Martinez, Arman Kilic, Rema Padman
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
Imperial College(帝国理工学院)
;
United Network for Organ Sharing(美国器官共享网络)
;
Medical University of South Carolina(南卡罗来纳医学院)
EuroBERT: Scaling Multilingual Encoders for European Languages
EuroBERT:面向欧洲语言的多语言编码器扩展
Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Duarte M. Alves, André Martins, Ayoub Hammal, Caio Corro, Céline Hudelot, Emmanuel Malherbe, Etienne Malaboeuf, Fanny Jourdan, Gabriel Hautreux, João Alves, Kevin El Haddad, Manuel Faysse, Maxime Peyrard, Nuno M. Guerreiro, Patrick Fernandes, Ricardo Rei, Pierre Colombo
Lessons from the Trenches on Reproducible Evaluation of Language Models
关于语言模型可重复评估的前线经验教训
Stella Biderman, Hailey Schoelkopf, Lintang Sutawika, Leo Gao, Jonathan Tow, Baber Abbasi, Alham Fikri Aji, Pawan Sasanka Ammanamanchi, Sidney Black, Jordan Clive, Anthony DiPofi, Julen Etxaniz, Benjamin Fattori, Jessica Zosa Forde, Charles Foster, Jeffrey Hsu, Mimansa Jaiswal, Wilson Y. Lee, Haonan Li, Charles Lovering, Niklas Muennighoff, Ellie Pavlick, Jason Phang, Aviya Skowron, Samson Tan, Xiangru Tang, Kevin A. Wang, Genta Indra Winata, François Yvon, Andy Zou
机构
*
MBZUAI
;
IIIT Hyderabad
;
EleutherAI
;
HiTZ Center - Ixa, UPV/EHU
;
Ivy Natal
;
University of Michigan
;
HubSpot
;
LibrAI
;
Kensho
;
Contextual AI
;
Brown University
;
New York University
;
Amazon
;
Yale University
;
HKUST
;
Sorbonne University
;
CMU
AI总结
本文基于开发Language Model Evaluation Harness框架的三年经验,总结了语言模型评估中面临的方法论挑战、缺乏可重复性和透明度等问题,并提供了改进评估严谨性和信心的建议。