CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR
CliniCARE-Bench:电子健康记录中医疗推理的临床校准审计
Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan Li, Daniel Yue Zhang, Chenguang Wang, Zainab Doctor, Zhijun Yin, Nigam H. Shah, Yuan Xue
机构
*
Scale AI
;
Emory University(埃默里大学)
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Vanderbilt University Medical Center(范德堡大学医学中心)
;
Stanford School of Medicine(斯坦福医学院)
;
Stanford Health Care(斯坦福医疗保健系统)
;
Clinical Excellence Research Center(临床卓越研究中心)
Trustworthy Machine Learning through the Lens of Combinatorial Optimization: Survey and Research Perspectives
从组合优化视角看可信机器学习:综述与研究展望
Thibaut Vidal, Julien Ferry
机构
*
CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains, Department of Mathematics and Industrial Engineering, Polytechnique Montreal(CIRRELT与数据驱动供应链的SCALE-AI主席、数学与工业工程系,蒙特利尔大学)
ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety
ROK-FORTRESS:衡量地缘政治转译对国家安全和公共安全的影响
Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q. Knight, Joseph Brandifino, Max Fenkell
EgoVerse: An Egocentric Human Dataset for Robot Learning from Around the World
EgoVerse:一个用于机器人学习的视点人类数据集
Ryan Punamiya, Simar Kareer, Zeyi Liu, Josh Citron, Ri-Zhao Qiu, Xiongyi Cai, Alexey Gavryushin, Jiaqi Chen, Davide Liconti, Lawrence Y. Zhu, Patcharapong Aphiwetsa, Baoyu Li, Aniketh Cheluva, Pranav Kuppili, Yangcen Liu, Dhruv Patel, Aidan Gao, Hye-Young Chung, Ryan Co, Renee Zbizika, Jeff Liu, Xiaomeng Xu, Haoyu Xiong, Geng Chen, Sebastiano Oliani, Wenkai Xuan, Chenyu Yang, Xi Wang, James Fort, Richard Newcombe, Josh Gao, Jason Chong, Garrett Matsuda, Aseem Doriwala, Marc Pollefeys, Robert Katzschmann, Xiaolong Wang, Shuran Song, Judy Hoffman, Danfei Xu
机构
*
Georgia Institute of Technology(佐治亚理工学院)
;
Stanford University(斯坦福大学)
;
University of California San Diego(加州大学圣地亚哥分校)
;
ETH Zürich(苏黎世联邦理工学院)
;
MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
;
Meta Reality Labs Research(Meta现实实验室)
;
Mecka AI
;
Scale AI
MoReBench: Evaluating Procedural and Pluralistic Moral Reasoning in Language Models, More than Outcomes
MoReBench:评估语言模型中的程序性和多元道德推理,超越结果
Yu Ying Chiu, Michael S. Lee, Rachel Calcott, Brandon Handoko, Paul de Font-Reaulx, Raphaël Millière, Paula Rodriguez, Chen Bo Calvin Zhang, Ziwen Han, Udari Madhushani Sehwag, Yash Maurya, Christina Q Knight, Harry R. Lloyd, Florence Bacus, Conor Downey, Mantas Mazeika, Bing Liu, Yejin Choi, Mitchell L Gordon, Sydney Levine
机构
*
University of Washington(华盛顿大学)
;
New York University(纽约大学)
;
Scale AI
;
Harvard University(哈佛大学)
;
University of Michigan(密歇根大学)
;
UNC Chapel Hill(北卡罗来纳大学教堂山分校)
;
Center for AI Safety(人工智能安全中心)
;
Stanford University(斯坦福大学)
;
MIT(麻省理工学院)
;
University of Oxford(牛津大学)
MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers
MCP-Atlas:一个大规模的工具使用能力基准测试,使用真实的MCP服务器
Chaithanya Bandi, Razvan-Gabriel Dumitru, Ben Hertzberg, Divyansh Agarwal, Geobio Boo, Tejas Polakam, Sami Hassaan, Jeff Da, HiJae Kim, Vipul Gupta, Manasi Sharma, Andrew Park, Martin Dimakis, Ernesto Gabriel Hernandez Montoya, Dan Rambado, Ivan Salazar, Rafael Cruz, MohammadHossein Rezaei, Chetan Rane, Ben Levin, Daniel Yue Zhang, Brad Kenstler, Bing Liu
机构
*
National University of Singapore(新加坡国立大学)
;
Scale AI
机构
*
Industrial Engineering and Management Science University of Twente(工业工程与管理科学代尔夫特理工大学)
;
SCALE-AI Chair and CIRRELT Polytechnique Montréal(SCALE-AI主席和CIRRELT蒙特利尔理工学院)
;
Polytechnique Montréal(蒙特利尔理工学院)
BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks
BenchMarker:一种受教育启发的工具包,用于突出多项选择基准测试中的缺陷
Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber
机构
*
University of Maryland(马里兰大学)
;
New York University(纽约大学)
;
Scale AI
;
George Mason University(乔治·梅森大学)
SciPredict: Can LLMs Predict the Outcomes of Scientific Experiments in Natural Sciences?
SciPredict: LLMs能否预测自然科学中的实验结果?
Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie, Shayan Shabihi, Erich Liang, Andrea Toledo, Guillermo Mangialardi, Sergio Fonrouge, Ed-Yeremai Hernandez Cardona, Paula Vergara, Utkarsh Tyagi, Chen Bo Calvin Zhang, Pavi Bhatter, Nicholas Johnson, Furong Huang, Ernesto Gabriel Hernandez Montoya, Bing Liu
机构
*
Scale AI
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of Maryland(马里兰大学)
;
Princeton University(普林斯顿大学)
;
Human Frontier Collective(人类前沿集体)
LLM Novice Uplift on Dual-Use, In Silico Biology Tasks
大语言模型在双用途生物任务中的新手提升
Chen Bo Calvin Zhang, Christina Q. Knight, Nicholas Kruus, Jason Hausenloy, Pedro Medeiros, Nathaniel Li, Aiden Kim, Yury Orlovskiy, Coleman Breen, Bryce Cai, Jasper Götting, Andrew Bo Liu, Samira Nedungadi, Paula Rodriguez, Yannis Yiming He, Mohamed Shaaban, Zifan Wang, Seth Donoughe, Julian Michael
机构
*
Scale AI
;
SecureBio
;
University of Oxford(牛津大学)
;
UC Berkeley(加州大学伯克利分校)