Evaluating Large Language Models for Antisemitic Incident Classification
评估用于反犹事件分类的大语言模型
Karina Halevy, Julia Mendelsohn, Chan Young Park, Yulia Tsvetkov, Maarten Sap
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
University of Maryland(马里兰大学)
;
Microsoft Research(微软研究院)
;
University of Washington(华盛顿大学)
;
Allen Institute for Artificial Intelligence(人工智能研究院)
CausalGame: Benchmarking Causal Thinking of LLM Agents in Games
因果游戏:在游戏中对大语言模型智能体的因果思维进行基准测试
Zhenhao Chen, Yongqiang Chen, Chenxi Liu, Junchi Yu, Xiangchen Song, Zijian Li, Jialin Li, Philip Torr, Bo Han, Kun Zhang
机构
*
MBZUAI(穆罕默德·本·扎耶德人工智能大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Hong Kong Baptist University(香港浸会大学)
;
University of Oxford(牛津大学)
;
New York University, Abu Dhabi(纽约大学阿布扎比分校)
CommentsZhenhao, Yongqiang, and Chenxi contributed equally to the project. A short version is accepted at the Forty-Third International Conference on Machine Learning (ICML) 2026 as an Oral presentation. Project website https://causalgame.github.io/
机构
*
Tuojing Intelligence(拓景智能)
;
Tsinghua University(清华大学)
;
King’s College London(伦敦国王学院)
;
Southeast University(东南大学)
;
Stevens Institute of Technology(史蒂文斯理工学院)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
University of Manchester(曼彻斯特大学)
;
Simple AI(简单人工智能公司)
;
Imperial College London(伦敦帝国学院)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Zhejiang University(浙江大学)
;
Beihang University(北京航空航天大学)
;
The University of Hong Kong(香港大学)
A Physics-Regulated Neural Framework for Learning 3D Grain Growth Dynamics
用于学习3D晶粒生长动力学的物理调节神经框架
Zhihui Tian, Kang Yang, Michael Tonks, Amanda R. Krause, Joel B. Harley
机构
*
Department of Electrical and Computer Engineering, University of Florida(美国佛罗里达大学电气与计算机工程系)
;
Department of Materials Science Engineering, University of Florida(美国佛罗里达大学材料科学与工程系)
;
Department of Materials Science Engineering, University of Florida, Carnegie Mellon University(美国佛罗里达大学、卡内基梅隆大学材料科学与工程系)
From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning
从推理轨迹到可复用模块:理解语言模型推理中的组合泛化
Lingjing Kong, Xin Liu, Guangyi Chen, Martin Q. Ma, Xiangchen Song, Yuekai Sun, Mikhail Yurochkin, Taylor W. Killian, Ruslan Salakhutdinov, Kun Zhang, Eric P. Xing, Zhengzhong Liu
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Institute of Foundation Models(基础模型研究院)
;
University of Michigan(密歇根大学)
ESC: Emotional Self-Correction for Reliable Vision-Language Models
ESC:面向可靠视觉语言模型的情感自我纠正
Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci
机构
*
1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author
MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding
MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准
Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)