PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages
PluraMath:将数学推理评估扩展到资源丰富语言之外
Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser
机构
*
Technical University of Munich(慕尼黑技术大学)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
Munich Data Science Institute(慕尼黑数据科学研究所)
;
Applied AI Institute(应用人工智能研究所)
;
Charles University(查尔斯大学)
;
Nazarbayev University(纳扎尔拜大学)
;
Inria(法国国家信息与自动化研究所)
;
Indian Institute of Technology, Kharagpur (IIT Kharagpur)(印度Kharagpur理工学院)
;
German University of Digital Science(德国数字科学大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Comments28 pages, 4 figures. Pre-registered cross-provider evaluation harness and per-regime results at github.com/canonic-canonic/canonic-pub. Construction claims resolve to commands run at the evidence-window-close ref (see Appendix C)
Your AI Travel Agent Would Book You a Bullfight: An Agentic Benchmark for Implicit Animal Welfare in Frontier AI Models
你的AI旅行代理会为你预订斗牛:前沿AI模型中隐含动物福利的代理基准
Jasmine Brazilek, Joel Christoph, Maheep Chaudhary, Oliver Tullio, Carol Kline, Miles Tidmarsh, Arturs Kanepajs
机构
*
Compassion Aligned Machine Learning(同情对齐机器学习)
;
Sentient Futures(感知未来)
;
Harvard Kennedy School(哈佛肯尼迪学院)
;
Appalachian State University Department of Management(阿巴拉契亚州立大学管理系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
CommentsProceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), ACL 2026, San Diego, California, USA. Available at https://openreview.net/forum?id=WJCalficPT
Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs
我们的基准测试足够吗?多模态大语言模型持续学习分析
Van-Tuan Tran, Shruthi Gowda, Merim Dzaferagic, Marco Ruffini
机构
*
School of Computer Science and Statistics, Trinity College Dublin(都柏林圣三一学院计算机科学与统计学院)
;
Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
RubricsTree: Scalable and Evolving Open-Ended Evaluation of Personal Health Agents across Health Memory and Medical Skills
RubricsTree: 面向个人健康代理在健康记忆与医疗技能上的可扩展且不断演进的开放式评估
Weizhi Zhang, Zechen Li, Hamid Palangi, Ben Graef, A. Ali Heydari, Simon A. Lee, Salman Rahman, Ray Luo, Zeinab Esmaeilpour, Erik Schenck, Chloe Zhang, Yamin Li, Menglian Zhou, Philip S. Yu, Daniel McDuff, Lindsey Sunden, Mark Malhotra, Shwetak Patel, Ahmed A. Metwally
机构
*
Google Research(谷歌研究院)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
IMPACTeen: Intentions, Manipulation, Persuasion, Annotations, and Consequences in Teen Communication Dataset
IMPACTeen:青少年沟通数据集中的意图、操纵、说服、标注与后果
Aleksander Szczęsny, Wiktoria Mieleszczenko-Kowszewicz, Maciej Markiewicz, Beata Bajcar, Tomasz Adamczyk, Jolanta Babiak, Grzegorz Chodak, Przemysław Kazienko
机构
*
Wrocław University of Science and Technology(弗罗茨瓦夫理工大学)
The Faithfulness Gap: Certifying Semantic Equivalence Between Natural-Language and Formal Mathematical Statements
忠实性差距:认证自然语言与形式数学语句之间的语义等价性
Noor Islam S. Mohammad, Tamim Sheikh
机构
*
Department of Computer Science, Informatics Institute, Istanbul Technical University, İstanbul, Türkiye(信息学院计算机科学系,伊斯坦布尔技术大学,伊斯坦布尔,土耳其)
;
Department of Computer Science(计算机科学系)
;
Engineering, Jashore University of Science(工程系,贾沙尔大学科学学院)
PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino
PACUTE: 面向菲律宾语的音韵、词缀和字符级词元理解
Jann Railey Montalan, David Demitri Africa, Jimson Paulo Layacan, Richell Isaiah Flores, Ivan Yuri De Leon, Lance Calvin Gamboa
机构
*
AI Singapore(AI新加坡)
;
Nanyang Technological University(南洋理工大学)
;
UK AI Security Institute(英国人工智能安全研究所)
;
Ateneo de Manila University(马尼拉雅典耀大学)
;
University of Birmingham(伯明翰大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility
AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化
Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
Purdue University(普渡大学)
;
University of Ljubljana(卢布尔雅那大学)
;
University of Washington(华盛顿大学)
;
Oasis Labs
;
University of Maryland(马里兰大学)
;
IBM Research(IBM研究院)
;
Mila
;
McGill University(麦吉尔大学)
;
ServiceNow Research(ServiceNow研究院)
;
Carnegie Mellon University(卡内基梅隆大学)
;
National Institute of Standards and Technology(美国国家标准与技术研究院)
;
The Ohio State University(俄亥俄州立大学)
;
University of Cambridge(剑桥大学)
;
University of California, Santa Barbara(加州大学圣塔芭芭拉分校)
ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning
ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准
Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
DAMO Academy, Alibaba Group(阿里巴巴达摩院)
;
Hupan Lab(湖畔实验室)
;
Zhejiang University(浙江大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI