arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Cambridge(剑桥大学)

2026-07-08 至 2026-07-08 共收录 3
2604.11290 2026-07-08 cs.CL 版本更新

Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation

多语言教师:评估语言模型用于多语言合成数据生成

Lester James V. Miranda, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

AI总结 本文评估了多语言教师模型的有效性,通过Polyglot Score衡量数据质量和学生模型表现,发现Gemma 3和Aya Expanse在不同学生模型家族中表现优异,数据质量如提示多样性、长度和响应流畅度对教学效果影响显著。

Comments Added human evaluation experiment results. Code is in https://github.com/ljvmiranda921/polyglot-teachers

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07872 2026-07-08 cs.CY cs.HC cs.LG 版本更新

Unequal Uncertainty: Rethinking Algorithmic Interventions for Mitigating Discrimination from AI

不平等的不确定性:重新思考减轻人工智能歧视的算法干预

Holli Sargeant, Mackenzie Jorgensen, Arina Shah, Sam Goring, Adrian Weller, Umang Bhatt

机构 * University of Cambridge(剑桥大学) Northumbria University(北umbria大学) George Washington University(乔治华盛顿大学) King’s College London(伦敦大学国王学院)

AI总结 研究人工智能预测不确定性带来的法律伦理问题,通过对英国法律下基于不确定性的算法干预(选择性弃权和选择性摩擦)进行教义分析及案例研究,发现不确定性阈值有歧视性影响,认为选择性摩擦在法律上更优,还探讨其对决策质量的影响及条件。

Comments Accepted at the 5th European Conference on Algorithmic Fairness (ECAF 2026). To appear in Proceedings of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09696 2026-07-08 cs.CV 版本更新

ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models

ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试

Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Florian Langer, Vyas Raina, Vatsal Raina, Hanyi Xiong, Vishaal Udandarao, Jingyi Lu, Shiyang Chen, Sam Purkis, Tianshuo Yan, Wenye Lin, Gyungin Shin, Qiaochu Yang, Anh Totti Nguyen, David I. Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D. Kunz, Kaiqu Liang, Alexander Lo, Brian Pulfer, Steven Walton, Charig Yang, Kai Han, Samuel Albanie

机构 * University of Cambridge(剑桥大学) University of Alberta(阿尔伯塔大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Northeastern University(东北大学) Astadeus College of Southern Maryland(马里兰州南部学院) University of Geneva(日内瓦大学) University of Oregon(俄勒冈大学)

AI总结 针对大型多模态模型在图像解释方面不足但在现有视觉基准测试中优势易逝的问题,引入通过对抗过滤策划的ZeroBench基准测试,评估多个模型,展现其潜力并公开测试内容,为模型视觉能力评估提供长期有效的新基准。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏