arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

2026-08-03 至 2026-08-03 共收录 3
2605.07161 2026-08-03 cs.AI 版本更新

SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios

SREGym:面向AI SRE代理的实时基准测试平台,具有高保真的故障场景

Jackson Clark, Yiming Su, Saad Mohammad Rafid Pial, Yifang Tian, Lily Gniedziejko, Hans-Arno Jacobsen, Yinfang Chen, Tianyin Xu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

AI总结 SREGym通过模拟真实云原生系统栈中的高保真故障场景,为AI SRE代理提供实时基准测试环境,包含90个真实挑战性SRE问题,评估前沿代理能力差异显著,可达40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02330 2026-08-03 cs.CV cs.AI cs.LG 版本更新

ActionParty: Multi-Subject Action Binding in Generative Video Games

ActionParty:生成视频游戏中的多主体动作绑定

Alexander Pondaven, Ziyi Wu, Igor Gilitschenski, Philip Torr, Sergey Tulyakov, Fabio Pizzati, Aliaksandr Siarohin

机构 * Snap Research(Snap研究院) University of Oxford(牛津大学) University of Toronto(多伦多大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。

Comments ECCV 2026 - Project page: https://action-party.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22146 2026-08-03 cs.CL cs.LG 版本更新

FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale

精细指令:将合成指令扩展到预训练规模

Ajay Patel, Colin Raffel, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 研究针对大语言模型监督训练数据有限的问题,提出将互联网规模预训练文档知识转化为合成指令和答案训练对的程序,生成FineInstructions数据集,经实验验证该方法在预训练中表现优于其他技术。

详情

展开后加载摘要…

URL PDF HTML 收藏