A Scalable Benchmark for Repository-Oriented Long-Horizon Conversational Context Management
面向仓库的长 horizon 对话上下文管理可扩展基准
专题命中 代码评测 :repository(title,abstract);分类 cs.SE
AI总结 本文提出LoCoEval,首个面向仓库开发场景的长 horizon 对话上下文管理基准,评估了多种方法并提出改进方案,提升了代码助手在复杂对话中的表现。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
面向仓库的长 horizon 对话上下文管理可扩展基准
专题命中 代码评测 :repository(title,abstract);分类 cs.SE
AI总结 本文提出LoCoEval,首个面向仓库开发场景的长 horizon 对话上下文管理基准,评估了多种方法并提出改进方案,提升了代码助手在复杂对话中的表现。
ESGenius:对环境、社会和治理(ESG)及可持续性知识的LLM基准测试
机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性公司实验室) ; Alibaba Group(阿里巴巴集团)
专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ESGenius是首个针对LLM在ESG及可持续性知识评估的综合问答基准,通过RAG方法显著提升模型性能。
Comments EMNLP'25 Main Oral (42 pages, 10 figures, 11 tables), Nominations for Resource Award & Theme Paper Award
Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 14612-14653
TML-Bench:用于表格机器学习任务的数据科学代理基准
机构 * Independent Researcher(独立研究者)
专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 TML-Bench评估10个开源LLM在Kaggle竞赛中的表现,揭示不同时间预算下模型性能的差异及稳定性。
Comments 19 pages, 16 tables and figures
UniCoR: 代码多模态协作以实现稳健的跨语言混合代码检索
专题命中 代码评测 :code model(abstract);分类 cs.SE
AI总结 UniCoR通过多模态协作和自监督学习提升跨语言混合代码检索的语义理解和泛化能力。
Comments Accepted by the 48th IEEE/ACM International Conference on Software Engineering (ICSE 2026)
KramaBench:一个用于数据湖上数据到洞察流程的AI系统基准测试
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Independent(独立研究者) ; University of Arizona(亚利桑那大学)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 KramaBench是一个用于评估AI系统在数据湖到洞察流程中端到端能力的基准测试,包含104个挑战,测试AI在自动化编排数据任务方面的表现。