SWE-Perf: Can Language Models Optimize Code Performance on Real-World Repositories?
SWE-Perf:语言模型能否优化真实仓库中的代码性能?
AI总结 提出SWE-Perf基准,用于系统评估LLM在真实仓库中的代码性能优化能力,通过140个实例评估发现现有模型与专家水平存在显著差距。
Comments Accepted by ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
SWE-Perf:语言模型能否优化真实仓库中的代码性能?
AI总结 提出SWE-Perf基准,用于系统评估LLM在真实仓库中的代码性能优化能力,通过140个实例评估发现现有模型与专家水平存在显著差距。
Comments Accepted by ICML 2026
多重性是多模态学习中不可避免且固有的挑战
机构 * Princeton University(普林斯顿大学)
AI总结 本文论证多模态数据固有的多对多映射关系(多重性)是影响数据构建、模型训练和评估的根本瓶颈,并呼吁发展多重性感知的学习框架与评估协议。
Comments ICML 2026 Position Track