VERINA: Benchmarking Verifiable Code Generation
VERINA:可验证代码生成基准测试
机构 * University of California, Berkeley(加州大学伯克利分校) ; Meta FAIR
AI总结 本文提出VERINA基准测试,用于全面评估代码、规范及证明生成能力,揭示LLM在可验证代码生成中的挑战,特别是证明生成的困难。
作者
AI / Security
VERINA:可验证代码生成基准测试
机构 * University of California, Berkeley(加州大学伯克利分校) ; Meta FAIR
AI总结 本文提出VERINA基准测试,用于全面评估代码、规范及证明生成能力,揭示LLM在可验证代码生成中的挑战,特别是证明生成的困难。
CUBE:统一智能体基准的标准化
AI总结 本文提出CUBE标准,通过MCP和Gym构建统一协议,实现智能体基准的标准化,减少碎片化,提升研究效率。
Comments Position paper. 10 pages. Reference implementation: https://github.com/The-AI-Alliance/cube-standard