arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-03 至 2026-08-03 共收录 3 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 3 篇

2601.02430 2026-08-03 cs.SE cs.AI 版本更新 62%

WebCoderBench: Benchmarking Web Application Generation with Comprehensive and Interpretable Evaluation Metrics

WebCoderBench: 用全面且可解释的评估指标对Web应用生成进行基准测试

Chenxu Liu, Yingjie Fu, Wei Yang, Ying Zhang, Tao Xie

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出WebCoderBench,首个基于真实用户需求的Web应用生成基准,包含1572个真实用户需求及24个细粒度评估指标,结合规则和LLM评估方法,提供可解释的评估结果,实验显示无单一最优模型,为模型优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29626 2026-08-03 cs.AI 新提交 57%

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing Huang

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29417 2026-08-03 cs.CR 新提交 50%

Enforcing Cryptographic Distributed-VCS Access Control with No Trust on Servers

在不信任服务器的情况下实施密码学分布式版本控制系统访问控制

Xin Xu, Zhen Yang, Quanwei Cai, Jingqiang Lin, Liangqin Ren, Bo Chen, Yongfeng Huang

专题命中 代码评测 :repository(abstract)

AI总结 针对现有分布式VCS访问控制需中央服务器参与、写权限细粒度控制缺失的问题,提出基于ABE和ABS的DVAC方案,借助以太坊智能合约实现无中央服务器的文件粒度读写访问控制,原型开销较小且可与Git集成。

Comments Accepted manuscript. 15 pages, 7 figures. Published in Journal of Information Security and Applications, Vol. 93 (2025), Article 104103

Journal ref Journal of Information Security and Applications, 93 (2025), 104103

详情

展开后加载摘要…

URL PDF HTML 收藏