arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-02 至 2026-04-02 共收录 5 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 5 篇

2604.01128 2026-04-02 cs.CL cs.AI cs.LG 67%

Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers

论文重构评估:评估AI论文中的表现和幻觉

Atsuyuki Miyai, Mashiro Toyooka, Zaiying Zhao, Kenta Watanabe, Toshihiko Yamasaki, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出首个系统评估框架,用于量化现代编码代理生成论文的质量与风险。通过重构现有论文并生成完整论文进行比较,将评估分为表现和幻觉两个维度,基于PaperWrite-Bench基准测试,揭示ClaudeCode和Codex在表现与幻觉间的权衡。

Comments Project Page: https://agent4science-utokyo.github.io/PaperRecon_HP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 57%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00550 2026-04-02 cs.AI 57%

BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery

BloClaw:面向下一代科学发现的全能多模态智能工作空间

Yao Qin, Yangyang Yan, Jinhua Pang, Xiaoming Zhang

机构 * AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部) Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室) First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出BloClaw,一种多模态操作系统,通过XML-Regex路由协议、运行时状态拦截沙箱和状态驱动动态视口UI三大创新,提升科学计算助手的鲁棒性和自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00079 2026-04-02 cs.CR cs.SE 57%

When Labels Are Scarce: A Systematic Mapping of Label-Efficient Code Vulnerability Detection

当标签稀缺时:一种系统性地映射标签高效代码漏洞检测方法

Noor Khalal, Chakib Fettal, Lazhar Labiod, Mohamed Nadif

专题命中 代码评测 :code model(abstract);分类 cs.SE

AI总结 本文系统性地映射了减少对人工标签依赖的代码漏洞检测方法,综合了五种范式家族及其机制,并提出了设计图和约束优先决策指南以指导实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24116 2026-04-02 eess.AS 50%

How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools

开放程度如何?对开源语音合成工具的实用性评估

Teodora Răgman, Adrian Bogdan Stânea, Horia Cucu, Adriana Stan

专题命中 代码评测 :repository(abstract)

AI总结 本文评估了四种开源语音合成框架在构建新型TTS模型的可行性,特别是在资源受限语言中的挑战,通过客观指标和主观测试揭示了工具链设置、数据预处理和计算效率的问题。

Comments Published in IEEE Access https://ieeexplore.ieee.org/document/11269795

详情

展开后加载摘要…

URL PDF HTML 收藏