arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-04 至 2026-06-04 共收录 7 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 7 篇

2606.05001 2026-06-04 cs.SE 70%

TeleSWEBench: A Commit-Driven Benchmark for Evaluating LLM-Powered Software Engineering in Telecommunications

TeleSWEBench:一个面向电信领域评估基于LLM的软件工程的提交驱动基准

Pranshav Gajjar, Ali Mamaghani, Dinesh Bharadia, Vijay K Shah

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE

AI总结 提出TeleSWEBench,首个面向电信领域的提交驱动基准,通过从srsRAN 5G仓库挖掘真实提交并构建734个可执行测试用例,结合分层LLM评判框架TeleJudge,评估ASE工具在电信软件工程中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04261 2026-06-04 cs.AI cs.CL cs.CV cs.ET cs.LG 67%

Can Generalist Agents Automate Data Curation?

通用智能体能否自动化数据筛选?

Feiyang Kang, Hanze Li, Adam Nguyen, Mahavir Dabas, Jiaqi W. Ma, Frederic Sala, Dawn Song, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Curation-Bench基准,通过通用编码智能体自动化数据筛选循环,实验表明现成智能体可达到强基线,但存在执行-研究差距,而结构化方法引导的智能体能在十分之一数据预算下自主组合出优于强基线的数据选择策略。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04205 2026-06-04 cs.MM cs.AI cs.CL cs.CV cs.LG cs.SD 67%

DetectZoo: A Unified Toolkit for AI-Generated Content Detection Across Text, Audio, and Image Modalities

DetectZoo:一个用于跨文本、音频和图像模态的AI生成内容检测的统一工具包

Sajad Ebrahimi, Nima Jamali, Bardia Shirsalimian, Kelly McConvey, Wentao Zhang, Jalehsadat Mahdavimoghaddam, Maksym Taranukhin, Maura Grossman, Vered Shwartz, Yuntian Deng, Ebrahim Bagheri

机构 * University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Toronto Metropolitan University(多伦多 Metropolitan 大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DetectZoo,一个首个统一的多模态AI生成内容检测工具包,通过标准化数据预处理、评估流程和集成61个检测器与22个基准数据集,实现公平可重复的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06911 2026-06-04 cs.CR cs.AI 57%

TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering

TamperBench:系统化压力测试微调和篡改下的LLM安全性

Saad Hossain, Tom Tseng, Punya Syon Pandey, Samanvay Vajpayee, Matthew Kowal, Nayeema Nonta, Samuel Simko, Stephen Casper, Zhijing Jin, Kellin Pelrine, Sirisha Rambhatla

机构 * Critical ML Lab Waterloo Canada(Waterloo大学Critical ML实验室) FAR.AI Berkeley USA(伯克利美国FAR.AI公司) University of Toronto Toronto Canada(多伦多大学) University of Waterloo Waterloo Canada(Waterloo大学) ETH Zürich Zürich Switzerland(苏黎世联邦理工学院) MIT CSAIL Cambridge USA(麻省理工学院CSAIL实验室) University of Toronto, MPI, EuroSafeAI, Vector Institute Toronto Canada(多伦多大学、马克斯·普朗克研究所、EuroSafeAI、Vector Institute) Critical ML Lab University of Waterloo Waterloo Canada(Waterloo大学Critical ML实验室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出统一框架TamperBench,通过系统化超参数扫描评估21个开源LLM在9种篡改威胁下的安全性和实用性,发现越狱微调是最严重攻击,当前对齐阶段防御基本失效。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.09829 2026-06-04 math.NA cs.NA 50%

An Abaqus UEL implementation of the smoothed finite element method

Abaqus中基于单元的平滑有限元方法的UEL实现

Pramod Y Kumbhar, Amrita Francis, Narasimhan Swaminathan, Ratna Kumar Annabattula, Sundararajan Natarajan

专题命中 代码评测 :repository(abstract)

AI总结 本文讨论了在商业有限元软件Abaqus中实现基于单元的平滑有限元方法(CSFEM)的方法。CSFEM的特点是不需要显式导出形状函数的导数,也不需要等参数映射。通过使用软件的用户元素子程序(UEL)功能实现了该方法。给出了输入数据格式的细节以及所提出的用户元素子程序,这是有限元分析的核心。通过解决线性弹性静力学问题的二维和三维基准问题来验证所提出的实现。开发的UEL和相关的输入文件可以从GitHub仓库下载:https://github.com/nsundar/SFEM_in_Abaqus。

Journal ref International Journal of Computational Methods, 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.04666 2026-06-04 math.NA cs.NA physics.comp-ph 50%

Taylor-Duffy Method for Singular Tetrahedron-Product Integrals: Efficient Evaluation of Galerkin Integrals for VIE Solvers

泰勒-迪菲方法用于奇异四面体积积分:用于离散化体积积分方程(VIE)求解器的加权伽辽金积分的高效评估

M. T. Homer Reid

专题命中 代码评测 :code generation(abstract)

AI总结 本文提出一种高效准确的数值方法,用于计算四面体积域上六维奇异积分,适用于计算离散化体积积分方程求解器的加权伽辽金矩阵元素,通过扩展通用泰勒-迪菲策略,实现将六维奇异积分转化为低维非奇异积分,提升计算效率。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1510.06108 2026-06-04 eess.SY cs.SY 50%

A Counter-Example Guided Framework for Robust Synthesis of Switched Systems Using Control Certificates

一种用于切换系统鲁棒综合的反例引导框架使用控制证书

Hadi Ravanbakhsh, Sriram Sankaranarayanan

专题命中 代码评测 :program synthesis(abstract)

AI总结 本文提出通过生成

Comments The paper has been withdrawn by the author. The main reason is incorrect proof of Theorem 4 and some incorrect results in the evaluation parts due to some bugs in the code

详情

展开后加载摘要…

URL PDF HTML 收藏