arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-03 至 2026-06-03 共收录 6 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 6 篇

2602.22480 2026-06-03 cs.AI cs.CL cs.LG 67%

VeRO: A Harness for Agents to Optimize Agents

VeRO: 用于优化智能体的智能体框架

Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan Xue, Samuel Marc Denton

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 VeRO 框架和 VeRO-Bench 基准,通过版本化快照、预算控制评估和结构化执行轨迹来优化智能体代码,并实验比较不同优化器对目标智能体的改进效果。

Comments Accepted to the Forty-Third International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03657 2026-06-03 cs.AI 57%

Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition

诊断大语言模型工具使用中的知识缺口:面向新API获取的智能体基准

Jinnuo Liu, Yue Peng, Jinhan Niu, Hongyi Wen

机构 * NYU Shanghai(纽约大学上海分校)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 提出 NovelAPIBench 基准,通过动态发现新API、分解知识包并生成可执行任务,诊断模型在API使用中的六类错误,发现检索与参数调优互补。

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03130 2026-06-03 cs.LG 57%

Synthetic Hallucinations, Real Gains: Hard Negatives from Frontier Models for FIM Hallucination Mitigation

合成幻觉,真实收益:来自前沿模型的硬负样本用于FIM幻觉缓解

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft(微软)

专题命中 代码评测 :code model(abstract);分类 cs.LG

AI总结 针对小型开源代码模型在IDE自动补全中产生的填充中间(FIM)幻觉问题,提出一种无需执行的替代方法:利用前沿代码模型合成看似合理但错误的补全作为硬负样本,通过对比合成幻觉与真实开发者编辑的差异作为监督微调信号,在Delulu基准上提升精确匹配18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02603 2026-06-03 cs.CV cs.LG 57%

COD10K-C: Benchmarking Robustness of Camouflaged Object Detection Under Natural Image Corruptions

COD10K-C:自然图像损坏下伪装目标检测的鲁棒性基准测试

Arafat Hossain Sayem

机构 * CSE, Bangladesh University of Engineering and Technology(孟加拉国工程与技术大学计算机科学与工程系)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 提出COD10K-C基准,包含8种损坏类型和5个严重级别,评估伪装目标检测模型在损坏图像上的性能,并引入轻量级模型RobustCODLite,通过损坏增强、频率先验分支和不确定性一致性损失,在损坏条件下保持较高Dice分数。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16014 2026-06-03 cs.CL 57%

Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains

无排序RAG:用选择替代重排序以应用于敏感领域

Yash Saxena, Ankur Padia, Mandar S Chaudhary, Kalpa Gunaratna, Srinivasan Parthasarathy, Manas Gaur

机构 * University of Washington(华盛顿大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 提出METEORA框架,通过DPO微调LLM生成检索理由、统计肘部检测自适应截断和验证器过滤,在敏感领域实现可解释、高效且鲁棒的证据选择,无需重排序。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03386 2026-06-03 cs.LG 57%

Annot-Mix: Learning with Noisy Class Labels from Multiple Annotators via a Mixup Extension

Annot-Mix: 通过混合扩展从多个标注者学习带噪声类别标签

Marek Herde, Lukas Lührs, Denis Huseljic, Bernhard Sick

机构 * University of Kassel(卡塞尔大学) European Conference on Artificial Intelligence(欧洲人工智能会议) Conference on Prestigious Applications of Intelligent Systems(智能系统 prestigious 应用会议)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 提出Annot-Mix框架,通过扩展mixup处理多标注者提供的类别标签,在11个数据集上优于11种现有方法。

Comments 9 pages, 8 figures, 4 tables; post-publication arXiv version with minor editorial corrections; methodology, results, and conclusions unchanged

Journal ref ECAI 2024: 27th European Conference on Artifical Intelligence, IOS Press, pp. 2910-2918, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏