arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2607.17528 2026-07-24 cs.AI cs.AR cs.LG 版本更新 62%

Can AI Agents Really Complete RTL-to-GDS? Lessons from Benchmarking Tool-Interactive EDA Workflows

人工智能代理真的能完成从RTL到GDS的转换吗?基准测试工具交互式EDA工作流程的经验教训

Jinyuan Deng, Zhengrui Chen, Xufeng Wei, Tianyu Xing, Chenyi Wen, Qi Sun, Cheng Zhuo

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨人工智能代理在EDA工作流程中的表现,提出FluxBench进行系统评估,涵盖多种场景并评估多项能力,引入Token ROI指标。结果显示不同代理系统架构性能有差距,特定领域技能不是提升性能的唯一关键,系统设计和基础模型能力也很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06742 2026-07-20 cs.SE cs.AI 版本更新 62%

Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios

评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现

Ruida Hu, Xinchen Wang, Chao Peng, Cuiyun Gao, David Lo

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Independent Researcher, China(独立研究者,中国) Singapore Management University, Singapore(新加坡管理大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。

Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04489 2026-07-16 cs.LG cs.AI 62%

Hierarchical Scoring for Machine Learning Classifier Error Impact Evaluation

层次评分用于机器学习分类器误差影响评估

Erin Lanus, Daniel Wolodkin, Laura J. Freeman

机构 * National Security Institute, Virginia Tech(维吉尼亚理工大学国家安全研究所) Applied Research Corporation, Virginia Tech(维吉尼亚理工大学应用研究公司)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出层次评分度量,通过评分树评估分类器误差影响,实现更细粒度的模型性能评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10212 2026-07-14 cs.AI cs.CL 新提交 62%

KGCQual: An Interpretable Framework for Evaluating the Knowledge Graph Construction Quality from Text

KGCQual:一个用于评估从文本构建知识图谱质量的可解释框架

Nipun Misra, Vikranth Udandarao, Aanchal Gupta, Yogender Kumar, Manuj Mukherjee, Raghava Mutharaju

机构 * VIT Vellore(维洛尔理工学院) IIIT-Delhi(德里信息技术学院) Indian Institute of Technology Palakkad(印度理工学院帕拉卡德分校)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对自动构建知识图谱质量评估问题,提出KGCQual框架,通过实体级和关系级评估,衡量提取图谱与理想图谱的接近度,能识别现有指标遗漏问题,为比较构建方法提供可扩展、可解释框架,还通过实验验证了指标有效性。

Comments This paper is under review at a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09791 2026-07-14 cs.LG cs.CL 新提交 62%

Gauge dependence and structured-output corruption in sign-branched repetition penalties: measurements across models, inference stacks, and alternative repetition controls

符号分支重复惩罚中的规范依赖性和结构化输出损坏:跨模型、推理堆栈和替代重复控制的测量

Peter Hollows

专题命中 代码评测 :code model(abstract);分类 cs.CL、cs.LG

AI总结 研究符号分支重复惩罚中规范依赖性和结构化输出损坏问题,发现其惩罚定义不明确且损坏输出,将惩罚应用于归一化对数概率可消除这些问题,给出了相关机制、测量及归一化变体。

Comments 8 pages, 2 figures, 4 tables. Code, data, per-stack survey and git genealogy: https://github.com/captainpete/repetition-penalty-gauge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08374 2026-07-10 cs.CL cs.AI cs.HC cs.RO cs.SI 新提交 62%

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition

大语言模型作为人格识别中原型网络的理论无关自适应度量对齐的评判器

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Shih-Yu Lo, Po-An Chen, Noriyuki Kawarazaki, Kosuke Takano, Anissa Mokraoui

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对人格识别受理论依赖公式限制的问题,提出理论无关的JAM框架,通过注意力池化图原型网络和跨理论协调方法学习结构化表示并统一数据集,还用大语言模型作为评判器机制,提升了跨框架泛化能力和性能。

Journal ref IEEE Transactions on Affective Computing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03238 2026-07-10 cs.LG cs.AI 版本更新 62%

When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

当RLHF失败时:奖励黑客、崩溃和评估者博弈的机制分类

Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan, Matjaz Gams

机构 * First Citizens Bank(第一公民银行) Alma Mater Europaea University(欧洲大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文通过PPO、DPO等方法的对比实验,提出了一种基于奖励和评估者分数方向的机制分类法,将RLHF失败模式分类为可定位、可预测的训练动态。

Comments 20 pages, 8 figures; includes code, artifacts, and live demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03195 2026-07-09 cs.AI cs.SE 版本更新 62%

Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?

Terminus-4B:一个较小的模型能否在智能体执行任务中取代前沿大语言模型?

Spandan Garg, Vikram Nitin, Yufan Huang

机构 * Microsoft USA(微软公司)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究智能体终端执行任务中较小模型能否取代前沿大语言模型。提出经监督微调及强化学习训练的Terminus-4B模型,评估发现其能减少主智能体令牌使用量约30%,不影响性能,还缩小与前沿模型差距甚至超越其性能。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06796 2026-07-09 cs.LG cs.AI 新提交 62%

Enhancing deep learning models for time series classification via knowledge distillation

通过知识蒸馏增强用于时间序列分类的深度学习模型

Javidan Abdullayev, Maxime Devanne, Jonathan Weber, Germain Forestier

机构 * IRIMAS, University of Haute Alsace(IRIMAS,法国高等教育高级阿列省大学) Faculty of IT, Monash University(信息技术学院,莫纳什大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究知识蒸馏用于时间序列分类的有效性,在FCN、Inception和ConvTran三种架构上评估,修改组件后在UCR Archive数据集测试,发现对中等复杂度学生模型效果最佳,不同模型经蒸馏有不同程度参数减少和性能提升,并提供实现代码。

Comments Published version. Open access under CC BY 4.0. 24 pages, 11 figures

Journal ref Knowledge and Information Systems, Volume 68, Article 215, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06505 2026-07-08 cs.SE cs.AI cs.DB 新提交 62%

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

使用北美行业分类系统(NAICS)对GitHub仓库进行行业分类

Kevin Xu, Alexander Quispe

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究利用北美行业分类系统对GitHub仓库进行行业分类,提出结合多种技术的检索与验证管道生成标签,构建NAICS-GH语料库,测试表明标签精度高,还对预训练编码器进行基准测试,相关数据和代码开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06125 2026-07-08 cs.SE cs.AI cs.CR 新提交 62%

Evaluating Fine-Tuning and Metrics for Neural Decompilation of Dart AOT Binaries

评估Dart AOT二进制文件神经反编译的微调与指标

Raafat Abualazm, Ayman AboElhassan, Amr G. Wassal

机构 * Cairo University Computer Engineering Department, Faculty of Engineering(开罗大学计算机工程系,工程学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究针对Dart AOT二进制文件神经反编译,在新基准上用三个指标评估六种微调模型变体,发现无微调配置能显著提升pass@k,存在跨语言干扰及指标差异,指出汇编序列长度是任务难度关键预测指标,贡献新基准等并明确pass@k为主要评估指标。

Comments Under review at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 62%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05443 2026-07-08 cs.IR cs.AI cs.SE 新提交 62%

Scientific Code Search at Scale: A Multi-Domain Dataset and Benchmark

大规模科学代码搜索:多领域数据集与基准测试

Nishan Pantha, Pranath Reddy Kumbam, Sajil Awale, Pushwitha Krishnappa, Muthukumaran Ramasubramanian, Nidhi Jha, Emily Foshee, Ankur Kumar, Rachel Slank, Ashkbiz Danehkar, Rahul Ramachandran

机构 * The University of Alabama in Huntsville (UAH)(阿拉巴马大学亨茨维尔分校) Universities Space Research Association (USRA)(大学空间研究协会) NASA Marshall Space Flight Center(美国国家航空航天局马歇尔太空飞行中心)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对科学家在众多GitHub库中找相关软件难的问题,构建含多领域科学存储库的语料库,引入存储库搜索及代码片段检索两个基准测试,揭示不同领域性能差异,相关数据集和基准已公开,助力科学工具发现研究。

Comments Datasets and benchmarks publicly released on HuggingFace. Code released on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14948 2026-07-08 cs.SE cs.AI 新提交 62%

Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力

Kirill Vasilevski, Ximing Dong, Benjamin Rombaut, Milad Soltany, Ruochen Deng, Jiahuei Lin, Arthur Leung, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算科学学院)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04912 2026-07-07 cs.CV cs.AI cs.LG 新提交 62%

Graph Representation Learning of Longitudinal Medical Imaging Trajectories for Treatment Response Prediction

用于治疗反应预测的纵向医学影像轨迹的图表示学习

Johannes Kiechle, Richard Osuala, Daniel M. Lang, Stefan M. Fischer, Ivana Janíčková, Karim Lekadir, Julia A. Schnabel, Jan C. Peeken

机构 * Technical University of Munich(慕尼黑工业大学) TUM University Hospital Rechts der Isar(慕尼黑工业大学伊萨尔河右岸大学医院) Helmholtz Munich(慕尼黑亥姆霍兹中心) Universitat de Barcelona(巴塞罗那大学) Medical University of Vienna(维也纳医科大学) King’s College London(伦敦国王学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 针对乳腺癌患者新辅助化疗治疗反应预测难题,提出基于影像的3D时空框架,集成图神经网络及时空交互关系建模与新自监督目标,实验表明该方法性能优越,还建立了预测基准并评估相关影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03377 2026-07-07 cs.CL cs.AI 新提交 62%

Spectral Signatures of Large Language Models

大语言模型的频谱特征

Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu, Zihang Liu, Hengrui Luo, Pu Ren, Yaoqing Yang

机构 * Rice University(莱斯大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02032 2026-07-07 cs.AI cs.CL 新提交 62%

PACE: A Proxy for Agentic Capability Evaluation

PACE:智能体能力评估的代理框架

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31179 2026-07-01 cs.AI cs.CL cs.CV 新提交 62%

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

HealthAgentBench:面向挑战性前沿AI代理的统一真实医疗环境基准套件

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

机构 * Microsoft(微软)

专题命中 代码评测 :code model(abstract);分类 cs.CL、cs.AI

AI总结 提出包含54个医疗任务的基准套件HealthAgentBench,评估AI代理在真实临床工作流中的端到端多步推理能力,最强代理Codex GPT-5.5仅达42%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11094 2026-07-01 cs.CL cs.AI cs.CR 62%

The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs

正义的尺度:关于大语言模型安全评估的全面调查

Songyang Liu, Chaozhuo Li, Jiameng Qiu, Xi Zhang, Feiran Huang, Litian Zhang, Yiming Hei, Philip S. Yu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Jinan University(暨南大学) Beihang University(北京航空航天大学) China Academy of Information and Communications Technology(中国信息通信研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文系统调研了大语言模型的安全评估现状,提出四维分类框架,分析评估原因、内容、场景及方法,指出当前挑战并提出研究方向,强调安全评估对可靠部署的重要性。

Comments 20 pages, preprint

Journal ref Information Fusion 136 (2026) 104579

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30294 2026-06-30 cs.AI cs.HC cs.SE 62%

Rehearsed Multi-Agent Live Product Demonstrations with Real-Time Voice Question Answering

排练式多智能体实时语音问答产品演示

Rahul Khedar, Mayank Malhotra, Avinash Karn, Mouli V, Prakhar Mehrotra

机构 * PayPal AI

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出多智能体系统Rhetor,通过跨模态特征表示、接地脚本、排练循环和运行时同步,实现带语音问答的实时产品演示自动化。

Comments Preprint. 4 figures, 1 algorithm, 5 tables. Systems paper with a preliminary six-session case study on four deployed applications; full benchmark protocol proposed, corpus run to appear in a later revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30062 2026-06-30 cs.CL cs.AI 62%

Little Brains, Big Feats: Exploring Compact Language Models

小脑袋,大成就:探索紧凑型语言模型

Dari Baturova, Elena Bruches, Ivan Chernov, Roman Derunets, Arsenii Fomin, Andrey Kostin

机构 * Siberian Neuronets LLC(西伯利亚神经网络有限公司)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本研究探索小型语言模型在检索增强生成(RAG)系统中的生成性能,实验表明无需GPU即可在设备上运行,并提供了基准测试结果。

Comments Accepted to ECML PKDD 2026, Applied Data Science track. Author preprint; the definitive version will appear in the proceedings of ECML PKDD 2026, Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28438 2026-06-30 cs.SE cs.AI 62%

When AI Reviews Its Own Code: Recursive Self-Training Collapse in Code LLMs

当AI审查自己的代码:代码大语言模型中的递归自训练崩溃

Xinyuan Song, Zekun Cai, Liang Zhao

机构 * Emory University(埃默里大学) The University of Tokyo(东京大学) LocationMind

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究代码LLM在递归自训练中因缺乏外部质量控制而崩溃的风险,对比无审查、人工门控和AI自门控三种机制,发现AI自门控会退化为无门控自训练,需外源验证。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27679 2026-06-29 cs.CL cs.AI 新提交 62%

From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Quang Minh Nguyen, Duc Anh Vu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity KAIST(韩国科学技术院)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 通过分解研究,发现原始隐藏状态和注意力特征在域内表现优异,但结构化压缩特征在分布偏移下更鲁棒,提示和标签构建显著影响探针行为,并训练出可迁移的预训练探针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26859 2026-06-29 cs.AI cs.CL cs.IR 新提交 62%

AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems

AgentX:迈向智能体驱动的工业推荐系统自迭代

Changxin Lao, Fei Pan, Guozhuang Ma, Han Li, Huihuang Lin, Jijun Shi, Kangzhi Zhao, Kun Gai, Mo Zhou, Qinqin Zhou, Quan Chen, Ruochen Yang, Shifu Bie, Shijie Yi, Shuang Yang, Shuo Yang, Wenhao Li, Wentao Xie, Xiao Lv, Xuming Wang, Yijun Wang, Yiming Chen, Yusheng Huang, Zhongyuan Wang, Zibo Zhao, Zijie Zhuang, Baoning Xia, Chao Liu, Chaoyi Ma, Chubo He, Dawei Cong, Feng Jiang, Gang Wang, Guilin Xia, Hanwen Xu, Jiahong Xie, Jiahui Qiao, Jian Liang, Jiangfan Yue, Jing Wang, Jinghan Yang, Jinghui Jia, Kan Qin, Lei Wang, Ming Li, Peilin Song, Pengbo Xu, Qiang Luo, Ruiming Tang, Shiyang Liu, Shuxian Jin, Tao Wang, Tao Zhang, Xiang Gao, Xianghan Li, Yingsong Luo, Yiwen Ning, Yongcheng Liu, Yueyang Liu, Yuan Guo, Zhaojie Liu, Zhenkai Cui

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 提出AgentX多智能体系统,通过闭环迭代自动生成、实施、评估推荐实验,实现工业推荐系统的自进化,突破人工瓶颈。

Comments Authors are listed alphabetically by their first name

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26852 2026-06-26 cs.AI cs.SE 新提交 62%

Context-Aware Synthesis of Optimization Pipelines for Warehouse Optimization

面向仓库优化的上下文感知优化流水线合成

Janik Bischoff, Anne Meyer, Uta Mohring, Fabian Dunke, Maximilian Barlang, Özge Nur Subas, Hadi Kutabi, Stefan Nickel, Kai Furmans

机构 * Institute for Information Management in Engineering, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院信息管理工程研究所) Department of Business Administration, University of Zurich(苏黎世大学工商管理系) Institute for Operations Research, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院运筹学研究所)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出CASOP框架,通过模块化算法库、语义卡片、问题分类、流水线合成与评估,自动生成并评估针对特定仓库上下文的优化流水线,在7个基准集上验证了1063044条有效流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22906 2026-06-23 cs.SE cs.AI 新提交 62%

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

从片段到路径:大型工业代码库的任务级上下文恢复

Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

机构 * AMAP, Alibaba Group(阿里集团AMAP) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) University of Cambridge(剑桥大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出DeepDiscovery方法,通过两阶段定位-推理框架在预算约束下恢复任务级上下文,显著提升大型工业代码库的文件检索和下游软件工程任务性能。

Comments 12 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21627 2026-06-23 cs.AI cs.LG 新提交 62%

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Counsel: 面向智能体任务的元评估数据集

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

机构 * Atla AI Cohere AI Mistral AI Google DeepMind(谷歌DeepMind)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09898 2026-06-23 cs.LG cs.AI 版本更新 62%

Learning Bug Context for PyTorch-to-JAX Translation with LLMs

学习 PyTorch 到 JAX 翻译中的 Bug 上下文

Hung Phan, Son Vu, Tuan Dinh, Nesreen Ahmed, Ali Payani, Ali Jannesari

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(Iowa State大学计算机科学系) Department of Human Science, Iowa State University, Ames, IA, USA(Iowa State大学人类科学系) Cisco AI Research, Outshift, San Jose, CA, USA(Cisco AI研究,Outshift,San Jose,加利福尼亚州,美国)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 针对 LLM 在 PyTorch 到 JAX 代码翻译中易出错的问题,构建 T2J 基准(含 bug 及修复),通过上下文学习使弱 LLM 翻译质量提升达 20%。

Comments ICML Deep Learning for Code (DL4C) workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16988 2026-06-16 cs.SE cs.LG 新提交 62%

Agent trajectories as programs: fingerprinting and programming coding-agent behavior

智能体轨迹作为程序:编码智能体行为的指纹识别与编程

Hamidah Oderinwale

机构 * McGill University(麦吉尔大学) Taste Labs

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.LG

AI总结 提出通过程序性表示分析智能体行为模式,实现轨迹指纹识别(85.7%准确率),并开发ProcGrep库用于审计和评估智能体任务处理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13608 2026-06-16 cs.AI cs.LG 新提交 62%

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化

Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Purdue University(普渡大学) University of Ljubljana(卢布尔雅那大学) University of Washington(华盛顿大学) Oasis Labs University of Maryland(马里兰大学) IBM Research(IBM研究院) Mila McGill University(麦吉尔大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学) National Institute of Standards and Technology(美国国家标准与技术研究院) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出代理化智能体评估(AAA)框架,通过标准化协议(A2A和MCP)统一评估接口,实现开放、可复现的多智能体评估,并基于AgentBeats系统通过大规模竞赛和案例研究验证其覆盖性、实用性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏