arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-17 至 2026-04-17 共收录 4 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 4 篇

2604.06296 2026-04-17 cs.LG cs.AI cs.MA cs.SE 67%

AgentOpt v0.1 Technical Report: Client-Side Optimization for LLM-Based Agent

AgentOpt v0.1 技术报告:基于LLM的代理的客户端优化

Wenyue Hua, Sripad Karne, Qian Xie, Armaan Agrawal, Nikos Pagonas, Kostis Kaffes, Tianyi Peng

机构 * Microsoft Research, AI Frontiers(微软研究院,人工智能前沿) Cornell University(康奈尔大学) Columbia University(哥伦比亚大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出AgentOpt框架,用于解决LLM代理客户端资源分配问题,通过多种搜索算法优化模型选择和资源分配,提升效率与效果。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23121 2026-04-17 cs.CL cs.AI 62%

Uncovering the Fragility of Trustworthy LLMs through Chinese Textual Ambiguity

通过中文文本歧义揭示可信大语言模型的脆弱性

Xinwei Wu, Haojie Li, Hongyu Liu, Xinyu Ji, Ruohan Li, Yule Chen, Yigeng Zhang

机构 * Chalmers University of Technology(楚德斯技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在处理中文歧义文本时的脆弱性,通过创建基准数据集发现模型在歧义处理上存在显著缺陷,影响实际应用。

Comments Accepted at KDD workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models (Agentic & GenAI Evaluation Workshop KDD '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15151 2026-04-17 cs.CL 57%

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

QuantCode-Bench: 一个用于评估大型语言模型生成可执行算法交易策略能力的基准

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

机构 * Lime

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本文提出QuantCode-Bench,通过多阶段流程评估现代LLM生成Backtrader框架策略的能力,包含400个不同难度任务,分析模型在交易逻辑、API使用和任务语义方面的局限性。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14828 2026-04-17 cs.CL 57%

Pangu-ACE: Adaptive Cascaded Experts for Educational Response Generation on EduBench

Pangu-ACE:适应性级联专家用于EduBench教育响应生成

Dinghao Li, Wenlong Zhou, Zhimin Chen, Yuehan Peng, Hong Ni, Chengfu Zou, Guoyu Shi, Yaochen Li

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 Pangu-ACE通过级联专家系统提升教育响应质量,在EduBench基准上实现更高效的计算分配,改进确定性和格式有效性,同时保持较低的直接请求比例。

详情

展开后加载摘要…

URL PDF HTML 收藏