arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-07 至 2026-07-07 共收录 8 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 8 篇

2607.02931 2026-07-07 cs.AI 新提交 70%

VERITAS: Towards a General-Purpose Replication Tool for Scientific Research

VERITAS:迈向科学研究的通用复制工具

Haokun Liu, Filbert Aurelian Tjiaranata, Chenhao Tan

机构 * University of Chicago(芝加哥大学) University of Indonesia(印度尼西亚大学)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 针对科研成果独立验证难且手工复制慢贵的问题,提出VERITAS框架,围绕CLI编码代理构建,可提取论文主张、运行方法并判断主张,在多领域评估中性能达最优。

Comments 21 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07591 2026-07-07 cs.LG cs.AI cs.CL 版本更新 67%

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

ResearchClawBench: 端到端自主科学研究基准

Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao, Yiheng Wang, Qi Li, Kun Li, Sheng Xu, Shengdu Chai, Fangchen Yu, Xiangyu Zhao, Zhangrui Zhao, Weijie Ma, Zijie Guo, Koutian Wu, Haoyu Zhou, Haoxiang Yin, Lixue Cheng, Chaofan Hu, Haoxuan Li, Lu Mi, Xuxuan Xie, Yifan Zhou, Ruizhe Chen, Zhiwang Zhou, Xingjian Guo, Yuhao Zhou, Xuming He, Shengyuan Xu, Xinyu Gu, Jiamin Wu, Mianxin Liu, Chunfeng Song, Fenghua Ling, Dongzhan Zhou, Shixiang Tang, Yuqiang Li, Mao Su, Peng Ye, Siqi Sun, Bin Wang, Xue Yang, Zhenfei Yin, Tianfan Fu, Guangtao Zhai, Wanli Ouyang, Bo Zhang, Lei Bai, Wenlong Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04912 2026-07-07 cs.CV cs.AI cs.LG 新提交 62%

Graph Representation Learning of Longitudinal Medical Imaging Trajectories for Treatment Response Prediction

用于治疗反应预测的纵向医学影像轨迹的图表示学习

Johannes Kiechle, Richard Osuala, Daniel M. Lang, Stefan M. Fischer, Ivana Janíčková, Karim Lekadir, Julia A. Schnabel, Jan C. Peeken

机构 * Technical University of Munich(慕尼黑工业大学) TUM University Hospital Rechts der Isar(慕尼黑工业大学伊萨尔河右岸大学医院) Helmholtz Munich(慕尼黑亥姆霍兹中心) Universitat de Barcelona(巴塞罗那大学) Medical University of Vienna(维也纳医科大学) King’s College London(伦敦国王学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 针对乳腺癌患者新辅助化疗治疗反应预测难题,提出基于影像的3D时空框架,集成图神经网络及时空交互关系建模与新自监督目标,实验表明该方法性能优越,还建立了预测基准并评估相关影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03377 2026-07-07 cs.CL cs.AI 新提交 62%

Spectral Signatures of Large Language Models

大语言模型的频谱特征

Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu, Zihang Liu, Hengrui Luo, Pu Ren, Yaoqing Yang

机构 * Rice University(莱斯大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02032 2026-07-07 cs.AI cs.CL 新提交 62%

PACE: A Proxy for Agentic Capability Evaluation

PACE:智能体能力评估的代理框架

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05197 2026-07-07 cs.SE 新提交 57%

Is Three the Magic Number? An Empirical Evaluation of LLM-Based Repair Loops

三是神奇数字吗?基于大语言模型的修复循环的实证评估

Tobias Kiecker, Eik Reichmann, Hosung Kang, Gabin An, Lars Grunske

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 研究基于大语言模型的修复循环迭代限制,通过多个软件工程任务观察到收益递减模式,前几次迭代收获大,后续贡献小,还发现修复行为受工作流编排和反馈设计影响更大。

Comments 4 Pages (+1 for references), NIER Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04136 2026-07-07 cs.AI 版本更新 57%

A Technical Survey of Reinforcement Learning Techniques for Large Language Models

大语言模型强化学习技术的技术综述

Saksham Sahai Srivastava, Vaneet Aggarwal

机构 * University of Georgia(佐治亚大学) Purdue University(普渡大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 综述强化学习与语言模型整合,介绍如近端策略优化等算法,分析其在各领域应用,对失败模式算法分析,给出分类法,评估趋势并探讨挑战与新兴方向,为研究提供路线图。

Comments Accepted to ACM Transactions on Intelligent Systems and Technology, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04825 2026-07-07 cs.MA 新提交 50%

Dynamic Airspace Management for UAVs in Evolving Urban Environments: Collaborative Coordination and Human Safety

动态空域管理用于不断演变的城市环境中的无人机:协同协调与人类安全

Lin Sun, Yuhang Wang, Fan Meng Hong, Haopeng Chen, Yan Jiao, Yongming Xu

专题命中 代码评测 :repository(abstract)

AI总结 针对复杂城市环境中无人机安全运行难题,提出协作多无人机空域管理系统Pharos,介于分布式与集中式范式间,采用MAPPO算法,经仿真验证其有效协调能力及在减少人类恐惧、提升空间利用率方面优势。

详情

展开后加载摘要…

URL PDF HTML 收藏