arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-11 至 2026-08-11 共收录 53 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 14 篇

2608.07925 2026-08-11 cs.AI 新提交 57%

ZhuLong: Execution-Grounded LLM Agent for EDA Scripting with Offline API Self-Exploration

ZhuLong:基于执行的大语言模型智能体,用于结合离线API自探索的EDA脚本编写

Yang Liu, Shiwei Hou, Xiyuan Chen, Yu Wang, Sen Yuan, Qirui Gan, Shao You, Feifan Chen, Wencheng Li, Shuyang Hu, Yongzhou Liu, Emma Xia, Xiaojing Lu, Hao Wang, Fan Xu, Yanfeng Li

机构 * Changxin Memory Technologies, Inc.(长鑫存储技术有限公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出基于执行的LLM智能体ZhuLong,结合API检索、沙箱执行与离线API自探索机制,在EDA脚本任务基准测试中性能远超纯LLM基线,为EDA脚本编写提供了有效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07885 2026-08-11 cs.AI 新提交 57%

Reason Wide, Not Deep: Amortizing the Reasoning Premium into Distilled Skills

广泛推理,而非深度推理:将推理溢价分摊到提炼技能中

Agamdeep Singh, Srishti Gautam, Priyanshu Gupta, Nikita Mehrotra, Tanmay Bakshi, Sumit Gulwani

机构 * Microsoft(微软公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究提出将推理模式的重复分摊为跨任务提炼的技能,在四个智能体基准上大幅降低代币量的同时恢复多数推理性能,部分场景下优于推理模式。

Comments COLM 2026 Efficient Reasoning Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27380 2026-08-11 cs.CV cs.AI 版本更新 57%

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

VideoCoCo:基于智能体双引擎系统的、以代码为思维链(CoT)的物理一致性视频生成方法

Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

机构 * CUHK(香港中文大学) USTC(中国科学技术大学) SCUT(华南理工大学) HKU(香港大学) NTU(南洋理工大学) PKU(北京大学) SJTU(上海交通大学) CMU(卡内基梅隆大学) THU(清华大学) HUST(华中科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 VideoCoCo作为智能体双引擎框架,以可执行Blender代码为过程级思维链,构建专属数据集提升视频编辑器适配性,在两个基准上显著优于基线,实现了高质量物理一致性视频生成。

Comments 15 pages, 3 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18171 2026-08-11 cs.LG 版本更新 57%

FlashRT: Agent Harness for Guiding Agents to Deploy Real-Time Multimodal Applications

FlashRT:用于引导智能体部署实时多模态应用的智能体框架

Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) AMD(超威半导体公司) University at Buffalo(纽约州立大学水牛城分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 研究实时多模态应用部署难题,提出FlashRT智能体框架。通过新范式引导编码智能体多阶段转换,将参考实现转为高效部署,在不同GPU上显著提升性能,尤其在专家优化不成熟平台更具扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07555 2026-08-11 cs.RO 新提交 50%

You Don't Need To Stay in The Loop: An Agentic Robotics Loop for Robot-Policy Improvement

你无需停留在循环中:用于机器人策略改进的智能体机器人循环

Hang Yu

专题命中 软件智能体 :coding agent(abstract)

AI总结 该研究将编码智能体的软件循环架构迁移至机器人策略改进领域,提出AgenticRobotics控制平面,解决机器人工具易失效问题,实现错误提升控制等性能提升。

Comments Agentic Robotics Preview Version

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 程序修复 1 篇

2607.01916 2026-08-11 cs.AI 版本更新 88%

ContextSniper: AntTrail's Token-Efficient Code Memory for Repository-Level Program Repair

ContextSniper: AntTrail的令牌高效代码记忆用于仓库级程序修复

Chiwang Luk, Matin Mohammad Najafi, Zhifeng Jia, Wei Yang, Xiuchang Li, Jinwei Zhu, Yang Ren, Lei Chen, Gao Cong

机构 * Huawei(华为) HKUST(GZ)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 程序修复 :program repair(title,abstract);repository(title,abstract);分类 cs.AI

AI总结 提出ContextSniper,一种令牌高效的代码记忆层,通过精准证据选择、混合检索排序和意图感知上下文门控,在SWE-bench Lite上减少51.5%令牌使用和36.4%成本,修复率仅轻微下降。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 3 篇

2601.08856 2026-08-11 cs.SE cs.AI 版本更新 81%

LAUDE: LLM-Assisted Unit Test Generation and Debugging of Hardware DEsigns

LAUDE: 基于LLM的硬件设计单元测试生成与调试

Deeksha Nandal, Riccardo Revalor, Soham Dan, Debjit Pal

机构 * Dept. of Electrical and Computer Engineering, University of Illinois Chicago(伊利诺伊大学芝加哥分校电子与计算机工程系) Microsoft(微软公司)

专题命中 测试生成 :unit test generation(title,abstract);分类 cs.SE、cs.AI

AI总结 LAUDE利用大语言模型能力,实现硬件设计的单元测试生成与调试,有效检测和修复设计中的错误。

Comments 11 Pages, 9 Figures, 9 Tables Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08069 2026-08-11 cs.SE cs.AI 新提交 62%

HugSelect: An Explainable Multi-Criteria Decision-Support Framework for foundation-model selection

HugSelect:一种用于基础模型选择的可解释多标准决策支持框架

Alireza Joonbakhsh, Arda Canser Adalı, Slinger Jansen, Farshad Khunjush, Siamak Farshidi

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 HugSelect是用于基础模型选择的可解释多标准决策支持框架,构建含71274个模型的知识库,经多维度评估,推荐质量与商业系统相当,推理可追溯且实用直观。

Comments Pages: 29, Figures: 5. Corresponding authors: Alireza Joonbakhsh (alireza.joonbakhsh@hafez.shirazu.ac.ir) and Siamak Farshidi (siamak.farshidi@wur.nl)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09459 2026-08-11 cs.CL 版本更新 57%

From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models

从推理到代理:大型语言模型强化学习中的信用分配

Chenchen Zhang

机构 * Independent Researcher(独立研究员)

专题命中 测试生成 :repository(abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型强化学习中信用分配问题,总结了47种方法,并提出了可重用的资源,指出从推理到代理的转变使信用分配更加复杂,推动了新的方法发展。

Comments 50 pages, 4 figures. v3: expanded to a unified 69-paper corpus through July 31, 2026; adds restored-state identification results, blind coding of a 42-paper full-text subset, a source-located reporting audit, the CA-ID Card, and replay-fidelity analysis

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 6 篇

2608.08709 2026-08-11 cs.AI cs.SE 新提交 62%

AI Evaluation Should Measure Verification Cost, Not Correctness Alone

AI评估应衡量验证成本,而非仅正确性

Viviana Crescitelli, Generoso Immediato, Fabio Persia, Stefania Costantini

机构 * Hitachi, Ltd.(日立制作所) Hitachi Rail(日立铁路)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 该研究指出AI评估仅靠正确性不足,提出需纳入验证成本,定义了验证成本错误,通过代码生成等证据说明高基准准确率可能掩盖高验证成本,主张评估应考虑现实资源约束下的错误可检测性。

Comments 20 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21597 2026-08-11 cs.SE cs.CL cs.IR 版本更新 62%

ATLAS: Agentic Taxonomy of Large-Scale Software Ecosystems

ATLAS: 大规模软件生态系统的智能体分类体系

Junyi Lu, Mengyao Lyu, Jiahui Wu, Lei Yu, Chengwei Liu, Fengjun Zhang, Li Yang, Chun Zuo, Yang Liu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Nankai University(南开大学) Sinosoft Company Limited(中软国际有限公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL

AI总结 提出ATLAS框架,结合LLM全局知识与实际仓库分布,通过智能体协作和自修正循环自动构建软件仓库的层次化分类体系,在54,387个GitHub仓库上评估,分类质量F1达83.13%,优于基线15个百分点。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26937 2026-08-11 cs.CL cs.AI 版本更新 62%

Beyond Questions: Evaluating LLM's Knowledge Expression

超越问题:评估大型语言模型(实际)知道什么

Luca Giordano, Simon Razniewski

机构 * ScaDS.AI Dresden/Leipzig & TU Dresden, Germany(ScaDS.AI 德尔布兰德/莱比锡及德累斯顿技术大学,德国)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 提出开放知识评估新范式,通过开放式提示(如“告诉我关于M.L. King的一切”)评估模型自然表达的知识,并构建BeQu基准测试10,000个实体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08184 2026-08-11 cs.AI 新提交 57%

Large Multimodal Agents for Intelligent Transportation Systems: Architectures, Evidence, and Deployment Challenges

面向智能交通系统的大型多模态智能体:架构、证据与部署挑战

Muhammad Ayub Sabir, Shaohong Zheng, Zhiyu Qu, Fatima Ashraf, Junbiao Pang

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本综述梳理2023-2026年42个LMAs研究家族,评估其在ITS中的多模态性、性能与部署情况,支持有限编排而非替代,提供评估协议与部署路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新 57%

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14633 2026-08-11 cs.CV 版本更新 50%

VIGIL: Tackling Hallucination Detection in Image Recontextualization

VIGIL:应对图像再上下文化中的幻觉检测

Joanna Wojciechowicz, Maria Łubniewska, Jakub Antczak, Justyna Baczyńska, Wojciech Gromski, Wojciech Kozłowski, Maciej Zieba

机构 * Wroclaw University of Science and Technology(沃拉茨拉夫大学科学与技术学院)

专题命中 代码评测 :repository(abstract)

AI总结 VIGIL通过细粒度分类填补多模态模型图像再上下文化中幻觉检测的空白,提出多阶段检测流程并公开资源促进透明度。

Comments 19 pages, 8 figures, 7 tables. Code and data are available at: https://github.com/mlubneuskaya/vigil and https://huggingface.co/datasets/joannaww/VIGIL

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 8 篇

2604.08377 2026-08-11 cs.AI cs.CL 版本更新 62%

SkillClaw: Let Skills Evolve Collectively with Agentic Evolver

SkillClaw: 让技能与代理进化者共同进化

Ziyu Ma, Shidong Yang, Yuxiang Ji, Xucong Wang, Yong Wang, Yiming Hu, Tongwen Huang, Xiangxiang Chu

机构 * DreamX Team(DreamX团队)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14219 2026-08-11 cs.LG cs.AI cs.DC 62%

A Survey on Inference Optimization Techniques for Mixture of Experts Models

Jiacheng Liu, Peng Tang, Wenfeng Wang, Yuhang Ren, Xiaofeng Hou, Pheng-Ann Heng, Minyi Guo, Chao Li

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

Comments Under Review

Journal ref ACM CSUR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09181 2026-08-11 cs.SE cs.CR 新提交 57%

Memoir: Learning, Verifying, and Evolving False-Positive Memories for Static Application Security Testing Tools

Memoir:针对静态应用安全测试工具的误报记忆学习、验证与演化

Shenyuan Guan, Qiaodan Hou, Yanjun Chen, Xincheng Wen, Jia Feng, Keke Lian, Cuiyun Gao

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究针对SAST工具的误报问题,提出Memoir框架,通过构建与演化语义记忆实现误报识别,在CWE-Bench-Java上表现优异,且记忆库可跨工具泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08453 2026-08-11 cs.AI cs.CR 新提交 57%

What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files

是什么阻碍了智能体技能的可复用性?来自13.8万个SKILL.md文件的证据

Chi Zhang, Yimin Liu, Xinze Chen, Ping Ji

机构 * The Graduate Center, City University of New York(纽约城市大学研究生中心) The Ohio State University(俄亥俄州立大学) Hunter College, City University of New York(纽约城市大学亨特学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本研究通过分析13.8万个SKILL.md文件,发现91.8%的Agent Skills存在可复用性相关缺陷,主要为打包问题,验证了路由元数据对检索可靠性的影响,并提出了结合规范提示等的质量保证生成工作流。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28120 2026-08-11 cs.DL cs.SE cs.SI 版本更新 57%

The Reciprocal Impact of Science and Software: A Cross-Corpus Analysis of How Research Shapes Software and Software Enables Research

科学与软件的相互影响:跨语料库分析研究如何塑造软件以及软件如何赋能研究

Audris Mockus

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 通过构建包含6980万条边的跨语料库图,链接软件仓库与学术文献,分析科学对软件的影响(如可重复性工具)和软件对科学的影响(如机器学习基础设施),发现直接引用稀疏且依赖复用与引用计数的相关性较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22758 2026-08-11 cs.AI 版本更新 57%

AutoRefine: Compiling Trajectories into Validated Typed Agent Artifacts

AutoRefine: 从轨迹到可重用的专业知识为连续LLM代理优化

Libin Qiu, Zhirong Gao, Junfu Chen, Yuhang Ye, Liangyu Li, Weizhi Huang, Xiaobo Xue, Wenkai Qiu, Shuo Tang

机构 * alibaba(阿里巴巴集团)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 AutoRefine通过提取和维护双重形式的经验模式,提升连续LLM代理的知识积累与维护效率,实现98.4%的准确率提升。

Comments 7 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07901 2026-08-11 cs.GT cs.AI cs.CY cs.MA econ.TH 版本更新 57%

The Theory of Strategic Evolution: Games with Endogenous Players and the Seven Laws of Strategic Replicators

战略进化理论:具有内生参与者和战略复制者的博弈

Kevin Vallier

机构 * Institute of American Constitutional Thought and Leadership(美国宪法思想与领导力研究所) University of Toledo(托莱多大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出战略进化理论,引入具有内生参与者的博弈,定义进化稳定智能分布,通过跨层增益矩阵构建战略层层次结构,证明相关封闭性及定理,可用于分析人工智能部署动态等,揭示人格工程问题及稳定多智能体系统的宪法约束。

Comments 171 pages. Formalized in Lean 4 with Mathlib: 240 theorems in the elaborated environment, 141 audited headline results, cold-compiling from a clean checkout with zero custom axioms. Source, theorem-by-theorem contract, and reproducible axiom audit: https://github.com/selfreferencing/TSE_Formal. Companion to Agentic Capital

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09062 2026-08-11 cs.CV cs.LG 版本更新 57%

SIP: Site in Pieces- A Dataset of Disaggregated Construction-Phase 3D Scans for Semantic Segmentation and Scene Understanding

SIP: 构建阶段碎片化3D扫描数据集——用于语义分割和场景理解

Seongyong Kim, Yong Kwon Cho

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 SIP数据集通过碎片化3D扫描反映施工现场实际约束,为建筑场景的语义分割和理解提供高质量基准数据。

详情

展开后加载摘要…

URL PDF HTML 收藏