arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3217 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3217 篇

2603.06739 2026-03-12 cs.SE cs.AI 62%

ResearchEnvBench: Benchmarking Agents on Environment Synthesis for Research Code Execution

ResearchEnvBench: 为研究代码执行环境合成的基准测试

Yubang Wang, Chenxi Zhang, Bowen Chen, Zezheng Huai, Zihao Dai, Xinchi Chen, Yuxin Wang, Yining Zheng, Jingjing Gong, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI(可信具身AI研究院) Shanghai Innovation Institution(上海创新机构) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身AI重点实验室) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) OpenMOSS Wuhan University(武汉大学) Nanjing University(南京大学) Jilin University(吉林大学)

专题命中 软件智能体 :autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 ResearchEnvBench 是一个用于评估自主代理在研究代码执行中环境合成能力的基准测试,旨在解决当前代理在依赖解析和版本耦合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18057 2026-03-11 cs.LG cs.AI cs.CC math.CO 62%

Reinforced Generation of Combinatorial Structures: Hardness of Approximation

增强的组合结构生成:近似难度

Ansh Nagda, Prabhakar Raghavan, Abhradeep Thakurta

机构 * University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Google(谷歌)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 利用AI方法在复杂性理论中取得进展,改进MAX-CUT、MAX-3-CUT和TSP的近似难度结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15701 2026-03-10 cs.AR cs.CL cs.LG 62%

HDLxGraph: Bridging Large Language Models and HDL Repositories via HDL Graph Databases

HDLxGraph: 通过HDL图数据库连接大型语言模型和HDL仓库

Pingqing Zheng, Jiayin Qin, Fuqi Zhang, Niraj Chitla, Zishen Wan, Shang Wu, Yu Cao, Caiwen Ding, Yang, Zhao

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.LG

AI总结 HDLxGraph通过整合HDL图特性与RAG,提升LLM在HDL任务中的搜索、调试和完成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07896 2026-03-10 cs.AI cs.LG 62%

SMGI: A Structural Theory of General Artificial Intelligence

SMGI:一般人工智能的结构理论

Aomar Osmani

机构 * INSA-Rouen(鲁昂国家理工学院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 SMGI提出了一种一般人工智能的结构理论,通过严格数学分离结构本体与行为语义,定义了满足四个义务的耦合动态,并证明了结构泛化界限和结构包含定理。

Comments Preprint. 77 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04293 2026-03-05 cs.SD cs.AI cs.IR cs.LG 62%

LabelBuddy: An Open Source Music and Audio Language Annotation Tagging Tool Using AI Assistance

LabelBuddy: 一种利用人工智能辅助的开源音乐和音频语言标注标签工具

Ioannis Prokopiou, Ioannis Sina, Agisilaos Kounelis, Pantelis Vikatos, Themos Stafylakis

机构 * Athens University of Economics and Business(雅典经济与商业大学) Orfium(Orfium公司) University of Patras(帕特拉斯大学) Archimedes/Athena R.C.(阿基米德/雅典研究会)

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI、cs.LG

AI总结 LabelBuddy是一种开源工具,利用AI辅助进行音乐和音频语言标注,通过容器化后端和多用户共识机制提升音频标注的准确性和效率。

Comments Accepted at NLP4MusA 2026 (4th Workshop on NLP for Music and Audio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01012 2026-03-04 cs.SE cs.AI 62%

FastCode: Fast and Cost-Efficient Code Understanding and Reasoning

FastCode: 快速且成本有效的代码理解和推理

Zhonghang Li, Zongwei Li, Yuxuan Chen, Han Shi, Jiawei Li, Jierun Chen, Haoli Bai, Chao Huang

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 FastCode通过结构化勘探机制提升代码推理效率,减少计算成本,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01048 2026-03-03 cs.SE cs.AI 62%

RepoRepair: Leveraging Code Documentation for Repository-Level Automated Program Repair

RepoRepair: 利用代码文档实现仓库级别的自动程序修复

Zhongqiang Pan, Chuanyi Li, Wenkang Zhong, Yi Feng, Bin Luo, Vincent Ng

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Human Language Technology Research Institute, University of Texas at Dallas(人机语言技术研究院,德克萨斯大学达拉斯分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 RepoRepair通过生成代码文档增强LLM能力,实现仓库级别的自动程序修复,取得高修复率和低成本的优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05296 2026-03-03 cs.AI cs.LG 62%

Control Tax: The Price of Keeping AI in Check

控制税:保持AI受控的成本

Mikhail Terekhov, Zhen Ning David Liu, Caglar Gulcehre, Samuel Albanie

机构 * EPFL(瑞士联邦理工学院) MATS

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出控制税概念,通过理论框架量化控制成本,评估语言模型在对抗性环境下的安全性,并开发优化的监控策略以平衡安全与成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00575 2026-03-03 cs.AI cs.SE 62%

SWE-Hub: A Unified Production System for Scalable, Executable Software Engineering Tasks

SWE-Hub:一个统一的生产系统,用于可扩展、可执行的软件工程任务

Yucheng Zeng, Shupeng Li, Daxiang Dong, Ruijie Xu, Zimo Chen, Liwei Zheng, Yuxuan Li, Zhe Zhou, Haotian Zhao, Lun Tian, Heng Xiao, Tianshu Zhu, Longkun Hao, Jianmin Wu

机构 * Qianfan Team, Baidu Inc.(百度公司)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 SWE-Hub通过统一的生产系统解决软件工程任务中可执行、可扩展和现实数据的稀缺问题,整合环境自动化、大规模合成和多样化任务生成,实现持续交付可执行任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03383 2026-02-27 cs.LG cs.AI 62%

UniQL: Unified Quantization and Low-rank Compression for Adaptive Edge LLMs

UniQL: 面向自适应边缘LLM的统一量化与低秩压缩

Hung-Yueh Chiang, Chi-Chih Chang, Yu-Chen Lu, Chien-Yu Lin, Kai-Chiang Wu, Mohamed S. Abdelfattah, Diana Marculescu

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 UniQL通过统一量化与低秩压缩技术,实现边缘LLM的高效部署,支持多种模型结构,提升内存效率与吞吐量,保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10471 2026-02-24 cs.SE cs.CL 62%

TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation

TestExplora: 通过仓库级测试生成对LLMs进行主动bug发现的基准测试

Steven Liu, Jane Luo, Xin Zhang, Aofan Liu, Hao Liu, Jie Wu, Ziyang Huang, Yangyu Huang, Yu Kang, Scarlett Li

机构 * Microsoft(微软公司) School of ECE, Peking University(北京大学电子工程学院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.SE

AI总结 TestExplora通过仓库级测试生成评估LLMs在主动bug发现中的能力,揭示了当前模型在复杂交互和代理探索方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17084 2026-02-20 cs.AI cs.SE 62%

How AI Coding Agents Communicate: A Study of Pull Request Description Characteristics and Human Review Responses

AI 编程代理如何交流:对拉取请求描述特征和人类审查响应的研究

Kan Watanabe, Rikuto Tsuchida, Takahiro Monno, Bin Huang, Kazuma Yamasaki, Youmei Fan, Kazumasa Shimari, Kenichi Matsumoto

机构 * Nara Institute of Science and Technology(奈良科学技術研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究分析了AI编程代理在拉取请求描述风格上的差异及其对人类审查员响应的影响,揭示了人机协作开发中的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16805 2026-02-20 cs.AI cs.LG 62%

Simple Baselines are Competitive with Code Evolution

简单基线在代码进化中具有竞争力

Yonatan Gideoni, Sebastian Risi, Yarin Gal

机构 * University of Oxford(牛津大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现简单基线在代码进化任务中表现优异,指出搜索空间设计和评估方法改进是未来研究重点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12058 2026-02-13 cs.SE cs.AI cs.FL 62%

ModelWisdom: An Integrated Toolkit for TLA+ Model Visualization, Digest and Repair

ModelWisdom: 一个集成工具包用于TLA+模型可视化、摘要与修复

Zhiyong Chen, Jialun Cao, Chang Xu, Shing-Chi Cheung

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,中国) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 ModelWisdom通过可视化、图优化、摘要和修复功能,提升TLA+模型检查的可解释性和可操作性。

Comments Accepted by FM 2026 Research Track (Tool)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03828 2026-02-13 cs.AI cs.CL cs.CV cs.DL 62%

AutoFigure: Generating and Refining Publication-Ready Scientific Illustrations

AutoFigure: 生成和细化可用于出版的科学插图

Minjun Zhu, Zhen Lin, Yixuan Weng, Panzhong Lu, Qiujie Xie, Yifan Wei, Sifan Liu, Qiyao Sun, Yue Zhang

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 AutoFigure通过代理框架自动生成高质量科学插图,基于长篇科学文本并优于基线方法,实现结构和视觉的双重完善。

Comments Accepted at the ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07348 2026-02-13 cs.CL cs.AI cs.NE 62%

Controlled Self-Evolution for Algorithmic Code Optimization

算法代码优化的受控自演进

Tu Hu, Ronghao Chen, Shuo Zhang, Jianghao Yin, Mou Xiao Feng, Jingping Liu, Shaolei Zhang, Wenqi Jiang, Yuqi Fang, Sen Hu, Huacan Wang, Yi Xu

机构 * NJU(南京大学) PKU(北京大学) Midea-AIRC(美的人工智能研究院) ECNU(华东师范大学) SYSU(南方科技大学) RUC(中国人民大学) QuantaAlpha(量子Alpha) QuantML(量子机器学习)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.CL

AI总结 受控自演进通过改进初始化、反馈引导和经验记忆,提升算法代码优化的效率和效果。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11159 2026-02-13 cs.AI cs.HC cs.LG 62%

Explaining AI Without Code: A User Study on Explainable AI

无需代码解释AI:可解释AI的用户研究

Natalia Abarca, Andrés Carvallo, Claudia López Moncada, Felipe Bravo-Marquez

机构 * Department of Computer Science, University of Chile(智利大学计算机科学系) CENIA – National Center for Artificial Intelligence(人工智能国家研究中心) Universidad Técnica Federico Santa María(弗朗西斯科·桑塔玛利亚技术大学) IMFD - Millennium Institute for Foundational Research on Data(数据基础研究千年研究所)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DashAI平台中的可解释AI模块,通过整合PDP、PFI和KernelSHAP技术,提升无代码ML中解释的可访问性和详细性。

Comments LatinX in AI Workshop @ NeurIPS-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11000 2026-02-12 cs.DC cs.AI cs.LG 62%

Fine-Tuning GPT-5 for GPU Kernel Generation

为GPU内核生成微调GPT-5

Ali Tehrani, Yahya Emara, Essam Wissam, Wojciech Paluch, Waleed Atallah, Łukasz Dudziak, Mohamed S. Abdelfattah

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 通过强化学习微调GPT-5提升GPU内核生成性能,实现正确率和效率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10153 2026-02-12 cs.CR cs.LG cs.SE 62%

Basic Legibility Protocols Improve Trusted Monitoring

基础可读性协议提升可信监控

Ashwin Sreevatsa, Sebastian Prasanna, Cody Rushing

机构 * Cambridge Boston Alignment Initiative (CBAI) Summer Research Fellowship(剑桥波士顿对齐计划暑期研究奖学金) Redwood Research(红木研究)

专题命中 软件智能体 :agent(abstract);分类 cs.LG、cs.SE

AI总结 本研究提出可读性协议,通过鼓励不受信任模型产生易于监控评估的行为,提升可信监控的安全性,同时增强监控者对诚实代码的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06268 2026-02-11 cs.SE cs.AI 62%

Automated QoR improvement in OpenROAD with coding agents

在OpenROAD中通过编码代理实现自动化QoR提升

Amur Ghose, Junyeong Jang, Andrew B. Kahng, Jakang Lee

机构 * UC San Diego(UC圣地亚哥大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 AuDoPEDA通过自主编码代理在OpenROAD中实现EDA技术的自动化改进,显著提升QoR指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01003 2026-02-10 cs.SE cs.CL 62%

Improving Code Localization with Repository Memory

通过仓库记忆提升代码定位

Boshi Wang, Weijian Xu, Yunsheng Li, Mei Gao, Yujia Xie, Huan Sun, Dongdong Chen

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 通过利用仓库提交历史增强语言代理的记忆,提升代码定位性能,更接近人类开发者经验。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06593 2026-02-09 cs.SE cs.AI 62%

AgentStepper: Interactive Debugging of Software Development Agents

AgentStepper: 软件开发代理的交互式调试

Robert Hutter, Michael Pradel

机构 * University of Stuttgart(斯图加特大学) CISPA Helmholtz Center for Information Security(CISPA 沃尔夫冈·泡利信息安全中心)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 AgentStepper是一种用于LLM软件工程代理的交互式调试工具,通过结构化对话和逐步执行提升调试效率,减少开发者工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16956 2026-02-09 cs.SE cs.LG 62%

SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

SpIDER:面向软件问题定位的时空感知密集嵌入检索

Shravan Chaudhari, Rahul Thomas Jacob, Mononito Goswami, Jiajun Cao, Shihab Rashid, Christian Bock

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 SpIDER通过结合LLM推理和图结构探索信息,提升代码库中相关代码单元的密集检索性能,实验显示在多个编程语言和基准测试中性能提升达13%。

Comments Initial preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13515 2026-02-06 cs.SE cs.CL cs.LO 62%

Fine-tuned LLM-based Code Migration Framework

基于微调的LLM代码迁移框架

Oleg Grynets, Vasyl Lyashkevych, Dmytro Baran, Maksym Orliansky, Taras Zelenyy, Markiian Leshchyshyn

专题命中 软件智能体 :workflow(abstract);分类 cs.CL、cs.SE

AI总结 本研究提出一种基于微调LLM的代码迁移框架,通过自动化SQL特征检测和半监督错误分析,提升数据库迁移的精度与效率。

Comments 16 pages, 27 figures, 7 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10192 2026-02-05 cs.LG cs.AI cs.DM quant-ph 62%

Multi-Excitation Projective Simulation with a Many-Body Physics Inspired Inductive Bias

多激发投影模拟:受多体物理启发的归纳偏置

Philip A. LeMaitre, Marius Krumm, Hans J. Briegel

机构 * University of Innsbruck, Institute for Theoretical Physics(因斯布鲁克大学理论物理研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多激发投影模拟(mePS)方法,通过受多体物理启发的归纳偏置解决超图建模中的指数复杂性问题,并在多个场景中验证了其资源节省和可解释性优势。

Comments 41 pages, 9 figures; Code repository at https://github.com/MariusKrumm/ManyBodyMEPS. Updated to be consistent with AIJ version

Journal ref Artificial Intelligence 352, 104489 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02084 2026-02-04 cs.CL cs.SE 62%

Closing the Loop: Universal Repository Representation with RPG-Encoder

闭环:通用仓库表示法与RPG-编码器

Jane Luo, Chengyu Yin, Xin Zhang, Qingtao Li, Steven Liu, Yiming Huang, Jie Wu, Hao Liu, Yangyu Huang, Yu Kang, Fangkai Yang, Ying Xin, Scarlett Li

专题命中 软件智能体 :planning(abstract);分类 cs.CL、cs.SE

AI总结 RPG-Encoder通过统一表示和闭环推理,实现复杂代码库的高精度理解和生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14858 2026-02-03 cs.LG cs.AI 62%

1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching Capabilities

1000层网络用于自监督强化学习:增加深度可以启用新的目标到达能力

Kevin Wang, Ishaan Javali, Michał Bortkiewicz, Tomasz Trzciński, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) Warsaw University of Technology(华沙理工大学) Tooploox IDEAS Research Institute(IDEAS研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过增加网络深度至1024层,显著提升自监督强化学习的目标到达能力,实验显示性能提升达2-50倍。

Comments Link to project website: https://wang-kevin3290.github.io/scaling-crl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00180 2026-02-03 cs.SE cs.AI 62%

Spec-Driven Development:From Code to Contract in the Age of AI Coding Assistants

基于规范的开发:在AI编码助手时代的代码与合同

Deepak Babu Piskala

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了在AI编码助手时代基于规范的开发方法,通过规范优先的哲学和不同领域的案例研究,提供了一种新的软件开发思路和实践框架。

Comments Submitted to AIWare 2026. 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26852 2026-02-02 cs.AI cs.CL 62%

CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments

CATArena: 通过迭代竞技场评估代码代理的进化能力

Lingyue Fu, Xin Ding, Linyue Pan, Yaoming Zhu, Shao Zhang, Lin Qiu, Weiwen Liu, Weinan Zhang, Xuezhi Cao, Xunliang Cai, Jiaxin Ding, Yong Yu

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际 Graduate School)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 CATArena通过迭代竞技场评估代码代理的进化能力,揭示了代理在连续优化和多轮迭代开发中的潜力及改进机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19494 2026-02-02 cs.SE cs.AI 62%

AACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level Context

AACR-Bench: 评估自动代码审查的综合仓库级上下文

Lei Zhang, Yongda Yu, Minghui Yu, Xinxin Guo, Zhengqi Zhuang, Guoping Rong, Dong Shao, Haifeng Shen, Hongyu Kuang, Zhengfeng Li, Boge Wang, Guoan Zhang, Bangyu Xiang, Xiaobin Xu

机构 * Southern Cross University, Gold Coast, Australia(南方十字大学) TRE, Alibaba Inc., Hangzhou, China(阿里云)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 AACR-Bench通过综合仓库级上下文和专家验证流程,提升自动代码审查评估的准确性与全面性,揭示上下文粒度和检索方法对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏