arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-23 至 2026-04-23 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 11 篇

2604.20779 2026-04-23 cs.AI cs.CY cs.SE 84%

SWE-chat: Coding Agent Interactions From Real Users in the Wild

SWE-chat:从真实用户中编码代理交互

Joachim Baumann, Vishakh Padmakumar, Xiang Li, John Yang, Diyi Yang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 SWE-chat是首个大规模真实编码代理会话数据集,包含6000个会话,揭示了编码代理在真实场景中的使用模式和失败模式,发现代理生成的代码效率低下且存在更多安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03690 2026-04-23 cs.SE cs.AI 81%

The OpenHands Software Agent SDK: A Composable and Extensible Foundation for Production Agents

OpenHands软件代理SDK:一种可组合且可扩展的生产代理基础

Xingyao Wang, Simon Rosenberg, Juan Michelini, Calvin Smith, Hoang Tran, Engel Nyst, Rohit Malhotra, Xuhui Zhou, Valerie Chen, Robert Brennan, Graham Neubig

机构 * MLSys 2026

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出OpenHands SDK,提供灵活的代理实现接口、安全可靠执行及用户交互接口,整合了本地到远程执行、多LLM路由和安全分析,验证了其在生产部署中的有效性。

Comments Accepted at MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03335 2026-04-23 cs.LG 79%

EvolveSignal: A Large Language Model Powered Coding Agent for Discovering Traffic Signal Control Strategies

EvolveSignal:一种基于大语言模型的编程代理,用于发现交通信号控制策略

Leizhen Wang, Peibo Duan, Hao Wang, Yue Wang, Jian Xu, Nan Zheng, Zhenliang Ma

机构 * Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) School of Transportation, Southeast University(交通学院,东南大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Department of Civil and Environmental Engineering, Monash University(土木与环境工程系,墨尔本大学) Department of Civil and Architectural Engineering, KTH Royal Institute of Technology(土木与建筑工程系,皇家理工学院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.LG

AI总结 本文提出EvolveSignal,利用大语言模型自动发现可解释的启发式策略,通过程序合成方法优化交通信号控制,实验表明其在减少延误和停车次数方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07849 2026-04-23 cs.SE cs.AI cs.IR 73%

SweRank: Software Issue Localization with Code Ranking

SweRank: 代码排名用于软件问题定位

Revanth Gangi Reddy, Tarun Suresh, JaeHyeok Doo, Ye Liu, Xuan Phi Nguyen, Yingbo Zhou, Semih Yavuz, Caiming Xiong, Heng Ji, Shafiq Joty

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Salesforce Research(Salesforce 研究) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SweRank框架,通过高效的检索与重排序方法提升软件问题定位的准确性,实验表明其在SWE-Bench-Lite和LocBench上优于现有方法。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20067 2026-04-23 q-fin.TR 71%

Testing replication for an agent-based model of market fragmentation and latency arbitrage

对代理基于市场碎片化和延迟套利模型的复制性检验

Ethan Ratliff-Crain, Colin M. Van Oort, Matthew T. K. Koehler, Brian F. Tivnan

专题命中 软件智能体 :agent(title)

AI总结 本文通过复制Wah和Wellman 2016年的延迟套利模型,发现原论文中缺失的实现细节和有限的定量报告阻碍了准确复制。通过增加模拟次数生成置信区间,弥补了分布信息的不足,并指出模型复杂性与对齐难度成正比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03362 2026-04-23 cs.SE 70%

ABTest: Behavior-Driven Testing for AI Coding Agents

ABTest:面向AI编码代理的行为驱动测试

Wuyang Dai, Moses Openja, Hung Viet Pham, Gias Uddin, Jinqiu Yang, Song Wang

专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.SE

AI总结 本文提出ABTest框架,通过挖掘用户报告的异常生成可执行测试用例,发现AI编码代理在真实场景中的鲁棒性差异及新故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20398 2026-04-23 cs.CL cs.LG cs.SE 67%

WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning

WebGen-R1: 通过强化学习激励大语言模型生成功能性和美观的网站

Juyong Jiang, Chenglin Cai, Chansung Park, Jiasi Shen, Sunghun Kim, Jianguo Li, Yue Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Electronics and Telecommunications Research Institute(电子电信研究院) Ant Group(蚂蚁集团)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 本文提出WebGen-R1框架,通过强化学习生成多页面功能性和美观的网站,解决了传统方法在多页面交互和审美评估上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19825 2026-04-23 cs.SE cs.AI 62%

SolidCoder: Bridging the Mental-Reality Gap in LLM Code Generation through Concrete Execution

SolidCoder:通过具体执行弥合LLM代码生成中的心理现实差距

Woojin Lee, Jin-Xia Huang

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电信研究所)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.SE

AI总结 SolidCoder通过强制边缘情况意识和沙盒执行解决心理现实差距,提升代码生成性能,实现HumanEval、CodeContests和APPS的高准确率。

Comments 23 pages, 2 figures, Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20452 2026-04-23 cs.IR cs.CL 57%

HaS: Accelerating RAG through Homology-Aware Speculative Retrieval

HaS:通过同源感知的推测检索加速RAG

Peng Peng, Weiwei Lin, Wentai Wu, Xinyang Wang, Yongheng Liu

机构 * South China University of Technology(华南理工大学) Pengcheng Laboratory(鹏城实验室) Jinan University(暨南大学) Beijing Forestry University(北京林业大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 HaS通过同源感知的推测检索框架,在受限范围内进行低延迟推测检索以获取候选文档,并验证其是否包含所需知识,从而提升RAG的效率。

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19965 2026-04-23 cs.SE 57%

Insights into Security-Related AI-Generated Pull Requests

对与安全相关的AI生成拉取请求的洞察

Md Fazle Rabbi, Asif K. Turzo, Arifa I. Champa, Minhaz F. Zibran

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文分析了33,000多个AI生成的拉取请求,发现675个与安全相关的提交,揭示了AI生成的拉取请求中常见的安全漏洞及审查结果,发现提交质量对接受度影响有限,扩展了拒绝分类。

Comments accepted at the International Conference on Evaluation and Assessment in Software Engineering (EASE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22598 2026-04-23 cs.CL 57%

RExBench: Can coding agents autonomously implement AI research extensions?

RExBench:代码代理能否自主实现AI研究扩展?

Nicholas Edwards, Yukyung Lee, Yujun Audrey Mao, Yulu Qin, Sebastian Schuster, Najoung Kim

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学UniVie计算机科学博士学院) Boston University(波士顿大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出RExBench基准,评估代码代理自主实现AI研究扩展的能力,发现现有代理在无人类指导时成功率不足44%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏