arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-31 至 2026-03-31 共收录 22 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 22 篇

2603.28428 2026-03-31 cs.CY cs.MA 89%

Synergy: A Next-Generation General-Purpose Agent for Open Agentic Web

Synergy: 一个下一代通用智能体用于开放性智能体网络

Xiaohang Nie, Zihan Guo, Kezhuo Yang, Zhichong Zheng, Bochen Ge, Shuai Pan, Zeyi Chen, Youling Xiang, Yu Zhang, Weiwen Liu, Yuanjian Zhou, Weinan Zhang

专题命中 软件智能体 :agent(title,abstract);agentic(title,abstract);AI agent(abstract)

AI总结 本文提出Synergy,一个用于开放性智能体网络的通用智能体架构,强调智能体间的协作、身份管理和持续进化,以实现开放网络中的社会集成。

Comments A tech report of a general-purpose agent architecture and human-agent society, 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27524 2026-03-31 cs.SE cs.AI 86%

Safer Builders, Risky Maintainers: A Comparative Study of Breaking Changes in Human vs Agentic PRs

更安全的构建者,危险的维护者:人类与代理PR中破坏性变更的比较研究

K M Ferdous, Dipayan Banik, Kowshik Chowdhury, Shazibul Islam Shamim

机构 * Kennesaw State University(肯尼索州立大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文比较了人类与代理PR中破坏性变更的频率和任务情境,发现代理在维护任务中风险更高,存在'信心陷阱'问题。

Comments Accepted at 23rd International Conference on Mining Software Repositories (MSR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19347 2026-03-31 cs.AR cs.LG 83%

Exploring the Agentic Frontier of Verilog Code Generation

探索Verilog代码生成的代理前沿

Patrick Yubeaton, Siddharth Garg, Chinmay Hegde

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文系统评估了代理LLM在Verilog生成中的影响,通过CVDP基准测试,分析了结构化提示和工具设计对性能的影响,并比较了开源与闭源模型的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08847 2026-03-31 cs.AI cs.MA 83%

What Is Your Agent's GPA? A Framework for Evaluating Agent Goal-Plan-Action Alignment

你的代理的GPA是多少?一个评估代理目标-计划-行动对齐的框架

Allison Sihan Jia, Daniel Huang, Nikhil Vytla, Seung Won Wilson Yoo, Nirvika Choudhury, Shayak Sen, John C. Mitchell, Anupam Datta

机构 * BASIS Independent Silicon Valley Upper School(BASIS独立硅谷高中) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出Agent GPA框架,通过评估代理目标、计划和行动的对齐性,验证其在多代理、单代理和企业数据代理中的有效性,展示了高误差覆盖和调试定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26990 2026-03-31 hep-ph 82%

Agentic Diagrammatica: Towards Autonomous Symbolic Computation in High Energy Physics

代理图示学:迈向高能物理中自主符号计算

Tony Menzo, Alexander Roman, George T. Fleming, Sergei Gleyzer, Konstantin T. Matchev, Stephen Mrenna

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 本文提出Diagrammatica,通过HEPTAPOD框架扩展实现LLM代理的多步骤理论计算。通过工具约束计算和知识接地方法,实现符号计算的精确性与可验证性,验证了在高能物理中的应用效果。

Comments 54 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27850 2026-03-31 cs.SE cs.CL 81%

EffiSkill: Agent Skill Based Automated Code Efficiency Optimization

EffiSkill:基于代理技能的自动代码效率优化

Zimu Wang, Yuling Shi, Mengfan Li, Zijun Liu, Jie M. Zhang, Chengcheng Wan, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学) King's College London(伦敦国王学院) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 EffiSkill通过构建可移植的优化工具箱,利用代码效率优化机制,实现无运行反馈的代码优化,提升了优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03548 2026-03-31 cs.CL 79%

SEAD: Self-Evolving Agent for Multi-Turn Service Dialogue

SEAD:多轮服务对话的自演化代理

Yuqin Dai, Ning Gao, Wei Zhang, Jie Wang, Zichen Luo, Jinpeng Wang, Yujie Wang, Ruiyuan Wu, Chaozheng Wang

机构 * Meituan(美团)

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL

AI总结 SEAD通过自演化机制提升服务对话性能,无需大规模人工标注,实验显示其任务完成率和对话效率均优于开源和商用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09701 2026-03-31 cs.SE 70%

An Empirical Study of Interaction Smells in Multi-Turn Human-LLM Collaborative Code Generation

多轮人-大语言模型协作代码生成中交互恶臭的实证研究

Binquan Zhang, Li Zhang, Lin Shi, Song Wang, Yuwei Qian, Linhui Zhao, Fang Liu, An Fu, Yida Ye

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文通过分析真实用户-大语言模型交互数据,揭示多轮协作代码生成中的交互恶臭现象,提出InCE框架以提升交互质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27646 2026-03-31 cs.CL hep-lat hep-ph physics.comp-ph physics.optics 70%

PRBench: End-to-end Paper Reproduction in Physics Research

PRBench: 物理研究中的端到端论文复现

Shi Qiu, Junyi Deng, Yiwei Deng, Haoran Dong, Jieyu Fu, Mao Li, Zeyu Li, Zhaolong Zhang, Huiwen Zheng, Leidong Bao, Anqi Lv, Zihan Mo, Yadi Niu, Yiyang Peng, Yu Tian, Yili Wang, Ziyu Wang, Zi-Yu Wang, Jiashen Wei, Liuheng Wu, Aoran Xue, Leyi Yang, Guanglu Yuan, Xiarui Zhan, Jingjun Zhang, Zifan Zheng, Pengfei Liu, Linrui Zhen, Kaiyang Li, Qichang Li, Ziheng Zhou, Guo-En Nian, Yunwei Xiao, Qing-Hong Cao, Linjie Dai, Xu Feng, Peng Gao, Ying Gu, Chang Liu, Jia Liu, Ming-xing Luo, Yan-Qing Ma, Liang-You Peng, Huichao Song, Shufeng Wang, Chenxu Wang, Tao Wang, Yi-Nan Wang, Chengyin Wu, Pengwei Zhao, Hua Xing Zhu

机构 * School of Physics, Peking University(北京大学物理学院) Beijing Computational Science Research Center(北京计算科学研究中心)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 PRBench通过30个物理领域专家任务评估AI在复现科学论文中的能力,发现现有模型在数据准确性和代码正确性上表现不佳,揭示了系统性失败模式。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08492 2026-03-31 cs.AI 70%

Autonomous Issue Resolver: Towards Zero-Touch Code Maintenance

自主问题解决者:迈向零接触代码维护

Aliaksei Kaliutau

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于数据转换图的新型方法,通过数据状态节点和函数边的拓扑结构,解决传统代码属性图的控制流逻辑缺陷,实现数据完整性导航与控制流逻辑的统一,提升代码修复效率。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26942 2026-03-31 cs.HC 69%

The Observability Gap: Why Output-Level Human Feedback Fails for LLM Coding Agents

可观性缺口:为何输出级人类反馈在LLM编码代理中失效

Yinghao Wang, Cheng Wang

专题命中 软件智能体 :agent(abstract,comments);multi-agent(abstract)

AI总结 研究发现,LLM编码代理在缺乏预定义功能的情况下,通过轻量级人类反馈构建可重用函数库时,输出反馈无法有效识别根因,导致持续失败模式。

Comments Accepted to CHI 2026 Workshop on Human-Agent Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28309 2026-03-31 cs.CR 67%

VulnScout-C: A Lightweight Transformer for C Code Vulnerability Detection

VulnScout-C:一种轻量级的Transformer用于C代码漏洞检测

Aymen Lassoued, Nacef Mbarek, Bechir Dardouri, Bassem Ouni, Qing Li, Fakhri Karray

专题命中 软件智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出VulnScout-C,一种轻量级Transformer模型,用于C代码漏洞检测,同时构建了VulnScout数据集,实验表明其在检测性能上优于现有方法,且具有更低的推理成本。

Comments Submitted to IEEE Transactions on Dependable and Secure Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27880 2026-03-31 cs.LG cs.AI cs.RO math.DS 62%

Kernel Dynamics under Path Entropy Maximization

核动力学在路径熵最大化下

Jnaneshwar Das

机构 * Earth Innovation Hub(地球创新中心)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个变分框架,将核函数视为路径熵最大化下的动态变量,探讨核函数的表示结构与信息几何分析,提出固定点条件、RG流及NTK演化的候选实例,并基于信息热力学假设推导核变化的下界。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20404 2026-03-31 cs.SE cs.AI cs.ET cs.HC 62%

On the Impact of AGENTS.md Files on the Efficiency of AI Coding Agents

关于AGENTS.md文件对AI编码代理效率的影响

Jai Lal Lulla, Seyedmoein Mohsenimofidi, Matthias Galster, Jie M. Zhang, Sebastian Baltes, Christoph Treude

机构 * Singapore Management University(新加坡管理大学) Heidelberg University(海德堡大学) University of Bamberg(班贝格大学) King's College London(伦敦国王学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究AGENTS.md文件对AI编码代理在GitHub拉取请求上的运行效率和令牌消耗的影响,发现其能降低运行时间及令牌消耗,同时保持任务完成行为。

Comments 5 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27745 2026-03-31 cs.SE cs.AI 62%

Needle in the Repo: A Benchmark for Maintainability in AI-Generated Repository Edits

代码仓库中的针:一项评估AI生成仓库编辑可维护性的基准测试

Haichao Zhu, Qian Zhang, Jiyuan Wang, Zhaorui Yang, Yuxin Qiu

机构 * UC Riverside(加州大学河滨分校) Independent Researcher(独立研究员) Tulane University(杜兰大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出NITR基准测试,评估AI生成代码是否保持可维护结构,发现现有系统在复杂架构修改上表现不佳,代理模式提升性能但未解决根本问题。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27277 2026-03-31 cs.SE cs.AI cs.PL 62%

Codebase-Memory: Tree-Sitter-Based Knowledge Graphs for LLM Code Exploration via MCP

基于MCP的代码库记忆:通过Tree-Sitter构建的知识图谱用于LLM代码探索

Martin Vogel, Falk Meyer-Eschenbach, Severin Kohler, Elias Grünewald, Felix Balzer

机构 * Independent Researcher, Berlin, Germany(独立研究者,柏林,德国) Institute of Medical Informatics, Charité – Universitätsmedizin Berlin, Berlin, Germany(柏林夏里特医学院医学信息学研究所,柏林,德国) Clinical Study Center, Berlin Institute of Health, Berlin, Germany(柏林健康研究所临床研究中心,柏林,德国) Institute of Informatics, Humboldt University, Berlin, Germany(柏林洪堡大学信息学研究所,柏林,德国) Institute of Informatics, Freie Universität Berlin, Berlin, Germany(柏林自由大学信息学研究所,柏林,德国) Health Data Science Unit, University Hospital Heidelberg, Heidelberg, Germany(海德堡大学医院健康数据科学部,海德堡,德国)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 Codebase-Memory通过MCP协议构建Tree-Sitter知识图谱,提升LLM代码探索效率,实现更高准确性与更低资源消耗。

Comments 10 pages, 5 authors, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28233 2026-03-31 cs.CV cs.AI 57%

TwinMixing: A Shuffle-Aware Feature Interaction Model for Multi-Task Segmentation

TwinMixing:一种面向多任务分割的洗牌感知特征交互模型

Minh-Khoi Do, Huy Che, Dinh-Duy Phan, Duc-Khai Lam, Duc-Lung Vu

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国立大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出TwinMixing模型,通过共享编码器和任务专用解码器实现特征共享与任务专精,结合高效金字塔混合模块和双分支上采样块,在BDD100K数据集上验证了其在 drivable-area 和 lane 分割中的高效准确性能。

Journal ref Results in Engineering 30 (2026) 109982

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25930 2026-03-31 cs.CR cs.SE 57%

AVDA: Autonomous Vibe Detection Authoring for Cybersecurity

AVDA:自主振动检测作者化以提升网络安全

Fatih Bulut, Carlo DePaolis, Raghav Batta, Anjali Mangal

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出AVDA框架,通过整合组织上下文自动化检测作者化,提升检测质量与效率,实验显示Agentic方法在相似度上比基线方法提升19%。

URL PDF HTML 收藏
2603.27766 2026-03-31 cs.LG stat.ML 57%

AutoStan: Autonomous Bayesian Model Improvement via Predictive Feedback

AutoStan:通过预测反馈实现自主的贝叶斯模型改进

Oliver Dürr

机构 * Thurgau Institute for Digital Transformation (TIDIT)(图尔高数字转型研究所)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 AutoStan通过预测反馈机制,使CLI编码代理自主构建并迭代改进Stan中的贝叶斯模型,展示了无需搜索算法或领域指令即可处理多样化贝叶斯建模问题的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01148 2026-03-31 math.OC 50%

A Correspondence-Driven Approach for Bilevel Decision-making with Nonconvex Lower-Level Problems

基于对应关系的非凸下层问题双层决策方法

Xiaotian Jiang, Jiaxiang Li, Jiawen Bi, Mingyi Hong, Shuzhong Zhang

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出基于对应关系的超函数方法,解决非凸下层问题的双层优化问题,通过高斯平滑处理并设计SCiNBiO算法,提供收敛性和复杂度保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27737 2026-03-31 cs.CV 50%

Synergizing Discriminative Exemplars and Self-Refined Experience for MLLM-based In-Context Learning in Medical Diagnosis

融合判别示例与自我优化经验的医学诊断基于MLLM的上下文学习

Wenkai Zhao, Zipei Wang, Mengjie Fang, Di Dong, Jie Tian, Lingwei Zhang

机构 * CAS Key Laboratory of Molecular Imaging, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所分子影像重点实验室) School of Software, North University of China(中北大学软件学院)

专题命中 软件智能体 :workflow(abstract)

AI总结 本文提出Clinician Mimetic Workflow框架,结合判别示例核心集选择与自我优化经验总结,提升医学诊断中基于MLLM的上下文学习性能,超越零样本通用和医疗MLLM,并接近全监督视觉模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27440 2026-03-31 cs.HC 50%

From Tool to Teammate: LLM Coding Agents as Collaborative Partners for Behavioral Labeling in Educational Dialogue Analysis

从工具到队友:LLM编码代理作为教育对话分析中行为标注的协作伙伴

Eason Chen, Isabel Wang, Nina Yuan, Sophia Judicke, Kayla Beigh, Xinyi Tang

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出利用LLM编码代理自动优化标注提示,提升教育对话行为分析的准确性,通过四折交叉验证证明其有效性,揭示了标注中的潜在模式。

Comments 10 pages, 6 figures, 4 tables. Submitted to EDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏