Responsible AI Agents
专题命中 软件智能体 :AI agent(title,abstract);agent(abstract)
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 软件智能体 :AI agent(title,abstract);agent(abstract)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
Comments 12 pages, to be presented at GeoAI workshop at ACM SigSpatial 2024
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG
专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract)
Comments This is a major revision and extension of the earlier release of AICA Reference Architecture
专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract)
Comments SIMULATION. January 2022
专题命中 软件智能体 :agent(title,abstract);AI agent(abstract)
Comments For associated code, see https://github.com/maffettone/xca
Journal ref Nat. Comput. Sci. 1, 290 (2021)
GitSkills:GitHub上的智能体技能数据集
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出GitSkills数据集,包含从28.22万个公开GitHub代码库收集的379.7117万个智能体技能相关文件,为智能体技能的多维度研究提供了数据支撑。
Comments Giuseppe Destefanis, Daniel Graziotin, Matteo Vaccargiu, and Marco Ortu. 2027. GitSkills: A Dataset of Agent Skills on GitHub. In Proceedings of the 24th International Conference on Mining Software Repositories (MSR '27). Association for Computing Machinery, New York, NY, USA, 3 pages. To appear
迈向超越代码的代理软件工程:构架视野、价值观和词汇
机构 * Monash University(墨尔本大学)
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出代理软件工程应超越代码,构建全过程愿景,基于SE基础和新兴框架,提出价值观和原则,并指导词汇设计,推动SE范式转变。
Comments 5 pages
Journal ref Rashina Hoda, Toward agentic software engineering beyond code: Framing vision, values, and vocabulary. In 2026 IEEE/ACM 48th International Conference on Software Engineering: Companion Proceedings (ICSE-Companion), 2026
Agint:软件工程代理的代理图编译
专题命中 软件智能体 :agentic(title,abstract);分类 cs.LG、cs.SE
AI总结 Agint通过代理图编译器和运行时实现高效、可靠的软件工程代理,支持自然语言到代码的自动化转换与协作开发。
Comments 18 pages, 5 figures, NeurIPS 2025: Deep Learning for Code in the Agentic Era
机构 * University College London(伦敦大学学院) ; Anthropic ; MATS ; Mila
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.LG
Comments 20 pages, 12 figures. Code available at https://github.com/anthropic-experimental/agentic-misalignment
SHERLOC: 代码修复智能体的结构化诊断定位
机构 * NVIDIA(英伟达) ; Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) ; TU Darmstadt(达姆施塔特工业大学) ; National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)
专题命中 软件智能体 :agent(abstract);tool use(abstract);agentic(abstract);multi-agent(abstract)
AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。
破解代码:通过系统性越狱攻击对AI代码代理进行安全评估
机构 * University of Maryland – College Park(马里兰大学-College Park) ; AWS AI Labs(AWS人工智能实验室) ; Meta Superintelligence Labs(Meta超智能实验室)
专题命中 软件智能体 :agent(abstract,abstract_cn);tool use(abstract);planning(abstract);分类 cs.AI
AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。
Comments 22 pages, 18 figures, 8 tables
在编码前看到:学习视觉先验以生成空间感知的教育动画
机构 * Wuhan University(武汉大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 软件智能体 :agent(abstract,abstract_cn);planning(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出OmniManim框架,通过视觉规划和反馈机制提升教育动画生成质量,改进渲染效果和教学效果。
Comments 21 pages, 4 figures
SpatialGrammar: 一种面向领域的语言用于基于LLM的3D室内场景生成
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 软件智能体 :agent(summary_cn,abstract);分类 cs.AI
AI总结 本文提出SpatialGrammar,一种领域特定语言,通过BEV网格放置确定性编译生成有效3D几何,提升空间准确性和物理合理性。SG-Agent通过编译器反馈迭代优化场景,SG-Mini在单次生成场景中表现优异。
机构 * School of Computer Science, Peking University(计算机科学学院,北京大学)
专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments Work in progress (V2)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);multi-agent(abstract)
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);tool use(abstract);分类 cs.AI、cs.CL、cs.LG
Comments ACL'24 Camera Ready
专题命中 软件智能体 :agent(title,abstract);autonomous agent(comments);multi-agent(comments)
Comments Accepted at the 23rd International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2024)
用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。
采用AI编码智能体的规范优先收敛:在71.7万行代码库中拆解189个文件的核心架构不变量的案例研究
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本文通过案例研究,展示AI编码智能体在规范优先协议下,成功在71.7万行代码库中拆解核心架构不变量,耗时3天、成本2430美元,修正201个缺陷,涉及189个文件。
Comments 14 pages, 4 figures, 3 tables
AI编码智能体研究中缺失了人类
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。
更好、更快、更强:程序化技能学习最能降低智能体成本
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG
AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。
Ouroboros:一种具有经审核的核心演化机制的自发展前沿编码智能体
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本研究提出具有经审核核心演化机制的编码智能体Ouroboros,其在三个基准测试中均创最优结果,Hope部署为长期活体演化实验,同时需应对自发展带来的操作安全问题。
SkillClaw: 让技能与代理进化者共同进化
机构 * DreamX Team(DreamX团队)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。
ADIAS:交互式智能体系统的自动化设计
机构 * University of Cambridge(剑桥大学) ; Tencent(腾讯)
专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对现有智能体设计方法的缺陷,提出以问题为中心的优化方案,构建ADIAS框架,在五个交互式基准中较最强基线平均提升25.2%,消融实验验证了关键机制的有效性。
Comments 23 pages, 7 tables, 5 figures
SkillTrace:面向LLM智能体技能复用的多溯源审计
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出SKILLTRACE框架,通过提取三种溯源审计LLM智能体技能复用,在SKILLTRACE-BENCH上取得高指标,野外审计显示其能生成更具操作性的复用审查队列。
CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体
专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。
EDATracer:用于大规模EDA工件分析的智能体框架
专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出EDATracer框架,将EDA工件组织为知识图谱搭配语义向量索引,构建含2787个开源芯片设计的18.9GB数据集及90题基准,使LLM智能体跨工件检索证据,准确率优于Cursor、Claude Code且token用量更少。
代理AI技能的正式分析与供应链安全
机构 * Independent Research(独立研究)
专题命中 软件智能体 :agentic(title);agent(abstract_cn);分类 cs.AI、cs.SE
AI总结 SkillFortify是首个用于代理技能供应链的形式化分析框架,通过六大贡献提升安全性和检测效率。
Comments 32 pages, 5 theorems with full proofs, 68 references, open-source tool: https://github.com/qualixar/skillfortify