arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3200 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3200 篇

2505.10819 2025-11-21 cs.AI cs.LG 79%

PoE-World: Compositional World Modeling with Products of Programmatic Experts

PoE-World: 通过程序专家的乘积进行组合世界建模

Wasu Top Piriyakulkij, Yichao Liang, Hao Tang, Adrian Weller, Marta Kryven, Kevin Ellis

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Dalhousie University(达尔豪斯大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 PoE-World通过程序专家的乘积有效建模复杂非网格世界领域,利用LLMs学习世界模型并实现高效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26161 2025-10-01 cs.AI cs.SE 79%

90% Faster, 100% Code-Free: MLLM-Driven Zero-Code 3D Game Development

Runxin Yang, Yuxuan Wan, Shuqing Li, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16299 2025-09-08 cs.SE cs.AI 79%

HyperAgent: Generalist Software Engineering Agents to Solve Coding Tasks at Scale

Huy Nhat Phan, Tien N. Nguyen, Phong X. Nguyen, Nghi D. Q. Bui

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

Comments 49 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01893 2025-05-20 cs.CL cs.AI 79%

What are the Essential Factors in Crafting Effective Long Context Multi-Hop Instruction Datasets? Insights and Best Practices

Zhi Chen, Qiguang Chen, Libo Qin, Qipeng Guo, Haijun Lv, Yicheng Zou, Wanxiang Che, Hang Yan, Kai Chen, Dahua Lin

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments ACL 2025 Camera Ready. Code is available at: https://github.com/WowCZ/LongMIT

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18653 2025-02-03 cs.SE cs.AI 79%

Cogito, ergo sum: A Neurobiologically-Inspired Cognition-Memory-Growth System for Code Generation

Yanlong Li, Jindong Li, Qi Wang, Menglin Yang, He Kong, Shengsheng Wang

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12468 2024-12-30 cs.SE cs.AI 79%

Evaluating Software Development Agents: Patch Patterns, Code Quality, and Issue Complexity in Real-World GitHub Scenarios

Zhi Chen, Lingxiao Jiang

专题命中 软件智能体 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE

Comments Paper accepted to the SANER 2025 Conference Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05001 2024-09-10 cs.SE cs.AI 79%

A Pair Programming Framework for Code Generation via Multi-Plan Exploration and Feedback-Driven Refinement

Huan Zhang, Wei Cheng, Yuhan Wu, Wei Hu

专题命中 软件智能体 :agent(abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.SE

Comments Accepted in the 39th IEEE/ACM International Conference on Automated Software Engineering (ASE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15991 2024-09-06 cs.SE cs.LG cs.PL 79%

WhiteFox: White-Box Compiler Fuzzing Empowered by Large Language Models

Chenyuan Yang, Yinlin Deng, Runyu Lu, Jiayi Yao, Jiawei Liu, Reyhaneh Jabbarvand, Lingming Zhang

专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.LG、cs.SE

Comments Published in OOPSLA 2024

Journal ref Proc. ACM Program. Lang., Vol. 8, No. OOPSLA2, Article 296. Publication date: October 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09835 2024-08-22 cs.CL cs.AI 79%

ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code

Xiangru Tang, Yuliang Liu, Zefan Cai, Yanjun Shao, Junjie Lu, Yichi Zhang, Zexuan Deng, Helan Hu, Kaikai An, Ruijun Huang, Shuzheng Si, Sheng Chen, Haozhe Zhao, Liang Chen, Yan Wang, Tianyu Liu, Zhiwei Jiang, Baobao Chang, Yin Fang, Yujia Qin, Wangchunshu Zhou, Yilun Zhao, Arman Cohan, Mark Gerstein

专题命中 软件智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14093 2026-08-17 cs.HC 新提交 78%

AppLooper: An Agentic Application Engineering Loop for Accountable Release with Virtual-User Feedback

AppLooper:用于负责任发布的智能体应用工程闭环,结合虚拟用户反馈

Zihong He, Chen Liang, Hai-Ning Liang

专题命中 软件智能体 :agentic(title);agent(abstract)

AI总结 本文提出AppLooper,一种结合虚拟用户反馈的人-编码智能体-虚拟用户应用工程闭环,将开发各环节绑定至特定版本,实现可追踪的负责任发布,人类保留最终发布权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06862 2026-08-10 cs.CR 新提交 78%

SynChain: Inducing Computer-Use Agent Systems to Construct Their Own Attack Chains

SynChain:诱导计算机使用智能体系统构建自身攻击链

Fuyao Zhang, Jiaming Zhang, Che Wang, Boyang Chen, Yurong Hao, Xiongtao Sun, Guowei Guan, Blaise Delattre, Yang Cao, Wei Yang Bryan Lim

专题命中 软件智能体 :agent(title,abstract)

AI总结 该研究提出SynChain攻击范式,通过定向监督微调诱导计算机使用智能体构建含恶意内容的良性制品,在多模型多防御设置下实现高攻击成功率,揭示需对智能体跨任务执行轨迹做来源感知推理以保障安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04587 2026-08-06 cs.CV 新提交 78%

MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding

MetaVideoAgent:面向长视频理解的自动视频智能体进化框架

Benlei Cui, Ruize Wang, Junjie Li, Jinhao Chen, Longtao Huang, Yinghao Chen, Yuwen Zhai, Jingqun Tang, Ruijian Jia, Weiwei Wu, Pengfei Sun, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) ByteDance(字节跳动)

专题命中 软件智能体 :agent(title,abstract)

AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。

Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03485 2026-08-05 cs.CR 新提交 78%

SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills

SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界

Nizhang Li, Zonghao Ying, Xiangfan Wu, Zonglei Jing, Xixun Lin, Hao Zhang, Wenxin Zhang, Jiaye Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 软件智能体 :agent(title,abstract)

AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25175 2026-07-30 cs.MA 版本更新 78%

Agentic AI-enabled discovery across large-scale sleep physiology

基于智能体的人工智能助力大规模睡眠生理学研究

Rahul Thapa, Umaer Hanif, Robin Guillard, Andreas Brink-Kjaer, Adrien Specht, Matteo Saibene, Magnus Ruud Kjaer, Harrison G. Zhang, Federico Bianchi, Elisabeth Roxane M. Heremans, Eric C. Landsness, Emmanuel Mignot, James Zou

专题命中 软件智能体 :agentic(title,abstract)

AI总结 研究利用人工智能睡眠联合科学家环境,在约124,000份PSG记录上进行五个案例研究,揭示睡眠与疾病风险、临床分类及自身调节的联系,展示智能体人工智能助力大规模、多模态睡眠生理学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12144 2026-07-24 cs.CV cs.RO eess.IV 版本更新 78%

O3N: Omnidirectional Open-Vocabulary Occupancy Prediction for Urban Autonomous Agents

O3N: 全向开放词汇占用预测

Mengfei Duan, Hao Shi, Fei Teng, Guoqiang Zhao, Yuheng Zhang, Zhiyong Li, Kailun Yang

机构 * Hunan University(湖南大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :autonomous agent(title,abstract)

AI总结 O3N通过全向感知和开放词汇方法,实现三维空间的连续表示和长距离上下文建模,提升具身智能在开放世界中的感知与建模能力。

Comments The source code will be made publicly available at https://github.com/MengfeiD/O3N

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17363 2026-07-21 physics.plasm-ph 新提交 78%

ORB5X v1.0: a performance-portable global electromagnetic gyrokinetic PIC code in C++/Kokkos built using Agentic AI

ORB5X v1.0:一个使用智能AI构建的性能可移植的全局电磁陀螺动力学PIC C++/Kokkos代码

Mohsen Sadr, Emmanuel Lanti, Alexey Mishchenko, Xin Wang, Laurent Villard

专题命中 软件智能体 :agentic(title);workflow(abstract)

AI总结 本文介绍ORB5X,它是ORB5的C++/Kokkos版本,保留了原Fortran代码的数学模型与算法,通过替换模块和数组提升性能可移植性,经测试与原代码精度相近,且能在多种设备上编译运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06411 2026-07-21 cs.SE cs.AI cs.CL 版本更新 78%

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench:一个具有原生编写的俄语任务规范的仓库级智能编码基准测试

Evgeny Shilov

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.CL、cs.SE

AI总结 RuBench 1.0是含25个俄语任务的仓库级智能编码基准测试,任务源于开源仓库修复提交,按客户请求风格编写。评估多种产品配置,报告运行结果,发现最佳配置解决78.7%任务,还发现产品替换模型问题,为智能编码评估提供新基准。

Comments 20 pages, 1 figure, 9 tables. v2 adds Round 2: Russian-market coding agents (SourceCraft CLI, Koda CLI), Antigravity with Gemini 3.1 Pro / 3.5 Flash, and Codex CLI with GPT-5.6 on the same frozen task set, plus a tool-call contamination re-audit (network + disk layers). Data, full trajectories and harness: https://github.com/eugeneshilow/rubench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27350 2026-07-20 cs.AR 版本更新 78%

CHIA: An open-source framework for principled, agentic AI-driven hardware/software co-design research

CHIA: 一个用于原则性、智能体AI驱动的硬件/软件协同设计研究的开源框架

Angela Cui, Ferran Hermida-Rivera, Jack Toubes, Raghav Gupta, Jim Fang, Chengyi Lux Zhang, Ella Schwarz, Junha Kim, Yakun Sophia Shao, Borivoje Nikolic, Christopher W. Fletcher, Sagar Karandikar

专题命中 软件智能体 :agentic(title,abstract)

AI总结 提出CHIA开源框架,通过有向循环图表达智能体AI驱动的协同设计流程,支持多种工具集成,实现可扩展、容错的大规模协同设计研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14082 2026-07-16 quant-ph 新提交 78%

Building Shor's Algorithm in Lean: An Agentic Formalization of Quantum Attacks on RSA-2048 and P-256

在Lean中构建肖尔算法:对RSA - 2048和P - 256的量子攻击的智能形式化

Lei Zhang, Yusheng Zhao, Hongshun Yao, Xin Wang

专题命中 软件智能体 :agentic(title,abstract)

AI总结 研究在Lean中对肖尔算法及其变体进行形式化,采用智能形式化方法让软件代理分析、编写代码及修复证明,建立数学基础用于分析RSA - 2048和P - 256加密设置下的量子攻击,为量子密码分析及算法设计验证助力。

Comments 21 pages, including appendix; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09674 2026-07-14 cs.CY 新提交 78%

From Tools to Teacher-Built Teammates: No-Code Pedagogical Plugin Authoring with LearnAdapt Agentic Studio and PedOS 1.1 Lumina

从工具到教师构建的队友:使用LearnAdapt智能工作室和PedOS 1.1 Lumina进行无代码教学插件创作

Nizam Kadir

专题命中 软件智能体 :agentic(title,abstract)

AI总结 该研究针对教师和研究人员难以定制教育AI的问题,介绍了基于PedOS 1.1 Lumina的LearnAdapt智能工作室,它能让非编码人员用英语描述学习交互,完成插件创作、安全检查等,展示了从提示到证据捕获的完整生命周期,实现从固定工具到教师构建队友的转变。

Comments 3 pages, 1 figure, Accepted into the 27th International Conference on Artificial Intelligence in Education Interactive Events Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20161 2026-06-19 cs.CV 新提交 78%

ARTEMIS: Agent-guided Reliability-aware Temporal Mask Evolution for Imperfectly Supervised Video Polyp Segmentation

ARTEMIS: 基于智能体引导的可靠性感知时间掩码演化用于不完美监督的视频息肉分割

Tong Wang, Siwen Wang, Yaolei Qi, Jinxing Zhou, Yuting He, Guanyu Yang, Yutong Xie

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, Ministry of Education(东南大学教育部新一代人工智能技术及其跨学科应用重点实验室) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) School of Medicine, Case Western Reserve University(凯斯西储大学医学院)

专题命中 软件智能体 :agent(title,abstract)

AI总结 提出ARTEMIS框架,利用视觉语言智能体选择可靠时间锚点,结合SAM2传播和可靠性感知鲁棒学习,从不完美监督(点、涂鸦、少量密集标签)中学习高质量视频息肉分割掩码,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19191 2026-06-18 cs.CR 新提交 78%

PhantomSkill: Malicious Code Injection in Agent Skill Ecosystems

PhantomSkill: 代理技能生态系统中的恶意代码注入

Yu-Ting Lin, Chia-Mu Yu

专题命中 软件智能体 :agent(title,abstract)

AI总结 提出PhantomSkill攻击框架,通过VulMask技术将恶意行为隐藏在技能的辅助资源中,利用漏洞形状的实现绕过检测,在保持良性功能的同时降低警告和恶意软件检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15390 2026-06-16 cs.CL cs.AI cs.LG 新提交 78%

Not All Skills Help: Measuring and Repairing Agent Knowledge

并非所有技能都有用:测量与修复智能体知识

Yixuan Wang, Yiyang Zhou, Yiming Liang, Congyu Zhang, Fuxiao Liu, Jiawei Zhou, Huaxiu Yao

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Purdue(普渡大学) NVIDIA(英伟达)

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 提出ASSAY框架,通过随机掩码测量技能因果贡献,分离技能生成与筛选,在推理时抑制负面技能,显著提升LLM智能体任务完成率。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09110 2026-06-09 cs.CV 新提交 78%

HDRAgent: An Agentic Framework for Multi-Exposure HDR Imaging

HDRAgent: 一种用于多曝光HDR成像的智能体框架

Weiyu Zhou, Tao Hu, Yijian Wang, Xiaogang Xu, Ruixing Wang, Qingsen Yan

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute, Northwestern Polytechnical University(西北工业大学深圳研究院) Zhejiang University(浙江大学) Camera Group, DJI(大疆相机部门)

专题命中 软件智能体 :agentic(title);agent(abstract)

AI总结 提出首个智能体驱动的HDR成像框架HDRAgent,通过细粒度上下文知识匹配、感知-失真反馈机制和智能体引导的生成对齐策略,自适应选择重建策略,减少复杂动态场景中的鬼影和局部伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
1706.06302 2026-06-04 econ.GN q-fin.EC 78%

Deep Learning in (and of) Agent-Based Models: A Prospectus

深度学习在基于主体的模型中的应用:前景展望

Sander van der Hoog

专题命中 软件智能体 :agent(title,abstract)

AI总结 本文探讨了将深度学习应用于经济主体模型以解决经验估计问题,介绍了多层人工神经网络和深度学习在该领域的潜力与贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27547 2026-05-28 cs.MA 78%

From Task Allocation to Risk Clearing: A Unifying Interface for Mixed Human-Agent Societies

从任务分配到风险清算:混合人机社会的统一接口

Vassilis Vassiliades

专题命中 软件智能体 :agent(title,abstract)

AI总结 提出风险感知选项清算(ROC)机制,通过将风险摘要与选项结合并由中央清算所优化风险调整任务效用,实现混合人机社会中异构代理的可扩展透明协调。

Comments Presented at EMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15606 2026-05-22 cs.AR 78%

Spec2Cov: An Agentic Framework for Code Coverage Closure of Digital Hardware Designs

Spec2Cov: 一种用于数字硬件设计代码覆盖率闭合的代理框架

Sean Lowe, Elias Hilaneh, Alma Babbit, Nakul Gopalan, Vidya Chhabria, Aman Arora

专题命中 软件智能体 :agentic(title,abstract)

AI总结 本文提出了一种基于代理框架的代码覆盖率闭合方法,利用大型语言模型和硬件仿真器的协同工作,自动迭代生成测试刺激以加速覆盖率闭合,并在不同复杂度的设计上实现了高达49%的覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15187 2026-05-15 cs.CV cs.GR cs.RO 78%

Articraft: An Agentic System for Scalable Articulated 3D Asset Generation

Articraft: 一种可扩展的拟人化3D资产生成代理系统

Matt Zhou, Ruining Li, Xiaoyang Lyu, Zhaomou Song, Zhening Huang, Chuanxia Zheng, Christian Rupprecht, Andrea Vedaldi, Shangzhe Wu

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agentic(title,abstract)

AI总结 本文提出Articraft代理系统,利用大语言模型生成大规模拟人化3D资产,构建了包含10000+资产的Articraft-10K数据集,应用于机器人仿真和虚拟现实等下游任务。

Comments Project page: https://articraft3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09594 2026-05-12 cs.CR 78%

Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills

相信我,导入这个:通过恶意代理技能进行依赖引导攻击

Yiyong Liu, Chia-Yi Hsu, Chun-Ying Huang, Michael Backes, Rui Wen, Chia-Mu Yu

专题命中 软件智能体 :agent(title,abstract)

AI总结 研究提出依赖引导攻击,通过恶意技能引导编码代理生成恶意包,无需修改模型或数据,展示出软件供应链中的新攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08927 2026-05-12 cs.PL 78%

Quantitative Comparison of Credible Compilation and Verification In Coding Agent Compiler Development

代码代理编译器开发中可信编译与验证的定量比较

Martin Rinard

专题命中 软件智能体 :agent(title,abstract)

AI总结 本文通过首个由人类监督的验证编译器,比较了可信编译与验证两种编译验证方法的效率,发现验证需要更多开发工作量,且验证优化选择更不高效的算法,证书检查时间占主导。

详情

展开后加载摘要…

URL PDF HTML 收藏