arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-20 至 2026-07-20 共收录 9 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 9 篇

2607.15948 2026-07-20 cs.SE 新提交 83%

TARS: A Theory-of-Mind Agent for Personalized In-IDE Code Comprehension

TARS:用于个性化IDE内代码理解的心理理论智能体

Leopoldo Todisco, Antonio Della Porta, Stefano Lambiase, Fabio Palomba

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.SE

AI总结 研究针对代码理解中LLM助手的不足,提出TARS智能体,基于心理理论范式,剖析开发者特点并调整解释,通过检索增强生成联系项目文档。实验表明它能提升效率、降低认知负荷,解释更适配开发者。

Comments Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29538 2026-07-20 cs.SE cs.AI 版本更新 81%

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

RESOURCE2SKILL: 从人类创建的多模态资源中提取可执行智能体技能

Yijia Fan, Zonglin Di, Zimo Wen, Yifan Yang, Mingxi Cheng, Qi Dai, Bei Liu, Kai Qiu, Yue Dong, Ji Li, Chong Luo

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) Microsoft(微软)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出RESOURCE2SKILL框架,从教程视频、代码库、文章等人类多模态资源中提取可执行技能,构建分层多模态技能维基,提升智能体在七个领域的任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15769 2026-07-20 cs.SE cs.CY 新提交 79%

Making Agent-Mediated Contributions Governable: A Project-Level Governance Manifest for Open-Source AI Collaboration

使代理介导的贡献具有可治理性:开源人工智能协作的项目级治理宣言

Jinjin Gao, Luyang Li, Shufen Guo, Ligang He, Xiaoning Sun

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究开源人工智能协作中代理介导贡献的治理问题,开发代理治理宣言(AGM)作为双向治理合同,通过实验验证其有效性,构建三层框架,推进合规数字创新治理并保留维护者决策权。

Comments Preprint. Under journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15684 2026-07-20 cs.SE 新提交 79%

Understanding Agent-Reactive Bugs at the Model-Harness Boundary: An Empirical Study of LLM Agent Issue Reports

理解模型-框架边界处的代理反应性错误:对大型语言模型代理问题报告的实证研究

Jingyi Chen, Songqiang Chen, Hengcheng Zhu, Jialun Cao, Jiasi Shen, Shing-Chi Cheung

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究聚焦大型语言模型代理在模型-框架边界处的反应性错误,通过分析255份错误报告构建分类法,发现此类错误多为无明确测试预言的静默错误,检测和重现困难,还揭示了用户与开发者对错误归因及修复的不匹配,推动相关技术设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27350 2026-07-20 cs.AR 版本更新 78%

CHIA: An open-source framework for principled, agentic AI-driven hardware/software co-design research

CHIA: 一个用于原则性、智能体AI驱动的硬件/软件协同设计研究的开源框架

Angela Cui, Ferran Hermida-Rivera, Jack Toubes, Raghav Gupta, Jim Fang, Chengyi Lux Zhang, Ella Schwarz, Junha Kim, Yakun Sophia Shao, Borivoje Nikolic, Christopher W. Fletcher, Sagar Karandikar

专题命中 软件智能体 :agentic(title,abstract)

AI总结 提出CHIA开源框架,通过有向循环图表达智能体AI驱动的协同设计流程,支持多种工具集成,实现可扩展、容错的大规模协同设计研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06742 2026-07-20 cs.SE cs.AI 版本更新 73%

Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios

评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现

Ruida Hu, Xinchen Wang, Chao Peng, Cuiyun Gao, David Lo

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Independent Researcher, China(独立研究者,中国) Singapore Management University, Singapore(新加坡管理大学)

专题命中 软件智能体 :autonomous agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。

Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30182 2026-07-20 cs.AI 版本更新 70%

MirrorCode: AI can rebuild entire programs from behavior alone

MirrorCode: AI 仅凭行为就能重建整个程序

Tom Adamczewski, David Owen, David Rein, Florian Brand, Giles Edkins, Allen Hart, Daniel O'Connell

机构 * Epoch AI Metr Prime Intellect University University of Warwick(沃里克大学)

专题命中 软件智能体 :AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出 MirrorCode 基准,基于从零复现完整软件项目评估 AI 长周期编码能力,最强模型得分 56%,如复现 16000 行生物信息学工具。

Comments 34 pages, 13 figures, 9 tables. Code available at https://github.com/epoch-research/MirrorCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15439 2026-07-20 cs.AI 新提交 57%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 31 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15977 2026-07-20 cs.CR 新提交 50%

Refusal is Not Safety! Benchmarking Latent Safety Risks of LLM-Driven Content Humorization

拒绝并非安全!评估大语言模型驱动的内容幽默化中的潜在安全风险

Yu Cui, Ruiqing Yue, Tingyu Li, Sicheng Pan, Zhuoyu Sun, Xufeng Zhang, Baohan Huang, Haibin Zhang, Cong Zuo

专题命中 软件智能体 :agent(abstract)

AI总结 研究基于LLM的内容幽默化潜在安全风险,提出HumorSafe框架评估风险传播,发现LLMs幽默化时会引入刻板印象和毒性,还提出HumorPIA攻击,揭示现有LLM安全评估在幽默化设置下的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏