arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-08 至 2026-04-08 共收录 8 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 8 篇

2604.06126 2026-04-08 cs.LG cs.AI 84%

Gym-Anything: Turn any Software into an Agent Environment

Gym-Anything: 将任意软件转化为智能体环境

Pranjal Aggarwal, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学)

专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Gym-Anything框架,通过多智能体任务将任意软件转化为交互式计算机使用环境,生成涵盖医疗、天文、工程等领域的10K+长周期任务,提升现实场景下的智能体研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05589 2026-04-08 cs.CR cs.AI 83%

Foundations for Agentic AI Investigations from the Forensic Analysis of OpenClaw

从OpenClaw的取证分析为基础的代理AI研究基础

Jan Gruber, Jan-Niclas Hilgert

机构 * KASTEL Security Research Labs, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院 KASTEL 安全研究实验室) Fraunhofer Institute for Communication, Information Processing and Ergonomics FKIE(弗劳恩霍夫通信、信息处理与人体工程学研究所 FKIE)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过分析OpenClaw的技术设计,提出了一种系统化的代理AI取证方法,揭示了代理执行带来的抽象层和非确定性挑战,为代理AI的系统研究提供了基础。

Comments Preprint. Code and experimental data available at: https://github.com/jgru/forensic-analysis-of-openclaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06013 2026-04-08 cs.AI cs.CL 73%

Epistemic Blinding: An Inference-Time Protocol for Auditing Prior Contamination in LLM-Assisted Analysis

知识盲区:一种用于审计LLM辅助分析中先验污染的推理时协议

Michael Cuccarese

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种在代理系统中用于审计LLM辅助分析中先验污染的推理时协议,通过替换实体标识符以匿名代码并比较输出与未盲对照组,以恢复审计性。

Comments code and LLM skill at: https://github.com/mcuccarese/epistemic-blinding 7 pages 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19894 2026-04-08 cs.SE cs.AI 73%

TransAgent: Enhancing LLM-Based Code Translation via Fine-Grained Execution Alignment

TransAgent:通过细粒度执行对齐增强基于LLM的代码翻译

Zhiqiang Yuan, Weitong Chen, Hanlin Wang, Xin Peng, Zhenpeng Chen, Yiling Lou

机构 * Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 TransAgent通过细粒度执行对齐本地化错误代码块,提升LLM代码翻译的准确性与修复性能,优于现有方法33.3%和56.7%。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05203 2026-04-08 cs.HC 67%

Decision-Oriented Programming with Aporia

面向决策的编程:Aporia

Saketh Ram Kasibatla, Raven Rothkopf, Hila Peleg, Benjamin C. Pierce, Sorin Lerner, Harrison Goldstein, Nadia Polikarpova

专题命中 软件智能体 :agent(abstract);AI agent(abstract)

AI总结 本文提出面向决策的编程范式,通过Aporia工具增强设计过程的参与度,提升代码实现的准确性。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05955 2026-04-08 cs.SE cs.AI 62%

Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution

通过率能讲述全部故事吗?评估基于LLM的问题解决的设计约束合规性

Kai Yu, Zhenhao Zhou, Junhao Zeng, Ying Wang, Xueying Du, Zhiqiang Yuan, Junwei Liu, Ziyu Zhou, Yujia Wang, Chong Wang, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出设计感知问题解决方法,引入bench基准,通过挖掘和验证真实项目中的设计约束,评估LLM在问题解决中设计约束的合规性,发现测试通过率高并不代表设计合规性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04979 2026-04-08 cs.SE cs.AI 62%

Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents

Squeez:面向编码代理的任务条件工具输出剪枝

Ádám Kovács

机构 * KR Labs(KR实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究了编码代理的任务条件工具输出剪枝,通过构建11477个示例的基准测试集,利用Qwen 3.5 2B模型实现92%的输入token剪枝,达到0.86召回率和0.80 F1分数,优于零样本模型和启发式基线。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06085 2026-04-08 physics.plasm-ph physics.comp-ph 50%

gyaradax: Local Gyrokinetics JAX Code

gyaradax:局部回旋动力学JAX代码

Gianluca Galletti, Eric Volkmann, Johannes Brandstetter

专题命中 软件智能体 :agentic(abstract)

AI总结 gyaradax是用于局部回旋动力学的JAX/CUDA求解器,结合GPU加速和自动微分,验证了与GKW的正式一致性和统计一致性,同时实现了显著加速,展示了编码代理在复杂Fortran代码转换中的高效性。

Comments Code: https://github.com/gerkone/gyaradax

详情

展开后加载摘要…

URL PDF HTML 收藏