arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-09 至 2026-06-09 共收录 20 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 20 篇

2605.23169 2026-06-09 q-bio.QM 版本更新 87%

PRAXIS: Case-distilled and code-verified AI agents for biological research

PRAXIS:用于生物学研究的案例提炼与代码验证的AI智能体

Zhenyu Ma, Yuyang Song, Chunyi Yang, Jingyi Zhu, Limei Xu, Min Xiao, Xukai Jiang

专题命中 软件智能体 :AI agent(title);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 提出PRAXIS框架,通过文献学习和案例提炼将研究经验转化为结构化长期记忆,支持生物计算任务中的问题定义、对象验证、方法选择等,实验表明基于案例的学习提升了复杂生物研究任务的方法选择、错误抑制和工作流组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08500 2026-06-09 cs.SE cs.AI 新提交 84%

Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey

通过发起野生的代码理解之旅来投射SWE代理新兴思维模式

Zhengyi Zhuo, Yan Liu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 软件智能体 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 本文通过有限工具接口让SWE代理在真实代码库中探索,提出Ada框架,利用观察透镜分析代理的导航、证据选择、综合、基础化和停止行为,将轨迹数据转化为可比较的行为画像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07889 2026-06-09 cs.LG cs.AI cs.CL 新提交 82%

Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories

应变连贯性:编码代理执行轨迹中的故障前信号

Marut Pandya, Kasey Zhang, Baiqing Lyu

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08710 2026-06-09 cs.SE cs.AI 新提交 81%

Structuring agentic AI for HPC code modernization

构建用于HPC代码现代化的智能体AI

Anthony Marinov, Igor Sfiligoi

机构 * San Diego Supercomputer Center(圣地亚哥超级计算机中心) University of California, San Diego(加州大学圣地亚哥分校) La Jolla, California, United States(圣地亚哥, 加州, 美国)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 提出一种结构化智能体AI方法,通过手动示例、持续可构建性和限制会话范围,成功将6万行Fortran MPI代码在数月内转换为C++ OpenMP并行代码。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09682 2026-06-09 cs.LG cs.DC cs.PF 新提交 80%

AutoMegaKernel: A Statically-Checked Agent Harness for Self-Retargeting Megakernel Synthesis

AutoMegaKernel:用于自我重定目标超内核合成的静态检查代理框架

Jaber Jaber, Osama Jaber

机构 * RightNow AI

专题命中 软件智能体 :agent(title,abstract);分类 cs.LG

AI总结 提出AutoMegaKernel系统,将Llama模型编译为单个持久CUDA内核,通过静态调度验证器确保无死锁和无竞争,自动生成10种模型正确超内核,并在NVIDIA推理卡上以W8A16精度超越cuBLAS bf16。

Comments 18 pages, 5 figures. Open-source code, data, and agent harness: https://github.com/RightNow-AI/AutoMegaKernel

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08135 2026-06-09 cs.SE 新提交 79%

TICoder: A Repository-Level Code Generation Framework with Test-Driven Planning and Implementation-Aware Reuse

TICoder: 一种具有测试驱动规划和实现感知复用的仓库级代码生成框架

Siyu Nan, Yaling Luo, Jian Wang, Neng Zhang, Bing Li

专题命中 软件智能体 :planning(title,abstract);分类 cs.SE

AI总结 提出TICoder框架,通过测试驱动迭代规划机制和实现感知代码复用策略,解决仓库级代码生成中的依赖和上下文限制问题,在多个基准上平均提升11.52%。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09110 2026-06-09 cs.CV 新提交 78%

HDRAgent: An Agentic Framework for Multi-Exposure HDR Imaging

HDRAgent: 一种用于多曝光HDR成像的智能体框架

Weiyu Zhou, Tao Hu, Yijian Wang, Xiaogang Xu, Ruixing Wang, Qingsen Yan

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute, Northwestern Polytechnical University(西北工业大学深圳研究院) Zhejiang University(浙江大学) Camera Group, DJI(大疆相机部门)

专题命中 软件智能体 :agentic(title);agent(abstract)

AI总结 提出首个智能体驱动的HDR成像框架HDRAgent,通过细粒度上下文知识匹配、感知-失真反馈机制和智能体引导的生成对齐策略,自适应选择重建策略,减少复杂动态场景中的鬼影和局部伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17855 2026-06-09 cs.AI cs.RO 版本更新 74%

QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents

QuickLAP: 为半自主代理快速语言-动作偏好学习

Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu

专题命中 软件智能体 :autonomous agent(title);分类 cs.AI

AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11012 2026-06-09 cs.SE 版本更新 74%

Beyond Accuracy: Behavioral Dynamics of Agentic Multi-Hunk Repair

超越准确率:智能体多块修复的行为动力学

Noor Nashid, Daniel Ding, Keheliya Gallaba, Ahmed E. Hassan, Ali Mesbah

专题命中 软件智能体 :agentic(title);分类 cs.SE

AI总结 研究LLM驱动的编码智能体在多块缺陷修复中的行为,通过404个多块bug的1616条修复轨迹分析定位、修复准确率、回归行为及操作动力学,发现修复准确率随bug分散度和复杂度下降,且失败修复消耗更多资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09800 2026-06-09 cs.SE cs.AI cs.MA 新提交 73%

FASE: Fast Adaptive Semantic Entropy for Code Quality

FASE: 用于代码质量的快速自适应语义熵

Shizhe Lin, Ladan Tahvildari

机构 * University of Waterloo(滑铁卢大学)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07681 2026-06-09 cs.SE cs.AI cs.CE cs.MA 新提交 73%

Systematic LLM Translation of Legacy Scientific Code to Differentiable Frameworks: Application to a Land Surface Model

将遗留科学代码系统性地LLM翻译为可微分框架:以陆面模型为例

Aya Lahlou, Linnia Hawkins, Pierre Gentine

机构 * University of California, Los Angeles(加州大学洛杉矶分校) NASA Goddard Space Flight Center(国家航空航天局戈达德空间飞行中心)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出基于LLM的五阶段流水线,将遗留Fortran代码自动翻译为JAX可微分框架,在CLM-ml-v2模型上实现完整雅可比矩阵计算和24倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10842 2026-06-09 cs.SE cs.AI 版本更新 73%

Resilient Write: A Six-Layer Durable Write Surface for LLM Coding Agents

抗挫写入:一种六层耐用写入表面用于大语言模型编码代理

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

机构 * Sperixlabs, Ghana(塞普里克斯实验室,加纳) Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(库马西技术大学,加纳) VIA Cybersecurity Lab, Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(VIA网络安全实验室,库马西技术大学,加纳)

专题命中 软件智能体 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Resilient Write,通过六层耐用写入表面提升编码代理在文件写入时的容错能力,减少恢复时间并提高自我纠正率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09577 2026-06-09 cs.CL cs.LG cs.SE 新提交 67%

Code Is More Than Text: Uncertainty Estimation for Code Generation

代码不仅仅是文本:代码生成的不确定性估计

Yuling Shi, Caiqi Zhang, Yuexian Li, Haopeng Wang, Yeheng Chen, Nigel Collier, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 针对代码生成中错误程序的可靠性问题,提出基于词法、算法和功能三个正交轴的不确定性估计方法,在五个代码LLM上将AUROC提升8.1个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07792 2026-06-09 cs.CR cs.LG cs.SE 新提交 62%

MOLOT System Card: Malicious Operational Logic Observation Transformer

MOLOT系统卡:恶意操作逻辑观察变换器

Daniil Lopatkin, Maksim Mitrofanov, Stanislav Rakovsky, Aleksandr Khalikov

机构 * False Positive Community

专题命中 软件智能体 :workflow(abstract);分类 cs.LG、cs.SE

AI总结 提出MOLOT系统,利用静态调用图的行为序列进行恶意代码检测,结合解释阶段定位可疑行为,在PyPI和npm包上评估,并发布Open Malicious-Code Bench基准。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05026 2026-06-09 cs.SE cs.LG cs.MA 版本更新 62%

RepoLaunch: Automating Build and Management of Code Repositories across Languages and Platforms

RepoLaunch:跨语言和平台的代码仓库构建与管理自动化

Kenan Li, Rongzhi Li, Linghao Zhang, Qirui Jin, Liao Zhu, Xiaosong Huang, Geng Zhang, Yikai Zhang, Shilin He, Chengxing Xie, Xin Zhang, Zijian Jin, Bowen Li, Chaoyun Zhang, Yu Kang, Yufan Huang, Elsie Nallipogu, Saravan Rajmohan, Qingwei Lin, Dongmei Zhang

机构 * Microsoft(微软)

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 RepoLaunch通过自动化依赖解析、编译和测试结果提取,提升了多语言多平台代码仓库的构建效率,其构建成功率达78%,并展示了全自动SWE数据集创建流程。

Comments Under peer review. 22 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07999 2026-06-09 cs.AI 新提交 57%

Efficient Skill Grounding via Code Refactoring with Small Language Models

通过小型语言模型的代码重构实现高效技能落地

Sera Choi, Wonje Choi, Saehun Chun, Daehee Lee, Jooyoung Kim, Chaeun Lee, Honguk Woo

机构 * KAIST(韩国科学技术院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出RECENT框架,通过将技能语义与执行绑定解耦,利用小型语言模型进行代码重构实现高效技能落地,在动态环境中达到与大型语言模型相当的性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07683 2026-06-09 cs.SE eess.SP 新提交 57%

Review the Code, Not the Story: A Vision and Protocol for Code-First Peer Review

审查代码,而非故事:代码优先同行评审的愿景与协议

Jienan Chen

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 提出代码优先同行评审协议,由AI系统构建环境、执行实验并生成标准化审查包,将评审焦点从叙述转向可执行证据。

Comments 17 pages, vision and protocol paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05138 2026-06-09 cs.AI 版本更新 57%

Executable World Models for ARC-AGI-3 in the Era of Coding Agents

可执行世界模型在编码智能体时代的ARC-AGI-3应用

Sergey Rodionov

机构 * SingularityNET

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出一种编码智能体系统,通过维护可执行Python世界模型、验证观察、重构简化抽象和模型内规划,在ARC-AGI-3游戏中取得初步成果,GPT-5.5高推理下完全解决15个游戏。

Comments 13 pages. Accepted for publication at AGI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09180 2026-06-09 cs.CV 新提交 50%

Claude Code-Driving Scenario Mining for the Argoverse 2 Challenge

Claude Code驱动的Argoverse 2挑战赛场景挖掘

Wei Deng, Caoshengzhe Xue, Shuaikun Liu, Zhaohong Liu, Mengshi Qi, Huadong Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 软件智能体 :agent(abstract)

AI总结 提出四阶段管道:Claude Code自主生成代码、迭代训练集筛选、语义代码审查和场景级验证,用于Argoverse 2场景挖掘挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08944 2026-06-09 cs.AR cs.PL 新提交 50%

LongRTL: Graph-Similarity-Guided LLM-driven Long Context RTL Optimization

LongRTL:基于图相似性的LLM驱动的长上下文RTL优化

Yuyang Ye, Che-Kuan Shen, Xiangfei Hu, Yuchen Liu, Shuo Yin, Xufeng Yao, Bei Yu, Tsung-Yi Ho

专题命中 软件智能体 :agent(abstract)

AI总结 提出一种基于图相似性的LLM驱动RTL优化框架,通过分区、优化和重构三个智能体解决长上下文RTL代码的优化问题。

Comments 7 pages, 6 figures, 5 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏