arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-24 至 2026-07-24 共收录 99 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工具调用 5 篇

2607.20536 2026-07-24 cs.AI cs.CL cs.LG cs.MA 新提交 89%

AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use

AppWorld-UL:用于工具使用的多样化智能体-用户交互基准测试

Junzhi Chen, Harsh Trivedi, Jane Pan, Michael JQ Zhang, Tejas Srinivasan, Niranjan Balasubramanian, Ashish Sabharwal

专题命中 工具调用 :agent(title,abstract);tool-use(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对当前智能体-用户交互基准测试不足,引入 AppWorld-UL 基准测试,基于 AppWorld 框架及模拟应用构建多样任务,用大型语言模型模拟用户行为,评估显示其难度大,能推动回路中工具使用智能体研究。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20668 2026-07-24 cs.CL cs.AI 新提交 81%

From Agent Failures to Text Policies: What Works and What Breaks

从智能体失败到文本策略:可行与不可行之处

Jaideep Ray, Ankit Goyal

专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究智能体中TextGrad应用问题,通过区分遵循与学习策略能力来研究。发现两者有差距,人工编写策略能提升智能体表现,而从轨迹生成的策略无法可靠超越固定提示,主要挑战是从经验中生成和选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21361 2026-07-24 cs.MA 新提交 75%

FedAgentKE: Federated Semantic Knowledge Evolution for Heterogeneous Agents

FedAgentKE:异构智能体的联邦语义知识演化

Weihao Li, Jun Bai, Ziyang Song

专题命中 工具调用 :agent(abstract);tool use(abstract);workflow(abstract)

AI总结 研究异构智能体孤立运行问题,提出 FedAgentKE 框架,通过语义知识蒸馏、聚合和Adapt实现联邦语义知识演化,实验验证其在跨框架和跨任务设置下能改进智能体协作,为未来协作智能体生态系统发展提供潜力。

Comments 9 pages (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21459 2026-07-24 econ.GN q-fin.EC 新提交 67%

The Evolution of Digital Search: From Blue Links to Delegated Decision-Making

数字搜索的演变:从蓝色链接到委托决策

David M. Rothschild, Nicole Immorlica, Brendan Lucier, Markus Mobius, Aleksandrs Slivkins

专题命中 工具调用 :agent(abstract);agentic(abstract)

AI总结 研究数字搜索从传统模式到人工智能原生模式的转变,指出小设计选择影响重大,未来搜索发展不由算法和界面改进决定,而是取决于开放透明有竞争力的代理系统设计,揭示多领域交叉的重大挑战。

Comments 4 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20430 2026-07-24 cs.CL cs.AI 新提交 62%

LLM-INSTRUCT at UZH Shared Task 2026: Constraint-Aware Retrieval and Selective Debate for Paragraph-Level Argument Mining

LLM-INSTRUCT在UZH 2026共享任务中的应用:用于段落级论证挖掘的约束感知检索和选择性辩论

Phuong Huu Vu Tran, Long Minh Vo, Son Nguyen Minh Le, Hoang Van

机构 * Vietnamese-German University(越南-德国大学) RMIT University Vietnam(皇家墨尔本理工大学越南分校) VANGIA INNOVATIONS(VANGIA创新公司)

专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文介绍了在UZH 2026共享任务中用于段落级论证挖掘的获胜系统LLM-INSTRUCT,通过元数据感知检索、约束解码等方法缩小决策空间,提高了准确性和提交稳健性,在官方排行榜上取得优异成绩。

Comments Accepted to the 13th Workshop on Argument Mining (ArgMining 2026) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划决策 22 篇

2607.20743 2026-07-24 cs.RO cs.AI cs.LG 新提交 81%

Self-Supervised Bio-Inspired Robotic Trajectory Planning with Obstacle Avoidance

具有避障功能的自监督生物启发式机器人轨迹规划

Miroslav Krupa, Miroslav Cibula, Kristína Malinovská

机构 * Faculty of Mathematics, Physics and Informatics, Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学数学、物理与信息学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究机器人轨迹规划问题,提出基于自监督学习框架,利用正反模型作监督机制,在含障碍物环境下规划轨迹,实验证明方法可行,针对规划器问题提出并评估了额外训练机制和缓解策略。

Comments 12 pages, 3 figures. To be published in 2026 International Conference on Artificial Neural Networks (ICANN) proceedings. This research was supported by the Slovak Research and Development Agency, project APVV-21-0105

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20582 2026-07-24 cs.LG cs.AI cs.MA 新提交 81%

Bayesian uncertainty estimation improves clinical decision making in medical AI agents

贝叶斯不确定性估计改善医学人工智能代理中的临床决策

Frederik Hauke, Patrick Wienholt, Christiane Kuhl, Dyke Ferber, Jakob Nikolas Kather, Sven Nebelung, Daniel Truhn

机构 * University Hospital RWTH Aachen(亚琛工业大学附属医院) Heidelberg University Hospital(海德堡大学医院) TU Dresden(德累斯顿工业大学) TUD Dresden University of Technology(德累斯顿工业大学)

专题命中 规划决策 :AI agent(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究针对医学图像分析机器学习模型缺乏置信度度量问题,采用蒙特卡洛随机失活获取认知不确定性信号,添加到点预测提高错误检测AUROC,在临床决策支持代理实验中,以特定形式传达该信号可降低误诊率,凸显其对决策的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21437 2026-07-24 cs.AI 新提交 79%

Agent-Guided Relational Concept Discovery: Toward Interpretable Surgical Margin Assessment

代理引导的关系概念发现:迈向可解释的手术切缘评估

Nooshin Maghsoodi, Amoon Jamzad, Robert Policelli, Mohammad Farahmand, Dilakshan Srikanthan, Martin Kaufmann, Kevin Y. M. Ren, Shaila Merchant, Sonal Varma, Ross Walker, Doug McKay, John Rudan, Gabor Fichtinger, Parvin Mousavi

机构 * Queen’s University(女王大学)

专题命中 规划决策 :agent(title,abstract);分类 cs.AI

AI总结 针对深度学习模型用于手术切缘评估时面临的泛化难及黑箱问题,提出代理引导的概念发现框架,直接从数据学习概念,经推理代理和知识图谱完善调整,在相关数据集和术中病例中提升了评估效果。

Comments This paper is accepted to MICCAI 2026, and this is the submission version, not the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21414 2026-07-24 cs.AI 新提交 79%

Logical Regression for Planning with Axioms

基于公理的规划逻辑回归

Connor Little, Christian Muise

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 研究含公理领域中动作的逻辑回归,提出近似方法,将条件限制在部分状态以避免公理重算。该方法可泛化部分状态,减少执行监控变量,增强执行监控在意外变化环境中的恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21354 2026-07-24 cs.AI 新提交 79%

SPORD: A Simulation-Propose-then-OR-Dispose Approach for Supply Chain Planning

SPORD:一种用于供应链规划的模拟-提出-然后-优化-处置方法

Jiayin He, Yutong Pan, Sen Yang, Ningxuan Kang, Yongzhi Qi, Jianshen Zhang, Wei Qi, Zuo-Jun Max Shen

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) College of Engineering, UC Berkeley(加州大学伯克利分校工程学院) Faculty of Business and Economics, University of Hong Kong(香港大学经管学院)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI

AI总结 针对电商供应链规划中孤立项目及面临的难题,提出模拟-提出-然后-优化-处置方法(SPORD)及NetSim平台,通过解耦实现加速模拟与操作闭环,应用后提升服务质量、降低履约率并实现碳减排,推动模拟用于主动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21209 2026-07-24 cs.LO cs.AI 新提交 79%

Explainability Framework for Policy-Aware Autonomous Agents

策略感知自主智能体的可解释性框架

Heather Merhout, Daniela Inclezan

机构 * Miami University(迈阿密大学)

专题命中 规划决策 :autonomous agent(title);agent(abstract);分类 cs.AI

AI总结 针对策略感知自主智能体,借鉴社会科学见解,用回答集编程语言结合Python实现可解释性框架,利用违反策略的惩罚创建对比性解释,并通过调查评估框架。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 515-528

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20772 2026-07-24 cs.RO 新提交 78%

Socially Consistent Multi-Robot Navigation Using Decoupled Planning and Trajectory Coordination

使用解耦规划和轨迹协调的社会一致多机器人导航

Matthew M. Sato, Kincho H. Law

专题命中 规划决策 :planning(title,abstract)

AI总结 研究多机器人在人类环境中的导航,通过解耦规划与轨迹协调,改进A*规划器嵌入社会规范构建社会图,转化轨迹协调为凸规划,实现可预测、符合社会规范的路径规划,简化多机器人协调。

Comments Submitted to Civil Engineering Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20827 2026-07-24 cs.AI 新提交 74%

Auditing Provenance Sensitivity in LLM Agent Action Selection

审计大语言模型智能体动作选择中的溯源敏感性

Junchi Liao

专题命中 规划决策 :agent(title);分类 cs.AI

AI总结 研究大语言模型智能体动作选择中的溯源敏感性,引入针对特定目标的授权审计,通过改变命题源权威等测试行为,发现可信和不可信变体在部分案例中产生不同动作,模型对线索有反应但不可信证据仍影响行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20470 2026-07-24 cs.AI 新提交 74%

PlanE: Meta Planning of Data, Tuning, and Inference for Extractive-based LLMs

PlanE:基于抽取式大语言模型的数据、调优和推理的元规划

Jiacheng Wang, Weiyan Zhang, Guangya Yu

机构 * Ant Group(蚂蚁集团) School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)

专题命中 规划决策 :planning(title);分类 cs.AI

AI总结 针对大语言模型特定任务能力提升中数据标注成本高及缺乏优化方法的问题,提出PlanE框架,含数据分解等,引入DTI规划器,实验验证了该框架及规划器在不同场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20982 2026-07-24 cs.AI 新提交 70%

GuardianAgentBench: Where Agents Fail and How to Guard Them

GuardianAgentBench:智能体何处失败及如何防范

Vishal Ishwar Naik, Chenyu Xu, Donna Dong, Hussein Hassan, Abhishek Pradhan, Ofer Mendelevitch, Tallat Shafat, Humayun Irshad

机构 * Vectara, Inc.(Vectara公司) Anthropic(Anthropic公司) OpenAI(OpenAI公司) Google DeepMind(谷歌DeepMind) DeepSeek-AI(DeepSeek人工智能公司)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20459 2026-07-24 cs.CL cs.AI 新提交 62%

THOR: A Theta-Gamma Hierarchical Oscillatory Reasoning Framework for Multi-hop QA

THOR:用于多跳问答的θ-γ分层振荡推理框架

Ziyang Ling, Ronald X. Xu, Mingzhai Sun

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学部生物医学工程学院)

专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL

AI总结 针对多跳问答中注意力衰减和错误积累问题,提出受大脑启发的θ-γ分层振荡推理框架THOR,经实验验证,该框架能提高答案准确性和鲁棒性,减轻相关限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21156 2026-07-24 cs.AI cs.MA 新提交 57%

SafeStep: AI-powered Travel Assistance for Elderly People with Frailty or Dementia

SafeStep:为体弱或痴呆老年人提供的人工智能旅行辅助

Elderly People with Frailty or Dementia Azul Debenedetti, David Gamez, Franco Such, Nik Kairinos

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 针对体弱或痴呆老人出行难题,SafeStep利用旅行图表示,结合大语言模型与Anticip8行为预测引擎,生成个性化失败场景并提出干预措施。经实验和实地研究评估,结合两者的方法性能可靠,虽界面可用性待改进,但能提升旅行信心与安全感,还可拓展应用于其他领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20834 2026-07-24 cs.LG 新提交 57%

Offline RL with Hierarchical Action Chunking

基于分层动作分块的离线强化学习

Ahad Jawaid

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究离线目标条件强化学习中扩展到长期任务的挑战,提出HiQC算法,结合高级潜在规划与低级动作分块,实现无偏k步价值备份,理论证明其价值误差界限更紧,实证表明在OGBench套件中性能最佳。

Comments RLC/RLJ 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20708 2026-07-24 cs.LG q-bio.NC 新提交 57%

Perspective Latents as an Architectural Condition for Causal Emergence in Active Inference Agents

视角潜在因素作为主动推理智能体中因果涌现的架构条件

Hongju Pae

机构 * Active Inference Institute(主动推理研究所)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 研究主动推理智能体中无奖励预测组织与信息理论特征的关系,通过特定架构智能体在无奖励环境切换协议中测试,确定\(g\)为与\(\Phi_r\)相关时间组织的架构位置,反对将\(\Phi_r\)作为学习整合直接指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20694 2026-07-24 cs.LG cs.GT 新提交 57%

Attribution Markets: A Fisher-Market Formulation for Fractional Credit Assignment Between Planned Tasks and Performed Actions

归因市场:计划任务与执行行动之间分数信用分配的费雪市场公式

Salavat Ishbulatov

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 研究计划任务与执行行动间分数信用分配问题,构建准线性费雪市场,通过市场工具得出相关定理,扩展市场考虑任务进度折扣,解决算法收敛问题,提出基准发现问题,用熵正则化泛化及规则解决,报告参数并讨论局限,关联相关算法。

Comments 35 pages, 3 figures. Companion technical report with extended treatment of dynamic/forward-looking markets and reinforcement-learning extensions available separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21121 2026-07-24 quant-ph cs.ET cs.LG 新提交 57%

Approximate Quantum State Preparation Through Proximal Policy Optimization

通过近端策略优化进行近似量子态制备

Marco Mordacci, Michele Amoretti

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 该研究针对近似量子态制备这一难题,利用基于近端策略优化的深度强化学习,让智能体识别目标状态的最佳近似并减少门的使用,经2至5个量子比特实验,框架能实现10⁻¹⁴的近似误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21341 2026-07-24 cs.RO 新提交 50%

Grasp, Handover, Rotate: Bimanual Object Reorientation via Compositional Diffusion and Energy-Based Optimization

抓取、交接、旋转:通过组合扩散和基于能量的优化实现双手物体重新定向

Wun Lam Yeung, Wenjun Liu, Yui Cheung Yu, Zhengyan Lambo Qin, Qijin She, Heng Li, Ziqi Wang, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 规划决策 :planning(abstract)

AI总结 研究双手物体重新定向问题,提出基于组合扩散和能量的BiCompoDiff框架,联合优化多方面任务,结合预训练模型与能量模型,通过梯度引导和采样优化抓取姿态,实验表明其成功率和轨迹平滑度优于基线,实现有效模拟到现实转移。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21281 2026-07-24 cs.CV cs.RO eess.IV 新提交 50%

HGeo-TopoMap: Boosting Topological Mapping with Hierarchical Geometric Priors

HGeo-TopoMap:利用分层几何先验增强拓扑映射

Siyu Li, Kunyu Peng, Di Wen, Beiping Hou, Zhiyong Li, Kailun Yang

机构 * Zhejiang University of Science and Technology(浙江科技学院) Hunan University(湖南大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 规划决策 :planning(abstract)

AI总结 针对现实环境中心线检测难题,提出HGeo-TopoMap,利用显式先验地图和隐式空间关系,设计几何自适应和一致性学习模块增强拓扑映射,在OpenLane-V2数据集上评估,提高了精度与鲁棒性,优于基线方法。

Comments The source code and model weights will be made publicly available at https://github.com/lynn-yu/HGeo-TopoMap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21113 2026-07-24 cs.RO 新提交 50%

RL-MACRO: A Cybernetic Closed-Loop Intelligence Framework for Multimodal Adaptive Robotic Craniotomy

RL-MACRO:一种用于多模态自适应机器人开颅手术的控制论闭环智能框架

Xiao Zhang, Jiaxuan Li, Renzhen Le, Di Wu, Chao Sun, Jiachen Zhu, Haoyuan Zhang, Xiang Li, Jian Liu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) Second Hospital of Dalian Medical University(大连医科大学附属第二医院) The University of Tokyo(东京大学)

专题命中 规划决策 :planning(abstract)

AI总结 研究针对自主机器人开颅手术面临的挑战,提出RL-MACRO框架,通过多模态感知、自适应决策和机器人执行实现闭环控制,利用CNN-LSTM观测器重建温度,经IQL策略和双头执行器优化行为,实验验证了该框架在骨切割方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21058 2026-07-24 cs.RO 新提交 50%

Human-Inspired Framework for Robotic Craniotomy: Integrating Multimodal Fusion and Adaptive Trajectory Adjustment

用于机器人开颅手术的受人类启发框架:集成多模态融合与自适应轨迹调整

Renzhen Le, Xiao Zhang, Di Wu, Yuanyu Wei, Jiachen Zhu, Zhenzhi Ying, Pengfei Zhang, Liming Shu

机构 * Dalian University of Technology(大连理工大学) The University of Tokyo(东京大学)

专题命中 规划决策 :planning(abstract)

AI总结 该研究针对机器人开颅手术问题,提出受人类启发的闭环框架,集成术前规划与术中执行。采用自适应双轮廓融合算法生成轨迹,利用多模态网络融合信号实现突破检测,通过原位投影策略调整轨迹,实验验证该框架能实现安全自主且高效闭环控制的开颅手术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20955 2026-07-24 cs.CV 新提交 50%

FSB-Net: Frequency-Spatial Boundary Network for Brain Stroke Lesion Segmentation in Non-Contrast CT

FSB-Net:用于非增强CT中脑卒病变分割的频率-空间边界网络

Linke Fan, Xianglong Li, Huixin Huang, Kai Shu

专题命中 规划决策 :planning(abstract)

AI总结 研究旨在解决非增强CT中脑卒病变分割难题。提出FSB-Net,利用频域分析,含小波边界检测头、频率-空间交叉注意力模块和频谱边界损失。在公共数据集上评估,性能优于多种方法,达当前最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20775 2026-07-24 cs.HC cs.PL 新提交 50%

Flint: A Semantics-Driven Data Visualization Intermediate Language

Flint:一种语义驱动的数据可视化中间语言

Yunhai Wang, Kecheng Lu, Junhao Chen, Alper Sarikaya, Chenglong Wang

专题命中 规划决策 :AI agent(abstract)

AI总结 Flint是一种语义驱动的数据可视化中间语言,通过分层数据语义模型,让作者从简洁规范创建高质量可视化,能生成并优化与库无关的配置,转化为多目标语法的可执行规范,简化创作过程且不损视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多智能体 17 篇

2607.21522 2026-07-24 cs.RO cs.AI cs.CL cs.CV 新提交 92%

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent:通过生成式模拟创建4D物理世界

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Genesis AI(创世纪人工智能公司)

专题命中 多智能体 :agent(title,title_cn);agentic(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20866 2026-07-24 cs.CV 新提交 91%

Agentic Designer: Progressive Multi-Agent Collaboration for Structure-Aware Interior Layout Generation

智能设计师:用于结构感知室内布局生成的渐进式多智能体协作

Zhijing Yang, Haocheng Lin, Zhihua Xu, Haojie Li, Keze Wang, Liang Lin, Tianshui Chen

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学)

专题命中 多智能体 :agent(title,abstract);agentic(title,abstract);multi-agent(title,abstract)

AI总结 针对室内布局生成难题,提出智能设计师这一渐进式多智能体框架,将布局生成视为迭代约束验证决策过程,通过渐进共识机制协调三个智能体,经实验验证其显著优于现有方法,提升了结构遵循和功能设计连贯性。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20499 2026-07-24 cs.AI cs.SE 新提交 90%

ExecuGraph: A Multi-Agent, Execution-Grounded Framework for Reliable Backend Code Synthesis with Large Language Models

ExecuGraph:一种用于通过大语言模型进行可靠后端代码合成的多智能体、基于执行的框架

Sai Deekshith Lekkala, Jothi Prabha Appadurai, Rohith Reddy Bellibatlu, Manpreet Singh

机构 * Department of Computer Science and Engineering (AI & ML), Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系(人工智能与机器学习)) Department of Computer Science and Engineering, Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系) Boston University(波士顿大学)

专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型后端代码合成可靠性问题,提出ExecuGraph多智能体框架,将执行验证置于核心,通过六个智能体和有向工作流协调,在多数据集评估中对比单智能体基线,验证方法有效性且能控制测量各因素贡献。

Comments Submitted to Data Science and Management

详情

展开后加载摘要…

URL PDF HTML 收藏