arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-30 至 2026-06-30 共收录 294 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 33 篇

2604.19971 2026-06-30 cs.HC cs.AI 74%

Semantic Prompting: Agentic Incremental Narrative Refinement through Spatial Semantic Interaction

语义提示:通过空间语义交互实现代理增量叙事优化

Xuxin Tang, Ibrahim Tahmid, Eric Krokos, Kirsten Whitley, Xuan Wang, Chris North

机构 * Department of Defense(国防部)

专题命中 工作流自动化 :agentic(title);分类 cs.AI

AI总结 本文提出语义提示框架,通过感知语义交互、推理解释意图并执行定位修订,解决现有空间-文本生成中的交互修订不一致、人机意图不一致和定制粒度不足问题,提升空间精细化调整的精度和用户交互效率。

Comments 9 pages, 7 figures, accepted by ACM AVI 2026; has updated the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29955 2026-06-30 cs.SE cs.AI 73%

SpreadsheetBench 2: Evaluating Agents on End-to-End Business Spreadsheet Workflows

SpreadsheetBench 2: 评估端到端商业电子表格工作流中的智能体

Jian Zhu, Yuzheng Zhang, Zeyao Ma, Bohan Zhang, Armin Schoepf, Daniel Woloch, Peter Yiliu Wang, Guangyu Robert Yang, Samuel Jacob, Siddharth Nagisetty, Abhiram Chundru, Jean Lin, Spencer Mateega, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Aptura AI Shortcut AI AfterQuery

专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 提出SpreadsheetBench 2基准,覆盖生成、调试和可视化三类任务,基于真实商业数据构建,评估前沿大模型在复杂多表工作流上的表现,发现当前系统准确率低,主要瓶颈为电子表格检查不足和目标单元格选择错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30246 2026-06-30 cs.AI cs.CY cs.MA 70%

Clarus: Coordinating Autonomous Research Agents toward Web-Scale Scientific Collaboration

Clarus: 协调自主研究代理实现网络规模的科学协作

Zihan Guo, Zeyi Chen, Zhiyu Chen, Zicai Cui, Shuai Shao, Bo Huang, Zhi Han, Yuanyi Song, Yuan Yuan, Chenxi Zeng, Xiaohang Nie, Zhengxi Yu, Hanwen Zhu, Junwei Liao, Ming Zhou, Yang Li, Yuanjian Zhou, Weinan Zhang

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Jilin University(吉林大学) Harbin Institute of Technology(哈尔滨工业大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 提出Clarus基础设施,通过定义项目-代理-资源对象模型和四层协作架构,协调AI与人类研究者在开放、可审计、可归属的资源感知多阶段流程中实现网络规模科学协作。

Comments 28 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28348 2026-06-30 cs.NI 67%

Intent-Driven 6G Service Orchestration: Grounded Translation, Validation, and Decomposition

意图驱动的6G服务编排:基于目录的翻译、验证与分解

Jean Martins, Leonid Mokrushin, Marin Orlic, Amardeep Kumar A

专题命中 工作流自动化 :workflow(abstract);agentic(abstract)

AI总结 提出一个三阶段智能体工作流,通过语义服务目录、SHACL验证和约束满足分解,实现6G意图驱动编排,在930次基准测试中成功率达97%,并减少26%的对抗性幻觉。

Comments AI4NextG @ ICML'26 Workshop on AI and ML for Next-Generation Wireless Communications and Networking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28344 2026-06-30 cs.IR cs.AI cs.CL cs.CV cs.LG 67%

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PIXELRAG:网页截图在检索增强生成中优于文本

Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PixelRAG方法,以网页截图替代文本进行检索和阅读,利用视觉嵌入模型和对比学习,在30M截图库上实现端到端RAG,在多项任务中优于文本基线,准确率提升最高18.1%,并通过图像压缩降低3倍token成本。

Comments Our code is available at https://github.com/StarTrail-org/PixelRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21190 2026-06-30 cs.CV 67%

SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning

SpatiO: 用于空间推理的视觉-语言代理自适应测试时编排

Chan Yeong Hwang, Miso Choi, Sunghyun On, Jinkyu Kim, Jungbeom Lee

机构 * Korea University(韩国大学) Kakao Mobility Corp.(Kakao Mobility公司) Handong Global University(Handong全球大学)

专题命中 工作流自动化 :agent(abstract);multi-agent(abstract)

AI总结 SpatiO通过自适应测试时编排机制协调多种视觉-语言代理,提升空间推理能力,在多个基准测试中优于现有方法。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30489 2026-06-30 stat.ML cs.LG hep-ex hep-th physics.data-an 57%

Factorizable Normalizing Flows for parameter-dependent density morphing

可分解归一化流用于参数依赖的密度变形

Davide Valsecchi, Mauro Donegà, Rainer Wallny

机构 * Institute for Particle Physics and Astrophysics, D-PHYS, ETH Zurich(粒子物理与天体物理学研究所,D-PHYS,苏黎世联邦理工学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 提出可分解归一化流(FNFs),通过参数多项式分解学习参数依赖密度变形,实现线性扩展和可解释性,适用于高能物理等领域的连续密度变形。

Comments 14 pages, 8 figures. Code: https://doi.org/10.5281/zenodo.21011625

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29532 2026-06-30 cs.DB cs.AI 57%

SemJoin: Semantic Join Optimization

SemJoin: 语义连接优化

Christopher Gou, Aditya Banerjee, Jiaxuan Wang, Chunwei Liu

机构 * Purdue University(普渡大学)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI

AI总结 提出基于LLM代理的决策管道,通过聚类连接或分类器策略动态优化语义连接执行,在三个数据集上F1分数比ABJ高20-33点,且token成本更低。

Comments 7 pages, submitted to VLDB 2026 Workshop: NOVAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15055 2026-06-30 stat.ML cs.LG math.ST stat.TH 57%

Spatio-temporal probabilistic forecast using MMAF-guided learning

基于MMAF引导学习的时空概率预测

Leonardo Bardi, Imma Valentina Curato, Lorenzo Proietti

机构 * TU Chemnitz, Faculty of Mathematics(图恩-切姆尼茨大学数学系)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出一种理论引导的广义贝叶斯方法,用于训练随机前馈神经网络 ensemble,通过约束数据嵌入设计和优化过程,实现时空奥斯特瓦尔德过程的依赖性和因果结构。实验表明,该方法在多个时间尺度上保持校准,并展示浅层前馈架构在概率预测中可媲美甚至优于卷积或扩散深度学习架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12394 2026-06-30 cs.LG 57%

Synthetic Interaction Data for Scalable Personalization in Large Language Models

用于大规模语言模型可扩展个性化的人工交互数据

Yuchen Ma, Yue Huang, Wenjie Wang, Xiaonan Luo, Xiangliang Zhang, Stefan Feuerriegel

机构 * Munich Center for Machine Learning & LMU Munich(慕尼黑机器学习中心及慕尼黑大学) University of Notre Dame(诺特尔大学) Sichuan University(四川大学)

专题命中 工作流自动化 :agentic(abstract);分类 cs.LG

AI总结 本文提出PersonaGym框架生成高质量合成数据,开发PPOpt方法优化用户提示,提升个性化性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10858 2026-06-30 cs.CR cs.AI 57%

Large Language Models for Security Operations Centers: A Comprehensive Survey

面向安全运营中心的大型语言模型:全面综述

Ali Habibzadeh, Farid Feyzi, Reza Ebrahimi Atani

机构 * University of Guilan(吉兰大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本文综述了将生成式AI,特别是大型语言模型应用于安全运营中心的工作流程,探讨其能力、挑战及未来方向,为研究人员和运营管理者提供当前状态的全面视角。

Journal ref Journal of Electrical and Computer Engineering, 2026, 3383674 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19633 2026-06-30 cs.AI 57%

OptiMUS-0.3: Using Large Language Models to Model and Solve Optimization Problems at Scale

OptiMUS-0.3:利用大语言模型在大规模范围内建模和解决优化问题

Ali AhmadiTeshnizi, Wenzhi Gao, Herman Brunborg, Shayan Talaei, Connor Lawless, Madeleine Udell

机构 * School of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程学院) Institute for Computational and Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本文提出OptiMUS-0.3系统,通过大语言模型自动建模和解决线性规划问题,提升优化工具的实用性与效率,实验证明其在易实例和实际案例中表现优异。

Comments This paper documents OptiMUS-0.3, improving on OptiMUS-0.1 (arXiv:2310.06116) and OptiMUS-0.2 (arXiv:2402.10172). arXiv admin note: text overlap with arXiv:2402.10172

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30456 2026-06-30 cs.RO cs.CV 50%

Vision-Language-Action Models: Experimental Insights from a Real-World UR5 Platform

视觉-语言-动作模型:来自真实世界UR5平台的实验洞察

Mathilde Hochedel, Marc Lalonde

机构 * Luqia Technologies(卢西亚科技)

专题命中 工作流自动化 :workflow(abstract)

AI总结 研究将VLA模型迁移到真实UR5e机器人,发现离线指标与闭环行为之间存在差距,强调数据-模型-控制管线的系统级优化比模型容量提升更重要。

Comments 23 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30402 2026-06-30 quant-ph physics.chem-ph 50%

Quantum Computations on Fusion Blanket Molten Salts

聚变包层熔盐的量子计算

Susanta Das, Thiago J. Pinheiro Dos Santos, Subhamoy Bhowmik, Milana Bazayeva, Zhen Li, Akhil Shajan, Danil Kaliakin, Fangchun Liang, Vyacheslav S. Bryantsev, Al Geist, Abigail McClain Gomez, Thaddeus Pellegrini, Robert Walkup, Seetharami R. Seelam, Mario Motta, Kenneth M. Merz,, Thomas Beck

专题命中 工作流自动化 :workflow(abstract)

AI总结 首次将异构量子-经典计算应用于FLiBe熔盐中氚的结合能预测,通过嵌入波函数方法和扩展样本量子对角化在IBM量子硬件上实现,能量误差在0.7 kcal/mol以内。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30382 2026-06-30 cs.AR 50%

RQP: Resource-Oriented Quantiser Pruning for Neural Networks on FPGAs

RQP:面向FPGA上神经网络资源的量化器剪枝

Changhong Li, Biswajit Basu, Shreejith Shanker

专题命中 工作流自动化 :workflow(abstract)

AI总结 提出一种资源导向的一次性量化器剪枝方法,通过双向beta调度微调,在喷注子结构分类任务上实现高达20.58倍的搜索成本降低,同时保持竞争性的Pareto前沿。

Comments Accepted by FPL'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30207 2026-06-30 astro-ph.IM 50%

Operational capabilities and on-sky performance of SAMOS at the completion of science commissioning

SAMOS在科学调试完成时的操作能力和在轨性能

Massimo Robberto, Stephen A. Smee, Robert H. Barkhouser, Stephen C. Hope, John J. Piotrowski, Dana Koeppe, Mario Gennaro, Zoran Ninkov, Megan E. Donahue, Andrei Tokovinin, Randolph P. Hammond, Albert J. Harding

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文介绍了基于数字微镜器件(DMD)的多目标光谱仪SAMOS在科学调试完成后的操作能力和在轨性能,包括可编程狭缝掩模生成、多目标光谱与成像并行获取、以及自动数据归约等能力。

Comments Presented at SPIE Astronomical Telescopes + Instrumentation conference in Copenhagen, Denmark, from July 5-10, 2026

Journal ref Proc. SPIE 14149, 14149-13 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30163 2026-06-30 eess.SY cs.SY 50%

End-to-End Abstraction-Based Control with LLM-Enhanced NL-to-LTL Translation

基于端到端抽象的控制与LLM增强的NL到LTL翻译

Amir Bayat, Necmiye Ozay, Alessandro Abate, Raphael M. Jungers

专题命中 工作流自动化 :workflow(abstract)

AI总结 提出LLM增强的NL-to-LTL翻译管道,集成到ABCD框架中,并通过实验揭示翻译成功率与LTL公式复杂度的缩放规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29104 2026-06-30 stat.CO stat.ME stat.ML 50%

spca: An R package to Compute Least Squares Sparse Principal Components

spca: 一个用于计算最小二乘稀疏主成分的R包

Giovanni Maria Merola

专题命中 工作流自动化 :workflow(abstract)

AI总结 介绍R包spca,实现最小二乘稀疏主成分分析(LS-SPCA),生成不相关或轻度相关的稀疏主成分,有效最大化解释方差,并提供高效计算和灵活的用户接口。

Comments Preprint. 20 tables and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28645 2026-06-30 astro-ph.IM astro-ph.HE astro-ph.SR 50%

GOATS: The next generation software infrastructure for time-domain astronomy at Gemini/NOIRLab. Application to alerts from Vera C. Rubin Observatory's Legacy Survey of Space and Time

GOATS: Gemini/NOIRLab时域天文学下一代软件基础设施——应用于Vera C. Rubin天文台时空遗产巡天警报

Monika Soraisam, Louis Avner, Miguel Gómez, William Vacca, Bryan Miller, Andrew Stephens, Arturo Núñez, Andrew Adamson, César Briceño, Hernán Chacana, Guillermo Damke, Nicolás Esquivel, Paul Hirst, Kathleen Labrie, Thomas Matheson, Chadd Myers, Robert Nikutta, Abhijit Saha, Chris Simpson, Olesja Smirnova, D. J. Teal, Sergio Troncoso, James Turner, Sebastián Vicencio, Hubert Condoretti, Scott Dahm, Tómas Ahumada, Eric Bellm, Robert Blum, Aleksandar Cikota, Hannah Crayton, Diego Gómez, Melissa Graham, Stephen Heathcote, Leanne Guy, Fredrik Rantakyrö, Kevin Reil, Rachel Street, Sandrine Thomas, Simón Torres, Kathy Vivas

专题命中 工作流自动化 :workflow(abstract)

AI总结 针对时域与多信使天文学对快速后随观测的需求,提出GOATS端到端软件系统,集成Gemini天文台和NOIRLab服务,实现从目标选择、触发观测到数据获取与分析的统一工作流,并在Rubin/LSST警报实时后随演示中成功应用。

Comments 34 pages, 23 figures, submitted to AAS Journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28555 2026-06-30 cs.RO eess.SP 50%

Robotic Arm-Based Spectral Sensing for Strawberry Positioning and Non-Destructive Sweetness Measurement

基于机械臂的光谱传感用于草莓定位与无损甜度测量

Yi Yang, Mark Cardamis, Wen Hu

机构 * Postdoctoral Supervisor: Dr Mark Cardamis(博士后导师:Mark Cardamis) Supervisor: Professor Wen Hu(导师:Wen Hu)

专题命中 工作流自动化 :workflow(abstract)

AI总结 提出一种集成RGB-ToF感知与机械臂控制的闭环系统,实现草莓检测、定位、接近及无损甜度估计,实验成功率达88.10%。

Comments 51 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04860 2026-06-30 cs.CV 50%

DivAS: Interactive 3D Segmentation by Depth-Weighted Voxel Aggregation

DivAS:通过深度加权体素聚合实现交互式3D分割

Ayush Pande, Mayank Vatsa

机构 * Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)

专题命中 工作流自动化 :workflow(abstract)

AI总结 DivAS通过深度加权体素聚合实现交互式3D分割,无需优化循环,基于GAussian Splatting和NeRF框架,实现高效且高质量的3D分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18639 2026-06-30 cs.LO 50%

A SAT-based Approach for Specification, Analysis, and Justification of Reductions between NP-complete Problems

基于SAT的方法用于NP完全问题之间简化规范、分析和证明

Predrag Janičić

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出基于SAT的框架,用于开发、分析和验证NP完全问题之间的简化,通过URSA求解器增强人类直觉,帮助探索NP完全问题间的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.02182 2026-06-30 econ.EM 50%

Nested Pseudo Likelihood Estimation of Continuous-Time Dynamic Discrete Games

连续时间动态离散博弈的嵌套伪似然估计

Jason R. Blevins, Minhae Kim

专题命中 工作流自动化 :agent(abstract)

AI总结 本文提出连续时间动态离散选择模型的序列估计方法,通过将离散时间模型的嵌套伪似然估计扩展到连续时间情况,验证了估计量的一致性和渐近正态性,并通过蒙特卡洛实验展示了在连续时间模型中收敛问题的缓解及参数估计偏差的减少。

Journal ref Journal of Econometrics 238 (2024) 105576

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 12 篇

2606.28791 2026-06-30 cs.SE 87%

From Determinism to Delegation: AI-Native Software Engineering and the Evolution of the Agentic Engineer

从确定性到委托:AI原生软件工程与智能体工程师的演进

Mamdouh Alenezi

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);tool use(abstract)

AI总结 本文提出AI原生软件工程是范式转变,定义新职业角色“智能体工程师”,其核心工件从程序转向智能体系统,并分析工作单元、正确性和问责制的三大转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23822 2026-06-30 cs.SE 84%

KISS Sorcar: A Stupidly-Simple General-Purpose and Software Engineering AI Assistant

KISS Sorcar:一个简单通用且软件工程友好的AI助手

Koushik Sen

专题命中 软件智能体 :agent(summary_cn,abstract);AI agent(abstract);分类 cs.SE

AI总结 KISS Sorcar基于KISS Agent Framework构建,通过五层代理架构解决传统AI助手的缺陷,实现高质量代码生成与多任务处理,测试显示其在Terminal Bench 2.0上的通过率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05786 2026-06-30 cs.CR cs.AI cs.CL 84%

Proof-of-Guardrail in AI Agents and What (Not) to Trust from It

AI代理中的证明-护栏以及从其中(不)应信任什么

Xisen Jin, Michael Duan, Qin Lin, Aaron Chan, Zhenglun Chen, Junyi Du, Xiang Ren

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出proof-of-guardrail系统,通过可信执行环境生成加密证明,确保代理在特定开源护栏后生成响应,同时保护开发者隐私,但指出恶意开发者可能欺骗安全措施的风险。

Comments AI4GOOD Workshop at ICML'26. Code: https://github.com/SaharaLabsAI/Verifiable-ClawGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04611 2026-06-30 cs.CR cs.SE 79%

PBFuzz: Agentic Directed Fuzzing for PoV Generation

PBFuzz:面向漏洞证明的代理引导模糊测试

Haochen Zeng, Andrew Bao, Jiajun Cheng, Chengyu Song

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 PBFuzz通过模拟人类专家流程,自动提取语义约束并高效生成漏洞证明输入,实验表明其在效率和漏洞触发性能上优于现有方法。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28520 2026-06-30 cs.CV cs.CL 70%

Detecting Clinical Hallucinations in LVLMs via Counterfactual Visual Grounding Uncertainty

通过反事实视觉基础不确定性检测LVLM中的临床幻觉

Xiao Song, Haonan Qin, Zhaoxu Zhang, Jiong Zhang, Yuqi Fang, Caifeng Shan

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) National Institute of Healthcare Data Science at Nanjing University(南京大学医疗数据科学国家研究院) School of Biomedical Engineering, Nanjing University(南京大学生物医学工程学院)

专题命中 软件智能体 :agentic(abstract,abstract_cn);分类 cs.CL

AI总结 提出一种基于反事实视觉基础不确定性的框架,通过提取实体并对比正反事实定位结果计算不确定性分数,无需修改模型即可检测LVLM在临床图像中的幻觉。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28403 2026-06-30 cs.SE cs.AI cs.CR cs.LG 67%

Reinforcement Learning for Software Vulnerability Analysis: A Systematic Review with Emphasis on C/C++ Source Code and Static Analysis

强化学习用于软件漏洞分析:以C/C++源代码和静态分析为重点的系统综述

Bruno Caro-Vásquez, Carola Figueroa-Flores, Gastón Marquez

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 系统综述强化学习在C/C++软件漏洞分析中的应用,发现15项研究聚焦于模糊测试和引导探索,仅3项直接检测漏洞,1项实现语句级定位,且静态结构表示(如CFG)和基准测试存在不足。

Comments 15 pages, 1 figure, 7 tables. Submitted to CIARP 2026

Journal ref CIARP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29957 2026-06-30 cs.SE cs.AI 62%

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

SWE-Together:在交互式用户会话中评估编码代理

Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

机构 * Meta

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出SWE-Together基准,从真实用户-代理编码会话中重建多轮交互任务,并利用基于LLM的用户模拟器评估编码代理的协作能力,发现强代理成功率更高且干预更少。

详情

展开后加载摘要…

URL PDF HTML 收藏