arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-18 至 2026-08-18 共收录 363 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 10 篇

2608.15284 2026-08-18 cs.RO cs.AI cs.CL cs.CV cs.MM 新提交 62%

VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments

VTInstructor:面向连续环境中导航指令生成的视觉轨迹提示

Haolin Yang, Yuxing Long, Zihan Yang, Hao Dong

机构 * Peking University(北京大学) PrimeBot

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出首个面向连续环境的VLN指令生成框架VTInstructor,通过视觉轨迹提示技术生成导航指令,在基准测试中刷新最优性能,提升跟随器成功率并为下游任务带来数据增强增益。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15930 2026-08-18 cs.AI cs.CV 新提交 57%

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体

Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng

机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性

Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05106 2026-08-18 cs.SE 版本更新 57%

RepoTrace: Browser-Assisted Evidence Collection for GitHub Research Datasets

RepoTrace:用于GitHub研究数据集的浏览器辅助证据收集

Xue Yao, Zehua Zhang, Jiatong Liu, Yongqiang Tian

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.SE

AI总结 研究利用GitHub问题和拉取请求构建数据集时,传统流程证据分散难审计。RepoTrace是浏览器辅助工具,结合扩展、后端和仪表盘收集证据,验证表明可支持完整本地证据收集工作流程。

Comments 6 pages. Accepted to the ISSTA 2026 Tool Demonstrations Track; published in the Companion Proceedings of SPLASH Companion '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16886 2026-08-18 cs.HC 新提交 50%

Evaluating Beyond the Screen: Collective Assessment of AI-Generated Business Plans with Resource-Constrained Entrepreneurs

屏幕之外的评估:与资源受限创业者共同评估AI生成的商业计划书

Qi Zhao, Marjory Pineda, Ketul Chhaya, Aakash Gautam, Yasmine Kotturi

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 该研究针对资源受限创业者,将BizChat工具扩展出评估模块,通过小组讨论让14名参与者集体评估AI生成的商业计划,发现该方式能提升评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16476 2026-08-18 cs.RO 新提交 50%

Exposing the Long-tail in Embodied Urban Navigation via Scalable Learning from In-the-Wild Videos

通过从野外视频进行可扩展学习揭示具身城市导航中的长尾分布

Bingyi Xia, Han Bao, Zhewei Chen, Hanjing Ye, Jingwen Yu, Yuhan Pang, Wenjun Xu, Jiankun Wang

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 该研究提出可扩展框架,从网络规模野外 egocentric 视频学习点目标城市导航策略,自动注释视频并训练视觉-语言-动作策略,表征并诊断导航长尾分布与失败模式,验证了知识迁移效果并揭示长尾结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16703 2026-08-18 cs.RO 50%

VLM-Empowered Multi-Mode System for Efficient and Safe Planetary Navigation

Sinuo Cheng, Ruyi Zhou, Wenhao Feng, Huaiguang Yang, Haibo Gao, Zongquan Deng, Liang Ding

机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)

专题命中 GUI与网页智能体 :planning(abstract)

Comments accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 19 篇

2608.16357 2026-08-18 cs.DC cs.AI cs.MA 新提交 83%

MELD: A Protocol for Merging Knowledge Across Distributed Agentic Memories

MELD:一种用于合并分布式智能体记忆中知识的协议

Lauri Lovén, Jaakko Sauvola, Jukka Riekki, Sasu Tarkoma

专题命中 记忆与上下文管理 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出MELD协议,实现分布式智能体记忆的知识合并,经实验验证其在存储、召回率、一致性及消息量上均优于基线,可支撑自治智能体联邦的知识协同。

Comments 30 pages, 3 figures, 1 table, plus an 11-page appendix (A-N). Code and experiment data: https://doi.org/10.5281/zenodo.21878274

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16178 2026-08-18 cs.DC cs.AI 新提交 83%

Agent-Native Telemetry: Verifiable State-Delta Evidence for Autonomous Operations

智能体原生遥测:面向自主操作的可验证状态增量证据

Jun He, Deying Yu

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究提出智能体原生遥测架构,基于ATP协议和状态增量证据账本,在微服务基准测试中大幅降低了数据开销、LLM资源消耗,且能检测对抗性突变、抵御提示注入攻击。

Comments 13 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15900 2026-08-18 cond-mat.mtrl-sci cs.LG 新提交 83%

Crystal-structure design by agentic AI in a language of motifs

基于基元语言的智能体AI晶体结构设计

Dinh-Khiet Le, Minh-Quyet Ha, Hong-Phuc Vu-Dinh, Takashi Miyake, Hiori Kino, Hieu-Chi Dam

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 该研究提出智能体AI框架MatEvolve,以基元语言设计晶体,在贫稀土永磁体设计中发现新结构原型的频率是生成模型的三倍以上,可揭示结构-性能关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15127 2026-08-18 cs.OS cs.AI cs.DC cs.MA 新提交 79%

From LLM Inference to Agentic Workloads: Characterization and Implications for Serving Systems

从大语言模型(LLM)推理到智能体工作负载:特征分析与服务系统启示

Chaokun Chang, Yukun Zhou, Kaihua Fu, Dakai An, Tianyu Feng, Hanfeng Lu, Sheng Yao, Pu Guo, Yinghao Yu, Yizhou Shan, Bo Li, Binhang Yuan, Wei Wang

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出AgentSysBench基准套件,分析智能体工作负载与传统LLM服务的6项差异,据此开展的4项设计探索可实现延迟降低、效率提升、内存减少及冗余调用节省等效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18005 2026-08-18 cs.CV 版本更新 78%

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)

专题命中 记忆与上下文管理 :agentic(title,abstract)

AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。

Comments Accepted by ACM MM 2026, the code is available at: https://github.com/tsinghua-fib-lab/UrbanWorld2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16775 2026-08-18 cs.CR cs.AI 新提交 70%

Topological Attribution Distance (TAD): Revealing Segment-Level RAG Influence on LLM Output Geometry for Incident Log Analysis

拓扑归因距离(TAD):揭示用于事件日志分析的RAG片段级影响对LLM输出几何的作用

Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang

专题命中 记忆与上下文管理 :autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究针对LLM在网络安全应用中证据归因追踪的缺口,提出拓扑归因距离(TAD)方法,可自适应识别对LLM输出关键的事件日志,为证据验证提供可解释追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04268 2026-08-18 cs.LG physics.ao-ph 版本更新 70%

Replacing Tunable Parameters in Weather and Climate Models with State-Dependent Functions using Reinforcement Learning

用强化学习替代天气和气候模型中的可调参数以状态依赖函数

Pritthijit Nath, Sebastian Schemm, Henry Moss, Peter Haynes, Emily Shuckburgh, Mark J. Webb

机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) School of Mathematical Sciences, Lancaster University(兰卡斯特大学数学科学学院) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) Met Office Hadley Centre(英国气象局哈德利中心)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文通过强化学习在线学习天气和气候模型中的参数方案,展示了在简化测试环境中,强化学习在气候偏差校正、辐射-对流平衡和纬向平均能量平衡模型中的应用,证明了强化学习在改进模型性能方面的有效性。

Comments 79 pages, 24 figures

Journal ref Journal of Advances in Modeling Earth Systems (JAMES) 18 (8), e2026MS005745

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16590 2026-08-18 cs.RO 新提交 67%

Zetta $ζ$: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

Zetta ζ:用于自进化物理智能的高效闭环具身框架

Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) Z-Trans AI

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract)

AI总结 Zetta ζ是一种闭环具身框架,通过时间尺度分离的循环进化评判器与恢复技能,结合Z-Infra在LIBERO-Pro、RoboCasa上实现90.8%、93.6%的成功率,为物理智能扩展提供路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16157 2026-08-18 cs.DC 新提交 67%

FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution

FreeToken:面向边缘原生MoE服务的带宽自适应高效执行方案

Shuo Yang, Xiaoze Fan, Melissa Pan, Haocheng Xi, Zhe Wang, Shanlin Sun, Kurt Keutzer, Song Han, Matei Zaharia, Chenfeng Xu, Ion Stoica

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract)

AI总结 FreeToken是边缘原生MoE服务系统,通过协同设计服务栈实现带宽自适应执行,将个人计算机转化为弹性推理平台,可在边缘硬件上部署大参数MoE模型,拓展了本地AI服务能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15071 2026-08-18 cs.AI cs.CL 新提交 62%

Evo-Harness: Context-to-Harness Skill Compilation for Self-Evolving Agents

Evo-Harness:面向自进化智能体的上下文到 harness 的技能编译

Tianxin Wei, Zhan Shi, Minhua Lin, Bing He, Zewen Liu, Yisi Sang, Yuanchen Bei, Xuying Ning, Jiaru Zou, Ting-Wei Li, Xiao Lin, Yanjun Zhao, Chi Wang, Benoit Dumoulin, Dakuo Wang, Jingrui He, Hanqing Lu

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对现有自进化 LLM 智能体方法的不足,提出 Evo-Harness 框架,通过上下文到 harness 的技能编译提炼单次执行的噪声上下文,在五个现实基准上验证了其有效性,为 LLM 智能体即时学习提供了原则性理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10161 2026-08-18 cs.CL cs.AI cs.IR 版本更新 62%

AWED-PIPER: Agents, Web Applications & Expert Detectors for Personally Identifiable Information Protection & Fine-grained Named Entity Recognition across 36 languages for 6.6 Billion Speakers

AWED-FiNER: 基于代理、网络应用和专家检测器的细粒度命名实体识别工具,支持36种语言,覆盖66亿使用者

Prachuryya Kaushik, Ashish Anand

机构 * Indian Institute of Technology Guwahati(印度理工学院古瓦哈蒂分校)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 AWED-FiNER提供支持36种语言的细粒度命名实体识别解决方案,包含代理工具、网络应用及53种先进专家模型,适用于多语言和低资源场景。

Comments Paper title updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15193 2026-08-18 q-bio.NC cs.AI 新提交 57%

Valhalla: A Layered Knowledge-State and Service-Governance Framework for Long-Term Scientific Knowledge Work

Valhalla:面向长期科学知识工作的分层知识状态与服务治理框架

Yuyang Zheng, Nan Li, Wenxia Deng, Lige Yan, Xiang Li, Si Chen

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI

AI总结 Valhalla是面向长期科学知识工作的分层框架,采用FREG模型与服务治理架构,经抗体设计任务验证,可将个性化知识结构转化为可共享重组的协作知识状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16114 2026-08-18 cs.CL 新提交 57%

HyperSkill: Self-Evolving LLM Agents via Hypergraph-Structured Skill Memory

HyperSkill:基于超图结构技能记忆的自进化大语言模型智能体

Ruiyao Xu, Tiankai Yang, Wei-Chieh Huang

机构 * University of Southern California(南加州大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校) Northwestern University(西北大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL

AI总结 本文提出HyperSkill超图记忆框架,解决LLM智能体记忆设计的存储、检索与进化问题,在多数据集上较10种基线取得显著性能提升。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15309 2026-08-18 cs.AI 新提交 57%

Physiological World Models for Human State Transitions

面向人体状态转换的生理世界模型

Chongyang Zhang, Rendong Wang, Hao Zheng, Hanwen Zhang, Yang Liu, Xiaolong Wei, Bin Chong

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI

AI总结 本文提出生理世界模型(PWM),引入人体状态转换标记,构建含六项基准任务的框架,用于建模人体生理状态响应现实因素的变化,助力个性化健康管理等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05714 2026-08-18 cs.AI 版本更新 57%

RA-CAD: Learning Post-Execution Critique for State-Aware Text-to-CAD Generation

RA-CAD:学习执行后批判的状态感知文本到CAD生成模型

Shuhao Yan, Changhao He, Peng Hu, Xi Peng

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 该研究针对文本到CAD生成的反馈利用不足问题,提出RA-CAD智能体,通过生成-执行-批判-重写循环结合CCB、FAO优化,在CADFusion和Text2CAD上实现最优性能。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16032 2026-08-18 cs.CR 新提交 50%

Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened

执行证明内存:通过验证实际发生的内容防御大语言模型智能体的伪造推理攻击

Md Habibur Rahman, Jaeho Kim

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 该研究针对大语言模型智能体的伪造推理攻击,提出执行证明内存(PoEM)防御方案,通过维护防篡改的HMAC链式分类账验证实际执行步骤,使攻击成功率降至0%,且误报率极低、开销微小。

Comments 8 pages, 6 figures, 5 tables. Code: https://github.com/bithabib/ai_security

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15706 2026-08-18 physics.soc-ph 新提交 50%

A memory-based three-state model of competing technology adoption: substitution regimes, multi-homing, and churn

基于记忆的技术竞争采纳三状态模型:替代机制、多归属与流失

Stefano Scialla, Marco Patriarca, Els Heinsalu, Julyan H. E. Cartwright

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 该研究提出基于记忆的三状态智能体竞争模型,可复现四类技术替代机制,揭示相似市场替代曲线或有不同微观成因,为关联技术替代轨迹与个体行为提供紧凑基线。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07035 2026-08-18 cs.IR 版本更新 50%

MISO: Model-Internal-State-Guided Optimization for Ranking Models

MISO:面向排序模型的模型内部状态引导优化

Yongzhe Zhang, Xiaoyu Deng, Yifan He, Mengying Sun, Sheng Luo, Yijia Liu, Hao Yan, Zhuo Li, Huiping Yao, Swathi Hrishikesh, Jing Chen, Dennis Choi, Steven Liu, Zhiwen Chen, Yang Jin, Haoyu Zhou, Lexi Luo, Keyi Chen, Anish Khazane, Marcio Porto, Xiaoya Wang, Emmy Wang, Kangfu Zheng, Xingyuan Wang, Peggy Yao, Yi Meng, Bilal Fadlallah, Gursharan Singh, Prabhakar Goyal, Alireza Vahdatpour, Santanu Kolay

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 针对排序模型优化依赖昂贵试错的问题,提出利用模型内部状态的MISO工作流,在广告排序案例中提升归一化熵且减少验证运行,实现手动调优与自动搜索的折中。

Comments Accepted at the OARS Workshop at ACM RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05144 2026-08-18 cond-mat.mtrl-sci 版本更新 50%

Revisiting ab-initio excited state forces from many-body Green's function formalism: approximations and benchmark

重新审视基于许多体格林函数方法的从头计算激发态力:近似与基准测试

Rafael R. Del Grande, David A. Strubbe

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 本文基于GW/BSE和DFPT计算,重新审视激发态力方法,修正了Ismail-Beigi和Louie的实现问题,并改进了电子-声子系数近似,用于研究材料中分子的激子-声子相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 65 篇

2608.15591 2026-08-18 cs.AI 新提交 91%

Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback

Agent Gym:通过人在回路反馈实现LLM智能体持续评估与演化的框架

Pouya Ghiasnezhad Omran, Michael Zimmermann, Duncan Cambridge, Ashmita Kapoor, Tanya Dixit

机构 * Google Cloud(谷歌云)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 Agent Gym是支持LLM智能体持续评估演化的模块化框架,通过人在回路反馈实现行为修正,其发票处理参考验证表明框架实用可用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15389 2026-08-18 cs.AI 新提交 89%

Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL

重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析

Changruo Zhao, Zujun Peng, Yu Tian, Yuting Liu, Yiyun Su, Huiying Zhu, Luyan Zhang, Heming Zeng

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract_cn);分类 cs.AI

AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14815 2026-08-18 cs.HC 新提交 87%

AI Agents and the Future of VIS

AI智能体与可视化(VIS)的未来

Chen Zhu-Tian, Nam Wook Kim, Saeed Boorboor, Shivam Raval, Pan Hao, Qianwen Wang, Vidya Setlur

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 该研讨会聚焦AI智能体与VIS领域的融合,探讨自主智能体对VIS的影响、人机协作等关键问题,邀请相关人员分享思路以推动VIS在人机共存未来的发展。

Comments workshop proposal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14667 2026-08-18 cs.AI cs.HC 新提交 86%

Position: AI Agents in Scientific Teams Should Be Studied as Human-Agent Systems

立场:科学团队中的智能体应作为人机系统(HAS)进行研究

Patrick Emami, Sameera Horawalavithana, Truc Nguyen, Gihan Panapitiya, Bruno Jacob, Siddhisanket Raskar, Saumya Sinha, Jared D. Willard, Andrew Glaws, Nithin Somasekharan, Ling Yue, Brian Lu, Shaowu Pan, Jason Eisner

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 针对当前AI科学家研究忽视科学团队社会层面的问题,提出将其作为人机系统(HAS)研究,分析相关风险并呼吁开发人机协同数学框架。

Comments 15 pages. Accepted at the COLM 2nd Workshop on Language Models for Scientific Discovery

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14680 2026-08-18 cs.AI cs.SE 新提交 86%

When Agentic Executions Fail: Detecting and Localizing Runtime Faults from Telemetry

当智能体执行失败时:从遥测数据中检测和定位运行时故障

Chenkai Zhang, Yiran Li, Yifang Tian, Michalis Bachras, Hans-Arno Jacobsen

机构 * University of Toronto(多伦多大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 该研究提出 AGENTCHAOSBENCH 基准,在智能体系统遥测数据中检测定位运行时故障,实验显示现有 LLM 基线对该任务的解决效果仍远未达标。

详情

展开后加载摘要…

URL PDF HTML 收藏