arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2607.14336 2026-07-17 cs.SE cs.AI 新提交 81%

Copy-on-Write Scoring: Application-Specific Agent Evaluations

写时复制评分:特定应用代理评估

Joanna Roy, Sven Hoelzel

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究如何在软件系统中可靠部署基于大语言模型的代理,提出写时复制(CoW)评分框架,利用PostgreSQL级机制在应用环境中直接评估代理操作,能低成本评估迭代,在开源平台上验证了该框架的有效性。

Comments 15 pages, 11 figures, accepted at ICML 2026 Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14159 2026-07-17 cs.AI cs.CL 新提交 81%

MemoHarness: Agent Harnesses That Learn from Experience

MemoHarness:从经验中学习的智能体控制层

Yue Huang, Wenjie Wang, Han Bao, Yuchen Ma, Xiaonan Luo, Yi Nian, Haomin Zhuang, Zheyuan Liu, Yue Zhao, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) LMU Munich(慕尼黑大学) University of Southern California(南加州大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究针对智能体控制层设计影响行为但改进方法窄且多重用单一全局控制层的问题,提出自适应框架MemoHarness,通过分解控制层、存储经验并检索应用,在多基准测试中优于固定控制层,证明执行经验可构建更具适应性的控制层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13172 2026-07-16 cs.AI cs.LG 新提交 81%

Learning Safe Agent Behaviour from Human Preferences and Justifications via World Models

通过世界模型从人类偏好和理由中学习安全智能体行为

Ilias Kazantzidis, Timothy J. Norman, Yali Du, Christopher T. Freeman

机构 * University of Southampton(南安普顿大学) King’s College London(伦敦国王学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究在环境未知且无合适奖励函数时安全训练与部署智能体策略的问题,提出DROPJ方法,先学习世界模型,由人类在其中生成模拟轨迹并给出偏好及理由,据此训练奖励模型用于部署,实验表明该方法可降低训练成本、提升部署性能及安全性。

Comments 42 pages, 18 figures. Extended version of a paper presented at ICAART 2026; submitted for consideration in the ICAART 2026 post-publication selected-papers volume in Lecture Notes in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12469 2026-07-15 cs.SE cs.AI 新提交 81%

Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric

作为承重证据的智能体安全评估:一种供应商中立的跨线束可重构性度量

Oleg Solozobov

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究智能体安全评估结果缺乏承重证据问题,引入属性级可重构性度量及跨线束适配器,通过特定协议和方法定义相关指标,在公共和捆绑轨迹上验证,为安全评估提供可重构性度量及相关验证方法。

Comments 36 pages, 3 tables. Reproducibility package (scorer, fixtures, Evidence Sufficiency Cards): https://doi.org/10.5281/zenodo.21055696

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06074 2026-07-08 cs.SE cs.AI cs.CY cs.HC 新提交 81%

Prompt Coach: An Empirical Evaluation of an Agentic Tutor for Learning Prompt Engineering in Software Development

Prompt Coach:软件开发中用于学习提示工程的智能导师的实证评估

Rohit Mehra, Kapil Singi, Vikrant Kaulgud, Vibhu Saujanya Sharma, Swapnajeet Gon Choudhury, Swati Sharma, Adam P. Burden, Majd Sakr

机构 * Accenture Labs, India(Accenture实验室,印度) Accenture, India(Accenture,印度) Accenture, USA(Accenture,美国)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 研究针对软件开发人员难以掌握的提示工程技能,提出智能导师Prompt Coach,通过苏格拉底式指导助其学习编写高质量代码生成提示,经实证研究,15名专业开发者参与,单次课程后有显著改进,提升了提示编写技能。

Comments 7 pages. To be published in the proceedings of 41st International Conference on Automated Software Engineering (ASE '26), October 12-16, 2026, Munich, Germany (Industry Showcase Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01136 2026-07-02 cs.SE cs.AI 新提交 81%

Skills Are Not Islands: Measuring Dependency and Risk in Agent Skill Supply Chains

技能并非孤岛:衡量智能体技能供应链中的依赖性与风险

Changguo Jia, Tianqi Zhao, Runzhi He, Minghui Zhou

机构 * Peking University(北京大学) Zhongguancun Laboratory(中关村实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出智能体技能供应链(ASSC)概念,设计SkillDepAnalyzer工具从自然语言中提取依赖关系,在超143万技能上揭示四种结构模式和安全风险,建议类型化依赖清单和风险预警审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31272 2026-07-01 cs.CR cs.CL cs.LG 新提交 81%

The Decomposition Is the Fingerprint: Per-Component Identity for Agent Skills

分解即指纹:面向智能体技能的组件级身份标识

Hongliang Liu, Yuhao Wu, Tung-Ling Li

机构 * Palo Alto Networks

专题命中 Agent评测 :agent(title);AI agent(abstract);分类 cs.CL、cs.LG

AI总结 提出一种基于多组SimHash的局部敏感指纹,将技能分解为提示、代码和工具三元组,通过汉明距离比较实现技能家族识别与变更定位,AUC达0.974。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22557 2026-06-23 cs.AI cs.CL cs.HC 新提交 81%

MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

MacAgentBench: 在真实macOS桌面上基准测试AI代理

Yikun Fu, Bowen Fu, Zhenyu Wu, Shuang Cheng, Xiaowei Sun, Bowen Yang, Zehao Li, Yibo Zhao, Zichen Ding, Zhoumianze Liu, Shijie Wang, Biqing Qi, Bowen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Tsinghua University(清华大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 提出MacAgentBench,包含676个跨25个应用的任务,采用规则评估和细粒度多检查点评分,实验表明最佳配置(OpenClaw上的Claude Opus 4.6)达到73.7% Pass@1,优势主要来自技能库而非框架设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22329 2026-06-23 cs.CL cs.AI 新提交 81%

BabelJudge: Measuring LLM-as-a-Judge Reliability Across Languages and Agent Trajectories

BabelJudge: 跨语言和智能体轨迹中LLM作为评判者可靠性的测量

Shreyas KC

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出BabelJudge基准,通过受控扰动生成已知标签的成对样本,无监督地测量评判模型的位置偏差、冗长偏差、顺序不一致和跨语言退化,发现Swahili顺序一致性接近随机。

Comments 8 pages, 4 figures. Source code, benchmark toolkit, and reproduction scripts at https://github.com/Shreyaskc/BabelJudge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22203 2026-06-23 cs.CL cs.AI cs.MA cs.SI 新提交 81%

When Is Emergent Consensus Real? A Measured Coupling Gain and a Validity Diagnostic for LLM Agent Societies

何时涌现共识是真实的?一种测量耦合增益与LLM智能体社会的有效性诊断

Dongxu Yang

机构 * DeepLethe

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对LLM智能体社会中的涌现共识或极化现象,提出基于反事实扰动的耦合增益测量方法,并建立有效性诊断工具,区分真实社会动态与模型伪影。

Comments 13 pages (incl. appendix with proofs), 7 figures. Code and per-run logs released

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20683 2026-06-23 cs.AI cs.CL 新提交 81%

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

从问答到任务完成:智能体系统与执行框架设计综述

Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yunhe Wang

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学) Peking University(北京大学) TokenRhythm Technologies(TokenRhythm 科技公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文从模型-执行框架视角综述LLM智能体,分析模型瓶颈与执行框架设计,提出六组件分解法,并探讨任务完成、效率与可靠性的影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20631 2026-06-23 cs.AI cs.LG 新提交 81%

Harnessing Agent Skills: Architectural Patterns and a Reference Architecture for Skill-Mediated LLM Agents

驾驭智能体技能:技能中介LLM智能体的架构模式与参考架构

Boming Xia, Liming Zhu, Zhenchang Xing, Qinghua Lu, Dino Sejdinovic, Xiwei Xu

机构 * Responsible AI Research (RAIR) Centre(负责任人工智能研究中心) Adelaide University(阿德莱德大学) University of New South Wales(新南威尔士大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出十种经验性架构模式(五种核心、五种辅助)用于技能中介,并综合成包含供应链、中介、执行控制、证据与反馈四层的参考架构,通过跨实例化评估提供分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09613 2026-06-23 cs.CL cs.AI 新提交 81%

AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

AGENTSERVESIM:面向多轮LLM智能体服务的硬件感知模拟器

Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中佛罗里达大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出AGENTSERVESIM模拟器,通过程序编排器、工具模拟器、会话感知路由器和KV驻留模型等模块,在程序粒度上评估多轮LLM智能体服务策略,在CPU上以6%误差复现真实系统行为。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17519 2026-06-17 cs.CL cs.AI 新提交 81%

Scaling Enterprise Agent Routing: Degradation, Diagnosis, and Recovery

扩展企业智能体路由:退化、诊断与恢复

Kellen Gillespie, Robyn Perry

机构 * Superhuman, Inc.(Superhuman公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 研究企业助手工具库扩展时路由准确率下降问题,通过嵌入预选恢复F1分数10-17个百分点。

Comments 10 pages (6 main + 4 appendix), 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16988 2026-06-16 cs.SE cs.LG 新提交 81%

Agent trajectories as programs: fingerprinting and programming coding-agent behavior

智能体轨迹作为程序:编码智能体行为的指纹识别与编程

Hamidah Oderinwale

机构 * McGill University(麦吉尔大学) Taste Labs

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG、cs.SE

AI总结 提出通过程序性表示分析智能体行为模式,实现轨迹指纹识别(85.7%准确率),并开发ProcGrep库用于审计和评估智能体任务处理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14200 2026-06-15 cs.AI cs.LG 新提交 81%

When Should Agent Trust Be Conditional? Characterizing and Attacking Skill-Conditional Reputation in Agent Swarms

何时应条件化智能体信任?表征与攻击智能体群中的技能条件声誉

Yihan Xia, Taotao Wang

机构 * Shenzhen University(深圳大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 研究异构LLM智能体群中技能条件信任的适用条件,通过相图分析揭示其在高异质性、稀疏证据和技能相关场景下有效,但存在跨技能证据被攻击者利用的风险,提出条件信息值测试(CIVT)量化攻击影响。

Comments 18 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08960 2026-06-09 cs.CR cs.AI cs.LG cs.MA 新提交 81%

Hardening Agent Benchmarks with Adversarial Hacker-Fixer Loops

通过对抗性黑客-修复者循环强化智能体基准测试

Ziqian Zhong, Ivgeni Segal, Ivan Bercovich, Shashwat Saxena, Kexun Zhang, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Fewshot Corp(Fewshot公司) Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出黑客-修复者循环方法,通过LLM代理交替攻击和修补验证器,自动生成抗利用的验证器,将KernelBench攻击成功率从62%降至0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08200 2026-06-09 cs.AI cs.LG 新提交 81%

Online Agent-as-a-Judge: Situation-Generating Evaluation for Interactive Agents

在线智能体作为裁判:面向交互式智能体的情境生成评估

Hyogon Ryu, Jeonghwan Kim, Yewon Lim, Chaeun Lee, Jeongwook Kim, Donghoon Ham

机构 * KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 提出在线智能体作为裁判框架,通过部署环境内评估智能体主动生成相关情境,以评估交互式社交智能体的能力,提高标准覆盖率和与人类标签的一致性。

Comments ICML 2026 Workshop on Trustworthy AI for Good

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12338 2026-07-15 cs.AI 新提交 80%

How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks

多少任务足以做出智能体基准决策?对公共大语言模型智能体基准的重放分析

Wei-Jung Huang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI;agentic(comments)

AI总结 研究智能体基准测试中多少任务足以做决策,通过重放公共任务级记录,提出部分预算需满足支持完整基准决策、覆盖任务组及控制未解决比较比例等条件,还指出部分评估报告应包含的内容。

Comments KDD 2026 Workshop Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09908 2026-07-14 cs.CL cs.IR 新提交 80%

RouteRec: Strict Evaluation of Recommender-Agent Selection and Aggregation

RouteRec:推荐代理选择与聚合的严格评估

Kaiji Zhou, Vladimir Kalmykov, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL;AI agent(comments)

AI总结 研究在推荐系统异构代理选择中,RouteRec框架在成本约束下比较请求级硬选与项目级学习聚合,发现在MovieLens-1M数据集上,请求级选择粗糙,项目级聚合更有前景,不同聚合方式有不同效果。

Comments 8 pages, 7 figures. Accepted at AgentSearch 2026 (The First Workshop on Indexing, Retrieval, and Ranking of AI Agents), co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20634 2026-06-23 cs.AI cs.CY 新提交 80%

DEMM-Bench: A Cross-Regime Benchmark for Agent-Runtime Governance-Evidence Sufficiency

DEMM-Bench:面向智能体运行时治理证据充分性的跨机制基准

Oleg Solozobov

机构 * Independent Researcher (Global)(全球独立研究员)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出DEMM-Bench,基于决策证据成熟度模型(DEMM),通过8个证据机制和8个退化条件,衡量智能体运行时记录能否重构决策级属性,解决现有方法过度声称问题。

Comments 41 pages, 8 tables, no figures. Benchmark and dataset paper. Dataset (CC-BY-4.0) and code (Apache-2.0): Zenodo doi:10.5281/zenodo.20426092 and Hugging Face https://huggingface.co/datasets/dev404ai/DEMM-Bench; code at https://github.com/agent-runtime-evidence/decision-evidence-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05177 2026-08-07 cs.CY 新提交 80%

Using AI-Generated Feedback to Improve Critical Thinking and Writing Proficiency

利用AI生成的反馈提升批判性思维与写作能力

Qi Zhu, Xiaoming Zhai, Yan Zou, Chunlei Gao

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 本研究开发了WISE Agent智能体,通过对260名六年级学生的三个月干预,证实其作为认知支架可促进不同水平学生批判性思维的差异化发展,为AI辅助培养批判性思维提供了可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24821 2026-07-29 cs.MM cs.CV cs.SD 新提交 80%

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

AVE-Compass:迈向音频-视频编辑能力的整体评估

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 研究针对现有视频编辑基准未充分考虑视听耦合问题,提出AVE-Compass基准及AVE-Agent框架,通过多种评估方式评估编辑能力,能分解复杂指令迭代改进结果,提升了跨模态编辑等方面表现及感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14228 2026-08-17 cs.LG 新提交 79%

AutoSchema: Live Schema Grounding for Agentic Text-to-Sparql over Heterogeneous Knowledge Graphs

AutoSchema:面向异构知识图谱的智能体文本转SPARQL的实时模式接地

Yiming Zhang, Koji Tsuda

机构 * The University of Tokyo(东京大学) National Institute for Materials Science(国立材料科学研究所) RIKEN Center for Advanced Intelligence Project(理化学研究所高级智能项目中心)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.LG

AI总结 提出无需训练的AutoSchema框架,用于异构知识图谱的智能体文本转SPARQL的实时模式接地,在多项生物医学KGQA等任务中优于TogoMCP,可支持未记录RDF图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13564 2026-08-17 cs.AI 新提交 79%

Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation

生成无奖励的评判标准以减少智能体评估中的过度打分

Darragh Quinn, David Dylan, Roisin Healy, Fionn Carroll, Maeve Donnelly, Cormac Sheehan

机构 * Trinity College Dublin(都柏林三一学院) University College Dublin(都柏林大学学院) Dublin City University(都柏林城市大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出 RubricForge 方法,从带标签轨迹生成无奖励的智能体评判标准,可减少智能体评估中的过度打分,在 tau-bench 和 WebShop 上的表现优于通用 G-Eval 评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12629 2026-08-14 cs.LG 新提交 79%

CAKE: Compiler-Agent Co-Design for Frontier Kernel Evolution

CAKE:面向前沿核函数演进的编译器-智能体协同设计

Zihao Ye, Yingyi Huang, Hongyi Jin, Bohan Hou, Junru Shao, Zhongming Yu, Jinqi Chen, Meghan Cowan, Shiyi Cao, Shanli Xing, Hanfeng Chen, Vinod Grover, Tianqi Chen, Luis Ceze

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出CAKE编译器-智能体协同设计方案,通过硬件显式IR实现GPU核函数演进,在Flash-KMeans等基准测试中性能优于CUDA/PTX,相关成果已提交上游PR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12002 2026-08-13 cs.AI 新提交 79%

CTBench: Evaluating Troubleshooting Capabilities of AI Agents in Realistic Telecom Network Operations

CTBench:评估AI智能体在真实电信网络运维中的故障排查能力

Xingyu Yan, Tingting Dai, Antonio De Domenico, Mohamed Sana, Nicola Piovesan, Changchang Li, Bowen Liu, Kun Jiang, Mengjie Zhang, Dingcheng Shan, Jing-Cheng Pang, Chenwei Wu, Sijie Wu, Lianying Chao, Haoran Cai, Jiantao Ye, Xubin Li, Simon Mark Lucas, Xin Chen

机构 * Huawei Technologies(华为技术有限公司) Paris Research Center, Huawei Technologies(华为技术有限公司巴黎研究中心) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本研究提出CTBench基准,评估AI智能体的电信故障排查能力,发现其路径恢复表现好于根本原因分析,且资源消耗与诊断效果无必然关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10669 2026-08-12 cs.AI 新提交 79%

REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

REDAgentBench:可执行的红队测试与LLM智能体系统的忠实测量

Zixing Chen, Xingyuan Liu, Jie Zhu, Huaixia Dou, Shuo Jiang, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究针对LLM智能体安全评估的缺陷,推出REDAgentBench框架,经实验发现其宏平均ASR为65.69%,还揭示了识别-执行差距,无训练策略提醒可减少70%以上违规

Comments 6 figures, 4 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08852 2026-08-11 cs.AI cs.CY cs.HC cs.MA 新提交 79%

Findings of the First Teaching Monster Challenge: A Benchmark of Pedagogical Content Knowledge in AI Agents

首届“教学怪兽挑战赛”的研究发现:AI智能体的教学内容知识基准

Yi-Cheng Lin, Yu-Kai Guo, Szu-Chi Chen, Bo-Han Feng, Yun-Man Hsu, Hsiang Hsieh, Yu-Jung Lin, Yue-Ling Wu, Jia-Kai Dong, An-Yu Cheng, Yu-Han Huang, Lok-Lam Ieong, Kuan-Yu Chen, Ming-Douo Tchouang, Shao-Hua Sun, Che Lin, Jian-Jiun Ding, Hung-yi Lee

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 研究推出首个以学习者角色为评估标准的教学视频生成基准“教学怪兽挑战赛”,测试发现当前AI教学系统内容适配能力不足,自动裁判存在局限,发布相关资源供后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08468 2026-08-11 cs.CR cs.AI 新提交 79%

SkillsMetric: Mapping the Detection Boundary of Static Analysis for Malicious Agent Skills

SkillsMetric:映射恶意智能体技能静态分析的检测边界

Xinze Chen, Chi Zhang, Ping Ji, Yimin Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。

Comments 6 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏