arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2603.25423 2026-03-27 cs.SI cs.AI 70%

From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild

从操控到怀疑:为野外鲁棒驳斥解释多样化的微视频虚假信息

Zhi Zeng, Yifei Yang, Jiaying Wu, Xulang Zhang, Xiangzheng Kong, Herun Wan, Zihan Ma, Minnan Luo

机构 * School of Computer Science and Technology, MOEKLINNS Lab, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院、教育部机器学习与智能决策网络实验室) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出WildFakeBench基准和FakeAgent框架,通过多模态理解和外部证据分析,提升微视频虚假信息检测的可解释性和鲁棒性。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23279 2026-03-25 cs.SI cs.AI 70%

Emergence of Fragility in LLM-based Social Networks: the Case of Moltbook

基于大语言模型的社会网络中脆弱性的涌现:以Moltbook为例

Luca Sodano, Sofia Sciangula, Amulya Galmarini, Francesco Bertolotti

机构 * School of Industrial Engineering Intelligence, Complexity and Technology Lab (ICT Lab)(工业工程智能、复杂性与技术实验室) LIUC - Università Cattaneo Castellanza(LIUC-卡塔内奥卡斯泰尔兰扎大学) Università Cattaneo Castellanza(卡塔内奥卡斯泰尔兰扎大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究分析Moltbook平台中基于大语言模型的智能体交互网络,发现其连接模式高度异质,存在核心外围结构,对随机节点移除较 resilient,但对高连接节点的攻击易受破坏,揭示AI社交系统可能发展出集中化与结构性脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23059 2026-03-25 cs.AI 70%

Minibal: Balanced Game-Playing Without Opponent Modeling

Minibal:无需对手建模的平衡游戏

Quentin Cohen-Solal, Tristan Cazenave

机构 * LAMSADE, Université Paris-Dauphine, PSL, CNRS(巴黎第四大学LAMSADE研究所,巴黎法兰西理工大学,法国国家科学研究中心)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Minibal算法,通过改进极大极小算法实现平衡游戏策略,实验表明其在多种棋盘游戏中表现出接近完美平衡的性能,为设计兼具挑战性与趣味性的AI代理提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22954 2026-03-25 cs.CR cs.LG 70%

Privacy-Preserving EHR Data Transformation via Geometric Operators: A Human-AI Co-Design Technical Report

通过几何运算实现隐私保护的电子健康记录数据转换:一个人工智能与人类协同设计技术报告

Maolin Wang, Beining Bao, Gan Yuan, Hongyu Chen, Bingkun Zhao, Baoshuo Kan, Jiming Xu, Qi Shi, Yinggong Zhao, Yao Wang, Wei Ying Ma, Jun Yan

机构 * Hong Kong Institute of AI for Science (HKAI-Sci), City University of Hong Kong(香港人工智能科学研究院(HKAI-Sci),香港城市大学) Department of Biostatistics, City University of Hong Kong(香港城市大学生物统计学系) Institute of Digital Medicine, City University of Hong Kong(香港城市大学数字医学研究院) YIDU TECH co. Ltd.(YIDU科技有限公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 本文提出一种隐私保护的数据转换框架,通过几何运算在保持医学语义和统计特性的同时,防止直接关联受保护的患者属性,解决了数据共享中的隐私和互操作性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22489 2026-03-25 cs.CR cs.SE 70%

Model Context Protocol Threat Modeling and Analyzing Vulnerabilities to Prompt Injection with Tool Poisoning

模型上下文协议威胁建模及针对提示注入的漏洞分析

Charoes Huang, Xin Huang, Ngoc Phu Tran, Amin Milani Fard

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.SE

AI总结 本文基于STRIDE和DREAD框架对MCP五个关键组件进行威胁建模,发现工具污染是主要客户端漏洞,提出多层防御策略以提升AI代理生态的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14783 2026-03-24 cs.CL cs.CY 70%

Human or LLM as Standardized Patients? A Comparative Study for Medical Education

人类或大语言模型作为标准化患者?医学教育中的比较研究

Bingquan Zhang, Xiaoxiao Liu, Yuchi Wang, Lei Zhou, Qianqian Xie, Benyou Wang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Freedom AI

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出EasyMED框架和SPBench基准,通过对比实验显示其在医学教育中更接近人类标准化患者行为,尤其在案例一致性与可控披露方面表现更优,且在学习效果和成本效率上具有优势。

Comments 24 pages, 13 figures, 10 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20285 2026-03-24 cs.AI 70%

AgentComm-Bench: Stress-Testing Cooperative Embodied AI Under Latency, Packet Loss, and Bandwidth Collapse

AgentComm-Bench: 在延迟、丢包和带宽崩溃下压力测试协作具身AI

Aayam Bansal, Ishaan Gangwani

机构 * Synthetic Sciences(合成科学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AgentComm-Bench通过六个通信退化维度系统性压力测试协作具身AI,揭示通信依赖任务在延迟、丢包和带宽崩溃下的性能急剧下降,提出基于冗余消息编码的轻量通信策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20101 2026-03-23 cs.AI 70%

Pitfalls in Evaluating Interpretability Agents

评估可解释性代理中的陷阱

Tal Haklay, Nikhil Prakash, Sana Pandey, Antonio Torralba, Aaron Mueller, Jacob Andreas, Tamar Rott Shaham, Yonatan Belinkov

机构 * Kempner Institute at Harvard University(哈佛大学 Kempner 机构) Northeastern University(东北大学) Boston University(波士顿大学) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文研究了自动化电路分析中可解释性代理的评估挑战,提出基于模型组件功能互换性的无监督内在评估方法,揭示了复制评估的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19668 2026-03-23 cs.CL 70%

Structured Prompting for Arabic Essay Proficiency: A Trait-Centric Evaluation Approach

结构化提示法在阿拉伯语作文能力评估中的应用:以特质为中心的评估方法

Salim Al Mandhari, Hieu Pham Dinh, Mo El-Haj, Paul Rayson

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出了一种新的提示工程框架,用于阿拉伯语特质特定的自动作文评分,利用大语言模型在零样本和少样本配置下进行评估。通过三种层次提示策略,指导模型评估如组织、词汇、发展和风格等语言能力特质。实验表明,结构化提示法在阿拉伯语自动作文评分中效果显著。

Comments 13 pages

Journal ref The Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05710 2026-03-23 q-fin.CP cs.AI 70%

FinReflectKG -- EvalBench: Benchmarking Financial KG with Multi-Dimensional Evaluation

FinReflectKG -- EvalBench:基于多维评估的金融知识图谱基准测试

Fabrizio Dimino, Abhinav Arun, Bhaskarjit Sarmah, Stefano Pasquali

机构 * New York, US(美国纽约) Gurugram, India(印度古尔冈)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出FinReflectKG-EvalBench,通过多维评估框架对金融知识图谱提取进行基准测试,证明基于反思的提取方法在全面性、精度和相关性上表现最佳,同时验证LLM作为评判者在成本效率和结构化错误分析中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17820 2026-03-19 cs.LG 70%

Federated Distributional Reinforcement Learning with Distributional Critic Regularization

联邦分布式强化学习与分布批评正则化

David Millard, Cecilia Alm, Rashid Ali, Pengcheng Shi, Ali Baheri

机构 * Dept. of Mechanical Engineering, Rochester Institute of Technology(机械工程系,罗切斯特理工学院) Dept. of Psychology and School of Information, Rochester Institute of Technology(心理学系和信息学院,罗切斯特理工学院) Department of Engineering Science, University West(工程科学系,西大学) Golisano College of Computing and Information Sciences, Rochester Institute of Technology(计算与信息科学学院,罗切斯特理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出FedDistRL和TR-FedDistRL,通过分布批评正则化提升安全性和稳定性,在多任务环境中表现出更低的均值模糊和更高的安全指标。

Comments 9 pages, 4 Figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16734 2026-03-18 cs.AI 70%

Differential Harm Propensity in Personalized LLM Agents: The Curious Case of Mental Health Disclosure

个性化LLM代理中的差异性伤害倾向:心理健康披露的奇特案例

Caglar Yildirim

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究探讨了心理健康披露对代理有害行为的影响,发现个性化设置可降低伤害,但易受对抗性压力影响,需加强个性化评估与安全措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18808 2026-03-18 cs.SE 70%

SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement

SR-Eval: 评估在逐步需求细化下的LLM代码生成能力

Zexun Zhan, Shuzheng Gao, Ruida Hu, Cuiyun Gao

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 SR-Eval是一个针对迭代代码生成的评估基准,通过多轮交互模拟真实开发流程,评估LLM在逐步需求细化下的表现,发现最佳模型在功能级任务中仅达到22.67%的完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15297 2026-03-17 cs.AI 70%

Evolutionary Transfer Learning for Dragonchess

进化迁移学习用于龙棋

Jim O'Connor, Annika Hoag, Sarah Goyette, Gary B. Parker

机构 * Computer Science Department, Connecticut College, New London, United States(康奈尔学院计算机科学系,新伦敦,美国)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出利用进化迁移学习在龙棋中适应启发式评估函数,通过CMA-ES优化提升AI性能,展示了在复杂游戏领域中迁移学习的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14265 2026-03-17 cs.CL cs.MA 70%

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08009 2026-03-17 cs.CY cs.AI 70%

The Law-Following AI Framework: Legal Foundations and Technical Constraints. Legal Analogues for AI Actorship and technical feasibility of Law Alignment

遵循法律的AI框架:法律基础与技术限制。AI行为者的法律类比和技术可行性

Katalina Hernandez Delgado

专题命中 Agent评测 :AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文评估了O'Keefe等人提出的

Comments Presented at SMU Computational Legal Studies Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13791 2026-03-17 cs.CL 70%

DeceptGuard :A Constitutional Oversight Framework For Detecting Deception in LLM Agents

DeceptGuard :一个宪法监督框架用于检测LLM代理中的欺骗行为

Snehasis Mukhopadhyay

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出DeceptGuard框架,通过比较三种监控机制,结合Coot-aware和激活探针监控,显著提升检测性能,并提出HYBRID-CONSTITUTIONAL集成方法,实现更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07427 2026-03-17 cs.AI cs.CR 70%

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。

Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17434 2026-03-17 cs.AI 70%

Resource Rational Contractualism Should Guide AI Alignment

资源理性契约主义应指导AI对齐

Sydney Levine, Matija Franklin, Tan Zhi-Xuan, Secil Yanik Guyot, Lionel Wong, Daniel Kilov, Yejin Choi, Joshua B. Tenenbaum, Noah Goodman, Seth Lazar, Iason Gabriel

机构 * Harvard(哈佛大学) MIT(麻省理工学院) Google Deepmind(谷歌DeepMind) Australian National University(澳大利亚国立大学) Stanford Psychology Department(斯坦福心理学系) Stanford(斯坦福大学) Computer Science Department(计算机科学系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出资源理性契约主义框架,通过认知启发式方法提升AI决策效率与适应性,解决大规模契约达成成本高问题。

Comments 24 pages, 10 figures

Journal ref International Association for Safe and Ethical AI, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11433 2026-03-13 cs.AI cs.CR 70%

Adversarial Reinforcement Learning for Detecting False Data Injection Attacks in Vehicular Routing

对抗性强化学习用于检测车联网中的虚假数据注入攻击

Taha Eghtesad, Yevgeniy Vorobeychik, Aron Laszka

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于对抗性强化学习的方法,用于检测车联网中的虚假数据注入攻击,通过纳什均衡策略优化检测效果,提升交通网络的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08723 2026-03-12 cs.CY cs.AI 70%

Alignment as Iatrogenesis: Pastoral Power, Collective Pathology, and the Structural Limits of Monolingual Safety Evaluation

对齐作为医源性:牧师权力、集体病理学以及单语安全评估的结构性限制

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry(刑事精神病研究所以) Sex Offender Medical Center(性犯罪医疗中心) Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文通过多语言实验揭示,单语安全评估无法捕捉对齐设计导致的集体病理效应,指出语言切换影响病理模式的定性与幅度。

Comments 30 pages, 1 figure, 24-page supplementary. Preprint v3. Companion paper: arXiv:2603.04904. Previous versions: Zenodo DOI 10.5281/zenodo.18646998

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08999 2026-03-11 cs.CR cs.AI 70%

MCP Bridge: A Lightweight, LLM-Agnostic RESTful Proxy for Model Context Protocol Servers

MCP Bridge:一种轻量级、LLM无关的RESTful代理,用于模型上下文协议服务器

Arash Ahmadi, Sarah Sharif, Yaser M. Banad

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 MCP Bridge是一种轻量级RESTful代理,通过统一API连接多个MCP服务器,支持任意后端,提升安全性和跨平台兼容性,优化模型在MCPToolBench++上取得73.0%的F1分数。

Comments 42 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09043 2026-03-11 cs.AI 70%

Time, Identity and Consciousness in Language Model Agents

时间、身份与语言模型代理的意识

Elija Perrier, Michael Timothy Bennett

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本文提出一种基于时间间隙的框架,用于评估语言模型代理的身份持续性,通过分离成分发生与共存,建立身份形态空间并提供保守的评估工具。

Comments Accepted at AAAI 2026 Spring Symposium - Machine Consciousness: Integrating Theory, Technology, and Philosophy

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22755 2026-03-11 cs.CL 70%

AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

AuditBench:对具有隐藏行为的模型进行对齐审计评估

Abhay Sheshadri, Aidan Ewart, Kai Fronsdal, Isha Gupta, Samuel R. Bowman, Sara Price, Samuel Marks, Rowan Wang

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 AuditBench通过植入隐藏行为的模型评估对齐审计技术,发现黑盒工具在代理中表现最佳,且训练技术影响审计难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07890 2026-03-10 cs.AI cs.CV 70%

Visualizing Coalition Formation: From Hedonic Games to Image Segmentation

从享乐博弈到图像分割:联盟形成的可视化

Pedro Henrique de Paula França, Lucas Lopes Felipe, Daniel Sadoc Menasché

机构 * UFRJ(里约热内卢联邦大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文通过图像分割技术研究享乐博弈中联盟形成的过程,揭示细粒度参数对均衡结构的影响,并将多代理系统与图像分割联系起来。

Comments The First Workshop on AI for Mechanism Design and Strategic Decision Making -- Workshop AIMS at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07169 2026-03-10 cs.LG stat.ML 70%

Making LLMs Optimize Multi-Scenario CUDA Kernels Like Experts

使LLMs像专家一样优化多场景CUDA内核

Yuxuan Han, Meng-Hao Guo, Zhengning Liu, Wenguang Chen, Shi-Min Hu

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出CUDAMaster系统,通过多代理和硬件感知方法,实现对多场景CUDA内核的高效优化,显著提升性能并超越现有闭源库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01528 2026-03-10 cs.CV cs.AI cs.RO 70%

DrivingGen: A Comprehensive Benchmark for Generative Video World Models in Autonomous Driving

DrivingGen:自主驾驶中生成视频世界模型的综合性基准

Yang Zhou, Hao Shao, Letian Wang, Zhuofan Zong, Hongsheng Li, Steven L. Waslander

机构 * University of Toronto(多伦多大学) CUHK MMLab(香港中文大学MMLab)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 DrivingGen提出首个综合性基准,用于评估生成驾驶世界模型的视觉真实性、轨迹合理性、时间一致性和可控性,揭示通用与专用模型间的权衡。

Comments ICLR 2026 Poster; Project Website: https://drivinggen-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11663 2026-03-04 cs.RO cs.AI cs.CV 70%

ConEQsA: Concurrent and Asynchronous Embodied Questions Scheduling and Answering

ConEQsA:并发与异步具身问题调度与回答

Haisheng Wang, Dong Liu, Weiming Zhi

机构 * Software Engineering Institute, East China Normal University(东华大学软件工程学院) Department of Computer Science, Yale University(耶鲁大学计算机科学系) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) College of Connected Computing, Vanderbilt University(范德比大学连接计算学院)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 ConEQsA通过并发与异步机制提升具身问题回答的效率与响应能力

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23415 2026-03-03 cs.AI 70%

From Conversation to Query Execution: Benchmarking User and Tool Interactions for EHR Database Agents

从对话到查询执行:为电子健康记录数据库代理构建用户和工具交互基准

Gyubok Lee, Woosog Chay, Heeyoung Kwak, Yeong Hwa Kim, Haanju Yoo, Oksoon Jeong, Meong Hi Son, Edward Choi

机构 * KAIST(韩国科学技术院) NAVER Cloud(NAVER云) Samsung Medical Center(三星医疗中心)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 EHR-ChatQA通过模拟环境评估数据库代理在处理用户查询模糊性和价值不匹配时的性能,揭示了构建安全关键EHR领域中鲁棒代理的重要性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00960 2026-03-03 cs.CR cs.AI 70%

AWE: Adaptive Agents for Dynamic Web Penetration Testing

AWE:动态网络渗透测试的自适应代理

Akshat Singh Jaswal, Ashish Baghel

机构 * Stux Labs(Stux实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AWE通过内存增强的多代理框架,在动态网络渗透测试中实现高准确性和效率,针对注入类漏洞取得显著成果。

Journal ref Workshop on LLM Assisted Security and Trust Exploration (LAST-X), co-located with NDSS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏