arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2607.27294 2026-07-31 cs.SE 新提交 57%

AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents

AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准

Jiajun Zhou, Zhaoxuan Ke, Jihang Ye, Xuanze Chen, Shanqing Yu, Qi Xuan

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27267 2026-07-31 cs.CR cs.AI 新提交 57%

FAVA: Formal Authorization for Verified Agents with Evidence-Backed Permission Graphs

FAVA:基于证据支持的权限图的经验证智能体的形式化授权

Yifan Zhang, Xinkui Zhao, Sai Liu, Hengxuan Lou, Guanjie Cheng, Chang Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26710 2026-07-30 cs.LG 新提交 57%

PowerAtlas: Towards Electricity-Computing Co-Scheduling for Power Systems

PowerAtlas:面向电力系统的电-计算协同调度

Kaiwen Jiang, Siya Xu, Ziyue Zhu, Chao Yang, Anh Tuan Luu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Grid Liaoning Electric Power Co., Ltd.(国网辽宁省电力有限公司) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 PowerAtlas是用于电-计算协同调度的LLM智能体框架,整合多类约束生成可行方案,构建含2000个实例的ECBench基准,在11种LLM上验证了有效性。

Comments 17 pages, 9 figures, 5 tables. Code: https://github.com/JAVA-Jiang/PowerAtlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26485 2026-07-30 cs.SI cs.LG 新提交 57%

Parameterized Fair Resource Allocation under Diversity Constraints

多样性约束下的参数化公平资源分配

Keke Huang, Yik Yu Ng, Laks V. S. Lakshmanan, Xiaokui Xiao

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出PRA及自适应变体APRA框架,将多样性约束下的资源分配从硬性条件优化转为柔性参数调节,兼顾公平性与效率,在真实应用中性能优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25620 2026-07-29 cs.AI cs.HC 新提交 57%

Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines

超越认知:认知分裂症与作为技术符号机器的大语言模型

Federico Cabitza, Gianluca Colombo

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25045 2026-07-29 cs.AI eess.SP q-bio.NC 新提交 57%

CogEEGAgent: Toward Autonomous Cognitive EEG Analysis with Grounded Execution and Selection-Aware Verification

CogEEGAgent:通过基于执行和选择感知验证实现自主认知脑电图分析

Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对认知EEG分析需专业知识及选择多的问题,提出基于MNE-Python的CogEEGAgent代理,LLM解释意图,确定性组件验证控制,在基准测试等中表现良好,建立了有限自主性和可审计自动化框架。

Comments 16 pages, 5 figures, and 16 tables. The supplementary material is included in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24300 2026-07-28 cs.CL cs.MA 新提交 57%

Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents

在启发式自我改进智能体中自我编写的验证不可靠

Diandian Guo, Cong Cao, Fangfang Yuan, Yingqi Wang, Yueshan Wang, Dakui Wang

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24275 2026-07-28 cs.LO cs.AI cs.CY 新提交 57%

A Computational Ethical Framework for Financial Digital Phenotyping for Mental Health

用于心理健康的金融数字表型分析的计算伦理框架

Oluwadara Adedeji, Michael Mayowa Farayola, Jeff Brozena, Irina Tal, Regina Connolly, Mark Matthews

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对人工智能驱动数字表型系统伦理治理难题,提出计算伦理框架,将伦理要求形式化为道义时态逻辑约束,通过金融数据和心理健康案例研究,用Z3求解器建模验证关键伦理属性,实现持续机器可验证伦理检查,支持相关系统发展。

Comments Accepted at the CIBB 2026 conference (https://cibb2026.teralab.ai/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24273 2026-07-28 cs.CL 新提交 57%

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准

Changyu Chen, Chenwei Lin, Xian Xu

机构 * Fudan University(复旦大学)

专题命中 Agent评测 :tool use(abstract);分类 cs.CL

AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。

Comments 18 pages, including appendices; 11 figures and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23263 2026-07-28 cs.AI 新提交 57%

SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents

SeekJudge:计算机使用智能体强化学习的实用奖励框架

Yang Wan, Zhenhao Zhang, Jierui Wang, Linchao Zhu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对计算机使用智能体强化学习中轨迹指令判断问题,提出SeekJudge框架,通过四个智能体循环裁决,用种子校准蒸馏管道训练共享主干模型,该框架在在线RL中匹配或超原生规则监督,还有诸多优势并改进奖励服务器,使模型奖励成实用替代品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23024 2026-07-28 cs.CV cs.LG stat.AP 新提交 57%

When Less Is More: A Controlled Benchmark of Lightweight CNNs for Satellite Land-Cover Segmentation on DeepGlobe

少即是多:用于DeepGlobe卫星土地覆盖分割的轻量级卷积神经网络的受控基准测试

Atiq Ur Rehman, Joseph Michael Donovan

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 研究在DeepGlobe数据集上比较VGG16等五种架构用于卫星土地覆盖分割,经三个迭代分离相关因素,采用相同预处理等协议。结果显示MobileNetV2_v1表现优,轻量级迁移学习模型在资源受限遥感环境中可匹配或超越更深模型,利于土地覆盖映射。

Comments 18 Figures, 8 Tables & 33 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22563 2026-07-28 cs.AI 新提交 57%

Synthetic Scenario Generation for Evaluation of Industry 4.0 Agents

用于工业4.0智能体评估的合成场景生成

Sagar Chethan Kumar, Rohith Kanathur, Dhaval Patel, Kaoutar El Maghraoui

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对工业智能体基准测试场景有限问题,扩展AssetOpsBench并引入ScenarioGeneratorAgent管道,通过多种优化方式提高可扩展性,实现智能电网变压器场景生成的高效优化,有效扩展工业智能体基准测试且保证场景质量。

Comments 19 pages, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22573 2026-07-28 cs.AI cond-mat.mtrl-sci physics.comp-ph 新提交 57%

PhononBench-MP40: a spectrum-resolved benchmark dataset for phonon stability

PhononBench-MP40:用于声子稳定性的光谱分辨基准数据集

Wen-Kao Li, Ze-Feng Gao, Zhong-Yi Lu

机构 * School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China(中国人民大学物理学院及量子态构建与调控教育部重点实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 研究针对计算材料筛选中虚声子模式瓶颈,提出PhononBench-MP40数据集,源于47969个MP40任务,含4类记录。通过科学数据银行公开,配套GitHub仓库提供代码等,为相关研究提供可审计参考。

Comments 18 pages, 3 figures, includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22520 2026-07-27 cs.AI 新提交 57%

The Regression Tax: Decomposing Why Skills Help and Hurt LLM Agents

回归税:剖析技能对大语言模型智能体产生帮助和伤害的原因

Darshan Tank, Baran Nama

机构 * Sentient Labs(森蒂恩实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究剖析大语言模型智能体中技能产生帮助和伤害的原因,通过对比实验区分回归和残余失败两种结果,识别出回归的三个原因,发现现有技能过度强调程序指导,指出应分解技能净效应评估,还识别出应避免的回归模式及可靠性的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22393 2026-07-27 cs.AI cs.CV 新提交 57%

SceneActBench: Can Agents Act on the 3D Scenes They See?

SceneActBench:智能体能否对其所看到的3D场景采取行动?

Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元) THU(清华大学) NJU(南京大学) HKUST(香港科技大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) PKU(北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究视觉语言模型智能体在3D场景行动能力,提出SceneActBench基准测试,涵盖五个3D任务,通过特定指标评估智能体输出,分析不同配置得分及失败情况,为评估智能体在多对象3D场景行动提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21646 2026-07-27 cs.LG 新提交 57%

Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning

作为非平稳强化学习安全约束的调整速度

Timothy Tomashevskiy

机构 * McMaster University(麦克马斯特大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究非平稳强化学习中的安全问题,提出以调整速度为安全约束,用上下文表示和预测估计适应需求,与智能体适应能力比较,超限时收紧动作集并激活屏蔽,实验验证该方法可减少安全违规,支持适应可行性原则。

Comments 15 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21400 2026-07-24 cs.RO cs.AI 新提交 57%

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20916 2026-07-24 cs.AI cs.DL 新提交 57%

Traceable Scholarship: Page Anchors and Ariadne's Thread for Humanistic Inquiry in the Age of Generative AI

可追溯的学术研究:生成式人工智能时代人文探究的页面锚点与阿里阿德涅之线

Deyu Jing

机构 * Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对生成式人工智能时代人文研究中解释缺乏明确依据的问题,提出可追溯学术研究,介绍页面锚点等方法及AIH-Infra参考实现,通过案例研究展示其作用,确保人文研究在该时代保持公开可反驳。

Comments 33 pages, 8 tables. This paper proposes a normative and infrastructural framework for traceable, AI-assisted humanistic research and presents an auditable Kant case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20872 2026-07-24 cs.CL 新提交 57%

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports

LegalCiteTrust:评估中文长篇法律研究报告中引用可信度的基准

Yunhan Li, Mingjie Xie, Zeyang Shi, Gengshen Wu, Min Yang

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Southern University of Science and Technology(南方科技大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 研究旨在评估中文长篇法律研究报告引用可信度,引入LegalCiteTrust基准,含72个任务并从三个维度评估。通过实验发现不同系统表现各异,检索工具与基于E/F/A的修订效果不同,强调可靠法律研究生成需检索后的引用感知证据治理。

Comments 8 pages, 21 pages with appendix, 26 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20549 2026-07-24 cs.LG cs.RO cs.SY eess.SY 新提交 57%

SevDiff: Severity-Conditioned Diffusion for Long-Tail Conflict Trajectory Generation

SevDiff:用于长尾冲突轨迹生成的严重程度条件扩散

Eni Solomon Laughter

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究针对ADAS评估中冲突轨迹罕见及现有方法不足的问题,提出SevDiff严重程度条件扩散模型,以TTC值为调节信号生成配对轨迹,经训练在不同TTC目标下有高命中率,生成特征物理合理,命中率下降模式可精确表征生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20528 2026-07-24 cs.AI 新提交 57%

PromptPack: Scaling LLM Annotation Agents for Online Recommendation

PromptPack:扩展用于在线推荐的大语言模型注释代理

Sebastian Koralewski, Merwan Barlier, Yulia Stolin, Blaž Škrlj

机构 * Teads Inc.(缇德思公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在线推荐平台用LLMs提取广告素材特征时按创意提示成本高的问题,提出可扩展的PromptPack代理,通过上下文内批处理等实现扩展,经实验评估,相比基线,它大幅降低成本、提高吞吐量且保留AUC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20431 2026-07-24 cs.CL cs.IR 新提交 57%

Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis

用于证据感知材料文献分析的技能收缩代理

Bixuan Li, Yu Liu, Shuo Shi, Xiaoya Huang, Peng Kang, Lei Zheng

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对材料科学文献分析难题,提出技能驱动的AlphaAgent框架,通过明确技能契约解耦任务。其含专门检索技能和报告生成技能,在盲评中显著优于基线系统,提升了文献分析效果。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20124 2026-07-23 cs.LG cs.MA 新提交 57%

Autonomous Collaborative Learning Among an Ensemble of Tsetlin Machines with Consensus-Based Inference

基于共识推理的Tsetlin机集成中的自主协作学习

Yehuda Rudin, Osnat Keren, Michal Yemini, Alexander Fish

机构 * Faculty of Engineering, Bar Ilan University(巴伊兰大学工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文针对分布式和去中心化TM学习关注不足的问题,提出基于共识推理的Tsetlin机集成去中心化协作学习范式,各智能体维护私有模型,不交换原始数据,实验表明该范式下分类准确率与集中式模型相当,促进了信息集成融合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20005 2026-07-23 cs.AI 新提交 57%

Safe Remediation as Risk-Constrained Intervention Decision in Microservice Systems

作为微服务系统中风险约束干预决策的安全修复

Chengxiao Dai, Zhaokun Yan, Chenjun Lei, Qiao Li, Luyan Zhang

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) Khoury College of Computer Sciences, Northeastern University(美国东北大学库里计算机科学学院) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) College of Business and Economics, Australian National University(澳大利亚国立大学商业与经济学院) School of Computer Science and Technology, Fujian Normal University(福建师范大学计算机科学与技术学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究微服务系统中安全修复问题,将其转化为风险约束干预决策问题并构建约束马尔可夫决策过程,引入三维风险分解和上下文自适应人在回路门,通过实验验证该框架能降低错误修复率、提高修复成功率并减轻值班升级负载。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19380 2026-07-23 cs.LG 新提交 57%

CruiseBench: A Real-Flight-Aligned N-CMAPSS Benchmark for Engine RUL Prediction

CruiseBench:用于发动机剩余使用寿命预测的真实飞行对齐N-CMAPSS基准测试

Pu Cheng, Qiang Miao

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 研究发动机RUL预测问题,提出CruiseBench基准测试及CPM-N-CMAPSS方法,通过固定协议处理数据,排除部分因素,利用多种模型实验给出基线结果,为RUL模型比较提供可重复子基准及数据基础。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19356 2026-07-23 cs.AI 新提交 57%

NEXUS: Structured Runtime Safety for Tool-Using LLM Agents

NEXUS:工具使用型大语言模型智能体的结构化运行时安全

Elias Hossain, Md Mehedi Hasan Nipu, Tasfia Nuzhat Ornee, Rajib Rana, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学) North South University(南北大学) University of Southern Queensland(南昆士兰大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究工具使用型大语言模型智能体运行时安全问题,提出NEXUS结构化计划安全监控器,结合多种方法进行分级升级。在多个基准测试中表现出色,如合成基准测试F1分数达0.949等,还具有低延迟、低开销特点,相关成果已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19967 2026-07-23 physics.soc-ph cs.AI cs.CY 新提交 57%

When Shippers Become Algorithms: Candidate Exposure, Information Design, and the Concentration of LLM-Mediated Freight Markets

当托运人成为算法:候选者曝光、信息设计与大语言模型介导的货运市场集中度

Takahiro Ezaki, Naoto Imura, Katsuhiro Nishinari

机构 * Research Center for Advanced Science and Technology, The University of Tokyo(东京大学先进科学与技术研究中心) Department of Aeronautics and Astronautics, School of Engineering, The University of Tokyo(东京大学工学部航空宇宙学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究托运人委托大语言模型代理选择承运人对货运市场的影响及平台设计应对策略,通过基于代理的模拟发现代理趋同、集中度随候选列表数量变化等风险,披露承运人剩余日运力可有效应对,凸显平台信息设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19281 2026-07-22 cs.LG 新提交 57%

A Reinforcement-Learning-Augmented Liquid-Fueled Reactor Network Model for Predicting Lean Blowout in Gas Turbine Combustors

一种用于预测燃气轮机燃烧室贫油熄火的强化学习增强型液体燃料反应器网络模型

Philip John, Eloghosa Ikponmwoba, Pinaki Pal, Opeoluwa Owoyele

机构 * Louisiana State University(路易斯安那州立大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究提出强化学习框架预测燃气轮机燃烧室贫油熄火,采用多阶段聚类-分类策略,借助初始聚类和演员-评论家RL智能体生成优化反应器区域,验证研究显示该框架预测保真度高、速度快,有潜力作为降阶建模技术辅助高保真模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18665 2026-07-22 cs.AI 新提交 57%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18659 2026-07-22 cs.CR cs.AI cs.MA 新提交 57%

Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents

破碎的大门:在大语言模型代理时代重新评估网络机器人防御

Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud, Dillan Bailey, Amin Kharraz

机构 * Florida International University(佛罗里达国际大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在大语言模型代理时代网络机器人防御的有效性,通过系统测量研究评估基于交互式挑战与非交互式信任的防御对商业验证码解决服务和大语言模型代理的弹性,发现非交互式防御安全边界在环境层,影响机器人管理系统设计评估。

详情

展开后加载摘要…

URL PDF HTML 收藏