AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents
AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。
FAVA:基于证据支持的权限图的经验证智能体的形式化授权
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。
PowerAtlas:面向电力系统的电-计算协同调度
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; State Grid Liaoning Electric Power Co., Ltd.(国网辽宁省电力有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 PowerAtlas是用于电-计算协同调度的LLM智能体框架,整合多类约束生成可行方案,构建含2000个实例的ECBench基准,在11种LLM上验证了有效性。
Comments 17 pages, 9 figures, 5 tables. Code: https://github.com/JAVA-Jiang/PowerAtlas
多样性约束下的参数化公平资源分配
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出PRA及自适应变体APRA框架,将多样性约束下的资源分配从硬性条件优化转为柔性参数调节,兼顾公平性与效率,在真实应用中性能优于现有基准。
超越认知:认知分裂症与作为技术符号机器的大语言模型
机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI
AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。
CogEEGAgent:通过基于执行和选择感知验证实现自主认知脑电图分析
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究针对认知EEG分析需专业知识及选择多的问题,提出基于MNE-Python的CogEEGAgent代理,LLM解释意图,确定性组件验证控制,在基准测试等中表现良好,建立了有限自主性和可审计自动化框架。
Comments 16 pages, 5 figures, and 16 tables. The supplementary material is included in the same PDF
在启发式自我改进智能体中自我编写的验证不可靠
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。
Comments 9 pages, 6 figures
用于心理健康的金融数字表型分析的计算伦理框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对人工智能驱动数字表型系统伦理治理难题,提出计算伦理框架,将伦理要求形式化为道义时态逻辑约束,通过金融数据和心理健康案例研究,用Z3求解器建模验证关键伦理属性,实现持续机器可验证伦理检查,支持相关系统发展。
Comments Accepted at the CIBB 2026 conference (https://cibb2026.teralab.ai/)
INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准
机构 * Fudan University(复旦大学)
专题命中 Agent评测 :tool use(abstract);分类 cs.CL
AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。
Comments 18 pages, including appendices; 11 figures and 12 tables
SeekJudge:计算机使用智能体强化学习的实用奖励框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对计算机使用智能体强化学习中轨迹指令判断问题,提出SeekJudge框架,通过四个智能体循环裁决,用种子校准蒸馏管道训练共享主干模型,该框架在在线RL中匹配或超原生规则监督,还有诸多优势并改进奖励服务器,使模型奖励成实用替代品。
少即是多:用于DeepGlobe卫星土地覆盖分割的轻量级卷积神经网络的受控基准测试
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 研究在DeepGlobe数据集上比较VGG16等五种架构用于卫星土地覆盖分割,经三个迭代分离相关因素,采用相同预处理等协议。结果显示MobileNetV2_v1表现优,轻量级迁移学习模型在资源受限遥感环境中可匹配或超越更深模型,利于土地覆盖映射。
Comments 18 Figures, 8 Tables & 33 Pages
用于工业4.0智能体评估的合成场景生成
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究针对工业智能体基准测试场景有限问题,扩展AssetOpsBench并引入ScenarioGeneratorAgent管道,通过多种优化方式提高可扩展性,实现智能电网变压器场景生成的高效优化,有效扩展工业智能体基准测试且保证场景质量。
Comments 19 pages, 3 appendices
PhononBench-MP40:用于声子稳定性的光谱分辨基准数据集
机构 * School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China(中国人民大学物理学院及量子态构建与调控教育部重点实验室)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 研究针对计算材料筛选中虚声子模式瓶颈,提出PhononBench-MP40数据集,源于47969个MP40任务,含4类记录。通过科学数据银行公开,配套GitHub仓库提供代码等,为相关研究提供可审计参考。
Comments 18 pages, 3 figures, includes Supplementary Information
回归税:剖析技能对大语言模型智能体产生帮助和伤害的原因
机构 * Sentient Labs(森蒂恩实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究剖析大语言模型智能体中技能产生帮助和伤害的原因,通过对比实验区分回归和残余失败两种结果,识别出回归的三个原因,发现现有技能过度强调程序指导,指出应分解技能净效应评估,还识别出应避免的回归模式及可靠性的关键因素。
SceneActBench:智能体能否对其所看到的3D场景采取行动?
机构 * Tencent Hunyuan(腾讯混元) ; THU(清华大学) ; NJU(南京大学) ; HKUST(香港科技大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; PKU(北京大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究视觉语言模型智能体在3D场景行动能力,提出SceneActBench基准测试,涵盖五个3D任务,通过特定指标评估智能体输出,分析不同配置得分及失败情况,为评估智能体在多对象3D场景行动提供依据。
作为非平稳强化学习安全约束的调整速度
机构 * McMaster University(麦克马斯特大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 研究非平稳强化学习中的安全问题,提出以调整速度为安全约束,用上下文表示和预测估计适应需求,与智能体适应能力比较,超限时收紧动作集并激活屏蔽,实验验证该方法可减少安全违规,支持适应可行性原则。
Comments 15 pages, 5 figures, 2 tables. Preprint
VoLN:仅视觉的长距离导航——范式、基准和方法
机构 * Beihang University(北京航空航天大学) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。
Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/
可追溯的学术研究:生成式人工智能时代人文探究的页面锚点与阿里阿德涅之线
机构 * Fudan University(复旦大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对生成式人工智能时代人文研究中解释缺乏明确依据的问题,提出可追溯学术研究,介绍页面锚点等方法及AIH-Infra参考实现,通过案例研究展示其作用,确保人文研究在该时代保持公开可反驳。
Comments 33 pages, 8 tables. This paper proposes a normative and infrastructural framework for traceable, AI-assisted humanistic research and presents an auditable Kant case study
LegalCiteTrust:评估中文长篇法律研究报告中引用可信度的基准
机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) ; Southern University of Science and Technology(南方科技大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.CL
AI总结 研究旨在评估中文长篇法律研究报告引用可信度,引入LegalCiteTrust基准,含72个任务并从三个维度评估。通过实验发现不同系统表现各异,检索工具与基于E/F/A的修订效果不同,强调可靠法律研究生成需检索后的引用感知证据治理。
Comments 8 pages, 21 pages with appendix, 26 tables, 4 figures
SevDiff:用于长尾冲突轨迹生成的严重程度条件扩散
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 研究针对ADAS评估中冲突轨迹罕见及现有方法不足的问题,提出SevDiff严重程度条件扩散模型,以TTC值为调节信号生成配对轨迹,经训练在不同TTC目标下有高命中率,生成特征物理合理,命中率下降模式可精确表征生成器。
PromptPack:扩展用于在线推荐的大语言模型注释代理
机构 * Teads Inc.(缇德思公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究在线推荐平台用LLMs提取广告素材特征时按创意提示成本高的问题,提出可扩展的PromptPack代理,通过上下文内批处理等实现扩展,经实验评估,相比基线,它大幅降低成本、提高吞吐量且保留AUC。
用于证据感知材料文献分析的技能收缩代理
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 研究针对材料科学文献分析难题,提出技能驱动的AlphaAgent框架,通过明确技能契约解耦任务。其含专门检索技能和报告生成技能,在盲评中显著优于基线系统,提升了文献分析效果。
Comments 9 pages, 5 figures
基于共识推理的Tsetlin机集成中的自主协作学习
机构 * Faculty of Engineering, Bar Ilan University(巴伊兰大学工程学院)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文针对分布式和去中心化TM学习关注不足的问题,提出基于共识推理的Tsetlin机集成去中心化协作学习范式,各智能体维护私有模型,不交换原始数据,实验表明该范式下分类准确率与集中式模型相当,促进了信息集成融合。
作为微服务系统中风险约束干预决策的安全修复
机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院) ; Khoury College of Computer Sciences, Northeastern University(美国东北大学库里计算机科学学院) ; School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) ; College of Business and Economics, Australian National University(澳大利亚国立大学商业与经济学院) ; School of Computer Science and Technology, Fujian Normal University(福建师范大学计算机科学与技术学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究微服务系统中安全修复问题,将其转化为风险约束干预决策问题并构建约束马尔可夫决策过程,引入三维风险分解和上下文自适应人在回路门,通过实验验证该框架能降低错误修复率、提高修复成功率并减轻值班升级负载。
CruiseBench:用于发动机剩余使用寿命预测的真实飞行对齐N-CMAPSS基准测试
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 研究发动机RUL预测问题,提出CruiseBench基准测试及CPM-N-CMAPSS方法,通过固定协议处理数据,排除部分因素,利用多种模型实验给出基线结果,为RUL模型比较提供可重复子基准及数据基础。
Comments 20 pages, 7 figures
NEXUS:工具使用型大语言模型智能体的结构化运行时安全
机构 * University of Central Florida(中佛罗里达大学) ; North South University(南北大学) ; University of Southern Queensland(南昆士兰大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究工具使用型大语言模型智能体运行时安全问题,提出NEXUS结构化计划安全监控器,结合多种方法进行分级升级。在多个基准测试中表现出色,如合成基准测试F1分数达0.949等,还具有低延迟、低开销特点,相关成果已公开。
当托运人成为算法:候选者曝光、信息设计与大语言模型介导的货运市场集中度
机构 * Research Center for Advanced Science and Technology, The University of Tokyo(东京大学先进科学与技术研究中心) ; Department of Aeronautics and Astronautics, School of Engineering, The University of Tokyo(东京大学工学部航空宇宙学系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究托运人委托大语言模型代理选择承运人对货运市场的影响及平台设计应对策略,通过基于代理的模拟发现代理趋同、集中度随候选列表数量变化等风险,披露承运人剩余日运力可有效应对,凸显平台信息设计的重要性。
一种用于预测燃气轮机燃烧室贫油熄火的强化学习增强型液体燃料反应器网络模型
机构 * Louisiana State University(路易斯安那州立大学) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 研究提出强化学习框架预测燃气轮机燃烧室贫油熄火,采用多阶段聚类-分类策略,借助初始聚类和演员-评论家RL智能体生成优化反应器区域,验证研究显示该框架预测保真度高、速度快,有潜力作为降阶建模技术辅助高保真模拟。
SciHazard:一种通过分解危害评分来衡量科学安全风险的基准
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI
AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。
破碎的大门:在大语言模型代理时代重新评估网络机器人防御
机构 * Florida International University(佛罗里达国际大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究在大语言模型代理时代网络机器人防御的有效性,通过系统测量研究评估基于交互式挑战与非交互式信任的防御对商业验证码解决服务和大语言模型代理的弹性,发现非交互式防御安全边界在环境层,影响机器人管理系统设计评估。