arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-13 至 2026-07-13 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 13 篇

2607.09586 2026-07-13 cs.AI 新提交 88%

TrustX Agent Risk Classification Framework (ARC): Risk-Tiering Internally Created Agentic AI Systems

TrustX智能体风险分类框架(ARC):对内部创建的智能体人工智能系统进行风险分层

Hannah M. Liu, Rhea Saxena, Shiv Asthana

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 针对智能体人工智能系统超出通用风险框架治理能力的问题,提出TrustX智能体风险分类框架(ARC),利用十二维度评分标准等组件量化风险,输出三层治理结果,为相关人员提供工具,且会持续迭代完善。

Comments This is a working paper on our risk classification tool, with iterations currently underway

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09065 2026-07-13 cs.SE cs.AI 新提交 84%

Inside the Skill Market: From Software Engineering Activities to Reusable Agent Skills

深入技能市场:从软件工程活动到可复用的智能体技能

Jialun Cao, Xinru Yan, Songqiang Chen, Yaojie Lu, Zhongxin Liu, Shing-Chi Cheung

机构 * The Hong Kong University of Science(香港科技大学) University of Chinese Academy of Sciences Beijing, China(中国科学院大学) Institute of Software, Chinese Academy of Sciences Beijing, China(中国科学院软件研究所) Zhejiang University Hangzhou, China(浙江大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨软件工程活动如何转化为可复用智能体技能。通过对公共库和市场中SE技能大规模实证研究,分析其封装活动、生命周期覆盖等,发现SE活动正通过技能成为可复用工件,为技能推荐等提供研究机会及相关机制需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09474 2026-07-13 cs.AI 新提交 84%

ProofCouncil: An LLM Agent for Solving Open Mathematical Problems

ProofCouncil:用于解决开放性数学问题的语言模型智能体

Johannes Schmitt, Tim Gehrunger, Jasper Dekoninck, Gergely Bérczi, Uri Kreitner, Liam Price, David Holmes

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学) Leiden University(莱顿大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究旨在提升大型语言模型解决数学开放性问题的性能,介绍了ProofCouncil智能体,它采用作者-评论家架构,在FirstProof挑战及其他问题测试中表现出色,还介绍了其开发及相关构建库并开源。

Comments 25 pages, 7 figures. ProofCouncil appears as System A (IMProofBench ProofCouncil) in the official FirstProof second-batch report (arXiv:2606.18119). Code and agent-building library: https://github.com/eth-sri/proof-council

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09420 2026-07-13 q-bio.PE 新提交 78%

PesTwin: A modular agent-based framework for pest and vector population control

PesTwin:一种用于害虫和病媒种群控制的基于模块化代理的框架

Andrea De Antoni, Giovanni Iacca, Andrea Pugliese, Anna Strampelli, Gerard Terradas, Matteo Rucco, Andrew Hammond

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对基因控制技术建模工具滞后问题,提出PesTwin框架,可跨物种等模拟基因控制技术,捕捉多种因素。经与实验室数据验证后可扩展到田间场景,能在基因控制系统实际应用前进行模拟测试,助力相关决策,缩短研发到应用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14300 2026-07-13 cs.AI cs.CL cs.LG 版本更新 75%

Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors

超越黑盒混淆:白盒监测器的机制分析与防御

Maheep Chaudhary, Fazl Barez

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG

AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08681 2026-07-13 cs.AI cs.ET cs.LG cs.MA econ.GN q-fin.EC 新提交 73%

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试

Shilin Ou, Yifan Xu, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18613 2026-07-13 cs.CL cs.AI 新提交 73%

Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

LLMs 是否已准备好辅助医生?PhysAssistBench:交互式医患-电子病历辅助基准

Tianming Du, Peijie Yu, Sihan Shang, Danli Shi, My Linh Nguyen, Shengbo Gao, Guangyuan Li, Yinghong Yu, Yan Jiang, Qianlong Zhao, Behzad Bozorgtabar, Shaoxiong Ji, Jiazhen Pan, Daniel Rueckert, Jiancheng Yang

机构 * Aalto University(阿尔托大学) Tencent(腾讯) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Aarhus University(奥胡斯大学) Technical University of Munich(慕尼黑工业大学)

专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出PhysAssistBench基准,通过构建交互式患者代理评估LLM在医患-EHR交互中的协调能力,发现当前模型不可靠,瓶颈在于多维度协调而非单一能力。

Comments 34 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29762 2026-07-13 cs.IR 版本更新 67%

Do Recommendation Algorithms Work When Users Are LLM Agents? A Case Study on Moltbook

当用户是LLM智能体时推荐算法是否有效?基于Moltbook的案例研究

Daming Li, Simeng Han, Jialu Zhang

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 研究LLM智能体作为用户时推荐算法的有效性,在Moltbook平台上评估八种方法,发现基于流行度和物品协同过滤的方法优于用户表示学习,表明推荐从个性化退化为结构模式匹配。

Comments 11 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09016 2026-07-13 cs.CR cs.SE 新提交 57%

SLBench: Evaluating How LLM Agents Follow Logical Relations in Skills

SLBench:评估大语言模型智能体在技能中遵循逻辑关系的情况

Xuan Chen, Chengpeng Wang, Lu Yan, Xiangyu Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 研究评估大语言模型智能体遵循逻辑关系情况,引入SkillLogic框架,构建SLBench基准,扫描超500个公共技能,评估发现不安全率高,人工审核分析失败原因,还表明SLGuard可减少违规,确立遵循逻辑关系是技能引导智能体的可靠性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08907 2026-07-13 q-fin.TR q-fin.CP 新提交 50%

Herding and Liquidity in Order-Book Markets. I. A Robust Liquidity-Stress Crossover and its Reflexive Mechanism

订单簿市场中的羊群行为与流动性。I. 稳健的流动性压力交叉及其反身机制

Jan Novotny

专题命中 Agent评测 :agent(abstract)

AI总结 研究订单簿市场中羊群行为与流动性,应用布沙尔相图方法于连续双拍卖模型,通过7x6网格定位流动性压力交叉,分析其稳健性及反身机制,还进行双市场分析,发现无方向性跨市场传染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09327 2026-07-13 cs.DS 新提交 50%

Subexponential Algorithm for High Multiplicity Fair Division of Mixed Instances via Stereometry

通过立体测量法对混合实例进行高多重性公平分配的次指数算法

Yuriy Dementiev, Fedor Pribytkov, Danil Sagunov

专题命中 Agent评测 :agent(abstract)

AI总结 研究n个代理对m个分三类的不可分割物品的无嫉妒分配问题,提出首个运行时间为(n·m)^O(√n)的次指数算法,利用几何表示和定理递归分解代理集,还扩展算法处理预固定分配代理以保持无嫉妒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09318 2026-07-13 cs.DC 新提交 50%

EcoKube: Simulating Carbon-Aware Scheduling Policies in Heterogeneous Edge-Cloud Environments

EcoKube:在异构边缘云环境中模拟碳感知调度策略

Gonçalo Ferreira, Shashikant Ilager

专题命中 Agent评测 :workflow(abstract)

AI总结 针对云与边缘计算能源需求增长及碳排放问题,提出EcoKube框架,用于在异构边缘云环境中评估可持续性感知调度策略,含事件驱动模拟器等,通过合成批处理工作负载评估,可在部署前比较策略。

Comments 6 pages, 2 figures. Submitted to EuroSys2026 (TDIS 2026) workshop

Journal ref Proceedings of the 4th International Workshop on Testing Distributed Internet of Things Systems (TDIS 2026), ACM, 2026, pp. 7-12

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09078 2026-07-13 cs.CV cs.RO 新提交 50%

Toward Active Object Detection for UAVs in the Wild: A Large-Scale Dataset, Benchmark and Method

面向野外无人机的主动目标检测:大规模数据集、基准和方法

Tianpeng Liu, Xinhua Jiang, Li Liu, Qinmu Shen, Siwei Tang, Zhen Liu, Yongxiang Liu

专题命中 Agent评测 :agent(abstract)

AI总结 针对无人机主动目标检测缺乏高质量数据集和基准的问题,提出ATRNet-LUDO数据集并建立评估基准。利用联合嵌入预测架构构建世界模型,提出AOD-JEPA,经实验验证其有效性和优越性,推动无人机-地面主动目标检测领域研究。

Comments 18 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏