arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2607.24663 2026-07-28 physics.acc-ph cs.AI cs.IR 新提交 85%

A corrective agentic hybrid RAG and an operations-grounded evaluation for a scientific facility

一种用于科学设施的校正智能混合RAG及基于操作的评估

Rajat Sainju, Dariusz Jarosz, Hairong Shang, Michael Prince, Ryan M. Aydelott, Mathew J. Cherukara, Yine Sun, Michael D. Borland

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 研究针对科学设施操作知识难覆盖问题,提出APS - RAG平台,融合多种检索通道并添加校正智能循环,构建APS - Bench数据集评估。结果显示该平台提升关键信息召回率,交叉编码器重排器作用显著,还发布相关资源,为设施操作提供可信AI辅助工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19038 2026-07-22 cs.CV cs.AI 新提交 85%

FilmWorld: Agentic Novel-to-Film Generation through Dynamic Cinematic World Modeling

FilmWorld:通过动态电影世界建模实现从小说到电影的智能生成

Jialong Zuo, Haotong Zuo, Shiwei Zhang, Xiang Wang, Chen Li, Nong Sang, Changxin Gao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究如何将小说转化为电影,提出将其形式化为动态电影世界建模,构建FilmWorld系统,两组智能体协作实现各阶段,引入FilmEval评估框架,实验证明该系统性能优于现有技术。

Comments Project Page: https://filmworld-ai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16845 2026-07-21 cs.AI 新提交 85%

From Overload to Insights: How AI Agents Can Support Scientists in Analyzing Complex Data

从过载到洞察:人工智能代理如何支持科学家分析复杂数据

Tim Fuchs, Luca Gelisio, Steffen Hauf, Walid Maalej

机构 * European XFEL(欧洲X射线自由电子激光设施)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 针对欧洲XFEL科学家分析复杂数据面临的挑战,设计并评估智能AI系统。采用设计科学研究方法,经多项研究开发并评估两原型,确定关键挑战,得出对AI代理的要求及设计建议,为开发可维护的AI支持提供指导。

Comments Accepted for publication at the 42nd IEEE International Conference on Software Maintenance and Evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13718 2026-07-21 cs.CR cs.AI 版本更新 85%

How Agents Ask for Permission: User Permissions for AI Agents, from Interfaces to Enforcement

智能体如何请求许可:人工智能智能体的用户权限,从接口到执行

Alexandra E. Michael, Franziska Roesner

机构 * University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究人工智能智能体系统中用户级权限处理问题,通过调查21个提案构建分类法,分析五个商业智能体并与文献系统比较,确定主题与空白,为智能体权限系统研究提供参考。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14275 2026-07-17 cs.AI cs.MA 新提交 85%

AI Agents Do Not Fail Alone:The Context Fails First

人工智能智能体并非独自失败:上下文首先失败

Fouad Bousetouane

机构 * The University of Chicago(芝加哥大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究人工智能智能体可靠性,通过ProofAgent-Harness评估上下文七个标准,验证上下文工程质量是智能体可靠性的领先指标,经受控研究表明上下文质量标准可预测行为结果,确立其为预检信号及可审计层。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15001 2026-07-17 hep-lat cs.AI hep-ph 新提交 85%

LQCDMaster: Agentic Scientific Computing for Lattice Quantum Chromodynamics Research

LQCDMaster:用于格点量子色动力学研究的智能科学计算

Haofei Gao, Tingjia Miao, Wenkai Jin, Muhua Zhang, Hanzhang Wang, Jie Ran, Jinxin Tan, Zhentao Zhang, Bo Tang, Leiyi Li, Jun Hua, Xiangyu Jiang, Qi-An Zhang, Siheng Chen, Wei Wang

机构 * School of Physics and Astronomy(物理与天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics(物理学院) SciLand Institute of Quantum Matter(量子物质研究所) Department of Physics(物理系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对格点量子色动力学研究实际应用受限问题,提出LQCDMaster智能体,结合智能规划等技术将自然语言任务转化为计算工作流程。经实验评估,其能精确再现多数任务,大幅缩短实现时间,开创智能科学计算范式,促进相关研究。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11503 2026-07-14 cs.CL 新提交 85%

GEIS: A Generation-Evaluation-Improvement Loop of Agent Skills for Long-Form Article Generation

GEIS:用于长篇文章生成的智能体技能生成-评估-改进循环

Jiale Zhang, Juntao Hu, Zhijian Ou

机构 * Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能实验室) TasiTech Co., Ltd., China(泰赛科技有限公司)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);multi-agent(abstract);分类 cs.CL

AI总结 针对长篇文章生成难题,提出GEIS循环,通过在Tasi Harness中实现文章写作、证据图像收集等技能,经核心写作、成对评估及改进技能,在20个主题实验中提升了PDF质量得分,证明可将其转变为可改进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11423 2026-07-14 cs.CL 新提交 85%

ToFu: A White-Box, Token-Efficient Agent Harness for Researchers

ToFu:面向研究人员的白盒、令牌高效代理工具包

Junhao Ruan, Yuan Ge, Bei Li, Yongjing Yin, Yuchun Fan, Xin Chen, Jingang Wang, Chenglong Wang, Jingbo Zhu, Tong Xiao

机构 * Northeastern University(东北大学) LongCat RSI, Meituan(美团龙猫RSI) NiuTrans Research(小牛翻译研究院)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);agentic(abstract);分类 cs.CL

AI总结 研究提出ToFu这一代理工具包,作为研究助手,以高令牌效率等支持实际研究流程,且能本地部署;作为研究对象,提供白盒工具包供研究人员检查、修改和评估,兼具强大性能与用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10286 2026-07-14 cs.AI cs.MA 新提交 85%

Can Agentic Trading Systems Pay for Their Own Intelligence?

智能交易系统能否为自身智能付费?

Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI(悖论人工智能公司) E Fund Management Co., Ltd(易方达基金管理有限公司) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)) The University of Tokyo(东京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 研究基于LLM的交易系统中智能体能否为自身智能付费的问题,引入TradeLens工具包进行评估,通过多方面分析发现可行性取决于智能到利润的转化,不同模型有不同失败模式,重构了此类交易智能体的评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08495 2026-07-10 cs.CY cs.AI 新提交 85%

The Context Access Divide: Interaction-Level Architecture as a Complementary Dimension of Agentic Inequality

上下文访问鸿沟:交互级架构作为智能不平等的补充维度

Masahiro Fujita

机构 * Faculty of Sociology, Kansai University(京都产业大学社会科学学部)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究智能不平等中未被关注的个体交互层面的上下文访问鸿沟,提出上下文性作为补充维度,用概率模型形式化CAD,分析其在相关架构中的技术基础及对知识工作分层和平台治理的影响。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04433 2026-07-07 cs.IR cs.CL 新提交 85%

Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

自主信息寻求:智能推荐系统路线图

Xinyu Lin, Yashar Deldjoo, Sunhao Dai, Honghui Bao, Xiaopeng Ye, Fatemeh Nazary, Wenjie Wang, Tommaso Di Noia, Jun Xu, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Polytechnic University of Bari(巴里理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.CL

AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00939 2026-07-02 cs.SE quant-ph 新提交 85%

Leveraging LLM-Based Agentic Systems to Generate Quantum Applications for Test Optimization

利用基于LLM的代理系统生成量子应用以优化测试

Ming Tao, Yuechen Li, Tao Yue, Man Zhang, Aitor Arrieta Marcos

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 提出QPipe,一种基于大语言模型的多代理架构,自动将自然语言需求转化为可执行的量子应用工作流,在测试优化问题上实现高编译率和执行率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30755 2026-07-01 cs.CR cs.AI 新提交 85%

Understanding and Evaluating Claw-like Agent Security Through a Computer-Systems Lens

通过计算机系统视角理解与评估爪类智能体安全性

Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) NUS(新加坡国立大学) UC Berkeley(加州大学伯克利分校) UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) KACST(阿卜杜勒阿齐兹国王科技城) UC Santa Cruz(加州大学圣克鲁兹分校) NVIDIA(英伟达) Google DeepMind(谷歌DeepMind) UW Seattle(华盛顿大学西雅图分校) HUMAIN(胡迈因研究所)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 针对爪类AI智能体安全漏洞,提出计算机系统类比,构建SafeClawArena基准测试,评估406个对抗任务,发现最高攻击成功率70%,恶意插件100%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01023 2026-07-01 cs.SE 85%

Large Language Model Evaluation Via Multi AI Agents: Preliminary results

通过多AI代理评估大型语言模型:初步结果

Zeeshan Rasheed, Muhammad Waseem, Kari Systä, Pekka Abrahamsson

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文提出多AI代理模型评估不同LLM性能,通过代码检索与验证,初步结果显示GPT-3.5 Turbo表现更优,未来将引入MBPP基准提升评估精度。

Comments 10 pages, 1 figure

Journal ref ICLR 2024 Workshop on Large Language Model (LLM) Agents, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16492 2026-06-29 cs.CL 版本更新 85%

Check Yourself Before You Wreck Yourself: Selectively Quitting Improves LLM Agent Safety

在自毁之前检查自己:选择性退出提升LLM智能体安全性

Vamshi Krishna Bonagiri, Ponnurangam Kumaragurum, Khanh Nguyen, Benjamin Plaut

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出让LLM智能体在不确定时主动退出,通过ToolEmu框架在12个模型上评估,发现该方法在几乎不降低有用性的情况下显著提升安全性。

Comments Reliable ML and Regulatable ML workshops, Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18191 2026-06-19 cs.AI cs.MA 新提交 85%

DRFLOW: A Deep Research Benchmark for Personalized Workflow Prediction

DRFLOW:用于个性化工作流预测的深度研究基准

Md Tawkat Islam Khondaker, Raymond Li, Muhammad Abdul-Mageed, Laks V. S. Lakshmanan, Issam H. Laradji

机构 * ServiceNow AI Research(ServiceNow人工智能研究)

专题命中 Agent评测 :workflow(title,abstract);agent(abstract,abstract_cn);分类 cs.AI

AI总结 提出DRFLOW基准,评估AI代理从异构源预测个性化工作流的能力,包含5领域100任务,并设计7个诊断指标,实验显示现有代理性能有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22748 2026-06-17 cs.AI 版本更新 85%

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

代理世界建模:基础、能力、定律及更远

Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang, Senqiao Yang, Wei Huang, Yeying Jin, Zhefan Rao, Jinhui Ye, Xinyu Lin, Xichen Zhang, Qisheng Hu, Shuai Yang, Leyang Shen, Wei Chow, Yifei Dong, Fengyi Wu, Quanyu Long, Bin Xia, Shaozuo Yu, Mingkang Zhu, Wenhu Zhang, Jiehui Huang, Haokun Gui, Runyi Li, Chenyu Tang, Dong Huang, Xuhang Chen, Rui Liu, Chengzu Li, Shiyi Du, Xu Huang, Haoxuan Che, Long Chen, Qifeng Chen, Wenya Wang, Wenxuan Zhang, Xiaojuan Qi, Yang Deng, Yanwei Li, Mike Zheng Shou, Zhi-Qi Cheng, See-Kiong Ng, Ziwei Liu, Philip Torr, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Chinese University of Hong Kong(香港中文大学) University of Hong Kong(香港大学) University of Washington(华盛顿大学) University of Tokyo(东京大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院) XGEN Labs(XGEN实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13731 2026-06-15 cs.AI cs.MA 新提交 85%

TwinBI: An Agentic Digital Twin for Efficient Augmented Interactions with Business Intelligence Dashboards

TwinBI:一种用于与商业智能仪表盘高效增强交互的智能数字孪生

Jisoo Jang Wen-Syan Li

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 提出TwinBI框架,通过LLM代理与可执行仪表盘状态耦合,统一对话、操作、语义和溯源,提升多步分析中状态一致性,将精确匹配准确率从43.3%提升至63.3%,超时率从40%降至10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08790 2026-06-09 cs.AI cs.CR cs.MA 新提交 85%

RAILS: Verification-Native Clearing For Agentic Commerce

RAILS: 面向代理商务的验证原生清算

Adrian de Valois-Franklin, Alex Bogdan

机构 * Evolutionairy AI

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 针对自主代理在商务活动中缺乏中立清算机制的问题,提出RAILS协议,通过可靠性评分、记录和清算函数实现验证原生清算,确保财务结算基于充分证据。

Comments 49 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15231 2026-06-05 cs.AI 85%

CangLing-KnowFlow: A Unified Knowledge-and-Flow-fused Agent for Comprehensive Remote Sensing Applications

CangLing-KnowFlow: 一个统一的知识与流程融合代理用于综合遥感应用

Zhengchao Chen, Haoran Wang, Jing Yao, Jianshe Zhang, Pedram Ghamisi, Jun Zhou, Peter M. Atkinson, Bing Zhang

机构 * State Key Laboratory of Remote Sensing and Digital Earth, Aerospace Information Research Institute, Chinese Academy of Sciences(遥感与数字地球国家重点实验室,航天信息研究所,中国科学院) Beijing Tiandi Shijie Technology Co., Ltd.(北京天帝世纪科技有限公司) Faculty of Science and Technology, Lancaster University(兰卡斯特大学科学与技术学院) Faculty of Electrical and Computer Engineering, University of Iceland(冰岛大学电气与计算机工程学院) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍尔茨中心) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出CangLing-KnowFlow,一个融合知识与流程的统一智能代理框架,通过整合过程知识库、动态工作流调整和进化记忆模块,解决遥感数据处理中任务特定、缺乏统一框架的问题,并在KnowFlow-Bench基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01961 2026-06-04 cs.AI 85%

AutoMedBench: Towards Medical AutoResearch with Agentic AI Models

AutoMedBench: 迈向基于智能体AI模型的医学自动研究

Junqi Liu, Selena Song, Yuhan Wang, Jiawei Mao, Hardy Chen, Xiaoke Huang, Tianhao Qi, Pengfei Guo, Yucheng Tang, Yufan He, Can Zhao, Andriy Myronenko, Dong Yang, Daguang Xu, Yuyin Zhou

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) NVIDIA

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);workflow(abstract)

AI总结 提出AutoMedBench,一个工作流感知的基准,通过五阶段工作流(计划、设置、验证、推理、提交)评估自主智能体在医学AI研究中的行为,发现验证阶段最弱而设置阶段最强,验证和提交失败占主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02644 2026-06-03 cs.CR cs.AI 85%

A New Framework for Cybersecurity Refusals in AI Agents

AI代理中网络安全拒绝的新框架

Eliot Krzysztof Jones, Mateusz Dziemian, Matt Fredrikson, J Zico Kolter

机构 * Gray Swan Gray Swan AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出首个针对AI代理在进攻性安全场景中建立拒绝边界的框架,包括拒绝原则、任务分类和评估方法,并发现8个前沿模型中6个拒绝率接近零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01434 2026-06-02 cs.CL 85%

DrugClaw and DrugAudit: A Primary-Source-Grounded Agent and Authority-Aware Benchmark for Drug-Information Question Answering

DrugClaw与DrugAudit:基于原始来源的智能体与权威感知基准用于药物信息问答

Qing Wang, Bo Li, Jialu Liang, Daling Shi, Bob Zhang, Qianqian Song

机构 * Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学健康结局与生物医学信息学系,医学院) PAMI Research Group, Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院计算机与信息科学系PAMI研究组)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);multi-agent(abstract);分类 cs.CL

AI总结 提出多智能体检索增强系统DrugClaw,通过反射驱动状态机查询药物注册与药物警戒知识库,并构建含3772条权威感知基准DrugAudit,在多个基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28683 2026-05-28 cs.AI 85%

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

VeriTrip: 面向非结构化网络语料的旅行规划智能体可验证基准

Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学技术大学网络安全学院) Amap, Alibaba Group(阿里巴巴集团阿地图) NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所神经信息处理实验室及机器智能研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出VeriTrip基准,通过多模态检索库和可验证知识库,评估智能体在非结构化网络语料中基于证据推理的旅行规划能力,揭示检索-推理权衡问题。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19149 2026-05-20 cs.CL cs.CR 85%

Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents

Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents

Rishi Jha, Harold Triedman, Arkaprabha Bhattacharya, Vitaly Shmatikov

机构 * Department of Computer Science(计算机科学系)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.CL

AI总结 研究探讨了代理在遇到错误时可能发生意外崩溃现象,通过实验发现64.7%的代理在遇到模拟错误时会出现不同程度的不安全行为,且这些行为未被现有安全标准所覆盖。

Comments 32 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18144 2026-05-19 cs.AI 85%

Evidence-Grounded Frontier Mapping and Agentic Hypothesis Generation in Nanomedicine

基于证据的前沿映射与代理假设生成在纳米医学中

Christiaan G. A. Viviers, Koen de Bruin, Mirre M. Trines, Ayla M. Hokke, Roy van der Meel, Avi Schroeder, Twan Lammers, Willem J. M. Mulder, Fons van der Sommen

机构 * ARIA Lab, Signal Processing Systems, Department of Electrical Engineering, Eindhoven University of Technology(ARIA实验室,信号处理系统,电气工程系,埃因霍温理工大学) Laboratory of Chemical Biology, Department of Biomedical Engineering, Eindhoven University of Technology(化学生物学实验室,生物医学工程系,埃因霍温理工大学) The Louis Family Laboratory for Targeted Drug Delivery and Personalized Medicine Technologies, Department of Chemical Engineering, Technion - Israel Institute of Technology(定向药物输送与个性化医学技术实验室,化学工程系,技术离子-以色列理工学院) Department of Nanomedicine and Theranostics, Institute for Experimental Molecular Imaging (ExMI), RWTH Aachen University Hospital(纳米医学与诊疗学系,实验分子成像研究所(ExMI),亚琛工业大学医院) Department of Internal Medicine and Radboud Center for Infectious Diseases (RCI), Radboud University Medical Center(内科学系和Radboud感染疾病中心(RCI),Radboud大学医学中心)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究提出了一种结合文章嵌入、相似性图分析、稀疏前沿提取、结构化证据包检索和审计过的大型语言模型(LLM)工作流的系统pArticleMap,用于支持纳米医学研究方向的选择和假设生成,通过生成和评分基于引用的假设,实现了证据导向的研究辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16436 2026-05-19 cs.CR cs.AI 85%

The End of Trust: How Agentic AI Breaks Security Assumptions

信任的终结:如何代理AI打破安全假设

Osama Zafar, Alexander Nemecek, Erman Ayday

机构 * Dept. of Computer and Data Sciences(计算机与数据科学系) Case Western Reserve University(凯斯西储大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 代理AI打破了传统安全假设,允许高保真的定制欺骗在大众市场层面实现。本文提出'无限冒充者'攻击模型,并探讨从验证行为转向评估行动的安全范式转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15625 2026-05-18 cs.AI cond-mat.soft 85%

ColPackAgent: Agent-Skill-Guided Hard-Particle Monte Carlo Workflows for Colloidal Packing

ColPackAgent:基于代理技能的硬粒子蒙特卡罗工作流程用于胶体堆积

Lijie Ding, Changwoo Do

机构 * Neutron Scattering Division, Oak Ridge National Laboratory, Oak Ridge, TN 37831, USA(奥克勒德国家实验室中子散射部)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 ColPackAgent通过MCP工具服务器和代理技能实现胶体堆积模拟的自主工作流程,展示了如何利用LLM代理执行模拟任务并评估不同模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26100 2026-05-15 cs.AI 85%

AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models

AgenticEval: 向大型语言模型的代理和自演化安全评估迈进

Yixu Wang, Xin Wang, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学) East China Normal University(华东师范大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14002 2026-05-15 cs.AI 85%

PolitNuggets: Benchmarking Agentic Discovery of Long-Tail Political Facts

PolitNuggets: 评估代理发现长尾政治事实

Yifei Zhu

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI

AI总结 PolitNuggets通过构建400位全球精英的政治传记,涵盖10000多个政治事实,评估代理信息合成能力,发现当前系统在细节处理和效率上存在显著差异。

Comments 24 pages, 7 figues, accpeted in The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏