arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3172 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 558 篇

2605.16551 2026-06-09 cs.CL 版本更新 79%

PQR: A Framework to Generate Diverse and Realistic User Queries that Elicit QA Agent Failures

PQR:一个生成多样化且逼真用户查询的框架,以引发问答代理失败

Yunan Lu, Luigi Liu, Omar Yahia, Arpit Sharma, Zhou Yu

机构 * Columbia University(哥伦比亚大学) University of California San Diego(加州大学圣地亚哥分校) Walmart(沃尔玛)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 PQR框架通过迭代交互生成多样化且逼真的用户查询,以发现问答代理的失败案例,其方法比现有方法更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19662 2026-06-09 cs.AI cs.CV 版本更新 79%

FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks

FieldWorkArena:面向真实作业任务的代理AI基准测试

Jun Takahashi, Atsunori Moteki, Akiyoshi Uchida, Shoichi Masui, Fan Yang, Kanji Uchino, Yueqi Song, Yonatan Bisk, Graham Neubig, Ikuo Kusajima, Yasuto Watanabe, Hiroyuki Ishida, Koki Nakagawa, Shan Jiang

机构 * Fujitsu Limited(富士通株式会社) Fujitsu Research of America(富士通美国研究部) Carnegie Mellon University(卡内基梅隆大学) Master’s Student, The University of Tokyo(东京大学硕士研究生) Agent Research Collective(代理研究集体)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出FieldWorkArena,用于评估代理AI在真实制造业和零售环境中的性能,通过现场采集的数据和实地访谈设计任务,验证多模态大语言模型的评估可行性。

Comments 27 pages, 10 figures, 7 tables [ICPR 2026 Accepted] Changes from previous version: added supplemental material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03889 2026-06-08 cs.CL 版本更新 79%

RealClawBench: Live OpenClaw Benchmarks from Real Developer-Agent Sessions

RealClawBench: 来自真实开发者-智能体会话的实时OpenClaw基准测试

Zongwei Lv, Zhewen Tan, Yaoming Li, Yilun Yao, Yuxuan Tian, Lin Sun, Xiangzheng Zhang, Weihong Lin, Tong Yang, Guangxiang Zhao

机构 * Peking University(北京大学) Qiyuan Tech(启元科技)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 针对现有基准缺乏真实性的问题,提出RealClawBench框架,通过重构执行环境和确定性可验证评分器,将真实OpenClaw会话转化为可复现、自动评分的任务,评估14个模型后最佳仅解决65.8%任务,揭示了开发者-智能体工作负载上的巨大提升空间。

Comments 19 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27853 2026-08-10 cs.CL cs.AI q-fin.CP 版本更新 79%

FinanceHarness: Autonomous Financial Deep Research Framework

FinanceHarness:自主金融深度研究框架

Yijia Xiao, Rujun Han, Yanfei Chen, Zifeng Wang, Ke Jiang, Zhongying CuiZhu, Vishy Tirumalashetty, Wei Wang, Burak Gokturk, Tomas Pfister, Chen-Yu Lee

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 FinanceHarness是一款端到端自动化金融深度研究的自主框架,结合自主智能体与金融专用工具,在FinanceGym基准上大幅提升了金融研究评分规则得分。

Comments FinanceHarness available at https://github.com/Yijia-Xiao/FinanceHarness

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22148 2026-08-10 cs.AI cs.CL 版本更新 79%

Ratchet: How Reliable Must an LLM Judge Be to Retire a Skill?

Ratchet:一种最小化卫生的自演化LLM代理技能库

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS 生成式人工智能创新中心) HSBC Holdings Plc.(汇丰控股有限公司) HSBC Technology Center, China(汇丰技术中心,中国)

专题命中 Agent评测 :agent(abstract,abstract_cn);agentic(abstract_cn);分类 cs.AI、cs.CL

AI总结 本文提出Ratchet,一种单代理循环,使冻结的LLM能够自行编写、检索、整理和淘汰其自然语言技能,通过整合四个卫生机制提升技能库的生命周期管理,从而在MBPP+ hard-100数据集上显著提升性能。

Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11354 2026-07-01 cs.AI cs.CL 版本更新 79%

ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences

ReplicatorBench:用于社会科学和行为科学中可复制性评估的LLM代理基准测试

Bang Nguyen, Dominik Soós, Qian Ma, Rochana R. Obadage, Zack Ranjan, Sai Koneru, Timothy M. Errington, Shakhlo Nematova, Sarah Rajtmajer, Jian Wu, Meng Jiang

机构 * University of Notre Dame(圣母大学) Old Dominion University(老道明大学) Pennsylvania State University(宾夕法尼亚州立大学) Independent Researcher(独立研究员) Uppsala University(乌普萨拉大学) Center for Open Science(开放科学中心)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ReplicatorBench,一个端到端的基准测试,用于评估AI代理在可复制性研究中的能力,涵盖数据提取、实验设计与结果解释三个阶段,并开发了ReplicatorAgent框架以评估不同LLM和编程语言的性能。

Comments Accepted to KDD 2026 AI4Sciences Track, Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19359 2026-08-18 econ.TH cs.GT 版本更新 78%

How damaging is zero-sum thinking to an agent's interests when the world is positive-sum?

零和思维对代理利益的损害在正和世界中有多大?

Shaun Hargreaves Heap, Mehmet Mars Seven

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究零和决策规则(maximin和minimax)在正和战略环境中的影响,发现maximin在某些情况下比纳什均衡更有利于代理利益,且两者在游戏类别上具有相同的数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09546 2026-08-18 q-fin.TR cs.SI 版本更新 78%

A Reflective LLM-based Agent to Guide Zero-shot Cryptocurrency Trading

一种用于指导零样本加密货币交易的反思型大语言模型智能体

Yuan Li, Bingqiao Luo, Qian Wang, Nuo Chen, Xu Liu, Bingsheng He

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究开发了结合链上链下数据分析与反思机制的LLM智能体CryptoTrade,拓展了LLM在加密货币交易的应用,建立了相关策略基准,其收益表现优于传统策略和时间序列基线。

Comments Published at EMNLP 2024 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18852 2026-08-14 cs.LG cs.AI cs.CL 版本更新 78%

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择

Qinwu Xu, Zhuoheng Li, Jessie Salas

机构 * Meta AI

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03565 2026-08-05 cs.IR 版本更新 78%

Skill Is Not Document: Query-Conditioned Compatibility for LLM Agent Skill Routing

技能不是文档:面向LLM智能体技能路由的查询条件基准与两阶段检索器

Zifei Wang, Wei Wen, Qiang Ji, Keyu Chen, Ruizhi Qiao, Xing Sun

专题命中 Agent评测 :agent(title,abstract)

AI总结 针对LLM智能体技能路由中技能兼容性被忽视的问题,提出Reject-as-Resource Retriever (R3)框架,构建双语基准R3-Skill,并设计两阶段检索系统(R3-Embedding + R3-Reranker)显式建模技能兼容性,显著提升检索效果。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10265 2026-07-28 cs.DB 版本更新 78%

TGMS: An Agent-Native Bi-Temporal Graph Management System

TGMS:一种原生代理双时态图管理系统

Xiaofei Zhang

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究针对时态图问题中LLM代理常失败的情况,提出双时态属性图管理系统TGMS,将13个运算符作为代理工具,LLM规划调用,系统计算,能分离有效时间与事务时间,在基准测试中表现优异,开源代码等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10535 2026-07-23 cs.HC 版本更新 78%

Exploring the Interplay Between Voice, Personality, and Gender in Human-Agent Interactions

探索语音、个性与性别在人机交互中的相互作用

Kai Alexander Hackney, Lucas Guarenti Zangari, Jhonathan Sora-Cardenas, Emmanuel Munoz, Sterling R. Kalogeras, Betsy DiSalvo, Pedro Guillermo Feijoo-Garcia

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究探讨用户能否通过语音识别人工代理的外向性,并分析感知个性与用户-代理同步性之间的关系,发现女性语音在区分外向性上更有效,而男性语音则不一致。

Journal ref https://www.frontiersin.org/articles/10.3389/fcomp.2026.1855830

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23212 2026-07-08 cond-mat.dis-nn cond-mat.stat-mech nlin.AO 版本更新 78%

Replication and Information Extraction in a Minimal Agent-Environment Model

最小化智能体 - 环境模型中的复制与信息提取

Sebastiano Ariosto, Jerome Garnier-Brun, Luca Saglietti, Davide Straziota

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究在无明确指导或奖励下从数据提取信息的问题,通过对分类规则施加简单性偏差,利用统计力学工具刻画自发学习相变,扩展到智能体群体后发现交互可重塑学习相边界,开辟仅通过标签交换的分散学习途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15917 2026-07-01 cs.CV 版本更新 78%

Making Image Editing Easier via Adaptive Task Reformulation with Agentic Executions

通过具有代理执行的自适应任务重构使图像编辑更易于实现

Bo Zhao, Kairui Guo, Runnan Du, Haiyang Sun, Pengshan Wang, Huan Yang, Kun Gai, Yixin Cao, Wei Ji

机构 * Nanjing University(南京大学) Beijing Institute of Technology(北京理工大学) College of Artificial Intelligence, China University of Petroleum (Beijing)(中国石油大学(北京)人工智能学院) Beijing University of Posts and Telecommunications(北京邮电大学) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 本文提出通过自适应任务重构框架提升图像编辑性能,通过代理分析和反馈优化任务描述,改进编辑效果,尤其在复杂案例中表现显著。

Comments 9pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04160 2026-06-29 cs.GT 版本更新 78%

Representation theorems for actual and alpha powers over two-agent general concurrent game frames

关于双智能体一般并发博弈框架中实际权力和α权力的表示定理

Zixuan Chen, Fengkui Ju, Thomas Agotnes

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文针对双智能体一般并发博弈框架,证明了实际权力和α权力的八种类型分别可由八类邻域框架表示,推广了已有结果,并指出双智能体实际权力刻画无法推广到任意有限智能体集合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03636 2026-06-15 cs.GT 版本更新 78%

Causal Mirage Equilibrium in Agentic Machine Intelligence

生成式机器智能中的因果幻象均衡

Hamidou Tembine

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 针对生成式机器智能中语义表征与物理现实脱钩的问题,提出风险敏感平均场型因果幻象均衡(CME),证明其存在性并揭示内生强化主导时非因果状态的稳定分岔。

Comments 10 pages, 1 figure. References double-checked manually

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10546 2026-06-11 cs.MA 版本更新 78%

SkillAxe: Sharpening LLM-Authored Agent Skills Through Evaluation-Guided Self-Refinement

SkillAxe: 通过评估引导的自我精炼提升LLM编写的智能体技能

Srishti Gautam, Arjun Radhakrishna, Sumit Gulwani

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出SkillAxe框架,通过无监督评估引导LLM自我诊断和精炼技能,在SkillsBench上提升通过率28%,缩小与人类技能的差距47-67%。

Comments 9 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22097 2026-06-09 cs.SE cs.AI cs.CL cs.CR 版本更新 78%

SecureVibeBench: Benchmarking Secure Vibe Coding of AI Agents via Reconstructing Vulnerability-Introducing Scenarios

SecureVibeBench: 通过重建引入漏洞的场景来基准测试AI代理的安全振动编码

Junkai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang, Haoye Tian, Yikun Li, Zhenhao Li, Xin Zhou, Xing Hu, David Lo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :AI agent(title);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出SecureVibeBench,一个包含105个C/C++安全编码任务的基准测试,旨在评估AI代理在真实场景中生成安全代码的能力,发现现有方法在评估人类与AI代理对比时的不足。

Comments ACL 2026 Main Conference. Our code and data are on https://github.com/iCSawyer/SecureVibeBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16095 2026-06-09 cs.HC 版本更新 78%

GroupEnvoy: A Conversational Agent Speaking for the Outgroup to Foster Intergroup Relations

GroupEnvoy: 代表外群体发言以促进群体间关系的对话代理

Koken Hata, Rintaro Chujo, Reina Takamatsu, Wenzhen Xu, Yukino Baba

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出基于群体间接触理论的文本对话代理GroupEnvoy,通过在内群体讨论中代表外群体视角,并评估其相比被动暴露在减少焦虑、提升观点采择等方面的效果。

Comments 18 pages, 5 figures, accepted to ACM CUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12104 2026-08-18 cs.CY cs.AI 版本更新 77%

No One to Blame: A Framework of Constitutive AI Unaccountability

无人可追责:构成型AI不可问责性的框架

Long Hoang Nguyen, Eva Späthe, Sebastian Lins, Ali Sunyaev

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 针对自主AI系统带来的问责挑战,该研究提出构成型AI不可问责性概念,构建诊断框架,在OpenClaw中检测到多数相关条件,为识别AI问责缺口提供实用工具。

Comments Extended version with appendix; final version to appear in the Proceedings of AAAI/ACM AIES 2026; v2: text encoding fix for author name, no content changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03799 2026-08-14 cs.CL 版本更新 77%

Natural Language Processing: A Comprehensive Practical Guide from Tokenisation to RLHF

自然语言处理:从分词到RLHF的全面实用指南

Mullosharaf K. Arabov

机构 * KAZAN (VOLGA REGION) FEDERAL UNIVERSITY INSTITUTE OF COMPUTATIONAL MATHEMATICS AND INFORMATION TECHNOLOGIES(卡赞(伏尔加地区)联邦大学计算数学与信息科技学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文系统指导现代NLP全流程,涵盖分词、向量化、大语言模型微调、检索增强生成及人类反馈强化学习,强调低资源语言处理与开源模型应用。

Comments 136 pages, 12 practical works, preprint. Textbook for senior undergraduates and graduate students. Original contributions on low-resource languages (Tajik, Tatar and other). Companion repository available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01039 2026-08-13 cs.CR cs.AI 版本更新 77%

Evaluation and Hardening of LLM System Instructions Against Extraction via Encoding Attacks

用于评估和加固LLM系统指令对抗编码攻击的自动化框架

Anubhab Sahu, Diptisha Samanta, Reza Soosahabi

机构 * Keysight Technologies

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出自动化框架评估LLM系统指令在对抗编码攻击时的保密性,通过四个模型和46条指令测试发现结构化序列化攻击成功率高,提出基于Chain-of-Thought的缓解策略。

Comments An earlier version of this manuscript will appear in the proceedings of IEEE Cyber-AI 2026 Conference. Project source code is available at https://github.com/Keysight/LLM-EncodeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07161 2026-08-03 cs.AI 版本更新 77%

SREGym: A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios

SREGym:面向AI SRE代理的实时基准测试平台,具有高保真的故障场景

Jackson Clark, Yiming Su, Saad Mohammad Rafid Pial, Yifang Tian, Lily Gniedziejko, Hans-Arno Jacobsen, Yinfang Chen, Tianyin Xu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

专题命中 Agent评测 :agentic(abstract,abstract_cn);AI agent(abstract);分类 cs.AI

AI总结 SREGym通过模拟真实云原生系统栈中的高保真故障场景,为AI SRE代理提供实时基准测试环境,包含90个真实挑战性SRE问题,评估前沿代理能力差异显著,可达40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22952 2026-07-24 cs.SE 版本更新 77%

Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering

筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究

Yunpeng Xiong, Ting Zhang

专题命中 Agent评测 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE

AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。

Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11019 2026-07-15 cs.AI 版本更新 77%

QwenPaw-Data: Bridging Facts, Methodology, and Execution for Autonomous Enterprise Data Analytics

QwenPaw-数据:为自主企业数据分析搭建事实、方法与执行的桥梁

Tianjing Zeng, Yuntao Hong, Zhongjun Ding, Dandan Liu, Yinan Mei, Yunxiang Su, Yiming Wang, Xiaojian Zhang, Jingyu Zhu, Junhao Zhu, Zhuowen Liang, Jiazhen Peng, Lianggui Weng, Zhihao Ding, Kerui Yi, Qifeng Wang, Rong Zhu, Bolin Ding, Liyu Mou, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究针对企业数据分析在开放环境的特性,提出QwenPaw-Data系统,通过整合异构资产、转化自然语言请求为工作流,架构含三个协作子系统,实验证明该系统提升了数据访问和分析质量,为企业数据智能体提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19576 2026-07-30 cs.AI cs.CL cs.SE 版本更新 76%

Library Drift: Diagnosing and Fixing a Silent Failure Mode in Self-Evolving LLM Skill Libraries

库漂移:在自我演化的LLM技能库中诊断和修复一种无声的失败模式

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE;agentic(comments)

AI总结 本文研究了自我演化的LLM技能库中的一种无声失败模式——库漂移,通过可重复触发实验、细粒度诊断和验证修复方法,揭示了技能积累无序导致检索退化、假阳性注入和性能停滞的问题,并提出了一种经过验证的修复方案,显著提升了技能库的性能。

Comments Accepted to the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN@ICML 2026), Seoul, South Korea. https://github.com/amazon-science/Self-Evolving-Agents-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04772 2026-08-19 cs.CL cs.AI 版本更新 76%

Guideline-as-Oracle: Zero-Annotation Training of an Ophthalmic Telephone Triage Agent

以指南为神谕:眼科电话分诊智能体的零标注训练

Chenyu Wang, Yi Liu, Baoqing Li, Min Tu, Diping Song

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 本研究提出以指南为神谕(GAO)方法,将美国眼科学会指南转化为训练监督信号,零标注训练出GAO-Triage智能体,大幅提升眼科电话分诊的一致性与紧急案例召回率,且性能优于7个通用系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10687 2026-07-03 cs.MA cs.AI cs.CL cs.GT 版本更新 76%

Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

谁获得奖励 & 谁受到责备?面向多LLM智能体的评估对齐训练信号

Chih-Hsuan, Yang, Tanwi Mallick, Le Chen, Krishnan Raghavan, Amal Gueroudji, Ian T. Foster, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(abstract,comments);multi-agent(abstract);分类 cs.AI、cs.CL;planning(comments)

AI总结 提出一个理论框架,结合合作博弈归因与过程奖励建模,将系统级评估转化为智能体信用和消息级信号,用于多LLM智能体训练。

Comments Accepted at the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning (LAW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12147 2026-08-10 cs.SE cs.AI cs.CL 版本更新 75%

From Plan to Action: How Well Do Agents Follow the Plan?

评估自主编程代理中的计划合规性

Shuyang Liu, Saman Dehghan, Jatin Ganhotra, Martin Hirzel, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM(IBM公司)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本文系统分析了编程代理在执行任务时对计划的遵循情况,通过16991条轨迹评估不同计划变体的影响,发现计划提醒能提高任务成功率,但不恰当的计划补充可能降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01153 2026-07-30 cs.CL cs.AI cs.SE 版本更新 75%

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准

Brett Reynolds

机构 * Humber Polytechnic(汉博理工学院) University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。

Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository

详情

展开后加载摘要…

URL PDF HTML 收藏