arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-11 至 2026-05-11 共收录 199 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 19 篇

2605.06716 2026-05-11 cs.AI cs.CL 84%

From Storage to Experience: A Survey on the Evolution of LLM Agent Memory Mechanisms

从存储到经验:LLM代理记忆机制演化的综述

Jinghao Luo, Yuchen Tian, Chuxue Cao, Ziyang Luo, Hongzhan Lin, Kaixin Li, Chuyi Kong, Ruichao Yang, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) South China Normal University(南方中国师范大学) Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Science and Technology Beijing(北京科技大学)

专题命中 记忆与上下文管理 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文综述了LLM代理记忆机制的发展,提出三阶段框架,分析长程一致性、动态环境挑战和持续学习目标,探讨前瞻性探索与跨轨迹抽象等前沿机制,为下一代LLM代理设计提供指导。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07242 2026-05-11 cs.AI cs.CL 81%

MEMOREPAIR: Barrier-First Cascade Repair in Agentic Memory

MEMOREPAIR:代理记忆中的障碍优先级级修复

Yang Zhao, Chengxiao Dai, Mengying Kou, Yue Xiu

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出MEMOREPAIR方法,通过障碍优先级级修复机制解决代理记忆中的级联更新问题,有效减少无效记忆暴露并降低修复成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05583 2026-05-11 cs.AI cs.CL 81%

Belief Memory: Agent Memory Under Partial Observability

信念记忆:在部分可观测性下的智能体记忆

Junfeng Liao, Qizhou Wang, Jianing Zhu, Bo Du, Rui Yan, Xiuying Chen

机构 * MBZUAI RIKEN AIP UT Austin Wuhan University(武汉大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出BeliefMem,通过保留多个候选结论及其概率,解决智能体在部分可观测环境中记忆的不确定性问题,实验证明其在LoCoMo和ALFWorld基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07277 2026-05-11 cs.LG cs.AI 81%

Android Coach: Improve Online Agentic Training Efficiency with Single State Multiple Actions

Android Coach: 通过单状态多动作提升在线代理训练效率

Guo Gan, Yuxuan Ding, Cong Chen, Yuwei Ren, Yin Huang, Hong Zhou

机构 * Zhejiang University(浙江大学) Qualcomm AI Research(高通人工智能研究)

专题命中 记忆与上下文管理 :agentic(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Android Coach框架,通过单状态多动作方法提升在线强化学习效率,实验显示在AndroidLab和AndroidWorld上成功率提升7.5%和8.3%,训练效率比PPO和GRPO高1.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14786 2026-05-11 cs.AI 79%

CogEvolution: A Human-like Generative Educational Agent to Simulate Student's Cognitive Evolution

CogEvolution: 一种模拟学生认知演化的类人生成教育代理

Wei Zhang, Yihang Cheng, Zhirong Ye, Kezhen Huang

机构 * Faculty of Artificial Intelligence in Education, Central China Normal University, Wuhan, Hubei, China(教育人工智能学院,中国中央师范大学,武汉,湖北,中国) National Engineering Research Center for Educational Big Data, Central China Normal University, Wuhan, Hubei, China(教育大数据国家工程研究中心,中国中央师范大学,武汉,湖北,中国) Central China Normal University Wollongong Joint Institute, Central China Normal University, Wuhan, Hubei, China(中国中央师范大学沃林顿联合学院,中国中央师范大学,武汉,湖北,中国)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 本文提出CogEvolution,通过构建认知深度感知器、基于IRT的记忆检索方法和基于进化算法的动态认知更新机制,模拟学生认知演化过程,提升教育代理的可解释性。

Comments none

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15356 2026-05-11 eess.IV cs.AI 79%

Q-Probe: Scaling Image Quality Assessment to High Resolution via Context-Aware Agentic Probing

Q-Probe:通过上下文感知代理探测扩展图像质量评估至高分辨率

Xiang Li, Xueheng Li, Yu Wang, Xuanhua He, Zhangchi Hu, Weiwei Yu, Chengjun Xie

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Institute of Intelligent Machines, Chinese Academy of Sciences(中国科学院智能 Machines 研究所)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI

AI总结 Q-Probe通过上下文感知探测方法解决高分辨率图像质量评估中的局部退化捕捉问题,提出Vista-Bench基准和三阶段训练框架,实现高分辨率下的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08060 2026-05-11 cs.CL cs.AI cs.GT cs.MA 73%

The Memory Curse: How Expanded Recall Erodes Cooperative Intent in LLM Agents

记忆诅咒:扩展回忆如何在LLM代理中侵蚀合作意图

Jiayuan Liu, Tianqin Li, Shiyi Du, Xin Luo, Haoxuan Zeng, Emanuel Tewolde, Tai Sing Lee, Tonghan Wang, Carl Kingsford, Vincent Conitzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Foundations of Cooperative AI Lab (FOCAL)(合作人工智能基础实验室) University of Michigan(密歇根大学) Harvard University(哈佛大学)

专题命中 记忆与上下文管理 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究发现扩展回忆会系统性地削弱多代理社会困境中的合作意图,通过三种分析揭示记忆内容对合作的影响,证明记忆是影响多代理行为的主动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06731 2026-05-11 cs.CR cs.CL cs.LG 73%

When Routine Chats Turn Toxic: Unintended Long-Term State Poisoning in Personalized Agents

当常规聊天变得有毒:个性化代理中无意的长期状态污染

Xiaoyu Xu, Minxin Du, Qipeng Xie, Haobin Ke, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology, HKUST (Guangzhou)(香港科学与技术大学(广州))

专题命中 记忆与上下文管理 :agent(abstract);tool-use(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了个性化代理中因常规交互导致的长期状态污染问题,提出ULSPB基准和Harm Score指标,并通过StateGuard防御机制降低安全风险。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07442 2026-05-11 cs.LG 70%

GameGen-Verifier: Parallel Keypoint-Based Verification for LLM-Generated Games via Runtime State Injection

GameGen-Verifier:通过运行时状态注入实现LLM生成游戏的并行关键点验证

Chaobo Jia, Ruipeng Wan, Ting Sun, Weihao Tan, Borui Wan, Yuxuan Tong, Guangming Sheng, Hong Xu

机构 * CUHK(香港中文大学) HUST(华中科技大学) Lionrock AI Lab(Lionrock人工智能实验室) NTU(国立新加坡大学) HKU(香港大学)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出GameGen-Verifier,通过分解规范为可验证的关键点,实现LLM生成游戏的自动化验证,提升验证准确率并减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03736 2026-05-11 cs.AI cs.CL cs.LG 67%

Are LLM Agents Behaviorally Coherent? Latent Profiles for Social Simulation

LLM代理行为是否一致?用于社交模拟的潜在特征

James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(明尼苏达大学计算机科学与工程系) Department of African American & African Studies, University of Minnesota(明尼苏达大学非裔美国人与非洲研究系) Department of Sociology, University of Chicago(芝加哥大学社会学系)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文研究LLM代理在不同实验环境下是否保持经验一致性,通过揭示代理的潜在特征来检验其行为一致性,发现不同模型家族和大小的LLM存在显著不一致。

Comments 25 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06841 2026-05-11 cs.AI cs.LG 62%

AGWM: Affordance-Grounded World Models for Environments with Compositional Prerequisites

AGWM:基于 affordance 的世界模型用于具有组合前提条件的环境

Qinshi Zhang, Weipeng Deng, Zhihan Jiang, Jiaming Qu, Qianren Li, Weitao Xu, Ray LC

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Hong Kong(香港大学) Columbia University(哥伦比亚大学) Amazon(亚马逊) City University of Hong Kong(香港城市大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 AGWM 模型,通过学习抽象 affordance 结构来跟踪动作的动态可执行性,以解决传统世界模型在多步预测中的误差累积问题。

Comments 16 pages, 3 figures, 4 tables. Appendix on pages 11-16 (main text is self-contained)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24372 2026-05-11 cs.CL cs.AI cs.NE 62%

SeaEvo: Advancing Algorithm Discovery with Strategy Space Evolution

SeaEvo:通过策略空间进化推进算法发现

Sichun Luo, Yi Huang, Haochen Luo, Fengyuan Liu, Guanzhi Deng, Lei Li, Qinghua Yao, Zefa Hu, Junlan Feng, Qi Liu

机构 * The University of Hong Kong(香港大学) JIUTIAN Research, China Mobile(钧天研究院,中国移动) City University of Hong Kong(城市大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 SeaEvo通过策略空间进化层,将语言级策略推理转化为群体级进化状态,提升LLM引导的程序搜索效果,实现算法发现、系统优化和智能体设计任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15294 2026-05-11 cs.AI cs.CL cs.MA 62%

A Multi-Memory Segment System for Generating High-Quality Long-Term Memory Content in Agents

一种多记忆段系统用于生成高质量的长期记忆内容在智能体中

Gaoke Zhang, Bo Wang, Yunlong Ma, Dongming Zhao, Zifei Yu

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出多记忆段系统MMS,通过多维度生成高质量长期记忆内容,提升智能体的回忆和响应质量,实验验证了其有效性。

Comments The content has been significantly revised and the author has also changed. Therefore, the paper will be withdrawn for revision and then uploaded after the completion of the modifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15719 2026-05-11 cs.AI 57%

Harnessing Pre-Resolution Signals for Future Prediction Agents

利用预决议信号为未来预测代理

Chuyang Wei, Maohang Gao, Zhixin Han, Kefei Chen, Yu Zhuang, Haoxiang Guan, Yanzhi Zhang, Yilin Cheng, Xiren Zhou, Huanhuan Chen, Jian Li, Jiyan He, Yu Shi, Yitong Duan, Shuxin Zheng

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) IIIS, Tsinghua University(清华大学人工智能研究院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出通过预决议信号提升未来预测性能,通过Milkyway代理在未决问题多次回顾中提取信息,改进预测并增强后续准确性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06997 2026-05-11 cs.LG 57%

Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators

Echo:无KV缓存的关联回忆与谱Koopman算子

Anupama Sridhar, Alexander Johansen

机构 * Stanford University(斯坦福大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.LG

AI总结 Echo通过谱Koopman算子实现无KV缓存的关联回忆,解决了传统Transformer的内存瓶颈问题,在多个基准测试中展现出卓越的检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25610 2026-05-11 quant-ph 50%

Optimizing ground state preparation protocols with autoresearch

利用自研算法优化基态准备协议

Luis Mantilla Calderón, Jérôme F. Gonthier, Ignacio Gustin, Varinia Bernales, Alán Aspuru-Guzik

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究如何利用基于人工智能的语言模型编码代理优化不同基态准备和采样协议的超参数选择,通过在简单自旋模型和分子哈密顿量上验证,展示编码代理在受限计算预算下改进能量代理的能力。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07238 2026-05-11 cs.DC 50%

FATE: Future-State-Aware Scheduling for Heterogeneous LLM Workflows

FATE:面向异构大语言模型工作流的未来状态感知调度

Zirui Huang, Yi-Xiang Hu, Feng Wu, Xiangyang Li

专题命中 记忆与上下文管理 :workflow(abstract)

AI总结 FATE通过结合前沿规划、前瞻性候选评分和多设备分片执行,优化异构LLM工作流的未来状态,降低延迟并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23688 2026-05-11 physics.soc-ph nlin.AO 50%

Non-Markovian Collective Motion from Self-Regulated Perceptual Dynamics

非马尔可夫集体运动来自自我调节的感知动力学

Jyotiranjan Beuria

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一个双时间尺度模型,通过快感知寄存器和慢调节变量实现非马尔可夫集体运动,揭示了局部反馈如何影响集体秩序和调节强度。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 30 篇

2508.16571 2026-05-11 cs.AI cs.IR cs.MA 90%

LLM-Based Agents for Competitive Landscape Mapping in Drug Asset Due Diligence

基于大语言模型的竞品映射 agent 在药物资产尽调中的应用

Vlad Vinogradov, Alisa Vinogradova, Dmitrii Radkevich, Ilya Yasny, Dmitry Kobyzev, Ivan Izmailov, Katsiaryna Yanchanka, Roman Doronin, Andrey Doronichev

机构 * LanceBio Ventures AI Expert

专题命中 Agent评测 :agent(title_cn,summary_cn);AI agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的竞品发现 agent,通过结构化数据处理提升药物资产尽调效率,实现竞品检索与属性标准化,实验结果显示其召回率优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06978 2026-05-11 cs.CL cs.AI 81%

Group of Skills: Group-Structured Skill Retrieval for Agent Skill Libraries

技能组:面向智能体技能库的分组结构技能检索

Kun Zeng, Yu Huo, Siyu Zhang, Zi Ye, Yuecheng Zhuo, Haoyue Liu, Yuquan Lu, Junhao Wen, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Sun Yat-sen University(孙中山大学) University of California, San Diego(加州大学圣地亚哥分校) Taiyuan University of Technology(太原理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出GoSkills,一种分组结构技能检索方法,通过构建基于类型技能图的锚点中心技能组,提升智能体在有限技能预算下对可见需求的覆盖能力,改进了传统技能检索方法的性能。

Comments 30 pages, 4 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07313 2026-05-11 cs.AI 79%

When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory

当存储的证据不再可用:基于规模的代理记忆评估

Jiaqi Shao, Yiyi Lu, Yunzhen Zhang, Bing Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(杜克昆山大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于规模的代理记忆评估方法,用于评估记忆在无关会话积累时的可靠性变化,展示了不同记忆系统在不同规模下的表现差异。

Comments 19 pages, 11 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07180 2026-05-11 cs.CL 79%

Learning Agent Routing From Early Experience

从早期经验学习代理路由

Yimin Wang, Jiahao Qiu, Xuan Qi, Xinzhe Juan, Jingzhe Shi, Zelin Zhao, Hongru Wang, Shilong Liu, Mengdi Wang

机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) University of Michigan(密歇根大学) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学) King’s College London(伦敦国王学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07073 2026-05-11 cs.AI 79%

TeamBench: Evaluating Agent Coordination under Enforced Role Separation

TeamBench: 在强制角色分离下评估代理协调

Yubin Kim, Chanwoo Park, Taehan Kim, Eugene Park, Samuel Schmidgall, Salman Rahman, Chunjong Park, Cynthia Breazeal, Xin Liu, Hamid Palangi, Hae Won Park, Daniel McDuff

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 TeamBench通过851个任务模板和931个预设实例,评估在操作系统强制角色分离下代理协调的能力,发现提示仅和沙盒强制团队的通过率无显著差异,但提示仅团队更易出现验证者篡改执行者代码的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07011 2026-05-11 cs.LG 79%

Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

双代理协同训练用于健康教练的隐式对抗偏好优化

Da Long, Lingyi Fu, Diya Michelle Rao, Jasmine Ruales Carrera, Yang Bai, Shandian Zhe

机构 * Kahlert School of Computing University of Utah(Utah大学计算学院Kahlert学院) Department of Health and Kinesiology University of Utah(健康与运动科学系Utah大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出双代理框架,通过隐式对抗偏好优化提升健康教练质量,改进对话和模拟器训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02934 2026-05-11 cs.SE 79%

AgenticSZZ: Temporal Knowledge Graph-Guided Agentic Bug-Inducing Commit Identification

AgenticSZZ: 基于时间知识图谱的代理式Bug引发提交识别

Yu Shi, Hao Li, Bram Adams, Ahmed E. Hassan

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.SE

AI总结 本文提出AgenticSZZ,利用时间知识图谱改进Bug引发提交识别,通过构建包含时间与结构关系的知识图谱,并结合LLM代理进行图搜索,提升识别精度与效果。

Comments Add RQ3 with open-source LLMs evaluation, such as DeepSeek-V4-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07062 2026-05-11 cs.SE cs.AI 79%

From Assistance to Agency: Rethinking Autonomy and Control in CI/CD Pipelines

从协助到自主:重新思考CI/CD流水线中的自主性与控制

Marcus Emmanuel Barnes, Taher A. Ghaleb, Safwat Hassan

机构 * Faculty of Information University of Toronto Toronto Ontario Canada(信息学院多伦多大学多伦多安大略加拿大) Department of Computer Science Trent University Peterborough Ontario Canada(计算机科学系特伦特大学彼得伯格安大略加拿大) University of Toronto(多伦多大学) Trent University(特伦特大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨CI/CD流水线中自主性与控制的重新定义,提出授权转移的设计挑战,分析当前系统在数据平面的操作限制,并提出控制平面安全与治理机制的研究方向。

Comments Accepted to the 3rd ACM International Conference on AI-Powered Software (AIware 2026), Main Track, Montreal, Canada, July 6-7, 2026. 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24661 2026-05-11 cs.RO 78%

Agent-Centric Observation Adaptation for Robust Visual Control under Dynamic Perturbations

以代理为中心的观测适应用于动态扰动下的鲁棒视觉控制

Zhengru Fang, Yu Guo, Fei Liu, Yuang Zhang, Yihang Tao, Senkang Hu, Wenbo Ding, Yuguang Fang

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出ACO-MoE方法,通过结合路由的修复专家和前景掩码分支,解决动态扰动下的视觉控制问题,提升下游任务性能。

Comments Source code is available at https://github.com/fangzr/aco-moe-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21582 2026-05-11 cs.CL cs.AI cs.HC 73%

VIDEE: Visual and Interactive Decomposition, Execution, and Evaluation of Text Analytics with Intelligent Agents

VIDEE:基于智能代理的文本分析可视化、交互式分解、执行与评估系统

Sam Yu-Te Lee, Chenyang Ji, Shicheng Wen, Lifu Huang, Dongyu Liu, Kwan-Liu Ma

机构 * Department of Computer Science, University of California at Davis(加州大学戴维斯分校计算机科学系)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 VIDEE通过人机协作流程帮助初级分析师进行高级文本分析,包含分解、执行和评估三个阶段,结合人类反馈和LLM评估,验证了系统在非专家用户中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07830 2026-05-11 cs.CR cs.AI 70%

CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios

CyBiasBench:用于网络攻击场景的LLM代理偏见基准测试

Taein Lim, Seongyong Ju, Munhyeok Kim, Hyunjun Kim, Hoki Kim

机构 * Chung-Ang University(Chung-Ang大学) Myongji University(Myongji大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出CyBiasBench,通过630次会话评估五个代理在三种目标和四种提示条件下的攻击偏见,揭示代理在攻击家族分配上的差异及偏见动量效应。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07247 2026-05-11 cs.AI 70%

EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation

EnvSimBench:一个评估和改进基于LLM的环境模拟的基准

Yi Liu, TingFeng Hui, Wei Zhang, Li Sun, Ningxin Su, Jian Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Chongqing University(重庆大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出EnvSimBench,通过400个样本覆盖167种多样环境的严格基准,揭示了LLM在环境模拟中的关键能力缺口,并设计了约束驱动的模拟流程以提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏