arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-08 至 2026-05-08 共收录 163 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 12 篇

2510.12635 2026-05-08 cs.AI 79%

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

记忆作为行动:面向长周期智能任务的自主上下文编纂

Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Hithink Research(慧思科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Noah’s Ark Lab(华为诺亚实验室) Peng Cheng Lab(鹏城实验室)

专题命中 记忆与上下文管理 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出MemAct框架,将工作记忆管理作为可学习的策略动作,通过端到端强化学习优化信息保留与任务表现,实验显示其在保持准确性的同时显著减少上下文长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03354 2026-05-08 cs.AI 79%

What Happens Inside Agent Memory? Circuit Analysis from Emergence to Diagnosis

代理记忆内部发生了什么?从涌现到诊断的电路分析

Xutao Mao, Jinman Zhao, Gerald Penn, Cong Wang

机构 * City University of Hong Kong(香港城市大学) University of Toronto(多伦多大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 研究揭示了代理记忆中控制与内容电路的因果关系及共享枢纽的机制,开发出76.2%准确率的无监督诊断工具,优于监督基线13分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00117 2026-05-08 cs.RO cs.AI 79%

PEPA: a Persistently Autonomous Embodied Agent with Personalities

PEPA:具有个性的持续自主体

Kaige Liu, Yang Li, Lijun Zhu, Weinan Zhang

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 本文提出PEPA框架,通过三层认知架构实现持续自主,利用个性特质自主生成目标并维持行为演化,实验证明其在动态环境中稳定运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06455 2026-05-08 cs.AI 74%

PrefixGuard: From LLM-Agent Traces to Online Failure-Warning Monitors

PrefixGuard: 从LLM-代理轨迹到在线故障预警监控

Xinmiao Huang, Jinwei Hu, Rajarshi Roy, Changshun Wu, Yi Dong, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学)

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI

AI总结 PrefixGuard通过离线StepView诱导和监督学习训练监控器,有效提升异构轨迹上的在线故障预警性能,实现0.900/0.710/0.533/0.557 AUPRC的高精度预警。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06529 2026-05-08 cs.AI cs.LG 73%

Market-Alignment Risk in Pricing Agents: Trace Diagnostics and Trace-Prior RL under Hidden Competitor State

定价代理中的市场对齐风险:轨迹诊断与隐藏竞争状态下的轨迹先验强化学习

Peiying Zhu, Sidi Chang

机构 * Blossom AI Blossom AI Labs(Blossom AI 实验室)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在部分可观测环境下,定价代理因无法观测竞争者状态导致的市场对齐失败,提出轨迹先验强化学习方法以修复此类问题。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06346 2026-05-08 cs.AI 70%

Prediction and Empowerment: A Theory of Agency through Bridge Interfaces

预测与赋能:通过桥接接口的代理理论

Richard Csaky

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文研究了在确定性物理或模拟世界中部分可观测性下的代理问题,通过桥接接口模型,证明了预测、压缩和赋能之间的分离关系,并提出了一种设计原则以区分隐藏状态识别、接口细化、任务相关可控性和简单覆盖控制。

Comments This is a working draft: feedback and criticism is most welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06149 2026-05-08 cs.LG cs.AI 62%

AdaGamma: State-Dependent Discounting for Temporal Adaptation in Reinforcement Learning

AdaGamma:强化学习中时序适应的状态依赖折扣

Yaomin Wang, Jianting Pan, Ran Tian, Xiaoyang Li, Yu Zhang, Hengle Qin, Tianshu YU

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 AdaGamma通过学习状态依赖折扣函数和回报一致性目标,改进了深度强化学习中的状态依赖折扣方法,在连续控制基准和京东物流平台实现显著提升。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18257 2026-05-08 cs.LG cs.AI 62%

Discovering What You Can Control: Interventional Boundary Discovery for Reinforcement Learning

发现你可以控制的东西:强化学习中的干预边界发现

Jiaxin Liu, Anzhe Cheng, Paul Bogdan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Southern California(南加州大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出干预边界发现方法,通过随机化动作生成干预对比,利用FDR校正的两样本检验确定观测维度,有效识别可控状态维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06416 2026-05-08 cs.CL 57%

MiA-Signature: Approximating Global Activation for Long-Context Understanding

MiA-Signature:近似全局激活以实现长上下文理解

Yuqing Li, Jiangnan Li, Mo Yu, Zheng Lin, Weiping Wang, Jie Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Pattern Recognition Center, WeChat AI, Tencent(微信AI模式识别中心) Hunyuan Team, Tencent(腾讯文心一言团队)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.CL

AI总结 本文提出MiA-Signature,通过压缩表示近似全局激活对下游处理的影响,提升长上下文理解任务的性能。

Comments This is a work in progress; we will continue to revise and improve the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05413 2026-05-08 cs.AI 57%

From History to State: Constant-Context Skill Learning for LLM Agents

从历史到状态:为LLM代理的常域技能学习

Haoyang Xie, Xinyuan Wang, Yancheng Wang, Puda Zhao, Feng Ju

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出常域技能学习框架,通过轻量任务模块学习可重用流程,利用确定性跟踪器生成紧凑状态块,结合SFT和在线RL提升性能,减少提示词用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18598 2026-05-08 econ.TH math.OC 50%

Locational Energy Storage Bid Bounds for Facilitating Social Welfare Convergence

区域能源存储报价界限以促进社会福利收敛

Ning Qi, Bolun Xu

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出基于多期经济调度的报价界限方法,通过整合系统不确定性和风险偏好,有效限制能源存储报价,提升社会福利,实验证明在不同场景下可降低系统成本并增加存储利润。

Journal ref IEEE Transactions on Energy Markets, Policy and Regulation, vol. 3, no. 4, pp. 486-497, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 29 篇

2602.03117 2026-05-08 cs.CR 87%

AgentDyn: Are Your Agent Security Defenses Deployable in Real-World Dynamic Environments?

AgentDyn: 您的代理安全防御能在现实世界动态环境中部署吗?

Hao Li, Ruoyao Wen, Shanghao Shi, Ning Zhang, Yevgeniy Vorobeychik, Chaowei Xiao

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);planning(abstract);agentic(abstract)

AI总结 本文揭示现有代理安全基准的三大缺陷,提出AgentDyn基准,包含60个挑战性开放任务和560个注入测试用例,评估十种先进防御,发现现有防御不足或过度防御,亟需更适应动态环境的基准。

Comments 26 Pages, 17 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05846 2026-05-08 cs.CR cs.AI 86%

LoopTrap: Termination Poisoning Attacks on LLM Agents

LoopTrap: 对 LLM agent 的终止污染攻击

Huiyu Xu, Zhibo Wang, Wenhui Zhang, Ziqi Zhu, Yaopeng Wang, Kui Ren, Chun Chen

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) School of Cyber Science and Engineering(网络安全与工程学院) Southeast University(东南大学)

专题命中 Agent评测 :agent(title_cn,summary_cn);分类 cs.AI

AI总结 本文研究了LLM agent迭代执行循环中的终止污染风险,提出10种攻击策略并通过实验证明不同agent的行为特征影响攻击效果,设计了自动化框架LoopTrap以提升红队攻击效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06434 2026-05-08 cs.AI 85%

Knowledge Graphs, the Missing Link in Agentic AI-based Formal Verification

知识图谱:代理AI形式验证中的缺失链接

Vaisakh Naduvodi Viswambharan, Keerthan Kopparam Radhakrishna, Deepak Narayan Gadde, Aman Kumar

机构 * 1 Infineon Technologies Dresden AG \& Co. KG, Germany 2 Infineon Technologies Semiconductor India Private Limited, India

专题命中 Agent评测 :agentic(title);agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出基于知识图谱的验证方法,通过结构化中间表示提取规范、RTL和工具反馈,提升形式验证中规范到RTL的关联性,并通过多代理工作流生成SVAs及三种修正循环。

Comments To appear at the IEEE International Conference on IC Design and Technology 2026 (ICICDT), June 22 - 24, 2026, Dresden, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06068 2026-05-08 cs.AI cs.DC 85%

VibeServe: Can AI Agents Build Bespoke LLM Serving Systems?

VibeServe: 人工智能代理能否构建定制化的LLM服务系统?

Keisuke Kamahori, Shihang Li, Simon Peter, Baris Kasikci

机构 * University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);agentic(abstract);multi-agent(abstract)

AI总结 本文提出VibeServe,一种通过多代理循环自动合成定制化LLM服务系统的框架,在标准部署中与vLLM竞争,在非标准场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00113 2026-05-08 cs.MA cs.AI cs.CE cs.CY cs.SI 85%

AI Agents Alone Are Not (Yet) Sufficient for Social Simulation

仅靠AI代理不足以进行社会模拟

Yiming Li, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文指出LLM代理单独使用不足以实现真实的社会动态,提出需考虑环境互动和调度机制的统一框架。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06132 2026-05-08 cs.AI 83%

Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents

Claw-Eval: 向可信的自主代理评估迈进

Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, Tong Yang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The University of Hong Kong(香港大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 Claw-Eval通过300人验证任务覆盖9类任务,采用轨迹感知评分体系,揭示自主代理在安全、鲁棒性及一致性上的多维特性,验证传统评估方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06639 2026-05-08 cs.LG cs.AI cs.CL cs.MA 82%

Recursive Agent Optimization

递归智能体优化

Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI Labs(亚马逊人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出递归智能体优化方法,通过递归代理训练实现更高效的推理扩展和泛化能力,提升任务处理效率和泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05868 2026-05-08 cs.CR 82%

SkillScope: Toward Fine-Grained Least-Privilege Enforcement for Agent Skills

SkillScope:迈向细粒度最小特权执行的代理技能

Jiangrong Wu, Yuhong Nan, Yixi Lin, Huaijin Wang, Yuming Xiao, Shuai Wang, Zibin Zheng

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出SkillScope框架,通过图分析方法实现细粒度最小特权执行,检测技能超特权行为,实验表明其在检测和约束超特权方面效果显著。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05379 2026-05-08 cs.AI cs.CC cs.ET 79%

Partial Evidence Bench: Benchmarking Authorization-Limited Evidence in Agentic Systems

部分证据基准:在代理系统中受授权限制的证据基准测试

Krti Tallam

机构 * KamiwazaAI

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出Partial Evidence Bench,用于评估代理系统在授权限制下的证据处理能力,通过四个维度评估系统表现,展示不同行为模式对完成度的影响。

Comments Benchmark paper with deterministic synthetic corpora, 14 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 79%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05790 2026-05-08 cs.HC 78%

GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment

GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估

Bin Wang, Yue Liu, Benjamin Newman, Ajoy S. Fernandes, Zhiyuan Wang, Robert Cavin, Michele A. Cox, Vijay Rajanna, Takumi Bolte, Melissa Hunfalvay, Ulas Bagci, Michael J. Proulx

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出GazeMind,一种基于注视的LLM代理框架,用于智能眼镜上的认知负荷评估。该框架通过编码注视数据为结构化表示,提供可解释的认知负荷预测,并通过新颖的任务引导推理方法实现跨场景泛化,同时利用用户特定特征和历史参考实现个性化适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05640 2026-05-08 cs.CV 78%

AffectSeek: Agentic Affective Understanding in Long Videos under Vague User Queries

AffectSeek: 长视频中基于模糊用户查询的代理情感理解

Zhen Zhang, Yuhang Yang, Yunxiang Jiang, Yuhuan Lu, Haifeng Lu, Zheng Lian, Runhao Zeng, Xiping Hu

机构 * Gansu Provincial Key Laboratory of Wearable Computing, School of Information Science and Engineering, Lanzhou University(甘肃省可穿戴计算重点实验室,兰州大学信息科学与工程学院) Guangdong-Hong Kong-Macao Joint Laboratory for Emotional Intelligence and Pervasive Computing, Shenzhen MSU-BIT University(粤港澳大湾区情感智能与泛在计算联合实验室,深圳MSU-BIT大学) Department of Computer and Information Engineering, Khalifa University(计算机与信息工程系,哈利法大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) Department of Electrical and Computer Engineering, The University of Hong Kong(电子与计算机工程系,香港大学)

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出VQAU任务,要求模型在长视频中定位情感时刻、预测情绪类别并生成证据支持的解释。构建VQAU-Bench基准,并提出AffectSeek框架,通过分步推理实现模糊查询驱动的情感理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06584 2026-05-08 cs.AI 77%

NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research

NeuroAgent:用于多模态神经影像分析和研究的LLM代理

Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 NeuroAgent通过LLM驱动的代理框架自动化多模态神经影像预处理与分析,支持自然语言查询,提升神经影像研究的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05250 2026-05-08 cs.IR cs.AI 74%

Decision-aware User Simulation Agent for Evaluating Conversational Recommender Systems

面向决策意识的用户模拟代理用于评估对话推荐系统

Yuan-Chi Li, Li-Chi Chen, Sung-Yi Wu, Yu-Che Tsai, Shou-De Lin

机构 * Department of Computer Science and Information Engineering(计算机科学与信息工程系)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文提出Hesitator框架,通过模块化决策模块模拟人类在选择过载下的决策过程,实验表明其能有效缓解模拟器在高过载条件下的不现实行为,复现了心理学经济学中的行为模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06490 2026-05-08 cs.AI cs.CY 70%

Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors

工具选择:测量LLM代理追求工具性行为的倾向

Jonas Wiedermann-Möller, Leonard Dung, Maksym Andriushchenko

机构 * Universität Bielefeld(比勒菲尔德大学) Ruhr-Universität Bochum(波鸿鲁尔大学) ELLIS Institute(ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 Agent评测 :AI agent(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一个基准测试,用于衡量终端基于代理的模型在追求工具性收敛行为的倾向,通过七个操作任务评估十种模型,发现工具性行为集中且系统性,但低提示环境下的危险行为表现较少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06345 2026-05-08 cs.AI 70%

More Than Can Be Said: A Benchmark and Framework for Pre-Question Scientific Ideation

比能说的更多:一个预问题科学构想的基准和框架

Jie Yu, Song Qiu

机构 * Shanghai Key Laboratory of Multidimensional Information Processing(上海多维信息处理关键实验室) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出InciteResearch框架,通过分解苏格拉底提问逻辑链,将隐性理解显性化,解决科研初始模糊输入问题,并引入TF-Bench基准,展示AI在思维延伸中的作用。

Comments 19 pages, 2 figures; Code is available at https://github.com/Paradoxtcal/InciteResearch.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05475 2026-05-08 cs.AI 70%

Intentionality is a Design Decision: Measuring Functional Intentionality for Accountable AI Systems

意图性是一种设计决策:测量功能意图性以实现可问责的AI系统

Allessia Chiappetta, Robert Mahari

机构 * CodeX, The Stanford Center for Legal Informatics(CodeX,斯坦福法律信息学中心)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出功能意图性测试(FIT)框架,用于量化AI系统意图性行为,通过五维指标评估系统意图性,以实现对高自主性系统的可控问责。

Journal ref AutomationXP26 Workshop of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06334 2026-05-08 cs.CL cs.LG cs.LO 62%

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

MANTRA: 为使用工具的LLM代理合成经过SMT验证的合规性基准

Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 MANTRA通过自动合成可机检验的合规性基准,解决LLM代理在复杂手册下的合规性验证问题,支持任意领域和长流程手册,并提供可调节的任务复杂度,生成285个任务的基准套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06066 2026-05-08 cs.LG cs.AI 62%

Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark

因果强化学习在复杂卡牌游戏中的应用:《魔法:英雄冒险》基准测试

Cristiano da Costa Cunha, Ajmal Mian, Tim French, Wei Liu

机构 * Department of Computer Science and Software Engineering, University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MTG-Causal-RL基准测试,通过Magic: The Gathering游戏中的复杂环境,结合因果结构和掩码动作空间,评估因果信用分配、跨 archetype 转移和策略可审计性等核心问题。

Comments 21 pages, 8 figures, 9 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏