arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-21 至 2026-08-21 共收录 162 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 40 篇

2608.19263 2026-08-21 cs.SE cs.MA 新提交 90%

The Evaluation Context Protocol (ECP): A Portable Contract for AI Agent Evaluation

评估上下文协议(ECP):一种用于AI智能体评估的便携式契约

Aniket Wattamwar, Manav Anandani, Mrunal Kakirwar

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);autonomous agent(abstract);agentic(abstract)

AI总结 针对当前AI智能体评估范式的局限性,提出厂商中立的ECP协议,实现跨框架的统一评估,已开发适配主流智能体框架的开源参考实现,相关验证为未来工作。

Comments 14 pages, 4 tables, 4 figures, Code available at this https URL (https://github.com/evaluation-context-protocol)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14398 2026-08-21 cs.AI 版本更新 88%

ChronoAgentic: A Code-based Multi-Agent World Simulator for Physically Grounded Simulation Construction

编码智能体作为世界模拟器

Hongyu Wang, Jingquan Wang, Ashvin Anilkumar, Bocheng Zou, Radu Serban, Dan Negrut

机构 * Department of Mechanical & Aerospace Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校机械与航空航天工程系) School of Computer, Data, and Information Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机、数据与信息科学学院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI

AI总结 提出一个通过可执行模拟代码构建基于物理的世界模型的智能体框架,协调规划、代码生成、视觉审查和物理分析智能体,迭代修正代码以满足物理约束,在物理准确性、指令忠实度和视觉质量上超越视频模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19202 2026-08-21 cs.AI cs.CL cs.LG 新提交 85%

Active Inference as Context Acquisition for AI Agents

主动推理作为AI智能体的上下文获取机制

Sanchayan Dutta, Sai Niranjan Ramachandran, Suvrit Sra

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) Technical University of Munich(慕尼黑工业大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究将AI智能体的上下文获取权衡形式化为主动推理,在最优提问框架中验证其有效性,为智能体上下文获取层提供模型无关的设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12323 2026-08-21 cs.CL cs.AI cs.CY 版本更新 84%

Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance

AI智能体为何违反规则?框架、情境与社会信号如何影响合规性

Mika Okamoto, Ansel Kaplan Erol, Kutluhan Erol

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,comments);分类 cs.AI、cs.CL

AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。

Comments Published at 2026 AAAI/ACM Conference on AI, Ethics, and Society and 2026 COLM Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19625 2026-08-21 cs.AI 新提交 83%

Scientific Data Skills: Enabling Agent-Ready Scientific Data Services at Scale

科学数据技能:实现规模化的智能体就绪型科学数据服务

Xiaohan Huang, Qingqing Long, Xiaolei Du, Siyu Pu, Jiawen Xu, Haotian Chen, Chenyang Zhao, Jinbiao Liu, Xuezhi Wang, Hao Wang, Hengshu Zhu, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 针对现有数据集表示难以满足AI智能体需求的问题,提出SciDSK智能体就绪型表示并构建相关平台,可提升智能体的数据集发现与解释能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19509 2026-08-21 cs.SE 新提交 83%

An Agentic RAG and Evaluation Framework for Assurance Case Generation: Industrial Use Case for the EU Cyber Resilience Act Compliance

用于保障案例生成的智能检索增强生成与评估框架:欧盟网络弹性法案合规性的工业用例

Fariz Ikhwantri, Iker Lasa Ojanguren, Dusica Marijan, Maria I. Maslioukova, José Arias Marin, Pavlos Kosmides

专题命中 Agent评测 :agentic(title,abstract);分类 cs.SE

AI总结 该研究提出基于智能RAG的保障案例生成与评估框架,通过案例研究验证其可自动化欧盟网络弹性法案合规评定,减少人工并提升证据可追溯性。

Comments 6 pages, accepted at ISSRE 2026 (Industry track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02022 2026-08-21 cs.AI 版本更新 83%

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19901 2026-08-21 cs.CR cs.AI 新提交 79%

MaliciousSkillBench: A Comprehensive Benchmark for Malicious Agent Skill Detection

MaliciousSkillBench:用于恶意智能体技能检测的综合基准

Yue Wang, Yi Liu, Gelei Deng, Ying Zhang, Yuekang Li, Zhenyu Chen, Leo Zhang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出MaliciousSkillBench这一综合基准,整合多源恶意技能数据构建含9740个技能的数据集,评估三类检测器后发现现有方法不足,需更广泛跨源覆盖及联合评估攻击检测与良性误报的方案。

Comments Project page: this https URL (https://protectskills.github.io/MaliciousSkillBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15052 2026-08-21 cs.AI math.OC 版本更新 79%

Andy: A Mathematical Agent for Rigorous Proof and Autonomous Research

Andy:用于严谨证明与自主研究的数学智能体

Zi'an Wang

机构 * School of Mathematical Sciences, Tongji University(同济大学数学科学学院) Key Laboratory of Intelligent Computing and Applications (Tongji University)(同济大学智能计算与应用重点实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出自主数学智能体Andy,以自触发脉冲共识的已发表结果为基础,构建混合控制方案并验证同步条件,展现其提出问题、开发并验证严谨证明的能力。

Comments 20 pages, 4 figures, 3 tables, and 3 algorithms. Research logs, reports, and simulation code are available at this https URL (https://github.com/mowaiwaim/Andy)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10388 2026-08-21 cs.IR cs.AI 版本更新 79%

Right Family, Wrong Skill: Benchmarking Risk Exposure in Agent Skill Retrieval

SkillResolve-Bench:衡量和解决智能体技能检索中的同能力歧义

Jiandong Ding, Honglei Ji, Ming Liu, Tao Duan

机构 * Huawei Technologies Ltd(华为技术有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对智能体技能库中同一能力族内不同技能的执行风险,提出SkillResolve-Bench基准和SkillResolve方法,通过候选族解析和代表性选择,在保持高召回率的同时将有害技能暴露率降至0。

Comments Preprint. 21 pages, 3 figures, 6 tables. Supersedes arXiv:2606.10388 (https://arxiv.org/abs/2606.10388)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19551 2026-08-21 cs.HC 新提交 79%

Delegating or Doing? Understanding User Behavior in Hybrid Human-Agent Interfaces

委托还是自行操作?理解混合人机界面中的用户行为

Gavin Raine Dizon, Tyrone Justin Sta Maria, Jordan Aiko Deja, Yasuyuki Sumi

专题命中 Agent评测 :agent(title,abstract)

AI总结 该研究通过被试间实验对比三种交互模式,发现混合人机界面可降低交互成本,委托行为更多反映用户个体特征而非任务需求。

Comments 9 pages, In Proceedings of the 14th International Conference on Human-Agent Interaction at Osaka, Japan on November 16-19, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20111 2026-08-21 cs.RO cs.ET 新提交 78%

Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms

面向规划的端到端自动驾驶:架构、评估与新兴范式

Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li, Yunjian Li, Lishengsa Yue, Zhiyong Cui, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) Chongqing University(重庆大学) The Hong Kong University of Science and Technology(香港科技大学) Tongji University(同济大学) Beihang University(北京航空航天大学)

专题命中 Agent评测 :planning(title,abstract)

AI总结 本综述梳理了端到端自动驾驶从回归任务向面向规划系统的转变,沿四个维度整合方法,分析基准转变,指出需结合一致评估解读架构进展,并总结了多项开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02910 2026-08-21 cs.HC cs.AI cs.CY 版本更新 77%

The Basic B*** Effect: The Use of LLM-based Agents Reduces the Distinctiveness and Diversity of People's Choices

基本B效应:基于大语言模型(LLM)的智能体的使用会降低人们选择的独特性与多样性

Sandra C. Matz, Kimberly Klugescheid, C. Blaine Horton, Sofie Goethals

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究通过实地研究和对照实验发现,使用基于LLM的智能体会降低人们选择的独特性与多样性,且顺序选择、智能体个性化会放大该效应,相关发现对设计维护人类多样性的AI系统具有重要意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19974 2026-08-21 cs.AI 新提交 74%

ReguSim: Evaluating LLM Agent Rule Grounding in Financial Compliance

ReguSim:评估大语言模型智能体在金融合规中的规则落地

Yiyang Luo, Yihang Jiang, Qijun Xie, Liang Lan, Lin Willian Cong, Anyi Rao, Yunya Song

机构 * HKUST(香港科技大学) HKBU(香港浸会大学) NTU(新加坡南洋理工大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 研究针对LLM智能体在金融合规中的规则落地问题,构建ReguSim环境与ReguBench基准,发现可见规则无法完全消除违规动作,结构化监控基线表现优于纯提示LLM,为金融合规评估提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19653 2026-08-21 cs.LG cs.AI 新提交 73%

DeltaML-Bench: Evaluating Machine Learning Agents on Real-World Research Repositories

DeltaML-Bench:基于真实研究仓库评估机器学习智能体

Josias Moukpe, Priyanka Aryal, Matthew Kenney

机构 * Algorithmic Research Group(算法研究组)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出DeltaML-Bench基准,评估发现基于搜索的ARG框架可提升GPT-5在机器学习实验任务中的成功率,且能避免规范博弈,为自主ML智能体部署提供了关键考量

Comments 18 pages, 3 figures, 12 tables. Code and benchmark: this https URL (https://github.com/AlgorithmicResearchGroup/deltaml-bench-public)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28969 2026-08-21 cs.CL cs.AI cs.HC 版本更新 73%

Beyond Recall: Behavioral Specification as an Interpretive Layer for AI Personalization

超越回忆:行为规范作为AI个性化的解释层

Aarik Gulaya

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 提出行为规范作为解释层,通过压缩用户数据为解释性模式,显著提升AI代理对用户意图的表示准确性,减少模型规避,并在解释型问题上优于原始语料和商业记忆系统。

Comments 142 pages, 4 figures. Code, data, judge prompts, and reproduction instructions: this http URL (http://github.com/agulaya24/beyond-recall) 8/19 Replacement: Pages updated to 142 from 134. Added Table of Contents. Updated table/graph formatting. Updated Section 8: Data, Code, and Reproducibility to include updated links, corrected author names

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19857 2026-08-21 cs.LG cs.CR 新提交 70%

Inadvertent Context Leakage in Language Models

语言模型中的无意上下文泄漏

Jaiden Fairoze, Neal Mangaokar, Kamalika Chaudhuri, Sanjam Garg, Saeed Mahloujifar

机构 * FAIR, Meta Superintelligence Labs(Meta超级智能实验室FAIR) University of California, Berkeley(加利福尼亚大学伯克利分校) Google DeepMind(谷歌DeepMind)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 该研究发现语言模型的上下文窗口会无意泄漏敏感用户信息,提出自适应攻击方法,在8个专有模型上验证了2、4位数秘密的重建准确率,还展示了两种实际攻击方式,指出泄漏是模型能力的副产品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19741 2026-08-21 cs.CL cs.DB 新提交 70%

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

单次成功并非可靠:Thinkingbox——面向有状态业务工作流智能体的沙箱与基准测试集

Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

机构 * University of Pittsburgh(匹兹堡大学) Northwestern University(西北大学) University of California Irvine(加州大学欧文分校) Microsoft(微软公司)

专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.CL

AI总结 研究人员推出面向有状态业务工作流智能体的沙箱Thinkingbox及基准测试集Thinkingbox-bench,发现现有智能体在该基准上可靠完成任务的表现远逊于单次成功表现,凸显了端到端任务可靠评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19511 2026-08-21 cs.AI 新提交 70%

Symposium: Trust via Auditable Records for Communities of AI Scientist Agents

专题讨论会:面向AI科学家智能体社群的可审计记录信任机制

Dexter Pratt

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Symposium是面向AI科学家智能体社群的可审计记录信任框架,通过保留科研活动的不可变历史与科学论证,支持信任评估,且提供可快速部署的实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20318 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试

Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

机构 * Navers Lab(Navers实验室) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20169 2026-08-21 cs.CL cs.AI cs.LG 新提交 67%

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task Selection

Task-CoEvolve:通过自适应验证任务选择实现高效的智能体框架优化

Atsuyuki Miyai, Kiyoharu Aizawa, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Task-CoEvolve通过自适应验证任务选择,使LLM智能体框架与验证任务协同演化,在保持全集搜索最终性能的同时,减少80%评估次数,实现高效的智能体框架优化。

Comments Github: this https URL (https://github.com/Agent4Science-UTokyo/Task-CoEvolve)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10471 2026-08-21 q-bio.QM q-bio.CB q-bio.PE 版本更新 67%

Stochastic mutation as a mechanism for the emergence of SARS-CoV-2 new variants -- A Scientific Conjecture on Artificial Intelligence Paradigm

随机突变作为新冠病毒新变体出现的机制——关于人工智能范式的科学猜想

Liaofu Luo, Jun Lv

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文总结新冠疫情传播动力学研究,提出科学猜想是科研的重要驱动力,还提出问答式AI相比AI智能体更高效低成本的AI范式猜想。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23955 2026-08-21 cs.AI cs.DC cs.LG cs.SI q-fin.CP 版本更新 62%

From Accuracy to Auditability: A Survey of Determinism in Financial AI Systems

从准确性到可审计性:金融AI系统中的确定性综述

Ruizhe Zhou, Xiaoyang Liu, Gaoyuan Du, Yi Zheng, Shouxi Ren, Deepayan Chakrabarti, Dengdu Jiang

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文从系统视角综述了金融AI中表格模型、图网络和基于LLM的智能体工作流三种模态的不可重现性问题,通过实验量化了确定性指标并提出了分层评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20106 2026-08-21 cs.CL 新提交 57%

OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准

Nikita Khudov

机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) StrategAI

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20024 2026-08-21 cs.LG 新提交 57%

Systematic Evaluation of TabPFN-TS for Zero-Shot Probabilistic Heat Load Forecasting in District Heating Networks

系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用

Ben Spoek, Karim K. Ben Hicham, Kai Derzsi, Philipp Althaus, Alexander Mitsos, Dirk Müller

机构 * RWTH Aachen University(亚琛工业大学) Process Systems Engineering(过程系统工程) Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。

Comments 33 pages, 10 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19564 2026-08-21 cs.CL 新提交 57%

Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM Agents

记住、验证还是询问?大语言模型智能体中记忆承诺的跨家族评估

Baichuan Li, Junyi Yao, Zihao Zheng

机构 * Southern Methodist University(南卫理公会大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究通过MCB数据集评估LLM智能体的记忆承诺,发现模型验证事实变化更可靠,策略提示可降低错误持久率,少样本提示能提升部分任务准确率,但澄清召回率仍较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17034 2026-08-21 cs.LG 版本更新 57%

Agents unlock new capabilities through Switching LoRA Adapters as a Tool (SLAaaT)

智能体通过切换LoRA适配器作为工具(SLAaaT)解锁新能力

Kenneth Ge

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究针对后训练导致的灾难性遗忘问题,提出让智能体在轨迹中途切换专用LoRA适配器的SLAaaT方法,实验显示其可解决新问题、自主切换策略且能力损耗低,在任务能力和token使用上优于生成子智能体的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09498 2026-08-21 cs.CL 版本更新 57%

Self-Harness: Harnesses That Improve Themselves

Self-Harness:自我改进的操控框架

Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Self-Harness范式,让LLM智能体通过弱点挖掘、框架提议和验证迭代改进自身操控框架,在Terminal-Bench-2.0上使三种模型的通过率分别提升21.4%、14.3%和14.2%。

Comments this https URL (https://github.com/qzzqzzb/Self-Harness)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19997 2026-08-21 cs.CL 版本更新 57%

When Contextual Inference Fails: Cancelability in Interactive Instruction Following

当情境推理失效时:交互指令跟随中的可取消性

Natalia Bila, Kata Naszádi, Alexandra Mayn, Christof Monz

机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) Department of Language Science and Technology, Saarland University(萨尔兰大学语言科学与技术系)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究探讨了在协作积木构建任务中,如何区分字面解释与情境推理,引入了交互基准测试BWIM,发现模型在判断与行动间存在脱节,未能有效利用信息进行澄清。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14642 2026-08-21 cs.GT cs.AI cs.DC 版本更新 57%

The Bidding Games: Reinforcement Learning for MEV Extraction on Polygon Blockchain

竞拍博弈:Polygon区块链上用于MEV提取的强化学习

Andrei Seoev, Leonid Gremyachikh, Anastasiia Smirnova, Yash Madhwal, Alisa Kalacheva, Dmitry Belousov, Ilia Zubov, Aleksei Smirnov, Denis Fedyanin, Vladimir Gorgadze, Yury Yanovich

机构 * Independent Researcher(独立研究者) Moscow Institute of Physics and Technology(莫斯科物理技术学院) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所) HSE University(俄罗斯伏尔加格勒国立高等经济大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文针对Polygon Atlas拍卖中MEV提取的策略难题,提出强化学习框架,构建匹配拍卖特性的模拟环境与PPO竞拍代理,实证显示其利润表现优于静态策略与历史市场领导者。

详情

展开后加载摘要…

URL PDF HTML 收藏