arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-18 至 2026-08-18 共收录 363 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 65 篇

2608.16349 2026-08-18 cs.AI 新提交 57%

AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment

AeroCopilotBench:用于在交互式虚拟驾驶舱环境中评估作为航空副驾驶的大语言模型智能体的双层基准

Yuchen Yuan, Zhenghuang Wu, Yuangan Li, Liang Ma, Ke Li

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出AeroCopilot操作环境与双层航空智能体评估基准,通过12个模型测试发现静态知识表现难转化为流程执行能力,为航空智能体评估提供可复现基础。

Comments 38 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16276 2026-08-18 cs.HC cs.CL 新提交 57%

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

PolyDebate:一种用于辩论技能练习与评估的游戏编排多模态系统

Jianing Yin, Weng Pan Kuan, Xiaoyun Liu, Zhiyuan Wen, Yuxuan Li, Milos Stojmenovic, Jiannong Cao

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 PolyDebate是一款游戏化多模态辩论练习评估系统,含Unity 3D游戏与网页版本,经四项研究验证,可结合AI对手、多模态评估与结构化反馈助力学习者提升辩论技能。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15265 2026-08-18 cs.AI 新提交 57%

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15090 2026-08-18 cs.CV cs.LG 新提交 57%

Distribution-free false-alarm calibration and chance-corrected spatial evaluation for industrial anomaly detection

面向工业异常检测的无分布虚警校准与经机会校正的空间评估

Jie Deng

机构 * Tongji University(同济大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 该研究针对工业异常检测现有指标的缺陷,提出结合无分布上限容差阈值与配对减交叉空间检验的方法,在多数据集上验证了其有效性,支持同时报告工作点性能与经机会校正的空间证据。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15008 2026-08-18 cs.CL 新提交 57%

Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents

利用记忆:记忆智能体中记忆载体的整体评估

Wei-Chieh Huang, Weizhi Zhang, Yuchen Wu, Yankai Chen, Eric Hanchen Jiang, Wooseong Yang, Yiwei Yang, Henry Peng Zou, Hanrong Zhang, Ying Nian Wu, Haolun Wu, Kai-Wei Chang, Philip S. Yu, Xue Liu, Aylin Caliskan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Washington(华盛顿大学) McGill University(麦吉尔大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究评估了记忆智能体的多种记忆载体,发现无通用最优载体,不同载体适配不同场景,为自适应智能体记忆系统设计提供了实证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14956 2026-08-18 cs.LG cs.LO 新提交 57%

LLM-based Framework for Generating and Verifying Parallel DEVS Statecharts

基于大语言模型的并行DEVS状态图生成与验证框架

Vamsi Krishna Vasa, Hessam S. Sarjoughian, Edward J. Yellig

机构 * Arizona State University(亚利桑那州立大学) Intel Corporation(英特尔公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本研究提出智能体式PDEVS-LLM框架,辅助建模人员生成验证PDEVS状态图,经评估该框架可显著提升生成状态图的逻辑一致性。

Comments 22 pages, 5 figures, 9 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14903 2026-08-18 cs.AI 新提交 57%

Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence

前沿AI预测存在测量问题:对进展证据的审计

Fabricio F Costa

机构 * AIx4All, LLC(AIx4All有限责任公司) HCLTech(HCLTech公司) Stanley Manne Children’s Research Institute(斯坦利·曼恩儿童研究所) Ann & Robert H. Lurie Children’s Hospital of Chicago(安与罗伯特·H·卢里芝加哥儿童医院) Northwestern University Feinberg School of Medicine(西北大学费恩伯格医学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文审计前沿AI预测的测量问题,构建含多类元素的冻结记录,发现训练计算量、METR horizon等关键数据缺失,基准更迭存在断点,来源高度集中,提出需明确版本化测量系统的预测主张。

Comments 16 pages, 6 figures, 1 table. Evidence cutoff: 12 August 2026. Ancillary code and data included. Preprint; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14642 2026-08-18 cs.LG 新提交 57%

Training and Evaluating Ethical Reinforcement Learning Agents on Per-Episode Distributions

基于每回合分布的伦理强化学习智能体训练与评估

Prabhjyot Singh, Majid Ghasemi, Mark Crowley

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究针对强化学习智能体的伦理训练与评估问题,在Craftax基准上对比四种方法,发现ESR准则下的智能体可在每回合维持违规预算,且训练评估需关注每回合分布而非均值。

Comments 11 Pages, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14641 2026-08-18 cs.AI 新提交 57%

Task- and Session-Level Model Routing: A Common-Interface Hybrid Evaluation of Four Open-Source Routers Across Four Benchmarks

任务与会话级模型路由:四个基准测试中四种开源路由的通用接口混合评估

Kiran N. Kumar, Santhosh K. Saminathan

机构 * Indiana University(印第安纳大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 该研究提出通用测量协议,在四个基准上混合评估四种开源路由,发现多数路由层级分配恒定,vLLM语义路由随提示变化但无最高成功率,需控制固定层级基线以评估路由。

Comments 34 pages, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11891 2026-08-18 cs.CY cs.AI cs.HC 版本更新 57%

Benchmark-Based Comparative Assessment of Publicly Benchmarked Indian Foundation Models: A Capability and Evaluation-Maturity Framework

基于基准的公开基准印度基础模型对比评估:能力与评估成熟度框架

Avinash Agarwal, Vridhi Jain

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文提出能力与评估成熟度框架,对公开基准的印度基础模型与全球同类模型对比评估,发现其在传统基准表现尚可但参与新评估不足,还提出基准成熟度指数,指出能力差距或源于评估生态问题。

Comments 19 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11216 2026-08-18 cs.AI 版本更新 57%

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

机构 * Electronic Arts(美国艺电公司) Simon Fraser University(西蒙菲莎大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。

Comments Project page: https://electronicarts.github.io/AutoWorldModelBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11079 2026-08-18 cs.AI 版本更新 57%

SkillZip: Evaluation-Free Skill Compression for Self-Evolving Agents by Discovering Reusable Structure

SkillZip:通过发现可重用结构实现自进化智能体的免评估技能压缩

Xiaofan Bai, Hongqiang Lin, Chao Liu, Yantao Zhang, Xuan Jin, Xipeng Cao, Yuhong Li

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Duke University(杜克大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 SkillZip 是一种免评估的自进化智能体技能压缩方法,通过提炼重复规则与动作序列实现高效压缩,在性能、泛化性及成本上优于评估引导压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18490 2026-08-18 cs.CL cs.IR 版本更新 57%

Single-Round Vector RAG vs an LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research Corpus

向量RAG与LLM编写的维基:在小型多领域研究上的预注册比较

Theodore O. Cochran

机构 * AI for Altruism (A4A)(AI为利他主义(A4A))

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文通过预注册比较,研究了向量RAG系统与LLM编写的维基在小型多领域研究中的表现,发现两者在跨论文连接、答案组织和成本等方面各有优劣,没有单一系统在所有指标上最优。

Comments v2: two-judge reanalysis of the decomposition-RAG ablation (groundedness advantage +1.15 to +0.15); H3a adjudicated; one registered-plan deviation disclosed; artifact deposit at osf.io/j37b8; title corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13964 2026-08-18 cs.CL 版本更新 57%

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

HLE-Verified: 人类最后考试的系统验证与结构化修订

Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Taolin Han, Wenjie Luo, Yiyuan Li, Xiang Zheng, Yaxuan Wang, Ruixiang Luo, Guojie Lin, Peiyao Xiao, Chengliang Xu, Ben Wang, Zeyu Wang, Zichao Chen, Jianan Ye, Yijie Hu, Jialong Chen, Zongwen Shen, Yuliang Xu, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Hu Wei, Que Shen, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 HLE-Verified通过系统验证和结构化修订,减少噪声并提高模型评估的准确性。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.12689 2026-08-18 eess.SY cs.AI cs.SY nlin.AO 57%

The Less Intelligent the Elements, the More Intelligent the Whole. Or, Possibly Not?

Guido Fioretti

机构 * University of Bologna(博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

Comments 29 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03875 2026-08-18 cs.LG 版本更新 57%

Learning Multi-Timescale Interventions under Safety and Resource Constraints

安全与资源约束下的多时间尺度干预学习

David Mguni, Wanrong Yang, Jing Dong, Jing Peng, Ziquan Liu, Muhammad Salman Haleem, Baoxiang Wang, Dominik Wojtczak

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究提出MINT模型,通过增强干预状态与结构化策略处理多时间尺度干预,在三类基准测试中表现优异,尤其在T1DM场景下大幅提升血糖控制效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16601 2026-08-18 cs.SI cs.CY cs.MA 新提交 50%

"If It Looks Like a User": Measuring Real-Time Moderation Effects via Social Media Simulation

“看起来像用户”:通过社交媒体模拟测量实时审核效果

Enrico Verdolotti, Gianluca Nogara, Luca Luceri, Silvia Giordano

专题命中 Agent评测 :agent(abstract)

AI总结 该研究开发了校准后的SimSoM社交媒体模拟器,通过实验验证后发现静态审核会高估用户封禁效果,实时审核时补偿性转发会削弱低质量内容减少效果,为内容审核政策评估提供了基于模拟的框架。

Comments 15 pages, 4 figures, 2 tables. Accepted for presentation at the Social Simulation Conference (SSC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16550 2026-08-18 cs.GT 新提交 50%

Anchoring for Truthfulness: The Random-Anchor Volume Mechanism for Multi-Facility Location

锚定求真:多设施选址的随机锚点体积机制

Haris Aziz, Simon Mackenzie, Mashbat Suzuki

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对多设施选址问题,提出随机锚点体积机制,证明其在k=1、2、3时为期望防策略机制,k≥4时可被操纵,k=3时期望社会成本最多为8OPT₃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16422 2026-08-18 cs.CR 新提交 50%

Proving the Utility of Large Language Models in Cybersecurity Simulations: A Comprehensive Examination

证明大型语言模型在网络安全模拟中的效用:一项综合研究

Stylianos Kampakis, Fabio Rovai, Marcos Charalambides, Theodosis Mourouzis, Chris Hicks

专题命中 Agent评测 :agent(abstract)

AI总结 该研究通过对比实验证明,大型语言模型(LLMs)驱动的网络安全模拟方法,相比经典强化学习方法,在网络攻击模拟中效率更高、适应性更强,且速度提升达25000至50000倍,为构建智能网络防御系统提供了新路径。

Comments 13 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16252 2026-08-18 cs.GT 新提交 50%

Group-Fair Metric Distortion of Facility Assignment Problems

设施分配问题的群体公平度量失真

Alexandros A. Voudouris

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究受群体公平约束的设施分配问题的度量失真,提出全信息与有序信息算法,推导最大和、和最大社会目标的失真上下界,且下界与上界匹配,覆盖单向匹配与聚类问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16130 2026-08-18 cs.GT 新提交 50%

On the Incompatibility of Weighted PROPX and Pareto Optimality for Indivisible Chores

不可分割家务分配中加权PROPX与帕累托最优的不相容性

Haris Aziz, Bo Li

专题命中 Agent评测 :agent(abstract)

AI总结 研究不可分割家务分配中,加权PROPX与帕累托最优的不相容性,给出2主体4家务、n主体n+1家务的反例,且该不相容性在物品数不超主体数时不成立,与EF1的兼容性结果形成对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16019 2026-08-18 cs.GT 新提交 50%

Maximum-Cost Strategic Facility Location: The Limits of Randomization

Jabari Hastings, Misha Ivkov

专题命中 Agent评测 :agent(abstract)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15822 2026-08-18 cs.GT cs.DS 新提交 50%

Exact MMS Allocations under Personalized Bivalued Valuations: Goods and Chores

个性化双值估值下的精确最大最小份额(MMS)分配:物品与劳务

Yuhao Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 针对个性化双值估值下不可分物品与劳务的精确最大最小份额(MMS)分配这一开放问题,研究人员通过结合配额重新表述等方法,证明该分配始终存在且可在多项式时间内计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15709 2026-08-18 cs.DB 新提交 50%

Logos: Certified Order-Sensitive SQL Rewrites with Mechanized Semantics and LLM Guidance

Logos:结合机械化语义与LLM指导的可验证顺序敏感型SQL重写

Jingyu Ke, Jingyang Li, Guoqiang Li

专题命中 Agent评测 :agent(abstract)

AI总结 Logos是一款结合Rocq机械化语义与LLM指导的SQL重写验证工具,解决了现有工具的不足,在389个查询对的评估中解决率达86.9%,优于基线工具SQLSolver。

Comments 13 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15631 2026-08-18 cs.GT econ.TH 新提交 50%

Non-obvious Manipulability with Groups in Shapley-Scarf Housing Markets

沙普利-斯卡夫住房市场中基于群体的非明显可操纵性

Louise Demoor, Martí Jané-Ballarín, Pierre Nunn, Subhajit Pramanik, Antoine Prévotat, Makoto Yokoo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究在沙普利-斯卡夫住房市场中,将策略完备性替换为基于群体的非明显可操纵性,定义了超群体下的顶端交易循环机制类,并证明此类机制的结果具有一致性。

Comments 14 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14967 2026-08-18 cs.DC cs.NI 新提交 50%

When Does Distributed AI Inference Need More Wide-Area Bandwidth? A Co-Design Evaluation of Optical, Packet, and Software Levers

分布式AI推理何时需要更多广域网带宽?光学、分组与软件杠杆的协同设计评估

Prasanna C

专题命中 Agent评测 :agentic(abstract)

AI总结 本文对比了分布式AI推理中,跨站点迁移推理状态与KV重计算等方案的优劣,推导了70B多头注意力模型的带宽交叉点,分析了敏感性因素及经济性,提出了测试计划。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14753 2026-08-18 cs.CR stat.ME 新提交 50%

SynthGuard-ReleaseBench: Locked-Audit Evidence for Synthetic Tabular Data Releases

SynthGuard-ReleaseBench:合成表格数据发布的锁定审计证据

Jeffery Opoku, David Banahene

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出SynthGuard-ReleaseBench审计框架,通过锁定审计要素对比工作流,在多类数据上验证其可复现性与区分性,为合成表格数据发布提供特定用途的审计证据。

Comments 45 pages, 20 figures, 11 tables. Software and evidence archive with locked configurations, tests, and a fail-closed release-gate validator archived at Zenodo, DOI 10.5281/zenodo.21909680

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15515 2026-08-18 math.PR 新提交 50%

Weak-Type Bounds for Convolution on the Boolean Hypercube

Junwei Lu, Shengtao Guo, Ethan X. Fang

专题命中 Agent评测 :agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15010 2026-08-18 cond-mat.soft physics.bio-ph 新提交 50%

Shear effects in active models of normal and cancer cells

正常细胞与癌细胞主动模型中的剪切效应

Souvik Sadhukhan, Rajsekhar Das, Lin Zhao, Wolfgang Losert, D. Thirumalai

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过三维智能体模型结合GMM与平均场理论,探究正常及癌细胞组织在剪切下的力学响应,揭示刚度与活性异质性决定其非仿射运动的规律,与实验结果吻合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12818 2026-08-18 econ.TH 版本更新 50%

Schedule equilibria

日程均衡

Harry Kleyer

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究一般均衡下的不完全竞争,推导家庭与企业最优条件,建立均衡存在性与颤抖手精炼,将框架应用于多场景,发现内生价格反应会改变相关标准结论。

详情

展开后加载摘要…

URL PDF HTML 收藏