arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1095 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1095 篇

2607.28074 2026-07-31 cs.AI cs.LG 新提交 62%

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

Echoverse:用于大规模训练计算机使用智能体的深度演化环境

Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia, Hussein Mozannar, Vibhav Vineet, Sara Abdali, Corby Rosset, Yash Lara, Ahmed Awadallah, Ece Kamar, Akshay Nambi

机构 * Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Echoverse是用于大规模训练计算机使用智能体的深度演化环境,其协同演化循环可提升智能体性能,经12个环境训练后9B模型准确率大幅提升,还发布了基准环境与代码

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27536 2026-07-31 cs.GT cs.AI cs.LG cs.MA 新提交 62%

Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games

策略,而非收益:标准型博弈的行为嵌入

Joshua Caiata, Sreepriya Pulyassary, Xiang Li, Kate Larson

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出轻量双特征行为嵌入,可预测大型语言模型在不同标准型博弈间微调后的策略能力变化,证明策略能力迁移由决策行为结构而非收益几何决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27384 2026-07-31 cs.CL cs.AI 新提交 62%

Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models

相同事实,不同诊断:临床语言模型中叙事锚定的测量与缓解

Prabhjot Singh, Pritam Deka, Vijay Chennareddy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Queen’s University Belfast(贝尔法斯特女王大学) Middlesex University London(伦敦密德萨斯大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对临床语言模型的叙事锚定偏差,构建含1000个USMLE案例的基准,提出NarrativeShield三智能体流水线,可大幅降低叙事锚定差距并减少不稳定决策,同时发布数据集供相关研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26273 2026-07-30 cs.LG cs.AI stat.ML 新提交 62%

Top-$k$ Pareto Bandits: Hypervolume Regret for Multi-Objective Slate Selection

Nicolas Gutowski, Fabien Chhel, Alexandre Letard, Sylvain Lamprier

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

Comments 21 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24999 2026-07-29 cs.CL cs.AI 新提交 62%

CogArena: A Multimethod Evaluation of Cognitive Ability Structure in Large Language Models

CogArena:大语言模型认知能力结构的多方法评估

Dengzhe Hou, Lingyu Jiang, Fangzhou Lin, Kazunori D Yamada

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究围绕多方法框架构建CogArena基准评估大语言模型认知能力结构,通过多模型实验,发现范式相关性多为正但组内优势不明显,冻结确认标准及复制均失败,未建立稳定五维分布,提供了结合多种要素的工作流程。

Comments 21 pages, 8 figures. Code and the procedurally generated battery: https://github.com/dengzhe-hou/CogArena

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24577 2026-07-28 cs.LG cs.SE 新提交 62%

Evaluating Fuzz Testing for Reinforcement Learning Agents

评估强化学习智能体的模糊测试

Zhibin Kang, Hanmo You, Dong Wang, Haiming Zheng, Junjie Chen

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 Agent评测 :agent(abstract);分类 cs.LG、cs.SE

AI总结 研究针对强化学习智能体模糊测试评估差异问题,通过在三种环境下统一配置对五种方法及随机测试进行基准测试,从多角度评估,揭示不同方法特点,表明模糊测试能提升智能体鲁棒性等,还给出可操作指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23310 2026-07-28 cs.GT cs.AI cs.LG cs.MA econ.TH 新提交 62%

Online Fair Division with Budget Constraints

具有预算约束的在线公平分配

Saar Cohen, Nicholas Teh, Paul W. Goldberg, Michael J. Wooldridge

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究广义分配预算约束下离散公平分配的在线变体,确定有界密度扩展条件并获近似算法,研究资源增强及刻画保证改进,还开发学习增强框架,证明其性质及单独预测边际的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22667 2026-07-28 cs.AI cs.IT cs.LG cs.RO cs.SY eess.SP eess.SY math.IT 新提交 62%

Reinforcement Learning for Heterogeneous Sensor Selection in Maritime Surveillance

用于海上监视中异构传感器选择的强化学习

Andrei Starodubov, Yaqub Aris Prabowo, Andreas Hadjipieris, Roberto Galeazzi, Ioannis Kyriakides

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对异构海上传感器网络单船跟踪问题,提出信息增益引导的强化学习传感器选择框架,通过近端策略优化智能体选传感器,结合贝叶斯跟踪器估计船只状态,经模拟比较,该策略在单传感器激活下性能接近全传感且避免复杂计算。

Comments 5 pages, 4 figures, submitted to the IEEE MetroSea 2026 Conference: Special Session 13: Object Detection, Tracking, and Sensor Fusion for Maritime Situational Awareness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21619 2026-07-27 cs.CL cs.AI 新提交 62%

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-07-24 cs.AI cs.CL 新提交 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, David R. Pugh, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20465 2026-07-24 cs.LG cs.CL 新提交 62%

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

数据准备基准:评估作为训练数据准备者的大语言模型

Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu, Linzhuang Sun, Meiyi Qiang, Zhaoyang Han, Xiaochen Ma, Bohan Zeng, Ruichuan An, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究院) OriginHub Technology(源创科技)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 研究LLMs作为训练数据准备者的表现,引入DataPrep - Bench统一基准,涵盖数据构建与质量评估,在多领域和模型上评估,发布相关智能体和评估器,为衡量LLM驱动数据准备能力提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19353 2026-07-23 cs.AI cs.LG 新提交 62%

Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX

在英特尔 TDX 下对 NVIDIA H100 上的机密 GPU 推理进行基准测试

Wei Wang, Abdul Hyee Waqas, Burns Smith

机构 * Mozilla

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究在英特尔 TDX 下 NVIDIA H100 GPU 上,比较标准与机密计算模式对语言模型推理的影响。通过两个模型实验,测量多项指标,发现机密模式会使首次令牌时间增加、全局令牌吞吐量下降,较大模型更早饱和,为容量规划提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19317 2026-07-22 cs.LG cs.CL cs.ET 新提交 62%

CircuitKIT : Circuit Discovery, Evaluation, and Application Toolkit for Mechanistic Interpretability

CircuitKIT:用于机理可解释性的电路发现、评估和应用工具包

Pratinav Seth, Hem Gosalia, Aditya Kasliwal, Vinay Kumar Sankarapu

专题命中 Agent评测 :workflow(abstract);分类 cs.CL、cs.LG

AI总结 介绍CircuitKIT工具包,用于机理可解释性的电路分析。它通过可序列化表示连接工作流程,提供发现算法、声明式接口、电路诊断及应用模块,为电路分析提供通用基础设施,解决了现有方法碎片化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18360 2026-07-22 cs.CR cs.AI cs.LG 新提交 62%

HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers

HALLMARK:诊断大语言模型引用验证器中的三种失败模式

Patrik Reizinger, Wieland Brendel

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型引用验证器的失败模式,通过HALLMARK基准测试评估多种验证器,发现误报率决定验证器是否可部署,并具体指出三种失败模式,强调误报率是部署瓶颈,未检测到的伪造对科学记录代价更高。

Comments 59 pages, 7 figures, 40 tables. Benchmark and code: https://github.com/rpatrik96/hallmark (v1.2.0); verification tool: https://github.com/rpatrik96/bibtexupdater (v1.5.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18181 2026-07-21 cs.CL cs.SE 新提交 62%

VEHBench: A Stage-Local Diagnostic Benchmark for LLM-Assisted Vibration Energy Harvester Design

VEHBench:用于大语言模型辅助振动能量采集器设计的阶段局部诊断基准测试

Depeng Su, Yuyu Luo, Guobiao Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 Agent评测 :workflow(abstract);分类 cs.CL、cs.SE

AI总结 研究针对无电池物联网中振动能量采集器设计,引入VEHBench基准测试,评估大语言模型在耦合物理设计不同阶段的表现,通过763个任务及四个设计角色测试,发现模型能力依赖阶段,为评估、选择等工程大语言模型提供阶段感知基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17979 2026-07-21 cs.LG cs.AI 新提交 62%

Harness Engineering for LLM-Driven GPU Kernel Generation

用于大语言模型驱动的GPU内核生成的工具工程

Yue Shui, Chenyu Ma, Hangfei Xu, Shengzhao Wen, Yanpeng Wang

机构 * Baidu, Inc.(百度公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 在MLSys 2026 FlashInfer竞赛中,针对NVIDIA Blackwell B200 GPU,提出以工具为中心的大语言模型驱动的GPU内核优化系统,分离评估工具与优化控制器,利用Codex等生成候选内核,实验显示优化后平均延迟加速显著,且代理辅助内核效果更佳。

Comments 24 pages, 6 figures. Extended technical report on our submission to the MLSys 2026 FlashInfer AI Kernel Generation Contest. Code: https://github.com/syhya/mlsys26-flashinfer-contest

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17765 2026-07-21 cs.LG cs.AI cs.DB 新提交 62%

FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents: Four Models, a Bookmaker, and 104 Matches

2026年国际足联世界杯作为语言模型预测代理的无污染基准:四个模型、一个博彩公司和104场比赛

Jiacheng Ding, Cong Guo, Jason Xu

机构 * University of Memphis(孟菲斯大学) QuantaInsight(量子洞察)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 介绍WC2026-Agents基准和数据集,用于评估大语言模型作为世界杯预测代理。四个前沿模型对104场比赛运行相同循环,与博彩市场数据配对。揭示模型预测虽有相同首选,但在决策质量等方面差异大,可衡量校准等方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17205 2026-07-21 cs.AI cs.SE 新提交 62%

A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents

代码智能体LoRA微调的轨迹数据管理系统评估

Yunze Han

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究代码智能体LoRA微调中轨迹数据管理,提出效率和风格两轴质量评分框架,经16个控制实验评估,揭示规模依赖的质量-数量权衡及错误重试率是主要子维度,为代码智能体监督微调提供可行手段与评估协议。

Comments 12 pages, 2 figures. Author's accepted manuscript of a paper published in the ICIC 2026 proceedings (oral presentation)

Journal ref In: Huang, D.S., Li, B., Zhang, Q., Bao, W. (eds) Advanced Intelligent Computing Technology and Applications. ICIC 2026. Lecture Notes in Computer Science, vol 16669, pp. 39-50. Springer, Singapore (2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16062 2026-07-20 cs.LG cs.AI 新提交 62%

When Model Merging Rivals Joint Multi-Task Reinforcement Learning: A Task-Vector Geometry Analysis

当模型合并与联合多任务强化学习相抗衡时:任务向量几何分析

S. Aaron McClendon

机构 * Aimpoint Digital Labs(Aimpoint数字实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究在强化学习中模型合并能否替代联合多任务训练,通过训练Qwen3 - 8B专家并合并,与联合训练模型对比,发现任务向量几何结构中方向和支持解耦,合并效果与联合训练相当,还发布了代码和统计数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13618 2026-07-16 cs.AI cs.LG 新提交 62%

STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle

库存盘点:使用公平预言机测量大语言模型智能体中感知与行动之间的差距

Sagar Deb, Ashwanth Krishnan

机构 * QpiAI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体在多周决策任务中的知行差距,提出库存盘点基准,通过公平参考策略区分感知与行动失败,测量知行差距两方向,为评估大语言模型智能体提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13041 2026-07-16 cs.CY cs.AI cs.LG cs.MM 新提交 62%

LessonBench-V1: A Benchmark Dataset for Evaluating AI Lesson Generation Agents

LessonBench-V1:用于评估人工智能课程生成代理的基准数据集

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, UK(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国) Department of Physics and Mathematics, Nottingham Trent University, Nottingham, UK(物理与数学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对无标准化基准评估人工智能课程生成系统的问题,引入LessonBench-V1基准数据集,其含人工编写课程与逆向工程课程计划,经人工审核并综合多种教学方法生成,可系统评估相关代理,还提出三维评估管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12523 2026-07-15 cs.LG cs.AI 新提交 62%

OOD-RL-Bench: A Benchmark Framework for Out-of-Distribution Detection in Reinforcement Learning

OOD-RL-Bench:强化学习中分布外检测的基准框架

Emil Mittag, Richard Dazeley, Peter Vamplew

机构 * Deakin University(迪肯大学) Federation University Australia(澳大利亚联邦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对强化学习中分布外检测问题,提出OOD-RL-Bench框架,通过共享接口集成检测器与异常注入器,在LunarLander-v3环境评估其效用,揭示不同异常类型性能差异,还公开相关成果以便重现。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11267 2026-07-14 cs.IR cs.AI cs.CL 新提交 62%

Enhancing LLMs through human feedback: a journey towards self-improvement

通过人类反馈增强语言模型:自我提升之旅

Tatiana Pelc, Gila Kamhi, Asaf Avrahamy, Adi Fledel-Alon

机构 * Intel Corporation(英特尔公司)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究在信息检索系统中,通过整合辅助反馈RAG系统及人工参与,利用人类反馈优化主RAG系统性能,经多数据集测试验证方法有效,强调了其变革潜力,为自适应信息检索技术研究树立了先例。

Comments AIC 2025: The 10th International Workshop on Artificial Intelligence and Cognition (held as part of ECAI 2025). October 25-26, 2025. Bologna, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10963 2026-07-14 cs.LG cs.AI cs.CG cs.GT econ.TH 新提交 62%

Efficient Online Proportional Sampling with Applications to Smoothed Online Learning

高效在线比例采样及其在平滑在线学习中的应用

Amirmahdi Mirfakhar, Maria-Florina Balcan, Hedyeh Beyhaghi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究高维域在线比例采样问题,设计支持高效更新和采样的数据结构,在不同对手下证明数据结构深度界,应用于在线学习获高效无悔算法及次线性遗憾保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08373 2026-07-10 cs.LG cs.AI 新提交 62%

Self-Adaptive Anomaly Detection with Reinforcement Learning and Human Feedback in Connected Vehicles

基于强化学习和人工反馈的车联网自适应异常检测

Matthias Weiß, Athreya Hosahalli Prakash, Maurice Artelt, Falk Dettinger, Nasser Jazdi, Michael Weyrich

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文针对车联网运行中行为监测的挑战,提出集成强化学习、统计监测和人工反馈的在线异常检测框架,通过自注意力选择检测器、多检测器集成及人工再训练机制,在测试平台上实现持续自适应且避免灾难性遗忘。

Comments Accepted at the 30th IEEE International Conference on Emerging Technologies and Factory Automation (ETFA 2026), Special Session SS10: Evaluation Methods for Autonomous Cyber-Physical Systems' Behavior. 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07985 2026-07-10 cs.CL cs.AI cs.SD eess.AS 新提交 62%

A Reliability Assessment of LALM Audio Judges for Full-Duplex Voice Agents

全双工语音智能体的LALM音频评判的可靠性评估

A. Sayyad, J. Emmons, S. Jones, T. Lin, H. Krishnan

机构 * Salesforce Applied AI Research(Salesforce应用人工智能研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究评估Gemini模型作为全双工语音智能体音频评判的可靠性,以Gemini 2.5 Flash为基准与人类评分者对比,测试多个维度,发现其在一些维度表现良好,不同模型有差异,确定部署需谨慎领域,为LALM部署提供实证依据。

Comments 28 pages total (12 main body, 1 reference, 15 appendix). In main body: 2 diagrams, 3 table, 2 charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07436 2026-07-09 cs.AI cs.CL cs.CR 新提交 62%

The Blind Curator: How a Biased Judge Silently Disables Skill Retirement in Self-Evolving Agents

盲选策展人:有偏见的评判者如何在自我进化的智能体中悄然阻碍技能淘汰

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(亚马逊云科技生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究自我进化智能体中,有偏见的评判者对技能淘汰的影响。通过损坏奖励分析等方法发现,“误判通过”偏差会导致技能淘汰机制失效,此为行为安全结果。还提出廉价审计可判断评判者是否越过阈值影响智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06713 2026-07-09 cs.SE cs.AI 新提交 62%

Reliable and Developer-Aligned Evaluation of Agents for Software Engineering

软件工程中智能体的可靠且与开发者一致的评估

Razvan Mihai Popescu

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型驱动智能体评估技术的局限,提出基于实际软件开发实践的综合评估方法,通过污染感知、实际行为评估及轨迹感知基准指标,来弥合差距,实现可靠且与开发者一致的评估。

Comments International Conference on the Foundations of Software Engineering '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交 62%

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05155 2026-07-07 cs.CL cs.LG 新提交 62%

EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments

EdgeBench:揭示从真实环境中学习的缩放定律

Deyao Zhu, Xin Zhou, Shengling Qin, Xuekai Zhu, Hangliang Ding, Shu Zhong, Zixin Wen, Zhonglin Xie, Chenhui Gou, Linxuan Ren, Yueyang Wang, Junfeng Zhong, Rui Liu, Tian Gao, Yangguang Lin, Jingyuan Zhang, Maojia Song, Xuan Qi, Jinhong Wu, Chenyang Zhang, Yinzhu Piao, Ziru Niu, Hongbin Lin, Lingxiang Meng, Peng Tang, Chengyao Tang, Shanyu Wu, Huanyu Zheng, Yu Liu, Liya Zhu, He Wang, Ming Ding, Ziyu Wan, Hao Liu, Sibo Wang, Haotian Zhu, Xintian Zhang, Nan Chai, Yipeng Liu, Panhao Lai, Sihang Yuan, Zixin Su, Ge Zhang, Wangchunshu Zhou, Yantao Du, Wenhao Huang, Guang Shi

机构 * ByteDance(字节跳动)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出含134项长周期真实任务的EdgeBench平台,通过分析大量智能体交互数据,发现环境学习性能符合对数S型缩放定律,为智能体现实经验学习研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏