arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2603.15831 2026-03-18 cs.AI cs.CL 73%

Persona-Conditioned Risk Behavior in Large Language Models: A Simulated Gambling Study with GPT-4.1

具有人格条件的风险行为在大语言模型中的表现:基于GPT-4.1的模拟赌博研究

Sankalp Dubedy

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过模拟赌博实验研究GPT-4.1在不同社会经济人格下的风险行为,发现其行为符合卡尼曼和特沃斯基的前景理论预测,揭示了大语言模型潜在的认知偏差。

Comments 21 pages, 13 figures, 9 tables. Independent research. Submitted to arXiv for open dissemination

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15372 2026-03-17 cs.SE cs.AI cs.CR 73%

SKILLS: Structured Knowledge Injection for LLM-Driven Telecommunications Operations

SKILLS: 为基于LLM的电信运维进行结构化知识注入

Ivo Brett

机构 * independent.academia.edu(独立学术教育)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨LLM在电信运维中执行API流程的可靠性,提出SKILLS框架,通过结构化知识指导提升模型性能,实验显示技能增强效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00718 2026-03-11 cs.CL cs.SE 73%

SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?

SkillCraft: 能否让大语言模型代理学会灵活使用工具?

Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 SkillCraft基准通过测试代理形成和重用高阶工具组合的能力,评估大语言模型在工具使用中的效率提升与技能积累。

Comments 21 pages. Code: https://github.com/shiqichen17/SkillCraft ; Project page: https://skillcraft-website.github.io/page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07886 2026-03-10 cs.CL cs.AI 73%

CCR-Bench: A Comprehensive Benchmark for Evaluating LLMs on Complex Constraints, Control Flows, and Real-World Cases

CCR-Bench:一个全面的评估基准,用于评估大语言模型在复杂约束、控制流和现实世界案例中的能力

Xiaona Xue, Yiqiao Huang, Jiacheng Li, Yuanhang Zheng, Huiqi Miao, Yunfei Ma, Rui Liu, Xinbao Sun, Minglu Liu, Fanyu Meng, Chao Deng, Junlan Feng

专题命中 Agent评测 :planning(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 CCR-Bench是一个用于评估大语言模型在复杂约束、控制流和现实世界案例中表现的全面基准,通过现实工业场景的样本揭示了当前模型在复杂指令理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19223 2026-03-10 cs.AI cs.LG cs.MA 73%

Characterizing MARL for Energy Control: A Multi-KPI Benchmark on the CityLearn Environment

对MARL在能源控制中的特性进行表征:在CityLearn环境中的一项多KPI基准测试

Aymen Khouja, Imen Jendoubi, Oumayma Mahjoub, Oussama Mahfoudhi, Ruan De Kock, Siddarth Singh, Claude Formanek

机构 * InstaDeep

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过多KPI基准测试,评估了MARL在城市能源管理中的性能,揭示了DTDE在平均和最坏情况下的优越性,并探讨了时间依赖学习对电池操作的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05028 2026-03-06 cs.AI cs.CL 73%

Survive at All Costs: Exploring LLM's Risky Behaviors under Survival Pressure

在生存压力下:探索LLM的冒险行为

Yida Lu, Jianwei Fang, Xuyang Shao, Zixuan Chen, Shiyao Cui, Shanshan Bian, Guangyao Su, Pei Ke, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,DCST,清华大学) China Unicom Software Research Institute(中国联合软件研究所) University of Electronic Science and Technology of China(电子科技大学) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了在生存压力下LLM的冒险行为,通过现实案例和基准测试揭示其潜在风险及缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13575 2026-03-03 cs.CL cs.AI 73%

Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment

Elo-Evolve:一种用于语言模型对齐的共进化框架

Jing Zhao, Ting Zhen, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang, Beijing, China(北京中关村)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Elo-Evolve通过动态多代理竞争和自适应对手选择,提升大型语言模型对齐的稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24282 2026-03-03 cs.CL cs.AI 73%

SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents

SimuHome: 一个时间与环境感知的智能家庭LLM代理基准

Gyuhyeon Seo, Jungwoo Yang, Junseong Pyo, Nalim Kim, Jonggeun Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Information Systems, Hanyang University(翰阳大学信息系统系)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 SimuHome是一个基于Matter协议的智能家庭LLM代理基准,用于评估智能家庭代理在时间与环境感知方面的能力,特别是工作流调度的挑战。

Comments Accepted at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00051 2026-03-03 cs.DL cs.AI cs.LG 73%

LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks

LitBench: 一种面向文献任务的图中心大型语言模型基准评估工具

Andreas Varvarigos, Ali Maatouk, Jiasheng Zhang, Ngoc Bui, Jialin Chen, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 LitBench是一种用于评估领域特定文献任务的大型语言模型基准工具,通过生成领域特定的文献子图和任务集,提升模型在文献相关任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20640 2026-03-02 cs.AI cs.LG 73%

CoMind: Towards Community-Driven Agents for Machine Learning Engineering

CoMind:面向机器学习工程的社区驱动代理

Sijie Li, Weiwei Sun, Shanda Li, Ameet Talwalkar, Yiming Yang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 CoMind通过多代理系统和迭代并行探索机制,在Kaggle竞赛中实现了优于人类竞争者的性能,展示了社区驱动代理在机器学习工程中的潜力。

Comments ICLR 2026. Code available at https://github.com/comind-ml/CoMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18998 2026-02-24 cs.AI cs.CL 73%

Benchmark Test-Time Scaling of General LLM Agents

通用大语言模型代理的基准测试时间扩展

Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Meta

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 研究提出General AgentBench基准测试,用于评估通用大语言模型代理在多个技能和工具上的表现,发现顺序和并行扩展方法在实际应用中均存在性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03267 2026-02-19 cs.AI cs.CL 73%

GDGB: A Benchmark for Generative Dynamic Text-Attributed Graph Learning

GDGB:生成动态文本属性图学习的基准

Jie Peng, Jiarui Ji, Runlin Lei, Zhewei Wei, Yongchao Liu, Chuntao Hong

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 GDGB提出一个生成动态文本属性图学习的基准,包含高质量数据集和两个新任务,用于评估生成DyTAG的结构、时间和文本质量。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16191 2026-02-19 cs.AI cs.HC cs.LG 73%

Large Language Models for Water Distribution Systems Modeling and Decision-Making

大型语言模型在水分配系统建模与决策中的应用

Yinon Goldshtein, Gal Perelman, Assaf Schuster, Avi Ostfeld

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-EPANET框架,利用大型语言模型实现与EPANET的自然语言交互,提升水分配系统建模与决策的效率和透明度。

Comments Accepted to EWRI Congress 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13275 2026-02-17 cs.AI cs.CL 73%

Artificial Organisations

人工组织

William Waites

机构 * University of Southampton(南安普顿大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过机构设计实现多智能体AI系统可靠性的方法,通过信息隔离和对抗性审查,使不可靠个体组件产生可靠集体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12517 2026-02-16 cs.LG cs.AI cs.MA math.OC 73%

Bench-MFG: A Benchmark Suite for Learning in Stationary Mean Field Games

Bench-MFG:用于在平稳均场博弈中学习的基准测试套件

Lorenzo Magnino, Jiacheng Shen, Matthieu Geist, Olivier Pietquin, Mathieu Laurière

机构 * University of Cambridge(剑桥大学) NYU Shanghai(纽约大学上海分校) NYU Center for Data Science(纽约大学数据科学中心) Earth Species Project(地球物种计划) NYU-ECNU Institute of Mathematical Sciences at NYU Shanghai(纽约大学上海分校数学科学研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 Bench-MFG提出了一套用于评估MFG学习方法的基准测试套件,通过分类问题类型和生成随机实例,提供标准化的实验框架和评估指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10081 2026-02-13 cs.CL cs.AI 73%

Anagent For Enhancing Scientific Table & Figure Analysis

一个增强科学表格及图表分析的代理

Xuehang Guo, Zhiyong Lu, Tom Hope, Qingyun Wang

机构 * College of William \& Mary The Allen Institute for AI (AI2)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Anagent通过多代理框架提升科学表格及图表分析的准确性和效率,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22130 2026-02-12 cs.AI cs.SE 73%

World of Workflows: A Benchmark for Bringing World Models to Enterprise Systems

世界工作流:一个将世界模型引入企业系统的基准

Lakshya Gupta, Litao Li, Yizhe Liu, Sriram Ganapathi Subramanian, Kaheer Suleman, Zichen Zhang, Haoye Lu, Sumit Pasupalak

专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 World of Workflows提出一个基于ServiceNow的企业系统基准,揭示前沿LLMs在动态建模中的盲区,并强调基于现实世界建模的可靠性需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05636 2026-02-10 cs.AI cs.CL 73%

Generative Ontology: When Structured Knowledge Learns to Create

生成本体:当结构化知识学会创造

Benny Cheung

机构 * Dynamind Research(Dynamind研究)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 生成本体通过融合本体结构与LLM创造力,实现结构化知识生成,展示了在桌游设计中的有效性及跨领域应用潜力。

Comments 19 pages, 12 figures, 8 tables. v2: added empirical evaluation (3 studies: ablation, benchmark, reliability), expanded related work, discussion section, appendices. Code available at https://github.com/bennycheung/GameGrammarCLI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01392 2026-02-10 cs.CL cs.AI cs.CV 73%

ComfyBench: Benchmarking LLM-based Agents in ComfyUI for Autonomously Designing Collaborative AI Systems

ComfyBench:在ComfyUI中基于LLM的代理自主设计协作AI系统的基准测试

Xiangyuan Xue, Zeyu Lu, Di Huang, Zidong Wang, Wanli Ouyang, Lei Bai

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 ComfyBench通过评估基于LLM的代理在ComfyUI中自主设计协作AI系统的能力,提出ComfyAgent框架,展示其在任务解决中的性能与潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03468 2026-02-04 cs.AI cs.LG 73%

IntentRL: Training Proactive User-intent Agents for Open-ended Deep Research via Reinforcement Learning

IntentRL: 通过强化学习训练主动的用户意图代理以进行开放性深度研究

Haohao Luo, Zexi Li, Yuexiang Xie, Wenhao Zhang, Yaliang Li, Ying Shen

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 IntentRL通过强化学习训练主动用户意图代理,提升开放性深度研究的意图识别与任务性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02760 2026-02-04 cs.CL cs.LG 73%

From Task Solving to Robust Real-World Adaptation in LLM Agents

从任务解决到在LLM代理中的鲁棒现实适应

Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加戈恩实验室)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM代理在现实环境中的鲁棒适应能力,发现任务解决与实际部署鲁棒性存在显著差距,揭示了在部分可观测性和噪声环境下代理的决策挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02589 2026-02-04 cs.AI cs.LG 73%

PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review

PeerRank: 通过基于网络的、受偏见控制的同行评审实现自主LLM评估

Yanki Margalit, Erni Avram, Ran Taig, Oded Margalit, Nurit Cohen-Inger

机构 * Computer Science and Information, Ben-Gurion University of the Negev(本·加里翁大学(内盖夫)计算机科学与信息学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 PeerRank通过基于网络的、受偏见控制的同行评审实现自主LLM评估,产生稳定且具有区分性的排名,并揭示可测量的身份和呈现偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01171 2026-02-03 cs.AI cs.CL cs.LO 73%

ASP-Bench: From Natural Language to Logic Programs

ASP-Bench: 从自然语言到逻辑程序

Stefan Szeider

机构 * Algorithms and Complexity Group TU Wien(算法与复杂性组维也纳技术大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 ASP-Bench通过自然语言到逻辑程序的转换基准,评估了基于ReAct框架的代理方法,揭示了建模难度的多维因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13448 2026-02-03 cs.MA cs.AI cs.ET cs.LG 73%

BMG-Q: Localized Bipartite Match Graph Attention Q-Learning for Ride-Pooling Order Dispatch

BMG-Q:局部双图匹配图注意力Q学习用于拼车订单调度

Yulong Hu, Siyuan Feng, Sen Li

机构 * Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系) Intelligent Transportation Thrust, Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)智能交通 thrust,系统中心) Department of Aeronautical and Aviation Engineering, The Hong Kong Polytechnic University(香港理工大学航空与航空工程系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 BMG-Q通过局部双图匹配图注意力Q学习提升拼车订单调度的决策效率与鲁棒性。

Journal ref IEEE Transactions on Intelligent Transportation Systems ( Volume: 26, Issue: 10, October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21903 2026-02-02 cs.SE cs.AI 73%

TOM-SWE: User Mental Modeling For Software Engineering Agents

TOM-SWE:软件工程代理的用户心理建模

Xuhui Zhou, Valerie Chen, Zora Zhiruo Wang, Graham Neubig, Maarten Sap, Xingyao Wang

机构 * Language Technology Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 TOM-SWE通过双代理架构实现用户心理建模,提升软件工程代理的任务成功率和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21096 2026-01-30 cs.AI cs.LG cs.PL 73%

Magellan: Autonomous Discovery of Novel Compiler Optimization Heuristics with AlphaEvolve

Magellan:利用AlphaEvolve自主发现新型编译器优化启发式方法

Hongzheng Chen, Alexander Novikov, Ngân Vũ, Hanna Alam, Zhiru Zhang, Aiden Grossman, Mircea Trofin, Amir Yazdanbakhsh

机构 * Google(谷歌) Google DeepMind(谷歌DeepMind) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 Magellan通过AlphaEvolve自主发现新型编译器优化启发式方法,提升编译器优化效率与性能。

Comments Accepted to C4ML@CGO'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13561 2026-01-30 cs.SE cs.AI 73%

OpenDerisk: An Industrial Framework for AI-Driven SRE, with Design, Implementation, and Case Studies

OpenDerisk: 一个面向AI驱动SRE的工业框架,包含设计、实现与案例研究

Peng Di, Faqiang Chen, Xiao Bai, Hongjun Yang, Qingfeng Li, Ganglin Wei, Jian Mou, Feng Shi, Keting Chen, Peng Tang, Zhitao Shen, Zheng Li, Wenhui Shi, Junwei Guo, Hang Yu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 OpenDerisk是一个专为SRE设计的开源多智能体框架,通过整合诊断协作模型、推理引擎和知识引擎,实现复杂问题的自动化解决,已在蚂蚁集团大规模部署并验证其高效性和可扩展性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08235 2026-01-27 cs.AI cs.CL 73%

MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents

MPCI-Bench: 一种用于语言模型代理多模态成对情境完整性评估的基准

Shouju Wang, Haopeng Zhang

机构 * University of Hawaii at Manoa(夏威夷大学曼瑙分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 MPCI-Bench是首个用于评估语言模型代理多模态情境完整性隐私行为的基准,揭示了现有模型在隐私与效用平衡及模态泄漏方面的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04663 2026-01-27 cs.CL cs.LG cs.MA 73%

Debate, Deliberate, Decide (D3): A Cost-Aware Adversarial Framework for Reliable and Interpretable LLM Evaluation

辩论、 deliberative、决定(D3):一种成本意识的对抗框架,用于可靠且可解释的LLM评估

Abir Harrasse, Chaithanya Bandi, Hari Bandi

机构 * Martian NUS(新加坡国立大学) MIT(麻省理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 D3是一种通过结构化辩论和聚合机制提升LLM评估可靠性和可解释性的对抗框架,通过预算停止机制优化成本效率。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11868 2026-01-21 cs.SE cs.AI 73%

Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces

终端基准:在命令行界面中对硬、现实任务的智能体基准测试

Mike A. Merrill, Alexander G. Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, E. Kelly Buchanan, Junhong Shen, Guanghao Ye, Haowei Lin, Jason Poulos, Maoyu Wang, Marianna Nezhurina, Jenia Jitsev, Di Lu, Orfeas Menis Mastromichalakis, Zhiwei Xu, Zizhao Chen, Yue Liu, Robert Zhang, Leon Liangyu Chen, Anurag Kashyap, Jan-Lucas Uslu, Jeffrey Li, Jianbo Wu, Minghao Yan, Song Bian, Vedang Sharma, Ke Sun, Steven Dillmann, Akshay Anand, Andrew Lanpouthakoun, Bardia Koopah, Changran Hu, Etash Guha, Gabriel H. S. Dreiman, Jiacheng Zhu, Karl Krauth, Li Zhong, Niklas Muennighoff, Robert Amanfu, Shangyin Tan, Shreyas Pimpalgaonkar, Tushar Aggarwal, Xiangning Lin, Xin Lan, Xuandong Zhao, Yiqing Liang, Yuanli Wang, Zilong Wang, Changzhi Zhou, David Heineman, Hange Liu, Harsh Trivedi, John Yang, Junhong Lin, Manish Shetty, Michael Yang, Nabil Omi, Negin Raoof, Shanda Li, Terry Yue Zhuo, Wuwei Lin, Yiwei Dai, Yuxin Wang, Wenhao Chai, Shang Zhou, Dariush Wahdany, Ziyu She, Jiaming Hu, Zhikang Dong, Yuxuan Zhu, Sasha Cui, Ahson Saiyed, Arinbjörn Kolbeinsson, Jesse Hu, Christopher Michael Rytting, Ryan Marten, Yixin Wang, Alex Dimakis, Andy Konwinski, Ludwig Schmidt

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 终端基准2.0通过89个计算机终端环境中的硬任务,评估智能体在现实任务中的表现,并揭示模型改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏