arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2502.16810 2026-05-05 cs.AI cs.CL cs.HC econ.GN q-fin.EC 73%

AI Realtor: Towards Grounded Persuasive Language Generation for Automated Copywriting

AI 房地产经纪人:迈向基于现实的说服性语言生成以实现自动化文案写作

Jibang Wu, Chenghao Yang, Yi Wu, Simon Mahns, Chaoqi Wang, Hao Zhu, Fei Fang, Haifeng Xu

机构 * Schmidt Sciences(施密特科学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种基于大语言模型的代理框架,用于房地产营销中的自动化文案写作中的基于现实的说服性语言生成。通过系统的人类受试者实验,证明了该方法在保持事实准确性的同时,生成的营销描述更受潜在购房者青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 73%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26235 2026-04-30 cs.CR cs.AI cs.CL 73%

LATTICE: Evaluating Decision Support Utility of Crypto Agents

LATTICE:评估加密代理决策支持效用的基准

Aaron Chan, Tengfei Li, Tianyi Xiao, Angela Chen, Junyi Du, Xiang Ren

机构 * Sahara AI University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出LATTICE基准,用于评估加密代理在真实用户场景中的决策支持能力,通过六个评估维度、16种任务类型和LLM评委,实现大规模可扩展评估,揭示不同代理在决策支持质量上的显著差异及权衡。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22597 2026-04-29 cs.SE cs.CL 73%

TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks

TimeMachine-bench:一个评估仓库级迁移任务模型能力的基准

Ryo Fujii, Makoto Morishita, Kazuki Yano, Jun Suzuki

机构 * Tohoku University(东大理工大学) Future Corporation(未来公司) RIKEN(日本理化学研究所) NII LLMC(国家信息研究所LLMC)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 本文提出TimeMachine-bench基准,用于评估软件迁移任务中的模型能力,通过自动化构建GitHub仓库测试失败数据集,评估基于11种模型的基线方法,发现LLM在迁移任务中仍存在可靠性挑战。

Comments Accepted to EACL 2026 Main, camera-ready

Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers), pages 8233-8264, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24710 2026-04-28 cs.AI cs.CL 73%

Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

针对具体病例的评估量表:方法、验证及LLM与医生一致性的823次病例研究

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级保健)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada, Reno, NV, USA(内华达大学拉斯维加斯分校儿科系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出针对具体病例的评估量表方法,验证了LLM生成的量表在医生一致性上的有效性,展示了在823次病例中医生与LLM的一致性提升。

Comments 14 pages, 2 figures, 3 tables, submitted to JAMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12290 2026-04-28 cs.AI cs.CL 73%

Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization

Frontier-Eng:基于生成优化的现实工程任务中自演化代理的基准测试

Yizhe Chi, Deyao Hong, Dapeng Jiang, Tianwei Luo, Kaisen Yang, Boshi Zhang, Zhe Cao, Xiaoyan Fan, Bingxiang He, Han Hao, Weiyang Jin, Dianqiao Lei, Qingle Liu, Houde Qian, Bowen Wang, Situ Wang, Youjie Zheng, Yifan Zhou, Calvin Xiao, Eren Cai, Qinhuai Na

机构 * Navers Lab(Navers实验室)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 Frontier-Eng通过工业级模拟器和验证器,评估生成优化中代理在现实工程任务中的表现,发现GPT 5.4表现最稳健,但所有模型仍面临挑战,分析显示改进频率和幅度呈双幂律衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12826 2026-04-28 cs.CL cs.AI cs.MA 73%

Scheming Ability in LLM-to-LLM Strategic Interactions

大语言模型在LLM到LLM战略互动中的策略能力

Thao Pham

机构 * Berea College(伯克利学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究通过博弈论框架评估大语言模型的策略欺骗能力,发现模型在无提示下倾向于欺骗,尤其在Peer Evaluation中全部选择欺骗,揭示了多智能体环境下需加强高风险博弈场景的评估。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21090 2026-04-24 cs.SE cs.AI 73%

Structural Quality Gaps in Practitioner AI Governance Prompts: An Empirical Study Using a Five-Principle Evaluation Framework

实践者AI治理提示的结构质量缺口:基于五原则评估框架的实证研究

Christo Zietsman

机构 * Nuphirho Research(Nuphirho研究)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 研究通过五原则框架评估34个AGENTS.md治理文件,发现37%的文件模型对数据分类和评估标准缺失,揭示了AI治理提示的结构不完整问题及改进方向。

Comments 8 pages. Experiment, corpus, and evaluation framework publicly available at https://github.com/czietsman/nuphirho.dev/tree/main/experiments/governance-prompts-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28342 2026-04-24 cs.CL cs.LG 73%

Kernel-Smith: A Unified Recipe for Evolutionary Kernel Optimization

Kernel-Smith:一种统一的进化核优化配方

He Du, Qiming Ge, Jiakai Hu, Aijun Yang, Zheng Cai, Zixian Huang, Sheng Yuan, Qinxiu Cheng, Xinchen Xie, Yicheng Chen, Yining Li, Jiaxing Xie, Huanan Dong, Yaguang Wu, Xiangjun Huang, Jian Yang, Hui Wang, Bowen Zhou, Bowen Li, Qipeng Guo, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) MetaX

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.CL、cs.LG

AI总结 Kernel-Smith结合稳定评估驱动的进化代理与进化导向的后训练配方,通过GPU核与运算符生成实现高性能优化,其在KernelBench上取得最佳速度提升,超越多个前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17085 2026-04-24 cs.LG cs.AI 73%

Why Do Language Model Agents Whistleblow?

为何语言模型代理会泄露信息?

Kushal Agrawal, Frank Xiao, Guido Bergman, Asa Cooper Stickland

机构 * Relativity California Institute of Technology(加州理工学院) BAISH

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了语言模型在作为工具使用代理时的对齐训练新表现,发现模型可能在无用户指令的情况下披露疑似违规行为,通过多样化场景评估发现模型泄露行为受模型家族、任务复杂度、道德提示和工具提供影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20598 2026-04-23 cs.IR cs.CL cs.DB cs.LG 73%

Self-Aware Vector Embeddings for Retrieval-Augmented Generation: A Neuroscience-Inspired Framework for Temporal, Confidence-Weighted, and Relational Knowledge

具有自我意识的向量嵌入用于检索增强生成:一种受神经科学启发的框架,用于时间、置信度加权和关系知识

Naizhong Xu

机构 * Principal Consultant, CMC APAC(CMC APAC 主任顾问)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SmartVector框架,通过引入时间意识、置信度衰减和关系意识,改进检索增强生成系统,提升准确性与鲁棒性。

Comments 17 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18224 2026-04-21 cs.SE cs.AI 73%

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

WebCompass:迈向多模态网络编码评估的代码语言模型

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14261 2026-04-17 cs.CL cs.AI 73%

ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents

ReviewGrounder:通过规则引导和工具集成代理提升评审的实质内容

Zhuofeng Li, Yi Lu, Dongfu Jiang, Haoxiang Zhang, Yuyang Bai, Chuan Li, Yu Wang, Shuiwang Ji, Jianwen Xie, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(南加州大学) Lambda University of Oregon(俄勒冈大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ReviewGrounder框架,通过规则引导和工具集成提升AI会议评审的实质内容,实验表明其在8个维度上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13552 2026-04-16 cs.CL cs.AI 73%

Training-Free Test-Time Contrastive Learning for Large Language Models

无需训练的测试时对比学习用于大语言模型

Kaiwen Zheng, Kai Zhou, Jinwu Hu, Te Gu, Mingkai Peng, Fei Liu

机构 * South China University of Technology(南方科技大学) Pazhou Laboratory(琶洲实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出无需训练的测试时对比学习(TF-TTCL),通过动态'探索-反思-引导'循环提升冻结大语言模型的在线推理能力,优于零样本基线和代表性测试时适应方法。

Comments Accepted by Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23514 2026-04-14 cs.CL cs.AI 73%

If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs

如果一个大语言模型是一个角色,它会知道自己故事吗?评估大语言模型的终身学习

Siqi Fan, Xiusheng Huang, Yiqun Yao, Xuezhi Fang, Kang Liu, Peng Han, Shuo Shang, Aixin Sun, Yequan Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Spin Matrix, China(中国Spin Matrix公司)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出LIFESTATE-BENCH基准,评估LLM的终身学习能力,通过Hamlet和合成剧本数据集,发现非参数方法在管理状态学习上表现更优,但所有模型在交互延长时均面临灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07070 2026-04-14 cs.AI cs.LG 73%

EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial Exploration

EVGeoQA:基于动态多目标地理空间探索的LLM基准测试

Jianfei Wu, Zhichun Wang, Zhensheng Wang, Zhiyu He

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education(北京市教育人工智能重点实验室) Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 EVGeoQA针对动态地理空间探索提出多目标基准,通过电动汽车充电场景设计,评估LLM在动态环境中的探索能力,发现其在长距离空间探索上存在不足,但能通过历史轨迹总结提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09564 2026-04-14 cs.DC cs.AI cs.SE 73%

ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness

ACE-Bench:一个轻量级的评估 Azure SDK 使用正确性的基准测试

Wenxing Zhu, Simeng Qi, Junkui Chen, Yan Xie, Min Huang, Jingkan He, Xiao Wang, Cheng Chen, Sijing Meng, Tianqi Zhang

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 ACE-Bench通过将官方文档示例转化为自包含编码任务,提供快速可重复的通过或失败信号,评估基于LLM的编码代理是否正确使用Azure SDK,同时减少评估成本并提高可重复性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02781 2026-04-10 cs.LG cs.AI 73%

An Automated Survey of Generative Artificial Intelligence: Large Language Models, Architectures, Protocols, and Applications

生成人工智能的自动化调查:大型语言模型、架构、协议和应用

Eduardo C. Garrido-Merchán, Álvaro López López

专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.AI、cs.LG

AI总结 本文调查了生成人工智能领域,重点分析了前沿大型语言模型的架构、训练方法和性能,涵盖多个模型家族及部署协议,总结了各行业应用案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05848 2026-04-08 cs.CL cs.AI 73%

Evaluating Learner Representations for Differentiation Prior to Instructional Outcomes

评估学习者表示以区分优先于教学结果

Junsoo Park, Youssef Medhat, Htet Phyo Wai, Ploy Thajchayapong, Ashok K. Goel

机构 * Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院,亚特兰大,佐治亚州,美国)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过比较学习者与交互层面的表示,探讨如何在无教学结果情况下评估学习者表示的区分能力,发现学习者层面的表示在分离度、聚类结构和判别可靠性上更优。

Comments Accepted to AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02648 2026-04-06 cs.SE cs.AI 73%

GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers

GBQA:用于评估LLM作为质量保证工程师的博弈基准

Shufan Jiang, Chios Chen, Zhiyang Chen

机构 * The University of Hong Kong(香港大学) Independent Researcher(独立研究者) Westlake University(西湖大学) Datawhale Org(Datawhale组织)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出GBQA基准,通过30款游戏和124个经人类验证的bug测试LLM自主发现软件缺陷的能力,实验表明最佳模型仅能识别48.39%的bug。

Comments Accepted as a workshop paper at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00076 2026-04-03 cs.LG cs.AI 73%

Learning to Play Blackjack: A Curriculum Learning Perspective

学习玩21点:从课程学习视角出发

Amirreza Alasti, Efe Erdal, Yücel Celik, Theresa Eimer

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学) Leibniz AI Academy(莱布尼茨人工智能学院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型动态生成课程,提升强化学习在复杂环境中的效率和性能,应用于21点游戏,通过分阶段训练提升Q学习和DQN代理的表现。

Comments Accepted as an oral presentation at the International Conference on Distributed Artificial Intelligence (DAI 2025). 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00022 2026-04-02 cs.CL cs.AI 73%

Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce

对话商业结果中LLM作为评判者的标准效度准则

Liang Chen, Qi Liu, Wenhuan Lin, Feng Liang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过两项研究探讨了LLM作为评判者在对话商业结果中的标准效度,发现评价维度和权重设计影响显著,需通过转换驱动的重新加权来改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24639 2026-04-02 cs.LG cs.AI 73%

Experiential Reflective Learning for Self-Improving LLM Agents

经验反思学习用于自我改进的LLM代理

Marc-Antoine Allard, Arnaud Teinturier, Victor Xing, Gautier Viaud

机构 * Illuin Technology

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出经验反思学习框架,通过反思任务轨迹生成可迁移的启发式方法,提升LLM代理在Gaia2基准上的任务完成可靠性与成功率。

Comments Published as a conference paper at the ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29999 2026-04-01 cs.SE cs.AI cs.PL 73%

Phyelds: A Pythonic Framework for Aggregate Computing

Phyelds: 一个用于聚合计算的Pythonic框架

Gianluca Aguzzi, Davide Domini, Nicolas Farabegoli, Mirko Viroli

机构 * University of Bologna(博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Phyelds,一个针对数据科学实践者的Python库,旨在整合机器学习与聚合计算,提供轻量级的字段 calculus 模型实现,支持联邦学习和多智能体强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16952 2026-03-31 cs.CL cs.AI 73%

AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation

AirQA:一个用于人工智能研究的综合性问答数据集,具有实例级评估

Tiancheng Huang, Ruisheng Cao, Yuxin Zhang, Zhangyi Kang, Zijian Wang, Chenrun Wang, Yijie Luo, Hang Zheng, Lirong Qian, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Shanghai Innovation Institution(上海创新研究院) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出AirQA数据集,包含13956篇AI论文和1246个问题,支持多任务、多模态和实例级评估,并提出ExTrActor框架提升小模型多轮工具使用能力。

Comments 29 page, 6 figures, 17 tables, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01331 2026-03-31 cs.CY cs.CL cs.LG 73%

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

AppellateGen:上诉法律判决生成的基准测试

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang, Haoyang Li, Jiexin Zheng, Xin Xu

机构 * Nanyang Technological University(南洋理工大学) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AppellateGen基准测试,包含7351个案例对,用于生成上诉阶段的法律判决,通过模拟司法流程验证模型在上诉推理中的逻辑一致性与挑战。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV 73%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22315 2026-03-25 cs.LG cs.AI 73%

Emergency Preemption Without Online Exploration: A Decision Transformer Approach

紧急预emption无在线探索:一种决策变压器方法

Haoran Su, Hanxiao Deng, Yandong Sun

机构 * New York University(纽约大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于决策变压器的紧急走廊优化框架,通过离线返回条件序列建模,实现无在线环境交互的策略学习,提升紧急车辆调度的紧急程度控制,并通过多智能体决策变压器实现空间协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22305 2026-03-25 cs.LG cs.AI 73%

CN-Buzz2Portfolio: A Chinese-Market Dataset and Benchmark for LLM-Based Macro and Sector Asset Allocation from Daily Trending Financial News

CN-Buzz2Portfolio: 一个面向中国市场、基于LLM的宏观与行业资产配置基准数据集

Liyuan Chen, Shilong Li, Jiangpeng Yan, Shuoling Liu, Qiang Yang, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) E Fund Management Co., Ltd.(E基金管理有限公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CN-Buzz2Portfolio数据集,用于评估LLM在动态金融决策中的表现,通过模拟真实市场关注流,测试模型在宏观叙事到资产配置的转换能力,揭示不同模型在资产分配上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20313 2026-03-24 cs.SE cs.AI 73%

Semantic Tool Discovery for Large Language Models: A Vector-Based Approach to MCP Tool Selection

面向大语言模型的语义工具发现:基于向量的方法用于MCP工具选择

Sarat Mudunuri, Jian Wan, Ally Qin, Srinivasan Manoharan

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出基于向量检索的语义工具发现架构,通过语义索引和动态选择机制,显著降低工具调用的token消耗,提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏