arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2406.08772 2025-02-28 cs.CV cs.CL 70%

MMFakeBench: A Mixed-Source Multimodal Misinformation Detection Benchmark for LVLMs

Xuannan Liu, Zekun Li, Peipei Li, Huaibo Huang, Shuhan Xia, Xing Cui, Linzhi Huang, Weihong Deng, Zhaofeng He

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.CL

Comments Accepted by ICLR 2025, Project page: https://liuxuannan.github.io/MMFakeBench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07095 2025-02-27 cs.CL 70%

MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

Jun Shern Chan, Neil Chowdhury, Oliver Jaffe, James Aung, Dane Sherburn, Evan Mays, Giulio Starace, Kevin Liu, Leon Maksin, Tejal Patwardhan, Lilian Weng, Aleksander Mądry

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.CL

Comments 10 pages, 17 pages appendix. Equal contribution by first seven authors, authors randomized. ICLR version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16868 2025-02-25 cs.DB cs.AI cs.HC 70%

Graphy'our Data: Towards End-to-End Modeling, Exploring and Generating Report from Raw Data

Longbin Lai, Changwei Luo, Yunkai Lou, Mingchen Ju, Zhengyi Yang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16362 2025-02-25 cs.SE 70%

AgentFL: Scaling LLM-based Fault Localization to Project-Level Context

Yihao Qin, Shangwen Wang, Yiling Lou, Jinhao Dong, Kaixin Wang, Xiaoling Li, Xiaoguang Mao

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

Comments Added a comment to refer to the published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15713 2025-02-25 cs.NI cs.AI 70%

UAV-assisted Internet of Vehicles: A Framework Empowered by Reinforcement Learning and Blockchain

Ahmed Alagha, Maha Kadadha, Rabeb Mizouni, Shakti Singh, Jamal Bentahar, Hadi Otrok

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10410 2025-02-18 cs.CY cs.AI 70%

Auto-Evaluation: A Critical Measure in Driving Improvements in Quality and Safety of AI-Generated Lesson Resources

Hannah-Beth Clark, Margaux Dowland, Laura Benton, Reka Budai, Ibrahim Kaan Keskin, Emma Searle, Matthew Gregory, Mark Hodierne, William Gayne, John Roberts

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

Comments 27 pages, Part of MIT Open Learning AI and Open Education Initiative Series, published Jan 2025 https://aiopeneducation.pubpub.org/pub/i36sncz8/release/3?readingCollection=06969c6d

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19100 2025-02-18 cs.CV cs.AI 70%

VideoWebArena: Evaluating Long Context Multimodal Agents with Video Understanding Web Tasks

Lawrence Jang, Yinheng Li, Dan Zhao, Charles Ding, Justin Lin, Paul Pu Liang, Rogerio Bonatti, Kazuhito Koishida

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09565 2025-02-14 cs.AI physics.chem-ph 70%

MDCrow: Automating Molecular Dynamics Workflows with Large Language Models

Quintina Campbell, Sam Cox, Jorge Medina, Brittany Watterson, Andrew D. White

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08119 2025-02-13 cs.AI cs.RO 70%

Generative AI-Enhanced Cooperative MEC of UAVs and Ground Stations for Unmanned Surface Vehicles

Jiahao You, Ziye Jia, Chao Dong, Qihui Wu, Zhu Han

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13381 2025-02-12 cs.CL 70%

Do as We Do, Not as You Think: the Conformity of Large Language Models

Zhiyuan Weng, Guikun Chen, Wenguan Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

Comments ICLR 2025 (Oral). Code: https://github.com/Zhiyuan-Weng/BenchForm

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18712 2025-02-10 cs.LG cs.CR 70%

Invisible Traces: Using Hybrid Fingerprinting to identify underlying LLMs in GenAI Apps

Devansh Bhardwaj, Naman Mishra

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14311 2025-02-10 cs.GT cs.AI 70%

Game Theory with Simulation in the Presence of Unpredictable Randomisation

Vojtech Kovarik, Nathaniel Sauerberg, Lewis Hammond, Vincent Conitzer

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18794 2025-02-03 q-bio.GN cs.AI 70%

Survey and Improvement Strategies for Gene Prioritization with Large Language Models

Matthew Neeley, Guantong Qi, Guanchu Wang, Ruixiang Tang, Dongxue Mao, Chaozhong Liu, Sasidhar Pasupuleti, Bo Yuan, Fan Xia, Pengfei Liu, Zhandong Liu, Xia Hu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

Comments 11 pages, 4 figures, 10 pages of supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15959 2025-01-30 cs.CL 70%

NoteChat: A Dataset of Synthetic Doctor-Patient Conversations Conditioned on Clinical Notes

Junda Wang, Zonghai Yao, Zhichao Yang, Huixue Zhou, Rumeng Li, Xun Wang, Yucheng Xu, Hong Yu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

Journal ref Findings of the Association for Computational Linguistics: ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09158 2025-01-17 cs.CL 70%

Evaluating GenAI for Simplifying Texts for Education: Improving Accuracy and Consistency for Enhanced Readability

Stephanie L. Day, Jacapo Cirica, Steven R. Clapp, Veronika Penkova, Amy E. Giroux, Abbey Banta, Catherine Bordeau, Poojitha Mutteneni, Ben D. Sawyer

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

Comments 64 pages, 9 tables, 6 figures, and supplemental materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15192 2025-01-17 cs.AI 70%

Measuring Diversity of Game Scenarios

Yuchen Li, Ziqi Wang, Qingquan Zhang, Bo Yuan, Jialin Liu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19976 2024-12-31 cs.HC cs.AI cs.CY 70%

Will you donate money to a chatbot? The effect of chatbot anthropomorphic features and persuasion strategies on willingness to donate

Ekaterina Novozhilova, Jiacheng Huang, Le He, Ziling Li, James Cummings

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17707 2024-12-25 cs.AI 70%

SMAC-Hard: Enabling Mixed Opponent Strategy Script and Self-play on SMAC

Yue Deng, Yan Yu, Weiyu Ma, Zirui Wang, Wenhui Zhu, Jian Zhao, Yin Zhang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12588 2024-12-18 cs.CL 70%

PerSphere: A Comprehensive Framework for Multi-Faceted Perspective Retrieval and Summarization

Yun Luo, Yingjie Li, Xiangkun Hu, Qinglin Qi, Fang Guo, Qipeng Guo, Zheng Zhang, Yue Zhang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10270 2024-12-16 cs.MA cs.AI 70%

Cultural Evolution of Cooperation among LLM Agents

Aron Vallinder, Edward Hughes

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07880 2024-12-13 cs.AI 70%

Towards Foundation-model-based Multiagent System to Accelerate AI for Social Impact

Yunfan Zhao, Niclas Boehmer, Aparna Taneja, Milind Tambe

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08442 2024-12-12 cs.LG 70%

From Multimodal LLMs to Generalist Embodied Agents: Methods and Lessons

Andrew Szot, Bogdan Mazoure, Omar Attia, Aleksei Timofeev, Harsh Agrawal, Devon Hjelm, Zhe Gan, Zsolt Kira, Alexander Toshev

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17572 2024-12-10 cs.CV cs.AI 70%

CityX: Controllable Procedural Content Generation for Unbounded 3D Cities

Shougao Zhang, Mengqi Zhou, Yuxi Wang, Chuanchen Luo, Rongyu Wang, Yiwei Li, Zhaoxiang Zhang, Junran Peng

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02776 2024-12-05 cs.CR cs.AI 70%

Hacking CTFs with Plain Agents

Rustem Turtayev, Artem Petrov, Dmitrii Volkov, Denis Volk

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15637 2024-11-28 cs.AI 70%

Synatra: Turning Indirect Knowledge into Direct Demonstrations for Digital Agents at Scale

Tianyue Ou, Frank F. Xu, Aman Madaan, Jiarui Liu, Robert Lo, Abishek Sridhar, Sudipta Sengupta, Dan Roth, Graham Neubig, Shuyan Zhou

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13352 2024-11-26 cs.CR cs.LG 70%

AgentDojo: A Dynamic Environment to Evaluate Prompt Injection Attacks and Defenses for LLM Agents

Edoardo Debenedetti, Jie Zhang, Mislav Balunović, Luca Beurer-Kellner, Marc Fischer, Florian Tramèr

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

Comments Updated version after fixing a bug in the Llama implementation and updating the travel suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13749 2024-11-22 cs.AI 70%

AI-Driven Agents with Prompts Designed for High Agreeableness Increase the Likelihood of Being Mistaken for a Human in the Turing Test

U. León-Domínguez, E. D. Flores-Flores, A. J. García-Jasso, M. K. Gómez-Cuellar, D. Torres-Sánchez, A. Basora-Marimon

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

Comments 25 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00563 2024-11-15 cs.MA cs.AI cs.CE q-fin.CP 70%

Simulate and Optimise: A two-layer mortgage simulator for designing novel mortgage assistance products

Leo Ardon, Benjamin Patrick Evans, Deepeka Garg, Annapoorani Lakshmi Narayanan, Makada Henry-Nickie, Sumitra Ganesh

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

Comments Accepted at the 5th ACM International Conference on AI in Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21029 2024-10-29 cs.MA cs.AI cs.MM 70%

FairStream: Fair Multimedia Streaming Benchmark for Reinforcement Learning Agents

Jannis Weil, Jonas Ringsdorf, Julian Barthel, Yi-Ping Phoebe Chen, Tobias Meuser

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19848 2024-10-29 cs.CV cs.CL 70%

Benchmarking Large Language Models for Image Classification of Marine Mammals

Yijiashun Qi, Shuzhang Cai, Zunduo Zhao, Jiaming Li, Yanbin Lin, Zhiqiang Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

Comments ICKG 2024

详情

展开后加载摘要…

URL PDF HTML 收藏