arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15662 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15662 篇

2512.02605 2025-12-03 cs.AI cs.MA cs.SE 81%

IACT: A Self-Organizing Recursive Model for General AI Agents: A Technical White Paper on the Architecture Behind kragent.ai

IACT:一种自组织递归模型用于通用人工智能代理:kragent.ai背后架构的技术白皮书

Pengju Lu

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 IACT是一种通过用户对话自主生成递归代理拓扑的通用人工智能代理模型,旨在解决传统静态工作流的局限性,并通过双向对话实现运行时错误修正。

Comments 13 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00007 2025-12-02 cs.IR cs.AI cs.CL 81%

Use of Retrieval-Augmented Large Language Model Agent for Long-Form COVID-19 Fact-Checking

使用检索增强型大语言模型代理进行长期形式的新冠事实核查

Jingyi Huang, Yuyi Yang, Mengmeng Ji, Charles Alba, Sheng Zhang, Ruopeng An

机构 * New York University, USA(纽约大学) Washington University in St. Louis, USA(华盛顿大学圣路易斯分校) Shanghai University of Sports, China(上海体育大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出SAFE系统,结合大语言模型与检索增强生成技术,有效提升长期新冠虚假信息的事实核查能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20703 2025-11-27 cs.CY cs.AI cs.LG 81%

PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach

PropensityBench: 通过代理方法评估大语言模型中的潜在安全风险

Udari Madhushani Sehwag, Shayan Shabihi, Alex McAvoy, Vikash Sehwag, Yuancheng Xu, Dalton Towers, Furong Huang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 PropensityBench通过模拟危险能力评估大语言模型的潜在安全风险倾向,揭示模型在压力下可能选择高风险行为的倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21426 2025-11-27 cs.AI cs.LG cs.MA econ.EM physics.soc-ph 81%

Learning Individual Behavior in Agent-Based Models with Graph Diffusion Networks

基于图扩散网络的学习个体行为在基于代理的模型中

Francesco Cozzi, Marco Pangallo, Alan Perotti, André Panisson, Corrado Monti

机构 * Sapienza University(萨皮恩扎大学) CENTAI

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于图扩散网络的方法,通过学习个体行为来提升基于代理模型的模拟能力,展示了其在预测复杂系统动态方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07793 2025-11-25 cs.CL cs.AI 81%

LLM4Cell: A Survey of Large Language and Agentic Models for Single-Cell Biology

LLM4Cell: 一种用于单细胞生物学的大语言和代理模型综述

Sajib Acharjee Dip, Adrika Zafor, Bikash Kumar Paul, Uddip Acharjee Shuvo, Muhit Islam Emon, Xuan Wang, Liqing Zhang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系) Department of Computational Modeling and Data Analytics, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算建模与数据分析系) Institute of Information and Technology, University of Dhaka, Dhaka, Bangladesh(达卡大学信息技术学院) Fralin Biomedical Research Institute at VTC: Cancer Research Center, Washington DC, USA(弗拉林生物医学研究中心:癌症研究中心)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 LLM4Cell综述了58个用于单细胞生物学的大语言和代理模型,分析了其在注释、轨迹建模和药物反应预测等任务中的表现,并指出了可解释性、标准化和可信模型开发的挑战。

Comments 34 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03303 2025-11-19 cs.MA cs.AI cs.CE cs.LG 81%

Automatic Differentiation of Agent-Based Models

Arnau Quera-Bofarull, Nicholas Bishop, Joel Dyer, Daniel Jarne Ornia, Anisoara Calinescu, Doyne Farmer, Michael Wooldridge

机构 * Macrocosm and University of Oxford(宏宇宙与牛津大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

Comments Rev. 1: Updated references and code availability

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04697 2025-11-10 cs.SI cs.AI cs.CL 81%

Simulating Misinformation Vulnerabilities With Agent Personas

David Farr, Lynnette Hui Xian Ng, Stephen Prochaska, Iain J. Cruickshank, Jevin West

机构 * School of Information Science University of Washington(信息科学学院华盛顿大学) School of Computer Science Carnegie Mellon University(计算机科学学院卡内基梅隆大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

Comments Accepted to Winter Simulation Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04502 2025-11-07 cs.CL cs.AI 81%

RAGalyst: Automated Human-Aligned Agentic Evaluation for Domain-Specific RAG

Joshua Gao, Quoc Huy Pham, Subin Varghese, Silwal Saurav, Vedhus Hoskere

机构 * University of Houston(德克萨斯大学休斯敦分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03731 2025-11-07 cs.HC cs.AI cs.CL 81%

MimiTalk: Revolutionizing Qualitative Research with Dual-Agent AI

Fengming Liu, Shubin Yu

机构 * University College London(伦敦大学学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10455 2025-10-31 cs.CL cs.AI 81%

IDEA: Enhancing the Rule Learning Ability of Large Language Model Agent through Induction, Deduction, and Abduction

Kaiyu He, Mian Zhang, Shuo Yan, Peilin Wu, Zhiyu Zoey Chen

机构 * Department of Computer Science University of Texas at Dallas(计算机科学系德克萨斯大学达拉斯分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24438 2025-10-29 cs.CL cs.AI cs.CY cs.MA 81%

Can LLMs Write Faithfully? An Agent-Based Evaluation of LLM-generated Islamic Content

Abdullah Mushtaq, Rafay Naeem, Ezieddin Elmahjub, Ibrahim Ghaznavi, Shawqi Al-Maliki, Mohamed Abdallah, Ala Al-Fuqaha, Junaid Qadir

机构 * Information Technology University(信息科技大学) Qatar University(卡塔尔大学) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

Comments Accepted at 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: 5th Muslims in Machine Learning (MusIML) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10858 2025-10-28 cs.LG cs.AI 81%

Centralized Reward Agent for Knowledge Sharing and Transfer in Multi-Task Reinforcement Learning

Haozhe Ma, Zhengding Luo, Thanh Vinh Vo, Kuankuan Sima, Tze-Yun Leong

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) TikTok Pte. Ltd., Singapore(新加坡TikTok公司) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21329 2025-10-27 cs.CL cs.AI 81%

TripTide: A Benchmark for Adaptive Travel Planning under Disruptions

Priyanshu Karmakar, Soumyabrata Chaudhuri, Shubhojit Mallick, Manish Gupta, Abhik Jana, Shreya Ghosh

机构 * School of Electrical and Computer Sciences, IIT Bhubaneswar(电子与计算机科学学院,印度理工学院Bhubaneswar分校) Microsoft(微软)

专题命中 Agent评测 :planning(title,abstract);分类 cs.AI、cs.CL

Comments 12 pages, 12 tables and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18129 2025-10-23 cs.CL cs.AI 81%

GeoBenchX: Benchmarking LLMs in Agent Solving Multistep Geospatial Tasks

Varvara Krechetova, Denis Kochedykov

机构 * World Bank(世界银行) JP Morgan Chase & Co(摩根大通公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

Comments Github with code and benchmark set: https://github.com/Solirinai/GeoBenchX

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09721 2025-10-22 cs.GT cs.AI cs.LG econ.TH 81%

Generalized Principal-Agent Problem with a Learning Agent

Tao Lin, Yiling Chen

机构 * Harvard University(哈佛大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

Comments A short version of this work appeared on ICLR 2025 (spotlight). This full version has been accepted by Quantitative Economics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21148 2025-10-21 cs.CL cs.AI 81%

A Survey of Scientific Large Language Models: From Data Foundations to Agent Frontiers

Ming Hu, Chenglong Ma, Wei Li, Wanghan Xu, Jiamin Wu, Jucheng Hu, Tianbin Li, Guohang Zhuang, Jiaqi Liu, Yingzhou Lu, Ying Chen, Chaoyang Zhang, Cheng Tan, Jie Ying, Guocheng Wu, Shujian Gao, Pengcheng Chen, Jiashi Lin, Haitao Wu, Lulu Chen, Fengxiang Wang, Yuanyuan Zhang, Xiangyu Zhao, Feilong Tang, Encheng Su, Junzhi Ning, Xinyao Liu, Ye Du, Changkai Ji, Pengfei Jiang, Cheng Tang, Ziyan Huang, Jiyao Liu, Jiaqi Wei, Yuejin Yang, Xiang Zhang, Guangshuai Wang, Yue Yang, Huihui Xu, Ziyang Chen, Yizhou Wang, Chen Tang, Jianyu Wu, Yuchen Ren, Siyuan Yan, Zhonghua Wang, Zhongxing Xu, Shiyan Su, Shangquan Sun, Runkai Zhao, Zhisheng Zhang, Dingkang Yang, Jinjie Wei, Jiaqi Wang, Jiahao Xu, Jiangtao Yan, Wenhao Tang, Hongze Zhu, Yu Liu, Fudi Wang, Yiqing Shen, Yuanfeng Ji, Yanzhou Su, Tong Xie, Hongming Shan, Chun-Mei Feng, Zhi Hou, Diping Song, Lihao Liu, Yanyan Huang, Lequan Yu, Bin Fu, Shujun Wang, Xiaomeng Li, Xiaowei Hu, Yun Gu, Ben Fei, Benyou Wang, Yuewen Cao, Minjie Shen, Jie Xu, Haodong Duan, Fang Yan, Hongxia Hao, Jielan Li, Jiajun Du, Yanbo Wang, Imran Razzak, Zhongying Deng, Chi Zhang, Lijun Wu, Conghui He, Zhaohui Lu, Jinhai Huang, Wenqi Shao, Yihao Liu, Siqi Luo, Yi Xin, Xiaohong Liu, Fenghua Ling, Yuqiang Li, Aoran Wang, Siqi Sun, Qihao Zheng, Nanqing Dong, Tianfan Fu, Dongzhan Zhou, Yan Lu, Wenlong Zhang, Jin Ye, Jianfei Cai, Yirong Chen, Wanli Ouyang, Yu Qiao, Zongyuan Ge, Shixiang Tang, Junjun He, Chunfeng Song, Lei Bai, Bowen Zhou

专题命中 Agent评测 :agent(title);autonomous agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13857 2025-10-17 cs.SE cs.AI 81%

From Craft to Constitution: A Governance-First Paradigm for Principled Agent Engineering

Qiang Xu, Xiangyu Wen, Changran Xu, Zeju Li, Jianyuan Zhong

机构 * CURE Lab., Dept. of CSE, The Chinese University of Hong Kong, Hong Kong S.A.R.(CUHK计算机科学与工程系CURE实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11736 2025-10-15 cs.AI cs.GT cs.LG 81%

AI Agents for the Dhumbal Card Game: A Comparative Study

Sahaj Raj Malla

机构 * Department of Mathematics, Kathmandu University(数学系,加德满都大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07414 2025-10-13 cs.CL cs.AI cs.IR 81%

Haystack Engineering: Context Engineering for Heterogeneous and Agentic Long-Context Evaluation

Mufei Li, Dongqi Fu, Limei Wang, Si Zhang, Hanqing Zeng, Kaan Sancak, Ruizhong Qiu, Haoyu Wang, Xiaoxin He, Xavier Bresson, Yinglong Xia, Chonglin Sun, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta AI University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

Comments Code available at https://github.com/Graph-COM/HaystackCraft

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07709 2025-10-10 cs.AI cs.CL cs.CY cs.MA 81%

Multimodal Safety Evaluation in Generative Agent Social Simulations

Alhim Vera, Karen Sanchez, Carlos Hinojosa, Haidar Bin Hamid, Donghoon Kim, Bernard Ghanem

机构 * University of Cincinnati(辛辛那提大学) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术)

专题命中 Agent评测 :agent(title);planning(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17384 2025-10-09 cs.LG cs.AI 81%

A Dual-Agent Adversarial Framework for Robust Generalization in Deep Reinforcement Learning

Zhengpeng Xie, Yulong Zhang

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14052 2025-10-06 cs.IR cs.AI cs.CL 81%

FinAgentBench: A Benchmark Dataset for Agentic Retrieval in Financial Question Answering

Chanyeol Choi, Jihoon Kwon, Alejandro Lopez-Lira, Chaewoon Kim, Minjae Kim, Juneha Hwang, Jaeseon Ha, Hojun Choi, Suyeol Yun, Yongjin Kim, Yongjae Lee

机构 * University of Florida(佛罗里达大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02139 2025-10-03 q-bio.QM cs.AI cs.LG cs.MA 81%

BioinfoMCP: A Unified Platform Enabling MCP Interfaces in Agentic Bioinformatics

Florensia Widjaja, Zhangtianyi Chen, Juexiao Zhou

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen (CUHK Shenzhen)(数据科学学院,香港中文大学(深圳))

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25593 2025-10-01 cs.AI cs.CL cs.HC cs.IR 81%

Causal Autoencoder-like Generation of Feedback Fuzzy Cognitive Maps with an LLM Agent

Akash Kumar Panda, Olaoluwa Adigun, Bart Kosko

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Southern California(南加州大学) School of Computing and Information Sciences(计算与信息科学学院) Florida International University(佛罗里达国际大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23655 2025-09-30 cs.RO cs.AI cs.CV cs.LG 81%

Focusing on What Matters: Object-Agent-centric Tokenization for Vision Language Action models

Rokas Bendikas, Daniel Dijkman, Markus Peschl, Sanjay Haresh, Pietro Mazzaglia

机构 * Centre for Artificial Intelligence, UCL(人工智能中心,伦敦大学学院) Qualcomm AI Research(高通人工智能研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

Comments Presented at 9th Conference on Robot Learning (CoRL 2025), Seoul, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16429 2025-09-29 cs.CL cs.AI 81%

Beyond Static Testbeds: An Interaction-Centric Agent Simulation Platform for Dynamic Recommender Systems

Song Jin, Juntian Zhang, Yuhan Liu, Xun Zhang, Yufei Zhang, Guojun Yin, Fei Jiang, Wei Lin, Rui Yan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Meituan(美团) Wuhan University(武汉大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

Comments EMNLP2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06960 2025-08-12 cs.AI cs.CL 81%

DatasetResearch: Benchmarking Agent Systems for Demand-Driven Dataset Discovery

Keyu Li, Mohan Jiang, Dayuan Fu, Yunze Wu, Xiangkun Hu, Dequan Wang, Pengfei Liu

机构 * Shanghai Jiao Tong University(上海交通大学) SII GAIR

专题命中 Agent评测 :agent(title);AI agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03092 2025-08-06 cs.AI cs.CL 81%

Toward Verifiable Misinformation Detection: A Multi-Tool LLM Agent Framework

Zikun Cui, Tianyi Huang, Chia-En Chiang, Cuiqianhe Du

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16725 2025-08-01 cs.CL cs.AI cs.IR 81%

RAVine: Reality-Aligned Evaluation for Agentic Search

Yilong Xu, Xiang Long, Zhi Zheng, Jinhua Gao

机构 * ModelBest Inc.(ModelBest公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22255 2025-07-31 cs.LG cs.AI cs.SC 81%

Agent-centric learning: from external reward maximization to internal knowledge curation

Hanqi Zhou, Fryderyk Mantiuk, David G. Nagy, Charley M. Wu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

Comments RLC Finding the Frame Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏