arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15686 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15686 篇

2512.17092 2025-12-22 cs.CL 79%

Data Augmentation Supporting a Conversational Agent Designed for Smoking Cessation Support Groups

数据增强支持用于戒烟支持小组的对话代理

Salar Hashemitaheri, Ian Harris

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出了一种两级数据增强策略,通过合成和真实数据提升对话代理在戒烟支持小组中的表现,验证了数据增强对F1分数提升的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16408 2025-12-19 cs.LG cs.MA 79%

NDRL: Cotton Irrigation and Nitrogen Application with Nested Dual-Agent Reinforcement Learning

NDRL:基于嵌套双智能体强化学习的棉花灌溉与氮肥施用

Ruifeng Xu, Liang He

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) Xinjiang Key Laboratory of Signal Detection and Processing(新疆信号检测与处理重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 NDRL通过嵌套双智能体强化学习优化棉花灌溉与氮肥施用,提升产量和资源利用效率。

Comments Accepted by ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25540 2025-12-16 cs.AI 79%

RadOnc-GPT: An Autonomous LLM Agent for Real-Time Patient Outcomes Labeling at Scale

RadOnc-GPT:一种用于大规模实时患者结果标注的自主大语言模型代理

Jason Holmes, Yuexing Hao, Mariana Borras-Osorio, Federico Mastroleo, Santiago Romero Brufau, Valentina Carducci, Katie M Van Abel, David M Routman, Andrew Y. K. Foong, Liv M Muller, Satomi Shiraishi, Daniel K Ebner, Daniel J Ma, Sameer R Keole, Samir H Patel, Mirek Fatyga, Martin Bues, Brad J Stish, Yolanda I Garces, Michelle A Neben Wittich, Robert L Foote, Sujay A Vora, Nadia N Laack, Mark R Waddle, Wei Liu

机构 * Mayo Clinic, Phoenix, AZ, USA(梅奥诊所,凤凰城,亚利桑那州,美国) Mayo Clinic, Rochester, MN, USA(梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 RadOnc-GPT是一种自主大语言模型代理,通过自主检索和评估实现大规模实时患者结果标注,提升放射肿瘤学研究的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12306 2025-12-15 cs.AI cs.CY 79%

UpBench: A Dynamically Evolving Real-World Labor-Market Agentic Benchmark Framework Built for Human-Centric AI

UpBench: 一个动态演化的现实劳动力市场代理基准框架,专为以人为本的AI设计

Darvin Yi, Teng Liu, Mattie Terzolo, Lance Hasson, Ayan Sinha, Pablo Mendes, Andrew Rabinovich

机构 * Upwork

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 UpBench是一个动态演化的现实劳动力市场代理基准框架,通过真实工作和财务结果评估AI与人类协作的能力,推动人机协作的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08629 2025-12-10 cs.AI cs.CV cs.HC 79%

See-Control: A Multimodal Agent Framework for Smartphone Interaction with a Robotic Arm

See-Control: 一种多模态代理框架用于智能手机与机械臂的交互

Haoyu Zhao, Weizhong Ding, Yuhao Yang, Zheng Tian, Linyi Yang, Kun Shao, Jun Wang

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) Huawei Noah’s Ark Lab(华为诺亚实验室) ShanghaiTech University(上海科技大学) Southern University of Science(南方科技大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 See-Control通过直接与机械臂交互实现智能手机操作,无需ADB或系统后台访问,提供了一个平台无关的多模态代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15593 2025-12-10 cs.AI 79%

What Does It Take to Be a Good AI Research Agent? Studying the Role of Ideation Diversity

要成为优秀的AI研究代理需要什么?研究思想多样性的作用

Alexis Audran-Reiss, Jordi Armengol-Estapé, Karen Hambardzumyan, Amar Budhiraja, Martin Josifoski, Edan Toledo, Rishi Hazra, Despoina Magka, Michael Shvartsman, Parth Pathak, Justine T Kao, Lucia Cipolina-Kun, Bhavul Gauri, Jean-Christophe Gagnon-Audet, Emanuel Tewolde, Jenny Zhang, Taco Cohen, Yossi Adi, Tatiana Shavrina, Yoram Bachrach

机构 * FAIR at Meta(FAIR(人工智能研究机构)于Meta) University College London(伦敦大学学院) Meta SuperIntelligence Labs(Meta超智能实验室) University of British Columbia(不列颠哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究思想多样性对AI研究代理性能的影响,通过分析不同模型和框架的轨迹及实验验证,发现高思想多样性提升代理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23856 2025-12-10 cs.AI 79%

From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production

从基准到业务影响:在企业生产中部署IBM通用代理

Segev Shlomov, Alon Oved, Sami Marreed, Ido Levy, Offer Akrabi, Avi Yaeli, Łukasz Strąk, Elizabeth Koumpan, Yinon Goldshtein, Eilam Shapira, Nir Mashkif, Asaf Adi

机构 * IBM

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 IBM开发并试点了CUGA,展示了通用代理在企业生产环境中的应用,通过分层规划-执行架构实现先进性能,并在人才招聘领域验证其可扩展性和安全性。

Comments AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26153 2025-12-09 cs.AI 79%

A Field Guide to Deploying AI Agents in Clinical Practice

人工智能代理在临床实践中的部署指南

Jack Gallifant, Katherine C. Kellogg, Matt Butler, Amanda Centi, Shan Chen, Patrick F. Doyle, Sayon Dutta, Joyce Guo, Matthew J. Hadfield, Esther H. Kim, David E. Kozono, Hugo JWL Aerts, Adam B. Landman, Raymond H. Mak, Rebecca G. Mishuris, Tanna L. Nelson, Guergana K. Savova, Elad Sharon, Benjamin C. Silverman, Umit Topaloglu, Jeremy L. Warner, Danielle S. Bitterman

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出了一本面向实践者的指南,旨在解决生成式AI在临床实践中部署的挑战,强调数据整合、模型验证和治理等关键实施工作。

Comments Under review. 7 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05930 2025-12-08 cs.AI 79%

PRiSM: An Agentic Multimodal Benchmark for Scientific Reasoning via Python-Grounded Evaluation

PRiSM:一种基于Python基础评估的科学推理多模态基准

Shima Imani, Seungwhan Moon, Adel Ahmadyan, Lu Zhang, Kirmani Ahmed, Babak Damavandi

机构 * Meta Reality Lab(Meta现实实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 PRiSM通过基于Python代码的动态多模态基准,评估科学推理能力,揭示VLMs在科学领域中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04771 2025-12-05 cs.MA cs.LG 79%

Complementary Characterization of Agent-Based Models via Computational Mechanics and Diffusion Models

通过计算力学和扩散模型互补性表征基于代理的模型

Roberto Garrone

机构 * University of Milano-Bicocca(米兰-比科卡大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出通过计算力学和扩散模型互补性表征基于代理的模型,结合时间结构与分布几何分析复杂模拟模型。

Comments 11 pages. Methods paper introducing a dual-domain framework for analyzing ABM dynamics. Companion temporal-analysis preprint: arXiv:2510.12729

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22479 2025-12-03 cs.CL 79%

NeLLCom-Lex: A Neural-agent Framework to Study the Interplay between Lexical Systems and Language Use

NeLLCom-Lex: 一种神经代理框架用于研究词汇系统与语言使用之间的相互作用

Yuqing Zhang, Ecesu Ürker, Tessa Verhoef, Gemma Boleda, Arianna Bisazza

机构 * Center for Language and Cognition, University of Groningen(语言与认知中心,格罗宁根大学) Department of Translation and Language Sciences, Universitat Pompeu Fabra(翻译与语言科学系,庞培法拉大学) Leiden Institute of Advanced Computer Science, Leiden University(莱顿高级计算机科学研究所,莱顿大学) Catalan Institution for Research and Advanced Studies (ICREA)(加泰罗尼亚研究与高级科学研究所(ICREA))

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 NeLLCom-Lex通过神经代理框架模拟词汇系统演变,研究词汇与语言使用间的相互作用及语义变化机制。

Comments Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02561 2025-12-03 cs.MA cs.AI 79%

EZYer: A simulacrum of high school with generative agent

EZYer: 一种高中学校的模拟体与生成代理

Jinming Yang, Zimu Ji, Weiqi Luo, Gaoxi Wang, Bin Ma, Yueling Deng

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 EZYer通过生成代理技术模拟高中教学环境,提供结构化教学材料和互动笔记生成,确保学术严谨性和教学适宜性,实验表明其生成内容质量高,应用前景广阔。

Comments AgentIR@SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00294 2025-12-02 cs.CV cs.AI cs.HC 79%

Words into World: A Task-Adaptive Agent for Language-Guided Spatial Retrieval in AR

词语进入世界:一种任务自适应代理用于增强现实中的语言引导空间检索

Lixing Guo, Tobias Höllerer

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种任务自适应AR代理,结合多模态大语言模型和视觉模型,实现语言引导的空间检索,支持复杂查询和真实世界交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11979 2025-11-26 cs.CL cs.MA 79%

Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersonal Closeness

基于价值的大型语言模型代理模拟用于信任和人际亲密的相互评估

Yuki Sakamoto, Takahisa Uchida, Hiroshi Ishiguro

机构 * The University of Osaka, Graduate School of Engineering Science(大阪大学工学科学研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本研究通过模拟LLM代理,探讨价值相似性对信任和人际亲密的影响,验证了人工社会中价值观对关系建立的作用。

Journal ref Scientific Reports volume 15, Article number: 41653 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02744 2025-11-25 cs.AI 79%

Large Language Model-based Data Science Agent: A Survey

基于大型语言模型的数据科学代理:综述

Ke Chen, Peiran Wang, Yaoning Yu, Xianyang Zhan, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文综述了基于LLM的数据科学代理,从代理设计和数据科学流程两个角度探讨其关键原则与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16131 2025-11-21 cs.DB cs.AI 79%

AskDB: An LLM Agent for Natural Language Interaction with Relational Databases

AskDB: 一种用于关系数据库自然语言交互的大型语言模型代理

Xuan-Quang Phan, Tan-Ha Mai, Thai-Duy Dinh, Minh-Thuan Nguyen, Lam-Son Lê

机构 * IT Operations, Mantu Group(Mantu集团信息技术部) Faculty of Engineering, Vietnamese-German University(越南-德国大学工程学院) Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与工程系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 AskDB是一种基于大型语言模型的代理,通过自然语言实现对关系数据库的数据分析和管理操作,提供统一且智能的交互体验。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15982 2025-11-21 cs.LG cs.NI 79%

Machine Learning Epidemic Predictions Using Agent-based Wireless Sensor Network Models

利用基于代理的无线传感器网络模型进行机器学习流行病预测

Chukwunonso Henry Nwokoye, Blessing Oluchi, Sharna Waldron, Peace Ezzeh

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本研究利用基于代理的SEIRV模型,通过机器学习算法预测无线传感器网络中的流行病传播,发现随机森林、XGBoost等算法在预测效果上表现最佳。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15203 2025-11-20 cs.CR cs.AI 79%

Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks

Zimo Ji, Xunguang Wang, Zongjie Li, Pingchuan Ma, Yudong Gao, Daoyuan Wu, Xincheng Yan, Tian Tian, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学) Lingnan University(岭南大学) School of Cyber Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ZTE Corporation(中兴通讯有限公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20606 2025-11-19 cs.CL 79%

Model Editing as a Double-Edged Sword: Steering Agent Ethical Behavior Toward Beneficence or Harm

Baixiang Huang, Zhen Tan, Haoran Wang, Zijie Liu, Dawei Li, Ali Payani, Huan Liu, Tianlong Chen, Kai Shu

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

Comments AAAI 2026 Oral. 14 pages (including appendix), 11 figures. Code, data, results, and additional resources are available at: https://model-editing.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04649 2025-11-18 cs.CL 79%

FRAME: Feedback-Refined Agent Methodology for Enhancing Medical Research Insights

Chengzhang Yu, Yiming Zhang, Zhixin Liu, Zenghui Ding, Yining Sun, Zhanpeng Jin

机构 * South China University of Technology(南方科技大学) HFIPS, Chinese Academy of Sciences(中国科学院HFIPS) University of Science and Technology of China(中国科学技术大学) The Third Affiliated Hospital of SuYat-sen University(孙逸德大学第三附属医院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

Comments 12 pages, 4 figures, 5 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11628 2025-11-18 cs.DC cs.AI 79%

Mixture-of-Schedulers: An Adaptive Scheduling Agent as a Learned Router for Expert Policies

Xinbo Wang, Shian Jia, Ziyang Huang, Jing Cao, Mingli Song

机构 * Zhejiang University(浙江大学) HangZhou City University(杭州市大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16711 2025-11-14 cs.RO cs.CV cs.LG 79%

Depth Matters: Multimodal RGB-D Perception for Robust Autonomous Agents

Mihaela-Larisa Clement, Mónika Farsang, Felix Resch, Mihai-Teodor Stanusoiu, Radu Grosu

机构 * CPS, Technische Universität Wien (TU Wien)(CPS,维也纳技术大学)

专题命中 Agent评测 :autonomous agent(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08487 2025-11-12 cs.MA cs.CL 79%

How Brittle is Agent Safety? Rethinking Agent Risk under Intent Concealment and Task Complexity

Zihan Ma, Dongsheng Zhu, Shudong Liu, Taolin Zhang, Junnan Liu, Qingqiu Li, Minnan Luo, Songyang Zhang, Kai Chen

机构 * School of Computer Science and Technology Xi’an Jiaotong University China(西安交通大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) MOE KLINNS Lab Xi’an Jiaotong University China(西安交通大学教育部KLINNS实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05977 2025-11-11 cs.AI cs.LO cs.MA 79%

An Epistemic Perspective on Agent Awareness

Pavel Naumov, Alexandra Pavlova

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

Comments Fortieth AAAI Conference on Artificial Intelligence (AAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05639 2025-11-11 cs.CL 79%

ECom-Bench: Can LLM Agent Resolve Real-World E-commerce Customer Support Issues?

Haoxin Wang, Xianhan Peng, Xucheng Huang, Yizhe Huang, Ming Gong, Chenghan Yang, Yang Liu, Ling Jiang

机构 * Xiaoduo AI Lab(小多人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

Comments Accepted as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02919 2025-11-06 cs.CL 79%

Cache Mechanism for Agent RAG Systems

Shuhang Lin, Zhencan Peng, Lingyao Li, Xiao Lin, Xi Zhu, Yongfeng Zhang

机构 * Rutgers University(新泽西州立大学) University of South Florida(佛罗里达州立大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20462 2025-11-06 cs.AI 79%

TAMO: Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent with Multi-Modality Observation Data in Cloud-Native Systems

Xiao Zhang, Qi Wang, Mingyi Li, Yuan Yuan, Mengbai Xiao, Fuzhen Zhuang, Dongxiao Yu

机构 * School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01415 2025-11-04 cs.AI 79%

Modulation of temporal decision-making in a deep reinforcement learning agent under the dual-task paradigm

Amrapali Pednekar, Álvaro Garrido-Pérez, Yara Khaluf, Pieter Simoens

机构 * Department of Information Technology(信息科技系) IDLab, Ghent University - imec(IDLab,根特大学 - imec) Department of Social Sciences(社会科学系) Wageningen University and Research(瓦赫宁根大学和研究中心)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

Comments Accepted at CogInterp workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18829 2025-11-04 cs.AI cs.HC cs.OS 79%

LiteCUA: Computer as MCP Server for Computer-Use Agent on AIOS

Kai Mei, Xi Zhu, Hang Gao, Shuhang Lin, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27016 2025-11-03 cs.CL 79%

Semantically-Aware LLM Agent to Enhance Privacy in Conversational AI Services

Jayden Serenari, Stephen Lee

机构 * Department of Computer Science University of Pittsburgh Pittsburgh, Pennsylvania, USA(计算机科学系 纽约大学 伯利恒,宾夕法尼亚州,美国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

Comments Accepted to IEEE Big Data 2025

详情

展开后加载摘要…

URL PDF HTML 收藏