arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15686 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15686 篇

2602.02345 2026-02-03 cs.SE 79%

A Task-Level Evaluation of AI Agents in Open-Source Projects

对开源项目中AI代理的任务级评估

Shojibur Rahman, Md Fazle Rabbi, Minhaz Zibran

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.SE

AI总结 本文评估了五个AI代理在开源项目中的表现,发现Codex在PR接受率上表现优异,而Copilot在审查讨论量上领先,但提交质量因任务类型而异。

Comments 5 pages, accepted at MSR Mining Challenge 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00352 2026-02-03 cs.CL 79%

DETOUR: An Interactive Benchmark for Dual-Agent Search and Reasoning

DETOUR:双智能体搜索与推理的交互基准

Li Siyan, Darshan Deshpande, Anand Kannappan, Rebecca Qian

机构 * Patronus AI DAP Lab(DAP实验室) Columbia University(哥伦比亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 DETOUR基准通过双智能体机制评估双智能体搜索与推理能力,揭示现有模型在模糊不明确场景下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22964 2026-02-02 cs.AI 79%

EvoClinician: A Self-Evolving Agent for Multi-Turn Medical Diagnosis via Test-Time Evolutionary Learning

EvoClinician: 一种通过测试时进化学习进行多轮医学诊断的自进化代理

Yufei He, Juncheng Liu, Zhiyuan Hu, Yulin Chen, Yue Liu, Yuan Sui, Yibo Li, Nuo Chen, Jun Hu, Bryan Hooi, Xinxing Xu, Jiang Bian

机构 * Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 EvoClinician通过测试时进化学习实现多轮医学诊断,采用'诊断-评分-进化'循环提升诊断效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22290 2026-02-02 cs.AI 79%

The Six Sigma Agent: Achieving Enterprise-Grade Reliability in LLM Systems Through Consensus-Driven Decomposed Execution

六西格玛代理:通过共识驱动的分解执行实现企业级可靠性

Khush Patel, Siva Surendira, Jithin George, Shreyas Kapale

机构 * Lyzr Research(Lyzr研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 六西格玛代理通过共识驱动的分解执行实现企业级可靠性,显著提升AI系统可靠性并降低成本。

Comments 25 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16993 2026-02-02 cs.DL cs.AI 79%

BibAgent: An Agentic Framework for Traceable Miscitation Detection in Scientific Literature

BibAgent: 一种用于科学文献中可追溯的误引检测代理框架

Peiran Li, Fangzhou Lin, Shuo Xing, Xiang Zheng, Xi Hong, Siyuan Yang, Jiashuo Sun, Zhengzhong Tu, Chaoqun Ni

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Worcester Polytechnic Institute(沃斯特理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 BibAgent是一种用于科学文献中可追溯误引检测的代理框架,通过整合检索、推理和自适应证据聚合,实现高效且透明的引文验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10197 2026-02-02 cs.AI 79%

Don't Just Fine-tune the Agent, Tune the Environment

不要只微调智能体,而是微调环境

Siyuan Lu, Zechuan Wang, Hongxuan Zhang, Qintong Wu, Leilei Gan, Chenyi Zhuang, Jinjie Gu, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Nanjing University(南京大学)

专题命中 Agent评测 :agent(title);tool-use(abstract);分类 cs.AI

AI总结 本文提出环境微调方法,通过结构化课程和环境增强,使智能体无需专家轨迹即可高效学习复杂行为,实现更稳健的泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20617 2026-01-29 cs.CY cs.AI 79%

Agent Benchmarks Fail Public Sector Requirements

代理基准测试未能满足公共部门要求

Jonathan Rystrøm, Chris Schmitz, Karolina Korgul, Jan Batzner, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) Centre for Digital Governance, Hertie School(数字治理中心) Weizenbaum Institute(魏泽瑙研究所) Technical University of Munich(慕尼黑技术大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出公共部门基准测试需满足过程性、现实性、特定性和指标性标准,指出现有基准测试未能全面反映公共部门需求,并呼吁研究人员和公共部门官员共同改进相关评估方法。

Comments Forthcoming @ IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20323 2026-01-29 cs.AI 79%

ECG-Agent: On-Device Tool-Calling Agent for ECG Multi-Turn Dialogue

ECG-Agent: 用于ECG多轮对话的设备端工具调用代理

Hyunseung Chung, Jungwoo Oh, Daeun Kyung, Jiho Kim, Yeonsu Kwon, Min-Gyu Kim, Edward Choi

机构 * KAIST(韩国科学技术院) Ajou University School of Medicine(全州大学医学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。

Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15034 2026-01-22 cs.HC cs.AI 79%

Visual and Cognitive Demands of a Large Language Model-Powered In-vehicle Conversational Agent

基于大型语言模型的车载对话代理的视觉与认知需求

Chris Monk, Allegra Ayala, Christine S. P. Yu, Gregory M. Fitch, Dara Gruber

机构 * Exponent, Inc.(Exponent公司) Google, Inc.(Google公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究评估了基于大型语言模型的车载对话代理在驾驶中的视觉与认知需求,发现其与免提通话在认知负荷上相当,且视觉需求较低,支持其在驾驶环境中的安全应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13880 2026-01-21 cs.AI 79%

LifeAgentBench: A Multi-dimensional Benchmark and Agent for Personal Health Assistants in Digital Health

LifeAgentBench: 一个多维基准和代理用于数字健康中的个人健康助手

Ye Tian, Zihao Wang, Onat Gungor, Xiaoran Fan, Tajana Rosing

机构 * University of California San Diego(加州大学圣地亚哥分校) Google Research(谷歌研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出LifeAgentBench多维基准和代理,用于评估LLM在长周期、跨维度健康推理中的能力,并通过实验识别关键瓶颈,提出基线代理LifeAgent实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10809 2026-01-19 cs.CL 79%

A Concise Agent is Less Expert: Revealing Side Effects of Using Style Features on Conversational Agents

简洁的代理不如专家:使用风格特征于对话代理时揭示副作用

Young-Min Cho, Yuan Yuan, Sharath Chandra Guntuku, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 研究揭示了在对话代理中使用风格特征时的副作用,指出不同风格特征之间存在深度交织,传统方法难以有效控制,需更原理化的多目标引导策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11485 2026-01-19 cs.CL 79%

Mistake Notebook Learning: Batch-Clustered Failures for Training-Free Agent Adaptation

错误笔记本学习:用于无训练代理适应的批量聚类失败

Xuanbo Su, Yingfang Zhang, Hao Luo, Xiaoteng Liu, Leo Huang

机构 * Bairong Inc.(柏龙公司) School of Mathematics, Harbin Institute of Technology(哈尔滨工业大学数学学院) School of Software, Jilin University(吉林大学软件学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 MNL通过批量聚类失败提炼结构化错误笔记,提升代理适应性和鲁棒性,无需参数更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15143 2026-01-16 cs.AI cs.MA 79%

An intelligent agent-based simulation of human mobility in extreme urban morphologies

基于智能代理的极端城市形态中人类移动性模拟

Abderaouf Bahi, Amel Ourici

机构 * Computer Science and Applied Mathematics Laboratory (LIMA) Faculty of Science and Technology(计算机科学与应用数学实验室(LIMA)理学院) Faculty of Science and Technology, Chadli Bendjedid University(科学与技术学院,Chadli Bendjedid大学) Mathematical Modeling and Numerical Simulation Laboratory (LAM2SIN) Faculty of Technology(数学建模与数值模拟实验室(LAM2SIN)技术学院) Faculty of Technology, Badji Mokhtar University(技术学院,Badji Mokhtar大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种混合模拟框架,通过整合强化学习和图神经网络,实现了在极端城市形态中高效且可持续的移动性解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09688 2026-01-15 cs.CL 79%

DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation

DeepResearchEval: 一种用于深度研究任务构建和代理评估的自动化框架

Yibo Wang, Lei Wang, Yue Deng, Keming Wu, Yao Xiao, Huanjin Yao, Liwei Kang, Hai Ye, Yongcheng Jing, Lidong Bing

机构 * Infinity Lab, Shanda Group(沙达集团无限实验室) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 DeepResearchEval提出了一种自动化框架,通过基于角色的任务生成流程和自适应评估机制,解决深度研究任务构建和评估中的挑战。

Comments Source code: https://github.com/Infinity-AILab/DeepResearchEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08839 2026-01-15 cs.CL 79%

Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework

多LLM系统的递归知识合成:稳定性分析与三代理审计框架

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出三代理框架用于多LLM系统稳定性分析,通过递归知识合成实现安全可靠的知识生成。

Comments 25 pages, 9 figures. Pilot feasibility study using public-access large language models without API-level orchestration

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07309 2026-01-15 cs.CL 79%

Agent Bain vs. Agent McKinsey: A New Text-to-SQL Benchmark for the Business Domain

Agent Bain vs. Agent McKinsey:业务领域的新文本到SQL基准测试

Yue Li, Ran Tao, Derek Hommel, Yusuf Denizay Dönder, Sungyong Chang, David Mimno, Unso Eun Seo Jo

机构 * Cornell University(康奈尔大学) Gena AI

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.CL

AI总结 CORGI是一个新的文本到SQL基准测试,旨在评估业务领域中更复杂的问题,如预测和推荐,揭示LLM在处理复杂任务时的性能下降。

Comments 23 pages, under review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11773 2026-01-15 cs.CL 79%

AgenticIE: An Adaptive Agent for Information Extraction from Complex Regulatory Documents

AgenticIE: 一种用于从复杂监管文件中提取信息的自适应代理

Gaye Colakoglu, Gürkan Solmaz, Jonathan Fürst

机构 * Zurich University of Applied Sciences(苏黎世应用科学大学) NEC Laboratories Europe(NEC欧洲实验室)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.CL

AI总结 本文提出AgenticIE系统,用于从复杂监管文件中提取信息和回答问题,通过高密度标注数据集验证其在KIE和QA任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07413 2026-01-13 cs.LG cs.MA 79%

The Practicality of Normalizing Flow Test-Time Training in Bayesian Inference for Agent-Based Models

归一化流在基于代理模型的贝叶斯推断中的实用性研究

Junyao Zhang, Jinglai Li, Junqi Tang

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出在基于代理模型的贝叶斯推断中使用测试时间训练归一化流的方法,通过对抗分布偏移提升参数推断的实时调整能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06424 2026-01-13 cs.CL 79%

Can a Unimodal Language Agent Provide Preferences to Tune a Multimodal Vision-Language Model?

单模语言代理能否为调整多模态视觉-语言模型提供偏好?

Sazia Tabasum Mim, Jack Morris, Manish Dhakal, Yanming Xiu, Maria Gorlatova, Yi Ding

机构 * Georgia State University(佐治亚州立大学) Duke University(杜克大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出通过单模语言代理提供偏好反馈,提升多模态视觉-语言模型的描述能力,实验显示在准确率上提升13%,且人类偏好匹配率达64.6%。

Comments Accepted to IJCNLP-AACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06112 2026-01-13 cs.AI 79%

ReliabilityBench: Evaluating LLM Agent Reliability Under Production-Like Stress Conditions

ReliabilityBench: 评估LLM代理在生产类压力条件下可靠性

Aayush Gupta

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 ReliabilityBench通过评估LLM代理在生产类压力条件下的可靠性,提出统一的可靠性表面和动作元关系,评估不同模型和架构的可靠性表现。

Comments 18 pages, 5 figures, 8 tables. Evaluates ReAct vs Reflexion across four tool-using domains with perturbation (epsilon) and fault-injection (lambda) stress testing; 1,280 total episodes

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04288 2026-01-13 cs.HC cs.LG cs.MA 79%

Human-in-the-Loop Testing of AI Agents for Air Traffic Control with a Regulated Assessment Framework

有人参与的AI空中交通管制代理评估框架

Ben Carvell, Marc Thomas, Andrew Pace, Christopher Dorney, George De Ath, Richard Everson, Nick Pepper, Adam Keane, Samuel Tomlinson, Richard Cannon

机构 * NATS University of Exeter(埃克塞特大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于监管认证模拟器的AI空中交通管制代理评估框架,通过人类参与评估提升AI性能测量的真实性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04794 2026-01-09 cs.AI 79%

APEX: Academic Poster Editing Agentic Expert

APEX:学术海报编辑智能专家

Chengxin Shi, Qinnan Cai, Zeyuan Chen, Long Zeng, Yibo Zhao, Jing Yu, Jianxiang Yu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 APEX是首个交互式学术海报编辑框架,通过多级API和审查机制实现细粒度控制,并引入首个系统性基准APEX-Bench评估编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04556 2026-01-09 cs.SE 79%

4D-ARE: Bridging the Attribution Gap in LLM Agent Requirements Engineering

4D-ARE:弥合LLM代理需求工程中的归因差距

Bo Yu, Lei Zhao

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 4D-ARE提出一种四维归因驱动代理需求工程方法,解决代理应推理什么的问题,补充运行时推理框架如何推理的不足。

Comments 39 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-01-08 cs.CL 79%

DiVA: Fine-grained Factuality Verification with Agentic-Discriminative Verifier

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23961 2026-01-01 cs.IR cs.AI cs.MA 79%

An Comparative Analysis about KYC on a Recommendation System Toward Agentic Recommendation System

面向代理推荐系统的KYC比较分析

Junjie H. Xu

机构 * Hechu Tech(海楚科技)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出利用代理AI的KYC推荐系统,通过对比不同垂直领域的性能,评估其在金融领域的应用效果。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22200 2025-12-30 cs.LG 79%

Emotion-Inspired Learning Signals (EILS): A Homeostatic Framework for Adaptive Autonomous Agents

情感启发学习信号(EILS):一种适应性自主代理的稳态框架

Dhruv Tiwari

机构 * Department of Computer Science(计算机科学系) Lovely Professional University(洛丽专业大学)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);分类 cs.LG

AI总结 EILS通过引入生物启发的情感信号,提升智能体在非平稳环境中的适应性和样本效率。

Comments 7 pages, 3 figures. arXiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00592 2025-12-30 cs.PL cs.DC cs.LG cs.PF 79%

Agentic Auto-Scheduling: An Experimental Study of LLM-Guided Loop Optimization

代理自调度:LLM引导循环优化的实验研究

Massinissa Merouani, Islem Kara Bernou, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.LG

AI总结 本文提出ComPilot框架,利用LLM与编译器闭环交互实现代码优化,实验表明其在循环优化中效果优于现有方法。

Comments Accepted at the 34th International Conference on Parallel Architectures and Compilation Techniques (PACT 2025). 12 pages, plus appendix

Journal ref 2025 34th International Conference on Parallel Architectures and Compilation Techniques (PACT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00336 2025-12-30 cs.RO cs.AI 79%

Never-Ending Behavior-Cloning Agent for Robotic Manipulation

永不终止的行为克隆代理用于机器人操作

Wenqi Liang, Gan Sun, Yao He, Yu Ren, Jiahua Dong, Yang Cong

机构 * State Key Laboratory of Robotics, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人国家重点实验室,沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) School of Automation Science and Engineering, South China University of Technology(自动化科学与工程学院,华南理工大学) Mohamed bin Zayed University of Artificial Intelligence(马斯达尔大学人工智能学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出NBAgent,通过持续学习技能共享和特定属性,解决具身机器人中3D场景表示和人类水平任务学习的挑战。

Comments 17 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21708 2025-12-29 cs.CL 79%

MoRAgent: Parameter Efficient Agent Tuning with Mixture-of-Roles

MoRAgent: 基于角色混合的参数高效代理调优

Jing Han, Binwei Yan, Tianyu Guo, Zheyuan Bai, Mengyu Zheng, Hanting Chen, Ying Nie

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 MoRAgent通过角色混合框架实现参数高效代理调优,分解任务为推理、执行和总结三个角色,结合低秩适应技术提升代理性能。

Comments Accepted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18450 2025-12-23 cs.AI cs.CV cs.MA 79%

Agent-Based Output Drift Detection for Breast Cancer Response Prediction in a Multisite Clinical Decision Support System

基于代理的输出漂移检测用于多中心临床决策支持系统中的乳腺癌反应预测

Xavier Rafael-Palou, Jose Munuera, Ana Jimenez-Pastor, Richard Osuala, Karim Lekadir, Oliver Diaz

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出基于代理的多中心临床决策支持系统中的输出漂移检测方法,通过模拟多中心环境验证了其在乳腺癌反应预测中的有效性,展示了自适应方案在漂移检测和严重性分类上的优越性能。

Comments Accepted at MICAD (Medical Imaging and Computer-Aided Diagnosis) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏