arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2603.12310 2026-03-16 cs.CV cs.AI cs.LG cs.MA 84%

VQQA: An Agentic Approach for Video Evaluation and Quality Improvement

VQQA:视频评估与质量提升的代理方法

Yiwen Song, Tomas Pfister, Yale Song

机构 * Google(谷歌)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VQQA框架,通过动态生成视觉问题并利用视觉语言模型进行语义梯度优化,实现高效的闭环提示优化,提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10745 2026-03-13 cs.AI cs.CV cs.LG cs.MA cs.MM 84%

Agentic Design Review System

代理设计评审系统

Sayan Nag, K J Joseph, Koustava Goswami, Vlad I Morariu, Balaji Vasan Srinivasan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgenticDRS系统,通过多个代理协作分析设计,结合图匹配和提示扩展方法,实现高效的设计评估与反馈生成。

Comments Project Page: https://sayannag.github.io/AgenticDRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10060 2026-03-12 cs.CR cs.AI cs.CL 84%

Tool Receipts, Not Zero-Knowledge Proofs: Practical Hallucination Detection for AI Agents

工具 receipts,而非零知识证明:面向 AI agent 的实用幻觉检测

Abhinaba Basu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 NabaOS 通过 epistemic 分类和 receipts 验证,实现交互式 AI agent 幻觉检测的高效高精度验证方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07379 2026-03-10 cs.AI cs.CL cs.CR cs.IR 84%

SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research Directions

SoK:基于代理的检索增强生成(RAG):分类、架构、评估及研究方向

Saroj Mishra, Suman Niroula, Umesh Yadav, Dilip Thakur, Srijan Gyawali, Shiva Gaire

机构 * University of North Dakota(北达科他大学) Youngstown State University(青年州大学) University of Toledo(托莱多大学) University of Missouri(密苏里大学) Tribhuvan University(特里布文大学)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 本文系统化地分析了基于代理的RAG系统,提出统一框架,识别关键风险并提出研究方向,以构建可靠可扩展的自主检索生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04403 2026-03-06 cs.IR cs.AI cs.CL 84%

FinRetrieval: A Benchmark for Financial Data Retrieval by AI Agents

FinRetrieval:通过AI代理进行金融数据检索的基准测试

Eric Y. Kim, Jie Huang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 FinRetrieval通过AI代理进行金融数据检索的基准测试,揭示了工具可用性对性能的主导作用及不同代理在推理模式和基础能力上的差异。

Comments 26 pages, 2 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02798 2026-03-04 cs.AI cs.CL 84%

Guideline-Grounded Evidence Accumulation for High-Stakes Agent Verification

基于指南的证据积累用于高风险代理验证

Yichi Zhang, Nabeel Seedat, Yinpeng Dong, Peng Cui, Jun Zhu, Mihaela van de Schaar

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Thomson Reuters Foundational Research(汤姆森路透基础研究)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 GLEAN通过基于指南的证据积累框架,提升高风险代理决策的验证可靠性,实验显示其在AUROC和Brier分数减少方面均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00214 2026-03-03 cs.SE cs.AI cs.MS physics.geo-ph 84%

Agentic Scientific Simulation: Execution-Grounded Model Construction and Reconstruction

代理科学模拟:基于执行的模型构建与重建

Knut-Andreas Lie, Olav Møyner, Elling Svee, Jakob Torben

机构 * SINTEF Digital(SINTEF数字研究院) Department of Mathematical Sciences(数学科学系) NTNU(挪威特纳厄大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出JutulGPT,通过代理科学模拟实现基于执行的模型构建与重建,解决模拟描述中的歧义问题,并公开所有代码和日志以确保可重现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23373 2026-03-02 cs.AI cs.CL cs.IR 84%

An Agentic LLM Framework for Adverse Media Screening in AML Compliance

面向反面媒体筛查的代理LLM框架用于反洗钱合规

Pavel Chernakov, Sasan Jafarnejad, Raphaël Frank

机构 * Interdisciplinary Centre for Security, Reliability and Trust(安全、可靠与信任跨学科中心)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于LLM与RAG的代理框架,用于自动化反面媒体筛查,通过多步骤流程实现高风险个体的准确识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04072 2026-02-11 cs.AI cs.LG 84%

Among Us: A Sandbox for Measuring and Detecting Agentic Deception

Among Us: 一种用于衡量和检测代理欺骗的沙盒

Satvik Golechha, Adrià Garriga-Alonso

机构 * MATS FAR AI

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 Among Us通过开放的沙盒游戏评估LLM的欺骗能力,发现强化学习训练的模型更擅长生成欺骗而非检测,且基于激活的逻辑回归和SAEs在检测中表现优异。

Comments 21 pages, preprint

Journal ref NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20694 2026-02-10 cs.AI astro-ph.SR cs.LG physics.space-ph 84%

Reasoning With a Star: A Heliophysics Dataset and Benchmark for Agentic Scientific Reasoning

用恒星进行推理:一个用于代理科学推理的太阳物理数据集和基准

Kevin Lee, Russell Spiewak, James Walsh

机构 * Frontier Development Lab(前沿发展实验室) Department of Mechanical and Aerospace Engineering, UCLA(机械与航空航天工程系,加州大学洛杉矶分校) Trillium Technologies Inc.(Trillium技术公司) Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一个太阳物理数据集和基准,用于评估代理在科学推理中的表现,发现系统工程原则在演绎推理任务中优于直接提示方法。

Comments Accepted at NeurIPS 2025 Machine Learning and the Physical Sciences (ML4PS) Workshop. Dataset: https://huggingface.co/datasets/SpaceML/ReasoningWithAStar

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02424 2026-02-10 cs.CR cs.AI cs.SE 84%

CyberRAG: An Agentic RAG cyber attack classification and reporting tool

CyberRAG: 一种基于代理的RAG网络攻击分类与报告工具

Francesco Blefari, Cristian Cosentino, Francesco Aurelio Pironti, Angelo Furfaro, Fabrizio Marozzo

机构 * University of Calabria(卡利博里大学) IMT School for Advanced Studies(IMT高级研究学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 CyberRAG是一种基于代理的RAG框架,通过模块化设计实现网络攻击的实时分类、解释和结构化报告,提高检测准确性和可解释性。

Journal ref Future Generation Computer Systems, 176, 2026, 108186

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02389 2026-02-05 cs.SE cs.CR cs.LG 84%

From Trace to Line: LLM Agent for Real-World OSS Vulnerability Localization

从痕迹到行:面向真实世界OSS漏洞定位的LLM代理

Haoran Xi, Minghao Shao, Brendan Dolan-Gavitt, Muhammad Shafique, Ramesh Karri

机构 * NYU Tandon School of Engineering(纽约大学唐纳德工程学院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.LG、cs.SE

AI总结 T2L框架通过基于AST的分块和证据引导细化,实现项目级和行级漏洞定位,提升LLM在开源软件中的精准诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18352 2026-01-30 cs.CL cs.AI 84%

LLM-based Few-Shot Early Rumor Detection with Imitation Agent

基于大语言模型的少样本早期谣言检测与模仿代理

Fengzhu Zeng, Qian Shao, Ling Cheng, Wei Gao, Shih-Fen Cheng, Jing Ma, Cheng Niu

机构 * Singapore Management University(新加坡管理大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于自主代理和大语言模型的少样本早期谣言检测框架,通过轻量级代理提升效率,实现准确性和早熟性的提升。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17087 2026-01-29 cs.HC cs.AI cs.CY cs.LG 84%

Lost in Simulation: LLM-Simulated Users are Unreliable Proxies for Human Users in Agentic Evaluations

陷入模拟:LLM模拟用户在代理评估中是不可靠的人类用户代理

Preethi Seshadri, Samuel Cahyawijaya, Ayomide Odumakinde, Sameer Singh, Seraphina Goldfarb-Tarrant

机构 * UC Irvine(加州大学欧文分校) Cohere(Cohere公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 研究发现LLM模拟用户在代理评估中存在稳健性不足、校准误差和文化差异问题,影响评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03310 2026-01-13 cs.AI cs.SE 84%

app.build: A Production Framework for Scaling Agentic Prompt-to-App Generation with Environment Scaffolding

app.build:一种用于扩展基于代理的提示到应用程序生成的生产框架

Evgenii Kniazev, Arseny Kravchenko, Igor Rekun, James Broadhead, Nikita Shamgunov, Pranav Sah, Pratik Nichite, Ivan Yamshchikov

机构 * Databricks THWS University of Applied Sciences Würzburg-Schweinfurt (CAIRO)(THWS应用科学大学沃尔夫斯堡-施维林(CAIRO))

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 app.build通过结构化环境和系统验证提升基于代理的应用程序生成效率,实现高可行性与质量,为生产级代理系统提供参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05432 2026-01-12 cs.CV cs.AI cs.CL 84%

Thinking with Map: Reinforced Parallel Map-Augmented Agent for Geolocalization

基于地图的思考:用于地理定位的强化并行地图增强智能体

Yuxiang Ji, Yong Wang, Ziyu Ma, Yiming Hu, Hailang Huang, Xuecai Hu, Guanhua Chen, Liaoni Wu, Xiangxiang Chu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP) Southern University of Science and Technology(南方科技大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出基于地图的强化并行智能体,通过两阶段优化提升地理定位精度,实验显示在Acc@500m指标上显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00868 2026-01-06 cs.LG cs.AI 84%

SmartFlow Reinforcement Learning and Agentic AI for Bike-Sharing Optimisation

SmartFlow 强化学习与代理AI用于自行车共享优化

Aditya Sreevatsa K, Arun Kumar Raveendran, Jesrael K Mani, Prakash G Shigli, Rajkumar Rangadore, Narayana Darapaneni, Anwesh Reddy Paduri

机构 * Department of Data Science, Machine Learning \& Artificial Intelligence, PES University, Bengaluru, Karnataka - 560100, India 1 Sunrise Setting Ltd, 12a Fore Street, St. Marychurch, Torquay, Devon, TQ1 4NE, UK 2 European Alliance for Innovation (EAI), Gent, Belgium

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 SmartFlow 通过整合强化学习与代理AI,实现城市自行车共享系统的高效再平衡,显著减少网络不平衡并提升运营效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00516 2026-01-05 cs.LG cs.AI 84%

Trajectory Guard -- A Lightweight, Sequence-Aware Model for Real-Time Anomaly Detection in Agentic AI

轨迹守护 -- 一种轻量级、序列感知的模型,用于代理AI中的实时异常检测

Laksh Advani

机构 * Laksh Advani

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 轨迹守护通过对比学习和重建学习,实现对代理AI中任务轨迹对齐和序列有效性的联合检测,提升实时异常检测性能。

Comments Accepted to AAAI Trustagent 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17158 2025-12-12 cs.AI cs.CL 84%

ARE: Scaling Up Agent Environments and Evaluations

ARE:扩展代理环境和评估

Romain Froger, Pierre Andrews, Matteo Bettini, Amar Budhiraja, Ricardo Silveira Cabral, Virginie Do, Emilien Garreau, Jean-Baptiste Gaya, Hugo Laurençon, Maxime Lecanu, Kunal Malkan, Dheeraj Mekala, Pierre Ménard, Gerard Moreno-Torres Bertran, Ulyana Piterbarg, Mikhail Plekhanov, Mathieu Rita, Andrey Rusakov, Vladislav Vorotilov, Mengjue Wang, Ian Yu, Amine Benhalloum, Grégoire Mialon, Thomas Scialom

机构 * Meta Superintelligence Labs(Meta超级智能实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 ARE平台通过Gaia2基准测试代理能力,强调需新架构和适应性计算策略以应对智能光谱的挑战。

Comments Updated authors order and acknowledgement

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19262 2025-11-25 cs.AI cs.LG math.ST stat.TH 84%

Psychometric Tests for AI Agents and Their Moduli Space

人工智能代理的心理测量测试及其模空间

Przemyslaw Chojecki

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于模理论的视角,用于分析人工智能代理的心理测量测试电池,并定义了AAI分数及其核心概念,揭示了测试电池在对称性下的不变性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14631 2025-11-19 cs.CL cs.AI cs.CV cs.MA 84%

Enhancing Agentic Autonomous Scientific Discovery with Vision-Language Model Capabilities

Kahaan Gandhi, Boris Bolliet, Inigo Zubeldia

机构 * Department of Physics, University of Cambridge, Cambridge, United Kingdom(剑桥大学物理系) Kavli Institute for Cosmology, University of Cambridge, Cambridge, United Kingdom(剑桥大学卡弗利天文研究所) Department of Physics and Astronomy, Haverford College, 370 Lancaster Avenue, Haverford, PA 19041, USA(哈弗福德学院物理与天文学系) Division of Physics, Mathematics and Astronomy, California Institute of Technology, Pasadena, CA 91125, USA(加州理工学院物理、数学与天文学系) Institute of Astronomy, University of Cambridge, Cambridge, United Kingdom(剑桥大学天文研究所)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13998 2025-11-19 cs.SE cs.AI 84%

LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering

Jielin Qiu, Zuxin Liu, Zhiwei Liu, Rithesh Murthy, Jianguo Zhang, Haolin Chen, Shiyu Wang, Ming Zhu, Liangwei Yang, Juntao Tan, Roshan Ram, Akshara Prabhakar, Tulika Awalgaonkar, Zixiang Chen, Zhepeng Cen, Cheng Qian, Shelby Heinecke, Weiran Yao, Silvio Savarese, Caiming Xiong, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

Comments 54-pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13537 2025-11-18 cs.LG cs.AI 84%

Competence-Aware AI Agents with Metacognition for Unknown Situations and Environments (MUSE)

Rodolfo Valiente, Praveen K. Pilly

机构 * Intelligent Systems Center, HRL Laboratories(智能系统中心,HRL实验室)

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

Comments Replaced all references to "self-awareness" with the more accurate term "self-assessment"; Updated Figure 2; Added recent pertinent work from the cognitive computational neuroscience literature; Removed the non-apples-to-apples comparison with Dreamer-v3 for self-assessment; Added additional experiments to validate the role of accurate self-assessment in effective self-regulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11324 2025-11-17 cs.CL cs.AI 84%

NOVA: An Agentic Framework for Automated Histopathology Analysis and Discovery

Anurag J. Vaidya, Felix Meissen, Daniel C. Castro, Shruthi Bannur, Tristan Lazard, Drew F. K. Williamson, Faisal Mahmood, Javier Alvarez-Valle, Stephanie L. Hyland, Kenza Bouzid

机构 * Mass General Brigham(麻省总医院) Microsoft Health Futures(微软健康未来) Emory University(埃默里大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08242 2025-11-12 cs.AI cs.CL 84%

Towards Outcome-Oriented, Task-Agnostic Evaluation of AI Agents

Waseem AlShikh, Muayad Sayed Ali, Brian Kennedy, Dmytro Mozolevskyi

机构 * Writer, Inc.(Writer公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05459 2025-11-12 cs.SE cs.AI 84%

SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models

Jingxuan Xu, Ken Deng, Weihao Li, Songwei Yu, Huaixi Tang, Haoyang Huang, Zhiyi Lai, Zizheng Zhan, Yanan Wu, Chenchen Zhang, Kepeng Lei, Yifan Yao, Xinping Lei, Wenqiang Zhu, Zongxian Feng, Han Li, Junqi Xiong, Dailin Li, Zuchen Gao, Kun Wu, Wen Xiang, Ziqi Zhan, Yuanxing Zhang, Wuxuan Gong, Ziyuan Gao, Guanxiang Wang, Yirong Xue, Mengtong Li, Mengfei Xie, Xiaojiang Zhang, Jinghui Wang, Wenhao Zhuang, Zheng Lin, Huiming Wang, Zhaoxiang Zhang, Yuqun Zhang, Haotian Zhang, Bin Chen, Jiaheng Liu

机构 * Kuaishou Technology(快手科技) Nanjing University(南京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02885 2025-11-06 cs.SE cs.AI 84%

AgentSLA : Towards a Service Level Agreement for AI Agents

Gwendal Jouneaux, Jordi Cabot

机构 * Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22898 2025-10-28 cs.AI cs.SE 84%

On Generalization in Agentic Tool Calling: CoreThink Agentic Reasoner and MAVEN Dataset

Vishvesh Bhat, Omkar Ghugarkar, Julian McAuley

机构 * CoreThink AI University of California, San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agentic(title,abstract);tool-use(abstract);分类 cs.AI、cs.SE

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09907 2025-10-14 cs.SE cs.AI 84%

Agentic Property-Based Testing: Finding Bugs Across the Python Ecosystem

Muhammad Maaz, Liam DeVoe, Zac Hatfield-Dodds, Nicholas Carlini

机构 * MATS, Anthropic(MATS,Anthropic) Northeastern University(东北大学) Anthropic

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

Comments 4 pages (main), NeurIPS 2025, The 4th Deep Learning for Code Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06711 2025-10-09 cs.AI cs.LG 84%

Inefficiencies of Meta Agents for Agent Design

Batu El, Mert Yuksekgonul, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏