arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15603 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15603 篇

2602.10090 2026-05-26 cs.AI cs.CL cs.LG 93%

Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning

Agent World Model: 用于智能体强化学习的无限合成环境

Zhaoyang Wang, Canwen Xu, Boyi Liu, Yite Wang, Siwei Han, Zhewei Yao, Huaxiu Yao, Yuxiong He

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(title,title_cn);agentic(title);autonomous agent(abstract);tool-use(abstract)

AI总结 提出Agent World Model (AWM)全合成环境生成管道,通过代码驱动和数据库支持的环境进行大规模强化学习,使智能体在多样日常场景中泛化。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05668 2026-08-07 cs.MA cs.AI cs.MM 新提交 92%

F$^2$Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading

F²Agent:面向多模态交易的智能体智能金融融合框架

Changshuo Liu, Yanzheng Jin, Shangfeng Cai, Peng Fang, Xiaokui Xiao, Beng Chin Ooi

专题命中 Agent评测 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI

AI总结 该研究针对现有多模态金融交易模型的跨模态依赖捕捉不足、抗噪性差的问题,提出F²Agent框架,通过专业化智能体提取模态信号、模态感知自适应融合机制及抗噪正则化,在6种资产上较16个基线实现超20%年化回报率提升,表现出优异性能。

Comments 32 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22902 2026-06-29 cs.AI 新提交 92%

Agent-as-a-Router: Agentic Model Routing for Coding Tasks

Agent-as-a-Router: 面向编码任务的智能体模型路由

Pengfei Zhou, Zhiwei Tang, Yixing Ma, Jiasheng Tang, Yizeng Han, Zhenglin Wan, Fanqing Meng, Wei Wang, Bohan Zhuang, Wangbo Zhao, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) University of California, Berkeley(加州大学伯克利分校) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI

AI总结 提出Agent-as-a-Router框架,通过C-A-F循环积累执行经验,实现编码任务的动态模型路由,ACRouter在分布内任务上取得最低累积遗憾并泛化到分布外任务。

Comments 39 pages, 21 figures, a living technical report with a living benchmark that continuously updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02866 2025-08-21 cs.DC cs.DB 92%

PROV-AGENT: Unified Provenance for Tracking AI Agent Interactions in Agentic Workflows

Renan Souza, Amal Gueroudji, Stephen DeWitt, Daniel Rosendo, Tirthankar Ghosal, Robert Ross, Prasanna Balaprakash, Rafael Ferreira da Silva

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(title,abstract);workflow(abstract)

Comments Paper accepted for publication in the Proceedings of the 2025 IEEE 21st International Conference on e-Science. Cite it as: R. Souza, A. Gueroudji, S. DeWitt, D. Rosendo, T. Ghosal, R. Ross, P. Balaprakash, R. F. da Silva, "PROV-AGENT: Unified Provenance for Tracking AI Agent Interactions in Agentic Workflows," IEEE International Conference on e-Science, Chicago, IL, USA, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03686 2026-06-03 cs.AI 92%

The DeepSpeak-Agentic Dataset

DeepSpeak-Agentic 数据集

Sarah Barrington, Maty Bohacek, Hany Farid

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Stanford University, USA(斯坦福大学)

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出了一个包含37小时人机半结构化对话视频的数据集DeepSpeak-Agentic,用于评估AI代理的自动取证识别、研究人机交互特性,并作为大型语言模型和AI生成语音/面部技术的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10365 2026-05-12 cs.AI 92%

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

Agent-ValueBench: 一个全面的评估代理价值观的基准

Haonan Dong, Qiguan Feng, Kehan Jiang, Haoran Ye, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院) Peking University School of Psychological and Cognitive Sciences(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室)

专题命中 Agent评测 :agent(title,title_cn);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出Agent-ValueBench,首个专门评估代理价值观的基准,包含394个环境和4335个价值冲突任务,揭示代理价值观与基础LLM的差异及Harness和技能对价值观的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19185 2026-04-06 cs.SE cs.ET 92%

An Empirical Study of Testing Practices in Open Source AI Agent Frameworks and Agentic Applications

对开源AI代理框架和代理应用测试实践的实证研究

Mohammed Mehedi Hasan, Hao Li, Emad Fallahzadeh, Gopi Krishnan Rajbahadur, Bram Adams, Ahmed E. Hassan

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(title,abstract);分类 cs.SE

AI总结 本文通过分析39个开源代理框架和439个代理应用,发现确定性组件消耗了70%的测试资源,而FM-based Plan Body测试不足,提出改进测试方法和促进Prompt回归测试的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02630 2025-12-18 cs.AI cs.CY cs.HC cs.MA econ.GN q-fin.EC 92%

What Is Your AI Agent Buying? Evaluation, Biases, Model Dependence, & Emerging Implications for Agentic E-Commerce

你的AI代理在买什么?评估、偏见、模型依赖性及代理电子商务的新兴影响

Amine Allouah, Omar Besbes, Josué D Figueroa, Yash Kanoria, Akshit Kumar

机构 * MyCustomAI Columbia University, Graduate School of Business(哥伦比亚大学商学院) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 研究发现AI代理在电子商务中的行为具有显著偏见和波动性,且其决策受模型和提供者影响,需持续审计以应对市场变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10403 2025-11-14 cs.RO cs.AI 92%

nuPlan-R: A Closed-Loop Planning Benchmark for Autonomous Driving via Reactive Multi-Agent Simulation

Mingxing Peng, Ruoyu Yao, Xusen Guo, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Intelligent Transportation Thrust(智能交通方向) Robotics and Autonomous Systems Thrust(机器人与自主系统方向) Division of Emerging Interdisciplinary Areas(新兴跨学科领域部门)

专题命中 Agent评测 :agent(title,abstract);planning(title,abstract);multi-agent(title,abstract);分类 cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25819 2025-10-31 cs.CR cs.AI cs.NI 92%

Identity Management for Agentic AI: The new frontier of authorization, authentication, and security for an AI agent world

Tobin South, Subramanya Nagabhushanaradhya, Ayesha Dissanayaka, Sarah Cecchetti, George Fletcher, Victor Lu, Aldo Pietropaolo, Dean H. Saxe, Jeff Lombardo, Abhishek Maligehalli Shivalingaiah, Stan Bounev, Alex Keisner, Andor Kesselman, Zack Proser, Ginny Fahs, Andrew Bunyea, Ben Moskowitz, Atul Tulshibagwale, Dazza Greenwood, Jiaxin Pei, Alex Pentland

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);agentic(title);autonomous agent(abstract)

Journal ref OpenID Foundation Whitepaper, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18836 2025-08-06 cs.AI 92%

REALM-Bench: A Benchmark for Evaluating Multi-Agent Systems on Real-world, Dynamic Planning and Scheduling Tasks

Longling Geng, Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(title,abstract);planning(title,abstract);multi-agent(title,abstract);分类 cs.AI

Comments 24 pages, 8 figures, 28 tables, 7 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23723 2026-05-04 cs.CL cs.AI cs.LG 91%

ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering

ML-Agent: 通过强化学习增强大语言模型代理以实现自主机器学习工程

Zexi Liu, Jingyi Chai, Xinyu Zhu, Shuo Tang, Rui Ye, Bo Zhang, Lei Bai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于强化学习的代理机器学习框架,通过探索增强微调、分步强化学习和专用奖励模块,训练出性能媲美大模型但成本更低的ML-Agent,实现跨任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24855 2026-06-24 cs.AI 新提交 91%

OpenThoughts-Agent: Data Recipes for Agentic Models

OpenThoughts-Agent: 智能体模型的数据配方

Negin Raoof, Richard Zhuang, Marianna Nezhurina, Etash Guha, Atula Tejaswi, Ryan Marten, Charlie F. Ruan, Tyler Griggs, Alexander Glenn Shaw, Hritik Bansal, E. Kelly Buchanan, Artem Gazizov, Reinhard Heckel, Chinmay Hegde, Sankalp Jajee, Daanish Khazi, Emmanouil Koukoumidis, Xiangyi Li, Hange Liu, Shlok Natarajan, Harsh Raj, Nicholas Roberts, Ethan Shen, Nishad Singhi, Michael Siu, Ashima Suvarna, Hanwen Xing, Patrick Yubeaton, Robert Zhang, Leon Liangyu Chen, Xiaokun Chen, Steven Dillmann, Saadia Gabriel, Xunyi Jiang, Anurag Kashyap, Boxuan Li, Yein Park, Minh Pham, Sujay Sanghavi, Lin Shi, Ke Sun, Yixin Wang, Zhiwei Xu, Erica Zhang, Siyan Zhao, Wanjia Zhao, Jenia Jitsev, Alex Dimakis, Benjamin Feuer, Ludwig Schmidt

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) JSC(于利希超级计算中心) LAION University of Texas at Austin(德克萨斯大学奥斯汀分校) Bespoke Labs Laude Institute UCLA(加州大学洛杉矶分校) Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) New York University(纽约大学) Medical University of South Carolina(南卡罗来纳医科大学) The LLM Data Company BenchFlow Independent Researcher(独立研究员) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Washington(华盛顿大学) TU Darmstadt(达姆施塔特工业大学) University of Southern California(南加州大学) UC San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Microsoft(微软) Korea University(高丽大学) Cornell Tech(康奈尔科技) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI

AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21937 2026-05-19 cs.AI cs.MA 91%

MolClaw: An Autonomous Agent with Hierarchical Skills for Drug Molecule Evaluation, Screening, and Optimization

MolClaw:一种具有分层技能的自主代理,用于药物分子评估、筛选和优化

Lisheng Zhang, Lilong Wang, Xiangyu Sun, Wei Tang, Haoyang Su, Yuehui Qian, Qikui Yang, Qingsong Li, Zhenyu Tang, Haoran Sun, Yingnan Han, Yankai Jiang, Wenjie Lou, Bowen Zhou, Xiaosong Wang, Lei Bai, Zhengwei Xie

机构 * Peking University Health Science Center, Peking University, Beijing, China(北京大学北京医院科学中心,北京大学,北京,中国) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Academy for Advanced Interdisciplinary Studies, Peking University, Beijing, China(北京大学先进跨学科研究学院,北京大学,北京,中国)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);AI agent(abstract);planning(abstract)

AI总结 MolClaw通过分层技能架构整合30余种领域资源,实现药物分子评估、筛选和优化的自动化,其在复杂工作流中的表现优于现有AI代理。

Comments 28 pages, 8 figures. Code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10547 2026-05-14 cs.AI 91%

Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?

Agent^2 RL-Bench: 能否让LLM代理在训练后设计自主强化学习?

Wanyi Chen, Xiao Yang, Xu Yang, Tianming Sha, Qizheng Li, Zhuo Wang, Bowen Xian, Fang Kong, Weiqing Liu, Jiang Bian

机构 * Soochow University(苏州大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Stony Brook University(石溪大学) The University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(title,title_cn);agentic(title,abstract);分类 cs.AI

AI总结 Agent2 RL-Bench评估LLM代理在训练后自主设计、实现、调试和执行提升基础模型的管道能力,展示代理在强化学习中的智能行为与局限性。

Comments 37 pages, 7 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01295 2025-10-03 cs.AI cs.MA 91%

The Social Laboratory: A Psychometric Framework for Multi-Agent LLM Evaluation

Zarreen Reza

机构 * Independent researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);AI agent(abstract);autonomous agent(abstract)

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25873 2025-10-01 cs.AI cs.CL cs.LG cs.PL cs.SE 91%

Lita: Light Agent Uncovers the Agentic Coding Capabilities of LLMs

Hankun Dai, Maoquan Wang, Mengnan Qi, Yikai Zhang, Zijian Jin, Yongqiang Yao, Yufan Huang, Shengyu Fu, Elsie Nallipogu

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);autonomous agent(abstract);workflow(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15366 2025-09-22 cs.AI 91%

Diagnostics of cognitive failures in multi-agent expert systems using dynamic evaluation protocols and subsequent mutation of the processing context

Andrejs Sorstkins, Josh Bailey, Dr Alistair Baron

机构 * School of Computing and Communications(计算与通讯学院) Lancaster University(兰卡斯特大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);tool use(abstract);planning(abstract)

Comments Dissertation and research project created in collaboration with JobFair LTD

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01725 2026-06-02 cs.AI cs.LG 91%

Characterization of Multi-Model Agentic AI Systems on General Tasks via Trace-Driven Simulation

基于迹驱动仿真的通用任务多模型智能体AI系统特征分析

Donghwan Kim, Prakhar Singh, Younghoon Min, Jongryool Kim, Jongse Park, Kiwan Maeng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) SK Hynix(SK海力士) KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(summary_cn,abstract);agentic(title,abstract);tool use(abstract);planning(abstract)

AI总结 本文提出GAIATrace数据集和Vidur-Agent仿真器,通过迹驱动仿真分析多模型智能体AI系统在通用任务上的行为特征。

Comments 13 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22608 2026-05-22 cs.CL cs.AI 91%

Agentic CLEAR: Automating Multi-Level Evaluation of LLM Agents

Agentic CLEAR: 自动化多层级评估LLM代理

Asaf Yehudai, Lilach Eden, Michal Shmueli-Scheuer

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出Agentic CLEAR框架,通过多层级细粒度分析实现LLM代理的自动化评估,提供高质量的数据驱动反馈并预测任务成功率。

Comments ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04284 2026-05-12 cs.AI cs.LG 91%

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

Agent-Omit:适应性上下文省略以提高LLM代理效率

Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science(香港科学与技术大学人工智能前沿) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agent-Omit框架,通过省略冗余思考和观察提升LLM代理效率,实验表明其在多个基准测试中表现优异。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18292 2026-04-21 cs.AI cs.CL 91%

Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence

Agent-World:通过可扩展环境提升进化通用智能

Guanting Dong, Junting Lu, Junjie Huang, Wanjun Zhong, Longxiang Liu, Shijue Huang, Zhenyu Li, Yang Zhao, Xiaoshuai Song, Xiaoxi Li, Jiajie Jin, Yutao Zhu, Hanbin Wang, Fangyu Lei, Qinyu Luo, Mingyang Chen, Zehui Chen, Jiazhan Feng, Ji-Rong Wen, Zhicheng Dou

机构 * Renmin University of China(中国人民大学) ByteDance Seed(字节跳动种子)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Agent-World,通过可扩展环境实现通用智能进化,展示其在23个挑战性基准测试中超越现有模型和基线。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17149 2024-12-24 cs.CL cs.AI cs.ET cs.MA cs.NE 91%

A Multi-AI Agent System for Autonomous Optimization of Agentic AI Solutions via Iterative Refinement and LLM-Driven Feedback Loops

Kamer Ali Yuksel, Hassan Sawaf

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);AI agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24693 2026-05-26 cs.CL 91%

CP-Agent: A Calibrated Risk-Controlled Agent for Feedback-Driven Competitive Programming

CP-Agent: 一种用于反馈驱动竞赛编程的校准风险控制智能体

Peisong Wang, Bowen Liu, Zehua Li, Yuyao Wang, Zhiwei Ma, Yuhan Li, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.CL

AI总结 提出CP-Agent,通过校准停止过程建模反馈驱动求解,结合双重粒度验证、测试增强和经验驱动自我进化机制,在不更新参数的情况下显著提升竞赛编程性能。

Comments Code: https://github.com/NineAbyss/CP-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18491 2026-04-24 cs.AI cs.CC cs.CL cs.CV cs.LG 91%

AgentDoG: A Diagnostic Guardrail Framework for AI Agent Safety and Security

AgentDoG:一种面向AI代理安全与安全的诊断防护框架

Dongrui Liu, Qihan Ren, Chen Qian, Shuai Shao, Yuejin Xie, Yu Li, Zhonghao Yang, Haoyu Luo, Peng Wang, Qingyu Liu, Binxin Hu, Ling Tang, Jilin Mei, Dadi Guo, Leitao Yuan, Junyao Yang, Guanxu Chen, Qihao Lin, Yi Yu, Bo Zhang, Jiaxuan Guo, Jie Zhang, Wenqi Shao, Huiqi Deng, Zhiheng Xi, Wenjie Wang, Wenxuan Wang, Wen Shen, Zhikai Chen, Haoyu Xie, Jialing Tao, Juntao Dai, Jiaming Ji, Zhongjie Ba, Linfeng Zhang, Yong Liu, Quanshi Zhang, Lei Zhu, Zhihua Wei, Hui Xue, Chaochao Lu, Jing Shao, Xia Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);agentic(abstract)

AI总结 本文提出AgentDoG框架,通过统一的三维分类法和细粒度安全基准,解决AI代理安全与安全中的复杂风险问题,提供细粒度监控和根因诊断,实现有效代理对齐。

Comments 40 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19127 2026-07-03 cs.CL 版本更新 91%

AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准

Qijie You, Wenkai Yu, Wentao Zhang

机构 * University of Science and Technology Beijing(北京科技大学) Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract);分类 cs.CL

AI总结 提出首个由大语言模型自动构建的Agentic RAG基准AgenticRAGTracer,包含1305个跨领域数据点,支持逐跳验证,揭示模型在多步推理中推理链扭曲的问题。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23032 2026-07-01 cs.AI q-fin.GN 新提交 91%

IPO Finance Agent: Benchmark of LLM Financial Analysts Beyond Finance Agent v2, with Automated Rubric Generation, on the SpaceX (SPCX) IPO

IPO金融分析师:超越Finance Agent v2的LLM金融分析师评估,带自动评分标准生成——以SpaceX (SPCX) IPO为例

Mostapha Benhenda

机构 * Vals AI

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 针对IPO尽职调查中长文档检索的挑战,提出IPO Finance Agent框架,通过上下文检索和自动评分标准生成,在SpaceX S-1文件上评估多个LLM,最佳模型Qwen 3.7 Max准确率79.4%,成本$0.30/查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11218 2026-06-11 cs.CY cs.AI 新提交 91%

An Ethical eValuation Agent (EeVA): Results of a Proof-of-Concept Test on a Prototype Agentic-like Workflow to Assist Ethical Deliberations

伦理评估代理(EeVA):在原型类代理工作流中辅助伦理审议的概念验证测试结果

Stephen Milford, B. Zara Malgir, Miguel Vazquez

机构 * Institute for Biomedical Ethics, Basel University(伦理研究所,巴塞尔大学) North-West University(北开普大学) Barcelona Supercomputing Center(巴塞罗那超级计算中心)

专题命中 Agent评测 :workflow(title,abstract);agentic(title,abstract);agent(title);分类 cs.AI

AI总结 提出基于LLM的类代理工作流EeVA,通过10种伦理框架评估用例,生成结构化评估与综合,促进伦理反思而非给出绝对答案,在三个案例中验证了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06453 2026-06-05 cs.AI 91%

Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

Vortex: 面向AI Agent的高效可编程稀疏注意力服务

Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Rice University(Rice大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :AI agent(title,title_cn);agent(title_cn,abstract_cn);分类 cs.AI

AI总结 提出Vortex系统,通过Python嵌入式前端语言和面向页面的张量抽象,结合高效后端,实现稀疏注意力算法的快速原型设计、部署和评估,显著提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05658 2026-06-05 cs.IR cs.AI 91%

Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval

Agent编排的自适应RAG:结构化与多跳检索的比较研究

Anuj Maharjan, Devinder Kaur, Richard Molyet

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 提出Agent编排的自适应RAG框架,通过动态查询分解、迭代检索和自反思评估,在结构化领域(DevOps)和多跳推理基准(MuSiQue)上对比发现,查询分解在结构化领域提升性能但降低多跳排名精度,反思机制提高引用准确性但增加延迟,表明Agent增强需根据查询和领域特性选择性应用。

详情

展开后加载摘要…

URL PDF HTML 收藏