arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-17 至 2026-04-17 共收录 34 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 34 篇

2604.14455 2026-04-17 cs.AI 89%

AIBuildAI: An AI Agent for Automatically Building AI Models

AIBuildAI: 一个用于自动构建AI模型的AI代理

Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学系)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 AIBuildAI通过分层代理架构自动构建AI模型,超越传统AutoML,实现端到端自动化,展示出在Kaggle风格任务中63.1%的获奖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10866 2026-04-17 cs.CL 85%

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation

OccuBench:通过语言环境模拟评估AI代理在真实世界专业任务中的表现

Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng, Yuxuan Liu, Yantao Liu, Dayiheng Liu, Tsung-Yi Ho

机构 * Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 OccuBench通过语言环境模拟评估AI代理在100个真实世界专业任务场景中的表现,涵盖10个行业类别和65个专业领域,发现大模型、新版本和高推理能力提升性能,但强代理不等于强环境模拟器。

Comments 23 pages, 8 figures, 2 tables. Project page: https://gregxmhu.github.io/OccuBench-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14509 2026-04-17 cs.SE cs.AI cs.CL 83%

E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task

E2EDev:端到端软件开发任务中大语言模型的基准测试

Jingyao Liu, Chen Huang, Zhizhao Guan, Wenqiang Lei, Yang Deng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) CHAT NLP Group, Singapore Management University(新加坡国立管理大学CHAT NLP组) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(教育部长机器学习与产业智能工程研究中心)

专题命中 Agent评测 :agent(abstract,abstract_cn);multi-agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出E2EDev基准,基于行为驱动开发原则,通过模拟真实用户交互评估端到端软件开发框架的能力,揭示现有方法在解决复杂任务中的不足。

Comments Accepted to ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14583 2026-04-17 cs.LG 83%

From Risk to Rescue: An Agentic Survival Analysis Framework for Liquidation Prevention

从风险到救援:一种用于防止清算的代理生存分析框架

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 本文提出一种基于生存分析的代理框架,通过预测和执行干预主动防止清算,引入返回期指标和趋势分数以优化资本效率,验证结果表明其能有效预防高风险场景下的清算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14160 2026-04-17 cs.AI 83%

NuHF Claw: A Risk Constrained Cognitive Agent Framework for Human Centered Procedure Support in Digital Nuclear Control Rooms

NuHF Claw:一种面向数字核控制室的人本流程支持的风险约束认知代理框架

Xingyu Xiao, Jiejuan Tong, Jun Sun, Zhe Sui, Peng Chen, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出NuHF Claw框架,通过风险约束代理运行时,将认知状态推断与概率安全评估结合,实现实时自主系统行为调控,提升核控制室操作安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09643 2026-04-17 cs.ET cs.AI 83%

MM-tau-p$^2$: Persona-Adaptive Prompting for Robust Multi-Modal Agent Evaluation in Dual-Control Settings

MM-tau-p$^2$: 人格自适应提示用于双控制设置中多模态代理的鲁棒性评估

Anupam Purwar, Aditya Choudhary

机构 * Sprinklr AI

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出MM-tau-p$^2$基准,通过12个新指标评估多模态代理在双控制环境中的鲁棒性,结合用户输入解决查询,并展示即使使用前沿LLM,多模态鲁棒性等指标仍需考虑。

Comments A benchmark for evaluating multimodal both voice and text LLM agents in dualcontrol settings. We introduce persona adaptive prompting and 12 new metrics to assess robustness safety efficiency and recovery in customer support scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14216 2026-04-17 cs.MM cs.AI cs.CL cs.CV cs.GR cs.LG 82%

Neuro-Oracle: A Trajectory-Aware Agentic RAG Framework for Interpretable Epilepsy Surgical Prognosis

Neuro-Oracle:一种具有轨迹意识的代理RAG框架用于可解释性癫痫手术预后

Aizierjiang Aiersilan, Mohamad Koubeissi

机构 * The George Washington University(乔治华盛顿大学)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Neuro-Oracle框架,通过三维Siamese对比编码器提取术前术后MRI变化,检索历史相似手术轨迹,并利用量化Llama-3-8B推理代理生成自然语言预后,验证了轨迹意识检索架构的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27420 2026-04-17 cs.RO 82%

Towards a Multi-Embodied Grasping Agent

迈向多体 grasping agent

Roman Freiberg, Alexander Qualmann, Ngo Anh Vien, Gerhard Neumann

机构 * Bosch Corporate Research(博世企业研究) Autonomous Learning Robots Lab(自主学习机器人实验室) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 Agent评测 :agent(title,title_cn)

AI总结 本文提出一种高效、基于流的 equivariant grasping 架构,能够处理不同自由度的抓取器,通过抓取器和场景几何信息推导出底层运动学模型,提升学习效率和性能。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19168 2026-04-17 econ.GN cs.MA q-fin.EC 82%

Implications of zero-growth economics analysed with an agent-based model

零增长经济学的含义通过基于代理的模型进行分析

Dylan C. Terry-Doyle, Adam B. Barrett

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文通过基于代理的模型研究零增长经济学的稳定性,发现零增长情景在经济指标上更具稳定性,但伴随更高的通胀率和经济危机风险。

Comments 51 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15915 2026-04-17 cs.LG cs.CL 81%

AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization

AccelOpt:一种自我改进的LLM代理系统,用于AI加速器内核优化

Genghan Zhang, Shaowei Zhu, Anjiang Wei, Zhenyu Song, Allen Nie, Zhen Jia, Nandita Vijaykumar, Yida Wang, Kunle Olukotun

机构 * Anonymous Authors(匿名作者)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL、cs.LG

AI总结 AccelOpt通过迭代生成探索内核优化空间,利用优化记忆库提升AI加速器内核性能,实验证明其能力随时间提升,且成本效益高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14220 2026-04-17 cs.IR cs.AI 79%

Knowledge Graph RAG: Agentic Crawling and Graph Construction in Enterprise Documents

知识图谱RAG:企业文档中的代理爬取与图谱构建

Koushik Chakraborty, Koyel Guha

机构 * Google AI, Global Services Delivery(谷歌AI,全球服务交付)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出基于递归爬取的代理知识图谱,解决复杂企业文档语义检索的局限性,提升法规查询的准确率。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14683 2026-04-17 cs.AI 77%

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

DR$^{3}$-Eval: 向真实和可重复的深度研究评估迈进

Qianqian Xie, Qingheng Xiong, He Zhu, Tiantian Xia, Xueming Han, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng, Jiaheng Liu

机构 * Nanjing University(南京大学) M-A-P Jiutian Research(九天研究) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出DR$^{3}$-Eval基准,用于评估多模态多文件报告生成的深度研究代理,通过真实用户材料和静态研究沙盒语料结合,引入多维评估框架,验证其与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14261 2026-04-17 cs.CL cs.AI 73%

ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents

ReviewGrounder:通过规则引导和工具集成代理提升评审的实质内容

Zhuofeng Li, Yi Lu, Dongfu Jiang, Haoxiang Zhang, Yuyang Bai, Chuan Li, Yu Wang, Shuiwang Ji, Jianwen Xie, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(南加州大学) Lambda University of Oregon(俄勒冈大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ReviewGrounder框架,通过规则引导和工具集成提升AI会议评审的实质内容,实验表明其在8个维度上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14495 2026-04-17 cs.CE cs.AI cs.CR 70%

Decoupling Identity from Utility: Privacy-by-Design Frameworks for Financial Ecosystems

分离身份与效用:面向金融生态系统的设计隐私框架

Ifayoyinsola Ibikunle, Tyler Farnan, Senthil Kumar, Mayana Pereira

机构 * Capital One

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出通过差分隐私合成数据解决金融机构在最大化数据效用与缓解传统匿名化方法重新识别风险之间的矛盾,探讨了两种生成范式并展示了其在动态市场行为建模中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14254 2026-04-17 cs.AI cs.LO 70%

Formalizing Kantian Ethics: Formula of the Universal Law Logic (FULL)

规范康德伦理学:普遍律令逻辑(FULL)

Taylor Olson

机构 * Taylor Olson(塔勒尔·奥尔森)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种多排序量化模态逻辑FULL,用于规范康德伦理学,通过无需内置道德直觉的背景知识评估代理行为,提升AI代理的鲁棒性和自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07338 2026-04-17 cs.CL 70%

Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation

超越字面映射:非字面翻译评估的基准测试与改进

Yanzhi Tian, Cunxiang Wang, Zeming Liu, Heyan Huang, Wenbo Yu, Dawei Song, Jie Tang, Yuhang Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程组) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出RATE框架,通过反思核心代理动态调用专用子代理,提升非字面翻译评估的准确性,实验显示其在系统和段级相关性上比现有方法提高至少3.2分。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16024 2026-04-17 cs.CV 67%

Speak, Segment, Track, Navigate: An Interactive System for Video-Guided Skull-Base Surgery

说话、分割、跟踪、导航:一种用于视频引导的颅底手术交互系统

Jecia Z. Y. Mao, Francis X. Creighton, Russell H. Taylor, Manish Sahu

机构 * IEEE

专题命中 Agent评测 :agent(abstract);workflow(abstract)

AI总结 本文提出一种基于语音引导的嵌入式代理框架,用于视频引导的颅底手术,通过实时视觉感知和图像引导任务响应外科医生的查询,提高手术流程整合性和部署速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15151 2026-04-17 cs.CL 57%

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

QuantCode-Bench: 一个用于评估大型语言模型生成可执行算法交易策略能力的基准

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

机构 * Lime

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出QuantCode-Bench,通过多阶段流程评估现代LLM生成Backtrader框架策略的能力,包含400个不同难度任务,分析模型在交易逻辑、API使用和任务语义方面的局限性。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15124 2026-04-17 cs.CL 57%

Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling

盲评大型语言模型与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询

Zhijun Guo, Alvina Lai, Emmanouil Korakas, Aristeidis Vagenas, Irshad Ahamed, Christo Albor, Hengrui Zhang, Justin Healy, Kezhi Li

机构 * Institute of Health Informatics, University College London(健康信息学研究所,伦敦大学学院) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院 NHS 基础信托) Dartford and Gravesham NHS Foundation Trust(达特福德和格拉夫萨姆 NHS 基础信托) Royal Free London NHS Foundation Trust(伦敦皇家自由 NHS 基础信托)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文通过盲评评估了基于检索的大型语言模型对话代理与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询中的表现,发现对话代理在同理心和可操作性方面得分更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14829 2026-04-17 cs.AI 57%

Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation

超越字面总结:重新定义医疗SOAP笔记评估中的幻觉

Bhavik Vachhani, Kush Shrisvastava, Pranshu Nema, Sai Chiranthan

机构 * Augnito Research(Augnito研究)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出通过校准提示和基于医学本体的检索,重新定义医疗SOAP笔记评估中的幻觉,发现传统评估方法高估了幻觉率,影响模型评估。

Comments 12 pages, 2 figures,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14828 2026-04-17 cs.CL 57%

Pangu-ACE: Adaptive Cascaded Experts for Educational Response Generation on EduBench

Pangu-ACE:适应性级联专家用于EduBench教育响应生成

Dinghao Li, Wenlong Zhou, Zhimin Chen, Yuehan Peng, Hong Ni, Chengfu Zou, Guoyu Shi, Yaochen Li

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 Pangu-ACE通过级联专家系统提升教育响应质量,在EduBench基准上实现更高效的计算分配,改进确定性和格式有效性,同时保持较低的直接请求比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14398 2026-04-17 physics.flu-dyn cs.LG 57%

Timescale Separation Enables Deep Reinforcement Learning Control of Rotating Detonation Engine Mode Transitions

时间尺度分离使深度强化学习能够控制旋转爆震发动机模式转换

Kristian Holme, Jean Rabault, Ricardo Vinuesa, Mikael Mortensen

机构 * University of Oslo(奥斯陆大学) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文通过时间尺度分离方法,利用移动参考系框架实现深度强化学习对旋转爆震发动机多尺度动态控制,有效诱导模式转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14256 2026-04-17 cs.IR cs.AI 57%

Evaluation of Agents under Simulated AI Marketplace Dynamics

对模拟AI市场动态下代理的评估

To Eun Kim, Alireza Salemi, Hamed Zamani, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出Marketplace Evaluation框架,通过模拟市场动态评估信息访问系统,补充传统准确度指标,探讨市场留存和份额等指标。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13878 2026-04-17 cs.LG 57%

Drowsiness-Aware Adaptive Autonomous Braking System based on Deep Reinforcement Learning for Enhanced Road Safety

基于深度强化学习的清醒意识自适应自动刹车系统:提升道路安全

Hossem Eddine Hafidi, Elisabetta De Giovanni, Teodoro Montanaro, Ilaria Sergi, Massimo De Vittorio, Luigi Patrono

机构 * University of Salento(萨勒诺大学) Istituto Italiano di Tecnologia(意大利技术研究院) Basque Center for Applied Mathematics(巴斯克应用数学中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于深度强化学习的自适应自动刹车系统,结合车辆动力学与驾驶员生理数据,通过ECG信号检测清醒状态,提升道路安全。

Comments 16 pages, 12 figures. Under review at IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13933 2026-04-17 cs.CL 57%

OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Dataset

OmniCompliance-100K:一个多领域、基于规则、现实世界安全合规数据集

Wenbin Hu, Huihao Jing, Haochen Shi, Changxuan Fan, Haoran Li, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文构建了一个涵盖74项法规的多领域安全合规数据集,包含12,985条规则和106,009个现实案例,通过基准测试评估了不同规模LLM的安全合规能力。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08780 2026-04-17 cs.AI 57%

Enhanced Deep Q-Learning for 2D Self-Driving Cars: Implementation and Evaluation on a Custom Track Environment

增强型深度Q学习用于2D自动驾驶汽车:在定制赛道环境中的实现与评估

Sagar Pathak, Bidhya Shrestha

机构 * Department of Computer Science, University of Memphis(密苏里大学梅斯分校计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种改进的深度Q学习网络用于2D自动驾驶汽车,通过定制环境和DQN模型设计,提升了性能,实验表明改进模型奖励显著高于原始DQN。

Comments 8 pages, 8 figures

Journal ref International Journal of Science and Technology (IJST), 3(2), 24-39 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15264 2026-04-17 econ.TH 50%

Knowing that you do not know everything

知晓你并不知晓一切

Alex A. T. Rathke

专题命中 Agent评测 :agent(abstract)

AI总结 理性主体无法确定自身是否知晓一切, introspection 和新事件学习无法解决此认知限制

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15125 2026-04-17 cs.GT 50%

Combinatorial Contracts Through Demand Types

通过需求类型进行组合合同

Elizabeth Baldwin, Paul Duetting, Michal Feldman, Maya Schlesinger

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过建立需求类型的几何框架,提出了一种新的合同设计算法,针对需求查询问题提出高效计算方法,并在多项式时间内解决新的奖励函数类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10166 2026-04-17 cs.MM 50%

Fact-Checking with Contextual Narratives: Leveraging Retrieval-Augmented LLMs for Social Media Analysis

基于上下文叙述的事实核查:利用检索增强的LLM进行社交媒体分析

Arka Ujjal Dey, Muhammad Junaid Awan, Georgia Channing, Christian Schroeder de Witt, John Collomosse

专题命中 Agent评测 :agent(abstract)

AI总结 CRAVE框架整合检索增强的大语言模型与聚类技术,通过多模态证据检索和聚类分析,提升社交媒体事实核查的准确性和解释性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13956 2026-04-17 econ.TH 50%

Blackwell-Monotone Updating Rules

Blackwell单调更新规则

Mark Whitmeyer

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了Blackwell单调更新规则,证明在特定类别的更新规则中,贝叶斯法则是唯一严格Blackwell单调的规则,并指出非父爱主义评估下,此类规则为贝叶斯后验的仿射扭曲。

Comments Previously titled "Bayes = Blackwell, Almost."

详情

展开后加载摘要…

URL PDF HTML 收藏