arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-17 至 2026-04-17 共收录 138 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 34 篇

2604.15151 2026-04-17 cs.CL 57%

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

QuantCode-Bench: 一个用于评估大型语言模型生成可执行算法交易策略能力的基准

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

机构 * Lime

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出QuantCode-Bench,通过多阶段流程评估现代LLM生成Backtrader框架策略的能力,包含400个不同难度任务,分析模型在交易逻辑、API使用和任务语义方面的局限性。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15124 2026-04-17 cs.CL 57%

Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling

盲评大型语言模型与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询

Zhijun Guo, Alvina Lai, Emmanouil Korakas, Aristeidis Vagenas, Irshad Ahamed, Christo Albor, Hengrui Zhang, Justin Healy, Kezhi Li

机构 * Institute of Health Informatics, University College London(健康信息学研究所,伦敦大学学院) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院 NHS 基础信托) Dartford and Gravesham NHS Foundation Trust(达特福德和格拉夫萨姆 NHS 基础信托) Royal Free London NHS Foundation Trust(伦敦皇家自由 NHS 基础信托)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文通过盲评评估了基于检索的大型语言模型对话代理与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询中的表现,发现对话代理在同理心和可操作性方面得分更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14829 2026-04-17 cs.AI 57%

Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation

超越字面总结:重新定义医疗SOAP笔记评估中的幻觉

Bhavik Vachhani, Kush Shrisvastava, Pranshu Nema, Sai Chiranthan

机构 * Augnito Research(Augnito研究)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出通过校准提示和基于医学本体的检索,重新定义医疗SOAP笔记评估中的幻觉,发现传统评估方法高估了幻觉率,影响模型评估。

Comments 12 pages, 2 figures,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14828 2026-04-17 cs.CL 57%

Pangu-ACE: Adaptive Cascaded Experts for Educational Response Generation on EduBench

Pangu-ACE:适应性级联专家用于EduBench教育响应生成

Dinghao Li, Wenlong Zhou, Zhimin Chen, Yuehan Peng, Hong Ni, Chengfu Zou, Guoyu Shi, Yaochen Li

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 Pangu-ACE通过级联专家系统提升教育响应质量,在EduBench基准上实现更高效的计算分配,改进确定性和格式有效性,同时保持较低的直接请求比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14398 2026-04-17 physics.flu-dyn cs.LG 57%

Timescale Separation Enables Deep Reinforcement Learning Control of Rotating Detonation Engine Mode Transitions

时间尺度分离使深度强化学习能够控制旋转爆震发动机模式转换

Kristian Holme, Jean Rabault, Ricardo Vinuesa, Mikael Mortensen

机构 * University of Oslo(奥斯陆大学) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文通过时间尺度分离方法,利用移动参考系框架实现深度强化学习对旋转爆震发动机多尺度动态控制,有效诱导模式转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14256 2026-04-17 cs.IR cs.AI 57%

Evaluation of Agents under Simulated AI Marketplace Dynamics

对模拟AI市场动态下代理的评估

To Eun Kim, Alireza Salemi, Hamed Zamani, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出Marketplace Evaluation框架,通过模拟市场动态评估信息访问系统,补充传统准确度指标,探讨市场留存和份额等指标。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13878 2026-04-17 cs.LG 57%

Drowsiness-Aware Adaptive Autonomous Braking System based on Deep Reinforcement Learning for Enhanced Road Safety

基于深度强化学习的清醒意识自适应自动刹车系统:提升道路安全

Hossem Eddine Hafidi, Elisabetta De Giovanni, Teodoro Montanaro, Ilaria Sergi, Massimo De Vittorio, Luigi Patrono

机构 * University of Salento(萨勒诺大学) Istituto Italiano di Tecnologia(意大利技术研究院) Basque Center for Applied Mathematics(巴斯克应用数学中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于深度强化学习的自适应自动刹车系统,结合车辆动力学与驾驶员生理数据,通过ECG信号检测清醒状态,提升道路安全。

Comments 16 pages, 12 figures. Under review at IEEE Transactions on Intelligent Vehicles

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13933 2026-04-17 cs.CL 57%

OmniCompliance-100K: A Multi-Domain, Rule-Grounded, Real-World Safety Compliance Dataset

OmniCompliance-100K:一个多领域、基于规则、现实世界安全合规数据集

Wenbin Hu, Huihao Jing, Haochen Shi, Changxuan Fan, Haoran Li, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文构建了一个涵盖74项法规的多领域安全合规数据集,包含12,985条规则和106,009个现实案例,通过基准测试评估了不同规模LLM的安全合规能力。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08780 2026-04-17 cs.AI 57%

Enhanced Deep Q-Learning for 2D Self-Driving Cars: Implementation and Evaluation on a Custom Track Environment

增强型深度Q学习用于2D自动驾驶汽车:在定制赛道环境中的实现与评估

Sagar Pathak, Bidhya Shrestha

机构 * Department of Computer Science, University of Memphis(密苏里大学梅斯分校计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种改进的深度Q学习网络用于2D自动驾驶汽车,通过定制环境和DQN模型设计,提升了性能,实验表明改进模型奖励显著高于原始DQN。

Comments 8 pages, 8 figures

Journal ref International Journal of Science and Technology (IJST), 3(2), 24-39 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15264 2026-04-17 econ.TH 50%

Knowing that you do not know everything

知晓你并不知晓一切

Alex A. T. Rathke

专题命中 Agent评测 :agent(abstract)

AI总结 理性主体无法确定自身是否知晓一切, introspection 和新事件学习无法解决此认知限制

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15125 2026-04-17 cs.GT 50%

Combinatorial Contracts Through Demand Types

通过需求类型进行组合合同

Elizabeth Baldwin, Paul Duetting, Michal Feldman, Maya Schlesinger

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过建立需求类型的几何框架,提出了一种新的合同设计算法,针对需求查询问题提出高效计算方法,并在多项式时间内解决新的奖励函数类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10166 2026-04-17 cs.MM 50%

Fact-Checking with Contextual Narratives: Leveraging Retrieval-Augmented LLMs for Social Media Analysis

基于上下文叙述的事实核查:利用检索增强的LLM进行社交媒体分析

Arka Ujjal Dey, Muhammad Junaid Awan, Georgia Channing, Christian Schroeder de Witt, John Collomosse

专题命中 Agent评测 :agent(abstract)

AI总结 CRAVE框架整合检索增强的大语言模型与聚类技术,通过多模态证据检索和聚类分析,提升社交媒体事实核查的准确性和解释性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13956 2026-04-17 econ.TH 50%

Blackwell-Monotone Updating Rules

Blackwell单调更新规则

Mark Whitmeyer

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了Blackwell单调更新规则,证明在特定类别的更新规则中,贝叶斯法则是唯一严格Blackwell单调的规则,并指出非父爱主义评估下,此类规则为贝叶斯后验的仿射扭曲。

Comments Previously titled "Bayes = Blackwell, Almost."

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04418 2026-04-17 econ.TH 50%

Making Information More Valuable

使信息更具价值

Mark Whitmeyer

专题命中 Agent评测 :agent(abstract)

AI总结 研究了哪些决策问题的修改会增加信息的价值,证明信息价值增加当且仅当代理在信念下的简化效用函数更凸。通过添加动作的变换,凸性增加当且仅当几何条件成立,并扩展到多个动作的情况。

Comments Formerly titled "Flexibility and Information.''

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12310 2026-04-17 cs.HC 50%

Dialogue Agents that Share Family Information to Strengthen Grandparent-Grandchild Relationships

能分享家庭信息的对话代理以加强祖孙关系

Seiya Mitsuno, Midori Ban, Hiroshi Ishiguro, Yuichiro Yoshikawa

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种对话代理,通过分享日常信息促进祖孙关系,减少老年人孤独感,提升社交连接与心理健康。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21025 2026-04-17 cs.CV 50%

CaptionQA: Is Your Caption as Useful as the Image Itself?

CaptionQA: 你的描述是否和它所代表的图像一样有用?

Shijia Yang, Yunong Liu, Bohan Zhai, Ximeng Sun, Zicheng Liu, Emad Barsoum, Manling Li, Chenfeng Xu

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Stanford University(斯坦福大学) Independent Researcher(独立研究者) Northwestern University(西北大学) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agentic(abstract)

AI总结 CaptionQA通过评估生成描述在下游任务中的实用性,揭示了图像与描述之间的效用差距,涵盖四个领域,包含25个顶级和69个子类别,提供33,027个密集标注的多选问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05529 2026-04-17 econ.EM 50%

Utilitarian or Quantile-Welfare Evaluation of Social Welfare? With Application to Health Cost-Effectiveness Analysis

效用或分位数-福利评估在社会福利中的应用?——以健康成本效果分析为例

Charles F. Manski, John Mullahy

专题命中 Agent评测 :planning(abstract)

AI总结 本文探讨了分位数-福利评估作为替代效用评估的方法,应用于健康成本效果分析中的测量与计量问题,提出非参数方法界定健康状态的分位数福利。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2603.17493 2026-04-17 physics.plasm-ph 50%

DustNET: enabling machine learning and AI models of dusty plasmas

DustNET: 使尘埃等离子体的机器学习和人工智能模型成为可能

Zhehui Wang, Justin C. Burton, Niklas Dormagen, Cheng-Ran Du, Yan Feng, John E. Foster, Susan S. Glenn, Max Klein, Christina A. Knapek, Lorin Matthews, André Melzer, Edward Thomas, Chuji Wang, Jalaan Avritte, Shan Chang, Neeraj Chaubey, Pubuduni Ekanayaka, John A. Goree, Truell Hyde, Chen Liang, Zhuang Liu, Zhuang Ma, Ilya Nemenman, Elon Price, A. S. Schmitz, Mike Schwarz, Saikat C. Thakur, M. H. Thoma, Hubertus M. Thomas, L. Wimmer, Wei Yang, Zimu Yang, Xiaoman Zhang

专题命中 其他Agent :autonomous agent(abstract)

AI总结 本文探讨了DustNET框架,通过整合实验、模拟和合成数据,利用机器学习和人工智能方法,实现尘埃等离子体的多尺度预测和不确定性量化。

Comments 61 pages, 35 figures, 490+ references

详情

展开后加载摘要…

URL PDF HTML 收藏