arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-22 至 2026-07-22 共收录 195 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 36 篇

2607.18360 2026-07-22 cs.CR cs.AI cs.LG 新提交 62%

HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers

HALLMARK:诊断大语言模型引用验证器中的三种失败模式

Patrik Reizinger, Wieland Brendel

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型引用验证器的失败模式,通过HALLMARK基准测试评估多种验证器,发现误报率决定验证器是否可部署,并具体指出三种失败模式,强调误报率是部署瓶颈,未检测到的伪造对科学记录代价更高。

Comments 59 pages, 7 figures, 40 tables. Benchmark and code: https://github.com/rpatrik96/hallmark (v1.2.0); verification tool: https://github.com/rpatrik96/bibtexupdater (v1.5.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07753 2026-07-22 cs.LG cs.AI 版本更新 62%

A Transdiagnostic Space of Disorder Like Phenotypes in Reinforcement Learning Agents

强化学习智能体中类似障碍表型的跨诊断空间

Hari Prasad

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究在强化学习智能体中建模心理障碍,将其重新表述为对认知评估信号的剂量可控操纵,通过多个旋钮表示多种障碍,呈现分级剂量反应,还发现障碍自组织成二维空间、旋钮对不同障碍有不同影响及旋钮相互作用可预测共病等,且框架具有通用性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16410 2026-07-22 cs.CL cs.AI 版本更新 62%

PlotTwist: A Creative Plot Generation Framework with Small Language Models

PlotTwist: 一种利用小语言模型的创意情节生成框架

Abhinav Thorat, Ravi Kolla, Jyotin Goel, Madhav Kataria, Niranjan Pedanekar

机构 * Sony Research India(索尼印度研究院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 PlotTwist通过结构化框架使小语言模型生成高质量前提条件情节,优于大型模型,且在多个叙事质量维度上表现优异。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18242 2026-07-22 cs.AI cs.MA cs.NI 新提交 61%

AI Tool Discovery at Scale: All You Need is DNS

大规模人工智能工具发现:你所需要的只是DNS

Enhao Chen, Yulin Shao

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI;agent(comments)

AI总结 针对自主人工智能代理时代工具发现难题,提出ToolDNS框架,通过嵌入意图和信任将语义搜索转为轻量级名称解析,引入三项增强。经大规模基准测试验证,其在减少搜索空间和降低延迟方面效果显著,证明可通过利用现有基础设施实现可扩展的AI互操作性。

Comments keywords: AI tool discovery, ToolDNS, Agent, DNS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19281 2026-07-22 cs.LG 新提交 57%

A Reinforcement-Learning-Augmented Liquid-Fueled Reactor Network Model for Predicting Lean Blowout in Gas Turbine Combustors

一种用于预测燃气轮机燃烧室贫油熄火的强化学习增强型液体燃料反应器网络模型

Philip John, Eloghosa Ikponmwoba, Pinaki Pal, Opeoluwa Owoyele

机构 * Louisiana State University(路易斯安那州立大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究提出强化学习框架预测燃气轮机燃烧室贫油熄火,采用多阶段聚类-分类策略,借助初始聚类和演员-评论家RL智能体生成优化反应器区域,验证研究显示该框架预测保真度高、速度快,有潜力作为降阶建模技术辅助高保真模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18665 2026-07-22 cs.AI 新提交 57%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18659 2026-07-22 cs.CR cs.AI cs.MA 新提交 57%

Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents

破碎的大门:在大语言模型代理时代重新评估网络机器人防御

Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud, Dillan Bailey, Amin Kharraz

机构 * Florida International University(佛罗里达国际大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在大语言模型代理时代网络机器人防御的有效性,通过系统测量研究评估基于交互式挑战与非交互式信任的防御对商业验证码解决服务和大语言模型代理的弹性,发现非交互式防御安全边界在环境层,影响机器人管理系统设计评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18432 2026-07-22 cs.CL 新提交 57%

Building a European Multilingual Evaluation Dataset: The MMLU Localisation Project within the EMT Network

构建欧洲多语言评估数据集:EMT网络中的MMLU本地化项目

Pilar Sánchez-Gijón, Susana Valdez, Sofía Calvo Del Barrio, Florence Bellemont, Anna Kokkinidou, Mihai Cristian Brasoveanu

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 DGT与EMT合作将MMLU数据集本地化至11种欧洲语言,既为大语言模型评估打造更具包容性基准,又为硕士生提供专业培训,还突显了相关方法、管理及工作流程方面的挑战。

Journal ref Proceedings of the 3rd International Conference on New Trends in Translation and Interpreting Technology, June 24 - 27, 2026, Dubrovnik, Croatia

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18294 2026-07-22 cs.LG 新提交 57%

Uncertainty Quantification for AI-Driven Crash Simulation Surrogates: A Comparative Study of Monte Carlo Dropout and Deep Ensemble on Open-Source Bumper Beam Benchmark

人工智能驱动的碰撞模拟代理的不确定性量化:基于开源保险杠梁基准的蒙特卡洛随机失活和深度集成的比较研究

Sudeep Chavare

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 研究人工智能驱动碰撞模拟代理的不确定性量化,对蒙特卡洛随机失活和深度集成两种方法在开源管道上比较,用具体随机失活解决常见批评,经汽车碰撞模拟实验,揭示权衡,表明可低成本实现良好校准和无超参数的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18272 2026-07-22 cs.GT cs.AI cs.SY eess.SY 新提交 57%

Market Strategy Evaluation for Prosumers in Local Electricity Markets

本地电力市场中 prosumer 的市场策略评估

Lukas Peter Wagner, Raoul Bisson, Felix Gehlhoff

机构 * Federal Ministry for Economic Affairs and Climate Action(经济事务和气候行动部) Projektträger Jülich GmbH(尤利奇项目载体)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究本地电力市场中 prosumer 的市场策略,开发基于代理的模拟平台,比较四种市场策略,通过模拟发现基于规则的资源控制可降社区能源支出,市场自适应策略收益最高,策略有效性取决于多种因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18240 2026-07-22 cs.AI 新提交 57%

Calibrated Selective Fact-Checking via Evidence Chain Evaluation

通过证据链评估进行校准的选择性事实核查

Dekun Yang

机构 * Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对大语言模型事实核查的可靠性问题,提出证据链评估框架ECE,通过网络搜索等收集证据并返回结构化裁决。在ECE - Bench上有较好表现,虽总体校准指标未超最强基线,但实现了选择性预测权衡,弃权可处理弱证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19334 2026-07-22 stat.ML cs.IT cs.LG math.IT math.ST stat.TH 新提交 57%

Fundamental limits of distributed multiclass classification from simple binary decisions

基于简单二元决策的分布式多类分类的基本限制

Ioannis Papageorgiou, Srinivas Nomula, Ayalvadi Ganesh, Sidharth Jaggi, Parimal Parag

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究从\(O(\log K)\)个简单二元分类器组合构建\(K\)类分类器的问题,当二元分类器为超平面时,在高斯设置下得出性能界限,并通过模拟实验验证理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 3 篇

2607.19213 2026-07-22 cs.RO cs.AI 新提交 57%

Computing on the Fly: Navigating a Vision for the Future of Drone Computing

即时计算:展望无人机计算的未来

Kevin Butler, Christopher Stewart, Nils Aschenbruck, Alina Gerall, Weisong Shi, Deborah Silver, Ufuk Topcu

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 报告设想无人机大规模运输货物等的未来,指出需弥合能力差距,确定了实现无人机技术变革潜力的十二个技术挑战及应对方法,为无人机技术发展规划了多方面的前进路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18506 2026-07-22 cs.CY 新提交 50%

AI Value Alignment for Evolving Social Norms

用于不断演变的社会规范的人工智能价值对齐

Nenad Tomašev, Matija Franklin, Simon Osindero

专题命中 其他Agent :agentic(abstract)

AI总结 研究人工智能价值对齐对社会规范演变的影响,引入基于社会物理学的数学建模框架,通过解析与模拟分析长期后果,强调价值锁定等风险,倡导用此模型作认知桥梁助力社会技术预见及大规模智能体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30855 2026-07-22 astro-ph.IM 版本更新 50%

Deep Learning for Astrophysics: An Open Textbook from the NASA Cosmic Origins AI/ML Science and Technology Interest Group

天体物理学深度学习:来自NASA宇宙起源AI/ML科学与技术兴趣小组的开放教材

Yuan-Sen Ting, Digvijay Wadekar, Phill Cargile, Carol Cuesta-Lazaro, André Curtis-Trudel, Gregory Green, Ryan McClelland, Daniel Muthukrishna, Tri Nguyen, Helen Qu, Tomasz Rozanski, Anna Scaife, Jesse Thaler, Licia Verde, Francisco Villaescusa-Navarro, John F. Wu, Duo Xu, Siyu Yao, Alex Gagliano, Siddharth Mishra-Sharma, Andrew K. Saydjari, Georgios Valogiannis, Peter Kurczynski, Swara Ravindranath

专题命中 其他Agent :agentic(abstract)

AI总结 针对机器学习在射电天文学中应用的教育障碍,NASA宇宙起源AI/ML兴趣小组编写了免费教材《天体物理学深度学习》,涵盖从计算基础到大型语言模型代理的23章内容,并包含可执行笔记本。

Comments 4 pages, 1 figure; Published in Research Notes of the AAS (RNAAS)

详情

展开后加载摘要…

URL PDF HTML 收藏