arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-21 至 2026-08-21 共收录 169 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 41 篇

2608.20106 2026-08-21 cs.CL 新提交 57%

OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准

Nikita Khudov

机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) StrategAI

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20024 2026-08-21 cs.LG 新提交 57%

Systematic Evaluation of TabPFN-TS for Zero-Shot Probabilistic Heat Load Forecasting in District Heating Networks

系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用

Ben Spoek, Karim K. Ben Hicham, Kai Derzsi, Philipp Althaus, Alexander Mitsos, Dirk Müller

机构 * RWTH Aachen University(亚琛工业大学) Process Systems Engineering(过程系统工程) Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。

Comments 33 pages, 10 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19564 2026-08-21 cs.CL 新提交 57%

Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM Agents

记住、验证还是询问?大语言模型智能体中记忆承诺的跨家族评估

Baichuan Li, Junyi Yao, Zihao Zheng

机构 * Southern Methodist University(南卫理公会大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究通过MCB数据集评估LLM智能体的记忆承诺,发现模型验证事实变化更可靠,策略提示可降低错误持久率,少样本提示能提升部分任务准确率,但澄清召回率仍较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17034 2026-08-21 cs.LG 版本更新 57%

Agents unlock new capabilities through Switching LoRA Adapters as a Tool (SLAaaT)

智能体通过切换LoRA适配器作为工具(SLAaaT)解锁新能力

Kenneth Ge

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究针对后训练导致的灾难性遗忘问题,提出让智能体在轨迹中途切换专用LoRA适配器的SLAaaT方法,实验显示其可解决新问题、自主切换策略且能力损耗低,在任务能力和token使用上优于生成子智能体的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09498 2026-08-21 cs.CL 版本更新 57%

Self-Harness: Harnesses That Improve Themselves

Self-Harness:自我改进的操控框架

Hangfan Zhang, Shao Zhang, Kangcong Li, Chen Zhang, Yang Chen, Yiqun Zhang, Lei Bai, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Self-Harness范式,让LLM智能体通过弱点挖掘、框架提议和验证迭代改进自身操控框架,在Terminal-Bench-2.0上使三种模型的通过率分别提升21.4%、14.3%和14.2%。

Comments https://github.com/qzzqzzb/Self-Harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19997 2026-08-21 cs.CL 版本更新 57%

When Contextual Inference Fails: Cancelability in Interactive Instruction Following

当情境推理失效时:交互指令跟随中的可取消性

Natalia Bila, Kata Naszádi, Alexandra Mayn, Christof Monz

机构 * Language Technology Lab, University of Amsterdam(阿姆斯特丹大学语言技术实验室) Department of Language Science and Technology, Saarland University(萨尔兰大学语言科学与技术系)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究探讨了在协作积木构建任务中,如何区分字面解释与情境推理,引入了交互基准测试BWIM,发现模型在判断与行动间存在脱节,未能有效利用信息进行澄清。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14642 2026-08-21 cs.GT cs.AI cs.DC 版本更新 57%

The Bidding Games: Reinforcement Learning for MEV Extraction on Polygon Blockchain

竞拍博弈:Polygon区块链上用于MEV提取的强化学习

Andrei Seoev, Leonid Gremyachikh, Anastasiia Smirnova, Yash Madhwal, Alisa Kalacheva, Dmitry Belousov, Ilia Zubov, Aleksei Smirnov, Denis Fedyanin, Vladimir Gorgadze, Yury Yanovich

机构 * Independent Researcher(独立研究者) Moscow Institute of Physics and Technology(莫斯科物理技术学院) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所) HSE University(俄罗斯伏尔加格勒国立高等经济大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文针对Polygon Atlas拍卖中MEV提取的策略难题,提出强化学习框架,构建匹配拍卖特性的模拟环境与PPO竞拍代理,实证显示其利润表现优于静态策略与历史市场领导者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19846 2026-08-21 econ.TH 新提交 50%

Random Cap: Optimal Informationally Robust Delegation

随机上限:最优的信息鲁棒授权机制

Zhiyuan Jia

专题命中 Agent评测 :agent(abstract)

AI总结 针对委托人知晓代理人私人信息均值但不知其分布的模糊性授权问题,提出随机上限机制,证明其优于确定性上限,采用鞍点方法构造解,结果可扩展至凸序模糊性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20033 2026-08-21 cs.GT 新提交 50%

Temporal Fair Division of Indivisible Mixed Manna: Tractable Settings

不可分割混合甘露的时间公平分配:易处理设置

Kui-Wang Choi, Minming Li, Nicholas Teh

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究不可分割混合甘露的时间公平分配问题,确定了多个易处理设置,给出了对应规则或算法,同时证明了部分相关问题的NP难性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19235 2026-08-21 cs.DL 新提交 50%

Beyond Document Retrieval: Architectural Challenges When LLM Agents Query Structured Enterprise Data

超越文档检索:LLM智能体查询结构化企业数据时的架构挑战

Sheikh Nazib Ahmed

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对企业智能体查询结构化数据的架构挑战,划分七个维度提出设计框架,经实验验证其可消除授权违规,还给出评估协议与开放问题。

Comments 9 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19474 2026-08-21 econ.TH math.OC 新提交 50%

Monotone Allocations without Single-Crossing: When to Bunch and When to Jump

无单交叉的单调分配:何时归并,何时跳跃

Aloisio Araujo, Carolina Parra, Sergei Vieira

专题命中 Agent评测 :agent(abstract)

AI总结 该论文针对存在最小有效规模代理人技术、斯彭斯-米尔利斯条件失效的筛选问题,研究了单调划分曲线与松弛解的相交方式,得出最优契约的三分法规则,并通过对偶方法证明了最优解的全局最优性。

Comments 85 pages, 10 figures. Replication code: https://doi.org/10.5281/zenodo.21854607

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20139 2026-08-21 quant-ph cond-mat.dis-nn cond-mat.stat-mech cond-mat.str-el 新提交 50%

Reinforcement LearningtoHarness Approximation Errors for Long-Time QuantumSimulation

利用近似误差的强化学习用于长时间量子模拟

Yu-Bo Shi, Markus Heyl, Roderich Moessner, Marin Bukov, Hongzheng Zhao

专题命中 Agent评测 :agent(abstract)

AI总结 该研究提出RL-Trotter强化学习框架,将量子模拟的近似误差视为校正资源,通过优化长时间演化发现自校正序列,提升精度并降低测量开销,可推广迁移至更大系统。

Comments 12+12 pages, 6+6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14499 2026-08-21 cs.GT 版本更新 50%

Ex-ante versus Ex-post: Egalitarian Facility Location Mechanism Design

事前与事后:平等主义设施选址机制设计

Zohar Barak, Inbal Talgam-Cohen

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对欧氏空间的设施选址问题,对比事前与事后评估,在低维中设计出打破确定性壁垒的机制,高维中则证明随机旋转中位数机制为最优平等主义机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12818 2026-08-21 econ.TH 版本更新 50%

Schedule equilibria

日程均衡

Harry Kleyer

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究一般均衡下的不完全竞争,推导家庭与企业最优条件,建立均衡存在性与颤抖手精炼,将框架应用于多场景,发现内生价格反应会改变相关标准结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10968 2026-08-21 physics.soc-ph 版本更新 50%

Radicalization Kinetics under Algorithmic Exposure in a Stochastic Multiplex Model of Opinion Dynamics

交叉接触激进化引擎:观点动力学随机复合模型中的平台设计、注意力与地理因素

Ruben E. Araújo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究构建随机复合观点动力学模型,分析社交媒体平台设计、注意力与地理因素对激进化的影响,发现算法同质性可悖论性抑制极端主义,未策划接触是激进化饱和水平的决定因素。

Comments 14 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18556 2026-08-21 eess.SY cs.SY eess.SP 版本更新 50%

Wind-Resilient Trajectory Optimization for UAV-BS Networks: TD3 for Continuous Service Availability

抗风无人机基站网络轨迹优化:基于TD3的连续服务可用性

Azim Akhtarshenas, German Svistunov, Kuangyu Zheng, David Lopez-Perez

专题命中 Agent评测 :agent(abstract)

AI总结 针对风扰导致无人机基站位置漂移和通信质量下降问题,提出基于TD3算法的抗风轨迹调整框架,通过随机运动学建模学习自适应控制策略,在湍流条件下维持最优覆盖,仿真验证其优于PPO等基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11716 2026-08-21 cs.AR 版本更新 50%

A Fast Locality Simulator for GEMM Design-Space Exploration on Multi-Chiplet GPUs

面向多芯片GPU的GEMM设计空间探索的快速局部性模拟器

Euijun Chung, Hyesoon Kim

专题命中 Agent评测 :agentic(abstract)

AI总结 提出一种快速、功能级、瓦片级局部性模拟器,用于评估多芯片GPU上GEMM的内核选择对片间流量影响,发现远程流量变化可达90倍,并揭示2D块交织CTA遍历可减少远程流量达5.1倍。

Comments Poster presentation at the Workshop on Modeling & Simulation of Systems and Applications (MODSIM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2608.19875 2026-08-21 cs.CL cs.AI 新提交 81%

A knowledge-guided agentic framework for mitigating patient-context ambiguity in health queries

一种用于缓解医疗查询中患者上下文歧义的知识引导智能体框架

Mahyar Abbasian, Saba A. Farahani, Arshia Ilaty, Hung Cao, Ramesh Jain, Amir M. Rahmani

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 该研究提出知识引导智能体框架,通过解析医疗查询、构建假设、识别缺失上下文并提问,缓解患者上下文歧义,在诊断检索和饮食安全分类任务中显著提升了多种语言模型的性能。

Comments 48 pages, 3 figures, 6 tables, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20041 2026-08-21 cs.AI cs.CY 新提交 57%

A three-dimensional typology of agency for advanced AI systems

高级人工智能系统的能动性三维类型学

Willem Fourie

机构 * Stellenbosch University(斯泰伦博斯大学) School for Data Science and Computational Thinking(数据科学与计算思维学院)

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 该研究构建了前沿AI系统能动性的三维类型学,区分法律与道德能动性,为非人类AI的能动性考量提供概念框架,解决AI行为归因复杂化的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏