arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-17 至 2026-08-17 共收录 19 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 19 篇

2608.02345 2026-08-17 cs.CL cs.AI stat.AP 版本更新 90%

Can AI Agents Simulate A/B Test Outcomes? A Validation Framework for Agentic Experimentation

AI智能体能模拟A/B测试结果吗?智能体实验的验证框架

Stefan Hut, Lorenzo Masoero

机构 * Amazon(亚马逊公司)

专题命中 Agent评测 :AI agent(title,abstract);agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出智能体实验的验证框架S-RCT,用AI智能体模拟A/B测试结果,经67个营销A/B测试验证,校准后可降低预测误差,为实验者提供智能体信号支持。

Comments Accepted as a workshop paper at this https URL (https://www.aiagentbehavior.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13608 2026-08-17 cs.AI cs.CR cs.LG 新提交 84%

Evaluating Agentic Learning Harness Capabilities Without Labels via the Scaling Hypothesis

基于缩放假设的无标签智能体学习控制器能力评估

Aryan Luthra, Kshitij Jain, Siddharth Arya, Bobby Filar, Anna Bertiger

机构 * Georgian

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出基于缩放假设的无标签智能体学习控制器评估框架,以教师模型与学生模型的收敛度为评分指标,验证其可作为标签缺失时控制器真实增益的有效代理。

Comments 18 pages, 6 figures. Accepted at CAMLIS 2025 (Conference on Applied Machine Learning for Information Security)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14270 2026-08-17 cs.AI 新提交 83%

TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments

TimeSage-EV:面向动态环境下智能体时间序列分析的实时基准测试集

Qingren Yao, Yaxuan Kong, Yuqi Nie, Yichen Li, Stefan Zohren, Anna Vettoruzzo, Qingsong Wen, Ming Jin, Joaquin Vanschoren

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of Oxford(牛津大学) VulpiVox Intelligence(VulpiVox智能公司) Squirrel Ai Learning(Squirrel AI学习公司) Griffith University(格里菲斯大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 针对现有时间序列基准未评估时间有效性等问题,推出动态环境智能体时间序列分析基准TimeSage-EV,含多领域真实场景,实验揭示模型性能差距及失败模式,提供研究资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13586 2026-08-17 cs.HC cs.CY 新提交 82%

The Tool-to-Entity Threshold: Parasocial Dynamics of Personalised AI Agents in Shared Social Spaces

工具到实体的阈值:共享社交空间中个性化AI智能体的准社会动态

Leonardo Borges (Eigenstack Pty Ltd), Asif Q. Gill (University of Technology Sydney)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 该研究提出身份标记框架,结合自传式民族志方法,揭示共享社交空间中个性化AI智能体从工具转变为社会实体的四种新动态,指出现有同意框架混淆了智能体存在与消息处理的同意。

Comments 24 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14228 2026-08-17 cs.LG 新提交 79%

AutoSchema: Live Schema Grounding for Agentic Text-to-Sparql over Heterogeneous Knowledge Graphs

AutoSchema:面向异构知识图谱的智能体文本转SPARQL的实时模式接地

Yiming Zhang, Koji Tsuda

机构 * The University of Tokyo(东京大学) National Institute for Materials Science(国立材料科学研究所) RIKEN Center for Advanced Intelligence Project(理化学研究所高级智能项目中心)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.LG

AI总结 提出无需训练的AutoSchema框架,用于异构知识图谱的智能体文本转SPARQL的实时模式接地,在多项生物医学KGQA等任务中优于TogoMCP,可支持未记录RDF图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13564 2026-08-17 cs.AI 新提交 79%

Inducing Reward-Free Judging Rubrics that Reduce Over-Crediting in Agent Evaluation

生成无奖励的评判标准以减少智能体评估中的过度打分

Darragh Quinn, David Dylan, Roisin Healy, Fionn Carroll, Maeve Donnelly, Cormac Sheehan

机构 * Trinity College Dublin(都柏林三一学院) University College Dublin(都柏林大学学院) Dublin City University(都柏林城市大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 该研究提出 RubricForge 方法,从带标签轨迹生成无奖励的智能体评判标准,可减少智能体评估中的过度打分,在 tau-bench 和 WebShop 上的表现优于通用 G-Eval 评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00023 2026-08-17 cs.MA cs.AI cs.HC cs.SD eess.AS 版本更新 79%

Musical Agent Systems: MACAT and MACataRT

音乐智能体系统:MACAT与MACataRT

Keon Ju M. Lee, Philippe Pasquier

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本研究开发了两款音乐智能体系统MACAT与MACataRT,分别用于智能体主导的表演与协作式即兴创作,基于个性化小数据集训练,以推动以人为核心的交互式生成式AI在音乐创作中的应用。

Comments In Proceedings of the Creativity and Generative AI NIPS (Neural Information Processing Systems) Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13926 2026-08-17 cs.AI cs.CL cs.DB 新提交 73%

Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact

绝非数字:将答案作为事实使用的AI系统的结构弃权

Zhelun (Allen)Wu

机构 * Apple Inc.(苹果公司)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM文本转SQL系统返回错误答案且无法区分的问题,提出带生成式外壳的可信内核架构,即结构弃权,在生产案例中验证其可靠性优于两种生成式替代方案。

Comments 26 pages, 5 figures, 5 tables. Technical report. Describes architecture and design principles only; contains no code, schemas, datasets, or performance metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14109 2026-08-17 cs.AI cs.LG cs.MA 新提交 62%

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

面向自主大语言模型智能体中结构化漂移诊断与恢复的基于图的强化学习框架

Ismail El Hamraoui, Sagar Jose, Nicolas Bureau, Robert Plana

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对自主LLM智能体的运行时行为漂移问题,提出基于图的强化学习即插即用恢复框架,经AppWorld基准验证,该框架可利用漂移信息做出正确恢复决策且输出符合要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13684 2026-08-17 cs.AI 新提交 57%

Learning to Assemble Novel Structures with Unfamiliar Parts under Semantic Constraints

在语义约束下学习使用不熟悉部件组装新型结构

Jonghyuk Park, Alex Lascarides, Subramanian Ramamoorthy

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出神经符号架构,在模拟玩具卡车组装领域,借助具身对话与任务演示,通过自然语言传递语义约束提升智能体在线适应的数据效率,解决部署后遇未知语义约束的组装问题。

Comments Accepted to, and to appear in the 20th Conference on Neurosymbolic Learning and Reasoning (NeSy 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13598 2026-08-17 cs.AI 新提交 57%

Measuring Cross-Task Behavioral Consistency in Language Model Agents

测量语言模型智能体的跨任务行为一致性

Amritesh Banerjee, Pranil Raichura

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mantis AI Research(螳螂人工智能研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出行为一致性指标(BCM),通过约9000条软件工程任务轨迹发现语言模型智能体的跨任务与任务内一致性是可分化的不同维度,且一致性与成功率无关,BCM可补充结果指标评估智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10538 2026-08-17 cs.AI 版本更新 57%

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models

SKILLER:面向小型语言模型可复用技能提取的语言级强化学习框架

Chenhao Dang, Siyuan Xiong, Conghui He, Weijia Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对小型语言模型技能生成成本高的问题,提出SKILLER框架,经实验在多基准上优于现有方法,性能接近闭源模型,可大幅降低智能体技能部署成本。

Comments 15 pages, 6 figures, and 8 tables. Project and code: this https URL (https://github.com/DANG-ai/SKILLER)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18785 2026-08-17 cs.AI 版本更新 57%

SkillSight: Calibrating Generic Content Bias for Skill Retrieval

SkillSight:通过共享描述实现准确技能检索

Jinying Xiao, Bin Li, Xiaopeng Li, Jianling Li, Jiacheng Jie, Xiaodong Liu, Ma Jun, Chao Wang, Nyima Tashi, Jie Yu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体技能检索问题,提出SkillSight框架,通过语义和词汇空间校准共享背景,减少偏差,实验证明该方法能提升检索指标,在端到端评估中表现出色且速度快,实现准确高效的技能选择。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14548 2026-08-17 cs.GT 新提交 50%

Forging Self-Funded Marketplaces among Strategic Agents

在策略智能体间构建自筹资金的市场

Yuan Deng, Vasilis Gkatzelis, Xizhi Tan, Grigoris Velegkas, Song Zuo

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对策略智能体,提出自筹资金市场的机制设计问题,证明现有 truthful auction 近似性能上限,给出序贯 auction 实现对数级近似,还设计 auction 实现最大最小份额基准的常数级近似。

Comments Extended Abstract accepted 27th ACM Conference on Economics and Computation (ACM EC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14499 2026-08-17 cs.GT 新提交 50%

Ex-ante versus Ex-post: Egalitarian Facility Location Mechanism Design

事前与事后:平等主义设施选址机制设计

Zohar Barak, Inbal Talgam-Cohen

专题命中 Agent评测 :agent(abstract)

AI总结 该研究针对欧氏空间的设施选址问题,对比事前与事后评估,在低维中设计出打破确定性壁垒的机制,高维中则证明随机旋转中位数机制为最优平等主义机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14462 2026-08-17 cs.RO 新提交 50%

THRIVE: Therapeutic Humanoid Robot In Virtual Environment

THRIVE:虚拟环境中的治疗性人形机器人

Jin Xu, Yu-Ping Chen, Ayanna Howard

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了家用康复平台THRIVE,集成VR上肢康复游戏、摄像头运动追踪与机器人治疗师,采用模块化设计,为上肢运动障碍儿童提供持续且具吸引力的上肢治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14134 2026-08-17 quant-ph q-fin.PM 新提交 50%

Photonic Quantum Computing vs. Classical Solvers in Constrained Factor Portfolio Optimization

受限因子投资组合优化中的光子量子计算与经典求解器对比

Nirvik Sahoo, Chyng Wen Tee, Paul Robert Griffin

专题命中 Agent评测 :agent(abstract)

AI总结 该研究对比光子量子计算、Gurobi、SAC三种优化范式在因子投资组合优化中的表现,发现光子硬件在窄范围有优势,经典混合整数规划在严格尾部风险控制场景更优,还揭示了强化学习分配器的失效模式并给出应用指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14101 2026-08-17 astro-ph.GA 新提交 50%

A Reproducible Two-Boundary Kinematic Correction for Baryonic Rotation-Curve Reconstruction in an 84-Galaxy SPARC Benchmark

84个星系SPARC基准中重子旋转曲线重建的可复现双边界运动学校正

David C. Flynn

专题命中 Agent评测 :workflow(abstract)

AI总结 本研究针对Flynn等人提出的omega运动学校正,基于84星系SPARC基准开展可复现验证,通过双边界系数校正将平均偏差降至30.15 km/s,明确了算法流程与结果,为天文数据变换提供可复现基准。

Comments 22 Pages 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03369 2026-08-17 econ.TH cs.CY cs.IR 版本更新 50%

Impact of Rankings and Personalized Recommendations in Marketplaces

市场中排名与个性化推荐的影响

Omar Besbes, Yash Kanoria, Akshit Kumar

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过大市场模型,量化了无容量与有容量约束供给下,公共排名和个性化推荐对市场福利的影响,发现二者价值随市场条件和偏好异质性变化,且引入策略定价后价值会被市场短边获取。

详情

展开后加载摘要…

URL PDF HTML 收藏