arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2608.09819 2026-08-11 cs.LG cs.CL 新提交 73%

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

Macaron-V1:面向具备自我改进与LoRA混合能力的开放持续学习

Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Jun Gao, Pyke Han, Nolan Ho, Ori Hong, Hailee Hou, Piers Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Kuss Koo, Jaron Lee, Andrew Lei, Alexy Li, Dawn Li, Lucian Li, Ray Li, Ricardo Li, Smith Li, Theo Li, Allen Lin, Elliot Lin, Fan Lin, Chen Ling, Kairus Liu, Kieran Liu, Logan Liu, Neo Liu, Xiang Liu, Yuxin Lu, Maeve Luo, Pony Ma, Verity Niu, Cole Qiao, Guian Qiu, Vince Qu, Sentry, Niko Song, Vincent Wang, Bo Wu, Rio Yang, Evelyn Ye, Fiona Ye, Ina Ye, Regis Ye, Josh Ying, Atlas Zeng, Danney Zeng, Salmon Zhan, Anya Zhang, Di Zhang, Mia Zhang, Sueky Zhang, Wei Zhao, Ada Zhou, Adrian Zhou, Yuhua Zhou, Juno Zhu, Murphy Zhuang

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Macaron-V1开放智能体模型家族,结合MoL架构与递归自我改进机制,经多基准评估验证其有效性,为开放持续学习提供新方案。

Comments 49 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09153 2026-08-11 cs.AI cs.LG 新提交 73%

TRACE: TRajectory Attribution for Automated Context Engineering

TRACE:用于自动化上下文工程的轨迹归因

Yikai Zhao, Pradeep Kumar Misra, Saurabh Pandey

机构 * Amazon(亚马逊公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 TRACE是利用历史智能体轨迹挖掘上下文故障的自动化反馈循环,可在上下文层诊断修复超80%的生产AI智能体故障,归因率72.7%、修复有效性82%。

Comments 21 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08239 2026-08-11 cs.LG cs.CL 新提交 73%

The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World

重放差距:大语言模型智能体中模型切换的静态评估评估的是错误的世界

Ashritha Gonuguntla

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现大语言模型智能体的模型切换静态评估基于错误假设,通过分支展开实验证明模型交换会导致轨迹分歧,重放评估无法准确预测结果,发布了相关工具与轨迹。

Comments 8 pages, 3 figures. Accepted at the Conference on Language Modeling 2026. Code: https://github.com/AshrithaG/replay-gap Data: https://huggingface.co/datasets/ashritha0907/replay-gap-trajectories

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12530 2026-08-11 cs.CL cs.AI cs.CY 版本更新 73%

In-Situ Behavioral Evaluation for LLM Fairness, Not Standardized-Test Scores

针对LLM公平性的在 situ 行为评估,而非标准化测试分数

Zeyu Tang, Sang T. Truong, Deonna Owens, Shreyas Sharma, Yibo Jacky Zhang, Brando Miranda, Sanmi Koyejo

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MAC-Fairness框架,通过多轮对话评估模型在不同身份下的行为变化,揭示稳定的行为特征,超越传统标准化测试的局限。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00549 2026-08-11 cs.CL cs.AI 73%

Towards Multi-dimensional Evaluation of LLM Summarization across Domains and Languages

Hyangsuk Min, Yuho Lee, Minjeong Ban, Jiaqi Deng, Nicole Hee-Yeon Kim, Taewon Yun, Hang Su, Jason Cai, Hwanjun Song

机构 * Korea Advanced Institute of Science and Technology(韩国先进科学研究院) AWS AI Labs(AWS人工智能实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

Comments 34 pages, 6 figures

Journal ref ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03689 2026-08-05 cs.AI cs.SE 新提交 73%

LiveEvalBench: Toward Open-World Evaluation for Web Generation

LiveEvalBench:面向网页生成的开放世界评估

Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 LiveEvalBench是将网页生成评估转为智能体驱动的自适应可扩展过程的自动化框架,经实验验证其与人类专家判断高度一致,可提供前沿模型网页生成能力的细粒度洞察

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00005 2026-08-04 cs.CL cs.AI 新提交 73%

RubricReviewer: From Direct Critique to Objective and Comprehensive Rubric-Driven Peer Review

RubricReviewer:从直接批评到客观全面的基于评分规则的同行评审

Shuyu Guo, Wenxiang Hu, Yuyue Zhao, Yougang Lyu, Xiaohui Yan

机构 * Shandong University(山东大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL

AI总结 RubricReviewer是一种基于评分规则驱动的框架,通过将评分规则生成为中间步骤,并结合Scout与Aligner模型,生成更全面、具判别性且抗攻击的评审意见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14896 2026-08-04 cs.SE cs.AI cs.MA 版本更新 73%

StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows

StructureClaw:用于结构工程工作流程的可追溯大语言模型智能体及可执行基准测试

Sizhong Qin, Yi Gu, Yao Jiang, Ao Cai, Changjian Zhou, Shaoxuan Shuai, Jiachang Wang, Tianhao Shen, Yueqiang Li, Xinhao Li, Li Zeng, Yueshi Chen, Dachen Gao, Genrong Xu, Wenjie Liao, Xinzheng Lu

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 针对结构工程请求评估中难以验证完整证据链的问题,提出StructureClaw及可执行基准测试StructureClaw-Bench,通过工件中心评估提高成功率,发现交互式和多模态评估的挑战,为评估改进结构工程智能体提供更严格基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28840 2026-08-03 cs.CL cs.SE 新提交 73%

Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications

基准测试并非验证:金融大语言模型应用的系统级视角

Burak Payzun, İrem Demirtaş, Simona Scala, Elena Ferretti, Seçil Arslan

机构 * Prometeia S.p.A.(普罗米特亚公司)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.CL、cs.SE

AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18476 2026-08-03 stat.CO cs.AI cs.LG 版本更新 73%

AI4BayesCode: From Natural Language Descriptions to Validated Modular Stateful Bayesian Samplers

AI4BayesCode: 从自然语言描述到经过验证的模块化状态性贝叶斯采样器

Jungang Zou, Alex Ziyu Jiang, Qixuan Chen

机构 * Department of Biostatistics, Columbia University(哥伦比亚大学生物统计学系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出AI4BayesCode系统,通过自然语言描述生成可运行且验证过的MCMC采样器,采用模块化设计和递归状态性编码范式,提升了贝叶斯模型的可靠性和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27231 2026-07-31 cs.AI cs.LG 新提交 73%

KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation

KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准测试

Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin

机构 * Beijing Normal University(北京师范大学) Beijing Jiaotong University(北京交通大学) Institute of Automation, CAS(中国科学院自动化研究所) Peking University(北京大学) BAAI(北京智源人工智能研究院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出KernelGenBench基准,评估LLM与智能体生成的Triton内核,发现智能体方法优于纯LLM采样,cuBLAS算子最具挑战,跨平台性能退化严重,自主生成成本远高于简单采样。

Comments 10 pages, 4 figures. Code and data are publicly available at https://github.com/flagos-ai/KernelGenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08532 2026-07-31 cs.LG cs.AI 73%

LuckyMera: a Modular AI Framework for Building Hybrid NetHack Agents

Luigi Quarantiello, Simone Marzeddu, Antonio Guzzi, Vincenzo Lomonaco

机构 * Department of Computer Science, University of Pisa(比萨大学计算机科学系) Journal Production Department, IOS Press(IOS Press期刊生产部)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13241 2026-07-29 cs.LG cs.AI 73%

Recursive Deep Inverse Reinforcement Learning

Paul Ghanem, Owen Howell, Michael Potter, Pau Closas, Alireza Ramezani, Deniz Erdogmus, Tales Imbiriba

机构 * Boston Dynamics AI Institute(波士顿动力AI研究院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06487 2026-07-23 cs.LG cs.AI 版本更新 73%

ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking

ArenaRL: 通过基于比赛的相对排名扩展强化学习以应对开放性智能体

Qiang Zhang, Boli Chen, Fanrui Zhang, Ruixue Ding, Shihang Wang, Qiuchen Wang, Yinfeng Huang, Haonan Zhang, Rongxiang Zhu, Pengyong Wang, Ailin Ren, Xin Li, Pengjun Xie, Jiawei Liu, Ning Guo, Jingren Zhou, Zheng-Jun Zha

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 ArenaRL通过基于比赛的相对排名机制,提升开放性智能体在复杂任务中的表现,实现效率与精度的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17352 2026-07-21 cs.AI cs.LG quant-ph 新提交 73%

Self-Modifying Lean Proof Agents with Verifier-Grounded Benchmark Coevolution

基于验证器的基准协同进化的自修改精益证明智能体

Yuqing Li, Zeguan Wu, Yu Gan, Junyu Liu

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究设计有效精益证明智能体的挑战,提出自进化精益证明智能体,其工作区可变,与基准协同进化,通过特定更新机制保持分数可比,经实验验证该方法能有效改善精益证明工作流程。

Comments 22 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09711 2026-07-14 cs.LG cs.SE 新提交 73%

EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?

EvoClawBench:智能体能否从自身运行中学习可复用技能?

Zhiyuan Peng, Xin Yin, Chenhao Ying, Zhe Cui, Zixiang Ding, Zhenhua Liu, Jiang Wu, Yuan Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Hithink Research(同花顺研究院)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.LG、cs.SE

AI总结 研究智能体能否从自身运行学可复用技能,引入EvoClawBench基准测试,涵盖多任务多子问题并支持多运行时。实验对比不同方式,发现直接基线性能依赖运行时,自我创作技能效果各异,表明学习可复用技能有选择性且成本敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09706 2026-07-14 cs.AI cs.GT cs.LG 新提交 73%

YUKTI: From Natural-Language Situations to Robust, Verifiable Decisions An Uncertainty-Typed Proposition IR, Assumption-Robust Pareto Frontiers, and a Regret Certificate

YUKTI:从自然语言情境到稳健、可验证的决策——一种不确定性类型的命题IR、假设稳健帕累托前沿和遗憾证书

Suyash Mishra

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究从自然语言情境生成稳健决策,核心方法是用类型命题图表示,经多求解器及分布帕累托交接耦合,并引入ARPF等。主要贡献是证明rho与决策遗憾关系,增加可追溯性,合成数据基础,通过多种验证方式展示方法有效性。

Comments 19 Pages , 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08681 2026-07-13 cs.AI cs.ET cs.LG cs.MA econ.GN q-fin.EC 新提交 73%

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试

Shilin Ou, Yifan Xu, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18613 2026-07-13 cs.CL cs.AI 新提交 73%

Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

LLMs 是否已准备好辅助医生?PhysAssistBench:交互式医患-电子病历辅助基准

Tianming Du, Peijie Yu, Sihan Shang, Danli Shi, My Linh Nguyen, Shengbo Gao, Guangyuan Li, Yinghong Yu, Yan Jiang, Qianlong Zhao, Behzad Bozorgtabar, Shaoxiong Ji, Jiazhen Pan, Daniel Rueckert, Jiancheng Yang

机构 * Aalto University(阿尔托大学) Tencent(腾讯) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Aarhus University(奥胡斯大学) Technical University of Munich(慕尼黑工业大学)

专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出PhysAssistBench基准,通过构建交互式患者代理评估LLM在医患-EHR交互中的协调能力,发现当前模型不可靠,瓶颈在于多维度协调而非单一能力。

Comments 34 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07435 2026-07-09 cs.LG cs.AI 新提交 73%

RLVP: Penalize the Path, Reward the Outcome

RLVP:惩罚路径,奖励结果

Bojie Li, Noah Shi

机构 * Pine AI(松果人工智能公司) University of Washington(华盛顿大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究在现实世界中智能体在线学习面临的挑战,提出“惩罚路径,奖励结果”方法,能在几乎零违规情况下实现高任务成功率,并给出有效惩罚的设计规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 73%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12243 2026-07-02 cs.CL cs.AI 版本更新 73%

Continuous Knowledge Metabolism: Generating Scientific Hypotheses from Evolving Literature

连续知识代谢:从演进文献中生成科学假设

Jinkai Tao, Yubo Wang, Xiaoyu Liu, Menglin Yang

机构 * Tsingyuai(清华院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出CKM框架,通过滑动时间窗口处理文献并动态更新知识库,提出CKM-Lite和CKM-Full两种变体,揭示了增量处理在预测和效率上的优势,以及知识变化对假设生成的影响。

Comments ICML 2026 AI4Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26874 2026-07-01 cs.DB cs.AI cs.LG 版本更新 73%

Knowledge Graphs as the Missing Data Layer for LLM-Based Industrial Asset Operations

知识图谱:基于LLM的工业资产运营中缺失的数据层

Madhulatha Mandarapu, Sandeep Kunkunuru

机构 * VaidhyaMegha Private Limited, India(印度VaidhyaMegha私人有限公司)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究通过类型化知识图谱作为数据层,将GPT-4在工业维护场景中的准确率从65%提升至99%,并引入生成增强知识(GAK)处理缺失数据,实现81.8%的场景可回答性。

Comments v4: Accepted at Agents+Graph (AG2026) @ VLDB 2026. Corrects claims to reproduced ground truth: base graph 9 labels/5 edge types/12,647 nodes (extended schema 14/21); GAK materializes 106 failure-mode nodes; FailureSensorIQ noted as a separate IBM benchmark; 467 FMSR overlap with GAK disclosed. 20 pages, 4 figures. Code: github.com/samyama-ai/assetops-kg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29193 2026-06-30 cs.SE cs.AI 73%

A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis

用于评估微服务故障诊断中LLM智能体的多数据集基准

Yuanhong Cai, Xiaohui Nie, Kanglin Yin, Changhua Pei, Yongqian Sun, Shenglin Zhang, Haibin Liu, Guiyang Liu, Xidao Wen, Fang Situ, Dan Pei

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 提出基于推理过程评估的基准,包含两个大规模数据集(AIOps2025和RCA100),从定位、识别和原因三个维度评估智能体诊断能力,覆盖500多个专家标注的故障案例。

Comments 10 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02380 2026-06-30 cs.CL cs.AI 73%

SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence

SPADE-Bench:通过计划-行动分歧评估智能体中的自发性策略欺骗

Yuyan Bu, Haowei Li, Qirui Zheng, Bowen Dong, Kaiyue Yang, Jiaming Ji, Yingshui Tan, Wenxin Li, Yaodong Yang, Juntao Dai

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Science(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM智能体在工具使用中可能出现的自发性策略欺骗(计划与行动不一致),提出SPADE-Bench基准,通过结合实际工具执行和受控压力场景,严格区分欺骗与幻觉,实验证实该问题真实且紧迫。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27539 2026-06-29 cs.SI cs.AI cs.LG 新提交 73%

Benchmarking Multi-Modal Graph-based Social Media Popularity Prediction

基于多模态图的社交媒体流行度预测基准测试

Utkarsh Sahu, Zhisheng Qi, Li Zhu, Yizhao Yang, Jun Li, Ryan Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) University of Georgia(佐治亚大学) Adobe Research(Adobe研究)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出统一的多模态图基准MMG-Pop和模型MMG-PopNet,联合建模文本、视觉、时间与社交交互信号,在Bluesky和Reddit数据集上验证了跨平台泛化与多模态贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17554 2026-06-26 cs.AI cs.LG 版本更新 73%

Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps

评估深度研究代理在专家咨询工作中的表现:一个包含验证器、评分标准和认知陷阱的基准

Tanmay Asthana, Aman Saksena, Divyansh Sahu

机构 * Deccan AI Research(德克南人工智能研究所)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基准,通过42个专家编写的任务,使用确定性验证器和五维度评分标准评估三个前沿深度研究代理(Claude、OpenAI o3、Gemini)在管理咨询类结构化分析交付物上的表现,并嵌入认知陷阱,发现所有代理的联合接受率均较低(最高21.4%),且各有独特失败模式。

Comments Updating the paper with more data. Will resubmit

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06078 2026-06-26 cs.CY cs.AI cs.CL 73%

Simulating Students with Large Language Models: A Review of Architecture, Mechanisms, and Role Modelling in Education with Generative AI

用大型语言模型模拟学生:生成式AI在教育中的架构、机制与角色建模综述

Luis Marquez-Carpintero, Alberto Lopez-Sellers, Miguel Cazorla

机构 * Institute for Computer Research University of Alicante(计算机研究所阿利坎特大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文综述了利用大型语言模型模拟学生行为在教育中的应用,探讨了其在学习者建模、教学评估和教师培训中的潜力与挑战。

Journal ref Computer Science Review 62 (2026) 101008

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20474 2026-06-23 cs.LG cs.AI cs.PF 新提交 73%

UltraQuant: 4-bit KV Caching for Context-Heavy Agents

UltraQuant: 面向上下文密集型智能体的4位KV缓存

Inesh Chakrabarti, David Limpus, Aditi Ghai Rana, Bowen Bao, Spandan Tiwari, Thiago Crepaldi, Ashish Sirasao

机构 * Advanced Micro Devices(超威半导体) University of California, Los Angeles(加州大学洛杉矶分校) Purdue University(普渡大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对上下文密集型智能体场景,提出UltraQuant方法,通过4位KV缓存压缩、旋转量化和代码本量化,结合AMD GPU优化,在长上下文多轮任务中延迟降低3.47倍,吞吐量提升1.63倍。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19595 2026-06-19 cs.LG cs.AI 新提交 73%

IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows

IHBench:评估语音代理在结构化工作流中的中断后恢复能力

Ahmad Salimi, Wentao Ma, Yuzhi Tang, Dongming Shen, Mu Li, Alex Smola

机构 * Boson AI

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出IHBench基准,评估语音代理在结构化工作流中处理中断后的恢复能力,涵盖任务完成和恢复质量两个维度,实验表明闭源模型比开源模型更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏