arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-05 至 2026-06-05 共收录 33 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 33 篇

2606.06453 2026-06-05 cs.AI 91%

Vortex: Efficient and Programmable Sparse Attention Serving for AI Agents

Vortex: 面向AI Agent的高效可编程稀疏注意力服务

Zhuoming Chen, Xinrui Zhong, Qilong Feng, Ranajoy Sadhukhan, Yang Zhou, Michael Qizhe Shieh, Zhihao Jia, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Rice University(Rice大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :AI agent(title,title_cn);agent(title_cn,abstract_cn);分类 cs.AI

AI总结 提出Vortex系统,通过Python嵌入式前端语言和面向页面的张量抽象,结合高效后端,实现稀疏注意力算法的快速原型设计、部署和评估,显著提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05658 2026-06-05 cs.IR cs.AI 91%

Agent-Orchestrated Adaptive RAG: A Comparative Study on Structured and Multi-Hop Retrieval

Agent编排的自适应RAG:结构化与多跳检索的比较研究

Anuj Maharjan, Devinder Kaur, Richard Molyet

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 提出Agent编排的自适应RAG框架,通过动态查询分解、迭代检索和自反思评估,在结构化领域(DevOps)和多跳推理基准(MuSiQue)上对比发现,查询分解在结构化领域提升性能但降低多跳排名精度,反思机制提高引用准确性但增加延迟,表明Agent增强需根据查询和领域特性选择性应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06462 2026-06-05 cs.AI 86%

Benchmark Everything Everywhere All at Once

无处不在的基准测试

Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(中大香港实验室) CPII under InnoHK(创新香港 CPII) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Shandong University(山东大学) Huawei Technologies(华为技术)

专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出Benchmark Agent,一个全自主智能体系统,自动化基准构建流程,以解决现有基准构建劳动密集、难以复用和性能饱和的问题。

Comments Project page: https://benchmarkagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15231 2026-06-05 cs.AI 85%

CangLing-KnowFlow: A Unified Knowledge-and-Flow-fused Agent for Comprehensive Remote Sensing Applications

CangLing-KnowFlow: 一个统一的知识与流程融合代理用于综合遥感应用

Zhengchao Chen, Haoran Wang, Jing Yao, Jianshe Zhang, Pedram Ghamisi, Jun Zhou, Peter M. Atkinson, Bing Zhang

机构 * State Key Laboratory of Remote Sensing and Digital Earth, Aerospace Information Research Institute, Chinese Academy of Sciences(遥感与数字地球国家重点实验室,航天信息研究所,中国科学院) Beijing Tiandi Shijie Technology Co., Ltd.(北京天帝世纪科技有限公司) Faculty of Science and Technology, Lancaster University(兰卡斯特大学科学与技术学院) Faculty of Electrical and Computer Engineering, University of Iceland(冰岛大学电气与计算机工程学院) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍尔茨中心) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出CangLing-KnowFlow,一个融合知识与流程的统一智能代理框架,通过整合过程知识库、动态工作流调整和进化记忆模块,解决遥感数据处理中任务特定、缺乏统一框架的问题,并在KnowFlow-Bench基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05548 2026-06-05 cs.SE cs.AI 84%

ADK Arena: Evaluating Agent Development Kits via LLM-as-a-Developer

ADK Arena: 通过LLM即开发者评估智能体开发工具包

Jintao Huang, Xiaomin Li, Gaurav Mittal, Yu Hu

机构 * The Ohio State University(俄亥俄州立大学) Microsoft(微软)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 提出LLM-as-a-Developer方法,通过自动化流水线ADK Arena评估51个Python ADK框架,发现框架间生成成本差异达5.6倍,但无单一框架占优,且文档、源码和参数知识可相互替代。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05525 2026-06-05 cs.AI cs.HC 83%

SciVisAgentSkills: Design and Evaluation of Agent Skills for Scientific Data Analysis and Visualization

SciVisAgentSkills:面向科学数据分析和可视化的智能体技能设计与评估

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Shusen Liu, Chaoli Wang

机构 * Univ. Notre Dame(诺丁汉大学) LLNL(劳伦斯利弗莫尔国家实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 提出SciVisAgentSkills技能库,通过编码环境假设、工具使用模式和领域启发式知识增强编码智能体,在ParaView等科学工具上实现自然语言驱动的科学可视化工作流,实验表明技能可提升任务得分并影响token效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12376 2026-06-05 cs.AI 83%

ProfiliTable: Profiling-Driven Tabular Data Processing via Agentic Workflows

ProfiliTable: 通过代理工作流实现基于轮廓的表格数据处理

Wei Liu, Yang Gu, Xi Yan, Zihan Nan, Beicheng Xu, Keyao Ding, Bin Cui, Wentao Zhang

机构 * School of CS & Key Lab of High Confidence Software Technologies (MOE), Peking University(计算机科学学院及高可信软件技术重点实验室(教育部),北京大学) Academy for Advanced Interdisciplinary Studies, Peking University(先进跨学科研究学院,北京大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) School of CS & Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University(计算机科学学院及北京软件与硬件协同人工智能系统重点实验室,北京大学) Center for Machine Learning Research, Peking University(机器学习研究中心,北京大学)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究提出ProfiliTable,一种基于动态轮廓的代理工作流框架,用于解决表格数据处理中的模糊指令、复杂任务结构和缺乏结构化反馈问题,通过交互探索、知识增强合成和反馈驱动细化,实现闭环优化,实验表明其在复杂多步骤场景中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31278 2026-06-05 cs.AI cs.LG stat.ME 82%

Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation

工业化预测驱动推断:用于可靠生成式AI与智能体系统评估的GLIDE库

Grégoire Martinon, Ibrahim Merad, Mohammed Raki

机构 * University of California, Berkeley(加州大学伯克利分校) Google Research(谷歌研究院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 提出GLIDE开源库,统一多种预测驱动推断方法,提供无偏估计与有效置信区间,显著降低人工标注成本。

Comments 8 pages, Accepted to the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05167 2026-06-05 cs.MA cs.AI 79%

RAINO: Anchoring Agents in Reality, A Systematic Review and Conceptual Framework for Realism in Agent-Based Modelling

RAINO:将智能体锚定于现实——基于智能体建模中现实主义的系统综述与概念框架

Loïs Vanhée, Melania Borit

机构 * Umeå Universitet(乌梅拉大学) UiT The Arctic University of Norway(北极大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文通过系统文献综述,识别了基于智能体建模中现实主义操作化与展示的不足,并提出了RAINO框架(现实锚点、输入、输出),以统一和拓展对现实主义的理解。

Comments The paper has been accepted in the Social Simulation Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05732 2026-06-05 physics.geo-ph 78%

Preparing for the Next Carrington: Spatiotemporal Agent-Based Modeling for Safeguarding Satellite Infrastructure Under Extreme Space Weather Disturbances

为下一次卡林顿事件做准备:基于时空智能体的极端空间天气扰动下卫星基础设施保护建模

Rushil Kukreja, Edward J. Oughton, Phillip M. Cunio, Richard Linares

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究开发了一种新型时空智能体模型,用于预测极端空间天气对卫星的影响,并提供实时机动建议,以保护卫星基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03555 2026-06-05 cs.MA cs.AI cs.SI 77%

Benchmarking Emergent Coordination in Large-Scale LLM Populations: An Evaluation Framework on the MoltBook Archive

在大规模大语言模型群体中评估涌现协调:对MoltBook档案库的评估框架

Brandon Yee, Pairie Koh

机构 * Management Lab, Yee Collins Research Group(Yee Collins研究组管理实验室)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出了一种评估框架,用于在开放代理环境中评估角色专业化、信息扩散和协作任务解决的涌现协调,通过MoltBook档案库的数据集展示了该框架,并建立了量化基准,揭示了核心-外围结构、重尾级联分布和去中心化任务解决中的严重协调开销。

Comments Substantial Revision Required

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05671 2026-06-05 cs.CL 70%

QueryAgent-R1: Bridging Query Generation and Product Retrieval for E-Commerce Query Recommendation

QueryAgent-R1:连接查询生成与商品检索的电商查询推荐

Dike Sun, Zheng Zou, Jingtong Zang, Qi Sun, Huaipeng Zhaoand Tao Luo, Xiaoyi Zeng

机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 提出QueryAgent-R1框架,通过记忆增强和检索链优化,将查询生成与实际库存检索对齐,以提升电商搜索中查询推荐的产品转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05557 2026-06-05 cs.CL 70%

AURA: Intent-Directed Probing for Implicit-Need Surfacing in Situated LLM Agents

AURA: 面向情境化LLM代理中隐式需求挖掘的意图导向探测

Yang Li, Jiaxiang Liu, Jiang Cai, Mingkun Xu

机构 * Guangdong Institute of Intelligence Science and Technology(广东省智能科学与技术研究院)

专题命中 Agent评测 :tool use(abstract);tool-use(abstract);分类 cs.CL

AI总结 提出AURA方法,通过在场景感知和工具使用之间插入意图推理步骤生成IntentFrame,以结构化估计隐式需求并控制探测预算,在隐式意图基准上提升覆盖率达+0.07,同时减少82%的探测次数并避免隐私违规。

Comments Submitted to EMNLP 2026. Code, simulator, and benchmark: https://github.com/innovation64/AURA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05793 2026-06-05 cs.CL cs.AI cs.CY cs.LG 67%

CollabBench: Benchmarking and Unleashing Collaborative Ability of LLMs with Diverse Players via Proactive Engagement

CollabBench: 通过主动参与与多样化玩家基准测试和释放LLMs的协作能力

Hong Qian, Yuanhao Liu, Zihan Zhou, Zongbao Zhang, Hanjie Ge, Haotian Shi, Liang Dou, Xiangfeng Wang, Jingwen Yang, Aimin Zhou

机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) School of Computer Science(计算机科学学院) East China Normal University(东华大学) Tencent Inc.(腾讯公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出CollabBench基准,通过多样化玩家模拟和协作智能体训练范式,提升LLM在合作游戏中的任务效率和情感适应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05567 2026-06-05 cs.CR cs.MA 67%

ZERO-APT: A Closed-Loop Adversarial Framework for LLM-Driven Automated Penetration Testing under Intelligent Defense

ZERO-APT: 智能防御下LLM驱动的自动化渗透测试的闭环对抗框架

Anlan Zheng, Tiantian Zhu

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 提出ZERO-APT框架,通过集成可配置的LLM防御者、架构级因果一致性机制和专用裁判智能体,解决了LLM驱动渗透测试在真实性、一致性和可审计性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05415 2026-06-05 cs.CL cs.AI cs.LG 67%

Executable Schema Contracts: From Automatic Ingestion to Multi-Source Retrieval

可执行模式合约:从自动摄入到多源检索

Padmaja Jonnalagedda, Yuguang Yao, Xiang Gao, Hilaf Hasson, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出一种自动从多源数据中发现可执行模式并将其作为共享合约的系统,通过模式约束的检索路由和结构化分析提升多源问答性能。

Comments 9 pages, 4 figures, plus supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05168 2026-06-05 cs.CL cs.AI cs.LG 67%

Epidemiology of Model Collapse: Modeling Synthetic Data Contamination via Bilayer SIR Dynamics

模型崩溃的流行病学:通过双层SIR动力学建模合成数据污染

Xiangyu Wang

机构 * Xiangyu Wang(王翔宇)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出双层耦合SIR/SIRS框架,将数据语料库和AI模型视为两个相互作用的群体,通过交叉层传播模拟合成数据污染导致的模型崩溃,并推导基本再生数R0,实验验证了阈值动力学和干预策略的有效性。

Comments 24 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05661 2026-06-05 cs.AI cs.CL 62%

Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments

持续学习基准:评估现实世界有状态环境中的前沿AI系统

Parth Asawa, Christopher M. Glaze, Gabriel Orlanski, Ramya Ramakrishnan, Benji Xu, Asim Biswal, Vincent Sunn Chen, Frederic Sala, Matei Zaharia, Joseph E. Gonzalez

机构 * UC Berkeley(伯克利大学) Snorkel AI University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出首个专家验证的持续学习基准CL-Bench,涵盖六个领域,通过增益指标隔离在线学习能力,发现现有系统存在过拟合和知识复用不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05563 2026-06-05 cs.AI cs.CL 62%

SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations

SoCRATES:跨领域和社会认知变异的前瞻性LLM调解的可靠自动化评估

Taewon Yun, Hyeonseong Park, Jeonghwan Choi, Hayoon Park, Yeeun Choi, Hwanjun Song

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出SoCRATES基准,通过多领域真实冲突场景和五维社会认知适应轴评估LLM调解员,使用主题定位评估器实现0.82的人类专家一致性,发现最强模型仅缩小约三分之一的未调解共识差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05436 2026-06-05 cs.AI cs.CL cs.IR 62%

Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison

十位头痛专家与人工智能在临床文献总结中的比较:一项关键评估与对比

Alejandro Lozano, Keiko Ihara, Ping-Hao Yang, Carrie E. Robertson, Jennifer Stern, Allan Purdy, Hsiangkuo Yuan, Pengfei Zhang, Yulia Orlova, Olga Fermo, Jennifer Hranilovich, Fred Cohen, Todd J. Schwedt, Jenelle A. Jindal, Serena Yeung-Levy, Chia-Chun Chiang

机构 * Stanford University Palo Alto CA USA(斯坦福大学) Department of Neurology Mayo Clinic Rochester MN USA(梅奥诊所神经科) Department of Neurology Dalhousie University Halifax Canada(达尔豪斯大学神经科) Jefferson Headache Center Department of Neurology Thomas Jefferson University PA USA(泰勒大学神经科) Beth Israel Deaconess Medical Center Boston MA USA(贝斯以色列医疗中心) Department of Neurology University of Florida Gainesville FL USA(佛罗里达大学神经科) University of Colorado School of Medicine Department of Pediatrics Division of Child Neurology Aurora CO USA(科罗拉多医学院儿科部儿童神经科) Department of Medicine Mount Sinai Hospital Icahn School of Medicine at Mount Sinai New York NY USA(西奈医院医学部) Department of Neurology Mayo Clinic Scottsdale AZ USA(梅奥诊所Scottsdale分部) Harvard Medical School Boston MA USA(哈佛医学院) Department of Neurology Mount Sinai Hospital Icahn School of Medicine at Mount Sinai New York NY USA(西奈医院神经科)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本研究通过构建基于RAG的AI框架,比较了三种大语言模型与十位头痛专家在临床文献总结方面的表现,发现专家撰写的摘要更受青睐,但专家有时难以区分人类与AI生成的摘要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05233 2026-06-05 cs.CR cs.AI cs.CL 62%

Domain-Conditioned Safety in Frontier Computer-Using Agents: A 793-Episode Browser Benchmark, a Coding-Domain Cross-Reference, and a Reproducibility Audit of Recent Red-Teaming

前沿计算机使用代理中的领域条件安全:一个793集浏览器基准测试、编码领域交叉引用以及近期红队攻击的可重复性审计

Nicholas Saban

机构 * Patronus AI University of California, Berkeley(Patronus AI 伯克利大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究通过构建包含793个浏览器任务和56个攻击模板的基准测试,评估前沿计算机使用代理对提示注入攻击的鲁棒性,发现模型权重提供了强抵抗性(攻击成功率0%),但该安全性是领域条件的,在编码代理中失效(攻击成功率高达100%),并指出文献中高攻击成功率主要归因于RL优化的注入文本而非攻击类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23190 2026-06-05 cs.SE cs.AI 62%

RAT: RunAnyThing via Fully Automated Environment Configuration

RAT: 通过完全自动化的环境配置实现RunAnyThing

Renhong Huang, Dongdong Hua, Yifei Sun, Sitao Ding, Hanyang Yuan, Daixin Wang, Yang Yang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出RAT框架,用于在任意仓库上实现跨编程语言的全自动环境配置,通过多阶段流水线整合语言感知抽象、镜像初始化、专用配置工具集和稳健沙箱,并提出RATBench基准测试集,实验表明RAT在环境设置成功率上比强基线提升了36.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14131 2026-06-05 cs.LG cs.AI econ.EM 62%

An Empirical Risk Minimization Approach for Offline Inverse RL and Dynamic Discrete Choice Model

一种用于离线逆强化学习和动态离散选择模型的经验风险最小化方法

Enoch H. Kang, Hema Yoganarasimhan, Lalit Jain

机构 * Foster School of Business, University of Washington(华盛顿大学福斯特商学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于经验风险最小化(ERM)的逆强化学习/动态离散选择模型框架,该方法无需显式估计贝尔曼方程中的状态转移概率,适用于高维和无限状态空间,并在理论上有Polyak-Lojasiewicz条件的支持,从而保证了快速的全局收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06219 2026-06-05 cs.RO cs.AI 57%

CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving

CLEAR:端到端自动驾驶中的认知与潜在评估自适应路由

Yining Xing, Zehong Ke, Zhiyuan Liu, Yanbo Jiang, Wenhao Yu, Jianqiang Wang

机构 * Qwen 3.5 0.8B

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 提出CLEAR框架,通过单步条件漂移替代扩散模型的多步去噪,结合视觉编码器Drive-JEPA和微调Qwen 3.5 0.8B进行语义推理,实现高效多模态规划,在NAVSIM v1上达到93.7 PDMS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05241 2026-06-05 cs.CR cs.AI 57%

Search-Time Contamination in Deep Research Agents: Measuring Performance Inflation in Public Benchmark Evaluation

深度研究代理中的搜索时污染:衡量公开基准评估中的性能膨胀

Yongjie Wang, Xinyue Zhang, Kunhong Yao, Zhiwei Zeng, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里-NTU全球可持续性科技公司实验室(ANGEL)) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究深度研究代理在推理过程中通过网页搜索检索公开基准元数据、问题上下文甚至真实答案导致的搜索时污染(STC),定义三种污染类型并开发检测算法,实验表明STC可导致性能膨胀高达4%。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05238 2026-06-05 cs.SE 57%

DeployBench: Benchmarking LLM Agents for Research Artifact Deployment

DeployBench: 用于研究工件部署的LLM智能体基准测试

Yuanli Wang, Yaoyao Qian, Yue Zhang, Hanhan Zhou, Jindan Huang, Tianfu Fu, Qiuyang Mang, Huanzhi Mao, Wenhao Chai, Wendong Fan, Liqiang Jing

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 提出DeployBench基准,包含51个跨领域的研究工件部署任务,评估LLM智能体在环境设置中的表现,发现主要失败原因是智能体过早停止且验证不充分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00644 2026-06-05 cs.AI 57%

ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment

ForeSci: 评估LLM智能体在前瞻性AI研究判断中的能力

Qiuyu Tian, Haojie Yin, Yingce Xia, Youyong Kong, Zequn Liu

机构 * Southeast University(东南大学) Beijing Zhongguancun Academy(北京中关村学院) Duke Kunshan University(杜克昆山大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出ForeSci基准,通过时间控制的500个任务评估LLM智能体基于历史证据做出前瞻性研究判断的能力,发现证据与决策脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13587 2026-06-05 stat.ML cs.LG eess.SP 57%

Reframing preprocessing selection as model-internal calibration in near-infrared spectroscopy: A large-scale benchmark of operator-adaptive PLS and Ridge models

将预处理选择重新定义为近红外光谱学中的模型内部校准:一种大规模的运算符自适应PLS和岭模型基准测试

Gregory Beurier, Robin Reiter, Camille Noûs, Lauriane Rouan, Denis Cornet

机构 * CIRAD, UMR AGAP Institut(CIRAD,AGAP研究院) UMR AGAP Institut, Univ Montpellier, CIRAD, INRAE, Institut Agro(AGAP研究院,蒙彼利埃大学,CIRAD,INRAE,农业研究院) Laboratoire Cogitamus(Cogitamus实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文研究了在近红外光谱学中,将预处理选择重新定义为模型内部校准的方法,通过大规模基准测试比较运算符自适应PLS和岭模型的性能和效率。

Comments 17 pages, 8 figures; supplementary material (39 pages, 4 figures) included. Extended preprint version of a companion study prepared as a concise journal article (same results, different framing and scope). Code and artifacts: https://github.com/GBeurier/nirs4all-aom

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06703 2026-06-05 cs.AI 57%

ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents

ST-WebAgentBench:用于评估网络代理安全性和可信度的基准测试

Ido Levy, Ben Wiesel, Sami Marreed, Alon Oved, Avi Yaeli, Nir Mashkif, Segev Shlomov

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出ST-WebAgentBench基准测试,用于评估网络代理在现实企业场景中的安全性和可信度,通过引入新的评估指标CuP和风险比,揭示了现有代理的安全性缺陷。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23845 2026-06-05 cs.CL 57%

CLFEC: A New Task for Unified Linguistic and Factual Error Correction in paragraph-level Chinese Professional Writing

CLFEC:一种新的任务,用于段落级中文专业写作中的统一语言和事实纠错

Jian Kai, Zidong Zhang, Jiwen Chen, Zhengxiang Wu, Songtao Sun, Fuyang Li, Yang Cao, Qiang Liu

机构 * Huazhong University of Science and Technology(华中科技大学) WPS AI, Kingsoft Office(WPS AI,Kingsoft Office)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出CLFEC任务,旨在解决段落级中文专业写作中语言和事实错误的联合纠错问题,构建了多领域数据集,并系统研究了基于LLM的纠错方法,揭示了实际挑战并展示了统一纠错的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏