Can Compressed LLMs Truly Act? An Empirical Evaluation of Agentic Capabilities in LLM Compression
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)
Comments Accepted by ICML2025 as Poster
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)
Comments Accepted by ICML2025 as Poster
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)
TxBench-PP:分析AI代理在小分子临床前药理学中的表现
机构 * LatchBio
专题命中 Agent评测 :agent(title);AI agent(title);workflow(abstract);分类 cs.AI、cs.LG
AI总结 提出TxBench-PP基准,用于评估AI代理从真实实验数据中恢复临床前药理学结论的能力,测试显示最强配置Claude Opus 4.8 / Pi仅通过59.3%的端点尝试。
CAMO:一种用于从微观行为到宏观涌现的LLM代理模拟自动因果发现的框架
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能计算学院) ; Tianjin Key Laboratory of Healthy Habitat and Smart Technology(天津健康人居环境与智能技术重点实验室) ; Laboratory of Computation and Analytics of Complex Management Systems, Tianjin University(复杂管理系统计算与分析实验室)
专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.AI、cs.CL
AI总结 CAMO通过分析LLM代理模拟中的微观行为,自动发现导致宏观结果的因果机制,提供可解释的因果链和干预手段,提升对社会涌现的理解。
你的大语言模型真的掌握了概念吗?一个多智能体基准
机构 * Beijing Normal University(北京师范大学) ; Australian National University(澳大利亚国立大学)
专题命中 Agent评测 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.CL
AI总结 本文提出CK-Arena,通过多智能体社交推理游戏评估大语言模型的概念理解能力,揭示模型在概念掌握上的差异性。
Comments 8 pages
人工智能代理供应链中行为后门检测的跨LLM泛化
机构 * Arun Chowdary Sanna(独立研究者)
专题命中 Agent评测 :AI agent(title,abstract);agent(title);分类 cs.AI、cs.LG
AI总结 本研究首次系统探讨了跨LLM行为后门检测的泛化问题,发现模型特定特征导致泛化差距,并提出模型感知检测方法提升检测准确率。
Comments 10 pages, 2 figures, 8 tables. Evaluation across 6 production LLMs with 1,198 traces
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Grammarly
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL
专题命中 Agent评测 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.LG
Comments In Proceedings ICLP 2021, arXiv:2109.07914
Journal ref EPTCS 345, 2021, pp. 182-188
Site4Drug: 利用AI智能体预测药物结合靶点
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.LG;agentic(comments)
AI总结 提出Site4Drug,一种模态感知的靶点发现智能体,通过整合拓扑、亲水性、翻译后修饰等证据,输出带约束、风险标记和决策日志的可靶向区域排名列表,并自动推荐结合模态。
Comments Accepted to the ICML 2026 Workshop on Generative and Agentic AI for Biology (GenBio)
DocOps:复杂文档操作中自主智能体的可验证基准
专题命中 Agent评测 :autonomous agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究自主智能体处理数字文档的能力,引入DocOps评估框架,解构文档操作,评估多种模型,发现其局限性及关键失败模式,揭示能力边界,为健壮无损智能体设计提供启示。
用于开放即兴分割的视觉引导代理
机构 * University of Michigan(密歇根大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);workflow(abstract);agentic(abstract)
AI总结 本文提出了一种名为VASA的视觉引导即兴分割代理,该代理通过结合视觉语言模型、分割基础模型和视觉引导工作流,实现了无需训练的即兴分割任务,其在PARS和RefCOCO等基准测试中均表现出色。
Comments 23 pages, 11 figures
RewardHarness: 自我进化代理的后训练
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; Kolors Team, Kuaishou Technology(快手团队) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Waterloo(滑铁卢大学) ; Etude AI ; Tsinghua University(清华大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG
AI总结 RewardHarness通过自我进化代理框架,利用少量人类偏好示例迭代优化工具库,实现高效图像编辑评估,准确率达47.4%,超越GPT-5 5.3个百分点。
Comments Project page: https://rewardharness.com
AgentDyn: 您的代理安全防御能在现实世界动态环境中部署吗?
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);planning(abstract);agentic(abstract)
AI总结 本文揭示现有代理安全基准的三大缺陷,提出AgentDyn基准,包含60个挑战性开放任务和560个注入测试用例,评估十种先进防御,发现现有防御不足或过度防御,亟需更适应动态环境的基准。
Comments 26 Pages, 17 Tables
AgentServe: 为在消费级GPU上高效执行代理AI服务的算法-系统协同设计
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);multi-agent(abstract)
AI总结 AgentServe通过算法-系统协同设计,在消费级GPU上实现高效代理AI服务,提升延迟稳定性并保持吞吐量。
代理批判训练
机构 * University of Maryland College Park(马里兰大学学院公园分校)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。
Comments Project page: https://attention-is-all-i-need.github.io/ACT/
代理自动组合:一种背包方法用于代理组件选择
机构 * AWS Agentic AI(AWS 代理人工智能)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出基于背包问题的代理组件自动组合框架,通过动态评估组件性能与成本,提升代理系统在不同场景下的成功率和资源利用效率。
Comments Accepted to NeurIPS 2025 Conference
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments 38th Conference on Neural Information Processing Systems (NeurIPS 2024), NeurIPS 2024 Workshop on Open-World Agents
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments Paper was accepted for Undergraduate Consortium at ACM KDD, 2024. Please find the link: https://kdd2024.kdd.org/undergraduate-consortium/
HANDBOOK.md:长上下文代理指令跟随基准测试
机构 * Surge AI
专题命中 Agent评测 :agentic(title,abstract);agent(abstract,comments);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出HANDBOOK.md基准测试,模拟企业员工遵循公司手册,含65个代理任务跨越多领域多公司。任务修改基础手册防记忆,评分具确定性。测试发现模型配置通过率低,代理常违背策略,还发布了所有任务、环境及评估工具。
Comments 16 pages, 3 figures, 5 tables. Accepted to the Workshop on Agent Behavior (WAB) at COLM 2026. Benchmark, environments, and evaluation harness: https://github.com/surge-ai/handbook
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
Comments Petar Radanliev, Carsten Maple, Omar Santos, and Kayvan Atefi. 2026. SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation. Digital Threats Just Accepted (March 2026)
多视角编码器在基于大语言模型的代理工作流性能预测中的应用
机构 * KAIST(韩国科学技术院)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Agentic Predictor,通过多视角编码技术与跨领域预训练,实现高效准确的代理工作流性能预测,提升LLM代理系统设计效率。
Comments ICLR 2026, Project Page: https://deepauto-ai.github.io/agentic-predictor/
评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型
机构 * Sony Interactive Entertainment(索尼互动娱乐)
专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);分类 cs.AI
AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。
智能体基准测试能衡量能力吗?智能体人工智能时代的协议有效性
机构 * Tencent(腾讯) ; The Hong Kong University of Science and Technology(香港科技大学) ; Duke Kunshan University(昆山杜克大学)
专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.AI
AI总结 研究智能体基准测试分数能否衡量能力,提出协议有效性概念及HackDetect事后审计方法,通过审计多基准测试轨迹发现暴露和奖励破解证据,量化分数膨胀,强调基准测试报告应证明分数反映预期能力。
MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理
机构 * Weill Cornell Medicine(威尔康乃尔医学院) ; University of Western Australia(西澳大利亚大学) ; Indiana University(印第安纳大学) ; Regenstrief Institute(瑞根斯特里夫研究所) ; Yale University(耶鲁大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.CL
AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。
基于大语言模型的AI智能体系统及其工业应用
专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI
AI总结 本文综述了从传统智能体到LLM驱动智能体的演进,分类为软件、物理和自适应混合系统,并讨论了在客服、软件开发、制造、教育、金融和医疗等领域的应用及挑战。
Comments This is the author's accepted version of the paper accepted to appear at IEEE AIIoT 2025. The final version will be available via IEEE Xplore. \c{opyright}2025 IEEE. Personal use of this material is permitted
无处不在的基准测试
机构 * MMLab, The Chinese University of Hong Kong(中大香港实验室) ; CPII under InnoHK(创新香港 CPII) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; Shandong University(山东大学) ; Huawei Technologies(华为技术)
专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出Benchmark Agent,一个全自主智能体系统,自动化基准构建流程,以解决现有基准构建劳动密集、难以复用和性能饱和的问题。
Comments Project page: https://benchmarkagent.github.io/
CV-Arena: 面向教学计算机视觉问题求解的开放基准与人类-AI协作偏好
机构 * Texas A&M University(德克萨斯A&M大学) ; Worcester Polytechnic Institute(沃斯特理工大学) ; Tohoku University(东北大学) ; Georgia Institute of Technology(佐治亚理工学院) ; NVIDIA(英伟达) ; UCSB(加州大学圣塔芭芭拉分校) ; UC Merced(加州大学默塞德分校)
专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract);agentic(abstract);分类 cs.AI
AI总结 提出CV-Arena基准,包含12K高分辨率真实图像指令对,覆盖16种任务类型,并采用Active Elo协议结合人类与AI偏好评估21个系统,揭示指令遵循、物理推理等方面的差距,同时开发CV-Agent代理模型展示闭环推理的潜力。
Comments 26 pages, 7 figures, 11 tables