Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems
不依赖代理的生产环境SQL准确性评估
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出STEF框架,通过自然语言输入和生成的SQL进行生产环境文本到SQL系统的评估,无需数据库模式或参考查询,实现持续监控和改进反馈。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
不依赖代理的生产环境SQL准确性评估
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出STEF框架,通过自然语言输入和生成的SQL进行生产环境文本到SQL系统的评估,无需数据库模式或参考查询,实现持续监控和改进反馈。
一种面向电网的基于代理的模型用于分析电动汽车充电系统
机构 * Lakeside Labs(拉克西德实验室) ; Silicon Austria Labs(硅 Austria 实验室)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 本文提出一种可配置的、面向电网的基于代理的模型,用于系统分析电动汽车充电系统在可配置基础设施和运营条件下的表现,通过整合异构的电动汽车行为、充电柱约束和共享的能源沙盒,研究用户导向的充电动态和设施层面的电力行为。
Comments This is the author's version of a paper submitted to SIMULTECH. 12 Pages, 1 Table, 10 Figures
ObjectGraph:从文档注入到知识遍历——面向代理时代的原生文件格式
机构 * Open Gigantic(开放巨型)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI
AI总结 本文提出ObjectGraph文件格式,通过将文档视为类型化有向知识图谱而非文本字符串,解决代理任务中文档处理的效率与准确性问题,实现95.3%的token减少和98.7%的内容保留。
Comments 12 pages, 4 figures, 4 tables
AgentEconomist:一个端到端的代理系统,将经济直觉转化为可执行的计算实验
机构 * Zhongguancun Academy(中关村学院) ; University of Science and Technology of China(中国科学技术大学) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院)
专题命中 Agent评测 :agentic(title);workflow(abstract);分类 cs.AI
AI总结 AgentEconomist通过模块化多阶段架构,将经济直觉转化为可执行的计算实验,通过文献基础假设生成、实验设计和执行阶段,结合人类与AI协作,提升研究创新性与文献相关性。
为智能代理AI设计道德学习:Toegye Yi Hwang的道德情感调节框架
机构 * Seoul National University(首尔国立大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出一种基于Toegye Yi Hwang道德哲学的智能代理AI道德情感调节框架,通过五阶段架构和评估工具规范自主决策周期中的道德情感过程。
OptiMat 合金:由对话代理驱动的多主元合金FAIR活数据库
专题命中 Agent评测 :agent(title,abstract)
AI总结 OptiMat Alloys通过对话代理实现多主元合金探索,结合活数据库、网页界面和不确定性量化,使计算合金筛选更易用,拓展FAIR原则至按需知识生成。
Comments See demo here https://youtu.be/lQzuorkzPMc
AI能否成为道德受害者?道德耐心和所有权感知在使用AI生成内容的伦理判断中的作用
机构 * Purdue University(普渡大学) ; University of California, Davis(加州大学戴维斯分校)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 研究探讨了人们在评估AI生成内容再利用时的道德判断,发现AI生成内容被判定为不道德和抄袭的可能性较低,这归因于较低的道德耐心感知和更高的所有权归属。
Comments Honourable Mention Award, ACM CHI 2026
TEA Nets框架结合人工智能与认知网络科学,用于建模文本中的目标、事件和主体
机构 * CogNosco Lab, Department of Psychology and Cognitive Science, University of Trento(CogNosco实验室,心理学与认知科学系,特伦托大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 TEA Nets框架通过认知网络科学和人工智能提取文本中的主体、事件和目标,展示了在阴谋文本和LLM生成文本中进行可解释情绪检测、语义框架分析和语言研究的能力。
MCPHunt:多服务器MCP代理跨边界数据传播的评估框架
机构 * Key Laboratory of Intraplate Volcanoes and Earthquakes (China University of Geosciences, Beijing), Ministry of Education, Beijing 100083, China(中国大陆地质大学(北京)构造运动与地震重点实验室,教育部,北京100083,中国) ; School of Geophysics and Information Technology, China University of Geosciences, Beijing 100083, China(中国大陆地质大学(北京)地球物理与信息技术学院,北京100083,中国)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI;agent(comments)
AI总结 本文提出MCPHunt框架,通过三种方法论贡献评估多服务器MCP代理中非对抗性跨边界凭证传播问题,发现政策违规传播率高达11.5%-41.3%,并验证了提示引导的数据流足以避免凭证传播。
Comments 21 pages, 1 figure, 16 tables. Code: https://github.com/lihaonan0716/MCPHunt Data: https://huggingface.co/datasets/lihaonan0716/mcphunt-agent-traces
AppTek 电话客服对话:一种多口音长形式评估基准用于英语语音识别
机构 * ANONYMIZED-ORG-NAME(匿名机构)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本文提出AppTek电话客服对话数据集,用于评估英语语音识别系统在不同口音下的性能,揭示了不同口音和分段方法对识别效果的影响。
Comments Submitted to INTERSPEECH 2026
知识 affordance 用于混合人类-人工智能信息获取
机构 * Cefriel
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出知识 affordance 概念,用于系统化混合环境中信息获取机会识别,连接多个研究领域,探索更透明和共享的理解系统。
Comments 10 pages, accepted at Hybrid Human Artificial Intelligence Conference (HHAI 2026)
机器群体智能用于可解释的科学发现
机构 * Korea Research Institute of Chemical Technology(韩国化学技术研究院) ; Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出机器群体智能,结合符号主义与元启发式方法,实现自主进化发现 governing equations,无需人工知识,显著降低 extrapolation error。
区间序、双序与可信度限制的信念修正
机构 * Cardiff University, United Kingdom(Cardiff大学,英国) ; Université Sorbonne Paris Nord, Inserm, Sorbonne Université, Limics(巴黎-索邦大学,Inserm,索邦大学,Limics) ; CAIR, University of Cape Town, South Africa(开普敦大学,南非) ; ISTI-CNR, Pisa, Italy(意大利比萨CNR ISTI)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文研究了区间序和双序在信念修正中的应用,提出了非优先修正家族,探讨了可信度限制下的信念修正方法。
HiL-Bench (Human-in-Loop Benchmark): 代理何时该请求帮助?
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 HiL-Bench通过评估代理在任务中何时请求帮助的能力,揭示了当前基准测试的不足。核心指标Ask-F1衡量代理在请求与猜测之间的平衡,证明判断力可通过强化学习提升。
拓扑语义与共同归纳知识
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出一种逻辑框架,用于解决归纳协调攻击问题,通过确定假设何时成为共同归纳知识,以确保实验室达成一致结论且避免假阳性。
Comments 31 pages, Master's thesis
评估胰腺导管腺癌血管侵袭:PDACVI基准
机构 * Sycai Technologies SL, Scientific ; Technical Department, Barcelona, Spain ; Universit\" a tsklinikum Erlangen, Department of Radiology of the Uniklinikum Erlangen (UKER), Erlangen, Germany ; University Hospital Erlangen, Imaging Science Institute, Erlangen, Germany ; ICUBE Laboratory, CNRS UMR-7357, University of Strasbourg, Strasbourg, France ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China ; University of Chinese Academy of Sciences, Beijing, China ; German Cancer Research Center (DKFZ), Medical Image Computing (E230), Heidelberg, Germany ; Hospital de Matar\' o , Matar\' o , Spain ; Hospital de Sant Pau i la Santa Creu, Diagnostic Imaging Department, Barcelona, Spain ; Institut de Recerca Sant Pau - CERCA, Advanced Medical Imaging, Artificial Intelligence ; Imaging-Guided Therapy Research Group, Barcelona, Spain ; TECNALIA, Basque Research
专题命中 Agent评测 :planning(abstract)
AI总结 本文提出PDACVI基准,通过密集标注数据集评估胰腺癌血管侵袭,揭示传统体积重叠指标的局限性,强调概率模型在术前决策中的重要性。
LLM偏见
机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) ; Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)
专题命中 其他Agent :agentic(abstract,abstract_cn);分类 cs.AI
AI总结 本文研究了基于Transformer的生成推荐系统中四种系统性偏见机制,指出其可能影响长期多样性和用户选择,强调需关注运营风险而非仅依赖性能指标。