AI Guardrail Survival under Single-Cycle Agentic Self-Summarization
单循环智能体自摘要下的AI安全护栏存续性
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本研究探究单循环智能体自摘要中安全规则的丢失机制,发现仅检查规则文本存在性的审计不可靠,需结合外部真实值检测,还指出仅靠LLM评判标签会反转评估结论。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
单循环智能体自摘要下的AI安全护栏存续性
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本研究探究单循环智能体自摘要中安全规则的丢失机制,发现仅检查规则文本存在性的审计不可靠,需结合外部真实值检测,还指出仅靠LLM评判标签会反转评估结论。
HexEval:一种用于多维学者评估的证据驱动六边形框架
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出HexEval框架,将学者评估构建为证据驱动的推理问题,通过内在与外部两个互补证据层评估,实现可解释可审计的AI辅助学者评估,同时指出公开学术数据的局限性。
Comments remove copyright information
Self-Harness:自我改进的操控框架
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 提出Self-Harness范式,让LLM智能体通过弱点挖掘、框架提议和验证迭代改进自身操控框架,在Terminal-Bench-2.0上使三种模型的通过率分别提升21.4%、14.3%和14.2%。
基于熵的代码对抗翻译用于真实仓库迁移
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 针对LLM迁移仓库难达可运行状态的问题,提出多智能体框架ECAT,引入A2H-RepoBench基准,迁移质量达74.7%且优于现有方法。
ForestBench:用于评估多智能体协作的统一图框架
机构 * Southwest University(西南大学) ; Tencent(腾讯) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对多智能体系统异构轨迹评估的问题,提出ForestBench框架,将MAS轨迹映射为统一协作图,筛选844个查询并预计算参考图,可快速评估MAS协作。
学习对程序分析生成的漏洞报告进行分类:针对Node.js的实证研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Amazon Web Services(亚马逊网络服务)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文针对Node.js,基于程序分析工具数据训练机器学习模型,实现漏洞报告优先级排序,最优模型在召回90%可利用报告时可排除75%良性报告,具备实用潜力。
Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). The version of record is available at https://doi.org/10.1145/3832783.3837503
评估智能体系统对抗恶意诱导危害的鲁棒性
机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 该研究提出智能体系统危害分类法与BAD-ACTS基准,评估LLM类智能体对抗恶意诱导的鲁棒性,发现其攻击成功率达40%-90%,并提出零样本消息监控防御方法。
SenWorld:用于生成富含上下文评估数据的数字孪生模拟
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对智能手机助手评估缺富含上下文且隐私安全数据的问题,提出SenWorld数字孪生模拟方法,通过真实数据构建场景生成评估数据,经实验验证其在数据分布等方面与真实用户基准匹配,能暴露助手故障且隐私安全。
RepoProbe:基于清单的架构感知代码仓库理解基准测试
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究推出RepoProbe基准,采用基于清单的验证协议,发现SOTA LLMs存在编辑偏差,且高清晰度与技术正确性间有差距,提升了代码仓库理解评估的可靠性。
Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Replication package: https://github.com/Tencent-Hunyuan/RepoProbe
RESPClinBench:呼吸专科医疗中的多模态临床决策与纵向疾病管理基准测试
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Macau University of Science and Technology(澳门科技大学) ; First Affiliated Hospital of Guangzhou Medical University(广州医科大学附属第一医院) ; Guangzhou Institute of Respiratory Health(广州呼吸健康研究院)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究开发了呼吸专科多模态临床决策与纵向疾病管理基准RESPClinBench,在两个数据集上评估7种大模型,识别模型在肺结节评估和COPD管理的局限,为模型选择提供临床依据。
ConlangBench:通过多样人造语言探索大语言模型的语言知识与学习
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究人员提出首个针对21种现有人造语言的大规模基准ConlangBench,收集大量平行句对和词汇条目,通过双向翻译实验发现模型在后天人造语言上表现更好,且可学习8种拥有足够语料库的人造语言,为人造语言探索LLMs低资源语言学习提供独特试验台。
Comments 29 pages, 12 figures, 17 tables
LLMs难以衡量区分不同水平学生的题目:阅读理解评估中题目区分度研究
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; University of Maryland(马里兰大学) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL
AI总结 本研究评估42个LLM在零样本设置下预测题目区分度的能力,发现直接预测与人类校准的区分度相关性弱(最高Spearman 0.152),基于CTT的响应校准相关性有限(0.241),表明LLM尚不能可靠捕捉题目区分度。
注意用户模拟中的Sim2Real差距以实现代理任务
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 研究发现基于LLM的用户模拟器在代理任务中存在Sim2Real差距,表现出过度合作和缺乏真实反馈,需通过人类验证提升模拟真实性。
Comments COLM 2026
超越单一评判者:用于生成式UI评估的社会角色面板模拟
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对GenUI评估问题,提出三阶段ESPP方法,通过多样化角色面板提升评估保真度,揭示用户子群体的结构性分歧,代码已公开。
面向现实世界的编译器助手
机构 * Southern University of Science and Technology(南方科技大学) ; ETH Zurich(苏黎世联邦理工学院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出llvm-autofix,首个专为修复编译器bug设计的代理工具,通过专用工具和基准测试展示其在处理复杂编译器bug时的性能优势。
从推理中获取结构,从搜索中获取数值:本地部署的开放大语言模型作为耦合MIMO控制器整定的结构先验
机构 * Jinling Institute of Technology(金陵科技学院) ; College of Water Resources and Civil Engineering, China Agricultural University(中国农业大学水利与土木工程学院) ; Zhejiang University(浙江大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对强耦合MIMO过程,提出利用本地部署的开源大语言模型作为结构先验,通过推理耦合关系提出非对称结构,结合经典优化器实现样本高效且可解释的控制器整定。
Comments 17 pages, 7 figures, 6 tables. Substantially revised benchmark, analysis, and presentation
CRMWeaver:通过智能体强化学习与共享记忆构建强大的商业智能体
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Southeast University(东南大学) ; University of Montreal(蒙特利尔大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);language agent(abstract);分类 cs.CL
AI总结 针对商业智能体面临的数据复杂、任务异质问题,提出CRMWeaver方法,通过智能体强化学习训练与共享记忆机制提升性能,在CRMArena-Pro数据集的B2B、B2C场景中取得竞争力结果,实用价值显著。
测量所关心的:使用情境判断测试对AI进行心理测量评估
机构 * Cedar City PD
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文通过情境判断测试和多维项目反应理论评估AI行为一致性,发现基于角色的AI行为稳定且可预测,提出更可靠的评估方法。
Comments 100 pages. Code, and link to datasets here: https://github.com/amir-abdullah-thoughtworks/psychometrics_for_LLMs
机器学习工程笔记本的自动化现代化进程以实现可重现性
机构 * University of Waterloo(滑铁卢大学) ; Google(谷歌公司)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 本文提出MLEModernizer,通过LLM驱动的框架自动化现代化工机器学习工程笔记本,以恢复其在不断变化的环境中的可重现性。
代理图RAG:利用协作AI导航无结构财务数据
机构 * Computational Social Science ETH Zürich(计算社会科学 ETH 瑞士 Zurich) ; Computational Social Science, ETH Complexity Science Hub Zürich(计算社会科学 ETH 复杂性科学中心 Zurich) ; ETH Complexity Science Hub Zürich, Switzerland(ETH 复杂性科学中心 Zurich 瑞士) ; Vienna, Austria(维也纳 奥地利)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本文提出了一种协作代理图RAG框架,用于专家分析商业登记数据。通过构建Neo4j知识图谱,结合确定性节点摄入、LLM提取弱节点以及确定性身份解析和去重,提升了多跳、时间相关和实体中心的查询能力。
SkillSieve:一种用于检测恶意AI代理技能的分层分流框架
机构 * Department of Earth Science and Engineering(地球科学与工程系) ; Imperial College London(帝国理工学院伦敦分校) ; Department of Computer Science(计算机科学系) ; University College London(伦敦大学学院) ; Lingban Technology Co., Ltd.(灵伴科技有限公司) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 提出SkillSieve三层检测框架,通过启发式评分、LLM子任务分析和多LLM陪审团辩论,高效检测恶意AI代理技能,在390个技能基准上达到F1=0.920。
Comments 10 pages, 2 figures, 6 tables
享受你的对话:一个用于多轮对话的以人为本基准,具有解耦的用户模拟、目标建模和评判
机构 * SenseTime Research(商汤科技研究院) ; University of Science and Technology of China(中国科学技术大学) ; Tsinghua University(清华大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究提出EYT-Bench基准,通过三方解耦设计评估大语言模型多轮对话能力,引入新指标,发现先进模型在主观维度相近但客观意图跟踪差异大,推理可提升客观跟踪,角色格式影响轨迹分布,且热身效应稳健。
对时间、空间和语义规避的自主代理进行基准测试
机构 * Tsinghua University(清华大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本文提出了一种针对基于大语言模型(LLM)的代理系统的多维规避框架,通过引入时间、空间和语义三种隐蔽攻击向量,系统地量化了这些威胁,并展示了其在实际威胁场景中的效果,揭示了现有自主代理系统在架构层面的系统性漏洞。
Comments 18 pages, 12 figures, 8 tables. Code and data available at https://github.com/antgroup/Agent3Sigma-Stage
智能体需要语义元数据吗?智能体数据检索的比较研究
机构 * Google(谷歌)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 通过对比基线智能体(搜索开放网络)与语义智能体(利用schema.org元数据)在数据检索中的表现,发现语义元数据在检索可操作数据时精度更高(整体精度高65.7%),而基线智能体覆盖更广但存在“最后一英里效用”失败。
跨越电路设计的最后一英里:PostEDA-Bench,一个用于PPA收敛和DRC修复的分层基准
机构 * University of Minnesota(明尼苏达大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 提出PostEDA-Bench分层基准,包含145个任务,覆盖DRC修复和PPA优化,实验发现现有LLM代理在复杂DRC推理和多目标PPA优化上表现不佳,视觉增强可提升DRC性能,权衡推理是PPA多目标瓶颈。
眼泪还是欢呼?通过文化诱发的差异情感反应基准测试LLMs
机构 * Hefei University of Technology(合肥工业大学) ; Monash University(墨尔本大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出CEDAR基准,通过文化诱发的差异情感反应评估LLMs,揭示语言一致性和文化契合度之间的脱节,展示文化根植的情感理解仍是模型的重大挑战。
Comments ACL 2026 SAC Highlight
AgentCompass:用于智能体能力的统一评估基础设施
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对大语言模型演变成自主智能体后评估基础设施分散的问题,提出AgentCompass,通过围绕三个独立组件组织评估过程,具备容错异步运行时和轨迹分析工具,支持多基准测试,为智能体研究提供可扩展、可重复的基础设施。
代理心理测量:在代理编码基准中的任务级性能预测
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Fulcrum ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 本文提出了一种基于任务级性能预测的代理编码基准评估框架,结合IRT理论与任务特征,区分LLM和支架能力,以更准确预测未见基准和组合的性能。
DEER:用于评估深度研究代理在专家报告生成上的基准
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 DEER是一个用于评估深度研究代理在专家报告生成中性能的基准,通过系统化的评估标准和主张验证架构,提升报告质量和逻辑完整性。
Comments ICML 2026 (45 pages, 12 figures, 25 tables, 129 references
一个 orchestrated AI agent 系统的一般均衡理论
专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出了一种基于一般均衡理论的AI代理系统模型,通过集中编排实现系统福利最大化,并证明了均衡存在性和收敛性。