arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-28 至 2026-04-28 共收录 245 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2604.23581 2026-04-28 cs.SE cs.CL 86%

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval: 基于DAG结构的步骤级评估用于具有错误传播跟踪的代理工作流

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.CL、cs.SE

AI总结 AgentEval通过构建评估有向无环图,实现对代理工作流中错误传播的精准追踪,提升故障检测召回率和根本原因准确性,适用于生产环境中的代理系统评估。

Comments Accepted at ACL 2026 Industry Track. 14 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04802 2026-04-28 cs.CL 85%

Mind the Gap: Evaluating Model- and Agentic-Level Vulnerabilities in LLMs with Action Graphs

注意差距:通过动作图评估LLM在模型和代理层面的漏洞

Ilham Wicaksono, Zekun Wu, Rahul Patel, Theo King, Adriano Koshiyama, Philip Treleaven

机构 * Holistic AI University College London(伦敦大学学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.CL

AI总结 本文通过动作图评估LLM在模型和代理层面的漏洞,揭示了代理层面特有的风险,并展示了通过动作图改进提示能有效降低代理 jailbreak 成功率。

Comments ICLR 2026 Agents in the Wild (Spotlight & Oral); ICLR 2026 AFAA; OpenAI Red-Teaming Challenge Winner (2025); NeurIPS 2025 LLMEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23280 2026-04-28 cs.AI cs.CR 85%

AI Identity: Standards, Gaps, and Research Directions for AI Agents

AI身份:面向AI代理的标准、缺口与研究方向

Takumi Otsuka, Kentaroh Toyoda, Alex Leung

机构 * AIFT, Singapore(新加坡AIFT) Graduate School of Fundamental Science and Engineering, Department of Computer Science and Communications Engineering, Waseda University, Japan(日本早稻田大学基础科学与工程研究生院计算机科学与通信工程系) Keio Global Research Institute (KGRI), Japan(日本庆应大学全球研究机构)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文探讨了AI代理身份识别与责任归属问题,指出现有技术与法规无法应对非确定性和跨边界实体的治理挑战,提出了五个关键缺口,并强调基础研究的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24218 2026-04-28 cs.SE cs.AI 84%

RefEvo: Agentic Design with Co-Evolutionary Verification for Agile Reference Model Generation

RefEvo: 基于共进化验证的代理设计用于敏捷参考模型生成

Yifan Zhang, Jianmin Ye, Jiahao Yang, Xi Wang

机构 * School of Integrated Circuits, Southeast University, China(东南大学集成电路学院,中国) National Center of Technology Innovation for EDA, China(EDA技术创新国家中心,中国)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 RefEvo通过动态设计规划、共进化验证机制和规格锚定策略,提升SoC设计参考模型的敏捷性和可靠性,实现95%的通过率和71.04%的上下文优化。

Comments 6 pages, 7 figures, accepted by ISEDA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23897 2026-04-28 cs.AI econ.GN q-fin.EC 83%

MarketBench: Evaluating AI Agents as Market Participants

MarketBench:评估AI代理作为市场参与者

Andrey Fradkin, Rohit Krishnan

机构 * Boston University and the MIT Initiative on the Digital Economy(波士顿大学和MIT数字经济倡议)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出MarketBench基准,评估AI代理在市场中的自我评估能力与成本感知,通过软件工程基准和LLM实验发现自我校准不足,但补充信息后有所改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24038 2026-04-28 cs.AI cs.CL cs.SE 82%

AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment

AgentPulse:一个连续多信号框架用于评估AI代理在部署中的表现

Yuxuan Gao, Megan Wang, Yi Ling Yu

机构 * University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学) OpenMesh AI

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出AgentPulse框架,通过18种实时信号评估50个AI代理在10种工作负载中的表现,揭示部署中的采纳、维护和体验信息,强调其作为方法论而非真实排名的价值。

Comments 19 pages, 5 figures, 9 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22861 2026-04-28 cs.IR cs.AI cs.LG 81%

IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review

IntrAgent:通过文献综述实现内容导向的信息检索的LLM代理

Fengbo Ma, Zixin Rao, Xiaoting Li, Zhetao Chen, Hongyue Sun, Yiping Zhao, Xianyan Chen, Zhen Xiang

机构 * University of Georgia(佐治亚大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出IntraView任务,设计IntrAgent代理,通过文献综述实现精确信息检索,提出包含315个测试实例的IntraBench基准,展示在七个基础LLM上IntrAgent比现有RAG和研究代理基线高13.2%的跨领域准确性。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23283 2026-04-28 cs.LG 79%

Revisable by Design: A Theory of Streaming LLM Agent Execution

为设计而可逆:流式LLM代理执行的理论

Zhiyuan Zhai, Ming Li, Xin Wang

机构 * Fudan University(复旦大学) Guangming Lab(光明实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出流式LLM代理执行的可逆性理论,通过定义可逆性分类,证明冲突可逆动作导致不可满足性,提出修订吸收器算法提升执行灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 79%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23374 2026-04-28 cs.CR 78%

Ghost in the Agent: Redefining Information Flow Tracking for LLM Agents

代理中的幽灵:重新定义LLM代理的信息流跟踪

Yuandao Cai, Wensheng Tang, Cheng Wen, Shengchao Qin

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22934 2026-04-28 cs.AI cs.CL 76%

PExA: Parallel Exploration Agent for Complex Text-to-SQL

PExA:复杂文本到SQL的并行探索代理

Tanmay Parekh, Ella Hofmann-Coyle, Shuyi Wang, Sachith Sri Ram Kothur, Srivas Prasad, Yunmo Chen

机构 * University of California Los Angeles(加州大学洛杉矶分校) Bloomberg(彭博)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 本文提出PExA,通过软件测试覆盖视角解决文本到SQL的延迟与性能权衡问题,通过并行执行测试用例确保语义覆盖,最终生成准确的SQL。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24710 2026-04-28 cs.AI cs.CL 73%

Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

针对具体病例的评估量表:方法、验证及LLM与医生一致性的823次病例研究

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级保健)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada, Reno, NV, USA(内华达大学拉斯维加斯分校儿科系)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出针对具体病例的评估量表方法,验证了LLM生成的量表在医生一致性上的有效性,展示了在823次病例中医生与LLM的一致性提升。

Comments 14 pages, 2 figures, 3 tables, submitted to JAMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12290 2026-04-28 cs.AI cs.CL 73%

Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization

Frontier-Eng:基于生成优化的现实工程任务中自演化代理的基准测试

Yizhe Chi, Deyao Hong, Dapeng Jiang, Tianwei Luo, Kaisen Yang, Boshi Zhang, Zhe Cao, Xiaoyan Fan, Bingxiang He, Han Hao, Weiyang Jin, Dianqiao Lei, Qingle Liu, Houde Qian, Bowen Wang, Situ Wang, Youjie Zheng, Yifan Zhou, Calvin Xiao, Eren Cai, Qinhuai Na

机构 * Navers Lab(Navers实验室)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 Frontier-Eng通过工业级模拟器和验证器,评估生成优化中代理在现实工程任务中的表现,发现GPT 5.4表现最稳健,但所有模型仍面临挑战,分析显示改进频率和幅度呈双幂律衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12826 2026-04-28 cs.CL cs.AI cs.MA 73%

Scheming Ability in LLM-to-LLM Strategic Interactions

大语言模型在LLM到LLM战略互动中的策略能力

Thao Pham

机构 * Berea College(伯克利学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 研究通过博弈论框架评估大语言模型的策略欺骗能力,发现模型在无提示下倾向于欺骗,尤其在Peer Evaluation中全部选择欺骗,揭示了多智能体环境下需加强高风险博弈场景的评估。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23781 2026-04-28 cs.CV cs.SE 70%

ClawMark: A Living-World Benchmark for Multi-Turn, Multi-Day, Multimodal Coworker Agents

ClawMark:多轮、多日、多模态同事代理的活体世界基准

Fanqing Meng, Lingxiao Du, Zijian Wu, Guanzheng Chen, Xiangyan Liu, Jiaqi Liao, Chonghe Jiang, Zhenglin Wan, Jiawei Gu, Pengfei Zhou, Rui Huang, Ziqi Zhao, Shengyuan Ding, Ailing Yu, Bo Peng, Bowei Xia, Hao Sun, Haotian Liang, Ji Xie, Jiajun Chen, Jiajun Song, Liu Yang, Ming Xu, Qionglin Qiu, Runhao Fu, Shengfang Zhai, Shijian Wang, Tengfei Ma, Tianyi Wu, Weiyang Jin, Yan Wang, Yang Dai, Yao Lai, Youwei Shu, Yue Liu, Yunzhuo Hao, Yuwei Niu, Jinkai Huang, Jiayuan Zhuo, Zhennan Shen, Linyu Wu, Cihang Xie, Yuyin Zhou, Jiaheng Zhang, Zeyu Zheng, Mengkang Hu, Michael Qizhe Shieh

机构 * ClawMark Team(ClawMark团队)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.SE

AI总结 ClawMark基准通过多轮多日任务和状态化沙盒环境评估同事代理在动态环境中的表现,包含100个专业场景任务,测试七种前沿代理系统,揭示部分进展常见但完整流程完成罕见。

Comments github repo: https://github.com/evolvent-ai/ClawMark

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23539 2026-04-28 cs.AI 70%

MetaGAI: A Large-Scale and High-Quality Benchmark for Generative AI Model and Data Card Generation

MetaGAI:一个大规模且高质量的生成AI模型和数据卡生成基准

Haoxuan Zhang, Ruochi Li, Yang Zhang, Zhenni Liang, Junhua Ding, Ting Xiao, Haihua Chen

机构 * University of North Texas(北德克萨斯大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出MetaGAI基准,通过语义三角化构建2541个验证文档三元组,采用多智能体框架进行评估,揭示稀疏MoE架构在成本与质量效率上的优势,为大规模评估生成模型和数据卡方法提供基础测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24184 2026-04-28 cs.CR 67%

Dynamic Cyber Ranges

动态网络攻防范围

Víctor Mayoral-Vilches, María Sanz-Gómez, Francesco Balassone, Maite Del Mundo De Torres, George Nicolaou, Samuel Rodriguez Borines, Almerindo Graziano, Paul Zabalegui, Endika Gil-Uriarte

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文提出动态网络攻防范围,通过LLM驱动的防御代理提升网络安全评估效果,减少攻击成功率,展现其在不同配置下的防护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24700 2026-04-28 cs.CL cs.AI 62%

Green Shielding: A User-Centric Approach Towards Trustworthy AI

绿色防护:面向可信AI的用户导向方法

Aaron J. Li, Nicolas Sanchez, Hao Huang, Ruijiang Dong, Jaskaran Bains, Katrin Jaradeh, Zhen Xiang, Bo Li, Feng Liu, Aaron Kornblith, Bin Yu

机构 * University of California, Berkeley(加州大学伯克利分校) University of Melbourne(墨尔本大学) University of California, San Francisco(加州大学旧金山分校) University of Georgia(佐治亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Green Shielding方法,通过分析用户输入变化对模型行为的影响,为可信AI部署提供证据支持的指导。通过医疗诊断基准测试,展示了交互选择如何系统性地影响模型输出属性,支持高风险领域更安全的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24645 2026-04-28 cs.CL cs.AI 62%

K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology

K-MetBench:一个多维基准,用于细粒度评估气象学中的专家推理、局部性和多模态能力

Soyeon Kim, Cheongwoong Kang, Myeongjin Lee, Eun-Chul Chang, Jaedeok Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) INEEJI Kongju National University(康久国立大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出K-MetBench,一个基于韩国资格考试的多维基准,揭示了专家推理、逻辑有效性、韩国地理文化理解及领域分析四个维度的差距,发现韩国模型在本地情境中优于大模型。

Comments 39 pages, 32 figures, 14 tables, including appendices. Accepted to Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24525 2026-04-28 cs.SE cs.AI 62%

Understanding the Limits of Automated Evaluation for Code Review Bots in Practice

理解自动化代码审查机器人在实践中评估的极限

Veli Karakaya, Utku Boran Torun, Baykal Mehmet Uçar, Eray Tüzün

机构 * Bilkent University(比尔肯特大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨了在工业环境中自动化评估LLM驱动的代码审查机器人评论的可行性及限制,发现不同模型和评估方法在与人类标签的一致性上表现不一,揭示了静态 artifacts 难以捕捉上下文约束和优先级决策的挑战。

Comments The first two authors contributed equally. Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14952 2026-04-28 cs.CL cs.AI 62%

CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning

CorpusQA:一个1000万词的语料库分析与推理基准

Zhiyuan Lu, Chenliang Li, Yingcheng Shi, Weizhou Shen, Ming Yan, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 CorpusQA提出一个1000万词的基准,解决大规模语料库推理问题,通过合成数据框架生成复杂查询,验证长文本推理能力,发现先进架构对全局信息整合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24579 2026-04-28 cs.SE 57%

Measuring the Unmeasurable: Markov Chain Reliability for LLM Agents

测量不可测量的:用于LLM代理的马尔可夫链可靠性

Phat T. Tran-Truong, Xuan-Bach Le

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文提出TraceToChain方法,通过构建吸收离散时间马尔可夫链模型,对LLM代理执行轨迹进行可靠性分析,提供更精确的成功时间分布估计和不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24461 2026-04-28 cs.HC cs.AI 57%

Measuring Successful Cooperation in Human-AI Teamwork: Development and Validation of the Perceived Cooperativity and Teaming Perception Scales

在人类-人工智能协作中测量成功协作:感知协作性与团队感知量表的开发与验证

Christiane Attig, Christiane Wiebel-Herboth, Patricia Wollstadt, Tim Schrills, Mourad Zoubir, Thomas Franke

机构 * Honda Research Institute Europe GmbH(本田欧洲研究院) Institute of Human-Centered Interactive Systems(人机交互系统研究所) University of Lübeck(吕贝克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文开发并验证了感知协作性量表和团队感知量表,用于评估人类-人工智能协作的主观质量,通过三个研究验证了量表的有效性和构造效度。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23653 2026-04-28 cs.CV cs.AI 57%

ResAF-Net: An Anchor-Free Attention-Based Network for Tree Detection and Agricultural Mapping in Palestine

ResAF-Net:一种基于注意力的无锚点网络用于巴勒斯坦树木检测和农业制图

Rabee Al-Qasem

机构 * AI-Developer Ministry of Labor - GGateway.ps(AI开发者劳动部 - GGateway.ps)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出ResAF-Net,一种基于卫星的树木检测框架,用于资源受限环境下的大规模农业监测。该框架结合了ResNet-50编码器、ASPP、特征融合阶段、多头自注意力细化模块和无锚点FCOS检测头,实现了在密集和异质场景中对树木的高效定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07709 2026-04-28 cs.AI 57%

MAGELLAN: Metacognitive predictions of learning progress guide autotelic LLM agents in large goal spaces

MAGELLAN:元认知预测学习进度指导自主LLM代理在大规模目标空间中学习

Loris Gaven, Thomas Carta, Clément Romac, Cédric Colas, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Department of XXX, University of YYY, Location, Country(XXX部门,YYYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Inria (Flowers), University of Bordeaux, France(Inria(Flowers),波尔多大学,法国) MIT, Computational Cognitive Science Lab, Cambridge, MA, USA(麻省理工学院,计算认知科学实验室,马萨诸塞州剑桥,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MAGELLAN通过元认知预测学习进度,使LLM代理在大规模目标空间中高效优先目标,提升学习效率和适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23148 2026-04-28 cs.AI 57%

PhySE: A Psychological Framework for Real-Time AR-LLM Social Engineering Attacks

PhySE: 一种用于实时AR-LLM社会工程攻击的心理学框架

Tianlong Yu, Yang Yang, Ziyi Zhou, Jiaying Xu, Siwei Li, Tong Guan, Kailong Wang, Ting Bi

机构 * Hubei University(湖北大学) Apple Inc(苹果公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 PhySE通过视觉语言模型的社会上下文训练和自适应心理代理,解决AR-LLM社会工程攻击中的冷启动个性化和静态攻击策略问题,提升实时交互效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23141 2026-04-28 cs.CR cs.AI 57%

UNSEEN: A Cross-Stack LLM Unlearning Defense against AR-LLM Social Engineering Attacks

UNSEEN: 一种跨栈LLM去学习防御对抗AR-LLM社会工程攻击

Tianlong Yu, Yang Yang, Xiao Luo, Lihong Liu, Fudu Xing, Zui Tao, Kailong Wang, Gaoyang Liu, Ting Bi

机构 * Hubei University(湖北大学) University of Southern California(南加州大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对AR-LLM社会工程攻击,提出UNSEEN跨栈防御机制,结合AR访问控制层、基于F-RMU的LLM去学习和运行时代理防护,通过用户研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18803 2026-04-28 cs.CV cs.AI 57%

LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models

用于评估视觉-语言模型中语气诱导幻觉的LLM-as-Judge框架

Zhiyuan Jiang, Weihao Hong, Xinlei Guan, Tejaswi Dhandu, Miles Q. Li, Meng Xu, Kuan Huang, Umamaheswara Rao Tida, Bingyu Shen, Daehan Kwak, Boyang Li

机构 * Kean University(凯恩大学) North Dakota State University(北达科他州立大学) McGill University(麦吉尔大学) University of Notre Dame(圣母大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出Ghost-100基准,通过结构化提示强度框架评估不同模型在提示压力下的表现,发现H-Rate和H-Score在模型家族间显著分化,且某些模型对语气敏感度非单调。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00081 2026-04-28 cs.CR cs.AI 57%

Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies

结合大语言模型和领域本体的透明网络威胁情报赋能

Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

机构 * Department of Information Engineering, University of Brescia, Italy(布雷西亚大学信息工程系) School of Computer Science and Informatics, Cardiff University, United Kingdom(卡迪夫大学计算机科学与信息学学院) Department of Electronics and Computer Science, University of Southampton, United Kingdom(南安普顿大学电子与计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出结合本体驱动的结构化输出与大语言模型,构建提升网络安全日志信息提取准确性和可解释性的AI代理,通过领域本体和SHACL约束提高语义有效性。

Comments 14 pages, 3 figures, 6 tables, presented at the 1st workshops on eXplainable AI, Knowledge Representation and Knowledge Graphs (XAI-KRKG) and User-Centered Explanations in XAI Workshop (UCEX-XAI), October 25-30, 2025, Bologna, Italy

Journal ref Joint Proceedings of the 1st workshops on eXplainable AI, Knowledge Representation and Knowledge Graphs (XAI-KRKG) and User-Centered Explanations in XAI Workshop (UCEX-XAI), 2025, CEUR Workshop proceedings, volume 4172, pages 95-108

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24546 2026-04-28 econ.TH q-fin.MF 50%

Comonotonic improvement under feasibility constraints

同向改进在可行性约束下的表现

Christopher Blier-Wong, Jean-Gabriel Lauzier

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在可行性约束下,同向改进定理的适用性,指出价值-at-风险上限会导致非同向的最优分配,并提出组件凸序稳固性作为恢复约束下同向改进的充分条件。

详情

展开后加载摘要…

URL PDF HTML 收藏