arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 186 篇

2506.13743 2026-04-21 cs.CL cs.IR 70%

LTRR: Learning To Rank Retrievers for LLMs

基于LLM的检索排名学习检索器

To Eun Kim, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title_cn);分类 cs.CL

AI总结 本文提出LTRR框架,通过动态选择检索器提升RAG性能,实验表明基于路由的RAG在多种基准上优于单一检索器,尤其在使用AC目标和成对排名时效果显著。

Comments SIGIR 2026; SIGIR 2025 LiveRAG Spotlight; Code: https://github.com/kimdanny/Starlight-LiveRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17871 2026-04-21 cs.HC 67%

Design and Evaluation of a Culturally Adapted Multimodal Virtual Agent for PTSD Screening

面向PTSD筛查的跨文化多模态虚拟代理设计与评估

Cengiz Ozel, Waleed Nadeem, Samuel Potter, Yahya Bokhari, Bdour Alwuqaysi, Wejdan Alotaibi, Rahaf Fahad Alnufaie, Sabri Boughorbel, Abdulrhman Aljouie, Rakan Altasan, Ehsan Hoque

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文设计并评估了适用于军事医疗场景的跨文化多模态虚拟代理Molhim,通过可配置的对话流程实现特定目的的交互,支持结构化多轮对话和自动会后分析,集成PCL-5量表进行PTSD筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10611 2026-04-21 cs.CR 67%

DuCodeMark: Dual-Purpose Code Dataset Watermarking via Style-Aware Watermark-Poison Design

DuCodeMark: 通过风格感知的水印-毒药设计实现双用途代码数据集水印

Yuchen Chen, Yuan Xiao, Chunrong Fang, Zhenyu Chen, Baowen Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出DuCodeMark,一种双用途代码数据集水印方法,通过抽象语法树和语言特定的风格转换,实现源码任务和反编译任务的通用性,同时增强对水印移除和毒药攻击的鲁棒性。

Comments Accepted to the 34rd ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07143 2026-04-21 cs.CV 67%

Are We Using the Right Benchmark: An Evaluation Framework for Visual Token Compression Methods

我们是否在使用正确的基准:视觉令牌压缩方法的评估框架

Chenfei Liao, Wensong Wang, Zichen Wen, Xu Zheng, Yiyu Wang, Haocong He, Yuanhuiyi Lyu, Lutao Jiang, Xin Zou, Yuqian Fu, Bin Ren, Linfeng Zhang, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) MBZUAI

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过实验证明现有基准含大量无关样本, downsampling能有效过滤样本,提出VTC-Bench框架以更公平评估视觉令牌压缩方法。

Comments Accepted by ACL2026 Main. Code: https://github.com/Chenfei-Liao/VTC-Bench; Project Page: https://chenfei-liao.github.io/VTC-Bench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17820 2026-04-21 cs.SE 67%

Raven: Rethinking Automated Assessment for Scratch Programs via Video-Grounded Evaluation

Raven: 通过视频基础评估重新思考Scratch程序的自动化评估

Donglin Li, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Raven通过视频生成规则替代传统断言,实现Scratch程序的自动化评估,提升评估的一致性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08280 2026-04-21 q-bio.GN 67%

ClusterChirp: Scalable Interactive Exploration of Omics Data with Natural Language-Guided Analysis

ClusterChirp: 基于自然语言引导分析的高通量数据可扩展交互探索

Osho Rawal, Rex Lu, Edgar Gonzalez-Kozlova, Sacha Gnjatic, Zeynep H. Gümüş

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 ClusterChirp通过自然语言接口和GPU加速技术,实现大规模多组学数据的高效交互探索,支持实时聚类、多指标排序和功能富集分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17092 2026-04-21 cs.SE 67%

AI Observability for Developer Productivity Tools: Bridging Cost Awareness and Code Quality

AI可观性用于开发者生产力工具:弥合成本意识与代码质量

Happy Bhati, Twinkll Sisodia

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出一种统一的AI可观性方法,通过实时跟踪token、配置模型定价库、响应验证和成本分析,构建单一仪表板,提升开发者生产力工具的成本与代码质量理解。

Comments 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16314 2026-04-21 cs.SE 67%

Software Self-Extension with SelfEvolve: an Agentic Architecture for Runtime Code Generation

软件自我扩展与SelfEvolve:一种用于运行时代码生成的代理架构

Md Asif Iqbal Fahim, Oluwadamilola Adebayo, Alessio Ferrari

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出SelfEvolve架构,通过自主生成和整合新功能实现运行时自我扩展,展示其在11个任务中达到92.7%的准确率,优于现有基线方法。

Comments 6 pages, 1 figure, accepted at 21st International Conference on Software Engineering for Adaptive and Self-Managing Systems, April 13--14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23885 2026-04-21 cs.CV 67%

Towards Real-World Document Parsing via Realistic Scene Synthesis and Document-Aware Training

通过现实场景合成和文档感知训练实现真实世界文档解析

Gengluo Li, Pengyuan Lyu, Chengquan Zhang, Huawen Shen, Liang Wu, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tencent(腾讯) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出数据训练协同框架,通过现实场景合成和文档感知训练提升文档解析的准确性和鲁棒性,构建了Wild-OmniDocBench基准,并在1B参数MLLM中实现了跨扫描/数字和真实世界场景的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03065 2026-04-21 eess.AS 67%

Towards Fine-Grained and Multi-Granular Contrastive Language-Speech Pre-training

迈向细粒度和多粒度对比语言-语音预训练

Yifan Yang, Bing Han, Hui Wang, Wei Wang, Ziyang Ma, Long Zhou, Zengrui Jin, Guanrou Yang, Tianrui Wang, Xu Tan, Xie Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出FCaps数据集,通过端到端流程生成细粒度语音描述,构建CLSP模型实现细粒度和多粒度语音-语言表示,实验显示其在多种任务中表现优异。

Comments Accepted in ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18490 2026-04-21 cs.CL cs.AI 62%

LQM: Linguistically Motivated Multidimensional Quality Metrics for Machine Translation

LQM:基于语言学的多维质量度量用于机器翻译

Samar M. Magdy, Fakhraddin Alwajih, Abdellah El Mekki, Wesam El-Sayed, Muhammad Abdul-Mageed

机构 * The University of British Columbia(不列颠哥伦比亚大学) Minia University(米尼亚大学) Canada Research Chair in NLP and ML(加拿大自然语言处理与机器学习研究主席)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出LQM,一种基于语言学的多维质量度量框架,用于评估机器翻译质量,通过六个语言学层面分析翻译错误,并在阿拉伯语多方言上进行实验,提供标注数据和自动指标。

Comments Accepted to ACL 2026; resources available at https://github.com/UBC-NLP/LQM_MT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18257 2026-04-21 cs.IR cs.AI cs.CL 62%

DocQAC: Adaptive Trie-Guided Decoding for Effective In-Document Query Auto-Completion

DocQAC:适应性前缀引导解码用于高效的文档内查询自动补全

Rahul Mehta, Kavin R, Indrajit Pal, Tushar Abhishek, Pawan Goyal, Manish Gupta

机构 * Microsoft Corporation(微软公司) Indian Institute of Technology(印度理工学院) Indian Institute of Technology Kharagpur(印度理工学院卡拉格浦)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 DocQAC通过适应性前缀引导解码框架提升长文档内的搜索效率,利用文档特定上下文增强查询精度,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16272 2026-04-21 cs.CV cs.AI cs.CL 62%

VEFX-Bench: A Holistic Benchmark for Generic Video Editing and Visual Effects

VEFX-Bench:一个全面的通用视频编辑和视觉特效基准测试

Xiangbo Gao, Sicong Jiang, Bangya Liu, Xinghao Chen, Minglai Yang, Siyuan Yang, Mingyang Wu, Jiongze Yu, Qi Zheng, Haozhi Wang, Jiayi Zhang, Jie Yang, Zihan Wang, Qing Yin, Zhengzhong Tu

机构 * Texas A\&M University(德克萨斯大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VEFX-Bench,基于VEFX-Dataset构建,用于标准化比较视频编辑系统,通过VEFX-Reward模型提升评估准确性,揭示当前模型在视觉合理性、指令遵循和编辑局部性方面的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11108 2026-04-21 cs.CL cs.AI 62%

Explanation Bias is a Product: Revealing the Hidden Lexical and Position Preferences in Post-Hoc Feature Attribution

解释偏差是产物:揭示后验特征归因中的隐藏词汇和位置偏好

Jonathan Kamp, Roos Bakker, Dominique Blok

机构 * Computational Linguistics and Text Mining Lab, Vrije Universiteit Amsterdam(计算语言学与文本挖掘实验室,荷兰自由大学) TNO–The Netherlands Organization for Applied Scientific Research, The Hague(荷兰应用科学研究院(TNO),海牙) Leiden University Centre for Linguistics (LUCL), Leiden University, Leiden(莱顿大学语言中心(LUCL),莱顿大学,莱顿)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过构建无模型和方法依赖的评估框架,系统评估了两种transformer模型的词汇和位置偏差,发现模型在词汇偏差和位置偏差之间存在权衡,并发现异常解释更可能带有偏差。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13464 2026-04-21 cs.CL cs.AI 62%

Estimating Commonsense Plausibility through Semantic Shifts

通过语义转变估计常识可信度

Wanqing Cui, Wei Huang, Keping Bi, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Lab of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院网络数据科学与技术重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ComPaSS框架,通过测量在添加常识信息时的语义变化来量化常识可信度,验证了判别方法在细粒度常识评估中的优势,并展示了视觉语言模型在结合ComPaSS后的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17411 2026-04-21 cs.CL cs.AI 62%

DuConTE: Dual-Granularity Text Encoder with Topology-Constrained Attention for Text-attributed Graphs

DuConTE:具有拓扑约束注意力的双粒度文本编码器用于带文本的图

Lexuan Liang, Tao Zou, Xuxiang Ta, Zekun Qiu

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 DuConTE通过双粒度编码和拓扑约束注意力,提升带文本图的语义表示,实现文本和结构信息的融合,实验表明其在多个基准数据集上表现优异。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17358 2026-04-21 cs.CL cs.AI cs.SD 62%

Still Between Us? Evaluating and Improving Voice Assistant Robustness to Third-Party Interruptions

我们之间仍存在差距吗?评估和改进语音助手对第三方中断的鲁棒性

Dongwook Lee, Eunwoo Song, Che Hyun Lee, Heeseung Kim, Sungroh Yoon

机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Department of EE, Yonsei University(延世大学电子工程系) Department of ECE, SNU(首尔国立大学电子与计算机工程系) Department of AI, University of Seoul(首尔大学人工智能系) AIIS, ASRI, INMC, and ISRC, SNU(首尔国立大学人工智能研究所、亚洲研究机构、智能网络研究中心和智能系统研究所以及首尔国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TPI-Train数据集和TPI-Bench框架,通过引入说话人感知的硬负样本,提升语音模型对第三方中断的鲁棒性,并减少语义捷径学习问题。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16851 2026-04-21 cs.LG cs.AI cs.CV q-bio.BM q-bio.QM 62%

Applications of deep generative models to DNA reaction kinetics and to cryogenic electron microscopy

深度生成模型在DNA反应动力学和低温电子显微镜中的应用

Chenwei Zhang

机构 * The University Of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了深度生成模型在DNA反应动力学和低温电子显微镜分析中的应用,提出ViDa和Struc2mapGAN等方法,提升生物过程的可解释性和结构建模的准确性。

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16437 2026-04-21 eess.SP cs.AI cs.LG 62%

Sampling Matters: The Effect of ECG Frequency on Deep Learning-Based Atrial Fibrillation Detection

采样频率的影响:深度学习在心房颤动检测中的效果

Arjan Mahmuod, Adrian Rod Hammerstad, Muzaffar Yousef, Yngve Sebastian Heill, Jonas L. Isaksen, Jørgen K. Kanters, Pal Halvorsen, Vajira Thambawita

机构 * Oslo Metropolitan University, Norway(奥斯陆 Metropolitan 大学,挪威) University of Copenhagen, Denmark(哥本哈根大学,丹麦) SimulaMet, Norway(SimulaMet,挪威)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了ECG采样频率对深度学习模型性能的影响,发现混合CNN-LSTM模型在中等频率下表现最佳,而CNN模型在高频率下性能下降,表明需考虑采样频率对临床可靠性的影响。

Comments 7 pages, 5 figures, 2 tables. Conference-style paper. Includes reproducible benchmark on PTB-XL using 12-lead 10-second ECGs resampled to 62, 100, 250, and 500 Hz

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18356 2026-04-21 cs.CL 57%

ComPASS: Towards Personalized Agentic Social Support via Tool-Augmented Companionship

ComPASS:通过工具增强的陪伴实现个性化代理社交支持

Zhaopei Huang, Yanfeng Jia, Jiayi Zhao, Xinjie Zhang, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 本文提出ComPASS框架,通过外部工具增强代理能力,构建首个个性化社交支持基准,训练出ComPASS-Qwen模型,提升响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18204 2026-04-21 cs.CL 57%

Hard to Be Heard: Phoneme-Level ASR Analysis of Phonologically Complex, Low-Resource Endangered Languages

难以被听见:对发音复杂、低资源濒危语言的音素级ASR分析

V. S. D. S. Mahesh Akavarapu, Michael Daniel, Gerhard Jäger

机构 * University of Tübingen(图宾根大学) University of Jena(耶拿大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究通过音素级分析,探讨发音复杂且低资源的濒危语言在ASR中的表现,发现数据稀缺性比发音复杂性更影响识别性能。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17976 2026-04-21 cs.CL 57%

ltzGLUE: Luxembourgish General Language Understanding Evaluation

ltzGLUE:卢森堡语通用语言理解评估

Alistair Plum, Felicia Körner, Anne-Marie Lutgen, Laura Bernardy, Fred Philippy, Emilia Milano, Nils Rehlinger, Cédric Lothritz, Tharindu Ranasinghe, Barbara Plank, Christoph Purschke

机构 * University of Luxembourg(卢森堡大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) LIST(卢森堡国家信息技术与智能系统研究所) Lancaster University(兰卡斯特大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出ltzGLUE,首个针对卢森堡语的NLU基准,填补了该语言在NLU领域的评估空白,通过新任务和现有任务评估编码器模型能力。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05489 2026-04-21 cs.AI cs.MA 57%

SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video Generation

SCMAPR: 自校正多智能体提示精修用于复杂场景文本到视频生成

Chengyi Yang, Pengzhen Li, Jiayin Qi, Aimin Zhou, Ji Wu, Ji Liu

机构 * HiThink Research(HiThink研究院) East China Normal University(华东师范大学) Guangzhou University(广州大学) Tsinghua University(清华大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文提出SCMAPR框架,通过多智能体分阶段精修提升复杂场景下的文本到视频生成质量,实验表明在VBench和EvalCrafter等基准上平均得分提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20743 2026-04-21 cs.CL 57%

Adaptive Text Anonymization: Learning Privacy-Utility Trade-offs via Prompt Optimization

自适应文本匿名化:通过提示优化学习隐私-效用权衡

Gabriel Loiseau, Damien Sileo, Damien Riquet, Maxime Meyer, Marc Tommasi

机构 * Hornetsecurity Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(Lille大学、Inria、CNRS、Centrale Lille、UMR 9189 - CRIStAL)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出自适应文本匿名化任务,通过提示优化框架自动构建匿名化指令,实现隐私与效用的动态平衡,优于现有方法且计算高效。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12676 2026-04-21 cs.CV cs.AI 57%

BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections

BridgeEQA:用于真实桥梁检查的虚拟具身代理

Subin Varghese, Joshua Gao, Asad Ur Rahman, Vedhus Hoskere

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出BridgeEQA基准,通过200个真实桥梁场景和2200个开放词汇问题对,评估具身记忆问答能力,引入Image Citation Relevance指标,并提出EMVR模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17284 2026-04-21 cs.AI 57%

HalluClear: Diagnosing, Evaluating and Mitigating Hallucinations in GUI Agents

HalluClear:诊断、评估和缓解GUI代理中的幻觉

Chao Jin, Wenkui Yang, Hao Sun, Yuqi Liao, Qianyi Jiang, Kai Zhou, Jie Cao, Ran He, Huaibo Huang

机构 * MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所人工智能与自然语言处理实验室,中国科学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Meituan(美团)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 HalluClear通过引入专门的幻觉分类、校准的评估流程和闭环推理方案,有效减少GUI代理中的幻觉,提升自动化可靠性。

Comments 47 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04609 2026-04-21 cs.CL 57%

When More Words Say Less: Decoupling Length and Specificity in Image Description Evaluation

当更多词语说更少:在图像描述评估中解耦长度与特异性

Rhea Kapur, Robert Hawkins, Elisa Kreiss

机构 * Stanford University(斯坦福大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出通过对比集定义描述特异性,验证人们更偏好信息密集的描述,无论长度如何,且长度分配影响特异性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20249 2026-04-21 cs.LG cs.CV eess.IV 57%

Unified Multimodal Brain Decoding via Cross-Subject Soft-ROI Fusion

通过跨受体软ROI融合实现统一的多模态脑解码

Xuanyu Hu

机构 * The University of Manchester, Manchester, UK(曼彻斯特大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 本文提出BrainROI模型,通过软ROI融合和可解释提示优化,提升跨受体脑解码的泛化能力和描述质量,在NSD数据集上取得领先结果。

Comments 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11838 2026-04-21 cs.CL 57%

A Transformer and Prototype-based Interpretable Model for Contextual Sarcasm Detection

基于变换器和原型的可解释模型用于语境讽刺检测

Ximing Wen, Rezvaneh Rezapour

机构 * Drexel University(德雷塞尔大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出一种结合变换器和原型网络的可解释模型,通过情感嵌入实现语境讽刺检测,优于当前最佳方法,且原型层通过相似示例生成解释。

Comments 8 pages, 2 figures. Accepted by WASSA at EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17125 2026-04-21 cs.CR cs.AI 57%

CASCADE: A Cascaded Hybrid Defense Architecture for Prompt Injection Detection in MCP-Based Systems

CASCADE:一种用于MCP系统中提示注入检测的级联混合防御架构

İpek Abasıkeleş Turgut, Edip Gümüş

机构 * Department of Computer Engineering, Faculty of Engineering and Natural Sciences(工程与自然科学学院计算机工程系) Department of Computer Engineering, Institute of Graduate Studies(研究生院计算机工程系)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出CASCADE架构,通过三级级联机制提升MCP系统中提示注入检测的精度与召回率,实现高检测率与低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏