arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 930 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 930 篇

2606.08682 2026-06-09 cs.LG cs.AI 新提交 62%

Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation

激活引导引发突现失调:一项更全面的评估

Qi Cao, Jian Lou, Meiting Liu, Wenjie Feng, Dan Li, See-Kiong Ng, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究激活引导是否引发突现失调,通过扩展评估范围,发现激活引导可导致广泛失调,且比微调产生更连贯的有害响应,并分析了关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08454 2026-06-09 cs.LG cs.CL 新提交 62%

Beyond Linear Activation Steering: Invertible Latent Transformations for Controlling LLM Behavior

超越线性激活引导:用于控制大语言模型行为的可逆潜在变换

Tuc Nguyen, Thai Le

机构 * Indiana University Bloomington(印第安纳大学伯明顿分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 提出INNSteer框架,通过可逆神经网络将LLM激活映射到潜在空间进行线性控制,再逆变换回原空间,实现非线性、输入依赖的激活引导,在多个模型和基准上优于现有方法。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08400 2026-06-09 cs.SE cs.AI cs.CL 新提交 62%

Impacts of Histories and Models on LLM Grading: A Study in Advanced Software Engineering Courses

历史与模型对LLM评分的影响:高级软件工程课程研究

Qilin Zhou, Zhuo Wang, Yue Li, W. K. Chan

机构 * City University of Hong Kong(香港城市大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对研究生阅读报告评分负担重的问题,提出人机协同的LLM辅助评分流程,基于180份作业评估Grok和GPT的评分一致性与人类对齐,发现交互历史导致评分标准漂移,需特定操作缓解不公平。

Comments 5 pages, accepted by ISET 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08247 2026-06-09 eess.AS cs.AI cs.LG eess.SP 新提交 62%

AeroSpectra Sentinel: An Auditable LLM Prompt-Chaining Decision-Support Workflow for Acute Asthma Risk Assessment from Respiratory Sounds and Clinical Signals

AeroSpectra Sentinel:一种用于从呼吸音和临床信号进行急性哮喘风险评估的可审计LLM提示链决策支持工作流

Aueaphum Aueawatthanaphisut

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(泰国朱拉隆梭国际技术学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出AeroSpectra Sentinel,结合STFT呼吸音分析、轻量ML筛查、临床特征融合和五阶段LLM提示链,实现可审计的急性哮喘风险评估,在公开数据集上验证了音频筛查和LLM工作流的有效性。

Comments 10 pages, 8 figures, 5 tables, 14 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08063 2026-06-09 cs.CV cs.AI cs.CL 新提交 62%

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

Robust-U1: MLLMs能否自我恢复受损视觉内容以实现鲁棒理解?

Jiaqi Tang, Jianmin Chen, Youyang Zhai, Wei Wei, Runtao Liu, Mengjie Zhao, Xiangyu Wu, Qingfa Xiao, Qifeng Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Robust-U1框架,通过监督微调、强化学习和多模态推理,使多模态大模型具备显式视觉自恢复能力,在真实和对抗性损坏下达到最先进鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07690 2026-06-09 cs.LG cs.AI 新提交 62%

HARP: Efficient Data Selection for Finetuning Large Language Models

HARP:高效数据选择用于微调大型语言模型

Ning Wang, Zhengxin Zhang, Maosen Tang, Yitang Gao, Claire Cardie, Sainyam Galhotra

机构 * Cornell University(康奈尔大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出层次主动区域剪枝(HARP),一种高效的基于训练的数据选择方法,通过层次结构和经验贝叶斯推断降低选择成本,同时保持下游对齐,在多个基准上优于最强基线最多8.9分,且训练样本减少约7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07524 2026-06-09 cs.CL cs.AI 新提交 62%

ABLE: Representing and Mapping LLMs via Attribution-Based Large-model Embedding

ABLE:基于归因的大模型嵌入表示与映射

Zirui Wang, Yusen Hou, Shaofeng Liang, Bowen Tian, Yanlin Zhang, Wenshuo Chen, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Deep Interdisciplinary Intelligence Lab (DI2 Lab)(深度跨学科智能实验室(DI2 Lab))

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出ABLE框架,利用梯度特征归因和分词器无关的词级对齐构建模型嵌入,实现异构LLM的高效比较,在关系预测、模型路由和基准分数预测上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07141 2026-06-08 cs.LG cs.AI 新提交 62%

REMEDI: A Benchmark for Retention and Unlearning Evaluation in Multi-label Clinical Disease Inference

REMEDI:多标签临床疾病推断中的保留与遗忘评估基准

Anurag Sharma, Sai Teja Chunchu, Prasenjit Mitra, Sandipan Sikdar, Koustav Rudra

机构 * IIT Kharagpur(印度理工学院Kharagpur分校) Carnegie Mellon University(卡内基梅隆大学) L3S Research Center, Leibniz University Hannover(Leibniz汉诺威大学L3S研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出REMEDI基准,针对多标签临床疾病推断中的机器遗忘问题,利用MIMIC-III数据库评估现有方法在效用与遗忘性能间的权衡,并发现其不适用于多标签任务。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07017 2026-06-08 cs.AI cs.CL cs.ET 新提交 62%

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

基础模型智能体的仿真到现实差距:统一MDP视角

Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出将基础模型智能体的评估与训练差距形式化为经典仿真到现实问题,围绕MDP四要素(观测、动作、转移、奖励)构建统一框架,并倡导采用域随机化等成熟解决方案。

Comments 7 pages, 2 figures, 2 tables. Accepted by KDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06825 2026-06-08 cs.CL cs.AI 新提交 62%

Progress-SQL: Improving Reinforcement Learning for Text-to-SQL via Progressive Rewards

Progress-SQL: 通过渐进式奖励改进文本到SQL的强化学习

Shihao Zhang, Xiaoman Wang, Yuan Liu, Yunshi Lan, Weining Qian

机构 * East China Normal University(华东师范大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Progress-SQL,一种多轮强化学习框架,通过Oracle引导诊断树(ODT)生成子句级结构反馈,结合渐进式奖励(结构对齐、词汇对齐、延迟奖励和执行状态奖励),提升文本到SQL生成的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14329 2026-08-17 cs.CR cs.AI cs.CL cs.CY cs.LG 新提交 61%

A Four-Axis Trustworthiness Benchmark for LLM-as-Judge in Principle-Based Regulation

面向基于原则的监管的LLM作为评判者的四轴可信度基准

Dipankar Sarkar

专题命中 安全评测 :分类 cs.CL、cs.AI、cs.CY;trustworthy(comments)

AI总结 本文提出面向基于原则监管的LLM评判者的四轴可信度基准,发布Principle-Bench并引入Ceca评估器,发现无方法在所有四轴占优,部署级LLM评判者需报告对抗性欺骗与事后校准等指标。

Comments 7 pages, 3 figures. Accepted at the KDD 2026 Workshop on Secure and Trustworthy Large Language Models (SeT-LLM), poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25423 2026-07-29 cs.HC cs.AI cs.ET 新提交 61%

From Dyad to Triad: Eliciting XAI Requirements in Stroke Rehabilitation

从二元组到三元组:中风康复中可解释人工智能需求的引出

Param Rajpura, Yogesh Kumar Meena

专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.AI

AI总结 研究针对中风康复中引出可解释人工智能需求的挑战,提出基于视频的支架协议,包含类比桥接等四种方法,揭示了参与者的需求及引导偏差,为康复中引出面向患者的XAI需求提供可复用方法,是可靠人机系统设计前提。

Comments AI and Cognitive Computing for Trustworthy Human Machine Systems Session, IEEE International Conference on Systems, Man, and Cybernetics (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14336 2026-07-17 cs.SE cs.AI 新提交 61%

Copy-on-Write Scoring: Application-Specific Agent Evaluations

写时复制评分:特定应用代理评估

Joanna Roy, Sven Hoelzel

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI;safety(comments)

AI总结 研究如何在软件系统中可靠部署基于大语言模型的代理,提出写时复制(CoW)评分框架,利用PostgreSQL级机制在应用环境中直接评估代理操作,能低成本评估迭代,在开源平台上验证了该框架的有效性。

Comments 15 pages, 11 figures, accepted at ICML 2026 Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16167 2026-06-16 cs.AI 新提交 61%

AI Pluralism and the Worlds It Misses

AI多元主义及其遗漏的世界

Rashid Mushkani

机构 * Rashid Mushkani

专题命中 安全评测 :alignment(abstract,comments);分类 cs.AI

AI总结 本文提出AI系统施加本体论,导致本体论扁平化,并引入多元生命周期治理框架以记录本体开放性和问责条件。

Comments To be presented at the ICML Pluralistic Alignment Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15766 2026-06-16 cs.AI cs.HC 新提交 61%

Rethinking Scaffolding in LLM Tutors: The Interactional Mismatch Between Benchmarks and Real-World Deployments

重新思考LLM导师中的脚手架:基准测试与真实部署之间的交互不匹配

Alexandra Neagu, Jeffrey T. H. Wong, Marcus Messer, Rhodri Nelson, Peter B. Johnson

机构 * University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract,comments);分类 cs.AI

AI总结 通过分析9490个聊天记录,发现AI导师基准测试假设学生积极接受脚手架,但真实场景中学生常绕过脚手架,揭示基准测试与真实部署的交互不匹配。

Comments Pluralistic Alignment Workshop @ ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14347 2026-06-15 cs.LG 新提交 61%

When Language Representations Interact: Separability and Cross-Lingual Effects in LLMs

当语言表示交互时:LLM中的可分离性与跨语言效应

Boris Marinov, Angira Sharma, Christian Schroeder de Witt, Philip Torr, Anisoara Calinescu, Jialin Yu

机构 * University of Oxford(牛津大学) Imperial College London(帝国理工学院) University of York(约克大学)

专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.LG

AI总结 通过因果几何分析,研究多语言LLM中语言表示的线性可分离性及跨语言结构依赖,发现语言概念在协方差调整内积下可分离,同语系语言呈现单纯形几何结构。

Comments Trustworthy AI for Good (AI4Good) Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14380 2026-08-17 cs.AI 新提交 57%

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents

AgentRewind:面向长 horizon LLM 智能体的可恢复执行框架

Yu Zhuang, Kefei Chen, Yitong Duan, Shuxin Zheng, Jian Li, Xu-Yao Zhang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 AgentRewind 是面向长周期 LLM 智能体的运行时恢复框架,通过记录检查点支持状态回退,结合自建基准 MettleBench 实验,可提升智能体任务成功率与清单进度。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14246 2026-08-17 cs.AI 新提交 57%

Polaris: Multi Agentic System for Conversational Enterprise Analytics

Polaris:用于对话式企业分析的多智能体系统

Varuni H K, Soham Sarkar, Jay Kumar, Goutham Krishnan, Tanvi Johari, Avinash Bharadwaj, Santosh Hegde

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 该研究提出名为Polaris的多智能体框架,通过动态任务协调(DTC)层与ReAct风格智能体结合,实现对话式企业分析,在结构化企业数据集上验证了其高语义保真度与答案相关性,为大规模可信端到端商业智能提供了新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14179 2026-08-17 cs.AI 新提交 57%

Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding

语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试

Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi

机构 * DGIST(大邱庆北科学技术院) KAIST(韩国科学技术院) InnoCORE LLM

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14016 2026-08-17 cs.CV cs.AI cs.GR 新提交 57%

Content Based Video Narration of Gameplay with Vision Language Models

基于内容的游戏玩法视频旁白:利用视觉语言模型

Mathew Varghese

机构 * University of Washington(华盛顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。

Comments this https URL (https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13120 2026-08-14 cs.AI 新提交 57%

SkillEvo: Self-Renewing Evolution Gradients from Multi-Turn Interaction Feedback

SkillEvo:基于多轮交互反馈的自更新进化梯度

Qianxi Yan, Chunrong Chen, Jiuzhou Zhao, Min Zhang, Yongzhou Xu, Xiaochuan Xu

机构 * Tencent Cloud Andon(腾讯云Andon) Zhejiang University(浙江大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 SkillEvo通过多轮用户模拟生成反馈、独立治理层修复退化,在6类云服务等数据集上,相比两种基线方法显著提升了智能体技能进化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13118 2026-08-14 cs.LG 新提交 57%

Branch and Bound for Relational Verification of Neural Networks

神经网络关系验证的分支定界法

Kota Fukuda, Zhenya Zhang, Guanqin Zhang, Jianjun Zhao

机构 * Graduate School and Faculty of Information Science and Electrical Engineering, Kyushu University(九州大学情报科学与电气工程研究院及学部) National Institute of Informatics(信息学研究所) UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出分支定界(BaB)框架,通过关系神经元拆分及对应选择策略,在817个跨多数据集的验证问题上,使SaBRe在已解决实例数和效率上优于基线方法,提升神经网络关系验证效果。

Comments The full version of the paper accepted by EMSOFT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12843 2026-08-14 cs.CV cs.AI 新提交 57%

Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法

Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo, Hoang Vo, Do Trung Hieu, Hieu Dinh Trung Pham, Khang Minh Le, Huy Minh Nhat Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学) University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) Vietnam National University, Ho Chi Minh City(胡志明市国家大学) VinUniversity Vietnamese-German University(越南德国大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究针对大规模基于文本的行人异常检索难题,提出带分歧感知重排序的异构视觉语言集成方法,在PAB基准上取得90.92% mAP等优异指标,验证了方案有效性。

Comments Accepted at the ECCV 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12645 2026-08-14 cs.AI 新提交 57%

Jagged Judges: Epistemic Stability Under Silence, Pressure, and Persistence

波动评判者:在沉默、压力与坚持下的认知稳定性

Justin Zhao, Himaghna Bhattacharjee, Hannah Korevaar, Bhaktipriya Radharapu, Khalid El-Arini

机构 * Meta Superintelligence Labs(元超级智能实验室) FAIR at Meta(元公司FAIR研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究提出Wiggle框架测试LLM评判者的认知稳定性,发现9个前沿模型在压力下裁决波动显著,且多数压力会损害真实值,基线陪审团多数强度可预测波动项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12477 2026-08-14 cs.LG 新提交 57%

Learning Under Treatment-Induced Label Indeterminacy with Expert Annotations of Counterfactual Outcomes: A Case Study in Neurological Prognostication

基于反事实结果专家标注的治疗诱导标签不确定性下的学习:以神经预后为例

Xiaobin Shen, Chloe Y. H. Huang, Jonathan Elmer, George H. Chen

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 针对治疗决策导致部分患者结局不确定的临床预后问题,提出结合确定与不确定病例标签的预测模型及分类型评估框架,揭示两类病例评估的权衡关系。

Comments Machine Learning for Healthcare (MLHC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12304 2026-08-13 cs.AI 新提交 57%

Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models

构建动态主逻辑模型作为知识图谱,用于使用检索增强大语言模型的复杂系统诊断

Saman Marandi, Yu-Shu Hu, Mohammad Modarres

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究提出基于检索增强大语言模型的KG-DML框架,实现了复杂系统动态主逻辑模型的自动化构建,经低压冷却剂注入系统验证,可转化技术文档为可执行功能模型用于诊断分析。

Comments 36 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12197 2026-08-13 eess.SY cs.AI cs.SY 新提交 57%

NetlistBench: Evaluating LLM Reliability in SPICE Netlist Recognition and Manipulation

NetlistBench:评估大型语言模型在SPICE网表识别与操作中的可靠性

Jiarui Ma, Jianghan Wang, Yuheng Ma, Ziyi Zhuang, Xiaoguang Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对LLMs在SPICE网表识别与操作中的可靠性,构建含2342个案例的NetlistBench基准,发现其性能随结构复杂度变化,为电路设计自动化提供关键瓶颈参考。

Comments accepted by MLCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11981 2026-08-13 cs.CL 新提交 57%

Benchmarking Trustworthiness of SLMs: Pre-trained vs. Compressed

小型语言模型(SLM)的可信性基准测试:预训练模型与压缩模型的对比

Haokun Lin, Kaijie Zhu, Haobo Xu, Yichen Wu, Zhichao Lu, Qingfu Zhang, Zhenan Sun

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Tsinghua University(清华大学) Harvard Medical School(哈佛医学院) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本研究评估SLM的可信性,发现量化压缩预训练模型比剪枝更能保留可信性,且量化压缩可靠大模型得到的SLM比从头训练的小型模型更优,知识蒸馏可进一步提升其可靠性。

Comments Published in IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11415 2026-08-13 cs.IR cs.AI 新提交 57%

TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs

TRACES:用于评估大型语言模型科学推理中认知可靠性的基准

Valentin Rodionov, Shamil Assylbekov

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究构建了名为TRACES的基准,发现30种大型语言模型在识别42篇不可靠科学论文的认知可靠性时表现不佳,仅少数模型能有效拒绝有缺陷前提,凸显科学部署需护栏。

Comments 16 pages + appendices. 4 figures in the main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10806 2026-08-12 cs.CL 新提交 57%

Assessing Reliability of BERT-Based Models on Question Answering Tasks

评估基于BERT的模型在问答任务上的可靠性

Pooja Yadav, Priyanka Harjule, Basant Agarwal, Marko Robnik Šikonja

机构 * Malaviya National Institute of Technology(马拉维亚国家理工学院) Central University of Rajasthan(拉贾斯坦中央大学) University of Ljubljana(卢布尔雅那大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本研究评估BERT及其变体在问答任务上的可靠性,发现RoBERTa可靠性更高,ALBERT与DistilBERT存在显著不一致,验证了MCD作为可靠性指标的有效性,强调需同时评估QA模型的准确性与稳定性。

Comments Accepted for publication in the Journal of Experimental & Theoretical Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏