arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-08 至 2026-05-08 共收录 413 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 62 篇

2605.06347 2026-05-08 cs.HC cs.AI 70%

Human-AI Co-Evolution and Epistemic Collapse: A Dynamical Systems Perspective

人类与人工智能的共演与知识崩溃:一种动态系统视角

Xuening Wu, Yanlan Kang, Qianya Xu, Kexuan Xie, Jiaqi Mi, Honggang Wang, Yubin Liu, Zeping Chen

机构 * Fudan University(复旦大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of California San Diego(加州大学圣地亚哥分校) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文从动态系统视角探讨人类与语言模型的共演及知识崩溃问题,提出人类与模型形成反馈闭环的耦合系统,通过三变量模型揭示共进化增强、脆弱均衡和退化收敛三种动态模式。

Comments 5 pages, 3 figures, ICML EIML Workshop submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06165 2026-05-08 cs.AI 70%

Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost

事后推理:在不增加成本的情况下提升非思考模型的性能

Richmond Sin Jing Xuan, Rishabh Bhardwaj, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Post-Reasoning方法,通过在生成最终回答后让模型解释答案,提升指令微调模型的性能,且不增加延迟或token成本,在117种模型-基准设置中提升了88.19%的性能,平均相对提升17.37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06116 2026-05-08 cs.AI 70%

Policy-Guided Stepwise Model Routing for Cost-Effective Reasoning

基于策略的分步模型路由以实现高效推理

Wenwen Si, Insup Lee, Osbert Bastani

机构 * Department of Computer and Information Science(计算机与信息科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于策略的分步模型路由方法,通过强化学习和阈值校准优化性能与效率的平衡,提升了数学基准测试中的准确率与成本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02312 2026-05-08 cs.LG 70%

KaVa: Latent Reasoning via Compressed KV-Cache Distillation

KaVa:通过压缩KV缓存蒸馏实现潜在推理

Anna Kuzina, Maciej Pioro, Paul N. Whatmough, Babak Ehteshami Bejnordi

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 KaVa通过压缩KV缓存蒸馏实现潜在推理,利用连续潜在标记的表示灵活性对齐逐步KV轨迹,有效提升复杂自然语言推理任务的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05826 2026-05-08 cs.AI 70%

AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD

AGPO:面向京东可验证推理和搜索广告相关性的非对称分组策略优化

Yang Xu, Kun Yao, Yiming Deng, Zheng Fang, Kai Ming Ting, Ming Pang

机构 * Nanjing University, Nanjing, China(南京大学) Peking University, Beijing, China(北京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AGPO方法,通过非对称分组策略优化,抑制错误推理路径,提升模型探索能力,并在数学基准和工业应用中实现高准确率和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05702 2026-05-08 cs.AI 70%

Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents

知识图谱路径作为自演化搜索代理的中间监督

Huyu Wu, Jun Liu, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过利用知识图谱路径作为中间监督,改进自演化搜索代理的提问生成和奖励塑造,解决传统方法中提问孤立和奖励信息不足的问题,提升多跳问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05459 2026-05-08 cs.CR cs.LG 70%

Privacy Without Losing Place: A Paradigm for Private Retrieval in Spatial RAGs

隐私不丧失位置:空间RAGs中隐私检索的范式

Kennedy Edemacu, Mohammad Mahdi Shokri, Vinay M. Shashidhar, Jong Wook Kim

机构 * The City University of New York(纽约城市大学) Northern Michigan University(北密歇根大学) Sangmyung University(商硕大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PAS机制,通过相对锚编码实现用户位置隐私保护,在保持检索性能的同时提供粗粒隐私保障,且大语言模型能补偿空间检索的不完美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13310 2026-05-08 cs.CV cs.AI 70%

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

视觉并行思考器:用于视觉理解的分而治之推理

Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) University of Chinese Academy of Sciences(中国科学院大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出视觉并行思考器,通过并行推理框架提升视觉理解能力,结合Pa-Attention和LPRoPE实现高效多模态处理,验证了并行推理在视觉领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01719 2026-05-08 cs.CL 70%

What MLLMs Learn about When they Learn about Multimodal Reasoning

大语言模型在学习多模态推理时所学的内容

Jiwan Chung, Neel Joshi, Pratyusha Sharma, Youngjae Yu, Vibhav Vineet

机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出MathLens基准测试,通过分解性能为感知、推理和多模态特定组件,揭示多模态推理模型评估中隐含的假设。研究显示,不同训练策略导致的能力谱系不同,多模态特定错误占比上升,表明进展反映的是子技能平衡变化而非统一提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28192 2026-05-08 cs.RO cs.CV 67%

LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning

LaST-R1:通过自适应物理潜在推理强化机器人操作

Hao Chen, Jiaming Liu, Zhonghao Yan, Nuowei Han, Renrui Zhang, Chenyang Gu, Jialin Gao, Ziyu Guo, Siyuan Qian, Yinxi Wang, Peng Jia, Shanghang Zhang, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院) Simplexity Robotics Project(Simplexity机器人项目)

专题命中 推理与问题求解 :foundation model(abstract);post-training(abstract)

AI总结 本文提出LaST-R1,一种基于强化学习的后训练框架,通过联合优化潜在推理过程和动作生成,提升机器人在动态环境中的适应性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00751 2026-05-08 cs.AI cs.CL 62%

Self-Consistency Is Losing Its Edge: Diminishing Returns and Rising Costs in Modern LLMs

自一致性正在失去优势:现代大语言模型中的边际效益递减与成本上升

Chiyan Loo

机构 * Chiyan Loo

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究指出,随着模型增强,自一致性技术变得低效且可能降低性能,通过实验显示增加推理路径数量带来的准确率提升有限,而成本却显著增加,建议仅在单次可靠度不足的问题上使用多路径采样。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06058 2026-05-08 cs.LG cs.CV 57%

Towards Self-Explainable Document Visual Question Answering with Chain-of-Explanation Predictions

迈向具有解释链预测的自解释文档视觉问答

Kjetil Indrehus, Adrian Duric, Changkyu Choi, Ali Ramezani-Kebrya

机构 * Department of Informatics, University of Oslo(奥斯陆大学信息学院) Integreat – Norwegian Centre for Knowledge-driven Machine Learning(挪威知识驱动机器学习中心) TRUST – The Norwegian Centre for Trustworthy AI(挪威可信人工智能中心)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本文提出CoExVQA框架,通过解释链设计实现文档视觉问答的自解释,通过证据识别、答案定位和基于证据解码三步流程提升可解释性,实验显示在PFL-DocVQA上取得SotA性能,ANLS提升12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05955 2026-05-08 cs.CL cs.CV 57%

TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity

TableVista:在视觉和结构复杂性下多模态表格推理的基准测试

Zheyuan Yang, Liqiang Shang, Junjie Chen, Xun Yang, Chenglong Xu, Bo Yuan, Chenyuan Jiao, Yaoru Sun, Yilun Zhao

机构 * Tongji University(同济大学) University of Bristol(布里斯托大学) Tianjin University(天津大学) Yale University(耶鲁大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL

AI总结 TableVista包含3000个高质量表格推理问题,通过多风格渲染和转换流程生成30000个多模态样本,评估29种基础模型在不同复杂性下的表现,揭示结构复杂性和视觉整合对推理一致性的影响。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04415 2026-05-08 cs.CL 57%

STEER: Structured Event Evidence for Video Reasoning via Multi-Objective Reinforcement Learning

STEER: 通过多目标强化学习进行视频推理的结构事件证据

Zinuo Li, Yongxin Guo, Jun Liu, Jiawei Zhan, Xi Jiang, Chengjie Wang, Mohammed Bennamoun, Farid Boussaid, Feng Zheng, Qiuhong Ke

机构 * University of Western Australia(西澳大学) CUHKSZ(香港科技大学) Tencent Youtu Lab(腾讯优图实验室) SUSTech(南方科技大学) Monash University(墨尔本大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL

AI总结 本文提出结构事件证据方法,通过多目标强化学习解决视频推理中事件结构缺失问题,提出STEER-60K数据集和P-FAB算法提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01951 2026-05-08 cs.LG 57%

Autolearn: Learn by Surprise, Commit by Proof

Autolearn: 通过惊喜学习,通过证明承诺

Kang-Sin Choi

机构 * Ewha Womans University(成均馆大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 Autolearn通过自动生成问答链验证异常高损失的段落,利用β₂调整抑制记忆,提升对新事实的理解能力,其扰动差距指标区分记忆与理解,四模型中唯一进入此领域。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05561 2026-05-08 cs.AI 57%

BitCal-TTS: Bit-Calibrated Test-Time Scaling for Quantized Reasoning Models

BitCal-TTS:用于量化推理模型的位校准测试时间缩放

Sai Babu Patarlapalli, Surya Teja Avvaru

专题命中 推理与问题求解 :post-training(abstract);分类 cs.AI

AI总结 本文提出BitCal-TTS,一种轻量级运行时控制器,通过在线代理、位条件置信度重缩放和位感知后标记确认范围,提升量化推理模型的准确率和稳定性。

Comments 17 pages, 5 figures, 4 tables. Code and reproducibility materials at https://github.com/Saibabu7770/bitcal-tts

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05271 2026-05-08 cs.CR cs.AI 57%

Shattering the Echo Chamber: Hidden Safeguards in Manuscripts Against the AI Takeover of Peer Review

打破回声室:对抗AI接管同行评审的隐藏保障

Oubo Ma, Ruixiao Lin, Jiahao Chen, Yuan Su, Yong Yang, Shouling Ji

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 本文提出IntraGuard框架,通过在PDF结构中嵌入异构防御文本对象,有效抵御AI生成的同行评审,实现84%的防御成功率,且不影响人类评审。

Comments 22 pages, 14 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01390 2026-05-08 cs.HC cs.AI 57%

Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

迈向可扩展的音频描述质量控制:评估人类和VLM评分者的流程

Lana Do, Gio Jung, Juvenal Francisco Barajas, Andrew Taylor Scott, Shasta Ihorn, Alexander Mario Blum, Vassilis Athitsos, Ilmi Yoon

机构 * Northeastern University(东北大学) San Francisco State University(旧金山州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种评估人类和VLM评分者音频描述质量的流程,利用项目反应理论评估其与专家标准的匹配程度,发现VLM在大规模评估中可与人类评分者相当,但其推理可靠性较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06847 2026-05-08 cs.SE 50%

Characterizing Faults in Agentic AI: A Taxonomy of Types, Symptoms, and Root Causes

代理AI中的故障特征化:故障类型、症状和根本原因的分类

Mehil B Shah, Mohammad Mehdi Morovati, Mohammad Masudur Rahman, Foutse Khomh

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文通过实证研究,提出代理AI系统故障的分类体系,涵盖34种故障类型,揭示其在结构化输出解释、工具调用、运行时执行和异常处理中的表现,以及数据模式不匹配、依赖漂移等根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19972 2026-05-08 cs.CV 50%

Boosting Reasoning in Large Multimodal Models via Activation Replay

通过激活回放提升大多模态模型的推理能力

Yun Xing, Xiaobin Hu, Qingdong He, Jiangning Zhang, Shuicheng Yan, Shijian Lu, Yu-Gang Jiang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯云图实验室) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :post-training(abstract)

AI总结 本文通过激活回放方法提升大模型的多模态推理能力,通过操控低熵激活来增强推理性能,验证了该方法在数学、视觉代理和视频推理等场景中的有效性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 97 篇

2605.05807 2026-05-08 cs.CR cs.AI 93%

LCC-LLM: Leveraging Code-Centric Large Language Models for Malware Attribution

LCC-LLM:利用代码导向的大语言模型进行恶意软件归因

Christopher G. Pedraza Pohlenz, Hassan Jalil Hadi, Ali Hassan, Ali Shoker

机构 * CyberSaR, King Abdullah University of Science and Technology(CyberSaR,国王阿卜杜勒·阿齐兹大学科学与技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title);language model(title);分类 cs.AI

AI总结 本文提出LCC-LLM,一种代码导向的恶意软件归因和多任务静态恶意软件分析框架,通过构建包含34000个PE样本的LCCD数据集,结合静态分析与多源安全知识,提升恶意软件归因的可靠性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06334 2026-05-08 cs.CL cs.LG cs.LO 92%

MANTRA: Synthesizing SMT-Validated Compliance Benchmarks for Tool-Using LLM Agents

MANTRA: 为使用工具的LLM代理合成经过SMT验证的合规性基准

Ashwani Anand, Ivi Chatzi, Ritam Raha, Anne-Kathrin Schmuck

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MANTRA通过自动合成可机检验的合规性基准,解决LLM代理在复杂手册下的合规性验证问题,支持任意领域和长流程手册,并提供可调节的任务复杂度,生成285个任务的基准套件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06635 2026-05-08 cs.CL 92%

Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents

被引用但未验证:解析和评估LLM深度研究代理中的源归属

Hailey Onweller, Elias Lumer, Austin Huber, Pia Ramchandani, Vamse Kumar Subbiah, Corey Feld

机构 * Commercial Technology and Innovation Office, PricewaterhouseCoopers, U.S(普华永道商业技术与创新办公室,美国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出首个源归属评估框架,通过AST解析器大规模评估LLM生成的Markdown报告中的引用,从链接有效性、内容相关性和事实准确性三个维度验证引用可靠性,揭示了表面引用质量与事实可靠性之间的关键断层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06527 2026-05-08 cs.CL 92%

STALE: Can LLM Agents Know When Their Memories Are No Longer Valid?

STALE:LLM代理能否知道其记忆已不再有效?

Hanxiang Chao, Yihan Bai, Rui Sheng, Tianle Li, Yushi Sun

机构 * Wuhan University(武汉大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 STALE基准测试评估LLM代理在新证据出现时修订存储信念的能力,揭示了现有模型在处理隐含冲突和更新状态时的不足,提出三种探查框架并提出CUPMem原型以改进状态感知记忆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06445 2026-05-08 cs.SE cs.AI 92%

Constraint Decay: The Fragility of LLM Agents in Backend Code Generation

约束衰减:后端代码生成中LLM代理的脆弱性

Francesco Dente, Dario Satriani, Paolo Papotti

机构 * EURECOM University of Basilicata(巴利卡塔大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理在多文件后端生成中处理结构约束的能力,发现随着约束累积,性能显著下降,且框架敏感性导致不同环境下的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06279 2026-05-08 cs.SE cs.AI 92%

Correct Code, Vulnerable Dependencies: A Large Scale Measurement Study of LLM-Specified Library Versions

正确的代码,易受攻击的依赖项:一项大规模的LLM指定库版本测量研究

Chengjie Wang, Jingzheng Wu, Xiang Ling, Tianyue Luo, Chen Zhao

机构 * Intelligent Software Research Center, Institute of Software, Chinese Academy of Sciences, Beijing, China(智能软件研究中心,软件研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Key Laboratory of System Software (Chinese Academy of Sciences), Beijing, China(中国科学院系统软件重点实验室,北京,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM生成代码中库版本的安全性和兼容性风险,发现版本选择存在系统性偏差,且版本选择影响漏洞暴露和兼容性故障。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06054 2026-05-08 cs.AI cs.HC 92%

Visual Fingerprints for LLM Generation Comparison

用于LLM生成比较的视觉指纹

Amal Alnouri, Andreas Hinterreiter, Christina Humer, Furui Cheng, Marc Streit

机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨分校) ETH Zürich(苏黎世联邦理工学院) Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过可视化方法比较不同生成条件下的LLM输出,揭示模型行为的一致性模式,提升提示设计和模型评估效率。

Comments Submitted to the Short Paper track at IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18823 2026-05-08 cs.CL 92%

EvalSense: A Framework for Domain-Specific LLM (Meta-)Evaluation

EvalSense:一种用于领域特定LLM(元)评估的框架

Adam Dejl, Jonathan Pearson

机构 * Imperial College London(伦敦帝国学院) NHS England Transformation Directorate(英格兰国家健康服务转型 Directorate)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EvalSense框架,用于构建领域特定的LLM评估套件,通过交互式指南和元评估工具提高评估方法的可靠性与灵活性。

Comments Accepted to EACL 2026 System Demonstrations

Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 3: System Demonstrations), 480-491. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05260 2026-05-08 cs.CR 91%

SecureMCP: A Policy-Enforced LLM Data Access Framework for AIoT Systems via Model Context Protocol

SecureMCP: 一种通过模型上下文协议实现的基于策略的LLM数据访问框架,用于AIoT系统

Wonbae Kim, Hee-Kyong Yoo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SecureMCP框架,结合RBAC与MCP服务器,通过五种防御模块实现多层防护,提升LLM生成SQL的安全性,实验显示其在保护数据安全和执行准确率方面表现优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05424 2026-05-08 cs.CR 91%

Evaluating the Reliability of Multiple Large Language Models in Risk Assessment: A CIS Controls Based Approach

评估多个大型语言模型在风险评估中的可靠性:基于CIS控制的方法

Gustavo Roberto Pinto, Arthur do Prado Labaki, Rodrigo Sanches Miani

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文通过问卷分析50名专家与五种大语言模型在评估网络安全风险场景中的表现,发现大语言模型低估风险,强调需人类监督,建议将LLM作为补充工具。

Comments Manuscript under review - International Journal of Data Science and Analytics

详情

展开后加载摘要…

URL PDF HTML 收藏