arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2607.26100 2026-07-30 cs.SE 新提交 92%

Large Language Models for Software Engineering Diagrams: A Systematic Review of UML and ER modelling

用于软件工程图的大语言模型:UML与ER建模的系统综述

Mojdeh Rahmanian, Ashkan Sami, Yanchao Yu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该系统综述分析64项2023-2025年研究,指出LLM在UML/ER建模中存在领域失衡、GPT依赖、评估不规范等问题,提出需标准化基准等改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13190 2026-07-16 physics.ed-ph 新提交 92%

Reliable isomorphic physics problem generation with large language models

基于大语言模型的可靠同构物理问题生成

Xian Wu, Lindim Ismaili

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究利用大语言模型代理工作流程生成同构物理问题,通过结合提示链等技术,在公共网站实现。开发评分标准并测试,89%生成问题可直接用,虽有局限,但显示出基于LLM系统在教学问题生成上的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07810 2026-06-09 cs.CL cs.AI cs.LG 新提交 92%

SLMJury: Can Small Language Models Judge as Well as Large Ones?

SLMJury:小型语言模型能否像大型模型一样进行评判?

Anish Laddha, Nitesh Pradhan, Gaurav Srivastava

机构 * LNMIIT Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract)

AI总结 提出SLMJury框架,评估小型语言模型作为评判者的能力,发现领域依赖的过度思考效应、领域泛化差异、闭端与开端评判能力分离,以及多智能体辩论降低准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18300 2026-08-20 cs.AI 新提交 92%

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

用于大规模推荐解释的LLM评判模型的生命周期

Emma Yanyang Kong, JJ Tan, Ishan Gupta, Lars Olds, Claire Campbell, David Fagnan, Veli Balin, Rohan Gosain, Louis Garcia, Minsu Jang

机构 * Netflix(网飞公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16924 2026-08-19 cs.CY cs.AI 新提交 92%

WIP: LLM Odyssey: A Game-Based Platform for Teaching LLM Engineering Concepts

工作进展:LLM奥德赛:一个基于游戏的LLM工程概念教学平台

Priyamvada Tripathi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究介绍开源游戏平台LLM奥德赛,含13个交互式游戏,覆盖LLM工程多主题,按布鲁姆分类设三个学习层级,已在加拿大学院初步部署,将开展50人混合方法评估。

Comments 5 pages, 4 figures. Accepted at the 2026 IEEE Frontiers in Education Conference (FIE 2026), Work in Progress track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15591 2026-08-18 cs.AI 新提交 92%

Agent Gym: A Framework for Continuous Evaluation and Evolution of LLM Agents Through Human-in-the-Loop Feedback

Agent Gym:通过人在回路反馈实现LLM智能体持续评估与演化的框架

Pouya Ghiasnezhad Omran, Michael Zimmermann, Duncan Cambridge, Ashmita Kapoor, Tanya Dixit

机构 * Google Cloud(谷歌云)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Agent Gym是支持LLM智能体持续评估演化的模块化框架,通过人在回路反馈实现行为修正,其发票处理参考验证表明框架实用可用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15391 2026-08-18 cs.AI cs.CR 新提交 92%

TwinGridShield: Consequence-Aware Runtime Authorization for LLM Grid-Agent Actions

TwinGridShield:面向LLM网格智能体动作的后果感知运行时授权

Md Fazley Rafy

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TwinGridShield是与模型无关的LLM网格智能体动作运行时授权层,通过确定性网络孪生体评估动作,在匹配模型实验中实现0次不安全发布,模型不匹配下鲁棒性存在一定风险。

Comments 6 pages, 3 figures, 4 tables and accepted in North American Power Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14370 2026-08-17 cs.CR cs.AI cs.SE 新提交 92%

A Hybrid LLM-Based Framework for Automated Security Annotation Generation in Business Process Models

一种基于混合大语言模型(LLM)的业务流程模型自动安全标注生成框架

Md Kamrul Islam, Tiphaine Henry, Mattia Salnitri, Julius Köpke, Sami Souihi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种混合LLM与规则的框架,输入BPMN模型和安全需求文档,自动生成符合SecBPMN2规范的安全标注,在27个流程模型数据集上验证,其准确率优于人工分析师,提升效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12368 2026-08-14 cs.AI 新提交 92%

Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments

一致性并非对齐:人类与大语言模型(LLM)伦理判断中的道德依据分歧

Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklavčič, Marko Robnik Šikonja

机构 * University of Ljubljana(卢布尔雅那大学) Faculty of Computer and Information Science(计算机与信息科学学院) Faculty of Theology(神学院) Faculty of Arts(艺术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究以ETHICS基准的500项道德判断条目为对象,发现LLM与人类的最终伦理判断常一致,但道德依据存在系统性分歧,表明一致性不等同于对齐性,仅靠标签评估易产生误导。

Comments 9 pages, 4 figures, 3 tables. Accepted and presented at the AI Transparency Conference (AITC 2026), Nuremberg, Germany, June 5-6, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11705 2026-08-13 cs.AI 新提交 92%

Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning

提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为

Lang Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10669 2026-08-12 cs.AI 新提交 92%

REDAgentBench: Executable Red Teaming and Faithful Measurement of LLM Agent Systems

REDAgentBench:可执行的红队测试与LLM智能体系统的忠实测量

Zixing Chen, Xingyuan Liu, Jie Zhu, Huaixia Dou, Shuo Jiang, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体安全评估的缺陷,推出REDAgentBench框架,经实验发现其宏平均ASR为65.69%,还揭示了识别-执行差距,无训练策略提醒可减少70%以上违规

Comments 6 figures, 4 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09988 2026-08-12 cs.CE cs.CL 新提交 92%

OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents

OpenPM:面向LLM投资组合管理智能体的可审计时点评估框架

Xinying Cai, Minghao Guo, Jiahe Liu, Jiaojiao Han, Bangwei Guo, Yitao Long, Yuxuan Chen, Bohan Wu, Dimitris N. Metaxas, Raymond Li

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 OpenPM是面向LLM投资组合管理智能体的可审计时点评估框架,构建了分层分配器参考智能体,发现分析师质量比构造器选择更重要,换手率是主要成本驱动因素。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05411 2026-08-07 cs.AI 新提交 92%

Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index

基于教学适宜性指数评估和改进基于大语言模型(LLM)的AI导师的教学适配性

Benjamin Barlog, Hudson Craig, Zedong Peng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出教学适宜性指数(PSI)评估LLM导师的教学适配性,评估4类LLM并发现PSI引导的反馈可显著提升弱表现案例的适配性。

Comments This paper has already been accepted and presented at the IEEE 27th International Conference on Information Reuse and Integration for Data Science (IRI 2026) from July 31 to August 2, 2026, in Seattle, WA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05030 2026-08-06 cs.AI 新提交 92%

From Score Matrices to Football-Aware Match-State Simulation: An Auditable LLM Harness for Exact-Score Reranking

从得分矩阵到足球感知的比赛状态模拟:用于精确得分重排序的可审计大语言模型(LLM)框架

Shaopeng Liang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出可审计混合架构,结合动态统计模型与LLM实现足球得分重排序,经迭代优化后在英超150场比赛时序测试中提升了精确得分准确率与候选覆盖度,明确了该方法的改进及局限。

Comments 9 pages, 1 figure, 5 tables. Interim chronological benchmark on the first 150 matches of the 2025-26 English Premier League

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02966 2026-08-05 cs.CL 新提交 92%

Every Wrong Answer Counts: Option-Level Psychometrics for LLM Multiple-Choice Benchmarks

每个错误答案都有价值:面向LLM多项选择基准的选项层面心理测量学

Xiao Fei, Yang Zhang, Sarah Almeida Carneiro, Michalis Vazirgiannis

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对LLM多项选择基准提出LLM-NRM框架,利用错误答案的独特信息提升能力估计精度与基准测试效率,其能力估计与人类偏好排行榜相关性达0.920,仅错误回答就能实现0.943的高相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01629 2026-08-04 cs.CL 新提交 92%

Human-LLM Alignment in Language Attitudes Toward Non-Native Japanese

在非母语日语的语言态度上实现人类与大语言模型(LLM)的对齐

Naho Orita, Hayato Ogawa, Daisuke Kawahara

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究对比人类与LLM对母语及非母语日语邮件的评价,发现LLM以结构化弱化形式重现母语者的语言态度,为审计LLM提供了可推广的语言态度框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10546 2026-07-14 cs.LG 新提交 92%

LLM-PDESR: Robust PDE Discovery via Subdomain Weighted Residuals and LLM-Guided Symbolic Hypothesis Generation

LLM-PDESR:通过子域加权残差和大语言模型引导的符号假设生成进行稳健的偏微分方程发现

Jinyang Du, Hao Ma, Xiaohu Shi, Bo Yang, Yanchun Liang, Heow Pueh Lee, Chunguo Wu

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Big Data and Artificial Intelligence, Guangdong University of Finance and Economics(广东财经大学大数据与人工智能学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(吉林大学符号计算与知识工程教育部重点实验室) School of Computer Science, Zhuhai College of Science and Technology(珠海科技学院计算机科学学院) Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究旨在从噪声数据发现偏微分方程,提出LLM-PDESR框架,结合大语言模型假设生成与数学评估环境,利用五次样条和子域加权残差减轻噪声影响,经帕累托驱动反馈环优化方程,实验表明其在多方面显著优于现有方法。

Comments 28 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05571 2026-07-08 cs.AI cs.HC 新提交 92%

CSTutorBench: Benchmarking Small Language Models as Tutors for Block-Based Programming

CSTutorBench:将小型语言模型作为基于块的编程导师进行基准测试

H. Chad Lane, Bryson Kageler

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究针对K-12环境中部署语言模型的问题,引入CSTutorBench基准评估VEX VR中语言模型作导师的表现。通过对11个模型测试发现其在深层教学行为有困难,模型家族和指令调整方法对辅导质量预测性更好,特定提示修订可提分,凸显此类基准的价值。

Journal ref SLM4ED'26: The 1st Workshop of Small Language Models for Education (SLM4ED). AIED 2026. Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20408 2026-07-07 cs.CR cs.AI 新提交 92%

NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms

LLM智能体安全性、多轮红队测试、越狱基准、对抗鲁棒性、安全关键系统

Hanwool Lee, Dasol Choi, Bokyeong Kim, Haon Park, Seung Geun Kim

机构 * AIM Intelligence(AIM智能公司) KAERI(韩国原子能研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出NRT-Bench基准,通过模拟核电站控制室的多轮红队测试,评估LLM智能体在安全关键系统中的对抗鲁棒性,发现不同模型的漏洞几乎不重叠,且防御效果高度依赖模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01584 2026-07-03 cs.AI 新提交 92%

EO-Agents: A Three-Agent LLM Pipeline for Earth Observation Hypothesis Generation

EO-Agents: 用于地球观测假设生成的三智能体LLM流水线

Mahyar Ghazanfari, Amin Tabrizian, Armin Mehrabian, Peng Wei

机构 * ADNET Systems(ADNET系统)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出基于NASA地球观测知识图谱的三智能体LLM流水线,通过图神经网络排序数据集对,生成并评估结构化研究假设,在1475个数据集上产生160个跨领域假设。

Comments Accepted at the ICML 2026 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16511 2026-07-02 cs.LG 新提交 92%

Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives

LLM评估中的尾部形状估计是脆弱的:诊断假阳性的协议

Luca Zhou

机构 * Sapienza University of Rome(罗马大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个协议,用于检验LLM评估中尾部形状估计的假阳性,通过极值理论指标区分尾部重量和尾部质量,并在毒性评估中识别出三种假阳性模式。

Comments 9 pages of main paper, 4 figures and 4 tables in the main paper, more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31608 2026-07-01 cs.CL 新提交 92%

CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

CLExEval: 一种用于定性评估LLM临床推理的人机协同框架

Ajmal M., Abin Roy, Afthab Salam Kanniyan, Jawadh Abdul Kabeer, Jerin James, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) IIT Madras(印度理工学院马德拉斯分校) Calicut Medical College(卡利卡特医学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CLExEval框架,通过渐进信息遮蔽和专家注释,揭示LLM临床推理中的冗长偏差、隐藏知识悖论和推理-输出不匹配问题,并验证了LLM作为评判者的局限性。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26627 2026-06-26 cs.CR cs.AI 新提交 92%

Agents That Know Too Much: A Data-Centric Survey of Privacy in LLM Agents

知道太多的智能体:LLM智能体中隐私的数据中心调查

Nada Lahjouji, Ashwin Gerard Colaco

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 从数据中心视角调查LLM智能体隐私风险,分类数据源、隐私风险及治理机制,发现信息流控制可覆盖组合和跨会话推理泄露,但缺乏统一隐私策略的基准。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25973 2026-06-25 cs.SE cs.AI 新提交 92%

Helpful or Harmful? Evaluating LLM-Assisted Vulnerability Patching via a Human Study

有益还是有害?通过人类研究评估LLM辅助的漏洞修补

Giulian Biolo, Michael Tezza, Yuanjun Gong, Fabio Massacci

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过人类实验研究LLM辅助漏洞修补的效果,发现其可能加速修补但增加生成不安全代码的风险。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24145 2026-06-24 cs.AI 新提交 92%

T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph

T2D-Bench:基于多层临床-生活方式知识图谱的2型糖尿病LLM输出证据门控评估

Saba A. Farahani, Hung Cao, Ramesh Jain, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出T2D-Bench基准,通过多层知识图谱和证据门控机制,检测LLM输出中未满足指南约束的临床遗漏,并在2型糖尿病诊断、用药安全等场景中实现可测量纠正。

Comments 7 pages, 2 figures, 2 tables. Accepted as a poster at AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16821 2026-06-24 cs.CL cs.CR cs.CY cs.IR 新提交 92%

How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation

我们能在多大程度上信任LLM搜索智能体?衡量对网络内容操纵的认可脆弱性

Yimeng Chen, Zhe Ren, Firas Laakom, Yu Li, Dandan Guo, Jürgen Schmidhuber

机构 * Center of Excellence for Generative AI, KAUST(KAUST生成式人工智能卓越中心) Jilin University(吉林大学) Zhejiang University(浙江大学) The Swiss AI Lab, IDSIA-USI/SUPSI(瑞士人工智能实验室 IDSIA-USI/SUPSI) NNAISENSE

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SearchGEO框架,通过五类攻击模式和输出级指标评估13种LLM后端对网络内容操纵的认可脆弱性,发现攻击成功率从0%到31.4%不等,且不同后端对攻击模式的敏感性和部署框架的影响存在显著差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22349 2026-06-23 cs.CL cs.HC 新提交 92%

Curiosity as Linguistic Intervention: Using LLM Tutoring Dialogues to Influence Exploratory Learning Behavior

好奇心作为语言干预:利用LLM辅导对话影响探索性学习行为

Gevindu Ganganath, Pasindu Bolonghege, Qianru Lyu, Pradeep Varakantham, Thivya Kandappu

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Human-Computer Interaction Institute, Carnegie Mellon University(卡内基梅隆大学人机交互研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CURIOBOT框架,通过LLM对话中的语言干预(新奇性、复杂性、冲突、不确定性)激发探索性学习行为,实验显示对话轮次增加2.4倍。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21856 2026-06-23 cs.CR cs.AI 新提交 92%

Harness-MU: A Safe, Governed, and Effective Harness for Multi-User LLM Agents

Harness-MU:面向多用户LLM代理的安全、可控且有效的框架

Wangxuan Fan, Xiaoyu Nie, Zhongxiang Dai

机构 * OpenAI Codex team(OpenAI Codex团队)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多用户LLM代理的权限冲突与数据泄露问题,提出模型无关、零微调的基础设施框架Harness-MU,通过执行钩子强制执行确定性治理约束,在Muses-Bench基准上实现隐私保护并提升指令遵循准确率高达48.9个百分点。

Comments 15 pages, 4 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19474 2026-06-19 cs.CR cs.AI cs.SE 新提交 92%

Secure Coding Drift in LLM-Assisted Post-Quantum Cryptography Development: A Gamified Fix

LLM辅助后量子密码开发中的安全编码漂移:一种游戏化修复方案

R. D. N. Shakya, C. P. Wijesiriwardana, S. M. Vidanagamachchi, Nalin A. G. Arachchilage

机构 * University of Moratuwa(摩图瓦大学) University of Ruhuna(鲁胡纳大学) RMIT University(皇家墨尔本理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LLM辅助PQC开发中的安全编码漂移模型,通过游戏化框架将LLM转变为主动安全协作者,以缓解长期依赖LLM导致的安全退化。

Comments Accepted for 2026 SIGIR Workshop on Vulnerabilities in Generative Systems for Information Retrieval track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18649 2026-06-19 cs.MA cs.CL cs.CY 新提交 92%

Gender Bias in LLM Hiring Decisions: Evidence from a Japanese Context and Evaluation of Mitigation Strategies

LLM招聘决策中的性别偏见:来自日本语境的证据及缓解策略评估

Serena A. Hoffstedde, Machiko Hirota, Akshara Nadayanur Sathis Kanna, Rihito Kotani, Ujwal Kumar, Gabriele Trovato, Phan Xuan Tan

机构 * Shibaura Institute of Technology, Tokyo, Japan(Shibaura技术学院,东京,日本) Amsterdam University of Applied Sciences, Amsterdam, Netherlands(阿姆斯特丹应用科学大学,阿姆斯特丹,荷兰) University of Pennsylvania, Philadelphia, USA(宾夕法尼亚大学,费城,美国) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,匹兹堡,美国) Keio University, Tokyo, Japan(庆应大学,东京,日本)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过60份日本履历书格式的简历和5个先进LLM,发现所有模型均存在显著的亲女性偏见,且简单的提示指令无法缓解,而移除姓名几乎完全消除该偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏