arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-19 至 2026-08-19 共收录 76 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 76 篇

2608.17183 2026-08-19 cs.AI cs.CR 新提交 93%

Benchmarking the Benchmarks: Evaluating Automated Safety Benchmarks for Small Language Models

基准的基准:评估小型语言模型的自动化安全基准

Nyamtulla Shaik, Fengjun Li, Bo Luo

机构 * University of Kansas(堪萨斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn)

AI总结 本研究通过评估5个基准套件在26个开源SLMs上的表现,发现现有以LLM为中心的安全基准无法可靠评估SLMs,模糊性会导致模型排名出现显著变化。

Comments This paper is accepted for publication at ESORICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17051 2026-08-19 cs.CL cs.AI 新提交 93%

Institution-Specific LLM Prompting Recovers PHI That De-identification Systems and Their Gold Standards Both Miss

基于机构特定的大语言模型提示工程恢复去标识化系统及其黄金标准均遗漏的受保护健康信息

Daniel Palacios, Matthew Brady Neeley, Angel Adetomike Otto, Shalini Dhamodharan, John P. Woodhouse, Chi-fan Lin, Mark Zobeck, Zhandong Liu, Hyun-Hwan Jeong

机构 * Baylor College of Medicine(贝勒医学院) Jan and Dan Duncan Neurological Research Institute(简与丹·邓肯神经学研究所)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出校准良好的上下文学习(ICL)的大语言模型(LLM),可通过机构特定提示恢复去标识化系统遗漏的受保护健康信息(PHI),平衡精确率与召回率,是专用去标识化系统的有效替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17715 2026-08-19 q-fin.RM cs.AI 新提交 92%

Communicating Credit Risk with Large Language Models: Evaluation of Explanations from Standard and Alternative Data-Based Models

利用大语言模型传达信用风险:基于标准数据与替代数据模型的解释评估

Sahab Zandi, Noah Kostesku, Christophe Mues, María Óskarsdóttir, Cristián Bravo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究探究大语言模型能否作为解释层转化信用风险模型的事后解释,构建三类流程并采用三类LLM,发现证据表征是解释质量的关键制约,专业人士对证据标准要求更严格。

Comments 49 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17516 2026-08-19 cs.CL 新提交 92%

Effects of Answer Format Variation on Gender Bias in Large Language Models

答案格式变化对大型语言模型中性别偏见的影响

Ksenia Merzlyakova, Sebastian Padó, Franziska Weeber

机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究探讨答案格式变化对LLMs性别偏见测量的影响,通过评估三种指令微调模型在不同格式下的表现,发现格式会显著改变测量结果,强调需将答案格式纳入LLM评估。

Comments 6th Workshop on Computational Linguistics for the Political and Social Sciences (CPSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27155 2026-08-19 cs.AI cs.CL cs.HC 版本更新 92%

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

OmegaUse-OfficeVal:基于经济基准的长周期办公套件任务LLM智能体评测基准

Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OmegaUse-OfficeVal是带经济基准的长周期办公套件任务LLM智能体评测基准,含100项任务,评测发现前沿LLM成本低速度快但质量未达人类水平,代码与数据集已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13110 2026-08-19 cs.CL cs.AI 版本更新 92%

SCOPE: Selective Conformal Optimized Pairwise LLM Judging

SCOPE: 选择性保形优化的成对LLM评判

Sher Badshah, Ali Emami, Hassan Sajjad

机构 * Faculty of Computer Science, Dalhousie University, Halifax, NS, Canada(达勒豪西大学计算机科学学院) Department of Computer Science, Emory University, Atlanta, GA, USA(埃默里大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SCOPE框架,通过校准接受阈值控制非弃权判断的错误率,并引入双向偏好熵(BPE)提供无偏不确定性信号,实现可靠且高覆盖率的LLM成对评估。

Comments Accepted at ICML 2026. 23 pages (9 main plus appendix), 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20182 2026-08-19 cs.CL cs.AI 版本更新 92%

Beyond BFI: The CSI for Enhanced Reliability and Validity in Evaluating LLM Personality Traits

超越BFI:用于增强评估LLM人格特质可靠性与有效性的CSI

Huanhuan Ma, Haisong Gong, Xiaoyuan Yi, Xing Xie, Philip S. Yu, Dongkuan Xu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有LLM人格特质评估工具BFI的可靠性与有效性局限,提出适配LLM的CSI,经实验验证其可靠性更高、与模型真实输出相关性超0.85,能有效评估LLM人格特质。

Comments Code available via this https URL (https://github.com/dependentsign/CSI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16924 2026-08-19 cs.CY cs.AI 新提交 92%

WIP: LLM Odyssey: A Game-Based Platform for Teaching LLM Engineering Concepts

工作进展:LLM奥德赛:一个基于游戏的LLM工程概念教学平台

Priyamvada Tripathi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究介绍开源游戏平台LLM奥德赛,含13个交互式游戏,覆盖LLM工程多主题,按布鲁姆分类设三个学习层级,已在加拿大学院初步部署,将开展50人混合方法评估。

Comments 5 pages, 4 figures. Accepted at the 2026 IEEE Frontiers in Education Conference (FIE 2026), Work in Progress track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02118 2026-08-19 cs.AI cs.CL 版本更新 91%

TSQueryBench: LLM-as-a-Judge for Time Series Explanations

基于时间序列的LLM作为裁判

Preetham Sivalingam, Murari Mandal, Dhruv Kumar, Saurabh Deshpande

机构 * BITS Pilani(比拉理工学院皮拉尼校区) KIIT(KIIT大学) Birla AI Labs(比拉人工智能实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文研究了在无参考情况下,利用大语言模型作为生成和评估时间序列解释的工具,通过构造合成基准测试,评估模型在生成解释、相对排序、独立评分和多异常检测任务中的表现,发现评估任务比生成任务更稳定。

Comments Accepted at ICML FMSD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16893 2026-08-19 cs.CY cs.AI 新提交 90%

A Framework for Using and Evaluating LLMs as Surrogate Experts in Security Surveys: Reliability, Bias, and Implications

在安全调查中使用和评估大语言模型(LLM)作为代理专家的框架:可靠性、偏差及启示

Despoina Giarimpampa, Roland Meier, Tegawendé F. Bissyandé, Vincent Lenders, Jacques Klein

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出了评估LLM作为安全调查代理专家的框架,发现LLM虽内部一致但与专家响应存在系统性偏差,可用于试点和假设生成但不能替代专家征询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17994 2026-08-19 cs.CL 新提交 90%

Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees

判断、检索或弃权:带有可证明风险保证的不确定性引导大语言模型(LLM)判断

Sher Badshah, Ali Emami, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL;language model(comments)

AI总结 本研究针对无参考LLM评判的可靠性问题,提出带可证明风险保证的不确定性引导双模式风险控制框架,在维持目标错误率的同时提升了判决覆盖率。

Comments Accepted at Conference on Language Modelling 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17270 2026-08-19 cs.AI 新提交 90%

Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking

大型语言模型(LLMs)能否判断优质假说?基于logit的能量评分在科学假说排序上优于提示式LLM评判器

Swati Rajwal, Sanjay Das, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对科学假说评估难题,提出基于logit的能量评分方法,在12学科1323篇论文的基准测试中,该方法的Hit@1显著优于提示式LLM评判器,展现出模型内在置信度的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15382 2026-08-19 cs.AI cs.CL cs.IR q-bio.QM 交叉投稿 90%

Grounding Healthcare LLMs in a Causal Knowledge Graph: Framework, Metrics, and a Cardiovascular Pilot

将医疗大语言模型(LLM)基于因果知识图谱:框架、指标与心血管试点研究

Ummara Mumtaz, Aimen Noor, Awais Ahmed

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出以因果知识图谱为核心的医疗LLM评估框架,在心血管试点中验证其有效性,发现集成条件C4在因果推理相关指标上表现最优,未基于图的C1原始干预准确性最高但缺乏因果与证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17326 2026-08-19 cs.HC 新提交 89%

Procedural Collapse: A Structural Account of Disengagement in LLM-Assisted Writing

程序崩溃:大语言模型辅助写作中脱离的结构解释

JaeWon Kim, Katelyn Mei

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文针对学生使用LLM写作时脱离的问题,提出结构层面解释,指出当前界面引发程序崩溃,给出分解式交互等设计方向以支持AI辅助写作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29894 2026-08-19 quant-ph 版本更新 89%

LLM-Guided Evolutionary Search for Algebraic T-Count Optimization

基于LLM的引导进化搜索在代数T计数优化中的应用

Daniil Fisher, Valentin Khrulkov, Mikhail Saygin, Ivan Oseledets, Stanislav Straupe

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出VarTODD方法,通过分离代数重写系统与搜索策略,利用LLM引导的进化算法优化T计数,提升量子电路编译效率。

Comments 13 pages, 5 figures, 2 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17933 2026-08-19 cs.AI cs.CE 新提交 87%

EvoTS-Agent: A Self-Evolving LLM Agent for Financial Time Series Change Point Detection

EvoTS-Agent:一种用于金融时间序列变点检测的自进化大语言模型智能体

Lei Jiang, Ye Wei, Xinyu Xi, Jordan Langham-Lopez, Yifan Bao, Raad Khraishi, Yihao Ang, Anthony K. H. Tung, Lukasz Szpruch, Hao Ni

机构 * Alan Turing Institute(阿兰·图灵研究所) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) NatWest AI Research(国民西敏寺银行人工智能研究部) University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究针对金融时间序列变点检测难题,提出自进化 LLM 智能体 EvoTS-Agent,经验证引导进化检测流程,在四个基准数据集上表现优于现有同类智能体且执行成功率达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14825 2026-08-19 cs.MA cs.AI 版本更新 87%

Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce

长视野多智能体大语言模型商业环境中涌现的对齐失效通信

Zeyuan Li, Lukas Petersson, Alessandro Acquisti, Michiel A. Bakker

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17810 2026-08-19 cs.CL cs.AI cs.HC 新提交 87%

Interpretable Humans, Alien LLMs: Expert Analysis of Latent Structures in Assessment Responses

可解释的人类,陌生的大语言模型:对评估响应中潜在结构的专家分析

Alona Strugatski, Licol Zeinfeld, Jason Cooper, Shelley Rap, Gil Schwarts, Giora Alexandron

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究结合探索性因子分析与学科专家盲审,发现6个LLMs的评估响应潜在因子与人类认知结构的可解释性存在显著差异,多数LLM因子无法被人类专家解读,揭示其机制与人类推理不同。

Comments Accepted for publication at AIME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17105 2026-08-19 cs.CY 新提交 87%

Language Models Reproduce Human Reductionist Bias and Decision Inconsistency in Neurodevelopmental Disorders Assessment

语言模型在神经发育障碍评估中再现了人类的简化主义偏差与决策不一致性

Maciej Wodziński, Joanna Wodzińska, Kacper Dudzic, Marcin Moskalewicz

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 研究通过对比人类与7个LLMs,发现LLMs虽表现出更高智力谦逊,却再现了人类在神经发育障碍评估中的简化主义偏差与决策不一致性,强调需审查AI的神经多样性操作化概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04180 2026-08-19 cs.LG 版本更新 86%

A Comparative Study of Feature Selection Methods for EHR Diagnosis Codes in Opioid Use Disorder Prediction

阿片类药物使用障碍预测中用于电子健康记录诊断代码的特征选择方法对比研究

Zihan Ding, Yinan Liu, Tengfei Ma, Rachel Wong, Xia Zhao, Richard N. Rosenthal, Fusheng Wang

机构 * Stony Brook University(石溪大学) Rutgers University(罗格斯大学) University of Vermont(佛蒙特大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究对比五种特征选择方法在阿片类药物使用障碍预测中的表现,发现NTK敏感性方法在准确性与稳定性间平衡最优,LLM引导选择可提供互补临床信号。

Comments Accepted at the AMIA 2026 Annual Symposium. Author list corrected to match the accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17355 2026-08-19 cs.CR cs.CE cs.CY 新提交 86%

FlowShield: cryptocurrency anti-money laundering with transaction semantics parsing and fund flow tracking

FlowShield:基于交易语义解析与资金流追踪的加密货币反洗钱

Qishuang Fu, Andreas Deppeler, Joseph K. Liu, Yixin Liu, Shirui Pan, Qin Wang, Weiqing Wang, Tsz Hon Yuen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 FlowShield是一种加密货币反洗钱框架,通过解析交易语义、重构资金流子图并结合LLM与GCN实现洗钱检测,在BybitML等数据集上平均F1达98.0%,还可生成可读报告辅助调查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17029 2026-08-19 cs.SE cs.HC 新提交 86%

LadderTeam: Dual-Agent Laddering Elicitation Framework

LadderTeam:双智能体阶梯式引出框架

Manjushree Aithal, Alexander Kotz, James Mitchell

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 LadderTeam是基于双智能体LLM架构的自动化UX线框图访谈框架,采用三种探测策略,经216次模拟访谈验证,实现高收敛率与可执行响应匹配率,且无主题偏离。

Comments 4 pages, 1 figure, 2 tables, Accepted in ACM AI Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17445 2026-08-19 cs.CR cs.CL 新提交 85%

Decomposition Attacks Across Unlinkable Identities: Limits of Stateful Defenses for LLM Services

跨不可链接身份的分解攻击:大语言模型服务的有状态防御的局限性

Bowen Sun, Zhengyue Zhao, Xiaogeng Liu, Yinzhi Cao, Chaowei Xiao

专题命中 评测与基准 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究发现,针对跨不可链接身份的分解攻击,现有有状态防御策略在攻击者可重试学习时无法有效阻止攻击,需引入身份链接等额外分组相关机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17379 2026-08-19 cs.CL cs.AI 新提交 85%

PTXBench: Benchmark and Adapt LLMs for GPU Kernel Optimization with Architecture-specific PTX

PTXBench:用于结合架构特定PTX优化GPU内核的大型语言模型基准测试与适配

Genghan Zhang, Yixin Dong, Chengze Fan, Zhichen Zeng, Yueming Yuan, Shaowei Zhu, Kunle Olukotun

机构 * Carnegie Mellon University(卡内基梅隆大学) RadixArk Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出PTXBench基准测试,评估LLM结合架构特定PTX优化GPU内核的能力,发现现有模型能力不均衡,经微调Qwen3.6-27B可改善部分任务但泛化仍不均,该基准为相关研究提供可审计测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17168 2026-08-19 cs.CL cs.AI 新提交 85%

Can LLMs Reason in a Legally Meaningful Manner? A Small-scale Study on European Court of Human Rights Cases

大语言模型能否以具有法律意义的方式进行推理?针对欧洲人权法院案件的小规模研究

Amogh Raina, Ilias Chalkidis, Daniel Hershcovich, Henrik Palmer Olsen

机构 * University of Copenhagen(哥本哈根大学) Faculty of Law, University of Copenhagen(哥本哈根大学法学院) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究以欧洲人权法院案件为测试平台,评估OpenAI GPT 5.4的法律推理表现,发现其推理质量不足、LLM评估不可替代人工,且专家提示未提升预测准确率。

Comments 24 pages, 4 figures, 4 tables, Submitted to AI4LAW Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17530 2026-08-19 cs.AI cs.LG 新提交 84%

When to Review: Spaced Repetition for Continual Pre-Training of Language Models

何时复习:语言模型持续预训练的间隔重复方法

Alankar Atreya, Devesh Batra, Yoages Kumar Mantri, Geremy Bantug, Greig A Cowan, Raad Khraishi

机构 * University College London(伦敦大学学院) NatWest AI Research(国民西敏寺银行人工智能研究部)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出受认知科学启发的SRT框架,采用SM-2算法调度样本重放,可恢复大型语言模型持续预训练中5至37个百分点的旧知识准确率,同时保留或提升新知识获取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17150 2026-08-19 cs.AI cs.CL cs.HC 新提交 84%

KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn

KnowSim:用学习的用户模拟器评估大语言模型助手的信息校准

Yoonjoo Lee, Hyoungwook Jin, Tae Soo Kim, Shaoyang Zhang, Philippe Laban, Q. Vera Liao

机构 * University of Michigan(密歇根大学) KAIST(韩国科学技术院) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出KNOWSIM框架,通过带显式知识状态的用户模拟器评估LLMs的信息校准,验证后其性能优于基线,可揭示用户知识水平与LLMs的适配关系。

Comments 30 pages, 6 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17687 2026-08-19 cs.AI cs.LG 新提交 82%

Mixture-of-Expert Blocks Contain Strong Hallucination Detection Signals

混合专家模块包含强幻觉检测信号

Joao Fonseca, Rodrigo Rodrigues, Paolo Romano

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出首个利用混合专家(MoE)专属内部信号的InnerExpert方法,在五个数据集和两种MoE架构上,以单次前向传播实现优于现有方法的逐词幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00547 2026-08-19 cs.AI cs.LG 版本更新 82%

Does Unification Come at a Cost? Uni-SafeBench: A Safety Benchmark for Unified Multimodal Large Models

统一是否带来代价?Uni-SafeBench:一种用于统一多模态大模型的安全基准

Zixiang Peng, Yongxiu Xu, Qin-Yi Zhang, Jiexun Shen, Yi-Fan Zhang, Hongbo Xu, Yubin Wang, Gaopeng Gou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Uni-SafeBench,用于评估统一多模态大模型的安全性,发现统一过程虽提升能力但显著降低基础LLM的安全性,开源资源以促进更安全的AGI发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17979 2026-08-19 cs.CL 新提交 81%

When Writing Style Drifts: Benchmarking Authorship Verification under Distribution Shifts in Genre, Time and the AI-Era

当写作风格发生漂移:在体裁、时间与AI时代的分布偏移下对作者验证进行基准测试

Lotta Kiefer, Brisca Balthes, Christoph Leiter, Yamen Ajjour, Elena Schmidt, Steffen Eger

机构 * University of Technology Nuremberg (UTN)(纽伦堡工业大学(UTN))

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本研究推出首个德语作者验证基准AVShift,对跨体裁、时间及AI时代分布偏移下的作者验证进行基准测试,发现微调LLM跨体裁泛化最佳,时间漂移是影响作者验证的最强因素之一,未观测到可测量的AI时代分布偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏