arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2678 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 964 篇

2608.10216 2026-08-12 cs.CL cs.AI 新提交 62%

Similarity Gates Approve Reversals: A Validity Audit of Embedding-Cosine Thresholds in Agent Systems

相似度门控认可反转:智能体系统中嵌入余弦阈值的有效性审计

Scott E. Frias

机构 * Eigenforma(艾根福马) Freemind Labs(自由思维实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究审计智能体系统中嵌入余弦阈值门控的有效性,发现其无法区分指令反转与释义、性能差且易受混杂因素影响,多数修复措施失效,仅部分配置可区分反转与释义。

Comments 11 pages, 2 figures. Artifact: https://github.com/eigenforma/polaritycheck (DOI: 10.5281/zenodo.21796531)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09028 2026-08-11 cs.AI cs.CL cs.DB cs.LO 新提交 62%

PolicyKG: An Agentic LLM Pipeline for Translating Institutional Policies into SHACL Knowledge Graphs

PolicyKG:一种用于将机构政策转换为SHACL知识图谱的智能体大语言模型流水线

Ponkrit Kaewsawee, Chaklam Silpasuwanchai, Chutiporn Anutariya

机构 * Asian Institute of Technology(亚洲理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出PolicyKG流水线,可自动将机构政策转换为SHACL知识图谱,在AIT语料库上取得高分类准确率,适配新领域仅需替换注册表,解决了人工转换的效率问题。

Comments 23 pages, 3 figures, 4 tables. Under review at IJCKG 2026, Bangkok, Thailand

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08182 2026-08-11 cs.LG cs.AI 新提交 62%

Biologically Informed Representation Learning for Robust Cross-Center Generalization of MALDI-TOF Mass Spectrometry

用于MALDI-TOF质谱稳健跨中心泛化的生物学信息表征学习

Alejandro L. García-Navarro, Carlos Sevilla-Salcedo, Belén Rodríguez-Sánchez, Vanessa Gómez-Verdejo

机构 * Universidad Carlos III de Madrid(卡洛斯三世大学) Instituto de Investigación Sanitaria Gregorio Marañón(格雷戈里奥·马拉尼翁卫生研究所) Hospital General Universitario Gregorio Marañón(格雷戈里奥·马拉尼翁大学总医院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对MALDI-TOF质谱模型跨中心部署的域偏移问题,提出DALMA框架,结合采集变异性与生物学监督学习可迁移表征,在多中心基准的零样本微生物鉴定等任务中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07693 2026-08-11 cs.CV cs.AI cs.CL 新提交 62%

CosmosAlign: Adapting a World Foundation Model for Generative Traffic Video Forecasting

CosmosAlign:适配世界基础模型用于生成式交通视频预测

Quang Minh Dinh, Tuan Kiet Doan

机构 * Simon Fraser University(西蒙菲莎大学) Institut Polytechnique de Paris(巴黎综合理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出基于Cosmos3-Nano的CosmosAlign框架,通过两阶段LoRA适配与推理优化,在AI City Challenge 2026 Track 5基准中获76.49分排名第一,实现了高质量交通视频预测。

Comments Accepted at ECCVW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05810 2026-08-07 cs.AI cs.CL 新提交 62%

When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents

当自进化适得其反:针对LLM智能体中技能污染的预提交门控机制

Linfang Shang, Ming Xu, Yiding Sun, Tianle Xia, Lingxiang Hu, Lan Xu, Ning Zheng

专题命中 安全评测 :harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现LLM智能体自进化会出现技能污染导致性能下降的不可逆问题,提出VaG预提交门控机制,可提升性能并实现技能池跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05695 2026-08-07 cs.AI cs.CL cs.CR 新提交 62%

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏

Wenhao Lin, Chenyu Yu, Xingwei Lin, Sicong Cao, Xiang Chen, Lei Xue, Le Yu, Letian Sha, Chunming Wu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05164 2026-08-07 cs.CL cs.LG 新提交 62%

Cross-Architecture Steering Transfer in Language Models: A Systematic Empirical Study

语言模型中的跨架构引导迁移:一项系统实证研究

Ayushi Agarwal

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过系统实证发现,在1.7B参数规模以上,独立训练的大语言模型间存在可利用的跨架构引导迁移,验证了柏拉图式表征假说的功能层面补充,强调了机制可解释性中的规模阈值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05153 2026-08-07 cs.CL cs.AI 新提交 62%

Universal Pathologies, Conditional Consequences: A Triple-Robustness Analysis of RAG for Multi-Hop Traceability

普遍存在的缺陷与有条件的后果:面向多跳可追溯性的RAG的三重鲁棒性分析

Meftun Akarsu, Burak Ozdemir

机构 * Technische Hochschule Ingolstadt(英戈尔施塔特应用技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过三重鲁棒性分析,探究了不同嵌入器、语料库、评判器下GraphRAG与向量RAG的多跳可追溯性表现,发现过度引用具架构普遍性,忠实度后果受语料库影响,提出三重鲁棒性为可信RAG架构主张的最低标准。

Comments 5 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05139 2026-08-06 cs.CL cs.LG 新提交 62%

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵

Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) University of Oxford(牛津大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。

Comments https://github.com/Gen-Verse/Skill-Entropy-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04524 2026-08-06 cs.CL cs.LG 新提交 62%

ODRA: Synthesizing Cognitive Behavioral Therapy Sessions with Structured Chain-Of-Thought and Dynamic Patient Resistance

ODRA:结合结构化思维链与动态患者阻抗的认知行为治疗会话合成

Javier Rodriguez-Juan, Hiba Arnaout, Jose Garcia-Rodriguez, David Tomás, Iryna Gurevych

机构 * University of Alicante(阿利坎特大学) Technische Universität Darmstadt(达姆施塔特工业大学) Hessian Center for AI (hessian.AI)(黑森人工智能中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出ODRA框架,结合结构化思维链与动态患者阻抗建模合成CBT会话,解决现有方法的顺从性问题,其生成的会话及微调数据集可提升下游治疗性能。

Comments 39 pages, 23 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04285 2026-08-06 cs.AI cs.LG 新提交 62%

The RAIL Principles for Neurosymbolic AI: Reasoning, Assurances, Interfacing and Learning

神经符号AI的RAIL原则:推理(Reasoning)、保证(Assurances)、接口(Interfacing)与学习(Learning)

Agnese Chiatti, Michael Cochez, Cristina Cornelio, Sebastijan Dumancic, Artur d'Avila Garcez, Luis C. Lamb, Lia Morra, Mathias Niepert, Robert Peharz, Alberto Speranzon, Maarten Stol, Annette Ten Teije, Thiviyan Thanapalasingam, Frank Van Harmelen, Emile Van Krieken, Antonio Vergari, Benjie Wang

机构 * Politecnico di Milano(米兰理工大学) ELLIS Institute Finland(芬兰ELLIS研究所) Åbo Akademi University(奥博 Akademi 大学) Samsung AI(三星人工智能研究院) Delft University of Technology(代尔夫特理工大学) Stony Brook University(石溪大学) Politecnico di Torino(都灵理工大学) University of Stuttgart(斯图加特大学) Graz University of Technology(格拉茨工业大学) Lockheed Martin, Advanced Technology Labs(洛克希德·马丁公司先进技术实验室) BrainCreators(BrainCreators公司) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Amsterdam(阿姆斯特丹大学) University of Edinburgh(爱丁堡大学) UCLA(加利福尼亚大学洛杉矶分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该文提出神经符号AI的RAIL四项原则,可统一分析多类AI系统,助力工程师更科学地设计部署生产级AI,指导整合神经符号方法到下一代AI技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03772 2026-08-05 cs.AI cs.LG cs.LO 新提交 62%

Computing Actual Causes for Neural Network Predictions under Structured Causal Inputs

结构化因果输入下神经网络预测的实际原因计算

Jannick Strobel, Muqsit Azeem, Stefan Leue

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对结构化因果输入下神经网络预测解释的误导性问题,提出基于布尔结构因果模型与边界传播、分支定界技术的方法,可高效计算所有最小实际原因,性能优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03700 2026-08-05 cs.CR cs.CL cs.CY 新提交 62%

When Agents Learn to Be You: Benchmarking Privacy Leakage, Impersonation Risk, and Defenses in Persona Skills

当智能体学会成为你:对角色技能中的隐私泄露、冒充风险及防御措施进行基准测试

Yongli Xiang, Zhifang Zhang, Bojun Yang, Ziming Hong, Lei Feng, Miao Xu, Tongliang Liu

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 该研究推出AntiSkillBench基准,评估角色技能流程的隐私泄露、冒充风险及防御,发现风险持续存在,现有防御效果有限,为相关技能开发提供基准。

Comments Project page: https://yonglixiang.github.io/AntiSkillBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03626 2026-08-05 cs.CR cs.AI cs.CY 新提交 62%

A Security-Oriented Lifecycle Model for Large Language Model Systems

面向大型语言模型系统的安全导向生命周期模型

Eleftherios Batzolis, George Drosatos, Vassilis Katsouros, Konstantinos Rantos

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文针对LLM系统生命周期框架重效率轻安全、治理与生命周期阶段脱节的问题,提出含32个阶段的安全导向生命周期模型,整合多监管框架发现治理证据分布不均的结构特性。

Comments Accepted as: Batzolis, E., Drosatos, G., Katsouros, V., & Rantos, K. (2026). A Security-Oriented Lifecycle Model for Large Language Model Systems. In: Kieseberg, P., Skopik, F., Atli, B., Schrittwieser, S., & Asplund, M. (Eds.), Availability, reliability and security---ARES 2026 EU Projects Symposium workshops (Lecture Notes in Computer Science, pp. 1-18). Springer Nature Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03581 2026-08-05 cs.CY cs.AI 新提交 62%

AI-Assisted Peer Review Across Research Communities: From Reviewer AI Policies to LLM Review Quality

跨研究社区的AI辅助同行评审:从评审人AI政策到大语言模型评审质量

Alexander M. Fichtl, Lukas Ellinger, Josefin Kelber, Kryštof Olík, Georg Groh

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 该研究调研111个顶尖AI/NLP会议及医学期刊的AI评审政策,评估ICLR 2026和《自然·通讯》的AI评审质量,发现AI评审存在系统性缺陷,主张采用多维度评估。

Comments 30 pages, 19 figures, 10 tables. Currently under peer review. GitHub link for code and data is given in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03148 2026-08-05 cs.LG cs.AI 新提交 62%

Lightweight Chunk Selection for Mobile Retrieval-Augmented Generation

面向移动端检索增强生成的轻量级分块选择

Sicong Chang, Yidan Shen, Wen Yu, Jiefu Chen, Xin Fu, Renjie Hu

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文针对移动端RAG部署的成本问题,提出结合LLM侧查询意图、MoE路由信号与检索分块嵌入的轻量级分块选择方法,提升了排名1的证据选择性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01792 2026-08-04 cs.AI cs.CL 新提交 62%

Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction

你能信任置信度吗?面向文档提取的视觉语言模型ConfBench

Priyashree Roy, Sujitha Martin, Mohammad Rostami, Spencer Romo, Renhao Xue, Bob Strahan, Diego A. Socolinsky, Boyi Xie, Md Mofijul Islam

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对视觉语言模型的文档提取任务推出校准专用基准ConfBench,评估多类VLM的置信度估计方法,揭示模态、模型能力等对置信度的影响,发布相关指标以助力可信IDP部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00717 2026-08-04 cs.AI cs.CL 新提交 62%

AI-Based Thesis Assessment: An Empirical Study of Human Evaluation Priorities and Their Impact on Automated Assessment

基于人工智能的论文评审:关于人类评审优先级及其对自动评审影响的实证研究

Garv Vikram Gursahaney, Baskhad Idrisov, Thorsten Fröhlich, Tim Schlippe

机构 * IU International University of Applied Sciences(IU应用科学大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究调查了84名导师确定的35项论文评审准则权重,对比人工智能系统RubiSCoT的默认权重后发现存在显著差异,整合导师权重的最优配置仅小幅降低评审偏差且无统计显著性,仅权重校准无法大幅提升AI与人类评审的一致性。

Comments Accepted for publication in the Proceedings of the 7th International Conference on Artificial Intelligence in Education Technology (AIET 2026), Zagreb, Croatia

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00011 2026-08-04 cs.CL cs.AI 新提交 62%

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

DLLM-TTS:用于文本到语音合成的块离散扩散语言模型

Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 DLLM-TTS 框架,将 TTS 建模为基于 X-Codec2 的条件块离散扩散,通过块内掩码扩散与并行预测实现高效语音生成,在 Seed-TTS-eval 基准上取得良好性能,兼具实用性与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29624 2026-08-03 cs.CY cs.AI cs.HC 新提交 62%

The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations

苏格拉底测试的理论基础:动态、多模态、对话式考试

Ilya Mikhelson

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出苏格拉底测试的理论基础,整合多类教育评估原则与分类学,量化最近发展区并设计非补偿性加法评分架构,以解决传统评估的缺陷并提升测量可靠性。

Comments 21 pages, 1 figure, submitted to Computers and Education: Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28665 2026-08-03 cs.LG cs.AI 新提交 62%

Sensitivity Analysis of GRU, LSTM and Transformer Encoder in Classification of Automated Driving Systems

GRU、LSTM与Transformer编码器在自动驾驶系统分类中的敏感性分析

Bidhya Shrestha, Christos Papadopoulos

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文研究GRU、LSTM、Transformer编码器对Level 2级自动驾驶系统的分类性能,提出含5类损坏的鲁棒性评估框架,发现时间抖动会大幅降低三类模型的宏F1。

Comments 7 pages, 6 figures, under review Milcom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28146 2026-07-31 cs.CL cs.AI 新提交 62%

Can Agents Deceive? Evaluating Reasoning and Deception in ParliamentBench using a Social Deduction Game

智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗能力

Niklas Bauer, Lars Benedikt Kaesberg, Akiko Aizawa, Jan Philip Wahle, Bela Gipp, Terry Ruas

机构 * University of Göttingen(哥廷根大学) National Institute of Informatics(信息学研究所) University of Tokyo(东京大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究基于《Secret Hitler》游戏构建ParliamentBench基准,评估16个LLM的欺骗与推理能力,发现前沿模型表现优异,多数LLM难以维持一致的欺骗人设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26066 2026-07-30 cs.CL cs.AI cs.DL 新提交 62%

Do Methods Support the Claims? Intra-Paper Verification for Peer Review

方法是否支持其主张?用于同行评审的论文内部验证

Ranjitha Shivaprasad Ballakuraya, Arash Mahyari, Ashok Srinivasan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有 LLM 评审系统忽视论文内部主张与方法学证据不匹配的问题,提出 intra-paper claim verification 框架,经实验验证其生成的评审意见与人类评审关注点高度契合。

Comments 9 pages, 8 figures. Source code, prompts, evaluation materials, and supporting data available at https://github.com/Ranjitha2493/intra-paper-claim-method-verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25947 2026-07-29 cs.AI cs.CL 新提交 62%

A Cost-Effective Multimodal LLM Reasoning Framework for Question Answering over Irregular Clinical Time Series

一种用于不规则临床时间序列问答的经济高效多模态大语言模型推理框架

Frank Nie, Ethan B Liu, Yuan Zhu, Wei Fan, Jindong Han

机构 * Shandong University(山东大学) University of Auckland(奥克兰大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对不规则临床时间序列问答,提出ClinPRISM框架。该框架含不规则感知多尺度编码器、时间证据蒸馏器和渐进对齐策略,通过构建训练数据,在40亿参数大语言模型主干上实现最优性能,兼具低时间序列令牌数和低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交 62%

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23175 2026-07-28 cs.CL cs.AI 新提交 62%

Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining

超越全局规范:无需重新训练即可在语言模型中实现毒性敏感性个性化

Rares A. C. Diaconescu, Iulia Slanina, Alina Florea, Andrei B. Trache, Miruna E. Coroi, Anne Arzberger, Jie Yang, Enrico Liscio

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究如何在语言模型中实现毒性敏感性个性化,通过对免训练方法在三个推理阶段进行比较评估,与PRISM数据集目标对比,各方法降低对齐误差28 - 47%,揭示了多目标间权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22218 2026-07-27 cs.CL cs.AI 新提交 62%

Why Large Language Models and Humans Converge and Diverge in Evaluating Creativity

为什么大语言模型与人类在评估创造力时会趋同和背离

Pengzhao Lyu, Yeun Joon Kim, Hanlin Xiao, Yingyue Luna Luan

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型与人类评估创造力时趋同和背离的原因,通过三项研究和六个模型,识别其评估标准及影响,发现一致性取决于判断证据和模型标准,强调内在品质时趋同,需上下文信息时背离,选评估模型很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21627 2026-07-27 cs.AI cs.LG 新提交 62%

Do Modules Stay in Their Lane? Role Drift in Compound LLM Systems

模块各司其职吗?复合语言模型系统中的角色漂移

Xiaoyang Cao, Siddarth Srinivasan, Michiel A. Bakker

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究复合语言模型系统中模块的角色漂移问题,提出角色锚定正则化方法,通过实验揭示仅准确性无法检测的角色漂移,该方法能以可调成本减轻漂移,且减少与角色漂移方向的对齐,而非简单抑制学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20558 2026-07-24 cs.LG cs.AI 新提交 62%

StabilityBench: Benchmarking Instability in LLMs

StabilityBench:评估大语言模型中的不稳定性

Emma Kondrup, Zachary Yang, Anne Imouza, Reihaneh Rabbany

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型实际行为难测、现有评估协议有局限的问题,提出StabilityBench基准测试工具,通过注入现实模拟增强现有基准,应用于四个基准测试评估九个模型,发现性能不稳定,还提出StabilityBench-Mini以实现更现实评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20476 2026-07-24 cs.AI cs.CL 新提交 62%

Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment

在多传感器物理危害评估中对大语言模型进行基准测试

Faizan Iqbal

机构 * Lovely Professional University(可爱专业大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究五个大语言模型对多传感器物理危害数据的评估,通过1800次API调用测试60个场景,发现模型在多传感器场景表现不佳,单传感器场景表现良好,且结构化表格格式优势不明显,为从业者提供了模型应用参考。

Comments 14 pages, 6 figures. Benchmark dataset, evaluation code, and raw results publicly available at: https://github.com/Faizaniqbal52/PhysicalHazardBenchmark

详情

展开后加载摘要…

URL PDF HTML 收藏