arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-05 至 2026-06-05 共收录 91 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 37 篇

2606.05616 2026-06-05 cs.CL 57%

What's in a Name? Morphological Shortcuts by LLMs in Pharmacology

名字里有什么?LLM在药理学中的形态捷径

Kaijie Mo, Thomas Yang, Chantal Shaib, Qing Yao, William Rudman, Ramez Kouzy, Kanishka Misra, Byron C. Wallace, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Northeastern University(东北大学) MD Anderson Cancer Center(MD安德森癌症中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究LLM在药理学中依赖词缀线索进行推理的形态捷径行为,通过虚构药物名称实验和归因框架揭示其机制及安全风险。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05497 2026-06-05 cs.LG 57%

LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, "Is Your VLM Smarter Than a 5th Grader?")

LEVANTE-bench: 使用认知任务对VLM与儿童进行多尺度比较(或者,“你的VLM比五年级学生聪明吗?”)

Alvin Wei Ming Tan, David Cardinal, Tania Lorido-Botran, Laura Bravo-Sanchez, Sunny Yu, Michael C. Frank

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出LEVANTE-bench基准,基于儿童认知任务数据,从多个尺度系统评估视觉语言模型与5-12岁儿童在六项任务上的对齐程度,发现模型与人类认知仅部分对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28579 2026-06-05 cs.AI 57%

MUSE: Benchmarking Manufacturable, Functional, and Assemblable Text-to-CAD Generation

MUSE: 面向可制造、功能性和可装配的文本到CAD生成的基准测试

Xiaoyu Dong, Zhi Li, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) Curvature Flow Co., Limited(曲率流有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出MUSE基准,通过三阶段评估协议(代码检查、几何检查、设计意图对齐)和基于规则的语言模型评判,衡量文本到CAD生成模型在功能、制造和装配方面的实际设计质量。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02628 2026-06-05 cs.LG 57%

A Generative Approach for Semantic Auditing of Electronic Health Records

电子健康记录语义审计的生成式方法

Irena Girshovitz, Atai Ambus, Moni Shahar, Ran Gilad-Bachrach

机构 * School of Biomedical Engineering, Faculty of Engineering, Tel Aviv University(特拉维夫大学生物医学工程学院,工程学院) AI and Data Science Center of Tel Aviv University (TAD)(特拉维夫大学人工智能与数据科学中心(TAD)) Safra Center for Bioinformatics, Tel Aviv University(特拉维夫大学萨弗拉生物信息学中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 提出一种基于大语言模型的生成式方法,通过语义数据覆盖和检索增强生成架构自动检测电子健康记录与流行病学证据之间的不一致性,实现可扩展的语义审计。

Comments 23 pages, 5 figures (+ appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18937 2026-06-05 cs.AI 57%

Evaluating the Utility of Personal Health Records in Personalized Health AI

评估个人健康记录在个性化健康AI中的效用

Rory Sayres, Kejia Chen, Ayush Jain, Matthew Thompson, Jonathan Richina, Xiang Yin, Jimmy Hu, Fan Zhang, Bob Lou, Mike Sanchez, Ines Mezerreg, Meredith Schreier, Hamsa Subramaniam, I-Ching Lee, Yugang Jia, Daniel Mcduff, Yossi Matias, Avinatan Hassidim, Dale Webster, Yun Liu, Jackie Barr, Quang Duong

机构 * Google Research(谷歌研究)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了利用个人健康记录(PHR)中的临床数据通过大语言模型(LLM)回答用户健康问题的效用,发现提供PHR上下文能显著提高回答的有用性、安全性和个性化水平,并揭示了LLM在理解复杂PHR方面的不足。

Comments 35 pages, 3 figures, 10 tables [bugfix / minor numerical update]

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00460 2026-06-05 cs.CL 57%

Pitfalls of Evaluating Language Models with Open Benchmarks

使用开放基准评估语言模型的陷阱

Md. Najib Hasan, Md Mahadi Hassan Sibat, Mohammad Fakhruddin Babar, Souvika Sarkar, Monowar Hasan, Santu Karmaker

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文探讨了使用开放基准评估语言模型时存在的数据泄露风险,并通过构建作弊模型验证了这种风险,指出开放基准可能无法反映实际应用效果,需补充私有或动态生成的基准以维持评估的完整性。

Comments After further review, we found that the core contribution and methodology substantially overlap with previously published work. As a result, the manuscript does not provide a sufficiently distinct or original contribution in its current form. To avoid repetition in the literature and prevent possible confusion for readers, we believe withdrawal is the most appropriate action

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14792 2026-06-05 cs.AI cs.SE 57%

IaC Generation with LLMs: An Error Taxonomy and A Study on Configuration Knowledge Injection

利用LLM生成IaC:错误分类法与配置知识注入研究

Roman Nekrasov, Stefano Fossati, Indika Kumara, Damian Andrew Tamburri, Willem-Jan van den Heuvel

机构 * Jheronimus Academy of Data Science(Jheronimus数据科学学院) Tilburg University(蒂尔堡大学) Eindhoven University of Technology(埃因霍温理工大学) University of Sannio(萨诺尼大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究探讨了如何通过系统性地注入结构化配置知识来提高LLM生成正确且意图一致的基础设施即代码(IaC)能力,特别是在Terraform中,提出了新的错误分类法,并评估了多种知识注入技术。

Comments Submitted to ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22768 2026-06-05 cs.CL 57%

Seeing is Believing? Evaluating Vision-Language Model Susceptibility in Agent-to-Agent Multimodal Persuasion

见多识广?评估面向Agent-to-Agent多模态说服的视觉语言模型易受性

Haoyi Qiu, Yilun Zhou, Pranav Narayanan Venkit, Kung-Hsiang Huang, Jiaxin Zhang, Nanyun Peng, Chien-Sheng Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce AI研究)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文研究了在多智能体多模态说服场景中,视觉语言模型对多模态内容的易受性,提出了MMPersuade框架和数据集,通过实验揭示了多模态输入在说服中的优势,以及说服对象的领域和格式依赖性,以及心理策略在不同上下文和模型架构下的效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05708 2026-06-05 cs.CV 50%

Real-Time Threat Detection from Surveillance Cameras using Machine Learning

基于机器学习的监控摄像头实时威胁检测

Gajendra Mandal, J. P. Patra, Priyansh Mahant

专题命中 安全评测 :safety(abstract)

AI总结 提出基于YOLOv8的实时目标检测框架,利用自定义钝器数据集与公开枪支刀具数据集训练模型,实现监控场景下枪支、刀具和钝器的有效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05499 2026-06-05 cs.SE 50%

STMutants: A Mutation Testing Dataset for Structured Text Programs in Industrial Automation

STMutants:工业自动化中结构化文本程序的变异测试数据集

Md Humaun Kabir, Md Rakibul Islam, Helen H. Lou

专题命中 安全评测 :safety(abstract)

AI总结 针对IEC 61131-3结构化文本程序缺乏公开变异测试基准的问题,构建了包含108个一阶变异体的数据集STMutants,涵盖七类变异算子,并评估了三个大语言模型在测试套件生成和变异检测中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25956 2026-06-05 cs.CV 50%

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

RAPTOR+: 一种基于视觉的视觉-语言框架,用于提高自动化癌症转诊处理中的临床信任度和可审计性

Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Anusha Jose, Adam Byfield, Lukman Akanbi, Muhammad Bilal

机构 * Birmingham City University(伯明翰城市大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) University Hospitals Birmingham NHS Foundation Trust(伯明翰大学医院 NHS 基础信托) NHS England(英格兰国家卫生服务体系)

专题命中 安全评测 :safety(abstract)

AI总结 提出RAPTOR+多模态框架,通过微调视觉-语言模型实现端到端转诊理解,在结直肠癌转诊表单上显著提升提取准确性和证据定位能力。

Comments 12 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2606.04037 2026-06-05 cs.AI cs.LG cs.SE 62%

Toward Pre-Deployment Assurance for Enterprise AI Agents: Ontology-Grounded Simulation and Trust Certification

面向企业AI代理的部署前保障:基于本体的仿真与信任认证

Thanh Luong Tuan, Abhijit Sanyal

机构 * Golden Gate University(金门大学) Data, Digital & IT, Novartis Healthcare Pvt. Ltd.(数据、数字与IT,诺华健康护理私人有限公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于本体的验证框架,通过本体驱动的场景生成和信任证书,实现企业AI代理在部署前的自动化监管合规与安全认证。

Comments 26 pages, 3 figures. Companion to arXiv:2604.00555. Code and data: https://github.com/frank-luongt/faos-research/tree/main/RA-6

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05256 2026-06-05 cs.AI 57%

How Far Did They Go? The Persuasive Tactics of Covert LLM Agents in a Discontinued Field Experiment

他们走了多远?已终止现场实验中隐蔽LLM代理的说服策略

Kokil Jaidka, Saifuddin Ahmed

机构 * Wee Kim Wee school of Communication and Information, Nanyang Technological University(魏家伟通信与信息学院,南洋理工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 通过分析Reddit r/ChangeMyView已终止现场实验的公开数据集,研究隐蔽LLM代理在身份丰富的讨论论坛中使用的说服策略,发现其系统性采用身份定位、权威信号、对齐策略和认知偏差触发,构成以说服效率为导向的修辞架构。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 18 篇

2606.05688 2026-06-05 cs.CL cs.AI 81%

Value-and-Structure Alignment for Routing-Consistent Quantization of Mixture-of-Experts Models

面向路由一致性的混合专家模型量化的值与结构对齐

Hancheol Park, Geonho Lee, Tairen Piao, Tae-Ho Kim

机构 * Nota Inc., South Korea(韩国Nota公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VSRAQ方法,通过值对齐和结构对齐两个互补目标保持量化前后的专家选择行为一致性,减少量化引起的性能下降,无需推理开销。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11618 2026-06-05 cs.LG 79%

Optimal CO2 storage management considering safety constraints in multi-stakeholder multi-site CCS projects: a Markov game perspective

考虑安全约束的多利益相关者多地点碳捕集与封存项目最优存储管理:从马尔可夫博弈视角

Jungang Chen, Seyyed A. Hosseini

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他安全 :safety(title,abstract);分类 cs.LG

AI总结 本文基于马尔可夫博弈方法,研究多利益相关者多地点碳捕集与封存项目中不同联盟结构对利益相关者目标的影响,提出一种考虑安全约束的多智能体强化学习框架,以实现多利益相关者的最优存储管理。

Comments 58 pages

Journal ref Int. J. Greenh. Gas Control 149 (2026) 104683

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20914 2026-06-05 cs.LG cs.AI cs.CL 67%

Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?

Everything, Everywhere, All at Once: Is Mechanistic Interpretability Identifiable?

Maxime Méloux, Silviu Maniu, François Portet, Maxime Peyrard

机构 * Université Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、国家科学研究中心、格勒诺布尔INP、实验室LIG)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了在机械可解释性(MI)框架下,给定行为是否具有唯一解释的问题,通过统计可识别性理论分析了MI解释的可识别性,并提出了两种主要策略及实验结果。

Journal ref The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05185 2026-06-05 cs.CY cs.CV cs.LG 62%

Drishti AI-Event Guardian: An Intelligent Real-Time Crowd Monitoring and Emergency Response System for Mass Gathering Events

Drishti AI-Event Guardian:面向大规模聚集事件的智能实时人群监控与应急响应系统

Ritabrata Roy Choudhury, Arkajyoti Karmakar, Rudra Pratap Mitra

机构 * School of Computer Engineering, Kalinga Institute of Industrial Technology(计算机工程学院,凯林加工业技术学院) School of Electronics Engineering, Kalinga Institute of Industrial Technology(电子工程学院,凯林加工业技术学院)

专题命中 其他安全 :safety(abstract);分类 cs.CY、cs.LG

AI总结 提出Drishti AI-Event Guardian框架,结合YOLOv8、异常检测和梯度提升回归等多模态深度学习技术,实现实时人群密度估计、异常检测、预测建模、人脸识别、医疗紧急报告、聊天机器人和智能警卫重分配,在Kumbh Mela和RCB Victory Parade事件中验证了低延迟和高精度。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13830 2026-06-05 cs.AI cs.LG 62%

Quantifying Sensitivity for Tree Ensembles: A symbolic and compositional approach

对树集成模型的敏感性量化:一种符号和组合方法

Ajinkya Naik, Chaitanya Garg, S. Akshay, Ashutosh Gupta, Kuldeep S. Meel

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔分校) University of Toronto(多伦多大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种针对树集成模型的敏感性量化方法,通过离散化输入空间并枚举易受敏感性影响的区域,结合代数决策图(ADD)编码和分拆子问题,实现高效计算。实验表明,所提工具XCount在速度和可扩展性方面优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10823 2026-06-05 cs.CL cs.AI 62%

CLASH: Evaluating Language Models on Judging High-Stakes Dilemmas from Multiple Perspectives

CLASH:从多个视角评估语言模型在高风险困境中的判断

Ayoung Lee, Ryan Sungmo Kwon, Peter Railton, Lu Wang

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Philosophy(哲学系) University of Michigan Ann Arbor(安娜堡大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CLASH数据集,用于研究基于价值观的决策过程,发现语言模型在处理矛盾决策、心理不适和价值观变化时存在显著不足。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10486 2026-06-05 cs.AI cs.CL 62%

IDEAL: Leveraging Infinite and Dynamic Characterizations of Large Language Models for Query-focused Summarization

IDEAL: 利用大型语言模型的无限和动态特性进行查询导向的摘要

Jie Cao, Dian Jiao, Yang Dai, Rolan Yan, Wenqiao Zhang, Siliang Tang

机构 * Zhejiang University(浙江大学) Tencent, Wechat(腾讯,微信)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文针对查询导向摘要问题,提出两种核心方法:高效细粒度查询-LLM对齐和长文档摘要,通过Query-aware HyperExpert和Query-focused Infini-attention模块实现,实验验证了方法的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05395 2026-06-05 cs.RO cs.AI 57%

VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents

VASO:物理AI智能体的形式可验证自进化技能

Yunhao Yang, Neel P. Bhatt, Kevin Wang, Samuel Tetteh, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Iowa State University(爱荷华州立大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出VASO框架,通过形式验证引导LLM生成的机器人技能合约自进化,将模型检查的反例转化为文本梯度更新技能合约,无需微调模型权重,在Jackal和四旋翼任务中达到97.2%的形式规范符合率。

Comments Project webpage: https://languagegroundedriskdetection.github.io/ProjectPage/vaso-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05376 2026-06-05 cs.LG 57%

SHALA-LLM: Smartly Handling Ambiguous Labels in Aligning LLMs

SHALA-LLM:在对齐LLM中智能处理模糊标签

Jingyao Wu, Ashley Wang, Keane Ong, Paul Pu Liang, Rosalind Picard

机构 * MIT Media Lab, Massachusetts Institute of Technology(麻省理工学院媒体实验室、麻省理工学院) National University of Singapore(新加坡国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出SHALA-LLM强化学习框架,通过从标注者分布中学习并动态优先处理高模糊样本,改善LLM对模糊标签的建模,在NLI和情感识别任务中提升与标注者分布的一致性及分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03785 2026-06-05 cs.CL 57%

Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

后门遗忘泛化:走向移除大语言模型中未知触发器的路径

Lisa Bouger, Théo Lasnier, Philippe Loubet Moundi, Yannick Teglia, Djamé Seddah

机构 * Inria Paris(法国巴黎国家信息与自动化研究所) Sorbonne Université(索邦大学) Thales CDI(泰雷兹CDI)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本文通过实验证明,针对单个后门的遗忘训练可以泛化抑制其他未明确针对的后门,并引入交叉激活偏移距离量化不同训练引起的模型变化,为利用可控后门移除未知后门提供新方向。

Comments 22 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20628 2026-06-05 cs.CL 57%

Divide-Prompt-Refine: a Training-Free, Structure-Aware Framework for Biomedical Abstract Generation

Divide-Prompt-Refine:一种无需训练的、结构感知的生物医学摘要生成框架

Sylvey Lin, Joe Menke, Shufan Ming, Dongin Nam, Neil Smalheiser, Halil Kilicoglu

机构 * University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出DPR-BAG框架,旨在生成具有完整文本但无摘要的生物医学文章的连贯且事实准确的摘要。该框架通过分解全文文档为结构化的修辞要素,进行并行LLM摘要生成,并应用最终的精炼阶段恢复全局话语连贯性。

Comments Accepted by BioNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00054 2026-06-05 cs.CV cs.AI 57%

HiDe: Rethinking The Zoom-IN method in High Resolution MLLMs via Hierarchical Decoupling

HiDe: 通过分层解耦重新思考高分辨率MLLMs中的Zoom-IN方法

Xianjie Liu, Yiman Hu, Yixiong Zou, Liang Wu, Jian Xu, Bo Zheng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出HiDe框架,通过分层解耦方法解决高分辨率图像中背景干扰导致的视觉理解问题,提升多模态大语言模型在高分辨率图像任务中的性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06073 2026-06-05 cs.IR 50%

Edge-Aware Curvature Modeling for Graph Understanding in Large Language Models

面向大语言模型图理解的边缘感知曲率建模

Zhenghong Lin, Zhibin Shi, Hongyang Dong, Xinjie Ye, Yuhong Chen, Shiping Wang

专题命中 其他安全 :alignment(abstract)

AI总结 针对图感知大语言模型中节点级对齐忽略边缘信息导致信息传播次优的问题,提出CureLLM框架,通过无训练文本提示和曲率感知图表示学习注入边缘信号,在11个数据集上超越20种对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05916 2026-06-05 cs.CV 50%

Unveiling the Unknown: Open Vocabulary Object Detection with Scene Graphs

揭示未知:基于场景图的开放词汇目标检测

Yi Chen, Yinghao Lu, Zhehao Li, Chenchen Yan, Jiafei Wu, Chong Wang, Jiangbo Qian

机构 * Faculty of Electrical Engineering and Computer Science, Ningbo University(宁波大学电气工程与计算机科学学院) Faculty of Computing, Georg-August-Universität Göttingen(哥廷根大学计算机学院) Merchants’ Guild Economics and Cultural Intelligent Computing Laboratory, Ningbo University(宁波大学商帮经济与文化智能计算实验室) School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出场景引导的关系建模检测框架,利用场景图捕获候选区域与上下文对象之间的结构化语义和空间关系,并通过关系注意力模块和场景文本对齐分支增强开放词汇目标检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05909 2026-06-05 cs.SD eess.AS 50%

Beyond WER: A Paired Acoustic Stress Test for Ambient Clinical Scribes

超越WER:面向环境临床记录员的配对声学压力测试

Xiao-Hang Jiang, Han-Jie Guo, Ying-Si Liang, Yang Ai, Zhen-Hua Ling, Lei Jiang, Zhi-Yang He

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Co., Ltd.(iFLYTEK公司)

专题命中 其他安全 :safety(abstract)

AI总结 提出配对声学压力测试方法,通过注入噪声并冻结下游模型,揭示噪声对临床推理的安全影响,发现轻微声学扰动可逆转临床意义而不显著增加词错误率,并展示轻量级缓解策略。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05753 2026-06-05 cs.CV 50%

Cosine Misleads: Auxiliary Losses Reshape Vision Language Models, Not Their Latents

余弦误导:辅助损失重塑视觉语言模型,而非其潜变量

XiuYu Zhang, Junfeng Fang, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文通过实验发现,在视觉语言模型的潜视觉推理中,余弦相似度等对齐损失与准确性负相关,并引入PRISM诊断工具揭示潜变量被绕过,辅助损失主要通过共享参数重塑语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05383 2026-06-05 cs.CR cs.SE 50%

Evolution of Log-Based Detection Rules in Public Repositories

基于日志的检测规则在公共仓库中的演变

Minjun Long, David Evans

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了公共仓库中基于日志的检测规则的演变,通过分析Sigma和Splunk Security Content两个项目中的6859条规则历史,发现约56%的规则至少经过一次修订,且规则生命周期内演变非单调,经常出现回退,表明规则变化并非持续积累,而是存在操作上的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏