arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-23 至 2026-07-23 共收录 23 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2607.20265 2026-07-23 cs.CL cs.AI 新提交 81%

The Maskability Index: Predicting Task-Objective Alignment in Pretrained Language Models

可掩码性指数:预测预训练语言模型中的任务目标对齐

Ahmad Pouramini, Mahsa Afsharzadeh

机构 * Sirjan University of Technology(锡尔詹理工大学) Department of Computer Engineering(计算机工程系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 研究提出可掩码性指数(MI),用于评估知识关系适合的提示方式,通过掩码与未掩码模板的DepthRank分数差异计算。在ATOMIC2020基准上评估发现MI与下游生成性能正相关,有助于选择提示模板和策略提取预训练语言模型的关系知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19913 2026-07-23 cs.AI cs.CL cs.CR 新提交 81%

JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety

JANUS:预见长期智能体安全中的潜在风险

Yuan Xiong, Linji Hao, Shizhu He, Yequan Wang, Lijun Li

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究长期智能体安全潜在风险,提出JANUS框架,通过多智能体模拟合成轨迹,经预测与裁决耦合任务学习共享策略,用CoAA-RL联合优化,所产生的Vanguard模型提升了智能体安全防护及任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19366 2026-07-23 cs.AI 新提交 79%

Geometry-Guided Constraint Learning for LLM Safety Classification

用于大语言模型安全分类的几何引导约束学习

Fumiaki Uehara, Koo Imai, Masato Tsutsumi, Keigo Kansa, Sora Usui, Yuki Kobiyama

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究大语言模型安全分类,利用稀疏自动编码器特征提取解决安全多面体中约束数量调整问题,在Qwen3.5 - 9B上对部分类别K = 2最优,准确率达96 - 99%,基于几何观点引入锥约束并经三阶段训练稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19356 2026-07-23 cs.AI 新提交 79%

NEXUS: Structured Runtime Safety for Tool-Using LLM Agents

NEXUS:工具使用型大语言模型智能体的结构化运行时安全

Elias Hossain, Md Mehedi Hasan Nipu, Tasfia Nuzhat Ornee, Rajib Rana, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学) North South University(南北大学) University of Southern Queensland(南昆士兰大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究工具使用型大语言模型智能体运行时安全问题,提出NEXUS结构化计划安全监控器,结合多种方法进行分级升级。在多个基准测试中表现出色,如合成基准测试F1分数达0.949等,还具有低延迟、低开销特点,相关成果已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02694 2026-07-23 cs.CV cs.AI 版本更新 79%

DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning

DocShield:通过证据导向的智能代理推理实现AI文档安全

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Weibin Yao, Joey Tianyi Zhou, Jianshu Li, Ying Yan

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)计算与先进机器人中心及高性能计算研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出DocShield框架,通过视觉-逻辑联合推理解决文档伪造检测问题,采用CCT机制和多任务奖励优化,提升检测准确性和解释性,实验显示其在多个基准测试中表现优异。

Comments 10 pages, 4 figures, 5 tables. Preprint. arXiv admin note: text overlap with arXiv:2512.21482

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19701 2026-07-23 cs.CV 新提交 78%

SafeGen: Goal-Conditioned Video Diffusion of Safety-Critical Scenarios for VLM-Based Autonomous Driving

SafeGen:基于视觉语言模型的自动驾驶安全关键场景的目标条件视频扩散

Jiangfan Liu, Zexuan Cui, Tianyuan Zhang, Zonglei Jing, Zonghao Ying, Yaoyuan Zhang, Jiakai Wang, Xiaoqi Jiang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北京航空航天大学) Zhongguancun Laboratory(中关村实验室) Chery Automobile Co., Ltd.(奇瑞汽车股份有限公司)

专题命中 安全评测 :safety(title,abstract)

AI总结 研究针对VLM在自动驾驶系统中的应用,提出SafeGen框架,将场景生成设为目标条件扩散过程,引入上下文接地最终状态推理和最终状态条件下的视频演化,实验表明该框架能提升评判得分,微调后可提高真实驾驶场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20286 2026-07-23 cs.CL cs.AI 新提交 76%

Sound Probabilistic Safety Bounds for Large Language Models

大语言模型的可靠概率安全边界

Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate

机构 * University of Oxford(牛津大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Birmingham(伯明翰大学)

专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI

AI总结 研究提出框架计算大语言模型生成有害输出概率的严格边界,利用克洛普 - 皮尔逊置信区间,通过潜在空间特征优先探索有害分支,能高效计算可靠下界,实验验证方法有效性,为模型评估和认证提供新途径。

Comments The Initial version of this manuscript has been available on OpenReview, see https://openreview.net/forum?id=papImkPLf5

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20379 2026-07-23 cs.AI cs.CL 新提交 73%

Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

训练模型,而非读者:可验证激活解释的可解码性监督

Hiskias Dingeto

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言自动编码器对隐藏激活解释评分的问题,提出RECAP等方法,能使指定内容可解码,提高解释忠实度与安全性,如在预训练模型上实现可靠探测解码,提升对真实声明评分及识别谎言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19355 2026-07-23 cs.AI cs.CL cs.CY 新提交 67%

Information Discernment in Large Language Models

大语言模型中的信息辨别

Joshua Ashkinaze, Laura Kurek, Alina Faisal, Tongyuan Miao, Mariam Joseph, Ceren Budak, Eric Gilbert

机构 * University of Michigan(密歇根大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究大语言模型在与外部知识源结合时的信息辨别问题,提出Learn2Discern框架及基准,通过用户研究和大量模型试验发现模型在来源和真相辨别上存在问题,识别出简单干预措施,发布数据集和调查作为测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19956 2026-07-23 cs.CL cs.AI 新提交 62%

When Does Knowledge Distillation Hurt? Reliability-Aware Distillation for Low-Resource Language Summarization

知识蒸馏何时会产生负面影响?低资源语言摘要的可靠性感知蒸馏

Dipto Sumit, Ankan Kumar Roy Srizon, Sadia Khair Rodela, Atia Haque Asha, Mourchona Afrin, Niloy Farhan, Farig Sadeque

机构 * BRAC University(BRAC大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究低资源语言摘要中知识蒸馏的问题,提出CHAD和EWAD+CPDP两种可靠性感知蒸馏方法,在BanSum基准测试中显著优于标准KD,EWAD+CPDP在多种语言上也有良好表现,还发布相关资源助力研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19361 2026-07-23 cs.CL cs.AI 新提交 62%

Stateful Guardrails for Multi-Turn LLM Systems: A Conversational Risk Accumulation Framework

多轮大语言模型系统的有状态防护栏:一个对话风险累积框架

Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

机构 * College of Medicine and Public Health, Flinders University(弗林德斯大学医学与公共卫生学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究多轮大语言模型系统的对话风险累积问题,提出会话层CRA框架,跟踪三个轨迹信号,提供评分方法,发布多个基准测试集及评估协议,重点在于分布内会话评分,为大语言模型安全防护提供新方法。

Comments 45 pages, 10 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20127 2026-07-23 cs.CL 新提交 57%

Back to Back with a Copy: A Computational Analysis of AI-Generated Visual Contemporary Art Pastiches

与仿作并肩:人工智能生成的视觉当代艺术模仿作品的计算分析

Anca Dinu, Andreiana Mihail, Andra-Maria Florescu, Claudiu Creanga, Liviu Dinu

机构 * University of Bucharest(布加勒斯特大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文研究更新的生成模型模仿当代艺术作品的能力及不同语言模型中风格评估的多维度一致性。利用五个计算机视觉模型,通过余弦距离捕捉多种特征,对比新旧模型。结果显示新模型语义对齐改进、多样性增加,但浅层特征表现稍弱,还通过艺术家反馈进行情境化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19899 2026-07-23 cs.MA cs.LG 新提交 57%

Harnessing Disagreement: Detecting Correlated Agreement Blindness in Multi-Agent Triage

利用分歧:检测多智能体分诊中的相关一致性盲点

Shay Seiya McDonnell, Avantika Singh, Quoc-Viet Pham, Vratislav Havlik, Gregory M. P. O'Hare

机构 * School of Computer Science \& Statistics, Trinity College Dublin, College Green, Dublin 2, Ireland ADAPT Centre, Trinity College Dublin, College Green, Dublin 2, Ireland CKDelta, 28/29 Sir John Rogerson's Quay, Dublin 2, Ireland

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究多智能体分诊中分歧引发升级导致的相关一致性盲点问题,提出结合随机森林、k近邻智能体及校准元模型的ARAT系统。通过实验表明该系统能降低预测不足,跨数据集验证显示多样化产生有效分歧才提升安全,揭示相关故障被忽视的风险。

Comments 14 pages, 2 figures, 3 tables. Accepted at PAAMS 2026; this is the author's pre-review submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19834 2026-07-23 cs.CL 新提交 57%

D2VBench: Benchmarking Large Language Models with Value Dilemmas in Daily Scenarios

D2VBench:在日常场景中使用价值困境对大语言模型进行基准测试

Siyi Hao, Yidi Cao, Linhao Yu, Yuqi Ren, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) The International Joint Institute of Tianjin University(天津大学国际联合研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对大语言模型输出价值含义评估问题,提出D2VBench基准,通过多阶段协作构建含10000个日常困境实例的数据集,采用混合评估范式,对八个主流模型全面评估,结果显示该基准可靠性和鲁棒性高,能反映模型价值一致性。

Comments 22 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19409 2026-07-23 cs.AI 新提交 57%

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

FORCE-Bench:企业金融中智能代理人工智能的基准测试、数据集和评估工具

Wolfgang M. Pauli, Sarah Panda, Kidus Admassu, Said Bleik, Ademola Okerinde, Jeremy Reynolds

机构 * Microsoft Corporation(微软公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究针对智能代理在企业金融领域应用,提出FORCE-Bench基准测试,含251个专家注释查询,从八个维度评估三种任务类型,在特定设置下评估通用和专用代理,结果显示专用代理更可靠,相关资源开源助力企业金融环境应用。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08625 2026-07-23 stat.ML cs.LG math.ST stat.TH 版本更新 57%

Spectral-transport stability and benign overfitting for minimum norm interpolation

谱-传输稳定性与插值学习中的良性过拟合

Gustav Olaf Yunus Laitinen-Fredriksson Lundström-Imanov

机构 * Linköping University(林雪平大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究了插值学习中高过参数化模型为何能实现零经验风险并保持预测准确性,提出谱-传输稳定性框架,结合数据分布谱几何、学习规则敏感性和噪声对齐结构,定义了尺度依赖的Fredriksson指数,推导了有限样本风险界和良性过拟合判据,揭示了隐式正则化机制。

Comments 13 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07466 2026-07-23 cs.CR cs.LG 版本更新 57%

Trusting What You Cannot See: Auditable Fine-Tuning and Inference for Proprietary AI

信任你无法看到的东西:可审计的微调与推理用于专有AI

Heng Jin, Chaoyu Zhang, Hexuan Yu, Shanghao Shi, Ning Zhang, Y. Thomas Hou, Wenjing Lou

机构 * Virginia Tech(弗吉尼亚理工学院) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 AFTUNE通过可审计和可验证的框架,确保云上微调和推理的计算完整性,实现可信模型服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11072 2026-07-23 cs.CL cs.SD eess.AS 版本更新 57%

Simultaneous Speech-to-Speech Translation Without Aligned Data

无需对齐数据的同时语音到语音翻译

Tom Labiausse, Romain Fabre, Yannick Estève, Alexandre Défossez, Neil Zeghidour

机构 * LIA, University of Avignon, France(LIA,阿维尼翁大学,法国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Hibiki-Zero无需词级对齐数据,通过句子级对齐和强化学习策略实现高精度的同时语音翻译,支持多种语言并提升翻译质量与效率。

Comments See inference code at: https://github.com/kyutai-labs/hibiki-zero

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19966 2026-07-23 cs.SE 新提交 50%

Towards Reliable C-to-Rust Translation with Rule-Guided Reasoning and Reinforcement Learning

通过规则引导推理和强化学习实现可靠的C到Rust翻译

Feng Luo, Jiachen Liu, Cuiyun Gao, Jia Feng, Kui Liu

专题命中 安全评测 :safety(abstract)

AI总结 研究旨在解决利用大语言模型进行C到Rust自动翻译时存在的问题,提出TRAVEL框架,通过规则引导推理和强化学习两个模块,在多个数据集上评估,该框架提升了翻译准确率、成功率并降低不安全率。

Comments Accepted to the Industry Showcase of ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19650 2026-07-23 cs.RO cs.MA 新提交 50%

Remote ID Spoofing-Aware Trajectory Planning for Small Unmanned Aerial Systems

小型无人机系统的远程ID欺骗感知轨迹规划

Jeremiah Webb, Bryce Bjorkman, Abel Diaz Gonzalez, Austin Coursey, Noah Dahle, Kailani Lemieux Mack, Filippos Fotiadis, Gautam Biswas, Bryan C. Ward, Abenezer Taye

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对小型无人机在RID位置欺骗攻击下的轨迹规划问题,提出分散式欺骗感知框架,利用物理层观测评估广播可信度,检测定位欺骗代理,集成到规划器中,仿真显示可减少近空中碰撞事件且保持计算效率。

Comments 9 pages, 3 figures, to be published in IEEE DASC 2026 Conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17820 2026-07-23 cs.CV 版本更新 50%

PRiSM: Prototype Regularization for Few-Shot VLMs

PRiSM:少样本视觉语言模型的原型正则化

Ghassen Baklouti, Omprakash Chakraborty, Jose Dolz, Ismail Ben Ayed

机构 * ÉTS Montreal(蒙特利尔高等商学院)

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对视觉语言模型少样本适应方法,质疑现有基准假设,引入新基准。提出PRiSM类原型正则化方法,优化多术语损失,结合有效优化器,提升性能,尤其在处理类不平衡和大量类时效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06210 2026-07-23 cs.CV cs.RO 版本更新 50%

VG3S: Visual Geometry Grounded Gaussian Splatting for Semantic Occupancy Prediction

VG3S:基于视觉几何的高斯散射用于语义占用预测

Xiaoyang Yan, Muleilan Pei, Shaojie Shen

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 安全评测 :alignment(abstract)

AI总结 VG3S 通过引入视觉基础模型的几何 grounding 能力,提升语义占用预测的准确性与泛化能力。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00972 2026-07-23 cs.CV 版本更新 50%

SemICP: Semantic Non-Rigid Point Cloud Registration with Elastic Energy Regularization

SemICP:基于弹性能量正则化的语义非刚性点云配准

Wanwen Chen, Qi Zeng, Carson Studders, Zongze Li, Jamie J. Y. Kwon, Tara Kemper, Emily H. T. Pang, Eitan Prisman, Septimiu E. Salcudean

机构 * Department of Electrical and Computer Engineering, University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学) Faculty of Medicine, University of British Columbia(医学院,不列颠哥伦比亚大学)

专题命中 安全评测 :alignment(abstract)

AI总结 研究针对计算机辅助干预中点云配准问题,提出SemICP框架,结合语义信息点匹配与变形正则化,经多数据集测试,相比其他方法降低多种距离误差,结合AI分割后为多模态配准提供有效管道。

详情

展开后加载摘要…

URL PDF HTML 收藏