arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-04 至 2026-08-04 共收录 15 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 15 篇

2608.01414 2026-08-04 cs.AI cs.CR 新提交 88%

No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks

无单一失效神经元:针对白盒攻击的分布式安全对齐

Simiao Xie, Chuancheng Shi, Shangze Li, Wenhua Wu, Fei Shen, Ying Zhou, Zhiyong Wang, Tat-Seng Chua

机构 * The University of Sydney(悉尼大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 针对现有安全对齐方法的单点失效问题,提出分布式安全对齐(DSA),通过冗余编码安全能力提升模型对抗白盒神经元级攻击的鲁棒性,且保留通用语言与多模态效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02024 2026-08-04 cs.AI cs.CY 新提交 81%

EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers

EduZone:面向K-12学生与教师的大语言模型安全评估框架

Junyeong Park, Jieun Han, Haneul Yoo, So-Yeon Ahn, Jinsung Yoon, Alice Oh

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 EduZone是针对K-12教育场景的LLM安全评估框架,整合多维度要素生成对抗交互,评估10个LLMs后发现其对教育特定风险更脆弱,现有防护措施不足,该框架可助力开发更安全的教育类LLMs。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00975 2026-08-04 cs.CV 新提交 78%

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00533 2026-08-04 cs.CL cs.AI cs.LG 新提交 67%

Native Multilingual Chain-of-Thought Reasoning in Low-Resource Southeast Asian Languages

低资源东南亚语言中的原生多语言思维链推理

Sean Gip Lim, William Chandra Tjhi, Hai Leong Chieu

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对低资源东南亚语言大模型推理的跨语言崩溃与微调瓶颈,提出OSCD算法,结合翻译智能体循环与联合嵌入语义对齐,在AIME25等基准上实现数学推理的显著提升。

Comments 22 pages, 16 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02088 2026-08-04 cs.LG cs.AI cs.SY eess.SY 新提交 62%

An AI-Based Decision-Support Pipeline for Day-Ahead Photovoltaic Forecasting

面向日前光伏功率预测的基于人工智能的决策支持流程

Fariba Dehghan, Sebastian Stein, Vahid Yazdanpanah, Stephanie Gauthier, Masood Nazari

机构 * University of Southampton(南安普顿大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对新部署站点数据不足导致的日前光伏预测难题,开发了防数据泄露的环境AI堆叠流程,在英国充电站站点验证了其优于基准模型的预测性能。

Comments 13 pages, 6 figures, Accepted for publication in the Proceedings of the UK AI Conference (UK-AI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01879 2026-08-04 cs.LG cs.AI 新提交 62%

LAB-Tab: LLM-Augmented Bayesian Network Adaptation for Few-Shot Tabular Generation

LAB-Tab:面向小样本表格生成的大语言模型增强型贝叶斯网络适配方法

Zijian Shen, Taijie Chen, Bin Zhou, Ziyang Jiang, Jintao Ke

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对小样本表格生成的分布偏移问题,提出LLM增强的贝叶斯网络适配框架LAB-Tab,在六个ACS分布偏移场景中表现优于基准方法,性能提升显著。

Comments 21 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00515 2026-08-04 cs.CR cs.AI cs.CL 新提交 62%

Auditable Release Control for Pedagogical Leakage in LLM Tutors

LLM辅导器中教学式泄露的可审计发布控制

Nizam Kadir

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM辅导器的教学式泄露问题,提出感知授权的可审计发布控制机制,经实验验证可显著降低泄露标记,且在安全与效用上优于基线方法。

Comments 9 pages, 1 figure, 6 tables. Preprint; not peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21337 2026-08-04 cs.LG cs.AI 版本更新 62%

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

DataClaw0: 从原始流中智能定制多模态数据

Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng, Xiangyang Luo, Zhiheng Ma, Yihong Gong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳理工大学) Tsinghua University(清华大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出DataClaw0模型,通过两阶段流水线将生成语义合成锚定于确定性事实锚点,结合SFT与GRPO实现复杂数据精炼意图的对齐,首个数据精炼基准验证其高效性。

Comments add base model: Qwen3.5-27B

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02595 2026-08-04 cs.LG 新提交 57%

onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

onepot-Bench 0:面向实验室实际场景的计算机化学基准测试

Brandon Wang, Andrei S. Tyrin, Daniil A. Boiko

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本研究推出专有基准测试onepot-Bench 0,通过三个互补评估衡量语言模型在湿实验室合成化学场景下的基础能力、可靠性等,弥补现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02446 2026-08-04 cs.IR cs.LG 新提交 57%

Advancing Relevance Measurement with Vision-Language Models for Web-Scale Search

利用视觉语言模型推进Web规模搜索的相关性测量

Han Wang, Alex Whitworth, Pak Ming Cheung, Zhenjie Zhang, Krishna Kamath, Xi Chen, Roberto Konow, Kurchi Subhra Hazra

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本研究提出基于VLM的自动化相关性评估流水线,部署于Pinterest搜索A/B实验,验证其与人工标注一致性,提升评估效率,降低MDEs,助力优化搜索体验。

Comments RecSys'26 Industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02101 2026-08-04 cs.CL 新提交 57%

Cross-Domain Hybrid OPD for Generalizable Search Agents

面向通用搜索智能体的跨域混合在线策略蒸馏

Hongzhan Chen, Xiaoyu Liu, Dengming Zhang, Minzhou Huang, Dongliang Xu, Jingcheng Xie, Dongxiang Fang, Bowen Qin, Minsheng Hao, Yaozong Shen, Xiaojun Quan, Mona Zhou, Haosheng Zou, Jeff Chen

机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00558 2026-08-04 cs.SE cs.AI 新提交 57%

AiFlow: Token-Native Reactive Orchestration with Bounded Backpressure for Streaming LLM Applications

AiFlow:面向流式大语言模型应用的带界背压令牌原生反应式编排框架

Qunhui Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对现有流式LLM工作流编排的背压等管理缺陷,提出AiFlow令牌原生反应式编排模型,经实验验证可降低应用TTFPT并控制队列深度。

Comments 24 pages, 5 figures, 12 tables, 1 algorithm, and 1 code listing. Public implementation: https://github.com/ModelEngine-Group/fit-framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20449 2026-08-04 cs.CL 版本更新 57%

LM-mixup: Text Data Augmentation via Language Model based Mixup

LM-mixup:基于语言模型的混合文本数据增强方法

Zhijie Deng, Zhouan Shen, Ling Li, Yao Zhou, Zhaowei Zhu, Yanji He, Wei Wang, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、ZJUT及D5Data.ai)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出LM-Mixup方法,通过构建MIXTURE数据集并结合监督微调与GRPO强化学习,仅用3%的蒸馏数据即可高效增强低质量指令跟随数据,提升LLMs的指令微调效率与性能。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00133 2026-08-04 eess.SY cs.SY 新提交 50%

Deep Reinforcement Learning: From First Principles to Reasoning Models

深度强化学习:从第一性原理到推理模型

Ghoshana Bista

专题命中 安全训练 :safety(abstract)

AI总结 本书介绍深度强化学习从经典方法到各类算法及多领域应用的演进,融合基础与研究视角,面向具备相关基础的学生、研究者和工程师。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29239 2026-08-04 cs.CR 版本更新 50%

Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors

打破舍入陷阱:保护LLM免受量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

专题命中 安全训练 :alignment(abstract)

AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。

详情

展开后加载摘要…

URL PDF HTML 收藏