arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-13 至 2026-08-13 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 10 篇

2608.11656 2026-08-13 cs.LG 新提交 74%

Continuous-Latent Predictive Modeling with Semantic Alignment for EEG-Language Foundation Models

面向EEG-语言基础模型的语义对齐连续隐式预测建模

Myeong-Ju Cho, Hye-Bin Shin, Seo-Hyun Lee, Seong-Whan Lee

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 本文提出BLPM模型,通过CELP编码器与MQSD模块对齐EEG语义,解决EEG基础模型预训练的关键挑战,在多基准任务中实现良好泛化。

Comments 19 pages, 3 figures; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12198 2026-08-13 cs.RO cs.AI cs.LG 新提交 62%

Learning-Based Behavior Planning for Automated Driving: Real-World Integration and Deployment

基于学习的自动驾驶行为规划:现实世界集成与部署

Jean-Pierre Busch, Guido Linden, Jan Bergmann, Lutz Eckstein

机构 * RWTH Aachen University(亚琛工业大学) Technical University of Munich(慕尼黑工业大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合机器学习与经典方法的混合规划架构,通过深度神经网络解读交通场景、优化监督层验证约束,经实车部署验证其在自动驾驶行为规划中的有效性。

Comments 17 pages; Accepted to be published as part of the 17. Uni-DAS e.V. Workshop "Fahrerassistenz und automatisiertes Fahren", September 29-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11951 2026-08-13 cs.LG cs.AI 新提交 62%

TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement

TailBooster:具备操作有效性约束的极值增强双层生成框架

Karim Aly, Alexei Sharpanskykh, Jacco Hoekstra

机构 * Delft University of Technology (TU Delft)(代尔夫特理工大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 TailBooster是结合生成建模与双异常检测层的双层框架,用于解决混合表格数据的极值增强问题,可提升极端事件预测的操作有效性与精度,且与模型无关可扩展至多领域。

Comments Preprint submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11483 2026-08-13 cs.AI cs.LG q-bio.QM 新提交 62%

A Modular Agentic Framework for Synthetically Constrained Multi-Objective Hit-to-Lead Optimization

用于合成约束多目标先导化合物优化的模块化智能体框架

Kelvin P. Idanwekhai, Enes Kelestemur, Benjamin Strickland, Matthew Hart, Steini Davidsson, Angelos Angelopoulos, Ron Alterovitz, Marcello DeLuca, Alexander Tropsha

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出开源模块化智能体框架SABLE,结合LLM与专用工具实现合成约束下的多目标先导化合物优化,可高效富集符合计算目标的候选集,为早期药物发现提供决策支持。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11227 2026-08-13 cs.AI cs.LG 新提交 62%

Forecasting Side Effects of Activation Steering

预测激活引导的副作用

Chong Yong Ong, Alson Wei Jie Sim, Peixin Zhang, Jun Sun

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对激活引导易产生意外副作用的问题,构建交叉效应矩阵揭示副作用的系统性与可预测性,为激活引导的安全部署提供支持。

Comments 24 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11681 2026-08-13 cs.CV cs.AI cs.MM 新提交 57%

Learning from Multimodal Pseudo-Labels for Robust Open-Vocabulary Instance and Panoptic Segmentation

学习多模态伪标签以实现鲁棒的开放词汇实例和全景分割

Duy Tran Thanh, Yeejin Lee, Byeongkeun Kang

机构 * Seoul National University of Science and Technology(首尔科技大学) Chung-Ang University(中央大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究针对开放词汇实例分割与开放集全景分割的痛点,提出多模态框架,结合预训练视觉语言模型生成伪标签并优化训练目标,在COCO数据集上取得优于现有SOTA的性能。

Comments 14 pages

Journal ref Neurocomputing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12024 2026-08-13 cond-mat.other physics.ins-det 新提交 50%

Formally Verified Lock-Free Software Transactional Memory for Scientific Measurement

经形式化验证的用于科学测量的无锁软件事务内存

Kentaro Kitagawa

专题命中 其他安全 :safety(abstract)

AI总结 针对科学测量中线程并发访问共享分层状态的问题,提出经形式化验证的无锁STM,实现原子子树操作,通过TLA+和TLC验证属性,接口支持Python脚本与AI自动化,已应用于多种实验。

Comments 15 pages, 7 figures, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28037 2026-08-13 cs.SE 版本更新 50%

Evolution-Aware Regression Test Prioritization of ML-Enabled Systems Using Gradient-Based Behavior Vectors

基于梯度行为向量的ML系统进化感知回归测试优先级排序

Eunho Cho, Donghwan Shin, In-Young Ko

专题命中 其他安全 :alignment(abstract)

AI总结 提出GBV-PD方法,利用梯度行为向量和参数更新投影,在不运行进化模型的情况下预测测试用例损失变化方向,实现高效的回归测试优先级排序。

Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07661 2026-08-13 cs.CV 版本更新 50%

Optimization-Guided Diffusion for Interactive Scene Generation

基于优化的扩散生成交互场景

Shihao Li, Naisheng Ye, Tianyu Li, Kashyap Chitta, Tuo An, Peng Su, Boyang Wang, Haiou Liu, Chen Lv, Hongyang Li

机构 * Beijing Institute of Technology(北京理工大学) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Nanyang Technological University(南洋理工大学) NVIDIA Research(英伟达研究院) Yinwang Intelligent Tech. Co. Ltd.(银网智能科技有限公司)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出OMEGA框架,通过优化引导扩散过程生成符合物理和行为约束的多智能体驾驶场景,提升生成场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12950 2026-08-13 cs.SE 版本更新 50%

Diffploit: Facilitating Cross-Version Exploit Migration for Open Source Library Vulnerabilities

Diffploit:助力开源库漏洞的跨版本漏洞利用迁移

Zirui Chen, Zhipeng Xue, Jiayuan Zhou, Xing Hu, Xin Xia, Xiaohu Yang

专题命中 其他安全 :alignment(abstract)

AI总结 Diffploit是一种迭代的差异驱动漏洞利用迁移方法,通过上下文模块和迁移模块提升跨版本漏洞利用迁移成功率,在大规模Java CVE数据集上表现优于现有工具,还发现了受影响版本范围错误的CVE及未报告的易受攻击版本。

Comments ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏