arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-04 至 2026-05-04 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 12 篇

2605.00069 2026-05-04 cs.LG 79%

Soft-MSM: Differentiable Context-Aware Elastic Alignment for Time Series

Soft-MSM:用于时间序列的可微上下文感知弹性对齐

Christopher Holder, Anthony Bagnall

机构 * School of Electronics and Computer Science(电子与计算机科学学院) University of Southampton(南安普顿大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出Soft-MSM,一种基于上下文感知的弹性对齐损失函数,通过平滑门替代MSM的分段分合成本,实现可微梯度计算,实验表明其在时间序列聚类和分类任务中优于Soft-DTW。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27807 2026-05-04 cs.AI cs.DC 79%

Autonomous Systems Dependability in the era of AI: Design Challenges in Safety, Security, Reliability and Certification

人工智能时代自主系统可靠性:安全、安全性和可靠性设计挑战

Behnaz Ranjbar, Kirankumar Raveendiran, Sudeep Pasricha, Samarjit Chakraborty, Cecilia Carbonelli, Akash Kumar

机构 * Colorado State University, US(科罗拉多州立大学) The University of North Carolina at Chapel Hill, US(北卡罗来纳大学教堂山分校) The TUM Institute for Advanced Study, Germany(慕尼黑工业大学高级研究 institute) Infineon Technologies, Germany(英飞凌科技)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文探讨了在人工智能时代设计可靠自主和嵌入式系统的新方法和框架,重点在于可靠性建模、安全系统设计和认证方法,以应对AI组件带来的不确定性与非确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17465 2026-05-04 cs.AI 70%

Language models recognize dropout and Gaussian noise applied to their activations

语言模型能够识别应用于其激活上的dropout和高斯噪声

Damiano Fornasiere, Mirko Bronzi, Spencer Kitts, Alessandro Palmas, Yoshua Bengio, Oliver Richardson

机构 * LawZero

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究发现语言模型能检测并区分激活上的dropout和高斯噪声,通过多选问题测试不同模型的识别能力,结果表明模型能准确识别扰动类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27077 2026-05-04 cs.LG cs.AI stat.ML 62%

Learning Rate Transfer in Normalized Transformers

归一化变换器中的学习率转移

Boris Shigida, Boris Hanin, Andrey Gromov

机构 * Meta Superintelligence Labs(Meta超智能实验室) Princeton University(普林斯顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出νGPT模型,通过结合数值实验和对齐指数,改进了超参数转移方法,实现了模型宽度、深度和token horizon上的学习率转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00072 2026-05-04 cs.CV cs.AI cs.LG 62%

Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards

通过间接奖励解锁零样本地理推理

Chenhui Xu, Fuxun Yu, Michael J. Bianco, Jacob Kovarskiy, Raphael Tang, Qi Zhang, Zirui Xu, Will LeVine, Brandon Dubbs, Heming Liao, Cassandra Burgess, Suvam Bag, Jay Patravali, Rupanjali Kukal, Mikael Figueroa, Rishi Madhok, Nikolaos Karianakis, Jinjun Xiong

机构 * University at Buffalo(布法罗大学) Microsoft(微软)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Geo-R1方法,利用间接可验证奖励提升地理推理能力,在多个下游任务中实现卓越的零样本迁移性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00279 2026-05-04 cs.CR cs.LG 57%

A Comparative Analysis of Machine Learning Models for Intrusion Detection in Intelligent Transport Systems

智能交通系统入侵检测机器学习模型比较分析

Zawad Yalmie Sazid, Robert Abbas, Sasa Maric

机构 * Victoria University, Sydney, Australia(维多利亚大学,悉尼,澳大利亚) University of New South Wales College, Sydney, Australia(新南威尔士大学学院,悉尼,澳大利亚)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文研究了在边缘计算中提升延迟、带宽效率和服务响应性的机器学习模型,提出基于信任的联邦混合入侵检测框架,通过随机森林、决策树和线性SVM网络互补流量表示,并在服务器端进行信任感知的模型更新聚合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00248 2026-05-04 cs.AI cs.GT cs.MA 57%

Causal Foundations of Collective Agency

集体代理的因果基础

Frederik Hytting Jørgensen, Sebastian Weichwald, Lewis Hammond

机构 * Copenhagen Causality Lab and Pioneer Centre for AI, University of Copenhagen, Denmark(哥本哈根因果实验室和先锋人工智能中心,哥本哈根大学,丹麦) Cooperative AI Foundation, United Kingdom(协作人工智能基金会,英国)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文探讨了多智能体系统中集体代理形成的因果基础,提出通过因果游戏和因果抽象框架分析集体行为的理性与目标导向性,解决多智能体激励问题和投票机制的集体代理度评估。

Comments CLeaR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02327 2026-05-04 cs.CV 50%

PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance

PPLLaVA:通过提示引导的视频序列理解

Shangkun Sun, Ruyang Liu, Haoran Tang, Yixiao Ge, Haibo Lu, Wei Gao, Jiankun Yang, Chen Li

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) XPeng Inc.(小鹏汽车有限公司) Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)

专题命中 其他安全 :alignment(abstract)

AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。

Comments Accepted to ICLR' 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00630 2026-05-04 cs.CV cs.MM eess.IV 50%

CMTA: Leveraging Cross-Modal Temporal Artifacts for Generalizable AI-Generated Video Detection

CMTA:利用跨模态时间特征进行通用的AI生成视频检测

Hang Wang, Chao Shen, Chenhao Lin, Minghui Yang, Lei Zhang, Cong Wang

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) Guangdong OPPO Mobile Communications Co., Ltd.(广东OPPO移动通信有限公司) City University of Hong Kong(香港城市大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出CMTA框架,通过联合跨模态嵌入和多粒度时间建模,识别AI生成视频中的跨模态时间特征,验证了其在四个大规模数据集上的新状态和跨生成器泛化能力。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00413 2026-05-04 cs.SE 50%

ClozeMaster: Fuzzing Rust Compiler by Harnessing LLMs for Infilling Masked Real Programs

ClozeMaster:利用LLMs填充掩码真实程序以模糊Rust编译器

Hongyan Gao, Yibiao Yang, Maolin Sun, Jiangchang Wu, Yuming Zhou, Baowen Xu

专题命中 其他安全 :safety(abstract)

AI总结 本文提出ClozeMaster,通过利用LLMs填充掩码的真实程序,生成有效测试用例,发现Rust编译器27个已确认的bug,优于现有模糊测试工具。

Comments Accepted at ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00405 2026-05-04 cs.CV 50%

BOLT: Online Lightweight Adaptation for Preparation-Free Heterogeneous Cooperative Perception

BOLT:面向无准备异构协作感知的在线轻量适应

Kang Yang, Tianci Bu, Peng Wang, Deying Li, Yongcai Wang

机构 * Renmin University of China(中国人民大学) National University of Defense Technology(国防科技大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本研究提出BOLT模块,通过 ego-as-teacher 蒸馏实现在线特征域对齐,无需预训练协调,在无准备场景下提升AP@50达32.3点,优于 ego-only 结果。

Comments 21 pages, 10 figures, 10tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00034 2026-05-04 cs.CR cs.PL cs.SE 50%

Symbolic Execution Meets Multi-LLM Orchestration: Detecting Memory Vulnerabilities in Incomplete Rust CVE Snippets

符号执行与多LLM协调:在不完整的Rust CVE代码片段中检测内存漏洞

Zeyad Abdelrazek, Young Lee

专题命中 其他安全 :safety(abstract)

AI总结 本文提出结合符号执行(KLEE)与四代理多LLM架构,解决不完整代码问题,通过协作合成可编译的KLEE测试用例,检测Rust不安全代码中的内存漏洞,实现90.3%的测试用例编译成功率,检测到1,206个关键错误。

Comments 11 pages, 1 figure, to be published in : Ease 2026 The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏