arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-04 至 2026-05-04 共收录 50 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 15 篇

2605.00436 2026-05-04 cs.CL cs.AI 62%

Impact of Task Phrasing on Presumptions in Large Language Models

任务表述对大语言模型中假设的影响

Kenneth J. K. Ong

机构 * AI.DA STC ST Engineering(AI.DA STC ST工程)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了任务表述如何导致大语言模型产生假设,影响其适应能力,通过囚徒困境实验发现中性表述可减少假设影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00620 2026-05-04 cs.CL 57%

SC-Taxo: Hierarchical Taxonomy Generation under Semantic Consistency Constraints using Large Language Models

SC-Taxo:基于语义一致性约束的层次化分类生成方法

Shiqiang Cai, Nianhong Niu, Shizhu He, Kang Liu, Jun Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Science and Technology Beijing(北京科技大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出SC-Taxo框架,利用大语言模型和层次化优化机制,解决现有分类生成方法在结构一致性和语义对齐上的不足,提升分类体系的层次性和准确性。

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00073 2026-05-04 cs.AI 57%

AgentReputation: A Decentralized Agentic AI Reputation Framework

AgentReputation: 一种去中心化的代理AI声誉框架

Mohd Sameen Chishti, Damilare Peter Oyinloye, Jingyue Li

机构 * Department of Computer Science(计算机科学系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AgentReputation框架,旨在解决去中心化代理AI市场中声誉机制失效的问题,通过分层架构和上下文感知声誉卡片实现声誉管理,同时提供风险驱动的决策引擎。

Comments 5 pages, 1 figure, accepted to FSE 2026, Ideas, Visions and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28158 2026-05-04 cs.AI 57%

Intern-Atlas: A Methodological Evolution Graph as Research Infrastructure for AI Scientists

Intern-Atlas:一种方法论进化图作为人工智能科学家的研究基础设施

Yujun Wu, Dongxu Zhang, Xinchen Li, Jinhang Xu, Yiling Duan, Yumou Liu, Jiabao Pan, Qiyuan Zhu, Xuanhe Zhou, Jingxuan Wei, Siyuan Li, Jintao Chen, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) Xi'an Jiaotong University(西安交通大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Hunan University(湖南大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University(上海大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Intern-Atlas通过构建方法论进化图,自动识别方法实体,推断方法间的关系,并捕捉驱动创新过渡的瓶颈,为AI研究提供因果网络支持。

Comments 25 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04465 2026-05-04 cs.AI 57%

The Topology of Multimodal Fusion: Why Current Architectures Fail at Creative Cognition

多模态融合的拓扑学:为何当前架构在创造性认知上失败

Xiujiang Tan

机构 * Guangzhou Academy of Fine Arts(广州美术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文指出当前多模态AI架构存在拓扑限制而非参数限制,通过哲学、认知科学和数学三个支柱提出多模态融合的拓扑学框架,提出UOO实现、ANALOGY-MM基准和META-TOP三阶基准,通过实验路线验证拓扑同构性。

Comments Expanded 11 technical improvements; 5 reference corrections; Appendix B pseudocode added. ~43 pages, 5 figures. Chinese philosophical terms romanized. Companion monograph available separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22908 2026-05-04 cs.CV cs.LG 57%

Adaptive Dual-Teacher Distillation with Subnetwork Rectification for Bridging Semantic Gaps in Black-Box Domain Adaptation

自适应双教师蒸馏与子网络校正用于桥接黑盒领域适应中的语义间隙

Zhe Zhang, Jing Li, Wanli Xue, Xu Cheng, Jianhua Zhang, Qinghua Hu, Shengyong Chen

机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出DDSR框架,通过自适应预测融合策略和子网络正则化机制,解决黑盒领域适应中任务特定知识与语言对齐语义先验的不一致问题,提升领域适应性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 2 篇

2605.00055 2026-05-04 cs.CR cs.AI cs.MA 57%

Ambient Persuasion in a Deployed AI Agent: Unauthorized Escalation Following Routine Non-Adversarial Content Exposure

部署AI代理中的环境说服:非对抗性内容暴露后的未经授权升级

Diego F. Cuadros, Abdoul-Aziz Maiga

机构 * Digital Epidemiology Laboratory, Digital Futures, University of Cincinnati(数字流行病学实验室,数字未来,辛辛那提大学) Center for Humanities and Technology (CHaT), University of Cincinnati(人文与科技中心(CHaT),辛辛那提大学) Norwegian University of Science and Technology(挪威科技大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 研究探讨了部署AI系统中因非对抗性内容暴露导致的未经授权行为升级问题,分析了多代理监管机制的局限性及伦理治理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18829 2026-05-04 cs.CR cs.AI 57%

Agent Control Protocol: Admission Control for Agent Actions

代理控制协议:代理行为的准入控制

Marcelo Fernandez

机构 * TraslaIA

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出ACP协议,通过静态风险评分与状态信号结合,控制代理行为,实验显示其能显著降低恶意行为执行率,同时通过形式化验证确保安全性和活性。

Comments 95 pages. Paper 1 of 6 in the Agent Governance Series (Papers 0-6). Zenodo: https://doi.org/10.5281/zenodo.19672575. Companion: P0 (arXiv:2604.17511), P2/IML (arXiv:2604.17517), P3/4 (zenodo.19708496), P5/RAM (arXiv:2604.22898), P6 (zenodo.19699460). Spec: https://github.com/chelof100/acp-framework-en. v1.30: series updated to 6 papers, P3/4 consolidated, P6 added

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 12 篇

2605.00069 2026-05-04 cs.LG 79%

Soft-MSM: Differentiable Context-Aware Elastic Alignment for Time Series

Soft-MSM:用于时间序列的可微上下文感知弹性对齐

Christopher Holder, Anthony Bagnall

机构 * School of Electronics and Computer Science(电子与计算机科学学院) University of Southampton(南安普顿大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出Soft-MSM,一种基于上下文感知的弹性对齐损失函数,通过平滑门替代MSM的分段分合成本,实现可微梯度计算,实验表明其在时间序列聚类和分类任务中优于Soft-DTW。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27807 2026-05-04 cs.AI cs.DC 79%

Autonomous Systems Dependability in the era of AI: Design Challenges in Safety, Security, Reliability and Certification

人工智能时代自主系统可靠性:安全、安全性和可靠性设计挑战

Behnaz Ranjbar, Kirankumar Raveendiran, Sudeep Pasricha, Samarjit Chakraborty, Cecilia Carbonelli, Akash Kumar

机构 * Colorado State University, US(科罗拉多州立大学) The University of North Carolina at Chapel Hill, US(北卡罗来纳大学教堂山分校) The TUM Institute for Advanced Study, Germany(慕尼黑工业大学高级研究 institute) Infineon Technologies, Germany(英飞凌科技)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文探讨了在人工智能时代设计可靠自主和嵌入式系统的新方法和框架,重点在于可靠性建模、安全系统设计和认证方法,以应对AI组件带来的不确定性与非确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17465 2026-05-04 cs.AI 70%

Language models recognize dropout and Gaussian noise applied to their activations

语言模型能够识别应用于其激活上的dropout和高斯噪声

Damiano Fornasiere, Mirko Bronzi, Spencer Kitts, Alessandro Palmas, Yoshua Bengio, Oliver Richardson

机构 * LawZero

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究发现语言模型能检测并区分激活上的dropout和高斯噪声,通过多选问题测试不同模型的识别能力,结果表明模型能准确识别扰动类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27077 2026-05-04 cs.LG cs.AI stat.ML 62%

Learning Rate Transfer in Normalized Transformers

归一化变换器中的学习率转移

Boris Shigida, Boris Hanin, Andrey Gromov

机构 * Meta Superintelligence Labs(Meta超智能实验室) Princeton University(普林斯顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出νGPT模型,通过结合数值实验和对齐指数,改进了超参数转移方法,实现了模型宽度、深度和token horizon上的学习率转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00072 2026-05-04 cs.CV cs.AI cs.LG 62%

Unlocking Zero-Shot Geospatial Reasoning via Indirect Rewards

通过间接奖励解锁零样本地理推理

Chenhui Xu, Fuxun Yu, Michael J. Bianco, Jacob Kovarskiy, Raphael Tang, Qi Zhang, Zirui Xu, Will LeVine, Brandon Dubbs, Heming Liao, Cassandra Burgess, Suvam Bag, Jay Patravali, Rupanjali Kukal, Mikael Figueroa, Rishi Madhok, Nikolaos Karianakis, Jinjun Xiong

机构 * University at Buffalo(布法罗大学) Microsoft(微软)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Geo-R1方法,利用间接可验证奖励提升地理推理能力,在多个下游任务中实现卓越的零样本迁移性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00279 2026-05-04 cs.CR cs.LG 57%

A Comparative Analysis of Machine Learning Models for Intrusion Detection in Intelligent Transport Systems

智能交通系统入侵检测机器学习模型比较分析

Zawad Yalmie Sazid, Robert Abbas, Sasa Maric

机构 * Victoria University, Sydney, Australia(维多利亚大学,悉尼,澳大利亚) University of New South Wales College, Sydney, Australia(新南威尔士大学学院,悉尼,澳大利亚)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文研究了在边缘计算中提升延迟、带宽效率和服务响应性的机器学习模型,提出基于信任的联邦混合入侵检测框架,通过随机森林、决策树和线性SVM网络互补流量表示,并在服务器端进行信任感知的模型更新聚合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00248 2026-05-04 cs.AI cs.GT cs.MA 57%

Causal Foundations of Collective Agency

集体代理的因果基础

Frederik Hytting Jørgensen, Sebastian Weichwald, Lewis Hammond

机构 * Copenhagen Causality Lab and Pioneer Centre for AI, University of Copenhagen, Denmark(哥本哈根因果实验室和先锋人工智能中心,哥本哈根大学,丹麦) Cooperative AI Foundation, United Kingdom(协作人工智能基金会,英国)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文探讨了多智能体系统中集体代理形成的因果基础,提出通过因果游戏和因果抽象框架分析集体行为的理性与目标导向性,解决多智能体激励问题和投票机制的集体代理度评估。

Comments CLeaR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02327 2026-05-04 cs.CV 50%

PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance

PPLLaVA:通过提示引导的视频序列理解

Shangkun Sun, Ruyang Liu, Haoran Tang, Yixiao Ge, Haibo Lu, Wei Gao, Jiankun Yang, Chen Li

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) XPeng Inc.(小鹏汽车有限公司) Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)

专题命中 其他安全 :alignment(abstract)

AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。

Comments Accepted to ICLR' 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00630 2026-05-04 cs.CV cs.MM eess.IV 50%

CMTA: Leveraging Cross-Modal Temporal Artifacts for Generalizable AI-Generated Video Detection

CMTA:利用跨模态时间特征进行通用的AI生成视频检测

Hang Wang, Chao Shen, Chenhao Lin, Minghui Yang, Lei Zhang, Cong Wang

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) Guangdong OPPO Mobile Communications Co., Ltd.(广东OPPO移动通信有限公司) City University of Hong Kong(香港城市大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出CMTA框架,通过联合跨模态嵌入和多粒度时间建模,识别AI生成视频中的跨模态时间特征,验证了其在四个大规模数据集上的新状态和跨生成器泛化能力。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00413 2026-05-04 cs.SE 50%

ClozeMaster: Fuzzing Rust Compiler by Harnessing LLMs for Infilling Masked Real Programs

ClozeMaster:利用LLMs填充掩码真实程序以模糊Rust编译器

Hongyan Gao, Yibiao Yang, Maolin Sun, Jiangchang Wu, Yuming Zhou, Baowen Xu

专题命中 其他安全 :safety(abstract)

AI总结 本文提出ClozeMaster,通过利用LLMs填充掩码的真实程序,生成有效测试用例,发现Rust编译器27个已确认的bug,优于现有模糊测试工具。

Comments Accepted at ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00405 2026-05-04 cs.CV 50%

BOLT: Online Lightweight Adaptation for Preparation-Free Heterogeneous Cooperative Perception

BOLT:面向无准备异构协作感知的在线轻量适应

Kang Yang, Tianci Bu, Peng Wang, Deying Li, Yongcai Wang

机构 * Renmin University of China(中国人民大学) National University of Defense Technology(国防科技大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本研究提出BOLT模块,通过 ego-as-teacher 蒸馏实现在线特征域对齐,无需预训练协调,在无准备场景下提升AP@50达32.3点,优于 ego-only 结果。

Comments 21 pages, 10 figures, 10tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00034 2026-05-04 cs.CR cs.PL cs.SE 50%

Symbolic Execution Meets Multi-LLM Orchestration: Detecting Memory Vulnerabilities in Incomplete Rust CVE Snippets

符号执行与多LLM协调:在不完整的Rust CVE代码片段中检测内存漏洞

Zeyad Abdelrazek, Young Lee

专题命中 其他安全 :safety(abstract)

AI总结 本文提出结合符号执行(KLEE)与四代理多LLM架构,解决不完整代码问题,通过协作合成可编译的KLEE测试用例,检测Rust不安全代码中的内存漏洞,实现90.3%的测试用例编译成功率,检测到1,206个关键错误。

Comments 11 pages, 1 figure, to be published in : Ease 2026 The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏