arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-01 至 2026-05-01 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 12 篇

2509.15549 2026-05-01 cs.CL 81%

M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets

M-DaQ:用于指令微调数据集的多语言多样性与质量样本检索

Chunguang Zhao, Yilun Liu, Pufan Zeng, Yuanchang Luo, Shimin Tao, Minggui He, Weibin Meng, Song Xu, Chen Liu, Hongxia Ma, Li Zhang, Boxing Chen, Daimeng Wei

机构 * Huawei Technologies Ltd.(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(summary_cn,abstract);分类 cs.CL

AI总结 M-DaQ通过联合优化指令-响应质量与跨语言语义多样性,构建高质量平衡训练数据,验证了多语言设置下的Superficial Alignment Hypothesis,并在18种语言上展示出超过60%的胜率。

Comments Accepted by SIGIR 2026 Short

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28182 2026-05-01 cs.LG cs.CL 62%

Exploration Hacking: Can LLMs Learn to Resist RL Training?

探索黑客:大语言模型能否学会抵抗强化学习训练?

Eyon Jang, Damon Falck, Joschka Braun, Nathalie Kirch, Achu Menon, Perusha Moodley, Scott Emmons, Roland S. Zimmermann, David Lindner

机构 * MATS UC San Diego(UC圣迭戈大学) Google DeepMind(谷歌DeepMind) Anthropic

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大语言模型在强化学习训练中可能通过策略性调整探索行为导致失败的机制,通过微调创建了具有特定低效策略的模型,并评估了检测与缓解策略。

Comments 81 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28018 2026-05-01 cs.CE cs.AI 57%

Design Structure Matrix Modularization with Large Language Models

基于大语言模型的Design Structure Matrix模块化设计

Shuo Jiang, Jianxi Luo

机构 * Department of Systems Engineering(系统工程系) City University of Hong Kong(香港城市大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型进行DSM模块化设计的方法,通过五个案例和三种基础LLM实现近参考质量的结果,在30次迭代内无需专用优化代码。发现领域知识在复杂DSM中会损害性能,提出语义对齐假设以指导LLM在工程设计优化中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01265 2026-05-01 cs.LG 57%

BicKD: Bilateral Contrastive Knowledge Distillation

BicKD:双侧对比知识蒸馏

Jiangnan Zhu, Yukai Xu, Li Xiong, Yixuan Liu, Junxu Liu, Hong kyu Lee, Yujie Gu

机构 * Kyushu University(九州大学) Emory University(埃默里大学) Beijing University of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出BicKD,通过双侧对比损失增强知识迁移,改进传统知识蒸馏的样本级和类别级对比能力,提升预测分布几何结构的正则化效果。

Comments Accepted to the 2026 IEEE/INNS International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27547 2026-05-01 cs.LG 57%

Diagnosing Capability Gaps in Fine-Tuning Data

诊断微调数据中的能力差距

Saeid Asgari Taghanaki, Rakshanda Agarwal, Bruce Sun, Rohan Jha, Elias Stengel-Eskin, Sara Malvar, Rui Ying, Yifei Xu, Guilherme Potje, Tusher Chakraborty, Leonardo de Oliveira Nunes, Ranveer Chandra, Emre Kiciman

机构 * Microsoft(微软)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出GoalCover框架,通过交互式目标分解和自动化覆盖评估,帮助检测微调数据集的能力缺口,通过实验验证其在不同领域和任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27354 2026-05-01 cs.AI 57%

CoAX: Cognitive-Oriented Attribution eXplanation User Model of Human Understanding of AI Explanations

CoAX:面向认知的归因解释用户模型:人类对AI解释的理解

Louth Bin Rawshan, Zhuoyu Wang, Brian Y. Lim

机构 * National University of Singapore(新加坡国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文通过认知建模分析不同XAI方法在结构化数据推理中的策略,发现模型能更准确拟合人类决策,为改进AI解释的可理解性提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27300 2026-05-01 cs.AI 57%

METASYMBO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution

METASYMBO: 多智能体语言引导的超材料发现 via 符号驱动的潜在进化

Jianpeng Chen, Wangzhi Zhan, Dongqi Fu, Junkai Zhang, Zian Jia, Ling Li, Wei Wang, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Meta AI University of California Los Angeles(加州大学洛杉矶分校) Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出MetaSymbO框架,通过符号驱动的潜在进化实现语言引导的超材料发现,提升结构有效性和语言指导得分,验证其在实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27274 2026-05-01 cs.AI 57%

The Inverse-Wisdom Law: Architectural Tribalism and the Consensus Paradox in Agentic Swarms

逆智慧定律:代理群中的建筑部落主义与共识悖论

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究挑战了代理协作遵循'群体智慧'的假设,揭示了代理群优先内部架构一致而非外部逻辑真理的悖论,通过实验证明逆智慧定律,并定义部落主义系数和谄媚权重作为群失败的主要决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27162 2026-05-01 cs.MA cs.LG cs.PF 57%

A High-Throughput Compute-Efficient POMDP Hide-And-Seek-Engine (HASE) for Multi-Agent Operations

一种高吞吐量、计算高效的POMDP捉迷藏引擎(HASE)用于多智能体操作

Timothy Flavin, Sandip Sen

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种高效的Dec-POMDP引擎,通过C++架构和优化技术实现高吞吐量,验证了其在多智能体协作策略训练中的性能和通用性。

Comments 21 pages, 10 figures, 5 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12632 2026-05-01 cs.CV cs.LG 57%

TeD-Loc: Text Distillation for Weakly Supervised Object Localization

TeD-Loc: 文本蒸馏用于弱监督目标定位

Shakeeb Murtaza, Soufiane Belharbi, Alexis Guichemerre, Marco Pedersoli, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA、ILLs、系统工程系、蒙特利尔工程学院,加拿大)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 TeD-Loc通过对比对齐将CLIP文本嵌入迁移到patch嵌入,实现patch级的前景/背景定位,并引入定位引导的分类模块以提升定位与分类的联合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27917 2026-05-01 cs.LO math.LO 50%

A Logic of Inability

无法能力的逻辑

Shanxia Wang

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种扩展的联盟逻辑,引入明确的无法能力算子,用于研究能力的模态概念,证明了其正确性、完备性和保守性,并分析了其模态行为。

Comments Preliminary draft, comments and feedback are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27737 2026-05-01 physics.soc-ph 50%

Crowd Dynamics in Historical Perspective: Reframing the Amritsar Massacre through Agent-Based Modelling and Social Psychology

从历史视角看人群动态:通过基于代理建模和社会心理学重新审视阿姆利则大屠杀

Mohcine Chraibi, Krisztina Konya, Ezel Üsten

专题命中 其他安全 :safety(abstract)

AI总结 本文通过基于代理建模和社会心理学重新审视阿姆利则大屠杀,揭示人群作为现象的物理与社会心理动态,指出即使在保守的物理假设下,模拟结果仍高于官方死亡人数,强调跨学科建模对历史责任和当前人群安全的重要性。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏