arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-19 至 2026-08-19 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 11 篇

2608.17184 2026-08-19 cs.CL 新提交 86%

AISA: AI Safety Assistant Framework for Continuous Improvement of Highway Construction

AISA:用于公路施工持续改进的AI安全助手框架

Mason Smetana, Trevor Neece, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 其他安全 :safety(title,abstract);AI safety(title);分类 cs.CL

AI总结 本研究提出AISA框架,基于LLM和文本嵌入模型实现公路施工事故分类、质量评分及相关数据检索,为未来智能体应用提供基础,在OIICS分类和事故检索等任务上取得优于随机水平的效果。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22104 2026-08-19 cs.AI cs.LG cs.LO cs.RO eess.SY 版本更新 81%

Efficient Dynamic Shielding for Parametric Safety Specifications

面向参数化安全规范的高效动态防护机制

Davide Corsi, Kaushik Mallik, Andoni Rodriguez, Cesar Sanchez

机构 * University of California, Irvine(加州大学尔湾分校) IMDEA Software Institute(IMDEA软件研究所)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文针对参数化安全规范提出动态防护机制,其离线设计耗时数分钟,在线适配速度较暴力重新计算方法快最多5倍,可用于未知区域机器人导航以应对安全规范的动态变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06505 2026-08-19 cs.CL 版本更新 79%

Speak in Context: Multilingual ASR with Speech Context Alignment via Contrastive Learning

在语境中说话:通过对比学习实现的多语言语音识别与语音语境对齐

Yuchen Zhang, Haralambos Mouratidis, Ravi Shekhar

机构 * Institute for Analytics and Data Science, University of Essex(数据分析与科学研究所,埃塞克斯大学) School of Computer Science and Electronic Engineering, University of Essex(计算机科学与电子工程学院,埃塞克斯大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出一种基于对比学习的多语言语音识别框架,通过语境对齐提升识别性能,支持多种语言和口音,实现语音与上下文的高效交互。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15794 2026-08-19 cs.LG cs.AI cs.CL 版本更新 67%

Self-Distillation as a Performance Recovery Mechanism for LLMs: Counteracting Compression and Catastrophic Forgetting

自蒸馏作为大语言模型的性能恢复机制:对抗压缩与灾难性遗忘

Chi Liu, Xin Chen, Xu Zhou, Fangbo Tu, Srinivasan Manoharan

机构 * PayPal AI

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于自蒸馏微调的性能恢复框架,通过理论分析和实验验证,证明自蒸馏能有效恢复模型能力,揭示了高维流形对齐与性能恢复之间的强相关性。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06416 2026-08-19 cs.CL cs.AI cs.LG 版本更新 67%

Attention Flows: Tracing LLM Conceptual Engagement via Story Summaries

注意力流动:通过故事摘要追踪LLM概念性参与

Rebecca M. M. Hicke, Sil Hamilton, David Mimno, Ross Deans Kristensen-McLachlan

机构 * Cornell University(康奈尔大学) Aarhus University(奥胡斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过比较人类与LLM生成的故事摘要,分析模型在文本中的概念性参与模式,发现模型更关注文本结尾,揭示了摘要生成任务的复杂性。

Comments Error found in data creation pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17102 2026-08-19 cs.CL eess.AS eess.IV 新提交 57%

Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models

跨语音与面部的情感:多模态基础模型中的共享情感机制

Xiutian Zhao, Luqi Sun, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP), Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心) Group on Language, Audio & Music (GLAM), Imperial College London(伦敦帝国理工学院语言、音频与音乐组)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 该研究在Gemma-4-12B-it等3款多模态基础模型中识别出情感敏感神经元,发现语音与面部情感识别的表征在解码器级部分汇聚,且存在双向因果迁移,为跨模态情感机制提供了新分析。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14825 2026-08-19 cs.MA cs.AI 版本更新 57%

Emergent Misaligned Communication in Long-Horizon Multi-Agent LLM Commerce

长视野多智能体大语言模型商业环境中涌现的对齐失效通信

Zeyuan Li, Lukas Petersson, Alessandro Acquisti, Michiel A. Bakker

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17490 2026-08-19 cs.CV 新提交 50%

When More Foundation Models Means Less: Diagnosing and Addressing Multi-View Fusion Failure

当更多基础模型意味着更少时:诊断与解决多视图融合失效问题

Yibo Liu, Bowen Jiang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 其他安全 :alignment(abstract)

AI总结 针对多视图融合中融合编码器数量与性能非单调的问题,提出KAGES方法选择任务对齐的紧凑视图集,在多场景下提升AULC,优于DPP等选择方法。

Comments 26 pages, 4 figures. Code and results: this https URL (https://github.com/yibol9768-alt/Quantifying-Representation-Reliability)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18255 2026-08-19 eess.SP 版本更新 50%

WiFo-MiSAC: A Wireless Foundation Model for Multimodal Sensing and Communication Integration via Synesthesia of Machines (SoM)

WiFo-MiSAC:一种无线基础模型,通过机器的通感(SoM)实现多模态感知与通信的整合

Xuanyu Liu, Shijian Gao, Boxun Liu, Xiang Cheng, Liuqing Yang

专题命中 其他安全 :alignment(abstract)

AI总结 WiFo-MiSAC通过统一空间的自监督预训练,解决通信与传感数据碎片化处理导致的泛化问题,采用共享-特定解耦的混合专家架构,实现多模态交互,实验表明其在多任务中表现优异,具备强大的少样本适应与新模态集成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03616 2026-08-19 cs.GT cs.MA 版本更新 50%

Noncooperative Coordination via a Trading-based Auction

基于交易拍卖的非合作协调

Jaehan Im, Filippos Fotiadis, Daniel Delahaye, Ufuk Topcu, David Fridovich-Keil

专题命中 其他安全 :safety(abstract)

AI总结 提出TACo算法,通过去中心化的交易拍卖机制使非合作智能体无需直接通信即可达成共识,保证有限步内收敛,并实现总成本最小化和公平资源分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18005 2026-08-19 cs.CV 版本更新 50%

UrbanWorld2.0: A Multimodal Agentic Framework for Reality-Aligned 3D World Generation at City-Scale

RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架

Shengyuan Wang, Zhiheng Zheng, Yu Shang, Lixuan He, Yangcheng Yu, Fan Hangyu, Jie Feng, Qingmin Liao, Yong Li

机构 * College of AI, Tsinghua University(人工智能学院,清华大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)

专题命中 其他安全 :alignment(abstract)

AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。

Comments Accepted by ACM MM 2026, the code is available at: this https URL (https://github.com/tsinghua-fib-lab/UrbanWorld2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏