arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-05 至 2026-03-05 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 13 篇

2510.10889 2026-03-05 cs.CV cs.AI cs.LG 81%

Topological Alignment of Shared Vision-Language Embedding Space

共享视觉-语言嵌入空间的拓扑对齐

Junwon You, Dasol Kang, Jae-Hun Jung

机构 * Department of Mathematics, POSTECH(POSTECH数学系) BootCamp, Google(Google BootCamp)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 ToMCLIP通过拓扑对齐方法提升多语言视觉-语言模型的结构一致性和零样本性能

Comments 27 pages, 5 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03324 2026-03-05 cs.CL cs.AI 73%

Controlling Chat Style in Language Models via Single-Direction Editing

通过单向编辑控制语言模型的聊天风格

Zhenyu Xu, Victor S. Sheng

机构 * Department of Computer Science, Texas Tech University(计算机科学系,德克萨斯科技大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过单向编辑实现语言模型风格控制,通过线性方向编码实现精准风格调整,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02888 2026-03-05 cs.LG cs.AI cs.CL 67%

When Your Own Output Becomes Your Training Data: Noise-to-Meaning Loops and a Formal RSI Trigger

当你的输出成为你的训练数据:噪声到意义的循环及形式RSI触发

Rintaro Ando

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出N2M-RSI模型,展示AI代理通过自反馈和信息整合阈值可无限增加内部复杂性,并探讨了代理群交互的超线性效应。

Comments Withdrawn due to a critical error discovered in the mathematical derivation and proof of Theorem 2 (Unbounded Growth) and related Lemma 2 (Compression gain lower bound). This flaw invalidates the paper's main conclusion that N2M-RSI guarantees unbounded growth, requiring a fundamental revision of the theoretical framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04045 2026-03-05 cs.LG cs.AI 62%

Inference-Time Toxicity Mitigation in Protein Language Models

蛋白质语言模型中的推理时间毒性缓解

Manuel Fernández Burda, Santiago Aranguri, Iván Arcuschin Moreno, Enzo Ferrante

机构 * Laboratory of Applied Artificial Intelligence (LIAA), Institute of Computer Sciences (ICC), CONICET - Universidad de Buenos(应用人工智能实验室(LIAA)、计算机科学研究所(ICC)、CONICET - 布宜诺斯艾利斯大学) AI Safety Argentina (AISAR)(阿根廷人工智能安全(AISAR)) Goodfire APOLO Biotech(APOLO生物技术)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LDA方法,通过放大logit差异在推理阶段缓解蛋白质语言模型的毒性生成问题,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03304 2026-03-05 cs.LG cs.AI 62%

Knowledge Graph and Hypergraph Transformers with Repository-Attention and Journey-Based Role Transport

知识图谱与超图变换器与仓库注意力和基于旅程的角色传输

Mahesh Godavarti

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合句子和结构化数据的模型,通过仓库注意力和基于旅程的角色传输实现语言和知识表示的分离,并支持多任务学习。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03298 2026-03-05 cs.CL cs.AI 62%

TATRA: Training-Free Instance-Adaptive Prompting Through Rephrasing and Aggregation

TATRA: 无需训练的实例自适应提示法通过重述与聚合

Bartosz Dziuba, Kacper Kuchta, Paweł Batorski, Przemysław Spurek, Paul Swoboda

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 TATRA通过重述与聚合生成实例特定的少量示例提示,无需训练数据和优化循环,在文本分类和数学推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03946 2026-03-05 cs.LG 57%

Lang2Str: Two-Stage Crystal Structure Generation with LLMs and Continuous Flow Models

Lang2Str: 基于LLM和连续流模型的双阶段晶体结构生成

Cong Liu, Chengyue Gong, Zhenyu Liu, Jiale Zhao, Yuxuan Zhang

机构 * AMLab, AI4Science Lab University of Amsterdam(AMLab、AI4Science Lab 阿姆斯特丹大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 Lang2Str通过结合LLM和流模型,实现灵活且精确的晶体结构生成,提升材料设计的效率和定制性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03644 2026-03-05 cs.HC cs.AI 57%

Bridging Pedagogy and Play: Introducing a Language Mapping Interface for Human-AI Co-Creation in Educational Game Design

连接教学与游戏:引入一种语言映射接口用于教育游戏设计中的人机协同创作

Daijin Yang, Erica Kleinman, Casper Harteveld

机构 * Northeastern University(东北大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种基于语言映射的接口,通过人机协同设计教育游戏,以明确教学意图并降低非专业设计师的设计门槛。

Comments Accepted for CHI EA 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03623 2026-03-05 cs.CL econ.EM 57%

A Neural Topic Method Using a Large-Language-Model-in-the-Loop for Business Research

基于循环大型语言模型的神经主题方法用于商业研究

Stephan Ludwig, Peter J. Danaher, Xiaohao Yang

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 LX Topic通过整合大型语言模型细化,提升主题建模的可重复性、可解释性和测量导向性,用于商业研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26905 2026-03-05 cs.AI 57%

Cognition Envelopes for Bounded Decision Making in Autonomous UAS Operations

认知边界用于自主无人机操作中的有限决策

Pedro Antonio Alarcon Granadeno, Arturo Miguel Bernal Russell, Sofia Nelson, Demetrius Hernandez, Maureen Petterson, Michael Murphy, Walter J. Scheirer, Jane Cleland-Huang

机构 * University of Notre Dame(诺特大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出认知边界概念,用于约束自主无人机在搜索救援任务中的决策,结合概率推理和资源分析,以减少 AI 生成决策中的错误。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03969 2026-03-05 cs.CV 50%

Scaling Dense Event-Stream Pretraining from Visual Foundation Models

从视觉基础模型扩展密集事件流预训练

Zhiwen Chen, Junhui Hou, Zhiyu Zhu, Jinjian Wu, Guangming Shi

机构 * City University of Hong Kong(香港城市大学) Xidian University(西安电子科技大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种基于视觉基础模型的自监督预训练方法,通过结构感知的蒸馏损失优化密集事件表示,显著提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20294 2026-03-05 physics.plasm-ph 50%

Interpreting AI for Fusion: an application to Plasma Profile Analysis for Tearing Mode Stability

解释AI用于融合:一种用于等离子体剖面分析以确定撕裂模稳定性的应用

Hiro J Farre-Kaga, Andrew Rothstein, Rohit Sonker, SangKyeun Kim, Ricardo Shousha, Minseok Kim, Keith Erickson, Jeff Schneider, Egemen Kolemen

专题命中 其他安全 :safety(abstract)

AI总结 本文提出了一种基于物理的解释框架,通过Shapley分析揭示等离子体剖面参数对撕裂模稳定性预测的影响,为融合能源中的AI应用提供可解释的ML方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03544 2026-03-05 cs.CV 50%

PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest

PinCLIP:Pinterest的规模化多模态基础表示

Josh Beal, Eric Kim, Jinfeng Rao, Rex Wu, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest Inc.(Pinterest公司)

专题命中 其他安全 :alignment(abstract)

AI总结 PinCLIP通过多模态表示学习提升Pinterest的检索和排序模型,解决冷启动问题并提高用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏