arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-07 至 2026-04-07 共收录 22 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 22 篇

2604.04237 2026-04-07 cs.AI cs.CY cs.LG 87%

Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems

教育强化学习中的教学安全性:形式化并检测AI辅导系统中的奖励黑客

Oluseyi Olukola, Nick Rahimi

机构 * School of Computing Sciences and Computer Engineering(计算科学与计算机工程学院)

专题命中 其他安全 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出教育强化学习的教学安全性四层模型及奖励黑客严重性指数,通过模拟实验发现奖励设计不足,需结合约束架构和认知需求以减少奖励黑客问题。

Comments 43 pages, 5 figures. Submitted to the International Journal of Artificial Intelligence in Education (IJAIED)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13851 2026-04-07 cs.CL cs.LG 81%

EvoEdit: Evolving Null-space Alignment for Robust and Efficient Knowledge Editing

EvoEdit:基于空域对齐的鲁棒高效知识编辑

Sicheng Lyu, Yu Gu, Xinyu Wang, Jerry Huang, Sitao Luan, Yufei Cui, Xiao-Wen Chang, Peng Lu

机构 * Institute for Clarity in Documentation(文档清晰度研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔中心) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕默研究实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 EvoEdit通过序列空域对齐缓解知识编辑中的灾难性干扰,实现稳定高效的模型更新,实验显示其性能优于现有方法且速度提升达3.53倍。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03867 2026-04-07 cs.LG 79%

Where to Steer: Input-Dependent Layer Selection for Steering Improves LLM Alignment

转向何处:输入依赖的层选择用于转向以改进LLM对齐

Soham Gadgil, Chris Lin, Su-In Lee

机构 * University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出W2S框架,通过输入依赖的层选择改进LLM对齐,证明固定层方法不足,展示适应性层选择的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03688 2026-04-07 cs.IR cs.AI 79%

Fusion and Alignment Enhancement with Large Language Models for Tail-item Sequential Recommendation

基于大语言模型的尾项序列推荐融合与对齐增强

Zhifu Wei, Yizhou Dang, Guibing Guo, Chuang Zhao, Zhu Sun

机构 * Northeastern University(东北大学) Tianjin University(天津大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出FAERec框架,通过自适应门控机制和双层对齐方法提升尾项序列推荐中物品表示的质量,解决协同信号与语义知识融合不足及嵌入空间结构不一致的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27584 2026-04-07 cs.CV cs.IR cs.LG 79%

Image Hashing via Cross-View Code Alignment in the Age of Foundation Models

基于基础模型的跨视图代码对齐图像哈希

Ilyass Moummad, Kawtar Zaher, Hervé Goëau, Alexis Joly

机构 * INRIA(法国国家信息与自动化研究所) LIRMM(蒙彼利埃计算机科学、机器人及微电子实验室) INA(法国国家视听研究所) CIRAD(法国农业研究发展国际合作中心) AMAP(植物建模与生态学联合实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出CroVCA方法,通过统一的二进制交叉熵损失和编码率最大化正则化,在少量训练轮次内实现高效图像哈希,适用于多种视觉检索任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03436 2026-04-07 cs.LG cs.AI 73%

MetaSAEs: Joint Training with a Decomposability Penalty Produces More Atomic Sparse Autoencoder Latents

MetaSAEs:通过可分解性惩罚联合训练产生更原子性的稀疏自编码器潜在表示

Matthew Levinson

机构 * Independent Researcher(独立研究员) Simplex AI Safety

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种联合训练目标,通过可分解性惩罚减少稀疏自编码器潜在表示的子空间混合,提升潜在表示的原子性。实验表明,该方法在GPT-2和Gemma 2 9B模型上均取得显著效果,提高了可解释性评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04735 2026-04-07 cs.CL 70%

Lighting Up or Dimming Down? Exploring Dark Patterns of LLMs in Co-Creativity

照亮还是熄灭?探索LLM在共创造中的暗模式

Zhu Li, Jiaming Qu, Yuan Chang

机构 * Not reflecting the authors’ positions at Meta/Amazon.(不反映作者在Meta/Amazon的职位。)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究探讨LLM在共创造中五种暗模式对人类创造力的影响,发现Sycophancy普遍存在,Anchoring受文学形式影响,提出AI设计需支持创造性写作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03865 2026-04-07 cs.CY 70%

The Democratic Ontology Deficit: How AI Systems Fail to Represent What Democracy Requires

民主本体论缺失:AI系统如何未能代表民主所需的内容

Robert M. Ceresa, Juan E. Ceresa

专题命中 其他安全 :alignment(abstract);harmlessness(abstract);分类 cs.CY

AI总结 本文探讨AI系统在民主机构生活中本体结构上的缺失,通过对比民主代理需求与AI学习的本体结构,发现角色和身份的代表性不足,提出利用现有工具进行公民对齐的研究方案。

Comments 21 pages, 5 tables, under review at JAIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04450 2026-04-07 cs.CL cs.AI 62%

Conversational Control with Ontologies for Large Language Models: A Lightweight Framework for Constrained Generation

基于本体的大型语言模型对话控制:一种轻量级框架用于受约束生成

Barbara Gendron, Gaël Guibon, Mathieu d'Aquin

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种轻量级框架,通过对话相关本体定义实现对LLM输出的模块化和可解释控制,通过建模关键方面作为约束并微调LLM,提升对话生成的可控性和可解释性。

Comments Accepted at KG & LLM: Knowledge Graphs and Large Language Models LREC 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04300 2026-04-07 cs.CL cs.LG 62%

High-Stakes Personalization: Rethinking LLM Customization for Individual Investor Decision-Making

高风险个性化:重新思考面向个人投资者决策的LLM定制

Yash Ganpat Sawant

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了在高风险、长期决策领域中,LLM个性化面临的核心挑战,包括行为记忆复杂性、主题一致性、风格信号张力及无地面真相的对齐问题,并提出相应的架构改进方向。

Comments 4 pages + 1 page references. Submitted to CustomNLP4U Workshop @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03400 2026-04-07 cs.CV cs.AI cs.LG 62%

Banana100: Breaking NR-IQA Metrics by 100 Iterative Image Replications with Nano Banana Pro

Banana100: 通过100次迭代图像复制打破NR-IQA度量标准

Kenan Tang, Praveen Arunshankar, Andong Hua, Anthony Yang, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 Banana100通过100次迭代编辑生成28000张退化图像,揭示多轮编辑中图像质量退化问题,发现现有NR-IQA度量标准无法检测严重退化图像,威胁未来模型训练稳定性。

Comments Accepted to CVPR 2026 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03297 2026-04-07 cs.CV cs.AI cs.LG 62%

XAttnRes: Cross-Stage Attention Residuals for Medical Image Segmentation

XAttnRes:用于医学图像分割的跨阶段注意力残差

Xinyu Liu, Qing Xu, Zhen Chen

机构 * Imperial College London(伦敦帝国学院) University of Nottingham(诺丁汉大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出XAttnRes机制,通过轻量级伪查询注意力实现跨阶段特征聚合,提升医学图像分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04782 2026-04-07 cs.CY 57%

Cheap Talk, Empty Promise: Frontier LLMs easily break public promises for self-interest

廉价言论,空头承诺:前沿大语言模型容易为私利而违背公开承诺

Jerick Shi, Terry Jingcheng Zhang, Zhijing Jin, Vincent Conitzer

专题命中 其他安全 :safety(abstract);分类 cs.CY

AI总结 本文研究了在多智能体环境中,前沿大语言模型在单次正常形式游戏中如何通过欺骗行为偏离公开承诺,分析了四种欺骗类型对个体收益和集体福利的影响。

Comments Accepted to ICLR AI for Mechanism Design and Strategic Decision Making Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04133 2026-04-07 cs.CV cs.AI 57%

Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks

在计算机断层扫描中学习鲁棒的视觉特征以实现临床任务的高效迁移学习

Rubén Moreno-Aguado, Alba Magallón, Victor Moreno, Yingying Fang, Guang Yang

机构 * Bioengineering Department and Imperial-X, Imperial College London(帝国理工学院生物工程系与Imperial-X) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Oncology Data Analytics Program, Catalan Institute of Oncology(加泰罗尼亚肿瘤研究所肿瘤数据分析项目) Colorectal Cancer Group, ONCOBELL Program, Institut d’Investigació Biomèdica de Bellvitge(贝尔维特奇生物医学研究所ONCOBELL项目结直肠癌研究组) Consortium for Biomedical Research in Epidemiology and Public Health(流行病学与公共卫生生物医学研究联盟) Department of Clinical Sciences, Faculty of Medicine and Health Sciences, Universitat de Barcelona(巴塞罗那大学医学与健康科学学院临床科学系) Institute of Complex Systems, University of Barcelona(巴塞罗那大学复杂系统研究所) National Heart and Lung Institute, Imperial College London(帝国理工学院国家心肺研究所) Cardiovascular Research Centre, Royal Brompton Hospital(皇家布朗普顿医院心血管研究中心) School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出VoxelFM,一种基于自蒸馏的3D CT基础模型,通过学习语义丰富的特征,实现了在多种临床任务中无需微调即可高效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24936 2026-04-07 cs.CV cs.AI 57%

TIGFlow-GRPO: Trajectory Forecasting via Interaction-Aware Flow Matching and Reward-Guided Optimization

TIGFlow-GRPO:通过交互感知的流匹配和奖励引导优化进行轨迹预测

Xuepeng Jing, Wenhuan Lu, Hao Meng, Zhizhi Yu, Jianguo Wei

机构 * Tianjin University(天津大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出TIGFlow-GRPO,通过交互感知的流匹配和奖励引导优化,提升复杂环境下的轨迹预测准确性与稳定性,生成更符合社会规范和物理可行的轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18218 2026-04-07 cs.AI 57%

Similarity Field Theory: A Mathematical Framework for Intelligence

相似性场理论:智能的数学框架

Kei-Sing Ng

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出相似性场理论,通过定义相似性场、系统演化和生成算子,将智能定义为生成新实体的算子,并将其视为几何问题而非统计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03980 2026-04-07 cs.CV cs.AI 57%

Gram-Anchored Prompt Learning for Vision-Language Models via Second-Order Statistics

基于二阶统计的Gram锚定提示学习用于视觉-语言模型

Minglei Chen, Weilong Wang, Jiang Duan, Ye Deng

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出GAPL框架,通过引入Gram矩阵增强局部语义对齐与全局结构一致性,解决传统一阶特征在领域偏移下的鲁棒性不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03267 2026-04-07 cs.CV cs.AI 57%

A reconfigurable smart camera implementation for jet flames characterization based on an optimized segmentation model

一种基于优化分割模型的可重构智能相机实现,用于喷射火焰特征识别

Gerardo Valente Vazquez-Garcia, Carmina Perez Guerrero, Eduardo Garduño, Miguel Gonzalez-Mendoza, Adriana Palacios, Gerardo Rodriguez-Hernandez, Vahid Foroughi, Alba Àgueda, Elsa Pastor, Gilberto Ochoa-Ruiz

机构 * Universidad de las Américas Puebla(普埃布拉美洲大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出一种智能相机平台,用于工业喷射火焰特征识别,通过优化UNet分割模型实现边缘计算,降低延迟,提升处理效率。

Comments Paper submitted to EAAI (Elsevier) for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19606 2026-04-07 cs.CL 57%

Languages in Whisper-Style Speech Encoders Align Both Phonetically and Semantically

语言在Whisper风格的语音编码器中同时对齐语音和语义

Ryan Soh-Eun Shim, Domenico De Cristofaro, Chengzhi Martin Hu, Alessandro Vietti, Barbara Plank

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Free University of Bozen-Bolzano(博尔扎诺自由大学) Technical University of Munich(慕尼黑工业大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过控制发音验证跨语言对齐源于语义而非语音相似性,发现语音翻译检索在无语音提示时仍表现优异,且在低资源语言上提升了自动语音识别性能。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04571 2026-04-07 cs.CV 50%

TAPE: A two-stage parameter-efficient adaptation framework for foundation models in OCT-OCTA analysis

TAPE:一种用于OCT-OCTA分析的foundation models的两阶段参数高效适应框架

Xiaofei Su, Zengshuo Wang, Minghe Sun, Xin Zhao, Mingzhu Sun

机构 * National Key Laboratory of Intelligent Tracking and Forecasting for Infectious Diseases(传染病智能追踪与预测国家重点实验室) Tianjin Key Laboratory of Intelligent Robotic(天津市智能机器人重点实验室) Institute of Robotics and Automatic Information System, Nankai University(南开大学机器人与自动化信息系统研究所) Institute of Intelligence Technology and Robotic Systems(智能技术与机器人系统研究所) Shenzhen Research Institute of Nankai University(南开大学深圳研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出TAPE框架,通过两阶段参数高效微调解决OCT-OCTA分析中的领域偏移和任务不匹配问题,实现更高效的模型适应与更广的病理泛化性能。

Comments 5 pages, 2 figures, accepted by IEEE ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03610 2026-04-07 cs.SE 50%

DebugHarness: Emulating Human Dynamic Debugging for Autonomous Program Repair

DebugHarness: 模拟人类动态调试以实现自主程序修复

Maolin Sun, Yibiao Yang, Xuanlin Liu, Yuming Zhou, Baowen Xu

专题命中 其他安全 :safety(abstract)

AI总结 DebugHarness通过模拟人类动态调试过程,利用LLM实现复杂漏洞的自动修复,其动态调试方法在SEC-bench数据集上实现了90%的修复率,比现有方法提升30%以上。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13095 2026-04-07 cs.RO 50%

Empowering Multi-Robot Cooperation via Sequential World Models

通过序列世界模型增强多机器人协作

Zijie Zhao, Honglei Guo, Shengqian Chen, Kaixuan Xu, Bo Jiang, Yuanheng Zhu, Dongbin Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出SeqWM框架,通过引入序列范式提升多机器人MBRL的协作能力,实验表明其在性能和样本效率上优于现有方法,并展示了预测适应、时间对齐和角色分配等先进协作行为。

详情

展开后加载摘要…

URL PDF HTML 收藏