arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-23 至 2026-04-23 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 17 篇

2510.01706 2026-04-23 cs.LG cs.AI 81%

Representational Alignment Across Model Layers and Brain Regions with Multi-Level Optimal Transport

跨模型层和脑区的多级最优传输表示对齐

Shaan Shah, Meenakshi Khosla

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级最优传输框架,通过全局优化实现层间和神经元级的软耦合,解决传统方法在深度不一致和全局结构忽略的问题,提升跨网络表示对比的解释性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20193 2026-04-23 cs.RO 78%

LLM-Guided Safety Agent for Edge Robotics with an ISO-Compliant Perception-Compute-Control Architecture

基于ISO合规感知-计算-控制架构的LLM引导安全代理用于边缘机器人

Xu Huang, Ruofan Zhang, Lu Cheng, Yuefeng Song, Xu Huang, Huayu Zhang, Sheng Yin, Anyang Liang, Chen Qian, Yin Zhou, Xiaoyun Yuan, Yuan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) SIMMIR Tech(SIMMIR科技)

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出一种基于ISO合规架构的LLM引导安全代理,通过将安全规范转化为可执行谓词,实现边缘机器人中的功能安全,支持ISO 13849 Category 3和PL d的实用部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12910 2026-04-23 cs.CL cs.AI 76%

SciCoQA: Quality Assurance for Scientific Paper--Code Alignment

SciCoQA:科学论文与代码对齐的质量保障

Tim Baumgärtner, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普遍知识处理实验室(UKP实验室)、计算机科学系、德累斯顿技术大学和应用网络安全国家研究中心ATHENE)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI

AI总结 本文提出SciCoQA数据集,用于评估LLM在科学论文与代码对齐任务中的表现,揭示自动化科学质量保障的关键差距。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14593 2026-04-23 cs.CL cs.AI 73%

Mechanistic Decoding of Cognitive Constructs in Large Language Models

大语言模型中认知结构的机制解码

Yitong Shou, Manhao Guan

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于Representation Engineering的Cognitive Reverse-Engineering框架,分析社会比较嫉妒的认知机制,揭示模型内部对嫉妒的结构化编码,并展示如何机械检测和抑制有毒情绪状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20055 2026-04-23 cs.AI cs.HC 70%

From Fuzzy to Formal: Scaling Hospital Quality Improvement with AI

从模糊到正式:利用AI扩展医院质量改进

Patrick Vossler, Jean Feng, Venkat Sivaraman, Robert Gallo, Hemal Kanzaria, Dana Freiser, Christopher Ross, Amy Ou, James Marks, Susan Ehrlich, Christopher Peabody, Lucas Zier

机构 * University of California, San Francisco(加州大学旧金山分校) Zuckerberg San Francisco General Hospital(扎克伯格旧金山总医院)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出通过AI框架优化医院质量改进过程,通过学习LLM提示和自然语言规范,提升质量因素发现的效率与可追溯性,实现人类与AI协同优化。

Comments 34 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20398 2026-04-23 cs.CL cs.LG cs.SE 62%

WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning

WebGen-R1: 通过强化学习激励大语言模型生成功能性和美观的网站

Juyong Jiang, Chenglin Cai, Chansung Park, Jiasi Shen, Sunghun Kim, Jianguo Li, Yue Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Electronics and Telecommunications Research Institute(电子电信研究院) Ant Group(蚂蚁集团)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出WebGen-R1框架,通过强化学习生成多页面功能性和美观的网站,解决了传统方法在多页面交互和审美评估上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20012 2026-04-23 cs.CV cs.AI cs.CL 62%

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EmbodiedMidtrain方法,通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距,实验表明中训练能提升不同VLM骨干网络的性能,且在初始化阶段对VLA微调有显著帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19754 2026-04-23 cs.AI cs.LG 62%

Exploring Data Augmentation and Resampling Strategies for Transformer-Based Models to Address Class Imbalance in AI Scoring of Scientific Explanations in NGSS Classroom

探索数据增强和重采样策略以解决基于Transformer模型的AI评分中科学解释类不平衡问题

Prudence Djagba, Kevin Haudek, Clare G. C. Franovic, Leonora Kaldaras

机构 * Michigan State University(密歇根州立大学) CREATE for STEM(STEM创新计划) University of Houston(休斯顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过数据增强策略提升Transformer模型对科学解释评分的性能,发现GPT生成数据和ALP方法在处理严重类别不平衡时效果显著,优于传统过采样方法。

Comments Published as a conference paper at NARST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15861 2026-04-23 cs.CL cs.AI 62%

CAST: Achieving Stable LLM-based Text Analysis for Data Analytics

CAST:实现稳定的大语言模型文本分析用于数据分析

Jinxiang Xie, Zihao Li, Wei He, Rui Ding, Shi Han, Dongmei Zhang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 CAST通过算法提示和先思考后发言提升大语言模型在表格数据分析中的输出稳定性,实验表明其在多个基准上表现最佳,稳定性提升达16.2%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13928 2026-04-23 cs.CL cs.AI 62%

LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X

Shuo Xing, Junyuan Hong, Yifan Wang, Runjin Chen, Zhenyu Zhang, Ananth Grama, Zhengzhong Tu, Zhangyang Wang

机构 * Texas A&M University(德克萨斯农工大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Purdue University(普渡大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

Comments Updated experiments with corrected data

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20496 2026-04-23 cs.CR cs.AI 57%

Mythos and the Unverified Cage: Z3-Based Pre-Deployment Verification for Frontier-Model Sandbox Infrastructure

神话与未验证的笼子:基于Z3的预部署验证用于前沿模型沙盒基础设施

Dominik Blain

机构 * COBALT Formal Verification(COBALT形式验证)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出COBALT,一种基于Z3的正式验证引擎,用于在部署前检测C/C++基础设施中的CWE-190/191/195算术漏洞模式。通过四个生产案例验证其有效性,并提出四层 containment 框架以提升前沿模型的安全性。

Comments 12 pages, 2 figures, 4 production case studies, 4 tables. Research paper on formal verification for frontier-model sandbox infrastructure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13871 2026-04-23 cs.LG cs.SY eess.SY 57%

Hardware-Efficient Neuro-Symbolic Networks with the Exp-Minus-Log Operator

高效硬件神经符号网络与Exp-Minus-Log运算符

Eymen Ipek

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出一种结合深度神经网络与Exp-Minus-Log运算符的混合模型,旨在解决传统DNN在安全关键和资源受限环境中的透明性和计算效率问题,通过硬件可实现的Sheffer元素提升可解释性和形式验证可行性。

Comments This paper has been withdrawn by the authors due to the discovery of a fundamental limitation in EML method

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20811 2026-04-23 cs.AI 57%

Diagnosing CFG Interpretation in LLMs

在LLM中诊断CFG解释

Hanqi Li, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院X-LANCE实验室) AISpeech Co., Ltd., Suzhou, China(上海AI语音有限公司) Shanghai Innovation Institution, Shanghai, China(上海创新研究所) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究LLM在处理新上下文无关文法时能否生成语法正确、行为功能和语义忠实的输出,揭示LLM在语法、行为和语义层面的层次退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20490 2026-04-23 cs.IR 50%

Break the Optimization Barrier of LLM-Enhanced Recommenders: A Theoretical Analysis and Practical Framework

突破LLM增强推荐系统优化障碍:理论分析与实践框架

Zhangchi Zhu, Wei Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 本文通过理论分析和实践框架,解决LLM增强推荐系统中优化障碍问题,提出TF-LLMER框架,通过嵌入规范化和Rec-PCA方法提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20429 2026-04-23 cs.CV 50%

Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing

快速-精细:一种用于遥感跨模态检索的两阶段框架,具有多粒度表示

Xi Chen, Xu Chen, Xiangyang Jia, Xu Zhang, Shuquan Wei, Wei Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种两阶段框架,通过多粒度表示提升遥感跨模态检索效率与精度,采用文本无关召回和文本引导重排序阶段,减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20067 2026-04-23 q-fin.TR 50%

Testing replication for an agent-based model of market fragmentation and latency arbitrage

对代理基于市场碎片化和延迟套利模型的复制性检验

Ethan Ratliff-Crain, Colin M. Van Oort, Matthew T. K. Koehler, Brian F. Tivnan

专题命中 其他安全 :alignment(abstract)

AI总结 本文通过复制Wah和Wellman 2016年的延迟套利模型,发现原论文中缺失的实现细节和有限的定量报告阻碍了准确复制。通过增加模拟次数生成置信区间,弥补了分布信息的不足,并指出模型复杂性与对齐难度成正比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16879 2026-04-23 cs.CV 50%

Adaptive Forensic Feature Refinement via Intrinsic Importance Perception

通过内在重要性感知实现自适应的 forensic 特征细化

Jiazhen Yang, Junjun Zheng, Kejia Chen, Xiangheng Kong, Jie Lei, Zunlei Feng, Bingde Hu, Yang Gao

机构 * Zhejiang University(浙江大学) Alibaba Inc(阿里巴巴公司) Zhejiang University of Technology(浙江工业大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出I2P框架,通过自适应识别关键层表示并约束任务驱动的参数更新,提升SID任务的特定性同时保留预训练表示的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏