arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-23 至 2026-06-23 共收录 171 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 35 篇

2606.21197 2026-06-23 cs.CV cs.AI cs.LG 新提交 62%

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

通过稀疏自编码器提取和分析视觉语言模型中的多模态概念

Sergio Lanza, Jae Hee Lee, Stefan Wermter

机构 * Knowledge Technology, Department of Informatics, University of Hamburg(汉堡大学信息学系知识技术实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出基于稀疏自编码器的框架,从视觉语言模型中提取视觉、文本和多模态概念,通过余弦相似度评估概念与样本的对齐,在VQA数据集上提升视觉概念质量达45%。

Comments International Conference on Artificial Neural Networks (ICANN), 2026, Padua

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13007 2026-06-23 cs.LG cs.AI 新提交 62%

scLLM-DSC: LLM-Knowledge Enhanced Cross-Modal Deep Structural Clustering for Single-Cell RNA Sequencing

scLLM-DSC:基于LLM知识增强的跨模态深度结构聚类用于单细胞RNA测序

Ping Xu, Pengjiang Li, Tian Du, Zaitian Wang, Jiawei Gu, Zhiyuan Ning, Ziyue Qiao, Pengfei Wang, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) School of Computing and Information Technology, Great Bay University(大湾区大学计算机科学与技术学院) School of Engineering, Westlake University(西湖大学工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出scLLM-DSC框架,通过知识驱动语义视图与结构感知拓扑视图的跨模态对比对齐,利用LLM增强单细胞RNA测序数据的聚类性能,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09893 2026-06-23 cs.CL cs.AI 版本更新 62%

Pseudo-Deliberation in Language Models: When Reasoning Fails to Align Values and Actions

语言模型中的伪 deliberation:当推理无法使价值观与行动一致时

Sushrita Rakshit, Hanwen Zhang, Hua Shen

机构 * New York University(纽约大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型中价值观与行动不一致的问题,提出伪 deliberation 概念,并通过 VALDI 框架评估对齐程度,发现不同模型在生成对话中存在一致的偏差。

Comments 9 pages, 5 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09416 2026-06-23 cs.CL cs.CY 版本更新 62%

Are Language Models Sensitive to Morally Irrelevant Distractors?

语言模型对道德无关干扰因素敏感吗?

Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang

机构 * University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究借鉴道德心理学中的“情境主义”观点,通过构建包含60种道德无关干扰因素的多模态数据集,发现这些干扰因素能使大语言模型的道德判断偏移超过30%,揭示了其道德判断的不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22382 2026-06-23 eess.IV cs.AI cs.CV 新提交 57%

Large Language Model-Assisted Cleaning of Report-Derived Labels in a Large-Scale Chest CT Dataset

大型胸部CT数据集中基于大语言模型的报告衍生标签清洗

Yosuke Yamagishi, Atsushi Takamatsu, Mototsugu Sato, Tomohiro Kikuchi, Shouhei Hanaoka, Takeharu Yoshikawa, Osamu Abe

机构 * Division of Radiology and Biomedical Engineering, Graduate School of Medicine, The University of Tokyo(放射医学与生物医学工程系,东京大学医学研究生院) Department of Computational Diagnostic Radiology and Preventive Medicine, The University of Tokyo Hospital(计算诊断放射学与预防医学系,东京大学医院) Department of Radiology, Kanazawa University Hospital(金泽大学医院放射科) Faculty of Medicine, The University of Tokyo(东京大学医学系) Department of Radiology, School of Medicine, Jichi Medical University(立命馆大学医学系放射科) Department of Radiology, The University of Tokyo Hospital(东京大学医院放射科)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究利用大语言模型(GPT-5.4)清洗CT-RATE数据集中的标签-报告不一致性,通过放射科医生裁决验证,发现LLM辅助清洗能有效识别临床相关错误,并提升数据集质量。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23394 2026-06-23 cs.CL 新提交 57%

Do LLM Embedding Spaces Recover Expert Structure?

LLM嵌入空间是否恢复了专家结构?

Yixuan Zhu, Zhenke Duan, Fanghen Li

机构 * Zhongnan University of Economics and Law(中南财经政法大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究LLM嵌入空间能否恢复心理健康领域的专家定义类别结构,通过对比预训练和微调Qwen3嵌入,发现对齐程度依赖于粒度级别且需控制混杂因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22495 2026-06-23 cs.AI 新提交 57%

Grounded Scaling: Why Agentic AI Needs Deterministic Environments

Grounded Scaling: 为什么代理型AI需要确定性环境

Liang Ding, Xintong Wang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文论证环境确定性是影响长链代理任务成功的关键因素,提出确定性-效率界限、验证者-古德哈特下限等理论,并构建供应确定性指数和确定性成熟度模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21882 2026-06-23 cs.SD cs.AI 新提交 57%

Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead

基于有限前瞻的流式T5文本到语音合成

Muyang Du, Jason Roche, Junjie Lai

机构 * NVIDIAChina(英伟达中国) NVIDIAUSA(英伟达美国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出S5-TTS,一种基于T5的流式变体,通过编码器-解码器语言模型和单调对齐学习实现逐词增量语音合成,并引入前瞻因果掩码和交错多源蒸馏以在低延迟下保持质量。

Comments 6 pages, 1 figure, 4 tables, Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20761 2026-06-23 cs.SE cs.AI cs.ET cs.MA cs.SY eess.SY 新提交 57%

Integrating Large Language Model Agents with Digital Twins for Industrial Autonomous Systems

将大语言模型代理与数字孪生集成用于工业自主系统

Yuchen Xia

机构 * Institut für Automatisierungs- und Softwaresysteme (IAS) der Universität Stuttgart(自动化与软件系统研究所(IAS)的斯图加特大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 提出三层框架集成大语言模型、数字孪生与自动化系统,通过TPSR模型和四种LLM角色实现自适应任务规划与执行,提升工业自动化适应性。

Comments Doctoral Dissertation, University of Stuttgart. Doctoral Exam Video Recording: https://youtu.be/Mhd9LiV5TKE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20707 2026-06-23 cs.CV cs.AI 新提交 57%

GEOPHYS: The Geometry of Physical Plausibility

GEOPHYS: 物理合理性的几何学

Christian Internò, Alexander Pondaven, Habon Issa, Fabio Pizzati, Francesco Pinto, Markus Olhofer, Ivan Laptev, Philip Torr, Eero P. Simoncelli, Barbara Hammer, David Klindt

机构 * Bielefeld University(比勒费尔德大学) University of Oxford(牛津大学) Cold Spring Harbor Laboratory(冷泉港实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Independent(独立作者) Honda Research Institute EU(本田欧洲研究院) New York University(纽约大学) Flatiron Institute, Simons Foundation(西蒙斯基金会熨斗研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出GEOPHYS方法,利用冻结图像编码器的每帧嵌入的五个几何特征检测视频中的物理不合理性,在物理违反检测上达到SOTA,并作为验证器提升视频生成模型的物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20598 2026-06-23 cs.HC cs.AI 新提交 57%

Using Biometrics to Understand AI-Assisted Coding Performance and its Perception

使用生物特征理解AI辅助编程性能及其感知

Paolo Burelli, Fabio Calefato, Daniela Grassi, Mihaela Yurieva Hristova, Nicole Novielli, Alberto Antonio, Romano, Paolo Tell

机构 * IT University of Copenhagen(丹麦技术大学) University of Bari(巴里大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 通过脑电图、眼动追踪等生物特征数据,发现AI辅助编程与无辅助编程在认知过程上存在显著差异,且主观感知与客观测量不一致。

Comments Stage 2 RR under review at EMSE. The accepted Stage 1 protocol is publicly archived on OSF (DOI: 10.31219/osf.io/mex39_v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22859 2026-06-23 cs.AI astro-ph.IM physics.soc-ph 新提交 57%

AI Scientists as Engines of Discovery: A Case for Development within Reformed Institutions

作为发现引擎的AI科学家:在改革机构内发展的案例

Raul Jimenez, Boris Bolliet, Francisco Villaescusa-Navarro, Rabih Zbib, Benjamin Wandelt, David N. Spergel, Thomas Meier, Jessica Montgomery, Hana Aliee, Licia Verde

机构 * Institute of Cosmos Sciences (ICCUB), University of Barcelona(巴塞罗那大学宇宙科学研究所) ICREA Cavendish Astrophysics, University of Cambridge(剑桥大学卡文迪什天体物理学) Kavli Institute for Cosmology, University of Cambridge(剑桥大学卡维里宇宙学研究所) Center for Computational Astrophysics, Flatiron Institute(弗拉蒂隆研究所计算天体物理中心) Department of Astrophysical Sciences, Princeton University(普林斯顿大学天体物理科学系) Avature Department of Physics and Astronomy, Johns Hopkins University(约翰霍普金斯大学物理与天文学系) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系) Flatiron Institute(弗拉蒂隆研究所) Munich Center for Machine Learning, LMU Munich(慕尼黑大学慕尼黑机器学习中心) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) School of Clinical Medicine, University of Cambridge(剑桥大学临床医学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文论证多智能体AI系统将从被动工具进化为“AI科学家”,通过原型框架Denario加速发现周期,并提出机构需为验证、问责、可解释性和双重用途安全进行改革。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19309 2026-06-23 cs.LG eess.SP 57%

Time-Vertex Machine Learning for Optimal Sensor Placement in Temporal Graph Signals: Applications in Structural Health Monitoring

时间顶点机器学习用于时间图信号中的最优传感器布置:在结构健康监测中的应用

Keivan Faghih Niresi, Jun Qing, Mengjie Zhao, Olga Fink

机构 * Intelligent Maintenance and Operations Systems Lab., EPFL, Lausanne, Switzerland(智能维护与运营系统实验室,瑞士联邦理工学院,洛桑)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出时间顶点机器学习框架,结合图信号处理、时域分析和机器学习,实现可解释且高效的传感器布置,通过识别代表性节点减少冗余并保留关键信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03818 2026-06-23 cs.CL 版本更新 57%

Empirical Prompt Engineering for Construct Identification with Large Language Models

改善人机编码对齐:心理学构念识别中提示工程的实证评估

Kylie L. Anglin, Stephanie Milan, Brittney Hernandez, Claudia Ventura

机构 * Department of Educational Psychology, Neag School of Education, University of Connecticut(教育心理学系,教育学院,康涅狄格大学) Department of Psychological Sciences, College of Liberal Arts and Sciences, University of Connecticut(心理学系,文理学院,康涅狄格大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究提出一个实证框架,通过提示工程优化大语言模型在心理学文本中识别构念的性能。实验评估五种提示策略,发现构念定义和任务框架最关键,结合代码簿引导和自动提示工程的少样本方法最接近专家判断。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00116 2026-06-23 q-bio.NC cs.AI 版本更新 57%

Meta-learning ecological priors from large language models explains human learning and decision making

从大型语言模型中元学习生态先验解释人类学习与决策

Akshay K. Jagadish, Mirko Thalmann, Julian Coda-Forno, Marcel Binz, Eric Schulz

机构 * Institute for Human-Centered AI, Helmholtz Computational Health Center(以人为本的人工智能研究所,海德堡计算健康中心) Computational Principles of Intelligence, Max Planck Institute for Biological Cybernetics(计算智能原理,马克斯·普朗克生物 cybernetics 研究院) Eberhard Karls University of Tübingen(图宾根大学) Princeton AI Lab, Princeton University(普林斯顿大学人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出生态理性分析框架,利用大语言模型生成生态有效任务,通过元学习得到ERMI算法,该算法内化自然问题空间的统计规律,灵活适应新情境,在15个实验中优于多个认知模型,表明人类认知可能反映对日常问题生态结构的适应性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23131 2026-06-23 cs.CV 新提交 50%

Expert Consensus on Criteria for the Automated Assessment of Laparoscopic Camera Navigation

腹腔镜摄像头导航自动化评估标准的专家共识

Amir Ebrahimzadeh, Nazila Esmaeili, Michael Ghadimi, Jannis Hagenah

机构 * University Medical Center Göttingen(哥廷根大学医学中心) Fraunhofer Research Institution for Individualized and Cell-based Medical Engineering (IMTE)(弗劳恩霍夫个性化与细胞医学工程研究所)

专题命中 其他安全 :safety(abstract)

AI总结 通过专家调查和计算机视觉技术评估,确定了腹腔镜摄像头导航的14个关键方面,并建立了临床重要性与技术就绪度矩阵,为自动化技能评估提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23173 2026-06-23 physics.optics 新提交 50%

Silicon Ring Based 64$\times$100 GHz Wavelength Division Multiplexing filter

基于硅环的64×100 GHz波分复用滤波器

Q. Deng, A. Elshazly, M. Oktay, J. De Coster, R. Magdziak, C. Marchese, G. Lepage, D. Bode, H. Kobbi, H. K. Tyagi, J. R. Vaskasi, M. E. Filipcic, H. Sar, M. Chakrabarti, D. Velenis, P. Verheyen, P. Absil, F. Ferraro, Y. Ban, J. Van Campenhout

专题命中 其他安全 :alignment(abstract)

AI总结 提出一种新型环-马赫-曾德尔干涉仪级联架构,利用三阶多项式互连弯曲构建低损耗半环波导,实现64×100 GHz硅基WDM滤波器,插入损耗3.2±1.1 dB,通道隔离度≥10.7 dB。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09717 2026-06-23 cs.SD eess.AS 新提交 50%

What Makes Synthetic Speech Sound Sarcastic? A Prosody-Controlled Perception Study

什么让合成语音听起来讽刺?一项韵律控制的感知研究

Zhu Li, Shekhar Nayak, Matt Coler

机构 * University of Groningen(格罗宁根大学)

专题命中 其他安全 :alignment(abstract)

AI总结 通过可控神经TTS系统操纵语速、音高变化和响度,发现响度主要驱动人类对讽刺的感知,而模型更依赖语速,揭示了韵律线索权重差异。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12683 2026-06-23 cs.CV q-bio.NC 版本更新 50%

Brain-DiT: A Universal Multi-state fMRI Foundation Model with Metadata-Conditioned Pretraining

Brain-DiT:一种基于元数据条件预训练的通用多状态fMRI基础模型

Junfeng Xia, Wenhao Ye, Xuanye Pan, Xinke Shen, Mo Wang, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology, China(南方科技大学生物医学工程系,中国) School of Biomedical Engineering, Shenzhen University, China(深圳大学生物医学工程学院,中国)

专题命中 其他安全 :alignment(abstract)

AI总结 提出Brain-DiT,一种基于扩散Transformer和元数据条件预训练的通用多状态fMRI基础模型,在24个数据集上预训练,通过生成式预训练学习多尺度表示,在7个下游任务中优于重建和对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20475 2026-06-23 cs.CV 版本更新 50%

CREG: Compass Relational Evidence Graph for Characterizing Directional Structure in VLM Spatial-Reasoning Attribution

CREG: 用于表征VLM空间推理归因中方向性结构的指南针关系证据图

Kaizhen Tan, Yang Feng, Heqing Du

机构 * Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出CREG框架,将令牌级归因转换为以参考为中心的指南针分布并测量方向对齐,揭示当前归因方法的方向性结构有限且常与图像布局混合,任务准确率提升不保证方向归因改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04748 2026-06-23 q-bio.GN 版本更新 50%

SeekRBP: Leveraging Sequence-Structure Integration with Reinforcement Learning for Receptor-Binding Protein Identification

SeekRBP: 利用强化学习整合序列-结构信息识别受体结合蛋白

Xiling Luo, Le Ou-Yang, Yang Shen, Jiaojiao Guan, Dehan Cai, Jun Zhang, Guoliang Xing, Yanni Sun, Jiayu Shang

专题命中 其他安全 :alignment(abstract)

AI总结 提出SeekRBP框架,通过多臂老虎机策略动态采样难负例,融合蛋白质语言与结构嵌入,有效识别序列差异大的受体结合蛋白,在噬菌体宿主预测中表现优异。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏