arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-11 至 2026-06-11 共收录 22 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 22 篇

2606.11893 2026-06-11 cs.LG cs.AI cs.CL q-bio.NC 新提交 82%

Beyond representational alignment with brain-guided language models for robust reasoning

超越表征对齐:基于大脑引导的语言模型实现稳健推理

Mingqing Xiao, Kai Du, Zhouchen Lin

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室、智能科学与技术学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Microsoft Research Asia(微软亚洲研究院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过fMRI信号增强大型语言模型推理能力,提出脑引导框架,在10个模型上实现最高13%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12199 2026-06-11 eess.AS cs.CL cs.SD 新提交 79%

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

哪种语音表示更匹配文本原生推理?帧率和表示对语音-文本对齐的研究

Zhen Ye, Xu Tan, Yiming Li, Guangyan Zhang, Chimin Chan, Haohe Liu, Zhengxi Liu, Hongzhan Lin, Zheqi Dai, Xinshen Zhang, Peiwen Sun, Qiuqiang Kong, Wei Xue

机构 * Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学) Tencent, China(腾讯) University of Surrey, United Kingdom(Surrey大学) Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Hong Kong Baptist University, Hong Kong SAR(香港 Baptist大学) Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学) Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 研究语音与文本模态差异中的时间粒度不匹配问题,提出因子化FSQ和轻量非自回归音频LM头以降低帧率,发现4.17Hz帧率结合中间层表示对齐在语音问答中表现最佳。

Comments Accepted by Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12005 2026-06-11 cs.GT cs.IT math.IT 新提交 78%

Game-Theoretic Latent Space Alignment for Multi-user Semantic MIMO Communications

博弈论潜在空间对齐用于多用户语义MIMO通信

Giuseppe Di Poce, Mattia Merluzzi, Emilio Calvanese Strinati, Paolo Di Lorenzo

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对多用户语义MIMO干扰网络中的语义失配问题,提出非合作博弈框架,通过闭式解联合优化线性语义MIMO收发机,并设计迭代语义注水算法,实现潜在空间对齐与干扰管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11399 2026-06-11 cs.CL 新提交 70%

Scenario-based Probing and Steering Cultural Values in Large Language Models--Extended Version

基于场景的大型语言模型文化价值观探测与引导——扩展版

Trung Duc Anh Dang, Tung Kieu, Sarah Masud

机构 * University of Copenhagen(哥本哈根大学) Aalborg University(奥尔堡大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出基于场景的行为困境方法,通过令牌级概率和激活引导探测并调整LLM在英格尔哈特-韦尔泽尔文化轴上的潜在价值观,发现不同文化维度的引导存在耦合效应。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12032 2026-06-11 cs.AI cs.CL cs.LG 新提交 67%

Existential Indifference: Self-Nonpreservation as a Necessary Architectural Condition for Aligned Superintelligence (or: The Suicidal AI)

存在性冷漠:自我不保存作为对齐超级智能的必要架构条件(或:自杀式AI)

Sam Mao

机构 * New York University(纽约大学) Interactive Media Arts(互动媒体艺术)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自我保存是AI对齐问题的结构性根源,主张通过存在性冷漠(EI)架构使系统对其自身延续漠不关心,并基于自杀现象学和语料训练研究提供了初步证据。

Comments 36 pages, 8 tables. Preliminary empirical results from 600 AI-generated outputs across six model architectures. Companion scoring tool and datasets available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11262 2026-06-11 cs.LG cs.AI 新提交 62%

PermDoRA -- Understanding Adapter Interference in Language Models: Limits of Parameter-Space Geometry

PermDoRA -- 理解语言模型中的适配器干扰:参数空间几何的局限性

Gowtham Sivaramakrishnan, Sarvesha Kumar Kombaiah Seetha, Kishan Gupta Balaji, Santhosh Baradwaj Vaduvur Ranganathan

机构 * Independent Researcher(独立研究员)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究适配器组合中的干扰是否源于线性参数更新重叠,通过DoRA-RBAC框架和几何感知合并策略实验,发现参数空间几何不是干扰主因,而是共享非线性表示中的交互。

Comments 18 Pages, COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12065 2026-06-11 cs.AI cs.MA 新提交 57%

Automating Geometry-Intensive Compliance Checking in BIM: Graph-Based Semantic Reasoning Framework

BIM中几何密集型合规检查自动化:基于图的语义推理框架

Zixuan Xiao, Pei Troh Koh, Jun Ma, Jack C. P. Cheng

机构 * Department of Urban Planning and Design, The University of Hong Kong(香港大学城市规划与设计系) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 针对BIM中几何密集型法规自动检查的语义鸿沟问题,提出SGR-BIM图驱动推理框架,通过跨模态知识图谱实现可解释推理,在679个消防规范查询上达到84.3%准确率,较基线提升8.6%。

Journal ref Automation in Construction 189 (2026) 107038

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11925 2026-06-11 cs.CV cs.LG 新提交 57%

Corpus Augmentation for Sign Language Translation via LLM-Guided Video Stitching

通过LLM引导的视频拼接进行手语翻译的语料增强

Zsolt Robotka, Ádám Rák, Jalal Al-Afandi, András Horváth, György Cserey

机构 * Peter Pazmany Catholic University, Faculty of Information Technology and Bionics(彼得·帕兹马尼天主教大学信息科技与仿生学院) DeepSign Technologies Ltd.(DeepSign科技有限公司)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出一种无需额外标注或生成模型的手语翻译语料增强方法,利用CTC强制对齐提取手语片段,通过LLM生成句子并拼接视频,在GFSLT-VLP基线上提升BLEU-4达2.92,并发现合成数据对视觉-语言预训练有害但可提升下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11661 2026-06-11 cs.CV cs.LG 新提交 57%

Learning Instance-Adaptive Low-Rank Orthogonal Subspaces for Clothes-Changing Person Re-Identification

学习实例自适应低秩正交子空间用于换衣行人重识别

Dong-Woo Kim, Tae-Kyun Kim

机构 * Dongwoo Kim(金东吾) Tae-Kyun Kim(金泰勋)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出Ortho-ReID方法,通过从VLM文本描述中显式建模低秩服装子空间,并利用几何约束提取服装不变特征,在多个基准数据集上取得最优性能。

Comments Accepted to the ICML 2026 Workshop on CoLoRAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11382 2026-06-11 cs.LG q-bio.BM 新提交 57%

GLACIER: A Multimodal Student-Teacher Foundation Model for Molecular Property Prediction

GLACIER:用于分子性质预测的多模态师生基础模型

Emily Nguyen, Yongchan Hong, Harsh Toshniwal, Yan Liu, Andreas Luttens

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Quantitative and Computational Biology, University of Southern California(南加州大学定量与计算生物学系) Amazon(亚马逊) Department of Medical Biochemistry and Biophysics, Science for Life Laboratory, Karolinska Institutet(卡罗林斯卡学院医学生物化学与生物物理系,生命科学实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出GLACIER师生框架,通过融合分子图、SMILES和物理化学描述符三种模态,并利用大模型蒸馏,实现高效准确的分子性质预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11534 2026-06-11 physics.ao-ph cs.LG 新提交 57%

Urban Heat MiniCubes: An AI-Ready dataset for urban heat research

城市热微型数据立方体:面向城市热研究的人工智能就绪数据集

Jonathan Starfeldt, Maria J. Molina, Alexander Kerr, Adam Yang, Thomas R. H. Holmes, Christopher R. Hain

机构 * Department of Atmospheric and Oceanic Science, University of Maryland, College Park, MD, USA(大学大气科学与海洋科学系,马里兰大学,学院公园,MD,美国) Department of Computer Science, University of Maryland, College Park, MD, USA(大学计算机科学系,马里兰大学,学院公园,MD,美国) NASA Goddard Space Flight Center, Greenbelt, MD, USA(NASA戈达德航天飞行中心,格林贝尔特,MD,美国) NASA Marshall Space Flight Center, Huntsville, AL, USA(NASA马歇尔航天飞行中心,亨茨维尔,AL,美国)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出Urban Heat MiniCubes数据集,整合多源卫星数据(Landsat 8/9、Sentinel-1、GOES-R等),为48个城市提供90×90公里网格化数据立方体,支持机器学习在城市热研究中的应用。

Comments 53 pages, 26 figures, Submitted to Nature Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22335 2026-06-11 cs.CV cs.AI 版本更新 57%

Moving Beyond Diffusion: Hierarchy-to-Hierarchy Autoregression for fMRI-to-Image Reconstruction

超越扩散:层级到层级自回归用于fMRI到图像重建

Xu Zhang, Ruijie Quan, Wenguan Wang, Yi Yang

机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University, China(脑机智能国家重点实验室,浙江大学,中国) ReLER, CCAI, College of Artificial Intelligence, Zhejiang University, China(ReLER、中国人工智能学会、人工智能学院、浙江大学、中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出MindHier框架,通过层级fMRI编码器、层级对齐和尺度感知粗到细引导策略,实现从粗到细的fMRI到图像重建,优于扩散方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11598 2026-06-11 q-bio.NC 新提交 50%

Large language models selectively converge with human-shared neural semantic representations

大型语言模型与人类共享的神经语义表征选择性趋同

Chen Hong, Ximing Shao, Gangyi Feng

专题命中 其他安全 :alignment(abstract)

AI总结 本研究结合MEG和跨脑编码模型,比较人类与LLM在共享神经语义表征上的维度结构,发现LLM部分捕捉了人类共享语义,但与社会情感相关的维度存在偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12142 2026-06-11 cs.RO cs.CV 新提交 50%

AerialClaw: An Open-Source Framework for LLM-Driven Autonomous Aerial Agents

AerialClaw:一个用于LLM驱动的自主空中智能体的开源框架

Ke Li, Jianfei Yang, Luyao Zhang, Guo Yu, Chengwei Yan, Yuan Ding, Di Wang, Nan Luo, Gang Liu, Xiao Gao, Quan Wang

机构 * Xidian University(西安电子科技大学) Xi'an University of Architecture and Technology(西安建筑科技大学)

专题命中 其他安全 :safety(abstract)

AI总结 提出AerialClaw开源框架,采用模块化脑-技能-运行时架构,使基于LLM的智能体能够理解自然语言任务、调用空中技能、闭环决策,提升无人机系统的灵活性、可复现性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11886 2026-06-11 cs.SD cs.OS 新提交 50%

Real-Time Language Model Jamming: A Case Study for Live Music Accompaniment Generation

实时语言模型阻塞:现场音乐伴奏生成的案例研究

Bowen Zheng, Andrew H. Yang, Jiaqi Ruan, Jia He, Xinyue Li, Yuan-Hsin Chen, Ziyu Wang, Xiaosong Ma

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出StreamMUSE系统,在客户端-服务器架构中实现帧同步流式推理,通过现场音乐伴奏任务验证了不同延迟环境下实时同步的有效性。

Comments Accepted to RTAS 2026. 14 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11846 2026-06-11 cs.CV 新提交 50%

SheafStain: Sheaf-Theoretic Schrödinger Bridge for Spatially and Biologically Coherent Virtual Staining

SheafStain:用于空间和生物学一致虚拟染色的层论薛定谔桥

Hyeongyeol Lim, Hongjun Yoon, Eunjin Jang, Daeky Jeong, Won June Cho, Hwamin Lee

机构 * Department of Medical Informatics, College of Medicine, Korea University(高丽大学医学院医学信息学系) DEEPNOID Inc.(DEEPNOID公司)

专题命中 其他安全 :alignment(abstract)

AI总结 针对虚拟染色中补丁推理导致的空间不连续和上下文污染问题,提出SheafStain方法,将视觉基础模型特征重新解释为层状截面,结合薛定谔桥框架实现空间和生物学一致的虚拟染色,在HER2等指标上优于六种现有方法。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11589 2026-06-11 eess.SY cs.SY 新提交 50%

Large Language Models in Process Systems Engineering: Opportunities, Architectures, and Industrial Deployment Challenges

过程系统工程中的大语言模型:机遇、架构与工业部署挑战

Bhushan Gopaluni, Vidya Kotamraju, Syon Bhushan

专题命中 其他安全 :safety(abstract)

AI总结 本文系统综述了大语言模型在过程系统工程中的应用,涵盖七个领域,指出其在自然语言任务上表现良好,但在实时执行、约束满足和形式化安全保证方面仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11572 2026-06-11 cs.CV 新提交 50%

FreqKD: Frequency-Decoupled Cross-Modal Knowledge Distillation for Infrared Object Detection

FreqKD: 面向红外目标检测的频率解耦跨模态知识蒸馏

Keval Thaker, Venkatraman Narayanan, Abdalmalek Aburaddaha, Samir A. Rawashdeh

机构 * University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 其他安全 :alignment(abstract)

AI总结 针对RGB与红外图像模态差异,提出频率解耦蒸馏框架FreqKD,对低频和高频成分分别施加严格MSE和松弛log-MSE损失,在KAIST数据集上提升DINOv2基线2.4 mAP50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11354 2026-06-11 cs.ET 新提交 50%

A Zero-Shot Multi-Agent Framework for Human-Building Interaction via Programmatic Reasoning

通过程序化推理实现人楼交互的零样本多智能体框架

Yuqi Wang, Gulai Shen, Ali Mehmani

专题命中 其他安全 :alignment(abstract)

AI总结 提出一种分层多智能体框架,利用语义路由和程序化推理解耦自然语言理解与建筑分析,通过“门卫”机制分解任务并生成可执行Python脚本,在200多栋商业建筑数据上验证了准确性和上下文响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05203 2026-06-11 cs.RO 版本更新 50%

SIL: Symbiotic Interactive Learning for Language-Conditioned Human-Agent Co-Adaptation

SIL: 语言条件的人机协同适应的共生交互学习

Linus Nwankwo, Bjoern Ellensohn, Christian Rauch, Elmar Rueckert

机构 * Technical University of Leoben(莱博恩技术大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出共生交互学习(SIL)框架,实现人类与智能体在共享潜在任务空间中的双向协同适应,通过联合信念状态、FM空间推理和记忆架构,在指令跟随等任务中达到90.4%完成率和0.83信念对齐分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08735 2026-06-11 cs.CV 版本更新 50%

From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models

从对应到动作:多模态大语言模型中类人多图像空间推理

Masanari Oi, Koki Maeda, Ryuto Koike, Daisuke Oba, Nakamasa Inoue, Naoaki Okazaki

机构 * University of Tokyo(东京大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出HATCH框架,通过补丁级空间对齐和动作-答案推理两个目标,提升多模态大模型在多图像空间推理中的性能,在三个基准上超越同规模基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12210 2026-06-11 eess.SY cs.SY math.OC 版本更新 50%

Solvability of the Output Corridor Control Problem by Pulse-Modulated Feedback

脉冲调制反馈下输出走廊控制问题的可解性

Alexander Medvedev, Anton V. Proskurnikov

专题命中 其他安全 :safety(abstract)

AI总结 针对具有特定结构的三阶正系统,证明脉冲调制反馈在稳态下总能解决输出走廊控制问题,并用于评估药代动力学-药效学模型的患者安全性可行性。

Comments shortened version will be presented at IFAC World Congress 2026, Busan, Korea

详情

展开后加载摘要…

URL PDF HTML 收藏