arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-30 至 2026-06-30 共收录 150 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 31 篇

2602.23353 2026-06-30 cs.LG cs.AI 81%

SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport

SOTAlign:通过最优传输实现半监督的单模态视觉与语言模型对齐

Simon Roschmann, Paul Krzakala, Sonia Mazelet, Quentin Bouniot, Zeynep Akata

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SOTAlign框架,通过少量配对数据和大量未配对数据实现视觉与语言模型的半监督对齐,利用最优传输理论提升对齐效果,优于传统监督和半监督方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29949 2026-06-30 eess.IV cs.AI q-bio.GN 79%

Data-Efficient Multimodal Alignment for Histopathology-based Molecular Prediction

基于组织病理学的分子预测的数据高效多模态对齐

Dominik Winter, Dominik Vonficht, Loïc Le Bescond, Christian Gebbe, Marco Rosati, Richard J. Chen, Markus Schick, Ross Stewart, Nicolas Brieu

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 提出一种轻量级对齐模块,在冻结的组织病理学和RNA-Seq基础模型上训练,实现无需测序或重新训练即可通过基因集签名预测通路活性的开放词汇分子提示,并在多癌队列中实现25倍检索提升。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29933 2026-06-30 cs.CL 79%

Towards Physical Intuitions for Alignment Dynamics: A Case Study With Randomness Crystallization

走向对齐动力学的物理直觉:以随机性结晶为例的案例研究

Kunal Samanta, Ari Holtzman, Peter West

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 通过类比热力学相变中的结晶过程,将语言模型对齐分解为三个相,并提出直观度量验证相变,为对齐动力学提供物理直觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29577 2026-06-30 cs.CV cs.AI 79%

ReMAP-PET: Beyond Visual Understanding -- Learning Region-Guided Metabolic Alignment Semantics from Brain PET

ReMAP-PET:超越视觉理解——从脑PET学习区域引导的代谢对齐语义

Dasen Dai, Yanteng Zhang, Shuoqi Li, Yuxiang Wei, Hongjie Yu, Qingxin Zhang, Qizhen Lan, Jagath C. Rajapakse, Vince D. Calhoun

机构 * The Chinese University of Hong Kong, HKSAR(香港中文大学) TReNDS Center (Georgia State, Georgia Tech, Emory)(TReNDS中心(佐治亚州立大学、佐治亚理工学院、埃默里大学)) ShanghaiTech University, Shanghai, P.R.China(上海科技大学) University of California, Berkeley, USA(加州大学伯克利分校) University of Texas Health Science Center at Houston, USA(德克萨斯大学健康科学中心(休斯顿)) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 提出ReMAP-PET框架,通过联合回归和对比学习监督3D ResNet-50学习脑PET的区域代谢语义,在SUVR预测和检索上显著优于基线,并实现与临床语言的对齐及报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08774 2026-06-30 cs.IR cs.AI 79%

Multimodal Representation Alignment for Cross-modal Information Retrieval

多模态表示对齐用于跨模态信息检索

Fan Xu, Luis A. Leiva

机构 * University of Luxembourg(卢森堡大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文研究多模态表示对齐对跨模态检索的影响,通过对比不同度量标准和嵌入空间,发现余弦相似度在对齐任务中表现最佳,同时 Wasserstein 距离提供了分布差异的补充视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30244 2026-06-30 cs.CV 78%

Semantic-Driven Scale and Spatial Selection for Efficient Cross-Modal Alignment in Referring Remote Sensing Image Segmentation

语义驱动的尺度与空间选择实现指代遥感图像分割中的高效跨模态对齐

Kun Li, Shengxi Gui, Francesco Nex, Michael Ying Yang

机构 * University of Liverpool, UK(利物浦大学) University of Michigan, USA(密歇根大学) University of Twente, NL(埃因霍温理工大学) University of Bath, UK(巴斯大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出S4ECA框架,通过参数高效微调的双编码器适配器架构,利用语言引导的尺度与空间选择机制实现跨模态对齐,仅更新2.4%骨干参数即在RRSIS-D和RefSegRS数据集上达到最优性能。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29081 2026-06-30 eess.SY cs.SY 78%

Divergence-based Safety Measure for Large Language Models via Rational Inattention

基于散度的语言模型安全度量:理性疏忽视角

Anh Tung Nguyen, Quanyan Zhu

专题命中 其他安全 :safety(title,abstract)

AI总结 针对嵌入输入攻击,提出一种基于KL散度的LLM安全度量,利用注意力机制与理性疏忽的等价性构建隐蔽约束,并通过Bregman散度推导上界,应用于GPT-2和GPT-Neo-125M以区分模型安全特性。

Comments 16 pages and 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30009 2026-06-30 cs.CL 74%

Node-to-Neighborhood Semantic Consistency: Text-Topology Alignment for TAGs Anomaly Detection

节点到邻域语义一致性:文本属性图异常检测中的文本-拓扑对齐

Bochen Lin, Jianxiang Yu, Jiayi Wu, Lin Qi, Huang Lu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(东华大学数据科学与工程学院) WeChat, Tencent(微信、腾讯)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 针对文本属性图异常检测中文本语义与拓扑关系不对齐的问题,提出N2NSC框架,通过双融合路径捕获节点与邻域的语义一致性,在八个数据集上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29604 2026-06-30 cs.LG cs.AI 73%

Mechanistically Eliciting Latent Behaviors in Language Models

机械性地引发语言模型中的潜在行为

Andrew Mack, Nina Panickssery, Alexander Matt Turner

机构 * Principles of Intelligence(智能原理研究所) Anthropic(Anthropic公司) Independent(独立)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03335 2026-06-30 cs.CL 70%

Compressed Sensing for Capability Localization in Large Language Models

压缩感知在大语言模型能力定位中的应用

Anna Bair, Yixuan Even Xu, Mingjie Sun, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 研究通过压缩感知方法识别大语言模型中特定能力依赖的稀疏注意力头,发现关闭少量头可显著降低特定能力表现,揭示了模型模块化组织原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02498 2026-06-30 cs.CL cs.AI cs.LG 67%

Test-Time Detoxification without Training or Learning Anything

无需训练或学习的测试时去毒化

Baturay Saglam, Dionysis Kalogerias

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种无需训练或学习的测试时去毒化方法,通过零阶优化调整输入嵌入以减少生成文本的毒性,实现安全高效的文本生成。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29164 2026-06-30 cs.LG cs.AI cs.CG 62%

Invariant Reasoning Directions in Latent Trajectories of Language Models

语言模型潜在轨迹中的不变推理方向

Arun Vignesh Malarkkan, Manan Roy Choudhury, Utkarsh Byahut, Yash Ravindra Charde, Vivek Gupta, Yanjie Fu

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 发现潜在推理轨迹中存在稳定不变方向,提出TILR方法通过低秩子空间干预提升推理一致性与稳定性。

Comments 9 main text pages and 6 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05879 2026-06-30 cs.LG cs.AI 62%

Hard-constraint physics-residual networks for hydrogen crossover prediction and high-pressure extrapolation in PEM water electrolysis

具有硬约束物理残差网络的氢渗透预测及质子交换膜水电解中的高压外推

Yong-Woon Kim, Jihyeok Lee, Chulung Kang, Yung-Cheol Byun

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合物理定律的硬约束残差网络PR-Net,用于预测质子交换膜水电解中的氢渗透,并在高压外推中表现出色,相比纯数据驱动神经网络和软约束物理信息神经网络,PR-Net在预测精度和外推能力上均有显著提升。

Comments Final peer-reviewed version. Updated to match the published open-access article. DOI and journal reference added

Journal ref Applied Energy 421 (2026) 128220

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29904 2026-06-30 cs.CL 57%

Timesteps of Mamba Align with Human Reading Times

Mamba的时间步长与人类阅读时间对齐

Yuji Yamamoto, Shinnosuke Isono, Yoshinobu Kawahara, Sho Yokoi

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究发现状态空间语言模型Mamba的每词时间步长能显著预测人类阅读时间,即使控制GPT-2惊讶度等已知预测因子后仍显著,表明Mamba可作为研究人类实时语言处理的新工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29773 2026-06-30 cs.LG 57%

GLIP: Graph and LLM Joint Pretraining for Graph-Level Tasks

GLIP:面向图级任务的图与大型语言模型联合预训练

Haoxin Sun, Yiqing Lin, Yajun Huang, Chenhui Dong, Mingjun Li, Zhongzhi Zhang

机构 * Fudan University(复旦大学) ByteDance(字节跳动)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出GLIP框架,通过图增强、多令牌选择策略和扩散投影器,联合预训练图神经网络和大型语言模型,在图级分类与推理任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29712 2026-06-30 cs.CL 57%

Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

为何纠结于连续潜变量?通过渲染压缩实现可解释的离散潜变量推理

Shuochen Chang, Qingyang Liu, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出离散潜变量推理(DLR)方法,将连续潜状态转化为离散令牌,通过渲染压缩实现高效、可解释的潜空间推理,在五个基准上优于先前方法并达到20倍压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29586 2026-06-30 cs.CV cs.AI 57%

SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis

SonoCLIP: 面向胎儿超声分析的掩码引导区域感知视觉-语言预训练

Hang Su, Chao Sun, Zhaofan Li, Wei Hu, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,武汉,中国) Institute of Artificial Intelligence, Wuhan University, Wuhan, China(武汉大学人工智能研究院,武汉,中国) Department of Ultrasound, Renmin Hospital of Wuhan University, Wuhan, China(武汉大学仁民医院超声科,武汉,中国) National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(武汉大学多媒体软件国家工程研究中心,武汉,中国) Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(湖北省多媒体与网络通信工程重点实验室,武汉大学,武汉,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出SonoCLIP,首个百万级区域可控胎儿超声视觉-语言基础模型,通过掩码引导的全局-局部对比学习,提升对临床关键局部结构的敏感性,在零样本迁移中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28667 2026-06-30 cs.CL 57%

Phonological Perception of Sign Language Models

手语模型的音系感知

Kayo Yin, Jessica Carter, Alex Xijie Lu, Annemarie Kocab

机构 * University of California, Berkeley(加州大学伯克利分校) Johns Hopkins University(约翰霍普金斯大学) Microsoft Research(微软研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究通过最小对测试和表征对齐评估手语识别模型的音系感知能力,发现模型具有涌现音系敏感性但存在架构权衡:姿态模型对手形敏感,像素模型对位置敏感。

Comments Accepted to CogSci 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22282 2026-06-30 cs.CV cs.AI 57%

UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation

UniMotion: 一种用于运动-文本-视觉理解和生成的统一框架

Ziyi Wang, Xinshun Wang, Shuang Chen, Yang Cong, Mengyuan Liu

机构 * Peking University(北京大学) Donghua University(东华大学) South China University of Technology(华南理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 UniMotion首次提出统一框架,同时处理人类运动、自然语言和RGB图像的理解与生成,通过连续模态处理和自监督预训练解决传统模型的局限性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02425 2026-06-30 cs.RO cs.AI 57%

Multi-Class Human/Object Detection on Robot Manipulators using Proprioceptive Sensing

使用本体感知传感进行机器人机械臂的多类人类/物体检测

Justin Hehli, Marco Heiniger, Maryam Rezayati, Hans Wernher van de Venn

机构 * MINDLab, Institute of Mechatronic Systems, ZHAW(苏黎世应用科技大学机电系统研究所MINDLab) Institute of Mechatronics system, ZHAW(苏黎世应用科技大学机电系统研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出多类人类/物体检测方法,通过Franka Emika Panda机械臂采集数据,采用LSTM、GRU和Transformer模型,实现实时91.11%的识别准确率,验证了多类检测模型的可行性。

Comments 2025 IEEE 21st International Conference on Automation Science and Engineering (CASE), Los Angeles, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29645 2026-06-30 cs.IR 50%

Metadata, Structure, or Strategy? A Decomposition of RAG Context Enrichment

元数据、结构还是策略?RAG上下文丰富化的分解研究

Saber Zerhoudi, Michael Granitzer, Jelena Mitrovic

专题命中 其他安全 :alignment(abstract)

AI总结 通过控制实验分解检索增强生成中的上下文丰富化因素,发现大多数丰富化降低准确性,模型能力与上下文的匹配比元数据数量更关键。

Journal ref European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML-PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29462 2026-06-30 cs.CV 50%

MIRROR: Aligning Semantic Relations from Language to Image via Gromov--Wasserstein

MIRROR: 通过Gromov-Wasserstein对齐从语言到图像的语义关系

Hong-Han Wang, Yuntao Wang, Hu Ding

专题命中 其他安全 :alignment(abstract)

AI总结 提出MIRROR框架,通过半逆Gromov-Wasserstein问题将语言中的关系先验几何对齐到视觉表示,提升多模态大模型的关系一致性,无需额外参数或推理成本。

Comments Accepted to ECCV 2026. 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29270 2026-06-30 cs.MA 50%

Minority Sentinel: When to Overturn Majority Voting in Multi-Agent LLM Debates

少数派哨兵:何时推翻多智能体LLM辩论中的多数投票

Chuan He, Zebin Chen, Zhengyi Yang, Shaobo Qiao, Mingchen Ju, Jiate Liu, Dong Wen, Guanfeng Liu

专题命中 其他安全 :safety(abstract)

AI总结 针对LLM辩论中多数投票压制正确少数意见的问题,提出Minority Sentinel轻量级元分类器,通过辩论日志特征训练LightGBM模型,在6个基准上实现81.2%的翻转精度和正向净增益。

Comments 11 pages, 4 figures. Accepted at the AgentSearch Workshop @ SIGIR 2026, Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29155 2026-06-30 cs.SE 50%

OASIF: An Efficient Obfuscation-Aware Self-Improving Framework for LLM-Based Assembly Code Instruction Following and Comprehension

OASIF:一种高效的混淆感知自改进框架,用于基于LLM的汇编代码指令遵循与理解

Xinyi Wang, Rongze Chen, Ke Wang, Qiyuan Chen, Yanming Liu, Xiang Li, Chunfu Jia

专题命中 其他安全 :alignment(abstract)

AI总结 提出OASIF框架,通过令牌高效汇编编码器、轻量投影器和三阶段训练(特征空间对齐、监督指令微调、在线自进化强化学习),提升LLM在商业级混淆汇编代码上的指令遵循与理解能力,在VMISA-Bench上取得显著成功率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05999 2026-06-30 cs.CV 50%

RePer-360: Releasing Perspective Priors for 360$^\circ$ Depth Estimation via Self-Modulation

RePer-360:通过自调节机制释放视角先验以实现360度深度估计

Cheng Guan, Chunyu Lin, Zhijie Shen, Junsong Zhang, Jiyuan Wang

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出RePer-360框架,通过自调节机制在保留预训练视角先验的情况下实现单目全景深度估计,仅用1%的数据即可提升RMSE约20%。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05329 2026-06-30 cs.SD eess.AS 50%

CosyEdit: Unlocking End-to-End Speech Editing Capability from Zero-Shot Text-to-Speech Models

CosyEdit:从零样本文本到语音模型中解锁端到端语音编辑能力

Junyang Chen, Yuhang Jia, Hui Wang, Jiaming Zhou, Yong Qin

专题命中 其他安全 :alignment(abstract)

AI总结 CosyEdit通过任务特定的后训练和互补训练范式,从零样本文本到语音模型中解锁端到端语音编辑能力,实现高一致性语音编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16413 2026-06-30 cs.CV 50%

BrepLLM: Enabling Large Language Models to Understand Boundary Representations

BrepLLM: 使大语言模型能够理解边界表示

Liyuan Deng, Hao Guo, Yongkang Dai, Yunpeng Bai, Yifan Zhu, Yuanyuan Gao, Huaxi Huang, Yilei Shi

专题命中 其他安全 :alignment(abstract)

AI总结 BrepLLM通过双阶段训练管道,将B-rep数据转化为图表示并进行语义对齐,实现3D语言生成,展示了在3D物体分类和描述任务中的最佳性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07778 2026-06-30 cs.CV 50%

Distribution Matching Variational AutoEncoder

分布匹配变分自编码器

Sen Ye, Jianning Pei, Mengde Xu, Shuyang Gu, Chunyu Wang, Liwei Wang, Han Hu

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出DMVAE,通过分布匹配约束将编码器的潜在分布与任意参考分布对齐,发现基于自监督学习的分布在图像生成中表现优异。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14483 2026-06-30 cs.CV 50%

Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Vivid-VR:基于文本到视频扩散变换器的文本概念蒸馏用于逼真视频修复

Haoran Bai, Xiaoxu Chen, Canqian Yang, Zongyao He, Sibin Deng, Ying Chen

机构 * Alibaba Group - Taobao & Tmall Group(阿里巴巴集团 - 淘宝天猫集团)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出Vivid-VR,通过文本到视频基础模型生成视频修复方法,利用ControlNet控制生成过程以保持内容一致性。为解决传统微调中的分布偏移问题,提出概念蒸馏策略,通过预训练T2V模型合成带文本概念的训练样本,提升纹理和时间一致性。

Comments Accepted by ICLR 2026; ICLR version of the paper: https://openreview.net/pdf?id=YV5Zgv8pdg

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06728 2026-06-30 cs.CV 50%

Multimodal Large Language Model driven Radiology Report Generation with Clinical Knowledge Enhancement

基于多模态大语言模型的放射科报告生成与临床知识增强

Miaojing Shi, Tianyu Cen, Zijie Yue, Meng Wei, Oluwatosin Alabi, Tom Vercauteren

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海自主智能无人系统科学中心)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出一种融合多模态大语言模型与临床知识的放射科报告生成方法,通过解剖学特征提取、多模态报告生成及多任务学习提升报告的临床相关性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏