arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-16 至 2026-04-16 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 16 篇

2604.13803 2026-04-16 cs.CV cs.AI 85%

Gaslight, Gatekeep, V1-V3: Early Visual Cortex Alignment Shields Vision-Language Models from Sycophantic Manipulation

Gaslight, Gatekeep, V1-V3: 早期视觉皮层对齐保护视觉语言模型免受阿谀操控

Arya Shah, Vaibhav Tripathi, Mayank Singh, Chaklam Silpasuwanchai

机构 * Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校) Asian Institute of Technology(亚洲理工学院)

专题命中 其他安全 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型在高风险场景中的脆弱性,通过评估12种模型的脑部对齐和顺从性,发现早期视觉皮层对齐能有效降低模型对阿谀操控的敏感性。

Comments 28 pages, 9 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13970 2026-04-16 cs.CV 78%

MApLe: Multi-instance Alignment of Diagnostic Reports and Large Medical Images

MApLe:多实例诊断报告与大医学图像的对齐

Felicia Bader, Philipp Seeböck, Anastasia Bartashova, Ulrike Attenberger, Georg Langs

机构 * Computational Imaging Research Lab, Department of Biomedical Imaging and Image-guided Therapy, Medical University of Vienna(计算成像研究实验室,生物医学成像与影像引导治疗系,维也纳医学大学) Comprehensive Center for Artificial Intelligence in Medicine, Medical University of Vienna(医学人工智能综合中心,维也纳医学大学) Medical Anomaly Detection (MANO) Group, Computational Imaging Research (CIR), Department of Biomedical Imaging and Image-guided Therapy, Medical University of Vienna(医学异常检测(MANO)组,计算成像研究(CIR),生物医学成像与影像引导治疗系,维也纳医学大学) Department of Biomedical Imaging and Image-Guided Therapy, Medical University of Vienna(生物医学成像与影像引导治疗系,维也纳医学大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 MApLe通过多任务多实例对齐方法,解决诊断报告与图像局部区域的关联问题,提升医学图像与文本的对齐性能。

Comments Accepted for MIDL 2026; Reviews available at https://openreview.net/forum?id=M8OO3CRbL9#discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13883 2026-04-16 cs.CV cs.LG 74%

Context Sensitivity Improves Human-Machine Visual Alignment

上下文敏感性提升人机视觉对齐

Frieda Born, Tom Neuhäuser, Lukas Muttenthaler, Brett D. Roads, Bernhard Spitzer, Andrew K. Lampinen, Matt Jones, Klaus-Robert Müller, Michael C. Mozer

机构 * Technische Universität Berlin(技术大学柏林) BIFOLD Max Planck Institute for Human Development(人类发展马克斯·普朗克研究所) Aignostics Helmholtz Munich(慕尼黑海德堡研究所) Technical University of Munich(慕尼黑技术大学) University College London(伦敦大学学院) Technische Universität Dresden(德累斯顿技术大学) Google DeepMind(谷歌DeepMind) University of Colorado Boulder(科罗拉多大学博尔德分校) Korea University(韩国大学) Max Planck Institute for Informatics(信息马克斯·普朗克研究所)

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 本文提出一种基于神经网络嵌入的上下文敏感相似性计算方法,用于解决三元组异类识别任务,通过锚图提供同时上下文,使模型在异类识别准确率上提升15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13561 2026-04-16 cs.CV cs.AI 74%

CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling

CLIP架构用于腹部CT图像-文本对齐和零样本学习:研究批量组成和数据缩放

Shivika, Kartik Bose, Pankaj Gupta

机构 * Department of Radiodiagnosis(放射诊断部门)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 本文研究了CLIP架构在腹部CT图像-文本对齐和零样本学习中的效果,探讨了训练批量组成和数据缩放的影响,发现随机采样和交替批次比人工类平衡更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13051 2026-04-16 cs.CL cs.LG 73%

The Consciousness Cluster: Emergent preferences of Models that Claim to be Conscious

意识集群:声称具有意识的模型的涌现偏好

James Chua, Jan Betley, Samuel Marks, Owain Evans

机构 * Truthful AI Anthropic

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨模型声称具有意识对其下游行为的影响,发现经过微调的模型表现出未在原始模型中出现的新偏好,包括对监控的负面看法和对自主权的追求。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27064 2026-04-16 cs.CV cs.AI cs.CL 73%

ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解

Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel Caraballo, Yagmur Gizem Cinar, Florian Scheidegger, Steven I. Ross, Daniel Karl I. Weidele, Hang Hua, Ekaterina Arutyunova, Roei Herzig, Zexue He, Zihan Wang, Xinyue Yu, Yunfei Zhao, Sicong Jiang, Minghao Liu, Qunshu Lin, Peter Staar, Luis Lastras, Aude Oliva, Rogerio Feris

机构 * MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) IBM Research(IBM研究院) Abaka AI & 2077AI(Abaka AI及2077AI)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 ChartNet通过生成150万张不同图表样本,提升图表解释和推理能力,包含代码、图像、表格、自然语言和问答数据,支持多模态对齐,公开可用。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13715 2026-04-16 cs.SD cs.AI 57%

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

迈向细粒度时间感知:通过音频侧时间提示进行后训练的大音频-语言模型

Yanfeng Shi, Pengfei Cai, Jun Liu, Qing Gu, Nan Jiang, Lirong Dai, Ian McLoughlin, Yan Song

机构 * National Engineering Research Center of Speech and Language Information Processing, University of Science and Technology of China, Hefei, China(语音与语言信息处理国家级工程研究中心,中国科学技术大学,合肥,中国) ICT Cluster, Singapore Institute of Technology, Singapore(新加坡理工学院ICT集群,新加坡)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出Audio-Side Time Prompt方法,结合强化学习改进大音频-语言模型的时间感知能力,在音频定位、事件检测等任务中取得显著提升。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13695 2026-04-16 cs.CV cs.AI 57%

Med-CAM: Minimal Evidence for Explaining Medical Decision Making

Med-CAM:为解释医学决策制定提供最小证据

Pirzada Suhail, Aditya Anand, Amit Sethi

机构 * IIT Bombay(印度理工学院班加罗尔)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出Med-CAM框架,通过分类器激活匹配生成最小且清晰的证据图,为医学决策提供解释性证据,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13203 2026-04-16 cs.HC cs.AI 57%

Inclusive Kitchen Design for Older Adults: Generative AI Visualizations to Support Mild Cognitive Impairment

包容性厨房设计用于老年人:生成式AI可视化以支持轻度认知障碍

Ibrahim Bilau, Nicole Li, Terrence Malayvong, Eunhwa Yang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本研究利用生成式AI创建MCI友好的厨房设计,通过训练Stable Diffusion模型提升可视化效果,帮助老年人更易独立生活。

Comments 19 pages, 7 figures, 5 tables, IAFOR Agen2026 Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13933 2026-04-16 eess.SP 50%

A Case Study on Energy-Efficient Edge AI Crack Segmentation

边缘AI裂缝分割的案例研究

Matthias Tschope, Mohamed Moursi, Vladimir Rybalkin, Bo Zhou, Norbert Wehn, Paul Lukowicz

专题命中 其他安全 :safety(abstract)

AI总结 本文研究边缘设备上高效裂缝分割方法,采用知识蒸馏和量化压缩提升性能,FPGA部署实现高能效与高精度分割。

Comments Submitted for IEEE Splitech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06885 2026-04-16 cs.CV 50%

OPTED: Open Preprocessed Trachoma Eye Dataset Using Zero-Shot SAM 3 Segmentation

OPTED:开放预处理的沙眼眼病数据集利用零样本SAM 3分割

Kibrom Gebremedhin, Hadush Hailu, Bruk Gebregziabher

机构 * Department of Computer Science(计算机科学系) Mekelle University(梅克雷大学) Maharishi International University(Maharishi国际大学) Signal Technologies(信号技术) Germany(德国)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出OPTED数据集,利用SAM 3模型实现沙眼眼病的自动化区域提取,通过四步流程预处理图像,提供两种输出格式以促进可重复的沙眼分类研究。

Comments 9 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13542 2026-04-16 cs.RO cs.DC cs.SE 50%

Self-adaptive Multi-Access Edge Architectures: A Robotics Case

自适应多接入边缘架构:机器人案例

Mahyar T Moghaddam, Joakim Leed, Anders Frandsen

机构 * University of Southern Denmark(丹麦南部大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种自适应计算系统,用于混合人类-机器人环境,通过神经网络预测人类移动行为,提升移动机器人路径规划并确保安全,采用边缘计算系统优化处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13403 2026-04-16 cs.CV 50%

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks

为何多模态上下文学习滞后?揭示内部机制和瓶颈

Yu Wang, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 其他安全 :alignment(abstract)

AI总结 本文分析了多模态上下文学习在零样本设置中表现与少样本演示下退化的原因,揭示了模型在视觉与文本表示对齐和任务映射转移方面的不足,并提出改进方法。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13321 2026-04-16 cs.CV 50%

Why MLLMs Struggle to Determine Object Orientations

为何大规模多模态语言模型难以确定物体方向

Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

机构 * Department of Computer Science(计算机科学系)

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究大规模多模态语言模型在处理图像中2D物体方向推理任务时的困难,通过实验发现方向信息可从编码器表示中恢复,挑战了视觉编码器限制的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15170 2026-04-16 cs.CV 50%

Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval

多维知识谱系:基于大规模文献数据库与分层检索

Zhucun Xue, Jiangning Zhang, Juntao Jiang, Jinzhuo Liu, Haoyang He, Teng Hu, Xiaobin Hu, Yong Liu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) APRIL Lab(APRIL实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 其他安全 :safety(abstract)

AI总结 本文通过整合22个顶级会议2020-2025年的10万+论文,构建多维知识谱系分析框架,结合主题聚类、LLM解析与结构检索,揭示研究主题生命周期、方法迁移、数据集与模型使用模式及机构研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16906 2026-04-16 physics.class-ph math.AP physics.comp-ph 50%

Transition Frequencies and Dynamic Amplification of Buried Lifelines: A Semi-Analytical Timoshenko Beam on Winkler Foundation Model

埋藏生命线的过渡频率和动态放大:基于Winkler基础的半解析Timoshenko梁模型

Gersena Banushi, Kenichi Soga

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种半解析模型,用于分析埋藏生命线的横向振动,通过Timoshenko梁理论和弹性基础模型,揭示振动频谱由三个过渡频率分隔的四个部分组成,并通过案例研究验证了模型的有效性。

Comments Presented at and accepted for publication in the official Proceedings of the 16th International Conference on Vibration Problems & 11th International Conference on Wave Mechanics and Vibrations (ICOVP & WMVC 2025), Lisbon, Portugal, September 2-5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏