arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-01 至 2026-04-01 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2602.05157 2026-04-01 cs.SE cs.SY eess.SY 82%

The Necessity of a Holistic Safety Evaluation Framework for AI-Based Automation Features

人工智能驱动自动化功能的综合安全评估框架的必要性

Alireza Abbaspour, Shabin Mahadevan, Kilian Zwirglmaier, Jeff Stafford

专题命中 安全评测 :safety(title,abstract);AI safety(abstract)

AI总结 本文探讨了在人工智能整合下,需对AI组件进行综合安全分析和风险评估,以识别和缓解潜在风险,特别是在安全关键驾驶系统中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29467 2026-04-01 cs.CL cs.AI 81%

M-MiniGPT4: Multilingual VLLM Alignment via Translated Data

M-MiniGPT4:通过翻译数据实现多语言VLLM对齐

Seung Hun Han, Youssef Mohamed, Mohamed Elhoseiny

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) KAUST(阿卜杜拉国王科技大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出M-MiniGPT4多语言视觉大语言模型,通过混合原生多语言和翻译数据提升MiniGPT4的多语言视觉理解能力,并引入多语言对齐训练阶段,使模型在多语言MMMU基准测试中达到36%的准确率。

Comments 6 pages, ACL 2026, Proceedings of the 7th Workshop on African Natural Language Processing (AfricaNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29410 2026-04-01 cs.CV cs.AI cs.LG 81%

AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models

AGFT:基于对齐的微调以提升视觉-语言模型的零样本对抗鲁棒性

Yubo Cui, Xianchao Guan, Zijun Xiong, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, Shenzhen, China(深圳市环域研究所)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AGFT框架,通过概率预测进行文本引导对抗训练,提升视觉-语言模型的零样本对抗鲁棒性,同时保持跨模态语义结构。

Comments Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29893 2026-04-01 cs.HC cs.AI cs.CL cs.MA 62%

Perfecting Human-AI Interaction at Clinical Scale. Turning Production Signals into Safer, More Human Conversations

在临床规模上完善人机交互。将生产信号转化为更安全、更人性化的对话

Subhabrata Mukherjee, Markel Sanz Ausin, Kriti Aggarwal, Debajyoti Datta, Shanil Puri, Woojeong Jin, Tanmay Laud, Neha Manjunath, Jiayuan Ding, Bibek Paudel, Jan Schellenberger, Zepeng Frazier Huo, Walter Shen, Nima Shirazian, Nate Potter, Sathvik Perkari, Darya Filippova, Anton Morozov, Austin Mease, Vivek Muppalla, Ghada Shakir, Alex Miller, Juliana Ghukasyan, Mariska Raglow-Defranco, Maggie Taylor, Herprit Mahal, Jonathan Agnew

机构 * Hippocratic AI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于真实患者与AI交互数据的框架,通过分析实时信号提升医疗AI的安全性和可靠性,减少ASR错误,提高患者体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29500 2026-04-01 cs.AI cs.LG 62%

Learning to Generate Formally Verifiable Step-by-Step Logic Reasoning via Structured Formal Intermediaries

通过结构化形式中介学习生成可形式验证的逐步逻辑推理

Luoxin Chen, Yichi Zhou, Huishuai Zhang

机构 * Wangxuan Institue of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PRoSFI方法,通过形式验证提升推理可靠性,利用结构化中间步骤和形式证明验证生成可信的逐步推理过程。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29953 2026-04-01 cs.AI cs.HC 57%

Structured Intent as a Protocol-Like Communication Layer: Cross-Model Robustness, Framework Comparison, and the Weak-Model Compensation Effect

结构意图作为协议式通信层:跨模型鲁棒性、框架比较及弱模型补偿效应

Peng Gang

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉特尼人工智能科技有限公司) Huizhou University(惠州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文研究结构意图在不同AI模型、语言和提示框架下的鲁棒性,比较不同框架效果,并发现弱模型补偿效应,证明结构意图在人机交互中的实用价值。

Comments 25 pages, figures, tables, and appendix. Third paper in a cumulative research series on PPS and 5W3H structured intent representation, extending prior work to cross-model robustness, framework comparison, and user-study validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29755 2026-04-01 cs.AI 57%

CausalPulse: An Industrial-Grade Neurosymbolic Multi-Agent Copilot for Causal Diagnostics in Smart Manufacturing

CausalPulse:一种工业级神经符号多智能体协作者,用于智能制造中的因果诊断

Chathurangi Shyalika, Utkarshani Jaimini, Cory Henson, Amit Sheth

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 CausalPulse通过神经符号架构整合异常检测、因果发现和推理,实现智能制造中的因果诊断,展现高可靠性和可扩展性。

Comments 10 pages, 8 figures, 4 tables, Accepted at AAAI-MAKE 2026 (AAAI Spring Symposium on Machine Learning and Knowledge Engineering for Knowledge-Grounded Semantic Agents)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24246 2026-04-01 cs.HC cs.CY 57%

Locating Risk: Task Designers and the Challenge of Risk Disclosure in RAI Content Work

定位风险:任务设计者与RAI内容工作中的风险披露挑战

Alice Qian, Ryland Shaw, Laura Dabbish, Jina Suh, Hong Shen

专题命中 安全评测 :red teaming(abstract);分类 cs.CY

AI总结 研究探讨任务设计者在RAI内容工作中如何披露风险,通过23份访谈揭示风险识别与沟通的实践,强调支持任务设计者提升工人福祉与AI伦理的技术有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29517 2026-04-01 cs.CL 57%

LLM Probe: Evaluating LLMs for Low-Resource Languages

LLM Probe:评估低资源语言的大型语言模型

Hailay Kidu Teklehaymanot, Gebrearegawi Gebremariam, Wolfgang Nejdl

机构 * L3S Research Center, Leibniz University Hannover(莱布尼茨汉诺威大学L3S研究中心) Aksum University(阿克苏姆大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出LLM Probe框架,通过词典基础方法系统评估低资源语言中LLM的语言能力,揭示序列到序列模型在形态语法分析和翻译质量上的优势,以及因果模型在词汇对齐上的表现。

Comments 11 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29429 2026-04-01 cs.CL 57%

CounselReflect: A Toolkit for Auditing Mental-Health Dialogues

CounselReflect:用于审计心理健康对话的工具包

Yahan Li, Chaohao Du, Zeyang Li, Christopher Chun Kuizon, Shupeng Cheng, Angel Hsing-Chi Hwang, Adam C. Frank, Ruishan Liu

机构 * University of Southern California(南加州大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出CounselReflect工具包,通过多维报告和证据链接片段,提供透明的心理健康对话审计方法,结合模型评估指标和文献库指标,支持可理解、可操作和可信的审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29077 2026-04-01 cs.CL 57%

Dual Perspectives in Emotion Attribution: A Generator-Interpreter Framework for Cross-Cultural Analysis of Emotion in LLMs

情绪归因的双重视角:一种用于LLM中跨文化情绪分析的生成-解释框架

Aizirek Turdubaeva, Uichin Lee

机构 * KAIST(韩国科学技术院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出生成-解释框架,从表达与解读双重视角分析情绪归因,评估六种LLM在15国数据上的表现,揭示文化背景对情绪类型和模型性能的影响,呼吁在LLM中实现文化敏感的情绪建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10149 2026-04-01 cs.CR cs.AI 57%

Semantic Labeling for Third-Party Cybersecurity Risk Assessment: A Semi-Supervised Approach to Intent-Aware Question Retrieval

第三方网络安全风险评估的语义标注:一种半监督的意图感知问题检索方法

Ali Nour Eldin, Mohamed Sellami, Mehdi Acheli, Walid Gaaloul, Julien Steunou

机构 * SAMOVAR, Telecom SudParis, Institut Polytechnique de Paris(SAMOVAR, 南巴黎电信学院, 巴黎综合理工学院) Board of Cyber

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种半监督方法,通过语义标签空间提升第三方网络安全风险评估中意图感知的问题检索效率,减少标注成本并提高一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14292 2026-04-01 cs.CL 57%

Tokens with Meaning: A Hybrid Tokenization Approach for Turkish

具有意义的标记:一种针对土耳其语的混合标记方法

M. Ali Bayram, Ali Arda Fincan, Ahmet Semih Gümüş, Sercan Karakaş, Banu Diri, Savaş Yıldırım, Demircan Çelik

机构 * Yıldız Technical University(伊尔迪兹技术大学) Yeditepe University(耶迪特佩大学) University of Chicago(芝加哥大学) Istanbul Bilgi University(伊斯坦布尔比尔基大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种结合词典驱动形态分割、音学规范化和受控子词回退的土耳其语混合标记器,通过TR-MMLU数据集评估,其在形态和词汇单元匹配度上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30038 2026-04-01 cs.CV 50%

Benchmarking PhD-Level Coding in 3D Geometric Computer Vision

在3D几何计算机视觉中评估博士级别的编程能力

Wenyi Li, Renkai Luo, Yue Yu, Huan-ang Gao, Mingju Gao, Li Yuan, Chaoyou Fu, Hao Zhao

机构 * AIR, Tsinghua University(清华大学智能产业研究院) Qiuzhen College, Tsinghua University(清华大学求真书院) BAAI(北京智源人工智能研究院) Peking University(北京大学) Nanjing University(南京大学) University of Toronto(多伦多大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出GeoCodeBench基准,用于评估3D视觉编程能力。通过精选论文中的任务,生成多样化的测试用例,评估八种模型的性能,揭示当前模型在可靠3D科学编程方面的差距。

Comments Accepted by CVPR 2026; Project page: https://geocodebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21507 2026-04-01 cs.CV 50%

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28901 2026-04-01 cs.RO 50%

See Something, Say Something: Context-Criticality-Aware Mobile Robot Communication for Hazard Mitigations

看见即应言:面向灾害缓解的上下文感知移动机器人通信

Bhavya Oza, Devam Shah, Ghanashyama Prabhu, Devika Kodi, Aliasghar Arab

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) ASAS LABS, Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系ASAS实验室)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种上下文感知的移动机器人通信框架,通过感知驱动自适应消息生成,提升灾害响应速度和有效性,在60多次实验中验证了结构化关键性评估对响应速度和缓解效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28888 2026-04-01 cs.RO 50%

A Semantic Observer Layer for Autonomous Vehicles: Pre-Deployment Feasibility Study of VLMs for Low-Latency Anomaly Detection

面向自动驾驶的语义观察层:VLMs在低延迟异常检测中的预部署可行性研究

Kunal Runwal, Swaraj Gajare, Daniel Adejumo, Omkar Ankalkope, Siddhant Baroth, Aliasghar Arab

机构 * The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系) Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院电气与计算机工程系)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种语义观察层,通过量化视觉-语言模型实现低延迟异常检测,验证了其在自动驾驶平台上的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21482 2026-04-01 cs.CV 50%

ALADIN:Attribute-Language Distillation Network for Person Re-Identification

ALADIN:基于属性-语言的知识蒸馏网络用于人重识别

Wang Zhou, Boran Duan, Haojun Ai, Ruiqi Lan, Ziyue Zhou

机构 * Wuhan University(武汉大学)

专题命中 安全评测 :alignment(abstract)

AI总结 ALADIN通过属性-语言知识蒸馏网络,提升人重识别中细粒度属性特征的捕捉能力,增强鲁棒性与泛化性。

Comments 14pages, 3figures, 7charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19910 2026-04-01 cs.CV 50%

Multi-Modal Representation Learning via Semi-Supervised Rate Reduction for Generalized Category Discovery

通过半监督率减少实现多模态表示学习的通用类别发现

Wei He, Xianghan Meng, Zhiyuan Huang, Xianbiao Qi, Rong Xiao, Chun-Guang Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。

Comments 15 pages, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00702 2026-04-01 cs.CV 50%

JoyStreamer: Unlocking Highly Expressive Avatars via Harmonized Text-Audio Conditioning

JoyStreamer: 通过和谐的文本-音频条件化解锁高度表达性的化身

Ruikui Wang, Jinheng Feng, Lang Tian, Huaishao Luo, Chaochao Li, Liangbo Zhou, Huan Zhang, Youzheng Wu, Xiaodong He

机构 * JD Technology(京东科技)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出JoyAvatar框架,通过双教师增强训练算法和动态调节多模态条件,提升视频化身生成的自然性和时序一致性,优于现有模型并在多人群对话等复杂应用中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏