arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2506.18428 2025-06-24 cs.AI cs.LG 79%

How Robust is Model Editing after Fine-Tuning? An Empirical Study on Text-to-Image Diffusion Models

Feng He, Zhenyang Liu, Marco Valentino, Zhixue Zhao

机构 * University of Sheffield, UK(谢菲尔德大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10029 2025-06-13 cs.CR cs.AI cs.CL 79%

Evaluation empirique de la sécurisation et de l'alignement de ChatGPT et Gemini: analyse comparative des vulnérabilités par expérimentations de jailbreaks

Rafaël Nouailles

专题命中 安全评测 :alignment(abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01168 2025-06-11 econ.GN cs.AI cs.CY cs.ET cs.HC q-fin.EC 79%

AI as Decision-Maker: Ethics and Risk Preferences of LLMs

Shumiao Ouyang, Hayong Yun, Xingjian Zheng

专题命中 安全评测 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16238 2025-03-13 cs.AI cs.LG 79%

Algebraic Evaluation Theorems

Andrés Corrada-Emmanuel

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14870 2025-02-24 cs.CY cs.AI cs.HC 79%

Why do Experts Disagree on Existential Risk and P(doom)? A Survey of AI Experts

Severin Field

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

Comments In submission to AI and Ethics Journal. 24 pages total, 15 pages of writing with 9 pages of appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01247 2024-12-02 cs.AI cs.CL cs.IT math.IT 79%

Conversational Complexity for Assessing Risk in Large Language Models

John Burden, Manuel Cebrian, Jose Hernandez-Orallo

专题命中 安全评测 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17386 2026-08-19 cs.RO 新提交 78%

MANIGUARD: A Benchmark and Data Suite for Specification-Grounded Safety Evaluation and Improvement of Robotic Manipulation

MANIGUARD:用于基于规范的机器人操作安全评估与改进的基准及数据集套件

Yiyan Peng, Philip Wang, Simon Sinong Zhan, Yiqi Lyu, Zhenyang Ni, Jixin Yan, Fiorelli Wong, Ruochen Jiao, Hang Yin, Xinyu Cao, Huajie Shao, Manling Li, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) William & Mary(威廉玛丽学院)

专题命中 安全评测 :safety(title,abstract)

AI总结 本研究提出ManiGuard基准与数据集套件,针对机器人操作基础模型策略,通过含23000余次滚动的实验证实安全需独立于任务成功评估,微调可提升安全表现但仍存差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17175 2026-08-19 cs.HC 新提交 78%

Balancing Safety and Autonomy: Accessibility-Oriented Interventions in Generative AI for Cognitive Impairment

平衡安全与自主性:面向认知障碍群体的生成式AI可及性导向干预

Yibo Meng, Jingruo Chen, Lyumanshan Ye, Bingyi Liu, Zhicong Lu

专题命中 安全评测 :safety(title,abstract)

AI总结 本研究针对认知障碍老年群体使用生成式AI的安全与自主冲突问题,通过对45名患者及照护者的质性研究,提出五种可及性导向机制,发现机制效果随障碍程度变化,强调需设计平衡安全与自主的动态AI方案。

Comments Accepted to ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00513 2026-08-19 cs.GT cs.MA 78%

Truthful and Trustworthy IoT AI Agents via Immediate-Penalty Enforcement under Approximate VCG Mechanisms

通过近似VCG机制下的即时惩罚实现可信的物联网AI代理

Xun Shao, Ryuuto Shimizu, Zhi Liu, Kaoru Ota, Mianxiong Dong

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出了一种结合近似Vickrey-Clarke-Groves双拍卖和即时单次惩罚的物联网能源交易信任保障框架,旨在通过单轮过程恢复 truthful 报告,即使在分配精度近似和监控噪声的情况下,同时通过理论分析和实验验证了轻量级惩罚设计在对齐战略物联网代理与社会最优能源交易结果中的有效性。

Journal ref IEEE Internet of Things Journal, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 78%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 安全评测 :alignment(title,abstract)

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18245 2026-08-18 cs.SE cs.CR 版本更新 78%

Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety

谁测试测试者?LLM代理工具调用安全的系统枚举与覆盖审计

Xuan Chen, Lu Yan, Ruqi Zhang, Xiangyu Zhang

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出SafeAudit框架,通过系统生成测试用例和规则阻力指标,发现现有测试未覆盖的20%不安全行为,揭示当前安全评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09001 2026-08-14 cs.SD eess.AS 版本更新 78%

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

基于最优传输的基于大语言模型的视听语音识别语义对齐

Xugang Lu, Peng Shen, Yu Tsao, Hisashi Kawai

专题命中 安全评测 :alignment(title,abstract)

AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30777 2026-08-14 cs.SE 版本更新 78%

What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants

当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障

Alif Al Hasan, Sumon Biswas

专题命中 安全评测 :safety(title,abstract)

AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。

Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09772 2026-08-07 cs.CV 版本更新 78%

SemDINO: Foundation Prior-Guided Cross-Temporal Semantic Alignment Network for Remote Sensing Change Detection

SemDINO: 一种基于DINOv3的跨时间语义对齐变化检测网络

Xinyu Tong, Meihua Zhou, Jinxiao Sun, Zaiyan Zhang, Hongruixuan Chen, Lei Wang

机构 * Xinjiang Institute of Ecology and Geography, Chinese Academy of Sciences(中国科学院新疆生态与地理研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) College of Information and Communication Engineering, Harbin Engineering University(哈尔滨工程大学信息与通信工程学院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 提出SemDINO网络,通过双分支编码器、多尺度时序交互、语义净化与变化增强模块,解决语义变化检测中跨时间对齐不足、多尺度表示弱及伪变化鲁棒性差的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04768 2026-08-06 cs.CV 新提交 78%

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04464 2026-08-06 cs.CE 新提交 78%

Trie-Constrained Token Prediction with Hierarchy-Aware Semantic Alignment for HS Code Prediction

结合前缀树约束的令牌预测与层级感知语义对齐的HS编码预测

Minseop Kim, Taekhyun Park, Kikun Park, Hyerim Bae

专题命中 安全评测 :alignment(title,abstract)

AI总结 本研究提出TRIE-HSA方法,结合前缀树约束的令牌预测与层级感知语义对齐,在集装箱码头数据实验中,其HS6准确率较零样本推理提升49.96个百分点,为受限环境下的HS编码预测提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24093 2026-08-06 q-bio.QM cs.DB 版本更新 78%

TCellAlign: Cross-study T-cell Populations Alignment with Nomenclature-Guided Multi-Agent Workflow

TCellAlign:使用命名法引导的多智能体工作流程进行跨研究 T 细胞群体对齐

Pengyu Xie, Rongjia Zhou, Zhilin Ou, Junyuan Zhang, Xiang Zhou, Xiaobo Sun, Jiaying Lu, Wenjing Ma

专题命中 安全评测 :alignment(title,abstract)

AI总结 该研究针对跨研究 T 细胞群体对齐难题,提出 TCellAlign 多智能体框架,含文献检索等模块,能保留原始术语与证据并生成标准化标签。构建基准数据集,实验表明其在语义一致性等方面表现出色,助力 T 细胞相关知识整合与模型发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08256 2026-08-06 cs.CL cs.AI cs.LG cs.SD 版本更新 78%

Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment

N选最佳语音合成评估受自动语音识别家族对齐的影响

Taehyung Yu, Seongjae Kang

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现最佳N选语音合成评估受ASR家族对齐影响,同家族验证器-评估器对效果更好。提出两种跨家族排名集成方法,能降低平均词错误率,建议交叉评估器三角测量作为默认报告实践。

Comments Accepted at ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21216 2026-08-06 cs.SI 版本更新 78%

ECHO-PPI: Evidence-Bundled Overlapping Protein Module Detection with Hierarchical Assignment Confidence for Network Biology

ECHO-PPI:用于蛋白质-蛋白质相互作用网络中重叠蛋白质模块检测的可信人工智能

Sima Soltani, Mehrdad Jalali, Yahya Forghani, Reza Sheibani

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 提出ECHO-PPI框架,通过整合加权网络拓扑、语义蛋白特征和基因本体证据,实现可解释的重叠蛋白质模块检测,并为每个分配提供证据分数和置信度标签。

Comments 39 pages, 15 figures, 12 tables, and 8 algorithm descriptions. The manuscript presents ECHO-PPI, an original computational biology framework evaluated on the Gavin and Krogan yeast PPI benchmarks and compared with MCL, MCL+overlap, ClusterONE, and SLPA. Reproducibility scripts, code, machine-readable outputs, and appendices are included in the submission package

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21343 2026-08-06 cs.CV 版本更新 78%

Latent Denoising Improves Visual Alignment in Large Multimodal Models

潜在去噪提升大多模态模型的视觉对齐

Dhruv Parikh, Jacob Fein-Ashley, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM ARL Army Research Office(DEVCOM ARL陆军研究办公室)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出通过潜在去噪框架改进大多模态模型的内部视觉特征对齐和多模态理解,采用掩码和高斯噪声混合腐蚀视觉token,并利用解码器恢复教师特征,提升模型在分布偏移下的鲁棒性。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00783 2026-08-04 cs.CR 新提交 78%

Safety Invariants for Agents Orchestrating Irreversible State Transitions: A Four-Dimensional Formalism Evaluated on Public Ledgers

编排不可逆状态转换的智能体的安全不变量:在公共账本上评估的四维形式主义

Zhaoming Yin

专题命中 安全评测 :safety(title,abstract)

AI总结 该研究针对编排不可逆状态转换的智能体,提出四维形式主义与七个安全不变量,在公共账本场景下验证其可提升智能体安全栈通过率,且可推广至其他不可逆状态交互场景。

Comments 29 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00068 2026-08-04 cs.CV 新提交 78%

SafeBuild-Bench: A Temporal-Robust Construction Safety Benchmark with Graph-Enhanced Data Mining

SafeBuild-Bench:一种具有图增强数据挖掘能力的时序鲁棒建筑安全基准

Yi Cui, Zilin Wang, Yijie Xu, Qianyi Cai, Huizai Yao, Shuai Jiang, Bingzhuo Zhong, Hui Xiong

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 研究人员构建了图增强数据挖掘的时序鲁棒建筑安全基准SafeBuild-Bench,开发可扩展验证的GEMS流水线,发现现有多模态大语言模型对建筑安全理解仍不足。

Comments Accepted by KDD 2026. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00107 2026-08-04 cs.SE 版本更新 78%

The Illusion of Safety: Multi-Tier Verification of AI vs. Human C++ Code

安全的假象:AI与人类C++代码的多层验证

Saif Mahmud, Fadul Sikder, Yuede Ji, Haotian Zhang, Yu Lei

专题命中 安全评测 :safety(title,abstract)

AI总结 提出VULBENCH-CPP基准,通过四层验证发现AI生成C++代码的运行时违规率约为人类代码的两倍,静态分析会因代码长度产生安全假象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25806 2026-08-04 cs.CV 版本更新 78%

An Analysis Focused on Womens Safety: Can VAD Models Be Enhanced by a Multi-modal Dataset?

聚焦女性安全分析:多模态数据集能否增强VAD模型?

Sangeeta ., Maddikuntla Sai Prajwal, Debi Prosad Dogra, Kamalakar Vijay Thakare, Hyungjoo Jung, Ig-Jae Kim, Heeseung Choi

机构 * Indian Institute of Technology Bhubaneswar(印度理工学院巴特那分校) Artificial Intelligence and Robotics Institute, Korea Institute of Science and Technology(人工智能与机器人研究所,韩国科学技术院) Yonsei-KIST Convergence Research Institute, Yonsei University(延世大学KIST融合研究中心)

专题命中 安全评测 :safety(title,abstract)

AI总结 针对现有视频异常检测数据集缺乏女性中心异常样本的问题,提出包含1001个视频及文本描述的多模态基准ExtrAnom,覆盖5种犯罪类型,并验证了多模态方法在检测女性中心异常上的有效性。

Comments 15 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25431 2026-08-03 cs.NI cs.MA eess.SP 版本更新 78%

Mode 0: Architecture, Risk Taxonomy, and Standardization Pathway for RCU-Assisted V2X Safety Communication

模式0:面向路侧计算单元辅助安全通信的新型3GPP V2X资源分配类别

Dewei Jiang, Xiang Gu

专题命中 安全评测 :safety(title,abstract)

AI总结 针对现有3GPP V2X资源分配框架中基站与车辆UE二元分类的结构性缺陷,提出以路侧计算单元(RCU)为核心实体的新模式0,通过集成感知、通信与计算能力,实现高密度交通场景下的低延迟安全通信,并利用MAPPO仿真验证了其性能优势。

Comments v4: substantial restructure; new sections on institutional authority, escalation security, and pool sizing; title revised; references expanded to 34. 44 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27923 2026-07-31 cs.SE 新提交 78%

The Case for Vibe Modeling: A Missing Step in AI-Based Trustworthy Software Development

氛围建模的必要性:基于AI的可信软件开发中缺失的一环

Shalini Chakraborty, Michael Mittermaier, Judith Michael

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文提出在AI辅助软件开发中引入氛围建模作为轻量中间抽象,通过学生调查验证其在提升LLM输出理解、降低验证工作量及增强信任方面的潜力,为可信AI软件工程研究提供方向。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27310 2026-07-31 cs.SE 新提交 78%

TrustChain-Review: A Risk-Adaptive Blockchain and Game-Theoretic Framework for Trustworthy AI-Assisted Code Review

TrustChain-Review:一种用于可信AI辅助代码审查的风险自适应区块链与博弈论框架

Mohammad Naserameri

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 该研究提出TrustChain-Review框架,结合区块链、博弈论与风险自适应治理,通过模拟验证其在AI辅助代码审查中平衡可信性与成本的效果,为不同风险场景提供治理方案。

Comments 24 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26409 2026-07-30 cs.NI 新提交 78%

Can We Trust AI in 6G? Verifiable and Auditable AI-Driven Trustworthy Wireless Networks

我们能信任6G中的AI吗?可验证且可审计的AI驱动可信无线网络

Genze Jiang, Yizhou Huang, Kezhi Wang

专题命中 安全评测 :trustworthy(title);safety(abstract)

AI总结 针对6G中AI在无线网络应用的信任问题,提出基于3GPP规范的机械审计方法与原生审计网络架构,支持AI功能的部署前认证和运行时审计,为AI驱动的可信无线网络提供解决方案。

Comments Submitted for possible journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25700 2026-07-29 cs.HC 新提交 78%

BioDisclose: An Actionability-Aware Benchmark for Biomedical Safety under Adversarial Elicitation

BioDisclose:对抗性诱导下生物医学安全的可操作性感知基准

Yinuo Zhu, He Liu, Boyuan Gu

专题命中 安全评测 :safety(title,abstract)

AI总结 研究针对大语言模型在对抗性诱导下生物医学知识披露行为不足问题,引入BioDisclose基准,含多领域多类别提示,对模型响应四级评分,通过实验揭示不同模型、策略及风险类别差异,为评估生物医学安全提供新测试平台。

Comments 27 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23297 2026-07-29 cs.CV 版本更新 78%

PRIMA: Pre-Training with Risk-Integrated Image--Metadata Alignment for Medical Diagnosis with LLM-Based Feature Aggregation

PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练

Yiqing Wang, Chunming He, Ziyun Yang, Maria Woodward, Ming-Chen Lu, Mercy Pawar, Leslie Niziol, Sina Farsiu

机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)

专题命中 安全评测 :alignment(title,abstract)

AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏