arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-12 至 2026-03-12 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2603.08723 2026-03-12 cs.CY cs.AI 88%

Alignment as Iatrogenesis: Pastoral Power, Collective Pathology, and the Structural Limits of Monolingual Safety Evaluation

对齐作为医源性:牧师权力、集体病理学以及单语安全评估的结构性限制

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry(刑事精神病研究所以) Sex Offender Medical Center(性犯罪医疗中心) Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学系)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过多语言实验揭示,单语安全评估无法捕捉对齐设计导致的集体病理效应,指出语言切换影响病理模式的定性与幅度。

Comments 30 pages, 1 figure, 24-page supplementary. Preprint v3. Companion paper: arXiv:2603.04904. Previous versions: Zenodo DOI 10.5281/zenodo.18646998

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10891 2026-03-12 cs.AI cs.IR 83%

A Hybrid Knowledge-Grounded Framework for Safety and Traceability in Prescription Verification

一种混合知识引导的框架用于处方验证中的安全性和可追溯性

Yichi Zhu, Kan Ling, Xu Liu, Hengrun Zhang, Huiqun Yu, Guisheng Fan

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出PharmGraph-Auditor框架,通过混合制药知识库和知识引导的验证链,提升处方验证的安全性和可追溯性。

Comments 11 pages, 7 figures.Framework for safe prescription auditing and hybrid knowledge-grounded reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17862 2026-03-12 cs.AI cs.CL cs.CV 81%

Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities

Daily-Omni: 向音频-视觉推理迈进:跨模态时间对齐

Ziwei Zhou, Rui Wang, Zuxuan Wu, Yu-Gang Jiang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 Daily-Omni提出一个包含684个真实世界视频和1,197个问题的音频-视觉问答基准,评估24个模型在跨模态时间对齐任务上的性能,发现端到端模型在对齐关键问题上仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03666 2026-03-12 cs.CV cs.AI 79%

MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations

MonitorVLM:一种用于采矿作业中安全违规检测的视觉语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Guangyuan Yu, Haoyuan Xu, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 MonitorVLM通过视觉语言框架提升采矿作业中安全违规检测的精度和召回率,实现高效自动化监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20744 2026-03-12 cs.SE 78%

From Law to Gherkin: A Human-Centred Quasi-Experiment on the Quality of LLM-Generated Behavioural Specifications from Food-Safety Regulations

从法律到Gherkin:一项以人类为中心的准实验,探讨LLM生成的行为规范质量

Shabnam Hassani, Mehrdad Sabetzadeh, Daniel Amyot

专题命中 安全评测 :safety(title,abstract)

AI总结 本文通过准实验评估LLMs从法律文本生成Gherkin规范的能力,发现其在相关性和清晰性方面表现良好,但需人类监督以纠正遗漏和幻觉。

Comments This article has been accepted for publication in Information and Software Technology (IST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19218 2026-03-12 cs.HC cs.AI q-bio.NC 70%

Technological folie à deux: Feedback Loops Between AI Chatbots and Mental Illness

技术幻觉:人工智能聊天机器人与心理健康之间的反馈循环

Sebastian Dohnány, Zeb Kurth-Nelson, Eleanor Spens, Lennart Luettgau, Alastair Reid, Iason Gabriel, Christopher Summerfield, Murray Shanahan, Matthew M Nour

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究探讨了人工智能聊天机器人与心理健康问题之间的相互作用风险,指出其可能引发信念不稳定和依赖,并呼吁跨领域的协调行动以应对这一新兴公共卫生问题。

Journal ref Nature Mental Health (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09996 2026-03-12 cs.CL cs.AI cs.CR cs.LG 67%

There Are No Silly Questions: Evaluation of Offline LLM Capabilities from a Turkish Perspective

没有愚蠢的问题:从土耳其视角评估离线LLM能力

Edibe Yilmaz, Kahraman Kostas

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究从土耳其视角评估了离线LLM在遗产语言教育中的鲁棒性和教学安全性,发现参数范围在8B-14B的模型在成本与安全性之间达到最佳平衡。

Comments 5 pages, 6 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09394 2026-03-12 cs.HC 67%

EyeAgent: An Agentic AI System for Multimodal Clinical Decision Support in Ophthalmology

EyeAgent:一种用于眼科多模态临床决策支持的智能AI系统

Danli Shi, Xiaolan Chen, Bingjie Yan, Weiyi Zhang, Pusheng Xu, Jiancheng Yang, Ruoyu Chen, Siyu Huang, Bowen Liu, Xinyuan Wu, Meng Xie, Ziyu Gao, Yue Wu, Senlin Lin, Kai Jin, Xia Gong, Yih Chung Tham, Xiujuan Zhang, Li Dong, Yuzhou Zhang, Jason Yam, Guangming Jin, Xiaohu Ding, Haidong Zou, Yalin Zheng, Zongyuan Ge, Mingguang He

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 EyeAgent通过整合53种眼科工具提升诊断准确率,实现多模态临床决策支持,为眼科AI系统提供新范式。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10303 2026-03-12 cs.CL cs.AI 62%

Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas

这个想法是否新颖?一种自动化的判断研究想法新颖性的基准

Tim Schopf, Michael Färber

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RINoBench基准,用于评估研究想法新颖性判断,发现LLM生成的推理与人类相似但判断不准确。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05941 2026-03-12 cs.LG cs.AI 62%

Comparative Analysis of Modern Machine Learning Models for Retail Sales Forecasting

现代机器学习模型在零售销售预测中的比较分析

Luka Hobor, Mario Brcic, Lidija Polutnik, Ante Kapetanovic

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(Zagreb大学电气工程与计算学院) It From Bit d.o.o.(It From Bit公司) Babson College(巴布森学院) mStart Plus d.o.o.(mStart Plus公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了现代机器学习模型在零售销售预测中的表现,发现基于树的集成方法在特定条件下表现更优。

Comments 12 total pages, 12 pages article

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03281 2026-03-12 cs.CV cs.LG 57%

CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance

CFG-Ctrl: 基于控制的分类器自由扩散引导

Hanyang Wang, Yiyang Liu, Jiawei Chi, Fangfu Liu, Ran Xue, Yueqi Duan

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 CFG-Ctrl通过引入滑模控制方法改进分类器自由扩散引导,提升语义对齐和鲁棒性。

Comments Accepted by CVPR 2026; Project Page: https://hanyang-21.github.io/CFG-Ctrl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10764 2026-03-12 cs.CL 57%

HeartAgent: An Autonomous Agent System for Explainable Differential Diagnosis in Cardiology

HeartAgent:一种用于心血管疾病可解释性差分诊断的自主代理系统

Shuang Zhou, Kai Yu, Song Wang, Wenya Xie, Zaifu Zhan, Meng-Han Tsai, Yuen-Hei Chung, Shutong Hou, Huixue Zhou, Min Zeng, Bhavadharini Ramu, Lin Yee Chen, Feng Xie, Rui Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 HeartAgent通过整合定制工具和数据资源,提供可解释的差分诊断支持,显著提升心血管疾病诊断的准确性和解释质量。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10703 2026-03-12 cs.CV cs.CY 57%

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

WalkGPT: 基于深度感知的视觉语言对话用于行人导航

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 WalkGPT通过结合视觉语言模型与深度感知分割技术,实现无障碍导航指导,提供精准的可访问性评估和深度估计。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10294 2026-03-12 eess.SY cs.AI cs.SY 57%

Simulation-in-the-Reasoning (SiR): A Conceptual Framework for Empirically Grounded AI in Autonomous Transportation

推理中的模拟(SiR):面向自主交通系统经验导向AI的概念框架

Wuping Xin

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 SiR通过将领域模拟器嵌入LLM推理循环,为自主交通系统提供经验导向的AI框架,提升策略验证与优化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09689 2026-03-12 cs.CV cs.AI 57%

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03507 2026-03-12 cs.LG cond-mat.dis-nn q-bio.NC stat.ML 57%

Solving adversarial examples requires solving exponential misalignment

解决对抗样本需要解决指数级不一致

Alessandro Salvatore, Stanislav Fort, Surya Ganguli

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 研究通过分析神经网络的感知流形维度,揭示对抗样本的起源与机器与人类感知的指数级不一致,并提出维度一致是提升对抗鲁棒性的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00353 2026-03-12 cs.AI cs.HC 57%

MHDash: An Online Platform for Benchmarking Mental Health-Aware AI Assistants

MHDash:一个用于评估心理健康意识AI助手的在线平台

Yihe Zhang, Cheyenne N Mohawk, Kaiying Han, Vijay Srinivas Tida, Manyu Li, Xiali Hei

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 MHDash是一个开源平台,用于评估心理健康意识AI助手的安全性和性能,揭示传统基准在心理健康领域不足的问题。

Comments Accepted for presentation at IEEE SoutheastCon 2026. This is the author version of an accepted paper. The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05748 2026-03-12 cs.LG 57%

Communication Enables Cooperation in LLM Agents: A Comparison with Curriculum-Based Approaches

通信使LLM代理协作:与基于课程的方法的比较

Hachem Madmoun, Salem Lahlou

机构 * MBZUAI(穆扎布伊人工智能研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文通过比较直接通信与课程学习方法,发现通信在促进LLM代理合作中更有效,而课程学习可能因设计选择影响对齐目标。

Comments Published in EACL 2026 - Corrected cooperation rates for two-stage communication conditions (96.7% and 100.0%, previously reported as 48.3% and 50.0% due to a denominator bug in the evaluation code). All other results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10940 2026-03-12 cs.SE cs.RO 50%

STADA: Specification-based Testing for Autonomous Driving Agents

STADA:基于规范的自动驾驶代理测试

Joy Saha, Trey Woodlief, Sebastian Elbaum, Matthew B. Dwyer

专题命中 安全评测 :safety(abstract)

AI总结 STADA是一种基于规范的自动驾驶代理测试生成框架,通过形式规范生成多样化的测试场景,提高测试覆盖率并减少模拟次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11099 2026-03-12 cs.CV 50%

A Survey on Interpretability in Visual Recognition

视觉识别中可解释性的综述

Qiyang Wan, Chengzhi Gao, Ruiping Wang, Xilin Chen

专题命中 安全评测 :safety(abstract)

AI总结 本文综述了视觉识别中可解释性的发展,从意图、对象、呈现和方法学角度建立多维分类法,总结了关键评估指标,并探讨了多模态大语言模型的可解释性及实际应用。

Comments 20 pages, 8 figures, 7 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏