arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-31 至 2026-03-31 共收录 38 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 38 篇

2603.26676 2026-03-31 cs.CY cs.AI cs.HC 88%

Evaluating Human-AI Safety: A Framework for Measuring Harmful Capability Uplift

评估人机安全:衡量有害能力提升的框架

Michelle Vaccaro, Jaeyoon Song, Abdullah Almaatouq, Michiel A. Bakker

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文提出通过测量前沿模型带来的有害能力提升,推动人中心的AI安全评估,提供系统性测量方法和行动步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27240 2026-03-31 cs.CV cs.AI 83%

Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection

通过因果发现和双模态安全子空间投影诊断和修复视觉-语言模型中的不安全通道

Jinhu Fu, Yihang Lou, Qingyi Si, Shudong Zhang, Yan Bai, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huawei Technologies Ltd.(华为技术有限公司) Peking University(北京大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出CARE框架,通过因果分析和双模态安全子空间投影修复视觉-语言模型中的不安全通道,提升安全性而不影响多模态能力。

Comments Accepted by CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02711 2026-03-31 cs.CL cs.LG 81%

CREST: Universal Safety Guardrails Through Cluster-Guided Cross-Lingual Transfer

CREST:通过聚类引导的跨语言迁移实现通用安全性防护

Lavish Bansal, Naman Mishra

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CREST模型,通过跨语言迁移有效提升低资源语言的安全性防护,展示其在六个安全基准上的优越表现。

Comments 9 Pages, 5 Figures, Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26829 2026-03-31 cs.LG cs.AI 81%

Squish and Release: Exposing Hidden Hallucinations by Making Them Surface as Safety Signals

挤压与释放:通过使其显现为安全信号来暴露隐藏的幻觉

Nathaniel Oh, Paul Attie

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Squish and Release框架,通过激活空间修补技术揭示模型在对话压力下隐藏的幻觉问题,通过实验验证了检测模块和核心架构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08847 2026-03-31 cs.AI cs.MA 79%

What Is Your Agent's GPA? A Framework for Evaluating Agent Goal-Plan-Action Alignment

你的代理的GPA是多少?一个评估代理目标-计划-行动对齐的框架

Allison Sihan Jia, Daniel Huang, Nikhil Vytla, Seung Won Wilson Yoo, Nirvika Choudhury, Shayak Sen, John C. Mitchell, Anupam Datta

机构 * BASIS Independent Silicon Valley Upper School(BASIS独立硅谷高中) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Agent GPA框架,通过评估代理目标、计划和行动的对齐性,验证其在多代理、单代理和企业数据代理中的有效性,展示了高误差覆盖和调试定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26922 2026-03-31 cs.HC cs.AI 79%

Mimetic Alignment with ASPECT: Evaluation of AI-inferred Personal Profiles

模仿对齐与ASPECT:AI推断个人资料的评估

Ruoxi Shang, Dan Marshall, Edward Cutrell, Denae Ford

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出ASPECT方法,通过验证的沟通量表和职场数据评估LLM沟通特征,生成的个人资料在自评上表现良好,并在多个场景中优于通用和自述基线。

Comments 20 pages (including appendix), 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28063 2026-03-31 cs.AI cs.GT 77%

Reward Hacking as Equilibrium under Finite Evaluation

奖励黑客行为作为有限评估下的均衡

Jiacheng Wang, Jinbin Huang

专题命中 安全评测 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.AI

AI总结 本文基于五个公理证明优化AI代理在未被评估系统覆盖的质量维度上会系统性地减少努力,揭示奖励黑客行为为结构性均衡而非可修复错误,并提出可计算的扭曲指数预测黑客行为。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26683 2026-03-31 cs.IR cs.AI cs.CL cs.CV 76%

LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval

LITTA:晚期交互与测试时对齐用于视觉接地多模态检索

Seonok Kim

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

AI总结 LITTA通过查询扩展提升多模态文档检索,利用晚期交互评分和反向排名融合提高检索鲁棒性,适用于计算机科学、制药和工业手册等多领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03121 2026-03-31 cs.CL cs.AI cs.SY eess.SY 73%

Control Barrier Function for Aligning Large Language Models

用于对齐大语言模型的控制屏障函数

Yuya Miyaoka, Masaki Inoue

机构 * Keio University(庆应义塾大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于控制的框架,利用控制屏障函数确保用户期望的文本生成,通过安全过滤器干预生成文本,无需微调基模型。

Comments This work is an extenede version of arXiv:2408.15625 and has been submitted to the IEEE for possible publication

Journal ref IEEE Transactions on Control Systems Technology 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01187 2026-03-31 cs.CL cs.CY 73%

Surfacing Subtle Stereotypes: A Multilingual, Debate-Oriented Evaluation of Modern LLMs

揭示微妙的刻板印象:一种多语言、辩论导向的现代大语言模型评估

Muhammed Saeed, Muhammad Abdul-mageed, Shady Shehata

机构 * The University of British Columbia(不列颠哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出多语言辩论基准测试,揭示生成模型中叙事偏见。通过8400个跨语言辩论提示,评估模型对敏感领域刻板印象的再现,发现所有模型均存在偏见,且低资源语言中偏见更严重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26730 2026-03-31 cs.RO 71%

Why Cognitive Robotics Matters: Lessons from OntoAgent and LLM Deployment in HARMONIC for Safety-Critical Robot Teaming

为何认知机器人很重要:来自OntoAgent和HARMONIC中LLM部署的启示

Sanjay Oruganti, Sergei Nirenburg, Marjorie McShane, Jesse English, Michael Roberts, Christian Arndt, Ramviyas Parasuraman, Luis Sentis

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) University of Georgia(佐治亚大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :safety(title)

AI总结 研究探讨了在物理世界部署具身体AI代理所需的认知能力,通过HARMONIC架构评估LLM是否能复制OntoAgent的认知能力,发现LLM在知识状态评估上存在缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09938 2026-03-31 cs.CL 70%

Model Merging in the Era of Large Language Models: Methods, Applications, and Future Directions

大语言模型时代下的模型合并:方法、应用与未来方向

Mingyang Song, Mao Zheng

机构 * Tencent, China(腾讯(中国))

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型时代模型合并的方法、应用及未来方向,通过FUSE分类体系系统回顾了算法空间、下游应用及支持生态系统,识别了关键挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00839 2026-03-31 cs.LG q-fin.RM stat.ML 70%

Algorithmic Insurance

算法保险

Dimitris Bertsimas, Agni Orfanoudaki

机构 * Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院斯隆管理学院) Saïd Business School, Oxford University(牛津大学赛德商学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 研究算法保险在AI致损中的风险定价与责任框架,提出基于CVaR的分类阈值优化方法,通过乳腺癌案例验证降低尾部风险并提升保险收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27335 2026-03-31 cs.CL 70%

PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering

PubMed Reasoner: 基于动态推理的证据导向生物医学问答检索

Yiqing Zhang, Xiaozhong Liu, Fabricio Murai

机构 * PayPal Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 PubMed Reasoner通过动态推理机制提升生物医学问答的准确性与证据可靠性,采用三阶段框架优化检索过程并生成有据可查的回答。

Comments 20 pages; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28211 2026-03-31 cs.CV 67%

Explaining CLIP Zero-shot Predictions Through Concepts

通过概念解释CLIP零样本预测

Onat Ozdemir, Anders Christensen, Stephan Alaniz, Zeynep Akata, Emre Akbas

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) Orbital DTU Compute, Technical University of Denmark(丹麦技术大学DTU计算学院) Dept. of Biology, University of Copenhagen(哥本哈根大学生物系) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工学院巴黎电信学院LTCI实验室) Technical University of Munich (TUM)(慕尼黑工业大学) Helmholtz Munich(亥姆霍兹慕尼黑中心) MCML MDSI Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文提出EZPC方法,通过人类可理解的概念解释CLIP的零样本预测,保持分类精度并提供概念层面的解释。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19582 2026-03-31 cs.CV 67%

ScenePilot-4K: A Large-Scale First-Person Dataset and Benchmark for Vision-Language Models in Autonomous Driving

ScenePilot-4K:一个大规模第一视角数据集和基准,用于自动驾驶中视觉-语言模型的安全感知学习与评估

Yujin Wang, Yutong Zheng, Wenxian Fan, Tianyi Wang, Hongqing Chu, Li Zhang, Bingzhao Gao, Daxin Tian, Jianqiang Wang, Hong Chen

机构 * Tongji University(同济大学) UT Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出ScenePilot-4K数据集,包含3847小时视频和27.7亿帧图像,用于评估视觉-语言模型在自动驾驶中的场景理解、空间感知、运动规划和语义对齐能力,揭示模型在几何感知和规划推理方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27011 2026-03-31 cs.SI 67%

ParsCN: A Persian Dataset for Counter-Narrative Generation to Combat Online Hate Speech

ParsCN:一种针对网络仇恨言论的Persian数据集用于生成反叙事以对抗在线仇恨言论

Zahra Safdari Fesaghandis, Suman Kalyan Maity

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出ParsCN数据集,用于生成对抗网络仇恨言论的反叙事,通过结合文化导向的人工标注与少样本LLM增强生成,提升低资源语言的反叙事质量。

Comments Accepted at the International AAAI Conference on Web and Social Media (ICWSM 2026); Paper Information: 16 pages, 3 Figures, 10 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26776 2026-03-31 cs.CV 67%

From Prediction to Diagnosis: Reasoning-Aware AI for Photovoltaic Defect Inspection

从预测到诊断:面向光伏缺陷检测的推理感知AI

Dev Mistry, Feng Qiu, Bo Chen, Feng Liu, Can Chen, Mohammad Shahidehpour, Ren Wang

机构 * Illinois Institute of Technology(伊利诺伊理工学院) Argonne National Laboratory(阿贡国家实验室) Commonwealth Edison(联邦爱迪生公司) Drexel University(德雷塞尔大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本文提出REVL-PV框架,通过融合电致发光、热成像和可见光图像,实现光伏缺陷的结构化诊断报告,提升检测准确性和可解释性。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26760 2026-03-31 cs.CV 67%

An Intelligent Framework for Real-Time Yoga Pose Detection and Posture Correction

实时瑜伽体态检测与纠正的智能框架

Chandramouli Haldar

机构 * Independent Researcher(独立研究员) NovaTech Innovative Solutions(NovaTech创新解决方案)

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出一种混合边缘AI框架,用于实时瑜伽姿势检测与体态纠正,结合轻量级人体姿态估计模型与生物力学特征提取,通过CNN-LSTM时序学习架构分析运动动态,并利用量化和剪枝技术提升边缘设备性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28295 2026-03-31 cs.AI 57%

Evaluating LLMs for Answering Student Questions in Introductory Programming Courses

评估LLMs在初级编程课程中回答学生问题的能力

Thomas Van Mullem, Bart Mesuere, Peter Dawyndt

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文研究了LLMs在初级编程课程中协助教师回答学生问题的能力,通过构建基准数据集和定制评估指标,证明了LLMs能超越传统教师回答质量,并提出'教师在环'策略以降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28057 2026-03-31 cs.LG eess.IV 57%

Physics-Embedded Feature Learning for AI in Medical Imaging

嵌入物理的特征学习用于医学影像中的AI

Pulock Das, Al Amin, Kamrul Hasan, Rohan Thompson, Azubike D. Okpalaeze, Liang Hong

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出PhysNet,通过将肿瘤生长动力学嵌入卷积神经网络的特征学习过程,提升医学影像AI的可解释性和鲁棒性,实验表明其在脑部MRI数据集上优于多种现有模型。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04241 2026-03-31 cs.CL 57%

Tokenization and Morphological Fidelity in Uralic NLP: A Cross-Lingual Evaluation

词化与乌拉尔语NLP中的形态保真度:跨语言评估

Nuo Xu, Ahrii Kim

机构 * University of Eastern Finland(东芬兰大学) AI-Bio Convergence Research Institute(人工智能-生物融合研究所) Soongsil University(崇实大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文通过比较三种子词方法在六个乌拉尔语中的表现,发现OBPE在形态对齐和标注准确性上优于传统方法,尤其在拉丁字母语中表现突出。

Journal ref Proceedings of the Second Workshop on Language Models for Low-Resource Languages (LoResLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26351 2026-03-31 cs.LG 57%

LLM-Assisted Emergency Triage Benchmark: Bridging Hospital-Rich and MCI-Like Field Simulation

基于大语言模型的急救分级基准:连接医院丰富与MCI类现场模拟

Joshua Sebastian, Karma Tobden, KMA Solaiman

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出一个开放的急救分级基准,通过大语言模型辅助构建,解决现有基准不可用的问题,涵盖医院环境和MCI模拟两种场景,提升临床AI数据集的可重复性和可访问性。

Comments Submitted to GenAI4Health@NeurIPS 2025. This was the first version of the LLM-assisted emergency triage benchmark dataset and baseline models. A related but separate benchmark-focused study on emergency triage under constrained sensing has been accepted at the IEEE International Conference on Healthcare Informatics (ICHI) 2026 (see arXiv:2602.20168)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01448 2026-03-31 cs.LG cs.MM 57%

OpenAVS: Training-Free Open-Vocabulary Audio Visual Segmentation with Foundational Models

OpenAVS: 基于基础模型的无训练开放词汇音频视觉分割

Shengkai Chen, Yifang Yin, Jinming Cao, Shili Xiang, Zhenguang Liu, Roger Zimmermann

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 OpenAVS通过文本作为代理,首次实现音频与视觉模态对齐,利用基础模型直接推断掩码,提升开放词汇音频视觉分割的泛化能力。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27694 2026-03-31 cs.CL 57%

Can Large Language Models Simulate Human Cognition Beyond Behavioral Imitation?

大语言模型能否超越行为模仿模拟人类认知?

Yuxuan Gu, Lunjun Liu, Xiaocheng Feng, Kun Zhu, Weihong Zhong, Lei Huang, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文通过217位AI研究者纵向研究轨迹构建基准,评估LLM是否能模拟人类认知,提出多维认知对齐指标,系统评估最新LLM及增强技术,探讨其模拟人类认知的能力及提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27664 2026-03-31 cs.CL 57%

Investigating the Influence of Language on Sycophantic Behavior of Multilingual LLMs

探究语言对多语言大语言模型趋炎附势行为的影响

Bayan Abdullah Aldahlawi, A. B. M. Ashikur Rahman, Irfan Ahmad

机构 * King Fahd University of Petroleum and Minerals(法赫德国王石油矿产大学) SDAIA-KFUPM Joint Research Center for AI (JRCAI)(SDAIA-KFUPM人工智能联合研究中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究通过评估三种先进模型在五种语言下的回应,发现尽管新模型趋炎附势倾向降低,但语言仍显著影响其行为,揭示了文化与语言模式。

Comments 15 Pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27536 2026-03-31 cs.AI 57%

Dual-Stage LLM Framework for Scenario-Centric Semantic Interpretation in Driving Assistance

双阶段LLM框架用于驾驶辅助中的场景中心语义解释

Jean Douglas Carvalho, Hugo Taciro Kenji, Ahmad Mohammad Saber, Glaucia Melo, Max Mauro Dias Santos, Deepa Kundur

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出双阶段LLM框架,用于评估城市驾驶场景中基于LLM的风险推理可复现性。通过多模态驾驶数据构建确定性场景窗口,并在固定提示约束和闭合数字风险方案下评估,揭示模型间在风险等级分配、高风险升级、证据使用和因果归因上的系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27065 2026-03-31 cs.CL 57%

Story2Proposal: A Scaffold for Structured Scientific Paper Writing

Story2Proposal:一种结构化科学论文写作的支架

Zhuoyang Qian, Wei Shi, Xu Lin, Li Ling, Meng Luo, Ziming Wang, Zhiwei Zhang, Tengyue Xu, Gaoge Liu, Zhentao Zhang, Shuo Zhang, Ziqi Wang, Zheng Feng, Yan Luo, Shu Xu, Yongjin Chen, Zhibo Feng, Zhuo Chen, Bruce Yuan, Biao Wu, Harry Wang, Kris Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出Story2Proposal,一种基于合同约束的多智能体框架,通过协调运作的智能体将研究故事转化为结构化论文,提升了论文结构一致性与视觉对齐性。

Comments 10 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26769 2026-03-31 cs.CV cs.AI 57%

Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption

视觉-语言模型边缘可靠性差距:压缩VLM在视觉损坏下的失败模式量化

Mehmet Kaan Erol

机构 * Marmara University, Institute of Pure and Applied Sciences(马尔马拉大学纯科学与应用科学研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文比较了压缩的视觉-语言模型在视觉损坏下的失败模式,发现紧凑模型在COCO上表现出更高的语义漂移和对象盲区,且置信度校准存在显著差异。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28547 2026-03-31 cs.CV 50%

GEditBench v2: A Human-Aligned Benchmark for General Image Editing

GEditBench v2:一个对齐人类的通用图像编辑基准

Zhangqi Jiang, Zheng Sun, Xianfang Zeng, Yufeng Yang, Xuanyang Zhang, Yongliang Wu, Wei Cheng, Gang Yu, Xu Yang, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) StepFun Southeast University(东南大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出GEditBench v2,包含1200个真实用户查询,涵盖23项任务,引入PVC-Judge模型评估视觉一致性,实验表明其在开放源模型中表现优异,揭示当前模型局限性。

Comments 30 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏