arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-07 至 2026-04-07 共收录 42 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 42 篇

2505.21605 2026-04-07 cs.LG cs.AI cs.CR 88%

SoSBench: Benchmarking Safety Alignment on Six Scientific Domains

SoSBench:在六个科学领域中对安全对齐进行基准测试

Fengqing Jiang, Fengbo Ma, Zhangchen Xu, Yuetai Li, Zixin Rao, Bhaskar Ramasubramanian, Luyao Niu, Bo Li, Xianyan Chen, Zhen Xiang, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of Georgia(佐治亚大学) WWU(西华盛顿大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 SoSBench针对高风险科学领域设计,通过3000个基于真实法规的提示评估大模型的安全性,揭示了先进模型在处理危险场景时存在严重的安全对齐缺陷。

Comments Project Page: https://sosbench.github.io/; ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03962 2026-04-07 cs.CL cs.LG 81%

Predict, Don't React: Value-Based Safety Forecasting for LLM Streaming

预测,而非反应:基于价值的安全预测用于LLM流式处理

Pride Kavumba, Koki Wataoka, Huy H. Nguyen, Jiaxuan Li, Masaya Ohagi

机构 * SB Intuitions Corp.(SB Intuitions 公司) Sakana AI

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出StreamGuard,通过预测未来潜在风险来实现流式处理中的安全监控,提升了输入和输出的 moderation 性能,同时降低了误判率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04849 2026-04-07 cs.CY 79%

Latent Profiles of AI Risk Perception and Their Differential Association with Community Driving Safety Concerns: A Person-Centered Analysis

人工智能风险感知的潜在轮廓及其与社区驾驶安全担忧的差异性关联:一项以人为核心分析

Amir Rafe, Anika Baitullah, Subasish Das

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文通过以人为核心分析,识别美国成年人中人工智能风险感知的潜在轮廓,并测试这些轮廓与社区驾驶安全担忧的差异性关联,揭示世界观驱动的风险结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04775 2026-04-07 cs.CY 79%

Community Driving-Safety Deterioration as a Push Factor for Public Endorsement of AI Driving Capability

社区驾驶安全性下降作为公众支持自动驾驶能力的推动力

Amir Rafe, Subasish Das

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 研究探讨了社区驾驶安全性担忧通过一般化人工智能倾向的中介作用,揭示了驾驶频率对自动驾驶接受度的双重路径影响,发现社区担忧虽促进特定领域AI支持,但抑制了普遍AI热情,总体效应接近零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04660 2026-04-07 cs.AI 79%

Springdrift: An Auditable Persistent Runtime for LLM Agents with Case-Based Memory, Normative Safety, and Ambient Self-Perception

Springdrift:一种可审计的持久运行时用于LLM代理,具备基于案例的记忆、规范安全性和环境自我感知

Seamus Brady

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 Springdrift通过可审计的执行子系统、基于案例的记忆层和规范安全机制,实现了LLM代理在跨会话任务连续性和环境自我感知方面的突破,展示了无显式指令下的自主诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04155 2026-04-07 cs.LG cs.IT math.IT q-bio.QM stat.ML 79%

The Geometric Alignment Tax: Tokenization vs. Continuous Geometry in Scientific Foundation Models

几何对齐税:令牌化与连续几何在科学基础模型中的对比

Prashant C. Raju

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 科学基础模型在预测精度优化中面临连续几何保持问题,研究发现几何对齐税是内在成本,通过连续头替代交叉熵可显著减少几何失真,但编码本存在非单调双关现象,不同架构在连续与离散目标下表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03976 2026-04-07 cs.AI cs.CE 79%

Quantifying Trust: Financial Risk Management for Trustworthy AI Agents

量化信任:为可信AI代理的金融风险管理

Wenyue Hua, Tianyi Peng, Chi Wang, Ian Kaufman, Bryan Lim, Chandler Fang

机构 * Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) t54.ai Virtuals ACP University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出基于金融风险管理的Agentic Risk Standard框架,通过整合风险评估与补偿机制,将信任从隐含期望转为可衡量的产品保证,提升AI代理在开放环境中的可靠性。

Comments 30 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03622 2026-04-07 cs.SE cs.AI 79%

Toward Executable Repository-Level Code Generation via Environment Alignment

面向环境对齐的仓库级代码生成

Ruwei Pan, Junlei Shen, Linhao Wu, Yueheng Zhu, Zixiong Yang, Yakun Zhang, Lu Zhang, Hongyu Zhang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出EnvGraph框架,通过环境对齐问题解决仓库级代码生成中的可执行性挑战,实验显示其在功能正确性和非功能质量上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03264 2026-04-07 cs.CV cs.AI cs.CR 79%

SafeScreen: A Safety-First Screening Framework for Personalized Video Retrieval for Vulnerable Users

SafeScreen: 一种以安全优先的个性化视频检索框架用于易受伤害用户的视频筛选

Wenzheng Zhao, Madhava Kalyan Gadiputi, Fengpei Yuan

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 SafeScreen通过安全优先机制,在确保个性化视频检索的同时满足个体安全约束,采用自动化流程进行视频的连续审批或拒绝,结合个性化安全标准提取、证据驱动评估和LLM决策,实现实时可解释的视频筛选。

Comments 11 pages, 3 figures, 7 tables. Under review for ACM ICMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04772 2026-04-07 math.OC cs.SY eess.SY 78%

Collaborative Altruistic Safety in Coupled Multi-Agent Systems

耦合多智能体系统中的协作利他安全

Brooks A. Butler, Xiao Tan, Aaron D. Ames, Magnus Egerstedt

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出一种基于协作控制屏障函数的框架,通过协作控制确保动态耦合多智能体系统的安全性,利用哈密顿规则定义利他安全条件,提升系统整体安全性和鲁棒性。

Comments This work is to appear at the 2026 American Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04496 2026-04-07 cs.CV 78%

The Indra Representation Hypothesis for Multimodal Alignment

多模态对齐的Indra表示假说

Jianglin Lu, Hailing Wang, Kuo Yang, Yitian Zhang, Simon Jenni, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(Adobe研究院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出Indra表示假说,通过范畴论中的V富化Yoneda嵌入,定义样本间关系轮廓,提升多模态对齐的鲁棒性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03341 2026-04-07 stat.AP physics.ao-ph stat.ML 78%

Generative Unsupervised Downscaling of Climate Models via Domain Alignment: Application to Wind Fields

通过域对齐生成无监督降尺度:应用于风场

Julie Keisler, Boutheina Oueslati, Anastase Charantonis, Yannig Goude, Claire Monteleoni

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出基于域对齐的生成模型,用于多变量风场降尺度与偏差校正,提升空间一致性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27139 2026-04-07 cs.CV 78%

The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models

鲁棒性几何:优化损失景观曲率和特征流形对齐以增强视觉-语言模型的鲁棒微调

Shivang Chopra, Shaunak Halbe, Chengyue Huang, Brisa Maneechotesuwan, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出GRACE框架,通过联合调节参数空间曲率和特征空间不变性,提升视觉-语言模型在分布内准确率、分布外泛化和对抗鲁棒性之间的平衡,实验显示在ImageNet微调中ID准确率提升10.8%,对抗准确率提升13.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29403 2026-04-07 cs.CR cs.AI 70%

Security in LLM-as-a-Judge: A Comprehensive SoK

LLM-as-a-Judge 的安全性:全面的系统化知识综述

Aiman Al Masoud, Antony Anju, Marco Arazzi, Mert Cihangiroglu, Vignesh Kumar Kembu, Serena Nicolazzo, Antonino Nocera, Vinod P., Saraga Sakthidharan

机构 * University of Pavia(帕维亚大学) Cochin University of Science and Technology(科钦科技大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文系统分析了LLM-as-a-Judge的安全性问题,提出分类框架,探讨了攻击、防御和应用等方向,揭示了现有框架的漏洞及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03356 2026-04-07 cs.AI 70%

Evaluating Artificial Intelligence Through a Christian Understanding of Human Flourishing

通过基督教对人类繁荣的理解评估人工智能

Nicholas Skytland, Lauren Parsons, Alicia Llewellyn, Steele Billings, Peter Larson, John Anderson, Sean Boisen, Steve Runge

机构 * Gloo WinShape Foundation(WinShape基金会) Biblica

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出基督教单轮Flourishing AI基准,评估前沿模型在七个维度上的人类繁荣表现,发现AI默认采用世俗主义,导致道德和神学推理不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23883 2026-04-07 cs.AI 70%

Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges

代理AI安全:威胁、防御、评估与开放挑战

Anshuman Chhabra, Shrestha Datta, Shahriar Kabir Nahin, Prasant Mohapatra

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文探讨代理AI系统的安全威胁与防御策略,分析其在自动化中的独特风险,并提出安全设计的开放挑战。

Comments Published in IEEE Access. DOI: https://doi.org/10.1109/access.2026.3675554

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15925 2026-04-07 cs.RO cs.AI cs.CV 70%

VERDI: VLM-Embedded Reasoning for Autonomous Driving

VERDI:嵌入视觉语言模型的自动驾驶推理

Bowen Feng, Zhiting Mei, Julian Ost, Filippo Ghilotti, Baiang Li, Roger Girgis, Anirudha Majumdar, Felix Heide

机构 * Princeton University(普林斯顿大学) Torc Robotics

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 VERDI通过在训练时整合视觉语言模型的推理过程和常识知识,提升自动驾驶系统的决策能力,实现更高效的模块化架构,同时保持快速推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04456 2026-04-07 cs.AI cs.CL cs.LG 67%

Empirical Characterization of Rationale Stability Under Controlled Perturbations for Explainable Pattern Recognition

基于受控扰动的理性稳定性经验表征

Abu Noman Md Sakib, Zhensen Wang, Merjulah Roby, Zijie Zhang

机构 * The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Department of Computer Science, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校计算机科学系) Department of Mechanical, Aerospace, and Industrial Engineering, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校机械、航空航天与工业工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新指标评估模型解释的一致性,通过BERT等预训练模型和SHAP计算特征重要性,检测模型在相似输入下是否保持一致的推理行为。

Comments 28th International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17585 2026-04-07 cs.AI cs.CL cs.LG 67%

Cite Pretrain: Retrieval-Free Knowledge Attribution for Large Language Models

Cite Pretrain: 无需检索的知识归因于大语言模型

Yukun Huang, Sanxing Chen, Jian Pei, Manzil Zaheer, Bhuwan Dhingra

机构 * Duke University(杜克大学) Meta

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CitePretrainBench基准,通过修改训练过程使大语言模型在无检索情况下可靠归因于训练期间看到的文档。通过两阶段方法提升模型在短形式和长形式引用任务中的表现,实验显示Active Indexing在多个任务和模型中均取得30.2%的引用精度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15746 2026-04-07 cs.CL cs.AI 62%

LLMs Judge Themselves: A Game-Theoretic Framework for Human-Aligned Evaluation

LLMs 自我评判:一种用于人类对齐评估的游戏理论框架

Gao Yang, Yuhang Liu, Siyu Miao, Xinyue Liang, Zhengyang Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Southeast Academy of Information Technology(东南信息技术研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于游戏理论的自动相互评估框架,通过LLM自我评估和同伴评审,结合人类投票行为,探索LLM评估的对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26433 2026-04-07 cs.LG cs.AI 62%

ACT: Agentic Classification Tree

ACT:代理分类树

Vincent Grari, Tim Arni, Thibault Laugel, Sylvain Lamprier, James Zou, Marcin Detyniecki

机构 * AXA AI Research(AXA人工智能研究) Stanford University(斯坦福大学) EPFL, Lausanne, Switzerland(瑞士洛桑联邦理工学院) Polish Academy of Sciences, IBS PAN, Warsaw, Poland(波兰科学院计算机科学研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 ACT通过将决策树扩展到非结构化输入,利用自然语言问题和LLM反馈提升透明度和可解释性,实验证明其在文本基准上优于基于提示的方法。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24186 2026-04-07 cs.CL cs.AI 62%

Measuring Competency, Not Performance: Item-Aware Evaluation Across Medical Benchmarks

测量能力,而非表现:跨医学基准的项目意识评估

Zhimeng Luo, Lixin Wu, Adam Frisch, Daqing He

机构 * School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院) Department of Educational Psychology, University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校教育心理学系) Department of Emergency Medicine, University of Pittsburgh(匹兹堡大学急诊医学系)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedIRT框架,通过项目反应理论评估LLM在医学领域的实际能力,揭示了不同医学主题的领域异质性,并展示了项目难度分析对不同响应模式的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03376 2026-04-07 cs.AI cs.CL 62%

VERT: Reliable LLM Judges for Radiology Report Evaluation

VERT:用于放射学报告评估的可靠LLM评判者

Federica Bologna, Jean-Philippe Corbeil, Matthew Wilkens, Asma Ben Abacha

机构 * Cornell University(康奈尔大学) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VERT作为LLM评判者,通过对比现有指标和实验验证,展示了其在多模态和解剖结构上的鲁棒性及轻量级微调的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03252 2026-04-07 cs.CY cs.CL 62%

Evaluating Digital Inclusiveness of Digital Agri-Food Tools Using Large Language Models: A Comparative Analysis Between Human and AI-Based Evaluations

利用大语言模型评估数字农业工具的包容性:人类与AI评估的比较分析

Githma Pewinya, Carolina Martins, Garcia Mariangel

机构 * International Water Management Institute(国际水资源管理研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨大语言模型在快速评估数字农业工具包容性方面的潜力,比较四种模型与专家评估的性能,发现其在某些维度上能接近专家判断,但可靠性因模型和情境而异。

Comments 24 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04878 2026-04-07 cs.AI cs.PF 57%

Learning, Potential, and Retention: An Approach for Evaluating Adaptive AI-Enabled Medical Devices

学习、潜能与保留:评估自适应AI医疗设备的方法

Alexis Burgon, Berkman Sahiner, Nicholas A Petrick, Gene Pennello, Ravi K Samala

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出三种测量方法:学习、潜能和保留,用于评估自适应AI医疗设备的性能变化,通过模拟人口变化验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04875 2026-04-07 cs.CV cs.AI cs.MM 57%

DIRECT: Video Mashup Creation via Hierarchical Multi-Agent Planning and Intent-Guided Editing

DIRECT:通过分层多智能体规划和意图引导编辑实现视频混剪创作

Ke Li, Maoliang Li, Jialiang Chen, Jiayu Chen, Zihao Zheng, Shaoqi Wang, Xiang Chen

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) School of Computer Science, Peking University(北京大学计算机科学学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出DIRECT框架,通过分层多智能体规划和意图引导编辑解决视频混剪中多模态协调问题,提出Mashup-Bench基准并验证了方法在客观和主观评估上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04791 2026-04-07 cs.CL 57%

How Far Are We? Systematic Evaluation of LLMs vs. Human Experts in Mathematical Contest in Modeling

我们离目标还有多远?对LLMs与人类专家在数学建模竞赛中的系统评估

Yuhang Liu, Heyan Huang, Yizhe Yang, Hongyan Zhao, Zhizhuo Zeng, Yang Gao

机构 * Beijing Institute of Technology(北京理工大学) Southeast Academy of Information Technology(东南信息技术研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文系统评估了LLMs与人类专家在数学建模竞赛中的能力差异,揭示了当前先进LLMs在执行阶段存在显著缺陷,需超越模型扩展的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04103 2026-04-07 cs.AI 57%

Compliance-by-Construction Argument Graphs: Using Generative AI to Produce Evidence-Linked Formal Arguments for Certification-Grade Accountability

基于构造的合规性论证图:利用生成式AI生成证据关联的正式论证以实现认证级问责

Mahyar T. Moghaddam

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种结合生成式AI与结构化正式论证表示的合规性架构,通过类型化论证图、检索增强生成、推理验证内核和溯源账本,确保论证的可验证性和可追溯性,防止不支持的主张进入决策记录。

Comments Accepted at FACCT 2026, IoT CPS Week

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03151 2026-04-07 cs.AI 57%

Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration

增强基础视觉语言模型对缺失模态的鲁棒性:可扩展的扩散用于双向特征恢复

Wei Dai, Haoyu Wang, Honghao Chang, Lijun He, Fan Li, Jian Sun, Haixia Bi

机构 * Department of Electronics Information \ 'an Jiaotong University Xi'an China School of Information Communications Engineering \ 'an Jiaotong University Xi'an China School of Mathematics Statistics \ 'an Jiaotong University Xi'an China Information \ 'an Jiaotong University Communications Engineering \ 'an Jiaotong University Statistics \ 'an Jiaotong University

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种通用缺失模态恢复策略,通过增强扩散模型实现双向特征对齐,提升视觉语言模型在模态缺失情况下的鲁棒性和可扩展性。

Comments 10 pages, 8 figures, 6 tables. Experiments and some details have been updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08565 2026-04-07 cs.HC cs.AI 57%

Rewriting Video: Text-Driven Reauthoring of Video Footage

重写视频:基于文本的视频重写

Sitong Wang, Anh Truong, Lydia B. Chilton, Dingzeyu Li

机构 * Columbia University(哥伦比亚大学) Adobe Research(Adobe研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于文本的视频重写方法,通过生成重建算法将视频转为可编辑文本提示,并通过交互式工具Rewrite Kit实现视频内容的重写,探讨了文本驱动视频重写的新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏