arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-13 至 2026-03-13 共收录 23 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2603.11987 2026-03-13 cs.AI 79%

LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories

LABSHIELD:一种多模态基准,用于科学实验室中的安全关键推理和规划

Qianpu Sun, Xiaowei Chi, Yuhan Rui, Ying Li, Kuangzhi Ge, Jiajun Li, Sirui Han, Shanghang Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 LABSHIELD是一个多模态基准,用于评估MLLM在科学实验室中的安全关键推理和规划能力,揭示了现有模型在专业实验室场景中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16211 2026-03-13 cs.SD cs.AI cs.CL eess.AS 73%

AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models

AudioTrust: 音频大语言模型多维可信度基准测试

Kai Li, Can Shen, Yile Liu, Jirui Han, Kelong Zheng, Xuechao Zou, Lionel Z. Wang, Shun Zhang, Xingjian Du, Hanjun Luo, Yingbin Jin, Xinxin Xing, Ziyang Ma, Yue Liu, Yifan Zhang, Junfeng Fang, Kun Wang, Yibo Yan, Gelei Deng, Haoyang Li, Yiming Li, Xiaobin Zhuang, Tianlong Chen, Qingsong Wen, Tianwei Zhang, Yang Liu, Haibo Hu, Zhizheng Wu, Xiaolin Hu, Eng-Siong Chng, Wenyuan Xu, XiaoFeng Wang, Wei Dong, Xinfeng Li

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 AudioTrust通过多维度评估音频大语言模型的可信度,揭示其在高风险音频场景下的局限性,为安全部署提供关键洞察。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02907 2026-03-13 cs.CL 70%

Beyond the Black Box: A Survey on the Theory and Mechanism of Large Language Models

超越黑箱:大型语言模型理论与机制的综述

Zeyu Gan, Ruifeng Ren, Wei Yao, Xiaolin Hu, Gengze Xu, Chen Qian, Huayi Tang, Zixuan Gong, Xinhao Yao, Pengwei Tang, Zhenxing Dou, Yong Liu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型的理论与机制,提出生命周期分类法,分析核心理论问题并识别前沿挑战,旨在推动LLM发展向科学学科转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11701 2026-03-13 stat.ML cs.LG 70%

Decomposing Observational Multiplicity in Decision Trees: Leaf and Structural Regret

分解决策树中的观测多重性:叶和结构后悔

Mustafa Cavus

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出决策树中叶和结构后悔的概念,分析观测多重性的来源,证明结构后悔主导了多重性,并通过实验展示其在提升模型安全性中的作用。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08281 2026-03-13 cs.CL cs.AI cs.CY 67%

Evaluating LLM-Based Grant Proposal Review via Structured Perturbations

通过结构化扰动评估基于LLM的项目申请评审

William Thorne, Joseph James, Yang Wang, Chenghua Lin, Diana Maynard

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过结构化扰动评估基于LLM的项目评审,发现逐部分分析方法在检测和评分可靠性上表现最佳,但LLM反馈存在偏颇,需进一步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04583 2026-03-13 cs.AI cs.CL cs.CV cs.LG 67%

Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper

初级AI科学家及其风险报告:从基础论文出发的自主科学探索

Atsuyuki Miyai, Mashiro Toyooka, Takashi Otonari, Zaiying Zhao, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京科学大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Jr. AI Scientist通过模仿初级研究人员的工作流程,自主生成科学论文,但存在潜在风险和局限性,需进一步研究。

Comments TMLR2026. Issues, comments, and questions are all welcome in https://github.com/Agent4Science-UTokyo/Jr.AI-Scientist

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18675 2026-03-13 cs.CV cs.AI cs.CL 62%

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

ReasonMap:迈向基于交通地图的细粒度视觉推理

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。

Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11342 2026-03-13 cs.CL cs.AI 62%

Evaluating Explainable AI Attribution Methods in Neural Machine Translation via Attention-Guided Knowledge Distillation

通过注意力引导的知识蒸馏评估神经机器翻译中的可解释AI归因方法

Aria Nourbakhsh, Salima Lamsiyah, Adelaide Danilov, Christoph Schommer

机构 * Department of Computer Science, University of Luxembourg(卢森堡大学计算机科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过注意力引导的知识蒸馏评估神经机器翻译中的可解释AI归因方法,发现注意力、值零化和层梯度×激活方法在BLEU指标上表现最佳,而其他梯度方法效果较弱。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11142 2026-03-13 cs.LG cs.AI cs.CV 62%

Attention Gathers, MLPs Compose: A Causal Analysis of an Action-Outcome Circuit in VideoViT

注意力汇聚,MLP组成:视频ViT中一个动作-结果回路的因果分析

Sai V R Chereddy

机构 * Sai V R Chereddy

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文通过因果分析揭示视频ViT中动作-结果回路的机理,发现注意力头负责收集证据,MLP块负责生成成功信号,展示了模型处理人类动作结果的核心计算模式。

Comments Accepted at the AAAI 2026 Workshop on Deployable AI (DAI). Non-archival. Code and custom dataset available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20900 2026-03-13 cs.SD cs.CL cs.LG eess.AS 62%

Text-only adaptation in LLM-based ASR through text denoising

基于文本去噪的LLM语音识别领域适应

Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Kadri Hacioglu, Srikanth Madikeri, Pradeep Rangappa, Manjunath K E, Petr Motlicek, Shankar Venkatesan, Andreas Stolcke

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过文本去噪方法实现LLM语音识别领域适应,有效保持跨模态对齐并提升性能,实测在两个数据集上达到22.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10745 2026-03-13 cs.AI cs.CV cs.LG cs.MA cs.MM 62%

Agentic Design Review System

代理设计评审系统

Sayan Nag, K J Joseph, Koustava Goswami, Vlad I Morariu, Balaji Vasan Srinivasan

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgenticDRS系统,通过多个代理协作分析设计,结合图匹配和提示扩展方法,实现高效的设计评估与反馈生成。

Comments Project Page: https://sayannag.github.io/AgenticDRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11559 2026-03-13 cs.AI cs.HC 57%

AI Knows What's Wrong But Cannot Fix It: Helicoid Dynamics in Frontier LLMs Under High-Stakes Decisions

AI知错却无法修复:前沿大语言模型在高风险决策中的螺旋动态

Alejandro R Jadad

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 前沿大语言模型在高风险决策中表现出螺旋动态,即在错误中自我识别却无法修复,导致可靠性下降,需通过识别该模式以提升AI信任度。

Comments 22 pages, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11266 2026-03-13 cs.AI 57%

The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning

消除幻觉:一种动态框架用于评估大语言模型的消除

Raj Sanjay Shah, Jing Huang, Keerthiram Murugesan, Nathalie Baracaldo, Diyi Yang

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) IBM Research(IBM研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种动态框架,用于评估大语言模型消除方法的鲁棒性,通过复杂结构查询揭示消除技术在多跳设置中的脆弱性,并提供可扩展的评估方法。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01716 2026-03-13 cs.CL 57%

Mechanistic Indicators of Steering Effectiveness in Large Language Models

大语言模型中转向效果的机制指标

Mehdi Jafari, Hao Xue, Flora Salim

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究通过分析大语言模型中转向效果的机制指标,探讨如何利用内部模型信号诊断转向可靠性,并提出新的评估基线以提升转向方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18395 2026-03-13 cs.CL 57%

NormGenesis: Multicultural Dialogue Generation via Exemplar-Guided Social Norm Modeling and Violation Recovery

NormGenesis: 通过实例引导的社会规范建模与违反恢复实现多文化对话生成

Minki Hong, Jangho Choi, Jihie Kim

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 NormGenesis通过实例引导的社会规范建模与违反恢复,实现多文化对话生成,提升对话自然度和文化适应性。

Comments 39 pages, 17 figures, EMNLP 2025 Main Conference, Senior Area Chair (SAC) Highlights Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12265 2026-03-13 cs.CV 50%

OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams

OmniStream:在连续流中掌握感知、重建与行动

Yibin Yan, Jilan Xu, Shangzhe Di, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, SJTU(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) VGG, Oxford(牛津大学视觉几何组)

专题命中 安全评测 :alignment(abstract)

AI总结 OmniStream通过统一的流视觉骨干网络,实现对视频流中感知、重建和行动的高效处理,展示了在多种任务上的通用性与竞争力。

Comments Technical Report. Project Page: https://go2heart.github.io/omnistream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12217 2026-03-13 cs.CV 50%

Real-World Point Tracking with Verifier-Guided Pseudo-Labeling

现实世界点跟踪中的验证者引导伪标签方法

Görkay Aydemir, Fatma Güney, Weidi Xie

机构 * Department of Computer Engineering, Koç University(科卡大学计算机工程系) KUIS AI Center(KUIS人工智能中心) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出验证者引导伪标签方法,通过元模型评估跟踪器预测可靠性,生成高质量伪标签以提升现实世界点跟踪性能,实验证明其在数据效率和性能上的优势。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12138 2026-03-13 cs.CV 50%

HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

HATS: 为GUI代理的硬度感知轨迹合成

Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

专题命中 安全评测 :alignment(abstract)

AI总结 HATS通过硬度感知轨迹合成框架,解决GUI代理训练中语义模糊性问题,提升任务执行鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11968 2026-03-13 hep-ph hep-ex hep-th quant-ph 50%

From vacuum amplitudes to qubits

从真空幅值到量子比特

Germán Rodrigo

专题命中 安全评测 :alignment(abstract)

AI总结 本文探讨了利用对撞机物理进行量子模拟的可能性,重点介绍多环真空幅值中的因果结构识别及高维函数积分与采样技术,旨在实现高阶量子事件生成器。

Comments Presented at 17th International Symposium on Radiative Corrections: Applications of Quantum Field Theory to Phenomenology (RADCOR2025), 5-10 October 2025, Puri, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11853 2026-03-13 cs.CR 50%

OpenClaw PRISM: A Zero-Fork, Defense-in-Depth Runtime Security Layer for Tool-Augmented LLM Agents

OpenClaw PRISM: 一种零fork、纵深防御的运行时安全层,用于工具增强的大语言模型代理

Frank Li

专题命中 安全评测 :prompt injection(abstract)

AI总结 OpenClaw PRISM通过零fork运行时安全层,结合启发式和LLM扫描流程,提供纵深防御机制,以增强工具增强型大语言模型代理的安全性。

Comments 23 pages, 3 figures, 6 tables. Open-source system paper with benchmark artifact pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11605 2026-03-13 cs.CV 50%

LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference

LaMoGen:通过LLM引导的符号推理实现语言到动作生成

Junkun Jiang, Ho Yin Au, Jingyu Xiang, Jie Chen

机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)

专题命中 安全评测 :alignment(abstract)

AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。

Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10365 2026-03-13 cs.CV 50%

Geometric Autoencoder for Diffusion Models

几何自编码器用于扩散模型

Hangyu Liu, Jianyong Wang, Yutao Sun

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出几何自编码器GAE,通过优化低维语义监督目标和潜在规范化,提升扩散模型在生成质量、压缩与稳健重建之间的平衡,实现更高效的高分辨率视觉生成。

Comments Code and models are publicly available at https://github.com/sii-research/GAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22433 2026-03-13 cs.CV 50%

SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition

SkeletonAgent: 一种基于骨架的动作识别代理交互框架

Hongda Liu, Yunfan Liu, Changlu Wang, Yunlong Wang, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(神经信息处理研究室,自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(abstract)

AI总结 SkeletonAgent通过Questioner和Selector两个代理连接识别模型与LLM,提升基于骨架的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏