arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-13 至 2026-03-13 共收录 69 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2603.11987 2026-03-13 cs.AI 79%

LABSHIELD: A Multimodal Benchmark for Safety-Critical Reasoning and Planning in Scientific Laboratories

LABSHIELD:一种多模态基准,用于科学实验室中的安全关键推理和规划

Qianpu Sun, Xiaowei Chi, Yuhan Rui, Ying Li, Kuangzhi Ge, Jiajun Li, Sirui Han, Shanghang Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 LABSHIELD是一个多模态基准,用于评估MLLM在科学实验室中的安全关键推理和规划能力,揭示了现有模型在专业实验室场景中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16211 2026-03-13 cs.SD cs.AI cs.CL eess.AS 73%

AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models

AudioTrust: 音频大语言模型多维可信度基准测试

Kai Li, Can Shen, Yile Liu, Jirui Han, Kelong Zheng, Xuechao Zou, Lionel Z. Wang, Shun Zhang, Xingjian Du, Hanjun Luo, Yingbin Jin, Xinxin Xing, Ziyang Ma, Yue Liu, Yifan Zhang, Junfeng Fang, Kun Wang, Yibo Yan, Gelei Deng, Haoyang Li, Yiming Li, Xiaobin Zhuang, Tianlong Chen, Qingsong Wen, Tianwei Zhang, Yang Liu, Haibo Hu, Zhizheng Wu, Xiaolin Hu, Eng-Siong Chng, Wenyuan Xu, XiaoFeng Wang, Wei Dong, Xinfeng Li

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 AudioTrust通过多维度评估音频大语言模型的可信度,揭示其在高风险音频场景下的局限性,为安全部署提供关键洞察。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02907 2026-03-13 cs.CL 70%

Beyond the Black Box: A Survey on the Theory and Mechanism of Large Language Models

超越黑箱:大型语言模型理论与机制的综述

Zeyu Gan, Ruifeng Ren, Wei Yao, Xiaolin Hu, Gengze Xu, Chen Qian, Huayi Tang, Zixuan Gong, Xinhao Yao, Pengwei Tang, Zhenxing Dou, Yong Liu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型的理论与机制,提出生命周期分类法,分析核心理论问题并识别前沿挑战,旨在推动LLM发展向科学学科转型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11701 2026-03-13 stat.ML cs.LG 70%

Decomposing Observational Multiplicity in Decision Trees: Leaf and Structural Regret

分解决策树中的观测多重性:叶和结构后悔

Mustafa Cavus

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出决策树中叶和结构后悔的概念,分析观测多重性的来源,证明结构后悔主导了多重性,并通过实验展示其在提升模型安全性中的作用。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08281 2026-03-13 cs.CL cs.AI cs.CY 67%

Evaluating LLM-Based Grant Proposal Review via Structured Perturbations

通过结构化扰动评估基于LLM的项目申请评审

William Thorne, Joseph James, Yang Wang, Chenghua Lin, Diana Maynard

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过结构化扰动评估基于LLM的项目评审,发现逐部分分析方法在检测和评分可靠性上表现最佳,但LLM反馈存在偏颇,需进一步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04583 2026-03-13 cs.AI cs.CL cs.CV cs.LG 67%

Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper

初级AI科学家及其风险报告:从基础论文出发的自主科学探索

Atsuyuki Miyai, Mashiro Toyooka, Takashi Otonari, Zaiying Zhao, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京科学大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Jr. AI Scientist通过模仿初级研究人员的工作流程,自主生成科学论文,但存在潜在风险和局限性,需进一步研究。

Comments TMLR2026. Issues, comments, and questions are all welcome in https://github.com/Agent4Science-UTokyo/Jr.AI-Scientist

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18675 2026-03-13 cs.CV cs.AI cs.CL 62%

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

ReasonMap:迈向基于交通地图的细粒度视觉推理

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。

Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11342 2026-03-13 cs.CL cs.AI 62%

Evaluating Explainable AI Attribution Methods in Neural Machine Translation via Attention-Guided Knowledge Distillation

通过注意力引导的知识蒸馏评估神经机器翻译中的可解释AI归因方法

Aria Nourbakhsh, Salima Lamsiyah, Adelaide Danilov, Christoph Schommer

机构 * Department of Computer Science, University of Luxembourg(卢森堡大学计算机科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过注意力引导的知识蒸馏评估神经机器翻译中的可解释AI归因方法,发现注意力、值零化和层梯度×激活方法在BLEU指标上表现最佳,而其他梯度方法效果较弱。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11142 2026-03-13 cs.LG cs.AI cs.CV 62%

Attention Gathers, MLPs Compose: A Causal Analysis of an Action-Outcome Circuit in VideoViT

注意力汇聚,MLP组成:视频ViT中一个动作-结果回路的因果分析

Sai V R Chereddy

机构 * Sai V R Chereddy

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文通过因果分析揭示视频ViT中动作-结果回路的机理,发现注意力头负责收集证据,MLP块负责生成成功信号,展示了模型处理人类动作结果的核心计算模式。

Comments Accepted at the AAAI 2026 Workshop on Deployable AI (DAI). Non-archival. Code and custom dataset available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20900 2026-03-13 cs.SD cs.CL cs.LG eess.AS 62%

Text-only adaptation in LLM-based ASR through text denoising

基于文本去噪的LLM语音识别领域适应

Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Kadri Hacioglu, Srikanth Madikeri, Pradeep Rangappa, Manjunath K E, Petr Motlicek, Shankar Venkatesan, Andreas Stolcke

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过文本去噪方法实现LLM语音识别领域适应,有效保持跨模态对齐并提升性能,实测在两个数据集上达到22.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10745 2026-03-13 cs.AI cs.CV cs.LG cs.MA cs.MM 62%

Agentic Design Review System

代理设计评审系统

Sayan Nag, K J Joseph, Koustava Goswami, Vlad I Morariu, Balaji Vasan Srinivasan

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgenticDRS系统,通过多个代理协作分析设计,结合图匹配和提示扩展方法,实现高效的设计评估与反馈生成。

Comments Project Page: https://sayannag.github.io/AgenticDRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11559 2026-03-13 cs.AI cs.HC 57%

AI Knows What's Wrong But Cannot Fix It: Helicoid Dynamics in Frontier LLMs Under High-Stakes Decisions

AI知错却无法修复:前沿大语言模型在高风险决策中的螺旋动态

Alejandro R Jadad

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 前沿大语言模型在高风险决策中表现出螺旋动态,即在错误中自我识别却无法修复,导致可靠性下降,需通过识别该模式以提升AI信任度。

Comments 22 pages, 2 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11266 2026-03-13 cs.AI 57%

The Unlearning Mirage: A Dynamic Framework for Evaluating LLM Unlearning

消除幻觉:一种动态框架用于评估大语言模型的消除

Raj Sanjay Shah, Jing Huang, Keerthiram Murugesan, Nathalie Baracaldo, Diyi Yang

机构 * Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) IBM Research(IBM研究院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种动态框架,用于评估大语言模型消除方法的鲁棒性,通过复杂结构查询揭示消除技术在多跳设置中的脆弱性,并提供可扩展的评估方法。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01716 2026-03-13 cs.CL 57%

Mechanistic Indicators of Steering Effectiveness in Large Language Models

大语言模型中转向效果的机制指标

Mehdi Jafari, Hao Xue, Flora Salim

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究通过分析大语言模型中转向效果的机制指标,探讨如何利用内部模型信号诊断转向可靠性,并提出新的评估基线以提升转向方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18395 2026-03-13 cs.CL 57%

NormGenesis: Multicultural Dialogue Generation via Exemplar-Guided Social Norm Modeling and Violation Recovery

NormGenesis: 通过实例引导的社会规范建模与违反恢复实现多文化对话生成

Minki Hong, Jangho Choi, Jihie Kim

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 NormGenesis通过实例引导的社会规范建模与违反恢复,实现多文化对话生成,提升对话自然度和文化适应性。

Comments 39 pages, 17 figures, EMNLP 2025 Main Conference, Senior Area Chair (SAC) Highlights Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12265 2026-03-13 cs.CV 50%

OmniStream: Mastering Perception, Reconstruction and Action in Continuous Streams

OmniStream:在连续流中掌握感知、重建与行动

Yibin Yan, Jilan Xu, Shangzhe Di, Haoning Wu, Weidi Xie

机构 * School of Artificial Intelligence, SJTU(上海交通大学人工智能学院) Shanghai Innovation Institute(上海创新研究院) VGG, Oxford(牛津大学视觉几何组)

专题命中 安全评测 :alignment(abstract)

AI总结 OmniStream通过统一的流视觉骨干网络,实现对视频流中感知、重建和行动的高效处理,展示了在多种任务上的通用性与竞争力。

Comments Technical Report. Project Page: https://go2heart.github.io/omnistream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12217 2026-03-13 cs.CV 50%

Real-World Point Tracking with Verifier-Guided Pseudo-Labeling

现实世界点跟踪中的验证者引导伪标签方法

Görkay Aydemir, Fatma Güney, Weidi Xie

机构 * Department of Computer Engineering, Koç University(科卡大学计算机工程系) KUIS AI Center(KUIS人工智能中心) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出验证者引导伪标签方法,通过元模型评估跟踪器预测可靠性,生成高质量伪标签以提升现实世界点跟踪性能,实验证明其在数据效率和性能上的优势。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12138 2026-03-13 cs.CV 50%

HATS: Hardness-Aware Trajectory Synthesis for GUI Agents

HATS: 为GUI代理的硬度感知轨迹合成

Rui Shao, Ruize Gao, Bin Xie, Yixing Li, Kaiwen Zhou, Shuai Wang, Weili Guan, Gongwei Chen

专题命中 安全评测 :alignment(abstract)

AI总结 HATS通过硬度感知轨迹合成框架,解决GUI代理训练中语义模糊性问题,提升任务执行鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11968 2026-03-13 hep-ph hep-ex hep-th quant-ph 50%

From vacuum amplitudes to qubits

从真空幅值到量子比特

Germán Rodrigo

专题命中 安全评测 :alignment(abstract)

AI总结 本文探讨了利用对撞机物理进行量子模拟的可能性,重点介绍多环真空幅值中的因果结构识别及高维函数积分与采样技术,旨在实现高阶量子事件生成器。

Comments Presented at 17th International Symposium on Radiative Corrections: Applications of Quantum Field Theory to Phenomenology (RADCOR2025), 5-10 October 2025, Puri, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11853 2026-03-13 cs.CR 50%

OpenClaw PRISM: A Zero-Fork, Defense-in-Depth Runtime Security Layer for Tool-Augmented LLM Agents

OpenClaw PRISM: 一种零fork、纵深防御的运行时安全层,用于工具增强的大语言模型代理

Frank Li

专题命中 安全评测 :prompt injection(abstract)

AI总结 OpenClaw PRISM通过零fork运行时安全层,结合启发式和LLM扫描流程,提供纵深防御机制,以增强工具增强型大语言模型代理的安全性。

Comments 23 pages, 3 figures, 6 tables. Open-source system paper with benchmark artifact pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11605 2026-03-13 cs.CV 50%

LaMoGen: Language to Motion Generation Through LLM-Guided Symbolic Inference

LaMoGen:通过LLM引导的符号推理实现语言到动作生成

Junkun Jiang, Ho Yin Au, Jingyu Xiang, Jie Chen

机构 * Department of Computer Science, Hong Kong Baptist University, HKSAR(香港 Baptist 大学计算机科学系)

专题命中 安全评测 :alignment(abstract)

AI总结 LaMoGen通过LLM引导的符号推理实现语言到动作的生成,利用LabanLite动作表示提升动作的可解释性和可控性。

Comments Accepted by CVPR 2026. Supplementary material included. Project page: https://jjkislele.github.io/LaMoGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10365 2026-03-13 cs.CV 50%

Geometric Autoencoder for Diffusion Models

几何自编码器用于扩散模型

Hangyu Liu, Jianyong Wang, Yutao Sun

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出几何自编码器GAE,通过优化低维语义监督目标和潜在规范化,提升扩散模型在生成质量、压缩与稳健重建之间的平衡,实现更高效的高分辨率视觉生成。

Comments Code and models are publicly available at https://github.com/sii-research/GAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22433 2026-03-13 cs.CV 50%

SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition

SkeletonAgent: 一种基于骨架的动作识别代理交互框架

Hongda Liu, Yunfan Liu, Changlu Wang, Yunlong Wang, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(神经信息处理研究室,自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(abstract)

AI总结 SkeletonAgent通过Questioner和Selector两个代理连接识别模型与LLM,提升基于骨架的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 3 篇

2603.01214 2026-03-13 cs.CL cs.LG 81%

Reasoning Boosts Opinion Alignment in LLMs

推理提升大语言模型中的观点一致性

Frédéric Berdoz, Yann Billeter, Yann Vonlanthen, Roger Wattenhofer

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过结构化推理提升大语言模型的观点一致性,验证了推理在改善观点建模中的有效性,但指出仍需进一步机制以减少偏见。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03998 2026-03-13 cs.HC cs.AI cs.CY 62%

TRACE: AI-Assisted Assessment of Collaborative Projects in Computer Science Education

TRACE:计算机科学教育中协作项目的AI辅助评估

Songmei Yu, Andrew Zagula

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 TRACE通过AI辅助分析提升计算机科学教育中协作项目评估的透明度和可扩展性。

Comments 7 pages, 3 figures. Accepted at EISTA 2025; published in the Journal of Systemics, Cybernetics and Informatics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04916 2026-03-13 cs.SE 50%

Classifier or Prompt: A Case Study on Legal Requirements Traceability

分类器或提示:关于法律要求可追溯性的案例研究

Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出Kashif和RICE_LRT两种方法,分别通过分类器和提示工程解决法律要求的可追溯性问题,实验表明Kashif在F2得分上优于基线,RICE_LRT在更复杂的GDPR文档中表现更优。

Comments 32 pages, 7 figues

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 13 篇

2603.11617 2026-03-13 cs.CV 78%

Noise-aware few-shot learning through bi-directional multi-view prompt alignment

通过双向多视图提示对齐实现噪声感知的少样本学习

Lu Niu, Cheng Xue

机构 * Southeast University(东南大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 其他安全 :alignment(title,abstract)

AI总结 NA-MVP通过双向多视图提示对齐实现噪声感知少样本学习,有效区分干净与噪声线索,提升模型在噪声环境下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11306 2026-03-13 cs.CV 78%

Hierarchical Granularity Alignment and State Space Modeling for Robust Multimodal AU Detection in the Wild

层次粒度对齐与状态空间建模用于野外多模态面部动作单元检测

Jun Yu, Yunxiang Zhang, Naixiang Zheng, Lingsi Zhu, Guoyuan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出了一种基于层次粒度对齐和状态空间模型的多模态框架,通过强大的基础模型提取高保真视觉和音频表示,并引入视觉-马尔可夫模型和不对称交叉注意机制,实现对野外环境中面部动作单元的高效检测。

Comments 8 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11950 2026-03-13 cs.AI cs.LG 62%

Learning Transferable Sensor Models via Language-Informed Pretraining

通过语言引导预训练学习可迁移的传感器模型

Yuliang Chen, Arvind Pillai, Yu Yvonne Wu, Tess Z. Griffin, Lisa Marsch, Michael V. Heinz, Nicholas C. Jacobson, Andrew Campbell

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 SLIP通过语言引导预训练学习可迁移的传感器模型,整合对比对齐与传感器条件标注,支持不同时间分辨率和输入长度,实现跨领域任务的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05598 2026-03-13 cs.LG astro-ph.IM cs.AI physics.comp-ph 62%

On the Value of Tokeniser Pretraining in Physics Foundation Models

在物理基础模型中tokenizer预训练的价值

Hadi Sotoudeh, Payel Mukhopadhyay, Ruben Ohana, Michael McCabe, Neil D. Lawrence, Shirley Ho, Miles Cranmer

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在物理基础模型中预训练tokenizer对准确性和效率的影响,发现领域内预训练可显著提升模拟性能,并引入灵活的时空压缩操作以适应多样化的下游任务。

Comments 16 pages, 4 figures. Workshop paper at ICLR 2026 AI & PDE

详情

展开后加载摘要…

URL PDF HTML 收藏