arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-27 至 2026-03-27 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2603.24904 2026-03-27 cs.AI cs.CR 85%

On the Foundations of Trustworthy Artificial Intelligence

人工智能可信性的基础

TJ Dunham

机构 * ARC

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出确定性推理是可信AI的必要充分条件,并通过信任熵量化非确定性的成本,证明验证失败概率精确为1-2^{-H_T}。通过构建纯整数推断引擎,验证了跨架构模型的确定性,展示了AI信任的本质是算术问题。

Comments 26 pages, 10 tables, 1 figure, 17 theorems/definitions/corollaries

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25692 2026-03-27 cs.LG cs.AI cs.AR cs.ET 81%

A Unified Memory Perspective for Probabilistic Trustworthy AI

概率可信人工智能的统一内存视角

Xueji Zhao, Likai Pei, Jianbo Liu, Kai Ni, Ningyuan Cao

机构 * University of Notre Dame(圣母大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一内存视角分析概率可信AI,揭示随机需求降低数据访问效率并驱动系统进入熵受限操作,定义内存级评估标准,分析传统架构局限并探讨新型概率计算内存方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25412 2026-03-27 cs.AI cs.CR 79%

Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models

超越内容安全:大型语言模型推理漏洞的实时监控

Xunguang Wang, Yuguang Zhou, Qingyue Wang, Zongjie Li, Ruixuan Huang, Zhenlan Ji, Pingchuan Ma, Shuai Wang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出实时监控方法,识别大型语言模型推理过程中的安全漏洞,定义九类不安全推理行为,并通过实验验证其有效性,展示了推理安全的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06055 2026-03-27 cs.LG 79%

A Trustworthy By Design Classification Model for Building Energy Retrofit Decision Support

为建筑节能改造决策支持设计的可信分类模型

Panagiota Rempi, Sotiris Pelekis, Alexandros Menelaos Tzortzis, Evangelos Spiliotis, Evangelos Karakolis, Christos Ntanos, Dimitris Askounis

机构 * Decision Support Systems Laboratory, School of Electrical and Computer Engineering, National Technical University of Athens(雅典国家技术大学电气与计算机工程学院决策支持系统实验室)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出一种可信-by-设计的机器学习框架,通过条件表格生成对抗网络和神经网络多标签分类器,为住宅建筑提供节能策略推荐,结合SHAP解释层提升透明度和可信度,验证了在不同数据条件下性能提升达53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25097 2026-03-27 cs.AI 79%

ElephantBroker: A Knowledge-Grounded Cognitive Runtime for Trustworthy AI Agents

ElephantBroker:一个基于知识的认知运行时用于可信AI代理

Cristian Lupascu, Alexandru Lupascu

机构 * Elephant Broker(大象经纪人)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 本文提出ElephantBroker,一个结合Neo4j知识图谱与Qdrant向量存储的认知运行时,通过Cognee SDK实现可信AI代理的记忆管理,包含认知循环、证据验证、安全防护等模块,支持多部署层级和安全审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL 76%

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12104 2026-03-27 cs.CR cs.AI 70%

DRIFT: Dynamic Rule-Based Defense with Injection Isolation for Securing LLM Agents

DRIFT: 基于注入隔离的动态规则防御以保障LLM代理安全

Hao Li, Xiaogeng Liu, Hung-Chun Chiu, Dianqi Li, Ning Zhang, Chaowei Xiao

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者)

专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract);分类 cs.AI

AI总结 DRIFT通过动态安全策略和注入隔离技术,有效防御LLM代理中的提示注入攻击,验证了其在多个基准测试中的高安全性和高实用性。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25196 2026-03-27 cs.CL cs.AI 62%

A Decade-Scale Benchmark Evaluating LLMs' Clinical Practice Guidelines Detection and Adherence in Multi-turn Conversations

一个十年级基准评估LLM在多轮对话中检测和遵守临床实践指南的能力

Andong Tan, Shuyu Dai, Jinglu Wang, Fengtao Zhou, Yan Lu, Xi Wang, Yingcong Chen, Can Yang, Shujie Liu, Hao Chen

机构 * Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CPGBench基准,评估LLM在多轮对话中检测和遵循临床实践指南的能力,发现多数模型在识别和遵循指南方面存在显著差距,通过人类评估验证了这一发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15281 2026-03-27 cs.RO cs.AI cs.CL cs.HC 62%

LLM4AD: Large Language Models for Autonomous Driving -- Concept, Review, Benchmark, Experiments, and Future Trends

LLM4AD:大型语言模型在自动驾驶中的应用——概念、综述、基准测试、实验与未来趋势

Can Cui, Yunsheng Ma, Sung-Yeon Park, Zichong Yang, Yupeng Zhou, Peiran Liu, Juanwu Lu, Juntong Peng, Jiaru Zhang, Ruqi Zhang, Lingxi Li, Yaobin Chen, Jitesh H. Panchal, Amr Abdelraouf, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Institute for Physical Artificial Intelligence (IPAI), Purdue University(普渡大学物理人工智能研究所) Department of Computer Science, Purdue University(普渡大学计算机科学系) InfoTech Labs, Toyota Motor North America(丰田北美信息技术实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了将大型语言模型应用于自动驾驶的潜力,提出LLM4AD概念,构建了评估框架,并通过实验和未来趋势分析揭示了挑战与发展方向。

Comments The paper was accepted by the Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24618 2026-03-27 cs.AR cs.AI cs.LG 62%

Causal AI For AMS Circuit Design: Interpretable Parameter Effects Analysis

因果AI用于AMS电路设计:可解释的参数影响分析

Mohyeu Hussain, David Koblah, Reiner Dizon-Paradis, Domenic Forte

机构 * University of Florida(佛罗里达大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于因果推理的框架,通过SPICE仿真数据构建DAG并估算ATE,实现参数影响的可解释性分析,验证了因果AI在AMS设计中的高精度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25727 2026-03-27 cs.AI cs.MM 57%

Back to Basics: Revisiting ASR in the Age of Voice Agents

回归基础:在语音助手时代重新审视ASR

Geeyang Tay, Wentao Ma, Jaewon Lee, Yuzhi Tang, Daniel Lee, Weisu Yin, Dongming Shen, Silin Meng, Yi Zhu, Mu Li, Alex Smola

机构 * Boson AI

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究指出现有ASR系统在真实场景下表现不佳,提出多语言诊断基准WildASR,揭示模型在环境退化、人口变化和语言多样性下的性能退化问题,并提供分析工具提升可靠性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25178 2026-03-27 cs.CV cs.CL 57%

Bilingual Text-to-Motion Generation: A New Benchmark and Baselines

双语文本到动作生成:一个新的基准和基线

Wanjiang Weng, Xiaofeng Tan, Xiangbo Shu, Guo-Sen Xie, Pan Zhou, Hongsong Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) Nanjing University of Science and Technology(南京理工大学) Singapore Management University(新加坡管理大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出BiHumanML3D双语文本到动作基准及BiMD基线,通过跨语言对齐策略提升多语言动作生成质量,实验显示其在FID和R@3指标上显著优于单语模型和翻译基线。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18840 2026-03-27 cs.CV cs.CL 57%

See the Text: From Tokenization to Visual Reading

查看文本:从分词到视觉阅读

Ling Xing, Rui Yan, Alex Jinpeng Wang, Zechao Li, Jinhui Tang

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学技术与人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出SeeTok方法,通过将文本渲染为图像并利用预训练多模态大模型实现视觉阅读,相比传统子词分词在资源消耗和跨语言泛化方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11413 2026-03-27 cs.HC cs.AI 57%

Evaluation format, not model capability, drives triage failure in the assessment of consumer health AI

评估格式而非模型能力驱动消费者健康AI的分诊失败

David Fraile Navarro, Farah Magrabi, Enrico Coiera

机构 * Centre for Health Informatics(健康信息学中心) Australian Institute of Health Innovation(澳大利亚健康创新研究所) Macquarie University(麦考瑞大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究通过对比考试式与自然场景下的分诊测试,发现评估格式显著影响分诊准确性,指出消费者健康AI的评估需模拟真实使用场景以获得可靠结果。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22013 2026-03-27 cs.CV 50%

RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

RobustVisRAG: 基于因果性的视觉增强检索增强生成方法在视觉退化下的鲁棒性

I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen

机构 * National Taiwan University(国立台湾大学) Microsoft(微软)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出RobustVisRAG,通过双路径框架分离语义与退化因素,提升在视觉退化下的检索生成性能,实验显示在真实退化条件下性能提升显著。

Comments Accepted by CVPR2026; Project Page: https://robustvisrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25092 2026-03-27 cs.IR 50%

AuthorityBench: Benchmarking LLM Authority Perception for Reliable Retrieval-Augmented Generation

AuthorityBench: 评估LLM权威感知以实现可靠的检索增强生成

Zhihui Yao, Hengran Zhang, Keping Bi

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出AuthorityBench基准,通过三个数据集评估LLM权威感知能力,发现ListJudge和PairJudge方法与真实权威最相关,且权威感知对检索增强生成的准确性有显著提升。

Comments 11 pages, 4 figures. Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24837 2026-03-27 cs.CR 50%

Bridging Code Property Graphs and Language Models for Program Analysis

连接代码属性图与语言模型用于程序分析

Ahmed Lekssays

专题命中 安全评测 :safety(abstract)

AI总结 本文提出codebadger,结合Joern的代码属性图引擎与LLM,解决代码分析中的挑战,通过高级工具实现程序切片、污点追踪等,提升大规模代码库的分析能力。

Comments Accepted at Software Vulnerability Management Workshop @ ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24703 2026-03-27 cs.SE cs.RO cs.SY eess.SY 50%

IndustriConnect: MCP Adapters and Mock-First Evaluation for AI-Assisted Industrial Operations

IndustriConnect:MCP适配器与先假测试用于AI辅助工业操作

Melwin Xavier, Melveena Jolly, Vaisakh M A, Midhun Xavier

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出IndustriConnect,通过MCP适配器将工业操作暴露为可发现的AI工具,支持协议特定连接和安全控制,并通过先假测试和确定性基准验证适配器的正确性、并发行为和结构化错误处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24696 2026-03-27 cs.CV 50%

LLaVA-LE: Large Language-and-Vision Assistant for Lunar Exploration

LLaVA-LE:用于月球探索的大型语言和视觉助手

Gokce Inal, Pouyan Navard, Alper Yilmaz

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LLaVA-LE,一个专为月球表面和地下特征分析设计的多模态模型,通过构建大规模月球数据集LLUCID和两阶段训练方法,提升了行星科学领域的视觉语言模型性能。

Comments Accepted in AI4Space Workshop CVPR2026. Website: https://osupcvlab.github.io/LLaVA-LE/, Dataset: https://huggingface.co/datasets/pcvlab/lucid

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24684 2026-03-27 cs.CV 50%

KitchenTwin: Semantically and Geometrically Grounded 3D Kitchen Digital Twins

KitchenTwin: 基于语义和几何的3D厨房数字孪生

Quanyun Wu, Kyle Gao, Daniel Long, David A. Clausi, Jonathan Li, Yuhao Chen

机构 * University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一种基于语义和几何的3D厨房数字孪生框架,通过融合视觉引导的对象网格与Transformer预测的全局点云,实现几何一致的数字孪生构建。

详情

展开后加载摘要…

URL PDF HTML 收藏