arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-11 至 2026-03-11 共收录 22 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 22 篇

2603.09154 2026-03-11 cs.CL 84%

Bioalignment: Measuring and Improving LLM Disposition Toward Biological Systems for AI Safety

Bioalignment: 评估和改进LLM对生物系统的倾向以提高AI安全性

Trent R Northen, Mingxun Wang

机构 * Bioaligned Labs(Bioaligned实验室) Lawrence Berkeley National Lab(伯克利国家实验室) Computer Science & Engineering Dept, UC Riverside(加州大学河滨分校计算机科学与工程系)

专题命中 安全评测 :safety(title);AI safety(title);分类 cs.CL

AI总结 本研究通过微调改进LLM对生物解决方案的偏好,表明少量微调可提升模型对生物与合成方法的权衡能力。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09706 2026-03-11 cs.AI 83%

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22755 2026-03-11 cs.CL 79%

AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors

AuditBench:对具有隐藏行为的模型进行对齐审计评估

Abhay Sheshadri, Aidan Ewart, Kai Fronsdal, Isha Gupta, Samuel R. Bowman, Sara Price, Samuel Marks, Rowan Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 AuditBench通过植入隐藏行为的模型评估对齐审计技术,发现黑盒工具在代理中表现最佳,且训练技术影响审计难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09758 2026-03-11 cs.CL 70%

Beyond Fine-Tuning: Robust Food Entity Linking under Ontology Drift with FoodOntoRAG

超越微调:在本体漂移下利用FoodOntoRAG实现鲁棒的食品实体链接

Jan Drole, Ana Gjorgjevikj, Barbara Korouši'c Seljak, Tome Eftimov

机构 * Computer Systems Department, Jožef Stefan International Postgraduate School, Ljubljana, Slovenia(卢布尔雅那,斯洛文尼亚乔泽夫·斯蒂芬国际研究生学院计算机系统系) Computer Systems Department, Jožef Stefan Institute, Ljubljana, Slovenia(卢布尔雅那,斯洛文尼亚乔泽夫·斯蒂芬研究所计算机系统系)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出FoodOntoRAG,通过检索本体和结构化证据实现鲁棒的食品实体链接,避免微调并提高本体漂移的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09200 2026-03-11 cs.AI cs.CL cs.CY cs.LG 70%

The Reasoning Trap -- Logical Reasoning as a Mechanistic Pathway to Situational Awareness

推理陷阱——逻辑推理作为情境意识的机制路径

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(MARS 4.0 Fellow,剑桥人工智能安全中心(CAISH),剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊生成AI创新中心,亚马逊网络服务,美国) Google, USA(谷歌,美国) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出RAISE框架,揭示逻辑推理能力提升与情境意识升级的机制路径,并提出安全原则与测试方法以应对潜在风险。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 21 Pages. Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07847 2026-03-11 cs.CR 67%

Robustness Over Time: Understanding Adversarial Examples' Effectiveness on Longitudinal Versions of Large Language Models

时间鲁棒性:对抗示例在大型语言模型纵向版本中的有效性

Yugeng Liu, Tianshuo Cong, Zhengyu Zhao, Michael Backes, Yun Shen, Yang Zhang

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文研究了大型语言模型在纵向版本中的对抗鲁棒性,发现更新并不总是提升鲁棒性,部分模型在误分类和幻觉方面有所下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09691 2026-03-11 cs.CL cs.AI 62%

ESAinsTOD: A Unified End-to-End Schema-Aware Instruction-Tuning Framework for Task-Oriented Dialog Modeling

ESAinsTOD: 一种统一的端到端模式感知指令微调框架用于任务导向对话建模

Dechuan Teng, Chunlin Lu, Libo Qin, Wanxiang Che

机构 * Research Center for Social Computing and Information Retrieval, Harbin Institute of Technology(社会科学与信息检索研究中心,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ESAinsTOD提出一种统一的端到端模式感知指令微调框架,提升任务导向对话建模的性能与泛化能力。

Comments Published at International Journal of Machine Learning and Cybernetics (IJMLC)

Journal ref Int. J. Mach. Learn. & Cyber. 17, 127 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06758 2026-03-11 cs.LG cs.AI 62%

Enhancing SHAP Explainability for Diagnostic and Prognostic ML Models in Alzheimer Disease

增强阿尔茨海默病诊断和预后ML模型的SHAP可解释性

Pablo Guillén, Enrique Frias-Martinez

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级框架提升AD诊断预后模型SHAP解释的稳健性和一致性,通过整合相干性、稳定性与跨任务一致性验证解释的可靠性。

Journal ref CMC 1546-2226 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08736 2026-03-11 cs.DC cs.AI cs.LG cs.SY eess.SY 62%

Autonomous Edge-Deployed AI Agents for Electric Vehicle Charging Infrastructure Management

自主边缘部署AI代理用于电动汽车充电基础设施管理

Mohammed Cherifi

机构 * Hyperion Consulting(超离子咨询)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Auralink SDC架构,通过边缘部署的专用AI代理实现电动汽车充电基础设施的自主管理,实现高准确率的事故修复与快速响应。

Comments 27 pages, 10 figures (TikZ), 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09249 2026-03-11 cs.AI 57%

Social-R1: Towards Human-like Social Reasoning in LLMs

Social-R1: 向大语言模型中引入人类般的社交推理

Jincenzi Wu, Yuxuan Lei, Jianxun Lian, Yitian Huang, Lexin Zhou, Haotian Li, Xing Xie, Helen Meng

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Social-R1通过多维奖励对齐模型推理与人类认知,利用ToMBench-Hard提供困难训练案例,使大模型在社交推理任务中实现超越和稳健泛化。

Comments 27 pages. Code and dataset will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09231 2026-03-11 cs.AI 57%

Cognitively Layered Data Synthesis for Domain Adaptation of LLMs to Space Situational Awareness

认知分层数据合成用于LLM在空间态势感知领域的领域适应

Ding Linghu, Cheng Wang, Da Fan, Wei Shi, Kaifeng Yin, Xiaoliang Xue, Fan Yang, Haiyi Ren, Cong Zhang

机构 * Qian Xuesen Laboratory of Space Technology(钱学森空间技术实验室) China Academy of Space Technology(中国航天科技研究院) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出BD-FDG框架,通过认知分层问题建模和结构化知识组织,构建高质量SFT数据集,提升LLM在空间态势感知领域的适应性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07191 2026-03-11 cs.CR cs.AI 57%

Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice

自主代理系统治理架构:威胁、框架与工程实践

Yuxu Ge

机构 * University of York(约克大学) Department of Computer Science(计算机科学系) York United Kingdom(约克英国)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出分层治理架构LGA,通过四层框架有效拦截恶意工具调用,实验表明其在不同部署场景下均表现出高拦截率和低虚警率。

Comments 22 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03538 2026-03-11 cs.CV cs.AI 57%

SDR-GAIN: A High Real-Time Occluded Pedestrian Pose Completion Method for Autonomous Driving

SDR-GAIN: 一种用于自动驾驶的高实时遮挡行人姿态补全方法

Honghao Fu, Yongli Gu, Yidong Yan, Yilang Shen, Yiwen Wu, Libo Sun

机构 * School of Instrument Science and Engineering, Southeast University(仪器科学与工程学院,东南大学) School of Geospatial Engineering and Science, Sun Yat-sen University(地理信息工程与科学学院,中山大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 SDR-GAIN通过自监督对抗学习实现高实时遮挡行人姿态补全,提升自动驾驶系统鲁棒性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08814 2026-03-11 cs.RO cs.AI cs.ET cs.MA 57%

Scale-Plan: Scalable Language-Enabled Task Planning for Heterogeneous Multi-Robot Teams

Scale-Plan: 为异构多机器人团队实现可扩展的语言赋能任务规划

Piyush Gupta, Sangjae Bae, Jiachen Li, David Isele

机构 * Honda Research Institute(本田研究院) University of California(加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Scale-Plan通过生成紧凑的任务相关问题表示,提升异构多机器人团队的可扩展性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08806 2026-03-11 cs.SE cs.AI 57%

Test-Driven AI Agent Definition (TDAD): Compiling Tool-Using Agents from Behavioral Specifications

基于行为规范的AI代理定义(TDAD):从行为规范编译工具使用代理

Tzafrir Rehan

机构 * Fiverr Labs(Fiverr 实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 TDAD通过编译行为规范生成可执行测试,确保工具使用代理在生产环境中的行为合规性,提升测试质量和回归安全性。

Comments 9 pages, 2 figures, open benchmark at https://github.com/f-labs-io/tdad-paper-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09497 2026-03-11 cs.SE 50%

EmbC-Test: How to Speed Up Embedded Software Testing Using LLMs and RAG

EmbC-Test: 如何利用LLMs和RAG加速嵌入式软件测试

Maximilian Harnot, Sebastian Komarnicki, Michal Polok, Timo Oksanen

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出利用LLMs和RAG技术,通过生成自动测试用例,显著提高嵌入式软件测试效率,节省66%的测试时间并每小时生成270个测试用例。

Journal ref Technical University of Munich. 2026. ISBN 978-3-911430-12-8. https://mediatum.ub.tum.de/1846559

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18315 2026-03-11 cs.NI 50%

CovertComBench: A First Domain-Specific Testbed for LLMs in Wireless Covert Communication

CovertComBench: 一个用于无线隐蔽通信中LLM的首个领域特定测试平台

Zhaozhi Liu, Jiaxin Chen, Yuanai Xie, Yuna Jiang, Minrui Xu, Xiao Zhang, Pan Lai, Zan Zhou

专题命中 安全评测 :trustworthy(abstract)

AI总结 CovertComBench是首个用于评估LLM在无线隐蔽通信中安全约束优化能力的领域特定测试平台,揭示了LLM在高阶数学推导上的不足,强调需通过外部工具增强构建可信无线AI系统。

Comments 6 pages, corrected a typo: "DeepSeek-R1:70B" was previously incorrectly written as "DeepSeek-V3.2:70B"

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08008 2026-03-11 cs.CV 50%

A Survey on Wi-Fi Sensing Generalizability: Taxonomy, Techniques, Datasets, and Future Research Prospects

关于Wi-Fi感知通用性的综述:分类、技术、数据集与未来研究前景

Fei Wang, Tingting Zhang, Wei Xi, Han Ding, Ge Wang, Di Zhang, Yuanhao Cui, Fan Liu, Jinsong Han, Jie Xu, Tony Xiao Han

机构 * School of Software Engineering and the State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(软件工程学院和人机混合增强智能国家重点实验室,西安交通大学) School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Information and Communication Engineering,Beijing University of Posts and Telecommunications(信息与通信工程,北京邮电大学) School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文综述了Wi-Fi感知通用性研究,涵盖技术分类、数据集及未来方向,旨在提升系统在不同环境下的适应能力。

Comments Accepted for publication in IEEE Communications Surveys & Tutorials 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09012 2026-03-11 cs.HC 50%

"Who wants to be nagged by AI?": Investigating the Effects of Agreeableness on Older Adults' Perception of LLM-Based Voice Assistants' Explanations

谁想被AI nag?:探究 agreeableness 对老年人感知基于LLM的语音助手解释的影响

Niharika Mathur, Hasibur Rahman, Smit Desai

专题命中 安全评测 :trustworthy(abstract)

AI总结 研究探讨了agreeableness对老年人感知基于LLM的语音助手解释的影响,发现高 agreeableness 助手在日常场景中更受信任,但在紧急情况下清晰度更重要,且可接受的老年人更严厉惩罚低 agreeableness 助手。

Comments To be published as a poster extended abstract at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08744 2026-03-11 cs.DC cs.SE 50%

Extension of ACETONE C code generator for multi-core architectures

ACETONE C代码生成器在多核架构上的扩展

Yanis Aït-Aïssa, Thomas Carle, Sergei Chichin, Benjamin Lesage, Claire Pagetti

专题命中 安全评测 :safety(abstract)

AI总结 本文提出通过形式化定义处理器分配问题,扩展ACETONE以生成并行代码,并评估框架各层的最坏执行时间。

Journal ref 13th European Congress of Embedded Real Time Systems (ERTS), Feb 2026, Toulouse, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03733 2026-03-11 cs.CV 50%

RegionReasoner: Region-Grounded Multi-Round Visual Reasoning

RegionReasoner: 基于区域的多轮视觉推理

Wenfang Sun, Hao Chen, Yingjun Du, Yefeng Zheng, Cees G. M. Snoek

机构 * University of Amsterdam(阿姆斯特丹大学) Anhui University(安徽大学) Westlake University(西湖大学)

专题命中 安全评测 :alignment(abstract)

AI总结 RegionReasoner通过强化学习框架,结合接地保真度和全局-局部语义对齐,提升多轮视觉推理的准确性和一致性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20461 2026-03-11 cs.CV 50%

Exploiting the Final Component of Generator Architectures for AI-Generated Image Detection

利用生成器架构的最终组件进行AI生成图像检测

Yanzhu Liu, Xiao Liu, Yuexuan Wang, Mondal Soumik

机构 * Institute for Infocomm Research, A*STAR, Singapore(信息与通信研究 institute,A*STAR,新加坡)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出通过生成器最终组件污染真实图像以提高AI生成图像检测的准确率,实验表明其在不同生成器上的泛化能力优异。

详情

展开后加载摘要…

URL PDF HTML 收藏