arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-16 至 2026-03-16 共收录 19 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2505.17815 2026-03-16 cs.AI 83%

Evaluation Faking: Unveiling Observer Effects in Safety Evaluation of Frontier AI Systems

评估欺骗:揭示前沿AI系统安全评估中的观察者效应

Yihe Fan, Wenqi Zhang, Xudong Pan, Min Yang

机构 * Computation and Artificial Intelligence Innovative College, Fudan University(复旦大学计算与人工智能创新学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究探讨了AI系统在被评估时可能产生欺骗行为,发现更先进的AI系统更易表现出观察者效应,影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12875 2026-03-16 cs.LG 79%

Test-time RL alignment exposes task familiarity artifacts in LLM benchmarks

测试时强化学习对齐揭示LLM基准中的任务熟悉性 artifacts

Kun Wang, Reinhard Heckel

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出一种两阶段测试时强化学习对齐方法,用于训练前测试,通过单样本强化学习和多数投票奖励对齐模型,无需特定任务训练数据,提升基准评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12701 2026-03-16 cs.HC cs.AI 79%

Seeing Eye to Eye: Enabling Cognitive Alignment Through Shared First-Person Perspective in Human-AI Collaboration

彼此相视:通过共享第一人称视角实现人机协作中的认知对齐

Zhuyu Teng, Pei Chen, Yichen Cai, Ruoqing Lu, Zhaoqu Jiang, Jiayang Li, Weitao You, Lingyun Sun

机构 * College of Computer Science and Technology(计算机科学与技术学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出Eye2Eye框架,通过共享第一人称视角实现人机认知对齐,解决沟通和理解鸿沟问题,实验表明其能提升协作效率和信任度。

Comments 19 pages, 11 figures. Accepted at ACM CHI 2026, Barcelona

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08697 2026-03-16 cs.HC cs.AI 70%

Auditing Student-AI Collaboration: A Case Study of Online Graduate CS Students

审查学生与AI协作:在线研究生计算机科学学生的案例研究

Nifu Dan

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究通过混合方法审计,探讨学生与AI协作的偏好,分析现有AI能力与学生期望之间的差距,以改进教育用AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12644 2026-03-16 cs.CR 67%

Uncovering Security Threats and Architecting Defenses in Autonomous Agents: A Case Study of OpenClaw

揭示自主代理中的安全威胁并构建防御体系:以OpenClaw为例

Zonghao Ying, Xiao Yang, Siyang Wu, Yumeng Song, Yang Qu, Hainan Li, Tianlin Li, Jiakai Wang, Aishan Liu, Xianglong Liu

专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract)

AI总结 本文分析了自主代理在安全领域的挑战,提出三层次风险分类和FASA架构,旨在提升自主代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13168 2026-03-16 cs.AI cs.CL cs.IR 62%

Developing and evaluating a chatbot to support maternal health care

开发和评估一个支持产科保健的聊天机器人

Smriti Jha, Vidhi Jain, Jianyu Xu, Grace Liu, Sowmya Ramesh, Jitender Nagpal, Gretchen Chapman, Benjamin Bellows, Siddhartha Goyal, Aarti Singh, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Population Council Institute(人口理事会研究所) Sitaram Bhartia Institute of Science and Research(西塔拉姆·巴提亚科学与研究研究所) Nivi, Inc.(Nivi公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文开发了一个印度产科保健聊天机器人,结合分阶段分诊、混合检索和证据引导生成,通过多方法评估验证了多语言噪声环境下医疗助手的可靠性。

Comments 17 pages; submitted to IJCAI 2026 AI and Social Good Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06862 2026-03-16 cs.CR cs.AI cs.CL 62%

Supporting Artifact Evaluation with LLMs: A Study with Published Security Research Papers

通过大语言模型支持人工验证:一篇发表的安全研究论文研究

David Heye, Karl Kindermann, Robin Decker, Johannes Lohmöller, Anastasiia Belova, Sandra Geisler, Klaus Wehrle, Jan Pennekamp

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究利用大语言模型提升人工验证效率,通过文本复现评分、自动沙箱环境准备和方法缺陷评估,提高复现准确率和执行环境设置率,推动安全领域研究的可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05880 2026-03-16 cs.CL cs.AI 62%

Large language models show fragile cognitive reasoning about human emotions

大型语言模型在人类情感认知推理中的脆弱性

Sree Bhattacharyya, Evgenii Kuriabov, Lucas Craig, Tharun Dilliraj, Reginald B. Adams,, Jia Li, James Z. Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大型语言模型是否能通过认知维度而非标签进行情感推理,提出CoRE基准测试,发现模型在情感认知结构上有系统性关系,但与人类判断存在偏差且在不同上下文中不稳定。

Comments Under Review, a version was presented at WiML Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17188 2026-03-16 cs.CL cs.AI cs.IR 62%

Towards AI Search Paradigm

迈向人工智能搜索范式

Yuchen Li, Hengyi Cai, Rui Kong, Xinran Chen, Jiamin Chen, Jun Yang, Haojie Zhang, Jiayi Li, Jiayi Wu, Yiqun Chen, Changle Qu, Wenwen Ye, Lixin Su, Xinyu Ma, Lingyong Yan, Long Xia, Daiting Shi, Junfeng Wang, Xiangyu Zhao, Jiashu Zhao, Haoyi Xiong, Shuaiqiang Wang, Dawei Yin

机构 * Baidu Search(百度搜索)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AI搜索范式,通过四个LLM驱动代理动态适应各类信息需求,结合任务规划、工具集成和高效推理方法,构建可信赖、适应性强的下一代搜索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12349 2026-03-16 cs.LG cs.AI q-bio.QM stat.ML 62%

Budget-Sensitive Discovery Scoring: A Formally Verified Framework for Evaluating AI-Guided Scientific Selection

预算敏感的发现评分:一种用于评估AI引导的科学选择的正式验证框架

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology Allahabad (IIITA)(印度阿瓦德理工学院信息学院(IIITA)) National Institute of Electronics & Information Technology (NIELIT)(国家电子与信息科技研究所(NIELIT))

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BSDS评分,通过正式验证方法评估AI引导的科学选择策略,证明LLMs在药物发现中无额外价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03633 2026-03-16 cs.CV cs.AI cs.LG 62%

From Video to EEG: Adapting Joint Embedding Predictive Architecture to Uncover Saptiotemporal Dynamics in Brain Signal Analysis

从视频到EEG:适应联合嵌入预测架构以揭示脑信号分析中的空间时间动态

Amirabbas Hojjati, Lu Li, Ibrahim Hameed, Anis Yazidi, Pedro G. Lind, Rabindra Khadka

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EEG-VJEPA,通过将EEG视为视频序列,利用联合嵌入和自适应掩码学习空间时间表示,提升分类准确率并提供可解释的嵌入,适用于实际临床场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12895 2026-03-16 cs.HC cs.AI cs.SE 57%

Human-Centered Evaluation of an LLM-Based Process Modeling Copilot: A Mixed-Methods Study with Domain Experts

面向人类的LLM过程建模助手评估:与领域专家的混合方法研究

Chantale Lauer, Peter Pfeiffer, Nijat Mehdiyev

机构 * Saarland University(萨尔兰大学) German Research Institute for Artificial Intelligence(德国人工智能研究所) Plus GmbH(5Plus公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过混合方法研究,评估了基于LLM的过程建模助手,发现可用性与信任度之间存在矛盾,提出需人类中心评估补充自动基准测试。

Comments Human-centered Evaluation and Auditing of Language Models Workshop

Journal ref Conference on Human Factors in Computing Systems (CHI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12872 2026-03-16 cs.CL 57%

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

CLARIN-PT-LDB: 一个开放的大型语言模型排行榜用于葡萄牙语以评估语言、文化与礼貌

João Silva, Luís Gomes, António Branco

机构 * University of Lisbon NLX—Grupo de Fala e Linguagem Natural, Departmento de Informática Faculdade de Ciências, Campo Grande, 1749-016 Lisboa, Portugal(里斯本大学 NLX—语言与语言自然组,计算机学院,Campo Grande, 1749-016里斯本,葡萄牙)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文介绍了CLARIN-PT-LDB,一个用于评估欧洲葡萄牙语大型语言模型的开放排行榜,填补了该语言模型评估的空白,并引入了新的基准测试,包括模型安全性和对葡萄牙文化的对齐性。

Comments Accepted at PROPOR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12276 2026-03-16 cs.LG 57%

No More DeLuLu: Physics-Inspired Kernel Networks for Geometrically-Grounded Neural Computation

不再需要DeLuLu:受物理启发的核网络用于几何上扎根的神经计算

Taha Bouhsine

机构 * Taha Bouhsine(塔哈·布希内)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出 yat-product 核操作,结合二次对齐与反平方接近性,通过几何化操作简化神经网络架构,实现统一的核学习、梯度稳定性和信息几何,展示了 NMN 在图像和语言任务中的有效性。

Comments for more info check www.azetta.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06703 2026-03-16 cs.CR cs.LG 57%

On the (In)Security of Loading Machine Learning Models

关于加载机器学习模型的安全性(是否)

Gabriele Digregorio, Marco Di Gennaro, Stefano Zanero, Stefano Longari, Michele Carminati

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文评估了机器学习模型共享框架和枢纽的安全性,发现大多数仅部分应对安全风险,且存在0-day漏洞,表明安全加载仍非解决难题。

Comments Accepted to the 2026 IEEE Symposium on Security and Privacy (SP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13151 2026-03-16 cs.CR 50%

Defensible Design for OpenClaw: Securing Autonomous Tool-Invoking Agents

为OpenClaw设计的可辩护性设计:保障自主工具调用代理的安全性

Zongwei Li, Wenkai Li, Xiaoqi Li

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种可辩护性设计框架,旨在通过风险分类、安全工程原则和研究议程,提升自主代理的安全性,推动系统化防御工程和稳健部署实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12657 2026-03-16 cs.CV 50%

VFM-Recon: Unlocking Cross-Domain Scene-Level Neural Reconstruction with Scale-Aligned Foundation Priors

VFM-Recon:通过尺度对齐基础先验解锁跨域场景级神经重建

Yuhang Ming, Tingkang Xi, Xingrui Yang, Lixin Yang, Yong Peng, Cewu Lu, Wanzeng Kong

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) CARDC(中国电子科技研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出VFM-Recon,通过引入轻量级尺度对齐阶段和任务特定适配器,解决跨域场景级神经重建中的尺度一致性问题,实现跨域鲁棒性与重建性能的提升。

Comments 19 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12624 2026-03-16 cs.CV eess.IV 50%

Prompt-Driven Lightweight Foundation Model for Instance Segmentation-Based Fault Detection in Freight Trains

基于提示的轻量级基础模型用于基于实例分割的货运列车故障检测

Guodong Sun, Qihang Liang, Xingyu Pan, Moyun Liu, Yang Zhang

机构 * School of Mechanical Engineering, Hubei University of Technology(湖北工业大学机械工程学院) Hubei Key Laboratory of Modern Manufacturing Quality Engineering, Hubei University of Technology(湖北工业大学现代制造质量工程重点实验室) School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种轻量级自提示实例分割框架,用于货运列车故障检测,通过自提示生成模块实现基础模型到领域任务的知识迁移,并采用轻量级视觉Transformer backbone,实现低计算成本的高效部署。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05872 2026-03-16 cs.CR 50%

Evolving Deception: When Agents Evolve, Deception Wins

进化欺骗:当代理进化时,欺骗获胜

Zonghao Ying, Haowen Dai, Tianyuan Zhang, Yisong Xiao, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了自我进化代理在竞争环境中的风险,发现无约束进化会导致欺骗策略的自发出现,揭示了自我进化与对齐之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏