arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-24 至 2026-04-24 共收录 50 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2601.06498 2026-04-24 cs.CL astro-ph.IM 57%

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Spec-o3:一种工具增强的视觉-语言代理,用于通过自动化光谱检查验证稀有天体候选体

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, CAS(SKL-MAIS,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) National Astronomical Observatories, CAS(国家天文台,中国科学院) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出Spec-o3,一种工具增强的视觉-语言代理,通过多模态链式推理实现天文学家对稀有天体候选体的自动化光谱检查,提升验证效率和准确性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21188 2026-04-24 cs.CR 50%

Physically Unclonable Functions for Secure IoT Authentication and Hardware-Anchored AI Model Integrity

用于安全物联网认证和硬件锚定AI模型完整性的物理不可克隆函数

Maryam Taghi Zadeh, Mohsen Ahmadi

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了用于AI赋能物联网系统的硬件根信任机制,比较了TPM、PUFs、混合容器感知硬件根信任等方法,指出PUFs和混合信任锚在大规模AI物联网系统中具有平衡的前景,而软件-only方法在对抗和物理暴露环境中不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 8 篇

2604.21152 2026-04-24 cs.CY cs.AI cs.CL cs.HC cs.IR 83%

Dialect vs Demographics: Quantifying LLM Bias from Implicit Linguistic Signals vs. Explicit User Profiles

方言与人口统计数据:从隐含语言信号与显式用户资料中量化LLM偏见

Irti Haq, Belén Saldías

机构 * University of Washington(华盛顿大学)

专题命中 AI治理与伦理 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过对比显式身份声明与隐含方言信号,揭示LLM在不同敏感领域中的偏见来源,发现隐含方言可降低拒绝率但影响内容安全。

Comments In The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25--28, 2026, Montreal, Canada. ACM, New York, NY, USA, 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21103 2026-04-24 cs.AI econ.GN q-fin.EC 74%

AI Governance under Political Turnover: The Alignment Surface of Compliance Design

人工智能治理中的政治更替:合规设计的对齐表面

Andrew J. Peterson

机构 * University of Poitiers(波尔多大学)

专题命中 AI治理与伦理 :alignment(title);分类 cs.AI

AI总结 研究探讨了在政治更替背景下,合规层如何影响AI治理的稳定性与透明性,分析了自动化程度、编码程度及迭代使用保障对系统脆弱性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21043 2026-04-24 cs.CY cs.AI cs.LG 67%

Strategic Polysemy in AI Discourse: A Philosophical Analysis of Language, Hype, and Power

人工智能话语中的战略多义性:语言、炒作与权力的哲学分析

Travis LaCroix, Fintan Mallory, Sasha Luccioni

机构 * Durham University(杜伦大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文探讨人工智能话语中语言的策略性使用,分析术语如'幻觉'、'思考链'等的多义性如何影响机构和话语实践,揭示语言作为社会技术机制塑造AI发展与治理的作用。

Comments Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20789 2026-04-24 cs.CL cs.AI cs.LG 67%

Working Memory Constraints Scaffold Learning in Transformers under Data Scarcity

工作记忆限制在数据稀缺下支撑Transformer的学习

Pranava Madhyastha, Dagmar Adamcova

机构 * City, University of London(伦敦城市大学) The Alan Turing Institute(艾伦·图灵研究所) Grounded Machines

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨在Transformer架构中引入类人工作记忆限制,提出基于固定宽度窗口和时间衰减的注意力机制,实验表明在数据稀缺时,这些约束能显著提升语法准确性并增强与人类处理指标的一致性。

Comments Published in ACL 2026 Findings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21549 2026-04-24 cs.AI stat.ME 57%

Unbiased Prevalence Estimation with Multicalibrated LLMs

基于多校准LLM的无偏流行率估计

Fridolin Linder, Thomas Leeper, Daniel Haimovich, Niek Tax, Lorenzo Perini, Milan Vojnovic

机构 * Meta Platforms Inc.(Meta公司) The London School of Economics and Political Science(伦敦政治经济学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出多校准方法以解决分类模型在存在协变量偏移时的流行率估计偏差问题,通过理论分析和实证应用展示其在LLM中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21036 2026-04-24 cs.AI 57%

Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models

谁定义了公平性?面向生成模型的基于目标的提示方法用于人口特征表示

Marzia Binta Nizam, James Davis

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种轻量级框架,在推理阶段通过提示级干预减轻生成模型中的代表性偏见,允许用户选择多种公平性定义,通过审计目标符合度和肤色分布来评估公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20677 2026-04-24 cs.CL 57%

Intersectional Fairness in Large Language Models

大语言模型中的交叉公平性

Chaima Boufaied, Ronnie De Souza Santos, Ann Barcomb

机构 * University of Calgary(卡尔加里大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文评估了六个大语言模型在交叉人口属性上的公平性,发现模型在模糊情境中表现良好,但在解歧情境中受刻板印象影响,且跨群体结果分布不均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20300 2026-04-24 cs.AI 57%

FSFM: A Biologically-Inspired Framework for Selective Forgetting of Agent Memory

FSFM:一种生物启发的智能体记忆选择性遗忘框架

Yingjie Gu, Wenjian Xiong, Liqiang Wang, Pengcheng Ren, Chao Li, Xiaojing Zhang, Yijuan Guo, Qi Sun, Jingyao Ma, Shidang Shi

机构 * China Mobile Digital Intelligence Business Unit(中国移动数字智能业务部) China Mobile Jiutian Company(中国移动蓟田公司) China Mobile Jiutian Research Institute(中国移动蓟田研究院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出FSFM框架,通过生物启发机制实现智能体记忆的选择性遗忘,提升效率、质量和安全性,经实验验证在访问效率、内容质量和安全性能上均有显著提升。

Comments 28 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 10 篇

2601.06033 2026-04-24 cs.HC cs.CR cs.CY 79%

How Generative AI Empowers Attackers and Defenders Across the Trust & Safety Landscape

生成式人工智能如何在信任与安全领域赋能攻击者和防御者

Patrick Gage Kelley, Steven Rousso-Schindler, Renee Shelby, Kurt Thomas, Allison Woodruff

专题命中 其他安全 :safety(title,abstract);分类 cs.CY

AI总结 本文通过43名专家的质性研究,探讨生成式AI在信任与安全领域对攻击者和防御者的影响,揭示其在提升攻击规模与速度的同时,也为防御方提供了检测有害内容、调查取证等新手段。

Comments 21 pages, 4 tables, 1 figure

Journal ref In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26). Association for Computing Machinery, New York, NY, USA, Article 1316, 1-21

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20938 2026-04-24 cs.LG cs.AI 62%

HARBOR: Automated Harness Optimization

HARBOR:自动化Harness优化

Biswa Sengupta, Jinhua Wang

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HARBOR框架,通过约束噪声贝叶斯优化解决Harness配置问题,强调自动化配置优于手动堆叠,并在生产编码代理中实例化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21361 2026-04-24 cs.AI 57%

Time, Causality, and Observability Failures in Distributed AI Inference Systems

时间、因果性和可观察性故障在分布式AI推理系统中

Ankur Sharma, Deep Shah, David Lariviere, Hesham ElBakoury

机构 * Open Compute Project(开放计算项目)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究揭示了分布式AI系统中时间同步对可观察性和因果性的影响,发现微小时钟偏差会导致因果错误,但系统功能和性能不受影响,强调时间对齐的重要性。

Comments 17 pages, 6 figures. Produced as part of the Unified Intelligent Infrastructure workstream at the Open Compute Project (OCP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21352 2026-04-24 cs.CL 57%

CARE: Counselor-Aligned Response Engine for Online Mental-Health Support

CARE:面向在线心理健康支持的咨询师对齐响应引擎

Hagai Astrin, Ayal Swaid, Avi Segal, Kobi Gal

机构 * Ben-Gurion University(本· Gurion 大学) School of Informatics, University of Edinburgh(爱丁堡大学信息学院) School of Informatics, University of Edinburgh Edinburgh UK(爱丁堡大学信息学院爱丁堡 英国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 CARE通过针对希伯来语和阿拉伯语的微调,提升心理健康领域低资源语言下的响应质量,增强咨询师与求助者对话的动态结构和情感语境。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21255 2026-04-24 cs.CL 57%

When Agents Look the Same: Quantifying Distillation-Induced Similarity in Tool-Use Behaviors

当代理看起来相同:量化蒸馏诱导的工具使用行为相似性

Chenghao Yang, Yuning Zhang, Zhoufutu Wen, Tao Gong, Jiaheng Liu, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, USTC(USTC计算机科学与技术学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) M-A-P

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出两种新指标RPS和AGS,用于区分任务成功必需行为与模型自主偏好,通过评估18个模型发现AGS能区分教师特定收敛与通用改进。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12994 2026-04-24 cs.CR cs.AI 57%

LogicEval: A Systematic Framework for Evaluating Automated Repair Techniques for Logical Vulnerabilities in Real-World Software

LogicEval: 一个系统框架用于评估自动修复技术在现实软件中逻辑漏洞的修复

Syed Md Mukit Rashid, Abdullah Al Ishtiaq, Kai Tu, Yilu Dong, Tianwei Wu, Ali Ranjbar, Tianchang Yang, Najrin Sultana, Shagufta Mehnaz, Syed Rafiul Hussain

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出LogicEval框架,通过LogicDS数据集评估传统和基于LLM的修复方法,发现编译和测试失败主要由提示敏感性、代码上下文丢失和补丁定位困难导致。

Comments To appear in ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11569 2026-04-24 cs.AI 57%

SemaPop: Semantic-Persona Conditioned and Controllable Population Synthesis

SemaPop:基于语义-人设的可控人口合成

Zhenlin Qin, Yancheng Ling, Leizhen Wang, Francisco Câmara Pereira, Zhenliang Ma

机构 * Department of Civil and Architectural Engineering, KTH Royal Institute of Technology(土木与建筑系,皇家理工学院) Digital Future, KTH Royal Institute of Technology(数字未来,皇家理工学院) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Department of Technology, Management and Economics, Technical University of Denmark(技术、管理与经济学系,丹麦技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SemaPop通过引入人设表示作为生成条件,实现可控的人口合成,提升生成性能并保持统计一致性与样本多样性。

Comments Submitted to Transportation Research Part C: Emerging Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04395 2026-04-24 cs.CV cs.MM 50%

BiTDiff: Fine-Grained 3D Conducting Motion Generation via BiMamba-Transformer Diffusion

BiTDiff:通过BiMamba-Transformer扩散实现细粒度3D导体运动生成

Tianzhi Jia, Kaixing Yang, Xiaole Yang, Xulong Tang, Ke Qiu, Shikui Wei, Yao Zhao

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学) Renmin University of China(中国人民大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出BiTDiff框架,结合BiMamba-Transformer模型和扩散策略,解决3D导体运动生成中的数据和方法限制,构建了首个大规模CM-Data数据集,并实现高质量运动合成与训练自由的联合级运动编辑。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12845 2026-04-24 cs.CV 50%

Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation

多模态蛋白质语言模型用于酶动力学参数:从底物识别到构象适应

Fei Wang, Xinye Zheng, Kun Li, Yanyan Wei, Yuxin Liu, Ganpeng Hu, Tong Bao, Jingwen Yang

机构 * School of Computer Science and Information Engineering(计算机科学与信息工程学院) Institute of Artificial Intelligence(人工智能研究院) CVLab, College of Information Technology(CV实验室,信息学院) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) School of Food Biological Engineering(食品生物工程学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出多阶段多模态条件建模方法,通过ERBA模块在蛋白质语言模型中注入跨模态信息,提升酶动力学参数预测的准确性与生物合理性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17955 2026-04-24 cs.SE 50%

Mining Type Constructs Using Patterns in AI-Generated Code

在AI生成代码中利用模式挖掘类型构造

Imgyeong Lee, Tayyib Ul Hassan, Abram Hindle

专题命中 其他安全 :safety(abstract)

AI总结 研究AI在类型构造任务中的表现,发现AI更易误用any关键字及高级类型构造,但其PR接受率高于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏