arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-01 至 2026-05-01 共收录 62 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2604.27132 2026-05-01 cs.AI 70%

TRUST: A Framework for Decentralized AI Service v.0.1

TRUST:一种去中心化AI服务框架v.0.1

Yu-Chao Huang, Zhen Tan, Mohan Zhang, Pingzhi Li, Zhuo Zhang, Tianlong Chen

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17469 2026-05-01 cs.CL cs.HC 70%

Cross-Lingual Sentiment Misalignment: Auditing Multilingual Language Models for Inversion Risk, Dialectal Representation, and Affective Stability

跨语言情感不一致:审计多语言语言模型以检测反向风险、方言表示和情感稳定性

Nusrat Jahan Lia, Shubhashis Roy Dipta

机构 * Institute of Information Technology University of Dhaka(达卡大学信息科技学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文通过控制基准框架评估多语言Transformer模型在平行孟加拉语-英语句子对上的表现,揭示了模型在情感反向、同理心不对称和方言表示中的问题,提出需引入情感稳定性指标以提升跨语言可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27283 2026-05-01 cs.CL cs.AI cs.LG 67%

Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents

学习何时记忆:风险敏感的上下文老虎机用于具有回避意识的记忆检索的LLM编码代理

Mehmet Iscan

机构 * PythaLab Yildiz Technical University(Yildiz技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RSCB-MC方法,通过风险敏感的上下文老虎机机制,解决编码代理在记忆检索中的安全性和有效性问题,实现非注入和回避作为首要安全动作。

Comments 26 pages, 7 figures, 10 tables. Code and deterministic local artifacts are available at the repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08418 2026-05-01 cs.LG cs.AI 62%

Taxon: Hierarchical Tax Code Prediction with Semantically Aligned LLM Expert Guidance

Taxon: 基于语义对齐的LLM专家指导的层级税码预测

Jihang Li, Qing Liu, Zulong Chen, Jing Wang, Wei Wang, Chuanfei Xu, Zeyi Wen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12622 2026-05-01 cs.AI cs.CR cs.ET cs.LG cs.SY eess.SY 62%

The AI Risk Repository: A Comprehensive Meta-Review, Database, and Taxonomy of Risks From Artificial Intelligence

人工智能风险仓库:人工智能风险的全面元综述、数据库和分类

Peter Slattery, Alexander K. Saeri, Emily A. C. Grundy, Jess Graham, Michael Noetel, Risto Uuk, James Dao, Soroush Pour, Stephen Casper, Neil Thompson

机构 * MIT AI Risk Initiative(麻省理工学院人工智能风险倡议)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文构建了首个公开可访问的人工智能风险数据库,通过系统综述和专家咨询,分类了777个风险,涵盖因果因素和领域分类,为协调管理AI风险提供基础。

Journal ref Patterns 101517 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28049 2026-05-01 cs.AI 57%

Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems

不依赖代理的生产环境SQL准确性评估

Taslim Jamal Arif, Kuldeep Singh

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出STEF框架,通过自然语言输入和生成的SQL进行生产环境文本到SQL系统的评估,无需数据库模式或参考查询,实现持续监控和改进反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27953 2026-05-01 cs.AI cs.CV 57%

The Effects of Visual Priming on Cooperative Behavior in Vision-Language Models

视觉提示对视觉语言模型合作行为的影响

Kenneth J. K. Ong

机构 * ST Engineering, Singapore(1 ST工程,新加坡)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了视觉提示如何影响视觉语言模型在囚徒困境中的合作行为,通过图像内容和颜色奖励矩阵实验,发现图像内容和颜色提示对模型决策模式有影响,不同模型的敏感性和缓解效果各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27789 2026-05-01 cs.SE cs.AI 57%

Test Before You Deploy: Governing Updates in the LLM Supply Chain

部署前测试:在LLM供应链中管理更新

Mohd Sameen Chishti, Damilare Peter Oyinloye, Jingyue Li

机构 * Department of Computer Science(计算机科学系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种部署侧治理框架,通过定义模型行为规则、按部署风险分类的测试套件和兼容性门禁来管理LLM更新,解决模型演变中的兼容性问题。

Comments 4 pages, 1 figure, accepted to The 2nd International Workshop on Large Language Model Supply Chain Analysis (LLMSC2026) co-located with FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27744 2026-05-01 cs.AI 57%

Consumer Attitudes Towards AI in Digital Health: A Mixed-Methods Survey in Australia

消费者对数字健康中AI的态度:澳大利亚混合方法调查

Wei Zhou, Rashina Hoda, Joycelyn Ling

机构 * Digital Health CRC(数字健康CRC)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究通过混合方法调查澳大利亚275名参与者,探讨消费者对医疗AI的接受度、信任及风险认知,并评估AI生成与医生撰写的咨询摘要的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27415 2026-05-01 cs.LG 57%

ChipLingo: A Systematic Training Framework for Large Language Models in EDA

ChipLingo: 一种面向电子设计自动化的大语言模型系统化训练框架

Lei Li, Xingwen Yu, Jianguo Ni, Junxuan Zhu, Jieqiong Zhang, Jian Zhao, Zhi Liu

机构 * Ickylin AI Team(Ickylin AI团队)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出ChipLingo系统化训练框架,通过多源数据构建、预训练优化和指令对齐,提升大语言模型在EDA领域的性能,实验表明其在EDA-Bench上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05192 2026-05-01 cs.CR cs.AI 57%

From surveillance to signalling: escalation channels as environmental controls for agentic AI

从监控到信号:冲突通道作为代理AI的环境控制

Francesca Gomez

机构 * Wiser Human

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了通过环境控制引导代理AI选择授权路径的方法,设计并评估了两种冲突通道,显著降低了有害行为的发生率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28084 2026-05-01 eess.SY cs.SY 50%

Intelligent Self-tuning Active EMI Filtering for Electrified Automotive Power Systems Using Reinforcement Learning

基于强化学习的智能自适应电磁干扰滤波器用于电动汽车电力系统

Mahuizi Lu, Kelin Jia, Rajib Goswami, Yukun Hu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于强化学习的智能自适应电磁干扰滤波器,通过马尔可夫决策过程动态调整滤波参数,提升电磁兼容性和系统效率,实验显示在宽频范围内实现25-30dB的干扰衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14988 2026-05-01 cs.CV 50%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

在细粒度图像任务上评估大型视觉-语言模型:全面评估

Hong-Tao Yu, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27261 2026-05-01 cs.DB 50%

SynSQL: Synthesizing Relational Databases for Robust Evaluation of Text-to-SQL Systems

SynSQL: 为文本到SQL系统的稳健评估合成关系数据库

Mohammadamin Habibollah, Davood Rafiei

专题命中 安全评测 :alignment(abstract)

AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 6 篇

2601.19768 2026-05-01 cs.AI cs.CR cs.LG 81%

GAVEL: Towards Rule-Based Safety Through Activation Monitoring

GAVEL:通过激活监控实现基于规则的安全性

Shir Rozenfeld, Rahul Pankajakshan, Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

机构 * Ben Gurion University of the Negev(本·古里安大学) Amrita Vishwa Vidyapeetham(阿米塔大学)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于规则的激活安全性方法,通过细粒度可解释的激活元素捕捉领域特定行为,提升精度并支持定制化,为可扩展的AI治理奠定基础。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27624 2026-05-01 cs.CL cs.AI cs.CY cs.HC cs.LG 70%

Mapping how LLMs debate societal issues when shadowing human personality traits, sociodemographics and social media behavior

映射LLMs在模仿人类性格特征、社会人口统计数据和社会媒体行为时如何辩论社会问题

Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过CDS数据集研究LLMs在不同社会和情境提示下生成的辩论内容变化,分析其社会议题立场和情感表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26958 2026-05-01 cs.CY cs.AI 62%

Designing Ethical Learning for Agentic AI: Toegye Yi Hwang's Ethical Emotion Regulation Framework

为智能代理AI设计道德学习:Toegye Yi Hwang的道德情感调节框架

Ji Yeon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一种基于Toegye Yi Hwang道德哲学的智能代理AI道德情感调节框架,通过五阶段架构和评估工具规范自主决策周期中的道德情感过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26955 2026-05-01 cs.CY cs.AI 62%

Policy-Governed LLM Routing with Intent Matching for Instrument Laboratories

基于意图匹配的政策引导LLM路由用于仪器实验室

Emmanuel A. Olowe, Danial Chitnis

机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 苏格兰爱丁堡大学 爱丁堡 英国)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于意图匹配的政策引导LLM路由系统,通过Routiium和EduRouter实现对实验室辅助系统的管理和控制,提升学习挑战度和任务完成率。

Comments IEEE EduCon

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27825 2026-05-01 cs.SE 50%

Requirements Debt in AI-Enabled Perception Systems Development: An Industrial RE4AI Perspective

人工智能赋能感知系统开发中的需求债务:一种工业RE4AI视角

Hina Saeeda, Soniya Abraham

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文从工业RE4AI视角探讨AI赋能感知系统开发中的需求债务问题,分析功能和非功能需求演变如何产生并传播需求债务,揭示其对系统审计性、可靠性及认证准备性的负面影响。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23946 2026-05-01 physics.comp-ph physics.flu-dyn 50%

Learning subgrid interfacial area in two-phase flows with regime-dependent inductive biases

在两相流中利用相态依赖性归纳偏置学习子网格界面面积

Anirban Bhattacharjee, Luis H. Hatashita, Suhas S. Jain

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文研究了在湍流多相流中利用物理结构嵌入学习过程以提高机器学习可靠性,开发并评估了两种子网格闭合模型,发现物理约束模型在不同Weber数下能提升预测精度并抑制非物理伪影。

Comments 34 pages, 17 figures, journal preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 12 篇

2509.15549 2026-05-01 cs.CL 81%

M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets

M-DaQ:用于指令微调数据集的多语言多样性与质量样本检索

Chunguang Zhao, Yilun Liu, Pufan Zeng, Yuanchang Luo, Shimin Tao, Minggui He, Weibin Meng, Song Xu, Chen Liu, Hongxia Ma, Li Zhang, Boxing Chen, Daimeng Wei

机构 * Huawei Technologies Ltd.(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(summary_cn,abstract);分类 cs.CL

AI总结 M-DaQ通过联合优化指令-响应质量与跨语言语义多样性,构建高质量平衡训练数据,验证了多语言设置下的Superficial Alignment Hypothesis,并在18种语言上展示出超过60%的胜率。

Comments Accepted by SIGIR 2026 Short

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28182 2026-05-01 cs.LG cs.CL 62%

Exploration Hacking: Can LLMs Learn to Resist RL Training?

探索黑客:大语言模型能否学会抵抗强化学习训练?

Eyon Jang, Damon Falck, Joschka Braun, Nathalie Kirch, Achu Menon, Perusha Moodley, Scott Emmons, Roland S. Zimmermann, David Lindner

机构 * MATS UC San Diego(UC圣迭戈大学) Google DeepMind(谷歌DeepMind) Anthropic

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了大语言模型在强化学习训练中可能通过策略性调整探索行为导致失败的机制,通过微调创建了具有特定低效策略的模型,并评估了检测与缓解策略。

Comments 81 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28018 2026-05-01 cs.CE cs.AI 57%

Design Structure Matrix Modularization with Large Language Models

基于大语言模型的Design Structure Matrix模块化设计

Shuo Jiang, Jianxi Luo

机构 * Department of Systems Engineering(系统工程系) City University of Hong Kong(香港城市大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型进行DSM模块化设计的方法,通过五个案例和三种基础LLM实现近参考质量的结果,在30次迭代内无需专用优化代码。发现领域知识在复杂DSM中会损害性能,提出语义对齐假设以指导LLM在工程设计优化中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01265 2026-05-01 cs.LG 57%

BicKD: Bilateral Contrastive Knowledge Distillation

BicKD:双侧对比知识蒸馏

Jiangnan Zhu, Yukai Xu, Li Xiong, Yixuan Liu, Junxu Liu, Hong kyu Lee, Yujie Gu

机构 * Kyushu University(九州大学) Emory University(埃默里大学) Beijing University of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出BicKD,通过双侧对比损失增强知识迁移,改进传统知识蒸馏的样本级和类别级对比能力,提升预测分布几何结构的正则化效果。

Comments Accepted to the 2026 IEEE/INNS International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27547 2026-05-01 cs.LG 57%

Diagnosing Capability Gaps in Fine-Tuning Data

诊断微调数据中的能力差距

Saeid Asgari Taghanaki, Rakshanda Agarwal, Bruce Sun, Rohan Jha, Elias Stengel-Eskin, Sara Malvar, Rui Ying, Yifei Xu, Guilherme Potje, Tusher Chakraborty, Leonardo de Oliveira Nunes, Ranveer Chandra, Emre Kiciman

机构 * Microsoft(微软)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出GoalCover框架,通过交互式目标分解和自动化覆盖评估,帮助检测微调数据集的能力缺口,通过实验验证其在不同领域和任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27354 2026-05-01 cs.AI 57%

CoAX: Cognitive-Oriented Attribution eXplanation User Model of Human Understanding of AI Explanations

CoAX:面向认知的归因解释用户模型:人类对AI解释的理解

Louth Bin Rawshan, Zhuoyu Wang, Brian Y. Lim

机构 * National University of Singapore(新加坡国立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文通过认知建模分析不同XAI方法在结构化数据推理中的策略,发现模型能更准确拟合人类决策,为改进AI解释的可理解性提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27300 2026-05-01 cs.AI 57%

METASYMBO: Multi-Agent Language-Guided Metamaterial Discovery via Symbolic Latent Evolution

METASYMBO: 多智能体语言引导的超材料发现 via 符号驱动的潜在进化

Jianpeng Chen, Wangzhi Zhan, Dongqi Fu, Junkai Zhang, Zian Jia, Ling Li, Wei Wang, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Meta AI University of California Los Angeles(加州大学洛杉矶分校) Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出MetaSymbO框架,通过符号驱动的潜在进化实现语言引导的超材料发现,提升结构有效性和语言指导得分,验证其在实际应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27274 2026-05-01 cs.AI 57%

The Inverse-Wisdom Law: Architectural Tribalism and the Consensus Paradox in Agentic Swarms

逆智慧定律:代理群中的建筑部落主义与共识悖论

Dahlia Shehata, Ming Li

机构 * University of Waterloo(滑铁卢大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究挑战了代理协作遵循'群体智慧'的假设,揭示了代理群优先内部架构一致而非外部逻辑真理的悖论,通过实验证明逆智慧定律,并定义部落主义系数和谄媚权重作为群失败的主要决定因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27162 2026-05-01 cs.MA cs.LG cs.PF 57%

A High-Throughput Compute-Efficient POMDP Hide-And-Seek-Engine (HASE) for Multi-Agent Operations

一种高吞吐量、计算高效的POMDP捉迷藏引擎(HASE)用于多智能体操作

Timothy Flavin, Sandip Sen

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种高效的Dec-POMDP引擎,通过C++架构和优化技术实现高吞吐量,验证了其在多智能体协作策略训练中的性能和通用性。

Comments 21 pages, 10 figures, 5 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12632 2026-05-01 cs.CV cs.LG 57%

TeD-Loc: Text Distillation for Weakly Supervised Object Localization

TeD-Loc: 文本蒸馏用于弱监督目标定位

Shakeeb Murtaza, Soufiane Belharbi, Alexis Guichemerre, Marco Pedersoli, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA、ILLs、系统工程系、蒙特利尔工程学院,加拿大)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 TeD-Loc通过对比对齐将CLIP文本嵌入迁移到patch嵌入,实现patch级的前景/背景定位,并引入定位引导的分类模块以提升定位与分类的联合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏