arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2606.07520 2026-06-09 cs.CL cs.LG 新提交 76%

TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles

TinyJudge: 通过轻量级专家集成实现不可验证约束对齐

Yirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Qixun Zhang, Yuxiang He, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology SCIR Lab(哈尔滨工业大学SCIR实验室) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.LG

AI总结 针对LLM遵循不可验证约束时奖励黑客和计算开销大的问题,提出TinyJudge框架,利用多个小型语言模型集成提供奖励,在五个基准上平均性能提升约10%,奖励精度提升12%,训练速度提升3倍。

Comments ACL 2026 Main Conference;15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07309 2026-06-08 cs.SD cs.AI cs.CL 新提交 76%

Acoustic Cue Alignment in Audio Language Models for Speech Emotion Recognition

语音情感识别中音频语言模型的声学线索对齐

Iosif Tsangko, Andreas Triantafyllopoulos, Björn W. Schuller

机构 * DFG's Reinhart Koselleck project(德国科研基金Reinhart Koselleck项目) EU H2020 project(欧盟H2020项目)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

AI总结 研究音频语言模型中显式声学线索的对齐性,通过eGeMAPS特征提取六种可解释声学概念标记,发现对齐标记提升UAR,而错乱标记降低性能,模型对符号线索敏感但仍部分依赖音频信号。

Comments 6 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02444 2026-06-02 cs.AI cs.CL 76%

Food Noise & False Safety: A Systematic Evaluation of How LLMs Fail to Adapt to Eating Disorder Queries with Clinician Feedback

食物噪音与虚假安全:系统评估LLMs如何在临床医生反馈下未能适应饮食障碍查询

Giulia Pucci, Emily Hemendinger, Ruizhe Li, Gavin Abercrombie, Tanvi Dinkar, Arabella Sinclair

机构 * University of Aberdeen(阿伯丁大学) University of Colorado Anschutz(科罗拉多大学安舒茨分校) Heriot-Watt University(赫里奥特-瓦特大学) University College London(伦敦大学学院)

专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI

AI总结 本研究通过与临床饮食障碍专家合作,系统评估了大型语言模型在处理饮食障碍用户查询时,因不加批判地适应不安全或自伤请求而可能产生的危害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01584 2026-06-02 cs.CL cs.AI 76%

Identifying High-Confidence Social Biases in LLMs for Trustworthy Conversational Tutoring Agents

识别LLM中高置信度的社会偏见以构建可信的对话辅导代理

Aitor Arronte Alvarez, Naiyi Xie Fincham

机构 * University of Hawaii at Manoa(夏威夷大学马诺亚分校)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 本研究通过生成对话数据集,评估大型语言模型在辅导场景中检测社会偏见的能力,发现模型在对话上下文中比基准测试更难检测偏见,且对错误判断过度自信,影响推理和反馈。

Comments Accepted for AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17246 2026-05-19 cs.LG cs.AI 76%

Fidelity Probes for Specification--Code Alignment

规范-代码对齐的保真度探针

Ferhat Erata, Hao Zhou, Luke Huan

机构 * AWS Agentic AI(AWS智能AI)

专题命中 安全评测 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出保真度探针,通过从参考artifact生成的自然语言问题和代码派生的地面真实答案,从候选规范中回答问题。保真度是同意探针的比例,分解为矛盾率和覆盖缺口率,驱动针对性的规范编辑以达到收敛。在15个程序、约12000行COBOL基准(AWS CardDemo)上,通过八次迭代将冻结测试规范的保真度从0.63提升到0.94,其中平台位置由仅需四次速率数据的两状态马尔可夫固定点$F^\dagger$预测。探针来自LLM读取代码或静态分析管道对其控制流、数据流和系统依赖图的处理,具有可调混合比例。一个带有冻结留出集的探针重采样协议提供了Hoeffding有界的过拟合判别;我们测量的训练/测试差距保持在该包络线下一个数量级。三种基于图的混合提升了保真度16到30分;跨分布评估显示LLM和符号通道在经验上互补。在五个独立LLM家族(Anthropic、DeepSeek、Google、Alibaba、OpenAI)上进行的跨家族生成器扫描确认了收敛行为不依赖于任何单一模型家族:五个非Claude生成器中有三个产生了与马尔可夫固定点预测一致的轨迹,而冻结测试协议主动否定了两个探针分布随迭代变化的生成器。该方法适用于任何应描述相同行为的artifact对。

Comments 29 pages, 14 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01567 2026-05-05 cs.SE cs.CL cs.LG 76%

Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture

反馈归一化的开发者内存用于强化学习编码代理:一种安全门控MCP架构

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University, Istanbul, Türkiye(PythaLab,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 安全评测 :safety(title);分类 cs.CL、cs.LG

AI总结 本文提出RL Developer Memory架构,通过归一化反馈和安全门控机制提升强化学习编码代理的内存管理,实验证明其在确定性任务中的有效性。

Comments 25 pages, 5 figures, 7 tables. Preprint. Implementation and supplementary artifacts are available at the project repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23121 2026-04-17 cs.CL cs.AI 76%

Uncovering the Fragility of Trustworthy LLMs through Chinese Textual Ambiguity

通过中文文本歧义揭示可信大语言模型的脆弱性

Xinwei Wu, Haojie Li, Hongyu Liu, Xinyu Ji, Ruohan Li, Yule Chen, Yigeng Zhang

机构 * Chalmers University of Technology(楚德斯技术大学)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型在处理中文歧义文本时的脆弱性,通过创建基准数据集发现模型在歧义处理上存在显著缺陷,影响实际应用。

Comments Accepted at KDD workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models (Agentic & GenAI Evaluation Workshop KDD '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08986 2026-04-13 cs.CL cs.AI 76%

PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment

PerMix-RLVR: 在可验证奖励对齐下保持人物表达性

Jihwan Oh, Soowon Oh, Murad Aghazada, Minchan Jeong, Sungnyun Kim, Se-Young Yun

机构 * KAIST AI(韩国科学技术院人工智能系) Samsung Advanced Institute of Technology(三星高级技术研究院) Seoul National University(首尔国立大学)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

AI总结 本文提出PerMix-RLVR方法,通过训练阶段处理人物敏感性,平衡模型在不同人物设定下的鲁棒性和表现真实性,提升任务性能和人物表达 fidelity。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26683 2026-03-31 cs.IR cs.AI cs.CL cs.CV 76%

LITTA: Late-Interaction and Test-Time Alignment for Visually-Grounded Multimodal Retrieval

LITTA:晚期交互与测试时对齐用于视觉接地多模态检索

Seonok Kim

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

AI总结 LITTA通过查询扩展提升多模态文档检索,利用晚期交互评分和反向排名融合提高检索鲁棒性,适用于计算机科学、制药和工业手册等多领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL 76%

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22097 2026-03-24 cs.AI cs.LG 76%

SpecTM: Spectral Targeted Masking for Trustworthy Foundation Models

SpecTM:用于可信基础模型的频谱定向遮蔽

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

AI总结 本文提出SpecTM,一种结合物理约束的遮蔽设计,通过预训练时利用交叉频谱上下文重建目标波段,提升EO领域基础模型的可信度和可解释性。

Comments Accepted to IEEE IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19532 2026-03-23 cs.CL cs.IR cs.LG 76%

EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models

EvidenceRL: 为可信语言模型强化证据一致性

J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Pekin University(培根大学)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.LG

AI总结 EvidenceRL通过强化学习框架在训练中强制证据遵循,提升语言模型在医疗诊断和法律推理中的证据接地和可信度,同时保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13455 2026-02-17 cs.CL cs.AI cs.HC 76%

Using Machine Learning to Enhance the Detection of Obfuscated Abusive Words in Swahili: A Focus on Child Safety

利用机器学习增强斯瓦希里语中隐晦侮辱性词汇的检测:聚焦儿童安全

Phyllis Nabangi, Abdul-Jalil Zakaria, Jema David Ndibwile

专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI

AI总结 本研究利用机器学习方法提升斯瓦希里语中隐晦侮辱性词汇的检测能力,旨在提高儿童网络环境的安全性。

Comments Accepted at the Second IJCAI AI for Good Symposium in Africa, hosted by Deep Learning Indaba, 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07414 2026-02-10 cs.AI cs.CL 76%

Can LLMs Truly Embody Human Personality? Analyzing AI and Human Behavior Alignment in Dispute Resolution

LLMs真的能体现人类个性吗?分析AI与人类行为在纠纷解决中的对齐

Deuksin Kwon, Kaleen Shrestha, Bin Han, Spencer Lin, James Hale, Jonathan Gratch, Maja Matarić, Gale M. Lucas

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

AI总结 本文研究LLMs在模拟人类人格驱动的冲突行为方面的有效性,通过评估框架和数据集方法,揭示LLMs在纠纷解决中与人类行为的显著差异。

Comments AAAI 2026 (Special Track: AISI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00078 2026-02-03 cs.CY cs.AI 76%

Standards for trustworthy AI in the European Union: technical rationale, structural challenges, and an implementation path

欧盟可信人工智能标准:技术依据、结构性挑战及实施路径

Piercosma Bisconti, Marcello Galisai

机构 * Department of Computer, Control and Management Engineering(计算机、控制与管理工程系) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.CY

AI总结 本文提出欧盟人工智能标准化的实施路径,强调通过分层方法和风险管理体系,实现技术标准与法律义务的对接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21900 2026-02-03 cs.CV cs.AI cs.CY cs.MM 76%

TraceRouter: Robust Safety for Large Foundation Models via Path-Level Intervention

TraceRouter: 通过路径级干预实现大型基础模型的鲁棒安全性

Chuancheng Shi, Shangze Li, Wenjun Lu, Wenhua Wu, Cong Wang, Zifeng Cheng, Fei Shen, Tat-Seng Chua

机构 * The University of Sydney, Sydney, Australia(悉尼大学) Nanjing University of Science(南京理工大学) Nanjing University, Nanjing, China(南京大学) National University of Singapore, Singapore, Singapore(新加坡国立大学)

专题命中 安全评测 :safety(title);分类 cs.AI、cs.CY

AI总结 TraceRouter通过路径级干预有效切断有害语义的因果传播,提升大型基础模型的对抗鲁棒性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23845 2026-01-26 cs.CL cs.AI 76%

CRADLE Bench: A Clinician-Annotated Benchmark for Multi-Faceted Mental Health Crisis and Safety Risk Detection

CRADLE Bench: 一种多维心理健康危机和安全风险检测的临床标注基准

Grace Byun, Rebecca Lipschutz, Sean T. Minton, Abigail Lott, Jinho D. Choi

机构 * Emory University, Department of Computer Science(埃默里大学计算机科学系) Emory University, Department of Psychiatry and Behavioral Sciences(埃默里大学精神病学与行为科学系)

专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI

AI总结 CRADLE Bench通过多维危机检测基准,结合临床标准和时间标签,提升语言模型对心理健康危机和安全风险的识别能力。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10645 2025-12-09 cs.LG cs.AI 76%

Trustworthy Retrosynthesis: Eliminating Hallucinations with a Diverse Ensemble of Reaction Scorers

可信的逆合成:通过多样化的反应评分器消除幻觉

Michal Sadowski, Tadija Radusinović, Maria Wyrzykowska, Lukasz Sztukiewicz, Jan Rzymkowski, Paweł Włodarczyk-Pruszyński, Mikołaj Sacha, Piotr Kozakowski, Ruard van Workum, Stanislaw Kamil Jastrzebski

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

AI总结 RetroTrim通过多样化反应评分策略有效消除逆合成中的幻觉,实现高质量路径生成,解决药物类似物领域中的合成计划可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04184 2025-11-07 cs.CL cs.AI 76%

Trustworthy LLM-Mediated Communication: Evaluating Information Fidelity in LLM as a Communicator (LAAC) Framework in Multiple Application Domains

Mohammed Musthafa Rafi, Adarsh Krishnamurthy, Aditya Balu

机构 * Iowa State University(爱荷华州立大学)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

Comments 10 pages, 4 figures. Submitted to IEEE DISTILL 2025 (co-located with IEEE TPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03665 2025-11-04 cs.LG cs.AI 76%

A DbC Inspired Neurosymbolic Layer for Trustworthy Agent Design

Claudiu Leoveanu-Condrei

机构 * ExtensityAI

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08525 2025-10-31 cs.LG cs.AI 76%

A mathematical certification for positivity conditions in Neural Networks with applications to partial monotonicity and Trustworthy AI

Alejandro Polo-Molina, David Alfaya, Jose Portela

机构 * CDTI

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments 16 pages, 4 figures

Journal ref IEEE Transactions on Neural Networks and Learning Systems, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09090 2025-10-13 cs.CY cs.AI 76%

AI and Human Oversight: A Risk-Based Framework for Alignment

Laxmiraju Kandikatla, Branislav Radeljic

专题命中 安全评测 :alignment(title);分类 cs.AI、cs.CY

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08608 2025-10-13 cs.CL cs.AI 76%

MMA-ASIA: A Multilingual and Multimodal Alignment Framework for Culturally-Grounded Evaluation

Weihua Zheng, Zhengyuan Liu, Tanmoy Chakraborty, Weiwen Xu, Xiaoxue Gao, Bryan Chen Zhengyu Tan, Bowei Zou, Chang Liu, Yujia Hu, Xing Xie, Xiaoyuan Yi, Jing Yao, Chaojun Wang, Long Li, Rui Liu, Huiyao Liu, Koji Inoue, Ryuichi Sumida, Tatsuya Kawahara, Fan Xu, Lingyu Ye, Wei Tian, Dongjun Kim, Jimin Jung, Jaehyung Seo, Nadya Yuki Wangsajaya, Pham Minh Duc, Ojasva Saxena, Palash Nandi, Xiyan Tao, Wiwik Karlina, Tuan Luong, Keertana Arun Vasan, Roy Ka-Wei Lee, Nancy F. Chen

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Agency for Science, Technology and Research, Singapore(新加坡科技研究局) Indian Institute of Technology Delhi(印度理工学院德里分校) Alibaba DAMO Academy(阿里巴巴达摩院) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Inner Mongolia University(内蒙古大学) Kyoto University(京都大学) Jiangxi Normal University(江西师范大学) Korea University(韩国大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08429 2025-10-10 cs.LG cs.AI stat.ML 76%

ClauseLens: Clause-Grounded, CVaR-Constrained Reinforcement Learning for Trustworthy Reinsurance Pricing

Stella C. Dong, James R. Finlay

机构 * Department of Applied Mathematics, University of California, Davis, CA, USA(加州大学戴维斯分校应用数学系) Wharton School of Business, University of Pennsylvania, Philadelphia, PA, USA(宾夕法尼亚大学沃顿商学院)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments Accepted for publication at the 6th ACM International Conference on AI in Finance (ICAIF 2025), Singapore. Author-accepted version (October 2025). 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14756 2025-10-10 cs.LG cs.AI 76%

LLINBO: Trustworthy LLM-in-the-Loop Bayesian Optimization

Chih-Yu Chang, Milad Azvar, Chinedum Okwudire, Raed Al Kontar

机构 * University of Michigan(密歇根大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19120 2025-09-24 cs.LG cs.AI cs.DC 76%

FedFiTS: Fitness-Selected, Slotted Client Scheduling for Trustworthy Federated Learning in Healthcare AI

Ferdinand Kahenga, Antoine Bagula, Sajal K. Das, Patrick Sello

机构 * Department of Computer Science University of the Western Cape(计算机科学系,西开普敦大学) Department of Computer Science Missouri University of Science and Technology(计算机科学系,密苏里科学与技术大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15959 2025-09-22 cs.HC cs.AI cs.CY 76%

Explainable AI for Maritime Autonomous Surface Ships (MASS): Adaptive Interfaces and Trustworthy Human-AI Collaboration

Zhuoyue Zhang, Haitong Xu

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17764 2025-09-22 cs.CL cs.AI math.ST stat.TH 76%

BBScoreV2: Learning Time-Evolution and Latent Alignment from Stochastic Representation

Tianhao Zhang, Zhecheng Sheng, Zhexiao Lin, Chen Jiang, Dongyeop Kang

机构 * University of Minnesota, Twin Cities(明尼苏达大学,双城分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12233 2025-09-17 cs.CR cs.AI cs.ET cs.LG cs.NI 76%

Towards Trustworthy Agentic IoEV: AI Agents for Explainable Cyberthreat Mitigation and State Analytics

Meryem Malak Dif, Mouhamed Amine Bouchiha, Abdelaziz Amara Korba, Yacine Ghamri-Doudane

机构 * L3i - La Rochelle University, La Rochelle, France(L3i - 拉罗谢尔大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

Comments 10 pages, 7 figures, Accepted at LCN'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06902 2025-09-09 cs.CL cs.CR cs.DB cs.LG 76%

Proof-Carrying Numbers (PCN): A Protocol for Trustworthy Numeric Answers from LLMs via Claim Verification

Aivin V. Solatorio

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏