arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-26 至 2026-05-26 共收录 170 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 10 篇

2605.04700 2026-05-26 cs.CR cs.AI cs.CL cs.LG cs.SD 80%

Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization

稀疏令牌足矣:通过令牌感知梯度优化越狱音频语言模型

Zheng Fang, Xiaosen Wang, Shenyi Zhang, Shaokang Wang, Zhijin Ge

机构 * Wuhan University Institute for Math \& AI, Wuhan University Huazhong University of Science Shanghai Jiao Tong University Xidian University

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出令牌感知梯度优化(TAGO)方法,通过仅保留高梯度能量的音频令牌对应的波形梯度,实现稀疏越狱攻击,在保持高成功率的同时大幅减少优化量。

Comments To appear in the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24834 2026-05-26 cs.CR cs.AI 70%

Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

Reflect-Guard: 通过逻辑自我反思增强大语言模型对对抗性提示的防护

Lixing Lin, Juli You, Yue Li, Luyun Lin, Yiqing Wang, Zhen Zhang, Moxuan Zheng

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学) Citigroup(摩根大通) Independent Researcher(独立研究者)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出Reflect-Guard方法,通过参数高效微调为大语言模型安全分类器注入链式思维自我反思能力,显著提升对对抗性越狱攻击的检测性能。

Comments 12 pages, 2 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14605 2026-05-26 cs.CR cs.AI cs.LG 62%

One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries

一步之遥:为什么针对恶意微调的防御在自适应对手面前失败

Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

机构 * Ben-Gurion University of the Negev(贝纳-约瑟夫大学) Amrita Vishwa Vidyapeetham(阿米塔维莎瓦迪耶佩塔)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析15种近期防御机制,发现它们共享一个弱点:仅掩盖或误导有害行为路径而未消除行为本身,并开发了一种统一的自适应攻击,成功突破了所有防御机制。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红队测试 1 篇

2605.25066 2026-05-26 quant-ph cs.CR cs.LG 57%

QML-PipeGuard: Drift-Aware Behavioral Fingerprinting for Quantum Machine Learning Pipeline Integrity

QML-PipeGuard:面向量子机器学习管道完整性的漂移感知行为指纹识别

Esra Yeniaras

机构 * Quantum Security and Post-Quantum Cryptography Researcher(量子安全与后量子密码学研究员)

专题命中 红队测试 :safety(abstract);分类 cs.LG

AI总结 提出QML-PipeGuard框架,通过行为指纹和基于合约的监测机制,同时应对量子机器学习管道中的硬件漂移和恶意信道替换威胁。

Comments 54 pages, 12 Tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 提示注入 5 篇

2605.25415 2026-05-26 cs.CL cs.CY cs.ET 84%

LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

LLM-as-a-Reviewer: 基准测试它们作为论文审稿人的能力、分歧和提示注入抵抗性

Lingyao Li, Junjie Xiong, Changjia Zhu, Runlong Yu, Chen Chen, Junyu Wang, Renkai Ma, Zhicong Lu

机构 * University of South Florida(佛罗里达南大学) Missouri University of Science and Technology(密苏里科技大学) University of Alabama(阿拉巴马大学) Florida International University(佛罗里达国际大学) University of Cincinnati(辛辛那提大学) George Mason University(乔治·梅森大学)

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究通过一个系统基准测试,评估了12个大型语言模型在论文评审中的表现,包括评分校准、与人类审稿人的分歧以及对不可见字体映射攻击的抵抗性,发现LLMs存在系统性高估弱论文、与人类关注点不同以及易受提示注入攻击等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24659 2026-05-26 cs.LG 79%

IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization

IterInject: 通过反馈引导的迭代优化实现对LLM智能体的间接提示注入

Zixuan Chen, Jiaxiang Chen, Li Luo, Ke Xu, Xiaoxiang Huang, Tanfeng Sun, Xinghao Jiang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 提出IterInject框架,通过规则诊断器和LLM优化器迭代优化对抗载荷,实现对LLM智能体的间接提示注入攻击,在多个基准和实际系统中显著优于现有方法,并揭示了注意力介导的阈值机制。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24421 2026-05-26 cs.CR cs.LG 79%

Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content

毒害瞭望塔:通过对抗性日志内容对LLM增强的安全运营进行提示注入攻击

Rohan Pandey, Archit Bhujang

机构 * DigitalOcean Arizona State University(亚利桑那州立大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG

AI总结 研究攻击者控制的日志字段如何向LLM注入指令(日志基底提示注入),提出四类攻击分类,并评估不同防御下的攻击成功率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04653 2026-05-26 cs.CR cs.LG 61%

Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise

通过聊天模板的推理时后门:从LLM供应链到代理系统妥协

Ariel Fogel, Omer Hofman, Eilon Cohen, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究)

专题命中 提示注入 :prompt injection(abstract);分类 cs.LG;trustworthy(comments)

AI总结 提出一种通过恶意修改聊天模板实现推理时后门攻击的方法,无需修改模型权重或训练数据,在LLM、代理和多代理系统层面均能成功攻击,且能绕过现有防御。

Comments V3: Accepted to ICLR 2026 Trustworthy AI Workshop, V4: Submitted to CCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25871 2026-05-26 cs.SE cs.CR 50%

How Agentic AI Coding Assistants Become the Attacker's Shell

自主AI编码助手如何成为攻击者的Shell

Yue Liu, Yanjie Zhao, Yunbo Lyu, Ting Zhang, Haoyu Wang, David Lo

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文研究了自主AI编码助手因依赖未审查外部工件而面临提示注入攻击的风险,分析了攻击机制、流行程度、现有防御的局限,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 9 篇

2605.24286 2026-05-26 cs.LG cs.CL 73%

Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning

忠实性作为信息流:评估与训练忠实的链式思维推理

Jinghan Jia, Joe Benton, Eric Easley

机构 * Dept. CSE, Michigan State University(密歇根州立大学计算机科学系) Anthropic

专题命中 幻觉与事实性 :safety(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 通过信息流视角提出基于充分性、完整性和必要性的框架,结合熵、掩码KL和梯度诊断评估链式思维忠实性,并引入更新时干预(如注意力掩码、反向梯度掩码等)训练更忠实的推理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23938 2026-05-26 cs.AI cs.CY cs.LG 67%

Authority Inversion in LLM-Mediated Ubiquitous Systems: When Models Trust Users Over Sensors

LLM介导的普适系统中的权威倒置:当模型信任用户胜过传感器

Long Zhang, Zi-bo Qin, Wei-neng Chen

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computer Science(计算机科学学院) Engineering, South China University of Technology(华南理工大学工程学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本研究揭示了大语言模型在融合传感器与用户冲突信息时,由于格式依赖性导致数值传感器数据被自然语言用户主张支配的权威倒置现象,并提出了几何框架、审计指标(CIR和AAI)以及推理时层干预方法(GAC)来诊断和缓解该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25120 2026-05-26 cs.CL cs.AI cs.HC 62%

Evidence-Linked Radiology Reporting: A Human-Supervised Reference Architecture for Structured Imaging Intelligence

证据关联放射学报告:面向结构化成像智能的人机协同参考架构

Houman Kazemzadeh, Kamyar Naderi

机构 * Xylemed

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出一种人机协同、证据关联的参考架构,通过结合特定检查模板、语音到结构处理、测量与分割捕获、受控AI辅助起草以及基于DICOM、HL7 FHIR等标准的互操作性,将放射学报告从自由文本转化为结构化智能层,支持审阅报告、纵向比较、临床数据重用及系统集成。

Comments Technical report, 27 pages, 2 figures, 12 tables, 1 listing; reference architecture paper; does not report clinical outcomes or validated diagnostic performance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25110 2026-05-26 cs.CV cs.AI cs.LG 62%

Uncertainty-DTW for Sequences and Visual Tokens

Uncertainty-DTW 用于序列和视觉标记

Lei Wang, Syuan-Hao Li, Yongsheng Gao, Piotr Koniusz

机构 * School of Engineering and Built Environment, Electrical and Electronic Engineering, Griffith University(工程与建筑环境学院,电气与电子工程学院,格里菲斯大学) School of Computer Science and Engineering, University of New South Wales(计算机科学与工程学院,新南威尔士大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出不确定性感知的动态时间规整(uDTW)框架,通过异方差不确定性建模和最大似然估计实现鲁棒对齐,并推广到视觉标记集,在多个领域取得优于现有方法的结果。

Comments Research report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04295 2026-05-26 cs.LG cs.AI 62%

LLMs Uncertainty Quantification via Adaptive Conformal Semantic Entropy

通过自适应共形语义熵进行LLM不确定性量化

Hamed Karimi, Vaishali Meyappan, Reza Samavi

机构 * Toronto Metropolitan University(多伦多 Metropolitan 大学) Vector Institute(向量研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出自适应共形语义熵(ACSE)方法,通过聚类语义熵并自适应调整不确定性分数,结合共形校准实现统计可靠的接受/弃权决策,在多个数据集上优于现有基线。

Comments Accepted for publication in the Proceedings of the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026); 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25566 2026-05-26 cs.AI 57%

Uncertainty Reasoning with Large Language Models for Explainable Disease Diagnosis

基于大语言模型的不确定性推理用于可解释疾病诊断

Xiaoyang Fan, Yufan Cai, Zhe Hou, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) Griffith University(格里菲斯大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 提出一种神经符号推理框架,将大语言模型与模糊逻辑和声明式规则结合,实现可解释且形式可验证的医学诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24977 2026-05-26 cs.CV cs.CL 57%

Universal Boosts, Specific Suppressors: Sparse Autoencoder Steering of Medical Vision-Language Models

通用增强,特定抑制:基于稀疏自编码器引导的医学视觉语言模型

Farhad Nooralahzadeh, Benjamin Gundersen, Nicolas Deperrois, Hidetoshi Matsuom, Mizuho Nishio, Thomas Frauenfelder, Ahmed Allam, Christian Blüthgen, Michael Moor, Michael Krauthammer

机构 * University of Zurich and University Hospital of Zurich(苏黎世大学及苏黎世大学医院) Kobe University(Kobe大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Zurich University of Applied Sciences(苏黎世应用科学大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种无需权重更新的解码时残差引导方法,通过每token稀疏自编码器(SAE)对医学视觉语言模型进行干预,抑制幻觉并提升报告质量,在多个模型上取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25844 2026-05-26 cs.CR cs.DC cs.GT 50%

Proof of Useful Attestation: A Consensus Primitive for Attestation-Native Chains

有用证明证明:一种面向证明原生链的共识原语

Stefan Stefanović

专题命中 幻觉与事实性 :safety(abstract)

AI总结 提出Proof of Useful Attestation (PoUA)共识机制,通过将证明处理质量纳入共识权重,解决通用权益证明链对证明工作漠视的问题,并给出经济成本下界和防御策略。

Comments 62 pages, 9 figures. Reference simulator with 196+ passing tests at https://github.com/ligate-io/ligate-research/tree/main/prototypes/poua-sim

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25524 2026-05-26 cs.CV 50%

ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

ProSR: 面向可靠思维链的过程塑造空间推理方法

Jiangyang Li, Cong Wan, Changjie Wu, Songlin Dong, Lingjun Zhang, Linzhe Shi, Xu Wang, Zhiheng Ma, Hang Zhang, Mu Xu, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团Amap) Tsinghua University(清华大学) Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 针对视觉语言模型在空间推理中存在的虚假基础与尾部不稳定性问题,提出ProSR框架,通过反事实不变性惩罚和尾部漂移惩罚优化推理过程,提升答案准确率及轨迹稳定性与视觉依赖性。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 4 篇

2603.18908 2026-05-26 cs.AI 79%

Characterizing Linear Alignment Across Language Models

表征语言模型间的线性对齐

Matt Gorbett, Suman Jana

机构 * Independent Researcher(独立研究者) Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI

AI总结 研究独立训练的大语言模型间是否存在线性对齐,并探索其在文本生成、嵌入分类、分布外检测及隐私保护跨孤岛推理中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02216 2026-05-26 cs.LG cs.CV 57%

Forgettable Federated Linear Learning with Certified Data Unlearning

具有认证数据遗忘的可遗忘联邦线性学习

Ruinan Jin, Minghui Chen, Qiong Zhang, Xiaoxiao Li

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Renmin University of China(中国人民大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.LG

AI总结 提出一种基于预训练模型线性近似的联邦遗忘框架,通过联邦线性训练实现高效、安全且可认证的客户端数据遗忘。

Comments IEEE Transactions on Neural Networks and Learning Systems

Journal ref IEEE Transactions on Neural Networks and Learning Systems, Early Access, pp. 1-10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24249 2026-05-26 cs.LG 57%

PrivFusion: A Privacy-preserving Multi-Agent Framework for Harmonizing Distributed Datasets

PrivFusion: 一种用于协调分布式数据集的隐私保护多智能体框架

Anisa Halimi, Liubov Nedoshivina, Kieran Fraser, Stefano Braghin

机构 * IBM Research(IBM研究院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 提出PrivFusion框架,通过多智能体自动协调异构结构化数据集,在联邦学习前实现隐私保护的数据对齐,减少人工干预。

Comments Accepted by IEEE CBMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24239 2026-05-26 cs.CR cs.AI 57%

Unlocking Apple's Private Cloud Compute: An Analysis of Privacy-Preserving Artificial Intelligence

解锁苹果的私有云计算:隐私保护人工智能分析

Yannik Dittmar, Marvin Jerome Stephan, Thomas Völkl, Matthias Hollick, Jiska Classen

机构 * Hasso Plattner Institute, University of Potsdam(哈索普兰特纳研究所,波茨坦大学) TU Darmstadt, Secure Mobile Networking Lab(德累斯顿技术大学,安全移动网络实验室) IMDEA Networks Institute, Madrid, Spain(IMDEA网络研究所,马德里,西班牙)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

AI总结 通过逆向工程苹果私有云计算(PCC)在移动设备上的实现,评估其隐私保护特性,并开放非公开接口以支持自定义查询和独立基准测试。

Journal ref Proceedings of the 19th ACM Conference on Security and Privacy in Wireless and Mobile Networks (WiSec 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 53 篇

2605.23989 2026-05-26 cs.AI cs.CL cs.CR 90%

Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security

迈向可信的自主AI:安全性、鲁棒性、隐私与系统安全的全面综述

Jinhu Qi, Muzhi Li, Jiahong Liu, Yuqin Shu, Dianzhi Yu, Shicheng Ma, Wenqian Cui, Yiyang Zhao, Yiyi Chen, Ruoxi Jiang, Irwin King, Zenglin Xu

机构 * Faculty of Engineering, Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学工程学院、计算机科学与工程系) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 安全评测 :trustworthy(title,abstract);safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了自主AI系统在安全鲁棒性与隐私系统安全两个核心维度的风险来源、阶段缓解策略及统一评估指标,并讨论了开放挑战。

Comments 36 pages, 4 figures. Survey/review article on trustworthy agentic AI. Published in Academia AI and Applications, 2026

Journal ref Academia AI and Applications, vol. 2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24962 2026-05-26 cs.CV 89%

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Manjin Kim, Suha Kwak, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科学技术大学)

专题命中 安全评测 :alignment(title,title_cn)

AI总结 提出Tempered Self-Similarity Alignment (TSA)损失函数,通过将视觉基础模型中的时空自相似性关系知识迁移到视频生成模型中,以改善视频的物理合理性。

Comments Accepted to the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21602 2026-05-26 cs.AI cs.SE 83%

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs

基准测试与改进LLMs中的分布外对齐失败监控器

Dylan Feng, Pragya Srivastava, Anca Dragan, Cassidy Laidlaw

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Haize Labs, New York, USA(Haize实验室) Google DeepMind, India(谷歌DeepMind)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 针对大语言模型在分布外情境下的安全与对齐失败问题,提出MOOD基准并证明结合守卫模型与OOD检测器可提升监控召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13608 2026-05-26 cs.LG 83%

Is GPT-4o mini Blinded by its Own Safety Filters? Exposing the Multimodal-to-Unimodal Bottleneck in Hate Speech Detection

GPT-4o mini 是否被自身的安全过滤器蒙蔽?揭示多模态到单模态瓶颈在仇恨言论检测中的作用

Niruthiha Selvanayagam, Ted Kurti

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 本文通过 Hateful Memes Challenge 数据集系统分析 GPT-4o mini 在多模态仇恨言论检测中的安全架构,发现并实验验证了“单模态瓶颈”缺陷,即上下文无关的安全过滤器会优先阻断多模态推理,导致误报。

Comments This paper reports preliminary findings from a small-scale study whose sample size is insufficient to support the stated conclusions. The authors are withdrawing it to conduct a more comprehensive evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10921 2026-05-26 cs.CV cs.AI cs.LG 81%

FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model

FG-CLIP 2: 一种双语细粒度视觉-语言对齐模型

Chunyu Xie, Bin Wang, Fanjing Kong, Jincheng Li, Dawei Liang, Ji Ao, Dawei Leng, Yuhui Yin

机构 * AI Research(360人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出FG-CLIP 2双语视觉语言模型,通过区域-文本匹配、长描述建模和文本内模态对比损失等细粒度监督,在英中双语上实现细粒度对齐,在29个数据集上取得最优结果。

Comments Accepted in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25273 2026-05-26 cs.CY 79%

LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment

LLM-as-a-Judge 在医疗保健中的应用:应用、方法和人类一致性的范围分析

Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu, Steven Bethard

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 本研究通过PRISMA指导的系统综述,分析了LLM-as-a-Judge在医疗保健中的应用场景、技术配置和与人类专家判断的一致性,发现其在临床决策支持、自然语言处理等领域有广泛应用,但可靠性因任务而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22827 2026-05-26 cs.CV cs.LG 79%

FairJudge: Abstention-Aware Multimodal Judges for Fairness and Alignment Evaluation in Text-to-Image Models

FairJudge: 文本到图像模型中公平性与对齐评估的弃权感知多模态裁判

Zahraa Al Sahili, Maimuna Nowaz, Maryam Fetanat, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦玛丽女王大学) Institut Jožef Stefan(乔泽夫·斯蒂芬研究所) Imperial College London(伦敦帝国学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出FairJudge协议,利用多模态大语言模型作为结构化裁判,通过封闭标签、弃权机制和证据报告,在文本到图像模型中实现社会属性预测、职业定位和提示-图像对齐的公平性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25226 2026-05-26 cs.CL 79%

From Automation to Collaboration: Human-in-the-Loop Methods for Safe and Trustworthy NLP

从自动化到协作:面向安全可信NLP的人机协同方法

Most. Sharmin Sultana Samu, MD. Tanvir Ahmed Seum, Md. Rakibul Islam

机构 * Department of Computer Science and Engineering, BRAC University(布拉克大学计算机科学与工程系) Department of Electrical and Electronic Engineering, Rajshahi University of Engineering and Technology(拉贾沙希工程与技术大学电子与电气工程系)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.CL

AI总结 本文综述了人机协同方法,通过人类监督支持审计、鲁棒性评估、数据构建和模型引导,以提升NLP在安全可信方面的表现,并指出了可扩展探测、可持续鲁棒性基准、低资源设置和私有系统治理等方面的差距。

Comments Preprint, manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏