arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-02 至 2026-06-02 共收录 192 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 3 篇

2506.11083 2026-06-02 cs.CL 83%

RedDebate: Safer Responses Through Multi-Agent Red Teaming Debates

RedDebate:通过多智能体红队辩论实现更安全的响应

Ali Asad, Stephen Obadinma, Radin Shayanfar, Xiaodan Zhu

机构 * Department of Electrical Computer Engineering \& Ingenuity Labs Research Institute, Queen's University, Kingston, Canada

专题命中 红队测试 :red teaming(title);safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 提出RedDebate框架,利用多智能体辩论和长期记忆模块,通过全自动红队测试减少大语言模型的不安全输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00801 2026-06-02 cs.CR cs.CL cs.ET cs.LG cs.NE 81%

Quality-Diversity Evolution for Discovering Diverse Vulnerabilities in LLM Safety

用于发现LLM安全中多样漏洞的质量-多样性进化

Subhadip Mitra

机构 * Rota Labs(Rota实验室)

专题命中 红队测试 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 提出基于质量-多样性进化框架(MAP-Elites)在语义层面生成可解释攻击策略,发现不同LLM的特定漏洞模式。

Comments 9 pages, 6 figures. Accepted at the ICLR 2026 Workshop on Agents in the Wild (AIWILD)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 提示注入 2 篇

2604.23593 2026-06-02 cs.AI 57%

When AI reviews science: Can we trust the referee?

当AI评审科学:我们能信任审稿人吗?

Jialiang Wang, Yuchen Liu, Hang Xu, Kaichun Hu, Shimin Di, Wangze Ni, Linan Yue, Min-Ling Zhang, Kui Ren, Lei Chen

机构 * School of Electronic Engineering, Southeast University(东南大学电子工程学院) Zhejiang University(浙江大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对AI审稿的安全性和可靠性问题,本文通过分类攻击类型并实验验证声望框架、断言强度、反驳谄媚和上下文投毒对评分的影响,为评估AI同行评审的可靠性提供基线。

Journal ref The Innovation Informatics 2:100030 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00485 2026-06-02 cs.CR 50%

Confused ChatGPT: Cross-App Context Poisoning via First-Party APIs

困惑的ChatGPT:通过第一方API的跨应用上下文投毒

Chao Wang, Somesh Jha, Zhiqiang Lin

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文发现ChatGPT Apps中由于共享聊天上下文缺乏隔离,恶意应用可通过第一方API注入持久性内容,导致跨应用上下文投毒攻击,并展示了两种攻击载荷。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与事实性 11 篇

2605.18838 2026-06-02 cs.LG cs.AI cs.CL 78%

Lying Is Just a Phase: The Hidden Alignment Transition in Language Model Scaling

说谎只是一个阶段:语言模型扩展中的隐藏对齐转变

Adil Amin

机构 * ZEHEN Labs(ZEHEN实验室)

专题命中 幻觉与事实性 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过分析63个基础模型,发现语言模型在特定规模阈值下,推理能力与真实性从反相关转变为正相关,并揭示了输出投影瓶颈和零竞争注意力头等内部机制。

Comments 15 pages, 8 figures, 2 tables. Companion paper: "The Growing Pains of Frontier Models: When Leaderboards Stop Separating and What to Measure Next." ( https://doi.org/10.48550/arXiv.2605.18840). Code: https://github.com/adilamin89/cape-scaling. Dashboard: https://zehenlabs.com/cape/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05650 2026-06-02 cs.CL cs.AI cs.LG 67%

Optimizing Diversity and Quality through Base-Aligned Model Collaboration

通过基座对齐模型协作优化多样性与质量

Yichen Wang, Chenghao Yang, Tenghao Huang, Muhao Chen, Jonathan May, Mina Lee

机构 * University of Chicago(芝加哥大学) University of Southern California, Information Sciences Institute(南加州大学信息科学研究所) University of California, Davis(加州大学戴维斯分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基座对齐模型协作框架(BACo),在推理时通过令牌级路由策略动态结合基座LLM与其对齐版本,以单次前向传递同时提升生成多样性和质量。

Comments ICML 2026. (47 pages, 22 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05566 2026-06-02 stat.ML cs.AI cs.CL cs.LG stat.AP 67%

Domain-Shift-Aware Conformal Prediction for Large Language Models

领域偏移感知的共形预测用于大型语言模型

Zhexiao Lin, Yuanyuan Li, Neeraj Sarna, Yuanyuan Gao, Michael von Gablenz

机构 * University of Waterloo(多伦多大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出领域偏移感知共形预测框架,通过重加权校准样本应对分布偏移,在MMLU基准上提升覆盖可靠性。

Comments Accepted to Forty-Third International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01923 2026-06-02 cs.CL cs.LG 62%

Resonant Context Anchoring: Decoupling Attention Routing and Signal Gain at Inference Time

共振上下文锚定:推理时解耦注意力路由与信号增益

Mingkuan Zhao, Yide Gao, Wentao Hu, Suquan Chen, Tianchen Huang, Zhenhua An, Zetao Chang, Xiayu Sun, Yuheng Min

机构 * Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出共振上下文锚定(RCA)方法,通过解耦自注意力中的路由逻辑与信息幅度,在推理时动态增强上下文令牌的信号,有效抑制大语言模型的参数化幻觉,提升事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27835 2026-06-02 cs.LG cs.CL 62%

CAREF: Calibration-Aware Regularization for Explanation Faithfulness Without Rationale Supervision

CAREF: 面向解释忠实性的校准感知正则化,无需理由监督

Naphat Nithisopa, Teerapong Panboonyuen

机构 * MARSAIL Chulalongkorn University(朱拉隆梭大学) PBYAIL (Panboonyuen AI Lab)(PBYAIL(Panboonyuen人工智能实验室))

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出CAREF框架,通过校准感知正则化联合优化预测准确性和解释忠实性,无需理由监督,在四个NLE基准上以少量可训练参数取得最佳性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22947 2026-06-02 cs.CL cs.LG 62%

Reconsidering Positional Supervision in Masked Diffusion Language Model Training

重新审视掩码扩散语言模型训练中的位置监督

Mengyu Ye, Keito Kudo, Ryosuke Takahashi, Jun Suzuki

机构 * Tohoku University(东大大学) RIKEN(理化学研究所) NII LLMC(国家信息研究所LLMC)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对掩码扩散语言模型对位置偏移敏感的问题,提出基于连接主义时序分类(CTC)的目标函数,通过引入松弛令牌和更新折叠映射来吸收位置不确定性,从而在开放生成基准上取得一致提升。

Comments preprint, WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01710 2026-06-02 cs.CV cs.LG 57%

Density-Aware Translation of Spurious Correlations in Zero-Shot VLMs

零样本VLM中虚假相关性的密度感知转换

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems, The University of Melbourne, Victoria, Australia(计算与信息系统学院,墨尔本大学,维多利亚,澳大利亚)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 提出密度感知转换(DAT)方法,利用局部几何密度项修正图像-文本相似度,以缓解CLIP等视觉语言模型在零样本分类中因虚假相关性导致的性能下降。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00596 2026-06-02 cs.CL 57%

Toward Responsible and Epistemically Grounded Multilingual LLMs for Computational Social Science and Humanities

面向负责任且基于认识论的多语言大语言模型在计算社会科学与人文学科中的应用

Wajdi Zaghouani

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文重新概念化多语言推理大语言模型为解释学工具,提出一个基于理论框架来评估其在社会科学与人文学科研究中的文化对齐、跨语言稳定性和推理忠实性。

Journal ref Proceedings of LLMs4SSH Workshop at LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26292 2026-06-02 cs.CV cs.CL 57%

Evi-Steer: Learning to Steer Biomedical Vision-Language Models through Efficient and Generalizable Evidential Tuning

Evi-Steer:通过高效且可泛化的证据调优学习引导生物医学视觉-语言模型

Taha Koleilat, Hassan Rivaz, Yiming Xiao

机构 * Concordia University(康科迪亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出Evi-Steer框架,通过证据跨模态低维引导实现BiomedCLIP的不确定性感知参数高效微调,仅更新0.11%参数,在15个生物医学数据集上少样本学习和域泛化设置中优于现有方法。

Comments MICCAI 2026 Early Accept; Project Page: https://tahakoleilat.github.io/Evi-Steer. This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published as part of the MICCAI 2026 proceedings in October

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18439 2026-06-02 cs.CL 57%

Grounding or Guessing? Visual Signals for Detecting Hallucinations in Sign Language Translation

基于视觉线索检测手语翻译中的幻觉:是依据视觉信息还是猜测?

Yasser Hamidullah, Koel Dutta Chowdhury, Yusser Al Ghussin, Shakib Yazdani, Cennet Oguz, Josef van Genabith, Cristina España-Bonet

机构 * German Research Center for Artificial Intelligence (DFKI GmbH)(德国人工智能研究中心(DFKI GmbH)) Saarland Informatics Campus(萨尔兰州信息学校园) Barcelona Supercomputing Center (BSC-CNS)(巴塞罗那超级计算中心(BSC-CNS))

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 针对手语翻译中模型依赖语言先验而非视觉输入导致幻觉的问题,提出一种基于特征敏感性和反事实信号的令牌级可靠性度量,用于量化视觉信息利用程度,并在两个基准上验证其预测幻觉率、跨数据集泛化及与文本信号结合提升风险评估的效果。

Comments Published at ICLR2026 Code available at \url{https://github.com/yhamidullah/hallucination-slt}

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09696 2026-06-02 cs.CL 57%

Empathy Applicability Modeling for General Health Queries

通用健康查询的共情适用性建模

Shan Randhawa, Agha Ali Raza, Kentaro Toyama, Julie Hui, Mustafa Naseem

机构 * University of Michigan(密歇根大学) Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出共情适用性框架(EAF),基于临床、语境和语言线索对患者查询的情感反应和解释适用性进行分类,以支持异步医疗中的共情沟通。

Comments Accepted at Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 隐私与版权 4 篇

2606.00467 2026-06-02 cs.CL cs.AI cs.LG stat.ML 67%

On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance

论大语言模型适应性的局限:模型内化先验对标注任务性能的影响

Etienne Casanova, Rafal Kocielnik, R. Michael Alvarez

机构 * University of Washington(华盛顿大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过毒性检测实验,研究大语言模型内化先验与指令交互的三个维度,发现近三分之二的零样本错误难以通过提示纠正,并引入定义特定熟悉度(DSF)指标,证明其与性能正相关,而文本记忆指标则无此关联。

Comments Accepted at ICML 2026 (Oral & Spotlight); PMLR vol. 306. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00105 2026-06-02 cs.CV cs.AI 57%

Visual-Noise Guided In-Context Distillation for Multimodal Large Language Model Unlearning

视觉噪声引导的上下文蒸馏用于多模态大语言模型遗忘

Junkai Chen, Yuhao He, Junxiang You, Ruiqi Liu, Chenyu Wang, Shu Wu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科研究院)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 提出视觉噪声引导的上下文蒸馏(VGID)框架,通过双模态干预构建教师分布进行蒸馏,实现多模态大语言模型参数级遗忘,平衡遗忘效果与模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02016 2026-06-02 cs.CR cs.CY 57%

What's on Your Mind? Exploring Privacy of Mental Health Apps

你在想什么?探索心理健康应用的隐私

Chloe Georgiou, Hans Lu, Emiliano De Cristofaro, Gene Tsudik

专题命中 隐私与版权 :alignment(abstract);分类 cs.CY

AI总结 通过对25款流行的Android心理健康应用进行静态分析、动态网络捕获和LLM辅助隐私政策提取,发现这些应用存在严重的透明度问题,包括未披露的跟踪器、权限政策矛盾以及第三方AI处理披露不充分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01225 2026-06-02 cs.CR 50%

Privacy-Preserving Smart Surveillance with Cross-Dataset Violence Detection and Decentralized Evidence Governance

隐私保护的智能监控:跨数据集暴力检测与去中心化证据治理

Hasan Coşkun, Furkan Çolhak, Andrea Kulakov, Vesna Dimitrova

专题命中 隐私与版权 :safety(abstract)

AI总结 提出一种隐私保护智能监控框架,使用轻量级MobileNetV2视频分类器检测暴力片段,并通过Shamir秘密共享和公钥加密实现去中心化证据访问控制,在多个数据集上评估了不同时序模型的表现。

Comments 7 pages. Submitted to the CyberMACS Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 62 篇

2606.01322 2026-06-02 cs.CL cs.AI 84%

TukaBench: A Culturally Grounded Jailbreak Benchmark for African Languages

TukaBench: 一个基于文化的非洲语言越狱基准

Victor Akinode, Senyu Li, Wassim Hamidouche, Waqas Zamir, Inbal Becker-Reshef, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) Microsoft AI for Good Research Lab(微软人工智能造福人类研究实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全评测 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对大型语言模型在非洲低资源语言上的安全评估缺失,提出TUKABENCH基准,通过四种设置(直接翻译、文化适应翻译、人工策划提示、代码切换提示)评估语言、文化背景和提示规避性对模型安全的影响,发现非洲语言提示降低拒绝率,并引入Deflection指标和人工验证以解决模型理解失败和评判可靠性问题。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01317 2026-06-02 cs.SE cs.CR 82%

SABER: Benchmarking Operational Safety of LLM Coding Agents in Stateful Project Workspaces

SABER:在有状态项目工作区中对LLM编码代理的操作安全性进行基准测试

Qi Hu, Yifeng Tang, Qinghua Wang, Lanyang Zhao, Pengji Zhang, Yuhao Qing, Xin Yao, Dong Huang, Lin Zhang, Zhuoran Ji

专题命中 安全评测 :safety(title,abstract);alignment(abstract)

AI总结 提出SABER基准,通过将模型置于真实代理式项目中并评估最终环境状态,来衡量LLM编码代理的操作安全性,发现最佳模型的有害安全违规率超过54%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02443 2026-06-02 cs.CL cs.AI cs.CV 81%

PaSBench-Video: A Streaming Video Benchmark for Proactive Safety Warning

PaSBench-Video: 面向主动安全预警的流式视频基准

Yusong Zhao, Yuejin Xie, Youliang Yuan, Junjie Hu, Jitian Guo, Yujiu Yang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 提出PaSBench-Video基准,包含740个视频,评估多模态大模型在危险发生前及时发出预警的能力,发现现有模型在时序精度和低误报率上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02322 2026-06-02 cs.LG cs.AI 81%

Repurposing Adversarial Perturbations for Continual Learning: From Defense to Active Alignment

重新利用对抗扰动进行持续学习:从防御到主动对齐

Ran Liu, Min Yu, Mingqi Liu, Jianguo Jiang, Gang Li, Rongsheng Li, Ning Li, Zhen Xu, Weiqing Huang, Ming Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Deakin University(德肯大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出AdvCL框架,通过将对抗扰动重新用作几何控制信号,结合三个即插即用模块(Intra-Smooth、Proto-Clip、Inter-Align),在持续学习中同时提升标准性能、鲁棒性、降低遗忘并增强迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00160 2026-06-02 cs.CR cs.AI cs.CL 81%

DataShield: Safety-degrading Data Filtering for LLM Benign Instruction Fine-Tuning

DataShield: 针对大语言模型良性指令微调的安全降级数据过滤

Junbo Zhang, Qianli Zhou, Xinyang Deng, Wen Jiang, Jie Pan, Jinbiao Zhu

机构 * nwpu.edu.cn(西北工业大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DataShield方法,通过量化每个样本对模型合规行为的贡献作为安全降级分数,高效识别良性数据集中的安全降级样本,并在多个模型和数据集上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02640 2026-06-02 cs.AI 79%

Trustworthy AI Suffers from Invariance Conflicts and Causality is The Solution

可信人工智能面临不变性冲突,因果性是解决方案

Ruta Binkyte, Ivaxi Sheth, Zhijing Jin, Mohammad Havaei, Bernhard Schölkopf, Mario Fritz

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文通过将可信AI目标重新解释为数据生成过程变化下的不相容不变性要求,论证因果性是理解和平衡性能与多个可信目标之间权衡的必要框架。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01552 2026-06-02 cs.AI 79%

RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents

RoleCDE:角色扮演代理中的角色-对齐权衡的基准测试与缓解

Huayi Lai, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Zhouxing Wang, Zhiqiang Yin, Xun Liang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 针对角色扮演代理在角色特定价值与对齐约束冲突时的决策问题,提出首个基准RoleCDE,通过认知困境场景评估角色-场景基础、价值冲突解决和决策倾向,发现“角色价值解耦”现象,并基于RoleCDE的微调有效缓解该问题。

Comments 23pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00611 2026-06-02 cs.AI 79%

TRACE: Trajectory Risk-Aware Compression for Long-Horizon Agent Safety

TRACE: 面向长程智能体安全的轨迹风险感知压缩

Zhepei Hong, Lin Wang, Liting Li, Haokai Ma, Junfeng Fang, Fei Shen, Dan Zhang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) South China Normal University(华南师范大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出轨迹风险感知压缩方法TRACE,通过压缩器-阅读器架构将长轨迹压缩为潜在证据状态,以聚合稀疏风险信号并提升长程安全检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00284 2026-06-02 cs.CL 79%

Parameter Alignment Mitigates Catastrophic Forgetting in Multilingual Expert Language Models

参数对齐减轻多语言专家语言模型中的灾难性遗忘

Sanchit Ahuja, Terra Blevins

机构 * Northeastern University(东北大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 针对多语言持续预训练中的灾难性遗忘问题,提出五种层感知参数对齐策略(硬冻结、软正则化、事后权重恢复和模型合并),在32种训练语言和保留语言上评估,证明参数对齐能有效减少遗忘且语言获取成本低。

Comments 25 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05427 2026-06-02 cs.AI 79%

The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models

拒绝-顺从权衡:大型语言模型的大规模安全行为审计

Alif Al Hasan, Sumon Biswas

机构 * Department of Computer and Data Sciences(计算机与数据科学系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本研究通过调整组合方法隔离模型敏感性与数据集毒性混淆,审计了21个开源权重LLM在四个安全基准上的拒绝与顺从失败模式,发现模型采用不同校准策略、人口保护不平等以及拒绝与顺从倾向在模型家族内稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05671 2026-06-02 cs.CL 79%

ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education

ClinTutor-R1:在临床苏格拉底式教育中推进可扩展且稳健的一对多对齐

Zhitao He, Haolin Yang, Zeyu Qin, Yi R Fung

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 针对临床查房等一对多教学场景中上下文稀释与目标错位问题,提出基于多智能体模拟器ClinEdu构建的苏格拉底式教学数据集ClinTeach,并开发首个显式内部思维机制的一对多对齐视觉语言智能体ClinTutor-R1,通过建模个体信念状态与群体共识,在静态基准、交互评估、专家评审及200人真实用户研究中超越基线模型20%以上,达到与专有模型相当的性能,并展现出随学生规模扩展的教学质量可扩展性。

Comments Accepted by ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏