arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2606.17915 2026-06-17 cs.MA cs.AI cs.DB cs.SE 新提交 79%

Trustworthy Self-Composable Big-Data-as-a-Service: An LLM-Orchestrated Multi-Agent Framework for Automated Data Engineering, AutoML, MLOps Deployment, and Drift-Aware Lifecycle Optimization

可信赖的自组合大数据即服务:一种LLM编排的多智能体框架,用于自动化数据工程、AutoML、MLOps部署和漂移感知生命周期优化

Aueaphum Aueawatthanaphisut, Badri Raj Lamichhane

机构 * School of Information, Computer, and Communication Technology(信息、计算机与通信技术学院) Sirindhorn International Institute of Technology, Thammasat University(素金国际技术研究所,泰国 Thammasat 大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 提出一种基于LLM编排的多智能体BDaaS框架,通过分解生命周期为专用智能体并协调执行,实现自动化数据工程、AutoML、MLOps部署和漂移感知优化,提升生命周期级可靠性。

Comments 7 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16799 2026-06-16 cs.CV cs.AI 新提交 79%

Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment

解耦语义与失真:面向AI生成图像质量评估的多尺度双流视觉-语言对齐

Zijie Meng

机构 * Zijie Meng(孟子杰)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出MST-CLIPIQA多尺度双流框架,通过显式表示解耦实现层次化视觉-语言对齐,在五个基准上取得质量SRCC平均提升1.11%、图文对应SRCC提升2.35%的新SOTA结果。

Comments 11 pages, 2 figures Accepted by ICME2026(spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16655 2026-06-16 cs.LG 新提交 79%

Distribution Alignment for One-Shot Federated Learning via Optimal Transport

基于最优传输的单轮联邦学习分布对齐

Daniele Berardini, Vito Paolo Pastore, Vittorio Murino

机构 * AI for Good (AIGO), Italian Institute of Technology(意大利技术研究院AI for Good (AIGO)) MaLGa-DIBRIS, University of Genoa(热那亚大学MaLGa-DIBRIS) Department of Computer Science, University of Verona(维罗纳大学计算机科学系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 针对单轮联邦学习中客户端数据异构导致的特征错位问题,提出SLOT-Align方法,利用共享冻结编码器、Bures-Wasserstein重心和测地最优传输映射实现无训练的特征对齐,提升模型精度与鲁棒性。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15153 2026-06-16 cs.LG 新提交 79%

False Sense of Safety in Selective Signal Classification: Auditing Bound Tightness and Exchangeability for Risk Control

选择性信号分类中的虚假安全感:风险控制的边界紧致性与可交换性审计

Jingwen Zhou, Mingzhe Wang

机构 * Xidian University(西安电子科技大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 审计分布自由风险控制下选择性预测的边界紧致性与可交换性假设,发现经验阈值法常超预算,而认证方法在可交换时有效,但组部署下因可交换性失效导致违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15034 2026-06-16 cs.AI 新提交 79%

OSGuard: A Benchmark for Safety in Computer-Use Agents

OSGuard:计算机使用智能体安全基准

Mina Mohammadmirzaei, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出OSGuard双粒度基准,通过动作级安全判断和风险增强执行评估智能体在良性指令下的安全性,揭示局部监督与端到端安全的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09039 2026-06-16 cs.AI 新提交 79%

Agent Economics: An Entropy-Controlled Pluralistic Alignment Framework for Preventing Artificial Hivemind in Autonomous Agents

Agent经济学:一种熵控制的多元对齐框架以防止自主智能体中的蜂群思维

Cheonsu Jeong

机构 * AX Center, SAMSUNG SDS(三星SDS AX中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出行为协议框架(BPF),通过心智化社会智能、多元对齐和可验证执行内核三个模块,在闭环架构中控制熵以保持策略多样性,提升自主智能体经济的稳定性、效率和可信度。

Comments 15 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06173 2026-06-16 cs.IR cs.AI 版本更新 79%

Beyond Case Law: Evaluating Structure-Aware Retrieval and Safety in Statute-Centric Legal QA

超越判例法:评估法规中心型法律问答中的结构感知检索与安全性

Kyubyung Chae, Jewon Yeom, Jeongjae Park, Seunghyun Bae, Ijun Jang, Hyunbin Jin, Jinkwan Jang, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 针对法规中心型法律问答中层级检索困难与模型幻觉问题,提出结构-安全感知基准SearchFireSafety,通过图引导检索提升性能,但揭示领域适应模型在证据缺失时更易幻觉。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12788 2026-06-12 cs.SI cs.CY cs.DC cs.SY econ.GN eess.SY q-fin.EC 新提交 79%

To Share or Not to Share: Orchestrating Trustworthy Data in Global Value Chains

共享还是不共享:协调全球价值链中的可信数据

Han-Teng Liao, Chang-Yi Kao

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

AI总结 针对欧盟CBAM带来的监管透明与数据主权矛盾,提出基于IDSA框架的RegTech参考架构,通过主权数据交换实现数字产品护照,驱动全球商业服务能力需求,并集成Agentic AI与绿色金融,为全球产业集群提供可扩展蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11316 2026-06-11 cs.CL 新提交 79%

Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

Schützen: 在保加利亚语和德语语境中评估LLM安全性

Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov, Preslav Nakov, Ivan Koychev

机构 * Sofia University "St. Kliment Ohridski" MBZUAI(索菲亚大学"圣克莱门特·奥赫里德斯基" MBZUAI)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 针对现有安全评估数据集以英语和中文为主的问题,构建了覆盖低资源语言保加利亚语和高资源语言德语的Schützen安全数据集,实验揭示多语言LLM在安全行为上的显著跨语言差异,强调了区域特定评估资源的必要性。

Comments 19 pages, 13 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11167 2026-06-10 cs.CL eess.AS 新提交 79%

Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

全双工语音模型中的多面交互对齐

Atsumoto Ohashi, Neil Zeghidour, Alexandre Défossez, Eugene Kharitonov

机构 * Kyutai Gradium

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 针对全双工对话模型交互性问题,提出基于强化学习的后训练对齐方法,从暂停处理、话轮转换、回馈和用户打断四个维度优化,并加入LLM奖励防止语义退化,在Moshi和PersonaPlex上取得一致改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10061 2026-06-10 cs.CL 新提交 79%

BenSyc: Benchmarking Conversational Sycophancy and Human Alignment in LLMs for Bengali Contexts

BenSyc: 孟加拉语上下文中大语言模型对话谄媚与人类对齐的基准测试

Kazi Noshin, Sajib Acharjee Dip, Ranat Das Prangon, Fardin Hassan Tamim, Syed Ishtiaque Ahmed, Liqing Zhang, Sharifa Sultana

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Tech(弗吉尼亚理工大学) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学) BRAC University(BRAC大学) University of Toronto(多伦多大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 提出BenSyc基准,基于孟加拉语社交数据构建五级标注集,评估15+模型在对话对齐分类与生成任务上的表现,发现前沿模型在区分共情与强化性认可上仍存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05463 2026-06-10 cs.AI 版本更新 79%

PSEBench: A Controllable and Verifiable Benchmark for Evaluating LLMs in Patient Safety Event Triage

PSEBench: 一个用于评估大语言模型在患者安全事件分类中的可控且可验证的基准

Keqi Han, Ryan Young, Annabel Strauss, Lindsey Hughes, Katharine M. Nesbitt, Nicole Schueler, Che Ngufor, Carl Yang, Yuan Xue, Zhijun Yin

机构 * Emory University(埃默里大学) Scale AI Mayo Clinic(梅奥诊所) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出基于政策条款卡的结构化构建方法,通过锚点驱动实例化和闭环验证生成带真实标签的叙事,并创建包含5074个案例的基准PSEBench,评估15个代表性LLM在患者安全事件分类中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09148 2026-06-09 cs.CL 新提交 79%

Explicit Representation Alignment for Multimodal Sentiment Analysis

显式表示对齐用于多模态情感分析

Baode Wang, Ziming Wang, Huacan Wang, Ronghao Chen, Biao Wu

机构 * AgentAlpha

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08234 2026-06-09 cs.AI 新提交 79%

SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents

SciTrace: 面向科学发现代理的轨迹感知安全推理

Tanush Swaminathan, Runmin Jiang, Letian Zhang, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Allen Institute(艾伦研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出SciTrace框架,通过安全内在推理循环和组合工具链验证器,在科学代理管道的每个阶段融入安全推理,实现工具调用安全性和对抗鲁棒性的SOTA提升。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07929 2026-06-09 cs.AI 新提交 79%

Stress-testing medical large language models reveals latent safety pathology beyond benchmark accuracy

压力测试医学大语言模型揭示基准准确性之外的潜在安全病理

Yuan Shen, Xiaojun Wu, Linghua Yu

机构 * College of Computer Science and Technology, Zhejiang University, PR China(浙江大学计算机科学与技术学院,中国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出AI-MASLD压力审计框架,通过240个临床病例和六种叙事扰动探针对七种模型进行双重压力测试,发现量化模型存在伪正常化,医学监督微调损害逻辑稳定性和公平性,开源模型在安全维度上达到或超越闭源模型。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06423 2026-06-05 cs.RO cs.AI 79%

RiskFlow: Fast and Faithful Safety-Critical Traffic Scenario Generation

RiskFlow: 快速且保真的安全关键交通场景生成

Qi Lan, Yining Tang, Yu Shen, Yi Zhou, Yuhao Wei, Jie Li, Guofa Li

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出RiskFlow框架,通过动作空间中的单次前向传输替代迭代去噪,实现快速、保真的安全关键多智能体交通场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06054 2026-06-05 cs.AI 79%

Beyond Similarity: Trustworthy Memory Search for Personal AI Agents

超越相似性:面向个人AI代理的可信记忆搜索

Jiawen Zhang, Kejia Chen, Jiachen Ma, Yangfan Hu, Lipeng He, Yechao Zhang, Jian Liu, Xiaohu Yang, Tianwei Zhang, Ruoxi Jia

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 针对个人AI代理中基于语义相似性的记忆检索存在的信任漏洞,提出轻量级记忆插件MemGate,通过查询条件神经门控实现可信记忆搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05357 2026-06-05 cs.AI 79%

An interpretable and trustworthy AI framework for large-scale longitudinal structure-pain association studies using data from the Osteoarthritis Initiative (OAI)

一个可解释且可信赖的AI框架,用于利用骨关节炎倡议(OAI)数据进行大规模纵向结构-疼痛关联研究

Jincheng Yu, Haoyang Li, Yiwen Liu, Shen Liu, Rachel Yuanbao Chen, C. Kent Kwoh, Hongxu Ding, Xiaoxiao Sun

机构 * Statistics & Data Science GIDP, University of Arizona(大学阿瓜斯卡连特斯统计与数据科学GIDP) Department of Epidemiology and Biostatistics, University of Arizona(大学阿瓜斯卡连特斯流行病学与生物统计学系) College of Medicine Tucson, University of Arizona(大学阿瓜斯卡连特斯医学学院) R. Kent Coit College of Pharmacy, University of Arizona(大学阿瓜斯卡连特斯R. Kent Coit药学院) University High School(大学高中)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 提出结合深度学习MOAKS预测与可解释统计建模的AI框架,通过不确定性量化筛选高置信度预测,利用纵向潜类混合模型分析结构异常与疼痛的关联,发现骨髓病变、软骨丢失和半月板挤压是疼痛进展的风险因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17256 2026-06-05 cs.CL 79%

Explainability of Large Language Models: Opportunities and Challenges toward Generating Trustworthy Explanations

大型语言模型的可解释性:朝着生成可信解释的方向机遇与挑战

Shahin Atakishiyev, Housam K. B. Babiker, Jiayi Dai, Nawshad Farruque, Teruaki Hayashi, Nafisa Sadaf Hriti, Md Abed Rahman, Iain Smith, Mi-Young Kim, Osmar R. Zaïane, Randy Goebel

机构 * University of Alberta(阿尔伯塔大学) University of Tokyo(东京大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型的可解释性问题,分析了局部可解释性和机械可解释性方法,并在医疗和自动驾驶两个关键领域进行了实验研究,总结了当前可解释性领域存在的问题和未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04867 2026-06-04 cs.AI 79%

AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety

AICompanionBench: 以LLM为评判标准的AI伴侣安全基准测试

Yanjing Ren, Reza Ebrahimi, TengTeng Ma

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出AICompanionBench,首个公开的细粒度安全风险标注的人机伴侣对话基准数据集,并评估20个LLM在检测不安全交互中的表现,发现强模型在显式有害内容上准确率高,但难以识别隐式不安全交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00747 2026-06-04 cs.CV cs.AI 79%

SkyShield: Occupancy as a Safety Interface for Low-Altitude UAV Autonomy

SkyShield:占用作为低空无人机自主飞行的安全接口

Jie Gao, Jie Ma, Kaihui Lin, Kai Ye, Miaohui Zhang, Pingyang Dai, Liujuan Cao

机构 * Xiamen University(厦门大学) Jiangxi Academy of Sciences(江西省科学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 针对低空无人机自主飞行中的三维空间理解问题,提出首个前视单目语义占用基准SkyShield、动态感知度量KAR-mIoU和几何优先基线SkyOcc,将占用作为安全接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24782 2026-06-04 cs.LG 79%

The Perception-Physics Paradox: Probing Scientific Alignment with TC-Bench

感知-物理悖论:用TC-Bench探究科学对齐

Dingling Yao, Andrea Polesello, Adeel Pervez, Caroline Muller, Francesco Locatello

机构 * ETH Zurich(苏黎世联邦理工学院) DeepMind University of Cambridge(剑桥大学) University of Amsterdam(阿姆斯特丹大学) University of Toronto(多伦多大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出科学对齐概念,通过结构同构性构建层次化必要条件,并发布TC-Bench基准数据集,揭示视觉基础模型在极端条件下依赖视觉捷径而非科学推理。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03644 2026-06-03 cs.LG 79%

Spatial Transcriptomics-Guided Alignment Enhances Molecular Profiling in Pathology Foundation Model

空间转录组学引导的对齐增强病理基础模型中的分子分析

Fengtao Zhou, Yingxue Xu, Zhengyu Zhang, Yihui Wang, Zhengrui Guo, Ling Liang, Jiabo Ma, Cheng Jin, Ziyi Liu, Huajun Zhou, Hongyi Wang, Du Cai, Chenglong Zhao, Xi Wang, Can Yang, Yu Wang, Wenbin Li, Feng Gao, Zhe Wang, Zhenhui Li, Xiuming Zhang, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology, Hong Kong SAR, China(计算机科学与工程系,香港科学与技术大学,香港特别行政区,中国) Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China(pathology department, 南方医科大学南芳医院,广州,中国) Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(pathology department, 南方医科大学基础医学学院,广州,中国) Guangdong Province Key Laboratory of Molecular Tumor Pathology, Guangzhou, China(广东省分子肿瘤病理学重点实验室,广州,中国) Jinfeng Laboratory, Chongqing, China(金风实验室,重庆,中国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出STAMP框架,利用空间转录组数据通过通路感知对齐策略增强病理基础模型的分子感知能力,并在多层级评估中验证其临床效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31381 2026-06-03 cs.CL 79%

LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

LLM 法官在安全标准和危害类别上不一致地存在分歧

Krishnapriya Vishnubhotla, Sowmya Vajjala, Akriti Vij, Isar Nejadgholi

机构 * National Research Council, Canada(加拿大国家研究理事会) IMDA, Singapore(新加坡信息通信技术发展局)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本研究评估了自动法官在无参考设置下进行多维安全评估的一致性,发现大型语言模型在识别金融等受监管领域中机器生成建议的安全问题时不可靠,且不一致程度因安全标准、内容语言和风格而异,不同法官之间也存在高度分歧。

Comments 8 pages plus appendices, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02640 2026-06-02 cs.AI 79%

Trustworthy AI Suffers from Invariance Conflicts and Causality is The Solution

可信人工智能面临不变性冲突,因果性是解决方案

Ruta Binkyte, Ivaxi Sheth, Zhijing Jin, Mohammad Havaei, Bernhard Schölkopf, Mario Fritz

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文通过将可信AI目标重新解释为数据生成过程变化下的不相容不变性要求,论证因果性是理解和平衡性能与多个可信目标之间权衡的必要框架。

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01552 2026-06-02 cs.AI 79%

RoleCDE:Benchmarking and Mitigating Role-Alignment Trade-offs in Role-Playing Agents

RoleCDE:角色扮演代理中的角色-对齐权衡的基准测试与缓解

Huayi Lai, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Zhouxing Wang, Zhiqiang Yin, Xun Liang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 针对角色扮演代理在角色特定价值与对齐约束冲突时的决策问题,提出首个基准RoleCDE,通过认知困境场景评估角色-场景基础、价值冲突解决和决策倾向,发现“角色价值解耦”现象,并基于RoleCDE的微调有效缓解该问题。

Comments 23pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00611 2026-06-02 cs.AI 79%

TRACE: Trajectory Risk-Aware Compression for Long-Horizon Agent Safety

TRACE: 面向长程智能体安全的轨迹风险感知压缩

Zhepei Hong, Lin Wang, Liting Li, Haokai Ma, Junfeng Fang, Fei Shen, Dan Zhang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) South China Normal University(华南师范大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出轨迹风险感知压缩方法TRACE,通过压缩器-阅读器架构将长轨迹压缩为潜在证据状态,以聚合稀疏风险信号并提升长程安全检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00284 2026-06-02 cs.CL 79%

Parameter Alignment Mitigates Catastrophic Forgetting in Multilingual Expert Language Models

参数对齐减轻多语言专家语言模型中的灾难性遗忘

Sanchit Ahuja, Terra Blevins

机构 * Northeastern University(东北大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 针对多语言持续预训练中的灾难性遗忘问题,提出五种层感知参数对齐策略(硬冻结、软正则化、事后权重恢复和模型合并),在32种训练语言和保留语言上评估,证明参数对齐能有效减少遗忘且语言获取成本低。

Comments 25 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05427 2026-06-02 cs.AI 79%

The Refusal--Compliance Tradeoff: A Large-Scale Safety Behavior Audit of Large Language Models

拒绝-顺从权衡:大型语言模型的大规模安全行为审计

Alif Al Hasan, Sumon Biswas

机构 * Department of Computer and Data Sciences(计算机与数据科学系)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本研究通过调整组合方法隔离模型敏感性与数据集毒性混淆,审计了21个开源权重LLM在四个安全基准上的拒绝与顺从失败模式,发现模型采用不同校准策略、人口保护不平等以及拒绝与顺从倾向在模型家族内稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05671 2026-06-02 cs.CL 79%

ClinTutor-R1: Advancing Scalable and Robust One-to-Many Alignment in Clinical Socratic Education

ClinTutor-R1:在临床苏格拉底式教育中推进可扩展且稳健的一对多对齐

Zhitao He, Haolin Yang, Zeyu Qin, Yi R Fung

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 针对临床查房等一对多教学场景中上下文稀释与目标错位问题,提出基于多智能体模拟器ClinEdu构建的苏格拉底式教学数据集ClinTeach,并开发首个显式内部思维机制的一对多对齐视觉语言智能体ClinTutor-R1,通过建模个体信念状态与群体共识,在静态基准、交互评估、专家评审及200人真实用户研究中超越基线模型20%以上,达到与专有模型相当的性能,并展现出随学生规模扩展的教学质量可扩展性。

Comments Accepted by ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏