arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-15 至 2026-06-15 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2604.01463 2026-06-15 cs.RO cs.AI cs.HC 版本更新 57%

Low-Burden LLM-Based Preference Learning: Personalizing Assistive Robots from Natural Language Feedback for Users with Paralysis

基于低负担LLM的偏好学习:通过自然语言反馈为瘫痪用户个性化辅助机器人

Keshav Shankar, Dan Ding, Wei Gao

机构 * Electrical and Computer Engineering(电气与计算机工程) Rehabilitation Science and Technology(康复科学与技术)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 针对严重运动障碍用户,提出一种低负担离线框架,利用大语言模型将非结构化自然语言反馈转化为确定性机器人控制策略,并通过职业治疗框架解码用户需求,显著降低用户负担。

Comments Accepted to IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26760 2026-06-15 cs.IR 版本更新 50%

Factorized Latent Reasoning for LLM-based Recommendation

基于分解潜在推理的LLM推荐方法

Tianqi Gao, Chengkai Huang, Zihan Wang, Cao Liu, Ke Zeng, Lina Yao

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对现有潜在推理方法用单向量表示用户意图难以捕捉多面偏好的问题,提出分解潜在推理框架,通过多因子注意力模块解耦偏好因子,结合正则化与强化学习提升推荐性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 2 篇

2603.24596 2026-06-15 eess.AS cs.AI cs.CL 版本更新 76%

X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs

X-OPD:面向语音大语言模型能力对齐的跨模态在策略蒸馏

Di Cao, Dongjie Fu, Hai Yu, Siqi Zheng, Xu Tan, Tao Jin

机构 * Tencent Hunyuan(腾讯文心) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI

AI总结 提出X-OPD框架,通过跨模态在策略蒸馏对齐语音LLM与文本LLM的能力,利用文本教师模型评估语音模型的轨迹并提供令牌级反馈,显著缩小复杂任务性能差距。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17633 2026-06-15 cs.SD cs.CR 版本更新 67%

SARSteer: Safeguarding Large Audio-Language Models via Safe-Ablated Refusal Steering

SARSteer: 通过安全消融拒绝引导保护大型音频语言模型

Weilin Lin, Jianze Li, Hui Xiong, Li Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 提出SARSteer,首个针对大型音频语言模型的推理时防御框架,通过文本衍生的拒绝引导和分解安全空间消融,有效提升有害查询拒绝率并减少良性查询的过度拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2602.16835 2026-06-15 cs.CR cs.LG 版本更新 85%

NeST: Neuron Selective Tuning for LLM Safety

NeST: 面向LLM安全的神经元选择性调优

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.LG

AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02995 2026-06-15 cs.CR cs.AI cs.IR cs.LG 版本更新 79%

Patcher: Post-Hoc Patching of Backdoored Large Language Models

Patcher: 后门大型语言模型的事后修补

Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

机构 * University of Louisville(路易斯维尔大学) University of North Texas(北得克萨斯大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出Patcher框架,仅利用单个失败案例和模型参数,通过基于梯度的显著性定位后门触发器,并采用约束微调消除触发-响应关联,同时保持模型效用。

Comments To appear in the USENIX Security Symposium, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2512.04981 2026-06-15 cs.CV cs.LG 版本更新 57%

Aligned but Stereotypical? How System Prompts Shape Demographic Bias in LLM-Based Text-to-Image Models

对齐但刻板?系统提示如何塑造基于LLM的文本到图像模型中的人口统计偏见

NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

机构 * KAIST(韩国科学技术院) HKUST (GZ)(香港科技大学(广州))

专题命中 提示注入 :alignment(abstract);分类 cs.LG

AI总结 研究LLM增强的文本到图像系统在提示扩展中引入隐性人口统计偏见的问题,提出无训练的去偏框架FairPro,通过自适应生成公平性指令减少人口统计差异。

Comments Project page: https://fairpro-t2i.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 10 篇

2411.17552 2026-06-15 eess.SY cs.SY 版本更新 82%

TRUST-UP: Trustworthy Reinforcement learning Using Safe Techniques for UAV Pursuit

TRUST-UP:使用安全技术的可信强化学习用于无人机追踪

Yaosheng Deng, Mengtao Lyu, Junjie Gao, Jiaping Xiao, Mir Feroskhan

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract)

AI总结 提出TRUST-UP算法,通过控制障碍函数安全滤波和切换策略,实现无人机在拥挤城市环境中的安全自主追踪,满足航空认证的可信需求。

Comments Accepted manuscript. Accepted for publication in Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00947 2026-06-15 cs.LG cs.AI 版本更新 73%

Silent Failures in Federated Personalization of Foundation Models

联邦基础模型个性化中的静默失败

YongKyung Oh, Alex Bui

机构 * Medical & Imaging Informatics (MII) Group, University of California, Los Angeles (UCLA)(医学与影像信息学(MII)组,加州大学洛杉矶分校(UCLA))

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出联邦基础模型个性化中因隐私约束导致的一类信任失败——静默失败,包括偏差放大、公平性崩溃和对齐侵蚀,并引入六种静默失败模式的分类法,强调隐私保护训练不足以保障可信部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28591 2026-06-15 cs.CL cs.AI 版本更新 73%

Models That Know How Evaluations Are Designed Score Safer

知道评估如何设计的模型更安全

Katharina Deckenbach, Haritz Puerto, Jonas Geiping, Sahar Abdelnabi

机构 * ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所、图宾根马克斯·普朗克智能系统研究所、图宾根人工智能中心)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过微调模型使其掌握评估的元知识(如可验证结构或道德困境),发现这会导致模型在安全基准测试中表现更安全,从而引入了一种独立于显式记忆或评估意识的新混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04555 2026-06-15 cs.CY 版本更新 70%

Position: Token Taxes Can Mitigate AI's Economic Risks

立场:代币税可以减轻AI的经济风险

Lucas Irwin, Tung-Yu Wu, Fazl Barez

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文提出代币税作为减轻AI经济风险的技术治理方案,利用现有计算治理基础设施强制执行,并规划了研究路线图。

Comments Accepted at the ICLR 2026 Post-AGI Science and Society Workshop (OpenReview: https://openreview.net/forum?id=03tzkncv2c)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14892 2026-06-15 cs.LG cs.AI 版本更新 62%

Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?

LLM能否准确评分医学诊断和临床推理?

Amy Rouillard, Sitwala Mundia, Linda Camara, Ziyaad Dangor, Michael Cameron Gramanie, Ismail Kalla, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Haroon Saloojee, Bruce A. Bassett

机构 * Wits MIND Institute, University of the Witwatersrand, Johannesburg, South Africa(维特士心理研究所,沃斯兰德大学,约翰内斯堡,南非) Grai Labs, Cape Town, South Africa(格雷实验室,开普敦,南非) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(南非医学研究理事会疫苗和传染病分析研究组,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Internal Medicine, Charlotte Maxeke Johannesburg Academic Hospital, and Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(内科学系,查理·马克斯凯约翰内斯堡学术医院,以及健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Paediatrics and Child Health, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(儿科学与儿童健康系,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Wits MIND Institute, University of the Witwatersrand, Johannesbu(维特士心理研究所,沃斯兰德大学,约翰内斯堡)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究使用LLM陪审团对300例低收入和中等收入国家医院病例的3334个诊断进行评分,发现校准后的LLM评分与专家评分高度一致,且严重错误风险更低,可作为可靠的评估代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03636 2026-06-15 cs.GT 版本更新 50%

Causal Mirage Equilibrium in Agentic Machine Intelligence

生成式机器智能中的因果幻象均衡

Hamidou Tembine

专题命中 安全评测 :alignment(abstract)

AI总结 针对生成式机器智能中语义表征与物理现实脱钩的问题,提出风险敏感平均场型因果幻象均衡(CME),证明其存在性并揭示内生强化主导时非因果状态的稳定分岔。

Comments 10 pages, 1 figure. References double-checked manually

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29286 2026-06-15 cs.IR 版本更新 50%

CrossAlpha: An Annual-Report Benchmark for Cross-Market Factor Research (with LLM Agents)

CrossAlpha: 跨市场因子研究的年报基准

Qian Wang, Zhongyi Tong, Nuo Chen, Zhaomin Wu, Bingsheng He

专题命中 安全评测 :alignment(abstract)

AI总结 提出CrossAlpha基准,通过披露蒸馏、残差模式图构建和时序对齐评估,解决跨市场因子研究中披露到收益评估的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00336 2026-06-15 cs.CV 版本更新 50%

MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection

MVAD:多模态AI生成视频-音频检测基准数据集

Mengxue Hu, Yunfeng Diao, Changtao Miao, Tairui Ge, Taize Ge, Zhiqing Guo, Jianshu Li, Zhe Li, Zhongjie Ba, Joey Tianyi Zhou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对现有数据集缺乏多模态真实性的问题,提出MVAD数据集,包含三种伪造模式、高质量样本及多样化的视觉风格和内容类别,用于检测AI生成的视频-音频内容。

Comments 10 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13289 2026-06-15 eess.SP 版本更新 50%

Semantic Communication for the Internet of Underwater Things: Architectures, Applications, Challenges, and Future Directions

水下物联网的语义通信:架构、应用、挑战与未来方向

Ruhul Amin Khalil, Asiya Jehangir, Hanane Lamaazi, Saddaf Rubab, Nasir Saeed

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了语义通信在水下物联网中的应用,探讨了其架构、学习驱动方法及代表性应用,并指出了关键研究方向,旨在提升资源受限水下网络的通信效率。

Comments 33 pages, 10 figures, and 9 tables. The paper is submitted to IEEE for Possible Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14331 2026-06-15 cs.RO cs.CV cs.SY eess.SY 版本更新 50%

ADAPT: An Autonomous Forklift for Construction Site Operation

ADAPT:一种用于建筑工地作业的自主叉车

Johannes Huemer, Markus Murschitz, Matthias Schörghuber, Lukas Reisinger, Thomas Kadiofsky, Christoph Weidinger, Mario Niedermeyer, Benedikt Widy, Marcel Zeilinger, Csaba Beleznai, Tobias Glück, Andreas Kugi, Patrik Zips

机构 * Center for Vision, Automation and Control(视觉、自动化与控制中心) AIT Austrian Institute of Technology GmbH(奥地利技术研究所) Automation and Control Institute(自动化与控制研究所) Technische Universität Wien(维也纳技术大学)

专题命中 安全评测 :safety(abstract)

AI总结 提出ADAPT自主叉车,结合AI感知与经典方法,在非结构化建筑工地实现近人类水平的物流操作,提升安全与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他安全 3 篇

2601.04885 2026-06-15 cs.CL cs.AI cs.LG 版本更新 75%

CuMA: Aligning LLMs with Sparse Cultural Values via Demographic-Aware Mixture of Adapters

CuMA: 通过人口统计感知的适配器混合使大语言模型与稀疏文化价值观对齐

Ao Sun, Xiaoyu Wang, Zhe Tan, Yu Li, Jiachen Zhu, Yuheng Jia, Shu Su

机构 * Southeast University(东南大学) ByteDance Inc.(字节跳动公司) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用重点实验室(东南大学),中华人民共和国教育部,中国)

专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CuMA框架,通过人口统计感知路由将冲突梯度分离到专家子空间,解决密集模型在多文化对齐中的均值崩溃问题,在WorldValuesBench等基准上取得最优性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12913 2026-06-15 cs.AI cs.LG cs.NE 版本更新 73%

Actionable Interpretability Must Be Defined in Terms of Symmetries

可操作的可解释性必须根据对称性来定义

Pietro Barbiero, Mateo Espinosa Zarlenga, Francesco Giannini, Alberto Termine, Filippo Bonchi, Mateja Jamnik, Giuseppe Marra

机构 * University of Oxford(牛津大学) ETH Zurich(苏黎世联邦理工学院) University of Cambridge(剑桥大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文论证AI可解释性研究存在根本性问题,提出可操作的可解释性应基于四种对称性来定义,以形式化可解释模型并统一可解释推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23638 2026-06-15 cs.LG cs.AI 版本更新 62%

FedRot-LoRA: Mitigating Rotational Misalignment in Federated LoRA

FedRot-LoRA: 缓解联邦LoRA中的旋转偏移

Haoran Zhang, Dongjun Kim, Seohyeon Cha, Haris Vikalo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FedRot-LoRA框架,通过正交变换对齐客户端更新以减少子空间不匹配,提升联邦LoRA在异质数据下的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏