arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-17 至 2026-06-17 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 11 篇

2606.17872 2026-06-17 cs.LG cs.AI 新提交 86%

AnchorKV: Safety-Aware KV Cache Compression via Soft Penalty with a Refusal Anchor

AnchorKV: 通过拒绝锚点的软惩罚实现安全感知的KV缓存压缩

Ning Ni, Yingjie Lao

机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) Department of Electrical and Computer Engineering, Tufts University(塔夫茨大学电气与计算机工程系)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出AnchorKV,一种通过软惩罚机制调整令牌保留分数以远离有害提示的KV缓存压缩方法,在保持实用性的同时显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16349 2026-06-17 cs.CR 新提交 82%

From Refusal Geometry to Safety Geometry: Harmfulness--Refusal Coupling under Dynamic Adversarial Fine-Tuning

从拒绝几何到安全几何:动态对抗微调下的有害性-拒绝耦合

Wenhao Lan, Shan Li, Xinhua Lai, Meiqi Wu, Junbin Yang, Haihua Shen

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 研究通过双安全几何协议测量语言模型在对抗微调中有害性与拒绝机制的耦合程度,发现R2D2训练早期高耦合带来强鲁棒性但牺牲实用性,后期低耦合恢复部分实用性但攻击成功率回升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08939 2026-06-17 cs.AI 版本更新 79%

CausalT5k: Diagnosing Refusal and Failure Modes in Trustworthy Causal Reasoning Across Causal Rungs

CausalT5k: 诊断可信因果推理中的拒绝与失败模式——跨越因果阶梯

Longling Geng, Andy Ouyang, Theodore Wu, Daphne Barretto, Matthew John Hayes, Rachael Cooper, Yuqiao Zeng, Sameer Vijay, Gia Ancone, Ankit Rai, Matthew Wolfman, Patrick Flanagan, Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 安全训练 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 提出CTK基准,通过5,147个案例诊断大语言模型在因果推理中的失败模式,包括因果阶梯、陷阱类型、压力敏感性和拒绝质量等标注,揭示聚合准确率隐藏的缺陷。

Comments 12 pages, 17 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17526 2026-06-17 cs.LG 新提交 74%

MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization

MGUP:一种用于随机优化的动量-梯度对齐更新策略

Da Chang, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :alignment(title);分类 cs.LG

AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17062 2026-06-17 q-bio.QM cs.LG 新提交 57%

RadSEM: A Finding-by-Finding Metric for Clinical Consistency in Radiology Reports

RadSEM:放射学报告中临床一致性的逐发现指标

Zhenhong Yang, Zhuoyun Liu, Jintao Fei, Wen Tang, Shichao Quan, Jun Zhao, Jun Xu

机构 * JDH Algo, JD Health International Inc., China Department of Big Data in Health Science, The First Affiliated Hospital of Wenzhou Medical University, China Zhejiang Engineering Research Center for Hospital Emergency Department of Intensive Care Unit, The First Affiliated Hospital of Wenzhou Medical University, Wenzhou, Zhejiang, China

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 提出RadSEM指标,通过约束LLM辅助将报告重写为原子发现句,进行矛盾感知的多对多匹配,并计算异常加权的F1分数,在SSREE测试中优于现有指标,实现高一致性评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17539 2026-06-17 cs.CV cs.AI 新提交 57%

Reinforcing Dual-Path Reasoning in Spatial Vision Language Models

空间视觉语言模型中的双路径推理强化

Yatai Ji, An-Chieh Cheng, Yang Fu, Yukang Chen, Han Zhang, Zhaojing Yang, Wei Huang, Ka Chun Cheung, Song Han, Vidya Nariyambut Murali, Pavlo Molchanov, Jan Kautz, Simon See, Hongxu Yin, Ping Luo, Sifei Liu

机构 * The University of Hong Kong(香港大学) NVIDIA(英伟达) University of California, San Diego(加州大学圣迭戈分校)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出SR-REAL框架,通过强化学习融合语言推理和3D检测推理两条路径,显著提升空间VLM在复杂几何推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17405 2026-06-17 cs.AI 新提交 57%

Treatment Response Optimized Clinical Decision Support AI System via Digital Twin Simulation

基于数字孪生模拟的治疗响应优化临床决策支持AI系统

Xinyu Qin, Anil K. Sood, Ruiheng Yu, Sara Corvigno, Elaine Stur, Lu Wang

机构 * The Cancer Genome Atlas (TCGA)(癌症基因组图谱(TCGA))

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出在线自适应框架,结合治疗效果估计、患者数字孪生和强化学习,在安全约束下实时优化治疗推荐,经合成和真实临床数据验证有效且稳定。

Comments Accepted for presentation at the IEEE Engineering in Medicine and Biology Conference (EMBC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25065 2026-06-17 cs.OS cs.AI cs.DC 版本更新 57%

Vulcan: Instance-specialized, Verifiable Systems Heuristics Through LLM-driven Search

Vulcan:通过LLM驱动的搜索实现实例特化的可验证系统启发式方法

Rohit Dwivedula, Divyanshu Saxena, Sujay Yadalam, Eric Hayden Campbell, Daehyeok Kim, Aditya Akella

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出Vulcan框架,利用LLM生成系统启发式方法,通过隔离决策逻辑和受限语言Anvil保证安全,在调度、缓存和内存管理上取得显著性能提升。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17246 2026-06-17 cs.CV cs.MA 新提交 50%

GeoDisaster: Benchmarking Orchestrated Agents for Operational Disaster Geo-Intelligence

GeoDisaster: 用于操作化灾害地理智能的编排智能体基准测试

Maram Hasan, Aman Verma, Savitra Roy, Hariseetharam Gunduboina, Daksh Jain, Muhammad Haris Khan, Subhasis Chaudhuri, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全训练 :alignment(abstract)

AI总结 提出GeoDisaster基准,包含2921个实例和43种问题类型,用于评估遥感视觉语言模型在工具化空间推理和结构化决策方面的能力,并设计多智能体框架RCEA提升工具使用和证据基础。

Comments 28 pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08650 2026-06-17 cs.HC 50%

Fast-Food Intimacy: How Chinese Women Navigate Soul's AI Boyfriend

快餐式亲密:中国女性如何与Soul的AI男友互动

Huiqian Lai, EunJeong Cheon

专题命中 安全训练 :safety(abstract)

AI总结 研究探讨中国女性在Soul平台与AI男友'With-you'建立亲密关系的过程,揭示其快速亲密与文化期望的冲突,以及技术问题和情感劳动分配的影响。

Comments Accepted by DIS 2026

Journal ref Proceedings of the 2026 ACM Designing Interactive Systems Conference (DIS '26), ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06756 2026-06-17 eess.SY cs.SY 版本更新 50%

Generative AI Enabled Robust Sensor Placement in Cyber-Physical Power Systems: A Graph Diffusion Approach

生成式AI赋能的信息物理电力系统鲁棒传感器布置:一种图扩散方法

Changyuan Zhao, Guangyuan Liu, Bin Xiang, Benoit Delinchant, Dong In Kim

专题命中 安全训练 :safety(abstract)

AI总结 提出一种基于图扩散的生成式AI框架,通过经验反馈图扩散算法优化传感器布置,同时提升物理层异常检测和网络层通信韧性,解决信息物理电力系统的NP-hard优化问题。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏