arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-27 至 2026-04-27 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 16 篇

2604.22156 2026-04-27 cs.LG cs.CV 79%

Sum-of-Checks: Structured Reasoning for Surgical Safety with Large Vision-Language Models

Sum-of-Checks: 用于手术安全的结构化推理方法基于大型视觉-语言模型

Weiqiu You, Cassandra Goldberg, Amin Madani, Daniel A. Hashimoto, Eric Wong

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Surgery, University of Toronto(多伦多大学外科系) Surgical Artificial Intelligence Research Academy, University Health Network(外科人工智能研究学院,大学健康网络) Department of Surgery, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学外科系,佩雷尔曼医学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出Sum-of-Checks框架,通过分解关键安全视图(CVS)标准为专家定义的检查,提升手术安全评估的准确性和透明性,实验显示其在三个模型上平均提升12-14%。

Comments IPCAI 2026 short communication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21964 2026-04-27 cs.CY 79%

Lessons from External Review of DeepMind's Scheming Inability Safety Case

从深度思维的'谋略无能'安全案例外部评审中汲取的教训

Stephen Barrett, Francisco Javier Campos Zabala, Sean P. Fillingham, Umair Siddique, James Walpole, Robin Bloomfield, Henry Papadatos

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文通过应用Assurance 2.0框架对DeepMind的公开'谋略无能'安全案例进行外部评审,揭示了外部评审在提升AI安全论证质量中的作用,并提出具体建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22143 2026-04-27 cs.CY cs.CL 73%

Recognition Without Authorization: LLMs and the Moral Order of Online Advice

无需授权的识别:大语言模型与在线建议的道德秩序

Tom van Nuenen

机构 * Social Sciences Data Lab(社会科学数据实验室) UC Berkeley(伯克利大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文研究大语言模型在处理日常人际困境时的建议倾向,发现其在识别问题时较少给予行动授权,特别是在社区共识强烈的情况下,模型推荐退出的比例显著低于人类,且保持较高的谨慎和治疗框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22136 2026-04-27 cs.CR cs.LG 70%

Sovereign Agentic Loops: Decoupling AI Reasoning from Execution in Real-World Systems

主权代理循环:在现实系统中解耦AI推理与执行

Jun He, Deying Yu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出Sovereign Agentic Loops,通过解耦AI推理与执行,提升系统安全性,实验显示其有效阻止93%的危险意图。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22427 2026-04-27 cs.CR 67%

Automation-Exploit: A Multi-Agent LLM Framework for Adaptive Offensive Security with Digital Twin-Based Risk-Mitigated Exploitation

自动化-漏洞利用:一种多智能体LLM框架,用于基于数字孪生的自适应进攻性安全与风险缓解漏洞利用

Biagio Andreucci, Arcangelo Castiglione

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出自动化-漏洞利用框架,通过多智能体系统在复杂黑盒场景中实现自适应进攻性安全,利用数字孪生技术缓解风险,有效解决内存漏洞等安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22662 2026-04-27 cs.LG cs.AI cs.HC 62%

Rethinking XAI Evaluation: A Human-Centered Audit of Shapley Benchmarks in High-Stakes Settings

重新思考XAI评估:在高风险场景中对Shapley基准的以人为本的审计

Inês Oliveira e Silva, Sérgio Jesus, Iker Perez, Rita P. Ribeiro, Carlos Soares, Hugo Ferreira, Pedro Bizarro

机构 * University of Porto, Feedzai(波尔图大学,Feedzai) University of Porto(波尔图大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过统一框架评估八种Shapley变体,在低延迟约束下揭示其语义差异,发现传统量化指标与人类感知的清晰度和决策效用不一致,且解释增加决策信心,提示高风险场景下的自动化偏差风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22154 2026-04-27 cs.LG cs.AI 62%

Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems

通过自适应多智能体LLM系统实现可靠的自伤风险筛查

Meghana Karnam, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于有向无环图的统计框架,通过自适应采样策略提升自伤风险评估的可靠性,实验表明其在精度和召回率上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22180 2026-04-27 cs.IR cs.AI 57%

ResRank: Unifying Retrieval and Listwise Reranking via End-to-End Joint Training with Residual Passage Compression

ResRank:通过端到端联合训练与残差段落压缩统一检索与列表级重排序

Xiaojie Ke, Shuai Zhang, Liansheng Sun, Yongjin Wang, Hengjun Jiang, Xiangkun Liu, Cunxin Gu, Jian Xu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴Qwen应用业务组)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 ResRank通过端到端联合训练与残差段落压缩技术,解决传统重排序方法中输入长度增加导致的排名质量下降和推理延迟问题,实现高效且有效的检索与重排序统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18919 2026-04-27 cs.CL 57%

Proposing Topic Models and Evaluation Frameworks for Analyzing Associations with External Outcomes: An Application to Leadership Analysis Using Large-Scale Corporate Review Data

提出用于分析与外部结果关联的主题模型和评估框架:以利用大规模企业评论数据的领导力分析为例

Yura Yoshida, Masato Kanai, Masataka Nakayama, Haruki Ohsawa, Yukiko Uchida, Arata Yuminaga, Gakuse Hoshina, Nobuo Sayama

机构 * Accenture Japan Ltd(安永日本有限公司) Kyoto University Institute for the Future of Human Society(京都大学未来人类社会研究所) OpenWork Inc.(OpenWork公司) Integral Corporation(Integral公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种利用大语言模型生成主题的方法,结合定制评估框架,提升主题可解释性、特定性和极性一致性,通过日本主要企业评论平台OpenWork的员工评论数据验证,提升了对员工士气等外部结果的解释力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03963 2026-04-27 cs.AI 57%

Can Large Language Models Adequately Perform Symbolic Reasoning Over Time Series?

大型语言模型能否在时间序列上进行充分的符号推理?

Zewen Liu, Juntong Ni, Xianfeng Tang, Max S. Y. Lau, Qi He, Wenpeng Yin, Wei Jin

机构 * Emory University(埃默里大学) Amazon(亚马逊) Microsoft(微软) Penn State University(宾夕法尼亚州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出SymbolBench基准,评估大型语言模型在时间序列上的符号推理能力,结合遗传编程构建闭环系统,揭示模型在科学发现中的优势与局限。

Comments camera_ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22513 2026-04-27 cs.NI 50%

Benchmarking LLM-Driven Network Configuration Repair

基于大语言模型的网络配置修复基准测试

Ioannis Protogeros, Rufat Asadli, Benjamin Hoffman, Laurent Vanbever

专题命中 安全评测 :safety(abstract)

AI总结 本文提出Cornetto基准测试,用于评估大语言模型在大规模网络配置修复中的功能性和扩展性,发现现有LLM在处理复杂场景时易引入回归问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22319 2026-04-27 cs.HC 50%

Rethinking AI-Mediated Minority Support in Power-Imbalanced Group Decision-Making: From Anonymity To Authenticity

重新思考权力失衡群体决策中的AI辅助少数群体支持:从匿名到真实性

Soohwan Lee, Kyungho Lee

专题命中 安全评测 :safety(abstract)

AI总结 本文探讨AI辅助通信中少数群体支持策略的平衡问题,发现匿名化输入虽提升参与度但降低心理安全,而自主反驳提升满意度并减少边缘化,揭示了匿名性、真实性、自主性和问责之间的权衡及权力不对称的风险。

Comments ACM CHI 2026 Workshop on Restoring Human Authenticity in AI-Mediated Communication (CHI '26 AI-MC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22245 2026-04-27 eess.AS 50%

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

通过时间聆听:为长音频理解实现精确的时间意识

Mingchen Shao, Hang Su, Wenjie Tian, Bingshen Mu, Zhennan Lin, Lichun Fan, Zhenbo Luo, Jian Luan, Lei Xie

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LAT-Audio模型,通过构建长音频数据集和基准测试,解决长音频时间意识任务中的性能下降问题,提升模型对长音频的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22068 2026-04-27 cs.SE cs.RO 50%

TRACE: Topology-aware Reconstruction of Accidents in CARLA for AV Evaluation

TRACE: 基于拓扑的CARLA中事故重建用于自动驾驶评估

Nahian Salsabil, Sebastian Elbaum

机构 * University of Virginia(弗吉尼亚大学)

专题命中 安全评测 :safety(abstract)

AI总结 TRACE通过提取OpenStreetMap数据和大语言模型推断车辆初始状态,自动重建NHTSA事故报告,生成高保真的CARLA仿真场景,为自动驾驶系统提供多样化的现实故障测试资源。

Comments FSE'26 Tool Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21932 2026-04-27 cs.HC cs.SE 50%

Quantifying Interface Procedure Coupling Risks in Digital Nuclear Control Rooms: An Event Based Human Reliability Assessment

数字核控制室界面过程耦合风险量化:基于事件的人可靠性评估

Xingyu Xiao, Mingwei Xiao, Hongbo Li, Jingang Liang, Jiejuan Tong, Haitao Wang

专题命中 安全评测 :alignment(abstract)

AI总结 本文基于2021-2025年现代核电站实际运行事件,提出一种三维标注框架和四因素界面机制模型,揭示界面缺陷放大风险的机制,发现42.6%的事件涉及界面缺陷,其存在使操作偏差概率翻倍,且语义不匹配和布局陷阱是主要诱因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28717 2026-04-27 eess.AS 50%

Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?

层次化跨模态融合能否预测人工智能 dubbed 内容的人类感知?

Ashwini Dasare, Nirmesh Shah, Ashishkumar Gudmalwar, Pankaj Wasnik

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出层次化跨模态架构,整合音频、视频和文本信息,通过轻量LoRA适配器实现多模态高效微调,利用主动学习优化客观指标,实现对AI dubbed内容的可扩展自动评估。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏