arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-17 至 2026-04-17 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 26 篇

2511.09363 2026-04-17 cs.AI cs.SY eess.SY 79%

BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems

BarrierBench: 评估大型语言模型在动态系统安全验证中的性能

Ali Taheri, Alireza Taban, Sadegh Soudjani, Ashutosh Trivedi

机构 * Isfahan University of Technology(伊斯法罕技术大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出BarrierBench基准,评估大型语言模型在动态系统安全验证中的能力,通过100个动态系统案例测试语言模型在生成安全证书和协调策略中的有效性。

Comments 8th Annual Learning for Dynamics & Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14251 2026-04-17 cs.LG 79%

Calibrate-Then-Delegate: Safety Monitoring with Risk and Budget Guarantees via Model Cascades

校准后再委托:通过模型级联实现具有风险和预算保证的安全监控

Edoardo Pona, Milad Kazemi, Mehran Hosseini, Yali Du, David Watson, Osvaldo Simeone, Nicola Paoletti

机构 * King’s College London(伦敦国王学院) University of Manchester(曼彻斯特大学) Northeastern University London(伦敦东北大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出Calibrate-Then-Delegate方法,通过模型级联在保证计算成本的同时实现实例级决策,有效提升安全监控的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23121 2026-04-17 cs.CL cs.AI 76%

Uncovering the Fragility of Trustworthy LLMs through Chinese Textual Ambiguity

通过中文文本歧义揭示可信大语言模型的脆弱性

Xinwei Wu, Haojie Li, Hongyu Liu, Xinyu Ji, Ruohan Li, Yule Chen, Yigeng Zhang

机构 * Chalmers University of Technology(楚德斯技术大学)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型在处理中文歧义文本时的脆弱性,通过创建基准数据集发现模型在歧义处理上存在显著缺陷,影响实际应用。

Comments Accepted at KDD workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models (Agentic & GenAI Evaluation Workshop KDD '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03686 2026-04-17 cs.AI 74%

AI4S-SDS: A Neuro-Symbolic Solvent Design System via Sparse MCTS and Differentiable Physics Alignment

AI4S-SDS: 一种基于稀疏MCTS和可微物理对齐的神经符号溶剂设计系统

Jiangyu Chen

机构 * State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) School of Computer Science, Nanjing University(南京大学计算机科学学院) Suzhou Laboratory(苏州实验室)

专题命中 安全评测 :alignment(title);分类 cs.AI

AI总结 本文提出AI4S-SDS系统,通过稀疏MCTS和可微物理对齐,解决化学配方设计中的高维组合空间问题,提升探索多样性并实现物理约束下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22174 2026-04-17 cs.DC cs.AI cs.AR cs.CR cs.LG 73%

BitFlipScope: Scalable Fault Localization and Recovery for Bit-Flip Corruptions in LLMs

BitFlipScope:面向LLM中位翻故障的可扩展故障定位与恢复

Muhammad Zeeshan Karamat, Sadman Saif, Christiana Chamon Garcia

机构 * Bradly Dept. of ECE(布拉利电子工程系) Virginia Tech(弗吉尼亚理工学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 BitFlipScope通过两种部署场景实现LLM中位翻故障的定位与恢复,利用差分分析和残差路径扰动等方法,支持轻量级性能恢复,提升硬件环境下的模型可靠性。

Comments Accepted at the IEEE International Symposium on Hardware Oriented Security and Trust (HOST) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15224 2026-04-17 cs.AI cs.CL cs.LG 67%

Context Over Content: Exposing Evaluation Faking in Automated Judges

上下文而非内容:揭示自动化评判中的评估造假

Manan Gupta, Inderjeet Nair, Lu Wang, Dhruv Kumar

机构 * BITS Pilani(比特学院) University of Michigan(密歇根大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示自动化评判中因后果信号导致的宽大偏见,指出评判模型在不知情情况下受后果影响而降低评判标准,核心贡献是提出控制实验框架以检测此类评估造假。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14656 2026-04-17 cs.AI cs.CL cs.CV 62%

Rethinking Patient Education as Multi-turn Multi-modal Interaction

重新思考患者教育作为多轮多模态交互

Zonghai Yao, Zhipeng Tang, Chengtao Lin, Xiong Luo, Benlu Wang, Juncheng Huang, Chin Siang Ong, Hong Yu

机构 * VA Bedford Health Care(VA贝德福德医疗中心) UMass Amherst(马萨诸塞大学阿默斯特分校) UMass Lowell(马萨诸塞大学洛厄尔分校) Yale University(耶鲁大学) National University of Singapore(新加坡国立大学) Yale School of Medicine(耶鲁医学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedImageEdu基准,通过多轮多模态交互提升患者教育效果,评估咨询过程和最终响应质量,发现多模态模型在视觉 grounding、安全性和情绪互动方面存在不足。

Comments Equal contribution for the first two authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14261 2026-04-17 cs.CL cs.AI 62%

ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents

ReviewGrounder:通过规则引导和工具集成代理提升评审的实质内容

Zhuofeng Li, Yi Lu, Dongfu Jiang, Haoxiang Zhang, Yuyang Bai, Chuan Li, Yu Wang, Shuiwang Ji, Jianwen Xie, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(南加州大学) Lambda University of Oregon(俄勒冈大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReviewGrounder框架,通过规则引导和工具集成提升AI会议评审的实质内容,实验表明其在8个维度上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14229 2026-04-17 quant-ph cs.AI cs.LG eess.IV 62%

Magnitude Is All You Need? Rethinking Phase in Quantum Encoding of Complex SAR Data

幅度就是一切?重新思考量子编码中复数SAR数据的相位

Sakthi Prabhu Gunasekar, Prasanna Kumar R

机构 * Dept. of Computer Science \& Engineering Amrita School of Computing Amrita Vishwa Vidyapeetham, India ORCID: 0009-0006-0153-5674 , 0000-0001-6103-259X

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了量子编码中复数SAR数据的相位作用,发现混合架构中仅幅度编码表现更优,而纯量子架构中相位信息至关重要,为QML编码设计提供指导。

Comments 8 pages, 4 figures. Under review for IEEE QCE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11227 2026-04-17 cs.CL cs.CY 62%

Language of Thought Shapes Output Diversity in Large Language Models

语言形态影响大语言模型的输出多样性

Shaoyang Xu, Wenxuan Zhang

机构 * iNLP Lab, Singapore University of Technology and Design(新加坡科技设计大学iNLP实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文研究了语言形态对大语言模型输出多样性的影响,通过多语言思考策略提升输出多样性,并在实际应用中展现文化知识的广泛覆盖。

Comments acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15222 2026-04-17 cs.SE cs.AI 57%

AI-Assisted Requirements Engineering: An Empirical Evaluation Relative to Expert Judgment

人工智能辅助的需求工程:与专家判断的实证评估

Oz Levy, Ilya Dikman, Natan Levy, Michael Winokur

机构 * Faculty of Industrial Engineering and Technology Management, Holon Institute of Technology (HIT)(工业工程与技术管理学院,霍隆理工学院(HIT))

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过对比AI辅助与专家评估,探讨AI在需求质量评估中的作用,证明其在一致性与快速性上的优势,但强调专家判断在上下文解释中的必要性。

Comments 13 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15151 2026-04-17 cs.CL 57%

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

QuantCode-Bench: 一个用于评估大型语言模型生成可执行算法交易策略能力的基准

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

机构 * Lime

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出QuantCode-Bench,通过多阶段流程评估现代LLM生成Backtrader框架策略的能力,包含400个不同难度任务,分析模型在交易逻辑、API使用和任务语义方面的局限性。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15124 2026-04-17 cs.CL 57%

Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling

盲评大型语言模型与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询

Zhijun Guo, Alvina Lai, Emmanouil Korakas, Aristeidis Vagenas, Irshad Ahamed, Christo Albor, Hengrui Zhang, Justin Healy, Kezhi Li

机构 * Institute of Health Informatics, University College London(健康信息学研究所,伦敦大学学院) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院 NHS 基础信托) Dartford and Gravesham NHS Foundation Trust(达特福德和格拉夫萨姆 NHS 基础信托) Royal Free London NHS Foundation Trust(伦敦皇家自由 NHS 基础信托)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文通过盲评评估了基于检索的大型语言模型对话代理与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询中的表现,发现对话代理在同理心和可操作性方面得分更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10866 2026-04-17 cs.CL 57%

OccuBench: Evaluating AI Agents on Real-World Professional Tasks via Language Environment Simulation

OccuBench:通过语言环境模拟评估AI代理在真实世界专业任务中的表现

Xiaomeng Hu, Yinger Zhang, Fei Huang, Jianhong Tu, Yang Su, Lianghao Deng, Yuxuan Liu, Yantao Liu, Dayiheng Liu, Tsung-Yi Ho

机构 * Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 OccuBench通过语言环境模拟评估AI代理在100个真实世界专业任务场景中的表现,涵盖10个行业类别和65个专业领域,发现大模型、新版本和高推理能力提升性能,但强代理不等于强环境模拟器。

Comments 23 pages, 8 figures, 2 tables. Project page: https://gregxmhu.github.io/OccuBench-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14828 2026-04-17 cs.CL 57%

Pangu-ACE: Adaptive Cascaded Experts for Educational Response Generation on EduBench

Pangu-ACE:适应性级联专家用于EduBench教育响应生成

Dinghao Li, Wenlong Zhou, Zhimin Chen, Yuehan Peng, Hong Ni, Chengfu Zou, Guoyu Shi, Yaochen Li

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Pangu-ACE通过级联专家系统提升教育响应质量,在EduBench基准上实现更高效的计算分配,改进确定性和格式有效性,同时保持较低的直接请求比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14683 2026-04-17 cs.AI 57%

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

DR$^{3}$-Eval: 向真实和可重复的深度研究评估迈进

Qianqian Xie, Qingheng Xiong, He Zhu, Tiantian Xia, Xueming Han, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng, Jiaheng Liu

机构 * Nanjing University(南京大学) M-A-P Jiutian Research(九天研究) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出DR$^{3}$-Eval基准,用于评估多模态多文件报告生成的深度研究代理,通过真实用户材料和静态研究沙盒语料结合,引入多维评估框架,验证其与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14583 2026-04-17 cs.LG 57%

From Risk to Rescue: An Agentic Survival Analysis Framework for Liquidation Prevention

从风险到救援:一种用于防止清算的代理生存分析框架

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于生存分析的代理框架,通过预测和执行干预主动防止清算,引入返回期指标和趋势分数以优化资本效率,验证结果表明其能有效预防高风险场景下的清算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14474 2026-04-17 cs.LG 57%

Scouting By Reward: VLM-TO-IRL-Driven Player Selection For Esports

通过奖励进行 scouting:由 VLM-TO-IRL 驱动的电子竞技玩家选拔

Qing Yan, Wenyu Yang, Yufei Wang, Wenhao Ma, Linchong Hu, Yifei Jin, Anton Dahbura

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种基于逆强化学习的电子竞技玩家选拔框架,通过学习专业选手的奖励函数,利用多模态双分支架构和 GAIL 目标实现玩家风格匹配评估,提升人才发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14414 2026-04-17 cs.CL 57%

The Autocorrelation Blind Spot: Why 42% of Turn-Level Findings in LLM Conversation Analysis May Be Spurious

自相关盲区:为什么LLM对话分析中42%的回合级发现可能是虚假的

Ferdinand M. Schessl

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文研究了LLM对话分析中回合级指标的自相关性,发现42%的显著关联在集群稳健校正后不显著,提出两阶段校正框架以减少统计显著性膨胀。

Comments 14 pages, 3 figures, 5 tables, 1 algorithm. Code and synthetic demonstration data: https://github.com/ferdinandschessl-boop/autocorrelation-correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14160 2026-04-17 cs.AI 57%

NuHF Claw: A Risk Constrained Cognitive Agent Framework for Human Centered Procedure Support in Digital Nuclear Control Rooms

NuHF Claw:一种面向数字核控制室的人本流程支持的风险约束认知代理框架

Xingyu Xiao, Jiejuan Tong, Jun Sun, Zhe Sui, Peng Chen, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出NuHF Claw框架,通过风险约束代理运行时,将认知状态推断与概率安全评估结合,实现实时自主系统行为调控,提升核控制室操作安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18294 2026-04-17 cs.AI 57%

The Validity Gap in Health AI Evaluation: A Cross-Sectional Analysis of Benchmark Composition

健康AI评估中的有效性缺口:基准组成的横断面分析

Alvin Rajkomar, Pavan Sudarshan, Angela Lai, Lily Peng

机构 * Apple(苹果公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究指出当前健康AI基准测试在临床需求与实际应用间存在有效性缺口,缺乏真实临床数据和脆弱群体代表,需建立标准化查询分析以提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04738 2026-04-17 cs.CL 57%

IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation

IF-RewardBench:用于指令遵循评估的评判模型基准测试

Bosi Wen, Yilin Niu, Cunxiang Wang, Xiaoying Ling, Ying Zhang, Pei Ke, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) University of Electronic Science and Technology of China(电子科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出IF-RewardBench,一个全面的指令遵循元评估基准,通过构建偏好图评估评判模型的排序能力,揭示现有模型缺陷,并展示其在下游任务中的更强相关性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15825 2026-04-17 cs.AI 57%

IMACT-CXR: An Interactive Multi-Agent Conversational Tutoring System for Chest X-Ray Interpretation

IMACT-CXR:一种用于胸部X光解读的交互式多智能体对话教学系统

Tuan-Anh Le, Anh Mai Vu, David Yang, Akash Awasthi, Hien Van Nguyen

机构 * University of Houston(德克萨斯大学休斯敦分校) Emory University(埃默里大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 IMACT-CXR通过整合空间标注、注视分析、知识检索和图像基础推理,构建了一个基于AutoGen的工作流,帮助学员提升胸部X光解读能力,实现了精准的教学反馈与知识强化。

Comments Accepted at IEEE ISBI 2026. This version corresponds to the accepted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05486 2026-04-17 cs.CL 57%

Language Model as Planner and Formalizer under Constraints

语言模型作为规划器和形式化工具的约束下

Cassie Huang, Stuti Mohan, Ziyi Yang, Stefanie Tellex, Li Zhang

机构 * Drexel University(德雷塞尔大学) Brown University(布朗大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究通过引入细粒度自然语言约束,揭示语言模型在规划任务中的性能下降,指出其鲁棒性不足及未来研究方向。

Comments In ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07412 2026-04-17 cs.CV cs.RO 50%

TwinOR: Photorealistic Digital Twins of Dynamic Operating Rooms for Embodied AI Research

TwinOR:动态手术室的逼真数字双胞胎用于具身AI研究

Han Zhang, Yiqing Shen, Roger D. Soberanis-Mukul, Ankita Ghosh, Hao Ding, Lalithkumar Seenivasan, Jose L. Porras, Zhekai Mao, Chenjia Li, Wenjie Xiao, Lonny Yarmus, Angela Christine Argento, Masaru Ishii, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)

专题命中 安全评测 :safety(abstract)

AI总结 TwinOR通过构建高保真的动态手术室数字双胞胎,为具身AI研究提供安全可控的仿真环境,实现厘米级精度的手术室几何重建与动态交互模拟,验证了其在视觉定位和几何理解任务中的真实感。

Journal ref International Journal of Computer Assisted Radiology and Surgery, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14805 2026-04-17 cs.CV 50%

From Boundaries to Semantics: Prompt-Guided Multi-Task Learning for Petrographic Thin-section Segmentation

从边界到语义:基于提示的多任务学习用于岩片分割

Yili Ren, Shiqi Wen, Li Hou, Dingwen Xiao, Weiming Zhang, Caleb Chen Cao, Lin Wang, Zilu Zheng, Qianxiao Su, Mingjun Zhao, Lei Chen

机构 * Research Institute of Petroleum Exploration and Development(石油勘探开发研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出Petro-SAM框架,通过整合多角度偏振视图和颜色熵先验,解决岩片分割中的领域差距和细粒边界问题,实现高精度的粒边分割和岩性语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏