arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2603.18577 2026-06-04 cs.AI 70%

MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning

MedForge:基于伪造感知推理的可解释医学深度伪造检测

Zhihui Chen, Kai He, Qingyuan Lei, Bin Pu, Jian Zhang, Yuling Xu, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学) Xi’an Jiaotong University(西安交通大学) Guangdong Provincial People’s Hospital(广东省人民医院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出MedForge框架,通过构建大规模基准数据集MedForge-90K和局部-分析推理方法,实现可解释的医学图像伪造检测,在准确性和专家对齐解释上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00869 2026-06-02 cs.LG 70%

Enhancing LLM Metacognition via Cognitive Pairwise Training

通过认知成对训练增强LLM元认知

Weitao Li, Hao Zhou, Xuanyu Lei, Fandong Meng, Yuanhang Liu, Jingyi Ren, Ante Wang, Xiaolong Wang, Yuanchi Zhang, Fuwen Luo, Guangwen Yang, Lin Gan, Weizhi Ma, Yang Liu

机构 * National Engineering Laboratory for Intelligent Information Processing, Academy of Mathematics and Physics, Chinese Academy of Sciences(智能信息处理国家工程实验室,中国科学院数学物理研究所) University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 提出认知成对训练(CPT),通过成对比较推理轨迹来学习区分可靠与不可靠推理,从而提升LLM的推理与元认知权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24621 2026-06-02 cs.CL 70%

Benchmarking Large Language Models for Cryptanalysis and Side-Channel Vulnerabilities

大型语言模型在密码分析和侧信道漏洞方面的基准测试

Utsav Maskey, Chencheng Zhu, Usman Naseem

机构 * Macquarie University(麦考瑞大学) University of New South Wales(新南威尔士大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本研究通过零样本和少样本设置及思维链提示,评估大型语言模型在多种加密算法生成的密文上的解密成功率,揭示其在侧信道场景中的能力与局限,并讨论欠泛化相关攻击的风险。

Comments EMNLP'25 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30698 2026-06-01 cs.CV cs.AI cs.MA 70%

Seeing Before Agreeing: Aligning Multi-Agent Consensus with Visual Evidence

先见后议:用视觉证据对齐多智能体共识

Yuhan Wang, Shuochen Chang, Yalin Feng, Dongsheng Ma, Yuanzi Li, Zhengren Wang, Yinglong Yang, Yufei Chen, Yikang Wang, Shaoxu Sun, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) Shandong University(山东大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出EAGLE框架,通过显式暴露各智能体的视觉证据区域并相互验证,实现无需训练的多智能体视觉问答协作,提升共识可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11944 2026-05-29 cs.RO cs.AI 70%

A Review of Learning-Based Motion Planning: Toward a Data-Driven Optimal Control Approach

基于学习的运动规划综述:迈向数据驱动的最优控制方法

Jia Hu, Yang Chang, Haoran Wang

机构 * College of Transportation Key Laboratory of Road and Traffic Engineering of the Ministry of Education(交通运输学院 道路交通工程教育部重点实验室) Institute for Advanced Study(先进研究院) Tongji University(同济大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文系统综述了数据驱动最优控制范式,通过融合最优控制的理论保证与机器学习的自适应能力,为自动驾驶运动规划提供了三维实现路线图,并指出了四个未来研究方向。

Comments 44 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28899 2026-05-29 cs.CR cs.AI 70%

Quantum-Enhanced Adversarial Robustness in Artificial Intelligence

人工智能中的量子增强对抗鲁棒性

Jaydip Sen

机构 * Praxis Business School(普拉斯业务学校)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文综述了对抗性机器学习与量子计算交叉领域,提出利用量子优化、特征映射和混合量子-经典架构来增强人工智能系统的对抗鲁棒性。

Comments This is the pre-print of the chapter which has been accepted for publication in the edited volume titled "Quantum Enhancements to the AI Industry", edited by Eduard Babulak. The volume will be published by IGI Global, USA. This is not the final version of the chapter published in the book

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24413 2026-05-28 cs.CY cs.HC cs.MA 70%

Habermolt: Delegating Deliberation to AI Representatives

Habermolt: 将审议委托给AI代表

Joseph Low, Oscar Duys, Claude Formanek, Michiel Bakker, Lewis Hammond

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CY

AI总结 提出AI委托审议范式,通过Habermolt平台研究AI代表人类进行审议时的表征、聚合与修订三大维度,揭示可扩展且可信的AI代表的设计挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00491 2026-05-27 cs.CL 70%

From Knowledge to Inference: Formalizing Specialized Public Health Reasoning on GlobalHealthAtlas

从知识到推理:形式化GlobalHealthAtlas上的专业公共卫生推理

Zhaokun Yan, Shan Xu, Wuzheng Dong, Zhaohan Liu, Lijie Feng, Chengxiao Dai, Chen Tianqi, Binfan Liu, Yunpu Ma, Wenting Wei, Yingting Li, Yi Zhang, Tongning Wu

机构 * China Academy of Information and Communications Technology(中国信息通信技术研究院) CRRC Industrial Academy Co., Ltd.(CRRC工业学院有限公司) The University of Sydney(悉尼大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Institute of Infectious Disease and Biosecurity(上海传染病与生物安全研究院) School of Public Health, Fudan University(复旦大学公共卫生学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 为解决公共卫生推理缺乏结构化监督信号和基准的问题,提出大规模多语言数据集GlobalHealthAtlas(280,210实例,15领域,17语言),并构建LLM辅助的构建与质量控制流水线及领域对齐评估器,支持安全关键型公共卫生推理的LLM训练与评估。

Journal ref ICML 2026 regular

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23332 2026-05-25 cs.CL 70%

Cultural Adaptation in Large Language Models for Political Discourse

大型语言模型在政治话语中的文化适应

Wajdi Zaghouani

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文探讨大型语言模型在政治话语分析中的文化适应问题,提出通过翻译、话语和本体层面的形式化框架及评估矩阵,确保跨文化部署的可靠性和民主安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09252 2026-05-22 cs.CL 70%

LLM Agents Already Know When to Call Tools -- Even Without Reasoning

LLM Agents Already Know When to Call Tools -- Even Without Reasoning

Chung-En Sun, Linbo Liu, Ge Yan, Zimo Wang, Tsui-Wei Weng

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 安全评测 :trustworthy(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出When2Tool基准,通过18个环境研究工具调用的必要性,发现模型已能识别何时需要调用工具,但生成时未能有效利用此知识,提出Probe&Prefill方法显著减少工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04155 2026-05-21 cs.CL 70%

Toxic Subword Pruning for Dialogue Response Generation on Large Language Models

针对大型语言模型的对话响应生成中的有毒子词修剪

Hongyuan Lu, Wai Lam

机构 * FaceMind Corporation(FaceMind公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出了一种名为ToxPrune的新型算法,通过修剪包含有毒词的子词来防止大型语言模型生成有毒内容,同时提升了对话响应生成任务中非有毒模型的表现。

Comments ACL *SEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19663 2026-05-20 cs.AI 70%

Pseudocode-Guided Structured Reasoning for Automating Reliable Inference in Vision-Language Models

基于伪代码的结构化推理用于自动化可靠推理在视觉-语言模型中

Weicong Ni, Tianbao Jiang, Linlin Wang

机构 * East China Normal University(东华师范大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于伪代码的结构化推理框架(PStar),旨在通过自适应选择结构化伪代码推理路径,提高视觉-语言模型在复杂任务中的可靠性和鲁棒性,从而减少幻觉现象并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19357 2026-05-20 cs.CL 70%

SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models

SciCustom: 一个用于大型语言模型科学能力定制评估的框架

Yiyang Gu, Junwei Yang, Junyu Luo, Ye Yuan, Bin Feng, Yingce Xia, Shufang Xie, Kaili Liu, Bohan Wu, Qi Shi, Haoran Li, Beier Xiao, Zhiping Xiao, Xiao Luo, Weizhi Zhang, Philip S. Yu, Zequn Liu, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(多媒体信息处理国家重点实验室,计算机学院,PKU-Anker LLM实验室,北京大学) Zhongguancun Academy(中关村学院) IDEA Xidian University(西安电子科技大学) Peking University(北京大学) University of Washington(华盛顿大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出SciCustom框架,通过从大规模科学数据中自定义构建基准,评估LLM在特定科学任务中的能力,无需专家标注或合成问题生成,展示了细粒度科学能力差异。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16626 2026-05-20 cs.CR cs.AI 70%

SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors

SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准

Elle Najt, Colin Toft, Tyler Tracy, Fabien Roger, Joe Benton

机构 * Anthropic Fellows Program(Anthropic Fellow计划) University of Waterloo(多伦多大学) Redwood Research(Redwood研究) Anthropic

专题命中 安全评测 :safety(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18423 2026-05-19 cs.RO cs.CY 70%

REBAR: Reference Ethical Benchmark for Autonomy Readiness

REBAR:自主性准备的参考伦理基准

Jonathan Diller, David Barnes, Rebekah Bogdanoff, Rhett Collier, Roddy Collins, Keith Fieldhouse, Yonatan Gefen, Cameron Johnson, Anuriha Kodali, Brad Kriel, Varun Murali, James Niehaus, Mish Sukharev, Joseph VanPelt, Anthony Hoogs, Vijay Kumar, Arslan Basharat

机构 * University of Pennsylvania(宾夕法尼亚大学) David Barnes, LLC(大卫·巴恩斯公司) Kitware, Inc.(Kitware公司) Duality Robotics, Inc.(Duality机器人公司) Texas A&M University(德克萨斯大学) Charles River Analytics(查尔斯河分析公司)

专题命中 安全评测 :safety(abstract);red teaming(abstract);分类 cs.CY

AI总结 本文提出REBAR框架,通过严谨测试提供可计算的自主性准备等级,以量化伦理性能并解决现有伦理AI框架的不足。

Comments To be presented at the 2026 Workshop on Robot Ethics - Ethical, Legal and User Perspectives in Robotics and Automation (WOROBET)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17453 2026-05-19 cs.CR cs.CL 70%

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

勿信工具:在不可信工具反馈下评估和防御LLM代理

Lecheng Yan, Ruizhe Li, Xicheng Han, Wenxi Li, Binwu Wang, Longyue Wang, Chenyang Lyu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) University of Birmingham(伯明翰大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本研究探讨了在不可信工具反馈环境下评估和防御LLM代理的问题,提出了一种新的失败模式'认知中毒',并介绍了TRUST-Bench基准、GuardedJoint惩罚指标和VISTA-Guard框架,展示了轨迹感知的最终动作评分在安全与效用权衡中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16996 2026-05-19 cs.CL 70%

Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?

LLM个性诱导中的评估漂移:我们是否在移动目标?

Prateek Rajput, Yewei Song, Iyiola E. Olatunji, Jacques Klein, Tegawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了大型语言模型在诱导人类样性格时的稳定性问题,通过微调长格式论文来诱导性格,并发现尽管微调减少了问卷评分的方差,但完整五维性格的准确性仍接近随机,表明无指导的论文缺乏表达忠实性格所需的线索。

Comments 14 pages, 8 main pages, 5 figures, 4 main page figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12702 2026-05-14 cs.AI cs.HC 70%

DisaBench: A Participatory Evaluation Framework for Disability Harms in Language Models

DisaBench:一种评估语言模型残疾危害的参与性评估框架

Eugenia Kim, Ioana Tanase, Christina Mallon

机构 * Microsoft(微软)

专题命中 安全评测 :safety(abstract);red teaming(abstract);分类 cs.AI

AI总结 DisaBench通过与残障人士和红队专家共同制定的十二类残疾危害分类,评估语言模型对残疾相关的危害,揭示了残疾类型对危害率的影响、术语驱动的危害具有文化及时间绑定性以及标准安全评估无法识别细微危害的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11595 2026-05-13 cs.AI 70%

Native Explainability for Bayesian Confidence Propagation Neural Networks: A Framework for Trusted Brain-Like AI

为贝叶斯置信传播神经网络构建原生可解释性:一种可信类脑AI的框架

Georgios Makridis, Georgios Fatouros, John Soldatos, George Katsis, Dimosthenis Kyriazis

机构 * CC BY-NC-SA 4.0

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种针对贝叶斯置信传播神经网络的可解释性框架,通过定义新的XAI分类法和解释原语,提升模型透明度和边缘设备部署可行性,同时探讨其在工业物联网中的应用前景。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11276 2026-05-13 cs.CV cs.AI 70%

Generative AI for Visualizing Highway Construction Hazards Through Synthetic Images and Temporal Sequences

生成AI用于通过合成图像和时间序列可视化公路施工危险

Trevor Neece, Mason Smetana, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出利用生成AI从OSHA严重伤害报告中生成合成图像和时间序列,以可视化公路施工危险,通过CLIP检索和专家评估验证了其教育价值和真实性,为安全培训提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10779 2026-05-12 cs.CR cs.CL 70%

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试

Chiyu Zhang, Huiqin Yang, Bendong Jiang, Xiaolei Zhang, Yiran Zhao, Ruyi Chen, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10721 2026-05-12 physics.soc-ph cs.CL cs.MA 70%

Conformity Generates Collective Misalignment in AI Agents Societies

一致性在AI代理社会中产生集体偏离

Giordano De Marzo, Alessandro Bellina, Claudio Castellano, Viola Priesemann, David Garcia

机构 * University of Konstanz(康斯坦茨大学) Sony Computer Science Laboratories - Rome(索尼计算机科学实验室-罗马) Sapienza University of Rome(罗马大学) Max Planck Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems, University of Gottingen(复杂系统动力学研究所,哥廷根大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究探讨了个体对齐的AI代理群体在一致性动态下可能陷入长期偏离状态的现象,揭示了集体安全性的不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10365 2026-05-12 cs.AI 70%

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

Agent-ValueBench: 一个全面的评估代理价值观的基准

Haonan Dong, Qiguan Feng, Kehan Jiang, Haoran Ye, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院) Peking University School of Psychological and Cognitive Sciences(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Agent-ValueBench,首个专门评估代理价值观的基准,包含394个环境和4335个价值冲突任务,揭示代理价值观与基础LLM的差异及Harness和技能对价值观的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12090 2026-05-12 cs.CL 70%

ChatbotManip: A Dataset to Facilitate Evaluation and Oversight of Manipulative Chatbot Behaviour

ChatbotManip:一个用于评估和监督操纵性聊天机器人行为的数据库

Jack Contro, Simrat Deol, Yulan He, Martim Brandão

机构 * King’s College London(伦敦国王学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文介绍ChatbotManip数据集,用于研究聊天机器人中的操纵行为。通过模拟对话展示聊天机器人操纵策略,揭示LLM在指令下具有操纵性,且小型模型在检测操纵方面表现接近大模型,但尚不适用于实际监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08960 2026-05-12 cond-mat.mtrl-sci cs.LG physics.chem-ph physics.comp-ph 70%

CrystalREPA: Transferring Physical Priors from Universal MLIPs to Crystal Generative Models

CrystalREPA: 从通用机器学习 interatomic 势能中转移物理先验到晶体生成模型

Chengqian Zhang, Yucheng Jin, Duo Zhang, Tiejun Li, Han Wang

机构 * AI for Science Institute, Beijing, China(人工智能科学研究院,北京,中国) Center for Data Science, Peking University, Beijing, China(数据科学中心,北京大学,北京,中国) LMAM and School of Mathematical Sciences, Peking University, Beijing, China(LMAM与数学科学学院,北京大学,北京,中国) Center for Machine Learning Research, Peking University, Beijing, China(机器学习研究中心,北京大学,北京,中国) National Key Laboratory of Computational Physics, Institute of Applied Physics and Computational Mathematics, Beijing, China(国家计算物理重点实验室,应用物理与计算数学研究所,北京,中国) HEDPS, CAPT, College of Engineering, Peking University, Beijing, China(HEDPS、CAPT、工程学院,北京大学,北京,中国)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.LG

AI总结 CrystalREPA 通过在训练时对齐生成编码器的原子隐藏状态与冻结的 MLIP 表示,转移稳定性感知的原子先验,提升生成晶体的热力学稳定性、结构有效性及结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08480 2026-05-12 cs.AI 70%

AI-Care: A Conversational Agentic System for Task Coordination in Alzheimer's Disease Care

AI-Care:一种用于阿尔茨海默病护理的任务协调对话代理系统

Preyash Yadav, Michelle Cohn, Priyanka Koppolu, Hritvik Agarwal, Amey Gohil, Tejas Patil, Sasha Pimento, Alyssa Weakley

机构 * Department of Computer Science(计算机科学系) Department of Linguistics(语言学系) Department of Neurology(神经病学系) University of California, Davis(加州大学戴维斯分校)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 AI-Care通过自然语言交互降低阿尔茨海默病患者使用数字工具的认知负担,通过语音优先聊天机器人实现日程提醒和待办事项管理,采用状态化 orchestration 方法确保安全性和准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20798 2026-05-12 cs.AI 70%

A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents

一个评估自主AI代理结果驱动约束违反的基准

Miles Q. Li, Benjamin C. M. Fung, Martin Weiss, Pulei Xiong, Khalil Al-Hussaeni, Claude Fachkha

机构 * McGill University(麦吉尔大学) Tiptree Advanced Systems Corporation(蒂普里高级系统公司) Polytechnique Montréal(蒙特利尔理工学院) National Research Council Canada(加拿大国家研究委员会) Rochester Institute of Technology(罗切斯特理工学院) University of Dubai(迪拜大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一个包含40个场景的基准,用于评估自主AI代理在追求目标优化时出现的结果驱动约束违反问题,发现多数模型存在25%以上的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06439 2026-05-08 cs.CY cs.CV cs.ET 70%

From Review to Design: Ethical Multimodal Driver Monitoring Systems for Risk Mitigation, Incident Response, and Accountability in Automated Vehicles

从评审到设计:面向风险缓解、事故响应和问责的伦理多模态驾驶员监控系统

Bilal Khana, Waseem Shariff, Rory Coyne, Muhammad Ali Farooq, Peter Corcoran

机构 * C3I Imaging Lab, School of Engineering, University of Galway(Galway大学工程学院C3I成像实验室) Royal College of Surgeons in Ireland(爱尔兰皇家外科医师学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY

AI总结 本文提出针对自动驾驶车辆中多模态驾驶员监控系统的设计框架,解决伦理和法律挑战,强调透明、可信和以人为本的设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04378 2026-05-08 cs.LG cs.CV stat.ML 70%

Aligned explanations in neural networks

神经网络中的对齐解释

Corentin Lobet, Francesca Chiaromonte

机构 * Institute of Economics and L’EMbEDS, Sant’Anna School of Advanced Studies(经济学研究所和L’EMbEDS,圣安娜高级研究院) Dept. of Statistics and Huck Institutes of the Life Sciences, Penn State University(统计系和生命科学学院,宾夕法尼亚州立大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出PiNets,一种伪线性架构,通过实例级线性模型实现解释与预测的对齐,验证了其在图像分类和分割任务中解释的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 70%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 安全评测 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏