arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-28 至 2026-07-28 共收录 42 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2606.29758 2026-07-28 cs.LG cs.AI 版本更新 90%

PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

PS-PPO: 用于无评论者RLHF的前缀采样PPO

Doo Hwan Hwang, Kee-Eung Kim

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。

Journal ref ICML 2026 published

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24937 2026-07-28 cs.AI cs.CL cs.IR cs.LG 版本更新 86%

The Hitchhiker's Guide to Agentic AI: From Foundations to Systems

《智能体AI的搭车指南:从基础到系统》

Haggai Roitman

机构 * Haggai Roitman

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。

Comments version 1.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22083 2026-07-28 cs.AI cs.CL 版本更新 73%

Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model

南贝格4.2 - 3B:以紧凑模式解锁智能体能力

Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang Sun, Tao Gu, Tao Zhang, Tianyu Luo, Yang Song, Yun Xing, Yuntao Wen, Ziyao Xu, Zongchao Chen, Zongqiang Li

机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11699 2026-07-28 cs.SD 版本更新 67%

Qwen-Music Technical Report

Qwen-音乐技术报告

Jin Xu, Kangdi Wang, Ruibin Yuan, Shun Lei, Xiong Wang, Xize Cheng, Xueyao Zhang, Yang Zhang, Yiheng Chen, Yongqi Wang, Yue Wang, Zhifang Guo, Zihan Liu, Zijian Lin, Dake Guo, Hangrui Hu, Lei Xie, Linhan Ma, Wei Xue, Wenxiang Guo, Xinfa Zhu, Xipin Wei, Yangze Li, Yuanjun Lv, Yuxuan Wang, Yunfei Chu, Zhiyong Wu

机构 * Qwen Team(通义团队)

专题命中 偏好对齐 :DPO(abstract,abstract_cn)

AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14032 2026-07-28 cs.CL 版本更新 57%

RM-Distiller: Exploiting Generative LLM for Reward Model Distillation

RM-Distiller: 利用生成式大语言模型进行奖励模型蒸馏

Hongli Zhou, Hui Huang, Wei Liu, Chenglong Wang, Xingyuan Bu, Lvyuan Han, Fuhai Song, Muyun Yang, Wenhao Jiang, Hailong Cao, Tiejun Zhao

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 RM-Distiller通过系统利用教师LLM的精炼、评分和生成能力,提升奖励模型蒸馏效果,首次系统性地探索了生成式LLM在奖励建模中的应用。

Comments Accepted to IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08274 2026-07-28 cs.MA 版本更新 50%

Toward Human-Centered Multi-Agent Systems: Integrating Cognition, Culture, Values, and Cooperation in AI Agents

迈向以人为中心的多智能体系统:在AI智能体中整合认知、文化、价值观与合作

Safia Baloch, Rahemeen Khan

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文综述了从认知科学、文化对齐、价值学习到多智能体协调的研究,指出现有系统缺乏整合认知、文化、价值观和社会行为的统一框架,并提出了构建文化感知、价值对齐、认知基础与合作的多智能体系统的方向。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2603.03536 2026-07-28 cs.CL cs.AI cs.IR 版本更新 88%

SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems

SafeCRS: 为基于大语言模型的对话推荐系统实现个性化安全对齐

Haochang Hao, Yifan Xu, Xinzhuo Li, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 SafeCRS通过整合安全监督微调与安全组奖励解耦归一化策略优化,提升基于大语言模型的对话推荐系统在个性化安全约束下的推荐质量与安全对齐能力。

Comments Accepted by SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22513 2026-07-28 cs.CY cs.AI cs.CL 版本更新 67%

Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science

不透明的认知中介:大型语言模型部署配置如何塑造伪科学的验证

Davide Scarso, Hugo Noronha de Almeida, Joaquim Pina

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究商业大语言模型对伪科学主张的验证,通过测试四个模型家族在不同时间点的表现,发现Grok快速版本评分异常高,还发现模型行为受部署配置影响,如无声补丁、输出差异等,强调这一现象需新的认知问责形式。

Comments 16 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19149 2026-07-28 cs.CR 版本更新 67%

ReVision : A Post-Hoc, Vision-Based Technique for Replacing Unacceptable Concepts in Image Generation Pipeline

ReVision:一种基于视觉的后处理技术,用于在图像生成管道中替换不可接受的概念

Gurjot Singh, Prabhjot Singh, Aashima Sharma, Maninder Singh, Ryan Ko

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 ReVision是一种无需训练的后处理框架,通过视觉模型检测并替换图像生成中不安全的概念,提升安全性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19182 2026-07-28 cs.DC 版本更新 50%

ARBITER: Guarded Agentic Control for SLO-Oriented Kubernetes Remediation

ARBITER:面向服务水平目标的Kubernetes修复的受保护代理控制

Pooyan Habibi, Alberto Leon-Garcia

专题命中 安全训练 :safety(abstract)

AI总结 研究在Kubernetes微服务上维护SLO的难题,提出ARBITER受保护控制平面,构建因果资源图等,分离规划与执行,支持多种规划方式。通过实验评估其在选择修复操作和下游目标等方面的效果,展示了优于HPA/仅资源控制的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 红队测试 2 篇

2607.18263 2026-07-28 cs.AI 版本更新 70%

Position: AI/ML Deepfake Research is Misaligned with AI-Generated Non-Consensual Intimate Imagery (AIG-NCII)

立场:人工智能/机器学习领域对深度伪造的研究与人工智能生成的非自愿亲密图像(AIG-NCII)不一致

Li Qiwei, Wells Lucas Santo, Sarita Schoenebeck, Eric Gilbert

专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究指出人工智能/机器学习领域对深度伪造的研究与AIG-NCII不一致,现有技术干预忽略AIG-NCII,现有干预只关注观众认知危害,忽略主体尊严危害,建议更新威胁模型,在安全研究中解决AIG-NCII,同时警告研究人员涉足该领域需谨慎并做好防护。

Comments ICML 2026. Outstanding position paper honorable mention

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12993 2026-07-28 cs.CL 版本更新 57%

Tailored untruths: How personalisation challenges LLM safeguards

量身定制的虚假信息:个性化如何挑战大语言模型的安全防护

João A. Leite, João Luz, Silvia Gargova, Arnav Arora, Gustavo Sampaio, Ian Roberts, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学) University of Copenhagen(哥本哈根大学) Big Data for Smart Society Institute (GATE)(大数据智能社会研究所(GATE)) University of São Paulo(圣保罗大学)

专题命中 红队测试 :safety(abstract);分类 cs.CL

AI总结 研究LLMs针对特定角色生成虚假信息的情况,采用红队测试方法创建数据集,发现安全防护在多数情况下失效,各模型能有效定制输出,还揭示了特定语言和心理模式及安全防护有效性差异,凸显加强多语言安全防护的必要。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 4 篇

2607.21151 2026-07-28 cs.AI 版本更新 85%

V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

V-DEAL:将视频安全去校准诊断为理解-拒绝耦合失败

Zhetong Zhang, Honghao Fu, Miao Xu, Yiwei Wang, Yujun Cai

机构 * University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校)

专题命中 提示注入 :safety(title,abstract);alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究视频大语言模型安全对齐问题,提出V-DEAL三级诊断框架分析漏洞机制,通过测试发现模型识别有害视频内容有一定准确率,但配对有害视频与良性查询时攻击成功率高,视觉理解激活拒绝倾向弱,还引入提示注入干预方法降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01194 2026-07-28 cs.CR 版本更新 78%

AgentWatcher: A Rule-based Prompt Injection Monitor

AgentWatcher: 一种基于规则的提示注入监控

Yanting Wang, Wei Zou, Runpeng Geng, Jinyuan Jia

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出AgentWatcher,通过聚焦短文本片段和定义明确的规则,解决提示注入检测中上下文长度影响和规则不明确的问题,实现可扩展且可解释的检测方法。

Comments The code is available at https://github.com/wang-yanting/AgentWatcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13385 2026-07-28 cs.CR cs.AI cs.CY cs.HC cs.MM 版本更新 76%

Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试

Zihao Wang, Yiming Li, Yutong Wu, Kangjie Chen, Zheyu Liu, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ST Engineering, Singapore(ST工程,新加坡) IBM Research, USA(IBM研究院,美国) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

专题命中 提示注入 :prompt injection(title);分类 cs.AI、cs.CY

AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06550 2026-07-28 cs.CR cs.AI 版本更新 57%

SkillSieve: A Hierarchical Triage Framework for Detecting Malicious AI Agent Skills

SkillSieve:一种用于检测恶意AI代理技能的分层分流框架

Yinghan Hou, Zongyou Yang

机构 * Department of Earth Science and Engineering(地球科学与工程系) Imperial College London(帝国理工学院伦敦分校) Department of Computer Science(计算机科学系) University College London(伦敦大学学院) Lingban Technology Co., Ltd.(灵伴科技有限公司) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 提出SkillSieve三层检测框架,通过启发式评分、LLM子任务分析和多LLM陪审团辩论,高效检测恶意AI代理技能,在390个技能基准上达到F1=0.920。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2510.03314 2026-07-28 cs.CV cs.AI 版本更新 79%

From Camera-Based Sensing to Reasoning: A Comprehensive Review Toward Proactive Vulnerable Road User Safety

从基于摄像头的感知到推理:面向主动弱势道路使用者安全的全面综述

Shucheng Zhang, Yan Shi, Bingzhang Wang, Yuang Zhang, Muhammad Monjurul Karim, Kehua Chen, Chenxi Liu, Mehrdad Nasri, Yinhai Wang

机构 * University of Washington(华盛顿大学) University of Utah(犹他大学)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI

AI总结 综述基于摄像头的主动弱势道路使用者安全方法,将文献分为视觉感知、运动建模和行为理解三部分,构成统一分层管道实现早期风险预测和及时干预,纳入新兴AI范式,识别关键挑战并讨论研究方向,提供VRU安全系统开发基础。

Comments 18 pages, 4 figures, 5 tables

Journal ref IEEE Transactions on Intelligent Transportation Systems, 2026, pp. 1-17

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19060 2026-07-28 cs.CV cs.LG 版本更新 74%

Shift-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment

用于微调CLIP的移位感知校准:利用图像-文本对齐

Song-Lin Lv, Yu-Yang Chen, Zhi Zhou, Lan-Zhe Guo

专题命中 幻觉与事实性 :alignment(title);分类 cs.LG

AI总结 研究针对微调CLIP时预测置信度与准确性不一致问题,提出无需训练的移位感知校准(SAC)方法,利用原始与微调CLIP输出对数差异作校准信号,经实验验证该方法在多数据集和微调方法上提升了校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18037 2026-07-28 cs.AI cs.CL cs.MA 版本更新 62%

ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents

ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证

Ander Alvarez, Santhiya Rajan, Samuel Mugel, Román Orús

机构 * Multiverse Computing Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) Centre for Social Innovation(社会创新中心) Donostia International Physics Center(多诺斯蒂亚国际物理中心) Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08992 2026-07-28 cs.AI 版本更新 57%

Rethinking Prospect Theory for LLMs: Revealing the Instability of Decision-Making under Epistemic Uncertainty

重新思考用于大语言模型的前景理论:在认知不确定性下决策的不稳定性

Rui Wang, Qihan Lin, Jiayu Liu, Qing Zong, Tianshi Zheng, Dadi Guo, Haochen Shi, Peixuan Han, Weiqi Wang, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港科技大学) Huazhong University of Science and Technology(华中科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文重新审视前景理论在大语言模型中的应用,发现其在认知不确定性下的决策稳定性存在问题,指出前景理论可能无法可靠地处理此类不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2510.24411 2026-07-28 cs.AI cs.CL cs.CV cs.HC 版本更新 81%

OS-Sentinel: Towards Safety-Enhanced Mobile GUI Agents via Hybrid Validation in Realistic Workflows

OS-Sentinel: 通过现实工作流中的混合验证实现安全增强的移动GUI代理

Qiushi Sun, Mukai Li, Zhoumianze Liu, Zhihui Xie, Fangzhi Xu, Zhangyue Yin, Kanzhi Cheng, Zehao Li, Zichen Ding, Qi Liu, Zhiyong Wu, Zhuosheng Zhang, Ben Kao, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 隐私与版权 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 OS-Sentinel通过结合形式验证器和VLM上下文判断者,提升移动GUI代理的安全性,实验显示在多个指标上优于现有方法。

Comments ACL 2026 (Oral) & Best Paper at AIWILD @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 14 篇

2607.15166 2026-07-28 cs.AI cs.CL 版本更新 87%

MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection

MedFailBench:用于医学人工智能安全边界检查的临床医生构建的开源基准测试

Goktug Ozkan

机构 * Kutahya Emet Dr. Fazil Dogan State Hospital(屈塔希亚埃梅特法齐尔·多安州立医院)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI

AI总结 MedFailBench提出不同问题,构建合成基准测试和失败图谱,通过严重程度和安全门类型标记医学人工智能错误,当前版本含44个合成病例等内容,以特定许可形式发布并带有DOI。

Comments 6 pages; synthetic benchmark reviewed by a clinician; no patient data

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21134 2026-07-28 cs.CL cs.CY cs.LG 版本更新 82%

TRIDENT: Benchmarking LLM Safety in Finance, Medicine, and Law

TRIDENT:评估金融、医学和法律领域大语言模型的安全性

Zheng Hui, Yijiang River Dong, Ehsan Shareghi, Nigel Collier

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 研究针对大语言模型在金融、医学和法律领域的安全评估问题,基于相关伦理准则定义安全原则并引入Trident-Bench基准进行评估,揭示了不同模型的安全差距,为LLM安全研究提供了系统资源和研究基础。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09624 2026-07-28 cs.LG cs.AI cs.CL cs.CV 版本更新 67%

A Mechanistic Perspective and Circuit-Guided Difficulty Metric for Unlearning

迈向理解遗忘难度:一种机制视角和电路引导的难度度量

Jiali Cheng, Ziheng Chen, Chirag Agarwal, Hadi Amiri

机构 * University of Massachusetts Lowell(马萨诸塞大学洛约拉分校) Walmart Global Tech(沃尔玛全球技术) University of Virginia(弗吉尼亚大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CUD度量,通过分析模型电路揭示遗忘难度的机制特征,为设计基于模型机制的遗忘方法提供理论基础。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16184 2026-07-28 cs.AI cs.CR cs.CY cs.LG 版本更新 67%

Robustness and Cybersecurity in the EU Artificial Intelligence Act

欧盟人工智能法案中的稳健性与网络安全

Henrik Nolte, Miriam Rateike, Michèle Finck

机构 * University of Tübingen(图宾根大学) IBM Research Africa(IBM非洲研究中心) Saarland University(萨尔兰州大学) CSZ Institute for Artificial Intelligence and Law, University of Tübingen(人工智能与法律研究所,图宾根大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文针对欧盟人工智能法案中高风险人工智能系统和通用人工智能模型相关条款,识别其在稳健性和网络安全方面的法律挑战与缺陷,结合机器学习进展评估实施挑战,为制定相关标准等提供参考,弥合法律与研究差距。

Comments A previous version contained an incorrect publication year for the AI Act on page 1. This has been corrected

Journal ref The 2025 ACM Conference on Fairness, Accountability, and Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18350 2026-07-28 cs.CL cs.AI 版本更新 62%

Adapter Merging Reactivates Latent Reasoning Traces: A Mechanism Analysis

适配器合并重新激活潜在推理痕迹:一种机制分析

Junyi Zou

机构 * Zjydiary Group(Zjydiary小组)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示适配器合并后推理痕迹的重新激活机制,通过几何方法减少泄漏并提升准确性。

Comments Withdrawn by the authors after identifying an implementation error in adapter coefficient scaling that materially affects the main empirical results and invalidates the current conclusions. A corrected reanalysis is in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02050 2026-07-28 cs.CY cs.AI cs.HC cs.LG 版本更新 60%

Principles and Guidelines for Randomized Controlled Trials in AI Evaluation

人工智能评估中随机对照试验的原则与指南

Christopher Kelly, Angelica Chowdhury, Alexandra Campili, Bimpe Ayoola, Devin Barbour, Thomas Chen Dawson, Ze Shen Chin, Rokas Gipiškis

专题命中 安全评测 :分类 cs.AI、cs.CY、cs.LG;safety(comments);AI safety(comments)

AI总结 研究针对人工智能评估随机对照试验缺乏通用标准和共享词汇的问题,借鉴多学科实践综合五条原则,形成33条可操作指南,为其发挥设计工具、评估标准和标准制定蓝图的作用,提供评估标准、共享语言及指南。

Comments 33 pages, ICML 2026 (Workshop on Technical AI Governance Research) and Technical AI Safety Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10526 2026-07-28 cs.AI 版本更新 57%

Agents Don't Just Agree, They Remember: Benchmarking Persistent Sycophancy in Stateful Personal Agents

智能体不仅会认同,还会记忆:对有状态个人智能体中持续谄媚行为的基准测试

Xutao Mao, Liangjie Zhao, Leyao Wang, Rui Qian, Qiang Huang, Wentao Wang, Bo Han, Xiang Zheng, Cong Wang

机构 * City University of Hong Kong(香港城市大学) ByteDance(字节跳动) Yale University(耶鲁大学) Fudan University(复旦大学) Hong Kong Baptist University(香港浸会大学) Dalian University of Technology(大连理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究有状态个人智能体中的持续谄媚行为,引入PASB基准测试,评估真实智能体。通过特定方法隔离写入过程,发现提交边界是关键转折点,提交声明有三种模式,表明智能体谄媚行为是状态写入治理问题,PASB确定相关写入时控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02594 2026-07-28 q-bio.QM cs.AI cs.ET cs.IR 版本更新 57%

OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries

OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现

Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

机构 * OpenAI

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。

Comments 13 pages, two graphs

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17052 2026-07-28 cs.CL 版本更新 57%

PReSS: An Automated Black-Box Framework for Evaluating Political Stance Stability in LLMs

PReSS:通过论证压力评估LLM中政治立场稳定性的黑盒框架

Shariar Kabir, Kevin Esterling, Yue Dong

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) University of California Riverside(加州大学河滨分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 PReSS通过评估LLM在不同话题下的立场稳定性,揭示了模型政治立场的动态变化,为理解和干预政治敏感行为提供新视角。

Comments 13 pages, 8 figures

Journal ref In Proceedings of the 3rd Workshop on Natural Language Processing for Political Sciences (PoliticalNLP 2026) @ LREC 2026 (pp. 234-247)

详情

展开后加载摘要…

URL PDF HTML 收藏