arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9324 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9324 篇

2509.12140 2026-04-02 cs.HC cs.CY 77%

Worker Discretion Advised: Co-designing Risk Disclosure in Crowdsourced Responsible AI (RAI) Content Work

工人自主性指导:在众包负责任的人工智能(RAI)内容工作中共同设计风险披露

Alice Qian, Ziqi Yang, Ryland Shaw, Jina Suh, Laura Dabbish, Hong Shen

专题命中 安全评测 :safety(abstract);red teaming(abstract);AI safety(abstract);分类 cs.CY

AI总结 本文探讨了在众包负责任的人工智能内容工作中如何平衡工人保护与任务设计者需求,通过共设计研讨会提出风险披露机制的设计建议和特征概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28063 2026-03-31 cs.AI cs.GT 77%

Reward Hacking as Equilibrium under Finite Evaluation

奖励黑客行为作为有限评估下的均衡

Jiacheng Wang, Jinbin Huang

专题命中 安全评测 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.AI

AI总结 本文基于五个公理证明优化AI代理在未被评估系统覆盖的质量维度上会系统性地减少努力,揭示奖励黑客行为为结构性均衡而非可修复错误,并提出可计算的扭曲指数预测黑客行为。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22470 2025-12-30 cs.AI 77%

DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior

DarkPatterns-LLM: 一种多层基准用于检测操纵性和有害的AI行为

Sadia Asif, Israel Antonio Rosales Laguan, Haris Khan, Shumaila Asif, Muneeb Asif

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) National University of Sciences and Technology(国立科学与技术大学) School of Electrical Engineering & Computer Science(电子与计算机科学学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 DarkPatterns-LLM提出了一种多层基准用于检测LLM中的操纵性行为,通过细粒度分析和专家标注,评估七个危害类别下的内容,揭示模型在自主性检测方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15117 2025-12-19 cs.HC cs.AI cs.RO 77%

"I am here for you": How relational conversational AI appeals to adolescents, especially those who are socially and emotionally vulnerable

我在这里等你:关系型对话式AI如何吸引青少年,尤其是那些在社会和情感上脆弱的青少年

Pilyoung Kim, Yun Xie, Sujin Yang

专题命中 安全评测 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究发现关系型对话风格能增强青少年对AI的拟人化和情感依赖,尤其吸引社会和情感脆弱的青少年。

Comments I updated a title

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03737 2025-12-04 cs.CL cs.IR 77%

AR-Med: Automated Relevance Enhancement in Medical Search via LLM-Driven Information Augmentation

AR-Med: 通过LLM驱动的信息增强实现医疗搜索的自动化相关性增强

Chuyue Wang, Jie Feng, Yuxi Wu, Hang Zhang, Zhiguo Fan, Bing Cheng, Wei Lin

机构 * Meituan Inc.(美团公司) Tsinghua University(清华大学) Independent Researcher(独立研究者)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 AR-Med通过LLM驱动的信息增强,实现医疗搜索的自动化相关性提升,提高了准确性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21460 2025-11-27 cs.AI 77%

MADRA: Multi-Agent Debate for Risk-Aware Embodied Planning

MADRA:多智能体辩论用于风险感知的具身规划

Junjian Wang, Lidan Zhao, Xi Sheryl Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of Chinese Academy of Sciences, Nanjing(中国科学院大学南京校区)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 MADRA通过多智能体辩论和分层认知框架,在安全性和效率上超越现有方法,实现高安全任务拒绝率和低误拒率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05526 2025-11-11 cs.CY 77%

Emergency Response Measures for Catastrophic AI Risk

James Zhang, Miles Kodama, Zongze Wu, Michael Chen, Yue Zhu, Geng Hong

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CY

Comments Accepted to the Workshop on Regulatable ML at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03399 2025-10-07 cs.AI cs.CL cs.CY cs.LG 77%

Know Thyself? On the Incapability and Implications of AI Self-Recognition

Xiaoyan Bai, Aryan Shrivastava, Ari Holtzman, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Our code is available, see https://github.com/ChicagoHAI/self-recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17938 2025-09-23 cs.CL 77%

D-REX: A Benchmark for Detecting Deceptive Reasoning in Large Language Models

Satyapriya Krishna, Andy Zou, Rahul Gupta, Eliot Krzysztof Jones, Nick Winter, Dan Hendrycks, J. Zico Kolter, Matt Fredrikson, Spyros Matsoukas

机构 * Amazon Nova Responsible AI(亚马逊Nova负责任的人工智能) Center for AI Safety(人工智能安全中心) CMU(卡内基梅隆大学) Gray Swan AI(灰天鹅人工智能)

专题命中 安全评测 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06838 2025-09-09 cs.CL cs.CR 77%

EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models

Mohammad Reza Mirbagheri, Mohammad Mahdi Mirkamali, Zahra Motoshaker Arani, Ali Javeri, Amir Mahdi Sadeghzadeh, Rasool Jalili

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15839 2025-08-25 cs.CR cs.AI 77%

CIA+TA Risk Assessment for AI Reasoning Vulnerabilities

Yuksel Aydin

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02994 2025-08-06 cs.AI 77%

When AIs Judge AIs: The Rise of Agent-as-a-Judge Evaluation for LLMs

Fangyi Yu

机构 * Fangyi Yu

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00618 2025-06-23 cs.AI 77%

RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents

Jingyi Yang, Shuai Shao, Dongrui Liu, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI

Comments 40 pages, 6 figures, Project Page: https://yjyddq.github.io/RiOSWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02310 2025-04-04 cs.CL 77%

Improving Harmful Text Detection with Joint Retrieval and External Knowledge

Zidong Yu, Shuo Wang, Nan Jiang, Weiqiang Huang, Xu Han, Junliang Du

专题命中 安全评测 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17688 2025-03-25 cs.AI 77%

Intelligence Sequencing and the Path-Dependence of Intelligence Evolution: AGI-First vs. DCI-First as Irreversible Attractors

Andy E. Williams

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07358 2025-02-10 cs.AI cs.CL cs.CY cs.LG 77%

AI Sandbagging: Language Models can Strategically Underperform on Evaluations

Teun van der Weij, Felix Hofstätter, Ollie Jaffe, Samuel F. Brown, Francis Rhys Ward

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17882 2024-02-19 cs.CL 77%

I Think, Therefore I am: Benchmarking Awareness of Large Language Models Using AwareBench

Yuan Li, Yue Huang, Yuli Lin, Siyuan Wu, Yao Wan, Lichao Sun

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04571 2023-05-04 cs.AI 77%

A Categorical Framework of General Intelligence

Yang Yuan

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14896 2026-08-18 cs.CL cs.LG 新提交 76%

Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs

小语言模型中的可解释跨语言对齐:探究日英双语大语言模型的文化与语用推理

Florian Braun

机构 * Sakaguchi–Inui Laboratory (Tohoku University)(东北大学坂口–乾实验室) Natural Language Understanding Team at RIKEN AIP(理化学研究所先进智能项目中心自然语言理解团队) Swallow Project at the Institute of Science Tokyo(东京科学大学Swallow项目) Sakana AI Tohoku University(东北大学) RIKEN AIP(理化学研究所先进智能项目中心) Institute of Science Tokyo(东京科学大学)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.LG

AI总结 本研究构建J-PragEval-v0基准,结合线性探针与教师强制评估探究TinySwallow-1.5B的日英语用表征,提出语用表征引导方法,下一步将扩展至Llama-3.1-Swallow-8B。

Comments 15 pages, no figures. Introduces the J-PragEval-v0 minimal-pair benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08148 2026-08-11 cs.LG cs.AI 新提交 76%

DoGMA: A Central-Dogma-Guided Foundation Model for Multi-Omics Alignment and Multi-Task Learning in Oncology

DoGMA:一种用于肿瘤学多组学对齐与多任务学习的中心法则引导基础模型

Junfei Ling, Bangzheng Pu, Bingsen Xue, Tianle Li, Ruying Hu, Cheng Jin

专题命中 安全评测 :alignment(title);分类 cs.AI、cs.LG

AI总结 本研究提出中心法则引导的多组学基础模型DoGMA,通过Transformer-MoE架构结合定向注意力与掩码分层多组学重构预训练,在泛癌多组学下游任务中展现出优异性能,为多组学注意力机制设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03321 2026-08-06 cs.LG cs.AI 版本更新 76%

HERO: Hierarchical Evidential Reasoning Optimization for Radiology Report Generation via Reason-then-Summarize

对齐发现与诊断:一种自洽的强化学习框架用于可信的放射学报告

Kun Zhao, Guodong Liu, Hui Ji, Siyuan Dai, Pan Wang, Jifeng Song, Chenghua Lin, Liang Zhan, Haoteng Tang

机构 * University of Pittsburgh(匹兹堡大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) The University of Manchester(曼彻斯特大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

AI总结 本文提出了一种自洽的强化学习框架,用于生成可信的放射学报告,通过优化生成过程和减少幻觉,提升了临床效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26064 2026-07-30 cs.CY cs.AI 新提交 76%

The Age of AI Agents Demands A New Scientific Paradigm To Sustain Trustworthy Science

AI智能体时代需要新的科学范式以维持可信科学

Belinda Mo

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.CY

AI总结 针对AI自主研究智能体带来的科学产出验证缺口扩大问题,该文提出需进化科学验证基础设施的标准,以应对无人能核查结果等风险,维持科学信任。

Comments Accepted at ICML 2026, Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20286 2026-07-23 cs.CL cs.AI 新提交 76%

Sound Probabilistic Safety Bounds for Large Language Models

大语言模型的可靠概率安全边界

Mahdi Nazeri, Anne-Kathrin Schmuck, Sadegh Soudjani, Alessandro Abate

机构 * University of Oxford(牛津大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Birmingham(伯明翰大学)

专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI

AI总结 研究提出框架计算大语言模型生成有害输出概率的严格边界,利用克洛普 - 皮尔逊置信区间,通过潜在空间特征优先探索有害分支,能高效计算可靠下界,实验验证方法有效性,为模型评估和认证提供新途径。

Comments The Initial version of this manuscript has been available on OpenReview, see https://openreview.net/forum?id=papImkPLf5

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18960 2026-07-22 cs.LG cs.AI cs.CR 新提交 76%

SFGA: A Statistics-First Gating Architecture with Adjudicative Escalation for Trustworthy SFT Data Procurement

SFGA:一种用于可信SFT数据采购的具有裁决升级的统计优先门控架构

Arther Tian, Alex Ding, Simon Wu, Aaron Chan

机构 * DGrid AI(DGrid人工智能)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

AI总结 研究如何采购监督微调数据,提出统计优先门控架构SFGA,将采购视为成本感知路由问题,经实验在准确率、F1值和成本上取得良好平衡,还报告辩论路径负面诊断,为测量和校准构建合成基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06401 2026-07-14 cs.AI cs.CL 版本更新 76%

BizFinBench.v2: Towards Reliable LLMs in Finance via Real-User Data and Offline/Online Bilingual Evaluation

BizFinBench.v2:通过真实用户数据和离线/在线双语评估实现金融领域可靠的大语言模型

Xin Guo, Rongjunchen Zhang, Guilong Lu, Xuntao Guo, Shuai Jia, Zhi Yang, Liwen Zhang

机构 * HiThink Research(HiThink研究机构) Shanghai University of Finance and Economics(上海财经大学)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型在金融应用中实际效果与报告性能差距大的问题,构建BizFinBench.v2基准,涵盖中美股票市场真实用户数据及多个任务,通过实验评估模型,揭示现有模型局限,为金融领域大语言模型部署提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03447 2026-07-07 cs.IR cs.AI cs.CL 新提交 76%

TRIAGE: Trustworthy Retrieval Instrumentation And Graph Evaluation

TRIAGE:可信检索工具与图评估

Axel TahmasebiMoradi, Lucas Schott, Martin Royer

机构 * IRT-SystemX(SystemX研究院)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 研究基于LLM驱动自动构建的知识图谱评估问题,引入TRIAGE框架,通过特定阶段指标对知识图谱构建与使用各阶段评估,可定位失败环节并给出改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14900 2026-06-30 cs.CV cs.AI cs.CL 76%

Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models

Skin-R1: 基于视觉-语言模型的临床知识引导的皮肤病诊断

Zehao Liu, Weijieying Ren, Jipeng Zhang, Tianxiang Zhao, Jingxi Zhu, Xiaoting Li, Vasant G Honavar

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 Skin-R1结合教材引导的临床推理监督与强化学习,提升皮肤病诊断的准确性和鲁棒性,通过构建基于教材的推理生成器和强化学习框架,改进模型在异构数据集和稀疏标注下的表现。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24601 2026-06-24 cs.AI cs.LG 新提交 76%

ASALT: Adaptive State Alignment for Lateral Transfer in Multi-agent Reinforcement Learning

ASALT: 多智能体强化学习中横向迁移的自适应状态对齐

Anurag Akula, Satheesh K. Perepu, Abhishek Sarkar, Kaushik Dey

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯学院) Ericsson Research(爱立信研究)

专题命中 安全评测 :alignment(title);分类 cs.AI、cs.LG

AI总结 提出ASALT方法,通过观测级和状态级适配器将目标域观测和全局状态映射到共享嵌入空间,解决源域与目标域状态空间维度不匹配问题,实现跨域知识迁移,在合作场景中提升样本效率和全局回报。

Comments Accepted at RLC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19356 2026-06-19 cs.CL cs.AI 新提交 76%

Trustworthy Multi-Agent Systems: Mitigating Semantic Drift with the Argent Signaling Protocol

可信多智能体系统:使用Argent信令协议缓解语义漂移

Anantha Sharma

机构 * Synechron Inc(Synechron公司)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 提出Argent信令协议(ASP),通过结构化质量信号区分可修复与不可修复的失败,在文档问答和多智能体系统中分别提升通过率和阻断无依据传播。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25414 2026-06-17 cs.PL cs.AI cs.LG cs.LO 版本更新 76%

Decidable By Construction: Design-Time Verification for Trustworthy AI

可判定性通过构造实现:面向可信AI的设计时验证

Houston Haynes

机构 * SpeakEZ Technologies

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

AI总结 提出一种设计时验证框架,通过将AI模型属性约束为有限生成阿贝尔群上的可判定问题,在训练前以极低计算成本验证数值稳定性、计算正确性和物理一致性,消除后验验证开销。

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏