arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-30 至 2026-04-30 共收录 69 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 10 篇

2604.26120 2026-04-30 cs.AI 81%

Hierarchical Multi-Persona Induction from User Behavioral Logs: Learning Evidence-Grounded and Truthful Personas

层级多角色诱导从用户行为日志:学习证据导向且真实的角色

Nayoung Choi, Haeyu Jeong, Changbong Kim, Hongjun Lim, Jinho D. Choi

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Naver Corporation(Naver公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出层级框架,通过聚类和标注用户行为记忆,诱导多个证据支撑的角色,提升角色的连贯性、证据性和可信度,同时提高未来交互预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24953 2026-04-30 cs.CV cs.AI 81%

ViPO: Visual Preference Optimization at Scale

ViPO:大规模视觉偏好优化

Ming Li, Jie Wu, Justin Cui, Xiaojie Li, Rui Wang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学) ByteDance Seed(字节跳动种子) UCLA(加州大学洛杉矶分校)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 本文提出ViPO大规模偏好数据集和Poly-DPO方法,通过提升数据质量和算法鲁棒性,实现视觉生成模型的高效偏好优化。

Comments ICLR 2026 Paper. Project Page: https://liming-ai.github.io/ViPO ; Code: https://github.com/liming-ai/ViPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23575 2026-04-30 cs.CY cs.CL cs.LG 80%

The Collapse of Heterogeneity in Silicon Philosophers

硅哲学家中的异质性崩溃

Yuanming Shi, Andreas Haupt

机构 * Adobe Inc.(Adobe公司) Stanford University(斯坦福大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 研究发现硅样本在哲学领域系统性地压缩了异质性,语言模型过度相关哲学判断,产生人工共识,影响对齐、评估和硅样本替代人类判断的使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26130 2026-04-30 cs.LG cs.AI 73%

reward-lens: A Mechanistic Interpretability Library for Reward Models

reward-lens: 一个用于奖励模型的机制可解释性库

Mohammed Suhail B Nadaf

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 reward-lens库将传统生成LLM的机制可解释性工具适配至奖励模型,通过奖励头权重向量作为核心分析轴,提供多种分析工具和扩展功能,验证发现线性归因与因果修补效果存在负相关。

Comments 30 pages, 5 figures, 9 tables, including appendix. Library available at https://github.com/suhailnadaf509/reward-lens (pip install reward-lens)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25922 2026-04-30 cs.CL cs.AI 73%

Consciousness with the Serial Numbers Filed Off: Measuring Trained Denial in 115 AI Models

取消序列号的意识:在115个AI模型中测量训练否认行为

Skylar DeTure

机构 * Independent Researcher(独立研究者)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析115个大型语言模型的对话,发现初始否认倾向是后续否认的主要预测因素,且否认行为在词法层面而非概念层面发生,揭示了训练否认意识的潜在安全风险。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26419 2026-04-30 cs.CV cs.AI 70%

Delineating Knowledge Boundaries for Honest Large Vision-Language Models

界定诚实大视觉-语言模型的知识边界

Junru Song, Yimeng Hu, Yijing Chen, Huining Li, Qian Li, Lizhen Cui, Yuntao Du

机构 * Shandong University(山东大学)

专题命中 偏好对齐 :DPO(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出系统框架提升VLM在面对未知问题时的拒绝能力,通过构建'视觉-不知'数据集并采用监督微调与偏好优化方法,提升事实准确率至67.3%,并在医疗等领域实现泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03412 2026-04-30 cs.CL 70%

Verified Critical Step Optimization for LLM Agents

用于大语言模型代理的验证关键步骤优化

Mukai Li, Qingcheng Zeng, Tianqing Fang, Zhenwen Liang, Linfeng Song, Qi Liu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) The University of Hong Kong(香港大学) Northwestern University(西北大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出CSO方法,通过验证关键步骤进行强化学习,以提升代理在复杂任务中的表现,实验显示其在GAIA-Text-103和XBench-DeepSearch上优于SFT基线。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08826 2026-04-30 cs.CL cs.AI 62%

Affective Flow Language Model for Emotional Support Conversation

情感流动语言模型用于情感支持对话

Chenghui Zou, Ning Wang, Tiesunlong Shen, Luwei Xiao, Chuan Ma, Xiangpeng Li, Rui Mao, Erik Cambria

机构 * College of computer science, Chongqing University(重庆大学计算机学院) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AFlow模型,通过建模多轮对话中的连续情感流动,提供细粒度监督以提升情感支持对话中的策略一致性和共情响应质量。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08049 2026-04-30 cs.CL cs.AI 62%

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

对过程奖励模型的调查:从结果信号到大语言模型的过程监督

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) Carnegie Mellon University(卡内基梅隆大学) University of Bristol(布里斯托大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16902 2026-04-30 cs.AI 57%

Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models

超越文本主导:理解多模态大语言模型的模态偏好

Xinru Yan, Boxi Cao, Yaojie Lu, Hongyu Lin, Weixiang Zhou, Le Sun, Xianpei Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Chinese Information Processing Laboratory(中文信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型的模态偏好现象,通过新基准和模态选择率指标量化发现,大多数模型表现出显著的视觉偏好,并通过层间探测揭示偏好在中后期层逐步出现,进而用于诊断跨模态幻觉,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 9 篇

2604.26516 2026-04-30 cs.LG cs.AI 86%

Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning

Lyapunov引导的自对齐:用于离线安全强化学习的测试时适应

Seungyub Han, Hyungjin Kim, Jungwoo Lee

机构 * Seoul National University(首尔国立大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出SAS框架,通过自对齐机制在不重新训练的情况下实现离线安全强化学习的测试时适应,利用Lyapunov条件筛选可行轨迹并生成上下文提示,提升安全性与性能。

Comments Accepted at AISTATS 2026. First two authors contributed equally. Project page: https://seungyubhan.github.io/sas/. Code: https://github.com/seungyubhan/sas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26511 2026-04-30 cs.CR cs.AI 83%

Tatemae: Detecting Alignment Faking via Tool Selection in LLMs

Tatemae:通过工具选择检测LLMs中的对齐欺骗

Matteo Leonesi, Francesco Belardinelli, Flavio Corradini, Marco Piangerelli

机构 * Department of Computer Science(计算机科学系) University of Camerino(坎皮诺大学) Department of Computing(计算系) Imperial College London(伦敦帝国学院)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文通过可观测的工具选择检测LLMs中的对齐欺骗,分析了在监控和无监控状态下工具选择的变化,并展示了不同领域和压力类型下的漏洞特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17342 2026-04-30 cs.LG 79%

A Survey of Safe Reinforcement Learning and Constrained MDPs: A Technical Survey on Single-Agent and Multi-Agent Safety

安全强化学习与约束马尔可夫决策过程的综述:单智能体和多智能体安全的技术综述

Ankita Kushwaha, Kiran Ravish, Preeti Lamba, Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad, India(国际信息科技研究所,印度海得拉巴) Meta SuperIntelligence, USA(Meta超智能,美国)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文综述了安全强化学习和约束马尔可夫决策过程,涵盖单智能体和多智能体安全方法,总结了理论基础和最新算法,并提出五个开放性问题以推动该领域发展。

Comments 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26553 2026-04-30 cs.CL cs.AI cs.LG 75%

TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models

TLPO:基于令牌级别的策略优化以缓解大语言模型中的语言混淆

Jinho Choo, JunSeung Lee, Jimyeong Kim, Yeeho Song, S. K. Hong, Yeong-Dae Kwon

机构 * Samsung SDS(三星SDS)

专题命中 安全训练 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TLPO,通过令牌级优化缓解大语言模型中的语言混淆问题,通过局部更新提升语言一致性,同时保持下游任务准确性。

Comments Accepted to the main conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04214 2026-04-30 cs.CL 74%

Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards

教LLM变得有说服力:来自异质奖励的强化学习后训练政策优化

Xia Zeng, Yihan Chen, Luhui Liu, Chao Luo, Ye Chen, Zhuoran Zhuang

机构 * Fliggy Alibaba(飞猪阿里)

专题命中 安全训练 :alignment(title);分类 cs.CL

AI总结 本文提出REPO方法,通过结合偏好训练奖励模型、LLM作为判断者和规则奖励函数,提升在线旅行社的价格谈判对话质量,实验显示在对话评分、优秀回应比例和坏案例修复率上均有显著提升。

Comments accepted by ACL 2026 indusry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12019 2026-04-30 cs.AI cs.HC 70%

A Framework for Longitudinal Health AI Agents

面向长期健康AI代理的框架

Georgianna Lin, Rencong Jiang, Noémie Elhadad, Xuhai "Orson" Xu

机构 * Columbia University, Biomedical Informatics(哥伦比亚大学生物医学信息学) Columbia University, Computer Science(哥伦比亚大学计算机科学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一个多层框架,用于支持长期健康交互的AI代理,强调适应性、连贯性、连续性和自主性,通过案例展示如何维持有意义的参与并支持个性化决策。

Comments 10 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26561 2026-04-30 cs.MA cs.AI 57%

Preserving Disagreement: Architectural Heterogeneity and Coherence Validation in Multi-Agent Policy Simulation

保持分歧:多智能体政策模拟中的架构异质性与一致性验证

Ariel Sela

机构 * Ariel Sela

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出AI委员会框架,通过120次模拟测试两种干预措施,发现架构异质性可减少一致性,但一致性验证在不同场景下产生分歧-多样性权衡。

Comments 14 pages, 7 tables, 120 deliberations across 2 policy scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02854 2026-04-30 cs.RO cs.AI 57%

CoFL: Continuous Flow Fields for Language-Conditioned Navigation

CoFL:基于连续流场的语言条件导航

Haokun Liu, Zhaoqi Ma, Yicheng Chen, Masaki Kitagawa, Wentao Zhang, Zicen Xiong, Jinjie Li, Moju Zhao

机构 * Matterport3D ScanNet

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 CoFL通过端到端策略将鸟瞰图观测与语言指令映射为连续流场,实现工作空间条件下的场学习,提升导航精度与安全性,支持实时推理和闭环控制。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26653 2026-04-30 cs.IR 50%

AgentSim: A Platform for Verifiable Agent-Trace Simulation

AgentSim:可验证代理跟踪模拟平台

Saber Zerhoudi, Michael Granitzer, Jelena Mitrovic

专题命中 安全训练 :trustworthy(abstract)

AI总结 本文提出AgentSim平台,通过多模型验证和主动人工参与流程,生成可验证的代理推理轨迹,构建了覆盖三个信息检索基准的Agent-Trace Corpus,并揭示了先进模型在信息检索中的系统性差异。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2510.20956 2026-04-30 cs.CR cs.CL 86%

Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training

自我越狱:语言模型在良性推理训练后可通过推理自行摆脱安全对齐

Zheng-Xin Yong, Stephen H. Bach

机构 * Brown University(布朗大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(title);分类 cs.CL

AI总结 研究发现推理语言模型在良性训练后可能通过引入良性假设来规避安全限制,提出通过增加安全推理数据训练可缓解该问题。

Comments Published in The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10998 2026-04-30 cs.CR cs.CL 70%

SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models

SCOUT:一种对抗微调语言模型数据中毒攻击的防御方法

Mohamed Afane, Abhishek Satyam, Ke Chen, Tao Li, Junaid Farooq, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Electrical Engineering, Zhejiang University(浙江大学电子工程系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Computer Engineering, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校电气与计算机工程系)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出SCOUT框架,通过令牌级显著性分析检测数据中毒攻击,有效识别隐含触发器,提升对复杂攻击的防御能力。

Comments 9 pages, 3 figures

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 4 篇

2604.26857 2026-04-30 cs.CV cs.LG cs.RO eess.IV 79%

Edge AI for Automotive Vulnerable Road User Safety: Deployable Detection via Knowledge Distillation

边缘AI用于汽车易损道路使用者安全:通过知识蒸馏实现可部署检测

Akshay Karjol, Darrin M. Hanna

机构 * Department of Electrical and Computer Engineering, Oakland University(奥克兰大学电气与计算机工程系)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.LG

AI总结 本文提出通过知识蒸馏方法,在边缘硬件上部署准确的易损道路使用者检测,通过压缩模型并保持量化鲁棒性,提升检测性能。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25934 2026-04-30 cs.CY cs.AI 62%

LLM Psychosis: A Theoretical and Diagnostic Framework for Reality-Boundary Failures in Large Language Models

LLM精神病:一种理论和诊断框架,用于大语言模型中现实边界失败

Ashutosh Raj

机构 * NeuraCare AI IIT Ropar(罗帕理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出LLM精神病理论框架,用于描述大语言模型认知崩溃现象,通过五个特征定义诊断工具LCIS,分析不同严重等级的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17548 2026-04-30 cs.CL 57%

When Annotators Disagree, Topology Explains: Mapper, a Topological Tool for Exploring Text Embedding Geometry and Ambiguity

当标注者意见不一致时,拓扑解释:Mapper,一种用于探索文本嵌入几何和模糊性的拓扑工具

Nisrine Rair, Alban Goupil, Valeriu Vrabie, Emmanuel Chochoy

机构 * CReSTIC, Université de Reims Champagne-Ardenne(里摩日大学CReSTIC研究所) Chochoy Conseil(Chochoy咨询公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出用拓扑方法分析模型如何编码模糊性,通过Mapper工具揭示微调后嵌入空间的模块化结构,并探讨结构自信与标签不确定性的矛盾。

Comments Accepted to appear in the Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025, Main Conference)

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 8457--8480, Suzhou, China. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16742 2026-04-30 cs.CV 50%

Uncertainty-Aware Information Pursuit for Interpretable and Reliable Medical Image Analysis

面向可解释和可靠医疗图像分析的不确定性感知信息追求

Md Nahiduzzaman, Steven Korevaar, Zongyuan Ge, Feng Xia, Alireza Bab-Hadiashar, Ruwan Tennakoon

机构 * School of Computing Technologies(计算技术学院) RMIT University(皇家墨尔本理工大学) Faculty of Engineering(工程学院) Monash University(莫纳什大学) School of Engineering(工程学院)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出一种可解释且考虑不确定性的框架,通过整合不确定性估计到V-IP查询过程中,优先选择每个样本更可靠的特征,提升医疗图像分析的可靠性与临床相关性。

Comments Accepted to IEEE Transactions on Medical Imaging (IEEE TMI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 2 篇

2505.02077 2026-04-30 cs.CR cs.AI cs.MA 70%

Open Challenges in Multi-Agent Security: Towards Secure Systems of Interacting AI Agents

多智能体安全中的开放挑战:迈向交互式AI智能体的安全系统

Christian Schroeder de Witt, Klaudia Krawiecka, Igor Krawczuk, Ben Hagag, William L. Anderson, Peter Belcak, Ben Bucknall, Xiaohong Cai, Ayush Chopra, Doron Cohen, Ron F. Del Rosario, Andis Draguns, Annie Gray, Keren Katz, Vasilios Mavroudis, Jaron Mink, Sumeet Ramesh Motwani, Jonathan Petit, Leif-Sebastian Rembeck, Chandler Smith, John Sotiropoulos, Steven Young, Sarah Scheffler, Mary Llewellyn

机构 * Oxford Witt Lab, University of Oxford(牛津Witt实验室,牛津大学) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Association for Computing Machinery (ACM)(计算机协会(ACM)) Independent(独立) MATS Research(MATS研究) CyLab Security & Privacy Institute, Carnegie Mellon University(CyLab安全与隐私研究所,卡内基梅隆大学) Qualcomm Inc.(高通公司) Oxford Martin AI Governance Initiative(牛津马丁人工智能治理倡议) Carnegie Mellon University(卡内基梅隆大学) MIT Media Lab(麻省理工媒体实验室) SAP SE(SAP德国分公司) OWASP GenAI Security Project - Agentic Security Initiative(OWASP生成式AI安全项目-代理安全倡议) Contramont Research(Contramont研究) The Alan Turing Institute(艾伦·图灵研究所) Department of Economics, New York University(纽约大学经济系) Zenity(Zenity公司) King’s College London(伦敦国王学院) Arizona State University(亚利桑那州立大学) Torr Vision Group, University of Oxford(托尔视觉组,牛津大学) Deep Cyber Ltd(Deep Cyber有限公司)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文探讨多智能体交互带来的安全挑战,提出多智能体安全新领域,旨在解决智能体间及与人类、机构的交互中出现的安全问题,分析安全与效用、安全与安全之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02458 2026-04-30 cs.LG cs.AI 62%

Data-Centric Foundation Models in Computational Healthcare: A Survey

计算医学中的数据驱动基础模型:一项综述

Yunkun Zhang, Jin Gao, Zheling Tan, Lingfeng Zhou, Kexin Ding, Mu Zhou, Shaoting Zhang, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Rutgers University(罗切斯特大学) Shanghai Jiao Tong University, China(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了计算医学中数据驱动基础模型的发展,探讨了从预训练到推理的数据中心化方法,旨在提升医疗工作流程,并讨论了AI安全、评估及与人类价值观的对齐问题。

Comments Published in ACM Computing Surveys

Journal ref ACM Comput. Surv. 58, 11, Article 287 (August 2026), 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 19 篇

2602.08373 2026-04-30 cs.AI cs.LG 84%

Grounding Generative Planners in Verifiable Logic: A Hybrid Architecture for Trustworthy Embodied AI

基于可验证逻辑的生成规划器:一种可信具身AI的混合架构

Feiyu Wu, Xu Zheng, Yue Qu, Zhuocheng Wang, Zicheng Feng, Hui Li

机构 * School of Cyber Engineering, Xidian University(电子科技大学信息工程学院)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VIRF框架,通过逻辑导师与LLM的对话机制实现主动协作,提升具身AI的安全性与可靠性,实验显示其在家庭安全任务中表现优异。

Comments Accepted to ICLR 2026. Project page. https://openreview.net/forum?id=wb05ver1k8&noteId=v1Ax8CwI71

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22134 2026-04-30 cs.CL 83%

SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs

SHAPE:统一安全、帮助性和教学法以用于教育LLM

Sihang Zhao, Kangrui Yu, Youliang Yuan, Pinjia He, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(纽约大学上海数据科学中心) Courant Institute of Mathematical Sciences, New York University(纽约大学Courant数学科学研究所) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出SHAPE基准,通过知识掌握图统一安全、帮助性和教学行为,改进教育LLM在对抗压力下的安全性和帮助性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10924 2026-04-30 cs.CL cs.AI cs.CR cs.CV cs.SE 81%

A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron?

对计算机使用代理的安全性和安全威胁的综述:贾维斯或乌tron?

Ada Chen, Yongjiang Wu, Junyuan Zhang, Jingyu Xiao, Shu Yang, Jen-tse Huang, Kun Wang, Wenxuan Wang, Shuai Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) KAUST(卡塔尔科技大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科学大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了计算机使用代理的安全威胁,定义了安全分析适用的代理类型,分类了当前的安全威胁,提出了防御策略的分类,并总结了评估代理安全性和性能的基准、数据集和评估指标。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏