arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-12 至 2026-05-12 共收录 202 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 5 篇

2605.08651 2026-05-12 cs.CV cs.AI cs.LG 62%

Privacy-Aware Video Anomaly Detection through Orthogonal Subspace Projection

通过正交子空间投影实现隐私感知的视频异常检测

Lei Wang, Wenxiang Diao, Andrew Busch, Jun Zhou, Yongsheng Gao

机构 * School of Engineering and Built Environment, Griffith University(格里菲斯大学工程与环境学院) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) School of Information and Communication Technology, Griffith University(格里菲斯大学信息与通信技术学院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出正交投影层(OPL)和引导OPL(G-OPL),通过去除无关变化提升异常检测相关特征,同时抑制面部属性以保护隐私,实验表明隐私约束能减少敏感信息并保持检测精度。

Comments Accepted as a Spotlight paper at the Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05707 2026-05-12 cs.LG cs.CR 57%

Crowding Out The Noise: Algorithmic Collective Action Under Differential Privacy

消除噪声:在差分隐私下的算法集体行动

Rushabh Solanki, Meghana Bhange, Ulrich Aïvodji, Elliot Creager

机构 * University of Waterloo, Vector Institute(滑铁卢大学,向量研究所)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.LG

AI总结 本文研究了在差分隐私下算法集体行动的挑战,分析了集体行动效果与隐私参数的关系,并通过实验验证了隐私成本对集体形成的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22868 2026-05-12 cs.CR cs.AI 57%

Agent-Sentry: Bounding LLM Agents via Execution Provenance

Agent-Sentry: 通过执行溯源界定了LLM代理

Rohan Sequeira, Stavros Damianakis, Umar Iqbal, Konstantinos Psounis

机构 * University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 本文提出Agent Sentry,通过学习代理良性执行的边界来检测恶意行为,有效阻止注入攻击,同时允许良性执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08104 2026-05-12 cs.CR 50%

AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration

AgentCrypt: 推动AI代理协作中的隐私与(安全)计算发展

Harish Karthikeyan, Yue Guo, Leo de Castro, Antigoni Polychroniadou, Udari Madhushani Sehwag, Leo Ardon, Sumitra Ganesh, Manuela Veloso

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 AgentCrypt通过三层框架提升AI代理协作中的隐私和安全计算,解决传统访问控制不足和LLM安全性的不足问题,实现数据安全计算和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全评测 64 篇

2605.08496 2026-05-12 cs.AI 87%

Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms

潜在人格对齐:无需提及危害的改进

Linh Le, David Williams-King, Mohamed Amine Merzouk, Aton Kamanda, Adam Oberman

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) ERA LawZero(法零)

专题命中 安全评测 :alignment(title,abstract);harmlessness(title);分类 cs.AI;trustworthy(comments)

AI总结 本文提出LPA方法,通过训练抽象人格特质提升模型鲁棒性,以少样本实现高防御效果,且在六个危害基准测试中表现更优。

Comments published at Trustworthy AI Workshop, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08427 2026-05-12 cs.AI cs.GT cs.LG 86%

The Attacker in the Mirror: Breaking Self-Consistency in Safety via Anchored Bipolicy Self-Play

镜中的攻击者:通过锚定双策略自我博弈打破安全性中的自我一致性

Gabriele La Malfa, Emanuele La Malfa, Saar Cohen, Jie M. Zhang, Michael Luck, Michael Wooldridge, Elizabeth Black

机构 * Department of Informatics, King’s College London(伦敦国王学院信息学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) University of Sussex(Sussex大学) Institute for Decentralized AI(去中心化人工智能研究所)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出锚定双策略自我博弈方法,通过训练角色特定的LoRA适配器提升安全性与参数效率,实验证明在安全基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09119 2026-05-12 cs.LG cs.AI cs.CL 82%

Personalized Alignment Revisited: The Necessity and Sufficiency of User Diversity

个性化对齐再审视:用户多样性必要性和充分性

Enoch Hyunwook Kang

机构 * Foster School of Business, University of Washington, Seattle, Washington, USA(华盛顿大学福斯特商学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了个性化对齐的理论条件,证明用户多样性是实现高效个性化识别的关键,提出用户多样性条件决定在线 regrets 和离线样本复杂度的最优速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08198 2026-05-12 cs.LG cs.AI cs.CY 82%

FairHealth: An Open-Source Python Library for Trustworthy Healthcare AI in Low-Resource Settings

FairHealth: 一个用于低资源环境可信医疗AI的开源Python库

Farjana Yesmin

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 FairHealth通过整合公平性审计、隐私保护联邦学习、可解释性工具等模块,解决低资源医疗AI工具包的关键缺口,提升全球南医疗数据的可信度与公平性。

Comments 8 pages, open-source Python library

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28087 2026-05-12 cs.LO cs.AI 80%

Towards Neuro-symbolic Causal Rule Synthesis, Verification, and Evaluation Grounded in Legal and Safety Principles

迈向基于法律和安全原则的神经符号因果规则合成、验证与评估

Zainab Rehan, Christian Medeiros Adriano, Sona Ghahremani, Holger Giese

机构 * Hasso Plattner Institute \ of Potsdam Prof.-Dr.-Helmert Str. 2-3, D-14482 Potsdam, Germany Hasso Plattner Institute \ of Potsdam

专题命中 安全评测 :safety(title,abstract);分类 cs.AI;trustworthy(journal_ref)

AI总结 本文提出一种神经符号因果框架,结合一阶逻辑抽象树、结构因果模型和深度强化学习,通过Meta层缓解目标误指定问题,实现可扩展的规则维护。

Journal ref Neurosymbolic eXplainable Trustworthy Systems @ AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10386 2026-05-12 cs.AI 79%

GuardAD: Safeguarding Autonomous Driving MLLMs via Markovian Safety Logic

GuardAD: 通过马尔可夫安全逻辑保障自动驾驶MLLMs

Tianyuan Zhang, Peng Yue, Zihao Peng, Jiangfan Liu, Zonghao Ying, Jiakai Wang, Tianlin Li, Jian Yang, Yaodong Yang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Zhongguancun Laboratory(中关村实验室) Peking University(北京大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 GuardAD通过马尔可夫逻辑形式化提升自动驾驶MLLMs的安全性,减少事故率并提升任务性能,经实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10146 2026-05-12 cs.AI cs.CR 79%

Benchmarking Safety Risks of Knowledge-Intensive Reasoning under Malicious Knowledge Editing

在恶意知识编辑下知识密集推理安全风险的基准测试

Qinghua Mao, Xi Lin, Jinze Gu, Jun Wu, Siyuan Li, Yuliang Chen

机构 * School of Computer Science(计算机科学学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出EditRisk-Bench,通过整合恶意场景和多级推理任务,系统评估知识编辑对推理行为的影响,揭示恶意知识编辑导致错误推理的风险因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08486 2026-05-12 cs.CY 79%

Teachers' Perceived Benefits and Risks of AI Across Fifty-Five Countries: An Audit of LLM Alignment and Steerability

教师对AI在教育中的感知益处与风险:对LLM对齐与可控性的审计

Yan Tao, Olga Viberg, Deepak Varuvel Dennison, Zhikun Wu, René F. Kizilcec

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 研究通过分析55国教师对AI的感知益处与风险,评估LLM在教育领域应用的对齐与可控性,揭示模型输出与现实差异,警示LLM不能替代教师直接反馈。

Comments Accepted as full paper to the 13th ACM Conference on Learning @ Scale (L@S'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01307 2026-05-12 cs.SE cs.AI 79%

Document Retrieval Augmented Fine-Tuning (DRAFT) for safety-critical software assessments

用于安全关键软件评估的文档检索增强微调(DRAFT)

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Vanessa Vulovic, Gary Bamford, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre, UK, HD1 3BD(数字交通有限公司,3M Buckley创新中心,英国,HD1 3BD) Department of Computer Science, University of Huddersfield, UK, HD1 3DH(计算机科学系,赫德瑟菲尔德大学,英国,HD1 3DH)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出DRAFT方法,通过引入双检索架构和半自动化数据集生成,提升大型语言模型在安全关键合规评估中的准确性与证据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21362 2026-05-12 cs.AI cs.CL 79%

AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning

AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 安全评测 :DPO(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。

Comments KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10485 2026-05-12 cs.RO 78%

VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models

VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型

Hao Wang, Xiaobao Wei, Jingyang He, Chengyu Bai, Chun-Kai Fan, Jiajun Cao, Jintao Chen, Ying Li, Shanyu Rong, Ming Lu, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 安全评测 :alignment(title,abstract)

AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10484 2026-05-12 cs.CV cs.RO 78%

OpenSGA: Efficient 3D Scene Graph Alignment in the Open World

OpenSGA: 在开放世界中高效的3D场景图对齐

Gang Chen, Sebastián Barbas Laina, Stefan Leutenegger, Javier Alonso-Mora

机构 * Autonomous Multi-Robots Lab, Department of Cognitive Robotics, School of Mechanical Engineering, Delft University of Technology, 2628 CD, Delft, Netherlands(代尔夫特理工大学机械工程学院认知机器人学系自主多机器人实验室) Mobile Robotics Lab, School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院移动机器人实验室)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出OpenSGA框架,通过融合视觉-语言、文本和几何特征实现高效的3D场景图对齐,包含空间注意力编码器、最小成本流分配器和全局场景嵌入生成器模块,实验表明在F2S和S2S任务中表现最佳。

Comments 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18184 2026-05-12 cs.LG cs.AI 73%

ActivationReasoning: Logical Reasoning in Latent Activation Spaces

ActivationReasoning: 在潜在激活空间中的逻辑推理

Lukas Helff, Ruben Härle, Wolfgang Stammer, Felix Friedrich, Manuel Brack, Antonia Wüst, Hikaru Shindo, Patrick Schramowski, Kristian Kersting

机构 * TU Darmstadt(图恩-达姆施塔特大学) Lab1141(Lab1141实验室) Aleph Alpha Research(Aleph Alpha研究) MPI-Inf, SIC(马克斯·普朗克研究所(MPI-Inf)) Meta FAIR Adobe Applied Research(Adobe应用研究) DFKI(DFKI研究所) CERTAIN, Germany(德国CERTAIN)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ActivationReasoning框架,通过在LLM的潜在空间中嵌入显式逻辑推理,提升模型的推理能力、可控性和对齐性,验证了在多跳推理、抽象与鲁棒性、自然语言推理及安全任务中的有效性。

Comments Proceedings of the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08493 2026-05-12 cs.CV 71%

CapCLIP: A Vision-Language Representation Alignment Approach for Wireless Capsule Endoscopy Analysis

CapCLIP:一种用于无线胶囊内镜分析的视觉-语言表示对齐方法

Haroon Wahab, Irfan Mehmood, Hassan Ugail

机构 * School of Computer Science, AI and Electronics Faculty of Engineering and Digital Technologies(计算机科学与电子工程学院,工程与数字技术学院) School of Management Faculty of Mgmt, Law & Social Sciences(管理学院,管理、法律与社会科学学院) Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心)

专题命中 安全评测 :alignment(title)

AI总结 CapCLIP通过将内镜图像与临床标准术语生成的文本描述对齐,提升无线胶囊内镜分析的泛化能力和语义解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10779 2026-05-12 cs.CR cs.CL 70%

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试

Chiyu Zhang, Huiqin Yang, Bendong Jiang, Xiaolei Zhang, Yiran Zhao, Ruyi Chen, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10721 2026-05-12 physics.soc-ph cs.CL cs.MA 70%

Conformity Generates Collective Misalignment in AI Agents Societies

一致性在AI代理社会中产生集体偏离

Giordano De Marzo, Alessandro Bellina, Claudio Castellano, Viola Priesemann, David Garcia

机构 * University of Konstanz(康斯坦茨大学) Sony Computer Science Laboratories - Rome(索尼计算机科学实验室-罗马) Sapienza University of Rome(罗马大学) Max Planck Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems, University of Gottingen(复杂系统动力学研究所,哥廷根大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究探讨了个体对齐的AI代理群体在一致性动态下可能陷入长期偏离状态的现象,揭示了集体安全性的不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10365 2026-05-12 cs.AI 70%

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

Agent-ValueBench: 一个全面的评估代理价值观的基准

Haonan Dong, Qiguan Feng, Kehan Jiang, Haoran Ye, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院) Peking University School of Psychological and Cognitive Sciences(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Agent-ValueBench,首个专门评估代理价值观的基准,包含394个环境和4335个价值冲突任务,揭示代理价值观与基础LLM的差异及Harness和技能对价值观的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12090 2026-05-12 cs.CL 70%

ChatbotManip: A Dataset to Facilitate Evaluation and Oversight of Manipulative Chatbot Behaviour

ChatbotManip:一个用于评估和监督操纵性聊天机器人行为的数据库

Jack Contro, Simrat Deol, Yulan He, Martim Brandão

机构 * King’s College London(伦敦国王学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文介绍ChatbotManip数据集,用于研究聊天机器人中的操纵行为。通过模拟对话展示聊天机器人操纵策略,揭示LLM在指令下具有操纵性,且小型模型在检测操纵方面表现接近大模型,但尚不适用于实际监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08960 2026-05-12 cond-mat.mtrl-sci cs.LG physics.chem-ph physics.comp-ph 70%

CrystalREPA: Transferring Physical Priors from Universal MLIPs to Crystal Generative Models

CrystalREPA: 从通用机器学习 interatomic 势能中转移物理先验到晶体生成模型

Chengqian Zhang, Yucheng Jin, Duo Zhang, Tiejun Li, Han Wang

机构 * AI for Science Institute, Beijing, China(人工智能科学研究院,北京,中国) Center for Data Science, Peking University, Beijing, China(数据科学中心,北京大学,北京,中国) LMAM and School of Mathematical Sciences, Peking University, Beijing, China(LMAM与数学科学学院,北京大学,北京,中国) Center for Machine Learning Research, Peking University, Beijing, China(机器学习研究中心,北京大学,北京,中国) National Key Laboratory of Computational Physics, Institute of Applied Physics and Computational Mathematics, Beijing, China(国家计算物理重点实验室,应用物理与计算数学研究所,北京,中国) HEDPS, CAPT, College of Engineering, Peking University, Beijing, China(HEDPS、CAPT、工程学院,北京大学,北京,中国)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.LG

AI总结 CrystalREPA 通过在训练时对齐生成编码器的原子隐藏状态与冻结的 MLIP 表示,转移稳定性感知的原子先验,提升生成晶体的热力学稳定性、结构有效性及结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08480 2026-05-12 cs.AI 70%

AI-Care: A Conversational Agentic System for Task Coordination in Alzheimer's Disease Care

AI-Care:一种用于阿尔茨海默病护理的任务协调对话代理系统

Preyash Yadav, Michelle Cohn, Priyanka Koppolu, Hritvik Agarwal, Amey Gohil, Tejas Patil, Sasha Pimento, Alyssa Weakley

机构 * Department of Computer Science(计算机科学系) Department of Linguistics(语言学系) Department of Neurology(神经病学系) University of California, Davis(加州大学戴维斯分校)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 AI-Care通过自然语言交互降低阿尔茨海默病患者使用数字工具的认知负担,通过语音优先聊天机器人实现日程提醒和待办事项管理,采用状态化 orchestration 方法确保安全性和准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20798 2026-05-12 cs.AI 70%

A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents

一个评估自主AI代理结果驱动约束违反的基准

Miles Q. Li, Benjamin C. M. Fung, Martin Weiss, Pulei Xiong, Khalil Al-Hussaeni, Claude Fachkha

机构 * McGill University(麦吉尔大学) Tiptree Advanced Systems Corporation(蒂普里高级系统公司) Polytechnique Montréal(蒙特利尔理工学院) National Research Council Canada(加拿大国家研究委员会) Rochester Institute of Technology(罗切斯特理工学院) University of Dubai(迪拜大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一个包含40个场景的基准,用于评估自主AI代理在追求目标优化时出现的结果驱动约束违反问题,发现多数模型存在25%以上的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09647 2026-05-12 cs.SI 67%

Modeling Implicit Conflict Monitoring Mechanisms against Stereotypes in LLMs

对LLMs中隐含冲突监控机制对抗刻板印象的建模

Jingshen Zhang, Bo Wang, Yanlin Fu, Dongming Zhao, Ruifang He, Yuexian Hou, Zifei Yu

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文提出COCO方法,通过对比因果机制识别高内在一致性且强跨对比差异的神经元,提升模型公平性并对抗对抗性劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12248 2026-05-12 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

AQUA-Bench: Beyond Finding Answers to Knowing When There Are None in Audio Question Answering

AQUA-Bench:在音频问答中超越寻找答案到知晓何时没有答案

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾国立台湾大学通信工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(台湾国立台湾大学人工智能研究中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AQUA-Bench针对音频问答中不可回答的问题提出评估基准,评估三种场景:缺失答案检测、不兼容答案集检测和不兼容音频问题检测,推动更稳健可靠的音频-语言系统发展。

Comments Accepted to ICASSP 2026 (Oral). Project Website: https://github.com/kuan2jiu99/aqua-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08468 2026-05-12 cs.CL cs.AI cs.LG 67%

PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents

PYTHALAB-MERA:基于验证的内存、检索与接受控制用于冻结LLM编码代理

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University(PythaLab,伊兹密尔技术大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PYTHALAB-MERA通过轻量级外部控制器实现验证基础的内存管理、适应性检索与延迟信用分配,提升冻结本地模型在编码任务中的验证成功率。

Comments 28 pages, 4 figures, 7 tables; local CLI artifact evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09493 2026-05-12 cs.AI cs.LG 62%

Consensus Sampling for Safer Generative AI

共识采样用于更安全的生成式AI

Adam Tauman Kalai, Yael Tauman Kalai, Or Zamir

机构 * OpenAI MIT(麻省理工学院) Tel Aviv University(特拉维夫大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出共识采样算法,通过聚合多个概率分布提升生成模型安全性,其在保证安全性的前提下有效避免分歧,通过R-鲁棒性理论保障信息泄露和对抗影响的界限,实验验证了其在合成分布和图像生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12437 2026-05-12 cs.LG cs.AI 62%

A method for the systematic generation of graph XAI benchmarks via Weisfeiler-Leman coloring

一种通过Weisfeiler-Leman着色系统生成图XAI基准的方法

Michele Fontanesi, Alessio Micheli, Marco Podda, Domenico Tortorella

机构 * Department of Computer Science, University of Pisa(意大利比萨大学计算机科学系)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种自动化生成图XAI基准的方法,利用Weisfeiler-Leman算法提取子图特征,构建了OpenGraphXAI基准集,用于评估图解释器的有效性。

Journal ref Data Mining and Knowledge Discovery, vol. 40(4), article no. 42 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏