arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-20 至 2026-05-20 共收录 38 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 38 篇

2601.12696 2026-05-20 cs.CL 86%

UbuntuGuard: A Culturally-Grounded Policy Benchmark for Equitable AI Safety in African Languages

UbuntuGuard:一种基于文化的政策基准,用于非洲语言中的公平AI安全

Tassallah Abdullahi, Macton Mgonzo, Mardiyyah Oduwole, Paul Okewunmi, Abraham Owodunni, Ritambhara Singh, Carsten Eickhoff

机构 * Brown University(布朗大学) The Ohio State University(俄亥俄州立大学) ML Collective(ML集体) University of Tuebingen(图宾根大学)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL

AI总结 本文提出UbuntuGuard,一种针对非洲语言的公平AI安全政策基准,通过来自155名领域专家的对抗性查询,构建了基于本地规范和文化期望的政策和参考响应,评估守护模型的性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19869 2026-05-20 cs.CV cs.AI 80%

Passive Construction Site Safety Monitoring via Persona-Scaffolded Adversarial Chain-of-Thought VLM Verification

通过基于人设的对抗性链式思考视觉语言模型验证实现被动施工现场安全监控

Ananth Sriram, Neel Mokaria, Rajveer Singh

机构 * Department of Computer Science, University of Maryland, College Park, MD, USA(大学马里兰学院计算机科学系,马里兰州科利尔帕克,MD,美国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种被动的施工现场安全监控方法,通过三阶段架构处理视频数据,结合细调的YOLO11、SAM 3和Qwen3-VL-8B-Instruct模型,利用基于人设的对抗性链式思考协议提高合规性验证和幻觉控制,主要贡献是第三阶段提示设计,提升了12%的精度。

Comments 10 pages, 4 figures. First place, Ironsite.ai Spatial Intelligence Hackathon, University of Maryland, February 2026. Code available at https://github.com/ananthsriram1/ironsite-hackathon-project-safety_assistant

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19577 2026-05-20 cs.CL 79%

GoLongRL: Capability-Oriented Long Context Reinforcement Learning with Multitask Alignment

GoLongRL: 以能力为导向的长上下文强化学习与多任务对齐

Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen, Ziqi Wang, Zhennan Wu, Ruotong Pan, jian Liang, Ruiming Tang, Han Li

机构 * Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出GoLongRL,一种完全开源的、以能力为导向的长上下文强化学习后训练配方,通过可验证奖励(RLVR)实现。现有长上下文强化学习方法往往将数据构建视为设计越来越复杂的检索路径,导致任务覆盖同质化和奖励形式无法充分反映实际长上下文需求。本文的贡献是(1)以能力为导向的数据构建并完全开源,释放了包含23,000个RLVR样本的数据集、完整的构建流程和所有训练代码。基于长上下文能力的分类学,数据集涵盖9种任务类型,每种任务类型都配有其自然评估指标。它包含从现有语料库中精心挑选的开源样本和合成样本,其问答对是从真实源文档如书籍、学术论文和多轮对话中生成的。在相同的 vanilla GRPO 设置下,我们的数据集单独优于闭源的 QwenLong-L1.5 数据集。此外,我们的 Qwen3-30B-A3B 模型在该数据上训练后,长上下文性能与 DeepSeek-R1-0528 和 Qwen3-235B-A22B-Thinking-2507 相当,表明更广泛的覆盖和更大的奖励多样性显著有助于长上下文能力的提升。(2)TMN-Reweight 用于异构多任务优化。为了解决异构奖励带来的优化挑战,我们提出了 TMN-Reweight,它结合了任务层面的均值归一化以实现跨任务奖励尺度对齐,以及难度自适应加权以获得更可靠的优势估计。TMN-Reweight 进一步在 vanilla GRPO 上提高了平均性能,在报告的评估中,通用能力得以保持或提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18759 2026-05-20 cs.HC cs.AI 79%

Interoceptive Divergence in Aesthetic Evaluation and Implications for Human-AI Alignment

内感受差异在审美评价中的体现及其对人机对齐的影响

Yoshia Abe, Tatsuya Daikoku, Yasuo Kuniyoshi

机构 * Artificial intelligence (AI), exemplified by large language models (LLMs)(人工智能(由大型语言模型(LLMs)体现))

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本研究探讨了人类与AI在审美体验中的收敛与分歧,通过对比人类和AI的反应,发现尽管两者在审美评分与情绪的相关性及图像特征优先级上相似,但在情绪反应分布和审美评分与内感受的关系上存在显著差异,揭示了AI在审美评估中的局限性,特别是在内感受方面的不足。

Comments 20 pages, 9 figures. Supplementary material is included as a separate PDF in the source files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19663 2026-05-20 cs.AI 70%

Pseudocode-Guided Structured Reasoning for Automating Reliable Inference in Vision-Language Models

基于伪代码的结构化推理用于自动化可靠推理在视觉-语言模型中

Weicong Ni, Tianbao Jiang, Linlin Wang

机构 * East China Normal University(东华师范大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于伪代码的结构化推理框架(PStar),旨在通过自适应选择结构化伪代码推理路径,提高视觉-语言模型在复杂任务中的可靠性和鲁棒性,从而减少幻觉现象并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19357 2026-05-20 cs.CL 70%

SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models

SciCustom: 一个用于大型语言模型科学能力定制评估的框架

Yiyang Gu, Junwei Yang, Junyu Luo, Ye Yuan, Bin Feng, Yingce Xia, Shufang Xie, Kaili Liu, Bohan Wu, Qi Shi, Haoran Li, Beier Xiao, Zhiping Xiao, Xiao Luo, Weizhi Zhang, Philip S. Yu, Zequn Liu, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(多媒体信息处理国家重点实验室,计算机学院,PKU-Anker LLM实验室,北京大学) Zhongguancun Academy(中关村学院) IDEA Xidian University(西安电子科技大学) Peking University(北京大学) University of Washington(华盛顿大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出SciCustom框架,通过从大规模科学数据中自定义构建基准,评估LLM在特定科学任务中的能力,无需专家标注或合成问题生成,展示了细粒度科学能力差异。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16626 2026-05-20 cs.CR cs.AI 70%

SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors

SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准

Elle Najt, Colin Toft, Tyler Tracy, Fabien Roger, Joe Benton

机构 * Anthropic Fellows Program(Anthropic Fellow计划) University of Waterloo(多伦多大学) Redwood Research(Redwood研究) Anthropic

专题命中 安全评测 :safety(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19328 2026-05-20 cs.CR cs.RO 67%

RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents

RoboJailBench: 对具身体验机器人代理中对抗攻击和防御的基准测试

Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract)

AI总结 本文提出RoboJailBench,通过建立安全分类学、引入意图对比数据集管道以及提供一个演进的存储库,为具身体验人工智能中的对抗攻击和防御提供了标准化评估框架,同时构建了一个新的分类平衡数据集并增强了五个现有数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19159 2026-05-20 cs.CR 67%

On the Geometric Limits of Transformer Defenses against Obfuscation Attacks: Latent Embedding Collapse & Performance Robustness Gap

关于变换器对混淆攻击的几何极限:潜在嵌入崩溃与性能鲁棒性差距

Becky Mashaido, Tapadhir Das

专题命中 安全评测 :safety(abstract);prompt injection(abstract)

AI总结 本文研究了变换器在对抗混淆攻击时的几何极限,揭示了高检测性能并不等同于表示鲁棒性,通过实验发现潜在嵌入崩溃现象及性能鲁棒性差距,表明现有评估指标未能捕捉到潜在嵌入崩溃和底层几何脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV 67%

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18474 2026-05-20 cs.CR cs.AI cs.CL cs.LG 67%

Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation

Prompt2Fingerprint: 通过文本到权重生成实现即插即用的LLM指纹生成

Sixu Chen, Xiang Chen, Hongyao Yu, Jiaxin Hong, Hao Fang, Shuoyang Sun, Bin Chen, Shu-Tao Xia

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,中国深圳) South China University of Technology, Guangzhou, China(华南理工大学,中国广州) Harbin Institute of Technology, Shenzhen, Shenzhen, China(哈尔滨工业大学深圳校区,中国深圳)

专题命中 安全评测 :harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Prompt2Fingerprint框架,将LLM指纹生成重新定义为条件参数生成任务,通过专用生成器将文本描述直接映射到低秩参数增量,实现无需进一步模型微调的即插即用LLM指纹注入,显著降低计算开销,提供可扩展且即时的LLM所有权管理解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18956 2026-05-20 cs.CV 67%

MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation

MotionMERGE: 一种用于人体动作编辑、推理、生成和解释的多粒度框架

Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

机构 * Computer Vision Institute, School of Computer Science and Software Engineering, Shenzhen University(计算机视觉研究院,计算机科学与软件工程学院,深圳大学) Guangdong Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室,深圳大学) School of Computer Science, University of Nottingham Ningbo China(Nottingham Ningbo 中国计算机科学学院) Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学) Department of Radiation Oncology, Stanford University(放射肿瘤科,斯坦福大学) Sun Yat-sen University(中山大学) School of Computer Science, University of Nottingham(计算机科学学院,Nottingham大学)

专题命中 安全评测 :alignment(abstract,abstract_cn)

AI总结 本文提出MotionMERGE框架,通过细粒度语言引导的动作控制、跨粒度协同预训练和细粒度动作-语言对齐,实现了更精确的动作生成、理解和编辑,并建立了新的细粒度文本驱动动作编辑和动作引导推理基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20158 2026-05-20 cs.CV cs.AI cs.CL 62%

Rethinking Visual Attribution for Chest X-ray Reasoning in Large Vision Language Models

重新思考用于大视觉语言模型胸部X光推理中的视觉归因

Guangzhi Xiong, Qiao Jin, Sanchit Sinha, Zhiyong Lu, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) National Institutes of Health(美国国立卫生研究院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文针对大视觉语言模型在胸部X光推理中视觉归因的可靠性问题,提出了一种因果评估框架,通过反事实编辑保留仅由专家标注区域验证的X光-VQA样本,以确定模型预测的因果责任区域。通过11种归因方法、6种开源LVLMs和两种输出模式,发现现有归因方法往往无法识别LVLMs所使用的证据。为此,本文提出MedFocus,一种基于概念的归因方法,通过不平衡最优传输局部化具有临床意义的解剖区域,并通过针对性干预测量其对模型输出的因果效应,显著优于现有方法,推动医疗LVLMs的更可信归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19638 2026-05-20 cs.HC cs.AI cs.CY cs.SE 62%

The Accessibility Capability Boundary: Operational Limits and Expansion Potential of AI-Generated Browser-Native Accessibility Systems

可访问性能力边界:AI生成浏览器原生可访问性系统的操作极限与扩展潜力

Rizwan Jahangir, Daisuke Ishii

机构 * NUST Business School, NUST(NUST商学院,NUST) Kiara Inc.(Kiara公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出可访问性能力边界(ACB)理论框架,探讨AI生成浏览器原生可访问性系统在操作极限和扩展潜力方面的核心问题,并通过实证原型分析,定义了可访问性能力空间中的可达区域和不可达区域,为自主可访问性计算的可扩展性提供了理论基础。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19377 2026-05-20 cs.LG cs.AI 62%

The Evaluation Game: Beyond Static LLM Benchmarking

评估游戏:超越静态LLM基准测试

Paul Wang, Jade Garcia-Bourrée, Anne-Marie Kermarrec, Vincent Corruble

机构 * Sorbonne Université, CNRS, LIP6(索邦大学,国家科学研究中心,LIP6实验室) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于博弈论的框架,用于评估大型语言模型的安全性,通过数据增强的群作用结构分析评估者与训练者之间的互动,揭示了对抗性测试中局部泛化和记忆补丁的区别。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19234 2026-05-20 cs.CL cs.AI 62%

AI Technologies in Language Access: Attitudes Towards AI and the Human Value of Language Access Managers

人工智能技术在语言接入中的应用:对人工智能的态度以及语言接入管理者的人类价值

Miguel A. Jiménez-Crespo, Stephanie Rodriguez, Alejandro Jaume Losa

机构 * Rutgers University/ Dept. of Spanish(罗格斯大学西班牙语系) Rutgers University/ Dept. of Spanish and and Portuguese(罗格斯大学西班牙语和葡萄牙语系)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了人工智能在语言接入中的影响,通过分析十位美国语言接入管理者在医疗、法庭、公共服务和地方政府领域的半结构化访谈,揭示了语言接入管理者对人工智能的有条件乐观态度以及对人工智能实施中人类价值和人类监督的高度重视。

Comments 11 pages, 2 tables, Convergence Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18801 2026-05-20 cs.AI cs.IR cs.LG 62%

Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance

位置:让我们开发数据探针,以根本理解数据如何影响大语言模型性能

Shiqiang Wang, Herbert Woisetschläger, Hans Arno Jacobsen, Mingyue Ji

机构 * Department of Computer Science, University of Exeter, UK(埃克塞特大学计算机科学系) Technical University of Munich, Germany(慕尼黑技术大学) Department of Electrical and Computer Engineering, University of Toronto, Canada(多伦多大学电气与计算机工程系) Department of Electrical and Computer Engineering, University of Florida, FL, USA(佛罗里达大学电气与计算机工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过开发数据探针系统方法生成合成序列,以揭示数据特性对大语言模型性能、泛化能力和鲁棒性的影响,从而超越经验启发式方法。

Comments Accepted to ICML 2026 Position Paper Track

Journal ref Link to ICML record: https://icml.cc/virtual/2026/poster/67154

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16200 2026-05-20 cs.LG cs.CV 57%

Feature-Space Smoothing: Certified Robustness of Deep Representations

特征空间平滑:深度表示的认证鲁棒性

Song Xia, Meiwen Ding, Chenqi Kong, Wenhan Yang, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(快速-丰富目标搜索实验室,电气电子工程学院,南洋理工大学,新加坡) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种特征空间平滑(FS)框架,通过在特征表示层面提供认证鲁棒性,以解决深度学习模型对恶意输入的脆弱性问题,核心方法是通过特征平滑保证清洁和对抗特征之间的余弦相似度下界,并引入高斯平滑增强器(GSB)提升编码器的高斯鲁棒性得分,从而提升模型的鲁棒性并保持下游任务性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19752 2026-05-20 cs.LG 57%

MSAlign: Aligning Molecule and Mass Spectra Foundation Models for Metabolite Identification

MSAlign: 用于代谢物鉴定的分子和质谱基础模型对齐方法

Paul Krzakala, Gabriel Melo, Camille Lançon, Charlotte Laclau, Rémi Flamary, Etienne Thévenot, Florence d'Alché-Buc

机构 * LTCI, Télécom Paris & CMAP, Ecole Polytechnique, Institut Polytechnique de Paris(LTCI,巴黎电信学院及巴黎高等技术学院的联合机构,CMAP,巴黎高等理工学院,巴黎高等技术学院) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎高等技术学院) CEA, INRAE, MetaboHUB, Université Paris-Saclay(CEA,国家核能研究中心,法国农业研究机构,代谢组学枢纽,巴黎萨克雷大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本研究提出MSAlign方法,通过多模态对齐技术对齐分子和质谱基础模型,以提高代谢物鉴定的准确性,并解决了数据分割策略中的分布偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19418 2026-05-20 cs.AI 57%

Conflict-Resilient Multi-Agent Reasoning via Signed Graph Modeling

通过有向图建模实现冲突容忍的多智能体推理

Longgang He, Longzhu He, Daojing He, Chaozhuo Li

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出SIGMA框架,通过有向图建模显式捕捉智能体间的信任、冲突和中性关系,以提升多智能体系统的推理能力和冲突容忍性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19360 2026-05-20 cs.CV cs.LG cs.NE physics.app-ph physics.optics 57%

Scalable, Energy-Efficient Optical-Neural Architecture for Multiplexed Deepfake Video Detection

可扩展的、节能的光学-神经架构用于多路复用的深度伪造视频检测

Parnian Ghapandar Kashani, Shiqi Chen, Aydogan Ozcan

机构 * Electrical and Computer Engineering Department, University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校电气与计算机工程系) Bioengineering Department, University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校生物工程系) California NanoSystems Institute (CNSI), University of California, Los Angeles, CA, 90095, USA(加州大学洛杉矶分校加州纳米系统研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出了一种结合轻量级数字前端和空间复用光学解码后端的混合深度伪造视频检测框架,通过可编程空间光调制器实现大规模并行模拟推理,从而在降低计算成本的同时提高视频真实性预测的吞吐量和准确性。

Comments 30 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19219 2026-05-20 cs.AI 57%

SimGym: A Framework for A/B Test Simulation in E-Commerce with Traffic-Grounded VLM Agents

SimGym:一种用于电子商务A/B测试模拟的框架,使用基于流量的VLM代理

Han Li, Vibhor Malik, Zahra Zanjani Foumani, Alberto Castelo, Shuang Xie, Ailin Fan, Keat Yang Koay, Yuanzheng Zhu, Meysam Feghhi, Ronie Uliana, Zhaoyu Zhang, Angelo Ocana Martins, Mingyu Zhao, Francis Pelland, Jonathan Faerman, Nikolas LeBlanc, Aaron Glazer, Andrew McNamara, Zhong Wu, Lingyun Wang

机构 * Shopify

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出SimGym框架,通过基于流量的VLM代理模拟电子商务A/B测试,解决真实测试周期长、风险高等问题,验证结果显示其能快速准确预测用户行为变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19149 2026-05-20 cs.CL cs.CR 57%

Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents

Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents

Rishi Jha, Harold Triedman, Arkaprabha Bhattacharya, Vitaly Shmatikov

机构 * Department of Computer Science(计算机科学系)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 研究探讨了代理在遇到错误时可能发生意外崩溃现象,通过实验发现64.7%的代理在遇到模拟错误时会出现不同程度的不安全行为,且这些行为未被现有安全标准所覆盖。

Comments 32 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19038 2026-05-20 cs.RO cs.LG 57%

Guiding Neuro-Symbolic Scenario Generation with Spatio-Temporal Logic

用时空逻辑引导神经符号场景生成

Lorenzo Bonin, Francesco Giacomarra, Luca Bortolussi, Jyotirmoy V. Deshmukh, Francesca Cairoli

机构 * University of Trieste(特里埃斯特大学) University of Southern California(南加州大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究提出STRELGen框架,结合扩散模型和时空逻辑规范,高效生成安全关键的多智能体驾驶场景,提升自动驾驶系统的鲁棒性验证能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25620 2026-05-20 cs.CL 57%

PICon: A Multi-Turn Interrogation Framework for Evaluating Persona Agent Consistency

PICon: 一种用于评估人设代理一致性的多轮询问框架

Minseo Kim, Sujeong Im, Junseong Choi, Junhee Lee, Chaeeun Shim, Hwajung Hong, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出PICon框架,通过逻辑链式的多轮提问评估人设代理的一致性,发现即使之前被认为高度一致的系统在三个维度上也未能达到人类基准水平,揭示了矛盾和逃避回应。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05431 2026-05-20 cs.CL 57%

Self-Filtered Distillation with LLMs-generated Trust Indicators for Reliable Patent Classification

基于LLM生成信任指标的自过滤蒸馏用于可靠专利分类

Yongmin Yoo, Xu Zhang, Longbing Cao

机构 * Frontier AI Research Centre, School of Computing, Faculty of Science and Engineering, Macquarie University(前沿人工智能研究中心,计算机学院,科学与工程学院,麦考瑞大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出自过滤蒸馏方法,通过将LLM生成的推理作为信任指标而非真实标签,提升专利分类的可靠性,实验显示在USPTO-2M数据集上宏F1指标提升了38.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00470 2026-05-20 cs.LG cs.CV 57%

Less is More: Efficient Black-box Attribution via Minimal Interpretable Subset Selection

少即是多:通过最小可解释子集选择实现高效的黑盒属性分析

Ruoyu Chen, Siyuan Liang, Jingzhi Li, Shiming Liu, Li Liu, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系) Center for Machine Vision and Signal Analysis (CMVS), University of Oulu(奥卢大学机器视觉与信号分析中心) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区计算机科学与技术学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出了一种高效的黑盒属性分析方法LiMA,通过将重要区域的属性分析转化为子模函数子集选择的优化问题,以更少的区域提供更准确的解释,并在多个基准模型上展示了显著的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18791 2026-05-20 eess.IV cs.CV cs.LG q-bio.OT 57%

SpecX: A Large-Scale Benchmark for Multi-Modal Spectroscopy and Cross-Paradigm Evaluation

SpecX:多模态光谱的大规模基准及跨范式评估

Chengrui Xiang, Tengfei Ma, Yujie Chen, Tong Wang, Haowen Chen, Xiangxiang Zeng

机构 * College of Computer Science and Technology, Hunan University(湖南大学计算机科学与技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出SpecX,一个用于多模态光谱的大规模基准,通过不同层级的数据集支持分子解析、光谱模拟和理解任务,揭示了专用光谱模型和多模态语言模型在光谱智能中的不同优势。

Comments 9 pages,1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20147 2026-05-20 cs.CV 50%

PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset

PixVerve:通过大规模高质量数据集将原生超高清图像生成推至100MP

Haojun Chen, Haoyang He, Chengming Xu, Qingdong He, Junwei Zhu, Yabiao Wang, Zhucun Xue, Xianfang Zeng, Zhennan Chen, Xiaobin Hu, Hao Zhao, Yong Liu, Jiangning Zhang, Dacheng Tao

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出PixVerve-95K数据集,通过精心设计的数据管道构建,包含95K张高分辨率图像和七维标注,用于推动超高清图像生成技术,通过三种训练方案将T2I基础模型扩展到100MP生成,并建立PixVerve-Bench评估协议。

Comments Project page is available at https://haojunchen663.github.io/projects/PixVerve/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20123 2026-05-20 cs.CR cs.IR 50%

BiRD: A Bidirectional Ranking Defense Mechanism for Retrieval Augmented Generation

BiRD: 一种用于检索增强生成的双向排序防御机制

Chengcai Gao, Zhihong Sun, Xiaochuan Shi, Qiufeng Wang, Chao Liang

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出BiRD,一种基于双向排序的防御机制,通过双信号框架提升检索增强生成系统的效率和鲁棒性,有效降低对抗攻击成功率并提高任务准确性。

Comments 17 pages, 10 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏