arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2601.17204 2026-03-05 cs.LG cs.CE 79%

SpecBridge: Bridging Mass Spectrometry and Molecular Representations via Cross-Modal Alignment

SpecBridge: 通过跨模态对齐弥合质谱与分子表示

Yinkai Wang, Yan Zhou Chen, Xiaohui Chen, Li-Ping Liu, Soha Hassoun

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 SpecBridge通过跨模态对齐方法提升质谱数据中分子鉴定的准确性,利用冻结的基础模型实现高效检索。

Comments We have found a problem in the preprocessing/evaluation pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02542 2026-03-04 cs.AI 79%

AnchorDrive: LLM Scenario Rollout with Anchor-Guided Diffusion Regeneration for Safety-Critical Scenario Generation

AnchorDrive: 基于锚点引导扩散再生的LLM场景回放用于安全关键场景生成

Zhulin Jiang, Zetao Li, Cheng Wang, Ziwen Wang, Chen Xiong

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能系统工程学院,深圳,中国)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 AnchorDrive通过结合LLM的可控生成和扩散模型的真实轨迹生成,实现安全关键场景的高效合成,提升场景的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00429 2026-03-03 cs.HC cs.AI 79%

Personalities at Play: Probing Alignment in AI Teammates

性格的博弈:探究AI队友的对齐

Mohammad Amin Samadi, Nia Nixon

机构 * School of Education University of California Irvine(教育学院 加州大学尔湾分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 研究探讨AI队友的性格对齐,通过多维度评估发现其性格表现受提示策略、供应商差异和记忆构建影响,强调需综合考虑记忆和系统设计以有效评估AI性格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23753 2026-03-02 cs.CL 79%

Structured Prompt Optimization for Few-Shot Text Classification via Semantic Alignment in Latent Space

通过潜在空间语义对齐的结构化提示优化实现少样本文本分类

Jiasen Zheng, Zijun Zhou, Huajun Zhang, Junjiang Lin, Jingyun Jia, Qi Wang

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出通过潜在空间语义对齐的结构化提示优化方法,解决少样本文本分类中的语义冲突和标签模糊问题,提升分类性能和跨任务适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23075 2026-02-27 cs.CL cs.IR 79%

CiteLLM: An Agentic Platform for Trustworthy Scientific Reference Discovery

CiteLLM:一个用于可信科学引文发现的代理平台

Mengze Hong, Di Jiang, Chen Jason Zhang, Zichang Guo, Yawen Li, Jun Chen, Shaobo Cui, Zhiyang Su

机构 * Hong Kong Polytechnic University(香港理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Swiss Federal Technology Institute of Lausanne (EPFL)(洛桑联邦理工学院) Hong Kong University of Science and Technology (HKUST)(香港科学大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 CiteLLM通过在LaTeX编辑器中嵌入LLM工具,实现可信的科学引文发现,确保引文的准确性和可靠性。

Comments Accepted by TheWebConf 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04403 2026-02-27 cs.CV cs.CL cs.CR 79%

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

自适应数据集构建用于现实世界多模态安全场景

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文提出了一种图像导向的自适应数据集构建方法,用于构建现实世界多模态安全场景的数据集,通过生成35,000个图像-文本对及其指导响应,提升了安全评估的有效性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21829 2026-02-26 cs.CV cs.AI 79%

StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles

StoryMovie: 一个用于视觉故事语义对齐的语料库,结合电影剧本和字幕

Daniel Oliveira, David Martins de Matos

机构 * INESC-ID(INESC-ID研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 StoryMovie通过结合电影剧本和字幕,提升视觉叙事模型的语义对齐能力,使对话归属更准确。

Comments 15 pages, submitted to Journal of Visual Communication and Image Representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20628 2026-02-25 cs.AI 79%

When can we trust untrusted monitoring? A safety case sketch across collusion strategies

我们何时可以信任不可信的监控?跨合谋策略的安全案例草图

Nelson Gardner-Challis, Jonathan Bostock, Georgiy Kozhevnikov, Morgan Sinclaire, Joan Velja, Alessandro Abate, Charlie Griffin

机构 * LASR Labs(LASR实验室) University of Oxford(牛津大学) University of Wyoming(怀俄明大学) Imperial College London(伦敦帝国学院) UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种跨合谋策略的安全案例草图,探讨了不可信监控的安全性问题,分析了不同合谋策略的有效性,并指出了未解决的挑战。

Comments 66 pages, 14 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11876 2026-02-25 cs.CL 79%

EAMET: Robust Massive Model Editing via Embedding Alignment Optimization

EAMET: 通过嵌入对齐优化实现鲁棒的大规模模型编辑

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 EAMET通过嵌入对齐优化提升大规模模型编辑的鲁棒性和效率,实现90%的编辑效果

Comments This paper was accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23434 2026-02-25 cs.LG 79%

Towards Trustworthy GUI Agents: A Survey

迈向可信的GUI代理:综述

Yucheng Shi, Wenhao Yu, Jingyuan Huang, Wenlin Yao, Wenhu Chen, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文综述了GUI代理的可信度挑战,提出信任分类法并分析了信任评估与安全可靠部署的开放问题。

Comments 14 pages, work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17910 2026-02-23 cs.AI 79%

Alignment in Time: Peak-Aware Orchestration for Long-Horizon Agentic Systems

时间对齐:面向长时间 horizon 代理系统的峰值感知 orchestration

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱维大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 APEMO通过时间-情感信号优化计算分配,提升长horizon代理系统轨迹质量和重用概率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17106 2026-02-20 cs.AI 79%

Toward Trustworthy Evaluation of Sustainability Rating Methodologies: A Human-AI Collaborative Framework for Benchmark Dataset Construction

迈向可信的可持续性评级方法论评估:一种人机协作框架用于基准数据集构建

Xiaoran Cai, Wang Yang, Xiyu Ren, Chekun Law, Rohit Sharma, Peng Qi

机构 * Columbia University, USA(哥伦比亚大学) Case Western Reserve University, USA(凯斯西储大学) Hong Kong University of Science(香港科学大学) NVIDIA, USA(NVIDIA公司) Informatica Inc., USA(Informatica公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出一种人机协作框架,用于构建可信的可持续性评级方法论基准数据集,以提高评分的可比性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16984 2026-02-20 cs.AI 79%

Fundamental Limits of Black-Box Safety Evaluation: Information-Theoretic and Computational Barriers from Latent Context Conditioning

黑盒安全评估的根本限制:从潜在上下文条件化的信息论和计算障碍

Vishal Srivastava

机构 * Whiting School of Engineering(韦斯利工程学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了黑盒安全评估的根本限制,揭示了潜在上下文条件化策略在部署风险估计中的信息论和计算障碍,提出了被动和自适应评估的下界以及计算分离的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06134 2026-02-18 cs.AI 79%

OpenAgentSafety: A Comprehensive Framework for Evaluating Real-World AI Agent Safety

OpenAgentSafety: 一个全面评估现实世界AI代理安全性的框架

Sanidhya Vijayvargiya, Aditya Bharat Soni, Xuhui Zhou, Zora Zhiruo Wang, Nouha Dziri, Graham Neubig, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 OpenAgentSafety提出一个全面评估AI代理安全性的框架,通过真实工具和多任务测试揭示代理在现实世界中的安全漏洞,强调需要加强安全防护。

Comments 26 pages, 10 figures, Accepted at ICLR 2026 and IASEAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13339 2026-02-17 cs.CV cs.AI 79%

An Integrated Causal Inference Framework for Traffic Safety Modeling with Semantic Street-View Visual Features

一种集成因果推断框架用于交通安全建模的语义街道视图视觉特征

Lishan Sun, Yujia Cheng, Pengfei Cui, Lei Han, Mohamed Abdel-Aty, Yunhan Zheng, Xingchen Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出集成因果推断框架,利用语义街景特征量化绿化对交通碰撞的因果影响,发现绿化比例显著降低碰撞风险,但对弱势道路使用者保护有限。

Comments 34 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10661 2026-02-16 cs.CL 79%

Targeted Syntactic Evaluation of Language Models on Georgian Case Alignment

针对格鲁吉亚语的语法评估:变换语义分析

Daniel Gallagher, Gerhard Heyer

机构 * Institute for Applied Informatics (InfAI)(应用信息研究所)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文针对格鲁吉亚语的语法评估,通过生成特定语法测试数据集,评估不同语言模型在处理分裂-反向语态对齐任务中的表现。

Comments To appear in Proceedings of The Second Workshop on Language Models for Low-Resource Languages (LoResLM), EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00653 2026-02-12 cs.CV cs.AI 79%

Non-Contrastive Vision-Language Learning with Predictive Embedding Alignment

非对比视觉语言学习与预测嵌入对齐

Lukas Kuhn, Giuseppe Serra, Florian Buettner

机构 * Goethe University Frankfurt(法兰克福歌德大学) German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联合会(DKTK))

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 NOVA通过联合嵌入预测与分布正则化,实现非对比视觉语言学习,简化训练目标并提升稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-02-12 cs.CV cs.AI 79%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11699 2026-02-10 cs.CY 79%

Frontier AI Auditing: Toward Rigorous Third-Party Assessment of Safety and Security Practices at Leading AI Companies

前沿AI审计:迈向对领先AI公司安全与安全实践的严格第三方评估

Miles Brundage, Noemi Dreksler, Aidan Homewood, Sean McGregor, Patricia Paskov, Conrad Stosz, Girish Sastry, A. Feder Cooper, George Balston, Steven Adler, Stephen Casper, Markus Anderljung, Grace Werner, Soren Mindermann, Vasilios Mavroudis, Ben Bucknall, Charlotte Stix, Jonas Freund, Lorenzo Pacchiardi, Jose Hernandez-Orallo, Matteo Pistillo, Michael Chen, Chris Painter, Dean W. Ball, Cullen O'Keefe, Gabriel Weil, Ben Harack, Graeme Finley, Ryan Hassan, Scott Emmons, Charles Foster, Anka Reuel, Bri Treece, Yoshua Bengio, Daniel Reti, Rishi Bommasani, Cristian Trout, Ali Shahin Shamsabadi, Rajiv Dattani, Adrian Weller, Robert Trager, Jaime Sevilla, Lauren Wagner, Lisa Soder, Ketan Ramakrishnan, Henry Papadatos, Malcolm Murray, Ryan Tovcimak

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文提出前沿AI审计的愿景,通过四个AI保证级别提升安全与安全实践的评估标准,推动行业高质量审计生态建设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03255 2026-02-04 cs.AI 79%

LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios

LPS-Bench: 在长周期规划中评估计算机使用代理的安全意识基准测试

Tianyu Chen, Chujia Hu, Ge Gao, Dongrui Liu, Xia Hu, Wenjie Wang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 LPS-Bench通过评估长周期规划中计算机使用代理的安全意识,揭示现有系统在安全行为维持方面的不足,并提出缓解策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03100 2026-02-04 cs.AI 79%

Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment

Risky-Bench: 探索现实部署中智能体安全风险

Jingnan Zheng, Yanzhen Luo, Jingjun Xu, Bingnan Liu, Yuxin Chen, Chenhang Cui, Gelei Deng, Chaochao Lu, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Southern University of Science and Technology(南方科技大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 Risky-Bench通过基于现实部署的安全原则,系统评估智能体在复杂任务中的安全风险,适用于多种部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15090 2026-02-04 cs.LG cs.GT econ.TH 79%

Emergent Alignment via Competition

通过竞争实现涌现对齐

Natalie Collina, Surbhi Goel, Aaron Roth, Emily Ryu, Mirah Shi

机构 * Department of Computer and Information Sciences, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 通过竞争实现AI与人类价值观的对齐,证明在特定条件下战略竞争可产生与完全对齐模型相当的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01824 2026-02-03 cs.HC cs.CY 79%

Risk, Data, Alignment: Making Credit Scoring Work in Kenya

风险、数据、对齐:使肯尼亚的信用评分有效

Daniel Mwesigwa, Steven J. Jackson, Christopher Csikszentmihalyi

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 本文探讨肯尼亚信用评分中风险、数据与对齐的动态关系,揭示算法信用评分通过持续的社会技术工作稳定风险的过程。

Comments Conditionally accepted to ACM CHI 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00641 2026-02-03 cs.AI 79%

AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents

AgentAuditor: 为LLM代理提供人类水平的安全性和安全性评估

Hanjun Luo, Shenyu Dai, Chiming Ni, Xinfeng Li, Guibin Zhang, Kun Wang, Tongliang Liu, Hanan Salam

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 AgentAuditor通过构建经验记忆和多阶段检索生成过程,提升LLM在代理安全性和安全性评估中的性能,达到人类水平的准确性。

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.09807 2026-02-02 cs.RO cs.AI cs.GT cs.MA 79%

I Know You Can't See Me: Dynamic Occlusion-Aware Safety Validation of Strategic Planners for Autonomous Vehicles Using Hypergames

我无法看到你:基于超游戏的动态遮挡感知的自动驾驶战略规划器安全验证

Maximilian Kahn, Atrisha Sarkar, Krzysztof Czarnecki

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出基于超游戏理论的动态遮挡风险度量方法和加速安全验证框架,用于提升自动驾驶战略规划器的安全性。

Comments This work is 6 pages long and contains 5 figures. For the supplementary video, see https://youtu.be/-crio3rA_IU

Journal ref 2022 International Conference on Robotics and Automation (ICRA). IEEE, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22696 2026-02-02 cs.CV cs.LG 79%

Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding

Bi-MCQ:重新表述视觉-语言对齐以理解否定

Tae Hun Kim, Hyun Gyu Lee

机构 * Department of Electrical and Computer Engineering, Inha University, Republic of Korea(电气与计算机工程系,印哈大学,大韩民国) College of Medicine, Inha University, Republic of Korea(医学学院,印哈大学,大韩民国)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 Bi-MCQ通过重新表述视觉-语言对齐为条件语义比较,提升医学VLM对否定理解的性能。

Comments 15 pages, 4 figures, Submitted to ICPR 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20419 2026-01-29 cs.CV cs.AI 79%

Let's Roll a BiFTA: Bi-refinement for Fine-grained Text-visual Alignment in Vision-Language Models

让我们进行BiFTA:用于视觉语言模型中细粒度文本-视觉对齐的双 refinement

Yuhao Sun, Chengyi Cai, Jiacheng Zhang, Zesheng Ye, Xingliang Yuan, Feng Liu

机构 * School of Computing and Information Systems(计算机与信息系统学院) The University of Melbourne(墨尔本大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 BiFTA通过视图和描述细化方法提升视觉语言模型中细粒度文本-视觉对齐的零样本性能。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19507 2026-01-28 cs.CL 79%

Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs

自动化安全基准测试:一种用于大型视觉语言模型的多代理流程

Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Qi Jia, Chunyi Li, Renrui Zhang, Heng Li, Zongrui Wang, Wei Sun

机构 * Shanghai AI Lab(上海人工智能实验室) PolyU HK(PolyU香港分校) East China Normal University(东华大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 VLSafetyBencher通过多代理流程自动化构建高质量安全基准,有效区分不同模型的安全性,提升LVLMs的安全评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18710 2026-01-26 q-bio.NC cs.AI 79%

Bridging Critical Gaps in Convergent Learning: How Representational Alignment Evolves Across Layers, Training, and Distribution Shifts

弥合收敛学习中的关键差距:表征对齐如何在层、训练和分布偏移中演变

Chaitanya Kapoor, Sudhanshu Srivastava, Meenakshi Khosla

机构 * Department of Cognitive Science University of California, San Diego(认知科学系加州大学圣地亚哥分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 研究通过大规模分析发现,正交变换在对齐表征上效果接近线性方法,且早期层在分布偏移下仍保持紧密对齐,揭示了表征对齐主要由输入统计和架构偏差驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13137 2026-01-23 cs.CL 79%

Adversarial Alignment: Ensuring Value Consistency in Large Language Models for Sensitive Domains

对抗对齐:确保大型语言模型在敏感领域中的价值一致性

Yuan Gao, Zhigang Liu, Xinyu Yao, Bo Chen, Xiaobing Zhao

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) National Language Resource Monitoring and Research Center of Minority Languages(少数民族语言资源监测与研究中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出对抗对齐框架,通过持续预训练、指令微调和对抗训练提升大型语言模型在敏感领域中的价值一致性,实验表明其优于现有主流模型。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏