arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-20 至 2026-08-20 共收录 23 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 23 篇

2608.18131 2026-08-20 cs.AI cs.CL cs.CY 新提交 89%

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

安全对齐错觉:大语言模型中的跨语言安全差距

Namya Bhatnagar

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 针对 LLMs 安全对齐以英语为中心导致的跨语言偏见问题,提出多语言评估基准 INCLUDE,评估十款 LLMs 后发现孟加拉语在开源模型中偏见最高、英语在开源与闭源模型中偏见表现反转的现象。

Comments 7 pages, 8 figures, submitted to IEEE SLT (Spoken Language Technology) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09471 2026-08-20 cs.CV 版本更新 82%

CKAA: Cross-subspace Knowledge Alignment and Aggregation for Robust Continual Learning

CKAA:用于鲁棒持续学习的跨子空间知识对齐与聚合

Lingfeng He, De Cheng, Zhiheng Ma, Huaijie Wang, Dingwen Zhang, Nannan Wang, Xinbo Gao

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学电信工程学院) School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) SUAT-Faculty of Computational Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术大学SUAT计算微电子学院) Brain and Artificial Intelligence Laboratory, Northwestern Polytechnical University(西北工业大学脑与人工智能实验室)

专题命中 安全评测 :alignment(title,abstract)

AI总结 该研究针对基于PEFT的持续学习方法在误导性任务ID下决策模糊的问题,提出CKAA框架,通过DKA和TC-MoA两项创新提升鲁棒性,实验显示其性能优于同类方法。

Comments Accepted by IEEE Transactions on Image Processing (TIP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18164 2026-08-20 cs.CL cs.AI cs.CR 新提交 81%

Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation

M P V S Gopinadh

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

Comments 3 pages. Accepted at ACL 2026 Workshop on Evaluation in Practice: Methodological Rigor, Sociotechnical Perspectives, & Community Collaboration (EvalEval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16895 2026-08-20 cs.CY physics.soc-ph 版本更新 79%

Orphan risks at the frontier of artificial intelligence: What diverging safety and compliance frameworks reveal about how AI companies choose the risks they prioritize

人工智能前沿的孤儿风险:不同的安全与合规框架揭示了AI公司如何选择其优先处理的风险

Andrew D. Maynard

专题命中 安全评测 :safety(title,abstract);分类 cs.CY

AI总结 本文对比四家前沿AI公司2023-2026年的安全合规文件,识别出其风险选择的四个筛选标准,提出“安全差异”概念,揭示了孤儿风险的成因及轻量应对工具。

Comments 21 pages, 40 references. Also available on SSRN: this https URL (https://dx.doi.org/10.2139/ssrn.7068898)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20468 2026-08-20 cs.CL 版本更新 74%

ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集

Luke Bates, Max Glockner, Preslav Nakov, Iryna Gurevych

专题命中 安全评测 :safety(title);分类 cs.CL

AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。

Comments Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20379 2026-08-20 cs.AI cs.CL 版本更新 73%

Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

训练模型,而非读者:可验证激活解释的可解码性监督

Hiskias Dingeto

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言自动编码器对隐藏激活解释评分的问题,提出RECAP等方法,能使指定内容可解码,提高解释忠实度与安全性,如在预训练模型上实现可靠探测解码,提升对真实声明评分及识别谎言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 67%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04448 2026-08-20 cs.AI cs.CL cs.CV cs.LG cs.MA 版本更新 67%

SkillNet: Create, Evaluate, and Connect AI Skills

SkillNet: 创建、评估和连接AI技能

Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Yida Xue, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen

机构 * Zhejiang University(浙江大学) Tongji University(同济大学) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) Tencent(腾讯) Fudan University(复旦大学) The University of Edinburgh(爱丁堡大学) Monash University(墨尔本大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huzhou University(湖州大学) Hornor Device Co., Ltd(Hornor设备有限公司) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。

Comments this http URL (http://skillnet.openkg.cn/;) add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19073 2026-08-20 cs.AI cs.LG stat.ML 新提交 62%

Robust Risk Under Evolving Uncertainty: A Wasserstein Counterpart of the Entropic Value-at-Risk

演化不确定性下的鲁棒风险:熵值风险(Entropic Value-at-Risk)的Wasserstein对应

Deep Kumar Ganguly, Jan Křetínský

机构 * Technical University of Munich(慕尼黑工业大学) Masaryk University(马萨里克大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对演化不确定性下的鲁棒风险问题,提出Wasserstein熵值风险,弥补熵值风险无法对冲名义模型认定不可能的灾难的缺陷,经数值验证其变分对偶性,并构造出随信念变化的闭式鲁棒动态规划算子。

Comments Best Paper Award at the 2nd Workshop on Safe AI at UAI (SafeAI@UAI 2026, non-archival), Amsterdam

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19029 2026-08-20 cs.AI cs.CL cs.MA 新提交 62%

Adaptive Memory and Reflection Multi-Agent System for Medical Question Answering

面向医学问答的自适应记忆与反思多智能体系统

Pradeep Murugesan, Luoxiao Yang, Xueli Chen, Xinqi Fan

机构 * School of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特城市大学计算与数学学院) Electrical and Computer Engineering, Technion – Israel Institute of Technology(以色列理工学院电气与计算机工程系) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科学与科技学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 针对现有医学问答系统缺乏适应性等问题,提出自适应记忆与反思多智能体框架,经MedQA等数据集验证,结合专用记忆等模块可提升性能,助力开发可信医学智能体。

Comments Accepted by IEEE SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18095 2026-08-20 cs.CL cs.AI 新提交 62%

Backdoor Learning in Language Models and Vision-Language Models

语言模型与视觉-语言模型中的后门学习

Weimin Lyu

机构 * Stony Brook University(石溪大学) The Graduate School(研究生院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本论文针对NLP与VLMs面临的后门攻击安全威胁,研究了后门攻击的分析、检测与设计,并开发了适用于临床医学影像的多模态表示方法,助力可信AI与高效多模态学习。

Comments Ph.D. dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17823 2026-08-20 cs.LG cs.AI cs.HC 版本更新 62%

MotoSafety: Edge-AI with Learned Temporal Importance for Two-Wheeler Collision Risk Assessment Under Time Pressure

MotoSafety:结合学习到的时间重要性的边缘AI,用于时间压力下两轮车碰撞风险评估

Sumit S. Shevtekar, Chandresh K. Maurya, Gourab Sil, Subasish Das

机构 * Indian Institute of Technology Indore(印度理工学院印多尔分校) Texas State University(德克萨斯州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文针对时间压力下两轮车碰撞风险评估问题,提出基于学习到的时间重要性的边缘AI架构MotoSafety,在多数据集验证下性能优于基线模型,适合低成本边缘部署,还具备跨领域迁移能力。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17050 2026-08-20 cs.CL cs.AI 版本更新 62%

Cross-Model Memory Transfer via Target-Side Reader Adaptation

通过目标侧读取器适配实现跨模型记忆迁移

Mingyuan Li, Guangsheng Yu, Xu Wang, Shaoxiong Ji

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大语言模型知识利用的两类方法缺陷,探究Engram式哈希记忆跨模型迁移的关键因素,通过跨模型冻结记忆提取实验,提出双层四分支读取器,实现同模型与跨模型复用差距的缩小,证明Engram可作为可复用外部知识人工制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06422 2026-08-20 cs.CL cs.AI cs.CV 版本更新 62%

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

何时称苹果为红色:人类遵循内省规则,而视觉语言模型却不遵循

Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

机构 * University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了视觉语言模型(VLMs)在何时会表现出意外行为,以及模型是否能可靠预测自身行为,发现VLMs系统性违反内省规则,而人类则遵循规则。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18900 2026-08-20 cs.AI 新提交 57%

\textsc{TestifAI}: Tomography-Based Testing for Deep Learning Systems

TestifAI:基于层析成像的深度学习系统测试方法

Arooj Arif, Tobias Hartung, Elena Botoeva, Alexandros Koliousis

机构 * Northeastern University London(伦敦东北大学) University of Kent(肯特大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 TestifAI是一种深度学习测试框架,通过部分模型层析成像从低阶扰动观测预测高阶扰动测试结果,可高效准确估计多扰动下的模型鲁棒性,减少60-80%的推理量且总误差低于7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18398 2026-08-20 cs.HC cs.AI 新提交 57%

LEDGER: Claim-to-Evidence Trace Graphs for Auditing LLM Agents

LEDGER:用于审计大语言模型智能体的从主张到证据的追踪图

Daehong Kim, Haichao Miao, Shusen Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对LLM智能体输出审计瓶颈,提出LEDGER系统构建分层追踪图,通过分组节点、添加语义边等实现以证据为中心的审计,揭示工作流决策等关键信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18300 2026-08-20 cs.AI 新提交 57%

The Lifecycle of LLM-as-a-Judge for Large-Scale Recommendation Explanations

用于大规模推荐解释的LLM评判模型的生命周期

Emma Yanyang Kong, JJ Tan, Ishan Gupta, Lars Olds, Claire Campbell, David Fagnan, Veli Balin, Rohan Gosain, Louis Garcia, Minsu Jang

机构 * Netflix(网飞公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出用于Netflix大规模推荐解释评估的LLM评判模型生命周期框架,经五周A/B测试证实,其对齐的解释可提升会员对新颖内容的观看及浏览到播放会话量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17574 2026-08-20 cs.AI eess.SY 交叉投稿 57%

Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making

演化不确定性下的风险量化:面向安全序贯决策的信念依赖鲁棒性

Deep Kumar Ganguly, Jan Kretinsky

机构 * Technical University of Munich(慕尼黑工业大学) Masaryk University(马萨里克大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出RATTL算法,将智能体谨慎程度与认知不确定性绑定,证明其规划问题适定且满足安全三明治性质,可保障LLM等智能体在不确定性下的运行时安全。

Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00020 2026-08-20 cs.AR cs.AI 版本更新 57%

Large Language Model for Verilog Code Generation: Literature Review and the Road Ahead

用于Verilog代码生成的大型语言模型:文献综述与未来方向

Guang Yang, Wei Zheng, Xiang Chen, Dong Liang, Peng Hu, Yukui Yang, Shaohang Peng, Zhenghan Li, Jiahui Feng, Xiao Wei, Kexin Sun, Deyuan Ma, Haotian Cheng, Yiheng Shen, Xing Hu, Terry Yue Zhuo, David Lo

机构 * Zhejiang University \& Northwestern Polytechnical University China Northwestern Polytechnical University China Nantong University China Zhejiang University China Monash University Australia Singapore Management University Singapore Zhejiang University \& Northwestern Polytechnical University Northwestern Polytechnical University Nantong University Zhejiang University Monash University Singapore Management University

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文综述了LLMs在Verilog代码生成中的应用,分析了现有方法的有效性、局限性及未来研究方向。

Comments Accept in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13068 2026-08-20 cs.CV cs.LG 版本更新 57%

Eyes on the Image: Gaze Supervised Multimodal Learning for Chest X-ray Diagnosis and Report Generation

聚焦图像:用于胸部X光诊断与报告生成的注视监督多模态学习

Tanjim Islam Riju, Shuchismita Anwar, Saman Sarker Joy, Farig Sadeque, Swakkhar Shatabda

机构 * Department of Computer Science and Engineering, Brac University(计算机科学与工程系,布拉克大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本研究基于MIMIC-Eye数据集构建两阶段多模态框架,引入注视监督提升胸部X光诊断准确率与报告空间可解释性,为该领域提供了可复现的新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18587 2026-08-20 eess.SY 新提交 50%

Toward S^2C^2I-Integrated High-Altitude Platforms: Architectures, Cross-Functional Design, Evaluation, and Deployment Perspectives

面向S^2C^2I集成高空平台:架构、跨职能设计、评估与部署视角

Haoxiang Luo, Mohamed-Slim Alouini

专题命中 安全评测 :trustworthy(abstract)

AI总结 本综述聚焦S^2C^2I集成高空平台,阐述其架构、技术、评估方法与部署,通过应急案例验证其服务优势,指明相关研究机遇,提供从设计到部署的路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18317 2026-08-20 cs.CV cs.RO 新提交 50%

Reproducible Multimodal Affordance Prediction

可复现的多模态可供性预测

Tommaso Apicella, Alessio Xompero, Andrea Cavallaro

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) EPFL(洛桑联邦理工学院)

专题命中 安全评测 :safety(abstract)

AI总结 针对可供性预测方法评估难的问题,本文提出Affordance Sheet以规范任务表述等信息,实现可供性模型的可复现基准测试与现实场景可靠评估。

Comments Paper accepted to Workshop on Human-Centered Multimodal Intelligence in the Wild (HCMIW) in European Conference on Computer Vision (ECCV) 2026; 18 pages, 3 figures, 7 tables. Project webpage at this https URL (https://apicis.github.io/aff-sheet)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18184 2026-08-20 cs.CV 新提交 50%

Human-Centric Intelligence in the Era of Foundation Models: A Survey

基础模型时代的以人为中心的智能:一项综述

Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学) University of Southern Queensland(南昆士兰大学) Tongji University(同济大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Beijing Institute of Technology(北京理工大学) The University of Sydney(悉尼大学) University of Trento(特伦托大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文针对基础模型时代以人为中心的智能进展碎片化问题,提出全谱人类上下文分类法,梳理其方法基础、相关方法与资源,探讨挑战方向,为该领域推进提供参考。

Comments GitHub Repo: this https URL (https://github.com/cseeyangchen/Human-Centric-AI;) Project Page: this https URL (https://cseeyangchen.github.io/Human-Centric-AI/homepage/)

详情

展开后加载摘要…

URL PDF HTML 收藏