The Necessity of a Holistic Safety Evaluation Framework for AI-Based Automation Features
人工智能驱动自动化功能的综合安全评估框架的必要性
专题命中 安全评测 :safety(title,abstract);AI safety(abstract)
AI总结 本文探讨了在人工智能整合下,需对AI组件进行综合安全分析和风险评估,以识别和缓解潜在风险,特别是在安全关键驾驶系统中。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
人工智能驱动自动化功能的综合安全评估框架的必要性
专题命中 安全评测 :safety(title,abstract);AI safety(abstract)
AI总结 本文探讨了在人工智能整合下,需对AI组件进行综合安全分析和风险评估,以识别和缓解潜在风险,特别是在安全关键驾驶系统中。
M-MiniGPT4:通过翻译数据实现多语言VLLM对齐
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; KAUST(阿卜杜拉国王科技大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出M-MiniGPT4多语言视觉大语言模型,通过混合原生多语言和翻译数据提升MiniGPT4的多语言视觉理解能力,并引入多语言对齐训练阶段,使模型在多语言MMMU基准测试中达到36%的准确率。
Comments 6 pages, ACL 2026, Proceedings of the 7th Workshop on African Natural Language Processing (AfricaNLP 2026)
AGFT:基于对齐的微调以提升视觉-语言模型的零样本对抗鲁棒性
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Shenzhen Loop Area Institute, Shenzhen, China(深圳市环域研究所)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出AGFT框架,通过概率预测进行文本引导对抗训练,提升视觉-语言模型的零样本对抗鲁棒性,同时保持跨模态语义结构。
Comments Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}
在临床规模上完善人机交互。将生产信号转化为更安全、更人性化的对话
机构 * Hippocratic AI
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种基于真实患者与AI交互数据的框架,通过分析实时信号提升医疗AI的安全性和可靠性,减少ASR错误,提高患者体验。
通过结构化形式中介学习生成可形式验证的逐步逻辑推理
机构 * Wangxuan Institue of Computer Technology, Peking University(北京大学王选计算机技术研究所)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文提出PRoSFI方法,通过形式验证提升推理可靠性,利用结构化中间步骤和形式证明验证生成可信的逐步推理过程。
Comments 19 pages
结构意图作为协议式通信层:跨模型鲁棒性、框架比较及弱模型补偿效应
机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉特尼人工智能科技有限公司) ; Huizhou University(惠州大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文研究结构意图在不同AI模型、语言和提示框架下的鲁棒性,比较不同框架效果,并发现弱模型补偿效应,证明结构意图在人机交互中的实用价值。
Comments 25 pages, figures, tables, and appendix. Third paper in a cumulative research series on PPS and 5W3H structured intent representation, extending prior work to cross-model robustness, framework comparison, and user-study validation
CausalPulse:一种工业级神经符号多智能体协作者,用于智能制造中的因果诊断
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 CausalPulse通过神经符号架构整合异常检测、因果发现和推理,实现智能制造中的因果诊断,展现高可靠性和可扩展性。
Comments 10 pages, 8 figures, 4 tables, Accepted at AAAI-MAKE 2026 (AAAI Spring Symposium on Machine Learning and Knowledge Engineering for Knowledge-Grounded Semantic Agents)
定位风险:任务设计者与RAI内容工作中的风险披露挑战
专题命中 安全评测 :red teaming(abstract);分类 cs.CY
AI总结 研究探讨任务设计者在RAI内容工作中如何披露风险,通过23份访谈揭示风险识别与沟通的实践,强调支持任务设计者提升工人福祉与AI伦理的技术有效性。
LLM Probe:评估低资源语言的大型语言模型
机构 * L3S Research Center, Leibniz University Hannover(莱布尼茨汉诺威大学L3S研究中心) ; Aksum University(阿克苏姆大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出LLM Probe框架,通过词典基础方法系统评估低资源语言中LLM的语言能力,揭示序列到序列模型在形态语法分析和翻译质量上的优势,以及因果模型在词汇对齐上的表现。
Comments 11 pages, 6 tables
CounselReflect:用于审计心理健康对话的工具包
机构 * University of Southern California(南加州大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 本文提出CounselReflect工具包,通过多维报告和证据链接片段,提供透明的心理健康对话审计方法,结合模型评估指标和文献库指标,支持可理解、可操作和可信的审计。
情绪归因的双重视角:一种用于LLM中跨文化情绪分析的生成-解释框架
机构 * KAIST(韩国科学技术院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出生成-解释框架,从表达与解读双重视角分析情绪归因,评估六种LLM在15国数据上的表现,揭示文化背景对情绪类型和模型性能的影响,呼吁在LLM中实现文化敏感的情绪建模。
第三方网络安全风险评估的语义标注:一种半监督的意图感知问题检索方法
机构 * SAMOVAR, Telecom SudParis, Institut Polytechnique de Paris(SAMOVAR, 南巴黎电信学院, 巴黎综合理工学院) ; Board of Cyber
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出一种半监督方法,通过语义标签空间提升第三方网络安全风险评估中意图感知的问题检索效率,减少标注成本并提高一致性。
具有意义的标记:一种针对土耳其语的混合标记方法
机构 * Yıldız Technical University(伊尔迪兹技术大学) ; Yeditepe University(耶迪特佩大学) ; University of Chicago(芝加哥大学) ; Istanbul Bilgi University(伊斯坦布尔比尔基大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出了一种结合词典驱动形态分割、音学规范化和受控子词回退的土耳其语混合标记器,通过TR-MMLU数据集评估,其在形态和词汇单元匹配度上优于现有方法。
在3D几何计算机视觉中评估博士级别的编程能力
机构 * AIR, Tsinghua University(清华大学智能产业研究院) ; Qiuzhen College, Tsinghua University(清华大学求真书院) ; BAAI(北京智源人工智能研究院) ; Peking University(北京大学) ; Nanjing University(南京大学) ; University of Toronto(多伦多大学)
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出GeoCodeBench基准,用于评估3D视觉编程能力。通过精选论文中的任务,生成多样化的测试用例,评估八种模型的性能,揭示当前模型在可靠3D科学编程方面的差距。
Comments Accepted by CVPR 2026; Project page: https://geocodebench.github.io/
SVBench:视频生成模型在社会推理中的评估
机构 * Tsinghua University(清华大学) ; Shanda AI Research Tokyo(盛大人工智能研究院东京) ; Shanghai AI Lab(上海人工智能实验室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peking University(北京大学)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。
Comments 10pages
看见即应言:面向灾害缓解的上下文感知移动机器人通信
机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) ; The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) ; ASAS LABS, Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系ASAS实验室)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出一种上下文感知的移动机器人通信框架,通过感知驱动自适应消息生成,提升灾害响应速度和有效性,在60多次实验中验证了结构化关键性评估对响应速度和缓解效果的提升。
面向自动驾驶的语义观察层:VLMs在低延迟异常检测中的预部署可行性研究
机构 * The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) ; Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系) ; Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院电气与计算机工程系)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出一种语义观察层,通过量化视觉-语言模型实现低延迟异常检测,验证了其在自动驾驶平台上的可行性。
ALADIN:基于属性-语言的知识蒸馏网络用于人重识别
机构 * Wuhan University(武汉大学)
专题命中 安全评测 :alignment(abstract)
AI总结 ALADIN通过属性-语言知识蒸馏网络,提升人重识别中细粒度属性特征的捕捉能力,增强鲁棒性与泛化性。
Comments 14pages, 3figures, 7charts
通过半监督率减少实现多模态表示学习的通用类别发现
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。
Comments 15 pages, accepted by CVPR 2026
JoyStreamer: 通过和谐的文本-音频条件化解锁高度表达性的化身
机构 * JD Technology(京东科技)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出JoyAvatar框架,通过双教师增强训练算法和动态调节多模态条件,提升视频化身生成的自然性和时序一致性,优于现有模型并在多人群对话等复杂应用中表现突出。