Assessing the Case for Africa-Centric AI Safety Evaluations
评估非洲中心的AI安全评估的必要性
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文探讨了非洲环境中前沿AI系统带来的严重风险,提出了一种分类方法来识别这些风险,并提出了针对非洲情境的威胁建模策略及评估指导。
Comments 41 pages, 1 figure
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
评估非洲中心的AI安全评估的必要性
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文探讨了非洲环境中前沿AI系统带来的严重风险,提出了一种分类方法来识别这些风险,并提出了针对非洲情境的威胁建模策略及评估指导。
Comments 41 pages, 1 figure
一种多视角基准和评估模型用于评估安全性和对抗鲁棒性
机构 * Department of Computer and Information Science, Fordham University(福德汉大学计算机与信息科学系) ; College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院) ; Department of Computer Science and Engineering, Qatar University(卡塔尔大学计算机科学与工程系)
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出GuardEval多视角基准和GGuard模型,通过细粒度标签提升内容审核的准确性和对抗鲁棒性,实验显示GGuard在宏平均F1得分上优于现有模型。
LSR:低资源西非语言的语言安全鲁棒性基准
机构 * Fagmart Lab(法格马特实验室)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 LSR是首个评估跨语言拒绝退化现象的基准,针对西非语言中的有害意图表达,发现模型拒绝率从英语的90%降至35-55%,其中Igala语言退化最严重。
Comments 6 pages. Reference implementation: https://huggingface.co/spaces/Faruna01/lsr-dashboard. Dataset: https://huggingface.co/datasets/Faruna01/lsr-benchmark
EvidenceRL: 为可信语言模型强化证据一致性
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Pekin University(培根大学)
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.LG
AI总结 EvidenceRL通过强化学习框架在训练中强制证据遵循,提升语言模型在医疗诊断和法律推理中的证据接地和可信度,同时保持任务准确性。
CAF-Score: 通过LALMs校准CLAP用于无参考音频描述评估
机构 * Department of Artificial Intelligence, Sogang University, South Korea(人工智能系,ソガン大学,韩国)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CAF-Score,一种无参考音频描述评估指标,通过结合对比音频-文本嵌入与LALM推理,有效检测语法不一致和细微幻觉,实验表明其在BRACE基准上与人类判断相关性最高。
Comments A condensed version of this work has been submitted to Interspeech 2026. Section 10 is an extended analysis added in this version
将照护需求映射到AI聊天机器人设计:阿尔茨海默病和痴呆症照护者的心理健康支持优势与不足
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) ; University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY
AI总结 研究探讨了阿尔茨海默病和痴呆症照护者在心理健康支持中的需求与AI聊天机器人设计的匹配度,通过访谈揭示了照护者在信息获取、情感支持等方面的需求及技术的优劣势。
Journal ref ACM Transactions on Computing for Healthcare, 2026
RobotArena ∞:通过现实到模拟的翻译实现可扩展的机器人评估
机构 * Carnegie Mellon University(卡内基梅隆大学) ; National Taiwan University(国立台湾大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RobotArena Infinity框架,通过模拟环境与在线人类反馈,解决机器人政策评估中的劳动密集型、安全性差等问题,实现可扩展的视觉-语言-动作评估。
Comments Website: https://robotarenainf.github.io
面向虚假相关性缓解的超类引导的表示解耦
机构 * New York University(纽约大学) ; NYU Grossman School of Medicine(纽约大学 Grossman 医学院) ; Zhejiang University(浙江大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出利用超类引导解耦表示以缓解虚假相关性,通过预训练视觉-语言模型的梯度注意力对齐和理论支持的最小最大最优特征使用策略,提升模型对复杂组结构和虚假相关性的鲁棒性。
LISAA:大型语言模型信息安全意识评估框架
机构 * Computer and Information Science Ben-Gurion University of the Negev(计算机与信息科学贝纳尔·戈里翁大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LISAA框架,用于评估大型语言模型的信息安全意识,通过100个真实场景测试其安全知识、态度和行为,揭示当前模型在信息安全方面的普遍漏洞。
LumosX:通过身份与属性的关系实现个性化视频生成
机构 * Zhejiang University(浙江大学) ; DAMO Academy, Alibaba Group(阿里云达摩院) ; Hupan Lab(虎斑实验室) ; National University of Singapore(新加坡国立大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 LumosX通过结合身份与属性关系,提升多主体个性化视频生成的精细度和一致性,采用数据与模型双改进策略,构建了全面的基准测试平台。
Comments ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/
结构化提示法在阿拉伯语作文能力评估中的应用:以特质为中心的评估方法
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出了一种新的提示工程框架,用于阿拉伯语特质特定的自动作文评分,利用大语言模型在零样本和少样本配置下进行评估。通过三种层次提示策略,指导模型评估如组织、词汇、发展和风格等语言能力特质。实验表明,结构化提示法在阿拉伯语自动作文评分中效果显著。
Comments 13 pages
Journal ref The Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026
你的 LLM-as-a-Recommender 代理可信吗?LLM 的推荐容易被偏见(偏好)所 hack
专题命中 安全评测 :alignment(abstract);分类 cs.CY
AI总结 本文提出 BiasRecBench 评估基准,揭示 LLM-as-a-Recommender 在高价值任务中易受偏见影响的漏洞,通过合成数据和注入上下文偏见,发现即使具备充足推理能力的代理也常受偏见影响。
超智能体
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; University of Edinburgh(爱丁堡大学) ; New York University(纽约大学) ; Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席) ; FAIR at Meta(Meta 的 FAIR 部门) ; Meta Superintelligence Labs(Meta 超智能实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出超智能体,通过整合任务智能体和元智能体,实现自我改进。DGM-H在多个领域表现出色,持续改进搜索方法。
Comments Code at https://github.com/facebookresearch/Hyperagents
一种多智能体感知-行动联盟用于高效长视频推理
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Cisco Systems(思科系统)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出A4VL多智能体感知-行动探索联盟,通过多轮感知-行动探索循环提升长视频推理效率,采用事件驱动划分和线索引导块对齐技术,实现高质量推理并降低推理延迟。
Comments Accepted by CVPR2026
基于提示的大规模视觉模型适应:综述
机构 * University of Alabama at Birmingham, USA(美国阿拉巴马大学伯明翰分校) ; Tulane University, USA(美国路易斯安那大学) ; Northeastern University, USA(美国东北大学) ; University of Missouri-Kansas City, USA(美国密苏里大学堪萨斯城分校) ; Johns Hopkins University, USA(约翰霍普金斯大学) ; Ohio State University, USA(俄亥俄州立大学) ; Carnegie Mellon University, USA(卡内基梅隆大学) ; Oak Ridge National Laboratory, USA(橡树岭国家实验室) ; Harvard University, USA(哈佛大学) ; Mohamed bin Zayed University of Artificial Intelligence, UAE(阿联酋Mohamed bin Zayed人工智能大学) ; Meta AI, USA(Meta AI)
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文综述了基于提示的视觉模型适应方法,探讨了VP和VPT的核心机制及在不同领域的应用,揭示了其在测试时适应和可信AI中的作用,并总结了当前基准和未来研究方向。
Comments Accepted by TMLR 2026
人工智能生成视频评估综述
机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校IFM实验室) ; University of California, Davis(加州大学戴维斯分校)
专题命中 安全评测 :alignment(abstract)
AI总结 本文综述了人工智能生成视频评估领域,探讨了视频内容复杂性和评估方法的系统性分析,强调了建立更稳健的评估框架的重要性。