arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-23 至 2026-03-23 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 16 篇

2602.13757 2026-03-23 cs.CY 88%

Assessing the Case for Africa-Centric AI Safety Evaluations

评估非洲中心的AI安全评估的必要性

Gathoni Ireri, Cecil Abungu, Jean Cheptumo, Sienka Dounia, Mark Gitau, Stephanie Kasaon, Michael Michie, Chinasa T. Okolo, Jonathan Shock

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文探讨了非洲环境中前沿AI系统带来的严重风险,提出了一种分类方法来识别这些风险,并提出了针对非洲情境的威胁建模策略及评估指导。

Comments 41 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03273 2026-03-23 cs.CL cs.AI cs.HC cs.LG 85%

A Multi-Perspective Benchmark and Moderation Model for Evaluating Safety and Adversarial Robustness

一种多视角基准和评估模型用于评估安全性和对抗鲁棒性

Naseem Machlovi, Maryam Saleki, Ruhul Amin, Mohamed Rahouti, Shawqi Al-Maliki, Junaid Qadir, Mohamed M. Abdallah, Ala Al-Fuqaha

机构 * Department of Computer and Information Science, Fordham University(福德汉大学计算机与信息科学系) College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院) Department of Computer Science and Engineering, Qatar University(卡塔尔大学计算机科学与工程系)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GuardEval多视角基准和GGuard模型,通过细粒度标签提升内容审核的准确性和对抗鲁棒性,实验显示GGuard在宏平均F1得分上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19273 2026-03-23 cs.CL cs.AI 84%

LSR: Linguistic Safety Robustness Benchmark for Low-Resource West African Languages

LSR:低资源西非语言的语言安全鲁棒性基准

Godwin Abuh Faruna

机构 * Fagmart Lab(法格马特实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 LSR是首个评估跨语言拒绝退化现象的基准,针对西非语言中的有害意图表达,发现模型拒绝率从英语的90%降至35-55%,其中Igala语言退化最严重。

Comments 6 pages. Reference implementation: https://huggingface.co/spaces/Faruna01/lsr-dashboard. Dataset: https://huggingface.co/datasets/Faruna01/lsr-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19532 2026-03-23 cs.CL cs.IR cs.LG 76%

EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models

EvidenceRL: 为可信语言模型强化证据一致性

J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Pekin University(培根大学)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.LG

AI总结 EvidenceRL通过强化学习框架在训练中强制证据遵循,提升语言模型在医疗诊断和法律推理中的证据接地和可信度,同时保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19615 2026-03-23 cs.SD cs.AI cs.CL 62%

CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation

CAF-Score: 通过LALMs校准CLAP用于无参考音频描述评估

Insung Lee, Taeyoung Jeong, Haejun Yoo, Du-Seong Chang, Myoung-Wan Koo

机构 * Department of Artificial Intelligence, Sogang University, South Korea(人工智能系,ソガン大学,韩国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAF-Score,一种无参考音频描述评估指标,通过结合对比音频-文本嵌入与LALM推理,有效检测语法不一致和细微幻觉,实验表明其在BRACE基准上与人类判断相关性最高。

Comments A condensed version of this work has been submitted to Interspeech 2026. Section 10 is an extended analysis added in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15047 2026-03-23 cs.HC cs.AI cs.CY 62%

Mapping Caregiver Needs to AI Chatbot Design: Strengths and Gaps in Mental Health Support for Alzheimer's and Dementia Caregivers

将照护需求映射到AI聊天机器人设计:阿尔茨海默病和痴呆症照护者的心理健康支持优势与不足

Jiayue Melissa Shi, Dong Whi Yoo, Keran Wang, Violeta J. Rodriguez, Ravi Karkar, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了阿尔茨海默病和痴呆症照护者在心理健康支持中的需求与AI聊天机器人设计的匹配度,通过访谈揭示了照护者在信息获取、情感支持等方面的需求及技术的优劣势。

Journal ref ACM Transactions on Computing for Healthcare, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23571 2026-03-23 cs.RO cs.AI cs.CV cs.LG 62%

RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation

RobotArena ∞:通过现实到模拟的翻译实现可扩展的机器人评估

Yash Jangir, Yidi Zhang, Pang-Chi Lo, Kashu Yamazaki, Chenyu Zhang, Kuan-Hsun Tu, Tsung-Wei Ke, Lei Ke, Yonatan Bisk, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(国立台湾大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RobotArena Infinity框架,通过模拟环境与在线人类反馈,解决机器人政策评估中的劳动密集型、安全性差等问题,实现可扩展的视觉-语言-动作评估。

Comments Website: https://robotarenainf.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08570 2026-03-23 cs.CV cs.AI cs.LG 62%

Superclass-Guided Representation Disentanglement for Spurious Correlation Mitigation

面向虚假相关性缓解的超类引导的表示解耦

Chenruo Liu, Hongjun Liu, Zeyu Lai, Yiqiu Shen, Chen Zhao, Qi Lei

机构 * New York University(纽约大学) NYU Grossman School of Medicine(纽约大学 Grossman 医学院) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用超类引导解耦表示以缓解虚假相关性,通过预训练视觉-语言模型的梯度注意力对齐和理论支持的最小最大最优特征使用策略,提升模型对复杂组结构和虚假相关性的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13207 2026-03-23 cs.CR cs.AI cs.LG 62%

LISAA: A Framework for Large Language Model Information Security Awareness Assessment

LISAA:大型语言模型信息安全意识评估框架

Ofir Cohen, Gil Ari Agmon, Asaf Shabtai, Rami Puzis

机构 * Computer and Information Science Ben-Gurion University of the Negev(计算机与信息科学贝纳尔·戈里翁大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LISAA框架,用于评估大型语言模型的信息安全意识,通过100个真实场景测试其安全知识、态度和行为,揭示当前模型在信息安全方面的普遍漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20192 2026-03-23 cs.CV cs.AI 57%

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

LumosX:通过身份与属性的关系实现个性化视频生成

Jiazheng Xing, Fei Du, Hangjie Yuan, Pengwei Liu, Hongbin Xu, Hai Ci, Ruigang Niu, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 LumosX通过结合身份与属性关系,提升多主体个性化视频生成的精细度和一致性,采用数据与模型双改进策略,构建了全面的基准测试平台。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19668 2026-03-23 cs.CL 57%

Structured Prompting for Arabic Essay Proficiency: A Trait-Centric Evaluation Approach

结构化提示法在阿拉伯语作文能力评估中的应用:以特质为中心的评估方法

Salim Al Mandhari, Hieu Pham Dinh, Mo El-Haj, Paul Rayson

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种新的提示工程框架,用于阿拉伯语特质特定的自动作文评分,利用大语言模型在零样本和少样本配置下进行评估。通过三种层次提示策略,指导模型评估如组织、词汇、发展和风格等语言能力特质。实验表明,结构化提示法在阿拉伯语自动作文评分中效果显著。

Comments 13 pages

Journal ref The Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17417 2026-03-23 cs.CY cs.MA 57%

Is Your LLM-as-a-Recommender Agent Trustable? LLMs' Recommendation is Easily Hacked by Biases (Preferences)

你的 LLM-as-a-Recommender 代理可信吗?LLM 的推荐容易被偏见(偏好)所 hack

Zichen Tang, Zirui Zhang, Qian Wang, Zhenheng Tang, Bo Li, Xiaowen Chu

专题命中 安全评测 :alignment(abstract);分类 cs.CY

AI总结 本文提出 BiasRecBench 评估基准,揭示 LLM-as-a-Recommender 在高价值任务中易受偏见影响的漏洞,通过合成数据和注入上下文偏见,发现即使具备充足推理能力的代理也常受偏见影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19461 2026-03-23 cs.AI 57%

Hyperagents

超智能体

Jenny Zhang, Bingchen Zhao, Wannan Yang, Jakob Foerster, Jeff Clune, Minqi Jiang, Sam Devlin, Tatiana Shavrina

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) University of Edinburgh(爱丁堡大学) New York University(纽约大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席) FAIR at Meta(Meta 的 FAIR 部门) Meta Superintelligence Labs(Meta 超智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出超智能体,通过整合任务智能体和元智能体,实现自我改进。DGM-H在多个领域表现出色,持续改进搜索方法。

Comments Code at https://github.com/facebookresearch/Hyperagents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14052 2026-03-23 cs.CV cs.MA 50%

A Multi-Agent Perception-Action Alliance for Efficient Long Video Reasoning

一种多智能体感知-行动联盟用于高效长视频推理

Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Systems(思科系统)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出A4VL多智能体感知-行动探索联盟,通过多轮感知-行动探索循环提升长视频推理效率,采用事件驱动划分和线索引导块对齐技术,实现高质量推理并降低推理延迟。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13219 2026-03-23 cs.CV 50%

Prompt-based Adaptation in Large-scale Vision Models: A Survey

基于提示的大规模视觉模型适应:综述

Xi Xiao, Yunbei Zhang, Lin Zhao, Yiyang Liu, Xiaoying Liao, Zheda Mai, Xingjian Li, Xiao Wang, Hao Xu, Jihun Hamm, Xue Lin, Min Xu, Qifan Wang, Tianyang Wang, Cheng Han

机构 * University of Alabama at Birmingham, USA(美国阿拉巴马大学伯明翰分校) Tulane University, USA(美国路易斯安那大学) Northeastern University, USA(美国东北大学) University of Missouri-Kansas City, USA(美国密苏里大学堪萨斯城分校) Johns Hopkins University, USA(约翰霍普金斯大学) Ohio State University, USA(俄亥俄州立大学) Carnegie Mellon University, USA(卡内基梅隆大学) Oak Ridge National Laboratory, USA(橡树岭国家实验室) Harvard University, USA(哈佛大学) Mohamed bin Zayed University of Artificial Intelligence, UAE(阿联酋Mohamed bin Zayed人工智能大学) Meta AI, USA(Meta AI)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了基于提示的视觉模型适应方法,探讨了VP和VPT的核心机制及在不同领域的应用,揭示了其在测试时适应和可信AI中的作用,并总结了当前基准和未来研究方向。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19884 2026-03-23 cs.CV 50%

A Survey of AI-Generated Video Evaluation

人工智能生成视频评估综述

Xiao Liu, Xinhao Xiang, Zizhong Li, Yongheng Wang, Zhuoheng Li, Zhuosheng Liu, Weidi Zhang, Weiqi Ye, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校IFM实验室) University of California, Davis(加州大学戴维斯分校)

专题命中 安全评测 :alignment(abstract)

AI总结 本文综述了人工智能生成视频评估领域,探讨了视频内容复杂性和评估方法的系统性分析,强调了建立更稳健的评估框架的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏