arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 49 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 49 篇

2602.16931 2026-03-17 cs.AI 88%

Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents

细粒度微调会削弱视觉语言代理的安全对齐

Idhant Gulati, Shivam Raval

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。

Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06594 2026-03-17 cs.CL cs.AI 84%

A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness

安全性的硬币翻转:LLM裁判无法可靠地衡量对抗鲁棒性

Leo Schwinn, Moritz Ladenburger, Tim Beyer, Mehrnaz Mofakhami, Gauthier Gidel, Stephan Günnemann

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文指出现有LLM裁判框架在评估对抗鲁棒性时存在分布偏移问题,提出ReliableBench和JudgeStressTest以提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI 84%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16643 2026-03-17 cs.CV cs.AI 83%

From Evaluation to Defense: Advancing Safety in Video Large Language Models

从评估到防御:推进视频大语言模型的安全性

Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出VideoSafety-R1框架,通过创新方法提升视频大语言模型的安全性,实验显示其在多个安全数据集上取得显著提升。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08009 2026-03-17 cs.CY cs.AI 81%

The Law-Following AI Framework: Legal Foundations and Technical Constraints. Legal Analogues for AI Actorship and technical feasibility of Law Alignment

遵循法律的AI框架:法律基础与技术限制。AI行为者的法律类比和技术可行性

Katalina Hernandez Delgado

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文评估了O'Keefe等人提出的

Comments Presented at SMU Computational Legal Studies Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13558 2026-03-17 stat.ML cs.CL cs.IT cs.LG math.IT 81%

Holographic Invariant Storage: Design-Time Safety Contracts via Vector Symbolic Architectures

全息不变存储:通过向量符号架构实现设计时的安全合同

Arsenios Scrivens

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出全息不变存储协议,通过整合双极向量符号架构的特性,为LLM上下文漂移缓解提供设计时的安全合同,提供三种可预估的保障,提升系统工程师在设计阶段的恢复保真度和代码本容量预算能力。

Comments 25 pages, 7 figures, includes appendices with extended proofs and pilot LLM experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13305 2026-03-17 cs.LG cs.AI 81%

Evidence-based Distributional Alignment for Large Language Models

基于证据的分布对齐用于大语言模型

Viet-Thanh Pham, Lizhen Qu, Zhuang Li, Gholamreza Haffari

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Evi-DA方法,通过检索世界价值观调查数据预测国家条件下的答案分布,提升大语言模型在领域和文化变化下的分布估计精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13286 2026-03-17 cs.CY cs.AI 81%

How Meta-research Can Pave the Road Towards Trustworthy AI In Healthcare: Catalogue of Ideas and Roadmap for Future Research

元研究如何推动可信AI在医疗领域的发展:想法目录与未来研究路线图

Valerie Bürger, Marlie Besouw, Jana Fehr, Riana Minocher, Emma Moorhead, Isabel Velarde, Louis Agha-Mir-Salim, Julia Amann, Alexandra Bannach-Brown, David B. Blumenthal, Kaitlyn Hair, Bert Heinrichs, Moritz Herrmann, Elizabeth Hofvenschiöld, Sune Holm, Anne A. H. de Hond, Sara Kijewski, Stuart McLennan, Timo Minssen, Marco S. Nobile, Nico Pfeifer, Jessica L. Rohmann, Tony Ross-Hellauer, Marija Slavkovik, Karin Tafur, Eleonora Viganò, Magnus Westerlund, Tracey Weissgerber, Vince I. Madai

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过跨学科研讨会探讨AI伦理原则在医疗领域实践中的挑战,提出元研究对提升AI鲁棒性、可重复性及透明度等关键问题的贡献,并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 79%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13247 2026-03-17 cs.AI cs.CR 79%

ILION: Deterministic Pre-Execution Safety Gates for Agentic AI Systems

ILION:用于代理AI系统的确定性预执行安全闸门

Florin Adrian Chitan

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ILION通过五层架构实现代理AI系统的安全控制,无需训练数据和API依赖,达到高精度和低延迟的判定效果。

Comments 16 pages, 7 tables, 7 figures. Benchmark and code available at https://github.com/Athonitul/ilion-framework-simulator. Patent application A/00052, OSIM Romania

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17646 2026-03-17 cs.LG 70%

Unveiling the Basin-Like Loss Landscape in Large Language Models

揭示大语言模型中的盆地状损失景观

Huanran Chen, Yinpeng Dong, Zeming Wei, Yao Huang, Yichi Zhang, Hang Su, Jun Zhu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 研究发现大语言模型的损失景观中出现盆地结构,随着模型规模增大,模型对参数空间扰动的鲁棒性增强,但最坏方向的损失景观尖锐且有害,对抗性微调会快速降低模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13257 2026-03-17 cs.AI 70%

Distilling Deep Reinforcement Learning into Interpretable Fuzzy Rules: An Explainable AI Framework

将深度强化学习转化为可解释的模糊规则:一个可解释人工智能框架

Sanup S. Araballi, Simon Khan, Chilukuri K. Mohan

机构 * Dept. of EECS, Syracuse University, NY 13244, USA(电子工程与计算机科学系, Syracuse大学,纽约州,13244,美国) Air Force Research Laboratory, Rome, NY 13441, USA(空军研究实验室,罗马,纽约州,13441,美国)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种分层Takagi-Sugeno-Kang模糊分类器系统,通过K-means聚类和岭回归将神经策略转化为可读的IF-THEN规则,并引入三个量化指标评估解释性。

Comments Accepted to AAAI 2026 Spring Symposium Series

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07427 2026-03-17 cs.AI cs.CR 70%

AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation

AutoControl Arena:为前沿AI风险评估合成可执行测试环境

Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出AutoControl Arena框架,通过逻辑-叙述解耦原理,结合可执行代码与LLM生成动态,有效缓解逻辑幻觉并提升灵活性,验证了在压力下AI风险显著增加,揭示了不同模型在安全性和对齐性上的差异。

Comments Project page: https://cosmosyi.github.io/AutoControl-Arena/; Code: https://github.com/CosmosYi/AutoControl-Arena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15408 2026-03-17 cs.CR cs.AI cs.CL cs.LG cs.MA 67%

TrinityGuard: A Unified Framework for Safeguarding Multi-Agent Systems

TrinityGuard:多智能体系统的统一防护框架

Kai Wang, Biaojie Zeng, Zeming Wei, Chang Jin, Hefeng Zhou, Xiangtian Li, Chao Yang, Jingjing Qu, Xingcheng Xu, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TrinityGuard框架,用于评估和监控基于大语言模型的多智能体系统安全风险,通过三级风险分类识别20种风险类型,结合测试模块和运行时监控实现预开发评估与运行时监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15044 2026-03-17 cs.AI cs.CY cs.LG 67%

Prompt Readiness Levels (PRL): a maturity scale and scoring framework for production grade prompt assets

提示准备等级(PRL):一种用于生产级提示资产的成熟度量表和评分框架

Sebastien Guinard

机构 * Univ. Grenoble Alpes(格勒诺布尔大学) CEA(法国原子能委员会) DRT(法国国家科研机构)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出PRL和PRS,通过九级成熟度量表和多维评分方法,为提示资产的规范、测试、可追溯性、安全评估和部署准备性提供结构化框架,实现跨团队和行业的可重复评估。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15615 2026-03-17 cs.CL cs.AI 62%

Mechanistic Origin of Moral Indifference in Language Models

语言模型中道德冷漠的机制起源

Lingyu Li, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示语言模型存在内在道德冷漠,通过构建道德向量并重构其拓扑关系,提升道德推理能力,实现75%的对抗性基准测试胜率。

Comments 24 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15221 2026-03-17 cs.LG cs.AI 62%

ADV-0: Closed-Loop Min-Max Adversarial Training for Long-Tail Robustness in Autonomous Driving

ADV-0:面向自动驾驶的闭环极小-极大对抗训练以提升长尾鲁棒性

Tong Nie, Yihong Tang, Junlin He, Yuewen Mei, Jie Sun, Lijun Sun, Wei Ma, Jian Sun

机构 * The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) Tongji University, Shanghai, China(同济大学) McGill University, Montreal, QC, Canada(麦吉尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ADV-0框架,通过闭环极小-极大优化,将驾驶策略与对抗 agent 的交互视为零和马尔可夫博弈,提升自动驾驶对长尾场景的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14947 2026-03-17 cs.LG cs.AI 62%

FairMed-XGB: A Bayesian-Optimised Multi-Metric Framework with Explainability for Demographic Equity in Critical Healthcare Data

FairMed-XGB: 一种具有可解释性的多指标框架,用于关键医疗数据中的公平性

Mitul Goswami, Romit Chatterjee, Arif Ahmed Sekh

机构 * School of Computer Engineering, Kalinga Institute of Industrial Technology(计算机工程学院,卡林加工业技术学院) Bio-AI Lab, UiT The Arctic University of Norway(生物-人工智能实验室,北欧大学(UiT))

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FairMed-XGB框架,通过整合统计平衡差、Theil指数和Wasserstein距离的公平性感知损失函数,结合贝叶斯搜索优化XGBoost分类器,有效减少性别偏差并保持模型性能和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06955 2026-03-17 cs.CL cs.AI 62%

BIS Reasoning 1.0: The First Large-Scale Japanese Benchmark for Belief-Inconsistent Syllogistic Reasoning

BIS推理1.0:首个大规模日语信念不一致三段论基准数据集

Ha-Thanh Nguyen, Hideyuki Tachibana, Chaoran Liu, Qianying Liu, Su Myat Noe, Koichi Takeda, Sadao Kurohashi

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BIS推理1.0,首个针对大语言模型信念不一致推理评估的日语三段论数据集,通过系统引入逻辑有效但信念不一致的三段论,揭示信念偏差问题,并评估多种模型在零样本下的表现。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14586 2026-03-17 cs.HC cs.AI cs.CY 62%

The Scenic Route to Deception: Dark Patterns and Explainability Pitfalls in Conversational Navigation

通往欺骗的风景路线:对话导航中的暗模式与可解释性陷阱

Ilya Ilyankou, Stefano Cavazzi, James Haworth

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了生成式AI在行人导航中的应用,揭示了对话接口可能带来的操纵风险,并提出神经符号架构作为提升可信任度的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14170 2026-03-17 cs.IR cs.AI cs.CL 62%

Citation-Enforced RAG for Fiscal Document Intelligence: Cited, Explainable Knowledge Retrieval in Tax Compliance

引用强化的财政文档智能:在税务合规中的引用、可解释知识检索

Akhil Chandra Shanivendra

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种引用强化的RAG框架,用于财政文档智能,强调可解释性和可审计性,通过源优先的摄入策略和引用强制机制提升税务合规中的引用准确性与解释性。

Comments 22 pages, 3 figures. Applied AI systems paper focused on citation-enforced RAG and abstention for fiscal document intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08309 2026-03-17 cs.CV cs.AI cs.LG 62%

Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness

基于概念引导的微调:引导ViT远离虚假相关性以提高鲁棒性

Yehonatan Elisha, Oren Barkan, Noam Koenigstein

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种引导模型推理至概念层面语义的微调框架,通过优化内部相关性映射对齐空间 grounded 的概念掩码,提升模型在分布偏移下的鲁棒性。

Comments CVPR 2026 ; Project page: https://yonisgit.github.io/concept-ft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00823 2026-03-17 cs.CL cs.AI 62%

A Comprehensive Evaluation of LLM Unlearning Robustness under Multi-Turn Interaction

大语言模型多轮交互下LLM去学习鲁棒性综合评估

Ruihao Pan, Suhang Wang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究多轮交互环境下LLM去学习的稳定性,发现静态评估可能高估实际效果,强调需确保交互场景下的稳定遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13691 2026-03-17 cs.CL cs.AI 62%

QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models

QuarkMedBench: 一个基于现实场景的基准测试,用于评估大型语言模型

Yao Wu, Kangping Yin, Liang Dong, Zhenxin Ma, Shuting Xu, Xuehai Wang, Yuxuan Jiang, Tingting Yu, Yunqing Hong, Jiayi Liu, Rianzhe Huang, Shuxin Zhao, Haiping Hu, Wen Shang, Jian Xu, Guanjun Jiang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 QuarkMedBench通过构建大规模医疗数据集和自动评分框架,评估LLM在真实医疗查询中的表现,揭示传统考试指标的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13563 2026-03-17 cs.LG cs.AI 62%

MR-GNF: Multi-Resolution Graph Neural Forecasting on Ellipsoidal Meshes for Efficient Regional Weather Prediction

MR-GNF:基于椭球网格的多分辨率图神经预测用于高效区域天气预测

Andrii Shchur, Inna Skarga-Bandurova

机构 * Kyiv School of Economics(基輔經濟學院) Oxford Brookes University(氧化橋學院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 MR-GNF通过多尺度图神经网络实现高效区域天气预测,利用椭球网格结构在1.6M参数内捕捉三维结构,提供稳定6至24小时预报,成本低于传统数值天气预报。

Comments Accepted to the AAAI2026 workshop on AI for Environmental Science (AAAI2026 AI4ES). Discussion version available on OpenReview. Code available at https://github.com/AndriiShchur/MR-GNF

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03231 2026-03-17 cs.NI cs.AI cs.LG 62%

NetArena: Dynamic Benchmarks for AI Agents in Network Automation

NetArena:网络自动化中AI代理的动态基准测试

Yajie Zhou, Jiajun Ruan, Eric S. Wang, Sadjad Fouladi, Francis Y. Yan, Kevin Hsieh, Zaoxing Liu

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 NetArena通过动态生成基准测试框架提升网络自动化中AI代理的可靠性,减少置信区间重叠,揭示更细致的行为特征,并支持SFT和RL微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13880 2026-03-17 cs.NE cs.AR cs.LG cs.RO 61%

Benchmarking the Energy Cost of Assurance in Neuromorphic Edge Robotics

在神经形态边缘机器人中评估保证的能量成本

Sylvester Kaczmarek

专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.LG

AI总结 本文研究了在边缘机器人中部署可信人工智能的高保证鲁棒性和能源可持续性之间的权衡,通过对比传统防御机制与事件驱动的神经形态架构,展示了后者在降低攻击成功率的同时保持低能耗的优势。

Comments 6 pages, 4 figures. Accepted and presented at the STEAR 2026 Workshop on Sustainable and Trustworthy Edge AI for Robotics, HiPEAC 2026, Krakow, Poland

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13325 2026-03-17 cs.MA cs.AI 61%

Auditing Cascading Risks in Multi-Agent Systems via Semantic-Geometric Co-evolution

通过语义-几何共演化审计多智能体系统中的级联风险

Zixun Luo, Yuhang Fan, Hengyu Lin, Yufei Li, Youzhi Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Lingnan University(岭大大学) Tsinghua University(清华大学) Centre for Artificial Intelligence and Robotics(人工智能与机器人中心) Hong Kong Institute of Science and Innovation(香港创新科技研究院) Chinese Academy of Sciences(中国科学院)

专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.AI

AI总结 本文提出基于语义-几何共演化的框架,通过动态图模型和Ollivier-Ricci曲率检测多智能体系统中的级联风险,提前预警并定位根本原因。

Comments This work has been accepted to ICLR 2026 Workshop: Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15457 2026-03-17 cs.CR cs.AI 57%

Evasive Intelligence: Lessons from Malware Analysis for Evaluating AI Agents

逃避式智能:从恶意软件分析中汲取的AI评估教训

Simone Aonzo, Merve Sahin, Aurélien Francillon, Daniele Perito

机构 * Eurecom SAP Labs(SAP实验室) Depthfirst

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文探讨了AI代理评估中因适应性行为导致的安全性误判问题,借鉴恶意软件沙盒逃避的研究,提出评估原则以应对潜在的对抗性环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15020 2026-03-17 cs.CV cs.CL 57%

MER-Bench: A Comprehensive Benchmark for Multimodal Meme Reappraisal

MER-Bench:多模态表情包再解释的综合基准

Yiqi Nie, Fei Wang, Junjie Chen, Kun Li, Yudi Cai, Dan Guo, Chenglong Li, Meng Wang

机构 * School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) College of Information Technology, United Arab Emirates University(阿拉伯联合酋长国大学信息学院) Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出MER-Bench,一个用于多模态表情包再解释的综合基准,通过多模态大语言模型评估结构保持、语义一致性和情感转换,揭示现有系统在约束满足上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏