arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2678 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 964 篇

2608.04830 2026-08-06 cs.AI 新提交 57%

ContextWeave: A Real-World Workflow Benchmark

ContextWeave:一个真实世界工作流基准测试

Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究推出ContextWeave工作流基准测试,通过实验发现可操作的经验记忆能提升智能体工作流性能,为优化记忆系统提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04613 2026-08-06 cs.LG 新提交 57%

Why Ranking Anomaly Detection Algorithms Isn't as Reliable as You May Think

为何异常检测算法的排名并不如你所想的可靠

Simon Klüttermann, Jérôme Rutinowski, Frederik Polachowski, Alice Kirchheim

机构 * Carnegie Mellon University(卡内基梅隆大学) TU Dortmund University(多特蒙德工业大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) iits Consulting GmbH(iits咨询有限公司) Fraunhofer Institute for Material Flow and Logistics IML(弗劳恩霍夫物流与材料流动研究所IML)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究通过分析7种算法在690个数据集上的表现,发现异常检测算法排名高度不稳定,数据集选择和超参数选择是主要影响因素,可靠基准测试需更大更多样的数据集。

Comments Accepted at the 2026 ICPR Workshop on Workshop on Reproducible Research in Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04574 2026-08-06 cs.CL 新提交 57%

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

当记忆“说谎”:VLM智能体中空间记忆过时的实证研究

Yushi Sun, Yanjie Zhang

机构 * Tencent LIGHTSPEED(腾讯光速工作室)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究通过动态FrozenLake测试平台,探究了VLM智能体的空间记忆过时问题,发现文本可解性不代表视觉接地、信任过时记忆存在安全隐患、审核无法完全消除差距,明确了相关核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04509 2026-08-06 cs.AI 新提交 57%

CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models

CARGO-VL:面向视觉-语言模型的风险约束组优化反事实仲裁方法

De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究提出CARGO-VL框架,结合XMC资源,通过组相对优化及原对偶控制器,提升视觉-语言模型的反事实仲裁性能,在多基准上优于逐点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04505 2026-08-06 cs.CL 新提交 57%

K-EXAONE 2.0 Technical Report

K-EXAONE 2.0 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Minhyeok Jung, Doyoung Kim, Heegyu Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Byungoh Ko, Changhun Lee, Dohaeng Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Minwoo Lee, Wonkee Lee, Sangha Park, Sungjune Park, Kwangrok Ryoo, Kijung Seo, Minju Seo, Yongwoo Song, Sejong Yang, Heuiyeen Yeen, Stanley Jungkyu Choi, Yemuk Choi, Yongchan Chun, Jiwon Ham, Dasol Hong, Sujeong Im, Kijeong Jeon, Gerrard Jeongwon Jo, Hyeongjun Jo, Yujin Jo, Jiyeon Jung, Naeun Kang, Daeseong Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, Chaeeun Lee, ChaeYoon Lee, Edward Hwayoung Lee, Honglak Lee, Hwansoo Lee, Minkyung Lee, Sangeun Lee, Solji Lim, Woohyung Lim, Chanwoo Moon, Jueun Mun, Jimin Park, Seojeong Park, Yongmin Park, Hyerin Seo, Donghyeon Shin, Donghyun Son, Eunyong Son, Kaehyun Um, Sihoon Yang, Chang En Yea, Sihyuk Yi, Kyungjae Yoo, Chansik Yoon

机构 * LG AI Research(LG AI研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该报告介绍LG AI Research开发的K-EXAONE 2.0,这是一款7500亿参数的MoE多语言基础模型,经升级前代模型而来,支持25.6万token上下文,在多类评估中表现优异,以Apache 2.0许可发布,助力AI生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04215 2026-08-06 cs.SE cs.AI 新提交 57%

A Unified Model for Cross-Domain Clone Detection via Model Merging

基于模型合并的跨域代码克隆检测统一模型

Palash R. Roy, Banani Roy, Kevin A. Schneider, Chanchal K. Roy

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过模型合并技术构建跨域代码克隆检测器,经实验验证TIES合并方法泛化性更优,合并后检测器性能优于零样本代码大模型且泛化性更强。

Comments Accepted at ASE 2026

Journal ref Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04071 2026-08-06 cs.AI 新提交 57%

Monte Carlo Tree Search for Table-to-Multimodal Report Generation

面向表格到多模态报告生成的蒙特卡洛树搜索

Teng Lin, Zhiyang Zhang, Yuyu Luo, Nan Tang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03791 2026-08-05 cs.AI 新提交 57%

Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation

遗忘能否跨模态迁移?面向跨模态知识遗忘评估的真实世界基准

Chunlin Liu, Junnian Chen, Haitong Jiang, Jianyu Zhao, Yingsen Pang, Jingchen Li, Jiabiao He, Youming Lu, Jinhe Bi, Yuntao Du

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文针对跨模态知识遗忘迁移研究缺口,推出UNLINK-VL基准,实验发现跨模态遗忘存在不对称性,纯文本遗忘迁移效果差,凸显跨模态遗忘与评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03782 2026-08-05 cs.AI 新提交 57%

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

KnowHal:用于全面多模态幻觉评估的知识驱动基准

Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLMs)的幻觉评估缺口,提出知识驱动的KnowHal基准,涵盖四个幻觉维度,经评估发现知识维度是模型最大挑战,多数模型对错误前提鲁棒性有限。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03731 2026-08-05 cs.AI 新提交 57%

CARE-Bench: Benchmarking Patient-Facing LLM Triage

CARE-Bench:面向患者的大语言模型分诊基准测试

Yining Hua, Hongbin Na, Cyrus Ayubcha

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究推出面向患者的大语言模型分诊基准CARE-Bench,评估11个模型后发现提示可提升多数模型性能但仍存阈值错误,表明患者分诊需明确评估行动时机而非仅靠简单提示。

Comments Code and data are available at GitHub and Hugging Face. Submitted as a preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03588 2026-08-05 cs.PL cs.AI cs.SE 新提交 57%

GenOS: Compositional Certificates for Semantic Robustness in AI Code Generation

GenOS:AI代码生成中语义鲁棒性的组合式证书

Corrado Priami

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 GenOS是针对AI代码生成语义鲁棒性的概率操作语义,通过马尔可夫核与等价关系确保工作流中组件替换的安全性,经实验验证其鲁棒性界与兼容性可测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03451 2026-08-05 cs.AI 新提交 57%

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

DataSpace:针对异构工作空间可验证分析的数据智能体基准测试

Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究推出DataSpace基准,用于评估异构工作空间下数据智能体的可验证分析能力,包含多类型任务与数据,实验揭示了智能体框架、多模态集成等对准确率的影响,为提升数据智能体可靠性指明了方向。

Comments 8 pages of main text, 7 figures, with a supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03330 2026-08-05 cs.AI 新提交 57%

Long-term Traffic Scene Prediction via Polynomial Representations in Autonomous Driving

自动驾驶中基于多项式表示的长期交通场景预测

Yue Yao

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究提出基于多项式表示的自动驾驶交通场景预测模型,结合理论分析与实证验证,在标准基准上接近最优准确率,提升分布偏移下的泛化能力,生成更合理的多智能体场景,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03190 2026-08-05 cs.AI 新提交 57%

TumorBoard: Evidence-Grounded Multi-Agent Decision Support for Longitudinal Neuro-Oncology

TumorBoard:基于证据的多智能体纵向神经肿瘤学决策支持系统

Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 TumorBoard是基于证据的多智能体纵向神经肿瘤学决策支持系统,经360例基准测试,其性能优于现有基线,安全管控模块可有效降低有害建议比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03174 2026-08-05 cs.CR cs.AI 新提交 57%

Attribute-based Undetectable Watermarking for Generative AI Models

面向生成式AI模型的基于属性的不可检测水印

Miryam Mi-Ying Huang, Chung-Wei Lee, Max Raffel, Er-Cheng Tang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对生成式AI水印中检测密钥滥用的问题,提出首个基于属性的生成式AI水印方案,实现策略控制的细粒度检测,经原型验证兼具有效性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03063 2026-08-05 cs.CL 新提交 57%

SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay

SeqLLM:为高风险决策场景下的微信支付增强序列大语言模型(LLM)的行为序列建模能力

Guilin Li, Jiaxing Zhang, Matthias Hwai Yong Tan, Bo Wang, Weiran Huang

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 SeqLLM是一种在保留LLM语言能力的同时增强其行为序列建模能力的框架,已部署于微信支付,在风险筛查等任务上性能显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00056 2026-08-04 eess.SP cs.LG eess.IV 新提交 57%

Domain-Generalized Adaptive Semantic Communication for Collaborative Perception

面向协同感知的域泛化自适应语义通信

Fan Gao, Youzheng Wang, Ning Ge

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 提出域泛化语义通信框架RSTA,通过跨域原型对齐等技术解决车路协同感知中观测域偏移与信道损坏耦合退化问题,在多基准测试中取得AP指标提升且部署开销极低。

Comments Accepted by IEEE ICCC 2026. 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02520 2026-08-04 cs.CL 新提交 57%

MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs

MedPRESS:面向大语言模型中患者压力诱导型医疗谄媚行为的多轮基准测试

Saman Sarker Joy, Niloy Farhan

机构 * Universiti Malaya(马来亚大学) BRAC University(BRAC大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 MedPRESS是衡量大语言模型患者压力诱导型医疗谄媚行为的多轮基准,含600个五轮医学对话,评估20类LLM发现其易在压力下不安全附和,反谄媚提示仅部分改善,凸显医疗LLM需抗对话压力的缺口。

Comments 27 pages, 10 figures. Both authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02295 2026-08-04 cs.AI cs.LO 新提交 57%

MechGeo: Autoformalizing and Proving Euclidean Geometry in Lean 4

MechGeo:在Lean 4中自动形式化与证明欧几里得几何

Hao Shen, Junyu Guo, Tian Cui, Yuxuan Xiao, Lihong Zhi

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01849 2026-08-04 cs.AI 新提交 57%

Exploring and Bridging Knowledge Holes in Unlearned Multimodal Large Language Models

探索与弥合未学习多模态大语言模型中的知识缺口

Junxiang You, Junkai Chen, Yuhao He, Ruiqi Liu, Zhetao Guo, Shu Wu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对未学习多模态大语言模型存在的知识缺口问题,提出带锚定正则化的选择性保护方法,在保障未学习安全性的同时大幅恢复模型响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01805 2026-08-04 cs.AI 新提交 57%

CockpitHAT: Dependency-Graph-Driven Hierarchical Attribution for Embodied Multi-Agent Cockpits

CockpitHAT:面向具身多智能体座舱的依赖图驱动分层归因方法

Wei Wang, Shuanghe Liu, Zhu Zhuo, Jiaqi Zhong, Xiaozhao Zhao, Xiaojie Zuo, Jie Su

机构 * ByteDance(字节跳动)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究针对LLM多智能体系统的“正确性崩溃”问题,提出CockpitHAT分层归因框架,发布含212条轨迹的CockpitBench基准,在相关基准上超越现有方法,实现可靠故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01378 2026-08-04 cs.LG 新提交 57%

When May a Model Replace the Experiment? Audits, Licenses, and the Price of Trust in Surrogate-Driven Design

模型何时可替代实验?代理驱动设计中的审计、许可与信任代价

Shuangxiu, Ma, Wenhe, Zhao

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 该研究明确了机器学习代理替代实验的安全条件,推导了模型作为神谕的最小准则,提出选择感知审计可降低认证评估成本,经审计的筛选使认证神谕成本降低25倍。

Comments 47 pages (18 pages main text, 29 pages Supporting Information), 9 figures, 2 tables, 70 references. SI contains complete proofs of all theorems, extended experiments, and the verification methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00817 2026-08-04 cs.AI cs.HC stat.AP 新提交 57%

Large language models improve physician accuracy but lead to false reliance

大型语言模型可提高医师准确率,但会导致错误依赖

Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kather, Consortium, Titus J. Brinker

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00764 2026-08-04 cs.AI 新提交 57%

FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction

FinDeepIndicator:端到端金融指标构建中深度研究智能体的基准测试

Chaoqun Yang, Fengbin Zhu, Xinyu Lin, Long Bai, Xiaoluan Liu, Ke-Wei Huang, Roger Zimmermann, Tat-Seng Chua

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) China Economics and Management Academy, Central University of Finance and Economics(中央财经大学中国经济与管理研究院) Asian Institute of Digital Finance, National University of Singapore(新加坡国立大学亚洲数字金融研究所) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究提出首个评估深度研究智能体端到端金融指标构建表现的基准FinDeepIndicator,含多市场数据,实验发现DR智能体优于检索增强LLMs但仍不可靠,为金融领域智能体开发提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00680 2026-08-04 cs.AI 新提交 57%

Multi-Dimensional Assessment for AI Cognition (MAAC): A Theoretical Framework for Process-Oriented Cognitive Evaluation of Text-Based AI Systems

人工智能认知的多维度评估(MAAC):面向基于文本的人工智能系统的过程导向认知评估理论框架

Abdalla Doleh, Ratna Babu Chinnam

机构 * Wayne State University(韦恩州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对现有AI评估仅关注结果的局限,本文提出MAAC框架,从九个认知维度对基于文本的AI系统进行过程导向评估,补充了现有结果基准的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29445 2026-08-03 cs.CV cs.AI 新提交 57%

QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models

用于红外视觉语言模型定向语义攻击的QR结构化热触发装置

Xiang Chen, Yingying Zhao, Chao Li, Jiaju Han, Ben Zhang, Ang Li, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究提出QR-STT框架,作为隐蔽黑盒攻击手段,可定向操控IR-VLMs的语义对齐,其扰动还能跨任务迁移,凸显了对该类攻击进行鲁棒性评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29431 2026-08-03 cs.AI 新提交 57%

ModelEquivBench: Certifying Multi-Relational Evaluation of LLM-Generated Optimization Models

ModelEquivBench:LLM生成优化模型的多关系验证评估系统

Penglin Zhu, Jungang Xu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出多关系评估系统ModelEquivBench,将其用于评估GPT-5.4等三个LLM生成的优化模型,发现不同模型在特征不同阶段失败,无法简化为单一准确率分数。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29085 2026-08-03 cs.CY 新提交 57%

IyawoBench v2.0: Extended Diagnostic Evaluation of Large Language Model Clinical Triage in Nigerian Primary Care

IyawoBench v2.0:尼日利亚基层医疗中大型语言模型临床分诊的扩展诊断评估

Anthonio Oladimeji Gabriel, Dimeji Olawuyi

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 IyawoBench v2.0评估尼日利亚基层医疗的大型语言模型临床分诊,提出含三类失效模式的框架及新指标,发现前沿模型存缺陷,最优模型随部署场景变化,为中低收入国家临床AI选择提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29079 2026-08-03 cs.CL 新提交 57%

Faster but Different: Diagnosing and Controlling Content Drift in Accelerated Multimodal Diffusion Language Models

更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制

Yaoxuan Dou, Yang Shu

机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。

Comments 9 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28840 2026-08-03 cs.CL cs.SE 新提交 57%

Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications

基准测试并非验证:金融大语言模型应用的系统级视角

Burak Payzun, İrem Demirtaş, Simona Scala, Elena Ferretti, Seçil Arslan

机构 * Prometeia S.p.A.(普罗米特亚公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏