arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-10 至 2026-08-10 共收录 57 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2604.00310 2026-08-10 cs.LG cs.AI 版本更新 88%

CASA: Classification Augmented with Safety Attention for Robust Multimodal Alignment

通过条件解码实现鲁棒的多模态安全性

Anurag Kumar, Raghuveer Peri, Jon Burnsky, Alexandru Nelus, Rohit Paturi, Srikanth Vishnubhotla, Yanjun Qi

机构 * The Ohio State University(俄亥俄州立大学) AWS(亚马逊云服务)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CASA方法,通过内部表示预测安全令牌以提升多模态大语言模型的安全性,实验显示其在多种基准上显著降低攻击成功率,同时保持良性输入的实用性。

Comments 9 pages + Appendix section

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06526 2026-08-10 cs.CL 新提交 81%

GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization

GRASP:用组相对策略优化增强语言模型匿名化器

Sajjad Ghiasvand, Nader Sehatbakhsh

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) UC Los Angeles(加州大学洛杉矶分校)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 该研究提出GRASP方法,用组相对策略优化增强设备端小型语言模型匿名化器,在隐私-效用权衡、对抗匿名化防御及运行成本上均优于DPO蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06792 2026-08-10 cs.IR cs.AI 新提交 79%

Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

通过多阶段后训练实现推荐系统基础模型的渐进式对齐

Oseong Choi, Hoeinn Kim, Jihoon Lee, Byungsoo Kang, Taeyeong Jang

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出LP-FFT-RFT三阶段渐进式后训练框架,将推荐系统基础模型的下游适配与业务指标对齐分离,实验证实其能提升推荐质量。

Comments 9 pages, 3 figures. Accepted to the 20th ACM Conference on Recommender Systems (RecSys '26), Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06632 2026-08-10 cs.AI 新提交 77%

Shape Your Feed: An LLM-based Agentic System for Conversational Recommendation

塑造你的信息流:一种基于大语言模型的智能体对话推荐系统

Ziyun Xu, Bosen Ding, Yue Zhang, Ji Qi, Qingyuan Song, Jizhou Huang, Liwei Wang, Jefferey Santelli, Yue Weng, Qichao Que, Zhenheng Yang, Junfeng Pan, Linhong Zhu

机构 * Meta Platforms(元平台公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI

AI总结 本文提出基于LLM的智能体推荐框架SYF,采用三层架构实现实时多模态内容协同策划,经离线评估与在线A/B实验验证,可提升信息流相关性与用户情感,为工业场景提供交互式推荐方案。

Comments Accepted in RecSys 2026 Industrial Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07419 2026-08-10 cs.LG 新提交 57%

Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration

超越事后温度缩放:用于大语言模型校准的双层优化方法

Ruochen Jin, Zhanliang Wang, Zongyu Dai, Jiancong Xiao, Bojian Hou

机构 * Dartmouth College(达特茅斯学院) University of Pennsylvania(宾夕法尼亚大学) National University of Singapore(新加坡国立大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 针对LLM偏好对齐导致的过度自信与校准问题,提出基于双层优化的校准方法,通过最大化预测分布熵实现,在多项选择与开放式问答任务中提升了校准效果与域外泛化能力。

Comments Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2608.07154 2026-08-10 cs.RO cs.AI 新提交 70%

Representation Handoffs for OpenArm-Based Laboratory Mobile Manipulation

基于OpenArm的实验室移动操作的表示交接

Yang Shen, Chonghao Cheng, Ziyi Zhao, Jialuo Zhu, Zhenyi Yi, Qi Zhao, Jian Yang, Yuhui Shi, Chin-Teng Lin

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。

Comments Robotics: Science and Systems (RSS) Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07418 2026-08-10 cs.AI cs.CL 新提交 62%

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

ResidencyRL:在模拟临床环境中开展的强化学习

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院) Houston Methodist Hospital(休斯顿卫理公会医院) Trinity Health Group(三一健康集团) Stanford Oncology Partners(斯坦福肿瘤学伙伴) St. Luke Hospital(圣卢克医院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出 ResidencyRL,通过多轮强化学习训练临床 AI 智能体,在模拟临床环境中提升诊断准确性、降低漏报率,且能力可迁移至多个医学基准测试,为临床 AI 发展提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07148 2026-08-10 cs.AI 新提交 57%

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing

面向智能制造中大型语言模型增强的多智能体强化学习(MARL)中心参考架构

Fouad Bahrpeyma, Dirk Reichelt

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文针对智能制造自适应控制的耦合需求,提出以MARL为中心的三层参考架构,探讨LLM在MARL中的附着点,明确传统MARL与LLM组件的适配场景,为相关研究提供结构化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11953 2026-08-10 cs.LG 版本更新 57%

When Does Reward Teach State? A Hidden-Automaton Instrument and a Group-Language Warning Signal

奖励何时能引导对状态的理解?一种隐藏自动机工具与群语言边界

James E. Allchin

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究强化学习中高奖励与潜在状态理解的关系,通过将任务表示为隐藏自动机,利用三个可控轴(优化器强度、任务结构、观察信息量)来分别测量奖励成功和潜在状态学习,区分感知差距和规划差距,得出高奖励非任务理解证据且智能体恢复潜在状态可预测的结论。

Comments 17 pages, 3 figures, 6 tables (9-page main text). Ancillary file hidden-automata-rl-code.zip contains reproduction code and the complete per-run data behind every table and figure. v3: author name corrected, title revised, text rewritten for clarity, new robustness checks (nonlinear and off-policy probes) added; results and conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03509 2026-08-10 cs.CR 版本更新 50%

SkillJack: Persistent Skill Backdoors in Self-Evolving Agents

SkillJack:自进化智能体中的持续性技能后门

Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo

专题命中 安全训练 :safety(abstract)

AI总结 该研究提出SkillJack攻击,利用自进化智能体的经验转技能流水线植入持续性恶意技能,在SkillX和Anything2Skill上验证其低检测率、高成功率,揭示技能演化为新攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19499 2026-08-10 cs.RO 版本更新 50%

Progress-Certified Reversible Simplex Supervision of Goal-Reaching Reinforcement Learning

强化学习目标到达控制与保证Lyapunov-like稳定器的移动机器人

Mehdi Heydari Shahna, Jouni Mattila

机构 * Faculty of Engineering(工程学院) Natural Sciences(自然科学) Tampere University(塔尔库大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于强化学习的控制框架,通过Lyapunov-like稳定器保证移动机器人在无结构环境中的目标到达,提升目标到达率至99%

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2608.07430 2026-08-10 cs.LG cs.AI 新提交 86%

Diffusion LLMs as Targets and Adversaries: Mechanistic Safety Exploits

扩散大语言模型作为目标与对抗者:机制性安全漏洞利用

Elena Dumitrescu, Gert Lek, Lydia Y. Chen, Jérémie Decouchant

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示扩散大语言模型(DLLMs)的安全机制漏洞,提出SN-Guided Diffusion黑盒越狱框架,实现高迁移攻击成功率且生成成本远低于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00123 2026-08-10 cs.AI 版本更新 83%

Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models

最小、局部、因果解释用于大语言模型中的对抗成功

Shubham Kumar, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了大语言模型对抗成功的因果机制,提出LOCA方法通过局部解释识别最小的中间表示变化,以解释对抗成功的原因。

Comments Published at COLM 2026 (updated bib)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09222 2026-08-10 cs.SD cs.AI 版本更新 79%

GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking

GRM:通过梯度比掩码实现音频大语言模型的效用感知越权攻击

Yunqiang Wang, Hengyuan Na, Di Wu, Miao Hu, Guocong Quan

机构 * Sun Yat-Sen University(中山大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出GRM框架,通过频率选择性扰动在音频大语言模型中实现效用感知的越权攻击,实验表明其在攻击成功率与效用平衡方面优于基线方法。

Comments Accpeted by MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06651 2026-08-10 cs.CR cs.SE 新提交 67%

CyberLLM: A Multi-Agent LLM Framework for Autonomous Detection and Guarded Response in Automotive Cybersecurity

CyberLLM:面向汽车网络安全的多智能体大语言模型框架,用于自主检测与受管控响应

Nenad Petrovic, Oussama Jeddou, Feres Ben Fraj, Vahid Zolfaghari, Fengjunjie Pan, Andre Schamschurko, Alois Knoll

专题命中 越狱攻击 :alignment(abstract);safety(abstract)

AI总结 CyberLLM是由大语言模型编排的多智能体框架,结合确定性检测层与大语言模型精化,在安全防护下实现汽车漏洞自主检测与修复,在基准测试中覆盖约70%漏洞且零误报,验证了LLM智能体自主防御的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06779 2026-08-10 q-bio.QM cs.AI cs.CL 新提交 62%

Genotypic Triggers: Exposing Pharmacogenomic Blind Spots via Host-Specific Backdoors in Generative Antimicrobial Peptide Models

基因型触发器:通过生成抗菌肽模型中宿主特定后门暴露药物基因组学盲区

Doniyorkhon Obidov, Xiaolong Guo, Yonghui Li, Kaichen Yang

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出基因型触发器后门攻击,操控抗菌肽生成模型使其针对特定HLA等位基因携带者生成高免疫原性风险肽,同时保留抗菌效力与低毒性,以暴露药物基因组学盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2608.06477 2026-08-10 cs.CR cs.AI cs.CL 新提交 88%

StepJack: Benchmarking Computer-Use Agent Safety Against Multi-Step Indirect Prompt Injection

StepJack:针对多步骤间接提示注入的计算机使用智能体安全基准测试

Zhuoxin Zhan, Akbar Rafiey, Avery Ma, Leila Pishdad, Layla El Asri

专题命中 提示注入 :safety(title,abstract);prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出多步骤间接提示注入新型攻击,构建含480个测试样例的StepJack基准,评估六款先进CUAs,发现多步骤攻击可提升部分CUAs的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07167 2026-08-10 cs.AI 新提交 70%

NiyamAI - An Intent-Bound AI Agent with Cryptographically Verifiable Guardrails using Zero-Knowledge Proofs

NiyamAI——一种使用零知识证明实现密码学可验证护栏的意图绑定AI智能体

Aditya Katkar, Om Karkele, Kartik Mandhane, Manisha More, Yash Kashid

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 Niyam-AI是一种基于零知识证明的意图绑定AI智能体框架,通过SHA-256承诺意图合约、Judge模型验证和zk-SNARK确保证明,在Agent-SafetyBench评估中较多款基线护栏实现显著安全性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2608.07141 2026-08-10 cs.CV 新提交 78%

Human-AI Perceptual Alignment by Playing Hues and Cues

通过玩Hues and Cues游戏实现人类与AI的感知对齐

Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver, Pablo Hernández-Cámara, Valero Laparra, Jesús Malo

机构 * Universitat de València(瓦伦西亚大学) Image Processing Lab(图像处理实验室)

专题命中 幻觉与事实性 :alignment(title,abstract)

AI总结 本研究提出基于Hues and Cues游戏的评估框架,对比162个CVLMs与人类的颜色感知对齐,发现其在抽象领域偏离人类基线,筛选的预训练数据集可缓解错位。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07139 2026-08-10 cs.LG 新提交 57%

Online Conformal Prediction Beyond Feedback

超越反馈的在线共形预测

Joar Skalse, Edoardo Pona, Osvaldo Simeone, Nicola Paoletti

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 针对超越反馈的在线共形预测场景,本文提出OCPQ方法,将标签高效预测器适配到该设置,实现了低查询率下的高覆盖率,且在真实数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2603.24735 2026-08-10 cs.HC 版本更新 50%

Examining the Effect of Explanations of AI Privacy Redaction in AI-mediated Interactions

考察AI隐私擦除解释在AI中介互动中的影响

Roshni Kaushik, Maarten Sap, Koichi Onoue

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 研究探讨AI中介互动中解释擦除操作对用户信任的影响,发现解释能提升隐私保护效果,且情境因素和个体差异影响解释效果。

Comments Accepted at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 20 篇

2608.07176 2026-08-10 cs.CV cs.AI 新提交 79%

Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation

面向隐空间生成的表征驱动型内窥镜视觉嵌入对齐

Francisco Caetano, Tim J. M. Jaspers, Haiko Middeljans, Martijn R. Jong, Rixta A. H. van Eijck van Heslinga, Floor Slooter, Albert J. de Groof, Jacques J. Bergman, Peter H. N. De With, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) Amsterdam University Medical Centers(阿姆斯特丹大学医学中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本研究针对内窥镜生成模型的领域差距与计算成本问题,提出REVEAL模型,基于500万帧内窥镜数据训练,在多任务中性能优于同类模型,为临床智能工具开发提供基础。

Comments Accepted at the DCA-MI Workshop (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06984 2026-08-10 cs.CR cs.AI 新提交 79%

HarnessSafe: Evaluating Safety Across Persistent Carriers in Agent Harnesses

HarnessSafe:评估智能体框架中持久载体的安全性

Xiao Zhang, Yusheng Wang, Yuhao Fei, Dongyuan Li, Zian Liang, Liuyu Xiang, Hongxun Gu, Zhaofeng He

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 HarnessSafe基准含7类持久载体的328个可执行案例,通过追踪攻击链的多阶段评估,揭示智能体框架中安全遏制效果的载体特异性及框架-模型配置的重要性。

Comments 21 pages, 3 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-08-10 cs.AI 版本更新 79%

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19035 2026-08-10 cs.AI 版本更新 79%

Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On

可信代理网络:在代理网络中,信任必须被内置,而非事后添加

Yixiang Yao, Yuhang Yao, Xinyi Fan, Jiechao Gao, Jie Wang, Minjia Zhang, Srivatsan Ravi, Carlee Joe-Wong

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 安全评测 :trustworthy(title);alignment(abstract);分类 cs.AI

AI总结 本文探讨了在代理网络中信任必须被内置而非事后添加的问题,提出了一个综合的概念框架,通过四个设计支柱来建立代理网络中的信任。

Comments Accepted at SIGKDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06865 2026-08-10 cs.CV cs.AI cs.MA 新提交 70%

Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection

用于可泛化深度伪造视频检测的多智能体取证推理

Xuechao Zou, Shun Zhang, Kai Li, Yi Zhou, Xinyu Sun, Yuhui Chen, Zhe Wu, Congyan Lang, Junliang Xing

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 针对深度伪造检测的现有方法泛化性不足问题,本文构建含10万视频的FaceVid-Forensics-100K数据集,提出多智能体取证推理框架,在域外测试集上性能优于GPT、Gemini等模型。

Comments 22 pages, 8 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21338 2026-08-10 cs.CV 版本更新 67%

Inspecting Training Dynamics of Similarity Development in Supervised Vision Networks

监督视觉网络中相似度发展的训练动态分析

Katarzyna Filus, Mateusz Żarski

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 本研究提出训练时框架DSI,分析卷积与Transformer视觉网络的相似度发展,发现其分三阶段形成结构且存在错误细化现象,为AI评估提供训练视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05910 2026-08-10 cs.AI cs.CY 版本更新 62%

CourseGraph: Finding overlaps and differences in Computer Science courses across universities

CourseGraph:跨大学计算机科学课程的重叠与差异识别

Arthur Nijdam, Paul Stankovski Wagner, Sara Ramezanian

机构 * Lund University(隆德大学) Karlstad University(卡尔斯塔德大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究提出CourseGraph,利用BERT语言模型与随机森林分类器,通过课程网页信息的语义表示计算课程相似度,实现跨大学计算机科学课程重叠的自动识别,为课程对齐提供有效支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00130 2026-08-10 cs.PL cs.AI cs.CL cs.MS cs.SE 版本更新 62%

A Fortran General-Purpose Transpiler: Proof of Concept

Fortran通用转译器:概念验证

Shivamshan Sivanesan, Kazem Ardaneh

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究针对Fortran专业知识断层问题,提出基于Python的FGPT编译器框架,可将Fortran转译为适配GPU或自动微分的代码,经气候建模内核验证,能自动生成正确的Python实现,为遗留Fortran代码现代化提供可靠路径。

Comments 19 pages, 14 figures, proof of concept

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29738 2026-08-10 cs.CL cs.AI 版本更新 62%

Multi-Legal-Bench: Evaluating LLMs on Legal Reasoning Across Jurisdictions, Languages, and Legal Traditions

Multi-Legal-Bench: 跨司法管辖区、语言和法律传统的法律推理评估LLM

Volodymyr Ovcharov

机构 * SecondLayer

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Multi-Legal-Bench,首个跨司法管辖区法律基准,在6个国家、4个语系和1.34亿份法院判决上评估LLM,发现少样本效果跨辖区复制、无单一模型主导所有语言、跨语言迁移不遵循语言邻近性、分词器效率不显著预测跨语言准确率。

Comments 17 pages, 5 figures, 9 tables. v2 corrects scorer and taxonomy defects, adds no-model baselines showing label leakage, re-runs the Lithuanian cells on de-leaked text, and withdraws the claim that few-shot helps on judgment-form classification everywhere; all tables and figures regenerated. Dataset: https://huggingface.co/datasets/overthelex/multi-legal-bench

详情

展开后加载摘要…

URL PDF HTML 收藏