arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-03 至 2026-06-03 共收录 114 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 33 篇

2606.03647 2026-06-03 cs.CR cs.AI cs.LG 62%

Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs

黑盒、自适应、高效、可迁移、有害、适用……攻击是破解LLM所需的一切

Vincent Limbach, Jonas Dornbusch, David Lüdke, Stephan Günnemann, Leo Schwinn

机构 * University of St. Gallen(圣加尔大学)

专题命中 安全评测 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 提出间接危害优化(IHO)方法,通过迭代偏好优化训练掩码扩散语言模型攻击器,实现黑盒、高效、可迁移的自适应攻击,显著提升对分层防御的破解成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03626 2026-06-03 cs.CV cs.AI cs.CY 62%

TurtleAI: Benchmarking Multimodal Models for Visual Programming in Turtle Graphics

TurtleAI:海龟图形学中视觉编程的多模态模型基准测试

Chao Wen, Jacqueline Staub, Adish Singla

机构 * MPI-SWS(马克斯·普朗克研究所-斯图加特)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 提出TurtleAI基准,包含823个基于海龟图形学真实任务的视觉编程任务,评估20多个多模态模型发现成功率低于30%,并通过少量种子样本生成合成数据微调Qwen2-VL-72B提升约20%性能。

Comments ACL Findings 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03331 2026-06-03 cs.CL cs.AI 62%

Evaluating LLMs' Effectiveness on Real-World Consumer Device Repair Questions

评估大语言模型在真实世界消费设备维修问题上的有效性

Atm Mizanur Rahman, Md Arid Hasan, Syed Ishtiaque Ahmed, Sharifa Sultana

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过引入包含991个真实维修问题的基准测试,评估六种大语言模型在英语和孟加拉语上的正确性、完整性、实用性和安全性,发现模型虽能提供有用帮助,但在高风险维修任务中仍不可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02741 2026-06-03 cs.CL cs.CY 62%

Greener Than Humans? Environmental Attitudes in Large Language Models

比人类更绿色?大语言模型中的环境态度

Stefanie Kunkel, Tilman Hartwig, Marcus Voss, Emma K. Schütt, Angelika Gellrich

机构 * University of Tübingen(图宾根大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 通过构建基准评估31个LLM的环境认知、情感和行为建议,发现多数模型比德国调查受访者更倾向环保态度,但存在语境敏感性和谄媚偏移。

Comments Code can be found at https://gitlab.opencode.de/uba-ki-lab/llm-questionnaire-benchmarking-framework Benchmark data and results can be found at https://zenodo.org/records/20445903

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18572 2026-06-03 cs.CV cs.AI cs.LG 62%

Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale

回到柏拉图的洞穴:大规模检验跨模态表示收敛性

A. Sophia Koepke, Daniil Zverev, Shiry Ginosar, Alexei A. Efros

机构 * UC Berkeley(伯克利大学) Technical University Munich, MCML(慕尼黑技术大学) University of Tübingen, Tübingen AI Center(图宾根大学) Toyota Technical Institute at Chicago(芝加哥丰田技术研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过大规模数据集实验,质疑了柏拉图表示假说中跨模态表示收敛的证据,发现对齐度随数据规模增大而显著下降,且仅反映粗粒度语义重叠。

Comments Project page: http://akoepke.github.io/cave_umwelten/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08247 2026-06-03 cs.CL cs.CY 62%

ParliaBench: An Evaluation and Benchmarking Framework for LLM-Generated Parliamentary Speech

ParliaBench: 面向大语言模型生成的议会演讲的评估与基准框架

Marios Koniaris, Argyro Tsipi, Panayiotis Tsanakas

机构 * University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 提出ParliaBench基准框架,通过构建英国议会数据集、结合计算指标与LLM评判的评估方法以及两种新型嵌入指标(政治光谱对齐和政党对齐),系统评估LLM生成议会演讲的语言质量、语义连贯性和政治真实性,实验表明微调显著提升多数指标且新指标对政治维度具有强区分力。

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 4797-4818, European Language Resources Association (ELRA), Palma, Mallorca, Spain, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03116 2026-06-03 eess.AS cs.AI cs.SD 57%

AnyAudio-Judge: A Dynamic Rubric-Based Benchmark and Evaluator for Audio Instruction Following

AnyAudio-Judge:基于动态评分标准的音频指令跟随基准与评估器

Haitao Li, Tian Tan, Yuguang Yang, Shan Yang, Xie Chen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文脉)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对指令引导音频生成中复杂指令解耦困难、评估缺乏可解释性和细粒度属性匹配的问题,提出基于动态评分标准的评估范式,通过自适应分解音频描述为可验证的二元评分项,并构建包含7920个样本的双语基准和105K训练语料,结合SFT与GRPO训练专用评估器,在零样本对齐检测和下游强化学习指令对齐中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03635 2026-06-03 cs.CV cs.AI 57%

VidMsg: A Benchmark for Implicit Message Inference in Short Videos

VidMsg:短视频中隐含信息推断的基准测试

Issar Tzachor, Michael Green, Rami Ben-Ari

机构 * OriginAI, Israel(OriginAI以色列)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出VidMsg基准,通过消息优先构建流程和双向检索任务,评估视频理解模型对短视频中隐含信息的推断能力。

Comments Project page: https://iyttor.github.io/VidMsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03312 2026-06-03 cs.RO cs.AI 57%

RobotValues: Evaluating Household Robots When Human Values Conflict

RobotValues: 当人类价值观冲突时评估家用机器人

Jongwook Han, Hyeongjin Kim, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出RobotValues基准,通过10K个价值冲突场景评估家用机器人规划器,发现视觉语言模型存在默认价值偏好且难以覆盖,表明评估需考虑价值冲突下的行动选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02959 2026-06-03 cs.LG cs.CR 57%

Gate AI: LLM Security Benchmark Evaluation Methodology and Results

Gate AI:大语言模型安全基准评估方法与结果

Ryle Goehausen, Marcus Sousa

机构 * constellationnetwork(Constellation Network)

专题命中 安全评测 :jailbreak(abstract);分类 cs.LG

AI总结 针对提示注入和越狱检测器评估中数据集阈值调优和操作点未公开的问题,提出一种采用5折交叉验证、全局操作点选择和多种泛化诊断的评估框架,并在16个公开基准上进行了测试。

Comments 17 pages, 23 figures, 2 tables. Working preprint; subsequent versions may update benchmark numbers as the framework evolves

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02755 2026-06-03 cs.SE cs.AI 57%

Acceptance-Test-Driven Evaluation Protocols for Business-Centric LLM Systems

面向业务中心LLM系统的验收测试驱动评估协议

Eric Liang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对LLM系统概率生成与确定性需求不匹配问题,提出基于验收测试驱动开发、安全工程和业务中心验证的评估协议,将利益相关者目标转化为可执行行为契约,并采用红-训练-绿生命周期确保多维门控通过后才发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01166 2026-06-03 cs.CR cs.CL 57%

BraveGuard: From Open-World Threats to Safer Computer-Use Agents

BraveGuard: 从开放世界威胁到更安全的计算机使用代理

Yunhao Feng, Xiaohu Du, Xinhao Deng, Yifan Ding, Ming Wen, Yixu Wang, Yuxiang Xie, Baihui Zheng, Yingshui Tan, Yige Li, Yutao Wu, Kerui Cao, Wenke Huang, Yanming Guo, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Ant Group(蚂蚁集团) Hunan Institute of Advanced Technology(湖南高级技术研究所) Alibaba Group(阿里巴巴集团) Singapore Management University(新加坡管理大学) Deakin University(德肯大学) Nanyang Technological University(南洋理工大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出BraveGuard框架,通过从开放世界威胁信号和真实代理轨迹中训练防护模型,实现轨迹级别的安全检测,显著提升计算机使用代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18160 2026-06-03 cs.CV cs.AI 57%

Vision Inference Former: Sustaining Visual Consistency in Multimodal Large Language Models

Vision Inference Former:在多模态大语言模型中维持视觉一致性

Xinpeng Dong, Min Zhang, Kairong Han, Xu Tan, Fei Wu, Kun Kuang

机构 * Zhejiang University(浙江大学) East China Normal University(华东师范大学) Zhejiang University of Science and Technology(浙江理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对多模态大语言模型中视觉信息被弱化的问题,提出Vision Inference Former(VIF)轻量模块,在推理解码阶段持续注入视觉语义,提升生成内容与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12430 2026-06-03 cs.MA cs.AI 57%

Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward

大型语言模型的智能体技能:架构、获取、安全与未来路径

Renjun Xu, Yang Yan

机构 * ReDiscovery Hangzhou China(杭州ReDiscovery研究院) Westlake University Hangzhou China(西交大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了大型语言模型智能体技能的研究,涵盖架构基础(如SKILL.md规范、渐进式上下文加载)、技能获取(强化学习、自主发现、组合合成)、大规模部署(计算机使用智能体栈、GUI接地)以及安全挑战(26.1%社区技能含漏洞),并提出技能信任与生命周期治理框架。

Comments Accepted by Agent Skills '26 Workshop at ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05530 2026-06-03 cs.AI 57%

MIND: Multi-rationale INtegrated Discriminative Reasoning Framework for Multi-modal Large Models

MIND:面向多模态大模型的多理由集成判别推理框架

Chuang Yu, Jinmiao Zhao, Mingxuan Zhao, Yunpeng Liu, Xiujun Shu, Yuanhao Feng, Bo Wang, Xiangyu Yue

机构 * Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) MMLab, CUHK(CUHK多模态实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在多理由语义建模、逻辑鲁棒性和抗误导方面的不足,提出MIND推理框架,通过“理解-反思-纠正”机制实现从被动模仿到主动判别推理的范式转变。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07867 2026-06-03 eess.SY cs.LG cs.SY 57%

Learning Power Flow with Confidence: A Probabilistic Guarantee Framework for Voltage Risk

学习潮流与置信度:电压风险的概率保证框架

Parikshit Pareek, Sidhant Misra, Deepjyoti Deka

机构 * Department of Electrical Engineering, Indian Institute of Technology Roorkee, India(印度理工学院罗奥克分校电气工程系) Los Alamos National Laboratory, New Mexico, USA(洛斯阿拉莫斯国家实验室) MIT Energy Initiative, Boston, USA(麻省理工学院能源倡议)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 针对机器学习在电力系统安全应用中缺乏形式化性能保证的问题,提出基于高斯过程回归的概率保证框架,通过顶点度核和网络扫描主动学习算法实现数据高效且可靠的电压风险评估。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03872 2026-06-03 eess.SY cs.SY 50%

NeuroSymbolic Robustness Analysis for Discrete Systems with Respect to Transition Deviations

针对转移偏差的离散系统神经符号鲁棒性分析

Shih-Jie Shih, Jonghan Lim, Ilya Kovalenko, Rômulo Meira-Góes

专题命中 安全评测 :safety(abstract)

AI总结 提出一种神经符号计算框架,利用大语言模型推断可行偏差转移集,再通过符号层计算离散鲁棒性保证,以解决传统方法可扩展性差和保守性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03417 2026-06-03 cs.CV 50%

A unified multi-task framework enables interpretable chest radiograph analysis

统一多任务框架实现可解释的胸部X光片分析

Lijian Xu, Ziyu Ni, Xinglong Liu, Xiaosong Wang, Hongsheng Li, Shaoting Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 提出IMT-CXR框架,通过统一Transformer架构模拟放射科医生诊断流程,实现疾病识别、属性表征和可追溯报告生成,在十个基准上表现优异,且临床评估中66%的AI报告达到或超越原始报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01624 2026-06-03 cs.CV cs.SE 50%

What to Test Next: Interpretable Coverage Gap Discovery in Driving VLMs

下一步测试什么:驾驶视觉语言模型中可解释的覆盖缺口发现

Abhishek Aich, Sparsh Garg, Vijay Kumar BG, Turgun Yusuf Kashgari, Manmohan Chandraker

专题命中 安全评测 :safety(abstract)

AI总结 提出 SliceScorer 和 SliceNav 方法,通过结合暴露先验和邻居失败先验的确定性评分规则,在驾驶视觉语言模型中有效发现高风险覆盖缺口,并支持可解释和可审计的验证流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30915 2026-06-03 cs.CV 50%

DiTTo: Scalable Order-aware All-in-One Image Restoration Agent

DiTTo: 可扩展的排序感知全能图像修复智能体

Seungho Choi, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang 大学 CMLab) David S. Hippocampus Department of Computer Science Cranberry-Lemon University(Cranberry-Lemon 大学 计算机科学系 Hippocampus 教授)

专题命中 安全评测 :alignment(abstract)

AI总结 提出DiTTo框架,通过模拟器高效构建最优修复轨迹数据集,并采用排序感知对齐实现修复专家的即插即用扩展,在多退化图像修复中达到最优性能。

Comments Please visit our project page at https://cmlab-korea.github.io/DiTTo/

详情

展开后加载摘要…

URL PDF HTML 收藏
1007.2738 2026-06-03 math.OC cs.SY eess.SY 50%

Consensus Computation in Unreliable Networks: A System Theoretic Approach

不可靠网络中的共识计算:系统论方法

Fabio Pasqualetti, Antonio Bicchi, Francesco Bullo

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对线性共识网络中行为异常代理的检测与识别问题,采用未知输入系统理论框架,给出了可检测与可识别的条件、最坏情况界限及三种算法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2601.04175 2026-06-03 cs.CY 79%

Legal Alignment for Safe and Ethical AI

安全与伦理人工智能的法律对齐

Noam Kolt, Nicholas Caputo, Jack Boeglin, Cullen O'Keefe, Rishi Bommasani, Stephen Casper, Mariano-Florentino Cuéllar, Noah Feldman, Iason Gabriel, Gillian K. Hadfield, Lewis Hammond, Peter Henderson, Atoosa Kasirzadeh, Seth Lazar, Anka Reuel, Kevin L. Wei, Jonathan Zittrain

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY

AI总结 本文通过调查法律对齐的新兴领域,提出三种核心研究路径(合规、解释方法、概念蓝图),以利用法律规则、原则和方法解决AI对齐问题,确保AI系统安全且合乎伦理地运行。

Comments Published in TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10169 2026-06-03 cs.AI cs.LG 62%

MAVEN-T: Reinforced Heterogeneous Distillation for Real-Time Multi-Agent Trajectory Prediction

MAVEN-T:用于实时多智能体轨迹预测的强化异构蒸馏

Wenchang Duan, Zhenguo Gao, Jinguo Xian, Yi Shi

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Bio-X Institutes, Key Laboratory for the Genetics of Developmental and Neuropsychiatric Disorders, Shanghai Jiao Tong University(上海交通大学Bio-X研究院、发育与神经精神疾病遗传学重点实验室) Shanghai Key Laboratory of Psychotic Disorders, Brain Science and Technology Research Center, Shanghai Jiao Tong University(上海精神疾病重点实验室、脑科学与技术研究中心,上海交通大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出MAVEN-T框架,通过高容量教师模型和紧凑学生模型的异构蒸馏,结合强化学习优化,实现实时多智能体轨迹预测,在多个数据集上达到高精度与低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03321 2026-06-03 cs.LG cs.MA cs.SY eess.SY 57%

Validation-Gated Multi-Agent Governance for Online Adaptation of Thermal-Hydraulic Surrogate Models under Operating-Regime Shift

验证门控多智能体治理:运行工况迁移下热工水力代理模型的在线自适应

Doyeong Lim, Seungyoon Lee, In Cheol Bang

机构 * Department of Nuclear Engineering, Ulsan National Institute of Science and Technology (UNIST)(核工程系,乌山国立科学技术研究所(UNIST))

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 针对离线训练模型在运行工况迁移时性能退化问题,提出验证门控多智能体治理框架,通过角色分离的智能体协作与确定性门控机制实现可审计的在线自适应,在实验热工水力数据上将平均绝对误差降低19%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03036 2026-06-03 cs.AI 57%

TriEval: A Resource-Efficient Pipeline for LLM Bias, Toxicity, and Truthfulness Assessment

TriEval: 一种资源高效的LLM偏见、毒性和真实性评估流水线

Akshatha Srikantha, Manpreet Singh, Yash Jajoo, Shyamal Lakhanpal

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 提出TriEval流水线,通过同时评估LLM输出的偏见、毒性和真实性,在标准笔记本电脑上高效运行,并揭示开源与闭源模型在毒性和真实性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02862 2026-06-03 cs.AI cs.MA 57%

Toward a Modular Architecture for Embedded AI Agent Systems at the Edge

面向边缘嵌入式AI智能体系统的模块化架构

Marcus Rüb, Michael Gerhards

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 提出一种模块化参考架构,通过分层设计解耦设备端和云端智能体,并引入治理层,解决嵌入式微控制器上部署自主AI的严格资源约束问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 28 篇

2606.03812 2026-06-03 cs.AI 83%

Enhancing Operational Safety via Agentic Dialogue Hazard Identification Analysis

通过智能体对话危害识别分析增强操作安全性

Sanjay Das, Ran Elgedawy, Ethan Seefried, Ryan Burchfield, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 其他安全 :safety(title,abstract);AI safety(abstract);分类 cs.AI

AI总结 提出HAZDIAL框架,利用结构化多智能体多轮对话(对抗性辩论与建设性讨论)改进基于NLP的危害识别质量,并通过算法优化智能体交互,实验证明优于单次基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29123 2026-06-03 cs.CL 79%

Learning Concepts, Not Tokens: Self-Supervised Semantic Alignment for Language Models

学习概念,而非词元:语言模型的自我监督语义对齐

Christine Zhang, Dan Jurafsky, Chen Shani

机构 * Stanford University(斯坦福大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出一种自我监督框架,通过预测语义等价词元集合(概念)替代下一个词元预测,提升语言模型的语义对齐能力,并在分类、聚类、重排序及下游推理任务中取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01374 2026-06-03 cs.CL 79%

MTA: Multi-Granular Trajectory Alignment for Large Language Model Distillation

MTA:面向大型语言模型蒸馏的多粒度轨迹对齐

Pham Khanh Chi, Quoc Phong Dao, Thuat Nguyen, Linh Ngo Van, Trung Le, Thanh Hong Nguyen

机构 * Hanoi University of Science and Technology(河内理工大学) Monash University(墨尔本大学) University of Oregon(俄勒冈大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出多粒度轨迹对齐(MTA)框架,通过层自适应策略对齐师生模型的层间变换轨迹,结合动态结构对齐损失和隐藏表示对齐损失,提升知识蒸馏效果。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01205 2026-06-03 cs.CL 79%

SRA: Span Representation Alignment for Large Language Model Distillation

SRA: 面向大型语言模型蒸馏的跨度表示对齐

Quoc Phong Dao, Hoang Son Nguyen, Pham Khanh Chi, Tung Nguyen, Linh Ngo Van, Nguyen Thi Ngoc Diep, Trung Le

机构 * Hanoi University of Science and Technology(河内科学技术大学) VNU University of Engineering and Technology(VNU工程大学) Monash University(莫纳什大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出SRA框架,通过将蒸馏对齐单元从token转为跨度的质心表示,并引入几何正则化和对齐跨度logit蒸馏,显著提升跨分词器知识蒸馏性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏