arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-12 至 2026-05-12 共收录 202 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 64 篇

2605.09925 2026-05-12 cs.CV 50%

Frequency Adapter with SAM for Generalized Medical Image Segmentation

基于SAM的频率适应器用于通用医学图像分割

Phuoc-Nguyen Bui, Van-Nguyen Pham, Duc-Tai Le, Junghyun Bum, Hyunseung Choo

机构 * Sungkyunkwan University, Korea(成均馆大学,韩国)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FSAM框架,结合LoRA和频率适配器提升医学图像分割的域泛化能力,通过提取域不变高频特征缓解频率相关域偏移。

Comments Under review, 10 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09481 2026-05-12 cs.NI 50%

TSNBench: Benchmarking LLM Proficiency in Time-Sensitive Networking

TSNBench:评估大语言模型在时间敏感网络中能力的基准测试

Rubi Debnath, Daniel Bujosa Mateu, Luxi Zhao, Silviu S. Craciunas, Paul Pop, Sebastian Steinhorst

专题命中 安全评测 :safety(abstract)

AI总结 本文提出TSNBench,首个评估大语言模型在时间敏感网络中的能力的基准测试,包含939道专家验证的多项选择题和100道开放性问题,揭示LLM在安全关键网络领域的能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05831 2026-05-12 cs.CV 50%

Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media

统一科学交流:跨科学媒体的细粒度对应

Megha Mariam K. M, Vineeth N. Balasubramanian, C. V. Jawahar

机构 * IIIT Hyderabad(IIIT海得拉尔学院) Microsoft Research India & IIT Hyderabad(微软研究院印度分部及IIIT海得拉尔学院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出MCD数据集,通过整合科研论文、演示视频、解释视频和幻灯片,评估不同模型在发现跨格式细粒度对应关系中的能力,揭示了视觉语言模型和嵌入模型的优缺点。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00149 2026-05-12 physics.comp-ph 50%

Towards Verifiable and Self-Correcting AI Physicists for Quantum Many-Body Simulations

迈向量子多体模拟的可验证和自校正人工智能物理学家

Ken Deng, Xiangfei Wang, Guijing Duan, Chen Mo, Junkun Huang, Runqing Zhang, Ling Qian, Zhiguo Huang, Jize Han, Di Luo

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出QMP-Bench基准和PhysVEC框架,通过自验证和纠错机制提升AI在量子多体模拟中的可靠性与准确性,显著优于现有LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14183 2026-05-12 cs.HC 50%

Exploring a Multimodal Chatbot as a Facilitator in Therapeutic Art Activity

探索多模态聊天机器人作为治疗艺术活动的促进者

Le Lin, Zihao Zhu, Rainbow Tin Hung Ho, Jing Liao, Yuhan Luo

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一种基于多模态大语言模型的聊天机器人,通过实时分析视觉创作并促进反思对话,探讨其在艺术治疗中的应用潜力及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09132 2026-05-12 cs.CV 50%

KEPIL: Knowledge-Enhanced Prompt-Image Learning for Prompt-Robust Disease Detection

KEPIL: 基于知识增强的提示-图像学习用于提示鲁棒疾病检测

Haozhe Luo, Shelley Zixin Shu, Ziyu Zhou, Robert Berke, Mauricio Reyes

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学) Department of Radiation Oncology, Inselspital, Bern University Hospital and University of Bern(放射肿瘤科、Inselspital伯尔尼大学医院及伯尔尼大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 KEPIL通过整合 curated 医学知识,提升零样本推理性能,采用动态提示增强、语义感知对比损失和实体中心报告标准化方法,在多个基准测试中实现 state-of-the-art 成绩,提升 AUC 6.37% 在 CheXpert 上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27157 2026-05-12 cs.IR 50%

A Survey on Generative Recommendation: Data, Model, and Tasks

生成推荐的综述:数据、模型与任务

Min Hou, Le Wu, Yuxin Liao, Yonghui Yang, Zhen Zhang, Yu Wang, Changlong Zheng, Han Wu, Richang Hong

专题命中 安全评测 :alignment(abstract)

AI总结 本文综述生成推荐领域,探讨数据、模型与任务维度,分析生成模型在推荐中的应用与挑战,提出智能推荐助手的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08226 2026-05-12 cs.CV 50%

SPECTRA-Net: Scalable Pipeline for Explainable Cross-domain Tensor Representations for AI-generated Images Detection

SPECTRA-Net:可扩展的可解释跨域张量表示可解释性AI生成图像检测流水线

Sarra Arab, Anfal Achouri, Seif Eddine Bouziane

机构 * The National School of Artificial Intelligence(国家人工智能学院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出SPECTRA-Net,通过多视角图像表示结合全局语义特征、频谱分析、局部补丁异常检测和统计描述符,实现跨域AI生成图像检测的高准确性和泛化能力。

Comments 13 pages, 2 figures, submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 8 篇

2605.10528 2026-05-12 cond-mat.stat-mech cs.CL cs.MA physics.soc-ph 79%

Collective Alignment in LLM Multi-Agent Systems: Disentangling Bias from Cooperation via Statistical Physics

大语言模型多智能体系统中的集体对齐:通过统计物理方法分离偏见与合作

Cristiano De Nobili

机构 * Critiqality

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL

AI总结 研究通过统计物理方法分析大语言模型多智能体系统在二维正方形晶格中的集体动态,揭示社会从众与内在偏见的分离,计算临界指数并探测多智能体系统的集体行为与可能相变。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09922 2026-05-12 cs.CL cs.AI 62%

Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs

基于双自适应加权的团队自博弈:用于微调大语言模型

Wu Li, Yigeng Zhou, Zesheng Shi, Yequan Wang, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TPAW算法,通过团队协作与竞争机制提升自监督下LLM对齐效果,采用双自适应加权机制提高优化效率,实验证明其在多种模型和基准测试中表现优异。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14345 2026-05-12 cs.LG cs.AI stat.ML 62%

PAC-MCTS: Bias-Aware Pruning for Robust LLM-Guided Search and Planning

PAC-MCTS:具有偏见意识的剪枝用于稳健的LLM引导搜索与规划

Tianhao Qian

机构 * School of Mathematics, Southeast University(东南大学数学学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PAC-MCTS框架,通过动态调整置信区间来应对LLM引导下的偏见问题,实验表明其在Blocksworld和ALFWorld任务中显著提升了鲁棒性和搜索效率。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10018 2026-05-12 cs.LG 57%

The Value of Mechanistic Priors in Sequential Decision Making

在序列决策中机制先验的价值

Itai Shufaro, Gal Benor, Shie Mannor

机构 * Technion(技术学院) NVIDIA Research(NVIDIA研究)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文研究了机制先验在序列决策中的价值,通过渐近和预热阶段的分析,提出机制信息度量并展示其在5-FU给药模拟中的高效性,对比LLM先验发现其在机械信息上存在严重损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09106 2026-05-12 cs.CL 57%

Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain

Fin-Bias:金融领域下LLM决策制定的综合评估:在存在人类偏见的背景下

Xiaoyu Hu, Jinman Zhao

机构 * Rutgers University(罗格斯大学) Department of Computer Science, University of Toronto(多伦多大学计算机科学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出Fin-Bias基准,评估LLM在金融不确定性和潜在人类偏见意见下的投资决策能力,通过分析8868份分析师报告揭示LLM易受显性偏见影响,并开发方法检测人类意见以促进LLM独立思考。

Comments ACL 2026 Findings

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09007 2026-05-12 cs.SD cs.AI 57%

Gender Fairness in Audio Deepfake Detection: Performance and Disparity Analysis

音频深度伪造检测中的性别公平性:性能与差异分析

Aishwarya Fursule, Shruti Kshirsagar, Anderson R. Avila

机构 * School of Computing, Wichita State University(维斯科大学计算学院) Institut national de la recherche scientifique (INRS–EMT)(国家科学研究中心(INRS–EMT)) INRS-UQO Mixed Research Unit on Cybersecurity(网络安全混合研究单位(INRS-UQO))

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文分析了音频深度伪造检测模型中性别依赖的性能和公平性,使用ASVspoof 5数据集训练ResNet-18分类器,并通过四种音频特征评估性能,结合公平性指标揭示性别差异。

Comments Paper Accepted to IEEE CAI Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10850 2026-05-12 cs.CV 50%

Verification Mirage: Mapping the Reliability Boundary of Self-Verification in Medical VQA

验证幻象:映射医学视觉问答中自我验证的可靠性边界

Ruinan Jin, Beidi Zhao, Myeongkyun Kang, Qiong Zhang, Xiaoxiao Li

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Redmin University of China(红矿大学)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文研究了医学视觉问答中自我验证的可靠性边界,通过分解验证行为中的辨别能力和同意偏差,发现验证幻象现象,指出任务条件对可靠性有显著影响,且验证无法独立提供安全信号。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08799 2026-05-12 cs.RO 50%

ElasticFlow: One-Step Physics-Consistent Policy with Elastic Time Horizons for Language-Guided Manipulation

ElasticFlow: 语言引导操作中的弹性时间 horizon 的一步物理一致策略

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究所) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆校区) Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(芬兰奥卢大学信息科技与电气工程学院)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 ElasticFlow通过弹性时间 horizon 机制和直接建模平均速度场,实现高效的一步映射,提升语言引导操作的物理一致性和效率。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 36 篇

2512.18880 2026-05-12 cs.CL cs.AI cs.CY 82%

Can LLMs Estimate Student Struggles? Human-AI Difficulty Alignment with Proficiency Simulation for Item Difficulty Prediction

LLMs能否估计学生困难?人类-人工智能难度对齐用于项目难度预测的 proficiency 模拟

Ming Li, Han Chen, Yunze Xiao, Jian Chen, Hong Jiao, Tianyi Zhou

机构 * University of Maryland(马里兰大学) Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学) MBZUAI

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文研究了LLMs在估计学生困难方面的表现,发现模型规模扩大并不总能提高准确性,且模型倾向于形成机器共识而非与人类对齐,揭示了当前模型在自动难度预测中的挑战。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09861 2026-05-12 cs.LG cs.AI 81%

Flag Varieties: A Geometric Framework for Deep Network Alignment

旗种:深度网络对齐的几何框架

Jingchuan Xiao, Xinyi Sui, Cihan Ruan

机构 * Department of Mathematics and Computer Studies, Mary Immaculate College, Ireland(爱尔兰玛丽伊曼纽尔学院数学与计算机研究系) Department of Computer Science and Engineering, Santa Clara University, USA(美国圣克拉拉大学计算机科学与工程系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于几何不变量理论的旗种结构,揭示深度网络层间对齐的几何本质,阐明子空间交集维度为唯一不变量,并通过实验验证其在多层感知机、残差网络和预训练语言模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09184 2026-05-12 cs.AI cs.CL cs.DB 81%

Open Ontologies: Tool-Augmented Ontology Engineering with Stable Matching Alignment

开放本体:基于稳定匹配对齐的工具增强本体工程

Fabio Rovai

机构 * The Tesseract Academy, London, United Kingdom(泰斯拉学院,伦敦,英国)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Open Ontologies系统,结合LLM驱动构建与形式OWL推理及本体对齐,发现稳定1对1匹配是本体对齐质量关键,且工具增强访问优于纯LLM解析。

Comments 10 pages, 6 tables. Code: https://github.com/fabio-rovai/open-ontologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08902 2026-05-12 cs.CV cs.AI 79%

DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models

DAPE:动态非均匀对齐与渐进细节增强技术以提升高效视觉语言模型的性能

Mengyuan Tian, Qiyan Zhao, Yanan Wang, Da-Han Wang

机构 * The Wang Yanan Institute for Studies in Economics, Xiamen University, Xiamen 361005, China(厦门大学王文安经济研究所) Fujian Key Laboratory of Pattern Recognition and Image Understanding, School of Computer and Information Engineering, Xiamen University of Technology, Xiamen 361024, China(福建pattern识别与图像理解重点实验室,厦门理工大学计算机与信息工程学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出DAPE框架,通过动态跨模态对齐和连续细节引入技术,提升高效视觉语言模型的性能,减少计算开销并提升下游任务准确性。

Comments Accepted in ICIC 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10712 2026-05-12 cs.SE cs.CR 78%

AutoSOUP: Safety-Oriented Unit Proof Generation for Component-level Memory-Safety Verification

AutoSOUP:面向组件级内存安全验证的安全导向单元证明

Paschal C. Amusuo, Ricardo Calvo, Dharun Anandayuvaraj, Taylor Le Lievre, Kevin Kolyakov, Elijah Jorgensen, Aravind Machiry, James C. Davis

专题命中 其他安全 :safety(title,abstract)

AI总结 AutoSOUP通过安全导向单元证明自动化组件级内存安全验证,结合确定性程序合成与LLM,生成可验证的证明以提高内存安全验证的自动化水平。

Comments 13 main pages, 7 appendix pages, 2 figures, 5 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08874 2026-05-12 cs.CV 78%

Semantic Alignment in Hyperbolic Space for Open-Vocabulary Semantic Segmentation

超几何空间中的语义对齐用于开放词汇语义分割

Hoang M. Truong, Hai Nguyen-Truong, Dang Huynh

机构 * Fulbright University Vietnam(富布赖特大学越南分校)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出HyRo框架,通过解耦超几何空间中的层次和语义对齐,提升开放词汇语义分割性能。

Comments Accepted to the PVUW Workshop at CVPR 2026. Project page: https://tmhoanggg.github.io/HyRo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20164 2026-05-12 cs.LG cs.AI cs.CL 75%

What's the plan? Metrics for implicit planning in LLMs and their application to rhyme generation and question answering

计划是什么?LLMs中隐式规划的度量及其在押韵生成和问答中的应用

Jim Maar, Denis Paperno, Callum Stuart McDougall, Neel Nanda

机构 * HPI / University of Potsdam(HPI/波茨坦大学) Utrecht University(乌特勒支大学) Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出简单方法评估LLM隐式规划,通过押韵生成和问答案例展示其可扩展性,发现隐式规划在1B参数模型中普遍存在,为AI安全提供新视角。

Comments 41 pages, 34 figures, Accepted at ICLR 2026, Code available at https://github.com/Jim-Maar/implicit-planning-in-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10142 2026-05-12 cs.CV cs.AI 70%

Scaling Vision Models Does Not Consistently Improve Localisation-Based Explanation Quality

扩大视觉模型并不一致地提高基于定位的解释质量

Mateusz Cedro, Marcin Chlebus

机构 * University of Warsaw(华沙大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了扩大视觉模型对基于定位的解释质量的影响,发现模型深度和参数数量增加并不总能提升解释质量,小模型表现可能更优。

Comments 28 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09314 2026-05-12 cs.AI 70%

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

大语言模型如何被说服:几个被重定向的注意力头

Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Skywork AI

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究揭示大语言模型在被说服时,少量中间层注意力头决定答案,通过重定向注意力产生事实性错误,该机制在开源LLM和现实攻击场景中均有效。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08409 2026-05-12 cs.AI 70%

Playing games with knowledge: AI-Induced delusions need game theoretic interventions

用知识玩游戏:AI 引发的幻觉需要博弈论干预

Will Beaumaster, Paul Schrater

机构 * University of Minnesota(明尼苏达大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文探讨了对话AI在知识接口中的根本缺陷,提出通过博弈论干预解决AI引发的幻觉问题,引入认知摩擦机制和信念版本化系统以实现信息环境设计的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10934 2026-05-12 cs.LG cs.AI cs.CV cs.RO stat.ML 62%

Variational Inference for Lévy Process-Driven SDEs via Neural Tilting

通过神经倾斜进行莱维过程驱动的随机微分方程的变分推断

Yaman Kindap, Manfred Opper, Benjamin Dupuis, Umut Simsekli, Tolga Birdal

机构 * Imperial College London, UK(伦敦帝国学院) Technical University of Berlin, Germany(柏林技术大学) INRIA, CNRS, Département d’Informatique de l’Ecole Normale Supérieure / PSL, France(法国国家信息与自动化研究所(INRIA)、国家科学研究中心(CNRS)、巴黎社会科学高等师范学院信息学系/巴黎社会科学高等师范学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经指数倾斜框架,用于莱维驱动SDEs的变分推断,通过神经网络重新加权莱维测度,保留跳跃结构并实现计算可行性,结合二次神经参数化、条件高斯表示和对称感知蒙特卡洛估计器,提升推断效率与可靠性。

Comments The associated project page which contains the official implementation can be found in https://circle-group.github.io/research/NeuralTilting/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10659 2026-05-12 cs.CL cs.AI cs.SI stat.ML 62%

When Can Digital Personas Reliably Approximate Human Survey Findings?

数字人设何时能可靠近似人类调查结果?

Mumin Jia, Yilin Chen, Divya Sharma, Jairo Diaz-Rodriguez

机构 * Department of Mathematics and Statistics(数学与统计学系) York University(约克大学) University Health Network(大学健康网络)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究通过LISS面板评估数字人设在不同架构和任务下的表现,发现其在稳定属性领域表现较好,但个体预测和多变量结构恢复能力有限,检索增强架构效果更依赖人类响应结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10025 2026-05-12 cs.CL cs.AI 62%

Medical Incident Causal Factors and Preventive Measures Generation Using Tag-based Example Selection in Few-shot Learning

基于标签的示例选择在少样本学习中生成医疗事件因果因素和预防措施

Yuna Haseyama, Tomoki Ito, Hiroki Sakaji, Itsuki Noda

机构 * Graduate School of Information Science(信息科学研究生院) Technology Hokkaido University Hokkaido, Japan(技术 Hokkaido 大学 Hokkaido, Japan) National Institute of Information(信息国家研究所) Faculty of Information Science(信息科学学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于标签的少样本学习方法,利用日本医疗事件数据集,通过对比随机采样、相似度选择和标签方法,验证标签选择能提高生成精度和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09969 2026-05-12 cs.LG cs.CL 62%

The Truth Lies Somewhere in the Middle (of the Generated Tokens)

生成标记中的真相位于中间

Sophie L. Wang, Phillip Isola, Brian Cheung

机构 * MIT(麻省理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了如何将自回归生成的隐藏状态汇总为反映语言模型内部状态的表示。通过核对齐发现,对生成标记的均池化比单个标记更有效,且生成标记的表示优于提示标记。

详情

展开后加载摘要…

URL PDF HTML 收藏