arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 7971 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7971 篇

2604.02459 2026-04-06 cs.LG cs.AI cs.CL 67%

On the Geometric Structure of Layer Updates in Deep Language Models

深度语言模型中层更新的几何结构研究

Jun-Sik Yoo

机构 * Institute of Basic Science, Korea University(韩国大学基础科学研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究深度语言模型中层更新的几何结构,发现层更新可分解为主导的tokenwise组件和一个几何上不同的残差部分,残差对输出扰动有显著影响。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29593 2026-04-01 physics.soc-ph q-fin.CP 67%

Be Water: An Evolutionary Proof for Trend-Following

顺势而为:一种进化证明的跟风策略

Yijia Chen

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文通过构建大规模基于代理的模型,探讨了金融市场中跟风策略的进化可行性,发现顺应市场趋势的策略比逆势策略更具生存优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27356 2026-03-31 cs.CL cs.AI cs.CY 67%

Culturally Adaptive Explainable LLM Assessment for Multilingual Information Disorder: A Human-in-the-Loop Approach

文化适应性可解释LLM评估用于多语言信息紊乱:一种人机协作方法

Maziar Kianimoghadam Jouneghani

机构 * University of Turin(都灵大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出一种人机协作框架,通过本地语言标注者生成的解释性理由,评估LLM在多语言信息紊乱中的表现,提升模型的文化适应性和可解释性。

Comments 9 pages, 3 figures, 1 table. Accepted to the Information Disorder Workshop at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19574 2026-03-23 cs.HC cs.AI cs.CL cs.CY cs.SI 67%

AI Psychosis: Does Conversational AI Amplify Delusion-Related Language?

AI精神病:对话AI是否会放大妄想相关语言?

Soorya Ram Shimgekar, Vipin Gunda, Jiwon Kim, Violeta J. Rodriguez, Hari Sundaram, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨对话AI对妄想相关语言的影响,通过模拟用户和三种模型家族分析妄想语言的变化,发现高妄想用户对话中妄想得分持续上升,而AI响应可有效降低此趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14664 2026-03-17 cs.AI cs.CL cs.CY 67%

Punctuated Equilibria in Artificial Intelligence: The Institutional Scaling Law and the Speciation of Sovereign AI

人工智能中的突变平衡:制度扩展定律与主权人工智能的物种分化

Mark Baciak, Thomas A. Cellucci, Deanna M. Falkowski

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文挑战人工智能发展连续进步的假设,提出基于生物进化突变平衡理论,揭示AI发展通过停滞期与快速转型交替的非单调模式,提出制度扩展定律及主权AI的物种分化概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08448 2026-03-17 cs.HC cs.AI cs.CL cs.LG 67%

A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic

前瞻性临床可行性研究:一种对话式诊断AI在门诊初级保健诊所中的应用

Peter Brodeur, Jacob M. Koshy, Anil Palepu, Khaled Saab, Ava Homiar, Roma Ruparel, Charles Wu, Ryutaro Tanno, Joseph Xu, Amy Wang, David Stutz, Wei-Hung Weng, Hannah M. Ferrera, David Barrett, Lindsey Crowley, Jihyeon Lee, Spencer E. Rittner, Ellery Wulczyn, Selena K. Zhang, Elahe Vedadi, Christine G. Kohn, Kavita Kulkarni, Vinay Kadiyala, Sara Mahdavi, Wendy Du, Jessica M. Williams, David Feinbloom, Renee Wong, Tao Tu, Petar Sirkovic, Alessio Orlandi, Christopher Semturs, Yun Liu, Juraj Gottweis, Dale R. Webster, Joëlle Barral, Katherine Chou, Pushmeet Kohli, Avinatan Hassidim, Yossi Matias, James Manyika, Rob Fields, Jonathan X. Li, Marc L. Cohen, Vivek Natarajan, Mike Schaekermann, Alan Karthikesalingam, Adam Rodman

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了基于大语言模型的对话式AI在真实临床环境中的可行性,评估了其安全性、质量和临床推理能力,并展示了AI在初级保健中的初步应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13884 2026-03-17 cs.CV 67%

SCoCCA: Multi-modal Sparse Concept Decomposition via Canonical Correlation Analysis

SCoCCA: 通过典型相关分析进行多模态稀疏概念分解

Ehud Gordon, Meir Yossef Levi, Guy Gilboa

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文提出SCoCCA,通过典型相关分析实现多模态稀疏概念分解,提升跨模态对齐与可解释性,实现概念发现的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09894 2026-03-17 cs.AI cs.CY cs.LG 67%

Beyond AlphaEarth: Toward Human-Centered Geospatial Foundation Models via POI-Guided Contrastive Learning

超越AlphaEarth:通过POI引导对比学习实现以人为中心的地理空间基础模型

Junyuan Liu, Quan Qin, Guangsheng Dong, Xinglei Wang, Jiazhuang Feng, Zichao Zeng, Tao Cheng

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出AETHER框架,通过POI引导的多模态对齐,将AlphaEarth与以人为中心的城市分析结合,提升地理空间表示的可解释性与语言可访问性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09987 2026-03-12 cs.CL cs.AI cs.LG 67%

Evolving Demonstration Optimization for Chain-of-Thought Feature Transformation

链式推理特征转换的进化演示优化

Xinyuan Wang, Kunpeng Liu, Arun Vignesh Malarkkan, Yanjie Fu

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种通过进化轨迹经验优化LLM驱动的特征转换方法,提升转换多样性与下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07329 2026-03-10 cs.AI cs.CL cs.CY 67%

The Third Ambition: Artificial Intelligence and the Science of Human Behavior

第三项雄心:人工智能与人类行为的科学

W. Russell Neuman, Chad Coleman

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出利用大型语言模型作为研究人类行为、文化及道德推理的科学工具,探讨其在社会科学中的应用与方法论创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06495 2026-03-09 cs.LG cs.AI cs.CL 67%

COLD-Steer: Steering Large Language Models via In-Context One-step Learning Dynamics

COLD-Steer: 通过上下文一步学习动态引导大型语言模型

Kartik Sharma, Rakshit S. Trivedi

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 COLD-Steer通过近似学习动态实现无需训练的LLM引导,有效提升引导效果并减少样本需求。

Comments ICLR 2026. Code available at https://github.com/Ksartik/cold-steer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23136 2026-03-09 cs.CL cs.AI cs.LG 67%

Modality Collapse as Mismatched Decoding: Information-Theoretic Limits of Multimodal LLMs

模态崩溃作为不匹配解码:多模态大语言模型的信息论限制

Jayadev Billa

机构 * Yahoo(雅虎) Nuance BBN

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示多模态大语言模型中模态崩溃现象的信息论限制,指出解码器评分规则决定了可访问信息量,通过LoRA干预验证了训练目标对情绪检测性能的提升作用。

Comments 24 pages, 11 tables, 2 figures. Code: https://github.com/jb1999/modality_collapse_paper, submitted for review COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06225 2026-03-09 cs.CY cs.AI cs.CL 67%

Classroom AI: Large Language Models as Grade-Specific Teachers

教室AI:大型语言模型作为按年级教师

Jio Oh, Steven Euijong Whang, James Evans, Jindong Wang

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) University of Chicago(芝加哥大学) William & Mary(威廉与玛丽学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究提出一种框架,通过微调大型语言模型生成适合不同年级学生的教育内容,显著提升年级匹配度,同时保持响应准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02888 2026-03-05 cs.LG cs.AI cs.CL 67%

When Your Own Output Becomes Your Training Data: Noise-to-Meaning Loops and a Formal RSI Trigger

当你的输出成为你的训练数据:噪声到意义的循环及形式RSI触发

Rintaro Ando

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出N2M-RSI模型,展示AI代理通过自反馈和信息整合阈值可无限增加内部复杂性,并探讨了代理群交互的超线性效应。

Comments Withdrawn due to a critical error discovered in the mathematical derivation and proof of Theorem 2 (Unbounded Growth) and related Lemma 2 (Compression gain lower bound). This flaw invalidates the paper's main conclusion that N2M-RSI guarantees unbounded growth, requiring a fundamental revision of the theoretical framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02532 2026-03-04 cs.CV 67%

EIMC: Efficient Instance-aware Multi-modal Collaborative Perception

EIMC: 高效实例感知多模态协作感知

Kang Yang, Peng Wang, Lantao Li, Tianci Bu, Chen Sun, Deying Li, Yongcai Wang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Sony Research and Development Center China(索尼(中国)研发有限公司) National University of Defense Technology(国防科技大学)

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 EIMC通过实例感知的多模态协作感知方法,提升自动驾驶安全性,减少带宽使用,实现高效且准确的3D感知。

Comments 9 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21722 2026-03-03 cs.CL cs.AI cs.CY 67%

German General Social Survey Personas: A Survey-Derived Persona Prompt Collection for Population-Aligned LLM Studies

德国通用社会调查人设:一种基于德国通用社会调查的人员提示集合,用于与人口一致的LLM研究

Jens Rupprecht, Leon Fröhling, Claudia Wagner, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS -- Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) RWTH Aachen University(亚琛工业大学) Complexity Science Hub(复杂性科学中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出德国通用社会调查人设集合,用于构建与人口一致的LLM研究,通过实验证明其在模拟调查响应方面的有效性。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04067 2026-03-03 cs.LG cs.AI cs.CL 67%

What Scales in Cross-Entropy Scaling Law?

交叉熵缩放定律中什么因素具有可扩展性?

Junxi Yan, Zixi Wei, Qingyao Ai, Yiqun Liu, Jingtao Zhan

机构 * Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分解交叉熵为误差熵、自我对齐和置信度三个部分,揭示了误差熵是唯一遵循幂律缩放的因素,从而解释了交叉熵缩放定律在小规模有效但在大尺度失效的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03594 2026-02-26 cs.CV 67%

TIPS Over Tricks: Simple Prompts for Effective Zero-shot Anomaly Detection

TIPS Over Tricks: 简单提示用于有效的零样本异常检测

Alireza Salehi, Ehsan Karami, Sepehr Noey, Sahand Noey, Makoto Yamada, Reshad Hosseini, Mohammad Sabokrou

机构 * University of Tehran(塔里哈大学) Amirkabir University of Technology(阿米尔卡比尔技术大学) Okinawa Institute of Science and Technology(冲绳科学技术大学院)

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文提出TIPS模型,通过改进的backbone和解耦提示策略,在无需复杂模块的情况下提升零样本异常检测的图像和像素级性能。

Comments This is the extended version of the paper accepted in ICASSP'26, which will be publicly available in May. Authors' contributions may vary among the versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21231 2026-02-26 cs.LG cs.AI cs.CL 67%

ACAR: Adaptive Complexity Routing for Multi-Model Ensembles with Auditable Decision Traces

ACAR:适应复杂度的多模型集合路由

Ramchand Kumaresan

机构 * Ramchand Kumaresan(独立研究者)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ACAR是一种用于多模型集合的可审计路由框架,通过自一致性方差实现任务路由,提升准确率并避免过度融合,同时揭示归因计算的挑战。

Comments 12 pages, 9 figures. Measurement framework for adaptive multi-model routing with auditable execution traces

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18777 2026-02-25 cs.AI cs.CL cs.LG 67%

Programming by Backprop: An Instruction is Worth 100 Examples When Finetuning LLMs

通过反向传播编程:在微调LLMs时,一条指令的价值相当于100个示例

Jonathan Cook, Silvia Sapora, Arash Ahmadian, Akbir Khan, Tim Rocktaschel, Jakob Foerster, Laura Ruis

机构 * FLAIR, University of Oxford(FLAIR,牛津大学) Cohere & Cohere Labs(Cohere及Cohere实验室) Anthropic UCL AI Centre(UCL人工智能中心) MIT(麻省理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过反向传播编程(PBB)使LLMs能从声明性指令中学习程序性知识,提升训练效率并减少对大量示例的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07238 2026-02-23 cs.CL cs.AI cs.LG 67%

Beyond Mimicry to Contextual Guidance: Knowledge Distillation for Interactive AI

超越模仿到情境引导:面向交互AI的知识蒸馏

Tong Wang, K. Sudhir

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于情境引导的知识蒸馏方法,通过构建可重用的战略文本引导库,提升交互AI在客户服务中的服务质量与客户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09201 2026-02-20 cs.LG cs.AI cs.CL 67%

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

多模态提示优化:为何不利用多种模态为大语言模型服务

Yumin Choi, Dongki Kim, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多模态提示优化问题,提出MPO框架,通过联合优化和贝叶斯策略提升多模态提示效果,验证其在图像、视频等多模态任务中的优越性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00004 2026-02-16 cs.AI cs.CL cs.LG 67%

Finetuning Large Language Models for Automated Depression Screening in Nigerian Pidgin English: GENSCORE Pilot Study

基于大型语言模型的尼日利亚皮钦英语自动化抑郁症筛查:GENSCORE试点研究

Isaac Iyinoluwa Olufadewa, Miracle Ayomikun Adesina, Ezekiel Ayodeji Oladejo, Uthman Babatunde Usman, Owen Kolade Adeniyi, Matthew Tolulope Olawoyin

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究利用微调的大型语言模型,针对尼日利亚皮钦英语开发自动化抑郁症筛查工具,GPT-4.1在准确率和文化适应性上表现最佳,为资源受限地区心理健康应用提供基础。

Comments 10 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11924 2026-02-12 cs.CL cs.AI cs.LG 67%

Intrinsic Self-Correction in LLMs: Towards Explainable Prompting via Mechanistic Interpretability

大语言模型中的内在自我修正:通过机制可解释性实现可解释的提示

Yu-Ting Lee, Fu-Chieh Chang, Yu-En Shu, Hui-Ying Shih, Pei-Yuan Wu

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taipei, Taiwan(通讯工程研究院,国立台湾大学) MediaTek Research, Taipei, Taiwan(联发科研究,台北,台湾) Department of Electrical Engineering, National Taiwan University, Taipei, Taiwan(电气工程系,国立台湾大学) Department of Electrical Engineering, National Tsing Hua University, Hsinchu, Taiwan(电气工程系,国立清华大学) AI Research Center (AINTU), National Taiwan University, Taipei, Taiwan(人工智能研究中心(AINTU),国立台湾大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过机制可解释性揭示大语言模型中内在自我修正的机制,证明提示引导隐藏表示偏移是其核心驱动因素。

Journal ref 4th Deployable AI Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07547 2026-02-10 q-bio.NC cs.AI cs.CL cs.LG 67%

Linguistic properties and model scale in brain encoding: from small to compressed language models

语言属性与模型规模在脑编码中的作用:从小型到压缩语言模型

Subba Reddy Oota, Vijay Rowtula, Satya Sai Srinath Namburi, Khushbu Pahwa, Anant Khandelwal, Manish Gupta, Tanmoy Chakraborty, Bapi S. Raju

机构 * TU Berlin(柏林技术大学) IIIT-Hyderabad(海得拉巴理工学院) GE HealthCare(通用电气医疗) AWS AI Labs, Amazon(亚马逊AI实验室) Microsoft Research, Bangalore, India(微软研究院,班加罗尔,印度) Microsoft, Hyderabad, India(微软,海得拉巴,印度) IIT Delhi(德里理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现小型语言模型在脑一致性上可与大模型媲美,压缩不影响脑可预测性,挑战了神经扩展的常见假设。

Comments 40 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07276 2026-02-10 cs.AI cs.CL cs.LG 67%

Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs

Steer2Adapt:动态组合转向向量引发LLM高效适应

Pengrui Han, Xueqiang Xu, Keyang Xuan, Peiyang Song, Siru Ouyang, Runchu Tian, Yuqing Jiang, Cheng Qian, Pengcheng Jiang, Jiashuo Sun, Junxia Cui, Ming Zhong, Ge Liu, Jiawei Han, Jiaxuan You

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STEER2ADAPT通过动态组合转向向量实现LLM高效适应,适用于需要多协调能力的复杂任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20741 2026-02-06 cs.HC cs.AI cs.CY cs.LG 67%

In defence of post-hoc explanations in medical AI

为医疗AI中的事后解释辩护

Joshua Hatherley, Lauritz Munch, Jens Christian Bjerring

机构 * Center for the Philosophy of AI(哲学人工智能中心) University of Copenhagen(哥本哈根大学) Department of Philosophy and History of Ideas(哲学与思想史系) Aarhus University(奥胡斯大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文为医疗AI中的事后解释辩护,指出其虽无法完全复制黑盒推理过程,但能提升用户理解、提高临床团队准确性并辅助医生决策。

Journal ref 2026. Hastings Center Report 56(1): 40-46

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03849 2026-02-05 cs.HC cs.AI cs.CL cs.LG 67%

HybridQuestion: Human-AI Collaboration for Identifying High-Impact Research Questions

HybridQuestion: 人机协作识别高影响力研究问题

Keyu Zhao, Fengli Xu, Yong Li, Tie-Yan Liu

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、北京理工大学、清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HybridQuestion通过人机协作识别高影响力研究问题,利用AI处理数据与人类判断结合,验证了在科学突破和未来问题预测中的有效性。

Comments 16 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21436 2026-02-05 cs.LG cs.AI cs.CL cs.CV 67%

From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning

从一致性到互补性:面向时间序列理解和推理的对齐与解缠多模态学习

Hang Ni, Weijia Zhang, Fei Wang, Zezhi Shao, Hao Liu

机构 * The Hong Kong University of Science(香港科学与技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MADI通过细粒度对齐和解缠交互提升多模态时间序列理解和推理能力,实现更精确的数值-视觉模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11367 2026-02-03 cs.LG cs.AI cs.CL 67%

Sparse Autoencoder Features for Classifications and Transferability

稀疏自编码器特征用于分类和可迁移性

Jack Gallifant, Shan Chen, Kuleen Sasse, Hugo Aerts, Thomas Hartvigsen, Danielle S. Bitterman

机构 * Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) Johns Hopkins University(约翰霍普金斯大学) Maastricht University(马斯特里赫特大学) University of Virginia(弗吉尼亚大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用稀疏自编码器提取LLM特征,通过优化架构和二进制化策略提升分类性能和跨模型迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏