arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 58 篇

2502.00816 2026-05-12 cs.LG 79%

Sundial: A Family of Highly Capable Time Series Foundation Models

Sundial:一个高能力时间序列基础模型家族

Yong Liu, Guo Qin, Zhiyuan Shi, Zhi Chen, Caiyin Yang, Xiangdong Huang, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院,BNRist,清华大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 Sundial提出基于流匹配的TimeFlow损失,实现无需离散化的时间序列Transformer预训练,生成多可能预测,提升表示学习灵活性,并在时间序列基础模型中取得前所未有的模型容量和泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08241 2026-05-12 cs.CV cs.AI 79%

TinySSL: Distilled Self-Supervised Pretraining for Sub-Megabyte MCU Models

TinySSL:用于子兆字节MCU模型的蒸馏自监督预训练

Bibin Wilson

机构 * Bibin Wilson

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出CA-DSSL框架,通过蒸馏和自监督学习在子兆字节MCU模型上实现高效表示学习,达到优于SimCLR-Tiny的性能,且参数更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03639 2026-05-12 cs.CV 78%

Diffusion Masked Pretraining for Dynamic Point Cloud

动态点云的扩散掩码预训练

Zhuoyue Zhang, Jihua Zhu, Chaowei Fang, Jian Liu, Ajmal Saeed Mian

机构 * Xi’an Jiaotong University(西安交通大学) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) University of Western Australia(西澳大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出DiMP框架,通过引入扩散建模解决动态点云预训练中位置泄露和运动监督问题,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09189 2026-05-12 cs.LG 77%

Practical Scaling Laws: Converting Compute into Performance in a Data-Constrained World

实用的扩展定律:在数据受限的世界中将计算转化为性能

Christopher M. Bryant, Hao Liu

机构 * Arena Physica

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种新的扩展定律公式,用于在数据受限条件下更准确地预测模型性能,通过分解损失为欠容量、欠训练和过拟合项,改进了传统扩展定律的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10616 2026-05-12 cs.LG cs.CL cs.CV 73%

MulTaBench: Benchmarking Multimodal Tabular Learning with Text and Image

MulTaBench: 基于文本和图像的多模态表格学习基准测试

Alan Arazi, Eilam Shapira, Shoham Grunblat, Mor Ventura, Elad Hoffer, Gioia Blayer, David Holzmüller, Lennart Purucker, Gaël Varoquaux, Frank Hutter, Roi Reichart

机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) Prior Labs(Prior实验室) NVIDIA SODA Team, INRIA Saclay, Palaiseau(SODA团队,INRIA萨克莱,帕莱索) University of Freiburg(弗赖堡大学) Probabl ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 MulTaBench通过40个数据集评估多模态表格学习,强调任务特定的表示学习,展示目标感知表示在文本和图像模态中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05064 2026-05-12 cs.LG cs.AI 73%

Dynamic Linear Coregionalization for Realistic Synthetic Multivariate Time Series

动态线性共区域化用于真实合成多变量时间序列

Annita Vapsi, Penghang Liu, Saheed Obitayo, Aakriti, Manoj Cherukumalli, Prathamesh Patil, Amit Varshney, Nicolas Marchesotti, Elizabeth Fons, Vamsi K. Potluru, Manuela Veloso

机构 * JPMorganChase(摩根大通)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DynLMC模型,通过引入时变和制度切换相关性及跨通道滞后结构,生成与真实数据相似的多变量时间序列,提升FMTS的迁移能力。

Comments ICLR 2026 Workshop on Time Series in the Age of Large Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09737 2026-05-12 cs.LG 70%

CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring

CALYREX:跨注意力层扩展变换器用于系统提示锚定

Li Lixing

机构 * Cornell University(康奈尔大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。

Comments Preprint. 25 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15529 2026-05-12 cs.AI 70%

LACE: Lattice Attention for Cross-thread Exploration

LACE:用于跨线探索的晶格注意力

Yang Li, Zirui Zhang, Yang Liu, Chengzhi Mao

机构 * Amazon AGI Labs(亚马逊人工通用智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LACE通过引入跨线注意力机制,使大语言模型在推理过程中实现协同合作,提升推理准确性达7个百分点。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09126 2026-05-12 cs.LG 70%

Cosine-Gated Adam-Decay: Drop-In Staleness-Aware Outer Optimization for Decoupled DiLoCo

余弦门控Adam衰减:一种用于解耦DiLoCo的掉入式滞后期感知外优化

Vatsal Shah, Jiahao Sun

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出CGAD,一种基于余弦门控的Adam衰减算法,通过衰减因子和余弦门控机制提升异步DiLoCo系统的稳定性,实验证明其在不同规模模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08383 2026-05-12 cs.CL 70%

Change My View? The Dynamics of Persuasion and Polarization in Online Discourse

改变观点?在线讨论中说服与极化的动态

David Freeborn, Malihe Alikani, Anthony Sicilia

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过分析Reddit的ChangeMyView讨论,探讨说服与极化动态,发现让步与共情策略促进观点改变,而直接反驳等策略则抑制观点改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08299 2026-05-12 cs.SE cs.AI 70%

Do not copy and paste! Rewriting strategies for code retrieval

不要复制粘贴!代码检索的重写策略

Andrea Gurioli, Federico Pennino, Maurizio Gabbrielli

机构 * DISI University of Bologna(博洛尼亚大学DISI学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了三种重写策略在不同检索场景下的效果,发现全自然语言重写在在线检索中表现最佳,但离线检索效果下降明显,提出Delta H作为评估重写收益的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09594 2026-05-12 cs.CR 67%

Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills

相信我,导入这个:通过恶意代理技能进行依赖引导攻击

Yiyong Liu, Chia-Yi Hsu, Chun-Ying Huang, Michael Backes, Rui Wen, Chia-Mu Yu

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 研究提出依赖引导攻击,通过恶意技能引导编码代理生成恶意包,无需修改模型或数据,展示出软件供应链中的新攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19914 2026-05-12 cs.CL cs.AI cs.SE 62%

Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments

在无状态执行环境中模拟复杂多轮工具调用交互

Maxwell Crouse, Ibrahim Abdelaziz, Kshitij Fadnis, Siva Sankalp Patel, Kinjal Basu, Chulaka Gunasekara, Sadhana Kumaravel, Asim Munawar, Pavan Kapanipathi

机构 * IBM Research AI(IBM人工智能研究院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DiGiT-TC方法,用于生成无状态环境下多轮工具调用对话,通过新颖的生成模式隐式表示工具调用,验证了在有状态问题设置中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09991 2026-05-12 cs.AI cs.LG math.OC 62%

Optimizer-Induced Mode Connectivity: From AdamW to Muon

优化器诱导的模式连接:从AdamW到Muon

Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了优化器对模式连接的影响,发现不同优化器在不同宽度下形成连通集,并揭示了优化器依赖的结构特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03928 2026-05-12 cs.LG cs.AI cs.CV stat.ML 62%

Supervised Dimensionality Reduction Revisited: Why LDA on Frozen CNN Features Deserves a Second Look

监督降维再审视:为何在冻结的CNN特征上使用LDA值得再次审视

Indar Kumar, Girish Karhana, Sai Krishna Jasti, Ankit Hemant Lade

机构 * independent researchers(独立研究人员)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文重新审视了在冻结特征上使用LDA进行监督降维的有效性,发现其在粗粒度任务中提升准确率,但在细粒度任务中表现不佳,揭示了LDA在不同任务场景下的适用边界。

Comments 11 pages, 5 figures, 5 tables. Code available at https://github.com/IndarKarhana/lda-image-classification

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12635 2026-05-12 cs.CL cs.AI 62%

Positional Encoding via Token-Aware Phase Attention

基于令牌感知的相注意力的位置编码

Yu Wang, Sheng Shen, Rémi Munos, Hongyuan Zhan, Yuandong Tian

机构 * Meta

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Token-Aware Phase Attention,通过可学习的相函数改进注意力机制,实现长距离token交互,支持更长上下文的持续预训练,并在长上下文场景下取得更低的困惑度和更强的检索性能。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08988 2026-05-12 cs.LG cs.AI cs.CE 62%

Benchmarking Compositional Generalisation for Machine Learning Interatomic Potentials

分子机器学习势函数的组成泛化基准测试

Amir Masoud Nourollah, Irtaza Khalid, Stefano Leoni, Steven Schockaert

机构 * Cardiff University(卡迪夫大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出四个任务评估分子学习势函数的组成泛化能力,发现最先进模型在面对新分子时表现显著下降,误差比分布内例子高一个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10590 2026-05-12 stat.ML cs.LG 57%

Amortizing Causal Sensitivity Analysis via Prior Data-Fitted Networks

通过先验数据拟合网络进行因果敏感性分析的 amortization

Emil Javurek, Dennis Frauen, Marie Brockschmidt, Jonas Schweisthal, Stefan Feuerriegel

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本文提出基于先验数据拟合网络的因果敏感性分析方法,通过上下文学习实现高效计算,解决传统方法需重新计算的问题,实验证明其在多个数据集和敏感性水平上显著提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10551 2026-05-12 cs.LG 57%

It's All Connected: Topology-Aware Structural Graph Encoding Improves Performance on Polymer Prediction

万物相连:拓扑感知的结构图编码提升聚合物预测性能

H. Ibrahim Erdogan, Punith Raviswamy, Nikita Agrawal, Yannik Köster, Stefan Zechel, Ulrich S. Schubert, Ruben Mayer, Christopher Kuenneth

机构 * Faculty of Engineering Science, University of Bayreuth, Germany(拜罗伊特大学工程科学学院) Faculty of Mathematics, Physics & Computer Science, University of Bayreuth, Germany(拜罗伊特大学数学、物理与计算机科学学院) Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena, Germany(耶拿弗里德里希·施莱尔大学有机与大分子化学实验室) Jena Center for Soft Matter (JCSM), Friedrich Schiller University Jena, Germany(耶拿软物质中心(JCSM)) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena), Germany(耶拿聚合物能源应用研究所(HIPOLE 耶拿)) Helmholtz Zentrum Berlin für Materialien und Energie GmbH (HZB), Germany(柏林材料与能源研究中心(HZB))

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种拓扑感知的结构图编码方法,通过构建大图和预训练提升聚合物预测性能,实验显示联合使用图构建和自监督预训练可显著降低误差。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10142 2026-05-12 cs.CV cs.AI 57%

Scaling Vision Models Does Not Consistently Improve Localisation-Based Explanation Quality

扩大视觉模型并不一致地提高基于定位的解释质量

Mateusz Cedro, Marcin Chlebus

机构 * University of Warsaw(华沙大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文研究了扩大视觉模型对基于定位的解释质量的影响,发现模型深度和参数数量增加并不总能提升解释质量,小模型表现可能更优。

Comments 28 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07940 2026-05-12 cs.AI 57%

MePo: Meta Post-Refinement for Rehearsal-Free General Continual Learning

MePo:无回放的通用持续学习的元后细化

Guanglong Sun, Hongwei Yan, Liyuan Wang, Zhiqi Kang, Shuang Cui, Hang Su, Jun Zhu, Yi Zhong

机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(生命科学学院,IDG/麦克戈维脑研究 institute,清华大学,北京,中国) Tsinghua-Peking Center for Life Sciences(清华-北京大学生命科学中心) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究所,清华-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,中国) Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国) Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, Grenoble, France(格勒诺布尔阿尔卑斯大学,Inria,CNRS,格勒诺布尔INP,LJK,格勒诺布尔,法国) Institute of Software Chinese Academy of Sciences, Beijing, China(软件研究所,中国科学院,北京,中国)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 MePo通过构建伪任务序列和双层元学习框架,提升预训练模型在无回放条件下的通用持续学习性能,显著提升多个基准测试的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03606 2026-05-12 cs.AI 57%

BioBLP: A Modular Framework for Learning on Multimodal Biomedical Knowledge Graphs

BioBLP: 一个用于多模态生物医学知识图谱学习的模块化框架

Daniel Daza, Dimitrios Alivanistos, Payal Mitra, Thom Pijnenburg, Michael Cochez, Paul Groth

机构 * Vrije Universiteit Amsterdam(荷兰阿姆斯特丹自由大学) University of Amsterdam(阿姆斯特丹大学) Elsevier B.V.(埃森哲公司) Discovery Lab, Elsevier(埃森哲发现实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文提出BioBLP框架,用于处理多模态生物医学知识图谱中的实体属性,支持不同模态的数据编码及缺失属性处理,并通过预训练策略提升训练效率,在药物-蛋白质相互作用预测任务中表现优于基线方法。

Journal ref J Biomed Semant 14, 20 (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20783 2026-05-12 cs.LG 57%

Physics-Conditioned Synthesis of Internal Ice-Layer Thickness for Incomplete Layer Traces

基于物理条件的内部冰层厚度合成:针对不完整层迹的合成

Zesheng Liu, Maryam Rahnemoonfar

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Lehigh University(莱维大学) Department of Civil and Environmental Engineering(土木与环境工程系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出基于物理特征的深度学习模型,用于合成不完整雷达层迹的内部冰层厚度,通过几何学习和Transformer模块实现一致的冰层结构和厚度演化,同时提供有效的预训练监督以提升下游预测性能。

Comments Accepted for 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28254 2026-05-12 cs.LG stat.ML 57%

MuonEq: Balancing Before Orthogonalization with Lightweight Equilibration

MuonEq: 在正交化前平衡以实现轻量级均衡

Da Chang, Qiankun Shi, Lvgang Zhang, Yu Li, Ruijie Zhang, Yao Lu, Yongxiang Liu, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Shenzhen University of Advanced Technology(深圳大学) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学) Southern University of Science and Technology(南方科技大学) George Washington University(乔治华盛顿大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 MuonEq通过在正交化前平衡动量矩阵,改进了矩阵参数的训练,其核心方法包括RC、R和C三种归一化形式,提升了正交化所见的几何结构,并在LLaMA2预训练中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05495 2026-05-12 cs.LG math.OC 57%

Cheap Thrills: Effective Amortized Optimization Using Inexpensive Labels

廉价快感:利用廉价标签进行有效的摊还优化

Khai Nguyen, Petros Ellinas, Anvita Bhagavathula, Priya L. Donti

机构 * Massachusetts Institute of Technology(麻省理工学院) Technical University of Denmark(丹麦技术大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出一种利用廉价不完美标签的框架,通过监督预训练和自监督学习提升模型性能,在非凸约束优化、电网操作和刚性动力系统中实现更快收敛和更低计算成本。

Comments in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08209 2026-05-12 cs.LG 57%

Learngene Search Across Multiple Datasets for Building Variable-Sized Models

跨多数据集学习基因搜索以构建可变大小模型

Boyu Shi, Junbo Zhou, Chang Liu, Xu Yang, Qiufeng Wang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(教育部新一代人工智能技术及其交叉应用重点实验室(东南大学))

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出LSAMD方法,通过跨多数据集搜索学习基因,构建可变大小模型,减少存储和训练成本,性能与预训练微调相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10925 2026-05-12 cs.RO 50%

PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models

PriorVLA: 为视觉-语言-动作模型保留先验进行适应

Xinyu Guo, Bin Xie, Wei Chai, Xianchi Deng, Tiancai Wang, Zhengxing Wu, Xingyu Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dexmal University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 PriorVLA通过保留预训练先验和学习有效适应方法,在机器人操作任务中实现了比全微调和现有基线更好的性能,特别是在分布外和少样本情况下表现更优。

Comments 32 pages. Project page: https://priorvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08296 2026-05-12 cs.CV eess.SP 50%

BenchHAR: Benchmarking Self-Supervised Learning for Generalizable Sensor-based Activity Recognition

BenchHAR: 用于通用传感器活动识别的自监督学习基准测试

Yize Cai, Rui Feng, Anlan Yu, Baoshen Guo, Zhiqing Hong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Peking University(北京大学) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 BenchHAR针对传感器活动识别中数据异质性和标注数据稀缺问题,系统比较了自监督学习方法的泛化性能,发现混合范式和CNN编码器在性能上表现最佳,且增加预训练数据量能提升泛化能力。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 78 篇

2509.12235 2026-05-12 cs.LG cs.AI 93%

RL Fine-Tuning Heals OOD Forgetting in SFT

强化学习修复SFT中的分布外遗忘

Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔理工学院) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席) Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究通过分析SFT和RL对ID和OOD推理的影响,发现RL能修复后期SFT导致的OOD能力下降,且与奇异向量旋转相关。

Comments 31 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08313 2026-05-12 cs.CR cs.AI cs.LG 93%

Seed Hijacking of LLM Sampling and Quantum Random Number Defense

LLM采样中的种子劫持与量子随机数防御

Ziyang You, Xiaoke Yang, Zhanling Fan, Feng Guo, Xiaogen Zhou, Xuxing Lu

机构 * School of Electronic, Electrical and Physics, Fujian University of Technology(福建工程学院电子、电气与物理系) School of Humanities, Fujian University of Technology(福建工程学院人文学院) Department of Investigation, Fujian Police College(福建警察学院调查系) Institute of Applied Physics and Materials Engineering, University of Macau(澳门大学应用物理与材料工程研究院)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract)

AI总结 本文提出SeedHijack攻击,通过操控PRNG输出实现指定token注入,提出基于量子随机数生成器的防御方案,解决LLM采样层的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏