arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138434 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12365 篇

2606.27655 2026-06-29 cs.CV 新提交 85%

Temporal-Emerged Prompting for Segment Anything in Multiframe Infrared Small Target Detection

时间涌现提示用于多帧红外小目标检测中的Segment Anything

Yinghui Xing, Donghao Chu, Shizhou Zhang, Di Xu

专题命中 预训练与数据 :prompting(title,abstract);foundation model(abstract);pretraining(abstract)

AI总结 提出TEP-SAM框架,通过联合建模全局运动模式和局部运动偏差,利用时间涌现线索提示SAM,实现低信噪比红外序列中小目标的精准定位与分割。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24173 2026-05-26 cs.CL cs.AI cs.CR cs.LG 85%

Extracting Training Data from Diffusion Language Models via Infilling

通过填充从扩散语言模型中提取训练数据

Yihan Wang, N. Asokan

机构 * University of Waterloo(滑铁卢大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出填充提取协议,利用扩散语言模型的双向去噪能力,通过任意二进制掩码参数化,揭示掩码几何形状控制提取能力,边缘条件掩码比前缀条件掩码多提取三倍逐字序列,且双向访问打开了自回归模型无法利用的通道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22981 2026-05-25 cs.CL cs.AI cs.LG 85%

Memorization Dynamics of Fill-in-the-Middle Pretraining

Fill-in-the-Middle 预训练的记忆动态

Tobias von Arx, Tanguy Dieudonné

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过对比 FIM 与标准 LTR 预训练,研究 FIM 对逐字记忆的影响,发现 FIM 更易恢复短片段或部分匹配,而 LTR 对长精确延续置信度更高,且 FIM 训练下的逐字提取随重复次数近似线性增长。

Comments MemFM @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16455 2026-05-19 cs.CR 85%

MalwarePT: A Binary-Level Foundation Model for Malware Analysis

MalwarePT:一种用于恶意软件分析的二进制级基础模型

Saastha Vasan, Yuzhou Nie, Kaie Chen, Yigitcan Kaya, Hojjat Aghakhani, Roman Vasilenko, Wenbo Guo, Christopher Kruegel, Giovanni Vigna

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出MalwarePT,一种基于ModernBERT编码器的二进制级基础模型,通过预训练实现跨任务的迁移学习,提升恶意软件分析中API预测和功能分类的性能。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14747 2026-05-15 cs.CL cs.AI cs.CV cs.LG 85%

Video2GUI: Synthesizing Large-Scale Interaction Trajectories for Generalized GUI Agent Pretraining

Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练

Weimin Xiong, Shuhao Gu, Bowen Ye, Zihao Yue, Lei Li, Feifan Song, Sujian Li, Hao Tian

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24416 2026-04-28 cs.CL cs.AI cs.LG 85%

Scaling Properties of Continuous Diffusion Spoken Language Models

连续扩散口语语言模型的可扩展性特性

Jason Ramapuram, Eeshan Gunesh Dhekane, Amitis Shidani, Dan Busbridge, Bogdan Mazoure, Zijin Gu, Russ Webb, Tatiana Likhomanenko, Navdeep Jaitly

机构 * Apple(苹果公司)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究连续扩散口语语言模型在性能上的可扩展性,提出基于音素Jensen-Shannon散度的评估指标,发现其在参数规模增加时生成质量提升,但长文本连贯性仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12370 2026-04-20 cs.CV 85%

LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens

LLaMo:通过连续自回归令牌扩展预训练语言模型,实现统一的运动理解和生成

Zekun Li, Sizhe An, Chengcheng Tang, Chuan Guo, Ivan Shugurov, Linguang Zhang, Amy Zhao, Srinath Sridhar, Lingling Tao, Abhay Mittal

机构 * Brown University(布朗大学) Meta

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract)

AI总结 LLaMo通过模态特定的Transformer混合架构扩展预训练语言模型,解决运动-语言生成和理解的统一问题,实现高保真文本到运动生成和运动到文本描述。

Comments Project page: https://kunkun0w0.github.io/project/LLaMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01738 2026-04-16 cs.CV 85%

Simplicity Prevails: The Emergence of Generalizable AIGI Detection in Visual Foundation Models

简单即正义:视觉基础模型中通用可推广AIGI检测的出现

Yue Zhou, Xinan He, Kaiqing Lin, Bing Fan, Feng Ding, Bin Li

机构 * Shenzhen University(深圳大学) Nanchang University(南昌大学) University of North Texas(北得克萨斯大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出通过简单线性分类器在现代视觉基础模型冻结特征上训练,实现超越专门检测器的AIGI检测性能,尤其在真实世界数据集上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09920 2026-04-14 cs.CV 85%

Does Your VFM Speak Plant? The Botanical Grammar of Vision Foundation Models for Object Detection

你的VFM说话植物吗?面向物体检测的视觉基础模型的植物语法

Lars Lundqvist, Earl Ranario, Hamid Kamangir, Heesup Yun, Christine Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出系统提示优化框架,评估四个开放词汇检测器在合成和真实农田图像中对豆科植物花和豆荚的检测性能,发现提示结构对不同模型响应各异,通过模型特定的组合提示显著提升检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06618 2026-04-10 cs.CR 85%

PoC-Adapt: Semantic-Aware Automated Vulnerability Reproduction with LLM Multi-Agents and Reinforcement Learning-Driven Adaptive Policy

PoC-Adapt: 基于语义的自动漏洞重现与LLM多智能体及强化学习驱动的自适应策略

Phan The Duy, Khoa Ngo-Khanh, Nguyen Huu Quyen, Van-Hau Pham

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PoC-Adapt框架,通过语义运行时验证和自适应策略学习,提升漏洞重现的可靠性并降低生成成本,实验表明其在CWE-Bench-Java和PrimeVul基准上验证可靠性和效率提升显著。

Comments 16 pages, abstracted and meta updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06894 2026-04-09 stat.AP 85%

How Does LLM Help Regional CPI Forecast: An LLM-powered Deep Panel Modeling Framework

大型语言模型如何帮助区域CPI预测:一种基于大型语言模型的深度面板建模框架

Tianchen Gao, Ao Sun, Yurou Wang, Jingyuan Liu, Cheng Hsiao

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合大型语言模型分析和社会媒体叙述的深度面板建模框架,通过构建大规模叙述语料库和微调BERT模型生成高频LLM诱导替代品,提升区域CPI预测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 85%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02368 2026-03-31 cs.IR 85%

NextQuill: Causal Preference Modeling for Enhancing LLM Personalization

NextQuill: 基于因果偏好建模的增强大语言模型个性化

Xiaoyan Zhao, Juntao You, Yang Zhang, Wenjie Wang, Hong Cheng, Fuli Feng, See-Kiong Ng, Tat-Seng Chua

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 NextQuill通过因果偏好建模方法,改进大语言模型的个性化对齐,通过区分模型预测和训练数据中的真实偏好影响,提升个性化效果。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19427 2026-03-23 cs.CL cs.AI cs.LG 85%

Vocabulary shapes cross-lingual variation of word-order learnability in language models

词汇如何塑造语言模型中词序可学习性的跨语言变异

Jonas Mayer Martins, Jaap Jumelet, Viola Priesemann, Lisa Beinborn

机构 * University of Göttingen, Germany(德国哥廷根大学) University of Groningen, Netherlands(荷兰格罗宁根大学) MPI for Dynamics and Self-Organization, Germany(德国动态与自组织研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过预训练变换器语言模型探讨不同词序语言的可学习性差异,发现词汇结构是影响词序可学习性的关键因素。

Comments Submitted to ACL 2026. 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17206 2026-03-03 cs.LG cs.AI cs.CL 85%

Soft-Masked Diffusion Language Models

软掩码扩散语言模型

Michael Hersche, Samuel Moor-Smith, Thomas Hofmann, Abbas Rahimi

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出软掩码方法,通过动态融合掩码token与预测token的嵌入,提升扩散语言模型的生成性能和准确性。

Comments Accepted at the Fourteenth International Conference on Learning Representations (ICLR2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01077 2026-02-26 cs.NE 85%

Zero-Shot Document-Level Biomedical Relation Extraction via Scenario-based Prompt Design in Two-Stage with LLM

零样本文档级生物医学关系抽取:基于场景的提示设计的两阶段方法与大语言模型

Lei Zhao, Ling Kang, Quan Guo

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究提出一种基于场景的提示设计的两阶段方法,利用通用LLMs在降低硬件和劳动力成本的同时实现文档级生物医学关系抽取的高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20580 2026-02-25 cs.CL cs.AI cs.CR cs.LG 85%

Personal Information Parroting in Language Models

语言模型中的个人信息重复

Nishant Subramani, Kshitish Ghate, Mona Diab

机构 * Carnegie Mellon University - Language Technologies Institute(卡内基梅隆大学-语言技术研究所) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究开发了检测个人信息的正则表达式和规则套件,发现语言模型会记忆并重复个人信息,建议加强数据过滤和匿名化以降低隐私风险。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19020 2026-02-24 cs.LG cs.AI cs.CL 85%

Learning to Detect Language Model Training Data via Active Reconstruction

通过主动重建学习检测语言模型训练数据

Junjie Oscar Yin, John X. Morris, Vitaly Shmatikov, Sewon Min, Hannaneh Hajishirzi

机构 * University of Washington(华盛顿大学) Cornell University(康奈尔大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 预训练与数据 :language model(title);LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出主动数据重建攻击方法,通过强化学习主动诱导模型重建文本以检测语言模型训练数据,实验表明其在检测预训练、后训练和蒸馏数据方面表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10160 2026-02-23 cs.CL cs.AI cs.LG 85%

Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment

对齐预训练:人工智能 discourse 导致自我实现的(不)对齐

Cameron Tice, Puria Radmard, Samuel Ratnam, Andy Kim, David Africa, Kyle O'Brien

机构 * Geodesic Research(Geodesic研究机构) UK AI Security Institute(英国人工智能安全研究所) University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过预训练不同量级的AI discourse,发现其对下游对齐有显著影响,表明预训练数据塑造对齐先验的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10577 2026-02-19 cs.IR 85%

Campaign-2-PT-RAG: LLM-Guided Semantic Product Type Attribution for Scalable Campaign Ranking

Campaign-2-PT-RAG: LLM引导的语义产品类型归因用于可扩展的活动排名

Yiming Che, Mansi Ranjit Mane, Keerthi Gopalakrishnan, Parisa Kaghazgaran, Murali Mohana Krishna Dandu, Archana Venkatachalapathy, Sinduja Subramaniam, Yokila Arora, Evren Korpeoglu, Sushant Kumar, Kannan Achan

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Campaign-2-PT-RAG通过LLM解析活动内容并推断产品类型,生成高质量标签以提升电子商务活动排名优化

Comments fix typo and author names

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14127 2026-02-17 cs.SD 85%

MUKA: Multi Kernel Audio Adaptation Of Audio-Language Models

MUKA:多核音频适应音频-语言模型

Reda Bensaid, Amine Ouasfi, Yassir Bendou, Ilyass Moummad, Vincent Gripon, François Leduc-Primeau, Adnane Boukhayma

机构 * Inria, University Rennes, IRISA, CNRS(Inria、里昂大学、IRISA、CNRS)

专题命中 预训练与数据 :language model(title,abstract);foundation model(abstract);pretraining(abstract)

AI总结 MUKA通过结合细粒度表示与全局语义表示,实现音频-语言模型的少样本适应,展现了在适应性和效率上的平衡性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10934 2026-02-13 cs.SD eess.AS 85%

MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models

MOSS-Audio-Tokenizer: 为未来音频基础模型扩展音频分词器

Yitian Gong, Kuangwei Chen, Zhaoye Fei, Xiaogui Yang, Ke Chen, Yang Wang, Kexin Huang, Mingshu Chen, Ruixiao Li, Qingyuan Cheng, Shimin Li, Xipeng Qiu

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 MOSS-Audio-Tokenizer通过同质Transformer架构实现端到端音频分词,支持高保真重建并提升语音合成和语音识别性能。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16023 2026-01-23 eess.AS cs.HC 85%

Timbre-Aware LLM-based Direct Speech-to-Speech Translation Extendable to Multiple Language Pairs

具有音色感知的基于大语言模型的直接语音到语音翻译系统,可扩展到多种语言对

Lalaram Arya, Mrinmoy Bhattacharjee, Adarsh C. R., S. R. Mahadeva Prasanna

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DS2ST-LM,一种基于多语言大语言模型的直接语音到语音翻译系统,通过整合Whisper编码器、可学习投影模块和音色感知合成器,实现多语言翻译并提升说话人相似性与语音自然度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09039 2026-01-15 cs.IT math.IT 85%

An Information-Theoretic Perspective on LLM Tokenizers

从信息论角度审视大语言模型分词器

Mete Erdogan, Abhiram Gorle, Shubham Chandak, Mert Pilanci, Tsachy Weissman

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 从信息论角度研究大语言模型分词器,揭示分词训练规模对熵分布的影响,提出压缩感知BPE变种,并分析分词器在不同领域下的鲁棒性与压缩效率的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13433 2026-01-15 cs.SD eess.AS 85%

MATS: An Audio Language Model under Text-only Supervision

MATS: 一种基于纯文本监督的音频语言模型

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 MATS通过纯文本监督训练,实现音频理解能力,无需依赖音频数据,展现出与大规模音频-语言对训练模型相当的性能。

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08517 2026-01-14 cs.CV 85%

Closed-Loop LLM Discovery of Non-Standard Channel Priors in Vision Models

闭环大语言模型在视觉模型中发现非标准通道先验

Tolgay Atinc Uzun, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS \& IFI, University of W\"urzburg, Germany

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用大语言模型进行视觉模型通道配置优化,通过生成大量架构数据训练LLM学习通道配置与性能关系,实验表明该方法在CIFAR-100上显著提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25531 2026-01-13 cs.CL cs.AI cs.LG 85%

MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources

MixtureVitae:基于宽容优先策略构建的开放网络级预训练数据集,包含高质量指令和推理数据

Huu Nguyen, Victor May, Harsh Raj, Marianna Nezhurina, Yishan Wang, Yanqi Luo, Minh Chien Vu, Taishi Nakamura, Ken Tsui, Van Khue Nguyen, David Salinas, Aleksandra Krasnodębska, Christoph Schuhmann, Mats Leon Richter, Xuan-Son, Vu, Jenia Jitsev

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixtureVitae通过宽容优先策略构建开放预训练数据集,提供高质量指令和推理数据,有效降低法律风险并提升模型性能。

Comments Code: \url{https://github.com/ontocord/mixturevitae}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24570 2026-01-01 cs.SE 85%

On the Effectiveness of Training Data Optimization for LLM-based Code Generation: An Empirical Study

在LLM基于代码生成中的训练数据优化有效性研究:一项实证研究

Shiqi Kuang, Zhao Tian, Tao Xiao, Dong Wang, Junjie Chen

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究评估了训练数据优化技术对LLM代码生成效果的影响,发现数据合成在提升功能正确性和减少代码异味方面最有效,而数据合成与重构的组合表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20145 2025-12-24 cs.CL cs.AI cs.CV cs.IR cs.LG 85%

Retrieval-augmented Prompt Learning for Pre-trained Foundation Models

基于检索的提示学习用于预训练基础模型

Xiang Chen, Yixin Ou, Quan Feng, Lei Li, Piji Li, Haibo Ye, Sheng-Jun Huang, Shuofei Qiao, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * MIIT Key Laboratory of Pattern Analysis and Machine Intelligence, College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(信息产业部模式分析与机器智能重点实验室,计算机科学与技术学院,南京航空航天大学) Zhejiang University(浙江大学) Hunan Vanguard Group Corporation Limited(湖南先锋集团有限公司) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RetroPrompt通过整合检索机制和知识库,提升预训练基础模型在少样本和零样本场景下的泛化能力与记忆平衡。

Comments IEEE/ACM Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19041 2025-12-22 cs.CL cs.AI cs.CV cs.LG cs.MM 85%

LookAhead Tuning: Safer Language Models via Partial Answer Previews

LookAhead Tuning: 通过部分答案预览实现更安全的语言模型

Kangwei Liu, Mengru Wang, Yujie Luo, Lin Yuan, Mengshu Sun, Lei Liang, Zhiqiang Zhang, Jun Zhou, Bryan Hooi, Shumin Deng

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室) Ant Group(蚂蚁集团) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LookAhead Tuning通过预览部分答案前缀,有效保持语言模型在微调过程中的安全性,同时不损害下游任务的性能。

Comments WSDM 2026 short

详情

展开后加载摘要…

URL PDF HTML 收藏