arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 731 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 731 篇

2606.27632 2026-06-29 cs.CL 新提交 95%

Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety

Yuvion LLM:一种面向内容和AI安全的对抗感知大语言模型

Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao, Yujian Li, Xinyue Chen, Chunyang Chai, Wenxuan Liu, Ziheng Wang, Dongjie Zhang, Yangfan Zhou, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Wei Wang, Huiming Zhang, Bin Li, Hui Xue

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);pretraining(abstract)

AI总结 针对大语言模型在对抗性攻击下的安全脆弱性,提出Yuvion LLM,通过对抗感知数据构建、知识增强预训练及多任务安全后训练,在安全基准和对抗鲁棒性上优于GPT-5.4等更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07996 2026-06-09 cs.CL cs.AI 新提交 94%

MC-PDD: Masked Corpus-Level Pretraining Data Detection for Black-Box Large Language Models

MC-PDD: 面向黑盒大语言模型的掩码语料级预训练数据检测

Kaixin Lan, Mu You, Tao Fang, Binkai Ou, Lidia S. Chao, Derek F. Wong

机构 * University of Macau(澳门大学) Macau Millennium College(澳门万人大学) BoardWare Information System Limited(博纬信息系统有限公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(title,abstract)

AI总结 提出MC-PDD方法,通过掩码特定token并利用LLM预测缺失内容,比较候选语料与参考非成员语料的预测命中率差异,以黑盒方式检测预训练数据,性能与现有方法相当。

Comments The manuscript consists of 10 pages formatted in the IEEE/ACM two-column style

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12419 2026-08-14 cs.LG 新提交 94%

LoKiFormer: Locality-aware Attention with Decoupled Knowledge Memory for Efficient Large Language Model Pretraining

LoKiFormer:面向高效大语言模型预训练的 locality-aware 注意力与解耦知识记忆

Qiuwu Chen, Zimo Liu, Yuchen Li, Ying Sun, Yifan Zhang, Zhijie Qiu, Zeng You, Ryan Dong, Simeng Ma, Yaofo Chen, Mingkui Tan

机构 * AIGCode South China University of Technology(华南理工大学) Pazhou Laboratory(琶洲实验室)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(title,abstract)

AI总结 针对LLM预训练效率问题,提出含局部融合注意力与知识记忆模块的LoKiFormer,使预训练收敛速度提升1.33倍,性能优于现有架构。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21631 2026-06-23 cs.CL cs.LG 新提交 93%

CuratorKIT : Data Curation and Synthetic Data Generation for LLM Post-Training

CuratorKIT:用于LLM后训练的数据策展与合成数据生成

Soham Bhattacharjee, Karun Sharma, Vinay Kumar Sankarapu, Pratinav Seth

机构 * Lexsi Labs(Lexsi实验室)

专题命中 预训练与数据 :LLM(title,title_cn);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出开源库CuratorKIT,集成数据摄取、去重、合成生成和质量过滤的全生命周期,通过可配置管道和可审计的样本溯源链提升后训练数据管道的透明度和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18268 2026-07-22 cs.AI 新提交 92%

Fence: Specialized SLM Guardrails for LLM Applications

Fence:用于大语言模型应用的专用小型语言模型护栏

Kumud Lakara, Ruibo Shi, Fran Silavong

机构 * JPMorgan(摩根大通)

专题命中 预训练与数据 :LLM(title,abstract);SLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究使用闭源大语言模型的实际应用的安全措施问题,提出用在合成数据上训练的小型语言模型作专用护栏,引入受GAN启发的合成数据生成方法,实验证明该方法训练的护栏比基于提示的性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07494 2026-07-09 cs.DC cs.LG 新提交 92%

GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining

GIFT:用于大语言模型预训练的几何感知低精度梯度通信

Jieying Wang, Shuyuan Fan, Mingkai Zheng, Zhao Zhang

机构 * Rutgers University(罗格斯大学)

专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对LLM预训练中梯度通信瓶颈,提出几何感知梯度缩放方法GIFT,通过变换梯度到近各向同性空间进行低精度通信,开发简化算法平衡开销与减少量,经实验验证可减少预训练时间并改善下游任务保留情况。

Comments 12 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19468 2026-06-19 cs.CL 新提交 92%

Characterizing Narrative Content in Web-scale LLM Pretraining Data

网络规模LLM预训练数据中的叙事内容特征化

Teagan Johnson, Elliott Ash, Andrew Piper, Maria Antoniak

机构 * University of Colorado Boulder(科罗拉多大学波尔德分校) ETH Zürich(苏黎世联邦理工学院) McGill University(麦吉尔大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.CL

AI总结 首次细粒度研究LLM预训练语料库Dolma的叙事特征,提出涵盖三个核心叙事元素(能动性、场景、事件)的框架,构建NarraBERT模型并发布NarraDolma数据集,揭示叙事结构在异构数据中可测量且分布不均。

Comments 8 pages of main content, 28 total pages. 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09697 2026-06-09 cs.CL 新提交 92%

PsychoSafe: Eliciting Psychologically-Informed Refusals in Large Language Models

PsychoSafe:在大语言模型中引发基于心理学的拒绝

Gianluca Barmina, Federico Torrielli, Sven Harms, Jacob Nielsen, Felix Mächtle, Stine Lyngsø Beltoft, Peter Schneider-Kamp, Thomas Eisenbarth, Lukas Galke Poech, Anne Lauscher

机构 * University of Southern Denmark(南丹麦大学) University of Turin(都灵大学) University of Hamburg(汉堡大学) University of Lübeck(吕贝克大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 提出PsychoSafe框架,将LLM的拒绝行为重构为基于证据干预策略的结构化支持性沟通,通过构建5个心理风险领域的8019个提示-响应对,对Qwen 3.5 27B进行提示和参数高效微调,在拒绝质量上比通用基线提升28.1%,同时保持非拒绝任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20729 2026-06-23 physics.chem-ph cond-mat.mtrl-sci cs.AI cs.LG 新提交 92%

LLM-Guided Test-Time Discovery of Quantum-Chemical Approximation Algorithms

LLM引导的量子化学近似算法测试时发现

Masaya Hagai, Yuta Suzuki, Tomoya Murata, Shuhei Kurita, Masaki Adachi

机构 * Lattice Lab, Toyota Motor Corporation(丰田汽车公司格子实验室) Department of Chemistry, Graduate School of Science, Nagoya University(名古屋大学理学部化学科) National Institute of Informatics(国家信息研究所)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 提出LADeQ框架,利用LLM在测试时自动发现、实现并评估量子化学近似算法,无需预训练或特定数据,可加速CCSD和CISD计算并控制误差。

Comments 13 main pages, 6 main figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15868 2026-06-16 cs.LG 新提交 92%

David vs. Goliath in Next Activity Prediction: Argmax vs. LSTM, Transformer, and LLM

下一活动预测中的大卫与歌利亚:Argmax 与 LSTM、Transformer 和 LLM

Hans Weytjens, Ingo Weber

机构 * Technical University of Munich(慕尼黑工业大学) Fraunhofer Gesellschaft(弗劳恩霍夫协会)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过系统基准测试,比较了简单计数 argmax 基线、LSTM、Transformer 和 LLM 在下一活动预测中的性能,发现 argmax 基线在多数数据集上可媲美或接近十亿参数 LLM。

Comments Accepted for 24th International Conference on Business Process Management (2026) Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27527 2026-06-29 cs.CV cs.AI cs.LG 新提交 92%

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

大型语言模型教授视觉学生:细粒度概念知识的跨模态迁移

Thomas Shih-Chao Liang, Zhuoran Yu, Yong Jae Lee

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 提出LaViD框架,利用语言模型生成多选题来蒸馏细粒度视觉概念,无需多模态数据,在多个基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01006 2026-07-02 cs.CL 新提交 92%

Understanding Large Language Models

理解大型语言模型

Yannik Keller, Thomas Eisenmann

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述大型语言模型(LLM)的机制、涌现能力及与人类认知的关系,通过分析注意力机制、符号推理、心智理论等证据,探讨LLM是否真正理解语言,并反对过度简化的人机认知差异观点。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17542 2026-06-17 cs.CL 新提交 92%

Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

评估大型语言模型在会议中的收话人、话轮转换和下一说话人预测能力

Ryo Fukuda, Takatomo Kano, Siddhant Arora, Marc Delcroix, Naohiro Tawara, Atsunori Ogawa, Yuya Chiba, Atsushi Ando, William Chen, Shinji Watanabe

机构 * NTT, Inc., Japan(日本电信电话公司) Language Technologies Institute, Carnegie Mellon University, USA(卡内基梅隆大学语言技术研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 利用大型语言模型(LLMs)研究多模态多人对话中的话轮转换,构建了收话人检测、话轮转换预测和下一说话人预测三个任务的评估框架,实验表明LLMs在下一说话人预测上优于监督模型和人类,但多模态LLM在收话人检测和话轮转换预测上仍低于人类水平。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30661 2026-07-01 cs.CY 新提交 92%

Understanding Censorship in Large Language Models: From Mechanisms to Governance

理解大型语言模型中的审查:从机制到治理

Quanyan Zhu

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文从社会技术视角审视LLM审查,涵盖数据、对齐、政策、推理时审核及法规,分析其表现形式、测量挑战与治理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13332 2026-07-16 cs.LG cs.DC 新提交 92%

Agora: Collective and Permissionless Internet-Scale Pretraining of Large Language Models

Agora:大规模语言模型的集体无许可互联网规模预训练

Gil Avraham, Violetta Shevchenko, Hadi Mohaghegh Dolatabadi, Karol Pajak, James Snewin, Harry Xi, Rodney O'Donnell, Thalaiyasingam Ajanthan, Sameera Ramasinghe, Chamin Hewa Koneputugodage, Shamane Siriwardhana, Alexander Long

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 研究旨在解决大语言模型训练资源受限问题,提出Agora系统,通过互联网级链路的带宽高效流水线并行模型分片与多方容错集体操作相结合,实现集体训练、集体所有模型,首次展示Pluralis - 8B预训练,效率达集中式基线63%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23271 2026-06-23 cs.CL 新提交 92%

Scaling LLM Knowledge Boundaries via Distribution-Optimized Synthesis

通过分布优化合成扩展LLM知识边界

Songze Li, Yarong Lan, Zhongpu Bo, Zhaoyang Wang, Zhiqiang Liu, Yuan Yuan, Chengtao Gan, Menghao Qian, Enpei Niu, Xiaoke Guo, Yuanxiang Liu, Zhaoyan Gong, Xiangjin Hu, Liangyurui Liu, Jingdian Lu, Lei Liang, Jun Zhou, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出KDoS框架,通过知识密度驱动的三阶段反馈机制优化合成数据的知识分布,显著扩展LLM知识边界,并在多模型和多数据规模上验证了最优分布的稳定性和有效性。

Comments ACL ARR May (EMNLP 2026) Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20574 2026-06-23 cs.NI cs.AI 新提交 92%

LLM-assisted gNB Parameter Configuration for Radio Access Network

LLM辅助的无线接入网gNB参数配置

Yao-Cong Dong, Maria Amparo Canaveras Galdon, Ari Uskudar, Kuntal Chowdhury, Edwin K. P. Chong, Ray-Guang Cheng

机构 * Dept. of Electronic and Computer Engineering, National Taiwan University of Science and Technology, Taiwan(电子与计算机工程系,台湾科技大学) NVIDIA, USA(NVIDIA公司) Colorado State University, USA(科罗拉多州立大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LLM辅助框架,通过合成数据生成和微调,自动从错误日志中生成正确的gNB参数配置,在OAI测试中准确率达92.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15325 2026-06-16 cs.CL 新提交 92%

Prior over Evidence: Stereotype-Driven Diagnosis in LLM-Based L2 Pronunciation Feedback

先验优于证据:基于LLM的二语发音反馈中的刻板印象驱动诊断

Rong Wang, Kun Sun

机构 * University of Tuebingen(蒂宾根大学) Tongji University(同济大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究测试了LLM在二语发音反馈中是否基于语音证据而非预训练先验进行诊断,发现评分准确性与推理脱钩,音素级反馈收敛于固定困难音素集,且声学证据仅在直接探测目标维度时改善评分。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13397 2026-06-12 cs.HC cs.AI cs.CY 新提交 92%

Mod-Guide: An LLM-based Content Moderation Feedback System to Address Insensitive Speech toward Indigenous Ethnic and Religious Minority Communities

Mod-Guide:一种基于LLM的内容审核反馈系统,用于解决针对原住民及少数族裔宗教群体的不敏感言论

Dipto Das, Achhiya Sultana, Ankit Singh Chauhan, Saadia Binte Alam, Mohammad Shidujaman, Shion Guha, Sunandan Chakraborty, Syed Ishtiaque Ahmed

机构 * Department of Computer Science, University of Toronto(计算机科学系,多伦多大学) Independent University Bangladesh(孟加拉国独立大学) Indiana University(印第安纳大学) Faculty of Information, University of Toronto(信息学院,多伦多大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究LLM审核系统对孟加拉国印度教和查克玛社区不敏感言论的认知局限,通过共同构建文化语料库和检索增强生成(RAG)方法开发Mod-Guide工具,提升模型对少数群体观点的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12983 2026-06-12 cs.AI 新提交 92%

Structured Testbench Generation for LLM-Driven HDL Design and Verification-Oriented Data Curation

面向LLM驱动的硬件描述语言设计与验证数据整理的结构化测试台生成

En-Ming Huang, Yu-Hung Kao, Ren-Hao Deng, Wei-Po Hsin, Yao-Ting Hsieh, Cheng Liang, Hsiang-Yu Tsou, Mu-Chi Chen, Yu-Kai Hung, Shao-Chun Ho, Po-Hsuang Huang, Shih-Hao Hung, H. T. Kung

机构 * National Taiwan University(国立台湾大学) Academia Sinica(中央研究院) Harvard University(哈佛大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出STG框架,利用硬件设计固有结构生成确定性测试台,比迭代LLM方法快720倍,编译成功率更高,覆盖率更高,误判更少,并用于数据整理和测试时扩展。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11166 2026-06-10 stat.OT cs.AI 新提交 92%

Flaws in the LLM Automation Narrative

LLM自动化叙事中的缺陷

George Perrett, Javae Elliott, Jennifer Hill, Marc Scott

机构 * New York University(纽约大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过编写代码完成数据分析任务的新基准测试,发现前沿LLM在平均性能、方差和错误幅度上均不如人类专家,挑战了LLM达到人类专家水平的说法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20613 2026-06-23 cs.CY 新提交 91%

Gender Disparities in LLM-Based Intimate Partner Violence Detection

基于LLM的亲密伴侣暴力检测中的性别差异

Tabia Tanzin Prama, Mikaela Irene Fudolig, Abigail M. Crocker, Christopher M. Danforth, Peter Sheridan Dodds

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究通过反事实变体测试LLM在亲密伴侣暴力检测中的性别偏见,发现当受害者为男性时,暴力检测率系统性降低,女性施暴者身份是暴力识别的负向预测因子。

Comments Accepted at the Seventh Workshop on NLP and Computational Social Science (at ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06502 2026-06-08 cs.CR 新提交 91%

Subtle Injection for Ground-truth Inference of LLM Training Data

用于LLM训练数据真实推断的微妙注入

Abraham Itzhak Weinberg

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SIGIL框架,通过向文本中嵌入不可感知的“金丝雀序列”,使训练了这些文档的LLM在特定查询下表现出可检测的行为特征,从而证明文档被用于训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06253 2026-08-07 cs.LG 新提交 91%

MetaboLLM: a metabolomics-specialized large language model for biochemical knowledge integration and predictive metabolite graph construction

MetaboLLM:用于生化知识整合与预测性代谢物图构建的代谢组学专用大语言模型

Dohyun Ku, Min Gu Kwak, Francisco J. Pasquel, Jing Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 该研究开发了代谢组学专用大语言模型MetaboLLM及配套的MetaboLLM-GIN,经多阶段适配后,在相关任务及两个临床预测场景中均取得优于对照模型的性能,证明领域专用语言模型可构建可预测且可解释的代谢物图表征。

Comments 60 pages, 3 figures, 16 tables; includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22652 2026-07-28 cs.AI 新提交 91%

KG2Code: Bridging Knowledge Graphs and Large Language Models via Executable Code for Question Answering

KG2Code:通过可执行代码连接知识图谱与大语言模型以进行问答

Yike Wu, Nan Hu, Guilin Qi, Guohui Xiao, Chen Jiang, Xinchun Zou, Yuchen Lu, Songlin Zhai, Yongrui Chen, Yuyang Zhang, Xiaoguang Li, Lifeng Shang, Jiaoyan Chen, Jeff Z. Pan

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其交叉应用重点实验室(东南大学)) Huawei Technologies(华为技术有限公司) University of Manchester(曼彻斯特大学) University of Edinburgh(爱丁堡大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 研究针对知识图谱问答中现有方法的局限,提出KG2Code方法,将知识图谱转换为代码表示,在此基础上构建KG2Code-QA框架,把KGQA作为代码生成任务,还构建代码语料库,训练后的模型在KGQA任务中表现优异且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20381 2026-06-19 cs.AI 新提交 91%

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

重新思考LLM FP4预训练中的收缩偏差:几何起源、系统影响与UFP4方案

Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

机构 * Ling Team, Ant Group(蚂蚁集团灵团队)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.AI

AI总结 本文发现E2M1格式因几何不对称导致收缩偏差,该偏差经随机哈达玛变换放大,造成训练不稳定;提出均匀网格E1M2/INT4及UFP4训练方案,在多种模型上实现更低损失。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19170 2026-06-18 cs.CL 新提交 91%

Dango: A Strictly L1-Only Large Language Model for Studying Second Language Acquisition

Dango:一个严格仅L1的大型语言模型,用于研究第二语言习得

Shiho Matta, Yin Jou Huang, Fei Cheng, Takashi Kodama, Hirokazu Kiyomaru, Yugo Murawaki

机构 * Kyoto University(京都大学) NII-LLMC(日本国立信息与通信技术研究所-语言模型中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 提出1.8B参数的Dango模型,通过过滤L2污染和微调L2学习课程,模拟人类L2产出模式,优于未过滤和多语言基线。

Comments 8 pages main text, 20 pages total including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11925 2026-06-11 cs.CV cs.LG 新提交 91%

Corpus Augmentation for Sign Language Translation via LLM-Guided Video Stitching

通过LLM引导的视频拼接进行手语翻译的语料增强

Zsolt Robotka, Ádám Rák, Jalal Al-Afandi, András Horváth, György Cserey

机构 * Peter Pazmany Catholic University, Faculty of Information Technology and Bionics(彼得·帕兹马尼天主教大学信息科技与仿生学院) DeepSign Technologies Ltd.(DeepSign科技有限公司)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract);分类 cs.LG

AI总结 提出一种无需额外标注或生成模型的手语翻译语料增强方法,利用CTC强制对齐提取手语片段,通过LLM生成句子并拼接视频,在GFSLT-VLP基线上提升BLEU-4达2.92,并发现合成数据对视觉-语言预训练有害但可提升下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19347 2026-06-19 cs.CL cs.AI cs.PL 新提交 91%

How LLMs Fail and Generalize in RTL Coding for Hardware Design?

LLM在硬件设计的RTL编码中如何失败与泛化?

Guan-Ting Liu, Chao-Han Huck Yang, Chenhui Deng, Zhongzhi Yu, Brucek Khailany, Yu-Chiang Frank Wang

机构 * NVIDIA Research(英伟达研究院)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出基于问题可解性的错误分类法,揭示LLM在RTL编码中受限于预训练知识,对齐技术仅教会编译,而推理能力才是关键瓶颈。

Comments Preview, under submission for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15521 2026-06-16 cs.CL cs.LG 新提交 91%

Emergent retokenization symmetry in large language models: phenomenology and applications

大型语言模型中涌现的重分词对称性:现象学与应用

Kanishk Jain, Matthew Day, Tankut Can

机构 * Department of Physics, Emory University(埃默里大学物理系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究发现大型语言模型在训练中部分涌现出重分词对称性,通过重分词实验探测模型对语义等价输入表示的敏感性和鲁棒性,并提出一种新的推理时采样策略。

详情

展开后加载摘要…

URL PDF HTML 收藏