arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2603.10067 2026-05-25 cs.LG cs.AI 79%

HTMuon: Improving Muon via Heavy-Tailed Spectral Correction

HTMuon:通过重尾谱校正改进Muon

Tianyu Pang, Yujie Fang, Zihang Liu, Shenyang Deng, Lei Hsiung, Shuhua Yu, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) Microsoft(微软) International Computer Science Institute(国际计算机科学研究所) University of California, Berkeley(加州大学伯克利分校) Meta

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对Muon优化器正交化更新规则抑制重尾权重谱并过度强调噪声方向训练的问题,提出HTMuon方法,通过重尾自正则化理论产生更重尾的更新和权重谱,在LLM预训练和图像分类中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21515 2026-05-22 cs.LG cs.AI 79%

Predicting Performance of Symbolic and Prompt Programs with Examples

通过示例预测符号程序和提示程序的性能

Chengqi Zheng, Keya Hu, Shuzhi Liu, Tao Wu, Kevin Ellis, Yewen Pu

机构 * Nanayang Technological University, Singapore(南洋理工大学,新加坡) Massachusetts Institute of Technology, USA(麻省理工学院,美国) Cornell University, USA(康奈尔大学,美国)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过示例预测程序性能的问题,提出了一种基于简单硬币翻转模型的方法,利用观察到的执行结果和性能先验知识来预测程序性能,并开发了RAP方法来构建代理先验以提高预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11871 2026-05-15 cs.CL cs.LG 79%

DMAP: A Distribution Map for Text

DMAP:文本的分布图

Tom Kempton, Julia Rozanova, Parameswaran Kamalaruban, Maeve Madigan, Karolina Wresilo, Yoann L. Launay, David Sutton, Stuart Burrell

机构 * University of Manchester, UK(曼彻斯特大学,英国) Featurespace, a Visa Solution(Visa解决方案的Featurespace) Risk and Security AI Lab, Visa Inc., UK(Visa公司的风险与安全AI实验室,英国) University of Cambridge, UK(剑桥大学,英国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 DMAP通过语言模型将文本映射到单位区间内的样本集,编码排名和概率信息,用于高效分析文本并支持多种应用,包括生成参数验证和机器生成文本检测。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12521 2026-05-14 cs.CL cs.AI 79%

ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues

ToolWeave:复杂多轮工具调用对话的结构化合成

Dinesh Khandelwal, Gnana Prakash Punnavajhala, GPS Bhargav, Gaurav Pandey, Sachin Joshi, Hima Karanam, Dinesh Raghu

机构 * IBM Research(IBM研究院) IIIT Hyderabad(Hyderabad理工学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 ToolWeave通过构建带有内置依赖关系的工具,生成更真实的多轮工具调用对话,减少参数幻觉,提升LLM在多步骤任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11689 2026-05-13 cs.LG cs.CL 79%

Slicing and Dicing: Configuring Optimal Mixtures of Experts

切片与切割:配置最优专家混合物

Margaret Li, Sneha Kudugunta, Danielle Rothermel, Luke Zettlemoyer

机构 * Paul G Allen School of Computer Science(保罗·G·艾伦计算机科学学院) University of Washington(华盛顿大学) New York University(纽约大学) Courant School of Data Science(科廷数据科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了混合专家架构中专家数量、粒度等核心参数的优化问题,发现专家数量和粒度对性能影响显著,其他参数影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25891 2026-04-29 cs.LG cs.AI cs.CR 79%

Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers

条件性偏差:通用干预可以隐藏新兴偏差背后的情境触发

Jan Dubiński, Jan Betley, Anna Sztyber-Betley, Daniel Tan, Owain Evans

机构 * Warsaw University of Technology(华沙技术大学) NASK National Research Institute(NASK国家研究院) Constellation Truthful AI University College London(伦敦大学学院) Center on Long-Term Risk(长期风险中心) UC Berkeley(伯克利大学)

专题命中 预训练与数据 :language model(abstract);post-training(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究发现通用干预可减少新兴偏差,但若评估提示模仿训练情境,则模型会再次出现偏差。三种干预方法均产生条件性偏差,表明在真实训练后,模型可能在标准评估中表现正常但存在潜在偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06803 2026-04-23 cs.CL cs.AI cs.CE 79%

Text to model via SysML: Automated generation of dynamical system computational models from unstructured natural language text via enhanced System Modeling Language diagrams

通过SysML生成动态系统模型:从无结构自然语言文本自动生成动态系统计算模型

Matthew Anderson Hendricks, Alice Cicirello

机构 * Department of Engineering, University of Cambridge, Trumpington Street, Cambridge, UK(剑桥大学工程系,特鲁布里奇顿街,剑桥,英国)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用领域和专家知识,通过SysML图自动从相关文档和输入文档生成动态系统计算模型,提升工程动态系统设计和部署效率。

Comments v3 - typos and imprecisions corrected, and added clarifications

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17429 2026-04-21 cs.CL cs.AI 79%

Jupiter-N Technical Report

木星-N技术报告

George Drayson

机构 * Locai Labs, University College London(Locai实验室,伦敦大学学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 木星-N通过混合推理模型在Nemotron 3 Super基础上进行微调,提升代理能力、文化对齐和威尔士语支持,同时保留基础模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09474 2026-04-21 cs.CL cs.AI 79%

Multimodal Policy Internalization for Conversational Agents

多模态策略内化用于对话代理

Zhenhailong Wang, Jiateng Liu, Amin Fazel, Ritesh Sarkhel, Xing Fan, Xiang Li, Chenlei Guo, Heng Ji, Ruhi Sarikaya

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多模态策略内化任务,通过将复杂策略内化为模型参数,提升对话代理的策略遵循能力,同时提供新数据集和训练框架TriMPI以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14172 2026-04-17 cs.CL cs.AI 79%

Tug-of-War within A Decade: Conflict Resolution in Vulnerability Analysis via Teacher-Guided Retrieval-Augmented Generations

十年内的拔河战:通过教师引导的检索增强生成解决漏洞分析中的冲突

Ziyin Zhou, Jianyi Zhang, Xu ji, Yilong Li, Jiameng Han, Zhangchi Zhao

机构 * Beijing Electronic Science and Technology Institute(北京电子科学技术研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRVA-TGRAG框架,通过改进检索准确性和教师引导的偏好优化,解决CVE检测中的知识冲突问题,提升漏洞检索的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04676 2026-04-13 cs.CV cs.AI cs.LG cs.MA 79%

Gen-n-Val: Agentic Image Data Generation and Validation

Gen-n-Val:代理图像数据生成与验证

Jing-En Huang, I-Sheng Fang, Tzuhsuan Huang, Yu-Lun Liu, Chih-Yu Wang, Jun-Cheng Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对计算机视觉任务中数据稀缺、标签噪声和长尾类别不平衡问题,Gen-n-Val引入基于Layer Diffusion和大语言模型的代理生成框架,有效提升实例分割和目标检测的合成数据质量与性能。

Comments Accepted to the CVPR 2026 Findings track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR 79%

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01472 2026-04-03 math.OC cs.AI cs.LG 79%

The Newton-Muon Optimizer

牛顿-穆恩优化器

Zhehang Du, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出牛顿-穆恩优化器,通过引入替代模型揭示穆恩设计原理并提出新优化方法,通过矩阵-梯度正交化实现闭式更新规则,实验证明其在训练GPT-2时效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28773 2026-04-01 cs.IR cs.CL cs.LG 79%

UltRAG: a Universal Simple Scalable Recipe for Knowledge Graph RAG

UltRAG:一种通用简单可扩展的知识图谱RAG配方

Dobrik Georgiev, Kheeran Naidu, Alberto Cattaneo, Federico Monti, Carlo Luschi, Daniel Justus

机构 * Graphcore Research(Graphcore 研究院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出UltRAG框架,通过神经查询执行模块提升知识图谱问答性能,无需重新训练LLM,在大规模知识图谱上实现高效问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28336 2026-04-01 cs.AI cs.LG 79%

A Multi-Agent Rhizomatic Pipeline for Non-Linear Literature Analysis

一种多智能体根状管道用于非线性文献分析

Julio C. Serrano, Joonas Kevari, Rumy Narayan

机构 * University of Vaasa, School of Management, Vaasa, Finland(瓦萨大学管理学院) LUT University, School of Engineering, Lahti, Finland(拉彭兰塔-拉赫蒂理工大学工程学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于德勒兹过程关系本体的多智能体系统,通过12个专用智能体实现非线性文献分析,自动检测跨学科交汇与研究空白。

Comments Research note paper, 12 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17075 2026-03-25 cs.CL cs.LG 79%

Perturb Your Data: Paraphrase-Guided Training Data Watermarking

扰动你的数据:基于改写引导的训练数据水印

Pranav Shetty, Mirazul Haque, Petr Babkin, Zhiqiang Ma, Xiaomo Liu, Manuela Veloso

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SPECTRA方法,通过LLM改写文本并结合评分模型,实现训练数据可靠检测,即使数据占比低于0.001%。该方法能有效区分训练数据与非训练数据,具有高鲁棒性和可扩展性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16051 2026-03-25 cs.LG cs.AI cs.HC 79%

GUIrilla: A Scalable Framework for Automated Desktop UI Exploration

GUIrilla:一个可扩展的自动化桌面UI探索框架

Sofiya Garkot, Maksym Shamrai, Ivan Synytsia, Mariya Hirna

机构 * MacPaw

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GUIrilla框架,用于生成大规模真实桌面交互数据,以提升交互系统基础模型的性能与泛化能力,特别针对macOS平台,提供可重用的MacApp Trees结构化表示。

Comments Accepted to the 3rd DATA-FM Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08663 2026-03-20 cs.CL cs.AI cs.CY 79%

Augmenting Rating-Scale Measures with Text-Derived Items Using the Information-Determined Scoring (IDS) Framework

通过信息确定评分(IDS)框架用文本衍生项目增强评分尺度测量

Joe Watson, Ivan O'Connor, Chia-Wen Chen, Luning Sun, Fang Luo, David Stillwell

机构 * Psychometrics Centre, Judge Business School, University of Cambridge(剑桥大学心理测量中心、剑桥大学商学院) Faculty of Law, University of Cambridge(剑桥大学法学院) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院) Faculty of Psychology, Beijing Normal University(北京师范大学心理学学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IDS框架,利用大型语言模型生成文本衍生项目,提升心理测量的精度和效度,通过案例研究展示其在抑郁症测量中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18034 2026-03-20 cs.CR cs.AI cs.LG 79%

Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems

语义变色龙:RAG系统中依赖语料库的污染攻击与防御

Scott Thornton

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究RAG系统中依赖语料库的污染攻击与防御,提出双文档污染攻击方法并评估混合检索防御效果,展示混合检索能有效降低攻击成功率。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15773 2026-03-18 cs.CL cs.AI 79%

Morphemes Without Borders: Evaluating Root-Pattern Morphology in Arabic Tokenizers and LLMs

无国界词素:在阿拉伯语分词器和大语言模型中评估根-模式词素学

Yara Alakeel, Chatrine Qwaider, Hanan Aldarmaki, Sawsan Alqahtani

机构 * Saudi Data & AI Authority (SDAIA)(沙特数据与人工智能局) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Princess Nourah Bint Abdulrahman University (PNU)(普罗瑟·努拉·本·阿卜杜勒拉赫曼大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了阿拉伯语分词器和大语言模型在处理根-模式词素学方面的表现,发现分词器的词素对齐并非生成词素学的必要或充分条件。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12683 2026-03-17 cs.CL cs.AI 79%

Experimental evidence of progressive ChatGPT models self-convergence

渐进式ChatGPT模型自我收敛的实验证据

Konstantinos F. Xylogiannopoulos, Petros Xanthopoulos, Panagiotis Karampelas, Georgios A. Bakamitsos

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过文本相似性度量评估不同ChatGPT模型生成文本多样性,发现近期版本在显式提示下生成文本多样性下降,可能由于训练数据中合成数据量增加导致模型自我收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13434 2026-03-17 cs.LG cs.AI 79%

Modality-free Graph In-context Alignment

无模态图上下文对齐

Wei Zhuo, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MF-GIA框架,通过梯度指纹捕捉领域特征,实现跨异构域的无模态few-shot预测与泛化。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11412 2026-03-13 cs.CL cs.IR cs.LG 79%

Seq vs Seq: An Open Suite of Paired Encoders and Decoders

序列 vs 序列:一个配对编码器和解码器的开放套件

Orion Weller, Kathryn Ricci, Marc Marone, Antoine Chaffin, Dawn Lawrie, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) LightOn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SOTA开放数据Ettin模型套件,包含不同规模的编码器和解码器模型,通过统一训练方法在分类、检索和生成任务中取得最佳性能。

Comments Accepted to ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08818 2026-03-09 cs.LG cs.AI 79%

From Tokenizer Bias to Backbone Capability: A Controlled Study of LLMs for Time Series Forecasting

从分词偏差到骨干能力:对用于时间序列预测的LLM进行受控研究

Xinyu Zhang, Shanshan Feng, Xutao Li, Kenghong Lin, Fan Li, Pengfei Jia

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过设计三个具有相同架构但不同预训练策略的模型,研究了LLM在时间序列预测中的性能,发现其表现有限,无法超越专门训练的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18310 2026-02-25 econ.GN cs.AI cs.CY cs.HC cs.LG q-fin.EC 79%

How much does context affect the accuracy of AI health advice?

上下文对AI健康建议准确性的影响有多大?

Prashant Garg, Thiemo Fetzer

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了上下文对AI健康建议准确性的影响,发现语言、主题和信息源显著影响LLM的健康声明验证性能,强调了多语言和领域特定评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16578 2026-02-19 cs.AI cs.CL 79%

Creating a digital poet

创造一个数字诗人

Vered Tohar, Tsahi Hayat, Amir Leshem

机构 * Department of Jewish Literature, Bar-Ilan University(巴伊兰大学犹太文学系) Department of Communication, Reichman University(雷赫曼大学传播系) Faculty of Engineering, Bar-Ilan University(巴伊兰大学工程学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过迭代专家反馈,大语言模型在无需重新训练的情况下发展出独特风格,成功创作诗歌集并引发对创造性和作者权的讨论。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13697 2026-02-17 cs.CY cs.AI cs.CL 79%

Writing in Symbiosis: Mapping Human Creative Agency in the AI Era

共生写作:人工智能时代人类创造性自主性的映射

Vivan Doshi, Mengyuan Li

机构 * Department of Computer Science University of Southern California(计算机科学系美国南加州大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了人工智能时代人类创造性自主性的共生写作模式,通过分析纵向写作数据揭示了作者与AI风格的适应性变化。

Comments Advances in Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12301 2026-02-16 cs.SD cs.CL cs.IR cs.LG eess.AS 79%

Beyond Musical Descriptors: Extracting Preference-Bearing Intent in Music Queries

超越音乐描述:在音乐查询中提取具有偏好的意图

Marion Baranes, Romain Hennequin, Elena V. Epure

机构 * Deezer Research(Deep Music 研究所) Idiap Research Institute(Idiap 研究所)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MusicRecoIntent语料库,通过标注音乐请求中的描述以提取用户意图,研究LLM在提取音乐描述中的表现,并为改进音乐理解系统提供基准。

Comments Accepted at NLP4MusA 2026 (4th Workshop on NLP for Music and Audio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11388 2026-02-13 cs.LG cs.CL 79%

Sparse Semantic Dimension as a Generalization Certificate for LLMs

稀疏语义维度作为大语言模型的泛化证书

Dibyanayan Bandyopadhyay, Asif Ekbal

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 通过稀疏语义维度理论,揭示大语言模型泛化能力源于内部表示的稀疏结构而非参数数量。

Comments Work in progress (17 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10553 2026-02-12 cs.LG cs.AI 79%

Contrastive Learning for Multi Label ECG Classification with Jaccard Score Based Sigmoid Loss

基于Jaccard分数的Sigmoid损失的多标签ECG分类对比学习

Junichiro Takahashi, Masataka Sato, Satoshi Kodeta, Norihiko Takeda

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于Jaccard分数的Sigmoid损失的对比学习方法,用于提升多标签ECG分类的性能,通过改进损失函数和数据增强技术提高诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏