arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 737 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 737 篇

2606.20418 2026-06-19 cs.SD 新提交 78%

MixProLAP: Mixture-Induced Uncertainty Modeling for Probabilistic Language-Audio Pretraining

MixProLAP:混合诱导的不确定性建模用于概率性语言-音频预训练

Yu Nakagome, Jaesong Lee, Soo-Whan Chung

机构 * LINE WORKS Corporation(LINE WORKS公司) NAVER Cloud Corporation(NAVER Cloud公司)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出概率性音频-语言预训练框架MixProLAP,通过混合音频-文本对模拟重叠声音,建模多对多对应不确定性,并引入多级包含损失,在音频-文本检索中优于确定性基线。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17200 2026-06-17 cs.RO 新提交 78%

ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining

ACE-Ego-0:统一第一人称人类与机器人数据用于VLA预训练

Hao Li, Ganlong Zhao, Yufei Liu, Haotian Hou, Guoquan Ye, Tongyan Fang, Chunxiao Liu, Siyuan Huang, Jianbo Liu, Xiaogang Wang, Hongsheng Li

机构 * ACE Robotics CUHK MMLab(香港中文大学多媒体实验室) CUHK, Shenzhen(香港中文大学(深圳)) SJTU(上海交通大学) THU(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出ACE-EGO-0框架,通过可扩展的第一人称视频到动作管道和可靠性感知训练目标,统一人类与机器人数据用于VLA预训练,在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17160 2026-06-17 cs.SD 新提交 78%

Transductive Zero-Shot Audio Classification with Audio-Language Models

基于音频-语言模型的直推式零样本音频分类

Jingwen Zhou, Mingzhe Wang

机构 * Xidian University, Xi'an, China(西安电子科技大学)

专题命中 预训练与数据 :language model(title);pretraining(abstract)

AI总结 提出一种文本锚定的球面高斯混合EM算法,利用测试批次音频嵌入统计信息改进零样本后验,无需标签和梯度,在三个数据集上提升4.6-9.2个点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15202 2026-06-16 cs.CV 新提交 78%

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

安全相关环境中的人类注视与视觉语言模型注意力的比较

Marta Vallejo, Siwen Wang

机构 * Heriot-Watt University(赫瑞-瓦特大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本研究通过眼动追踪实验和GPT-4o等视觉语言模型,比较了人类与模型在安全相关场景中的注意力分布,发现模型无需训练数据即可近似人类注视模式。

Comments 30 pages, 33 figures. Submitted as a preprint. Code and data available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09511 2026-06-09 cs.CV 新提交 78%

Securing Self-supervised Data Curation for Foundation Models Robustness

保障基础模型鲁棒性的自监督数据筛选

Sandeep Gupta, Roberto Passerone

机构 * Queen's University Belfast(贝尔法斯特女王大学) University of Trento(特伦托大学)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 针对自监督数据筛选面临的数据投毒风险,提出基于ImageBind和传统分类器的主动防御机制PDD,在多种攻击下有效检测中毒数据,SVM-PDD表现最优。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13947 2026-08-17 cs.CL 新提交 77%

Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion

通过属性引导的体裁扩展扩展非以故事为中心数据的创意写作规模

Hwan Chang, Yongil Kim, Heuiyeen Yeen, Yireun Kim, Jinsik Lee, Hwanhee Lee

机构 * Chung-Ang University(中央大学) LG AI Research(LG AI研究院)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出属性引导的体裁扩展框架,构建涵盖13种体裁的5万示例语料库,经微调的模型在多类创意写作任务上表现优于基线模型,证实受控体裁扩展是提升创意写作能力的关键。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12018 2026-08-13 cs.CL 新提交 77%

Poly-Dialectal Neural Machine Translation System for Bangla Regional Dialects

孟加拉语区域方言的多方言神经机器翻译系统

Rakib Ullah, Ruhul Islam Rahul, Tanbir Ahmed

机构 * SYLHET ENGINEERING COLLEGE(锡尔赫特工程学院)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对孟加拉语方言翻译性能差的问题,本研究提出Poly-Dialectal神经机器翻译系统,构建含51531句对的最大多方言语料库,微调BanglaT5模型性能最优,还部署量化网络应用推动数字包容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10327 2026-08-12 cs.AI 新提交 77%

Toward a Theory of Value in AI Alignment

迈向AI对齐中的价值理论

Andrew Smart, Shazeda Ahmed, Jackie Kay, Jimmy Tobin, Kris Shrishak, Abeba Birhane

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究通过标注94篇AI价值对齐论文,发现多数未明确定义人类价值,转而依赖偏好,且采用合成数据等自动方法可能关闭价值践行路径,旨在明确该领域哲学承诺以丰富相关辩论。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06791 2026-08-10 cs.AR cs.AI 新提交 77%

HLSmith: An Expert-Guided Agentic Framework for C/C++-to-HLS Translation

HLSmith:专家引导的C/C++到HLS转换智能体框架

Yuebo Luo, Ahmad Sedigh Baroughi, Philip Stachura, Le Chen, Venkatram Vishwanath, Zhenman Fang, Caiwen Ding

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出HLSmith框架,结合HLS优化专业知识库、分阶段反馈驱动编排流程及模型适配流水线,在PolyBench上较ChatHLS实现4.24倍几何平均加速比,所有基准均生成正确设计,开放权重模型下最高加速比达138倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05409 2026-08-07 cs.CL 新提交 77%

Mood Matters: How Syntactic Sensitivity Undermines Safety Alignment

情绪很重要:句法敏感性如何破坏安全对齐

Alina Klerings, Jannik Brinkmann, Heiner Stuckenschmidt, Simone Paolo Ponzetto

机构 * University of Mannheim(曼海姆大学) Technical University Clausthal(克劳斯塔尔工业大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 该研究发现大型语言模型存在句法敏感性漏洞,16个700亿参数级模型可通过调控句法特征触发或抑制拒绝行为,源于开源模型后训练数据的语言偏见,增加句法多样性可缓解问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29283 2026-08-03 cs.AR cs.LG 新提交 77%

RTLCurator: Label-Efficient Data Curation for RTL Generation

RTLCurator:用于RTL生成的标签高效数据整理

Siyang Cai, Cangyuan Li, Wenjing Chang, Kun Wang, Haoyu Gao, Yinhe Han, Ying Wang

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RTLCurator通过对比规范与模拟失败的实现学习兼容性先验,用少量验证配对校准后,平衡对齐度、覆盖度与结构丰富度保留80%语料,在CodeV和RTLCoder上提升RTL生成模型性能,仅需验证10%语料池。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29188 2026-08-03 cs.CL 新提交 77%

Detecting Experiential Intertextuality Across Migration Routes: Beyond Surface Similarity in French Narratives

检测移民路线间的经验互文性:法语叙事中超越表面相似性

Sakayo Toadoum Sari, Nelly Robin, Michelle Auzanneau, Lakhdar Sais, Veronique Petit, Marie Veniard, Said Jabbour, Fabien Delorme

机构 * CRIL, CNRS – Université d’Artois(CRIL,法国国家科学研究中心——阿图瓦大学) CEPED, Université Paris Cité(CEPED,巴黎西岱大学) EDA, Université Paris Cité(EDA,巴黎西岱大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本文提出无需标注训练数据的经验互文性检测任务,采用多种方法分析法语移民叙事,发现Qwen2.5-7B零-shot及监督混合方法表现最优,且叙事位置显著影响互文性。

Comments 11 pages, 3 figures, 5 tables. Accepted at SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)

Journal ref Proceedings of the 27th Annual Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL 2026), Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23648 2026-07-28 cs.CL 新提交 77%

EmoTrace: An Emotion Trajectory-Centered Framework for Psychological Support Dialogue Generation

EmoTrace:一种以情感轨迹为中心的心理支持对话生成框架

Kaitong Weng, Lixin Liu, Zihao Liu, Bo Wang, Shiguang Ni

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对现有心理支持对话数据生成方法的局限,提出EmoTrace框架,通过构建求助者认知概况及相关模块,以模拟其情感轨迹,增强情感表达层次性,实验证明该方法在情感丰富度和共情质量上优于现有方法。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22577 2026-07-28 cs.AI 新提交 77%

cMoLLM at Scale: Horizontal Scaling Laws for Mixture-of-LLMs

大规模的cMoLLM:语言模型混合的水平扩展定律

Xin Yang, Yemin Wang, Mingda Liu, Letian Li, Shuaishuai Cao, Zhengxiao He, Ryan Dong

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型训练和推理成本随模型规模线性增长的瓶颈,将MoE风格混合层 reformulate 为可变内核动态卷积,引入cMoLLM,在FineWeb训练的模型中提升了语言建模及下游任务表现,有更好流利用率等优势。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16212 2026-07-21 cs.AI 新提交 77%

Symbolic Augmentation Closes a Canonical-Equivalence Blind Spot in Neural Fact-Checkers

符号增强弥补神经事实核查器中规范等价盲点

Genpei Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型总结科学文本时数字和单位幻觉问题,提出将错误检测重定义为类型验证,引入分类法和基准。用符号增强训练框架,提升规范等价鲁棒性,提高准确率,还明确了符号特征及银标签在特定情况下的作用,确定训练时增强是关键集成点。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14256 2026-07-17 cs.AI cs.MA 新提交 77%

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation

基于多级智能数据管理的自动硬示例合成

Genglin Liu, Muye Zhang, Krishnamurthy Viswanathan, Nichole J. Hansen, Blaž Bratanič, Nathan L Clement, Shalini Ghosh, Ariel Fuxman

机构 * UCLA(加州大学洛杉矶分校) Google(谷歌)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型在内容安全审核任务中易受攻击的问题,提出自动智能红队框架,利用多智能体架构合成对抗示例,无需人工干预,提高模型鲁棒性,降低公共图像安全基准中的误报率。

Comments 23 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11471 2026-07-14 cs.CL 新提交 77%

Are LLMs ready for HardChoices?

语言模型是否准备好应对艰难选择?

Dmitry Nikolaev

机构 * University of Manchester(曼彻斯特大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究通过新数据集检查大语言模型在重大社会问题上的立场,发现大小模型面对相关问题时很少中立、常不连贯,且在有立场的问题上有高度一致性。

Comments Accepted to Konvens 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09543 2026-07-13 cs.LG q-bio.NC 新提交 77%

CoCoT-EEG: Contrastive-Pretrained Multiscale Convolutional Transformer for EEG Decoding

CoCoT-EEG:用于脑电解码的对比预训练多尺度卷积Transformer

Gabriel Mahuas, Victoria Shevchenko, Ugo Tanielian, Yassir Bendou, Richard Gao

机构 * Sigma Nova Paris(巴黎西格玛诺瓦公司) Goethe University Frankfurt(法兰克福歌德大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);prompting(abstract);分类 cs.LG

AI总结 研究针对EEG解码,开发了含多尺度时间卷积输入层和Transformer编码器块的对比预训练模型CoCoT,在广泛基准解码任务中表现出色,优于单任务解码模型,证明对比学习构建EEG基础模型可行,还给出架构设计考量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06845 2026-07-09 cs.CL 新提交 77%

LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering

大语言模型对非裔美国英语的隐性纠正:通过激活引导来审计和减轻方言偏见

Huan Wu, Ali Emami, Muhammad Furquan Hassan, Osaretin Igbinoba, Osakpolor Idusuyi, Osamede Igbinoba, Faiza Khan Khattak, Laleh Seyyed-Kalantari

机构 * York University(约克大学) Vector Institute(向量研究所) Connected Minds(连接思维公司) Emory University(埃默里大学) Wilfrid Laurier University(威尔弗里德·劳里埃大学) University of Toronto(多伦多大学) University of Guelph(圭尔夫大学) Monark Health(莫纳克健康公司) CIFAR Solution Network(加拿大高级研究院解决方案网络)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究发现大语言模型会将非裔美国英语重写为标准美国英语,提出端到端框架审计和减轻偏见,审计用cDGI等方法,减轻偏见用激活引导,该方法比提示更有效,还发布了真实AAE平行语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05842 2026-07-08 cs.SE cs.AI cs.CR 新提交 77%

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

超越拒绝:用于漏洞分析的对齐和消除拒绝的大语言模型的同谱系研究

Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型辅助软件安全中,同谱系模型的安全状态(对齐或消除拒绝)对软件安全工作流程防御效用的影响,通过比较不同模型在多方面的表现,发现评估应综合考量模型响应、响应正确性及输出在工程流程中的可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05217 2026-07-08 cs.CY cs.CL cs.IR 新提交 77%

Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off

公共人工智能信息服务中的 curated 检索与开放网页搜索:覆盖度-可信度权衡研究

Hafsteinn Einarsson, Hafsteinn Birgir Einarsson, Jón Gunnar Ólafsson, Jón Gunnar Þorsteinsson

机构 * Faculty of Industrial Engineering, Mechanical Engineering and Computer Science, University of Iceland(工业工程、机械工程和计算机科学学院,爱沙尼亚大学) Faculty of Political Science, University of Iceland(政治学学院,爱沙尼亚大学) The Icelandic Web of Science, University of Iceland(冰岛科学网络,爱沙尼亚大学)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对公共AI信息服务的源可信度问题,对比 curated 本地语料RAG与开放网页搜索两种检索路径,发现前者可信度高但覆盖有限,后者覆盖广但源可信度差,揭示了覆盖度与可信度的核心权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18663 2026-06-18 cs.CL 新提交 77%

RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories

RegMix-D: 通过代理训练轨迹实现动态数据混合

Kaiyan Zhao, Zhongtao Miao, Akiko Aizawa, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出RegMix-D,通过代理训练轨迹预测多阶段最优混合比例,实现动态数据混合,在13个下游任务上优于RegMix和DoReMi,且代理计算预算仅为RegMix的25%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11875 2026-06-11 cs.CL cs.SD 新提交 77%

I Understand How You Feel: Enhancing Deeper Emotional Support Through Multilingual Emotional Validation in Dialogue System

我理解你的感受:通过对话系统中的多语言情感验证增强深层情感支持

Zi Haur Pang, Yahui Fu, Koji Inoue, Tatsuya Kawahara

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出情感验证在对话系统中的应用,构建多语言语料库M-EDESConv和测试集M-TESC,设计多语言情感感知门控单元MEGUMI进行时机检测,并评估当前LLM在情感验证响应生成中的表现。

Comments This paper has been accepted for presentation at SIGdial Meeting on Discourse and Dialogue 2026 (SIGDIAL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11304 2026-06-11 physics.ins-det cs.LG hep-ex hep-ph 新提交 77%

SPADE: Split-and-Delay Embeddings for Autoregressive High-Granularity Calorimeter Simulation

SPADE: 用于自回归高粒度量热器模拟的分裂与延迟嵌入

Joschka Birk, Frank Gaede, Anna Hallin, Gregor Kasieczka, Martina Mozzanica, Henning Rose

机构 * Institute for Experimental Physics, Universität Hamburg(实验物理研究所,汉堡大学) Deutsches Elektronen-Synchrotron DESY(德国电子同步辐射光源DESY)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 提出SPADE自回归变压器,通过独立嵌入多特征令牌并延迟特征流,利用标准自注意力学习令牌内相关性,在ILD探测器点云簇射生成中优于现有模型。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08729 2026-06-09 cs.RO cs.LG 新提交 77%

IR-SIM: A Lightweight Skill-Native Simulator for Navigation, Learning, and Benchmarking

IR-SIM:一种用于导航、学习和基准测试的轻量级技能原生模拟器

Ruihua Han, Shuai Wang, Chengyang Li, Rui Gao, Xinyi Wang, Zhe Liu, Guoliang Li, Yupu Lu, Qi Hao, Jia Pan, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) Southern University of Science and Technology(南方科技大学) University of Michigan(密歇根大学) University of Macau(澳门大学)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出轻量级技能原生导航模拟器IR-SIM,通过YAML配置完全定义场景,支持文本提示生成与修改,用于导航算法基准测试和训练数据自动生成,并桥接高保真模拟器和真实部署。

Comments 12 pages, 6 figures, project website: https://github.com/hanruihua/ir-sim

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08025 2026-06-09 cs.CL 新提交 77%

Arabic Sentence Segmentation Across Genres and Punctuation Conditions

跨体裁与标点条件下的阿拉伯语句子分割

Mohammed Elkholy, Khalid N. Elmadani, Nizar Habash, Bashar Alhafni

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 针对阿拉伯语标点歧义和不一致导致的句子分割难题,构建跨8种体裁的语料库AraSEG,评估LLM、轻量编码器和依存解析器,发现轻量模型在困难设置下优于LLM,且准确分割能显著提升下游依存解析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20441 2026-07-24 cs.CL cs.LG 新提交 76%

Belief Propagation in LLM World Models: Measuring Strategic Information Bias with Prediction Markets

大语言模型世界模型中的信念传播:用预测市场测量战略信息偏差

Mykola Khandoga, Yevhen Kostiuk, Anton Polishko, Yurii Filipchuk, Kostiantyn Kozlov, Dmytro Zamriy, Artur Kiulian

机构 * Future Principle(未来原理) Aarhus University(奥胡斯大学)

专题命中 预训练与数据 :LLM(title);分类 cs.CL、cs.LG

AI总结 研究大语言模型结合预测市场测量信息偏差,通过消融特定文本偏差贡献,应用于乌克兰相关预测市场发现英语新闻背景致偏差,主要源于文本,补充乌军事分析源可减偏差,此偏差在多架构中会持续并影响下游决策。

Comments Accepted at UNLP 2026. 12 pages, 8 figures, 11 tables. Dataset available at https://huggingface.co/datasets/OpenBabylon/unlp-ukraine-forecasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15216 2026-06-16 cs.CL cs.AI 新提交 76%

Spokes: Optimizing for Diverse Pretraining Data Selection

Spokes: 优化多样化预训练数据选择

Clarence Lee, Yejin Choi, Luke Zettlemoyer, Pang Wei Koh, Hai Leong Chieu

机构 * DSO National Laboratories(DSO国家实验室) Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI

AI总结 提出基于G-Vendi分数的概率多样化框架,通过指数梯度下降直接优化数据多样性,在FineWeb和DCLM上提升下游性能1.5和1.4个点。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24276 2026-07-28 cs.CL cs.AI cs.LG 新提交 75%

The Tokenizer Tax: Quantifying and Explaining the Cross-Lingual Cost of Subword Tokenization for Indian Languages

分词器代价:量化并解释印度语言子词分词的跨语言成本

Priyansh Srivastava

机构 * Sirena Ai India(印度Sirena人工智能公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究量化印度语言子词分词跨语言成本,测量六种分词器在十四种语言上的分词丰富度,揭示字节对合并失败是高代价主因,多语言分词器可降低代价,还发现分词与阅读理解性能关联受语言资源可用性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20310 2026-07-23 q-bio.NC 新提交 75%

Capturing Inner Experience At Scale: An AI Interviewer Co-Developed with the Founder of a Landmark Phenomenological Method

大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者

Jona Carmon, Clara Bersch, Charles Fernyhough, Russell T. Hurlburt, Simone Kühn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。

详情

展开后加载摘要…

URL PDF HTML 收藏