arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 10708 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 731 篇

2606.09338 2026-06-09 cs.CL 新提交 85%

Multi-Hop Knowledge Composition is Bound by Pretraining Exposure

多跳知识组合受限于预训练暴露

Yannis Karmim, Luis Marti, Djamé Seddah, Valentin Barrière

机构 * Inria, Paris, France(法国国家信息与自动化研究所(巴黎)) Inria, Chile(法国国家信息与自动化研究所(智利)) Dept. of Computer Science, Universidad de Chile(智利大学计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现,即使单跳准确率达97%,大语言模型仍无法进行隐式多跳推理,原因是预训练中缺乏组合上下文,而非知识缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11167 2026-08-12 cs.CV cs.CL cs.LG 新提交 85%

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐

Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交 85%

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07669 2026-07-09 cs.CL cs.AI 新提交 85%

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

DiaLLM:英语方言适应中稳健性-生成差距的研究

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin

机构 * Institute for People-Centered AI, University of Surrey(萨里大学以人为本人工智能研究所) University of New South Wales(新南威尔士大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究英语方言适应中稳健性与生成的差距,通过DiaLLM持续预训练并结合多种策略对比不同英语变体。发现二者分离,特定变体适应产出受青睐但优化奖励方法未获评估者偏爱,缩小差距需丰富奖励设计和投入方言资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03160 2026-07-07 cs.CL cs.AI 新提交 85%

The Role of Prompt Language and Translation-Theory-Driven Prompts in Large Language Models: A Case Study on Spanish-Chinese Journalistic Translation

提示语言和翻译理论驱动的提示在大语言模型中的作用:以西班牙语-中文新闻翻译为例

Haohong Lai, Weijia Li

机构 * Faculty of Translation and Interpreting(翻译与口译学院) Autonomous University of Barcelona(巴塞罗那自治大学) Barcelona, Spain(西班牙巴塞罗那)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究提示语言和翻译理论驱动的提示设计对GPT-5.2生成的西中新闻翻译质量的影响。通过48种实验条件翻译平行语料库,用自动评估指标和人工评估,发现理论驱动提示能减少特定错误,提示语言影响小。

Comments Published in the Proceedings of the 27th Annual Conference of the European Association for Machine Translation (EAMT 2026), pp. 927-945. ACL Anthology entry forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13482 2026-08-14 cs.LG cs.AI cs.CL 新提交 85%

Synthetic Persona Pretraining: Alignment from Token Zero

合成角色预训练:从零开始的对齐

Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West

机构 * EPFL(洛桑联邦理工学院) University of Toronto(多伦多大学) Northeastern University(东北大学) SJTU(上海交通大学) Saarland University(萨尔大学) Hereon(亥姆霍兹极地与海洋研究中心) TUHH(汉堡工业大学) Ontocord AI(Ontocord人工智能公司) TUC(德累斯顿工业大学) DFKI(德国人工智能研究中心)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出合成角色预训练(SPP),在预训练token零阶段植入助手角色,通过标注反思、预训练及角色绑定,提升模型价值构成遵循度与鲁棒性,降低对齐错误率,证明预训练时角色干预是对齐的有效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03930 2026-08-05 cs.CL cs.AI cs.LG 新提交 85%

Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility

语言之前的逻辑:基于形式推导的预预训练可促进技能获取与可压缩性

Jo-Ku Cheng, Nikolaos Aletras, Marco Valentino

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出Logic-PPT策略,通过形式推导预预训练语言模型,可加速技能获取、提升性能,还能增强模型可压缩性,在少用36B token时达80%准确率,33%稀疏度下匹配密集基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11562 2026-07-14 cs.CV 新提交 85%

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2:用于文档人工智能的视觉-文本基础模型

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Kingsoft Office(金山办公软件)

专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究针对主流视觉编码器难以应用于文档图像的问题,提出MonkeyOCRv2模型。通过构建大型文档图像预训练语料库及采用联合预训练策略,在多个文档分析任务中提升性能,并验证其作为视觉编码器在文档解析和理解任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10277 2026-07-14 cs.SE 新提交 85%

From Business Requirements to Test Assertions: Evaluating LLM-Generated Oracles on Real Bugs

从业务需求到测试断言:评估大语言模型生成的预言机在实际错误上的表现

Tiancheng Ma, Nasir U. Eisty

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究大语言模型能否从自然语言业务需求生成测试预言机,提出基于Defects4J的流程,对10个实际错误进行实验,评估预言机在与需求衍生预言机及被测系统一致性上表现,发现大语言模型有泛化但存在差异,为后续研究提供可行性参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30944 2026-07-01 eess.AS cs.SD 新提交 85%

Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation

保留语音到文本LLM能力的语音到语音生成

Yuxuan Hu, Heng Lu, Ruchao Fan, Yao Qian, Xiaofei Wang, Jian Xue, Heming Wang, Shuohang Wang, Young Jin Kim, Yelong Shen, Jinyu Li

机构 * Microsoft(微软)

专题命中 预训练与数据 :LLM(title,title_cn)

AI总结 提出PRIME-Speech框架,通过冻结骨干网络并仅训练语音生成模块,在保持语音到文本性能的同时实现高质量语音到语音转换,支持多轮对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27655 2026-06-29 cs.CV 新提交 85%

Temporal-Emerged Prompting for Segment Anything in Multiframe Infrared Small Target Detection

时间涌现提示用于多帧红外小目标检测中的Segment Anything

Yinghui Xing, Donghao Chu, Shizhou Zhang, Di Xu

专题命中 预训练与数据 :prompting(title,abstract);foundation model(abstract);pretraining(abstract)

AI总结 提出TEP-SAM框架,通过联合建模全局运动模式和局部运动偏差,利用时间涌现线索提示SAM,实现低信噪比红外序列中小目标的精准定位与分割。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06398 2026-08-10 cs.AI 新提交 84%

EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs

EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由

Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EntropyMoE针对无分词器字节级LLM的块计算局限性,提出基于块熵的稀疏专家路由MoE架构,在降低位每字节的同时保持下游准确率,扩展了MoE建模的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06283 2026-08-07 cs.LG math.OC math.PR stat.ML 新提交 84%

The Tamed Subgradient Unadjusted Langevin Algorithm beyond Convexity

超越凸性的驯服次梯度未校正朗之万算法

Iosif Lytras, Nikolaos Makras, Sotirios Sabanis

机构 * University of Edinburgh(爱丁堡大学) National Technical University of Athens(雅典国立技术大学) Athena/Archimedes Research Centre(雅典娜/阿基米德研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文针对非光滑、超线性梯度增长且非凸的目标分布采样问题,提出SG-TULA算法,推导其非渐近收敛界,验证假设并用于GPT-2系列LLM预训练,效果优于AdamW等。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26178 2026-07-30 cs.CL 新提交 84%

DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues

DuplexGen:人机交替对话的自适应合成

Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Seoul National University(首尔大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 DuplexGen框架通过将LLM预测与少量槽级人类偏好标注校准,生成场景自适应交替发言对话,契合人类偏好的效果优于未校准方法,证明人类校准对交替发言合成场景特定性的关键作用。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25198 2026-07-02 cs.AI 新提交 84%

Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and Novelty

Heuresis: 自主AI研究智能体在质量、多样性和新颖性上的搜索策略

Antonis Antoniades, Deepak Nathani, Ritam Saha, Alfonso Amayuelas, Ivan Bercovich, Zhaotian Weng, Vignesh Baskaran, Kunal Bhatia, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Hexo AI

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出Heuresis框架,将研究流程抽象为通用原语,实现开放科学探索;在三个领域评估六种搜索策略,发现完全新颖的想法罕见且无法达到最高性能,揭示了当前策略无法扩展质量-新颖性前沿的挑战。

Comments 14 pages main text, 82 pages total including appendix; 38 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17526 2026-06-17 cs.LG 新提交 84%

MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization

MGUP:一种用于随机优化的动量-梯度对齐更新策略

Da Chang, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08148 2026-08-11 cs.LG cs.AI 新提交 84%

DoGMA: A Central-Dogma-Guided Foundation Model for Multi-Omics Alignment and Multi-Task Learning in Oncology

DoGMA:一种用于肿瘤学多组学对齐与多任务学习的中心法则引导基础模型

Junfei Ling, Bangzheng Pu, Bingsen Xue, Tianle Li, Ruying Hu, Cheng Jin

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出中心法则引导的多组学基础模型DoGMA,通过Transformer-MoE架构结合定向注意力与掩码分层多组学重构预训练,在泛癌多组学下游任务中展现出优异性能,为多组学注意力机制设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05076 2026-08-06 cs.LG cs.AI eess.SP 新提交 84%

MultiPathFormer: Towards a Foundation Model for Multipath Wireless Propagation

MultiPathFormer:迈向多径无线传播的基础模型

Blessed Guda, Kayley Sze, Carlee Joe-Wong

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出MultiPathFormer,以多径传播为预训练对象,结合Environmental RAG机制,在27种环境预训练后,在多项无线通信下游任务中超越SOTA模型,验证了路径级预训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15267 2026-07-17 cs.AI cs.CL 新提交 84%

Pretraining Data Can Be Poisoned through Computational Propaganda

预训练数据可通过计算宣传被下毒

Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现预训练数据可通过公共讨论界面被下毒,引入HalfLife方法衡量恶意内容,探索在网络规模下毒预训练语料库的可行性,证明估计毒注入重要性,确立第三方网页内容为攻击语言模型预训练的可能载体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11508 2026-07-14 cs.LG cs.AI stat.ML 新提交 84%

CDFM: Towards a General-Purpose Causal Discovery Foundation Model

CDFM:迈向通用因果发现基础模型

Jie Qiao, Ruichu Cai, Zijian Li, Weilin Chen, Pengfei Hua, Boyan Xu, Zhengming Chen, Zhifeng Hao, Peng Cui

机构 * School of Computer Science, Guangdong University of Technology, Guangzhou, China(广东技术大学计算机科学学院) College of Mathematics and Computer, Shantou University, Shantou, China(汕头大学数学与计算机学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对因果发现中特定数据集方法的局限,提出通用框架CDFM,通过研究因果可识别性理论边界构建变分框架,将未知因果机制视为潜在变量,经大量合成模型预训练,性能优于传统算法,推动因果发现范式转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06617 2026-07-09 cs.LG cs.AI 新提交 84%

Inertia-1: An Open Exploration of Wearable Motion Foundation Models

Inertia-1:可穿戴运动基础模型的开放探索

Zongzhe Xu, Aakarsh Anand, Sarah Jiang, Chuntung Zhuang, Zitao Shuai, Sriram Sankararaman, Yuzhe Yang

机构 * John Hopkins University(约翰·霍普金斯大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究可穿戴运动基础模型,利用大量加速度计数据构建框架,涵盖数据、模型和训练选择等,通过多数据集评估得出有趣发现,不仅提供先进方法,还为可穿戴运动表示学习提供全面实用开放指南。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00293 2026-07-02 cs.CV cs.CL cs.LG 新提交 84%

Rosetta: Composable Native Multimodal Pretraining

Rosetta: 可组合的原生多模态预训练

Xiangyue Liu, Zijian Zhang, Miles Yang, Zhao Zhong, Liefeng Bo, Ping Tan

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 提出Rosetta框架,通过动量锚定正交投影(MAOP)实现无损模态扩展,解决多模态预训练中的灾难性遗忘和梯度冲突问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24998 2026-06-25 cs.LG cs.AI 新提交 84%

Internal Data Repetition Destroys Language Models

内部数据重复破坏语言模型

Jessica Chudnovsky, Joshua Kazdan, Noam Levi, Rylan Schaeffer, Yegor Denisov-Blanch, Bo He, Mehmet Donmez, Sanmi Koyejo, David Donoho

机构 * Stanford Computer Science(斯坦福大学计算机科学系) Stanford Statistics(斯坦福大学统计学系) Tel Aviv University(特拉维夫大学) IMC Trading

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究重复数据对语言模型的影响,通过无重复缩放定律量化计算等效损失,发现重复次数存在最坏点,且该点随模型规模呈幂律增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20673 2026-06-25 cs.LG cs.AI cs.CV 新提交 84%

NeuroShield: A Device-Agnostic Foundation Model for EEG Authentication

NeuroShield: 一种设备无关的EEG认证基础模型

Matin Fallahi, Patricia Arias-Cabarcos, Thorsten Strufe

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Joint Research Centre, European Commission(欧盟委员会联合研究中心)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对EEG认证中模型因采集设备差异而难以复用的问题,提出NeuroShield基础模型,采用双阶段Transformer架构从变通道、变长度EEG中学习身份判别嵌入,在三个公开数据集预训练后,微调后等错误率降低0.44-8.06个百分点,并泛化至未见过的通道布局和更长信号段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21885 2026-06-23 cs.LG cs.AI 新提交 84%

Cohort-Anchored Foundation Models for Electronic Health Records: From Risk Scores to Auditable Peer Cohorts

基于队列锚定的电子健康记录基础模型:从风险评分到可审计的同行队列

Kaiping Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出CAFM框架,将患者队列作为一等对象融入学习流程,通过四个阶段提升数据质量、组织表示并支持可审计决策,以解决基础模型在临床部署中的可解释性、分布偏移和临床对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20812 2026-06-23 cs.LG cs.AI 新提交 84%

B[FM]$^2$: Brain Foundation Model via Flow Matching with SplitUNet

B[FM]$^2$: 基于流匹配与SplitUNet的脑基础模型

Jaedong Hwang, Kathleen Zhang, Wei Dai, Konstantinos Kontras, Maarten Vanmarcke, Maarten De Vos, Ila Fiete, Paul Pu Liang

机构 * Massachusetts Institute of Technology(麻省理工学院) KU Leuven(鲁汶大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出B[FM]$^2$,通过连续时间流匹配直接在原始EEG信号上预训练,避免离散化带来的时间动态损失,并设计SplitUNet网络处理时间-电极不对称性,在9个下游任务中7个达到最优,预训练数据量减少约30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17289 2026-06-23 cs.AI cs.CL 新提交 84%

Nothing from Something: Can a Language Model Discover 0?

无中生有:语言模型能否发现0?

Phoebe Zeng, Thomas L. Griffiths, Brenden M. Lake

机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型能否独立发现“零”的概念,通过算术任务测试,发现GPT-2规模模型无法在测试时泛化,但少量示例训练后显著提升,且语言预训练减少所需示例约50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20089 2026-06-19 cs.CL cs.AI 新提交 84%

IHUBERT: Vector-Based Semantic Deduplication and Domain-Balanced Pretraining for Persian Resources

IHUBERT: 面向波斯语资源的基于向量的语义去重与领域平衡预训练

Arash Ghafouri, Mahdi Firouzmandi, Hossein Saberi, Mohammad Reza Hasani Ahangar

机构 * Department of Artificial Intelligence and Cognitive Science, Imam Hossein Comprehensive University(人工智能与认知科学系,伊玛目·侯赛因综合大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出IHUBERT,一个基于RoBERTa-base的波斯语预训练模型,通过多阶段预处理(包括基于向量数据库的语义去重和领域平衡)在45GB语料上训练,在多项NLU任务上取得领先结果,尤其抽取式问答表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交 84%

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12595 2026-06-12 cs.LG cs.AI cs.CV 新提交 84%

Emerging Flexible Designs for Geospatial Multimodal Foundation Models

地理空间多模态基础模型的新兴灵活设计

Philipe Dias, Waqwoya Abebe, Abhishek Potnis, Aristeidis Tsaris, Dan Lu, Xiao Wang, Dalton Lunga

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文系统比较了不同架构的地理空间基础模型,在统一设置下评估其灵活性与性能,为多模态推理提供设计指导。

详情

展开后加载摘要…

URL PDF HTML 收藏