arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-02 至 2026-06-02 共收录 849 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 62 篇

2606.00683 2026-06-02 cs.CL 77%

OCC-RAG: Optimal Cognitive Core for Faithful Question Answering

OCC-RAG:面向忠实问答的最优认知核心

Maksim Savkin, Mikhail Goncharov, Alexander Gambashidze, Alla Chepurova, Dmitrii Tarasov, Nikita Andriianov, Daria Pugacheva, Vasily Konovalov, Andrey Galichin, Ivan Oseledets

机构 * OCC Team(OCC团队)

专题命中 预训练与数据 :language model(abstract);small language model(abstract);SLM(abstract_cn);分类 cs.CL

AI总结 提出OCC-RAG,一种通过多上下文多跳合成数据训练的小语言模型,在忠实问答任务中匹配或超越2-6倍规模通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12081 2026-06-02 cs.IR cs.LG 77%

From Scaling to Structured Expressivity: Rethinking Transformers for CTR Prediction

从规模到结构化表达能力:重新思考用于CTR预测的Transformer

Bencheng Yan, Yuejie Lei, Zhiyuan Zeng, Zheye Deng, Di Wang, Kaiyi Lin, Pengjie Wang, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对CTR预测中Transformer模型因结构错位导致收益递减的问题,提出Field-Aware Transformer (FAT),通过场感知参数重构和基组合超网络实现结构化表达能力,在理论(Rademacher复杂度标度律)和实验(AUC提升+4.38%,线上CTR+2.33%,RPM+0.66%)上均优于现有方法。

Comments KDD 2026; The first four authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01155 2026-06-02 cs.LG cs.AI 76%

When Data Is Scarce: Scaling Sparse Language Models with Repeated Training

当数据稀缺时:通过重复训练扩展稀疏语言模型

Boqian Wu, Qiao Xiao, Patrik Okanovic, Tomasz Sternal, Maurice van Keulen, Mykola Pechenizkiy, Elena Mocanu, Torsten Hoefler, Decebal Constantin Mocanu

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of Luxembourg(卢森堡大学) University of Twente(埃因霍温大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 预训练与数据 :language model(title);分类 cs.AI、cs.LG

AI总结 研究数据受限下稀疏训练的可扩展性,提出包含活跃参数、唯一标记、数据重复和稀疏度的缩放定律,发现稀疏训练可延迟数据饱和并改善资源权衡。

Comments Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00884 2026-06-02 cs.LG cs.AI 73%

Dive into Waves: Morlet Spectral Transformer for Cross-Subject Emotion Decoding from EEG

深入波动:用于跨被试脑电情绪解码的Morlet谱变换器

Jiaxin Qing, Lexin Li

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对脑电情绪识别中跨被试变异性问题,提出基于Morlet小波标记化、长上下文基线去除和频带特定空间投影的Morlet谱变换器(MST),无需预训练即可在SEED系列数据集上超越大型预训练模型和频域方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00703 2026-06-02 cs.IT cs.AI cs.LG math.IT 73%

Information-Theoretic Lower Bounds for Bit-Constrained Stochastic Optimization via a Reduction to Compressed Gaussian Mean Estimation

通过约化到压缩高斯均值估计的比特约束随机优化的信息论下界

Munsik Kim

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过将强凸二次族优化问题精确约化为交互式压缩高斯均值估计问题,推导出比特约束随机优化的无条件下界,并给出近乎匹配的可实现性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04127 2026-06-02 cs.LG cs.CL cs.CY 73%

Position: the Stochastic Parrot in the Coal Mine. Model Collapse is a Threat to Low-Resource Communities

立场:煤矿中的随机鹦鹉。模型崩溃对低资源社区的威胁

Devon Jarvis, Richard Klein, Benjamin Rosman, Steven James, Stefano Sarao Mannelli

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨模型崩溃(生成模型在先前模型输出上训练导致的性能下降)如何通过降低训练效率、扭曲数据分布,不成比例地影响低资源和边缘化社区,并呼吁采取行动。

Comments 14 pages, 1 figure, 1 table, International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17034 2026-06-02 cs.LG cs.AI cs.CR 73%

Privacy Policy Enforcement Guardrails for Data-Sensitive Retrieval-Augmented Generation

面向数据敏感检索增强生成的隐私策略执行护栏

Osama Zafar, Alexander Nemecek, Yiqian Zhang, Wenbiao Li, Debargha Ganguly, Vikash Singh, Vipin Chaudhary, Erman Ayday

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对RAG系统中上下文数据泄露问题,提出基于双单类密度估计器与融合文本嵌入的隐私策略执行框架,在医学、金融和法律领域实现高AUROC和低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00696 2026-06-02 stat.ML cs.CL cs.LG 73%

Adaptive Querying with AI Persona Priors

基于AI人格先验的自适应查询

Kaizheng Wang, Yuhang Wu, Assaf Zeevi

机构 * Department of Industrial Engineering and Operations Research and Data Science Institute, Columbia University(工业工程与运筹学系及数据科学研究所,哥伦比亚大学) Decision, Risk, and Operations Division, Columbia Business School(决策、风险与运营部门,哥伦比亚商学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种基于AI人格诱导的潜变量模型,利用大语言模型生成响应分布,实现高效贝叶斯设计,用于在有限查询预算下学习用户相关量。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02528 2026-06-02 cs.AI cs.LG 73%

Multimodal Function Vectors for Visual Relations

视觉关系的多模态函数向量

Shuhao Fu, Esther Goldberg, Ying Nian Wu, Hongjing Lu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过因果中介分析提取多模态函数向量,操纵注意力头以改善视觉关系推理,并实现零样本和微调性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01906 2026-06-02 cs.AI 70%

Bayesian Spectral Emotion Transition Discovery from Multi-Annotator Disagreement

贝叶斯谱情感转移发现:来自多标注者分歧

Keito Inoshita, Takato Ueno

机构 * Keio University(庆应大学) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出贝叶斯谱情感转移发现(BSETD)两阶段框架,从多标注者软标签中挖掘情感转移结构,并通过谱分解分离惯性与传染成分,在EmotionLines数据集上验证了与心理学理论的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01289 2026-06-02 cs.LG 70%

Feature to Dynamics: Feature-space to Autoregression strategy for Zero-shot Time Series Forecasting

从特征到动态:面向零样本时间序列预测的特征空间到自回归策略

Yifan Wu, Junjie Wu, Kai Wu, Xiaoyu Zhang, Jian Lou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出FSA框架,通过从可解释特征空间到自回归策略空间的映射,在零样本单变量时间序列预测中引入显式归纳偏置,分离全局趋势、周期成分和局部动态,以更少数据假设实现跨域泛化,在受控实验中优于Transformer架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02277 2026-06-02 cs.CL 70%

CECOR: Correction-oriented synthetic data construction for factual error correction

CECOR:面向事实错误纠正的修正导向合成数据构建

Lei Zhu, Xiaobao Wang, Jianbiao Yang, Chenyang Wang, Dongxiao He, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出CECoR框架,通过分解与注入范式合成高质量训练数据,结合两阶段学习策略,有效提升多跳事实错误纠正的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29948 2026-06-02 cs.SD cs.AI eess.AS 70%

HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

HoliTok: 一种具有鲁棒的双重语音生成与理解能力的连续整体式分词

Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) hi lab, Xiaohongshu Inc, China(hi实验室,小红书公司,中国)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 提出HoliTok连续整体式语音分词模型,通过渐进训练策略联合保持信号保真度、融入语义信息并维持潜在可学习性,基于该分词构建统一AR+DiT模型实现语音合成与识别,实验证明其在统一生成-理解架构中无需额外优化即可鲁棒运行。

Comments 14 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03309 2026-06-02 cs.CV cs.AI 70%

VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models

VLM4VLA:重新审视视觉-语言-动作模型中的视觉-语言模型

Jianke Zhang, Xiaoyu Chen, Qiuyue Wang, Mingsheng Li, Yanjiang Guo, Yucheng Hu, Jiajun Zhang, Shuai Bai, Junyang Lin, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Qwen Team, Alibaba Inc.(阿里巴巴公司Qwen团队)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文通过VLM4VLA最小适配管道,系统研究视觉-语言模型(VLM)的选择和能力如何影响下游视觉-语言-动作(VLA)策略性能,发现VLM通用能力无法预测下游任务表现,且视觉模块是性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01955 2026-06-02 cs.RO cs.CV 67%

WALL-WM: Carving World Action Modeling at the Event Joints

WALL-WM:在事件关节处雕刻世界动作建模

Shalfun Li, Victor Yao, Charles Yang, Truth Qu, Regis Cheng, Ryan Yu, Howard Lu, Newton Von, Vincent Chen, Yohann Tang, Maeve Zhang, Ellie Ma, Gody Li, Sage Yang, Lorien Shu, J. W. Gao, Ethan Chen, Colin Ye, Yu Sun, Elise Mon, PS Zhang, Neo Li, Lily Li, James Wang, Ping Yang, Chris Pan, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

机构 * X Square Robot Team(X Square机器人团队)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 提出WALL-WM世界动作模型,通过事件级视觉-语言-动作预训练解决固定长度动作块与语言、视觉、动作之间的粒度不匹配问题,实现跨语言、场景和任务的泛化,在大规模真实世界评估中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01788 2026-06-02 cs.CV 67%

PlatonicNav: Unveiling Semantic Correspondence in Navigation with Platonic Topological Maps

PlatonicNav: 在导航中揭示柏拉图式拓扑地图的语义对应

Junlin Long, Zeyu Zhang, Xu Deng, Yiran Wang, Yue Yang, Luke Borgnolo, Maxwell Twelftree, Yang Zhao

机构 * USYD(新南威尔士大学) Maincode UNSW(新南威尔士大学) La Trobe(拉特罗布大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 提出PlatonicNav框架,通过自监督视觉编码器构建柏拉图式拓扑地图,无需跨模态训练即可统一视觉目标导航、跨模态目标导航和视觉语言导航任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11903 2026-06-02 cs.CL 65%

GeistBERT: Breathing Life into German NLP

GeistBERT: 为德语 NLP 注入活力

Raphael Scheible-Schmitt, Johann Frei

专题命中 预训练与数据 :language model(abstract,journal_ref);分类 cs.CL;large language model(journal_ref)

AI总结 通过在大规模德语语料库上使用 RoBERTa 架构和 Whole Word Masking 进行增量预训练,GeistBERT 在多项德语 NLP 任务上取得了领先性能,并在 GermEval 2018 细粒度文本分类中达到新 SOTA。

Journal ref Proceedings of the Workshop on Beyond English: Natural Language Processing for all Languages in an Era of Large Language Models, 2025, pp. 42-50

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02434 2026-06-02 cs.AI 57%

Bridging the Sim-to-Real Gap in Semiconductor Visual Program Synthesis via Input Binarization

通过输入二值化弥合半导体视觉程序合成中的仿真到现实差距

Yusuke Ohtsubo, Kota Dohi, Koichiro Yawata, Koki Takeshita, Tatsuya Sasaki

机构 * National Institute of Information and Communications Technology, Japan(日本信息通信技术全国研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 提出一种视觉程序合成框架,利用输入二值化策略消除扫描电子显微镜图像的纹理和噪声,使视觉语言模型专注于几何结构,从而弥合仿真到现实的差距,在MIIC数据集上将平均Dice系数从0.4393提升至0.5256。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01702 2026-06-02 cs.GR cs.LG 57%

KDH-CAD: Knowledge-data hybrid CAD learning under data scarcity

KDH-CAD:数据稀缺下的知识-数据混合CAD学习

Ziqin Gao, Zhijie Yang, Qiang Zou

机构 * State Key Laboratory of CAD \& CG, Zhejiang University, Hangzhou, 310027, China

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 提出KDH-CAD框架,融合预训练基础模型、结构化领域知识和少量标注CAD数据,在数据稀缺下实现高效机械零件分类,准确率达92.6%(250样本)和95.8%(1000样本)。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00121 2026-06-02 cs.CV cs.AI 57%

Versatile Framework with Semantic and Structural guidance for Image Reconstruction from Brain Activity

基于语义和结构引导的大脑活动图像重建通用框架

Yizhuo Lu, Changde Du, Qiongyi Zhou, Liuyun Jiang, Huiguang He

机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 提出MindDiffuser两阶段框架,结合CLIP文本嵌入和视觉特征,通过Stable Diffusion生成语义图像并迭代优化结构信息,在fMRI、EEG、MEG三种模态上显著提升图像重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21364 2026-06-02 cs.CL 57%

SindBERT, the Sailor: Charting the Seas of Turkish NLP

SindBERT,水手:绘制土耳其语NLP的海洋

Raphael Schmitt, Stefan Schweter

机构 * School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院) Institute of General Practice, Faculty of Medicine and Medical Center, University of Freiburg(弗赖堡大学医学系一般实践研究所) Independent Researcher(独立研究者)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 针对形态丰富语言预训练不足的问题,提出首个大规模土耳其语RoBERTa编码器SindBERT,在多个任务上表现有竞争力,并揭示了基准饱和与语料质量的重要性。

Comments Published at SIGTURK 2026, co-located with EACL 2026

Journal ref Proceedings of the Second Workshop on Natural Language Processing for Turkic Languages (SIGTURK 2026), pp. 1-13, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13774 2026-06-02 cs.LG cs.CV 57%

UrbanFusion: Stochastic Multimodal Fusion for Contrastive Learning of Robust Spatial Representations

UrbanFusion: 用于鲁棒空间表示对比学习的随机多模态融合

Dominik J. Mühlematter, Lin Che, Ye Hong, Martin Raubal, Nina Wiedemann

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出UrbanFusion模型,通过随机多模态融合(SMF)和Transformer模块整合街景、遥感、地图和POI数据,在56个城市41项任务中优于现有GeoAI模型。

Journal ref International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01819 2026-06-02 cs.CV eess.IV 50%

Hist2Style: Histogram-Guided Stylization with Bilateral Grids

Hist2Style: 基于双边网格的直方图引导风格化

Dekel Galor, Adam Pikielny, Zhoutong Zhang, Ke Wang, Laura Waller, Jiawen Chen, Ilya Chugunov

机构 * Adobe Nextcam University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出Hist2Style,利用双边网格实现快速、边缘感知的逼真风格迁移,通过蒸馏大模型为轻量网络,并基于直方图嵌入提供可解释的用户控制。

Comments 10 pages, 8 figures. Extended results are at https://www.dekelgalor.com/hist2style

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01631 2026-06-02 cs.MM 50%

TimeLogic Challenge @ CVPR 2026: Strong MLLMs Meet Evidence-Seeking Agents for Temporal-Logic Video Question Answering

TimeLogic Challenge @ CVPR 2026: 强多模态大语言模型遇见面向时序逻辑视频问答的证据搜索智能体

Zhaoyang Xu, Xusheng He, Wei Liu, Zhenyang Li, Jianlong Wu

专题命中 预训练与数据 :language model(abstract)

AI总结 提出一种基于证据搜索智能体的无训练时序逻辑视频问答方法,通过多粒度采样工具包和分类引导策略,在TimeLogic测试集上达到77.13 AvgAcc。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01362 2026-06-02 cs.GR cs.CV 50%

AlbedoEdit: Unified Instance-Level Video Editing with Albedo Guidance

AlbedoEdit: 基于反照率引导的统一实例级视频编辑

Xilong Zhou, Bao-Huy Nguyen, Zheng Zeng, Jacob Munkberg, Jon Hasselgren, Thomas Leimkühler, Nima Kalantari, Miloš Hašan, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) University of California Santa Barbara(加州大学圣巴巴拉分校) NVIDIA Research(NVIDIA研究) Texas A & M University(德克萨斯A&M大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 提出 AlbedoEdit,一个统一框架,利用反照率图实现对象插入、移除和纹理编辑,通过微调视频基础模型,在合成数据集上训练,实现编辑内容的和谐融合与复杂视觉效果模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01259 2026-06-02 cs.CE 50%

MsFEM-Inspired CNNs with Transfer Learning for Multiscale Model Reduction

受MsFEM启发的卷积神经网络与迁移学习用于多尺度模型降阶

Xuehan Zhang, Lijian Jiang, Eric T. Chung

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出一种受多尺度有限元法(MsFEM)启发的迁移学习策略(MITL),通过预训练基础CNN和系数CNN,仅需训练轻量级适应网络即可高效处理不同源项、边界条件或微分算子的多尺度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01157 2026-06-02 cs.CV 50%

HiTokSR: A Coarse-to-Fine Tokenizer with Hierarchical Codebooks for High-Fidelity Real-World Image Super-Resolution

HiTokSR: 一种用于高保真真实世界图像超分辨率的具有层次化码本的从粗到细分词器

Mingxi Li

机构 * com(163.com)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 提出HiTokSR层次化标记预测框架,通过将潜在空间沿通道维度划分为频率感知组并独立量化,解耦全局结构与细节,结合视觉基础模型先验和索引级扰动策略,实现真实世界图像超分辨率的最优感知质量和重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00782 2026-06-02 cs.CV 50%

FlowOVD: Learning Generative Latent Flows for Zero-shot Open-vocabulary Detection

FlowOVD: 学习生成式潜在流用于零样本开放词汇检测

Yao Wei, Andrea Cavallaro, Changjae Oh

机构 * Queen Mary University of London(伦敦女王学院) EPFL(瑞士联邦理工学院)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出FlowOVD,基于修正流的文本条件查询生成框架,通过连续潜在查询动态实现开放词汇检测,在COCO和LVIS上分别达到49.5 AP和31.5 AP,优于GroundingDINO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00751 2026-06-02 cs.CV 50%

Head-Pose-Aware Visual Speech Recognition with FiLM Modulation

基于FiLM调制的头部姿态感知视觉语音识别

Matthew Kit Khinn Teng, Haibo Zhang, Takeshi Saitoh

机构 * Department of Artificial Intelligence, Kyushu Institute of Technology(人工智能系,九州工业大学)

专题命中 预训练与数据 :language model(abstract)

AI总结 提出HP-VSR-ResFiLM框架,通过姿态条件残差FiLM模块显式融入头部姿态信息,在LRS2和LRS3上分别达到25.0%和33.2%的词错误率,有效提升非正面视角下视觉语音识别的鲁棒性。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30877 2026-06-02 cs.RO 50%

Wall-OSS-0.5 Technical Report

Wall-OSS-0.5 技术报告

Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出Wall-OSS-0.5,一个基于3B VLM骨干网络并增强动作生成组件的4B开源VLA模型,通过梯度桥接联合训练策略,在超过20个实体上预训练,实现零样本真实机器人行为,并在微调后超越π_0.5,证明VLA预训练本身即可产生可执行的机器人能力。

详情

展开后加载摘要…

URL PDF HTML 收藏