arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-16 至 2026-06-16 共收录 644 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 39 篇

2602.11543 2026-06-16 cs.CL 版本更新 94%

Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm

使用分布式GPU预训练大型语言模型:一种内存高效的分散式范式

Jinrui Zhang, Chaodong Xiao, Aoqi Wu, Xindong Zhang, Lei Zhang

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) OPPO Research Institute(OPPO研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);pretraining(title,abstract)

AI总结 提出SPES框架,通过分散式训练MoE LLM的子集专家降低内存需求,结合专家合并预热策略,在16个48GB GPU上训练2B参数模型,性能媲美集中式训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15868 2026-06-16 cs.LG 新提交 92%

David vs. Goliath in Next Activity Prediction: Argmax vs. LSTM, Transformer, and LLM

下一活动预测中的大卫与歌利亚:Argmax 与 LSTM、Transformer 和 LLM

Hans Weytjens, Ingo Weber

机构 * Technical University of Munich(慕尼黑工业大学) Fraunhofer Gesellschaft(弗劳恩霍夫协会)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过系统基准测试,比较了简单计数 argmax 基线、LSTM、Transformer 和 LLM 在下一活动预测中的性能,发现 argmax 基线在多数数据集上可媲美或接近十亿参数 LLM。

Comments Accepted for 24th International Conference on Business Process Management (2026) Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15325 2026-06-16 cs.CL 新提交 92%

Prior over Evidence: Stereotype-Driven Diagnosis in LLM-Based L2 Pronunciation Feedback

先验优于证据:基于LLM的二语发音反馈中的刻板印象驱动诊断

Rong Wang, Kun Sun

机构 * University of Tuebingen(蒂宾根大学) Tongji University(同济大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究测试了LLM在二语发音反馈中是否基于语音证据而非预训练先验进行诊断,发现评分准确性与推理脱钩,音素级反馈收敛于固定困难音素集,且声学证据仅在直接探测目标维度时改善评分。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23878 2026-06-16 cs.LG cs.AI 版本更新 91%

AC-ODM: Actor--Critic Online Data Mixing for Sample-Efficient LLM Pretraining

AC-ODM: 面向样本高效LLM预训练的演员-评论家在线数据混合

Jing Ma, Chenhao Dang, Mingjie Liao

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 提出AC-ODM方法,从强化学习视角优化预训练数据混合,通过参数化策略实现梯度构造性干扰最大化,支持代理与非代理两种模式,显著提升收敛速度和下游任务准确率。

Comments ICML 2026 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15521 2026-06-16 cs.CL cs.LG 新提交 91%

Emergent retokenization symmetry in large language models: phenomenology and applications

大型语言模型中涌现的重分词对称性:现象学与应用

Kanishk Jain, Matthew Day, Tankut Can

机构 * Department of Physics, Emory University(埃默里大学物理系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究发现大型语言模型在训练中部分涌现出重分词对称性,通过重分词实验探测模型对语义等价输入表示的敏感性和鲁棒性,并提出一种新的推理时采样策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15396 2026-06-16 cs.CL cs.AI 新提交 88%

CHILLGuard: Towards Fine-Grained Chinese LLM Safety Guardrail with Scalable Data Construction and Model-aware Preference Alignment

CHILLGuard:面向细粒度中文大语言模型安全护栏的可扩展数据构建与模型感知偏好对齐

Wenbo Yu, Bohua Wang, Hao Fang, Kuofeng Gao, Jingru Zeng, Xiaochen Yang, Tianyi Zhang, Xiaoxiao Ma, Jiawei Kong, Hao Wu, Bin Chen, Shu-Tao Xia, Min Zhang

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen ShenNong Information Technology Co., Ltd.(深圳神农信息技术有限公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对中文场景,提出细粒度风险分类体系(5大类31小类),通过可扩展数据构建管道生成高质量训练数据,并采用模型感知直接偏好优化训练CHILLGuard,在基准上F1分数提升15.92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06184 2026-06-16 cs.SE cs.LG cs.LO cs.PL 84%

Teaching LLMs Program Semantics via Symbolic Execution Traces

通过符号执行轨迹教学LLM程序语义

Jonas Bayer, Stefan Zetzsche, Olivier Bouissou, Remi Delmas, Michael Tautschnig, Soonho Kong

机构 * University of Cambridge(剑桥大学) Amazon Web Services(亚马逊网络服务)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);pretraining(abstract);分类 cs.LG

AI总结 本文通过符号执行轨迹训练提升LLM对程序语义的理解,发现结合推理的训练显著提升了漏洞检测能力,且在不同属性类型上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14752 2026-06-16 cs.CV cs.AI cs.LG cs.RO 新提交 84%

X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining

X-Tokenizer: 一种用于视觉-语言-动作预训练的多模态动作分词器

Miracle Kang, Lights Shi, Lucy Liang, Roy Gan, Dongxiu Liu, Pushi Zhang, Sylas Chen, Shawn Qin, Yinan Zheng, Jinliang Zheng, Hao Wang, Xianyuan Zhan, Hang Su

机构 * Square Robot City University of Hong Kong(香港城市大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出X-Tokenizer,通过语义残差量化(SRQ)和掩码动作建模(MAM)将动作离散化为语义接口,在2.4M轨迹上预训练后提升VLA模型的多模态接地和长程任务性能。

Comments Project page: https://x-square-robot.github.io/X-Tokenizer_projectPage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16899 2026-06-16 cs.LG 新提交 84%

Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization

奇妙预训练优化器及其发现之处 II:超球优化

Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 针对Muon等优化器在大模型预训练中增益随规模增大而减弱的问题,提出Hyperball包装器,固定权重矩阵及其更新的Frobenius范数,在1.2B参数模型上实现20-30%的token等效加速,并改善学习率迁移。

Comments Corresponding blog post: https://psychedelic-sunstone-851.notion.site/Fantastic-Pretraining-Optimizers-and-Where-to-Find-Them-2-1-Hyperball-Optimization-2e924306e6f280e7a5ffee00eb40a0dd

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15129 2026-06-16 cs.CV cs.AI 新提交 83%

EyeMVP: OCT-Informed Fundus Representation Learning via Paired CFP--OCT Pretraining

EyeMVP: 通过配对CFP-OCT预训练实现OCT启发的眼底表征学习

Zhuo Deng, Ruiheng Zhang, Ziheng Zhang, Weihao Gao, Yitong Li, Qian Wang, Lei Shao, Jiaoyue Dong, Zhixi Zeng, Lijian Fang, Haibo Wang, Xiaobin Lin, Tao Liu, Zhicheng Du, Zhengwei Zhang, Lin Yang, Zheng Gong, Xinyu Zhao, Zhenquan Wu, Fang Li, Zhiguang Zhou, Guoming Zhang, Sun Jing, Han Lv, Wenbin We, Lan Ma

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Beijing Tongren Eye Center, Beijing Tongren Hospital, Capital Medical University(首都医科大学附属北京同仁医院北京同仁眼科中心) Liangxiang Hospital of Beijing Fangshan District, Capital Medical University(首都医科大学北京市房山区良乡医院) The Third People's Hospital of Dalian(大连市第三人民医院) National Clinical Research Center for Endocrine and Metabolic Diseases, The Second Xiangya Hospital of Central South University(中南大学湘雅二医院国家内分泌代谢病临床医学研究中心) The Central Hospital of Baoji City(宝鸡市中心医院) Wuxi No.2 People's Hospital, Affiliated Wuxi Clinical College of Nantong University(南通大学附属无锡临床学院无锡市第二人民医院) Shenzhen Eye Hospital, Southern Medical University(南方医科大学深圳眼科医院) Beijing Friendship Hospital, Capital Medical University(首都医科大学附属北京友谊医院)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出跨模态视网膜基础模型EyeMVP,利用配对CFP-OCT预训练,通过跨模态掩码重建将OCT结构信息注入CFP表征,在16项下游任务中优于现有模型,尤其对黄斑疾病诊断有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14760 2026-06-16 cs.CV cs.AI 新提交 83%

GeoRoPE: Ground-Aware Rotary Adaptation for Remote Sensing Foundation Models

GeoRoPE: 面向遥感基础模型的地面感知旋转适配

Yu Luo, Kun Hu, Mengwei He, Xiaogang Zhu, Shan Zeng, Allen Benter, Wei Xiang, Patrick Filippi, Thomas Francis Bishop, Zhiyong Wang

机构 * The University of Sydney(悉尼大学) Edith Cowan University(埃迪斯科文大学) Adelaide University(阿德莱德大学) Wuhan Polytechnic University(武汉轻工大学) Climate, Orange Agricultural Institute(气候研究所,奥兰治农业研究所) La Trobe University(拉筹伯大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出GeoRoPE方法,通过地理坐标校准和频率校准解决遥感基础模型中的尺度失配问题,提升跨分辨率鲁棒性和尺度敏感表征学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14819 2026-06-16 cs.CL 83%

Testimole-Conversational: A 30-Billion-Word Italian Discussion Board Corpus (1996-2024) for Language Modeling and Sociolinguistic Research

Testimole-Conversational: 一个包含300亿词的意大利讨论板语料库(1996-2024)用于语言建模和社会语言学研究

Matteo Rinaldi, Rossella Varvara, Viviana Patti

机构 * University of Bologna(博洛尼亚大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 该语料库为意大利大语言模型预训练和语言社会学研究提供了丰富的讨论板文本资源,涵盖1996-2024年间超过300亿词的意大利语信息。

Journal ref Proceedings of the 12th Workshop on Challenges in the Management of Large Corpora (CMLC-12) @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12306 2026-06-16 cs.CL 版本更新 83%

A large-scale pipeline for LLM-assisted corpus annotation: variation and change in the English consider construction

基于大语言模型的大规模语料标注流水线:英语consider构式的变异与变化

Cameron Morin, Matti Marttinen Larsson

机构 * Université Paris-Cité(巴黎-城市大学) University of Gothenburg(哥德堡大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种利用大语言模型自动标注大规模语料的四阶段流水线,在历史英语语料库中标注14万条consider构式,准确率超98%,揭示未记录的体裁特异性变化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16307 2026-06-16 cs.AI cs.CL 新提交 82%

State-Grounded Multi-Agent Synthetic Data Generation for Tool-Augmented LLMs

面向工具增强型大语言模型的基于状态的多智能体合成数据生成

Rahul Khedar, Eshita, Sneha Teja Sree Reddy Thondapu, Mayank Malhotra, Arup Das, Jitesh Chandra, Yun-Shiuan Chuang, Chaitanya Kulkarni, Arun Menon, Linsey Pang, Avinash Karn, Mouli V, Prakhar Mehrotra

机构 * PayPal AI

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出StateGen平台,通过四角色LLM循环和状态管理器生成多轮、工具接地的高质量训练对话,消除工具调用幻觉,支持层次化多智能体设置。

Comments 9 pages, 5 figures, 6 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12678 2026-06-16 cs.CV cs.CY 版本更新 82%

No One Knows the State of the Art in Geospatial Foundation Models

没有人知道地理空间基础模型的现状

Isaac Corley, Nils Lehmann, Caleb Robinson, Gabriel Tseng, Anthony Fuller, Hamed Alemohammad, Evan Shelhamer, Jennifer Marcus, Hannah Kerner

机构 * Taylor Geospatial(泰勒地理空间公司) Technical University of Munich(慕尼黑技术大学) Microsoft AI for Good Research Lab(微软AI for Good研究实验室) Allen Institute for AI(艾伦人工智能研究所) Vector Institute(向量研究所) Carleton University(卡尔顿大学) Clark University(克拉克大学) University of British Columbia(不列颠哥伦比亚大学) Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文指出地理空间基础模型缺乏标准化评估和训练协议,提出六项具体期望以促进社区共识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04061 2026-06-16 cs.RO cs.CV 版本更新 82%

CLAP: Contrastive Latent Action Pretraining for Learning Vision-Language-Action Models from Human Videos

CLAP: 从人类视频中学习视觉-语言-动作模型的对比潜在动作预训练

Chubin Zhang, Jianan Wang, Zifeng Gao, Yue Su, Tianru Dai, Cai Zhou, Jiwen Lu, Yansong Tang

机构 * Tsinghua University(清华大学) Astribot University of Hong Kong(香港大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract)

AI总结 提出CLAP框架,通过对比学习将人类视频与机器人动作词汇对齐,利用伪标签训练VLA模型,实现从人类视频到机器人执行的有效技能迁移。

Comments The code is available at: https://github.com/LinShan-Bin/OpenCLAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15984 2026-06-16 cs.CL 新提交 81%

ROMPAR: Morphological Completion and Demographic Unlearning for Romanian-Accented Speech Recognition

ROMPAR:罗马尼亚口音语音识别的形态补全与人口统计去偏

Andrei-Marius Avram, Aureliu-Valentin Antonie, Ştefan-Bogdan Badea, Andrei Florea, Robert-Nicolae Zaharoiu, Dumitru-Clementin Cercel

机构 * National University of Science and Technology POLITEHNICA Bucharest(布加勒斯特理工大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出ROMPAR语料库和多任务对抗训练框架,通过指数衰减机制和LLM引导解码,实现人口统计不变性和形态补全,WER显著降低,形态重建F1达96.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00074 2026-06-16 q-bio.GN cs.AI 版本更新 81%

CRC-Screen: Certified DNA-Synthesis Hazard Screening Under Taxonomic Shift

CRC-Screen:分类偏移下认证的DNA合成危害筛查

Najmul Hasan

机构 * Najmul Hasan(纳杰姆·哈桑)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对DNA合成订单中危害序列因分类偏移导致基线筛查100%误报的问题,提出基于k-mer Jaccard相似度、五LLM评委修剪均值和嵌入聚类质心余弦相似度的融合信号,经单调逻辑聚合器和共形风险控制校准,在保证假阴性率受控的同时实现零漏检和低误报。

Comments Accepted at the 6th Muslims in ML (MusIML) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22777 2026-06-16 cs.CL 版本更新 81%

RASST: Retrieval-Augmented Simultaneous Speech Translation

RASST:检索增强的同声传译

Jiaxuan Luo, Siqi Ouyang, Jiaxing Xu, Lei Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对同声传译中罕见术语翻译不准的问题,提出检索增强方法RASST,通过轻量级语音-文本检索器提供分块术语提示,并合成训练数据教会模型何时应用检索术语,在ACL 60/60和ESO测试集上术语准确率提升近40%,BLEU提升最多3点。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22530 2026-06-16 cs.LG cs.DB 79%

Task-Agnostic Contrastive Pretraining for Relational Deep Learning

关系深度学习中的任务无关对比预训练

Jakub Peleška, Gustav Šír

机构 * Czech Technical University in Prague(捷克技术大学布拉格分校)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出一种任务无关的对比预训练方法,通过三层对比目标提升关系数据的表示学习,实验表明预训练模型在关系数据迁移学习中表现优异。

Comments arXiv admin note: text overlap with arXiv:2506.22199

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12445 2026-06-16 cs.AI cs.LG stat.ML 版本更新 79%

Computational Safety for Generative AI: A Hypothesis Testing Perspective

生成式AI的计算安全性:假设检验视角

Pin-Yu Chen

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从假设检验角度形式化生成式AI的计算安全性,提出基于信号处理的方法检测恶意输入和AI生成内容。

Comments Extended version of the paper presented at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15202 2026-06-16 cs.CV 新提交 78%

Comparing Human Gaze and Vision-Language Model Attention in Safety-Relevant Environments

安全相关环境中的人类注视与视觉语言模型注意力的比较

Marta Vallejo, Siwen Wang

机构 * Heriot-Watt University(赫瑞-瓦特大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本研究通过眼动追踪实验和GPT-4o等视觉语言模型,比较了人类与模型在安全相关场景中的注意力分布,发现模型无需训练数据即可近似人类注视模式。

Comments 30 pages, 33 figures. Submitted as a preprint. Code and data available upon reasonable request

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18428 2026-06-16 cs.RO cs.CV 版本更新 78%

Latent Action Pretraining Through World Modeling

通过世界建模的潜在动作预训练

Bahey Tharwat, Yara Nasser, Ali Abouzeid, Ian Reid

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) Alexandria University(亚历山大大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出LAWM框架,通过世界建模从无标签视频中学习潜在动作表征,实现跨任务、环境和本体的迁移学习,在LIBERO基准和真实场景中优于使用真实动作预训练的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17148 2026-06-16 cs.CV 版本更新 78%

MixTeX: Data-Efficient LaTeX OCR via Synthetic Pretraining and Limited Fine-Tuning

MixTeX: 通过合成预训练和有限微调实现数据高效的LaTeX OCR

Yuhan Xu, Yijun Zhao, Renqing Luo, Gary M. Weiss

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出MixTeX,通过合成预训练(无需真实LaTeX源)和少量真实样本微调,实现数据高效的LaTeX OCR,在英中印刷和手写基准上优于依赖大数据集的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15216 2026-06-16 cs.CL cs.AI 新提交 76%

Spokes: Optimizing for Diverse Pretraining Data Selection

Spokes: 优化多样化预训练数据选择

Clarence Lee, Yejin Choi, Luke Zettlemoyer, Pang Wei Koh, Hai Leong Chieu

机构 * DSO National Laboratories(DSO国家实验室) Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI

AI总结 提出基于G-Vendi分数的概率多样化框架,通过指数梯度下降直接优化数据多样性,在FineWeb和DCLM上提升下游性能1.5和1.4个点。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08289 2026-06-16 cs.CR 版本更新 75%

MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks

MIRAGE: 通过黑盒与查询无关的投毒攻击误导检索增强生成

Tailun Chen, Yu He, Yan Wang, Shuo Shao, Haolun Zheng, Zhihao Liu, Jinfeng Li, Zhizhen Qin, Yuefeng Chen, Zhixuan Chu, Zhan Qin, Kui Ren

专题命中 预训练与数据 :LLM(abstract,abstract_cn);preference optimization(abstract)

AI总结 提出MIRAGE,一种在黑盒和查询无关场景下通过多阶段投毒管道攻击RAG系统的方法,利用代理模型反馈、人物驱动查询合成、语义锚定和对抗性TPO优化,显著提升攻击效果和隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16053 2026-06-16 cs.SI cs.CY 新提交 67%

Modeling Engagement with Brand and Organizational TikTok Videos Using Machine-Assisted Theory-Ensemble Annotation

使用机器辅助理论集成标注建模品牌和组织TikTok视频的参与度

Sander Paekivi, Andres Karjus

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 利用多模态大语言模型标注77个理论驱动的结构变量,分析约1万个TikTok视频,以预测参与度并探索短视频文化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15802 2026-06-16 cs.CV 新提交 67%

CPS4: Class Prompt driven Semi-Supervised Spine Segmentation with Class-specific Consistency Constraint

CPS4: 基于类别提示的半监督脊柱分割与类别特定一致性约束

Qingtao Pan, Hongzan Sun, Bing Ji, Shuo Li

机构 * School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院) Department of Nuclear Medicine, Shengjing Hospital of China Medical University(中国医科大学附属盛京医院核医学科) Department of Computer and Data Science, Case Western Reserve University(凯斯西储大学计算机与数据科学系) Department of Biomedical Engineering, Case Western Reserve University(凯斯西储大学生物医学工程系)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 提出CPS4,首个利用文本类别提示增强伪标签质量的半监督脊柱分割网络,通过两阶段训练(VLM预训练和半监督分割)实现,仅用5%标注数据即达80.44% Dice。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16019 2026-06-16 cs.CL cs.LG cs.SD 新提交 62%

Scaling Human and G2P Supervision for Robust Phonetic Transcription

扩展人类与G2P监督以实现鲁棒语音转录

Alexander Metzger, Aruna Srivastava, Ruslan Mukhamedvaleev

机构 * Koel Labs LLC

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究自动语音转录中人类标注与G2P监督的扩展规律,发现当人类标注少于20-30小时时G2P有效,超过后无益甚至降低鲁棒性,而ASR预训练可显著提升性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15695 2026-06-16 cs.LG cs.AI 新提交 62%

When Generator Replay Degrades: Projected Rehearsal Orchestration for Heterogeneous Federated Class-Incremental Learning

当生成器回放退化时:面向异构联邦类增量学习的投影排练编排

Thinh T. H. Nguyen, Khoa D. Doan, Binh T. Nguyen, Danh Le-Phuoc, Kok-Seng Wong

机构 * VinUniversity VNU-HCM, University of Science(胡志明市国家大学理科大学) Technische Universität Berlin(柏林工业大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对异构联邦类增量学习中客户端标签子集不同、任务阶段不一致导致的旧知识遗忘问题,提出投影排练编排框架PRO及增强版PRO-MAX,通过服务器端维护紧凑类级投影记忆并实现平衡伪多任务训练,在图像、文本和图基准上提升异构流下的保留与最终效用。

Comments 46 pages

详情

展开后加载摘要…

URL PDF HTML 收藏