arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-14 至 2026-04-14 共收录 45 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 45 篇

2604.10985 2026-04-14 cs.AI cs.CL cs.CV 91%

Back to the Barn with LLAMAs: Evolving Pretrained LLM Backbones in Finetuning Vision Language Models

回到牛棚与LLAMAs:在微调视觉语言模型中进化预训练LLM骨干

Sameera Horawalavithana, Lauren Phillips, Ian Stewart, Sai Munikoti, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 预训练与数据 :LLM(title,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 研究探讨了在微调视觉语言模型时,不同预训练LLM骨干对下游任务性能的影响,发现新版本LLM并非总能提升性能,且表现依赖具体任务。

Comments Preprint and under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13047 2026-04-14 cs.CL cs.AI cs.LG 90%

Multi-Model Synthetic Training for Mission-Critical Small Language Models

多模型合成训练用于关键任务小型语言模型

Nolan Platt, Pragyansmita Nayak

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);large language model(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用多模型生成技术,将AIS数据转化为问答对,训练出准确率达75%的低成本小型模型,为专业领域AI应用提供可复现的合成数据生成框架。

Comments 8 pages. Accepted as a full paper to the 3rd International Conference on Foundation and Large Language Models (IEEE FLLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10799 2026-04-14 cs.CL cs.AI 90%

Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series

通过优化分词器推动波兰语言建模:Bielik v3 7B和11B系列

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

机构 * SpeakLeash ACK Cyfronet AGH(AGH科技大学计算机中心) Jagiellonian University(雅盖隆大学) Azurro Enelpol

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 本文探讨了Bielik v3系列模型中通过优化分词器提升波兰语言建模性能的方法,包括专有词汇表、嵌入初始化、多阶段预训练和后训练对齐技术。

Comments arXiv admin note: text overlap with arXiv:2601.11579

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17682 2026-04-14 cs.CL cs.AI 88%

Tuning Language Models for Robust Prediction of Diverse User Behaviors

调优语言模型以鲁棒预测多样化用户行为

Fanjin Meng, Jingtao Ding, Jiahui Gong, Chen Yang, Hong Chen, Zuojian Wang, Haisheng Lu, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系,BNRist) Honor Device Co., Ltd(荣耀终端有限公司)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

AI总结 本文提出BehaviorLM,通过分阶段微调提升模型对长尾用户行为的预测能力,实验表明其在两个真实数据集上有效提升了对锚点和长尾行为的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06806 2026-04-14 cs.CL cs.AI 88%

MachineLearningLM: Scaling Many-shot In-context Learning via Continued Pretraining

MachineLearningLM: 通过持续预训练扩展多示例上下文学习

Haoyu Dong, Pengkun Zhang, Mingzhe Lu, Yanzhen Shen, Guolin Ke

机构 * UCAS(中国科学院大学) Microsoft(微软) SCUT(华南理工大学) Stanford(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MachineLearningLM通过持续预训练赋予大语言模型强大的上下文机器学习能力,同时保持其通用知识和推理能力,提升多示例任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05663 2026-04-14 cs.AI 85%

CuraLight: Debate-Guided Data Curation for LLM-Centered Traffic Signal Control

CuraLight: 基于辩论引导的数据整理用于LLM中心的交通信号控制

Qing Guo, Xinhang Li, Junyu Chen, Zheng Guo, Shengzhe Xu, Lin Zhang, Lei Li

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Beijing Big Data Center(北京大数据中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CuraLight框架,通过强化学习代理生成高质量交互轨迹并结合多LLM辩论系统优化信号控制策略,实验显示在不同真实网络中优于现有方法,降低平均通行时间、排队长度和等待时间。

Comments accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09920 2026-04-14 cs.CV 85%

Does Your VFM Speak Plant? The Botanical Grammar of Vision Foundation Models for Object Detection

你的VFM说话植物吗?面向物体检测的视觉基础模型的植物语法

Lars Lundqvist, Earl Ranario, Hamid Kamangir, Heesup Yun, Christine Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出系统提示优化框架,评估四个开放词汇检测器在合成和真实农田图像中对豆科植物花和豆荚的检测性能,发现提示结构对不同模型响应各异,通过模型特定的组合提示显著提升检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10544 2026-04-14 cs.LG cs.AI 84%

WaveMoE: A Wavelet-Enhanced Mixture-of-Experts Foundation Model for Time Series Forecasting

WaveMoE: 一种用于时间序列预测的小波增强混合专家基础模型

Shunyu Wu, Jiawei Huang, Weibin Feng, Boxin Li, Xiao Zhang, Erli Meng, Dan Li, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米集团) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 WaveMoE通过整合小波域表示提升时间序列预测能力,采用双路径架构和共享专家路由机制,实验表明其在16个基准数据集上具有提升预测性能的潜力。

Comments Presented at ICLR 2026 TSALM Workshop (1st Workshop on Time Series in the Age of Large Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11066 2026-04-14 cs.CL 83%

ks-pret-5m: a 5 million word, 12 million token kashmiri pretraining dataset

ks-pret-5m: 一个500万词、1200万token的克什米尔语言预训练数据集

Haq Nawaz Malik, Nahfid Nissar

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了一个包含500万词和1200万token的克什米尔语言最大公开预训练数据集,通过清理流程和分词方法,提升了数据质量,支持语言模型预训练和计算语言学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10591 2026-04-14 cs.CV cs.AI 83%

GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing

GeoMeld:迈向遥感领域语义引导的基模模型

Maram Hasan, Md Aminur Hossain, Savitra Roy, Souparna Bhowmik, Ayush V. Patel, Mainak Singha, Subhasis Chaudhuri, Muhammad Haris Khan, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Space Applications Centre, ISRO(印度空间研究组织空间应用中心) University of Trento(特伦托大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出GeoMeld数据集,通过语义引导的监督方法,结合多模态对齐,提升遥感领域基模模型的性能和鲁棒性。

Comments Accepted at CVPR Workshop 2026; 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10114 2026-04-14 cs.CL cs.AI 82%

CircuitSynth: Reliable Synthetic Data Generation

CircuitSynth:可靠的合成数据生成

Zehua Cheng, Wei Dai, Jiahao Sun, Thomas Lukasiewicz

机构 * University of Oxford(牛津大学) TU Wien(维也纳工业大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 CircuitSynth提出了一种新的神经符号框架,通过将语义推理与表层实现解耦,结合概率句法决策图和凸优化机制,实现高保真合成数据生成,确保逻辑约束和分布目标。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11576 2026-04-14 cs.CV 82%

Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

微调如你预训练:提升视觉语言模型零样本对抗鲁棒性

Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Xi’an Jiaotong University(西安交通大学) University of Oxford(牛津大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 本文提出AdvFLYP方法,通过遵循CLIP预训练过程的训练配方,利用网络上收集的图像-文本对生成对抗样本,并通过对比损失匹配文本,提升视觉语言模型的零样本对抗鲁棒性。

Comments Accepted to CVPR Findings Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11082 2026-04-14 cs.CV 82%

RESP: Reference-guided Sequential Prompting for Visual Glitch Detection in Video Games

RESP:基于参考的顺序提示用于视频游戏中的视觉故障检测

Yakun Yu, Ashley Wiens, Adrián Barahona-Ríos, Benedict Wilkins, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 预训练与数据 :prompting(title,abstract);language model(abstract)

AI总结 本文提出RESP框架,通过参考引导提示实现多帧视频游戏故障检测,利用VLMs在视频层面进行比较而非孤立分类,提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11575 2026-04-14 cs.CL 79%

MIXAR: Scaling Autoregressive Pixel-based Language Models to Multiple Languages and Scripts

MIXAR:将自回归像素基于语言模型扩展到多种语言和文字

Chen Hu, Yintao Tai, Antonio Vergari, Frank Keller, Alessandro Suglia

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 MIXAR是首个基于像素的多语言生成模型,通过八种不同语言和文字训练,提升了多语言任务的性能和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07466 2026-04-14 cs.CL 79%

Cross-Tokenizer LLM Distillation through a Byte-Level Interface

通过字级接口进行跨分词器语言模型蒸馏

Avyav Kumar Singh, Yen-Chen Wu, Alexandru Cioba, Alberto Bernacchia, Davide Buffelli

机构 * MediaTek Research, Cambridge (United Kingdom)(联发科技研究中心,剑桥(英国)) Orbital Materials, London (United Kingdom)(轨道材料公司,伦敦(英国))

专题命中 预训练与数据 :LLM(title);language model(abstract);分类 cs.CL

AI总结 本文提出字级蒸馏方法,通过统一的字级接口实现跨分词器知识转移,验证了字级作为自然共同基础的有效性,同时指出跨任务改进仍存挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02189 2026-04-14 cs.LG 79%

deCIFer: Crystal Structure Prediction from Powder Diffraction Data using Autoregressive Language Models

deCIFer:基于粉末衍射数据的晶体结构预测方法

Frederik Lizak Johansen, Ulrik Friis-Jensen, Erik Bjørnager Dam, Kirsten Marie Ørnsbjerg Jensen, Rocío Mercado, Raghavendra Selvan

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Department of Chemistry & Nano-Science Center, University of Copenhagen(哥本哈根大学化学系与纳米科学中心) Department of Computer Science & Engineering, Chalmers University of Technology(查尔姆斯理工大学计算机科学与工程系)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 deCIFer利用自回归语言模型,通过整合粉末X射线衍射数据进行晶体结构预测,实现94%的结构匹配率,为未来复杂实验场景的预测提供基础。

Comments 24 pages, 18 figures, 8 tables. v2: Figure 8 revision. v3: added benchmarks, text revisions. v4: accepted to TMLR (https://openreview.net/forum?id=LftFQ35l47)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10633 2026-04-14 cs.CL 79%

ProUIE: A Macro-to-Micro Progressive Learning Method for LLM-based Universal Information Extraction

ProUIE:一种面向大规模信息提取的宏到微渐进学习方法

Wenda Liu, Zhigang Song, Shuai Nie, Guangyao Liu, Lisung Chen, Binyu Yang, Yaran Chen, Peng Zhou, Hongzhen Wang, Yuchen Liu, Wenyue Hu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * Xiaomi Corporation(小米公司) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出ProUIE方法,通过宏、中、微三级阶段提升LLM基于统一信息提取性能,实验表明其在多个数据集上优于基线模型,尤其在大规模生产场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09849 2026-04-14 cs.CR cs.LG 79%

Improving DNS Exfiltration Detection via Transformer Pretraining

通过变换器预训练改进DNS数据外泄检测

Miloš Tomić, Aleksa Cvetanović, Predrag Tadić

机构 * School of Electrical Engineering, University of Belgrade(贝尔格莱德大学电气工程学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 研究变换器预训练对子域级数据外泄检测的影响,通过控制流程验证预训练对分类任务的效果,结果显示在ROC曲线左尾有显著提升,尤其对抗随机初始化基线。

Comments This is the preprint version of the paper. The final version of the paper has been presented at the TELFOR 2025 conference. The paper has 4 pages, 1 figure and 3 tables

Journal ref 2025 33rd Telecommunications Forum (TELFOR), Belgrade, Serbia, 2025, pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09282 2026-04-14 cs.SD cs.CL 79%

End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering

端到端对比语言-语音预训练模型用于长形式语音问答

Jiliang Hu, Zuchao Li, Baoyuan Qi, Liu Guoming, Ping Wang

专题命中 预训练与数据 :pretraining(title);language model(abstract);分类 cs.CL

AI总结 本文提出CLSR模型,通过将音频特征转换为文本表示,提升长音频问答任务的性能,实验表明其优于现有方法。

Comments 12 pages, 7 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10609 2026-04-14 cs.CV q-bio.QM 78%

Self-supervised Pretraining of Cell Segmentation Models

细胞分割模型的自监督预训练

Kaden Stillwagon, Alexandra Dunnum VandeLoo, Benjamin Magondu, Craig R. Forest

机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学学院) School of Materials Science and Engineering, Georgia Institute of Technology(佐治亚理工学院材料科学与工程学院) Department of Biomedical Engineering, Georgia Institute of Technology(佐治亚理工学院生物医学工程系) School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院机械工程学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出DINOCell,通过自监督学习和微调提升细胞实例分割性能,实验显示其在LIVECell基准上表现优于现有模型。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09782 2026-04-14 cs.CV 78%

Biomarker-Based Pretraining for Chagas Disease Screening in Electrocardiograms

基于生物标志物的预训练用于心电图中的查加斯病筛查

Elias Stenhede, Arian Ranjbar

机构 * Akershus University Hospital(阿克什胡斯大学医院) University of Oslo(奥斯陆大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出基于生物标志物的预训练方法,通过MIMIC-IV-ECG数据集训练ECG特征提取器,再在巴西数据集上微调以检测查加斯病,五模型集成在PhysioNet 2025挑战中取得第5名。

Journal ref Computing in Cardiology 2025; Vol 52

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10952 2026-04-14 cs.LG 77%

UniPROT: Uniform Prototype Selection via Partial Optimal Transport with Submodular Guarantees

UniPROT: 通过部分最优传输与子模性保证的统一原型选择

Prateek Chanda, Prayas Agrawal, Karthik S. Gurumoorthy, Ganesh Ramakrishnan, Bamdev Mishra, Pratik Jawanpuria

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) Centre for Machine Intelligence and Data Science, Indian Institute of Technology Bombay(印度理工学院孟买分校机器智能与数据科学中心) Microsoft Research India(微软研究院印度) Walmart Global Tech, India(沃尔玛全球技术印度) Microsoft India(微软印度)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 UniPROT通过部分最优传输和子模性保证,解决原型选择中的类别不平衡问题,提升少数类表现而不影响多数类准确性。

Comments 25 pages, 31 figures. Accepted as a poster at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14410 2026-04-14 cs.CL 77%

BiT-MCTS: A Theme-based Bidirectional MCTS Approach to Chinese Fiction Generation

BiT-MCTS:一种基于主题的双向MCTS方法用于中文小说生成

Zhaoyi Li, Xu Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) School of Foreign Languages, Peking University(北京大学外国语学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BiT-MCTS方法,通过主题驱动策略生成结构化小说,提升叙事连贯性和主题深度。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11269 2026-04-14 eess.AS 75%

Speaker Attributed Automatic Speech Recognition Using Speech Aware LLMS

带有说话者属性的自动语音识别使用语音感知的LLMS

Hagai Aronowitz, Zvi Kons, Avihu Dekel, George Saon, Ron Hoory

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过微调语音感知LLM实现带说话者属性的自动语音识别,引入说话者聚类标签提升识别精度,并通过数据增强方法解决训练数据限制问题。

Comments \c{opyright} 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15640 2026-04-14 cs.LG cs.AI cs.CL 75%

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training

数据混合代理:学习重新加权领域以实现持续预训练

Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang

机构 * The University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院) Imperial College London(伦敦帝国学院) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。

Comments Accepted by the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24503 2026-04-14 cs.LG cs.AI 73%

Can Small Training Runs Reliably Guide Data Curation? Rethinking Proxy-Model Practice

小规模训练能否可靠地指导数据整理?重新审视代理模型实践

Jiachen T. Wang, Tong Wu, Kaifeng Lyu, James Zou, Dawn Song, Ruoxi Jia, Prateek Mittal

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了小规模代理模型训练在数据整理中的可靠性问题,指出固定配置协议与全规模模型开发流程的差异,并提出通过降低学习率提升小规模实验的可靠性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23964 2026-04-14 cs.AI 70%

From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments

从像素到数字代理:关于强化学习环境分类和技术趋势的实证研究

Lijing Luo, Yiben Luo, Alexey Gorbatovski, Sergey Kovalchuk, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Yancheng Institute of Technology(盐城工学院) Central University Moscow(莫斯科中央大学) ITMO University(ITMO大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过大规模数据分析,研究强化学习环境从物理模拟到通用代理的演变,揭示领域分为语义优先和领域特定泛化两大生态,并提出设计下一代具身语义模拟器的路线图。

Comments 32 pages main text, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09270 2026-04-14 cs.CL 70%

MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus

MCGA:多任务古典中文文学体裁音频语料库

Yexing Du, Kaiyuan Liu, Bihe Zhang, Youcheng Pan, Bo Yang, Liangyu Huo, Xiyuan Zhang, Jian Xie, Daojing He, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Du xiaoman(杜小满)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MCGA语料库,包含22000个音频样本,涵盖六个任务:ASR、S2TT、SEC、SQA、SU和SR,评估十种MLLM发现其在MCGA测试集上仍面临显著挑战,并引入领域特定的SEC指标和语音与文本一致性度量。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10391 2026-04-14 cs.CV cs.AI 70%

FishRoPE: Projective Rotary Position Embeddings for Omnidirectional Visual Perception

FishRoPE: 用于全方位视觉感知的投影旋转位置嵌入

Rahul Ahuja, Mudit Jain, Bala Murali Manoghar Sai Sudhakar, Venkatraman Narayanan, Pratik Likhar, Varun Ravi Kumar, Senthil Yogamani

机构 * Automated Driving, Qualcomm Technologies, Inc(高通技术公司自动驾驶部门) Automated Driving, Qualcomm India Private Limited(高通印度私人有限公司自动驾驶部门)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出FishRoPE,通过轻量框架将冻结的视觉基础模型适配到鱼眼几何,利用旋转位置嵌入重新参数化注意力机制,实现角分离而非像素距离的处理,提升全方位视觉感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10021 2026-04-14 cs.SD cs.LG 70%

Masked Contrastive Pre-Training Improves Music Audio Key Detection

掩码对比预训练改进音乐音频键检测

Ori Yonay, Tracy Hammond, Tianbao Yang

机构 * Department of Computer Science Engineering, Texas A\&M University

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文通过掩码对比预训练提升音乐音频键检测性能,发现其能有效增强音高敏感性,并在监督学习中实现SOTA表现。

Comments Code and models available at github.com/echo-cipher/keymyna

详情

展开后加载摘要…

URL PDF HTML 收藏