arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 885 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 885 篇

2607.01690 2026-07-03 cs.AI cs.CL cs.LG 新提交 80%

Epistemic Goggles: A Pretrained Module that Induces an Epistemic Frame via Gradient Editing

认知护目镜:通过梯度编辑诱导认知框架的预训练模块

Joshua Penman

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对微调语言模型时出现的“否定忽视”问题,提出Goggles模块,通过编辑微调梯度而非数据来赋予模型特定的认知框架,使模型在保持能力的同时正确识别虚构内容。

Comments 20 pages, 10 figures, 2 tables. Code at https://github.com/JoshuaSP/epistemic-goggles and generated documents, questions, and teacher rollouts at https://huggingface.co/datasets/joshuapenman/epistemic-goggles-artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28016 2026-07-03 cs.CV 新提交 80%

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct: 通过规划器-执行器强化学习推进自回归视频生成中的时间合理性

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) Peking University(北京大学) USTB(北京科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 提出TempAct框架,利用规划器-执行器强化学习联合优化时间分解与步骤条件执行,解决自回归视频生成中时间指令模糊、延迟反应和错误传播问题,提升时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23889 2026-06-24 cs.IR 新提交 80%

INSPIRE: Intent-aware Neural Sponsored Product Retrieval for E-commerce

INSPIRE:面向电子商务的意图感知神经赞助商品检索

Shasvat Desai, Hong Yao, Utkarsh Porwal, Kuang-chih Lee

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对电商搜索中用户意图与商品不匹配问题,提出INSPIRE框架,利用结构化意图信号(如品牌、口味、饮食限制)增强查询与赞助商品的匹配,通过弱监督意图学习和大模型蒸馏实现精准检索。

Comments Accepted to ACM SIGIR E-commerce Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23623 2026-06-23 cs.RO 新提交 80%

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型

Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23494 2026-06-23 cs.CV 新提交 80%

Brain-Adapter: A Dual-Stream Vision-Language MIL Framework for Comprehensive 3D CT Diagnosis of Acute Intracranial Pathologies

Brain-Adapter: 一种用于急性颅内病理综合3D CT诊断的双流视觉-语言MIL框架

Zhenyu Yi, Zhiyun Song, Yusong Sun, Zelin Liu, Manman Fei, Zhenhao Li, Jiaxuan Zhao, Xu Han, Lichi Zhang

机构 * School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Brain-Adapter双流多实例学习框架,利用预训练2D生物医学视觉-语言模型和原始诊断报告,通过文本条件注意力和不确定性感知融合实现3D CT扫描的多标签分类,无需密集标注。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15963 2026-06-16 cs.DC cs.AI cs.CL cs.LG 新提交 80%

PreLort: Prefix-Nested LoRA for Federated Fine-Tuning under Rank Heterogeneity

PreLort: 面向秩异构联邦微调的前缀嵌套LoRA

Muhammad Waseem, Nurbek Tastan, Andrej Jovanovic, Nicholas D. Lane, Nils Lukas, Karthik Nandakumar, Samuel Horvath

机构 * MBZUAI, UAE University of Cambridge, UK(MBZUAI,阿联酋剑桥大学,英国) Flower Labs, UK(Flower Labs,英国) Michigan State University, USA(密歇根州立大学,美国)

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对联邦LoRA中异构秩导致的信息分布不均问题,提出PreLort方法,通过前缀层次化嵌套低秩结构、分段聚合规则和前缀嵌套训练策略,使低秩客户端受益于高秩客户端的丰富信息,在准确率和ROUGE-L上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14228 2026-06-15 cs.NI cs.DC 新提交 80%

Selective Field Transmission: Bandwidth Efficient Communication under Standardized Message Schemas

选择性字段传输:标准化消息模式下的带宽高效通信

David Philipp Klüner, David Murach, Stefan Kowalewski, Alexandru Kampmann

专题命中 指令微调 :SFT(summary_cn,abstract)

AI总结 提出选择性字段传输(SFT)机制,通过动态适配传输内容至接收方实际需求,在保持标准接口不变的同时显著降低带宽消耗,且无额外延迟开销。

Comments 8 pages, 9 figures, IEEE ETFA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10279 2026-06-10 cs.AI cs.CL cs.LG 新提交 80%

Supervised Fine-tuning with Synthetic Rationale Data Hurts Real-World Disease Prediction

使用合成理由数据进行监督微调损害真实世界疾病预测

Buxin Su, Bingxuan Li, Cheng Qian, Yiwei Wang, Jin Jin, Bingxin Zhao

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Merced(加州大学默塞德分校)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现,在临床预测任务中,使用合成理由数据进行监督微调反而显著降低模型性能,根本原因在于叙事合理性与判别优化之间的结构性冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11359 2026-08-13 cs.LG 新提交 79%

Market-Information-Aware Gated-LoRA of Foundation Models for Transferable Day-Ahead Electricity Price Forecasting

面向可迁移日前电价预测的、融合市场信息的基础门控低秩适配(Gated-LoRA)模型

Hang Fan, Wei Wei, Shengwei Mei

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出融合市场信息的Gated-LoRA框架,将Chronos-2模型迁移至日前电价预测,经中国四省现货市场验证,可显著降低预测误差,为数据稀缺电力市场提供迁移方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10525 2026-08-12 cs.CV cs.AI 新提交 79%

Dynamic Context Adapters: Efficiently Infusing History into Vision-and-Language Models

动态上下文适配器:将历史信息高效注入视觉-语言模型

Yuhang Song, Bor-Jiun Lin, Jiaxu Liu, Te-Chuan Chiu, Anh Nguyen, Chun-Yi Lee

机构 * University of Liverpool(利物浦大学) National Tsinghua University(国立清华大学) Imperial College London(伦敦帝国学院) National Taiwan University(国立台湾大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 针对视觉-语言模型整合历史上下文时的计算与信息损失问题,提出动态上下文适配器(DCA),实现高效历史注入,降低注意力FLOPs超25%、内存13%,提升长时序任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09521 2026-08-11 cs.AI 新提交 79%

One Adapter Pair per Model: A Universal Activation Interface for Language Models

每个模型一个适配器对:语言模型的通用激活接口

Su-Hyeon Kim, Jiwan Mun, Yo-Sub Han

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本研究提出通用激活总线框架,为兼容语言模型提供通用激活接口,每个模型配备轻量级适配器对,可实现激活工具跨模型共享与复用,为可复用工具建立稳定的激活契约。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09124 2026-08-11 cs.AI 新提交 79%

ChronoState: Hidden Elapsed-Time Conditioning for Temporal-State Action Selection in Frozen-Backbone Language Models

ChronoState:用于冻结骨干语言模型中时间-状态动作选择的隐式流逝时间条件

Sam Siavoshian, Omar Ramadan, Amir K. Saeed, Benjamin A. Johnson, Amin Mohamed El-Amin Diab, Benjamin M. Rodriguez

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 该研究提出 ChronoState 基准,证实冻结骨干语言模型可在直接监督下将隐式流逝时间与符号状态组合,但其泛化性有限,且性能不及提示注入时间戳基线。

Comments Submitted to SPIE Defense and Commercial Sensing 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07053 2026-08-10 cs.AI 新提交 79%

Unsupervised Adaptation of PDE Foundation Models

PDE基础模型的无监督适配

Ziye Song, Zhao Wei, Xin Yu, Ivor Tsang, Yueming Lyu

机构 * Nanyang Technological University(南洋理工大学) CFAR, A*STAR(新加坡科技研究局CFAR)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 针对PDE基础模型适配需密集解数据的问题,提出无监督微调框架,引入NSLoRA解决LoRA的物理量学习不均问题,在未见PDE上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05813 2026-08-07 cs.AI 新提交 79%

Cautious Context Steering for Language Model Personalization

用于语言模型个性化的谨慎上下文引导(Cautious Context Steering, CCS)

Gihoon Kim, Jeyoung Lee, Suhan Woo, Sekwon Oh, Minsu Jeon, Hyounsoo Han, Euntai Kim

机构 * Yonsei University(延世大学) Hyundai Motors Company(现代汽车公司) Korea Institute of Science and Technology(韩国科学技术研究院)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文提出 CCS 方法,通过轻量适配器动态控制语言模型解码时的上下文影响,在单数据集训练后实现领域内及四个分布外基准的个性化提升,且降低推理成本。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04504 2026-08-06 cs.CV cs.AI 新提交 79%

GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction

GeoReward:缓解跨市场偏好预测的视觉语言模型中的上下文变量高估问题

Shuo Liu, Huixiang Cai, Weiru Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本研究针对视觉语言模型的上下文变量高估问题,提出GeoReward奖励模型,通过三种机制缓解该偏差,在跨市场广告偏好预测任务中性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03428 2026-08-05 cs.CV cs.AI 新提交 79%

OliveGemma: A 3 Billion Visual Language Model for Recognising the Mediterranean & European Diet

OliveGemma:一款用于识别地中海与欧洲饮食的30亿参数视觉语言模型

Dimitrios I. Zaridis, Traianos Tsiokris, Vasileios C. Pezoulas, Daphni Plati, Eugenia Mylona, Eleni Georga, Nikos Tsiknakis, Antonis Sakellarios, Dimitrios I. Fotiadis

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本研究构建基于PaliGemma-2-3B的OliveGemma,经LoRA微调后在欧洲饮食识别任务上超越多数前沿模型,仅逊于DenseNet-121,小型VLM经PEFT适配可在专业任务超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02830 2026-08-05 cs.CV cs.AI 新提交 79%

In-Context Collapse in Vision-Language Models and How to Mitigate it?

视觉语言模型中的上下文坍缩及其缓解方法

Mohammad Rostami

机构 * Amazon Generative AI Innovation Center(亚马逊生成式AI创新中心)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 本文发现视觉语言模型存在随演示增多的上下文坍缩问题,通过因果定位将其归因于视觉-语言整合通路,提出CircA干预方法可有效缓解该问题并实现抗坍缩能力迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02407 2026-08-04 cs.CR cs.AI 新提交 79%

Antares: Foundation Models for Agentic Vulnerability Localization

Antares:用于智能体漏洞定位的基础模型

Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi

专题命中 指令微调 :foundation model(title);language model(abstract);分类 cs.AI

AI总结 该研究提出基于IBM Granite的Antares系列紧凑语言模型,经两阶段训练用于智能体漏洞定位,其30亿参数版本性能接近GPT-5.5且远超更大模型,推理高效低成本。

Comments 57 pages, 12 figures, technical report for antares

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01751 2026-08-04 cs.CV cs.AI 新提交 79%

SPECTRA: Band-Routed Embedding and Stage-Wise LoRA for Cross-Sensor Fine-Tuning of Geospatial Foundation Models

SPECTRA:用于地理空间基础模型跨传感器微调的波段路由嵌入与分阶段LoRA

Xingyan Li, Jordan A. Caraballo-Vega, Jie Gong, Mark L. Carroll, Jianwu Wang

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) NASA Goddard Space Flight Center(美国国家航空航天局戈达德太空飞行中心)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出SPECTRA框架,通过波段路由嵌入(BRE)解决地理空间基础模型的光谱不匹配问题,利用分阶段可迁移性感知LoRA(ST-LoRA)降低微调成本,在多数据集上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01290 2026-08-04 cs.LG cs.DC 新提交 79%

FedChronos: Federated Fine-Tuning of Time-Series Foundation Models for Privacy-Preserving Commodity Price Forecasting

FedChronos:用于隐私保护商品价格预测的时间序列基础模型联邦微调

Amit Sharma, Nitin Auluck, Akramul Azim

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 FedChronos是用于时间序列基础模型联邦微调的框架,结合LoRA与差分隐私,在非IID商品价格联邦预测中实现隐私与准确性互补,适配边缘部署

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00622 2026-08-04 cs.CL 新提交 79%

A Heuristic Perspective on Debiasing Language Models

语言模型去偏的启发式视角

Tian Lan, Yemin Wang, Chuancheng Shi, Xiangyu Wu, Zesheng Shi, Yuan Wang, Jiang Li, Guanglai Gao, Xiangdong Su

机构 * Inner Mongolia University(内蒙古大学) Xiamen University(厦门大学) University of Sydney(悉尼大学) Nanjing University of Science and Technology(南京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Zhejiang University(浙江大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 该研究针对现有语言模型去偏方法的局限,提出HEIMAT启发式自动去偏框架,经实验验证其可在保留NLU性能的同时有效缓解不同文化下的模型偏见。

Comments 13 pages in total, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25763 2026-07-29 cs.NI cs.LG 新提交 79%

WALoMA: A Multitask Wireless Foundation Model via Adaptive Low-Rank Masked Autoencoders

WALoMA:一种通过自适应低秩掩码自动编码器实现的多任务无线基础模型

Madi Makin, Asmaa Abdallah, Abdulkadir Celik, Ahmed M. Eltawil

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对6G无线物理层架构中特定任务模型局限和标记数据稀缺问题,提出WALoMA模型,利用自适应低秩掩码自动编码器,通过自监督学习从无标签数据中学习可转移表示,在五个下游任务中表现出色,显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23394 2026-07-28 cs.AI 新提交 79%

Inference-Time Consensus for Mitigating Hidden Behaviors from LLM Fine-Tuning

用于减轻大语言模型微调中隐藏行为的推理时共识

Adhyyan Narang, Artin Tajdini, Claire Zhang, Jamie Morgenstern

机构 * University of Washington(华盛顿大学)

专题命中 指令微调 :LLM(title);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型微调中隐藏行为问题,通过从不同源收集多数据集并学习共性,在解码时聚合参考模型下一个token分布,引入两种共识解码器,有效抑制特定源不当行为,保留共享期望行为。

Comments 21 pages, 4 figures. Code: https://github.com/AdhyyanNarang/consensus-aggregation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22861 2026-07-28 cs.CV cs.AI 新提交 79%

Robustifying pathology foundation models via fine-tuning

通过微调增强病理学基础模型的鲁棒性

Alexandre Filiot, Oskar Thaeter, Benoit Schmauch, Lionel Guillou

机构 * Waiv Institute of Pathology, Technical University of Munich(慕尼黑工业大学病理学研究所) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 研究针对病理学基础模型对采集因素敏感问题,开发新颖微调方法,应用于十个不同模型提升鲁棒性与下游性能,平均鲁棒性指数提高23%,综合性能提高43%,并公开两个模型的微调版本。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18958 2026-07-22 cs.CV cs.AI 新提交 79%

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

用于增强大型视觉语言模型鲁棒性的对偶对抗微调

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16635 2026-07-21 cs.CV cs.AI 新提交 79%

TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos

TellTale:融合多实例LoRA文本编码器和零样本大语言模型判断器用于视频中的矛盾/犹豫识别

Abdel-Karim Al-Tamimi, Ali Rodan

机构 * Sheffield Hallam University(谢菲尔德哈勒姆大学) Yarmouk University(亚尔穆克大学) The University of Jordan(约旦大学)

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 TellTale旨在解决视频中矛盾/犹豫识别问题,它融合多实例LoRA文本编码器和零样本大语言模型判断器,结合三个概率流,在BAH数据集上取得优异成绩,相比官方基于视觉的基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16325 2026-07-21 cs.CV cs.LG 新提交 79%

RegionFM: Interpretable Region-Based Brain MRI Classification Using Foundation Model Embeddings

RegionFM:使用基础模型嵌入进行可解释的基于区域的脑MRI分类

Wei Zhang

机构 * L3S Research Center(L3S研究中心)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对脑MRI基础模型预测难解释问题,提出RegionFM框架,将解剖分割与基础模型嵌入结合,通过划分区域、编码嵌入及构建模型组合,用于认知障碍分类评估,在保持性能同时使解释与临床推理更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13013 2026-07-15 cs.AI cs.SD 新提交 79%

Audio-Native Speech Recognition with a Frozen Discrete-Diffusion Language Model

使用冻结离散扩散语言模型的音频原生语音识别

Harsha Vardhan Khurdula, Abhinav Kumar Singh, Yoeven D Khemlani, Vineet Agarwal

机构 * Interfaze AI(Interfaze人工智能公司)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 探讨离散扩散语言模型能否用于语音识别,训练音频原生接口,用冻结Whisper编码器等,约42M参数。自然训练目标遇问题,连接主义时间分类损失打破僵局,模型在LibriSpeech test-clean上字错误率6.6%,能并行转录多种语言。

Comments 10 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10371 2026-07-14 eess.AS cs.CL 新提交 79%

GigaAM Multilingual: Foundation Model for Underrepresented Languages

GigaAM多语言:针对低资源语言的基础模型

Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin

机构 * SaluteDevices, Russia(SaluteDevices)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.CL

AI总结 针对多语言ASR中长尾语言数据稀缺问题,提出GigaAM Multilingual,用Conformer编码器在大量音频上预训练,预训练时引入聚类级数据平衡策略,微调时采用领域感知采样方法,在目标语言上优于其他编码器,发布相关模型提供多语言适应方法。

Comments Accepted to Interspeech 2026. Model weights: https://github.com/salute-developers/GigaAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11706 2026-07-14 cs.SD cs.AI 新提交 79%

VoxENES 2026: Benchmarking Generalization of Speech Spoofing Detectors Against LLM-Era TTS and Voice Conversion

VoxENES 2026:针对大语言模型时代文本转语音和语音转换的语音欺骗检测泛化基准测试

Aastha Sharma, Guangjing Wang

机构 * University of South Florida(佛罗里达州立大学)

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型时代TTS和VC系统合成语音与传统基准测试不匹配问题,引入VoxENES 2026基准测试,对八个预训练检测器测试发现性能大幅下降,凸显当前检测器问题,确立该基准为开发音频欺骗对策的实用平台。

Comments Accepted in InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏