arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-14 至 2026-07-14 共收录 313 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 23 篇

2607.10159 2026-07-14 cs.AI 新提交 89%

UNIT: Unleash Large Language Models Potential for Graph Continual Learning

UNIT:释放大语言模型在图连续学习中的潜力

Tairan Huang, Yili Wang, Beibei Hu, Yiting Shi, Qiutong Li, Changlong He, Jianliang Gao

机构 * Central South University(中南大学) Hongkong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hunan Institute of Engineering(湖南工程学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 针对图连续学习面临的语义-结构分离和知识转移不平衡问题,提出UNIT框架,通过微调大语言模型、引入不确定感知锚点生成机制和结构融合建模,提升模型适应性与跨任务知识保留能力,在图连续学习任务中达最优性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11562 2026-07-14 cs.CV 新提交 85%

MonkeyOCRv2: A Visual-Text Foundation Model for Document AI

MonkeyOCRv2:用于文档人工智能的视觉-文本基础模型

Yuliang Liu, Zhang Li, Ziyang Zhang, Shuo Zhang, Qiang Liu, Jiajun Song, Zidun Guo, Xinhan Wang, Handong Zheng, Yang Liu, Dongliang Luo, Zhiyin Ma, Jiarui Zhang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Kingsoft Office(金山办公软件)

专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究针对主流视觉编码器难以应用于文档图像的问题,提出MonkeyOCRv2模型。通过构建大型文档图像预训练语料库及采用联合预训练策略,在多个文档分析任务中提升性能,并验证其作为视觉编码器在文档解析和理解任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10277 2026-07-14 cs.SE 新提交 85%

From Business Requirements to Test Assertions: Evaluating LLM-Generated Oracles on Real Bugs

从业务需求到测试断言:评估大语言模型生成的预言机在实际错误上的表现

Tiancheng Ma, Nasir U. Eisty

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究大语言模型能否从自然语言业务需求生成测试预言机,提出基于Defects4J的流程,对10个实际错误进行实验,评估预言机在与需求衍生预言机及被测系统一致性上表现,发现大语言模型有泛化但存在差异,为后续研究提供可行性参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11508 2026-07-14 cs.LG cs.AI stat.ML 新提交 84%

CDFM: Towards a General-Purpose Causal Discovery Foundation Model

CDFM:迈向通用因果发现基础模型

Jie Qiao, Ruichu Cai, Zijian Li, Weilin Chen, Pengfei Hua, Boyan Xu, Zhengming Chen, Zhifeng Hao, Peng Cui

机构 * School of Computer Science, Guangdong University of Technology, Guangzhou, China(广东技术大学计算机科学学院) College of Mathematics and Computer, Shantou University, Shantou, China(汕头大学数学与计算机学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对因果发现中特定数据集方法的局限,提出通用框架CDFM,通过研究因果可识别性理论边界构建变分框架,将未知因果机制视为潜在变量,经大量合成模型预训练,性能优于传统算法,推动因果发现范式转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10534 2026-07-14 cs.AI cs.CR cs.LG 新提交 82%

Cross-Layer Misalignment Detection in Agent Skills: A Progressive Loading-Aware Contrastive Learning Approach

智能体技能中的跨层错位检测:一种渐进式加载感知对比学习方法

Chengjun Zhang, Yang Gao, Jianna Hur, Jingjing Zhang, Sagar Samtani

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究智能体技能跨层错位问题,提出渐进式加载感知分层对比学习框架PL-HCL,通过建模技能分层结构和学习跨层一致性来检测错位,使用相关语料库与挑战集,提升宏F1指标,为用户和运营商提供筛选工具与设计原则。

Comments 10 pages, 5 pages supplemental. Accepted at the KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11783 2026-07-14 cs.CL 新提交 81%

How Temperature Shapes Ideological Discourse in Retrieval-Augmented Generation?

温度如何塑造检索增强生成中的意识形态话语?

Elmira Salari, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Maria Nunes Delfino, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) São Paulo Catholic University(圣保罗天主教大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨温度对检索增强生成中意识形态话语的影响,通过对新冠治疗文章语料库应用词汇多维分析,让模型在不同温度下回答意识形态问题并评估,发现RAG框架易转移意识形态话语,中等温度下话语对齐最高,低温时下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09955 2026-07-14 cs.LG cs.AI 新提交 81%

A Foundation Model for Multimodal Event Sequences in Financial Applications

金融应用中多模态事件序列的基础模型

Nikita Rusakov, Vladislav Meshkov, Konstantin Zorin, Gleb Zaripov, Alexander Uglov, Alexey Vasilev, Anton Klenitskiy

机构 * Sber(俄罗斯储蓄银行) Sber AI Lab(俄罗斯储蓄银行人工智能实验室)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究金融应用中多模态事件序列预测建模,提出预训练基础变压器模型统一多源事件成序列,经下一个事件预测学习通用表示,结合现有特征训练轻量级神经模型用于多下游任务,优于传统模型并减少开发开销且已应用取得业务改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11008 2026-07-14 cs.CV cs.AI 新提交 79%

SynCLIP: Synonym-Coherent Language-Image Pretraining for Robust Open-Vocabulary Dense Perception

SynCLIP:用于鲁棒开放词汇密集感知的同义词一致语言-图像预训练

Mingjie Xie, Guangjun He, Dongli Xu, Youtian Lin, Hongjue Li, Pengming Feng, Jian Guan, Yue Deng

机构 * Beihang University(北京航空航天大学) State Key Laboratory of Space Information System and Integrated Application(空间信息系统与集成应用国家重点实验室) Nanjing University(南京大学) Harbin Engineering University(哈尔滨工程大学) Beijing Zhongguancun Academy(北京中关村科学城)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 研究针对开放词汇密集感知中同义词引起的定位不一致问题,提出SynCLIP框架,通过SSA和SAR模块增强注意力一致性与定位精度,构建SEViC支持预训练,实验证明该方法显著提升定位一致性并达领先性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11471 2026-07-14 cs.CL 新提交 77%

Are LLMs ready for HardChoices?

语言模型是否准备好应对艰难选择?

Dmitry Nikolaev

机构 * University of Manchester(曼彻斯特大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究通过新数据集检查大语言模型在重大社会问题上的立场,发现大小模型面对相关问题时很少中立、常不连贯,且在有立场的问题上有高度一致性。

Comments Accepted to Konvens 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11052 2026-07-14 cs.LG cs.CL 新提交 73%

Domain-Aware Scaling Laws Uncover Data Synergy

领域感知缩放定律揭示数据协同效应

Kimia Hamidieh, Lester Mackey, David Alvarez-Melis

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Microsoft Research(微软研究院) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型预训练中的数据协同效应,利用开放权重语言模型的观测变化估计领域间协同效应,其框架提高预测精度,恢复稳定估计,经训练模型验证能正确预测性能排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10911 2026-07-14 cs.CL cs.AI cs.DB 新提交 73%

The Nuts and Bolts of Natural Language to SQL Translation: A Systematic Analysis of Model Pipeline Optimisation Approaches and their Interactions

自然语言到SQL翻译的关键要素:模型管道优化方法及其交互的系统分析

Filip Klubicka, Vasudevan Nedumpozhimana, Sneha Rautmare, Bora Caglayan, Mingxue Wang, John D. Kelleher

机构 * Huawei Ireland Research Centre(华为爱尔兰研究中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究NL2SQL翻译问题,通过集成NatSQL中间表示、增加预处理和微调步骤、开发重排器模型等方法,并结合SmBoP和RASAT架构进行消融及Shapley分析,揭示组件交互对结果的影响,为轻量级模型开发提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09754 2026-07-14 cs.CV cs.AI cs.LG q-bio.NC 新提交 73%

Cross-Subject Modeling for Widefield Calcium Imaging via Atlas-Aligned Spatiotemporal Tokenization

通过图谱对齐的时空令牌化实现宽场钙成像的跨主体建模

Mohammad Hosseini, Eray Erturk, Saba Hashemi, Maryam M. Shanechi

机构 * ShanechiLab(沙内奇实验室)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对宽场钙成像建模受限问题,提出多主体模型WiCAT,利用自监督预训练,引入图谱对齐的时空令牌化方案,能跨主体、任务和数据集迁移,实现零样本行为解码及遗漏脑区重建,优于基线模型。

Comments Published at the 43rd International Conference on Machine Learning (ICML) 2026. Code available at: https://github.com/ShanechiLab/WiCAT

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09727 2026-07-14 eess.SP cs.AI 新提交 70%

The Universal Language of CSI:Unifying Wireless Sensing Across Devices and Environments

CSI的通用语言:统一跨设备和环境的无线传感

Jiayi Chen, Weiting Ou, Guangxu Zhu

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究旨在解决基于CSI的WiFi传感异构问题,提出基础模型框架,通过整理标准化数据集、引入模块化架构,将CSI视为有通用语法的语言,实现跨设备和环境统一无线传感,提升泛化能力,优于特定任务基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10993 2026-07-14 cs.CV 新提交 67%

Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics

开放词汇检测中的置信度分数是尺度和语义的有偏混合

Yi Tang Soon, Jun-Wei Hsieh

机构 * Institute of Intelligence Systems, National Yang Ming Chiao Tung University(国立阳明交通大学智能系统研究所) College of Artificial Intelligence and Green Energy, National Yang Ming Chiao Tung University(国立阳明交通大学人工智能与绿色能源学院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 研究开放词汇检测中置信度分数问题,通过实验表明其是尺度和语义的有偏混合,两种偏差源于CLIP图像级预训练,阈值调整无法消除,无参数温度缩放校正可部分改善小物体召回率并揭示相关限制。

Comments ICPR Workshop 2026 (FMVA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10953 2026-07-14 cs.CV 新提交 67%

Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge

利用器官分层报告知识学习基于解剖学的CT视觉语言表征

Guoliang You, Hongming Li, Yuanwang Zhang, Yong Fan

机构 * Department of Radiology, Perelman School of Medicine, University of Pennsylvania(放射科,佩尔曼医学院,宾夕法尼亚大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 研究利用CT图像与放射学报告进行医学视觉语言预训练,提出OKA-CT框架,通过转化报告为器官条件知识,分阶段学习,在数据集上实现零样本异常诊断高AUROC,优于基线,提升报告-图像对齐。

Comments 9 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11720 2026-07-14 cs.LG cs.AI 新提交 62%

Active Offline-to-Online Reinforcement Learning

主动离线到在线强化学习

Alper Kamil Bozkurt, Shangtong Zhang, Yuichi Motai

机构 * Virginia Commonwealth University(弗吉尼亚共同体大学) University of Virginia(弗吉尼亚大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究离线到在线强化学习中有限交互预算下的主动策略选择问题,提出基于未来性能上置信界主动选策略微调的方法,经实验验证其优于现有基线,能更有效利用预算,推动离线强化学习在现实系统的实际部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09751 2026-07-14 cs.AI cs.LG 新提交 62%

Task-Conditioned Synthetic Data Generation for Improving Machine Learning Performance in Agricultural Prediction Tasks

用于提高农业预测任务中机器学习性能的任务条件合成数据生成

Hamid Ebrahimy, Moritz Lucas, Martin Atzmueller

机构 * Osnabrück University(奥斯纳布吕克大学) Leibniz Institute for Agricultural Engineering and Bioeconomy (ATB)(莱布尼茨农业工程与生物经济研究所(ATB)) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对农业预测任务中训练数据受限影响机器学习性能的问题,提出任务条件合成数据生成算法TCSDG,结合贝叶斯网络生成器与表格基础模型,经实验验证其能有效提升性能,优于基准算法,提供实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09805 2026-07-14 eess.IV cs.AI cs.CV 新提交 57%

A Unified Model for Highly Accurate ECG-Free Dynamic Coronary Roadmapping Using Spatio-Temporal Transformers

一种使用时空变换器的高精度无心电图动态冠状动脉造影统一模型

Saahil Islam, Sebastian Piat, Venkatesh N. Murthy, Serkan Cimen, Puneet Sharma, Andreas Maier, Florin C. Ghesu

机构 * Pattern Recognition Lab, Friedrich Alexander University(模式识别实验室,弗赖堡亚历山大大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 针对无心电图动态冠状动脉造影中准确心脏相位匹配和导管尖端跟踪的挑战,提出统一框架,利用大规模时空编码器预训练学习心脏运动动力学,引入辅助任务并采用多数投票后处理策略,实现高精度实时引导,性能达先进水平。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09866 2026-07-14 cs.RO cs.AI 新提交 57%

Robo-ValueRL: Reliable Value Estimation for Offline-to-Online Reinforcement Learning

Robo-ValueRL:离线到在线强化学习的可靠价值估计

Wenke Xia, Pei Ren, Wenbo Yu, Yizhuo Zhang, Jifan Li, Yixue Zhang, Yinuo Zhao, Qingyang Gao, Jianlong Fu, Jian Tang, Ji-Rong Wen, Zhengping Che, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Beijing Forestry University(北京林业大学) Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 研究离线到在线强化学习中价值函数可靠性对策略优化的影响,提出Robo-ValueRL框架,通过特定指标评估价值估计可靠性并用于策略预训练和在线改进,实验显示其能有效提升下游策略性能,突出价值引导数据利用对策略改进的重要性。

Comments Please refer to our website: https://gewu-lab.github.io/Robo-ValueRL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10959 2026-07-14 cs.LG math.OC stat.ML 新提交 57%

WSqD: A Horizon-Free Learning Rate Schedule for Large Model Training

WSqD:一种用于大模型训练的与训练轮次无关的学习率调度方法

Jianhao Ma, Yuxin Chen

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 研究提出WSqD学习率调度方法,受随机凸优化启发,用移位反平方根基础取代WSD恒定稳定阶段,保留最终线性冷却,其基础学习率调度与训练轮次无关且收敛速率最优,实验显示在语言模型预训练中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11366 2026-07-14 cs.CV 新提交 50%

Self-supervised training for high-resolution close-range multispectral remote sensing imagery

高分辨率近程多光谱遥感影像的自监督训练

Leon-Friedrich Thomas, Mikael Änäkkälä, Antti Lajunen

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究探索自监督学习在高分辨率多光谱无人机影像用于精准农业的有效性,用MoCo-v3等对基于Transformer的编码器预训练,在作物-杂草语义分割任务中表现出色,展示跨传感器和区域泛化能力,还提供芬兰多光谱无人机数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11362 2026-07-14 cs.IR 新提交 50%

Boolean queries are all you need?

布尔查询就足够了吗?

Charles L. A. Clarke, Mark D. Smucker

专题命中 预训练与数据 :LLM(abstract)

AI总结 研究在TREC 2024 RAG赛道任务中,为基于大语言模型的搜索代理配备布尔检索引擎,仅依据语料库子串与查询匹配密度排名,无需监督学习等,结果表明简单模式匹配或足以用于智能搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10537 2026-07-14 cs.SD cs.MM eess.AS 新提交 50%

Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment

利用未配对数据和对比对齐进行预训练的舞蹈音乐生成

Ryota Kimura, Sangheon Park, Natalia Polouliakh, Taketo Akama

机构 * Sony Computer Science Laboratories(索尼计算机科学实验室) Keio University(庆应义塾大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对舞蹈音乐生成中高质量配对数据稀缺问题,提出利用未配对和配对数据的框架,结合预训练单峰编码器、对比预训练及控制网络模块,实验证明该方法提升了舞蹈音乐对齐和音频质量,优于现有技术。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 22 篇

2607.11444 2026-07-14 cs.CL 新提交 88%

UMoE:Unlocking Every Expert in Domain-Specific Training

UMoE:在特定领域训练中解锁每个专家

Xuefeng Li, Pengfei Liu

机构 * Qwen Team(通义千问团队) DeepSeek-AI(渊亭科技) Thinking Machines Lab(思维机器实验室) LLM-Core Xiaomi(小米大语言模型核心团队)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对特定领域训练中专家池不合理问题,提出UMoE流程,先修剪低显著性专家,再扩展专家池,最后应用标准SFT,该方法在多架构、多领域及多基准测试中优于直接SFT,能转化冗余容量,提升训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11102 2026-07-14 cs.SD 新提交 85%

CHARM: Charge Calibration and Acoustic Rescue for LLM-based Multimodal Sarcasm Detection

CHARM:基于大语言模型的多模态讽刺检测中的电荷校准与声学救援

Qiyang Sun, Yi Chang, Yupei Li, Xi Shao, Zixing Zhang, Björn W. Schuller

机构 * GLAM – the Group on Language, Audio, & Music, Imperial College London(伦敦帝国理工学院语言、音频和音乐小组) College of Telecommunications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Shenzhen Research Institute, Hunan University(湖南大学深圳研究院) CHI – Chair of Health Informatics, TUM University Hospital(慕尼黑工业大学医院健康信息学主席) relAI – the Konrad Zuse School of Excellence in Reliable AI(康拉德·楚泽可靠人工智能卓越学院) MDSI – Munich Data Science Institute(慕尼黑数据科学研究所) MCML – Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型在讽刺检测中过度预测积极类别及韵律线索利用不足的问题,提出CHARM框架,含双向电荷校准和声学后期融合救援两个模块,无需微调主干,提升检测性能,揭示跨文化韵律解耦,产生可解释的跨语言多模态检测器。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11703 2026-07-14 cs.CL 新提交 84%

Production and Perception in LLMs: A Token Probability Approach

大语言模型中的生成与感知:一种令牌概率方法

Anna Marklová, Jiří Milička, Martina Vokáčová, Rudolf Rosa

机构 * Faculty of Arts, Charles University, Prague(布拉格查理大学文学院) Faculty of Mathematics and Physics, Charles University, Prague(布拉格查理大学数学与物理系)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨大语言模型中语言生成与感知的区别,通过直接令牌概率测量,利用Llama - 3.1 - 8B等模型实验发现,提示框架能引发生成 - 感知区别,此区别特定于交际框架,在多模型中可复制,感知提示在序列起始影响最强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10092 2026-07-14 cs.CL cs.AI 新提交 84%

Efficiently Adapting Spoken Language Models for the Singaporean Context

高效地使口语语言模型适应新加坡语境

Ng Jia Sheng Jason

机构 * xData Home Team Science & Technology Agency (HTX)(新加坡内政团队科技局)

专题命中 指令微调 :language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对原始训练数据不可用且需多语言口语交互的情况,将开源口语语言模型适应新加坡语境。核心方法是结合LoRA微调等技术,构建多语言数据集。贡献是HT - Moonstone(5B)在多数任务表现出色,口音和性别识别佳,且原始语音问答能力损失小。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11732 2026-07-14 cs.CV 新提交 82%

GFR-SAM: Training-Free Referring Camouflaged Object Segmentation via Cross-Image Prompting

GFR-SAM:通过跨图像提示实现免训练的指认伪装物体分割

Yilong Yang, Jianxin Tian, Shengchuan Zhang, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,教育部,厦门大学)

专题命中 指令微调 :prompting(title,abstract);foundation model(abstract)

AI总结 研究指认伪装物体分割问题,提出GFR-SAM三阶段免训练框架,通过生成候选掩码、过滤背景干扰、细化边界等步骤,在R2C7K基准测试中表现出色,弥合通用模型与特定感知任务差距,凸显SAM3跨图像提示潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10797 2026-07-14 cs.CV 新提交 80%

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

用于从视频理解复杂装配动作的组合上下文微调视觉语言模型

Hao Zheng, Jinyi Huang, Tiantian Zheng, Xun Xu, Tuka Alhanai

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) The University of Auckland(奥克兰大学)

专题命中 指令微调 :language model(title,abstract);LLM(comments)

AI总结 针对装配动作理解难题,提出组合上下文微调方法及层划分交替训练方法,将动作分解为语义元素并微调视觉语言模型,创建相关数据集,实验证明该方法优于基线且能提供可解释预测,助力人机协作装配。

Comments Accepted by ICRA 2026. Video Understanding; Vision Language Model; Multi-modal LLM; Action Recognition; Assembly

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10371 2026-07-14 eess.AS cs.CL 新提交 79%

GigaAM Multilingual: Foundation Model for Underrepresented Languages

GigaAM多语言:针对低资源语言的基础模型

Andrei Kuzmenko, Alexandr Maximenko, Aleksandr Kutsakov, Georgii Gospodinov, Dmitrii Bolotov, Oleg Kutuzov, Pavel Bogomolov, Fyodor Minkin

机构 * SaluteDevices, Russia(SaluteDevices)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.CL

AI总结 针对多语言ASR中长尾语言数据稀缺问题,提出GigaAM Multilingual,用Conformer编码器在大量音频上预训练,预训练时引入聚类级数据平衡策略,微调时采用领域感知采样方法,在目标语言上优于其他编码器,发布相关模型提供多语言适应方法。

Comments Accepted to Interspeech 2026. Model weights: https://github.com/salute-developers/GigaAM

详情

展开后加载摘要…

URL PDF HTML 收藏