The Neglected Tails in Vision-Language Models
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)
Comments Project Page: https://shubhamprshr27.github.io/neglected-tails-of-vlms/
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)
Comments Project Page: https://shubhamprshr27.github.io/neglected-tails-of-vlms/
专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
Comments AAAI 2024
探究多模态大语言模型的对抗鲁棒性
机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) ; Khalifa University, UAE(哈利法大学,阿联酋) ; Australian National University, Australia(澳大利亚国立大学,澳大利亚)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract)
AI总结 通过系统研究多模态大语言模型的对抗鲁棒性,提出诊断性CLIP对齐协议预测鲁棒视觉编码器的迁移效果,并证明端到端多模态对抗训练能显著提升模型在强对抗攻击下的性能。
Journal ref The 37th British Machine Vision Conference (BMVC) 2026
EPSVec: 通过数据集向量实现高效且私密的合成数据生成
机构 * Capital One
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 提出EPSVec,一种轻量级差分隐私方法,通过提取并净化数据集向量来引导LLM生成合成文本,在低数据场景下实现高保真度,且计算开销低。
Comments Accepted at ICML 2026. Camera-ready version
探索用于模型专业化的自主智能体数据工程
机构 * Zhejiang University(浙江大学) ; Platform and Content Group, Tencent(腾讯平台与内容部)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文提出自主智能体数据工程任务,让LLM作为自主数据工程师,通过端到端数据策划驱动模型专业化,实验显示GPT-5.2通过迭代数据适应使学生模型性能提升57.29%。
Comments Work in progress
利用多模态大语言模型增强单图像面部去变形
机构 * IEEE
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract)
AI总结 提出一种基于多模态大语言模型引导的耦合扩散重建框架,通过提取中间层语义嵌入作为条件,实现无参考的面部去变形,恢复构成图像并保持身份一致性。
迈向真实世界的人类行为模拟:在长时间跨度、跨场景、异质行为轨迹上对大语言模型进行基准测试
机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Kuaishou Technology(快手科技)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出OmniBehavior基准测试,通过真实世界数据整合长周期、跨场景和异质行为模式,揭示现有模型在模拟复杂人类行为时的局限性,包括对正向平均人的趋同、人格同质化和乌托邦偏见,为未来高保真模拟研究指明方向。
Comments Project page: https://OmniBehavior.github.io
LLMs on the Line: 数据决定损失-损失缩放定律
机构 * Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; Tübingen AI Center(图宾根人工智能中心) ; University of Tübingen(图宾根大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 研究探讨了影响LLM损失-损失缩放定律的主要因素,发现预训练数据决定了缩放趋势,而模型大小、优化超参数、分词器和架构差异对缩放影响有限,因此应精心选择预训练数据以获得最佳下游性能。
Comments ICML 2025 camera-ready version
通过数据无关的平坦性感知提示预训练提升视觉语言模型测试时提示调优的校准
机构 * Yonsei University(延世大学) ; ETRI(韩国电子技术研究院)
专题命中 预训练与数据 :pretraining(title,abstract);language model(title,abstract)
AI总结 本文提出FPP框架,通过在提示初始化时选择平坦区域,提升测试时提示调优的校准和性能,无需额外标注数据和计算成本。
Comments CVPR 2026
将结构化生物医学知识注入语言模型:持续预训练与GraphRAG
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出通过持续预训练和GraphRAG两种方法将结构化生物医学知识注入语言模型,提升其在生物医学领域的表现,实验显示BERTUMLS在知识密集型问答任务中表现优异,GraphRAG在PubMedQA和BioASQ上提升显著。
Comments Accepted at LREC 2026
从感知流中对大语言模型进行时空 grounding
机构 * Toyota Motor North America Research & Development(丰田北美研发中心)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文提出FESTS框架,通过将自然语言查询转化为SpRE,为大语言模型注入可验证的时空监督,提升时空推理能力,使30亿参数模型在27k数据上实现87.5%的帧级F1分数,接近GPT-4.1性能。
利用大语言模型进行故事点估计
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 研究探讨了大语言模型在无训练数据或少量训练数据下对故事点的预测能力,并比较了比较判断与直接标注对模型性能的影响。
Comments 10 pages
为手术基础模型扩展视频预训练
机构 * The Johns Hopkins University(约翰霍普金斯大学) ; Zhejiang University(浙江大学) ; Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) ; Zhejiang Lab(之江实验室) ; Shaoxing University(绍兴大学) ; Angelalign(时代天使) ; Harvard Medical School(哈佛医学院)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract)
AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。
大语言模型是否增强了土木与环境工程师的写作方式?对25年学术交流的定量分析
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文通过词汇频率分析方法,研究大语言模型对土木与环境工程领域学术写作的影响,发现自2022年起,LLM的使用显著改变了写作风格,使文章更复杂、自信。
在基础模型预训练数据中被低估?一个单次探测器
机构 * ML-Labs(ML实验室) ; Dublin City University(都柏林城市大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title);large language model(abstract);language model(abstract)
AI总结 本文提出一种低成本方法,通过单张标记图像预测VLFM在目标领域的零样本准确率,用于评估和优化数据标注决策。
面向领域特定基础模型的视觉指令预训练
机构 * PCA Lab, VCIP, Computer Science, NKU, Tianjin, China(PCA实验室、VCIP、计算机科学、NKU、天津,中国) ; NKIARI, Futian, Shenzhen, China(NKIARI、福田、深圳,中国)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract)
AI总结 本文提出ViTP,通过视觉指令预训练提升领域特定基础模型的感知与推理能力,在多个遥感和医学影像任务中取得新的最先进性能。
通过多模态大语言模型扩展音频-文本检索
机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) ; Epidemic Sound ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 AuroLA通过多模态大语言模型实现音频-文本检索的扩展,利用可扩展的数据管道和混合NCE损失提升检索性能。
Comments Technical Report
开放多模态大语言模型中的涌现形变攻击检测
机构 * Faculty of Electrical Engineering, University of Ljubljana(卢布尔雅那大学电气工程学院)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract)
AI总结 本文提出利用开源多模态大语言模型进行零样本人脸形变攻击检测,通过实验表明其在无微调情况下具备优异的判别能力,性能超越传统基线23%。
Comments This manuscript is currently under review at Pattern Recognition Letters
利用大语言模型自动化提取多组分合金数据用于可持续设计
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 利用大语言模型自动化提取多组分合金数据,构建大规模数据库并用于可持续材料选择。
Comments 18 pages, 6 figures
迈向无需昂贵重训练的公平大型语言模型推荐系统
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 FUDLR提出一种无需昂贵重训练的高效去偏方法,通过两阶段机器无学习提升LLM推荐系统的公平性,同时保持推荐准确性。
Comments Accepted by WWW 2026
基于知识增强的视觉语言病理基础模型用于癌症诊断
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属新华医院) ; School of Artificial Intelligence(人工智能学院) ; Department of Pathology(病理学部) ; Department of Oral Pathology(口腔病理学部) ; Department of Pediatric Hematology/Oncology(儿科血液肿瘤科) ; Clinical Research and Innovation Unit(临床研究与创新单元) ; Department of Pediatric Cardiology(儿童心脏病科)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);language model(abstract)
AI总结 本文提出KEEP模型,通过整合疾病知识图谱提升癌症诊断的视觉语言基础模型性能,显著优于现有方法。
Comments V2: fixed typos, updated experimental results, added ablation
通用大型语言模型——无人机指挥与控制接口
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文提出了一种通用的无人机控制接口,通过MCP协议实现LLM与无人机的无缝集成,提供实时导航和飞行控制能力。
Doctor Sun: 一种双语多模态大语言模型用于生物医学AI
机构 * Key Laboratory of Smart Manufacturing in Energy Chemical Process, Ministry of Education East China University of Science and Technology(能源化工过程智能制造重点实验室,东华大学) ; Research Institute of Intelligent Control and Systems Harbin Institute of Technology(智能控制与系统研究室,哈尔滨工业大学) ; Department of Emergency Medicine, Sir Run Run Shaw Hospital Zhejiang University School of Medicine(浙江大学医学院急诊医学科) ; Provincial Key Laboratory of Precise Diagnosis Treatment of Abdominal Infection, Sir Run Run Shaw Hospital Zhejiang University School of Medicine(腹部感染精准诊断治疗省级重点实验室,浙江大学医学院) ; School of Medicine Shaoxing University(绍兴大学医学院)
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);instruction tuning(abstract)
AI总结 Doctor Sun是一种双语多模态大语言模型,通过整合预训练视觉编码器和医学LLM,提升生物医学多模态任务的性能,并提供SunMed-VL数据集支持研究进展。
大型语言模型安全性和内容审核的半监督学习
机构 * National University of Science and Technology Politehnica Bucharest(波兰技术大学科学与技术国家大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出利用半监督学习提升大型语言模型的安全性,通过结合标记和未标记数据以及任务特定增强技术,提高安全分类器的性能。
基于大语言模型的测试驱动代码生成中贝叶斯提示优化的探索性研究
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文提出BODE-GEN方法,通过贝叶斯优化优化提示以提高大语言模型生成代码的准确性,实验表明其在代码生成准确性上优于固定提示和手动提示工程。
Comments 20 pages, 13 figures
从多路径中检索的记忆:一种多前缀框架,用于在大型语言模型中稳健检测训练数据泄露
机构 * Department of Computer Science, University of Central Florida(计算机科学系,中央佛罗里达大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出多前缀框架,通过量化记忆的检索路径多样性,稳健检测大型语言模型中的训练数据泄露问题。
Comments 11 pages, 2 tables, 8 figures
机构 * Clarivate
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 7 pages, 5 figures, 4 tables
专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 14 pages, 5 tables, 4 figures | Accepted at International Conference on Neural Computing for Advanced Applications 2025, Conference info: https://aaci.org.hk/ncaa2025
Journal ref Commun. Comput. Inf. Sci. 2665 (2025) 75-87
机构 * Manycore Tech Inc.(Manycore科技公司) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)