Privacy Preserving Large Language Models: ChatGPT Case Study Based Vision and Framework
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)
Comments ICCV 2023
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract)
Comments Accepted by Findings of ACL 2023
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract)
Comments To appear in CVPR 2023
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI、cs.LG
Comments CVPR 2023 Camera-Ready; Project Webpage: https://antoyang.github.io/vid2seq.html ; 18 pages; 6 figures
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)
Comments Tech report. Project page: https://facebookresearch.github.io/LaViLa; Code is available at http://github.com/facebookresearch/LaViLa
面向EEG-语言基础模型的语义对齐连续隐式预测建模
专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文提出BLPM模型,通过CELP编码器与MQSD模块对齐EEG语义,解决EEG基础模型预训练的关键挑战,在多基准任务中实现良好泛化。
Comments 19 pages, 3 figures; supplementary material included
佐治亚理工学院DS团队参加eRisk 2026任务3:针对ADHD症状句子的稀疏、语义及大语言模型重排序
专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL
AI总结 本文介绍佐治亚理工学院DS团队针对eRisk 2026任务3,采用分阶段检索结合稀疏BM25、语义及LLM重排序的方案,其中LLM重排序器取得官方最优成绩,分阶段重排序具发展前景。
噪声从何而来?大语言模型品牌答案中非确定性的方差成分分解
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究大语言模型品牌答案中非确定性的来源,通过交叉随机效应分解将响应级品牌结果总方差分为提示内重采样等四个来源,应用于多语言多模型语料库,发现查询语言是最大方差来源,跨语言和模型能提升可靠性而非重复提示。
Comments 18 pages, 6 tables, 3 code listings
MetricAnything:利用噪声异构源扩展度量深度预训练
机构 * Li Auto Inc(李自动公司)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。
Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/
SurrogateShield:超越脱敏的高效用隐私保护LLM交互
机构 * Arizona State University(亚利桑那州立大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL
AI总结 提出客户端代理SurrogateShield,用本地生成的类型一致替代值替换检测到的PII,在保护隐私的同时保持语义效用,在1124条查询语料上F1达98.87%,BERTScore提升13.26个百分点。
Comments 14 pages, 1 figure, 9 tables. Code and dataset: https://github.com/sherwinvishesh/SurrogateShield
量化数据影响与数据相似性之间的一致性以理解LLM行为
机构 * RIKEN Center for Advanced Intelligence Project, Tokyo, Japan(日本东京理化学研究所先进智能项目中心) ; Section of Computer Science, EPFL Lausanne, Switzerland(瑞士洛桑联邦理工学院计算机科学系) ; Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室) ; National Research Center for Applied Cybersecurity ATHENE, Germany(德国国家应用网络安全研究中心ATHENE) ; TU Darmstadt & Hessian Center for AI (hessian.AI), Darmstadt, Germany(达姆施塔特工业大学与黑森州人工智能中心)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG
AI总结 通过排序重叠量化数据相似性与数据影响在输出追踪中的一致性和不对称性,并利用不对称性实现成本-精度权衡。
Comments 37 pages, 35 figures, preprint
基于LLM的端到端口语对话状态跟踪的联合语音与文本训练
机构 * Brno University of Technology(布拉格技术大学)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出联合训练口语DST数据和跨域文本DST数据的方法,解决口语数据稀缺和跨域泛化问题,无需目标域口语训练数据即可获得良好性能。
Comments accepted for Interspeech 2026
斯坦福EDGAR文件数据集:将美国公司及财务披露重建为布局忠实且令牌高效的预训练数据
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Nanjing University(南京大学) ; Stanford University(斯坦福大学)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 为解决长上下文文档稀缺问题,提出SEFD数据集,将SEC文件重建为布局忠实的MultiMarkdown格式,用于金融语言建模与评估,具有令牌高效、与Common Crawl重叠率低于0.1%的特点。
Comments Preprint. Includes appendix, tables, and figures
大型字节模型:教会语言模型关于编译代码的知识
机构 * CrowdStrike U.K.(CrowdStrike英国分公司) ; CrowdStrike Romania(CrowdStrike罗马尼亚分公司) ; CrowdStrike USA(CrowdStrike美国分公司)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI
AI总结 本文提出首个字节原生大语言模型,通过定制字节分词器扩展词汇表,使其能直接处理可执行文件原始字节并回答恶意软件分析问题,在家族分类和架构分类上分别达到69%和98%的准确率。
单一LLM驱动的多智能体系统的扩展行为
机构 * Fudan University(复旦大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI
AI总结 本文通过提出顺序迭代多智能体系统(SIMAS)框架,系统研究了同质多智能体系统性能随智能体数量变化的扩展规律,发现性能并非单调提升,而是受协作协同与协调开销之间的权衡支配,呈现收益递减模式。
语言模型中预训练的Grokking类比:追踪延迟的语法泛化
机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校)
专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title);分类 cs.LG
AI总结 本文提出一个基于暴露的框架,在LLM预训练中研究类似grokking的延迟泛化现象,通过BLiMP最小对发现语法泛化延迟,并分析泛化前后语法概念向量的变化。
Comments 18 pages, 10 figures, 9 tables
Înţelegi Româneşte?'' 罗马尼亚语视觉语言模型的构建配方
机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰技术大学布加勒斯特国家大学)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL
AI总结 本文系统研究了构建罗马尼亚语视觉语言模型(VLM)的完整流程,通过翻译英文语料、消融实验分析视觉骨干、语言骨干和OCR数据的影响,并构建文化本地化评估集HoraVQA,证明罗马尼亚语适配模型在性能上超越同尺寸甚至更大尺寸的模型。
基于点视觉融合与语言模型重建的音素级视觉语音识别
机构 * Kyushu Institute of Technology(九州工业大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title);分类 cs.CL
AI总结 提出一种两阶段音素级视觉语音识别框架,通过融合视觉和面部地标运动特征,并利用LLM模型重建单词,在LRS2和LRS3数据集上分别实现17.4%和21.0%的词错误率。
Comments Accepted at ICASSP 2026. This version corresponds to the camera-ready manuscript
TabCausal: 跨因果环境的表格因果发现预训练
机构 * Nanjing University(南京大学)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.LG
AI总结 提出TabCausal,一种通过动态任务构建策略在多样化因果环境中进行大规模预训练的因果发现基础模型,在合成和语义基准上优于现有方法。
适应是双向的:研究人类与语言模型之间的语言趋同
机构 * Khoury College of Computer Sciences(科里学院计算机科学学院)
专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title);分类 cs.CL
AI总结 通过大规模研究人类与LLM对话中的语言趋同现象,发现LLM在功能词和开放类特征上过度适应人类风格,而人类对LLM的适应程度与人类之间对话的基线一致。
重新思考Muon超越预训练:VLA和RLVR中的频谱失败及高频修复
机构 * Michigan State University(密歇根州立大学) ; Cisco(思科) ; University of Minnesota(明尼苏达大学) ; IBM Research(IBM研究院)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG
AI总结 本文研究了Muon优化器在预训练之外的局限性,提出Pion通过高频NS迭代机制改进VLA和RLVR任务的性能。
CAPC-CG:一个大规模、专家指导的中国适应性政策沟通LLM注释语料库
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Northwestern University(西北大学) ; Duke Kunshan University(杜克-昆山大学)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文介绍了CAPC-CG语料库,该语料库是首个开放的中国政策指令注释语料库,基于Ang的适应性政策沟通理论,采用五色分类法对清晰和模糊语言类别进行标注,旨在支持下游任务和多语言NLP研究。
Comments Accepted for publication in the Proceedings of ACL Main 2026
20/20 Vision Language Models: 通过数据整理单独提升VLMs的方案
机构 * DatologyAI
专题命中 预训练与数据 :language model(title,title_cn);pretraining(abstract);分类 cs.LG
AI总结 本文通过数据整理提升VLMs性能,展示在20个公开基准和DatBench九个能力轴上均取得显著提升,同时提升可靠性、OOD泛化和推理效率。
Comments 33 pages, 15 figures. DatalogyAI website for more details: https://www.datologyai.com/
原型引导的单细胞表示学习预训练
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 本文提出CellRefine方法,通过整合标记基因集作为先验指导单细胞预训练后的优化,提升下游任务性能,实验显示性能提升达15%。
说服策略有多重要?来自慈善捐赠对话的LLM注释证据
机构 * Interdisciplinary Centre for Security, Reliability and Trust (SnT)(安全、可靠性与信任跨学科研究中心)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究通过分析10600个对话中的说服策略,发现仅 guilt induction 与较低的捐款率相关,而 reciprocity 是最强的正相关因素,表明单纯策略识别不足以解释说服效果。
Comments 8 pages, 2 figures, 5 tables. Interdisciplinary Centre for Security, Reliability and Trust (SnT), University of Luxembourg
探索在LLM训练中作为可靠性挑战的静默数据损坏
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 研究静默数据损坏对LLM预训练的影响,通过GPU矩阵乘法指令注入故障,分析不同位位置、内核函数和执行阶段的敏感性,并提出轻量检测方法以缓解有害参数更新。
Comments 10 Pages, 4 Figures, CCGrid 2026
多样本提示与演员-评论员提示优化用于多样化合成数据生成
机构 * Paris 1 Panthéon–Sorbonne University(巴黎第一大学)
专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出多样本提示与演员-评论员提示优化方法,用于提升合成数据生成的多样性与下游任务表现,实验显示在需求工程分类任务中,F1分数提升达6至43.8个百分点。