MatLM: a Matrix Formulation for Probabilistic Language Models
专题命中 知识编辑与模型理解 :language model(title,abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 知识编辑与模型理解 :language model(title,abstract)
专题命中 知识编辑与模型理解 :large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI;foundation model(comments)
Comments LLMs, Native, Arabic LLMs, Augmentation, Multilingual, Language Diversity, Contextual Understanding, Minority Languages, Culturally Informed, Foundation Models, Large Language Models
EEG-PRIME:面向脑电信号解码的多层级条件原型对齐表示学习
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Centre for AI in Medicine, Nanyang Technological University(南洋理工大学医学人工智能中心) ; Southeast University(东南大学)
专题命中 知识编辑与模型理解 :foundation model(abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.AI
AI总结 本文提出EEG-PRIME脑电基础模型,结合掩码预训练与原型对齐指令调优,在16个多类型数据集上实现跨被试解码性能提升,且具备零样本迁移能力。
谁搭建安全桥梁?识别并靶向跨语言共享安全路径
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究识别出跨语言共享安全路径,提出基于该路径的靶向对齐方法,仅更新少量参数即可提升非高资源语言安全性并保留模型通用能力。
助力音乐协同创作智能体“良好聆听”:用于理解与生成的分层自监督世界模型
机构 * Belmont University(贝尔蒙特大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.LG
AI总结 本研究提出分层自监督世界模型,通过Swin V2编码器与条件流匹配模型构建协同音乐创作智能体,提升了和弦与调式检测准确率,可快速生成音乐建议并支持交互演示。
Comments 20 pages, 14 figures. A 6-page version was submitted to the NeurIPS 2026 Creative AI Track. Supplemental website with listening examples: https://drscotthawley.github.io/midi-rae-jepa-son/. Live demo: https://drscotthawley-midi-rae-jepa-son.hf.space/
LDARNet: 用于基因组建模的DNA自适应表示网络与可学习分词
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL
AI总结 提出LDARNet,一种结合动态分块和双向路由的120M参数层次基因组基础模型,在27个任务中优于更大模型,并发现学习到的边界与生物学基序对齐。
Comments Fix parameter count typo; update results
RadPRISM:用于概念解耦图像表示与视觉定位的模式分层放射学报告监督方法
机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) ; TUM University Hospital(慕尼黑工业大学医院) ; Technical University of Munich, School of Medicine and Health(慕尼黑工业大学医学与健康学院) ; Klinikum rechts der Isar(右伊萨尔医院) ; Charité – Universitätsmedizin Berlin(柏林夏里特医学院) ; Freie Universität Berlin(柏林自由大学) ; Humboldt Universität zu Berlin(柏林洪堡大学) ; Imperial College London(伦敦帝国理工学院) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) ; University Hospital Essen (AöR)(埃森大学医院(AöR)) ; Institute for Artificial Intelligence in Medicine (IKIM)(医学人工智能研究所(IKIM)) ; Institute of Interventional and Diagnostic Radiology and Neuroradiology(介入与诊断放射学及神经放射学研究所) ; National Center for Tumor Diseases West(西部肿瘤疾病国家中心)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG
AI总结 RadPRISM将放射学模式作为分层轴,通过专用视觉子空间对齐临床概念,提升零样本分类与视觉定位性能,实现可透明检查的概念解耦医学图像表示。
语言多样性:评估非洲语言在数字空间中的使用情况和人工智能性能
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Africa Kigali Rwanda(非洲基加利卢旺达) ; Bahir Dar Institute of Technology(巴希尔达尔技术学院) ; Federal University Otuoke Bayelsa Nigeria(贝莱萨州联邦大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL
AI总结 本研究发现本地新闻数据比对话平台数据更有效用于训练非洲语言的AI模型,强调了处理干净和语言切换文本的重要性。
时间胶囊:将生成性幻觉作为历史意义建构的一种方法
机构 * Muhlenberg College(Muhlenberg学院)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL
AI总结 研究针对大语言模型在叙述过去时不可靠的问题,提出在维多利亚时代文本上训练的TimeCapsule模型,通过定量评估和定性探究展示其性能及问题,认为对未来的无知使幻觉成为对19世纪本体论的解释性探索。
Comments 10 pages, 4 figures. Accepted to Creativity and Cognition (C&C '26)
模式感知本地化(SAL):用于Oracle NL2SQL的实时模式基础与幻觉验证
机构 * Torrens University Australia(澳大利亚托伦斯大学)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大型语言模型在Oracle数据库执行SQL失败的问题,提出模式感知本地化(SAL)轻量级中间件,通过构建实时模式映射、注入上下文及幻觉索引验证等方法,提升执行基础真值,减少执行失败率。
Comments 18 pages , 3 figures , 14 tables ,1 algorithm
为自信所束缚:对大语言模型中过度自信的机械视角分析
机构 * University of Virginia(弗吉尼亚大学)
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究探讨了大语言模型中过度自信的机制,发现中间层的MLP块和注意力头会生成自信信号,并通过干预提升校准性。
Comments COLM 2026
学习进行事实性推理
机构 * FAIR at Meta(Meta 的 FAIR) ; University of Washington(华盛顿大学)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究推理大型语言模型在事实性推理方面的问题,提出同时考虑事实精度、响应细节和答案相关性的新型奖励函数,应用在线强化学习,使模型在长篇事实性基准测试中幻觉率降低、答案细节提升且响应帮助性无降。
Comments ICML 2026
EssayCBM: 基于评分标准的概念瓶颈模型用于透明的作文评分
机构 * Arizona State University(亚利桑那州立大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL
AI总结 EssayCBM通过分解为八种可解释的写作概念,提供透明的作文评分方法,使教师能够检查和调整评分标准级别的预测。
当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。
自我提升往往是突然的:大规模模型的顿悟式微调
机构 * School of Computer Science and Artificial Intelligence, Guangdong University of Education(广东第二师范学院计算机科学与人工智能学院) ; School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG
AI总结 研究大规模模型自主提升,提出顿悟式无训练后微调范式,通过修改关键模块捷径且不更新权重,针对大语言和视觉语言模型有不同实例化,实验证明有效解锁预训练网络潜力,提升性能。
幽灵标注者:通过共形预测探索内容审核中人类标签变异的框架
机构 * Laboratory for the Modeling of Biological and Socio-technical Systems, Northeastern University(生物与社会技术系统建模实验室,东北大学) ; Heriot-Watt University(赫瑞-沃顿大学) ; aequa-tech ; Università del Piemonte Orientale(皮埃蒙特东方大学) ; Università degli Studi di Torino(托斯卡纳大学)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL
AI总结 提出结合共形预测与协同过滤式标注者表征的框架,通过幽灵预测度量和幽灵标注者表征量化模型预测与所有人类标注的分歧,并发现模型在标注者分歧时不确定性增加,但大型模型对无人类对齐文本更自信,且存在结构性人口统计偏差。
Comments The publishing of this preprint is contextual with the ACL ARR cycle system. After an encouraging review in January we revised and submit the paper on Arxiv. However, a new batch of reviewers raised additional issues that will lead to significant revisions of the experimental setting. Therefore, we decide to withdraw the manuscript
测量人工智能的元认知
机构 * Center for Brain Science, RIKEN(日本立命馆大学脑科学研究中心)
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出使用meta-d'框架和信号检测理论评估AI的元认知能力,通过实验验证其在不同任务和风险下的决策调节能力。
Comments 19 pages, 5 figures, 2 tables
替代保真度:开放LLM何时能解释封闭LLM?
机构 * Meta
专题命中 知识编辑与模型理解 :LLM(title_cn);language model(abstract);分类 cs.LG
AI总结 研究开放模型能否替代解释封闭模型,发现预测保真度显著高估归因保真度,模型虽答案一致但理由不同,机械解释不能自动迁移。
在资源不足的癫痫护理中教授LLMs推荐与转诊
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Makerere University(马凯雷雷大学) ; St. Francis Hospital Nsambya(圣弗朗西斯医院恩桑比亚分院)
专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.LG
AI总结 针对资源匮乏环境下专科癫痫专家稀缺的问题,提出MANANA框架,通过非参数提示学习从少量患者数据中学习本地处方指南,结合贝叶斯提示平均实现不确定性驱动的选择性预测,在乌干达儿科癫痫队列中提升处方准确率并支持转诊。
Comments 34 pages, 8 figures
LibEvoBench:探测代码生成模型中的时间知识分层
机构 * Faculty of EEMCS, Delft University of Technology, Delft, Netherlands(代尔夫特理工大学电子工程与信息科学学院) ; JetBrains Research, Amsterdam, Netherlands(JetBrains研究)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 针对LLM在代码生成中因训练数据时间混合导致API版本混淆的问题,提出多版本基准LibEvoBench和新指标SEUS,揭示模型对版本不敏感且仅靠文档可提升准确性。
Comments Accepted at the DL4Code workshop at ICML 2026
从语义和语音角度探测语音编解码器
机构 * University of Southern California(南加州大学) ; Dolby Laboratories(杜比实验室)
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文通过三项任务系统分析多种语音分词器编码的信息,发现当前分词器主要捕获语音结构而非词汇语义,为下一代语音分词方法设计提供指导。
Comments Accepted by Interspeech 2026
自信但矛盾:大语言模型中的内部不确定性与认知失调解决
机构 * Indiana University Bloomington(印第安纳大学伯明顿分校)
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型面对矛盾输入时的认知失调解决机制,提出信任弹性(TE)度量模型被说服的倾向,并发现内部不确定性指标(如置信度校准和内部不确定性变化)与行为变异相关。
BALTO: 用于幻觉缓解的平衡令牌级策略优化
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent(腾讯) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 针对大语言模型幻觉问题,提出BALTO框架,通过提取可验证事实声明并投影为令牌级标签,引入平衡信用分配机制,在六个模型-基准设置中实现最高忠实度,优于现有后训练基线。
基于不确定性感知注意力头的高效大语言模型幻觉检测
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德人工智能大学) ; ETH Zurich(苏黎世联邦理工学院) ; Independent Researcher(独立研究者) ; Applied AI Institute(应用人工智能研究所)
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出RAUQ框架,利用不确定性感知注意力头与令牌级置信度,通过单次前向传递实现无监督、高效的序列级幻觉检测,在12个数据集上优于现有方法且额外计算少于1%。
Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea, 2026
LapidaryEngine: 全对话式晶体生成
机构 * Lattice Lab, Toyota Motor Corporation(丰田汽车公司Lattice实验室) ; The University of Osaka(大阪大学)
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出LapidaryEngine,首个支持全对话式晶体生成的模型,通过枢轴表示实现文本与晶体结构的双向翻译,支持自由形式自然语言请求和迭代优化。
Comments 11 main pages, 5 main figures, and 1 table
SAGE: 面向言语不确定性对齐的答案条件不确定性目标
机构 * University of Notre Dame(圣母大学)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL
AI总结 提出SAGE目标,通过答案条件不确定性几何从模型采样响应中构建群组级不确定性目标,结合GUPO训练框架优化言语不确定性表达,在多项推理任务中提升不确定性排序、降低校准误差和过度自信。
GPT-Micro: 一种用于制造业中加速、低成本且热力学一致的本构模型发现的大语言范式
机构 * Department of Mechanical and Aerospace Engineering, Rutgers University(罗格斯大学机械与航空航天工程系) ; Department of Mechanical, Aerospace & Manufacturing Engineering, University of Connecticut(康涅狄格大学机械、航空航天与制造工程系) ; Edison Welding Institute(埃迪森焊接研究所) ; Manufacturing Science Division, Oak Ridge National Laboratory(橡树岭国家实验室制造科学分会) ; Department of Aerospace and Mechanical Engineering, University of Texas at El Paso(德克萨斯州埃尔帕索大学航空航天与机械工程系)
专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出GPT-Micro范式,结合大语言模型、热力学约束和稀疏数据,实现自主发现本构模型,在印刷电子测试中数据量减少70%、发现时间缩短400倍。
Comments 23 pages, 4 tables, 11 equations, 9 figures
原子作为语言:VQ-Atom:用于分子表示学习的语义离散化
机构 * Atoms as Language, LLC(Atoms as Language公司)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG
AI总结 本文提出VQ-Atom,一种用于分子表示学习的语义离散化框架,通过将连续的原子级图表示转换为对应局部化学环境的离散标记,从而提升分子表示的学习效果。
Comments 7 pages, 6 figures. Submitted to ICML 2026 Workshop on Foundation Models for Life Sciences
工作流到技能:通过路由-工作流-语义-附件分解创建技能
机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门与可信计算重点实验室,教育部,网络安全科学与工程学院,武汉大学) ; Nanchang University(南昌大学)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI
AI总结 提出RWSA中间表示和W2S框架,从异构交互证据中自动构建技能,通过分解工作流结构、执行语义和运行时附件,提升行为重放一致性10.5%。
Comments 10 pages, 2 figures
为什么你不知道?评估不确定性来源对大型语言模型中不确定性量化的影响
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文通过引入一个明确分类不确定性来源的新数据集,系统评估了现有不确定性量化方法在不同不确定性来源下的表现,发现多数方法在模型知识局限下表现良好,但在其他来源下性能下降或产生误导。