Extending Puzzle for Mixture-of-Experts Reasoning Models with Application to GPT-OSS Acceleration
扩展谜题以用于专家混合推理模型的推理,应用于GPT-OSS加速
专题命中 效率与部署 :post-training(abstract);分类 cs.LG
AI总结 本文通过扩展Puzzle框架优化GPT-OSS模型,结合MoE剪枝、注意力替换、量化和强化学习提升推理效率,实现部署优化并提高请求级效率。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
扩展谜题以用于专家混合推理模型的推理,应用于GPT-OSS加速
专题命中 效率与部署 :post-training(abstract);分类 cs.LG
AI总结 本文通过扩展Puzzle框架优化GPT-OSS模型,结合MoE剪枝、注意力替换、量化和强化学习提升推理效率,实现部署优化并提高请求级效率。
恒星中由对流和潮汐激发的重力波之间的竞争
专题命中 效率与部署 :prompting(abstract)
AI总结 研究恒星伴星影响下重力波的激发机制,分析对流和潮汐激发的相对贡献及关键参数,揭示伴星对恒星辐射层角动量传输的影响。
Comments 17 pages, 16 figures
120分钟与一台笔记本:通过无监督探索和离线强化学习实现极简图像目标导航
机构 * Faculty of Science and Technology, University of Macau(澳门大学科技学院)
专题命中 效率与部署 :pretraining(abstract)
AI总结 本文提出MINav方法,通过无监督数据收集与 hindsight 目标重标记,实现高效图像目标导航,在120分钟内使用消费级笔记本完成训练与部署,无需人工干预。
Comments 8 pages, 8 figures, submitted to IEEE Robotics and Automation Letters (RA-L)
重新思考特征条件化以在边缘AI传感系统中实现稳健的伪造媒体检测
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文研究了在边缘AI传感系统中,通过特征条件化提升伪造媒体检测鲁棒性的问题,提出了一种基于DINOv3 ConvNeXt的可控探针研究,发现无需任务特定微调,仅使用线性探针即可获得竞争性性能,表明ViT-7B自监督蒸馏可适应边缘兼容的推理成本。
Skullptor:几秒钟内通过多视角法线预测实现高保真的3D头部重建
机构 * Ubisoft La Forge(育碧La Forge) ; University of Toronto(多伦多大学) ; ÉTS Montréal(蒙特利尔高等技术学院) ; Vector Institute(向量研究所)
专题命中 效率与部署 :foundation model(abstract)
AI总结 本文提出Skullptor,结合单目基础模型与跨视角注意力机制,通过法线预测和逆渲染优化,实现高保真的3D头部重建,优于现有单图和多视角方法,减少相机需求和计算成本。
Comments For our project page, see https://ubisoft-laforge.github.io/character/skullptor/
PokeFusion Attention:一种轻量级的跨注意力机制用于风格条件图像生成
机构 * Independent Researcher, Vancouver, Canada(独立研究员,加拿大温哥华) ; School of Computing, Universiti Kebangsaan Malaysia (UKM), Malaysia(马来西亚国立大学计算机学院)
专题命中 效率与部署 :prompting(abstract)
AI总结 本文提出PokeFusion Attention,一种轻量级跨注意力机制,用于风格条件图像生成,通过学习风格分布先验而非实例级条件,提升生成效果与一致性。
Comments 12 pages, 5 figures. Revised version with improved method description and corrected references
BeetleFlow: 一种用于甲虫图像处理的集成深度学习流水线
机构 * The Ohio State University(俄亥俄州立大学) ; Rensselaer Polytechnic Institute(伦斯勒理工学院) ; The University of Maine(缅因大学) ; National Ecological Observatory Network (NEON), Battelle(国家生态观测网络(NEON),巴特尔纪念研究所) ; Michigan State University(密歇根州立大学)
专题命中 效率与部署 :language model(abstract)
AI总结 本文提出BeetleFlow流水线,通过深度学习方法自动处理大量甲虫图像,实现甲虫检测、排序裁剪和形态分割,提高生物研究效率。
Comments 4 pages, NeurIPS 2025 Workshop Imageomics
大型语言模型在软件测试教育中的应用:经验报告
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 本文通过混合方法研究,探讨学生在使用LLM进行测试任务时的交互问题及教学策略,提出轻量级提示框架以提升测试脚本生成能力。
Comments Paper Accepted by the ACM International Conference on the Foundations of Software Engineering (FSE 2026) Software Engineering Education Track
通过大型语言模型和符合性检查构建软件监视器以实现控制流异常检测
机构 * University of Naples Federico II(那不勒斯费德里科二世大学) ; University of Applied Sciences and Arts of Southern Switzerland(瑞士南部应用科学与艺术大学) ; University of Florence(佛罗伦萨大学) ; Linnaeus University(林奈大学)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
AI总结 本文提出利用大型语言模型和符合性检查构建软件监视器,以检测控制流异常。通过在铁路交通管理系统中测试,该方法实现了82.849%的控制流覆盖率和95.957%的F1分数。
使用大语言模型自动化从芬兰电子健康记录中检索临床信息
机构 * Aalto University School of Science(阿尔托大学理学院) ; Tampere University(坦佩雷大学) ; Tampere University Hospital(坦佩雷大学医院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文提出一种本地部署的临床上下文问答框架,通过EHR直接回答临床问题,验证了开源大语言模型在无外部数据传输情况下检索患者特定信息的准确性与可行性。
面向利用大语言模型支持渗透测试教育:一项评估与比较
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract)
AI总结 本文评估大语言模型在渗透测试教育中的有效性,通过15项任务测试6种模型,发现GPT-4o mini表现最一致,但需结合WhiteRabbitNeo提升工具推荐能力。
Comments To be published in: 11th IEEE International Conference on Social Networks Analysis, Management and Security (SNAMS-2024), IEEE
自动化领域驱动设计:提示框架的经验
机构 * Chair of Software Engineering Technical University of Munich Heilbronn, Germany ; Engineering Team FTAPI Software GmbH Munich, Germany
专题命中 领域大模型 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出一个提示框架,通过结构化大语言模型交互自动化领域驱动设计的核心活动,通过案例研究验证其在真实需求下的有效性,发现后期步骤易积累误差,LLM能增强但无法替代架构专业知识。
Comments \c{opyright} 20XX IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works
对抗性新闻与损失利润:在基于大语言模型的算法交易中操纵头条
专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究探讨了在基于大语言模型的算法交易中,通过操纵新闻头条导致模型误判的风险,分析了Unicode同音替代和隐藏文本条款对模型影响,并量化了其对收益的负面影响。
Comments This work has been accepted for publication at the IEEE Conference on Secure and Trustworthy Machine Learning (SaTML). The final version will be available on IEEE Xplore
小型模型能否对法律文件进行推理?一项比较研究
机构 * Independent Researcher(独立研究员)
专题命中 领域大模型 :prompting(abstract,comments);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文通过测试九种模型在三个法律基准上的表现,发现3B参数的混合专家模型在法律持有识别上优于GPT-4o-mini,且提示策略影响显著,few-shot提示效果最佳。
Comments 17 pages, 9 models, 5 prompting strategies, 3 legal benchmarks, 405 experiments
KALAVAI:预测独立专家融合何时有效——一个事后合作大语言模型训练的定量模型
机构 * Murai Labs
专题命中 领域大模型 :LLM(title);分类 cs.CL、cs.AI、cs.LG
AI总结 KALAVAI提出一个定量模型,通过事后融合独立训练的领域专家,预测协作增益,验证了在不同规模模型上的融合效果及路由精度。
ZEBRA-Prop:一种基于零样本嵌入的快速且易用的材料属性回归模型
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出ZEBRA-Prop模型,利用领域专用LLM和文本嵌入技术,无需微调即可实现材料属性预测,训练时间减少95%,提升预测性能。
迈向可靠科学可视化管道构建的结构感知检索增强型大语言模型
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出结构感知检索增强型大语言模型,用于生成可执行的科学可视化管道,通过提供 vtk.js 代码示例提高模块选择和执行顺序的准确性,降低人工修正成本。
大语言模型能否在一学期内完成原创天文研究?一门研究生课程实验
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本研究探讨了大语言模型在 unfamiliar 领域进行原创天文研究的能力,发现尽管学生普遍认为模型节省时间,但模型在复杂代码生成、数据检索和准确性方面存在不足,同时学生担忧模型可能抑制创造力。
Comments 17 pages; white paper about a graduate class experiment on using LLMs for scientific research in Fall 2025 at the University of Arizona
葡萄牙语临床命名实体识别:现代BERT模型和LLM的基准测试
机构 * Spesia ; Faculdade de Medicina, Universidade de São Paulo(圣保罗大学医学院) ; Pontifícia Universidade Católica do Paraná (PUCPR)(巴拉那天主教大学) ; Florida Atlantic University(佛罗里达大西洋大学) ; Universidade Federal do Paraná (UFPR)(巴拉那联邦大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文评估了BERT和LLM在葡萄牙语临床命名实体识别中的表现,发现mmBERT-base在微平均F1分数上表现最佳,通过迭代分层和过采样策略提升了性能。
Comments Under peer review. GitHub: https://github.com/GRUPOMED4U/clinical_ner_benchmark_paper
ClimateCheck 2026:气候相关主张的科学事实核查与虚假信息叙述分类
机构 * Deutsches Forschungszentrum für Künstliche Intelligenz GmbH (DFKI)(德国人工智能研究中心) ; Technische Universität Berlin(柏林工业大学) ; Leuphana Universität Lüneburg(吕讷堡大学) ; Humboldt-Universität zu Berlin(柏林洪堡大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 ClimateCheck 2026通过扩大训练数据和新增虚假信息叙述分类任务,挑战气候相关主张的自动核查,揭示传统指标的系统性偏差。
Comments Accepted at NSLP@LREC 2026
基于检索增强生成的护士观察提取
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出自动流程减轻护士负担,通过RAG方法提取临床观察,达到0.796的F1分数。
并非心灵,而是符号:通过符号学重新审视大语言模型
机构 * University of Lausanne(洛桑大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文挑战将大语言模型视为认知系统的倾向,提出符号学视角,强调模型通过符号操作和意义生成参与文化过程,而非模拟人类思维。
金融面板数据中的时间覆盖偏差:一种覆盖意识的结构化框架及达卡证券交易所的实证研究
专题命中 领域大模型 :foundation model(abstract)
AI总结 本文提出一种覆盖意识的结构化框架,用于解决金融面板数据中因时间覆盖不一致导致的偏差问题,并通过达卡证券交易所的数据验证了该方法对收益率动态和波动性的影响。
Comments 16 pages, 7 figures, 2 tables
为医学图像中的概念驱动病变分割适应Segment Anything Model 3:一项实验研究
机构 * The Medical Artificial Intelligence and Automation (MAIA) Laboratory, Department of Radiation Oncology, University of Texas Southwestern Medical Center(德克萨斯大学西南医学中心放射肿瘤学系医学人工智能与自动化(MAIA)实验室) ; Medical Image Processing Group, Department of Radiology, University of Pennsylvania(宾夕法尼亚大学放射学系医学图像处理组) ; Division of Digestive and Liver Diseases, Department of Internal Medicine, University of Texas Southwestern Medical Center(德克萨斯大学西南医学中心内科学系消化与肝脏疾病科)
专题命中 领域大模型 :foundation model(abstract)
AI总结 本文评估SAM3在多模态医学图像中的病变分割性能,通过几何框和概念提示提升鲁棒性,并展示其跨模态泛化能力。
Comments 31 pages, 8 figures
基于大语言模型文本生成的不确定性分析形式框架
机构 * University of Passau(帕绍大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.LG
AI总结 本文提出形式框架以测量文本生成中不确定性,考虑提示、生成和解释的相互关联过程,并展示如何通过过滤器和目标函数表达不确定性,揭示现有方法的关联性及未研究的不确定性方面。
稀疏自编码器与大型语言模型的整体性
机构 * University of Reading(雷丁大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨LLM是否暗示了语义整体性,通过稀疏自编码器发现的可解释潜在特征挑战了传统整体性观点,最终论证整体性仍具说服力。
H-Node攻击与防御在大语言模型中
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出H-Node对抗噪声消除框架,通过识别并防御Transformer大语言模型中的幻觉表示,利用逻辑回归探针定位幻觉节点,通过白盒对抗攻击增强这些维度,并采用自适应防御抑制幻觉节点,提升模型鲁棒性。
Comments 17 pages, 7 figures, 6 tables
神经不确定性原理:对抗脆弱性与大语言模型幻觉的统一视角
机构 * Northwest Institute of Nuclear Technology(西北核技术研究所) ; Tsinghua University(清华大学)
专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文揭示对抗脆弱性与大语言模型幻觉的共同几何起源,提出神经不确定性原理,通过输入与损失梯度的不确定性界限,提供统一的可靠性分析框架。
Comments 16 pages,3 figures
CARPE:通过集成实现上下文感知的图像表示优先级
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 CARPE通过集成机制增强大视觉-语言模型对视觉和文本模态的自适应加权能力,提升图像分类和多模态任务表现。
对齐税:对齐语言模型中的响应同质化及其对不确定性估计的影响
专题命中 知识编辑与模型理解 :language model(abstract);SFT(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究发现对齐语言模型存在响应同质化现象,影响不确定性估计方法的效果,提出通过叠加不确定性信号提升模型性能。
Comments 25 pages, 3 figures, 10 tables, 24 experiments across 5 benchmarks. v2: added SINdex head-to-head (Exp 27), NLI validation (Exp 28), decoding protocol analysis. Code: https://github.com/DigitLion/ucbd-experiment