The WER Trap: Shattering the Illusion of Unified Tokens in Speech Language Models
WER陷阱:打破语音语言模型中统一令牌的幻觉
专题命中 领域大模型 :language model(title,abstract);SLM(abstract,abstract_cn)
AI总结 本文通过动态压缩分词器提取纯语义令牌,揭示了低WER令牌无法保留声学合成所需的连续语音轨迹,从而打破统一令牌的幻觉。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
WER陷阱:打破语音语言模型中统一令牌的幻觉
专题命中 领域大模型 :language model(title,abstract);SLM(abstract,abstract_cn)
AI总结 本文通过动态压缩分词器提取纯语义令牌,揭示了低WER令牌无法保留声学合成所需的连续语音轨迹,从而打破统一令牌的幻觉。
SAMD:一种识别AI/ML医疗设备中虚假数据注入场景的工具
专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出SAMD工具,基于STPA-Sec和LLM自动化识别AI/ML医疗设备设计阶段的虚假数据注入漏洞与攻击场景,在五个FDA批准设备上验证了高精度与效率。
Comments 10 pages, 6 figures, 3 tables
Croissant Tasks:一种用于可重复机器学习评估的元数据格式
机构 * Google DeepMind(谷歌DeepMind) ; ChaLearn ; Université Paris-Saclay(巴黎-萨克雷大学) ; Jetty ; Mila, Quebec AI Institute(魁北克AI研究所) ; Inst. of Computational Biology, Helmholtz Munich(海德堡慕尼黑计算生物学研究所) ; German Center for Diabetes Research(德国糖尿病研究中心) ; School of CIT, TUM(技术大学 CIT 学校) ; Helmholtz AI(海德堡人工智能研究所) ; Brickroad ; Eindhoven Univ. of Technology(埃因霍温技术大学)
专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI
AI总结 提出Croissant Tasks元数据格式,通过声明式规范解耦任务问题与解决方案,结合自动化LLM管道实现概念可重复性,使自主代理能从零生成可复现的评估流水线。
Comments 10 pages, 4 figures
Agent4Edu:通过生成式智能体为智能教育系统生成学习者响应数据
机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Artificial Intelligence(人工智能研究院) ; Hefei Comprehensive National Science Center(合肥综合性国家科学中心)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出Agent4Edu,一种利用大语言模型构建生成式智能体模拟学习者行为,以解决智能教育系统中离线指标与在线性能差异的问题,并支持个性化学习算法评估与优化。
Comments Accepted by AAAI2025
生物安全盲点:开放科学基础设施中的系统性双重用途检测
机构 * LophiLabs
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究通过混合词法过滤和大语言模型评估,系统分析了bioRxiv预印本中双重用途研究关注内容,揭示了开放获取摘要中普遍存在的潜在风险,并提出了结合元数据监控与开放科学原则的治理框架。
Comments Ongoing work
认知范畴变换器:用于语言建模的范畴论归纳偏置
机构 * Manceps Inc.(Manceps公司)
专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 提出认知范畴变换器(CCT),通过引入基于范畴论和认知科学的组件,在WikiText-103上以306M参数实现21.27验证困惑度,相比GPT-2 Small基线降低2.92 PPL(12%相对提升),并通过消融实验证实单纯复形消息传递贡献了84%的改进。
为什么专家模型仍然重要:面向医学人工智能的异构多智能体范式
机构 * Fudan University(复旦大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出HetMedAgent异构多智能体框架,通过冲突感知证据融合、不确定性驱动的临床医生干预触发和自适应阈值校准,实现通用大语言模型与领域专家模型的协同,在三个临床决策任务中验证了专家模型在模态特定分析中的不可替代价值。
Comments Accepted at ICML 2026. 12 pages main text, 16 pages appendix
MELD: 基于梅尔频谱的离散潜变量语音语言建模
机构 * University of Edinburgh(爱丁堡大学) ; Google DeepMind(谷歌DeepMind) ; Meta Superintelligence Labs(Meta超智能实验室)
专题命中 领域大模型 :language model(title,abstract);分类 cs.CL
AI总结 提出一种在梅尔频谱上联合优化编码器和语音语言模型的离散潜变量模型,在零样本文本转语音和语音转文本任务上优于基于编解码器和其他梅尔频谱基线,并缓解了自回归建模中的长时间静音和单词遗漏问题。
医疗视觉语言模型中的谄媚行为基准测试与缓解
机构 * MBZUAI ; Saarland University(萨尔兰大学) ; HKUST(GZ)(香港科技大学(广州)) ; KAUST(卡塔尔大学)
专题命中 领域大模型 :language model(title,abstract);分类 cs.AI
AI总结 针对医疗视觉语言模型中的谄媚问题,提出分层医疗视觉问答基准和VIPER策略,通过过滤非证据社会线索减少谄媚,提升模型鲁棒性。
Comments 19figures, 61pages. The first two authors contributed equally
从数据到洞察:探索程序化思维提示在图表摘要中的应用
机构 * Adelaide University(阿德莱德大学)
专题命中 领域大模型 :prompting(title);language model(abstract);分类 cs.CL
AI总结 本文提出一种零样本学习方法,通过Python程序作为中介,利用程序化思维策略驱动轻量级视觉语言模型进行图表摘要,并引入图表到字典的辅助任务以提高灵活性和性能。
Comments 22 pages, 9 figures
ProtoMedAgent: 通过隐私感知的智能体工作流实现多模态临床可解释性
机构 * School of Computing and Communications(计算与通信学校) ; Lancaster University(兰卡斯特大学) ; Lancaster Medical School(兰卡斯特医学院) ; PUC-Rio(里约热内卢联邦大学) ; Puc-Behring Institute for AI(人工智能皮克林研究所)
专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出ProtoMedAgent框架,通过神经符号瓶颈和反射性Scribe-Critic循环约束生成过程,解决原型网络在临床报告中的语义结构缺失和检索谄媚问题,并引入k-匿名和ℓ-多样性隐私门控。
Comments CVR 2026
ProjectionBench: 在渐进信息揭示下评估大语言模型的科学假设生成
机构 * Unreasonable Labs
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出ProjectionBench框架,通过渐进式信息揭示评估大语言模型在科学发现中的创新性和推理能力,实验表明GPT-5.4在最小上下文下仍保持0.7 F1分数与真实结论对齐。
Comments 19 pages, 4 figures
内部表示,而非临床知识:明显的大语言模型分诊失败源于何处
机构 * Macquarie University(麦考瑞大学) ; Politecnico di Bari(巴里理工大学) ; NSW Health(新南威尔士州卫生部) ; Independent Researcher(独立研究者)
专题命中 领域大模型 :LLM(title);分类 cs.CL、cs.AI
AI总结 本研究通过稀疏自编码器特征分析,发现大语言模型在分诊任务中表现不佳源于输出格式限制,而非临床知识表示缺陷。
Comments 9 pages main text, 27 pages total including appendices; 7 figures, 25 tables
大规模人工智能与基础模型在神经科学中的应用:综合综述
机构 * Department of Systems Engineering, Stevens Institute of Technology(系统工程系,史蒂文斯理工学院) ; Department of Neurology and Weill Institute for Neurosciences, University of California San Francisco(神经病学系和Weill神经科学研究所,旧金山大学) ; Duke Institute for Brain Sciences, Duke University(杜克大学脑科学研究所) ; Division of Systems Engineering, Department of Electrical and Computer Engineering, Boston University(系统工程 division,电气与计算机工程系,波士顿大学) ; Department of Neuroscience, School of Translational Medicine, Monash University(神经科学系,转化医学学院,莫纳什大学) ; Department of Neurology, Alfred Hospital, Melbourne, Victoria, Australia(神经病学系,阿尔弗雷德医院,墨尔本,维多利亚州,澳大利亚) ; Department of Radiology and Biomedical Imaging, University of California, San Francisco, CA, USA(放射学与生物医学成像系,旧金山大学,加州,美国) ; Department of Psychiatry and Behavioral Sciences, School of Medicine, Stanford University(精神病学与行为科学系,医学院,斯坦福大学) ; Wu Tsai Neurosciences Institute, Stanford University(吴氏神经科学研究所,斯坦福大学) ; Stanford Institute for Human-Centered AI, Stanford University(斯坦福大学人本人工智能研究所)
专题命中 领域大模型 :foundation model(title);分类 cs.AI
AI总结 本文综述了大规模AI模型在神经科学四个主要领域(神经影像与数据处理、脑机接口与神经解码、临床决策支持与转化框架、神经系统与精神疾病特定应用)的应用,展示了其在多模态数据整合、时空模式解释和临床转化方面的潜力,并强调了严格评估、领域知识整合、临床验证和伦理指南的重要性。
Comments Accepted for publication in Meta-Radiology
CCS:放射学报告生成的临床共识选择
机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) ; School of Electrical and Computer Engineering, University of Sydney(悉尼大学电气与计算机工程学院) ; Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出CCS框架,通过采样多个候选报告并选择临床共识最高的一个,以改进放射学报告生成在推理时的质量。
Comments 17 pages, 6 figures
MEMENTO: 利用网络作为低数据领域的学习信号
机构 * Adobe, Media & Data Science Research Lab(Adobe媒体与数据科学研究实验室)
专题命中 领域大模型 :instruction tuning(abstract);prompting(abstract);分类 cs.AI
AI总结 提出MEMENTO框架,通过自适应探索树和双通道记忆将网络作为学习信号,在低数据专业领域(销售自动化和法律研究)中显著提升性能。
AfriScience-MT:通过文本翻译实现非洲科学去殖民化
机构 * Data Science for Social Impact, University of Pretoria(数据科学与社会影响,南非比勒陀利亚大学) ; Masakhane Research Foundation(马萨克纳研究基金会) ; Imperial College London(伦敦帝国理工学院) ; Mila, McGill University(麦吉尔大学Mila实验室) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ; University of Cape Town(开普敦大学) ; University of Wisconsin - Stevens Point(威斯康星大学斯蒂文斯点分校) ; Independent Consultant(独立顾问) ; University of South Africa(南非大学) ; Independent Researcher(独立研究员) ; Access 2 Perspectives ; Lelapa AI(Lelapa人工智能)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对非洲语言缺乏科学术语的问题,构建包含6种非洲语言、11个科学领域的平行语料库AfriScience-MT,并评估机器翻译和大型语言模型在零样本、少样本和微调设置下的性能。
专业知识提升AI使用:比较普通人和专业艺术家的实验证据
机构 * Center for Humans and Machines, Max Planck Institute for Human Development(人类与机器中心,马克斯·普朗克人类发展研究所) ; Tallinn University(塔林大学) ; Estonian Business School(爱沙尼亚商学院) ; Academy of Media Arts Cologne(科隆媒体艺术学院)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 通过实验比较50位专业艺术家和普通人使用生成式AI进行图像复制和创意生成的表现,发现艺术家的专业技能迁移到AI使用中,在复制准确性和发散思维上均优于普通人,而GPT-4o在创意任务上平均略优于艺术家但未超越最佳人类。
Comments Eisenmann and Karjus contributed equally to this work and share first authorship
Journal ref International Journal of Human-Computer Interaction, 2026, pp 1-22
临床试验中AI与人机交互的趋势——一种混合人机探索
机构 * Keele University, UK(英国凯利大学) ; Manchester Metropolitan University, UK(英国曼彻斯特 Metropolitan 大学)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究通过分析ClinicalTrials.gov注册库中的记录,揭示了AI相关临床试验的时间趋势和地理分布,并探索了一种混合人机方法用于分析注册试验中的人机交互趋势。
Comments 8 pages plus 2 pages references and appendix
ClinicBot:基于指南的临床聊天机器人,具有优先证据RAG和可验证引用
机构 * USC Information Sciences Institute(USC信息科学研究所)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出ClinicBot系统,通过结构化提取指南、按临床重要性排序证据和多智能体协作,生成准确、可验证的临床回答。
BioRefusalAudit: 使用通用和领域微调稀疏自编码器审计生物安全拒绝深度
机构 * Independent researcher(独立研究者) ; Apart Research AIxBio Sprint
专题命中 领域大模型 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出BioRefusalAudit方法,通过行为测试和内部稀疏自编码器特征分析,评估语言模型在生物安全场景下的拒绝一致性,发现模型存在结构脆弱性、过度拒绝和架构差异。
Comments 21 pages, 2 figures, 3 tables. Apart Research AIxBio Sprint hackathon paper, April 2026 (Track 3: AI Biosecurity Tools). Code, eval set, and SAEs: github.com/SolshineCode/Deleeuw-AI-x-Bio-hackathon. Reviewer feedback: apartresearch.com/project/biorefusalaudit-auditing-biosecurity-refusal-depth-using-general-and-domainfinetuned-sparse-autoencoders-1fyk
在联邦域泛化下通过因果启发的干预减轻听诊器引起的呼吸音分类中的捷径
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; RSC LAB(RSC实验室) ; Wonkwang University(Wonkwang大学)
专题命中 领域大模型 :pretraining(abstract);分类 cs.AI
AI总结 针对呼吸音分类中听诊器设备差异导致的域偏移问题,提出一种因果启发的多模态联邦域泛化框架,通过内容保持的风格扰动、反事实文本增强和梯度对齐实现设备不变表示,在ICBHI和SPRSound数据集上优于传统方法。
Comments 2 figures, 4 tables, and 5 pages
压缩知识图谱假说:哪些图事实对科学假设生成至关重要?
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) ; Oak Ridge National Laboratory(橡树岭国家实验室) ; Lawrence Berkeley National Laboratory(伯克利国家实验室) ; UniverseTBD(宇宙TBD)
专题命中 领域大模型 :language model(abstract);分类 cs.AI
AI总结 研究通过扰动局部知识图谱(密度、本体丰富度、拓扑和控制结构),评估不同语言模型在电池材料假设生成中知识图谱的效用,提出冗余感知的压缩知识图谱假说:有用信号可从紧凑子图恢复。
异质双曲流形上的树间模态对齐
机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) ; Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) ; Department of Electrical and Computer System Engineering, Monash University(电子与计算机系统工程系,墨尔本大学)
专题命中 领域大模型 :language model(abstract);分类 cs.LG
AI总结 提出一种在异质双曲流形上对齐图像和文本树状层次特征的方法,通过交叉注意力提取视觉层次特征、异质流形嵌入及KL距离度量学习中间流形,在开放集分类任务中优于基线。
Comments Published as a conference paper at ICLR 2026
Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026), Rio de Janeiro, Brazil, 2026
通过打破尾部对齐改进CLIP适应:用于源无关跨域小样本学习
机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, Wuhan, China(华中科技大学计算机科学与技术学院) ; Institute of Artificial Intelligence, Huazhong University of Science and Technology, Wuhan, China(华中科技大学人工智能研究院)
专题命中 领域大模型 :language model(abstract)
AI总结 针对CLIP在跨域小样本学习中的性能下降问题,提出自适应尾头对齐策略(ATHA),通过有选择地削弱低相似度图像令牌的对齐来减少过拟合,在四个基准上取得最优结果。
Comments Accepted by ICML 2026
利用源域监督和无标签目标数据的鲁棒跨域泛化
机构 * Department of Radiology and Diagnostic Imaging, University of Alberta(放射学与诊断影像学系,阿尔伯塔大学)
专题命中 领域大模型 :pretraining(abstract)
AI总结 针对医学影像AI模型跨设备泛化问题,提出结合目标域无监督预训练(掩码图像建模与对比学习)和源域监督训练的策略,在儿科腕部超声骨折检测中实现超过6%的Dice提升。
教会语言模型使用人类应试策略检查基于事实的声明真实性
机构 * Intelligent Systems Laboratory(智能系统实验室) ; University of Bristol(布里斯托大学)
专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract)
AI总结 将基于事实的声明真实性检查建模为真假阅读理解任务,通过提示语言模型使用明确的应试策略进行高效推理,并训练小语言模型以降低推理成本。
Comments ACL 2026 Main
投影式解码:迈向语义感知的LLM生成
机构 * University of Ottawa(渥太华大学) ; University of Murcia(穆尔西亚大学) ; University of Toronto(多伦多大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出投影式解码框架,通过维护部分图模型作为主要工件表示,实现增量语义验证和错误检测,以提升LLM生成工件的语义有效性。
Comments 5 pages, 3 figures. Accepted at FSE 2026 IVR track
去中心化LLM驱动的声学机器人协调用于非接触式物体操控
机构 * Department of Computer Science, University College London(计算机科学系,伦敦大学学院) ; Department of Artificial Intelligence, University of Malaya(人工智能系,马来大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一种去中心化框架,利用Whisper语音识别和LLM语义解析将自然语言指令转换为多机器人任务计划,实现声学机器人的非接触式物体操控,实验验证了顺序、并行和同步协作任务的有效性。
Comments This paper has been accepted for publication in the Proceedings of the 2026 IEEE 22nd International Conference on Automation Science and Engineering (CASE 2026), August 17-21, 2026, Shenyang, China
剖析黑箱:LLM 漏洞检测的电路级分析
机构 * Lund University(隆德大学)
专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 通过机械可解释性分析 Gemma-2-2b 模型在 C/C++ 漏洞检测中的内部计算,发现模型主要依赖安全检测器(识别安全编码模式的注意力头)而非直接检测漏洞特征,并识别出关键神经组件(早期层注意力头和 MLP 神经元),通过消融实验验证其因果作用。
Comments 11 pages, 6 figures. Supported by the Wallenberg AI, Autonomous Systems and Software Program (WASP)