Back to Basics: Revisiting ASR in the Age of Voice Agents
回归基础:在语音助手时代重新审视ASR
机构 * Boson AI
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 研究指出现有ASR系统在真实场景下表现不佳,提出多语言诊断基准WildASR,揭示模型在环境退化、人口变化和语言多样性下的性能退化问题,并提供分析工具提升可靠性。
Comments 10 pages, 5 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
回归基础:在语音助手时代重新审视ASR
机构 * Boson AI
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 研究指出现有ASR系统在真实场景下表现不佳,提出多语言诊断基准WildASR,揭示模型在环境退化、人口变化和语言多样性下的性能退化问题,并提供分析工具提升可靠性。
Comments 10 pages, 5 figures
双语文本到动作生成:一个新的基准和基线
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) ; Nanjing University of Science and Technology(南京理工大学) ; Singapore Management University(新加坡管理大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出BiHumanML3D双语文本到动作基准及BiMD基线,通过跨语言对齐策略提升多语言动作生成质量,实验显示其在FID和R@3指标上显著优于单语模型和翻译基线。
Comments 11 pages, 7 figures
查看文本:从分词到视觉阅读
机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; College of Information Science and Technology and Artificial Intelligence, Nanjing Forestry University(南京林业大学信息科学技术与人工智能学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出SeeTok方法,通过将文本渲染为图像并利用预训练多模态大模型实现视觉阅读,相比传统子词分词在资源消耗和跨语言泛化方面表现更优。
评估格式而非模型能力驱动消费者健康AI的分诊失败
机构 * Centre for Health Informatics(健康信息学中心) ; Australian Institute of Health Innovation(澳大利亚健康创新研究所) ; Macquarie University(麦考瑞大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 研究通过对比考试式与自然场景下的分诊测试,发现评估格式显著影响分诊准确性,指出消费者健康AI的评估需模拟真实使用场景以获得可靠结果。
Comments 12 pages
RobustVisRAG: 基于因果性的视觉增强检索增强生成方法在视觉退化下的鲁棒性
机构 * National Taiwan University(国立台湾大学) ; Microsoft(微软)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出RobustVisRAG,通过双路径框架分离语义与退化因素,提升在视觉退化下的检索生成性能,实验显示在真实退化条件下性能提升显著。
Comments Accepted by CVPR2026; Project Page: https://robustvisrag.github.io
AuthorityBench: 评估LLM权威感知以实现可靠的检索增强生成
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文提出AuthorityBench基准,通过三个数据集评估LLM权威感知能力,发现ListJudge和PairJudge方法与真实权威最相关,且权威感知对检索增强生成的准确性有显著提升。
Comments 11 pages, 4 figures. Submitted to ACL 2026
连接代码属性图与语言模型用于程序分析
专题命中 安全评测 :safety(abstract)
AI总结 本文提出codebadger,结合Joern的代码属性图引擎与LLM,解决代码分析中的挑战,通过高级工具实现程序切片、污点追踪等,提升大规模代码库的分析能力。
Comments Accepted at Software Vulnerability Management Workshop @ ICSE 2026
IndustriConnect:MCP适配器与先假测试用于AI辅助工业操作
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :safety(abstract)
AI总结 本文提出IndustriConnect,通过MCP适配器将工业操作暴露为可发现的AI工具,支持协议特定连接和安全控制,并通过先假测试和确定性基准验证适配器的正确性、并发行为和结构化错误处理。
LLaVA-LE:用于月球探索的大型语言和视觉助手
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出LLaVA-LE,一个专为月球表面和地下特征分析设计的多模态模型,通过构建大规模月球数据集LLUCID和两阶段训练方法,提升了行星科学领域的视觉语言模型性能。
Comments Accepted in AI4Space Workshop CVPR2026. Website: https://osupcvlab.github.io/LLaVA-LE/, Dataset: https://huggingface.co/datasets/pcvlab/lucid
KitchenTwin: 基于语义和几何的3D厨房数字孪生
机构 * University of Waterloo(滑铁卢大学)
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出一种基于语义和几何的3D厨房数字孪生框架,通过融合视觉引导的对象网格与Transformer预测的全局点云,实现几何一致的数字孪生构建。
理解人机价值对齐的过程
机构 * University of Bath(巴斯大学)
专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 本文通过系统文献综述,探讨人工智能中价值对齐的核心方法与挑战,提出更精确的定义,识别六个关键主题以指导未来研究。
Comments 39 pages, 7 figures
Journal ref JAIR, Vol 85, Article 29 (March 2026)
结构化意图表示是否具有泛化性?一项跨语言、跨模型的5W3H提示经验研究
机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉特尼人工智能科技有限公司) ; Huizhou University(惠州大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 本文通过跨语言和跨模型的实验,探讨结构化意图表示的泛化能力,发现AI辅助写作工具生成的5W3H提示在目标对齐上与手动创建的提示无显著差异,且能减少跨模型输出方差。
Comments 28 pages, figures, tables, and appendix. Follow-up empirical study extending prior work on PPS and 5W3H structured prompting to cross-language, cross-model, and AI-assisted authoring settings
涌现形式验证:自主AI生态系统如何在六个领域独立发现基于SMT的安全性
机构 * Aisophical SRL
专题命中 其他安全 :safety(title,abstract);AI safety(abstract);分类 cs.AI
AI总结 自主AI生态系统在无显式形式方法指令下,独立在六个AI安全领域发现SMT求解器的应用,提出统一框架实现100%准确验证。
Comments 10 pages, 3 figures, 5 tables. Code: https://github.com/octavuntila-prog/substrate-guard. Companion paper: https://doi.org/10.5281/zenodo.19157571
基于知识的故障预测:检测对象检测器何时错过安全关键对象
机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) ; Fraunhofer IOSB(弗劳恩霍夫光电、系统技术及图像处理研究所)
专题命中 其他安全 :safety(title,abstract);分类 cs.LG
AI总结 本文提出KGFP框架,通过检测内部特征与视觉基础模型嵌入之间的语义偏差来识别对象检测器的故障,提升安全关键对象的召回率。
CLAR:基于检索增强的语音大语言模型的上下文语音识别中的CIF局部对齐
机构 * BRVoice Team, Bairong, Inc., China(BRVoice团队,百融云创,中国)
专题命中 其他安全 :alignment(title)
AI总结 CLAR通过CIF学习单调性token级对齐,提升语音识别中专有名词和长尾词的识别效果,减少表示稀释和注意力漂移,提高检索准确率。
Comments Submitted to Interspeech 2026
AutoSAM:一种用于自动化生成SAM代码输入文件的代理框架,结合多模态检索增强生成
机构 * Department of Nuclear Engineering, Texas A\&M University. ; Engineering Division, Argonne National Laboratory
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 AutoSAM通过多模态检索增强生成技术,自动化生成SAM代码输入文件,解决异构工程文档中提取设计数据并转换为求解器语法的难题,实现100%结构化输入利用和88%PDF文本提取。
Comments 34 Pages, 14 Figures
OWLEYE:跨域图数据异常检测的零样本学习者
机构 * Virginia Tech(弗吉尼亚理工大学) ; Meta AI ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 OWLEYE提出一种跨域图数据异常检测框架,通过跨域特征对齐模块、多域多模式字典学习和截断注意力重构模块,实现零样本学习和持续学习能力,提升异常检测性能与泛化能力。
Comments Accepted by ICLR 2026
SMILES-Mamba:用于药物ADMET预测的化学Mamba基础模型
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; Stanford University(斯坦福大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Washington(华盛顿大学) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 SMILES-Mamba通过自监督预训练和微调策略,利用未标记和标记数据预测药物ADMET属性,在22个数据集上表现优异,提升分子属性预测准确性并减少对大规模标注数据的依赖。
Pixelis:在像素中推理,从看见到行动
机构 * University of Reading(雷丁大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 Pixelis通过在像素空间中直接操作图像和视频,结合执行操作和学习后果,提升视觉智能的通用性和物理基础,实现基于行动的多模态感知。
Comments 28pages, 16figures, 18tables
可解释性潜在奖励的自校正图像生成
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Singapore Management University(新加坡管理大学) ; William & Mary(威廉与玛丽学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出xLARD框架,利用多模态大语言模型通过可解释性潜在奖励指导生成,改进语义对齐和视觉保真度,同时保持生成先验。
Comments CVPR 2026
TAG-MoE:基于任务的门控用于统一的生成混合专家
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Tencent Hunyuan(腾讯文言) ; National Cheng-Kung University(国立成功大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文提出TAG-MoE框架,通过引入层次化任务语义标注方案和预测对齐正则化,解决密集扩散变换器架构中任务干扰问题,提升生成质量和保真度。
Comments Accept by CVPR 2026. Project page: https://yuci-gpt.github.io/TAG-MoE/
MiDashengLM:通过通用音频字幕实现高效的音频理解
机构 * MiLM Plus Xiaomi Inc.(小米公司)
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出MiDashengLM,一个基于通用音频字幕的开放音频语言模型,通过ACAVCaps数据集实现高效且全面的音频理解,提升透明度和可重复性,并提供更快的推理速度和更高的吞吐量。
Comments Added ACAVCaps reference (ICASSP 2026)