ALARM: Audio-Language Alignment for Reasoning Models
ALARM:用于推理模型的音频-语言对齐
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 ALARM通过自我改写和多编码器融合,提升推理模型的音频理解能力,实现更高效的音频推理性能。
Comments Submitted to Interspeech2026
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
ALARM:用于推理模型的音频-语言对齐
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL
AI总结 ALARM通过自我改写和多编码器融合,提升推理模型的音频理解能力,实现更高效的音频推理性能。
Comments Submitted to Interspeech2026
逐步奖励:面向连续环境的视觉语言导航中的步骤感知对比对齐
机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)
专题命中 其他安全 :alignment(title,abstract)
AI总结 本文提出SACA框架,通过步骤感知对比对齐提升连续环境中视觉语言导航的性能,解决传统方法在错误恢复和训练稳定性方面的不足。
Comments 28 pages, 10 figures
通过参数和数据高效适应实现草稿模型的高效对齐
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ; Shanghai Innovation Institute(上海创新研究院) ; Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI)) ; University of Science and Technology of China (USTC)(中国科学技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出高效草稿适应框架EDA,通过解耦架构、数据再生策略和样本选择机制,实现草稿模型在特定领域微调时的高效适应,降低训练成本并提升推测解码性能。
Comments 10 pages
从空间到动作:在空间先验基础上构建视觉-语言-动作模型
机构 * ByteDance Seed(字节跳动种子) ; NUS(新加坡国立大学) ; NTU(国立技术大学) ; THU(清华大学) ; SMU(南方大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。
Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/
GateLens: 一种增强推理能力的LLM代理用于汽车软件发布分析
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI
AI总结 GateLens是一种基于LLM的代理,通过引入关系代数作为中间表示,提升复杂表格数据分析的效率与准确性,适用于汽车软件发布分析领域。
人工智能现象学:理解跨时代的以人为本的AI体验
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Bergen(卑尔根大学) ; Stanford University(斯坦福大学)
专题命中 其他安全 :alignment(abstract,comments);分类 cs.AI
AI总结 本文提出人工智能现象学,通过研究用户与AI交互的主观体验,促进双向人机对齐,并提供可重复的方法论工具。
Comments This is an accepted workshop paper at CHI '26, "W37: Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures", or https://bialign-workshop.github.io/2026/cfp
在AI-RAN赋能的多接入边缘计算系统中的一种多原型引导的联邦知识蒸馏方法
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文提出了一种多原型引导的联邦知识蒸馏方法,用于解决AI-RAN赋能的多接入边缘计算系统中非独立和相同分布数据的问题,通过引入自我知识蒸馏和多原型策略提升模型性能。
Comments 15 pages, 6 figures
Turn:一种用于代理计算的语言
机构 * Turn Lang(Turn语言) ; Prescott Data(Prescott数据)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 Turn是一种用于代理计算的编译型语言,通过类型安全、能力身份系统和编译时模式吸收等机制,实现对大型语言模型推断的可靠控制和安全管理。
VLCE:一种用于灾害评估图像描述的知识增强框架
机构 * Clark Atlanta University(克拉克亚特兰大大学) ; BRAC University(布拉克大学) ; United International University(国际联合大学) ; Daffodil International University(花王国际大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 VLCE通过整合知识图谱提升灾害影像描述的准确性和领域相关性,其在RescueNet上优于QwenVL基线。
Comments 28 pages, 30 figures, 1 algorithms
速度的官僚主义:内存一致性模型与多智能体授权撤销之间的结构等价性
专题命中 其他安全 :safety(abstract)
AI总结 本文提出能力一致性系统,通过有限新鲜度语义构建状态映射,实现高并发下授权撤销的安全性保障,显著降低未经授权操作数量。
Comments 18 pages, 3 figures. Simulation code at https://github.com/hipvlady/prizm
具有 compartmentalization 意识的自动化程序修复
专题命中 其他安全 :safety(abstract)
AI总结 本文提出了一种专门针对 compartment 接口安全的 APR 框架,通过整合 fuzzer、补丁生成和验证组件,自动化修复 cross-compartment 接口漏洞。
Comments Accepted to appear in ICSE's Journal Ahead Workshop (JAWs) 2026
动态多模态表达生成用于基于大语言模型的教育代理:从用户体验视角
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出基于大语言模型的动态多模态表达生成方法,通过生成协调的语音和手势指令,提升教育代理的沉浸感和自然表达能力。
TopoOR: 一种用于手术室的统一拓扑场景表示
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Imperial College London(伦敦帝国理工学院) ; Kyung Hee University(韩国庆熙大学)
专题命中 其他安全 :safety(abstract)
AI总结 TopoOR通过更高阶拓扑结构建模手术室的多模态特性,提升场景表达能力,优于传统图和LLM基线。
基于类可视化和激活图谱的深度学习计算病理学解释性增强
专题命中 其他安全 :alignment(abstract)
AI总结 本研究提出基于类可视化和激活图谱的深度学习计算病理学解释性增强方法,通过评估不同标签粒度下的模型表现,揭示了变压器模型中的结构化形态流形。
MGCR-Net:多模态图条件视觉-语言重建网络用于遥感变化检测
机构 * School of Computer Science and Technology, Shandong Technology and Business University(山东科技职业大学计算机科学与技术学院) ; School of Computer Science and Technology, Qingdao University(青岛大学计算机科学与技术学院) ; School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院)
专题命中 其他安全 :alignment(abstract)
AI总结 MGCR-Net通过多模态图条件视觉-语言重建机制提升遥感变化检测的语义交互能力。
Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 1-15, 2026, Art no. 4701515
基于大型语言模型的需求生成类模型
专题命中 其他安全 :alignment(abstract)
AI总结 本文研究了大型语言模型在自动从自然语言需求生成UML类图方面的有效性,通过双验证框架评估模型生成的准确性和一致性。
Comments Accepted by The Eighth Workshop on Modeling and Simulation of Software-Intensive Systems (MSSiS 2026), ICSE 2026