Pretraining Reusable Inference Across Views with Synthetic Task Priors
利用合成任务先验预训练跨视图的可复用推理
机构 * Hong Kong Baptist University(香港浸会大学) ; Zhejiang University(浙江大学)
AI总结 本文提出SIMPLE模型,将多视图推理预训练为可复用过程,在多视图与多组学基准上,其冻结变体具竞争力,轻量级适配器校准性能领先。
高校专区
利用合成任务先验预训练跨视图的可复用推理
机构 * Hong Kong Baptist University(香港浸会大学) ; Zhejiang University(浙江大学)
AI总结 本文提出SIMPLE模型,将多视图推理预训练为可复用过程,在多视图与多组学基准上,其冻结变体具竞争力,轻量级适配器校准性能领先。
MedUAG:面向医学多模态模型的统一理解与生成框架
机构 * Zhejiang University(浙江大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Tsinghua University(清华大学) ; Tencent Jarvis Lab(腾讯Jarvis实验室)
AI总结 针对医学多模态领域缺乏统一理解生成框架的问题,本文构建了MedUAGCorpus数据集与MedUAGBench基准,开发了MedUAG模型,其在医学理解与生成任务中表现出色,为下一代医学多模态系统奠定基础。
DentAgent:以证据为中心的多智能体协调的多模态牙科推理框架
机构 * Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; Angelalign Technology Inc.(时代天使科技有限公司) ; Peking University(北京大学) ; Tsinghua University(清华大学)
AI总结 针对现有牙科AI系统模态或任务局限及证据不可追溯问题,提出以证据为中心的多智能体框架DentAgent,经四个基准测试,其多标签诊断性能超越资深专家17.3个百分点,可用于多模态牙科推理及人群口腔健康评估。
SoftVTBench:面向可变形物体操作的形变感知视觉-触觉数据集与基准
机构 * Tuojing Intelligence(拓境智能) ; Tsinghua University(清华大学) ; Southeast University(东南大学) ; Stevens Institute of Technology(斯蒂文斯理工学院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Manchester(曼彻斯特大学) ; Simple AI ; Imperial College London(帝国理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; The University of Hong Kong(香港大学)
AI总结 本研究推出SoftVTBench视觉-触觉数据集与基准,定义形变感知成功率(DSR),发现触觉信息本身未必提升多模态融合,为可变形物体操作的物理交互研究提供资源。
天目-TC:用于全球热带气旋预报的物理约束生成式人工智能
机构 * College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) ; School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) ; School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) ; School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)
AI总结 研究针对热带气旋预报的不确定性与高成本问题,提出物理约束生成式框架Tianmu-TC,该模型在全球各洋盆的预报性能优于权威系统,且在复杂场景下表现良好,计算成本显著更低。
对齐即全部所需:通用音频-语言模型的无指令训练
机构 * Zhejiang University(浙江大学) ; Tencent Hunyuan(腾讯混元)
AI总结 该研究提出仅对齐的无指令大音频-语言模型LALM,仅训练轻量投影器,在多模态数据集上用更少数据达到或优于基线,证明仅靠对齐即可构建有竞争力的多模态大语言模型。