arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-08-20 至 2026-08-20 共收录 6
2608.19115 2026-08-20 cs.LG cs.MM 新提交

Pretraining Reusable Inference Across Views with Synthetic Task Priors

利用合成任务先验预训练跨视图的可复用推理

Jielong Lu, Zhihao Wu, Jiajun Yu, Zhaoliang Chen, Haishuai Wang

机构 * Hong Kong Baptist University(香港浸会大学) Zhejiang University(浙江大学)

AI总结 本文提出SIMPLE模型,将多视图推理预训练为可复用过程,在多视图与多组学基准上,其冻结变体具竞争力,轻量级适配器校准性能领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18937 2026-08-20 cs.CL cs.AI 新提交

MedUAG: Unified Understanding and Generation for Medical Multimodal Models

MedUAG:面向医学多模态模型的统一理解与生成框架

Zijie Meng, Yuncheng Zhang, Hualiang Wang, Yitian Tang, Xiaotang Gai, Chen Shen, Songtao Jiang, Shaosheng Cao, Jian Wu, Xian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Tencent Jarvis Lab(腾讯Jarvis实验室)

AI总结 针对医学多模态领域缺乏统一理解生成框架的问题,本文构建了MedUAGCorpus数据集与MedUAGBench基准,开发了MedUAG模型,其在医学理解与生成任务中表现出色,为下一代医学多模态系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18878 2026-08-20 cs.AI cs.MA 新提交

DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning

DentAgent:以证据为中心的多智能体协调的多模态牙科推理框架

Zijie Meng, Xiwei Dai, Yixuan Tang, Jin Hao, Yang Feng, Fudong Zhu, Xiaoqiang Liu, Shaosheng Cao, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Angelalign Technology Inc.(时代天使科技有限公司) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 针对现有牙科AI系统模态或任务局限及证据不可追溯问题,提出以证据为中心的多智能体框架DentAgent,经四个基准测试,其多标签诊断性能超越资深专家17.3个百分点,可用于多模态牙科推理及人群口腔健康评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18701 2026-08-20 cs.RO 新提交

SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation

SoftVTBench:面向可变形物体操作的形变感知视觉-触觉数据集与基准

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) Tsinghua University(清华大学) Southeast University(东南大学) Stevens Institute of Technology(斯蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI Imperial College London(帝国理工学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 本研究推出SoftVTBench视觉-触觉数据集与基准,定义形变感知成功率(DSR),发现触觉信息本身未必提升多模态融合,为可变形物体操作的物理交互研究提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18500 2026-08-20 cs.LG 新提交

Tianmu-TC: Physics-constraints Generative Artificial Intelligence for Global Tropical Cyclone Forecasting

天目-TC:用于全球热带气旋预报的物理约束生成式人工智能

Shiqi Zhang, Pan Mu, Cheng Huang, Hanting Yan, Yuchao Zhu, Jinglin Zhang, Shengyong Chen, Shoujuan Shu, Cong Bai

机构 * College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) School of Control Science and Engineering, Shandong University(山东大学控制科学与工程学院)

AI总结 研究针对热带气旋预报的不确定性与高成本问题,提出物理约束生成式框架Tianmu-TC,该模型在全球各洋盆的预报性能优于权威系统,且在复杂场景下表现良好,计算成本显著更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18132 2026-08-20 cs.CL cs.SD eess.AS 新提交

Alignment Is All You Need: Instruction-Free Training for General Audio-Language Models

对齐即全部所需:通用音频-语言模型的无指令训练

Xuanru Zhou, Yiwen Shao, Jiahong Li, Dong Yu

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元)

AI总结 该研究提出仅对齐的无指令大音频-语言模型LALM,仅训练轻量投影器,在多模态数据集上用更少数据达到或优于基线,证明仅靠对齐即可构建有竞争力的多模态大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏