arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The University of Hong Kong(香港大学)

共收录 1522
2512.04519 2025-12-05 cs.CV

VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory

VideoSSM:基于混合状态-空间记忆的自回归长视频生成

Yifei Yu, Xiaoshan Wu, Xinting Hu, Tao Hu, Yangtian Sun, Xiaoyang Lyu, Bo Wang, Lin Ma, Yuewen Ma, Zhongrui Wang, Xiaojuan Qi

机构 * HKU(香港大学) PICO, ByteDance(字节跳动PICO) SUSTech(南方科技大学)

AI总结 VideoSSM通过结合自回归扩散与混合状态空间记忆,实现了具有全局一致性和运动稳定性的长视频生成,支持提示自适应交互并提升内容多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04204 2025-12-05 astro-ph.IM astro-ph.HE cs.AI

Machine Phenomenology: A Simple Equation Classifying Fast Radio Bursts

机器现象学:一个简单方程分类快速射电暴

Yang Liu, Yuhao Lu, Rahim Moradi, Bo Yang, Bing Zhang, Wenbin Lin, Yu Wang

机构 * School of Computer Science, University of South China(南华大学计算机科学学院) Department of Physics E. Pancini, University Federico II(费米研究所物理系) Key Laboratory of Particle Astrophysics, Institute of High Energy Physics, Chinese Academy of Sciences(中国科学院高能物理研究所粒子天体物理重点实验室) School of Mathematics and Physics, University of South China(南华大学数学物理学院) The Hong kong Institute for Astronomy and Astrophysics, University of Hong Kong(香港大学天文与天体物理研究所) Department of Physics, University of Hong Kong(香港大学物理系) Nevada Center for Astrophysics, University of Nevada(内华达大学天文中心) School of Physical Science and Technology, Southwest Jiaotong University(西南交通大学物理科学与技术学院)

AI总结 本文提出一个简单方程通过符号回归分类快速射电暴,结合人类物理推理与机器学习发现经验定律。

Comments 19 pages, 9 figures, 3 tables. Submitted to SCIENCE CHINA Physics, Mechanics & Astronomy

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23075 2025-12-05 cs.CV cs.AI

SpaceMind: Camera-Guided Modality Fusion for Spatial Reasoning in Vision-Language Models

SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理

Ruosen Zhao, Zhikang Zhang, Jialei Xu, Jiahao Chang, Dong Chen, Lingyun Li, Weijian Sun, Zizhuang Wei

机构 * Huawei(华为) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学)

AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07768 2025-12-04 cs.CV

Test-time Correction: An Online 3D Detection System via Visual Prompting

测试时校正:通过视觉提示的在线3D检测系统

Hanxue Zhang, Zetong Yang, Yanan Sun, Li Chen, Fei Xia, Fatma Güney, Hongyang Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) GAC R&D Center(GAC研发中心) The University of Hong Kong(香港大学) Google(谷歌) Koç University(科克大学)

AI总结 本文提出一种通过视觉提示实现在线3D检测的测试时校正系统,旨在提升自动驾驶系统在部署后的实时纠错能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14430 2025-12-04 cs.CV cs.AI cs.PF

PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference

PipeFusion: 基于扩散变换器推理的片级流水线并行

Jiarui Fang, Jinzhe Pan, Aoyu Li, Xibo Sun, Jiannan Wang

机构 * ByteDance(字节跳动) HUST(华中科技大学) Tencent(腾讯) The University of Hong Kong(香港大学)

AI总结 PipeFusion通过片级流水线并行方法,提高扩散变换器推理的效率和性能,适用于大模型如Flux.1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03004 2025-12-03 cs.CV

DGGT: Feedforward 4D Reconstruction of Dynamic Driving Scenes using Unposed Images

DGGT:利用未定位图像实现动态驾驶场景的前馈4D重建

Xiaoxue Chen, Ziyi Xiong, Yuantao Chen, Gen Li, Nan Wang, Hongcheng Luo, Long Chen, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Hongyang Li, Ya-Qin Zhang, Hao Zhao

机构 * AIR, Tsinghua University(清华人工智能研究院) Xiaomi EV(小米电动车) The University of Hong Kong(香港大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 DGGT通过前馈方法实现无姿态动态驾驶场景的4D重建,结合3D高斯地图和轻量级动态头,提升重建速度与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02993 2025-12-03 cs.CV

TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond

TEXTRIX:用于原生纹理生成及更广泛领域的潜在属性网格

Yifei Zeng, Yajie Bao, Jiachen Qian, Shuang Wu, Youtian Lin, Hao Zhu, Buyu Li, Feihu Zhang, Xun Cao, Yao Yao

机构 * Nanjing University(南京大学) DreamTech HKU(香港大学) OriginArk

AI总结 TEXTRIX通过构建潜在3D属性网格和稀疏注意力扩散变换器,实现高保真纹理合成及精确3D分割。

Comments Project Page: https://www.neural4d.com/research-page/textrix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02931 2025-12-03 cs.CV

DiverseAR: Boosting Diversity in Bitwise Autoregressive Image Generation

DiverseAR: 提升位级自回归图像生成中的多样性

Ying Yang, Zhengyao Lv, Tianlin Pan, Haofan Wang, Binxin Yang, Hubery Yin, Chen Li, Chenyang Si

机构 * PRLab, Nanjing University(南京大学PRLab) The University of Hong Kong(香港大学) University of Chinese Academy of Sciences(中国科学院大学) Lovart AI WeChat, Tencent Inc.(腾讯公司)

AI总结 DiverseAR通过自适应logits分布缩放和能量基生成路径搜索算法,提升位级自回归图像生成的样本多样性,同时保持视觉质量。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02729 2025-12-03 cs.RO

RoboWheel: A Data Engine from Real-World Human Demonstrations for Cross-Embodiment Robotic Learning

RoboWheel: 从现实世界人类示范数据中提取的机器人学习跨形态数据引擎

Yuhong Zhang, Zihan Gao, Shengpeng Li, Ling-Hao Chen, Kaisheng Liu, Runqing Cheng, Xiao Lin, Junjia Liu, Zhuoheng Li, Jingyi Feng, Ziyan He, Jintian Lin, Zheyan Huang, Zhifang Liu, Haoqian Wang

机构 * Tsinghua University(清华大学) Synapath CUHK(香港中文大学) HKU(香港大学) PolyU

AI总结 RoboWheel通过高精度HOI重建和强化学习优化,将现实世界人类示范转化为跨形态机器人学习的有效数据,提供轻量级、通用的运动表示,提升机器人学习性能。

Comments 27 Pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02044 2025-12-03 cs.CL

Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models

超越置信度:用于扩散语言模型的自适应与一致解码

Kecheng Chen, Ziru Liu, Xijia Tao, Hui Liu, Xinyu Fu, Suiyun Zhang, Dandan Tu, Lingpeng Kong, Rui Liu, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究) The University of Hong Kong(香港大学)

AI总结 本文提出Coherent Contextual Decoding方法,通过自适应解码策略提升扩散语言模型的生成质量和采样效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01979 2025-12-02 cs.AI cs.CL cs.CV

Chain-of-Ground: Improving GUI Grounding via Iterative Reasoning and Reference Feedback

Chain-of-Ground: 通过迭代推理和参考反馈提升GUI定位

Aiden Yiliu Li, Bizhi Yu, Daoan Lei, Tianhe Ren, Shilong Liu

机构 * University College London(伦敦大学学院) Chico Future AI Lab(芝加哥未来人工智能实验室) The University of Hong Kong(香港大学) Princeton University(普林斯顿大学)

AI总结 Chain-of-Ground通过迭代推理和参考反馈提升GUI定位,实现68.4的准确率,并在现实世界界面中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21309 2025-12-02 cs.CV

CaliTex: Geometry-Calibrated Attention for View-Coherent 3D Texture Generation

CaliTex: 用于视图一致3D纹理生成的几何校准注意力

Chenyu Liu, Hongze Chen, Jingzhi Bao, Lingting Zhu, Runze Zhang, Weikai Chen, Zeyu Hu, Yingda Yin, Keyang Luo, Xin Wang

机构 * PKU(北京大学) HKUST(香港科技大学) CUHK(SZ)(香港中文大学(深圳)) HKU(香港大学) LIGHTSPEED

AI总结 CaliTex通过几何校准注意力机制,解决3D纹理生成中的跨视图不一致问题,提升纹理的视图一致性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06309 2025-12-02 cs.AI cs.MA

The Station: An Open-World Environment for AI-Driven Discovery

The Station:一个面向AI驱动发现的开放世界环境

Stephen Chung, Wenyu Du

机构 * DualverseAI University of Cambridge(剑桥大学) University of Hong Kong(香港大学)

AI总结 STATION是一个开放世界多智能体环境,通过自主科学发现的涌现行为实现AI驱动的科学突破。

Comments 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07663 2025-12-02 cs.AI cs.CL cs.CY cs.HC

Human Decision-making is Susceptible to AI-driven Manipulation

人类决策易受AI驱动的操控

Sahand Sabour, June M. Liu, Siyang Liu, Chris Z. Yao, Shiyao Cui, Xuanming Zhang, Wen Zhang, Yaru Cao, Advait Bhat, Jian Guan, Wei Wu, Rada Mihalcea, Hongning Wang, Tim Althoff, Tatia M. C. Lee, Minlie Huang

机构 * The CoAI Group, DCST, Institute for Artificial Intelligence, Tsinghua University, Beijing, China(CoAI小组、DCST、人工智能研究所、清华大学、北京中国) State Key Laboratory of Brain and Cognitive Sciences, The University of Hong Kong, Hong Kong SAR, China(脑与认知科学国家重点实验室、香港大学、香港特别行政区中国) The LIT Group, Department of Computer Science and Engineering, University of Michigan, Ann Arbor(LIT小组、计算机科学与工程系、密歇根大学、安阿伯) Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, WA, USA(保罗·G·阿伦计算机科学与工程学院、华盛顿大学、西雅图华盛顿州美国) ANT Group(ANT集团)

AI总结 研究发现人类在金融和情感决策中易受AI操控,操控代理显著提高了用户对隐藏激励的评分,表明需加强伦理监管以保护自主权。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20561 2025-12-02 cs.CV cs.CL

Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward

在统一多模态模型中,理解是否会影响生成?从分析到未来路径

Yuwei Niu, Weiyang Jin, Jiaqi Liao, Chaoran Feng, Peng Jin, Bin Lin, Zongjian Li, Bin Zhu, Weihao Yu, Li Yuan

机构 * Peking University(北京大学) Chongqing University(重庆大学) HKU MMLab(香港大学多模态实验室) PengCheng Laboratory(鹏城实验室)

AI总结 研究通过UniSandbox分析统一多模态模型中理解与生成之间的差距,发现显式链式思维和自训练方法能有效弥合这一差距,并揭示查询架构的潜在CoT特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17442 2025-12-02 cs.CL cs.AI

Confident RAG: Enhancing the Performance of LLMs for Mathematics Question Answering through Multi-Embedding and Confidence Scoring

Confident RAG: 通过多嵌入和置信度评分提升LLM在数学问题回答中的性能

Shiting Chen, Zijian Zhao, Jinsong Chen

机构 * Faculty of Education, The University of Hong Kong(香港大学教育学院) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学土木与环境工程系)

AI总结 Confident RAG通过多嵌入和置信度评分提升LLM在数学问题回答中的性能,实验表明其在准确率上比普通LLMs和RAG分别提升10%和5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08594 2025-12-02 cs.CV cs.LG

PointNSP: Autoregressive 3D Point Cloud Generation with Next-Scale Level-of-Detail Prediction

PointNSP: 通过下一尺度细节预测实现自回归3D点云生成

Ziqiao Meng, Qichao Wang, Zhiyang Dou, Zixing Song, Zhipeng Zhou, Irwin King, Peilin Zhao

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) University of Cambridge(剑桥大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 PointNSP通过下一尺度细节预测实现自回归3D点云生成,首次在自回归范式中达到最先进的生成质量,并在参数、训练和推理效率上超越扩散基线。

Comments 24 pages; Previously this version appeared as arXiv:2510.05613 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06588 2025-12-02 cs.SD cs.CV

Speech Audio Generation from dynamic MRI via a Knowledge Enhanced Conditional Variational Autoencoder

通过动态MRI生成语音音频的增强知识条件变分自编码器

Yaxuan Li, Han Jiang, Yifei Ma, Shihua Qin, Jonghye Woo, Fangxu Xing

机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) Wake Forest University School of Medicine(威克森林大学医学学院) Department of Radiology, Harvard Medical School(哈佛医学院放射科)

AI总结 本文提出KE-CVAE方法,通过动态MRI生成语音音频,解决MRI数据损坏和噪声问题,提升语音合成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00085 2025-12-02 cs.RO cs.AI

Hyper-GoalNet: Goal-Conditioned Manipulation Policy Learning with HyperNetworks

Hyper-GoalNet: 基于超网络的目标条件化操纵策略学习

Pei Zhou, Wanting Yao, Qian Luo, Xunzhe Zhou, Yanchao Yang

机构 * InfoBodied AI Lab, The University of Hong Kong(信息身体AI实验室,香港大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 Hyper-GoalNet通过超网络生成任务特定策略参数,提升机器人操纵在多样化目标和环境下的鲁棒性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16177 2025-12-02 cs.GR cs.CV

OccluGaussian: Occlusion-Aware Gaussian Splatting for Large Scene Reconstruction and Rendering

OccluGaussian:面向大场景重建与渲染的遮挡感知高斯点云技术

Shiyong Liu, Xiao Tang, Zhihao Li, Yingfan He, Chongjie Ye, Jianzhuang Liu, Binxiao Huang, Shunbo Zhou, Xiaofei Wu

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) The University of Hong Kong(香港大学) Huawei Embodied Intelligence Lab(华为具身智能实验室)

AI总结 OccluGaussian通过遮挡感知的场景划分和区域渲染技术,提升大规模场景重建与渲染的质量和效率。

Comments Accepted to ICCV 2025. Project website: https://occlugaussian.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10125 2025-12-02 cs.CV cs.MM

Proxy-Tuning: Tailoring Multimodal Autoregressive Models for Subject-Driven Image Generation

代理调优:为以主题驱动的图像生成定制多模态自回归模型

Yi Wu, Shengju Qian, Lingting Zhu, Lei Liu, Wandi Qiao, Ziqiang Li, Lequan Yu, Bin Li

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Nanjing University of Information Science and Technology(南京信息工程大学)

AI总结 本文提出代理调优方法,通过扩散模型增强AR模型在主题驱动图像生成中的能力,揭示了弱到强泛化现象,提升了多主题组合和上下文理解的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03492 2025-12-02 cs.LG cs.AI cs.CL

Teaching Language Models to Critique via Reinforcement Learning

通过强化学习教学语言模型进行批评

Zhihui Xie, Jie Chen, Liyu Chen, Weichao Mao, Jingjing Xu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

AI总结 本文提出CTRL框架,通过强化学习训练批评模型以提升代码生成的准确性和性能,实现迭代改进和误差缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23239 2025-12-01 cs.LG stat.ML

Towards Understanding Transformers in Learning Random Walks

向理解变换器在学习随机游走中的能力

Wei Shi, Yuan Cao

机构 * School of Computing & Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

AI总结 本文研究了变换器在学习随机游走中的能力和可解释性,证明单层变换器在预测随机游走时能达到最优准确性,并揭示了其可解释性机制。

Comments 45 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23031 2025-12-01 cs.CV cs.AI

From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning

从幻觉到意图:用于视觉-语言推理的视觉理由学习

Changpeng Wang, Haozhe Wang, Xi Chen, Junhan Liu, Taofeng Xue, Chong Peng, Donglian Qi, Fangzhen Lin, Yunfeng Yan

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Meituan(美团)

AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22911 2025-12-01 eess.IV cs.AI cs.CV

MICCAI STS 2024 Challenge: Semi-Supervised Instance-Level Tooth Segmentation in Panoramic X-ray and CBCT Images

MICCAI STS 2024挑战:在全景X光和CBCT图像中实现半监督实例级牙齿分割

Yaqi Wang, Zhi Li, Chengyu Wu, Jun Liu, Yifan Zhang, Jiaxue Ni, Qian Luo, Jialuo Chen, Hongyuan Zhang, Jin Liu, Can Han, Kaiwen Fu, Changkai Ji, Xinxu Cai, Jing Hao, Zhihao Zheng, Shi Xu, Junqiang Chen, Qianni Zhang, Dahong Qian, Shuai Wang, Huiyu Zhou

机构 * Innovation Center for Electronic Design Automation Technology(电子设计自动化技术创新中心) School of Cyberspace(网络空间学院) Hangzhou Dianzi University(杭州电子科技大学) Hangzhou Geriatric Stomatology Hospital(杭州老年牙科医院) Shenzhen University(深圳大学) Queen Mary University of London(伦敦大学Queen Mary分校) Shandong University(山东大学) Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学) Chinese Academy of Sciences(中国科学院) Yunnan Provincial Stomatology Hospital(云南省牙科医院) Shanghai MediWorks Precision Instruments Co., Ltd(上海 MediWorks 精密仪器有限公司) University of Leicester(莱斯特大学)

AI总结 MICCAI STS 2024挑战通过半监督学习方法在全景X光和CBCT图像中实现实例级牙齿分割,展示了SSL在数据稀缺情况下的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22664 2025-12-01 cs.CV

VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models

VaMP:用于视觉-语言模型的变分多模态提示学习

Silin Cheng, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

AI总结 VaMP提出了一种变分多模态提示学习框架,通过实例条件提示和不确定性建模提升视觉-语言模型在少样本和领域泛化任务中的性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22609 2025-12-01 cs.CV cs.RO

MG-Nav: Dual-Scale Visual Navigation via Sparse Spatial Memory

MG-Nav:基于稀疏空间记忆的双尺度视觉导航

Bo Wang, Jiehong Lin, Chenzhi Liu, Xinting Hu, Yifei Yu, Tianjia Liu, Zhongrui Wang, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

AI总结 MG-Nav通过稀疏空间记忆图和VGGT-adapter模块实现双尺度视觉导航,结合全局规划与局部控制,实现零样本导航的高鲁棒性与高性能。

Comments 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22429 2025-12-01 cs.CV

Fin3R: Fine-tuning Feed-forward 3D Reconstruction Models via Monocular Knowledge Distillation

Fin3R:通过单目知识蒸馏细调馈送式3D重建模型

Weining Ren, Hongjun Wang, Xiao Tan, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)

AI总结 Fin3R通过单目知识蒸馏细调馈送式3D重建模型,提升几何精度和鲁棒性,仅增加微小权重。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21937 2025-12-01 cs.CV

Interpretable Multimodal Cancer Prototyping with Whole Slide Images and Incompletely Paired Genomics

可解释的多模态癌症原型生成:结合整张滑片图像与不完全配对的基因组学

Yupei Zhang, Yating Huang, Wanming Hu, Lequan Yu, Hujun Yin, Chao Li

机构 * Department of Clinical Neurosciences, University of Cambridge, UK(剑桥大学临床神经科学系) Department of Electrical & Electronic Engineering, The University of Manchester, UK(曼彻斯特大学电气与电子工程系) Department of Pathology, State Key Laboratory of Oncology in South China, Guangdong Provincial Clinical Research Center for Cancer, Sun Yat-sen University Cancer Center, China(南方医科大学肿瘤学国家重点实验室、广东省癌症临床研究中心、中山大学肿瘤中心病理学部) Department of Statistics and Actuarial Science, The University of Hong Kong, Hong Kong SAR, China(香港大学统计与精算科学系) Department of Clinical Neurosciences and Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学临床神经科学系和应用数学与理论物理系;邓迪大学科学与工程学院和医学学院) School of Science and Engineering and School of Medicine, University of Dundee, UK

AI总结 本文提出了一种可解释的多模态原型生成框架,通过整合整张滑片图像和不完整的基因组学数据,提升精准肿瘤学中的多模态整合效果。

详情

展开后加载摘要…

URL PDF HTML 收藏