arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-07-07 至 2026-07-07 共收录 6
2605.31604 2026-07-07 cs.CV 版本更新

Representation Forcing for Bottleneck-Free Unified Multimodal Models

表示强制:无瓶颈统一多模态模型

Yuqing Wang, Zhijie Lin, Ceyuan Yang, Yang Zhao, Fei Xiao, Hao He, Qi Zhao, Zihan Ding, Fuyun Wang, Shuai Wang, Youliang Zhang, Haoqi Fan, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Tsinghua University(清华大学)

AI总结 提出表示强制(RF)技术,通过让解码器自回归预测视觉表示作为中间令牌,再在相同骨干网络中引导像素扩散,从而消除统一多模态模型对预训练VAE的依赖,实现无瓶颈的端到端模型。

Comments Project page: https://yuqingwang1029.github.io/RepresentationForcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06577 2026-07-07 cs.CV 版本更新

Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion

全模态扩散:基于掩码离散扩散的统一多模态理解与生成

Lijiang Li, Zuwei Long, Yunhang Shen, Heting Gao, Haoyu Cao, Xing Sun, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Tencent Youtu Lab(腾讯云科技实验室) CASIA(中国科学院自动化研究所)

AI总结 受离散扩散模型在多领域成功应用启发,提出全模态扩散模型,基于掩码离散扩散模型构建,统一文本、语音和图像的理解与生成,用统一模型直接捕捉离散多模态令牌联合分布,性能优于现有多模态系统。

Comments Accepted to ICML 2026. This version updates the ICML submission with an optimized model checkpoint. Project page: https://omni-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18176 2026-07-07 cs.CV 版本更新

Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation

图谱是理想上下文:用于可泛化基础医学图像分割的一次性定制

Ziyu Zhang, Yi Yu, Simeng Zhu, Ahmed Aly, Yunhe Gao, Ning Gu, Yuan Xue

机构 * Nanjing University(南京大学) The Ohio State University(俄亥俄州立大学) Stanford University(斯坦福大学)

AI总结 研究医学图像中解剖结构分割问题,提出图谱引导框架AtlasSegFM,通过图谱查询配准生成提示,用冻结基础模型细化分割,经自适应融合模块结合图谱先验与模型输入及预测,实现一次性定制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20272 2026-07-07 cs.CV 版本更新

VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs

VKnowU:评估多模态语言模型中的视觉知识理解

Tianxiang Jiang, Sheng Xia, Yicheng Xu, Linquan Wu, Xiangyu Zeng, Limin Wang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学)

AI总结 研究多模态大语言模型视觉知识理解能力,提出VKnowU基准测试。评估28个模型,发现与人类表现有差距。引入新数据集和VideoKnow+基线模型,采用结构化范式和强化学习,提升模型表现。

Comments Accepted by ECCV 2026. https://github.com/OpenGVLab/VKnowU

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01651 2026-07-07 cs.CV 版本更新

Diffusion Models are Open-World Affordance Learners: Leveraging Generative Priors for 3D Affordance Learning

扩散模型是开放世界的功能学习器:利用生成先验进行3D功能学习

Hanqing Wang, Zhenhao Zhang, Kaiyang Ji, Mingyu Liu, Wenti Yin, yuchao chen, Zhirui Liu, Xiangyu Zeng, Tianxiang Gui, Hangxing Zhang, Jiahao Yuan, Zhiqing Cui, Jiaxin Liu, Zhiyuan Ma, Hui Xiong

机构 * The Hong Kong University of Science and Technology(香港科技大学) ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 研究3D功能基础问题,利用文本到图像扩散模型提取先验知识,提出基于扩散的DAG框架用于3D功能预测,通过实验证明其优于现有方法且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13378 2026-07-07 cs.AI cs.CL cs.IR cs.LG q-bio.QM 版本更新

DrugAgent: Reliable Multi-Agent Integration of Conflicting Biomedical Evidence for Drug-Target Interaction Assessment

DrugAgent:用于药物-靶点相互作用评估的冲突生物医学证据的可靠多智能体整合

Yoshitaka Inoue, Tianci Song, Xinling Wang, Rui Kuang, Tianfan Fu, Augustin Luna

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Computational Biology Branch, National Library of Medicine(国家医学图书馆计算生物学分支) Khoury College of Computer Sciences, Northeastern University(东北大学计算机科学学院) State Key Laboratory for Novel Software Technology at Nanjing University, School of Computer Science, Nanjing University(南京大学新型软件技术国家重点实验室,南京大学计算机科学学院) Developmental Therapeutics Branch, National Cancer Institute(国家癌症研究所发育治疗分支)

AI总结 研究药物-靶点相互作用评估中整合异构数据问题,核心方法是基于大语言模型的多智能体系统DrugAgent,贡献是能进行异构证据支持的DTI评估,补充独立DTI预测,还提供相关策略。

详情

展开后加载摘要…

URL PDF HTML 收藏