arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-20 至 2026-03-20 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2603.19092 2026-03-20 cs.CV cs.AI cs.CL cs.LG 67%

SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues

SAVeS: 通过语义线索引导视觉-语言模型中的安全判断

Carlos Hinojosa, Clemens Grange, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02906 2026-03-20 cs.CV cs.AI cs.MM 67%

MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding

MRD:多分辨率检索-检测融合用于高分辨率图像理解

Fan Yang, Xingping Dong, Xin Yu, Wenhan Luo, Wei Liu, Kaihao Zhang

机构 * HITSZ(哈尔滨工业大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出MRD框架,通过多分辨率语义融合和开放词汇检测提升高分辨率图像理解,实现局部和全局视角的增强,取得单目标和多目标理解任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17024 2026-03-20 cs.CV cs.AI cs.CL 67%

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23098 2026-03-20 cs.CV cs.AI 62%

Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding

无视位置,语言偏见:探测视觉语言编码器中中间层表征偏见以实现零样本语言基础空间理解

Na Min An, Inha Kang, Minhyun Lee, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Samsung Electronics(三星电子)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了视觉语言编码器中间层中位置和语言相关信息的偏见,通过层间分析发现常规最终层多模态嵌入优先考虑全局语义对齐,导致视觉嵌入对位置线索敏感性低,多语言文本嵌入在共享空间中形成语言依赖的几何偏移,提出构建空间地图的方法提升零样本图像分割性能。

Comments 61 pages, 28 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12696 2026-03-20 cs.RO cs.CV 57%

HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation

HaltNav: 基于轻量拓扑先验的反应式视觉停止用于鲁棒视觉-语言导航

Zihui Yu, Pingcong Li, Bichi Zhang, Sören Schwertfeger

机构 * SIST, ShanghaiTech University(上海科技大学信息与通信科学核心平台,上海科技大学) Key Laboratory of Intelligent Perception and Human-Machine Collaboration(智能感知与人机协同重点实验室)

专题命中 图文多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出HaltNav框架,结合轻量拓扑先验与局部探索能力,通过反应式视觉停止机制提升视觉-语言导航的鲁棒性,实验表明其在复杂环境下的表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10846 2026-03-20 cs.CL 57%

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

DUAL-Bench: 测量视觉语言模型中的过度拒绝与鲁棒性

Kaixuan Ren, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DUAL-Bench,通过评估18种VLM在12类危险场景下的表现,揭示模型在双重使用场景中的脆弱安全边界,强调安全完成与过度拒绝的平衡需求。

Comments 26pages, 13 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19233 2026-03-20 cs.RO 56%

Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models

并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究

Bryce Grant, Xijia Zhao, Peng Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 图文多模态 :multimodal(abstract,comments)

AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。

Comments Accepted to Multimodal Intelligence Workshop @ ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2510.08581 2026-03-20 cs.SD cs.AI eess.AS 88%

Evaluating Hallucinations in Audio-Visual Multimodal LLMs with Spoken Queries under Diverse Acoustic Conditions

通过多样声学条件下的语音查询评估音频-视觉多模态大语言模型的幻觉

Hansol Park, Hoseong Ahn, Junwon Moon, Yejin Lee, Kyuhong Shim

机构 * Department of Intelligent Software, Sungkyunkwan University(智能软件系,成均馆大学) Department of Computer Science and Engineering, Sungkyunkwan University(计算机科学与工程系,成均馆大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);image-text(abstract);分类 cs.AI、eess.AS

AI总结 研究探讨语音查询对多模态幻觉的影响,通过RePOPE-Spk基准测试发现语音查询导致错误率显著增加,提出改进方法以提升语音界面可靠性。

Comments Submitted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02768 2026-03-20 eess.AS cs.CL cs.SD 81%

DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment

DeSTA2.5-Audio:迈向通用大规模音频语言模型的自我生成跨模态对齐

Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Sung-Feng Huang, Chih-Kai Yang, Chee-En Yu, Chun-Wei Chen, Wei-Chih Chen, Chien-yu Huang, Yi-Cheng Lin, Yu-Xiang Lin, Chi-An Fu, Chun-Yi Kuan, Wenze Ren, Xuanjun Chen, Wei-Ping Huang, En-Pei Hu, Tzu-Quan Lin, Yuan-Kuei Wu, Kuan-Po Huang, Hsiao-Ying Huang, Huang-Cheng Chou, Kai-Wei Chang, Cheng-Han Chiang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee

专题命中 音频语音多模态 :cross-modal(title,abstract);分类 cs.CL、eess.AS

AI总结 本文提出DeSTA2.5-Audio,一种通用大规模音频语言模型,通过自我生成的跨模态对齐策略解决知识保留与音频感知的平衡问题,展示了在多个音频-语言基准测试中的优异性能。

Comments Published in IEEE Transactions on Audio, Speech and Language Processing (TASLP). Model and code available at: https://github.com/kehanlu/DeSTA2.5-Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10045 2026-03-20 cs.CL 79%

Do Language Models Associate Sound with Meaning? A Multimodal Study of Sound Symbolism

语言模型是否将声音与意义关联?一种多模态研究声音象征主义

Jinhong Jeong, Sunghyun Lee, Jaeyoung Lee, Seonah Han, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) Korea University(韩国大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 研究语言模型在多模态输入中对声音象征性的处理,通过分析不同语义维度下的音节注意力分数,揭示模型对声音与意义关联的理解机制。

Comments 33 pages, 27 tables, 10 figures, accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19176 2026-03-20 cs.SD cs.CV eess.AS 76%

Few-shot Acoustic Synthesis with Multimodal Flow Matching

少样本声学合成与多模态流匹配

Amandine Brunetto

机构 * Center for Robotics, Mines Paris - PSL University(机器人中心,巴黎 Mines - PSL 大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV、eess.AS

AI总结 本文提出FLAC方法,通过流匹配生成少样本声学合成,结合空间、几何和声学线索生成新的场景房间脉冲响应,优于现有八样本基线。

Comments To appear at CVPR 2026. 23 pages, 16 figures. Project Page: https://amandinebtto.github.io/FLAC/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2603.18118 2026-03-20 cs.CV cs.AI cs.LG 81%

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10887 2026-03-20 cs.CV 79%

AutoOEP -- A Multi-modal Framework for Online Exam Proctoring

AutoOEP -- 一种用于在线考试监考的多模态框架

Aryan Kashyap Naveen

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出AutoOEP,通过计算机视觉和机器学习实现高效的自动监考,采用双摄像头和LSTM网络检测可疑行为,准确率达90.7%。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11403 2026-03-20 quant-ph physics.optics 78%

Bidimensional measurements of photon statistics within a multimodal temporal framework

双维光子统计的多模时域测量

C. Hainaut, K. Ouahrouche, A. Rancon, G. Patera, C. Ouarkoub, M. Le Parquier, P. Suret, A. Amo

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种双维光子统计测量方法,利用DFG在非线性BBO晶体中实现高时间分辨率的单次成像,区分相干与热光子统计,并通过时间模式分解框架解释测量偏差原因。

Journal ref Phys. Rev. Research 8, 013286 (16 March, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO 78%

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18758 2026-03-20 cs.HC cs.CV cs.SD 57%

Dual-Model Prediction of Affective Engagement and Vocal Attractiveness from Speaker Expressiveness in Video Learning

双模型预测视频学习中说话者表达性对情感参与和语音吸引力的影响

Hung-Yue Suen, Kuo-En Hung, Fan-Hsun Tseng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于说话者情感表达的双回归模型,利用大规模在线课程数据预测观众情感参与和语音吸引力,验证说话者多模态特征可预测观众反馈。

Comments Preprint. Accepted for publication in IEEE Transactions on Computational Social Systems

Journal ref IEEE Transactions on Computational Social Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18649 2026-03-20 cs.CV 57%

Click-to-Ask: An AI Live Streaming Assistant with Offline Copywriting and Online Interactive QA

点击提问:一种带有离线文案生成和在线交互问答的AI直播助手

Ruizhi Yu, Keyang Zhong, Peng Liu, Qi Wu, Haoran Zhang, Yanhao Zhang, Chen Chen, Haonan Lu

机构 * East China normal University(东中国正常大学) Sun Yat-sen University(孙中山大学) OPPO AI Center(OPPO AI中心) Shenzhen Institutes of Advanced Technology(深圳先进技术研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Click-to-Ask系统,通过离线处理多模态产品信息生成结构化数据和合规文案,结合在线实时问答模块提升直播电商效率和观众互动性。

Comments 4 pages, 2 figures, Accepted at WWW2026 Demos

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21782 2026-03-20 cs.CV 57%

Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding

Mobile-VideoGPT:用于移动视频理解的高效模型

Abdelrahman Shaker, Muhammad Maaz, Chenhui Gou, Hamid Rezatofighi, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Monash University(莫纳什大学) Linköping University(利尔贝里大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Mobile-VideoGPT,一种轻量级多模态框架,通过高效编码器、投影器和小语言模型实现快速推理,提升移动视频理解效率。

Comments Technical Report. Project: https://amshaker.github.io/Mobile-VideoGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00960 2026-03-20 cs.CV 57%

Efficient and Scalable Monocular Human-Object Interaction Motion Reconstruction

高效且可扩展的单目人类-物体交互运动重建

Boran Wen, Ye Lu, Sirui Wang, Keyan Wan, Jiahong Zhou, Junxuan Liang, Xinpeng Liu, Bang Xiao, Ruiyang Liu, Yong-Lu Li

机构 * SJTU(上海交通大学) SII(上海信息院) FDU(福建大学) BJTU(北京理工大学) ZJU(浙江大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种高效的稀疏接触标注方法和InterPoint多模态预测器,结合4DHOISolver框架,构建了大规模4D HOI数据集,并通过强化学习验证了运动重建的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02535 2026-03-20 cs.CV 57%

Video Anomaly Detection with Semantics-Aware Information Bottleneck

基于语义感知信息瓶颈的视频异常检测

Juntong Li, Lingwei Dang, Qingxin Xiao, Shishuo Shang, Jiajia Cheng, Haomin Wu, Yun Hao, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SIB-VAD框架,通过自适应信息瓶颈过滤和语义增强方法,解决视频异常检测中正常与异常边界模糊和低级特征难以捕捉高级语义异常的问题。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2412.08973 2026-03-20 cs.CV cs.AI 73%

Is Contrastive Distillation Enough for Learning Comprehensive 3D Representations?

对比蒸馏是否足以学习全面的3D表示?

Yifan Zhang, Junhui Hou

机构 * School of Mechatronic Engineering and Automation, Shanghai University, Shanghai, China(上海大学机械与自动化工程学院) Department of Computer Science, City University of Hong Kong, Hong Kong SAR, China(香港城市大学计算机科学系)

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMCR框架,通过整合模态共享和特定特征,改进传统方法,引入掩码图像建模和占用估计任务,提升3D表示学习效果。

Comments Accepted to IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19028 2026-03-20 cs.CV cs.AI cs.LG 62%

SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models

SEM:用于视觉-语言模型后验去偏的稀疏嵌入调制

Quentin Guimard, Federico Bartsch, Simone Caldarella, Rahaf Aljundi, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) Toyota Motor Europe(丰田欧洲公司) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SEM框架,通过稀疏自编码器空间调制嵌入,实现视觉-语言模型的后验去偏,提升检索和零样本分类的公平性。

Comments CVPR Findings 2026. Project website: https://sparse-embedding-modulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20651 2026-03-20 cs.AI 57%

Memory Bear AI A Breakthrough from Memory to Cognition Toward Artificial General Intelligence

记忆熊AI:从记忆到认知迈向通用人工智能的突破

Deliang Wen, Ke Sun

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Memory Bear系统,通过整合多模态感知、动态记忆维护和适应性认知服务,提升LLM的记忆机制,实现跨领域知识准确性和检索效率的提升,减少幻觉并增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 10 篇

2603.18600 2026-03-20 cs.CV 83%

Improving Joint Audio-Video Generation with Cross-Modal Context Learning

通过跨模态上下文学习提升联合音频视频生成

Bingqi Ma, Linlong Lang, Ming Zhang, Dailan He, Xingtong Ge, Yi Zhang, Guanglu Song, Yu Liu

机构 * Vivix Group Limited(维维克斯集团有限公司)

专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出跨模态上下文学习方法,解决双流Transformer生成中模态交互不一致、训练不稳定等问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18505 2026-03-20 cs.CV 79%

From Snapshots to Symphonies: The Evolution of Protein Prediction from Static Structures to Generative Dynamics and Multimodal Interactions

从快照到交响曲:蛋白质预测从静态结构到生成动态和多模态交互的演变

Jingzhi Chen, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文综述了人工智能在蛋白质科学中的范式转变,探讨了多模态表示、静态预测优化、生成框架、异质相互作用预测及功能推断等核心方法,指出现存瓶颈并展望未来方向。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14615 2026-03-20 cs.RO 78%

Accelerated Multi-Modal Motion Planning Using Context-Conditioned Diffusion Models

利用上下文条件扩散模型加速多模态运动规划

Edward Sandra, Lander Vanroye, Dries Dirckx, Ruben Cartuyvels, Jan Swevers, Wilm Decré

机构 * Department of Mechanical Engineering, KU Leuven(卢森堡鲁文大学机械工程系) Department of Computer Science, KU Leuven(卢森堡鲁文大学计算机科学系)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出CAMPD模型,通过上下文感知的扩散模型实现高效的多模态运动规划,适用于多样场景且无需重新训练,展示出在未见环境中生成高质量轨迹的能力。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18896 2026-03-20 cs.CV cs.AI 62%

Translating MRI to PET through Conditional Diffusion Models with Enhanced Pathology Awareness

通过增强病理意识的条件扩散模型将MRI翻译为PET

Yitong Li, Igor Yakushev, Dennis M. Hedderich, Christian Wachinger

机构 * Lab for Artificial Intelligence in Medical Imaging, Institute for Diagnostic and Interventional Radiology, School of Medicine and Health, TUM Klinikum, Technical University of Munich (TUM)(人工智能医学成像实验室,诊断与介入放射学研究所,医学院与健康学院,TUM医院,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Nuclear Medicine, School of Medicine and Health(核医学系,医学院与健康学院) Department of Neuroradiology, School of Medicine and Health(神经放射学系,医学院与健康学院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PASTA框架,利用条件扩散模型生成高质量3D PET图像,通过双臂架构和多模态条件整合提升结构与病理细节的保留,使合成PET在阿尔茨海默病诊断中性能优于MRI,接近真实PET。

Comments Accepted by Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19232 2026-03-20 cs.CV 57%

Cubic Discrete Diffusion: Discrete Visual Generation on High-Dimensional Representation Tokens

三次离散扩散:高维表示上的离散视觉生成

Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming Han, Jiashi Feng, Yi Jiang, Xihui Liu

机构 * University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子) Carnegie Mellon University(卡内基梅隆大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CubiD,首个高维表示离散生成模型,通过精细掩码实现高维离散表示的生成,具备固定步数的生成能力,且在ImageNet-256上达到SOTA性能,验证离散token保留原始表示能力。

Comments Accepted by CVPR 2026 main track; Code: https://github.com/YuqingWang1029/CubiD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19053 2026-03-20 cs.CV cs.GR 57%

SwiftTailor: Efficient 3D Garment Generation with Geometry Image Representation

SwiftTailor: 基于几何图像表示的高效3D服装生成

Phuc Pham, Uy Dieu Tran, Binh-Son Hua, Phong Nguyen

机构 * Qualcomm AI Research(高通AI研究) Trinity College Dublin(都柏林大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SwiftTailor框架,通过紧凑的几何图像表示统一缝纫图案推理与几何网格合成,提升3D服装生成的效率与精度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04614 2026-03-20 cs.CV 57%

HyperAlign: Hyperbolic Entailment Cones for Adaptive Text-to-Image Alignment Assessment

HyperAlign:基于双曲蕴含几何的自适应文本到图像对齐评估

Wenzhi Chen, Bo Hu, Leida Li, Lihuo He, Wen Lu, Xinbo Gao

机构 * Chongqing University of Posts and Telecommunications(重庆邮电大学) Xidian University(西安电子科技大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 HyperAlign基于双曲蕴含几何提出自适应文本到图像对齐评估框架,通过CLIP提取欧几里得特征并映射到双曲空间,设计动态监督蕴含建模机制和自适应调制回归器,实现对图像-文本对齐的高效评估。

详情

展开后加载摘要…

URL PDF HTML 收藏