arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-05 至 2026-08-05 共收录 102 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 16 篇

2608.03474 2026-08-05 cs.CV 新提交 57%

MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试

Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03451 2026-08-05 cs.AI 新提交 57%

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

DataSpace:针对异构工作空间可验证分析的数据智能体基准测试

Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究推出DataSpace基准,用于评估异构工作空间下数据智能体的可验证分析能力,包含多类型任务与数据,实验揭示了智能体框架、多模态集成等对准确率的影响,为提升数据智能体可靠性指明了方向。

Comments 8 pages of main text, 7 figures, with a supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03279 2026-08-05 cs.CV 新提交 57%

3DGSI-Assessor: A Large-Scale Dataset and An LMM-based Method for 3D Gaussian Splatting Image Quality Assessment

3DGSI-Assessor:面向3D高斯溅射图像质量评估的大规模数据集与基于大视觉语言模型的方法

Yuke Xing, Jiarui Wang, William Gordon, Zhu Li, Guangtao Zhai, Yiling Xu

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对3D高斯溅射压缩的失真评估缺口,提出含15200张图像的多维IQA数据集3DGS-IEval-15K+,并构建基于大视觉语言模型的一体化IQA框架3DGSI-Assessor,该框架在对应数据集上达SOTA且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03225 2026-08-05 cs.CV 新提交 57%

Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis

面向跨站点可解释皮肤病图像诊断的开放语言概念统一学习

Chengyu Wu, Junpeng Tan, Wanxiang Luo, Yaqi Wang, Yandong Wen, Yefeng Zheng

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对现有概念模型跨站点泛化差、适配FVLMs成本高的问题,提出开放语言概念统一学习框架UniCon,通过共享语义空间等三项创新实现多模态可解释皮肤病诊断,获顶级准确率且具备跨站点干预能力。

Comments accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01737 2026-08-05 cs.CV 版本更新 57%

IDraw: Artist Verification from Digital Drawing Images

IDraw:基于数字绘画图像的艺术家身份验证

Nayoung Kim, Nan Jiang, Bangjie Sun, Jaewon Shin, Sojeong Kim, Jun Han

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对数字绘画作者身份验证的挑战,提出IDraw框架,构建首个多模态数据集,可从完整图像推断绘画行为、抑制内容干扰,在9种主干网络下将验证误差最多降低40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23258 2026-08-05 cs.AI cs.LG 版本更新 57%

CAPT: A Multi-task Continuous Autoregressive Transformer enabling Cross-dataset and Cross-species Transfer for Calcium Population Dynamics

CAPT:一种多任务连续自回归Transformer,实现钙群体动力学的跨数据集和跨物种转移

Xinhong Xu, Yimeng Zhang, Yuanlong Zhang

机构 * Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究针对钙群体动力学模型跨数据集和物种推广难的问题,提出CAPT这一连续自回归群体Transformer,通过连续补丁令牌化策略建模,经多数据集实验验证,其在预测任务中性能优且能形成共享功能空间,为通用神经基础模型开辟新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25761 2026-08-05 cs.CV cs.DL 57%

A Survey of OCR Evaluation Methods and Metrics and the Invisibility of Historical Documents

OCR评估方法和指标及历史文件的不可见性综述

Fitsum Sileshi Beyene, Christopher L. Dancy

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨OCR系统在历史文档中的评估问题,指出现代文档评估方法忽视了历史档案的布局、字体和材料退化,导致结构性不可见和代表性伤害。

Comments This manuscript is the author's submitted version to the ACM Conference on Fairness, Accountability, and Transparency (FAccT 2026). Please cite the final published version via ACM Digital Library when available

Journal ref FAccT '26: The 2026 ACM Conference on Fairness, Accountability, and Transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17810 2026-08-05 cs.LG cs.IR 版本更新 50%

VIBE: Vector Index Benchmark for Embeddings

VIBE:用于嵌入的向量索引基准测试

Elias Jääsaari, Ville Hyvönen, Matteo Ceccarello, Teemu Roos, Martin Aumüller

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究针对现有ANN基准数据集无法代表现代应用的问题,推出开源VIBE框架,含分布内外数据集,评估22个向量索引,为ANN算法提供最新基准测试。

Comments The 2nd Workshop on Vector Databases (VecDB@VLDB2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 6 篇

2607.11844 2026-08-05 cs.CV 版本更新 81%

Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

超越单摄像头:体育视频理解中的智能多视角推理

Kerui Chen, Jinglu Wang, Xiaoyi Zhang, Yan Lu

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 针对体育视频多视角理解缺乏评估基准及MLLMs难以利用多视角信息的问题,引入SportMV - Bench基准,分析瓶颈所在,并提出SportMV - Agent框架,通过迭代循环实现主动视角选择等,相比最强MLLM基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26760 2026-08-05 cs.CL cs.LG 版本更新 70%

Metis: Memory Foundation Model

Metis:记忆基础模型

Zeyu Zhang, Ziliang Guo, Yihang Sun, Xichong Zhang, Xixuan Hao, Zehao Lin, Yang Zhang, Xiaoyan Zhao, Tong Shen, Bo Tang, Zhi-Qin John Xu, Junchi Yan, Haofen Wang, Xu Chen, Feiyu Xiong, Zhiyu Li, Tat-Seng Chua

机构 * MemTensor (Shanghai) Technology Co., Ltd.(墨芯(上海)科技有限公司) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL

AI总结 该研究提出首个记忆基础模型原型Metis,赋予基础模型原生记忆能力,通过新架构与优化目标实现,经实验验证其具备原生记忆能力并发布相关资源。

Comments 46 pages, 11 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02643 2026-08-05 cs.SE cs.AI 新提交 57%

CUADebug: Diagnosing and Repairing Computer-Use Agent Failures

CUADebug:计算机使用智能体故障的诊断与修复

Weijia Zhang, Kunlun Zhu, Zeyi Liu, Yinting Chen, Tianyi Ma, Jiateng Liu, Jiaxun Zhang, Bingxuan Li, Xiangru Tang, Heng Ji, Jiaxuan You

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究提出CUADebug框架,含错误分类、CUAErrorBench基准与CUADebugger工具,可诊断修复计算机使用智能体故障,提升任务完成与重新执行成功率,证明其能提供可操作修复信号。

Comments 23 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03556 2026-08-05 cs.RO 新提交 50%

Human Centric Embodied Intelligence for Soft Wearable Robotics

面向软质可穿戴机器人的以人为中心的具身智能

Rainier Natividad, Raye Chen-Hua Yeow

专题命中 多模态Agent :multimodal(abstract)

AI总结 本综述提出以人为中心的具身智能(HCEI)概念,引入感知-认知-执行-增强(PCAA)框架,整合多领域进展以指导软质可穿戴机器人向个性化、可预测的以人为中心方向发展。

Comments Review article; 48 pages, 6 figures, 4 tables, and 2 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02959 2026-08-05 cs.MA 新提交 50%

SABRE: A Multi-Agent Approach for Selecting Out-of-Distribution Detectors Under a Budget

SABRE:预算约束下选择分布外检测器的多智能体方法

Mary Wisell, Salimeh Sekeh

专题命中 多模态Agent :multimodal(abstract)

AI总结 SABRE是一种多智能体方法,可在预算约束下针对视觉-语言模型的分布外检测,自动选择各领域最优检测器,解决固定检测器跨领域失效的问题,实现可靠检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25459 2026-08-05 cs.RO 版本更新 50%

GS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning

GS-Playground:一种高吞吐量的视觉真实模拟器用于基于视觉的机器人学习

Yufei Jia, Heng Zhang, Ziheng Zhang, Junzhe Wu, Mingrui Yu, Zifan Wang, Dixuan Jiang, Zheng Li, Chenyu Cao, Zhuoyuan Yu, Xun Yang, Haizhou Ge, Yuchi Zhang, Jiayuan Zhang, Zhenbiao Huang, Tianle Liu, Shenyu Chen, Jiacheng Wang, Bin Xie, Xuran Yao, Xiwa Deng, Guangyu Wang, Jinzhi Zhang, Lei Hao, Zhixing Chen, Yuxiang Chen, Anqi Wang, Hongyun Tian, Yiyi Yan, Zhanxiang Cao, Yizhou Jiang, Hanyang Shao, Yue Li, Lu Shi, Bokui Chen, Wei Sui, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Guyue Zhou

机构 * THU(清华大学) Motphys Dexmal DISCOVER Robotics HKUST(GZ)(香港科技大学(广州)) BIT(北京理工大学) NUS(新加坡国立大学) HITSZ(哈尔滨工业大学) XJTU(西安交通大学) NJU(南京大学) SJTU(上海交通大学) D-Robotics

专题命中 多模态Agent :multi-modal(abstract)

AI总结 GS-Playground通过高吞吐量的多模态模拟框架,结合高效物理引擎和3DGS渲染管道,提升视觉强化学习的效率,降低大规模视觉RL的门槛,实现感知与物理的无缝衔接。

Comments Robotics: Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 22 篇

2608.00077 2026-08-05 cs.CV 版本更新 90%

Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

超越准确率:针对OCR关键多模态大语言模型(MLLM)推理的视觉令牌剪枝空间溯源审计

Feixiang Liu, Qiang Qiu, Hao Zhang, Xinyue Wang

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究针对OCR关键MLLM推理的视觉令牌剪枝,提出结合空间溯源的审计方法,发现准确率无法反映的质量风险,揭示模型特定前沿并验证压缩与任务通用性的关系,为视觉令牌剪枝评估提供新范式。

Comments 21 pages, including supplementary material. Code and reproducibility artifacts: https://github.com/SouthWinter/spatial-provenance-audit

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03141 2026-08-05 eess.SP 新提交 89%

Geometric Cross-Modal Token Selection for Latency-Constrained Multimodal Token Communication

面向延迟约束多模态令牌通信的几何跨模态令牌选择

Joohyuk Park, Junyong Shin, Yongjeong Oh, Jihong Park, Yo-Seb Jeon

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);audio-visual(abstract)

AI总结 该研究针对延迟约束多模态令牌通信问题,提出基于几何的跨模态令牌选择框架及IBS、R-IBS策略,在VQA和AVQA任务上实现了显著的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03660 2026-08-05 cs.AI 新提交 89%

Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training

驯服隐式:面向持续多模态后训练的双通道风险感知强化微调

Yibei Liu, Jiajun Chen, Qianle Zhang, Tangyue Jin, Mengying Zhu, Meng Xi, Yangyang Wu

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.AI

AI总结 针对持续多模态后训练中RFT算法在任务分布偏移下遗忘加剧的问题,提出双通道风险感知强化微调框架RAPO,通过策略与数据通道的风险管控降低遗忘,在MLLM-CL基准上使遗忘减少79.8%且保留新任务竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03450 2026-08-05 cs.MM cs.AI cs.CL cs.CV 新提交 88%

Balancing Efficiency and Efficacy: Training-Free Attention-Guided Switching Between Explicit and Latent Thoughts for MLLMs

平衡效率与效能:面向多模态大语言模型(MLLM)的无训练注意力引导式显式与隐式思维切换

Haoqian Kang, Liupeng Li, Kuofeng Gao, Jinpeng Wang, Zhenyu Lu, Bin Chen, Ke Chen, Yaowei Wang

专题命中 多模态训练与对齐 :MLLM(title_cn,summary_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对MLLM推理中感知与逻辑混淆的问题,提出无训练的注意力引导式切换框架,通过视觉-文本注意力比率自适应切换显式与隐式推理,实现性能与效率的双重提升。

Comments Accepted by ACM MM 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03611 2026-08-05 cs.AI cs.MM 新提交 86%

Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations

面向含不完整观测的多模态情感分析,重新思考模态可靠性

Chunlei Meng, Jacqueline J. Pang, Pengbin Feng, Zhenyu Yu, Chun Ouyang, Zhongxue Gan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 针对含不完整观测的多模态情感分析,本文提出显式建模模态可靠性的MRCF框架,缓解可靠性不匹配与传播偏差,在多个公开情感数据集上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03812 2026-08-05 cs.CV 新提交 85%

OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

OmniPack:面向高效全模态大语言模型的统一令牌压缩方法

Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

专题命中 多模态训练与对齐 :omni-modal(title,abstract);multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文针对全模态大语言模型的高计算开销问题,提出无需训练的OmniPack框架,通过LLM前结构压缩与LLM内语义优化的协作,在5个基准上实现最优性能-效率权衡,在Qwen2.5-Omni-7B上大幅降低计算量且保持高性能。

Comments 16 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03475 2026-08-05 cs.MM cs.AI cs.CL 新提交 85%

Adaptive Modality Reliability Diagnosis and Restoration for Robust Multimodal Intent Recognition

用于鲁棒多模态意图识别的自适应模态可靠性诊断与恢复

Suraj Kumar, Mohnish Raj, Soumi Chattopadhayay, Chandranath Adak, Ayan Dutta

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 提出PRIME闭环可靠性引导框架,通过诊断恢复多模态意图识别的不可靠模态,在保持干净数据性能的同时提升了多模态数据各类退化场景下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04010 2026-08-05 cs.CV cs.CL 新提交 84%

ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs

ParVL:面向多模态大语言模型的并行缩放与可扩展计算分配

Yang Yang, Qinyu Zhao, Mouxiang Chen, Xiaohui Li, Lixin Gu, Wenhai Wang, Hongjie Zhang, Wenwei Zhang

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL

AI总结 本研究针对多模态大语言模型的计算分配僵化问题,提出ParVL框架,通过复用骨干参数扩展并行计算,在13B token上微调后,其多模态性能优于同配置单分支基线,且最优分配随任务变化。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25179 2026-08-05 cs.MM 版本更新 83%

Mitigating Shared-Private Branch Imbalance via Dual-Branch Rebalancing for Multimodal Sentiment Analysis

通过双分支重新平衡缓解共享-私有分支不平衡以实现多模态情感分析

Chunlei Meng, Jiabin Luo, Pengbin Feng, Zhenglin Yan, Chengyin Hu, Zhongxue Gan, Chun Ouyang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出双分支重新平衡框架,通过解耦共享与私有分支,缓解多模态情感分析中的分支不平衡问题,提升模型鲁棒性。

Comments This study has been Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25103 2026-08-05 cs.LG cs.AI 83%

Layer-Specific Lipschitz Modulation for Fault-Tolerant Multimodal Representation Learning

模块特定的Lipschitz调制用于容错多模态表示学习

Diyar Altinses, Andreas Schwung

机构 * South Westphalia University of Applied Sciences(西南威斯特法伦应用科学大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种结合自监督异常检测与误差校正的框架,通过模块特定的Lipschitz调制和梯度裁剪提升多模态表示学习的容错能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02769 2026-08-05 stat.ME cs.LG math.ST stat.ML stat.TH 新提交 82%

DAIF: A Data-Driven Intermediate Fusion Framework for Multimodal Supervised Learning via Approximate Message Passing

DAIF:一种基于数据的近似消息传递多模态监督学习中间融合框架

Sagnik Nandy, Samriddha Lahiry, Pragya Sur, Subhabrata Sen

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本研究提出DAIF数据自适应中间融合框架,结合随机矩阵理论与非参数依赖度量,通过近似消息传递生成去噪特征,在模拟及两个多模态数据集上的预测任务中表现优于或媲美现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03559 2026-08-05 cs.CV 新提交 79%

Compass: Degradation-Simulated Reciprocal Learning with Lightweight Needle RWKV for Multimodal Crack Segmentation under Missing Modalities

Compass:面向缺失模态场景下多模态裂缝分割的退化模拟互学习与轻量型Needle RWKV

Hui Liu, Chen Jia, Fan Shi, Xu Cheng, Mianzhao Wang, Shengyong Chen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 Compass是面向缺失模态场景的多模态裂缝分割轻量型网络,通过DSD、Needle Block与ETPF实现鲁棒分割,在90%深度模态缺失时仍达SOTA性能,仅需258万参数。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03109 2026-08-05 cs.CV cs.RO 新提交 79%

Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis

结合三维骨架提取与语言分析的多模态植物根表型分析

Jiakai Lin, Zijun Li, Guoyu Lu

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出多模态机器人AI框架,结合W-LBC无监督三维骨架提取与证据优先语言建模,微调GPT实现12种植物根表型的可解释分析,建立了定量与语义结合的根表型统一分析范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02692 2026-08-05 cs.LG 新提交 78%

PatTree: a novel approach for automated creation of multimodal, graph-based patient representations for medical classification tasks

PatTree:一种用于医学分类任务的多模态图基患者表示自动构建新方法

Julia Gehrmann, Lars Quakulinski, Hamza Naseem, Oya Beyan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出PatTree,一种自动构建的多模态图基患者表示,在ADNI-1队列子集上实现阿尔茨海默病等三分类任务98.5%平衡准确率,可作为临床AI流程的可扩展基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03247 2026-08-05 cs.CV cs.CL 新提交 73%

CIGTSurv: Clinical Information Guided Tri-modal Survival Prediction with Local Prototype Association and Global Feature Alignment

CIGTSurv:结合局部原型关联与全局特征对齐的临床信息引导三模态生存预测

Jing Dai, Qibin Zhang, Weiwei Zhou, Mingde Xu, Jingsong Liu, Jingdong Zhang, Hongming Xu

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本研究针对临床信息未充分利用及多模态异质性问题,提出CIGTSurv框架,结合局部原型关联与全局特征对齐机制,在五个TCGA癌症队列上取得生存预测SOTA性能。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03185 2026-08-05 cs.CV 新提交 70%

CRIL-U-Net: Compact Ratio-Interaction Learning for Focal Cortical Dysplasia Segmentation from T1w and FLAIR MRI

CRIL-U-Net:用于从T1w和FLAIR MRI中分割局灶性皮质发育不良的紧凑比率交互学习网络

Soumen Ghosh, Amit Soni Arya, Tilottama Goswami, Subhojit Mandal, John Phamnguyen, Rajat Vashistha

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 该研究针对II型局灶性皮质发育不良MRI自动分割难题,提出CRIL-U-Net模型,在85例患者与25例对照的五折交叉验证中,其性能显著优于传统及注意力型U-Net。

详情

展开后加载摘要…

URL PDF HTML 收藏