arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-28 至 2026-04-28 共收录 132 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 24 篇

2604.23570 2026-04-28 cs.RO 50%

EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks

EgoLive:一个大规模的第一人称视角数据集,源自现实世界的人类任务

Yihang Li, Xuelong Wei, Jingzhou Luo, Yingjing Xiao, Yibo Bai, Guangyuan Zhou, Teng Zou, Chenguang Gui, Jiajun Wen, He Zhang, Kangliang Chen, Xing Pan, Shuaiyan Liu, Daming Wang, Tao An, Jiayi Li, Shibo Jin, Wanwan Zhang, Tianyu Wang, Boren Wei, Zhixuan Huang, Fangsheng Liu, Ruodai Li, Hui Zhang, Anson Li, Yicheng Gong, Peng Cao, Jiaming Liang, Liang Lin

机构 * Joy Future Academy, JD(京东探索研究院)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出EgoLive数据集,用于机器人操作学习,具有大规模、高质量、真实场景采集等优势,推动通用机器人模型突破和实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 7 篇

2510.17590 2026-04-28 cs.AI cs.CL cs.CV cs.CY cs.LG 85%

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

MERIT:基于网络基础推理的多模态虚假信息检测模块化框架

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma

机构 * University of Rochester(罗切斯特大学)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MERIT通过四个专用模块提升多模态虚假信息检测性能,采用GPT-4o-mini在MMFakeBench上取得81.65% F1得分,优于零样本基线,验证了其架构设计的有效性。

Comments 18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24441 2026-04-28 cs.CV 74%

AutoGUI-v2: A Comprehensive Multi-Modal GUI Functionality Understanding Benchmark

AutoGUI-v2:一个全面的多模态GUI功能理解基准

Hongxin Li, Xiping Wang, Jingran Su, Zheng Ju, Yuntao Chen, Qing Li, Zhaoxiang Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) New Laboratory of Pattern Recognition(模式识别新实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Hong Kong Institute of Science & Innovation(香港科学创新研究院) PolyU Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multi-modal(title);分类 cs.CV

AI总结 AutoGUI-v2通过多平台截图递归解析生成多样化任务,评估深度GUI功能理解和交互预测能力,揭示VLMs在功能接地与描述上的差异及复杂交互逻辑的挑战。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23392 2026-04-28 cs.AI 70%

SoccerRef-Agents: Multi-Agent System for Automated Soccer Refereeing

SoccerRef-Agents: 多智能体系统用于自动足球裁判

Zi Meng, Wanli Song, Yi Hu, Jiayuan Rao, Gang Chen

机构 * University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出SoccerRef-Agents多智能体系统,通过构建多模态基准和知识库,提升足球裁判决策的准确性和可解释性。

Comments 26 pages, 8 figures. Submitted to ISACE 2026. Github Repo: https://github.com/yjlog/SoccerRef-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10139 2026-04-28 cs.CR cs.AI 70%

Anonymization-Enhanced Privacy Protection for Mobile GUI Agents: Available but Invisible

增强隐私保护的移动GUI代理:可用但不可见

Lepeng Zhao, Zhenhua Zou, Shuo Li, Zhuotao Liu

机构 * Tsinghua University(清华大学)

专题命中 多模态Agent :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出一种基于匿名化的隐私保护框架,通过检测敏感UI内容并替换为非识别性占位符,实现敏感信息在任务执行中可用但不可见,减少隐私泄露同时保持代理的无缝使用。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23775 2026-04-28 cs.RO 67%

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

视觉-语言-动作安全性:威胁、挑战、评估与机制

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学) Peking University(北京大学)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract)

AI总结 本文探讨了视觉-语言-动作模型的安全性问题,分析了其在训练和推理阶段的威胁与防御机制,总结了评估方法及六个部署领域的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17736 2026-04-28 cs.HC cs.AI 57%

From Static to Interactive: Authoring Interactive Visualizations via Natural Language

从静态到交互:通过自然语言实现交互式可视化

Can Liu, Jaeuk Lee, Tianhe Chen, Zhibang Jiang, Xiaolin Wen, Yong Wang

机构 * Nanyang Technological University(南洋理工大学) Ajou University(阿乔大学) Providence Health & Services(普罗维登斯健康与服务)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出Athanor方法,利用多模态大语言模型和自然语言指令将静态可视化转为交互式,通过三种创新设计提升用户交互体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23802 2026-04-28 cs.MA 50%

EndoGov: A knowledge-governed multi-agent expert system for endometrial cancer risk stratification

EndoGov:一种基于知识的多智能体专家系统用于子宫内膜癌风险分层

Weiye Dai, Liyun Shi, Zanxiang He, Yuling Ma, Mengyuan Lin, Dianxiang Sun, Liming Nie

专题命中 多模态Agent :multimodal(abstract)

AI总结 EndoGov通过多智能体系统结合规则治理,实现子宫内膜癌风险分层的指南合规性与高准确性,同时保持竞争性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 23 篇

2603.08592 2026-04-28 cs.CV 89%

Boosting MLLM Spatial Reasoning with Geometrically Referenced 3D Scene Representations

通过几何参考的3D场景表示提升MLLM空间推理能力

Jiangye Yuan, Gowri Kumar, Baoyuan Wang

机构 * Zillow Group(智域集团)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出几何参考3D场景表示GR3D,使MLLM能利用语言能力处理3D空间,无需额外训练,在空间推理基准中提升GPT-5性能9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV 85%

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12890 2026-04-28 cs.CV cs.AI 84%

Towards Long-horizon Agentic Multimodal Search

面向长视界代理多模态搜索

Yifan Du, Zikang Liu, Jinbiao Peng, Jie Wu, Junyi Li, Jinyang Li, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 polled 智能学院) City University of Hong Kong(香港城市大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LMM-Searcher框架,通过文件化视觉表示和定制化图像加载工具,解决长视界多模态搜索中的信息管理与成本问题,实验证明其在长视界基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00829 2026-04-28 cs.CV cs.CL 84%

LinguDistill: Recovering Linguistic Ability in Vision-Language Models via Selective Cross-Modal Distillation

LinguDistill: 通过选择性跨模态蒸馏恢复视觉语言模型中的语言能力

Patrick Amadeus Irawan, Erland Hilman Fuadi, Shanu Kumar, Alham Fikri Aji, Yova Kementchedjhieva

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出LinguDistill方法,通过利用冻结的原始语言模型作为教师,选择性蒸馏语言信号以恢复语言能力,同时保持视觉基础,提升了语言和知识基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24125 2026-04-28 cs.CV 83%

Open-Vocabulary Semantic Segmentation Network Integrating Object-Level Label and Scene-Level Semantic Features for Multimodal Remote Sensing Images

开放词汇语义分割网络:整合对象级标签与场景级语义特征用于多模态遥感图像

Jinkun Dai, Yuanxin Ye, Peng Tang, Tengfeng Tang, Xianping Ma, Jing Xiao, Mi Wang

机构 * Faculty of Geosciences and Engineering, Southwest Jiaotong University, Chengdu 611756, China(西南交通大学地质工程学院,成都 611756,中国) State-Province Joint Engineering Laboratory of Spatial Information Technology for High-Speed Railway Safety, Southwest Jiaotong University, Chengdu 611756, China(高速铁路安全空间信息技术省部共建工程实验室,西南交通大学,成都 611756,中国) School of Artificial Intelligence, Wuhan University, Wuhan 430072, China(武汉大学人工智能学院,武汉 430072,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University, Wuhan 430072, China(武汉大学测绘遥感信息工程国家重点实验室,武汉 430072,中国)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出TSMNet,通过整合文本监督与视觉表示,实现开放词汇语义分割,利用双分支文本编码器提取场景级语义和对象级标签信息,提升遥感图像分割的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22899 2026-04-28 cs.CV 83%

Text-Guided Multimodal Unified Industrial Anomaly Detection

基于文本引导的多模态统一工业异常检测

Zewen Li, Shuo Ye, Zitong Yu, Weicheng Xie, Linlin Shen

机构 * School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Computing and Information Technology, Great Bay University(海湾大学计算机与信息学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于文本语义的多模态统一工业异常检测框架,解决跨模态对齐和几何建模不足问题,通过几何感知跨模态映射和对象条件文本特征适配器实现多模态特征对齐,实现跨类别的准确异常检测。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06883 2026-04-28 cs.IR 82%

Structural and Disentangled Adaptation of Large Vision Language Models for Multimodal Recommendation

大型视觉语言模型的结构和解耦适应用于多模态推荐

Zhongtao Rao, Peilin Zhou, Dading Chong, Zhiwei Chen, Shoujin Wang, Nan Tang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出SDA框架,通过跨模态结构对齐和模态解耦适应,解决多模态推荐中表示不一致和梯度冲突问题,实验显示在三个Amazon数据集上提升了推荐性能。

Comments Accepted to SIGIR '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23753 2026-04-28 cs.AI cs.HC cs.LG 79%

Modeling Induced Pleasure through Cognitive Appraisal Prediction via Multimodal Fusion

通过多模态融合进行诱导愉悦的认知评估预测建模

Nastaran Dab, Raziyeh Zall, Mohammadreza Kangavari

机构 * Iran University of Science and Technology(伊朗科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态融合模型,通过认知评估变量预测视频诱导的愉悦,解决标签噪声、语义鸿沟、数据稀缺和解释性不足等问题,实验验证了模型在检测视频诱导愉悦方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23112 2026-04-28 cs.LG 78%

Conditional Imputation for Within-Modality Missingness in Multi-Modal Federated Learning

多模态联邦学习中模态内缺失的条件补全

Wugeng Zheng, Ziwen Kan, Katie Wang, Chen Chen, Song Wang

机构 * University of Central Florida(佛罗里达大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract)

AI总结 本文提出CondI框架,通过条件扩散模型解决多模态联邦学习中的模态内缺失问题,采用两阶段训练流程提升模态特定提取器和联合嵌入空间的性能,实验表明在三个临床数据集上效果与现有方法相当。

Comments Wugeng Zheng and Ziwen Kan contributed equally to this work. Song Wang is the corresponding author. Accepted to FedVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22763 2026-04-28 cs.HC 78%

A learning health system in Neurorehabilitation as a foundation for multimodal patient representation

神经康复中的学习健康系统作为多模态患者表示的基础

Thomas Weikert, Eljas Roellin, Lukas Heumos, Fabian J. Theis, Diego Paez-Granados, Chris Easthope Awai

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出通过整合多模态数据采集、模型计算和临床可视化,构建神经康复中的学习健康系统,以促进临床与机器学习的合作,解决数据碎片化、互操作性差和临床人员参与度低的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12938 2026-04-28 cs.LG physics.ao-ph 78%

Local Off-Grid Weather Forecasting with Multi-Modal Earth Observation Data

本地非网格天气预报与多模态地球观测数据

Qidong Yang, Jonathan Giezendanner, Daniel Salles Civitarese, Johannes Jakubik, Eric Schmitt, Anirban Chandra, Jeremy Vila, Detlef Hohl, Chris Hill, Campbell Watson, Sherrie Wang

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院) Shell Information Technology International Inc.(壳牌信息技术国际公司)

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出一种多模态Transformer模型,通过端到端训练将网格化预报降尺度至非网格位置,提升局部天气预测精度,实验显示其优于多种非数据驱动和数据驱动的非网格预报方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22989 2026-04-28 cs.CV cs.AI 73%

CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging

CheXmix:用于医学影像的统一生成预训练

Ashwin Kumar, Robbie Holland, Corey Barrett, Jangwon Kim, Maya Varma, Zhihong Chen, Yunhe Gao, Greg Zaharchuk, Tara Taghavi, Krishnaram Kenthapadi, Akshay Chaudhari

机构 * Stanford AIMI, Stanford University(斯坦福大学AIMI研究所,斯坦福大学) Oracle Health AI(Oracle健康AI) Department of Radiology, Stanford University(斯坦福大学放射科)

专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 CheXmix通过统一早融合生成方法,在医学影像中实现更精确的联合表征学习,优于现有生成模型,在多个任务上表现突出。

Comments CVPR Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18576 2026-04-28 cs.RO 71%

DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment

DriVerse:通过多模态轨迹提示和运动对齐实现驾驶模拟的导航世界模型

Xiaofan Li, Chenming Wu, Zhao Yang, Zhihao Xu, Dingkang Liang, Yumeng Zhang, Ji Wan, Jun Wang

机构 * Baidu Inc.(百度公司)

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 DriVerse通过多模态轨迹提示和运动对齐技术,实现从单张图像和未来轨迹生成导航驱动的驾驶场景,提升了动态对象的生成精度和时间一致性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27507 2026-04-28 cs.CV 70%

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22903 2026-04-28 cs.CV cs.AI 62%

On the Complementarity of Quantum and Classical Features: Adaptive Hybrid Quantum-Classical Feature Fusion for Breast Cancer Classification

量子与经典特征的互补性:面向乳腺癌分类的自适应混合量子-经典特征融合

Yasmin Rodrigues Sobrinho, João Renato Ribeiro Manesco, João Paulo Papa

机构 * Department of Computing, São Paulo State University(圣保罗州大学计算机系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种混合量子-经典架构,通过双分支特征提取管道融合经典模型和量子电路的互补表示,引入三种特征融合策略提升乳腺癌分类性能。

Comments 41 pages, 16 figures. This manuscript is a preprint under review at Artificial Intelligence in Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22832 2026-04-28 cs.CV cs.AI cs.LG 62%

Intervention-Aware Multiscale Representation Learning from Imaging Phenomics and Perturbation Transcriptomics

基于影像表型和扰动转录组的干预感知多尺度表征学习

Jiayuan Chen, Ruoqi Liu, Zishan Gu, Ping Zhang

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种干预感知蒸馏框架,利用扰动转录组指导图像表征学习,通过基因表达和干预元数据生成化学感知的代码本,提升对未见干预的迁移能力及药物-靶点基因发现。

Comments CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24543 2026-04-28 cs.CV 57%

RACANet: Reliability-Aware Crowd Anchor Network for RGB-T Crowd Counting

RACANet:面向RGB-T人群计数的可靠性感知人群锚网络

Jinghao Shi, Mengqi Lei, Kunliang He, Yun Li, Wei Bao, Siqi Li

机构 * School of Computer Science, China University of Geosciences, Wuhan(中国地质大学(武汉)计算机科学学院) School of Software, Tsinghua University(清华大学软件学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出RACANet,通过两阶段融合框架解决RGB-T人群计数中跨模态融合的可靠性建模问题,引入轻量级预训练和局部锚点融合模块,提升计数精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24380 2026-04-28 cs.CL 57%

Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency

大型视觉语言模型的结构剪枝:对剪枝动态、恢复和数据效率的全面研究

Yiran Huang, Lukas Thede, Massimiliano Mancini, Wenjia Xu, Zeynep Akata

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心,德国) Helmholtz Munich, Germany(海德堡-慕尼黑赫尔姆霍尔茨研究中心,德国) University of Tübingen, Tübingen AI Center, Germany(图宾根大学,图宾根人工智能中心,德国) University of Trento, Italy(特伦托大学,意大利) Beijing University of Posts and Telecommunications, China(北京邮电大学,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文研究了通过结构化剪枝压缩现有大型视觉语言模型的方法,发现宽度剪枝在低资源环境下表现更优,结合监督微调和隐藏状态蒸馏可实现高效恢复,仅需5%的数据即可保持95%性能。

Comments Accepted at International Journal of Computer Vision (IJCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10334 2026-04-28 cs.CV 57%

SIMPLER: H&E-Informed Representation Learning for Structured Illumination Microscopy

SIMPLER: 基于H&E的结构光照明显微镜表示学习

Abu Zahid Bin Aziz, Syed Fahim Ahmed, Gnanesh Rasineni, Mei Wang, Olcaytu Hatipoglu, Marisa Ricci, Malaiyah Shaw, Guang Li, J. Quincy Brown, Valerio Pascucci, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah, Salt Lake City, UT 84112, USA Scientific Computing \& Imaging Institute, University of Utah, Salt Lake City, UT 84112, USA Instapath Inc., Houston, TX 77021 Tulane University, Department of Biomedical Engineering, New Orleans, Louisiana, United States

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SIMPLER框架,利用H&E作为语义锚点学习可重用的SIM表示,通过对抗、对比和重建目标逐步对齐SIM和H&E,提升跨模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23977 2026-04-28 cs.CV 57%

Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification

多视图协同学习与视觉-语言适应用于低资源生物医学图像分类

Xiaoliu Luo, Minxue Xiao, Ting Xie, Mengzhu Wang, Huiqing Qi, Joey Tianyi Zhou, Taiping Zhang, Xu Wang

机构 * Chongqing University of Technology(重庆理工大学) Collge of Computer Science, Sichuan University(四川大学计算机学院) Hebei University of Technology(河北工业大学) Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(新加坡科技研究局前沿人工智能研究中心)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出多视图协同学习框架,通过视觉-语言适应提升低资源下生物医学图像分类性能,采用多粒度对比学习和结构监督增强跨模态对齐与细粒度区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23467 2026-04-28 cs.LG cs.AI cs.AR 57%

Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference

混合JIT-CUDA图优化用于低延迟大语言模型推理

Divakar Kumar Yadav, Tian Zhao

机构 * Department of Computer Science(计算机科学系) University of Wisconsin-Milwaukee(威斯康星大学密尔沃基分校) Milwaukee, WI, USA(美国威斯康星州密尔沃基)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种混合运行时框架,结合JIT编译与CUDA图执行,以降低启动开销并保持自回归解码的运行时灵活性,通过静态组件和动态组件的分离,有效减少短序列LLM推理的延迟和方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23125 2026-04-28 cs.CV cs.LG 57%

Learning from Imperfect Text Guidance: Robust Long-Tail Visual Recognition with High-Noise Label

从不完美文本指导中学习:在高噪声标签下的鲁棒长尾视觉识别

Mengke Li, Haiquan Ling, Yiqun Zhang, Yang Lu, Hui Huang

机构 * CSSE, Shenzhen University(软件学院,深圳大学) SCST, Guangdong University of Technology(软件学院,广东技术大学) INFORMATICS, Xiamen University(信息学院,厦门大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出利用预训练视觉-语言模型的跨模态对齐能力,通过弱教师监督纠正长尾噪声数据中的标签-图像不一致问题,提升模型在高噪声环境下的识别性能。

Comments Accepted by CVM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏