arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-23 至 2026-07-23 共收录 57 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 15 篇

2509.24739 2026-07-23 cs.CV 版本更新 83%

Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation

迈向医学数据的视觉-语言基础模型:越南语PET/CT报告生成的多模态数据集和基准

Huu Tien Nguyen, Dac Thai Nguyen, The Minh Duc Nguyen, Trung Thanh Nguyen, Thao Nguyen Truong, Huy Hieu Pham, Johan Barthelemy, Minh Quan Tran, Thanh Tam Nguyen, Quoc Viet Hung Nguyen, Quynh Anh Chau, Hong Son Mai, Thanh Trung Nguyen, Phi Le Nguyen

机构 * AI4LIFE, Hanoi University of Science and Technology, Vietnam(AI4LIFE,河内科学技术大学,越南) Nagoya University, Japan(名古屋大学,日本) AIST, Japan(日本国家先进工业技术研究院) VinUniversity, Vietnam(文园大学,越南) NVIDIA, USA(NVIDIA,美国) Griffith University, Australia(格里菲斯大学,澳大利亚) Hanoi Medical University, Vietnam(河内医学院,越南) Military Central Hospital, Vietnam(越南108中央军医院)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种面向越南语医学数据的多模态数据集和基准,旨在解决医学影像领域中PET/CT数据不足和低资源语言代表性不足的问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19975 2026-07-23 cs.CV 新提交 79%

Forecasting the Number of Harvest-ready Fruits of Sweet Peppers Using Multimodal Time-Series Data

使用多模态时间序列数据预测甜椒的可收获果实数量

Enrico Pallotta, Mohamed Farag, Esra Guclu, Chris McCool, Ribana Roscher, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) CSIRO(联邦科学与工业研究组织)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对单株甜椒产量预测,提出融合图像特征与计数测量的多模态深度学习框架,利用LSTM网络处理时间依赖性和不规则采样,实验证明该方法能降低RMSE,提供校准不确定性估计,还发布数据集和代码助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20323 2026-07-23 cs.LG physics.comp-ph q-bio.BM 新提交 78%

Multi-modal transformer for signal classification in nanopore blockade experiments

用于纳米孔阻断实验中信号分类的多模态变压器

Sandro Kuppel, Julian Hoßbach, Samuel Tovey, Christian Holm

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 针对纳米孔信号复杂难以分类的问题,引入多模态深度学习架构,联合处理多种信号表示,在42肽基准测试中大幅超越现有方法,转移到20氨基酸数据集也有高准确率,证明机器学习助力纳米孔传感器高精度分子识别的潜力。

Comments 22 pages (incl. references), 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19816 2026-07-23 physics.chem-ph cs.LG physics.comp-ph physics.data-an 新提交 78%

Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data

基于多模态光谱数据的有机结构假设与细化学习

Chengchun Liu, Zhiyuan Yan, Li Yuan, Hao Li, Boxuan Zhao, Yonghong Tian, Bartosz A. Grzybowski, Fanyang Mo

机构 * State Key Laboratory of Advanced Waterproof Materials, School of Materials Science and Engineering, Peking University(先进防水材料国家重点实验室,材料科学与工程学院,北京大学) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(电子与计算机工程学院,北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) IBS Center for Algorithmic and Robotized Synthesis (CARS), UNIST(算法与机器人化合成中心(CARS),UNIST) Department of Chemistry, UNIST(化学系,UNIST) School of Advanced Materials, Peking University Shenzhen Graduate School(先进材料学院,北京大学深圳研究生院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对从光谱数据确定分子结构的难题,提出假设细化范式,构建QM9SPIN数据集,引入SpectroMol和MS - Mol2Mol,集成系统在模拟基准上准确率达93.8%,能适应实验光谱并改进预测,为有机结构解析提供可扩展途径。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20092 2026-07-23 cs.CV cs.AI cs.CL 新提交 67%

ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

ENTRAP-VL:视觉语言模型中双上下文夹带的分类探测器

Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani

机构 * IIIT Delhi(德里信息技术学院) Dr. Ambedkar Institute of Technology(阿姆贝德卡尔技术学院) Heritage Institute of Technology(遗产技术学院) PwC(普华永道)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究视觉语言模型中上下文夹带现象,提出需构建分类结构化双模态工具。引入ENTRAP-VL数据集,含1500个项目,跨八类,分文本和视觉夹带流,提供工具、分类法及评估协议,助力社区严格研究该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04166 2026-07-23 cs.CV cs.CL 版本更新 62%

STEMTOX: From Collaborative Tags to Fine-Grained Toxic Meme Detection via Entropy-Guided Multi-Task Learning

STEMTOX:通过熵引导的多任务学习从社交标签到细粒度有毒迷因检测

Subhankar Swain, Naquee Rizwan, Vishwa Gangadhar S, Nayandeep Deb, Animesh Mukherjee

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出TOXICTAGS数据集及STEMTOX框架,通过熵引导的多任务学习整合社交标签生成与分类,提升多模态内容审核性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20087 2026-07-23 cs.CV 新提交 57%

Development of an automated, reliable, and clinically meaningful artificial intelligence (AI) tool for diagnosing cardiac disease from conventional cardiovascular magnetic resonance (CMR) images

开发一种用于从传统心血管磁共振(CMR)图像中诊断心脏病的自动化、可靠且具有临床意义的人工智能(AI)工具

Sina Amirrajab, Volker Vehof, Michael Bietenbeck, Nuriye Akyol, Redouane Bouras, Khuraman Isgandarova, Alexandru Zlibut, Philipp Stalling, Ali Yilmaz

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在开发用于CMR图像心脏病诊断的AI工具,通过整合开源LLMs和预处理多模态数据,对三种视觉基础模型两阶段微调,在独立测试集上有高诊断性能,集成策略进一步提升准确性和鲁棒性,代码和模型权重公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19772 2026-07-23 cs.CV 新提交 57%

DRGBT-1K: A Large-scale High-quality Benchmark for Dynamic RGBT Tracking

DRGBT-1K:用于动态RGBT跟踪的大规模高质量基准测试

Zhaodong Ding, Chenglong Li, Zeyu Ding, Futian Wang, Jin Tang

机构 * Anhui University(安徽大学) State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电子信息采集与保护技术国家重点实验室) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对现有基准无法有效评估动态RGBT跟踪器在真实场景下鲁棒性的问题,构建DRGBT-1K基准测试,提供全面注释,评估多种跟踪方法,发布未对齐版本及衍生数据集,并开发在线评估平台,为相关研究提供有力支持。

Comments Submitted to TIP (Under Review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19726 2026-07-23 cs.CV 新提交 57%

An Exploratory Analysis of Pain Localization via Explainable Computational Modeling

通过可解释计算建模对疼痛定位进行探索性分析

Ioannis Kyprakis, Stefanos Gkikas, Eric Nichols, Yu Fang, Manolis Tsiknakis

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 针对自动疼痛定位问题,利用AI4Pain 2026挑战数据集,比较经典特征工程与深度序列学习用于独立于受试者的三类疼痛定位,极端随机树表现最佳,发现疼痛检测与定位存在差距,揭示外周自主神经通路解剖扩散性的基本上限。

Comments Accepted at the 14th International Conference on Affective Computing and Intelligent Interaction (ACII 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07643 2026-07-23 cs.CV 版本更新 57%

Universality Reconsidered: Rethinking the Validation of Foundation Models for General-Purpose 3D Medical Segmentation

揭示通用3D医学分割中的模态差异与泛化幻觉

Yichi Zhang, Le Xue, Feiyang Xiao, Wenbo Zhang, Gang Feng, Chenguang Zheng, Yuan Qi, Yuan Cheng, Zixin Hu

机构 * Fudan University, Shanghai, China.(复旦大学) Shanghai Academy of Artificial Intelligence for Science, Shanghai, China.(上海人工智能科学研究院) Shanghai Universal Medical Imaging Diagnostic Center, Shanghai, China.(上海通用医学影像诊断中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文通过UMD数据集揭示3D医学分割中模态差异与泛化幻觉问题,指出现有基础模型在实际应用中存在显著性能差异,需转向多模态训练以提升通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19381 2026-07-23 cs.LG 新提交 50%

Air Quality Arena: A Large-Scale Multi-Region Ground Monitoring Dataset and Benchmark for Air Quality Forecasting with Time-Series Foundation Models

空气质量竞技场:一个大规模多区域地面监测数据集以及基于时间序列基础模型的空气质量预测基准

Rishi Bharadwaj, Manik Gupta, Pandarasamy Arjunan

专题命中 多模态评测 :cross-modal(abstract)

AI总结 研究针对现有空气质量预测基准不足,提出空气质量竞技场(AQA),它是含多国多污染物的数据集及基准。通过在11个模型和基线测试,表明时间序列基础模型是有效零样本预测器,表现最佳的模型采用跨模态架构,AQA已公开发布。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 5 篇

2512.16300 2026-07-23 cs.AI 版本更新 81%

Code-in-the-Loop Forensics: Agentic Tool Use for Image Forgery Detection

循环代码取证:面向图像伪造检测的代理工具使用

Fanrui Zhang, Qiang Zhang, Sizhuo Zhou, Jianwen Sun, Chuanhao Li, Jiaxin Ai, Yukang Feng, Yujie Zhang, Wenjie Li, Zizhen Li, Yifan Chang, Jiawei Liu, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19532 2026-07-23 cs.LG cs.AI 新提交 79%

Trustworthy Privacy-Preserving Multimodal Federated Learning for Personalised Breast Cancer Prediction

用于个性化乳腺癌预测的可信隐私保护多模态联邦学习

Ruth Amey, Muhammad Arifur Rahman, Taha Osman, Nicholas Shopland, Andy Burton, Mufti Mahmud, David J. Brown

机构 * NTU(南洋理工大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究探讨联邦学习能否兼顾四个关键支柱,支持乳腺癌患者肿瘤进展预测模型开发。通过多模态数据评估联邦学习框架,与集中式模型比较性能,并研究相关策略,结果助于理解隐私保护多模态预测建模可行性及支持未来应用。

Comments 26 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19568 2026-07-23 eess.SY cs.SY 新提交 78%

From P&ID Drawings to Process Graphs: A Multimodal Language Model Approach

从管道和仪表图到过程图:一种多模态语言模型方法

Baikai Zhu, Samuel Duong, Javal Vyas, Mehmet Mercangöz

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 研究针对P&IDs数字化难题,提出基于多模态大语言模型的两阶段工作流程,将其数字化重定义为设备标签提取与拓扑推理,经案例研究评估,该方法比端到端数字化更优,凸显知识引导工作流程在P&ID数字化中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19947 2026-07-23 cs.CV 新提交 74%

ETPDesigner: Multi-Agent Orchestration for Interactive Multimodal Electronic Theater Program

ETPDesigner:用于交互式多模态电子剧院节目的多智能体编排

Mengtian Li, Xinru Guo, Xiaoru Lin, Xiao Rong, Zhifeng Xie, Chaofeng Chen

机构 * Shanghai University(上海大学) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) Institute for Math and AI, Wuhan School of Artificial Intelligence, Wuhan University(武汉大学数学与人工智能研究院武汉人工智能学院)

专题命中 多模态Agent :multimodal(title);分类 cs.CV

AI总结 研究针对电子剧院节目设计难题,提出ETPDesigner多智能体框架,能从戏剧脚本合成高质量ETP,通过全局风格锚定机制保证一致性,还实现交互功能,经ETP-Pro基准测试验证了方法在多方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20124 2026-07-23 cs.LG cs.MA 新提交 50%

Autonomous Collaborative Learning Among an Ensemble of Tsetlin Machines with Consensus-Based Inference

基于共识推理的Tsetlin机集成中的自主协作学习

Yehuda Rudin, Osnat Keren, Michal Yemini, Alexander Fish

机构 * Faculty of Engineering, Bar Ilan University(巴伊兰大学工程学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文针对分布式和去中心化TM学习关注不足的问题,提出基于共识推理的Tsetlin机集成去中心化协作学习范式,各智能体维护私有模型,不交换原始数据,实验表明该范式下分类准确率与集中式模型相当,促进了信息集成融合。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 8 篇

2607.20357 2026-07-23 cs.CV 新提交 83%

Look Less, Think Faster: Joint Token-Compute Adaptation for Multimodal LLMs

少看,快思考:多模态大语言模型的联合令牌-计算适配

Pengcheng Wang, Zhiquan Wang, Jayoung Lee, Zhuoyan Xu, Ran Xu, Saurabh Bagchi, Yin Li, Somali Chaterji

机构 * Purdue University(普渡大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(英伟达)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 针对多模态大语言模型推理成本高的问题,提出SmartVL框架,通过视觉侧令牌控制器和LLM侧计算控制器联合控制视觉令牌数量和模型计算能力,实验证明该框架优于先前方法,实现更好的精度-效率平衡。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19600 2026-07-23 stat.ME cs.CV cs.LG q-bio.QM stat.ML 新提交 79%

Deep Shape Regression for Planar Curves with Multimodal Covariates

具有多模态协变量的平面曲线深度形状回归

Manuel Pfeuffer, Roshan Prakash Rane, Hadya Yassin, Kerstin Ritter, Sonja Greven

机构 * Humboldt-Universität zu Berlin, Berlin, Germany(柏林洪堡大学) Hertie Institute for AI in Brain Health, Universität Tübingen, Tübingen, Germany(人工智能与脑健康赫特研究所) Universität Tübingen, Tübingen, Germany(图宾根大学) Hasso Plattner Institut, Universität Potsdam, Potsdam, Germany(哈索·普拉特纳研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对平面曲线提出深度形状回归模型,允许多模态高维协变量。用复值函数表示曲线,提出含模态特定编码器的协方差平滑器,模型具多种不变性,还提供弹性均值估计算法,经模拟和实际应用验证了方法有效性。

Comments 17 pages, 4 figures, 1 algorithm. Submitted to the ShapeMI Workshop, MICCAI 2026. Code is available at https://github.com/mpff/dnn-shapes

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02533 2026-07-23 cs.RO cs.LG 78%

HMVLA: Hyperbolic Multimodal Fusion for Vision-Language-Action Models

HMVLA:超几何多模态融合用于视觉-语言-动作模型

Kun Wang, Xiao Feng, Mingcheng Qu, Tonghua Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chongqing Research Institute of HIT(重庆HIT研究 institute) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 HMVLA通过在双曲空间中融合视觉、语言和动作信息,提升多模态语义对齐的效率和准确性。

Comments 5 pages,5 figures,ICASSP

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21863 2026-07-23 cs.CV 版本更新 70%

Prompt-Calibrated SAM 3 for Open-Vocabulary Remote Sensing Semantic Segmentation

Prompt-Calibrated SAM 3 用于开放词汇遥感语义分割

Yanghui Song, Nanqing Liu, Haonan Yin, Yingjie Gao, Chengfu Yang, Qi Ming

机构 * School of Information Science and Technology, Yunnan Normal University(云南师范大学信息科学与技术学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) College of Computer Science, Beijing University of Technology(北京工业大学计算机学院)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出ProC-SAM3方法,通过离线提示池、缓存文本嵌入和存在引导残差融合,解决开放词汇遥感语义分割中提示语义覆盖不足、冗余编码和噪声传播问题,在8个基准上平均mIoU达56.1%。

Comments 5 pages, 5 figures. Accepted for publication in IEEE Geoscience and Remote Sensing Letters (GRSL)

Journal ref IEEE Geoscience and Remote Sensing Letters, vol. 23, 2026, Art. no. 3713378

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 57%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 多模态训练与对齐 :image-text(abstract);分类 cs.CV

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19879 2026-07-23 cs.CV 新提交 57%

Current Injection Spiking Neural Network for Infrared and Visible Image Fusion

用于红外与可见光图像融合的电流注入脉冲神经网络

Rui Zhao, Zhuoyuan Li, Wenrui Li, Yanchen Dong, Yajing Zheng, Giuseppe Valenzise, Weisi Lin

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 研究红外与可见光图像融合问题,提出CIS - Fuse脉冲网络,通过电流注入脉冲算子在膜电位水平实现跨模态融合,构建双向跨模态融合模块并部署在双分支架构上,实验表明其融合质量与基于ANN的方法相当且更节能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17330 2026-07-23 cs.LG cs.AI 版本更新 57%

SubQuad: Near-Quadratic-Free Structure Inference with Distribution-Balanced Objectives in Adaptive Receptor framework

SubQuad:在自适应受体框架中利用分布平衡目标的近二次自由结构推断

Rong Fu, Zijian Zhang, Kun Liu, Jiekai Wu, Xianda Li, Simon Fong

机构 * University of Macau(澳门大学) University of Pennsylvania(宾夕法尼亚大学) University of Southampton(南安普顿大学) Juntendo University(顺天堂大学) University of Bologna(博洛尼亚大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 SubQuad通过结合抗原感知的近子二次检索、GPU加速的亲和力核、学习多模态融合和公平性约束聚类,解决大规模群体适应性免疫谱分析中的二次成本和数据不平衡问题,提升效率与公平性。

Comments 27 pages, 9 figures. In the previous version, Juntendo University was erroneously listed as the affiliation; we must clarify that this paper has absolutely no relation to Juntendo University. Therefore, we have replaced this affiliation in the new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00972 2026-07-23 cs.CV 版本更新 57%

SemICP: Semantic Non-Rigid Point Cloud Registration with Elastic Energy Regularization

SemICP:基于弹性能量正则化的语义非刚性点云配准

Wanwen Chen, Qi Zeng, Carson Studders, Zongze Li, Jamie J. Y. Kwon, Tara Kemper, Emily H. T. Pang, Eitan Prisman, Septimiu E. Salcudean

机构 * Department of Electrical and Computer Engineering, University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学) Faculty of Medicine, University of British Columbia(医学院,不列颠哥伦比亚大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对计算机辅助干预中点云配准问题,提出SemICP框架,结合语义信息点匹配与变形正则化,经多数据集测试,相比其他方法降低多种距离误差,结合AI分割后为多模态配准提供有效管道。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他多模态 3 篇

2607.19597 2026-07-23 astro-ph.SR astro-ph.IM cs.LG 新提交 50%

A Deep Learning Framework for Predicting Solar EUV Irradiance During Significant Flares

一种用于预测重大耀斑期间太阳极紫外辐射的深度学习框架

Sathvik Soman, Jason T. L. Wang, Haimin Wang, Haodi Jiang

机构 * Sam Houston State University(萨姆休斯顿州立大学)

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究提出FlareEUV框架,利用NASA的SDO多仪器观测,通过轻量级基于注意力的架构从原始成像数据学习磁结构与日冕发射关系,用于预测重大太阳耀斑期间连续三天6.5纳米处每日EUV辐照度,实验证明其性能优于基线方法。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06636 2026-07-23 cs.RO 50%

Design, Control, and Motion Strategy for DELTA: Transformable Multilink Multirotor for Air-Ground Hybrid Locomotion and Manipulation

DELTA:可变形多连杆多旋翼飞行器的设计、控制与运动策略——用于空地混合运动与操作

Kazuki Sugihara, Moju Zhao, Takuzumi Nishio, Kei Okada, Masayuki Inaba

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种新型多连杆多旋翼机器人DELTA,通过在每个连杆上安装推进器并利用关节驱动,实现了地面滚动、空中飞行及多种环境下的操作能力,并设计了基于非线性优化的实时控制方法和考虑接触约束的运动策略。

Comments 20 pages, 31 figures

Journal ref IEEE Transactions on Robotics, vol. 42, pp. 2765-2785, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.00108 2026-07-23 q-bio.QM cs.LG stat.ML 50%

Deep Learning in Mining Biological Data

深度学习在挖掘生物数据中的应用

Mufti Mahmud, M Shamim Kaiser, Amir Hussain

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文探讨深度学习在生物数据挖掘中的应用,涵盖其在序列、图像和信号数据中的应用、数据来源、工具比较及未来研究方向。

Comments 36 pages, 8 figures, and 6 tables

Journal ref Cogn Comput 13, 1-33 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏