arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-23 至 2026-07-23 共收录 39 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2607.20284 2026-07-23 cs.CV 新提交 79%

Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?

用于遥感图像理解的多模态大语言模型:领域特定还是通用?

Qiwei Ma, Chunping Qiu, Xinjun Cheng, Xiaoyu Zhang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) Yuelushan Center for Industrial Innovation(岳麓山工业创新中心)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文针对遥感图像理解的多模态大语言模型展开研究,通过系统调查和评估,比较其与通用模型在不同任务上的表现,发现当前模型存在局限,进而给出未来方向,为开发相关模型提供系统参考。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20274 2026-07-23 cs.CV cs.AI cs.CL cs.LG 新提交 67%

Self-supervision drives representational convergence in medical foundation models more than clinical supervision

自我监督比临床监督更能推动医学基础模型中的表征趋同

Soroosh Tayebi Arasteh, Sebastian Ziegelmayer, Mahshad Lotfinia, Lisa Adams, Sven Nebelung, Jakob Nikolas Kather, Daniel Truhn

机构 * RWTH Aachen University(亚琛工业大学) University Hospital RWTH Aachen(亚琛工业大学附属医院) Technical University of Munich(慕尼黑工业大学) Friedrich-Alexander-Universität Erlangen-Nürnberg(埃尔朗根-纽伦堡弗里德里希-亚历山大大学) Technical University Dresden(德累斯顿工业大学) University Hospital Dresden(德累斯顿大学附属医院) University Hospital Heidelberg(海德堡大学附属医院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究探讨医学基础模型中表征趋同问题,通过对多个编码器剖析发现自我监督比临床监督更能驱动收敛,虽收敛有限但线性分类器可跨编码器转移,表明医学成像收敛由预训练目标决定,为互操作性设计与验证提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2607.19636 2026-07-23 eess.AS 新提交 79%

Multimodal Speaker Verification as a Threat to Speaker Anonymization

多模态说话人验证对说话人匿名化的威胁

Ashi Garg, Cristina Aggazzotti, Leibny Paola García-Perera, Nicholas Andrews

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 研究多话语、多模态环境下的说话人验证,通过对多个匿名话语的音频、韵律和语言信息进行聚合,比较不同聚合策略,发现多模态系统性能更优,帧级聚合EER最低,即便少量匿名话语结合音频和文本也能显著降低EER。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19352 2026-07-23 cs.HC cs.CY cs.MM cs.SD 新提交 57%

Validating the Single Item Kawaii Measure

验证单项卡哇伊度量

Katie Seaborn, Yijia Wang

机构 * University of Cambridge(剑桥大学) Institute of Science(科学研究院) Tokyo Institute of Technology(东京技术大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM

AI总结 研究测量用户对卡哇伊感知的问题,通过九个数据集对单项度量进行收敛、已知群体和跨情境效度及信度检验,证明了其在声音和视觉卡哇伊感知方面效度的初步证据,并指出可进一步提高严谨性。

Comments Accepted at CUI '26 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19434 2026-07-23 cs.SD 新提交 50%

CAPS: A Cascaded Reconstruction Model to Power Saving in Hearables Using Sub-Nyquist Sampling with Bandwidth Extension

CAPS:一种使用带带宽扩展的亚奈奎斯特采样实现可穿戴设备节能的级联重建模型

Tarikul Islam Tamiti, Sajid Fardin Dipto, Luke Baja-Ricketts, David Vergano, Anomadarshi Barua

机构 * George Mason University(乔治梅森大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究可穿戴设备中联合降低ADC采样比特分辨率和频率对功耗及音频质量的影响,提出CAPS模型,采用亚奈奎斯特采样和低比特分辨率,降低功耗3.3倍,支持移动平台流操作,确保语音清晰度,平衡效率与节能。

Comments arXiv admin note: substantial text overlap with arXiv:2506.22321

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2607.19528 2026-07-23 cs.CV cs.AI 新提交 79%

D3VL: Understanding Driving Scenes from 3D Time Series Data and Video with Language Models

D3VL:利用语言模型从3D时间序列数据和视频中理解驾驶场景

Heesang Han, A. Lynn Abbott, Abhijit Sarkar

机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学布拉德利电气与计算机工程系) Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) Sanghani Center for Artificial Intelligence and Data Analytics(桑哈尼人工智能与数据分析中心)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对自动驾驶中多模态大语言模型,提出D3VL框架,整合2D和3D时间序列数据,回答交通场景相关问题,在KITTI问答数据集上性能提升11%,并引入Waymo QA数据集扩展以评估模型在多样驾驶条件下处理3D和时间序列数据的能力。

Comments Accepted to IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19547 2026-07-23 cs.CV eess.IV 新提交 57%

ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

ChronoStitch:用于长时程时间推理的视觉键值记忆的免训练组合

Santiram Tiwari, Nishant Sinha, Kunal Kislay

机构 * KGraph AI Solutions Pvt. Ltd.(KGraph人工智能解决方案私人有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对长视频问答中视觉KV记忆组合问题,ChronoStitch提出免训练方法,先将键值重基于全局坐标系,解决几何不一致问题,再处理残余内容差距,通过选择性重新计算部分视觉令牌,提升事件排序准确性且运行速度更快。

Comments 6 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19827 2026-07-23 cs.RO cs.CY 新提交 50%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2607.20358 2026-07-23 cs.ET cs.AR 新提交 78%

PolySim: Deterministic Polynomial Surrogates for Cross-Modal Retrieval on CiM

PolySim:用于CiM上跨模态检索的确定性多项式代理

Xinzhao Li, Charles Power, Pengyu Ren, Jongun Won, Likai Pei, Yuting Hu, Jinjun Xiong, Alptekin Vardar, Ningyuan Cao, Xiaobo Sharon Hu, Thomas Kämpfe, Kai Ni, Ruiyang Qin

专题命中 跨模态检索 :cross-modal(title,abstract)

AI总结 研究边缘设备跨模态检索在CiM硬件部署问题,提出PolySim框架,将概率检索转为确定性管道,用低阶多项式基近似高斯嵌入维度,经实验其提升R@1,减少推理计算,是首个在CiM硬件实现概率跨模态检索的方法。

Comments Accepted by ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20291 2026-07-23 cs.CV 新提交 77%

Diverse-Intent Multi-Turn Fashion Image Retrieval

多样化意图的多轮时尚图像检索

Mingqiang Tang, Haokun Wen, Meng Liu, Yupeng Hu, Weili Guan, Xuemeng Song

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 研究现实世界时尚多轮图像检索问题,提出FashionAM框架直接对齐多模态对话查询与时尚图库嵌入空间,避免文本化,引入DIM-Fashion数据集,实验证明该框架优于现有方法,数据集和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20238 2026-07-23 cs.CV 新提交 57%

Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training

并非所有补丁都一样:可见-红外预训练中的采样很重要

Qiwei Ma, Bin Deng, Junjie Zhu, Qiangjuan Huang, Puhong Duan, Ke Yang, Xudong Kang, Shutao Li

机构 * Yuelushan Center for Industrial Innovation(岳麓山工业创新中心) Intelligent Game and Decision Lab(智能游戏与决策实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对可见-红外预训练,提出重要性感知采样(IAS)方法,通过从红外结构线索导出权重、学习重要性掩码及采用补丁课程学习策略调整训练重点,在多个VIS-IR基准实验中比基线有改进。

Comments 13 pages, 11 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19830 2026-07-23 cs.CL 新提交 57%

VizRAG: Enhancing Retrieval-Augmented Generation with Hypergraph Visualization

VizRAG:通过超图可视化增强检索增强生成

Yanbin Wei, Yang Chen, Renling Gan, Ziru Liu, Xinyu Fu, Chun Kang, Ning Lu, Rui Liu, Yu Zhang, James Kwok

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究院) Beihang University(北京航空航天大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 研究旨在增强检索增强生成,核心方法是通过视觉线索将超图感知整合到RAG系统中,引入VizRAG支持视觉超图结构感知,实验证明该方法显著优于基线,验证了超图可视化用于RAG系统的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2607.20057 2026-07-23 q-bio.BM cs.LG 新提交 85%

Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

用于功能性抗体设计的抗原特异性抗体多模态基础模型

Xiaoliang Shi, Zichen Wang, Runze Ma, Zhongyue Zhang, Shuangjia Zheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)

AI总结 该研究针对抗原特异性抗体设计难题,引入AAMFM多模态基础模型,通过跨模态适配器整合抗原信息,用校准直接偏好优化微调,实现抗体 - 抗原相互作用联合建模,实验证明其在功能性抗体设计中性能最优,有抗原特异性抗体工程潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19886 2026-07-23 cs.CV 新提交 79%

MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation

MTVDiff:用于增强热红外到可见光面部翻译的多模态条件潜扩散

Zhiyuan Xia, Haojie Li, Jingyu Lin, Yiguo Qiao, Cunjian Chen

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(新一代人工智能技术及其交叉应用重点实验室(东南大学)) Monash University(莫纳什大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对热红外到可见光面部翻译的挑战,提出MTVDiff框架,通过双分支交叉注意力融合等三个核心技术,整合深度和文本信息,在多指标上优于现有方法,提升图像质量和面部验证性能,推动跨光谱面部图像翻译发展。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20197 2026-07-23 cs.CV 新提交 70%

RS-RIE-Bench: Benchmarking Reasoning-Guided Remote Sensing Image Editing

RS-RIE-Bench:推理引导的遥感图像编辑基准测试

Zihan Qin, Boao Xu, Zhao Dong, Yingping Sun, Ziheng Jiao, Junying Wang, Hongwei Wang

机构 * Huawei(华为)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20159 2026-07-23 cs.CV 新提交 57%

SHFormer: Dynamic Spectral Filtering Convolutional Neural Network and High-pass Kernel Generation Transformer for Adaptive MRI Reconstruction

SHFormer:用于自适应MRI重建的动态频谱滤波卷积神经网络和高通内核生成变压器

Sriprabha Ramanarayanan, Rahul G. S., Mohammad Al Fahim, Keerthi Ram, Ramesh Venkatesan, Mohanasankar Sivaprakasam

机构 * Indian Institute of Technology Madras (IITM)(印度理工学院马德拉斯分校) Healthcare Technology Innovation Centre(医疗技术创新中心) GE John F Welch Technology Center(通用电气约翰·F·韦尔奇技术中心)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对基于注意力机制的MRI重建模型在高频表示和多模态数据处理上的不足,提出含频谱滤波CNN和动态高通内核生成变压器的网络进行可扩展MRI重建,在未见场景下有良好重建效果,提升了PSNR和SSIM。

Comments Published in Neural Networks (Elsevier), Vol. 187, Article 107334, July 2025. DOI: 10.1016/j.neunet.2025.107334

Journal ref Neural Networks, Vol. 187, Article 107334, July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19986 2026-07-23 cs.CV 新提交 57%

STEREOFLOW: Progressive Stereo Matching with StereoDiT and Transition Flow Matching

STEREOFLOW:基于StereoDiT和过渡流匹配的渐进式立体匹配

Hao Wang, Haoran Geng, Xiaotong Yang, Jing Tang, Songlin Wei, Linlong Lang, Yeying Jin, Zheng Zhu, Zhaoxin Fan, Biao Leng

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Google(谷歌公司) State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Tencent(腾讯公司) GigaAI(未知(可能是公司或组织,由于未找到确切对应中文名,按原文保留))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究针对立体匹配问题,提出先验引导的生成框架StereoFlow,通过两阶段渐进级联匹配网络、像素扩散变压器StereoDiT和过渡流匹配实现高效优化,在多基准测试中取得多个最新结果,提升了立体匹配效果。

Comments 10 pages, 6 figures, submitted to TVCG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19767 2026-07-23 cs.AI 新提交 57%

Symbol and Footprint Database for Electronic Components by Agentic Recognition and Generation

基于智能识别与生成的电子元件符号与引脚封装数据库

Yichen Shi, Yuzhi Liu, Zhuofu Tao, Li Huang, Yuhao Gao, Ting-Jung Lin, Lei Hel

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学) Shanghai Jiao Tong University(上海交通大学) BTD Technology(BTD科技)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究利用多模态大语言模型开发电子元件符号和引脚封装智能识别与生成流程SFgen,其符号生成准确率86%,引脚封装生成准确率80%,并用此创建含1000个元件的SFnet数据库,为PCB设计自动生成奠定基础。

Comments Accepted by PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19624 2026-07-23 cs.CV 新提交 57%

Pathologist Attention-Aligned Report Generation for Prostate Histopathology

用于前列腺组织病理学的病理学家注意力对齐报告生成

Ruoyu Xue, Suryakant Singh, Souradeep Chakraborty, Pierre Marza, Oksana Yaskiv, Constantin Friedman, Natallia Sheuka, Paul Friedman, Bharat Ramlal, Beatrice Knudsen, Rajarsi Gupta, Joel Saltz, Prateek Prasanna, Gregory Zelinsky, Dimitris Samaras

机构 * Department of Computer Science, Stony Brook University(纽约州立大学石溪分校计算机科学系) Department of Biomedical Informatics, Stony Brook University(纽约州立大学石溪分校生物医学信息学系) Université Paris-Saclay, CentraleSupélec, Gustave Roussy, INSERM, IHU PRISM, Cancer Data Science Unit(巴黎萨克雷大学、中央理工高等电力学院、古斯塔夫·鲁西研究所、法国国家健康与医学研究院、PRISM综合大学医院、癌症数据科学单元) Université Paris-Saclay, CentraleSupélec, MICS Laboratory(巴黎萨克雷大学、中央理工高等电力学院、MICS实验室) Department of Pathology and Laboratory Medicine, Northwell Health Laboratories(诺斯韦尔健康实验室病理与检验医学部) Department of Pathology, University of Utah School of Medicine(犹他大学医学院病理系) Department of Psychology, Stony Brook University(纽约州立大学石溪分校心理学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究将人类注意力引入前列腺病理报告生成模型训练,收集多模态数据集,通过注意力对齐损失微调模型,在两个模型上评估,在报告生成和视觉问答任务中取得较好效果,模型注意力图与病理学家注意力更对齐。

Comments 11 pages, 4 figures, accepted for publication at the 29th International Conference on Medical Image Computing and Computer-Assisted Intervention (MICCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 11 篇

2607.19857 2026-07-23 cs.CV cs.AI 新提交 84%

Memory-Augmented Multimodal Large Language Models for Small Object Understanding in Streaming Aerial Videos

用于流式航空视频中小目标理解的内存增强多模态大语言模型

Penglei Sun, Yehua Huang, Zhuoli Tao, Xiang Li, Runwei Guan, Yaoxian Song, Kaiyong Zhao, Henghui Ding, Bo Han, Yang Yang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Freiburg(弗莱堡大学) Hangzhou City University(杭州城市大学) XGRIDS(XGRIDS公司) Fudan University(复旦大学) Hong Kong Baptist University(香港浸会大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究针对流式航空视频中小目标理解难题,提出像素级开放词汇数据集DroneEyes,以及含语义感知令牌路由器和分层内存库的多模态大语言模型SkyAnchor,从数据和方法角度应对挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19793 2026-07-23 cs.AI cs.CV 新提交 84%

Silent Failures in Multimodal Agentic Search:A Diagnostic Taxonomy and Cross-Judge Evaluation

多模态智能体搜索中的无声故障:一种诊断分类法与跨评判者评估

Zhengxian Wu, Junjie Gao, Kai Yang

机构 * Ant Group(蚂蚁集团)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态智能体搜索中无声故障这一隐藏可靠性问题,引入六类分类法,构建轨迹级诊断管道,通过实验表明表面准确性高估真实正确性,且无声故障与能力相关、常转移。

Journal ref SIGIR 2026 SynthIR Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19910 2026-07-23 cs.CV cs.HC 新提交 83%

MV-Bench: Benchmarking Multimodal Large Language Models for Coordinated Multi-View Interface Construction

MV-Bench:用于协同多视图界面构建的多模态大语言模型基准测试

Yue Zhao, Hongxu Liu, Feiyu Wang, Xiaoyu Yang, Tong Ge, Zhen Yang, Chao Wang, Qiong Zeng

机构 * Shandong Second Medical University(山东第二医科大学) Shandong University(山东大学) Bairong Inc.(百融云创科技股份有限公司) Ke Holdings Inc.(贝壳控股有限公司) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Shandong Provincial Key Laboratory of Computing-Network Integration, Shandong University(山东大学计算网络融合技术山东省重点实验室)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在协同多视图界面构建评估不足的问题,引入MV-Bench基准,通过多阶段管道转换规范为界面,评估五个模型,发现当前MLLMs虽能再现视觉外观,但在数据语义和交互逻辑生成上有限,迭代改进效果不佳。

Comments Submitted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19975 2026-07-23 cs.CV 新提交 79%

Forecasting the Number of Harvest-ready Fruits of Sweet Peppers Using Multimodal Time-Series Data

使用多模态时间序列数据预测甜椒的可收获果实数量

Enrico Pallotta, Mohamed Farag, Esra Guclu, Chris McCool, Ribana Roscher, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) CSIRO(联邦科学与工业研究组织)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对单株甜椒产量预测,提出融合图像特征与计数测量的多模态深度学习框架,利用LSTM网络处理时间依赖性和不规则采样,实验证明该方法能降低RMSE,提供校准不确定性估计,还发布数据集和代码助力相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20323 2026-07-23 cs.LG physics.comp-ph q-bio.BM 新提交 78%

Multi-modal transformer for signal classification in nanopore blockade experiments

用于纳米孔阻断实验中信号分类的多模态变压器

Sandro Kuppel, Julian Hoßbach, Samuel Tovey, Christian Holm

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 针对纳米孔信号复杂难以分类的问题,引入多模态深度学习架构,联合处理多种信号表示,在42肽基准测试中大幅超越现有方法,转移到20氨基酸数据集也有高准确率,证明机器学习助力纳米孔传感器高精度分子识别的潜力。

Comments 22 pages (incl. references), 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19816 2026-07-23 physics.chem-ph cs.LG physics.comp-ph physics.data-an 新提交 78%

Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data

基于多模态光谱数据的有机结构假设与细化学习

Chengchun Liu, Zhiyuan Yan, Li Yuan, Hao Li, Boxuan Zhao, Yonghong Tian, Bartosz A. Grzybowski, Fanyang Mo

机构 * State Key Laboratory of Advanced Waterproof Materials, School of Materials Science and Engineering, Peking University(先进防水材料国家重点实验室,材料科学与工程学院,北京大学) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(电子与计算机工程学院,北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) IBS Center for Algorithmic and Robotized Synthesis (CARS), UNIST(算法与机器人化合成中心(CARS),UNIST) Department of Chemistry, UNIST(化学系,UNIST) School of Advanced Materials, Peking University Shenzhen Graduate School(先进材料学院,北京大学深圳研究生院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对从光谱数据确定分子结构的难题,提出假设细化范式,构建QM9SPIN数据集,引入SpectroMol和MS - Mol2Mol,集成系统在模拟基准上准确率达93.8%,能适应实验光谱并改进预测,为有机结构解析提供可扩展途径。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20092 2026-07-23 cs.CV cs.AI cs.CL 新提交 67%

ENTRAP-VL: A Taxonomic Probe for Dual Contextual Entrainment in Vision-Language Models

ENTRAP-VL:视觉语言模型中双上下文夹带的分类探测器

Karan Goyal, Afreen Hossain, Debojyoti Das, Vishal Bhutani

机构 * IIIT Delhi(德里信息技术学院) Dr. Ambedkar Institute of Technology(阿姆贝德卡尔技术学院) Heritage Institute of Technology(遗产技术学院) PwC(普华永道)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究视觉语言模型中上下文夹带现象,提出需构建分类结构化双模态工具。引入ENTRAP-VL数据集,含1500个项目,跨八类,分文本和视觉夹带流,提供工具、分类法及评估协议,助力社区严格研究该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20087 2026-07-23 cs.CV 新提交 57%

Development of an automated, reliable, and clinically meaningful artificial intelligence (AI) tool for diagnosing cardiac disease from conventional cardiovascular magnetic resonance (CMR) images

开发一种用于从传统心血管磁共振(CMR)图像中诊断心脏病的自动化、可靠且具有临床意义的人工智能(AI)工具

Sina Amirrajab, Volker Vehof, Michael Bietenbeck, Nuriye Akyol, Redouane Bouras, Khuraman Isgandarova, Alexandru Zlibut, Philipp Stalling, Ali Yilmaz

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在开发用于CMR图像心脏病诊断的AI工具,通过整合开源LLMs和预处理多模态数据,对三种视觉基础模型两阶段微调,在独立测试集上有高诊断性能,集成策略进一步提升准确性和鲁棒性,代码和模型权重公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19772 2026-07-23 cs.CV 新提交 57%

DRGBT-1K: A Large-scale High-quality Benchmark for Dynamic RGBT Tracking

DRGBT-1K:用于动态RGBT跟踪的大规模高质量基准测试

Zhaodong Ding, Chenglong Li, Zeyu Ding, Futian Wang, Jin Tang

机构 * Anhui University(安徽大学) State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电子信息采集与保护技术国家重点实验室) Anhui Provincial Key Laboratory of Security Artificial Intelligence(安徽省安全人工智能重点实验室) Anhui Provincial Key Laboratory of Multimodal Cognitive Computation(安徽省多模态认知计算重点实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对现有基准无法有效评估动态RGBT跟踪器在真实场景下鲁棒性的问题,构建DRGBT-1K基准测试,提供全面注释,评估多种跟踪方法,发布未对齐版本及衍生数据集,并开发在线评估平台,为相关研究提供有力支持。

Comments Submitted to TIP (Under Review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19726 2026-07-23 cs.CV 新提交 57%

An Exploratory Analysis of Pain Localization via Explainable Computational Modeling

通过可解释计算建模对疼痛定位进行探索性分析

Ioannis Kyprakis, Stefanos Gkikas, Eric Nichols, Yu Fang, Manolis Tsiknakis

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 针对自动疼痛定位问题,利用AI4Pain 2026挑战数据集,比较经典特征工程与深度序列学习用于独立于受试者的三类疼痛定位,极端随机树表现最佳,发现疼痛检测与定位存在差距,揭示外周自主神经通路解剖扩散性的基本上限。

Comments Accepted at the 14th International Conference on Affective Computing and Intelligent Interaction (ACII 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19381 2026-07-23 cs.LG 新提交 50%

Air Quality Arena: A Large-Scale Multi-Region Ground Monitoring Dataset and Benchmark for Air Quality Forecasting with Time-Series Foundation Models

空气质量竞技场:一个大规模多区域地面监测数据集以及基于时间序列基础模型的空气质量预测基准

Rishi Bharadwaj, Manik Gupta, Pandarasamy Arjunan

专题命中 多模态评测 :cross-modal(abstract)

AI总结 研究针对现有空气质量预测基准不足,提出空气质量竞技场(AQA),它是含多国多污染物的数据集及基准。通过在11个模型和基线测试,表明时间序列基础模型是有效零样本预测器,表现最佳的模型采用跨模态架构,AQA已公开发布。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏