arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 600 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 600 篇

2606.14562 2026-06-15 cs.CV cs.LG 新提交 79%

NEST3D: A High-Resolution Multimodal Dataset of Sociable Weaver Tree Nests

NEST3D:织布鸟树巢的高分辨率多模态数据集

Constanza A. Molina Catricheo, Simon Boeder, Ting-Jia Guo, Giacomo May, Clément Berthelot, Devis Tuia, Friedrich Fedor Reinhard, Fabio Remondino, Benjamin Risse

机构 * Institute for Geoinformatics (ifgi), University of Münster(明斯特大学地理信息学研究所) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所) University of Konstanz(康斯坦茨大学) Kuzikus Research Station(库兹库斯研究站) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对织布鸟巢缺乏精细3D结构数据的问题,提出包含104棵巢树、1.4TB多模态无人机数据集,并基准测试语义分割方法,PT-v3达86.35% mIoU。

Comments 14 pages, 4 figures. Dataset available at https://huggingface.co/NEST3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12419 2026-06-12 cs.CY cs.AI 新提交 79%

GeoDial: A Multimodal Conversational Tutoring Dataset for Geometry Problem-Solving with Visual Tutor Turns

GeoDial:面向几何问题求解的多模态对话式辅导数据集,包含可视化辅导轮次

Sankalan Pal Chowdhury, Junling Wang, Donya Rooein, April Yi Wang, Mrinmaya Sachan

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(苏黎世联邦理工学院人工智能中心) Bocconi University(博科尼大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出GeoDial数据集,包含1300+几何师生对话,通过可扩展标注协议整合对话行为、视觉高亮和反馈,微调视觉语言模型发现其难以生成准确图解高亮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11563 2026-06-11 cs.CV cs.RO 新提交 79%

Cross-Modal Benchmarking for Robotic Perception in Natural Environments

自然环境中机器人感知的跨模态基准测试

David Hall, Joshua Knights, Mark Cox, Peyman Moghadam

机构 * CSIRO Robotics, CSIRO, Australia(CSIRO机器人研究所,CSIRO,澳大利亚) University of Sydney (USyd), Australia(悉尼大学(USyd),澳大利亚) Queensland University of Technology (QUT), Australia(昆士兰理工大学(QUT),澳大利亚)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对自然环境中机器人感知的挑战,提出WildCross跨模态基准,用于大规模自然场景下的地点识别和度量深度估计,并扩展了度量深度估计实验。

Comments Accepted to the IEEE ICRA Workshop on Open Challenges for Rigorous Robot Perception 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10790 2026-06-10 cs.CV 新提交 79%

A Multimodal RGB and Events Dataset for Hand Detection in First-Person View

第一人称视角下用于手部检测的多模态RGB和事件数据集

Bharghav Kota, Yulia Sandamirskaya

机构 * Zurich University of Applied Sciences(苏黎世应用科技大学)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 针对移动机器人系统中传统相机在暗光下运动模糊的问题,提出利用事件相机与RGB相机结合的多模态手部检测方法,并通过合成事件数据集实现与现有方法相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09882 2026-06-10 cs.CV cs.LG 新提交 79%

WHU-Infra3D: A Full-stack Multi-modal Dataset and Benchmark for 3D Roadside Infrastructure Inventory

WHU-Infra3D:面向3D路边基础设施清单的全栈多模态数据集与基准

Chong Liu, Luxuan Fu, Xuyu Feng, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS)(信息工程测绘遥感国家重点实验室) Wuhan University(武汉大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出WHU-Infra3D多模态基准数据集,覆盖三城市53.8公里,融合全景图像与LiDAR点云,提供2D-3D实例关联和跨帧跟踪,支持基础设施状态诊断与属性识别,填补自动化维护数据集空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09461 2026-06-09 cs.CL 新提交 79%

H2HMem: A Multimodal Memory Benchmark for Agents in Human-Human Interactions

H2HMem: 面向人际交互中智能体的多模态记忆基准

Shiping Zhu, Yibo Yang, Zhengyang Wang, Tiancheng Shen, Dandan Guo, Ming-Hsuan Yang

机构 * Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学) University of California at Merced(加州大学默塞德分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 提出H2HMem基准,通过双人和多人多模态对话评估智能体在记忆召回、推理和应用方面的能力,揭示现有模型在多模态、多参与者场景下的显著局限。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09125 2026-06-09 cs.CR cs.AI 新提交 79%

Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges

多模态大语言模型中的隐私风险揭示:任务特定漏洞与缓解挑战

Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本研究揭示了多模态大语言模型在处理图像和文本时存在的隐私泄露风险,通过构建MM-Privacy数据集评估了不同任务下的披露风险与保留风险,并强调了任务不一致性对隐私风险的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08394 2026-06-09 cs.CL 新提交 79%

When Correct Decisions Hide Internal Stress: Decision-State Probing in Multimodal Language Models

当正确决策隐藏内部压力:多模态语言模型中的决策状态探测

Haoran Zhao, Soyeon Caren Han, Eduard Hovy

机构 * The University of Melbourne(墨尔本大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 提出S³E框架,通过正锚定A/B强制选择任务和隐藏状态分析,发现多模态语言模型在正确行为下仍存在语义压力导致的决策状态位移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08093 2026-06-09 cs.AI 新提交 79%

A Multi-modal Agentic Co-pilot for Evidence Grounded Computational Pathology

面向证据基础计算病理学的多模态智能体协同助手

Zhe Xu, Zhengyu Zhang, Zhiyuan Cai, Jiahao Xu, Yijie Lin, Ziyi Liu, Junlin Hou, Hongyi Wang, Yuxiang Nie, Ling Liang, Yihui Wang, Yingxue Xu, Ronald Cheong Kin Chan, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Department of Pathology, Nanfang Hospital, Southern Medical University(南方医科大学南芳医院病理科) Department of Pathology, School of Basic Medical Sciences, Southern Medical University(南方医科大学基础医学学院病理科) Department of Anatomical and Cellular Pathology, Chinese University of Hong Kong(香港中文大学解剖与细胞病理学系) Guangdong Provincial Key Laboratory of Molecular Tumor Pathology(广东省分子肿瘤病理学重点实验室) Jinfeng Laboratory(锦风实验室) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) Division of Life Science, Hong Kong University of Science and Technology(香港科技大学生命科学系) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科技大学神经系统疾病国家重点实验室) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, The Hong Kong University of Science and Technology(香港科技大学深圳-香港协同创新研究院)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 提出PathPocket,一种多模态AI协同助手,通过构建包含11万文档的病理证据语料库和455万实体的超图,实现基于证据的病理诊断,在20万真实案例上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07661 2026-06-09 cs.CV cs.DL 新提交 79%

PereStruct: Multimodal Semantic Assembly for Robust Historical Document Parsing

PereStruct: 面向鲁棒历史文档解析的多模态语义组装

Maksim Shandybo, Ivan Bespalov, Daniil Yefimov, Marina Kosheleva, Alexander Loukianov

机构 * IGIC RAS(俄罗斯科学院信息传输问题研究所) Yandex Cloud National University of Science and Technology MISIS(莫斯科国立钢铁合金学院) Nekrasov Central Universal Scientific Library(涅克拉索夫中央综合科学图书馆)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 针对历史报纸复杂多栏布局的解析难题,提出结合微调YOLO与语义组装模块的多模态方法,在块到文章映射上F1达0.904,BLEU约0.96,显著优于通用视觉语言模型。

Comments Code and data available at https://github.com/makSShandybo/PereStruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06966 2026-06-08 cs.CV 新提交 79%

From Vision to Text: A Compact Multimodal Approach for Robust, Cross-Domain Presentation Attack Detection on ID Cards

从视觉到文本:一种用于身份证件跨域鲁棒演示攻击检测的紧凑多模态方法

Qingwen Zeng, Juan E. Tapia, Sneha Das, Christoph Busch

机构 * da/sec-Biometrics and Security Research Group, Hochschule Darmstadt(da/sec生物安全研究组,达姆施塔特应用技术大学) Technical University of Denmark (DTU)(丹麦技术大学(DTU))

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对身份证件演示攻击检测中的跨域迁移问题,提出一种结合视觉与文本数据的紧凑多模态模型,发现监督微调后泛化强但零样本设置下失效,强调模型容量和真实数据的重要性。

Comments Publication under the revision process on IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06869 2026-06-08 cs.AI 新提交 79%

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22864 2026-06-23 cs.LG 新提交 79%

When AUC 0.998 Is Not Enough: A Candidate Evaluation Protocol for Hidden-State Probes of Indirect Prompt Injection in Multimodal Computer-Use Agents

当AUC 0.998还不够:多模态计算机使用智能体中隐藏状态探针对间接提示注入的候选评估协议

Yanhang Li, Zhichao Fan, Zexin Zhuang

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Southern Methodist University(南卫理公会大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文通过单骨干案例研究,论证高AUC不能直接证明恶意内容检测,提出后验诊断和候选控制集来明确探针能力的边界。

Comments 17 pages, 3 figures. Camera-ready version for EvalMG '26, The 2nd Workshop on Evaluation for Multimodal Generation, co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07543 2026-08-11 cs.CV cs.AI 新提交 79%

Performance of large language models in the optical diagnosis of colorectal polyps

大型语言模型在结直肠息肉光学诊断中的性能

Joshua C. Vences, William T. Tran, Nikko Gimpaya, Catharine M. Walsh, Rishad J. Khan, Robert Bechara, Asher C. Wiggins, Celine N. Rousan, Kaitlyn V. G. L. Morgado, Angie Ibrahim, Kevin H. M. Kuo, Daniel von Renteln, Alexander Hann, Dennis L. Shung, Michael A. Scaffidi, Charles Ménard, Joshua Landy, Samir C. Grover

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究评估Claude Opus 4等5款大型语言模型对结直肠息肉的光学诊断性能,发现其区分息肉亚型的准确率接近专家共识,但灵敏度与特异度未达ESGE标准,需进一步研究方可临床应用。

Comments 22 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12745 2026-08-14 cs.LG cs.DC 新提交 78%

A Cloud-Edge System for Multimodal Clinical Screening in Resource-Constrained Rural Settings

面向资源受限农村地区多模态临床筛查的云边协同系统

Hei Ting, Chan, Chenwei Wu, Xueshen Liu, Zesen Zhao, Boyuan Zheng, Luis Filipe Nakayama, Michael G. Morley, Liyue Shen, Jiasi Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对资源受限农村地区的多模态临床筛查问题,提出云边协同架构,经实验验证其诊断性能优异且成本更低,可适配部署约束。

Comments 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13342 2026-08-14 quant-ph cs.ET 新提交 78%

Quantum-Inspired Phase Bicoherence Spectroscopy: A Framework for Detecting Universal Textural Angular Order Across Multi-Modal Complex Datasets

量子启发的双相干相位光谱:一种用于检测多模态复杂数据集普适纹理角序的框架

Zheng Xing, Chan-Tong Lam, Xiaochen Yuan

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出量子双相干相位(QPBC)光谱框架,将图像角扇区嵌入9量子比特纠缠态,在三类多模态成像数据集上验证其可解析角相位序、区分生物表型,性能优于传统方法,提供经典无法实现的定量纹理观测值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10825 2026-08-12 eess.SY cs.SY 新提交 78%

Cross-modal topology decodes battery faults from sparse voltage snapshots

跨模态拓扑从稀疏电压快照解码电池故障

Jinwen Li, Yunhong Che, Simona Onori, Weihan Li, Xiaosong Hu

专题命中 多模态评测 :cross-modal(title,abstract)

AI总结 本研究针对EV电池安全瓶颈,提出跨模态诊断框架DeFault,通过将电压序列展开为相空间拓扑解码故障,在99辆EV的1640万条数据上对四种故障类型平均准确率达0.96,无需新增传感器即可实现高可解释性故障诊断。

Comments 33 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10127 2026-08-12 astro-ph.CO 新提交 78%

Evaporation of Primordial Black Holes with Multimodal Mass and Extended Spin Distributions: Cosmological Imprints on the Effective Number of Relativistic Species

多模态质量与扩展自旋分布的原初黑洞蒸发:对有效相对论粒子数的宇宙学印记

T. Toghrai, A. Daassou, Y. Ouchhaine, H. Laassiri, R. Benbrik

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究构建FRISHBEE代码实现多模态质量函数与扩展自旋分布,计算原初黑洞蒸发对有效相对论粒子数$\Delta N_{\rm eff}$的影响,发现质量分布和自旋会改变$\Delta N_{\rm eff}$,其可作为原初黑洞形成通道的判别依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09434 2026-08-11 quant-ph 新提交 78%

Birefringent Biomineral Microcarriers Stabilise Multimodal Nanodiamond Quantum Sensing in Liquids

双折射生物矿物微载体稳定液体中的多模态纳米金刚石量子传感

T. Amro, M. Attrash, A. Droby, A. Ushkov, R. Malkinson, P. Penshin, A. Hen, V. Bobrovs, P. Ginzburg, H. Barhum, N. Bar-Gill

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究利用双折射球文石微球作为载体,组装氮空位纳米金刚石,开发杂化平台实现液体中多模态量子传感,可用于磁场与质子浓度、pH值检测,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06013 2026-08-07 cs.HC 新提交 78%

OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction

OneEmo:用于情感感知、理解与交互的统一多模态推理模型

Jiahao Huang, Zheng Lian, Jingyi Zhang, Zhide Chen, Xiaojiang Peng, Shaonan Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对现有情感智能多模态模型忽略任务协同的问题,研究人员提出统一多模态情感模型OneEmo,构建EmoWorld-130K数据集并采用Emo-Chord强化学习策略,其性能优于同规模基线模型,参数远少于商业模型且结果具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03187 2026-08-05 cs.NE 新提交 78%

NeuroMosaic: Anatomically Grounded Multimodal Large Language Modeling for Molecularly Aware Glioma Reasoning from 3D MRI and Clinical Narratives

NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理

Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23822 2026-07-28 cs.LG 新提交 78%

DriveDNA: A Large-Scale Multimodal Naturalistic Driving Dataset and Benchmark for Driving Style Identification

DriveDNA:用于驾驶风格识别的大规模多模态自然驾驶数据集及基准测试

Yuhang Wang, Lingyao Li, Hao Zhou

机构 * University of South Florida(南佛罗里达大学) University of Arizona(亚利桑那大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究引入DriveDNA数据集及基准测试用于驾驶风格识别,定义驾驶风格为车辆在相似条件下的特定行为模式,通过三个核心任务评估,对比多种基线方法得出学习表示更优,视频模型有路线泄漏问题,强调可靠评估需考虑多方面因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22006 2026-07-27 cs.CY econ.GN q-fin.EC stat.AP 新提交 78%

Unfit for stranding assessment: a panel-scale multimodal-LLM audit of building-decarbonisation disclosure (BeDA)

不适用于搁浅评估:建筑脱碳披露(BeDA)的面板规模多模态大语言模型审计

Jingyi Xu, Minghui Cheng, Anchen Sun

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究建筑脱碳披露情况,引入多模态大语言模型工具BeDA审计全球公司面板。发现多数披露不适用,存在报告差距,BeDA分数可靠,可监测该差距,为可执行的建筑搁浅法规提供支持,是筛选工具非预测工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21986 2026-07-27 cs.RO 新提交 78%

Mag4D-SLAM Dataset: A Repeated-Traversal Multi-Modal 4D Geomagnetic Dataset for Localization and Mapping

Mag4D-SLAM数据集:用于定位和映射的重复遍历多模态4D地磁数据集

Bibhutibhusan Nayak, Hyoseok Ju, Giseop Kim

机构 * Department of Robotics and Mechatronics Engineering, DGIST(大邱庆北科学技术院机器人与机电工程系)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 该研究提出Mag4D-SLAM这一首个大规模室外地磁SLAM数据集,含多传感器同步测量与地面真值姿态。通过重复遍历实验分析磁场重复性等特性,支持偏航漂移缓解等研究,还能开启地磁传感补充其他模态及应对特殊情况的新研究。

Comments Accepted to IROS 2026. 8 pages, 8 figures. *Bibhutibhusan Nayak and Hyoseok Ju contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21780 2026-07-27 cs.CL cs.AI cs.CV 新提交 78%

Khondo: A Multimodal Benchmark for Document Packet Splitting of Bangla Forms

Khondo:孟加拉语表格文档分组拆分的多模态基准测试

Abu Tyeb Azad, Fahim Ahmed, Ishita Sur Apan, Ezharuddin Jubaer, Sumaiya Karim Katha, Armun Alam, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) CCDS, Independent University, Bangladesh(孟加拉国独立大学计算与通信科学系) Amazon GenAI(亚马逊生成式人工智能)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对孟加拉语表格文档分组拆分难的问题,引入多模态基准测试Khondo,涵盖多种拼接方案和行政领域。通过对语言模型零样本评估及对照分析,发现页面排列是主要挑战,语言有影响,确立页面顺序重建问题并提供基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20323 2026-07-23 cs.LG physics.comp-ph q-bio.BM 新提交 78%

Multi-modal transformer for signal classification in nanopore blockade experiments

用于纳米孔阻断实验中信号分类的多模态变压器

Sandro Kuppel, Julian Hoßbach, Samuel Tovey, Christian Holm

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 针对纳米孔信号复杂难以分类的问题,引入多模态深度学习架构,联合处理多种信号表示,在42肽基准测试中大幅超越现有方法,转移到20氨基酸数据集也有高准确率,证明机器学习助力纳米孔传感器高精度分子识别的潜力。

Comments 22 pages (incl. references), 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19816 2026-07-23 physics.chem-ph cs.LG physics.comp-ph physics.data-an 新提交 78%

Hypothesis-and-Refinement Learning of Organic Structures from Multimodal Spectroscopic Data

基于多模态光谱数据的有机结构假设与细化学习

Chengchun Liu, Zhiyuan Yan, Li Yuan, Hao Li, Boxuan Zhao, Yonghong Tian, Bartosz A. Grzybowski, Fanyang Mo

机构 * State Key Laboratory of Advanced Waterproof Materials, School of Materials Science and Engineering, Peking University(先进防水材料国家重点实验室,材料科学与工程学院,北京大学) School of Electronic and Computer Engineering, Peking University Shenzhen Graduate School(电子与计算机工程学院,北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) IBS Center for Algorithmic and Robotized Synthesis (CARS), UNIST(算法与机器人化合成中心(CARS),UNIST) Department of Chemistry, UNIST(化学系,UNIST) School of Advanced Materials, Peking University Shenzhen Graduate School(先进材料学院,北京大学深圳研究生院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对从光谱数据确定分子结构的难题,提出假设细化范式,构建QM9SPIN数据集,引入SpectroMol和MS - Mol2Mol,集成系统在模拟基准上准确率达93.8%,能适应实验光谱并改进预测,为有机结构解析提供可扩展途径。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16604 2026-07-21 eess.IV 新提交 78%

When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering

多模态和图增强的检索增强生成(RAG)何时有用?文档问答的对照评估

Sokipriala Jonah

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究文档问答中多模态和图增强RAG的作用,提出用多模态图-RAG架构,通过独立检索并融合文本、图和视觉证据源来评估效果。经实验发现其价值取决于多种因素,如检索设计等,还揭示了一些相关问题,如图像检索及生成器效率对结果的影响。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15436 2026-07-20 cs.CY 新提交 78%

Complete Trip: A Linked Multimodal Human Mobility Dataset

完整行程:一个链接的多模式人类移动数据集

Ruohan Li, Weiyu Luo, Xin Wu, Chenfeng Xiong

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究提出完整行程数据集,通过四阶段工作流程从LBS数据重建多模式旅行行为,涵盖犹他州六个县。能保留行程关系、提供路线表示并支持人口级分析,推动交通、公共卫生等多领域可重复研究。

Comments 16 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09730 2026-07-14 eess.SP 新提交 78%

Multimodal EEG-IMU Fusion for Motor Assessment: Leveraging Task-Dependent Complementarity for Robustness

用于运动评估的多模态脑电-惯性测量单元融合:利用任务相关互补性提高鲁棒性

Zhenan Yin, Lalitha Pranathi Pulavarthy, Saptarshi Purkayastha

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究针对运动障碍评估中多传感模式整合不足问题,通过同步记录脑电-惯性测量单元数据,评估特定任务模态性能和多模态融合。结果表明脑电和惯性测量单元各有优势,后期融合可利用互补性提高评估可靠性,为大规模临床验证提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏