arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-10 至 2026-03-10 共收录 37 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 37 篇

2603.06578 2026-03-10 cs.CV 83%

Multimodal Large Language Models as Image Classifiers

多模态大语言模型作为图像分类器

Nikita Kisel, Illia Volkov, Klara Janouskova, Jiri Matas

机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学普拉茨视觉识别组)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本研究通过修正评估协议和真实标签问题,发现多模态大语言模型在图像分类中的表现受注释质量影响显著,且能辅助人类注释者提升数据集整理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05867 2026-03-10 cs.CV 83%

TumorChain: Interleaved Multimodal Chain-of-Thought Reasoning for Traceable Clinical Tumor Analysis

TumorChain: 交错多模态链式推理用于可追溯的临床肿瘤分析

Sijing Li, Zhongwei Qiu, Jiang Liu, Wenqiao Zhang, Tianwei Lin, Yihan Xie, Jianxiang An, Boxiang Yun, Chenglin Yang, Jun Xiao, Guangyu Guo, Jiawen Yao, Wei Liu, Yuan Gao, Ke Yan, Weiwei Cao, Zhilin Zheng, Tony C. W. Mok, Kai Cao, Yu Shi, Jiuyu Zhang, Jian Zhou, Beng Chin Ooi, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里集团达摩院) Hupan Lab(虎扑实验室) Shanghai Institution of Pancreatic Disease(上海胰腺疾病研究所) Shengjing Hospital of China Medical University(中国医科大学盛京医院) Sun Yat-sen University Cancer Center(中山大学肿瘤中心)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 TumorChain通过多模态交错推理框架提升临床肿瘤分析的可追溯性和准确性。

Comments Accepted at ICLR 2026. 10 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06985 2026-03-10 cs.CV 83%

Perception-Aware Multimodal Spatial Reasoning from Monocular Images

视感知-aware的多模态空间推理从单目图像

Yanchun Cheng, Rundong Wang, Xulei Yang, Alok Prakash, Daniela Rus, Marcelo H Ang, ShiJie Li

机构 * NUS, Singapore(新加坡国立大学) NTU, Singapore(新加坡国立大学) MIT, US(麻省理工学院) A*STAR, Singapore(新加坡科技研究局)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种感知-aware的多模态推理框架,通过统一标记空间联合处理视觉证据和文本推理,提升单目图像空间推理的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06681 2026-03-10 cs.CV 83%

RADAR: A Multimodal Benchmark for 3D Image-Based Radiology Report Review

RADAR:用于基于3D图像的放射学报告审查的多模态基准

Zhaoyi Sun, Minal Jagtiani, Wen-wai Yim, Fei Xia, Martin Gunn, Meliha Yetisgen, Asma Ben Abacha

机构 * University of Washington(华盛顿大学) Microsoft Health AI(微软健康AI)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 RADAR是一个用于放射学报告审查的多模态基准,通过3D医学图像与初步报告及候选编辑的配对,评估模型在细粒度临床推理和图像-文本对齐方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14613 2026-03-10 cs.CL cs.AI cs.CV 82%

Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models

多模态、多任务、多标准自动评估与视觉语言模型

Masanari Ohi, Masahiro Kaneko, Naoaki Okazaki, Nakamasa Inoue

机构 * Institute of Science Tokyo(东京科学研究所) MBZUAI NII LLMC(日本国立信息与通信技术研究所语言模型中心)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出HarmonicEval,一种无需参考的多任务多标准自动评估指标,通过聚合标准评分提升与人类判断的相关性,并构建MMHE基准测试多任务场景下的评估泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11202 2026-03-10 cs.CV cs.AI cs.LG 81%

A Robust Incomplete Multimodal Low-Rank Adaptation Approach for Emotion Recognition

一种鲁棒的不完整多模态低秩适应方法用于情感识别

Xinkui Zhao, Jinsong Shu, Yangyang Wu, Guanjie Cheng, Zihe Liu, Naibo Wang, Shuiguang Deng, Zhongle Xie, Jianwei Yin

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MCULoRA方法,通过解耦模态组合的共享信息和动态调整参数微调,提升不完整多模态学习模型的训练效率和下游任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11024 2026-03-10 cs.LG cs.AI cs.DC 79%

Co-LoRA: Collaborative Model Personalization on Heterogeneous Multi-Modal Clients

Co-LoRA:在异构多模态客户端上的协同模型个性化

Minhyuk Seo, Taeheon Kim, Hankook Lee, Jonghyun Choi, Tinne Tuytelaars

机构 * KU Leuven(库勒芬大学) Seoul National University(首尔国立大学) Sungkyunkwan University(成均馆大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 Co-LoRA通过任务相关性感知的模型聚合和维度不变模块,实现了在异构多模态客户端上的协同模型个性化,提升了在异构场景下的性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07931 2026-03-10 cs.CL 79%

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded

Biao Xiang, Soyeon Caren Han, Yihao Ding

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07486 2026-03-10 cs.CV 79%

Multi-Modal Decouple and Recouple Network for Robust 3D Object Detection

多模态解耦与耦合网络用于抗干扰的3D目标检测

Rui Ding, Zhaonian Kuang, Yuzhe Ji, Meng Yang, Xinhu Zheng, Gang Hua

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) Intelligent Transportation Thrust of the Systems Hub, The Hong Kong University of Science and Technology (Guangzhou)(系统枢纽智能交通方向,香港科技大学(广州)) Multimodal Experiences Research Lab, Dolby Laboratories(多模态体验研究实验室,Dolby实验室)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态解耦与耦合网络,通过分离和重新耦合不同模态特征以提高在数据损坏下的3D目标检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07443 2026-03-10 cs.CV 79%

Med-Evo: Test-time Self-evolution for Medical Multimodal Large Language Models

Med-Evo: 医疗多模态大语言模型的测试时自演化

Dunyuan Xu, Xikai Yang, Juzheng Miao, Yaoqian Li, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong, China(计算机科学与工程系,香港中文大学,香港,中国) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong, Hong Kong, China(医学智能与XR研究所,香港中文大学,香港,中国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 Med-Evo通过无标签强化学习和伪标签技术提升医疗多模态大语言模型性能,实验表明在医疗VQA任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00312 2026-03-10 cs.AI cs.LG 79%

How Well Do Multimodal Models Reason on ECG Signals?

多模态模型在心电图信号上的推理能力如何?

Maxwell A. Xu, Harish Haresamudram, Catherine W. Liu, Patrick Langer, Jathurshan Pradeepkumar, Wanting Mao, Sunita J. Ferns, Aradhana Verma, Jimeng Sun, Paul Schmiedmayer, Xin Liu, Daniel McDuff, Emily B. Fox, James M. Rehg

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Rush University(拉什大学) ETH Zurich(苏黎世联邦理工学院) St. Christopher's Hospital for Children(圣克里斯opher儿童医院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Google Inc(谷歌公司)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种评估多模态模型在ECG信号上推理能力的框架,通过感知和演绎两个方面验证模型的逻辑和模式识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24118 2026-03-10 cs.RO cs.AI 79%

LagMemo: Language 3D Gaussian Splatting Memory for Multi-modal Open-vocabulary Multi-goal Visual Navigation

LagMemo: 语言3D高斯点云记忆用于多模态开放词汇多目标视觉导航

Haotian Zhou, Xiaole Wang, He Li, Zhuo Qi, Jinrun Yin, Haiyu Kong, Jianghuan Xu, Huijing Zhao

机构 * Key Laboratory of Machine Perceptions (MOE), School of Intelligence Science and Technology, Peking University(机器感知重点实验室(教委)、智能科学与技术学院、北京大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 LagMemo通过语言3D高斯点云记忆实现多模态开放词汇多目标视觉导航,有效提升多目标定位性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07130 2026-03-10 cs.SD eess.AS 79%

Toward Multimodal Industrial Fault Analysis: A Single-Speed Chain Conveyor Dataset with Audio and Vibration Signals

迈向多模态工业故障分析:一个包含音频和振动信号的单速链式输送机数据集

Zhang Chen, Yucong Zhang, Xiaoxiao Miao, Ming Li

机构 * Digital Innovation Research Center, Duke Kunshan University(杜克昆山大学数字创新研究中心) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出一个包含音频和振动信号的单速链式输送机数据集,用于多模态工业故障分析,提供标准化评估协议和统一基准以支持通道级分析和多模态融合研究。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06986 2026-03-10 cs.HC cs.CV 79%

ADAS-TO: A Large-Scale Multimodal Naturalistic Dataset and Empirical Characterization of Human Takeovers during ADAS Engagement

ADAS-TO:大规模多模态自然数据集及ADAS参与期间人类接管的实证分析

Yuhang Wang, Yiyao Xu, Jingran Sun, Hao Zhou

机构 * Department of Civil and Environmental Engineering, University of South Florida(土木与环境工程系,佛罗里达州立大学)

专题命中 多模态评测 :multimodal(title);cross-modal(abstract);分类 cs.CV

AI总结 ADAS-TO数据集通过多模态分析揭示了ADAS参与期间人类接管的运动特征及视觉预警潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13172 2026-03-10 cs.CV 79%

WHU-STree: A Multi-modal Benchmark Dataset for Street Tree Inventory

WHU-STree: 一个用于街道树盘点的多模态基准数据集

Ruifei Ding, Zhe Chen, Wen Fan, Chen Long, Huijuan Xiao, Yelu Zeng, Zhen Dong, Bisheng Yang

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 WHU-STree是一个多模态的街道树盘点数据集,包含丰富的标注和多任务支持,用于提升城市街道树管理的自动化和智能化水平。

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing, 2026, 233: 519-542

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06919 2026-03-10 cs.RO 78%

SurgSync: Time-Synchronized Multi-Modal Data Collection Framework and Dataset for Surgical Robotics

SurgSync: 用于手术机器人的时间同步多模态数据采集框架和数据集

Haoying Zhou, Chang Liu, Yimeng Wu, Junlin Wu, Zijian Wu, Yu Chung Lee, Sara Martuscelli, Spetimiu E. Salcudean, Gregory S. Fischer, Peter Kazanzides

机构 * Department of Robotics Engineering, Worcester Polytechnic Institute(机器人工程系,沃斯特理工学院) Laboratory for Computational Sensing and Robotics(计算感知与机器人实验室) Department of Computer Science, Johns Hopkins University(计算机科学系,约翰霍普金斯大学) Robotics and Control Laboratory, the University of British Columbia(机器人与控制实验室,不列颠哥伦比亚大学) Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子、信息与生物工程系,米兰理工学院)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 SurgSync提出了一种时间同步的多模态数据采集框架和数据集,用于手术机器人中的高阶控制与训练,通过多传感器和后处理工具提升数据质量与实用性。

Comments Accepted By International Conference on Robotics and Automation (ICRA), IEEE, 2026. More details can be found at https://surgsync.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02748 2026-03-10 cs.CV cs.AI 76%

iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding

iGVLM:动态指令引导的视觉编码用于问题感知的多模态理解

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Technology, Huazhong University of Science(科技,华中科技大学) Li Auto Inc.(Li汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究所,中国科学院)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.AI

AI总结 iGVLM通过动态指令引导的视觉编码框架,提升多模态理解中对指令的敏感度,实现从通用感知到任务感知推理的平滑过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19935 2026-03-10 q-bio.QM 71%

CAN-STRESS: A Real-World Multimodal Dataset for Understanding Cannabis Use, Stress, and Physiological Responses

CAN-STRESS:一种用于理解大麻使用、压力和生理反应的现实世界多模态数据集

Reza Rahimi Azghan, Nicholas C. Glodosky, Ramesh Kumar Sah, Carrie Cuttler, Ryan McLaughlin, Michael J. Cleveland, Hassan Ghasemzadeh

专题命中 多模态评测 :multimodal(title)

AI总结 CAN-STRESS数据集通过多模态数据研究大麻使用与压力及生理反应的关系,为相关研究提供可靠资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06700 2026-03-10 cs.CV 70%

SIQA: Toward Reliable Scientific Image Quality Assessment

SIQA:迈向可靠的科学图像质量评估

Wenzhe Li, Liang Chen, Junying Wang, Yijing Guo, Ye Shen, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * TongJi University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13795 2026-03-10 cs.CV cs.AI 62%

Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs

Bee:一个高质量语料库和全栈工具包,解锁高级完全开放的多模态大语言模型

Yi Zhang, Bolin Ni, Xin-Sheng Chen, Heng-Rui Zhang, Yongming Rao, Houwen Peng, Qinglin Lu, Han Hu, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan Team(腾讯文英团队)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Bee通过高质量数据集和全栈工具包,提升完全开放多模态大语言模型的性能,达到与半开放模型相当甚至超越的水平。

Comments homepage: https://open-bee.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06648 2026-03-10 cs.CV cs.AI 62%

ObjChangeVR: Object State Change Reasoning from Continuous Egocentric Views in VR Environments

ObjChangeVR: 从VR环境中连续眼动视角推断物体状态变化

Shiyi Ding, Shaoen Wu, Ying Chen

机构 * Kennesaw State University(肯纳邦大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ObjChangeVR通过结合视角感知和时间基检索,有效识别VR环境中物体状态变化,提升多模态大语言模型在复杂场景下的表现。

Comments European Chapter of the Association for Computational Linguistics (EACL) 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08024 2026-03-10 cs.CL 57%

ConflictBench: Evaluating Human-AI Conflict via Interactive and Visually Grounded Environments

ConflictBench: 通过交互式和视觉 grounded 环境评估人类-人工智能冲突

Weixiang Zhao, Haozhen Li, Yanyan Zhao, xuda zhi, Yongbo Huang, Hao He, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) SERES

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

AI总结 ConflictBench通过交互式和视觉 grounded 环境评估人类-人工智能冲突,揭示智能体在不同风险情境下的行为差异及对齐失败问题。

Comments 29 pages, 20 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07868 2026-03-10 cs.AI cs.LG 57%

Hospitality-VQA: Decision-Oriented Informativeness Evaluation for Vision-Language Models

Hospitality-VQA: 为视觉-语言模型的决策导向信息评估

Jeongwoo Lee, Baek Duhyeong, Eungyeol Han, Soyeon Shin, Gukin han, Seungduk Kim, Jaehyun Jeon, Taewoo Jeong

机构 * Yonsei University(延世大学) Yanolja NEXT

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出Hospitality-VQA,通过构建专门针对旅游业的VQA数据集,评估视觉-语言模型在决策导向场景中的信息评估能力,并发现需通过领域微调提升其决策意识。

Comments Accepted at EACL 2026 SRW. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07834 2026-03-10 cs.CY cs.AI cs.HC 57%

AI Misuse in Education Is a Measurement Problem: Toward a Learning Visibility Framework

教育中AI的滥用是测量问题:迈向学习可见性框架

Eduardo Davalos, Yike Zhang

机构 * Trinity University(特里尼蒂大学) St. Mary's University(圣玛丽大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出学习可见性框架,旨在通过强调过程可见性而非对抗性检测,解决教育中AI滥用的测量问题,以实现教育价值观与AI使用的对齐。

Comments 14 pages, 5 figures, Submitted and Accepted to AIR-RES2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07786 2026-03-10 cs.CV 57%

OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models

OrdinalBench: 一种用于诊断视觉-语言模型在序数理解通用性限制的基准数据集

Yusuke Tozaki, Hisashi Miyamori

机构 * Division of Frontier Informatics, Kyoto Sangyo University, Kyoto, Japan(前沿信息学系,京都精华大学,京都,日本)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 OrdinalBench通过评估视觉-语言模型在序数理解上的表现,揭示其在大序数和复杂路径条件下的泛化能力不足问题。

Comments Accepted as a Short Paper at VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07769 2026-03-10 cs.CV 57%

MedQ-Deg: A Multidimensional Benchmark for Evaluating MLLMs Across Medical Image Quality Degradations

MedQ-Deg:一个多维基准,用于评估医疗图像质量退化下的多模态大语言模型

Jiyao Liu, Junzhi Ning, Chenglong Ma, Wanying Qu, Jianghan Shen, Siqi Luo, Jinjie Wei, Jin Ye, Pengze Li, Tianbin Li, Jiashi Lin, Hongming Shan, Xinzhe Luo, Xiaohong Liu, Lihao Liu, Junjun He, Ningsheng Xu

机构 * Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Imperial College London(伦敦帝国理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 MedQ-Deg是一个多维基准,用于评估医疗图像质量退化下多模态大语言模型的性能,揭示模型在不同退化类型下的表现差异及置信度校准问题。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07670 2026-03-10 cs.AI 57%

Memory for Autonomous LLM Agents:Mechanisms, Evaluation, and Emerging Frontiers

自主LLM代理的记忆:机制、评估与新兴前沿

Pengfei Du

机构 * Hong Kong Research Institute of Technology(香港理工大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了自主LLM代理中记忆的机制、评估及未来发展方向,分析了五种核心机制及评估挑战,强调记忆对代理适应性和应用的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11071 2026-03-10 cs.MM quant-ph 57%

Q-BAR: Blogger Anomaly Recognition via Quantum-enhanced Manifold Learning

Q-BAR: 通过量子增强的流形学习进行博主异常识别

Maida Wang, Panyun Jiang

专题命中 多模态评测 :multimodal(abstract);分类 cs.MM

AI总结 Q-BAR通过量子增强的流形学习方法,有效检测低数据量下的博主语义异常,提升个性化媒体取证的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06746 2026-03-10 cs.RO cs.CV 57%

M3CAD: Towards Generic Cooperative Autonomous Driving Benchmark

M3CAD:迈向通用协作自动驾驶基准

Morui Zhu, Yongqi Zhu, Yihao Zhu, Qi Chen, Deyuan Qu, Song Fu, Qing Yang

机构 * University of North Texas(北卡罗来纳州立大学) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 M3CAD是一个全面的协作自动驾驶基准,提供多模态数据支持多种自动驾驶任务,并提出多级融合方法以平衡通信效率与感知精度。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03935 2026-03-10 cs.LG cs.AI 57%

LLM-Powered Prediction of Hyperglycemia and Discovery of Behavioral Treatment Pathways from Wearables and Diet

基于大语言模型的高血糖预测及从可穿戴设备和饮食中发现行为治疗路径

Abdullah Mamun, Asiful Arefeen, Susan B. Racette, Dorothy D. Sears, Corrie M. Whisner, Matthew P. Buman, Hassan Ghasemzadeh

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) College of Health Solutions, Arizona State University(健康解决方案学院,亚利桑那州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出GlucoLens系统,利用大语言模型和多模态数据预测餐后血糖及高血糖,提供可解释的治疗路径建议。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏