arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-14 至 2026-05-14 共收录 95 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 7 篇

2605.13277 2026-05-14 cs.CL cs.AI cs.CV cs.IR cs.LG 82%

Utility-Oriented Visual Evidence Selection for Multimodal Retrieval-Augmented Generation

以效用为导向的多模态证据选择用于多模态检索增强生成

Weiqing Luo, Zongye Hu, Xiao Wang, Zhiyuan Yu, Haofeng Zhang, Ziyi Huang

机构 * Arizona State University(亚利桑那州立大学) Texas A&M University(德克萨斯大学) Morgan Stanley(摩根大通)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出以信息论视角重构多模态证据选择,定义证据效用为模型输出分布的信息增益,通过引入潜在的证据有效性概念,提出无需训练的代理加速框架,实验证明在MRAG-Bench和Visual-RAG上优于现有RAG基线并降低计算成本。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13034 2026-05-14 cs.CV cs.IR 79%

ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

ViDR:基于源视觉证据的多模态深度研究报告 grounding

Zhuofan Shi, Peilun Jia, Baoqin Sun, Haiyang Shen, Sixiong Xie, Yun Ma, Xiang Jing

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室) School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 ViDR通过源视觉证据构建多模态深度研究报告框架,提升报告质量与证据可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15642 2026-05-14 cs.CV 70%

UNIV: Unified Foundation Model for Infrared and Visible Modalities

UNIV:用于红外和可见模态的统一基础模型

Fangyuan Mao, Shuo Wang, Jilin Mei, Shun Lu, Chen Min, Fuyang Liu, Xiaokun Feng, Meiqi Wu, Yu Hu

机构 * Research Center for Intelligent Computing Systems, CAS ICT(智能计算系统研究所以及中国科学院信息科技研究院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 跨模态检索 :cross-modal(abstract,abstract_cn);分类 cs.CV

AI总结 UNIV通过跨模态对比学习提升红外与可见光感知的鲁棒性,解决模态偏差问题,实验显示在红外任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12545 2026-05-14 cs.CV cs.AI 62%

CROP: Expert-Aligned Image Cropping via Compositional Reasoning and Optimizing Preference

CROP:通过组合推理和优化偏好实现专家对齐的图像裁剪

Zhitong Dong, Chao Li, Jie Yu, Hao Chen

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology(新一代人工智能技术重点实验室) Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CROP方法,通过组合推理和优化偏好,解决传统图像裁剪方法在复杂场景中难以做出组合权衡和缺乏适应性推理的问题,提升裁剪结果与专家审美的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12988 2026-05-14 cs.AI cs.CY cs.IR 57%

Retrieval-Augmented Tutoring for Algorithm Tracing and Problem-Solving in AI Education

增强检索的辅导系统用于AI教育中的算法追踪与问题解决

Mragisha Jain, Tirth Bhatt, Griffin Pitts, Aum Pandya, Peter Brusilovsky, Narges Norouzi, Arto Hellas, Juho Leinonen, Bita Akram

机构 * North Carolina State University(北卡罗来纳州立大学) University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校) Aalto University(阿尔托大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出KITE系统,通过增强检索生成技术辅助学生理解算法追踪和问题解决,提升算法推理能力。

Comments Paper accepted to the 21st Workshop on Innovative Use of NLP for Building Educational Applications (BEA 2026), co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13013 2026-05-14 cs.LG 50%

JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning

JEDI: 联合嵌入扩散世界模型用于在线基于模型的强化学习

Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 JEDI通过联合嵌入扩散方法,构建了首个端到端的潜在扩散世界模型,提升了在线基于模型的强化学习效率与性能,减少了显存占用并加快了训练速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23089 2026-05-14 cs.LG 50%

Physics-informed neural particle flow for the Bayesian update step

具有物理信息的神经粒子流用于贝叶斯更新步骤

Domonkos Csuzdi, Tamás Bécsi, Olivér Törő

机构 * Department of Control for Transportation and Vehicle Systems, Faculty of Transportation Engineering and Vehicle Engineering, Budapest University of Technology and Economics(交通运输与车辆系统控制系,交通运输工程与车辆工程学院,布达佩斯技术与经济大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出一种物理信息神经粒子流框架,通过将先验到后验密度函数的log-homotopy轨迹与密度演变的连续性方程结合,推导出主PDE,用于无监督训练,提高高维非线性估计的计算效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 8 篇

2605.12584 2026-05-14 cs.LG cs.AI 83%

Towards Robust Federated Multimodal Graph Learning under Modality Heterogeneity

面向模态异质性的鲁棒联邦多模态图学习

Sirui Zhang, Haonan Wang, Xunkai Li, Zekai Chen, Shumeng Li, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出FedMPO,通过拓扑感知的跨模态生成和可靠性感知的聚合,解决联邦多模态图学习中模态缺失和异质性问题,实验表明在高缺失和非IID设置下性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01908 2026-05-14 cs.CV 81%

Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning

基于推理的编辑:基于假设指令的图像编辑与视觉推理

Qingdong He, Xueqin Chen, Chaoyi Wang, Yanjie Pan, Xiaobin Hu, Zhenye Gan, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Tencent Youtu Lab(腾讯云图实验室) Sichuan University(四川大学) University of the Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出Reason50K数据集和ReasonBrain框架,通过多模态大语言模型和扩散模型实现复杂隐含指令的图像编辑,提升视觉推理能力。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13309 2026-05-14 eess.SP 78%

SimART: A Unified and Open Real-world Multimodal Simulation Platform for 6G Integrated Sensing and Communication

SimART:一个统一的开放现实多模态仿真平台用于6G集成感知与通信

Kang Yan, Yuqi Cao, Jiaqi Li, Luping Xiang, Kun Yang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 SimART通过整合机器人学、光线追踪和无线评估引擎,提供一个可重复的多模态仿真平台,支持6G集成感知与通信的多方面需求,包括场景构建和信道知识图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13502 2026-05-14 eess.SP 71%

A Multi-Modal Intelligent U2V Channel Model for 6G Sensing-Communication Integration

一种面向6G感知通信一体化的多模智能U2V信道模型

Shuo Wang, Zengrui Han, Lu Bai, Xiang Cheng

专题命中 多模态生成 :multi-modal(title)

AI总结 本文提出一种基于三维散射体预测的新型U2V信道模型,通过构建宽车道场景下的高保真混合感知通信集成U2V仿真数据集,设计了3D-SPADE算法,利用LiDAR点云准确预测散射体分布,提升了动态U2V场景的建模精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13729 2026-05-14 cs.CV cs.AI 62%

Coordinating Multiple Conditions for Trajectory-Controlled Human Motion Generation

轨迹控制的人体运动生成

Deli Cai, Haoyang Ma, Changxing Ding

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) Pazhou Lab(琶洲实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CMC框架,通过分治策略协调文本和轨迹条件,解决现有方法中文本与轨迹冲突及冗余表示导致的不稳定问题,实验显示其在控制精度和运动质量上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14104 2026-05-14 cs.RO cs.CV 57%

When Backdoors Meet Partial Observability: Attacking Real-World Reinforcement Learning

当后门遇见部分可观测性:攻击现实世界的强化学习

Tairan Huang, Qingqing Ye, Yulin Jin, Jiawei Lian, Yaxin Xiao, Yi Wang, Haibo Hu

机构 * Department of Electrical and Electronic Engineering(电气与电子工程系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DGBA框架,针对现实世界强化学习中部分可观测性问题,通过扩散引导后门攻击实现稳定攻击激活,实验表明其优于现有方法且不影响正常任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05376 2026-05-14 cs.CV 57%

GeomHair: Reconstruction of Hair Strands from Colorless 3D Scans

GeomHair:从无色3D扫描中重建发丝

Rachmadio Noval Lazuardi, Artem Sevastopolsky, Egor Zakharov, Matthias Niessner, Vanessa Sklyarova

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出一种从无色3D扫描直接重建发丝的方法,通过多模态发丝方向提取,结合神经网络2D线检测器和扩散先验,构建了Strands400数据集,支持下游任务和CG工作流。

Comments 15 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06021 2026-05-14 stat.ML cs.LG cs.NA math.NA math.PR 50%

Diffusion Model's Generalization Can Be Characterized by Inductive Biases toward a Data-Dependent Ridge Manifold

扩散模型的泛化能力可以通过数据依赖的ridge流形的归纳偏差来表征

Ye He, Yitong Qiu, Molei Tao

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文研究扩散模型泛化能力的几何机制,通过引入时间依赖的log-density ridge流形,揭示生成样本在流形附近的运动规律,并通过实验验证了其在多模态数据和MNIST中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 23 篇

2605.13173 2026-05-14 cs.DB 86%

OxyEcomBench: Benchmarking Multimodal Foundation Models across E-Commerce Ecosystems

OxyEcomBench:跨电子商务生态系统的多模态基础模型基准测试

Yong Liu, Ximan Liu, Guoqing Yang, Bing Bai, Xiaoqiang Xu, Zhen Chen, Ke Zhang, Yan Li

专题命中 多模态评测 :multimodal(title,abstract);multimodal foundation model(title)

AI总结 本文提出OxyEcomBench,一个涵盖6300个高质量实例的多模态基准,用于评估模型在电子商务场景中的表现,通过覆盖平台运营者、商家和消费者六个能力方面和29项任务,验证模型在多模态输入下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10187 2026-05-14 cs.CV 83%

SciVQR: A Multidisciplinary Multimodal Benchmark for Advanced Scientific Reasoning Evaluation

SciVQR:一个多学科多模态基准用于高级科学推理评估

Longteng Guo, Xuanxu Lin, Dongze Hao, Tongtian Yue, Pengkang Huo, Jiatong Ma, Yuchen Liu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center(OPPO AI中心)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 SciVQR通过54个学科的多模态任务评估科学推理能力,包含专家解答的复杂推理挑战,揭示了多模态大语言模型在复杂推理和跨学科整合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12703 2026-05-14 cs.CV cs.AI 81%

MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence

MMCL-Bench:多模态上下文学习从视觉规则、程序和证据

Yifan Chen, Fei Yin, Qingyan Bai, Zicheng Lin, Yujiu Yang

机构 * University of Cambridge(剑桥大学) HKUST(香港科技大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MMCL-Bench提出一个多模态上下文学习基准,要求模型从视觉或混合模态教学上下文中学习规则、程序和经验模式,并应用于新实例。评估发现当前系统在多模态上下文学习上仍不稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10556 2026-05-14 cs.CV cs.LG 79%

EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving

EnergyLens: 多模态大语言模型推理服务中的可解释闭式能量模型

Vittorio Palladino, Gianluca Palermo, Michael E. Papka, Zhiling Lan

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态大语言模型推理服务中的能量优化问题,提出EnergyLens模型,通过符号回归发现结构,构建基于系统属性的闭式能量模型,实现可解释且高效的配置选择。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10755 2026-05-14 cs.CV 79%

MMRareBench: A Rare-Disease Multimodal and Multi-Image Medical Benchmark

MMRareBench: 一种罕见疾病多模态和多图像医学基准

Junzhi Ning, Jiashi Lin, Yingying Fang, Wei Li, Jiyao Liu, Cheng Tang, Chenglong Ma, Wenhao Tang, Tianbin Li, Ziyan Huang, Guang Yang, Junjun He

机构 * Shanghai AI Laboratory(上海人工智能实验室) Imperial College London(帝国理工学院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MMRareBench,首个评估多模态和多图像临床能力的罕见疾病基准,包含1756个问题-答案对和7958张医学图像,揭示23个MLLMs在多图像任务中表现低下,存在能力稀释效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15616 2026-05-14 cs.CV 79%

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

LENS:基于大语言模型的多级多模态推理评估

Ruilin Yao, Bo Zhang, Jirui Huang, Xinwei Long, Yifang Zhang, Tianyu Zou, Yufei Wu, Shichao Su, Yifan Xu, Wenxi Zeng, Zhaoyu Yang, Guoyou Li, Shilan Zhang, Zichan Li, Yaxiong Chen, Shengwu Xiong, Peng Xu, Jiajun Zhang, Bowen Zhou, David Clifton, Luc Van Gool

机构 * Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室) University of Oxford(牛津大学) INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 LENS提出一个包含3.4K图像和60K+问题的多级评估基准,涵盖8个任务和12种日常场景,用于评估大语言模型在多模态推理中的表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13330 2026-05-14 cs.CL 79%

FIND: Toward Multimodal Financial Reasoning and Question Answering for Indic Languages

FIND:迈向印度语言多模态金融推理与问答

Sarmistha Das, Vaibhav Vishal, Syed Ibrahim Ahmad, Manish Gupta, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院帕纳分校) Microsoft(微软)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出FinVQA基准和FIND框架,针对多语言印度语言金融推理挑战,通过多模态和数值推理提升金融决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12838 2026-05-14 cs.AI 79%

Multimodal Hidden Markov Models for Persistent Emotional State Tracking

多模态隐马尔可夫模型用于持久情绪状态跟踪

Anamika Ragu, Aneesh Jonelagadda

机构 * Kaliber AI, San Mateo, California, USA(Kaliber AI,美国加利福尼亚州圣马特奥)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于多模态valence- arousal表示的轻量框架,利用sticky factorial HDP-HMM实现对话情绪的持续状态跟踪,通过LLM-as-a-Judge等指标验证其比基线Gaussian HMM更高效且可解释。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12799 2026-05-14 cs.MA cs.CY cs.MM 79%

Synthesizing the Expert: A Validated Multimodal Dataset for Trustworthy AI-Assisted Swimming Coaching

合成专家:一个经过验证的多模态数据集用于可信的人工智能辅助游泳教练

Ahmad Al-Kabbany, Esraa Kassem

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出一个多模态数据集,用于构建可信的人工智能游泳教练系统,通过多代理LLM架构生成1864个验证的'问题-上下文-答案'三元组,提升自动化指导的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10127 2026-05-14 cs.CV 79%

Fashion130K: An E-commerce Fashion Dataset for Outfit Generation with Unified Multi-modal Condition

Fashion130K: 一个用于服装生成的电子商务服装数据集,具有统一的多模态条件

Yu He, Ting Zhu, Yichun Liu, Lichen Ma, Xinyuan Shan, Jingling Fu, Yu Shi, Junshi Huang, Yan Li

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Fashion130K数据集和统一多模态条件框架,通过多模态提示对齐和融合变压器提升生成一致性,实验验证了UMC在视觉一致性上的有效性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13530 2026-05-14 cs.CV cs.AI 79%

Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs

迈向统一的手术场景理解:通过多模态大语言模型弥合推理与 grounding

Jincai Huang, Shihao Zou, Yuchen Guo, Jingjing Li, Wei Ji, Kai Wang, Shanshan Wang, Weixin Si

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Northwestern University(西北大学) University of Alberta(阿尔伯塔大学) Yale University(耶鲁大学) Nanfang Hospital(南华医院) Shenzhen University of Advanced Technology(深圳大学先进技术研究院)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SurgMLLM框架,通过统一推理与视觉 grounding 实现手术场景理解,提升三元组识别和分割精度,实验表明其在三元组识别指标AP_IVT上提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12882 2026-05-14 cs.CL cs.CV 79%

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

CiteVQA:可信赖文档智能的证据归因基准测试

Dongsheng Ma, Jiayu Li, Zhengren Wang, Yijie Wang, Jiahao Kong, Weijun Zeng, Jutao Xiao, Jie Yang, Wentao Zhang, Bin Wang, Conghui He

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13711 2026-05-14 cs.LG 78%

MILM: Large Language Models for Multimodal Irregular Time Series with Informative Sampling

MILM:用于多模态不规则时间序列的大型语言模型与信息采样

Hsing-Huan Chung, Shijun Li, Yoav Wald, Xing Han, Suchi Saria, Joydeep Ghosh

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Technion-IIT(技术学院-以色列理工学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出MILM模型,通过两阶段策略处理多模态不规则时间序列,有效利用采样模式和观测值进行分类,提升医疗记录中住院死亡率预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02502 2026-05-14 cs.CR 78%

GuardSec: A Multi-Modal Web Platform for Real-Time Digital Fraud Detection, Entity Verification, and Connection Security Analysis in the African Context

GuardSec:面向非洲情境的多模态网络平台,用于实时数字欺诈检测、实体验证及连接安全分析

Gilda Rech Bansimba, Regis Freguin Babindamana

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 GuardSec为非洲用户设计,提供实时多模态威胁验证,无需注册或技术知识,用户可快速评估网址、电话号码等合法性,并通过My Footprint实时分析自身连接安全,同时集成Gilda提供个性化安全建议。

Comments first version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13218 2026-05-14 cs.LG 78%

Machine Learning-Driven Multimodal Spectroscopic Liquid Biopsy for Early Multicancer Detection

基于机器学习的多模态光谱学液体活检用于早期多癌种检测

Alejandro Leonardo García Navarro, Javier Cachón Ortiz, Javier González Colsa, Samuel García Díaz, Carlos Viadero Valderrama

机构 * Signal Processing Group(信号处理组) Gregorio Marañón Health Research Institute(格雷戈里奥·马兰农健康研究中心) Amber Health Solutions(艾默健康解决方案)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出结合FTIR、拉曼和EEM荧光光谱的多模态液体活检框架,利用机器学习方法实现多癌种早期检测,实验显示多模态融合在ROC-AUC和灵敏度特异度上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏