arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-11 至 2026-08-11 共收录 202 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 45 篇

2608.09281 2026-08-11 cs.AI 新提交 87%

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

MMArch:基于建筑证据的多模态推理基准测试

Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLM)在工程多模态推理基准上的表现,构建MMArch基准,发现现有MLLM与人类专家存在差距,为相关研究提供评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 86%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新 85%

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

专题命中 多模态评测 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07958 2026-08-11 cs.CV 新提交 83%

LIBAD: A Multimodal Anomaly Detection Benchmark for Li-Ion Battery Electrode Manufacturing

LIBAD:面向锂离子电池电极制造的多模态异常检测基准

Wenbo Sui, Daniel Lichau, Harold Phelippeau, Zhao Liu

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文推出首个面向锂离子电池电极制造的多模态异常检测基准LIBAD,提出DA-Core方法,其在核心集比例0.05时可降低误报率并缩短推理时间,优于相关基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07867 2026-08-11 cs.LG 新提交 82%

CONFER: Conflict-Aware Evidence Negotiation for Regime-Calibrated Weak Supervision in Multimodal Emotion Recognition

CONFER:面向多模态情感识别中规则校准弱监督的冲突感知证据协商框架

Bojing Hou, Ruohao Li, Yitong Zhu, Luwen Yu, Yuyang Wang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出CONFER框架,针对多模态情感识别中跨模态冲突与自我报告标签不可靠问题,通过图结构的冲突感知证据协商实现弱标签校准,在多数据集严格LOSO协议下取得具竞争力的情感识别准确率,提升了对弱标签损坏的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10904 2026-08-11 cs.CR 版本更新 82%

When the Defense Writes the Refusal: Auditing Keyword-Scored Evaluation of Inference-Time Defenses for Multimodal Large Language Models

多模态大语言模型推理时防御方法的比较分析

Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract)

AI总结 本文比较评估了三种推理时防御方法及其组合在InternVL和Qwen-VL系列共8个模型上的效果,发现无单一防御在所有设置中占优,组合防御导致良性查询过度拒绝率达97-100%,而简单安全提示在保持实用性的同时带来适度安全提升。

Comments 15 pages, 3 figures. Conditionally accepted at DAMDID/RCDL 2026; revised after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19634 2026-08-11 cs.CL cs.AI cs.CV cs.SD 版本更新 82%

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

MCIF: 多模态跨语言指令遵循基准从科学讲座

Sara Papi, Maike Züfle, Marco Gaido, Beatrice Savoldi, Danni Liu, Ioannis Douros, Luisa Bentivogli, Jan Niehues

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MCIF是首个多模态跨语言指令遵循基准,通过科学讲座数据评估模型在跨语言、多模态环境下处理不同输入长度的任务能力。

Comments Data available at https://huggingface.co/datasets/FBK-MT/MCIF | Evaluation, outputs, and baselines available at https://github.com/hlt-mt/mcif

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09122 2026-08-11 cs.CV cs.AI 新提交 81%

Visual Distortion Detection in UGC Images Using Large Multimodal Models

基于大型多模态模型的UGC图像视觉失真检测

Ziheng Jia, Yingji Liang, Jiaying Qian, Xiongkuo Min

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对现有LMM图像失真检测方法准确率不足及合成失真泛化差距问题,提出VIGIL模型,构建VIGIL-140K数据集,利用LLM解码器多层级特征检测并缓解FG-BG分离问题,在两类任务上性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08727 2026-08-11 cs.CV cs.AI 新提交 81%

TomaMMU: A Comprehensive Multimodal Understanding Benchmark for Tomato Leaf Diseases

TomaMMU:用于番茄叶片病害的综合多模态理解基准

Gia-Han Truong, Khang Nguyen Quoc, Luyl-Da Quach

机构 * FPT University(FPT大学) Korea University(高丽大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究推出用于番茄叶片病害多模态理解的TomaMMU数据集及TomaBench基准,评估14种VLMs时发现其细粒度识别等存在差距,微调后MCQ准确率达96.09%,为相关研究提供了方向。

Comments Accepted at ECCV CVPPA Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03162 2026-08-11 cs.CY cs.AI cs.CL cs.LG 版本更新 81%

MateInfoUB: A Real-World Benchmark for Testing LLMs in Competitive, Multilingual, and Multimodal Educational Tasks

MateInfoUB:用于测试大型语言模型(LLMs)在竞争性、多语言及多模态教育任务中表现的真实世界基准

Adrian Marius Dumitran, Theodor-Pierre Moroianu, Mihnea-Vicentiu Buca

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯特大学数学与计算机科学学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究构建了双语多模态计算机科学竞赛题数据集,评估当前最先进LLMs在该数据集上的表现,揭示其优劣势及语言选择的影响,还发布了教育应用以支持罗马尼亚学生自我评估。

Comments 14 pages (9 paper, 2 references, 3 annexes). Accepted for BEA 2025!

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09240 2026-08-11 cs.LG cs.AI 新提交 79%

Multimodal Federated Learning under Dual-Axis Modality Missingness

双轴模态缺失下的多模态联邦学习

Adiba Orzikulova, Jaehyun Kwak, Jaemin Shin, Yunqi Guo, Xiaomin Ouyang, Guoliang Xing, Steven Euijong Whang, Sung-Ju Lee

机构 * KAIST(韩国科学技术院) CUHK(香港中文大学) HKUST(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态联邦学习的双轴模态缺失问题,提出Flux框架,通过模态感知置信度调温与梯度解耦私有适配,在四个多模态数据集上取得最高平均宏F1,性能优于最强基准

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09230 2026-08-11 cs.AI 新提交 79%

SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge

SafeSceneReason:连接工业危害与事故知识的多模态推理基准

Yuanchi Zhu, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Xinqi Yang, Hebao Zhu, Bokai Zhao, Tianyu Liang, Ziliang Wang, Faqiang Qian, Yunli Yang, Weiyang Shi, Qibing Ren

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 SafeSceneReason是关联工业危害与事故知识的多模态推理基准,含两类问答对,评估发现现有视觉-语言模型在工业安全推理上存显著弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09121 2026-08-11 cs.AI 新提交 79%

MELLON - Multimodal Enhanced LLM for Online Navigation

MELLON——面向在线导航的多模态增强型大语言模型

Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08736 2026-08-11 cs.AI 新提交 79%

FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

FitAQA:面向多模态大语言模型的健身动作质量评估基准

Kaili Zheng, Kaiwen Wang, Xun Zhu, Qingyuan Yang, Chenyi Guo, Ji Wu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本研究推出FitAQA基准,含2219个视频等数据,设计三项评估任务,发现当前MLLMs评估健身动作质量及定位错误存在瓶颈,视觉感知是关键瓶颈,相关数据和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交 79%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07543 2026-08-11 cs.CV cs.AI 新提交 79%

Performance of large language models in the optical diagnosis of colorectal polyps

大型语言模型在结直肠息肉光学诊断中的性能

Joshua C. Vences, William T. Tran, Nikko Gimpaya, Catharine M. Walsh, Rishad J. Khan, Robert Bechara, Asher C. Wiggins, Celine N. Rousan, Kaitlyn V. G. L. Morgado, Angie Ibrahim, Kevin H. M. Kuo, Daniel von Renteln, Alexander Hann, Dennis L. Shung, Michael A. Scaffidi, Charles Ménard, Joshua Landy, Samir C. Grover

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究评估Claude Opus 4等5款大型语言模型对结直肠息肉的光学诊断性能,发现其区分息肉亚型的准确率接近专家共识,但灵敏度与特异度未达ESGE标准,需进一步研究方可临床应用。

Comments 22 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09434 2026-08-11 quant-ph 新提交 78%

Birefringent Biomineral Microcarriers Stabilise Multimodal Nanodiamond Quantum Sensing in Liquids

双折射生物矿物微载体稳定液体中的多模态纳米金刚石量子传感

T. Amro, M. Attrash, A. Droby, A. Ushkov, R. Malkinson, P. Penshin, A. Hen, V. Bobrovs, P. Ginzburg, H. Barhum, N. Bar-Gill

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本研究利用双折射球文石微球作为载体,组装氮空位纳米金刚石,开发杂化平台实现液体中多模态量子传感,可用于磁场与质子浓度、pH值检测,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09573 2026-08-11 cs.CV 新提交 77%

VideoVIBE: A Video-Grounded Diagnostic Benchmark for One-Shot Interactive Website Generation

VideoVIBE:用于一次性交互式网站生成的基于视频的诊断基准

Jiajun Xu, Yanghao Zhou, Jingyun Liao, Yu Bai, Jinxing Zhou, Chengliang Liu, Changsen Yuan, Bo Wang, Qian Liu

专题命中 多模态评测 :MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 针对现有一次性交互式网站生成质量评估的不足,提出VideoVIBE基准与V2Lens多智能体系统,实验显示V2Lens可提升Video MLLM的评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05137 2026-08-11 cs.CV 版本更新 77%

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

SmartMage:面向3D场景理解的动态模态编排

Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan

机构 * Zhejiang University(浙江大学) Stanford University(斯坦福大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文针对现有MLLMs采用固定模态组合的缺陷,提出SmartMage模型,通过SMART和MAGE模块动态编排模态,在5个3D场景理解基准上取得最优性能,在RGB视频理解基准上表现具竞争力。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08859 2026-08-11 cs.LG cs.AI 新提交 74%

Agentic Anomaly Detection with ORCA-Style Dynamic Inductive Bias Adaptation in Multimodal Wearable Time Series Data

基于ORCA风格动态归纳偏差自适应的多模态可穿戴时间序列智能体异常检测

Anushka Roy, Jyotirmoy Singh, Shreea Bose, Chittaranjan Hota

机构 * BITS Pilani(皮尔尼理工学院)

专题命中 多模态评测 :multimodal(title);分类 cs.AI

AI总结 该研究针对资源受限的非平稳生理时间序列异常检测问题,提出ORCA框架,通过监督控制器动态调整时间感受野,在WBAN和MIMIC-IV数据集上实现稳健性能,无需预调时间范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07590 2026-08-11 stat.AP q-bio.QM 新提交 71%

Uncertainty-Aware Missing-Data Multimodal Latent for Fetal-Growth Analysis

用于胎儿生长分析的不确定性感知缺失数据多模态潜在模型

Tiago Cortinhal, César Díaz-Parga, Gabriel Bernardino, Marta Nuñez-Garcia

专题命中 多模态评测 :multimodal(title)

AI总结 该研究提出线性高斯因子模型,对977例胎儿的四类测量数据拟合后发现测量模块几乎独立,可通过边缘化缺失值得到反映可用数据不确定性的生长谱,其重建残差还可用于数据质量筛选。

Comments https://github.com/TiagoCortinhal/fgr-geometry

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08641 2026-08-11 cs.CR 新提交 71%

Whose Refusal Is It? The Unmeasured Contribution of Black-Box Multimodal Guardrails

这是谁的拒绝?黑盒多模态安全护栏的未被衡量的贡献

Haoyu Zhang, Xiao Luo, Haowen Xu, Yi Feng, Shibo Zheng, Mohammad Zandsalimy, Shanu Sushmita

专题命中 多模态评测 :multimodal(title)

AI总结 该研究指出黑盒多模态安全护栏的评估指标混淆了护栏与目标模型的弃权贡献,通过实验揭示了有效载荷通道和内部读取文本对护栏贡献的影响,并修正了相关评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03903 2026-08-11 cs.CL 版本更新 70%

CC-OCR V2: Fine-Grained Attribution of LMM Failures in Real-World Visual Document Understanding

CC-OCR V2:真实场景视觉文档理解中多模态大模型失效的细粒度归因

Chunyi Peng, Zhipeng Xu, Yuqi Xiong, Zulong Chen, Junhao Ji, Qing Liu, Zhenghao Liu, Zubao Qin, Bing Zhao, Jianqiang Wan, Jun Tang, Zhibo Yang, Shuai Bai, Dayiheng Liu, Maosong Sun

专题命中 多模态评测 :multimodal(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对真实文档采集条件下多模态大模型(LMMs)的失效归因问题,构建了含7093个样本的CC-OCR v2基准,经17个LMMs实验发现,基准性能与实际部署可靠性存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09519 2026-08-11 cs.CV cs.LG 新提交 70%

XFeat Revisited: Reproducibility and Evaluation of a Lightweight Image Matcher

XFeat 再探讨:轻量级图像匹配器的可复现性与评估

Lazar Đoković, Aimee Lin

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究复现并评估轻量级图像匹配器XFeat,发现其在部分基准数据集上表现接近或优于原始检查点,同时揭示其架构设计的局限性及跨模态匹配的性能边界。

Comments 21 pages, 6 figures. Published in Transactions on Machine Learning Research (TMLR); Reproducibility Certification

Journal ref Transactions on Machine Learning Research, August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09374 2026-08-11 cs.AI cs.CV 新提交 62%

CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Circuits

CircuitReason-1k:电路中的长程视觉到符号推理基准测试

Xinqi Yang, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CircuitReason-1k是含1000个真实教材电路问题的基准,用于评估多模态模型的长程视觉到符号推理,现有模型在长程问题上表现差,该基准为相关测试提供了聚焦平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09296 2026-08-11 cs.AI cs.CV cs.LG cs.RO 新提交 62%

CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly Reasoning, and Physics Simulation

CADEngBench:它看起来像CAD,但真的能用吗?——参数化设计、装配推理与物理仿真的评估

Harmanjot Singh, Abhra Dubey, Jorge Alejandro Amador Herrera

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CADEngBench双轨基准,从参数化设计、装配推理等维度评估8种多模态代码模型,发现编辑现有CAD更易,复杂编辑与匹配FEA仍难,装配预测存在缺陷,强调CAD评估需关注工程行为而非外观。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08135 2026-08-11 cs.CV cs.AI 新提交 62%

Compositional Cross-Modality Translation via Whole-Volume Multitask Latent Flow Matching

基于全容积多任务潜在流匹配的组合跨模态医学图像转换

Daniele Molino, Alessio Zoboli, Camillo Maria Caruso, Valerio Guarrasi, Paolo Soda

机构 * Università Campus Bio-Medico di Roma(罗马 Campus Bio-Medico 大学) Umeå University(于默奥大学) UniCamillus – Saint Camillus International University of Health Sciences(UniCamillus – 圣卡米勒斯国际健康科学大学)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出基于全容积多任务潜在流匹配的方法,解耦容积先验与跨模态映射目标,训练单个多任务模型实现跨/模态内转换,在全容积处理、零样本泛化等方面优于基线,为合成系统泛化提供可扩展途径。

Comments Accepted ad Sashimi 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05098 2026-08-11 cs.CV cs.AI 版本更新 62%

Beyond Pixels: Benchmarking and Reward-Based Assessing Framework for Visual Spatial Aesthetics

SA-IQA: 重新定义空间美学的图像质量评估:多维奖励

Yuan Gao, Jin Song, Yiyun Fei, Gongzhe Li, Ruigao Yang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SA-IQA通过多维奖励框架系统评估室内场景的美学质量,利用SA-BENCH基准提升AIGC生成流程和图像质量。

Comments Accepted to CVPRW 2026. Code: https://github.com/AlibabaResearch/SA-IQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18587 2026-08-11 cs.CV cs.AI 版本更新 62%

HyperFake: Hyperspectral Reconstruction and Attention-Guided Analysis for Advanced Deepfake Detection

HyperFake:用于高级深度伪造检测的高光谱重建与注意力引导分析

Pavan C Shekar, Pawan Soni, Vivek Kanhangad

机构 * Department of Electrical Engineering, Indian Institute of Technology Indore(印度理工学院印度尔分校电子工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 HyperFake是首个利用高光谱成像重建的深度伪造检测方法,通过改进的MST++架构、光谱注意力机制与EfficientNet分类器,从RGB视频重建31通道高光谱数据,实现了更准确且泛化性更强的深度伪造检测。

Comments 6 pages, 3 figures, 1 table. Preliminary results on FaceForensics++ dataset. First approach to use hyperspectral reconstruction for deepfake detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09285 2026-08-11 eess.SP cs.AI 新提交 57%

GLocFM: A Geometry-Aware Foundation Model for 3D Indoor Wireless Localization

GLocFM:面向三维室内无线定位的几何感知基础模型

Chenghong Bian, Chaozheng Wen, Hongze Chen, Jun Zhang

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 该研究针对现有学习式无线定位器无法利用环境几何信息的问题,提出GLocFM模型,联合利用WiFi测量与三维点云场景几何,在两类数据集上较基线降低近50%定位误差,鲁棒性与有效性经消融实验验证。

Comments 13 pages, single column

详情

展开后加载摘要…

URL PDF HTML 收藏