arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-20 至 2026-08-20 共收录 19 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 19 篇

2608.04759 2026-08-20 cs.CV cs.CL 版本更新 86%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18591 2026-08-20 cs.AI cs.CL 新提交 81%

Can a Lightweight Multimodal Model Estimate LLM Reasoning Performance? A Study for Compute-Optimal Document Inference

轻量级多模态模型能否评估LLM的推理性能?一项面向计算最优文档推理的研究

Zishan Ahmad, Vishal Vaddina

机构 * Phi Labs(菲实验室) Quantiphi(宽梯斐科技)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出轻量级多模态模型DRB,基于新基准BudgetDoc实现文档任务中LLM推理预算的动态分配,在降低成本的同时多数情况下达到或优于固定最大预算的性能,具备跨模型泛化潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18586 2026-08-20 cs.CV cs.AI 新提交 81%

OmniHandwritingOCR: A Diagnostic Benchmark for Evaluating Multimodal LLMs in Handwritten OCR Scenarios

OmniHandwritingOCR:用于评估多模态大语言模型在手写OCR场景中表现的诊断基准

Zinuo Guo, Min Zhang, Bo Jiang

机构 * East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究推出OmniHandwritingOCR手写OCR诊断基准,评估13个多模态模型,发现其在复杂公式上表现差且存在幻觉,为诊断模型失效模式提供测试平台。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18317 2026-08-20 cs.CV cs.RO 新提交 80%

Reproducible Multimodal Affordance Prediction

可复现的多模态可供性预测

Tommaso Apicella, Alessio Xompero, Andrea Cavallaro

机构 * Istituto Italiano di Tecnologia(意大利技术研究院) EPFL(洛桑联邦理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对可供性预测方法评估难的问题,本文提出Affordance Sheet以规范任务表述等信息,实现可供性模型的可复现基准测试与现实场景可靠评估。

Comments Paper accepted to Workshop on Human-Centered Multimodal Intelligence in the Wild (HCMIW) in European Conference on Computer Vision (ECCV) 2026; 18 pages, 3 figures, 7 tables. Project webpage at this https URL (https://apicis.github.io/aff-sheet)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18096 2026-08-20 cs.CL cs.LG 新提交 79%

MAVEN: A Macro-Societal Value Evaluation Framework of Multimodal Content with Compact Aligned Evaluators

MAVEN:基于紧凑对齐评估器的多模态内容宏观社会价值评估框架

Zijuan Zhao, Zheren Fu, Hou Xia, Licheng Zhang, Yi Liu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 针对多模态内容宏观社会价值评估难题,提出MAVEN分层框架,构建相关基准与指标,优化评估器,实验表明其2B评估器表现接近前沿闭源VLMs,提供了可扩展评估路径。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15265 2026-08-20 cs.AI 版本更新 79%

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?

VibeWorlding:多模态智能体能否端到端构建3D开放世界?

Yansong Ning, Jingwen Ye, Zhongkai Wu, Yang Sun, Yiqin Zhu, Xingyi Li, Weidong Zhang, Hao Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯) AI Thrust TEG AIPD

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究提出VibeWorlding框架,构建VWE-BENCH基准与VibeWorlding-Gym框架,发现当前前沿MLLMs在3D开放世界构建任务中表现不佳,经RL训练的VibeWorlder模型可提升性能,旗舰模型VibeWorlder-30B-A3B表现最优。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17809 2026-08-20 cs.CV 版本更新 79%

Million-scale multimodal pollen microscopy with expert-guided foundation models

百万级多模态花粉显微镜图像与专家引导的基础模型

András Biricz, Björn Gedda, Donát Magyar, Antonio Spanu, János Fillinger, Péter Pollner, István Csabai

机构 * Department of Physics of Complex Systems, ELTE Eötvös Loránd University(ELTE罗兰大学复杂物理系) The Palynological Laboratory at the Swedish Museum of Natural History(瑞典自然历史博物馆孢粉学实验室) National Centre for Public Health and Pharmacy(国家公共卫生与药品中心) INRAE, UR 546 BioSP, Site Agroparc(法国国家农业、食品与环境研究院,UR 546 BioSP,阿格罗帕克园区) National Korányi Institute for Pulmonology(国家科拉尼肺病研究所) Health Data Science and AI Knowledge Centre, Health Services Management Training Centre, Faculty of Health and Public Administration, Semmelweis University(塞梅维什大学健康与公共管理学院卫生服务管理培训中心健康数据科学与人工智能知识中心) Department of Biological Physics, ELTE Eötvös Loránd University(ELTE罗兰大学生物物理系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出百万级多模态花粉显微镜数据集Pollen AI Atlas,结合专家引导的视觉-语言模型生成形态描述,实现跨区域、跨设置的高精度花粉识别与检索。

Comments 31 pages, 5 main figures, supplementary information included. Submitted to Scientific Reports. v2: clarified reporting of taxonomic scope, captioning settings, backbone configuration, and evaluation details; no changes to numerical results or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13068 2026-08-20 cs.CV cs.LG 版本更新 79%

Eyes on the Image: Gaze Supervised Multimodal Learning for Chest X-ray Diagnosis and Report Generation

聚焦图像:用于胸部X光诊断与报告生成的注视监督多模态学习

Tanjim Islam Riju, Shuchismita Anwar, Saman Sarker Joy, Farig Sadeque, Swakkhar Shatabda

机构 * Department of Computer Science and Engineering, Brac University(计算机科学与工程系,布拉克大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究基于MIMIC-Eye数据集构建两阶段多模态框架,引入注视监督提升胸部X光诊断准确率与报告空间可解释性,为该领域提供了可复现的新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19195 2026-08-20 astro-ph.SR 新提交 78%

JW-FD: A Long Horizon Multimodal Solar Flare Forecasting Dataset

JW-FD:一个长时程多模态太阳耀斑预报数据集

Shao Mingfu, Lin Jiaben, Wang Hui, Tong Liyue, Yang Chen, Zhang Yin, Li Yuyang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对太阳耀斑预报的长时程数据需求,构建含3064个活动区的15年多模态数据集JW-FD,采用活动区分层划分避免时间泄漏,经Transformer实验确定Bth=1000 G为≥C1.0级耀斑预报的初步默认磁饱和阈值。

Comments 10 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19192 2026-08-20 astro-ph.SR 新提交 78%

JW-SSD: A Multimodal Benchmark Dataset for Fine-Grained Sunspot Classification

JW-SSD:用于细粒度太阳黑子分类的多模态基准数据集

Hui Wang, Mingfu Shao, Luyang Li, Jiaben Lin, Liyue Tong, Chen Yang, Zhanji Wei

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究提出用于太阳黑子细粒度磁型分类的多模态基准数据集JW-SSD,经质量控制后含36553对图像,可用于训练多种模型,包括取得高准确率的JW-SunSpot。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12745 2026-08-20 cs.LG cs.DC 版本更新 78%

A Cloud-Edge System for Multimodal Clinical Screening in Resource-Constrained Rural Settings

面向资源受限农村地区多模态临床筛查的云边协同系统

Hei Ting (Una) Chan, Chenwei Wu, Xueshen Liu, Zesen Zhao, Boyuan Zheng, Luis Filipe Nakayama, Michael G. Morley, Liyue Shen, Jiasi Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对资源受限农村地区的多模态临床筛查问题,提出云边协同架构,经实验验证其诊断性能优异且成本更低,可适配部署约束。

Comments 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18311 2026-08-20 cs.CV cs.AI cs.LG 新提交 73%

FedCoRe: Target-Adaptive Completion for Missing Modalities in Healthcare Federated Learning

FedCoRe:医疗联邦学习中针对缺失模态的目标自适应补全方法

Holger R. Roth, Ziyue Xu, Peter Cnudde

机构 * NVIDIA(英伟达)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对医疗联邦学习中客户端存在缺失模态的问题,提出FedCoRe框架,通过学习表示或对数空间修正,在呼吸恶化任务中恢复了ECG和CXR缺失导致的部分性能损失。

Comments Accepted to the 7th Workshop on Distributed, Collaborative & Federated Learning, DeCaF 2026, MICCAI, Strasbourg, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18579 2026-08-20 cs.CV cs.AI 新提交 62%

MR-IQA-2: Faithful Image Quality Reflection via Fine-Grained Credit Assignment

MR-IQA-2:通过细粒度信用分配实现真实的图像质量反映

Yuan li, Youyuan Lin, Chenhui Chu, Shin'ya Nishida

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对现有盲图像质量评估(IQA)中推理真实性不足的问题,提出MR-IQA-2框架,通过解耦推理与评分的细粒度信用分配,在IQA基准上实现了与人类评分的竞争性对齐,还能提供更丰富的视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18438 2026-08-20 cs.CL cs.AI cs.LG 新提交 62%

Pedagogical AI in Mental Health: A Tri-Stream Fine-Tuned LLM Framework for Automated Clinical Supervision and Risk Triage

心理健康领域的教学式AI:用于自动化临床监督与风险分诊的三通路微调大语言模型框架

Shreeya Sharma, Ravish Gupta, Saket Kumar, Abhishek Aggarwal

机构 * Microsoft(微软) BigCommerce University at Buffalo, The State University of New York(纽约州立大学布法罗分校) Amazon(亚马逊)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对精神医疗的监督缺口,提出三通路微调Mistral-7B-instruct框架,实现自动化临床监督与风险分诊,提升效率并解决冷启动问题。

Comments 14 pages, 1 figure, 2 tables. Accepted for publication in AICTC 2026, Lecture Notes in Networks and Systems, vol. 2165, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17514 2026-08-20 cs.CV cs.MM 版本更新 62%

SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment

SE-MoLoRA:用于特定领域摄影评估的共享专家LoRA适配器

Bishwash Khanal, Anlan Zhang, Sasu Tarkoma, Tommi Mikkonen, Abhishek Kumar

机构 * Faculty of Information Technology(信息技术学院) University of Jyväskylä(于韦斯屈莱大学) Adobe Research(奥多比研究院) University of Helsinki(赫尔辛基大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出SE-MoLoRA框架,通过共享LoRA专家与路由适配器解耦通用摄影知识和专业判断,在摄影评论生成任务上显著提升BERTScore-F1,且更受偏好、参数更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18627 2026-08-20 cs.CV 新提交 57%

PCQA-R1: Advancing Generalized 3D Point Cloud Quality Assessment with Reinforcement Learning

PCQA-R1:基于强化学习的通用三维点云质量评估方法

Kangning Ye, Yunhao Li, Sijing Wu, Yucheng Zhu, Guangtao Zhai

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出首个用于三维点云质量评估的强化学习LMM PCQA-R1,基于GRPO策略构建PCQA-CoT数据集并引入高斯 proximity 奖励,在跨数据集泛化和域内准确率上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18188 2026-08-20 cs.LG cs.AI 新提交 57%

A systematic review of machine learning techniques to address diagnosis and treatment of autism: challenges and opportunities

解决自闭症诊断与治疗的机器学习技术系统综述:挑战与机遇

Rafael Muñoz-Terol, Jesús Peral, Sandra Amador, David Gil

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本系统综述分析2017-2023年55项研究,探究ML在ASD诊断治疗的应用,指出监督学习为主、深度学习作用扩大,需整合多模态数据并加强跨学科合作。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18701 2026-08-20 cs.RO 新提交 50%

SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation

SoftVTBench:面向可变形物体操作的形变感知视觉-触觉数据集与基准

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) Tsinghua University(清华大学) Southeast University(东南大学) Stevens Institute of Technology(斯蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI Imperial College London(帝国理工学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究推出SoftVTBench视觉-触觉数据集与基准,定义形变感知成功率(DSR),发现触觉信息本身未必提升多模态融合,为可变形物体操作的物理交互研究提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02592 2026-08-20 cs.CY 版本更新 50%

AI Fact-Checking in the Wild: A Field Evaluation of LLM-Written Community Notes on X

在野中的AI事实核查:在X平台上的LLM生成社区笔记现场评估

Haiwen Li, Michiel A. Bakker

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文首次在X平台现场评估LLM生成的社区笔记,通过三个月的测试发现LLM笔记在不同政治立场的评价者中获得更高正面评分,证明其在事实核查中的广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏