arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-20 至 2026-05-20 共收录 94 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 13 篇

2605.18835 2026-05-20 cs.LG 78%

StampFormer: A Physics-Guided Material-Geometry-Coupled Multimodal Model for Rapid Prediction of Physical Fields in Sheet Metal Stamping

StampFormer: 一种基于物理的材料-几何耦合多模态模型,用于快速预测冲压板料的物理场

Jiajie Luo, Mohamed Mohamed, Osama Hassan, Haosu Zhou, Yingxue Zhao, Haoran Li, Xinrun Li, Zhutao Shao, Yang Long, Nan Li, Jichun Li

机构 * Dyson School of Design Engineering, Imperial College London(帝国理工学院设计工程学院) School of Computing, Newcastle University(新castle大学计算机学院) Department of Computing, Imperial College London(帝国理工学院计算系) Multi-X Solution Limited(Multi-X解决方案有限公司) Department of Computer Science, Durham University(达勒姆大学计算机科学系) Department of Mechanical Engineering, Faculty of Engineering, Helwan University(Helwan大学工程学院机械工程系)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出StampFormer模型,通过结合材料和几何信息,实现对冲压板料物理场的快速准确预测,从而提高设计效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11010 2026-05-20 cs.IR cs.DL 78%

GovScape: A Public Multimodal Search System for 70 Million Pages of Government PDFs

GovScape:一个公共的多模态搜索系统,用于7000万页的政府PDF文件

Ying-Hsiang Huang, Claire Gong, Shreya Shaji, Alison Yan, Leslie Harka, Albert Du, Anjali Gopal, Samuel J Klein, Shannon Zejiang Shen, Mark Phillips, Trevor Owens, Kyle Deeds, Benjamin Charles Germain Lee

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出GovScape,一个支持多模态搜索的公共系统,用于搜索7000万页的政府PDF文件,展示了其在大规模PDF数据处理中的高效性和可扩展性。

Comments 11 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19436 2026-05-20 cs.LG cs.CL cs.CV 62%

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

CEPO: 使用对比证据策略优化进行RLVR自蒸馏

Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan

机构 * MBZUAI Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出CEPO,通过对比证据策略优化解决RLVR中自蒸馏的问题,通过区分关键推理步骤与填充内容来提升模型性能。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04065 2026-05-20 cs.CV cs.IR cs.MM 62%

Enabling Collaborative Parametric Knowledge Calibration for Retrieval-Augmented Vision Question Answering

使检索增强的视觉问答实现协作参数知识校准

Jiaqi Deng, Kaize Shi, Zonghan Wu, Huan Huo, Dingxian Wang, Guandong Xu

机构 * University of Technology Sydney(悉尼大学) East China Normal University(华东师范大学) The Education University of Hong Kong(香港教育大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出了一种统一的检索增强视觉问答框架,通过协作参数知识校准来充分利用KB-VQA中的跨任务协同效应,从而提升问答准确性。

Comments 10 pages, 5 figures, Under Review

Journal ref Knowledge-Based Systems, 8 July 2026, Volume 346

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13193 2026-05-20 cs.CV 57%

FIKA-Bench: From Fine-grained Recognition to Fine-Grained Knowledge Acquisition

FIKA-Bench: 从细粒度识别到细粒度知识获取

Geng Li, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FIKA-Bench,一个包含311个公开来源和现实实例的细粒度知识获取基准,通过过滤和审计确保实例质量,评估最新多模态模型和代理发现细粒度识别任务仍具挑战性,需改进代理设计以提升知识获取能力。

Comments Project page with code: https://ligeng0197.github.io/FIKA-Bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25722 2026-05-20 cs.CV cs.LG 57%

No Hard Negatives Required: Concept Centric Learning Leads to Compositionality without Degrading Zero-shot Capabilities of Contrastive Models

无需硬负样本:基于概念的学习在不降低对比模型零样本能力的情况下实现组合性

Hai X. Pham, David T. Hoffmann, Ricardo Guerrero, Brais Martinez

机构 * Samsung AI Center(三星人工智能中心)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种基于概念的学习方法,无需使用硬负样本即可在不损害对比模型零样本和检索能力的情况下实现组合性,通过简单的方法改进了文本和图像编码器的全局池化问题。

Comments Accepted at CVPR 2026. 2nd rev: update github repo URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19734 2026-05-20 cs.CV 57%

GeoMamba: A Geometry-driven MambaVision Framework and Dataset for Fine-grained Optical-SAR Object Retrieval

GeoMamba: 一种基于几何的MambaVision框架及数据集,用于细粒度光学-雷达目标检索

Tiantong Fang, Xiuwei Wang, Jing Xiao, Wujie Zhou, Liang Liao, Mi Wang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) School of Artificial Intelligence and Information Engineering, Zhejiang University of Science & Technology(浙江科技大学人工智能与信息工程学院) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GeoMamba框架,通过引入几何特征注入模块和几何一致性约束模块,提升光学-雷达细粒度目标检索的鲁棒性,并构建了新的FGOS-as数据集来评估跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18763 2026-05-20 cs.IR cs.AI 57%

Query-Conditioned Graph Retrieval for Contextualized LLM Reasoning in Personalized Wearable Data

基于查询的图检索用于个性化可穿戴数据中的上下文化LLM推理

Zhenyu Lu, Mahyar Abbasian, Amir M. Rahmani

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Irvine(加州大学 Irvine 分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出WAG框架,通过图检索实现LLM在可穿戴数据中的上下文化推理,通过构建个性化知识图谱并检索查询条件子图,提高推理效率和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19902 2026-05-20 cs.LG q-bio.QM 50%

Hierarchical Contrastive Learning for Multi-Domain Protein-Ligand Binding

多领域蛋白质-配体结合的分层对比学习

Shuo Zhang, Rongqi Hong, Huifeng Zhang, Jian K. Liu

机构 * University of Birmingham, UK(英国伯明翰大学)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本研究提出HCLBind框架,通过分层对比学习方法,解决多领域蛋白质-配体结合亲和力预测问题,核心方法是分离几何表示学习与亲和力回归,并采用新颖的分层诱饵策略,结合领域门控图注意力网络和跨模态注意力,提升领域界面优先级,实验表明HCLBind能有效学习判别界面特征并提供鲁棒的不确定性估计。

Comments Accepted by ISBRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19752 2026-05-20 cs.LG 50%

MSAlign: Aligning Molecule and Mass Spectra Foundation Models for Metabolite Identification

MSAlign: 用于代谢物鉴定的分子和质谱基础模型对齐方法

Paul Krzakala, Gabriel Melo, Camille Lançon, Charlotte Laclau, Rémi Flamary, Etienne Thévenot, Florence d'Alché-Buc

机构 * LTCI, Télécom Paris & CMAP, Ecole Polytechnique, Institut Polytechnique de Paris(LTCI,巴黎电信学院及巴黎高等技术学院的联合机构,CMAP,巴黎高等理工学院,巴黎高等技术学院) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎高等技术学院) CEA, INRAE, MetaboHUB, Université Paris-Saclay(CEA,国家核能研究中心,法国农业研究机构,代谢组学枢纽,巴黎萨克雷大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本研究提出MSAlign方法,通过多模态对齐技术对齐分子和质谱基础模型,以提高代谢物鉴定的准确性,并解决了数据分割策略中的分布偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 14 篇

2505.17726 2026-05-20 cs.CV cs.AI 93%

Slot-MLLM: Object-Centric Visual Tokenization for Multimodal LLM

Slot-MLLM: 多模态大语言模型中的面向对象视觉标记化

Donghwan Chi, Hyomin Kim, Yoonjin Oh, Yongjin Kim, Donghoon Lee, Daejin Jo, Jongmin Kim, Junyeob Baek, Sungjin Ahn, Sungwoong Kim

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系) Kakao Corp(Kakao公司) School of Computing, KAIST(韩国科学技术院计算机学院)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种面向对象的视觉标记化方法Slot-MLLM,通过基于Slot Attention的标记器,有效编码局部视觉细节并保持高层语义,从而提升多模态大语言模型在视觉内容理解和生成中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20090 2026-05-20 cs.CV 85%

MetaEarth-MM: Unified Multimodal Remote Sensing Image Generation with Scene-centered Joint Modeling

MetaEarth-MM:基于场景中心联合建模的多模态遥感图像生成

Zhiping Yu, Chenyang Liu, Jinqi Cao, Qinzhe Yang, Siwei Yu, Zhengxia Zou, Zhenwei Shi

机构 * Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(航天智能科学与技术系,航天学院,北京航空航天大学) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Shenyuan Honors College, Beihang University(Shen Yuan荣誉学院,北京航空航天大学)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);cross-modal(abstract);any-to-any(abstract)

AI总结 本文提出MetaEarth-MM模型,通过统一的多模态遥感图像生成框架,实现多模态图像的联合生成和任意模态之间的转换,展示了其在多模态遥感观测中的强大生成能力和广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19798 2026-05-20 cs.CL 79%

Towards Trust Calibration in Socially Interactive Agents: Investigating Gendered Multimodal Behaviors Generation with LLMs

迈向社交互动代理的信任校准:探究LLMs生成性别化的多模态行为生成

Lucie Galland, Chloé Clavel, Magalie Ochs

机构 * LIS Laboratory, Amu(LIS实验室,Amu) Inria Paris(Inria巴黎)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL

AI总结 本文研究了LLMs生成多模态行为以反映能力与善意的不同层次,探讨了性别对行为生成的影响,并通过用户研究验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11234 2026-05-20 cs.CV 79%

RoomPilot: Controllable Indoor Scene Synthesis via Multimodal Semantic Parsing

RoomPilot: 通过多模态语义解析实现可控的室内场景合成

Wentang Chen, Shougao Zhang, Yiman Zhang, Tianhao Zhou, Ruihui Li

机构 * School of Information Science and Engineering, Hunan University(信息科学与工程学院,湖南大学)

专题命中 多模态生成 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 该研究提出RoomPilot框架,通过多模态语义解析实现可控的室内场景合成,解决了现有方法输入模态有限和生成过程隐式的问题,提高了场景结构和语义的可控性。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20147 2026-05-20 cs.CV 70%

PixVerve: Advancing Native UHR Image Generation to 100MP with a Large-Scale High-Quality Dataset

PixVerve:通过大规模高质量数据集将原生超高清图像生成推至100MP

Haojun Chen, Haoyang He, Chengming Xu, Qingdong He, Junwei Zhu, Yabiao Wang, Zhucun Xue, Xianfang Zeng, Zhennan Chen, Xiaobin Hu, Hao Zhao, Yong Liu, Jiangning Zhang, Dacheng Tao

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出PixVerve-95K数据集,通过精心设计的数据管道构建,包含95K张高分辨率图像和七维标注,用于推动超高清图像生成技术,通过三种训练方案将T2I基础模型扩展到100MP生成,并建立PixVerve-Bench评估协议。

Comments Project page is available at https://haojunchen663.github.io/projects/PixVerve/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16819 2026-05-20 cs.CV 57%

Character-Centered Dialogue Generation from Scene-Level Prompts

从场景级提示生成以角色为中心的对话

Taewon Kang, Ming C. Lin

机构 * University of Maryland at College Park, United States(马里兰大学学院市分校,美国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出了一种模块化流程,将动作级提示转化为视觉和听觉上一致的对话,丰富了基于场景的故事叙述。通过预训练的视觉-语言编码器提取高级视觉语义,并结合结构化提示引导大型语言模型生成对话。引入递归叙述银行以保持跨场景的上下文和情感一致性,最终生成具有表现力的角色条件语音,产生完整的视听叙事。

Comments Accepted to the 2026 IEEE International Conference on Image Processing (ICIP 2026). 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19726 2026-05-20 cs.CV 57%

Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention

通过块近似稀疏注意力实现扩散语言模型的高效长上下文建模

Wenhu Zhang, Yiming Wu, Huanyu Wang, Yaoyang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种块近似稀疏注意力框架(BA-Att),通过块级预下采样操作识别信息区域,避免依赖脆弱的位置先验,从而在保持高性能的同时提升计算效率,实验表明其在注意力计算上比FlashAttention快6.95倍,并在50%稀疏度下保持接近全注意力性能。

Comments CVPR 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19639 2026-05-20 cs.CV 57%

Benchmarking and Evolving Reason-Reflect-Rectify for Reflective Visual Generation

基于反思生成的基准测试与进化

Junjie Wang, Xinghua Lou, Jason Li, Ye Tian, Keyu Chen, Yulin Li, Bin Kang, Jacky Mai, Yanwei Li, Zhuotao Tian, Liqiang Nie

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出R^3-Bench基准和R^3-Refiner框架,用于评估和提升反思视觉生成能力,通过改进迭代推理和修正能力,提升文本到图像模型的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19250 2026-05-20 cs.AI 57%

Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination

因果证据:模态冲突幻觉中的注意力头不平衡

Jinrui Jiang, Zhangtai Wu, Zhen Wu, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Artificial Intelligence(人工智能学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在模态冲突中产生幻觉的原因,通过分析注意力头的因果作用,发现驱动幻觉的头部分布更广且权重更大,而抑制幻觉的头部集中在少量重要头部,提出MACI方法在减少幻觉的同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14530 2026-05-20 cs.CV 57%

Mitigating Mask Prior Drift and Positional Attention Collapse in Large Diffusion Vision-Language Models

缓解大扩散视觉-语言模型中的遮蔽先验漂移和位置注意力崩溃

Sujung Hong, Chanyong Yoon, Seong Jae Hwang

机构 * Department of Artificial Intelligence, Yonsei University, Seoul, Republic of Korea(首尔大学人工智能系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了大扩散视觉-语言模型在长形式生成中的重复生成和视觉 grounding 退化问题,提出了一种无需训练的解决方案来缓解遮蔽先验漂移和位置注意力崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04776 2026-05-20 cs.CY cs.CL 57%

Quantifying the Climate Risk of Generative AI: Region-Aware Carbon Accounting with G-TRACE and the AI Sustainability Pyramid

量化生成式人工智能的气候风险:基于G-TRACE和AI可持续性金字塔的区域感知碳核算

Zahida Kausar, Seemab Latif, Raja Khurram Shahzad, Mehwish Fatima

机构 * School of Electrical Engineering and Computer Science (SEECS), National University of Sciences and Technology (NUST), Islamabad, Pakistan(电气工程与计算机科学学院(SEECS),国家科学与技术大学(NUST),巴基斯坦伊斯兰阿巴德)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出G-TRACE框架,用于量化生成式人工智能在不同模态和部署地区的训练和推理相关排放,并通过AI可持续性金字塔模型提出七级治理框架,以指导可持续的人工智能部署。

Comments 27 page, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03824 2026-05-20 cs.LG cs.AI stat.ML 57%

Proximal Diffusion Neural Sampler

近端扩散神经采样器

Wei Guo, Jaemoo Choi, Yuchen Zhu, Molei Tao, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一种名为近端扩散神经采样器(PDNS)的框架,通过在路径测度空间上应用近端点方法,解决神经采样器在训练过程中遇到的多模式目标分布和模式崩溃问题,通过分阶段的简单子问题逐步逼近目标分布,促进模式的全面探索。

Comments Accepted at ICLR 2026 (https://openreview.net/forum?id=XTHQqS7ObC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19707 2026-05-20 stat.ML cs.LG stat.CO stat.ME 50%

Diffusion and Flow-based Copulas: Forgetting and Remembering Dependencies

扩散与流基copula:遗忘与记忆依赖

David Huk, Theodoros Damoulas

机构 * Department of Statistics(统计系) Department of Computer Science(计算机科学系) University of Warwick(沃里克大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于扩散和流原理的copula建模方法,通过遗忘和记忆依赖机制,有效建模多变量依赖,提升了copula模型的表示能力,适用于复杂和高维数据。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18959 2026-05-20 astro-ph.IM astro-ph.CO astro-ph.EP astro-ph.GA cs.LG 50%

Hyrax: An Extensible Framework for Rapid ML Experimentation and Unsupervised Discovery in the Era of Rubin, Roman, and Euclid

Hyrax:一个用于快速机器学习实验和无监督发现的可扩展框架,在Rubin、Roman和Euclid时代

Aritra Ghosh, Drew Oldag, Michael Tauraso, Andrew J. Connolly, Peter Ferguson, Derek Jones, Gourav Khullar, Argyro Sasli, Samarth Venkatesh, Gracia Wang, Maxine West, Dylan Berry, Neven Caplar, Colin Orion Chandler, Tanawan Chatchadanoraset, Michael W. Coughlin, Melissa DeLucchi, Alexandra Junell, Diego Miura, Felipe Fontinele Nunes, Wilson Beebe, Doug Branton, Sandro Campos, Liam Cunningham, Mi Dai, Jeremy Kubica, Konstantin Malanchev, Rachel Mandelbaum, Sean McGuire, Imad Pasha, Dan S. Taranu, Tianqing Zhang

机构 * Dept. of Astronomy \& the DiRAC Institute, University of Washington, Box 351580, Seattle, WA 98195, USA School of Physics Astronomy, University of Minnesota, Minneapolis, MN 55455, USA Department of Astronomy Planetary Science, Northern Arizona University, Flagstaff, USA McWilliams Center for Cosmology Astrophysics, Department of Physics, Carnegie Mellon University, Pittsburgh, PA 15213, USA

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出Hyrax,一个支持天文领域完整机器学习生命周期的开源框架,通过五个实际应用展示了其在大规模天文数据中的无监督发现和监督检测能力,为下一代天文调查提供了系统化的机器学习基础设施。

Comments 28 pages, 20 figures, submitted to AJ

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 16 篇

2605.19307 2026-05-20 cs.CV 85%

MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems

MetaRA: 多模态大语言模型基于视觉问答系统的元形态鲁棒性评估

Quanxing Xu, Yuhao Tian, Ling Zhou, Xian Zhong, Xiaohua Huang, Rubing Huang, Chia-Wen Lin

机构 * School of Computer Science and Engineering, Macau University of Science and Technology, Macao SAR(澳门科学技术大学计算机科学与工程学院) Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(湖北省交通物联网重点实验室,武汉理工大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MetaRA,一种基于元形态测试的框架,用于评估多模态大语言模型基于视觉问答系统的鲁棒性,通过生成受控的图像-问题输入变体,揭示模型在语言扰动、视觉线索依赖和多模态推理中的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19223 2026-05-20 cs.CV 83%

HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding

HAVEN:用于统一视频理解的层次对齐多模态基准

Mengqi Shi, Haopeng Zhang

机构 * Department of Information and Computer Sciences(信息与计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出HAVEN,一个用于统一视频理解的层次对齐多模态基准,旨在解决现有多模态大语言模型在复杂叙事总结和推理方面评估不足的问题,通过引入全粒度和全多模态的数据集架构,提供了一个严谨的标准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18791 2026-05-20 eess.IV cs.CV cs.LG q-bio.OT 83%

SpecX: A Large-Scale Benchmark for Multi-Modal Spectroscopy and Cross-Paradigm Evaluation

SpecX:多模态光谱的大规模基准及跨范式评估

Chengrui Xiang, Tengfei Ma, Yujie Chen, Tong Wang, Haowen Chen, Xiangxiang Zeng

机构 * College of Computer Science and Technology, Hunan University(湖南大学计算机科学与技术学院)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出SpecX,一个用于多模态光谱的大规模基准,通过不同层级的数据集支持分子解析、光谱模拟和理解任务,揭示了专用光谱模型和多模态语言模型在光谱智能中的不同优势。

Comments 9 pages,1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06943 2026-05-20 cs.CV cs.AI 81%

PlantTraitNet: An Uncertainty-Aware Multimodal Framework for Global-Scale Plant Trait Inference from Citizen Science Data

PlantTraitNet: 一种考虑不确定性的多模态框架,用于从公民科学数据中进行全球尺度植物特性推断

Ayushi Sharma, Johanna Trost, Daniel Lusk, Johannes Dollinger, Julian Schrader, Christian Rossi, Javier Lopatin, Etienne Laliberté, Simon Haberstroh, Jana Eichel, Daniel Mederer, Jose Miguel Cerda-Paredes, Shyam S. Phartyal, Lisa-Maricia Schwarz, Anja Linstädter, Maria Conceição Caldeira, Teja Kattenborn

机构 * GeoSense-Freiburg(弗赖堡GeoSense)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出PlantTraitNet,一种多模态、多任务且考虑不确定性的深度学习框架,通过弱监督从公民科学照片中预测四个关键植物特性(植物高度、叶面积、特定叶面积和氮含量),并利用空间聚合生成全球特性分布图,验证结果表明其在所有评估特性上均优于现有特性地图。

Comments Accepted at the 40th AAAI Conference on Artificial Intelligence (AAAI-26). Link: https://ojs.aaai.org/index.php/AAAI/article/view/41272

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19004 2026-05-20 cs.CV cs.LG cs.RO 79%

EgoTraj: Real-World Egocentric Human Trajectory Dataset for Multimodal Prediction

EgoTraj: 用于多模态预测的现实世界人轨迹数据集

Ahmad Yehia, Abduallah Mohamed, Tianyi Wang, Jiseop Byeon, Kun Qian, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(土木、建筑与环境工程系,德克萨斯大学奥斯汀分校) Meta Reality Labs(Meta现实实验室) School of Architecture, The University of Texas at Austin(建筑学院,德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出EgoTraj数据集,用于多模态预测,包含75个真实城市环境中的人导航轨迹,提供了同步的RGB视频和地面真实数据,包括6自由度头部姿态、3D眼 gaze向量和场景注释,展示了该数据集在AR感知、导航和辅助系统中的应用价值。

Comments 21 pages, 14 figures. Project page: https://github.com/yehiahmad/EgoTraj

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18686 2026-05-20 cs.MS econ.EM 78%

critband: A Python Package for Critical Bandwidth Analysis of Multimodal Distributions

critband: 一个用于多模分布临界带宽分析的Python包

Ruiyu Zhang, Qihao Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出critband,一个基于Silverman核密度方法的Python包,用于多模分布的临界带宽双峰检测,提供了稳健的模式计数求解器和FFT加速的KDE,以及k-模式检测、成分分解、双峰强度量化和超额质量估计等功能,验证表明其在不同情况下具有稳定的估计结果,且性能优于R的modetest()。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏