arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1521 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 318 篇

2510.03880 2026-08-14 cs.CV 版本更新 70%

Exploring Instruction Data Quality for Explainable Image Quality Assessment

探索可解释图像质量评估的指令数据质量

Yunhao Li, Sijing Wu, Jun Jia, Kang Fu, Qi Jia, Yucheng Zhu, Wei Sun, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对可解释图像质量评估任务,提出Q-Selector数据选择框架,仅用10%训练数据就达到全数据微调的102.1%和103.7%性能,证明指令数据存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09996 2026-08-13 cs.CV 版本更新 70%

Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization

Omni-Persona:系统性基准测试与改进多模态个性化

Yeongtak Oh, Dongwook Lee, Sangkwon Park, Heeseung Kim, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Department of Artificial Intelligence, University of Seoul(首尔大学人工智能系)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Omni-Persona提出首个多模态个性化基准,通过Persona Modality Graph任务组和细粒度任务,系统分析多模态个性化中的接地行为,提出Calibrated Accuracy评估方法,揭示开源模型在音频与视觉接地上的差距及SFT与RLVR的局限性。

Comments Project Page: https://github.com/oyt9306/Omni-Persona

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03903 2026-08-11 cs.CL 版本更新 70%

CC-OCR V2: Fine-Grained Attribution of LMM Failures in Real-World Visual Document Understanding

CC-OCR V2:真实场景视觉文档理解中多模态大模型失效的细粒度归因

Chunyi Peng, Zhipeng Xu, Yuqi Xiong, Zulong Chen, Junhao Ji, Qing Liu, Zhenghao Liu, Zubao Qin, Bing Zhao, Jianqiang Wan, Jun Tang, Zhibo Yang, Shuai Bai, Dayiheng Liu, Maosong Sun

专题命中 多模态评测 :multimodal(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对真实文档采集条件下多模态大模型(LMMs)的失效归因问题,构建了含7093个样本的CC-OCR v2基准,经17个LMMs实验发现,基准性能与实际部署可靠性存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01295 2026-08-10 cs.CV 版本更新 70%

UniREditBench: A Unified Reasoning-based Image Editing Benchmark

UniREditBench: 一个基于推理的图像编辑统一基准

Feng Han, Yibin Wang, Chenglin Li, Zheming Liang, Dianyi Wang, Yang Jiao, Zhipeng Wei, Chao Gong, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) UC Berkeley(伯克利大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 UniREditBench通过多模态双参考评估和大规模合成数据集,提升图像编辑模型在复杂推理场景中的评估可靠性与性能表现。

Comments Project page: https://maplebb.github.io/UniREditBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02854 2026-08-03 cs.AI 版本更新 70%

M3MAD-Bench: Multi-Dimensional Evaluation of Multi-Agent Debate Across Domains and Modalities

M3MAD-Bench: 多智能体辩论在不同领域和模态中真的有效吗?

Ao Li, Jinghui Zhang, Luyu Li, Yuxiang Duan, Lang Gao, Mingcai Chen, Weijun Qin, Shaopeng Li, Fengxian Ji, Ning Liu, Lizhen Cui, Xiuying Chen, Yuntao Du

机构 * Shandong University(山东大学) MBZUAI Nanjing University of Posts and Telecommunications(南京邮电大学) BOB Cloud(BOB云)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 M3MAD-Bench通过多领域、多模态和多维指标评估多智能体辩论方法的有效性,提供全面的性能-成本分析。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04876 2026-07-16 cs.CV cs.LG 版本更新 70%

BenthiCat: An opti-acoustic dataset for advancing benthic classification and habitat mapping

BenthiCat:用于推进底栖生物分类和栖息地测绘的光声数据集

Hayat Rajani, Valerio Franchi, Borja Martinez-Clavel Valles, Raimon Ramos, Rafael Garcia, Nuno Gracias

机构 * Computer Vision and Robotics Research Institute, University of Girona, Spain(计算机视觉与机器人研究研究所,加泰罗尼亚大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 为解决底栖生物分类和栖息地测绘领域大型标注数据集稀缺问题,本文介绍含约百万侧扫声纳图块等的多模态数据集,通过空间关联促进跨模态学习,提供工具,旨在建立标准化基准推动相关领域进步。

Comments Article under review by Earth System Science Data (ESSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20274 2026-07-03 cs.CV 版本更新 70%

SCLARO: A Dataset for Grounded Scenario-Level Scene Understanding and ScenarioCLIP for Benchmarking

SCLARO:面向场景级场景理解的数据集及用于基准测试的ScenarioCLIP

Advik Sinha, Saurabh Atreya, Aashutosh A, Sk Aziz Ali, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Science, Pilani – Hyderabad Campus(人工智能组,计算机科学与信息系,比拉理工学院和科学学院,比拉-海得拉巴校区)

专题命中 多模态评测 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出SCLARO数据集(615,805张图像,含动作、对象和关系标注)及ScenarioCLIP模型,通过解耦编码器和知识蒸馏联合编码场景上下文、对象和关系,在零样本检索等任务上优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31597 2026-07-02 cs.CV 版本更新 70%

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

SOCO: 视觉基础模型中语义对象对应关系的基准测试

Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) Saarland Informatics Campus(萨尔州信息学校园) CISPA Helmholtz Center for Information Security(信息安全霍夫曼中心) University of Freiburg(弗赖堡大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出SOCO基准,通过引入对应类型分类法和100个类别上超过100万对功能上有意义的关键点注释,系统评估视觉基础模型中的语义对应能力,并揭示模型在跨类别迁移、语言引导定位与视觉对应之间的差距。

Comments Project page: https://genintel.github.io/SOCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17920 2026-07-02 cs.CV 版本更新 70%

SegFly: A Dataset and 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale

SegFly:大规模航空RGB-热红外语义分割的数据集与2D-3D-2D范式

Markus Gross, Sai Bharadhwaj Matha, Rui Song, Viswanathan Muthuveerappan, Conrad Christoph, Julius Huber, Daniel Cremers

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校) Uni Cambridge(剑桥大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对航空RGB-T数据集规模小、标注成本高和对齐困难的问题,提出几何驱动的2D-3D-2D范式,通过少量RGB标注自动生成密集伪标签并实现跨模态对齐,构建含2万+RGB图像和1.5万+RGB-T对的SegFly基准,实验表明该范式有效提升分割性能。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30599 2026-07-01 cs.CV 版本更新 70%

Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing

Goku:百万级通用指令视频编辑数据集与基准

Sen Liang, Cong Wang, Zhentao Yu, Fengbin Guan, Zhengguang Zhou, Teng Hu, Youliang Zhang, Yuan Zhou, Xin Li, Qinglin Lu, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Tencent Hunyuan(腾讯混元)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出首个百万级多任务视频编辑数据集Goku,包含200万高质量指令对齐对,并设计高效数据合成流程和渐进过滤系统,基于此提出双分支模型Goku-Edit及包含1000个测试用例的基准Goku-Bench,在指令遵循上提升8%。

Comments Project Page: https://flying-sky999.github.io/Goku.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03788 2026-06-16 cs.CV 版本更新 70%

SLU-2K: A Question-Based Benchmark for Semantic Evaluation of Sign Language Translation

SLU-2K:基于问题的手语翻译语义评估基准

Zeno Testa, Antonino Furnari, Lorenzo Baraldi, Natalia Díaz-Rodríguez

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Catania(卡塔尼亚大学) University of Granada(格拉纳达大学) CITIC & DaSCI Institute(CITIC与DaSCI研究所)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 提出SLU-2K基准,通过2350个视频问答对评估手语翻译的语义理解,揭示当前系统在语义正确性上的不足。

Comments Accepted at the GenSign Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10242 2026-06-11 cs.CV 版本更新 70%

MedVeriSeg: Teaching LISA-Like Medical Segmentation Models to Verify Query Validity Without Extra Training

MedVeriSeg: 教授LISA-like医学分割模型验证查询的有效性而无需额外训练

Qinyue Tong, Xiaozhen Wang, Ziqian Lu, Jun Liu, Yunlong Yu, Zheming Lu

机构 * School of Aeronautics and Astronautics, Zhejiang University(浙江大学航空宇航学院) Southern Medical University(南方医科大学) School of Computer Science and Technology (School of Artificial Intelligence), Zhejiang Sci-Tech University(浙江科技学院计算机科学与技术学院(人工智能学院)) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MedVeriSeg,一种无需训练的查询验证框架,使LISA-like医学分割模型能够拒绝虚假分割查询。通过相似性响应质量评分模块和轻量级路由多代理验证模块,提升验证鲁棒性,并构建MedVeriSeg-Bench基准,有效减少幻觉分割。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20247 2026-08-07 cs.LG cs.AI cs.CL cs.CV 版本更新 67%

CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning

CP-MoE:一致性保留的混合专家用于持续学习

Yang Liu, Toan Nguyen, Flora D. Salim

机构 * School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院 新南威尔士大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出CP-MoE,一种基于瞬时专家的持续学习框架,通过一致性保留的路由偏置和瞬时专家引导的正则化机制,减少参数干扰和遗忘,同时保留跨任务知识转移。

Comments Accepted at CoLLAs 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25538 2026-08-04 cs.LG cs.SE 版本更新 67%

ARMOR: A Robust Self-Supervised Framework for Root Cause Analysis in Microservices under Missing Modality

面向缺失数据的多模态融合用于统一微服务故障管理

Wenzhuo Qian, Hailiang Zhao, Ziqi Wang, Zhipeng Gao, Jiayi Chen, Zhiwei Ling, Shuiguang Deng

机构 * Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出ARMOR框架,通过自监督学习解决微服务故障管理中多模态数据缺失问题,提升异常检测、故障分类和根本原因定位的性能。

Comments Accepted by the Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), 2026. This is the authors' version of the work; the definitive Version of Record is forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 67%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08728 2026-07-28 cs.AI cs.CL cs.CV cs.LG 版本更新 67%

Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery

人工智能数学推理:语言模型、神经符号系统与验证发现的综合综述

Syed Rifat Raiyan, Mohsinul Kabir, Hasan Mahmud, Md Kamrul Hasan, Sophia Ananiadou

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文综述了数学推理领域从早期规则系统到当代推理模型、多智能体系统及验证发现工作流的演变,沿非正式推理、形式推理、数学发现及推理技术四轴组织,并评估了基准测试、失败模式及未来方向。

Comments Under review, 47 pages, 14 figures, 22 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06537 2026-07-14 cs.RO 版本更新 67%

UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation

UniLM-Nav:零样本最后一英里导航的统一框架

Zhuofan Zhang, Tianxu Wang, Guoxi Zhang, Yixiong Lin, Xilin Wang, Hongming Xu, Qing Li, Song-Chun Zhu, Lifeng Fan

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract)

AI总结 研究移动操作中最后一英里导航问题,提出UniLM-Nav统一框架,通过多模态大语言模型后端分解任务为视图选择、功能接地和姿态推理,在OVMM基准上优于现有方法,还验证了在实际机器人上的适用性。

Comments Project page: https://unilm-nav.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-07-14 cs.RO cs.AI cs.CL cs.CV 版本更新 67%

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09731 2026-06-29 cs.CV cs.AI cs.CL 版本更新 67%

EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

EXPLORE-Bench:具有长视距推理的自我中心场景预测

Chengjun Yu, Xuhan Zhu, Chaoqun Du, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Foundation Model Team, Li Auto Inc.(蔚来汽车基础模型团队) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出EXPLORE-Bench基准,通过初始场景图像和动作序列预测最终场景,评估多模态大模型在自我中心长视距推理中的能力,发现与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16385 2026-06-18 cs.CV cs.AI cs.CL 版本更新 67%

Hilbert-Geo: Solving Solid Geometric Problems by Neural-Symbolic Reasoning

Hilbert-Geo:通过神经符号推理解决立体几何问题

Ruoran Xu, Haoyu Cheng, Bin Dong, Qiufeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Ricoh Software Research Center Beijing Co.,Ltd(Ricoh 软件研究中心北京有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出Hilbert-Geo框架和Parse2Reason方法,利用条件描述语言和定理库实现立体几何问题的严格推理,在SolidFGeo2k和MathVerse-Solid上达到SOTA性能。

Comments Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00241 2026-06-17 cs.LG cs.AI cs.CL cs.CV 版本更新 67%

Mordal: Automated Pretrained Model Selection for Vision Language Models

Mordal: 面向视觉语言模型的自动化预训练模型选择

Shiqi He, Insu Jang, Mosharaf Chowdhury

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出Mordal框架,通过减少候选模型数量和评估时间,自动化搜索用户定义任务的最佳视觉语言模型,相比网格搜索降低GPU耗时8.9-11.6倍,加权Kendall's τ平均提升69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08991 2026-08-12 cs.CV cs.AI 版本更新 66%

PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos

PinpointQA: 一个用于室内视频中微小物体中心空间理解的数据集和基准

Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang, Luyang Zhang, Cheng Zhang, Hongxia Xie, Wen-Huang Cheng

机构 * Jilin University(吉林大学) National Taiwan University(国立台湾大学)

专题命中 多模态评测 :multimodal(abstract,comments);分类 cs.CV、cs.AI

AI总结 本文提出PinpointQA数据集,用于评估多模态大语言模型在室内视频中对微小物体空间定位的精准理解能力,通过四个递进任务验证模型性能,并展示其作为诊断基准和训练数据集的效果。

Comments Accepted at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06110 2026-08-12 cs.AI cs.CL 版本更新 62%

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

ECHO:具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手

Abdulkadir Külçe, Alihan Esen, Çağla Fikir, Berke Kurt, Kuzey Arar, Gökhan Ercan, Faik Boray Tek

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手ECHO,其核心聊天机器人、安全层、语音评估模块均达特定性能指标,且可在消费级硬件运行,符合数据保护法规。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05098 2026-08-11 cs.CV cs.AI 版本更新 62%

Beyond Pixels: Benchmarking and Reward-Based Assessing Framework for Visual Spatial Aesthetics

SA-IQA: 重新定义空间美学的图像质量评估:多维奖励

Yuan Gao, Jin Song, Yiyun Fei, Gongzhe Li, Ruigao Yang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SA-IQA通过多维奖励框架系统评估室内场景的美学质量,利用SA-BENCH基准提升AIGC生成流程和图像质量。

Comments Accepted to CVPRW 2026. Code: https://github.com/AlibabaResearch/SA-IQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18587 2026-08-11 cs.CV cs.AI 版本更新 62%

HyperFake: Hyperspectral Reconstruction and Attention-Guided Analysis for Advanced Deepfake Detection

HyperFake:用于高级深度伪造检测的高光谱重建与注意力引导分析

Pavan C Shekar, Pawan Soni, Vivek Kanhangad

机构 * Department of Electrical Engineering, Indian Institute of Technology Indore(印度理工学院印度尔分校电子工程系)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 HyperFake是首个利用高光谱成像重建的深度伪造检测方法,通过改进的MST++架构、光谱注意力机制与EfficientNet分类器,从RGB视频重建31通道高光谱数据,实现了更准确且泛化性更强的深度伪造检测。

Comments 6 pages, 3 figures, 1 table. Preliminary results on FaceForensics++ dataset. First approach to use hyperspectral reconstruction for deepfake detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02976 2026-08-04 cs.CV cs.AI 版本更新 62%

Deep Learning for Retinal Degeneration Assessment: A Comprehensive Analysis of the MARIO Challenge

利用深度学习评估视网膜退化:对MARIO挑战的全面分析

Rachid Zeghlache, Ikram Brahim, Pierre-Henri Conze, Mathieu Lamard, Mohammed El Amine Lazouni, Zineb Aziza Elaouaber, Leila Ryma Lazouni, Christopher Nielsen, Ahmad O. Ahsan, Matthias Wilms, Nils D. Forkert, Lovre Antonio Budimir, Ivana Matovinović, Donik Vršnak, Sven Lončarić, Philippe Zhang, Weili Jiang, Yihao Li, Yiding Hao, Markus Frohmann, Patrick Binder, Marcel Huber, Taha Emre, Teresa Finisterra Araújo, Marzieh Oghbaie, Hrvoje Bogunović, Amerens A. Bekkers, Nina M. van Liebergen, Hugo J. Kuijf, Abdul Qayyum, Moona Mazher, Steven A. Niederer, Alberto J. Beltrán-Carrero, Juan J. Gómez-Valverde, Javier Torresano-Rodríquez, Álvaro Caballero-Sastre, María J. Ledesma Carbayo, Yosuke Yamagishi, Yi Ding, Robin Peretzke, Alexandra Ertl, Maximilian Fischer, Jessica Kächele, Sofiane Zehar, Karim Boukli Hacene, Thomas Monfort, Béatrice Cochener, Mostafa El Habib Daho, Anas-Alexis Benyoussef, Gwenolé Quellec

机构 * University of Western Brittany, Brest, France University of Tlemcen, Algeria Ophthalmology Department, CHRU Brest, Brest, France Imperial College London, United Kingdom Biomedical Engineering, Graduate School of Medicine, The University of Tokyo, Tokyo, Japan Evolucare Technologies, France College of Computer Science, Sichuan University, China Medical University of Vienna, Austria TNO, The Hague, The Netherlands Image Sciences Institute, UMC Utrecht, Utrecht, The Netherlands Johannes Kepler University Linz, Austria University of Zagreb, Faculty of Electrical Engineering Department of Radiology, University of Calgary, Calgary, AB, Canada Biomedical Engineering Graduate Program, University of Calgary, Calgary, AB, Canada Hotchkiss Brain Institute, University of Calgary, Calgary, AB, Canada Alberta Children’s Hospital Research Institute, University of Calgary, Calgary, AB, Canada Department of Pediatrics, University of Calgary, Calgary, AB, Canada Department of Community Health Sciences, University of Calgary, Calgary, AB, Canada Department of Clinical Neuroscience, University of Calgary, Calgary, AB, Canada University of Calgary, Calgary, AB, Canada German Cancer Research Center (DKFZ) Heidelberg, Division of Medical Image Computing, Germany Medical Faculty Heidelberg, Heidelberg University, Germany Biomedical Image Technologies (BIT), ETSI Telecomunicación, Universidad Politécnica de Madrid, Spain Ophthalmology Service of the Provincial Ophthalmic Institute, Hospital Universitario Gregorio Marañón, Madrid, Spain University of Edinburgh, Scotland Lung Institute, Faculty of Medicine, Imperial College London, United Kingdom Hawkes Institute, Department of Computer Science, University College London, London, United Kingdom

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过MARIO挑战展示了深度学习在AMD监测中的应用,验证了AI在检测AMD进展方面的有效性,但尚未实现对未来演变的预测。

Comments MARIO-MICCAI-CHALLENGE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23118 2026-07-30 cs.CV cs.MM 版本更新 62%

SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions

SMSP:多尺度感知的插件策略用于MLLMs感知视觉错觉

Jinzhe Tu, Ruilei Guo, Zihan Guo, Junxiao Yang, Shiyao Cui, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华人工智能(CoAI)小组,DCST,清华大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出SMSP策略,通过抑制高频背景以提升MLLMs对视觉错觉的识别能力,实验表明其显著提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22205 2026-07-29 cs.CV cs.AI 版本更新 62%

Filling Before Advancing: Capability-Gap-Driven Post-Training for Scenario-Specialized Remote Sensing MLLMs

推进前填充:能力差距驱动的场景专用遥感多模态大语言模型的训练后处理

Yuheng Zong, Minghua Wang, Xin Zhao, Zhi-Hui Zhan, Antonio Plaza, Jon Atli Benediktsson

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对地球观测应用中遥感多模态大语言模型因高质量数据稀缺和能力覆盖不完整难以实现细粒度场景专业化的问题,提出能力差距驱动的推进前填充(FBA)方法,经实验验证其效果优于其他方法,提升了模型在相关基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19259 2026-07-28 cs.CV cs.AI 版本更新 62%

TextRich: A Multi-Domain Benchmark for Detecting AI-Generated Text-Rich Images from GPT-Image-2

一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准

Yijin Wang, Shuyi Wang, Wenhan Zhang, Yuqi Ouyang

机构 * College of Computer Science(计算机科学学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12650 2026-07-28 cs.CV cs.AI 版本更新 62%

AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use

AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构

Yaotian Yang, Yiwen Tang, Yizhe Chen, Xiao Chen, Jiangjie Qiu, Hao Xiong, Haoyu Yin, Zhiyao Luo, Yifei Zhang, Sijia Tao, Wentao Li, Qinghua Zhang, Yuqiang Li, Wanli Ouyang, Bin Zhao, Xiaonan Wang, Fei Wei

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。

Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat

详情

展开后加载摘要…

URL PDF HTML 收藏