arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-30 至 2026-07-30 共收录 67 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 11 篇

2607.24241 2026-07-30 cs.CV cs.AI 版本更新 62%

FilmBench: A Film-Grade Benchmark for Cinematic Video Generation

FilmBench:用于电影视频生成的电影级基准测试

Shengyi Wang, Niantong Li, Guangzheng Hu, Hong Qi, Fei Ding, Weixu Qiao, Jinlin Wang, Xiaotong Lv, Peng Han, Zimeng Li, Fanshu Ding, Yushu Wang, Han Wu, Jingjing Chen, Chongxiao Wang, Yanhao Wu, Chenglong Huang, Xiaoqian Zhu, Jie Tian, Hua Li, Jingjing Fan, Mingshuang Tang, Zhong Li, Hengxia Qiang, Weibin Chen, Jinyang Zhen, Bing Zhao, Lin Qu, Jing Li, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) Beijing Film Academy(北京电影学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26754 2026-07-30 cs.CV 新提交 57%

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

StatePlay:用于机制一致性生成的状态感知游戏世界模型

Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin

机构 * Tencent(腾讯)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出StatePlay,一种状态感知游戏世界模型,采用混合Transformer架构联合预测视觉内容与游戏状态,经实验验证可提升游戏生成的机制保真度。

Comments Project Page: https://jimntu.github.io/stateplay_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08293 2026-07-30 cs.CV 版本更新 57%

Distill, Diffuse, Segment: Unsupervised 3D Semantic Segmentation for Autonomous Driving Based on Multi-Level Distillation and Graph Diffusion

Distill, Diffuse, and Semanticize (DDS): 基于多粒度蒸馏和图扩散的无标注3D场景理解

Yijing Wang, Ruonan Li, Qilin Wang, Rongqiang Zhao, Jie Liu

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Pengcheng Laboratory(鹏城实验室)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 DDS通过多粒度蒸馏和图扩散实现轻量级无标注3D场景理解,提升区域一致性和语义识别,实验显示在多个数据集上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11214 2026-07-30 eess.SP cs.IT math.IT 版本更新 50%

CSI Prediction Using Diffusion Models

基于扩散模型的信道状态信息(CSI)预测

Mehdi Sattari, Javad Aliakbari, Alexandre Graell i Amat, Tommy Svensson

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出一种基于扩散模型的新型概率CSI预测框架,分解任务为时间编码器与扩散生成器,研究多种推理方案与骨干,仿真显示其性能优于现有最先进基线模型。

Comments Accepted, IEEE Transactions on Wireless Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13337 2026-07-30 cs.RO 50%

Invisible Servoing: a Visual Servoing Approach with Return-Conditioned Latent Diffusion

Bishoy Gerges, Barbara Bazzana, Nicolò Botteghi, Youssef Aboudorra, Antonio Franchi

机构 * Robotics and Mechatronics group, Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(特文特大学机器人与机电组,电气工程、数学与计算机科学学院) Department of Applied Mathematics, University of Twente(特文特大学应用数学系) Department of Computer, Control and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、控制与管理工程系)

专题命中 多模态生成 :cross-modal(abstract)

Journal ref 2025 International Conference on Unmanned Aircraft Systems (ICUAS)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 14 篇

2607.26595 2026-07-30 cs.CV 新提交 91%

SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM

SpatialQ:基于视觉的多模态大语言模型(MLLM)理解3D Gaussian Splatting场景质量

Jingxuan Su, Shenglin Wang, Tiesong Zhao, Ge Li, Wei Gao

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Fuzhou University(福州大学)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 针对3DGS场景质量评估的局限,本文提出SpatialQ框架,通过VGGT编码器与Qwen-MLLM实现结构感知的多模态质量评估,解决传统IQA仅依赖2D线索的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26432 2026-07-30 cs.CV cs.AI 新提交 90%

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

FAS-R1:用于推理人脸防伪的统一多任务多模态大语言模型(MLLM)

Hongyang Wang, Yichen Shi, Hongrui Li, Yiru Huo, Jun Feng, Zitong Yu

专题命中 多模态评测 :MLLM(title,title_cn);分类 cs.CV、cs.AI

AI总结 本文提出面向推理的两阶段多任务MLLM框架FAS-R1,结合DSA与DA-GRPO优化,在人脸防伪的分类、识别、定位任务中表现优异,性能优于对比系统且具备良好缩放性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26465 2026-07-30 cs.AI 新提交 79%

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

MultivationBench:多模态序列动机推理基准

Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MultivationBench基准,基于心理学框架评估多模态序列动机推理,发现现有模型难以在序列语境中保持一致的动机推理,暴露了静态识别与动态推理的差距。

Comments 31 pages, including appendices; 6 figures and 22 tables. Code: https://github.com/HKUST-KnowComp/MultivationBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18668 2026-07-30 cs.LG cs.CV 版本更新 79%

On-Device Inference versus Wireless Streaming: Energy-Efficient Multi-Modal Deep Learning for Wearable Cardiovascular Patches

面向心血管传感器贴片的端到端多模态微型CNN原型设计

Mustafa Fuad Rifet Ibrahim, Tunc Alkanat, Felix Manthey, Maurice Meijer, Alexander Schlaefer, Peer Stelldinger

机构 * CTO System Innovation, NXP Semiconductors Germany GmbH(NXP半导体德国系统创新部) Advanced Chip Engineering, NXP Semiconductors(NXP半导体先进芯片工程部) Business Line Secure Connected Edge, NXP Semiconductors(NXP半导体安全连接边缘业务线) Institute of Medical Technology and Intelligent Systems, Hamburg University of Technology(汉堡技术大学医学技术与智能系统研究所) Department of Informatics, Hamburg University of Applied Sciences(汉堡应用科学大学信息学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 针对资源受限的医疗边缘设备,提出一种早期融合心电图和心音图数据的卷积神经网络,实现二分类,相比现有技术将内存和计算成本降低约三个数量级,并验证了在微控制器上的能效优势。

Comments 16 pages, 2 figures. Extended version of our 2024 IEEE PerCom paper, with direct on-device energy measurements, a BLE communication benchmark, architecture comparisons, and an extended evaluation. Submitted to Pervasive and Mobile Computing; Measurement-method clarifications and minor editorial corrections; results and conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16129 2026-07-30 cs.AI 版本更新 79%

Bridging the Gap in Ophthalmic AI: MM-Retinal-Reason Dataset and OphthaReason Model toward Dynamic Multimodal Reasoning

缩小眼科人工智能的差距:MM-Retinal-Reason数据集与OphthaReason模型用于动态多模态推理

Ruiqi Wu, Yuang Yao, Tengfei Ma, Chenran Zhang, Na Su, Tao Zhou, Geng Chen, Wen Fan, Yi Zhou

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Ophthalmology, The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院眼科学系) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对现有眼科AI仅聚焦基础推理的问题,构建首个眼科多模态数据集MM-Retinal-Reason,并提出带UADT方法的OphthaReason模型,实现眼科多模态推理性能的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18600 2026-07-30 cs.LG 版本更新 78%

MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs

MapTab: MLLMs 是否已准备好在异构图中进行多标准路线规划?

Ziqiao Shang, Ling-Yue Ge, Zian Xu, Zi-Jian Cheng, Shi-Yu Tian, Zhenyu Huang, Wenbo Fu, Weiming Wu, Yang Chen, Xiangwen Zhang, Yulan Hu, Bin Liu, Lan-Zhe Guo

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出MapTab基准测试,用于评估多模态大语言模型在多标准路线规划任务中的综合推理能力,发现当前模型在多模态推理方面存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06945 2026-07-30 cs.LG stat.ML 版本更新 78%

Challenges and proposed solutions in modeling multimodal medical data: A systematic review

多模态医疗数据建模的挑战与解决方案:一项系统综述

Maryam Farhadizadeh, Maria Weymann, Michael Blaß, Johann Kraus, Christopher Gundler, Sebastian Walter, Noah Hempen, Hannah Bast, Harald Binder, Nadine Binder

机构 * Institute of General Practice/Family Medicine(一般医学/家庭医学研究所) Freiburg Center for Data Analysis, Modeling and AI(弗赖堡数据分析、建模与人工智能中心) Institute of Medical Biometry and Statistics(医学生物统计研究所) Institute for Applied Medical Informatics(应用医学信息研究所) Institute of Medical Systems Biology(医学系统生物学研究所) Department of Computer Science(计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本系统综述针对多模态医疗数据建模面临的模态缺失、样本量有限等挑战,结合69项研究,介绍迁移学习等解决方案,为该领域未来研发提供实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27066 2026-07-30 cs.CV cs.AI 新提交 73%

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分

Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03273 2026-07-30 cs.CV cs.AI cs.CL 版本更新 67%

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

VistaHop: 视觉深度搜索的多跳视觉推理基准

Hang He, Chuhuai Yue, Chengqi Dong, Chengcheng Wan, Ting Su, Haiying Sun, Jiajun Chai, Xiaohan Wang, Guojun Yin

机构 * East China Normal University(东华大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出VistaHop基准,通过多跳问答任务评估多模态大推理模型在视觉深度搜索中的迭代图像检查、视觉锚点定位和跨证据链推理能力,实验表明现有模型表现有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27084 2026-07-30 cs.CV cs.AI 新提交 62%

SciFigQual-Bench: A Benchmark for Scientific Figure Quality Assessment with Full-Manuscript Context

SciFigQual-Bench:面向全文本上下文的科学图片质量评估基准

Zihan Deng, Chuanzhi Xu, Huiqi Liang, Haoyang Li, Xiaozhen Zhong, Lequan Yu

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对现有科学图片质量评估方法的不足,构建了SciFigQual-Bench基准,设计SFQ-Agent框架实现自动化评估,实验显示其在eval1200子集上表现优于主流方案。

Comments † Equal contribution. Affiliations: 1: The University of Hong Kong 2: The University of Sydney 3: University of Electronic Science and Technology of China Corresponding authors: Zihan Deng (zhdeng@hku.hk), Chuanzhi Xu (chuanzhi.xu@sydney.edu.au) Project page: https://frankdengai.github.io/SciFigQual-Bench Source code & dataset: https://github.com/FrankDengAI/SciFigQual-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26452 2026-07-30 cs.AI cs.CV cs.GR 新提交 62%

CG-World: A Large-Scale World-State Dataset and Protocol for World Models

CG-World:面向世界模型的大规模世界状态数据集与协议

Yiming Cai, Fangjie Yu, Meiqing Yu, Ziyue Shi, Pengfei Yuan, Yong Guo

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CG-World是源自工业计算机图形流水线的大规模世界状态数据集,含约85万时间对齐片段,支持干预学习与反事实推理,经评估可为世界模型相关任务提供结构化监督,拟打造共享数据基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23118 2026-07-30 cs.CV cs.MM 版本更新 62%

SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions

SMSP:多尺度感知的插件策略用于MLLMs感知视觉错觉

Jinzhe Tu, Ruilei Guo, Zihan Guo, Junxiao Yang, Shiyao Cui, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华人工智能(CoAI)小组,DCST,清华大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出SMSP策略,通过抑制高频背景以提升MLLMs对视觉错觉的识别能力,实验表明其显著提高模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26848 2026-07-30 cs.CV 新提交 57%

ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures

ICDAR 2026 原子层沉积/蚀刻(ALD/E)科学图信息提取竞赛

Fahad Ahmed, Sören Auer, Jennifer D'Souza

机构 * TIB - Leibniz Information Centre for Science and Technology(蒂宾根信息中心(莱布尼茨科学技术信息中心)) L3S Research Center, Leibniz University(莱布尼茨大学L3S研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究介绍了ICDAR 2026 ALD/E科学图信息提取竞赛,基于Sci-ImageMiner基准数据集开展多任务评测,发现现有多模态模型在数据提取等任务中存在局限,为领域多模态AI研究提供了平台。

Comments 17 pages, 6 figures, 8 tables, to be published in ICDAR 2026 Conference Proceedings and Volume 16975 of the Lecture Notes in Computer Science series (Springer Nature)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21809 2026-07-30 cs.CV 版本更新 57%

Clinical Graph-Mediated Distillation for Unpaired MRI-to-CFI Hypertension Prediction

临床图介导的非配MRI到CFI高血压预测

Dillan Imans, Phuoc-Nguyen Bui, Duc-Tai Le, Hyunseung Choo

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Research Convergence Institute(研究融合院) Department of AI Systems Engineering(人工智能系统工程系) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CGMD框架,通过构建临床相似性kNN图将MRI中的高血压知识迁移至视网膜模型,提升非配MRI-视网膜数据下的高血压预测性能。

Comments 10 pages, 2 figures, 2 tables. Under review at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 5 篇

2607.27145 2026-07-30 cs.CV 新提交 85%

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

机构 * Heritage Institute of Technology(遗产技术学院) Kalyani Government Engineering College(卡利亚尼政府工程学院) IAIRO Intel Corporation(英特尔公司)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14029 2026-07-30 cs.CV 版本更新 83%

POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management

POINTS-Seeker:从零开始训练多模态代理搜索模型

Yikun Liu, Yuan Liu, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University(上海交通大学CMIC) WeChat AI, Tencent(腾讯WeChat AI)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出POINTS-Seeker模型,通过引入代理播种机制和V-Fold压缩方案,解决长周期交互中的证据检索问题,并在六个基准测试中超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04398 2026-07-30 cs.HC cs.CY 版本更新 78%

The Agency Gap in AI-Supported Writing: How Reactive and Proactive Agent Designs Shape Multimodal Reasoning

AI辅助写作中的主体差距:反应式与主动式智能体设计如何塑造多模态推理

Yueqiao Jin, Kaixun Yang, Roberto Martinez-Maldonado, Dragan Gašević, Lixiang Yan

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 该研究针对AI辅助写作中的主体差距,对比反应式与主动式智能体设计的效果,发现主动式设计可强化多模态推理关联,还能缩小AI素养相关的表现差异,为教育AI智能体设计提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26155 2026-07-30 cs.AI 新提交 74%

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

ClinLens:面向纵向多模态临床数据科学的长周期编码智能体

Yuan Zhu, Ethan B. Liu, Frank Nie, Jindong Han

机构 * Shandong University(山东大学)

专题命中 多模态Agent :multimodal(title);分类 cs.AI

AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26460 2026-07-30 cs.RO 新提交 50%

RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning

RLMM-Flow:一种基于流的隐空间强化学习移动操作框架

Shuhang Wang, Ziming Li, Hui Cheng

专题命中 多模态Agent :multimodal(abstract)

AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 9 篇

2607.26885 2026-07-30 cs.CV 新提交 85%

SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation

SCALPEL:基于大语言模型驱动的编码器学习的医学视觉-语言语义跨模态对齐框架

Yunzhan Fu, Enyu Bao, Xiangyu Shen, Yihao Wu, Chunbo Jiang, Fangli Guan, Liqi Yan

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 针对现有医学视觉-语言预训练的三大瓶颈,本文提出SCALPEL框架,通过临床报告对比微调、非对称对齐策略及解剖-否定感知目标,在三大医学基准上实现了多项任务的最优性能。

Comments 14 pages, 3 figures, accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26326 2026-07-30 cs.CV 新提交 83%

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

视觉还是认知?多模态大语言模型的视觉上下文敏感性

Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

机构 * University of Copenhagen(哥本哈根大学) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Clemson University(克莱姆森大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26743 2026-07-30 cs.CV cs.AI 新提交 81%

Multimodal fusion of visual and morphometric features for avian bone classification

用于鸟类骨骼分类的视觉与形态计量特征多模态融合

Nevio Dubbini, Lisa Yeomans, Marco Pavia, Ramazan Parmaksiz, Ayse Atas Hooglugt, Gabriele Gattiglia, Beatrice Demarchi

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出结合卷积神经网络图像分析与骨计量测量的多模态框架,用于鸟类骨骼分类,在骨骼类型分类准确率达86%,科级分类Top-1准确率51%、Top-3准确率75%,为AI辅助动物考古识别建立了方法学基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26596 2026-07-30 cs.CV cs.AI 新提交 81%

Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

解耦视觉处理:通过模态特定Transformer替换实现高效多模态适配

Mingkuan Feng, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型视觉指令微调成本高的问题,提出解耦视觉处理框架,替换预训练大语言模型上层解码器为轻量Transformer块,仅训练该块即可在多个基准上实现竞争力性能,降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26555 2026-07-30 cs.CL 新提交 70%

Where Detectors Fail: Closing the Tail-Domain Gap with Expert-Guided Mutual Distillation

检测器何时失效:通过专家引导的互蒸馏缩小尾域差距

Xuan Feng, Guihong Liu, Tianlong Gu, Shuai Zhao, Xuemin Wang, Chenzhong Bin, Yang Liu, Bo An

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CL

AI总结 针对多模态假新闻检测器跨域泛化差的问题,提出专家引导的互蒸馏方法,构建域平衡基准Weibo_Balanced,在四个数据集上实现SOTA准确率并大幅降低域偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26395 2026-07-30 cs.CV 新提交 70%

Registration-Grounded Spectral Fusion for Unregistered WLI/NBI Endoscopic Lesion Segmentation

基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割

Pengyu Jie, Wanquan Liu, Rui He, Pengcheng Li, Weiping Wen, Deyu Meng, Junwei Han, Chenqiang Gao

机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏