arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-04 至 2026-08-04 共收录 197 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 19 篇

2605.04227 2026-08-04 cs.AI cs.HC 版本更新 79%

Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks

Pro²Assist:面向长程流程任务的、基于多模态自我中心感知的步骤感知主动式辅助系统

Lilin Xu, Bufang Yang, Siyang Jiang, Kaiwei Liu, Kaiyuan Hou, Yuang Fan, Hongkai Chen, Zhenyu Yan, Xiaofan Jiang

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本研究提出Pro²Assist,一种基于多模态自我中心感知的步骤感知主动式辅助系统,通过AR眼镜感知与持续推理提升长程流程任务辅助效果,在动作理解与主动时机准确率上优于基线,获多数用户认可。

Comments To appear in IMWUT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00847 2026-08-04 cs.CV 新提交 79%

Models as Tools: An Agentic Coordination Framework for Unified Multimodal Visual Tracking

模型作为工具:用于统一多模态视觉跟踪的智能体协调框架

Wenrui Cai, Yuzhe Li, Qingjie Liu, Yunhong Wang

机构 * Beihang University(北京航空航天大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有视觉跟踪方法的瓶颈,提出ACTrack智能体协调框架,整合异构模型工具的互补优势,仅用30%可训练参数便在多类基准上实现性能超越。

Comments 21 pages, 15 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00309 2026-08-04 cs.SE cs.AI 新提交 79%

OrEdge: Efficient Multi-Modal Anomaly Detection in Distributed Software Systems via Orthogonal-Domain Learning

OrEdge:基于正交域学习的分布式软件系统高效多模态异常检测

Amr M. Zaki, Farhoud Jafari Kaleibar, Honggeun Ji, Komal Sarda, Marin Litoiu

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 OrEdge是基于正交域学习的轻量级多模态异常检测框架,通过OrEdgeCore重构模块,在微服务数据集上实现了高精度,且模型参数仅9.6K,推理延迟较现有方法降低一个数量级以上,可高效部署于边缘设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21337 2026-08-04 cs.LG cs.AI 版本更新 79%

DataClaw0: Agentic Tailoring Multimodal Data from Raw Streams

DataClaw0: 从原始流中智能定制多模态数据

Cong Wan, Zeyu Guo, Zijian Cai, Jiangyang Li, SongLin Dong, Lin Peng, Xiangyang Luo, Zhiheng Ma, Yihong Gong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shenzhen University of Advanced Technology(深圳理工大学) Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出DataClaw0模型,通过两阶段流水线将生成语义合成锚定于确定性事实锚点,结合SFT与GRPO实现复杂数据精炼意图的对齐,首个数据精炼基准验证其高效性。

Comments add base model: Qwen3.5-27B

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09154 2026-08-04 cs.CV cs.AI cs.MM 67%

A Hybrid Deterministic Framework for Named Entity Extraction in Broadcast News Video

一种混合确定性框架用于广播新闻视频中的命名实体提取

Andrea Filiberto Lucas, Dylan Seychell

机构 * Dept. of Artificial Intelligence University of Malta Msida, Malta(人工智能系 马耳他大学 Msida)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出一种混合确定性框架,用于自动提取广播新闻视频中的个人姓名,通过可解释的模块化管道实现高精度和可追溯性,适用于新闻媒体信息提取任务。

Comments 7 pages, 5 figures. Accepted for publication at the 2026 IEEE Conference on Artificial Intelligence (CAI)

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), 2026, pp. 1134-1139

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01980 2026-08-04 cs.CV cs.AI 新提交 62%

AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

AdaThinkV:面向令牌高效视频推理的自适应思维

Jingqi Tian, Haoji Zhang, Lin Chen, Hongbo Jin, Haonan Xu, Tianrui Zhu, Xingming Shui, Shilin Ma, Wenjing Yang, Yansong Tang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01354 2026-08-04 cs.CV 新提交 57%

PixVL: Self-Supervised Training of Pixel-Level MLLMs via a Unified Mask--Text Consistency Cycle

PixVL:通过统一掩码-文本一致性循环进行像素级多模态大语言模型的自监督训练

Yicheng Xiao, Haoxuan Ma, Caorui Li, Yucheng Wu, Weijie Wang, Haoxiao Wang, Shuang Chen, Fan Yang, Haiyun Guo, Jinqiao Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 PixVL作为自监督后训练框架,通过统一掩码-文本一致性循环及语义验证等策略,解决像素级MLLMs的优化干扰问题,同时提升区域理解与分割任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01302 2026-08-04 cs.CV 新提交 57%

Beyond Symmetric Fusion: Exploiting Task-Dependent Modality Strengths for RGB-Event Small Object Detection

超越对称融合:利用任务相关的模态优势进行RGB-事件小目标检测

Ziheng Wang, Chaolang Li, Yutong Yang, Xiaohan Xu, Chongxiang Yang, Hengxuan Zhong, Zhen Liang, Pengwen Dai

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对现有RGB-事件检测器的对称融合设计缺陷,提出AERODet模型,通过SURE和TDSR实现任务相关的模态利用,在FRED和NeRDD数据集上取得最优性能,FRED挑战性拆分提升10.7 mAP点。

Comments 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00371 2026-08-04 cs.CV 新提交 57%

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22973 2026-08-04 cs.CV 版本更新 57%

mmSimPrior: Learning Simulation Priors for Data-Efficient and Generalizable Real-World Radar-based Human Motion Reconstruction

mmSimPrior:学习用于数据高效的真实世界可泛化雷达人体运动重建的模拟先验

Cheng Guo, Qiming Cao, Shengkai Xu, Haoyu Xie, Kaixiang Su, Pu Wang, Hongfei Xue

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对毫米波雷达人体运动重建中数据收集成本高及模拟训练模型迁移差的问题,提出mmSimPrior框架,将知识分解为先验,经多模态编码器等训练,构建数据集并设无重叠设置,实验证明其在降低MPJPE上有显著效果。

Comments 19 pages, 11 figures, including supplementary material. Project page: https://ch3ngguo.github.io/mmsimprior/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06872 2026-08-04 cs.CV 版本更新 57%

Ensemble Deep Learning Approaches for AI-Altered Video Detection

用于人工智能篡改视频检测的集成深度学习方法

Laiba Khan, Hung-Mao Wu, Wei Lin, Frank Bi, Yousef Abdelhadi, Joshua Jung

机构 * Department of Mathematical and Computational Sciences, University of Toronto Mississauga(多伦多大学密西沙加分校数学与计算科学系) Department of Mathematical and Computational Sciences, University of Toronto(多伦多大学数学与计算科学系) University of Toronto(多伦多大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对人工智能篡改视频检测难题,开发多模态深度伪造检测系统,结合音频视觉分析,用模型集成及均值平均、堆叠等策略组合分数,提升检测鲁棒性与性能,凸显对未见篡改泛化的挑战,平均准确率约70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01095 2026-08-04 cs.CV cs.LG 版本更新 57%

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

NarrativeTrack: 评估实体中心推理在叙事理解中的表现

Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma, Gargi Chakraborty

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。

Comments Project Page: https://github.com/apple/ml-NarrativeTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12147 2026-08-04 cs.CV 版本更新 57%

EgoIntent: A Pre-Outcome Micro-Step Benchmark for Understanding What, Why, and Next

EgoIntent: 一种用于理解‘是什么、为什么和下一步’的以自我为中心的步级基准

Ye Pan, Chi Kit Wong, Yuanhuiyi Lyu, Hanqian Li, Chenfei Liao, Jiahao Huo, Lutao Jiang, Zixin Zhang, Jiacheng Chen, Yuqian Fu, Xu Zheng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 EgoIntent基准旨在通过步级意图理解解决以自我为中心视频中对‘是什么、为什么和下一步’的细粒度理解难题,包含15种日常生活场景,评估模型在三个维度上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15038 2026-08-04 cs.AI 版本更新 57%

LADY: Linear Attention for Autonomous Driving Efficiency without Transformers

LADY:用于自动驾驶效率的线性注意力,无需Transformer

Jihao Huang, Xi Xia, Zhiyuan Li, Tianle Liu, Jingke Wang, Junbo Chen, Tengju Ye

机构 * Udeer AI Zhejiang University(浙江大学) Yuanshi Intelligence(元世智能)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

AI总结 LADY是首个基于线性注意力的端到端自动驾驶生成模型,通过常数时间与内存复杂度实现高效长时序建模与跨模态交互。

Comments Accepted by IEEE RAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08065 2026-08-04 cs.AI 57%

STGDPM:Vessel Trajectory Prediction with Spatio-Temporal Graph Diffusion Probabilistic Model

Jin Wenzhe, Tang Haina, Zhang Xudong

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments This paper has been ACCEPTED as a FULL PAPER at DASFAA 2025

Journal ref Database Systems for Advanced Applications (DASFAA 2025), Lecture Notes in Computer Science, vol. 15987, pp. 571-586, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01773 2026-08-04 q-bio.NC 新提交 50%

NeuroWorld: A Latent Brain World Model for Stimulus-Conditioned Human Brain Dynamics

NeuroWorld:用于刺激条件下人脑动力学的潜在脑世界模型

Zijian Dong, Jianxiong Zhou, Kwun Kei Ng, Jan Paolo Macapinlac Balagtas, Zhizhou Li, Zijiao Chen, Juan Helen Zhou

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对现有脑编码模型的时间约束缺陷,提出首个脑世界模型NeuroWorld,通过两阶段方法在三个fMRI基准上实现了更优的脑活动多步预测性能,为脑活动因果预测提供了新框架。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13489 2026-08-04 eess.SP 版本更新 50%

Feasibility of simultaneous EEG-fMRI at 0.55 T: Recording, Denoising, and Functional Mapping

0.55T下同时进行EEG-fMRI可行性的研究:记录、去噪与功能映射

Parsa Razmara, Takfarinas Medani, Majid Abbasi Sisara, Anand A. Joshi, Rui Chen, Woojae Jeong, Ye Tian, Krishna S. Nayak, Richard M. Leahy

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究证明在0.55T下同时进行EEG-fMRI的可行性,通过去噪和功能映射展示了多模态神经成像的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 21 篇

2608.02148 2026-08-04 cs.IR cs.CL cs.CV 新提交 86%

Douyin Multimodal Embedding Model Technical Report

抖音多模态嵌入模型技术报告

Haonan Chen, Chu Li, Zhicheng Wang, Yuanwei Liu, Yuanjiang Wang, Shaohua Jiang, Zhicheng Dou

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02583 2026-08-04 cs.CV cs.AI cs.CL cs.IR 新提交 85%

UEmbed: Unified Sparse and Dense Multimodal Embeddings

UEmbed:统一稀疏与稠密多模态嵌入

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Yale University(耶鲁大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01430 2026-08-04 cs.AI 新提交 83%

MRAFnd: Multimodal Retrieval-Augmented Framework for Zero-Shot Fake News Detection

MRAFnd:面向零样本假新闻检测的多模态检索增强框架

Lehan Zhang, Yinlei Cheng, Shiqi Hu Yiheng Zhou, Shangxi Li, Naidong Zhao

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对零样本假新闻检测的现有方法无法识别重复虚假手段与跨模态差异的问题,本文提出多模态检索增强框架MRAFnd,经多智能体协作推理,在Weibo-21等数据集上准确率最高提升2.35%,优于现有方法。

Comments 14 pages, 6 figures, 2 tables, Presented at the MMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01543 2026-08-04 cs.AI cs.CL cs.CV cs.IR 新提交 82%

V-Mem: Modality-Routed Retrieval for Long-Term Multimodal Agentic Memory

V-Mem:面向多模态智能体长期记忆的模态路由检索

Dingyi Kang, Dongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究针对多模态智能体记忆的模态与相似性-相关性差距,提出V-Mem系统,通过模态路由检索优化,在Mem-Gallery、LoCoMo数据集上显著提升多模态问答性能。

Comments 19 pages, 2 figures, 16 tables. Code: https://github.com/Dingyi-Kang/V-Mem

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00877 2026-08-04 cs.LG 新提交 82%

GeoArbiter: Verifiability-Guided Grounding for Remote-Sensing Multimodal LLMs

GeoArbiter:面向遥感多模态大语言模型的可验证性导向 grounding 方法

Xuechen Li

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 该研究针对遥感多模态大语言模型的事实断言问题,提出无需训练的 GeoArbiter 流程,通过仅注入图像无法验证的地理事实,有效降低了模型的断言级幻觉并提升了对冲突记录的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00623 2026-08-04 cs.LG 新提交 82%

Towards Effective Federated Multimodal Graph Learning via Navigating Multifaceted Heterogeneity

面向有效联邦多模态图学习的多层面异质性导航方法

Yinlin Zhu, Di Wu, Yi Zhang, Xunkai Li, Wang Luo, Wei-Jin Huang, Miao Hu, Guocong Quan

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对联邦多模态图学习的多层面异质性问题,本文提出FedTCR算法,通过两阶段范式与拓扑感知跨模态路由机制,在7个领域的图中心与模态中心任务上优于现有最优基线。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15782 2026-08-04 cs.AI cs.CV 版本更新 81%

Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference

通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉

Pratheswaran Hariharan, Haiping Xu, Donghui Yan

机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27269 2026-08-04 cs.AI 版本更新 79%

Unifying biomedical knowledge in a modern multimodal graph

OptimusKG:统一生物医学知识的现代多模态图

Lucas Vittor, Ayush Noori, Iñaki Arango, Joaquín Polonuer, Sam Rodriques, Andrew White, David A. Clifton, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Edison Scientific Inc.(Edison科学公司) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20318 2026-08-04 cs.CV cs.MM 版本更新 79%

UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval

UniCVR:从对齐到重排序的统一零样本复合视觉检索

Haokun Wen, Xuemeng Song, Haoyu Zhang, Weili Guan, Xiangyu Zhao, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学) Southern University of Science and Technology(南方科技大学) Pengcheng Laboratory(鹏城实验室)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 UniCVR提出首个统一零样本复合视觉检索框架,结合多模态大语言模型与视觉语言预训练模型,通过两阶段方法实现多任务联合优化,实验表明其在五个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01852 2026-08-04 cs.DB cs.IR 新提交 78%

Multimodal Embeddings for 3D Similarity Search in Semantic Web-of-Things Digital-Twin Platforms

面向语义物联网数字孪生平台中三维相似度搜索的多模态嵌入

Oussama Zaid, Romaric Gaudel, Hassan Thomas, Maria Massri, Philippe Raipin-Parv{é}dy

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文针对语义物联网数字孪生平台缺乏三维相似度搜索能力的问题,提出多模态嵌入框架,在Thing'in平台实现后经S3DIS验证,可支持混合本体-向量查询,满足相关领域的三维相似度搜索需求。

Journal ref 4th International Workshop on the Semantic WEb of EveryThing (SWEET 2026), co-located with ICWE 2026, Jun 2026, Lyon, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00544 2026-08-04 cs.CV 新提交 74%

Zero-Cost Virtual RNA: Approximating Immunotherapy Signatures via Cross-Modal WSI Retrieval

零成本虚拟RNA:通过跨模态WSI检索近似免疫治疗特征

Sigrid Vila-Bagaria, Mar Teixidó, Miquel Piñol, Felip Vilardell, Robert Montal, Veronica Vilaplana

机构 * Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) IRB Lleida(莱里达生物医学研究所)

专题命中 跨模态检索 :cross-modal(title);分类 cs.CV

AI总结 针对胃腺癌免疫治疗RNA特征检测成本高的问题,提出VITA模型,通过H&E与RNA跨模态对齐实现仅用H&E切片近似RNA特征,取得0.72准确率等结果,提供低成本预筛选工具。

Comments Accepted to MIDL 2026 Short Paper track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00551 2026-08-04 cs.IR 新提交 67%

PHA-Net: Prototype-based Hierarchical Alignment Network for Text-Video Retrieval

PHA-Net:用于文本-视频检索的基于原型的分层对齐网络

Xiaolun Jing, Kezhao Yin, Xinxing Yang, Genke Yang, Jian Chu

专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract)

AI总结 针对文本-视频检索中跨模态语义不匹配及计算成本高的问题,提出PHA-Net,以模态共享原型为桥梁,结合原型支持的令牌合并模块与原型对比损失,在四个基准数据集上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00361 2026-08-04 cs.CV cs.AI 新提交 62%

Artificial Intelligence for the Characterization of Particles and Fibers by Optical Microscopy

用于光学显微镜下颗粒与纤维表征的人工智能方法

Simiao Sun, Kenneth Ng, Lynn Lee, Astrid Harth, Asami Odate, Aggelos Katsaggelos, Manuel Ballester Matito, Nicholas Eastaugh, Marc Walton

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种带语义锚点的AI蒸馏框架,训练仅视觉输入的学生ViT模型,在颗粒与纤维显微镜表征任务中获80%伪类验证准确率等结果,实现更丰富可解释的表征,适用于相关分析场景。

详情

展开后加载摘要…

URL PDF HTML 收藏