arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3450 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3450 篇

2601.11632 2026-05-28 cs.CV 79%

KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering

KG-ViP:在多模态大语言模型中桥接知识基础与视觉感知以进行视觉问答

Zhiyang Li, Ao Ke, Yukun Cao, Xike Xie

机构 * University of Science and Technology of China(中国科学技术大学) Data Darkness Lab, MIRACLE Center, USTC(数据黑暗实验室,MIRACLE中心,中国科学技术大学) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出KG-ViP框架,通过检索与融合场景图和常识图,统一外部知识与细粒度视觉细节,缓解多模态大语言模型在视觉问答中的知识幻觉和视觉感知不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23996 2026-05-26 cs.CV eess.IV 79%

Brain-to-Image Retrieval and Reconstruction via Multimodal EEG Alignment

通过多模态EEG对齐实现脑到图像的检索与重建

Chi Kit Wong, Yan Liu, Haowen Yan

专题命中 跨模态检索 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 提出一种脑到图像系统,通过多模态EEG对齐实现自然图像观看时的视觉刺激解码,在检索任务中达到86.30%的Top-1准确率,在重建任务中获得0.903的CLIP分数。

Comments 16 pages, 5 figures. Code available at: https://github.com/Chikit-WONG/DL_Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22833 2026-05-25 cs.IR cs.AI cs.LG 79%

RAG4Outcome: A Retrieval-Augmented Multimodal Framework for Prognostic Prediction in Chronic Osteomyelitis

RAG4Outcome:用于慢性骨髓炎预后预测的检索增强多模态框架

Daqian Shi, Pei Han, Jishizhan Chen, Yang Wang, Xiaolei Diao, Xianyou Zheng, Pengfei Cheng

机构 * Queen Mary University of London(女王玛丽大学) Shanghai Sixth People’s Hospital Affiliated to SJTU School of Medicine(上海第六人民医院附属复旦大学医学院) University College London(大学学院伦敦)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出RAG4Outcome框架,通过检索增强生成技术融合PET-CT影像报告、结构化手术诊断记录和非结构化随访笔记等多模态临床数据,实现慢性骨髓炎的预后预测,提高可解释性和临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22829 2026-05-25 cs.IR cs.AI 79%

LFRAG: Layout-oriented Fine-grained Retrieval-Augmented Generation on Multimodal Document Understanding

LFRAG:面向布局的多模态文档理解中的细粒度检索增强生成

Yifan Zhu, Yu Mi, Yue Lu, Yanchu Guan, Zhixuan Chu

机构 * Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Zhejiang University Institute of Blockchain and Data Security(杭州高新技术区(滨江)浙江大学区块链与数据安全研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 提出LFRAG框架,通过布局分割和语义-布局融合编码器实现从页面级到块级的细粒度检索,提升多模态文档检索精度并减少生成冗余,在LFDocQA基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16638 2026-05-19 cs.AI 79%

TTE-Flash: Accelerating Reasoning-based Multimodal Representations via Think-Then-Embed Tokens

TTE-Flash: 通过思考-然后-嵌入标记加速基于推理的多模态表示

Jianpeng Cheng, Xian Wu, Jiangfan Zhang, Wentao Bao, Chaitanya Ahuja, Shlok Kumar Mishra, Hanchao Yu, Yang Gao, Fan Xia, Qi Guo, Shaodan Zhai, Xiangjun Fan, Jun Xiao

机构 * Meta AI

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出TTE-Flash模型,通过引入隐式思考标记替代显式推理链,实现多模态表示的高效推理。模型在MMEB-v2基准上优于显式CoT方法,且在零样本评估中展示了可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13034 2026-05-14 cs.CV cs.IR 79%

ViDR: Grounding Multimodal Deep Research Reports in Source Visual Evidence

ViDR:基于源视觉证据的多模态深度研究报告 grounding

Zhuofan Shi, Peilun Jia, Baoqin Sun, Haiyang Shen, Sixiong Xie, Yun Ma, Xiang Jing

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室) School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 ViDR通过源视觉证据构建多模态深度研究报告框架,提升报告质量与证据可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12678 2026-05-13 cs.CL 79%

Gradient-Boosted Decision Tree for Listwise Context Model in Multimodal Review Helpfulness Prediction

基于列表式上下文模型的梯度提升决策树在多模态评论有用性预测中的应用

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Anh Tuan Luu, Cong-Duy Nguyen, Zhen Hai, Lidong Bing

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) DAMO Academy(达摩院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出列表式注意力网络和梯度提升决策树,用于多模态评论有用性预测,以提升模型泛化能力与排名准确性。

Comments Published in ACL 2023 (Findings). Code is available at https://github.com/nguyentthong/gbdt_listwise_mrhp

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10253 2026-05-12 cs.CR cs.AI 79%

Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation

针对医疗多模态检索增强生成的知识污染攻击

Peiru Yang, Haoran Zheng, Tong Ju, Shiting Wang, Wanchun Ni, Jiajun Liu, Shangguang Wang, Yongfeng Huang, Tao Qi

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern Polytechnical University(西北工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 本文提出M³Att框架,针对医疗多模态RAG系统,通过在文本数据中注入隐蔽虚假信息并利用配对视觉数据作为查询无关触发器,提升检索概率,从而在不依赖用户查询先验知识的情况下实现知识污染攻击。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07683 2026-05-11 cs.LG cs.AI 79%

Multimodal Cancer Modeling in the Age of Foundation Model Embeddings

多模态癌症建模:在基础模型嵌入时代

Steven Song, Morgan Borjigin-Wang, Irene Madejski, Robert L. Grossman

机构 * Center for Translational Data Science(转化数据科学中心) Department of Computer Science(计算机科学系) University of Chicago(芝加哥大学) Medical Scientist Training Program(医学科学家培训计划) Brown University(布朗大学) Section of Biomedical Data Science(生物医学数据科学部门) Department of Medicine(医学系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文探讨了利用基础模型嵌入进行多模态癌症建模的可能性,展示了多模态融合的优势,并评估了病理报告文本和文本摘要对模型性能的影响。

Comments camera ready version for ML4H 2025, typo corrected

Journal ref Proceedings of the Fifth Machine Learning for Health Symposium, PMLR 297:202-227, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27724 2026-05-01 cs.AI 79%

Iterative Multimodal Retrieval-Augmented Generation for Medical Question Answering

迭代多模态检索增强生成用于医疗问答

Xupeng Chen, Binbin Shi, Chenqian Le, Jiaqi Zhang, Kewen Wang, Ran Gong, Jinhan Zhang, Chihang Wang

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Independent Researcher(独立研究者) Chinese Academy of Sciences, Beijing, China(中国科学院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 MED-VRAG通过多模态检索增强生成框架,利用文档页面图像而非OCR文本进行医疗问答,提升准确率至78.6%,并验证检索和迭代对问答性能的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25711 2026-05-01 cs.SE cs.AI 79%

Learning Generalizable Multimodal Representations for Software Vulnerability Detection

学习通用的多模态表示以进行软件漏洞检测

Zeming Dong, Yuejun Guo, Qiang Hu, Yao Zhang, Maxime Cordy, Hao Liu, Mike Papadakis, Yongqiang Lyu

机构 * University of Luxembourg(卢森堡大学) Luxembourg Institute of Science and Technology(卢森堡科学与技术研究院) Tianjin University(天津大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MultiVul框架,通过双相似性学习和一致性正则化对代码和注释进行多模态对齐,提升漏洞检测的泛化能力,实验表明在多个数据集上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23522 2026-04-28 cs.IR cs.MM 79%

Beyond Static Collision Handling: Adaptive Semantic ID Learning for Multimodal Recommendation at Industrial Scale

超越静态碰撞处理:面向工业级多模态推荐的自适应语义ID学习

Yongsen Pan, Yuxin Chen, Zheng Hu, Xu Yuan, Daoyuan Wang, Yuting Yin, Songhao Ni, Hongyang Wang, Jun Wang, Fuji Ren, Wenwu Ou

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出AdaSID框架,通过两阶段过程自适应处理多模态推荐中的语义ID碰撞问题,提升召回率和NDCG,并在工业场景中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20444 2026-04-23 cs.RO cs.AI cs.DB cs.LG 79%

VTouch++: A Multimodal Dataset with Vision-Based Tactile Enhancement for Bimanual Manipulation

VTouch++:一个用于双臂操作的多模态数据集,具有基于视觉的触觉增强

Qianxi Hua, Xinyue Li, Zheng Yan, Yang Li, Chi Zhang, Yongyao Li, Yufei Liu

机构 * Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学) School of Astronautics, Harbin Institute of Technology(航天学院,哈尔滨工程大学)

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract);分类 cs.AI

AI总结 本文提出VTouch++数据集,通过视觉触觉传感提供高保真的物理交互信号,采用矩阵式任务设计实现系统学习,并利用自动化数据采集管道确保可扩展性,通过跨模态检索和真实机器人评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20283 2026-04-23 cs.CL 79%

Multi-Perspective Evidence Synthesis and Reasoning for Unsupervised Multimodal Entity Linking

多视角证据综合与推理用于无监督多模态实体链接

Mo Zhou, Jianwei Wang, Kai Wang, Helen Paik, Ying Zhang, Wenjie Zhang

机构 * The University of New South Wales(新南威尔士大学) Shanghai Jiao Tong University(上海交通大学) University of Technology Sydney(技术大学悉尼)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MSR-MEL框架,通过多视角证据综合与推理提升无监督多模态实体链接性能,采用图神经网络和大语言模型进行证据整合与推理,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18892 2026-04-22 cs.CL 79%

Prioritizing the Best: Incentivizing Reliable Multimodal Reasoning by Rewarding Beyond Answer Correctness

优先选择最佳:通过奖励超越答案正确性来激励可靠的多模态推理

Mengzhao Jia, Zhihan Zhang, Meng Jiang

机构 * University of Notre Dame(北德克萨斯大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出Groupwise Ranking Reward方法,通过在单次遍历中对相同提示下的验证通过轨迹进行排名并重新分配奖励,有效缓解多模态强化学习中的推理-答案不一致问题,提升可靠性条件下的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02073 2026-04-21 cs.CV 79%

PLUME: Latent Reasoning Based Universal Multimodal Embedding

PLUME:基于潜在推理的通用多模态嵌入

Chenwei He, Xiangzhao Hao, Tianyu Yang, Yuxiang Ma, Yuheng Jia, Lingxiang Wu, Chaoyang Zhao, Haiyun Guo, Jinqiao Wang

机构 * Southeast University(东南大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 PLUME通过引入潜在推理框架改进通用多模态嵌入,用连续潜在状态的自回归滚动替代显式推理链,减少推理开销并提升效率,优于传统显式推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17394 2026-04-21 cs.CV 79%

LVLM-Aware Multimodal Retrieval for RAG-Based Medical Diagnosis with General-Purpose Models

面向RAG的医疗诊断的LVLM感知多模态检索

Nir Mazor, Tom Hope

机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(希伯来大学耶路撒冷分校计算机科学与工程学院) The Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出轻量级机制提升检索增强LVLM的诊断性能,通过轻量微调和通用模型实现临床分类和VQA任务的竞争力结果,并分析不一致检索预测问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12574 2026-04-15 cs.CV 79%

Cross-Modal Knowledge Distillation for PET-Free Amyloid-Beta Detection from MRI

跨模态知识蒸馏用于无PET的MRI淀粉样蛋白β检测

Francesco Chiumento, Julia Dietlmeier, Ronan P. Killeen, Kathleen M. Curran, Noel E. O'Connor, Mingming Liu

机构 * Dublin City University(都柏林城市大学) Insight Research Ireland Centre for Data Analytics(爱尔兰Insight研究数据分析师中心) St. Vincent’s University Hospital(圣文森医院) University College Dublin(都柏林大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种基于BiomedCLIP的跨模态知识蒸馏框架,利用MRI单独预测淀粉样蛋白β,无需PET或临床变量,实现了可解释的无PET检测方法。

Comments Accepted to CVPR Workshops 2026 (PHAROS-AIF-MIH)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12081 2026-04-15 cs.AI 79%

Human-Inspired Context-Selective Multimodal Memory for Social Robots

以人为本的上下文选择性多模态记忆用于社交机器人

Hangyeol Kang, Slava Voloshynovskiy, Nadia Magnenat Thalmann

机构 * Department of Computer Science, University of Geneva(日内瓦大学计算机科学系) MIRALab, University of Geneva(日内瓦大学MIRALab)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种以人为本的多模态记忆架构,用于社交机器人,通过捕捉和检索文本和视觉事件痕迹,提升个性化和上下文感知的交互能力。

Comments Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11095 2026-04-14 cs.LG cs.AI 79%

Bottleneck Tokens for Unified Multimodal Retrieval

瓶颈令牌用于统一多模态检索

Siyu Sun, Jing Ren, Zhaohe Liao, Dongxiao Mao, Xiangyuan Ren, Yiyi Zhang, Haohua Zhao, Weixiong Lin, Jiang Shaohua, Liqing Zhang, Yuchao Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出瓶颈令牌和生成信息压缩方法,解决多模态大语言模型在统一检索中的隐式池化和对比微调问题,提升语义压缩效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10071 2026-04-14 cs.CV 79%

Spotlight and Shadow: Attention-Guided Dual-Anchor Introspective Decoding for MLLM Hallucination Mitigation

聚光与阴影:基于注意力的双锚点反思解码用于MLLM幻觉缓解

Yebo Wu, Han Jin, Zhijiang Guo, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(澳门大学物联网国家重点实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 跨模态检索 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出双锚点反思解码框架DaID,通过动态校准每个token生成来缓解MLLM幻觉,利用视觉注意力分布指导双锚点选择,提升推理能力。

Comments Accepted for Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07863 2026-04-10 cs.IR cs.AI 79%

Task-Adaptive Retrieval over Agentic Multi-Modal Web Histories via Learned Graph Memory

基于学习图记忆的代理多模态网络历史任务自适应检索

Saman Forouzandeh, Kamal Berahmand, Mahdi Jalili

机构 * School of Engineering, Royal Melbourne Institute of Technology University(皇家墨尔本理工大学工程学院)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出ACGM方法,通过任务自适应图记忆检索代理历史,利用策略梯度优化提升检索质量,在多个数据集上取得显著成果。

Comments The 49th International ACM SIGIR Conference on Research and Development in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06179 2026-04-09 cs.IR cs.CL 79%

ARIA: Adaptive Retrieval Intelligence Assistant -- A Multimodal RAG Framework for Domain-Specific Engineering Education

ARIA:自适应检索智能助手——面向领域特定工程教育的多模态RAG框架

Yue Luo, Dibakar Roy Sarkar, Rachel Herring Sangree, Somdatta Goswami

机构 * Dalian University of Technology(大连理工大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 ARIA通过多模态内容提取管道和e5-large-v2模型,实现领域特定工程教育的智能教学助手,展现高精度和教学一致性,验证了其在课程相关问题上的高准确率和响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29441 2026-04-09 cs.CV 79%

EarthEmbeddingExplorer: A Web Application for Cross-Modal Retrieval of Global Satellite Images

地球嵌入探索器:一种用于全球卫星图像跨模态检索的Web应用

Yijie Zheng, Weijie Wu, Bingyue Wu, Long Zhao, Guoqing Li, Mikolaj Czerkawski, Konstantin Klemmer

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences(中国科学院地理科学与资源研究所) Asterisk Labs(Asterisk实验室) LGND AI, Inc.(LGND AI公司) University College London(伦敦大学学院)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文介绍EarthEmbeddingExplorer,一种Web应用,通过跨模态查询实现全球卫星图像的动态检索,帮助研究人员将研究成果转化为实际应用。

Comments ICLR 2026 Workshop ML4RS Tutorial Track (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05773 2026-04-08 cs.CV 79%

PDMP: Rethinking Balanced Multimodal Learning via Performance-Dominant Modality Prioritization

PDMP:通过性能主导模态优先级重思平衡多模态学习

Shicai Wei, Chunbo Luo, Qiang Zhu, Yang Luo

机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(电子科技大学智能协同计算实验室) School of Information and Communication Engineering, University of Electronic Science and Technology of China(电子科技大学信息与通信工程学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PDMP策略,通过性能主导模态优先级提升多模态学习效果,解决传统方法中因模态不平衡导致的优化不足问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05038 2026-04-08 cs.CL 79%

Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization

引导查询细化:多模态混合检索与测试时优化

Omri Uzan, Asaf Yehudai, Roi pony, Eyal Shnarch, Ariel Gera

机构 * Stanford University(斯坦福大学) IBM Research(IBM研究院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出引导查询细化方法,通过测试时优化提升多模态检索性能,使视觉中心模型在效率和性能上达到更优平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01247 2026-04-03 cs.SD eess.AS 79%

Combining Masked Language Modeling and Cross-Modal Contrastive Learning for Prosody-Aware TTS

结合掩码语言建模与跨模态对比学习的语调感知语音合成

Kirill Borodin, Vasiliy Kudryavtsev, Maxim Maslov, Nikita Vasiliev, Mikhail Gorodnichev, Grach Mkrtchian

机构 * MTUCI(莫斯科电信与信息技术大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 eess.AS

AI总结 本文研究了基于扩散模型的语音合成中多阶段预训练对语调建模的影响,通过掩码语言建模与混合音素对比学习相结合,提升了生成质量与感知指标。

Comments This paper has been submitted to Interspeech 2026 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29376 2026-04-03 cs.CV 79%

Assessing Multimodal Chronic Wound Embeddings with Expert Triplet Agreement

基于专家三元组一致性的多模态慢性伤口嵌入评估

Fabian Kabus, Julia Hindel, Jelena Bratulić, Meropi Karakioulaki, Ayush Gupta, Cristina Has, Thomas Brox, Abhinav Valada, Harald Binder

机构 * Institute of Medical Biometry and Statistics (IMBI), Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学院与医学中心医学统计与生物统计研究所) Department of Computer Science, Faculty of Engineering, University of Freiburg(弗莱堡大学工程学院计算机科学系) Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学院与医学中心皮肤科)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出通过专家三元组比较评估嵌入空间,引入TriDerm框架整合图像、边界掩码和专家报告,融合视觉与文本模态提升专家一致性至73.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03380 2026-04-03 cs.CV 79%

Seeing Through the Chain: Mitigate Hallucination in Multimodal Reasoning Models via CoT Compression and Contrastive Preference Optimization

通过链看穿:通过CoT压缩和对比偏好优化缓解多模态推理模型的幻觉

Hao Fang, Jinyu Li, Jiawei Kong, Tianqu Zhuang, Kuofeng Gao, Bin Chen, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出C3PO框架,通过CoT压缩和对比偏好优化缓解多模态推理模型的幻觉问题,通过过滤冗余思考 token 提升信号效率,并利用高质量反馈和定制诱导器增强对比学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29631 2026-04-01 cs.CV cs.DC cs.IR 79%

Storing Less, Finding More: How Novelty Filtering Improves Cross-Modal Retrieval on Edge Cameras

存储更少,查找更多:新颖性过滤如何改进边缘摄像头上的跨模态检索

Sherif Abdelwahab

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种流式检索架构,通过边缘设备的epsilon-net过滤器保留语义新颖帧,构建去噪嵌入索引,并结合跨模态适配器和云重排序器,提升边缘摄像头跨模态检索性能。

Comments 6 pages, 3 figures, 5 tables; supplementary video included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏