arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-28 至 2026-07-28 共收录 99 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 11 篇

2607.24354 2026-07-28 cs.AI 新提交 83%

Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization

提示优化器是盲目运行的吗?用于自动提示优化的跨模态视觉反馈

Haoyue Liu, Xiaoyu Ma, Ye Chen, Yuexian Zou, Xiaoying Tang

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 研究多模态任务中自动提示优化的盲目性问题,提出跨模态视觉反馈方法,含故障条件视觉诊断和错误感知聚合阶段,在多个VQA数据集和目标VLM上效果显著,能提升分数且优化器可跨模型转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23981 2026-07-28 cs.CV cs.AI 新提交 76%

Multimodal Semantic-Probabilistic Objectness for Open World Object Detection

用于开放世界目标检测的多模态语义概率目标性

Weijun Tian, Rui Liu

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 研究开放世界目标检测问题,提出MSPO轻量级语义校准框架,通过融合已知类别语言语义与视觉目标性来校准预测,在实验中改进了PROB基线,提升了主要指标及PASCAL VOC最终mAP,证明已知类别语义可有效校准概率目标性。

Comments 16 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23368 2026-07-28 cs.CV cs.AI cs.CL 新提交 67%

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

用基于树图解析支持的加权班扎夫交互解释生物医学CLIP

Jakub Rymarski, Adam Rempała, Bartłomiej Sobieski, Przemysław Biecek

机构 * University of Warsaw(华沙大学) Centre for Credible AI, Warsaw University of Technology(华沙理工大学可信人工智能中心)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对视觉语言模型在医学任务中解释难的问题,引入ParseFIxLIP方法,将树图解析融入班扎夫交互博弈,通过smart_depth分组策略减轻概念碎片化,提升跨模态交互可解释性,为VLM决策提供医学领域相关见解。

Comments 12 pages, 13 figures. Accepted at EXPLIMED 2026 (Third Workshop on Explainable Artificial Intelligence for the medical domain), IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24707 2026-07-28 cs.AI cs.CV cs.DB 新提交 62%

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

ERUnderstand:在结构化实体关系图上评估视觉语言模型

Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24651 2026-07-28 cs.CV cs.CL cs.IR 新提交 62%

Evidence Attribution in Visual Document Understanding without Coordinates or Region Labels

无坐标或区域标签的视觉文档理解中的证据归因

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿尔托大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究视觉文档理解中无坐标或区域标签时的证据归因问题,通过对比坐标与语言接口,发现语言接口能提升证据召回率、降低幻觉率。基于此用引述和检索管道作训练框架,引入GRPO方法,提高了模型严格归因准确率,找到改善归因的实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24554 2026-07-28 cs.IR cs.CV 新提交 57%

DeCoRAG: Cognitive Decoupling and Semantic-Aware Cropping for Complex Document Understanding

DeCoRAG:用于复杂文档理解的认知解耦和语义感知裁剪

Shuo Wang, Kai Zhang, Wenyuan Huang, Yizheng Yu, Xia Liao, Junming Su, Qing Wang, Fang Xi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对复杂文档理解中多模态检索增强生成的难题,提出DeCoRAG方法,通过认知解耦、建立语义锚及区域感知裁剪机制,提升语义通过率,减少提示令牌,在复杂文档基准测试中取得良好效果。

Comments 11 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24194 2026-07-28 cs.CV 新提交 57%

Face Age Verification Vulnerabilities Under Simple Appearance Manipulations

简单外观操纵下的面部年龄验证漏洞

Ioannis Sarridis, Ioannis Kompatsiaris, Symeon Papadopoulos

机构 * Information Technologies Institute, Centre for Research and Technology Hellas(信息技术研究所,希腊研究与技术中心)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究简单外观操纵下面部年龄验证的漏洞,评估七个模型在三个数据集及四种操纵类型下的情况,发现胡茬操纵影响大,不同人口统计特征受影响有差异,还探索了用偏差缓解方法减轻偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23492 2026-07-28 cs.CV cs.LG 新提交 57%

To Erase, or Not to Erase: Robust Training-Free Concept Erasure with Preservation aware Adaptive Ranked Subspace Expansion

擦除还是不擦除:基于保留感知自适应排序子空间扩展的无训练鲁棒概念擦除

Shaswati Saha, Rajasekhar Anguluri, Manas Gaur

机构 * University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 研究针对文本到图像扩散模型的概念擦除技术面临的鲁棒性与效用权衡问题,提出无训练框架PARSE,通过自适应发现擦除与保留概念、编辑交叉注意力值空间及迭代搜索触发因素来实现鲁棒概念擦除,引入BEUS评估,实验证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23373 2026-07-28 cs.CV 新提交 57%

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器

Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis, Yassine Ouali, Hyeonuk Kim, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) Technical University of Iasi(雅西技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22902 2026-07-28 cs.AI cs.SE 新提交 57%

How Well Can AI Generate Backlogs from App Mockups?

人工智能从应用程序原型生成待办事项列表的效果如何?

Andrea Lezcano Airaldi, Lourdes Romera, Walid Maalej

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究人工智能从应用程序原型生成待办事项列表的效果,提出多模态方法,评估三种提示策略,发现结合架构上下文的混合提示有帮助,结果因项目类型而异,还提出新度量,强调开发人员监督必要。

Comments Accepted at the AIRE Workshop, IEEE 34th International Requirements Engineering Conference (RE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23739 2026-07-28 cs.SI 新提交 50%

Separating Clicks from Baits: Using Large Language Models to Detect Misleading YouTube Thumbnails

从诱饵中分离点击:使用大语言模型检测误导性的YouTube缩略图

Wajiha Naveed, Muhammad Muneeb Pervez, Zaeem Mohtashim Khan, Zafar Ayyub Qazi, Zartash Afzal Uzmi

专题命中 图文多模态 :multi-modal(abstract)

AI总结 研究针对YouTube等平台误导性缩略图问题,提出用大语言模型的多模态检测管道,构建数据集并评估多个模型,发现Claude 3.5 Sonnet性能突出,通过失败分析为视频平台发展提供方向。

Comments Accepted to the 21st International AAAI Conference on Web and Social Media (ICWSM 2027)

Journal ref Proceedings of the International AAAI Conference on Web and Social Media, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2607.22794 2026-07-28 cs.LG cs.AI cs.CL cs.SD 新提交 84%

Multimodal Domain Generalization for Depression Detection: An Attention-Based BiLSTM Network with Domain-Adversarial Training

用于抑郁症检测的多模态域泛化:基于注意力的双向长短期记忆网络与域对抗训练

Ali Tabaraei, Federico Simonetta, Stavros Ntalampiras

机构 * University of Milan(米兰大学) Gran Sasso Science Institute (GSSI)(大萨索科学研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 研究针对深度学习抑郁症检测泛化受限问题,提出含域泛化的多模态检测框架,集成BiLSTM与注意力机制,用梯度反转层增强泛化,实验表明该方法提升了准确率和F1分数,超越现有基准,消融研究突出各因素贡献。

Comments 12 pages, 8 figures, 6 tables. Accepted for publication in IEEE Transactions on Neural Networks and Learning Systems (TNNLS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23845 2026-07-28 cs.AI 新提交 84%

Do Visual Features Improve Other-Initiated Repair Detection? A Dyadic Multimodal Approach

视觉特征能否改善他人发起的修复检测?一种二元多模态方法

Anh Ngo, Nicolas Rollet, Catherine Pelachaud, Chloé Clavel

机构 * INRIA Paris(法国国家信息与自动化研究所巴黎分院) ISIR, Sorbonne University Paris(巴黎索邦大学信息学、系统与机器人研究所) Télécom Paris, SES, Institut Polytechnique de Paris, I3-CNRS Paris(巴黎电信学院、巴黎高等理工学院SES系、巴黎综合理工学院I3 - 法国国家科学研究中心) CNRS(法国国家科学研究中心) LTCI, Institut Polytechnique de Paris(巴黎综合理工学院LTCI实验室)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究他人发起的修复检测问题,提出结合视觉特征的二元多模态模型,通过在两个语料库上评估,证明视觉信息能提升检测性能,提供跨模态特征贡献见解。

Comments Accepted to ICMI 2026 (International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24430 2026-07-28 cs.HC cs.CL eess.AS 新提交 62%

Let Me Look at You: Advanced Facial Expression Modeling for Conversational Speech Synthesis

让我看着你:用于对话语音合成的高级面部表情建模

Yifan Hu, Shuwei He, Rui Liu, Haizhou Li

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

AI总结 研究针对对话语音合成中面部表情线索常被忽视及缺乏多模态数据集的问题,提出基于大语言模型的FacialTalker框架,含AUTokenizer和DualDPO策略,构建VSDD-1K数据集,实验表明该框架在表情感知和语音合成质量上表现出色。

Comments 10 pages, 5 figures, 5 tables. Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23808 2026-07-28 cs.CL cs.AI 新提交 62%

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

Indic DiarBench:印度语言的多语言联合语音分离与自动语音识别基准

Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi, Kaushal Bhogale, Mitesh M. Khapra

机构 * Sarvam AI(萨尔瓦姆人工智能公司) AI4Bharat, IIT Madras(印度理工学院马德拉斯分校人工智能促进印度发展实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 介绍涵盖印度22种在册语言的Indic DiarBench基准数据集,含约108小时多说话者音频,经人工校正注释。通过评估领先系统建立基线,该数据集作为开放资源推动印度语言多语言语音技术研究。

Comments 5 pages, 2 figures, Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24359 2026-07-28 cs.CV 新提交 57%

TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation

TaoMate:用于实时音频-视频数字人生成的锚点引导内存桥接演化和参考状态

Qijun Gan, Chenwei Zhang, Meiguang Jin, Junfeng Ma, Qiu Shen

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 研究实时长格式数字人生成问题,提出TaoMate框架,通过锚点引导、内存桥接等方法,在保持稳定外观和视听同步下,实现少步联合音频-视频生成,且能跨块并行执行加速自回归推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24082 2026-07-28 cs.AI 新提交 57%

Towards High-Level Semantic Intelligence

迈向高级语义智能

Xiujie Song, Gefei Yang, Yining You, Jiahui Gan, Qi Jia, Shota Watanabe, Tianxi Wan, Mengyue Wu, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 综述从语义复杂性角度审视人工智能语义智能发展,系统调研高级语义任务研究,总结理解和生成的相关方法及策略,旨在推动人工智能向高级语义智能持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2607.22729 2026-07-28 cs.CV cs.CL 新提交 81%

Open Your Model's Eyes: Video and Context-Aware Multimodal Backchannel Prediction

睁开模型之眼:视频与上下文感知的多模态反馈预测

Min-Jae Kim, Jun-Yeong Moon, Mujeen Sung, Gyeong-Moon Park

机构 * Korea University(韩国大学) Kyung Hee University(庆熙大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究视频与上下文感知的多模态反馈预测问题,提出CAMA - BC框架,利用多层多模态对齐,分上下文对齐和反馈对齐两阶段,显著优于现有方法及简单多模态基线,尤其在识别复杂反馈上效果突出。

Comments 18 pages, Accepted at ACL 2026

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), Association for Computational Linguistics, pp. 3738-3755, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24570 2026-07-28 cs.CV cs.AI 新提交 62%

The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding

视觉瓶颈:用于联合时空视频定位的多模态大语言模型的稀疏帧适配

Jiameng Zhang, Srikanth Madikeri

机构 * University of Zurich(苏黎世大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型在视频定位中训练与部署条件不匹配问题,通过实验表明视觉特征提取是稀疏帧输入瓶颈,提出适配特定层及边界感知采样策略,证明训练策略对稀疏帧视频定位比模型规模更关键。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24064 2026-07-28 cs.CV cs.AI 新提交 62%

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。

Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24701 2026-07-28 cs.CV 新提交 57%

Spatio-Temporal Conditional Denoising Transformer for Modality-Missing RGBT Tracking

用于模态缺失的RGBT跟踪的时空条件去噪Transformer

Andong Lu, Ziyi Zha, Jiandong Jin, Shihao Li, Chenglong Li, Jin Tang, Bin Luo

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对RGBT跟踪中模态缺失致性能下降问题,提出时空条件去噪Transformer(SCDT)。它整合时空线索,通过利用不同时间线索及噪声调制适应机制,在统一框架下实现缺失模态信息重建等,实验证明其性能优于现有方法。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24098 2026-07-28 cs.CV 新提交 57%

ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation

ReflexTrack:一种用于无训练的引用视频对象分割的反馈驱动智能体

Yuanjia Li, Tianyang Xu, Tao Zhou, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音和信号处理中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对引用视频对象分割问题,提出无训练、反馈驱动的ReflexTrack智能体。通过掩码引导空间细化和视频级掩码反射实现空间与时间层面反馈,提升预测可靠性,在Ref-VPS和ReasonVOS上取得较好分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23647 2026-07-28 cs.LG cs.AI 新提交 57%

CALMRec: Causally Aligned Language Memory for Long-Horizon Recommendation

CALMRec:用于长期推荐的因果对齐语言记忆

Gengyu Zhan

机构 * Shenzhen University(深圳大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对当前大语言模型推荐器的问题,提出CALMRec框架,利用冻结多模态语言模型转换信息,维护多种记忆,通过倾向加权更新等减少偏差,在多环境评估中表现良好,提升了折扣长期价值,释义基准上语义原子NDCG显著提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23576 2026-07-28 cs.CV 新提交 57%

Neuromorphic Object Detection: An In-Depth Study and Future Directions

神经形态目标检测:深入研究与未来方向

Jianing Li, Dianze Li, Arren Glover, Xiaopeng Fan, Guoqi Li, Chiara Bartolozzi, Ryad B. Benosman, Yonghong Tian

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院) Italian Institute of Technology(意大利理工学院) Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) Sorbonne Université(索邦大学) INSERM(法国国家健康与医学研究院) CNRS(法国国家科学研究中心) Institut de la Vision(视觉研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对传统相机在特定条件下目标检测的挑战,本文对神经形态目标检测算法进行全面调查和基准测试,从多视角探索现有方法,评估多种模型并分析结果,讨论未解决问题,为该领域研究提供资源与方向。

Comments Accepted by Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23457 2026-07-28 physics.soc-ph 新提交 50%

From Pen to Palette: Mathematical Analysis of van Gogh's Psychological Trajectory

从笔到调色板:梵高心理轨迹的数学分析

Anna Singley, Eli Goldwyn, Mark Pitzer, Jessica Logue

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究通过对梵高信件片段情感分析和画作分形维数分析,运用临界慢化理论,发现视觉复杂性与死亡情绪相关,重大危机前有CSD模式,如1888年割耳事件,揭示数学方法可检测历史人物心理转变特征。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2607.22586 2026-07-28 cs.AI cs.CL 新提交 81%

MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models

MM-ShiftKV:用于多模态大语言模型的解码感知预填充阶段键值选择

Jinsong Shu, Chenyang Wu, Zhongle Xie, Baokun Wang, Lidan Shou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术产业开发区(滨江)区块链与数据安全研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究多模态大语言模型中KV缓存问题,提出MM-ShiftKV方法,通过构建方差扩展查询代理近似解码时查询行为,基于聚合注意力质量估计KV重要性,在严格缓存预算下性能优于现有方法。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23944 2026-07-28 cs.AI 新提交 79%

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

DICA:多模态大语言模型中的双指标引导对比对齐

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23581 2026-07-28 cs.AI 新提交 79%

Verification-Notebook Learning for Source-Aware Multimodal Misinformation Detection

用于源感知多模态错误信息检测的验证笔记本学习

Junyuan Tan

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态错误信息检测,提出验证笔记本学习框架VNL,通过构建包含决策原则等的笔记本,在推理时指导验证新示例,实验显示其性能优于基线,能提高源归因且紧凑可解释,无需模型训练积累知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22919 2026-07-28 cs.CV cs.AI 新提交 73%

Controlling Embedding Spaces with Text-Conditioned Transformations

通过文本条件变换控制嵌入空间

Joseph Fioresi, Fabian Caba Heilbron, Pankaj Nathani, Mubarak Shah, Kushal Kafle

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所) Adobe Research(Adobe研究院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究提出文本条件变换视觉嵌入,通过自然语言描述属性类别,网络生成仿射变换强调指定属性,能同时学习多属性,可在推理时访问,为控制嵌入空间提供统一高效框架,在多任务中展现近零推理成本的最优性能。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23038 2026-07-28 cs.IR 新提交 50%

EGR: Embedding-Native Generative Retrieval with a Shared LLM

EGR:使用共享语言模型的嵌入原生生成式检索

Xiaodong Liu, Congfei Zhang, Hsiang-wei Chao, Siman Wang, Tong Zhao, Xiao Bai, Vincent Zhang, Jingxiao Ma, Zhe Liu, Wenfeng Zhuo, Zichu Li, Jitin Krishnan, Yunzhi Zhou, Yajun Wang, Jinchao Li, Yu Zhang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究针对生成式检索在推荐和广告系统中的问题,提出EGR框架,利用共享语言模型在同一嵌入空间学习项目与用户表示,经联合对比训练,在多场景评估中表现出色,提升了转化率,简化了系统设计。

Comments Accepted to RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏