arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-29 至 2026-07-29 共收录 55 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2607.24904 2026-07-29 cs.CV cs.CL 新提交 88%

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL:一种高效的编解码器原生流式多模态基础模型

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

机构 * Microsoft(微软)

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title);image-text(abstract);分类 cs.CV、cs.CL

AI总结 研究针对标准视觉语言模型在流式感知任务的不足,提出Mage-VL。核心方法是用Mage-ViT选择性编码关键区域,减少视觉令牌消耗。该模型在多模态理解和交互上表现出色,推理速度加快,还有多项关键实证发现。

Comments Project page: https://microsoft.github.io/Mage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25794 2026-07-29 cs.CV 新提交 70%

Fine-Grained Food Image Understanding via Target-Aware Data Alignment

通过目标感知数据对齐实现细粒度食品图像理解

Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn, Jinge Ma, Fengqing Zhu

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25527 2026-07-29 cs.CV cs.AI 新提交 62%

Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation

阿格斯统一模型:迈向紧凑且经济的图像理解与生成统一模型

Weiming Zhuang, Jiabo Huang, Jingtao Li, Zhizhong Li, Chen Chen, Sina Sajadmanesh, Lingjuan Lyu

机构 * Sony AI(索尼人工智能公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在统一图像理解与生成,提出阿格斯统一模型,利用预训练视觉语言模型,引入混合视觉令牌,分两阶段训练,以最少数据和低成本实现良好性能,达当前最优,可作统一模型开发基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24770 2026-07-29 cs.AI cs.HC 新提交 57%

ProcAgent: An Agentic Framework for Procedural Task Guidance on Edge with Human-in-the-Loop

ProcAgent:一种用于边缘端人机协作的过程性任务指导的智能体框架

Azizul Zahid, Subrata Biswas, Bashima Islam, Sai Swaminathan

机构 * University of Tennessee Knoxville(田纳西大学诺克斯维尔分校) Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对家具组装等过程性任务,提出ProcAgent框架,利用提议与验证架构,结合多种技术,在边缘设备上实现实时自适应指导,经多维度评估及用户研究,证明能在不牺牲可用性的情况下于边缘硬件达成自适应过程性辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2607.24786 2026-07-29 cs.IR cs.AI cs.MM cs.SD eess.AS 新提交 85%

Unlocking Spatial Grounding in Large Audio-Visual Retrieval models

在大型视听检索模型中解锁空间定位

Hugo Malard, Michel Olvera, Sanjeel Parekh, Gaël Richard, Slim Essid, Stéphane Lathuilière

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 研究针对视听声源定位任务,利用大规模视听检索模型的潜在表示,引入LAIP框架,通过音频信息池化恢复局部空间信息,在相关数据集上取得领先性能,证明可从现有检索表示解锁定位,为检索和定位任务提供统一路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24821 2026-07-29 cs.MM cs.CV cs.SD 新提交 82%

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

AVE-Compass:迈向音频-视频编辑能力的整体评估

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 研究针对现有视频编辑基准未充分考虑视听耦合问题,提出AVE-Compass基准及AVE-Agent框架,通过多种评估方式评估编辑能力,能分解复杂指令迭代改进结果,提升了跨模态编辑等方面表现及感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25667 2026-07-29 cs.CL cs.AI 新提交 81%

MyMentorLLM: A psychotherapy GenAI environment with multimodal voice/text patients, trainees and experts for deliberate practice

MyMentorLLM:一个用于刻意练习的心理治疗生成式人工智能环境,具有多模态语音/文本患者、受训者和专家

Rodolfo Rizzi, Alessandro Grecucci, Massimo Stella

机构 * University of Trento(特伦托大学) University of Bari(巴里大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对心理治疗师培训可扩展性问题,提出MyMentorLLM多模态模拟环境用于CBT培训,生成2100个课程,分析情感等方面,发现不同语言模型督导质量有别,患者逼真度等需评估,证明CBT培训刻意练习模拟可行。

Comments 27 pages, 6 figures, 2 tables; 1 supplementary table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25903 2026-07-29 eess.AS 新提交 79%

CARE: A Multimodal Corpus for Studying Speech and Non-Verbal Communication Across Multiple Medical Conditions

CARE:一个用于研究多种医疗状况下言语和非言语交流的多模态语料库

David Gimeno-Gómez, Catarina Botelho, Carlos-D. Martínez-Hinarejos, Isabel Trancoso, Alberto Abad

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 针对多模态语音分析领域因现有数据集存在局限而发展受限的问题,引入CARE v1.0多模态英语数据集,涵盖多种医疗状况,提供丰富描述符和元数据,支持多种应用,推动该领域研究发展。

Comments Under review in npj Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26047 2026-07-29 cs.RO 新提交 78%

S2A2: Audio-Visual Imitation Learning for Manipulation Tasks Using Acoustic Spatial Information

S2A2:利用声学空间信息进行操作任务的视听模仿学习

Kaneyoshi Hiratsuka, Benjamin Yen, Ryosuke Kojima

机构 * Kyoto University(京都大学) RIKEN(理化学研究所) Institute of Science Tokyo(东京理科大学)

专题命中 音频语音多模态 :audio-visual(title);multimodal(abstract)

AI总结 研究利用声学信息进行操作任务的模仿学习,提出多模态框架S2A2,集成视觉与声学信息,实现多种策略集成,模拟与真实机器人实验表明其对特定任务有效且适用于现实操作。

Comments Project page: https://azuma413.github.io/projects/s2a2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25543 2026-07-29 cs.CV cs.AI 新提交 73%

Less is More: Modality-Decoupling for General AIGC Audio-Video Detection

少即是多:通用AIGC音频-视频检测的模态解耦

Jielun Peng, Yabin Wang, Yaqi Li, Jincheng Liu, Xiaopeng Hong, Athanasios V. Vasilakos

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Agder(阿格德大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 针对通用AIGC音频-视频检测,现有方法假设不总成立,本文提出DAV-Det系统,通过决策级融合独立建模各模态取证证据,视觉和音频检测器分别利用多粒度表示及门控双分支架构,在挑战赛中排名第一。

Comments First place in the General AIGC Audio-Video Detection Challenge at the IJCAI-ECAI 2026 DDL 2.0 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25085 2026-07-29 eess.AS 新提交 57%

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

文本提示的CLAP:通过对比学习学习查询条件音频表示

Mohan Li, Rama Doddipatla, Philip C. Woodland

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 研究旨在解决CLAP独立编码模态限制,提出TP-CLAP,通过引入交叉注意力融合模块,利用音频多项选择题框架训练,在音频问答、检索等任务中表现出色,优于标准CLAP基线。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2607.24794 2026-07-29 cs.AI cs.CV 新提交 62%

Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding

利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架

Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Jilin University(吉林大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25125 2026-07-29 cs.CV 新提交 57%

LENS: Adaptive Spatio-Temporal Zooming for Keyframe Sampling in Long-Form Videos

LENS:用于长视频关键帧采样的自适应时空缩放

Ce Zhang, Jinxi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对长视频理解受限于上下文窗口的问题,提出无需训练的关键帧采样框架LENS,它能基于文本查询动态分配帧预算,在时空缩放间平衡,提升关键帧采样效果,优于现有方法,提高了Video-MME准确率。

Comments Accepted at ECCV 2026. Project page: https://zhangce01.github.io/LENS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25047 2026-07-29 cs.HC cs.AI cs.RO 新提交 57%

Extended Reality as a Mediation Layer for Situated Human Control in Human-Robot Teaming

扩展现实作为人机协作中情境化人类控制的中介层

Jens Grubert, John Dudley, Eyal Ofek, Per Ola Kristensson

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究探讨扩展现实在人机协作中作为情境化人类控制中介层的作用,通过床边护理等场景阐述观点,确定四种中介功能和六个设计维度,为使机器人自主性在动态环境中更具操作性和问责性的XR系统规划研究议程。

Comments Accepted to 2026 IEEE International Symposium on Mixed and Augmented Reality Adjunct (ISMAR-Adjunct)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2607.24861 2026-07-29 cs.IR cs.AI 新提交 83%

HVM-GraphRAG: Holistic-View Multimodal Graph Retrieval-Augmented Generation on Complex Document

HVM-GraphRAG:复杂文档上的整体视图多模态图检索增强生成

Xin He, Yili Wang, Wenqi Fan, Qing Li, Qinggang Zhang, Yi Chang, Xin Wang

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对复杂文档问答中跨模态证据索引不可靠和图遍历昂贵的问题,提出HVM-GraphRAG框架,用整体视图指导图构建,检索时在概念级图上搜索并通过索引访问证据,实验证明其能提升答案性能和检索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24799 2026-07-29 cs.IR cs.AI 新提交 79%

Multimodal Hybrid Retrieval-Augmented Generation for Scientific Document Understanding using Open-Source SLMs

使用开源语言模型进行科学文档理解的多模态混合检索增强生成

Alexandru-Andrei Saucă, Ana-Luiza Rusnac

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 针对科学文档理解中大型语言模型的问题,提出多模态混合检索增强生成系统。利用开源视觉语言模型生成摘要,结合多种检索方法并优化,采用查询压缩器确保连贯性。经评估,该系统提高了检索质量,验证了开源模型与先进策略结合的竞争力。

Comments 7 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24875 2026-07-29 cs.LG 新提交 78%

FinAbstain: Uncertainty-Calibrated Multimodal RAG for Selective Financial Forecasting

FinAbstain:用于选择性金融预测的不确定性校准多模态检索增强生成模型

Dorothy Torres, Wei Cheng, Henan Huang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究针对大语言模型在金融预测中证据不足时高置信度的问题,提出FinAbstain框架,通过多模态检索增强生成及选择性预测,经多种不确定性评估方法和指标评估,贡献了时间安全架构、复合不确定性公式和可重复评估蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24748 2026-07-29 cs.IR cs.AI cs.CL 新提交 62%

VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents

VLD-RAG:用于长的、视觉丰富的多页文档的智能视觉语言检索增强生成

Seonok Kim

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉丰富的长文档问答的多模态检索增强生成,提出VLD-RAG框架,构建多模态索引并采用混合检索策略,经智能体工作流程协调,在相关基准上提升了证据页面检索及问答表现,凸显协调验证与混合检索的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25407 2026-07-29 cs.CV 新提交 57%

ANFI: Rethinking Neighbor Feature Interaction in Person Re-ID

ANFI:重新思考行人重识别中的邻居特征交互

Xulin Li, Yan Lu, Bin Liu, Jiaze Li, Qinhong Yang, Tao Gong, Qi Chu, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 该研究针对行人重识别中基于邻居方法仅依赖亲和关系、受噪声邻居影响的问题,提出ANFI方法,不仅建模亲和关系与差异关系,还用自适应加权,通过新邻域相似度导出差异关系,经噪声关系监督训练,实验证明其在多种设置下的优越性。

Comments accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25196 2026-07-29 cs.LG 新提交 50%

Rethinking CD: A Reproducibility Study and Extension on the Ineffectiveness of Contrastive Decoding at Mitigating Object Hallucinations in MLLMs

重新思考对比解码:关于多模态大语言模型中对比解码在减轻对象幻觉方面无效性的可重复性研究与扩展

Arnav Bendre, Guneesh Gupta, Kavish Grover, Chayan Aggarwal, Shreyansh Modi

机构 * Indian Institute of Technology, Roorkee(印度理工学院鲁尔基分校)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究多模态大语言模型中对比解码减轻对象幻觉的有效性,通过重现和扩展相关研究,进行多实验验证其在不同数据集上效果,发现其带来的改善常是虚假的,挑战了当前策略有效性,推动更可靠方法开发。

Comments 32 pages, 9 Figures, submitted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24760 2026-07-29 cs.IR 新提交 50%

CHaystack: Benchmarking Chinese Document Retrieval and VQA

CHaystack:中文文档检索与视觉问答基准测试

Hanxi Li

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文介绍了CHaystack中文文档检索与视觉问答基准测试,涵盖四类文档。提出CDocRAG系统,用VLM相关性过滤器验证文档图像。评估开源模型发现Qwen系列在文本丰富文档表现佳,中文大规模DocumentVQA在文本编码方面有挑战,仍需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 4 篇

2607.25901 2026-07-29 cs.IR 新提交 88%

RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation

RecoReward:用于推荐的推荐器引导多模态描述生成

Guohong Mu, Yueyang Liu, Jiangxia Cao, Changxin Lao, Zijie Zhuang, Yuhui Zhang, Jiaqi Feng, Ruochen Yang, Shuang Yang, Zhaojie Liu, Qibin Hou

专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(title,abstract)

AI总结 研究针对多模态推荐中传统方法不足,提出RecoReward,训练时用行为衍生奖励,保留仅内容推理。在直播推荐中利用用户历史等估计亲和力,通过推荐器亲和力分数提供反馈,实验表明该方法能提升MLLM性能,利于下游推荐且保留内容服务。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25948 2026-07-29 cs.CV cs.AI cs.LG 新提交 87%

MODUS: Decoder-Only Any-to-Any Modeling of Diverse Modalities

MODUS:仅解码器的多模态任意到任意建模

Mingqiao Ye, Zhaochong An, Zhitong Gao, Xian Liu, François Fleuret, Chuan Li, Amir Zadeh, Serge Belongie, Afshin Dehghan, Jesse Allardice, David Mizrahi, Oğuzhan Fatih Kar, Roman Bachmann, Amir Zamir

专题命中 多模态生成 :any-to-any(title,abstract);multimodal(abstract,comments);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究任意到任意多模态建模,提出仅解码器的对称多模态建模方法Modus,无需特定模态组件,支持多种应用,在各基准测试中用单模型展现强大性能且与基线竞争,材料开源。

Comments Accepted at ICML 2026. Project page: https://modus-multimodal.epfl.ch

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25962 2026-07-29 cs.CV 新提交 79%

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) University College London(伦敦大学学院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对深度伪造检测问题,提出LaP-Forensics多模态框架,利用基于重建的取证证据及结构化模型预测,经组相对策略优化,实现跨生成器检测和伪影定位,实验验证了残差流效用,但后处理下文本忠实性和可靠性有局限。

Comments Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26055 2026-07-29 cs.RO cs.AI cs.LG 新提交 57%

$π\mathbf{R}^2$: Reactive Real-time Flow Policies

$π\mathbf{R}^2$:反应式实时流策略

Sungjae Park, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 研究通用操作策略反应性和实时性问题,提出$\pi\mathbf{R}^2$方法,将条件分快速和慢速通道,采用延迟自适应流调度,能在保留大型主干等的同时,让策略实时反应并提高成功率。

Comments Preprint(20 pages). Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 13 篇

2607.24957 2026-07-29 cs.CV 新提交 87%

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

感知基准:评估多模态大语言模型中的原子视觉感知

Zichao Lin, Yifeng Xie, Bowen Qu, Haiming Wang, Jia Li, Haoning Wu, Yuhao Dong, Zuhao Yang, Jinguo Zhu, Haoyu Lu, Zijia Zhao, Tongtian Yue, Zhangyang Qi, Junwei Yang, Mengfan Dong, Peizhou Cao, Chenzhuang Du, Zaida Zhou, Haotian Yao, Hao Yang, Hongcheng Gao, Lin Sui, Weihong Li, Xinxing Zu, Jia Chen, Yao Wang, Xiaoxue Wu, Yalin Wang, Y. Charles, Yiping Bao, Yangyang Liu, Zhiqi Huang, Xinyu Zhou

机构 * Moonshot AI(登月人工智能)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.CV

AI总结 介绍用于评估多模态大语言模型原子视觉感知能力的PerceptionBench基准,通过自下而上方法构建错误分类法及相关问题,测试16个前沿模型,发现原子感知待解决,该基准为衡量MLLM视觉感知边界提供标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24856 2026-07-29 cs.CV cs.AI 新提交 86%

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧

Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Southeast University(东南大学自动化学院) Department of Geography, National University of Singapore(新加坡国立大学地理系)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25294 2026-07-29 cs.CV cs.AI cs.CL cs.LG 新提交 82%

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

CLBench-V:评估从基础到知识获取的多模态上下文学习

Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Zhongguancun Academy(中关村科学城创新中心) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究多模态上下文学习问题,引入CLBench-V基准,围绕上下文基础、新信息应用和新知识学习三个维度组织任务,结合公共基准与新数据集,经自动化程序构建,测试六个模型,分析相关因素,揭示多模态上下文学习远未饱和及各模型表现情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24862 2026-07-29 cs.IR 新提交 82%

KuaiLive-M3: A Multi-Modal, Multi-Domain, and Multi-Feedback Dataset for Live Streaming Recommendation

KuaiLive-M3:用于直播推荐的多模态、多领域和多反馈数据集

Ke Guo, Changle Qu, Jiayaqi Cheng, Xiao Zhang, Shijun Wang, Xiaoyu Zhang, Xueliang Wang, Le Zhang, Lantao Hu, Jun Xu

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract)

AI总结 针对现有直播数据集的局限,引入KuaiLive-M3数据集,它涵盖多领域用户交互及多模态内容,有丰富反馈记录。基于此建立多种推荐基准,经实验验证其为直播推荐研究提供了有挑战且现实的基准,凸显相关研究要点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25947 2026-07-29 cs.AI cs.CL 新提交 81%

A Cost-Effective Multimodal LLM Reasoning Framework for Question Answering over Irregular Clinical Time Series

一种用于不规则临床时间序列问答的经济高效多模态大语言模型推理框架

Frank Nie, Ethan B Liu, Yuan Zhu, Wei Fan, Jindong Han

机构 * Shandong University(山东大学) University of Auckland(奥克兰大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对不规则临床时间序列问答,提出ClinPRISM框架。该框架含不规则感知多尺度编码器、时间证据蒸馏器和渐进对齐策略,通过构建训练数据,在40亿参数大语言模型主干上实现最优性能,兼具低时间序列令牌数和低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏