arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-10 至 2026-07-10 共收录 55 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2607.08503 2026-07-10 cs.CV 新提交 79%

CT-CLIP Representations for Multimodal Lung Cancer Survival Prediction

用于多模态肺癌生存预测的CT-CLIP表示

Sofie Allgöwer, Mikael Johansson, Andreas Hallqvist, Jonas Andersson, Åse Johnsson, Ida Häggström, Jennifer Alvén

机构 * Chalmers University of Technology(查尔姆斯理工大学) Umeå University(于默奥大学) Sahlgrenska University Hospital(萨尔格伦斯卡大学医院) Sahlgrenska Academy at Gothenburg University(哥德堡大学萨尔格伦斯卡学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 研究评估特定领域基础模型CT-CLIP用于肺癌多模态生存预测,通过多种策略提取特征,结果显示冻结的CT-CLIP模型结合可训练生存头表现出色,能有效区分高低风险组。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08605 2026-07-10 cs.CV cs.AI cs.LG 新提交 73%

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

当结构化稀疏自编码器跨模态学习一致概念时

Weiduo Liao, Yunqiao Yang, Ying Wei

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08745 2026-07-10 cs.AI cs.CV 新提交 62%

AUTOPILOT VQA: Benchmarking Vision-Language Models for Incident-Centric Dashcam Understanding

自动驾驶视觉问答:以事件为中心的行车记录仪理解视觉语言模型基准测试

Siddharth Damodharan, Radhika Gupta, Ali Alshami, Ryan Rabinowitz, Jugal Kalita

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校) University of Michigan(密歇根大学) University of Notre Dame(圣母大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对评估视觉语言模型对安全关键事件推理能力的挑战,提出AUTOPILOT-VQA基准,通过围绕真实驾驶事件的结构化问题评估系统,涵盖多安全相关类别,推动向安全意识推理发展,为自动驾驶系统评估提供标准,助力相关视觉语言系统开发。

Comments CVPR Autopilot Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11530 2026-07-10 cs.CV cs.AI 版本更新 62%

Beyond Attention Scores: SVD-Based Vision Token Pruning for Efficient Vision-Language Models

超越注意力分数:基于SVD的视觉令牌修剪用于高效视觉-语言模型

Yvon Apedo, Martyna Poreba, Michal Szczepanski, Samia Bouchafa

机构 * anoncvlab(匿名计算机视觉实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SVD-Prune方法,通过SVD分解视觉令牌特征矩阵并利用统计杠杆分数选择顶级令牌,以在极端视觉令牌预算下保持高性能,优于现有修剪方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12999 2026-07-10 cs.CV cs.AI 版本更新 62%

Concept-as-Tree: A Controllable Synthetic Data Framework Makes Stronger Personalized VLMs

概念树:一个可控的合成数据框架助力更强的个性化视觉语言模型

Ruichuan An, Kai Zeng, Ming Lu, Sihan Yang, Renrui Zhang, Huitong Ji, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) CUHK MMLab(香港中文大学MMLab) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security(北京数据智能与安全重点实验室)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究提升VLM个性化能力问题,提出概念树(CaT)框架,以树结构表示概念生成多样正负样本,经数据过滤策略确保质量,实验证明该框架显著增强VLM在个性化基准测试中的能力,是首个可控合成数据管道。

Comments ECCV26 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08397 2026-07-10 cs.CV 新提交 57%

Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation

用于开放词汇量内镜组合式指称分割的属性检索

Shun Liu, Nan Xi, Yang Liu, Tianyu Luan, Xuan Gong, David Doermann

机构 * Virginia Commonwealth University(弗吉尼亚联邦大学) King’s College London(伦敦国王学院) University at Buffalo(纽约州立大学布法罗分校) Harvard Medical School(哈佛医学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 该研究针对内镜图像指称分割面临的挑战,引入ReferEndoscopy基准,提出AR-ERIS框架,利用属性检索进行开放词汇量内镜组合式指称分割,在模拟和真实内镜数据上实现最优性能且泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08359 2026-07-10 cs.RO cs.AI 新提交 57%

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

FSD-VLN:用于空中长距离视觉语言导航的快慢双系统建模

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology(中国科学院深圳先进技术研究院) Peking University(北京大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究空中长距离视觉语言导航问题,提出FSD-VLN快慢双系统架构,将语义推理与低延迟飞行命令解耦,通过两个异步分支及时间感知自适应优化器实现,实验表明该方法提升导航成功率,减少推理延迟和运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09016 2026-07-10 cs.RO 版本更新 50%

Open-Vocabulary Object-Goal Navigation by Generalizing Semantic Mapping with Dense CLIP

通过用密集CLIP泛化语义映射实现开放词汇目标导航

Meng Wei, Chenyang Wan, Tai Wang, Yuqiang Yang, Wenzhe Cai, Yilun Chen, Hanqing Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2607.07907 2026-07-10 cs.LG cs.AI cs.CL cs.CR cs.MM 新提交 87%

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准的综述

Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 综述跨视觉、语言、音频和视频的多模态遗忘,基于相关进展等提供统一视角,通过分类法系统比较模型架构和模态,阐明权衡,强调开放问题与实际考虑,支持未来研究与部署,并发布存储库。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08112 2026-07-10 cs.CV 新提交 83%

VSRo-200: A Romanian Visual Speech Recognition Dataset for Studying Supervision and Multimodal Robustness

VSRo-200:用于研究监督和多模态鲁棒性的罗马尼亚语视觉语音识别数据集

Iulia-Maria Udrea, Alexandra Diaconu, Bogdan Alexe

机构 * University of Bucharest(布加勒斯特大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文介绍罗马尼亚语视觉语音识别数据集VSRo-200,通过伪标签和人工转录注释样本,建立低资源视觉语音识别基准。研究监督质量影响,评估域转移鲁棒性及噪声下视听语音识别,证明其表示可转移至其他基准,为相关研究提供新测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08714 2026-07-10 eess.AS 新提交 79%

Multimodal Digital Biomarker for Asthma: Complementary Roles of Vocal, Clinical and Demographic Factors

用于哮喘的多模态数字生物标志物:声音、临床和人口统计学因素的互补作用

Vladimir Despotovic, Milena Despotovic, Abir Elbeji, Petr V. Nazarov, Guy Fagherazzi

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 研究针对哮喘诊断依赖传统方法、声音生物标志物缺乏临床背景整合的问题,提出多模态专家混合框架,结合声学嵌入与临床人口数据,在匹配队列上评估,模型性能优,还通过分析揭示不同症状个体特征依赖差异,支持哮喘筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23804 2026-07-10 cs.HC eess.SP 版本更新 50%

Perceptually Lossless Tactile Texture Synthesis with Compact Spectral Envelope Models

基于紧凑频谱包络模型的感知无损触觉纹理合成

Jagan K. Balasubramanian, Yasemin Vardar

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 提出两种紧凑频谱表示(频谱β和频谱斜率)来捕获手指-表面摩擦信号的时间频谱结构,通过感知实验验证其能实现与高保真再现相当的感知真实感,为触觉压缩、通信和合成纹理生成提供高效框架。

Comments 16 pages and 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 6 篇

2607.08073 2026-07-10 cs.LG eess.SP 新提交 78%

Cross-Modal Generative Framework for Signal Translation from Fetal-Maternal Electrocardiograms to Fetal Doppler Waveforms

用于从胎儿-母亲心电图到胎儿多普勒波形信号转换的跨模态生成框架

Tongli Su, Alireza Rafiei, Marly van Assen, Reza Sameni, Gari D. Clifford, Faezeh Marzbanrad, Nasim Katebi

机构 * Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院) Monash University(莫纳什大学)

专题命中 视频多模态 :cross-modal(title,abstract)

AI总结 该研究针对胎儿-母亲心血管系统关系建模问题提出跨模态生成框架,结合扩张卷积、跨模态注意力及自注意力,经训练可从双导联心电图合成多普勒包络,降低误差,量化母婴耦合贡献,推进了相关计算建模及胎儿评估。

Comments Accepted for oral presentation at IEEE EMBC 2026. 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08725 2026-07-10 cs.CV cs.AI cs.LG 新提交 62%

Pose-to-Biomechanics: Bridging 3D Human Pose Estimation and Biomechanical Attribute Prediction

姿态到生物力学:连接3D人体姿态估计与生物力学属性预测

Ayda Eghbalian, Kevin Desai

机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在连接3D人体姿态估计与生物力学属性预测。提出BioModule轻量级插件式时间变压器,连接在3D姿态估计器下游预测生物力学属性,无需修改上游模型。构建数据集训练评估,在七个先进姿态估计器上基准测试,成为两者间紧凑模块化桥梁。

Comments 23 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07370 2026-07-10 cs.RO cs.AI cs.HC cs.LG 新提交 57%

Behavior Foundations for Quadruped Robots: ABot-C0 Technical Report

四足机器人的行为基础:ABot-C0技术报告

Xufeng Zhao, Fuzhi Yang, Jianhui Chen, Li Gao, Zhang Meng, Jie Gao, Yao Zheng, Congyang Zhao, Tianxiong Lv, Menglin Yang, Minqi Gu, Yaru Zhao, Wenyu Liu, Honglin Han, Shihui Su, Zixiao Tang, Liu Liu, Mu Xu, Yang Cai, Wenbin Tang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究聚焦四足机器人运动控制,提出ABot-C0通用系统,构建数据金字塔生成运动片段,训练流匹配通用策略展示跟踪缩放定律,采用特定框架推动全地形遍历运动,经实验验证其能让四足机器人迈向产品级行为智能。

Comments Abot-C0 project page will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01803 2026-07-10 cs.CV 版本更新 57%

Generative Action Tell-Tales: Assessing Human Motion in Synthesized Videos

生成式动作叙事:评估合成视频中的人体运动

Xavier Thomas, Youngsun Lim, Ananya Srinivasan, Audrey Zheng, Deepti Ghadiyaram

机构 * Boston University(波士顿大学) Belmont High School(贝利蒙高中) Canyon Crest Academy(坎波尔峡谷学院) Runway

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究视频生成模型中评估复杂人类动作指标难的问题,提出融合骨骼与外观特征的评估指标,经多方面基准验证,该指标相比现有方法有显著改进,与人类感知相关性强,揭示了当前模型局限性并建立新标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05240 2026-07-10 cs.RO cs.CV 版本更新 57%

StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling

StreamVLN:通过快慢上下文建模实现流式视觉与语言导航

Meng Wei, Chenyang Wan, Xiqian Yu, Tai Wang, Yuqiang Yang, Xiaohan Mao, Chenming Zhu, Wenzhe Cai, Hanqing Wang, Yilun Chen, Xihui Liu, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01560 2026-07-10 cs.CV 版本更新 57%

XOV-Action: Towards Generalizable Open-Vocabulary Action Recognition

XOV-Action:迈向可泛化的开放词汇动作识别

Kun-Yu Lin, Henghui Ding, Jia-Run Du, Jiaming Zhou, Yi-Xing Peng, Yu-Ming Tang, Zhilin Zhao, Chen Change Loy, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) AI Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 研究针对开放词汇动作识别模型泛化性不足的问题,提出XOV-Action模型,通过学习多样化表示和场景无关表示克服两大挑战,还构建XOVABench基准,实验证明该模型能有效提升跨视频领域的动作识别性能。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2607.08698 2026-07-10 cs.HC 新提交 78%

How YouTube Frames ChatGPT Use in Education: An Epistemic Network Analysis with Supporting Multimodal Metadata

YouTube如何构建教育领域中ChatGPT的使用:基于支持多模态元数据的认知网络分析

Shayla Sharmin, Mohammad Al-Ratrout, Mohammad Fahim Abrar, Roghayeh Leila Barmaki

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究通过多模态元数据分析教育类YouTube视频中ChatGPT的使用,识别出三个话语组,发现不同组在构建方式、观众反应和平台影响力上有差异,揭示了自主AI学习中优先快速输出与促进深度参与内容的差距及相关问题。

Comments This paper has been accepted in ICMI 2026 and will be presented in October

Journal ref In Proceedings of the 28th ACM International Conference on Multimodal Interaction (ICMI '26), Napoli, Italy, October 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08470 2026-07-10 cs.LG 新提交 78%

MatBind: A Shared Embedding Space for Multimodal Materials Characterization

MatBind:用于多模态材料表征的共享嵌入空间

Le Yang, Anoop K. Chandran, Jona Östreicher, Evgenii Sovetkin, Adrian Mirza, Sebastien Bompas, Bashir Kazimi, Pascal Friederich, Stefan Kesselheim, Kevin Maik Jablonka, Stefan Sandfeld

专题命中 跨模态检索 :multimodal(title);cross-modal(abstract)

AI总结 研究旨在整合异构材料数据以全面表征晶体材料。提出MatBind对比学习框架,以晶体结构为锚点将四种模态对齐到统一空间,实现零样本跨模态检索,且学习空间能依物理属性组织材料,组合模态可提升检索性能。

Comments 24 pages, 12 figures, submitted to npj computational material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08202 2026-07-10 cs.LG 新提交 50%

PIT-SUN: A Deployable Empirical Marginal Transform Framework with Expectation-Consistent Recovery for Regression in Recommender Systems

PIT-SUN:一种可部署的经验边际变换框架,用于推荐系统中的回归,具有期望一致恢复

Mingyu Zhao, Zhaohan Li, Zhenxiong Miao, Xu Zhang, Dewei Leng, Yanan Niu, Kun Gai

机构 * Kuaishou Technology(快手科技)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 针对推荐系统中估计原始空间条件期望的问题,提出PIT-SUN框架,通过经验边际表定义相关内容,应用乘法SUN恢复估计期望,实验表明该方法在多方面有提升且部署开销小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22916 2026-07-10 cs.IR 版本更新 50%

GateSID: Adaptive Gating for Balancing Semantic and Collaborative Signals in Recommendation

GateSID: 语义协作对齐中的冷启动推荐自适应门控

Hai Zhu, Yantao Yu, Lei Shen, Bing Wang, Xiaoyi Zeng

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出GateSID框架,通过自适应门控网络动态平衡语义与协同信号,提升冷启动推荐性能,实验显示其在GMV、CTR和订单量上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2607.08497 2026-07-10 cs.CV cs.AI cs.CL cs.LG 新提交 82%

Cognitive-structured Multimodal Agent for Multimodal Understanding, Generation, and Editing

用于多模态理解、生成和编辑的认知结构多模态智能体

Feng Wang, Canmiao Fu, Zhipeng Huang, Chen Li, Jing Lyu, Ge Li

机构 * Peking University(北京大学) Tencent Inc(腾讯公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对统一多模态模型在长时多模态对话中的局限,提出认知结构多模态智能体,通过外化视觉信息等方式改进。开发统一场景引擎,构建评估基准。实验显示该智能体检索准确率高、推理时间减半,还介绍了工具包,为长时多模态智能体提供新范式。

Comments 16 pages, 7 figures, 8 tables. Project page: https://caseclose.github.io/cma-harness/ Code: https://github.com/caseclose/cma-harness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08434 2026-07-10 cs.CV 新提交 79%

DeltaV: Thinking with Visual State Updates in Unified Large Multimodal Models

DeltaV:在统一大型多模态模型中通过视觉状态更新进行思考

Pengjie Wang, Linger Deng, Zujia Zhang, Shaojie Zhang, Zhenbo Luo, Pei Fu, Jian Luan, Xiang Bai, Yuliang Liu

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi Inc.(小米公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对统一大型多模态模型全图像生成范式的问题,提出DeltaV模型,通过视觉更新避免冗余,引入TSIM路由器匹配令牌预算,构建StructCoT数据集,实验证明该范式能减少视觉令牌、提升推理能力,DeltaV - 2B性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08227 2026-07-10 cs.CV 新提交 79%

Multimodal 3D LUT Generation via StatLUT with Statistical Features for Photorealistic Style Transfer

通过具有统计特征的StatLUT进行多模态3D LUT生成以实现逼真的风格迁移

Yifan Wang, Zhixiang Hao, Yu Wang, Congchao Zhu

机构 * Honor Device Co., Ltd.(荣耀终端有限公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对逼真风格迁移中现有方法的瓶颈,提出StatLUT框架,通过提取统计特征、基于Transformer的Seq2Seq任务预测3D LUT及用H-Diffuser从自然语言提示合成特征,实现多模态逼真风格迁移,性能优于现有方法。

Comments 17 pages, 9 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 79%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12886 2026-07-10 cs.CV cs.AI 新提交 73%

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

交错思维中的模态隔离桥接:通过逐步强化监督模态转换

Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出MoTiF框架,通过反射式SFT和Flow-GRPO优化模态转换保真度,解决交错思维中图像与文本脱节的模态隔离问题,提升跨模态一致性和任务准确性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07967 2026-07-10 stat.ML cs.LG math.OC 新提交 50%

Expressivity and Statistical Trade-offs in Diffusion Policy Learning

扩散策略学习中的表达能力与统计权衡

Viet Vu, Renyuan Xu, Jiacheng Zhang, Yufei Zhang

机构 * Stanford University(斯坦福大学) Chinese University of Hong Kong(香港中文大学) Imperial College London(伦敦帝国理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究扩散策略学习中表达能力与统计权衡,确定漂移Lipschitz预算K为核心量,通过近似量化表达能力,证明其与统计复杂性的关系,给出有限样本性能差距,数值实验验证,还提出根据样本大小选K及对应神经网络架构的实现原则。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 9 篇

2607.08267 2026-07-10 cs.CV 新提交 83%

UniRef-UAV: A Multimodal Benchmark for Universal Referring in UAV Imagery

UniRef-UAV:无人机图像通用指称的多模态基准测试

Haibin Tian, Huichao Xie, Xuelin Qian, Ruitao Lu, Junwei Han, Dingwen Zhang

机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.CV

AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08215 2026-07-10 cs.DC 新提交 78%

On the Limitations of Non-GPU AI Accelerators for Large-Model Inference: A Field Study of MoE and Multimodal Serving on Huawei Ascend

论非 GPU 人工智能加速器在大模型推理中的局限性:基于华为昇腾的 MoE 和多模态服务的实地研究

Zheng Yu

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究非 GPU 人工智能加速器在大模型推理中的局限性,通过在华为昇腾系统上部署两个大型推理工作负载进行实地研究,总结平台八类限制及原因,量化相关指标,为评估或操作此类加速器的团队提供可重复参考。

详情

展开后加载摘要…

URL PDF HTML 收藏