arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-21 至 2026-08-21 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 7 篇

2606.19161 2026-08-21 cs.RO 版本更新 67%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Wanlin Li, Chenxi Xiao, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20127 2026-08-21 cs.CV 新提交 57%

ID-VTG: Image-Disambiguated Video Temporal Grounding

ID-VTG:基于图像消歧的视频时间定位

Minghang Zheng, Jingli Wei, Hongyi Yang, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频时间定位中视觉相似实体的消歧难题,本文提出ID-VTG任务与VGD-Agg框架,构建两个基准数据集,实现了该任务的当前最优性能。

Comments ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11322 2026-08-21 cs.HC cs.AI 版本更新 57%

Socioduality: A Relational Process Framework for Human-AI Interaction

社会对偶性:用于人机交互的关系过程框架

Mehmed Zahid Çögenli

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出社会对偶性这一关系过程框架,通过嵌套单元定义人机交互过程,经实验验证其可用于分析人机交互中贡献的形成及路径信息。

Comments 50 pages, 4 figures, 12 tables. Revised version adds a Supplementary Exploratory Analysis comparing Sociodual pathways with blind developmental/task-process segmentation, with granularity and record-format checks and an unseen-case extension. Main construct specification unchanged; minor editorial and terminology refinements

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07932 2026-08-21 cs.CV 版本更新 57%

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09261 2026-08-21 cs.CV 版本更新 57%

Self-supervised Learning Matters: A Simple Ensemble Solution for Micro-Gesture Recognition

自监督学习至关重要:一种用于微手势识别的简单集成方案

Tingyi Liu, Kun Li, Fei Wang, Junjie Chen, Zhiliang Wu, Jihao Gu, Haixu Liu, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) United Arab Emirates University(阿拉伯联合酋长国大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui Evolution Technology Co., Ltd.(安徽进化科技有限公司) Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯科技有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种集成自监督RGB模型与监督多流模型的框架,在MiGA挑战赛微手势分类赛道取得第一名,通过自监督预训练提升性能,在iMiGUE测试集上达到74.419%的top-1准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24856 2026-08-21 cs.LG cs.AI 版本更新 57%

The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth

概念分配区:追踪概念如何跨越Transformer深度形成

James Henry

机构 * Independent Researcher(独立研究者)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出概念分配区(CAZ)框架,通过层间度量(分离度、概念一致性、概念速度)检测概念在残差流中逐渐形成的深度区间,并在34个模型上验证了分离曲线的多模态性及温和CAZ的因果活性。

Comments v2: substantial revision. Cross-architecture ordering statistic and MHA/GQA cohort-split claim retracted per recomputation; corpus and companion-paper citations refreshed. See paper's "Changes from Version 1" section for the full list of superseded values

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23078 2026-08-21 eess.IV 版本更新 50%

A Systematic Survey on Event Camera Representation Learning

事件相机表示学习系统综述

Hongwei Ren, Youxin Jiang, Tuopusen Huang, Lei Yu, Xiao Wang, Min Liu, Lin Wang, Xiangqian Wu

专题命中 视频多模态 :multimodal(abstract)

AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏