arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 320 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 320 篇

2606.26093 2026-06-25 cs.RO 新提交 50%

ForceBand: Learning Forceful Manipulation with sEMG

ForceBand: 利用表面肌电信号学习有力操作

Botao He, Zhi Wang, Linna Kuang, Ishaan Ghosh, Jitendra Malik, Cornelia Fermuller, Tingfan Wu, Jiayuan Mao, Ruoshi Liu, Haozhi Qi, Yiannis Aloimonos

机构 * Amazon FAR(亚马逊 FAR) University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出ForceBand,一种低成本腕戴式sEMG系统,通过预测手指力来增强人类演示数据,用于机器人有力操作策略学习,在多种物体上实现87%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24962 2026-06-25 cs.LG 新提交 50%

Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models

迈向可扩展的多任务强化学习与大决策模型

Thibaut Kulak

专题命中 视频多模态 :multi-modal(abstract)

AI总结 提出LDM-v0,一个在大规模异构强化学习环境上离线预训练的Transformer策略,通过监督下一动作预测实现多任务学习,在约1000个环境中达到与独立训练策略相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23791 2026-06-24 hep-ph 新提交 50%

One Generator, Any Process: LLM-Conditioning for the LHC

一个生成器,任意过程:LHC的LLM条件生成

Henning Bahl, Tilman Plehn, Daniel Schiller, Thanush Sivagnanalingam

专题命中 视频多模态 :multi-modal(abstract)

AI总结 提出利用预训练LLM为自回归变压器提供描述性嵌入,通过连续参数、过程标签和费曼图的条件化方案,实现LHC事件生成网络的快速收敛、更优结果及对未见过程的泛化。

Comments 33 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23729 2026-06-24 cond-mat.mtrl-sci 新提交 50%

Interpretable Material Spatial Intelligence for Discovery of Governing Microstructural Features

可解释的材料空间智能用于发现主导微观结构特征

Mathieu Calvat, Gregory Sparks, Dhruv Anjaria, Chris Bean, Haoren Wang, Paul Gradl, Timothy M. Smith, Allison M. Beese, Gabriel Demeneghi, Kenneth Vecchio, Morad Behandish, J. C. Stinville

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出材料空间智能(MSI)框架,通过多模态表示学习直接从空间观测数据中编码微观结构信息,实现性能预测、解释和优化,并识别主导力学行为的关键特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23078 2026-06-23 eess.IV 新提交 50%

A Systematic Survey on Event Camera Representation Learning

事件相机表示学习系统综述

Hongwei Ren, Youxin Jiang, Tuopusen Huang, Xiangqian Wu

专题命中 视频多模态 :multimodal(abstract)

AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22336 2026-06-23 stat.ML cs.LG 新提交 50%

Null-Calibrated Conformal Selection via Target-Membership Scores

通过目标隶属度分数进行零校准的共形选择

Seungjin Choi

机构 * CROID Research and aSSIST University(CROID研究院和aSSIST大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出基于目标隶属度分数的共形选择方法,通过零校准(NCCS)生成有限样本有效的零p值,在方差驱动和多模态目标上优于传统预测导向分数。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22729 2026-06-23 cs.RO 新提交 50%

Temporal Logic Guidance for Action-Only Diffusion Policies with World Models

基于时序逻辑的动作扩散策略与世界模型引导

Moritz Zoellner, Anastasios Manganaris, Rohan Paleja

机构 * German Academic Exchange Service (DAAD)(德国学术交流中心(DAAD))

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出一种利用世界模型实现时序逻辑鲁棒性可微评估的引导方法,在不重新训练的情况下改善动作扩散策略的约束满足,在Robomimic任务中将违规率从80%降至4%。

Comments Accepted at the ICRA 2026 Workshop on Bridging the Gap between Robot Learning and Human-Robot Interaction. 3 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21776 2026-06-23 cs.LG 新提交 50%

A Causal DAG Prior for Synthetic Time-Series Classification Datasets

用于合成时间序列分类数据集的因果DAG先验

Franco Martino O'Rourke, Ana Trisovic, Dimitris Bertsimas

机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 提出一种因果DAG先验,从随机采样的有向无环图生成多变量、多类别的时间序列分类数据集,包含跨模态因果结构,微调TabPFN v2.5后在UCR/UEA数据集上显著优于基线。

Comments Accepted at the 2nd ICML 2026 Workshop on Foundation Models for Structured Data (FMSD). 4 pages (main text), 2 figures, plus references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21600 2026-06-23 cs.RO 新提交 50%

VQActFlow: Vector-Quantized Action Mode Steering for Multi-Task Robot Manipulation

VQActFlow: 用于多任务机器人操作的矢量量化动作模式引导

Zhigen Zhao, Mark Leggiero, Yipu Chen, Haoran Liu, Yifan Wu, Huishu Xue, Sirui Zhan, Ye Zhao

机构 * Institute for Robotics and Intelligent Machines (IRIM), Georgia Institute of Technology(佐治亚理工学院机器人与智能机器研究所(IRIM))

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出VQActFlow,通过矢量量化动作标记和变分流匹配生成离散代码序列,显式区分动作模式,并利用推理时引导(语言条件无分类器引导和代码本评论家)实现模式承诺,在LIBERO、Unitree G1和ALOHA平台上优于连续和离散基线。

Comments 8 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21088 2026-06-23 cs.RO 新提交 50%

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

MV-WAM: 具有价值增强的流形感知世界动作模型

Jintao Chen, Peidong Jia, Qingpo Wuwu, Jiaming Liu, Mengfei Du, Chun-Kai Fan, Xiaowei Chi, Hao Chen, Chengyu Bai, Zezhong Qian, Hao Wang, Jiajun Cao, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 提出MV-WAM框架,通过跨模态因果掩码、流形感知优化和进度价值调节机制,联合建模视觉预测、动作生成和价值估计,在分布外场景中提升动作泛化能力,在仿真和真实机器人任务上显著优于基线。

Comments 20 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12899 2026-06-17 eess.SP 新提交 50%

LGVSC: A Large-Model-Driven Generative Video Semantic Communication Framework

LGVSC:一种大模型驱动的生成式视频语义通信框架

Yu Ma, Hang Yin, Li Qiao, Shuo Sun, Zhen Gao, Yin Xu, Wenjun Zhang

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出大模型驱动的生成式视频语义通信框架LGVSC,通过解耦编解码器、引入概率语义相似度评分和语义引导关键帧提取,在极低带宽下实现高效视频语义传输,并保持零样本泛化能力。

Comments Accepted by IEEE Transactions on Vehicular Technology; v2: Added appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16053 2026-06-16 cs.SI cs.CY 新提交 50%

Modeling Engagement with Brand and Organizational TikTok Videos Using Machine-Assisted Theory-Ensemble Annotation

使用机器辅助理论集成标注建模品牌和组织TikTok视频的参与度

Sander Paekivi, Andres Karjus

专题命中 视频多模态 :multimodal(abstract)

AI总结 利用多模态大语言模型标注77个理论驱动的结构变量,分析约1万个TikTok视频,以预测参与度并探索短视频文化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15330 2026-06-16 cs.IR 新提交 50%

OneBar: An End-to-End Content-Grounded Generative Query Recommendation Framework for E-Commerce Video Feeds

OneBar:一种面向电商视频流的端到端内容驱动生成式查询推荐框架

Yao Tang, Ying Yang, Ben Chen, Yufei Ma, Zihan Liang, Chenyi Lei, Wenwu Ou, Jian Liu

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出OneBar框架,通过协同多模态意图对齐、统一端到端架构和渐进偏好学习,解决短视频平台查询推荐中的延迟和偏好漂移问题,显著提升查询曝光和点击。

Comments Any questions feel free to contact: benchen4395@gmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14893 2026-06-16 cs.HC 新提交 50%

Automated Gaze-based Behavioral Segmentation and Temporal Representation for Bridge Inspection in Unconstrained 3D Environments

基于自动注视行为分割与时间表示的非约束三维环境桥梁检测

Daniel Jimenez Gil, Haosen Zhang, Zixin Wang, Mohamad Alipour

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出自动分析框架,将非约束3D注视、头部运动、无人机导航和场景几何数据分割为全局扫描、局部检测和导航三种功能模式的时间序列,提取行为描述符,揭示检测策略差异及与性能的关系。

Comments 46 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12494 2026-06-12 cs.LG 新提交 50%

Net-Ev$^2$: A Generative Simulator for Network Event Evolution

Net-Ev$^2$:网络事件演化的生成式模拟器

Guangyu Wang, Zhaonan Wang

机构 * NYU Shanghai(上海纽约大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出Net-Ev$^2$,一种结合事件线索与网络拓扑的生成式模拟器,通过结构引导掩码预训练和拓扑感知扩散过程模拟网络事件演化,在多个道路网络数据集上达到最优性能。

Comments Accepted by KDD 2026 Research Track

Journal ref In Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12403 2026-06-11 cs.RO 新提交 50%

World Pilot: Steering Vision-Language-Action Models with World-Action Priors

World Pilot: 用世界动作先验引导视觉-语言-动作模型

Zefu Lin, Rongxu Cui, Junjia Xu, Xiaojuan Jin, Wenling Li, Lue Fan, Zhaoxiang Zhang

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 视频多模态 :image-text(abstract)

AI总结 提出World Pilot框架,通过世界动作模型(WAM)的潜在引导和动作引导两条路径,为VLA模型提供场景演化先验和轨迹级运动提示,在LIBERO-Plus零样本OOD基准上达到84.7%的总成功率,并在多个真实机器人操作任务中取得最高成功率。

Comments Project Website: https://world-pilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10927 2026-06-10 cs.RO 新提交 50%

AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning

AllDayNav: 通过真实世界强化学习实现终身导航

Hang Yin, Yinan Liang, Jiazhao Zhang, Jiahang Liu, Minghan Li, Zhizheng Zhang, He Wang

机构 * Tsinghua University(清华大学) Galbot Robotics Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出AllDayNav框架,利用自进化多模态记忆和强化学习隐式编码场景动态,在跨房间、跨回合和跨任务场景中实现接近100%的成功率,超越基于地图、VLM和RL的基线方法。

Comments Project Page: https://bagh2178.github.io/AllDayNav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10743 2026-06-10 cs.RO 新提交 50%

Hand-centric Human-to-Robot Trajectory Transfer from Video Demonstrations via Open-World Contact Localization

基于开放世界接触定位的以手为中心的人到机器人轨迹迁移

Yitian Shi, Di Wen, Zhengqi Han, Zicheng Guo, Yu Hu, Edgar Welte, Kunyu Peng, Rainer Stiefelhagen, Rania Rayyes

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 提出HOWTransfer框架,通过接触定位从人类视频中提取接触感知的机器人轨迹,无需物体特定描述,在多样化操作任务中实现86%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08737 2026-06-09 cs.RO 新提交 50%

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

Dream-Tac: 用于接触丰富机器人操作任务的统一触觉世界动作模型

Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Nanjing University(南京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 提出Dream-Tac统一触觉世界动作模型,通过接触门控视觉-触觉融合和接触感知注意力偏置,联合建模动作、未来视觉观察和触觉动态,在六项接触丰富操作任务中平均动作准确率提升31.7%。

Comments 16 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06967 2026-06-08 cs.LG 新提交 50%

GenPO++: Generative Policy Optimization with Jacobian-free Likelihood Ratios

GenPO++:基于无雅可比似然比的生成式策略优化

Ke Hu, Shutong Ding, Panxin Tao, Jingya Wang, Ye Shi

机构 * ShanghaiTech University(上海科技大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出GenPO++框架,利用高阶可逆ODE求解器中的历史状态作为辅助记忆,实现精确可逆映射,从而无偏且高效地计算生成流策略的似然比,在连续控制任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏