arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-17 至 2026-08-17 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 7 篇

2608.14157 2026-08-17 cs.AI cs.LG 新提交 79%

Removing Temporal Note Redundancy Improves Multimodal Reinforcement Learning for Medicine

消除时间性笔记冗余可提升医学多模态强化学习性能

Chenran Weng, Joo Seung Lee, Malini Mahendra, Anil Aswani

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对机械通气决策的RL方法缺失笔记临床信息的问题,提出冗余感知多模态框架,通过两种策略去除笔记冗余,在ICU数据上显著提升了RL临床决策性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14070 2026-08-17 cs.CV 新提交 70%

InstructVVT: Instruction-Driven Video Virtual Try-On without Auxiliary Spatial Priors

InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿

Dingbao Shao, Song Wu, Xinyu Chen, Qian Wang, Jiahang Li, Kuai Jiang, Jiang Lin, Yuhang Liu, Ziyu Chen, Duo Li, Jiaxin Hu, Shengrong Gu, Ziheng Tang, Rongrong Liu, Yanlun Peng, Liang Li, Junlan Feng, Lujia Jin, Ting Zhang, Jian Yang, Zili Yi

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。

Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13606 2026-08-17 cs.AI cs.CL cs.LG cs.MA cs.MM 新提交 67%

MobileMem: Learning from a Year of Mobile Experiences

MobileMem:从一年的移动体验中学习

Xinle Deng, Yida Xue, Xiangyuan Ru, Haoming Xu, Shuofei Qiao, Mengru Wang, Yijun Chen, Buqiang Xu, Chen Jiang, Yuchen Eleanor Jiang, Lizhong Wang, Jianfeng Wang, Li Zeng, Haofen Wang, Guilin Qi, Huajun Chen, Ningyu Zhang

机构 * OPPO OpenKG

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。

Comments Technical Report; Project Page: this http URL (http://mobilemem.openkg.cn/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08705 2026-08-17 cs.CV 版本更新 57%

HumanForge: A Human-Centric Deepfake Video Benchmark with Multi-Agent Forgery Rationales

HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准

Wenbo Xu, Zhimin Chen, Xiaojie Liang, Hengrui Liu, Ziqi Sheng, Wei Lu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。

Comments 18 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06201 2026-08-17 cs.CV 版本更新 57%

Point-Supervised Skeleton-Based Human Action Segmentation

基于点监督的骨架人类动作分割

Hongsong Wang, Yiqin Shen, Pengbo Yan, Jie Gui, Yang Zhang

机构 * Southeast University(东南大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种点监督框架,通过多模态骨架数据和新型原型相似性方法,实现了高效的基于骨架的人类动作分割,减少了注释工作量并提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14349 2026-08-17 cs.LG 新提交 50%

Non-Parametric Spatiotemporal Trajectory Prediction via State-Conditioned Transition Sampling

基于状态条件转移采样的非参数时空轨迹预测

Michael Fore, Akshay Jain, Justin Downes, Rohan Pradhan, Duncan Botti

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究提出一种无训练的非参数时空轨迹预测方法,无需GPU和学习参数,在数据充足时精度与57M参数Transformer相当,数据稀缺时性能显著更优,可从少量历史数据部署到新区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10780 2026-08-17 cs.RO 版本更新 50%

StageWAM: Joint-Embedding Stage Prediction for World-Action Models in Robot Manipulation

JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测

Xiao Liu, Yuguang Yang, Xi Wang, Kai Jiang, Cheng Chi, Yong Xu, Wenchao Ding, Yilun Chen, Yan Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏