Removing Temporal Note Redundancy Improves Multimodal Reinforcement Learning for Medicine
消除时间性笔记冗余可提升医学多模态强化学习性能
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 该研究针对机械通气决策的RL方法缺失笔记临床信息的问题,提出冗余感知多模态框架,通过两种策略去除笔记冗余,在ICU数据上显著提升了RL临床决策性能。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
消除时间性笔记冗余可提升医学多模态强化学习性能
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI
AI总结 该研究针对机械通气决策的RL方法缺失笔记临床信息的问题,提出冗余感知多模态框架,通过两种策略去除笔记冗余,在ICU数据上显著提升了RL临床决策性能。
InstructVVT:无需辅助空间先验的指令驱动视频虚拟试穿
专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 InstructVVT是基于DiT的视频虚拟试穿框架,通过双层级参考调控方案无需推理时空间先验,在ViViD-S等数据集上优于现有开源方法,解决了现有方法依赖辅助先验的问题。
Comments 23 pages, 10 figures. Dingbao Shao and Song Wu contributed equally. Zili Yi is the corresponding author
MobileMem:从一年的移动体验中学习
机构 * OPPO ; OpenKG
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 该研究推出MobileMem基准与框架,基于一年移动体验构建,用于设备端长期记忆研究,支持多类推理,推动智能体从信息检索向体验智能发展。
Comments Technical Report; Project Page: this http URL (http://mobilemem.openkg.cn/)
HumanForge:一个具有多智能体伪造原理的以人类为中心的深度伪造视频基准
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对视频伪造给数字内容取证带来的挑战,引入HumanForge数据集,提出基于LangGraph的Gen2Anno多智能体管道构建并注释数据集,经测试展现了零样本泛化和细粒度推理的重大挑战,代码和数据集将公开。
Comments 18 pages, 8 figures
基于点监督的骨架人类动作分割
机构 * Southeast University(东南大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出了一种点监督框架,通过多模态骨架数据和新型原型相似性方法,实现了高效的基于骨架的人类动作分割,减少了注释工作量并提升了性能。
基于状态条件转移采样的非参数时空轨迹预测
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 视频多模态 :multi-modal(abstract)
AI总结 该研究提出一种无训练的非参数时空轨迹预测方法,无需GPU和学习参数,在数据充足时精度与57M参数Transformer相当,数据稀缺时性能显著更优,可从少量历史数据部署到新区域。
JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测
专题命中 视频多模态 :multimodal(abstract)
AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。