Chronic Kidney Disease Prognosis Prediction Using Transformer
使用Transformer进行慢性肾脏病预后预测
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
AI总结 提出基于Transformer的ProQ-BERT框架,利用多模态电子健康记录预测CKD进展,在9万余名患者数据上实现高达0.995的ROC-AUC。
Comments 5 pages, 2 figures, 2 tables
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
使用Transformer进行慢性肾脏病预后预测
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
AI总结 提出基于Transformer的ProQ-BERT框架,利用多模态电子健康记录预测CKD进展,在9万余名患者数据上实现高达0.995的ROC-AUC。
Comments 5 pages, 2 figures, 2 tables
观察、推断、干预:面向目标导向社交智能的主动世界建模
机构 * Mita Technology(Mita技术公司) ; University of Bristol(布里斯托大学) ; University of Toronto(多伦多大学) ; McGill University(麦吉尔大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
AI总结 提出 See-Infer-Intervene (SII) 框架和主动意图世界模型 (PIWM),通过观察顾客行为、推断潜在意图并选择干预动作,实现零售场景中的主动辅助,在 GuidanceSalesBench 基准上达到 0.641 macro F1。
Comments 16 pages, 3 figures, 9 tables. Preprint
基于稀疏卫星时间序列和天气协变量的概率NDVI预测
机构 * Department of Naval, Electrical, Electronics and Telecommunications Engineering, University of Genoa, Italy(海军、电子、电子与电信工程系,热那亚大学,意大利)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出一种概率预测框架,利用稀疏卫星数据和天气协变量进行田间NDVI预测,通过融合历史和未来数据实现多步分位数预测,实验表明优于传统和深度学习方法。
基于语言驱动的序列级模态不变表示学习用于视频可见光-红外行人重识别
机构 * Shandong Key Laboratory of Ubiquitous Intelligent Computing, School of Information Science and Engineering, University of Jinan(山东省 Ubiquitous Intelligent Computing 重点实验室,济南大学信息科学与工程学院) ; College of Information Science and Technology & Artificial Intelligence, Nanjing Forestry University(信息科学与技术及人工智能学院,南京林业大学) ; Department of Informatics, Modeling, Electronics, and Systems, University of Calabria(信息学、建模、电子与系统系,卡利博大学)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV
AI总结 提出LSMRL方法,通过CLIP的时空特征学习、语义扩散和跨模态交互模块,结合模态级损失,学习序列级模态不变表示,在VVI-ReID任务上超越现有方法。
EchoFoley: 面向视频接地创意声音生成的事件中心层次化控制
机构 * ByteDance Intelligent Creation(字节跳动智能创作) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Merced(加州大学默塞德分校) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出EchoFoley任务,通过事件级局部控制和层次化语义控制实现视频接地声音生成,构建EchoFoley-6k基准并设计EchoVidia框架,在可控性和感知质量上分别提升40.7%和12.5%。
Comments CVPR-2026 Main Conference
MILE:一种用于灵巧操作的指尖视觉触觉传感的机械同构外骨骼数据采集系统
机构 * State Key Laboratory of Mechanical System and Vibration, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(机械系统与振动国家重点实验室,上海交通大学机械工程学院,上海200240,中国) ; Shanghai Key Laboratory of Intelligent Robotics, Shanghai Jiao Tong University, Shanghai 200240, China(智能机器人上海重点实验室,上海交通大学,上海200240,中国) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) ; Humanoid Robot (Shanghai) Co., Ltd., Shanghai, China(上海人形机器人有限公司,上海,中国)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 针对现有灵巧操作数据采集系统运动重定向不准确、效率低、缺乏高分辨率指尖触觉传感的问题,提出MILE系统,通过从人手到外骨骼再到机械手的机械同构设计,实现无重定向精确控制,并集成指尖视觉触觉模块,采集多模态数据集,显著提升遥操作成功率。
Comments 18 pages including supplementary material. Main manuscript and supplementary material included in this version
看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象
机构 * CUHK (SZ)(香港中文大学(深圳)) ; University of Cambridge(剑桥大学) ; UESTC(电子科技大学) ; CUHK(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。
Comments Accepted to CVPR 2026 (Highlight)
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架
机构 * East China Normal University(华东师范大学) ; ByteDance(字节跳动)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。
Comments Accepted by CVPR 2026
SleepMaMi:一种融合宏观与微观结构的通用睡眠基础模型
机构 * Graduate School of Data Science, Seoul National University, Seoul, South Korea(首尔国立大学数据科学研究生院,韩国首尔) ; Department of Biomedical Sciences, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院生物医学科学系,韩国首尔) ; Obstructive Upper Airway Research (OUaR) Laboratory, Department of Pharmacology, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院药理学系阻塞性上气道研究(OUaR)实验室,韩国首尔) ; Department of Otorhinolaryngology-Head and Neck Surgery, Seoul National University Hospital, Seoul, Republic of Korea(首尔国立大学医院耳鼻喉头颈外科系,韩国首尔)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI
AI总结 提出SleepMaMi睡眠基础模型,通过分层双编码器设计(宏观编码器建模整夜时间依赖,微观编码器捕捉生物信号短时特征),结合人口统计引导对比学习和混合掩码自编码器训练,在超过2万条PSG记录上预训练,在下游任务中优于或匹配现有基础模型。
Comments 8 pages, Appendix 9 pages
Auteur: 以语言驱动的电影化取景实现以人为中心的视频生成
机构 * Koç University(科克大学) ; University College London(伦敦大学学院) ; Adobe(Adobe公司) ; Hacettepe University(哈切特佩大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出Auteur方法,通过将相机运动参数化为以人为中心的取景(包括镜头尺寸、角度和构图),并利用领域特定语言(DSL)和微调的多模态大语言模型,实现语言驱动的电影化取景,在人类中心视频生成中优于现有方法。
Comments Project Page: https://cyberiada.github.io/Auteur/
V-JEPA 2.1: 解锁视频自监督学习中的密集特征
机构 * FAIR at Meta(Meta的FAIR) ; Universidad de Zaragoza(萨拉戈萨大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV
AI总结 提出V-JEPA 2.1系列自监督模型,通过密集预测损失、深度自监督、多模态分词器和有效缩放,学习图像和视频的密集高质量视觉表示,在多个基准上取得最优性能。
等变流匹配用于对称破缺分岔问题
机构 * Department of Mechanical Engineering, Eindhoven University of Technology(埃因霍温理工大学机械工程系) ; DIFFER – Dutch Institute for Fundamental Energy Research(荷兰基础能源研究所) ; Faculty of Civil Engineering, Department of Mechanics, Czech Technical University in Prague(布拉格捷克技术大学土木工程学院力学系) ; Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 针对非线性动力系统中对称破缺导致的多稳态共存问题,提出等变流匹配方法,结合等变架构与最优传输耦合机制,准确捕捉多模态分布和对称破缺分岔,优于非概率和变分方法。
Comments 9 pages, 7 figures including appendices. Accepted to Machine Learning and the Physical Sciences Workshop, NeurIPS 2025 (https://ml4physicalsciences.github.io/2025/). Repository with corresponding code: https://github.com/FHendriks11/bifurcationML/. Video explanation: https://www.youtube.com/watch?v=wsL3h17KtjY
CoVR-R: 推理感知的组合视频检索
机构 * Mohamed bin Zayed University of AI(莫扎德·本·扎耶德人工智能大学) ; University of Chicago(芝加哥大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Linköping University(林奈大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出一种零样本推理优先方法,利用大型多模态模型推断编辑的因果和时序后效,并构建CoVR-Reason基准评估,在隐式效应子集上显著优于强基线。
Comments 9 Pages, 3 Figures
GenEyePose:用于数字神经生理学生物标志物开发的无患者、基于知识的扫视眼动建模
机构 * Whiting School of Engineering, Johns Hopkins University(约翰霍普金斯大学惠廷工程学院) ; Department of Neurology, Johns Hopkins Medicine(约翰霍普金斯医学院神经内科)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出首个全合成、无患者的多模态眼动生成流水线,用于泛化扫视分析;基于合成数据训练的深度学习分类器在真实临床数据上区分正常与异常扫视精度,AUROC达0.76。
OpenGlass:用于设备上基于事件的手势识别的开源智能眼镜
机构 * Department of Information Technology and Electrical Engineering, ETH Zürich(信息科技与电气工程系,瑞士联邦理工学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 提出开源智能眼镜平台OpenGlass,采用模块化设计、事件驱动电源管理和GAP9 RISC-V SoC,实现低功耗设备上ML,在LynX数据集上达到83.94%的跨主体手势识别准确率。
ChatHealthAI: 将电子健康记录表示与大语言模型对齐以实现基于临床的推理
机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学系) ; Mila - Quebec AI Institute(魁北克人工智能研究所)
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 提出ChatHealthAI框架,通过任务感知重采样器将预训练的EHR基础模型的结构化表示与冻结的大语言模型语义空间对齐,实现可解释的临床推理并保持预测性能。
Comments Main paper with appendix, 13 pages
QuickLAP: 为半自主代理快速语言-动作偏好学习
专题命中 视频多模态 :multimodal(abstract);分类 cs.AI
AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。
高速公路立交匝道流量预测的代理重建预训练
机构 * Southeast University(东南大学) ; Institute of Telecommunications and Information Sciences, China(中国电信与信息科学研究院)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI
AI总结 提出时空解耦自编码器(STDAE),通过跨模态重建预训练从主线数据恢复匝道流量,结合GWNet等模型提升预测精度,在真实数据集上超越13个基线。
Comments Accepted at Applied Soft Computing Journal
Journal ref Applied Soft Computing Journal 200 (2026) 115462
JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测
专题命中 视频多模态 :multimodal(abstract)
AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。
机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) ; X-Era AI Lab(X-Era人工智能实验室) ; AMAP, Alibaba(阿里妈妈实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 视频多模态 :image-text(abstract)
AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。
Comments Accepted at ACM Multimedia 2026
无序地标视觉导航
专题命中 视频多模态 :multimodal(abstract)
AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。
Comments ECCV2026 Oral & Spotlight
Loom:利用局部邻域和全局轨迹对空间转录组学进行多区域分析
专题命中 视频多模态 :multi-modal(abstract)
AI总结 Loom是用于空间转录组学分析的视觉计算系统,利用新颖图形符号和计算框架,应对多模态整合挑战,经案例研究和可用性研究评估,有效支持细胞转变及时空表达动态发现。
超越静态预测:利用世界模型进行移动交通外推
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。
大黄蜂:用于大规模推荐系统的交错混合层构建块
专题命中 视频多模态 :cross-modal(abstract)
AI总结 研究针对推荐系统发展的两条轨道缺乏交互的问题,提出大黄蜂架构,通过交错可堆叠块设计,结合多种技术,实现模态混合与信息丰富,经实验验证该方法优于基线模型,证明交错异构单元是有前途的推荐架构范式。
0.55T下同时进行EEG-fMRI可行性的研究:记录、去噪与功能映射
专题命中 视频多模态 :multimodal(abstract)
AI总结 本研究证明在0.55T下同时进行EEG-fMRI的可行性,通过去噪和功能映射展示了多模态神经成像的潜力。
StateScribe: 向现实世界重访中的可访问性变化意识迈进
专题命中 视频多模态 :multimodal(abstract)
AI总结 StateScribe通过双层记忆架构实现跨重访的现实变化感知,提高盲人和低视力用户对环境变化的认知能力,准确率达83.1%。
一种带有触觉反馈的视觉-触觉数据采集系统用于粗到细模仿学习
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出一种视觉-触觉数据采集系统,生成时间结构丰富的接触密集演示,用于模仿学习。通过直接驱动夹具和触觉阵列,保留自然触觉反馈,结合实时注释,生成多模态数据集以支持粗到细学习算法。
Facade:使用深度上下文异常检测的高精度内部威胁检测
专题命中 视频多模态 :multi-modal(abstract)
AI总结 研究内部人员特权访问带来的威胁,提出Facade系统,通过考虑事件上下文、基于多模态模型及对比学习策略检测可疑事件,能高精度检测内部威胁且误报率极低,可用于大型企业环境。
PACE:通过人机交互中的对话启发实现角色适应
机构 * Macquarie University(麦考瑞大学) ; NVIDIA(英伟达)
专题命中 视频多模态 :multimodal(abstract)
AI总结 研究如何让类人机器人有可适应角色,提出PACE框架,通过用户问答动态生成角色,经提高结构化提示,经系统集成转化为行为,实证评估显示其对人机交互多方面有积极影响,为部署个性化等身份开辟途径。
Comments 8 pages, 5 figures
增强型分位数回归神经网络与时空排列熵用于复杂系统预测
机构 * University of Hertfordshire(赫特福德大学)
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出一种基于时空排列熵分析与增强型分位数回归神经网络的新型框架,用于模式预测和系统预测。通过结合基于熵的复杂性度量与先进神经架构,实现多维系统复杂动态模式的理解,提升预测精度和不确定性量化能力。
Comments Preliminary version of a predictive maintenance framework using spiking neural networks and entropy-based analysis. To be expanded in future publications with hardware implementations and real-time drift detection modules. arXiv admin note: substantial text overlap with arXiv:2501.05087