EyeWorld: A Generative World Model of Ocular State and Dynamics
EyeWorld: 一种眼态与动态的生成世界模型
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 EyeWorld通过统一多模态解析与时间条件状态转移,实现对眼态的鲁棒多模态解释与临床预测模拟。
Comments 38 pages, 8 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
EyeWorld: 一种眼态与动态的生成世界模型
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 EyeWorld通过统一多模态解析与时间条件状态转移,实现对眼态的鲁棒多模态解释与临床预测模拟。
Comments 38 pages, 8 figures
细粒度微调会削弱视觉语言代理的安全对齐
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。
Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026
眼认证:融合眼动与周睑模态
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本文提出一种多模态认证系统,通过融合眼动和周睑图像,在无校准认证系统中提升性能,优于单一模态系统,超越FIDO基准。
Comments Supplementary material is available
Journal ref 2025 IEEE International Joint Conference on Biometrics (IJCB)
INST-IT:通过显式视觉提示指令微调提升实例理解
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本文提出INST-IT方法,通过显式视觉提示指令微调提升大模型的实例理解能力,构建了评估基准和数据集,并在多个基准上验证了方法的有效性。
Comments Accepted by NeurIPS 2025
从系统生物学视角出发,通过多层次融合基因组、蛋白质组和病理影像数据以推进癌症预后
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本文提出HFGPI框架,通过分子编码策略和蛋白质引导超图学习,多层次融合基因组、蛋白质组和病理影像数据,提升癌症预后预测精度。
大型音频语言模型中音频-文本融合的因果追溯
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL
AI总结 研究通过因果追溯分析大型音频语言模型在音频理解过程中音频特征与文本上下文的融合机制,揭示不同模型在层间和token级的融合策略及信息瓶颈。
Comments Submitted to Interspeech 2026
Fuxi-DA: 一种通用的深度学习数据同化框架,用于同化卫星观测数据
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 本文提出Fuxi-DA框架,利用深度学习技术同化卫星观测数据,有效降低分析误差并提升预报性能,通过单观测实验验证其一致性与可靠性。
当视觉隐私保护与多模态大语言模型相遇
专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 本文研究多模态大语言模型在提供便利性的同时如何保护视觉隐私,提出基于黑盒模型的优化框架,通过帕累托最优和关键历史增强优化实现隐私与性能的平衡。
Journal ref Int J Comput Vis (IJCV) 134, 167 (2026)
UniMMAD: 一种基于MoE驱动特征解压的多模态多类别异常检测统一框架
专题命中 其他多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 UniMMAD通过MoE驱动的特征解压机制,实现多模态和多类别异常检测的统一,解决传统方法在领域变化和内存占用上的不足,提升检测效率与准确性。
Comments Accepted by CVPR 2026
通过梯度调节与投影平衡多模态领域泛化
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出GMP方法,通过解耦分类与领域不变目标的梯度,调节模态梯度基于语义和领域置信度,并动态调整梯度投影以平衡多模态领域泛化中的优化不均衡问题。
Comments AAAI 2026 Oral Accepted
具有多模感知的动态障碍物避让风险感知安全控制
专题命中 其他多模态 :multi-modal(title,abstract)
AI总结 本文提出一种融合概率状态估计与条件风险值控制障碍函数的安全框架,通过 Wasserstein barycenter 结合多模感知数据,提升自动驾驶在动态环境中的安全性和鲁棒性。
LHM++:一种高效的大型人类重建模型,用于从无姿态图像到3D
专题命中 其他多模态 :multimodal(abstract);分类 cs.CV
AI总结 本文提出LHM++模型,通过编码器-解码器点图像变换器高效生成高质量可动画3D人像,融合多模态注意力提升效率与视觉真实性。
Comments HomePage: https://lingtengqiu.github.io/LHM++/ Online Demo: https://huggingface.co/spaces/Lingteng/LHMPP
KAN-FIF: 基于样条参数化的轻量级物理引导型热带气旋估计方法用于气象卫星
专题命中 其他多模态 :multimodal(abstract);分类 cs.AI
AI总结 本文提出KAN-FIF框架,通过整合MLP和CNN层与样条参数化的KAN层,实现轻量级多模态架构,在减少参数量和提升推理速度的同时保持高精度,适用于边缘设备的热带气旋监测。
参数高效混合脉冲-量子卷积神经网络与替代梯度和量子数据重传
专题命中 其他多模态 :multi-modal(abstract)
AI总结 本文提出了一种参数高效的混合脉冲-量子卷积神经网络,通过统一优化策略实现脉冲神经网络和量子电路的联合训练,无需依赖预训练的脉冲编码器和子集数据集,提高了模型性能和可扩展性。
Comments Work under review
Journal ref PeerJ Computer Science 12 (2026): e3554
非参数学习连续变量系统的非高斯量子态
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文提出非参数核量子态估计方法,用于从噪声数据中重建量子态及其迹特征,适用于多模非高斯态的鲁棒估计。
流体流变性对自然裂缝网络中流体流动的影响
专题命中 其他多模态 :multimodal(abstract)
AI总结 研究非牛顿流体在自然裂缝网络中的流动行为,探讨流变性、裂缝几何和流体惯性之间的复杂相互作用,揭示非牛顿流体对裂缝连通性和流动模式的影响。
增强型GFlowNets:通过顺序学习提升探索
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文提出增强型GFlowNets,通过顺序训练多个模型,补偿已捕捉的奖励,提升探索效率和样本多样性。
Comments 11 pages, 3 figures (22 pages total including supplementary material)
跨量子化学层级的统一基础模型学习
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文提出一种多模态学习架构,能够学习任意数量的量子化学层级,提供更通用且易用的替代方案,通过训练AIO-ANI-UIP模型,展示了其在有机分子中的泛化能力,同时设计了更准确的Δ-AIO-ANI模型。
迈向与物理架构流畅交互的领域
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文探讨了人机交互在大规模可变形环境中的设计,通过两项研究揭示了用户需求与自动化与自主性之间的矛盾,以及多模态协作的核心挑战,提出了一种无模态依赖的用户意图演化模型。
Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems