Chem4DLLM: 4D Multimodal LLMs for Chemical Dynamics Understanding
Chem4DLLM: 4D 多模态大语言模型用于化学动态理解
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 Chem4DLLM通过整合等变图编码器和预训练大语言模型,旨在提升对4D分子动态轨迹的解释能力,推动化学动态理解和多模态科学推理的研究。
Comments 18 pages
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
Chem4DLLM: 4D 多模态大语言模型用于化学动态理解
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 Chem4DLLM通过整合等变图编码器和预训练大语言模型,旨在提升对4D分子动态轨迹的解释能力,推动化学动态理解和多模态科学推理的研究。
Comments 18 pages
MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。
Comments 27 pages, 4 tables, 6 figures
MARIA:一种用于不完整医疗数据的多模态Transformer模型
机构 * UniCampus
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 MARIA是一种基于Transformer的多模态模型,通过掩码自注意力机制有效处理不完整医疗数据,优于现有方法在性能和鲁棒性方面。
多模态可解释性通过潜在位移应用于COVID-19分层
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出一种多模态可解释方法,通过潜在位移技术在COVID-19分层中实现决策解释,提升模型可解释性与分类性能。
Journal ref Pattern Recognition 156 (2024) 110825
STONE数据集:一个可扩展的多模态周围视图3D可通行性数据集用于越野机器人导航
机构 * Interdisciplinary Program in Artificial Intelligence, Seoul National University(人工智能交叉学科项目,首尔国立大学) ; Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)
专题命中 多模态评测 :multi-modal(title,abstract)
AI总结 STONE数据集通过大规模多模态数据和自动标注流程,为越野机器人导航中的3D可通行性预测提供了可扩展的地面真实值和基准测试平台。
Comments ICRA 2026
同时多模隐蔽通信:分析与优化
专题命中 多模态评测 :multi-modal(title)
AI总结 本文提出了一种低复杂度的多模隐蔽通信模式选择技术,旨在在满足速率约束的前提下最大化隐蔽性,通过分析不同对手知识状态下的检测错误概率,验证了其性能优势。
一种用于生态化认知评估的腕戴式多模态反应时间监测设备
专题命中 多模态评测 :multimodal(title)
AI总结 本文提出了一种低成本腕戴式设备,用于在现实环境中实现多模态反应时间的高精度监测,支持非侵入式认知评估。
MM-CondChain: 一种可编程验证的视觉基础深度组合推理基准
专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 MM-CondChain提出了一种可编程验证的视觉基础深度组合推理基准,通过多层推理链评估多模态大语言模型在复杂视觉任务中的表现,实验表明深度组合推理仍是重大挑战。
Comments Project Page: https://accio-lab.github.io/MM-CondChain
ReasonMap:迈向基于交通地图的细粒度视觉推理
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。
Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/
多目标优化确定何时、何种及如何融合深度网络:应用于预测新冠结局的应用
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种多目标优化方法,用于确定何时、何种及如何融合深度网络,以提升新冠预测的准确性和鲁棒性。
Journal ref Computers in Biology and Medicine 154 (2023) 106625
CoMMET:大型语言模型在理论思维任务中能发挥多大作用?
机构 * Agency for Science, Technology and Research (A*STAR)(科技研究局) ; Nanyang Technological University(南洋理工大学) ; Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州),中国)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CL
AI总结 本文提出CoMMET多模态基准数据集,用于评估大型语言模型在多轮对话中的理论思维能力,通过扩展心理状态评估和引入多轮测试,分析模型优劣势并指明未来改进方向。
ZeroSense:视觉在长上下文压缩中的作用
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 本文提出ZeroSense框架,通过解耦多模态大语言模型能力,评估视觉-文本压缩质量,并通过低语义相关性基准测试验证长上下文压缩效果与下游任务准确性之间的显著差异。
自动驾驶系统推理的综述:开放挑战与新兴范式
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文综述了自动驾驶系统推理的挑战与新兴范式,提出认知层次分解驾驶任务,并系统化七个核心推理挑战,强调发展可验证的神经符号架构以解决高延迟推理与安全需求的矛盾。
Comments Published in TMLR (March 2026) | OpenReview: https://openreview.net/forum?id=XwQ7dc4bqn
代理可解释人工智能(代理XAI)方法探索更好的解释
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出一种结合SHAP解释性和多模态LLM迭代细化的代理XAI框架,通过农业推荐系统验证,发现早期停止可提升推荐质量,但过度细化导致性能下降,揭示了偏差-方差权衡。
LROO Rug Pull Detector:一种基于链上和开源情报信号的抗泄漏框架
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文提出了一种基于链上和开源情报信号的抗泄漏框架,用于早期识别 rug pull 攻击,通过整合多模式数据提升检测性能和可靠性。
多模式港口系统中锚泊队列容量的测量
专题命中 多模态Agent :multimodal(title,abstract)
AI总结 本文提出了一种方法,用于估算多模式港口系统的运营和终极容量,通过队列模型和微分方程模型分析休斯顿港的吞吐量及瓶颈。
面向低空经济网络的具身增强型波束预测的代理AI
机构 * School of Electronic Science and Engineering, South China Normal University(南方科技大学电子科学与工程学院) ; School of Intelligent Engineering, Shaoguan university(韶关大学智能工程学院) ; School of Automation, Guangdong University of Technology(广东工业大学自动化学院)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文提出了一种基于多代理协作推理的混合波束预测模型,通过整合时序建模、视觉编码和多模态融合,提升低空经济网络中UAV通信的波束预测精度与鲁棒性。
将顺序设计动作建模为设计师在无限画布上的外部化
专题命中 多模态Agent :multimodal(abstract)
AI总结 研究探讨了AI在无限画布设计中的作用,发现AI通过改变认知分配和工作流程,促进了设计师与AI的协同进化。
利用人工智能进行phytolith研究
专题命中 多模态Agent :multimodal(abstract)
AI总结 Sorometry通过人工智能整合2D和3D数据,实现phytolith的高效分析与预测,提升考古和古生态研究的精度与标准化。
Comments 45 pages, 23 figures
MedMO:为医学图像构建和理解多模态大语言模型
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract);multimodal foundation model(abstract)
AI总结 MedMO是一种基于通用MLLM架构构建的医学多模态基础模型,通过多阶段训练提升跨模态和任务的性能,超越现有开源基线,在医学图像识别和报告生成中取得显著提升。
Comments 21 pages, 6 figures and 4 tables
IDRL: 一种面向抑郁症诊断的个体感知多模态抑郁症相关表示学习框架
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) ; Key Laboratory of Intelligent Computing in Medical Image of Ministry of Education, Northeastern University, Shenyang, China(教育部医学图像智能计算重点实验室) ; National Frontiers Science Center for Industrial Intelligence and Systems Optimization, Shenyang, China(工业智能与系统优化国家级前沿科学中心) ; Alberta Machine Intelligence Institute, University of Alberta, Edmonton, Canada(阿尔伯塔机器智能研究所,阿尔伯塔大学,加拿大爱德蒙顿)
专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 IDRL框架通过分解多模态表示并引入个体感知的模态融合模块,提升抑郁症诊断的鲁棒性和适应性。
LoC-Path:学习压缩用于病理多模态大语言模型
专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 LoC-Path通过压缩滑片图像特征,降低多模态模型的训练和推理成本,使在有限资源下实现高效病理大语言模型成为可能。
Comments Code will be released soon
层次粒度对齐与状态空间建模用于野外多模态面部动作单元检测
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV
AI总结 本文提出了一种基于层次粒度对齐和状态空间模型的多模态框架,通过强大的基础模型提取高保真视觉和音频表示,并引入视觉-马尔可夫模型和不对称交叉注意机制,实现对野外环境中面部动作单元的高效检测。
Comments 8 pages, 1 figures
频率调制的视觉修复用于Matryoshka大多模态模型
机构 * Case Western Reserve University(凯斯西储大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL
AI总结 本文提出FMVR策略,通过频率调制修复视觉语义,提升LMMs在减少视觉token时的推理能力,并在多个基准测试中验证其有效性。
LatentGeo: 在潜在空间中学习可学习的辅助构造以进行多模态几何推理
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Nankai University(南开大学) ; Communication University of China(中国传媒大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 LatentGeo通过学习潜在空间中的连续视觉表示,解决多模态几何推理中辅助构造的表示问题,采用三阶段课程和强化学习方法提升几何推理任务的性能。
多模态深度学习在生物医学应用中的中间融合系统综述
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI
AI总结 本文系统综述了多模态深度学习在生物医学应用中的中间融合方法,分析了现有技术、挑战及未来方向,并提出结构化符号以促进方法的广泛应用。
Journal ref Image and Vision Computing 158 (2025) 105509
通过双向多视图提示对齐实现噪声感知的少样本学习
机构 * Southeast University(东南大学) ; AIIA, Ministry of Education, China(教育部人工智能研究院,中国)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 NA-MVP通过双向多视图提示对齐实现噪声感知少样本学习,有效区分干净与噪声线索,提升模型在噪声环境下的鲁棒性。
通过梯度下降学习基于树的模型
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出通过梯度下降学习硬轴对齐决策树的方法,解决传统方法的局限性,提升树模型在多个领域的性能和适用性。
Comments PhD thesis
混合策略强化学习可调节探索用于多模态推理
机构 * Aberystwyth University(阿伯里斯特维斯大学) ; Institute of Artificial Intelligence (TeleAl)(人工智能研究所) ; China Telecom(中国电信) ; Tsinghua University(清华大学)
专题命中 其他多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 本文提出CalibRL框架,通过分布感知优势加权和非对称激活函数实现可控探索,提升多模态推理模型的探索与利用平衡。
Comments Published as a conference paper at ICLR 2026
OrchMLLM: 通过批量后平衡 orchestrate 多模态数据以加速多模态大语言模型训练
专题命中 其他多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 OrchMLLM通过批量后平衡调度器和全局协调器解决多模态数据训练中的模态不一致问题,提升训练效率和可扩展性。