arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-29 至 2026-06-29 共收录 31 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 1 篇

2511.11266 2026-06-29 cs.CV 版本更新 57%

GraphPilot: Grounded Scene Graph Conditioning for Language-Based Autonomous Driving

GraphPilot: 基于场景图条件化的语言自主驾驶

Fabian Schmidt, Markus Enzweiler, Abhinav Valada

机构 * Esslingen University of Applied Sciences(埃斯林根应用科学大学) University of Freiburg(弗赖堡大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出GraphPilot方法,通过交通场景图序列化与结构化提示模板,将关系上下文注入语言驾驶模型,显著提升驾驶分数。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频多模态 6 篇

2603.18558 2026-06-29 cs.CV cs.AI 版本更新 91%

HiMu: Hierarchical Multimodal Frame Selection for Long Video Question Answering

HiMu: 面向长视频问答的分层多模态帧选择

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学INSIGHT实验室,以色列) Ben-Gurion University of the Negev, Israel(本-古里安内盖夫大学,以色列)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 提出HiMu框架,通过文本LLM将查询分解为层次逻辑树,由视觉和音频专家处理原子谓词,经模糊逻辑算子组合生成连续帧满意度曲线,在16帧预算下达到帧选择方法的最优精度,并作为即插即用模块提升多种MLLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00705 2026-06-29 cs.CV 版本更新 84%

Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs

无训练不确定性引导的复杂视觉任务多模态大语言模型

Sanghwan Kim, Rui Xiao, Stephan Alaniz, Yongqin Xian, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学 LTCI 实验室)

专题命中 视频多模态 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV

AI总结 提出无需训练的框架,利用MLLM内在不确定性主动引导,通过响应不确定性评分候选视觉输入,使模型自主聚焦关键信息,在视觉搜索、长视频理解等任务中达到与微调系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03401 2026-06-29 cs.HC cs.AI cs.CV 版本更新 81%

Can LLMs Reason About Attention? Towards Zero-Shot Analysis of Multimodal Classroom Behavior

LLMs能否进行注意力推理?多模态课堂行为的零样本分析

Nolan Platt, Sehrish Nizamani, Alp Tural, Elif Tural, Saad Nizamani, Andrew Katz, Yoonje Lee, Nada Basit

机构 * Virginia Tech(弗吉尼亚理工大学) University of Virginia(弗吉尼亚大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个隐私保护的分析流程,利用OpenPose和Gaze-LLE提取学生注意力信息,并通过QwQ-32B-Reasoning进行零样本分析,探讨LLMs在多模态行为理解中的潜力与局限。

Comments 8 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20328 2026-06-29 cs.CV 版本更新 57%

HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization

混合潜在推理与解耦策略优化

Tao Cheng, Shi-Zhe Chen, Hao Zhang, Yixin Qin, Jinwen Luo, Zheng Wei

机构 * Tencent PCG(腾讯PCG) Tencent CSIG(腾讯CSIG)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HyLaR框架,通过结合离散文本生成与连续视觉潜在表示,提升多模态大语言模型在细粒度感知和通用多模态理解中的性能。

Comments Accepted to ECCV 2026

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00784 2026-06-29 cs.CV 版本更新 57%

An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models

一种丰富手术视频数据集的方法,用于视觉-语言模型的细粒度时空理解

Lennart Maack, Alexander Schlaefer

机构 * Hamburg University of Technology(汉堡理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出SurgSTU-Pipeline生成管道,通过时空连续性过滤创建细粒度时空问答数据集SurgSTU,提升视觉-语言模型在手术视频中的时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02340 2026-06-29 cs.AI q-bio.OT 版本更新 57%

Chronic Kidney Disease Prognosis Prediction Using Transformer

使用Transformer进行慢性肾脏病预后预测

Yohan Lee, Dong Gyun Kang, SeHoon Park, Sa-Yoon Park, Kwangsoo Kim

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 提出基于Transformer的ProQ-BERT框架,利用多模态电子健康记录预测CKD进展,在9万余名患者数据上实现高达0.995的ROC-AUC。

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 6 篇

2507.05503 2026-06-29 cs.CE 版本更新 78%

MolFORM: Multi-modal Flow Matching for Structure-Based Drug Design

MolFORM:基于多模态流匹配的结构药物设计

Jie Huang, Daiheng Zhang

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 提出MolFORM框架,利用多流匹配联合建模离散原子类型和连续3D坐标,并通过基于直接偏好优化的偏好引导微调提升生成质量,在多个评估指标上取得一致改进。

Comments Accepted to ICML 2025 genbio workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05950 2026-06-29 cs.AI 版本更新 77%

Edit-R2: Context-Aware Reinforcement Learning for Multi-Turn Image Editing

Edit-R2:面向多轮图像编辑的上下文感知强化学习

Yuxiao Ye, Haoran He, Fangyuan Kong, Xintao Wang, Pengfei Wan, Kun Gai, Ling Pan

机构 * Hong Kong University of Science and Technology(香港理工大学) Kuaishou Technology(快手科技)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 提出Edit-R2框架,通过重构会话意图和联合优化推理与生成的强化学习,解决多轮图像编辑中的长上下文稀释和状态污染问题,并在MICE-Bench基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10179 2026-06-29 cs.CV cs.AI 版本更新 62%

When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models

当提示变为视觉:面向大型图像编辑模型的以视觉为中心的越狱攻击

Jiacheng Hou, Yining Sun, Ruochong Jin, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出首个视觉到视觉的越狱攻击VJA,通过纯视觉输入传递恶意指令,并构建安全基准IESBench,在商业模型上攻击成功率高达80.9%,同时提出无需训练的内省多模态推理防御方法。

Comments Accepted for spotlight and oral presentation at ICML 2026 (Project: https://csu-jpg.github.io/vja.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25042 2026-06-29 cs.CV 版本更新 57%

Unbiased Diffusion Variational Inversion via Principled Posterior Matching

无偏扩散变分反演:基于原则性后验匹配

Weimin Bai, Yuxuan Gu, Yifei Wang, Weijian Luo, He Sun

机构 * Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出原则性后验匹配(PPM)框架,通过精确优化KL散度(利用Fisher散度积分)解决逆问题中模式坍塌和不确定性量化不可靠的问题,统一变分推理和摊销推理,在图像修复、超分辨荧光显微和射电干涉成像中实现高保真重建和校准的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10863 2026-06-29 cs.CV 版本更新 57%

Beyond Sequential Distance: Inter-Modal Distance Invariant Position Encoding

超越序列距离:模态间距离不变位置编码

Lin Chen, Bolin Ni, Qi Yang, Zili Wang, Kun Ding, Ying Wang, Houwen Peng, Shiming Xiang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, China(MAIS,自动化研究所,中国科学院,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) Tencent Hunyuan Team, China(腾讯文言团队,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大模型在长上下文中的视觉衰减问题,提出模态间距离不变位置编码(DIPE),通过解耦模态间位置编码消除距离惩罚,保持视觉感知一致性,显著缓解视觉衰减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03117 2026-06-29 cs.CV cs.SD 版本更新 57%

Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction

通过高级模态条件与交互驯服文本到发声视频生成

Kaisi Guan, Xihua Wang, Zhengfeng Lai, Xin Cheng, Peng Zhang, XiaoJiang Liu, Ruihua Song, Meng Cao

机构 * Renmin University of China(中国人民大学) Apple(苹果公司)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出分层视觉基础字幕框架(HVGC)生成解耦的视频和音频字幕,并基于此引入双塔扩散变换器BridgeDiT,通过双交叉注意力机制实现对称双向信息交互,在三个基准数据集上达到最先进结果。

Comments The 19th European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态评测 5 篇

2603.19466 2026-06-29 cs.CV 版本更新 79%

ProactiveBench: Benchmarking Proactiveness in Multimodal Large Language Models

ProactiveBench: 多模态大语言模型主动性的基准测试

Thomas De Min, Subhankar Roy, Stéphane Lathuilière, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) University of Bergamo(贝拉米奥大学) Inria Grenoble(格勒诺布尔研究所) Bruno Kessler Foundation(布鲁诺·凯斯勒基金会)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出ProactiveBench基准,评估多模态大语言模型在遮挡识别等任务中请求用户干预的主动性,发现模型普遍缺乏主动性且与能力无关,但可通过强化学习微调习得。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12857 2026-06-29 cond-mat.mtrl-sci 版本更新 78%

Quantifying Perovskite Solar Cell Degradation via Machine Learning from Spatially Resolved Multimodal Luminescence Time Series

通过空间分辨多模态发光时间序列的机器学习量化钙钛矿太阳能电池退化

Giulio Barletta, Simon Ternes, Saif Ali, Zohair Abbas, Chiara Ostendi, Marialucia D'Addio, Erica Magliano, Pietro Asinari, Eliodoro Chiavazzo, Aldo Di Carlo

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出深度学习框架LumPerNet,利用多模态发光成像(EL、PLoc、PLsc)直接估计钙钛矿太阳能电池的效率保持率,通过对比空间均匀化控制,发现全局发光演变包含主要预测信号,空间信息提供次要鲁棒性贡献。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09731 2026-06-29 cs.CV cs.AI cs.CL 版本更新 67%

EXPLORE-Bench: Egocentric Scene Prediction with Long-Horizon Reasoning

EXPLORE-Bench:具有长视距推理的自我中心场景预测

Chengjun Yu, Xuhan Zhu, Chaoqun Du, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Foundation Model Team, Li Auto Inc.(蔚来汽车基础模型团队) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出EXPLORE-Bench基准,通过初始场景图像和动作序列预测最终场景,评估多模态大模型在自我中心长视距推理中的能力,发现与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22536 2026-06-29 cs.CV cs.CL 版本更新 62%

SpaceDG: Benchmarking Spatial Intelligence under Visual Degradation

SpaceDG: 在视觉退化下评估空间智能的基准测试

Xiaolong Zhou, Yifei Liu, Ziyang Gong, Jiarui Li, Qiyue Zhao, Muyao Niu, Yuanyuan Gao, Le Ma, Xue Yang, Hongjie Zhang, Zhihang Zhong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Electronic Science and Technology of China(电子科技大学) Chongqing University(重庆大学) The University of Tokyo(东京大学) Beihang University(北航) Northwestern Polytechnical University(西北工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SpaceDG,首个针对退化感知空间理解的大型数据集,通过物理基础的退化合成引擎生成9种退化类型,评估多模态大语言模型在视觉退化下的空间推理能力,并展示在退化条件下微调可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17100 2026-06-29 eess.IV 版本更新 50%

TG-OT: Topology-guided CCTA-IVUS registration via optimal transport matching

TG-OT: 基于最优传输匹配的拓扑引导CCTA-IVUS配准

R. L. M. van Herten, José P. Henriques, R. Nils Planken, Joost Daemen, Eline M. J. Hartman, Jolanda J. Wentzel, Johannes C. Paetzold, Ivana Išgum

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出TG-OT框架,通过集成训练的特征检测器和基于不平衡Sinkhorn最优传输损失的拓扑圆柱配准,实现CCTA与IVUS的全自动配准,无需预分割,在47例数据上取得高精度。

Comments Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态Agent 1 篇

2509.03704 2026-06-29 cs.CV 版本更新 57%

QuantV2X: A Fully Quantized Multi-Agent System for Cooperative Perception

QuantV2X:一种用于协同感知的全量化多智能体系统

Seth Z. Zhao, Huizhi Zhang, Zhaowei Li, Juntong Peng, Anthony Chui, Zewei Zhou, Zonglin Meng, Hao Xiang, Zhiyu Huang, Fujia Wang, Ran Tian, Chenfeng Xu, Bolei Zhou, Jiaqi Ma

机构 * UCLA(加州大学洛杉矶分校) UW-Madison(威斯康星大学麦迪逊分校) NCSU(北卡罗来纳州立大学) Purdue University(普渡大学) UC Berkeley(加州大学伯克利分校) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 提出首个全量化多智能体系统QuantV2X,通过端到端量化策略同时降低计算负载和传输带宽,在低比特约束下达到与全精度相当的精度,并显著降低延迟、提升mAP30。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态训练与对齐 8 篇

2603.03710 2026-06-29 cs.CV cs.AI 版本更新 84%

MPFlow: Multi-modal Posterior-Guided Flow Matching for Zero-Shot MRI Reconstruction

MPFlow: 多模态后验引导的流匹配用于零样本MRI重建

Seunghoi Kim, Chen Jin, Henry F. J. Tregidgo, Matteo Figini, Daniel C. Alexander

机构 * 1 Hawkes Institute, UCL \, 2 Dept. of Medical Physics Biomedical Engineering, UCL 3 Dept. of Computer Science, UCL 4 Centre for AI, DS\&AI, AstraZeneca, UK

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出MPFlow框架,利用自监督预训练PAMRI学习跨模态共享表示,在推理时通过数据一致性和特征对齐引导采样,减少幻觉并提升零样本MRI重建效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01588 2026-06-29 cs.LG cs.AI 版本更新 83%

Spectral Text Fusion: A Frequency-Aware Approach to Multimodal Time-Series Forecasting

频谱文本融合:一种频率感知的多模态时间序列预测方法

Huu Hiep Nguyen, Minh Hoang Nguyen, Dung Nguyen, Hung Le

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划) Deakin University(迪金大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI

AI总结 提出SpecTF框架,通过频谱分解将文本信息与时间序列在频域融合,利用轻量级交叉注意力机制自适应重加权频带,显著提升多模态时间序列预测性能。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08668 2026-06-29 eess.SP 版本更新 82%

Beyond Information Redundancy: Expanding Cross-Modal Knowledge Representation for Power Load Time Series Forecasting

PrismNet:通过多模态棱镜解读时间序列以实现可解释的电力负荷预测

Yuxuan Chen, Shuo Dai, Ruoyi Xu, Haipeng Xie

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multi-modal(abstract)

AI总结 PrismNet通过多模态增强模块和PID引导的多模态对比学习,提升电力负荷预测的可解释性与少样本学习能力,在实际数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26629 2026-06-29 cs.LG 版本更新 82%

Context-specific Credibility-aware Multimodal Fusion with Conditional Probabilistic Circuits

基于条件概率电路的上下文特定可信感知多模态融合

Pranuthi Tenali, Sahil Sidheekh, Saurabh Mathur, Erik Blasch, Kristian Kersting, Sriraam Natarajan

机构 * Department of Computer Science , TU Darmstadt(德累斯顿技术大学计算机科学系) Air Force Research Lab(空军研究实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 提出C$^2$MF框架,利用条件概率电路建模实例级源可靠性,通过KL散度度量上下文特定信息可信度,在跨模态冲突下提升预测准确率高达29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20196 2026-06-29 cs.AI 版本更新 79%

Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning

面向选择性多模态大语言模型遗忘的良性记忆遗忘

Zhen Zeng, Leijiang Gu, Zhangling Duan, Feng Li, Cees G. M. Snoek, Meng Wang, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型隐私泄露问题,提出S-MLLMUn Bench基准和SMFA框架,实现精确删除敏感知识同时保持模型基础能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22709 2026-06-29 cs.CV cs.AI 版本更新 62%

Gated Relational Alignment via Confidence-based Distillation for Efficient VLMs

基于置信度蒸馏的门控关系对齐用于高效视觉语言模型

Yanlong Chen, Amirhossein Habibian, Luca Benini, Yawei Li

机构 * Department of Information Technology(信息科技系) Electrical Engineering, ETH Zurich, Zurich, Switzerland(电气工程,苏黎世联邦理工学院,苏黎世,瑞士) Qualcomm AI Research, Amsterdam, the Netherlands(高通人工智能研究,阿姆斯特丹,荷兰) Department of Electrical, Electronic and Information Engineering(电气、电子与信息工程系) University of Bologna, Bologna, Italy(博洛尼亚大学,博洛尼亚,意大利) School of Electrical and Electronic Engineering(电气与电子工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出GRACE框架,通过信息瓶颈原理统一知识蒸馏与量化感知训练,使用置信度门控解耦蒸馏、关系中心核对齐和自适应控制器,在INT4量化下实现性能超越FP16基线并接近教师模型,同时显著降低内存和提升吞吐量。

Comments Accepted to the International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23951 2026-06-29 cs.CV 版本更新 57%

HunyuanImage 3.0 Technical Report

HunyuanImage 3.0 技术报告

Tencent Hunyuan Foundation Model Team

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 HunyuanImage 3.0是一种统一多模态理解与生成的自回归模型,通过精心数据整理、先进架构、原生思维链、渐进预训练和激进后训练,训练出超800亿参数MoE模型(推理时激活130亿),在文本-图像对齐和视觉质量上媲美最先进模型,并开源代码和权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19785 2026-06-29 eess.SP 版本更新 50%

Radar and Acoustic Sensor Fusion using a Transformer Encoder for Robust Drone Detection and Classification

基于Transformer编码器的雷达与声学传感器融合用于鲁棒的无人机检测与分类

Gevindu Ganganath, Pasindu Sankalpa, Samal Punsara, Demitha Pasindu, Chamira U. S. Edussooriya, Ranga Rodrigo, Udaya S. K. P. Miriya Thanthrige

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 针对无人机入侵安全问题,提出雷达与声学传感器融合的Transformer编码器方法,利用原始声学信号减少参数,在户外实验中优于现有技术。

Comments Accepted at IEEE 12$^{\text{th}}$~Moratuwa Engineering Research Conference 2026 (MERCon 2026)

Journal ref IEEE 12th Moratuwa Engineering Research Conference 2026 (MERCon 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他多模态 4 篇

2511.05708 2026-06-29 q-bio.QM 版本更新 78%

HuBMAP Data Portal: A Resource for Multimodal Spatial and Single-Cell Data of Healthy Human Tissues

HuBMAP 数据门户:健康人体组织多模态空间和单细胞数据的资源

Morgan L. Turner, Thomas C. Smits, Tiffany S. Liaw, Brendan Honick, Bill Shirey, Lisa Choy, Nikolay Akhmetov, Shaokun An, David Betancur, Dominic Bordelon, Karl Burke, Ivan Cao-Berg, John Conroy, Chris Csonka, Penny Cuda, Sean Donahue, Stephen Fisher, Derek Furst, Ed Hanna, Josef Hardi, Tabassum Kakar, Mark S. Keller, Devin Lange, Xiang Li, Yan Ma, Alison McWilliams, Austen Money, Richard Morgan, Eric Moerth, Juan Muerto, Mark A. Musen, Emily Nic, Martin J. O'Connor, Gesina Phillips, Alexander J. Ropelewski, Ryan Sablosky, Sravani Saripalli, Max Sibilla, Derek Simmel, Alan Simmons, Xu Tang, Joel Welling, Zhou Yuan, Martin Hemberg, HuBMAP Consortium, Matthew Ruffalo, Jonathan Silverstein, Philip Blood, Nils Gehlenborg

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 介绍 HuBMAP 数据门户,一个整合健康人体组织多模态空间和单细胞数据的综合平台,支持搜索、可视化和分析,并通过统一处理流程确保数据可比性。

Comments 43 pages; 8 figures; 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03269 2026-06-29 cs.AI 版本更新 57%

Distilling Answer-Set Programming Rules from LLMs for Neurosymbolic Visual Question Answering

从LLM中蒸馏答案集编程规则用于神经符号视觉问答

Thomas Eiter, Nelson Higuera Ruiz, Johannes Oetsch

机构 * Vienna University of Technology ( TU Wien )(维也纳技术大学) Jönköping University(约克灵厄普大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出从大语言模型中蒸馏答案集编程规则的方法,以可解释的方式扩展视觉问答系统的推理能力,仅需少量示例即可生成正确规则。

Comments Under consideration in Theory and Practice of Logic Programming (TPLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20239 2026-06-29 cs.RO cs.CV 版本更新 57%

Rheos: Modelling Continuous Motion Dynamics in Hierarchical 3D Scene Graphs

Rheos: 分层3D场景图中的连续运动动态建模

Iacopo Catalano, Francesco Verdoja, Javier Civera, Jorge Peña-Queralta, Julio A. Placed

机构 * University of Turku(图尔库大学) Centre for Artificial Intelligence, Zürich University of Applied Sciences(应用科学大学人工智能中心) Instituto Tecnológico de Aragón (ITA) and the University of Zaragoza(阿拉贡理工大学和萨拉戈萨大学) University of Zaragoza(萨拉戈萨大学) School of Electrical Engineering, Aalto University(艾尔沃斯大学电气工程学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Rheos框架,将连续方向运动模型嵌入分层3D场景图的动态层,通过半包裹高斯混合模型捕获多模态方向流,并采用水库采样和贝叶斯信息准则实现在线操作,优于离散基线方法。

Comments Accepted at IROS 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏