arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-24 至 2026-03-24 共收录 148 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 27 篇

2603.00431 2026-03-24 cs.CV cs.AI 81%

Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models

面向层次视觉识别的分类意识表示对齐

Hulingxiao He, Zhi Tan, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机系王轩研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出TARA方法,通过生物基础模型的层次对比学习将分类知识注入大模态模型,提升层次视觉识别中对已知和新类别的识别性能。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22158 2026-03-24 cs.LG cs.AI 80%

Multimodal Survival Analysis with Locally Deployable Large Language Models

多模态生存分析与可本地部署的大语言模型

Moritz Gögl, Christopher Yau

机构 * University of Oxford(牛津大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI;multi-modal(comments)

AI总结 本文提出利用可本地部署的大语言模型进行多模态生存分析,结合临床文本、表格数据和基因组数据,通过教师-学生蒸馏和原理化的多模态融合,实现校准的生存概率估计和简洁的诊断文本生成,优于标准基线并在隐私和准确性方面表现更优。

Comments NeurIPS 2025 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21562 2026-03-24 cs.CV 79%

Exploring Multimodal Prompts For Unsupervised Continuous Anomaly Detection

探索多模态提示用于无监督连续异常检测

Mingle Zhou, Jiahui Liu, Jin Wan, Gang Li, Min Li

机构 * Key Laboratory of Computing Power Network(计算能力网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超算中心),齐鲁工业大学(山东科学院)) Shandong Provincial Key Laboratory of Computing Power Internet(山东省计算能力互联网重点实验室) Service Computing, Shandong Fundamental Research Center for Computer Science(服务计算,山东省计算机基础研究中心) Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出基于多模态提示的无监督连续异常检测框架,通过持续多模态提示记忆库和缺陷语义引导自适应融合机制提升检测精度与鲁棒性,实验表明在MVTec AD和VisA数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21108 2026-03-24 cs.LG cs.AI 79%

DMMRL: Disentangled Multi-Modal Representation Learning via Variational Autoencoders for Molecular Property Prediction

DMMRL:通过变分自编码器进行解耦多模态表示学习以进行分子性质预测

Long Xu, Junping Guo, Jianbo Zhao, Jianbo Lu, Yuzhong Peng

机构 * Guangxi Key Lab of Human-machine Interaction and Intelligent Decision(广西人机交互与智能决策重点实验室) Nanning Normal University(南宁师范大学) College of Big Data and Software Engineering(大数据与软件工程学院) Zhejiang Wanli University(浙江万里大学)

专题命中 多模态训练与对齐 :multi-modal(title);cross-modal(abstract);分类 cs.AI

AI总结 本文提出DMMRL,通过变分自编码器解耦分子表示为共享和私有潜在空间,提升可解释性和预测性能,实验验证其在七个基准数据集上的优越表现。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13677 2026-03-24 cs.CV cs.AI cs.LG cs.MM 78%

HeCoFuse: Cross-Modal Complementary V2X Cooperative Perception with Heterogeneous Sensors

HeCoFuse: 跨模态互补V2X协作感知与异构传感器

Chuheng Wei, Ziye Qin, Walter Zimmer, Guoyuan Wu, Matthew J. Barth

机构 * College of Engineering, Center for Environmental Research and Technology, University of California at Riverside(加州大学河滨分校工程学院、环境研究与技术中心) School of Transportation and Logistics, Southwest Jiaotong University(西南交通大学交通运输与物流学院) Chair of Robotics, Artificial Intelligence and Real-time Systems, TUM School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算机、信息与技术学院机器人、人工智能与实时系统教授职位)

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI、cs.MM

AI总结 HeCoFuse提出一种统一框架,通过通道和空间注意力机制实现异构传感器下的跨模态特征融合,提升协作感知的可靠性与性能,实验显示其在TUMTraf-V2X数据集上达到43.22%的3D mAP,优于基线方法。

Comments Ranked first in CVPR DriveX workshop TUM-Traf V2X challenge. Accepted by ITSC2025

Journal ref Proceedings of the 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC), pp. 1214-1221, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21754 2026-03-24 cs.CV cs.AI 62%

Let's Think with Images Efficiently! An Interleaved-Modal Chain-of-Thought Reasoning Framework with Dynamic and Precise Visual Thoughts

让我们高效地用图像思考!一种具有动态和精确视觉思维的交错模态推理框架

Xu Liu, Yongheng Zhang, Qiguang Chen, Yao Li, Sheng Wang, Libo Qin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DaP-ICoT框架,通过动态视觉思维整合和精确视觉思维引导,解决传统ICoT方法中视觉思维位置固定和表示不连贯的问题,提升推理效率和效果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21232 2026-03-24 cs.CV cs.AI 62%

QMoP: Query Guided Mixture-of-Projector for Efficient Visual Token Compression

QMoP:基于查询的混合投影器用于高效的视觉令牌压缩

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

机构 * East China Normal University(华东师范大学) Li Auto Inc(Li汽车公司)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出QMoP框架,通过三种协作分支实现视觉令牌的自适应压缩,结合查询引导路由和专家融合机制,提升效率并减少资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17685 2026-03-24 q-bio.QM cs.AI cs.CV cs.LG 62%

Dual-Path Knowledge-Augmented Contrastive Alignment Network for Spatially Resolved Transcriptomics

双路径知识增强对比对齐网络用于空间解析转录组学

Wei Zhang, Jiajun Chu, Xinci Liu, Chen Tong, Xinyue Li

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DKAN网络,通过整合组织病理图像和基因表达谱,利用生物信息学方法预测空间解析基因表达,解决现有方法在生物上下文利用不足、依赖示例检索和模态对齐不充分的问题。

Comments AAAI 2026 Oral, extended version

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(15), 12807-12815. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05264 2026-03-24 cs.CV cs.AI 62%

SGDFuse: SAM-Guided Diffusion Model for High-Fidelity Infrared and Visible Image Fusion

SGDFuse: 基于SAM的扩散模型用于高保真红外与可见图像融合

Xiaoyang Zhang, jinjiang Li, Guodong Fan, Yakun Ju, Linwei Fan, Jun Liu, Alex C. Kot

机构 * School of Computer Science(计算机科学学院) Business University, Yantai, China(烟台商学院) College of Computer and Data Science(计算机与数据科学学院) Fuzhou University, Fuzhou, China(福州大学) School of Computing and Mathematical Sciences(计算与数学科学学院) University of Leicester, Leicester, United Kingdom(莱斯特大学) School of Computing and Artificial Intelligence(计算与人工智能学院) Director of the Rapid-Rich Object Search Laboratory(快速丰富对象搜索实验室主任) NTU-PKU Joint Research Institute, Nanyang Technological University, Singapore(NTU-PKU联合研究机构,新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SGDFuse,通过结合SAM的高阶语义先验与扩散模型的高保真生成能力,解决红外与可见图像融合中的语义盲问题,提升图像质量和下游任务性能。

Comments Published in Information Fusion

Journal ref Information Fusion, 2026: 104290

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21999 2026-03-24 cs.CV 57%

STENet: Superpixel Token Enhancing Network for RGB-D Salient Object Detection

STENet:基于超像素令牌增强的RGB-D显著目标检测网络

Jianlin Chen, Gongyang Li, Zhijiang Zhang, Liang Chang, Dan Zeng

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Yunnan Key Laboratory of Service Computing, Yunnan University of Finance and Economics(云南财经大学服务计算重点实验室) Innovation Academy for Microsatellites of Chinese Academy of Science(中国科学院微卫星创新院) Institute for Urban Governance, Shanghai University(上海大学城市治理研究院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 STENet通过引入超像素进行跨模态交互,解决RGB-D显著目标检测中注意力机制复杂度高和局部细节提取有限的问题,提出全局增强模块和局部精修模块以提升特征表示。

Comments 12 pages, 8 figures, accepted by IEEE TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21820 2026-03-24 cs.CV 57%

Beyond Strict Pairing: Arbitrarily Paired Training for High-Performance Infrared and Visible Image Fusion

超越严格配对:用于高性能红外和可见图像融合的任意配对训练

Yanglin Deng, Tianyang Xu, Chunyang Cheng, Hui Li, Xiao-jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(Surrey 大学视觉、语音和信号处理中心)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文挑战严格配对训练范式,提出任意配对训练范式,通过丰富跨模态关系提升红外和可见图像融合性能,实验证明其在数据有限情况下可达到与大规模数据集相当的性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21660 2026-03-24 cs.CV 57%

OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical Imaging

OmniFM:迈向模态鲁棒且任务无关的联邦学习 for 异质医学影像

Meilin Liu, Jiaying Wang, Jing Shan

机构 * School of Software, Shenyang University of Technology(沈阳理工大学软件学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 OmniFM提出一种统一训练分类、分割、超分辨率、视觉问答和多模态融合的联邦学习框架,通过频域洞察提升跨模态一致性,实现任务无关和模态鲁棒的联邦学习。

Comments Accepted by CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21528 2026-03-24 cs.CV 57%

PEARL: Geometry Aligns Semantics for Training-Free Open-Vocabulary Semantic Segmentation

PEARL:几何对齐语义以实现无训练的开放词汇语义分割

Gensheng Pei, Xiruo Jiang, Xinhao Cai, Tao Chen, Yazhou Yao, Byeungwoo Jeon

机构 * Department of Electrical and Computer Engineering, Sungkyunkwan University(苏州市立大学电气与计算机工程系) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 PEARL提出一种无训练的开放词汇语义分割方法,通过几何对齐和文本感知拉普拉斯传播,在不增加复杂度的情况下实现高效分割。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20811 2026-03-24 cs.CV 57%

Lean Learning Beyond Clouds: Efficient Discrepancy-Conditioned Optical-SAR Fusion for Semantic Segmentation

在云之外的高效学习:基于光- SAR融合的语义分割框架

Chenxing Meng, Wuzhou Quan, Yingjie Cai, Liqun Cao, Liyan Zhang, Mingqiang Wei

机构 * School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出EDC框架,通过三流编码器和Discrepancy-Conditioned Hybrid Fusion机制提升光- SAR融合的效率和鲁棒性,实验显示在M3M-CR和WHU-OPT-SAR数据集上mIoU提升0.56%和0.88%,参数量减少46.7%。

Comments 14 page, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10568 2026-03-24 cs.CV 57%

UniStitch: Unifying Semantic and Geometric Features for Image Stitching

UniStitch:统一语义与几何特征用于图像拼接

Yuan Mei, Lang Nie, Kang Liao, Yunqiu Xu, Chunyu Lin, Bin Xiao

机构 * CQUPT(中国科学技术大学紫金学院) PolyU NTU(国立台湾大学) NUS(新加坡国立大学) BJTU(北京交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出UniStitch框架,通过融合语义和几何特征提升图像拼接性能,采用Neural Point Transformer和Adaptive Mixture of Experts模块实现特征融合,实验表明其显著优于现有方法。

Comments Project Page: http://mmelodyy.github.io/projects/unistitch

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12984 2026-03-24 cs.CG cs.CV cs.GR cs.LG math.OC 57%

VoroLight: Learning Voronoi Surface Meshes via Sphere Intersection

VoroLight: 通过球体相交学习Voronoi表面网格

Jiayin Lu, Ying Jiang, Yumeng He, Yin Yang, Chenfanfu Jiang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 VoroLight通过球体相交损失促进可控的Voronoi退化,实现平滑的表面重建,保留Voronoi的拓扑一致性与凸性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20680 2026-03-24 q-bio.NC cs.LG 50%

Hierarchical Multiscale Structure-Function Coupling for Brain Connectome Integration

层次化多尺度结构-功能耦合用于脑连接组整合

Jianwei Chen, Zhengyang Miao, Wenjie Cai, Jiaxue Tang, Boxing Liu, Yunfan Zhang, Yuhang Yang, Hao Tang, Carola-Bibiane Schönlieb, Zaixu Cui, Du Lei, Shouliang Qi, Chao Li

机构 * School of Medicine, University of Dundee, UK(邓迪大学医学院) School of Science and Engineering, University of Dundee, UK(邓迪大学科学与工程学院) College of Medicine and Biological Information Engineering, Northeastern University, China(东北大学医学院与生物信息工程学院) College of Medical Informatics, Chongqing Medical University, China(重庆医科大学医学信息学院) School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院) Chinese Institute for Brain Research, China(中国脑科学研究院) Department of Applied Mathematics and Theoretical Physics, University of Cambridge, UK(剑桥大学应用数学与理论物理系) Department of Clinical Neurosciences, University of Cambridge, UK(剑桥大学临床神经科学系)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本文提出层次化多尺度结构-功能耦合框架,通过联合学习结构和功能连接组的模块化组织与层级耦合,提升脑连接组整合效果,验证了其在预测脑年龄、认知分数和疾病分类中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16127 2026-03-24 cs.RO cs.SY eess.SY 50%

Reactive Slip Control in Multifingered Grasping: Hybrid Tactile Sensing and Internal-Force Optimization

多指抓取中的反应滑移控制:混合触觉感知与内部力优化

Théo Ayral, Saifeddine Aloui, Mathieu Grossard

机构 * Université Grenoble Alpes, CEA, Leti(格勒诺布尔大学、CEA、LETI) Université Paris-Saclay, CEA, List(巴黎-萨克雷大学、CEA、LIST)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出一种结合学习触觉滑移检测与模型内部力控制的混合方法,用于多指抓取的稳定控制,通过触觉反馈实现快速滑移检测与力优化,实验验证了在外部扰动下的抓取稳定性。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 10 篇

2603.21944 2026-03-24 cs.CV 83%

Group3D: MLLM-Driven Semantic Grouping for Open-Vocabulary 3D Object Detection

Group3D: 基于多模态大语言模型的开放词汇3D目标检测语义分组

Youbin Kim, Jinho Park, Hogun Park, Eunbyung Park

机构 * Department of Artificial Intelligence, Sungkyunkwan University(成均馆大学人工智能系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 其他多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 Group3D通过将语义约束整合到实例构建过程中,解决多视角开放词汇3D目标检测中的几何过合并问题,实现语义与几何一致性融合的检测框架。

Comments 24 pages, 7 figures, Project page: https://ubin108.github.io/Group3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17487 2026-03-24 cs.CV 79%

Downscaling Intelligence: Exploring Perception and Reasoning Bottlenecks in Small Multimodal Models

智能下放:探索小型多模态模型中感知与推理的瓶颈

Mark Endo, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文研究小型多模态模型中感知与推理能力的瓶颈,通过分析LLM容量下降对多模态能力的影响,提出视觉提取调优方法,提升效率与性能。

Comments CVPR 2026, website at https://web.stanford.edu/~markendo/projects/downscaling_intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22182 2026-03-24 cs.RO 78%

Cross-Modal Reinforcement Learning for Navigation with Degraded Depth Measurements

跨模态强化学习用于退化深度测量的导航

Omkar Sawant, Luca Zanatta, Grzegorz Malczyk, Kostas Alexis

机构 * Department of Engineering Cybernetics, Norwegian University of Science and Technology (NTNU)(工程 cybernetics 部,挪威科学技术大学(NTNU))

专题命中 其他多模态 :cross-modal(title,abstract)

AI总结 本文提出利用深度和灰度图像互补信息的跨模态学习框架,通过跨模态一致性学习共享潜在表示,实现深度退化下的鲁棒导航。

Comments Accepted to the 24th European Control Conference (ECC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22031 2026-03-24 cs.RO 78%

MEVIUS2: Practical Open-Source Quadruped Robot with Sheet Metal Welding and Multimodal Perception

MEVIUS2:实用开源四足机器人,具备金属焊接与多模态感知

Kento Kawaharazuka, Keita Yoneda, Shintaro Inoue, Temma Suzuki, Jun Oda, Kei Okada

机构 * Department of Mechano-Informatics, Graduate School of Information Science and Technology, The University of Tokyo(机械信息学系,信息科学与技术研究生院,东京大学)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 MEVIUS2是首个基于电子商务服务可订购的开源四足机器人,采用金属焊接与加工技术实现坚固结构,集成LiDAR和高动态范围相机实现多模态感知,能有效应对复杂地形。

Comments Accepted to IEEE Robotics and Automation Practice, Website - https://haraduka.github.io/mevius2-hardware/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21032 2026-03-24 stat.AP stat.ME 78%

Integrative Predictor-Dependent Learning of Network Data and Spatially Correlated Nodal Attributes for Multimodal Brain Imaging in Aging

整合预测依赖学习网络数据与空间相关节点属性以研究衰老的多模态脑成像

Jose Rodriguez-Acosta, Sharmistha Guha, Jessica Bernard, Thamires Magalhaes, Kaitlin McOwen

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 本文提出一个预测依赖的联合建模框架,用于多受试者共享节点的网络数据,结合空间坐标和空间相关节点属性,通过整合结构性和功能性信息,研究脑连接模式与衰老相关预测变量的关系。

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21629 2026-03-24 cond-mat.mtrl-sci 71%

Tailoring dispersion and evanescent modes in multimodal nonlocal lattices using positive-only interactions

在多模非本地晶格中利用单向相互作用定制色散和衰减模式

Lucas Rouhi, Christophe Droz

专题命中 其他多模态 :multimodal(title)

AI总结 本文提出一种基于插值的框架,通过设定频率-波数点来定制非本地晶格的色散关系,实现对波行为的局部可控,同时确保正实刚度参数和被动机械行为。

Comments Preprint also available on HAL: https://hal.science/hal-05330430

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21054 2026-03-24 cs.LG cs.AI cs.MM 62%

Harmful Visual Content Manipulation Matters in Misinformation Detection Under Multimedia Scenarios

在多媒体场景中,有害视觉内容操纵对虚假信息检测的重要性

Bing Wang, Ximing Li, Changchun Li, Jinjin Chi, Tianze Li, Renchu Guan, Shengsheng Wang

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学高级技术学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出一种新颖的多模态虚假信息检测方法,通过捕捉视觉内容操纵特征和意图特征,提升虚假信息检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21067 2026-03-24 stat.ME 50%

A Bayesian Framework for Quantifying Association Between Functional and Structural Data in Neuroimaging

一种用于量化神经影像中功能与结构数据关联的贝叶斯框架

Sakul Mahat, Sharmistha Guha, Jessica Bernard

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种贝叶斯框架,用于量化神经影像中功能与结构数据的关联,通过构建功能脑网络并结合层次贝叶斯模型,实现对不同数据结构的适应性和后验不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20992 2026-03-24 cs.RO 50%

Geometrically Plausible Object Pose Refinement using Differentiable Simulation

基于可微模拟的几何合理物体姿态细化

Anil Zeybek, Rhys Newbury, Snehal Dikhale, Nawid Jamali, Soshi Iba, Akansel Cosgun

机构 * Monash University(墨尔本大学) Honda Research Institute(本田研究院) Technical University of Munich(慕尼黑技术大学) Physical AI(物理AI)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文提出结合可微物理模拟、可微渲染和视觉-触觉传感的多模态姿态优化方法,提升空间准确性和物理一致性,实验表明在初始估计准确和高初始不确定性下,显著优于标准ICP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01377 2026-03-24 cs.HC cs.CE 50%

From Sustainable Materials to User-Centered Sustainability: Material Experience in Art Healing

从可持续材料到以用户为中心的可持续性:材料体验在艺术疗愈中的作用

Yuxin Zhang, Fan Zhang, Zihao Song, Chao Zhao

专题命中 其他多模态 :multimodal(abstract)

AI总结 研究通过水凝胶基材开发可持续材料,探讨从材料可持续性到用户中心可持续性的转变,重点在于通过材料体验实现艺术疗愈。发现美学属性对艺术疗愈影响最大,其次是内在属性,而物理属性影响较小,并提出材料体验框架以系统理解材料特性。

Journal ref IASDR 2025: Design Next (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏