arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2026-04-16 至 2026-04-16 共收录 5 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 1 篇

2604.13236 2026-04-16 cs.CV cs.AI eess.IV 62%

SemiFA: An Agentic Multi-Modal Framework for Autonomous Semiconductor Failure Analysis Report Generation

SemiFA:一种用于自主半导体故障分析报告生成的代理多模态框架

Shivam Chand Kaushik

机构 * School of Artificial Intelligence and Data Engineering (SAIDE)(人工智能与数据工程学院) Indian Institute of Technology Jodhpur(印度理工学院贾尔普尔)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV、eess.IV

AI总结 SemiFA通过多代理语言图框架实现自主生成半导体故障分析报告,利用多模态数据融合提升根因分析精度,首次整合SECS/GEM设备 telemetry 进行自动化报告生成。

Comments 11 pages, 6 figures, 8 tables. Dataset available at https://huggingface.co/datasets/ShivamChand/SemiFA-930. Code available at https://github.com/Shivamckaushik/SemiFA

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 融合架构与评测 4 篇

2604.13714 2026-04-16 cs.CE 78%

An End-to-end Building Load Forecasting Framework with Patch-based Information Fusion Network and Error-weighted Adaptive Loss

一种基于碎片信息融合网络和误差加权自适应损失的端到端建筑负载预测框架

Hang Fan, Ying Lu, Weican Liu, Dunnan Liu, Xiaotao Chen, Shengwei Mei

专题命中 融合架构与评测 :information fusion(title,abstract)

AI总结 本文提出端到端建筑负载预测框架,通过碎片信息融合网络和误差加权自适应损失提升预测精度,解决复杂时间依赖性和高波动性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14025 2026-04-16 cs.CV cs.AI cs.GR 57%

Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

前馈3D场景建模:以问题为导向的视角

Weijie Wang, Qihang Cao, Sensen Gao, Donny Y. Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, Jianfei Cai, Jia-Wang Bian, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学) ETH Zurich(苏黎世联邦理工学院) University of Tübingen(图宾根大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。

Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13867 2026-04-16 gr-qc astro-ph.CO hep-ph hep-th 50%

Robust parameter inference for Taiji via time-frequency contrastive learning and normalizing flows

为Taiji探测器开发鲁棒参数推断方法:通过时频对比学习和归一化流

Tian-Yang Sun, Bo Liang, Ji-Yu Song, Song-Tao Liu, Shang-Jie Jin, He Wang, Ming-Hui Du, Jing-Fei Zhang, Xin Zhang

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文提出一种结合时频多模态融合编码器和对比学习的鲁棒参数推断框架,用于Taiji探测器中的大质量黑洞双星参数推断,通过生成高保真合成瞬态数据提升训练效率,验证了深度学习在空间引力波观测中的有效性。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13241 2026-04-16 cs.CE 50%

Early-Warning Learner Satisfaction Forecasting in MOOCs via Temporal Event Transformers and LLM Text Embeddings

通过时间事件Transformer和LLM文本嵌入在MOOCs中进行学习者满意度预警预测

Anna Kowalczyk, Jakub Kowalski

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 本文提出TET-LLM框架,结合时间事件Transformer、LLM嵌入和短文本主题分布,通过早期信号预测学习者满意度,实验表明其在7天预警范围内RMSE为0.82,AUC为0.77。

详情

展开后加载摘要…

URL PDF HTML 收藏