Dual IMU System for Accurate Gastrointestinal Motility Tracking
用于精确胃肠道动力跟踪的双IMU系统
专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 eess.SP
AI总结 该研究针对单IMU系统易受伪影干扰的问题,提出双IMU系统,结合传感器融合算法可有效区分胃肠道动力与身体运动,实现精确胃肠道动力跟踪。
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
用于精确胃肠道动力跟踪的双IMU系统
专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 eess.SP
AI总结 该研究针对单IMU系统易受伪影干扰的问题,提出双IMU系统,结合传感器融合算法可有效区分胃肠道动力与身体运动,实现精确胃肠道动力跟踪。
从关键点到预测分布:YOLO-Pose模型的事后不确定性
专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV
AI总结 本研究针对YOLO-Pose模型未量化空间不确定性的问题,提出轻量级事后概率扩展方法,结合校准诊断与AKP的评估协议,经COCO实验验证其在关键点可靠性排序等任务中有效,并在飞机着陆场景得到应用。
PRISM:非结构化环境中用于漫游车导航的多模态地形映射
机构 * SnT, University of Luxembourg(卢森堡大学安全、可靠性和信任跨学科中心) ; Department of Automation and Systems Engineering, Universidad de Málaga, Andalucía Tech(马拉加大学自动化与系统工程系,安达卢西亚技术大学)
专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO
AI总结 研究针对非结构化环境中漫游车导航问题,提出PRISM多模态感知系统,利用定制传感器套件和OmniUnet网络,经新数据集验证及现场实验,可在资源受限设备上高效生成可通行性地图,实现漫游车自主导航。
用于高精度定位的蜂窝信号构建卷积视觉Transformer
专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 eess.SP
AI总结 针对复杂蜂窝环境中定位难题,提出混合卷积视觉Transformer(ConViT)架构,整合CNNs局部感受野与Transformer全局注意力,评估多种信号融合策略,经实验验证其性能显著优于基准模型,且有较低参数数量和计算复杂度,还具备可解释性。
一种用于眼部活体检测的双流挑战-响应协议
专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV
AI总结 针对眼部生物识别面临的复杂呈现攻击,提出时空亮度传感器融合协议,构建同步矩阵评估相关生物延迟,通过蒙特卡罗模拟证明理论可分离性及多轮挑战设计的优势,为眼部和虹膜生物识别动态欺骗防御提供理论框架。
Comments 6 pages, 2 figures. Simulation-based theoretical framework; human-subject validation identified as future work
机载辅助惯性导航中的闭环与开环卡尔曼滤波器架构
机构 * Airbus Central Research and Technology(空客中央研究与技术中心) ; Department of Engineering Cybernetics, Norwegian University of Science and Technology(挪威科技大学工程 cybernetics 系)
专题命中 机器人多传感器融合 :information fusion(abstract);分类 cs.RO
AI总结 研究闭环与开环卡尔曼滤波器架构在机载辅助惯性导航中的性能影响,用标准惯性机制和直接位置辅助评估,通过模拟展示不同传感器误差下两种架构的权衡。
Comments 6 pages, 6 figures, submission to IEEE Navicon
基于自适应质量估计的缆绳悬挂载荷运输的分散几何控制
机构 * MassRobotics
专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO
AI总结 提出GPAC四层分层架构,通过隐式协调实现多四旋翼无中心协调运输缆绳悬挂载荷,结合几何控制、自适应质量估计和CBF安全滤波,仿真显示低计算成本下平均跟踪误差33.8厘米。
Comments Accepted to be presented at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
MIL-LC:一种鲁棒的磁力计-惯性-LiDAR融合多模态定位框架
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ; Centre for Advanced Robotics Technology Innovation (CARTIN)(先进机器人技术创新中心)
专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO
AI总结 提出MIL-LC框架,融合磁力计、惯性和LiDAR,解决GNSS缺失、几何重复或无纹理环境下的定位问题,通过磁地图与LiDAR退化检测实现鲁棒定位。
解耦语义与几何基础:面向语言条件模仿学习的空间视觉提示
机构 * Tsinghua University(清华大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; National University of Singapore(新加坡国立大学)
专题命中 机器人多传感器融合 :feature-level fusion(abstract);分类 cs.RO
AI总结 提出SVP-IL解耦架构,通过视觉语言基础模型将指令解析为零样本几何掩码,生成空间视觉提示并注入连续动作生成器,在低数据条件下显著提升语言条件模仿学习的成功率。
Viking Hill数据集:用于森林场景检测与分割的激光雷达-雷达-相机数据集
机构 * Örebro University(奥雷布罗大学) ; AASS research centre(AASS研究中心) ; Robot Navigation and Perception Lab(机器人导航与感知实验室)
专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO
AI总结 提出首个包含4D成像雷达的森林多传感器数据集,通过MinkowskiUNet实现雷达与激光雷达点云的语义分割,并评估树干分割质量与树木尺寸的关系。
Comments 33 pages, 11 figures
通过视觉和触觉进行推理时策略引导
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO
AI总结 提出ViTaL框架,通过视觉采样验证和触觉引导扩散编辑的双层优化,在推理时引导机器人策略,显著提升接触丰富操作任务的成功率。
基于注意力的缺失模态鲁棒预测模型
机构 * Simon Fraser University(西蒙菲莎大学) ; RBC Borealis
专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO
AI总结 提出一种基于条件变分自编码器和Transformer的多模态模型,通过注意力机制学习统一固定维度的表示,在训练和推理中处理缺失模态,在人类轨迹预测和机器人操作预测任务上优于现有方法。
Comments Work originally done in 2023
极端波前控制工具包(XWCTk):地基与空间日冕仪的高对比度成像仪器控制
专题命中 机器人多传感器融合 :sensor fusion(abstract)
AI总结 本文介绍专为MagAO-X ExAO仪器开发的XWCTk软件,基于低延迟工具链,可实现仪器控制、数据保存与压缩,适配地基及未来空间高对比度成像仪器,支持远程操作与自动化开发。
Comments Presented at SPIE Astronomical Telescopes + Instrumentation 2026
用于天气模拟的多传感器对齐
机构 * Indian Institute of Science(印度科学研究所)
专题命中 机器人多传感器融合 :sensor fusion(abstract)
AI总结 研究针对自动驾驶车辆在恶劣天气下的感知问题,提出参考数据集对齐方法和统一天气编辑方法进行多传感器对齐,经实验验证方法有效,能提升3D目标检测模型在不同天气下的鲁棒性。
用于DIY无人机研究的飞行控制、遥测和视频流的嵌入式固件开发
专题命中 机器人多传感器融合 :sensor fusion(abstract)
AI总结 针对低成本无人机,基于双核ESP32-S3微控制器设计优化固件,利用内核任务分配、零拷贝缓冲区等技术,实现飞行控制、遥测和视频传输,经实验评估能提供精确稳定支持,助力DIY项目和研究。
Comments 6 pages, 12 figures, Pre-print
基于生理信号的深度时间建模与集成融合多模态情感识别
机构 * Howard University(霍华德大学)
专题命中 机器人多传感器融合 :sensor fusion(abstract)
AI总结 本研究评估LSTM、TCN和Transformer在WESAD数据集上的多模态情感识别性能,通过消融实验和传感器级早期融合,并采用晚期融合集成策略,最终集成方法达到98.91%准确率和98.56%宏F1分数。
Comments Accepted for publication in the 17th ACM International Conference on Bioinformatics, Computational Biology and Health Informatics (ACM BCB 2026). DOI: https://doi.org/10.1145/3807503.3819363
利用混合几何注意力推进异构医学数据上的多模态融合
机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) ; RoentGen Health(伦琴健康公司) ; Deakin University(迪肯大学) ; University of Central Florida(中佛罗里达大学) ; Queensland University of Technology(昆士兰科技大学) ; Murdoch University(莫道克大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract);分类 cs.CV
AI总结 针对异构医学数据多模态融合难题,提出CURE框架,通过HyFuse层及相关模块逐步整合模态,有效捕捉跨模态交互,降低计算成本,在多数据集上评估显示其性能显著提升,优于领先方法。
Comments ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)
用于动作质量评估的具有自适应对齐的两阶段多模态融合
机构 * Tsinghua University(清华大学) ; Beihang University(北京航空航天大学) ; Children’s Hospital, Capital Institute of Pediatrics(首都儿科研究所附属儿童医院) ; Zhongguancun Laboratory(中关村实验室)
专题命中 音视频/视觉语言融合 :multi-modal fusion(title,abstract);分类 cs.CV
AI总结 研究动作质量评估问题,提出两阶段多模态融合框架DualAlign,通过自适应对齐解决跨模态错位等挑战,引入MM-JDM数据集,实验表明该框架在多模态评估中表现出色,相比现有方法有显著提升且在特定条件下稳健。
Comments Accepted to IJCV
CRUISE:面向鲁棒自动驾驶的视觉语言模型引导的不确定性感知跨模态传感器融合
机构 * University of California, Irvine(加利福尼亚大学欧文分校)
专题命中 音视频/视觉语言融合 :sensor fusion(title,abstract)
AI总结 针对现有不确定性感知融合方法泛化性差的问题,提出CRUISE框架,结合VLM引导的UQ模块与动态自适应机制,实现鲁棒的自动驾驶跨模态传感器融合。
TIER-MoE:用于生物医学分类多模态融合的、基于条件模态风险的信任感知专家路由
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
AI总结 该研究提出TIER-MoE风险引导子空间混合专家模型,用于生物医学分类多模态融合,可提升预测性能与概率校准,在多数据集上优于现有最优方法且具备强零样本泛化能力。
分离、细化、整合:用于情感分析的多模态融合分解
机构 * National Technical University of Athens(雅典国立技术大学) ; Athena Research Center(雅典娜研究中心) ; University of Bern(伯尔尼大学) ; Archimedes AI(阿基米德人工智能公司) ; Synaptic Bloom PBC(突触绽放有限责任公司)
专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)
AI总结 研究情感分析中的多模态融合问题,提出SeRIn方案,通过分离特定模态与跨模态路径,各自细化演变,将跨模态交互推迟到预测步骤,在CH - SIMS和CMU - MOSEI上取得领先成果。
Vortex: 面向智能视频检索的多模态融合系统
机构 * University of Science, VNU-HCM(越南国立大学胡志明市理科大学) ; Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市)
专题命中 音视频/视觉语言融合 :multi-modal fusion(title);分类 cs.CV
AI总结 提出Vortex系统,融合自适应关键帧提取、多模态元数据生成及混合检索策略(CLIP与SigLIP2的倒数秩融合),结合Rocchio反馈和多阶段时序搜索,在比赛中取得优异成绩。
Comments SOICT 2025
少即是多:通用AIGC音频-视频检测的模态解耦
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; University of Agder(阿格德大学)
专题命中 音视频/视觉语言融合 :feature-level fusion(abstract);decision-level fusion(abstract);分类 cs.CV
AI总结 针对通用AIGC音频-视频检测,现有方法假设不总成立,本文提出DAV-Det系统,通过决策级融合独立建模各模态取证证据,视觉和音频检测器分别利用多粒度表示及门控双分支架构,在挑战赛中排名第一。
Comments First place in the General AIGC Audio-Video Detection Challenge at the IJCAI-ECAI 2026 DDL 2.0 Workshop
用于文本引导医学图像分割的定位注入视觉语言语义融合
机构 * Air Force Engineering University(空军工程大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; University of Sydney(悉尼大学) ; Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)
专题命中 音视频/视觉语言融合 :information fusion(abstract);feature-level fusion(abstract);分类 cs.CV
AI总结 研究针对文本引导医学图像分割,提出LoG框架,通过联合执行多尺度目标定位任务,实现三级定位注入语义融合,在三个基准数据集实验中表现出色,优于现有医学图像分割方法。
用于通用跨模态行人重识别的双空间模态一致性学习
机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) ; School of Humanities and Social Sciences, Beihang University(北京航空航天大学人文与社会科学高等研究院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Informatics, Xiamen University(厦门大学信息学院)
专题命中 音视频/视觉语言融合 :visible-infrared(abstract);分类 cs.CV
AI总结 提出DSMCL即插即用框架,联合建模空间与频域一致性,在5个数据集的17项协议上提升跨模态ReID基线性能,适配多样化异构模态场景。
用于鲁棒多模态意图识别的自适应模态可靠性诊断与恢复
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM
AI总结 提出PRIME闭环可靠性引导框架,通过诊断恢复多模态意图识别的不可靠模态,在保持干净数据性能的同时提升了多模态数据各类退化场景下的鲁棒性。
基于多模态可穿戴设备的嗅觉诱导唤醒-效价维度情感识别
专题命中 音视频/视觉语言融合 :hybrid fusion(abstract);分类 eess.SP
AI总结 针对现有嗅觉情感研究的维度失衡与多模态数据不足问题,构建多模态嗅觉情感数据集,提出STF-HFNet模型,在两个数据集上取得最优情感识别准确率。
从费舍尔信息视角理解和克服多模态异常检测中的跨模态融合偏差
机构 * Northeastern University(东北大学) ; CATL(宁德时代)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 该研究针对多模态异常检测中被忽视的跨模态融合偏差问题,提出即插即用框架UCFB,经实验验证在多种设置下均实现性能提升。
HyperClaim:用于视频虚假信息检测的细粒度跨模态超图推理
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM
AI总结 HyperClaim是一种用于视频虚假信息检测的判别式时间超图框架,通过细粒度跨模态超图推理,在FactGuard协议下的三个数据集上准确率优于基线方法。
Comments 13 pages, including supplementary material
基于配准的光谱融合用于未配准的WLI/NBI内镜病灶分割
机构 * The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院) ; School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院) ; School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 针对未配准的WLI/NBI内镜病灶分割问题,提出可靠性感知复域融合框架,通过拓扑正则化特征对应与可靠性引导的选择性融合,提升病灶分割性能。
Comments 11 pages