ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA
ViewMind3D:用于无需训练的3D问答的模块化视图感知推理
专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV
AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。
视觉与机器人
自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。
ViewMind3D:用于无需训练的3D问答的模块化视图感知推理
专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV
AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。
面向实时PixOOD:自动驾驶的高效异常分割
机构 * Scuola Superiore Sant’Anna(圣安娜高等学校)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV
AI总结 该研究针对自动驾驶和铁路领域,提出优化PixOOD的高效异常分割流水线,经TensorRT编译后在桌面GPU和嵌入式平台实现高帧率,解决了实时部署的计算成本问题。
Comments 12 pages, 2 figures, 3 tables. Accepted at the Efficient Deep Learning: Methods and Applications workshop, 35th International Conference on Artificial Neural Networks (ICANN 2026)
当机器人交换意义:面向协作机器人的目标导向语义通信演示
专题命中 感知 :LiDAR(abstract);分类 cs.RO
AI总结 本文提出一种机器人-边缘端语义通信测试平台,通过VQ-VAE等技术实现视觉压缩与语义建图,为协作机器人及相关6G网络研究提供了实用演示平台。
Comments 3 pages, 3 figures. This paper has been accepted for presentation as a demo paper at IEEE CSCN 2026
VCE:通过视觉对比编辑实现LVLMs的零成本幻觉抑制方法
机构 * Huazhong University of Science and Technology(华中科技大学) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究院) ; China Telecom(中国电信)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV
AI总结 本文提出VCE方法,通过分析模型对对比视觉扰动的响应,利用SVD分解激活模式以抑制幻觉倾向,有效减少多基准测试中的物体幻觉,同时保持计算效率。
Comments ICASSP 2026
Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026, pp. 16657-16661
专题命中 感知 :occupancy(abstract);分类 cs.RO
Comments IEEE-MFI 2024
Journal ref 2024 IEEE International Conference on Multisensor Fusion and Integration for Intelligent Systems (MFI), Pilsen, Czech Republic, 2024, pp. 1-8
动力学匹配物理储备池计算用于欠感知交通预测
专题命中 感知 :autonomous driving(abstract)
AI总结 本研究提出将交通网络作为储备池的IIDM-RC方法,用于欠感知交通预测,在预测准确性和训练时间上优于ESNs与LSTM网络。
Comments 16 pages, 4 figures. Has been submitted for journal publication