《计算机应用》唯一官方网站 ›› 2026, Vol. 46 ›› Issue (9): 2800-2808.DOI: 10.11772/j.issn.1001-9081.2025081035
• 人工智能 • 上一篇
收稿日期:2025-09-09
修回日期:2026-03-18
接受日期:2026-03-20
发布日期:2026-04-22
出版日期:2026-09-10
通讯作者:
张平
作者简介:崔伟(1983—),男,四川自贡人,高级工程师,硕士研究生,主要研究方向:人工智能、物联网基金资助:
Wei CUI1, Ping ZHANG1(
), Zhuoling XIAO2, Zhuohang CHEN3
Received:2025-09-09
Revised:2026-03-18
Accepted:2026-03-20
Online:2026-04-22
Published:2026-09-10
Contact:
Ping ZHANG
About author:CUI Wei, born in 1983, M. S. candidate, senior engineer. His research interests include artificial intelligence, internet of things.Supported by:摘要:
传统语义同时定位与建图(SLAM)系统依赖全量数据进行训练,难以适应开放环境中的新类别识别,且仅构建稀疏地图,语义表达能力有限,难以支持复杂的人机交互。因此,提出一种基于视觉SLAM的增量式语义建图系统。该系统在ORB-SLAM3(Oriented FAST and Rotated BRIEF SLAM 3.0)框架中引入稠密建图线程,并融合所设计的DAISS(Depth Attention Incremental Semantic Segmentation)语义分割模型,实现同步定位与语义建图。其中,DAISS模型采用双分支编码器和注意力蒸馏机制,以提升新旧类别分割精度。在NYU Depth V2数据集上的实验结果显示,该系统的平均精度(MA)、平均交并比(MIoU)分别达到了61.0%和47.5%,相较于SATS(Self-Attention Transfer for continual Semantic segmentation)模型,分别提高60.9%和48.9%,具备良好的增量学习能力和语义感知性能。
中图分类号:
崔伟, 张平, 肖卓凌, 陈卓航. 基于视觉SLAM的增量式语义建图系统[J]. 计算机应用, 2026, 46(9): 2800-2808.
Wei CUI, Ping ZHANG, Zhuoling XIAO, Zhuohang CHEN. Incremental semantic mapping system based on visual SLAM[J]. Journal of Computer Applications, 2026, 46(9): 2800-2808.
| 阶段 | OA | MA | MIoU |
|---|---|---|---|
| Session_0 | 95.482 0 | 89.731 5 | 80.930 6 |
| Session_1 | 94.906 2 | 89.278 8 | 78.512 7 |
| Session_2 | 94.418 2 | 84.769 8 | 75.077 9 |
| Session_3 | 90.987 8 | 83.761 5 | 71.717 8 |
| Session_4 | 88.937 1 | 82.185 9 | 68.582 2 |
| Session_5 | 87.062 6 | 82.180 4 | 66.405 2 |
表1 在PASCAL VOC 2012数据集上的分割测试结果 (%)
Tab. 1 Segmentation test results on PASCAL VOC 2012 dataset
| 阶段 | OA | MA | MIoU |
|---|---|---|---|
| Session_0 | 95.482 0 | 89.731 5 | 80.930 6 |
| Session_1 | 94.906 2 | 89.278 8 | 78.512 7 |
| Session_2 | 94.418 2 | 84.769 8 | 75.077 9 |
| Session_3 | 90.987 8 | 83.761 5 | 71.717 8 |
| Session_4 | 88.937 1 | 82.185 9 | 68.582 2 |
| Session_5 | 87.062 6 | 82.180 4 | 66.405 2 |
| 模型 | 模态 | MIoU | OA | MA |
|---|---|---|---|---|
| SATS[ | RGB | 31.9 | 37.9 | |
| SATS* | RGB+Depth | 24.6 | 66.0 | 28.8 |
| Dformer-S[ | RGB+Depth | 14.1 | 80.1 | 16.9 |
| HN-network[ | RGB+Depth | 33.5 | 62.9 | 56.0 |
| CompL[ | RGB+Depth | 31.6 | — | — |
| DAISS | RGB+Depth | 80.3 |
表2 NYU Depth V2数据集上的模型定量对比 (%)
Tab. 2 Quantitative comparison of models on NYU Depth V2 dataset
| 模型 | 模态 | MIoU | OA | MA |
|---|---|---|---|---|
| SATS[ | RGB | 31.9 | 37.9 | |
| SATS* | RGB+Depth | 24.6 | 66.0 | 28.8 |
| Dformer-S[ | RGB+Depth | 14.1 | 80.1 | 16.9 |
| HN-network[ | RGB+Depth | 33.5 | 62.9 | 56.0 |
| CompL[ | RGB+Depth | 31.6 | — | — |
| DAISS | RGB+Depth | 80.3 |
| 类别 | IoU/% | Acc/% | 类别 | IoU/% | Acc/% |
|---|---|---|---|---|---|
| wall | 56.7 | 74.3 | mirror | 43.8 | 57.0 |
| floor | 69.6 | 81.8 | sofa | 59.9 | 74.1 |
| cabinet | 77.9 | 88.0 | books | 53.4 | 73.9 |
| chair | 51.7 | 67.0 | TV | 37.5 | 51.6 |
| window | 40.2 | 52.5 | paper | 22.0 | 31.0 |
| bookshelf | 40.6 | 53.5 | towel | 25.8 | 32.9 |
| picture | 46.9 | 69.3 | ceiling | 22.9 | 29.9 |
| curtain | 8.3 | 10.5 | 平均 | 44.0 | 56.6 |
表3 SUN RGB-D数据集的15个基础类0阶段语义分割定量结果
Tab. 3 Quantitative results of Session_0 semantic segmentation of 15 basic categories of SUN RGB-D dataset
| 类别 | IoU/% | Acc/% | 类别 | IoU/% | Acc/% |
|---|---|---|---|---|---|
| wall | 56.7 | 74.3 | mirror | 43.8 | 57.0 |
| floor | 69.6 | 81.8 | sofa | 59.9 | 74.1 |
| cabinet | 77.9 | 88.0 | books | 53.4 | 73.9 |
| chair | 51.7 | 67.0 | TV | 37.5 | 51.6 |
| window | 40.2 | 52.5 | paper | 22.0 | 31.0 |
| bookshelf | 40.6 | 53.5 | towel | 25.8 | 32.9 |
| picture | 46.9 | 69.3 | ceiling | 22.9 | 29.9 |
| curtain | 8.3 | 10.5 | 平均 | 44.0 | 56.6 |
| 模型 | 基础模型 | 模态 | MIoU | OA |
|---|---|---|---|---|
| FuseNet[ | CNN | RGB-D | 37.3 | 76.3 |
| D-CNN[ | CNN | RGB-D | 42.0 | — |
| SATS[ | Transformer | RGB | 35.5 | 68.2 |
| SATS* | Transformer | RGB-D | 40.4 | 74.5 |
| Dformer-L[ | Transformer | RGB-D | ||
| DAISS | Transformer+CNN | RGB-D | 44.0 | 75.7 |
表4 SUN RGB-D数据集上的模型定量对比 (%)
Tab. 4 Quantitative comparison of models on SUN RGB-D dataset
| 模型 | 基础模型 | 模态 | MIoU | OA |
|---|---|---|---|---|
| FuseNet[ | CNN | RGB-D | 37.3 | 76.3 |
| D-CNN[ | CNN | RGB-D | 42.0 | — |
| SATS[ | Transformer | RGB | 35.5 | 68.2 |
| SATS* | Transformer | RGB-D | 40.4 | 74.5 |
| Dformer-L[ | Transformer | RGB-D | ||
| DAISS | Transformer+CNN | RGB-D | 44.0 | 75.7 |
| [1] | 黄泽霞,邵春莉. 深度学习下的视觉SLAM综述[J]. 机器人, 2023, 45(6): 756-768. |
| Huang Zexia, Shao Chunli. Survey of visual SLAM based on deep learning [J]. Robot, 2023, 45(6): 756-768. | |
| [2] | Wang T, Dhiman V, Atanasov N. Inverse reinforcement learning for autonomous navigation via differentiable semantic mapping and planning [J]. Autonomous Robots, 2023, 47(6): 809-830. |
| [3] | Sünderhauf N, Pham T T, Latif Y, et al. Meaningful maps with object-oriented semantic mapping [C]// IROS 2017. Piscataway: IEEE, 2017: 5079-5085. |
| [4] | Campos C, Elvira R, Gómez Rodríguez J J, et al. ORB-SLAM3: An accurate open-source library for visual, visual-inertial and multi-map SLAM [J]. IEEE Transactions on Robotics, 2021, 37(6): 1874-1890. |
| [5] | Ma L, Stückler J, Kerl C, et al. Multi-view deep learning for consistent semantic mapping with RGB-D cameras [C]// IROS 2017. Piscataway: IEEE, 2017: 598-605. |
| [6] | Su H, Maji S, Kalogerakis E, et al. Multi-view convolutional neural networks for 3D shape recognition [C]// ICCV 2015. Piscataway: IEEE, 2015: 945-953. |
| [7] | McCormac J, Handa A, Davison A, et al. SemanticFusion: dense 3D semantic mapping with convolutional neural networks [C]// ICRA 2017. Piscataway: IEEE, 2017: 4628-4635. |
| [8] | 徐陈,周怡君,罗晨. 动态场景下基于光流和实例分割的视觉SLAM方法[J]. 光学学报, 2022, 42(14): No.1415002. |
| Xu Chen, Zhou Yijun, Luo Chen. Visual SLAM method based on optical flow and instance segmentation for dynamic scenes [J]. Acta Optica Sinica, 2022, 42(14): No.1415002. | |
| [9] | 华春生,郭伟豪. 动态环境下的语义视觉SLAM算法研究[J]. 辽宁大学学报(自然科学版), 2022, 49(4): 289-297. |
| Hua Chunsheng, Guo Weihao. Research on a semantic vision SLAM algorithm in dynamic environments [J]. Journal of Liaoning University (Natural Science Edition), 2022, 49(4): 289-297. | |
| [10] | Wang H, Wang J, Agapito L. Co-SLAM: joint coordinate and sparse parametric encodings for neural real-time SLAM [C]// CVPR 2023. Piscataway: IEEE, 2023: 13293-13302. |
| [11] | Natan O, Miura J. DeepIPC: deeply integrated perception and control for an autonomous vehicle in real environments [J]. IEEE Access, 2024, 12: 49590-49601. |
| [12] | Yuan B, Zhao D. A survey on continual semantic segmentation: Theory, challenge, method and application [J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024, 46(12): 10891-10910. |
| [13] | Qiu Y, Shen Y, Sun Z, et al. SATS: self-attention transfer for continual semantic segmentation [J]. Pattern Recognition, 2023, 138: No.109383. |
| [14] | Silberman N, Hoiem D, Kohli P, et al. Indoor segmentation and support inference from RGBD images [C]// ECCV 2012, LNCS 7576. Berlin: Springer, 2012: 746-760. |
| [15] | 电子科技大学. 一种基于视觉SLAM的增量式语义分割系统: CN202411755485.5[P]. 2025-04-08. |
| University of Electronic Science and Technology of China. Incremental semantic segmentation system based on visual SLAM: CN202411755485.5[P]. 2025-04-08. | |
| [16] | Xie E, Wang W, Yu Z, et al. SegFormer: simple and efficient design for semantic segmentation with Transformers [C]// NeurIPS 2021. Red Hook: Curran Associates Inc., 2021: 12077-12090. |
| [17] | Liu Z, Mao H, Wu C Y, et al. A ConvNet for the 2020s [C]// CVPR 2022. Piscataway: IEEE, 2022: 11966-11976. |
| [18] | Khudjaev N, Tsoy R, Sharif S M A, et al. Dformer: learning efficient image restoration with perceptual guidance [C]// CVPRW 2024. Piscataway: IEEE, 2024: 6363-6372. |
| [19] | Lahoud J, Ghanem B. RGB-based semantic segmentation using self-supervised depth pre-training[PP/OL]. arXiv (2020-02-06) [2024-10-05].. |
| [20] | Kanakis M, Huang T E, Brüggemann D, et al. Composite learning for robust and effective dense predictions [C]// WACV 2023. Piscataway: IEEE, 2023: 2298-2307. |
| [21] | Hazirbas C, Ma L, Domokos C, et al. FuseNet: incorporating depth into semantic segmentation via fusion-based CNN architecture [C]// ACCV 2016, LNCS 10111. Cham: Springer, 2017: 213-228. |
| [22] | Wang W, Neumann U. Depth-aware CNN for RGB-D segmentation[C]// ECCV 2018, LNCS 11215. Cham: Springer, 2018: 144-161. |
| [1] | 刘赏, 汤兆森, 刘鸿月, 董林芳, 周金. 共享语义条件下面向模态缺失的多模态情感分析模型[J]. 《计算机应用》唯一官方网站, 2026, 46(9): 2761-2768. |
| [2] | 郭晓金, 隋旭洋, 周柯男. 基于深度学习的STAR⁃RIS辅助混合场通信系统信道估计[J]. 《计算机应用》唯一官方网站, 2026, 46(8): 2548-2554. |
| [3] | 刘明, 沈东奇, 孟子洋. 双分支结构下多层次特征融合的点云配准网络[J]. 《计算机应用》唯一官方网站, 2026, 46(8): 2584-2593. |
| [4] | 刘凤春, 邵馨莹, 张春英, 王立亚, 任静. 多尺度特征优化的单目深度估计框架FCMdepth[J]. 《计算机应用》唯一官方网站, 2026, 46(8): 2603-2611. |
| [5] | 刘威, 李维刚, 田志强. 面向点云分类与分割的层次化旋转不变几何结构的表征学习方法[J]. 《计算机应用》唯一官方网站, 2026, 46(8): 2594-2602. |
| [6] | 刘新亮, 徐雨时, 李杜白, 任延昭. 基于知识图谱的问答方法综述[J]. 《计算机应用》唯一官方网站, 2026, 46(8): 2394-2410. |
| [7] | 刘晶, 赵邵泽, 刘鑫刚, 牛浩哲, 季海鹏. 跨工况下基于改进CGAN的钛合金显微组织数据生成方法[J]. 《计算机应用》唯一官方网站, 2026, 46(7): 2373-2382. |
| [8] | 凌妙根, 井瑞, 方巍. 可解释性深度学习在热带气旋预报中的应用研究综述[J]. 《计算机应用》唯一官方网站, 2026, 46(7): 2318-2326. |
| [9] | 武湘怡, 叶海良, 曹飞龙. 基于平滑-锐化图卷积的点云补全方法[J]. 《计算机应用》唯一官方网站, 2026, 46(7): 2267-2276. |
| [10] | 杜秀丽, 高星, 张校毓, 潘成胜, 邹启杰. 基于密集时空可变形注意力的视频快照压缩成像重建方法[J]. 《计算机应用》唯一官方网站, 2026, 46(7): 2288-2296. |
| [11] | 杜艺, 续明进, 孔佳仪, 王力瑶, 赵晨. 基于YOLOv11的低秩自适应参数高效微调算法[J]. 《计算机应用》唯一官方网站, 2026, 46(6): 1738-1745. |
| [12] | 熊珍凯, 徐梦军, 孙胤胤, 王鑫. 基于改进YOLOv8的复杂天气环境下海面船舶检测算法[J]. 《计算机应用》唯一官方网站, 2026, 46(6): 1998-2006. |
| [13] | 何丽丽, 曹勐, 张磊, 潘洪军, 刘义, 孙成心. 基于Kolmogorov-Arnold网络与扩散Transformer的手语生成模型[J]. 《计算机应用》唯一官方网站, 2026, 46(6): 1801-1810. |
| [14] | 盛兴, 翁孙贤, 陈扩松, 王忠平, 任芮锋, 刘勇. 基于深度学习的电网企业专利价值评估[J]. 《计算机应用》唯一官方网站, 2026, 46(5): 1468-1474. |
| [15] | 刘馨瑶, 梁军, 龙嘉濠, 颜仁梁. 基于特征融合和通道信息补偿的中草药细粒度图像分类[J]. 《计算机应用》唯一官方网站, 2026, 46(5): 1677-1683. |
| 阅读次数 | ||||||
|
全文 |
|
|||||
|
摘要 |
|
|||||