作者投稿和查稿 主编审稿 专家审稿 编委审稿 远程编辑

阅读排行

  • 一年内发表的文章
  • 两年内
  • 三年内
  • 全部
Please wait a minute...
  • 全选
    |
  • 计算机视觉与图形图像处理
    唐克, 魏飞鸣, 李东瀛, 郁文贤
    计算机工程. 2026, 52(3): 97-106. https://doi.org/10.19678/j.issn.1000-3428.0070085
    摘要 (1102) PDF全文 (313) HTML (139)   可视化   收藏

    针对无人机图像中小目标实例多、目标间存在遮挡所导致的漏检和误检等现象, 提出一种基于改进YOLOv8的轻量化无人机图像小目标检测算法。首先, 在颈部引入三特征编码器(TFE)、尺度序列特征融合(SSFF)模块, 增强了网络对不同尺度特征的提取能力。接着, 设计小目标检测层(SMOH), 并将其与改进的颈部特征提取网络进行融合, 在头部引入一个额外的检测头, 减小小目标特征的损失, 增强网络对小目标的识别能力。然后, 针对完整交并比(CIoU)的缺陷, 结合适应交并比(Wise-IoU)、内部交并比(Inner-IoU)和最小点距离交并比(MPDIoU), 提出了一种回归损失函数Wise-Inner-MPDIoU。最后, 为了实现算法在移动端和嵌入式场景下的轻量化应用需求, 进行了基于幅度的层自适应稀疏化剪枝, 在保证模型精度的同时进一步压缩了模型大小。实验结果表明, 相比于原YOLOv8s算法模型, 改进后的模型在mAP@0.5提高6.8百分点的同时参数量、计算量、模型大小分别降低76.4%、17.1%、73.5%, 在检测精度与轻量化方面均取得了显著提升, 具有很强的实用价值。

  • 多模态与信息融合
    李健浪, 吴新电, 陈灵, 阳波, 唐文胜
    计算机工程. 2026, 52(2): 299-310. https://doi.org/10.19678/j.issn.1000-3428.0070113
    摘要 (1044) PDF全文 (291) HTML (122)   可视化   收藏

    针对自动驾驶场景中行人和车辆的目标识别与定位问题, 提出一种四维(4D)毫米波雷达与视觉融合的CDCAM-BEV算法, 以提高目标检测的精度。首先, 设计雷达柱体网络, 将4D雷达点云编码为伪图像, 并通过正交特征变换(OFT)将单目图像转换为鸟瞰图(BEV)特征; 其次, 基于交叉注意力机制, 设计共同信息提取模块(CICAM)和差异信息提取模块(DICAM), 充分挖掘雷达和图像的公共信息和差异信息; 最后, 基于CICAM和DICAM设计BEV特征融合模块, 实现图像信息和雷达信息在BEV空间的特征级融合。在VOD数据集上进行实验, 将CDCAM-BEV算法与其他5种三维(3D)目标检测算法进行对比。实验结果表明, CDCAM-BEV在多个模式下检测性能均优于其他算法。在3D模式下, CDCAM-BEV的平均检测精度比排名第二的Part-A2高出3.65百分点; 在BEV模式下, 比排名第二的PointPillars高出5.04百分点; 在平均方向相似度(AOS)模式下, 比排名第二的Part-A2高出2.62百分点。结果显示, CDCAM-BEV在各模式下均表现出卓越性能, 能够有效融合图像和4D雷达点云特征, 显著提高目标检测的精度和可靠性。

  • 图形图像处理
    王国明, 贾代旺
    计算机工程. 2025, 51(12): 294-303. https://doi.org/10.19678/j.issn.1000-3428.0070027
    摘要 (1038) PDF全文 (453) HTML (160)   可视化   收藏

    深度学习在目标检测领域的广泛应用显著提升了对大中目标的检测能力。然而, 针对小目标检测, 由于其固有的尺度小、背景复杂等挑战, 传统的目标检测算法常常会出现漏检、误检。为了提高小目标检测的精度, 对YOLOv8模型进行研究。首先, 将主干部分的卷积模块替换为RFAConv模块, 增强了模型对于复杂图像的处理能力; 其次, 在Neck部分引入混合局部通道注意力(MLCA)机制, 能够在保持计算效率的同时, 帮助模型更高效地融合不同层次的特征; 再次, 将YOLOv8的Detect头替换为Detect_FASFF头, 以解决不同特征尺度间的一致性问题, 并增强模型对小目标的检测能力; 最后, 将完全交并比(CIoU)损失函数替换为Focaler-IoU损失函数, 使模型更关注难以精确定位的小目标。实验结果显示: 改进后的模型在小目标稀疏的FloW-Img数据集上mAP@0.5提高了4.8百分点, mAP@0.5:0.95提高了3.0百分点; 在小目标密度高的VisDrone2019数据集上, mAP@0.5提升了5.9百分点, mAP@0.5:0.95提高了4.0百分点。同时还在低空数据集AU-AIR以及行人密集检测数据集WiderPerson上做了泛化对比实验。结果表明, 优化后的模型相比较原模型在小目标检测精度上有显著提升, 且适用范围更广。

  • 大模型与生成式人工智能
    王合庆, 魏杰, 景红雨, 宋晖, 徐波
    计算机工程. 2026, 52(2): 383-392. https://doi.org/10.19678/j.issn.1000-3428.0070415
    摘要 (1017) PDF全文 (1327) HTML (93)   可视化   收藏

    大语言模型(LLM)在对话、推理和知识保留能力方面展现了显著优势, 但在处理电力领域知识密集型任务时仍面临事实准确性不足、知识更新难以及高质量领域数据集匮乏的问题。针对这些挑战, 引入一种改进的检索增强生成(RAG)策略, 该策略融合了混合检索策略和经过微调的生成模型, 提供了更高效的知识捕获和更新能力。基于对现有方法的深入分析, 针对电力领域的知识问答(QA)任务, 提出了元数据驱动的RAG框架Meta-RAG, 该框架包含数据准备、模型微调和检索推理3个阶段。数据准备阶段包括文档转换、元信息抽取与增强及文档解析模块, 在此阶段, 借助元信息的提取与增强确保了电力规范文档的高效索引和结构化处理, 并且构建了电力领域的EleQA(Electricity Question Answering)数据集, 这是一个包含19 560个问答对的电力规范问答数据集。在模型微调阶段, 通过多问题生成、思维链提示生成和监督指令微调数据集构建模块, 优化了模型在特定电力问答任务上的推理能力。在检索推理阶段则采用混合编码和重排序策略, 结合检索和生成模块, 进一步提高了答案的准确性和合理性。通过一系列实验, Meta-RAG的有效性得到验证。与Self-RAG、Corrective-RAG、Adaptive-RAG、RA-ISF等基线模型相比, Meta-RAG具有更高的回答准确率和检索命中率, 其中, 基于Qwen1.5-14B-Chat模型的Meta-RAG达到了整体准确率0.804 3, 高于其他方法。消融实验和文档召回实验结果表明文档检索对框架性能影响最大, 失去检索能力整体准确率下降了0.292 8。

  • 热点与综述
    孙丽郡, 孟繁军, 徐行健
    计算机工程. 2025, 51(11): 1-21. https://doi.org/10.19678/j.issn.1000-3428.0069543
    摘要 (907) PDF全文 (4707) HTML (125)   可视化   收藏

    在教育信息化持续推进的背景下, 构建精准且高效的课程知识图谱已成为推动教育个性化发展的关键任务之一。课程知识图谱作为一种结构化的知识表示模型, 旨在揭示课程内容与学习目标之间的复杂关联关系, 以优化教育资源配置, 并为学习者定制个性化的学习路径。围绕课程知识图谱的构建技术进行探讨, 首先阐述知识图谱、教育知识图谱、课程知识图谱的基本概念及其之间的内在联系与显著差异; 其次深入剖析课程知识图谱构建的关键技术, 涵盖课程本体设计、实体抽取、关系抽取等方面, 并对其发展历程、特点及局限性展开详细分析与总结; 再次, 探讨课程知识图谱在学习资源推荐、学习者画像建模和多模态课程知识图谱构建等场景中的应用价值; 最后, 聚焦于课程知识图谱在构建过程中所面临的难题, 如数据多样性和异构性、知识图谱质量难以评估以及多课程交叉融合不足等, 从深度学习、大语言模型(LLM)等前沿技术的角度出发, 对未来的发展趋势进行展望。

  • 前沿观点与综述
    许旻辰, 屈丹, 司念文, 彭思思, 陈雅淇
    计算机工程. 2026, 52(5): 60-80. https://doi.org/10.19678/j.issn.1000-3428.0070287
    摘要 (815) PDF全文 (390) HTML (62)   可视化   收藏

    实现及时有效的虚假信息检测有助于遏止虚假信息传播, 降低社会危害。目前已有大量深度学习方法被用于虚假信息检测, 总结现有研究的检测原理和检测范式对于明确技术优化方向至关重要。因此, 结合虚假信息检测的原理和实现路径对现有研究进行全面综述, 并首次对大语言模型在该领域的应用进行总结对比。首先, 介绍虚假信息检测任务的相关概念, 并汇总分析常用虚假信息检测数据集的数据结构; 然后, 根据检测原理和实现方式, 分别介绍如何通过语义特征表示、辅助任务设计、内部知识推断和事实核查来检测文本和多模态虚假信息, 将其细化为10个子类别, 并总结分析各个子类别检测方法的潜在特性; 最后, 对基于深度神经网络和大语言模型的虚假信息检测范式进行总结, 对比两种检测范式的代表性方法在7个虚假信息检测数据集中的检测性能, 并归纳大语言模型检测虚假信息的优势和局限性, 展望大语言模型给虚假信息检测领域带来的机遇与挑战, 为后续研究提供参考。

  • 大模型与生成式人工智能
    余滔, 董军
    计算机工程. 2026, 52(5): 336-348. https://doi.org/10.19678/j.issn.1000-3428.0070301
    摘要 (795) PDF全文 (349) HTML (54)   可视化   收藏

    在多智能体博弈仿真中, 大语言模型(LLM)的性能已经被广泛研究, 但其在模糊任务目标或不确定性环境中引导多智能体合作的决策能力往往出现"失灵"现象。针对这一问题, 提出一种基于分布式贝叶斯推断的多层级协同决策框架。该框架集成了决策、互评、监管三大功能模块, 利用多个LLM进行协同决策, 并在空间囚徒困境博弈中进行了实验验证。实验结果表明, 该框架有效克服了LLM在模糊任务环境下的决策瓶颈, 成功促进了多智能体合作行为的涌现。此外, 通过对不同实验场景下模型决策能力的量化评估, 发现模型的决策误差与模型规模不呈线性关系。在模糊任务指令下, LLaMA3(70×109)模型的决策误差较LLaMA3(8×109)模型高出16.6%, 较LLaMA2(7×109)模型高出7.2%, 表明在更复杂的环境中, 单纯依赖模型规模的扩大未能显著提升决策性能。相反, LLM协同决策在提升决策一致性和有效性方面显示出显著优势。这些结果揭示了多模型协同在复杂决策环境中的关键作用, 并为未来在不确定性任务下的智能体系统设计提供了重要参考。

  • 前沿观点与综述
    秦颖鑫, 张可佳, 潘海为, 巨亚昊
    计算机工程. 2026, 52(2): 46-68. https://doi.org/10.19678/j.issn.1000-3428.0069826
    摘要 (780) PDF全文 (343) HTML (93)   可视化   收藏

    深度学习引领人工智能蓬勃发展, 被广泛用于计算机视觉, 在图像识别、目标检测、目标跟踪、人脸识别等复杂任务上取得了突破性进展和显著的成果, 展现出其卓越的识别和预测能力。但深度学习模型的脆弱性和漏洞也逐渐暴露, 以卷积神经网络为代表的深度学习技术对精心设计的对抗样本极为敏感, 容易对模型的安全性和隐私性造成影响。首先, 总结对抗攻击的概念、对抗样本产生的原因以及相关术语, 概述数字域和物理域中几类经典的对抗攻击策略, 对其优缺点进行分析; 其次, 专注计算机视觉, 从数字域和物理域两个方面分别总结目标检测、人脸识别、目标跟踪、单目深度估计、光流估计中对抗攻击的最新研究进展以及常用于研究的各种数据集, 简单介绍现阶段对抗样本的防御和检测方法, 归纳对抗样本防御和检测方法的优缺点, 阐述不同视觉任务对抗样本防御的应用实例; 最后, 基于对抗攻击方法的总结, 探索并分析现有计算机视觉对抗攻击的不足和挑战。

  • 前沿观点与综述
    廖勇, 韩小金, 刘金林, 汪浩
    计算机工程. 2026, 52(3): 41-61. https://doi.org/10.19678/j.issn.1000-3428.0069925
    摘要 (777) PDF全文 (339) HTML (94)   可视化   收藏

    人工智能在诸多领域的应用取得了突破性的进展, 引起了全球各国对其研发的高度重视。然而, 人工智能的快速发展也带来了一系列的问题, 过度依赖和盲目信任人工智能模型可能导致严重的风险。因此, 可解释人工智能成为构建可信、透明的智能系统的关键要素, 其研发变得尤为迫切。为此, 本文综述可解释人工智能的国内外研究进展, 从多维度、多层次进行全面梳理与归纳。首先, 基于当前行业内的研究成果, 将可解释人工智能的关键技术细分为解释模型、解释方法、安全测试及实验验证4类, 旨在明确各领域的技术焦点与发展方向。然后, 探讨可解释人工智能在多个关键行业领域的具体应用实例, 包括但不限于教育、医疗、金融、自动驾驶及司法等, 展示其在提升决策透明度等方面的重要作用。最后, 深入剖析可解释人工智能当前面临的主要技术挑战, 并展望其未来的发展趋势, 尤其针对当前备受瞩目的大模型可解释性问题, 进行了专项调研与探讨分析。

  • 前沿观点与综述
    李沂杨, 陆声链, 王继杰, 陈明
    计算机工程. 2026, 52(4): 62-81. https://doi.org/10.19678/j.issn.1000-3428.0069312
    摘要 (759) PDF全文 (415) HTML (75)   可视化   收藏

    在目标检测领域, 卷积神经网络(CNN)凭借其优异的准确性和可扩展性, 长期主导着相关研究, 并获得了学术界的广泛认可。在此框架下, 先后涌现出基于区域的卷积神经网络(R-CNN)系列(如Fast R-CNN、Faster R-CNN)与YOLO(You Only Look Once)系列等多个代表性模型。随着Transformer在自然语言处理领域的成功, 研究者开始探索将其用于计算机视觉领域, 由此产生了视觉Transformer(ViT)和Swin Transformer等视觉骨干网络。Facebook团队为减少目标检测任务中的先验知识和后处理, 在2020年推出了一种端到端目标检测算法——基于Transformer的DETR(DEtection TRansformer)。尽管DETR在目标检测领域展现出潜力, 但也存在收敛速度慢、准确性较差、目标查询的物理意义不明确等缺点。这促使研究者对该算法开展了进一步的研究和改进。本研究旨在归纳总结针对DETR的改进探索, 并分析它们的优势与不足, 同时对利用DETR开展的前沿研究和细分应用领域进行概括, 最后给出DETR在计算机视觉领域的未来展望。

  • 多模态与信息融合
    王永旗, 王雷
    计算机工程. 2026, 52(6): 258-267. https://doi.org/10.19678/j.issn.1000-3428.0070508
    摘要 (755) PDF全文 (194) HTML (50)   可视化   收藏

    多模态情感识别旨在通过融合不同模态(如文本、音频、视频)的信息, 提高情感识别的准确性和鲁棒性。然而, 现有方法在处理模态间的差异性和互补性、时间序列信息的动态特征捕捉方面仍存在不足, 导致情感识别效果不佳。为了解决这些问题, 提出一种基于跨模态增强与时间步门控机制的多模态情感识别模型。首先, 该模型通过跨模态交叉注意力机制学习不同模态之间的关联性, 增强各模态特征的互补性。通过跨模态的相互作用, 模型能够更好地整合来自文本、音频和视频模态的信息, 并减少单一模态在情感表达中的不足。随后, 利用时间步门控机制对每个时间步的特征权重进行动态调整, 从而聚焦于情感信息较为关键的时间步, 提升模型的时间序列建模能力。最后, 融合后的特征被输入分类器进行情感预测。在公开的CMU-MOSEI和CMU-MOSI多模态情感识别数据集上进行实验评估, 实验结果表明, 所提模型的情感识别准确率分别达到82.41%和82.60%, 相较于ALMT和TETFN等当前主流模型, 均有显著提升。这证明了跨模态增强与时间步门控机制有效提高了模型的多模态特征融合和时间序列处理能力, 验证了该方法在多模态情感识别任务中的有效性与鲁棒性。

  • 多模态与信息融合
    苏建华, 池云仙, 许云峰, 高凯
    计算机工程. 2026, 52(3): 234-242. https://doi.org/10.19678/j.issn.1000-3428.0069955
    摘要 (668) PDF全文 (179) HTML (24)   可视化   收藏

    意图识别是自然语言理解的一项重要任务, 传统的意图识别研究主要关注于特定任务的单模态意图识别。然而, 在现实世界的场景中, 人类的意图是复杂的, 需要通过整合诸如语言、语调、表情和动作等信息来判断。提出以注意力为主的多模态融合的意图识别方法, 用于在真实世界的多模态场景中进行意图识别。为了能够捕捉和融合不同模态之间的长距离依赖关系, 自适应地调整各模态信息的重要性和提供更丰富的表示, 对每个模态特征分别使用自注意力机制。通过在每个模态的特征中添加明确的模态标识, 使模型能够区分并有效融合不同模态的信息, 提升整体理解和决策能力。考虑到在跨模态交互时文本模态信息的重要性, 使用以跨注意力机制为核心、以文本为主导其他模态辅助交互引导的多模态融合, 旨在促进文本与视觉、听觉模态之间的交互。最后对多模态意图识别的MIntRec和MIntRec2.0基准数据集进行了实验评估。结果显示, 该方法在准确性、精确度、召回率和F1值等指标上均优于现有的多模态学习方法, 比目前最好的基线方法提升0.1~0.5百分点。

  • 计算机视觉与图形图像处理
    汤伟博, 方强, 李沛根, 艾龙金, 熊金红, 夏海廷
    计算机工程. 2026, 52(4): 214-228. https://doi.org/10.19678/j.issn.1000-3428.0070151
    摘要 (610) PDF全文 (164) HTML (51)   可视化   收藏

    针对无人机(UAV)航拍图像存在的检测性能低、遮挡严重、小目标特征提取难度大及模型参数量大的问题, 提出了基于YOLOv8s的RSD-YOLO算法。首先, 设计了感受野注意力(RFA)模块CSP-RFA替代C2f模块, 以提升小目标特征提取能力, 有效应对传统卷积操作对位置变化不敏感的问题。其次, 对主干网络和特征融合网络进行了轻量化处理, 新增了大尺寸特征图检测分支, 并提出了感受野金字塔网络(RFPN), 优化特征流动方向, 增强特征表达能力。再次, 检测头模块经过优化, 将多尺度特征集成至具有多级注意力机制的检测头中, 并替换了损失函数, 提升了模型对小目标的检测性能。最后, 在模型压缩方面, 采用层自适应幅度剪枝(LAMP)算法, 进一步减少了模型的参数量和大小。实验结果表明, 轻量化后的RSD-YOLO在公开数据集VisDrone2019上较基线模型有显著提升, 精度提高了10.0百分点, mAP@0.5提升9.5百分点(增幅24.1%), mAP@0.5∶0.95提高6.9百分点(增幅29.4%)。模型参数量从11.12×106减少至4.05×106(减少63.6%), 计算量从42.7 GFLOPs降至25.5 GFLOPs(减少40%)。此外, 在仅检测遮挡小目标的新数据集上, RSD-YOLO在精度、mAP@0.5、mAP@0.5∶0.95上分别提升了9.1、16.1和10.7百分点。

  • 热点与综述
    邸钦渤, 陈劭力, 时良仁
    计算机工程. 2025, 51(11): 35-44. https://doi.org/10.19678/j.issn.1000-3428.0069780
    摘要 (607) PDF全文 (649) HTML (82)   可视化   收藏

    随着多变量时序数据在各行业中的广泛应用, 开发有效的异常检测方法对于保障系统的稳定运行和安全性变得极为关键, 由于多变量时序数据内在的复杂性和动态变化特性, 对异常检测算法提出了更高的要求。针对现有异常检测方法在处理含有复杂变量关系的高维数据时存在效率不足的问题, 提出一种基于图神经网络(GNN)与扩散模型的多变量时序数据异常检测算法GRD。通过节点嵌入和图结构学习, GRD算法能有效地捕捉和表示变量间的复杂关系, 并通过门控循环单元(GRU)和去噪扩散概率模型(DDPM)进一步提取特征, 实现了对异常数据的高精度检测。在以往的实验评估中, 大多数算法在评分前会采用点调整(PA)评估协议, 该协议会严重高估算法的检测能力。为了更准确地评估算法性能, 采用新的评估协议和评价指标。实验结果表明, GRD算法在3个公开数据集上的F1@k指标分别是0.741 4、0.801 7、0.767 1, 性能优于现有方法。特别是在高维数据处理方面, GRD算法展现出显著优势, 证明了其在现实场景的异常检测应用中的实用性和鲁棒性。

  • 热点与综述
    廖牛语, 田沄, 李岩松, 薛海峰, 杜长坤, 张国华
    计算机工程. 2025, 51(12): 1-17. https://doi.org/10.19678/j.issn.1000-3428.0253230
    摘要 (604) PDF全文 (380) HTML (107)   可视化   收藏

    近年来, 以GPT、LLaMA、Qwen、DeepSeek等为代表的大模型在自然语言处理、计算机视觉及多模态等领域取得了突破性进展。然而, 受限于其推理机制、参数规模和固有的训练数据知识等因素, 这些模型在处理复杂任务、解答专业领域问题及生成时效性内容时, 常出现答案不准确乃至事实性偏差幻觉等问题, 严重制约了其在高可靠性场景中的应用。为突破上述能力瓶颈, 工具学习范式应运而生并迅速成为研究热点, 其核心旨在使大模型理解并使用外部工具以完成特定任务。通过调用数据库、搜索引擎、数学工具等外部工具, 大模型能够超越自身参数化知识, 提升其推理、决策和执行能力, 缓解幻觉问题。本文系统综述了大模型工具学习的发展脉络与技术进展, 剖析了工具对大模型能力的扩展, 梳理了从上下文学习到微调训练的工具调用机制, 进而探讨了工具调用性能优化、自适应工具生成等关键问题, 分析了大模型工具调用的测评方法, 最后总结了当前工具学习面临的挑战并对大模型工具学习未来发展方向进行展望。

  • 前沿观点与综述
    赵翔, 黑梦哲, 李家旭, 庞宁, 陈子阳
    计算机工程. 2026, 52(6): 1-16. https://doi.org/10.19678/j.issn.1000-3428.0260356
    摘要 (563) PDF全文 (410) HTML (77)   可视化   收藏

    一般认为, 世界模型理解并表示外部世界, 同时根据当前的世界状态和动作预测世界的未来状态。大模型依靠海量的训练数据和庞大的参数规模, 拥有出众的文本知识学习、理解表示和生成能力, 例如语言大模型GPT-4、LLaMA等。近年来, 世界模型研究备受工业界和学术界的关注, 涌现出了一大批包括自动驾驶、社会模拟、具身智能和视频生成的研究和商业成果, 并且研究者将各类大模型的出色成果应用在世界模型上, 使世界模型的效果得到了进一步提升。本文对利用大模型构建的各领域世界模型进行了全面综述, 包括基于语言大模型和基于视觉大模型(VLM), 并且选取了数个重要的应用领域对相关模型进行介绍, 包括具身智能、智慧城市、社会模拟和物理环境模拟。本文首先基于大模型的模态对世界模型进行分类, 指出了基于不同模态的世界模型在功能上的不同; 随后给出了世界模型重要的开源资源和基准, 帮助相关领域的研究人员快速了解和使用世界模型; 最后对文章进行总结, 并对未来研究方向进行展望。

  • 开发研究与工程应用
    朱亚州, 杜平川, 柴志雷
    计算机工程. 2025, 51(12): 337-345. https://doi.org/10.19678/j.issn.1000-3428.0069437
    摘要 (514) PDF全文 (215) HTML (60)   可视化   收藏

    Kubernetes作为容器编排的主流工具, 可支持自动部署、服务发现以及负载均衡, 且具有高可用性、高效能的特点。然而, Kubernetes采用的最佳适应算法或最小负载法等调度策略忽略了节点的异构性和性能的差异性。此外, Kubernetes工具仅考虑CPU资源和内存资源且预先设置统一权重机制, 容易导致负载不均衡、性能下降以及无法满足精细化调度等问题。针对这些问题, 提出了一种基于多维度资源的异构任务调度(A-KCSS)算法, 该算法基于集群的异构计算资源, 增加磁盘输入/输出(I/O)、网络I/O负载以及GPU资源作为评价指标进行过滤和筛选, 更全面地考虑了node的异构性。此外, 引入一种基于多维度资源因素的权重计算模型, 依据待调度任务的资源需求, 计算待调度任务各维度资源因素的权重值, 结合集群node的实时资源利用率计算出每一个node的评分, 依据评分进行优先级排序, 并选择优先级最高的node进行调度。通过实验在Kubernetes集群上测试了A-KCSS算法的性能, 该算法与Kubernetes默认的调度算法以及Kubernetes容器调度(KCSS)算法相比, 平均响应时间分别减少10%和4%, 吞吐量分别提高30%和15%, 可用性分别提高40%和30%, 负载均衡性分别提高23%和18%, 集群的整体性能得到提高。

  • 多模态与信息融合
    于梦源, 刘向阳
    计算机工程. 2026, 52(6): 278-287. https://doi.org/10.19678/j.issn.1000-3428.0070436
    摘要 (506) PDF全文 (294) HTML (12)   可视化   收藏

    单一模态图像在全天候的船舶检测中易受光照、天气等环境影响, 导致船舶检测精度低、漏检率高。为此, 提出了一种融合可见光与红外图像信息的船舶检测方法VIF-RTDETR。该方法根据可见光图像丰富的细节和颜色信息以及红外图像在低光照环境下的稳定表现, 构建了四通道输入模型; 设计可见光与红外图像信息的融合模块VIF, 实现了不同模态信息的互补融合, 使得在检测网络中更加合理利用两种模态的信息; 在主干Backbone特征提取网络中结合通道注意力, 为通道动态分配不同的权重, 以增强通道的特征表达能力来进一步优化特征提取能力。此外, 为进一步提升船舶检测中船舶小目标的检测性能, 设计了一种加权的边界框损失函数, 使模型能够有效地关注不同尺寸目标的特征表达, 提高模型在不同目标尺寸下的检测精度。实验结果表明, 在船舶可见光和红外数据集上, 该模型的检测精度AP0.5∶0.95、AP0.5分别达到了78.3%、98.5%, 相对于单一模态的可见光和红外模型的AP0.5∶0.95分别提升了4.7、9.2百分点; 召回率AR0.5∶0.95达到了85.2%, 相对于单一模态模型分别提升了3.1、7.3百分点, 显著提高船舶的检测精度且降低漏检情况。

  • 交叉融合与工程应用
    沈明辉, 刘宇杰, 陈婧, 叶康祈, 高赫远, 刘建, 姜烨, 殷文斐, 王恺豪, 刘振宇
    计算机工程. 2026, 52(6): 326-338. https://doi.org/10.19678/j.issn.1000-3428.0070196
    摘要 (495) PDF全文 (386) HTML (36)   可视化   收藏

    印刷电路板组件(PCBA)的缺陷检测对于提高流水线生产效率具有重要影响, 而在PCBA之后的检查通常由人工完成, 容易造成人力与时间的浪费和出现漏检与误检的情况。为此, 提出一种轻量化的YOLOv8s改进算法, 该算法在有效降低模型复杂度的同时可以提高PCBA缺陷的检测精度。首先, 由于没有公开的PCBA相关数据集, 因此构建一个名为PCBA-DET的组装后PCBA缺陷检测数据集, 并对PCBA-DET进行多种方式的数据增强以模拟实际生产场景和改善数据集的平衡性。其次, 将YOLOv8s的骨干网络最后一个C2f模块替换成重参数化大核卷积网络(RepLKNet)以减少计算开销和提高模型的有效感受野, YOLOv8s的颈部网络引入P2小目标检测层和幽灵卷积以捕捉更多的细节信息, 有效降低模型参数量。实验结果表明, 在数据增强后的PCBA-DET数据集上进行评估, 均值平均精度(mAP)@0.5∶0.95和mAP@0.5与基准模型相比分别上升了2.6和0.1百分点, 但参数量和基线模型相比下降了36.8%。

  • 交叉融合与工程应用
    火久元, 李昕, 常琛, 张耀南
    计算机工程. 2026, 52(5): 430-444. https://doi.org/10.19678/j.issn.1000-3428.0070297
    摘要 (495) PDF全文 (180) HTML (31)   可视化   收藏

    滚动轴承是机械设备中的常用部件, 传统方法难以对多噪声环境下具有众多复杂特征的信号进行分类, 并且常在一维数据上通过经典深度学习模型进行故障诊断, 无法对复杂特征进行充分提取。因此, 提出一种基于ACNN-LFSwin Transformer的双通道故障诊断方法, 分别在一维数据和二维图像上进行故障诊断。首先, 对原始信号分别进行基于完全自适应指数模型分解(CEEMDAN)与短时傅里叶变换(STFT)处理, 获取模态分量(IMF)与二维图像; 然后, 在通道1中将CEEMDAN分解后的IMF送入基于注意力机制的卷积神经网络(ACNN)中进行特征提取, 在通道2中将轴承数据构成的二维图像作为局部特征提取的Swin Transformer网络(LFSwin Transformer)的输入, 进行图像特征提取; 最后, 将两通道特征进行串联融合, 以进行故障诊断, 其中, ACNN运用注意力机制对信号特征进行自动权重分配, 以强调关键特征, LFSwin Transformer模型在传统Swin Transformer的基础上进行向量转换, 将输入向量转换为图像并对其进行卷积操作, 使模型在故障局部特征提取方面更具优势。分别采用CWRU数据集和帕德博恩数据集进行实验验证, 结果表明, 该方法的故障诊断准确率达97%以上, 说明所提方法不仅能对多种故障进行精确诊断, 还能有效避免复杂噪声的干扰。

  • 交叉融合与工程应用
    王忠美, 聂芃轩, 刘建华, 吴海波, 郑良
    计算机工程. 2026, 52(8): 422-430. https://doi.org/10.19678/j.issn.1000-3428.0070483
    摘要 (490) PDF全文 (233) HTML (17)   可视化   收藏

    多传感数据融合方法能够提升轴承故障诊断的准确性, 但在电机轴承故障诊断中, 现有大多数多传感数据融合方法存在传感数据类型单一、难以充分挖掘不同模态数据间冗余性和互补性的问题。为此, 提出一种基于多约束模态不变图卷积融合网络(MCMI-GCFN)的轴承故障诊断方法。首先, 通过卷积自编码器(CAE)和挤压-激励模块(SE block)对原始电流、振动信号进行特征提取; 其次, 引入源域分类器和域鉴别器在域对抗训练的基础上捕获不同模态数据间的模态不变性, 充分挖掘多模态数据间的冗余性和互补性; 最后, 利用图卷积神经网络(GCN)的空间聚合特性捕获电流、振动模态相近时间步特征之间的依赖关系, 以精确融合其上下文语义信息。在德国帕德伯恩大学公开的轴承损伤电流、振动数据集上进行验证, 实验结果表明, MCMI-GCFN方法达到了99.6%的轴承故障诊断精度, 比非融合方法高9~11.4百分点, 验证了所提模型的有效性。

  • 开发研究与工程应用
    郑洁云, 张章煌, 宣菊琴, 魏鑫, 薛静玮
    计算机工程. 2025, 51(11): 392-402. https://doi.org/10.19678/j.issn.1000-3428.0069531
    摘要 (484) PDF全文 (127) HTML (19)   可视化   收藏

    配电网规划在电力系统中非常重要, 因为它直接影响到电力供应的可靠性、效率和经济性。良好的规划可以确保电力资源得到高效分配, 同时降低运营成本和减少电力损耗。然而, 随着电力需求的增加和系统复杂性的提升, 传统的决策方法不再适用。为提升设备选型、连接配置和电网布局的效率和可靠性, 提出一种基于知识图谱(KG)和图卷积神经网络(GCNN)的配电网智能规划方法KG-GCNN。该方法综合利用KG、图神经网络(GNN)和卷积神经网络(CNN)技术的优势, 为电力系统规划者提供一种智能化的配电网规划方法, 以更好地理解、分析和优化电力系统的设备配置、连接以及物理布局。首先, 建立电力网络的KG, 该KG包含电网的设备、属性及其相互关系, 为后续的分析和优化提供基础; 然后, 利用GNN对电力网络的结构数据进行分析, 以捕捉设备之间的关系和影响, 为设备配置和连接决策提供重要信息; 最后, 引入CNN改善电网的物理布局, 以确定电网中设备的最佳位置和连接方式, 从而提高电网的性能和可靠性。实验结果表明, 通过与决策树、支持向量机(SVM)、循环神经网络(RNN)相比, 该方法能够有效匹配电网中的复杂拓扑结构, 优化电网的物理布局。

  • 新一代网络与边缘计算
    沈丹阳, 麦文
    计算机工程. 2026, 52(5): 383-395. https://doi.org/10.19678/j.issn.1000-3428.0069677
    摘要 (471) PDF全文 (128) HTML (32)   可视化   收藏

    自动调制识别(AMR)是通信识别、态势感知和电子侦察等领域的重要环节。由于深度神经网络具有很强的特征提取和分类能力, 使得与传统检测方法相比有着更高的识别精度, 但目前常用的神经网络在提取信号时序信息时存在局限性, 包括高复杂度和低信噪比下识别精度差等问题。针对以上问题, 构建一种基于残差神经网络(ResNet)和Transformer网络(ResNet-Transformer)的决策融合识别方案, 旨在处理更复杂的信噪比情况, 并提高整体的识别准确率。该方案首先通过ResNet的时序记忆特性深度挖掘通信信号的时域特征, 然后结合Transformer网络突出的长距离依赖关系提取能力进一步提升抗噪性能, 最后使用决策融合策略根据每条支路输出得到最终判决结果。实验结果表明, 在开源数据集RML2018.01A上, 该方案在信噪比为10 dB以上时平均识别精度大于93%, 在信噪比为0时仍能保持56%的识别精度, 相比传统网络模型能取得更高的调制识别准确率并且具有良好的抗噪能力。

  • 多模态与信息融合
    张志, 尹昱凯, 孙奕灵, 孟雯锦, 彭畅
    计算机工程. 2026, 52(3): 243-254. https://doi.org/10.19678/j.issn.1000-3428.0070175
    摘要 (469) PDF全文 (137) HTML (54)   可视化   收藏

    针对Android恶意软件种类和结构繁杂不一、单一静态特征难以区分良性和恶意软件的问题, 在深入研究Android软件的权限、API、字节码、操作码等特征的基础上, 提出一种基于多模态特征融合的构建方法。将字节码转换为RGB图像, 通过预训练模型EfficientNetV2B3提取字节码图像特征, 以表征Android应用的整体特性。利用局部敏感哈希(LSH)算法提取操作码序列特征, 以表征Android应用的细节特性。采用多模态分解双线性池化(MFB)融合算法对字节码图像特征和操作码序列特征进行融合, 实现2种特征数据的异质互补, 以得到更具区分度的静态特征。在此基础上, 提出一种基于Transformer的Android恶意软件检测模型(TEAAD)。实验结果表明, 基于融合特征的TEAAD模型优于其他深度模型, 检测准确率达到96.87%, MFB特征融合方法相较于其他方法具有更高的恶意软件识别能力。

  • 前沿观点与综述
    赵莹莹, 朱率率
    计算机工程. 2026, 52(8): 84-100. https://doi.org/10.19678/j.issn.1000-3428.0252971
    摘要 (467) PDF全文 (248) HTML (23)   可视化   收藏

    知识图谱(KG)作为一种以实体为节点、关系为边的结构化语义知识表示形式, 能够精准刻画现实世界中各类事物及其复杂关联, 已成为人工智能、自然语言处理、推荐系统、智能问答等多个领域的核心支撑技术, 为机器理解语义和实现认知智能提供了重要基础。首先, 阐述知识图谱的基本概念与体系架构, 明确以"实体-关系-属性"三元组为核心的知识表示单元, 并分别剖析自顶向下和自底向上两种构建模式的适用场景与技术特点; 其次, 重点分析知识图谱构建过程中信息抽取、知识融合以及知识推理三大核心环节的技术演进, 系统梳理技术发展脉络, 并对比不同方法的优势与局限; 再次, 深入剖析DBpedia和百度两个典型知识图谱在技术路线选择上的差异, 将理论方法与实际知识图谱构建场景相结合; 最后, 总结当前知识图谱构建在数据质量、语义一致性、动态演化等方面面临的挑战, 并展望未来研究方向, 旨在为知识图谱构建的理论研究与实际应用提供全面参考, 推动该领域技术的进一步发展。

  • 大模型时代的服务计算
    张珑耀, 温东新, 马庄宇, 舒燕君, 李庆, 刘明义, 左德承
    计算机工程. 2026, 52(1): 22-32. https://doi.org/10.19678/j.issn.1000-3428.0252754
    摘要 (464) PDF全文 (195) HTML (69)   可视化   收藏

    基于大语言模型(LLM)的多智能体系统(MAS)虽在处理复杂任务方面展现出巨大潜力, 但其分布式特性与交互不确定性易引发多样化异常, 威胁系统可靠性。为系统化识别并分类此种异常, 进行全面综述。研究选取7个代表性MAS及相应数据集, 收集13 418段运行轨迹, 采用LLM初步分析与专家人工校验相结合的方法进行数据分析。构建一个涵盖模型理解感知异常、智能体交互异常、任务执行异常和外部环境异常4个层级的细粒度异常分类框架, 并结合典型案例揭示各类异常产生的内在逻辑与外部诱因。统计分析显示: 模型理解感知异常占比最高, 其中"上下文幻觉"和"任务指令误解"是主要问题; 智能体交互异常占16.8%, "信息隐瞒"是主因; 任务执行异常占27.1%, 主要表现为"决策重复出错"; 外部环境异常占18.3%, 以"记忆冲突"为主。此外, 模型理解感知异常作为根源性诱因, 引发其他层级的异常, 凸显了提升模型基础能力的重要性。此分类和根源分析旨在为构建高可靠的基于LLM的MAS提供理论支撑与实践参考。

  • 前沿观点与综述
    方仪豪, 邹丹平
    计算机工程. 2026, 52(2): 13-23. https://doi.org/10.19678/j.issn.1000-3428.0070059
    摘要 (462) PDF全文 (186) HTML (73)   可视化   收藏

    随着人工智能与机器人技术的深度融合, 多旋翼无人机在多个领域中得到了广泛应用, 展现了其灵活性和高效性。然而, 在开发和验证多旋翼无人机的飞行控制算法或解决方案时, 研究人员面临着高成本和高风险的挑战。为了降低这些风险并提高算法测试和优化的效率, 多旋翼无人机仿真平台提供了一个安全、可控的环境。首先, 介绍了多旋翼无人机的常规机型, 选取了常用的四旋翼无人机作为多旋翼无人机的代表机型, 根据不同仿真程度阐述了其动力学模型。接着, 对多旋翼无人机仿真平台的常规系统结构框架进行概述, 并探讨了其评价方式和分类方法。从功能和性能两个方面出发, 进一步细化了仿真平台的评价方式。多旋翼无人机仿真平台的分类一方面根据其是否支持交互学习环境进行划分, 另一方面依据不同侧重点, 从动力学、传感器和多机集群3个方面进行分类。然后, 回顾了现有无人机飞行任务的主要解决方案, 在传统解决方案和基于学习方式的解决方案背景下, 分析了现有的典型多旋翼无人机仿真平台。最后, 对多旋翼无人机仿真平台未来发展进行了展望。

  • 开发研究与工程应用
    许德刚, 王双臣, 尹柯栋, 王再庆
    计算机工程. 2025, 51(11): 377-391. https://doi.org/10.19678/j.issn.1000-3428.0069125
    摘要 (461) PDF全文 (105) HTML (17)   可视化   收藏

    为了解决城市车辆目标检测算法中存在检测效果差、误检漏检率高、泛化能力弱的问题, 提出一种改进YOLOv8的城市车辆目标检测算法。首先, 在主干网络尾部融入高效多尺度注意力(EMA)机制, 有助于模型更好地捕捉目标车辆的细节特征, 结合160×160像素尺寸的小目标检测层来加强对小目标的检测能力, 通过维度交互进一步聚合像素级特征, 增强对目标车辆的挖掘能力。其次, 为轻量化网络设计了一种多尺度轻量化卷积(MLConv)模块, 并基于MLConv重构了C2f模块, 提高模型的特征提取能力。最后, 为抑制低质量图像产生的有害梯度, 采用WIoU损失函数替代完全交并比(CIoU)损失函数, 优化网络的边界框损失, 提升模型的收敛速度和回归精度。在Streets车辆数据集上进行验证, 结果表明, 改进算法的mAP@0.5、mAP@0.5∶0.95和召回率相较于基准模型YOLOv8n分别提升了1.9、1.4和2.4百分点。在国内车辆数据集和VisDrone2019小目标数据集上进行验证, 改进算法的各项性能指标都有不同程度的提升, 充分证明了改进算法具有良好的泛化性和鲁棒性。与其他主流算法相比, 改进算法同样表现出了更高的准确率和召回率, 表明该算法对于城市车辆目标检测具有更好的性能。

  • 新一代网络与边缘计算
    王怡, 覃团发, 韦睿, 黄金宝
    计算机工程. 2026, 52(5): 371-382. https://doi.org/10.19678/j.issn.1000-3428.0070030
    摘要 (450) PDF全文 (75) HTML (21)   可视化   收藏

    针对偏远地区蜂窝网络覆盖不足且物联网(IoT)设备能量和计算能力低而无法满足大量延迟敏感型任务卸载和计算需求的问题, 考虑将空天地一体化网络(SAGIN)和移动边缘计算(MEC)相结合, 提出一种支持无线电力传输(WPT)技术的无人机辅助IoT设备的动态任务卸载和资源分配方案, 其中无人机负责收集IoT设备产生的计算密集型任务, 采用部分卸载模式将这些任务根据当前状态进行本地计算或动态卸载给基站和低地球轨道(LEO)卫星进一步处理。由于动态的异构网络和长期排队延迟与短期决策的耦合性, 因此在排队延迟的约束下提出一种基于Lyapunov优化的双延迟深度确定性策略梯度(TD3PG)算法, 该算法通过优化无人机动态关联、任务分配、计算资源分配和带宽分配来协调无人机学习最优卸载策略和资源分配。仿真结果表明, 所提出的动态方案与其他对比方案相比能够有效降低无人机网络的能耗、网络积压总和及平均排队延迟, 在2种学习率组合下TD3PG算法相对于深度确定性策略梯度(DDPG)算法和双重深度Q网络(DDQN)算法的奖励分别提高了13.6%、24.0%和20.4%、17.9%。

  • 计算机视觉与图形图像处理
    姜有泽, 刘向阳
    计算机工程. 2026, 52(6): 160-169. https://doi.org/10.19678/j.issn.1000-3428.0070443
    摘要 (446) PDF全文 (234) HTML (34)   可视化   收藏

    针对相同地理空间、不同时相的高分辨率遥感图像之间受季节性变化、气候、光照等干扰因素影响的问题, 提出一种基于多时相ChangeFormer的遥感图像建筑物变化检测(CD)方法。该方法使用多个不同时相的遥感图像, 将最新时相遥感图像与变化前的多个遥感图像在特征差异提取上进行不同尺度下的融合, 分别关注图像的综合语义特征以及图像之间语义信息的细节。该方法有助于减少季节、光照等因素发生变化时引起的误检。同时, 考虑变化前多个不同时相的遥感图像, 将其特征差异进行融合并引入正则化项作为损失函数, 进一步消除非建筑物变化以及建筑物非变化区域光照阴影带来的干扰, 提高模型的泛化能力。构建从农业土地耕地到建筑用地变化的三时相遥感图像数据集, 实验结果表明, 相较于目前最优的BIT方法, 多时相ChangeFormer方法在F1值、交并比(IoU)、精确率和召回率指标上分别提升了9.04%、9.87%、15.27%和3.4%, 显著提高了检测精度, 且在细节信息处理方面明显优于经典的CD方法。

  • 网络空间安全
    牛淑芬, 王宁, 周旭升, 孔维滢, 陈丽华
    计算机工程. 2026, 52(4): 302-312. https://doi.org/10.19678/j.issn.1000-3428.0070132
    摘要 (438) PDF全文 (97) HTML (34)   可视化   收藏

    联邦学习促进了不同医疗机构之间的数据共享和合作, 提高了医疗诊断、治疗和预测的准确性和效率。然而在医疗场景中, 现有联邦学习方案仍然存在安全和效率上的问题。在训练过程中, 模型参数的更新可能会间接地泄露有关本地训练数据集的信息。为了保证模型参数的机密性, 研究人员提出了各种解决方案, 例如掩码协议和差分隐私。使用掩码协议的解决方案通常不具有较高的安全性, 而使用差分隐私的解决方案则需要在准确性和隐私性之间进行权衡。为了解决上述挑战, 提出一种智慧医疗中基于秘密共享和同态加密的安全联邦学习方案。在模型训练过程中, 该方案能够有效抵御医疗云和医疗客户端对模型参数的窃取, 同时可以抵抗多个参与方的共谋攻击。最后, 通过密文验证算法, 确保模型参数在训练过程中的可验证性。安全性和性能分析结果表明, 该方案在智慧医疗场景中可以满足模型参数的机密性和完整性要求, 与现有方案相比, 在计算效率和传输效率上也有显著提升。

  • 前沿观点与综述
    王利民, 朱光辉, 吴涛
    计算机工程. 2026, 52(2): 1-6. https://doi.org/10.19678/j.issn.1000-3428.0253281
    摘要 (438) PDF全文 (182) HTML (25)   可视化   收藏

    大语言模型推动了人工智能进入以自然语言为核心的交互时代,但其在物理世界建模与复杂任务决策方面仍存在显著能力瓶颈。针对上述问题,以世界模型为核心范式,系统分析了大语言模型向决策型智能体演进的关键技术路径。首先界定了大语言模型的能力边界,阐明其在知识结构化表征、现实世界感知及高可靠性应用中的内在局限;其次从动态预测、任务驱动的选择性建模、多模态融合与物理一致性等方面,归纳了世界模型的核心内涵与关键特征;再次对数据驱动的生成式建模路径与物理先验驱动的仿真建模路径进行了系统梳理与对比,分析了世界模型在高质量交互数据获取、长期预测一致性、多模态表征统一及实时推理效率等方面面临的共性技术挑战;随后从弥补常识缺失、增强规划与决策能力及支撑具身智能发展的角度,讨论了世界模型在通向通用人工智能过程中的作用与现实局限;最后结合技术发展趋势,从大语言模型与世界模型协同融合、数据与算法协同优化、物理先验与生成式建模结合、具身智能深度耦合以及伦理与安全治理等方面,对世界模型的未来研究方向进行了系统展望。通过对世界模型技术现状的系统性分析与发展方向的前瞻性探讨,为人工智能从感知向决策的演进提供了理论与实践参考。

  • 人工智能与模式识别
    袁英华, 金英然, 高赟
    计算机工程. 2025, 51(12): 96-108. https://doi.org/10.19678/j.issn.1000-3428.0069871
    摘要 (436) PDF全文 (614) HTML (100)   可视化   收藏

    孪生跟踪网络是主流的目标跟踪框架之一,其包括骨干网络、融合网络和定位网络3个模块。对于融合网络模块,Transformer是较新且有效的融合网络实现方法。Transformer的编码器和解码器中使用自注意力机制对卷积神经网络(CNN)特征进行增强。然而,自注意力机制仅能从空间维度进行特征增强,未考虑从通道维度进行特征增强。为了使得Transformer的自注意力网络同时对特征的空间维度和通道维度进行增强,为目标定位网络提供准确的相关性信息,提出一种基于双维度特征增强的Transformer跟踪器,对Transformer融合网络进行改进。首先,采取骨干网络的第三和第四阶段特征作为输入;然后,在Transformer编码器与解码器的自注意力模块中,通过CAE-Net网络进行通道维度的特征增强,用于增强通道上的重要性,通过SAE-Net网络实现两阶段特征的加权融合与线性变换,获取自注意力因子Q、K和V;最后,通过自注意力运算实现空间维度特征增强。在5个主流的公开基准数据集上进行实验,结果表明,改进后的Transformer特征融合模块可以用极小的速度代价提升跟踪器的跟踪性能。

  • 先进计算与数据处理
    孙雯倩, 徐天辰, 余佩厚, 陈云芳, 张伟
    计算机工程. 2025, 51(12): 189-201. https://doi.org/10.19678/j.issn.1000-3428.0069804
    摘要 (434) PDF全文 (89) HTML (13)   可视化   收藏

    数据隐私保护已成为社会关注的焦点,各国和地区正在陆续制定相关的法律法规,但是由于App产品发布的隐私政策存在篇幅长、专业性强等问题,利用自动化手段检测隐私政策的合规性成为亟待解决的技术难题。作为主流解决方法的机器学习模型需要标签注释的数据集进行支撑,而国内目前缺少这样的App隐私政策数据集。在分析欧盟《通用数据保护条例》(GDPR)合规性分析相关工作的基础上,设计适合我国《个人信息保护法》的标签方案,具体包括15个要求标签,然后使用网络爬虫获取10个类别、363个App的中文隐私政策,并对这些隐私政策进行语句级划分和标注,构建包括104 134个隐私政策语句及标签组成的中文隐私政策语料库。采用百度最新开源的预训练语言模型ERNIE对语料库进行训练与测试,实验结果表明,该方案检测准确率达到85.75%。

  • 大模型时代的服务计算
    林丹, 卢顺峰, 刘姿妍, 张博昭, 何龙, 蒋子规, 吴嘉婧, 郑子彬
    计算机工程. 2026, 52(1): 1-21. https://doi.org/10.19678/j.issn.1000-3428.0253233
    摘要 (426) PDF全文 (193) HTML (55)   可视化   收藏

    区块链已逐渐发展成支撑数字经济的重要基础设施, 但其匿名性、跨链互操作性、多方参与等特征, 导致诈骗、洗钱与攻击等安全事件频发, 严重威胁生态系统的稳定与合规。尽管现有分析工具与方法在区块链服务安全领域取得了一定进展, 但仍普遍存在泛化能力不足、推理能力有限、难以适应复杂业务逻辑演化等问题。与此同时, 生成式大语言模型(LLM)的快速发展正在深刻重塑服务计算范式, 其在自然语言理解、知识推理与多模态融合等方面的优势, 为区块链服务安全研究提供了新的思路与技术路径。系统梳理LLM在事前智能合约审计、事中异常行为检测、事后多链行为关联任务中的应用进展, 归纳其优势与局限, 总结LLM赋能区块链服务安全的典型实践。最后, 展望LLM赋能区块链服务安全面临的开放科学问题与未来研究方向, 为构建可信、可解释、高效的区块链服务计算与治理体系提供参考。

  • 大模型时代的服务计算
    张俊娜, 王泓尊, 丁春涛
    计算机工程. 2026, 52(1): 33-60. https://doi.org/10.19678/j.issn.1000-3428.0252721
    摘要 (421) PDF全文 (830) HTML (59)   可视化   收藏

    后训练量化(PTQ)是一种高效的模型压缩方法, 它无需重新训练模型, 只需少量(或无需)无标签校准数据即可将高精度浮点模型的参数转换为低比特整数表示。该方法在显著降低存储与计算开销的同时能够最大限度地保留原始模型的推理精度, 因而受到学术界与工业界的广泛关注。从PTQ的量化步骤、方法分类、工具生态、应用进展4个维度, 系统总结PTQ的研究进展。首先, 构建了量化流程框架, 涵盖动态范围统计、量化参数计算、权重与激活量化、误差优化和模型生成等步骤; 其次, 提出一个完整的量化方法分类体系, 从量化粒度、位宽、校准方法到结构导向量化; 再次, 分析了支持PTQ规模化应用的工具生态, 探讨了其在硬件适配和工程部署中的应用价值; 最后, 总结了PTQ方法的融合与应用进展, 并指出PTQ方法在实践中面临的挑战, 尤其是跨模态一致性、极低比特语义崩塌与硬件适配等难题。这些实践挑战的总结不仅揭示了当前技术的局限性, 也为未来研究提供了重要方向。本综述为学术界与工业界提供了PTQ方法的参考框架, 助力推动人工智能在资源受限场景中的广泛应用。

  • 计算智能与模式识别
    张春昊, 解滨, 张佳豪
    计算机工程. 2026, 52(7): 131-142. https://doi.org/10.19678/j.issn.1000-3428.0070335
    摘要 (419) PDF全文 (90) HTML (10)   可视化   收藏

    时序数据异常检测在金融、医疗、工业监控等领域具有重要意义, 然而, 传统方法在处理时序数据时常常面临特征提取能力有限、泛化能力差且实时性不佳等挑战, 甚至忽视了数据之间的时序关系。为充分考虑数据的时间依赖性, 进一步提高时序数据异常检测能力, 提出了一种无监督时序数据异常检测方法β-VAE-BiLSTM。首先, 在重新设计变分自编码器(VAE)模块网络结构以使其更适用于数据重构异常检测任务的基础上, 通过引入超参数β控制证据下界中KL(Kullback-Leibler)散度项的权重, 从而增强编码器模块对于潜在空间的解耦性和表达能力, 获取更有力的数据潜在表示。然后, 采用双向长短期记忆网络(BiLSTM)模块估计潜在表示的长期相关性, 捕捉其前向和后向的依赖关系, 并对其进行时序预测。最后, 对预测结果进行平均融合并重构解码器, 从而计算重构误差, 通过网格搜索最优阈值来检测时序异常。实验结果表明, 该方法在多个公开时序数据集上具有优越的异常检测性能, 能够有效提取时间相关的复杂数据特征, 实现高效计算和实时异常检测, 识别异常点和异常区域, 提高了检测精确率和鲁棒性, 减少了误报和漏报。

  • 计算机视觉与图形图像处理
    张信佳, 王芳
    计算机工程. 2026, 52(2): 148-157. https://doi.org/10.19678/j.issn.1000-3428.0069729
    摘要 (416) PDF全文 (189) HTML (20)   可视化   收藏

    无人机(UAV)航拍图像中的目标通常具有尺度密集、易被遮挡且多为小目标等特点, 这导致检测过程中容易出现漏检和误检。为应对上述挑战, 基于YOLOv5s提出了针对小目标检测的SNA-YOLOv5s算法。首先, 引入空间深度转换卷积(SPD-Conv)模块替换原模型的跨步卷积层, 避免细节信息丢失, 增强小目标特征提取能力; 其次, 设计新型平均快速空间金字塔池化(AGSPPF)模块, 引入平均池化操作缓解池化层在提取特征信息的同时会导致部分信息丢失的问题, 提升模型的特征提取能力; 再次, 新增针对小目标的大尺度检测分支, 捕捉浅层特征中丰富的细节信息, 提升模型对小目标的检测能力; 最后, 将归一化注意力机制(NAM)嵌入骨干网络, 对特征信息进行加权处理, 抑制无效的特征信息。在VisDrone2019数据集和NWPU VHR-10数据集上的训练测试结果表明, 该算法的均值平均精度(mAP)分别达到了42.3%和96.5%, 与基线模型YOLOv5s相比分别提高了8.4和2.6百分点。通过与其他基于深度学习的主流模型对比实验, 进一步验证了该模型的鲁棒性和精确性。

  • 计算机视觉与图形图像处理
    黎东丰, 陈雨人, 余博
    计算机工程. 2026, 52(1): 154-165. https://doi.org/10.19678/j.issn.1000-3428.0252294
    摘要 (401) PDF全文 (125) HTML (73)   可视化   收藏

    在现有基于U-Net的路面裂缝检测方法中, 编码器各层次特征间的交互未能得到充分考虑, 容易因下采样过程中的信息丢失而导致检测结果不完整或出现漏检。为此, 提出一种基于多层次特征融合的路面裂缝检测方法。首先, 在编码阶段, 提取裂缝在不同层次上的特征, 形成从浅层到深层的裂缝特征表示; 其次, 在跳跃连接部分, 采用基于改进通道交叉Transformer(CCT)的跨层次融合策略, 增强各层次特征间的互补性, 丰富裂缝特征的表达; 最后, 在解码阶段, 通过特征融合模块优化解码器对编码器特征的利用方式, 促进裂缝特征的传递, 提高对裂缝特征的感知能力。为验证所提方法的有效性, 在DeepCrack和CRACK500 2个公开数据集上进行一系列的对比和消融实验, 结果表明, 所提方法的综合表现优于DeepCrack、Swin-UNet等6种方法, 在DeepCrack数据集上的F1值相较DeepCrack、Swin-UNet分别提高了2.30和2.51百分点, 在CRACK500数据集上则分别提高了1.65和1.00百分点。

  • 开发研究与工程应用
    张祥瑞, 谭泰, 李辉, 张建伟, 黎博文
    计算机工程. 2025, 51(12): 324-336. https://doi.org/10.19678/j.issn.1000-3428.0069621
    摘要 (390) PDF全文 (150) HTML (7)   可视化   收藏

    无人机(UAV)近距空战环境复杂, 敌机机动高速变化, 针对该环境下六自由度无人机空战自主机动决策困难的问题, 提出一种分层框架下基于双重奖励的近端策略优化(DR-PPO)无人机自主引导算法。传统深度强化学习方法在解决六自由度无人机空战任务时, 因动作空间维度高、探索空间大, 导致算法收敛速度慢甚至难以学习到决策的问题, 设计无人机空战机动决策分层框架, 将空战任务分为决策与控制两个子问题, DR-PPO算法作为决策层生成高层决策, 通过双重奖励引导无人机更好地理解正确的空战行为, 解决空战任务中奖励稀疏难以收敛的问题; 比例积分微分(PID)算法作为控制层, 生成无人机基本控制律, 将高层决策转换并输出原始控制指令, 使DR-PPO算法更专注于无人机机动决策层面, 缩短飞行控制的探索时间, 加快算法的收敛速度。仿真结果表明, 在典型的空战实验场景中, 分层框架下的DR-PPO算法能够缩短探索时间, 避免陷入局部最优, 有效引导无人机在不同态势下自主学习机动决策并快速到达优势位置, 完成空战任务, 其收敛效果与机动决策表现均显著优于传统深度强化学习方法下的DR-PPO算法及PPO算法, 有效提高了无人机作战能力, 并通过复杂多场景测试验证该算法具有良好的泛化性。

  • 移动互联与通信技术
    王华华, 黄烨霞, 李玲, 王嘉程
    计算机工程. 2025, 51(12): 255-267. https://doi.org/10.19678/j.issn.1000-3428.0069877
    摘要 (385) PDF全文 (888) HTML (60)   可视化   收藏

    在无蜂窝网络环境下实施联邦学习(FL)时, 用户调度和资源分配策略对优化系统时间开销、提升用户可达速率以及加速FL收敛速率至关重要。为解决资源分配不均的问题, 设计一种联合用户调度、CPU处理频率和功率分配的优化方案。通过最大化系统的最小用户速率来实现资源的公平分配, 并提升FL性能。联合优化问题被分解为用户调度和功率分配两个子问题。在用户调度方面, 设计基于k-means聚类的贪婪调度算法, 以综合评估用户的信道状态和数据"价值", 并将用户划分为不同的群组。随后, 针对每个群组的资源占用情况, 为组内用户制定个性化的CPU处理频率分配方案。最后, 通过在各群组中独立执行用户调度, 实现高效且精准的用户选择, 并通过提前分组有效降低用户选择的复杂度。在功率分配方面, 引入基于二分法的功率分配算法(BM-PA)。该算法不仅考虑了用户间的公平性, 还针对资源受限用户进行了优先处理, 以确保其能够获得更优质的资源分配。BM-PA算法通过低复杂度的迭代优化过程, 实现了功率分配的快速收敛, 并在保证系统性能的同时, 显著提升了资源的利用效率。合理的用户调度策略是功率分配子问题获得最优解的基础, 采用交替迭代的方法允许在每个子问题中独立进行优化, 同时考虑到另一个子问题的解。这种相互依赖的关系通过多轮迭代优化过程, 确保功率资源被合理地分配给那些最需要或最有可能有效利用它们的用户, 从而使系统整体性能得到提升, 实现联合优化求解, 显著提升系统整体性能。仿真实验结果表明, 与基准算法相比, 所提算法在下行可达速率方面, 最佳平均提升幅度高达103.34%, 在上行可达速率方面, 最佳提升幅度达到102.78%。此外, 相较于基准算法还能平均节省67.44%的FL任务训练时间, 特别是在FL学习模型精度达到90%时, 所提算法的时间开销最小。

  • 开发研究与工程应用
    谢鑫刚, 芦照烜, 梁静坤
    计算机工程. 2025, 51(12): 381-393. https://doi.org/10.19678/j.issn.1000-3428.0252199
    摘要 (382) PDF全文 (93) HTML (10)   可视化   收藏

    气候变化和海洋污染导致珊瑚礁退化, 珊瑚自动检测成为海洋生态系统监测的迫切需求, 水下珊瑚检测任务中图像对比度低、珊瑚形状复杂和生长密集等问题限制了通用检测算法的性能。针对上述问题, 提出一种基于YOLO架构的软珊瑚检测模型CoralDet。首先, 设计多路径融合模块(MPFB)来捕捉多个尺度的珊瑚特征, 针对水下不均匀光照和图像模糊现象提高模型的鲁棒性, 同时通过重新参数化来提高推理效率。其次, 引入GSConv和VoV-GSCSP轻量级设计组件, 可在不牺牲性能的情况下降低计算成本。引入一种自适应幂变换(APT)标签分配策略来动态调整锚点匹配度量, 并且使用软标签和软中心区域损失以使模型专注于高质量、对齐准确的预测。最后, 在soft-coral数据集上对CoralDet进行评估, 推理延迟仅为9.52 ms, 均值平均精度(mAP@50)达到81.9%, 超过了YOLOv5的79.9%、YOLOv6的79.4%、YOLOv8的79.5%、YOLOv9的78.3%、YOLOv10的79.5%、MambaYOLO的80.1%和RT-DETR的81.6%, 并在Coral-lwptl数据集上进行了泛化实验, CoralDet在多个关键指标上均优于MambaYOLO、YOLOv8和YOLOv10等传统模型, 结果证明了CoralDet在水下珊瑚检测方面的有效性和实用性。

  • 计算机视觉与图形图像处理
    金晶, 胡楚笛, 陈刚
    计算机工程. 2026, 52(7): 199-209. https://doi.org/10.19678/j.issn.1000-3428.0070385
    摘要 (378) PDF全文 (224) HTML (11)   可视化   收藏

    Transformer模型凭借其出色的全局信息捕获能力和强大的表示能力, 被广泛应用于医学图像分割领域, 并取得了显著成效。然而, 这些方法在对图像进行序列化时, 会将图像分割成固定大小的块, 仅提取单一尺度的全局特征, 在一定程度上割裂了图像的语义特征, 最终导致分割精度不佳。为此, 提出一种多尺度自注意力Transformer架构(MultiFormer)。首先, 采用连续卷积和下采样模块对图像进行处理; 然后, 使用多尺度卷积投影模块来替换原来的1×1投影模块; 最后, 在自注意力模块生成的特征图中引入可变形卷积。与传统Transformer图像序列化过程相比, 这种连续卷积在产生相同分辨率的特征时, 有效增大了感受野, 保留了二维(2D)图像的空间相关性, 避免固定位置和大小的图像块带来的语义信息损失。同时, 多尺度卷积投影模块利用4种不同大小的卷积核捕捉图像中的上下文信息, 并通过通道拼接实现多尺度特征融合, 反映了不同尺度下局部与局部间的注意力, 而不仅限于单一尺度, 实现了模型对不同尺度语义信息的聚合能力, 进一步减轻了语义割裂问题。此外, 可变形卷积通过引入一个额外的卷积层来学习并生成偏移场, 使得卷积核能够灵活调整其形状, 以适应图像中形态多变的病变或器官, 提升模型对复杂医学图像的处理能力。将该模块分别插入到SETR、TransUNet、TransFuse这3个网络结构中, 并在ACDC心脏数据集和ISIC 2018皮肤病变数据集上进行实验, 结果表明, Dice系数分别提升了3.63、1.06、2.30百分点和1.22、2.31、3.01百分点。MultiFormer具有即插即用性, 能够方便地集成到各种下游医学图像分析任务中。

  • 网络空间安全
    蒋翠玲, 程梓源, 俞新贵, 万永菁
    计算机工程. 2026, 52(1): 242-253. https://doi.org/10.19678/j.issn.1000-3428.0069948
    摘要 (376) PDF全文 (204) HTML (54)   可视化   收藏

    人脸深度伪造技术的滥用给社会和个人带来了极大的安全隐患, 因此深度伪造检测技术已成为当今研究的热点。目前基于深度学习的伪造检测技术在高质量(HQ)数据集上效果较好, 但在低质量(LQ)数据集和跨数据集上的检测效果不佳。为提升深度伪造检测的泛化性, 提出一种基于多尺度双流网络(MSDSnet)的深度伪造检测方法。MSDSnet输入分为空域特征流和高频噪声特征流, 首先采用多尺度融合(MSF)模块捕获不同情况下图像在空域被篡改的粗粒度人脸特征和伪造图像的细粒度高频噪声特征信息, 然后通过MSF模块将空域流和高频噪声流的双流特征充分融合, 由多模态交互注意力(MIA)模块进一步交互以充分学习双流特征信息, 最后利用FcaNet(Frequency Channel Attention Network)获取伪造人脸特征的全局信息并完成检测分类。实验结果表明, 该方法在HQ数据集Celeb-DF v2上的准确率为98.54%, 在LQ数据集FaceForensics++上的准确率为93.11%, 同时在跨数据集上的实验效果也优于其他同类方法。

  • 交叉融合与工程应用
    张惠煜, 吴佳俊, 陈庆新, 毛宁
    计算机工程. 2026, 52(8): 351-363. https://doi.org/10.19678/j.issn.1000-3428.0070458
    摘要 (370) PDF全文 (192) HTML (6)   可视化   收藏

    机场旅客到达过程存在一定的聚集性和随机性, 不平稳的到达过程很容易导致服务资源浪费。为了动态配置机场安检区的服务资源, 根据航班计划精准预测各个时间段的安检旅客流量。在安检过程中, 安检设备读取旅客证件信息, 旅客此刻已经完成了排队过程, 旅客实际到达安检区的时间早于安检时间。目前的安检流程无法记录每个旅客到达旅检区的时间。针对机场旅客量预测的研究中, 都是将旅客开始接受安检时刻替代为旅客到达安检区时刻, 忽略旅客等待安检的排队时间, 导致预测结果精确度降低。针对此问题, 提出一种基于非平稳排队模型的机场安检客流预测方法。首先, 建立具有一般分布、非平稳随机到达和服务过程的安检排队模型, 提出近似算法求解系统排队性能指标; 其次, 设计基于非平稳排队模型的启发式迭代算法, 迭代推算旅客到达时间; 最后, 基于分时段聚类-拟合方法, 建立航班旅客到达分布模型。实验结果表明, 相比现有的旅客到达时间处理方法, 推算到达时间的预测方法误差降低约15.07%, 分时段聚类-拟合方法建立的航班旅客到达分布模型在多个算例中都具有良好的预测准确性和泛用性, 在处理节假日等特殊日期的数据时, 也能够得到较精确的预测结果, 且具有较好的过量预测效果, 便于后续的服务资源配置。基于非平稳排队模型的机场安检客流预测方法可为动态配置机场安检区服务资源提供数据基础。

  • 计算机视觉与图形图像处理
    宋天泽, 曹从军, 何佳琪, 王旭升, 刘晨煜
    计算机工程. 2026, 52(5): 250-258. https://doi.org/10.19678/j.issn.1000-3428.0070106
    摘要 (370) PDF全文 (93) HTML (10)   可视化   收藏

    密集行人检测是行人检测领域的一大研究热点。针对密集行人检测场景中被遮挡目标及小目标行人易漏检的问题, 提出一种改进DETR的目标检测算法Pe-DETR。采用基于多头自注意力机制的Dino-DETR作为基准模型, 因自注意力机制缺少捕获局部特征的能力, 导致密集行人检测效果较差, 对前馈神经网络(FNN)进行改进, 设计通道注意力深度卷积前馈神经网络DWSEFNN, 使模型可以提取到更多局部细节特征。针对ResNet50骨干网络对重要特征提取效率较低的问题, 采用Swin Transformer-L作为特征提取网络, 提升骨干网络对重要特征的提取能力, 同时使Pe-DETR完全基于注意力机制搭建, 结构中不包含深度卷积结构。针对密集行人场景中目标数量多与DETR检测器中稀疏匹配的矛盾问题, 应用密集不同查询有效应对行人密集的场景, 且不会引入无效的相似查询。在CrowdHuman密集行人检测数据集上的实验结果表明, 所提行人检测算法Pe-DETR相比Dino-DETR算法的平均精度(AP)@0.5提高了3.7百分点, AP提高4.5百分点, 在密集行人检测任务中改进后Pe-DETR算法的准确率明显优于其他端到端模型。

  • 计算智能与模式识别
    李明明, 潘子豪
    计算机工程. 2026, 52(5): 150-159. https://doi.org/10.19678/j.issn.1000-3428.0070256
    摘要 (367) PDF全文 (323) HTML (13)   可视化   收藏

    传统的移动机器人路径规划算法通常需要在有地图的条件下才能有效规划路径。相比之下基于深度强化学习(DRL)的路径规划因其在无地图条件下的导航能力而备受关注。然而, 传统的DRL路径规划算法往往存在样本利用率低、训练速度慢、泛化能力不足等问题。针对上述问题, 对双延迟深度确定性(TD3)策略梯度算法进行改进以提高其在移动机器人路径规划中的性能。首先, 针对TD3算法持续探索空间能力有限的问题, 对其探索策略进行改进, 通过使用具有时间相关性的粉红噪声来增强算法的持续探索空间能力。其次, 结合n步方法和损失调整近似Actor优先(LA3P)经验回放方法, n步方法将经验回放池中的即时奖励扩展为n步的累计折扣奖励, 能够更准确地捕捉长期奖励信号, 而LA3P方法通过对n步经验的高效利用, 提高样本利用率和算法的性能。最后, 通过在Gazebo中搭建了3个不同的环境进行实验, 并和多种算法进行比较。实验结果表明, 改进算法在训练时间、平均成功率、平均距离等方面更具优势, 证明了改进算法的有效性。

  • 计算机视觉与图形图像处理
    曹继卫, 罗飞, 丁炜超
    计算机工程. 2026, 52(3): 119-127. https://doi.org/10.19678/j.issn.1000-3428.0070159
    摘要 (363) PDF全文 (142) HTML (68)   可视化   收藏

    近年来, 基于深度学习的目标检测算法在准确率和鲁棒性等方面取得了巨大进步, 并且在工业界得到广泛应用。但是, 在小目标检测领域, 当前的目标检测算法仍然存在漏检率和误检率高的问题。因此, 提出一种基于SCConv和BSAM注意力机制的YOLO小目标检测算法BS-YOLO。首先, 针对特征提取网络存在大量冗余信息的问题, 利用SCConv重构主干网络, 提出一种新的模块C3SC, 对提取到的特征图从空间和通道两个方面减少冗余信息, 提升主干网络提取到的特征图质量, 从而提高检测精度; 其次, 结合CBAM和BiFormer自注意力机制提出一种新的注意力机制BSAM, 在空间和通道两个方面合理分配权重, 使特征图更加关注有效信息, 抑制背景的干扰; 最后, 为了解决小目标检测存在的难易样本分布不均的问题, 利用Slideloss优化损失函数, 从而提高小目标检测的效果。在RSOD数据集上的实验结果表明, BS-YOLO算法的精确率为94.2%, 召回率为91.6%, 均值平均精度(mAP@0.5)为95.9%, 相对于原始的YOLOv5算法, 分别提高了3.3、0.1、3.6百分点, 表明BS-YOLO算法可以有效提高小目标检测的精度, 降低漏检率。

  • 计算机视觉与图形图像处理
    胡康源, 郭涛, 穆楠
    计算机工程. 2026, 52(6): 179-188. https://doi.org/10.19678/j.issn.1000-3428.0070181
    摘要 (362) PDF全文 (137) HTML (31)   可视化   收藏

    卷积网络在文物修复中由于卷积核的局部感受野对于全局上下文和复杂结构的理解较弱, 又因卷积操作的平移不变性对文物表面复杂的几何形态处理不充分, 在进行文物图像修复时容易出现无关结构和伪影等问题。具有自注意力机制的Transformer模型在处理文物图像的细节和局部特征时, 对特定区域的细节关注不足, 难以获取足够的深层特征, 从而影响修复的精度和细腻度, 对图像的远距离语义获取不充分, 导致修复图像的直观视觉性不足。提出了一种基于SwinTransformer的文物图像修复模型DMSWT。该模型通过对网络中的自注意力模块进行多项改进以优化网络结构。首先删除层归一化, 且用残差连接替换全连接层, 提高网络的深层特征提取能力; 其次引入动态掩膜机制, 缓解修复大规模缺失图像时默认采样造成的有效像素减少的问题; 最后改进损失函数, 注重直观性感受, 提高修复图像的直观视觉性。在不同场景下修复的实验结果表明, DMSWT模型能够学习到更多的结构先验信息, 并生成符合现实直觉的修复图像, 且在定量评估下指标有明显提高。

  • 计算机视觉与图形图像处理
    程弘楠, 张晨光
    计算机工程. 2026, 52(1): 196-205. https://doi.org/10.19678/j.issn.1000-3428.0069935
    摘要 (360) PDF全文 (177) HTML (7)   可视化   收藏

    芯片产业是国家安全和经济发展的重要基础, 而集成电路(IC)反向工程(RE)作为分析芯片内部性能的手段, 是芯片产业链中的重要环节。RE包括从扫描电子显微镜(SEM)逐层采集芯片图像、识别器件、提取栅极网表、推断其功能等步骤, 而将电气元件和金属线从IC图像背景中分割出来是识别器件等步骤的前提。然而, 传统图像分割方法因为缺乏专家经验的学习, 不能适应IC图像复杂多变的电路情况。为此, 提出一种HE-UNet方法, 用于提取IC图像中的金属线与过孔。HE-UNet包含3个步骤: 首先, 利用U-M2网络提取芯片图像的含噪特征; 其次, 利用霍夫圆检测算法去除过孔周围的噪声; 最后, 利用边缘检测池化去除远离过孔的噪声。在尺寸为1 024×1 024像素的IC图像上进行实验, 结果表明, HE-UNet可以有效完成金属线和过孔的分割, 其平均交并比(mIoU)为98.24%, 平均像素准确率(MPA)为99.11%, 均优于对比方法。