作者投稿和查稿 主编审稿 专家审稿 编委审稿 远程编辑

2026年, 第52卷, 第10期 刊出日期:2026-10-15
  

  • 全选
    |
    目录
  • 计算机工程. 2026, 52(10): 0-0.
    摘要 ( ) PDF全文 ( )   可视化   收藏
  • 前沿观点与综述
  • 王鼎宇, 张帆, 王俊超, 曹琰
    计算机工程. 2026, 52(10): 1-17. https://doi.org/10.19678/j.issn.1000-3428.0260693
    摘要 ( ) PDF全文 ( )   可视化   收藏
    智能电网作为现代能源体系的关键基础设施,其网络空间与物理运行过程深度耦合,已成为国家能源安全的重要支撑。随着分布式能源、储能系统、智能电表等海量异构设备的大规模接入,"云-管-边-端"协同架构成为主流形态。然而,攻击手段的持续演进使针对数据采集与监视控制(SCADA)系统、智能终端和通信网络的网络攻击日益频发,传统"封门补漏"式被动防御固有的滞后性与对先验知识的依赖,使其难以有效应对深植于系统架构与运行过程的安全威胁。信息系统中由漏洞、后门等自身缺陷引发的内生安全问题,难以在设计与开发阶段被完全消除,成为制约电网安全防护能力提升的根本性瓶颈。针对上述问题,系统研究了可部署于智能电网的内生安全技术。首先,以智能电网面临的供应链攻击、漏洞利用攻击、分布式拒绝服务/拒绝服务(DDoS/DoS)攻击、数据篡改与伪造攻击、物理与侧信道攻击、高级持续性威胁(APT)6类主要威胁为研究切入点,结合智能电网架构模型(SGAM)与典型攻击案例,分析了各类攻击的典型入口、影响层级及传统防御的技术难点与局限,发现攻击的直接来源大多集中于组件层与通信层,且攻击影响可跨层级传播。其次,依据核心功能定位,将可部署的内生安全技术划分为抗攻击类与可信认证类两大类:前者包括软件多样化、动态异构冗余(DHR)、基于物理不可克隆函数(PUF)的认证机制和抗攻击路由,后者包括零信任架构、可信计算与量子安全可信认证技术,并从作用机理、适用威胁、部署层级、性能开销和工程条件等维度,系统梳理了7类技术的研究进展、防御目标、作用层级与验证结果,总结了各类技术的适用条件与主要局限。研究结果表明:其一,单项内生安全技术通常只作用于攻击过程的局部环节,难以独立应对APT等复合攻击,多技术协同的关键在于按照攻击阶段明确技术分工,并共享身份、设备状态、异常输出、网络状态等信息,后续研究应以攻击链阻断率、误判率、最坏时延、恢复时间等指标评价协同效果;其二,现有技术方案多处于原型、仿真或小规模验证阶段,缺乏智能电网真实场景下的大规模部署验证,性能开销与实时性约束是技术落地的关键障碍;其三,供应链安全是内生安全技术可靠运行的基础,软件多样化依赖可信编译链,DHR依赖执行体来源,零信任和可信计算依赖准确的资产及固件信息,应形成从组件识别、完整性验证到异常处置的闭环;其四,人工智能(AI)可辅助内生安全检测与认证,但需兼顾识别能力与模型安全,评价时应同时报告检测性能、推理时延、资源占用与更新方式;其五,量子安全技术应按当前发展状况渐进迁移,后量子密码(PQC)可优先通过纯软件方案部署并建立密码敏捷机制,量子密钥分发(QKD)宜优先用于固定的高价值链路。
  • 刘颖, 张润宇, 杨朝树
    计算机工程. 2026, 52(10): 18-30. https://doi.org/10.19678/j.issn.1000-3428.0252595
    摘要 ( ) PDF全文 ( )   可视化   收藏
    日志结构合并树(LSM-tree)被广泛用于键值存储系统,凭借顺序写入机制实现高效的写入性能,但同时也带来了读写放大率高、合并任务开销大、数据冗余等问题。传统优化方案通过调整树结构、优化合并策略、采用键值分离机制等方式提升系统性能。然而,在大数据时代,数据规模急剧飙升,LSM-tree需要处理更频繁的写入与合并任务,导致CPU计算资源持续紧张,逐渐成为系统性能提升的瓶颈。此外,传统优化方案未能避免主机与存储设备间大量的I/O操作,仍面临高昂的冗余数据迁移开销。计算存储技术为应对上述挑战带来了新思路,该技术在存储层部署额外算力资源,通过任务卸载减轻CPU负担,进一步通过近数据处理降低数据迁移带来的性能损耗。聚焦基于计算存储技术的LSM-tree优化研究。首先,对计算存储技术架构进行梳理;然后,针对大数据背景下系统面临的主要瓶颈,从合并任务优化、数据迁移优化2个方面对现有方案进行分类和对比;最后,结合当前研究的局限性与发展趋势,对未来的研究方向进行展望。
  • 罗昊, 辛一冉, 唐云祁
    计算机工程. 2026, 52(10): 31-49. https://doi.org/10.19678/j.issn.1000-3428.0253234
    摘要 ( ) PDF全文 ( )   可视化   收藏
    近年来,基于扩散模型(DM)的生成式图像技术取得了突破性进展,以Stable Diffusion、DALL-E和Midjourney为代表的文生图模型已经广泛应用于商业领域和日常生活。然而,高度逼真的AI生成图像也带来了图像真实性挑战,催生了虚假信息传播、版权侵犯等社会问题。为有效应对这些挑战,本文系统综述了基于扩散模型的生成图像检测技术的最新研究进展。首先,梳理了扩散模型从原理、基础框架到大规模应用的发展。其次,总结数据集发展,指出数据集建设正从少量生成器、低分辨率向多模型融合、高质量多级筛选方向发展。再次,分析了检测技术的三大主流方法:基于隐式特征的检测技术、基于显式特征的检测技术以及基于混合特征的检测技术。最后,分析了当前检测技术面临的主要挑战,并展望了未来研究方向。本综述为研究人员和从业者提供了全面的技术图谱和发展趋势参考。
  • 丁同光, 杜胜东, 赵晗, 钱为, 郭楚珊, 刘凡
    计算机工程. 2026, 52(10): 50-72. https://doi.org/10.19678/j.issn.1000-3428.0253044
    摘要 ( ) PDF全文 ( )   可视化   收藏
    短期光伏功率预测是电力系统实现优化调度的核心基础,其精度直接影响系统整体效能。然而,光伏发电功率受多重气象因素影响,所呈现出的短期波动性和随机性给高精度预测的实现带来严峻挑战。近年来,深度学习(DL)技术凭借其挖掘数据内在关联特征的卓越能力,为突破性提升短期光伏功率预测精度开辟了全新路径。全面梳理现有DL技术在短期光伏功率预测任务中的应用进展。首先,阐述DL在该预测任务中的典型应用范式;然后,介绍在可用数据充足、静态且无增量的理想场景下,卷积神经网络(CNN)、循环神经网络(RNN)、转换器(Transformer)及图神经网络(GNN)等深度神经网络在该任务中的应用现状;继而,剖析基于深度数据增强、迁移学习(TL)、联邦学习(FL)、在线学习(OL)等技术的深度神经网络在应对数据匮乏、访问受限等现实数据挑战时,在该任务中的应用思路与进展;最后,探讨当前基于DL的短期光伏功率预测研究在鲁棒性、泛化性、适应性等方面面临的挑战,并从模型架构、优化策略等角度对未来技术路线进行前瞻性展望。
  • 计算智能与模式识别
  • 王朝扬, 孙未未
    计算机工程. 2026, 52(10): 73-80. https://doi.org/10.19678/j.issn.1000-3428.0252115
    摘要 ( ) PDF全文 ( )   可视化   收藏
    组合优化问题在物流路径规划等领域具有重要应用价值,但其解空间随问题规模呈指数级扩张,导致传统方法面临严峻挑战。近年来基于强化学习的神经组合优化方法能够在保持较短求解耗时的同时,使解质量接近传统求解器的水平。主流方法POMO(Policy Optimization with Multiple Optima)通过对称性优化增强了训练稳定性,但其单向序列生成机制仍存在双重局限:一方面,传统构造式方法难以充分挖掘问题对称性特征;另一方面,终点信息无法有效参与远端节点的决策过程。针对这一问题,提出了基于双向构造策略(BCS)的BCS-POMO模型,通过起点与终点双向并行构造解序列,动态选择更有把握的扩展方向,避免模型因单向构造而陷入两难的抉择之中。该模型利用构造序列对称性实现权重参数共享,并通过批量并行计算提升效率。实验表明,BCS-POMO有效强化了终点信息在构造过程中的决策辅助作用,在旅行商问题(TSP)和有容量约束的车辆路径问题(CVRP)上分别使误差降低了16%和18%,验证了双向构造策略对终点信息利用的有效性和对称性建模的优势。
  • 闫世泽, 方志军
    计算机工程. 2026, 52(10): 81-93. https://doi.org/10.19678/j.issn.1000-3428.0070696
    摘要 ( ) PDF全文 ( )   可视化   收藏
    知识图谱作为一种图结构数据组织方式,为推荐系统提供了更为丰富的语义信息和上下文背景,使得推荐系统能够有效地处理复杂的用户行为和物品特征。现有的基于知识图谱的推荐方法仍然面临诸如信息过度平滑和异常数据处理等问题,尤其是在大规模数据处理的场景中,过度平滑往往导致模型无法捕捉到个性化的用户需求,异常数据的干扰也可能影响推荐结果的准确性和鲁棒性。为此,提出了一种基于用户行为特征融合与异常点检测的知识图谱推荐模型。该模型通过引入用户融合行为特征,有效避免信息过度平滑的问题;且该模型结合了异常点检测机制,通过识别和剔除噪声数据和异常行为,显著提升了推荐结果的准确性和鲁棒性,减少了不良数据对推荐结果的影响。为了验证模型的有效性,在3个真实世界数据集上进行了实验。实验结果表明,与现有的最优基线模型相比,提出的模型在受试者工作特征曲线下面积(AUC)和F1值等指标上分别平均提升了0.067 7和0.050 9,尤其在数据稀疏程度较高的数据集上,模型的性能提升尤为显著,能够有效缓解数据稀疏性带来的问题。
  • 刘春, 王汝婷, 林泓
    计算机工程. 2026, 52(10): 94-105. https://doi.org/10.19678/j.issn.1000-3428.0252002
    摘要 ( ) PDF全文 ( )   可视化   收藏
    对话推荐系统(CRS)根据用户的多轮交互提供个性化的推荐,在电子商务和电影咨询等领域具有广阔的应用前景。然而现有工作未针对性地提取实际对话中项目间的关联信息,同时在语义融合时未考虑单词与实体共存情况的权重分配,导致系统不能全面提取对话文本所反映的语义信息,进而影响系统的对话生成能力与个性化推荐能力。因此,本文提出一种基于语义增强的对话推荐系统(SECRS),构建可调优的提示来指示预训练语言模型DialoGPT完成对话推荐任务。首先提出会话增强的项目嵌入提取方法,利用图神经网络挖掘实际对话中项目间的转承和共现关系来增强项目的语义。其次提出自适应的语义融合方法,将会话增强的项目嵌入与实体嵌入进行加权相加,再通过独立映射与联合融合的方式将会话增强前后的实体嵌入分别与单词嵌入进行融合,构成对话任务和推荐任务中语义增强的提示,从而提升系统的语言表达能力和个性化推荐能力。在两个数据集上的实验结果表明,SECRS优于多数主流的对话推荐系统,与基线UniCRS相比,SECRS在ReDIAL数据集上的Recall@10指标提高8.33%,Distinct-4指标提高45.15%。对比实验与消融实验的结果表明,SECRS能生成更精确的推荐结果及语言更丰富的回复。
  • 彭李湘松, 张著洪
    计算机工程. 2026, 52(10): 106-115. https://doi.org/10.19678/j.issn.1000-3428.0070397
    摘要 ( ) PDF全文 ( )   可视化   收藏
    方面级情感分析(ABSA)旨在获取句法结构复杂的语句中特定方面词的情感极性。现有基于依存树与图神经网络(GNN)的模型因难以完整提取句法结构与深层语义特征,以及特征融合机制难以有效融合语义特征与句法结构,导致情感分析中句子情感极性判断的准确率较低。为此,建立基于DeBERTa的新型ABSA模型。首先,借助DeBERTa生成文本词向量,同时利用方面感知注意力机制提取方面词的特征,利用抽象语义表示获取文本句法结构,减少特征信息因提取不完整而对后续情感分析的影响;其次,构建融合句法结构与深层语义特征的新型三角形乘法机制;最后,通过三角形自注意力机制和全连接网络,将方面词的情感极性特征映射到情感分类层,使无关噪声的干扰得到有效抑制,从而提升情感极性判断的准确率。实验结果表明,相较于最新的基线模型,该模型的情感极性判断准确率和宏平均F1值分别平均提升0.93和1.39百分点,其能有效获取句子的句法结构与深层语义,且情感极性的分类准确率较高。
  • 田青, 申珺妤, 郁江森
    计算机工程. 2026, 52(10): 116-128. https://doi.org/10.19678/j.issn.1000-3428.0070761
    摘要 ( ) PDF全文 ( )   可视化   收藏
    无监督域适应(UDA)旨在将知识从标记的源域迁移到未标记的目标域,从而提高目标域模型的性能。然而,传统的UDA方法假设源域和目标域的类别空间完全一致,导致无法处理目标域中存在的未知类别,这限制了其在实际场景中的应用。开放集域适应(OSDA)通过引入对未知类别的识别来解决这一问题,但如何有效减少域间差异和类别不平衡对模型性能的负面影响,仍是一个重要挑战。现有的OSDA方法往往忽略了域特定特征,并简单地对域差异直接进行最小化,这可能导致类别之间的边界不清晰并削弱模型的泛化能力。为了解决这一问题,提出基于最优传输距离正则化(OTR)和近邻聚类方法的开放集域适应(OTRNC)方法。该方法通过OTR来最大化高、低置信度样本组之间的分布距离,减少未知类别对域适应过程的干扰。然后利用动态近邻检索和不变特征学习,减少目标域的类内变化,增强特征的泛化能力。实验结果表明,OTRNC在多个基准数据集上均表现出色,具有一定的有效性。
  • 丁磊, 李思维, 黄瑞婷, 余慧坤, 余烈
    计算机工程. 2026, 52(10): 129-137. https://doi.org/10.19678/j.issn.1000-3428.0252004
    摘要 ( ) PDF全文 ( )   可视化   收藏
    针对基于可穿戴设备的健身动作识别方法收集标注的传感器数据可能造成隐私泄露风险,以及传统中心化模型训练方法在新用户适应性方面存在局限的问题,提出一种基于可穿戴运动护膝和个性化联邦学习(FL)的健身动作识别方法。该方法实现了健身动作类型识别和用户表现水平识别两项任务,帮助用户了解自身健身表现,提高锻炼效果。首先,将每位用户视为独立的任务,以联邦的方式元训练一个全局嵌入网络,学习跨用户的共享表征,此表征可以有效地泛化到任意用户;然后,通过一个适应化流程,在全局嵌入网络的基础上对本地分类网络进行两阶段微调,使每位用户获得个性化模型;最后,在来自真实世界的健身数据集上进行大量实验,以验证该方法的性能表现。实验结果表明,所提方法实现了100%的健身动作类型识别准确率和95.94%的用户表现水平识别准确率,显著优于现有先进方法。所提系统能够保护用户隐私,同时具备良好的新用户泛化能力。
  • 朱莉, 徐婉茹, 高靖凯, 朱春强, 邓凡
    计算机工程. 2026, 52(10): 138-153. https://doi.org/10.19678/j.issn.1000-3428.0070676
    摘要 ( ) PDF全文 ( )   可视化   收藏
    准确地生成多变量时间序列(MTS)数据为解决数据规模不足问题提供了有效途径,对电力负荷预测和风光发电评估等下游任务至关重要。然而,现有方法难以同时捕捉长短期依赖与变量间关联关系,且缺乏可解释性,无法满足能源系统分析需求。为此,提出了一种基于可解释扩散模型的MTS生成方法IDMTS。首先,在扩散模型的去噪网络中引入了包含三重注意力(TA)的Transformer架构,以捕捉长短期依赖与变量特征关联关系;接着,结合多尺度趋势季节分解,利用双向长短期记忆(BiLSTM)网络和傅里叶注意力(FA)分别建模趋势项和季节项,提升生成数据的准确性和可解释性。同时,通过多尺度自适应最大均值差异(Ada-MMD)损失函数优化生成质量。实验结果表明,IDMTS在4个公开数据集上的生成准确性显著优于基线方法,其中Context-FID得分、相关性得分、判别得分和预测得分分别降低了51.5%~84.5%、4.1%~26.8%、24.0%~68.8%、0.3%~40.0%。同时,在可解释性实验、条件插补和预测实验中,IDMTS展现出良好的可解释性和泛化能力。
  • 代子男, 张捷, 陈冲冲, 谌章义, 陈付龙
    计算机工程. 2026, 52(10): 154-163. https://doi.org/10.19678/j.issn.1000-3428.0070675
    摘要 ( ) PDF全文 ( )   可视化   收藏
    中文医疗命名实体识别(NER)旨在从医疗文本中识别具有特定意义的实体,如疾病、药物、症状及身体部位等多种类型的医疗实体。这一任务可为临床辅助决策、医疗信息整合和病案管理等方面提供有力支持。现有的中文医疗NER研究尚未充分考虑医疗文本的复杂结构,存在专业术语繁多、嵌入信息单一、语义信息利用不足等问题。为此,提出一种融合多级别粒度特征的中文医疗文本NER模型。该模型首先利用BERT预训练模型生成文本的字嵌入表示,并设计了一维和二维卷积神经网络(CNN)提取字符的字形与笔画特征,同时通过外部词库引入词级特征,以增强对词与实体边界的信息表达。此外,模型还加入句子级特征以捕获全局语义特征。通过交叉注意力机制将上述多级别的粒度特征进行迭代融合,得到包含深层语义信息的嵌入表示,最后利用条件随机场(CRF)输出实体识别结果。在CCKS2017和CCKS2019数据集上的实验结果表明,该模型F1值达到92.88%和87.86%,相较于当前主流模型展现了更优异的识别性能。
  • 计算机视觉与图形图像处理
  • 辛振伟, 张粼, 王宝龙, 石少华, 杨一鹏, 程辉, 陈涛
    计算机工程. 2026, 52(10): 164-176. https://doi.org/10.19678/j.issn.1000-3428.0252596
    摘要 ( ) PDF全文 ( )   可视化   收藏
    目标检测是计算机视觉中的一项基础任务,旨在实现对图像中目标的定位和类别识别。多属性识别则是输入以目标为中心的图像,输出图像中目标的多个属性的分类结果。当前检测算法对小目标识别存在困难,而属性识别算法无法自行定位目标。为此,提出一种多属性小目标检测框架MA-YOLO,以同时完成小目标检测和多属性识别两个任务。首先,该框架通过属性解耦模块(ADM)进行特征解耦,并添加多个并行的属性分类头;其次,为了实现属性间的特征交互,设计一种简单但有效的属性融合策略,通过桥接特征生成模块(BFGM)生成桥接特征,实现骨干网络提取到的特征和后续解耦出来的所有属性特征的过渡,利用属性融合模块(AFM)得到融合后的各个属性特征。针对小目标检测问题,采用一种卷积和自注意力混合(ACmix)模块,以增强网络的特征提取能力。此外,将边界框建模为二维高斯分布,使用归一化Wasserstein距离(NWD)度量。实验结果表明,在多属性数据集WIDER Attribute的测试集和验证集以及小目标数据集VisDrone2019的验证集上,MA-YOLO的mAP@0.5分别达到84.1%、85.3%和48.2%,大量消融和可视化实验也验证了MA-YOLO的有效性。
  • 杨红菊, 刘娜, 李尧, 曹付元
    计算机工程. 2026, 52(10): 177-187. https://doi.org/10.19678/j.issn.1000-3428.0252645
    摘要 ( ) PDF全文 ( )   可视化   收藏
    草图引导的图像修复技术在照片修复、创意编辑等领域具有重要的应用价值,但面临用户草图数据稀缺与几何偏差导致的修复失真双重挑战。现有方法依赖边缘检测生成伪草图,但忽略用户手绘偏差(如手抖、笔触断裂),导致在复杂场景下结构错位与细节模糊。针对上述挑战,提出一种联合可变形草图生成网络(DSN)与双阶段引导修复的创新框架。首先构建可变形草图生成网络,通过建模典型手绘偏差,生成具有真实几何变形特征的大规模草图-图像配对数据集,有效缓解数据稀缺问题;其次设计两阶段修复框架,第一阶段针对用户输入草图进行几何失准校正与结构断裂修复,实现草图优化,第二阶段将优化后的草图信息有效融入修复网络,实现全局结构约束与局部纹理生成的协同优化。在基准数据集上的实验验证了该方法的有效性,实验结果表明,在CelebA-HQ数据集上,该方法的峰值信噪比(PSNR)为25.78 dB,结构相似性(SSIM)为0.852,该方法有效解决了用户草图数据稀缺与几何偏差问题,显著提升了草图引导图像修复在结构准确性和感知质量方面的性能。
  • 李元昊, 应方立
    计算机工程. 2026, 52(10): 188-198. https://doi.org/10.19678/j.issn.1000-3428.0252270
    摘要 ( ) PDF全文 ( )   可视化   收藏
    学习解耦表征以提升图像生成模型的可控性是计算机视觉领域的重要研究方向。然而,现有解耦表征学习方法存在两大局限性:一是依赖大规模标注数据;二是难以有效处理特征间的复杂依赖关系。为突破这些限制,提出一种基于希尔伯特-施密特独立性准则(HSIC)的通用解耦生成方法。该方法创新性地将HSIC这一非参数统计方法转化为生成模型潜在空间的独立性正则化机制,通过施加HSIC正则项优化非线性依赖关系的度量目标,引导模型学习独立的特征表示。具体而言,通过实验将HSIC融入两类主流生成模型架构的优化过程:在变分自编码器(VAE)模型类中,通过结合变分推断重构与HSIC正则项,优化潜在分布的解耦性;在扩散模型(DM)类中,通过将HSIC正则项嵌入反向过程的时间步优化,逐步实现渐进式特征解耦。实验结果表明,这种能够在不同模型架构中实现的通用方法提升了潜在表示的独立性,且在无监督场景下保持稳定性能,为建模特征间复杂依赖关系提供了新途径。为进一步验证解耦空间的语义一致性,通过潜在空间插值实验,生成轨迹更加平滑的结果,证明了HSIC正则化有效构建了线性可分的解耦空间。在评估体系方面,采用标准解耦指标与基于HSIC的自定义指标进行双重验证,结果两者呈正相关,证实了解耦评价标准的客观性。
  • 谭仲夏, 刘奇坤, 蒋翠玲, 万永菁
    计算机工程. 2026, 52(10): 199-214. https://doi.org/10.19678/j.issn.1000-3428.0252062
    摘要 ( ) PDF全文 ( )   可视化   收藏
    由于脑卒中的检查时间较长且治疗时间窗有限,因此研发一种快速且高准确性的脑卒中医学图像分割模型对于临床诊断具有重要意义。基于Mamba的U-Net架构具有较低复杂度和大尺寸图像处理能力,近年来在医学图像处理领域得到广泛关注。分数阶傅里叶变换(FRFT)能够转换信号到空域和频域之间的任意分数域,在分数域内可以观测空域和频域中不显著的特征,故引入FRFT,在分数域观察病灶特征。因此,基于FRFT与Mamba网络,提出一种针对脑卒中医学图像分割的模型FRFTMamba-UNet。该模型在Mamba网络中引入了分数域,并设计了一种与U-Net编码器相连接的多级残差模块,此外,在U-Net型网络中实现了分层特征提取策略,针对U-Net的浅层与深层分别设计了不同的特征提取模块,浅层添加了基于卷积神经网络(CNN)的残差卷积以有效提取浅层特征,深层使用Mamba架构进一步提取深层特征。实验结果表明,所提出方法的准确率和效率在AISD、ATLAS和ISLES 2022这3个脑卒中数据集上普遍优于现有基于Mamba模块的SOTA模型,在AISD数据集上其Dice相似性系数(DSC)为64.27%,ATLAS数据集上DSC为62.24%,ISLES 2022数据集上DSC为85.24%。
  • 郑鲲, 张梓嫣, 李晓理
    计算机工程. 2026, 52(10): 215-226. https://doi.org/10.19678/j.issn.1000-3428.0252028
    摘要 ( ) PDF全文 ( )   可视化   收藏
    面向在线教育中人脸视频的生理参数测量是当前智慧教育研究的热点。传统的远程光电容积描记法(rPPG)无法适应在线教育场景中的光照环境变化,影响了基于人脸视频进行生理参数测量的灵活性和准确性。面向在线教育中的典型光照场景,提出一种光照自适应的血容量脉冲(BVP)信号提取方法,并结合生成对抗网络(GAN)与卷积神经网络(CNN)构建BVP信号双重校正模型。该方法基于模拟退火算法计算不同光照条件下正交色度信号的最优解,同时建立利用平均灰度强度进行光照场景分类的光照场景预测机制,实现光照场景自适应的最优色度信号输出;进一步结合GAN与CNN模型对BVP信号进行双重校正,以确保最终输出的生理参数更加准确可靠。在面向典型教育场景重组的4个公开数据集上进行模型验证,实验结果表明,心率(HR)的均方根误差(RMSE)平均降低8.3 bpm,证明了所提模型在不同光照条件下的鲁棒性和准确性。该模型在提升HR及心率变异性(HRV)预测准确性方面具有显著优势,可为复杂光照环境下的非接触式生理参数检测提供有效支持。
  • 徐少平, 王子超, 唐祎玲, 熊思龙
    计算机工程. 2026, 52(10): 227-241. https://doi.org/10.19678/j.issn.1000-3428.0252123
    摘要 ( ) PDF全文 ( )   可视化   收藏
    人类视觉皮层采用分层结构,其中双目融合与双目竞争首先发生在低级视觉区域,但当前基于深度学习的立体图像质量评价(SIQA)模型普遍采用在网络的不同层次上融合左右视点图像特征来估计立体图像质量值,对人类低级视觉区域感知的模拟程度存在不足。鉴于此,本文提出了一种仿双目竞争的立体图像质量评价方法。首先,模拟双目视觉竞争现象,构建了一个基于无监督方法的双目图像融合模型。通过左右视点图像的梯度幅值响应来评估图像降质程度,确定左右视点图像的融合权重,并利用深度卷积神经网络(CNN)对输入图像先验知识的获取能力,建立基于编码器-解码器架构的无监督图像生成网络,以左右视点两幅图像作为学习对象,实现左右视点图像的融合。其次,利用在大规模图像数据库上预训练的ResNet50模型从融合图像中提取质量感知特征,并构建了一个基于支持向量回归(SVR)的特征质量映射模型来估计立体图像的质量值。实验结果显示,在4个经典立体图像基准测试数据库上,所提方法在皮尔逊线性相关系数(PLCC)和斯皮尔曼等级相关系数(SROCC)两个评价指标上均超过了0.96,并且均方根误差(RMSE)均优于对比方法。这表明提出的基于无监督双目图像融合的方法能够有效模拟双目视觉效应,从而显著提高立体图像质量评价的准确性。
  • 耿霞, 林贤文, 杨治
    计算机工程. 2026, 52(10): 242-251. https://doi.org/10.19678/j.issn.1000-3428.0252150
    摘要 ( ) PDF全文 ( )   可视化   收藏
    在基于图文的行人重识别任务中,基于图文预训练模型的参数初始化已成为主流范式,这有效突破了单模态模型因跨模态信息缺失导致的特征对齐瓶颈。现有方法聚焦于挖掘图像-文本联合嵌入空间中不同尺度下的语义特征进行优化,但新对齐范式的引入易使原模型在微调过程中陷入局部最优。为了解决上述问题,提出一种基于提示的信息传输(PIT)框架,通过在单模态编码器和跨模态图像-文本编码器的原始前向过程中嵌入跨模态提示标识符,促进早期特征融合,隐式地引导模型更加聚焦于模态不变的信息。PIT框架包含基于跨模态提示的对比学习(CL)损失和提示训练策略(PTS)。基于跨模态提示的CL损失旨在通过约束图文特征之间的相似度,构建兼具模态内区分度与模态间语义一致性的共享特征嵌入空间。PTS可以视为一种自蒸馏方法,通过将无提示特征与基准真相产生的伪目标视为另一种行人图文对的特征视图,监督跨模态提示特征的训练过程,使最终学习到的特征嵌入相较于无提示特征包含更丰富的多模态信息。实验结果表明,PIT在完全微调的基础上仅需要添加0.61×106的参数,在CUHK-PEDES、ICFG-PEDES和RSTPReid数据集上所提模型相比基线模型的Rank-1提高了1.48、1.5 和1.55百分点。
  • 高雄, 苟光磊, 周琳杰, 贾朋昊
    计算机工程. 2026, 52(10): 252-262. https://doi.org/10.19678/j.issn.1000-3428.0252234
    摘要 ( ) PDF全文 ( )   可视化   收藏
    在细粒度图像分类(FGIC)任务中,充足的样本能够提供丰富的局部特征信息。然而,在小样本场景下,数据稀疏性导致模型难以充分捕捉具有判别性的局部信息。为解决该问题,提出一种融合轴向注意力与尺度感知机制的小样本学习(FSL)方法。首先,设计频率自适应特征选择(FAFS)模块,旨在减少背景噪声和非目标区域的干扰,突出判别性局部特征,从而扩大不同类别间的特征区分度;其次,构建轴向尺度联合增强模块,融合全局上下文信息,关注关键区域,并行处理不同感受野的特征,增强模型对不同尺度细节的表征能力;最后,采用双相似度度量模块,通过2种相似度度量方式指导学习,提升特征的泛化性,减少特定特征的偏向性。在公开数据集CUB和Stanford Dog上,相较基准方法,该方法在1-shot和5-shot场景下的分类准确率分别提升1.4、1.45百分点和1.86、3.49百分点。在Stanford Car数据集上,在1-shot场景下该方法达到最优性能,在5-shot场景下也取得了具有竞争力的结果。实验结果表明,所提方法有效提升了小样本细粒度图像分类(FSFGIC)的性能,能够更好地捕捉判别性特征信息。
  • 郑明宇, 邵慧超, 邵延华, 楚红雨
    计算机工程. 2026, 52(10): 263-274. https://doi.org/10.19678/j.issn.1000-3428.0252029
    摘要 ( ) PDF全文 ( )   可视化   收藏
    目标检测与多目标跟踪技术日益成熟,但在复杂场景下执行航拍多目标跟踪任务时,目标尺寸小、尺寸变化大、遮挡等问题仍会导致检测与跟踪效果不理想。为此,提出一种基于改进YOLOv8与ByteTrack的航拍多目标跟踪算法(YBTrack)。构建MSA-YOLO(Multi-Scale Attention YOLO)检测器,设计空间-深度卷积替换YOLOv8原有卷积,将空间信息转换为通道维度,有效保留目标细节,减少多尺度特征图融合过程中信息丢失导致的漏检、误检。同时设计轻量加速空间-通道注意力模块,用于颈部卷积,降低计算复杂度,并作为检测头前的特征细化模块,进一步增强算法对目标特征信息提取的能力。为提高跟踪效果,对ByteTrack跟踪模型进行优化,设计空间-外观相似度矩阵(ASM),提升模型区分相似目标的性能,并提出目标校正函数,减少卡尔曼滤波器产生的误差积累,降低目标偏移、丢失率。将MSA-YOLO与优化后的ByteTrack结合,开展多目标跟踪实验。其中,MSA-YOLO在VisDrone2019-DET数据集上平均精度均值(mAP@0.5)提高了9.4百分点;多目标跟踪算法在VisDrone2019-MOT、MOT17数据集上多目标跟踪准确率(MOTA)分别提升了11.2和8.3百分点,ID调和均值(IDF1)分别提升了8.9和7.4百分点,实验结果表明本文所提方法跟踪效果显著。此外,与其他多目标跟踪算法的对比实验也证明了本文算法的优越性。
  • 多模态与信息融合
  • 郑洋, 王雷, 盛捷
    计算机工程. 2026, 52(10): 275-284. https://doi.org/10.19678/j.issn.1000-3428.0252352
    摘要 ( ) PDF全文 ( )   可视化   收藏
    多模态情感分析利用多模态数据来推断人类情感。然而现有模型在模态信息缺失、文本依赖及跨模态冲突等情况下性能下降明显。为此,提出一种基于生成式补全与动态知识融合的多模态情感分析模型(GC-DKF)。首先通过生成式提示学习模块,对原始数据中缺失的模态内及模态间信息进行补全,生成缺失的模态特征,提升模型对不确定模态场景的适应能力;然后设计一种主导模态动态选择机制,依据情感比例因子动态选定主导模态,同时引入知识编码器增强单一模态的表征能力,获取各模态的知识增强表征;最后在主导模态特征的引导下,进一步学习其他次要模态,生成互补性的多模态联合表征,实现更为高效、精准的多模态情感分析。在公开的CMU-MOSI和CMU-MOSEI数据集上的实验结果显示,所提模型在二分类准确率、F1值、平均绝对误差(MAE)和Pearson相关系数等指标上,均超越现有的主流多模态情感识别方法,情感识别准确率分别高达83.55%和83.02%。这充分证明提出的模型在多模态情感识别任务中具备较强竞争力。
  • 石旭, 解庆, 汤梦姿, 王玉菡, 刘永坚
    计算机工程. 2026, 52(10): 285-301. https://doi.org/10.19678/j.issn.1000-3428.0252046
    摘要 ( ) PDF全文 ( )   可视化   收藏
    在互联网技术迅猛发展的当下,个性化推荐系统对于帮助用户筛选感兴趣内容扮演着至关重要的角色。传统的推荐方法在处理大规模数据和捕捉用户复杂偏好方面存在局限性,而现有的基于图神经网络(GNN)的推荐方法主要侧重于挖掘用户与物品间的直接交互关系,虽然提高了推荐的准确性,但其往往忽略了如文本、图像、音视频等多模态信息的融合与利用。元路径作为异构图中描述节点间复合关系的概念,有助于进一步提升嵌入质量和推荐效果,但现有模型要么忽略节点内容特征,要么丢弃了元路径上的中间节点,或者仅考虑单一的元路径。针对现有多模态推荐系统的挑战,提出了一种基于元路径引导的多模态推荐方法MAMGNN。首先通过构建多模态异构图,整合来自不同模态的信息,然后利用元路径来引导信息在同种元路径内及不同种元路径间进行传播和聚合。此外,该方法还引入了GNN和注意力机制,以学习用户和物品的高质量嵌入表示,从而生成更精确且具有可解释性的推荐结果。在MovieLens-20M和H&M两个真实世界数据集上的广泛实验及小范围内的用户调研,实验结果表明,MAMGNN在预测用户对项目的偏好程度方面效果显著提升,相较于次优模型,在MovieLens-20M数据集上的Precision@10、Recall@10和NDCG@10分别提高了2.93%、1.98%、2.12%,在H&M数据集上分别提高了3.43%、1.18%、2.40%。
  • 张昊然, 蹇木伟, 王瑞, 宋增凯
    计算机工程. 2026, 52(10): 302-316. https://doi.org/10.19678/j.issn.1000-3428.0260521
    摘要 ( ) PDF全文 ( )   可视化   收藏
    在真实临床问诊场景中,患者主诉通常以语音形式表达,并由医生记录为文本。医生需要综合利用患者口述语音及其文本记录对症状进行判断和分类,从而为后续临床决策提供依据。然而,该任务仍面临一定挑战:语音信息容易受到环境噪声和个体发音差异的影响,文本记录又难以体现语速、停顿、音调等语音表达特征;同时,患者主诉通常具有口语化、主观性和非结构化特点,不同症状类别之间也可能存在语义边界模糊的问题,导致仅依赖单一模态难以获得理想的分类效果。针对上述问题,提出一种基于动态权重决策融合的多模态症状分类方法(DWDF-MSC),以充分利用文本与语音信息的互补性,提升症状分类的准确性和鲁棒性。该方法主要包括多模态特征提取、初步分类和自适应门控决策融合三个阶段。在多模态特征提取阶段,分别构建文本分支和语音分支,对患者主诉文本和语音数据进行并行建模:文本分支基于临床预训练语言模型Bio_ClinicalBERT同时提取全局语义特征和局部词汇特征,并通过文本异构特征融合模块对两者进行融合,从而增强模型对主诉整体语义和局部症状关键词的表征能力;语音分支利用音频频谱图Transformer(AST)提取语音中的时序声学表示,以补充文本记录中难以体现的语音表达信息。在初步分类阶段,文本分支和语音分支分别通过各自的分类模块输出初步分类结果,使两种模态先独立完成症状判断。在最终分类阶段,设计自适应门控决策融合策略,根据不同样本的特征动态生成融合权重,对文本分支和语音分支的初步分类结果进行加权融合,得到最终症状分类结果。与简单特征拼接或固定权重融合不同,该策略能够根据样本差异自适应调整两种模态在最终决策中的贡献,从而增强具有判别力的信息对分类结果的影响,提高模型在复杂主诉场景下的分类稳定性。在公共医疗数据集上的实验结果表明,DWDF-MSC的准确率、精确率和F1值分别达到82.43%、87.44%和81.52%,均优于多数主流基准模型。多模态融合方案对比进一步证明,相较于特征融合,所提出的动态权重决策融合能够取得更好的分类效果。在消融实验中,完整DWDF-MSC相较于仅采用文本异构特征融合的方案,在准确率和F1值上的提升幅度分别为4.25%和7.60%,验证了语音分支和自适应门控决策融合的有效性。McNemar检验结果显示,DWDF-MSC与多种对比方法之间的p-value小于0.000 1,说明其与这些对比方法之间的分类结果差异具有统计显著性。抗噪性能实验结果表明,DWDF-MSC在不同信噪比(SNR)条件下仍能保持较稳定的分类表现。综上所述,DWDF-MSC能够有效融合患者主诉中的文本与语音信息,提升模型分类性能,为面向患者主诉的智能症状分类提供了一种可行的多模态方法。
  • 钟杭, 张清华, 罗南方, 郭芮利
    计算机工程. 2026, 52(10): 317-327. https://doi.org/10.19678/j.issn.1000-3428.0260120
    摘要 ( ) PDF全文 ( )   可视化   收藏
    多模态对话情感识别(ERC)通过融合语言、声学和视觉等多源信息,实现对话情绪的自动识别,从而增强人机交互的自然性与情感理解。然而,现有方法在建模情感的多层上下文依赖方面仍存在不足,模态融合易引入冗余或噪声,且难以刻画情感的不确定性,限制复杂情绪识别。针对上述问题,提出一种融合混合编码与模糊建模的多模态ERC模型。该模型通过混合编码模块同时建模情感的全局对话上下文与局部依赖关系,从而增强情感时序特征的表达能力,并在此基础上引入分层门控融合机制,对不同层次和不同模态特征进行动态加权融合,以有效抑制冗余信息与噪声干扰。在情感分类阶段,采用线性等间距初始化的模糊神经网络,通过模糊隶属函数对情感类别边界进行建模,以刻画情绪表达中的不确定性与模糊性。实验结果显示,该模型在IEMOCAP、MELD和CMU-MOSEI 3个数据集上的各项指标均优于基线模型,在IEMOCAP上准确率为72.67%,在MELD上准确率为67.37%,在CMU-MOSEI七分类与二分类准确率上分别为54.96%和86.78%,验证了所提模型在多模态情感分析中的有效性。
  • 大模型与生成式人工智能
  • 顾滢双, 桂韬, 张奇
    计算机工程. 2026, 52(10): 328-339. https://doi.org/10.19678/j.issn.1000-3428.0252253
    摘要 ( ) PDF全文 ( )   可视化   收藏
    大语言模型(LLM)的事实性幻觉指的是模型生成内容与真实世界事实存在冲突的现象,这一问题显著降低了其在医疗、法律、科学研究等高风险领域的可信度与应用价值。现有的幻觉缓解方法主要依赖输入优化、监督学习或外部知识库,但这些方法存在泛化能力有限、对大规模标注数据依赖性强、实时性受限等问题,难以根本性提升模型的事实性偏好。为此,提出一种基于语义熵反馈强化学习的事实性幻觉缓解框架。通过引入语义熵作为衡量模型语义级别不确定性的度量标准,该方法能够精准评估模型对自身生成内容的置信度,并将其作为奖励信号嵌入强化学习训练过程,使模型在生成过程中主动规避高幻觉风险的回答。相比于传统基于预测熵的方法,语义熵能够更有效地区分语义等价表达,并在无需外部知识库的情况下增强模型的事实性。在多个公开数据集上的实验表明,该方法在保持生成内容丰富、连贯的基础上,相较于效果最好的基线模型,事实判断准确率最高提升5.7百分点,事实生成准确率最高提升7.8百分点,显著验证了其在事实性幻觉缓解方面的优越性。
  • 林明生, 沈立炜, 董震
    计算机工程. 2026, 52(10): 340-349. https://doi.org/10.19678/j.issn.1000-3428.0252412
    摘要 ( ) PDF全文 ( )   可视化   收藏
    在家庭服务场景中,多机器人系统需处理非专业用户发出的自然语言指令,这对自动化任务调度提出更高要求。针对现有多机器人调度方法在任务理解、依赖管理和资源优化方面的不足,提出有向无环图(DAG)-大语言模型(LLM)调度方法,实现从自然语言输入到多机器人协作的全流程自动化。该方法首先利用LLM结合环境信息进行语义解析与任务分解,通过抽象链(CoA)机制生成具备执行约束的子任务集合;其次,基于LLM自动构建子任务间的DAG,取代传统人工建模流程,准确表征任务依赖关系;最后采用回溯算法匹配机器人技能与子任务需求,结合异步执行策略提升执行效率,在保证依赖顺序的前提下通过动态调度减少等待时间。为验证所提方法有效性,在AI2-THOR仿真环境中设计3类不同复杂度的家庭任务(含4组场景)开展对比实验。实验结果表明,DAG-LLM在任务成功率上相较于SMART-LLM提升41.4百分点,相较于AutoTAMP提升57.7百分点;运行时间分别缩短24.3%和6.3%。消融实验进一步表明任务依赖建模和异步执行机制对提升系统性能具有关键作用。该方法无需人工参与任务分解与依赖建模,适用于多机器人智能体在家庭等自然语言驱动应用场景下的高效协作调度。
  • 林荣鑫, 李硕豪, 董力铭, 郝思齐
    计算机工程. 2026, 52(10): 350-362. https://doi.org/10.19678/j.issn.1000-3428.0252354
    摘要 ( ) PDF全文 ( )   可视化   收藏
    随着社交媒体平台传播的信息量呈指数级增长,虚假新闻检测成为信息鉴伪领域的关键任务。当前研究方法聚焦于单一模态的语义分析,未能有效地解决多模态新闻的跨模态语义矛盾问题。现有模型决策过程可信度不足,缺乏可解释的辅助信息支撑。针对上述问题,提出一种面向多模态新闻的视觉语言大模型检测框架。首先,引入视觉语言大模型推理新闻内容,通过生成图文描述集来增强检测的可解释性;其次,设计多粒度协同注意力机制,实现文本、图像,以及辅助描述的多粒度特征对齐。采用多模态视觉语言大模型Qwen2.5-VL作为新闻解释性工具,设计新闻提示模板,引导模型对新闻图像提取关键对象和场景要素,利用模型的语言生成能力增强新闻文本的上下文信息,形成可解释的辅助决策依据。多粒度协同注意力融合机制以协同注意力层为基础,通过多层级特征交互,在高维语义空间中捕捉新闻图文中的潜在伪造模式。在Weibo、GossipCop和Pheme多模态虚假新闻数据集上的实验结果表明,所提模型的准确率分别为90.4%、88.1%和86.6%。
  • 崔泽源, 葛文翰, 王俊峰
    计算机工程. 2026, 52(10): 363-374. https://doi.org/10.19678/j.issn.1000-3428.0070706
    摘要 ( ) PDF全文 ( )   可视化   收藏
    网络威胁狩猎(CTH)通过主动发现攻击线索与恶意证据实现对攻击事件的快速响应。现有网络威胁狩猎方法虽具备在广泛信息源条件下进行决策的能力,但在现实场景中存在先验知识缺乏以及反馈稀疏的问题。针对上述问题,提出一种基于大语言模型(LLM)和强化学习(RL)的网络威胁狩猎算法RE-HUNTER。为解决先验知识缺乏的问题,该方法构建了上下文向量数据库,利用大语言模型中的领域知识和网络威胁情报中的非结构化知识提升决策方法的冷启动效果,初始化强化学习权重;为解决反馈稀疏的问题,该方法改进了蒙特卡洛树搜索(MCTS)算法,引入了递归更新机制和方法相似度机制,从而增强了对实体和方法执行结果的反馈。基于186个真实攻击案例进行的网络威胁狩猎实验结果显示,该方法相较当前最优基线方法显著提高了搜索效率,在0~2 000步区间内平均召回率相对提升18.24%;值得注意的是,在0~250步冷启动区间内较基线方法实现了86.28%的平均召回率提升;此外,消融实验表明该方法的不同组成部分对实验结果均起到正向作用,能够有效降低网络威胁狩猎的成本。
  • 张凌浩, 谭海波, 赵赫, 陈中
    计算机工程. 2026, 52(10): 375-389. https://doi.org/10.19678/j.issn.1000-3428.0070735
    摘要 ( ) PDF全文 ( )   可视化   收藏
    近年来,大模型已经成为人类生活的重要工具之一。作为人类与大模型沟通的桥梁,提示词发挥着至关重要的作用。虽然高质量提示词能够充分激发大模型的潜力,但其设计不仅需要专业技能,还需耗费大量资源,这促使提示词交易市场以及授权服务模式的出现。然而,将提示词作为商品存在以下3个问题:1)提示词明文一旦泄露就会被轻易地复制以及传播,使其失去价值;2)缺乏客观的提示词质量标准和价格体系;3)用户难以对虚假提示词的提供者追究责任,同时中心化平台的行为也会影响提供者的权益。针对上述挑战,本文提出了PromptDEX,一种基于区块链的大模型提示词服务平台。基于智能合约的提示词租用机制和基于LangChain的服务模板,使提供者直接与需求方对接,削弱中心化机构对参与者利益和隐私的影响。所有交易记录将被公开透明地记录在链上,确保交易流程安全、可靠、可追责。此外,平台还设计了以需求方评分为依据的动态定价机制。实验结果表明,PromptDEX引入区块链所带来的额外成本开销以角为单位计算,几乎可以忽略不计。提供者仅需约10行代码即可构建API服务,对于网络带宽要求极低,具备较强的可行性与实用性。
  • 梁堉, 马佳妍, 胡晰远, 王子恒, 刘文, 彭天豪, 李莹
    计算机工程. 2026, 52(10): 390-406. https://doi.org/10.19678/j.issn.1000-3428.0260022
    摘要 ( ) PDF全文 ( )   可视化   收藏
    随着网络和社交媒体的快速发展,信息的生成和传播速度达到了前所未有的水平,虚假信息、谣言及其他误导性内容充斥的现象愈加突出,这类问题已对社会治理秩序、和谐稳定构成重大威胁。在谣言检测中,谣言样本占比低导致数据不平衡,现有文本增强技术因缺乏谣言风格针对性、生成质量低,难以提升检测效果。同时,预训练语言模型虽然擅长捕捉文本全局依赖关系,却难以聚焦谣言关键局部特征。为此,提出一种基于大模型数据增强的多粒度特征融合的谣言检测框架。首先,提出融合谣言风格词典与大语言模型(LLM)的谣言生成方法,基于公开谣言数据集构建风格词典,以词典为约束指导LLM生成语义连贯且符合谣言风格的少数类样本,在缓解数据不平衡问题的同时保障增强样本质量;其次,所提多粒度上下文特征提取器(MGCFE),融合基于解耦注意力机制的预训练语言模型在全局依赖捕捉上的优势,与卷积子层对局部特征的聚焦能力,实现对谣言语义长距离逻辑关联与细粒度语言线索的同步捕捉,有效弥补此类预训练模型在局部关键特征捕捉上的固有局限。实验结果表明,该检测方法在BuzzFeed和PolitiFact数据集准确率分别达到82.24%、93.91%。
  • 刘梓熠, 沙灜
    计算机工程. 2026, 52(10): 407-417. https://doi.org/10.19678/j.issn.1000-3428.0252069
    摘要 ( ) PDF全文 ( )   可视化   收藏
    视觉语言导航 (VLN) 任务旨在引导智能体根据语言指令在3D或真实环境中移动到目标位置。然而,传统端到端深度学习VLN算法存在不足,智能体在导航规划中一旦出现错误动作,就容易进入错误路径,导致无法继续遵循指令或探索不必要的区域。为了解决这一问题,提出一种基于大语言模型(LLM)和探索模块的智能体Nav-Explore。该智能体利用LLM强大的推理能力,结合语言指令和当前视觉信息预测下一步动作,并引入探索模块以平衡探索与利用。探索模块通过 ε-greedy策略决定智能体在正常导航和探索模式间切换,当随机概率小于 ε 时进入探索模式,智能体通过探索可能的未来路径,提前评估下一步行动的可行性,从而有效避免做出错误决策。而当随机概率大于 ε 时,智能体直接采用LLM输出的动作进行导航。这种模块化设计使得 Nav-Explore 方法能够有效地提升导航成功率,并增强智能体在未见环境中的泛化能力。实验结果表明,Nav-Explore在Touchdown和Map2seq 2个户外环境VLN基准数据集上取得了优异的性能,显著提升了导航成功率。此外,Nav-Explore也展现出较强的泛化能力,能够在不同的环境中有效地完成导航任务。
  • 新一代网络与边缘计算
  • 梁月冰, 钱博豪, 朱梦莹, 郑小林
    计算机工程. 2026, 52(10): 418-428. https://doi.org/10.19678/j.issn.1000-3428.0070444
    摘要 ( ) PDF全文 ( )   可视化   收藏
    随着微服务架构在数字服务网络中的广泛应用,数字服务网络中服务节点规模的庞大和调用关系的复杂性给运维管理带来了严峻挑战。目前,分布式追踪技术在研究和应用领域已经取得显著进展。然而,该技术仍面临诸多限制,包括需要侵入系统源代码、依赖特定中间件,甚至在生成追踪路径时的准确性和完整性不足,导致调用链出现链路缺失,从而影响基于可观测数据进行下游分析任务的可靠性。为此,提出一种面向追踪-度量的异质动态图神经网络(TM-HEDGE)。首先,构建了引入度量数据的调用异质动态有向图,通过快照内异质注意力编码器和快照间Transformer编码器进行节点异质时空表征学习;然后,通过链路补全分类器实现缺失调用链的补全,进而完成追踪链路重建。实验结果表明,所提的TM-HEDGE在3个公开数据集上执行追踪链路重建任务的准确率相比现有链路补全模型平均提升了5.22%,显著提高了数字服务网络中调用链的完整性,为数字服务网络的高效治理提供了可靠的技术支持。
  • 林澍, 黄家玮, 邵婧, 李思覃, 梁琦, 王启乐, 赵艺琳
    计算机工程. 2026, 52(10): 429-441. https://doi.org/10.19678/j.issn.1000-3428.0252087
    摘要 ( ) PDF全文 ( )   可视化   收藏
    在网络通信、网络流量管理等领域,快速、准确地识别大流对流量拥塞控制、恶意流量监测等任务具有重要意义。然而,现实网络环境中的数据流传输速率极高,使得大流检测变得异常复杂和具有挑战性。现有大多数大流检测方法主要依赖单一维度的统计数据,通常仅基于流中数据包的估计值进行流量统计与分析。这种方式的局限性在于其忽略了其他潜在维度的关键信息,如数据包间隔的分布特性,这些信息在准确识别大流时可能起到关键作用。针对上述问题,提出一种名为间隔值草图的大流检测算法。该算法通过引入流的估计值大小和数据包间隔分布特性这2个维度的流量特征,优化大流的保护与小流的替换策略。具体地,间隔值草图通过结合数据包间隔特性,有效区分大流与小流,从而在低内存条件下显著提升检测性能。为验证间隔值草图的准确性和有效性,采用CAIDA和MAWI两个真实网络流量数据集进行分析。实验结果表明,间隔值草图在多种内存设置和流量分布下均表现出显著优势,与现有方法相比,间隔值草图能够在内存资源受限的情况下保持较高的检测精度,F1值最高可达到现有方法的2.4倍。
  • 王纶羽, 顾益军
    计算机工程. 2026, 52(10): 442-454. https://doi.org/10.19678/j.issn.1000-3428.0252127
    摘要 ( ) PDF全文 ( )   可视化   收藏
    在恶意加密流量分类领域,模型通过增加流量特征维度来扩展判别表征的丰富性,但仍然存在选择模型与恶意加密流量数据特征不匹配以及特征选择不充分的问题,同时缺乏对加密流量数据特征的讨论研究。为此,针对物联网(IoT)恶意加密流量分类问题,提出一种基于多表征融合的分类模型。一方面,使用抽象表征学习模型学习流量会话的数据包级字节关联表征与会话统计表征;另一方面,使用明文表征学习模型学习未加密明文的会话连接表征。最后,根据抽象表征学习模型对分类结果的置信分数融合2个模型,获得最终的恶意流量分类结果。为验证模型的先进性,与7种基准模型进行实验比较,结果表明,所提模型的F1值达到0.769 4,相较其他基准模型均有大幅提升。同时,为验证模型中各个模块与流量表征学习的适配性、选择特征所含判别表征之间的互补性,生成10种基于不同输入与不同模型架构的变体模型进行比较,结果表明,该模型具有更优的检测性能,证明了模型架构的适配性与表征之间的互补性。
  • 张航, 王劲松
    计算机工程. 2026, 52(10): 455-464. https://doi.org/10.19678/j.issn.1000-3428.0252187
    摘要 ( ) PDF全文 ( )   可视化   收藏
    对于计算资源有限的用户设备(UD)而言,处理计算密集型任务较为困难。边缘计算通过将计算资源扩展到网络边缘来处理计算密集型任务,其关键功能之一便是计算任务的合理卸载。如何协调众多边缘节点的计算资源进行任务卸载,且在任务卸载过程中保障数据安全,是其重要挑战。因此,提出一种基于深度强化学习(DRL)的任务安全卸载方法。首先,构建边缘计算网络模型,并为其设计可变的安全防护机制,以适应性地保障数据安全;然后,将边缘计算网络模型和任务目标进行形式化,并将其转化为马尔可夫决策过程(MDP);最后,提出一种基于惩罚动作空间的DRL方法,给出最优的任务卸载策略。仿真结果表明,所提方案可以在进行安全防护的同时,降低时延和能源消耗成本,且始终保持零任务丢失率。