作者投稿和查稿 主编审稿 专家审稿 编委审稿 远程编辑

最新录用

Please wait a minute...
  • 全选
    |
  • 刘志卓, 张玉杰, 刘志邦, 徐朝农
    录用日期: 2026-08-19
    随着Transformer模型在计算机视觉、自然语言处理等领域的广泛应用,推理请求数量呈现指数级增长趋势,任务规模的迅速扩张对模型推理吞吐率提出了更高的要求。现有推理框架主要通过算子融合、内核生成和图优化提升局部执行效率,但Transformer模型中的不同算子对Tensor Core、CUDA Core和内存带宽等硬件资源具有不同的需求偏好。受数据依赖限制,这些算子通常仍按拓扑顺序执行,导致不同资源之间难以形成充分重叠,限制了推理吞吐量的进一步提升。针对上述问题,提出一种基于批次分割的Transformer流水推理方法。Transformer模型由矩阵乘法、归约、逐元素计算和张量重排等多类算子组成。结合算子的资源占用特征及离线性能分析结果,将其划分为Tensor Core密集型、CUDA Core密集型和内存带宽密集型三类,为后续的跨子批次流水调度提供依据。随后,针对传统方法执行中严格数据依赖导致不同资源类型算子难以重叠的问题,将原始推理批次划分为三个规模可调的子批次,并在保持各子批次内部计算图拓扑依赖的前提下进行并行调度。通过使不同子批次处于不同的计算阶段,资源偏好不同的算子可在时间维度上形成流水重叠,从而降低同类资源竞争和减少流水线空泡,提高硬件资源利用效率。进一步地,将三个子批次的规模确定问题建模为离散优化问题,以计算图拓扑依赖和三类资源容量为约束,以三个子批次规模为决策变量,并以端到端推理吞吐量最大化为优化目标。考虑到不同子批次规模会改变各流水阶段的执行时长、资源占用和重叠程度,基于离线性能查表构建吞吐量评价函数。该函数综合考虑三个流水阶段的预计执行时长及其均衡程度:当某一阶段持续时间明显长于其余阶段时,其他阶段容易提前完成并进入等待,从而降低流水重叠效果。因此,算法优先选择能够缩短瓶颈阶段、平衡各阶段执行时长并减少资源空泡的候选划分方案。在此基础上,设计滑动窗口启发式搜索算法,在每轮迭代中评估当前窗口内的邻域候选划分方案,并根据评价结果调整子批次规模;同时采用窗口衰减、收益饱和和资源阈值等机制控制搜索过程,以低搜索开销获得吞吐量最优的批次划分方案。在NVIDIA GeForce RTX 4090 GPU上,在ViT-Base、Conformer-L、BERT-Base、GPT2-XL、BLOOM-7B1和LLaMA3-8B等六个具有代表性的Transformer模型上开展实验,覆盖视觉、语音、自然语言理解和生成式大语言模型等应用场景。实验结果表明,在不同模型和批次规模配置下,该方法相较于Welder、PyTorch Inductor、TensorRT、ONNX Runtime、MetaAttention和NanoFlow,吞吐量至多可提升1.74倍、6.26倍、1.79倍、8.94倍、3.56倍和3.68倍。结果验证了所提方法能够有效挖掘不同资源类型算子之间的互补性,并在多种Transformer推理负载下提升推理吞吐量。
  • 侯冬冬, 刘京菊, 许文博
    录用日期: 2026-08-19
    摘 要: 通用漏洞评分系统(Common Vulnerability Scoring System,CVSS)是漏洞优先级排序、修复决策和合规审计中的核心依据。在真实安全运营中心中,扫描器输出的端口、协议、服务、横幅和版本号等半结构化信息往往早于通用漏洞与披露(Common Vulnerabilities and Exposures,CVE)描述到达,而现有自动化评分方法大多依赖结构完整的漏洞描述文本,难以适配“扫描数据先到、漏洞描述滞后”的处置流程。同时,CVSS基础向量由攻击途径、攻击复杂度、所需权限、用户交互、作用域以及保密性、完整性和可用性影响等8项指标共同组成,任一字段误判都可能改变漏洞风险排序,因此模型不仅需要预测单项标签,还需要一次性生成语义一致、可复核的完整基础向量。针对上述问题,本文提出一种面向CVSSv3.1基础向量的可解释多标签预测模型VulXbert。该模型采用双通道语义对齐框架,分别对漏洞描述文本和主机扫描输出进行编码,并利用安全领域预训练语言模型SecureBERT增强对漏洞术语、服务名称、端口协议和半结构化符号的表达能力。在训练阶段,模型通过归一化温度标度交叉熵对比学习将描述侧与扫描侧输入映射到统一嵌入空间,从而缩小公开漏洞描述与真实扫描日志之间的表达差异;在预测阶段,模型以共享表征为输入,构建8个任务特定的softmax分类头,一次前向传播同时输出CVSSv3.1基础向量的全部字段。为降低类别不平衡对少数类标签的影响,本文引入类别加权交叉熵,并在训练集中按标签频率归一化权重。此外,本文结合输入—梯度显著性分析,为每一项预测结果输出词元级关键证据,使安全分析人员能够定位支撑攻击途径、所需权限或影响范围判断的关键字段,提升模型结果的透明度、可审计性和人工复核效率。实验基于国家漏洞数据库(National Vulnerability Database,NVD)中2016年至2024年包含完整CVSSv3.1基础向量的约6万条记录及真实扫描数据构建,并在统一数据划分和统一评价指标下与CVSS-BERT、BERT-multi、Costa等提出的CVSS指标预测方法、Kühn等提出的基于开源情报信息源的CVSS向量预测方法以及AutoCVSS方法进行对比。结果表明,VulXbert在Macro-F1、Micro-F1、Hamming Loss和Exact Match Accuracy上分别达到0.89、0.91、0.054和68%。进一步的逐指标实验显示,VulXbert在攻击途径、所需权限、作用域和三项影响指标上均取得更稳定表现;消融实验表明,安全领域预训练编码器、跨来源语义对齐和联合多头预测结构均对模型性能有明显贡献。综上,VulXbert通过跨来源语义对齐、多标签联合预测和证据级解释输出,为扫描日志先到条件下的自动化、可解释CVSS基础向量生成提供了一种可扩展方案。
  • 应文灏, 沈晓宇, 朱鹏, 向声, 刘钦源
    录用日期: 2026-08-19
    数字经济时代,数字金融在缓解中小微企业融资约束、服务实体经济中发挥着关键作用。然而,中小微企业普遍存在财务不规范、缺乏抵押物等问题,导致信贷风险评估面临严重的信息不对称。传统的风控模型高度依赖企业季度或年度的静态财务报表,数据存在显著的滞后性,难以客观、实时地刻画企业的真实经营动态。近年来,高频电力负荷数据因能客观连续、抗篡改地映射企业实际生产状况(如产线开工率与设备利用率),逐渐成为替代性风控数据的核心。现有基于电力数据的信用评估方法主要依赖专家规则引擎或纯数据驱动的深度学习模型。然而,这些方法在金融业务实际落地中存在显著局限:传统专家规则过于僵化,难以捕捉海量非线性时序中的隐蔽异常;而纯数据驱动模型在面对冗长的高频序列时极易陷入“黑盒”困境,并且极易受到气象环境突变与日常短时停机(如交接班、常规检修)等正常波动的干扰。这导致模型缺乏精准聚焦核心违约风险的能力,无法提供满足金融合规审计要求的可溯源证据链。针对上述问题,本文提出了一种基于多源异构数据的电力预测与信用风险联合预警研究,旨在打通从底层物理电力波动到高层信用违约的映射机理。首先,在跨频特征感知阶段,本文利用零阶保持机制实现日级宏观气象协变量与15分钟级高频用电序列的精准对齐,建立动态预测基线并剥离排除环境温度干扰后的经营动态残差,从而物理性解耦并提取出真实的微观经营异常。其次,在知识表示阶段,本文摒弃了变量简单拼接的方法,而是通过多热编码与特征投影技术,将企业业务语义(所属行业门类)、资质标签(如涉诉违约状态)及量化资本(如注册资本、合同容量)深度表征为稠密的异构知识矩阵,构筑出企业专属的先验风控画像。最后,本文设计了知识引导的多头交叉注意力机制,以企业画像知识矩阵为先验查询滤波器,对高频残差序列进行深度降噪与特征提纯。该机制能够引导网络自适应地忽略常规生产节奏带来的负荷突降,精准放大由于订单断崖式萎缩或资金链断裂导致的结构性异常掉电信号。此外,为了在同一框架内协同优化预测与识别任务,本文引入了基于同方差不确定性的多任务自适应动态损失函数。该机制结合多分类焦点损失,有效应对了四级风险等级天然极其不平衡的难题。同时,模型附加了电气物理容量上限约束与风险单调性逻辑约束,在保证高精度负荷预测的同时,显著提升了联合判别能力与模型内部的可解释性。我们在全球头部电力企业的真实业务数据集上进行了大规模实验。实验结果表明,本文提出的方法在负荷预测与信用评级两大任务上均优于基线模型,取得了当前最优表现。
  • 王春艳, 张强
    录用日期: 2026-08-19
    针对多模态情感分析中视觉、音频等非语言模态容易受到采集环境、个体表达差异和模态质量波动影响,从而在融合过程中引入噪声并造成预测偏差的问题,本文提出一种视听残差补偿多模态情感分析方法。该方法的研究目的并不是重新构建完整的多模态融合框架,而是在已有语言聚焦多模态融合模型的基础预测结果之外,增加一条受控的视觉-音频残差补偿路径,使非语言模态能够在参与基础融合预测的同时,对基础预测中尚未被充分刻画的剩余偏差进行输出级校准。具体而言,模型首先对文本、视觉和音频三种模态进行编码,并利用语言聚焦的多模态融合结构生成基础多模态预测结果;随后,将语言聚焦后的视觉增强表示和音频增强表示进行拼接,输入由全连接映射、非线性激活、Dropout、短接连接和标量输出层组成的残差补偿分支,得到视觉-音频补偿项。为避免补偿分支对基础预测结果产生过量修正,本文进一步引入前向补偿权重、残差截断阈值、补偿幅值正则项和残差监督目标,使补偿分支学习基础预测结果与真实情感标签之间的剩余偏差,而不是重新拟合完整情感标签。考虑到不同数据条件下基础预测稳定性和残差模式充分性可能存在差异,本文分别设计端到端残差补偿训练路径和残差补偿结合分阶段训练路径。在 CMU-MOSEI 数据集上,模型采用先训练基础预测分支、再训练残差补偿分支、最后联合微调的 Residual+Stage 路径;在 CMU-MOSI 数据集上,模型采用基础预测分支与残差补偿分支同步更新的 Residual-only 路径。为避免仅依赖跨数据集比较带来的混杂因素,本文还在 CMU-MOSEI 上构造不同训练规模的下采样受控实验,通过保持验证集、测试集、模态特征配置和评价脚本不变,观察训练样本规模变化对残差训练路径适配性的影响。实验结果表明,本文方法在 CMU-MOSEI 和 CMU-MOSI 两个公开数据集的六项评价指标上均优于 DLF 基线模型。在 CMU-MOSEI 上,本文方法的 Acc-7、Acc-5、Acc-2 和 F1 分别达到 55.26%、57.04%、86.91% 和 86.88%,相较于 DLF 分别提升 1.36、1.34、1.49 和 1.61个百分点;相关系数由 0.764 提高至 0.780,平均绝对误差由 0.536 降低至 0.530。在 CMU-MOSI 上,本文方法的 Acc-7、Acc-5、Acc-2 和 F1 分别达到 48.19%、54.50%、86.67% 和 87.70%,相较于 DLF 分别提升 1.11、2.17、1.61 和 2.66个百分点;相关系数由 0.781 提高至 0.800,平均绝对误差由 0.731 降低至 0.721。结构消融实验进一步表明,在 CMU-MOSEI 上,Residual+Stage 路径取得最佳综合性能,F1、Corr 和 MAE 分别为 86.88%、0.780 和 0.530;而在 CMU-MOSI 上,Residual-only 路径表现更优,F1、Corr 和 MAE 分别为 87.70%、0.800 和 0.721,说明残差补偿分支的效果与训练路径组织方式密切相关。损失项消融实验显示,加入残差监督损失、补偿幅值正则项和样本加权机制后,模型性能逐步提升,说明这些约束能够改善补偿方向、限制过量修正并增强残差学习效果。训练规模受控实验显示,当 CMU-MOSEI 训练比例为 10% 和 25% 时,Residual-only 表现更稳定;当训练比例增加到 50%、75% 和 100% 时,Residual+Stage 逐渐取得优势,表明训练样本规模变化会影响基础预测误差模式的稳定性和补偿分支训练路径的适配效果。补偿量统计结果进一步显示,CMU-MOSEI 和 CMU-MOSI 上实际补偿量的平均绝对值分别为 0.018 和 0.021,接近补偿边界的样本比例分别仅为 2.6% 和 3.1%,说明补偿分支并未对基础预测进行大幅度改写,而是在较小范围内进行受控校准;两个数据集上的补偿方向一致率分别为 63.4% 和 65.7%,有效校准率分别为 58.9% 和 60.8%,进一步说明补偿分支能够在多数样本上朝降低基础预测误差的方向修正。计算开销分析表明,残差补偿分支仅增加约 2.03×104个参数,模型参数量由 111.23M 增加到 111.25M;CMU-MOSEI 和 CMU-MOSI 上单轮训练时间分别增加约 2.5% 和 3.1%,单样本推理时间均增加约 2.2%,说明该补偿机制在提升预测性能的同时并未显著增加计算负担。综合实验结果表明,视听残差补偿能够以较小的参数和时间开销改善基础多模态预测结果,残差监督与幅值约束有助于降低非语言模态导致过量修正的风险,而不同训练路径在不同数据条件下具有不同适配性。该方法为多模态情感分析中辅助模态的受控利用和输出级偏差校准提供了一种可行思路。
  • 陈大鹏, 庄舟, 申连顺, 李晨凯
    录用日期: 2026-08-18
    盲文是视障群体获取信息、接受教育、参与社会生活的基础性文字载体,中文到盲文的自动精准翻译是推进信息无障碍、保障信息公平的关键技术支撑。当前中文‑盲文自动转换领域仍面临多重技术瓶颈:传统基于规则与词典的方法高度依赖人工编写的拼音映射以及分词连写与标点转换规则,缺乏深层上下文语义理解能力,在多音字消歧、歧义句式判定、长句语义建模等场景中准确率偏低;通用神经机器翻译模型虽具备端到端建模能力,但在中文‑盲文低资源平行语料条件下易出现泛化不足、序列对齐偏差等问题;现有神经网络模型多采用统一前馈结构,难以对语义理解、盲文分词、符号生成等差异化语言现象进行分工建模,导致复杂文本翻译流畅度不足、规则一致性差。为突破上述局限,本文提出一种融合预训练语言模型与混合专家网络的中文到盲文翻译模型,构建兼顾语义理解深度与任务专门化能力的端到端翻译架构。模型以编码器‑解码器为基础框架。编码器采用预训练BERT模型作为核心语义提取模块,充分利用其双向上下文编码能力,提升对中文多音字、歧义结构、长距离语义依赖的捕捉能力;在BERT输出层后引入混合专家网络增强层,通过可学习门控网络计算不同专家的路由权重并动态融合专家输出,从而增强模型对语义特征、盲文分词边界、标点与特殊符号等差异化语言信息的处理能力。解码器由6层Transformer Decoder堆叠构成,以编码器输出的增强语义表示为条件,结合目标盲文序列嵌入与位置编码信息,通过自回归方式逐步生成目标盲文符号序列。为支撑模型训练与评估,本文与盲校合作整理构建了中文-盲文平行语料库,语料内容涵盖新闻资讯、文学作品、科普教育、公共服务文件和日常交流文本等常见类型,并通过数据清洗、重复样本去除和盲文符号规范化等步骤提升语料的一致性和可用性。实验采用双语评估替补(BLEU)、字符错误率(CER)、字符级准确率(CharAcc)和完全匹配率(EM)等指标,分别从整体n-gram一致性、字符级编辑错误、字符级正确程度和序列完全一致性等方面评价模型性能。在相同训练数据、数据划分、预处理流程和评价设置下,本文模型在自建测试集上的BLEU、CER、CharAcc和EM分别为98.15%、1.46%、98.54%和63.99%。与标准Transformer基线模型相比,本文模型的BLEU提高11.64个百分点,CER降低17.24个百分点。消融实验结果表明,单独引入混合专家网络后,BLEU由86.51%提高至92.12%,CER由18.70%降低至10.17%;单独引入BERT编码器后,BLEU达到97.02%,CER降低至1.84%。当同时使用BERT编码器与混合专家网络时,模型在本文设置的消融模型中取得最佳结果,说明二者具有一定的互补作用。面向视障用户的主观实验结果表明,翻译方法对盲文阅读评分具有显著影响,本文模型在日常生活、科普教育和文学艺术三类文本的阅读流畅度、内容辨识度和语义准确性方面均取得较高评分,且评分分布较为集中。综合自动评价、消融实验和用户实验结果,BERT语义编码能够增强中文输入的上下文表示,混合专家机制能够依据输入特征动态融合专家输出,二者结合有助于降低盲文字符级错误并提高完整序列匹配率。本文方法在中等模型规模下取得了较好的中文到盲文翻译性能,可为盲文出版、数字读物无障碍转换、智能助盲终端和公共信息盲文服务等应用提供技术支持。
  • 孙坦博, 钟帅, 胡欣骜, 王丽萍, 许晓宇
    录用日期: 2026-08-17
    针对图像篡改检测中对尺度微小、边缘模糊的篡改区域感知能力不足,易导致漏检;空域与频域等多域特征的融合机制多采用简单拼接或串行注意力,未能充分挖掘跨域特征的互补性与协同判别能力;复杂模型往往参数量大、计算开销高,难以在资源受限的实际部署场景中实现精度与效率的平衡等问题,本文提出一种融合双流特征与注意力聚合机制的图像篡改检测网络FDU-Net。该方法基于U型编码器-解码器架构,构建RGB与JPEG双流并行输入机制:RGB流直接处理原始图像,旨在提取色彩、纹理及结构等空间域表观特征,以捕捉篡改区域与背景在视觉一致性上的差异;JPEG流则通过精心设计的伪影提取模块,将图像映射至频域表示,利用多层卷积捕获压缩域中因篡改操作遗留的块效应、量化误差及频谱异常等隐蔽痕迹,从而有效弥补单一空域特征对后处理操作鲁棒性不足的缺陷。在骨干网络方面,为兼顾特征表达效率与计算经济性,本文采用轻量化的MobileNetV4作为双流共享骨架,并针对篡改检测任务对高频边缘信息的特殊敏感性,提出采用UIB-1与UIB-2两种通用倒置瓶颈模块变体进行差异化组合配置——其中UIB-1通过前置深度卷积预处理缓解下采样过程中的高频信息丢失,UIB-2借助后置深度卷积增强感受野与通道交互,从而在5个尺度上输出富含多尺度语义与细节的特征图。在特征融合阶段,本文设计了双流注意力特征融合模块,该模块突破传统串行或单维度注意力机制的局限,通过跨域多头自注意力在通道与空间维度上并行建模RGB与JPEG特征之间的长程依赖关系,并引入线性压缩层降低计算复杂度,实现了双流特征的深度交互与自适应提纯,有效解决了多域特征融合不充分的问题。此外,为提升篡改边界的定位精度,本文引入精度检测头模块,该模块串联通道注意力与空间注意力双重机制:通道注意力通过全局池化与全连接层筛选判别性特征通道,空间注意力融合平均池化与最大池化结果以强化边界响应,二者协同作用显著增强了模型对边缘模糊及微小篡改区域的敏感度。本文在CASIAV1、CASIAV2、COVERAGE、IMD2020以及基于PASCAL VOC2012自制的VOC2012TAMPER等多个公开及自建数据集上开展了大量实验。实验结果表明模型F1分数达0.8921,在F1、MCC及AUC等关键指标上均优于现有优秀主流算法,所提方法在检测精度、鲁棒性与泛化能力方面表现优异,且模型参数量较低,具备良好的实用性与可部署性。
  • 秦熙明, 赵玉琦, 和诗雨
    录用日期: 2026-08-17
    在高负载边缘环境中,突发任务到达与边缘节点CPU、输入输出、带宽和内存等多维资源受限之间的矛盾,容易引发排队拥塞和资源碎片化,进而影响资源利用率、运行时间和等待时间等调度指标。针对现有学习式方法对任务与服务器之间高阶资源竞争关系刻画不足、连续模型输出难以直接转化为满足容量约束的离散放置方案的问题,提出一种基于超图建模与装箱解码的边缘任务调度方法EdgeHypOp。该方法以资源利用率、运行时间和等待时间为联合优化目标,将当前调度窗口内的任务节点与服务器节点构造成二部超图,并设置容量超边、任务—服务器超边、时延超边和利用率超边,分别描述多任务共享资源预算、候选放置关系、任务等待状态和系统整体负载。为控制高负载条件下的在线调度开销,依据任务等待时间和执行时长计算紧急度,并限制单轮候选批次规模。随后,利用多层超图神经网络在节点与超边之间传播信息,获得融合资源需求、剩余容量和高阶竞争关系的任务表示与服务器表示,并通过双线性匹配生成任务—服务器评分矩阵。针对评分结果无法直接满足离散容量约束的问题,设计融合Tetris思想的多资源装箱解码策略,在可行候选集合内综合考虑模型评分、任务需求与服务器剩余资源的匹配程度、等待优先级和执行时长,逐步完成任务放置并同步更新服务器状态;在初始放置结果上进一步调整服务器内部任务顺序,以缓解长任务对短任务的阻塞。基于Google Cluster Trace、Alibaba Cluster Trace和EUA 3个真实数据集开展实验,并与FCFS、HRRN、RLPNet、PSNet、HyperJet和aRL进行比较。主要实验采用相同的任务规模、服务器规模和测试实例,通过10次重复运行统计均值与标准差。在任务数为2000、服务器数为5的代表性高负载配置下,EdgeHypOp在3个数据集上均取得最高资源利用率。相对于各数据集上的最优基线,在Google Cluster Trace上资源利用率提高3.93个百分点,运行时间和等待时间分别降低4.18%和14.03%;在Alibaba Cluster Trace上分别提高2.01个百分点、降低2.25%和8.16%;在EUA上分别提高2.10个百分点、降低2.19%和0.65%。任务规模与服务器规模变化实验表明,任务数量增加或服务器资源受限时,所提方法在资源利用率和等待时间方面的优势更为稳定;在低负载或资源供给较充足时,各方法差距有所缩小。消融实验表明,去除二部超图建模或多资源装箱解码后,综合目标值分别上升7.89%和4.29%,说明高阶关系表示与约束感知解码是性能改进的主要来源;去除局部优化后,综合目标值上升2.46%,且该模块对CPU和内存高需求任务的改善更明显。在线开销测试显示,任务规模由500增至2000时,推理时间由704.49 ms增至2178.42 ms,CPU和GPU峰值内存增幅较小。模型训练在离线阶段完成,在线阶段仅执行批次选择、超图构建、前向传播、评分、装箱解码和局部优化,不进行梯度更新。实验结果表明,EdgeHypOp能够将高阶资源竞争表示、多维容量约束和离散任务放置统一到同一调度流程中,适用于任务并发度较高、资源竞争和碎片化较明显的边缘任务调度场景;在低负载、单一资源瓶颈或强任务依赖场景下,仍需结合相应约束进一步扩展。
  • 张宸瑜, 周泽金, 袁艺嘉, 张文芳
    录用日期: 2026-08-17
    工业物联网(IIoT)的大规模部署使工业网络面临日益复杂的安全威胁,网络入侵检测成为保障IIoT系统安全运行的关键手段。然而,IIoT流量中各攻击类别的样本规模差异巨大,现有检测模型对少数类高危攻击的识别能力不足;同时,基于Transformer等复杂架构的方法参数规模与计算开销较大,难以适应边缘设备的资源约束。为此提出一种层次化特征自适应型网络(HLAF-Net),实现对类别不平衡流量的高精度、低时延检测。在数据处理层面,IIoT流量中部分连续特征呈长尾或稀疏分布,直接归一化时其判别信息易被极端值主导或被海量零值稀释。通过对该类特征进行对数数值变换,压缩极端值与常规值之间的数量级差异,使样本间的判别距离在归一化后得以保留。在结构设计层面,按各攻击类别的样本数量将分类任务分解为若干层级。由于每一层级仅需处理本层的样本子集,用于区分浅层类别的部分特征在该子集上取值恒定,不再提供判别信息,故引入零方差准则逐层剔除此类冗余特征,为各层级单独构建特征子空间。在网络架构层面,每一层级先以门控注意力机制对输入特征进行自适应重标定,再由轻量的多层感知机(MLP)与显式特征交互分支(EFIB)分别提取语义表征与高阶交互特征,二者融合后经分类输出层得到各层级预测。推理阶段各层级并行输出预测概率,通过逐层级联的决策逻辑确定最终类别。在Edge-IIoTset与X-IIoTID两个公开数据集上对HLAF-Net进行了实验验证。消融实验表明,对数变换带来最为显著的增益,使Macro-F1值由77.16%提升至91.04%;层次化架构在高质量输入特征的支撑下进一步将Macro-F1值提升至95.06%;门控注意力机制则提高了深层的训练收敛稳定性。在Edge-IIoTset数据集上,HLAF-Net的检测准确率达到98.89%,Weighted-F1值达到98.91%,单样本推理时间仅为0.0979ms,在保证检测精度的同时满足边缘部署的实时性需求。五轮独立运行下,准确率与Weighted-F1值的标准差均低于0.0002,表明模型性能稳定,不依赖于特定的随机初始化条件。与同样基于层次化分治思想的模型相比,HLAF-Net的准确率与Weighted-F1值分别提升2.18%与2.70%,验证了独立特征子空间与网络分支设计的有效性。在X-IIoTID数据集上,模型的准确率与Weighted-F1值均达到98.98%,进一步证明其在不同IIoT环境下的有效性与鲁棒性。
  • 包红丽, 贾向东
    录用日期: 2026-08-17
    通感一体化(Integrated Sensing and Communication,ISAC)被认为是未来无线网络的关键技术之一。可重构智能表面(Reconfigurable Intelligent Surface,RIS)辅助的多无人机(Unmanned Aerial Vehicle,UAV)协同ISAC系统能够同时发挥传播环境调控与空域机动优势,但也面临变量耦合强、优化维度高和通信—感知性能难以协同提升等问题。为此,提出一种RIS辅助多UAV协同ISAC系统联合优化方法。构建由多架UAV、多个地面基站、单个感知目标和RIS组成的三维离散时隙系统模型,统一刻画UAV运动约束、RIS反射机制、空地通信过程与目标感知过程;以系统总通信速率和基于无量纲化费舍尔信息矩阵(Fisher Information Matrix,FIM)对数行列式的感知性能指标为联合目标,建立关于发射波束、UAV轨迹和RIS相移的非凸优化问题。其中,FIM感知项由直接链路和RIS辅助链路对目标位置参数的信息贡献累加得到,可显式反映UAV空间部署、RIS位置和目标观测几何结构对感知性能的影响。针对该问题目标函数非凸、单位模约束难处理、通信干扰项和感知项高度耦合等特点,设计交替优化(Alternating Optimization,AO)求解框架,将原问题分解为发射波束优化、UAV轨迹优化和RIS相移优化三个子问题。在发射波束优化中,利用加权最小均方误差(Weighted Minimum Mean Square Error, WMMSE)方法将加权和速率最大化问题转化为等价的迭代最小化问题,并结合感知权重引导波束资源分配;在UAV轨迹优化中,采用逐次凸近似(Successive Convex Approximation,SCA)方法对通信速率项、感知效用项和安全距离约束进行局部凸化,并引入信赖域和平滑正则项提高轨迹可执行性和数值稳定性;在RIS相移优化中,将单位模约束下的非凸二次规划问题转化为半定松弛(Semidefinite Relaxation, SDR)问题,并结合分组策略和高斯随机化降低高维RIS相位恢复复杂度。仿真结果表明,所提算法在不同系统参数和不同网络几何部署下均表现出稳定的收敛特性,通常在8~15次迭代内达到稳定状态。基于100次独立蒙特卡罗试验的统计结果显示,与无RIS方案相比,所提RIS辅助联合优化方法可使系统平均通信速率提升24.83%,说明RIS的传播环境调控能力能够有效增强空地通信链路质量;与仅通信优化方案相比,引入FIM感知项后,多UAV平均飞行高度提升16.58%,说明联合目标能够引导UAV形成更有利于目标定位的空间观测结构,能够在满足多UAV安全飞行约束的同时实现通信性能与感知性能的协同优化;权重敏感性实验与UAV数量影响实验进一步表明,RIS的传播环境调控能力、多UAV的空间机动能力以及FIM感知信息量建模之间具有明显协同作用。综上可得,所提方法能够在满足UAV安全飞行约束和RIS单位模约束的条件下,实现通信速率提升、感知几何结构改善和系统综合效用增强,可为复杂空地ISAC网络中的联合资源配置与轨迹设计提供有效方案。
  • 屠乃威 , 孟祥宇
    录用日期: 2026-08-17
    针对输电线路绝缘子缺陷(如破损、闪络)检测任务中,由于航拍图像背景干扰强烈、缺陷目标微小且尺度差异巨大,加之绝缘子具有细长且空间分布任意的几何各向异性特征,导致传统目标检测模型在此类任务中存在感受野不匹配、特征融合存在语义鸿沟、检测头参数冗余以及微小缺陷漏检率高的问题。为满足无人机等边缘计算设备对模型存储开销与推理实时性的严苛限制要求,本研究提出了一种基于改进YOLO11n的轻量级且高效的绝缘子检测算法DDE-YOLO,旨在实现检测精度与计算效率的最佳平衡。本算法在特征提取、特征融合及预测回归三个维度进行了深度重构。第一,在主干网络中创新性地设计了动态起始混合模块(C3K2-DIMB)。其内部的动态Inception深度可分离卷积采用并行的正方形、水平带状和垂直带状卷积核提取多方向特征,并结合通道级动态权重机制,使网络能够自适应感知绝缘子的细长分布特征与空间方向,有效过滤背景噪声并增强有效特征表达。第二,针对多尺度特征融合时信息丢失问题,构建动态自适应双重融合网络(DAFPN)。该网络利用动态注意力门控融合模块(DAGF),通过分组交互与双向门控机制动态筛选多层级语义信息,生成基于全局上下文的特征权重,显著抑制了背景干扰,有效弥合了深层语义与浅层细节间的鸿沟,强化了复杂背景下对微小缺陷纹理的捕获能力。第三,设计了基于共享细节增强的轻量级检测头(ESDH)。该模块在多尺度检测层间实施特征提取与回归权重的跨尺度共享,并采用组归一化(GN)提升训练稳定性。针对参数共享带来的尺度敏感性下降问题,在回归分支末端引入了可学习的尺度校准因子。此外,采用细节增强卷积(DEConv),在训练阶段通过差分卷积分支强化高频边缘细节的提取,在推理阶段通过结构重参数化技术将其等效融合为单层标准卷积,实现零额外推理开销的性能提升。在绝缘子数据集上进行的综合实验验证表明,DDE-YOLO算法实现了卓越的检测性能。该算法的精确率达到93.67%,召回率达到89.75%,mAP50高达93.86%,mAP50:95达到65.01%。相较于基准模型YOLO11n,其mAP50与mAP50:95分别实现了4.74和5.73个百分点的大幅提升,而模型总参数量仅为2.35M,较基线下降了约9.3%,计算量控制在7.0GFLOPs。消融实验证实,C3K2-DIMB模块在降低6.6%参数量的同时提升了定位质量,DAFPN使得破损和闪络的AP分别显著提升4.29%和3.47%,ESDH检测头单独使用则缩减了12.4%的参数量。此外,在公开的航拍绝缘子数据集(UPID)上进行的验证中,该模型mAP50达到87.64%,较基线提升1.62%;在跨领域的钢材表面缺陷数据集(NEU-DET)上,mAP50提升3.31%至79.27%,充分证明了其卓越的跨域泛化能力。该算法在显著提升微小破损和闪络缺陷检测精度的同时,有效削减了模型参数冗余并降低了计算复杂度,展现出优异的鲁棒性。
  • 赵娅迪, 魏苏波, 宋晨烨, 焦珊珊, 骆祥峰, 翁星宇
    录用日期: 2026-08-14
    针对现有任务链推演方法在复杂环境下难以准确捕捉深层语义和长程依赖,导致推演准确率和稳定性不足的问题,提出一种知识图谱增强的大模型作战任务链推演方法,以提升复杂战场环境下任务序列预测的准确性与稳定性。方法首先采用基于双向编码器的要素链接模块,将任务文本中的作战要素与外部通用知识图谱进行精准链接与消歧,获取要素的语义描述信息;进而构建任务组成成分图谱,利用TransE图表示学习方法学习要素间的复杂关系,得到知识增强的向量表示;在此基础上,通过自注意力机制融合任务链上下文与候选任务集,生成知识级任务状态表示,并与链式时序表示进行拼接,形成融合外部知识的综合状态;最后将任务链推演建模为强化学习问题,设计融合链式奖励(BLEU)和知识级奖励(余弦相似度)的多级奖励机制,指导模型进行多步推演。在NYT、Finance、ICEWS14和ICEWS15四个公开数据集上的实验结果表明,本方法在单步预测任务中准确率分别达到76.23%、74.39%、72.11%和70.09%,相比现有最优方法平均提升约19个百分点;在4步任务链预测中准确率分别达到71.76%、70.39%、68.97%和69.35%,显著优于各基线模型。进一步引入MRR、Hits@3和Hits@5三项排序指标进行多维度评估,并与SPARK、ThinkTank-ME等近年代表性方法及DeepSeek-V4-Flash大模型零样本推理基线进行对比,本方法在全部四项指标上均取得最优或近似最优的结果,其中MRR在NYT、ICEWS14和ICEWS15上分别达到78.64%、73.15%和72.83%。消融实验证实,知识融合机制与奖励设计对性能提升具有关键作用。本研究验证了知识图谱在增强语义理解与推演性能方面的有效性,可为智能化作战指挥决策系统提供技术支撑。
  • 张晗瑞, 张淑芬, 刘新蕊, 姜志, 王炯炯
    录用日期: 2026-07-30
    近年来,为了克服传统联邦学习在面临设备系统异构和通信带宽受限时的瓶颈,联邦原型学习(FPL)通过聚合低维的特征原型而非庞大的高维模型参数,极大降低了通信开销。FPL的开放式分布式架构使其在实际部署中面临着安全威胁:缺乏严格准入机制的网络极易遭受外部攻击者的身份伪造;同时内部恶意节点可通过上传恶意构造的虚假原型实施投毒攻击,严重破坏全局特征空间。针对FPL在开放网络环境下易遭身份伪造,且现有统计学防御机制在非独立同分布场景下难以区分恶意扰动与良性异构特征导致诚实长尾节点被误剔除的问题,提出了一种面向FPL的格陷门可控身份追溯机制(FedLHT)。该机制将安全防线从概率性统计检测转化为确定性数学计算,构建了事前匿名、事中验证与事后追责的完整轻量级防御架构。在初始化阶段,基于格密码构造无证书签名体系,利用原像采样算法实现身份标识与格上短向量私钥的密码学绑定,实现了验证权与追溯权的物理解耦;在匿名准入阶段,通过注入格上误差生成隐匿真实身份的可追溯标签,并结合拒绝采样技术输出非交互式签名,在保障信息论匿名性的同时消除签名对私钥的统计依赖。在聚合验证阶段,将非线性群运算全面降级为格上矩阵-向量的线性乘加计算,实现了轻量级的批处理准入;在靶向追溯阶段,监管实体利用独占的格陷门主基及其短正交化性质求解有界距离解码问题,从异常误差项中靶向恢复恶意节点的真实身份,进而驱动全局模型精准剥离恶意历史贡献以实现自愈。该机制的安全性严格规约至平均情况下的带误差学习(LWE)问题与小整数解(SIS)问题,从根本上赋予了系统抵抗未来大规模量子计算机攻击的后量子安全属性。在模型自愈层面充分利用了特征原型向量的线性叠加同态特性。锁定恶意身份后服务器仅需在全局原型池中执行低开销的向量减法,即可在常数级时间内抹除恶意节点的历史贡献,实现了训练过程的无缝衔接。与隐私保护联邦学习投毒防御机制(ShieldFL)及基于信任引导的鲁棒联邦学习机制(FLTrust)等方案相比,全局模型准确率在CIFAR-10数据集上维持在83.65%以上;在数据异构程度系数为1.0的严苛Non-IID环境下,对诚实长尾数据的保留率高达98.75%,实现了零误判响应。此外,在40个并发客户端规模下,客户端局部耗时仅1.22毫秒,服务器端身份验证总开销低至6.42毫秒,有效克服了传统双线性配对群签名方案的计算瓶颈,适用于资源受限的移动物联网场景。
  • 汪晨亮, 赵佳乐, 葛星彤, 彭玲
    录用日期: 2026-07-30
    历史文献作为人类文明与红色文化的核心载体,其文本内部蕴含着高度密集的时空线索与错综复杂的实体关联。然而,传统数字人文领域的知识组织方法长期面临多源史料碎片化、记述风格异构化以及人地时事指代模糊等瓶颈。通用大语言模型直接应用于历史文本处理时,极易因缺乏领域先验知识而导致实体边界识别失准;同时,历史实体普遍存在的同名异实与异名同实现象,使得传统实体对齐算法在海量图谱节点比对中面临计算复杂度随规模呈二次方增长的开销危机;此外,传统检索增强生成方法忽略了文本间隐式的时空拓扑约束,在应对跨时段历程梳理与复杂时空转移等叙事型问答时往往衍生逻辑失真。鉴于此,本文提出一种面向历史文献的大语言模型结合知识图谱的时空叙事增强框架,旨在实现大规模历史文本的高效结构化抽取、高精度关联融合以及深层次时空推理问答。 本文所提框架采取分层协同设计,包含知识抽取、实体对齐以及时空叙事智能问答三个递进式核心模块。在知识抽取阶段,针对历史文本专名密集且语法特殊的特征,设计了基于历史约束的提示词链框架,将单一的抽取任务解构为分步推理提示、领域先验知识注入以及结构化输出约束校正三个级联阶段,通过在上下文流中引入军事术语、历史地名及干支纪年对照表,实现非结构化文本向图结构数据的精准、大批量转化。在实体对齐阶段,为消除跨源多谱归并中的计算瓶颈,提出两阶段实体对齐算法。第一阶段引入索引优化筛选机制,构建涵盖文本别名、生命周期、地理层次映射及社会拓扑关系的四维混合索引,利用分桶策略将待对齐节点的搜索空间收敛至个位数,从而将整体算法的时间复杂度从平方级压缩至线性级;第二阶段执行大模型增强的语义判别,融合候选实体的动静态属性特征与多跳关联网络计算综合相似度,并借助置信度评估机制建立人机协同的分级决策闭环。在智能问答阶段,设计时空叙事图检索增强生成模块,通过指令微调或语义解析将自然语言查询映射为包含显式时空边界的结构化约束条件,动态生成面向图数据库的查询语言,进而从全局图谱中检索多跳关联的时空子图,将时序演进特征与空间拓扑结构完整传递至生成模型,驱动其生成具备严密逻辑链条与高可解释性的时空叙事文本。 为验证所提框架在实际场景下的鲁棒性与有效性,本文在自建红色历史文献数据集 N4A-Hist 以及公开历史数据集 CHisIEC 、多语言通用数据集 DBP15K 上进行了多维度的实证评估。实验结果表明,在面向非结构化文本的知识抽取任务中,提示词链框架在 N4A-Hist 和 CHisIEC 数据集上的 F1 指数分别达到 94.8% 和 92.1% ,较之基座模型直接抽取的基准性能分别提升了 16.3% 和 14.0% ,消融实验亦证实了分步约束对缓解格式幻觉的决定性作用。在跨源实体对齐测试中,两阶段实体对齐算法在 N4A-Hist 上的 Hits@1 达到 91.3% ,MRR 达到 0.962 ,且在线总耗时仅为 0.8 小时,相较于前沿的大模型对齐方法 ChatEA 、 LLM4EA 以及传统方法 EasyEA ,在保持同等或更高精度的前提下,运行开销缩短了 75% 以上,而在通用数据集 DBP15K 上同样保持了 98.3% 的 Hits@1 以及 4.2 小时的快速收敛表现,充分印证了四维索引在平抑计算规模扩张方面的优越性。在包含 530 条复杂推理指令的问答测试中,时空叙事图检索增强生成模块在空间位移型问题与跨时段综合推理型问题上的回答准确率较传统向量数据库检索分别大幅攀升了 47% 和 54% 。 综上所述,本文研究表明,将大语言模型深层的语义表征能力与知识图谱严谨的拓扑结构知识有机融合,是破解历史文献数字人文研究中高歧义性、强时空关联性瓶颈的有效途径。所提框架在保障自动化处理流转效率的同时,通过置信度过滤与多维约束机制平抑了技术落地中的不确定性风险,为海量、异构的历史文献资源
  • 庄崇毅, 查铖, 胡浩枫, 周泽伟, 孟雩昊, 赵卫薇, 洪颖浩
    录用日期: 2026-07-30
    低空无人机航拍图像中的微小目标检测面临尺度小、分布密集、背景干扰强和成像条件复杂等问题。与一般目标相比,微小目标在图像中仅占少量像素,其边缘、纹理和形状信息容易在特征提取过程中被背景响应淹没。现有检测方法通常通过多层卷积和逐级下采样获得高层语义特征,但这一过程会快速降低特征图空间分辨率,使微小目标的局部结构和像素级细节被削弱甚至丢失。虽然特征金字塔和注意力机制能够在一定程度上缓解尺度变化和背景干扰问题,但多数方法更侧重多尺度语义融合,对下采样阶段造成的细粒度空间信息衰减缺乏直接约束;同时,通道特征之间的协同建模不足,使分散在不同通道中的微小目标关键信息难以形成稳定的判别表达。 针对上述问题,提出一种基于重标定细粒度下采样和组间协同建模的微小目标检测网络RFINet。首先,构建重标定细粒度下采样(Recalibrated Fine-grained Downsampling,RFD)模块,以空间切片和通道重组替代传统下采样操作,将局部空间信息映射到通道维度,在降低特征图尺寸的同时保留微小目标的细粒度结构。针对通道扩展带来的冗余响应和背景噪声,RFD进一步引入跨通道自适应重标定机制,根据聚合特征的通道响应强度重新分配权重,从而增强目标相关通道并抑制无关背景。与直接采用步长卷积或池化操作相比,RFD并不简单丢弃空间采样点,而是通过结构化重排将原本容易被压缩的信息转移至通道域,为后续特征提取提供更完整的局部上下文。其次,设计组间协同建模(Inter-group Collaborative Modeling,ICM)模块,将输入特征划分为多个通道子空间,分别提取各组内的局部显著信息,并通过权重再分配、残差连接和通道拼接促进组内增强与组间交互。该设计既保留了分组建模对局部特征的细粒度刻画能力,又缓解了固定分组导致的信息隔离问题,使网络能够更充分地整合分散在不同通道中的微小目标线索。最后,在检测头中完成目标类别预测和边界框回归,实现复杂低空场景下的微小目标检测。 为验证所提模块的作用,本文从不同输入分辨率、模块消融、模型复杂度、检测精度以及跨数据集泛化等角度进行实验分析,以考察RFINet在微小目标密集分布、尺度变化明显和背景干扰较强条件下的综合性能。在VisDrone2019数据集上的实验表明,RFD有效保留细粒度信息并抑制通道扩增带来的背景噪声,ICM则通过组间交互强化关键区域响应,削弱无关背景干扰,二者结合后模型在不同输入分辨率下均取得稳定增益。RFINet在640×640和960×960输入尺寸下的mAP@0.5分别达到40.8%和47.5%,优于参与比较的主流两阶段检测器、单阶段检测器和轻量化检测模型。实验结果表明,所提方法能够在保持较高检测精度的同时增强对密集、遮挡和复杂背景中微小目标的表征能力,为低空无人机视觉感知任务提供了一种更具针对性的特征建模方案。
  • 于瓅, 杜泽熙
    录用日期: 2026-07-29
    现有点云补全网络主要依赖单模态点云自身的空间坐标和局部邻域特征进行形状推理,但部分点云通常存在点分布稀疏以及全局轮廓信息不足的问题,难以准确判断缺失区域的空间方向和结构边界,导致补全结构出现细节缺失和拓扑结构不连续的问题。以往跨模态点云补全方法需严格依赖于成对输入的多模态数据,多模态数据的采集和配准过程也会增加数据构建成本,难以直接在现实工程中应用。为此,提出一种基于双状态引导的跨模态点云补全网络(DSG-Net),旨在弥补单模态特征的固有表征不足。DSG-Net仅以输入进来的部分点云作为原始数据,在数据预处理阶段通过预设的针孔相机模型投影渲染生成对应的深度图来辅助单模态点云进行补全,从而摆脱了传统跨模态方法对严格配对多模态数据的依赖。首先,设计的跨模态融合生成模块(CMFG)将提取出来的点云特征和深度图特征利用卷积映射至相同的特征空间进行拼接融合,再通过多头自注意力机制将融合特征进行长距离建模,并将建模后的互补特征通过逐点拆分初步生成粗点云。其次,细化阶段引入双状态引导细化模块(DSGR),其包含结构分析与相似性比对两条并行处理通道。结构分析通道通过度量生成点云与输入部分点云之间的空间相关性,引导网络重点关注缺失区域的结构差异,以提升整体轮廓和局部结构的连续性。相似性比对通道则侧重于挖掘不同局部区域之间的潜在相似模式,引导缺失区域的拓扑优化,从而进一步增强补全点云的形态一致性与细节完整性。最后,DSGR模块内部集成状态流动模块(SFBlock),用于实现在迭代细化过程中特征状态的动态更新与有效传递。SFBlock模块通过双门控单元分别控制历史积累状态和当前输入特征的保留比例,可以动态调控细化过程中的局部细节和位置偏差,避免已恢复的形状信息在多次迭代中被削弱或冗余。为验证DSG-Net网络的有效性,在两个公开数据集PCN、ShapeNet55以及一个自建的兵马俑数据集上进行实验评估。实验结果表明,DSG-Net在公开PCN数据集上的平均CD-L1为 6.72,比PoinTr(8.38)的平均CD-L1相对降低19.81%。同时,DSG-Net在8个类别上的CD-L1指标均优于最新网络 3DMambaComplete,进一步说明了DSG-Net网络能够有效提升缺失区域的结构补全精度。在ShapeNet55数据集上,DSG-Net 在三种不同难度任务中的平均CD-L2达到 0.89,同时,在常见的五个类别中,DSG-Net在其中三类上取得最优补全效果。在自建兵马俑数据集上,DSG-Net的平均CD-L1为5.23,比PoinTr(5.84)的平均CD-L1相对降低10.45%,表明DSG-Net网络在非公开数据上具有较强的泛化性。综上,DSG-Net在公开数据集与自建数据集上均取得了良好的补全效果,说明其不仅能够有效恢复复杂物体的形状结构,还具有较强的跨数据集适应能力,可为后续文化遗产数字化建模与残缺文物修复提供有价值的技术参考。
  • 李整, 王文凯, 秦金磊, 耿聆, 刘铭远
    计算机工程.
    录用日期: 2026-07-29
    针对电力负荷序列非平稳性强、多尺度波动显著、周期信息难以稳定建模且在多步预测中易出现衰减与相位偏移,以及温度、湿度、电价等外生变量与负荷间耦合复杂的问题,本文提出一种基于时频特征融合与多周期残差耦合的短期负荷预测方法(time-frequency fusion and periodic residual coupling,TFF-PRC),旨在提升模型对负荷序列长期趋势、局部波动和周期规律的联合表征能力,同时增强多变量场景下外生信息的有效利用,从而提高不同预测步长下的预测精度与稳定性。现有深度学习方法多依赖时域建模或全局依赖建模,对低频趋势、高频扰动及显式周期信息利用不足;同时,多变量建模中过早混合外生变量易引入冗余噪声,完全通道独立又会削弱有效交互。为此,本文从时频协同建模、多周期残差补偿和负荷中心通道交互三个方面构建预测框架。首先,在时域采用移动平均分解提取趋势和季节成分,在频域通过多层离散小波变换(discrete wavelet transform,DWT)获取低频近似分量及多尺度高频细节分量。通过定向融合机制,低频增强趋势,高频增强季节,使频域信息以残差形式参与时域成分构造,从而强化模型对长期趋势和局部扰动的刻画能力。随后,增强后的趋势与季节分量分别输入通道独立的时序切片特征提取网络,利用卷积捕捉局部模式,并通过多层LSTM建模长短期依赖,以获得稳定、纯净的高维表示。针对多步预测中周期衰减和相位偏移问题,本文基于快速傅里叶变换(fast Fourier transform,FFT)识别负荷序列主导周期,提取与预测区间相位对齐的历史同期负荷片段,并通过样本级自适应加权生成周期补偿特征,以残差形式增强主干预测结果。随后,负荷中心通道交互模块以负荷为查询中心,通过查询-键-值机制选择性聚合温度、湿度、电价等外生变量信息,在保留多变量建模能力的同时有效抑制通道间噪声干扰。本文在澳大利亚新南威尔士州(New South Wales,NSW)和西班牙(Spain)两个公开电力负荷数据集上进行实验验证,输入窗口48时间步,预测未来1、2、24和48时间步。相比于主流基线模型,TFF-PRC在NSW数据集MAE平均降低11.03%~20.11%,RMSE平均降低11.41%~18.53%;在Spain数据集MAE平均降低3.99%~5.23%,RMSE平均降低4.05%~4.10%,表明模型具有良好的泛化能力。消融实验显示,移除TFF、PRC或LCA模块后,MAE分别上升7.54%、10.63%和7.00%,RMSE分别上升7.03%、8.18%和8.10%,验证了各模块对预测性能的贡献。综上,TFF-PRC通过时频定向融合、多周期残差耦合及负荷中心通道交互,有效
  • 任翊宁, 吴志周, 梁韵逸
    录用日期: 2026-07-29
    现有车路协同感知任务调度方法面临两大核心问题:计算资源硬约束刻画不足,以及调度决策效率难以满足动态环境需求。此外,在车路协同感知任务调度过程中,智能网联汽车(Connected Autonomous Vehicle, CAV)与路侧单元(Roadside Unit, RSU)之间存在双向数据传输(RSU向CAV下发感知数据、CAV向RSU卸载任务并接收结果)。在这一过程中,任务完成时延模型中RSU端计算时延与分配的计算资源呈反比关系,从而在时延模型中引入分式非线性项,进一步提升了问题的数学复杂度。针对上述问题,本文考虑RSU和CAV两端均存在计算资源上限约束的情形,构建车路协同感知任务调度模型,旨在最小化系统总时延。在通信层面,模型采用正交频分多址(Orthogonal Frequency Division Multiple Access, OFDMA)接入方式,通过RSU为各车辆分配正交子载波,保证CAV与RSU之间具备均等的通信带宽;同时考虑车辆高速移动产生的多普勒频移与载波间干扰(Inter-Carrier Interference, ICI),建立车速与数据发送速率之间的定量关系。在计算资源分配层面,模型显式刻画RSU总计算资源上限约束、单任务计算资源上限约束、RSU最大并行任务数约束以及CAV车载计算资源上限约束。从RSU视角,核心决策是选择接纳来自哪些CAV的任务并为其分配计算资源,使任务卸载决策与计算资源分配相互耦合。在此基础上,本文以最小化系统内所有CAV的任务完成时延总和为目标函数,以任务卸载决策变量、RSU计算资源分配连续变量、CAV本地计算资源分配连续变量为核心优化变量,并引入任务完成时延作为辅助变量,构建了包含分式非线性约束的混合整数非线性规划模型。为解决非线性约束导致的求解困难,本文基于外逼近法提出一套定制求解算法。该算法利用时延函数的凸可分特性,对RSU处理任务的延迟表达式进行一阶泰勒展开,生成外逼近切割,将原非线性模型转化为混合整数线性规划问题。针对传统外逼近法对初始点敏感、收敛稳定性不足的缺陷,本文提出初始点选取策略:将单个任务可分配的最大计算资源作为初始点,以提升模型求解质量和求解效率。为评估模型性能,实验将本文模型与两种基准方案进行对比:(1)所有CAV完全本地处理任务,不使用RSU资源;(2)CAV优先将任务卸载至RSU,超出RSU承载能力的任务由CAV本地处理,RSU为每个被卸载的任务分配均等计算资源。实验结果表明:相较于CAV优先将任务卸载至RSU的方案,本文模型将任务完成时延总和降低15.6%;其中单辆CAV的任务完成时延最大降幅达32.4%。本文还将所提算法与遗传算法和自适应大邻域搜索算法进行对比。实验结果表明:在求解效率方面,本文提出的初始点选取策略可使算法平均2.55轮收敛、求解用时控制在0.91~2.86秒;本文算法相较于遗传算法在求解用时上平均节省56.2%。以上结果表明,本文提出的计算资源约束下的车路协同感知任务调度模型与方法,可有效降低系统总时延,提升调度决策效率。
  • 曲海成, 宿文华
    录用日期: 2026-07-29
    针对多模态情感分析中模态表示异质性强、视觉和音频等非文本模态易引入冗余噪声,以及不同样本下模态贡献难以动态建模等问题,提出一种文本引导与双门控自适应图融合模型(Text-Guided and Dual-Gated Adaptive Graph Fusion,TGAGF)。在视频情感分析任务中,文本、视觉和音频分别从语义内容、面部表情和声学变化等方面提供情感线索,但三类模态在表示形式、信息密度和噪声分布上存在明显差异。文本模态通常具有较强的语义表达能力,能够更直接地反映说话人的观点和情感倾向;视觉和音频模态能够补充表情、姿态、语调和语速等非语言信息,但也容易受到个体差异、环境干扰和采集质量等因素的影响。若直接对多模态特征进行融合,非文本模态中的弱相关信息和冗余噪声可能被引入联合表示,并在跨模态交互过程中进一步传播或放大,从而削弱模型对情感极性、细粒度等级和连续情感强度的判别能力。为此,TGAGF以文本模态为语义引导,在跨模态融合过程中增强视觉和音频模态中有效情感线索的表征能力,并抑制冗余噪声对情感判别结果的影响。首先,模型对文本、视觉和音频三种模态进行特征提取与维度对齐,将不同模态特征映射到统一语义空间,为后续融合提供结构一致的输入表示。随后,通过共享—特有双分支解耦网络分离跨模态一致信息与模态特有信息。其中,共享分支提取与情感表达相关的一致语义信息,特有分支保留各模态自身的补充判别信息;同时结合重建一致性、特定一致性、度量约束和正交约束,从语义恢复、模态稳定性、跨模态一致性和子空间独立性等方面约束解耦表示,降低共享特征与特有特征之间的语义混叠。其次,利用文本引导双阶段门控机制在图关系推理前抑制视觉和音频模态中的冗余噪声,在图传播后重新加权各模态表示。第一阶段门控对进入图关系推理模块的模态信息进行预筛选,减少无效信息在关系传播过程中的扩散;第二阶段门控依据图传播后的跨模态交互结果重新调整各模态贡献,使模型能够根据不同样本的情感表达特点动态分配模态权重。在此基础上,将文本、视觉和音频三种模态作为图节点,通过可学习邻接矩阵建模模态间依赖关系,在模态级显式刻画不同模态之间的语义相关性,并通过图消息传播增强模态间互补信息。最后,采用级联多任务预测策略联合建模情感极性、细粒度等级和连续情感强度,使模型同时兼顾情感方向判别、情感等级区分和连续强度估计。在CMU-MOSI和CMU-MOSEI数据集上的实验结果表明,所提模型在多项评价指标上取得较优性能。其中,在CMU-MOSI上的Acc7、Acc5、Acc2和F1分别为48.4%、56.1%、85.3%和85.3%;在CMU-MOSEI上的Acc2、F1和MAE分别为85.2%、85.1%和0.534。与多种经典方法和近期代表性方法相比,TGAGF在情感分类和情感强度预测任务中均表现出较强竞争力。实验结果验证了所提方法在缓解模态异质性、抑制冗余噪声干扰、动态
  • 姜晓恒, 孙柯凡, 邵蒙恩, 胡世哲, 徐明亮
    录用日期: 2026-07-29
    可信的多模态分类通过整合异构数据流并量化预测不确定性,在医疗诊断、自动驾驶等高风险领域具有重要意义。然而,现有方法在处理多模态冲突时,多数方法仍存在三个核心问题:机械噪声处理导致模型在证据匮乏时过度自信、统一融合范式造成模态特有深层语义被“特征同化”而丢失、以及不确定性估计未能作为动态反馈信号闭环引导融合决策。为应对这些核心挑战,本文提出联合类对抗学习与动态融合的可信多模态分类方法(JALDF)。该方法旨在通过特征对齐、语义保留和自适应融合的协同优化,系统性提升多模态分类的准确性、抗噪性和可信性。 在技术实现上,JALDF包含三个核心创新模块。首先,跨模态类相似度模块对各模态特征进行Sigmoid稀疏化和L1正则化以筛选高判别力子集,随后按类别提取样本,采用Wasserstein距离度量同一类别在不同模态下特征分布的差异,通过最小化该距离迫使网络建立跨模态共享的判别性表征。该模块利用最优传输理论精确刻画分布间的最小搬运代价,相较于KL散度等对称性度量,Wasserstein距离在特征空间存在较大分布偏移时仍能提供稳定的梯度指导,从而确保跨模态对齐的有效性。其次,为抑制上述约束导致的模态过度趋同,语义对抗类模块将每个模态视作独立领域,为样本分配模态归属标签并训练领域分类器,该分类器与相似度模块形成对抗博弈,即相似度模块努力混淆模态差异,而领域分类器则力图区分模态来源,从而在保持类间分布接近的同时,精准保留各模态独有的深层信息。这一对抗性设计首次被引入多模态可信分类领域,有效化解了特征塌缩与信息丢失的矛盾。最后,置信度监督的自注意力融合模块将各模态特征映射为查询、键和值,通过多头自注意力计算模态间依赖权重,并以真实类概率(TCP)作为可信监督信号训练置信度估计分支,使模型在测试阶段无需标签即可动态评估各模态证据质量;融合损失同时包含分类交叉熵与置信度均方误差,驱动注意力权重根据当前置信度实时调整,实现对高质量模态的增强和低质量、噪声模态的抑制。该闭环监督机制使得不确定性度量直接参与融合权重的生成,突破了传统静态融合的局限。 在五个公开多模态数据集(Cub、Caltech101、Scene15、Animal、PIE)上的实验表明,JALDF在准确率上均取得领先结果,其中Scene15上达81.40%,较次优模型RMVC提升8.35个百分点,PIE上达95.14%,显著优于现有方法。其余超参数分析、冲突数据敏感性、不确定性估计、消融及可视化等实验进一步地从多个维度验证了JALDF的有效性和先进性。 综上,JALDF通过类对抗学习与动态融合的有机协同,有效解决了多模态分类中的过度自信、特征同化和融合刚性三大难题,为可信多模态分类提供了兼具高精度与强鲁棒性的技术方案。
  • 马飞, 李淑涵, 杨飞霞, 徐光宪
    录用日期: 2026-07-29
    认知诊断(Cognitive Diagnosis,CD)旨在根据学生在在线教学平台中的作答记录,精准识别其在不同知识点上的掌握状态,是个性化学习推荐、学习路径规划和教学干预的重要基础。然而,真实教育数据普遍存在明显的长尾分布特征:少数头部学生拥有丰富的答题交互,能够为模型提供充分监督信号;而大量尾部学生仅具有少量作答记录,其认知状态难以被稳定估计,容易出现表征混叠、均值回归甚至表征坍塌问题。现有认知诊断模型大多依赖学生ID嵌入和有限交互记录,对头部学生中较为完备的认知模式利用不足,难以有效缓解尾部学生的冷启动与表征稀疏问题;同时,部分模型未充分区分答题正确与错误行为背后的认知语义差异,导致稀疏交互中的判别信息挖掘不充分。针对上述问题,本文提出一种基于条件流形增强与正误双视图对比学习的学生认知诊断框架CFECD。 在方法设计上,CFECD首先引入语义增强特征初始化模块,融合习题文本语义、知识点信息与ID嵌入,以提升稀疏场景下节点表示的泛化能力;随后,利用LightGCN编码学生、习题和知识点之间的高阶交互关系,获得结构化认知表征。在此基础上,构建条件流形增强模块,通过全局记忆库存储头部学生的高质量认知表征,并利用流形的可逆映射能力,在连续概率空间中对尾部学生进行逆向投影、潜空间插值和正向生成,实现尾部学生稀疏表征的分布补全与特征校准。为进一步提高增强特征的可靠性,模型融合原始图特征、流形生成特征、同伴参考特征和上下文交互特征,形成多源协同的尾部学生表示。同时,针对答题正误行为所反映的不同认知含义,本文构建正误双视图对比学习机制,将交互图解耦为正向掌握视图和负向缺陷视图,通过对比约束增强隐空间中不同认知状态的可分性。最后,模型设计带缩放因子的诊断预测函数,对学生能力与习题难度之间的边际差异进行适度放大,并结合自适应损失权重生成网络动态平衡预测损失、排序损失、一致性损失和对比学习损失,以提升联合优化过程的稳定性。在ASSIST2009、Junyi和XES3G5M三个公开教育数据集上的实验结果表明,CFECD在预测精度和排序能力方面均优于多种基线模型,尤其对于尾部学生有明显提升。消融实验和参数敏感性分析进一步表明,条件流形增强能够有效补全尾部学生表征,正误双视图对比学习能够提升隐空间语义判别性,适度的流形约束、网络深度、对比学习权重和缩放因子有助于在表征增强与主任务预测之间取得平衡。 综上,CFECD能够在长尾在线教学场景中生成更加稳定、可解释的学生知识掌握画像,尤其适用于低活跃学生、新注册学生和交互记录不足学生的早期诊断。模型输出可进一步服务于薄弱知识点识别、个性化习题推荐、学习路径规划、教师教学预警和班级学情分析。实验结果验证了所提方法在长尾学生认知诊断任务中的有效性、鲁棒性和实际教学应用潜力。
  • 肖琳, 胡磊, 朱恒亮, 邢树礼
    录用日期: 2026-07-22
    低光照图像增强旨在从光照不足、对比度偏低、噪声显著和颜色失真的图像中恢复清晰、自然且细节完整的视觉内容,是夜间监控、移动摄影、自动驾驶和智能感知等场景中的重要基础任务。在现实中低光照图像的退化并非单一亮度衰减,而是由照度不足、暗区噪声、颜色偏移和结构细节弱化共同造成。现有方法虽然能够提升图像整体亮度,但在复杂暗光场景下仍容易出现噪声放大、色彩不稳定、局部纹理丢失和过增强等问题。其主要原因在于,噪声与纹理在空间域中往往具有相近的高频响应,若直接对空间进行处理,网络可能将噪声误作为有效细节进行增强;同时,RGB 空间中的亮度与色彩信息高度耦合,端到端增强过程容易使亮度恢复与颜色校正相互干扰,影响增强结果的真实性和一致性。针对上述问题,本文提出一种基于色彩空间解耦的空间-频率协同低光照图像增强网络 SFSNet。该方法首先利用 HVI 色彩空间将输入图像分解为亮度分量和色度分量,使网络能够分别建模亮度恢复和颜色表达,从而减弱二者之间的耦合影响。在此基础上,为降低低光噪声对后续空间恢复的干扰,本文在编码前引入频域去噪模块,通过频率域特征调制抑制噪声相关扰动,并保留对结构恢复有用的主要信息。随后,网络构建双分支协同主干,分别处理亮度特征和色度特征,并通过多尺度卷积模块增强对局部纹理、方向边缘和上下文信息的表达能力。为避免双分支独立恢复造成亮度与颜色不一致,本文进一步设计跨分支特征协同机制,在不同尺度上促进亮度分支与色度分支的信息交互,使亮度增强能够结合颜色结构约束,颜色恢复也能够感知照度变化。与此同时,本文在瓶颈层引入深度交互模块,通过深层特征融合生成辅助增强结果,并利用辅助监督强化网络对全局亮度分布和结构信息的建模能力。训练过程中,本文联合 sRGB 空间重建约束、HVI 空间一致性约束和瓶颈辅助监督,并采用不确定性自适应加权策略平衡不同目标的优化贡献,以提升模型训练的稳定性。本文在 LOL-v1、LOL-v2-real 和 LOL-v2-syn 数据集上进行定量评价,并在 DICM、LIME、MEF 和 VV 等真实无配对数据集上验证模型的泛化能力。结果表明,本文方法在 PSNR、SSIM、LPIPS、BRISQUE 和 NIQE 等评价指标上具有较强竞争力,并在视觉效果上能够较好地提升暗区亮度、抑制噪声放大、保持颜色自然性和恢复局部结构细节。与多种代表性低光照增强方法相比,SFSNet 在亮度恢复、色彩一致性和细节保持方面表现更加稳定。消融实验进一步证明,频域去噪、多尺度空间建模、跨分支特征协同和深度交互监督均对模型性能提升具有积极作用。综上,本文方法通过色彩解耦、频域净化、空间恢复和分支协同的联合设计,有效缓解了低光照图像增强中噪声退化、颜色失真与细节恢复相互耦合的问题,为复杂真实暗光场景下的图像增强提供了一种有效方案。
  • 芦帅晔, 李雨晴, 周林江, 马超, 石小川
    录用日期: 2026-07-22
    视觉语言模型(VLMs)通过对齐大语言模型与视觉编码器,在跨模态任务中展现出卓越能力,但跨模态幻觉问题严重限制了其在严谨场景中的应用。其根本原因在于,大语言模型基座在纯文本预训练中固化了强烈的语言先验,在自回归解码时往往反客为主压制真实的视觉特征。深入剖析解码阶段的内部注意力机制发现,视觉特征在不同网络层级呈现显著的演化差异:浅层网络视觉注意力高度弥散,包含大量易诱发注意力漂移的冗余噪声;而深层网络受语言先验主导,跨模态注意力严重衰退,阻断了文本生成与视觉事实的关联。现有解码干预方法多采用全局粗粒度策略,难以系统应对“浅层弥散、深层衰退”的矛盾。因此,本研究提出一种基于多层累积视觉先验增强(Multi-layer Cumulative Visual Prior, MCVP)的幻觉抑制方法,通过三大协同机制在解码阶段精细化重构特征分布。首先,引入稀疏化聚焦策略动态评估浅层响应,过滤背景噪声以提炼高置信度特征,从根源避免注意力漂移;其次,设计层级递归累积机制,利用滑动窗口对前序浅层稀疏化注意力进行加权聚合,构建时序稳健的全局视觉先验;最后,提出自适应软注入策略,实时计算当前生成阶段的视觉依赖度,将稳健先验动态融入深层交叉注意力模块,强制重塑模态权重以严格对齐视觉事实。在LLaVA-1.5、MiniGPT4和DeepseekVL等模型上,基于CHAIR与POPE基准的实证评估表明,MCVP相较于基础采样及现有先进干预方法优势显著。在CHAIR测试中,MCVP使综合幻觉抑制性能平均相对提升18.8%,其中LLaVA-1.5的句子级幻觉率从48.4%大幅降至38.2%,且在削减幻觉的同时维持了77.7%的高召回率,克服了传统探索性策略易拟合语言概率的缺陷,实现了更优的精度与覆盖率平衡。在POPE测试中,MCVP在MiniGPT4上取得88.45%的最优F1分数,并在DeepseekVL上有效修正了因浅层弥散导致的过度预测问题。深入的消融与可视化分析亦证实,所提机制成功防止了深层特征衰退,并将注意力重新紧密聚焦于目标区域。综上所述,MCVP精准捕捉了层级注意力的演化规律,在不损害通用推理能力且无需任何额外训练成本的前提下,高效、精准地抑制了跨模态幻觉,为未来基于白盒层级干预的免训练大模型优化奠定了新的理论与实践范式。
  • 陈鹏, 廖豪, 余肖生
    录用日期: 2026-07-22
    摘 要: 针对脑肿瘤磁共振成像(MRI)影像中肿瘤尺度差异大、形态异质性强,病灶边界常与正常脑组织交融,现有检测模型在局部细节提取、全局语义建模和跨尺度融合方面仍存在不足,易造成边界定位偏差、漏检误检增加及部署成本较高。针对上述问题,本文以基于ResNet-18骨干网络的实时检测Transformer模型(RTDETR-r18)为基线,提出高精度轻量化脑肿瘤检测模型(GDC-DETR),旨在提升复杂病灶检测精度的同时降低模型参数量和计算量,使模型更适合临床辅助诊断和轻量化部署需求。模型从主干增强、特征融合和高效交互三个层面改进。首先,设计融合上下文感知的门控增强模块(GLCA-CG),在局部与全局双分支中分别提取边缘纹理细节和长距离上下文信息,并通过卷积门控机制自适应筛选关键特征,增强对小病灶、弱边界和复杂背景的判别能力。其次,构建层次化局部-全局注意力融合模块(HLGA-FM),通过局部尺度与全局尺度的并行感知注意力(Patch)实现高、低层特征的语义对齐和自适应融合,缓解传统特征拼接造成的信息稀释、通道冗余和语义偏差问题,提高跨尺度病灶定位能力。最后,提出低分辨率轻量特征交互模块(LR-AIFI),先采用抗混叠下采样将高分辨率特征映射至低分辨率空间进行注意力交互,再通过上采样与深度卷积细化补偿空间细节,使注意力主项计算复杂度约降至原策略的1/16,从而兼顾全局建模能力与计算效率。 本文在包含神经胶质瘤、脑膜瘤和垂体瘤三类脑肿瘤的公开MRI数据集上验证,并采用统一训练参数、统一评价指标和相同实验环境与RTDETR系列、YOLO系列及多种脑肿瘤检测模型进行对比。实验结果表明,GDC-DETR的平均精度均值(mAP50)达到92.9%,较RTDETR-r18基线提升2.7个百分点,精确率和召回率分别为91.4%和91.1%;参数量为15.6 M,较基线减少21.6%,计算量为47.8十亿次浮点运算量(GFLOPs),在参与对比的主流模型中保持较低计算开销。可视化结果表明,在边界模糊、形态不规则及病灶与周围组织高度混杂的困难样本中,GDC-DETR能够更准确地聚焦肿瘤核心区域,减少背景区域无效响应,并获得更稳定的检测框定位结果。消融实验显示,GLCA-CG单独引入后mAP50提升1.2个百分点,并显著压缩参数规模;HLGA-FM与GLCA-CG联合后mAP50提升至92.4%;LR-AIFI在降低计算负担的同时保持稳定精度。三种模块联合后取得最优综合性能,说明细节增强、多尺度语义融合和低分辨率高效交互具有互补作用。泛化实验表明,模型在两类外部MRI数据集上的mAP50分别达到94.9%和92.9%;在零标注迁移场景下mAP50为73.5%,仅使用10%和20%目标域标注微调后分别提升至86.5%和88.6%,表现出较好的跨域适应性和小样本迁移能力。综上,GDC-DETR能够缓解脑肿瘤MRI检测中高精度与低计算成本难以兼顾的问题,提高复杂病灶检测灵敏度和定位能力,并降低模型部署对硬件资源的依赖,可为临床脑肿瘤辅助检测提供轻量化参考方案。
  • 郑诚, 王旭东
    录用日期: 2026-07-22
    随着大语言模型(LLM)的快速发展,LLM在文本分类任务中展现出良好的应用前景。现有基于提示词工程的文本分类方法高度依赖LLM的生成能力,在轻量级LLM场景下存在生成能力不足、推理稳定性差的问题,往往难以取得理想效果。此外,LLM不同隐藏层在表征能力上存在显著差异,其中间层表示往往蕴含丰富的语义信息,甚至在部分任务中优于其最后一层的输出。针对上述问题,提出一种基于LLM的多层次语义融合文本分类方法,通过提取并融合轻量级LLM不同隐藏层的文本嵌入表示,在无需对LLM进行参数微调的条件下,实现高效稳定的分类效果。首先,将提示词工程引入文本嵌入表示构建过程,通过设计适用于文本分类任务的提示模板,将原始句子插入特定上下文语义中,以引导模型在生成隐藏层表示时调整句向量的注意力分布,影响文本嵌入表示的判别能力。其次,使用曲率刻画隐藏层表示的几何变化平滑性,曲率较低的隐藏层表示对应更平滑的语义轨迹,更适合作为文本嵌入表示用于文本分类任务中。通过计算各隐藏层的层平均曲率,并选取曲率较低的若干个隐藏层表示作为后续融合的特征来源。再次,通过层内位置加权融合和层间多尺度卷积融合,获得更具表达能力的文本嵌入表示,层内位置加权融合根据词元在输入序列中的相对位置分配不同权重,在保留尾部重要语义信息的同时兼顾前部上下文内容,以获得更加完整稳定的文本嵌入表示。层间多尺度卷积融合通过卷积操作建模不同隐藏层之间的语义关联关系,实现多层语义信息的融合。最后,联合多种损失函数训练分类器,同时提升分类准确性、较难分类样本学习能力以及表示空间的判别性,从不同角度对参数进行优化训练实现最终结果预测。实验结果表明,所提出的方法在SST-2、MR、20NG、Ohsumed和R52五个数据集上的准确率分别达到96.11%、93.48%、89.92%、74.15%和96.33%,优于现有主流基线方法;在Ohsumed与R52两个类别分布相对不均衡的数据集上,引入宏平均F1分数作为补充评价指标,结果分别达到62.93%和73.12%,验证其在复杂数据分布条件下的分类能力。进一步地,通过消融实验、不同层内融合方法效果分析、不同提示模板效果分析、不同数量层数融合效果分析,充分验证各模块设计的合理性与有效性;通过损失函数权重敏感性分析,评估分类性能对不同损失函数权重变化的敏感程度;通过不同层效果分析,探讨不同隐藏层表示与分类性能之间的关系。综上所述,所提出方法能够有效提取并融合LLM的嵌入表示用于文本分类,大幅降低计算开销的同时提升文本的表示能力与判别能力,具有良好的泛化能力和实际应用价值。
  • 程冠杰, 苏韬龙, 黄俊钦, 孔令和
    录用日期: 2026-07-22
    面向物联网(Internet of Things,IoT)场景中海量、连续的时序数据共享需求,传统基于双线性映射或椭圆曲线的无证书签密(Certificateless Signcryption,CLSC)方案在量子计算威胁下安全性受限,且在多段数据的重复签密中引入较高的计算与通信开销。为此,提出一种面向时序数据共享的后量子轻量化无证书混合签密方案。首先,设计了双向哈希链驱动的对称密钥生成与管理机制,实现多段连续数据的密钥快速生成与前/后向安全。此外,在模块格框架下构建条件隐私保护的轻量化混合签密体制,并结合离线/在线分离将部分计算前移,实现后量子安全的同时显著降低端侧与链路负担。在随机预言机模型下证明了该方案满足IND-CCA机密性与EUF-CMA不可伪造性。在资源受限的终端设备上开展了原型实现与评测,对比实验结果显示该方案相较代表性方案具有显著优势,端侧整体时延与传输体量平均可降至同类后量子方案的40%左右。在长时段、连续时序数据场景下,该方案优势将进一步扩大,兼顾后量子安全、轻量化与可扩展性,适用于新一代智能物联网中的时序数据共享应用。
  • 胡程, 何卓成
    录用日期: 2026-07-22
    在人机协同相关场景下,智能体意图的显式/可读表示与准确识别是提升协作安全以及效率的重要手段,也是建立及提升人类对智能体信任度的重要依托。其核心在于增强智能体行为的可读性,以便人类有效理解其意图。现有研究主要通过引入偏离最优路径的差异化行为来传递意图,此类方案存在牺牲一部分执行效率以达到传递意图的目的,在强混淆场景下,存在以下两类难题:1)场景中路线重叠且密集,智能体通过牺牲效率的方法传递意图效果不佳。2)重叠的路线导致智能体原本的行为序列难以表征出足够的信息,观察者难以识别其真实意图。针对此类问题,探究人类在复杂场景协作中影响其行为可读性的重要因素,其不同因素在人类协作中主要表现动作姿态、速度和距离等。 本文在不改变智能体原有行为的基础上,通过对其关键状态信息如姿态、速度和距离进行多维度建模与融合,以此提出一种多维融合表征机制。设计符合人类推理的姿态映射函数、运用高斯核函数将速度和距离表征转换映射,并通过融合参数集成智能体相关表征,实现增强行为可读性的目的。此外,匹配于多维表征机制提出一种基于贝叶斯更新的高效意图识别方案,通过充分利用机制中已融合的状态信息,进行智能体意图的快速准确识别。最后,将以上机制与方案整体实现为一种新的智能体行为可读性增强与识别方法,不仅增强了整体行为对其意图的显式表达能力,而且可通过缩减差异化行为数量,进而有利于任务执行效率提升。 通过无约束、复杂障碍、强混淆三类实验场景对方法进行全面验证,实验结果表明,对比于其他基准方法:本方法加入更多维度的状态信息,使得对智能体意图识别的准确度平均提升44.47%;且本方法以更短的行为序列传达充足意图信息,极大提升了任务执行效率,使智能体执行成本平均降低42.86%;此外通过消融实验验证了姿态、速度、距离三类状态信息对可读性提升的正向作用,其中姿态信息最为显著;由敏感性分析验证了颜色与速度因子参数的最优取值区间,保障了方法的稳定性能;并通过连续控制任务实验检验了方法在复杂引擎与实际工程应用中的表现;另一方面,算法复杂度分析显示,该方法推理时间耗时对比原基底方法增加2.89毫秒,可满足实时交互需求。 本文提出的一种新的智能体行为可读性增强与识别方法提供了减少冗余行为,提高可读性的新的路径。在保有其原有行为序列的前提下,兼顾了信念传达与效率执行。该方法可以直接嵌入不同类型基准方法,并实现不同程度识别准确率提升,后续工作将围绕本文方法的可嵌入性展开,进一步发掘其在连续控制任务中的潜力。
  • 张红霞, 赵祥旭, 何明月, 刘若萱
    录用日期: 2026-07-22
    高效的跨域资源分配是空天地一体化网络实现资源优化配置与服务质量保障的基础。然而,受限于空天地一体化网络固有的多层高度复杂拓扑和大量差异化网络切片服务请求,传统扁平化架构和静态数学优化模型在面对动态复杂问题时,难以实现跨域资源的高效与动态分配。因此提出一种基于深度强化学习的分层跨域资源分配方法(DLCDS),旨在最大化系统效用的同时兼顾底层物理资源的高效利用。首先,设计了分层协作的跨域框架,建立全局域层与本地域层的双层协作机制。其次,在全局域层面,提出了基于双延迟深度确定性策略梯度的服务等级协议(SLA)分解算法,该算法借助连续动作空间下的确定性策略实现了SLA约束在各子域间的规划与分解;在本地域层面,设计了基于近端策略优化的资源分配算法,该算法构建SLA映射模型实现了从服务目标到资源需求的转换,采用随机策略的探索优势提升域内资源分配效率。最后,实验结果表明,相比于其他基准算法,所提算法资源利用率平均提升12%,系统效用平均提升19%。
  • 王磊, 项志超, 齐俊艳, 王文
    录用日期: 2026-07-22
    针对低空复杂背景下无人机目标尺寸小、纹理特征弱、易受背景干扰导致检测精度下降及漏检率较高的问题,提出一种基于YOLOv11改进的轻量化无人机目标检测方法EF-YOLO(Efficient Fusion YOLO)。针对传统模型在复杂场景中存在深层语义信息不足、多尺度特征融合失配以及复杂背景干扰严重等问题,对YOLOv11网络结构进行系统优化。首先,在主干网络深层设计C3K2-MSFE模块,通过分组卷积与多尺度卷积核协同建模,增强深层弱目标的判别能力,并利用线性分支保持主语义流稳定,从而提升复杂背景下小目标无人机的特征表达能力。其次,提出改进的多尺度特征融合结构PSG-FPN,在上采样阶段引入软最近邻插值机制,通过软化系数减缓跨尺度特征融合中的语义覆盖问题,同时结合GSConvE优化下采样过程,并新增P2检测层以增强模型对小尺度无人机目标的感知能力,从而改善多尺度特征对齐效果。随后,针对传统检测头参数冗余与计算开销较大的问题,提出共享特征轻量化检测头SFE-Head,采用共享卷积主干与分组卷积结构实现分类与回归特征共享,在保持检测精度的同时显著降低模型参数量与计算复杂度。最后,对YOLOv11中的C2PSA模块进行改进,引入基于频域筛选机制的前馈增强结构,通过频域特征建模抑制复杂背景中的纹理噪声,提高模型对微弱无人机目标的响应能力与抗干扰性能。实验分别在DUT Anti-UAV数据集与Det-Fly数据集上进行。结果表明,在DUT Anti-UAV数据集上,EF-YOLO的Precision、Recall、mAP50与mAP50-95分别达到96.76%、88.16%、92.59%和62.41%,相比原始YOLOv11分别提升4.01%、3.44%、3.04%和6.18%;模型参数量由2.58M降低至2.27M,模型大小由5.3MB减小至4.8MB,在较低计算复杂度条件下仍保持良好的实时检测性能。在Det-Fly数据集上,EF-YOLO的mAP50和mAP50-95分别达到96.4%和68.06%,相比YOLOv11分别提升2.39%和2.16%,验证了模型在不同复杂低空场景中的泛化能力与稳定性。与此同时,消融实验结果表明,各改进模块在复杂背景下具有良好的协同增益作用,其中C3K2-MSFE能够有效增强深层弱目标特征表达,PSG-FPN能够改善跨尺度语义对齐能力,SFE-Head在降低模型复杂度的同时维持检测精度,而频域增强结构则进一步提升了模型对复杂纹理噪声的抑制能力。相比传统目标检测模型,EF-YOLO在复杂背景、远距离目标以及低对比度场景下具有更稳定的检测表现,能够有效减少漏检与误检现象,并在保持模型轻量化的同时增强特征表达能力。综合实验结果可以看出,EF-YOLO在检测精度、模型轻量化与实时性之间取得了较好的平衡,不仅能够有效提升复杂低空环境下无人机目标的检测能力,同时也具备较强的工程部署潜力,可为低空空域监管、边缘智能监测及无人机安全防控等应用场景提供可靠的技术支撑。
  • 谢静远, 查凯文, 刘鹏举, 田春伟
    录用日期: 2026-07-22
    针对 YOLOv11 的 SPPF、C3K2 与 C2PSA 模块在昇腾 NPU 上存在的冗余访存、细粒度核函数启动和多分支同步通信瓶颈,本文研究一种不改变网络语义和参数规模的算子级重构方法。基于 Ascend C 设计三类硬件友好融合算子:SPPF 采用片上数据闭环与边界缓存减少多级池化的全局内存往返;C3K2 采用多核任务分配和多队列异步流水线降低细粒度算子串行开销;C2PSA 采用并行归约—广播机制重构注意力分支间通信。在 Ascend 910B NPU 上,完整重构后 COCO 单轮训练时间提升了 27.6%。实验结果表明,所提方法通过适配昇腾片上存储、异步队列和多核同步机制,提高了 YOLOv11 关键模块的训练执行效率,并保持推理性能稳定,可为复杂目标检测网络在昇腾平台上的部署提供可复核的算子映射方案。
  • 李天赐, 方亦圆, 金孙伟, 奚雪峰, 朱润, 盛胜利, 崔志明, 王坚
    录用日期: 2026-07-21
    人类反馈强化学习(Reinforcement Learning from Human Feedback, RLHF)是法律大语言模型实现专业价值对齐的关键技术,但现有综述缺乏对法律场景特有适配机制与挑战的系统分析。本文旨在填补这一空白,系统构建RLHF在法律大语言模型中的研究与应用全景,并为工程实践提供方法选型参考。本文以“技术基础—算法演进—任务迁移—评估体系—应用挑战—未来路径”六维框架为分析主线,系统回顾2017年至2025年间NeurIPS、ICML、ICLR、ACL等顶会顶刊中80篇核心文献,剖析RLHF在法律领域从算法适配到评估体系的完整演进逻辑。分析表明,法律RLHF的核心困境在于多维奖励冲突与专家偏好稀疏导致的奖励建模失准,PPO算法在长文本法律生成中稳定性不足,而DPO、GRPO等新算法虽简化流程但面临偏好数据质量瓶颈。进一步研究发现,不同法律任务在风险等级、推理复杂度以及反馈获取成本方面存在显著差异,因此RLHF算法并不存在统一最优方案。对于法律文书生成、法规摘要等结构化任务,DPO凭借训练流程简洁、稳定性较高等优势具有较好的适用性;对于法律推理、案例分析等需要多路径论证的任务,GRPO利用组内相对排序构建学习信号,在处理复杂法律论证方面展现出较大潜力;而在司法辅助决策、量刑建议等高风险场景中,则需要结合专家反馈、规则约束以及知识检索机制共同实现可靠对齐。评估体系正从自动化指标向过程可解释性与偏见审计演进。 RLHF为法律大语言模型提供了从可用到可信的关键进化路径,但其落地需依赖内生奖励与混合反馈机制以降低标注成本,并发展奖励溯源与过程评估以满足司法透明性要求。同时,随着直接偏好优化和群体相对策略优化等新方法的发展,法律RLHF正逐步由传统奖励模型驱动模式向轻量化偏好优化与相对排序优化方向演进,为降低训练复杂度和提升法律场景适配能力提供了新的技术路径。现有研究表明,仅依赖单一奖励模型难以充分刻画法律价值体系中的复杂权衡关系,未来需要进一步融合规则知识、专家经验以及过程反馈信息,构建更加稳定和可解释的法律对齐机制。本文不仅构建了面向法律RLHF研究的六维分析框架,还进一步提出法律任务导向的RLHF适配性分析体系,系统比较PPO、DPO、GRPO等算法在法律文书生成、法律推理、合规审查等不同任务中的适用边界与失效机制。此外,本文结合法律任务风险等级与算法特征,对不同RLHF方法进行了横向比较,为法律智能系统中的算法选型与工程部署提供参考依据。研究表明,法律RLHF的核心矛盾并非单纯算法性能不足,而是法律场景中多维奖励冲突、专家偏好不一致与司法价值难以量化之间的结构性矛盾。本文首次从技术演进、奖励建模、评估体系与司法治理四个层面完整揭示法律RLHF从算法适配到工程落地的全流程逻辑,为法律大语言模型可信化构建提供系统性研究框架与实践指引。
  • 彭晏飞, 王子莹, 白一卉
    录用日期: 2026-07-20
    当今全球海洋生态环境污染日益加剧,塑料、金属等固体废弃物在水下各深度海域激增,对海洋生物链与生态系统安全构成了前所未有的威胁。依托自主无人水下航行器或水下机器人实现高效、精准的自动化智能垃圾监测与清洁技术,已成为海洋环境保护领域的迫切学术共识。针对水下可见光成像普遍存在的色偏、模糊、低对比度等物理退化问题,以及不同海域间水体光学特性引发的跨域异质性与高质量细粒度标注样本稀缺的瓶颈,为了克服未知部署水域导致的特征偏移与负迁移现象,提出一种融合物理级图像增强与两阶段鲁棒跨域自适应学习的水下垃圾目标检测框架。该框架采取“分步构建、动态对齐”的设计策略,将流水线解耦为两个协同阶段。第一阶段旨在构建抗干扰的基础检测架构以夯实特征地基,为保持高计算效率并规避生成网络在少样本下引入伪影的缺陷,在数据载入层建立低开销的像素级物理对齐流水线:先将输入图像转换至LAB色彩空间,提取L通道执行自适应像素级线性拉伸以恢复边缘对比度与细节,再通过通道稳定化模块对A、B通道进行色偏补偿以抑制青蓝色伪影;在此基础上,基于源域数据集TrashCan Instance实施30k次迭代的监督感知训练,使RetinaNet获取高质量的底层几何纹理与高层鲁棒语义特征,确立感知基线。随后流程进入第二阶段,聚焦于域对齐与跨域部署精度提升。为消除未知新水域引发的深层特征流溢与响应偏移,研究在预训练主干网络多尺度输出层级联注入轻量级特征校准模块(FCM),并在微调初始阶段对FCM内部参数直接实施差异化初值赋能以显式诱导自适应动态校准。在随后的10k次跨域自适应迭代微调中,为杜绝少样本部署时的灾难性遗忘,本阶段完全冻结主干网特征提取器参数作为底层特征稳定器;同时采用差异化非对称双学习率机制,为新注入的FCM赋予高梯度敏感度,而为顶层FPN与检测头赋予较小步长。此外,微调全程引入固定衰减率(λ= 0.9999)的指数移动平均(EMA)技术,在每1000次迭代评估时自动切换至EMA平滑权重,利用平滑的损失平面抵御训练噪声,确保特征空间对齐的无损迁移。为确保实验设计的科学严谨性与实战部署的参考价值,研究引入完全独立的第三方跨域水下数据集进行盲测泛化性验证。定量结果表明,该方法在保持整体框架仅55.86 M参数量的轻量化、紧凑型设计下,在单张 NVIDIA RTX 4080 SUPER 显卡上实现了高达44.61 FPS(每秒传输帧数)的实时推理速度,展现了较高的边缘端实战部署潜力。在同域闭环测试中,该框架相比传统RetinaNet基线模型的平均精度显著提升了5.33个百分点,尤其在水下边缘模糊、低可视度的极其困难的小目标检测任务上,AP 跃升了8.97个百分点。而在最为严苛的跨水域、跨数据集泛化性盲测验证中,该方法展现出了显著的性能提升效果:在未参与训练的全新J_Litter独立数据集上,基线模型的AP_50在多源干扰下仅为0.31%,而该方法通过动态特征校准使AP_50升至28.66%;在深度水下场景的DeepPlastic数据集上,该方法成功将基线模型的AP_50从3.30% 稳步提升至12.81%。这充分验证了所提框架中“物理地基构建”与“动态特征校准”在两阶段架构下的科学性与协同效能,能有效克服跨水域检测中的负迁移现象,在海洋垃圾自动化智能清理的实际工程落地中具备较强的实战泛化潜力。
  • 陈烁, 王洁
    录用日期: 2026-07-16
    视觉问答作为人工智能与多模态理解领域的一项核心研究任务,要求模型联合理解图像的视觉内容与自然语言问题并生成精准回答。针对现有非大规模预训练视觉问答方法在多模态特征建模时易受弱关联背景及冗余区域干扰,传统自注意力未能充分捕捉空间位置依赖及通道间深层语义关联,且多采用静态融合策略难以自适应复杂问题场景等缺陷,本文提出一种基于多模态过滤与空间通道注意力的多模块协同视觉问答方法。在具体实现上,该方法首先设计多模态过滤模块,通过提取特定位置的问题特征向量作为全局语义表示,与对齐后的视觉特征进行哈达玛积交互,并利用感知机与激活函数生成归一化过滤门控权重,从而在深层交互前逐元素缩放图像特征,显式抑制背景冗余信息,为后续深度交互提供纯净的视觉输入。随后,引入空间通道自注意力单元以替代传统自注意力架构。在六层堆叠的编解码器基础架构中,该单元于空间维度将特征重塑为二维图,通过多尺度卷积核结合全局池化生成空间注意力分布,充分捕捉图像区域间的空间依赖关系;同时在通道维度利用池化与全连接网络动态调整语义通道重要性,进而采用门控机制将空间通道调制后的局部特征与多头自注意力捕获的全局上下文进行加权融合,有效增强视觉特征的判别性。在此基础上,构建动态模态融合模块以摒弃静态融合机制。经过多层交互后,模型生成视觉与文本特征的注意力映射并进行拼接,将其输入至包含随机失活的全连接分类网络中,自适应学习二维动态融合权重因子,最终完成多模态特征的动态加权整合,并利用二元交叉熵损失函数进行整体参数的优化训练。基于VQA-v2和GQA数据集的广泛定量实验结果表明,在不依赖超大规模跨模态预训练数据的条件下,所提方法取得了一定的性能优化。具体而言,在VQA-v2的test-dev测试集上,所提方法的总体准确率达到71.85%,较同类基线模型MCAN和BAN分别显著提升了1.22%和2.33%,其中二元是非判断类和其它类问题的准确率分别高达88.03%和62.39%。在强调组合推理与关系理解的GQA测试集上,该模型的总体准确率达到57.92%,其中二元是非判断类问题取得了76.68%的准确率。此外,严格的消融实验定量证实了各核心模块的有效性,多模态过滤、空间通道注意力与动态模态融合模块的引入分别带来了0.63%、0.69%和0.52%的绝对性能提升,且模型层数影响分析进一步证实编解码器各堆叠六层时特征交互最为充分,模型整体性能达到最高峰值。综上所述,本文方法通过细粒度特征建模与动态交互,成功缓解了噪声干扰重、空间通道孤立与静态融合适应性差等问题,为计算资源受限等特定垂直领域下的视觉语言多模态理解与深度特征表达提供了一种改进方案。
  • 黄晨曦, 芦天亮, 彭舒凡, 单程昊, 陈卓鹏
    录用日期: 2026-07-15
    针对生成式面部换脸技术对个人隐私构成严重威胁,且现有主动防御方法在黑盒场景下泛化能力较差、对图像处理失真鲁棒性不足的问题,本文提出一种面向黑盒场景的鲁棒增强主动防御框架(Robust Black-box Proactive Defense, RBPD)。该框架旨在从源图像端注入不可见对抗扰动,干扰未知换脸模型的身份特征提取过程,实现可靠的身份保护。该框架采用两阶段生成机制。第一阶段利用语义感知编码器(Semantic-Aware Encoder, SAE)与纹理引导解码器(Texture-Guided Decoder, TGD)生成初始语义扰动。语义感知编码器SAE通过面部语义掩码引导并结合卷积块注意力模块精准聚焦身份关键区域,纹理引导解码器TGD借助跳跃连接融合浅层纹理特征,强制扰动适配源图像的局部纹理分布与梯度强度,在保证攻击有效性的同时显著减少视觉伪影并提升视觉质量。第二阶段引入双流融合编码器(Dual-Stream Fusion Encoder, DFE)与多尺度聚合解码器(Multi-Scale Aggregation Decoder, MAD)。双流融合编码器DFE将源图像与初始扰动进行深层特征提取与非线性融合,使对抗信息深度嵌入图像语义特征空间;多尺度聚合解码器MAD采用三路并行空洞卷积捕获多尺度上下文信息,并集成挤压激励模块自适应重校准通道响应,增强扰动对图像失真的鲁棒性。同时设计元学习自适应攻击策略(Meta-learning Adaptive Attack, MAA),集成ArcFace、FaceNet、MagFace和AdaFace四种异构身份特征提取器的梯度反馈,动态调整优化权重,实现对强鲁棒性提取器的精准突破,提升扰动在未知黑盒模型上的跨模型泛化能力。在CelebA-HQ数据集上,针对SimSwap、E4S、DiffSwap三种主流换脸模型以及百度、腾讯商业人脸识别API的评估结果显示:受保护图像平均Top-1和Top-5身份匹配率分别降至0.311和0.396,较未保护图像下降63.28%和54.79%,相较最佳基线进一步下降16.17%和19.02%;在未见数据集RaFD上仍保持稳定,平均Top-1和Top-5身份匹配率分别降至0.349与0.394。在黑盒换脸测试中,换脸后图像与源图像的身份余弦相似度大多降至0.3以下,最低达0.185,实现可靠的身份错配。面对JPEG压缩、高斯模糊、噪声和缩放等常见社交网络失真时,失真防御波动率(Distortion Defense Volatility, DDV)平均仅为3.4%,显著优于Saliency(55.5%)、DF-RAP(27.1%)、NullSwap(19.70%)和ID-Eraser(13.90%)四类基准方法。视觉质量方面,受保护图像PSNR达37.38dB,SSIM为0.976,LPIPS为0.0065,展现出良好的图像自然度。在商业API测试中,百度API身份匹配通过率从89.92%降至0.40%,腾讯API从90.37%降至4.25%。单张图像总处理时间仅8.23ms,展现部署潜力。本文提出的主动防御框架有效解决了现有方法在黑盒泛化性和失真鲁棒性方面的不足,通过语义纹理引导与多尺度深度融合的协同设计,实现了攻击效能、视觉质量和鲁棒性的良好平衡,为复杂社交网络环境下个人隐私保护提供了高效实用的主动防御方案,具有重要的理论意义和应用价值。
  • 邓星志, 陈攀峰, 李晖, 王喜宾, 刘威
    录用日期: 2026-07-15
    问答模型旨在使机器能够理解自然语言问题并从文本或知识库中自动推理生成准确答案。现有基于检索增强生成的问答方法虽通过引入外部知识提高了生成质量,但仍面临两个问题,一是语义理解能力不足,难以捕捉问题与检索知识之间的关系;二是检索阶段不可避免地引入与问题相关性较低的噪声信息,这些噪声在后续生成过程中被放大,容易导致答案偏离或幻觉现象。为缓解上述问题,本文提出一种基于两阶段过滤机制的语义检索增强生成问答模型(BiS-RQA)。该模型通过构建显式过滤与隐式过滤相递进的框架,在保持高效推理的同时提高问答场景下的答案准确率。该模型使用两阶段递进式过滤架构,第一阶段筛除明显不相关的知识实体,第二阶段对保留下来的候选知识进行噪声抑制,使得大模型能够聚焦于最有价值的信息片段。第一阶段为显式过滤,提出语义引导的个性化PageRank算法(SPPR)。具体实现上,对输入的自然语言问题,使用预训练语言模型提取问题的嵌入向量;知识图谱中的实体和关系也通过同一模型获得各自的嵌入向量。首先,计算问题向量与每个实体向量的相似度,以此作为个性化向量,用于引导带重启的随机游走中的初始偏好。然后,计算问题向量与每个关系向量的相似度,利用该相似度调整游走过程中当前节点到邻居节点的转移矩阵,即根据问题与关系的相似度修改跳转概率。在此基础上,执行算法迭代直至收敛,得到各节点的平稳分布得分。最后按得分降序排序,选取Top-K个实体及其关联关系,构建对应的子图。该过程能够从原始知识图谱中显式过滤掉无关节点与边,从而有效提升检索信息的相关性。第二阶段为隐式过滤,提出多种注意力知识融合方法(MAIF)。MAIF方法分别使用了自注意力与交叉注意力机制来加权实体和关系权重。首先,将实体和关系池化后作为子图嵌入;随后,实体、关系与子图通过自注意力模块捕捉内部依赖,再进一步执行交叉注意力互相交互得到不同粒度信息之间的关联程度,从而实现对候选信息的隐式过滤与加权。最后交叉注意力机制输出的权重作为软提示,并将第一阶段得到的实体和关系作为硬提示,与问题一同输入大语言模型进行回答。在WebQSP数据集上,BiS-RQA的准确率达到77.21%,相较最优基线模型G-Retriever(73.79%)相对提升4.6%;在CWQ数据集上,BiS-RQA的F1得分为35.38%,较次优基线(32.70%)相对提升8.1%。内存占用方面,BiS-RQA使用了31.5 GB内存,相较于基线模型G-Retriever增加了1.5%;推理时长方面,BiS-RQA需要0.9427秒,相较于GRAG增加了56%。在多个公开问答数据集上的实验结果验证了该方法在语义检索与答案生成上的有效性,并展现出优秀的竞争优势。
  • 李源, 董凌, 李英, 余正涛, 高盛祥, 毛存礼, 黄于欣
    录用日期: 2026-07-15
    目前规范文本的标点恢复已经取得了很好的结果,但是语音识别系统中的实时标点恢复任务仍然面临挑战。其核心挑战为真实语音识别输出往往包含口语化表达和类别分布不均衡等特点,导致传统分类模型难以准确识别复杂语义边界,而生成式大模型虽然具有较强语义理解能力,却存在推理延迟高、部署成本大等问题,难以满足实时应用需求。为缓解上述问题,本文提出一种基于渐进式迭代优化的实时标点恢复方法。首先,通过整合多个公开中文语料库,构建覆盖多种类型的大规模训练语料。同时,设计了一种标点感知的数据加权策略,通过改变不同样本的权重缓解逗号、句号和问号等类别分布不均衡带来的学习偏差,实现训练数据与真实语音识别输出文本的有效对齐。然后,通过动态掩码限制注意力计算范围,仅保留当前位置附近有限窗口内的上下文信息,保证关键语义信息获取能力并有效减少远距离噪声干扰,从而实现精度与延迟之间的平衡。最后,提出一种渐进式迭代优化机制,通过记录训练过程中样本的滑动窗口平均损失,对训练样本进行难度评估,并构建动态权重更新策略。对于持续产生较高预测损失的困难样本,采用多句拼接方式生成具有更复杂上下文依赖关系的新样本,并提高其训练权重,使模型逐步聚焦于复杂语义边界,实现训练数据与模型能力的协同演化,从而不断提升模型对复杂语义结构的建模能力。本文在真实标点恢复测试集上进行了系统实验,并与CT-transformer以及Qwen2.5-7B、Llama3.1-8B、Gemma2-9B、DeepSeek-V3等代表性模型进行比较。实验结果表明,本文方法相较于传统实时标点恢复基线CT-transformer模型的 F1值提升4.92个百分点。同时,在与参数规模远大于本模型的大语言模型比较中,本文方法仍取得更优的恢复性能。在推理效率方面,模型单句平均推理时间仅为26 ms,较DeepSeek-V3提升近200倍,满足实时语音处理场景对低延迟响应的要求。消融实验进一步验证了可控时延机制、数据加权策略以及渐进式迭代优化模块对模型性能提升的有效性,其中迭代优化过程使模型F1值由38.78%逐步提升至43.70%。相比依赖大规模参数的通用大模型,针对任务特征设计的数据与模型协同优化方案能够在保持低资源消耗和低延迟推理的前提下获得更优的标点恢复效果,为实时语音识别后处理系统的工程部署提供了一种兼顾精度、效率与可扩展性的解决方案。
  • 张文茜, 朱永利, 郭灏琨, 姬梦陈, 刘雨姗
    录用日期: 2026-07-13
    针对无人机巡检场景下绝缘子缺陷检测过程中存在背景干扰严重、缺陷目标尺度变化大、小尺度缺陷特征不明显以及深层网络边缘信息逐渐丢失等问题,鉴于YOLOv11n在实时性与参数量间的良好平衡,本文以其为基础框架进行改进,提出一种基于改进YOLOv11n的绝缘子缺陷检测方法,以提升模型在复杂背景条件下对绝缘子缺陷的检测精度与鲁棒性。该方法从特征增强、特征融合以及特征提取三个层面对网络结构进行协同优化,在保证模型轻量化特性的同时提高其对复杂场景中绝缘子缺陷目标的感知与识别能力。本文模型包含三项核心优化模块。首先,为缓解复杂背景干扰、强化细粒度缺陷表征能力,在骨干网络的特征提取阶段设计动态双域特征增强模块(Dynamic Dual-Domain Feature Enhancement Module, DDFEM),构建全局语义分支与局部细节分支协同工作机制。其中,全局分支利用双方向全局池化与跨维度矩阵交互建立长距离空间依赖关系,实现低计算复杂度下的全局语义建模;局部分支采用多分支深度可分离卷积结构提取闪络损伤、破损等细粒度纹理特征,并结合动态注意力融合机制对局部特征进行自适应重标定,从而实现全局语义信息与局部细节信息的互补增强。其次,针对深层语义特征增强过程中边缘细节信息逐渐弱化的问题,设计Sobel边缘引导加权融合模块(Sobel-Edge-Guided Weighted Fusion Module, SEGWF),利用Sobel算子从浅层特征中显式提取边缘信息,并通过通道加权融合机制将边缘结构信息与深层语义特征进行动态融合,以增强模型对绝缘子破损边缘、轮廓等关键结构特征的感知能力,提高复杂背景下的小目标检测性能。最后,为增强多尺度目标的特征提取能力,针对传统卷积感受野固定、难以适应不同尺度缺陷的问题,在骨干网络中引入感受野注意力卷积机制(Receptive-Field Attention Convolution, RFAConv)替换传统卷积结构,该机制能根据不同空间区域的特征分布自适应调整感受野响应范围,从而提升模型对不同尺度绝缘子缺陷的检测性能。为验证所提方法的有效性,在自建绝缘子缺陷数据集上开展实验研究,并与主流目标检测模型进行对比。实验结果表明,本文方法取得92.2%的mAP@0.5,相较于原始YOLOv11n提高4.9个百分点;Precision由89.7%提升至93.0%,提高3.3个百分点;Recall由79.6%提升至88.3%,提高8.7个百分点,表明所提方法能够有效降低漏检率并提升复杂场景下的缺陷检测精度。同时,为进一步验证模型的泛化能力,在公开绝缘子缺陷数据集IDID上进行测试。结果显示,本文方法Precision为89.6%,Recall为79.8%,mAP@0.5为88.9%,在所有对比模型中取得最高的mAP@0.5指标,相较于原始YOLOv11n提升1.9个百分点,体现出较好的跨数据集泛化能力和稳定检测性能。同时,本文模型参数量仅为3.12M,计算量为7.6 GFLOPs,在精度提升的前提下保持了较低的计算复杂度。综上,本文所提出的改进YOLOv11n算法能够有效完成复杂背景下的绝缘子缺陷检测任务。
  • 胡翔一, 李子奇, 郭婷婷, 张永宏, 孙俊
    录用日期: 2026-07-13
    多视图子空间聚类旨在利用多源特征间的一致性、互补性与差异性信息学习潜在共享结构。如何在特征融合过程中兼顾全局结构关系、局部几何特征与表示稳定性,是该领域的重要问题。现有方法多基于低秩表示、稀疏约束或图学习机制构建统一模型,虽然能够在一定程度上挖掘跨视图共享信息,但对全局结构保持、局部平滑约束与鲁棒表示学习之间的协同建模仍不充分,导致模型在噪声污染、异常扰动及复杂分布条件下易出现局部结构失真、表示不稳定及聚类性能退化问题。针对上述问题,本文提出一种面向结构保持的局部平滑多视图子空间聚类方法(SLS-MVSC)。所提方法在统一自表示学习框架下联合引入低秩约束、全变差(TV)范数约束、图正则化约束以及鲁棒误差建模机制,实现全局信息学习、局部关系保持与稳定表示优化的协同建模。首先,利用低秩约束学习多视图共享表示,以挖掘不同视图间潜在一致的全局子空间结构,增强模型对跨视图公共信息的表达能力。其次,考虑噪声干扰容易导致自表示矩阵产生剧烈波动,本文在自表示学习过程中引入TV范数约束,通过限制局部区域表示变化幅度保持表示连续性与边界结构,从而提高表示结果的平滑性与稳定性。进一步地,引入图正则化约束保持样本间邻域关系一致性,通过显式建模局部流形结构增强模型对数据几何关系的刻画能力,使学习得到的表示更加符合原始数据的内在分布特征。同时,在重构误差项中采用鲁棒范数增强模型对异常样本与复杂噪声的适应能力,从多个层面提升表示质量与聚类鲁棒性。针对所构建的优化模型,本文设计基于交替方向乘子法(ADMM)的迭代求解算法,通过引入辅助变量对复杂目标函数进行分解优化,将原问题转化为多个可独立求解的子问题,并推导得到各变量的更新过程与整体求解流程,从而保证模型训练过程的稳定性与求解效率。为了验证所提方法的有效性,本文在6个公开数据集上开展实验研究,并与多种代表性多视图聚类方法进行对比。实验结果表明,所提方法在聚类准确率(ACC)、归一化互信息(NMI)、纯度(PUR)、调整兰德指数(AR)及F-score等指标上均取得优异性能,在多个数据集上达到最优或接近最优结果,展现出良好的聚类性能与跨数据集适应能力。进一步的消融实验验证了各组成模块对模型性能提升的积极作用,其中低秩约束和图正则化分别在全局结构学习与局部几何关系保持方面发挥重要作用,而TV范数约束在增强表示平滑性、缓解噪声引起的表示震荡以及提高模型稳定性方面表现尤为突出。鲁棒性实验结果进一步表明,在不同强度噪声条件下,所提方法整体仍能够保持稳定性能,说明模型能够有效减弱噪声扰动对特征表示学习与聚类结果的影响。综上所述,所提SLS-MVSC方法能够有效提升多视图数据的聚类性能、表示稳定性与抗噪能力,为复杂多视图数据分析提供了一种有效的子空间聚类方法。
  • 张书锏, 李贝, 陈程立诏
    录用日期: 2026-07-13
    现有显著性目标检测(SOD)方法普遍遵循被动视觉刺激原理,依赖颜色、纹理、对比度等底层特征判定显著区域,以场景中视觉特征最强的物体作为用户关注焦点,忽视了用户主动需求对显著目标判断的决定性作用。然而在人机交互、机器人巡检等真实场景中,待检测对象常淹没于复杂背景之中,用户注意力具有强烈的意图导向。近年来,用户需求驱动的显著性目标检测(UserSOD)任务被提出,将感知范式从被动视觉响应转向主动意图匹配,并构建了相应的基准数据集与基线模型。由于现有方法在视觉特征与用户需求语义之间缺乏深层融合与动态校准,模型仅能捕捉关键词的浅层语义关联,且在分层主干网络下采样过程中易丢失空间细节,导致模型在复杂背景下难以精准定位与抽象需求匹配的目标,检测性能仍受较大限制。针对上述问题,在UserSOD任务框架下提出一种深度校准与属性感知网络(DCA-Net)。该网络以Swin-Transformer模型为视觉主干,结合预训练对比语言-图像预训练(CLIP)文本编码器作为文本分支。网络核心设计了级联语义重校准编码器(CSRE),包含四个独立的语义重校准模块(SRM),每个SRM模块内部通过跨模态交叉注意力机制在特征提取源头实现视觉特征与用户意图的逐级语义对齐 ,同时在其内部引入基于多层感知机结构的门控特征流机制(ScGate),利用全连接变换与ReLU-Tanh激活生成自适应权重以动态调节各通道语义流强度,确保在特征流早期精准锁定目标区域。同时,构建卷积跨尺度交互模块(CCIM)以实现跨层级特征补偿;CCIM利用金字塔池化聚合算子与1×1卷积聚合全局特征,通过三路并行且具备不同膨胀率的3×3深度可分离卷积分支捕获多尺度上下文信息,结合串联的通道与空间注意力模块实施加权,并利用双线性插值上采样恢复尺寸,显著增强模型对多尺度目标空间细节的感知能力。引入细粒度属性感知解码器(AGD)提供细粒度约束;AGD采用自顶向下的路径将高层特征逐级上采样合并,利用CLIP文本编码器对类别、颜色、外观和功能需求四类预设属性提示词进行初始化以提供语义先验,有效避免属性查询从随机状态收敛的弊端;随后通过多头交叉注意力从用户指令中分别抽取四类属性维度的显式语义约束向量,将抽象意图解耦为四个独立的细粒度属性约束以避免多属性需求的语义混淆;将视觉特征输入四个并行的属性专用特征分支以感知对应属性的视觉模式,并与约束向量融合;最后由全局文本特征动态预测属性存在概率权重,对四类属性进行自适应调节各分支贡献强度,确保细粒度约束与用户意图精准对应,引导模型生成边界清晰、语义一致的检测掩码。在UserSOD基准数据集上的实验结果表明,DCA-Net在S-measure、F-measure、E-measure指标上相比现有最优方法分别提升4.5%、6.8%和3.8%,MAE降低至0.028,有效验证了所提架构在复杂背景干扰、变尺度目标捕获以及抽象意图对齐方面的优越性与强鲁棒性。
  • 张颖, 王晶, 靳希源
    录用日期: 2026-07-10
    生理时间序列分类在睡眠监测、心电诊断和癫痫检测等多种医疗健康任务中具有重要意义,但在实际应用中,其严重的类别不平衡问题导致少数类特征难以有效学习,尽管这些少数类样本数量稀少,但它们通常承载着更为重要的信息,其性能的准确识别对于疾病及时干预、健康精确评估及其他应用场景的优化决策至关重要。 由于生理时间序列少数类样本数量有限且多为背景波形,模型很难直接从整体序列中学习到判别性强的特征。这些少数类样本中往往存在少量关键局部片段,其独特结构或变化模式承载了类别判别信息,识别这些关键信息对少数类建模至关重要。对比学习方法具备良好的泛化性和结构感知能力,被广泛应用于改进类别不平衡建模,但现有方法多来源于图像领域或依赖样本全局表示,难以捕获少数类样本中稀疏却具有判别信息的局部关键波形片段,另外,现有不平衡方法对频域上的特征利用不充分,数据增强时也缺少类别区分,忽略了少数类与多数类的类间分布差异。 为解决上述问题,该研究提出了一种面向类别不平衡生理时间序列分类的关键波形感知的对比学习方法KWave-CL。少数类中难以学习的关键波形片段通常表现为重构误差较大,该方法设计了联合时域与频域的变分自编码器对少数类波形片段进行重构,通过计算时域与频域的重构误差识别少数类的关键波形片段与非关键波形片段,从而为后续对比学习提供信息。为了充分挖掘少数类样本中的局部判别信息,基于识别出的关键波形片段,该方法进一步设计了关键波形感知对比损失,通过拉近少数类关键波形片段之间的距离,并拉远关键波形片段与非关键波形片段的距离,使少数类在表示空间中形成更紧密且可分的聚类结构,提升少数类表示的判别性。为了增强少数类的多样性,同时保持多数类的特征稳定性,该方法还引入了类别区分的数据增强,对少数类施加较强的扰动,而对多数类则施加较弱的扰动,从增强空间上缓解类别分布偏移问题。整体方法采用联合优化策略,将自监督对比损失、关键波形感知对比损失和时频变分自编码器重构损失整合训练,实现全局与局部特征的协同学习。KWave-CL方法也具有良好的灵活性,可以嵌入多种时间序列对比学习框架中。 在三个公开的真实生理数据集上的实验表明,KWave-CL在两种代表性对比学习框架下的整体性能优于现有的多种不平衡学习基线模型。在PhysioNet 2017数据集的实例级框架下,整体F1分数最高提升了6.69%,少数类别的F1分数最高提升了11.67%,消融实验进一步表明,关键波形感知对比损失、时频变分自编码器以及类别区分数据增强均对少数类性能提升起到关键作用,证明KWave-CL有效缓解了类别不平衡问题,可以为医疗健康领域提供可靠的辅助决策支持。
  • 陈文杰, 梁银, 杜明晶, 黄尧晟, 刘妍洁
    录用日期: 2026-07-10
    针对红外无人机航拍图像中小目标像素占比低、纹理细节弱、信噪比低以及易受复杂背景干扰等问题,同时兼顾无人机平台对检测模型轻量化与实时性的部署需求,本文以YOLOv12n为基线模型,提出一种轻量化红外小目标检测算法ACFF-YOLOv12n。现有红外小目标检测方法在特征提取阶段普遍存在弱目标细节建模不足、多尺度特征融合效率低以及检测头对低对比度目标适应性差等问题,导致小目标在深层网络传递过程中易出现特征稀释、漏检及误检现象。为提升模型对复杂红外场景下弱小目标的感知能力,本文从骨干网络、特征融合结构以及检测头三个层面进行协同优化。首先,在骨干网络中设计A2C2f-ACmix++特征增强模块,将全局自注意力机制与局部增强卷积进行双路径协同建模,并引入轻量通道注意力(Lightweight Channel Attention,LCA),对红外弱目标通道响应进行自适应强化,在保持较低计算开销的同时提升模型对边缘、纹理等细粒度信息的提取能力。其次,在颈部网络中提出语义门控动态融合模块(Semantic-Gated Dynamic Fusion Module,SGDFM),以高层语义特征为主导、浅层细节特征为辅助,通过门控权重动态调节跨层特征融合比例,实现不同尺度特征之间的自适应互补,缓解红外小目标在深层网络中的信息衰减问题,增强模型在复杂背景和尺度变化场景下的鲁棒性。最后,在检测头部分构建基于条件参数化卷积的轻量化检测头(CondConv-based Lightweight Detection Head,CLD-DET),引入条件参数化卷积(Conditionally Parameterized Convolution,CondConv),并结合小目标细节增强模块(Small Object Enhancement,SOE),对红外弱边缘、低对比度目标进行空间细节强化,从而提高模型对微弱目标的定位与分类能力。实验采用HIT-UAV红外无人机数据集进行训练与测试,并在SIRST和NUDT-SIRST数据集上进一步验证模型的泛化性能。结果表明,ACFF-YOLOv12n在HIT-UAV数据集上的mAP@0.5达到87.1%,较基线YOLOv12n提升5.7个百分点;mAP@0.5:0.95达到56.8%,提升2.8个百分点。同时,模型参数量降至2.13M,计算量降至5.0GFLOPs,在保证检测精度提升的同时实现了较好的轻量化效果。在SIRST数据集上,模型mAP@0.5达到78.6%,较YOLOv12n提升5.6个百分点;在NUDT-SIRST数据集上,mAP@0.5达到76.7%,较基线提升3.4个百分点,验证了所提方法在不同红外场景下具有较强的泛化能力与稳定性。此外,可视化与热力图实验结果表明,本文模型在复杂背景、远距离弱目标及密集小目标场景下能够形成更加准确且均衡的特征关注区域,有效降低漏检与误检现象。综合实验结果表明,ACFF-YOLOv12n在检测精度、模型复杂度以及实时性能之间实现了较优平衡,能够满足无人机红外小目标检测任务对高精度与轻量化部署的双重需求,在红外无人机巡检、边境安防及复杂环境目标监测等领域具有较高的应用价值。
  • 许彦波, 李 莹, 高永彬, 汤 信
    录用日期: 2026-07-09
    动态场景下的同时定位与建图(Simultaneous Localization and Mapping,SLAM)易受运动目标、遮挡及光照变化等因素影响,导致位姿估计漂移与地图重建伪影。现有方法在动态观测判别和地图更新约束方面仍存在局限,容易依赖类别先验、固定阈值或特定场景分布,并可能将运动目标误建为伪静态结构。针对上述问题,提出一种面向动态场景的多源一致性残差增强高斯SLAM方法(Multi-Source Consistency Residual-Enhanced Gaussian SLAM,MCRGS-SLAM)。该方法从观测可靠性角度对动态干扰进行连续、可解释建模,并将可靠性约束嵌入前端位姿估计与后端高斯建图过程,以提升动态场景下单目SLAM系统的定位精度和静态地图重建质量。 该方法基于静态区域需满足多视图一致性的物理约束,构建外观、几何、运动和结构四类互补的一致性残差,将动态观测判别转化为可量化的物理度量。其中,外观残差用于刻画跨视角亮度与纹理一致性,几何残差用于衡量深度投影关系的稳定性,运动残差用于检测难以由相机自运动解释的独立位移,结构残差用于描述局部边缘与几何形态变化。不同于直接采用二值掩膜或固定阈值剔除动态区域的策略,上述残差将被建模为连续物理约束,用于表征像素观测相对静态假设的偏离程度。在此基础上,设计语义—几何双流融合的可靠性推理网络(Multi-source Consistency Residual Network,MCR-Net)。语义流提取高层语义特征,用以提供类别级动态先验,几何流编码残差证据,用以表征多视图一致性,两路信息经注意力机制融合后生成像素级可靠性图谱。该图谱以软权重形式作用于 SLAM 系统前后端:在前端位姿优化中,对外观、运动、几何和结构约束进行可靠性加权,降低动态外点对相机位姿求解的干扰;在后端3D高斯(3D Gaussian Splatting,3DGS)建图中,指导高斯基元的初始化、更新与剔除,从而自适应抑制动态观测造成的地图污染。由此,系统将动态观测处理从离散剔除转化为基于可靠性的连续加权,在保留边界区域和弱可靠静态观测的同时,减弱动态外点对位姿估计与高斯地图更新的累积影响。此外,MCRGS-SLAM 构建基于重投影误差与渲染一致性的自监督闭环优化机制,使网络能够在线适应未知场景中的动态变化。 在Bonn和TUM等动态场景数据集上的实验结果表明,MCRGS-SLAM在定位精度和重建渲染质量方面均取得了良好的综合表现。在定位精度评价中,该方法在Bonn动态数据集上的平均绝对轨迹误差均方根(ATE RMSE)为2.35 cm,优于多类代表性方法,说明可靠性加权优化能够有效减弱动态观测对位姿估计的影响。在重建渲染质量评价中,该方法在TUM动态数据集上的平均PSNR、SSIM和LPIPS分别为17.99 dB、0.73和0.272,相较于现有代表性动态3DGS-SLAM方法Dy3DGS-SLAM,PSNR提升0.14 dB,SSIM提升约1.1%,LPIPS降低约4.6%,有效减少了动态目标引起的建图伪影。真实复杂场景序列上的结果进一步表明,该方法在场景分布变化和非结构化动态干扰下仍能保持稳定表现,具有较好的跨场景适用能力。
  • 陈金泽, 李明轩, 张士豪
    录用日期: 2026-07-09
    区块链的匿名属性为交易提供了隐蔽环境,比特币地址类型检测旨在分类行为模式各异的地址,对区块链去匿名化分析具有重要意义。现有方法主要面临三方面挑战:一是比特币交易网络规模庞大、结构复杂,直接使用图神经网络训练效率低;二是深层图神经网络易出现过度平滑问题,导致节点表征趋同,判别能力下降;三是多数方法仅依赖静态图结构或简单统计特征,忽略了交易行为中的时序模式,难以有效捕捉地址的动态行为特征。针对上述问题,本文提出一种基于时序图特征网络的比特币地址类型检测方法F-BAC(Filter-enhanced Bitcoin Address Classifier)。该方法包含四个核心步骤。一是交易建模。将标签地址的每笔交易构建为独立的同构图,节点为交易涉及的地址,边为资金流向。为应对不同交易规模差异巨大的问题,提出细粒度的地址聚合压缩策略:根据地址在全体交易记录中出现的总频次将节点划分为四个层级并分别聚合,从而将原始异构图转换为结构规整的小规模同构图。该策略显著简化了拓扑复杂性,为后续图表示学习奠定了有效基础。二是地址特征提取与增广。为每个地址计算局部特征,并对聚合后的每类地址计算统计特征。随后,利用图特征网络(GFN)对特征进行三层传播与增广,同时保留每层网络的原始节点信息,有效缓解过度平滑问题。三是时序特征优化。将同一地址按时间排序的交易图表示序列输入过滤器增强的多层感知机(F-MLP),经离散傅里叶变换转换至频域,利用可训练的线性滤波器抑制混淆行为和行为噪声,最后经逆傅里叶变换重构增强后的时序信号。此设计显著提升了模型对周期性交易模式的捕捉能力。四是地址分类。将过滤优化后的时序图表示序列输入分类器,输出地址类型标签,以交叉熵损失函数监督训练。本文构建了一个包含时序特征的数据集,为后续研究提供了重要数据基础。在自建数据集及三个公开数据集上进行了系统实验。消融实验表明,去除地址聚合模块、GFN模块、时序过滤模块模型性能均有不同程度下降,验证了三项策略的必要性。在自建数据集上,F-BAC取得了96.7%的精确率、95.9%的召回率和96.3%的F1值,宏平均F1达到91.1%。在BAC数据集上,F-BAC的F1值达到98.4%;在BATC数据集上达到98.0%;在Google/CvdxBp数据集上达到94.6%。对比实验显示,F-BAC的表现均优于BAClassifier、Multi-hop GAT、Balanced-BiEGCN和MDST-GNN等现有方法。此外,F-BAC较BABD方法减少89.3%数据采集量,GFN模块相较GCN节省约30%-45%的训练时间,显著降低了训练成本。综上所述,本文提出的F-BAC方法通过细粒度地址聚合、图特征网络增强和时序频域过滤三项策略,有效缓解了比特币地址类型检测中图规模过大、过度平滑、时序模式缺失和混淆干扰等问题。在多个数据集上的实验验证了F-BAC在这一任务上具有良好的泛化性能。
  • 杜谨泽, 李旭东
    录用日期: 2026-07-09
    针对现有多元时间序列异常检测方法在复杂时序依赖建模、多尺度动态特征刻画以及先验信息利用方面存在的不足,提出一种多分布多尺度自适应先验Transformer异常检测模型MMAPT-AD(Multi-distribution and Multi-scale Adaptive Prior Transformer for Anomaly Detection)。模型首先通过数据嵌入模块对输入多元时间序列进行统一表示,从时间维度与变量维度提取基础时序特征,以增强对变量间耦合关系与动态变化模式的表达能力。随后构建多分布多尺度先验生成机制,在不同时间尺度下联合引入高斯分布、拉普拉斯分布与柯西分布,对序列潜在关联结构进行建模。其中,高斯分布用于描述平稳变化特征,拉普拉斯分布用于增强对局部突变模式的刻画能力,柯西分布用于提高模型对长尾异常及复杂波动模式的适应能力。针对不同尺度下时序依赖关系存在差异的问题,模型在多个时间尺度下生成先验关联矩阵,对局部依赖关系与全局时序结构进行联合建模。同时,引入可学习权重实现多分布先验融合,以增强模型对复杂统计特征与异构动态模式的表征能力。在此基础上,设计先验引导的异常注意力机制,将多尺度先验信息融入注意力权重计算过程。该机制在学习时序关联特征的同时引入结构先验约束,引导模型关注潜在异常相关的关键时间片段与变量通道,从而提升对局部异常、稀疏异常及复杂结构异常的识别能力。为提高模型对复杂异常模式的区分能力,在模型优化阶段结合重构误差、注意力先验差异约束以及多尺度不一致性约束构建联合损失函数,并融合重构误差、注意力分布差异及多尺度结构偏离信息构建综合异常评分,实现时间步级异常判定。为验证模型性能,本文在SMD、MSL、SWaT、SMAP及PSM五个公开数据集上进行了实验。实验结果表明,MMAPT-AD在五个数据集上分别取得93.40%、94.99%、96.06%、96.67%和98.06%的F1值,在多个数据集上达到最优或接近最优的检测性能。其中,在SMD数据集上,F1值较InterFusion与Anomaly Transformer分别提升7.18个百分点和1.07个百分点;在MSL数据集上,较TransDe提升0.63个百分点;在SMAP数据集上,Recall达到99.35%,表现出较强的异常覆盖能力。进一步的消融实验与鲁棒性实验验证了多分布先验建模、多尺度结构约束以及联合优化策略对性能提升的有效性,同时表明模型在输入扰动条件下仍具有较好的稳定性与泛化能力。综上,MMAPT-AD能够有效融合多分布统计特征与多尺度时序依赖信息,在复杂动态场景下表现出良好的异常检测性能与结构适应性。
  • 杨泽凡, 黄迁, 陈薇, 蔡瑞初
    录用日期: 2026-07-09
    针对存在隐变量干扰时因果结构学习准确性下降、观测变量间因果方向难以可靠判断的问题,提出一种基于非高斯信息的隐变量因果发现方法。实际数据中往往存在无法直接观测或难以完整记录的隐变量,这些隐变量会同时影响多个观测变量,使观测变量之间出现由共同原因导致的统计相关关系。不考虑隐变量存在的因果发现方法容易将隐变量诱导的相关性误判为因果关系,进而产生虚假因果边、因果方向错误和结构恢复不完整等问题。为提高含隐变量场景下因果结构恢复的准确性,所提方法在含隐变量的线性非高斯无环因果模型下,利用数据的非高斯信息,对观测变量间的直接因果关系以及隐变量影响下的未定向因果关系进行识别。具体而言,在第一阶段中,方法以观测变量构成的完全无向图作为初始结构,通过基于回归残差的条件独立性检验逐步删除统计独立的变量对,从而获得观测变量间的初始骨架结构。该阶段能够在不显式建模隐变量的情况下,优先确定部分可靠的观测变量间直接因果关系,为后续隐变量检测和剩余边定向提供结构基础。在第二阶段中,针对仍未完全定向且可能受到隐变量影响的变量关系,引入高阶累积量刻画非高斯分布中的高阶统计信息。通过采用四阶联合累积量估计隐变量对观测变量的作用强度,并通过检验是否满足共享单隐成分条件,判断多个观测变量是否受到共同隐变量影响。在此基础上,进一步对受隐变量影响的观测变量间剩余未定向边进行方向判定,最终输出包含观测变量及隐变量的因果结构。理论分析表明,在变量由线性非高斯无环因果模型生成、噪声变量相互独立且相关可识别条件成立的情况下,所提方法能够利用独立性约束和高阶累积量信息识别含隐变量因果结构。为验证方法有效性,在5种模拟因果图和3种样本量设置下,将所提方法与多种代表性方法进行比较。实验结果表明,所提方法在多数场景下精确率较高,比现有方法的精确率至少高30%。同时,所提方法在召回率和F1得分上均取得最优结果,在不同样本量下的F1评分大于或等于75%。特别是在隐变量影响较强、结构较复杂的模拟场景中,所提方法能够有效减少真实因果边遗漏,提高整体结构恢复能力。消融实验表明,所提方法中无隐变量干扰局部结构识别,以及隐变量检测与未定向因果边识别两个阶段均对最终因果结构恢复具有重要作用。在真实金融数据实验中,以香港股票市场中多只成分股收益数据为研究对象,进一步验证所提方法在实际场景中的适用性。实验结果显示,所提方法能够在保持因果图合理稀疏性的同时,识别出具有明确经济含义的隐变量结构,刻画从全市场宏观因子到行业板块再到个体股票的多层级因果传导关系。与多种代表性方法相比,所提方法既避免了因果图边过密的问题,也弥补了部分方法缺乏全局驱动因子或未显式刻画隐变量结构的不足。综合模拟实验、消融实验和真实数据实验结果可知,所提方法能够有效利用高阶统计信息和条件独立性约束,提高含隐变量场景下因果结构恢复的准确性、完整性与可解释性,为复杂数据环境下的因果分析和智能决策提供了一种有效方法。
  • 林聪, 林惠晶, 沈雨, 陈川, 周梦潇, 章湘粤, 涂志刚
    录用日期: 2026-07-08
    城市道路积水是暴雨内涝过程中最直接影响交通通行和应急调度的风险形态之一,及时识别积水等级对于道路管控、抢险部署和公众出行提示具有重要意义。然而,面向真实道路监控视频开展积水分级识别仍存在三方面困难:一是强降雨、夜间低照度、车流遮挡和水面反射会造成同一等级内部差异较大;二是重度、严重积水等高危样本出现频次低,数据呈现明显长尾分布;三是同一摄像头、同一路段或同一降雨事件中视频片段相似度较高,若处理不当会影响模型泛化能力评价。针对上述问题,提出一种少样本多模态标签约束道路积水分级识别方法。首先,将I-JEPA式联合嵌入预测架构扩展到视频片段,以连续帧中的跨帧时空块作为上下文和预测目标,在表征空间预测积水相关目标块特征,避免像素级重建带来的冗余优化,使编码器更关注路面水层、车轮涉水、反光纹理和水面扰动等与积水等级相关的语义线索。其次,利用CLIP文本编码器提取积水等级描述的语义特征,并在支持集原型构建阶段引入文本约束,使视觉特征与“轻微、轻度、中度、重度、严重”等类别语义在共享空间内对齐,从而缓解少样本条件下相邻水深等级边界不稳定的问题。再次,在查询视频与支持原型匹配阶段引入动态时间规整距离,通过帧级累积距离矩阵搜索最优时序对齐路径,使模型能够适应不同视频长度、车辆涉水时刻和关键帧位置差异,提高跨拍摄节奏匹配的稳定性。基于南京市和厦门市真实道路监控视频构建两套积水分级数据集,划分训练集、验证集和测试集前对同源近重复片段进行去重,并结合摄像头编号、道路位置和降雨事件时间进行交叉核查,以降低高度相似片段跨集合分布带来的泄漏风险。在对比实验中,本文选取ResNet50、VGG-16、ViT-B、SwinT-B、HCL、OTAM、CPEA、CLIP-FSAR、Qwen2-VL和Qwen2.5-VL等方法作为基线,并在表格中补充各方法的提出年份和发表来源;同时将2025年以后正式发表且代码开源的AVF-MAE++和TEAM纳入方法层面对比,以说明本文方法与最新开源视频表征学习和少样本视频识别方法之间的差异。实验结果表明,本文方法在南京和厦门数据集上的总体精度分别达到96.4%和95.0%,优于卷积神经网络、Transformer、少样本视频识别方法和多模态大模型基线。鉴于少数类测试样本数量有限,本文不将单次划分中P/R=100%作为独立稳定性证据,而是补充5次独立分层重划分实验,使重度和严重积水样本在不同测试子集中得到多次覆盖;5次实验中总体精度标准差低于0.8%,说明该方法在长尾少样本类别和跨城市场景下具有较好的鲁棒性。
  • 武聪, 曹玉, 田聪聪
    录用日期: 2026-07-08
    随着无人机技术的不断进步,无人机航拍小目标检测受到越来越广泛的关注。针对无人机航拍图像中目标尺度小、分布密集及背景复杂导致的检测精度低、漏检率高等问题,提出一种基于改进YOLOv11n的无人机航拍小目标检测模型PK-YOLO。以YOLOv11n为基线模型,分别从特征提取、特征融合与损失函数三个方面对模型进行针对性改进,旨在提升无人机航拍场景下小目标的检测精度与整体鲁棒性。在特征提取阶段,针对YOLOv11n采用P3至P5层的特征金字塔结构,对尺寸小于32×32像素的极小目标响应能力有限,导致的漏检、误检等问题,研究新增小目标检测层P2检测层,利用更高分辨率的特征图保留更丰富的空间位置信息与边缘细节信息,实现从高分辨率浅层特征到强语义深层特征的渐进式融合,显著增强网络对微小目标的特征提取能力。其次,设计融合核选择融合注意力机制(Kernel Selective Fusion Attention, KSFA)的C3k2_KSFA模块,替换原始骨干网络中的C3k2模块。KSFA机制借鉴动态卷积与选择性核网络的思想,通过并行使用多种扩张率与尺寸的卷积核提取多尺度特征,并利用空间-光谱选择机制自适应地为不同空间位置分配最优的核权重,使模型能够根据输入目标的实际尺寸灵活调整感受野,从而提升对不同尺度目标的特征表达与区分能力。在特征融合阶段,传统固定上采样操作难以适配无人机图像中目标尺度剧烈变化的特性,容易造成小目标特征丢失且易受复杂背景干扰。为此,研究将颈部网络中的固定上采样模块替换为DySample动态上采样。DySample基于点采样策略,能够根据特征图内容自适应调整采样点位置,在放大特征图的同时有效抑制背景干扰,降低小目标特征的丢失率。在损失函数优化方面,针对YOLOv11n所采用的CIoU损失函数易受低质量预测框干扰而导致定位精度不足的问题,引入Inner-IoU机制改进Wise-IoU v3,提出Inner-WIoU损失函数。该函数通过动态非单调调频机制与辅助边框,在保留对困难样本关注能力的同时,增强对目标位置与形状的精细描述能力,有效提升了小目标的定位精度。为验证模型有效性,本文在VisDrone2019、TinyPerson及RSOD三个公开数据集上开展对比实验。在VisDrone2019数据集上的实验结果表明,与基线模型相比,PKD-YOLO模型在mAP@0.5和mAP@0.5:0.95上分别提升5.0%和3.3%,精确率提升5.0%;在更具挑战性的TinyPerson数据集上,上述三项指标分别提升5.7%、1.9%与7.4%,充分证明了模型在复杂场景下对小目标的检测优势。在RSOD数据集上,mAP@0.5与mAP@0.5:0.95分别达到了96.1%与68.8%,较基线模型分别提升2.7%与3.6%,表明模型在保持较高定位精度的同时,对目标检测的置信度判别能力有所增强。综合三个数据集的实验结果,PKD YOLO在多种无人机航拍场景下均表现出优越的小目标检测性能,验证了本文所提改进方法的有效性与泛化能力。
  • 朱弘毅, 陈鹏, 李智鑫, 许小龙, 吕智慧, 叶广楠, 柴洪峰
    录用日期: 2026-07-08
    针对当前大语言模型在医疗等高知识密度与强逻辑约束领域应用时,同源多智能体系统因底层思维逻辑一致性导致的自我纠错能力缺失、算力投入与性能产出不成正比等核心瓶颈问题,提出并实现了一种基于异质模型交互验证的多代理验证融合结构。该结构通过精密设计的提示工程构建了一个差异化的层级协作架构,其技术实现的核心在于打破单一模型系列的逻辑盲区。系统由具备极高参数量与泛化推理能力的高性能大模型担任核心决策智能体,负责解析医疗病历信息并生成初步诊疗逻辑;同时,创新性地引入了输出风格稳定、逻辑倾向保守且具备完全不同训练分布的异源模型作为验证层。其中,验证层并不参与答案的生成和决定,而是专注于对决策层输出的推理路径、医学事实一致性以及逻辑合理性进行多维度的“验证-问题列举-响应”式审计。这种特定结构的逻辑基础在于:利用异源模型间的思维差异性来实现异源智能体之间的逻辑冲突与交叉验证,从而在确保医疗事实严谨性的基础上,显著增强系统输出的多样性与稳健性,同时提升模型对于场景的适应能力和稳定性。在针对糖尿病医疗领域的专项实验分析中,该模型展现出显著的性能增强。实验结果显示,相较于相同基座配置的单智能体基线,模型在医疗知识选择题上的正确率提升了约 10%,在简单医学填空上提升了约 8%,在复杂医学题上的表现提升了约 22%。通过与当前前沿的策略模型 Colacare 进行深度对比,研究发现模型在处理医学决策时表现出更优的逻辑一致性与推理稳定性。此外,更突出的成果是,该系统在不依赖高成本的标注数据集和无需进行任何模型微调训练的情况下,其综合评测性能已超越了经过深度领域微调的专业模型 Diabetica-7B。在工程可行性与资源消耗的权衡分析中,实验数据记录显示该系统的平均推理消耗为 61,881 tokens/题,平均推理时延为 71.74 s/题;相较于 Diabetica-7B 等专用模型,该系统不仅规避了高昂的算力训练成本与数据标注周期,还通过灵活的插件式架构降低了系统的整体设计复杂度。研究结论表明,在处理高知识融合、强约束需求的医疗决策问题时,引入模型间的异质性而非单纯堆叠同源模型规模,是提升系统可靠性的关键路径。模型的成功实践证明,通过优化异构智能体间的协作校验机制,可以在不损失大模型推理上限的前提下,利用异源模型的稳健性有效填补逻辑漏洞。这一研究成果不仅为医疗 AI 系统在复杂任务下的低成本部署提供了全新的技术框架,也为大语言模型从“通用智能”向“可靠专业智能”的范式转型提供了重要的理论支撑与实践指引。
  • 张智伟, 陈晓红, 朱玉莲
    录用日期: 2026-07-01
    锚点二分图能够以较低计算代价近似样本间关系,是大规模多视图聚类中的常用图构建方式。但现有方法多采用随机采样、K-Means中心或静态字典生成锚点,锚点位置通常在图学习前固定。在非球形簇、环状簇、长条状簇以及簇间密度差异较大的数据中,静态锚点难以贴近局部密度峰与弯曲簇边界,容易产生锚点失配。由此构造的样本–锚点二分图会包含冗余连接或不可靠连接,影响跨视图结构融合,并降低聚类结果的稳定性。针对上述问题,提出一种均值漂移引导的多视图锚点二分图聚类方法。该方法的目标是在保持锚点图高效率的同时,提高锚点对复杂数据分布的自适应刻画能力,并将图学习与聚类划分纳入统一优化过程。首先,在每个视图中初始化锚点集合,并利用Mean Shift沿核密度梯度迭代更新锚点,使锚点由欧氏中心代表点转向局部密度模式。随后,根据样本到近邻锚点的距离估计局部带宽,只保留每个样本的近邻锚点关系,构造稀疏且密度感知的样本–锚点二分图。其次,将各视图二分图分解为共享一致性图和视图特有互补图。一致性图用于刻画不同视图共同支持的聚类结构,并施加核范数约束以增强低秩性和结构紧致性;互补图用于保留单个视图中偏离共识但具有判别作用的局部信息,并施加稀疏约束以抑制噪声和冗余连接。再次,依据重构误差自适应学习视图权重,避免各视图等权融合带来的信息干扰。在此基础上,融合一致性图与互补图,构造联合样本–锚点二分图和增广拉普拉斯矩阵,并通过谱迹约束使联合图趋向于形成给定数量的连通分量。模型采用块坐标下降策略交替更新聚类指示矩阵、一致性图、互补图和视图权重。各子问题可通过特征分解、软阈值算子、奇异值阈值和二次规划求解,从而实现图结构学习与聚类划分的一步优化。实验在Handwritten、BBC-sport、MSRC_v1和Caltech101-7四个多视图数据集上进行,并采用ACC、NMI和F-score评价性能。结果表明,所提方法在12项指标中获得8项最优。在Handwritten上取得最高NMI,为0.949;在BBC-sport上ACC和F-score分别达到0.971和0.933;在MSRC_v1上ACC和F-score分别达到0.966和0.931;在Caltech101-7上ACC、NMI和F-score分别达到0.711、0.521和0.484,三项指标均为最优。消融实验进一步表明,Mean Shift锚点更新、一致性–互补性分解和拉普拉斯谱迹约束均对性能提升有贡献。在Caltech101-7上,完整模型的ACC、NMI和F-score高于仅使用Mean Shift模块的0.534、0.362和0.348。不同锚点策略对比显示,Mean Shift锚点的三项指标为0.711、0.521和0.484,明显高于K-Means锚点的0.576、0.395和0.456,也高于随机采样锚点的0.308、0.260和0.320。收敛性实验显示,目标函数通常在前5–10次迭代内快速下降,并在20次迭代内趋于稳定。复杂度分析与运行时间实验表明,在固定锚点数和迭代次数时,算法运行时间随样本规模近似线性增长。综上,所提方法能够利用密度信息校准锚点位置,增强二分图对复杂簇结构的表达能力,同时兼顾多视图一致性、互补性与一步聚类优化,在非球形和密度不均数据上表现出较好的聚类效果、稳定性和可扩展性。
  • 邓波, 毛代坤, 吴楠, 徐凌桦, 杨靖, 林建华
    录用日期: 2026-07-01
    针对光伏电站异构多功能清洗机器人集群在多约束条件下的协同任务分配问题,提出了一种基于重叠联盟形成博弈的分布式任务分配方法。首先,构建面向光伏运维的多约束异构机器人集群协同任务优化模型。系统分析异构机器人与多元运维任务的资源适配机理,设计了光伏组件污染等级与机器人清洗能力的匹配机制,建立融合综合资源匹配度、挽回发电损失、运维总成本、最大完工时间和冗余惩罚机制的综合效用函数,该任务分配问题的目标函数构建为最大化联盟总效用,结合工程实际引入任务优先级、任务唯一性与安全距离等约束条件,完成机器人集群运维任务的精细化数学建模,显著提升了机器人与任务间的资源匹配度与运维调度适配性。其次,构建基于双边互利准则的重叠联盟形成博弈框架。该框架将全局组合优化问题转化为分布式联盟划分问题,依托所定义的偏好关系与交换操作,可支持机器人跨联盟动态协作与自主形成重叠联盟结构,进一步提出一种可以描述个体自私逐利与系统全局最优映射关系的双边互利交换准则,显著提升了资源调度灵活性,有效协调了个体理性与系统整体效用;该博弈被证明为势博弈,当机器人最大化自身效用而改变资源分配结构时,目标函数的差异与效用函数的差异是一致的,且博弈框架中至少存在一个纳什均衡即稳定的联盟结构。最后,设计一种融合偏好引力引导与扰动机制的重叠联盟形成算法。算法引入偏好引力机制为机器人选择联盟提供方向性指引,利用边际收益评估机制与提出的双禁忌列表剔除低效联盟、规避无效搜索,结合协同设计的动态资源调整策略与随机扰动机制有效摆脱局部最优;该算法被证明可以在有限次迭代内收敛到T-稳定状态,通过分析其复杂度处于可控范围;最终该算法在求解由任务优化模型与博弈框架所构成的任务分配数学模型时,能够满足异构机器人集群在复杂多元任务协同场景下的任务分配需求,并快速收敛至高质量的纳什均衡解。仿真实验结果表明,本文所提方法在保证全局解质量的前提下,兼备显著的实时性与稳定性。在消融实验中,验证了各改进策略能全面提升算法综合性能;在验证算法解质量与运维指标实验中,相较于基线算法,本文算法挽回发电损失提升了6.63%,运维总成本降低了2.55%,平均作业时间缩短了13.29%;在规模变化下性能对比分析实验中,本文算法在不同机器人与任务数量变化情况下各项指标均为最优;在实时性与稳定性实验中,本文算法平均运行时间不超过6.09s,标准差与Wilcoxon秩和检验具有统计显著性。可制定经济高效的任务分配方案,为光伏电站精细化运维提供了有效技术支撑。
  • 孙万杰, 张宏, 李豪杰
    录用日期: 2026-06-29
    针对点云检索过程中的特征提取过程,主流方法通过层次化局部邻域特征聚合形成全局形状描述符,其对物体结构信息的感知主要依赖于对表面点空间分布的间接推断,缺乏对点云骨架等显式结构先验的直接利用。针对现有点云检索方法在提取全局形状特征时结构信息利用不足的问题,该文提出一种用骨架先验增强结构感知的点云检索网络。该文首先引入点云骨架作为结构先验,通过显式融合与隐式引导双重机制增强点云特征的结构表达能力,并设计自适应特征聚合模块聚合多个尺度特征,从而形成最终的全局描述符。具体而言,该文方法包含两模块。第一,双分支特征融合模块:该模块从输入点云中提取骨架点云,然后通过两个独立的PointNet++分支分别提取原始点云与骨架的多尺度局部特征。在每个尺度上,以骨架特征作为键与值、点云特征作为查询,采用多尺度交叉注意力机制将骨架结构信息加权融合到点云特征中。同时,构造对比学习任务,将裁剪点云与完整骨架组合作为锚点,完整点云与骨架组合作为正样本,批内其他类别样本作为负样本,通过损失隐式引导模型学习结构一致性,形成“显式融合+隐式引导”的双重结构增强机制。第二,设计多尺度局部自适应聚合模块(MVLAAD):该模块由VLAAD与多尺度聚合增强两部分组成。VLAAD基于轻量级Transformer解码器,以输入点云的局部特征序列为键与值,以初始通用聚类中心为查询,通过多层交叉注意力迭代更新,动态生成适应每个输入样本的个性化聚类中心;再结合动量更新策略融合通用中心与个性化中心,平衡自适应性与稳定性。接着,基于更新后的聚类中心,分别对精炼后的多尺度特征计算软分配权重并聚合残差,生成三个尺度的全局描述符,最后经门控机制增强后输出最终紧凑描述符。此外,具体训练过程中采用动态权重调整策略,综合分类损失、三元组损失和对比损失进行训练。训练初期侧重对比学习,后期转向三元组损失,从而同时强化结构感知与判别性学习。实验结果表明,在ModelNet40数据集上该方法取得82.6%的mAP,较先进方法CF3D提升1.3%。在ShapeNet上达84.6%,优于现有方法。消融实验验证了各模块的有效性:基线Pointnet++的mAP为62.0%,引入该文的设计后模型性能提升至82.6%。轻量化版本参数量降至20.34M,mAP提升至84.7%。鲁棒性实验表明,方法在中等稀疏、低噪声及轻度遮挡条件下表现稳健,但在极端退化条件下性能明显下降。综上所述,该文所提出的骨架先验增强结构感知网络,通过显式融合骨架先验与隐式对比学习引导,解决了现有方法对结构信息利用不足的缺陷;设计的MVLAAD模块通过动态生成个性化聚类中心,实现了对全局描述符判别性的提升。