作者投稿和查稿 主编审稿 专家审稿 编委审稿 远程编辑

最新录用

Please wait a minute...
  • 全选
    |
  • 张晗瑞, 张淑芬, 刘新蕊, 姜志, 王炯炯
    录用日期: 2026-07-30
    近年来,为了克服传统联邦学习在面临设备系统异构和通信带宽受限时的瓶颈,联邦原型学习(FPL)通过聚合低维的特征原型而非庞大的高维模型参数,极大降低了通信开销。FPL的开放式分布式架构使其在实际部署中面临着安全威胁:缺乏严格准入机制的网络极易遭受外部攻击者的身份伪造;同时内部恶意节点可通过上传恶意构造的虚假原型实施投毒攻击,严重破坏全局特征空间。针对FPL在开放网络环境下易遭身份伪造,且现有统计学防御机制在非独立同分布场景下难以区分恶意扰动与良性异构特征导致诚实长尾节点被误剔除的问题,提出了一种面向FPL的格陷门可控身份追溯机制(FedLHT)。该机制将安全防线从概率性统计检测转化为确定性数学计算,构建了事前匿名、事中验证与事后追责的完整轻量级防御架构。在初始化阶段,基于格密码构造无证书签名体系,利用原像采样算法实现身份标识与格上短向量私钥的密码学绑定,实现了验证权与追溯权的物理解耦;在匿名准入阶段,通过注入格上误差生成隐匿真实身份的可追溯标签,并结合拒绝采样技术输出非交互式签名,在保障信息论匿名性的同时消除签名对私钥的统计依赖。在聚合验证阶段,将非线性群运算全面降级为格上矩阵-向量的线性乘加计算,实现了轻量级的批处理准入;在靶向追溯阶段,监管实体利用独占的格陷门主基及其短正交化性质求解有界距离解码问题,从异常误差项中靶向恢复恶意节点的真实身份,进而驱动全局模型精准剥离恶意历史贡献以实现自愈。该机制的安全性严格规约至平均情况下的带误差学习(LWE)问题与小整数解(SIS)问题,从根本上赋予了系统抵抗未来大规模量子计算机攻击的后量子安全属性。在模型自愈层面充分利用了特征原型向量的线性叠加同态特性。锁定恶意身份后服务器仅需在全局原型池中执行低开销的向量减法,即可在常数级时间内抹除恶意节点的历史贡献,实现了训练过程的无缝衔接。与隐私保护联邦学习投毒防御机制(ShieldFL)及基于信任引导的鲁棒联邦学习机制(FLTrust)等方案相比,全局模型准确率在CIFAR-10数据集上维持在83.65%以上;在数据异构程度系数为1.0的严苛Non-IID环境下,对诚实长尾数据的保留率高达98.75%,实现了零误判响应。此外,在40个并发客户端规模下,客户端局部耗时仅1.22毫秒,服务器端身份验证总开销低至6.42毫秒,有效克服了传统双线性配对群签名方案的计算瓶颈,适用于资源受限的移动物联网场景。
  • 汪晨亮, 赵佳乐, 葛星彤, 彭玲
    录用日期: 2026-07-30
    历史文献作为人类文明与红色文化的核心载体,其文本内部蕴含着高度密集的时空线索与错综复杂的实体关联。然而,传统数字人文领域的知识组织方法长期面临多源史料碎片化、记述风格异构化以及人地时事指代模糊等瓶颈。通用大语言模型直接应用于历史文本处理时,极易因缺乏领域先验知识而导致实体边界识别失准;同时,历史实体普遍存在的同名异实与异名同实现象,使得传统实体对齐算法在海量图谱节点比对中面临计算复杂度随规模呈二次方增长的开销危机;此外,传统检索增强生成方法忽略了文本间隐式的时空拓扑约束,在应对跨时段历程梳理与复杂时空转移等叙事型问答时往往衍生逻辑失真。鉴于此,本文提出一种面向历史文献的大语言模型结合知识图谱的时空叙事增强框架,旨在实现大规模历史文本的高效结构化抽取、高精度关联融合以及深层次时空推理问答。 本文所提框架采取分层协同设计,包含知识抽取、实体对齐以及时空叙事智能问答三个递进式核心模块。在知识抽取阶段,针对历史文本专名密集且语法特殊的特征,设计了基于历史约束的提示词链框架,将单一的抽取任务解构为分步推理提示、领域先验知识注入以及结构化输出约束校正三个级联阶段,通过在上下文流中引入军事术语、历史地名及干支纪年对照表,实现非结构化文本向图结构数据的精准、大批量转化。在实体对齐阶段,为消除跨源多谱归并中的计算瓶颈,提出两阶段实体对齐算法。第一阶段引入索引优化筛选机制,构建涵盖文本别名、生命周期、地理层次映射及社会拓扑关系的四维混合索引,利用分桶策略将待对齐节点的搜索空间收敛至个位数,从而将整体算法的时间复杂度从平方级压缩至线性级;第二阶段执行大模型增强的语义判别,融合候选实体的动静态属性特征与多跳关联网络计算综合相似度,并借助置信度评估机制建立人机协同的分级决策闭环。在智能问答阶段,设计时空叙事图检索增强生成模块,通过指令微调或语义解析将自然语言查询映射为包含显式时空边界的结构化约束条件,动态生成面向图数据库的查询语言,进而从全局图谱中检索多跳关联的时空子图,将时序演进特征与空间拓扑结构完整传递至生成模型,驱动其生成具备严密逻辑链条与高可解释性的时空叙事文本。 为验证所提框架在实际场景下的鲁棒性与有效性,本文在自建红色历史文献数据集 N4A-Hist 以及公开历史数据集 CHisIEC 、多语言通用数据集 DBP15K 上进行了多维度的实证评估。实验结果表明,在面向非结构化文本的知识抽取任务中,提示词链框架在 N4A-Hist 和 CHisIEC 数据集上的 F1 指数分别达到 94.8% 和 92.1% ,较之基座模型直接抽取的基准性能分别提升了 16.3% 和 14.0% ,消融实验亦证实了分步约束对缓解格式幻觉的决定性作用。在跨源实体对齐测试中,两阶段实体对齐算法在 N4A-Hist 上的 Hits@1 达到 91.3% ,MRR 达到 0.962 ,且在线总耗时仅为 0.8 小时,相较于前沿的大模型对齐方法 ChatEA 、 LLM4EA 以及传统方法 EasyEA ,在保持同等或更高精度的前提下,运行开销缩短了 75% 以上,而在通用数据集 DBP15K 上同样保持了 98.3% 的 Hits@1 以及 4.2 小时的快速收敛表现,充分印证了四维索引在平抑计算规模扩张方面的优越性。在包含 530 条复杂推理指令的问答测试中,时空叙事图检索增强生成模块在空间位移型问题与跨时段综合推理型问题上的回答准确率较传统向量数据库检索分别大幅攀升了 47% 和 54% 。 综上所述,本文研究表明,将大语言模型深层的语义表征能力与知识图谱严谨的拓扑结构知识有机融合,是破解历史文献数字人文研究中高歧义性、强时空关联性瓶颈的有效途径。所提框架在保障自动化处理流转效率的同时,通过置信度过滤与多维约束机制平抑了技术落地中的不确定性风险,为海量、异构的历史文献资源
  • 庄崇毅, 查铖, 胡浩枫, 周泽伟, 孟雩昊, 赵卫薇, 洪颖浩
    录用日期: 2026-07-30
    低空无人机航拍图像中的微小目标检测面临尺度小、分布密集、背景干扰强和成像条件复杂等问题。与一般目标相比,微小目标在图像中仅占少量像素,其边缘、纹理和形状信息容易在特征提取过程中被背景响应淹没。现有检测方法通常通过多层卷积和逐级下采样获得高层语义特征,但这一过程会快速降低特征图空间分辨率,使微小目标的局部结构和像素级细节被削弱甚至丢失。虽然特征金字塔和注意力机制能够在一定程度上缓解尺度变化和背景干扰问题,但多数方法更侧重多尺度语义融合,对下采样阶段造成的细粒度空间信息衰减缺乏直接约束;同时,通道特征之间的协同建模不足,使分散在不同通道中的微小目标关键信息难以形成稳定的判别表达。 针对上述问题,提出一种基于重标定细粒度下采样和组间协同建模的微小目标检测网络RFINet。首先,构建重标定细粒度下采样(Recalibrated Fine-grained Downsampling,RFD)模块,以空间切片和通道重组替代传统下采样操作,将局部空间信息映射到通道维度,在降低特征图尺寸的同时保留微小目标的细粒度结构。针对通道扩展带来的冗余响应和背景噪声,RFD进一步引入跨通道自适应重标定机制,根据聚合特征的通道响应强度重新分配权重,从而增强目标相关通道并抑制无关背景。与直接采用步长卷积或池化操作相比,RFD并不简单丢弃空间采样点,而是通过结构化重排将原本容易被压缩的信息转移至通道域,为后续特征提取提供更完整的局部上下文。其次,设计组间协同建模(Inter-group Collaborative Modeling,ICM)模块,将输入特征划分为多个通道子空间,分别提取各组内的局部显著信息,并通过权重再分配、残差连接和通道拼接促进组内增强与组间交互。该设计既保留了分组建模对局部特征的细粒度刻画能力,又缓解了固定分组导致的信息隔离问题,使网络能够更充分地整合分散在不同通道中的微小目标线索。最后,在检测头中完成目标类别预测和边界框回归,实现复杂低空场景下的微小目标检测。 为验证所提模块的作用,本文从不同输入分辨率、模块消融、模型复杂度、检测精度以及跨数据集泛化等角度进行实验分析,以考察RFINet在微小目标密集分布、尺度变化明显和背景干扰较强条件下的综合性能。在VisDrone2019数据集上的实验表明,RFD有效保留细粒度信息并抑制通道扩增带来的背景噪声,ICM则通过组间交互强化关键区域响应,削弱无关背景干扰,二者结合后模型在不同输入分辨率下均取得稳定增益。RFINet在640×640和960×960输入尺寸下的mAP@0.5分别达到40.8%和47.5%,优于参与比较的主流两阶段检测器、单阶段检测器和轻量化检测模型。实验结果表明,所提方法能够在保持较高检测精度的同时增强对密集、遮挡和复杂背景中微小目标的表征能力,为低空无人机视觉感知任务提供了一种更具针对性的特征建模方案。
  • 于瓅, 杜泽熙
    录用日期: 2026-07-29
    现有点云补全网络主要依赖单模态点云自身的空间坐标和局部邻域特征进行形状推理,但部分点云通常存在点分布稀疏以及全局轮廓信息不足的问题,难以准确判断缺失区域的空间方向和结构边界,导致补全结构出现细节缺失和拓扑结构不连续的问题。以往跨模态点云补全方法需严格依赖于成对输入的多模态数据,多模态数据的采集和配准过程也会增加数据构建成本,难以直接在现实工程中应用。为此,提出一种基于双状态引导的跨模态点云补全网络(DSG-Net),旨在弥补单模态特征的固有表征不足。DSG-Net仅以输入进来的部分点云作为原始数据,在数据预处理阶段通过预设的针孔相机模型投影渲染生成对应的深度图来辅助单模态点云进行补全,从而摆脱了传统跨模态方法对严格配对多模态数据的依赖。首先,设计的跨模态融合生成模块(CMFG)将提取出来的点云特征和深度图特征利用卷积映射至相同的特征空间进行拼接融合,再通过多头自注意力机制将融合特征进行长距离建模,并将建模后的互补特征通过逐点拆分初步生成粗点云。其次,细化阶段引入双状态引导细化模块(DSGR),其包含结构分析与相似性比对两条并行处理通道。结构分析通道通过度量生成点云与输入部分点云之间的空间相关性,引导网络重点关注缺失区域的结构差异,以提升整体轮廓和局部结构的连续性。相似性比对通道则侧重于挖掘不同局部区域之间的潜在相似模式,引导缺失区域的拓扑优化,从而进一步增强补全点云的形态一致性与细节完整性。最后,DSGR模块内部集成状态流动模块(SFBlock),用于实现在迭代细化过程中特征状态的动态更新与有效传递。SFBlock模块通过双门控单元分别控制历史积累状态和当前输入特征的保留比例,可以动态调控细化过程中的局部细节和位置偏差,避免已恢复的形状信息在多次迭代中被削弱或冗余。为验证DSG-Net网络的有效性,在两个公开数据集PCN、ShapeNet55以及一个自建的兵马俑数据集上进行实验评估。实验结果表明,DSG-Net在公开PCN数据集上的平均CD-L1为 6.72,比PoinTr(8.38)的平均CD-L1相对降低19.81%。同时,DSG-Net在8个类别上的CD-L1指标均优于最新网络 3DMambaComplete,进一步说明了DSG-Net网络能够有效提升缺失区域的结构补全精度。在ShapeNet55数据集上,DSG-Net 在三种不同难度任务中的平均CD-L2达到 0.89,同时,在常见的五个类别中,DSG-Net在其中三类上取得最优补全效果。在自建兵马俑数据集上,DSG-Net的平均CD-L1为5.23,比PoinTr(5.84)的平均CD-L1相对降低10.45%,表明DSG-Net网络在非公开数据上具有较强的泛化性。综上,DSG-Net在公开数据集与自建数据集上均取得了良好的补全效果,说明其不仅能够有效恢复复杂物体的形状结构,还具有较强的跨数据集适应能力,可为后续文化遗产数字化建模与残缺文物修复提供有价值的技术参考。
  • 李整, 王文凯, 秦金磊, 耿聆, 刘铭远
    计算机工程.
    录用日期: 2026-07-29
    针对电力负荷序列非平稳性强、多尺度波动显著、周期信息难以稳定建模且在多步预测中易出现衰减与相位偏移,以及温度、湿度、电价等外生变量与负荷间耦合复杂的问题,本文提出一种基于时频特征融合与多周期残差耦合的短期负荷预测方法(time-frequency fusion and periodic residual coupling,TFF-PRC),旨在提升模型对负荷序列长期趋势、局部波动和周期规律的联合表征能力,同时增强多变量场景下外生信息的有效利用,从而提高不同预测步长下的预测精度与稳定性。现有深度学习方法多依赖时域建模或全局依赖建模,对低频趋势、高频扰动及显式周期信息利用不足;同时,多变量建模中过早混合外生变量易引入冗余噪声,完全通道独立又会削弱有效交互。为此,本文从时频协同建模、多周期残差补偿和负荷中心通道交互三个方面构建预测框架。首先,在时域采用移动平均分解提取趋势和季节成分,在频域通过多层离散小波变换(discrete wavelet transform,DWT)获取低频近似分量及多尺度高频细节分量。通过定向融合机制,低频增强趋势,高频增强季节,使频域信息以残差形式参与时域成分构造,从而强化模型对长期趋势和局部扰动的刻画能力。随后,增强后的趋势与季节分量分别输入通道独立的时序切片特征提取网络,利用卷积捕捉局部模式,并通过多层LSTM建模长短期依赖,以获得稳定、纯净的高维表示。针对多步预测中周期衰减和相位偏移问题,本文基于快速傅里叶变换(fast Fourier transform,FFT)识别负荷序列主导周期,提取与预测区间相位对齐的历史同期负荷片段,并通过样本级自适应加权生成周期补偿特征,以残差形式增强主干预测结果。随后,负荷中心通道交互模块以负荷为查询中心,通过查询-键-值机制选择性聚合温度、湿度、电价等外生变量信息,在保留多变量建模能力的同时有效抑制通道间噪声干扰。本文在澳大利亚新南威尔士州(New South Wales,NSW)和西班牙(Spain)两个公开电力负荷数据集上进行实验验证,输入窗口48时间步,预测未来1、2、24和48时间步。相比于主流基线模型,TFF-PRC在NSW数据集MAE平均降低11.03%~20.11%,RMSE平均降低11.41%~18.53%;在Spain数据集MAE平均降低3.99%~5.23%,RMSE平均降低4.05%~4.10%,表明模型具有良好的泛化能力。消融实验显示,移除TFF、PRC或LCA模块后,MAE分别上升7.54%、10.63%和7.00%,RMSE分别上升7.03%、8.18%和8.10%,验证了各模块对预测性能的贡献。综上,TFF-PRC通过时频定向融合、多周期残差耦合及负荷中心通道交互,有效
  • 任翊宁, 吴志周, 梁韵逸
    录用日期: 2026-07-29
    现有车路协同感知任务调度方法面临两大核心问题:计算资源硬约束刻画不足,以及调度决策效率难以满足动态环境需求。此外,在车路协同感知任务调度过程中,智能网联汽车(Connected Autonomous Vehicle, CAV)与路侧单元(Roadside Unit, RSU)之间存在双向数据传输(RSU向CAV下发感知数据、CAV向RSU卸载任务并接收结果)。在这一过程中,任务完成时延模型中RSU端计算时延与分配的计算资源呈反比关系,从而在时延模型中引入分式非线性项,进一步提升了问题的数学复杂度。针对上述问题,本文考虑RSU和CAV两端均存在计算资源上限约束的情形,构建车路协同感知任务调度模型,旨在最小化系统总时延。在通信层面,模型采用正交频分多址(Orthogonal Frequency Division Multiple Access, OFDMA)接入方式,通过RSU为各车辆分配正交子载波,保证CAV与RSU之间具备均等的通信带宽;同时考虑车辆高速移动产生的多普勒频移与载波间干扰(Inter-Carrier Interference, ICI),建立车速与数据发送速率之间的定量关系。在计算资源分配层面,模型显式刻画RSU总计算资源上限约束、单任务计算资源上限约束、RSU最大并行任务数约束以及CAV车载计算资源上限约束。从RSU视角,核心决策是选择接纳来自哪些CAV的任务并为其分配计算资源,使任务卸载决策与计算资源分配相互耦合。在此基础上,本文以最小化系统内所有CAV的任务完成时延总和为目标函数,以任务卸载决策变量、RSU计算资源分配连续变量、CAV本地计算资源分配连续变量为核心优化变量,并引入任务完成时延作为辅助变量,构建了包含分式非线性约束的混合整数非线性规划模型。为解决非线性约束导致的求解困难,本文基于外逼近法提出一套定制求解算法。该算法利用时延函数的凸可分特性,对RSU处理任务的延迟表达式进行一阶泰勒展开,生成外逼近切割,将原非线性模型转化为混合整数线性规划问题。针对传统外逼近法对初始点敏感、收敛稳定性不足的缺陷,本文提出初始点选取策略:将单个任务可分配的最大计算资源作为初始点,以提升模型求解质量和求解效率。为评估模型性能,实验将本文模型与两种基准方案进行对比:(1)所有CAV完全本地处理任务,不使用RSU资源;(2)CAV优先将任务卸载至RSU,超出RSU承载能力的任务由CAV本地处理,RSU为每个被卸载的任务分配均等计算资源。实验结果表明:相较于CAV优先将任务卸载至RSU的方案,本文模型将任务完成时延总和降低15.6%;其中单辆CAV的任务完成时延最大降幅达32.4%。本文还将所提算法与遗传算法和自适应大邻域搜索算法进行对比。实验结果表明:在求解效率方面,本文提出的初始点选取策略可使算法平均2.55轮收敛、求解用时控制在0.91~2.86秒;本文算法相较于遗传算法在求解用时上平均节省56.2%。以上结果表明,本文提出的计算资源约束下的车路协同感知任务调度模型与方法,可有效降低系统总时延,提升调度决策效率。
  • 曲海成, 宿文华
    录用日期: 2026-07-29
    针对多模态情感分析中模态表示异质性强、视觉和音频等非文本模态易引入冗余噪声,以及不同样本下模态贡献难以动态建模等问题,提出一种文本引导与双门控自适应图融合模型(Text-Guided and Dual-Gated Adaptive Graph Fusion,TGAGF)。在视频情感分析任务中,文本、视觉和音频分别从语义内容、面部表情和声学变化等方面提供情感线索,但三类模态在表示形式、信息密度和噪声分布上存在明显差异。文本模态通常具有较强的语义表达能力,能够更直接地反映说话人的观点和情感倾向;视觉和音频模态能够补充表情、姿态、语调和语速等非语言信息,但也容易受到个体差异、环境干扰和采集质量等因素的影响。若直接对多模态特征进行融合,非文本模态中的弱相关信息和冗余噪声可能被引入联合表示,并在跨模态交互过程中进一步传播或放大,从而削弱模型对情感极性、细粒度等级和连续情感强度的判别能力。为此,TGAGF以文本模态为语义引导,在跨模态融合过程中增强视觉和音频模态中有效情感线索的表征能力,并抑制冗余噪声对情感判别结果的影响。首先,模型对文本、视觉和音频三种模态进行特征提取与维度对齐,将不同模态特征映射到统一语义空间,为后续融合提供结构一致的输入表示。随后,通过共享—特有双分支解耦网络分离跨模态一致信息与模态特有信息。其中,共享分支提取与情感表达相关的一致语义信息,特有分支保留各模态自身的补充判别信息;同时结合重建一致性、特定一致性、度量约束和正交约束,从语义恢复、模态稳定性、跨模态一致性和子空间独立性等方面约束解耦表示,降低共享特征与特有特征之间的语义混叠。其次,利用文本引导双阶段门控机制在图关系推理前抑制视觉和音频模态中的冗余噪声,在图传播后重新加权各模态表示。第一阶段门控对进入图关系推理模块的模态信息进行预筛选,减少无效信息在关系传播过程中的扩散;第二阶段门控依据图传播后的跨模态交互结果重新调整各模态贡献,使模型能够根据不同样本的情感表达特点动态分配模态权重。在此基础上,将文本、视觉和音频三种模态作为图节点,通过可学习邻接矩阵建模模态间依赖关系,在模态级显式刻画不同模态之间的语义相关性,并通过图消息传播增强模态间互补信息。最后,采用级联多任务预测策略联合建模情感极性、细粒度等级和连续情感强度,使模型同时兼顾情感方向判别、情感等级区分和连续强度估计。在CMU-MOSI和CMU-MOSEI数据集上的实验结果表明,所提模型在多项评价指标上取得较优性能。其中,在CMU-MOSI上的Acc7、Acc5、Acc2和F1分别为48.4%、56.1%、85.3%和85.3%;在CMU-MOSEI上的Acc2、F1和MAE分别为85.2%、85.1%和0.534。与多种经典方法和近期代表性方法相比,TGAGF在情感分类和情感强度预测任务中均表现出较强竞争力。实验结果验证了所提方法在缓解模态异质性、抑制冗余噪声干扰、动态
  • 姜晓恒, 孙柯凡, 邵蒙恩, 胡世哲, 徐明亮
    录用日期: 2026-07-29
    可信的多模态分类通过整合异构数据流并量化预测不确定性,在医疗诊断、自动驾驶等高风险领域具有重要意义。然而,现有方法在处理多模态冲突时,多数方法仍存在三个核心问题:机械噪声处理导致模型在证据匮乏时过度自信、统一融合范式造成模态特有深层语义被“特征同化”而丢失、以及不确定性估计未能作为动态反馈信号闭环引导融合决策。为应对这些核心挑战,本文提出联合类对抗学习与动态融合的可信多模态分类方法(JALDF)。该方法旨在通过特征对齐、语义保留和自适应融合的协同优化,系统性提升多模态分类的准确性、抗噪性和可信性。 在技术实现上,JALDF包含三个核心创新模块。首先,跨模态类相似度模块对各模态特征进行Sigmoid稀疏化和L1正则化以筛选高判别力子集,随后按类别提取样本,采用Wasserstein距离度量同一类别在不同模态下特征分布的差异,通过最小化该距离迫使网络建立跨模态共享的判别性表征。该模块利用最优传输理论精确刻画分布间的最小搬运代价,相较于KL散度等对称性度量,Wasserstein距离在特征空间存在较大分布偏移时仍能提供稳定的梯度指导,从而确保跨模态对齐的有效性。其次,为抑制上述约束导致的模态过度趋同,语义对抗类模块将每个模态视作独立领域,为样本分配模态归属标签并训练领域分类器,该分类器与相似度模块形成对抗博弈,即相似度模块努力混淆模态差异,而领域分类器则力图区分模态来源,从而在保持类间分布接近的同时,精准保留各模态独有的深层信息。这一对抗性设计首次被引入多模态可信分类领域,有效化解了特征塌缩与信息丢失的矛盾。最后,置信度监督的自注意力融合模块将各模态特征映射为查询、键和值,通过多头自注意力计算模态间依赖权重,并以真实类概率(TCP)作为可信监督信号训练置信度估计分支,使模型在测试阶段无需标签即可动态评估各模态证据质量;融合损失同时包含分类交叉熵与置信度均方误差,驱动注意力权重根据当前置信度实时调整,实现对高质量模态的增强和低质量、噪声模态的抑制。该闭环监督机制使得不确定性度量直接参与融合权重的生成,突破了传统静态融合的局限。 在五个公开多模态数据集(Cub、Caltech101、Scene15、Animal、PIE)上的实验表明,JALDF在准确率上均取得领先结果,其中Scene15上达81.40%,较次优模型RMVC提升8.35个百分点,PIE上达95.14%,显著优于现有方法。其余超参数分析、冲突数据敏感性、不确定性估计、消融及可视化等实验进一步地从多个维度验证了JALDF的有效性和先进性。 综上,JALDF通过类对抗学习与动态融合的有机协同,有效解决了多模态分类中的过度自信、特征同化和融合刚性三大难题,为可信多模态分类提供了兼具高精度与强鲁棒性的技术方案。
  • 马飞, 李淑涵, 杨飞霞, 徐光宪
    录用日期: 2026-07-29
    认知诊断(Cognitive Diagnosis,CD)旨在根据学生在在线教学平台中的作答记录,精准识别其在不同知识点上的掌握状态,是个性化学习推荐、学习路径规划和教学干预的重要基础。然而,真实教育数据普遍存在明显的长尾分布特征:少数头部学生拥有丰富的答题交互,能够为模型提供充分监督信号;而大量尾部学生仅具有少量作答记录,其认知状态难以被稳定估计,容易出现表征混叠、均值回归甚至表征坍塌问题。现有认知诊断模型大多依赖学生ID嵌入和有限交互记录,对头部学生中较为完备的认知模式利用不足,难以有效缓解尾部学生的冷启动与表征稀疏问题;同时,部分模型未充分区分答题正确与错误行为背后的认知语义差异,导致稀疏交互中的判别信息挖掘不充分。针对上述问题,本文提出一种基于条件流形增强与正误双视图对比学习的学生认知诊断框架CFECD。 在方法设计上,CFECD首先引入语义增强特征初始化模块,融合习题文本语义、知识点信息与ID嵌入,以提升稀疏场景下节点表示的泛化能力;随后,利用LightGCN编码学生、习题和知识点之间的高阶交互关系,获得结构化认知表征。在此基础上,构建条件流形增强模块,通过全局记忆库存储头部学生的高质量认知表征,并利用流形的可逆映射能力,在连续概率空间中对尾部学生进行逆向投影、潜空间插值和正向生成,实现尾部学生稀疏表征的分布补全与特征校准。为进一步提高增强特征的可靠性,模型融合原始图特征、流形生成特征、同伴参考特征和上下文交互特征,形成多源协同的尾部学生表示。同时,针对答题正误行为所反映的不同认知含义,本文构建正误双视图对比学习机制,将交互图解耦为正向掌握视图和负向缺陷视图,通过对比约束增强隐空间中不同认知状态的可分性。最后,模型设计带缩放因子的诊断预测函数,对学生能力与习题难度之间的边际差异进行适度放大,并结合自适应损失权重生成网络动态平衡预测损失、排序损失、一致性损失和对比学习损失,以提升联合优化过程的稳定性。在ASSIST2009、Junyi和XES3G5M三个公开教育数据集上的实验结果表明,CFECD在预测精度和排序能力方面均优于多种基线模型,尤其对于尾部学生有明显提升。消融实验和参数敏感性分析进一步表明,条件流形增强能够有效补全尾部学生表征,正误双视图对比学习能够提升隐空间语义判别性,适度的流形约束、网络深度、对比学习权重和缩放因子有助于在表征增强与主任务预测之间取得平衡。 综上,CFECD能够在长尾在线教学场景中生成更加稳定、可解释的学生知识掌握画像,尤其适用于低活跃学生、新注册学生和交互记录不足学生的早期诊断。模型输出可进一步服务于薄弱知识点识别、个性化习题推荐、学习路径规划、教师教学预警和班级学情分析。实验结果验证了所提方法在长尾学生认知诊断任务中的有效性、鲁棒性和实际教学应用潜力。
  • 肖琳, 胡磊, 朱恒亮, 邢树礼
    录用日期: 2026-07-22
    低光照图像增强旨在从光照不足、对比度偏低、噪声显著和颜色失真的图像中恢复清晰、自然且细节完整的视觉内容,是夜间监控、移动摄影、自动驾驶和智能感知等场景中的重要基础任务。在现实中低光照图像的退化并非单一亮度衰减,而是由照度不足、暗区噪声、颜色偏移和结构细节弱化共同造成。现有方法虽然能够提升图像整体亮度,但在复杂暗光场景下仍容易出现噪声放大、色彩不稳定、局部纹理丢失和过增强等问题。其主要原因在于,噪声与纹理在空间域中往往具有相近的高频响应,若直接对空间进行处理,网络可能将噪声误作为有效细节进行增强;同时,RGB 空间中的亮度与色彩信息高度耦合,端到端增强过程容易使亮度恢复与颜色校正相互干扰,影响增强结果的真实性和一致性。针对上述问题,本文提出一种基于色彩空间解耦的空间-频率协同低光照图像增强网络 SFSNet。该方法首先利用 HVI 色彩空间将输入图像分解为亮度分量和色度分量,使网络能够分别建模亮度恢复和颜色表达,从而减弱二者之间的耦合影响。在此基础上,为降低低光噪声对后续空间恢复的干扰,本文在编码前引入频域去噪模块,通过频率域特征调制抑制噪声相关扰动,并保留对结构恢复有用的主要信息。随后,网络构建双分支协同主干,分别处理亮度特征和色度特征,并通过多尺度卷积模块增强对局部纹理、方向边缘和上下文信息的表达能力。为避免双分支独立恢复造成亮度与颜色不一致,本文进一步设计跨分支特征协同机制,在不同尺度上促进亮度分支与色度分支的信息交互,使亮度增强能够结合颜色结构约束,颜色恢复也能够感知照度变化。与此同时,本文在瓶颈层引入深度交互模块,通过深层特征融合生成辅助增强结果,并利用辅助监督强化网络对全局亮度分布和结构信息的建模能力。训练过程中,本文联合 sRGB 空间重建约束、HVI 空间一致性约束和瓶颈辅助监督,并采用不确定性自适应加权策略平衡不同目标的优化贡献,以提升模型训练的稳定性。本文在 LOL-v1、LOL-v2-real 和 LOL-v2-syn 数据集上进行定量评价,并在 DICM、LIME、MEF 和 VV 等真实无配对数据集上验证模型的泛化能力。结果表明,本文方法在 PSNR、SSIM、LPIPS、BRISQUE 和 NIQE 等评价指标上具有较强竞争力,并在视觉效果上能够较好地提升暗区亮度、抑制噪声放大、保持颜色自然性和恢复局部结构细节。与多种代表性低光照增强方法相比,SFSNet 在亮度恢复、色彩一致性和细节保持方面表现更加稳定。消融实验进一步证明,频域去噪、多尺度空间建模、跨分支特征协同和深度交互监督均对模型性能提升具有积极作用。综上,本文方法通过色彩解耦、频域净化、空间恢复和分支协同的联合设计,有效缓解了低光照图像增强中噪声退化、颜色失真与细节恢复相互耦合的问题,为复杂真实暗光场景下的图像增强提供了一种有效方案。
  • 芦帅晔, 李雨晴, 周林江, 马超, 石小川
    录用日期: 2026-07-22
    视觉语言模型(VLMs)通过对齐大语言模型与视觉编码器,在跨模态任务中展现出卓越能力,但跨模态幻觉问题严重限制了其在严谨场景中的应用。其根本原因在于,大语言模型基座在纯文本预训练中固化了强烈的语言先验,在自回归解码时往往反客为主压制真实的视觉特征。深入剖析解码阶段的内部注意力机制发现,视觉特征在不同网络层级呈现显著的演化差异:浅层网络视觉注意力高度弥散,包含大量易诱发注意力漂移的冗余噪声;而深层网络受语言先验主导,跨模态注意力严重衰退,阻断了文本生成与视觉事实的关联。现有解码干预方法多采用全局粗粒度策略,难以系统应对“浅层弥散、深层衰退”的矛盾。因此,本研究提出一种基于多层累积视觉先验增强(Multi-layer Cumulative Visual Prior, MCVP)的幻觉抑制方法,通过三大协同机制在解码阶段精细化重构特征分布。首先,引入稀疏化聚焦策略动态评估浅层响应,过滤背景噪声以提炼高置信度特征,从根源避免注意力漂移;其次,设计层级递归累积机制,利用滑动窗口对前序浅层稀疏化注意力进行加权聚合,构建时序稳健的全局视觉先验;最后,提出自适应软注入策略,实时计算当前生成阶段的视觉依赖度,将稳健先验动态融入深层交叉注意力模块,强制重塑模态权重以严格对齐视觉事实。在LLaVA-1.5、MiniGPT4和DeepseekVL等模型上,基于CHAIR与POPE基准的实证评估表明,MCVP相较于基础采样及现有先进干预方法优势显著。在CHAIR测试中,MCVP使综合幻觉抑制性能平均相对提升18.8%,其中LLaVA-1.5的句子级幻觉率从48.4%大幅降至38.2%,且在削减幻觉的同时维持了77.7%的高召回率,克服了传统探索性策略易拟合语言概率的缺陷,实现了更优的精度与覆盖率平衡。在POPE测试中,MCVP在MiniGPT4上取得88.45%的最优F1分数,并在DeepseekVL上有效修正了因浅层弥散导致的过度预测问题。深入的消融与可视化分析亦证实,所提机制成功防止了深层特征衰退,并将注意力重新紧密聚焦于目标区域。综上所述,MCVP精准捕捉了层级注意力的演化规律,在不损害通用推理能力且无需任何额外训练成本的前提下,高效、精准地抑制了跨模态幻觉,为未来基于白盒层级干预的免训练大模型优化奠定了新的理论与实践范式。
  • 陈鹏, 廖豪, 余肖生
    录用日期: 2026-07-22
    摘 要: 针对脑肿瘤磁共振成像(MRI)影像中肿瘤尺度差异大、形态异质性强,病灶边界常与正常脑组织交融,现有检测模型在局部细节提取、全局语义建模和跨尺度融合方面仍存在不足,易造成边界定位偏差、漏检误检增加及部署成本较高。针对上述问题,本文以基于ResNet-18骨干网络的实时检测Transformer模型(RTDETR-r18)为基线,提出高精度轻量化脑肿瘤检测模型(GDC-DETR),旨在提升复杂病灶检测精度的同时降低模型参数量和计算量,使模型更适合临床辅助诊断和轻量化部署需求。模型从主干增强、特征融合和高效交互三个层面改进。首先,设计融合上下文感知的门控增强模块(GLCA-CG),在局部与全局双分支中分别提取边缘纹理细节和长距离上下文信息,并通过卷积门控机制自适应筛选关键特征,增强对小病灶、弱边界和复杂背景的判别能力。其次,构建层次化局部-全局注意力融合模块(HLGA-FM),通过局部尺度与全局尺度的并行感知注意力(Patch)实现高、低层特征的语义对齐和自适应融合,缓解传统特征拼接造成的信息稀释、通道冗余和语义偏差问题,提高跨尺度病灶定位能力。最后,提出低分辨率轻量特征交互模块(LR-AIFI),先采用抗混叠下采样将高分辨率特征映射至低分辨率空间进行注意力交互,再通过上采样与深度卷积细化补偿空间细节,使注意力主项计算复杂度约降至原策略的1/16,从而兼顾全局建模能力与计算效率。 本文在包含神经胶质瘤、脑膜瘤和垂体瘤三类脑肿瘤的公开MRI数据集上验证,并采用统一训练参数、统一评价指标和相同实验环境与RTDETR系列、YOLO系列及多种脑肿瘤检测模型进行对比。实验结果表明,GDC-DETR的平均精度均值(mAP50)达到92.9%,较RTDETR-r18基线提升2.7个百分点,精确率和召回率分别为91.4%和91.1%;参数量为15.6 M,较基线减少21.6%,计算量为47.8十亿次浮点运算量(GFLOPs),在参与对比的主流模型中保持较低计算开销。可视化结果表明,在边界模糊、形态不规则及病灶与周围组织高度混杂的困难样本中,GDC-DETR能够更准确地聚焦肿瘤核心区域,减少背景区域无效响应,并获得更稳定的检测框定位结果。消融实验显示,GLCA-CG单独引入后mAP50提升1.2个百分点,并显著压缩参数规模;HLGA-FM与GLCA-CG联合后mAP50提升至92.4%;LR-AIFI在降低计算负担的同时保持稳定精度。三种模块联合后取得最优综合性能,说明细节增强、多尺度语义融合和低分辨率高效交互具有互补作用。泛化实验表明,模型在两类外部MRI数据集上的mAP50分别达到94.9%和92.9%;在零标注迁移场景下mAP50为73.5%,仅使用10%和20%目标域标注微调后分别提升至86.5%和88.6%,表现出较好的跨域适应性和小样本迁移能力。综上,GDC-DETR能够缓解脑肿瘤MRI检测中高精度与低计算成本难以兼顾的问题,提高复杂病灶检测灵敏度和定位能力,并降低模型部署对硬件资源的依赖,可为临床脑肿瘤辅助检测提供轻量化参考方案。
  • 郑诚, 王旭东
    录用日期: 2026-07-22
    随着大语言模型(LLM)的快速发展,LLM在文本分类任务中展现出良好的应用前景。现有基于提示词工程的文本分类方法高度依赖LLM的生成能力,在轻量级LLM场景下存在生成能力不足、推理稳定性差的问题,往往难以取得理想效果。此外,LLM不同隐藏层在表征能力上存在显著差异,其中间层表示往往蕴含丰富的语义信息,甚至在部分任务中优于其最后一层的输出。针对上述问题,提出一种基于LLM的多层次语义融合文本分类方法,通过提取并融合轻量级LLM不同隐藏层的文本嵌入表示,在无需对LLM进行参数微调的条件下,实现高效稳定的分类效果。首先,将提示词工程引入文本嵌入表示构建过程,通过设计适用于文本分类任务的提示模板,将原始句子插入特定上下文语义中,以引导模型在生成隐藏层表示时调整句向量的注意力分布,影响文本嵌入表示的判别能力。其次,使用曲率刻画隐藏层表示的几何变化平滑性,曲率较低的隐藏层表示对应更平滑的语义轨迹,更适合作为文本嵌入表示用于文本分类任务中。通过计算各隐藏层的层平均曲率,并选取曲率较低的若干个隐藏层表示作为后续融合的特征来源。再次,通过层内位置加权融合和层间多尺度卷积融合,获得更具表达能力的文本嵌入表示,层内位置加权融合根据词元在输入序列中的相对位置分配不同权重,在保留尾部重要语义信息的同时兼顾前部上下文内容,以获得更加完整稳定的文本嵌入表示。层间多尺度卷积融合通过卷积操作建模不同隐藏层之间的语义关联关系,实现多层语义信息的融合。最后,联合多种损失函数训练分类器,同时提升分类准确性、较难分类样本学习能力以及表示空间的判别性,从不同角度对参数进行优化训练实现最终结果预测。实验结果表明,所提出的方法在SST-2、MR、20NG、Ohsumed和R52五个数据集上的准确率分别达到96.11%、93.48%、89.92%、74.15%和96.33%,优于现有主流基线方法;在Ohsumed与R52两个类别分布相对不均衡的数据集上,引入宏平均F1分数作为补充评价指标,结果分别达到62.93%和73.12%,验证其在复杂数据分布条件下的分类能力。进一步地,通过消融实验、不同层内融合方法效果分析、不同提示模板效果分析、不同数量层数融合效果分析,充分验证各模块设计的合理性与有效性;通过损失函数权重敏感性分析,评估分类性能对不同损失函数权重变化的敏感程度;通过不同层效果分析,探讨不同隐藏层表示与分类性能之间的关系。综上所述,所提出方法能够有效提取并融合LLM的嵌入表示用于文本分类,大幅降低计算开销的同时提升文本的表示能力与判别能力,具有良好的泛化能力和实际应用价值。
  • 程冠杰, 苏韬龙, 黄俊钦, 孔令和
    录用日期: 2026-07-22
    面向物联网(Internet of Things,IoT)场景中海量、连续的时序数据共享需求,传统基于双线性映射或椭圆曲线的无证书签密(Certificateless Signcryption,CLSC)方案在量子计算威胁下安全性受限,且在多段数据的重复签密中引入较高的计算与通信开销。为此,提出一种面向时序数据共享的后量子轻量化无证书混合签密方案。首先,设计了双向哈希链驱动的对称密钥生成与管理机制,实现多段连续数据的密钥快速生成与前/后向安全。此外,在模块格框架下构建条件隐私保护的轻量化混合签密体制,并结合离线/在线分离将部分计算前移,实现后量子安全的同时显著降低端侧与链路负担。在随机预言机模型下证明了该方案满足IND-CCA机密性与EUF-CMA不可伪造性。在资源受限的终端设备上开展了原型实现与评测,对比实验结果显示该方案相较代表性方案具有显著优势,端侧整体时延与传输体量平均可降至同类后量子方案的40%左右。在长时段、连续时序数据场景下,该方案优势将进一步扩大,兼顾后量子安全、轻量化与可扩展性,适用于新一代智能物联网中的时序数据共享应用。
  • 胡程, 何卓成
    录用日期: 2026-07-22
    在人机协同相关场景下,智能体意图的显式/可读表示与准确识别是提升协作安全以及效率的重要手段,也是建立及提升人类对智能体信任度的重要依托。其核心在于增强智能体行为的可读性,以便人类有效理解其意图。现有研究主要通过引入偏离最优路径的差异化行为来传递意图,此类方案存在牺牲一部分执行效率以达到传递意图的目的,在强混淆场景下,存在以下两类难题:1)场景中路线重叠且密集,智能体通过牺牲效率的方法传递意图效果不佳。2)重叠的路线导致智能体原本的行为序列难以表征出足够的信息,观察者难以识别其真实意图。针对此类问题,探究人类在复杂场景协作中影响其行为可读性的重要因素,其不同因素在人类协作中主要表现动作姿态、速度和距离等。 本文在不改变智能体原有行为的基础上,通过对其关键状态信息如姿态、速度和距离进行多维度建模与融合,以此提出一种多维融合表征机制。设计符合人类推理的姿态映射函数、运用高斯核函数将速度和距离表征转换映射,并通过融合参数集成智能体相关表征,实现增强行为可读性的目的。此外,匹配于多维表征机制提出一种基于贝叶斯更新的高效意图识别方案,通过充分利用机制中已融合的状态信息,进行智能体意图的快速准确识别。最后,将以上机制与方案整体实现为一种新的智能体行为可读性增强与识别方法,不仅增强了整体行为对其意图的显式表达能力,而且可通过缩减差异化行为数量,进而有利于任务执行效率提升。 通过无约束、复杂障碍、强混淆三类实验场景对方法进行全面验证,实验结果表明,对比于其他基准方法:本方法加入更多维度的状态信息,使得对智能体意图识别的准确度平均提升44.47%;且本方法以更短的行为序列传达充足意图信息,极大提升了任务执行效率,使智能体执行成本平均降低42.86%;此外通过消融实验验证了姿态、速度、距离三类状态信息对可读性提升的正向作用,其中姿态信息最为显著;由敏感性分析验证了颜色与速度因子参数的最优取值区间,保障了方法的稳定性能;并通过连续控制任务实验检验了方法在复杂引擎与实际工程应用中的表现;另一方面,算法复杂度分析显示,该方法推理时间耗时对比原基底方法增加2.89毫秒,可满足实时交互需求。 本文提出的一种新的智能体行为可读性增强与识别方法提供了减少冗余行为,提高可读性的新的路径。在保有其原有行为序列的前提下,兼顾了信念传达与效率执行。该方法可以直接嵌入不同类型基准方法,并实现不同程度识别准确率提升,后续工作将围绕本文方法的可嵌入性展开,进一步发掘其在连续控制任务中的潜力。
  • 张红霞, 赵祥旭, 何明月, 刘若萱
    录用日期: 2026-07-22
    高效的跨域资源分配是空天地一体化网络实现资源优化配置与服务质量保障的基础。然而,受限于空天地一体化网络固有的多层高度复杂拓扑和大量差异化网络切片服务请求,传统扁平化架构和静态数学优化模型在面对动态复杂问题时,难以实现跨域资源的高效与动态分配。因此提出一种基于深度强化学习的分层跨域资源分配方法(DLCDS),旨在最大化系统效用的同时兼顾底层物理资源的高效利用。首先,设计了分层协作的跨域框架,建立全局域层与本地域层的双层协作机制。其次,在全局域层面,提出了基于双延迟深度确定性策略梯度的服务等级协议(SLA)分解算法,该算法借助连续动作空间下的确定性策略实现了SLA约束在各子域间的规划与分解;在本地域层面,设计了基于近端策略优化的资源分配算法,该算法构建SLA映射模型实现了从服务目标到资源需求的转换,采用随机策略的探索优势提升域内资源分配效率。最后,实验结果表明,相比于其他基准算法,所提算法资源利用率平均提升12%,系统效用平均提升19%。
  • 王磊, 项志超, 齐俊艳, 王文
    录用日期: 2026-07-22
    针对低空复杂背景下无人机目标尺寸小、纹理特征弱、易受背景干扰导致检测精度下降及漏检率较高的问题,提出一种基于YOLOv11改进的轻量化无人机目标检测方法EF-YOLO(Efficient Fusion YOLO)。针对传统模型在复杂场景中存在深层语义信息不足、多尺度特征融合失配以及复杂背景干扰严重等问题,对YOLOv11网络结构进行系统优化。首先,在主干网络深层设计C3K2-MSFE模块,通过分组卷积与多尺度卷积核协同建模,增强深层弱目标的判别能力,并利用线性分支保持主语义流稳定,从而提升复杂背景下小目标无人机的特征表达能力。其次,提出改进的多尺度特征融合结构PSG-FPN,在上采样阶段引入软最近邻插值机制,通过软化系数减缓跨尺度特征融合中的语义覆盖问题,同时结合GSConvE优化下采样过程,并新增P2检测层以增强模型对小尺度无人机目标的感知能力,从而改善多尺度特征对齐效果。随后,针对传统检测头参数冗余与计算开销较大的问题,提出共享特征轻量化检测头SFE-Head,采用共享卷积主干与分组卷积结构实现分类与回归特征共享,在保持检测精度的同时显著降低模型参数量与计算复杂度。最后,对YOLOv11中的C2PSA模块进行改进,引入基于频域筛选机制的前馈增强结构,通过频域特征建模抑制复杂背景中的纹理噪声,提高模型对微弱无人机目标的响应能力与抗干扰性能。实验分别在DUT Anti-UAV数据集与Det-Fly数据集上进行。结果表明,在DUT Anti-UAV数据集上,EF-YOLO的Precision、Recall、mAP50与mAP50-95分别达到96.76%、88.16%、92.59%和62.41%,相比原始YOLOv11分别提升4.01%、3.44%、3.04%和6.18%;模型参数量由2.58M降低至2.27M,模型大小由5.3MB减小至4.8MB,在较低计算复杂度条件下仍保持良好的实时检测性能。在Det-Fly数据集上,EF-YOLO的mAP50和mAP50-95分别达到96.4%和68.06%,相比YOLOv11分别提升2.39%和2.16%,验证了模型在不同复杂低空场景中的泛化能力与稳定性。与此同时,消融实验结果表明,各改进模块在复杂背景下具有良好的协同增益作用,其中C3K2-MSFE能够有效增强深层弱目标特征表达,PSG-FPN能够改善跨尺度语义对齐能力,SFE-Head在降低模型复杂度的同时维持检测精度,而频域增强结构则进一步提升了模型对复杂纹理噪声的抑制能力。相比传统目标检测模型,EF-YOLO在复杂背景、远距离目标以及低对比度场景下具有更稳定的检测表现,能够有效减少漏检与误检现象,并在保持模型轻量化的同时增强特征表达能力。综合实验结果可以看出,EF-YOLO在检测精度、模型轻量化与实时性之间取得了较好的平衡,不仅能够有效提升复杂低空环境下无人机目标的检测能力,同时也具备较强的工程部署潜力,可为低空空域监管、边缘智能监测及无人机安全防控等应用场景提供可靠的技术支撑。
  • 谢静远, 查凯文, 刘鹏举, 田春伟
    录用日期: 2026-07-22
    针对 YOLOv11 的 SPPF、C3K2 与 C2PSA 模块在昇腾 NPU 上存在的冗余访存、细粒度核函数启动和多分支同步通信瓶颈,本文研究一种不改变网络语义和参数规模的算子级重构方法。基于 Ascend C 设计三类硬件友好融合算子:SPPF 采用片上数据闭环与边界缓存减少多级池化的全局内存往返;C3K2 采用多核任务分配和多队列异步流水线降低细粒度算子串行开销;C2PSA 采用并行归约—广播机制重构注意力分支间通信。在 Ascend 910B NPU 上,完整重构后 COCO 单轮训练时间提升了 27.6%。实验结果表明,所提方法通过适配昇腾片上存储、异步队列和多核同步机制,提高了 YOLOv11 关键模块的训练执行效率,并保持推理性能稳定,可为复杂目标检测网络在昇腾平台上的部署提供可复核的算子映射方案。
  • 李天赐, 方亦圆, 金孙伟, 奚雪峰, 朱润, 盛胜利, 崔志明, 王坚
    录用日期: 2026-07-21
    人类反馈强化学习(Reinforcement Learning from Human Feedback, RLHF)是法律大语言模型实现专业价值对齐的关键技术,但现有综述缺乏对法律场景特有适配机制与挑战的系统分析。本文旨在填补这一空白,系统构建RLHF在法律大语言模型中的研究与应用全景,并为工程实践提供方法选型参考。本文以“技术基础—算法演进—任务迁移—评估体系—应用挑战—未来路径”六维框架为分析主线,系统回顾2017年至2025年间NeurIPS、ICML、ICLR、ACL等顶会顶刊中80篇核心文献,剖析RLHF在法律领域从算法适配到评估体系的完整演进逻辑。分析表明,法律RLHF的核心困境在于多维奖励冲突与专家偏好稀疏导致的奖励建模失准,PPO算法在长文本法律生成中稳定性不足,而DPO、GRPO等新算法虽简化流程但面临偏好数据质量瓶颈。进一步研究发现,不同法律任务在风险等级、推理复杂度以及反馈获取成本方面存在显著差异,因此RLHF算法并不存在统一最优方案。对于法律文书生成、法规摘要等结构化任务,DPO凭借训练流程简洁、稳定性较高等优势具有较好的适用性;对于法律推理、案例分析等需要多路径论证的任务,GRPO利用组内相对排序构建学习信号,在处理复杂法律论证方面展现出较大潜力;而在司法辅助决策、量刑建议等高风险场景中,则需要结合专家反馈、规则约束以及知识检索机制共同实现可靠对齐。评估体系正从自动化指标向过程可解释性与偏见审计演进。 RLHF为法律大语言模型提供了从可用到可信的关键进化路径,但其落地需依赖内生奖励与混合反馈机制以降低标注成本,并发展奖励溯源与过程评估以满足司法透明性要求。同时,随着直接偏好优化和群体相对策略优化等新方法的发展,法律RLHF正逐步由传统奖励模型驱动模式向轻量化偏好优化与相对排序优化方向演进,为降低训练复杂度和提升法律场景适配能力提供了新的技术路径。现有研究表明,仅依赖单一奖励模型难以充分刻画法律价值体系中的复杂权衡关系,未来需要进一步融合规则知识、专家经验以及过程反馈信息,构建更加稳定和可解释的法律对齐机制。本文不仅构建了面向法律RLHF研究的六维分析框架,还进一步提出法律任务导向的RLHF适配性分析体系,系统比较PPO、DPO、GRPO等算法在法律文书生成、法律推理、合规审查等不同任务中的适用边界与失效机制。此外,本文结合法律任务风险等级与算法特征,对不同RLHF方法进行了横向比较,为法律智能系统中的算法选型与工程部署提供参考依据。研究表明,法律RLHF的核心矛盾并非单纯算法性能不足,而是法律场景中多维奖励冲突、专家偏好不一致与司法价值难以量化之间的结构性矛盾。本文首次从技术演进、奖励建模、评估体系与司法治理四个层面完整揭示法律RLHF从算法适配到工程落地的全流程逻辑,为法律大语言模型可信化构建提供系统性研究框架与实践指引。
  • 彭晏飞, 王子莹, 白一卉
    录用日期: 2026-07-20
    当今全球海洋生态环境污染日益加剧,塑料、金属等固体废弃物在水下各深度海域激增,对海洋生物链与生态系统安全构成了前所未有的威胁。依托自主无人水下航行器或水下机器人实现高效、精准的自动化智能垃圾监测与清洁技术,已成为海洋环境保护领域的迫切学术共识。针对水下可见光成像普遍存在的色偏、模糊、低对比度等物理退化问题,以及不同海域间水体光学特性引发的跨域异质性与高质量细粒度标注样本稀缺的瓶颈,为了克服未知部署水域导致的特征偏移与负迁移现象,提出一种融合物理级图像增强与两阶段鲁棒跨域自适应学习的水下垃圾目标检测框架。该框架采取“分步构建、动态对齐”的设计策略,将流水线解耦为两个协同阶段。第一阶段旨在构建抗干扰的基础检测架构以夯实特征地基,为保持高计算效率并规避生成网络在少样本下引入伪影的缺陷,在数据载入层建立低开销的像素级物理对齐流水线:先将输入图像转换至LAB色彩空间,提取L通道执行自适应像素级线性拉伸以恢复边缘对比度与细节,再通过通道稳定化模块对A、B通道进行色偏补偿以抑制青蓝色伪影;在此基础上,基于源域数据集TrashCan Instance实施30k次迭代的监督感知训练,使RetinaNet获取高质量的底层几何纹理与高层鲁棒语义特征,确立感知基线。随后流程进入第二阶段,聚焦于域对齐与跨域部署精度提升。为消除未知新水域引发的深层特征流溢与响应偏移,研究在预训练主干网络多尺度输出层级联注入轻量级特征校准模块(FCM),并在微调初始阶段对FCM内部参数直接实施差异化初值赋能以显式诱导自适应动态校准。在随后的10k次跨域自适应迭代微调中,为杜绝少样本部署时的灾难性遗忘,本阶段完全冻结主干网特征提取器参数作为底层特征稳定器;同时采用差异化非对称双学习率机制,为新注入的FCM赋予高梯度敏感度,而为顶层FPN与检测头赋予较小步长。此外,微调全程引入固定衰减率(λ= 0.9999)的指数移动平均(EMA)技术,在每1000次迭代评估时自动切换至EMA平滑权重,利用平滑的损失平面抵御训练噪声,确保特征空间对齐的无损迁移。为确保实验设计的科学严谨性与实战部署的参考价值,研究引入完全独立的第三方跨域水下数据集进行盲测泛化性验证。定量结果表明,该方法在保持整体框架仅55.86 M参数量的轻量化、紧凑型设计下,在单张 NVIDIA RTX 4080 SUPER 显卡上实现了高达44.61 FPS(每秒传输帧数)的实时推理速度,展现了较高的边缘端实战部署潜力。在同域闭环测试中,该框架相比传统RetinaNet基线模型的平均精度显著提升了5.33个百分点,尤其在水下边缘模糊、低可视度的极其困难的小目标检测任务上,AP 跃升了8.97个百分点。而在最为严苛的跨水域、跨数据集泛化性盲测验证中,该方法展现出了显著的性能提升效果:在未参与训练的全新J_Litter独立数据集上,基线模型的AP_50在多源干扰下仅为0.31%,而该方法通过动态特征校准使AP_50升至28.66%;在深度水下场景的DeepPlastic数据集上,该方法成功将基线模型的AP_50从3.30% 稳步提升至12.81%。这充分验证了所提框架中“物理地基构建”与“动态特征校准”在两阶段架构下的科学性与协同效能,能有效克服跨水域检测中的负迁移现象,在海洋垃圾自动化智能清理的实际工程落地中具备较强的实战泛化潜力。
  • 陈烁, 王洁
    录用日期: 2026-07-16
    视觉问答作为人工智能与多模态理解领域的一项核心研究任务,要求模型联合理解图像的视觉内容与自然语言问题并生成精准回答。针对现有非大规模预训练视觉问答方法在多模态特征建模时易受弱关联背景及冗余区域干扰,传统自注意力未能充分捕捉空间位置依赖及通道间深层语义关联,且多采用静态融合策略难以自适应复杂问题场景等缺陷,本文提出一种基于多模态过滤与空间通道注意力的多模块协同视觉问答方法。在具体实现上,该方法首先设计多模态过滤模块,通过提取特定位置的问题特征向量作为全局语义表示,与对齐后的视觉特征进行哈达玛积交互,并利用感知机与激活函数生成归一化过滤门控权重,从而在深层交互前逐元素缩放图像特征,显式抑制背景冗余信息,为后续深度交互提供纯净的视觉输入。随后,引入空间通道自注意力单元以替代传统自注意力架构。在六层堆叠的编解码器基础架构中,该单元于空间维度将特征重塑为二维图,通过多尺度卷积核结合全局池化生成空间注意力分布,充分捕捉图像区域间的空间依赖关系;同时在通道维度利用池化与全连接网络动态调整语义通道重要性,进而采用门控机制将空间通道调制后的局部特征与多头自注意力捕获的全局上下文进行加权融合,有效增强视觉特征的判别性。在此基础上,构建动态模态融合模块以摒弃静态融合机制。经过多层交互后,模型生成视觉与文本特征的注意力映射并进行拼接,将其输入至包含随机失活的全连接分类网络中,自适应学习二维动态融合权重因子,最终完成多模态特征的动态加权整合,并利用二元交叉熵损失函数进行整体参数的优化训练。基于VQA-v2和GQA数据集的广泛定量实验结果表明,在不依赖超大规模跨模态预训练数据的条件下,所提方法取得了一定的性能优化。具体而言,在VQA-v2的test-dev测试集上,所提方法的总体准确率达到71.85%,较同类基线模型MCAN和BAN分别显著提升了1.22%和2.33%,其中二元是非判断类和其它类问题的准确率分别高达88.03%和62.39%。在强调组合推理与关系理解的GQA测试集上,该模型的总体准确率达到57.92%,其中二元是非判断类问题取得了76.68%的准确率。此外,严格的消融实验定量证实了各核心模块的有效性,多模态过滤、空间通道注意力与动态模态融合模块的引入分别带来了0.63%、0.69%和0.52%的绝对性能提升,且模型层数影响分析进一步证实编解码器各堆叠六层时特征交互最为充分,模型整体性能达到最高峰值。综上所述,本文方法通过细粒度特征建模与动态交互,成功缓解了噪声干扰重、空间通道孤立与静态融合适应性差等问题,为计算资源受限等特定垂直领域下的视觉语言多模态理解与深度特征表达提供了一种改进方案。
  • 黄晨曦, 芦天亮, 彭舒凡, 单程昊, 陈卓鹏
    录用日期: 2026-07-15
    针对生成式面部换脸技术对个人隐私构成严重威胁,且现有主动防御方法在黑盒场景下泛化能力较差、对图像处理失真鲁棒性不足的问题,本文提出一种面向黑盒场景的鲁棒增强主动防御框架(Robust Black-box Proactive Defense, RBPD)。该框架旨在从源图像端注入不可见对抗扰动,干扰未知换脸模型的身份特征提取过程,实现可靠的身份保护。该框架采用两阶段生成机制。第一阶段利用语义感知编码器(Semantic-Aware Encoder, SAE)与纹理引导解码器(Texture-Guided Decoder, TGD)生成初始语义扰动。语义感知编码器SAE通过面部语义掩码引导并结合卷积块注意力模块精准聚焦身份关键区域,纹理引导解码器TGD借助跳跃连接融合浅层纹理特征,强制扰动适配源图像的局部纹理分布与梯度强度,在保证攻击有效性的同时显著减少视觉伪影并提升视觉质量。第二阶段引入双流融合编码器(Dual-Stream Fusion Encoder, DFE)与多尺度聚合解码器(Multi-Scale Aggregation Decoder, MAD)。双流融合编码器DFE将源图像与初始扰动进行深层特征提取与非线性融合,使对抗信息深度嵌入图像语义特征空间;多尺度聚合解码器MAD采用三路并行空洞卷积捕获多尺度上下文信息,并集成挤压激励模块自适应重校准通道响应,增强扰动对图像失真的鲁棒性。同时设计元学习自适应攻击策略(Meta-learning Adaptive Attack, MAA),集成ArcFace、FaceNet、MagFace和AdaFace四种异构身份特征提取器的梯度反馈,动态调整优化权重,实现对强鲁棒性提取器的精准突破,提升扰动在未知黑盒模型上的跨模型泛化能力。在CelebA-HQ数据集上,针对SimSwap、E4S、DiffSwap三种主流换脸模型以及百度、腾讯商业人脸识别API的评估结果显示:受保护图像平均Top-1和Top-5身份匹配率分别降至0.311和0.396,较未保护图像下降63.28%和54.79%,相较最佳基线进一步下降16.17%和19.02%;在未见数据集RaFD上仍保持稳定,平均Top-1和Top-5身份匹配率分别降至0.349与0.394。在黑盒换脸测试中,换脸后图像与源图像的身份余弦相似度大多降至0.3以下,最低达0.185,实现可靠的身份错配。面对JPEG压缩、高斯模糊、噪声和缩放等常见社交网络失真时,失真防御波动率(Distortion Defense Volatility, DDV)平均仅为3.4%,显著优于Saliency(55.5%)、DF-RAP(27.1%)、NullSwap(19.70%)和ID-Eraser(13.90%)四类基准方法。视觉质量方面,受保护图像PSNR达37.38dB,SSIM为0.976,LPIPS为0.0065,展现出良好的图像自然度。在商业API测试中,百度API身份匹配通过率从89.92%降至0.40%,腾讯API从90.37%降至4.25%。单张图像总处理时间仅8.23ms,展现部署潜力。本文提出的主动防御框架有效解决了现有方法在黑盒泛化性和失真鲁棒性方面的不足,通过语义纹理引导与多尺度深度融合的协同设计,实现了攻击效能、视觉质量和鲁棒性的良好平衡,为复杂社交网络环境下个人隐私保护提供了高效实用的主动防御方案,具有重要的理论意义和应用价值。
  • 邓星志, 陈攀峰, 李晖, 王喜宾, 刘威
    录用日期: 2026-07-15
    问答模型旨在使机器能够理解自然语言问题并从文本或知识库中自动推理生成准确答案。现有基于检索增强生成的问答方法虽通过引入外部知识提高了生成质量,但仍面临两个问题,一是语义理解能力不足,难以捕捉问题与检索知识之间的关系;二是检索阶段不可避免地引入与问题相关性较低的噪声信息,这些噪声在后续生成过程中被放大,容易导致答案偏离或幻觉现象。为缓解上述问题,本文提出一种基于两阶段过滤机制的语义检索增强生成问答模型(BiS-RQA)。该模型通过构建显式过滤与隐式过滤相递进的框架,在保持高效推理的同时提高问答场景下的答案准确率。该模型使用两阶段递进式过滤架构,第一阶段筛除明显不相关的知识实体,第二阶段对保留下来的候选知识进行噪声抑制,使得大模型能够聚焦于最有价值的信息片段。第一阶段为显式过滤,提出语义引导的个性化PageRank算法(SPPR)。具体实现上,对输入的自然语言问题,使用预训练语言模型提取问题的嵌入向量;知识图谱中的实体和关系也通过同一模型获得各自的嵌入向量。首先,计算问题向量与每个实体向量的相似度,以此作为个性化向量,用于引导带重启的随机游走中的初始偏好。然后,计算问题向量与每个关系向量的相似度,利用该相似度调整游走过程中当前节点到邻居节点的转移矩阵,即根据问题与关系的相似度修改跳转概率。在此基础上,执行算法迭代直至收敛,得到各节点的平稳分布得分。最后按得分降序排序,选取Top-K个实体及其关联关系,构建对应的子图。该过程能够从原始知识图谱中显式过滤掉无关节点与边,从而有效提升检索信息的相关性。第二阶段为隐式过滤,提出多种注意力知识融合方法(MAIF)。MAIF方法分别使用了自注意力与交叉注意力机制来加权实体和关系权重。首先,将实体和关系池化后作为子图嵌入;随后,实体、关系与子图通过自注意力模块捕捉内部依赖,再进一步执行交叉注意力互相交互得到不同粒度信息之间的关联程度,从而实现对候选信息的隐式过滤与加权。最后交叉注意力机制输出的权重作为软提示,并将第一阶段得到的实体和关系作为硬提示,与问题一同输入大语言模型进行回答。在WebQSP数据集上,BiS-RQA的准确率达到77.21%,相较最优基线模型G-Retriever(73.79%)相对提升4.6%;在CWQ数据集上,BiS-RQA的F1得分为35.38%,较次优基线(32.70%)相对提升8.1%。内存占用方面,BiS-RQA使用了31.5 GB内存,相较于基线模型G-Retriever增加了1.5%;推理时长方面,BiS-RQA需要0.9427秒,相较于GRAG增加了56%。在多个公开问答数据集上的实验结果验证了该方法在语义检索与答案生成上的有效性,并展现出优秀的竞争优势。
  • 李源, 董凌, 李英, 余正涛, 高盛祥, 毛存礼, 黄于欣
    录用日期: 2026-07-15
    目前规范文本的标点恢复已经取得了很好的结果,但是语音识别系统中的实时标点恢复任务仍然面临挑战。其核心挑战为真实语音识别输出往往包含口语化表达和类别分布不均衡等特点,导致传统分类模型难以准确识别复杂语义边界,而生成式大模型虽然具有较强语义理解能力,却存在推理延迟高、部署成本大等问题,难以满足实时应用需求。为缓解上述问题,本文提出一种基于渐进式迭代优化的实时标点恢复方法。首先,通过整合多个公开中文语料库,构建覆盖多种类型的大规模训练语料。同时,设计了一种标点感知的数据加权策略,通过改变不同样本的权重缓解逗号、句号和问号等类别分布不均衡带来的学习偏差,实现训练数据与真实语音识别输出文本的有效对齐。然后,通过动态掩码限制注意力计算范围,仅保留当前位置附近有限窗口内的上下文信息,保证关键语义信息获取能力并有效减少远距离噪声干扰,从而实现精度与延迟之间的平衡。最后,提出一种渐进式迭代优化机制,通过记录训练过程中样本的滑动窗口平均损失,对训练样本进行难度评估,并构建动态权重更新策略。对于持续产生较高预测损失的困难样本,采用多句拼接方式生成具有更复杂上下文依赖关系的新样本,并提高其训练权重,使模型逐步聚焦于复杂语义边界,实现训练数据与模型能力的协同演化,从而不断提升模型对复杂语义结构的建模能力。本文在真实标点恢复测试集上进行了系统实验,并与CT-transformer以及Qwen2.5-7B、Llama3.1-8B、Gemma2-9B、DeepSeek-V3等代表性模型进行比较。实验结果表明,本文方法相较于传统实时标点恢复基线CT-transformer模型的 F1值提升4.92个百分点。同时,在与参数规模远大于本模型的大语言模型比较中,本文方法仍取得更优的恢复性能。在推理效率方面,模型单句平均推理时间仅为26 ms,较DeepSeek-V3提升近200倍,满足实时语音处理场景对低延迟响应的要求。消融实验进一步验证了可控时延机制、数据加权策略以及渐进式迭代优化模块对模型性能提升的有效性,其中迭代优化过程使模型F1值由38.78%逐步提升至43.70%。相比依赖大规模参数的通用大模型,针对任务特征设计的数据与模型协同优化方案能够在保持低资源消耗和低延迟推理的前提下获得更优的标点恢复效果,为实时语音识别后处理系统的工程部署提供了一种兼顾精度、效率与可扩展性的解决方案。
  • 张文茜, 朱永利, 郭灏琨, 姬梦陈, 刘雨姗
    录用日期: 2026-07-13
    针对无人机巡检场景下绝缘子缺陷检测过程中存在背景干扰严重、缺陷目标尺度变化大、小尺度缺陷特征不明显以及深层网络边缘信息逐渐丢失等问题,鉴于YOLOv11n在实时性与参数量间的良好平衡,本文以其为基础框架进行改进,提出一种基于改进YOLOv11n的绝缘子缺陷检测方法,以提升模型在复杂背景条件下对绝缘子缺陷的检测精度与鲁棒性。该方法从特征增强、特征融合以及特征提取三个层面对网络结构进行协同优化,在保证模型轻量化特性的同时提高其对复杂场景中绝缘子缺陷目标的感知与识别能力。本文模型包含三项核心优化模块。首先,为缓解复杂背景干扰、强化细粒度缺陷表征能力,在骨干网络的特征提取阶段设计动态双域特征增强模块(Dynamic Dual-Domain Feature Enhancement Module, DDFEM),构建全局语义分支与局部细节分支协同工作机制。其中,全局分支利用双方向全局池化与跨维度矩阵交互建立长距离空间依赖关系,实现低计算复杂度下的全局语义建模;局部分支采用多分支深度可分离卷积结构提取闪络损伤、破损等细粒度纹理特征,并结合动态注意力融合机制对局部特征进行自适应重标定,从而实现全局语义信息与局部细节信息的互补增强。其次,针对深层语义特征增强过程中边缘细节信息逐渐弱化的问题,设计Sobel边缘引导加权融合模块(Sobel-Edge-Guided Weighted Fusion Module, SEGWF),利用Sobel算子从浅层特征中显式提取边缘信息,并通过通道加权融合机制将边缘结构信息与深层语义特征进行动态融合,以增强模型对绝缘子破损边缘、轮廓等关键结构特征的感知能力,提高复杂背景下的小目标检测性能。最后,为增强多尺度目标的特征提取能力,针对传统卷积感受野固定、难以适应不同尺度缺陷的问题,在骨干网络中引入感受野注意力卷积机制(Receptive-Field Attention Convolution, RFAConv)替换传统卷积结构,该机制能根据不同空间区域的特征分布自适应调整感受野响应范围,从而提升模型对不同尺度绝缘子缺陷的检测性能。为验证所提方法的有效性,在自建绝缘子缺陷数据集上开展实验研究,并与主流目标检测模型进行对比。实验结果表明,本文方法取得92.2%的mAP@0.5,相较于原始YOLOv11n提高4.9个百分点;Precision由89.7%提升至93.0%,提高3.3个百分点;Recall由79.6%提升至88.3%,提高8.7个百分点,表明所提方法能够有效降低漏检率并提升复杂场景下的缺陷检测精度。同时,为进一步验证模型的泛化能力,在公开绝缘子缺陷数据集IDID上进行测试。结果显示,本文方法Precision为89.6%,Recall为79.8%,mAP@0.5为88.9%,在所有对比模型中取得最高的mAP@0.5指标,相较于原始YOLOv11n提升1.9个百分点,体现出较好的跨数据集泛化能力和稳定检测性能。同时,本文模型参数量仅为3.12M,计算量为7.6 GFLOPs,在精度提升的前提下保持了较低的计算复杂度。综上,本文所提出的改进YOLOv11n算法能够有效完成复杂背景下的绝缘子缺陷检测任务。
  • 胡翔一, 李子奇, 郭婷婷, 张永宏, 孙俊
    录用日期: 2026-07-13
    多视图子空间聚类旨在利用多源特征间的一致性、互补性与差异性信息学习潜在共享结构。如何在特征融合过程中兼顾全局结构关系、局部几何特征与表示稳定性,是该领域的重要问题。现有方法多基于低秩表示、稀疏约束或图学习机制构建统一模型,虽然能够在一定程度上挖掘跨视图共享信息,但对全局结构保持、局部平滑约束与鲁棒表示学习之间的协同建模仍不充分,导致模型在噪声污染、异常扰动及复杂分布条件下易出现局部结构失真、表示不稳定及聚类性能退化问题。针对上述问题,本文提出一种面向结构保持的局部平滑多视图子空间聚类方法(SLS-MVSC)。所提方法在统一自表示学习框架下联合引入低秩约束、全变差(TV)范数约束、图正则化约束以及鲁棒误差建模机制,实现全局信息学习、局部关系保持与稳定表示优化的协同建模。首先,利用低秩约束学习多视图共享表示,以挖掘不同视图间潜在一致的全局子空间结构,增强模型对跨视图公共信息的表达能力。其次,考虑噪声干扰容易导致自表示矩阵产生剧烈波动,本文在自表示学习过程中引入TV范数约束,通过限制局部区域表示变化幅度保持表示连续性与边界结构,从而提高表示结果的平滑性与稳定性。进一步地,引入图正则化约束保持样本间邻域关系一致性,通过显式建模局部流形结构增强模型对数据几何关系的刻画能力,使学习得到的表示更加符合原始数据的内在分布特征。同时,在重构误差项中采用鲁棒范数增强模型对异常样本与复杂噪声的适应能力,从多个层面提升表示质量与聚类鲁棒性。针对所构建的优化模型,本文设计基于交替方向乘子法(ADMM)的迭代求解算法,通过引入辅助变量对复杂目标函数进行分解优化,将原问题转化为多个可独立求解的子问题,并推导得到各变量的更新过程与整体求解流程,从而保证模型训练过程的稳定性与求解效率。为了验证所提方法的有效性,本文在6个公开数据集上开展实验研究,并与多种代表性多视图聚类方法进行对比。实验结果表明,所提方法在聚类准确率(ACC)、归一化互信息(NMI)、纯度(PUR)、调整兰德指数(AR)及F-score等指标上均取得优异性能,在多个数据集上达到最优或接近最优结果,展现出良好的聚类性能与跨数据集适应能力。进一步的消融实验验证了各组成模块对模型性能提升的积极作用,其中低秩约束和图正则化分别在全局结构学习与局部几何关系保持方面发挥重要作用,而TV范数约束在增强表示平滑性、缓解噪声引起的表示震荡以及提高模型稳定性方面表现尤为突出。鲁棒性实验结果进一步表明,在不同强度噪声条件下,所提方法整体仍能够保持稳定性能,说明模型能够有效减弱噪声扰动对特征表示学习与聚类结果的影响。综上所述,所提SLS-MVSC方法能够有效提升多视图数据的聚类性能、表示稳定性与抗噪能力,为复杂多视图数据分析提供了一种有效的子空间聚类方法。
  • 张书锏, 李贝, 陈程立诏
    录用日期: 2026-07-13
    现有显著性目标检测(SOD)方法普遍遵循被动视觉刺激原理,依赖颜色、纹理、对比度等底层特征判定显著区域,以场景中视觉特征最强的物体作为用户关注焦点,忽视了用户主动需求对显著目标判断的决定性作用。然而在人机交互、机器人巡检等真实场景中,待检测对象常淹没于复杂背景之中,用户注意力具有强烈的意图导向。近年来,用户需求驱动的显著性目标检测(UserSOD)任务被提出,将感知范式从被动视觉响应转向主动意图匹配,并构建了相应的基准数据集与基线模型。由于现有方法在视觉特征与用户需求语义之间缺乏深层融合与动态校准,模型仅能捕捉关键词的浅层语义关联,且在分层主干网络下采样过程中易丢失空间细节,导致模型在复杂背景下难以精准定位与抽象需求匹配的目标,检测性能仍受较大限制。针对上述问题,在UserSOD任务框架下提出一种深度校准与属性感知网络(DCA-Net)。该网络以Swin-Transformer模型为视觉主干,结合预训练对比语言-图像预训练(CLIP)文本编码器作为文本分支。网络核心设计了级联语义重校准编码器(CSRE),包含四个独立的语义重校准模块(SRM),每个SRM模块内部通过跨模态交叉注意力机制在特征提取源头实现视觉特征与用户意图的逐级语义对齐 ,同时在其内部引入基于多层感知机结构的门控特征流机制(ScGate),利用全连接变换与ReLU-Tanh激活生成自适应权重以动态调节各通道语义流强度,确保在特征流早期精准锁定目标区域。同时,构建卷积跨尺度交互模块(CCIM)以实现跨层级特征补偿;CCIM利用金字塔池化聚合算子与1×1卷积聚合全局特征,通过三路并行且具备不同膨胀率的3×3深度可分离卷积分支捕获多尺度上下文信息,结合串联的通道与空间注意力模块实施加权,并利用双线性插值上采样恢复尺寸,显著增强模型对多尺度目标空间细节的感知能力。引入细粒度属性感知解码器(AGD)提供细粒度约束;AGD采用自顶向下的路径将高层特征逐级上采样合并,利用CLIP文本编码器对类别、颜色、外观和功能需求四类预设属性提示词进行初始化以提供语义先验,有效避免属性查询从随机状态收敛的弊端;随后通过多头交叉注意力从用户指令中分别抽取四类属性维度的显式语义约束向量,将抽象意图解耦为四个独立的细粒度属性约束以避免多属性需求的语义混淆;将视觉特征输入四个并行的属性专用特征分支以感知对应属性的视觉模式,并与约束向量融合;最后由全局文本特征动态预测属性存在概率权重,对四类属性进行自适应调节各分支贡献强度,确保细粒度约束与用户意图精准对应,引导模型生成边界清晰、语义一致的检测掩码。在UserSOD基准数据集上的实验结果表明,DCA-Net在S-measure、F-measure、E-measure指标上相比现有最优方法分别提升4.5%、6.8%和3.8%,MAE降低至0.028,有效验证了所提架构在复杂背景干扰、变尺度目标捕获以及抽象意图对齐方面的优越性与强鲁棒性。
  • 张颖, 王晶, 靳希源
    录用日期: 2026-07-10
    生理时间序列分类在睡眠监测、心电诊断和癫痫检测等多种医疗健康任务中具有重要意义,但在实际应用中,其严重的类别不平衡问题导致少数类特征难以有效学习,尽管这些少数类样本数量稀少,但它们通常承载着更为重要的信息,其性能的准确识别对于疾病及时干预、健康精确评估及其他应用场景的优化决策至关重要。 由于生理时间序列少数类样本数量有限且多为背景波形,模型很难直接从整体序列中学习到判别性强的特征。这些少数类样本中往往存在少量关键局部片段,其独特结构或变化模式承载了类别判别信息,识别这些关键信息对少数类建模至关重要。对比学习方法具备良好的泛化性和结构感知能力,被广泛应用于改进类别不平衡建模,但现有方法多来源于图像领域或依赖样本全局表示,难以捕获少数类样本中稀疏却具有判别信息的局部关键波形片段,另外,现有不平衡方法对频域上的特征利用不充分,数据增强时也缺少类别区分,忽略了少数类与多数类的类间分布差异。 为解决上述问题,该研究提出了一种面向类别不平衡生理时间序列分类的关键波形感知的对比学习方法KWave-CL。少数类中难以学习的关键波形片段通常表现为重构误差较大,该方法设计了联合时域与频域的变分自编码器对少数类波形片段进行重构,通过计算时域与频域的重构误差识别少数类的关键波形片段与非关键波形片段,从而为后续对比学习提供信息。为了充分挖掘少数类样本中的局部判别信息,基于识别出的关键波形片段,该方法进一步设计了关键波形感知对比损失,通过拉近少数类关键波形片段之间的距离,并拉远关键波形片段与非关键波形片段的距离,使少数类在表示空间中形成更紧密且可分的聚类结构,提升少数类表示的判别性。为了增强少数类的多样性,同时保持多数类的特征稳定性,该方法还引入了类别区分的数据增强,对少数类施加较强的扰动,而对多数类则施加较弱的扰动,从增强空间上缓解类别分布偏移问题。整体方法采用联合优化策略,将自监督对比损失、关键波形感知对比损失和时频变分自编码器重构损失整合训练,实现全局与局部特征的协同学习。KWave-CL方法也具有良好的灵活性,可以嵌入多种时间序列对比学习框架中。 在三个公开的真实生理数据集上的实验表明,KWave-CL在两种代表性对比学习框架下的整体性能优于现有的多种不平衡学习基线模型。在PhysioNet 2017数据集的实例级框架下,整体F1分数最高提升了6.69%,少数类别的F1分数最高提升了11.67%,消融实验进一步表明,关键波形感知对比损失、时频变分自编码器以及类别区分数据增强均对少数类性能提升起到关键作用,证明KWave-CL有效缓解了类别不平衡问题,可以为医疗健康领域提供可靠的辅助决策支持。
  • 陈文杰, 梁银, 杜明晶, 黄尧晟, 刘妍洁
    录用日期: 2026-07-10
    针对红外无人机航拍图像中小目标像素占比低、纹理细节弱、信噪比低以及易受复杂背景干扰等问题,同时兼顾无人机平台对检测模型轻量化与实时性的部署需求,本文以YOLOv12n为基线模型,提出一种轻量化红外小目标检测算法ACFF-YOLOv12n。现有红外小目标检测方法在特征提取阶段普遍存在弱目标细节建模不足、多尺度特征融合效率低以及检测头对低对比度目标适应性差等问题,导致小目标在深层网络传递过程中易出现特征稀释、漏检及误检现象。为提升模型对复杂红外场景下弱小目标的感知能力,本文从骨干网络、特征融合结构以及检测头三个层面进行协同优化。首先,在骨干网络中设计A2C2f-ACmix++特征增强模块,将全局自注意力机制与局部增强卷积进行双路径协同建模,并引入轻量通道注意力(Lightweight Channel Attention,LCA),对红外弱目标通道响应进行自适应强化,在保持较低计算开销的同时提升模型对边缘、纹理等细粒度信息的提取能力。其次,在颈部网络中提出语义门控动态融合模块(Semantic-Gated Dynamic Fusion Module,SGDFM),以高层语义特征为主导、浅层细节特征为辅助,通过门控权重动态调节跨层特征融合比例,实现不同尺度特征之间的自适应互补,缓解红外小目标在深层网络中的信息衰减问题,增强模型在复杂背景和尺度变化场景下的鲁棒性。最后,在检测头部分构建基于条件参数化卷积的轻量化检测头(CondConv-based Lightweight Detection Head,CLD-DET),引入条件参数化卷积(Conditionally Parameterized Convolution,CondConv),并结合小目标细节增强模块(Small Object Enhancement,SOE),对红外弱边缘、低对比度目标进行空间细节强化,从而提高模型对微弱目标的定位与分类能力。实验采用HIT-UAV红外无人机数据集进行训练与测试,并在SIRST和NUDT-SIRST数据集上进一步验证模型的泛化性能。结果表明,ACFF-YOLOv12n在HIT-UAV数据集上的mAP@0.5达到87.1%,较基线YOLOv12n提升5.7个百分点;mAP@0.5:0.95达到56.8%,提升2.8个百分点。同时,模型参数量降至2.13M,计算量降至5.0GFLOPs,在保证检测精度提升的同时实现了较好的轻量化效果。在SIRST数据集上,模型mAP@0.5达到78.6%,较YOLOv12n提升5.6个百分点;在NUDT-SIRST数据集上,mAP@0.5达到76.7%,较基线提升3.4个百分点,验证了所提方法在不同红外场景下具有较强的泛化能力与稳定性。此外,可视化与热力图实验结果表明,本文模型在复杂背景、远距离弱目标及密集小目标场景下能够形成更加准确且均衡的特征关注区域,有效降低漏检与误检现象。综合实验结果表明,ACFF-YOLOv12n在检测精度、模型复杂度以及实时性能之间实现了较优平衡,能够满足无人机红外小目标检测任务对高精度与轻量化部署的双重需求,在红外无人机巡检、边境安防及复杂环境目标监测等领域具有较高的应用价值。
  • 许彦波, 李 莹, 高永彬, 汤 信
    录用日期: 2026-07-09
    动态场景下的同时定位与建图(Simultaneous Localization and Mapping,SLAM)易受运动目标、遮挡及光照变化等因素影响,导致位姿估计漂移与地图重建伪影。现有方法在动态观测判别和地图更新约束方面仍存在局限,容易依赖类别先验、固定阈值或特定场景分布,并可能将运动目标误建为伪静态结构。针对上述问题,提出一种面向动态场景的多源一致性残差增强高斯SLAM方法(Multi-Source Consistency Residual-Enhanced Gaussian SLAM,MCRGS-SLAM)。该方法从观测可靠性角度对动态干扰进行连续、可解释建模,并将可靠性约束嵌入前端位姿估计与后端高斯建图过程,以提升动态场景下单目SLAM系统的定位精度和静态地图重建质量。 该方法基于静态区域需满足多视图一致性的物理约束,构建外观、几何、运动和结构四类互补的一致性残差,将动态观测判别转化为可量化的物理度量。其中,外观残差用于刻画跨视角亮度与纹理一致性,几何残差用于衡量深度投影关系的稳定性,运动残差用于检测难以由相机自运动解释的独立位移,结构残差用于描述局部边缘与几何形态变化。不同于直接采用二值掩膜或固定阈值剔除动态区域的策略,上述残差将被建模为连续物理约束,用于表征像素观测相对静态假设的偏离程度。在此基础上,设计语义—几何双流融合的可靠性推理网络(Multi-source Consistency Residual Network,MCR-Net)。语义流提取高层语义特征,用以提供类别级动态先验,几何流编码残差证据,用以表征多视图一致性,两路信息经注意力机制融合后生成像素级可靠性图谱。该图谱以软权重形式作用于 SLAM 系统前后端:在前端位姿优化中,对外观、运动、几何和结构约束进行可靠性加权,降低动态外点对相机位姿求解的干扰;在后端3D高斯(3D Gaussian Splatting,3DGS)建图中,指导高斯基元的初始化、更新与剔除,从而自适应抑制动态观测造成的地图污染。由此,系统将动态观测处理从离散剔除转化为基于可靠性的连续加权,在保留边界区域和弱可靠静态观测的同时,减弱动态外点对位姿估计与高斯地图更新的累积影响。此外,MCRGS-SLAM 构建基于重投影误差与渲染一致性的自监督闭环优化机制,使网络能够在线适应未知场景中的动态变化。 在Bonn和TUM等动态场景数据集上的实验结果表明,MCRGS-SLAM在定位精度和重建渲染质量方面均取得了良好的综合表现。在定位精度评价中,该方法在Bonn动态数据集上的平均绝对轨迹误差均方根(ATE RMSE)为2.35 cm,优于多类代表性方法,说明可靠性加权优化能够有效减弱动态观测对位姿估计的影响。在重建渲染质量评价中,该方法在TUM动态数据集上的平均PSNR、SSIM和LPIPS分别为17.99 dB、0.73和0.272,相较于现有代表性动态3DGS-SLAM方法Dy3DGS-SLAM,PSNR提升0.14 dB,SSIM提升约1.1%,LPIPS降低约4.6%,有效减少了动态目标引起的建图伪影。真实复杂场景序列上的结果进一步表明,该方法在场景分布变化和非结构化动态干扰下仍能保持稳定表现,具有较好的跨场景适用能力。
  • 陈金泽, 李明轩, 张士豪
    录用日期: 2026-07-09
    区块链的匿名属性为交易提供了隐蔽环境,比特币地址类型检测旨在分类行为模式各异的地址,对区块链去匿名化分析具有重要意义。现有方法主要面临三方面挑战:一是比特币交易网络规模庞大、结构复杂,直接使用图神经网络训练效率低;二是深层图神经网络易出现过度平滑问题,导致节点表征趋同,判别能力下降;三是多数方法仅依赖静态图结构或简单统计特征,忽略了交易行为中的时序模式,难以有效捕捉地址的动态行为特征。针对上述问题,本文提出一种基于时序图特征网络的比特币地址类型检测方法F-BAC(Filter-enhanced Bitcoin Address Classifier)。该方法包含四个核心步骤。一是交易建模。将标签地址的每笔交易构建为独立的同构图,节点为交易涉及的地址,边为资金流向。为应对不同交易规模差异巨大的问题,提出细粒度的地址聚合压缩策略:根据地址在全体交易记录中出现的总频次将节点划分为四个层级并分别聚合,从而将原始异构图转换为结构规整的小规模同构图。该策略显著简化了拓扑复杂性,为后续图表示学习奠定了有效基础。二是地址特征提取与增广。为每个地址计算局部特征,并对聚合后的每类地址计算统计特征。随后,利用图特征网络(GFN)对特征进行三层传播与增广,同时保留每层网络的原始节点信息,有效缓解过度平滑问题。三是时序特征优化。将同一地址按时间排序的交易图表示序列输入过滤器增强的多层感知机(F-MLP),经离散傅里叶变换转换至频域,利用可训练的线性滤波器抑制混淆行为和行为噪声,最后经逆傅里叶变换重构增强后的时序信号。此设计显著提升了模型对周期性交易模式的捕捉能力。四是地址分类。将过滤优化后的时序图表示序列输入分类器,输出地址类型标签,以交叉熵损失函数监督训练。本文构建了一个包含时序特征的数据集,为后续研究提供了重要数据基础。在自建数据集及三个公开数据集上进行了系统实验。消融实验表明,去除地址聚合模块、GFN模块、时序过滤模块模型性能均有不同程度下降,验证了三项策略的必要性。在自建数据集上,F-BAC取得了96.7%的精确率、95.9%的召回率和96.3%的F1值,宏平均F1达到91.1%。在BAC数据集上,F-BAC的F1值达到98.4%;在BATC数据集上达到98.0%;在Google/CvdxBp数据集上达到94.6%。对比实验显示,F-BAC的表现均优于BAClassifier、Multi-hop GAT、Balanced-BiEGCN和MDST-GNN等现有方法。此外,F-BAC较BABD方法减少89.3%数据采集量,GFN模块相较GCN节省约30%-45%的训练时间,显著降低了训练成本。综上所述,本文提出的F-BAC方法通过细粒度地址聚合、图特征网络增强和时序频域过滤三项策略,有效缓解了比特币地址类型检测中图规模过大、过度平滑、时序模式缺失和混淆干扰等问题。在多个数据集上的实验验证了F-BAC在这一任务上具有良好的泛化性能。
  • 杜谨泽, 李旭东
    录用日期: 2026-07-09
    针对现有多元时间序列异常检测方法在复杂时序依赖建模、多尺度动态特征刻画以及先验信息利用方面存在的不足,提出一种多分布多尺度自适应先验Transformer异常检测模型MMAPT-AD(Multi-distribution and Multi-scale Adaptive Prior Transformer for Anomaly Detection)。模型首先通过数据嵌入模块对输入多元时间序列进行统一表示,从时间维度与变量维度提取基础时序特征,以增强对变量间耦合关系与动态变化模式的表达能力。随后构建多分布多尺度先验生成机制,在不同时间尺度下联合引入高斯分布、拉普拉斯分布与柯西分布,对序列潜在关联结构进行建模。其中,高斯分布用于描述平稳变化特征,拉普拉斯分布用于增强对局部突变模式的刻画能力,柯西分布用于提高模型对长尾异常及复杂波动模式的适应能力。针对不同尺度下时序依赖关系存在差异的问题,模型在多个时间尺度下生成先验关联矩阵,对局部依赖关系与全局时序结构进行联合建模。同时,引入可学习权重实现多分布先验融合,以增强模型对复杂统计特征与异构动态模式的表征能力。在此基础上,设计先验引导的异常注意力机制,将多尺度先验信息融入注意力权重计算过程。该机制在学习时序关联特征的同时引入结构先验约束,引导模型关注潜在异常相关的关键时间片段与变量通道,从而提升对局部异常、稀疏异常及复杂结构异常的识别能力。为提高模型对复杂异常模式的区分能力,在模型优化阶段结合重构误差、注意力先验差异约束以及多尺度不一致性约束构建联合损失函数,并融合重构误差、注意力分布差异及多尺度结构偏离信息构建综合异常评分,实现时间步级异常判定。为验证模型性能,本文在SMD、MSL、SWaT、SMAP及PSM五个公开数据集上进行了实验。实验结果表明,MMAPT-AD在五个数据集上分别取得93.40%、94.99%、96.06%、96.67%和98.06%的F1值,在多个数据集上达到最优或接近最优的检测性能。其中,在SMD数据集上,F1值较InterFusion与Anomaly Transformer分别提升7.18个百分点和1.07个百分点;在MSL数据集上,较TransDe提升0.63个百分点;在SMAP数据集上,Recall达到99.35%,表现出较强的异常覆盖能力。进一步的消融实验与鲁棒性实验验证了多分布先验建模、多尺度结构约束以及联合优化策略对性能提升的有效性,同时表明模型在输入扰动条件下仍具有较好的稳定性与泛化能力。综上,MMAPT-AD能够有效融合多分布统计特征与多尺度时序依赖信息,在复杂动态场景下表现出良好的异常检测性能与结构适应性。
  • 杨泽凡, 黄迁, 陈薇, 蔡瑞初
    录用日期: 2026-07-09
    针对存在隐变量干扰时因果结构学习准确性下降、观测变量间因果方向难以可靠判断的问题,提出一种基于非高斯信息的隐变量因果发现方法。实际数据中往往存在无法直接观测或难以完整记录的隐变量,这些隐变量会同时影响多个观测变量,使观测变量之间出现由共同原因导致的统计相关关系。不考虑隐变量存在的因果发现方法容易将隐变量诱导的相关性误判为因果关系,进而产生虚假因果边、因果方向错误和结构恢复不完整等问题。为提高含隐变量场景下因果结构恢复的准确性,所提方法在含隐变量的线性非高斯无环因果模型下,利用数据的非高斯信息,对观测变量间的直接因果关系以及隐变量影响下的未定向因果关系进行识别。具体而言,在第一阶段中,方法以观测变量构成的完全无向图作为初始结构,通过基于回归残差的条件独立性检验逐步删除统计独立的变量对,从而获得观测变量间的初始骨架结构。该阶段能够在不显式建模隐变量的情况下,优先确定部分可靠的观测变量间直接因果关系,为后续隐变量检测和剩余边定向提供结构基础。在第二阶段中,针对仍未完全定向且可能受到隐变量影响的变量关系,引入高阶累积量刻画非高斯分布中的高阶统计信息。通过采用四阶联合累积量估计隐变量对观测变量的作用强度,并通过检验是否满足共享单隐成分条件,判断多个观测变量是否受到共同隐变量影响。在此基础上,进一步对受隐变量影响的观测变量间剩余未定向边进行方向判定,最终输出包含观测变量及隐变量的因果结构。理论分析表明,在变量由线性非高斯无环因果模型生成、噪声变量相互独立且相关可识别条件成立的情况下,所提方法能够利用独立性约束和高阶累积量信息识别含隐变量因果结构。为验证方法有效性,在5种模拟因果图和3种样本量设置下,将所提方法与多种代表性方法进行比较。实验结果表明,所提方法在多数场景下精确率较高,比现有方法的精确率至少高30%。同时,所提方法在召回率和F1得分上均取得最优结果,在不同样本量下的F1评分大于或等于75%。特别是在隐变量影响较强、结构较复杂的模拟场景中,所提方法能够有效减少真实因果边遗漏,提高整体结构恢复能力。消融实验表明,所提方法中无隐变量干扰局部结构识别,以及隐变量检测与未定向因果边识别两个阶段均对最终因果结构恢复具有重要作用。在真实金融数据实验中,以香港股票市场中多只成分股收益数据为研究对象,进一步验证所提方法在实际场景中的适用性。实验结果显示,所提方法能够在保持因果图合理稀疏性的同时,识别出具有明确经济含义的隐变量结构,刻画从全市场宏观因子到行业板块再到个体股票的多层级因果传导关系。与多种代表性方法相比,所提方法既避免了因果图边过密的问题,也弥补了部分方法缺乏全局驱动因子或未显式刻画隐变量结构的不足。综合模拟实验、消融实验和真实数据实验结果可知,所提方法能够有效利用高阶统计信息和条件独立性约束,提高含隐变量场景下因果结构恢复的准确性、完整性与可解释性,为复杂数据环境下的因果分析和智能决策提供了一种有效方法。
  • 林聪, 林惠晶, 沈雨, 陈川, 周梦潇, 章湘粤, 涂志刚
    录用日期: 2026-07-08
    城市道路积水是暴雨内涝过程中最直接影响交通通行和应急调度的风险形态之一,及时识别积水等级对于道路管控、抢险部署和公众出行提示具有重要意义。然而,面向真实道路监控视频开展积水分级识别仍存在三方面困难:一是强降雨、夜间低照度、车流遮挡和水面反射会造成同一等级内部差异较大;二是重度、严重积水等高危样本出现频次低,数据呈现明显长尾分布;三是同一摄像头、同一路段或同一降雨事件中视频片段相似度较高,若处理不当会影响模型泛化能力评价。针对上述问题,提出一种少样本多模态标签约束道路积水分级识别方法。首先,将I-JEPA式联合嵌入预测架构扩展到视频片段,以连续帧中的跨帧时空块作为上下文和预测目标,在表征空间预测积水相关目标块特征,避免像素级重建带来的冗余优化,使编码器更关注路面水层、车轮涉水、反光纹理和水面扰动等与积水等级相关的语义线索。其次,利用CLIP文本编码器提取积水等级描述的语义特征,并在支持集原型构建阶段引入文本约束,使视觉特征与“轻微、轻度、中度、重度、严重”等类别语义在共享空间内对齐,从而缓解少样本条件下相邻水深等级边界不稳定的问题。再次,在查询视频与支持原型匹配阶段引入动态时间规整距离,通过帧级累积距离矩阵搜索最优时序对齐路径,使模型能够适应不同视频长度、车辆涉水时刻和关键帧位置差异,提高跨拍摄节奏匹配的稳定性。基于南京市和厦门市真实道路监控视频构建两套积水分级数据集,划分训练集、验证集和测试集前对同源近重复片段进行去重,并结合摄像头编号、道路位置和降雨事件时间进行交叉核查,以降低高度相似片段跨集合分布带来的泄漏风险。在对比实验中,本文选取ResNet50、VGG-16、ViT-B、SwinT-B、HCL、OTAM、CPEA、CLIP-FSAR、Qwen2-VL和Qwen2.5-VL等方法作为基线,并在表格中补充各方法的提出年份和发表来源;同时将2025年以后正式发表且代码开源的AVF-MAE++和TEAM纳入方法层面对比,以说明本文方法与最新开源视频表征学习和少样本视频识别方法之间的差异。实验结果表明,本文方法在南京和厦门数据集上的总体精度分别达到96.4%和95.0%,优于卷积神经网络、Transformer、少样本视频识别方法和多模态大模型基线。鉴于少数类测试样本数量有限,本文不将单次划分中P/R=100%作为独立稳定性证据,而是补充5次独立分层重划分实验,使重度和严重积水样本在不同测试子集中得到多次覆盖;5次实验中总体精度标准差低于0.8%,说明该方法在长尾少样本类别和跨城市场景下具有较好的鲁棒性。
  • 武聪, 曹玉, 田聪聪
    录用日期: 2026-07-08
    随着无人机技术的不断进步,无人机航拍小目标检测受到越来越广泛的关注。针对无人机航拍图像中目标尺度小、分布密集及背景复杂导致的检测精度低、漏检率高等问题,提出一种基于改进YOLOv11n的无人机航拍小目标检测模型PK-YOLO。以YOLOv11n为基线模型,分别从特征提取、特征融合与损失函数三个方面对模型进行针对性改进,旨在提升无人机航拍场景下小目标的检测精度与整体鲁棒性。在特征提取阶段,针对YOLOv11n采用P3至P5层的特征金字塔结构,对尺寸小于32×32像素的极小目标响应能力有限,导致的漏检、误检等问题,研究新增小目标检测层P2检测层,利用更高分辨率的特征图保留更丰富的空间位置信息与边缘细节信息,实现从高分辨率浅层特征到强语义深层特征的渐进式融合,显著增强网络对微小目标的特征提取能力。其次,设计融合核选择融合注意力机制(Kernel Selective Fusion Attention, KSFA)的C3k2_KSFA模块,替换原始骨干网络中的C3k2模块。KSFA机制借鉴动态卷积与选择性核网络的思想,通过并行使用多种扩张率与尺寸的卷积核提取多尺度特征,并利用空间-光谱选择机制自适应地为不同空间位置分配最优的核权重,使模型能够根据输入目标的实际尺寸灵活调整感受野,从而提升对不同尺度目标的特征表达与区分能力。在特征融合阶段,传统固定上采样操作难以适配无人机图像中目标尺度剧烈变化的特性,容易造成小目标特征丢失且易受复杂背景干扰。为此,研究将颈部网络中的固定上采样模块替换为DySample动态上采样。DySample基于点采样策略,能够根据特征图内容自适应调整采样点位置,在放大特征图的同时有效抑制背景干扰,降低小目标特征的丢失率。在损失函数优化方面,针对YOLOv11n所采用的CIoU损失函数易受低质量预测框干扰而导致定位精度不足的问题,引入Inner-IoU机制改进Wise-IoU v3,提出Inner-WIoU损失函数。该函数通过动态非单调调频机制与辅助边框,在保留对困难样本关注能力的同时,增强对目标位置与形状的精细描述能力,有效提升了小目标的定位精度。为验证模型有效性,本文在VisDrone2019、TinyPerson及RSOD三个公开数据集上开展对比实验。在VisDrone2019数据集上的实验结果表明,与基线模型相比,PKD-YOLO模型在mAP@0.5和mAP@0.5:0.95上分别提升5.0%和3.3%,精确率提升5.0%;在更具挑战性的TinyPerson数据集上,上述三项指标分别提升5.7%、1.9%与7.4%,充分证明了模型在复杂场景下对小目标的检测优势。在RSOD数据集上,mAP@0.5与mAP@0.5:0.95分别达到了96.1%与68.8%,较基线模型分别提升2.7%与3.6%,表明模型在保持较高定位精度的同时,对目标检测的置信度判别能力有所增强。综合三个数据集的实验结果,PKD YOLO在多种无人机航拍场景下均表现出优越的小目标检测性能,验证了本文所提改进方法的有效性与泛化能力。
  • 朱弘毅, 陈鹏, 李智鑫, 许小龙, 吕智慧, 叶广楠, 柴洪峰
    录用日期: 2026-07-08
    针对当前大语言模型在医疗等高知识密度与强逻辑约束领域应用时,同源多智能体系统因底层思维逻辑一致性导致的自我纠错能力缺失、算力投入与性能产出不成正比等核心瓶颈问题,提出并实现了一种基于异质模型交互验证的多代理验证融合结构。该结构通过精密设计的提示工程构建了一个差异化的层级协作架构,其技术实现的核心在于打破单一模型系列的逻辑盲区。系统由具备极高参数量与泛化推理能力的高性能大模型担任核心决策智能体,负责解析医疗病历信息并生成初步诊疗逻辑;同时,创新性地引入了输出风格稳定、逻辑倾向保守且具备完全不同训练分布的异源模型作为验证层。其中,验证层并不参与答案的生成和决定,而是专注于对决策层输出的推理路径、医学事实一致性以及逻辑合理性进行多维度的“验证-问题列举-响应”式审计。这种特定结构的逻辑基础在于:利用异源模型间的思维差异性来实现异源智能体之间的逻辑冲突与交叉验证,从而在确保医疗事实严谨性的基础上,显著增强系统输出的多样性与稳健性,同时提升模型对于场景的适应能力和稳定性。在针对糖尿病医疗领域的专项实验分析中,该模型展现出显著的性能增强。实验结果显示,相较于相同基座配置的单智能体基线,模型在医疗知识选择题上的正确率提升了约 10%,在简单医学填空上提升了约 8%,在复杂医学题上的表现提升了约 22%。通过与当前前沿的策略模型 Colacare 进行深度对比,研究发现模型在处理医学决策时表现出更优的逻辑一致性与推理稳定性。此外,更突出的成果是,该系统在不依赖高成本的标注数据集和无需进行任何模型微调训练的情况下,其综合评测性能已超越了经过深度领域微调的专业模型 Diabetica-7B。在工程可行性与资源消耗的权衡分析中,实验数据记录显示该系统的平均推理消耗为 61,881 tokens/题,平均推理时延为 71.74 s/题;相较于 Diabetica-7B 等专用模型,该系统不仅规避了高昂的算力训练成本与数据标注周期,还通过灵活的插件式架构降低了系统的整体设计复杂度。研究结论表明,在处理高知识融合、强约束需求的医疗决策问题时,引入模型间的异质性而非单纯堆叠同源模型规模,是提升系统可靠性的关键路径。模型的成功实践证明,通过优化异构智能体间的协作校验机制,可以在不损失大模型推理上限的前提下,利用异源模型的稳健性有效填补逻辑漏洞。这一研究成果不仅为医疗 AI 系统在复杂任务下的低成本部署提供了全新的技术框架,也为大语言模型从“通用智能”向“可靠专业智能”的范式转型提供了重要的理论支撑与实践指引。
  • 张智伟, 陈晓红, 朱玉莲
    录用日期: 2026-07-01
    锚点二分图能够以较低计算代价近似样本间关系,是大规模多视图聚类中的常用图构建方式。但现有方法多采用随机采样、K-Means中心或静态字典生成锚点,锚点位置通常在图学习前固定。在非球形簇、环状簇、长条状簇以及簇间密度差异较大的数据中,静态锚点难以贴近局部密度峰与弯曲簇边界,容易产生锚点失配。由此构造的样本–锚点二分图会包含冗余连接或不可靠连接,影响跨视图结构融合,并降低聚类结果的稳定性。针对上述问题,提出一种均值漂移引导的多视图锚点二分图聚类方法。该方法的目标是在保持锚点图高效率的同时,提高锚点对复杂数据分布的自适应刻画能力,并将图学习与聚类划分纳入统一优化过程。首先,在每个视图中初始化锚点集合,并利用Mean Shift沿核密度梯度迭代更新锚点,使锚点由欧氏中心代表点转向局部密度模式。随后,根据样本到近邻锚点的距离估计局部带宽,只保留每个样本的近邻锚点关系,构造稀疏且密度感知的样本–锚点二分图。其次,将各视图二分图分解为共享一致性图和视图特有互补图。一致性图用于刻画不同视图共同支持的聚类结构,并施加核范数约束以增强低秩性和结构紧致性;互补图用于保留单个视图中偏离共识但具有判别作用的局部信息,并施加稀疏约束以抑制噪声和冗余连接。再次,依据重构误差自适应学习视图权重,避免各视图等权融合带来的信息干扰。在此基础上,融合一致性图与互补图,构造联合样本–锚点二分图和增广拉普拉斯矩阵,并通过谱迹约束使联合图趋向于形成给定数量的连通分量。模型采用块坐标下降策略交替更新聚类指示矩阵、一致性图、互补图和视图权重。各子问题可通过特征分解、软阈值算子、奇异值阈值和二次规划求解,从而实现图结构学习与聚类划分的一步优化。实验在Handwritten、BBC-sport、MSRC_v1和Caltech101-7四个多视图数据集上进行,并采用ACC、NMI和F-score评价性能。结果表明,所提方法在12项指标中获得8项最优。在Handwritten上取得最高NMI,为0.949;在BBC-sport上ACC和F-score分别达到0.971和0.933;在MSRC_v1上ACC和F-score分别达到0.966和0.931;在Caltech101-7上ACC、NMI和F-score分别达到0.711、0.521和0.484,三项指标均为最优。消融实验进一步表明,Mean Shift锚点更新、一致性–互补性分解和拉普拉斯谱迹约束均对性能提升有贡献。在Caltech101-7上,完整模型的ACC、NMI和F-score高于仅使用Mean Shift模块的0.534、0.362和0.348。不同锚点策略对比显示,Mean Shift锚点的三项指标为0.711、0.521和0.484,明显高于K-Means锚点的0.576、0.395和0.456,也高于随机采样锚点的0.308、0.260和0.320。收敛性实验显示,目标函数通常在前5–10次迭代内快速下降,并在20次迭代内趋于稳定。复杂度分析与运行时间实验表明,在固定锚点数和迭代次数时,算法运行时间随样本规模近似线性增长。综上,所提方法能够利用密度信息校准锚点位置,增强二分图对复杂簇结构的表达能力,同时兼顾多视图一致性、互补性与一步聚类优化,在非球形和密度不均数据上表现出较好的聚类效果、稳定性和可扩展性。
  • 邓波, 毛代坤, 吴楠, 徐凌桦, 杨靖, 林建华
    录用日期: 2026-07-01
    针对光伏电站异构多功能清洗机器人集群在多约束条件下的协同任务分配问题,提出了一种基于重叠联盟形成博弈的分布式任务分配方法。首先,构建面向光伏运维的多约束异构机器人集群协同任务优化模型。系统分析异构机器人与多元运维任务的资源适配机理,设计了光伏组件污染等级与机器人清洗能力的匹配机制,建立融合综合资源匹配度、挽回发电损失、运维总成本、最大完工时间和冗余惩罚机制的综合效用函数,该任务分配问题的目标函数构建为最大化联盟总效用,结合工程实际引入任务优先级、任务唯一性与安全距离等约束条件,完成机器人集群运维任务的精细化数学建模,显著提升了机器人与任务间的资源匹配度与运维调度适配性。其次,构建基于双边互利准则的重叠联盟形成博弈框架。该框架将全局组合优化问题转化为分布式联盟划分问题,依托所定义的偏好关系与交换操作,可支持机器人跨联盟动态协作与自主形成重叠联盟结构,进一步提出一种可以描述个体自私逐利与系统全局最优映射关系的双边互利交换准则,显著提升了资源调度灵活性,有效协调了个体理性与系统整体效用;该博弈被证明为势博弈,当机器人最大化自身效用而改变资源分配结构时,目标函数的差异与效用函数的差异是一致的,且博弈框架中至少存在一个纳什均衡即稳定的联盟结构。最后,设计一种融合偏好引力引导与扰动机制的重叠联盟形成算法。算法引入偏好引力机制为机器人选择联盟提供方向性指引,利用边际收益评估机制与提出的双禁忌列表剔除低效联盟、规避无效搜索,结合协同设计的动态资源调整策略与随机扰动机制有效摆脱局部最优;该算法被证明可以在有限次迭代内收敛到T-稳定状态,通过分析其复杂度处于可控范围;最终该算法在求解由任务优化模型与博弈框架所构成的任务分配数学模型时,能够满足异构机器人集群在复杂多元任务协同场景下的任务分配需求,并快速收敛至高质量的纳什均衡解。仿真实验结果表明,本文所提方法在保证全局解质量的前提下,兼备显著的实时性与稳定性。在消融实验中,验证了各改进策略能全面提升算法综合性能;在验证算法解质量与运维指标实验中,相较于基线算法,本文算法挽回发电损失提升了6.63%,运维总成本降低了2.55%,平均作业时间缩短了13.29%;在规模变化下性能对比分析实验中,本文算法在不同机器人与任务数量变化情况下各项指标均为最优;在实时性与稳定性实验中,本文算法平均运行时间不超过6.09s,标准差与Wilcoxon秩和检验具有统计显著性。可制定经济高效的任务分配方案,为光伏电站精细化运维提供了有效技术支撑。
  • 孙万杰, 张宏, 李豪杰
    录用日期: 2026-06-29
    针对点云检索过程中的特征提取过程,主流方法通过层次化局部邻域特征聚合形成全局形状描述符,其对物体结构信息的感知主要依赖于对表面点空间分布的间接推断,缺乏对点云骨架等显式结构先验的直接利用。针对现有点云检索方法在提取全局形状特征时结构信息利用不足的问题,该文提出一种用骨架先验增强结构感知的点云检索网络。该文首先引入点云骨架作为结构先验,通过显式融合与隐式引导双重机制增强点云特征的结构表达能力,并设计自适应特征聚合模块聚合多个尺度特征,从而形成最终的全局描述符。具体而言,该文方法包含两模块。第一,双分支特征融合模块:该模块从输入点云中提取骨架点云,然后通过两个独立的PointNet++分支分别提取原始点云与骨架的多尺度局部特征。在每个尺度上,以骨架特征作为键与值、点云特征作为查询,采用多尺度交叉注意力机制将骨架结构信息加权融合到点云特征中。同时,构造对比学习任务,将裁剪点云与完整骨架组合作为锚点,完整点云与骨架组合作为正样本,批内其他类别样本作为负样本,通过损失隐式引导模型学习结构一致性,形成“显式融合+隐式引导”的双重结构增强机制。第二,设计多尺度局部自适应聚合模块(MVLAAD):该模块由VLAAD与多尺度聚合增强两部分组成。VLAAD基于轻量级Transformer解码器,以输入点云的局部特征序列为键与值,以初始通用聚类中心为查询,通过多层交叉注意力迭代更新,动态生成适应每个输入样本的个性化聚类中心;再结合动量更新策略融合通用中心与个性化中心,平衡自适应性与稳定性。接着,基于更新后的聚类中心,分别对精炼后的多尺度特征计算软分配权重并聚合残差,生成三个尺度的全局描述符,最后经门控机制增强后输出最终紧凑描述符。此外,具体训练过程中采用动态权重调整策略,综合分类损失、三元组损失和对比损失进行训练。训练初期侧重对比学习,后期转向三元组损失,从而同时强化结构感知与判别性学习。实验结果表明,在ModelNet40数据集上该方法取得82.6%的mAP,较先进方法CF3D提升1.3%。在ShapeNet上达84.6%,优于现有方法。消融实验验证了各模块的有效性:基线Pointnet++的mAP为62.0%,引入该文的设计后模型性能提升至82.6%。轻量化版本参数量降至20.34M,mAP提升至84.7%。鲁棒性实验表明,方法在中等稀疏、低噪声及轻度遮挡条件下表现稳健,但在极端退化条件下性能明显下降。综上所述,该文所提出的骨架先验增强结构感知网络,通过显式融合骨架先验与隐式对比学习引导,解决了现有方法对结构信息利用不足的缺陷;设计的MVLAAD模块通过动态生成个性化聚类中心,实现了对全局描述符判别性的提升。
  • 胡世豪, 贾智伟, 李家骏, 孙辰昊
    录用日期: 2026-06-26
    针对输电线路无人机巡检中异物目标尺度差异大、小目标易漏检、背景干扰强、遮挡普遍以及机载边缘设备算力受限等问题,本文以YOLOv8n为基线,提出面向输电线路异物检测的多分支轻量化算法MBL-YOLO,用于鸟巢、风筝、垃圾和气球等典型异物识别。巡检图像中异物常与导线、绝缘子、杆塔和自然背景相互交叠,目标边界不清,容易导致轻量模型出现定位偏移和置信度不足。该方法的目标是在不显著增加模型复杂度的前提下,提高网络对多尺度异物和复杂背景的表征能力,并满足无人机边缘平台对实时性、低功耗和轻量化的部署需求。 在网络结构上,MBL-YOLO从主干特征提取、跨尺度特征融合和检测头轻量化三个层面改进YOLOv8n。首先,在C2f结构中嵌入混合动态融合模块,构建C2F-MDFB。该模块通过动态核权重机制和多尺度深度可分离卷积分支,自适应调整不同感受野特征的贡献,使网络能够同时关注鸟巢等较大目标、风筝线等细长目标、气球等小尺度目标以及形态不规则垃圾的局部特征;结合残差连接、通道混合和归一化操作,进一步增强低层细节与高层语义之间的信息交互,降低异物边缘模糊或局部遮挡造成的漏检风险。其次,在Neck部分引入加权双向特征金字塔BI-FPN,通过可学习权重融合P3、P4、P5等层级特征,保留浅层特征中的边缘纹理和位置信息,利用深层语义约束抑制导线、杆塔、植被和天空等背景噪声,从而提升小目标定位和复杂背景下的类别判别能力。最后,针对原检测头多尺度独立分支带来的参数重复和推理冗余,设计Detect-LSCD共享卷积检测头,以两层共享卷积替代重复卷积,并采用GroupNorm稳定小批量推理条件下的特征分布,在保持多尺度检测能力的同时降低参数规模和计算开销。 实验基于自建输电线路异物数据集开展。该数据集包含4200张图像和8207个完整标注目标,覆盖山区和城市两类背景,其中鸟巢2103个、风筝2560个、垃圾1648个、气球1896个,训练集、验证集和测试集分别为2940张、840张和420张。在统一训练和测试条件下,MBL-YOLO取得97.5%的Precision、97.1%的Recall、97.3%的mAP50和70.4%的mAP50-95,参数量为2.08M,计算量为5.8 GFLOPs,推理速度达到175.6 FPS。与YOLOv8n相比,mAP50-95提高1.9个百分点,参数量和计算量分别降低约30.9%和29.3%,FPS由168.6提升至175.6。与YOLOv9t、YOLOv10n、YOLOv11n、YOLOv12n、Gold-YOLO、YOLO-world、D-Fine-N和DEIM-D-Fine-N相比,MBL-YOLO在最低计算量和较低参数规模下取得最高mAP50-95,说明其性能提升并非依赖模型堆叠。消融实验表明,C2F-MDFB、BI-FPN和Detect-LSCD分别改善动态表征、加权融合和轻量预测,三者联合具有互补作用。为验证跨场景泛化能力,本文在VisDrone2019公开数据集上测试,MBL-YOLO的Precision、Recall、mAP50和mAP50-95分别为41.7%、31.1%、31.2%和18.6%,较YOLOv8n分别提升4.3、5.5、4.3和2.1个百分点。可视化结果显示,模型在小尺度异物、多类别异物、密集背景和遮挡场景中能够减少漏检、误检和冗余框,体现出较好的特征保持与场景迁移能力。 为验证工程可用性,本文将MBL-YOLO部署到搭载NVIDIA Jetson TX2和ZED2双目相机的无人机平台。模型经ONNX导出后,基于TensorRT 8.2进行FP16半精度量化与算子融合,生成TX2原生推理引擎。在输入分辨率640×640、批大小为1和TX2 Max-P模式下,MBL-YOLO端到端单帧延迟为38.5 ms,整体帧率稳定在26 FPS;同等条件下YOLOv8n为55.1 ms和18 FPS,实际部署速度提升约44.4%。TX2与ZED2协同工作时平均功耗约9.2 W,占无人机飞行功耗不足3%。综合结果表明,MBL-YOLO能够在降低参数量和计算量的同时提升检测精度、召回能力和实时性能,适合部署于无人机边缘巡检平台,可为输电线路异物自动识别、异常告警和智能运维提供兼顾准确性、效率与工程落地性的检测方案,也为后续多模态感知和在线巡检系统集成奠定基础。
  • 录用日期: 2026-06-26
    装备文档知识获取与利用是装备分析与辅助决策的重要支撑。然而,多源异构装备文档普遍存在版式结构复杂、跨模态混排显著、公式表格密集及语义表达离散等问题,导致传统方法在复杂结构还原、异质内容统一解析及知识驱动问答方面存在不足。针对上述问题,提出一种基于大语言模型的装备文档知识解析与决策增强方法 EKADE。该方法构建“全局布局分析—局部内容识别”的双阶段解耦框架:首先从页面全局视角识别文本段落、图像、公式和表格等要素的空间分布、类别属性及层级关系;随后针对局部区域开展文本、公式与表格的精细化解析与结构重建,并将逐页结果重组为统一的标准化 Markdown 文档,在此基础上构建可检索的结构化知识片段库,结合检索增强生成机制实现面向装备性能认知、战术运用分析及规范条款理解等任务的知识驱动问答。实验结果表明,该方法在页面布局解析任务中的平均 F1 为 86.0%,公式识别任务中的字符检测匹配指标 CDM 为 86.7%,表格识别任务中的树编辑距离相似度指标 TEDS 为 90.7%;在决策问答任务中,Recall、BLEU、ROUGE-L 与准确率等指标均优于对比方法。结果表明,EKADE能够有效提升复杂装备文档的结构化解析能力、知识组织能力与问答推理准确性,为装备知识的智能建模与决策支持提供了有效方法。
  • 孙翔, 曾昭龙, 马启明
    录用日期: 2026-06-24
    为解决现有语音-人脸跨模态匹配方法存在特征通道重要性建模不足、对困难样本区分不明显的问题。提出一种融合多尺度通道注意力机制与对比学习增强策略的语音-人脸匹配方法。在自适应身份权重中心框架的基础上,构建了主-细-粗三尺度并行的通道注意力模块,并结合显式与隐式的统计融合方式,增强梅尔频谱图和人脸特征图的关键通道响应;此外在交叉熵损失和跨模态N-pair损失基础上,引入双向InfoNCE对比损失,并与自适应身份权重联合优化,从而提高困难样本的类间分离度。在VoxCeleb与VGGFace身份重叠数据集上的大量实验表明,在跨模态验证、匹配和检索任务中均显著优于SVHF、DIMNet等主流方法,相较于基线模型,语音到人脸验证AUC提升2.1%,人脸到语音提升2.4%。此外,消融实验进一步验证了多尺度通道注意力机制和对比学习损失的必要性与互补性。
  • 张昊然, 蹇木伟, 王瑞, 宋增凯
    录用日期: 2026-06-24
    真实临床问诊场景中,患者主诉通常以语音形式表达,并由医生记录为文本。医生需要综合利用患者口述语音及其文本记录对症状进行判断和分类,从而为后续临床决策提供依据。然而,该任务仍面临一定挑战,语音信息容易受到环境噪声和个体发音差异的影响,文本记录又难以体现语速、停顿、音调等语音表达特征。同时,患者主诉通常具有口语化、主观性和非结构化特点,不同症状类别之间也可能存在语义边界模糊的问题,导致仅依赖单一模态难以获得理想的分类效果。针对上述问题,提出一种基于动态权重决策融合的多模态症状分类方法(DWDF-MSC),以充分利用文本与语音信息的互补性,提升症状分类的准确性和鲁棒性。 该方法主要包括多模态特征提取、初步分类和自适应门控决策融合三个阶段。在多模态特征提取阶段,分别构建文本分支和语音分支,对患者主诉文本和语音数据进行并行建模。文本分支基于临床预训练语言模型Bio_ClinicalBERT同时提取全局语义特征和局部词汇特征,并通过文本异构特征融合模块对两者进行融合,从而增强模型对主诉整体语义和局部症状关键词的表征能力。语音分支利用音频频谱图Transformer提取语音中的时序声学表示,以补充文本记录中难以体现的语音表达信息。在初步分类阶段,文本分支和语音分支分别通过各自的分类模块输出初步分类结果,使两种模态先独立完成症状判断。在最终分类阶段,设计自适应门控决策融合策略,根据不同样本的特征动态生成融合权重,对文本分支和语音分支的初步分类结果进行加权融合,得到最终症状分类结果。与简单特征拼接或固定权重融合不同,该策略能够根据样本差异自适应调整两种模态在最终决策中的贡献,从而增强具有判别力的信息对分类结果的影响,提高模型在复杂主诉场景下的分类稳定性。 在公共医疗数据集上的实验结果表明,DWDF-MSC在Accuracy、Precision和F1-Score上分别达到82.43%、87.44%和81.52%,各项指标均优于多数主流基准模型。多模态融合方案对比进一步证明,相较于特征融合,所提出的动态权重决策融合能够取得更好的分类效果。消融实验中,完整DWDF-MSC相较于仅采用文本异构特征融合的方案,在Accuracy和F1-Score上的提升幅度分别为4.25%和7.60%,验证了语音分支和自适应门控决策融合的有效性。McNemar检验结果显示,DWDF-MSC与多种对比方法之间的p-value小于0.0001,说明其与这些对比方法之间的分类结果差异具有统计显著性。抗噪性能实验结果说明,DWDF-MSC在不同信噪比条件下仍能保持较稳定的分类表现。综上所述,DWDF-MSC能够有效融合患者主诉中的文本与语音信息,提升模型分类性能,为面向患者主诉的智能症状分类提供了一种可行的多模态方法。
  • 梁清豪, 高宏娟
    录用日期: 2026-06-22
    文物三维重建是文化遗产数字化保护、虚拟展示与数字修复的重要技术支撑。相比结构光扫描、激光扫描等依赖专业设备和受控环境的建模方式,基于多视角图像的重建方法具有采集成本低、操作灵活、部署门槛低等特点,更适用于博物馆展陈空间中的文物数字化采集。真实馆藏场景通常存在背景复杂、玻璃反射、光照不均、局部遮挡和拍摄视角受限等问题,目标文物与展台、墙面及其他背景区域在图像中相互混杂。原始三维高斯泼溅(3D Gaussian Splatting,3DGS)虽能通过显式高斯核实现高效训练与实时渲染,但其主要面向完整场景建模,缺乏面向文物主体的语义聚焦机制,易使冗余背景点云和非目标高斯参与优化,进而增加显存占用、训练耗时和模型规模,并在主体边界处产生异常拉伸和伪影,影响文物几何形态与纹理细节的稳定表达。 为提升复杂馆藏环境下文物主体重建的准确性与效率,提出基于分割先验与3DGS的高保真三维重建方法,将二维主体分割结果引入三维高斯建模过程。利用Segment Anything Model生成多视角图像中的文物主体掩码,并结合SfM估计的相机位姿与稀疏点云,将三维点投影至对应视角的掩码平面,依据多视图语义一致性筛除稳定落入背景区域的点云,从初始化阶段获得更加纯净、紧凑的主体点云。高斯优化过程中引入掩码引导约束,将颜色重建损失限制于文物目标区域,使参数更新集中于主体几何结构、表面纹理和局部细节,降低背景区域对优化过程的干扰。面向文物轮廓处采样不足和深度不连续引起的高斯椭球异常拉伸问题,设计基于几何形态约束的边缘裁剪策略,通过长短轴比判定并删除边界附近形态异常的高斯核,抑制“黑刺”伪影和边缘噪声扩散,增强主体边界的连续性、紧致性和视觉稳定性。 在Tanks&Temples、Mip-NeRF 360、LERF、LLFF等公共数据集以及自建馆藏文物数据集上的实验结果表明,该方法在重建精度、结构一致性和感知质量方面均具有较好的综合性能。公共数据集上的平均PSNR为32.99 dB,平均SSIM为0.977,平均LPIPS为0.026;自建文物数据集上的平均PSNR为35.48 dB,平均SSIM为0.983,平均LPIPS为0.027。与原始3DGS及LightGaussian、3DGSR、2DGS、Perceptual-GS、FCGS等方法相比,该方法能够在复杂背景条件下获得更加清晰的主体轮廓和更加稳定的纹理表达。资源消耗对比与消融实验表明,分割先验引导的点云过滤和边缘裁剪能够协同减少背景冗余高斯并改善轮廓伪影,在保持重建质量的同时显著降低训练成本。相较于原始3DGS,训练时间缩短约60%,显存占用降低约40%,模型体积减少约50%,为非受控采集条件下馆藏文物的低成本、高效率和高保真三维重建提供了可行方案。
  • 钟寒, 陈柯冉
    录用日期: 2026-06-22
    联邦学习作为一种分布式学习架构,允许客户端在不共享本地数据的前提下进行全局模型训练,能够有效平衡隐私与效率的矛盾,但其分布式特性也使其易受数据投毒攻击。恶意客户端通过篡改本地训练数据,向全局模型注入有偏差或错误的更新,从而达到降低模型准确率或在特定输入下操控模型行为的目的,其中标签反转攻击作为数据投毒攻击中的经典方法,实现简单、计算成本低,只需修改本地数据标签而无需修改特征,难以被常规统计分析发现,却能够有效降低全局模型准确率或完成后门植入。为了提高联邦学习中全局模型准确度和系统整体安全性,常常在全局模型聚合前,从服务器端筛查过滤各本地客户端上传的模型更新参数,准确识别恶意客户端行为,并进行鲁棒性聚合来抵御数据投毒攻击。针对上述问题,本文提出一种面向联邦学习的标签翻转攻击防御方法(Label Flipping Attack Defense Algorithm, LFADA),旨在提升模型在面对数据投毒时的准确度与安全性。LFADA使用对数似然得分机制,首先对各客户端模型更新后的参数进行展平、降维,从而构建样本集。其次,使用高斯混合模型(Gaussian Mixture Model,GMM)对处理后的更新参数样本集进行建模。然后,通过对数似然得分(Log-Likelihood Score,LLS)对每个客户端的更新进行概率量化,得出每个客户端的“正常性”得分。接着,基于当前参数集合根据要求的分位数设置过滤阈值得分,认为低于该得分的客户端为恶意客户端,并剔除所有恶意客户端的更新参数,只对通过筛选的客户端更新参数进行聚合更新,从而实现对客户端更新的无监督异常检测与过滤和全局模型的安全聚合。本文分别在MNIST数据集、Fashion-MNIST数据集、CIFAR-10数据集上进行实验,统一设置包含三个卷积块的卷积神经网络(Convolutional Neural Network,CNN)作为基础模型,分别进行标签翻转攻击。模型准确率和攻击成功率的实验表明,在恶意客户端比例为0.1、0.2、0.3、0.5时,LFADA能够有效抵御标签翻转攻击,且在恶意客户端比例为0.5这种高比例恶意客户端时,LFADA表现依然较好。与Multi-Krum、Median、Foolsgold、Lfighter等9种主流算法相比,使用LFADA的模型准确度平均提高3.28%、3.38%和2.62%,同时攻击成功率整体保持较低比例,其中在MNIST、Fashion-MNIST数据集上均低于3%,在CIFAR-10数据集上也显著低于多数方法,能够与无投毒攻击环境下联邦平均FedAvg方案模型的性能保持相近。在算法稳定性方面,使用LFADA的联邦学习整体过程能够在整个训练阶段保持整体稳定,尤其在较为复杂的Fashion-MNIST和CIFAR-10数据集上,未出现大幅度上下波动,整体幅度可控,较其他算法明显稳定。时间开销实验表明,与对比算法相比,在保证相同准确度和攻击成功率的前提下,LFADA的时间开销显著降低。
  • 刘洲峰, 李慧敏, 丁淑敏, 徐艳芝, 李春雷
    录用日期: 2026-06-18
    弱监督语义分割通常利用类激活图(Class Activation Maps, CAMs)生成伪标签以训练分割网络。然而,由于CAM源于图像级分类任务,其响应往往集中在目标显著区域,导致前景激活不完整;同时,CAM在目标边界及复杂结构区域的响应不稳定,易引入伪标签噪声,从而限制分割性能的提升。针对上述问题,提出了一种语义不确定性区域增强的单阶段弱监督语义分割方法。首先,设计基于语义不确定性区域的对比学习模块,通过融合多种不确定性信息对CAM中语义不确定性区域进行细粒度建模,以增强前景激活完整性。其次,引入动态自适应高斯去噪模块,通过动态阈值调整与高斯混合去噪策略,对伪标签噪声进行自适应识别与逐步去除,从而抑制伪标签噪声。实验结果表明,在仅使用图像级标签监督的条件下,所提方法在PASCAL VOC 2012验证集和测试集上mIoU分别达到72.2%和72.8%,在MS COCO 2014数据集上达到42.5%。消融实验进一步表明,单独引入语义不确定性区域对比学习模块与动态自适应高斯去噪模块后,mIoU分别提升1.6%与2.5%,验证了两模块在增强前景完整性与抑制伪标签噪声的有效性,从而提升了模型整体分割性能。
  • 王凯源, 史彩娟, 高炜翔, 张艺琼, 张奕楠
    录用日期: 2026-06-17
    小样本目标检测(Few-Shot Object Detection, FSOD)旨在利用少量标注样本检测新类目标。现有基于元学习的FSOD方法虽通过查询与支持分支协同提升了性能,但仍面临三大瓶颈:一是固定的多尺度特征融合策略忽略了不同分辨率特征间的重要性差异,难以应对多尺度目标;二是基于简单平均池化的类级原型生成方式难以捕捉类内复杂结构,且易受噪声干扰;三是支持集语义匮乏导致查询特征与原型交互时易产生语义偏差,进而引发误检或漏检。针对上述挑战,本文提出了一种基于特征融合与语义增强(Feature Fusion and Semantic Enhancement, FFSE)的小样本目标检测模型。FFSE模型以Meta R-CNN为基础架构,通过设计三个协同互补的核心功能组件,从特征融合、原型表征及特征调制三个维度对小样本目标检测性能进行提升。首先,动态权重特征融合(Dynamic Weight based Feature Fusion, DWFF)模块通过自适应地为不同尺度特征分配权重,有效整合了局部纹理细节与全局语义信息,显著增强了模型对多尺度目标的感知能力。其次,原型图神经网络(Prototype Graph Network, PGN)机制为提升类级原型的质量,利用图神经网络的消息传递机制,实现了对原型的高阶语义增强。经PGN机制处理后的精炼原型具有更强的判别力和鲁棒性,能够更准确地代表目标类别的特征分布。最后,支持集驱动的特征调制(Feature Modulation Driven by Support set, FMDS)模块借鉴特征线性调制的思想,首先在内部对融合后的查询特征进行了多感受野分解,随后,利用精炼原型驱动生成动态缩放因子和偏移因子,通过仿射变换对查询特征进行通道级调制。缩放因子负责放大目标相关特征,而偏移因子则引导查询特征分布向支持集语义空间靠拢,从而有效校正了因类别信息不足引起的语义偏差,增强了目标的显著性。首先,所提方法FFSE在FSOD领域的PASCAL VOC和MS COCO基准数据集上进行了定量评估。在PASCAL VOC数据集上,FFSE在新类三种不同划分下的表现均优于基线方法,在新类三种不同划分的5-shot和10-shot设置下,FFSE模型的nAP50较基线方法提升了至少2.2%;在更复杂的MS COCO数据集上,FFSE模型的nAP较基线方法提升了至少5%;在两个数据集上运行多次实验的均值与标准差,与其他方法相比,所提FFSE模型能够在提升精度的同时,保持了较低的性能波动,表现出优异的鲁棒性。另外,对所提方法FFSE在PASCAL VOC数据集上进行了定性分析,并与其他相关方法进行了比较,实验结果进一步表明FFSE模型在面对复杂场景中的严重遮挡、多变微小目标以及高相似度背景干扰时,能够更准确地锁定并识别目标实例,大幅降低了跨类别的误检与漏检。综上,实验结果表明了所提FFSE模型的有效性。未来,研究工作将致力于探索更好的注意力机制,从更细粒度的像素层级有效抑制背景噪声的干扰,进一步提升小样本目标检测性能。
  • 林骏凯, 俞经虎, 王启蒙, 朱房勇, 许海凤
    录用日期: 2026-06-17
    口腔疾病严重影响民众健康,及时且有效的诊断与治疗对降低口腔疾病恶化风险具有重要意义。传统口腔疾病诊断依赖经验丰富的医生对影像资料进行人工判读,存在诊断耗时较长以及边界模糊病症易漏诊等问题,因此需要借助图像分割技术辅助临床牙齿病症的诊断。口腔全景片能够在单幅图像中呈现牙齿整体形态和颌骨结构,是临床牙科诊断中常用的医学影像资料。然而,由于口腔全景片中普遍存在灰度对比度低、病症边界模糊、噪声和伪影干扰等问题,龋齿、牙根尖周炎、根分叉病变和阻生齿等多类别牙齿病症分割仍面临较大挑战。针对上述问题,提出一种面向口腔全景片多类别牙齿病症分割网络Teeth-Net。该网络以TransUNet结构为基础,并在特征提取、特征重建和跳跃连接三个关键阶段进行针对性改进。在特征提取阶段引入跨尺度金字塔融合模块(Cross-Scale Pyramid Fusion Module, CPFM)优化原有编码器,通过不同感受野的并行群卷积提取多尺度特征,并利用跨尺度注意力机制建模不同尺度特征之间的相关性,从而增强模型对细小病症的捕捉能力,缓解细节特征丢失;在特征重建阶段设计并行多核池化模块(Parallel Multi-Kernel Pooling Module, PMKP),通过多尺度最大池化与平均池化并行提取局部细节和全局上下文信息,并经过通道压缩与特征融合为解码器提供更丰富的语义信息;在各级跳跃连接处嵌入空域-通道协同注意力模块(Spatial-Channel Collaborative Attention, SCCA),通过空间与通道注意力机制对编码器传递的浅层特征进行自适应筛选,抑制背景噪声的干扰,提高编码器与解码器之间的跨层特征融合质量。在自建口腔全景片数据集上进行对比实验与消融实验。实验结果表明,Teeth-Net的平均Dice系数、豪斯多夫距离(Hausdorff Distance, HD)、精确率和召回率分别达到84.22%、18.546mm、94.13%和95.96%。与基线模型TransUNet相比,平均Dice系数、精确率和召回率分别提升3.34、2.89和4.21个百分点,HD值降低6.869mm,表明该方法在整体分割精度、边界一致性和病症检出能力方面均取得明显改善。为进一步评估模型的泛化能力与跨数据集适应性,在两个公开来源数据集上开展外部测试。在重新标注的MICCAI 2023 STS外部测试集上,Teeth-Net的平均Dice系数、HD值、精确率和召回率分别为80.26%、19.520mm、92.58%和93.41%。与基线模型TransUNet相比,平均Dice系数、精确率和召回率分别提升3.32、4.33和3.89个百分点,HD值降低6.705mm。在公开多中心牙科全景影像数据集(Multi-Center Dental Panoramic Radiography Image, MCDP)上,Teeth-Net的平均Dice系数、HD值、精确率和召回率分别达到88.99%、12.126mm、90.61%和92.45%。与基线模型TransUNet相比,平均Dice系数、精确率和召回率分别提升3.83、4.03和3.33个百分点,HD值降低7.222mm。综合自建数据集和两组外部测试结果可知,Teeth-Net相较于基线模型TransUNet在不同数据来源和成像条件下均表现出更好的分割精度、边界刻画能力和跨域适应性,可为口腔全景片中多类别牙齿病症的辅助诊断提供有效的技术支持。
  • 杨本臣, 姚佳, 金海波, 任哲聪, 刘世琦
    录用日期: 2026-06-16
    图像隐写通过将秘密信息嵌入普通载体图像实现隐蔽通信,是信息安全与多媒体安全领域的重要研究方向。随着社交媒体平台压缩、格式转换、图像重采样以及主动隐写分析技术的发展,传统图像隐写方法面临更加复杂的应用环境。同时,现有深度隐写方法多集中于提升视觉不可感知性和嵌入容量,对提取后消息的内容机密性、完整性认证、误码容忍能力关注不足,导致隐蔽传输、内容保护与鲁棒恢复之间仍难以形成统一机制。针对上述问题,本文提出一种信息加密驱动的高安全性图像隐写模型,将认证加密、纠错编码、密钥控制置乱与深度隐写网络协同设计,以实现复杂信道下秘密消息的安全、隐蔽和可靠传输。载荷生成层面,构建“加密-纠错-置乱”主动防御体系:利用HKDF-SHA256派生加密密钥和置乱密钥,采用AES-GCM认证加密,生成兼具机密性与完整性校验能力的密文载荷;同时引入Reed-Solomon纠错编码,为隐写信道提供符号级误码修复能力。当反置乱后的码字符号错误数不超过RS纠错半径时,系统能够恢复正确数据包;若错误超出纠错能力或认证失败,则终止解密,避免错误明文输出。进一步采用CSPRNG驱动的位置置乱与比特置乱策略,打散载荷空间相关性和统计偏置,并生成稀疏位图控制嵌入位置,降低可被隐写分析器利用的结构线索。隐写嵌入层面,设计融合MS-DiSpAC与ViT的混合U-Net架构。MS-DiSpAC通过多尺度卷积提取纹理、边缘和局部结构信息,并利用膨胀空间注意力在保持分辨率的同时扩大感受野,引导高熵载荷嵌入复杂纹理区域;ViT补充全局上下文建模能力,弥补卷积结构对长距离依赖表达不足。网络输出残差扰动图和扰动强度图,通过加权残差调制生成隐写图像,在较高有效载荷下兼顾图像保真度与恢复稳定性。最后,引入WGAN判别器并采用Wasserstein距离进行对抗分布对齐,使隐写图像统计分布贴近载体图像,降低嵌入痕迹被SRNet、ZhuNet等隐写分析器捕获的概率。为验证方法有效性,本文在ImageNet、COCO和Visual Genome数据集上开展性能、泛化、载荷白化、鲁棒性及消融实验,并采用PSNR、MS-SSIM、LPIPS、BER、ESR、ACC.1、ACC.2和Dacc等指标评价。实验结果表明,在0.4bpp有效载荷条件下,本文方法在ImageNet上取得38.65dB的PSNR、0.975的MS-SSIM和0.036的LPIPS,提取端原始比特恢复准确率达到99.14%。载荷白化实验显示,原始消息经AES-GCM加密、RS编码和双重置乱后,单比特熵由0.8932提升至0.9998,平均绝对自相关由0.1285降至0.0028,最终载荷接近随机序列。与代表性方法相比,本文模型在视觉保真、信息恢复和抗隐写分析能力之间取得更优平衡;复杂失真条件下仍能在RS纠错能力范围内保持较高恢复成功率,为真实网络环境下的高安全图像隐写提供了可行方案。
  • 帅春燕, 郑顺元, 张小七, 欧阳鑫
    录用日期: 2026-06-16
    高速公路节假日期间的交通流具有显著的时空异质性,对起讫点(OD)流量进行精准短时预测是提升路网管理智能化水平的关键技术。针对OD数据的高维稀疏性、复杂时空依赖性及节假日模式偏移等问题,本文提出一种基于时空融合与节假日修正的高速公路OD流量短时预测方法,并构建双阶段时空融合网络(DSTF)模型。首先设计一种多源数据融合的时空特征提取架构:利用双分支图注意力网络(GAT)分别从OD层面与入口、出口流量层面提取并融合宏观出行关联与微观节点状态依赖的空间特征;进而通过门控融合的时间卷积网络(TCN)与卷积-长短期记忆网络(CNN-LSTM)组合模块,协同捕捉交通流的短时波动与长周期趋势;同时引入交叉注意力(Cross-Attention)机制实现入口流量、出口流量与基础OD流量的多任务协同预测。为适配节假日特殊出行模式,模型采用两阶段训练策略:第一阶段利用数据充足、模式稳定的非节假日数据训练基础预测模型;第二阶段引入轻量级的序列到序列(Seq2Seq)节假日修正模块,专注于学习节假日相对于基础模式的偏移量,对基础OD流量预测值进行自适应微调。基于真实高速公路收费数据的实验结果表明,所提DSTF模型在节假日OD短时预测任务中,在多项评价指标上均显著优于多种基线模型,在1步预测中MAE和RMSE较最优基线模型STGCN分别降低了11.7%和12.2%,展现了更高的预测精度、更强的鲁棒性以及更优秀的场景适应性。