针对皮肤病灶边界模糊、存在毛发干扰、病灶大小不一等问题,提出一种基于双路径注意力机制和多尺度信息融合的皮肤病灶分割网络。首先,在编码器部分设计基于深度可分离卷积的残差门控注意力模块DGConv(Depthwise Gate Convolution),用于捕捉病灶区域的局部信息;其次,在网络瓶颈处设计多尺度上下文关系提取模块(MCEM),采用水平平均池化及垂直平均池化建模上下文信息,并融合残差空洞卷积金字塔模块捕获的多尺度特征进一步增强对病灶全局信息的理解;再次,在跳跃连接处设计双路径注意力模块用于细化病灶信息,并利用多尺度特征融合增强(MSFE)模块实现多阶段信息的交融,丰富当前阶段传输的细节特征信息;最后,在解码器部分设计特征融合模块(FM),以解决同阶段接受野失配的问题,并逐步融合编码器输出和跳跃连接传递的特征信息得到最终的分割结果。该网络在ISIC2017(International Skin Imaging Collaboration)和ISIC2018数据集上的实验结果表明,相较于皮肤病灶分割方面表现次优的网络,所提网络的Dice指标分别提高了0.09和1.09个百分点,交并比(IoU)指标分别提高0.14和1.76个百分点;与经典U-Net相比,Dice指标分别提高5.13和3.84个百分点,IoU指标分别提高了7.74和6.04个百分点。充分说明所提网络的先进性与有效性。
针对在联邦学习中实施隐私保护机制会加剧系统通信负担,而当试图提升系统通信效率时,又会牺牲模型精度的问题,设计了一种兼顾高效性和安全性的联邦学习方案FedPSR(Federated Parameter Sparsification with secure aggregation and Reconstruction)。该方案旨在平衡由时间复杂度与通信开销构成的模型通信效率和隐私安全性。首先,利用稀疏三元压缩(STC)算法的参数稀疏化策略将待上传的模型参数压缩为三元组形式,以减少数据传输量;其次,为弥补因参数压缩带来的信息损失,采用错误反馈机制将上一轮压缩产生的误差累加至下一轮本地更新后的梯度;最后,采用Paillier同态加密技术保证了模型在高效通信前提下的参数传输及聚合过程的隐私安全。在多个公开数据集上将FedPSR与当前前沿方案在独立同分布(IID)及非独立同分布(Non-IID)的数据场景下进行对比分析,实验结果表明,FedPSR解决了现存方案无法在时间复杂度、通信开销、隐私保护间取得平衡的问题,且在3个主流数据集的IID与Non-IID条件下都有效提高了模型的精度、收敛性及鲁棒性。
联邦学习是一种强调隐私保护的分布式机器学习框架。然而,它在应对统计异质性问题时面临显著挑战。统计异质性源于参与节点间的数据分布差异,可能导致模型更新偏差、全局模型性能下降以及收敛不稳定等问题。针对上述问题,首先,详细分析统计异质性带来的主要问题,包括特征分布不一致、标签分布不均衡、数据量不对称以及数据质量参差不齐等;其次,对现有的联邦学习统计异质性解决方案进行系统综述,包括局部校正、聚类方法、客户端选择优化、聚合策略调整、数据共享、知识蒸馏以及解耦优化等,并逐一评估它们的优缺点与适用场景;最后,探讨了未来的相关研究方向,如设备计算能力感知、模型异构适应、隐私安全机制的优化以及跨任务迁移能力的提升,为应对实际应用中的统计异质性提供参考。
智慧家庭领域的发展依赖于构建丰富的时空知识图谱支撑下游任务的设计与执行。然而,构建智慧家庭空间的时空知识图谱面临数据源多样、数据质量低以及规模有限等挑战。因此,提出一种融合说明文档相对位置信息与用户行为日志的双模态知识提取框架来充分挖掘设备说明文档和用户行为日志中的多模态信息,从而高效地实现知识提取与图谱构建。该框架包括两部分:首先,提出一个基于相对位置布局匹配(RPLM)的方法,以利用说明文档的相对位置特性来对设备说明文档中的图像和文本进行关联匹配,同时设计说明文档的本体模型,并与大语言模型(LLM)融合,提取结构化信息并构建说明文档知识图谱;其次,设计功能关联分析(FCA)算法和设备使用行为处理(DUBP)算法,从用户行为日志中提取功能关联的设备信息并构建家庭空间的时空知识图谱。选取LayoutLMv3、ERNIE-Layout和GeoLayoutLM等作为基准模型,并在一个自建中文说明文档布局分析(CMDLA)数据集和合成的用户行为日志数据集以及3个公开文档分析数据集上进行验证。结果表明,所提框架在家庭领域数据集上的知识提取准确性和效率上优于基线方法,准确率达到96.39%,比次优方法GeoLayoutLM提高了0.97个百分点,在异构数据融合与时空建模任务中表现出显著优势。
针对深海拍摄会导致水下图像色彩偏移、对比度过低和结构不清晰等问题,提出一种基于多尺度感知的多维空间融合水下图像增强算法,结合空间、通道和三维特征将图像信息并行传入多维特征提取网络和编码器中。首先,在多维特征提取网络中引入多尺度特征精炼模块进一步处理提取到的特征信息,使网络更准确地学习不同尺度的信息;然后,在编码器中引入多维色彩增强模块,增强图像细节和色彩;最后,设计自适应增强网络来进一步处理特征信息并融合多级信息,再通过解码器得到最终的增强图像。在公开数据集上的实验结果表明,所提算法表现优异,它的峰值信噪比(PSNR)和结构相似性(SSIM)最高分别达到24.865 1 dB和0.895 4,比混合融合方法(HFM)分别提升了1.580 6 dB和0.039 8;水下色彩质量评价(UCIQE)和水下图像质量测量(UIQM)最高分别达到0.593 1和3.102 8,比HFM分别提升了0.038 4和0.151 4。可见,所提算法能有效提升水下视觉效果。
传统交通流量预测模型未能有效考虑地区间和时段间的时间延迟效应,且难以同时捕捉交通流量的短期波动与长期趋势。为此,提出一种结合小波分解与时间延迟感知的时空预测模型(WTA-LAGNN)。首先,结合小波分解将交通流量数据分为长期趋势模式和短期波动模式:短期波动模式通过特征增强模块强化关键特征,提升对短期波动的敏感性;针对长期趋势,设计了序列增强的多头自注意力机制捕捉流量的长期变化。其次,为了处理时间延迟效应,设计了时间序列延迟感知层,优化区域间流量传播的时空依赖关系。最后,通过融合层生成最终预测结果。基于现实高速公路交通数据集PeMS03、PeMS04、PeMS07、PeMS08进行60 min流量预测,结果表明,在PeMS03和PeMS07数据集上,与时空图神经控制微分方程(STG-NCDE)相比,WTA-LAGNN的平均绝对误差(MAE)、均方根误差(RMSE)分别降低了5.14%、2.69%和5.80%、2.69%;在PeMS08数据集上,与交通流量矩阵-图卷积注意力模型(TFM-GCAM)相比,WTA-LAGNN的MAE、RMSE分别下降了9.28%、3.32%;在PeMS04数据集上,与时空融合图卷积网络(STFGCN)相比,WTA-LAGNN的MAE、RMSE分别降低了3.53%、2.72%。WTA-LAGNN的整体模型性能上优于对比模型,能更有效地捕捉时空依赖关系,提升流量预测精度。
追踪学生的历史互动以预测他们的未来表现是知识追踪(KT)领域的关键研究重点。最近的KT方法旨在研究学生的学习模式和不断变化的知识状态,以提供个性化学习指导,而忽略了习题本身的丰富性。此外,随着新专业和跨学科领域的兴起,基于图神经网络(GNN)的KT方法面临着一些挑战:如何扩展概念之间关联的视野并建模学生的学习行为。为了应对这些挑战,提出一种新的KT模型——融合图注意力的概念关联记忆网络知识追踪模型(GAMKT)。GAMKT可以建模学生的习题记录,追踪他们的知识状态,并从习题-概念图中捕捉相关概念的全局特征;同时,将遗忘门和高阶信息提取纳入模型,以真实模拟学生的习题过程。在Junyi、ASSIST09和Static2011数据集上的对比实验结果表明, 与基于图神经网络的知识追踪(GKT)等7种模型相比,GAMKT的曲线下面积(AUC)和准确率分别平均至少提升了约2.1%和2.4%,表明GAMKT在成熟的知识结构数据集上优于基线模型。
现有的知识追踪(KT)模型未能有效利用学习行为信息,且忽略了不同学习行为对答题表现的贡献差异。因此,提出一种学习行为增强的知识追踪(LBBKT)模型。该模型采用门控残差网络(GRN)将学生的学习行为特征编码成4种上下文向量并把它们融入模型中,从而充分利用学习行为信息(答题速度、尝试次数和提示)更好地建模学生的学习过程。此外,利用变量选择网络对学生的学习行为特征进行选择性加权,并通过GRN抑制不相关特征的干扰,以增强相关特征对学生答题表现的影响,从而充分考虑不同学习行为对学生答题表现的差异性贡献。在多个公开数据集上的实验结果表明,LBBKT模型在预测准确性上显著优于对比的KT模型。
为了解决联邦学习中恶意客户端通过上传恶意更新破坏全局模型可靠性的问题,提出一种面向联邦学习的投毒攻击检测与防御算法FedDyna。首先,设计一种异常客户端检测方案,利用余弦相似度与欧几里得距离的历史标准差初步检测异常更新,并结合多视角模型评估机制进一步检测可疑的客户端;其次,提出一种自适应调整策略,根据权重调整因子逐步降低被判定为异常客户端的参与权重,直至将恶意更新从模型训练过程中剔除。在EMNIST和CIFAR-10数据集上评估FedDyna在不同攻击场景下的防御性能,并与现有的先进防御算法进行对比。实验结果表明,在固定攻击频率的条件下,将FedDyna算法与Scope算法进行效果对比:面对投影梯度下降(PGD)、模型替换(MR)以及PGD+MR这3种攻击方式,FedDyna均取得了最优效果,攻击成功率(ASR)分别降低了1.07和0.53、1.49和1.45、10.55和1.25个百分点;在余弦约束攻击(CCA)攻击的EMNIST数据集下,FedDyna的ASR虽略有下降,但仍取得了次优结果。此外,当在不同攻击者池中与对比算法进行效果评估时,FedDyna的ASR在多数条件下表现最优,其余条件下也处于次优水平。尤为突出的是,在不同攻击强度的场景下,FedDyna的平均全局模型准确率(MA)高达98.5%。可见,FedDyna在不同攻击场景下表现出显著的抗投毒攻击稳健性,且能够有效检测并剔除投毒模型。
在消费电子的动态领域,了解用户行为对于产品创新和提高用户满意度至关重要。因此,提出一种突破性的多聚类方法以结合深度学习与张量分解,从而应对数据分析和挖掘的挑战。首先,从复杂的异构数据集中提取高级特征,例如对现代设备的各种传感器和用户交互的数据集,采用深度神经网络封装数据源的各种特征;其次,把张量分解技术应用于特征提取和聚类分析,以将每个数据源视为数据张量中的不同模态,从而揭示它们潜在的结构和模式;最后,采用与某电商平台合作得到的涵盖数万消费者的多模态购物数据的数据集进行实验。实验结果表明,所提结合卷积神经网络(CNN)的张量分解算法在消费电子相关数据集上表现出色,准确率均超过0.7,同时在纯度、调整兰德指数(ARI)和归一化互信息(NMI)等关键指标上也表现突出,验证了所提方法在捕捉数据内在结构和相似性方面的有效性;与动态的多聚类(DMCR)方法、深度多模态聚类(DMMC)方法以及FAST-CNN等现有方法相比,所提方法在多个评价指标上均显示出显著优势,不仅验证了它在准确性和稳定性方面优于对比方法,而且展现了它在揭示数据底层原理和异构数据之间相互关系方面的优势。
JPEG(Joint Photographic Experts Group)压缩是当前应用最为广泛的图像压缩标准之一,它涉及诸如图像操作链取证、图像源取证、隐写与隐写分析和JPEG反取证等多种取证场景和安全模型。研究者针对JPEG图像特性开展了诸多有关JPEG重压缩取证的研究,发现JPEG重压缩取证不仅为图像取证提供先验知识,也可以直接应用到取证场景中。因此,对彩色图像JPEG重压缩取证进行综述。首先,介绍了重压缩取证的研究背景,并将重压缩取证分成了非对齐、对齐异步和对齐同步3种重压缩问题;其次,详细介绍了JPEG压缩的流程、收敛误差、误差图像、算法评价指标等用于重压缩取证的基础知识;再次,对每类问题的现有方法进行了详细的介绍和梳理。此外,由于图像隐写、对抗样本等都涉及关于JPEG重压缩的鲁棒性研究,因此,列举了JPEG重压缩特征特性在上述领域中的应用,并选取了常见的算法进行对比,总结归纳它们的优缺点。最后,展望了JPEG重压缩取证中有待进一步解决的问题和发展趋势。
多变量时间序列数据常表现出多尺度特征和复杂的相互依赖性,给异常检测带来了挑战。为了解决这一问题,提出一种基于多尺度的多变量时间序列异常检测模型M3AD(Multi-scale Mamba Multi-layer perceptron Anomaly Detection)。首先,采用多尺度特征提取方法,即通过在不同时间尺度上分割时间序列,捕捉短期和长期模式;其次,利用多层感知机(MLP)和卷积层进行特征学习,提取局部和高级特征表示;再次,引入选择性状态空间模型(SSM) Mamba,通过它高效的处理能力捕捉长序列中的关键信息;最后,通过基于KL (Kullback-Leibler)散度的损失函数和异常分数计算,实现对异常的敏感检测。为了验证模型的有效性,将M3AD与Anomaly Transformer和MEMTO等7种模型在4个公共数据集上对比。实验结果表明,M3AD在精确率、召回率和F1分数等关键指标上相较于对比方法展现出显著优势和领先性能,验证了M3AD在多变量时间序列异常检测任务中的有效性和优越性。
针对现有区块链多域环境下访问控制模型存在的属性隐私保护泄漏和可扩展性不足问题,提出一种基于跨链的多域访问控制模型(CC-MDACM)。首先,基于属性访问控制(ABAC)和中继链技术,提出一种跨区块链的多域访问控制模型,实现域内自主授权并在域间通过中继链实现异构链之间的细粒度访问控制。其次,结合基于SM2的门限同态密码算法和零知识证明技术,提出多域环境下跨链的属性与策略双隐藏且可扩展的访问控制方案。该方案通过中继链的分布式节点验证和解密数据,并在密文状态下完成访问控制决策,从而实现访问控制过程中属性和策略的双隐藏以及访问控制策略的动态扩展,同时采用Raft共识保证解密的可靠性。最后,对所提方案进行安全理论分析和仿真实验。结果表明,在属性和策略双隐藏,以及访问策略动态扩展的基础上,所提方案有效解决了异构链间跨链的多域访问控制问题,且加、解密效率相较于分布式双陷门公钥密码系统(DT-PKC)分别提升了34.4%和44.9%。
联邦学习(FL)是一种分布式机器学习方法,即利用分布式数据在训练模型的同时保护数据隐私。然而,它在高度异构的数据分布情况时表现不佳。个性化联邦学习(PFL)通过为每个客户端提供个性化模型来解决这一问题。然而,以往的PFL算法主要侧重于客户端本地模型的优化,忽略了服务器端全局模型的优化,导致服务器计算资源没有得到充分利用。针对上述局限性,提出基于模型预分配(PA)与自蒸馏(SD)的PFL方法FedPASD。FedPASD从服务器端和客户端2方面入手:在服务器端,对下一轮客户端模型有针对性地预先分配,这样不仅能提高模型的个性化性能,还能有效利用服务器的计算能力;在客户端,经过分层训练,并通过模型自蒸馏微调使模型更好地适应本地数据分布的特点。在3个数据集CIFAR-10、Fashion-MNIST和CIFAR-100上,将FedPASD与FedCP (Federated Conditional Policy)、FedPAC (Personalization with feature Alignment and classifier Collaboration)和FedALA (Federated learning with Adaptive Local Aggregation)等作为基准的典型算法进行对比实验的结果表明:FedPASD在不同异构设置下的测试准确率都高于基准算法。具体而言,FedPASD在CIFAR-100数据集上,客户端数量为50,参与率为50%的实验设置中,测试准确率较传统FL算法提升了29.05~29.22个百分点,较PFL算法提升了1.11~20.99个百分点;在CIFAR-10数据集上最高可达88.54%测试准确率。
针对现有多尺度信息传播预测模型忽略了级联传播的动态性,以及独立进行微观信息预测时性能有待提高的问题,提出基于超图神经网络的多尺度信息传播预测模型(MIDHGNN)。首先,使用图卷积网络(GCN)提取社交网络图中蕴含的用户社交关系特征,使用超图神经网络(HGNN)提取传播级联图中蕴含的用户全局偏好特征,并融合这2类特征进行微观信息传播预测;其次,利用门控循环单元(GRU)连续预测传播用户,直至虚拟用户;再次,将每次预测所得用户总数作为级联的最终规模,完成宏观信息传播预测;最后,在模型中嵌入强化学习(RL)框架,采用策略梯度方法优化参数,提升宏观信息传播预测性能。在微观信息传播预测方面,相较于次优模型,MIDHGNN在Twitter、Douban、Android数据集上的Hits@k指标分别平均提升12.01%、11.64%、9.74%,mAP@k指标分别平均提升31.31%、14.85%、13.24%;在宏观预测方面,MIDHGNN在这3个数据集上的均方对数误差(MSLE)指标分别最少降低8.10%、12.61%、3.24%,各项指标均显著优于对比模型,验证了它的有效性。
语音情感识别(SER)旨在赋予计算机准确识别语音信号中的情感状态的能力,而如何高效地表征语音中的情感特征一直是SER的研究热点。目前,大多数研究都致力于利用深度学习方法直接从原始语音或语谱图中学习最优特征,这种学习模式可以提取到更完整的特征信息,但忽略了对特定特征更深层细化信息的学习,同时不能保证特征的可解释性。为了解决上述问题,提出一种基于卷积神经网络的渐进式表征学习SER方法(CnnPRL),在语音声学特征的基础上利用卷积神经网络(CNN)渐进式地提取具有可解释性的精细化情感特征。首先,手工提取可解释的浅层特征并选择出最优的特征集;其次,提出级联CNN和动态融合结构,以细化浅层特征,并学习深层情感表征;最后,构建并行异构CNN提取不同尺度的互补特征,以利用融合模块实现多特征融合,捕获多粒度特征,并整合来自不同特征尺度的深层情感信息。实验结果表明,在保证时间复杂度的前提下,在数据集IEMOCAP (Interactive EMOtional dyadic motion CAPture database)、CASIA(Institute of Automation, Chinese Academy of Sciences)和EMODB(Berlin EMOtional DataBase)上,相较于SpeechFormer++、TLFMRF(Two-Layer Fuzzy Multiple Random Forest)和TIM-Net(Temporal-aware bI-direction Multi-scale Network)等对比方法,CnnPRL在指标加权平均召回率(WAR)上分别至少取得了0.86、2.92和1.46个百分点的提升,验证了CnnPRL的有效性;消融实验结果验证了CnnPRL的每个模块都有利于提升模型的整体性能。
图像去雾是计算机视觉领域的热点话题之一。由于真实世界中大规模高质量的配对数据集的获取存在成本昂贵、实施困难等问题,现有方法通常利用合成数据对深度学习模型进行全监督训练,这可能会导致模型在真实场景下的泛化性能较差。为了解决真实域和合成域之间的域差异问题,提出一种基于师生学习的半监督图像去雾算法。该算法采用一个半监督的师生学习框架,利用指数移动平均(EMA)策略来更新教师模型,并端到端地进行去雾学习,显著地解决了合成数据与真实数据之间的域偏移问题,并提高了模型在真实有雾场景下的泛化性能。实验结果表明,所提算法在2个合成雾霾图像数据集SOTS(Synthetic Objective Testing Set)、Haze4K和真实雾霾图像数据集URHI(Unannotated Real-world Hazy Images)上取得了较好性能,并获得了更好的去雾视觉效果。
睡眠呼吸暂停严重影响生活质量和健康。多导睡眠图(PSG)是诊断睡眠呼吸暂停的“金标准”,然而它的成本高且不便长期监测。基于此,提出一种基于通用运动手环的新方法以便捷地检测睡眠呼吸暂停。该方法通过分析手环采集的心率、血氧饱和度和睡眠状态数据,采用自适应生理数据重构方法和数据插值方法滤除噪声;在特征工程中,融合连续生理变量和类别变量,以深度提取睡眠状态特征;而分类模块采用轻量级门控循环单元(GRU)模型,从而简化训练过程,并降低过拟合风险。实验结果表明,所提方法在23人数据集上获得了93.68%的准确率和93.97%的召回率。相关性分析表明,血氧饱和度、身体质量指数和年龄是判断睡眠呼吸暂停的关键特征。与PSG相比,所提方法更适用于家庭环境下的长期监测。
作为一种新型的分布式机器学习,联邦学习在解决数据孤岛和隐私保护问题上具有一定潜力,然而它面临着潜在的隐私威胁和安全威胁。因此,系统性综述联邦学习在隐私与安全领域的前沿研究成果,详细阐述联邦学习的基本概念和工作流程,并对联邦学习中的隐私和安全问题在现有前沿的研究成果上进行分类。首先,分析联邦学习中的隐私威胁,归纳相应的隐私保护方法;其次,总结联邦学习中的安全威胁问题,并介绍相应的安全攻击的防御方法;最后,讨论联邦学习中未来需要解决的挑战,并针对ChatGPT和DeepSeek等大语言模型(LLM)在联邦学习中的应用,进一步探讨LLM带来的计算效率瓶颈与隐私泄露挑战。
针对现有情感分类模型在深层情感理解上的局限性、传统注意力机制的单向性束缚以及自然语言处理(NLP)中的类别不平衡等问题,提出一种融合多尺度BERT(Bidirectional Encoder Representations from Transformers)特征和双向交叉注意力机制的情感分类模型M-BCA(Multi-scale BERT features with Bidirectional Cross Attention)。首先,从BERT的低层、中层和高层分别提取多尺度特征,以捕捉句子文本的表面信息、语法信息和深层语义信息;其次,利用三通道门控循环单元(GRU)进一步提取深层语义特征,从而增强模型对文本的理解能力;最后,为促进不同尺度特征之间的交互与学习,引入双向交叉注意力机制,从而增强多尺度特征之间的相互作用。此外,针对不平衡数据问题,设计数据增强策略,并采用混合损失函数优化模型对少数类别样本的学习。实验结果表明,在细粒度情感分类任务中,M-BCA表现优异。M-BCA在处理分布不平衡的多分类情感数据集时,它的性能显著优于大多数基线模型。此外,M-BCA在少数类别样本的分类任务中表现突出,尤其是在NLPCC 2014与Online_Shopping_10_Cats数据集上,M-BCA的少数类别的Macro-Recall领先其他所有对比模型。可见,该模型在细粒度情感分类任务中取得了显著的性能提升,并适用于处理不平衡数据集。
针对深度学习缺陷检测方法需要大量标注样本训练,而绝缘子缺陷样本获取困难的问题,提出一种基于迁移学习的小样本绝缘子缺陷检测方法。首先,在主干网络加入高效多尺度注意力(EMA)机制,以增强模型对目标特征的表征能力;其次,构建分层采样的区域建议网络(RPN)在特征金字塔中均匀选择锚框,提高模型对不同尺度下新类对象的捕获能力;最后,设计解耦分类头,并通过正负两个头分别处理正负样本,从而使模型可以更有效地适应新类对象。实验结果表明,与基线方法TFA(Two-stage Fine-tuning Approach)相比,在公共数据集PASCAL VOC上,所提方法对新类的平均精度均值(mAP)(交并比(IoU)为0.5)平均提升了9.5个百分点;在绝缘子缺陷数据集上,所提方法在1-shot、5-shot、10-shot、20-shot和30-shot检测任务中的mAP50分别提高了15.8、12.2、17.4、7.3和7.1个百分点。
针对轮式移动机器人(WMR)在轨迹跟踪过程中因定位失准和未知干扰等因素导致的位姿偏移问题,提出一种基于几何模型预测控制(GMPC)的增强型粒子群优化混合器(EPSO-Mixer)算法,旨在提升WMR的轨迹跟踪性能。首先,以粒子群优化(PSO)为基础,提出一种增强型粒子群优化(EPSO)算法,以加快收敛并提升优化能力;其次,利用EPSO对GMPC进行改进,根据当前偏移程度筛选出最优跟踪参数,以有效地减小轨迹跟踪误差;最后,结合混合多层感知器(MLP-Mixer)架构,提出EPSO-Mixer算法,从而进一步增强对全局最优解的搜索能力,同时生成更具适应性的控制策略。仿真实验结果表明,与非线性模型预测控制和经典GMPC算法相比,EPSO-Mixer GMPC有效提升了WMR在位姿偏移条件下的轨迹跟踪性能,误差减小8.0%~82.3%,并显著改善了运动中的振动问题。可见,EPSO-Mixer算法能够提供更有效的控制策略,不仅降低了参数调整的难度与时间成本,而且显著增强了轨迹跟踪控制的自适应能力。
图神经网络(GNN)是处理图结构数据的有效图表示学习方法。然而,在实际应用中, GNN的性能受限于信息缺失问题:一方面,图结构通常较为稀疏,导致模型难以充分学习节点特征;另一方面,监督学习依赖的标签数据通常稀缺,使模型训练受限,进而难以获得鲁棒的节点表示。针对以上问题,提出一种基于数据增强的子图感知对比学习(SCLDA)模型。首先,使用链路预测学习原始图得出节点之间的关系得分,并将得分最高的边添加到原始图中以生成增强图;其次,对原始图和增强图分别利用目标节点进行局部子图采样,将子图的目标节点输入共享GNN编码器,生成子图级别的目标节点嵌入;最后,基于2个视角子图的目标节点的对比学习最大化相似实例之间的互信息。在Cora、Citeseer、Pubmed、Cora_ML、DBLP和Photo 6个公共数据集上进行节点分类实验的结果表明, SCLDA模型比传统GCN模型的准确率分别提升了约4.4%、6.3%、4.5%、7.0%、13.2%和9.3%。
非自回归的文本到语音(NAR-TTS)模型的发展使得快速且高质量的语音合成成为可能。然而,合成语音的韵律仍有待提升,且在文本单元与语音之间存在一对多的问题,导致难以生成具有丰富韵律且高质量的梅尔频谱。此外,现有的NAR-TTS模型中存在大量冗余的神经网络。因此,提出一种基于流的轻量化高质量NAR-TTS方法——AirSpeech。首先,分析文本,得到不同粒度的语音特征编码;其次,采用基于注意力机制的技术对齐这些特征编码,从混合编码中提取韵律信息;在此过程中,利用长短距离注意力(LSRA)机制和单一网络技术使特征提取轻量化;最后,设计基于流的解码器,从而显著降低模型的参数量和峰值内存,并通过引入仿射耦合层(ACL),使解码出的梅尔频谱更细致和自然。实验结果表明,相较于BVAE-TTS和PortaSpeech方法,AirSpeech的结构相似性(SSIM)和平均意见得分(MOS)指标更优,能够兼顾合成语音的高质量和模型的轻量化。
为了解决区块链数据量剧增带来的存储问题,提出一种改进的一致性哈希算法,以实现区块链的存储扩展。针对Hyperledger Fabric在企业级应用中节点存储负载不均和数据倾斜的问题,基于一致性哈希算法提出了改进方案——基于虚拟节点分配与动态权重策略的哈希算法(VNDWS)。首先,采用虚拟节点分配机制为每个节点动态分配多个虚拟节点,使数据在哈希环中均匀分布,减少负载不均;其次,应用动态权重机制,基于节点存储能力和网络延迟等性能指标实时调整权重,使高性能节点承担更多数据负载,从而优化数据分配和存储效率。仿真实验结果表明,与传统区块链Fabric网络和传统一致性哈希算法相比,VNDWS的节点存储消耗分别降低了48.31和6.39个百分点,而数据查询效率分别提升了96.25%和21.95%。VNDWS在存储扩展方面能有效降低节点存储消耗并提高查询效率。
利用串联质谱对蛋白质酶切产生的肽段进行测序(称为肽鉴定)是蛋白质组学研究的支撑技术。现有肽段从头测序算法在鉴定具有重要生物学意义的磷酸化修饰肽段时准确度受限,主要原因是磷酸化修饰导致碎裂模式更复杂,易产生中性丢失峰,且磷酸化肽的质谱图在常规质谱数据中丰度较低。因此,提出基于Transformer和门控循环单元(GRU)的从头测序算法TGNovo。TGNovo引入谱峰连接图,显式建模谱峰间的质量差关系,指导Transformer编码器捕捉谱图特征。Transformer模块与GRU模块分别建模谱图与氨基酸序列的关联以及谱峰间与氨基酸间的依赖关系,二者协同工作以实现肽段重建。相较于完全基于Transformer的从头测序算法Casanovo, TGNovo通过谱峰连接图和GRU模块充分利用谱图先验信息,增强了模型对谱图的建模能力。在跨物种磷酸化肽段评测中, TGNovo在肽水平和氨基酸水平的召回率上比Casanovo分别平均提升了16.5和37.1个百分点;此外,在免疫肽数据集上的实验结果表明, TGNovo鉴定的高可信抗原肽覆盖了数据库搜索结果的86%。
运动想象脑电(MI-EEG)信号在无创脑机接口(BCI)中扮演重要角色,已被广泛应用于临床辅助康复训练。作为一个主动刺激范式,MI-EEG的样本采集成本高且个体差异大,同时具有复杂时变性和低信噪比等特点,使得构建跨被试MI-EEG解码模型成了研究关键。然而,当前绝大多数的跨被试解码模型采用单阶段的对抗学习策略,并且仅考虑学习边缘分布或条件分布最小化的深度表征,进而严重制约了MI-EEG解码性能。因此,提出一种多阶段分布适应(MSDA)的跨被试MI-EEG解码模型。首先,采用样本协方差对齐被试者之间的样本边缘分布差异;其次,通过预训练特征提取器和域鉴别器获取边缘分布不变的深度表征;最后,通过L2距离构建深度表征的联合分布不变映射,并交替训练联合这些映射和分类器学习联合分布不变的深度表征用于跨被试MI-EEG解码。MSDA模型分别从样本边缘分布、深度表征边缘分布和深度表征联合分布这3个阶段进行被试者之间的分布适应,从而有效地应对单阶段分布适应的挑战。在BCI Competition IV-2a和BCI Competition IV-2b公开数据集上的实验结果表明,MSDA模型在准确率和Kappa系数这2个指标均超越了近期提出的解码模型。可见, MSDA模型提升了跨被试域不变深度特征的学习能力,为构建MI-BCI提供了新的选择。
通过机器视觉算法对目标进行识别并定位它的空间坐标是实现机械臂视觉抓取的关键。针对基于双目视觉的目标识别与定位中定位精度低、运行效率不高等问题,提出面向机械臂抓取的联合双目视觉目标检测与立体深度估计的网络结构BDS-YOLO(Binocular Detect and Stereo YOLO)及基于BDS-YOLO的目标定位算法。该算法联合目标检测与立体深度估计算法,利用注意力机制进行跨视图特征信息交互,从而提高特征表达能力,使网络可以通过深度特征匹配获得高质量视差图,再经过自注意力机制进一步提升后,由三角测量原理转换为深度信息。BDS-YOLO网络采用多任务学习,同时训练目标检测与立体深度估计网络,并使用合成与真实数据共同训练。针对真实数据不易标注密集深度的问题,采用自监督学习技术优化由视差重建图像的过程,以提高BDS-YOLO网络对现实世界的泛化能力。实验结果表明:BDS-YOLO网络在真实数据集上对目标检测的平均精度(AP)比YOLOv8l高6.5个百分点,预测的视差和转换后的深度优于专门的立体深度估计算法,推理速度可达20 frame/s以上,对目标对象的识别和定位均优于对比方法,能较好地满足目标实时检测与定位的需求。
针对大语言模型(LLM)在零样本重排序任务中存在的标签语义理解不足、关系建模模糊和计算成本过高的问题,提出基于层次过滤与标签语义扩展的重排序方法HFLS (Hierarchical Filtering and Label Semantics)。该方法构建多级标签语义扩展路径,并设计“关键词匹配→语义关联→领域知识整合”的递进式提示策略引导LLM实现深度相关性推理;同时,引入分层过滤机制,在降低计算复杂度的同时保留高潜力候选文档。实验结果表明:在TREC-DL2019等7个基准数据集上, HFLS相较于Pointwise.qg、Pointwise.yes_no和Pointwise.3Label等Pointwise方法的NDCG@10(归一化折损累积增益)指标分别平均提升了21.92%、13.43%和8.59%;而在推理效率方面, HFLS的单个查询处理时延较Listwise方法、Pairwise方法和Setwise方法分别降低了91.06%、68.87%和33.54%。