随着深度学习技术的发展,人工智能正从单模态智能向多模态智能演进。视觉语言模型(VLM)作为连接视觉与语言的关键技术,已成为核心研究领域。针对VLM的技术演进历程,系统地综述它的架构发展,并总结该领域的核心技术和最新研究进展。首先,回顾VLM从早期探索到当前蓬勃发展的演进历程,分析关键技术节点和发展趋势,进而勾勒出以“架构发展”为核心主线的VLM技术发展图谱;其次,深入剖析当前VLM的基础技术,包括围绕视觉编码器、语言编码器和跨模态融合机制构建的核心架构,以及掩码语言建模(MLM)、掩码图像建模(MIM)和对比学习(CL)等关键预训练优化目标;同时,系统梳理当前VLM预训练所依赖的主流数据集如COCO和LAION-5B等;最后,对比分析代表性VLM,以阐明模型性能与数据规模、架构创新及训练策略间的关联,并评述相关核心技术的优势与局限性,从而为相关领域研究者提供全面的VLM技术图谱,助力把握发展脉络,并为未来研究提供参考与启发。
针对小样本学习中训练数据稀少以及单一距离度量无法全面衡量样本之间关系的问题,提出一种基于粒球原型网络(GBProtoNet)的小样本图像分类方法。首先,将粒球算法(Ball k-means)应用于查询集,并通过自适应更新迭代得到查询集类别信息,之后将这些信息与原型网络(ProtoNet)结合,构造具有查询集与支持集信息的粒球原型,从而缓解训练数据量少的问题;其次,在GBProtoNet特征提取后,设计一个特征筛选模块用于提取样本的重要信息,利用Ball k-means算法得到查询集各类的簇心,并把它们与初始原型进行加权融合,以构造更具代表性的粒球原型;再次,计算初始查询集样本与粒球原型的欧氏距离与余弦距离,并将二者相乘得到综合考量的距离,从而使样本间距离的度量更全面;最后,按照最邻近分配原则,将查询集样本分配给所属类别。实验结果表明,在MiniImageNet和TieredImageNet数据集的5-way 1-shot和5-way 5-shot的图像分类任务中,相较于基线模型ProtoNet,所提方法在MiniImageNet数据集上分类准确率分别提升了6.18%和3.85%,而在TieredImageNet数据集上分别提升了6.89%和3.57%。并且,所提方法在MiniImageNet数据集5-shot图像分类任务上所需时间成本比SSL-ProtoNet (Self-Supervised Learning Prototypical Network)减少了72.6%。可见,所提方法在有效提高小样本图像分类准确度的同时具有高效性。
针对现有社交机器人检测方法多模态特征建模不足、伪装行为难以识别及弱监督场景下泛化性欠缺的问题,提出一种融合多尺度小波增强与自监督学习的社交机器人检测框架——W2A-BotNet (Wavelet-to-Attention Bot Network)。该框架对文本语义、用户属性和社交关系构建统一的三通道表示,以缓解模态冲突;设计多尺度注意力小波神经算子模块(MAWNOBlock)对行为序列进行时频分解,捕捉周期规律与突发异常;提出多源协同融合机制,通过跨模态交互与门控实现动态语义对齐;引入基于粉丝数分布的自监督预训练,在少量标注数据的条件下加强特征表征。实验结果表明,W2A-BotNet的准确率在Cresci-15、Cresci-17与TwiBot-20数据集上相较于次优方法分别提高了0.35、4.86和2.21个百分点。可见,W2A-BotNet可有效提升社交平台上对机器人账户的识别能力,为社交网络的安全治理提供了可推广的检测框架。
针对复杂场景下目标检测任务中深度学习算法的泛化性和鲁棒性受限以及全参数微调(FPFT)计算成本高的问题,提出一种基于YOLOv11 (You Only Look Once version 11)的低秩自适应参数高效微调(PEFT)算法。首先,在YOLOv11的骨干和颈部网络中嵌入低秩自适应(LoRA)模块;其次,结合LoRA、权重分解低秩自适应(DoRA)和主奇异值与奇异向量自适应(PiSSA)这3种低秩分解算法,通过权重分解与动态调整机制实现参数的高效更新;最后,在训练过程中,将YOLOv11网络的绝大部分预训练权重保持冻结状态,仅对LoRA模块中由3种低秩分解算法生成的低秩矩阵进行训练,将可训练参数规模缩减至原算法的1.56%。COCO (Common Objects in COntext)数据集上的实验结果表明,所提算法相较于基线算法YOLOv11在精确度、召回率和交并比阈值为0.5时的平均精度均值(mAP)上分别提升了4.18、7.11和7.85个百分点。可见,所提算法为资源受限场景下的大型检测算法轻量化与高效微调提供了有效技术路径。
在遥感图像全色锐化中,传统的成分替换(CS)和多分辨率分析(MRA)方法的线性注入模型没有考虑用于全色锐化传感器的相对光谱响应,而基于深度学习的方法对原图像特征的提取不足会导致融合结果中的光谱和空间信息的丢失。针对以上问题,提出一种结合传统与深度学习方法的全色锐化方法CMRNet。首先,将CS和MRA与卷积神经网络(CNN)相结合以实现非线性从而提高全色锐化方法性能;其次,设计残差通道(RC)块实现多尺度特征信息的融合提取,并利用通道注意力(CA)自适应地为不同通道的特征图分配不同的权值,从而学习更有效的信息。在QuickBird和GF1卫星数据集上对CMRNet进行训练和测试,实验结果表明,在降尺度QuickBird和GF1数据集上,与经典方法PanNet相比,CMRNet的峰值信噪比(PSNR)分别提高了5.48%和9.62%,其他指标也均有显著提高。可见,CMRNet能实现较好的全色锐化效果。
区块链是一种结合分布式存储、共识机制和密码学原理等技术的新兴数据结构。针对公有链上的数据访问控制问题,提出一种面向公有区块链上的私有区块链(POP)的多权威属性加密(MA-ABE)方案。首先,构建依托公有区块链的私有区块链,并给出具体的数据隐私保护流程;其次,设计联合权威初始化算法以及联合密钥生成算法;最后,在随机预言机模型下,通过模拟挑战密文和用户私钥,使用基于判定性双线性Diffie-Hellman (DBDH)的假设证明所提方案满足静态安全性。实验结果表明,在保证安全性的前提下,所提方案能够抵抗针对主密钥的 n - 1 方恶意权威下的合谋攻击。
智能制造和环境可持续性研究中,多目标调度问题对于协调生产效率、成本管理与环境保护之间的平衡具有至关重要的意义,但现有基于CPU的调度解决方案在处理大规模生产任务时仍面临效率和时效性的限制,而GPU的并行计算能力可为优化大规模流水车间调度问题提供新的解决途径。针对多目标零等待流水车间调度问题(NWFSP),以同时最小化最大完成时间和总能耗(TEC)为优化目标,构建了混合整数线性规划模型(MILP)表征该调度问题,并提出一种基于GPU加速的张量化演化算法(Tensor-GPU-NSGA-Ⅱ)求解该问题。Tensor-GPU-NSGA-Ⅱ的主要创新在于对NWFSP关于最小化最大完成时间和TEC的计算过程的张量化处理,并提出了一种基于GPU的并行种群更新方法。实验结果表明,在500工件和20机器的问题规模下,Tensor-GPU-NSGA-Ⅱ在计算效率上相较于传统NSGA-Ⅱ算法取得了9 761.75的加速比;且随着种群规模的增加,它的加速性能有显著提升。
针对基于深度学习的低照度图像增强(LLIE)技术普遍依赖成对的数据集进行训练的问题,考虑实际应用中配对数据集的获取难度较高及其可能导致网络的泛化能力受限的问题,提出一种结合信噪比(SNR)引导的双分支结构和直方图均衡(HE)的LLIE网络,从而摆脱对配对数据集的依赖。首先,在生成对抗网络(GAN)的框架上,引入卷积神经网络(CNN)和Transformer的双分支结构,并使用SNR图像指导网络自适应地增强图像的不同区域,以有效平衡图像增强和噪声抑制;其次,采用经HE处理的低照度图像约束生成结果,从而显著提升生成图像的纹理细节;最后,在鉴别器部分,结合全局与局部鉴别器确保生成图像与参考图像在分布上的一致性,进一步提高图像的视觉质量。为了验证所提网络的有效性,在LOL与LSRW测试集上进行测试,与包含监督和无监督的10种先进方法进行比较。实验结果表明,在LOL数据集上,所提网络的峰值信噪比(PSNR)为19.15 dB,结构相似性指数(SSIM)为0.705 1,均位列第2名;在LSRW数据集中,所提网络以17.28 dB的PSNR和0.485 7的SSIM分别获得第1名与第2名;具体地,在LSRW数据集上,所提网络的PSNR相较于KinD (Kindling the Darkness)和EnlightenGAN(deep light Enhancement without paired supervision Generative Adversarial Network)方法分别提升了15.7%和9.6%。可见,所提网络与无监督方法和部分有监督方法相比均展现了更优越的性能,且显著提升了生成图像的质量。