最大熵强化学习因在复杂任务中卓越的探索能力备受关注,调节策略熵项重要性的温度系数是平衡策略探索与利用的关键因素,它的设定方式对算法性能具有重要影响。然而,现有温度系数调节方法通常依赖经验预设或固定目标熵调整,忽视了与状态相关的探索的差异,缺乏有效的自适应机制。因此,提出基于状态的温度系数自适应调节方法,采用神经网络模型根据给定状态预测适合的温度系数,利用规范化的时序差分误差构建监督信息指导模型训练,从而实现基于状态的熵项权重自适应调节。将该温度系数自适应调节方法与软演员-评论家(SAC)算法相结合,提出基于状态的温度系数自适应调节SAC算法。实验结果表明,在MuJoCo标准控制任务上,该算法在性能与训练稳定性方面总体优于SAC和TD3(Twin Delayed Deep Deterministic policy gradient)等基准算法,在测试阶段的平均回报相较于SAC与TD3算法分别至少提升了4.3%和6.2%,验证了基于状态的温度系数自适应调节方法的有效性。