面对多航天器智能协作围捕逃逸目标的空间复杂任务,提出基于多智能体双延迟深度确定性策略梯度(multi-agent twin-delayed deep deterministic policy gradient, MATD3)的智能协作围捕算法。首先建立多航天器协作围捕环境和相对轨道动力学模型,利用马尔可夫决策过程来描述空间目标围捕问题;其次为了改进围捕环境中高维度状态空间、连续动作空间,并解决多智能体航天器构型不稳定等问题,设计一种考虑围捕态势一致性的引导性奖励函数,使围捕星能够快速实现对逃逸星的稳定围捕;最后基于Gym框架搭建的多航天器协作围捕仿真环境进行集群博弈策略的训练优化,使各个航天器行为达到个体和团队双重最优决策目的。仿真结果表明,在100 m末端位置约束下,该算法能避免多航天器相互碰撞,并有效实现多航天器对目标的协作围捕,为未来空间航天器的智能自主操控提供参考。