ज़ालैंडो Postgres ऑपरेटर के साथ PostgreSQL उच्च उपलब्धता: मल्टी-क्लाउड Kubernetes परिनियोजन गाइड
किसी भी Kubernetes प्लेटफ़ॉर्म पर ज़ालैंडो ऑपरेटर के साथ उत्पादन-ग्रेड PostgreSQL HA तैनात करें
परिचय: Kubernetes पर PostgreSQL की उच्च उपलब्धता
को क्यों महत्व देती हैउत्पादन में PostgreSQL चलाने के लिए उच्च उपलब्धता (HA) की आवश्यकता होती है। मिनटों में मापे गए डाउनटाइम से उद्यमों को राजस्व में लाखों डॉलर का नुकसान हो सकता है, ग्राहकों का भरोसा कम हो सकता है और सेवा-स्तर के समझौतों का उल्लंघन हो सकता है। Kubernetes कंटेनरीकृत वर्कलोड को ऑर्केस्ट्रेट करने के लिए वास्तविक मंच बन गया है, लेकिन Kubernetes पर PostgreSQL जैसी स्टेटफुल सेवाएं चलाने से अद्वितीय चुनौतियां पेश होती हैं: लगातार भंडारण प्रबंधन, नेता चुनाव, स्वचालित विफलता, बैकअप ऑर्केस्ट्रेशन और कनेक्शन पूलिंग।
ज़ालैंडो Postgres ऑपरेटरएक ओपन-सोर्स, युद्ध-परीक्षणित समाधान है जिसे यूरोप के सबसे बड़े ऑनलाइन फ़ैशन रिटेलर ज़ालैंडो ने उत्पादन में सैकड़ों PostgreSQL समूहों को प्रबंधित करने के लिए बनाया है। यह सर्वसम्मति-आधारित नेता चुनाव के लिएपैट्रोनी, PostgreSQL कंटेनर छवि के रूप मेंस्पिलो, निरंतर संग्रह और पॉइंट-इन-टाइम पुनर्प्राप्ति के लिएWAL-Gऔर कनेक्शन पूलिंग के लिएPgBouncerका लाभ उठाता है। साथ में, ये घटक पूरी तरह से स्वचालित, स्व-उपचार PostgreSQL परिनियोजन प्रदान करते हैं जो किसी भी Kubernetes वितरण पर काम करता है - AWS EKS, Azure AKS और Google GKE जैसी प्रबंधित क्लाउड सेवाओं से लेकर Rancher के साथ k3s चलाने वाले बेयर-मेटल क्लस्टर तक।
इस व्यापक गाइड में, हम ज़ालैंडो Postgres ऑपरेटर की वास्तुकला का पता लगाएंगे, कई Kubernetes प्लेटफार्मों पर इंस्टॉलेशन और कॉन्फ़िगरेशन के माध्यम से चलेंगे, प्रतिकृति, बैकअप, आपदा पुनर्प्राप्ति, निगरानी और उत्पादन ट्यूनिंग में गहराई से उतरेंगे। अंत तक, आपको किसी भी Kubernetes बुनियादी ढांचे पर उत्पादन-ग्रेड PostgreSQL HA क्लस्टर को तैनात और संचालित करने का ज्ञान होगा।
ज़ालैंडो Postgres ऑपरेटर आर्किटेक्चर
तैनात करने से पहले आर्किटेक्चर को समझना आवश्यक है। ज़ालैंडो Postgres ऑपरेटर Kubernetes ऑपरेटर पैटर्न का अनुसरण करता है: यहpostgresqlप्रकार की कस्टम संसाधन परिभाषाओं (CRDs) पर नज़र रखता है और वांछित स्थिति को वास्तविक Kubernetes संसाधनों में समेटता है। यहां बताया गया है कि घटक एक साथ कैसे फिट होते हैं:
स्पिलो: PostgreSQL कंटेनर छवि
स्पिलोज़ालैंडो की Docker छवि है जो PostgreSQL को पेट्रोनी, वाल-जी और आवश्यक एक्सटेंशन के साथ बंडल करती है। स्टेटफुलसेट में प्रत्येक पॉड एक स्पिलो कंटेनर चलाता है। स्पिलो हैंडल:
- PostgreSQL सर्वर- स्वयं डेटाबेस इंजन, संस्करण 13 से 16 का समर्थन करता है
- संरक्षक- HA एजेंट जो नेता चुनाव, प्रतिकृति और विफलता का प्रबंधन करता है
- वाल-जी- सतत वाल संग्रह और आधार बैकअप उपकरण
- pg_cron, pg_stat_statements, PostGIS- आमतौर पर आवश्यक एक्सटेंशन पहले से स्थापित
संरक्षक: नेता चुनाव और स्वचालित विफलता
पेट्रोनी HA तंत्र का हृदय है। यह क्लस्टर स्थिति को बनाए रखने और नेता का चुनाव करने के लिए एक वितरित कॉन्फ़िगरेशन स्टोर (डीसीएस) का उपयोग करता है। ज़ालैंडो ऑपरेटर संदर्भ में, पैट्रोनीKubernetes APIको DCS (एंडपॉइंट्स या कॉन्फिगमैप्स के माध्यम से) के रूप में उपयोग करता है, जिससे बाहरी आदि या ज़ूकीपर क्लस्टर की आवश्यकता समाप्त हो जाती है।
यहां बताया गया है कि पेट्रोनी की फेलओवर प्रक्रिया कैसे काम करती है:
- स्वास्थ्य जांच- प्रत्येक पेट्रोनी एजेंट लगातार अपने स्थानीय PostgreSQL उदाहरण की निगरानी करता है और DCS को स्वास्थ्य रिपोर्ट करता है।
- लीडर लॉक- प्राथमिक DCS (एक Kubernetes एंडपॉइंट ऑब्जेक्ट) में एक लीडर लॉक रखता है। लॉक में TTL (डिफ़ॉल्ट 30 सेकंड) है।
- विफलता का पता लगाना- यदि प्राथमिक टीटीएल के भीतर अपने लॉक को नवीनीकृत करने में विफल रहता है, तो प्रतिकृतियां अनुपस्थिति का पता लगाती हैं।
- चुनाव- योग्य प्रतिकृतियां लीडर लॉक के लिए प्रतिस्पर्धा करती हैं। सबसे कम प्रतिकृति अंतराल वाली प्रतिकृति जीतती है।
- प्रमोशन- विजेता प्रतिकृति खुद को प्राइमरी में प्रमोट करती है, DCS को अपडेट करती है, और Kubernetes
masterसर्विस एंडपॉइंट स्वचालित रूप से अपडेट होती है। - बाड़ लगाना- विभाजन-मस्तिष्क को रोकने के लिए पुराने प्राइमरी को बाड़ लगा दिया गया है (रोक दिया गया है या प्रतिकृति में बदल दिया गया है)।
यह पूरी फेलओवर प्रक्रिया आम तौर पर15-30 सेकंडमें पूरी हो जाती है, जिससे आपके एप्लिकेशन के लिए न्यूनतम डाउनटाइम सुनिश्चित होता है।
WAL-G: सतत संग्रह और बैकअप
WAL-G, PostgreSQL के लिए अगली पीढ़ी का अभिलेखीय उपकरण है जो S3, Google क्लाउड स्टोरेज (GCS) और Azure ब्लॉब स्टोरेज के बैकअप का समर्थन करता है। यह प्रदान करता है:
- बेस बैकअप-
pg_basebackupका उपयोग करके पूर्ण भौतिक बैकअप - वाल संग्रह- पॉइंट-इन-टाइम पुनर्प्राप्ति के लिए निरंतर राइट-अहेड लॉग शिपिंग
- डेल्टा बैकअप- वृद्धिशील बैकअप जो केवल परिवर्तित पृष्ठों को संग्रहीत करते हैं
- एन्क्रिप्शन- आराम पर बैकअप का AES-256 एन्क्रिप्शन
- संपीड़न- कम भंडारण लागत के लिए LZ4 या ZSTD संपीड़न
Kubernetes संसाधन पदानुक्रम
जब आपpostgresqlकस्टम संसाधन बनाते हैं, तो ऑपरेटर क्लस्टर को प्रबंधित करने के लिए Kubernetes संसाधनों का एक व्यापक सेट बनाता है। समस्या निवारण और निगरानी के लिए इस पदानुक्रम को समझना महत्वपूर्ण है:
संसाधन ऑपरेटर
द्वारा निर्मित- स्टेटफुलसेट- स्थिर नेटवर्क पहचान और आदेशित तैनाती के साथ PostgreSQL पॉड प्रबंधित करता है
- सेवाएँ- दो क्लस्टरआईपी सेवाएँ: प्राथमिक के लिए
<cluster-name>और पढ़ने योग्य प्रतिकृतियों के लिए<cluster-name>-repl - एंडपॉइंट्स- निर्बाध फेलओवर के लिए वर्तमान लीडर को इंगित करने के लिए पेट्रोनी एंडपॉइंट्स को अपडेट करता है
- पॉडडिसरप्शनबजट (PDB)- यह सुनिश्चित करता है कि स्वैच्छिक व्यवधान के दौरान कम से कम एक उदाहरण उपलब्ध रहे
- रहस्य- PostgreSQL सुपरयूजर, प्रतिकृति, और एप्लिकेशन क्रेडेंशियल्स Kubernetes रहस्य
- PersistentVolumeClaims (PVCs)- PostgreSQL के लिए प्रति पॉड एक PVC डेटा भंडारण
- PgBouncer परिनियोजन- वैकल्पिक कनेक्शन पूलर को अपनी सेवा के साथ एक अलग परिनियोजन के रूप में तैनात किया गया है
इंस्टालेशनआवश्यकताएँ
ज़ालैंडो Postgres ऑपरेटर स्थापित करने से पहले, सुनिश्चित करें कि आपके पास:
- एक चल रहा Kubernetes क्लस्टर (v1.25+)
kubectlको क्लस्टर एडमिन एक्सेस के साथ कॉन्फ़िगर किया गया हैhelmv3 पर स्थापित है- एक डिफ़ॉल्ट स्टोरेजक्लास कॉन्फ़िगर
ऑपरेटर इंस्टालेशन
अनुशंसित इंस्टॉलेशन विधि Helm का उपयोग करती है। यह सभी Kubernetes प्लेटफ़ॉर्म पर लगातार काम करता है:
# Add the Zalando Postgres Operator Helm repository
helm repo add postgres-operator-charts https://opensource.zalando.com/postgres-operator/charts/postgres-operator
helm repo add postgres-operator-ui-charts https://opensource.zalando.com/postgres-operator/charts/postgres-operator-ui
helm repo update
# Create a dedicated namespace
kubectl create namespace postgres-operator
# Install the operator with custom values
helm install postgres-operator postgres-operator-charts/postgres-operator \
--namespace postgres-operator \
--set configKubernetes.enable_pod_antiaffinity=true \
--set configKubernetes.pod_environment_configmap=postgres-pod-config \
--set configAwsOrGcp.aws_region=us-east-1 \
--set configLoadBalancer.db_hosted_zone=db.example.com \
--set configConnectionPooler.connection_pooler_default_cpu_request=500m \
--set configConnectionPooler.connection_pooler_default_memory_request=100Mi
# Optionally install the operator UI for visual management
helm install postgres-operator-ui postgres-operator-ui-charts/postgres-operator-ui \
--namespace postgres-operatorसत्यापित करें कि ऑपरेटर चल रहा है:
kubectl get pods -n postgres-operator
# Expected output:
# NAME READY STATUS RESTARTS AGE
# postgres-operator-7f8b9c6d4-x2k9j 1/1 Running 0 2mAWS EKS परिनियोजन विशिष्टताएँ
Amazon EKS को इष्टतम PostgreSQL प्रदर्शन के लिए विशिष्ट कॉन्फ़िगरेशन की आवश्यकता है:
# EKS-specific Helm values (eks-values.yaml)
configAwsOrGcp:
aws_region: us-east-1
enable_ebs_gp3_migration: true
additional_secret_mount: "aws-iam-token"
configKubernetes:
enable_pod_antiaffinity: true
pod_environment_configmap: "postgres-pod-config"
spilo_privileged: false
storage_resize_mode: pvc
# Use EBS gp3 StorageClass for better performance
# Create the StorageClass first:
---
apiVersion: storage.k8s.io/v1
kind: StorageClass
metadata:
name: ebs-gp3-postgres
provisioner: ebs.csi.aws.com
parameters:
type: gp3
iops: "6000"
throughput: "400"
encrypted: "true"
reclaimPolicy: Retain
volumeBindingMode: WaitForFirstConsumer
allowVolumeExpansion: trueEKS पर WAL-G बैकअप के लिए, सेवा खातों (IRSA) के लिए IAM भूमिकाएँ कॉन्फ़िगर करें:
# Create IAM policy for WAL-G S3 access
{
"Version": "2012-10-17",
"Statement": [
{
"Effect": "Allow",
"Action": [
"s3:PutObject",
"s3:GetObject",
"s3:ListBucket",
"s3:DeleteObject",
"s3:GetBucketLocation"
],
"Resource": [
"arn:aws:s3:::my-pg-backups",
"arn:aws:s3:::my-pg-backups/*"
]
}
]
}Azure AKS परिनियोजन
Azure AKS लगातार भंडारण के लिए Azure डिस्क और बैकअप प्रमाणीकरण के लिए प्रबंधित पहचान का उपयोग करता है:
# AKS-specific StorageClass
apiVersion: storage.k8s.io/v1
kind: StorageClass
metadata:
name: managed-premium-postgres
provisioner: disk.csi.azure.com
parameters:
skuName: Premium_LRS
cachingMode: ReadOnly
reclaimPolicy: Retain
volumeBindingMode: WaitForFirstConsumer
allowVolumeExpansion: true
---
# WAL-G backup to Azure Blob Storage environment variables
apiVersion: v1
kind: ConfigMap
metadata:
name: postgres-pod-config
namespace: default
data:
AZURE_STORAGE_ACCOUNT: "pgbackupsstorage"
AZURE_STORAGE_ACCESS_KEY: "" # Use Managed Identity instead
WALG_AZ_PREFIX: "azure://pg-wal-backups/$(SCOPE)"
USE_WALG_BACKUP: "true"
USE_WALG_RESTORE: "true"
BACKUP_SCHEDULE: "0 2 * * *"
BACKUP_NUM_TO_RETAIN: "7"Google GKE परिनियोजन
Google Kubernetes इंजन GCS बैकअप एक्सेस के लिए पर्सिस्टेंट डिस्क और वर्कलोड आइडेंटिटी का उपयोग करता है:
# GKE StorageClass for SSD Persistent Disks
apiVersion: storage.k8s.io/v1
kind: StorageClass
metadata:
name: ssd-postgres
provisioner: pd.csi.storage.gke.io
parameters:
type: pd-ssd
reclaimPolicy: Retain
volumeBindingMode: WaitForFirstConsumer
allowVolumeExpansion: true
---
# GCS backup configuration
apiVersion: v1
kind: ConfigMap
metadata:
name: postgres-pod-config
namespace: default
data:
WALG_GS_PREFIX: "gs://my-pg-backups/$(SCOPE)"
USE_WALG_BACKUP: "true"
USE_WALG_RESTORE: "true"
GOOGLE_APPLICATION_CREDENTIALS: "/var/secrets/google/key.json"
BACKUP_SCHEDULE: "0 2 * * *"
BACKUP_NUM_TO_RETAIN: "7"बेयर मेटल k3s/रंचर लॉन्गहॉर्न स्टोरेज के साथ
ऑन-प्रिमाइसेस परिनियोजन के लिए, k3s एक हल्का Kubernetes वितरण प्रदान करता है और लॉन्गहॉर्न वितरित ब्लॉक स्टोरेज प्रदान करता है। यह संयोजन आदर्श है जब आपको क्लाउड विक्रेता लॉक-इन के बिना अपने बुनियादी ढांचे पर पूर्ण नियंत्रण की आवश्यकता होती है।
# Install k3s on all nodes
# Master node:
curl -sfL https://get.k3s.io | sh -s - server \
--cluster-init \
--disable traefik \
--write-kubeconfig-mode 644
# Worker nodes:
curl -sfL https://get.k3s.io | sh -s - agent \
--server https://master-ip:6443 \
--token $(cat /var/lib/rancher/k3s/server/node-token)
# Install Longhorn for persistent storage
helm repo add longhorn https://charts.longhorn.io
helm install longhorn longhorn/longhorn \
--namespace longhorn-system \
--create-namespace \
--set defaultSettings.defaultReplicaCount=3 \
--set defaultSettings.defaultDataPath=/mnt/longhorn
# Install MetalLB for LoadBalancer services
kubectl apply -f https://raw.githubusercontent.com/metallb/metallb/v0.14.5/config/manifests/metallb-native.yaml
# Configure MetalLB IP pool
apiVersion: metallb.io/v1beta1
kind: IPAddressPool
metadata:
name: postgres-pool
namespace: metallb-system
spec:
addresses:
- 192.168.1.200-192.168.1.210PostgreSQL क्लस्टर CRD विशिष्टता
तैनात करने का मूल ज़ालैंडो ऑपरेटर के साथ PostgreSQL क्लस्टरpostgresqlकस्टम संसाधन है। यह YAML मेनिफेस्ट आपके क्लस्टर की वांछित स्थिति की घोषणा करता है, और ऑपरेटर इसे वास्तविकता में समेटता है। नीचे एक व्यापक, उत्पादन के लिए तैयार CRD विनिर्देश है:
apiVersion: acid.zalan.do/v1
kind: postgresql
metadata:
name: pg-production-cluster
namespace: databases
labels:
team: platform
environment: production
spec:
teamId: "platform"
volume:
size: 100Gi
storageClass: ebs-gp3-postgres
numberOfInstances: 3
enableConnectionPooler: true
enableReplicaConnectionPooler: true
connectionPooler:
numberOfInstances: 2
mode: transaction
schema: pooler
user: pooler
resources:
requests:
cpu: 500m
memory: 100Mi
limits:
cpu: "1"
memory: 256Mi
users:
app_user:
- superuser
- createdb
readonly_user: []
databases:
app_database: app_user
postgresql:
version: "16"
parameters:
shared_buffers: "2GB"
max_connections: "200"
work_mem: "64MB"
maintenance_work_mem: "512MB"
effective_cache_size: "6GB"
random_page_cost: "1.1"
effective_io_concurrency: "200"
wal_buffers: "64MB"
max_wal_size: "4GB"
min_wal_size: "1GB"
checkpoint_completion_target: "0.9"
default_statistics_target: "100"
log_statement: "ddl"
log_min_duration_statement: "1000"
idle_in_transaction_session_timeout: "600000"
lock_timeout: "30000"
statement_timeout: "60000"
patroni:
initdb:
encoding: "UTF8"
locale: "en_US.UTF-8"
data-checksums: "true"
pg_hba:
- hostssl all all 0.0.0.0/0 md5
- host all all 0.0.0.0/0 md5
ttl: 30
loop_wait: 10
retry_timeout: 10
synchronous_mode: false
synchronous_mode_strict: false
maximum_lag_on_failover: 33554432
resources:
requests:
cpu: "2"
memory: 8Gi
limits:
cpu: "4"
memory: 16Gi
podAnnotations:
prometheus.io/scrape: "true"
prometheus.io/port: "9187"
tolerations:
- key: "database"
operator: "Equal"
value: "postgres"
effect: "NoSchedule"
nodeAffinity:
requiredDuringSchedulingIgnoredDuringExecution:
nodeSelectorTerms:
- matchExpressions:
- key: workload-type
operator: In
values:
- database
enableShmVolume: true
spiloRunAsUser: 101
spiloRunAsGroup: 103
spiloFSGroup: 103कुंजी CRD फ़ील्ड्स की व्याख्या
- numberOfInstances- पॉड्स की कुल संख्या। ऑपरेटर स्वचालित रूप से एक को प्राथमिक और बाकी को स्ट्रीमिंग प्रतिकृतियों के रूप में नामित करता है।
- EnableConnectionPooler- कनेक्शन ओवरहेड को कम करते हुए, प्राथमिक सेवा के लिए PgBouncer साइडकार तैनात करता है।
- इनेबलरेप्लिकाकनेक्शनपूलर- प्रतिकृति सेवा के लिए एक अलग PgBouncer तैनात करता है, जो रीड-हेवी वर्कलोड के लिए आवश्यक है।
- postgresql.parameters- डायरेक्ट PostgreSQL कॉन्फ़िगरेशन पैरामीटर
postgresql.confको पास कर दिए गए। - संरक्षक- टीटीएल, लूप प्रतीक्षा, पुनः प्रयास टाइमआउट और सिंक्रोनस प्रतिकृति मोड सहित संरक्षक व्यवहार को कॉन्फ़िगर करता है।
- वॉल्यूम.स्टोरेजक्लास- प्लेटफ़ॉर्म-विशिष्ट स्टोरेजक्लास के लिए मैप्स (AWS पर EBS gp3, Azure पर प्रीमियम SSD, GCP पर SSD PD, k3s पर लॉन्गहॉर्न)।
- EnableShmVolume- PostgreSQL साझा मेमोरी के लिए
/dev/shmपरtmpfsमाउंट करता है, जो प्रदर्शन के लिए महत्वपूर्ण है।
कनेक्शन पूलिंग
PostgreSQL का प्रक्रिया-प्रति-कनेक्शन मॉडल बड़ी संख्या में क्लाइंट कनेक्शन को संभालना महंगा बनाता है। प्रत्येक कनेक्शन लगभग 10MB RAM की खपत करता है। PgBouncer वास्तविक PostgreSQL कनेक्शन के एक छोटे पूल पर हजारों क्लाइंट कनेक्शनों को मल्टीप्लेक्स करके इसे हल करता है।
ज़ालैंडो ऑपरेटर मूल रूप से PgBouncer परिनियोजन का समर्थन करता है। जब आप CRD मेंenableConnectionPooler: trueसेट करते हैं, तो ऑपरेटर बनाता है:
- कॉन्फ़िगर करने योग्य प्रतिकृति गिनती के साथ एक PgBouncer परिनियोजन
- पूलित कनेक्शन के लिए एक समर्पित सेवा (
<cluster-name>-pooler) - PostgreSQL के साथ स्वचालित क्रेडेंशियल सिंक्रनाइज़ेशन
PgBouncer कॉन्फ़िगरेशन मोड
# PgBouncer connection pooler modes:
#
# transaction (recommended for most workloads)
# - Connection returned to pool after each transaction
# - Best balance of efficiency and compatibility
# - Cannot use session-level features (prepared statements, temp tables)
#
# session
# - Connection held for entire client session
# - Full PostgreSQL compatibility
# - Lower pooling efficiency
#
# statement
# - Connection returned after each statement
# - Most efficient but most restrictive
# - Only works with autocommit queries
# Custom PgBouncer configuration via operator
spec:
connectionPooler:
numberOfInstances: 3
mode: transaction
schema: pooler
user: pooler
defaultPoolSize: 25
maxDBConnections: 100
resources:
requests:
cpu: 250m
memory: 128Mi
limits:
cpu: "1"
memory: 256Miउन अनुप्रयोगों के लिए जिन्हें तैयार विवरण या सत्र-स्तरीय सुविधाओं की आवश्यकता है, PgBouncer को दरकिनार करते हुए सीधे PostgreSQL सेवाओं से कनेक्ट करें, या कम कनेक्शन दक्षता के ट्रेडऑफ़ के साथsessionपूलिंग मोड का उपयोग करें।
बहु-क्षेत्र PostgreSQL प्रतिकृति
वैश्विक अनुप्रयोगों के लिए जिन्हें कई भौगोलिक स्थानों से कम-विलंबता पढ़ने या क्षेत्रों में आपदा पुनर्प्राप्ति की आवश्यकता होती है, बहु-क्षेत्र प्रतिकृति आवश्यक है। ज़ालैंडो ऑपरेटर स्टैंडबाय क्लस्टर के माध्यम से इसका समर्थन करता है जो स्ट्रीमिंग प्रतिकृति या वाल-जी अभिलेखागार के माध्यम से प्राथमिक क्लस्टर से दोहराता है।
स्ट्रीमिंग प्रतिकृति कॉन्फ़िगरेशन
PostgreSQL स्ट्रीमिंग प्रतिकृति ज़ालैंडो ऑपरेटर में HA की नींव है। यह लगभग वास्तविक समय में प्राथमिक से प्रतिकृतियों तक राइट-अहेड लॉग (वाल) रिकॉर्ड भेजकर काम करता है। ऑपरेटर इसे स्वचालित रूप से कॉन्फ़िगर करता है, लेकिन विवरण समझने से ट्यूनिंग और समस्या निवारण में मदद मिलती है।
- सिंक्रोनस प्रतिकृति- प्राथमिक लेनदेन करने से पहले वाल रसीद की पुष्टि करने के लिए कम से कम एक प्रतिकृति की प्रतीक्षा करता है। यह शून्य डेटा हानि (आरपीओ=0) की गारंटी देता है लेकिन विलंबता जोड़ता है।
patroni.synchronous_mode: trueके साथ सक्षम करें। - अतुल्यकालिक प्रतिकृति- प्राथमिक तुरंत प्रतिबद्ध होता है और वाल को अतुल्यकालिक रूप से शिप करता है। थोड़ी कम विलंबता लेकिन विफलता के दौरान संभावित डेटा हानि। यह डिफ़ॉल्ट है.
- कैस्केडिंग प्रतिकृति- प्रतिकृतियां प्राथमिक के बजाय अन्य प्रतिकृतियों से प्रतिकृति कर सकती हैं, जिससे बड़े समूहों में प्राथमिक पर भार कम हो जाता है।
# Enable synchronous replication for zero data loss
spec:
patroni:
synchronous_mode: true
synchronous_mode_strict: false # Allow async if no sync replica available
synchronous_node_count: 1 # Number of sync replicas required
postgresql:
parameters:
synchronous_commit: "on" # Matches Patroni synchronous_mode
max_wal_senders: "10" # Maximum WAL sender processes
wal_keep_size: "1GB" # WAL retention for replica catch-up
hot_standby: "on" # Allow queries on replicas
hot_standby_feedback: "on" # Reduce query conflicts on replicasWAL-Gके साथबैकअप और रिकवरीवाल-जी बैकअप कॉन्फ़िगरेशन
आपदा पुनर्प्राप्ति के लिए उचित बैकअप कॉन्फ़िगरेशन महत्वपूर्ण है। ज़ालैंडो ऑपरेटर ऑब्जेक्ट स्टोरेज के निरंतर बैकअप के लिए वाल-जी को एकीकृत करता है। यहां S3-संगत स्टोरेज के लिए पूर्ण कॉन्फ़िगरेशन है:
# ConfigMap for WAL-G backup configuration
apiVersion: v1
kind: ConfigMap
metadata:
name: postgres-pod-config
namespace: databases
data:
# S3 backup configuration
AWS_ENDPOINT: "https://s3.us-east-1.amazonaws.com"
AWS_S3_FORCE_PATH_STYLE: "false"
AWS_REGION: "us-east-1"
WALG_S3_PREFIX: "s3://my-pg-backups/$(SCOPE)"
WALG_DISABLE_S3_SSE: "false"
WALG_S3_SSE: "aws:kms"
WALG_S3_SSE_KMS_ID: "arn:aws:kms:us-east-1:123456789:key/mrk-abcdef"
# Backup scheduling and retention
USE_WALG_BACKUP: "true"
USE_WALG_RESTORE: "true"
BACKUP_SCHEDULE: "0 1 * * *" # Daily at 1 AM UTC
BACKUP_NUM_TO_RETAIN: "14" # Keep 14 daily backups
# WAL archiving
WALG_COMPRESSION_METHOD: "zstd" # Better compression than lz4
WALG_DELTA_MAX_STEPS: "6" # Delta backups between full backups
WALG_UPLOAD_CONCURRENCY: "4" # Parallel upload streams
WALG_DOWNLOAD_CONCURRENCY: "4" # Parallel download for restore
WALG_UPLOAD_DISK_CONCURRENCY: "4" # Disk read concurrency
# Clone configuration
CLONE_AWS_ENDPOINT: "https://s3.us-east-1.amazonaws.com"
CLONE_AWS_REGION: "us-east-1"
CLONE_WALG_S3_PREFIX: "s3://my-pg-backups/$(CLONE_SCOPE)"
CLONE_METHOD: "CLONE_WITH_WALG"
CLONE_USE_WALG_RESTORE: "true"पॉइंट-इन-टाइम रिकवरी (PITR)
PITR आपको अपने डेटाबेस को किसी भी विशिष्ट समय पर पुनर्स्थापित करने की अनुमति देता है - जो आकस्मिक डेटा विलोपन या भ्रष्टाचार से उबरने के लिए महत्वपूर्ण है। ज़ालैंडो ऑपरेटर क्लोन तंत्र के माध्यम से PITR का समर्थन करता है:
# Clone a cluster with PITR
apiVersion: acid.zalan.do/v1
kind: postgresql
metadata:
name: pg-restored-cluster
namespace: databases
spec:
teamId: "platform"
volume:
size: 100Gi
storageClass: ebs-gp3-postgres
numberOfInstances: 3
postgresql:
version: "16"
clone:
cluster: "pg-production-cluster"
timestamp: "2026-04-11T14:30:00+00:00" # Restore to this exact moment
s3_wal_path: "s3://my-pg-backups/wal/16/pg-production-cluster"
s3_endpoint: "https://s3.us-east-1.amazonaws.com"
s3_access_key_id: "" # Use IAM role instead
s3_secret_access_key: "" # Use IAM role insteadजब यह CRD लागू किया जाता है, तो ऑपरेटर निम्नलिखित चरण निष्पादित करता है:
- लक्ष्य टाइमस्टैम्प से पहले नवीनतम बेस बैकअप ढूंढता है
- नए स्टेटफुलसेट के प्राथमिक पॉड में बेस बैकअप को पुनर्स्थापित करता है
- निर्दिष्ट टाइमस्टैम्प तक वाल सेगमेंट को दोबारा चलाता है
- पढ़ने-लिखने के संचालन के लिए डेटाबेस खोलता है
- प्रतिकृति पॉड्स पर स्ट्रीमिंग प्रतिकृति सेट करता है
स्टैंडबाय क्लस्टर
एक स्टैंडबाय क्लस्टर लगातार प्राथमिक क्लस्टर से प्रतिकृति बनाता है, एक गर्म स्टैंडबाय प्रदान करता है जिसे आपदा के दौरान बढ़ावा दिया जा सकता है। यह क्लस्टर के भीतर प्रतिकृतियों से अलग है - एक स्टैंडबाय क्लस्टर एक पूरी तरह से स्वतंत्र Kubernetes संसाधन है जो एक अलग नेमस्पेस, क्लस्टर या यहां तक कि क्षेत्र में भी चल सकता है।
# Standby cluster in a different region
apiVersion: acid.zalan.do/v1
kind: postgresql
metadata:
name: pg-standby-eu
namespace: databases
spec:
teamId: "platform"
volume:
size: 100Gi
storageClass: managed-premium-postgres
numberOfInstances: 2
postgresql:
version: "16"
standby:
standby_host: "pg-production-cluster.databases.svc.cluster.local"
standby_port: "5432"
# Alternative: replicate from S3 WAL archive
# s3_wal_path: "s3://my-pg-backups/wal/16/pg-production-cluster"
enableConnectionPooler: true
enableReplicaConnectionPooler: trueएक स्टैंडबाय क्लस्टर को एक स्वतंत्र प्राथमिक (आपदा पुनर्प्राप्ति के दौरान) में बढ़ावा देने के लिए, बस CRD सेstandbyअनुभाग हटाएं और लागू करें:
# Edit the standby cluster CRD to remove standby section
kubectl patch postgresql pg-standby-eu -n databases --type json \
-p '[{"op": "remove", "path": "/spec/standby"}]'
# The operator will promote the standby to primary
# Update your application DNS/service mesh to point to the new primaryPrometheus और Grafanaके साथमॉनिटरिंग
उत्पादन PostgreSQL परिनियोजन के लिए व्यापक निगरानी गैर-परक्राम्य है। ज़ालैंडो ऑपरेटरpostgres_exporterसाइडकार के माध्यम से Prometheus मेट्रिक्स निर्यात का समर्थन करता है। संपूर्ण मॉनिटरिंग स्टैक कैसे सेट करें, यहां बताया गया है:
सर्विस मॉनिटर# ServiceMonitor for PostgreSQL metrics
apiVersion: monitoring.coreos.com/v1
kind: ServiceMonitor
metadata:
name: postgres-monitor
namespace: databases
labels:
team: platform
release: prometheus
spec:
selector:
matchLabels:
team: platform
namespaceSelector:
matchNames:
- databases
endpoints:
- port: exporter
interval: 15s
scrapeTimeout: 10s
path: /metrics
relabelings:
- sourceLabels: [__meta_kubernetes_pod_label_spilo_role]
targetLabel: role
- sourceLabels: [__meta_kubernetes_pod_label_cluster_name]
targetLabel: cluster
---
# PodMonitor alternative (scrapes pods directly)
apiVersion: monitoring.coreos.com/v1
kind: PodMonitor
metadata:
name: postgres-pod-monitor
namespace: databases
spec:
selector:
matchLabels:
application: spilo
podMetricsEndpoints:
- port: exporter
interval: 15s
path: /metrics
की निगरानी के लिए मुख्य मेट्रिक्स
# ServiceMonitor for PostgreSQL metrics
apiVersion: monitoring.coreos.com/v1
kind: ServiceMonitor
metadata:
name: postgres-monitor
namespace: databases
labels:
team: platform
release: prometheus
spec:
selector:
matchLabels:
team: platform
namespaceSelector:
matchNames:
- databases
endpoints:
- port: exporter
interval: 15s
scrapeTimeout: 10s
path: /metrics
relabelings:
- sourceLabels: [__meta_kubernetes_pod_label_spilo_role]
targetLabel: role
- sourceLabels: [__meta_kubernetes_pod_label_cluster_name]
targetLabel: cluster
---
# PodMonitor alternative (scrapes pods directly)
apiVersion: monitoring.coreos.com/v1
kind: PodMonitor
metadata:
name: postgres-pod-monitor
namespace: databases
spec:
selector:
matchLabels:
application: spilo
podMetricsEndpoints:
- port: exporter
interval: 15s
path: /metricsये आपके Grafana डैशबोर्ड में ट्रैक करने के लिए सबसे महत्वपूर्ण PostgreSQL मेट्रिक्स हैं:
- pg_stat_replication_lag- बाइट्स और सेकंड में प्रतिकृति अंतराल। यदि अंतराल आपके आरपीओ सीमा से अधिक हो तो अलर्ट करें।
- pg_stat_activity_count- राज्य के अनुसार सक्रिय कनेक्शन। कनेक्शन पूल ख़त्म होने पर अलर्ट.
- pg_stat_database_tup_fetched/लौटाया गया/डाला गया/अपडेट किया गया/हटाया गया- क्वेरी थ्रूपुट मेट्रिक्स।
- pg_stat_bgwriter_buffers_checkpoint/clean/backend— बफर प्रबंधन दक्षता।
- pg_database_size_bytes- क्षमता नियोजन के लिए समय के साथ डेटाबेस आकार में वृद्धि।
- pg_locks_count— लॉक विवाद। अत्यधिक प्रतीक्षा लॉक पर अलर्ट.
- pg_stat_statements_calls/mean_time- अनुकूलन के लिए क्वेरी प्रदर्शन आँकड़े।
- संरक्षक_पोस्टग्रेज_रनिंग— संरक्षक स्वास्थ्य स्थिति (1 = चल रहा है, 0 = नीचे)।
- संरक्षक_मास्टर- कौन सा पॉड वर्तमान प्राथमिक है (1 = मास्टर, 0 = प्रतिकृति)।
- pg_up— मूल PostgreSQL उपलब्धता जांच।
चेतावनी नियम
# PrometheusRule for PostgreSQL alerts
apiVersion: monitoring.coreos.com/v1
kind: PrometheusRule
metadata:
name: postgres-alerts
namespace: databases
spec:
groups:
- name: postgresql.rules
rules:
- alert: PostgreSQLDown
expr: pg_up == 0
for: 1m
labels:
severity: critical
annotations:
summary: "PostgreSQL instance {{ $labels.instance }} is down"
- alert: PostgreSQLReplicationLag
expr: pg_stat_replication_pg_wal_lsn_diff > 100000000
for: 5m
labels:
severity: warning
annotations:
summary: "Replication lag is {{ $value }} bytes on {{ $labels.instance }}"
- alert: PostgreSQLHighConnections
expr: sum(pg_stat_activity_count) by (instance) > 180
for: 5m
labels:
severity: warning
annotations:
summary: "{{ $value }} active connections on {{ $labels.instance }}"
- alert: PostgreSQLDeadlocks
expr: rate(pg_stat_database_deadlocks[5m]) > 0
for: 1m
labels:
severity: warning
annotations:
summary: "Deadlocks detected on {{ $labels.datname }}"
- alert: PatroniFailover
expr: changes(patroni_master[5m]) > 0
labels:
severity: critical
annotations:
summary: "Patroni failover occurred in cluster {{ $labels.cluster }}"प्रोडक्शन ट्यूनिंग गाइड
Kubernetes पर PostgreSQL से अधिकतम प्रदर्शन प्राप्त करने के लिए उचित ट्यूनिंग आवश्यक है। आपकी पॉड संसाधन सीमा और कार्यभार विशेषताओं के आधार पर निम्नलिखित मापदंडों को समायोजित किया जाना चाहिए।
मेमोरी कॉन्फ़िगरेशन
# For a pod with 16GB memory limit:
postgresql:
parameters:
# shared_buffers: 25% of total memory
shared_buffers: "4GB"
# effective_cache_size: 75% of total memory
# (tells planner how much OS cache to expect)
effective_cache_size: "12GB"
# work_mem: shared_buffers / (max_connections * 2)
# Conservative to prevent OOM
work_mem: "10MB"
# maintenance_work_mem: 5-10% of total memory
# Used for VACUUM, CREATE INDEX, ALTER TABLE
maintenance_work_mem: "1GB"
# temp_buffers: memory for temp tables per session
temp_buffers: "32MB"
# huge_pages: try to use huge pages (requires OS config)
huge_pages: "try"वाल और चेकपॉइंट कॉन्फ़िगरेशन
postgresql:
parameters:
# WAL settings
wal_buffers: "64MB" # 1/32 of shared_buffers, max 64MB
wal_compression: "zstd" # Compress WAL (PG 15+)
max_wal_size: "8GB" # Before forced checkpoint
min_wal_size: "2GB" # WAL disk reservation
wal_level: "replica" # Required for replication
# Checkpoint settings
checkpoint_completion_target: "0.9" # Spread I/O over 90% of interval
checkpoint_timeout: "15min" # Max time between checkpointsक्वेरी प्लानर और I/O
postgresql:
parameters:
# Cost parameters for SSD storage
random_page_cost: "1.1" # SSD: close to seq_page_cost
seq_page_cost: "1.0" # Sequential I/O baseline
effective_io_concurrency: "200" # Concurrent I/O for SSD
# Planner behavior
default_statistics_target: "200" # More accurate statistics
from_collapse_limit: 12 # JOIN planning threshold
join_collapse_limit: 12 # JOIN planning threshold
# Parallel queries
max_parallel_workers_per_gather: "4"
max_parallel_workers: "8"
max_parallel_maintenance_workers: "4"
parallel_tuple_cost: "0.01"
parallel_setup_cost: "1000"कनेक्शन और लॉगिंग
postgresql:
parameters:
# Connection limits
max_connections: "200" # Keep low, use PgBouncer
superuser_reserved_connections: "5" # Reserve for admin access
# Logging for troubleshooting
log_statement: "ddl" # Log DDL statements
log_min_duration_statement: "500" # Log queries > 500ms
log_checkpoints: "on" # Log checkpoint activity
log_connections: "off" # Too noisy in production
log_disconnections: "off" # Too noisy in production
log_lock_waits: "on" # Log lock waits
log_temp_files: "0" # Log all temp file usage
log_autovacuum_min_duration: "1000" # Log slow autovacuum
# Statement timeouts
statement_timeout: "60000" # 60 second query timeout
lock_timeout: "30000" # 30 second lock timeout
idle_in_transaction_session_timeout: "600000" # 10 min idle txn timeoutरोलिंग अपडेट और संस्करण अपग्रेड
लघु संस्करण
को अपग्रेड करता है जब आप स्पिलो इमेज टैग को अपडेट करते हैं तोलघु संस्करण अपग्रेड (उदाहरण के लिए, 16.2 से 16.3) ऑपरेटर द्वारा स्वचालित रूप से नियंत्रित किया जाता है। ऑपरेटर एक रोलिंग पुनरारंभ करता है:
# Update the operator configuration to use a new Spilo image
helm upgrade postgres-operator postgres-operator-charts/postgres-operator \
--namespace postgres-operator \
--set configGeneral.docker_image=ghcr.io/zalando/spilo-16:3.1-p1 \
--reuse-values
# The operator will perform rolling updates:
# 1. Restart replicas one at a time
# 2. Failover the primary to a freshly updated replica
# 3. Restart the old primary (now a replica)प्रमुख संस्करण
को अपग्रेड करता हैप्रमुख संस्करण उन्नयन (उदाहरण के लिए, PostgreSQL 15 से 16) के लिए अधिक सावधानीपूर्वक योजना की आवश्यकता होती है। ज़ालैंडो ऑपरेटरpg_upgradeका उपयोग करके इन-प्लेस प्रमुख अपग्रेड का समर्थन करता है:
# Step 1: Update the CRD to the new major version
spec:
postgresql:
version: "16" # Changed from "15"
# Step 2: The operator detects the version change and:
# a) Scales down the StatefulSet to 1 replica
# b) Runs pg_upgrade on the primary pod
# c) Scales back up to the desired numberOfInstances
# d) Replicas are rebuilt from the upgraded primary
# Step 3: Verify the upgrade
kubectl exec -it pg-production-cluster-0 -n databases -- \
su postgres -c "psql -c 'SELECT version()'"
# Step 4: Run ANALYZE to update statistics after upgrade
kubectl exec -it pg-production-cluster-0 -n databases -- \
su postgres -c "psql -c 'ANALYZE VERBOSE'"प्रमुख उन्नयन के लिए महत्वपूर्ण विचार:
- को अपग्रेड करने से पहले हमेशा ताजा बैकअप लें
- पहले क्लोन क्लस्टर पर अपग्रेड का परीक्षण करें
- प्रमुख अपग्रेड के लिए डाउनटाइम की आवश्यकता होती है (आमतौर पर डेटाबेस आकार के आधार पर 5-30 मिनट)
- परिवर्तनों को तोड़ने के लिए PostgreSQL रिलीज़ नोट्स की समीक्षा करें प्रतिकृति के पुनर्निर्माण के बाद प्रतिकृति अंतराल की बारीकी से निगरानी करें
- क्वेरी प्लानर आँकड़ों को पुन: उत्पन्न करने के लिए सभी डेटाबेस पर
ANALYZEचलाएँ
उन्नत परिचालन पैटर्न
लॉजिकल बैकअप
भौतिक WAL-G बैकअप के अलावा, ऑपरेटरpg_dumpका उपयोग करके तार्किक बैकअप का समर्थन करता है। तार्किक बैकअप क्रॉस-वर्जन माइग्रेशन और चयनात्मक तालिका पुनर्स्थापना के लिए उपयोगी हैं:
# Enable logical backups in the operator configuration
helm upgrade postgres-operator postgres-operator-charts/postgres-operator \
--namespace postgres-operator \
--set configLogicalBackup.logical_backup_schedule="0 3 * * *" \
--set configLogicalBackup.logical_backup_s3_bucket="my-pg-logical-backups" \
--set configLogicalBackup.logical_backup_s3_region="us-east-1" \
--set configLogicalBackup.logical_backup_s3_sse="AES256" \
--reuse-values
# The operator creates a CronJob for each cluster that:
# 1. Connects to the primary PostgreSQL instance
# 2. Runs pg_dumpall (or pg_dump per database)
# 3. Compresses and uploads to S3कस्टम पॉड पर्यावरण चर
आप कॉन्फिग मैप का उपयोग करके स्पिलो पॉड्स में पर्यावरण चर इंजेक्ट कर सकते हैं। यह WAL-G, कस्टम स्क्रिप्ट को कॉन्फ़िगर करने या OS-स्तरीय मापदंडों को ट्यून करने के लिए उपयोगी है:
apiVersion: v1
kind: ConfigMap
metadata:
name: postgres-pod-config
namespace: databases
data:
# Custom Spilo configurations
SPILO_CONFIGURATION: |
bootstrap:
dcs:
ttl: 30
loop_wait: 10
retry_timeout: 10
maximum_lag_on_failover: 33554432
postgresql:
use_pg_rewind: true
use_slots: true
parameters:
archive_mode: "on"
archive_timeout: 1800s
# Enable pg_stat_statements
POSTGRESQL_SHARED_PRELOAD_LIBRARIES: "bg_mon,pg_stat_statements,pgextwlist,pg_auth_mon,set_user,timescaledb,pg_cron,pg_stat_kcache"
# Cron jobs inside PostgreSQL
ENABLE_PG_CRON: "true"सुरक्षा के लिएनेटवर्क नीतियां
उत्पादन में, Kubernetes नेटवर्क नीतियों का उपयोग करके PostgreSQL पॉड तक नेटवर्क पहुंच प्रतिबंधित करें:
apiVersion: networking.k8s.io/v1
kind: NetworkPolicy
metadata:
name: postgres-network-policy
namespace: databases
spec:
podSelector:
matchLabels:
application: spilo
policyTypes:
- Ingress
- Egress
ingress:
- from:
- namespaceSelector:
matchLabels:
name: app-namespace
- podSelector:
matchLabels:
app: backend
ports:
- protocol: TCP
port: 5432
- protocol: TCP
port: 8008 # Patroni REST API
- from:
- namespaceSelector:
matchLabels:
name: monitoring
ports:
- protocol: TCP
port: 9187 # Prometheus exporter
egress:
- to:
- ipBlock:
cidr: 0.0.0.0/0
ports:
- protocol: TCP
port: 443 # S3/GCS/Azure for backupsसामान्य समस्याओं का निवारण
स्वचालन के साथ भी, समस्याएँ उत्पन्न होती हैं। ज़ालैंडो ऑपरेटर के साथ PostgreSQL चलाते समय सबसे आम समस्याएं और उनके समाधान यहां दिए गए हैं:
1. पॉड लंबित स्थिति में अटका हुआ
# Check events for the pod
kubectl describe pod pg-production-cluster-0 -n databases
# Common causes:
# - No nodes with matching tolerations/affinity
# - Insufficient CPU or memory on nodes
# - PVC cannot be provisioned (check StorageClass)
# Fix: Check node resources and storage availability
kubectl get nodes -o custom-columns=NAME:.metadata.name,CPU:.status.allocatable.cpu,MEM:.status.allocatable.memory
kubectl get pvc -n databases2. प्रतिकृति अंतराल बढ़ रहा है
# Check replication status on the primary
kubectl exec -it pg-production-cluster-0 -n databases -- \
su postgres -c "psql -c 'SELECT client_addr, state, sent_lsn, write_lsn, flush_lsn, replay_lsn, write_lag, flush_lag, replay_lag FROM pg_stat_replication'"
# Common causes:
# - Replica CPU/IO saturation
# - Network bandwidth limits
# - Long-running queries on replica blocking WAL replay
# - Insufficient wal_keep_size
# Fix: Check replica resources and cancel blocking queries
kubectl exec -it pg-production-cluster-1 -n databases -- \
su postgres -c "psql -c 'SELECT pg_cancel_backend(pid) FROM pg_stat_activity WHERE state = \"active\" AND query_start < now() - interval \"5 minutes\"'"3. फ़ेलओवर
को ट्रिगर नहीं कर रहा है# Check Patroni cluster status
kubectl exec -it pg-production-cluster-0 -n databases -- \
su postgres -c "patronictl list"
# Check Patroni logs
kubectl logs pg-production-cluster-0 -n databases -c postgres | grep -i patroni
# Manual failover (if auto-failover is stuck)
kubectl exec -it pg-production-cluster-0 -n databases -- \
su postgres -c "patronictl failover --candidate pg-production-cluster-1 --force"4. बैकअप विफलताएँ
# Check WAL-G backup status
kubectl exec -it pg-production-cluster-0 -n databases -- \
su postgres -c "envdir /run/etc/wal-e.d/env wal-g backup-list"
# Check backup CronJob logs
kubectl logs -l application=spilo,cluster-name=pg-production-cluster -n databases | grep -i wal-g
# Verify S3/GCS credentials
kubectl exec -it pg-production-cluster-0 -n databases -- \
su postgres -c "envdir /run/etc/wal-e.d/env aws s3 ls s3://my-pg-backups/"सुरक्षा सर्वोत्तम अभ्यास
Kubernetes पर PostgreSQL को सुरक्षित करने के लिए गहन रक्षा दृष्टिकोण की आवश्यकता है:
- TLS एन्क्रिप्शन- सभी क्लाइंट कनेक्शन के लिए SSL सक्षम करें। ऑपरेटर सर्टिफिकेट-मैनेजर का उपयोग करके स्वचालित रूप से प्रमाणपत्रों का प्रावधान कर सकता है।
- गुप्त प्रबंधन- डेटाबेस क्रेडेंशियल्स के लिए Kubernetes सीक्रेट्स (या वॉल्ट जैसे बाहरी गुप्त प्रबंधक) का उपयोग करें। कॉन्फिगमैप्स में कभी भी पासवर्ड स्टोर न करें।
- RBAC- ऑपरेटर सर्विसअकाउंट अनुमतियां सीमित करें। एप्लिकेशन डेटाबेस उपयोगकर्ताओं के लिए न्यूनतम-विशेषाधिकार पहुंच का उपयोग करें।
- नेटवर्क नीतियाँ- पॉड-टू-पॉड संचार को प्रतिबंधित करें जैसा कि पिछले अनुभाग में दिखाया गया है।
- pg_hba.conf- कौन से आईपी और उपयोगकर्ता कनेक्ट कर सकते हैं, इसे प्रतिबंधित करने के लिए होस्ट-आधारित प्रमाणीकरण कॉन्फ़िगर करें।
- ऑडिट लॉगिंग- विनियमित वातावरण में SQL ऑडिट लॉगिंग के लिए
pgauditएक्सटेंशन सक्षम करें। - एन्क्रिप्टेड स्टोरेज- एन्क्रिप्टेड स्टोरेजक्लास (ईबीएस एन्क्रिप्शन, Azure डिस्क एन्क्रिप्शन, आदि) का उपयोग करें।
- पॉड सुरक्षा मानक- प्रतिबंधित सुरक्षा संदर्भों के साथ स्पिलो पॉड्स को गैर-रूट के रूप में चलाएं।
# Security-hardened CRD settings
spec:
spiloRunAsUser: 101
spiloRunAsGroup: 103
spiloFSGroup: 103
enableShmVolume: true
patroni:
pg_hba:
- hostssl all all 0.0.0.0/0 md5
- host replication standby all md5
- hostssl replication standby all md5
postgresql:
parameters:
ssl: "on"
ssl_min_protocol_version: "TLSv1.3"
password_encryption: "scram-sha-256"
additionalVolumes:
- name: postgres-tls
mountPath: /tls
secret:
secretName: pg-tls-cert
defaultMode: 0640क्षमता योजना और आकार
उचित आकार स्थिर प्रदर्शन और लागत दक्षता सुनिश्चित करता है। इन दिशानिर्देशों को शुरुआती बिंदु के रूप में उपयोग करें और अपने कार्यभार निगरानी डेटा के आधार पर समायोजित करें:
| कार्यभार | CPU | मेमोरी | भंडारण | उदाहरण |
|---|---|---|---|---|
| विकास | 500m | 1Gi | 10Gi | 1 |
| लघु उत्पादन | 2 कोर | 8Gi | 50Gi SSD | 3 |
| मध्यम उत्पादन | 4 कोर | 16Gi | 200Gi SSD | 3 |
| बड़ा उत्पादन | 8 कोर | 32Gi | 500Gi SSD | 5 |
| एंटरप्राइज़ / एनालिटिक्स | 16+ कोर | 64Gi+ | 1Ti+ SSD | 5+ |
पूर्ण एंड-टू-एंड परिनियोजन उदाहरण
आइए एक नए Kubernetes क्लस्टर पर स्क्रैच से पूर्ण तैनाती के साथ सब कुछ एक साथ रखें:
# Step 1: Create namespace and configure storage
kubectl create namespace databases
kubectl create namespace postgres-operator
# Step 2: Install the Zalando Postgres Operator
helm repo add postgres-operator-charts \
https://opensource.zalando.com/postgres-operator/charts/postgres-operator
helm repo update
helm install postgres-operator postgres-operator-charts/postgres-operator \
--namespace postgres-operator \
--set configKubernetes.enable_pod_antiaffinity=true \
--set configKubernetes.pod_environment_configmap=databases/postgres-pod-config
# Step 3: Create backup configuration
kubectl apply -f - <<EOF
apiVersion: v1
kind: ConfigMap
metadata:
name: postgres-pod-config
namespace: databases
data:
USE_WALG_BACKUP: "true"
USE_WALG_RESTORE: "true"
WALG_S3_PREFIX: "s3://my-pg-backups/\$(SCOPE)"
BACKUP_SCHEDULE: "0 1 * * *"
BACKUP_NUM_TO_RETAIN: "14"
EOF
# Step 4: Deploy the PostgreSQL cluster
kubectl apply -f - <<EOF
apiVersion: acid.zalan.do/v1
kind: postgresql
metadata:
name: pg-app-cluster
namespace: databases
labels:
team: platform
spec:
teamId: "platform"
volume:
size: 50Gi
numberOfInstances: 3
enableConnectionPooler: true
enableReplicaConnectionPooler: true
users:
app_user:
- superuser
- createdb
databases:
app_db: app_user
postgresql:
version: "16"
parameters:
shared_buffers: "2GB"
work_mem: "64MB"
effective_cache_size: "6GB"
resources:
requests:
cpu: "2"
memory: 8Gi
limits:
cpu: "4"
memory: 16Gi
EOF
# Step 5: Wait for cluster readiness
kubectl wait --for=condition=Running postgresql/pg-app-cluster \
-n databases --timeout=300s
# Step 6: Verify cluster status
kubectl get postgresql -n databases
kubectl get pods -n databases -l cluster-name=pg-app-cluster
kubectl get svc -n databases -l cluster-name=pg-app-cluster
# Step 7: Get connection credentials
export PGPASSWORD=$(kubectl get secret app-user.pg-app-cluster.credentials.postgresql.acid.zalan.do \
-n databases -o jsonpath='{.data.password}' | base64 -d)
# Step 8: Connect and verify
kubectl run pg-client --rm -it --image=postgres:16 -n databases -- \
psql -h pg-app-cluster-pooler -U app_user -d app_db -c "SELECT version();"निष्कर्ष
ज़ालैंडो Postgres ऑपरेटर PostgreSQL को Kubernetes पर एक जटिल परिचालन चुनौती से एक प्रबंधनीय, स्वचालित तैनाती में बदल देता है। सर्वसम्मति-आधारित विफलता के लिए पेट्रोनी, बैटरी-शामिल कंटेनर छवि के लिए स्पिलो, निरंतर बैकअप और पुनर्प्राप्ति के लिए वाल-जी, और कुशल कनेक्शन पूलिंग के लिए पीजीबाउंसर का लाभ उठाकर, आपको एक उत्पादन-ग्रेड डेटाबेस प्लेटफ़ॉर्म मिलता है जो AWS EKS, Azure AKS, Google GKE और बेयर-मेटल k3s क्लस्टर में लगातार काम करता है।
इस गाइड की मुख्य बातें हैं:
- सब कुछ स्वचालित करें- ऑपरेटर को स्टेटफुलसेट प्रबंधन, फेलओवर और बैकअप शेड्यूलिंग को संभालने दें। मैन्युअल हस्तक्षेप अपवाद होना चाहिए.
- आक्रामक तरीके से मॉनिटर करें- पहले दिन से Prometheus और Grafana तैनात करें। प्रतिकृति अंतराल, कनेक्शन गणना और लॉक विवाद आपके प्रारंभिक चेतावनी संकेत हैं।
- आपदा के लिए योजना- WAL-G बैकअप कॉन्फ़िगर करें, नियमित रूप से PITR का परीक्षण करें, और महत्वपूर्ण कार्यभार के लिए एक स्टैंडबाय क्लस्टर बनाए रखें।
- अपने कार्यभार के लिए ट्यून करें— डिफ़ॉल्ट PostgreSQL पैरामीटर रूढ़िवादी हैं। अपने संसाधन आवंटन और क्वेरी पैटर्न के आधार पर शेयर्ड_बफ़र्स, वर्क_मेम और चेकपॉइंट सेटिंग्स समायोजित करें।
- डिफ़ॉल्ट रूप से सुरक्षित- TLS सक्षम करें, SCRAM-SHA-256 प्रमाणीकरण का उपयोग करें, नेटवर्क एक्सेस को प्रतिबंधित करें, और बाकी समय में स्टोरेज को एन्क्रिप्ट करें।
- परीक्षण उन्नयन- उत्पादन में लागू करने से पहले हमेशा अपने क्लस्टर को क्लोन करें और प्रमुख संस्करण उन्नयन का परीक्षण करें।
इस व्यापक आधार के साथ, आप किसी भी Kubernetes प्लेटफ़ॉर्म पर अत्यधिक उपलब्ध PostgreSQL क्लस्टर को तैनात और संचालित करने के लिए अच्छी तरह से सुसज्जित हैं, जो बड़े पैमाने पर विश्वसनीयता, प्रदर्शन और डेटा अखंडता की मांग करने वाले अनुप्रयोगों की सेवा प्रदान करते हैं।