क्रंची डेटा पीजीओ के साथ PostgreSQL उच्च उपलब्धता: एंटरप्राइज़ Kubernetes परिनियोजन
Kubernetes पर क्रंची डेटा PGO के साथ एंटरप्राइज PostgreSQL HA
Kubernetes पर उत्पादन में PostgreSQL चलाने के लिए लगातार वॉल्यूम के साथ स्टेटफुलसेट से अधिक की आवश्यकता होती है। आपको स्वचालित फेलओवर, निरंतर बैकअप और पॉइंट-इन-टाइम रिकवरी, कनेक्शन पूलिंग, TLS एन्क्रिप्शन, मॉनिटरिंग और क्लाउड प्रदाताओं और बेयर मेटल पर लगातार तैनात करने की क्षमता की आवश्यकता है। क्रंची डेटा पीजीओ (Postgres ऑपरेटर) v5 यह सब एक ही Kubernetes-मूल कस्टम संसाधन -PostgresClusterCRD के माध्यम से वितरित करता है - जो युद्ध-परीक्षणित घटकों द्वारा समर्थित है: सर्वसम्मति-आधारित HA के लिए पेट्रोनी, एंटरप्राइज़ बैकअप के लिए pgBackRest, कनेक्शन पूलिंग के लिए PgBouncer, और Prometheus-संगत अवलोकन के लिए pgMonitor।
यह मार्गदर्शिका पीजीओ-प्रबंधित PostgreSQL क्लस्टर को आरंभिक तैनाती से लेकर AWS EKS, Azure AKS, GCP GKE, और Rancher के साथ बेयर मेटल k3s में उत्पादन-ग्रेड ऑपरेशन तक ले जाने के लिए आवश्यक सभी चीज़ों को कवर करती है। प्रत्येक अनुभाग में ठोस YAML, Helm मान और परिचालन प्रक्रियाएं शामिल हैं जिन्हें आप अपने वातावरण के अनुसार अनुकूलित कर सकते हैं।
क्रंची डेटा PGO v5 आर्किटेक्चर
PGO v5 क्रंची Postgres ऑपरेटर का पूर्ण पुनर्लेखन है। यह पिछले pgcluster/pgreplus/pgpolicy CRDs को एक एकलPostgresClusterसंसाधन से प्रतिस्थापित करता है जो PostgreSQL परिनियोजन के हर पहलू का घोषणात्मक रूप से वर्णन करता है। ऑपरेटर इस संसाधन में परिवर्तनों पर नज़र रखता है और वांछित स्थिति से मेल खाने के लिए अंतर्निहित Kubernetes ऑब्जेक्ट्स - स्टेटफुलसेट्स, सर्विसेज, कॉन्फिगमैप्स, सीक्रेट्स, जॉब्स - का मिलान करता है।
आर्किटेक्चर चार स्तंभों पर बनाया गया है।पेट्रोनीप्रत्येक PostgreSQL पॉड में एक साइडकार के रूप में चलता है और Kubernetes-मूल वितरित सर्वसम्मति का उपयोग करके नेता चुनाव, प्रतिकृति टोपोलॉजी और स्वचालित विफलता का प्रबंधन करता है।pgBackRestपूर्ण, अंतर और वृद्धिशील बैकअप के साथ-साथ ऑब्जेक्ट स्टोरेज (S3, GCS, Azure ब्लॉब) या स्थानीय PVCs में निरंतर वाल संग्रह को संभालता है।PgBouncerहल्का कनेक्शन पूलिंग प्रदान करता है जो PostgreSQL को कनेक्शन तूफानों से बचाता है।pgMonitorआपके मौजूदा अवलोकन स्टैक के साथ एकीकरण के लिए Prometheus निर्यातक साइडकार के माध्यम से PostgreSQL मेट्रिक्स को उजागर करता है।
ऑपरेटर स्वयं स्टेटलेस है - सभी स्थायी स्थिति PostgreSQL क्लस्टर और उसके बैकअप रिपॉजिटरी में रहती है। इसका मतलब है कि आप चल रहे डेटाबेस को प्रभावित किए बिना ऑपरेटर को अपग्रेड या पुनरारंभ कर सकते हैं। ऑपरेटर सुलह लूप निष्क्रिय है: एक हीPostgresClusterविनिर्देश को कई बार लागू करने से Kubernetes ऑब्जेक्ट का एक ही सेट उत्पन्न होता है।
PGO v5
स्थापित कर रहा हैPGO v5 को Helm या प्रत्यक्ष kubectl मैनिफ़ेस्ट के माध्यम से स्थापित किया जा सकता है। उत्पादन के लिए Helm दृष्टिकोण को प्राथमिकता दी जाती है क्योंकि यह GitOps वर्कफ़्लो के साथ स्पष्ट रूप से एकीकृत होता है और संस्करण-नियंत्रित अपग्रेड प्रदान करता है।
# Add the Crunchy Data Helm repository
helm repo add crunchydata https://charts.crunchydata.com
helm repo update
# Install PGO into its own namespace
helm install pgo crunchydata/pgo \
--namespace postgres-operator \
--create-namespace \
--set controllerImages.cluster=registry.crunchydata.com/crunchydata/postgres-operator:ubi8-5.7.2-0 \
--set relatedImages.postgres_16=registry.crunchydata.com/crunchydata/crunchy-postgres:ubi8-16.6-1 \
--set relatedImages.pgbackrest=registry.crunchydata.com/crunchydata/crunchy-pgbackrest:ubi8-2.54.1-0 \
--set relatedImages.pgbouncer=registry.crunchydata.com/crunchydata/crunchy-pgbouncer:ubi8-1.23.1-0 \
--set relatedImages.pgexporter=registry.crunchydata.com/crunchydata/crunchy-postgres-exporter:ubi8-0.16.0-0एयर-गैप्ड वातावरण के लिए, आवश्यक छवियों को अपनी आंतरिक रजिस्ट्री में मिरर करें और तदनुसारrelatedImagesमानों को अपडेट करें। पीजीओ केवल Helm मानों याPostgresClusterविनिर्देश में निर्दिष्ट छवियों को खींचेगा - यह रनटाइम पर बाहरी रजिस्ट्रियों तक कभी नहीं पहुंचता है जब तक कि ऐसा करने के लिए स्पष्ट रूप से कॉन्फ़िगर नहीं किया जाता है।
# Verify the operator is running
kubectl get pods -n postgres-operator
NAME READY STATUS RESTARTS AGE
pgo-controller-manager-7d8f9b6c4-xk2pt 1/1 Running 0 45sPostgresक्लस्टर CRD विशिष्टता
PostgresClusterCRD आपके संपूर्ण PostgreSQL परिनियोजन के लिए एकल घोषणात्मक सतह है। नीचे एक उत्पादन-तैयार विनिर्देश है जो प्रमुख अनुभागों को प्रदर्शित करता है। इस गाइड के अगले भागों में प्रत्येक अनुभाग पर विस्तार से चर्चा की गई है।
apiVersion: postgres-operator.crunchydata.com/v1beta1
kind: PostgresCluster
metadata:
name: production-db
namespace: databases
spec:
postgresVersion: 16
image: registry.crunchydata.com/crunchydata/crunchy-postgres:ubi8-16.6-1
instances:
- name: pgha1
replicas: 3
resources:
requests:
cpu: "2"
memory: 8Gi
limits:
cpu: "4"
memory: 16Gi
dataVolumeClaimSpec:
storageClassName: gp3-csi
accessModes: ["ReadWriteOnce"]
resources:
requests:
storage: 100Gi
walVolumeClaimSpec:
storageClassName: gp3-csi
accessModes: ["ReadWriteOnce"]
resources:
requests:
storage: 20Gi
affinity:
podAntiAffinity:
requiredDuringSchedulingIgnoredDuringExecution:
- topologyKey: kubernetes.io/hostname
labelSelector:
matchLabels:
postgres-operator.crunchydata.com/cluster: production-db
tolerations:
- key: "workload"
operator: "Equal"
value: "database"
effect: "NoSchedule"
backups:
pgbackrest:
image: registry.crunchydata.com/crunchydata/crunchy-pgbackrest:ubi8-2.54.1-0
configuration:
- secret:
name: pgbackrest-s3-creds
global:
repo1-retention-full: "7"
repo1-retention-diff: "14"
repo1-path: /pgbackrest/production-db/repo1
repo1-s3-uri-style: path
repos:
- name: repo1
schedules:
full: "0 2 * * 0" # Sunday 2am
differential: "0 2 * * 1-6" # Mon-Sat 2am
incremental: "0 */4 * * *" # Every 4 hours
s3:
bucket: mycompany-pg-backups
endpoint: s3.eu-west-1.amazonaws.com
region: eu-west-1
proxy:
pgBouncer:
image: registry.crunchydata.com/crunchydata/crunchy-pgbouncer:ubi8-1.23.1-0
replicas: 2
resources:
requests:
cpu: 500m
memory: 256Mi
limits:
cpu: "1"
memory: 512Mi
config:
global:
pool_mode: transaction
max_client_conn: "1000"
default_pool_size: "25"
min_pool_size: "5"
reserve_pool_size: "5"
reserve_pool_timeout: "3"
monitoring:
pgmonitor:
exporter:
image: registry.crunchydata.com/crunchydata/crunchy-postgres-exporter:ubi8-0.16.0-0
resources:
requests:
cpu: 100m
memory: 128Mi
patroni:
dynamicConfiguration:
synchronous_mode: true
postgresql:
parameters:
shared_buffers: 2GB
effective_cache_size: 6GB
work_mem: 32MB
maintenance_work_mem: 512MB
max_connections: 200
wal_buffers: 64MB
checkpoint_completion_target: 0.9
random_page_cost: 1.1
effective_io_concurrency: 200
min_wal_size: 1GB
max_wal_size: 4GB
max_worker_processes: 8
max_parallel_workers_per_gather: 4
max_parallel_workers: 8
log_min_duration_statement: 500
log_checkpoints: "on"
log_connections: "on"
log_disconnections: "on"
log_lock_waits: "on"
users:
- name: appuser
databases: ["appdb"]
options: "NOSUPERUSER"
- name: readonly
databases: ["appdb"]
options: "NOSUPERUSER"
databaseInitSQL:
name: init-sql-configmap
key: init.sqlयह विनिर्देश अलग-अलग डेटा और वाल वॉल्यूम के साथ तीन-आवृत्ति PostgreSQL 16 क्लस्टर बनाता है, पूर्ण/अंतर/वृद्धिशील शेड्यूल पर S3-समर्थित बैकअप, लेनदेन मोड में PgBouncer कनेक्शन पूलिंग, Prometheus मेट्रिक्स निर्यात और पेट्रोनी सिंक्रोनस प्रतिकृति। पॉड एंटी-एफ़िनिटी नियम यह सुनिश्चित करता है कि सभी तीन उदाहरण अलग-अलग Kubernetes नोड्स पर उतरें।
पेट्रोनी-आधारित HA और स्वचालित विफलता
पेट्रोनी प्रत्येक पीजीओ-प्रबंधित PostgreSQL पॉड में एम्बेडेड HA फ्रेमवर्क है। यह Kubernetes API को अपने वितरित कॉन्फ़िगरेशन स्टोर (DCS) के रूप में उपयोग करता है - किसी अलग आदि या ज़ूकीपर क्लस्टर की आवश्यकता नहीं है। पेट्रोनी लगातार PostgreSQL प्राथमिक और प्रतिकृतियों के स्वास्थ्य की निगरानी करता है। जब प्राथमिक अनुत्तरदायी हो जाता है, तो पेट्रोनी एक स्वचालित विफलता शुरू करता है: यह सबसे अद्यतित प्रतिकृति को प्राथमिक में बढ़ावा देता है और नए नेता का अनुसरण करने के लिए शेष प्रतिकृतियों को पुन: कॉन्फ़िगर करता है।
पीजीओ में फेलओवर प्रक्रिया निम्नानुसार काम करती है। प्रत्येक पॉड पर पेट्रोनी Kubernetes (एंडपॉइंट या कॉन्फिगमैप ऑब्जेक्ट के माध्यम से) में एक लीडर लॉक रखता है। वर्तमान प्राथमिक को इस लॉक को एक विन्यास योग्य अंतराल (डिफ़ॉल्ट 10 सेकंड टीटीएल, 3 सेकंड लूप प्रतीक्षा) पर नवीनीकृत करना होगा। यदि प्राथमिक नवीनीकरण करने में विफल रहता है - क्योंकि यह दुर्घटनाग्रस्त हो गया, नोड मर गया, या नेटवर्क ने इसे विभाजित कर दिया - एक प्रतिकृति जो प्राथमिक की वाल स्थिति के सबसे करीब है, लॉक प्राप्त कर लेगी और खुद को बढ़ावा देगी। पूरी प्रक्रिया आम तौर पर 10 से 30 सेकंड में पूरी हो जाती है।
सिंक्रोनस प्रतिकृति मोड, पेट्रोनी कॉन्फ़िगरेशन मेंsynchronous_mode: trueके माध्यम से सक्षम, थोड़ी अधिक लेखन विलंबता की कीमत पर शून्य डेटा हानि (आरपीओ = 0) की गारंटी देता है। सिंक्रोनस मोड में, क्लाइंट को लेनदेन तब तक स्वीकार नहीं किया जाता जब तक कि कम से कम एक प्रतिकृति ने वाल प्राप्त करने की पुष्टि नहीं कर दी हो। यदि कोई सिंक्रोनस प्रतिकृति उपलब्ध नहीं है, तो पैट्रोनी उपलब्धता बनाए रखने के लिए सिंक्रोनस मोड को अस्थायी रूप से अक्षम कर देता है - यदि आप स्थिरता के लिए उपलब्धता का त्याग करना पसंद करते हैं तो आप इसेsynchronous_mode_strict: trueके साथ ओवरराइड कर सकते हैं।
# Check Patroni cluster status
kubectl exec -it production-db-pgha1-0 -n databases -- patronictl list
+----------------------------+-------------------+---------+---------+----+-----------+
| Member | Host | Role | State | TL | Lag in MB |
+----------------------------+-------------------+---------+---------+----+-----------+
| production-db-pgha1-0 | 10.244.0.15 | Leader | running | 3 | |
| production-db-pgha1-1 | 10.244.1.22 | Replica | running | 3 | 0 |
| production-db-pgha1-2 | 10.244.2.18 | Replica | running | 3 | 0 |
+----------------------------+-------------------+---------+---------+----+-----------+
# Manual switchover (planned, zero downtime)
kubectl exec -it production-db-pgha1-0 -n databases -- \
patronictl switchover --master production-db-pgha1-0 --candidate production-db-pgha1-1 --force
# Manual failover (forced, for emergencies)
kubectl exec -it production-db-pgha1-1 -n databases -- \
patronictl failover --candidate production-db-pgha1-1 --forcePGO पैट्रोनी लीडर को ट्रैक करने के लिए Kubernetes सेवाओं को स्वचालित रूप से कॉन्फ़िगर करता है।production-db-primaryसेवा हमेशा उस पॉड को इंगित करती है जिसके पास वर्तमान में लीडर लॉक है, इसलिए इस सेवा के माध्यम से कनेक्ट होने वाले एप्लिकेशन केवल एक संक्षिप्त कनेक्शन रीसेट के साथ निर्बाध विफलता का अनुभव करते हैं।
pgBackRest बैकअप और पुनर्स्थापित करें
pgBackRest पीजीओ में एकीकृत बैकअप इंजन है। यह तीन बैकअप प्रकारों का समर्थन करता है - पूर्ण, विभेदक और वृद्धिशील - साथ ही पॉइंट-इन-टाइम रिकवरी (पीआईटीआर) के लिए निरंतर वाल संग्रह। यह समझना कि ये एक साथ कैसे फिट होते हैं, एक बैकअप रणनीति तैयार करने के लिए आवश्यक है जो भंडारण लागत, बैकअप गति और पुनर्प्राप्ति समय को संतुलित करती है।
एकपूर्ण बैकअपसंपूर्ण PostgreSQL डेटा निर्देशिका की प्रतिलिपि बनाता है और अन्य सभी बैकअप प्रकारों के लिए आधार रेखा है।अंतर बैकअपकेवल उन पृष्ठों की प्रतिलिपि बनाता है जो पिछले पूर्ण बैकअप के बाद बदल गए हैं। एकवृद्धिशील बैकअपकेवल उन पृष्ठों की प्रतिलिपि बनाता है जो किसी भी प्रकार के अंतिम बैकअप के बाद बदल गए हैं। पुनर्स्थापना के दौरान, pgBackRest स्वचालित रूप से आवश्यक बैकअप को एक साथ जोड़ता है - उदाहरण के लिए, वृद्धिशील से पुनर्स्थापित करने के लिए वृद्धिशील प्लस पूर्व अंतर (या पूर्ण) और पूर्ण बैकअप, साथ ही लक्ष्य पुनर्प्राप्ति बिंदु तक पहुंचने के लिए आवश्यक किसी भी वाल सेगमेंट की आवश्यकता होती है।
बैकअप शेड्यूल कॉन्फ़िगरेशन
बैकअप शेड्यूल कोPostgresClusterस्पेक के भीतर pgBackRest कॉन्फ़िगरेशन केreposअनुभाग में परिभाषित किया गया है। एक ठोस उत्पादन कार्यक्रम आमतौर पर साप्ताहिक पूर्ण, दैनिक अंतर और अधिक लगातार वृद्धिशील बैकअप चलाता है।
backups:
pgbackrest:
global:
repo1-retention-full: "4" # Keep 4 full backups
repo1-retention-full-type: count
repo1-retention-diff: "14" # Keep 14 differentials
repos:
- name: repo1
schedules:
full: "0 2 * * 0" # Weekly full: Sunday 2am
differential: "0 2 * * 1-6" # Daily diff: Mon-Sat 2am
incremental: "0 */6 * * *" # Every 6 hours
s3:
bucket: mycompany-pg-backups
endpoint: s3.eu-west-1.amazonaws.com
region: eu-west-1मैनुअल बैकअप और पुनर्स्थापित
# Trigger a manual full backup
kubectl annotate postgrescluster production-db -n databases \
postgres-operator.crunchydata.com/pgbackrest-backup="$(date +%s)" \
--overwrite
# Check backup status
kubectl exec -it production-db-pgha1-0 -n databases -- \
pgbackrest info --stanza=db
# Restore to a specific point in time
# First, update the PostgresCluster spec:
spec:
backups:
pgbackrest:
restore:
enabled: true
repoName: repo1
options:
- --type=time
- --target="2026-04-12 08:30:00+00"
- --target-action=promote
# Apply the restore annotation
kubectl annotate postgrescluster production-db -n databases \
postgres-operator.crunchydata.com/pgbackrest-restore="$(date +%s)" \
--overwritePITR पुनर्स्थापना के दौरान, PGO सभी PostgreSQL उदाहरणों को बंद कर देता है, निकटतम पूर्ण या अंतर बैकअप से पुनर्स्थापित करता है, लक्ष्य समय तक WAL सेगमेंट को फिर से चलाता है, और फिर क्लस्टर शुरू करता है। संपूर्ण ऑपरेशन ऑपरेटर द्वारा व्यवस्थित किया जाता है - व्यक्तिगत पॉड्स पर किसी मैन्युअल हस्तक्षेप की आवश्यकता नहीं होती है।
Pgबाउंसर कनेक्शन पूलिंग
PostgreSQL प्रत्येक क्लाइंट कनेक्शन के लिए एक नई प्रक्रिया बनाता है। पैमाने पर - सैकड़ों या हजारों एप्लिकेशन पॉड जिनमें से प्रत्येक कनेक्शन पूल बनाए रखता है - यह मॉडल टूट जाता है। PgBouncer आपके एप्लिकेशन और PostgreSQL के बीच बैठता है, कम संख्या में सर्वर कनेक्शन पर कई क्लाइंट कनेक्शन को मल्टीप्लेक्स करता है।
PGO अपनी स्वयं की सेवा के साथ PgBouncer को एक अलग परिनियोजन के रूप में तैनात करता है। आपके एप्लिकेशन कोproduction-db-pgbouncerसेवा से कनेक्ट होना चाहिए, न कि सीधे PostgreSQL प्राथमिक सेवा से। PgBouncer तीन पूल मोड का समर्थन करता है:
- सत्र पूलिंग- क्लाइंट कनेक्शन के जीवनकाल के लिए क्लाइंट को एक सर्वर कनेक्शन सौंपा जाता है। सबसे सुरक्षित, लेकिन सबसे कम कुशल.
- लेनदेन पूलिंग- एक सर्वर कनेक्शन केवल लेनदेन की अवधि के लिए सौंपा गया है। वेब वर्कलोड के लिए सबसे कुशल. यह अनुशंसित डिफ़ॉल्ट है.
- स्टेटमेंट पूलिंग- एक सर्वर कनेक्शन एक स्टेटमेंट के लिए असाइन किया गया है। केवल सरल, गैर-लेन-देन वाले कार्यभार के लिए काम करता है।
proxy:
pgBouncer:
replicas: 3
config:
global:
pool_mode: transaction
max_client_conn: "2000"
default_pool_size: "30"
min_pool_size: "10"
reserve_pool_size: "10"
reserve_pool_timeout: "3"
server_idle_timeout: "300"
server_lifetime: "3600"
client_idle_timeout: "600"
tcp_keepalive: "1"
tcp_keepidle: "30"
tcp_keepintvl: "10"
tcp_keepcnt: "3"
affinity:
podAntiAffinity:
preferredDuringSchedulingIgnoredDuringExecution:
- weight: 100
podAffinityTerm:
topologyKey: kubernetes.io/hostname
labelSelector:
matchLabels:
postgres-operator.crunchydata.com/role: pgbouncertcp_keepaliveसेटिंग्स पर ध्यान दें - ये तब महत्वपूर्ण हैं जब PgBouncer क्लाउड लोड बैलेंसर या Kubernetes सेवा के पीछे चलता है। आक्रामक रख-रखाव के बिना, निष्क्रिय कनेक्शन को मध्यवर्ती नेटवर्क घटकों द्वारा चुपचाप हटा दिया जा सकता है, जिससे अगले क्वेरी प्रयास पर एप्लिकेशन त्रुटियां हो सकती हैं।
pgमॉनिटर और Prometheus/Grafana मॉनिटरिंग
PGO का मॉनिटरिंग एकीकरण प्रत्येक PostgreSQL पॉड में एकcrunchy-postgres-exporterसाइडकार तैनात करता है। यह निर्यातक PostgreSQL के आंतरिक सांख्यिकी दृश्यों को स्क्रैप करता है और उन्हें पोर्ट 9187 पर Prometheus मेट्रिक्स के रूप में प्रदर्शित करता है। निर्यातक 150 से अधिक मेट्रिक्स को बॉक्स से बाहर कवर करता है, जिसमें कनेक्शन, प्रतिकृति अंतराल, लेनदेन दर, कैश हिट अनुपात, तालिका और सूचकांक आँकड़े, लॉक विवाद और वाल पीढ़ी दरें शामिल हैं।
# ServiceMonitor for Prometheus Operator auto-discovery
apiVersion: monitoring.coreos.com/v1
kind: ServiceMonitor
metadata:
name: postgres-monitoring
namespace: databases
labels:
release: kube-prometheus-stack
spec:
selector:
matchLabels:
postgres-operator.crunchydata.com/cluster: production-db
postgres-operator.crunchydata.com/crunchy-postgres-exporter: "true"
endpoints:
- port: exporter
interval: 15s
scrapeTimeout: 10sक्रंची डेटा पूर्व-निर्मित Grafana डैशबोर्ड का एक सेट प्रदान करता है जिसे आप सीधे आयात कर सकते हैं। इनमें PostgreSQL अवलोकन, प्रतिकृति स्थिति, pgBackRest बैकअप स्थिति, PgBouncer आँकड़े और पॉड-स्तरीय संसाधन उपयोग शामिल हैं। उन्हें Grafana के डैशबोर्ड प्रावधान के माध्यम से या मैन्युअल रूप से क्रंची डेटा उदाहरण भंडार से आयात करें।
# Install Grafana dashboards as ConfigMaps
kubectl create configmap grafana-pg-overview \
--from-file=pg-overview.json=dashboards/pg-overview.json \
-n monitoring
kubectl label configmap grafana-pg-overview grafana_dashboard=1 -n monitoringPostgreSQLके लिएमहत्वपूर्ण चेतावनी नियमapiVersion: monitoring.coreos.com/v1
kind: PrometheusRule
metadata:
name: postgres-alerts
namespace: databases
labels:
release: kube-prometheus-stack
spec:
groups:
- name: postgresql-health
rules:
- alert: PostgresReplicationLagHigh
expr: ccp_replication_lag_size_bytes > 104857600
for: 5m
labels:
severity: warning
annotations:
summary: "Replica {{ $labels.pod }} lag exceeds 100MB"
- alert: PostgresConnectionsExhausted
expr: ccp_connection_stats_active / ccp_connection_stats_max_connections > 0.85
for: 2m
labels:
severity: critical
annotations:
summary: "PostgreSQL connections above 85% capacity"
- alert: PostgresDeadlockDetected
expr: rate(ccp_stat_database_deadlocks[5m]) > 0
for: 1m
labels:
severity: warning
annotations:
summary: "Deadlocks detected in {{ $labels.datname }}"
- alert: PostgresCacheHitRatioLow
expr: ccp_stat_database_blks_hit / (ccp_stat_database_blks_hit + ccp_stat_database_blks_read) < 0.95
for: 10m
labels:
severity: warning
annotations:
summary: "Cache hit ratio below 95% for {{ $labels.datname }}"
- alert: PgBackRestStaleBackup
expr: time() - ccp_backrest_last_full_backup_time_since_completion_seconds > 604800
for: 1h
labels:
severity: critical
annotations:
summary: "No full backup in the last 7 days"
AWS EKS परिनियोजन
apiVersion: monitoring.coreos.com/v1
kind: PrometheusRule
metadata:
name: postgres-alerts
namespace: databases
labels:
release: kube-prometheus-stack
spec:
groups:
- name: postgresql-health
rules:
- alert: PostgresReplicationLagHigh
expr: ccp_replication_lag_size_bytes > 104857600
for: 5m
labels:
severity: warning
annotations:
summary: "Replica {{ $labels.pod }} lag exceeds 100MB"
- alert: PostgresConnectionsExhausted
expr: ccp_connection_stats_active / ccp_connection_stats_max_connections > 0.85
for: 2m
labels:
severity: critical
annotations:
summary: "PostgreSQL connections above 85% capacity"
- alert: PostgresDeadlockDetected
expr: rate(ccp_stat_database_deadlocks[5m]) > 0
for: 1m
labels:
severity: warning
annotations:
summary: "Deadlocks detected in {{ $labels.datname }}"
- alert: PostgresCacheHitRatioLow
expr: ccp_stat_database_blks_hit / (ccp_stat_database_blks_hit + ccp_stat_database_blks_read) < 0.95
for: 10m
labels:
severity: warning
annotations:
summary: "Cache hit ratio below 95% for {{ $labels.datname }}"
- alert: PgBackRestStaleBackup
expr: time() - ccp_backrest_last_full_backup_time_since_completion_seconds > 604800
for: 1h
labels:
severity: critical
annotations:
summary: "No full backup in the last 7 days"AWS EKS पर PGO को तैनात करने के लिए लगातार वॉल्यूम के लिए EBS CSI ड्राइवर और S3 बैकअप एक्सेस के लिए सर्विस अकाउंट्स (IRSA) के लिए IAM रोल्स को कॉन्फ़िगर करने की आवश्यकता होती है। यह दृष्टिकोण Kubernetes रहस्यों में लंबे समय तक चलने वाले AWS क्रेडेंशियल्स को संग्रहीत करने से बचाता है।
# Install the EBS CSI driver (required for gp3 volumes)
eksctl create addon --name aws-ebs-csi-driver --cluster my-cluster --region eu-west-1 \
--service-account-role-arn arn:aws:iam::111122223333:role/AmazonEKS_EBS_CSI_DriverRole
# Create a gp3 StorageClass
apiVersion: storage.k8s.io/v1
kind: StorageClass
metadata:
name: gp3-csi
provisioner: ebs.csi.aws.com
parameters:
type: gp3
iops: "3000"
throughput: "125"
encrypted: "true"
volumeBindingMode: WaitForFirstConsumer
allowVolumeExpansion: true# IAM policy for pgBackRest S3 access
{
"Version": "2012-10-17",
"Statement": [
{
"Effect": "Allow",
"Action": [
"s3:PutObject",
"s3:GetObject",
"s3:DeleteObject",
"s3:ListBucket"
],
"Resource": [
"arn:aws:s3:::mycompany-pg-backups",
"arn:aws:s3:::mycompany-pg-backups/*"
]
}
]
}
# Create an IRSA-enabled service account
eksctl create iamserviceaccount \
--name pgbackrest-sa \
--namespace databases \
--cluster my-cluster \
--attach-policy-arn arn:aws:iam::111122223333:policy/PGBackRestS3Policy \
--approvePostgresClusterस्पेक में, S3 बकेट और क्षेत्र का संदर्भ लें। पीजीओ पॉड के सेवा खाता क्रेडेंशियल्स (आईआरएसए के माध्यम से) स्वचालित रूप से उपयोग करेगा - किसी स्पष्ट एक्सेस कुंजी की आवश्यकता नहीं है।
backups:
pgbackrest:
repos:
- name: repo1
s3:
bucket: mycompany-pg-backups
endpoint: s3.eu-west-1.amazonaws.com
region: eu-west-1मल्टी-एजेड लचीलेपन के लिए, सुनिश्चित करें कि आपके ईकेएस नोड समूह कम से कम तीन उपलब्धता क्षेत्रों तक फैले हों और उनमें PostgreSQL पॉड्स वितरित करने के लिए पहले दिखाए गए टोपोलॉजी प्रसार बाधाओं का उपयोग करें।
Azure AKS परिनियोजन
Azure AKS लगातार स्टोरेज के लिए प्रबंधित डिस्क और pgBackRest बैकअप के लिए Azure ब्लॉब स्टोरेज का उपयोग करता है। अनुशंसित स्टोरेज क्लास डेटाबेस वर्कलोड के लिए प्रीमियम SSD v2 या प्रीमियम LRS का उपयोग करता है।
# StorageClass for Azure Premium SSD
apiVersion: storage.k8s.io/v1
kind: StorageClass
metadata:
name: azure-premium-ssd
provisioner: disk.csi.azure.com
parameters:
skuName: Premium_LRS
kind: Managed
volumeBindingMode: WaitForFirstConsumer
allowVolumeExpansion: true
---
# pgBackRest with Azure Blob Storage
backups:
pgbackrest:
configuration:
- secret:
name: pgbackrest-azure-creds
global:
repo1-azure-account: mystorageaccount
repo1-retention-full: "7"
repos:
- name: repo1
schedules:
full: "0 2 * * 0"
differential: "0 2 * * 1-6"
azure:
container: pg-backups
---
# Secret with Azure credentials
apiVersion: v1
kind: Secret
metadata:
name: pgbackrest-azure-creds
namespace: databases
stringData:
azure.conf: |
[global]
repo1-azure-key=BASE64_STORAGE_ACCOUNT_KEYवर्कलोड आइडेंटिटी (AWS IRSA के समतुल्य Azure) के लिए, OIDC जारीकर्ता के साथ AKS क्लस्टर को कॉन्फ़िगर करें और pgBackRest सेवा खाते के लिए एक फ़ेडरेटेड पहचान क्रेडेंशियल बनाएं। इससे रहस्यों में भंडारण खाता कुंजियों की आवश्यकता समाप्त हो जाती है।
GCP GKE परिनियोजन
GKE स्टोरेज के लिए पर्सिस्टेंट डिस्क (pd-ssd) और pgBackRest बैकअप के लिए GCS का उपयोग करता है। GKE वर्कलोड आइडेंटिटी सुरक्षित, बिना चाबी प्रमाणीकरण के लिए Kubernetes सेवा खातों को Google क्लाउड सेवा खातों में मैप करता है।
# StorageClass for GKE SSD Persistent Disk
apiVersion: storage.k8s.io/v1
kind: StorageClass
metadata:
name: pd-ssd
provisioner: pd.csi.storage.gke.io
parameters:
type: pd-ssd
volumeBindingMode: WaitForFirstConsumer
allowVolumeExpansion: true
---
# pgBackRest with GCS
backups:
pgbackrest:
configuration:
- secret:
name: pgbackrest-gcs-creds
repos:
- name: repo1
gcs:
bucket: mycompany-pg-backups
---
# GCS service account key secret
apiVersion: v1
kind: Secret
metadata:
name: pgbackrest-gcs-creds
namespace: databases
stringData:
gcs-key.json: |
{
"type": "service_account",
"project_id": "my-project",
...
}# Enable Workload Identity on GKE
gcloud container clusters update my-cluster \
--workload-pool=my-project.svc.id.goog
# Create and bind IAM service account
gcloud iam service-accounts create pgbackrest-gcs \
--display-name="pgBackRest GCS Access"
gcloud projects add-iam-policy-binding my-project \
--member="serviceAccount:pgbackrest-gcs@my-project.iam.gserviceaccount.com" \
--role="roles/storage.objectAdmin"
gcloud iam service-accounts add-iam-policy-binding \
pgbackrest-gcs@my-project.iam.gserviceaccount.com \
--role="roles/iam.workloadIdentityUser" \
--member="serviceAccount:my-project.svc.id.goog[databases/production-db-pgbackrest]"बहु-क्षेत्रीय आपदा पुनर्प्राप्ति
PGO क्रॉस-रीजन आपदा रिकवरी के लिए स्टैंडबाय क्लस्टर का समर्थन करता है। एक स्टैंडबाय क्लस्टर लगातार प्राथमिक क्लस्टर के pgBackRest रिपॉजिटरी से WAL को दोहराता है, एक गर्म प्रतिलिपि बनाए रखता है जिसे क्षेत्रीय विफलता की स्थिति में एक स्वतंत्र प्राथमिक में पदोन्नत किया जा सकता है।
# Standby cluster in Region B
apiVersion: postgres-operator.crunchydata.com/v1beta1
kind: PostgresCluster
metadata:
name: production-db-standby
namespace: databases
spec:
postgresVersion: 16
image: registry.crunchydata.com/crunchydata/crunchy-postgres:ubi8-16.6-1
standby:
enabled: true
repoName: repo1
instances:
- name: pgha1
replicas: 2
dataVolumeClaimSpec:
storageClassName: gp3-csi
accessModes: ["ReadWriteOnce"]
resources:
requests:
storage: 100Gi
backups:
pgbackrest:
image: registry.crunchydata.com/crunchydata/crunchy-pgbackrest:ubi8-2.54.1-0
configuration:
- secret:
name: pgbackrest-s3-creds
repos:
- name: repo1
s3:
bucket: mycompany-pg-backups
endpoint: s3.us-east-1.amazonaws.com
region: us-east-1किसी आपदा के दौरान स्टैंडबाय क्लस्टर को बढ़ावा देने के लिए,standby.enabled: falseको स्पेक में सेट करें और परिवर्तन लागू करें। पीजीओ एक स्वतंत्र प्राथमिक क्लस्टर के लिए स्टैंडबाय को बढ़ावा देता है। यह प्रमोशन अपरिवर्तनीय है - मूल प्राथमिक क्षेत्र के ठीक होने के बाद आपको प्रतिकृति संबंध को नए सिरे से बनाने की आवश्यकता होगी।
बेयर मेटल k3s/रंचर परिनियोजन
रंचर प्रबंधन के साथ नंगे धातु k3s पर पीजीओ चलाने के लिए भंडारण और नेटवर्किंग पर सावधानीपूर्वक ध्यान देने की आवश्यकता होती है, क्योंकि आपके पास क्लाउड-प्रदाता प्रबंधित डिस्क या लोड बैलेंसर नहीं है।
लॉन्गहॉर्न स्टोरेज
लॉन्गहॉर्न Kubernetes के लिए एक हल्का, वितरित ब्लॉक स्टोरेज सिस्टम है जो नंगे धातु वातावरण के लिए आदर्श है। यह स्थायित्व के लिए कई नोड्स में वॉल्यूम को दोहराता है और स्नैपशॉट, बैकअप और वॉल्यूम विस्तार का समर्थन करता है।
# Install Longhorn via Helm
helm repo add longhorn https://charts.longhorn.io
helm repo update
helm install longhorn longhorn/longhorn \
--namespace longhorn-system \
--create-namespace \
--set defaultSettings.defaultReplicaCount=3 \
--set defaultSettings.storageOverProvisioningPercentage=100 \
--set defaultSettings.storageMinimalAvailablePercentage=15
---
# Longhorn StorageClass for PostgreSQL
apiVersion: storage.k8s.io/v1
kind: StorageClass
metadata:
name: longhorn-pg
provisioner: driver.longhorn.io
parameters:
numberOfReplicas: "3"
staleReplicaTimeout: "2880"
fsType: ext4
dataLocality: best-effort
volumeBindingMode: WaitForFirstConsumer
allowVolumeExpansion: true
reclaimPolicy: Retainलोड संतुलन के लिएMetalLB
# Install MetalLB
helm repo add metallb https://metallb.github.io/metallb
helm install metallb metallb/metallb --namespace metallb-system --create-namespace
---
# Configure IP address pool
apiVersion: metallb.io/v1beta1
kind: IPAddressPool
metadata:
name: pg-pool
namespace: metallb-system
spec:
addresses:
- 192.168.1.200-192.168.1.210
---
apiVersion: metallb.io/v1beta1
kind: L2Advertisement
metadata:
name: pg-l2
namespace: metallb-system
spec:
ipAddressPools:
- pg-poolMetalLB कॉन्फ़िगर होने के साथ,LoadBalancerप्रकार की PGO की सेवाएं आपके पूल से आईपी पते प्राप्त करेंगी, जिससे PostgreSQL प्राथमिक और PgBouncer एंडपॉइंट मैन्युअल पोर्ट फ़ॉरवर्डिंग के बिना आपके नेटवर्क से सीधे पहुंच योग्य हो जाएंगे।
pgBackRest# For environments without S3/GCS/Azure Blob, use a PVC-based repo
backups:
pgbackrest:
repos:
- name: repo1
schedules:
full: "0 2 * * 0"
differential: "0 2 * * 1-6"
volume:
volumeClaimSpec:
storageClassName: longhorn-pg
accessModes: ["ReadWriteOnce"]
resources:
requests:
storage: 200Gi
# For environments without S3/GCS/Azure Blob, use a PVC-based repo
backups:
pgbackrest:
repos:
- name: repo1
schedules:
full: "0 2 * * 0"
differential: "0 2 * * 1-6"
volume:
volumeClaimSpec:
storageClassName: longhorn-pg
accessModes: ["ReadWriteOnce"]
resources:
requests:
storage: 200Giएयर-गैप्ड वातावरण के लिए, आप एक द्वितीयक pgBackRest रिपॉजिटरी को भी कॉन्फ़िगर कर सकते हैं जो NFS शेयर या ऑन-प्रिमाइसेस पर चलने वाले MiniIO इंस्टेंस पर बैकअप भेजता है, जो क्लाउड निर्भरता के बिना एक ऑफ-क्लस्टर बैकअप कॉपी प्रदान करता है।
TLS/SSL एन्क्रिप्शन कॉन्फ़िगरेशन
PGO डिफ़ॉल्ट रूप से सभी आंतरिक संचार के लिए स्व-हस्ताक्षरित TLS प्रमाणपत्र उत्पन्न करता है - PostgreSQL उदाहरण, प्रतिकृति, pgBackRest और PgBouncer सभी बिना किसी मैन्युअल प्रमाणपत्र प्रबंधन के एन्क्रिप्टेड चैनलों पर संचार करते हैं। हालाँकि, उत्पादन परिवेश के लिए आप आमतौर पर अपने संगठन के सीए द्वारा हस्ताक्षरित प्रमाणपत्रों का उपयोग करना चाहते हैं।
# Create a TLS secret with your CA-signed certificates
kubectl create secret tls production-db-tls \
--cert=server.crt \
--key=server.key \
-n databases
kubectl create secret generic production-db-ca \
--from-file=ca.crt=ca.crt \
-n databases
---
# Reference in PostgresCluster spec
spec:
customTLSSecret:
name: production-db-tls
customReplicationTLSSecret:
name: production-db-replication-tlsPGO PostgreSQL कोssl = onके साथ कॉन्फ़िगर करता है और उपयुक्तssl_cert_file,ssl_key_fileऔरssl_ca_fileपैरामीटर सेट करता है। PgBouncer को क्लाइंट कनेक्शन के लिए TLS की आवश्यकता और PostgreSQL बैकएंड से कनेक्ट होने पर TLS का उपयोग करने के लिए समान रूप से कॉन्फ़िगर किया गया है।
# Enforce TLS for all client connections via pg_hba.conf
spec:
patroni:
dynamicConfiguration:
postgresql:
pg_hba:
- hostssl all all 0.0.0.0/0 scram-sha-256
- hostssl replication all 0.0.0.0/0 scram-sha-256कस्टम PostgreSQL कॉन्फ़िगरेशन
PGO पैट्रोनी डायनेमिक कॉन्फ़िगरेशन अनुभाग के माध्यम से PostgreSQL कॉन्फ़िगरेशन को उजागर करता है। यह अनुशंसित दृष्टिकोण है क्योंकि पेट्रोनी सुनिश्चित करता है कि सभी इंस्टेंसेस सुसंगत कॉन्फ़िगरेशन बनाए रखें और आवश्यकता पड़ने पर पुनरारंभ को संभालें।
patroni:
dynamicConfiguration:
postgresql:
parameters:
# Memory
shared_buffers: 4GB
effective_cache_size: 12GB
work_mem: 64MB
maintenance_work_mem: 1GB
huge_pages: "try"
# WAL
wal_buffers: 128MB
min_wal_size: 2GB
max_wal_size: 8GB
checkpoint_completion_target: 0.9
wal_compression: lz4
# Query Planning
random_page_cost: 1.1
effective_io_concurrency: 200
default_statistics_target: 200
# Parallelism
max_worker_processes: 16
max_parallel_workers_per_gather: 4
max_parallel_workers: 8
max_parallel_maintenance_workers: 4
# Connections
max_connections: 200
idle_in_transaction_session_timeout: 60000
statement_timeout: 300000
# Logging
log_min_duration_statement: 250
log_checkpoints: "on"
log_connections: "on"
log_disconnections: "on"
log_lock_waits: "on"
log_temp_files: 0
log_autovacuum_min_duration: 0
# Autovacuum Tuning
autovacuum_max_workers: 5
autovacuum_naptime: 30
autovacuum_vacuum_cost_limit: 800
autovacuum_vacuum_scale_factor: 0.02
autovacuum_analyze_scale_factor: 0.01ये पैरामीटर 16 CPU कोर और PostgreSQL को समर्पित 32 जीबी रैम के साथ एक नोड मानते हैं।shared_buffersको उपलब्ध RAM के लगभग 25% पर औरeffective_cache_sizeको लगभग 75% पर समायोजित करें। वाल और चेकपॉइंट सेटिंग्स को राइट-हैवी वर्कलोड के लिए ट्यून किया गया है - रीड-हैवी सिस्टम के लिएmax_wal_sizeको कम करें जहां चेकपॉइंट फ्रीक्वेंसी कम मायने रखती है।
उपयोगकर्ता और डेटाबेस प्रबंधन
PGO,PostgresClusterविशिष्टता केusersअनुभाग के माध्यम से घोषणात्मक रूप से PostgreSQL उपयोगकर्ताओं और डेटाबेस का प्रबंधन करता है। जब आप कोई उपयोगकर्ता जोड़ते हैं, तो PGO PostgreSQL में भूमिका बनाता है, एक यादृच्छिक पासवर्ड बनाता है, और क्रेडेंशियल्स को Kubernetes सीक्रेट में संग्रहीत करता है।
users:
- name: appuser
databases: ["appdb"]
options: "NOSUPERUSER NOCREATEDB NOCREATEROLE"
- name: readonly
databases: ["appdb"]
options: "NOSUPERUSER NOCREATEDB NOCREATEROLE"
- name: migrations
databases: ["appdb"]
options: "NOSUPERUSER CREATEDB"
- name: monitoring
databases: ["postgres"]
options: "NOSUPERUSER LOGIN"
---
# Access credentials from the generated secret
kubectl get secret production-db-pguser-appuser -n databases -o jsonpath='{.data.password}' | base64 -d
# The secret also contains a full connection URI
kubectl get secret production-db-pguser-appuser -n databases -o jsonpath='{.data.uri}' | base64 -d
# postgresql://appuser:PASSWORD@production-db-primary.databases.svc:5432/appdbकेवल पढ़ने के लिए पहुंच प्रदान करने के लिए, क्लस्टर निर्माण पर SQL चलाने के लिएdatabaseInitSQLसुविधा का उपयोग करें जो केवल पढ़ने के लिए भूमिका बनाता है और इसे सभी तालिकाओं पर चयन प्रदान करता है।
# init.sql ConfigMap
apiVersion: v1
kind: ConfigMap
metadata:
name: init-sql-configmap
namespace: databases
data:
init.sql: |
-- Read-only role for reporting users
ALTER DEFAULT PRIVILEGES IN SCHEMA public GRANT SELECT ON TABLES TO readonly;
GRANT CONNECT ON DATABASE appdb TO readonly;
GRANT USAGE ON SCHEMA public TO readonly;
GRANT SELECT ON ALL TABLES IN SCHEMA public TO readonly;
-- Extensions
CREATE EXTENSION IF NOT EXISTS pg_stat_statements;
CREATE EXTENSION IF NOT EXISTS pgcrypto;
CREATE EXTENSION IF NOT EXISTS pg_trgm;रोलिंग अपडेट और प्रमुख संस्करण अपग्रेड
PGO रोलिंग अपडेट के माध्यम से छोटे संस्करण अपग्रेड को संभालता है। जब आपPostgresClusterस्पेक में छवि टैग को एक नए पैच रिलीज में बदलते हैं, तो पीजीओ एक समय में एक उदाहरण को अपडेट करता है, प्रतिकृतियों से शुरू होता है और प्राथमिक के साथ समाप्त होता है (जो डाउनटाइम को कम करने के लिए पेट्रोनी स्विचओवर को ट्रिगर करता है)।
# Minor version upgrade: change the image tag
spec:
image: registry.crunchydata.com/crunchydata/crunchy-postgres:ubi8-16.7-0प्रमुख संस्करण अपग्रेड (उदाहरण के लिए, PostgreSQL 15 से 16) के लिएpg_upgradeकी आवश्यकता होती है, जिसे PGO एक अलगPGUpgradeCRD के माध्यम से व्यवस्थित करता है।
apiVersion: postgres-operator.crunchydata.com/v1beta1
kind: PGUpgrade
metadata:
name: production-db-upgrade
namespace: databases
spec:
postgresClusterName: production-db
fromPostgresVersion: 15
toPostgresVersion: 16
image: registry.crunchydata.com/crunchydata/crunchy-upgrade:ubi8-5.7.2-0अपग्रेड प्रक्रिया मौजूदा क्लस्टर को बंद कर देती है, हार्ड लिंक (डेटा कॉपी करना कम करना) का उपयोग करके इन-प्लेस अपग्रेड करने के लिएpg_upgrade --linkचलाती है, अपग्रेड को सत्यापित करती है, और नए संस्करण पर क्लस्टर शुरू करती है। प्रमुख संस्करण अपग्रेड शुरू करने से पहले हमेशा पूर्ण बैकअप लें और पहले गैर-उत्पादन क्लस्टर पर प्रक्रिया का परीक्षण करें।
# Pre-upgrade checklist
# 1. Take a full backup
kubectl annotate postgrescluster production-db -n databases \
postgres-operator.crunchydata.com/pgbackrest-backup="$(date +%s)" \
--overwrite
# 2. Verify backup completed
kubectl exec -it production-db-pgha1-0 -n databases -- pgbackrest info --stanza=db
# 3. Shutdown the cluster (set replicas to 0 or use PGO shutdown annotation)
kubectl annotate postgrescluster production-db -n databases \
postgres-operator.crunchydata.com/shutdown="$(date +%s)" \
--overwrite
# 4. Apply the PGUpgrade resource
kubectl apply -f pg-upgrade.yaml
# 5. Update the PostgresCluster spec with the new version and image
# 6. Remove the shutdown annotation to start the upgraded clusterउत्पादन ट्यूनिंग अनुशंसाएँ
को उत्पादन में चलाने के लिए प्रारंभिक तैनाती के अलावा कई परिचालन क्षेत्रों पर ध्यान देने की आवश्यकता है।
भंडारण प्रदर्शन
- डेटा और वाल वॉल्यूम को अलग करें: WAL को एक समर्पित PVC पर रखने के लिए हमेशा
walVolumeClaimSpecका उपयोग करें। यह राइट-हैवी वाल गतिविधि को डेटा I/O के साथ प्रतिस्पर्धा करने से रोकता है। - उच्च-IOPS स्टोरेजका उपयोग करें: gp3 (AWS), प्रीमियम SSD v2 (Azure), PD-SSD (GCP), या नंगे धातु पर NVMe-समर्थित लॉन्गहॉर्न। PostgreSQL के यादृच्छिक I/O पैटर्न कम-विलंबता भंडारण की मांग करते हैं।
- वॉल्यूम विस्तार: सुनिश्चित करें कि आपके स्टोरेज क्लास में
allowVolumeExpansion: trueहै। पीजीओ समर्थित भंडारण प्रदाताओं पर बिना किसी व्यवधान के PVCs का विस्तार कर सकता है।
पॉड व्यवधान बजट
PGO स्वचालित रूप से आपके PostgreSQL उदाहरणों के लिए PDB बनाता है, लेकिन सत्यापित करें कि वे आपकी HA आवश्यकताओं के लिए उपयुक्त हैं।
# Check PDBs
kubectl get pdb -n databases
NAME MIN AVAILABLE MAX UNAVAILABLE ALLOWED DISRUPTIONS AGE
production-db-pgha1 1 N/A 2 7dसंसाधन अनुरोध और सीमाएं
- OOM किलों को रोकने और गारंटीकृत QoS क्लास सुनिश्चित करने के लिए डेटाबेस पॉड्स के लिए सीमा के बराबर मेमोरी अनुरोध सेट करें।
- सेट CPU रूढ़िवादी रूप से अनुरोध करता है और वैक्यूम या रखरखाव संचालन के दौरान फटने की अनुमति देने के लिए उच्चतर सीमा निर्धारित करता है।
- pgMonitor मेट्रिक्स के माध्यम से वास्तविक उपयोग की निगरानी करें और त्रैमासिक समायोजित करें।
कनेक्शन प्रबंधन
- हमेशा PgBouncer के माध्यम से कनेक्ट करें, सीधे PostgreSQL से नहीं।
- PostgreSQL में
max_connectionsको उस मान पर सेट करें जो PgBouncer के पूल आकार और सिस्टम कनेक्शन (प्रतिकृति, मॉनिटरिंग, सुपरयूजर) के लिए जिम्मेदार है। - वेब अनुप्रयोगों के लिए लेनदेन पूलिंग मोड का उपयोग करें। सत्र पूलिंग पर तभी स्विच करें जब आपका एप्लिकेशन तैयार कथन या सत्र-स्तरीय स्थिति (उदाहरण के लिए,
SETकमांड, अस्थायी तालिकाएँ) का उपयोग करता है।
बैकअप सत्यापन
- बैकअप से क्लोन क्लस्टर बनाकर और एप्लिकेशन-स्तरीय स्मोक टेस्ट चलाकर नियमित रूप से रिस्टोर का परीक्षण करें।
- यह सुनिश्चित करने के लिए कि बैकअप निर्धारित समय पर पूरा हो रहा है,
PgBackRestStaleBackupअलर्ट की निगरानी करें। - विशिष्ट टाइमस्टैम्प को पुनर्स्थापित करके और डेटा स्थिरता की पुष्टि करके PITR को मान्य करें।
# Clone cluster for backup validation
apiVersion: postgres-operator.crunchydata.com/v1beta1
kind: PostgresCluster
metadata:
name: backup-validation
namespace: databases
spec:
postgresVersion: 16
image: registry.crunchydata.com/crunchydata/crunchy-postgres:ubi8-16.6-1
dataSource:
postgresCluster:
clusterName: production-db
repoName: repo1
options:
- --type=time
- --target="2026-04-12 06:00:00+00"
instances:
- name: pgha1
replicas: 1
dataVolumeClaimSpec:
storageClassName: gp3-csi
accessModes: ["ReadWriteOnce"]
resources:
requests:
storage: 100Gi
backups:
pgbackrest:
repos:
- name: repo1
volume:
volumeClaimSpec:
accessModes: ["ReadWriteOnce"]
resources:
requests:
storage: 50Giनेटवर्क नीतियाँ
# Restrict PostgreSQL traffic to known namespaces
apiVersion: networking.k8s.io/v1
kind: NetworkPolicy
metadata:
name: postgres-network-policy
namespace: databases
spec:
podSelector:
matchLabels:
postgres-operator.crunchydata.com/cluster: production-db
policyTypes:
- Ingress
ingress:
- from:
- namespaceSelector:
matchLabels:
app-access: database
- podSelector:
matchLabels:
postgres-operator.crunchydata.com/cluster: production-db
ports:
- port: 5432
protocol: TCP
- port: 9187
protocol: TCPमॉनिटरिंग चेकलिस्ट
- प्रतिकृति अंतराल: जब कोई प्रतिकृति 100 एमबी या 60 सेकंड के अंतराल से अधिक हो तो अलर्ट।
- कनेक्शन संतृप्ति: सक्रिय कनेक्शन
max_connectionsके 80% से अधिक होने पर अलर्ट। - लेनदेन दर विसंगतियां: अपने टीपीएस को बेसलाइन करें और महत्वपूर्ण विचलन पर अलर्ट करें।
- डिस्क उपयोग: वॉल्यूम विस्तार रनबुक के साथ 70% और 85% सीमा पर अलर्ट।
- बैकअप ताजगी: जब अंतिम पूर्ण बैकअप आपकी RPO विंडो से पुराना हो तो अलर्ट करें।
- लॉक विवाद: लंबे समय तक रखे गए लॉक पर अलर्ट (> 30 सेकंड) जो एप्लिकेशन बग का संकेत दे सकता है।
- ऑटोवैक्यूम स्वास्थ्य: जब टेबल को 24 घंटे से अधिक समय से वैक्यूम नहीं किया गया हो तो अलर्ट करें।
डिजास्टर रिकवरी रनबुक
एक आपदा पुनर्प्राप्ति योजना केवल तभी उपयोगी होती है जब इसका परीक्षण किया गया हो। निम्नलिखित रनबुक सामान्य विफलता परिदृश्यों से उबरने के लिए प्रमुख प्रक्रियाओं की रूपरेखा तैयार करती है।
सिंगल पॉड विफलता
Patroni और Kubernetes इसे स्वचालित रूप से संभालते हैं। यदि प्राथमिक पॉड क्रैश हो जाता है, तो पेट्रोनी 10-30 सेकंड के भीतर एक प्रतिकृति को बढ़ावा देता है। Kubernetes विफल पॉड को पुनः प्रारंभ करता है, जो एक प्रतिकृति के रूप में पुनः जुड़ जाता है।
एकल नोड विफलता
यदि PostgreSQL पॉड चलाने वाला नोड मर जाता है, तो Kubernetes पॉड को एक स्वस्थ नोड पर पुनर्निर्धारित करता है। पॉड अपने मौजूदा PVC से जुड़ जाता है (यदि स्टोरेज नेटवर्क से जुड़ा हुआ है) या बैकअप से पुनर्स्थापित करता है (यदि स्थानीय स्टोरेज का उपयोग किया गया था)। पॉड एंटी-एफ़िनिटी नियम यह सुनिश्चित करते हैं कि शेष उदाहरण ट्रैफ़िक प्रदान करना जारी रखें।
पूर्ण क्लस्टर हानि
यदि संपूर्ण Kubernetes क्लस्टर खो गया है, तो एक नया क्लस्टर तैनात करें, PGO स्थापित करें, और बैकअप रिपॉजिटरी की ओर इशारा करते हुएdataSourceके साथ एक नयाPostgresClusterबनाएं। पीजीओ नवीनतम बैकअप को पुनर्स्थापित करता है और वाल को नवीनतम उपलब्ध बिंदु पर पुनः चलाता है।
क्षेत्रीय विफलता
यदि प्राथमिक क्षेत्र खो गया है, तोstandby.enabled: falseसेट करके स्टैंडबाय क्लस्टर को बढ़ावा दें। नए प्राथमिक क्षेत्र को इंगित करने के लिए अपने DNS या लोड बैलेंसर को अपडेट करें। एक बार जब मूल क्षेत्र ठीक हो जाता है, तो आप रिवर्स में स्टैंडबाय संबंध का पुनर्निर्माण कर सकते हैं।
# Promote standby cluster
kubectl patch postgrescluster production-db-standby -n databases --type merge \
-p '{"spec":{"standby":{"enabled":false}}}'
# Verify the cluster is now an independent primary
kubectl exec -it production-db-standby-pgha1-0 -n databases -- patronictl listऑपरेशनल कमांड त्वरित संदर्भ
# Cluster status
kubectl get postgrescluster -n databases
kubectl describe postgrescluster production-db -n databases
# Patroni status
kubectl exec -it production-db-pgha1-0 -n databases -- patronictl list
kubectl exec -it production-db-pgha1-0 -n databases -- patronictl history
# Connect to PostgreSQL
kubectl exec -it production-db-pgha1-0 -n databases -- psql -U postgres
# Backup info
kubectl exec -it production-db-pgha1-0 -n databases -- pgbackrest info --stanza=db
# Manual backup
kubectl annotate postgrescluster production-db -n databases \
postgres-operator.crunchydata.com/pgbackrest-backup="$(date +%s)" --overwrite
# Restart PostgreSQL (rolling)
kubectl annotate postgrescluster production-db -n databases \
postgres-operator.crunchydata.com/restart="$(date +%s)" --overwrite
# Logs
kubectl logs production-db-pgha1-0 -n databases -c database
kubectl logs production-db-pgha1-0 -n databases -c pgbackrest
kubectl logs production-db-pgha1-0 -n databases -c exporter
# PgBouncer status
kubectl exec -it $(kubectl get pod -l postgres-operator.crunchydata.com/role=pgbouncer -n databases -o name | head -1) -n databases -- psql -U pgbouncer pgbouncer -c "SHOW POOLS;"
# Scale replicas
kubectl patch postgrescluster production-db -n databases --type merge \
-p '{"spec":{"instances":[{"name":"pgha1","replicas":5}]}}'निष्कर्ष
क्रंची डेटा पीजीओ PostgreSQL को Kubernetes पर एक परिचालन बोझ से एक प्रबंधनीय, घोषणात्मक प्रणाली में बदल देता है।PostgresClusterCRD संपूर्ण परिनियोजन - उदाहरण, प्रतिकृति, बैकअप, पूलिंग, मॉनिटरिंग, TLS - को एक एकल संस्करण-नियंत्रित संसाधन में कैप्चर करता है। पेट्रोनी युद्ध-परीक्षित स्वचालित विफलता प्रदान करता है। pgBackRest किसी भी क्लाउड ऑब्जेक्ट स्टोर पर पॉइंट-इन-टाइम रिकवरी के साथ एंटरप्राइज़-ग्रेड बैकअप प्रदान करता है। PgBouncer उस कनेक्शन पूलिंग को संभालता है जो PostgreSQL का प्रक्रिया-प्रति-कनेक्शन मॉडल बड़े पैमाने पर मांग करता है। और pgMonitor परिचालन दृश्यता के लिए आपके लिए आवश्यक मेट्रिक्स को Prometheus और Grafana में फीड करता है।
AWS EKS, Azure AKS, GCP GKE, और बेयर मेटल k3s में परिनियोजन पैटर्न समान कोरPostgresClusterस्पेक साझा करते हैं - स्टोरेज क्लास, बैकअप रिपॉजिटरी कॉन्फ़िगरेशन और नेटवर्किंग लेयर में क्या परिवर्तन होता है। यह स्थिरता ऑपरेटर-आधारित दृष्टिकोण का वास्तविक मूल्य है: आपकी टीम एक उपकरण, एक परिचालन मॉडल और रनबुक का एक सेट सीखती है जो हर जगह काम करती है।
तीन-इंस्टेंस क्लस्टर, लेनदेन पूलिंग मोड में PgBouncer, एक साप्ताहिक पूर्ण प्लस दैनिक अंतर बैकअप शेड्यूल और कोर Prometheus अलर्ट के साथ शुरू करें। अपनी बैकअप पुनर्स्थापना प्रक्रिया को पहले ही दिन सत्यापित करें - तब नहीं जब आपको पहली बार इसकी आवश्यकता हो। जैसे-जैसे आपकी उपलब्धता आवश्यकताएं और परिचालन परिपक्वता बढ़ती है, बहु-क्षेत्रीय स्टैंडबाय क्लस्टर, सिंक्रोनस प्रतिकृति और उन्नत ट्यूनिंग का विस्तार करें। ऑपरेटर यांत्रिकी को संभालता है; आपकी ज़िम्मेदारी अपने कार्यभार के लिए सही समझौता करने के लिए वास्तुकला को अच्छी तरह से समझने की है।