Kubeflow (train / evaluate / register) को Argo CD (GitOps deliver / rollback) से जोड़ने की व्यावहारिक गाइड। पूर्ण architecture, manifests और anti-patterns के लिए पढ़ें लंबा article.
InferenceService, pipeline definition और platform component Git से reconcile होता है। Kubeflow में train और evaluate करें; Git manifest अपडेट कर promote करें; roll back करें git revert। Models को object storage में रखें — Git URIs और config संग्रहीत करता है, weights नहीं।
दोनों tools क्यों?
Kubeflow जवाब देता है: GPUs पर reproducible training और evaluation कैसे चलाएँ? Argo CD जवाब देता है: resulting model को snowflake clusters के बिना production में कैसे पहुँचाएँ? केवल Kubeflow उपयोग अक्सर manual पर समाप्त होता है kubectl apply serving के लिए। केवल Argo CD उपयोग करने से आपके पास first-class ML pipeline और experiment system नहीं रहता। साथ मिलकर वे एक बंद MLOps loop बनाते हैं।
श्रम का विभाजन
| चिंता | टूल | Git में क्या रहता है |
|---|---|---|
| Pipeline DAGs, TrainJobs, experiments | Kubeflow Pipelines / Trainer | Pipeline YAML / component specs |
| Model artifacts एवं lineage | Model Registry + object storage | URI + metadata — weights file नहीं |
| Serving, canaries, rollbacks | KServe + Argo CD | InferenceService overlays |
| Platform install एवं upgrades | Argo CD Applications | Kubeflow स्वयं के लिए Helm/Kustomize |
End-to-end loop (अच्छा कैसा दिखता है)
- Data scientist pipeline बदलाव merge करता है → Argo CD pipeline CRDs sync करता है।
- Kubeflow GPU nodes पर training चलाता है (वैकल्पिक रूप से Kueue से queued)।
- Evaluation gates पास → model URI registered; एक PR prod अपडेट करता है
InferenceServicestorageUri. - Argo CD OutOfSync पहचानता है और rollout करता है (पहले canary traffic)।
- Drift या खराब metrics →
git revertपिछला URI restore करता है; Argo CD reconcile करता है।
पाँच practices जो दर्द बचाती हैं
- अलग repos या folders: platform (Kubeflow install) बनाम apps (pipelines + InferenceServices)।
- Model binaries कभी commit न करें — संदर्भ
s3:///gs:/// PVC URIs। - Sync waves: KFP components से पहले MySQL/MinIO (या managed equivalents)।
- हर step पर resource limits — बिना limits के training jobs cluster को भूखा छोड़ देंगे।
- Promotion = PR, notebook में बटन नहीं। Audit trail मुफ़्त मिलता है।
जब यह stack overkill हो
SME chatbot के लिए Ollama चलाता एक अकेला Mac Studio Kubeflow + Argo CD नहीं चाहता। इस pattern को तब अपनाएँ जब कई models हों, GPU contention हो, compliance जरूरतें हों, या एक से अधिक environments (dev/staging/prod) जो एक जैसे रहने चाहिए।
लंबा संस्करण पढ़ें
The लंबा article 2026 Kubernetes MLOps map (KFP v2, Trainer, KServe, Kueue), Argo CD Application patterns, promotion gates, canary serving, GPU FinOps और rollout checklist कवर करता है। प्रकाशित Workstation.