MLA-C01 परीक्षा द्वारा परखे जाने वाले architectural patterns का स्कैन-योग्य संदर्भ। ऊपर से नीचे पढ़ें या किसी section पर जाएं।
ML के लिए डेटा तैयार करना
एक विज़ुअल डेटा-प्रेप टूल चुनें।
ML-केंद्रित, SageMaker Studio + फ्लो के साथ एकीकृत → प्रोसेसिंग जॉब → पाइपलाइन → नोटबुक एक्सपोर्ट → SageMaker Data Wrangler। पुनः प्रयोज्य रेसिपी, प्रोफाइलिंग, SageMaker निर्भरता के बिना सामान्य डेटा सफाई → AWS Glue DataBrew। कस्टम कोड के साथ 50 TB+ Spark → Amazon EMR।
क्यों: Data Wrangler SageMaker-नेटिव विकल्प है (300+ ट्रांसफॉर्म, डेटटाइम एक्सट्रैक्शन, पाइपलाइन/प्रोसेसिंग में एक्सपोर्ट)। DataBrew रेसिपी-आधारित और स्रोत-अज्ञेयवादी है। EMR स्केल और आर्बिटरेरी Spark को हैंडल करता है।
मौजूदा PySpark कोड के साथ 50 TB की फीचर इंजीनियरिंग, 4 घंटे में पूरी होनी चाहिए।
Spark के साथ Amazon EMR। ट्यूनेबल क्लस्टर साइज, Spot सपोर्ट, मौजूदा कोड को अपरिवर्तित चलाता है।
क्यों: Glue ETL भी Spark चलाता है, लेकिन EMR क्लस्टर के आकार पर अधिक नियंत्रण देता है; SageMaker Processing छोटे पैमाने के सिंगल-कंटेनर जॉब्स के लिए है।
100,000 छवियों को लागत-कुशलता से लेबल करें - मानव + स्वचालित लेबलिंग चाहते हैं।
स्वचालित डेटा लेबलिंग सक्षम के साथ Amazon SageMaker Ground Truth। प्रारंभिक मानव-लेबल वाले सबसेट के बाद, Ground Truth एक मॉडल को प्रशिक्षित करता है और उच्च-विश्वास वाले सैंपलों को स्वतः-लेबल करता है।
क्यों: एक्टिव लर्निंग आमतौर पर लेबलिंग लागत को 70% तक कम कर देता है। A2I मॉडल की भविष्यवाणियों की मानव समीक्षा के लिए है, न कि बल्क लेबलिंग के लिए।
कई एनोटेटर असहमत हैं; लेबल के एक नमूने को सत्यापित करने के लिए एक वरिष्ठ समीक्षक की आवश्यकता है।
Ground Truth लेबल सत्यापन (ऑडिट) वर्कफ़्लो। लेबल का एक सबसेट एक समीक्षा कार्यबल को भेजा जाता है जो अनुमोदित करता है, अस्वीकृत करता है या समायोजित करता है। मल्टी-वर्कर बहुमत वोटिंग के लिए एनोटेशन समेकन के साथ मिलाएं।
प्रशिक्षण (बैच) और अनुमान (10ms से कम) पर समान इंजीनियर फीचर्स की आवश्यकता है।
Amazon SageMaker Feature Store जिसमें फीचर ग्रुप पर ऑनलाइन + ऑफलाइन दोनों स्टोर सक्षम हैं। ऑनलाइन स्टोर रियल-टाइम GetRecord को बैक करता है; ऑफलाइन स्टोर (S3 में Parquet) प्रशिक्षण को बैक करता है।
क्यों: कस्टम DynamoDB ↔ S3 सिंक के बिना ट्रेन/सर्व स्क्यू को समाप्त करता है।
भविष्य के फीचर मूल्यों को लीक किए बिना प्रशिक्षण के लिए दो फीचर ग्रुप्स को जोड़ें।
इवेंट-टाइम कॉलम का उपयोग करके ऑफलाइन स्टोर के खिलाफ पॉइंट-इन-टाइम जॉइन। प्रत्येक प्रशिक्षण पंक्ति केवल उन्हीं फीचर मूल्यों को देखती है जो उसके इवेंट टाइमस्टैम्प पर मौजूद थे।
क्यों: नवीनतम मानों पर प्लेन JOIN पोस्ट-इवेंट फीचर ड्रिफ्ट को मॉडल तक पहुंचाकर डेटा लीकेज का कारण बनता है।
500 GB डेटासेट के लिए SageMaker प्रशिक्षण डेटा इनपुट मोड चुनें।
फाइल मोड → पूरा डेटासेट पहले डाउनलोड होता है (धीमी शुरुआत, EBS लागत)। पाइप मोड → S3 से स्ट्रीम होता है, कम स्टार्टअप, कम स्टोरेज। FastFile मोड → लेजी फाइल-लेवल स्ट्रीमिंग। डाउनलोड से बचने के लिए बड़े डेटासेट के लिए पाइप (या FastFile) का उपयोग करें।
अक्सर कॉलम-सबसेट रीड्स + पार्टिशन फिल्टर के साथ S3 पर ML डेटा लेक के लिए एक स्टोरेज फॉर्मेट और लेआउट चुनें।
Parquet (कॉलमनार, कंप्रेस्ड) को सबसे अधिक फ़िल्टर किए गए कॉलम (उदाहरण के लिए, तिथि या क्षेत्र) द्वारा पार्टिशन किया गया। Athena और SageMaker में कॉलम प्रूनिंग + पार्टिशन प्रूनिंग को चलाता है।
श्रेणीबद्ध विशेषताओं को एन्कोड करें। कुछ क्रमित हैं (Basic/Standard/Premium), कुछ नहीं हैं (US राज्य)।
क्रमित → ऑर्डिनल एन्कोडिंग (रैंक को संरक्षित करता है)। अक्रमित → वन-हॉट एन्कोडिंग (नकली क्रमबद्धता से बचता है)। अक्रमित विशेषताओं पर लेबल एन्कोडिंग से बचें। टारगेट एन्कोडिंग को लीकेज से बचने के लिए सावधान CV की आवश्यकता होती है।
न्यूमेरिकल कॉलम में गुम मान हैं जो किसी अन्य विशेषता से सहसंबद्ध हैं (उदाहरण के लिए, आय की कमी रोजगार के प्रकार पर निर्भर करती है)।
समूह-आधारित मीडियन इम्पुटेशन (प्रति रोजगार प्रकार मीडियन)। संबंध को संरक्षित करता है; माध्य आउटलायर्स के प्रति संवेदनशील होता है; ड्रॉप करने से डेटा खो जाता है; शून्य पूर्वाग्रह जोड़ता है।
0.3% पॉजिटिव क्लास के साथ बाइनरी क्लासिफिकेशन।
केवल प्रशिक्षण फोल्ड पर SMOTE ओवरसैंपलिंग (स्प्लिट के बाद)। PR-curve / F1 मूल्यांकन के साथ मिलाएं, सटीकता के साथ नहीं।
क्यों: लीकेज से बचने के लिए स्प्लिटिंग के बाद ओवरसैंपलिंग लागू करें। असंतुलित डेटा पर सटीकता भ्रामक होती है।
राइट-स्क्यूड न्यूमेरिक फीचर (उदाहरण के लिए, आय) लीनियर-मॉडल प्रदर्शन को नुकसान पहुंचाता है।
लॉग ट्रांसफॉर्म। राइट टेल को संपीड़ित करता है और अधिक सममित वितरण पैदा करता है। स्टैंडर्डाइजेशन/मिन-मैक्स स्केल को बदलते हैं, आकार को नहीं।
50 अत्यधिक सहसंबद्ध विशेषताएं; विचरण को संरक्षित करते हुए कम आयाम चाहते हैं।
PCA। सहसंबद्ध विशेषताओं को विचरण द्वारा रैंक किए गए असंबद्ध मुख्य घटकों में बदलता है।
एक ट्रेन/वैल/टेस्ट स्प्लिट चुनें।
असंतुलित क्लासिफिकेशन → स्ट्रेटिफाइड स्प्लिट (क्लास अनुपात को संरक्षित करता है)। टाइम-सीरीज → कालानुक्रमिक स्प्लिट (प्रारंभिक अवधि पर प्रशिक्षित करें, नवीनतम पर परीक्षण करें); कभी भी रैंडम-शफल न करें। IID टैबुलर → रैंडम।
ML मॉडल विकास
एक SageMaker बिल्ट-इन एल्गोरिथम चुनें।
टैबुलर क्लासिफिकेशन/रिग्रेशन → XGBoost या Linear Learner। बड़े पैमाने पर मल्टी-क्लास टेक्स्ट क्लासिफिकेशन → BlazingText (पर्यवेक्षित)। संबंधित सीरीज और मौसमीता के साथ टाइम-सीरीज → DeepAR। न्यूमेरिक पर अनपर्यवेक्षित विसंगति का पता लगाना → Random Cut Forest। टॉपिक मॉडलिंग → Neural Topic Model। अनुवाद / Seq2Seq → Sequence-to-Sequence। पिक्सेल-लेवल क्लासेस → Semantic Segmentation। युग्मित-एंटिटी एम्बेडिंग (उपयोगकर्ता/आइटम) → Object2Vec।
बिल्ट-इन में कस्टम प्रशिक्षण फ्रेमवर्क / प्रोप्रायटरी टोकेनाइज़र नहीं है।
BYOC (ब्रिंग योर ओन कंटेनर): कोड और निर्भरताओं के साथ Docker इमेज, Amazon ECR पर पुश करें, SageMaker प्रशिक्षण में संदर्भ दें। अनुकूलन को छोड़े बिना प्रबंधित इंफ्रा (Spot, वितरित, जीवनचक्र) रखता है।
चिकित्सा वर्गीकरण के लिए छोटा इमेज डेटासेट (~2,000)।
ImageNet (उदाहरण के लिए ResNet) पर प्री-प्रशिक्षित मॉडल से ट्रांसफर लर्निंग। अंतिम परतों को फाइन-ट्यून करें। SageMaker Image Classification इसे सीधे सपोर्ट करता है।
क्यों: छोटे डेटा पर खरोंच से प्रशिक्षण से ओवरफिटिंग होती है। प्री-प्रशिक्षित विशेषताएं (किनारे, बनावट) चिकित्सा इमेजरी में साफ-सुथरा स्थानांतरित होती हैं।
कस्टम प्रशिक्षण कोड लिखे बिना एक प्री-प्रशिक्षित फाउंडेशन मॉडल को तेजी से फाइन-ट्यून करें।
SageMaker JumpStart फाइन-ट्यूनिंग API: मॉडल ID चुनें, अपेक्षित प्रारूप में डेटासेट प्रदान करें (आमतौर पर JSONL), एक फाइन-ट्यूनिंग जॉब लॉन्च करें, JumpStart से एक एंडपॉइंट पर डिप्लॉय करें।
एक LLM को एक डोमेन के अनुकूल बनाएं। बहुत अधिक स्थिर ज्ञान → RAG बनाम फाइन-ट्यूनिंग बनाम केवल प्रॉम्प्ट चुनें।
बार-बार बदलने वाला डोमेन ज्ञान → Bedrock Knowledge Bases के माध्यम से RAG। ब्रांड वॉयस / लेबल वाले उदाहरणों के साथ सुसंगत शैली → Bedrock मॉडल अनुकूलन (फाइन-ट्यूनिंग, अक्सर पैरामीटर-कुशल एडेप्टर)। छोटा स्थिर मार्गदर्शन → कुछ-शॉट के साथ प्रॉम्प्ट इंजीनियरिंग।
8 हाइपरपैरामीटर्स को ट्यून करें; प्रत्येक प्रशिक्षण कार्य 30 मिनट का है; सीमित कंप्यूट।
Bayesian ऑप्टिमाइज़ेशन (डिफ़ॉल्ट) के साथ SageMaker Automatic Model Tuning। उद्देश्य का एक संभाव्य मॉडल बनाता है और आशाजनक क्षेत्रों का नमूना लेता है।
क्यों: ग्रिड सर्च संयोजनात्मक रूप से फैलता है; रैंडम सर्च बजट बर्बाद करता है। उद्देश्य मीट्रिक (उदाहरण के लिए `validation:auc`) और प्रकार (`Maximize`) निर्दिष्ट करें।
माता-पिता के कार्यों को पूर्व के रूप में उपयोग करके और सर्वश्रेष्ठ प्रदर्शन करने वाले कॉन्फ़िगरेशन पर केंद्रित संकीर्ण सीमाओं के साथ वार्म स्टार्ट के साथ नई ट्यूनिंग नौकरी।
मौजूदा मॉडल को मासिक नए लेबलों पर प्रशिक्षित करना जारी रखें - खरोंच से शुरू न करें।
वृद्धिशील प्रशिक्षण: पिछले मॉडल आर्टिफैक्ट्स को इनपुट के रूप में पास करें। Image Classification, Object Detection, Semantic Segmentation बिल्ट-इन्स द्वारा समर्थित।
मॉडल एक GPU पर फिट बैठता है लेकिन डेटा बहुत बड़ा है → डेटा पैरेललिज्म (मॉडल को दोहराएं, बैचों को विभाजित करें, AllReduce ग्रेडिएंट्स)। मॉडल एक GPU पर फिट नहीं बैठता है → मॉडल पैरेललिज्म (GPU में परतें/टेंसर विभाजित करें)। 10B+ पैरामीटर → SageMaker मॉडल पैरेलल लाइब्रेरी (टेंसर + पाइपलाइन पैरेलल)।
प्रशिक्षण हानि गिरती रहती है, 50 युग के बाद सत्यापन हानि बढ़ने लगती है।
ओवरफिटिंग। सत्यापन-हानि न्यूनतम पर अर्ली स्टॉपिंग लागू करें, साथ ही ड्रापआउट / L2 वेट डिके। अधिक परतें इसे बदतर बनाती हैं।
सही वर्गीकरण मीट्रिक चुनें।
असंतुलित + दुर्लभ सकारात्मक मायने रखता है → रिकॉल, F1, PR कर्व / एवरेज प्रिसिजन (ROC AUC नहीं, जो कई TNs द्वारा फुलाया जाता है)। असंतुलन के साथ मल्टी-क्लास → मैक्रो-एवरेज्ड F1। थ्रेशोल्ड-स्वतंत्र रैंकिंग → AUC। संभाव्यता अंशांकन → लॉग लॉस / ब्रियर।
रिग्रेशन मॉडल उच्च अंत पर अधिक भविष्यवाणी करता है और निम्न अंत पर कम भविष्यवाणी करता है।
अवशेषों बनाम अनुमानित मान को प्लॉट करें; व्यवस्थित पूर्वाग्रह के लिए मीन एरर (हस्ताक्षरित) का उपयोग करें। RMSE / MAE / R² दिशा को छिपाते हैं।
प्रत्येक इनपुट एक साथ कई वर्गों से संबंधित हो सकता है।
बाइनरी क्रॉस-एंट्रॉपी लॉस (स्वतंत्र संभावनाएं) के साथ प्रति आउटपुट न्यूरॉन सिगमॉइड सक्रियण। सॉफ्टमैक्स + श्रेणीबद्ध क्रॉस-एंट्रॉपी पारस्परिक रूप से अनन्य वर्गों को मानता है।
एक मेटा-लर्नर के साथ कई बेस मॉडल स्टैक करें।
k-फोल्ड क्रॉस-वैलिडेशन: प्रत्येक बेस मॉडल अपने होल्ड-आउट फोल्ड पर आउट-ऑफ-फोल्ड भविष्यवाणियां उत्पन्न करता है; फोल्ड्स में इकट्ठा करें और उन पर मेटा-लर्नर को प्रशिक्षित करें।
क्यों: बेस मॉडल को प्रशिक्षित करना और उसी प्रशिक्षण सेट पर भविष्यवाणी करना मेटा-लर्नर में जानकारी लीक करता है।
कई प्रशिक्षण रनों (पैरामीटर, मेट्रिक्स, आर्टिफैक्ट्स) को ट्रैक और तुलना करें।
SageMaker Experiments। प्रशिक्षण कार्य को `experiment_config` (एक्सपेरिमेंट + ट्रायल + ट्रायल कंपोनेंट) पास करें; SageMaker हाइपरपैरामीटर्स, इनपुट कॉन्फिग, मेट्रिक्स और आर्टिफैक्ट्स को स्वतः-लॉग करता है।
स्क्रिप्ट को फिर से लिखे बिना प्रशिक्षण पैथोलॉजी (लुप्तप्राय ग्रेडिएंट, हानि में कमी नहीं, विस्फोटक टेंसर) का पता लगाएं।
बिल्ट-इन नियमों (`VanishingGradient`, `LossNotDecreasing`, `ExplodingTensor`, `Overfit`) के साथ SageMaker Debugger। हुक के माध्यम से टेंसर कैप्चर करता है; नियमों का मूल्यांकन तुरंत करता है।
स्थिर निम्न-विलंबता तुल्यकालिक → रियल-टाइम एंडपॉइंट। स्पाइकी / निष्क्रिय ट्रैफ़िक, GPU की आवश्यकता नहीं → सर्वरलेस अनुमान (कोल्ड स्टार्ट को खत्म करने के लिए प्रोविज़नड कॉन्करेंसी कॉन्फ़िगर करें)। प्रति-अनुरोध लंबे समय तक चलने वाला (>60 सेकंड) या बड़े पेलोड → एसिंक्रोनस अनुमान। S3 रिकॉर्ड्स का बल्क ऑफ़लाइन स्कोरिंग → बैच ट्रांसफॉर्म।
ARM एज डिवाइस पर एक TensorFlow मॉडल डिप्लॉय करें; इसे छोटा + तेज चाहिए।
SageMaker Neo। लक्षित हार्डवेयर के लिए संकलित करता है; 25 गुना तक तेज, ~1/10वीं मेमोरी। DLR रनटाइम के माध्यम से डिप्लॉय करें; ऑफ़लाइन एज के लिए IoT Greengrass के साथ मिलाएं।
जब ग्राउंड ट्रुथ देरी से आता है तो भविष्यवाणी-गुणवत्ता में गिरावट (सटीकता / F1 / RMSE) का पता लगाएं।
SageMaker मॉडल मॉनिटर - मॉडल क्वालिटी। कैप्चर की गई भविष्यवाणियों को देरी से आए ग्राउंड-ट्रुथ लेबल के साथ मर्ज करता है; जब मेट्रिक्स बेसलाइन से नीचे गिरते हैं तो अलार्म करता है।
इनपुट वितरण अपरिवर्तित दिखता है लेकिन भविष्यवाणी की गुणवत्ता बदल गई है।
SageMaker Clarify फीचर एट्रिब्यूशन ड्रिफ्ट मॉनिटर (SHAP-आधारित)। शिफ्टिंग फीचर महत्व के माध्यम से कॉन्सेप्ट ड्रिफ्ट का पता लगाता है। जब ग्राउंड ट्रुथ उपलब्ध हो तो मॉडल क्वालिटी मॉनिटर के साथ जोड़ें।
सटीकता गिर गई लेकिन इनपुट फीचर वितरण अपरिवर्तित हैं।
कॉन्सेप्ट ड्रिफ्ट (लेबल/फीचर संबंध बदल गया)। डेटा ड्रिफ्ट को खारिज कर दिया गया था। फिक्स: हाल ही के लेबल वाले डेटा पर पुनःप्रशिक्षित करें।
प्रशिक्षण से पहले डेटासेट में पूर्वाग्रह की जांच करें।
SageMaker Clarify प्री-ट्रेनिंग पूर्वाग्रह मेट्रिक्स। नमूना-आकार असमानता के लिए क्लास इम्बैलेंस (CI); लेबल-दर असमानता के लिए लेबल के सकारात्मक अनुपातों में अंतर (DPL); वितरण संबंधी अंतराल के लिए KL/JS डायवर्जेंस।
क्यों: प्री-ट्रेन DPL साफ लेकिन पोस्ट-ट्रेन DI पक्षपाती = मॉडल स्वयं एक प्रॉक्सी वेरिएबल को बढ़ाता है। विशेषताओं की जांच करें (उदाहरण के लिए ज़िप कोड)।
नोटबुक को एक S3 बकेट से प्रशिक्षण डेटा पढ़ने और कलाकृतियों को दूसरे में लिखने की आवश्यकता है।
कस्टम IAM नीति: प्रशिक्षण बकेट/प्रीफिक्स पर `s3:GetObject` और कलाकृतियों बकेट/प्रीफिक्स पर `s3:PutObject`, SageMaker निष्पादन भूमिका से जुड़ा हुआ। `AmazonS3FullAccess` से बचें।
IAM शर्त `aws:ResourceTag/project` के साथ विशेषता-आधारित एक्सेस कंट्रोल (ABAC)। `project=A` टैग किए गए संसाधन केवल उन भूमिकाओं के लिए सुलभ हैं जिनकी नीतियां मेल खाती हैं।
ग्राहक-प्रबंधित कुंजियों + रोटेशन के साथ प्रशिक्षण डेटा और मॉडल कलाकृतियों को एन्क्रिप्ट करें।
कस्टमर मैनेज्ड की (CMK) के साथ SSE-KMS। KMS रोटेशन, कुंजी नीतियां, CloudTrail ऑडिट। SageMaker द्वारा उपयोग के लिए प्रशिक्षण कार्य + एंडपॉइंट कॉन्फ़िग (वॉल्यूम + आउटपुट) में KMS कुंजी निर्दिष्ट करें।
कंटेनर को आउटबाउंड नेटवर्क कॉल नहीं करने चाहिए; डेटा SageMaker कॉपी-चैनल के अंदर रहना चाहिए।
प्रशिक्षण/प्रोसेसिंग जॉब या एंडपॉइंट पर `EnableNetworkIsolation=true` सेट करें। SageMaker कंटेनर चलने से पहले S3 इनपुट चैनलों को कॉपी करता है; कंटेनर का कोई आउटबाउंड नहीं होता।
प्रशिक्षण को सार्वजनिक इंटरनेट को नहीं छूना चाहिए।
SageMaker को बिना NAT/इंटरनेट गेटवे के एक निजी सबनेट में चलाएं। VPC एंडपॉइंट्स जोड़ें - S3 के लिए गेटवे एंडपॉइंट, SageMaker API + Runtime + ECR + STS + CloudWatch Logs के लिए इंटरफ़ेस एंडपॉइंट्स।
यह सुनिश्चित करें कि सभी SageMaker संसाधन VPC + KMS + अनुमोदित इंस्टेंस प्रकारों का उपयोग करें।
निवारक → SageMaker Service Catalog उत्पाद (पूर्व-अनुमोदित कॉन्फ़िग) और IAM कंडीशन कीज़ (`sagemaker:VpcSecurityGroupIds`, `sagemaker:VolumeKmsKey`) जो गैर-अनुपालन API कॉल को अस्वीकार करते हैं। जासूसी → AWS Config प्रबंधित/कस्टम नियम।