SSC CGL सांख्यिकी: प्रतिदर्श सिद्धांत एवं आकलन — सम्पूर्ण अध्ययन सामग्री
advanced22 min read
अवधारणा
सोचो — भारत की पूरी जनसंख्या (140 करोड़) का स्वास्थ्य सर्वेक्षण करना हो तो क्या हर व्यक्ति से पूछोगे? असंभव है। इसके बजाय तुम कुछ लाख लोगों का प्रतिदर्श (sample) लेते हो और उस sample के आधार पर पूरी जनसंख्या के बारे में निष्कर्ष निकालते हो — यही प्रतिदर्श सिद्धांत का मूल विचार है।
मूल शब्दावली जो exam में सीधी पूछी जाती है:
जनसंख्या (Population): सभी इकाइयों का समूह। इसके माप को प्राचल (Parameter) कहते हैं — जैसे जनसंख्या माध्य μ, जनसंख्या मानक विचलन σ।
प्रतिदर्श (Sample): जनसंख्या का एक उपसमूह। इसके माप को सांख्यिकी (Statistic) कहते हैं — जैसे नमूना माध्य xˉ, नमूना मानक विचलन s।
प्रतिचयन त्रुटि (Sampling Error): Parameter − Statistic। यह त्रुटि केवल इसलिए होती है क्योंकि तुमने पूरी जनसंख्या नहीं, सिर्फ एक हिस्सा देखा।
अ-प्रतिचयन त्रुटि (Non-Sampling Error): डेटा संग्रह, अभिलेखन या processing में होने वाली गलती — यह census में भी होती है।
सरल सादृश्य: डॉक्टर खून की जाँच में सिर्फ 5 मिली खून लेता है, पूरा खून नहीं — लेकिन उस sample से पूरे शरीर की स्थिति समझ लेता है। यही प्रतिदर्शन का सार है।
आकलन (Estimation): जब sample statistics के आधार पर population parameter का अनुमान लगाया जाए तो इसे आकलन कहते हैं। यह दो प्रकार का होता है:
बिंदु आकलन (Point Estimation): एक अकेला मान — जैसे "xˉ=45"
अंतराल आकलन (Interval Estimation): एक सीमा — जैसे "μ, 42 और 48 के बीच है (95% विश्वास के साथ)"
गहन विश्लेषण
प्रतिदर्शन विधियाँ (Sampling Methods)
SSC CGL में इन चारों विधियों की पहचान और गणना — दोनों पूछी जाती हैं।
1. सरल यादृच्छिक प्रतिदर्शन (Simple Random Sampling — SRS)
परिभाषा: जनसंख्या की प्रत्येक इकाई को चुने जाने की समान और स्वतंत्र संभावना होती है।
यह दो प्रकार का होता है:
प्रतिस्थापन सहित (SRSWR): चुनी इकाई वापस रखी जाती है। मानक त्रुटि = nσ
यहाँ N−1N−n को परिमित जनसंख्या संशोधन (Finite Population Correction — FPC) कहते हैं।
महत्वपूर्ण: जब n बहुत छोटा हो N की तुलना में, तो SRSWR और SRSWOR की मानक त्रुटि लगभग बराबर होती है।
2. स्तरीकृत यादृच्छिक प्रतिदर्शन (Stratified Random Sampling)
जनसंख्या को सजातीय उपसमूहों (स्तरों) में बाँटो, फिर प्रत्येक स्तर से अलग-अलग यादृच्छिक नमूना लो।
आनुपातिक आवंटन (Proportional Allocation): स्तर h से नमूना आकार:
nh=n×NNh
जहाँ Nh = स्तर h का आकार, N = कुल जनसंख्या, n = कुल नमूना आकार।
याद करो: यदि सभी स्तर समान आकार के हों, तो प्रत्येक स्तर से बराबर नमूना आता है।
3. क्रमबद्ध प्रतिदर्शन (Systematic Sampling)
जनसंख्या को क्रम में सजाओ, पहली इकाई 1 से k के बीच यादृच्छिक रूप से चुनो (मान लो r), फिर r,r+k,r+2k,… क्रम से चुनो।
प्रतिचयन अंतराल:k=nN
i-वीं इकाई:r+(i−1)×k
4. गुच्छ प्रतिदर्शन (Cluster Sampling)
जनसंख्या को गुच्छों (clusters) में बाँटो, फिर कुछ गुच्छे यादृच्छिक रूप से चुनो और उनकी सभी इकाइयाँ लो।
स्तरीकृत बनाम गुच्छ — यही सबसे बड़ा confusion point है:
| स्तरीकृत | गुच्छ |
|---|---|
| स्तर भीतर से सजातीय | गुच्छ भीतर से विषमजातीय |
| हर स्तर से नमूना | कुछ गुच्छे पूरे लो |
| अधिक precise | कम खर्चीला |
आकलक के गुण (Properties of Estimators)
1. अनभिनत (Unbiased): यदि E(θ^)=θ — यानी सभी संभावित samples का औसत population parameter के बराबर हो।
3. न्यूनतम विचरण (Minimum Variance): सभी unbiased estimators में सबसे कम variance वाला।
4. पर्याप्त (Sufficient): जो estimator sample की सारी relevant जानकारी का उपयोग करे।
मानक त्रुटि (Standard Error)
मानक त्रुटि = sample statistic का मानक विचलन। यह sampling variability को मापती है।
SRSWR:SE(xˉ)=nσ
SRSWOR:SE(xˉ)=nσN−1N−n
महत्वपूर्ण:n बढ़ाने से मानक त्रुटि घटती है — इसीलिए बड़े नमूने अधिक precise होते हैं।
विश्वास अंतराल (Confidence Interval)
जनसंख्या माध्य μ का 95% विश्वास अंतराल:
xˉ±1.96×SE(xˉ)
99% के लिए: xˉ±2.576×SE(xˉ)
Interpretation: "95% विश्वास" का अर्थ है — यदि हम 100 बार sampling करें और हर बार interval बनाएं, तो उनमें से लगभग 95 intervals में सच्चा μ होगा।
शॉर्टकट और युक्तियाँ
patternSRSWR में N भूल जाओ
जब भी प्रश्न में SRSWR (प्रतिस्थापन सहित) लिखा हो, N का मान चाहे कुछ भी दिया हो — उसे formula में मत डालो। सीधे SE=σ/n लगाओ। परीक्षा में अक्सर N distractor के रूप में दिया जाता है। उदाहरण: σ=20, n=100 → SE=20/10=2। SRSWOR में FPC लगता है, SRSWR में नहीं — बस यही फर्क याद रखो। सामान्य विधि: पहले FPC calculate करो (45 सेकंड) बनाम shortcut: N देखते ही SRSWR पहचानो और सीधे गणना करो (10 सेकंड)।
patternSystematic Sampling की $i$-वीं इकाई का formula
i-वीं इकाई = r+(i−1)×k — इसे linear sequence की तरह सोचो। पहला term r, common difference k। 10वीं इकाई चाहिए? → r+9k। 15वीं चाहिए? → r+14k। यहाँ k=N/n। SSC CGL में यह formula AP (arithmetic progression) की तरह directly लागू होता है। अगर AP याद है तो यह प्रश्न 15 सेकंड में हल होगा — बिना formula याद किए।
patternआनुपातिक आवंटन: sampling fraction एक ही रहती है
Proportional allocation में हर स्तर की sampling fraction (nh/Nh) बराबर होती है और वह कुल sampling fraction (n/N) के बराबर है। तो किसी भी स्तर से नमूना = उस स्तर का आकार × (n/N)। उदाहरण: N=1000, n=100, तीसरे स्तर में N3=200 → n3=200×(100/1000)=200×0.1=20। यह मानसिक गणना है — calculator की जरूरत नहीं। 3 चरण की गणना बनाम सीधे mental multiplication: 20 सेकंड बचते हैं।
प्रश्न में "ग्रेड स्तर", "आय वर्ग", "लिंग", "क्षेत्र के अनुसार विभाजन" → स्तरीकृत। "गाँव", "स्कूल", "ब्लॉक" → गुच्छ। स्तरीकृत में हर उपसमूह से नमूना लो; गुच्छ में पूरे cluster लो। MCQ में यह keyword-matching से 5 सेकंड में हल होता है — पूरा प्रश्न पढ़ने की जरूरत नहीं।
eliminationBias vs Sampling Error: कहाँ से आई त्रुटि
त्रुटि का कारण: यादृच्छिक चयन → Sampling Error। डेटा संग्रह/रिकॉर्डिंग में गलती → Non-Sampling Error। Parameter − Statistic का अंतर पूछा → Sampling Error। Estimator का E(θ^)−θ पूछा → Bias। इन चारों को एक बार diagram में लिखो, फिर exam में 8 सेकंड में option eliminate हो जाएगा।
"प्रतिस्थापन सहित / SRSWR" लिखा है → SE=σ/n, N ignore करो
"प्रतिस्थापन रहित / SRSWOR" → FPC भी लगाओ
N नहीं दिया → निश्चित SRSWR है
Step 3 — Systematic sampling की इकाई पूछी है?
k=N/n निकालो → i-वीं इकाई =r+(i−1)k
Step 4 — Stratified proportional allocation?
nh=n×Nh/N → mental multiplication करो
Step 5 — Concept/definition पूछी है?
"समान अवसर" → SRS
"Parameter − Statistic" → Sampling Error
"E(θ̂) = θ" → Unbiased
इस framework से हर प्रश्न 60 सेकंड से कम में हल होना चाहिए।
हल किए गए PYQs
क्यों यह प्रश्न: यह SRS की मूल परिभाषा है — SSC CGL में सबसे बार पूछी जाने वाली concept। यहाँ "समान अवसर" keyword सीधा SRS की तरफ इशारा करता है।
समाधान का रास्ता: "समान और स्वतंत्र संभावना" = SRS की परिभाषा। Systematic में हर इकाई को बराबर chance नहीं (पहली इकाई पर depend करता है)। Cluster में सभी को chance नहीं मिलता। Stratified में हर स्तर से अलग sampling होती है।
Previous Year Questionपिछले वर्ष का प्रश्न
Which of the following sampling methods gives every member of the population an equal chance of being selected?
निम्नलिखित में से कौन सी सैंपलिंग विधि जनसंख्या के प्रत्येक सदस्य को चुने जाने का समान अवसर देती है?
Systematic Sampling
Simple Random Sampling
Cluster Sampling
Stratified Sampling
व्यवस्थित सैंपलिंग
सरल यादृच्छिक सैंपलिंग
क्लस्टर सैंपलिंग
स्तरीकृत सैंपलिंग
Solutionसमाधान
Simple Random Sampling is the method where every individual in the population has an equal and independent probability of being selected. It is the most basic form of probability sampling and forms the foundation of sampling theory.
सरल यादृच्छिक सैंपलिंग वह विधि है जिसमें जनसंख्या के प्रत्येक व्यक्ति को चुने जाने की समान और स्वतंत्र संभावना होती है। यह प्रायिकता सैंपलिंग का सबसे बुनियादी रूप है और सैंपलिंग सिद्धांत की नींव बनाती है।
क्यों यह प्रश्न: स्तरीकृत बनाम गुच्छ प्रतिदर्शन का confusion SSC CGL में repeated trap है। यहाँ "ग्रेड स्तर के आधार पर विभाजन + प्रत्येक समूह से नमूना" — यह पूरी तरह Stratified की definition है।
समाधान का रास्ता: 500 छात्र → 5 ग्रेड-आधारित स्तर (विषमजातीय population को सजातीय उपसमूहों में बाँटा) → हर स्तर से 20 = Stratified। अगर पूरे cluster को लेते = Cluster। SRS में random start से एक-एक चुनते।
Previous Year Questionपिछले वर्ष का प्रश्न
A population of 500 students is divided into 5 groups of 100 each based on their grade level, and then 20 students are randomly selected from each group. What type of sampling is this?
500 छात्रों की जनसंख्या को उनके ग्रेड स्तर के आधार पर 100-100 के 5 समूहों में विभाजित किया जाता है, और फिर प्रत्येक समूह से 20 छात्रों को यादृच्छिक रूप से चुना जाता है। यह किस प्रकार की सैंपलिंग है?
Cluster Sampling
Simple Random Sampling
Stratified Sampling
Convenience Sampling
क्लस्टर सैंपलिंग
सरल यादृच्छिक सैंपलिंग
स्तरीकृत सैंपलिंग
सुविधा सैंपलिंग
Solutionसमाधान
In Stratified Sampling, the population is divided into distinct subgroups (strata) based on a shared characteristic, and samples are drawn from each stratum. Here, the 500 students are divided into 5 grade-level groups (strata), and 20 are selected from each, making it Stratified Sampling.
स्तरीकृत सैंपलिंग में, जनसंख्या को एक साझा विशेषता के आधार पर अलग-अलग उपसमूहों (स्तरों) में विभाजित किया जाता है, और प्रत्येक स्तर से नमूने लिए जाते हैं। यहाँ 500 छात्रों को 5 ग्रेड-स्तर समूहों में बाँटा गया है और प्रत्येक से 20 चुने गए हैं, इसलिए यह स्तरीकृत सैंपलिंग है।
क्यों यह प्रश्न: SRSWR की मानक त्रुटि — N दिया है distractor के रूप में। अगर SRSWR का shortcut याद नहीं तो option (c) = 4 गलत answer देते हो (FPC लगाने की कोशिश में)।
समाधान का रास्ता: SRSWR → SE=σ/n=20/{100}=20/10=2। N=500 का यहाँ कोई उपयोग नहीं — यह distractor है। सीधे option (d) = 2 चुनो।
Previous Year Questionपिछले वर्ष का प्रश्न
A population of N = 500 units has a standard deviation σ = 20. In simple random sampling with replacement (SRSWR), what is the standard error of the sample mean when n = 100?
N = 500 इकाइयों की एक जनसंख्या का मानक विचलन σ = 20 है। प्रतिस्थापन सहित सरल यादृच्छिक प्रतिचयन (SRSWR) में, जब n = 100 हो तो नमूना माध्य का मानक त्रुटि क्या होगी?
0.2
20
4
2
0.2
20
4
2
Solutionसमाधान
In SRSWR, Standard Error of sample mean = σ/√n = 20/√100 = 20/10 = 2. In SRSWR, the population size N does not enter the formula because units are replaced after each draw.
SRSWR में, नमूना माध्य की मानक त्रुटि = σ/√n = 20/√100 = 20/10 = 2। SRSWR में जनसंख्या आकार N सूत्र में नहीं आता क्योंकि प्रत्येक आहरण के बाद इकाई को वापस रख दिया जाता है।
क्यों यह प्रश्न: Systematic sampling की i-वीं इकाई — AP formula का सीधा application। SSC CGL में 2-3 प्रश्न इसी pattern पर आते हैं।
समाधान का रास्ता:k=1000/50=20। दूसरी इकाई = 8+(2−1)×20=8+20=28। AP: first term = 8, common difference = 20।
Previous Year Questionपिछले वर्ष का प्रश्न
In systematic sampling, a sample of 50 units is to be drawn from a population of 1000 units. If the first unit selected is 8, what will be the second unit in the sample?
क्रमबद्ध प्रतिचयन में, 1000 इकाइयों की जनसंख्या से 50 इकाइयों का एक नमूना लिया जाना है। यदि चुनी गई पहली इकाई 8 है, तो नमूने में दूसरी इकाई क्या होगी?
18
28
58
38
18
28
58
38
Solutionसमाधान
In systematic sampling, the sampling interval k = N/n = 1000/50 = 20. The second unit = first unit + k = 8 + 20 = 28. Every subsequent unit is selected by adding the interval k to the previous unit.
क्रमबद्ध प्रतिचयन में, प्रतिचयन अंतराल k = N/n = 1000/50 = 20। दूसरी इकाई = पहली इकाई + k = 8 + 20 = 28। प्रत्येक अगली इकाई पिछली इकाई में अंतराल k जोड़कर चुनी जाती है।
क्यों यह प्रश्न: Sampling Error की exact definition — "parameter − statistic का अंतर"। Bias और Non-Sampling Error के साथ confusion बहुत होता है।
समाधान का रास्ता: Parameter (जनसंख्या का माप) − Statistic (नमूने का माप) = Sampling Error। Bias = E(θ^)−θ। Non-sampling error = measurement/recording mistakes। इसलिए option (d) सही।
Previous Year Questionपिछले वर्ष का प्रश्न
The difference between a parameter and its corresponding statistic is known as:
एक प्राचल (Parameter) और उसके संगत सांख्यिकी (Statistic) के बीच के अंतर को क्या कहते हैं?
Non-Sampling Error
Standard Error
Bias
Sampling Error
अ-प्रतिचयन त्रुटि
मानक त्रुटि
पूर्वाग्रह (Bias)
प्रतिचयन त्रुटि
Solutionसमाधान
Sampling error is defined as the difference between the value of a population parameter and the value of the corresponding sample statistic. It arises purely due to the chance selection of units in the sample. Non-sampling errors arise due to mistakes in data collection, recording, or processing.
प्रतिचयन त्रुटि को जनसंख्या प्राचल के मान और संगत नमूना सांख्यिकी के मान के बीच के अंतर के रूप में परिभाषित किया जाता है। यह त्रुटि केवल नमूने में इकाइयों के यादृच्छिक चयन के कारण उत्पन्न होती है। अ-प्रतिचयन त्रुटियाँ आंकड़ों के संग्रह, अभिलेखन या प्रसंस्करण में गलतियों के कारण होती हैं।
क्यों यह प्रश्न: Proportional allocation की गणना — सबसे सीधा numerical, लेकिन घबराहट में गलत formula लगा देते हैं।
समाधान का रास्ता: प्रत्येक स्तर में 500/5=100 इकाइयाँ। Sampling fraction = 50/500=1/10। प्रत्येक स्तर से = 100×(1/10)=10। या directly: nh=n×Nh/N=50×100/500=10।
Previous Year Questionपिछले वर्ष का प्रश्न
A population of 500 units is divided into 5 strata of equal size. A stratified random sample of 50 units is to be drawn using proportional allocation. How many units will be selected from each stratum?
500 इकाइयों की एक जनसंख्या को समान आकार के 5 स्तरों में विभाजित किया गया है। आनुपातिक आवंटन का उपयोग करके 50 इकाइयों का एक स्तरीकृत यादृच्छिक नमूना लिया जाना है। प्रत्येक स्तर से कितनी इकाइयाँ चुनी जाएंगी?
8
5
10
25
8
5
10
25
Solutionसमाधान
In proportional allocation, the sample size from each stratum is proportional to the stratum size. Each stratum has 500/5 = 100 units. The sampling fraction is 50/500 = 1/10. So units from each stratum = 100 × (1/10) = 10.
आनुपातिक आवंटन में, प्रत्येक स्तर से नमूना आकार उस स्तर के आकार के अनुपात में होता है। प्रत्येक स्तर में 500/5 = 100 इकाइयाँ हैं। सैम्पलिंग अनुपात 50/500 = 1/10 है। अतः प्रत्येक स्तर से इकाइयाँ = 100 × (1/10) = 10।
क्यों यह प्रश्न: असमान स्तर आकारों में proportional allocation — यहाँ तीसरे स्तर का आकार N3=200 है, पूरी जनसंख्या N=1000।
A population of size N = 1000 is divided into 4 strata of sizes 400, 300, 200, and 100. A stratified random sample of size n = 100 is to be drawn using proportional allocation. How many units should be drawn from the third stratum?
N = 1000 आकार की एक जनसंख्या को 400, 300, 200 और 100 आकार के 4 स्तरों में विभाजित किया गया है। समानुपातिक आवंटन (proportional allocation) का उपयोग करके n = 100 आकार का एक स्तरीकृत यादृच्छिक नमूना निकाला जाना है। तीसरे स्तर से कितनी इकाइयाँ ली जानी चाहिए?
20
25
30
15
20
25
30
15
Solutionसमाधान
Under proportional allocation, the sample size from stratum h is n_h = n × (N_h / N). For the third stratum: n_3 = 100 × (200/1000) = 100 × 0.2 = 20. So 20 units are drawn from the third stratum.
समानुपातिक आवंटन में, स्तर h से नमूना आकार n_h = n × (N_h / N) होता है। तीसरे स्तर के लिए: n_3 = 100 × (200/1000) = 100 × 0.2 = 20। अतः तीसरे स्तर से 20 इकाइयाँ ली जाएंगी।
क्यों यह प्रश्न: Systematic sampling में 10वीं इकाई — i=10 वाला AP term। पहले k निकालो, फिर AP formula।
समाधान का रास्ता:k=500/50=10। 10वीं इकाई = 7+(10−1)×10=7+90=97। Option (d) = 97 सही। Common mistake: (10−1) के बजाय 10 लगाना → 7+100=107 गलत।
Previous Year Questionपिछले वर्ष का प्रश्न
A systematic random sample of size n = 50 is to be drawn from a population of size N = 500. If the sampling interval is k and the first unit selected (random start) is 7, which unit number will be the 10th selected unit?
N = 500 आकार की जनसंख्या से n = 50 आकार का एक क्रमबद्ध यादृच्छिक नमूना (systematic random sample) निकाला जाना है। यदि नमूनाकरण अंतराल k है और पहली चुनी गई इकाई (random start) 7 है, तो 10वीं चुनी गई इकाई संख्या क्या होगी?
90
107
70
97
90
107
70
97
Solutionसमाधान
In systematic sampling, the sampling interval k = N/n = 500/50 = 10. The selected units are: 7, 17, 27, 37, ..., i.e., 7 + (i-1)×10 for the i-th unit. The 10th unit = 7 + (10-1)×10 = 7 + 90 = 97.
क्रमबद्ध नमूनाकरण में, नमूनाकरण अंतराल k = N/n = 500/50 = 10 होता है। चुनी गई इकाइयाँ हैं: 7, 17, 27, 37, ... अर्थात i-वीं इकाई = 7 + (i-1)×10। 10वीं इकाई = 7 + (10-1)×10 = 7 + 90 = 97।
आम गलतियाँ
SRSWR में FPC लगाना: जब "प्रतिस्थापन सहित" लिखा हो और N दिया हो, तो FPC की जरूरत नहीं। SE=σ/n काफी है। N को formula में घुसाने की कोशिश मत करो — यह distractor है।
Systematic sampling में i-वीं इकाई में i की जगह (i−1) भूलना: 10वीं इकाई = r+9k, न कि r+10k। AP का पहला term r है, तो (n−1) gaps होंगे। यह सबसे common गलती है।
Stratified और Cluster को आपस में बदलना: Stratified में हर उपसमूह से नमूना लो; Cluster में पूरे cluster लो। "ग्रेड/आय/लिंग के आधार पर" = Stratified। "स्कूल/गाँव/ब्लॉक पूरे लो" = Cluster।
Sampling Error और Bias को एक समझना: Sampling Error = Parameter − Statistic (किसी एक sample के लिए)। Bias = E(θ^)−θ (सभी possible samples का average error)। दोनों अलग हैं।
Proportional allocation में Nh के बजाय n को 5 से भाग देना: यदि स्तर असमान आकार के हों, तो n/k वाला shortcut गलत होगा। हमेशा nh=n×Nh/N formula लगाओ।
"समान अवसर" को Systematic Sampling से जोड़ना: Systematic में पहली इकाई randomly चुनी जाती है, लेकिन बाकी सभी उस पर depend करती हैं — इसलिए हर इकाई को independently equal chance नहीं। SRS में हर बार independent equal probability होती है।