SSC CGL सांख्यिकी: प्रतिदर्श सिद्धांत एवं आकलन — सम्पूर्ण अध्ययन सामग्री

advanced 22 min read

अवधारणा

सोचो — भारत की पूरी जनसंख्या (140 करोड़) का स्वास्थ्य सर्वेक्षण करना हो तो क्या हर व्यक्ति से पूछोगे? असंभव है। इसके बजाय तुम कुछ लाख लोगों का प्रतिदर्श (sample) लेते हो और उस sample के आधार पर पूरी जनसंख्या के बारे में निष्कर्ष निकालते हो — यही प्रतिदर्श सिद्धांत का मूल विचार है।

मूल शब्दावली जो exam में सीधी पूछी जाती है:

सरल सादृश्य: डॉक्टर खून की जाँच में सिर्फ 5 मिली खून लेता है, पूरा खून नहीं — लेकिन उस sample से पूरे शरीर की स्थिति समझ लेता है। यही प्रतिदर्शन का सार है।

आकलन (Estimation): जब sample statistics के आधार पर population parameter का अनुमान लगाया जाए तो इसे आकलन कहते हैं। यह दो प्रकार का होता है:

  1. बिंदु आकलन (Point Estimation): एक अकेला मान — जैसे "xˉ=45\bar{x} = 45"
  2. अंतराल आकलन (Interval Estimation): एक सीमा — जैसे "μ, 42 और 48 के बीच है (95% विश्वास के साथ)"

गहन विश्लेषण

प्रतिदर्शन विधियाँ (Sampling Methods)

SSC CGL में इन चारों विधियों की पहचान और गणना — दोनों पूछी जाती हैं।

1. सरल यादृच्छिक प्रतिदर्शन (Simple Random Sampling — SRS)

परिभाषा: जनसंख्या की प्रत्येक इकाई को चुने जाने की समान और स्वतंत्र संभावना होती है।

यह दो प्रकार का होता है:

यहाँ NnN1\sqrt{\dfrac{N-n}{N-1}} को परिमित जनसंख्या संशोधन (Finite Population Correction — FPC) कहते हैं।

महत्वपूर्ण: जब nn बहुत छोटा हो NN की तुलना में, तो SRSWR और SRSWOR की मानक त्रुटि लगभग बराबर होती है।

2. स्तरीकृत यादृच्छिक प्रतिदर्शन (Stratified Random Sampling)

जनसंख्या को सजातीय उपसमूहों (स्तरों) में बाँटो, फिर प्रत्येक स्तर से अलग-अलग यादृच्छिक नमूना लो।

आनुपातिक आवंटन (Proportional Allocation): स्तर hh से नमूना आकार:

nh=n×NhNn_h = n \times \frac{N_h}{N}

जहाँ NhN_h = स्तर hh का आकार, NN = कुल जनसंख्या, nn = कुल नमूना आकार।

याद करो: यदि सभी स्तर समान आकार के हों, तो प्रत्येक स्तर से बराबर नमूना आता है।

3. क्रमबद्ध प्रतिदर्शन (Systematic Sampling)

जनसंख्या को क्रम में सजाओ, पहली इकाई 11 से kk के बीच यादृच्छिक रूप से चुनो (मान लो rr), फिर r,r+k,r+2k,r, r+k, r+2k, \ldots क्रम से चुनो।

प्रतिचयन अंतराल: k=Nnk = \dfrac{N}{n}

ii-वीं इकाई: r+(i1)×kr + (i-1) \times k

4. गुच्छ प्रतिदर्शन (Cluster Sampling)

जनसंख्या को गुच्छों (clusters) में बाँटो, फिर कुछ गुच्छे यादृच्छिक रूप से चुनो और उनकी सभी इकाइयाँ लो।

स्तरीकृत बनाम गुच्छ — यही सबसे बड़ा confusion point है:

| स्तरीकृत | गुच्छ | |---|---| | स्तर भीतर से सजातीय | गुच्छ भीतर से विषमजातीय | | हर स्तर से नमूना | कुछ गुच्छे पूरे लो | | अधिक precise | कम खर्चीला |


आकलक के गुण (Properties of Estimators)

1. अनभिनत (Unbiased): यदि E(θ^)=θE(\hat{\theta}) = \theta — यानी सभी संभावित samples का औसत population parameter के बराबर हो।

उदाहरण: xˉ\bar{x} एक unbiased estimator है μ\mu का।

2. संगत (Consistent): जैसे-जैसे nn \to \infty, θ^θ\hat{\theta} \to \theta (probability में)।

3. न्यूनतम विचरण (Minimum Variance): सभी unbiased estimators में सबसे कम variance वाला।

4. पर्याप्त (Sufficient): जो estimator sample की सारी relevant जानकारी का उपयोग करे।


मानक त्रुटि (Standard Error)

मानक त्रुटि = sample statistic का मानक विचलन। यह sampling variability को मापती है।

SRSWR: SE(xˉ)=σnSE(\bar{x}) = \dfrac{\sigma}{\sqrt{n}}

SRSWOR: SE(xˉ)=σnNnN1SE(\bar{x}) = \dfrac{\sigma}{\sqrt{n}} \sqrt{\dfrac{N-n}{N-1}}

महत्वपूर्ण: nn बढ़ाने से मानक त्रुटि घटती है — इसीलिए बड़े नमूने अधिक precise होते हैं।


विश्वास अंतराल (Confidence Interval)

जनसंख्या माध्य μ का 95%95\% विश्वास अंतराल:

xˉ±1.96×SE(xˉ)\bar{x} \pm 1.96 \times SE(\bar{x})

99%99\% के लिए: xˉ±2.576×SE(xˉ)\bar{x} \pm 2.576 \times SE(\bar{x})

Interpretation: "95% विश्वास" का अर्थ है — यदि हम 100 बार sampling करें और हर बार interval बनाएं, तो उनमें से लगभग 95 intervals में सच्चा μ होगा।


शॉर्टकट और युक्तियाँ

patternSRSWR में N भूल जाओ

जब भी प्रश्न में SRSWR (प्रतिस्थापन सहित) लिखा हो, NN का मान चाहे कुछ भी दिया हो — उसे formula में मत डालो। सीधे SE=σ/nSE = \sigma/\sqrt{n} लगाओ। परीक्षा में अक्सर NN distractor के रूप में दिया जाता है। उदाहरण: σ=20\sigma = 20, n=100n = 100SE=20/10=2SE = 20/10 = 2। SRSWOR में FPC लगता है, SRSWR में नहीं — बस यही फर्क याद रखो। सामान्य विधि: पहले FPC calculate करो (45 सेकंड) बनाम shortcut: N देखते ही SRSWR पहचानो और सीधे गणना करो (10 सेकंड)।

patternSystematic Sampling की $i$-वीं इकाई का formula

ii-वीं इकाई = r+(i1)×kr + (i-1) \times k — इसे linear sequence की तरह सोचो। पहला term rr, common difference kk। 10वीं इकाई चाहिए? → r+9kr + 9k। 15वीं चाहिए? → r+14kr + 14k। यहाँ k=N/nk = N/n। SSC CGL में यह formula AP (arithmetic progression) की तरह directly लागू होता है। अगर AP याद है तो यह प्रश्न 15 सेकंड में हल होगा — बिना formula याद किए।

patternआनुपातिक आवंटन: sampling fraction एक ही रहती है

Proportional allocation में हर स्तर की sampling fraction (nh/Nhn_h/N_h) बराबर होती है और वह कुल sampling fraction (n/Nn/N) के बराबर है। तो किसी भी स्तर से नमूना = उस स्तर का आकार × (n/N)(n/N)। उदाहरण: N=1000N = 1000, n=100n = 100, तीसरे स्तर में N3=200N_3 = 200n3=200×(100/1000)=200×0.1=20n_3 = 200 \times (100/1000) = 200 \times 0.1 = 20। यह मानसिक गणना है — calculator की जरूरत नहीं। 3 चरण की गणना बनाम सीधे mental multiplication: 20 सेकंड बचते हैं।

eliminationस्तरीकृत बनाम गुच्छ पहचान: keyword देखो

प्रश्न में "ग्रेड स्तर", "आय वर्ग", "लिंग", "क्षेत्र के अनुसार विभाजन" → स्तरीकृत। "गाँव", "स्कूल", "ब्लॉक" → गुच्छ। स्तरीकृत में हर उपसमूह से नमूना लो; गुच्छ में पूरे cluster लो। MCQ में यह keyword-matching से 5 सेकंड में हल होता है — पूरा प्रश्न पढ़ने की जरूरत नहीं।

eliminationBias vs Sampling Error: कहाँ से आई त्रुटि

त्रुटि का कारण: यादृच्छिक चयन → Sampling Error। डेटा संग्रह/रिकॉर्डिंग में गलती → Non-Sampling Error। Parameter − Statistic का अंतर पूछा → Sampling Error। Estimator का E(θ^)θE(\hat{\theta}) - \theta पूछा → Bias। इन चारों को एक बार diagram में लिखो, फिर exam में 8 सेकंड में option eliminate हो जाएगा।


तेज़-समाधान रूपरेखा

परीक्षा-भवन में निर्णय वृक्ष:

Step 1 — प्रश्न किस type का है?

Step 2 — मानक त्रुटि पूछी है?

Step 3 — Systematic sampling की इकाई पूछी है?

Step 4 — Stratified proportional allocation?

Step 5 — Concept/definition पूछी है?

इस framework से हर प्रश्न 60 सेकंड से कम में हल होना चाहिए।


हल किए गए PYQs

क्यों यह प्रश्न: यह SRS की मूल परिभाषा है — SSC CGL में सबसे बार पूछी जाने वाली concept। यहाँ "समान अवसर" keyword सीधा SRS की तरफ इशारा करता है।

समाधान का रास्ता: "समान और स्वतंत्र संभावना" = SRS की परिभाषा। Systematic में हर इकाई को बराबर chance नहीं (पहली इकाई पर depend करता है)। Cluster में सभी को chance नहीं मिलता। Stratified में हर स्तर से अलग sampling होती है।

Previous Year Questionपिछले वर्ष का प्रश्न
Which of the following sampling methods gives every member of the population an equal chance of being selected?
निम्नलिखित में से कौन सी सैंपलिंग विधि जनसंख्या के प्रत्येक सदस्य को चुने जाने का समान अवसर देती है?
  1. Systematic Sampling
  2. Simple Random Sampling
  3. Cluster Sampling
  4. Stratified Sampling
  1. व्यवस्थित सैंपलिंग
  2. सरल यादृच्छिक सैंपलिंग
  3. क्लस्टर सैंपलिंग
  4. स्तरीकृत सैंपलिंग
Solutionसमाधान
Simple Random Sampling is the method where every individual in the population has an equal and independent probability of being selected. It is the most basic form of probability sampling and forms the foundation of sampling theory.
सरल यादृच्छिक सैंपलिंग वह विधि है जिसमें जनसंख्या के प्रत्येक व्यक्ति को चुने जाने की समान और स्वतंत्र संभावना होती है। यह प्रायिकता सैंपलिंग का सबसे बुनियादी रूप है और सैंपलिंग सिद्धांत की नींव बनाती है।

क्यों यह प्रश्न: स्तरीकृत बनाम गुच्छ प्रतिदर्शन का confusion SSC CGL में repeated trap है। यहाँ "ग्रेड स्तर के आधार पर विभाजन + प्रत्येक समूह से नमूना" — यह पूरी तरह Stratified की definition है।

समाधान का रास्ता: 500 छात्र → 5 ग्रेड-आधारित स्तर (विषमजातीय population को सजातीय उपसमूहों में बाँटा) → हर स्तर से 20 = Stratified। अगर पूरे cluster को लेते = Cluster। SRS में random start से एक-एक चुनते।

Previous Year Questionपिछले वर्ष का प्रश्न
A population of 500 students is divided into 5 groups of 100 each based on their grade level, and then 20 students are randomly selected from each group. What type of sampling is this?
500 छात्रों की जनसंख्या को उनके ग्रेड स्तर के आधार पर 100-100 के 5 समूहों में विभाजित किया जाता है, और फिर प्रत्येक समूह से 20 छात्रों को यादृच्छिक रूप से चुना जाता है। यह किस प्रकार की सैंपलिंग है?
  1. Cluster Sampling
  2. Simple Random Sampling
  3. Stratified Sampling
  4. Convenience Sampling
  1. क्लस्टर सैंपलिंग
  2. सरल यादृच्छिक सैंपलिंग
  3. स्तरीकृत सैंपलिंग
  4. सुविधा सैंपलिंग
Solutionसमाधान
In Stratified Sampling, the population is divided into distinct subgroups (strata) based on a shared characteristic, and samples are drawn from each stratum. Here, the 500 students are divided into 5 grade-level groups (strata), and 20 are selected from each, making it Stratified Sampling.
स्तरीकृत सैंपलिंग में, जनसंख्या को एक साझा विशेषता के आधार पर अलग-अलग उपसमूहों (स्तरों) में विभाजित किया जाता है, और प्रत्येक स्तर से नमूने लिए जाते हैं। यहाँ 500 छात्रों को 5 ग्रेड-स्तर समूहों में बाँटा गया है और प्रत्येक से 20 चुने गए हैं, इसलिए यह स्तरीकृत सैंपलिंग है।

क्यों यह प्रश्न: SRSWR की मानक त्रुटि — NN दिया है distractor के रूप में। अगर SRSWR का shortcut याद नहीं तो option (c) = 4 गलत answer देते हो (FPC लगाने की कोशिश में)।

समाधान का रास्ता: SRSWR → SE=σ/n=20/{100}=20/10=2SE = \sigma/\sqrt{n} = 20/\sqrt\{100\} = 20/10 = 2N=500N = 500 का यहाँ कोई उपयोग नहीं — यह distractor है। सीधे option (d) = 2 चुनो।

Previous Year Questionपिछले वर्ष का प्रश्न
A population of N = 500 units has a standard deviation σ = 20. In simple random sampling with replacement (SRSWR), what is the standard error of the sample mean when n = 100?
N = 500 इकाइयों की एक जनसंख्या का मानक विचलन σ = 20 है। प्रतिस्थापन सहित सरल यादृच्छिक प्रतिचयन (SRSWR) में, जब n = 100 हो तो नमूना माध्य का मानक त्रुटि क्या होगी?
  1. 0.2
  2. 20
  3. 4
  4. 2
  1. 0.2
  2. 20
  3. 4
  4. 2
Solutionसमाधान
In SRSWR, Standard Error of sample mean = σ/√n = 20/√100 = 20/10 = 2. In SRSWR, the population size N does not enter the formula because units are replaced after each draw.
SRSWR में, नमूना माध्य की मानक त्रुटि = σ/√n = 20/√100 = 20/10 = 2। SRSWR में जनसंख्या आकार N सूत्र में नहीं आता क्योंकि प्रत्येक आहरण के बाद इकाई को वापस रख दिया जाता है।

क्यों यह प्रश्न: Systematic sampling की ii-वीं इकाई — AP formula का सीधा application। SSC CGL में 2-3 प्रश्न इसी pattern पर आते हैं।

समाधान का रास्ता: k=1000/50=20k = 1000/50 = 20। दूसरी इकाई = 8+(21)×20=8+20=288 + (2-1) \times 20 = 8 + 20 = 28। AP: first term = 8, common difference = 20।

Previous Year Questionपिछले वर्ष का प्रश्न
In systematic sampling, a sample of 50 units is to be drawn from a population of 1000 units. If the first unit selected is 8, what will be the second unit in the sample?
क्रमबद्ध प्रतिचयन में, 1000 इकाइयों की जनसंख्या से 50 इकाइयों का एक नमूना लिया जाना है। यदि चुनी गई पहली इकाई 8 है, तो नमूने में दूसरी इकाई क्या होगी?
  1. 18
  2. 28
  3. 58
  4. 38
  1. 18
  2. 28
  3. 58
  4. 38
Solutionसमाधान
In systematic sampling, the sampling interval k = N/n = 1000/50 = 20. The second unit = first unit + k = 8 + 20 = 28. Every subsequent unit is selected by adding the interval k to the previous unit.
क्रमबद्ध प्रतिचयन में, प्रतिचयन अंतराल k = N/n = 1000/50 = 20। दूसरी इकाई = पहली इकाई + k = 8 + 20 = 28। प्रत्येक अगली इकाई पिछली इकाई में अंतराल k जोड़कर चुनी जाती है।

क्यों यह प्रश्न: Sampling Error की exact definition — "parameter − statistic का अंतर"। Bias और Non-Sampling Error के साथ confusion बहुत होता है।

समाधान का रास्ता: Parameter (जनसंख्या का माप) − Statistic (नमूने का माप) = Sampling Error। Bias = E(θ^)θE(\hat{\theta}) - \theta। Non-sampling error = measurement/recording mistakes। इसलिए option (d) सही।

Previous Year Questionपिछले वर्ष का प्रश्न
The difference between a parameter and its corresponding statistic is known as:
एक प्राचल (Parameter) और उसके संगत सांख्यिकी (Statistic) के बीच के अंतर को क्या कहते हैं?
  1. Non-Sampling Error
  2. Standard Error
  3. Bias
  4. Sampling Error
  1. अ-प्रतिचयन त्रुटि
  2. मानक त्रुटि
  3. पूर्वाग्रह (Bias)
  4. प्रतिचयन त्रुटि
Solutionसमाधान
Sampling error is defined as the difference between the value of a population parameter and the value of the corresponding sample statistic. It arises purely due to the chance selection of units in the sample. Non-sampling errors arise due to mistakes in data collection, recording, or processing.
प्रतिचयन त्रुटि को जनसंख्या प्राचल के मान और संगत नमूना सांख्यिकी के मान के बीच के अंतर के रूप में परिभाषित किया जाता है। यह त्रुटि केवल नमूने में इकाइयों के यादृच्छिक चयन के कारण उत्पन्न होती है। अ-प्रतिचयन त्रुटियाँ आंकड़ों के संग्रह, अभिलेखन या प्रसंस्करण में गलतियों के कारण होती हैं।

क्यों यह प्रश्न: Proportional allocation की गणना — सबसे सीधा numerical, लेकिन घबराहट में गलत formula लगा देते हैं।

समाधान का रास्ता: प्रत्येक स्तर में 500/5=100500/5 = 100 इकाइयाँ। Sampling fraction = 50/500=1/1050/500 = 1/10। प्रत्येक स्तर से = 100×(1/10)=10100 \times (1/10) = 10। या directly: nh=n×Nh/N=50×100/500=10n_h = n \times N_h/N = 50 \times 100/500 = 10

Previous Year Questionपिछले वर्ष का प्रश्न
A population of 500 units is divided into 5 strata of equal size. A stratified random sample of 50 units is to be drawn using proportional allocation. How many units will be selected from each stratum?
500 इकाइयों की एक जनसंख्या को समान आकार के 5 स्तरों में विभाजित किया गया है। आनुपातिक आवंटन का उपयोग करके 50 इकाइयों का एक स्तरीकृत यादृच्छिक नमूना लिया जाना है। प्रत्येक स्तर से कितनी इकाइयाँ चुनी जाएंगी?
  1. 8
  2. 5
  3. 10
  4. 25
  1. 8
  2. 5
  3. 10
  4. 25
Solutionसमाधान
In proportional allocation, the sample size from each stratum is proportional to the stratum size. Each stratum has 500/5 = 100 units. The sampling fraction is 50/500 = 1/10. So units from each stratum = 100 × (1/10) = 10.
आनुपातिक आवंटन में, प्रत्येक स्तर से नमूना आकार उस स्तर के आकार के अनुपात में होता है। प्रत्येक स्तर में 500/5 = 100 इकाइयाँ हैं। सैम्पलिंग अनुपात 50/500 = 1/10 है। अतः प्रत्येक स्तर से इकाइयाँ = 100 × (1/10) = 10।

क्यों यह प्रश्न: असमान स्तर आकारों में proportional allocation — यहाँ तीसरे स्तर का आकार N3=200N_3 = 200 है, पूरी जनसंख्या N=1000N = 1000

समाधान का रास्ता: n3=n×N3/N=100×200/1000=100×0.2=20n_3 = n \times N_3/N = 100 \times 200/1000 = 100 \times 0.2 = 20। Answer = 20। दूसरे options check: N1=400N_1 = 400n1=40n_1 = 40; N2=300N_2 = 300n2=30n_2 = 30; N4=100N_4 = 100n4=10n_4 = 10। Check: 40+30+20+10=10040 + 30 + 20 + 10 = 100

Previous Year Questionपिछले वर्ष का प्रश्न
A population of size N = 1000 is divided into 4 strata of sizes 400, 300, 200, and 100. A stratified random sample of size n = 100 is to be drawn using proportional allocation. How many units should be drawn from the third stratum?
N = 1000 आकार की एक जनसंख्या को 400, 300, 200 और 100 आकार के 4 स्तरों में विभाजित किया गया है। समानुपातिक आवंटन (proportional allocation) का उपयोग करके n = 100 आकार का एक स्तरीकृत यादृच्छिक नमूना निकाला जाना है। तीसरे स्तर से कितनी इकाइयाँ ली जानी चाहिए?
  1. 20
  2. 25
  3. 30
  4. 15
  1. 20
  2. 25
  3. 30
  4. 15
Solutionसमाधान
Under proportional allocation, the sample size from stratum h is n_h = n × (N_h / N). For the third stratum: n_3 = 100 × (200/1000) = 100 × 0.2 = 20. So 20 units are drawn from the third stratum.
समानुपातिक आवंटन में, स्तर h से नमूना आकार n_h = n × (N_h / N) होता है। तीसरे स्तर के लिए: n_3 = 100 × (200/1000) = 100 × 0.2 = 20। अतः तीसरे स्तर से 20 इकाइयाँ ली जाएंगी।

क्यों यह प्रश्न: Systematic sampling में 10वीं इकाई — i=10i = 10 वाला AP term। पहले kk निकालो, फिर AP formula।

समाधान का रास्ता: k=500/50=10k = 500/50 = 10। 10वीं इकाई = 7+(101)×10=7+90=977 + (10-1) \times 10 = 7 + 90 = 97। Option (d) = 97 सही। Common mistake: (101)(10-1) के बजाय 1010 लगाना → 7+100=1077 + 100 = 107 गलत।

Previous Year Questionपिछले वर्ष का प्रश्न
A systematic random sample of size n = 50 is to be drawn from a population of size N = 500. If the sampling interval is k and the first unit selected (random start) is 7, which unit number will be the 10th selected unit?
N = 500 आकार की जनसंख्या से n = 50 आकार का एक क्रमबद्ध यादृच्छिक नमूना (systematic random sample) निकाला जाना है। यदि नमूनाकरण अंतराल k है और पहली चुनी गई इकाई (random start) 7 है, तो 10वीं चुनी गई इकाई संख्या क्या होगी?
  1. 90
  2. 107
  3. 70
  4. 97
  1. 90
  2. 107
  3. 70
  4. 97
Solutionसमाधान
In systematic sampling, the sampling interval k = N/n = 500/50 = 10. The selected units are: 7, 17, 27, 37, ..., i.e., 7 + (i-1)×10 for the i-th unit. The 10th unit = 7 + (10-1)×10 = 7 + 90 = 97.
क्रमबद्ध नमूनाकरण में, नमूनाकरण अंतराल k = N/n = 500/50 = 10 होता है। चुनी गई इकाइयाँ हैं: 7, 17, 27, 37, ... अर्थात i-वीं इकाई = 7 + (i-1)×10। 10वीं इकाई = 7 + (10-1)×10 = 7 + 90 = 97।

आम गलतियाँ


संबंधित विषय

SarkariRise पर अभ्यास

Sign up + get 3 free mocks →