SSC CGL सांख्यिकी — अपकिरण के माप (परिसर, माध्य विचलन, मानक विचलन, विचरण गुणांक)

intermediate 18 min read

अवधारणा

केंद्रीय प्रवृत्ति (माध्य, माध्यिका, बहुलक) हमें बताती है कि data का "केंद्र" कहाँ है। लेकिन दो बिल्कुल अलग data sets का माध्य एक जैसा हो सकता है। देखो:

माध्य बराबर है, लेकिन Set A में कोई फैलाव नहीं, Set B में काफ़ी फैलाव है। यही फैलाव मापना अपकिरण (Dispersion) का काम है।

एक सरल सादृश्य: मान लो दो टीमें क्रिकेट खेल रही हैं। दोनों का औसत score 40 रन है। लेकिन Team A के खिलाड़ी हर मैच में 38-42 के बीच score करते हैं, जबकि Team B के खिलाड़ी कभी 5 तो कभी 80 रन बनाते हैं। Team B ज़्यादा अनिश्चित (variable) है — यही अपकिरण पकड़ता है।

अपकिरण के मुख्य माप:

| माप | सूत्र आधार | Outlier प्रभाव | |---|---|---| | परिसर (Range) | Max − Min | सर्वाधिक | | चतुर्थक विचलन (QD) | (Q3 − Q1)/2 | न्यूनतम | | माध्य विचलन (MD) | Σ|x − x̄| / n | मध्यम | | मानक विचलन (SD) | √(Σ(x−x̄)²/n) | अधिक | | विचरण गुणांक (CV) | (SD/x̄) × 100 | तुलना के लिए |

SSC CGL में इन मापों पर सीधे गणना के प्रश्न आते हैं, और scaling (गुणा/जोड़ का प्रभाव) पर conceptual प्रश्न भी आते हैं। दोनों की तैयारी ज़रूरी है।


गहन विश्लेषण

1. परिसर (Range)

Range=XmaxXmin\text{Range} = X_{\max} - X_{\min}

सबसे सरल माप। गणना में 5 सेकंड लगते हैं। लेकिन यह केवल दो चरम मानों पर निर्भर करता है, इसलिए एक भी outlier पूरी तस्वीर बिगाड़ देता है।

परिसर गुणांक (Coefficient of Range): Coefficient of Range=XmaxXminXmax+Xmin\text{Coefficient of Range} = \frac{X_{\max} - X_{\min}}{X_{\max} + X_{\min}}

2. चतुर्थक विचलन (Quartile Deviation)

QD=Q3Q12QD = \frac{Q_3 - Q_1}{2}

यह अन्तर चतुर्थक परिसर (IQR = Q3 − Q1) का आधा है। बीच के 50% data पर निर्भर करता है, इसलिए outliers का इस पर सबसे कम प्रभाव पड़ता है। Skewed distributions और open-ended classes में उपयोगी।

चतुर्थक विचलन गुणांक: Coefficient of QD=Q3Q1Q3+Q1\text{Coefficient of QD} = \frac{Q_3 - Q_1}{Q_3 + Q_1}

3. माध्य विचलन (Mean Deviation)

MD=xiAnMD = \frac{\sum |x_i - A|}{n}

यहाँ A = माध्य, माध्यिका, या बहुलक हो सकता है। माध्यिका के सापेक्ष MD सबसे न्यूनतम होता है — यह एक महत्वपूर्ण तथ्य है जो परीक्षा में सीधे पूछा जाता है।

Grouped data के लिए: MD=fixiAfiMD = \frac{\sum f_i |x_i - A|}{\sum f_i}

माध्य विचलन गुणांक: Coefficient of MD=MDA\text{Coefficient of MD} = \frac{MD}{A}

4. मानक विचलन (Standard Deviation) और प्रसरण (Variance)

प्रसरण (Variance): σ2=(xixˉ)2n\sigma^2 = \frac{\sum (x_i - \bar{x})^2}{n}

मानक विचलन: σ=(xixˉ)2n\sigma = \sqrt{\frac{\sum (x_i - \bar{x})^2}{n}}

गणना का shortcut formula: σ2=xi2n(xin)2=x2(xˉ)2\sigma^2 = \frac{\sum x_i^2}{n} - \left(\frac{\sum x_i}{n}\right)^2 = \overline{x^2} - (\bar{x})^2

यह formula बड़े numbers के लिए बहुत तेज़ है। इसे याद करो: "वर्गों का माध्य − माध्य का वर्ग"

Grouped data के लिए: σ=fi(xixˉ)2fi\sigma = \sqrt{\frac{\sum f_i (x_i - \bar{x})^2}{\sum f_i}}

5. Scaling का प्रभाव — परीक्षा में सबसे महत्वपूर्ण

यह section मत छोड़ो। SSC CGL में यह सीधे पूछा जाता है।

यदि प्रत्येक observation में स्थिरांक c जोड़ा/घटाया जाए:

यदि प्रत्येक observation को स्थिरांक k से गुणा किया जाए:

कारण सरल है: SD फैलाव मापता है। सबको एक ही संख्या जोड़ने से data की shape नहीं बदलती, केवल position बदलती है। लेकिन गुणा करने से फैलाव proportionally बढ़ता है।

6. विचरण गुणांक (Coefficient of Variation)

CV=σxˉ×100CV = \frac{\sigma}{\bar{x}} \times 100

यह इकाई-मुक्त (unit-free) माप है। दो अलग-अलग units या अलग-अलग means वाले datasets की तुलना करने के लिए CV सबसे उचित माप है।

नियम: जिसका CV अधिक, वह data अधिक परिवर्तनशील (variable) और कम स्थिर है।

7. कार्ल पियर्सन का विषमता गुणांक

SkP=xˉModeσ\text{Sk}_P = \frac{\bar{x} - \text{Mode}}{\sigma}

माध्यिका का उपयोग करते हुए (जब बहुलक अस्पष्ट हो): SkP=3(xˉMedian)σ\text{Sk}_P = \frac{3(\bar{x} - \text{Median})}{\sigma}


शॉर्टकट और युक्तियाँ

patternवर्गों का माध्य − माध्य का वर्ग

जब SD निकालनी हो और numbers बड़े हों, तो deviation method की जगह यह formula लो: σ² = (Σx²/n) − (Σx/n)²

उदाहरण: {2, 4, 6, 8, 10} Σx = 30, माध्य = 6, Σx² = 4+16+36+64+100 = 220 σ² = 220/5 − 6² = 44 − 36 = 8 → σ = 2√2

Deviation method में: हर element से 6 घटाओ → −4,−2,0,2,4 → वर्ग करो → 16,4,0,4,16 → योग 40 → 40/5 = 8। दोनों answer एक है। Formula method में column बनाना नहीं पड़ता — standard method: 8 steps, shortcut: 4 steps।

patternScaling का सुनहरा नियम: जोड़ो तो SD नहीं बदलती, गुणा करो तो SD उतनी गुनी

परीक्षा में यह pattern देखो: "प्रत्येक observation को k से गुणा किया तो प्रसरण पर क्या प्रभाव?" सीधे याद करो: SD → |k| गुना, Variance → k² गुना, Mean → k गुना। जोड़ने/घटाने पर: SD, Variance अपरिवर्तित, Mean बदलता है।

k=3 का प्रश्न आए: Variance = 3² = 9 गुना। calculation ज़ीरो, answer तुरंत। Standard method (सोचकर derive करना): 30 सेकंड। यह shortcut: 5 सेकंड।

eliminationCV से तुलना: बड़ा CV = ज़्यादा अनिश्चितता

जब दो series की तुलना करनी हो तो पहले देखो कि means अलग-अलग हैं या नहीं।

  • Means समान हों → जिसका SD बड़ा, वह अधिक variable।
  • Means अलग हों → CV = (SD/Mean) × 100 निकालो, बड़ा CV = अधिक variable।

प्रश्न: Series A: SD=4, Mean=30 → CV=13.33%; Series B: SD=6, Mean=20 → CV=30%। सीधे eliminate करो: B का CV बड़ा → B अधिक variable। गलती वे करते हैं जो सीधे SD देखकर A को ज़्यादा variable मान लेते हैं। Standard approach (confuse होना): 20 सेकंड। CV formula सीधे apply: 10 सेकंड।

eliminationOutlier प्रभाव: Range > SD > MD > QD

"किस माप पर outlier का सबसे अधिक/कम प्रभाव?" — यह सीधे पूछा जाता है। क्रम याद करो (अधिक से कम): R > SD > MD > QD

  • Range: केवल 2 values देखता है (max, min) → outlier से सर्वाधिक प्रभावित।
  • QD: बीच के 50% data देखता है → outlier से सबसे कम प्रभावित। Option elimination: "सबसे कम प्रभाव" वाले प्रश्न में QD/चतुर्थक विचलन answer होगा। "सबसे अधिक प्रभाव" में Range। Step count: 0 — सीधे memory से।
patternमाध्यिका पर MD न्यूनतम — एक ज़रूरी तथ्य

MAD (Mean Absolute Deviation) जब माध्यिका के सापेक्ष निकाला जाए, तो यह किसी भी अन्य केंद्र बिंदु की तुलना में न्यूनतम होता है। परीक्षा में प्रश्न आ सकता है: "किस केंद्रीय प्रवृत्ति के सापेक्ष MD न्यूनतम होता है?" → उत्तर: माध्यिका (Median)। यह एक गणितीय property है, derive करने की ज़रूरत नहीं — सीधे याद करो।


तेज़-समाधान रूपरेखा

परीक्षा हॉल में यह decision tree follow करो:

Step 1: प्रश्न किस माप के बारे में है?

Step 2: Scaling प्रश्न है?

Step 3: गणना प्रश्न है?

Step 4: विषमता गुणांक?


हल किए गए PYQs

क्यों यह प्रश्न: परिसर सबसे बुनियादी अपकिरण माप है। SSC CGL में warm-up question की तरह आता है — गलती मत करो।

समाधान का रास्ता: Data {4, 7, 13, 2, 19, 11} में max = 19, min = 2। Range = 19 − 2 = 17। Option (D) सही है। गलत option: 19 (केवल max देख लिया), 21 (जोड़ने की गलती)।

Previous Year Questionपिछले वर्ष का प्रश्न
The range of the data set {4, 7, 13, 2, 19, 11} is:
डेटा सेट {4, 7, 13, 2, 19, 11} का परिसर (Range) क्या है?
  1. 19
  2. 15
  3. 21
  4. 17
  1. 19
  2. 15
  3. 21
  4. 17
Solutionसमाधान
Range = Maximum value − Minimum value = 19 − 2 = 17. It is the simplest measure of dispersion.
परिसर = अधिकतम मान − न्यूनतम मान = 19 − 2 = 17। यह फैलाव (Dispersion) का सबसे सरल माप है।

क्यों यह प्रश्न: माध्य विचलन की step-by-step गणना का यह standard pattern है। माध्य निकालना → absolute deviation → औसत।

समाधान का रास्ता: माध्य = (2+4+6+8+10)/5 = 30/5 = 6। Deviations: |2−6|=4, |4−6|=2, |6−6|=0, |8−6|=2, |10−6|=4। MD = (4+2+0+2+4)/5 = 12/5 = 2.4। Option (B)।

Previous Year Questionपिछले वर्ष का प्रश्न
The mean deviation of the data {2, 4, 6, 8, 10} about the mean is:
डेटा {2, 4, 6, 8, 10} का माध्य के बारे में माध्य विचलन (Mean Deviation) क्या है?
  1. 2.0
  2. 2.4
  3. 3.0
  4. 1.6
  1. 2.0
  2. 2.4
  3. 3.0
  4. 1.6
Solutionसमाधान
Mean = (2+4+6+8+10)/5 = 30/5 = 6. Deviations from mean: |2−6|=4, |4−6|=2, |6−6|=0, |8−6|=2, |10−6|=4. Mean Deviation = (4+2+0+2+4)/5 = 12/5 = 2.4.
माध्य = (2+4+6+8+10)/5 = 6। माध्य से विचलन: |2−6|=4, |4−6|=2, |6−6|=0, |8−6|=2, |10−6|=4। माध्य विचलन = (4+2+0+2+4)/5 = 12/5 = 2.4।

क्यों यह प्रश्न: CV formula का reverse application — यहाँ CV और Mean दिए हैं, SD निकालनी है। Formula को दोनों दिशाओं में जानना ज़रूरी है।

समाधान का रास्ता: CV = (SD/Mean) × 100 → SD = (CV × Mean)/100 = (40 × 25)/100 = 1000/100 = 10। Option (C)।

Previous Year Questionपिछले वर्ष का प्रश्न
If the coefficient of variation of a data set is 40% and its mean is 25, what is the standard deviation?
यदि किसी डेटा सेट का विचरण गुणांक 40% है और उसका माध्य 25 है, तो मानक विचलन क्या होगा?
  1. 8
  2. 15
  3. 10
  4. 12
  1. 8
  2. 15
  3. 10
  4. 12
Solutionसमाधान
Coefficient of Variation (CV) = (Standard Deviation / Mean) × 100. So Standard Deviation = (CV × Mean) / 100 = (40 × 25) / 100 = 1000 / 100 = 10.
विचरण गुणांक (CV) = (मानक विचलन / माध्य) × 100। अतः मानक विचलन = (40 × 25) / 100 = 10।

क्यों यह प्रश्न: Scaling property का सबसे अधिक परीक्षित प्रश्न। k=3 से गुणा → Variance = 9 गुना। Conceptual clarity है तो 5 सेकंड।

समाधान का रास्ता: Property: Var(kX) = k² × Var(X)। k=3 → नया Variance = 3² × मूल Variance = 9 गुना। Option (C)। गलत options: 3 गुना (SD से confuse), 6 गुना (2k सोचना)।

Previous Year Questionपिछले वर्ष का प्रश्न
If each observation of a data set is multiplied by 3, what happens to the variance of the data set?
यदि किसी डेटा सेट के प्रत्येक प्रेक्षण को 3 से गुणा कर दिया जाए, तो डेटा सेट के प्रसरण (variance) पर क्या प्रभाव पड़ेगा?
  1. Variance becomes 6 times the original
  2. Variance remains unchanged
  3. Variance becomes 9 times the original
  4. Variance becomes 3 times the original
  1. प्रसरण मूल प्रसरण का 6 गुना हो जाता है
  2. प्रसरण अपरिवर्तित रहता है
  3. प्रसरण मूल प्रसरण का 9 गुना हो जाता है
  4. प्रसरण मूल प्रसरण का 3 गुना हो जाता है
Solutionसमाधान
If each observation is multiplied by a constant k, the new standard deviation = k × original SD, so new variance = k² × original variance. Here k=3, so variance becomes 3² = 9 times the original variance.
यदि प्रत्येक प्रेक्षण को एक स्थिरांक k से गुणा किया जाए, तो नया मानक विचलन = k × मूल मानक विचलन, अतः नया प्रसरण = k² × मूल प्रसरण। यहाँ k=3, इसलिए प्रसरण 3² = 9 गुना हो जाता है।

क्यों यह प्रश्न: Outlier sensitivity का direct conceptual प्रश्न। इस topic को समझ लो तो यह प्रश्न 3 सेकंड में होगा।

समाधान का रास्ता: Range = Max − Min। यह केवल 2 extreme values पर निर्भर है। एक भी outlier होने पर Max या Min बदल जाएगा, और Range नाटकीय रूप से बदलेगा। Option (C) परिसर। QD सबसे कम प्रभावित होता है — यह भी याद रखो।

Previous Year Questionपिछले वर्ष का प्रश्न
Which measure of dispersion is most affected by extreme values (outliers) in a data set?
विचलन के किस माप पर डेटा सेट में अत्यधिक मान (outliers) का सबसे अधिक प्रभाव पड़ता है?
  1. Quartile Deviation
  2. Standard Deviation
  3. Range
  4. Mean Deviation
  1. चतुर्थक विचलन
  2. मानक विचलन
  3. परिसर (Range)
  4. माध्य विचलन
Solutionसमाधान
Range = Maximum value − Minimum value. Since it depends only on the two extreme values, it is the most affected by outliers. Quartile deviation is least affected as it ignores the top and bottom 25% of data.
परिसर = अधिकतम मान − न्यूनतम मान। यह केवल दो चरम मानों पर निर्भर करता है, इसलिए outliers से सबसे अधिक प्रभावित होता है। चतुर्थक विचलन पर outliers का सबसे कम प्रभाव पड़ता है।

क्यों यह प्रश्न: कार्ल पियर्सन का विषमता गुणांक — formula और किस situation में कौन सा version उपयोग करना है, दोनों परीक्षा में आते हैं।

समाधान का रास्ता: माध्यिका दी है, इसलिए: Sk = 3(Mean − Median)/SD = 3(50 − 48)/15 = 3(2)/15 = 6/15 = 0.4। Mean > Median → धनात्मक विषमता। Option (D)।

Previous Year Questionपिछले वर्ष का प्रश्न
For a frequency distribution, the mean is 50, the median is 48, and the standard deviation is 15. What is the coefficient of skewness using Karl Pearson's method (using median)?
एक बारंबारता बंटन के लिए माध्य 50, माध्यिका 48 और मानक विचलन 15 है। कार्ल पियर्सन की विधि (माध्यिका का उपयोग करते हुए) से विषमता गुणांक क्या होगा?
  1. 0.6
  2. −0.4
  3. 0.13
  4. 0.4
  1. 0.6
  2. −0.4
  3. 0.13
  4. 0.4
Solutionसमाधान
Karl Pearson's coefficient of skewness (using median) = 3(Mean − Median) / Standard Deviation = 3(50 − 48) / 15 = 3 × 2 / 15 = 6/15 = 0.4. Since mean > median, the distribution is positively skewed.
कार्ल पियर्सन का विषमता गुणांक (माध्यिका सहित) = 3(माध्य − माध्यिका) / मानक विचलन = 3(50 − 48) / 15 = 6/15 = 0.4। चूँकि माध्य > माध्यिका है, बंटन धनात्मक रूप से विषम है।

क्यों यह प्रश्न: CV से दो series की तुलना — यह SSC CGL का बहुत प्रिय प्रश्न-प्रकार है। SD देखकर decide मत करो, CV निकालो।

समाधान का रास्ता: CV(A) = (4/30) × 100 = 13.33%। CV(B) = (6/20) × 100 = 30%। CV(B) > CV(A) → Series B अधिक variable। Option (B)। यहाँ जो छात्र सीधे SD देखकर B (SD=6) को choose करते हैं वे सही answer देते हैं लेकिन गलत reasoning से — अगर means अलग हों तो हमेशा CV निकालो।

Previous Year Questionपिछले वर्ष का प्रश्न
The standard deviations of two series A and B are 4 and 6 respectively. The mean of series A is 30 and that of series B is 20. Which series is more variable?
दो श्रृंखलाओं A और B के मानक विचलन क्रमशः 4 और 6 हैं। श्रृंखला A का माध्य 30 और श्रृंखला B का माध्य 20 है। कौन-सी श्रृंखला अधिक परिवर्तनशील है?
  1. Cannot be determined without sample size
  2. Series B
  3. Series A
  4. Both are equally variable
  1. प्रतिदर्श आकार के बिना निर्धारित नहीं किया जा सकता
  2. श्रृंखला B
  3. श्रृंखला A
  4. दोनों समान रूप से परिवर्तनशील हैं
Solutionसमाधान
Variability is compared using Coefficient of Variation (CV) = (SD/Mean) × 100. CV of A = (4/30) × 100 = 13.33%. CV of B = (6/20) × 100 = 30%. Since CV of B (30%) > CV of A (13.33%), Series B is more variable.
परिवर्तनशीलता की तुलना विभिन्नता गुणांक (CV) = (SD/माध्य) × 100 से की जाती है। A का CV = (4/30) × 100 = 13.33%। B का CV = (6/20) × 100 = 30%। चूँकि B का CV (30%) > A का CV (13.33%), श्रृंखला B अधिक परिवर्तनशील है।

आम गलतियाँ


संबंधित विषय

SarkariRise पर अभ्यास

Sign up + get 3 free mocks →