केंद्रीय प्रवृत्ति (माध्य, माध्यिका, बहुलक) हमें बताती है कि data का "केंद्र" कहाँ है। लेकिन दो बिल्कुल अलग data sets का माध्य एक जैसा हो सकता है। देखो:
Set A: {5, 5, 5, 5, 5} — माध्य = 5
Set B: {1, 3, 5, 7, 9} — माध्य = 5
माध्य बराबर है, लेकिन Set A में कोई फैलाव नहीं, Set B में काफ़ी फैलाव है। यही फैलाव मापना अपकिरण (Dispersion) का काम है।
एक सरल सादृश्य: मान लो दो टीमें क्रिकेट खेल रही हैं। दोनों का औसत score 40 रन है। लेकिन Team A के खिलाड़ी हर मैच में 38-42 के बीच score करते हैं, जबकि Team B के खिलाड़ी कभी 5 तो कभी 80 रन बनाते हैं। Team B ज़्यादा अनिश्चित (variable) है — यही अपकिरण पकड़ता है।
अपकिरण के मुख्य माप:
| माप | सूत्र आधार | Outlier प्रभाव |
|---|---|---|
| परिसर (Range) | Max − Min | सर्वाधिक |
| चतुर्थक विचलन (QD) | (Q3 − Q1)/2 | न्यूनतम |
| माध्य विचलन (MD) | Σ|x − x̄| / n | मध्यम |
| मानक विचलन (SD) | √(Σ(x−x̄)²/n) | अधिक |
| विचरण गुणांक (CV) | (SD/x̄) × 100 | तुलना के लिए |
SSC CGL में इन मापों पर सीधे गणना के प्रश्न आते हैं, और scaling (गुणा/जोड़ का प्रभाव) पर conceptual प्रश्न भी आते हैं। दोनों की तैयारी ज़रूरी है।
गहन विश्लेषण
1. परिसर (Range)
Range=Xmax−Xmin
सबसे सरल माप। गणना में 5 सेकंड लगते हैं। लेकिन यह केवल दो चरम मानों पर निर्भर करता है, इसलिए एक भी outlier पूरी तस्वीर बिगाड़ देता है।
परिसर गुणांक (Coefficient of Range):Coefficient of Range=Xmax+XminXmax−Xmin
2. चतुर्थक विचलन (Quartile Deviation)
QD=2Q3−Q1
यह अन्तर चतुर्थक परिसर (IQR = Q3 − Q1) का आधा है। बीच के 50% data पर निर्भर करता है, इसलिए outliers का इस पर सबसे कम प्रभाव पड़ता है। Skewed distributions और open-ended classes में उपयोगी।
चतुर्थक विचलन गुणांक:Coefficient of QD=Q3+Q1Q3−Q1
3. माध्य विचलन (Mean Deviation)
MD=n∑∣xi−A∣
यहाँ A = माध्य, माध्यिका, या बहुलक हो सकता है। माध्यिका के सापेक्ष MD सबसे न्यूनतम होता है — यह एक महत्वपूर्ण तथ्य है जो परीक्षा में सीधे पूछा जाता है।
Grouped data के लिए:
MD=∑fi∑fi∣xi−A∣
माध्य विचलन गुणांक:Coefficient of MD=AMD
4. मानक विचलन (Standard Deviation) और प्रसरण (Variance)
प्रसरण (Variance):σ2=n∑(xi−xˉ)2
मानक विचलन:σ=n∑(xi−xˉ)2
गणना का shortcut formula:σ2=n∑xi2−(n∑xi)2=x2−(xˉ)2
यह formula बड़े numbers के लिए बहुत तेज़ है। इसे याद करो: "वर्गों का माध्य − माध्य का वर्ग"।
Grouped data के लिए:σ=∑fi∑fi(xi−xˉ)2
5. Scaling का प्रभाव — परीक्षा में सबसे महत्वपूर्ण
यह section मत छोड़ो। SSC CGL में यह सीधे पूछा जाता है।
यदि प्रत्येक observation में स्थिरांक c जोड़ा/घटाया जाए:
माध्य: x̄ + c (बदलता है)
मानक विचलन: अपरिवर्तित
प्रसरण: अपरिवर्तित
यदि प्रत्येक observation को स्थिरांक k से गुणा किया जाए:
माध्य: k × x̄
मानक विचलन: |k| × σ
प्रसरण: k² × σ²
कारण सरल है: SD फैलाव मापता है। सबको एक ही संख्या जोड़ने से data की shape नहीं बदलती, केवल position बदलती है। लेकिन गुणा करने से फैलाव proportionally बढ़ता है।
6. विचरण गुणांक (Coefficient of Variation)
CV=xˉσ×100
यह इकाई-मुक्त (unit-free) माप है। दो अलग-अलग units या अलग-अलग means वाले datasets की तुलना करने के लिए CV सबसे उचित माप है।
नियम: जिसका CV अधिक, वह data अधिक परिवर्तनशील (variable) और कम स्थिर है।
7. कार्ल पियर्सन का विषमता गुणांक
SkP=σxˉ−Mode
माध्यिका का उपयोग करते हुए (जब बहुलक अस्पष्ट हो):
SkP=σ3(xˉ−Median)
यदि Sk > 0: धनात्मक विषमता (right-skewed)
यदि Sk < 0: ऋणात्मक विषमता (left-skewed)
यदि Sk = 0: सममित बंटन
शॉर्टकट और युक्तियाँ
patternवर्गों का माध्य − माध्य का वर्ग
जब SD निकालनी हो और numbers बड़े हों, तो deviation method की जगह यह formula लो:
σ² = (Σx²/n) − (Σx/n)²
Deviation method में: हर element से 6 घटाओ → −4,−2,0,2,4 → वर्ग करो → 16,4,0,4,16 → योग 40 → 40/5 = 8। दोनों answer एक है।
Formula method में column बनाना नहीं पड़ता — standard method: 8 steps, shortcut: 4 steps।
patternScaling का सुनहरा नियम: जोड़ो तो SD नहीं बदलती, गुणा करो तो SD उतनी गुनी
परीक्षा में यह pattern देखो: "प्रत्येक observation को k से गुणा किया तो प्रसरण पर क्या प्रभाव?"
सीधे याद करो: SD → |k| गुना, Variance → k² गुना, Mean → k गुना।जोड़ने/घटाने पर: SD, Variance अपरिवर्तित, Mean बदलता है।
k=3 का प्रश्न आए: Variance = 3² = 9 गुना। calculation ज़ीरो, answer तुरंत।
Standard method (सोचकर derive करना): 30 सेकंड। यह shortcut: 5 सेकंड।
eliminationCV से तुलना: बड़ा CV = ज़्यादा अनिश्चितता
जब दो series की तुलना करनी हो तो पहले देखो कि means अलग-अलग हैं या नहीं।
Means समान हों → जिसका SD बड़ा, वह अधिक variable।
Means अलग हों → CV = (SD/Mean) × 100 निकालो, बड़ा CV = अधिक variable।
प्रश्न: Series A: SD=4, Mean=30 → CV=13.33%; Series B: SD=6, Mean=20 → CV=30%।
सीधे eliminate करो: B का CV बड़ा → B अधिक variable। गलती वे करते हैं जो सीधे SD देखकर A को ज़्यादा variable मान लेते हैं।
Standard approach (confuse होना): 20 सेकंड। CV formula सीधे apply: 10 सेकंड।
eliminationOutlier प्रभाव: Range > SD > MD > QD
"किस माप पर outlier का सबसे अधिक/कम प्रभाव?" — यह सीधे पूछा जाता है।
क्रम याद करो (अधिक से कम): R > SD > MD > QD
Range: केवल 2 values देखता है (max, min) → outlier से सर्वाधिक प्रभावित।
QD: बीच के 50% data देखता है → outlier से सबसे कम प्रभावित।
Option elimination: "सबसे कम प्रभाव" वाले प्रश्न में QD/चतुर्थक विचलन answer होगा। "सबसे अधिक प्रभाव" में Range। Step count: 0 — सीधे memory से।
patternमाध्यिका पर MD न्यूनतम — एक ज़रूरी तथ्य
MAD (Mean Absolute Deviation) जब माध्यिका के सापेक्ष निकाला जाए, तो यह किसी भी अन्य केंद्र बिंदु की तुलना में न्यूनतम होता है।
परीक्षा में प्रश्न आ सकता है: "किस केंद्रीय प्रवृत्ति के सापेक्ष MD न्यूनतम होता है?" → उत्तर: माध्यिका (Median)।
यह एक गणितीय property है, derive करने की ज़रूरत नहीं — सीधे याद करो।
तेज़-समाधान रूपरेखा
परीक्षा हॉल में यह decision tree follow करो:
Step 1: प्रश्न किस माप के बारे में है?
"Max − Min" शब्द दिखे → परिसर (Range), गणना तुरंत करो।
"विचरण गुणांक" या "कौन अधिक variable" → CV = (SD/Mean)×100 निकालो।
"प्रसरण पर प्रभाव" + "गुणा" → k² लगाओ।
"Outlier का प्रभाव" → क्रम याद करो: R > SD > MD > QD।
Step 2: Scaling प्रश्न है?
जोड़/घटाव → SD, Variance नहीं बदलते।
गुणा/भाग → SD = |k|σ, Variance = k²σ²।
Step 3: गणना प्रश्न है?
पहले माध्य निकालो।
MD के लिए: |xi − माध्य| का योग ÷ n।
SD के लिए: shortcut formula σ² = (Σx²/n) − x̄² उपयोग करो।
Step 4: विषमता गुणांक?
माध्यिका दी है → 3(Mean − Median)/SD।
बहुलक दिया है → (Mean − Mode)/SD।
हल किए गए PYQs
क्यों यह प्रश्न: परिसर सबसे बुनियादी अपकिरण माप है। SSC CGL में warm-up question की तरह आता है — गलती मत करो।
समाधान का रास्ता: Data {4, 7, 13, 2, 19, 11} में max = 19, min = 2। Range = 19 − 2 = 17। Option (D) सही है। गलत option: 19 (केवल max देख लिया), 21 (जोड़ने की गलती)।
Previous Year Questionपिछले वर्ष का प्रश्न
The range of the data set {4, 7, 13, 2, 19, 11} is:
डेटा सेट {4, 7, 13, 2, 19, 11} का परिसर (Range) क्या है?
19
15
21
17
19
15
21
17
Solutionसमाधान
Range = Maximum value − Minimum value = 19 − 2 = 17. It is the simplest measure of dispersion.
परिसर = अधिकतम मान − न्यूनतम मान = 19 − 2 = 17। यह फैलाव (Dispersion) का सबसे सरल माप है।
क्यों यह प्रश्न: माध्य विचलन की step-by-step गणना का यह standard pattern है। माध्य निकालना → absolute deviation → औसत।
क्यों यह प्रश्न: Scaling property का सबसे अधिक परीक्षित प्रश्न। k=3 से गुणा → Variance = 9 गुना। Conceptual clarity है तो 5 सेकंड।
समाधान का रास्ता: Property: Var(kX) = k² × Var(X)। k=3 → नया Variance = 3² × मूल Variance = 9 गुना। Option (C)। गलत options: 3 गुना (SD से confuse), 6 गुना (2k सोचना)।
Previous Year Questionपिछले वर्ष का प्रश्न
If each observation of a data set is multiplied by 3, what happens to the variance of the data set?
यदि किसी डेटा सेट के प्रत्येक प्रेक्षण को 3 से गुणा कर दिया जाए, तो डेटा सेट के प्रसरण (variance) पर क्या प्रभाव पड़ेगा?
Variance becomes 6 times the original
Variance remains unchanged
Variance becomes 9 times the original
Variance becomes 3 times the original
प्रसरण मूल प्रसरण का 6 गुना हो जाता है
प्रसरण अपरिवर्तित रहता है
प्रसरण मूल प्रसरण का 9 गुना हो जाता है
प्रसरण मूल प्रसरण का 3 गुना हो जाता है
Solutionसमाधान
If each observation is multiplied by a constant k, the new standard deviation = k × original SD, so new variance = k² × original variance. Here k=3, so variance becomes 3² = 9 times the original variance.
यदि प्रत्येक प्रेक्षण को एक स्थिरांक k से गुणा किया जाए, तो नया मानक विचलन = k × मूल मानक विचलन, अतः नया प्रसरण = k² × मूल प्रसरण। यहाँ k=3, इसलिए प्रसरण 3² = 9 गुना हो जाता है।
क्यों यह प्रश्न: Outlier sensitivity का direct conceptual प्रश्न। इस topic को समझ लो तो यह प्रश्न 3 सेकंड में होगा।
समाधान का रास्ता: Range = Max − Min। यह केवल 2 extreme values पर निर्भर है। एक भी outlier होने पर Max या Min बदल जाएगा, और Range नाटकीय रूप से बदलेगा। Option (C) परिसर। QD सबसे कम प्रभावित होता है — यह भी याद रखो।
Previous Year Questionपिछले वर्ष का प्रश्न
Which measure of dispersion is most affected by extreme values (outliers) in a data set?
विचलन के किस माप पर डेटा सेट में अत्यधिक मान (outliers) का सबसे अधिक प्रभाव पड़ता है?
Quartile Deviation
Standard Deviation
Range
Mean Deviation
चतुर्थक विचलन
मानक विचलन
परिसर (Range)
माध्य विचलन
Solutionसमाधान
Range = Maximum value − Minimum value. Since it depends only on the two extreme values, it is the most affected by outliers. Quartile deviation is least affected as it ignores the top and bottom 25% of data.
परिसर = अधिकतम मान − न्यूनतम मान। यह केवल दो चरम मानों पर निर्भर करता है, इसलिए outliers से सबसे अधिक प्रभावित होता है। चतुर्थक विचलन पर outliers का सबसे कम प्रभाव पड़ता है।
क्यों यह प्रश्न: कार्ल पियर्सन का विषमता गुणांक — formula और किस situation में कौन सा version उपयोग करना है, दोनों परीक्षा में आते हैं।
समाधान का रास्ता: माध्यिका दी है, इसलिए: Sk = 3(Mean − Median)/SD = 3(50 − 48)/15 = 3(2)/15 = 6/15 = 0.4। Mean > Median → धनात्मक विषमता। Option (D)।
Previous Year Questionपिछले वर्ष का प्रश्न
For a frequency distribution, the mean is 50, the median is 48, and the standard deviation is 15. What is the coefficient of skewness using Karl Pearson's method (using median)?
एक बारंबारता बंटन के लिए माध्य 50, माध्यिका 48 और मानक विचलन 15 है। कार्ल पियर्सन की विधि (माध्यिका का उपयोग करते हुए) से विषमता गुणांक क्या होगा?
0.6
−0.4
0.13
0.4
0.6
−0.4
0.13
0.4
Solutionसमाधान
Karl Pearson's coefficient of skewness (using median) = 3(Mean − Median) / Standard Deviation = 3(50 − 48) / 15 = 3 × 2 / 15 = 6/15 = 0.4. Since mean > median, the distribution is positively skewed.
कार्ल पियर्सन का विषमता गुणांक (माध्यिका सहित) = 3(माध्य − माध्यिका) / मानक विचलन = 3(50 − 48) / 15 = 6/15 = 0.4। चूँकि माध्य > माध्यिका है, बंटन धनात्मक रूप से विषम है।
क्यों यह प्रश्न: CV से दो series की तुलना — यह SSC CGL का बहुत प्रिय प्रश्न-प्रकार है। SD देखकर decide मत करो, CV निकालो।
समाधान का रास्ता: CV(A) = (4/30) × 100 = 13.33%। CV(B) = (6/20) × 100 = 30%। CV(B) > CV(A) → Series B अधिक variable। Option (B)। यहाँ जो छात्र सीधे SD देखकर B (SD=6) को choose करते हैं वे सही answer देते हैं लेकिन गलत reasoning से — अगर means अलग हों तो हमेशा CV निकालो।
Previous Year Questionपिछले वर्ष का प्रश्न
The standard deviations of two series A and B are 4 and 6 respectively. The mean of series A is 30 and that of series B is 20. Which series is more variable?
दो श्रृंखलाओं A और B के मानक विचलन क्रमशः 4 और 6 हैं। श्रृंखला A का माध्य 30 और श्रृंखला B का माध्य 20 है। कौन-सी श्रृंखला अधिक परिवर्तनशील है?
Cannot be determined without sample size
Series B
Series A
Both are equally variable
प्रतिदर्श आकार के बिना निर्धारित नहीं किया जा सकता
श्रृंखला B
श्रृंखला A
दोनों समान रूप से परिवर्तनशील हैं
Solutionसमाधान
Variability is compared using Coefficient of Variation (CV) = (SD/Mean) × 100. CV of A = (4/30) × 100 = 13.33%. CV of B = (6/20) × 100 = 30%. Since CV of B (30%) > CV of A (13.33%), Series B is more variable.
परिवर्तनशीलता की तुलना विभिन्नता गुणांक (CV) = (SD/माध्य) × 100 से की जाती है। A का CV = (4/30) × 100 = 13.33%। B का CV = (6/20) × 100 = 30%। चूँकि B का CV (30%) > A का CV (13.33%), श्रृंखला B अधिक परिवर्तनशील है।
आम गलतियाँ
Range में गलत subtraction: {4, 7, 13, 2, 19, 11} देखकर 13−2=11 या 19−4=15 कर देना। हमेशा पहले सूची को scan करो: actual max और min identify करो, फिर subtract करो।
Scaling में SD और Variance को एक समझना: "k गुणा करने पर SD भी k² गुना हो जाता है" — यह गलत है। SD = |k|σ, Variance = k²σ²। जोड़ने पर दोनों नहीं बदलते — यह property अलग-अलग याद करो।
CV की जगह SD से तुलना: दो series की variability compare करते वक्त जब means अलग हों तो SD से compare करना fundamentally गलत है। हमेशा CV निकालो।
माध्य विचलन में absolute value भूलना: |xi − x̄| में absolute value sign ज़रूरी है। बिना modulus के negative deviations positive को cancel कर देंगे और MD = 0 आ जाएगा।
कार्ल पियर्सन के दोनों formulas में confusion: Mode दिया हो तो (Mean − Mode)/σ, Median दिया हो तो 3(Mean − Median)/σ। "3" का गुणा केवल Median वाले formula में है।
MAD का minimum कहाँ होता है — यह भूलना: MD (Mean Absolute Deviation) माध्यिका के सापेक्ष minimum होता है, माध्य के सापेक्ष नहीं। Variance (squared deviation) माध्य के सापेक्ष minimum होता है — दोनों को अदला-बदली मत करो।