SSC CGL सांख्यिकी — प्रसरण विश्लेषण (ANOVA): F-परीक्षण, Degrees of Freedom और ANOVA तालिका

advanced 22 min read

अवधारणा

मान लो तुम्हारे सामने यह प्रश्न है: तीन अलग-अलग शिक्षण पद्धतियों से पढ़े छात्रों के अंकों के बीच कोई सार्थक अंतर है या नहीं? सिर्फ दो समूहों की तुलना होती तो t-परीक्षण काफी था। लेकिन जब तीन या उससे अधिक समूह हों, तो प्रत्येक जोड़े का अलग-अलग t-परीक्षण करने से Type-I error की संभावना बढ़ जाती है। यहीं प्रसरण विश्लेषण (Analysis of Variance, ANOVA) की ज़रूरत पड़ती है।

ANOVA का मूल विचार सरल है: कुल विचरण (variation) को दो भागों में बाँटो —

  1. समूहों के बीच का विचरण (Between Groups / Treatment): यह दर्शाता है कि विभिन्न समूहों के माध्य एक-दूसरे से कितने अलग हैं।
  2. समूहों के भीतर का विचरण (Within Groups / Error): यह दर्शाता है कि एक ही समूह के अंदर मान कितने बिखरे हुए हैं — यही प्राकृतिक या यादृच्छिक त्रुटि है।

एक सहज सादृश्य: कल्पना करो कि पाँच कक्षाओं में परीक्षा परिणाम आए। "Between Groups" विचरण यह है कि एक कक्षा का औसत दूसरी से कितना अलग है। "Within Groups" विचरण यह है कि एक ही कक्षा के छात्रों के अंक आपस में कितने बिखरे हैं। यदि कक्षाओं के बीच का अंतर, कक्षा के भीतर के बिखराव की तुलना में बहुत बड़ा है — तो शिक्षण पद्धति का प्रभाव सार्थक माना जाएगा।

F-अनुपात इसी तुलना को संख्यात्मक रूप देता है:

F=Mean Square Between (MSB)Mean Square Within (MSW)F = \frac{\text{Mean Square Between (MSB)}}{\text{Mean Square Within (MSW)}}

जब शून्य परिकल्पना (सभी समूहों के माध्य बराबर हैं) सत्य होती है, तो दोनों mean squares एक ही जनसंख्या-विचरण का अनुमान लगाते हैं, इसलिए F का अपेक्षित मान 1 के करीब रहता है। F का मान 1 से बहुत अधिक होने पर हम शून्य परिकल्पना अस्वीकार करते हैं।


गहन विश्लेषण

एकमार्गी ANOVA (One-Way ANOVA)

एकमार्गी ANOVA में एक ही कारक (factor) के kk स्तर (levels/groups) होते हैं। मान लो kk समूह हैं और प्रत्येक समूह में nin_i प्रेक्षण हैं। कुल प्रेक्षण N=niN = \sum n_i

Degrees of Freedom (df) — सबसे महत्वपूर्ण

| स्रोत | df सूत्र | संख्यात्मक उदाहरण (k=4,N=20k=4, N=20) | |-------|----------|----------------------------------| | Between Groups (Treatment) | k1k - 1 | 41=34 - 1 = 3 | | Within Groups (Error) | NkN - k | 204=1620 - 4 = 16 | | कुल (Total) | N1N - 1 | 201=1920 - 1 = 19 |

सत्यापन: dfBetween+dfWithin=dfTotaldf_{Between} + df_{Within} = df_{Total}, अर्थात् 3+16=193 + 16 = 19। यह जाँच परीक्षा में एक सेकंड में होती है।

वर्गों का योग (Sum of Squares)

SST=SSBetween+SSWithinSST = SS_{Between} + SS_{Within}

Mean Square और F-अनुपात

MSB=SSBetweenk1,MSW=SSWithinNkMSB = \frac{SS_{Between}}{k-1}, \quad MSW = \frac{SS_{Within}}{N-k}

F=MSBMSWF = \frac{MSB}{MSW}

यह F, F(k1, Nk)F(k-1,\ N-k) distribution का अनुसरण करता है।


द्विमार्गी ANOVA (Two-Way ANOVA)

द्विमार्गी ANOVA में दो कारक होते हैं — मान लो कारक A के aa स्तर और कारक B के bb स्तर। यहाँ दो प्रकार होते हैं:

(i) Replication रहित Two-Way ANOVA (प्रत्येक cell में एक प्रेक्षण)

| स्रोत | df | |-------|----| | Rows (Factor A) | a1a - 1 | | Columns (Factor B) | b1b - 1 | | Error (Residual) | (a1)(b1)(a-1)(b-1) | | कुल | ab1ab - 1 |

उदाहरण: a=3a = 3 rows, b=4b = 4 columns:

(ii) Replication सहित Two-Way ANOVA (प्रत्येक cell में nn प्रेक्षण)

| स्रोत | df | |-------|----| | Factor A | a1a - 1 | | Factor B | b1b - 1 | | Interaction (A×B) | (a1)(b1)(a-1)(b-1) | | Error | ab(n1)ab(n-1) | | कुल | abn1abn - 1 |

उदाहरण: a=3a = 3 teaching methods, b=4b = 4 school types, n=2n = 2 observations per cell:


ANOVA की मूल मान्यताएँ

परीक्षा में कभी-कभी मान्यताओं पर प्रश्न आते हैं:

  1. सामान्यता (Normality): प्रत्येक समूह का population सामान्य वितरण का अनुसरण करता है।
  2. समविचरणता (Homoscedasticity): सभी समूहों का विचरण समान है।
  3. स्वतंत्रता (Independence): प्रेक्षण एक-दूसरे से स्वतंत्र हैं।

F-अनुपात की व्याख्या


शॉर्टकट और युक्तियाँ

patterndf का तुरंत सत्यापन — जोड़ से जाँच

एकमार्गी ANOVA में df की जाँच करनी हो: Between + Within = Total, अर्थात् (k1)+(Nk)=N1(k-1) + (N-k) = N-1। विकल्प देखते ही जोड़ो — जो जोड़ा N1N-1 न दे वह गलत है। k=4,N=20k=4, N=20: विकल्प "3 और 16" देखो — 3+16=19=2013+16=19=20-1। विकल्प "4 और 16" देखो — 4+16=20194+16=20 \neq 19। तुरंत खारिज।

मानक विधि: formula याद करो और दोनों df अलग-अलग निकालो — 20 सेकंड। यह shortcut: 5 सेकंड।

patternBetween Groups df = समूह − 1, Within Groups df = कुल − समूह

एकमार्गी ANOVA के df को एक वाक्य में याद करो: "Between में एक कम, Within में समूह घटाओ।" यानी dfB=k1df_B = k-1 और dfW=Nkdf_W = N-k। Replication रहित two-way ANOVA में error df = (r1)(c1)(r-1)(c-1) — इसे "rows minus one, columns minus one का गुणनफल" याद करो।

परीक्षा में "df क्या होगा" प्रश्न आते ही इस pattern से 8 सेकंड में उत्तर — formula sheet देखने की ज़रूरत नहीं।

eliminationF = MSB/MSW — अंश हमेशा Between

F-अनुपात में Between Groups हमेशा अंश (numerator) में होता है, Within Groups हमेशा हर (denominator) में। जब भी विकल्पों में "MSW/MSB" दिखे, उसे तुरंत elimination से खारिज करो। याद रखो: "कारण ऊपर (between), शोर नीचे (within)।" — Between = कारक का प्रभाव, Within = noise।

इस pattern से गलत विकल्प 3 सेकंड में हटते हैं, 4-विकल्प प्रश्न में।

estimationH₀ सत्य हो तो F ≈ 1

अगर प्रश्न पूछे "सभी माध्य बराबर हों तो F का अपेक्षित मान?" — उत्तर हमेशा 1। कारण: दोनों mean squares एक ही population variance का unbiased estimate देते हैं, ratio = 1। विकल्पों में "0", "k", "critical value से अधिक" हों तो सब गलत — F = 0 impossible है, F ऋणात्मक नहीं हो सकता। Estimation से 4 सेकंड में उत्तर।

patternTwo-Way Interaction df = (a−1)(b−1)

Replication सहित two-way ANOVA में interaction df याद करने का तरीका: Interaction df = Between rows df × Between columns df। यानी (a1)(b1)(a-1)(b-1)a=3,b=4a=3, b=4: (2)(3)=6(2)(3)=6। यह error df से अलग है जो ab(n1)ab(n-1) है। परीक्षा में interaction और error के df अदला-बदली करके विकल्प दिए जाते हैं — इन्हें गड्डमड्ड मत करो।

Standard approach: सभी df अलग निकालो — 30 सेकंड। इस shortcut: 8 सेकंड।


तेज़-समाधान रूपरेखा

परीक्षा-कक्ष में ANOVA प्रश्न देखते ही यह क्रम अपनाओ:

पहला काम — ANOVA का प्रकार पहचानो:

दूसरा काम — दी गई संख्याएँ नोट करो:

तीसरा काम — df का formula लगाओ:

चौथा काम — जोड़कर सत्यापित करो: सभी df का योग = N1N - 1 (या abn1abn - 1 two-way में)। यह 5 सेकंड की जाँच तुम्हें गलती से बचाती है।

F-अनुपात प्रश्न के लिए: हमेशा F=MSB/MSWF = MSB/MSW — अंश में Between, हर में Within।


हल किए गए PYQs

क्यों यह प्रश्न: यह SSC CGL का सबसे बुनियादी ANOVA प्रश्न है — सिर्फ Within Groups का df माँगा। यहाँ गलती सिर्फ formula भूलने से होती है।

Previous Year Questionपिछले वर्ष का प्रश्न
In a one-way ANOVA, if there are 4 groups and a total of 20 observations, what is the degrees of freedom for the error (within groups)?
एक-तरफा ANOVA में, यदि 4 समूह हैं और कुल 20 observations हैं, तो error (within groups) के लिए degrees of freedom क्या होगी?
  1. 16
  2. 15
  3. 19
  4. 3
  1. 16
  2. 15
  3. 19
  4. 3
Solutionसमाधान
In one-way ANOVA, degrees of freedom for error = Total observations − Number of groups = 20 − 4 = 16. Degrees of freedom for treatment = k − 1 = 3, and total df = n − 1 = 19.
एक-तरफा ANOVA में, error के लिए degrees of freedom = कुल observations − समूहों की संख्या = 20 − 4 = 16 होती है। Treatment के लिए df = k − 1 = 3, और कुल df = n − 1 = 19 होती है।

समाधान का रास्ता: N=20N = 20, k=4k = 4। Within Groups df =Nk=204=16= N - k = 20 - 4 = 16। जोड़ से जाँच: Between df =k1=3= k - 1 = 3, 3+16=19=N13 + 16 = 19 = N - 1 ✓।


क्यों यह प्रश्न: यह प्रश्न दोनों df एक साथ माँगता है — Between और Within। विकल्पों में "4 और 16" और "3 और 15" जानबूझकर भ्रामक हैं।

Previous Year Questionपिछले वर्ष का प्रश्न
In a one-way Analysis of Variance (ANOVA), if there are 4 groups and a total of 20 observations, what are the degrees of freedom for the 'Between Groups' (treatment) and 'Within Groups' (error) respectively?
एक-तरफ़ा Analysis of Variance (ANOVA) में, यदि 4 समूह हैं और कुल 20 प्रेक्षण (observations) हैं, तो 'Between Groups' (treatment) और 'Within Groups' (error) के लिए degrees of freedom क्रमशः क्या होंगे?
  1. 3 and 16
  2. 4 and 19
  3. 4 and 16
  4. 3 and 15
  1. 3 और 16
  2. 4 और 19
  3. 4 और 16
  4. 3 और 15
Solutionसमाधान
In one-way ANOVA with k groups and N total observations: df(Between Groups) = k − 1 = 4 − 1 = 3, and df(Within Groups) = N − k = 20 − 4 = 16. The total degrees of freedom = N − 1 = 19, which equals 3 + 16 = 19, confirming the answer.
एक-तरफ़ा ANOVA में k समूह और N कुल प्रेक्षण होने पर: df(Between Groups) = k − 1 = 4 − 1 = 3, और df(Within Groups) = N − k = 20 − 4 = 16 होता है। कुल degrees of freedom = N − 1 = 19 = 3 + 16, जो उत्तर की पुष्टि करता है।

समाधान का रास्ता: dfBetween=k1=3df_{Between} = k-1 = 3, dfWithin=Nk=16df_{Within} = N-k = 16। विकल्प "4 और 19" में kk को घटाया नहीं — trap। "3 और 15" में Nk1=15N-k-1 = 15 — extra एक घटा दिया — trap। जोड़ से जाँच: 3+16=193 + 16 = 19 ✓।


क्यों यह प्रश्न: यह conceptual प्रश्न है — Between Groups का df formula सीधे पूछा। विकल्प में kk, N1N-1, NkN-k भी हैं।

Previous Year Questionपिछले वर्ष का प्रश्न
In a one-way ANOVA with k groups and a total of N observations, what are the degrees of freedom for the 'Between Groups' sum of squares?
एक-तरफा ANOVA में, जहाँ k समूह और कुल N प्रेक्षण हैं, 'Between Groups' (समूहों के बीच) वर्गों के योग के लिए स्वतंत्रता की कोटि क्या होगी?
  1. k
  2. k − 1
  3. N − 1
  4. N − k
  1. k
  2. k − 1
  3. N − 1
  4. N − k
Solutionसमाधान
In one-way ANOVA, the Between Groups (treatment) degrees of freedom equals the number of groups minus one, i.e., k − 1. The Within Groups (error) degrees of freedom is N − k, and the Total degrees of freedom is N − 1.
एक-तरफा ANOVA में, Between Groups (उपचार) की स्वतंत्रता की कोटि समूहों की संख्या घटा एक, यानी k − 1 होती है। Within Groups (त्रुटि) की स्वतंत्रता की कोटि N − k होती है, और कुल स्वतंत्रता की कोटि N − 1 होती है।

समाधान का रास्ता: Between Groups df = समूहों की संख्या 1=k1- 1 = k - 1N1N-1 कुल df है, NkN-k Within Groups df है — दोनों गलत। kk (बिना घटाए) भी गलत।


क्यों यह प्रश्न: F-अनुपात की परिभाषा सीधे पूछी। विकल्प में SS को MS से, और MSW/MSB को MSB/MSW से बदला है।

Previous Year Questionपिछले वर्ष का प्रश्न
In ANOVA, the F-ratio is computed as:
ANOVA में F-अनुपात की गणना किस प्रकार की जाती है?
  1. Sum of Squares Between Groups / Sum of Squares Within Groups
  2. Mean Square Between Groups / Mean Square Within Groups
  3. Mean Square Within Groups / Mean Square Between Groups
  4. Total Sum of Squares / Sum of Squares Between Groups
  1. Sum of Squares Between Groups / Sum of Squares Within Groups
  2. Mean Square Between Groups / Mean Square Within Groups
  3. Mean Square Within Groups / Mean Square Between Groups
  4. Total Sum of Squares / Sum of Squares Between Groups
Solutionसमाधान
The F-ratio in ANOVA is the ratio of Mean Square Between Groups (MSB) to Mean Square Within Groups (MSW), i.e., F = MSB / MSW. A large F-value indicates that the variation between groups is significantly larger than the variation within groups.
ANOVA में F-अनुपात, Between Groups के Mean Square (MSB) को Within Groups के Mean Square (MSW) से भाग देकर निकाला जाता है, यानी F = MSB / MSW। बड़ा F-मान यह दर्शाता है कि समूहों के बीच का विचरण, समूहों के भीतर के विचरण से काफी अधिक है।

समाधान का रास्ता: F=MSB/MSWF = MSB / MSW। विकल्प (a) में SS है, MS नहीं — गलत। विकल्प (c) में हर-अंश उलटे हैं — गलत। विकल्प (d) का कोई सांख्यिकीय अर्थ नहीं। उत्तर: MSB/MSW।


क्यों यह प्रश्न: H₀ सत्य होने पर F का मान — यह conceptual trap है। कई छात्र "0" चुनते हैं।

Previous Year Questionपिछले वर्ष का प्रश्न
In one-way ANOVA, if all group means are equal, the expected value of the F-ratio is approximately:
एक-तरफा ANOVA में, यदि सभी समूहों के माध्य बराबर हों, तो F-अनुपात का अपेक्षित मान लगभग कितना होगा?
  1. 1
  2. 0
  3. Equal to the number of groups
  4. Greater than the critical value
  1. 1
  2. 0
  3. समूहों की संख्या के बराबर
  4. क्रांतिक मान से अधिक
Solutionसमाधान
When all group means are equal (i.e., the null hypothesis is true), both MSB and MSW estimate the same population variance, so their ratio F = MSB / MSW is expected to equal 1. A value significantly greater than 1 leads to rejection of the null hypothesis.
जब सभी समूहों के माध्य बराबर हों (अर्थात् शून्य परिकल्पना सत्य हो), तो MSB और MSW दोनों एक ही जनसंख्या विचरण का अनुमान लगाते हैं, इसलिए F = MSB / MSW का अपेक्षित मान 1 होता है। 1 से काफी अधिक मान शून्य परिकल्पना को अस्वीकार करने का आधार बनता है।

समाधान का रास्ता: H₀ सत्य → सभी माध्य बराबर → MSB और MSW दोनों σ2\sigma^2 का estimate → F=σ2/σ2=1F = \sigma^2 / \sigma^2 = 1। F = 0 तभी होता जब MSB = 0, यानी सभी group means बिल्कुल grand mean के बराबर — theoretical extreme, expected value नहीं।


क्यों यह प्रश्न: Two-way ANOVA with replication में interaction df — SSC CGL का advancing level प्रश्न।

Previous Year Questionपिछले वर्ष का प्रश्न
In a two-way ANOVA, a researcher studies the effect of 3 teaching methods and 4 school types on student scores. If there are 2 observations per cell, what are the degrees of freedom for the interaction effect?
एक two-way ANOVA में एक researcher 3 teaching methods और 4 school types का student scores पर प्रभाव अध्ययन करता है। यदि प्रत्येक cell में 2 observations हैं, तो interaction effect के लिए degrees of freedom क्या होगी?
  1. 3
  2. 24
  3. 12
  4. 6
  1. 3
  2. 24
  3. 12
  4. 6
Solutionसमाधान
In two-way ANOVA with factor A having 'a' levels and factor B having 'b' levels, the degrees of freedom for the interaction (A×B) = (a - 1)(b - 1). Here, teaching methods (a = 3) and school types (b = 4), so df_interaction = (3 - 1)(4 - 1) = 2 × 3 = 6. The df for error = ab(n - 1) = 3×4×(2-1) = 12, which is a common distractor.
Two-way ANOVA में interaction (A×B) के लिए df = (a - 1)(b - 1) होती है, जहाँ a = teaching methods के levels = 3 और b = school types के levels = 4 हैं। अतः df_interaction = (3-1)(4-1) = 2 × 3 = 6। Error के लिए df = ab(n-1) = 3×4×1 = 12 होती है, जो एक सामान्य गलत विकल्प है।

समाधान का रास्ता: a=3a = 3 (teaching methods), b=4b = 4 (school types), n=2n = 2 (observations per cell)। dfinteraction=(a1)(b1)=(2)(3)=6df_{interaction} = (a-1)(b-1) = (2)(3) = 6। विकल्प "12" trap है — वह dferror=ab(n1)=3×4×1=12df_{error} = ab(n-1) = 3 \times 4 \times 1 = 12 है। Interaction और Error की df मत मिलाओ।


क्यों यह प्रश्न: Replication रहित two-way ANOVA में error df — formula (r1)(c1)(r-1)(c-1) का सीधा application।

Previous Year Questionपिछले वर्ष का प्रश्न
In a two-way ANOVA without replication, there are 3 rows and 4 columns. The degrees of freedom for the Error (Residual) term is:
Replication के बिना एक two-way ANOVA में 3 rows और 4 columns हैं। Error (Residual) term के लिए degrees of freedom क्या होगा?
  1. 11
  2. 6
  3. 8
  4. 3
  1. 11
  2. 6
  3. 8
  4. 3
Solutionसमाधान
In a two-way ANOVA without replication with r rows and c columns: df_rows = r−1 = 2, df_columns = c−1 = 3, df_total = rc−1 = 11. df_error = df_total − df_rows − df_columns = 11 − 2 − 3 = 6. This can also be computed as (r−1)(c−1) = 2×3 = 6.
Replication रहित two-way ANOVA में r rows और c columns के साथ: df_rows = r−1 = 2, df_columns = c−1 = 3, df_total = rc−1 = 11। df_error = df_total − df_rows − df_columns = 11 − 2 − 3 = 6। इसे (r−1)(c−1) = 2×3 = 6 के रूप में भी निकाला जा सकता है।

समाधान का रास्ता: r=3,c=4r = 3, c = 4dftotal=rc1=11df_{total} = rc - 1 = 11dfrows=2df_{rows} = 2, dfcolumns=3df_{columns} = 3dferror=1123=6df_{error} = 11 - 2 - 3 = 6। या सीधे: (r1)(c1)=2×3=6(r-1)(c-1) = 2 \times 3 = 6। दोनों रास्ते एक ही उत्तर देते हैं।


आम गलतियाँ


संबंधित विषय

SarkariRise पर अभ्यास

Sign up + get 3 free mocks →