सांख्यिकी, डेटा को समझने की वह भाषा है जो तुम्हें बताती है — यह numbers का झुंड असल में कहाँ केंद्रित है और कितना बिखरा हुआ है।
एक सोच प्रयोग करो: मान लो एक army battalion के 50 जवानों की height है। तुम्हारे कमांडिंग ऑफिसर को सिर्फ़ दो चीज़ें चाहिए —
औसत height (केंद्रीय प्रवृत्ति) — ताकि uniform का standard size तय हो सके।
फैलाव (विस्तार/dispersión) — ताकि पता चले कितनी variety है, क्या सब लगभग एक जैसे हैं या बहुत अलग-अलग।
यही दो काम सांख्यिकी करती है।
केंद्रीय प्रवृत्ति के माप (Measures of Central Tendency):
माध्य (Mean): सभी मानों का योग ÷ कुल संख्या। सबसे ज़्यादा उपयोगी, पर extreme values से प्रभावित होता है।
माध्यिका (Median): क्रमबद्ध डेटा का मध्य मान। extreme values से अप्रभावित।
बहुलक (Mode): सबसे अधिक बार आने वाला मान।
फैलाव के माप (Measures of Dispersion):
परिसर (Range): अधिकतम − न्यूनतम।
माध्य विचलन (Mean Deviation)
प्रसरण (Variance): विचलनों के वर्गों का माध्य।
मानक विचलन (Standard Deviation): प्रसरण का वर्गमूल — सबसे महत्वपूर्ण।
भिन्नता गुणांक (Coefficient of Variation): दो अलग-अलग datasets की तुलना का एकमात्र सही तरीका।
NDA में सांख्यिकी से प्रतिवर्ष 3-5 प्रश्न आते हैं। इनमें से अधिकांश प्रसरण और मानक विचलन पर होते हैं — विशेषकर वह formula जो raw data से सीधे calculate करता है।
गहन विश्लेषण
माध्य (Mean) — तीन रूप
Ungrouped data के लिए:xˉ=n∑xi
Grouped data (frequency distribution) के लिए:xˉ=∑fi∑fixi
Step-deviation method (बड़े numbers के लिए):xˉ=A+∑fi∑fidi×h
जहाँ di=hxi−A, A = assumed mean, h = class width।
प्रसरण और मानक विचलन — दो formula, दोनों याद रखो
Formula 1 (definition से):σ2=n∑(xi−xˉ)2
Formula 2 (raw data / computation formula — NDA में यही काम आता है):σ2=n∑xi2−(n∑xi)2
यही simplify होकर लिखा जाता है:
σ2=n∑xi2−xˉ2
देखो — जब question में ∑X, ∑X2, और n दिए हों, तो Formula 2 को direct plug-in करो। Formula 1 में पहले mean निकालना, फिर हर value से घटाना, फिर square करना — यह exam hall में time की बर्बादी है।
Grouped data के लिए:σ2=∑fi∑fixi2−(∑fi∑fixi)2
मानक विचलन:σ=σ2
Linear Transformation का नियम — अत्यंत महत्वपूर्ण
यदि Y=aX+b हो, तो:
नया माध्य: Yˉ=aXˉ+b
नया प्रसरण: σY2=a2σX2
नया मानक विचलन: σY=∣a∣⋅σX
Critical point:b (constant जोड़ना/घटाना) मानक विचलन को बिल्कुल प्रभावित नहीं करता। केवल a (गुणा/भाग) प्रभावित करता है।
यह rule NDA में बार-बार पूछा जाता है। एक line में याद करो: "जोड़ो-घटाओ तो SD वही रहे, गुणा-भाग करो तो SD बदले।"
भिन्नता गुणांक (Coefficient of Variation — CV)
CV=xˉσ×100%
CV का उपयोग तब होता है जब दो अलग units या अलग scales के datasets की consistency compare करनी हो। जिसका CV कम, वह ज़्यादा consistent (stable)।
उदाहरण: एक series का SD = 21 और mean = 35 हो, तो CV=3521×100=60%।
माध्यिका (Median)
Ungrouped data के लिए:
n विषम हो तो median = (2n+1)वाँ पद
n सम हो तो median = 2(2n){वाँपद}+(2n+1){वाँपद}
Grouped data के लिए:M=l+f2n−CF×h
जहाँ l = median class की lower boundary, CF = पिछली सभी classes की cumulative frequency, f = median class की frequency, h = class width।
बहुलक (Mode)
Grouped data के लिए:Z=l+2f1−f0−f2f1−f0×h
जहाँ f1 = modal class की frequency, f0 = पिछली class की frequency, f2 = अगली class की frequency।
Empirical Relation
Mode=3×Median−2×Mean
यह relation moderately skewed distributions में काम आता है। इससे तीसरा measure निकाला जा सकता है जब दो दिए हों।
शॉर्टकट और युक्तियाँ
patternRaw Data Formula — सीधे Plug-In
जब भी question में ∑X, ∑X2, n दिए हों — Variance को एक ही step में निकालो:
Standard method (हर value से mean घटाओ, square करो, average लो): 8-10 steps, ~90 seconds।
यह shortcut: 2 steps, ~15 seconds।
patternLinear Transform नियम — SD पर b का कोई असर नहीं
Y=aX+b में:
Yˉ=aXˉ+b (mean पर दोनों का असर)
σY=∣a∣⋅σX (SD पर सिर्फ़ a का असर, b का नहीं)
Quick check: Y=3X+10, original SD = 5
नया SD = 3×5=15 (10 को ignore करो)
गलत approach: σY=3×5+10=25 — यह trap है।
सही approach: 1 mental step, ~5 seconds vs. derivation से निकालने पर ~40 seconds।
substitutionCV से Mean निकालना — उल्टी दिशा
जब CV और SD दोनों दिए हों, mean निकालो:
xˉ=CVSD×100
उदाहरण: CV = 60%, SD = 21
xˉ=6021×100=35
यह formula आगे से लिखो, पीछे से भी काम करता है। Standard method: CV का formula याद करो, xˉ को subject बनाओ — 3 steps। यह reverse plug-in: 1 step, ~8 seconds।
patternEmpirical Relation — तीसरा Measure खोजो
Mode=3×Median−2×Mean
जब दो दिए हों, तीसरा तुरंत निकालो:
Mean = 25, Median = 26 → Mode = 3(26)−2(25)=78−50=28
Standard method: frequency distribution बनाओ, modal class ढूंढो — 5+ steps।
यह shortcut (जहाँ applicable हो): 1 step, ~10 seconds।
substitutionPoisson Distribution में λ निकालना
Poisson में P(X=r)=r!e−λλr
P(X=k)=P(X=k+1) condition दी हो तो:
k!e−λλk=(k+1)!e−λλk+1⇒λ=k+1
P(X=1)=P(X=2) → λ=2 (mean = 2)
e−λ cancel हो जाता है, calculation की ज़रूरत नहीं। Standard approach: पूरा algebra करो — 5 steps। यह pattern: 1 step, ~8 seconds।
तेज़-समाधान रूपरेखा
Exam hall में यह decision tree follow करो:
Step 1: Question में क्या दिया है?
∑X, ∑X2, n दिए हैं → Raw data formula: σ2=n∑X2−xˉ2
CV और SD दिए हैं, mean पूछा है → xˉ=CVSD×100
Y=aX+b transformation दी है → नया mean = axˉ+b, नया SD = ∣a∣⋅σ
Step 2: क्या compare करना है?
दो datasets की consistency → CV compare करो (कम CV = ज़्यादा consistent)
दो datasets के absolute spread → SD compare करो
Step 3: Poisson/Binomial का mean पूछा है?
P(X=k)=P(X=k+1) condition → λ=k+1
Binomial में mean = np, variance = npq
Red flag: अगर question में "कम से कम" (at least) या "अधिक से अधिक" (at most) आए, तो complement method सोचो — P(X≥k)=1−P(X<k)।
हल किए गए PYQs
क्यों यह प्रश्न: यह raw data formula का classic application है। n, ∑X, ∑X2 तीनों दिए हैं — यही pattern NDA में बार-बार दिखता है। Variance की comparison से answer निकलता है, calculation minimal है।
Previous Year Questionपिछले वर्ष का प्रश्न2025
The sum and the sum of squares of the observations corresponding to length X (in cm) and weight Y (in gm) of 50 tropical tubers are given as ΣX = 200, ΣY = 250, ΣX² = 900 and ΣY² = 1400. Which one of the following is correct?
समाधान का रास्ता: Formula σ2=n∑X2−(n∑X)2 को दोनों variables के लिए लगाओ। X के लिए: 50900−(50200)2=18−16=2। Y के लिए: 501400−(50250)2=28−25=3। चूँकि 2<3, Variance(X) < Variance(Y)।
क्यों यह प्रश्न: Linear transformation का नियम NDA में सीधे पूछा जाता है। यहाँ trap यह है कि constant (10) जोड़ने पर SD बदलता नहीं — जो छात्र यह भूलते हैं वे option D (160 और 45) चुन लेते हैं।
Previous Year Questionपिछले वर्ष का प्रश्न
The mean and standard deviation of 100 observations are 50 and 5 respectively. If each observation is multiplied by 3 and then 10 is added, what are the new mean and standard deviation respectively?
100 प्रेक्षणों का माध्य और मानक विचलन क्रमशः 50 और 5 हैं। यदि प्रत्येक प्रेक्षण को 3 से गुणा किया जाए और फिर 10 जोड़ा जाए, तो नया माध्य और मानक विचलन क्रमशः क्या होंगे?
160 and 15
160 and 5
150 and 15
160 and 45
160 और 15
160 और 5
150 और 15
160 और 45
Solutionसमाधान
If Y=3X+10, then new mean=3×50+10=160. Standard deviation is not affected by adding a constant but is scaled by 3: new SD=3×5=15.
यदि Y=3X+10 है, तो नया माध्य=3×50+10=160। स्थिरांक जोड़ने से मानक विचलन प्रभावित नहीं होता परंतु 3 से गुणा होने पर नया SD=3×5=15 होता है।
समाधान का रास्ता:Y=3X+10। नया mean =3×50+10=160। SD के लिए: केवल multiplicative constant (3) असर करता है, additive constant (10) नहीं। नया SD =3×5=15। Answer: 160 और 15।
क्यों यह प्रश्न: CV को reverse करके mean निकालना — यह NDA 2025 में पूछा गया pattern है। दोनों series के लिए अलग-अलग CV और SD दिए हैं, means पूछे हैं।
Previous Year Questionपिछले वर्ष का प्रश्न
The coefficient of variation of two series A and B are 60% and 70% respectively, and their standard deviations are 21 and 35. What are the means of A and B respectively?
दो श्रेणियों A और B के भिन्नता गुणांक क्रमशः 60% और 70% हैं, और उनके मानक विचलन 21 और 35 हैं। A और B के माध्य क्रमशः क्या हैं?
35 and 50
35 and 40
40 and 50
30 and 45
35 और 50
35 और 40
40 और 50
30 और 45
Solutionसमाधान
CV=SD/Mean×100. For A: 60=21/Mean_A×100, Mean_A=21×100/60=35. For B: 70=35/Mean_B×100, Mean_B=35×100/70=50.
CV=SD/माध्य×100। A के लिए: 60=21/माध्य_A×100, माध्य_A=35। B के लिए: 70=35/माध्य_B×100, माध्य_B=50।
समाधान का रास्ता:CV=xˉSD×100 को reverse करो: xˉ=CVSD×100। Series A: xˉA=6021×100=35। Series B: xˉB=7035×100=50। Answer: 35 और 50।
क्यों यह प्रश्न: Poisson distribution में P(X=1)=P(X=2) condition — इससे λ निकालना। यह shortcut pattern समझने पर 8 seconds का काम है।
Previous Year Questionपिछले वर्ष का प्रश्न
In a Poisson distribution, if P(X=1)=P(X=2), what is the mean of the distribution?
एक पॉइसन वितरण में, यदि P(X=1)=P(X=2) है, तो वितरण का माध्य क्या है?
1/2
1
2
3
1/2
1
2
3
Solutionसमाधान
For Poisson distribution P(X=r)=e^(−λ)·λʳ/r!. Setting P(X=1)=P(X=2): e^(−λ)·λ/1!=e^(−λ)·λ²/2!, so λ=λ²/2, giving λ=2. Hence the mean=2.
पॉइसन वितरण के लिए P(X=r)=e^(−λ)·λʳ/r!। P(X=1)=P(X=2) रखने पर: λ=λ²/2, अतः λ=2। इसलिए माध्य=2।
समाधान का रास्ता:P(X=1)=e−λλ और P(X=2)=e−λλ2/2। दोनों equal रखने पर: λ=λ2/2⇒λ=2। Poisson distribution का mean = λ=2।
आम गलतियाँ
Variance vs. SD की confusion: Question में "प्रसरण" पूछा हो पर σ (SD) दे दो, या "मानक विचलन" पूछा हो पर σ2 (Variance) दे दो। हमेशा final answer से पहले check करो — क्या square root लेना था?
Linear Transform में b को SD में जोड़ना:Y=3X+10 में नया SD = 3σ+10 लिखना सबसे common trap है। याद रखो: SD में केवल multiplicative factor असर करता है।
Raw Data Formula में n से भाग भूलना:σ2=∑X2−xˉ2 लिख देना। सही है σ2=n∑X2−xˉ2। n से भाग न लेने पर answer बहुत बड़ा आएगा।
CV comparison में उल्टा निष्कर्ष निकालना: "CV जितना ज़्यादा, उतना ज़्यादा consistent" — यह गलत है। CV कम = ज़्यादा consistent (stable)। CV ज़्यादा = ज़्यादा variable (unstable)।
Poisson में e−λ cancel करना भूलना:P(X=k)=P(X=k+1) में e−λ दोनों sides में common है — cancel करने के बाद calculation बहुत सरल हो जाती है।
Grouped data के Median formula में CF गलत लेना:CF median class की अपनी frequency नहीं, बल्कि उससे पहले की सभी classes की cumulative frequency है। यह distinction हमेशा confirm करो।