Analysis of Variance (ANOVA)– विचरण विश्लेषण |

परिचय
(Introduction)
Analysis of Variance (ANOVA) या विचरण विश्लेषण एक महत्वपूर्ण परामितीय (Parametric) सांख्यिकीय परीक्षण है, जिसका उपयोग तीन या तीन से अधिक समूहों (Groups) के माध्यों (Means) की तुलना करने के लिए किया जाता है।
ANOVA का विकास प्रसिद्ध सांख्यिकीविद् Sir Ronald A. Fisher (1925) ने किया था, इसलिए इसे F-Test भी कहा जाता है।
ANOVA का मुख्य उद्देश्य यह निर्धारित करना है कि विभिन्न समूहों के माध्यों में पाया गया अंतर वास्तविक (Significant) है या केवल संयोग (Random Chance) के कारण है।
परिभाषा (Definition)
Ronald A. Fisher के अनुसार,
“Analysis of Variance is a statistical technique used to test whether the means of three or more populations are equal.”
अर्थात् ANOVA एक सांख्यिकीय तकनीक है जिसके द्वारा तीन या तीन से अधिक जनसंख्याओं के माध्यों की समानता का परीक्षण किया जाता है।
ANOVA का उद्देश्य
(Objectives of ANOVA)
1. तीन या अधिक समूहों के माध्यों की तुलना करना।
2. समूहों के बीच वास्तविक अंतर का पता लगाना।
3. परिकल्पना (Hypothesis) का परीक्षण करना।
4. विभिन्न कारकों के प्रभाव का मूल्यांकन करना।
5. अनुसंधान निष्कर्षों की वैज्ञानिक पुष्टि करना।
6. कृषि, भूगोल, समाजशास्त्र, चिकित्सा एवं शिक्षा में समूहों की तुलना करना।
ANOVA का सिद्धांत
(Principle of ANOVA)
ANOVA इस सिद्धांत पर आधारित है कि कुल विचरण (Total Variance) को दो भागों में विभाजित किया जा सकता है-
1. समूहों के बीच का विचरण (Between Group Variance)
2. समूहों के भीतर का विचरण (Within Group Variance)
यदि समूहों के बीच का विचरण, समूहों के भीतर के विचरण की तुलना में अधिक है, तो यह माना जाता है कि समूहों के माध्यों में वास्तविक अंतर मौजूद है।
ANOVA का सूत्र (Formula)
F = Mean Square Between Groups (MSB)/Mean Square Within Groups (MSW)
जहाँ-
F = F-Statistic
MSB = समूहों के बीच का औसत विचरण
MSW = समूहों के भीतर का औसत विचरण
ANOVA की मूल परिकल्पनाएँ (Assumptions)
✍️ डेटा सामान्य वितरण (Normal Distribution) का होना चाहिए।
✍️ सभी समूह स्वतंत्र (Independent) होने चाहिए।
✍️ समूहों का विचरण समान (Homogeneity of Variance) होना चाहिए।
✍️ डेटा अंतराल (Interval) या अनुपात (Ratio) माप स्तर का होना चाहिए।
✍️ नमूने यादृच्छिक (Random Sampling) होने चाहिए।
ANOVA के प्रकार
(Types of ANOVA)
(क) One-Way ANOVA
(एक-मार्गीय ANOVA):
जब केवल एक स्वतंत्र चर (One Independent Variable) के आधार पर तीन या अधिक समूहों के माध्यों (Means) की तुलना की जाती है, तब One-Way ANOVA का उपयोग किया जाता है।
इसमें यह जाँचा जाता है कि विभिन्न समूहों के माध्य समान हैं या उनमें सांख्यिकीय रूप से महत्वपूर्ण अंतर है।
उदाहरण: एक शोधकर्ता यह जानना चाहता है कि बिहार, उत्तर प्रदेश एवं झारखंड में धान की औसत उत्पादकता (Quintal/Hectare) में कोई महत्वपूर्ण अंतर है या नहीं।
यहाँ-
स्वतंत्र चर (Independent Variable) = राज्य (3 समूह)
आश्रित चर (Dependent Variable) = धान की उत्पादकता
यदि ANOVA का परिणाम सार्थक (Significant) आता है, तो यह निष्कर्ष निकाला जाएगा कि कम-से-कम एक राज्य की औसत उत्पादकता अन्य राज्यों से भिन्न है।
(ख) Two-Way ANOVA
(दो-मार्गीय ANOVA):
जब दो स्वतंत्र चरों (Two Independent Variables) का एक आश्रित चर (Dependent Variable) पर संयुक्त (Combined) एवं पृथक (Individual) प्रभाव ज्ञात करना हो, तब Two-Way ANOVA का उपयोग किया जाता है।
यह केवल प्रत्येक कारक के प्रभाव का ही नहीं, बल्कि यह भी बताता है कि क्या दोनों कारक मिलकर (Interaction Effect) भी परिणाम को प्रभावित करते हैं।
उदाहरण: एक शोधकर्ता यह अध्ययन करना चाहता है कि वर्षा (Rainfall) तथा उर्वरक (Fertilizer) दोनों का गेहूँ उत्पादन पर क्या प्रभाव पड़ता है।
यहाँ-
स्वतंत्र चर-1 = वर्षा (कम, मध्यम, अधिक)
स्वतंत्र चर-2 = उर्वरक (कम, मध्यम, अधिक)
आश्रित चर = गेहूँ उत्पादन (क्विंटल/हेक्टेयर)
Two-Way ANOVA से निम्न तीन बातें ज्ञात होती हैं-
1. केवल वर्षा का प्रभाव।
2. केवल उर्वरक का प्रभाव।
3. वर्षा एवं उर्वरक के संयुक्त (Interaction) प्रभाव का विश्लेषण।
(ग) Repeated Measures ANOVA
(पुनरावृत्त मापन ANOVA):
जब एक ही समूह (Same Group) को अलग-अलग समय (Different Time) या अलग-अलग परिस्थितियों (Different Conditions) में बार-बार मापा जाता है, तब Repeated Measures ANOVA का उपयोग किया जाता है।
इसमें अलग-अलग समूह नहीं होते, बल्कि एक ही समूह का बार-बार अवलोकन (Repeated Observation) किया जाता है।
उदाहरण: एक शोधकर्ता पटना जिले की औसत वार्षिक वर्षा का अध्ययन 2020, 2022 एवं 2024 में करता है और यह जानना चाहता है कि इन वर्षों में वर्षा में कोई महत्वपूर्ण परिवर्तन हुआ है या नहीं।
यहाँ-
समूह = एक ही जिला (पटना)
समय = 2020, 2022 एवं 2024
आश्रित चर = औसत वार्षिक वर्षा
यदि ANOVA का परिणाम सार्थक होता है, तो निष्कर्ष निकाला जाएगा कि विभिन्न वर्षों में वर्षा में महत्वपूर्ण परिवर्तन हुआ है।
तीनों ANOVA का अंतर (Difference between Types of ANOVA)
| आधार | One-Way ANOVA | Two-Way ANOVA | Repeated Measures ANOVA |
| स्वतंत्र चर | 1 | 2 | सामान्यतः 1 (समय/स्थिति) |
| समूह | अलग-अलग समूह | अलग-अलग समूह | एक ही समूह |
| उद्देश्य | तीन या अधिक समूहों के माध्यों की तुलना | दो कारकों के प्रभाव एवं उनके संयुक्त प्रभाव का अध्ययन | एक ही समूह में समय या परिस्थितियों के अनुसार परिवर्तन का अध्ययन |
| उदाहरण | बिहार, यूपी एवं झारखंड की धान उत्पादकता | वर्षा एवं उर्वरक का गेहूँ उत्पादन पर प्रभाव |
2020, 2022 एवं 2024 में एक ही जिले की वर्षा की तुलना |
ANOVA करने की प्रक्रिया (Steps of ANOVA)
1. शून्य परिकल्पना (H₀) एवं वैकल्पिक परिकल्पना (H₁) बनाना।
2. महत्व स्तर (Significance Level, α = 0.05) निर्धारित करना।
3. Sum of Squares (SS) की गणना करना।
4. Degree of Freedom (df) ज्ञात करना।
5. Mean Square (MS) निकालना।
6. F-मूल्य की गणना करना।
7. F-Table से तुलना करना।
8. निष्कर्ष निकालना।
ANOVA सारणी (ANOVA Table)
| स्रोत | SS | df | MS | F |
| समूहों के बीच (Between Groups) | SSB | k−1 | MSB | F = MSB/MSW |
| समूहों के भीतर (Within Groups) | SSW | N−k | MSW | |
| कुल (Total) | SST | N−1 |
भूगोल में ANOVA के उपयोग
(Applications in Geography)
✍️ विभिन्न राज्यों की वर्षा की तुलना।
✍️ विभिन्न जिलों की जनसंख्या घनत्व का विश्लेषण।
✍️ भूमि उपयोग परिवर्तन का अध्ययन।
✍️ विभिन्न क्षेत्रों की कृषि उत्पादकता की तुलना।
✍️ जल गुणवत्ता का क्षेत्रीय विश्लेषण।
✍️ जलवायु परिवर्तन के प्रभावों का अध्ययन।
✍️ मिट्टी की उर्वरता की तुलना।
✍️ क्षेत्रीय विकास स्तर का मूल्यांकन।
ANOVA के लाभ (Advantages)
✍️ तीन या अधिक समूहों की एक साथ तुलना करता है।
✍️ समय एवं श्रम की बचत करता है।
✍️ Type-I Error की संभावना कम होती है।
✍️ वैज्ञानिक एवं विश्वसनीय परिणाम देता है।
✍️ सामाजिक एवं प्राकृतिक विज्ञानों में व्यापक उपयोग।
ANOVA की सीमाएँ (Limitations)
✍️ केवल यह बताता है कि अंतर है या नहीं; कौन-से समूह अलग हैं, यह नहीं बताता।
✍️ सामान्य वितरण की आवश्यकता होती है।
✍️ समान विचरण (Homogeneity) आवश्यक है।
✍️ Outliers परिणामों को प्रभावित कर सकते हैं।
✍️ यदि ANOVA सार्थक हो, तो Post Hoc Test (जैसे Tukey Test) करना पड़ता है।
ANOVA एवं t-Test में अंतर
| आधार | ANOVA | t-Test |
| समूहों की संख्या | 3 या अधिक | 2 |
| परीक्षण | F-Test | t-Test |
| उद्देश्य | कई समूहों के माध्य की तुलना | दो समूहों के माध्य की तुलना |
| विकासकर्ता | R. A. Fisher | W. S. Gosset (Student) |
One-Way ANOVA का उदाहरण (Solved Example)
प्रश्न (Example)
एक शोधकर्ता यह जानना चाहता है कि बिहार के तीन जिलों (पटना, गया और मुजफ्फरपुर) में गेहूँ की औसत उत्पादकता (क्विंटल/हेक्टेयर) में कोई महत्वपूर्ण अंतर है या नहीं।
डेटा (Yield in Quintal/Hectare)
| पटना | गया | मुजफ्फरपुर |
| 25 | 20 | 30 |
| 27 | 22 | 32 |
| 26 | 21 | 31 |
Step-1 : Hypothesis (परिकल्पना)
H₀ (Null Hypothesis):
तीनों जिलों की औसत उत्पादकता समान है।
H₁ (Alternative Hypothesis):
कम-से-कम एक जिले की औसत उत्पादकता अन्य से भिन्न है।
Step-2 : प्रत्येक समूह का Mean निकालें
पटना
\[
\bar{X}_{1}=\frac{25+27+26}{3}=26
\]
गया
\[
\bar{X}_{2}=\frac{20+22+21}{3}=21
\]
मुजफ्फरपुर
\[
\bar{X}_{3}=\frac{30+32+31}{3}=31
\]
Grand Mean (संपूर्ण माध्य)
सभी 9 मानों का योग
= 25+27+26+20+22+21+30+32+31
= 234
\[
\bar{X}=\frac{234}{9}=26
\]
Step-3 : Between Group Sum of Squares (SSB)
सूत्र
\[
SSB=\sum n(\bar{X}_i-\bar{X})^2
\]
जहाँ
n = 3
पटना
$$
3(26-26)^2=0
$$
गया
$$
3(21-26)^2
$$
= 3×25
= 75
मुजफ्फरपुर
$$
3(31-26)^2
$$
= 3×25
= 75
अतः
SSB = 0+75+75=150
Step-4 : Within Group Sum of Squares (SSW)
पटना
\[
(25-26)^2+(27-26)^2+(26-26)^2
\]
=1+1+0=2
गया
\[
(20-21)^2+(22-21)^2+(21-21)^2
\]
=1+1+0=2
मुजफ्फरपुर
\[
(30-31)^2+(32-31)^2+(31-31)^2
\]
= 1+1+0=2
अतः SSW = 2+2+2 = 6
Step-5 : Total Sum of Squares
SST = SSB+SSW
= 150+6
= 156
Step-6 : Degree of Freedom (df)
Number of Groups (k) = 3
Total Observation (N) = 9
Between Groups
df = k−1
= 3−1
= 2
Within Groups
df = N−k
= 9−3
= 6
Step-7 : Mean Square निकालें
Mean Square Between
MSB = 150/2 = 75
Mean Square Within
MSW = 6/6 = 1
Step-8 : F-value निकालें
F = MSB/MSW
F = 75/1
= 75
Step-9 : ANOVA Table
| Source | SS | df | MS | F |
| Between Groups | 150 | 2 | 75 | 75 |
| Within Groups | 6 | 6 | 1 | |
| Total | 156 | 8 |
Step-10 : Decision (निर्णय)
5% महत्व स्तर (α = 0.05) पर
df₁ = 2
df₂ = 6
F-Table ≈ 5.14
Fcal = 75
क्योंकि 75 > 5.14
अतः Null Hypothesis (H₀) अस्वीकार (Reject) की जाएगी
Final Conclusion (निष्कर्ष)
पटना, गया एवं मुजफ्फरपुर जिलों की गेहूँ की औसत उत्पादकता में सांख्यिकीय रूप से महत्वपूर्ण अंतर (Statistically Significant Difference) पाया गया। अर्थात तीनों जिलों की उत्पादकता समान नहीं है।
Leave a Reply