חלק ג: מהמדגם לאוכלוסייה · פרק 17
התפלגות הדגימה
עד עכשיו תיארנו את 200 התלמידים שלנו. אבל אף אחד לא עורך מחקר רק כדי לדעת משהו על 200 תלמידים מסוימים. רוצים לדעת משהו על כל התלמידים בגילם. בפרק הזה נשאל מה היה קורה אילו בחרנו תלמידים אחרים, ונגלה שאפשר לענות על השאלה הזו גם כשיש בידינו מדגם אחד בלבד. התשובה, התפלגות הדגימהSampling distribution, היא הבסיס של כל מבחן סטטיסטי בהמשך הספר.
החרדה הממוצעת של התלמידים במחקר היא 2.24. אילו בחרנו 200 תלמידים אחרים, מאותה אוכלוסייה, האם היינו מקבלים שוב 2.24?
כמעט בטוח שלא. אבל גם לא משהו רחוק: בדרך כלל הממוצע היה זז בכ־0.04 בלבד, ורק לעיתים רחוקות הפער היה גדול מ־0.07. איך אפשר לדעת את זה, כשאין לנו שום מדגם אחר? בסוף הפרק תדעו לחשב את המספר הזה בשורה אחת, ותבינו למה החישוב עובד גם כשהנתונים עצמם אינם נורמליים.
בסוף הפרק תוכלו
- להסביר מהו אומדEstimator, ומה פירוש "חסר הטיה" ו"עקיב".
- להראות, בדוגמה קטנה ובסימולציה, למה אומדים את השונות בחלוקה ב־n − 1.
- לתאר את התפלגות הדגימה של הממוצע: המרכז, הרוחב והצורה שלה.
- לחשב , טעות התקןStandard error, ולהבחין בינה לבין סטיית התקן.
- להסביר מה אומר משפט הגבול המרכזיCentral limit theorem, ומתי אפשר לסמוך עליו.
- לחשב ציון תקן של ממוצעz for a sample mean, ומשם את הסיכוי לקבל ממוצע כזה.
מהמדגם לאוכלוסייה
את הפרמטר, למשל ממוצע האוכלוסייה , אי אפשר לחשב: אין לנו את כל האוכלוסייה. לכן אומדים אותו בעזרת סטטיסטי מהמדגם, למשל . כל מדגם נותן אומדןEstimate קצת אחר. ההבדל בין האומדן לפרמטר, שנובע רק מהשאלה מי נבחר במקרה למדגם, נקרא טעות דגימהSampling error.
בפרק 10 הבחנו בין סטטיסטי, מספר שמחושב על המדגם, לבין פרמטר, אותו מספר באוכלוסייה כולה. בחלק ב עסקנו רק בסטטיסטים: תיארנו את 200 התלמידים. מעכשיו נשאל את השאלה שבשבילה בכלל עושים מחקר: מה הסטטיסטים אומרים על הפרמטרים?
מה רוצים לדעת? למשל, את רמת החרדה הממוצעת של כל התלמידים בכיתות ד׳ ו־ה׳ בישראל. זה פרמטר, , ואי אפשר לחשב אותו: אין לנו את כל התלמידים. מה יש לנו? מדגם של 200 תלמידים, שהממוצע שלהם M = 2.24. כשמשתמשים בסטטיסטי כדי לנחש את הפרמטר, הוא נקרא אומדןEstimate. הכלל שלפיו מחשבים אותו, למשל "סכום הערכים חלקי n", נקרא אומד. ומכיוון שהאומדן הוא מספר אחד, הוא נקרא גם אומדן נקודתיPoint estimate. בפרק 19 נכיר גם אומדן שהוא טווח.
| הפרמטר (באוכלוסייה) | האומד (מהמדגם) | |
|---|---|---|
| ממוצע | ||
| שונות | σ² | , בחלוקה ב־n − 1 (פרק 11) |
| סטיית תקן | σ | , בחלוקה ב־n − 1 |
והבעיה: כל מדגם נותן אומדן קצת אחר.
ניסוי מחשבתי: 200 התלמידים כאוכלוסייהExperiment
כדי לראות את זה, נעשה תרגיל שאי אפשר לעשות במחקר אמיתי: נעמיד פנים ש־200 התלמידים שלנו הם כל האוכלוסייה. אז ידוע לנו: 2.24 (בדיוק 2.2356). עכשיו נגריל מתוכם מדגם של 10 תלמידים, ונחשב את הממוצע שלו. ושוב, ושוב. הנה שישה מדגמים כאלה, שהמחשב הגריל:
| מדגם 1 | מדגם 2 | מדגם 3 | מדגם 4 | מדגם 5 | מדגם 6 | |
|---|---|---|---|---|---|---|
| M | 2.25 | 2.40 | 1.78 | 2.14 | 2.00 | 2.22 |
ממוצע האוכלוסייה הוא μ = 2.24. אף מדגם לא נתן אותו בדיוק. אחד קרוב מאוד (2.25), ואחד רחוק (1.78): במקרה הוגרלו אליו כמה תלמידים רגועים במיוחד.
שום דבר לא השתבש כאן. לא טעינו בחישוב, ולא בחרנו את התלמידים בצורה מוטה: ההגרלה הייתה הוגנת. ההבדלים נובעים רק מהמקרה, ממי שנבחר למדגם. לזה קוראים טעות דגימהSampling error.
ובמחקר אמיתי המצב גרוע יותר: יש לנו רק מדגם אחד, ואנחנו לא יודעים את . אז איך נדע כמה לסמוך על הממוצע שקיבלנו? זו השאלה של כל הפרק. והדרך לענות עליה מפתיעה: שואלים מה היה קורה אילו חזרנו על הדגימה הרבה מאוד פעמים.
המילה "טעות" מטעה כאן. טעות דגימה אינה שגיאה של מישהו, ואי אפשר להימנע ממנה: כל עוד מודדים רק חלק מהאוכלוסייה, האומדן יזוז ממדגם למדגם. אבל היא מתנהגת יפה: לפעמים היא למעלה, לפעמים למטה, ובממוצע מתקזזת. וככל שהמדגם גדול יותר, היא קטנה יותר.
חשוב להבדיל בינה לבין הטיית דגימה, שפגשנו בפרק 7. אם חוקרת מחלקת שאלונים רק לתלמידים שהתנדבו להישאר אחרי השיעור, המדגם שלה שונה מהאוכלוסייה באופן שיטתי. זו כבר לא טעות מקרית שמתקזזת. היא מושכת תמיד לאותו כיוון, ומדגם גדול יותר לא יתקן אותה. כל מה שנלמד בפרק הזה מניח מדגם מקרי, ועוסק רק בטעות הדגימה.
מורה לחשבון מחשבת את הציון הממוצע של 32 התלמידים בכיתה שלה במבחן. א. אם היא רוצה לדעת איך הכיתה שלה הצליחה, האם יש כאן טעות דגימה? ב. ואם היא רוצה להסיק מהממוצע על כל תלמידי כיתות ה׳ בעיר? ג. בשני המקרים, מהו 32?
בדיקת התשובה
א. לא. אם שואלים רק על הכיתה הזו, 32 התלמידים הם כל האוכלוסייה, והממוצע הוא פרמטר. אין ממי לדגום. ב. כן. עכשיו הכיתה היא מדגם, והממוצע שלה הוא אומדן לממוצע של כל תלמידי העיר. כיתה אחרת הייתה נותנת ממוצע אחר. וגם יותר מזה: כיתה אחת אינה מדגם מקרי של העיר, ולכן ייתכן שיש גם הטיית דגימה. ג. במקרה א׳ זה גודל האוכלוסייה, ובמקרה ב׳ גודל המדגם, .
בדקו את עצמכם3 שאלות
1.איזה מהבאים הוא פרמטר?
2.שתי חוקרות דגמו באקראי, כל אחת 50 תלמידים מאותה אוכלוסייה, ומדדו קשיבות באותו שאלון. אחת קיבלה ממוצע 3.31, והשנייה 3.18. מה ההסבר הסביר ביותר?
3.למה הגדלת המדגם מקטינה את טעות הדגימה, אבל לא מתקנת הטיית דגימה?
אומד טוב: חסר הטיה ועקיב
אומד הוא חסר הטיה אם בממוצע, על פני כל המדגמים האפשריים, הוא פוגע בדיוק בפרמטר. הוא עקיב אם ככל שהמדגם גדל, האומדנים מתקרבים לפרמטר. הממוצע הוא אומד חסר הטיהUnbiased estimator ועקיב ל־. השונות בחלוקה ב־n − 1 היא אומד חסר הטיה ל־σ², ואילו החלוקה ב־n נותנת, בממוצע, ערך נמוך מדי.
אם כל מדגם נותן אומדן אחר, מה הופך אומד ל"טוב"? שתי תכונות:
- חסר הטיה. חשבו על משקל ביתי. משקל אחד מוסיף לכולם קילו, תמיד: הוא מוטה. משקל אחר טועה לפעמים קצת למעלה ולפעמים קצת למטה, ובממוצע לא טועה בכלל: הוא חסר הטיה. כך גם אומד: אם היינו לוקחים את כל המדגמים האפשריים, הממוצע של כל האומדנים היה שווה בדיוק לפרמטר. האומד לא נוטה, באופן שיטתי, להיות גבוה מדי או נמוך מדי.
- עקיב. ככל שהמדגם גדול יותר, האומדנים מתרכזים קרוב יותר לפרמטר. במדגם ענק, כמעט כל מדגם ייתן ערך קרוב מאוד לאמת.
שימו לב: חסר הטיה אינו אומר שכל מדגם פוגע בפרמטר. ראינו שממוצע המדגם הוא אומד חסר הטיהUnbiased estimator, ובכל זאת אף אחד מששת המדגמים לא נתן בדיוק 2.24. חסר הטיה מתאר את כל המדגמים יחד, לא מדגם אחד.
דוגמה קטנה: כל המדגמים האפשריים
בפרק 11 אמרנו שבחלוקה ב־n − 1 מקבלים אומדן טוב יותר לשונות האוכלוסייהPopulation variance, והבטחנו להראות את זה. הנה דוגמה קטנה מספיק כדי לראות בה את כל המדגמים האפשריים.
בכיתה זעירה שלושה תלמידים, ולהם 1, 2 ו־3 אחים. זו כל האוכלוסייה, ולכן אפשר לחשב את הפרמטרים שלה. כאן מחלקים ב־N, כי אלה באמת כל הערכים (המקרה היחיד שבו פרק 11 התיר את זה):
עכשיו דוגמים שני תלמידים עם החזרה: מגרילים תלמיד, רושמים את מספר האחים שלו, מחזירים אותו להגרלה, ומגרילים שוב. יש 3 × 3 = 9 מדגמים אפשריים, וכולם באותו סיכוי. לכל אחד מחשבים ממוצע, את סכום הריבועיםSum of squares SS (פרק 11), ואת השונות בשתי הדרכים:
| המדגם | M | SS | SS / n | SS / (n − 1) |
|---|---|---|---|---|
| 1, 1 | 1 | 0 | 0 | 0 |
| 1, 2 | 1.5 | 0.5 | 0.25 | 0.5 |
| 1, 3 | 2 | 2 | 1 | 2 |
| 2, 1 | 1.5 | 0.5 | 0.25 | 0.5 |
| 2, 2 | 2 | 0 | 0 | 0 |
| 2, 3 | 2.5 | 0.5 | 0.25 | 0.5 |
| 3, 1 | 2 | 2 | 1 | 2 |
| 3, 2 | 2.5 | 0.5 | 0.25 | 0.5 |
| 3, 3 | 3 | 0 | 0 | 0 |
| ממוצע | 2 | 0.67 | 0.33 | 0.67 |
הסתכלו על השורה האחרונה. ממוצע כל ממוצעי המדגמים הוא 2, בדיוק μ: חסר הטיה. ממוצע השונויות בחלוקה ב־n − 1 הוא 0.67, בדיוק σ²: חסר הטיה. אבל ממוצע השונויות בחלוקה ב־n הוא רק 0.33, חצי מהאמת: מוטה, נמוך מדי באופן שיטתי.
ועוד דבר: אף מדגם בודד לא נתן שונות של 0.67. האומדנים נעים בין 0 ל־2. ובכל זאת, בממוצע, האומד חסר ההטיה פוגע בדיוק.
למה בדיוק חצי? בפרק 11 ראינו שבממוצע, SS / n שווה ל־(n − 1) / n משונות האוכלוסייה. כאן n = 2, ולכן 1/2. במדגמים של 5 זה יהיה 4/5, ובמדגמים של 20, 19/20.
ובמדגמים מהנתונים שלנו
נחזור לניסוי המחשבתי: 200 התלמידים הם האוכלוסייה. שונות החרדה שלהם, בחלוקה ב־N, היא σ² = 0.2679. המחשב הגריל 10,000 מדגמים בכל גודל, ולכל מדגם חישב את השונות בשתי הדרכים:
| גודל המדגם | ממוצע SS / n | ממוצע s² = SS / (n − 1) | (n − 1) / n |
|---|---|---|---|
| 2 | 0.1320 | 0.2640 | 50% |
| 3 | 0.1797 | 0.2695 | 67% |
| 5 | 0.2132 | 0.2665 | 80% |
| 10 | 0.2415 | 0.2684 | 90% |
| 20 | 0.2549 | 0.2683 | 95% |
העמודה של s² מתנדנדת סביב 0.2679 בכל גודל מדגם: חסרת הטיה. העמודה של החלוקה ב־n נמוכה תמיד, בערך באחוז שבעמודה האחרונה. במדגמים של 5, למשל, 0.2132 / 0.2679 = 0.80. וככל שהמדגם גדל, הפער קטן.
ומכאן גם הבדל עדין בין שתי התכונות. גם החלוקה ב־n מתקרבת ל־σ² כשהמדגם גדל, ולכן היא עקיבה. אבל בכל גודל מדגם היא נמוכה מדי, ולכן היא מוטה. אומד יכול להיות עקיב ומוטה בבת אחת.
בפרק 11 הזכרנו שגם עם n − 1, סטיית התקן עצמה, השורש של s², קטנה מעט מ־σ בממוצע. בסימולציה רואים את זה: במדגמים של 5, הממוצע של הוא 0.4904, בעוד σ = 0.5176. במדגמים של 20 הפער כבר קטן: 0.5130. הסיבה: שורש של ממוצע אינו ממוצע של שורשים. ההטיה הזו קטנה, היא נעלמת כשהמדגם גדל, וכל התוכנות והמאמרים משתמשים ב־ עם n − 1. זו המוסכמה.
מעבדה: אומד חסר הטיה
- קבעו מדגמים של 3, ולחצו כמה פעמים על "דגמו 500 מדגמים". לאן מתקרב כל קו?
- הגדילו את המדגם ל־20 ודגמו שוב. מה קרה לפער בין הקווים?
- בלי ללחוץ: לאיזה מספר יתקרב ממוצע SS / n במדגמים של 10?
בדיקת התשובה
1. הקו של s² מתקרב ל־100, שונות האוכלוסייהPopulation variance. הקו של החלוקה ב־n מתקרב ל־67 בערך: 100 · 2/3. 2. הפער קטן מאוד: החלוקה ב־n מתקרבת ל־95, כלומר 100 · 19/20. 3. ל־90: 100 · 9/10.
א. סטודנט טוען: "s² הוא אומד חסר הטיה, ולכן במחקר שלי השונות שחישבתי שווה לשונות האוכלוסייה." מה לא נכון בטענה? ב. חוקרת דוגמת שוב ושוב 4 תלמידים, ומחלקת ב־n. שונות האוכלוסייה היא 0.40. לאיזה ממוצע של אומדנים היא תגיע אחרי הרבה מדגמים?
בדיקת התשובה
א. חסר הטיה מתאר את הממוצע על פני כל המדגמים האפשריים, לא מדגם אחד. בדוגמת שלושת התלמידים אף מדגם לא נתן את השונות הנכונה. במחקר מסוים השונות יכולה לצאת גבוהה או נמוכה מהאמת. ב.
בדקו את עצמכם3 שאלות
1.חוקר דוגם שוב ושוב מדגמים של 8 תלמידים, ומחשב בכל מדגם שונות בחלוקה ב־nVariance dividing by n. שונות האוכלוסייה היא 40. לאיזה ממוצע של אומדנים הוא יגיע אחרי הרבה מדגמים?
2.איזה תיאור מתאים לשונות בחלוקה ב־n, כאומד לשונות האוכלוסייה?
3.בכיתה זעירה שני תלמידים. לאחד 0 ספרים בבית, ולשני 4. דוגמים שני תלמידים עם החזרה. כתבו את ארבעת המדגמים האפשריים, חשבו לכל אחד s² = SS / (n − 1), ובדקו אם הממוצע שלהם שווה לשונות האוכלוסייה.
התפלגות הדגימה של הממוצע
התפלגות הדגימה של הממוצע היא ההתפלגות של הממוצעים של כל המדגמים האפשריים בגודל n מאותה אוכלוסייה. זו התפלגות של סטטיסטי, לא של אנשים. יש לה שלוש תכונות: המרכז שלה הוא , היא צרה בהרבה מההתפלגות של האנשים עצמם, וככל שהמדגם גדל, היא קרובה יותר לנורמלית.
עד עכשיו כל התפלגות שציירנו הייתה התפלגות של אנשים: כמה תלמידים קיבלו כל ציון. עכשיו נצייר התפלגות של ממוצעים. כך בונים אותה, לפחות בדמיון:
- לוקחים מדגם מקרי בגודל n מהאוכלוסייה, ומחשבים את הממוצע שלו.
- מחזירים את המדגם, לוקחים עוד מדגם באותו גודל, ומחשבים שוב ממוצע.
- חוזרים על זה שוב ושוב. בתאוריה, אינסוף פעמים.
ההתפלגות של כל הממוצעים האלה היא התפלגות הדגימה של הממוצע. במחקר אמיתי לוקחים מדגם אחד בלבד, ולכן התפלגות הדגימה היא כלי תאורטי. אבל זה כלי חזק מאוד: הוא אומר אילו ממוצעים סביר לקבל, ואילו נדירים.
בדוגמת שלושת התלמידים כבר בנינו התפלגות כזו, עם תשעה ממוצעים:
| הממוצע | 1 | 1.5 | 2 | 2.5 | 3 |
|---|---|---|---|---|---|
| מספר המדגמים | 1 | 2 | 3 | 2 | 1 |
| ההסתברות | 1/9 | 2/9 | 3/9 | 2/9 | 1/9 |
באוכלוסייה כל ערך מופיע באותה שכיחות: תלמיד אחד עם 1, אחד עם 2, ואחד עם 3. ההתפלגות שטוחה. אבל הממוצעים מתרכזים סביב 2. למה? כי ממוצע קיצוני, 1 או 3, דורש ששני התלמידים במדגם יהיו קיצוניים באותו כיוון. זה קורה רק בדרך אחת. לממוצע 2 מגיעים בשלוש דרכים.
ובנתונים שלנו: 10,000 מדגמים
ועכשיו על הנתונים שלנו. המחשב הגריל 10,000 מדגמים של 25 תלמידים מתוך ה־200, וחישב לכל מדגם את החרדה הממוצעת. למעלה, ההתפלגות של התלמידים עצמם. למטה, ההתפלגות של 10,000 הממוצעים, על אותו ציר:
anx_pre). למטה: הממוצעים של 10,000 מדגמים מקריים של 25 תלמידים מתוכם, ועליהם העקומה הנורמליתNormal distribution עם ממוצע μ וסטיית תקן σ / √25. לכל חלונית סולם גובה משלה.שלוש תצפיות:
- המרכז זהה. ממוצע 10,000 הממוצעים הוא 2.2352, וממוצע האוכלוסייה 2.2356. זה מה שראינו בסעיף הקודם: הממוצע הוא אומד חסר הטיה.
- הרוחב קטן בהרבה. התלמידים נעים בין 1.13 ל־3.75. הממוצעים נעים רק בין 1.82 ל־2.64. סטיית התקן של התלמידים 0.52, ושל הממוצעים רק 0.10.
- הצורה נורמלית יותר. ההתפלגות של התלמידים קצת מוטה ימינה (הטיה 0.22) ו"משוננת". הממוצעים יוצרים פעמון סימטרי (הטיה 0.03), שיושב כמעט בדיוק על העקומה הנורמלית.
כל אחת מהתצפיות היא נושא של סעיף: המרכז כבר הוסבר, הרוחב בסעיף 4, והצורה בסעיף 5.
ולמה הממוצעים מפוזרים הרבה פחות מהתלמידים? דמיינו כיתה של 35 סטודנטים, כל אחד בגובה אחר. עכשיו מחלקים אותם לשורות של חמישה, ומחשבים לכל שורה גובה ממוצע. בכל שורה יהיו, במקרה, גם גבוהים וגם נמוכים, והם יאזנו זה את זה. לכן ההבדלים בין ממוצעי השורות קטנים מההבדלים בין הסטודנטים. בשורות של עשרה, הסיכוי ששורה שלמה תהיה של נמוכים קטן עוד יותר, והממוצעים דומים עוד יותר. ובקיצוניות: אם כל "שורה" היא כל הכיתה, כל הממוצעים זהים, ואין ביניהם הבדל בכלל.
בכל הסימולציות בפרק דגמנו עם החזרה: אותו תלמיד יכול להופיע פעמיים באותו מדגם. למה? כי כך ה־200 מתנהגים כמו אוכלוסייה ענקית עם אותה צורה בדיוק, וכל הגרלה אינה תלויה בקודמות. אילו דגמנו בלי החזרה מאוכלוסייה קטנה, הממוצעים היו מפוזרים קצת פחות. כשהאוכלוסייה גדולה בהרבה מהמדגם, כמו כל תלמידי ישראל מול 200, אין לזה כמעט השפעה.
ומה שעשינו כאן, לקחת את המדגם שלנו, להתייחס אליו כאל אוכלוסייה ולדגום ממנו שוב ושוב עם החזרה, הוא בדיוק הרעיון של שיטה בשם bootstrap, שהציע ברדלי אפרון מסטנפורד (Efron, 1979). במקום לגזור את התפלגות הדגימה מנוסחה, בונים אותה מהנתונים עצמם. כך אפשר להעריך עד כמה סטטיסטי "קופץ" ממדגם למדגם, גם כשאין לו נוסחה פשוטה, למשל לחציוןMedian. השיטה דורשת הרבה פחות הנחות, אבל לא אפס: היא מניחה שהמדגם מקרי ומייצג, ובמדגמים קטנים מאוד היא לא מדויקת.
מעבדה: התפלגות הדגימה של הממוצע
- לחצו כמה פעמים על "דגמו מדגם אחד". כל נקודה צהובה היא ערך במדגם. לאן נופל הממוצע של המדגם בהיסטוגרמהHistogram התחתונה?
- באוכלוסייה המוטה, עם n = 25, דגמו 1000 מדגמים. השוו את ממוצע הממוצעים ל־μ, ואת סטיית התקן של הממוצעים לכרטיס "טעות התקן".
- שנו את גודל המדגם ל־5 ואחר כך ל־100, ודגמו שוב. מה קורה לרוחב ולצורה?
בדיקת התשובה
1. כל מדגם מוסיף עמודה קטנה אחת, במקום של הממוצע שלו. 2. ממוצע הממוצעים כמעט שווה ל־μ, וסטיית התקן של הממוצעים כמעט שווה ל־σ / √n. 3. עם 5, ההתפלגות רחבה ועדיין מוטה מעט. עם 100, היא צרה מאוד, ונראית נורמלית לגמרי, אף שהאוכלוסייה מוטה.
א. מה רחב יותר: ההתפלגות של ציוני הקשיבות של תלמידים, או התפלגות הדגימה של הממוצע של מדגמים בני 10? ב. באיזה גודל מדגם התפלגות הדגימה של הממוצע זהה בדיוק להתפלגות באוכלוסייה? ג. האם אפשר לבנות התפלגות דגימה גם לחציוןMedian, או לסטיית התקן?
בדיקת התשובה
א. ההתפלגות של התלמידים. ממוצעים של 10 תלמידים מאזנים בין גבוהים לנמוכים, ולכן הם דומים זה לזה יותר מהתלמידים עצמם. ב. ב־n = 1: "הממוצע" של תלמיד אחד הוא פשוט הציון שלו. ג. כן. לכל סטטיסטי יש התפלגות דגימה: מחשבים אותו בכל מדגם, וחוזרים שוב ושוב. בספר נעסוק בעיקר בהתפלגות הדגימה של הממוצע, ובהמשך גם של הפרש בין ממוצעים ושל המתאםCorrelation.
בדקו את עצמכם3 שאלות
1.חוקרת ציירה היסטוגרמה של 500 ממוצעים של מדגמים בני 20 תלמידים. מה סופרת כל עמודה בהיסטוגרמה?
2.באוכלוסייה שלושה תלמידים, עם הציונים 2, 4 ו־6. דוגמים שני תלמידים עם החזרה. מה ההסתברות שממוצע המדגם יהיה 4?
3.הסבירו במילים שלכם: למה הממוצעים של מדגמים בני 25 תלמידים מפוזרים הרבה פחות מהציונים של התלמידים עצמם?
טעות התקן
סטיית התקן של התפלגות הדגימה נקראת טעות התקן. כשסטיית התקן באוכלוסייה ידועה, היא σ / √n. במחקר, כש־σ לא ידועה, אומדים אותה מהמדגם: SE = SD / √n. טעות התקן אומרת בכמה, בערך, ממוצע של מדגם רחוק מ־. כדי לחצות אותה, צריך מדגם גדול פי ארבעה.
כמה רחבה התפלגות הדגימה? את הרוחב מודדים, כמו כל רוחב, בסטיית תקן. אבל לסטיית התקן של הממוצעים יש שם משלה, כי משתמשים בה כל כך הרבה: טעות התקן (Standard Error). את הגרסה שלה עם σ מסמנים σM: σ כי זו סטיית תקן, ו־M כי זו סטיית התקן של הממוצעים. והיא תלויה בשני דברים בלבד:
- במונה, סטיית התקן באוכלוסייה. ככל שהתלמידים שונים יותר זה מזה, הממוצע "קופץ" יותר ממדגם למדגם. אם כל התלמידים היו זהים, כל מדגם היה נותן אותו ממוצע.
- במכנה, השורש של גודל המדגם. ככל שהמדגם גדול יותר, יש בו יותר תלמידים שמאזנים זה את זה, והממוצע יציב יותר.
האם הנוסחה עובדת? בניסוי המחשבתי, סטיית התקן של 200 התלמידים (בחלוקה ב־N, כי הם כל האוכלוסייה) היא σ = 0.5176. המחשב הגריל 10,000 מדגמים בכל גודל, וחישב את סטיית התקן של הממוצעים:
| גודל המדגם | לפי הנוסחה: σ / √n | בסימולציה: סטיית התקן של 10,000 ממוצעים |
|---|---|---|
| 1 | 0.5176 / 1 = 0.5176 | 0.5202 |
| 5 | 0.5176 / 2.236 = 0.2315 | 0.2323 |
| 10 | 0.5176 / 3.162 = 0.1637 | 0.1632 |
| 25 | 0.5176 / 5 = 0.1035 | 0.1033 |
| 100 | 0.5176 / 10 = 0.0518 | 0.0518 |
הנוסחה והסימולציה מסכימות כמעט עד הספרה האחרונה.
פי ארבעה תלמידים, חצי טעות
שימו לב לשורות של 25 ו־100. המדגם גדל פי ארבעה, וטעות התקן קטנה רק פי שניים: מ־0.1035 ל־0.0518. הסיבה היא השורש: √4 = 2. כדי לחצות את טעות התקן צריך מדגם גדול פי ארבעה, וכדי להקטין אותה פי ארבעה, מדגם גדול פי 16. כל שיפור בדיוק עולה הרבה תלמידים. ובשורה הראשונה: עם תלמיד אחד, טעות התקן שווה לסטיית התקן, כי "הממוצע" של תלמיד אחד הוא הציון שלו.
במחקר אמיתי: SE = SD / √n
בניסוי המחשבתי ידענו את σ. במחקר אמיתי לא יודעים אותה, ולכן מציבים במקומה את האומדן שלה מהמדגם, . זו טעות התקן שכל התוכנות מדווחות, ושנשתמש בה עד סוף הספר. (בפרקים 18 ו־19 נעבוד עם נורמות שבהן σ ידועה, ושם נכתוב בקיצור גם SE = σ / √n.)
בחרדה לפני התוכנית, SD = 0.5189 ו־n = 200:
אילו חזרנו על המחקר עם 200 תלמידים אחרים, מאותה אוכלוסייה, הממוצע היה זז בדרך כלל בכ־0.04. ומכיוון שהתפלגות הדגימה נורמלית, לפי כלל 68־95־99.7Empirical rule רק כ־5% מהמדגמים היו נותנים ממוצע שרחוק מ־μ יותר מ־0.07. זו התשובה לשאלת הפתיחה, וקיבלנו אותה ממדגם אחד בלבד. בפרק 19 נהפוך את הרעיון הזה לרווח סמךConfidence interval.
| סטיית התקן, | טעות התקן, | |
|---|---|---|
| מה היא מתארת | כמה התלמידים שונים זה מזה | כמה הממוצע היה משתנה ממדגם למדגם |
| כשהמדגם גדל | לא משתנה באופן שיטתי: התלמידים לא נעשים דומים יותר | קטנה, כמו 1 / √n |
| אצלנו, בחרדה | 0.52 | 0.037 |
| מתי מדווחים | כדי לתאר את המשתתפים | כדי לתאר עד כמה הממוצע מדויק |
בגרפים עם קווי שגיאה (ה"שפמים" מעל העמודות) בדקו תמיד מה הם מציגים. קווים של SE קצרים בהרבה מקווים של SD, ומי שמבלבל ביניהם יחשוב שהקבוצות שונות או דומות הרבה יותר ממה שהן.
החרדה לפני התוכנית, בשלוש קבוצות המחקר:
| הקבוצה | n | M | SD | SE = SD / √n |
|---|---|---|---|---|
| ביקורת | 74 | 2.32 | 0.53 | 0.5279 / √74 = 0.061 |
| תוכנית עקיפה | 51 | 2.17 | 0.53 | 0.5350 / √51 = 0.075 |
| תוכנית משולבת | 75 | 2.19 | 0.49 | 0.4930 / √75 = 0.057 |
הממוצע של התוכנית העקיפה הוא הפחות מדויק: הקבוצה הכי קטנה, וגם סטיית התקן שלה הכי גדולה. כדי לחצות את טעות התקן שלה, היו צריכים פי ארבעה תלמידים: 204.
עם טעות התקן ביד, אפשר סוף סוף להסביר מאיפה בא ה־n − 1, בלי מתמטיקה קשה. יש זהות אלגברית פשוטה: סכום הריבועים סביב μ שווה לסכום הריבועים סביב M, ועוד n · (M − μ)². כלומר:
עכשיו לוקחים ממוצע על פני כל המדגמים. כל ריבוע של מרחק מ־μ שווה, בממוצע, ל־σ², ולכן ה־SS סביב μ שווה בממוצע ל־n · σ². ו־(M − μ)² הוא ריבוע המרחק של הממוצע מ־μ, ולכן בממוצע הוא בדיוק טעות התקן בריבוע: σ² / n. ביחד:
ולכן, כדי לקבל בממוצע בדיוק את σ², מחלקים ב־n − 1. ה"אחד" שהולך לאיבוד הוא בדיוק השונות של הממוצע סביב μ. בדקו בדוגמת שלושת התלמידים: σ² = 2/3 ו־n = 2, ולכן ממוצע ה־SS צריך להיות 1 · 2/3 = 0.67. וזה מה שיצא בטבלה.
במבחן ארצי, סטיית התקן של הציונים באוכלוסייה היא 18. א. מהי טעות התקן של הממוצע במדגמים של 9 תלמידים? ב. ובמדגמים של 36? ג. כמה תלמידים צריך כדי שטעות התקן תהיה 1.5?
בדיקת התשובה
בדקו את עצמכם3 שאלות
1.סטיית התקן באוכלוסייה היא 14. מהי טעות התקן של הממוצע במדגמים של 49?
2.מה יקרה לטעות התקן אם סטיית התקן באוכלוסייה תהיה כפולה, וגם המדגם יהיה גדול פי 4?
3.בתלונות הגופניות לפני התוכנית (soma_pre), סטיית התקן היא 0.5007, ו־n = 200. מהי טעות התקן? ומה היא הייתה, עם אותה סטיית תקן, אילו השתתפו רק 51 תלמידי התוכנית העקיפה?
משפט הגבול המרכזי
משפט הגבול המרכזי: כשהמדגם גדול, התפלגות הדגימה של הממוצע קרובה לנורמלית, כמעט בלי קשר לצורת ההתפלגות באוכלוסייה. ואם האוכלוסייה עצמה נורמלית, התפלגות הדגימה נורמלית בכל גודל מדגם. כלל האצבע: 30 ומעלה. בהתפלגות מוטה מאוד, או עם ערכים קיצונייםOutlier, צריך יותר.
התכונה השלישית של התפלגות הדגימה היא הצורה. בחרדה הצורה כבר בהתחלה הייתה קרובה לפעמון. מה קורה כשהאוכלוסייה רחוקה מנורמלית? נבדוק את מספר האחים: משתנה של ספירה, מוטה ימינה. לרוב התלמידים יש אח אחד עד שלושה, ולמעטים שישה או שבעה. שוב ניסוי מחשבתי: 195 התלמידים שמספר האחים שלהם ידוע הם האוכלוסייה.
siblings, בלי ערכי 99), μ = 2.33, σ = 1.51. באמצע ולמטה: הממוצעים של 10,000 מדגמים בני 5 ובני 30, עם העקומה הנורמלית לפי σ / √n. הקו המקווקו: μ.שלוש שורות, שלושה סיפורים. האוכלוסייה מוטה (הטיה 0.63, פרק 12) ומורכבת ממספרים שלמים בלבד. הממוצעים של 5 כבר רציפים יותר, אבל עדיין קצת מוטים (0.32), והעקומה הנורמלית לא יושבת עליהם בדיוק. והממוצעים של 30: כמעט סימטריים (0.08), והעקומה מתאימה להם יפה. וכמובן, הם גם צרים הרבה יותר, כמו שטעות התקן צופה: 1.51 / √30 = 0.28.
למה זה קורה? חשבו על הכנסה. ההתפלגות של ההכנסות של אנשים מוטה מאוד: רוב האנשים מרוויחים לא הרבה, ומעטים מרוויחים המון. עכשיו דוגמים כל פעם 20 אנשים, ומחשבים הכנסה ממוצעת. בכל מדגם יהיו, סביר להניח, הרבה אנשים עם הכנסה רגילה ומעט עשירים, והעשירים ימשכו את הממוצע רק קצת. כדי לקבל ממוצע קיצוני, הרבה מהמדגם צריכים להיות קיצוניים יחד, וזה נדיר. זה בדיוק ההיגיון מפרק 14: תכונה שהיא סכום של הרבה השפעות קטנות ובלתי תלויות מתפלגת כפעמון. וממוצע הוא בדיוק סכום כזה, חלקי n.
וזה המשפט, אולי החשוב ביותר בסטטיסטיקה:
כשהמדגמים גדולים, התפלגות הדגימה של הממוצע קרובה להתפלגות נורמליתNormal distribution, עם ממוצע וסטיית תקן σ / √n, כמעט בלי קשר לצורת ההתפלגות באוכלוסייה. ככל שהמדגם גדל, הקירוב טוב יותר.
ואם האוכלוסייה עצמה מתפלגת נורמלית, התפלגות הדגימה של הממוצע נורמלית בכל גודל מדגם, אפילו 2.
כמה זה "גדול"? כלל האצבע המקובל הוא 30 ומעלה, ובהשוואה בין קבוצות, 30 ומעלה בכל קבוצה. זה מספיק כשההתפלגות לא מוטה מאוד, כמו מספר האחים. כשההתפלגות מוטה מאוד, או כשיש בה ערכים קיצונייםOutlier, צריך לפעמים הרבה יותר.
ולמה המשפט כל כך חשוב? כי כמעט כל מבחן סטטיסטי בספר שואל שאלה על ממוצע, או על הפרש בין ממוצעים. בזכות המשפט, התפלגות הדגימה שלהם נורמלית, גם כשהנתונים עצמם אינם נורמליים. ומשם אפשר להשתמש בכל מה שלמדנו בפרק 14 על העקומה הנורמלית. זה גם מה שהבטחנו בפרקים 12 ו־14: מה שהמבחנים באמת צריכים הוא שהתפלגות הדגימה תהיה נורמלית. נורמליות של הנתונים היא דרך אחת להבטיח את זה. מדגם גדול היא דרך אחרת.
- הוא לא הופך את הנתונים לנורמליים. ההיסטוגרמה של 200 התלמידים נשארת בדיוק כמו שהייתה. המשפט מדבר על ההתפלגות של הממוצעים, לא של התלמידים. ולכן, אם רוצים לתאר משתנה מוטה, עדיין מתאים לדווח חציון (פרק 10).
- 30 אינו מספר קסם. זו מוסכמה. בהתפלגות סימטריתSymmetric distribution גם פחות מספיק, ובהתפלגות עם זנב ארוך מאוד, למשל הכנסות, צריך יותר.
- הוא לא פותר כל בעיה. הוא עוסק בצורה של התפלגות הדגימה, ולא בהנחות אחרות של המבחנים, כמו אי־תלות בין המשתתפים, או שוויון שונויותHomogeneity of variance בין קבוצות (פרק 21).
הגרסה הראשונה של המשפט מופיעה כבר אצל אברהם דה־מואבר, ב־1733: הוא הראה שמספר ה"עץ" בהרבה הטלות מטבע מתפלג בקירוב לפי העקומה שנקראה אחר כך נורמלית. פייר־סימון לפלס הרחיב את הרעיון בתחילת המאה ה־19, והראה שהוא נכון לממוצעים בכלל. את השם "משפט הגבול המרכזי" נתן המתמטיקאי ג׳ורג׳ פוליה ב־1920. "מרכזי", כי הוא מרכזי לתורת ההסתברות. "גבול", כי הוא מתאר מה קורה כשהמדגם גדל בלי סוף.
ומשהו מהשטח: גם חוקרים מנוסים שוכחים שהמשפט עוסק בהתפלגות הדגימה. לא פעם שופטים של כתבי עת מבקשים לבדוק את הנורמליות של הנתונים, גם כשבכל קבוצה יש מאות משתתפים. קשה מאוד לשכנע אותם להסתכל על התפלגות הדגימה ולא על ההתפלגות עצמה. במקרה כזה, הדרך הבטוחה היא לדווח את הבדיקה שהם מבקשים, ולהסביר במשפט אחד למה במדגם גדול היא כמעט לא משנה.
מעבדה: משפט הגבול המרכזי, עם הנתונים שלנו
במעבדה הבאה שלוש האוכלוסיות הראשונות הן תלמידי המחקר: החרדה, מספר האחים, וההתנדבות בתחילת השנה (0 = לא התנדב, 1 = התנדב).
- בחרו "מספר אחים". קבעו n = 1 והוסיפו כמה מאות מדגמים. אחר כך n = 30. מה השתנה בצורה, ומה ברוחב?
- בחרו "התנדבות". באוכלוסייה יש רק שני ערכים, 0 ו־1. איך נראית התפלגות הדגימה עם n = 1, עם n = 5 ועם n = 30? ומה המשמעות של ממוצע הממוצעים כאן?
- בכל אוכלוסייה, השוו את "סטיית התקן של הממוצעים" ל"טעות התקן". מתי הם קרובים?
בדיקת התשובה
1. עם n = 1, ההתפלגות היא האוכלוסייה עצמה: מוטה, ורק במספרים שלמים. עם n = 30 היא צרה הרבה יותר, וכמעט סימטרית, והעקומה האדומה מתאימה לה. 2. עם n = 1 יש שתי עמודות בלבד, 0 ו־1, רחוק מאוד מפעמון. עם 5 כבר יש שישה ערכים אפשריים, ועם 30 ההתפלגות כמעט נורמלית. ממוצע של אפסים ואחדים הוא שיעור המתנדבים (פרק 5), ולכן ממוצע הממוצעים קרוב ל־0.38, שיעור המתנדבים באוכלוסייה. כלומר המשפט עובד גם על אחוזים. 3. בכל האוכלוסיות, אחרי כמה מאות מדגמים, השניים קרובים מאוד. זו הנוסחה σ / √n בפעולה.
א. חוקרת מדדה זמני תגובה של 400 תלמידים. ההתפלגות מוטה מאוד ימינה, ולכן היא טוענת: "אי אפשר להניח שממוצע המדגם מתפלג נורמלית." האם היא צודקת? ב. ציוני מבחן באוכלוסייה מתפלגים נורמלית. מה הצורה של התפלגות הדגימה של ממוצעים של 4 תלמידים?
בדיקת התשובה
א. לא. עם 400 תלמידים, לפי משפט הגבול המרכזי, התפלגות הדגימה של הממוצע קרובה מאוד לנורמלית, גם כשהנתונים מוטים. הנתונים עצמם נשארים מוטים, ולכן כדי לתאר אותם כדאי לדווח גם חציון. ב. נורמלית. כשהאוכלוסייה נורמלית, התפלגות הדגימה נורמלית בכל גודל מדגם, וטעות התקן היא σ / 2.
בדקו את עצמכם3 שאלות
1.מתי התפלגות הדגימה של הממוצע נורמלית גם במדגמים של 5 בלבד?
2.חוקר עם 500 משתתפים קיבל Shapiro-Wilk מובהק לנתונים שלו (פרק 12). מה נכון?
3.האוכלוסייה מוטה מאוד ימינה. איך, בערך, תיראה התפלגות הדגימה של הממוצע במדגמים של 2? ובמדגמים של 200?
איפה נמצא ממוצע של מדגם?
ציון תקן של ממוצע: z = (M − μ) / (σ / √n). כמו ציון תקןz-score של תלמיד (פרק 13), רק שמחלקים בטעות התקן ולא בסטיית התקן. כשהתפלגות הדגימה נורמלית, השטח מעבר לציון הזה הוא הסיכוי לקבל ממוצע קיצוני כמו שלנו, או יותר.
בפרק 13 שאלנו איפה עומד תלמיד ביחס לאחרים, ומדדנו את המרחק שלו מהממוצע ב"מרצפות" של סטיית תקן. עכשיו אותה שאלה בדיוק, על ממוצע: איפה עומד ממוצע של מדגם ביחס לכל הממוצעים האפשריים? והמרצפת המתאימה היא סטיית התקן של התפלגות הדגימה, כלומר טעות התקן.
ומכיוון שהתפלגות הדגימה נורמלית (בזכות משפט הגבול המרכזי), את השטחים מוצאים בדיוק כמו בפרק 14. שימו לב לדבר מעניין: את כל התפלגות הדגימה אפשר לבנות לפני שאוספים נתון אחד. אם יודעים את μ ואת σ של האוכלוסייה, למשל מנתוני משרד החינוך, ויודעים מה יהיה גודל המדגם, יודעים מראש את המרכז, את הרוחב ואת הצורה. רק אחר כך מניחים עליה את הממוצע של המדגם שלנו.
ציוני מבחן ארצי בהבנת הנקרא מתפלגים באוכלוסייה עם ממוצע 100 וסטיית תקן 15. בוחרים באקראי 36 תלמידים. מה הסיכוי שהממוצע שלהם יהיה מעל 104?
כ־5.5% בלבד מהמדגמים של 36 תלמידים יקבלו ממוצע מעל 104. ולהשוואה, תלמיד בודד:
39% מהתלמידים מקבלים מעל 104. תלמיד עם 104 הוא דבר רגיל לגמרי. כיתה עם ממוצע 104 היא כבר אירוע די נדיר.
שוב 200 התלמידים כאוכלוסייה: μ = 2.2356, σ = 0.5176. מגרילים 25 תלמידים. מה הסיכוי שהחרדה הממוצעת שלהם תהיה מעל 2.40?
לפי התאוריה, 5.6%. ובסימולציה? מתוך 10,000 המדגמים שבאיור של סעיף 3, ב־542 הממוצע היה מעל 2.40: 5.4%. כמעט בדיוק. ותלמיד בודד? 70 מתוך 200 התלמידים, 35%, הם מעל 2.40.
זה כל העיקרון. בפרק הבא נהפוך את השאלה: יש לנו מדגם אמיתי, למשל כיתה שהשתתפה בתוכנית, וממוצע שנראה גבוה. האם הוא כל כך נדיר בהתפלגות הדגימה של האוכלוסייה הרגילה, שסביר יותר להניח שהכיתה הזו כבר לא שייכת אליה? זה מבחן zz test, הראשון במבחנים הסטטיסטיים.
בפרק הזה עסקנו בממוצע, אבל הרעיון כללי. אפשר לחזור שוב ושוב על המחקר ולחשב בכל פעם הפרש בין שני ממוצעים, מתאם, או יחס בין שתי שונויות, ולקבל התפלגות דגימה של כל אחד מהם. לכל אחת יש מרכז, רוחב, וצורה משלה, ולחלק מהן יש שמות: התפלגות t, התפלגות F, התפלגות חי בריבועChi-square distribution. נכיר אותן בהמשך. וכל המבחנים בספר, בלי יוצא מן הכלל, עושים אותו דבר: לוקחים סטטיסטי מהמדגם, ושואלים עד כמה הוא קיצוני ביחס להתפלגות הדגימה שלו. מי שהבין את הפרק הזה, הבין את הלב של הסטטיסטיקה ההיסקית.
באותו מבחן ארצי (ממוצע 100, סטיית תקן 15), בוחרים באקראי 36 תלמידים. א. מה הסיכוי שהממוצע שלהם יהיה בין 97 ל־103? ב. ומה הסיכוי שהוא יהיה מתחת ל־95?
בדיקת התשובה
כ־77% מהמדגמים יקבלו ממוצע בין 97 ל־103, ורק כ־2.3% ממוצע מתחת ל־95.
בדקו את עצמכם3 שאלות
1.ציונים באוכלוסייה: ממוצע 500, סטיית תקן 100. מה הסיכוי שממוצע של מדגם מקרי של 100 נבחנים יהיה מעל 520?
2.באוכלוסייה הממוצע 100 וסטיית התקן 15. מה הסיכוי שממוצע של 9 נבדקים יהיה מתחת ל־95?
3.התייחסו ל־195 התלמידים שמספר האחים שלהם ידוע כאל אוכלוסייה: μ = 2.333, σ = 1.508. מה הסיכוי שבמדגם מקרי של 36 תלמידים, הממוצע יהיה מתחת ל־2 אחים?
בתוכנה: טעות התקן, וסימולציה של דגימה
בכל התוכנות נחשב את טעות התקן של החרדה לפני התוכנית, anx_pre. באקסל נבנה גם סימולציה קטנה של התפלגות הדגימה, כמו בפרק.
טעות התקן. לאקסל אין פונקציה מוכנה לטעות התקן, אבל היא נוסחה קצרה: סטיית התקן חלקי השורש של מספר התצפיות. בקובץ המחקר, anx_pre בעמודה AI:
anx_pre (AI2:AI201)
| Formula | Result | |
|---|---|---|
| Mean | =AVERAGE(AI2:AI201) | 2.2356 |
| SD | =STDEV.S(AI2:AI201) | 0.5189 |
| n | =COUNT(AI2:AI201) | 200 |
| SE | =STDEV.S(AI2:AI201)/SQRT(COUNT(AI2:AI201)) | 0.0367 |
| σ (the 200 as a population) | =STDEV.P(AI2:AI201) | 0.5176 |
| σ / √25 | =STDEV.P(AI2:AI201)/SQRT(25) | 0.1035 |
| P(M > 2.40), n = 25 | =1-NORM.DIST(2.4, AVERAGE(AI2:AI201), STDEV.P(AI2:AI201)/SQRT(25), TRUE) | 0.0561 |
- SE
- טעות התקן של הממוצע.
COUNTסופר רק תאים עם מספרים, ולכן הנוסחה נכונה גם כשחסרים ערכים בעמודה. - STDEV.P
- כאן, ורק כאן, משתמשים ב־P: בניסויExperiment המחשבתי ה־200 הם כל האוכלוסייה (פרק 11). במחקר אמיתי, תמיד
STDEV.S. - P(M > 2.40)
- אותה
NORM.DISTמפרק 14, עם טעות התקן במקום סטיית התקן.
סימולציה של התפלגות הדגימה. אקסל יכול להגריל בשבילנו. RANDBETWEEN(1, 200) מגרילה מספר שלם בין 1 ל־200, ו־INDEX מחזירה את הערך שבשורה הזו בטווח. יחד הן מגרילות תלמיד, עם החזרה:
- פתחו גיליון חדש באותו קובץ. בתא A1 כתבו
=INDEX(care_school!$AI$2:$AI$201, RANDBETWEEN(1, 200)). (care_school הוא שם הגיליון של הנתונים. אם שיניתם אותו, החליפו גם בנוסחה.) - העתיקו את התא ימינה עד Y1: 25 עמודות, 25 תלמידים, מדגם אחד.
- בתא Z1 כתבו
=AVERAGE(A1:Y1): הממוצע של המדגם. - סמנו את A1:Z1 וגררו למטה עד שורה 1000. עכשיו יש 1000 מדגמים, וב־Z את 1000 הממוצעים שלהם.
- בתאים ריקים:
=AVERAGE(Z1:Z1000)צריך לצאת קרוב ל־2.24, ו־=STDEV.S(Z1:Z1000)קרוב ל־0.10, טעות התקן. היסטוגרמה של עמודה Z (פרק 9) תראה פעמון.
בכל שינוי בגיליון, או בלחיצה על F9, אקסל מגריל הכול מחדש, והמספרים זזים קצת. זו טעות הדגימה של הסימולציה עצמה. 1000 מדגמים מספיקים כדי לראות את התמונה, ו־10,000 ייתנו מספרים יציבים יותר.
Analyze > Descriptive Statistics > Descriptives. מעבירים את anx_pre ל־Variable(s), ובכפתור Options מסמנים S.E. mean.
Descriptive Statistics
| N | Minimum | Maximum | Mean | Std. Deviation | ||
|---|---|---|---|---|---|---|
| Statistic | Statistic | Statistic | Statistic | Std. Error 1 | Statistic | |
| anx_pre | 200 | 1.13 | 3.75 | 2.2356 | .03669 | .51886 |
| Valid N (listwise) | 200 | |||||
- 1 · Std. Error
- טעות התקן של הממוצע. היא מופיעה מתחת לכותרת Mean, כי היא שייכת לממוצע: .51886 / √200 = .03669.
- Std. Deviation
- סטיית התקן, בחלוקה ב־n − 1. שימו לב לסדר הגודל: סטיית התקן גדולה פי 14 בערך מטעות התקן, כי √200 = 14.1.
טעות התקן מופיעה גם בפלט של Analyze > Descriptive Statistics > Explore, בעמודה Std. Error ליד Mean (ראו את הפלט בפרק 14). ולטעות תקן לכל קבוצה בנפרד: Analyze > Compare Means > Means, עם anx_pre ב־Dependent List ו־group ב־Independent List. בכפתור Options מוסיפים את Std. Error of Mean לרשימת Cell Statistics.
Descriptives > Descriptive Statistics. מעבירים את anx_pre ל־Variables. כדי לראות כל קבוצה בנפרד, מעבירים את group ל־Split. תחת Statistics מסמנים S.E. mean.
Descriptive Statistics
| anx_pre | |||
|---|---|---|---|
| 0 | 1 | 2 | |
| Valid | 74 | 51 | 75 |
| Mean | 2.324 | 2.172 | 2.191 |
| Std. Error of Mean | 0.061 | 0.075 | 0.057 |
| Std. Deviation | 0.528 | 0.535 | 0.493 |
- Std. Error of Mean
- טעות התקן של הממוצע בכל קבוצה. הגדולה ביותר בקבוצה 1, התוכנית העקיפה, שבה הכי מעט תלמידים: 0.535 / √51 = 0.075.
- Std. Deviation
- סטיית התקן של התלמידים בכל קבוצה. היא כמעט זהה בשלוש הקבוצות, ולכן ההבדלים בטעות התקן נובעים בעיקר מגודל הקבוצה.
בלי Split מקבלים את כל 200 התלמידים יחד: Std. Error of Mean = 0.037. ושימו לב לסימן של המשתנה group: הוא צריך להיות Nominal (פרק 6).
בדקו את עצמכם3 שאלות
1.הציונים נמצאים בתאים B2:B81. איזו נוסחה באקסל נותנת את טעות התקן של הממוצע?
=STDEV.S(B2:B81)/SQRT(COUNT(B2:B81)) סטיית התקן, עם S כי זה מדגם, חלקי השורש של מספר התצפיות. COUNT סופר את התצפיות, ו־SQRT מוציא שורש.1.ב־SPSS, איך מקבלים ב־Descriptives את טעות התקן של הממוצע?
1.ב־JASP, איך מקבלים ב־Descriptive Statistics את טעות התקן של הממוצע?
2.בסימולציה, כל אחד מ־25 התלמידים במדגם מוגרל בנפרד: בכל פעם מגרילים מספר שורה בין 1 ל־200, בלי קשר להגרלות האחרות. למה זו דגימה עם החזרה?
3.באקסל, בפלט של Data > Data Analysis > Descriptive Statistics, מופיעה שורה בשם Standard Error. מה יש בה?
3.בפלט Descriptive Statistics של SPSS, תחת הכותרת Mean, יש שתי עמודות: Statistic ו־Std. Error. מה יש בעמודה Std. Error?
3.ב־JASP, עם group ב־Split, השורה Std. Error of Mean מראה 0.061, 0.075 ו־0.057. סטיות התקן כמעט שוות: 0.528, 0.535, 0.493. למה טעות התקן הגדולה ביותר בקבוצה 1?
טעויות נפוצות
- מבלבלים בין סטיית תקן לטעות תקן. SD מתארת את התלמידים, SE את הדיוק של הממוצע. SE קטנה תמיד מ־SD (כשיש יותר מנבדק אחד).
- בציון תקן של ממוצע, מחלקים בסטיית התקן. במכנה צריכה להיות טעות התקן, σ / √n. מי שמחלק ב־σ מקבל ציון קטן מדי, ושואל בעצם על תלמיד בודד ולא על ממוצע.
- "כדי לחצות את טעות התקן, מכפילים את המדגם." כפל המדגם מקטין אותה רק פי 1.41. כדי לחצות, צריך פי ארבעה.
- "משפט הגבול המרכזי הופך את הנתונים לנורמליים." הנתונים נשארים כמו שהם. רק התפלגות הדגימה של הממוצע מתקרבת לנורמלית.
- "אומד חסר הטיה פוגע בפרמטר." הוא פוגע בממוצע, על פני כל המדגמים. מדגם בודד יכול לטעות לכל כיוון.
- "טעות התקן קטנה, ולכן המדגם מייצג." טעות התקן מודדת רק את הטעות המקרית. מדגם גדול של מתנדבים יכול לתת טעות תקן זעירה, וממוצע מוטה לגמרי.
- מחשבים באקסל
STDEV.Pבמחקר אמיתי. σ של האוכלוסייה לא ידועה, ולכן אומדים אותה עםSTDEV.S. P רק כשהנתונים הם באמת כל האוכלוסייה, כמו בניסוי המחשבתי של הפרק.
בדקו את עצמכם
סיכום
- אומד ופרמטר: את הפרמטר (μ, σ) אומדים בעזרת סטטיסטי מהמדגם (M, SD). כל מדגם נותן אומדן אחר: טעות דגימה.
- אומד טוב הוא חסר הטיה (בממוצע פוגע בפרמטר) ועקיב (מתקרב אליו כשהמדגם גדל). השונות בחלוקה ב־n − 1 חסרת הטיה. בחלוקה ב־n היא נותנת, בממוצע, רק (n − 1) / n משונות האוכלוסייה.
- התפלגות הדגימה של הממוצע: ההתפלגות של ממוצעי כל המדגמים האפשריים בגודל n. התפלגות של סטטיסטי, לא של אנשים.
- המרכז: μ. הרוחב: טעות התקן, σ / √n, ובמחקר SD / √n. מדגם גדול פי ארבעה חוצה אותה. הצורה: נורמלית אם האוכלוסייה נורמלית, או אם המדגם גדול (משפט הגבול המרכזי, בערך 30 ומעלה).
- ציון תקן של ממוצע: (M − μ) / (σ / √n), ומשם שטחים כמו בפרק 14.
מונחים חדשים
שאלות לדוגמה, עם פתרונות
שאלות בסגנון מבחן, מהקלה אל הקשה. נסו לפתור לבד, ורק אז פתחו את הפתרון.
שלוש התפלגויות: ההתפלגות באוכלוסייה, ההתפלגות במדגם אחד, והתפלגות הדגימה של הממוצע. לאיזו מהן מתאים כל משפט? א. היא צרה יותר ככל ש־n גדל. ב. הממוצע שלה הוא μ וסטיית התקן שלה σ. ג. יש בה n ערכים בלבד, והממוצע שלה M. ד. משפט הגבול המרכזי מתאר את הצורה שלה. ה. היא לא משתנה כשהחוקרת מחליטה להגדיל את המדגם.
בדיקת התשובה
א. התפלגות הדגימה: טעות התקן, σ / √n, קטנה כש־n גדל. ב. האוכלוסייה: אותיות יווניות לפרמטרים. ג. המדגם. ד. התפלגות הדגימה. המשפט מדבר על הממוצעים, לא על האנשים. ה. האוכלוסייה. היא קיימת בלי קשר למחקר. (גם הממוצע של התפלגות הדגימה לא משתנה, הוא תמיד μ, אבל הרוחב שלה כן.)
בשאלון מוטיבציה, סטיית התקן של התלמידים היא 0.9. א. מהי טעות התקן של הממוצע במחקר עם 81 תלמידים? ב. ועם 9 תלמידים? ג. כמה תלמידים צריך כדי שטעות התקן תהיה 0.05? ד. עמית טוען: "אם נכפיל את המדגם ל־162, טעות התקן תרד מ־0.1 ל־0.05." מה תענו לו?
בדיקת התשובה
א. SE = 0.9 / √81 = 0.9 / 9 = 0.10ב. SE = 0.9 / √9 = 0.9 / 3 = 0.30ג. √n = 0.9 / 0.05 = 18 → n = 18² = 324ד. 0.9 / √162 = 0.9 / 12.73 = 0.071העמית טועה. n נמצא בתוך שורש, ולכן כפל המדגם מקטין את טעות התקן רק פי √2 = 1.41, ל־0.071. כדי לחצות אותה צריך פי ארבעה תלמידים: 324, בדיוק התשובה לסעיף ג.
ציוני מבחן במתמטיקה מתפלגים נורמלית באוכלוסייה, עם ממוצע 60 וסטיית תקן 12. בוחרים באקראי 16 תלמידים. א. מה הממוצע ומה טעות התקן של התפלגות הדגימה? ב. מה הסיכוי שממוצע המדגם יהיה מעל 65? ג. מה הסיכוי שהוא יהיה בין 55 ל־65? ד. מה הסיכוי שתלמיד אחד, שנבחר באקראי, יקבל מעל 65? ה. מתחת לאיזה ממוצע נמצאים 10% מהמדגמים בני 16 עם הממוצעים הנמוכים ביותר?
בדיקת התשובה
א. ממוצע התפלגות הדגימה = μ = 60, σM = 12 / √16 = 12 / 4 = 3ב. z = (65 − 60) / 3 = 1.667 → 1 − NORM.S.DIST(1.667, TRUE) = 0.0478ג. z = ±1.667 → 0.9522 − 0.0478 = 0.9044ד. z = (65 − 60) / 12 = 0.42 → 1 − NORM.S.DIST(0.42, TRUE) = 0.34ה. =NORM.INV(0.1, 60, 3) → 60 + (−1.2816) · 3 = 56.16כ־4.8% מהמדגמים יקבלו ממוצע מעל 65, אבל 34% מהתלמידים הבודדים מקבלים מעל 65. בסעיף ה׳ עוברים מאחוז לציון, כמו בפרק 14, עם טעות התקן במקום סטיית התקן. והאוכלוסייה נורמלית, ולכן אפשר להשתמש בעקומה הנורמלית גם עם 16 תלמידים בלבד.
לפניכם פלט של SPSS לשלושה משתנים בקובץ המחקר, לפני התוכנית: שביעות רצון מהחיים (1 עד 7), קשיבות (1 עד 5) ותלונות גופניות (1 עד 4). א. ודאו שטעות התקן של
sat_preמחושבת נכון. ב. סטודנטית אומרת: "הממוצע של שביעות הרצון הוא הפחות מדויק, כי טעות התקן שלו הכי גדולה." מה חסר בטענה? ג. מה הייתה טעות התקן שלsat_preאילו השתתפו רק 96 הבנים, עם אותה סטיית תקן? ד. בין אילו שני ערכים נמצאים כ־95% מהממוצעים שהיינו מקבלים בקשיבות, במדגמים של 200 מאותה אוכלוסייה?Descriptive Statistics
N Minimum Maximum Mean Std. Deviation Statistic Statistic Statistic Statistic Std. Error Statistic sat_pre 200 2.40 7.00 5.0640 .07093 1.00306 mind_pre 200 1.73 4.47 3.2030 .03864 .54642 soma_pre 200 1.00 3.40 1.8460 .03541 .50074 Valid N (listwise) 200 בדיקת התשובה
א. 1.00306 / √200 = 1.00306 / 14.142 = .07093ג. 1.00306 / √96 = 1.00306 / 9.798 = 0.102ד. 3.2030 ± 2 · 0.03864 → 3.13 עד 3.28ב. טעות התקן נמדדת ביחידות של המשתנה, ושביעות הרצון נמדדת על סולם רחב יותר (1 עד 7), עם סטיית תקן כפולה. בשלושת המשתנים n = 200, ולכן היחס בין טעות התקן לסטיית התקן זהה בכולם: 1 / √200. ביחס לפיזורMeasure of dispersion של כל משתנה, שלושת הממוצעים מדויקים באותה מידה. השוואה של טעויות תקן במספרים מוחלטים הוגנת רק כשמדובר באותו משתנה.
ג. פחות תלמידים, טעות תקן גדולה יותר: מ־0.071 ל־0.102. ד. לפי כלל 68־95־99.7: כ־95% מהממוצעים נמצאים עד שתי טעויות תקן מ־μ. כאן הצבנו במקום μ את הממוצע שלנו, כי μ לא ידוע. בפרק 19 נראה למה זה מותר, ומה בדיוק המשמעות.
חוקרת מודדת זמני תגובה. באוכלוסייה הממוצע 450 אלפיות שנייה, סטיית התקן 120, וההתפלגות מוטה מאוד ימינה. היא בונה בסימולציה התפלגות דגימה של הממוצע פעם עם מדגמים של 4, ופעם עם מדגמים של 64. א. מה המרכז ומה טעות התקן בכל מקרה? ב. באיזה מהמקרים סביר להשתמש בעקומה הנורמלית כדי לחשב הסתברויות לממוצע? ג. חשבו, במקרה המתאים, את הסיכוי לממוצע מעל 480. ד. בכל מדגם של 4 היא מחשבת גם שונות, אבל מחלקת את SS ב־n. לאיזה ממוצע של אומדנים היא תגיע, ומה הייתה צריכה לעשות?
בדיקת התשובה
א. בשני המקרים המרכז 450. 120 / √4 = 60, 120 / √64 = 15ג. z = (480 − 450) / 15 = 2 → 1 − NORM.S.DIST(2, TRUE) = 0.0228ד. σ² = 120² = 14,400 → 14,400 · (4 − 1) / 4 = 10,800ב. רק במדגמים של 64. האוכלוסייה מוטה מאוד, ולכן עם 4 בלבד גם הממוצעים יהיו מוטים, והעקומה הנורמלית תטעה. עם 64, לפי משפט הגבול המרכזי, הקירוב הנורמלי סביר. ג. כ־2.3%. ד. הממוצע יתקרב ל־10,800 ולא ל־14,400: הערכת חסר של רבע, כי החלוקה ב־n מוטה. היא הייתה צריכה לחלק ב־n − 1 = 3, ואז הממוצע היה מתקרב ל־14,400.
תרגול עם הנתונים
פתחו את קובץ המחקר ואת מילון המשתנים.
הקבצים עצמם נמצאים גם בתיקיית data בחבילת הספר.
- חשבו את טעות התקן של שביעות הרצון לפני התוכנית (
sat_pre, עמודה AG), פעם לכל 200 התלמידים, ופעם לבנים ולבנות בנפרד. למה טעויות התקן בקבוצות גדולות יותר?בדיקת התשובה
לכל התלמידים: 1.0031 / √200 = 0.071. בנים (96): SD = 0.97, SE = 0.099. בנות (104): SD = 1.03, SE = 0.101. בכל קבוצה יש בערך חצי מהתלמידים, וסטיית התקן דומה, ולכן טעות התקן גדלה בערך פי √2 = 1.41. באקסל, אחרי מיון לפי
gender(Data > Sort), הבנים בשורות 2–97:=STDEV.S(AG2:AG97)/SQRT(COUNT(AG2:AG97)).ב־SPSS: Analyze > Compare Means > Means, עםgenderב־Independent List ו־Std. Error of Mean ב־Options.ב־JASP: Descriptives, עםgenderב־Split ו־S.E. mean. - בנו סימולציה כמו בקטע "בתוכנה", בלשונית Excel (את התרגיל הזה עושים באקסל גם אם אתם עובדים בתוכנה אחרת), אבל לקשיבות (
mind_pre, עמודה AH) ועם מדגמים של 10 תלמידים: 10 עמודות ו־1000 שורות. מה צריך לצאת ממוצע הממוצעים, ומה סטיית התקן שלהם? בדקו.בדיקת התשובה
ממוצע הממוצעים צריך להיות קרוב ל־μ = 3.20. סטיית התקן של הממוצעים צריכה להיות קרובה לטעות התקן:
=STDEV.P(AH2:AH201)/SQRT(10)נותן 0.5451 / 3.162 = 0.172. בכל לחיצה על F9 תקבלו מספרים קצת אחרים, למשל 3.19 או 3.21, ו־0.17 או 0.18. - התייחסו ל־195 התלמידים שמספר האחים שלהם ידוע (
siblings, בלי ערכי 99) כאל אוכלוסייה. לפי התאוריה, מה הסיכוי שבמדגם מקרי של 25 תלמידים, הממוצע יהיה מעל 3 אחים? האם הקירוב הנורמלי סביר כאן?בדיקת התשובה
μ = 2.333, σ = 1.508 (באקסל,
AVERAGEו־STDEV.P, אחרי שמחקתם את ערכי 99, כמו בפרק 8). טעות התקן: 1.508 / 5 = 0.302. z = (3 − 2.333) / 0.302 = 2.21, והשטח מימיןUpper-tail area: 0.0135, כ־1.4%. סימולציה של 10,000 מדגמים נתנה 1.44%: קרוב מאוד. ההתפלגות מוטה רק במידה בינונית (0.63), ולכן גם 25 מספיקים כאן לקירוב טוב. - חשבו את טעות התקן של החרדה אחרי התוכנית (
anx_post) בכל אחת משלוש הקבוצות. באיזו קבוצה הממוצע הכי מדויק, ולמה?בדיקת התשובה
ביקורת (74): SD = 0.67, SE = 0.078. עקיפה (51): SD = 0.59, SE = 0.083. משולבת (75): SD = 0.55, SE = 0.063. בתוכנית המשולבת: גם הקבוצה הגדולה ביותר, וגם התלמידים בה הכי דומים זה לזה. ב־SPSS: Analyze > Compare Means > Means, עם
groupב־Independent List.ב־JASP: Descriptives, עםgroupב־Split.באקסל: ממיינים לפיgroup, ומחשבים לכל טווחSTDEV.SחלקיSQRT(COUNT(…)). - ההתנדבות בתחילת השנה (
vol_pre) היא 0 או 1. מה הממוצע שלה, ומה טעות התקן שלו? מה המשמעות של שני המספרים?בדיקת התשובה
הממוצע 0.38: 38% מהתלמידים התנדבו (פרק 5). סטיית התקן 0.4866, וטעות התקן 0.4866 / √200 = 0.034. כלומר, במדגמים אחרים של 200 תלמידים, אחוז המתנדבים היה זז בדרך כלל בכ־3.4 נקודות אחוז. משפט הגבול המרכזי עובד גם כאן: ממוצע של אפסים ואחדים הוא אחוז, וגם הוא מתפלג נורמלית בקירובApproximate normality במדגם גדול, כמו שראיתם במעבדה של סעיף 5.
בפרק הבא: ההיגיון של בדיקת השערות, במבחן zz test. נשתמש בהתפלגות הדגימה כדי לשאול אם ממוצע של מדגם רחוק מדי מ־μ בשביל להיות מקרי, ונכיר את המושגים ערך pp-value, ערך קריטיCritical value, ושני סוגי הטעויות שאפשר לעשות בהחלטה.
מקורות: Efron, B. (1979). Bootstrap methods: Another look at the jackknife. The Annals of Statistics, 7(1), 1–26. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y