חלק ג: מהמדגם לאוכלוסייה · פרק 19
עוצמה ורווח סמך
בפרק 18 למדנו להחליט אם לדחות את השערת האפסNull hypothesis. בפרק הזה נשאל שלוש שאלות שמשלימות את התמונה: מה הסיכוי שהמחקר שלנו בכלל יגלה השפעה שבאמת קיימת? כמה נבדקים צריך כדי שזה יקרה? ואיך אומדיםEstimator את ממוצע האוכלוסייה לא במספר אחד, אלא בטווח?
השווינו את בעיות הקשב של 200 התלמידים במחקר לנורמה ארצית (נורמה לדוגמה, שנציג בסעיף 3), ולא נמצא הבדל מובהק. האם זה אומר שהתלמידים שלנו לא שונים מהנורמה?
התשובה הקצרה: לא בהכרח. בסוף הפרק תדעו לשאול שתי שאלות נוספות לפני שמסיקים משהו: כמה עוצמה הייתה למבחן, ומה הטווח הסביר להבדל. ותגלו שבמקרה הזה, הסיכוי לגלות הבדל קטן אבל אמיתי היה בערך כמו הטלת מטבע.
בסוף הפרק תוכלו
- להסביר מהי עוצמת המבחןPower, ולחשב אותה ביד ובתוכנה.
- למנות את חמשת הגורמים שמשפיעים על העוצמה, ולהסביר כל אחד בעזרת שתי העקומות.
- לחשב גודל מדגם מינימליMinimum sample size לפני שמתחילים מחקר.
- לבנות רווח סמךConfidence interval לממוצע, ולפרש אותו נכון.
- להשתמש ברווח סמך כדי להחליט במבחן דו־צדדיTwo-tailed hypothesis / test, ולהסביר מה הוא מוסיף על ערך .
- להבחין בין תוצאה מובהקתStatistically significant לבין תוצאה חשובה, בעזרת גודל אפקטEffect size.
עוצמה: הסיכוי לגלות השפעה שקיימת
עוצמת המבחן היא הסיכוי לדחות את השערת האפס כשהיא באמת לא נכונה: לגלות השפעה שקיימת. היא שווה ל־1 − β. מחשבים אותה כשטח מתחת לעקומהArea under the curve של ההשערה החלופיתResearch hypothesis, מעבר לממוצע הקריטי.
בפרק 18 ראינו שכל החלטה במבחן יכולה לטעות בשתי דרכים. נזכיר את הטבלה:
| במציאות: אין השפעה ( נכונה) | במציאות: יש השפעה ( נכונה) | |
|---|---|---|
| דחינו את השערת האפס | טעות מסוג ראשון. הסיכוי לה: Type I error | החלטה נכונה. הסיכוי לה: העוצמה, 1 − β |
| לא דחינו | החלטה נכונה. הסיכוי לה: 1 − α | טעות מסוג שני. הסיכוי לה: βType II error |
בשורה הראשונה דוחים את השערת האפס בשני המקרים. ההבדל הוא אם דוחים בצדק או שלא בצדק. α היא הסיכוי לדחות שלא בצדק. העוצמה היא הסיכוי לדחות בצדק: לומר שהתוכנית עוזרת, כשהיא באמת עוזרת. זה המקום שבו כל חוקר רוצה להיות, ולכן הוא רוצה שהסיכוי הזה יהיה גבוה ככל האפשר.
אבל שימו לב לבעיה. את α קובעים מראש, כי השערת האפס אומרת בדיוק מהו ממוצע האוכלוסייה. כדי לחשב עוצמה צריך להחליט גם מה הממוצע אם השערת האפס לא נכונה. ההשערה "יש השפעה" לא אומרת כמה. לכן העוצמה מחושבת תמיד ביחס לגודל השפעה מסוים: "אם הממוצע האמיתי הוא 1, מה הסיכוי שנדחה?"
שתי עקומות
מבחן הבנת הנקרא ארצי בנוי כך שבאוכלוסייה הממוצע 50 וסטיית התקן σ = 10. בית ספר מנסה תוכנית קריאה חדשה עם 25 תלמידים, ובודק השערה חד־צדדיתOne-tailed hypothesis / test: התוכנית מעלה את הציון. α = .05. ונניח שבאמת, התוכנית מעלה את הממוצע ל־55.
בפרק 17 ראינו שממוצעי מדגמים מתפלגים נורמלית סביב ממוצע האוכלוסייה, עם = σ / √n = 10 / 5 = 2. כאן יש שתי אפשרויות, ולכן שתי עקומות:
- העקומה של H0: הממוצעים שהיינו מקבלים אם השערת האפס נכונה. היא סביב 50.
- העקומה של H1: הממוצעים שהיינו מקבלים אם הממוצע האמיתי 55. אותה צורה, אותו רוחב, רק מוזזת.
את הקו המקווקו, הממוצע הקריטי, קובעים לפי העקומה של H0 בלבד, בדיוק כמו בפרק 18: מעליו דוחים. עכשיו מסתכלים על שלושה שטחים:
- α: החלק של העקומה של H0 מעבר לקו. דוחים, אבל שלא בצדק.
- העוצמה: החלק של העקומה של H1 מעבר לקו. דוחים, ובצדק.
- β: החלק של העקומה של H1 לפני הקו. ההשפעה קיימת, אבל ממוצע המדגם יצא נמוך מדי, ולא דחינו.
העוצמה ו־β הן שני חלקים של אותה עקומה, ולכן הן תמיד מסתכמות ב־1.
אותם נתונים: μ0 = 50, σ = 10, n = 25, חד־צדדית ימנית, α = .05, והממוצע האמיתי 55.
מסקנה: אם התוכנית באמת מעלה את הממוצע ל־55, יש סיכוי של כ־80% שהמחקר יגלה את זה. ויש סיכוי של כ־20% שהוא יפספס, ויגיד "לא נמצא הבדל מובהק" על תוכנית שעובדת.
קיצור דרך
אפשר לחבר את ארבעת השלבים לנוסחה אחת. שואלים כמה טעויות תקן μ1 רחוק מ־μ0, ומחסירים את הערך הקריטי. מה שנשאר הוא המרחק של μ1 מעבר לקו, ביחידות של טעות תקןStandard error:
בדוגמה: (55 − 50) / 2 = 2.5 טעויות תקן. פחות 1.645 נשאר 0.855, ו־=NORM.S.DIST(0.855,TRUE) נותן .804. אותה תוצאה בדיוק.
ובבדיקה דו־צדדית? משתמשים בערך הקריטי הדו־צדדי, 1.96. באופן עקרוני יש גם סיכוי לדחות בזנב השני, אבל כשהעקומה של H1 מוזזת ימינה, השטח שלה בזנב השמאלי זעיר, ומזניחים אותו. בדוגמה: 2.5 − 1.96 = 0.54, ועוצמה של .705.
ציוני מבחן חשבון ארצי: μ0 = 100, σ = 15. בודקים 36 תלמידים, בהשערה חד־צדדיתOne-tailed hypothesis / test ימנית, α = .05. הממוצע האמיתי של התלמידים האלה הוא 106. מהי טעות התקןStandard error? מהו הממוצע הקריטי? מהי העוצמה, ומהי β?
בדיקת התשובה
סיכוי של כ־77% לגלות את ההבדל, וכ־23% לפספס אותו.
הנה שאלה שמופיעה הרבה במבחנים. אנשים ישנים בממוצע 7 שעות. מרצה משער שסטודנטים למתמטיקה ישנים פחות, ובודק בהשערה חד־צדדית שמאלית, α = .05. נניח שבאמת הם ישנים 6 שעות. גודל המדגם לא ידוע. מה אפשר לומר על העוצמה?
התשובה: בוודאות היא גדולה מ־5%, ויותר מזה אי אפשר לדעת. למה? דמיינו שהעקומה של ההשערה החלופיתResearch hypothesis יושבת בדיוק על העקומה של השערת האפס, כלומר הסטודנטים ישנים בדיוק 7 שעות. אז החלק שלה שנופל באזור הדחייהRejection region הוא בדיוק α, 5%. עכשיו הזיזו אותה שמאלה, לכיוון אזור הדחייה: החלק שלה שנופל שם רק גדל. לכן העוצמה גדולה מ־α. ומה החסם העליון? אין. אם המדגם ענק, טעות התקן זעירה, העקומות כמעט לא חופפות, והעוצמה יכולה להגיע ל־99.9%.
ושימו לב למקרה ההפוך: אם המרצה שיער "פחות", אבל באמת הסטודנטים ישנים יותר, 8 שעות, העקומה זזה הרחק מאזור הדחייה, והעוצמה קטנה אפילו מ־α. זה המחיר של השערה חד־צדדית בכיוון הלא נכון. ובהשערה דו־צדדית? אם μ1 = μ0, הסיכוי לדחות הוא שוב בדיוק α (חצי בכל זנב), וכל הזזה, לאיזה צד שהוא, רק מגדילה אותו. כלומר גם שם העוצמה גדולה מ־α.
בדקו את עצמכם3 שאלות
1.במבחן מסוים β = .35. מהי העוצמה?
2.בציור של שתי העקומות, איזה שטח הוא העוצמה?
3.מבחן אוצר מילים: μ0 = 40, σ = 8. בודקים 16 תלמידים בהשערה חד־צדדית ימנית, α = .05. מה העוצמה אם הממוצע האמיתי 44?
מה משפיע על העוצמה?
חמישה גורמים: גודל ההשפעה, סטיית התקן באוכלוסייה, גודל המדגם, α, והאם ההשערה חד־צדדית. הכלל: כל מה שמרחיק את שתי העקומות זו מזו, או מצר אותן, מגדיל את העוצמה. בפועל, החוקר שולט בעיקר בגודל המדגם.
לפני שמסתכלים בטבלה, נסו לחשוב לבד, בעזרת הציור של שתי העקומות: מה אפשר לשנות כדי שחלק גדול יותר מהעקומה של H1 יעבור את הקו?
| הגורם | העוצמה | למה, בציור | בדוגמת הקריאה (בסיס: .80) |
|---|---|---|---|
| השפעה גדולה יותר (μ1 רחוק יותר מ־μ0) | גדלה | העקומות רחוקות יותר זו מזו | ממוצע אמיתי 57: .97 ממוצע אמיתי 53: .44 |
| סטיית תקן קטנה יותר באוכלוסייה | גדלה | טעות התקן קטנה, והעקומות צרות | σ = 8: .93 σ = 15: .51 |
| מדגם גדול יותר | גדלה | טעות התקן קטנה, והעקומות צרות | n = 36: .91 n = 16: .64 |
| α גדולה יותר (.05 במקום .01) | גדלה | הקו הקריטי זז לכיוון μ1 | α = .01: .57 |
| השערה חד־צדדית (בכיוון הנכון) במקום דו־צדדית | גדלה | כל α בצד אחד, והקו קרוב יותר | דו־צדדית: .71 |
חמישה גורמים, אבל לא כולם באמת בידיים של החוקר:
- α קבועה בדרך כלל על .05. אפשר להגדיל אותה, ואז העוצמה גדלה, אבל גם הסיכוי לטעות מסוג ראשון. זה לא משהו שרוצים לשחק בו.
- השערה חד־צדדית מגדילה את העוצמה, ולא מעט: הערך הקריטי יורד מ־1.96 ל־1.645. אבל רק אם הכיוון נקבע מראש, ורק אם הוא הכיוון הנכון. ובמחקר מקובל לעבוד דו־צדדית גם כשיש השערה עם כיוון, כי זו בדיקה מחמירה יותר.
- גודל ההשפעה תלוי בעולם, אבל לא רק. טיפול חזק יותר, למשל תוכנית של שמונה מפגשים במקום שניים, מזיז את העקומה של H1 רחוק יותר.
- סטיית התקן אפשר להקטין בשתי דרכים. אחת: כלי מדידה מהימנים יותר (פרק 16), כי כל טעות מדידהMeasurement error מוסיפה פיזורMeasure of dispersion. השנייה: מדגם הומוגני, למשל רק בנות בכיתה ה׳ מעיר אחת. אבל כאן יש מחיר: מה שנמצא נכון אולי רק לבנות בכיתה ה׳ מאותה עיר. זה מחיר בתוקף החיצוני (פרק 7).
- גודל המדגם הוא הגורם שהחוקר שולט בו הכי הרבה. הוא עולה כסף וזמן, אבל לא פוגע בשום דבר אחר. לכן כשצריך לבחור, מגדילים את המדגם. בסעיף הבא נחשב בדיוק בכמה.
יש עוד דרך אחת, שנראה בפרק 21: למדוד את אותם אנשים פעמיים, לפני ואחרי. כל נבדק משמש ביקורת לעצמו, ההבדלים הקבועים בין האנשים יוצאים מהחישוב, והפיזור שנשאר קטן בהרבה. לכן במערך כזה צריך פחות נבדקים.
רעיון שעולה הרבה: כדי שתוכנית נגד חרדה תראה השפעה גדולה, נבחר רק את התלמידים החרדים ביותר. הבעיה: גם בלי שום תוכנית, מי שקיבל ציון קיצוני במדידה אחת יקבל בממוצע ציון פחות קיצוני במדידה הבאה. זו רגרסיה לממוצעRegression to the mean. החרדה "תרד" גם אם התוכנית לא עשתה כלום, ובלי קבוצת ביקורת אי אפשר להפריד בין השניים.
- התחילו מהערכים ההתחלתיים: הבדל של 4, σ = 16, n = 36, חד־צדדית, α = .05. מהי העוצמה?
- הגדילו את המדגם עד שהעוצמה מגיעה ל־0.80. כמה נבדקים צריך?
- חזרו ל־36 נבדקים. עברו ל־α = .01, ואז גם לדו־צדדית. מה קרה לעוצמה, ולמה?
בדיקת התשובה
1. בערך 0.44. טעות התקן היא 16 / 6 = 2.67, ההבדל הוא 1.5 טעויות תקן, ו־1.5 − 1.645 שלילי: הממוצע האמיתי עוד לא עבר את הקו. 2. בערך 99 נבדקים. נחשב את זה בנוסחה בסעיף הבא. 3. העוצמה יורדת ל־0.20 בערך עם α = .01, ול־0.14 בערך כשגם עוברים לדו־צדדית. בשני המקרים הקו הקריטי מתרחק מ־μ1: הערך הקריטי עולה ל־2.33, ואחר כך ל־2.58.
מעבדה: שתי הטעויות והעוצמה, עם הנתונים שלנו
כאן הציר הוא ביחידות של סטיית תקן, וההשפעה נמדדת ב־, ההבדל ביחידות של סטיית תקן. נכיר אותו בסעיף 7. בינתיים מספיק לדעת ש־0.26 הוא הבדל של רבע סטיית תקן, בערך. המצב הראשון לקוח מסעיף 7: שביעות הרצון של התלמידים שלנו מול נורמה ארצית.
- בחרו "שביעות רצון מול הנורמה" ואחר כך "אותו אפקט, 20 תלמידים". מה קרה לעוצמה?
- בחרו "בעיות קשב: הבדל של 0.10". מהי העוצמה? מה זה אומר על שאלת הפתיחה?
- בחרו "אין אפקט". כמה תוצאות מובהקות נקבל, ואיך קוראים להן?
בדיקת התשובה
1. העוצמה צונחת מ־0.96 בערך ל־0.21 בערך. אותו אפקט בדיוק, אבל עם 20 תלמידים המחקר יפספס אותו ברוב המקרים. 2. בערך 0.51: רק כחצי מהמחקרים כמו שלנו יגלו הבדל כזה. לכן "לא נמצא הבדל מובהק" בבעיות הקשב לא מוכיח שאין הבדל קטן. נחזור לזה בסעיף 6. 3. בערך 5% מהמחקרים ייתנו תוצאה מובהקת, כגודל α. כולן טעויות מסוג ראשוןType I error, כי באמת אין אפקט.
בדקו את עצמכם3 שאלות
1.בדוגמת הקריאה מהפרק (μ0 = 50, σ = 10, ממוצע אמיתי 55, חד־צדדית, α = .05), מגדילים את המדגם מ־25 ל־64. מה העוצמה?
2.חוקר מחליט לבדוק רק בנים בכיתה ה׳ מעיר אחת, כדי להקטין את הפיזורMeasure of dispersion ולהגדיל את העוצמה. מה המחיר?
3.סטודנטית מציעה: "אם רוצים עוצמה גבוהה, פשוט נעבוד עם α = .10 במקום .05". מה התשובה?
כמה נבדקים צריך? גודל מדגם מינימלי
לפני המחקר קובעים α, עוצמה רצויה (בדרך כלל .80) וגודל השפעה שרוצים לגלות. אז n = ((zα + zβ) · σ / (μ1 − μ0))². תמיד מעגלים כלפי מעלה.
עד עכשיו חישבנו את העוצמה של מחקר שכבר תוכנן. אבל הכי שימושי לשאול את השאלה הפוכה, לפני שמתחילים: כמה נבדקים צריך כדי שהעוצמה תהיה מספיקה? המוסכמה בתכנון מחקר היא עוצמה של .80 לפחות.
צריך להחליט מראש על שלושה דברים: רמת המובהקותSignificance level α, העוצמה הרצויה, וגודל ההשפעה שרוצים להיות מסוגלים לגלות. מה שנשאר, גודל המדגם, מחושב מהם:
| מה זה | הערכים הנפוצים | באקסל | ב־SPSS (Compute Variable) | ב־JASP |
|---|---|---|---|---|
| zα: הערך הקריטי | 1.645 בחד־צדדית, 1.96 בדו־צדדית (α = .05) | =NORM.S.INV(0.975) | IDF.NORMAL(0.975, 0, 1) | מודול Distributions, כמו בפרק 18 |
| zβ: ציון התקן של העוצמה הרצויה | 0.842 לעוצמה .80, 1.282 לעוצמה .90 | =NORM.S.INV(0.8) | IDF.NORMAL(0.8, 0, 1) | מודול Distributions, כמו בפרק 18 |
מה זה zβ? כדי שהעוצמה תהיה 80%, 80% מהעקומה של H1 צריכים להיות מעבר לממוצע הקריטי. כלומר, הממוצע הקריטי צריך לעמוד מתחת ל־μ1, במרחק שמשאיר 80% מהשטח מעליו: 0.842 טעויות תקן. לכן, בבדיקה דו־צדדית, המרחק הכולל בין μ0 ל־μ1 צריך להיות 1.96 + 0.842 = 2.802 טעויות תקן, ומזה יוצאת הנוסחה.
נניח שלשאלון בעיות הקשב יש נורמות ארציות: בכיתות ד׳ ו־ה׳, ממוצע 2.40 וסטיית תקן 0.70. (אלה מספרים לדוגמה, לא נורמות אמיתיות.) חוקרת רוצה להיות מסוגלת לגלות הבדל של 0.10 נקודה מהנורמה, בבדיקה דו־צדדית, α = .05, ובעוצמה של .80.
מסקנה: כדי לגלות הבדל של 0.10 בעוצמה של 80%, צריך 385 תלמידים. במחקר שלנו יש 200. נחזור לזה בסעיף 6.
ולמה תמיד כלפי מעלה? כי עם 384 תלמידים העוצמה כבר קצת פחות מ־.80. גם אילו יצא 384.1, היינו מעגלים ל־385.
שימו לב מה קורה כשמשנים את ההבדל שרוצים לגלות. ההבדל נמצא במכנה, בריבוע:
| ההבדל שרוצים לגלות | 0.20 | 0.10 | 0.05 |
|---|---|---|---|
| גודל מדגם מינימלי | 97 | 385 | 1539 |
הבדל קטן פי 2 דורש מדגם גדול פי 4. השפעות קטנות דורשות מדגמים גדולים מאוד. ומהצד השני, כדי להקטין את טעות התקן פי 2, צריך להגדיל את המדגם פי 4, כי היא תלויה ב־√n.
ואם לא יודעים את σ?
הרבה פעמים לא יודעים מראש את סטיית התקן, ולא את ההבדל בנקודות של השאלון. אז מגדירים את ההשפעה ביחידות של סטיית תקן, (נכיר אותו בסעיף 7), ו־σ יוצאת מהנוסחה:
לבדיקה דו־צדדית, α = .05 ועוצמה .80, המונה הוא 2.802² = 7.85. לכן אפקט של חצי סטיית תקן דורש 7.85 / 0.25 = 31.4, כלומר 32 נבדקים. אפקט של 0.2 סטיית תקן דורש 197. ואפקט של 0.8, רק 13.
במבחן מיומנויות כתיבה סטיית התקן באוכלוסייה היא 8. רוצים לגלות הבדל של 2 נקודות, בבדיקה דו־צדדית ברמה .05, בעוצמה של .90. מהו zβ? כמה תלמידים צריך? ומה אם מסתפקים בעוצמה של .80?
בדיקת התשובה
העלייה מ־80% ל־90% עוצמה עולה כאן 43 תלמידים.
הנוסחה יוצאת מהציור של שתי העקומות. כדי שהעוצמה תהיה בדיוק 1 − β, הממוצע הקריטי צריך לעמוד במקום שמקיים שני תנאים בבת אחת: הוא zα טעויות תקן מעל μ0, וגם zβ טעויות תקן מתחת ל־μ1. כלומר המרחק בין שני הממוצעים הוא (zα + zβ) · SE. מציבים SE = σ / √n, ומחלצים את n.
בפרק 7 קראנו שהחוקרות של המחקר שלנו חישבו מראש, בתוכנה G*Power, שהן צריכות לפחות 153 תלמידים. החישוב שלהן התאים למערך המלא של המחקר, עם שלוש קבוצות ושלוש מדידות, ולכן הנוסחה שלנו לא נותנת בדיוק את המספר הזה. אבל ההיגיון זהה: α, עוצמה רצויה, גודל אפקט צפוי, ומהם גודל המדגם. G*Power היא תוכנה חינמית שעושה את החישובים האלה לכמעט כל מבחן (Faul et al., 2007). היא משתמשת בהתפלגות tt distribution ולא בהתפלגות הנורמלית, ולכן נותנת מעט יותר נבדקים מהנוסחה שלנו. כך גם התוכנות הסטטיסטיות, כפי שנראה בקטע "בתוכנה".
ומאיפה יודעים מה גודל האפקט הצפוי? משלושה מקורות: מחקרים קודמים על תוכניות דומות, מחקר חלוץ קטן, או השאלה "מהו ההבדל הקטן ביותר שהיה חשוב לנו לגלות?". ועוד עצה מעשית: בבתי ספר תמיד יש תלמידים שעוזבים או לא ממלאים את השאלון השני. לכן מוסיפים למספר המחושב כמה אחוזים, לפי הנשירהAttrition הצפויה.
בדקו את עצמכם4 שאלות
1.בחישוב גודל מדגם מינימלי יצא 52.1. כמה נבדקים צריך?
2.אפקט צפוי של d = 0.4, בדיקה דו־צדדית, α = .05, עוצמה .80. כמה נבדקים צריך?
3.בשאלון חרדת מבחנים סטיית התקן באוכלוסייה היא 15. רוצים לגלות הבדל של 5 נקודות, בבדיקה דו־צדדית, α = .05, ובעוצמה של .80. כמה תלמידים צריך?
4.בתכנון מחקר החליטו שרוצים לגלות הבדל קטן פי 3 מזה שתכננו קודם, בלי לשנות שום דבר אחר. מה יקרה לגודל המדגם המינימלי?
רווח סמך לממוצע
רווח סמך הוא טווח של ערכים סבירים לממוצע האוכלוסייה: M ± z · σ / √n. ברמת ביטחוןConfidence level של 95%, z = 1.96. החלק אחרי ה־±, טעות האמידהMargin of error, הוא חצי רוחב הרווח. מדגם גדול: רווח צר. רמת ביטחון גבוהה: רווח רחב.
סקר בחירות מדווח שמפלגה קטנה תקבל 2% מהקולות. מה הסיכוי שבבחירות עצמן היא תקבל בדיוק 2%? כמעט אפסי. אם היא תקבל 2.1%, לא נגיד שהסקר טעה. נגיד שהוא היה קרוב. לכן סוקר זהיר לא אומר "2%", אלא נותן טווח: "בין 1% ל־3%".
את ממוצע המדגם, , הכרנו בפרק 17 כאומדן נקודתיPoint estimate: המספר הטוב ביותר שיש לנו למה שלא ידוע, μ. אבל כמעט בוודאות הוא לא שווה ל־μ בדיוק. רווח סמך מוסיף לאומדןEstimate הנקודתי טווח סביבו, שמבטא כמה אנחנו לא בטוחים.
ועכשיו שאלה: כמה רחב צריך להיות הטווח? אפשר לומר "המפלגה תקבל בין 0% ל־100%", ולהיות צודקים בוודאות. אבל הטווח הזה לא אומר כלום. ככל שרוצים להיות בטוחים יותר, צריך טווח רחב יותר, ומאבדים דיוק. לכן בוחרים מראש רמת ביטחוןConfidence level, ולרוב 95%.
למה דווקא 1.96? כי בפרק 14 ראינו ש־95% מהשטח מתחת לעקומה הנורמלית נמצאים עד 1.96 סטיות תקן מהמרכז. ממוצעי המדגמים מתפלגים נורמלית סביב μ, עם סטיית תקן SE. לכן ב־95% מהמדגמים, הממוצע רחוק מ־μ לכל היותר 1.96 טעויות תקן. ואם M רחוק מ־μ פחות מ־1.96 טעויות תקן, אז גם μ רחוק מ־M פחות מזה. זה בדיוק הרווח.
החלק אחרי ה־±, כלומר z · SE, נקרא טעות האמידהMargin of error. הוא חצי רוחב הרווח. כשבחדשות אומרים "טעות הדגימהSampling error בסקר היא 4.4%", מתכוונים אליו. באקסל מחשבים אותו בפונקציה CONFIDENCE.NORM.
| רמת ביטחון | 90% | 95% | 99% |
|---|---|---|---|
| z | 1.645 | 1.96 | 2.576 |
הממוצע של בעיות הקשב לפני התוכנית (attn_pre) הוא M = 2.4805. נשתמש בסטיית התקן של הנורמות, σ = 0.70, כאילו היא ידועה. (סטיית התקן במדגם שלנו, 0.71, קרובה מאוד.) נבנה רווח סמך של 95% לממוצע בעיות הקשב באוכלוסייה שממנה באו התלמידים.
פירוש: ממוצע בעיות הקשב באוכלוסייה כנראה בין 2.38 ל־2.58. איך בדיוק לקרוא את המילה "כנראה" נראה בסעיף הבא.
בדיווח בסגנון APA כותבים 95% CI [2.38, 2.58]: גבול תחתון ועליון בסוגריים מרובעים.
מה קובע את רוחב הרווח?
| השינוי | הרווח | בדוגמת הקשב |
|---|---|---|
| מדגם גדול יותר | צר יותר | ולהפך: רק 75 התלמידים של התוכנית המשולבת נותנים טעות אמידה של 0.158 במקום 0.097 |
| רמת ביטחון גבוהה יותר | רחב יותר | 90%: [2.40, 2.56] · 95%: [2.38, 2.58] · 99%: [2.35, 2.61] |
| סטיית תקן גדולה יותר באוכלוסייה | רחב יותר | עם σ = 1.40, פי שניים: טעות אמידה 0.194, פי שניים |
רמת ביטחון גבוהה יותר "קונה" ביטחון במחיר של דיוק. מדגם גדול יותר משפר את שניהם יחד, אבל לאט: כדי לחצות את הרוחב צריך פי 4 תלמידים.
במדגם של 64 תלמידים, הממוצע במבחן אוצר מילים הוא 31.5. סטיית התקן באוכלוסייה ידועה: 6. בנו רווח סמך של 95% ושל 99%.
בדיקת התשובה
הרווח של 99% רחב יותר. שני הרווחים מרוכזים סביב אותו מרכז: ממוצע המדגם.
גם רווח סמך אפשר לתכנן מראש. אם רוצים שטעות האמידה תהיה לכל היותר E, פותרים את E = z · σ / √n, ומקבלים n = (z · σ / E)². למשל, כדי לאמוד את ממוצע בעיות הקשב בטעות אמידה של 0.05 לכל היותר, ברמת ביטחון של 95%: (1.96 · 0.70 / 0.05)² = 27.44² = 752.95, כלומר 753 תלמידים. כך מתכננים סקרים: קודם מחליטים כמה דיוק צריך, ומזה נגזר גודל המדגם.
ועוד הערה: כאן הנחנו ש־σ ידועה. כמעט אף פעם היא לא ידועה, ואז משתמשים בסטיית התקן של המדגם, , ובמקום z בערך קריטיCritical value מהתפלגות t, שגדול מעט יותר. זה רווח סמך עם tt confidence interval, בפרק 20. במדגם של 200 ההבדל זניח: הרווח עם t לבעיות הקשב הוא [2.38, 2.58], כמו שלנו.
מעבדה: התפלגות הדגימה ורווחי סמךSampling distribution
המעבדה דוגמת שוב ושוב מאותה אוכלוסייה, ובונה רווח סמך מכל מדגם. כמו שעושים במציאות, היא משתמשת בסטיית התקן של כל מדגם, ולכן גם רוחב הרווחים משתנה קצת ממדגם למדגם (פרק 20). שתי אוכלוסיות: הקשיבות לפני התוכנית, שמתפלגת נורמלית בקירובApproximate normality, ומספר האחים, שמוטה ימינה.
- בחרו בקשיבות, ולחצו כמה פעמים "עוד 100 מדגמים" עם n = 25. השוו את "טעות התקן" לסטיית התקן של הממוצעים שהתקבלו. ואז העבירו את n ל־100 ודגמו שוב. מה קרה לרוחב ההיסטוגרמהHistogram ולרוחב הרווחים?
- כמה אחוזים מהרווחים מכילים את ממוצע האוכלוסייה? האם זה משתנה כשמשנים את n?
- בחרו במספר האחים, עם n = 5 ואחר כך n = 50. מה קורה לצורת התפלגות הממוצעים?
בדיקת התשובה
1. שני המספרים קרובים: טעות התקן היא בדיוק סטיית התקן של התפלגות הממוצעים. עם n = 100 טעות התקן קטנה פי 2 (מ־0.11 ל־0.055), וגם ההיסטוגרמה והרווחים צרים פי 2. 2. בערך 95%, בכל גודל מדגם. גודל המדגם משנה את הרוחב, לא את אחוז הכיסוי. 3. עם 5 התפלגות הממוצעים עדיין מוטה מעט ימינה. עם 50 היא כמעט נורמלית: משפט הגבול המרכזיCentral limit theorem מפרק 17.
בדקו את עצמכם3 שאלות
1.במדגם של 36 תלמידים, הממוצע במבחן שטף קריאה הוא 12.4, וסטיית התקן באוכלוסייה ידועה: 3. מהו רווח הסמך של 95%?
2.מה מהבאים לא משפיע על רוחב רווח הסמך?
3.למה לא בונים פשוט רווח סמך של 100%, ואז בטוחים לגמרי?
מה בדיוק אומר "95% ביטחון"?
μ קבוע, והרווח הוא שמשתנה ממדגם למדגם. "95% ביטחון" פירושו: אם נחזור על המחקר הרבה פעמים, 95% מהרווחים שנבנה יכילו את μ. הרווח הוא על ממוצע האוכלוסייה, לא על הנבדקים.
זו נקודה שמתבלבלים בה הרבה, ולכן נלך לאט.
ממוצע האוכלוסייה, μ, הוא מספר קבוע. אנחנו לא יודעים אותו, אבל הוא לא זז. מה שמשתנה ממדגם למדגם הוא ממוצע המדגם, ואיתו הרווח כולו. דמיינו שחוזרים על המחקר 20 פעמים, כל פעם עם 200 תלמידים אחרים מאותה אוכלוסייה, ובונים כל פעם רווח של 95%. בציור, ממוצע האוכלוסייה הוא 2.40:
רוב הרווחים חוצים את הקו של μ. אחד לא: הממוצע של המדגם שלו יצא רחוק מ־μ, במקרה. על פני הרבה מאוד חזרות, 95% מהרווחים יכילו את μ ו־5% יפספסו. זה הפירוש של "95% ביטחון": הוא אומר משהו על השיטה, על כל הרווחים שהיא מייצרת.
וכמה רווחים יש לחוקר אחד? רק אחד. הוא לא יודע אם הרווח שלו הוא אחד מה־95% הטובים, או אחד מה־5% שמפספסים. מה שהוא יודע הוא שהשתמש בשיטה שצודקת ב־95% מהמקרים.
| הניסוח | נכון? |
|---|---|
| אם נחזור על המחקר הרבה פעמים, 95% מהרווחים שנבנה כך יכילו את ממוצע האוכלוסייה. | כן. זה הפירוש המדויק. |
| הטווח 2.38 עד 2.58 הוא טווח סביר לממוצע האוכלוסייה. ממוצעים מחוצה לו לא מתיישבים עם הנתונים. | כן. זה הפירוש המעשי, וכך כותבים במאמר. |
| 95% מהתלמידים קיבלו ציון בין 2.38 ל־2.58. | לא. הרווח הוא על הממוצע, לא על התלמידים. הציונים של התלמידים מתפזרים מ־1 עד 4.36. |
| ב־95% מהמדגמים, ממוצע המדגם ייפול בין 2.38 ל־2.58. | לא. הרווח מרוכז סביב ממוצע המדגם שלנו. מדגם אחר ייתן רווח אחר. |
| יש סיכוי של 95% ש־μ נמצא בין 2.38 ל־2.58. | בזהירות. ראו "הסיפור המלא". |
- ספרו כמה רווחים אדומים יש. לחצו כמה פעמים "דגמו 100 מדגמים חדשים". האם המספר תמיד 5?
- עברו ל־99% ואחר כך ל־90%. מה קרה לרוחב הרווחים, ולמספר האדומים?
- הגדילו את n ל־100. האם יש פחות רווחים אדומים?
בדיקת התשובה
1. לא. בערך 5, אבל לפעמים 2, לפעמים 8. "95%" מתקיים על פני הרבה מאוד חזרות. 2. ב־99% הרווחים רחבים יותר, ומפספסים רק בערך 1 מכל 100. ב־90% הם צרים יותר, ומפספסים בערך 10. 3. לא. הרווחים צרים יותר, אבל עדיין בערך 5 מפספסים. גודל המדגם קובע את הדיוק, ורמת הביטחון קובעת את אחוז הפספוס.
רווח הסמך הומצא על ידי יז׳י ניימן ב־1937, בתוך הגישה הקלאסית לסטטיסטיקה, שבה הסתברות מתארת מה קורה בחזרות רבות (Neyman, 1937). בגישה הזו, μ הוא מספר קבוע. אחרי שחישבנו רווח מסוים, μ או בתוכו או לא. אין כאן עוד הגרלה, ולכן גם אין "סיכוי של 95%". ההסתברות שייכת לשיטה, לפני שדגמנו: לפני המדגם, הסיכוי שהרווח שנקבל יכיל את μ הוא 95%.
יש גישה אחרת, הגישה הבייסיאנית, שבה מותר לומר "יש סיכוי של 95% שהפרמטר בטווח הזה". שם בונים רווח אמינות (credible interval), בחישוב שונה, שמשלב גם את מה שידענו לפני המחקר. במקרים פשוטים, ועם מדגם גדול, שני הרווחים יוצאים כמעט זהים. לכן הניסוח המעשי, "טווח סביר לממוצע האוכלוסייה", מקובל. ההבדל חשוב בעיקר כשרוצים לדייק, למשל במבחן בקורס.
בדקו את עצמכם3 שאלות
1.ב־40 מחקרים בלתי תלויים, כל אחד בנה רווח סמך של 95% לממוצע של אותה אוכלוסייה. כמה רווחים צפויים, בממוצע, לא להכיל את μ?
2.חוקר חוזר על אותו מחקר שוב ושוב, עם תלמידים אחרים. מה משתנה בין החזרות?
3.סטודנט כתב: "יש סיכוי של 95% שממוצע בעיות הקשב באוכלוסייה נמצא בין 2.38 ל־2.58". מה בעייתי בניסוח, ואיך הייתם מנסחים במקומו?
רווח סמך ובדיקת השערות
רווח סמך של 95% ומבחן דו־צדדי ברמה .05 מגיעים תמיד לאותה מסקנה: אם μ0 מחוץ לרווח, דוחים. אם הוא בתוכו, לא דוחים. היתרון של הרווח: הוא אומר גם מה הטווח הסביר לגודל ההבדל.
רווח סמך ובדיקת השערות הם שני צדדים של אותו חשבון, כמו תמונת ראי. בבדיקת השערות מתחילים מ־μ0, ושואלים אם ממוצע המדגם רחוק ממנו יותר מ־1.96 טעויות תקן. ברווח סמך מתחילים מממוצע המדגם, ושואלים אילו ערכים של μ רחוקים ממנו פחות מ־1.96 טעויות תקן. זה אותו מרחק, מסתכלים עליו משני הקצוות. לכן:
- אם μ0 מחוץ לרווח של 95%: דוחים את השערת האפס, במבחן דו־צדדי ברמה .05.
- אם μ0 בתוך הרווח: לא דוחים.
וזה עובד גם ברמות אחרות: רווח של 99% מתאים למבחן דו־צדדי ברמה .01.
הנורמה בבעיות קשב היא 2.40. רווח הסמך שבנינו הוא [2.38, 2.58]. 2.40 בתוך הרווח, ולכן לא דוחים את השערת האפס. נבדוק במבחן zz test, כמו בפרק 18:
אותה מסקנה: לא נמצא הבדל מובהק. אבל עכשיו אפשר לענות על שאלת הפתיחה. האם זה אומר שהתלמידים שלנו לא שונים מהנורמה?
- הרווח: ממוצע האוכלוסייה של התלמידים שלנו יכול להיות 2.38, קצת מתחת לנורמה, ויכול להיות 2.58, כמעט חמישית נקודה מעליה. הנתונים מתיישבים עם כל הטווח הזה.
- העוצמה: אם באמת התלמידים שלנו גבוהים מהנורמה ב־0.10, הסיכוי של המחקר לגלות את זה הוא NORM.S.DIST(0.10 / 0.0495 − 1.96, TRUE) = .52. כמו הטלת מטבע. בסעיף 3 חישבנו שבשביל עוצמה של 80% היו צריכים 385 תלמידים.
מסקנה: "לא נמצא הבדל מובהק" כאן לא אומר "אין הבדל". הוא אומר שלא היה מספיק מידע כדי לגלות הבדל קטן. לא דחינו, אבל גם לא הוכחנו. ולכן כותבים "לא נמצא הבדל מובהק", ולא "הממוצע שווה לנורמה".
אז למה צריך גם רווח סמך?
כי הם עונים על שאלות שונות. בדיקת השערות עונה על השאלה "האם יש הבדל?". רווח סמך עונה על השאלה "כמה?". חברת תרופות שואלת קודם אם החיסון שלה עובד. אבל רופא רוצה לדעת גם בכמה הוא משפר את מערכת החיסון: "בערך 4%, ובטווח הסביר בין 2% ל־6%" אומר הרבה יותר מ־"p < .05".
והרווח מראה גם כמה המחקר מדויק. תוכנית הרזיה שהשפעתה "בין ירידה של 50 קילו לעלייה של 30 קילו" לא מובהקת, כי האפס בתוך הרווח. אבל הרוחב של הרווח אומר משהו נוסף וחשוב: המחקר כמעט לא לימד אותנו כלום. לכן כתבי עת רבים, וגם מדריך APA, דורשים לדווח רווח סמך לצד ערך pp-value, וחוקרים רבים מעדיפים היום להציג קודם כול אומדנים ורווחי סמך (Cumming, 2014).
רווח סמך של 95% לממוצע ציוני מבחן הוא [68.4, 75.6]. א. מהו ממוצע המדגם? ב. במבחן דו־צדדי ברמה .05, האם דוחים את ההשערה שממוצע האוכלוסייה 75? ומה לגבי 67? ג. מהי טעות התקן?
בדיקת התשובה
רווח סמך רגיל הוא דו־צדדי: 2.5% "בורחים" מכל צד. לכן הוא מתאים בדיוק למבחן דו־צדדי. מבחן חד־צדדי ברמה .05 שם את כל ה־5% בצד אחד, ולכן הוא מתאים לרווח של 90%: ברמה הזו, הגבול של כל צד הוא 1.645 טעויות תקן מהממוצע. בדוגמת הקשב, הרווח של 90% הוא [2.399, 2.562]. הגבול התחתון, 2.399, קטן מעט מ־2.40, ולכן הנורמה בתוך הרווח, במרחק זעיר. ואכן, גם במבחן חד־צדדי ימני z = 1.63 קטן מ־1.645, והמבחן לא מובהק, בקושי. אבל זכרו: בחירה בחד־צדדי אחרי שרואים את הנתונים אסורה.
בדקו את עצמכם3 שאלות
1.רווח סמך של 95% לממוצע הוא [4.1, 5.3]. בודקים את ההשערה שממוצע האוכלוסייה 5.0. מה המסקנה?
2.במבחן z דו־צדדי יצא z = 2.3. האם רווח סמך של 99% יכיל את μ0?
3.מחקר קטן על תוכנית קריאה מדווח שהשיפור בציון הוא בממוצע 2.9 נקודות, 95% CI [−0.4, 6.2]. מה אפשר להסיק?
גודל אפקט: כמה גדול ההבדל?
ערך pp-value תלוי בגודל המדגם: במדגם ענק, גם הבדל זעיר מובהק. גודל אפקט אומר כמה גדול ההבדל, ללא תלות בגודל המדגם. הנפוץ: = ההבדל ביחידות של סטיית תקן. בערך: 0.2 קטן, 0.5 בינוני, 0.8 גדול. מובהק אינו בהכרח חשוב.
נניח שבסקר ארצי גדול, שביעות הרצון מהחיים של תלמידי כיתות ד׳ ו־ה׳ היא בממוצע 4.80, עם סטיית תקן 1.00 (שוב, מספרים לדוגמה). אצל 200 התלמידים שלנו, לפני התוכנית, M = 5.064. האם התלמידים שלנו מרוצים יותר?
מובהק מאוד. אבל האם ההבדל גדול? 0.26 נקודה על סולם של 1 עד 7. ומה היה קורה אילו בדקנו מספר אחר של תלמידים, ובכל פעם יצא בדיוק אותו ממוצע?
| מספר התלמידים | 20 | 50 | 100 | 200 | 1000 |
|---|---|---|---|---|---|
| z | 1.18 | 1.87 | 2.64 | 3.73 | 8.35 |
| p | .238 | .062 | .008 | < .001 | < .001 |
| d | 0.26 | 0.26 | 0.26 | 0.26 | 0.26 |
אותו הבדל בדיוק. עם 20 תלמידים הוא לא מובהק, ועם 1000 הוא "מובהק מאוד". ערך p השתנה, כי הוא תלוי בטעות התקן, שקטנה כשהמדגם גדל. ועם מדגם ענק, של מיליון תלמידים, גם הבדל של מאית נקודה היה יוצא מובהק. לכן ערך p לבדו לא אומר כמה ההבדל חשוב.
מה שלא השתנה בטבלה הוא גודל האפקט, בשורה האחרונה. גודל אפקט הוא מדד לגודל של ההבדל או הקשר, שלא תלוי בגודל המדגם. הנפוץ ביותר להבדלים הוא של כהן: ההבדל, ביחידות של סטיית תקן.
שימו לב להבדל בין z ל־d: אותו מונה, מכנה אחר. ב־z מחלקים בטעות התקן, σ / √n, שקטנה כשהמדגם גדל. ב־d מחלקים בסטיית התקן עצמה, שלא תלויה בגודל המדגם. ומכאן קשר פשוט: z = d · √n. בדוגמה: 0.264 · 14.14 = 3.73.
כהן (Cohen, 1988) הציע סימני דרך לפירוש:
| d | 0.2 | 0.5 | 0.8 |
|---|---|---|---|
| פירוש | קטן | בינוני | גדול |
אצלנו d = 0.26: מובהק, אבל קטן. ובדיווח כותבים את שניהם: ערך p עונה על השאלה "האם סביר שזה מקרי?", וגודל האפקט על השאלה "כמה גדול?".
גודל אפקט הוא גם בדיוק מה שצריך לתכנון מחקר: בסעיף 3 ראינו ש־n = ((zα + zβ) / d)². ויש גדלי אפקט נוספים: את מקדם המתאםCorrelation כבר הכרנו בפרק 15, והוא בעצמו גודל אפקט. את d של כהןCohen's d לשני מדגמים נחשב בפרק 21, ומדדים נוספים יגיעו עם ניתוח השונות והרגרסיה.
חוקר בדק 2500 תלמידים במבחן מתמטיקה ארצי (μ0 = 500, σ = 100), ומצא ממוצע 505. חשבו z, ערך p דו־צדדי ו־d. מה הייתם אומרים לעיתונאי שכותב "התלמידים האלה טובים משמעותית מהממוצע הארצי"?
בדיקת התשובה
ההבדל מובהק סטטיסטית, אבל זעיר: חמש מאיות של סטיית תקן, הרבה מתחת ל"קטן" של כהן. "משמעותית" בעיתון נשמע כמו "הרבה". כאן הוא אומר רק שההבדל כנראה לא מקרי, בזכות המדגם הענק.
כהן עצמו הזהיר שהמספרים 0.2, 0.5 ו־0.8 הם ברירת מחדל, למי שאין לו שום מידע אחר. מה נחשב גדול תלוי בתחום. בחינוך, תוכנית זולה שמשפרת הישגים ב־0.2 סטיות תקן אצל מאות אלפי תלמידים יכולה להיות הצלחה גדולה. ובמחקר על תרופה, אפקט "בינוני" שמחיר תופעות הלוואי שלו גבוה יכול להיות לא כדאי. לכן הדרך הטובה ביותר לפרש גודל אפקט היא להשוות אותו לגדלי אפקט במחקרים דומים, ולשאול מה ההבדל אומר בעולם האמיתי: כמה נקודות, כמה תלמידים, כמה כסף.
ועוד דבר: גם גודל האפקט הוא אומדן, ולכן גם לו יש רווח סמך. אצלנו הרווח לממוצע, [4.93, 5.20], אומר שההבדל מהנורמה הוא בין 0.13 ל־0.40 נקודה, כלומר d בין 0.13 ל־0.40, כי σ = 1. ההבדל כנראה לא אפס, אבל גם כנראה לא גדול.
בדקו את עצמכם3 שאלות
1.במבחן קריאה ארצי μ = 100, σ = 15. בבית ספר מסוים הממוצע 103. מהו d, ואיך מתארים אותו?
2.שני מחקרים מצאו d = 0.3. באחד 30 נבדקים, ובשני 300. מה נכון?
3.מאמר מדווח: "400 תלמידים, z = 4.0, p < .001", אבל לא מדווח גודל אפקט. חשבו את d מהמספרים האלה, ופרשו.
בתוכנה: רווח סמך, עוצמה וגודל מדגם
נחזור לבעיות הקשב (attn_pre) ולנורמה: μ0 = 2.40, σ = 0.70. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות. באקסל נעשה בדיוק את החישובים של הפרק, עם z ועם σ ידועה. שימו לב: SPSS לא בונה רווח סמך עם σ ידועה. הוא משתמש בסטיית התקן של המדגם ובהתפלגות tt distribution, שנלמד בפרק 20. במדגם של 200 ההבדל זניח. שימו לב: JASP לא בונה רווח סמך עם σ ידועה. הוא משתמש בסטיית התקן של המדגם ובהתפלגות t, שנלמד בפרק 20. במדגם של 200 ההבדל זניח.
attn_pre היא עמודה AJ, בשורות 2 עד 201. בעמודה BE כותבים תוויות, ובעמודה BF את הנוסחאות:
רווח סמך, מבחן z, עוצמה וגודל מדגם
| BE | BF: הנוסחה | התוצאה | |
|---|---|---|---|
| 2 | Mean | =AVERAGE(AJ2:AJ201) | 2.4805 |
| 3 | Margin of error | =CONFIDENCE.NORM(0.05,0.7,200) | 0.0970 |
| 4 | Lower | =BF2-BF3 | 2.3834 |
| 5 | Upper | =BF2+BF3 | 2.5775 |
| 6 | z | =(BF2-2.4)/(0.7/SQRT(200)) | 1.6255 |
| 7 | p (two-tailed) | =2*(1-NORM.S.DIST(ABS(BF6),TRUE)) | 0.1041 |
| 8 | Power (diff 0.1) | =NORM.S.DIST(0.1/(0.7/SQRT(200))-NORM.S.INV(0.975),TRUE) | 0.5241 |
| 9 | n for power .8 | =ROUNDUP(((NORM.S.INV(0.975)+NORM.S.INV(0.8))*0.7/0.1)^2,0) | 385 |
- CONFIDENCE.NORM
- טעות האמידה: z · σ / √n. שלושה ארגומנטים, בסדר הזה: α (0.05 לרווח של 95%, 0.01 ל־99%), סטיית התקן באוכלוסייה, וגודל המדגם. הפונקציה לא מקבלת את הנתונים עצמם, ולא את הממוצע.
- Lower, Upper
- גבולות הרווח: הממוצע פחות טעות האמידה, והממוצע ועוד טעות האמידה. [2.38, 2.58].
- NORM.S.INV
- הופכת שטח לציון תקןz-score (פרק 14).
NORM.S.INV(0.975)נותן 1.96, הערך הקריטי הדו־צדדי.NORM.S.INV(0.8)נותן 0.842, הוא zβ. - ROUNDUP
- מעגלת כלפי מעלה. הארגומנט השני, 0, אומר לעגל למספר שלם. אל תשתמשו ב־
ROUND: 384.4 היה מתעגל ל־384, והעוצמה הייתה נמוכה מהרצוי.
אפשר להחליף את 0.7, 0.1 ו־0.8 בהפניות לתאים, ואז הגיליון הופך למחשבון: משנים את ההבדל או את העוצמה הרצויה, ורואים מיד את התוצאה. ולמי שרוצה רווח עם סטיית התקן של המדגם: CONFIDENCE.T, בפרק 20.
רווח סמך: SPSS מחשב רווח סמך לממוצע ב־Explore, שהכרנו בפרק 12.
- Analyze > Descriptive Statistics > Explore. מעבירים את
attn_preל־Dependent List. - בכפתור Statistics מסומן Descriptives, ולידו Confidence Interval for Mean: 95%. לרווח של 99%, משנים ל־99.
Descriptives
| Statistic | Std. Error | ||
|---|---|---|---|
| Attention problems, pre | Mean | 2.48 | .051 |
| 95% Confidence Interval for Mean, Lower Bound | 2.38 | ||
| 95% Confidence Interval for Mean, Upper Bound | 2.58 | ||
| 5% Trimmed Mean | 2.48 | ||
| Median | 2.55 | ||
| Variance | .511 | ||
| Std. Deviation | .715 | ||
| Minimum | 1.00 | ||
| Maximum | 4.36 | ||
| Range | 3.36 | ||
| Interquartile Range | .91 | ||
| Skewness | .045 | .172 | |
| Kurtosis | -.120 | .342 | |
- Mean, Std. Error
- הממוצע, וטעות התקן שלו. SPSS מחשב את טעות התקן מסטיית התקן של המדגם: .715 / √200 = .051. אצלנו, עם σ של הנורמות, יצא .0495.
- 95% Confidence Interval for Mean
- הגבול התחתון והעליון: [2.38, 2.58]. בדיוק כמו בחישוב שלנו, בשתי ספרות. בספרה השלישית יש הבדל קטן (2.381 ו־2.580 מול 2.383 ו־2.577), כי SPSS משתמש ב־SD של המדגם ובערך קריטי של tCritical t value, 1.972, במקום 1.96.
עוצמה וגודל מדגם: מגרסה 27, ל־SPSS יש תפריט לניתוחי עוצמה.
- Analyze > Power Analysis > Means > One-Sample T Test
- Estimate: Sample size. Single power value: 0.8.
- Population mean: 2.50 (הנורמה ועוד ההבדל שרוצים לגלות). Null value: 2.40. Population standard deviation: 0.70.
- Test Direction: Nondirectional (two-sided) analysis. Significance level: 0.05.
Power Analysis Table
| N | Actual Powerb | Test Assumptions: Power | Std. Dev. | Sig. | |
|---|---|---|---|---|---|
| Test for Meana | 387 | .800 | .8 | .7 | .05 |
| a. Two-sided test. b. Based on noncentral t-distribution. | |||||
- N
- גודל המדגם המינימלי: 387. הנוסחה שלנו נתנה 385. ההבדל הקטן הוא כי SPSS מחשב עם התפלגות t ולא עם הנורמלית, ומניח שגם את סטיית התקן נאמוד מהמדגם.
- Actual Power
- העוצמה שמתקבלת בפועל עם 387 נבדקים. היא מעט מעל העוצמה המבוקשת, כי גודל המדגם הוא מספר שלם.
- שינוי השאלה
- כדי לקבל את העוצמה של המחקר שלנו, בוחרים Estimate: Power, ומקלידים 200 בגודל המדגם. SPSS נותן .520, לעומת .524 בנוסחה שלנו.
שמות השדות והעמודות בחלון Power Analysis עשויים להשתנות מעט בין גרסאות.
רווח סמך: ב־JASP הדרך הפשוטה היא דרך חלון של מבחן t למדגם בודדOne-sample t test (פרק 20). כאן נשתמש בו רק בשביל הרווח.
- T-Tests > One Sample T-Test. מעבירים את
attn_preל־Variables. - Test value: 2.40, הנורמה.
- מסמנים Student, ותחת Additional Statistics: Location estimate (הפרש הממוצעים) ו־Confidence interval: 95%.
One Sample T-Test
| t | df | p | Mean Difference | 95% CI Lower | 95% CI Upper | |
|---|---|---|---|---|---|---|
| attn_pre | 1.59 | 199 | .113 | 0.08 | -0.02 | 0.18 |
| Note. For the Student t-test, the alternative hypothesis specifies that the population mean is different from 2.4. | ||||||
- Mean Difference
- ממוצע המדגם פחות ערך הבדיקהTest value: 2.48 − 2.40 = 0.08.
- 95% CI
- רווח סמך להפרש מהנורמה: [−0.02, 0.18]. כדי לקבל רווח לממוצע עצמו, מוסיפים 2.40 לשני הגבולות: [2.38, 2.58]. ושימו לב: האפס בתוך הרווח של ההפרש, בדיוק כמו ש־2.40 בתוך הרווח של הממוצע. ולכן גם המבחן לא מובהק.
- t, p
- גרסת t של מבחן z שעשינו. p = .113, קרוב ל־.104 שלנו. ההבדל הוא שוב t מול z, ו־SD של המדגם מול σ.
עוצמה וגודל מדגם: ל־JASP יש מודול Power. מפעילים אותו בכפתור ה־+ שבסרגל המודולים.
- Power. ב־Test בוחרים One Sample T-Test.
- Calculate: N. Minimal effect size of interest: 0.143 (ההבדל, 0.10, חלקי σ, 0.70: זה d). Minimum desired power: 0.8. α: 0.05. Alternative Hypothesis: Two-sided.
A Priori Power Analysis
| N | Effect size | Power | α |
|---|---|---|---|
| 386 | 0.143 | 0.800 | 0.050 |
- N
- 386 תלמידים. הנוסחה שלנו נתנה 385. JASP מחשב עם התפלגות t, ולכן קצת יותר. (עם d המדויק, 0.142857…, יוצא 387.)
- Effect size
- JASP עובד ב־d, לא בנקודות של השאלון. לכן מחלקים את ההבדל בסטיית התקן לפני שמקלידים.
- Calculate
- אפשר לבחור גם Power, ולהקליד N = 200. מתקבלת עוצמה של כ־.52. המודול מצייר גם גרף של העוצמה לפי גודל המדגם, שימושי מאוד בתכנון.
שמות האפשרויות במודול Power ובחלון המבחן עשויים להשתנות מעט בין גרסאות.
בדקו את עצמכם4 שאלות
1.מה תחזיר הנוסחה =CONFIDENCE.NORM(0.01,0.7,200)?
1.ב־SPSS, ב־Explore, בכפתור Statistics, מה כותבים בשדה Confidence Interval for Mean כדי לקבל רווח סמך של 99%?
CONFIDENCE.NORM באקסל, ו־0.99 הוא אותה רמה כשבר, שהשדה לא מצפה לו.1.ב־JASP, בחלון One Sample T-Test, תחת Confidence interval, מה כותבים כדי לקבל רווח סמך של 99%?
2.למה רווח הסמך שמחשבות התוכנות הסטטיסטיות מהנתונים שונה מעט מהרווח שחישבנו ביד לבעיות הקשב?
3.באקסל, גודל המדגם הוא =ROUNDUP(((NORM.S.INV(0.975)+NORM.S.INV(0.8))*σ/Δ)^2,0). רוצים לגלות הבדל של 0.15 נקודה בחרדה, כשסטיית התקן באוכלוסייה 0.50. מה מציבים במקום σ/Δ?
3.ב־SPSS, ב־Analyze > Power Analysis > Means > One-Sample T Test, רוצים לחשב כמה תלמידים צריך כדי לגלות הבדל של 0.15 נקודה בחרדה מהנורמה, 2.30, כשסטיית התקן באוכלוסייה 0.50. Null value הוא 2.30. מה מקלידים ב־Population mean?
3.ב־JASP, במודול Power, רוצים לחשב כמה תלמידים צריך כדי לגלות הבדל של 0.15 נקודה בחרדה מהנורמה, כשסטיית התקן באוכלוסייה 0.50. איזה מספר מקלידים ב־Minimal effect size of interest?
4.חשבו את הגבול התחתון של רווח סמך של 99% לממוצע התלונות הגופניות (soma_pre), בהנחה ש־σ = 0.50. ממוצע המדגם 1.846, ו־n = 200.
טעויות נפוצות
- "לא מובהק" = "אין הבדל". תוצאה לא מובהקת יכולה לנבוע מעוצמה נמוכה. בדקו את רוחב רווח הסמך ואת העוצמה לפני שמסיקים משהו.
- מבלבלים בין עוצמה ל־α. α היא הסיכוי לדחות כשאין השפעה. העוצמה היא הסיכוי לדחות כשיש.
- מעגלים את גודל המדגם כלפי מטה. 384.1 הופך ל־385. תמיד כלפי מעלה.
- "95% מהתלמידים נמצאים ברווח הסמך". רווח הסמך הוא על ממוצע האוכלוסייה, לא על הנבדקים.
- "ב־95% מהמדגמים הממוצע ייפול ברווח שלנו". הרווח משתנה ממדגם למדגם. 95% מתייחס לכל הרווחים שהשיטה בונה.
- חושבים שמדגם גדול יותר מקטין את אחוז הרווחים שמפספסים. מדגם גדול מצר את הרווח. אחוז הפספוס נקבע רק ברמת הביטחון.
- "מובהק מאוד" = "השפעה גדולה". ערך p קטן יכול לנבוע ממדגם ענק. דווחו תמיד גם גודל אפקט.
- מכניסים לנוסחה של d את טעות התקן במקום את סטיית התקן. מה שמתקבל הוא z, לא d.
בדקו את עצמכם
סיכום
- עוצמה: הסיכוי לדחות את השערת האפס כשההשערה החלופית נכונה, 1 − β. מחושבת ביחס לגודל השפעה מסוים.
- חישוב: המרחק בין μ1 ל־μ0 בטעויות תקן, פחות הערך הקריטי, ואז
NORM.S.DIST. - מה מגדיל עוצמה: השפעה גדולה, σ קטנה, מדגם גדול, α גדולה, השערה חד־צדדית בכיוון הנכון. בפועל: מגדילים את המדגם.
- גודל מדגם מינימלי: מחליטים מראש על α, עוצמה וגודל השפעה. מעגלים כלפי מעלה.
- רווח סמך: הממוצע ועוד ופחות z טעויות תקן. 95% מהרווחים שהשיטה בונה מכילים את μ.
- רווח ומבחן: μ0 מחוץ לרווח של 95%: דוחים במבחן דו־צדדי ברמה .05. הרווח מוסיף את הטווח הסביר לגודל ההבדל.
- גודל אפקט: כמה גדול ההבדל, ללא תלות בגודל המדגם. d = (M − μ0) / σ. מובהק אינו בהכרח חשוב.
מונחים חדשים
שאלות לדוגמה, עם פתרונות
רווח סמך של 95% לממוצע ציוני מבחן מתמטיקה, ב־64 תלמידים, הוא [71.2, 76.8]. הרווח חושב עם סטיית תקן ידועה של האוכלוסייה. א. מהו ממוצע המדגם, ומהי טעות האמידה? ב. מהי סטיית התקן באוכלוסייה? ג. במבחן דו־צדדי ברמה .05, האם דוחים את ההשערה שממוצע האוכלוסייה 70? ומה לגבי 72? ד. האם רווח של 99% יכיל את 70?
בדיקת התשובה
M = (71.2 + 76.8) / 2 = 74, טעות האמידה = 76.8 − 74 = 2.8 אSE = 2.8 / 1.96 = 1.4286, σ = SE · √64 = 1.4286 · 8 = 11.43 ב. טעות האמידה היא 1.96 טעויות תקן70 מחוץ לרווח → דוחים. 72 בתוך הרווח → לא דוחים ג2.576 · 1.4286 = 3.68 → [70.32, 77.68] ד. רווח של 99%ד. לא: גם הרווח הרחב יותר, של 99%, לא מגיע ל־70. כלומר גם ברמה .01 היינו דוחים את ההשערה שהממוצע 70. אפשר לראות את זה גם בלי לבנות את הרווח: 70 רחוק מ־74 ב־4 / 1.4286 = 2.8 טעויות תקן, יותר מ־2.576.
במבחן קריאה ארצי μ0 = 60 ו־σ = 12. מורה רוצה לבדוק אם תוכנית תגבור מעלה את הציונים, עם 49 תלמידים, בהשערה חד־צדדית ימנית, α = .05. היא מקווה שהתוכנית מעלה את הממוצע ל־64. א. מהו הממוצע הקריטי? ב. מהי העוצמה? ג. כמה תלמידים היא צריכה לעוצמה של .90?
בדיקת התשובה
SE = 12 / √49 = 12 / 7 = 1.71460 + 1.645 · 1.714 = 62.82 א. הממוצע הקריטי(64 − 60) / 1.714 = 2.333, 2.333 − 1.645 = 0.688 ב. המרחק בטעויות תקן, פחות הערך הקריטיNORM.S.DIST(0.688, TRUE) = .75n = ((1.645 + 1.282) · 12 / 4)² = (2.927 · 3)² = 8.781² = 77.11 → 78 געם 49 תלמידים יש סיכוי של 75% לגלות שיפור של 4 נקודות, ו־25% לפספס. כדי להגיע ל־90% צריך 78 תלמידים.
חוקרת רוצה לאמוד את ממוצע החרדה של תלמידי כיתות ד׳ ו־ה׳ בעיר. מתוך הנורמות היא מניחה שסטיית התקן 0.50. א. כמה תלמידים היא צריכה כדי שטעות האמידה, ברמת ביטחון של 95%, תהיה לכל היותר 0.05? ב. ואם היא רוצה רמת ביטחון של 99%? ג. בלי לחשב: כמה תלמידים היו נדרשים לטעות אמידה של 0.10, ברמה של 95%?
בדיקת התשובה
n = (1.96 · 0.50 / 0.05)² = 19.6² = 384.16 → 385 אn = (2.576 · 0.50 / 0.05)² = 25.76² = 663.58 → 664 ב385 / 4 ≈ 97 ג. טעות אמידה גדולה פי 2: מדגם קטן פי 4ג. בדיוק: (1.96 · 5)² = 96.04, כלומר 97. רמת ביטחון גבוהה יותר, או דיוק רב יותר, עולים בהרבה תלמידים.
הנורמה הארצית בתלונות גופניות היא μ = 1.75, σ = 0.50 (מספרים לדוגמה). סטודנט חישב באקסל את הפלט הבא, ל־
soma_preשל 200 התלמידים. א. מהו רווח הסמך של 95%? ב. האם התלמידים שלנו שונים מהנורמה, במבחן דו־צדדי ברמה .05? ג. חשבו את d ופרשו. ד. הסטודנט כתב: "95% מהתלמידים מדווחים על תלונות גופניות בין 1.78 ל־1.92". מה הבעיה?soma_pre
הנוסחה התוצאה Mean =AVERAGE(AK2:AK201)1.8460 Margin =CONFIDENCE.NORM(0.05,0.5,200)0.0693 z =(1.846-1.75)/(0.5/SQRT(200))2.7153 p =2*(1-NORM.S.DIST(2.7153,TRUE))0.0066 בדיקת התשובה
1.8460 ± 0.0693 → [1.78, 1.92] א1.75 מחוץ לרווח, z = 2.72, p = .007 → דוחים ב. שתי הדרכים מסכימותd = (1.846 − 1.75) / 0.50 = 0.19 גב. כן: התלמידים שלנו מדווחים על יותר תלונות גופניות מהנורמה, z = 2.72, p = .007. ג. אבל ההבדל קטן, כחמישית סטיית תקן, ממש על סימן הדרך "קטן" של כהן. ההבדל כנראה לא מקרי, אבל לא בהכרח חשוב. ד. רווח הסמך הוא על ממוצע האוכלוסייה, לא על התלמידים. התלמידים עצמם מתפזרים מ־1 עד 3.4, הרבה מעבר לרווח.
מורה בדקה 30 תלמידים במבחן שבו μ0 = 50 ו־σ = 10, וקיבלה M = 52.4. היא כותבת בדוח: "הבדיקה הראתה שהתלמידים שלנו לא שונים מהממוצע הארצי". א. בדקו בעצמכם, במבחן דו־צדדי ברמה .05, ובנו רווח סמך של 95%. ב. מה העוצמה של המבחן שלה, אם התלמידים באמת גבוהים ב־3 נקודות? ג. מה הייתם כותבים במקומה? ד. כמה תלמידים היו נדרשים לעוצמה של .80 להבדל כזה?
בדיקת התשובה
SE = 10 / √30 = 1.826z = (52.4 − 50) / 1.826 = 1.31, p = .189 → לא דוחים א52.4 ± 1.96 · 1.826 → [48.82, 55.98]3 / 1.826 − 1.96 = −0.317, NORM.S.DIST(−0.317, TRUE) = .38 בn = ((1.96 + 0.842) · 10 / 3)² = 9.34² = 87.24 → 88 דג. הניסוח "לא שונים" שגוי. נכון לכתוב: "לא נמצא הבדל מובהק בין התלמידים לממוצע הארצי, z = 1.31, p = .189, 95% CI [48.82, 55.98]". הרווח מראה שהממוצע האמיתי יכול להיות גם כמעט 6 נקודות מעל הנורמה. והעוצמה, 38%, אומרת שגם אילו התלמידים היו באמת גבוהים ב־3 נקודות, ברוב המקרים מבחן כזה לא היה מגלה את זה. המדגם פשוט קטן מדי.
תרגול עם הנתונים
קובץ המחקר: 200 תלמידים, 55 משתנים. בשאלות האלה נשתמש בנורמות לדוגמה, שבהן סטיית התקן באוכלוסייה ידועה. בכל שאלה הנורמה כתובה בשאלה עצמה.
הקבצים עצמם, care_school.csv ומילון המשתנים, נמצאים גם בתיקיית data בחבילת הספר.
- בנו רווח סמך של 95% ושל 99% לממוצע שביעות הרצון מהחיים לפני התוכנית (
sat_pre), עם σ = 1.00.בדיקת התשובה
M = 5.064. 95%: 5.064 ± 0.139 → [4.93, 5.20]. 99%: 5.064 ± 0.182 → [4.88, 5.25]. באקסל:
=CONFIDENCE.NORM(0.05,1,200)ו־=CONFIDENCE.NORM(0.01,1,200). - הנורמה בחרדה היא μ = 2.30, σ = 0.50. בעזרת רווח סמך של 95%, האם החרדה של התלמידים שלנו לפני התוכנית (
anx_pre) שונה מהנורמה? חשבו גם d.בדיקת התשובה
M = 2.2356, טעות האמידה 0.069, ורווח הסמך [2.17, 2.30]. הגבול העליון הוא 2.3049, כלומר 2.30 בתוך הרווח, ממש בקצה: לא דוחים. במבחן z: z = −1.82, p = .069. d = −0.13: גם אילו ההבדל היה מובהק, הוא היה קטן מאוד. שימו לב: כשמעגלים לשתי ספרות, נדמה שהנורמה יושבת בדיוק על הגבול. מחליטים לפי הערכים המדויקים, או לפי ערך p.
- חזרו לבעיות הקשב, עם σ = 0.70, אבל רק לתלמידי התוכנית המשולבת (
group= 2). בנו רווח סמך של 95%, והשוו את הרוחב שלו לרוחב הרווח של כל 200 התלמידים.בדיקת התשובה
75 תלמידים, M = 2.5067. טעות האמידה 1.96 · 0.70 / √75 = 0.158, ורווח הסמך [2.35, 2.67]. רוחב 0.32, לעומת 0.19 בכל המדגם. היחס הוא √(200 / 75) = 1.63: פחות תלמידים, פחות דיוק.
- חוקר רוצה לחזור על המחקר בבתי ספר אחרים, ולגלות הבדל של 0.15 נקודה בחרדה מהנורמה (σ = 0.50), בבדיקה דו־צדדית, α = .05. מה העוצמה עם 200 תלמידים? וכמה תלמידים צריך לעוצמה של .90?
בדיקת התשובה
SE = 0.50 / √200 = 0.0354. העוצמה: NORM.S.DIST(0.15 / 0.0354 − 1.96, TRUE) = NORM.S.DIST(2.28, TRUE) = .99. לעוצמה של .90: ((1.96 + 1.282) · 0.50 / 0.15)² = 116.8, כלומר 117 תלמידים. 200 תלמידים יותר ממספיקים.
בפרק הבא: מה עושים כשסטיית התקן באוכלוסייה לא ידועה, וזה המצב כמעט בכל מחקר. נכיר את התפלגות t ואת דרגות החופשDegrees of freedom, נבנה מבחן t למדגם בודד, ונבנה רווח סמך עם tt confidence interval.
מקורות: Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Erlbaum. · Cumming, G. (2014). The new statistics: Why and how. Psychological Science, 25(1), 7–29. https://doi.org/10.1177/0956797613504966 · Faul, F., Erdfelder, E., Lang, A.-G., & Buchner, A. (2007). G*Power 3: A flexible statistical power analysis program for the social, behavioral, and biomedical sciences. Behavior Research Methods, 39(2), 175–191. https://doi.org/10.3758/BF03193146 · Neyman, J. (1937). Outline of a theory of statistical estimation based on the classical theory of probability. Philosophical Transactions of the Royal Society of London. Series A, 236(767), 333–380. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y