סטטיסטיקה מ־0 עד 100בטאתוכנהעומק

חלק ג: מהמדגם לאוכלוסייה · פרק 19

עוצמה ורווח סמך

בפרק 18 למדנו להחליט אם לדחות את השערת האפסNull hypothesis. בפרק הזה נשאל שלוש שאלות שמשלימות את התמונה: מה הסיכוי שהמחקר שלנו בכלל יגלה השפעה שבאמת קיימת? כמה נבדקים צריך כדי שזה יקרה? ואיך אומדיםEstimator את ממוצע האוכלוסייה לא במספר אחד, אלא בטווח?

שאלת הפתיחה

השווינו את בעיות הקשב של 200 התלמידים במחקר לנורמה ארצית (נורמה לדוגמה, שנציג בסעיף 3), ולא נמצא הבדל מובהק. האם זה אומר שהתלמידים שלנו לא שונים מהנורמה?

התשובה הקצרה: לא בהכרח. בסוף הפרק תדעו לשאול שתי שאלות נוספות לפני שמסיקים משהו: כמה עוצמה הייתה למבחן, ומה הטווח הסביר להבדל. ותגלו שבמקרה הזה, הסיכוי לגלות הבדל קטן אבל אמיתי היה בערך כמו הטלת מטבע.

בסוף הפרק תוכלו

עוצמה: הסיכוי לגלות השפעה שקיימת

עוצמת המבחן היא הסיכוי לדחות את השערת האפס כשהיא באמת לא נכונה: לגלות השפעה שקיימת. היא שווה ל־1 − β. מחשבים אותה כשטח מתחת לעקומהArea under the curve של ההשערה החלופיתResearch hypothesis, מעבר לממוצע הקריטי.

בפרק 18 ראינו שכל החלטה במבחן יכולה לטעות בשתי דרכים. נזכיר את הטבלה:

במציאות: אין השפעה ( נכונה)במציאות: יש השפעה ( נכונה)
דחינו את השערת האפסטעות מסוג ראשון. הסיכוי לה: Type I errorהחלטה נכונה. הסיכוי לה: העוצמה, 1 − β
לא דחינוהחלטה נכונה. הסיכוי לה: 1 − αטעות מסוג שני. הסיכוי לה: βType II error

בשורה הראשונה דוחים את השערת האפס בשני המקרים. ההבדל הוא אם דוחים בצדק או שלא בצדק. α היא הסיכוי לדחות שלא בצדק. העוצמה היא הסיכוי לדחות בצדק: לומר שהתוכנית עוזרת, כשהיא באמת עוזרת. זה המקום שבו כל חוקר רוצה להיות, ולכן הוא רוצה שהסיכוי הזה יהיה גבוה ככל האפשר.

אבל שימו לב לבעיה. את α קובעים מראש, כי השערת האפס אומרת בדיוק מהו ממוצע האוכלוסייה. כדי לחשב עוצמה צריך להחליט גם מה הממוצע אם השערת האפס לא נכונה. ההשערה "יש השפעה" לא אומרת כמה. לכן העוצמה מחושבת תמיד ביחס לגודל השפעה מסוים: "אם הממוצע האמיתי הוא 1, מה הסיכוי שנדחה?"

שתי עקומות

מבחן הבנת הנקרא ארצי בנוי כך שבאוכלוסייה הממוצע 50 וסטיית התקן σ = 10. בית ספר מנסה תוכנית קריאה חדשה עם 25 תלמידים, ובודק השערה חד־צדדיתOne-tailed hypothesis / test: התוכנית מעלה את הציון. α = .05. ונניח שבאמת, התוכנית מעלה את הממוצע ל־55.

בפרק 17 ראינו שממוצעי מדגמים מתפלגים נורמלית סביב ממוצע האוכלוסייה, עם = σ / √n = 10 / 5 = 2. כאן יש שתי אפשרויות, ולכן שתי עקומות:

את הקו המקווקו, הממוצע הקריטי, קובעים לפי העקומה של H0 בלבד, בדיוק כמו בפרק 18: מעליו דוחים. עכשיו מסתכלים על שלושה שטחים:

העוצמה ו־β הן שני חלקים של אותה עקומה, ולכן הן תמיד מסתכמות ב־1.

4244464850525456586062ממוצע קריטי: 53.29H0: μ = 50H1: μ = 55עוצמה .80β .20α .05ממוצע המדגם (n = 25)
מבחן הבנת הנקרא: μ0 = 50, σ = 10, n = 25, חד־צדדי ימני, α = .05. אם הממוצע האמיתי 55, ממוצע המדגם יעבור את הממוצע הקריטי ב־80% מהמחקרים.
דוגמה פתורה: מה העוצמה של מחקר הקריאה?

אותם נתונים: μ0 = 50, σ = 10, n = 25, חד־צדדית ימנית, α = .05, והממוצע האמיתי 55.

SE = 10 / √25 = 10 / 5 = 2 1. טעות התקן
50 + 1.645 · 2 = 53.29 2. הממוצע הקריטי: מעליו דוחים. 1.645 הוא הערך הקריטי החד־צדדי מפרק 18
z = (53.29 − 55) / 2 = −0.855 3. ציון התקן של הממוצע הקריטי, הפעם לפי העקומה של H1, סביב 55
1 − NORM.S.DIST(−0.855, TRUE) = 1 − .196 = .804 4. העוצמה: השטח מימין לממוצע הקריטי, מתחת לעקומה של H1
β = 1 − .804 = .196

מסקנה: אם התוכנית באמת מעלה את הממוצע ל־55, יש סיכוי של כ־80% שהמחקר יגלה את זה. ויש סיכוי של כ־20% שהוא יפספס, ויגיד "לא נמצא הבדל מובהק" על תוכנית שעובדת.

קיצור דרך

אפשר לחבר את ארבעת השלבים לנוסחה אחת. שואלים כמה טעויות תקן μ1 רחוק מ־μ0, ומחסירים את הערך הקריטי. מה שנשאר הוא המרחק של μ1 מעבר לקו, ביחידות של טעות תקןStandard error:

עוצמה = NORM.S.DIST( μ1 − μ0SE − zקריטי , TRUE )

בדוגמה: (55 − 50) / 2 = 2.5 טעויות תקן. פחות 1.645 נשאר 0.855, ו־=NORM.S.DIST(0.855,TRUE) נותן .804. אותה תוצאה בדיוק.

ובבדיקה דו־צדדית? משתמשים בערך הקריטי הדו־צדדי, 1.96. באופן עקרוני יש גם סיכוי לדחות בזנב השני, אבל כשהעקומה של H1 מוזזת ימינה, השטח שלה בזנב השמאלי זעיר, ומזניחים אותו. בדוגמה: 2.5 − 1.96 = 0.54, ועוצמה של .705.

עצרו ונסו

ציוני מבחן חשבון ארצי: μ0 = 100, σ = 15. בודקים 36 תלמידים, בהשערה חד־צדדיתOne-tailed hypothesis / test ימנית, α = .05. הממוצע האמיתי של התלמידים האלה הוא 106. מהי טעות התקןStandard error? מהו הממוצע הקריטי? מהי העוצמה, ומהי β?

בדיקת התשובה
SE = 15 / √36 = 15 / 6 = 2.5
100 + 1.645 · 2.5 = 104.11 הממוצע הקריטי
(106 − 100) / 2.5 = 2.4 μ1 רחוק מ־μ0 2.4 טעויות תקן
NORM.S.DIST(2.4 − 1.645, TRUE) = NORM.S.DIST(0.755, TRUE) = .775 העוצמה
β = 1 − .775 = .225

סיכוי של כ־77% לגלות את ההבדל, וכ־23% לפספס אותו.

הסיפור המלא: כשהכיוון נכון, העוצמה אף פעם לא קטנה מ־α

הנה שאלה שמופיעה הרבה במבחנים. אנשים ישנים בממוצע 7 שעות. מרצה משער שסטודנטים למתמטיקה ישנים פחות, ובודק בהשערה חד־צדדית שמאלית, α = .05. נניח שבאמת הם ישנים 6 שעות. גודל המדגם לא ידוע. מה אפשר לומר על העוצמה?

התשובה: בוודאות היא גדולה מ־5%, ויותר מזה אי אפשר לדעת. למה? דמיינו שהעקומה של ההשערה החלופיתResearch hypothesis יושבת בדיוק על העקומה של השערת האפס, כלומר הסטודנטים ישנים בדיוק 7 שעות. אז החלק שלה שנופל באזור הדחייהRejection region הוא בדיוק α, 5%. עכשיו הזיזו אותה שמאלה, לכיוון אזור הדחייה: החלק שלה שנופל שם רק גדל. לכן העוצמה גדולה מ־α. ומה החסם העליון? אין. אם המדגם ענק, טעות התקן זעירה, העקומות כמעט לא חופפות, והעוצמה יכולה להגיע ל־99.9%.

ושימו לב למקרה ההפוך: אם המרצה שיער "פחות", אבל באמת הסטודנטים ישנים יותר, 8 שעות, העקומה זזה הרחק מאזור הדחייה, והעוצמה קטנה אפילו מ־α. זה המחיר של השערה חד־צדדית בכיוון הלא נכון. ובהשערה דו־צדדית? אם μ1 = μ0, הסיכוי לדחות הוא שוב בדיוק α (חצי בכל זנב), וכל הזזה, לאיזה צד שהוא, רק מגדילה אותו. כלומר גם שם העוצמה גדולה מ־α.

בדקו את עצמכם3 שאלות

1.במבחן מסוים β = .35. מהי העוצמה?

2.בציור של שתי העקומות, איזה שטח הוא העוצמה?

3.מבחן אוצר מילים: μ0 = 40, σ = 8. בודקים 16 תלמידים בהשערה חד־צדדית ימנית, α = .05. מה העוצמה אם הממוצע האמיתי 44?

מה משפיע על העוצמה?

חמישה גורמים: גודל ההשפעה, סטיית התקן באוכלוסייה, גודל המדגם, α, והאם ההשערה חד־צדדית. הכלל: כל מה שמרחיק את שתי העקומות זו מזו, או מצר אותן, מגדיל את העוצמה. בפועל, החוקר שולט בעיקר בגודל המדגם.

לפני שמסתכלים בטבלה, נסו לחשוב לבד, בעזרת הציור של שתי העקומות: מה אפשר לשנות כדי שחלק גדול יותר מהעקומה של H1 יעבור את הקו?

הגורםהעוצמהלמה, בציורבדוגמת הקריאה (בסיס: .80)
השפעה גדולה יותר (μ1 רחוק יותר מ־μ0)גדלההעקומות רחוקות יותר זו מזוממוצע אמיתי 57: .97
ממוצע אמיתי 53: .44
סטיית תקן קטנה יותר באוכלוסייהגדלהטעות התקן קטנה, והעקומות צרותσ = 8: .93
σ = 15: .51
מדגם גדול יותרגדלהטעות התקן קטנה, והעקומות צרותn = 36: .91
n = 16: .64
α גדולה יותר (.05 במקום .01)גדלההקו הקריטי זז לכיוון μ1α = .01: .57
השערה חד־צדדית (בכיוון הנכון) במקום דו־צדדיתגדלהכל α בצד אחד, והקו קרוב יותרדו־צדדית: .71

חמישה גורמים, אבל לא כולם באמת בידיים של החוקר:

יש עוד דרך אחת, שנראה בפרק 21: למדוד את אותם אנשים פעמיים, לפני ואחרי. כל נבדק משמש ביקורת לעצמו, ההבדלים הקבועים בין האנשים יוצאים מהחישוב, והפיזור שנשאר קטן בהרבה. לכן במערך כזה צריך פחות נבדקים.

זהירות: "ניקח רק את החרדים ביותר"

רעיון שעולה הרבה: כדי שתוכנית נגד חרדה תראה השפעה גדולה, נבחר רק את התלמידים החרדים ביותר. הבעיה: גם בלי שום תוכנית, מי שקיבל ציון קיצוני במדידה אחת יקבל בממוצע ציון פחות קיצוני במדידה הבאה. זו רגרסיה לממוצעRegression to the mean. החרדה "תרד" גם אם התוכנית לא עשתה כלום, ובלי קבוצת ביקורת אי אפשר להפריד בין השניים.

מעבדה: עוצמת המבחן, מה משפיע עליה? משנים את ההשפעה, את σ, את גודל המדגם, את α ואת סוג ההשערה.פתיחה בחלון נפרד
משימות למעבדה
  1. התחילו מהערכים ההתחלתיים: הבדל של 4, σ = 16, n = 36, חד־צדדית, α = .05. מהי העוצמה?
  2. הגדילו את המדגם עד שהעוצמה מגיעה ל־0.80. כמה נבדקים צריך?
  3. חזרו ל־36 נבדקים. עברו ל־α = .01, ואז גם לדו־צדדית. מה קרה לעוצמה, ולמה?
בדיקת התשובה

1. בערך 0.44. טעות התקן היא 16 / 6 = 2.67, ההבדל הוא 1.5 טעויות תקן, ו־1.5 − 1.645 שלילי: הממוצע האמיתי עוד לא עבר את הקו. 2. בערך 99 נבדקים. נחשב את זה בנוסחה בסעיף הבא. 3. העוצמה יורדת ל־0.20 בערך עם α = .01, ול־0.14 בערך כשגם עוברים לדו־צדדית. בשני המקרים הקו הקריטי מתרחק מ־μ1: הערך הקריטי עולה ל־2.33, ואחר כך ל־2.58.

מעבדה: שתי הטעויות והעוצמה, עם הנתונים שלנו

כאן הציר הוא ביחידות של סטיית תקן, וההשפעה נמדדת ב־, ההבדל ביחידות של סטיית תקן. נכיר אותו בסעיף 7. בינתיים מספיק לדעת ש־0.26 הוא הבדל של רבע סטיית תקן, בערך. המצב הראשון לקוח מסעיף 7: שביעות הרצון של התלמידים שלנו מול נורמה ארצית.

מעבדה: טעויות, עוצמה וגודל אפקט. בוחרים מצב, ומשנים את גודל האפקט, את גודל המדגם ואת α.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו "שביעות רצון מול הנורמה" ואחר כך "אותו אפקט, 20 תלמידים". מה קרה לעוצמה?
  2. בחרו "בעיות קשב: הבדל של 0.10". מהי העוצמה? מה זה אומר על שאלת הפתיחה?
  3. בחרו "אין אפקט". כמה תוצאות מובהקות נקבל, ואיך קוראים להן?
בדיקת התשובה

1. העוצמה צונחת מ־0.96 בערך ל־0.21 בערך. אותו אפקט בדיוק, אבל עם 20 תלמידים המחקר יפספס אותו ברוב המקרים. 2. בערך 0.51: רק כחצי מהמחקרים כמו שלנו יגלו הבדל כזה. לכן "לא נמצא הבדל מובהק" בבעיות הקשב לא מוכיח שאין הבדל קטן. נחזור לזה בסעיף 6. 3. בערך 5% מהמחקרים ייתנו תוצאה מובהקת, כגודל α. כולן טעויות מסוג ראשוןType I error, כי באמת אין אפקט.

בדקו את עצמכם3 שאלות

1.בדוגמת הקריאה מהפרק (μ0 = 50, σ = 10, ממוצע אמיתי 55, חד־צדדית, α = .05), מגדילים את המדגם מ־25 ל־64. מה העוצמה?

2.חוקר מחליט לבדוק רק בנים בכיתה ה׳ מעיר אחת, כדי להקטין את הפיזורMeasure of dispersion ולהגדיל את העוצמה. מה המחיר?

3.סטודנטית מציעה: "אם רוצים עוצמה גבוהה, פשוט נעבוד עם α = .10 במקום .05". מה התשובה?

כמה נבדקים צריך? גודל מדגם מינימלי

לפני המחקר קובעים α, עוצמה רצויה (בדרך כלל .80) וגודל השפעה שרוצים לגלות. אז n = ((zα + zβ) · σ / (μ1 − μ0))². תמיד מעגלים כלפי מעלה.

עד עכשיו חישבנו את העוצמה של מחקר שכבר תוכנן. אבל הכי שימושי לשאול את השאלה הפוכה, לפני שמתחילים: כמה נבדקים צריך כדי שהעוצמה תהיה מספיקה? המוסכמה בתכנון מחקר היא עוצמה של .80 לפחות.

צריך להחליט מראש על שלושה דברים: רמת המובהקותSignificance level α, העוצמה הרצויה, וגודל ההשפעה שרוצים להיות מסוגלים לגלות. מה שנשאר, גודל המדגם, מחושב מהם:

n = (zα + zβ)² · σ²(μ1 − μ0)²
מה זההערכים הנפוציםבאקסלב־SPSS (Compute Variable)ב־JASP
zα: הערך הקריטי1.645 בחד־צדדית, 1.96 בדו־צדדית (α = .05)=NORM.S.INV(0.975)IDF.NORMAL(0.975, 0, 1)מודול Distributions, כמו בפרק 18
zβ: ציון התקן של העוצמה הרצויה0.842 לעוצמה .80, 1.282 לעוצמה .90=NORM.S.INV(0.8)IDF.NORMAL(0.8, 0, 1)מודול Distributions, כמו בפרק 18

מה זה zβ? כדי שהעוצמה תהיה 80%, 80% מהעקומה של H1 צריכים להיות מעבר לממוצע הקריטי. כלומר, הממוצע הקריטי צריך לעמוד מתחת ל־μ1, במרחק שמשאיר 80% מהשטח מעליו: 0.842 טעויות תקן. לכן, בבדיקה דו־צדדית, המרחק הכולל בין μ0 ל־μ1 צריך להיות 1.96 + 0.842 = 2.802 טעויות תקן, ומזה יוצאת הנוסחה.

דוגמה פתורה: כמה תלמידים צריך כדי לגלות הבדל בבעיות קשב?

נניח שלשאלון בעיות הקשב יש נורמות ארציות: בכיתות ד׳ ו־ה׳, ממוצע 2.40 וסטיית תקן 0.70. (אלה מספרים לדוגמה, לא נורמות אמיתיות.) חוקרת רוצה להיות מסוגלת לגלות הבדל של 0.10 נקודה מהנורמה, בבדיקה דו־צדדית, α = .05, ובעוצמה של .80.

zα = 1.96,   zβ = 0.842 1. הערכים הקריטיים
n = ((1.96 + 0.842) · 0.70 / 0.10)² 2. מציבים
= (2.802 · 7)² = 19.614² = 384.71 3. מחשבים
n = 385 4. מעגלים כלפי מעלה, תמיד

מסקנה: כדי לגלות הבדל של 0.10 בעוצמה של 80%, צריך 385 תלמידים. במחקר שלנו יש 200. נחזור לזה בסעיף 6.

ולמה תמיד כלפי מעלה? כי עם 384 תלמידים העוצמה כבר קצת פחות מ־.80. גם אילו יצא 384.1, היינו מעגלים ל־385.

שימו לב מה קורה כשמשנים את ההבדל שרוצים לגלות. ההבדל נמצא במכנה, בריבוע:

ההבדל שרוצים לגלות0.200.100.05
גודל מדגם מינימלי973851539

הבדל קטן פי 2 דורש מדגם גדול פי 4. השפעות קטנות דורשות מדגמים גדולים מאוד. ומהצד השני, כדי להקטין את טעות התקן פי 2, צריך להגדיל את המדגם פי 4, כי היא תלויה ב־√n.

ואם לא יודעים את σ?

הרבה פעמים לא יודעים מראש את סטיית התקן, ולא את ההבדל בנקודות של השאלון. אז מגדירים את ההשפעה ביחידות של סטיית תקן, (נכיר אותו בסעיף 7), ו־σ יוצאת מהנוסחה:

n = (zα + zβ)²d²

לבדיקה דו־צדדית, α = .05 ועוצמה .80, המונה הוא 2.802² = 7.85. לכן אפקט של חצי סטיית תקן דורש 7.85 / 0.25 = 31.4, כלומר 32 נבדקים. אפקט של 0.2 סטיית תקן דורש 197. ואפקט של 0.8, רק 13.

עצרו ונסו

במבחן מיומנויות כתיבה סטיית התקן באוכלוסייה היא 8. רוצים לגלות הבדל של 2 נקודות, בבדיקה דו־צדדית ברמה .05, בעוצמה של .90. מהו zβ? כמה תלמידים צריך? ומה אם מסתפקים בעוצמה של .80?

בדיקת התשובה
zβ = NORM.S.INV(0.9) = 1.282
n = ((1.96 + 1.282) · 8 / 2)² = (3.242 · 4)² = 12.968² = 168.17 → 169
n = ((1.96 + 0.842) · 4)² = 11.208² = 125.62 → 126 בעוצמה .80

העלייה מ־80% ל־90% עוצמה עולה כאן 43 תלמידים.

הסיפור המלא: מאיפה הנוסחה, ומה עשו במחקר שלנו

הנוסחה יוצאת מהציור של שתי העקומות. כדי שהעוצמה תהיה בדיוק 1 − β, הממוצע הקריטי צריך לעמוד במקום שמקיים שני תנאים בבת אחת: הוא zα טעויות תקן מעל μ0, וגם zβ טעויות תקן מתחת ל־μ1. כלומר המרחק בין שני הממוצעים הוא (zα + zβ) · SE. מציבים SE = σ / √n, ומחלצים את n.

בפרק 7 קראנו שהחוקרות של המחקר שלנו חישבו מראש, בתוכנה G*Power, שהן צריכות לפחות 153 תלמידים. החישוב שלהן התאים למערך המלא של המחקר, עם שלוש קבוצות ושלוש מדידות, ולכן הנוסחה שלנו לא נותנת בדיוק את המספר הזה. אבל ההיגיון זהה: α, עוצמה רצויה, גודל אפקט צפוי, ומהם גודל המדגם. G*Power היא תוכנה חינמית שעושה את החישובים האלה לכמעט כל מבחן (Faul et al., 2007). היא משתמשת בהתפלגות tt distribution ולא בהתפלגות הנורמלית, ולכן נותנת מעט יותר נבדקים מהנוסחה שלנו. כך גם התוכנות הסטטיסטיות, כפי שנראה בקטע "בתוכנה".

ומאיפה יודעים מה גודל האפקט הצפוי? משלושה מקורות: מחקרים קודמים על תוכניות דומות, מחקר חלוץ קטן, או השאלה "מהו ההבדל הקטן ביותר שהיה חשוב לנו לגלות?". ועוד עצה מעשית: בבתי ספר תמיד יש תלמידים שעוזבים או לא ממלאים את השאלון השני. לכן מוסיפים למספר המחושב כמה אחוזים, לפי הנשירהAttrition הצפויה.

בדקו את עצמכם4 שאלות

1.בחישוב גודל מדגם מינימלי יצא 52.1. כמה נבדקים צריך?

2.אפקט צפוי של d = 0.4, בדיקה דו־צדדית, α = .05, עוצמה .80. כמה נבדקים צריך?

3.בשאלון חרדת מבחנים סטיית התקן באוכלוסייה היא 15. רוצים לגלות הבדל של 5 נקודות, בבדיקה דו־צדדית, α = .05, ובעוצמה של .80. כמה תלמידים צריך?

4.בתכנון מחקר החליטו שרוצים לגלות הבדל קטן פי 3 מזה שתכננו קודם, בלי לשנות שום דבר אחר. מה יקרה לגודל המדגם המינימלי?

רווח סמך לממוצע

רווח סמך הוא טווח של ערכים סבירים לממוצע האוכלוסייה: M ± z · σ / √n. ברמת ביטחוןConfidence level של 95%, z = 1.96. החלק אחרי ה־±, טעות האמידהMargin of error, הוא חצי רוחב הרווח. מדגם גדול: רווח צר. רמת ביטחון גבוהה: רווח רחב.

סקר בחירות מדווח שמפלגה קטנה תקבל 2% מהקולות. מה הסיכוי שבבחירות עצמן היא תקבל בדיוק 2%? כמעט אפסי. אם היא תקבל 2.1%, לא נגיד שהסקר טעה. נגיד שהוא היה קרוב. לכן סוקר זהיר לא אומר "2%", אלא נותן טווח: "בין 1% ל־3%".

את ממוצע המדגם, , הכרנו בפרק 17 כאומדן נקודתיPoint estimate: המספר הטוב ביותר שיש לנו למה שלא ידוע, μ. אבל כמעט בוודאות הוא לא שווה ל־μ בדיוק. רווח סמך מוסיף לאומדןEstimate הנקודתי טווח סביבו, שמבטא כמה אנחנו לא בטוחים.

ועכשיו שאלה: כמה רחב צריך להיות הטווח? אפשר לומר "המפלגה תקבל בין 0% ל־100%", ולהיות צודקים בוודאות. אבל הטווח הזה לא אומר כלום. ככל שרוצים להיות בטוחים יותר, צריך טווח רחב יותר, ומאבדים דיוק. לכן בוחרים מראש רמת ביטחוןConfidence level, ולרוב 95%.

:   ± z · σ√     z = 1.96

למה דווקא 1.96? כי בפרק 14 ראינו ש־95% מהשטח מתחת לעקומה הנורמלית נמצאים עד 1.96 סטיות תקן מהמרכז. ממוצעי המדגמים מתפלגים נורמלית סביב μ, עם סטיית תקן SE. לכן ב־95% מהמדגמים, הממוצע רחוק מ־μ לכל היותר 1.96 טעויות תקן. ואם M רחוק מ־μ פחות מ־1.96 טעויות תקן, אז גם μ רחוק מ־M פחות מזה. זה בדיוק הרווח.

החלק אחרי ה־±, כלומר z · SE, נקרא טעות האמידהMargin of error. הוא חצי רוחב הרווח. כשבחדשות אומרים "טעות הדגימהSampling error בסקר היא 4.4%", מתכוונים אליו. באקסל מחשבים אותו בפונקציה CONFIDENCE.NORM.

רמת ביטחון90%95%99%
z1.6451.962.576
דוגמה מהמחקר: בעיות הקשב של 200 התלמידים

הממוצע של בעיות הקשב לפני התוכנית (attn_pre) הוא M = 2.4805. נשתמש בסטיית התקן של הנורמות, σ = 0.70, כאילו היא ידועה. (סטיית התקן במדגם שלנו, 0.71, קרובה מאוד.) נבנה רווח סמך של 95% לממוצע בעיות הקשב באוכלוסייה שממנה באו התלמידים.

SE = 0.70 / √200 = 0.70 / 14.142 = 0.0495 טעות התקן
1.96 · 0.0495 = 0.0970 טעות האמידה
2.4805 − 0.0970 = 2.3835,   2.4805 + 0.0970 = 2.5775
95% CI [2.38, 2.58]

פירוש: ממוצע בעיות הקשב באוכלוסייה כנראה בין 2.38 ל־2.58. איך בדיוק לקרוא את המילה "כנראה" נראה בסעיף הבא.

בדיווח בסגנון APA כותבים 95% CI [2.38, 2.58]: גבול תחתון ועליון בסוגריים מרובעים.

מה קובע את רוחב הרווח?

השינויהרווחבדוגמת הקשב
מדגם גדול יותרצר יותרולהפך: רק 75 התלמידים של התוכנית המשולבת נותנים טעות אמידה של 0.158 במקום 0.097
רמת ביטחון גבוהה יותררחב יותר90%: [2.40, 2.56] · 95%: [2.38, 2.58] · 99%: [2.35, 2.61]
סטיית תקן גדולה יותר באוכלוסייהרחב יותרעם σ = 1.40, פי שניים: טעות אמידה 0.194, פי שניים

רמת ביטחון גבוהה יותר "קונה" ביטחון במחיר של דיוק. מדגם גדול יותר משפר את שניהם יחד, אבל לאט: כדי לחצות את הרוחב צריך פי 4 תלמידים.

עצרו ונסו

במדגם של 64 תלמידים, הממוצע במבחן אוצר מילים הוא 31.5. סטיית התקן באוכלוסייה ידועה: 6. בנו רווח סמך של 95% ושל 99%.

בדיקת התשובה
SE = 6 / √64 = 6 / 8 = 0.75
95%: 31.5 ± 1.96 · 0.75 = 31.5 ± 1.47 → [30.03, 32.97]
99%: 31.5 ± 2.576 · 0.75 = 31.5 ± 1.93 → [29.57, 33.43]

הרווח של 99% רחב יותר. שני הרווחים מרוכזים סביב אותו מרכז: ממוצע המדגם.

הסיפור המלא: כמה נבדקים צריך כדי לאמוד בדיוק מסוים?

גם רווח סמך אפשר לתכנן מראש. אם רוצים שטעות האמידה תהיה לכל היותר E, פותרים את E = z · σ / √n, ומקבלים n = (z · σ / E)². למשל, כדי לאמוד את ממוצע בעיות הקשב בטעות אמידה של 0.05 לכל היותר, ברמת ביטחון של 95%: (1.96 · 0.70 / 0.05)² = 27.44² = 752.95, כלומר 753 תלמידים. כך מתכננים סקרים: קודם מחליטים כמה דיוק צריך, ומזה נגזר גודל המדגם.

ועוד הערה: כאן הנחנו ש־σ ידועה. כמעט אף פעם היא לא ידועה, ואז משתמשים בסטיית התקן של המדגם, , ובמקום z בערך קריטיCritical value מהתפלגות t, שגדול מעט יותר. זה רווח סמך עם tt confidence interval, בפרק 20. במדגם של 200 ההבדל זניח: הרווח עם t לבעיות הקשב הוא [2.38, 2.58], כמו שלנו.

מעבדה: התפלגות הדגימה ורווחי סמךSampling distribution

המעבדה דוגמת שוב ושוב מאותה אוכלוסייה, ובונה רווח סמך מכל מדגם. כמו שעושים במציאות, היא משתמשת בסטיית התקן של כל מדגם, ולכן גם רוחב הרווחים משתנה קצת ממדגם למדגם (פרק 20). שתי אוכלוסיות: הקשיבות לפני התוכנית, שמתפלגת נורמלית בקירובApproximate normality, ומספר האחים, שמוטה ימינה.

מעבדה: התפלגות הדגימה, טעות התקן ורווח סמך. בוחרים אוכלוסייה וגודל מדגם, ודוגמים.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו בקשיבות, ולחצו כמה פעמים "עוד 100 מדגמים" עם n = 25. השוו את "טעות התקן" לסטיית התקן של הממוצעים שהתקבלו. ואז העבירו את n ל־100 ודגמו שוב. מה קרה לרוחב ההיסטוגרמהHistogram ולרוחב הרווחים?
  2. כמה אחוזים מהרווחים מכילים את ממוצע האוכלוסייה? האם זה משתנה כשמשנים את n?
  3. בחרו במספר האחים, עם n = 5 ואחר כך n = 50. מה קורה לצורת התפלגות הממוצעים?
בדיקת התשובה

1. שני המספרים קרובים: טעות התקן היא בדיוק סטיית התקן של התפלגות הממוצעים. עם n = 100 טעות התקן קטנה פי 2 (מ־0.11 ל־0.055), וגם ההיסטוגרמה והרווחים צרים פי 2. 2. בערך 95%, בכל גודל מדגם. גודל המדגם משנה את הרוחב, לא את אחוז הכיסוי. 3. עם 5 התפלגות הממוצעים עדיין מוטה מעט ימינה. עם 50 היא כמעט נורמלית: משפט הגבול המרכזיCentral limit theorem מפרק 17.

בדקו את עצמכם3 שאלות

1.במדגם של 36 תלמידים, הממוצע במבחן שטף קריאה הוא 12.4, וסטיית התקן באוכלוסייה ידועה: 3. מהו רווח הסמך של 95%?

2.מה מהבאים לא משפיע על רוחב רווח הסמך?

3.למה לא בונים פשוט רווח סמך של 100%, ואז בטוחים לגמרי?

מה בדיוק אומר "95% ביטחון"?

μ קבוע, והרווח הוא שמשתנה ממדגם למדגם. "95% ביטחון" פירושו: אם נחזור על המחקר הרבה פעמים, 95% מהרווחים שנבנה יכילו את μ. הרווח הוא על ממוצע האוכלוסייה, לא על הנבדקים.

זו נקודה שמתבלבלים בה הרבה, ולכן נלך לאט.

ממוצע האוכלוסייה, μ, הוא מספר קבוע. אנחנו לא יודעים אותו, אבל הוא לא זז. מה שמשתנה ממדגם למדגם הוא ממוצע המדגם, ואיתו הרווח כולו. דמיינו שחוזרים על המחקר 20 פעמים, כל פעם עם 200 תלמידים אחרים מאותה אוכלוסייה, ובונים כל פעם רווח של 95%. בציור, ממוצע האוכלוסייה הוא 2.40:

מפספס2.202.302.402.502.60μ = 2.40 (הקו האנכי). כל קו אופקי: רווח סמך של 95% ממדגם אחר של 200 תלמידים
סימולציה: 20 מדגמים של 200 תלמידים מאוכלוסייה עם μ = 2.40 ו־σ = 0.70. לכל הרווחים אותו רוחב, כי σ ידועה. 19 מכילים את μ, ואחד מפספס.

רוב הרווחים חוצים את הקו של μ. אחד לא: הממוצע של המדגם שלו יצא רחוק מ־μ, במקרה. על פני הרבה מאוד חזרות, 95% מהרווחים יכילו את μ ו־5% יפספסו. זה הפירוש של "95% ביטחון": הוא אומר משהו על השיטה, על כל הרווחים שהיא מייצרת.

וכמה רווחים יש לחוקר אחד? רק אחד. הוא לא יודע אם הרווח שלו הוא אחד מה־95% הטובים, או אחד מה־5% שמפספסים. מה שהוא יודע הוא שהשתמש בשיטה שצודקת ב־95% מהמקרים.

הניסוחנכון?
אם נחזור על המחקר הרבה פעמים, 95% מהרווחים שנבנה כך יכילו את ממוצע האוכלוסייה.כן. זה הפירוש המדויק.
הטווח 2.38 עד 2.58 הוא טווח סביר לממוצע האוכלוסייה. ממוצעים מחוצה לו לא מתיישבים עם הנתונים.כן. זה הפירוש המעשי, וכך כותבים במאמר.
95% מהתלמידים קיבלו ציון בין 2.38 ל־2.58.לא. הרווח הוא על הממוצע, לא על התלמידים. הציונים של התלמידים מתפזרים מ־1 עד 4.36.
ב־95% מהמדגמים, ממוצע המדגם ייפול בין 2.38 ל־2.58.לא. הרווח מרוכז סביב ממוצע המדגם שלנו. מדגם אחר ייתן רווח אחר.
יש סיכוי של 95% ש־μ נמצא בין 2.38 ל־2.58.בזהירות. ראו "הסיפור המלא".
מעבדה: רווח סמך, 100 מדגמים, 100 רווחים. כל קו הוא רווח ממדגם אחר. אדום: רווח שמפספס את μ.פתיחה בחלון נפרד
משימות למעבדה
  1. ספרו כמה רווחים אדומים יש. לחצו כמה פעמים "דגמו 100 מדגמים חדשים". האם המספר תמיד 5?
  2. עברו ל־99% ואחר כך ל־90%. מה קרה לרוחב הרווחים, ולמספר האדומים?
  3. הגדילו את n ל־100. האם יש פחות רווחים אדומים?
בדיקת התשובה

1. לא. בערך 5, אבל לפעמים 2, לפעמים 8. "95%" מתקיים על פני הרבה מאוד חזרות. 2. ב־99% הרווחים רחבים יותר, ומפספסים רק בערך 1 מכל 100. ב־90% הם צרים יותר, ומפספסים בערך 10. 3. לא. הרווחים צרים יותר, אבל עדיין בערך 5 מפספסים. גודל המדגם קובע את הדיוק, ורמת הביטחון קובעת את אחוז הפספוס.

הסיפור המלא: למה "יש סיכוי של 95% ש־μ ברווח" בעייתי?

רווח הסמך הומצא על ידי יז׳י ניימן ב־1937, בתוך הגישה הקלאסית לסטטיסטיקה, שבה הסתברות מתארת מה קורה בחזרות רבות (Neyman, 1937). בגישה הזו, μ הוא מספר קבוע. אחרי שחישבנו רווח מסוים, μ או בתוכו או לא. אין כאן עוד הגרלה, ולכן גם אין "סיכוי של 95%". ההסתברות שייכת לשיטה, לפני שדגמנו: לפני המדגם, הסיכוי שהרווח שנקבל יכיל את μ הוא 95%.

יש גישה אחרת, הגישה הבייסיאנית, שבה מותר לומר "יש סיכוי של 95% שהפרמטר בטווח הזה". שם בונים רווח אמינות (credible interval), בחישוב שונה, שמשלב גם את מה שידענו לפני המחקר. במקרים פשוטים, ועם מדגם גדול, שני הרווחים יוצאים כמעט זהים. לכן הניסוח המעשי, "טווח סביר לממוצע האוכלוסייה", מקובל. ההבדל חשוב בעיקר כשרוצים לדייק, למשל במבחן בקורס.

בדקו את עצמכם3 שאלות

1.ב־40 מחקרים בלתי תלויים, כל אחד בנה רווח סמך של 95% לממוצע של אותה אוכלוסייה. כמה רווחים צפויים, בממוצע, לא להכיל את μ?

2.חוקר חוזר על אותו מחקר שוב ושוב, עם תלמידים אחרים. מה משתנה בין החזרות?

3.סטודנט כתב: "יש סיכוי של 95% שממוצע בעיות הקשב באוכלוסייה נמצא בין 2.38 ל־2.58". מה בעייתי בניסוח, ואיך הייתם מנסחים במקומו?

רווח סמך ובדיקת השערות

רווח סמך של 95% ומבחן דו־צדדי ברמה .05 מגיעים תמיד לאותה מסקנה: אם μ0 מחוץ לרווח, דוחים. אם הוא בתוכו, לא דוחים. היתרון של הרווח: הוא אומר גם מה הטווח הסביר לגודל ההבדל.

רווח סמך ובדיקת השערות הם שני צדדים של אותו חשבון, כמו תמונת ראי. בבדיקת השערות מתחילים מ־μ0, ושואלים אם ממוצע המדגם רחוק ממנו יותר מ־1.96 טעויות תקן. ברווח סמך מתחילים מממוצע המדגם, ושואלים אילו ערכים של μ רחוקים ממנו פחות מ־1.96 טעויות תקן. זה אותו מרחק, מסתכלים עליו משני הקצוות. לכן:

וזה עובד גם ברמות אחרות: רווח של 99% מתאים למבחן דו־צדדי ברמה .01.

דוגמה מהמחקר: חזרה לשאלת הפתיחה

הנורמה בבעיות קשב היא 2.40. רווח הסמך שבנינו הוא [2.38, 2.58]. 2.40 בתוך הרווח, ולכן לא דוחים את השערת האפס. נבדוק במבחן zz test, כמו בפרק 18:

z = (2.4805 − 2.40) / 0.0495 = 1.63
p = 2 · (1 − NORM.S.DIST(1.63, TRUE)) = .104 דו־צדדי

אותה מסקנה: לא נמצא הבדל מובהק. אבל עכשיו אפשר לענות על שאלת הפתיחה. האם זה אומר שהתלמידים שלנו לא שונים מהנורמה?

מסקנה: "לא נמצא הבדל מובהק" כאן לא אומר "אין הבדל". הוא אומר שלא היה מספיק מידע כדי לגלות הבדל קטן. לא דחינו, אבל גם לא הוכחנו. ולכן כותבים "לא נמצא הבדל מובהק", ולא "הממוצע שווה לנורמה".

אז למה צריך גם רווח סמך?

כי הם עונים על שאלות שונות. בדיקת השערות עונה על השאלה "האם יש הבדל?". רווח סמך עונה על השאלה "כמה?". חברת תרופות שואלת קודם אם החיסון שלה עובד. אבל רופא רוצה לדעת גם בכמה הוא משפר את מערכת החיסון: "בערך 4%, ובטווח הסביר בין 2% ל־6%" אומר הרבה יותר מ־"p < .05".

והרווח מראה גם כמה המחקר מדויק. תוכנית הרזיה שהשפעתה "בין ירידה של 50 קילו לעלייה של 30 קילו" לא מובהקת, כי האפס בתוך הרווח. אבל הרוחב של הרווח אומר משהו נוסף וחשוב: המחקר כמעט לא לימד אותנו כלום. לכן כתבי עת רבים, וגם מדריך APA, דורשים לדווח רווח סמך לצד ערך pp-value, וחוקרים רבים מעדיפים היום להציג קודם כול אומדנים ורווחי סמך (Cumming, 2014).

עצרו ונסו

רווח סמך של 95% לממוצע ציוני מבחן הוא [68.4, 75.6]. א. מהו ממוצע המדגם? ב. במבחן דו־צדדי ברמה .05, האם דוחים את ההשערה שממוצע האוכלוסייה 75? ומה לגבי 67? ג. מהי טעות התקן?

בדיקת התשובה
M = (68.4 + 75.6) / 2 = 72 א. הממוצע הוא האמצע של הרווח
75 בתוך הרווח → לא דוחים.   67 מחוץ לרווח → דוחים ב
טעות האמידה = 75.6 − 72 = 3.6,   SE = 3.6 / 1.96 = 1.84 ג
הסיפור המלא: ומה עם השערה חד־צדדית?

רווח סמך רגיל הוא דו־צדדי: 2.5% "בורחים" מכל צד. לכן הוא מתאים בדיוק למבחן דו־צדדי. מבחן חד־צדדי ברמה .05 שם את כל ה־5% בצד אחד, ולכן הוא מתאים לרווח של 90%: ברמה הזו, הגבול של כל צד הוא 1.645 טעויות תקן מהממוצע. בדוגמת הקשב, הרווח של 90% הוא [2.399, 2.562]. הגבול התחתון, 2.399, קטן מעט מ־2.40, ולכן הנורמה בתוך הרווח, במרחק זעיר. ואכן, גם במבחן חד־צדדי ימני z = 1.63 קטן מ־1.645, והמבחן לא מובהק, בקושי. אבל זכרו: בחירה בחד־צדדי אחרי שרואים את הנתונים אסורה.

בדקו את עצמכם3 שאלות

1.רווח סמך של 95% לממוצע הוא [4.1, 5.3]. בודקים את ההשערה שממוצע האוכלוסייה 5.0. מה המסקנה?

2.במבחן z דו־צדדי יצא z = 2.3. האם רווח סמך של 99% יכיל את μ0?

3.מחקר קטן על תוכנית קריאה מדווח שהשיפור בציון הוא בממוצע 2.9 נקודות, 95% CI [−0.4, 6.2]. מה אפשר להסיק?

גודל אפקט: כמה גדול ההבדל?

ערך pp-value תלוי בגודל המדגם: במדגם ענק, גם הבדל זעיר מובהק. גודל אפקט אומר כמה גדול ההבדל, ללא תלות בגודל המדגם. הנפוץ: = ההבדל ביחידות של סטיית תקן. בערך: 0.2 קטן, 0.5 בינוני, 0.8 גדול. מובהק אינו בהכרח חשוב.

נניח שבסקר ארצי גדול, שביעות הרצון מהחיים של תלמידי כיתות ד׳ ו־ה׳ היא בממוצע 4.80, עם סטיית תקן 1.00 (שוב, מספרים לדוגמה). אצל 200 התלמידים שלנו, לפני התוכנית, M = 5.064. האם התלמידים שלנו מרוצים יותר?

SE = 1.00 / √200 = 0.0707
z = (5.064 − 4.80) / 0.0707 = 3.73,   p < .001
95% CI: 5.064 ± 1.96 · 0.0707 → [4.93, 5.20]

מובהק מאוד. אבל האם ההבדל גדול? 0.26 נקודה על סולם של 1 עד 7. ומה היה קורה אילו בדקנו מספר אחר של תלמידים, ובכל פעם יצא בדיוק אותו ממוצע?

מספר התלמידים20501002001000
z1.181.872.643.738.35
p.238.062.008< .001< .001
d0.260.260.260.260.26

אותו הבדל בדיוק. עם 20 תלמידים הוא לא מובהק, ועם 1000 הוא "מובהק מאוד". ערך p השתנה, כי הוא תלוי בטעות התקן, שקטנה כשהמדגם גדל. ועם מדגם ענק, של מיליון תלמידים, גם הבדל של מאית נקודה היה יוצא מובהק. לכן ערך p לבדו לא אומר כמה ההבדל חשוב.

מה שלא השתנה בטבלה הוא גודל האפקט, בשורה האחרונה. גודל אפקט הוא מדד לגודל של ההבדל או הקשר, שלא תלוי בגודל המדגם. הנפוץ ביותר להבדלים הוא של כהן: ההבדל, ביחידות של סטיית תקן.

= − 0σ     בדוגמה: d = (5.064 − 4.80) / 1.00 = 0.26

שימו לב להבדל בין z ל־d: אותו מונה, מכנה אחר. ב־z מחלקים בטעות התקן, σ / √n, שקטנה כשהמדגם גדל. ב־d מחלקים בסטיית התקן עצמה, שלא תלויה בגודל המדגם. ומכאן קשר פשוט: z = d · √n. בדוגמה: 0.264 · 14.14 = 3.73.

כהן (Cohen, 1988) הציע סימני דרך לפירוש:

d0.20.50.8
פירושקטןבינוניגדול

אצלנו d = 0.26: מובהק, אבל קטן. ובדיווח כותבים את שניהם: ערך p עונה על השאלה "האם סביר שזה מקרי?", וגודל האפקט על השאלה "כמה גדול?".

גודל אפקט הוא גם בדיוק מה שצריך לתכנון מחקר: בסעיף 3 ראינו ש־n = ((zα + zβ) / d)². ויש גדלי אפקט נוספים: את מקדם המתאםCorrelation כבר הכרנו בפרק 15, והוא בעצמו גודל אפקט. את d של כהןCohen's d לשני מדגמים נחשב בפרק 21, ומדדים נוספים יגיעו עם ניתוח השונות והרגרסיה.

עצרו ונסו

חוקר בדק 2500 תלמידים במבחן מתמטיקה ארצי (μ0 = 500, σ = 100), ומצא ממוצע 505. חשבו z, ערך p דו־צדדי ו־d. מה הייתם אומרים לעיתונאי שכותב "התלמידים האלה טובים משמעותית מהממוצע הארצי"?

בדיקת התשובה
SE = 100 / √2500 = 100 / 50 = 2
z = (505 − 500) / 2 = 2.5,   p = 2 · (1 − NORM.S.DIST(2.5, TRUE)) = .012
d = 5 / 100 = 0.05

ההבדל מובהק סטטיסטית, אבל זעיר: חמש מאיות של סטיית תקן, הרבה מתחת ל"קטן" של כהן. "משמעותית" בעיתון נשמע כמו "הרבה". כאן הוא אומר רק שההבדל כנראה לא מקרי, בזכות המדגם הענק.

הסיפור המלא: קטן, אבל חשוב?

כהן עצמו הזהיר שהמספרים 0.2, 0.5 ו־0.8 הם ברירת מחדל, למי שאין לו שום מידע אחר. מה נחשב גדול תלוי בתחום. בחינוך, תוכנית זולה שמשפרת הישגים ב־0.2 סטיות תקן אצל מאות אלפי תלמידים יכולה להיות הצלחה גדולה. ובמחקר על תרופה, אפקט "בינוני" שמחיר תופעות הלוואי שלו גבוה יכול להיות לא כדאי. לכן הדרך הטובה ביותר לפרש גודל אפקט היא להשוות אותו לגדלי אפקט במחקרים דומים, ולשאול מה ההבדל אומר בעולם האמיתי: כמה נקודות, כמה תלמידים, כמה כסף.

ועוד דבר: גם גודל האפקט הוא אומדן, ולכן גם לו יש רווח סמך. אצלנו הרווח לממוצע, [4.93, 5.20], אומר שההבדל מהנורמה הוא בין 0.13 ל־0.40 נקודה, כלומר d בין 0.13 ל־0.40, כי σ = 1. ההבדל כנראה לא אפס, אבל גם כנראה לא גדול.

בדקו את עצמכם3 שאלות

1.במבחן קריאה ארצי μ = 100, σ = 15. בבית ספר מסוים הממוצע 103. מהו d, ואיך מתארים אותו?

2.שני מחקרים מצאו d = 0.3. באחד 30 נבדקים, ובשני 300. מה נכון?

3.מאמר מדווח: "400 תלמידים, z = 4.0, p < .001", אבל לא מדווח גודל אפקט. חשבו את d מהמספרים האלה, ופרשו.

בתוכנה: רווח סמך, עוצמה וגודל מדגם

נחזור לבעיות הקשב (attn_pre) ולנורמה: μ0 = 2.40, σ = 0.70. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות. באקסל נעשה בדיוק את החישובים של הפרק, עם z ועם σ ידועה. שימו לב: SPSS לא בונה רווח סמך עם σ ידועה. הוא משתמש בסטיית התקן של המדגם ובהתפלגות tt distribution, שנלמד בפרק 20. במדגם של 200 ההבדל זניח. שימו לב: JASP לא בונה רווח סמך עם σ ידועה. הוא משתמש בסטיית התקן של המדגם ובהתפלגות t, שנלמד בפרק 20. במדגם של 200 ההבדל זניח.

attn_pre היא עמודה AJ, בשורות 2 עד 201. בעמודה BE כותבים תוויות, ובעמודה BF את הנוסחאות:

רווח סמך, מבחן z, עוצמה וגודל מדגם

BEBF: הנוסחההתוצאה
2Mean=AVERAGE(AJ2:AJ201)2.4805
3Margin of error=CONFIDENCE.NORM(0.05,0.7,200)0.0970
4Lower=BF2-BF32.3834
5Upper=BF2+BF32.5775
6z=(BF2-2.4)/(0.7/SQRT(200))1.6255
7p (two-tailed)=2*(1-NORM.S.DIST(ABS(BF6),TRUE))0.1041
8Power (diff 0.1)=NORM.S.DIST(0.1/(0.7/SQRT(200))-NORM.S.INV(0.975),TRUE)0.5241
9n for power .8=ROUNDUP(((NORM.S.INV(0.975)+NORM.S.INV(0.8))*0.7/0.1)^2,0)385
CONFIDENCE.NORM
טעות האמידה: z · σ / √n. שלושה ארגומנטים, בסדר הזה: α (0.05 לרווח של 95%, 0.01 ל־99%), סטיית התקן באוכלוסייה, וגודל המדגם. הפונקציה לא מקבלת את הנתונים עצמם, ולא את הממוצע.
Lower, Upper
גבולות הרווח: הממוצע פחות טעות האמידה, והממוצע ועוד טעות האמידה. [2.38, 2.58].
NORM.S.INV
הופכת שטח לציון תקןz-score (פרק 14). NORM.S.INV(0.975) נותן 1.96, הערך הקריטי הדו־צדדי. NORM.S.INV(0.8) נותן 0.842, הוא zβ.
ROUNDUP
מעגלת כלפי מעלה. הארגומנט השני, 0, אומר לעגל למספר שלם. אל תשתמשו ב־ROUND: 384.4 היה מתעגל ל־384, והעוצמה הייתה נמוכה מהרצוי.

אפשר להחליף את 0.7, 0.1 ו־0.8 בהפניות לתאים, ואז הגיליון הופך למחשבון: משנים את ההבדל או את העוצמה הרצויה, ורואים מיד את התוצאה. ולמי שרוצה רווח עם סטיית התקן של המדגם: CONFIDENCE.T, בפרק 20.

רווח סמך: SPSS מחשב רווח סמך לממוצע ב־Explore, שהכרנו בפרק 12.

  1. Analyze > Descriptive Statistics > Explore. מעבירים את attn_pre ל־Dependent List.
  2. בכפתור Statistics מסומן Descriptives, ולידו Confidence Interval for Mean: 95%. לרווח של 99%, משנים ל־99.

Descriptives

StatisticStd. Error
Attention problems, preMean2.48.051
95% Confidence Interval for Mean, Lower Bound2.38
95% Confidence Interval for Mean, Upper Bound2.58
5% Trimmed Mean2.48
Median2.55
Variance.511
Std. Deviation.715
Minimum1.00
Maximum4.36
Range3.36
Interquartile Range.91
Skewness.045.172
Kurtosis-.120.342
Mean, Std. Error
הממוצע, וטעות התקן שלו. SPSS מחשב את טעות התקן מסטיית התקן של המדגם: .715 / √200 = .051. אצלנו, עם σ של הנורמות, יצא .0495.
95% Confidence Interval for Mean
הגבול התחתון והעליון: [2.38, 2.58]. בדיוק כמו בחישוב שלנו, בשתי ספרות. בספרה השלישית יש הבדל קטן (2.381 ו־2.580 מול 2.383 ו־2.577), כי SPSS משתמש ב־SD של המדגם ובערך קריטי של tCritical t value, 1.972, במקום 1.96.

עוצמה וגודל מדגם: מגרסה 27, ל־SPSS יש תפריט לניתוחי עוצמה.

  1. Analyze > Power Analysis > Means > One-Sample T Test
  2. Estimate: Sample size. Single power value: 0.8.
  3. Population mean: 2.50 (הנורמה ועוד ההבדל שרוצים לגלות). Null value: 2.40. Population standard deviation: 0.70.
  4. Test Direction: Nondirectional (two-sided) analysis. Significance level: 0.05.

Power Analysis Table

NActual PowerbTest Assumptions: PowerStd. Dev.Sig.
Test for Meana387.800.8.7.05
a. Two-sided test.   b. Based on noncentral t-distribution.
N
גודל המדגם המינימלי: 387. הנוסחה שלנו נתנה 385. ההבדל הקטן הוא כי SPSS מחשב עם התפלגות t ולא עם הנורמלית, ומניח שגם את סטיית התקן נאמוד מהמדגם.
Actual Power
העוצמה שמתקבלת בפועל עם 387 נבדקים. היא מעט מעל העוצמה המבוקשת, כי גודל המדגם הוא מספר שלם.
שינוי השאלה
כדי לקבל את העוצמה של המחקר שלנו, בוחרים Estimate: Power, ומקלידים 200 בגודל המדגם. SPSS נותן .520, לעומת .524 בנוסחה שלנו.

שמות השדות והעמודות בחלון Power Analysis עשויים להשתנות מעט בין גרסאות.

רווח סמך: ב־JASP הדרך הפשוטה היא דרך חלון של מבחן t למדגם בודדOne-sample t test (פרק 20). כאן נשתמש בו רק בשביל הרווח.

  1. T-Tests > One Sample T-Test. מעבירים את attn_pre ל־Variables.
  2. Test value: 2.40, הנורמה.
  3. מסמנים Student, ותחת Additional Statistics: Location estimate (הפרש הממוצעים) ו־Confidence interval: 95%.

One Sample T-Test

tdfpMean Difference95% CI Lower95% CI Upper
attn_pre1.59199.1130.08-0.020.18
Note. For the Student t-test, the alternative hypothesis specifies that the population mean is different from 2.4.
Mean Difference
ממוצע המדגם פחות ערך הבדיקהTest value: 2.48 − 2.40 = 0.08.
95% CI
רווח סמך להפרש מהנורמה: [−0.02, 0.18]. כדי לקבל רווח לממוצע עצמו, מוסיפים 2.40 לשני הגבולות: [2.38, 2.58]. ושימו לב: האפס בתוך הרווח של ההפרש, בדיוק כמו ש־2.40 בתוך הרווח של הממוצע. ולכן גם המבחן לא מובהק.
t, p
גרסת t של מבחן z שעשינו. p = .113, קרוב ל־.104 שלנו. ההבדל הוא שוב t מול z, ו־SD של המדגם מול σ.

עוצמה וגודל מדגם: ל־JASP יש מודול Power. מפעילים אותו בכפתור ה־+ שבסרגל המודולים.

  1. Power. ב־Test בוחרים One Sample T-Test.
  2. Calculate: N. Minimal effect size of interest: 0.143 (ההבדל, 0.10, חלקי σ, 0.70: זה d). Minimum desired power: 0.8. α: 0.05. Alternative Hypothesis: Two-sided.

A Priori Power Analysis

NEffect sizePowerα
3860.1430.8000.050
N
386 תלמידים. הנוסחה שלנו נתנה 385. JASP מחשב עם התפלגות t, ולכן קצת יותר. (עם d המדויק, 0.142857…, יוצא 387.)
Effect size
JASP עובד ב־d, לא בנקודות של השאלון. לכן מחלקים את ההבדל בסטיית התקן לפני שמקלידים.
Calculate
אפשר לבחור גם Power, ולהקליד N = 200. מתקבלת עוצמה של כ־.52. המודול מצייר גם גרף של העוצמה לפי גודל המדגם, שימושי מאוד בתכנון.

שמות האפשרויות במודול Power ובחלון המבחן עשויים להשתנות מעט בין גרסאות.

בדקו את עצמכם4 שאלות

1.מה תחזיר הנוסחה =CONFIDENCE.NORM(0.01,0.7,200)?

1.ב־SPSS, ב־Explore, בכפתור Statistics, מה כותבים בשדה Confidence Interval for Mean כדי לקבל רווח סמך של 99%?

1.ב־JASP, בחלון One Sample T-Test, תחת Confidence interval, מה כותבים כדי לקבל רווח סמך של 99%?

2.למה רווח הסמך שמחשבות התוכנות הסטטיסטיות מהנתונים שונה מעט מהרווח שחישבנו ביד לבעיות הקשב?

3.באקסל, גודל המדגם הוא =ROUNDUP(((NORM.S.INV(0.975)+NORM.S.INV(0.8))*σ/Δ)^2,0). רוצים לגלות הבדל של 0.15 נקודה בחרדה, כשסטיית התקן באוכלוסייה 0.50. מה מציבים במקום σ/Δ?

3.ב־SPSS, ב־Analyze > Power Analysis > Means > One-Sample T Test, רוצים לחשב כמה תלמידים צריך כדי לגלות הבדל של 0.15 נקודה בחרדה מהנורמה, 2.30, כשסטיית התקן באוכלוסייה 0.50. Null value הוא 2.30. מה מקלידים ב־Population mean?

3.ב־JASP, במודול Power, רוצים לחשב כמה תלמידים צריך כדי לגלות הבדל של 0.15 נקודה בחרדה מהנורמה, כשסטיית התקן באוכלוסייה 0.50. איזה מספר מקלידים ב־Minimal effect size of interest?

4.חשבו את הגבול התחתון של רווח סמך של 99% לממוצע התלונות הגופניות (soma_pre), בהנחה ש־σ = 0.50. ממוצע המדגם 1.846, ו־n = 200.

טעויות נפוצות

בדקו את עצמכם

סיכום

עוצמה = NORM.S.DIST( (μ1 − μ0) / SE − zקריטי , TRUE ),   β = 1 − עוצמה
n = ((zα + zβ) · σ / (μ1 − μ0))² = ((zα + zβ) / d)²
M ± z · σ / √n,   z = 1.645 / 1.96 / 2.576 לרמות 90% / 95% / 99%
d = (M − μ0) / σ,   z = d · √n

מונחים חדשים

עוצמת המבחןממוצע קריטיz_βגודל מדגם מינימלירווח סמךרמת ביטחוןטעות האמידהCONFIDENCE.NORMגודל אפקט

שאלות לדוגמה, עם פתרונות

  1. רווח סמך של 95% לממוצע ציוני מבחן מתמטיקה, ב־64 תלמידים, הוא [71.2, 76.8]. הרווח חושב עם סטיית תקן ידועה של האוכלוסייה. א. מהו ממוצע המדגם, ומהי טעות האמידה? ב. מהי סטיית התקן באוכלוסייה? ג. במבחן דו־צדדי ברמה .05, האם דוחים את ההשערה שממוצע האוכלוסייה 70? ומה לגבי 72? ד. האם רווח של 99% יכיל את 70?

    בדיקת התשובה
    M = (71.2 + 76.8) / 2 = 74,   טעות האמידה = 76.8 − 74 = 2.8 א
    SE = 2.8 / 1.96 = 1.4286,   σ = SE · √64 = 1.4286 · 8 = 11.43 ב. טעות האמידה היא 1.96 טעויות תקן
    70 מחוץ לרווח → דוחים.   72 בתוך הרווח → לא דוחים ג
    2.576 · 1.4286 = 3.68 → [70.32, 77.68] ד. רווח של 99%

    ד. לא: גם הרווח הרחב יותר, של 99%, לא מגיע ל־70. כלומר גם ברמה .01 היינו דוחים את ההשערה שהממוצע 70. אפשר לראות את זה גם בלי לבנות את הרווח: 70 רחוק מ־74 ב־4 / 1.4286 = 2.8 טעויות תקן, יותר מ־2.576.

  2. במבחן קריאה ארצי μ0 = 60 ו־σ = 12. מורה רוצה לבדוק אם תוכנית תגבור מעלה את הציונים, עם 49 תלמידים, בהשערה חד־צדדית ימנית, α = .05. היא מקווה שהתוכנית מעלה את הממוצע ל־64. א. מהו הממוצע הקריטי? ב. מהי העוצמה? ג. כמה תלמידים היא צריכה לעוצמה של .90?

    בדיקת התשובה
    SE = 12 / √49 = 12 / 7 = 1.714
    60 + 1.645 · 1.714 = 62.82 א. הממוצע הקריטי
    (64 − 60) / 1.714 = 2.333,   2.333 − 1.645 = 0.688 ב. המרחק בטעויות תקן, פחות הערך הקריטי
    NORM.S.DIST(0.688, TRUE) = .75
    n = ((1.645 + 1.282) · 12 / 4)² = (2.927 · 3)² = 8.781² = 77.11 → 78 ג

    עם 49 תלמידים יש סיכוי של 75% לגלות שיפור של 4 נקודות, ו־25% לפספס. כדי להגיע ל־90% צריך 78 תלמידים.

  3. חוקרת רוצה לאמוד את ממוצע החרדה של תלמידי כיתות ד׳ ו־ה׳ בעיר. מתוך הנורמות היא מניחה שסטיית התקן 0.50. א. כמה תלמידים היא צריכה כדי שטעות האמידה, ברמת ביטחון של 95%, תהיה לכל היותר 0.05? ב. ואם היא רוצה רמת ביטחון של 99%? ג. בלי לחשב: כמה תלמידים היו נדרשים לטעות אמידה של 0.10, ברמה של 95%?

    בדיקת התשובה
    n = (1.96 · 0.50 / 0.05)² = 19.6² = 384.16 → 385 א
    n = (2.576 · 0.50 / 0.05)² = 25.76² = 663.58 → 664 ב
    385 / 4 ≈ 97 ג. טעות אמידה גדולה פי 2: מדגם קטן פי 4

    ג. בדיוק: (1.96 · 5)² = 96.04, כלומר 97. רמת ביטחון גבוהה יותר, או דיוק רב יותר, עולים בהרבה תלמידים.

  4. הנורמה הארצית בתלונות גופניות היא μ = 1.75, σ = 0.50 (מספרים לדוגמה). סטודנט חישב באקסל את הפלט הבא, ל־soma_pre של 200 התלמידים. א. מהו רווח הסמך של 95%? ב. האם התלמידים שלנו שונים מהנורמה, במבחן דו־צדדי ברמה .05? ג. חשבו את d ופרשו. ד. הסטודנט כתב: "95% מהתלמידים מדווחים על תלונות גופניות בין 1.78 ל־1.92". מה הבעיה?

    soma_pre

    הנוסחההתוצאה
    Mean=AVERAGE(AK2:AK201)1.8460
    Margin=CONFIDENCE.NORM(0.05,0.5,200)0.0693
    z=(1.846-1.75)/(0.5/SQRT(200))2.7153
    p=2*(1-NORM.S.DIST(2.7153,TRUE))0.0066
    בדיקת התשובה
    1.8460 ± 0.0693 → [1.78, 1.92] א
    1.75 מחוץ לרווח, z = 2.72, p = .007 → דוחים ב. שתי הדרכים מסכימות
    d = (1.846 − 1.75) / 0.50 = 0.19 ג

    ב. כן: התלמידים שלנו מדווחים על יותר תלונות גופניות מהנורמה, z = 2.72, p = .007. ג. אבל ההבדל קטן, כחמישית סטיית תקן, ממש על סימן הדרך "קטן" של כהן. ההבדל כנראה לא מקרי, אבל לא בהכרח חשוב. ד. רווח הסמך הוא על ממוצע האוכלוסייה, לא על התלמידים. התלמידים עצמם מתפזרים מ־1 עד 3.4, הרבה מעבר לרווח.

  5. מורה בדקה 30 תלמידים במבחן שבו μ0 = 50 ו־σ = 10, וקיבלה M = 52.4. היא כותבת בדוח: "הבדיקה הראתה שהתלמידים שלנו לא שונים מהממוצע הארצי". א. בדקו בעצמכם, במבחן דו־צדדי ברמה .05, ובנו רווח סמך של 95%. ב. מה העוצמה של המבחן שלה, אם התלמידים באמת גבוהים ב־3 נקודות? ג. מה הייתם כותבים במקומה? ד. כמה תלמידים היו נדרשים לעוצמה של .80 להבדל כזה?

    בדיקת התשובה
    SE = 10 / √30 = 1.826
    z = (52.4 − 50) / 1.826 = 1.31,   p = .189 → לא דוחים א
    52.4 ± 1.96 · 1.826 → [48.82, 55.98]
    3 / 1.826 − 1.96 = −0.317,   NORM.S.DIST(−0.317, TRUE) = .38 ב
    n = ((1.96 + 0.842) · 10 / 3)² = 9.34² = 87.24 → 88 ד

    ג. הניסוח "לא שונים" שגוי. נכון לכתוב: "לא נמצא הבדל מובהק בין התלמידים לממוצע הארצי, z = 1.31, p = .189, 95% CI [48.82, 55.98]". הרווח מראה שהממוצע האמיתי יכול להיות גם כמעט 6 נקודות מעל הנורמה. והעוצמה, 38%, אומרת שגם אילו התלמידים היו באמת גבוהים ב־3 נקודות, ברוב המקרים מבחן כזה לא היה מגלה את זה. המדגם פשוט קטן מדי.

תרגול עם הנתונים

קובץ המחקר: 200 תלמידים, 55 משתנים. בשאלות האלה נשתמש בנורמות לדוגמה, שבהן סטיית התקן באוכלוסייה ידועה. בכל שאלה הנורמה כתובה בשאלה עצמה.

הקבצים עצמם, care_school.csv ומילון המשתנים, נמצאים גם בתיקיית data בחבילת הספר.

  1. בנו רווח סמך של 95% ושל 99% לממוצע שביעות הרצון מהחיים לפני התוכנית (sat_pre), עם σ = 1.00.
    בדיקת התשובה

    M = 5.064. 95%: 5.064 ± 0.139 → [4.93, 5.20]. 99%: 5.064 ± 0.182 → [4.88, 5.25]. באקסל: =CONFIDENCE.NORM(0.05,1,200) ו־=CONFIDENCE.NORM(0.01,1,200).

  2. הנורמה בחרדה היא μ = 2.30, σ = 0.50. בעזרת רווח סמך של 95%, האם החרדה של התלמידים שלנו לפני התוכנית (anx_pre) שונה מהנורמה? חשבו גם d.
    בדיקת התשובה

    M = 2.2356, טעות האמידה 0.069, ורווח הסמך [2.17, 2.30]. הגבול העליון הוא 2.3049, כלומר 2.30 בתוך הרווח, ממש בקצה: לא דוחים. במבחן z: z = −1.82, p = .069. d = −0.13: גם אילו ההבדל היה מובהק, הוא היה קטן מאוד. שימו לב: כשמעגלים לשתי ספרות, נדמה שהנורמה יושבת בדיוק על הגבול. מחליטים לפי הערכים המדויקים, או לפי ערך p.

  3. חזרו לבעיות הקשב, עם σ = 0.70, אבל רק לתלמידי התוכנית המשולבת (group = 2). בנו רווח סמך של 95%, והשוו את הרוחב שלו לרוחב הרווח של כל 200 התלמידים.
    בדיקת התשובה

    75 תלמידים, M = 2.5067. טעות האמידה 1.96 · 0.70 / √75 = 0.158, ורווח הסמך [2.35, 2.67]. רוחב 0.32, לעומת 0.19 בכל המדגם. היחס הוא √(200 / 75) = 1.63: פחות תלמידים, פחות דיוק.

  4. חוקר רוצה לחזור על המחקר בבתי ספר אחרים, ולגלות הבדל של 0.15 נקודה בחרדה מהנורמה (σ = 0.50), בבדיקה דו־צדדית, α = .05. מה העוצמה עם 200 תלמידים? וכמה תלמידים צריך לעוצמה של .90?
    בדיקת התשובה

    SE = 0.50 / √200 = 0.0354. העוצמה: NORM.S.DIST(0.15 / 0.0354 − 1.96, TRUE) = NORM.S.DIST(2.28, TRUE) = .99. לעוצמה של .90: ((1.96 + 1.282) · 0.50 / 0.15)² = 116.8, כלומר 117 תלמידים. 200 תלמידים יותר ממספיקים.

בפרק הבא: מה עושים כשסטיית התקן באוכלוסייה לא ידועה, וזה המצב כמעט בכל מחקר. נכיר את התפלגות t ואת דרגות החופשDegrees of freedom, נבנה מבחן t למדגם בודד, ונבנה רווח סמך עם tt confidence interval.

מקורות: Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Erlbaum. · Cumming, G. (2014). The new statistics: Why and how. Psychological Science, 25(1), 7–29. https://doi.org/10.1177/0956797613504966 · Faul, F., Erdfelder, E., Lang, A.-G., & Buchner, A. (2007). G*Power 3: A flexible statistical power analysis program for the social, behavioral, and biomedical sciences. Behavior Research Methods, 39(2), 175–191. https://doi.org/10.3758/BF03193146 · Neyman, J. (1937). Outline of a theory of statistical estimation based on the classical theory of probability. Philosophical Transactions of the Royal Society of London. Series A, 236(767), 333–380. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y