חלק ג: מהמדגם לאוכלוסייה · פרק 18
ההיגיון של בדיקת השערות: מבחן z
בפרק הקודם ראינו שממוצע של מדגם כמעט אף פעם לא יוצא בדיוק כמו ממוצע האוכלוסייה. בפרק הזה נשאל את השאלה ההפוכה: כשממוצע של מדגם יוצא שונה ממה שציפינו, איך יודעים אם זה מקרה, או שיש כאן משהו אמיתי? התשובה היא ההיגיון של בדיקת השערות. נלמד אותו על המבחן הפשוט ביותר, מבחן zz test, אבל אותו היגיון בדיוק יחזור בכל מבחן בהמשך הספר.
"הילדים שלי חרדים במיוחד השנה," אומרת המחנכת של כיתה ה׳ בבית הספר הראשון. האם היא צודקת?
בשאלון החרדה, הממוצע של 22 התלמידים בכיתה שלה הוא 2.55. בנורמה הארצית של השאלון הממוצע הוא 2.30. ההבדל קיים, אבל גם כיתה רגילה לגמרי לא תקבל בדיוק 2.30. אז האם הכיתה הזו באמת חרדה יותר, או שזה הבדל שיכול לקרות במקרה? בסוף הפרק תדעו לענות בחמישה שלבים קבועים, ותדעו גם מה התשובה לא אומרת.
בסוף הפרק תוכלו
- להסביר את ההיגיון של בדיקת השערות: מניחים שהשערת האפסNull hypothesis נכונה, ושואלים אם הנתונים סבירים בעולם כזה.
- לחשב ביד את סטטיסטי המבחןTest statistic z, ולהחליט בשתי דרכים: לפי ערך קריטיCritical value ולפי ערך .
- להבחין בין מבחן חד־צדדיOne-tailed hypothesis / test לדו־צדדי, ולדעת מתי מותר להשתמש בכל אחד.
- להסביר מהן טעות מסוג ראשוןType I error וטעות מסוג שניType II error, ומה הקשר ביניהן.
- לעבור את חמשת השלבים של כל מבחן, ולפרש נכון ערך pp-value: מה הוא אומר, ומה לא.
שתי השערות על האוכלוסייה
כל מבחן מתחיל בשתי השערות על האוכלוסייה. השערת האפס () אומרת שאין הבדל: הממוצע באוכלוסייה שווה לערך מסוים, μ0. השערת המחקר () אומרת שיש הבדל. את שתיהן ניסחנו כבר בפרק 4. החדש בפרק הזה: איך הנתונים מכריעים ביניהן.
בפרק 4 פגשנו את שתי ההשערות. השערת האפס היא "השערת סבתא": שום דבר לא השתנה, הכול נשאר כמו שהיה. השערת המחקר, שנקראת גם ההשערה החלופיתResearch hypothesis, אומרת שיש הבדל, או קשר, או השפעה. ראינו גם שתי עובדות שחשובות מאוד בפרק הזה: ההשערות הן תמיד על האוכלוסייה, ובודקים דווקא את השערת האפס.
בשאלת הפתיחה, על מה בדיוק ההשערות? לא על 22 הילדים עצמם: את הממוצע שלהם אנחנו פשוט רואים, 2.55. ההשערות הן על האוכלוסייה שהילדים האלה מייצגים. דמיינו שהיינו יכולים למדוד אינסוף ילדים "כמו" ילדי הכיתה הזו. מה היה הממוצע שלהם? את הממוצע הזה, שאיננו יודעים, מסמנים . ואת הערך שהשערת האפס מציעה, 2.30, מסמנים μ0 (מיו־אפס).
השערת האפס אומרת: הכיתה הזו היא כמו כל הילדים בגילה, וההבדל שראינו הוא מקרי. השערת המחקר אומרת: הילדים בכיתה הזו שונים מהנורמה. המחנכת אמרה "חרדים יותר", כלומר השערה עם כיוון. ובכל זאת כתבנו ≠, השערה דו־צדדיתTwo-tailed hypothesis / test, כי זו ברירת המחדל של הספר (פרק 4). בסעיף 5 נראה בדיוק מה ההבדל, במספרים.
ומה הבעיה? בפרק 17 ראינו שטעות דגימהSampling error קיימת תמיד: גם אם השערת האפס נכונה לגמרי, כיתה של 22 ילדים לא תקבל בדיוק 2.30. היא תקבל קצת יותר או קצת פחות. לכן השאלה היא לא "האם 2.55 שונה מ־2.30?" (ברור שכן), אלא: האם 2.55 רחוק מספיק מ־2.30, כדי שיהיה קשה להסביר אותו במקרה?
בפרק 13 ראינו שלמבחנים מוכרים יש נורמות: ממוצע וסטיית תקן שנמדדו על אלפי נבדקים. לשאלון החרדה שבספר אין נורמה כזו, ולכן נניח שיש: בסקר ארצי גדול של תלמידי כיתות ד׳ ו־ה׳, הממוצע הוא μ = 2.30 וסטיית התקן היא σ = 0.50. שני המספרים מומצאים, לצורך הפרק. את כל השאר נחשב מהקובץ של המחקר.
למה הנורמה חשובה כל כך? כי מבחן z מתאים רק כשסטיית התקן באוכלוסייה, σ, ידועה מראש. זה קורה בעיקר כשיש נורמה. בדרך כלל אין, ואז משתמשים בסטיית התקן של המדגם, , כאומדןEstimate. השינוי הקטן הזה מוביל למבחן t, שנלמד בפרק 20. ההיגיון נשאר אותו היגיון.
בית משפט פועל לפי חזקת החפות: הנאשם חף מפשע, עד שהראיות נגדו חזקות מספיק. השערת האפס היא החפות. החוקר הוא התובע, והנתונים הם הראיות. אם הראיות חזקות, מרשיעים: דוחים את השערת האפס. ואם לא, מזכים. אבל זיכוי "מחוסר ראיות" לא אומר שהנאשם חף מפשע. הוא אומר רק שלא הוכח שהוא אשם. בדיוק כך, כשלא דוחים את השערת האפס, לא הוכחנו שהיא נכונה.
ולמה בכלל בודקים את השערת האפס ולא את השערת המחקר? סיבה מעשית: השערת האפס היא מספר אחד, μ = 2.30. כשיש מספר אחד, אפשר לבנות בדיוק איך ייראו ממוצעי מדגמים בעולם כזה. השערת המחקר, μ ≠ 2.30, היא אינסוף ערכים: 2.31, 2.40, 3.00. אי אפשר לבנות ממנה התפלגות אחת. וסיבה פילוסופית: אף פעם לא נוכל להוכיח שתוכנית עובדת או שכיתה שונה. אנחנו יכולים רק להפריך: לומר שהשערת האפס כנראה לא נכונה, ברמת ביטחוןConfidence level מסוימת.
לכל שאלה, כתבו את H0 ואת H1 בסמלים. א. בנורמה של מבחן בשטף קריאה הממוצע 100. האם תוכנית קריאה מעלה את הציון? ב. בנורמה של שאלון שביעות רצון הממוצע 5.0. האם תלמידי בית ספר דמוקרטי שונים מהנורמה? ג. ממוצע זמן התגובה במשימת קשב הוא 500 אלפיות שנייה. האם שנת צהריים מקצרת אותו?
בדיקת התשובה
בכל השלוש ההשערות הן על μ, הממוצע באוכלוסייה, ולא על ממוצע המדגם. ובחד־צדדית, השערת האפס כוללת גם את הכיוון ההפוך (פרק 4).
בדקו את עצמכם3 שאלות
1.שאלת מחקרResearch question: "האם תלמידי כיתה ו׳ בעיר ישנים פחות מ־9 שעות בלילה?" איזו השערת אפס מתאימה?
2.למה אפשר להריץ מבחן z על כיתה ה׳ רק כשיש נורמה לשאלון?
3.ממוצע החרדה בכיתה מסוימת הוא 2.40, והנורמה 2.30. חבר אומר: "ברור שהכיתה חרדה יותר, 2.40 גדול מ־2.30." מה חסר בטיעון?
ההיגיון: עולם שבו השערת האפס נכונה
מניחים שהשערת האפס נכונה. בעולם כזה, ממוצעים של מדגמים בגודל מתפלגים נורמלית סביב μ0, עם טעות תקן σ / √n (פרק 17). שואלים: כמה טעויות תקן ממוצע המדגם רחוק מ־μ0? זה סטטיסטי המבחן, z = (M − μ0) / SE. ככל ש־z רחוק יותר מאפס, הממוצע שלנו נדיר יותר בעולם של השערת האפס.
הנה ההיגיון כולו, וכדאי להפנים אותו, כי הוא יחזור בכל מבחן בספר. נעשה ניסויExperiment מחשבתי. נניח שהשערת האפס נכונה: הילדים בכיתה ה׳ הם כמו כל הילדים בגילם, והממוצע שלהם באוכלוסייה הוא 2.30. עכשיו דמיינו שאנחנו דוגמים מהאוכלוסייה הזו כיתה אחרי כיתה, כל פעם 22 ילדים, ורושמים את הממוצע של כל כיתה. איך ייראו הממוצעים האלה?
את התשובה כבר יודעים מפרק 17. הם יתפלגו בערך נורמלית (משפט הגבול המרכזיCentral limit theorem), סביב 2.30, ועם פיזורMeasure of dispersion קטן בהרבה מהפיזור של ילדים בודדים. הפיזור הזה הוא טעות התקן:
כלומר, בעולם של השערת האפס, ממוצע של כיתה טיפוסית רחוק מ־2.30 בערך עשירית נקודה. עכשיו שמים את הכיתה שלנו על התמונה: היא רחוקה 0.25 נקודה מ־2.30. הרבה או מעט? כדי לדעת, מודדים את המרחק ביחידות של טעות תקן.
תחשבו על מדרכה. אם כל מרצפת ברוחב 30 סנטימטר, ואני עומד 15 סנטימטר מהקיר, אני חצי מרצפה מהקיר. לקחתי את המרחק, וחילקתי אותו בגודל היחידה. כאן היחידה היא טעות התקן: המרחק שלנו, חלקי גודל "המרצפת". והתוצאה היא ציון תקןz-score, בדיוק כמו בפרק 13, רק של ממוצע ולא של תלמיד:
הממוצע של הכיתה נמצא 2.36 טעויות תקן מעל מה שהשערת האפס צופה. האם זה הרבה? מפרק 14 אנחנו יודעים שבהתפלגות נורמליתNormal distribution, רק כ־2.3% מהערכים נמצאים יותר משתי סטיות תקן מעל הממוצע. כלומר, אם השערת האפס נכונה, כיתה כמו שלנו היא אירוע די נדיר.
ומכאן ההיגיון כולו, במשפט אחד: אם השערת האפס נכונה, תוצאה כמו שלנו נדירה מאוד. ולכן, כנראה, השערת האפס לא נכונה. זה דומה להוכחה בדרך השלילה במתמטיקה: מניחים משהו, ומראים שההנחה מובילה לתוצאה בלתי סבירה. ההבדל: במתמטיקה מגיעים לסתירה מוחלטת, וכאן רק לתוצאה "לא סבירה". לכן המסקנה תמיד בהסתברות, ואף פעם לא בוודאות.
וזה העיקרון של כל המבחנים הסטטיסטיים, לא רק של z. לוקחים סטטיסטי: ממוצע, הפרש ממוצעים, מתאםCorrelation, יחס שונויותVariance ratio. משווים אותו להתפלגות הדגימהSampling distribution שלו בעולם של השערת האפס. ושואלים כמה הוא קיצוני. משתנים רק הסטטיסטי וההתפלגות. מי שמבין את הפרק הזה, מבין את ההיגיון של כל מבחן בספר.
תלמיד אחד עם ציון חרדה 2.55 נמצא רק חצי סטיית תקן מעל הנורמה: (2.55 − 2.30) / 0.50 = 0.50. אין בזה שום דבר מיוחד. אבל כיתה של 22 ילדים עם ממוצע 2.55 נמצאת 2.36 טעויות תקן מעל. אותו מספר, 2.55, רגיל לגמרי לתלמיד, ונדיר לכיתה. למה? כי ממוצעים מתנדנדים הרבה פחות מתלמידים בודדים: כדי שכיתה שלמה תגיע ל־2.55, הרבה ילדים צריכים להיות חרדים יחסית באותו זמן. לכן לתלמיד מחלקים ב־σ, ולממוצע ב־SE.
ועוד הערה, למי שחושב כמו חוקר. מבחן z מניח שהילדים בכיתה הם כמו מדגם מקרי מאוכלוסייה אחת. כיתה היא לא מדגם מקרי: יש לילדים אותה מחנכת, אותה שכבה ואותה שכונה, והם משפיעים זה על זה. לכן "דחינו את השערת האפס" אומר כאן רק שהכיתה הזו שונה מהנורמה, ולא למה. ואת הבעיה שתלמידים באותה כיתה דומים זה לזה נפגוש שוב בפרק 36, במודלים מעורביםLinear mixed model.
בכיתה ה׳ בבית הספר השני (התוכנית העקיפה) יש גם 22 ילדים, וממוצע החרדה שלהם לפני התוכנית הוא 1.9773. חשבו את z מול הנורמה (μ0 = 2.30, σ = 0.50). מה הסימן אומר?
בדיקת התשובה
הסימן השלילי אומר שהכיתה מתחת לנורמה: פחות חרדה. והמרחק, יותר משלוש טעויות תקן, גדול אפילו מזה של הכיתה בבית הספר הראשון. שימו לב: זה לפני שהתוכנית התחילה. ההבדלים בין הכיתות קיימים עוד לפני כל התערבות.
בדקו את עצמכם3 שאלות
1.בנורמה μ0 = 2.30, σ = 0.50. בכיתה של 25 ילדים הממוצע 2.42. מהו z?
2.חוקר מגדיל את המדגם פי 4, מ־25 ל־100 ילדים. מה קורה לטעות התקן?
3.בנורמה של שאלון החרדה (μ = 2.30, σ = 0.50): לתלמידה אחת ציון 2.80, ולכיתה של 16 ילדים ממוצע 2.80. חשבו ציון תקןz-score לכל אחת. למה הם כל כך שונים?
מה נחשב נדיר? רמת מובהקות וערך קריטיSignificance level
את הגבול בין "סביר" ל"נדיר" קובעים מראש: רמת המובהקות, , בדרך כלל .05. היא קובעת את אזור הדחייהRejection region: 5% הממוצעים הקיצוניים ביותר בעולם של השערת האפס. במבחן דו־צדדיTwo-tailed hypothesis / test, 2.5% בכל זנב, והערך הקריטי הוא ±1.96. אם z נופל באזור הדחייה, דוחים את השערת האפס, ואומרים שהתוצאה מובהקת.
"נדיר" זו מילה גמישה מדי. אם נחליט מה נדיר אחרי שראינו את הנתונים, תמיד נוכל למצוא סיבה לדחות או לא לדחות. לכן קובעים כלל מראש, לפני שאוספים נתון אחד: רמת המובהקות, (אלפא). היא אומרת איזה אחוז מהתוצאות, הקיצוניות ביותר בעולם של השערת האפס, ייחשבו "נדירות מדי".
הנפוצה ביותר היא α = .05. כלומר: אם ממוצע כמו שלנו נמצא בין 5% הממוצעים הקיצוניים ביותר שהשערת האפס מייצרת, נדחה אותה. יש מחקרים שקובעים .01 או אפילו .001, למשל כשבודקים הרבה משתנים בבת אחת (נבין למה בסעיף 6).
בהשערה דו־צדדית, תוצאה קיצונית יכולה להיות בכל אחד מהצדדים: כיתה חרדה במיוחד, או רגועה במיוחד. לכן ה־5% מתחלקים בין שני הזנבות: 2.5% למעלה ו־2.5% למטה. השטחים האלה נקראים אזור הדחייהRejection region, וציון התקן שבו מתחיל אזור הדחייה נקרא הערך הקריטי. כבר פגשנו אותו בפרק 14: 2.5% מהשטח נמצאים מעל 1.96.
הערכים הקריטיים שכדאי להכיר, לפי רמת המובהקות ולפי סוג ההשערה (בחד־צדדית כל ה־α נמצא בזנב אחד, ועל זה בסעיף 5):
| רמת המובהקות α | דו־צדדי: α/2 בכל זנב | חד־צדדי: α בזנב אחד |
|---|---|---|
| .10 | ±1.645 | 1.282 |
| .05 | ±1.96 | 1.645 |
| .01 | ±2.576 | 2.326 |
| .001 | ±3.291 | 3.090 |
באקסל מקבלים כל ערך קריטי עם NORM.S.INV מפרק 14, לפי השטח שמשמאלו: בדו־צדדי =NORM.S.INV(1-α/2), למשל =NORM.S.INV(0.975) נותן 1.96. בחד־צדדי =NORM.S.INV(1-α), למשל =NORM.S.INV(0.95) נותן 1.645.
ב־SPSS הפונקציה המקבילה היא IDF.NORMAL(p, 0, 1), בחלון Transform > Compute Variable, בקבוצה Inverse DF. למשל IDF.NORMAL(0.975, 0, 1) נותן 1.96. בפועל, את הערכים הקריטיים של z קל יותר פשוט לזכור, או לקחת מהטבלה.
ב־JASP אפשר לקבל ערך קריטי במודול Distributions (מוסיפים אותו בכפתור ה־+): בוחרים Normal, עם ממוצע 0 וסטיית תקן 1, ומבקשים את הערך שמשמאלו 97.5% מהשטח. בפועל, את הערכים הקריטיים של z קל יותר פשוט לזכור, או לקחת מהטבלה.
ברמת מובהקות של .05, ההבדל בין הכיתה לנורמה מובהק: החרדה בכיתה גבוהה מהנורמה. ברמה של .01 הוא לא מובהק. אותם נתונים, החלטה אחרת. זו בדיוק הסיבה שאת α קובעים לפני שמסתכלים בנתונים.
אפשר לתרגם את הגבולות גם לממוצעים: 2.30 ± 1.96 · 0.1066, כלומר מתחת ל־2.09 או מעל 2.51. כל כיתה של 22 ילדים שהממוצע שלה מחוץ לטווח הזה תוביל לדחיית השערת האפס. רואים את זה בשורה התחתונה של הציר באיור. (לגבולות האלה, ב"שפה" של הממוצעים, נחזור בפרק 19.)
ומילה על המילה "מובהק". בעברית יומיומית "מובהק" פירושו "ברור, בולט". בסטטיסטיקה יש לה משמעות צרה אחת: דחינו את השערת האפס ברמת המובהקות שקבענו. היא לא אומרת שההבדל גדול, ולא שהוא חשוב. בפרק 12 פגשנו את המילה במבחן Shapiro-Wilk, ועכשיו אתם יודעים בדיוק מה היא אומרת.
אין שום דבר מתמטי במספר 5%. רונלד פישר, אחד מאבות הסטטיסטיקה המודרנית, הציע אותו ב־1925 כגבול נוח: פעם אחת בעשרים, וקרוב לשתי סטיות תקן מהממוצע (Fisher, 1925). הגבול הזה נשאר איתנו כמעט מאה שנה, בעיקר מתוך הרגל.
ובעצם, מה שלומדים היום הוא שילוב של שתי גישות שהתווכחו ביניהן בחריפות. פישר ראה בערך p מדד לחוזק הראיות נגד השערת האפס: ככל שהוא קטן יותר, הראיות חזקות יותר. יז׳י ניימן ואגון פירסון בנו גישה של החלטה: קובעים α מראש, דוחים או לא דוחים, ומחשבים את הסיכוי לטעות בכל כיוון (Neyman & Pearson, 1933). את הטעויות האלה נכיר בסעיף 6. חמשת השלבים שבסעיף 7 לקוחים מניימן ופירסון, וההמלצה לדווח את ערך p המדויק לקוחה מפישר.
חוקרת קבעה רמת מובהקות של .02, בהשערה דו־צדדית. א. איזה שטח יש בכל זנב? ב. מהו הערך הקריטי? ג. ציון התקן של המדגם שלה הוא −2.20. האם היא דוחה את השערת האפס?
בדיקת התשובה
ברמת מובהקות של .05, עם ערך קריטי 1.96, היא הייתה דוחה. רמת מובהקות מחמירה יותר מרחיקה את הערך הקריטי מאפס.
בדקו את עצמכם3 שאלות
1.במבחן דו־צדדי ברמת מובהקות .05, איזה חלק מההתפלגות נמצא באזור הדחייה בכל זנב?
2.μ0 = 2.30, SE = 0.10, מבחן דו־צדדי, α = .05. איזה ממוצע מדגם יוביל לדחיית השערת האפס?
3.למה קובעים את רמת המובהקות לפני שמסתכלים בנתונים, ולא אחרי?
ערך p
ערך p הוא ההסתברות לקבל תוצאה כמו שלנו, או קיצונית ממנה, אם השערת האפס נכונה. מחשבים אותו כשטח שמעבר ל־z, ובמבחן דו־צדדי מכפילים בשתיים. הכלל: אם p ≤ α, דוחים את השערת האפס. זו אותה החלטה בדיוק כמו לפי הערך הקריטי, אבל ערך p אומר גם כמה התוצאה נדירה.
יש דרך שנייה להגיע לאותה החלטה. במקום לשאול "האם z בתוך אזור הדחייה?", שואלים: מה בדיוק הסיכוי לקבל ממוצע כמו שלנו, או קיצוני ממנו, בעולם שבו השערת האפס נכונה? הסיכוי הזה נקרא ערך , מלשון probability, הסתברות.
בפרק 13 פגשנו רעיון דומה מאוד: "אחוז הקיצונייםTail proportion", כמה ערכים קיצונייםOutlier כמו ערך מסוים או יותר. ערך p הוא בדיוק זה, רק לא בין תלמידים אלא בין ממוצעים, בעולם של השערת האפס. אפשר לחשוב עליו כמו על אחוזוןPercentile, שנספר מהקצה.
בכיתה ה׳, z = 2.36. השטח שמימין ל־2.36 הוא השלם פחות השטח שמשמאל (פרק 14):
אם השערת האפס נכונה, הסיכוי שכיתה של 22 ילדים תהיה רחוקה מהנורמה כמו הכיתה הזו, או יותר, לאחד הכיוונים, הוא 1.8%. זה סיכוי קטן מ־5%, ולכן דוחים. (בחישוב השתמשנו ב־z המדויק, 2.3559. עם 2.36 המעוגל יוצא כמעט אותו דבר.)
למה מכפילים בשתיים? כי ההשערה דו־צדדית. מראש אמרנו שגם כיתה רגועה במיוחד, עם z = −2.36, הייתה נחשבת עדות נגד השערת האפס. לכן "קיצוני כמו שלנו, או יותר" כולל את שני הזנבות. בציור שבסעיף 3 רואים את שני השטחים הסגולים הכהים, אחד בכל צד.
| סוג ההשערה | ערך p הוא השטח | באקסל | ב־SPSS (Compute Variable) | ב־JASP |
|---|---|---|---|---|
| חד־צדדית ימנית (μ > μ0) | מימין ל־z | =1-NORM.S.DIST(z, TRUE) | 1 - CDF.NORMAL(z, 0, 1) | Alt. Hypothesis: > Test value |
| חד־צדדית שמאלית (μ < μ0) | משמאל ל־z | =NORM.S.DIST(z, TRUE) | CDF.NORMAL(z, 0, 1) | Alt. Hypothesis: < Test value |
| דו־צדדית (μ ≠ μ0) | פעמיים הזנב שמעבר ל־|z| | =2*(1-NORM.S.DIST(ABS(z), TRUE)) | 2 * (1 - CDF.NORMAL(ABS(z), 0, 1)) | Alt. Hypothesis: ≠ Test value |
הפונקציה ABS מחזירה ערך מוחלט: היא הופכת מספר שלילי לחיובי. בלעדיה, הנוסחה הדו־צדדית תיתן תשובה שגויה כש־z שלילי. נסו: =2*(1-NORM.S.DIST(-2.36, TRUE)) מחזיר 1.98, "הסתברות" גדולה מ־1, וזה סימן בטוח לטעות.
ב־SPSS הפונקציה ABS מחזירה ערך מוחלט: היא הופכת מספר שלילי לחיובי. בלעדיה, הנוסחה הדו־צדדית תיתן תשובה שגויה כש־z שלילי. אפשר לבחור אותה בקבוצה Arithmetic בחלון Compute Variable.
ב־JASP לא מחשבים ערך p בנוסחה: התוכנה מדפיסה אותו בטבלת המבחן, לפי ההשערה שבחרתם ב־Alt. Hypothesis. נראה את זה בקטע "בתוכנה".
שתי דרכים, החלטה אחת
הערך הקריטי וערך p מובילים תמיד לאותה החלטה. אם z נמצא מעבר לערך הקריטי, השטח שמעבר לו קטן מהשטח שמעבר לערך הקריטי, כלומר קטן מ־α. ולהפך. אז למה צריך שתיים? הדרך של הערך הקריטי היא הדרך הישנה: פעם לא היה אפשר לחשב שטח מדויק לכל ערך, ולכן השתמשו בטבלאות של ערכים קריטיים מוכנים. היום כל תוכנה נותנת את ערך p המדויק, והוא אומר יותר: לא רק אם עברנו את הגבול, אלא כמה רחוק.
ושימו לב להבדל בין α ל־p. את α קובע החוקר, מראש, והוא כלל ההחלטה. ערך p הוא תכונה של המדגם הספציפי: עד כמה הוא קיצוני. משווים את p ל־α, ולא להפך.
ובדיווח, לפי APA: כותבים את ערך p המדויק, שתיים או שלוש ספרות, בלי אפס לפני הנקודה: z = 2.36, p = .018. כשערך p קטן מאלפית כותבים p < .001, ולא p = .000: ערך p אף פעם לא אפס בדיוק.
מעבדה: מבחן z, אזור הדחייה וערך p
- בהגדרות הפתיחה (30 נבדקים ששתו קפה, ממוצע 484.5, השערה דו־צדדית): מה ציון התקן, ומה ערך p? האם דוחים? האם הקו של z נמצא באזור האדום?
- עברו לרמת מובהקות 0.01. מה השתנה בציור, ומה השתנה בהחלטה? האם ערך p השתנה?
- החזירו ל־0.05, והגדילו את המדגם ל־100, עם אותו ממוצע. מה קורה לציון התקן ולערך p, ולמה?
- עם 30 נבדקים, עברו להשערה "גדול (חד־צדדית)". מה קרה לערך p? מה זה מלמד על בחירת כיוון אחרי שרואים את הנתונים?
בדיקת התשובה
1. z = −2.12, ו־p = 0.0338. קטן מ־.05: דוחים. הקו נמצא בזנב השמאלי, בתוך האדום. 2. אזור הדחייה הצטמצם, והערך הקריטי זז ל־±2.58. ההחלטה התהפכה: לא דוחים. ערך p לא השתנה, כי הוא תכונה של המדגם ולא של הכלל. 3. טעות התקן קטנה ל־40 / √100 = 4, ולכן z = −15.5 / 4 = −3.88, וערך p קטן מאוד (בערך 0.0001). אותו הבדל, אבל מדגם גדול יותר מודד את הממוצע בדיוק רב יותר. 4. ערך p קפץ ל־0.98. ההשערה "גדול מ־500" לא יכולה להיתמך בממוצע שקטן מ־500. ומי שבוחר כיוון אחרי שראה את הנתונים, בוחר תמיד את הכיוון "הנכון", ועל זה בסעיף הבא.
חשבו את ערך p, והחליטו ברמת מובהקות .05: א. z = 2.05, דו־צדדי. ב. z = −1.40, חד־צדדי שמאלי. ג. z = 2.70, דו־צדדי.
בדיקת התשובה
בסעיף ג גם ברמת מובהקות של .01 היינו דוחים. וזה בדיוק מה שערך p אומר ושההחלטה לבדה לא אומרת: ג רחוק מהגבול, ו־א קרוב אליו.
בדקו את עצמכם3 שאלות
1.במבחן z חד־צדדי ימני התקבל z = 1.30. מהו ערך p?
2.ערך p של מבחן הוא .012, ורמת המובהקות שנקבעה מראש היא .01. מה ההחלטה?
3.במבחן z דו־צדדי התקבל z = −2.40. חשבו את ערך p. מה ההחלטה ברמת מובהקות .05, ומה ברמה של .01?
חד־צדדי או דו־צדדי, במספרים
בדו־צדדי ה־α מתחלק בין שני הזנבות, ובחד־צדדי כולו בזנב אחד. לכן, כשהתוצאה בכיוון שחזינו, ערך p החד־צדדי הוא חצי מהדו־צדדי, והערך הקריטי קרוב יותר לאפס: 1.645 במקום 1.96. את הכיוון קובעים לפני איסוף הנתונים. בספר מנתחים דו־צדדי, אלא אם יש סיבה טובה מאוד שלא.
בפרק 4 הבטחנו לראות במספרים למה מבחן חד־צדדי "קל" יותר. הנה. נשווה הפעם את כל 200 התלמידים במחקר, לפני התוכנית, לנורמה. הממוצע שלהם 2.2356, קצת מתחת ל־2.30.
אותם נתונים, אותו z, והחלטות הפוכות. בדו־צדדי, −1.82 לא מגיע ל־−1.96. בחד־צדדי, כל ה־5% נמצאים בזנב השמאלי, הגבול זז ל־−1.645, ו־−1.82 כבר בפנים.
וכאן בדיוק הפיתוי. חוקר שראה p = .069 יכול לומר לעצמו: "בעצם, תמיד חשבתי שהתלמידים שלנו פחות חרדים מהממוצע הארצי." הוא עובר לחד־צדדי, ומקבל .034. אבל מי שבוחר את הכיוון אחרי שראה את הנתונים, יבחר תמיד את הכיוון שבו התוצאה יצאה. בפועל הוא דוחה בכל אחד מהזנבות, ב־5% מכל צד, כלומר רמת המובהקות האמיתית שלו היא 10% ולא 5%. לכן, כשמאמר מדווח ניתוח חד־צדדי בלי הסבר, קוראים רבים מסיקים שהדו־צדדי פשוט לא יצא מובהק.
ויש לחד־צדדי גם מחיר. אילו החוקר היה קובע מראש H1: μ > 2.30 (התלמידים שלנו חרדים יותר), ערך p היה .966. לא דוחים, וגם אסור לו לטעון שהם חרדים פחות: את הכיוון הזה הוא ויתר עליו מראש.
אז מתי חד־צדדי מתאים? כשהכיוון נקבע מראש, לפני איסוף הנתונים, מתוך תיאוריה או מחקר קודם, ותוצאה בכיוון ההפוך באמת לא תשנה שום החלטה. ואז כותבים במאמר במפורש שהבדיקה חד־צדדית, ולמה.
| השאלה | ההשערות | אזור הדחייה (α = .05) | ערך p |
|---|---|---|---|
| "שונה מ..." | H0: μ = μ0 H1: μ ≠ μ0 | |z| ≥ 1.96 | שני הזנבות |
| "גבוה מ...", "משפר" | H0: μ ≤ μ0 H1: μ > μ0 | z ≥ 1.645 | הזנב הימני |
| "נמוך מ...", "מקטין" | H0: μ ≥ μ0 H1: μ < μ0 | z ≤ −1.645 | הזנב השמאלי |
כשהערך הקריטי זז מ־1.96 ל־1.645, קל יותר לעבור אותו. לכן, אם ההבדל האמיתי באוכלוסייה הוא בכיוון שחזינו, הסיכוי שהמבחן יגלה אותו גדל, ולפעמים לא מעט. למשל, כשההבדל האמיתי הוא שתי טעויות תקן, הסיכוי לגלות אותו עולה מכ־52% בדו־צדדי לכ־64% בחד־צדדי. אבל אם ההבדל בכיוון ההפוך, הסיכוי לגלות אותו יורד כמעט לאפס. את הסיכוי הזה, עוצמת המבחןPower, נלמד לחשב בפרק 19.
במבחן z התקבל z = 1.75. מה ערך p, ומה ההחלטה ברמת מובהקות .05, אם ההשערה שנקבעה מראש היא: א. דו־צדדית? ב. חד־צדדית ימנית? ג. חד־צדדית שמאלית?
בדיקת התשובה
בסעיף ג התוצאה בכיוון ההפוך להשערה: הממוצע מעל μ0, וההשערה צפתה שהוא יהיה מתחת. ערך p ענק. החד־צדדי עוזר רק בכיוון שבחרתם מראש.
בדקו את עצמכם3 שאלות
1.חוקר קבע מראש H1: μ < μ0, וקיבל z = −1.90. מה ערך p, ומה ההחלטה ב־α = .05?
2.חוקרת קיבלה בבדיקה דו־צדדית p = .07. אחרי שראתה שהממוצע גבוה מהצפוי, היא עברה לבדיקה חד־צדדית, וקיבלה p = .035. מה הבעיה?
3.הסבירו במשפט או שניים, בעזרת אזור הדחייה, למה קל יותר לדחות את השערת האפס במבחן חד־צדדי, כשהתוצאה בכיוון שחזינו.
שתי טעויות אפשריות
ההחלטה מבוססת על הסתברות, ולכן יכולה לטעות בשתי דרכים. טעות מסוג ראשון: דוחים את השערת האפס כשהיא נכונה, אזעקת שווא. הסיכוי לה הוא α. טעות מסוג שני: לא דוחים את השערת האפס כשהיא לא נכונה, החמצה. הסיכוי לה מסומן β. הקטנת α, בלי לשנות שום דבר אחר, מגדילה את β.
האמת בעולם היא אחת משתיים: השערת האפס נכונה, או שהיא לא נכונה. את האמת הזו אנחנו לא יודעים, ולעולם לא נדע בוודאות. אנחנו יודעים רק מה החלטנו. שתי אפשרויות באמת, כפול שתי החלטות, נותנות ארבעה מצבים:
| ההחלטה שלנו | במציאות: השערת האפס נכונה (אין הבדל) | במציאות: השערת המחקר נכונה (יש הבדל) |
|---|---|---|
| דוחים את השערת האפס | טעות מסוג ראשון. הסיכוי: α | החלטה נכונה. הסיכוי: 1 − β, עוצמת המבחן |
| לא דוחים את השערת האפס | החלטה נכונה. הסיכוי: 1 − α | טעות מסוג שני. הסיכוי: β |
טעות מסוג ראשון, במילים של בני אדם: להגיד שהתוכנית עוזרת, כשהיא לא עוזרת. איך זה קורה? כל הילדים במדגם "רגילים", אבל במקרה דגמנו דווקא את הקיצוניים, והממוצע נפל באזור הדחייה. כמה פעמים זה יקרה? בדיוק בשיעור שקבענו כ"נדיר": α. הרי הגדרנו את אזור הדחייה כך שבעולם של השערת האפס, 5% מהממוצעים ייפלו בו.
טעות מסוג שני: התוכנית באמת עוזרת, אבל לא מצאנו את זה. המדגם שלנו נפל במקרה בחלק הנמוך של ההתפלגות של השערת המחקר, בתוך אזור אי־הדחייה. הסיכוי לטעות כזו מסומן β (בטא), והמשלים שלו, 1 − β, הוא עוצמת המבחן: הסיכוי לדחות את השערת האפס, בצדק. את העוצמה נלמד לעומק בפרק 19.
הגרלנו במחשב 1,000 כיתות דמיוניות של 22 ילדים, כולן מאוכלוסייה שבה השערת האפס נכונה בוודאות: ממוצע 2.30, סטיית תקן 0.50. לכל כיתה הרצנו מבחן z דו־צדדי, ברמת מובהקות .05. 54 כיתות יצאו מובהקות, 27 בכל זנב. כלומר 5.4%, קרוב מאוד ל־5% שקבענו. כל 54 הן טעויות מסוג ראשון: אין בכיתות האלה שום דבר מיוחד.
ועכשיו ההפך. הגרלנו 1,000 כיתות מאוכלוסייה שבה הממוצע באמת שונה מהנורמה: 2.55, בדיוק כמו בכיתה ה׳. הפעם השערת האפס לא נכונה, וכל דחייה היא החלטה נכונה. 634 כיתות יצאו מובהקות. 366 האחרות, כ־37%, הן טעויות מסוג שני: ההבדל קיים, והמבחן פספס אותו. (החישוב המדויק, שנלמד בפרק 19, נותן עוצמה של כ־65%.)
ומה לגבי הכיתה האמיתית שלנו? דחינו את השערת האפס. אם השערת האפס נכונה, עשינו טעות מסוג ראשון. אם לא, צדקנו. איזו משתי האפשרויות נכונה? את זה אי אפשר לדעת, כמו בכל החלטה בחיים. מה שאפשר לדעת הוא מה הסיכוי לטעות, אם נפעל לפי הכלל הזה שוב ושוב.
אי אפשר להקטין את שתיהן סתם כך
תסתכלו על האיור. רוצים פחות טעויות מסוג ראשון? מקטינים את α, והקו הקריטי זז ימינה. אבל אז חלק גדול יותר מעקומת המחקר נמצא משמאל לקו, ו־β גדלה. רוצים פחות החמצות? מזיזים את הקו שמאלה, ומקבלים יותר אזעקות שווא. כמו שמיכה קצרה: מכסים את הראש, והרגליים בחוץ.
הדרך היחידה להקטין את שתיהן היא להצר את שתי העקומות, כך שיחפפו פחות. ומה מצר אותן? טעות תקן קטנה יותר, כלומר מדגם גדול יותר. גם הבדל גדול יותר באוכלוסייה מקטין את החפיפה, כי העקומות מתרחקות זו מזו. על כל זה, בפרק 19.
איזו טעות חמורה יותר?
זה תלוי. נניח שבודקים חיסון חדש. טעות מסוג ראשון: מוכרים במיליונים חיסון שלא עובד, ואולי יש לו גם תופעות לוואי. טעות מסוג שני: יש חיסון שעובד, והוא לעולם לא מגיע לאנשים. ובחינוך: טעות מסוג ראשון מכניסה לבתי הספר תוכנית שלא עוזרת, על חשבון זמן וכסף. טעות מסוג שני גורמת לוותר על תוכנית שהייתה עוזרת לילדים. החוקרים מחליטים מה המחיר של כל טעות, וקובעים את α בהתאם.
ועוד דבר, שכבר אמרנו בפרק 4 וחשוב לחזור עליו: "לא דוחים" אינו "מקבלים". כשלא דחינו את השערת האפס, אולי היא נכונה, ואולי עשינו טעות מסוג שני. לכן כותבים "לא נמצא הבדל מובהק", ולא "הוכחנו שאין הבדל".
מעבדה: טעות מסוג ראשון וטעות מסוג שני
- בהגדרות הפתיחה (α = 0.05, מרחק של 2.5 טעויות תקן בין הממוצעים): מה β, ומה העוצמה?
- הקטינו את α ל־0.01. לאן זז הקו הקריטי, ומה קרה ל־β?
- החזירו את α ל־0.05, והקטינו את המרחק בין הממוצעים עד אפס. מה העוצמה עכשיו? למה דווקא המספר הזה?
בדיקת התשובה
1. β = 0.2 בערך (המדויק: .196), ועוצמה של כ־0.8. 2. הקו זז ימינה, מ־1.645 ל־2.33, ו־β גדלה ל־0.43. פחות אזעקות שווא, יותר החמצות. 3. העוצמה יורדת ל־0.05, בדיוק α. כשהעקומות מתלכדות, "השערת המחקר" היא בעצם השערת האפס, והסיכוי לדחות הוא הסיכוי לטעות מסוג ראשון. כל הבדל אמיתי בכיוון הנכון רק מגדיל את העוצמה מעבר ל־α.
α הוא הסיכוי לטעות מסוג ראשון במבחן אחד. מה קורה כשבודקים שמונה כיתות, כל אחת מול הנורמה, ובאף אחת אין הבדל אמיתי? הסיכוי שלפחות אחת תצא מובהקת במקרה הוא 1 − (1 − .05)8 = 1 − .958 = .34, ולא 5%. דמיינו שבודקים אם יש הבדל בין בנים לבנות בחיפה, ואז בבאר שבע, בירוחם ובכפר קאסם. אם בודקים מספיק ערים, באחת מהן במקרה יהיו כמה בנות מוכשרות במיוחד. ככל ששואלים יותר שאלות, צריך להחמיר יותר. זו הסיבה שמחקרים שבודקים משתנים רבים קובעים α של .01 או .001, ונלמד דרכים מסודרות לתקן את זה בפרק 26.
איזו טעות, אם בכלל? א. משרד החינוך בדק תוכנית לשיפור קריאה, והמבחן לא היה מובהק. שנים אחר כך התברר שהתוכנית דווקא עוזרת. ב. חוקר מצא שתרגול נשימה משפר ריכוז (p = .03). מחקרים רבים אחריו הראו שאין לתרגול שום השפעה. ג. חוקרת לא מצאה הבדל מובהק בין שתי שיטות לימוד, ובאמת אין ביניהן הבדל.
בדיקת התשובה
א. טעות מסוג שני: יש השפעה, ולא דחו את השערת האפס. החמצה. ב. טעות מסוג ראשון: אין השפעה, והוא דחה את השערת האפס. אזעקת שווא. הסיכוי לה הוא α, וערך p נמוך לא מגן ממנה. ג. אין טעות: לא דחתה, ובצדק. אבל שימו לב, היא עצמה לא יכולה לדעת את זה. מבחינתה, "לא נמצא הבדל מובהק".
בדקו את עצמכם4 שאלות
1.חוקר קבע α = .01. אם השערת האפס נכונה, מה הסיכוי שהוא יעשה טעות מסוג ראשון?
2.בית ספר אימץ תוכנית אחרי מחקר מובהק. מחקרים גדולים מאוחרים יותר הראו שלתוכנית אין שום השפעה. איזו טעות נעשתה במחקר הראשון?
3.מה מאפשר להקטין גם את הסיכוי לטעות מסוג ראשון וגם את הסיכוי לטעות מסוג שני?
4.בניסויExperiment במחשב הגרילו 2,000 מדגמים מאוכלוסייה שבה השערת האפס נכונה, ובדקו כל אחד ברמת מובהקות .01. בכמה מדגמים, בערך, צפויה תוצאה מובהקתStatistically significant? ואיזו טעות זו?
חמשת השלבים של כל מבחן
כל מבחן בספר עובר באותם חמישה שלבים: 1. השערות על μ, חד־צדדיות או דו־צדדיות. 2. רמת מובהקות והערך הקריטי. 3. סטטיסטי המבחן, כאן z. 4. החלטה: באזור הדחייה, או p ≤ α, דוחים. 5. מסקנה במילים, בהקשר של שאלת המחקר.
עכשיו אפשר לסדר את כל מה שעשינו בסדר קבוע. אותו סדר ילווה אותנו במבחני t, בחי בריבועChi-square statistic, בניתוח שונותOne-way ANOVA ובכל השאר. משתנים רק הסטטיסטי וההתפלגות.
- השערות. כותבים את השערת האפס ואת השערת המחקר, על μ. מחליטים אם דו־צדדית או חד־צדדית, לפי שאלת המחקר, ולפני שרואים נתונים.
- רמת מובהקות. בדרך כלל .05. ממנה, ומסוג ההשערה, נובע הערך הקריטי.
- סטטיסטי המבחן. במבחן z: z = (M − μ0) / (σ / √n). ואיתו ערך p.
- החלטה. אם z באזור הדחייה, או p ≤ α: דוחים את השערת האפס. אחרת: לא דוחים.
- מסקנה. משפט במילים, בשפה של שאלת המחקר. לא "דחינו את H0", אלא מה זה אומר על הילדים, על התוכנית או על הכיתה.
במבחן שטף קריאה ארצי הממוצע 100 וסטיית התקן 15. 36 תלמידים השתתפו בתוכנית קריאה חדשה, והממוצע שלהם 105. האם התוכנית משנה את שטף הקריאה? (α = .05)
5. מסקנה: ברמת מובהקות של .05, שטף הקריאה של משתתפי התוכנית גבוה מהממוצע הארצי, z = 2.00, p = .046. שימו לב כמה קרוב לגבול: .046 מול .05. ועוד שאלה שהמבחן לא עונה עליה: האם התוכנית גרמה לזה? בלי קבוצת ביקורת אי אפשר לדעת. אולי התלמידים שנבחרו לתוכנית היו קוראים טובים מלכתחילה (פרק 7).
בפרק 14 ראינו שהזמן שלוקח לתלמידים לקרוא קטע מסוים מתפלג נורמלית, עם ממוצע 120 שניות וסטיית תקן 15. מורה מתכננת תוכנית של קריאה בזוגות, ומחקרים קודמים מראים שתוכניות כאלה מקצרות את זמן הקריאה. לכן, עוד לפני שאספה נתונים, היא קבעה השערה חד־צדדית. אחרי התוכנית, 25 תלמידים קראו את הקטע בממוצע של 114 שניות. (α = .05)
5. מסקנה: ברמת מובהקות של .05, אחרי התוכנית התלמידים קוראים את הקטע מהר יותר מהממוצע, z = −2.00, p = .023, בבדיקה חד־צדדית. אותו גודל של z כמו בדוגמה הקודמת, וערך p חצי ממנו: כי כאן רק זנב אחד נחשב. וזה לגיטימי, כי הכיוון נקבע מראש.
5. מסקנה: החרדה של תלמידי כיתה ה׳ בבית הספר הראשון גבוהה באופן מובהק מהנורמה הארצית, z = 2.36, p = .018. המחנכת צודקת: קשה להסביר הבדל כזה במקרה. אבל המבחן לא אומר למה הכיתה חרדה, ולא אומר שזה קשור אליה. הוא גם לא אומר כמה גדול ההבדל, ועל זה בסעיף הבא.
תהליך אחד, הרבה מבחנים
הטבלה הזו תלווה אותנו בהמשך הספר. בכל מבחן חדש: אותם חמישה שלבים, רק סטטיסטי אחר והתפלגות אחרת.
| המבחן | סטטיסטי המבחן | ההתפלגות שלו אם H0 נכונה | פרק |
|---|---|---|---|
| ממוצע מול אוכלוסייה, σ ידועה | z | נורמלית סטנדרטית | 18 |
| ממוצע מול ערך, σ לא ידועה; שני ממוצעים | t | התפלגות tt distribution | 20, 21 |
| קשר בין שני משתנים קטגוריים | χ² | חי בריבועChi-square statistic | 23 |
| מתאם | r, שנבדק בעזרת t | התפלגות t | 24 |
| שלושה ממוצעים או יותר | F | התפלגות F | 26 |
במבחן מתמטיקה ארצי הממוצע 70 וסטיית התקן 12. 16 תלמידים השתתפו בתגבור, והממוצע שלהם 75. עוד לפני התגבור, הצוות קבע שיבדוק אם התגבור משפר את הציון. עברו את חמשת השלבים (α = .05). ומה הייתה ההחלטה אילו הבדיקה הייתה דו־צדדית?
בדיקת התשובה
5. ברמת מובהקות של .05, הציון הממוצע של משתתפי התגבור גבוה מהממוצע הארצי (z = 1.67, p = .048, חד־צדדי). בבדיקה דו־צדדית: p = .096, והערך הקריטי 1.96, ולכן לא היינו דוחים. החלטה גבולית מאוד, בשני המקרים.
בדקו את עצמכם3 שאלות
1.באילו שלבים מבין החמישה מחליטים לפני שאוספים את הנתונים?
2.מבחן z דו־צדדי נתן z = 1.10, p = .271. איזה משפט מתאים לשלב 5, המסקנה?
3.במבחן ארצי באנגלית הממוצע 80 וסטיית התקן 8. 16 תלמידים שלמדו בשיטה חדשה קיבלו ממוצע 83. האם הם שונים מהממוצע הארצי? עברו את חמשת השלבים (α = .05).
מה ערך p אומר, ומה לא
ערך p הוא הסיכוי לתוצאה כזו, או קיצונית ממנה, אם השערת האפס נכונה. הוא לא הסיכוי שהשערת האפס נכונה, לא הסיכוי שהתוצאה "מקרית", ולא מדד לגודל ההבדל או לחשיבותו. אותו הבדל בדיוק יכול להיות מובהק במדגם גדול ולא מובהק במדגם קטן. לכן מדווחים את ערך p המדויק, ותמיד גם את גודל ההבדל.
ערך p הוא כנראה המושג הכי פחות מובן במחקר. אז נדייק. מה הוא כן אומר? זה המשפט שכדאי לשנן, כי הוא נכון לכל מבחן בספר: ערך p הוא הסיכוי לקבל תוצאה כמו שלנו, או קיצונית ממנה, בהנחה שהשערת האפס נכונה. ערך p קטן אומר: הנתונים שלנו לא מתיישבים טוב עם השערת האפס. ועכשיו, ארבע טעויות נפוצות.
1. "p = .018, ולכן הסיכוי שהשערת האפס נכונה הוא 1.8%"
לא. ערך p מחושב בהנחה שהשערת האפס נכונה. הוא לא יכול להיות גם הסיכוי שההנחה עצמה נכונה. אלה שתי שאלות שונות לגמרי, שנשמעות דומה. מה הסיכוי שמי שזכה בלוטו קנה כרטיס? 100%. מה הסיכוי שמי שקנה כרטיס יזכה בלוטו? כמעט אפס. ערך p עונה על שאלה מהסוג "מה הסיכוי לנתונים, אם ההשערה נכונה", ולא "מה הסיכוי להשערה, בהינתן הנתונים". ומאותה סיבה, 1 − p = .982 הוא לא הסיכוי שהשערת המחקר נכונה.
2. "p קטן, ולכן ההבדל גדול וחשוב"
לא. ערך p תלוי מאוד בגודל המדגם. ניקח את אותו הבדל בדיוק, 0.25 נקודה מעל הנורמה, ונשנה רק את מספר הילדים:
| מספר הילדים | ההבדל מהנורמה | SE | z | p (דו־צדדי) |
|---|---|---|---|---|
| 5 | 0.25 | 0.224 | 1.12 | .264 |
| 22 | 0.25 | 0.107 | 2.35 | .019 |
| 200 | 0.25 | 0.035 | 7.07 | < .001 |
אותו הבדל: לא מובהק, מובהק, ומובהק מאוד. ובכיוון ההפוך, עם מספיק ילדים, גם הבדל זעיר יוצא מובהק: הבדל של 0.05 נקודה בלבד, עשירית מסטיית התקן, נותן עם 2,000 ילדים z = 4.47, p < .001. מובהק, וחסר כל חשיבות מעשית. לכן מדווחים תמיד גם גודל אפקטEffect size, מדד לגודל ההבדל שלא תלוי בגודל המדגם. נלמד אותו בפרק 19.
3. "p = .053, ולכן אין הבדל"
לא. באחת מכיתות ד׳ בבית הספר השלישי (התוכנית המשולבת, class_id = 6), ממוצע החרדה לפני התוכנית הוא 2.11, ו־z = −1.93, p = .053. לא מובהק. בכיתה ה׳ מהשאלה הפותחת, p = .018, מובהק. האם העדות שמספקות שתי הכיתות שונה כל כך? בכלל לא: שתיהן רחוקות מהנורמה כמעט באותה מידה, 1.93 ו־2.36 טעויות תקן, בכיוונים הפוכים. לא דחינו את השערת האפס בכיתה ד׳, וזה לא אומר שהוכחנו אותה. ויש ציטוט שאני אוהב: "אלוהים אוהב את .06 כמעט כמו את .05" (Rosnow & Rosenthal, 1989). ההבדל בין .04 ל־.06 זעיר, גם כשההחלטה הפוכה. לכן מדווחים את ערך p המדויק, ולא רק "מובהק" או "לא מובהק".
4. "p = .018, ולכן יש רק 1.8% סיכוי שהתוצאה מקרית"
לא, וזו בעצם טעות 1 בתחפושת. "התוצאה מקרית" פירושו "השערת האפס נכונה", ואת הסיכוי לזה ערך p לא נותן. ערך p אומר כמה מקרה כזה נדיר, אם הכול מקרה.
נניח שמאה צוותי מחקר ברחבי העולם בודקים תוכנית ללמידה חברתית־רגשית, נושא שנמצא היום בחזית המחקר. ונניח שהתוכנית לא עושה כלום. עם α = .05, בערך חמישה צוותים יקבלו תוצאה מובהקת, במקרה. הם יפרסמו. 95 האחרים יקבלו תוצאה לא מובהקת, והמאמרים שלהם יישארו במגירה. מה יראה מי שקורא את הספרות? חמישה מחקרים, וכולם מראים שהתוכנית עובדת.
שימו לב: זה לא אומר ש־5% מהמאמרים שמתפרסמים שגויים. α הוא הסיכוי לטעות מסוג ראשון כשהשערת האפס נכונה, לא אחוז המאמרים השגויים. בדוגמה הזו, כל המאמרים שהתפרסמו שגויים. כמה מהספרות שגויה תלוי בכמה מההשערות שנבדקות נכונות באמת, בעוצמת המחקרים, ובכמה מהתוצאות הלא מובהקות נשארות במגירה. לכן חשוב לבדוק אם תוצאה שוחזרה במחקרים נוספים. ויותר ויותר כתבי עת מעודדים רישום מראש: החוקרים מפרסמים את ההשערות ואת תוכנית הניתוח לפני איסוף הנתונים, למשל באתר OSF, וכך גם תוצאה לא מובהקת נשארת גלויה.
ועוד קשר לאחור: בפרק 12 פגשנו את מבחן Shapiro-Wilk, שבו השערת האפס היא "ההתפלגות נורמלית". עכשיו ברור למה במדגם גדול הוא יוצא מובהק גם על סטיות זעירות, ובמדגם קטן מפספס גם סטיות גדולות. זו בדיוק טעות 2 שלמעלה: ערך p תלוי בגודל המדגם.
מעבדה: ערך p, השערת האפס ועוצמת המבחן
- עשרה תלמידים בתוכנית העשרה קיבלו ממוצע 78.1 (מבחן חד־צדדי, α = .05). מה ערך p? האם דוחים?
- השאירו את הממוצע 78.1, והגדילו את המדגם ל־40. מה קרה לערך p? האם ההבדל עצמו השתנה?
- חזרו ל־10 תלמידים ועברו לדו־צדדי. מה קרה לערך p, ולגבול הדחייה?
- במבחן חד־צדדי עם 10 תלמידים, אם הממוצע האמיתי של משתתפי התוכנית הוא 80, מה הסיכוי לגלות את זה? ועם 40 תלמידים?
בדיקת התשובה
1. p = .066: לא דוחים. התוצאה קרובה לגבול, אבל לא עברה אותו. 2. ערך p ירד ל־.001. ההבדל, 4.3 נקודות, לא השתנה. רק טעות התקן קטנה, מ־2.85 ל־1.43. 3. ערך p הוכפל ל־.132 בערך, ונוסף גבול דחייה גם בצד השמאלי. 4. עם 10 תלמידים העוצמה כ־70%: בערך פעם אחת מכל שלוש, המבחן יפספס הבדל שקיים. עם 40 תלמידים העוצמה כמעט 100%. על זה, בפרק הבא.
ב־2016 פרסם האיגוד האמריקאי לסטטיסטיקה, לראשונה בתולדותיו, הצהרה רשמית על ערך p (Wasserstein & Lazar, 2016). עיקרי הדברים: ערך p יכול להראות עד כמה הנתונים לא מתיישבים עם מודל מסוים. הוא לא מודד את ההסתברות שההשערה נכונה. החלטות מדעיות לא צריכות להתבסס רק על השאלה אם p עבר סף מסוים. צריך לדווח בשקיפות את כל הניתוחים שנעשו. ערך p לא מודד את גודל האפקט או את חשיבותו. וערך p לבדו אינו מדד טוב לראיות בעד מודל או השערה.
יש חוקרים שהציעו להחמיר את הסף ל־.005, ויש שהציעו לוותר על המילה "מובהק" בכלל. הספר הולך בדרך האמצע שרוב כתבי העת מבקשים היום: מדווחים ערך p מדויקExact p-value, יחד עם גודל אפקט ורווח סמךConfidence interval (פרק 19). ומי שרוצה לשאול ישירות "כמה הנתונים תומכים בהשערת המחקר לעומת השערת האפס?", ימצא תשובה בגישה הבייסיאנית, בפרק 40.
במחקר התקבל p = .03. נכון או לא נכון? א. אם השערת האפס נכונה, הסיכוי לתוצאה כזו או קיצונית ממנה הוא 3%. ב. יש 97% סיכוי שהשערת המחקר נכונה. ג. ההבדל שנמצא גדול. ד. אילו החוקר היה קובע מראש α = .01, הוא לא היה דוחה את השערת האפס.
בדיקת התשובה
א. נכון: זו בדיוק ההגדרה. ב. לא נכון: ערך p מחושב בהנחה שהשערת האפס נכונה, ולא אומר מה הסיכוי של אף אחת מההשערות. ג. לא נכון: ערך p לא מודד גודל. עם מדגם גדול, גם הבדל זעיר נותן p קטן. ד. נכון: .03 > .01.
בדקו את עצמכם3 שאלות
1.במחקר על 5,000 תלמידים נמצא ששיטה חדשה מעלה ציונים בשלוש עשיריות נקודה, בסולם של 100, עם p = .002. מה נכון?
2.התקבל p = .30. מה הפירוש הנכון?
3.בעיתון: "עשרה מחקרים שפורסמו מצאו שמשחקי מחשב חינוכיים משפרים זיכרון." למה זו עדיין לא ראיה חזקה?
בתוכנה: מבחן z לכיתה ה׳
נריץ את מבחן z של שאלת הפתיחה על קובץ המחקר. כיתה ה׳ בבית הספר הראשון היא class_id = 3, והמשתנה הוא החרדה לפני התוכנית, anx_pre. הנורמה: μ0 = 2.30, σ = 0.50. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות.
בקובץ המחקר הנתונים ממוינים לפי הכיתה, וכיתה 3 נמצאת בשורות 54 עד 75. החרדה, anx_pre, היא עמודה AI. שני מסלולים: נוסחאות צעד אחר צעד, או פונקציה אחת.
Z test: class 3 (AI54:AI75) vs. norm
| Cell | Formula | Result | |
|---|---|---|---|
| BE2 | n | =COUNT(AI54:AI75) | 22 |
| BE3 | Mean | =AVERAGE(AI54:AI75) | 2.5511 |
| BE4 | SE | =0.5/SQRT(BE2) | 0.1066 |
| BE5 | z | =(BE3-2.3)/BE4 | 2.3559 |
| BE6 | Critical value (two-tailed) | =NORM.S.INV(0.975) | 1.9600 |
| BE7 | p (two-tailed) | =2*(1-NORM.S.DIST(ABS(BE5),TRUE)) | 0.0185 |
| BE8 | Z.TEST (one-tailed, right) | =Z.TEST(AI54:AI75, 2.3, 0.5) | 0.0092 |
| BE9 | Z.TEST, two-tailed | =2*MIN(BE8, 1-BE8) | 0.0185 |
- z = 2.3559
- הממוצע של הכיתה נמצא 2.36 טעויות תקן מעל הנורמה. את החישובים שמנו בעמודה ריקה, BE, מימין לנתונים.
- p = 0.0185
- ערך p דו־צדדי: p = .018. קטן מ־.05: דוחים. ובתא BE6 רואים את אותה החלטה בדרך השנייה: 2.36 גדול מ־1.96.
- Z.TEST
- מקבלת את הנתונים, את μ0 ואת σ, ומחזירה ערך p חד־צדדי ימני: השטח מימין ל־z. כדי לקבל דו־צדדי, לוקחים את הזנב הקטן מבין השניים ומכפילים בשתיים, כמו בתא BE9.
זהירות: אם משמיטים את הארגומנט השלישי, Z.TEST משתמשת בסטיית התקן של המדגם במקום ב־σ. זה כבר לא מבחן z אמיתי, ולמקרה הזה בדיוק נועד מבחן t (פרק 20). תמיד כתבו את σ של הנורמה.
ב־SPSS אין חלון מוכן למבחן z על ממוצע, כי σ ידועה רק לעיתים רחוקות. לכן מחשבים את הממוצע, ואת z ו־p בנוסחה. (החלון One-Sample T Test משתמש בסטיית התקן של המדגם, וזה כבר מבחן t, שנלמד בפרק 20.)
- בוחרים רק את הכיתה: Data > Select Cases, If condition is satisfied, ובחלון If:
class_id = 3. - Analyze > Descriptive Statistics > Descriptives, ומעבירים את
anx_pre. - מחשבים את z ואת p: Transform > Compute Variable. ב־Target Variable כותבים
z_class, ובביטוי:(2.5511 - 2.30) / (0.50 / SQRT(22)). ושוב, משתנהp_twoעם הביטוי2 * (1 - CDF.NORMAL(ABS(z_class), 0, 1)). - בסוף מחזירים את כל הנתונים: Data > Select Cases > All cases.
Descriptive Statistics
| N | Minimum | Maximum | Mean | Std. Deviation | |
|---|---|---|---|---|---|
| anx_pre | 22 | 1.88 | 3.13 | 2.5511 | .37926 |
| Valid N (listwise) | 22 |
Data View: שתי העמודות החדשות (בכל שורה אותו ערך)
| class_id | anx_pre | z_class | p_two |
|---|---|---|---|
| 3 | 2.50 | 2.36 | .02 |
- Mean
- הממוצע של הכיתה, 2.5511. אותו מספר שמציבים בנוסחה של z.
- Std. Deviation
- .379 היא סטיית התקן של 22 הילדים בכיתה. לא משתמשים בה במבחן z: שם משתמשים ב־σ = 0.50 של הנורמה.
- p_two
- SPSS מציג את העמודה בשתי ספרות אחרי הנקודה, כברירת מחדל. כדי לראות .0185, מגדילים את Decimals של המשתנה ב־Variable View.
אותו דבר בתחביר, למי שמעדיף:
Syntax
| COMPUTE z_class = (2.5511 - 2.30) / (0.50 / SQRT(22)). COMPUTE p_two = 2 * (1 - CDF.NORMAL(ABS(z_class), 0, 1)). EXECUTE. |
ב־JASP יש מבחן z מוכן, בתוך החלון של מבחן t למדגם אחדOne-sample t test.
- כדי לנתח רק את הכיתה: לוחצים על כותרת העמודה
class_idבגיליון הנתונים, ומבטלים את הסימון של כל הכיתות חוץ מ־3 (מסנן). - T-Tests > One Sample T-Test. מעבירים את
anx_preל־Variables. - תחת Tests: מבטלים את Student ומסמנים Z Test. בשדה Std. deviation שלידו כותבים 0.5, את σ של הנורמה.
- תחת Alt. Hypothesis: בשדה Test value כותבים 2.3, ומשאירים את ≠ Test value (דו־צדדי). מסמנים גם Descriptives.
One Sample T-Test
| Test | Statistic | p | |
|---|---|---|---|
| anx_pre | Z | 2.356 | .018 |
Note. For the Z test, the alternative hypothesis specifies that the mean is different from 2.3.
Descriptives
| N | Mean | SD | SE | |
|---|---|---|---|---|
| anx_pre | 22 | 2.551 | 0.379 | 0.081 |
- Statistic = 2.356
- זה z. ערך p דו־צדדי, .018: דוחים.
- SD ו־SE בטבלת Descriptives
- אלה של המדגם: 0.379, ו־0.379 / √22 = 0.081. מבחן z לא משתמש בהם, אלא ב־0.5 שכתבתם, ולכן טעות התקן שלו היא 0.107.
- Note
- JASP כותב מתחת לטבלה איזו השערה נבדקה. כדאי לבדוק אותה תמיד.
וכדי לראות את התמונה: במודול Distributions, Normal עם ממוצע 0 וסטיית תקן 1, אפשר לבקש את ההסתברות מעל 2.356, ו־JASP יצבע את הזנב.
בדקו את עצמכם3 שאלות
1.באקסל, =Z.TEST(A2:A31, 50, 10) החזיר 0.97. מהו ערך p הדו־צדדי?
Z.TEST מחזירה את הזנב הימני. 0.97 אומר שהממוצע מתחת ל־50, והזנב הקטן הוא השמאלי, 0.03. בדו־צדדי מכפילים את הזנב הקטן בשתיים.1.ב־SPSS חישבתם ב־Compute Variable את z_class, ויצא −1.88. אחר כך כתבתם p_right = 1 - CDF.NORMAL(z_class, 0, 1), וקיבלתם .97. מהו ערך p הדו־צדדי?
p_right הוא הזנב הימני. 0.97 אומר שהממוצע מתחת לנורמה, והזנב הקטן הוא השמאלי, 0.03. בדו־צדדי מכפילים את הזנב הקטן בשתיים.1.ב־JASP הרצתם Z Test, ובחרתם ב־Alt. Hypothesis את > Test value, כלומר זנב ימני. קיבלתם p = .97. מהו ערך p הדו־צדדי?
2.במבחן z לכיתה, סטיית התקן של הנורמה היא σ = 0.5, וסטיית התקן במדגם היא SD = 0.379. באיזו סטיית תקן משתמש המבחן?
3.באקסל, z נמצא בתא BE5. כתבו נוסחה שנותנת ערך p דו־צדדי. ולמה צריך בה ABS?
=2*(1-NORM.S.DIST(ABS(BE5),TRUE)). הפונקציה NORM.S.DIST עם TRUE מחזירה את השטח משמאל. בזכות ABS תמיד לוקחים את הזנב שמעבר לערך החיובי, ולכן הנוסחה עובדת גם כש־z שלילי. בלי ABS, עם z שלילי, מקבלים מספר גדול מ־1.3.ב־SPSS, ב־Compute Variable, כתבו ביטוי שנותן ערך p דו־צדדי ממשתנה z שכבר חישבתם. ולמה צריך בו ABS?
2 * (1 - CDF.NORMAL(ABS(z), 0, 1)). הפונקציה CDF.NORMAL מחזירה את השטח משמאל. בזכות ABS תמיד לוקחים את הזנב שמעבר לערך החיובי, ולכן הנוסחה עובדת גם כש־z שלילי. בלי ABS, עם z שלילי, מקבלים מספר גדול מ־1.3.ב־JASP, בעמודה מחושבת בקוד R, כתבו ביטוי שנותן ערך p דו־צדדי ממשתנה z שכבר חישבתם. ולמה צריך בו abs?
2 * (1 - pnorm(abs(z))). הפונקציה pnorm מחזירה את השטח משמאל. בזכות abs תמיד לוקחים את הזנב שמעבר לערך החיובי, ולכן הביטוי עובד גם כש־z שלילי. בלי abs, עם z שלילי, מקבלים מספר גדול מ־1. (ולמבחן z על ממוצע יש ב־JASP גם חלון מוכן.)טעויות נפוצות
- השערות על המדגם. "M = 2.30" אינה השערה: את המדגם רואים. ההשערות הן על μ.
- מחלקים בסטיית התקן במקום בטעות התקן. לממוצע של מדגם מחלקים ב־σ / √n, לא ב־σ. ב־σ מחלקים רק כשמדובר בתלמיד אחד (פרק 13).
- שוכחים להכפיל בשתיים בדו־צדדי. הזנב לבדו הוא ערך p חד־צדדי.
- בוחרים חד־צדדי אחרי שרואים את הנתונים. זה מכפיל בפועל את α. את הכיוון קובעים מראש.
- "לא דחינו, ולכן הוכחנו שאין הבדל." לא דוחים זה לא מקבלים. אולי זו טעות מסוג שני.
- "p הוא הסיכוי שהשערת האפס נכונה." ערך p מחושב בהנחה שהיא נכונה.
- "מובהק, ולכן חשוב." ערך p תלוי בגודל המדגם. במדגם ענק גם הבדל זניח מובהק.
- "α = .05, ולכן 5% מהמאמרים שגויים." α הוא הסיכוי לטעות מסוג ראשון כשהשערת האפס נכונה, לא אחוז המאמרים השגויים.
- כותבים p = .000. כותבים p < .001.
- משתמשים ב־
Z.TESTכאילו היא דו־צדדית. היא מחזירה את הזנב הימני בלבד.
בדקו את עצמכם
סיכום
- ההיגיון: מניחים שהשערת האפס נכונה, ושואלים אם הנתונים סבירים בעולם כזה. אם הם נדירים מאוד, דוחים אותה.
- סטטיסטי המבחן z: כמה טעויות תקן ממוצע המדגם רחוק מ־μ0. מבחן z דורש σ ידועה.
- רמת מובהקות α נקבעת מראש וקובעת את אזור הדחייה. ערכים קריטיים ב־α = .05: ±1.96 בדו־צדדי, 1.645 בחד־צדדי.
- ערך p: הסיכוי לתוצאה כזו או קיצונית ממנה, אם השערת האפס נכונה. p ≤ α: דוחים. בדו־צדדי, פעמיים הזנב.
- חד־צדדי רק כשהכיוון נקבע מראש. ברירת המחדל: דו־צדדי.
- טעויות: סוג ראשון, לדחות כשאין הבדל (α). סוג שני, לא לדחות כשיש (β). עוצמה = 1 − β.
- חמשת השלבים: השערות, רמת מובהקות, סטטיסטי, החלטה, מסקנה במילים.
- ערך p לא אומר מה הסיכוי שההשערה נכונה, ולא כמה גדול ההבדל.
מונחים חדשים
שאלות לדוגמה, עם פתרונות
שאלות בסגנון מבחן, מהקלה אל הקשה. נסו לפתור לבד, ורק אז פתחו את הפתרון.
לכל מחקר, כתבו את ההשערות בסמלים, ואת הערך הקריטי ברמת מובהקות .05. א. בנורמה של שאלון הערכה עצמית הממוצע 30. האם ילדים שעולים לכיתה א׳ מגן ממלכתי שונים מהנורמה? ב. בנורמה של זמן שינה בגיל 10, 9.5 שעות. האם ילדים עם טלפון בחדר ישנים פחות? ג. אותה שאלה כמו ב, אבל ברמת מובהקות .01.
בדיקת התשובה
א. H0: μ = 30 H1: μ ≠ 30 → ±1.96 "שונים": דו־צדדיתב. H0: μ ≥ 9.5 H1: μ < 9.5 → −1.645 "ישנים פחות": חד־צדדית שמאליתג. =NORM.S.INV(0.01) → −2.326 1% בזנב השמאליבחד־צדדית השמאלית הערך הקריטי שלילי, ודוחים רק אם z קטן ממנו.
במבחן חשיבה מילולית, הנורמה היא ממוצע 100 וסטיית תקן 15. 49 תלמידים בתוכנית למחוננים קיבלו ממוצע 104.5. האם הם שונים מהנורמה? עברו את חמשת השלבים (α = .05).
בדיקת התשובה
1. H0: μ = 100 H1: μ ≠ 1002. α = .05 → ±1.963. SE = 15 / √49 = 15 / 7 = 2.143, z = (104.5 − 100) / 2.143 = 2.10p = 2 · (1 − NORM.S.DIST(2.10, TRUE)) = 2 · 0.0179 = .0364. 2.10 > 1.96, וגם .036 < .05 → דוחים5. ברמת מובהקות של .05, הציון הממוצע של משתתפי התוכנית גבוה מהנורמה, z = 2.10, p = .036. ההפרש, 4.5 נקודות, הוא פחות משליש סטיית תקן: מובהק, אבל לא גדול.
בשאלון חרדת מבחנים, הנורמה היא ממוצע 50 וסטיית תקן 10. יועצת בנתה סדנה, וקבעה מראש שתבדוק אם הסדנה מורידה את חרדת המבחנים, ברמת מובהקות מחמירה של .01. 64 תלמידים השתתפו, והממוצע שלהם אחרי הסדנה 47.5. א. חשבו את z ואת ערך p. ב. מה ההחלטה? ג. מה היה קורה ברמת מובהקות של .05? ד. היועצת כותבת: "הסדנה לא משפיעה על חרדת מבחנים." מה הבעיה במשפט?
בדיקת התשובה
H0: μ ≥ 50 H1: μ < 50 חד־צדדית שמאליתא. SE = 10 / √64 = 1.25, z = (47.5 − 50) / 1.25 = −2.00, p = NORM.S.DIST(−2, TRUE) = .023ב. α = .01 → ערך קריטי −2.326. −2.00 > −2.326, וגם .023 > .01 → לא דוחיםג. α = .05 → −1.645. −2.00 < −1.645 → דוחיםד. "לא דחינו" אינו "הוכחנו שאין השפעה". הממוצע ירד בפועל, וברמה של .05 הירידה הייתה מובהקת. ייתכן שזו טעות מסוג שני, שהיועצת עצמה הגדילה כשבחרה α מחמיר. ניסוח נכון: "ברמת מובהקות של .01, לא נמצאה ירידה מובהקת בחרדת המבחנים, z = −2.00, p = .023."
מורה הריצה ב־JASP מבחן z לאחת משתי כיתות ד׳ בבית הספר הראשון (
class_id= 1), מול נורמת החרדה של הפרק (μ0 = 2.30, σ = 0.50). קראו את הפלט וענו: א. מה היו ההשערות? ב. בדקו את ערך הסטטיסטי בחישוב ביד. ג. מה ההחלטה והמסקנה? ד. המורה טוענת: "בדיקה ביד עם SD = 0.618 נותנת z אחר." במה היא טועה?One Sample T-Test
Test Statistic p anx_pre Z -1.434 .152 Note. For the Z test, the alternative hypothesis specifies that the mean is different from 2.3.
Descriptives
N Mean SD SE anx_pre 27 2.162 0.618 0.119 בדיקת התשובה
א. לפי ההערה מתחת לטבלה: H0: μ = 2.3, H1: μ ≠ 2.3, דו־צדדית.
ב. SE = 0.50 / √27 = 0.50 / 5.196 = 0.0962z = (2.162 − 2.30) / 0.0962 = −0.138 / 0.0962 = −1.43 ✓ג. p = .152 > .05: לא דוחים. לא נמצא הבדל מובהק בין החרדה בכיתה לבין הנורמה, z = −1.43, p = .152. זה לא אומר שהכיתה "כמו הנורמה", רק שההבדל שנמצא, כ־0.14 נקודה מתחתיה, קטן מכדי לשלול מקרה.
ד. 0.618 היא סטיית התקן של 27 הילדים בכיתה. במבחן z משתמשים ב־σ של האוכלוסייה, 0.50, ולכן טעות התקן היא 0.096 ולא 0.119. מי שמשתמש בסטיית התקן של המדגם עושה בעצם מבחן t (פרק 20).
מנהל רשת בתי ספר בודק 20 שאלונים שונים, כל אחד מול הנורמה שלו, ברמת מובהקות .05. נניח שבאמת בתלמידים שלו אין שום הבדל מאף נורמה. א. בכמה שאלונים, בממוצע, ייצא הבדל מובהק? איזו טעות זו? ב. מה הסיכוי שלפחות שאלון אחד ייצא מובהק? ג. המנהל מפרסם רק את השאלון שיצא מובהק. מה הבעיה?
בדיקת התשובה
א. 20 · 0.05 = 1 שאלון, בממוצע כל אחד מהם טעות מסוג ראשוןב. 1 − (1 − .05)20 = 1 − .9520 = 1 − .358 = .64ג. בסיכוי של כמעט שני שלישים, לפחות שאלון אחד ייצא מובהק גם כשאין שום הבדל. מי שמפרסם רק אותו, מבלי לספר על 19 האחרים, מציג אזעקת שווא כאילו הייתה ממצא. זו המגירה מסעיף 8, בתוך מחקר אחד. הפתרון: לדווח את כל הבדיקות, ולהחמיר את α כשבודקים הרבה (פרק 26).
בנורמת החרדה של הפרק (μ0 = 2.30, σ = 0.50), בודקים כיתות של 25 ילדים, דו־צדדי, ברמת מובהקות .05. א. מאילו ממוצעי כיתה דוחים את השערת האפס? ב. כיתה קיבלה ממוצע 2.45. בלי לחשב את ערך p, האם דוחים? ואחר כך חשבו אותו. ג. בכמה ילדים לפחות צריכה להיות כיתה, כדי שממוצע של 2.45 יוביל לדחייה?
בדיקת התשובה
א. SE = 0.50 / √25 = 0.10, 2.30 ± 1.96 · 0.10 → מתחת ל־2.104 או מעל 2.496ב. 2.45 < 2.496 → לא דוחים. z = 0.15 / 0.10 = 1.50, p = 2 · (1 − NORM.S.DIST(1.5, TRUE)) = .134ג. 0.15 / (0.50 / √n) ≥ 1.96 → √n ≥ 1.96 · 0.50 / 0.15 = 6.53 → n ≥ 42.7 → 43 ילדיםאותו ממוצע, 2.45, לא מובהק בכיתה של 25 ומובהק בכיתה של 43. ההבדל מהנורמה לא השתנה, רק הדיוק של המדידה. חישובים כאלה, של גודל המדגם הדרוש, הם הנושא של פרק 19.
תרגול עם הנתונים
פתחו את קובץ המחקר ואת מילון המשתנים. בכל השאלות: anx_pre (עמודה AI), מול נורמת החרדה של הפרק, μ0 = 2.30, σ = 0.50, דו־צדדי, ברמת מובהקות .05.
הקבצים עצמם נמצאים גם בתיקיית data בחבילת הספר.
- כיתה ד׳ בבית הספר השני (
class_id= 4, שורות 76 עד 104): האם החרדה בה שונה מהנורמה?בדיקת התשובה
n = 29, M = 2.3196. SE = 0.50 / √29 = 0.0928, z = 0.0196 / 0.0928 = 0.21, p = .833. לא דוחים: הכיתה קרובה מאוד לנורמה. באקסל:
=2*MIN(Z.TEST(AI76:AI104,2.3,0.5),1-Z.TEST(AI76:AI104,2.3,0.5)). - בדקו בנפרד את הבנים (
gender= 1) ואת הבנות (gender= 2) מול הנורמה. מה מצאתם?בדיקת התשובה
בנים: n = 96, M = 2.0666, z = −4.57, p < .001. החרדה של הבנים נמוכה באופן מובהק מהנורמה. בנות: n = 104, M = 2.3917, z = 1.87, p = .062. לא מובהק. שימו לב: מכאן עוד אי אפשר להסיק שבנות חרדות יותר מבנים. זו השוואה בין שתי קבוצות, ולה יש מבחן משלה (פרק 21, ושם ההבדל אכן מובהק).
- חשבו z ו־p לכל אחת משמונה הכיתות. אילו כיתות שונות מהנורמה באופן מובהק? ומה הסיכוי שלפחות כיתה אחת תצא מובהקת, אילו באף כיתה לא היה הבדל אמיתי?
בדיקת התשובה
רק שתי כיתות: כיתה 3 (z = 2.36, p = .018) וכיתה 5 (z = −3.03, p = .002). כיתה 6 קרובה מאוד לגבול (z = −1.93, p = .053), וכיתה 2 נמצאת בדיוק על הנורמה (M = 2.30, z = 0, p = 1). עם שמונה בדיקות, הסיכוי לפחות לאזעקת שווא אחת הוא 1 − .958 = .34. כיתה 5, עם p = .002, מעוררת פחות ספק מכיתה 3.
- בדקו את כל 200 התלמידים יחד. מה מחזירה
=Z.TEST(AI2:AI201, 2.3, 0.5), ואיך מגיעים ממנה לערך p הדו־צדדי?מה z, ומה ערך p הדו־צדדי? ומה היה ערך p בבדיקה חד־צדדית שמאלית?בדיקת התשובה
הפונקציה מחזירה 0.9657: השטח מימין ל־z. הממוצע מתחת לנורמה, ולכן הזנב הימני כמעט כל העקומה. הזנב הקטן הוא 1 − 0.9657 = 0.0343, ופעמיים זה 0.0686. z = −1.82, p = .069. לא דוחים. זו הדוגמה של סעיף 5: בחד־צדדי שמאלי, שנקבע מראש, ערך p היה .034.
בפרק הבא: עוצמה ורווח סמךConfidence interval. בפרק הזה שאלנו אם לדחות את השערת האפס. בפרק הבא נשאל מה הסיכוי שהמבחן יגלה הבדל שבאמת קיים, כמה נבדקים צריך כדי שהסיכוי הזה יהיה גבוה, ואיך אומדיםEstimator את μ בטווח של ערכים, ולא רק בודקים ערך אחד. ונכיר את גודל האפקטEffect size, שעונה על השאלה שערך p לא עונה עליה: כמה גדול ההבדל.
מקורות: Fisher, R. A. (1925). Statistical methods for research workers. Oliver & Boyd. · Neyman, J., & Pearson, E. S. (1933). On the problem of the most efficient tests of statistical hypotheses. Philosophical Transactions of the Royal Society of London, Series A, 231, 289–337. · Rosnow, R. L., & Rosenthal, R. (1989). Statistical procedures and the justification of knowledge in psychological science. American Psychologist, 44(10), 1276–1284. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y · Wasserstein, R. L., & Lazar, N. A. (2016). The ASA statement on p-values: Context, process, and purpose. The American Statistician, 70(2), 129–133.