חלק ג: מהמדגם לאוכלוסייה · פרק 20
מבחן t למדגם בודד
בפרק 18 בדקנו השערות עם מבחן zz test, והנחנו שאנחנו יודעים את סטיית התקן של האוכלוסייה. בחיים האמיתיים כמעט אף פעם לא יודעים אותה. בפרק הזה נלמד מה עושים במצב הזה: אומדיםEstimator אותה מהמדגם, ומשלמים על כך מחיר קטן. המחיר הזה נקרא התפלגות tt distribution.
האם התלמידים במחקר קשובים יותר מ"לפעמים"?
בשאלון הקשיבות התלמידים ענו על כל משפט בסולם של 1 (אף פעם) עד 5 (תמיד). אמצע הסולם הוא 3, "לפעמים". הממוצע של 200 התלמידים לפני התוכנית הוא 3.20. זה מעל 3, אבל אולי רק במקרה? אין לנו סטיית תקן של "כל התלמידים בישראל", רק את המדגם. בסוף הפרק תדעו לענות, ביד ובתוכנה, ותדעו גם כמה גדול ההבדל.
בסוף הפרק תוכלו
- להסביר מתי משתמשים במבחן t ולא במבחן z, ולמה התפלגות t רחבה יותר מהנורמלית.
- לחשב ביד את סטטיסטי , את דרגות החופשDegrees of freedom , את הערך הקריטי ואת ערך , בהשערה דו־צדדיתTwo-tailed hypothesis / test וחד־צדדית.
- לבנות רווח סמךConfidence interval לממוצע עם t, ולחשב את של כהן למדגם בודד.
- להריץ את המבחן באקסל (בנוסחאות), ב־SPSS וב־JASP, לקרוא את הפלט ולדווח בסגנון APA.
למה t ולא z?
במבחן z מחלקים בטעות התקןStandard error σ / √n, ולכן צריך לדעת את σ. כמעט אף פעם לא יודעים אותה. אז אומדים אותה בעזרת של המדגם: t = (M − μ0) / (SD / √n). אותה נוסחה, אבל האומדןEstimate מוסיף אי־ודאות, ולכן הסטטיסטי מתפלג לפי התפלגות t ולא לפי הנורמלית.
נזכיר את מבחן z מפרק 18. רצינו לדעת אם ממוצע המדגם רחוק מדי מהערך שהשערת האפסNull hypothesis צופה, 0. מדדנו את המרחק ביחידות של טעות התקןStandard error (פרק 17):
כדי לחשב את המכנה צריך את σ, סטיית התקן של כל האוכלוסייה. מתי יודעים אותה? כמעט רק במבחנים מתוקננים, שנבדקו על מיליוני אנשים. במבחן אינטליגנציה, למשל, הממוצע 100 וסטיית התקן 15. אבל מה סטיית התקן של הקשיבות של כל ילדי כיתות ד׳ ו־ה׳ בישראל? אף אחד לא יודע.
אז מה יש לנו ביד? את נתוני המדגם. ובפרק 11 ראינו שסטיית התקן של המדגם, עם n − 1 במכנה, היא בדיוק אומדןEstimate של σ. לכן מחליפים את σ ב־SD, וטעות התקן הופכת ל:
זה כל ההבדל בנוסחה. אבל יש לו מחיר. σ היא מספר קבוע. SD, לעומת זאת, משתנה ממדגם למדגם, בדיוק כמו הממוצע. נניח שסטיית התקן באוכלוסייה היא 15. במדגם אחד נקבל 14, באחר 16, באחר 17, ובאחר 13. כלומר, עכשיו יש שני מקורות של מקריות: גם המונה, הממוצע, משתנה, וגם המכנה, סטיית התקן. יותר מקריות פירושה יותר ערכים קיצונייםOutlier. ולכן הסטטיסטי כבר לא מתפלג נורמלית, אלא לפי התפלגות t, שהיא רחבה קצת יותר.
שלוש שאלות שכדאי לשאול לפני שבוחרים:
| מבחן z למדגם בודד (פרק 18) | מבחן t למדגם בודד | |
|---|---|---|
| סטיית התקן באוכלוסייה | ידועה | לא ידועה, אומדים אותה מהמדגם |
| במכנה | σ / √n | SD / √n |
| ההתפלגות של הסטטיסטי | נורמלית סטנדרטית | התפלגות t, עם n − 1 דרגות חופש |
| ערך קריטי (דו־צדדי, .05) | תמיד 1.96 | תלוי בגודל המדגם. למשל 2.06 עם 27 נבדקים |
| כמה נפוץ במחקר | נדיר מאוד | נפוץ יותר, אבל גם הוא לא שכיח (סעיף 6) |
ומה צריך כן לדעת? את μ0, הערך שמשווים אליו. הוא נקרא ערך הבדיקהTest value, ונראה בסעיף 6 מאיפה הוא מגיע.
דמיינו מדגם קטן שבמקרה יצא עם תלמידים דומים מאוד זה לזה. סטיית התקן שלו קטנה מדי ביחס לאמת. מה קורה ל־t? המכנה קטן, ו־t מתנפח. זה יכול לקרות גם כשהשערת האפס נכונה לגמרי. במבחן z זה לא קורה, כי המכנה קבוע.
במדגם גדול האומדן של σ מדויק: אם לקחתם כמעט את כל האוכלוסייה, סטיית התקן של המדגם כמעט זהה לאמיתית. במדגם קטן אי אפשר לדעת אם במקרה לקחתם דווקא אנשים דומים. לכן ההבדל בין t ל־z גדול במדגמים קטנים, וכמעט נעלם במדגמים גדולים.
ולמה זה חשוב? אילו השתמשנו בטבלה הנורמלית גם כשאומדים את σ, היינו דוחים את השערת האפס יותר מדי פעמים. רמת המובהקותSignificance level "האמיתית" שלנו הייתה גבוהה מ־.05, בלי שנדע.
בדקו את עצמכם3 שאלות
1.במבחן t למדגם בודדOne-sample t test, מה בא במקום σ שבנוסחה של מבחן z?
2.באיזה מהמצבים הבאים מתאים מבחן z, ולא מבחן t?
3.36 תלמידים, ממוצע 52, סטיית תקן 9. ערך הבדיקהTest value 50. חשבו את טעות התקן ואת t.
התפלגות t ודרגות חופש
התפלגות t סימטרית ופעמונית סביב 0, כמו הנורמלית הסטנדרטית, אבל עם זנבות עבים יותר. הצורה שלה תלויה בדרגות החופש, ובמבחן למדגם בודד df = n − 1. ככל שיש יותר דרגות חופש, היא קרובה יותר לנורמלית, והערך הקריטי יורד לכיוון 1.96.
התפלגות t היא לא התפלגות אחת, אלא משפחה של התפלגויות. לכל מספר של דרגות חופש יש עקומה משלה. כולן סימטריות סביב 0, כולן בצורת פעמון, אבל לכולן יש יותר "מקום" בזנבות מאשר לנורמלית. כלומר, ערכים קיצוניים סבירים בהן יותר.
מה זה דרגות חופש?
בפרק 11 ראינו למה מחלקים ב־n − 1 כשמחשבים סטיית תקן. נחזור על הרעיון בדוגמה קטנה. חמישה תלמידים, והממוצע שלהם ידוע. כל אחד אומר בכמה הוא רחוק מהממוצע. סכום המרחקים מהממוצע הוא תמיד 0. ארבעה אמרו: +2, −1, +2, −6. הסכום שלהם −3. החמישי כבר לא חופשי: הוא חייב לומר +3.
כלומר, אחרי שחישבנו את הממוצע מהנתונים, רק ארבעה מתוך חמשת הערכים חופשיים להשתנות. זה "המחיר" ששילמנו על האומדן. עם n נבדקים יש n − 1 דרגות חופש. בפרק 21 נראה שבשתי קבוצות משלמים שתיים, ובהמשך הספר נפגוש דרגות חופש בכל מבחן.
ערכים קריטיים של tCritical t value
הנה הערך הקריטי הדו־צדדי ברמת מובהקותSignificance level .05, לפי דרגות החופש:
| דרגות חופש | 5 | 10 | 20 | 30 | 60 | 120 | אינסוף (z) |
|---|---|---|---|---|---|---|---|
| ערך קריטי | 2.571 | 2.228 | 2.086 | 2.042 | 2.000 | 1.980 | 1.960 |
במדגם קטן צריך ממוצע רחוק יותר מ־μ0 כדי לדחות. ההיגיון: האומדן של סטיית התקן פחות מדויק, ולכן דורשים ראיות חזקות יותר. ומעל 120 דרגות חופש, בערך, אין כמעט הבדל בין t ל־z.
בקבוצה קטנה של 10 תלמידים, ממוצע הקשיבות 3.6, וסטיית התקן 0.9. האם הממוצע שונה מ־3? ( = .05, דו־צדדי)
מה היה קורה אילו טעינו והשתמשנו בטבלה הנורמלית? הערך הקריטי היה 1.96, ו־2.11 גדול ממנו. היינו דוחים, עם p = .035. אותם נתונים בדיוק, ומסקנה הפוכה. בעשרה נבדקים, ההבדל בין t ל־z ממש משנה.
לנורמלית הסטנדרטית יש ממוצע 0 וסטיית תקן 1. גם להתפלגות t יש ממוצע 0, אבל סטיית התקן שלה גדולה מ־1:
עם 5 דרגות חופש: √(5/3) = 1.29. עם 30: √(30/28) = 1.04. עם 120: 1.008. כשדרגות החופש גדלות, השבר מתקרב ל־1, והתפלגות t הופכת לנורמלית. (הנוסחה נכונה מ־3 דרגות חופש ומעלה. עם 1 או 2 הזנבות עבים כל כך, שאין לה סטיית תקן סופית בכלל.)
את ההתפלגות גילה ב־1908 כימאי במבשלת גינס, שפרסם בשם בדוי, Student. את הסיפור שלו נספר בפרק 21. ועוד הערה היסטורית: לפני המחשבים, כל ספר סטטיסטיקה כלל טבלה של ערכים קריטיים של t, כמו הטבלה למעלה, אבל עם הרבה שורות. היום התוכנה נותנת ערך p מדויקExact p-value, והטבלה נשארה בעיקר כדי להבין את הרעיון.
מעבדה: התפלגות t מול הנורמלית
- קבעו דרגת חופש אחת. איפה ההבדל בין שתי העקומות גדול במיוחד: במרכז או בזנבות? מה הערך הקריטי?
- הזיזו את המחוון לאט עד 60. מאיזה מספר של דרגות חופש הערך הקריטי כבר קטן מ־2.1? ומ־2.05?
- בכיתה 1 של המחקר יש 27 תלמידים. כמה דרגות חופש? מה הערך הקריטי?
בדיקת התשובה
1. עם דרגת חופש אחת העקומה של t נמוכה יותר במרכז, והזנבות שלה גבוהים בהרבה. הערך הקריטי עצום: 12.706. 2. מ־19 דרגות חופש הוא 2.093, ומ־28 הוא 2.048. משם והלאה הוא יורד לאט מאוד, וההבדל מ־1.96 נעשה קטן. 3. 27 − 1 = 26 דרגות חופש, וערך קריטיCritical value 2.056.
בדקו את עצמכם3 שאלות
1.כמה דרגות חופש יש במבחן t למדגם בודד עם 18 נבדקים?
2.עם 1,000 דרגות חופש, מה הערך הקריטי הדו־צדדי של t, ברמת .05, בערך?
3.הסבירו במילים שלכם: למה במדגם קטן צריך t גדול יותר כדי לדחות את השערת האפסNull hypothesis?
המבחן, שלב אחר שלב
אותם חמישה שלבים כמו במבחן z: השערות על μ, רמת מובהקותSignificance level, סטטיסטי המבחןTest statistic, החלטה ומסקנה. רק שני הבדלים: במכנה SD במקום σ, והערך הקריטי וערך pp-value באים מהתפלגות t עם n − 1 דרגות חופש.
אם הבנתם את מבחן z בפרק 18, אתם כבר יודעים כמעט הכול. הנה חמשת השלבים, וההבדלים מודגשים:
- השערות. בדיוק כמו במבחן z: H0: μ = μ0 מול H1: μ ≠ μ0 (דו־צדדית), או עם כיוון (חד־צדדית). ההשערות הן תמיד על האוכלוסייה.
- רמת מובהקות ודרגות חופש. בדרך כלל α = .05. df = n − 1, והערך הקריטי בא מהתפלגות t.
- סטטיסטי המבחןTest statistic. t = (M − μ0) / (SD / √n). את SD מחשבים מהמדגם, עם n − 1.
- החלטה. לפי הערך הקריטי: אם |t| גדול ממנו, דוחים. או לפי ערך pp-value: אם p ≤ α, דוחים. שתי הדרכים תמיד מסכימות.
- מסקנה. משפט במילים, בהקשר של השאלה, עם הכיוון.
בכיתה 1 (כיתה ד׳ בבית הספר של קבוצת הביקורת) יש 27 תלמידים. ממוצע הקשיבות שלהם לפני התוכנית (mind_pre) הוא 3.2928, וסטיית התקן 0.5591. האם הם קשובים יותר, או פחות, מ"לפעמים"? (α = .05, דו־צדדי)
5. מסקנה: ממוצע הקשיבות בכיתה 1 גבוה באופן מובהק מאמצע הסולם. התלמידים בכיתה הזו מדווחים, בממוצע, על קשיבות גבוהה מ"לפעמים". המדגם רחוק מ־3 כמעט שלוש טעויות תקן.
איפה מוצאים את ערך p ואת הערך הקריטי?
כשמריצים את המבחן בתוכנה, ערך p מופיע בפלט (בקטע "בתוכנה" בהמשך). כשמחשבים t ביד, צריך עוד צעד אחד:
- באקסל: ערך p דו־צדדי:
=T.DIST.2T(ABS(t), df). הפונקציה מחזירה שגיאה אם t שלילי, ולכן תמיד עוטפים ב־ABS. חד־צדדי ימני (H1: μ > μ0):=T.DIST.RT(t, df). חד־צדדי שמאלי:=T.DIST(t, df, TRUE). ערך קריטי דו־צדדי:=T.INV.2T(0.05, df). בדוגמה:=T.DIST.2T(2.72, 26)נותן 0.011, ו־=T.INV.2T(0.05, 26)נותן 2.056. - ב־SPSS: ב־Transform > Compute Variable אפשר לחשב ערך p דו־צדדי לכל t:
2 * (1 - CDF.T(ABS(2.72), 26))נותן .011. ערך קריטי דו־צדדי:IDF.T(0.975, 26)נותן 2.056. התוצאה נכנסת כעמודה חדשה בקובץ. - ב־JASP: אין נוסחה, אבל במודול Distributions (כמו בפרק 18) אפשר לבחור את התפלגות t, להקליד את דרגות החופש, ולקבל את השטח מעבר ל־t. דרך פשוטה יותר: המעבדה שבסוף הסעיף. מכניסים את הממוצע, את סטיית התקן ואת גודל המדגם, ומקבלים t, ערך קריטי וערך p.
באותו בית ספר, בכיתה 2, יש 25 תלמידים. ממוצע הקשיבות 3.0640, וסטיית התקן 0.5482.
מסקנה: לא נמצא הבדל מובהק בין ממוצע הקשיבות בכיתה 2 לבין אמצע הסולם. שימו לב לניסוח. לא כתבנו "התלמידים בכיתה 2 קשובים בדיוק 'לפעמים'". לא דחינו את השערת האפס, אבל גם לא הוכחנו אותה. כמו בבית משפט: "לא אשם" זה לא "חף מפשע". אולי יש הבדל קטן, והמדגם קטן מכדי לגלות אותו (פרק 19).
| כיתה 1 | כיתה 2 | |
|---|---|---|
| n | 27 | 25 |
| M | 3.29 | 3.06 |
| SD | 0.56 | 0.55 |
| t (df) | 2.72 (26) | 0.58 (24) |
| p | .011 | .565 |
סטיות התקן בשתי הכיתות כמעט זהות, וגם גודל הכיתות. מה שמבדיל ביניהן הוא המרחק של הממוצע מ־3.
השערה חד־צדדיתOne-tailed hypothesis / test
לפעמים יש לחוקרים כיוון צפוי, ויש להם סיבה טובה לקבוע אותו מראש. למשל, מורה מאמינה שתוכנית קריאה חדשה מעלה את הציונים. אז ההשערה היא H1: μ > μ0, וכל אזור הדחייהRejection region נמצא בזנב אחד. הסטטיסטי tt statistic מחושב בדיוק אותו דבר. רק הערך הקריטי וערך p משתנים. ובתנאי אחד: ש־t יצא בכיוון שצפיתם.
הנורמה הארצית במבחן קריאה היא 70. בכיתה שלמדה בתוכנית חדשה, 16 תלמידים, ממוצע 73.5 וסטיית תקן 7. המורה קבעה מראש: התוכנית משפרת. (α = .05)
אותם נתונים, ושתי מסקנות. לכן הכלל חשוב כל כך: את הכיוון קובעים לפני שרואים את הנתונים, לפי שאלת המחקר. מי שבוחר חד־צדדי רק אחרי שראה ש"זה עוזר", בעצם מכפיל את α. רוב כתבי העת מצפים לדיווח דו־צדדי, גם כשההשערה עם כיוון.
שמונה מורות דירגו כמה הן מרגישות שחוקות, בסולם של 1 עד 7. הציונים: 5, 6, 4, 5, 7, 5, 6, 4. אמצע הסולם הוא 4. האם המורות שחוקות יותר, או פחות, מאמצע הסולם? (α = .05, דו־צדדי)
בדיקת התשובה
3.42 גדול מ־2.365, ו־p קטן מ־.05: דוחים. המורות מדווחות על שחיקה גבוהה מאמצע הסולם. אבל זהירות: שמונה מורות, שלא נבחרו באקראי, הן לא "המורות בישראל".
מעבדה: מבחן t למדגם בודד
- בחרו "כיתה 1". בדקו שהמעבדה נותנת את מה שחישבנו ביד. עכשיו הקטינו את המדגם ל־10 תלמידים, עם אותם ממוצע וסטיית תקן. מה השתנה?
- בחרו "כיתה 2". עד כמה צריך להגדיל את המדגם, עם אותם ממוצע וסטיית תקן, כדי שההבדל יהיה מובהק?
- בחרו "כיתה 1" ועברו להשערה שמאלית (H1: μ < 3). מה קרה לערך p, ולמה?
בדיקת התשובה
1. עם 27 תלמידים: t = 2.72, p = .011. עם 10: טעות התקן גדלה ל־0.177, t יורד ל־1.66, הערך הקריטי עולה ל־2.262, ו־p = .132. לא דוחים. אותו הבדל, פחות ראיות. 2. בערך 285 תלמידים. ההבדל קטן מאוד, 0.06, ולכן צריך מדגם ענק. וגם אז הוא יישאר הבדל קטן. 3. ערך p קפץ לכמעט 1 (.994). השערה שמאלית מחפשת ממוצע נמוך מ־3, והממוצע דווקא גבוה. זו הסיבה שבוחרים כיוון מראש: אם הכיוון שגוי, המבחן לא יכול לגלות את ההבדל.
בדקו את עצמכם4 שאלות
1.9 תלמידים, ממוצע 14, סטיית תקן 3. האם הממוצע שונה מ־12? (α = .05, דו־צדדי. הערך הקריטי עם 8 דרגות חופש: 2.306)
2.חוקר קבע מראש H1: μ > μ0, וקיבל t(15) = −2.50. מה ההחלטה ברמת .05?
3.במבחן t דו־צדדי יצא p = .08, והממוצע יצא בכיוון שהחוקרת צפתה. אילו היא הייתה קובעת השערה חד־צדדית מראש, מה היה ערך p?
4.מבחן t מול 4 יצא לא מובהק, p = .31. סטודנט כתב: "הוכחנו שממוצע האוכלוסייה הוא 4". מה לא בסדר, ואיך לכתוב נכון?
רווח סמך עם tt confidence interval
כמו בפרק 19, רק עם SD במקום σ, ועם ערך קריטי של tCritical t value במקום 1.96: M ± tcrit · SD / √n. אם ערך הבדיקה מחוץ לרווח הסמך של 95%, המבחן הדו־צדדי ברמת .05 דוחה. אם הוא בפנים, לא דוחה.
בפרק 19 בנינו רווח סמך לממוצע כש־σ ידועה: הממוצע, ועוד ופחות 1.96 טעויות תקן. כש־σ לא ידועה, מחליפים שני דברים: את σ ב־SD, ואת 1.96 בערך הקריטי של t, עם n − 1 דרגות חופש.
רווח הסמך של כיתה 1 לא כולל את 3: כל הערכים שבו גבוהים מ־3. ובמבחן דחינו. רווח הסמך של כיתה 2 כולל את 3, ובמבחן לא דחינו. זה לא מקרה. זה אותו מידע, משתי זוויות.
מבחן ורווח סמך: שני צדדים של אותו מטבע
המבחן שואל: אם הממוצע באוכלוסייה הוא 3, האם המדגם שלנו מפתיע? רווח הסמך שואל שאלה אחרת: אילו ערכים של ממוצע האוכלוסייה מתיישבים עם המדגם שלנו? המבחן מתחיל מ־μ0 והולך לממוצע. רווח הסמך מתחיל מהממוצע והולך החוצה. הכלל:
- ערך הבדיקה מחוץ לרווח הסמך של 95%: המבחן הדו־צדדי, ברמת .05, דוחה.
- ערך הבדיקה בתוך רווח הסמך: המבחן לא דוחה.
אבל רווח הסמך נותן יותר. בכיתה 2 הוא אומר לא רק "לא מובהק", אלא גם שהממוצע האמיתי יכול להיות בין 2.84 ל־3.29: קצת מתחת ל"לפעמים" או קצת מעליו. ובכיתה 1 הוא אומר שהממוצע האמיתי גבוה מ־3, אבל אולי רק ב־0.07. לכן יש היום חוקרים רבים שמעדיפים לדווח רווחי סמך, ולא רק ערך p.
רווח הסמך של ההפרש
SPSS ו־JASP מדפיסים רווח סמך להפרש בין הממוצע לערך הבדיקה, ולא לממוצע עצמו. זה אותו רווח, רק מוזז: מחסירים את ערך הבדיקה משני הקצוות. בכיתה 1, [3.07, 3.51] לממוצע הופך ל־[0.07, 0.51] להפרש. והכלל משתנה בהתאם: אם רווח הסמך של ההפרש לא כולל אפס, דוחים.
במדגם של 9 נבדקים הממוצע 30, וסטיית התקן 6. הערך הקריטי, עם 8 דרגות חופש, הוא 2.306. א. מהו רווח הסמך של 95% לממוצע? ב. בלי לחשב t: האם מבחן דו־צדדי ברמת .05 ידחה את H0: μ = 26? ואת H0: μ = 35?
בדיקת התשובה
ב. 26 בתוך הרווח: לא דוחים. 35 מחוץ לרווח: דוחים. ומי שהשתמש ב־1.96 קיבל רווח צר מדי, [26.08, 33.92].
באקסל יש פונקציה שנותנת ישר את חצי הרוחב של רווח הסמך: =CONFIDENCE.T(0.05, SD, n). בכיתה 1: =CONFIDENCE.T(0.05, 0.5591, 27) נותן 0.2212. הארגומנט הראשון הוא α, לא רמת הביטחוןConfidence level. לרווח של 99% כותבים 0.01. ושימו לב לא לבלבל עם CONFIDENCE.NORM מפרק 19, שמשתמשת ב־1.96.
בכיתה 1, אילו היינו משתמשים ב־1.96, חצי הרוחב היה 1.96 · 0.1076 = 0.211 במקום 0.221. ההבדל קטן, כי 26 דרגות חופש הן כבר לא מעט. אבל בקבוצה של 10 תלמידים, 2.262 במקום 1.96 מרחיב את הרווח ב־15%. זה המחיר על האומדן של σ: פחות ודאות, רווח רחב יותר.
ועוד הערה על הפירוש. "רווח סמך של 95%" לא אומר שיש סיכוי של 95% שהממוצע האמיתי נמצא ברווח הזה. הממוצע האמיתי הוא מספר קבוע: הוא בפנים או לא. הפירוש הנכון הוא על השיטה: אילו חזרנו על המחקר הרבה פעמים, ובכל פעם בנינו רווח באותה דרך, כ־95% מהרווחים היו כוללים את הממוצע האמיתי. ראינו את זה בפרק 19.
בדקו את עצמכם3 שאלות
1.16 תלמידים, ממוצע 20, סטיית תקן 4. מהו רווח הסמך של 95% לממוצע? (הערך הקריטי עם 15 דרגות חופש: 2.131)
2.בפלט של מבחן t מול ערך בדיקה 4: Mean Difference = 0.15, ו־95% CI להפרש [−0.10, 0.40]. מה נכון?
3.רווח הסמך של 95% לממוצע לא כולל את ערך הבדיקה. האם רווח הסמך של 99% בטוח לא יכלול אותו? הסבירו.
כמה גדול ההבדל? d למדגם בודד
d = (M − μ0) / SD: ההבדל ביחידות של סטיית תקן. ב־t מחלקים בטעות התקן, וב־d בסטיית התקן, ולכן t = d · √n. אותו d נותן t גדול יותר במדגם גדול. בערך: 0.2 קטן, 0.5 בינוני, 0.8 גדול.
ערך p עונה על שאלה אחת: האם סביר שההבדל נוצר במקרה. הוא לא אומר כמה ההבדל גדול. בפרק 19 הכרנו את גודל האפקטEffect size, והנה הגרסה שלו למבחן t למדגם בודד: d של כהןCohen's d.
בכיתה 1: d = (3.2928 − 3) / 0.5591 = 0.52. הממוצע של הכיתה גבוה מאמצע הסולם בחצי סטיית תקן בערך. אפקט בינוני. בכיתה 2: d = 0.0640 / 0.5482 = 0.12. אפקט זניח.
שימו לב לקשר בין t ל־d. ב־t מחלקים בטעות התקן, SD / √n. ב־d מחלקים בסטיית התקן עצמה. לכן:
מה זה אומר? אותו אפקט בדיוק נותן t גדול יותר, ו־p קטן יותר, כשהמדגם גדל. הנה אפקט בינוני, d = 0.50, בשלושה גדלי מדגם:
| n | d | t | p (דו־צדדי) |
|---|---|---|---|
| 10 | 0.50 | 1.58 | .148 |
| 27 | 0.50 | 2.60 | .015 |
| 100 | 0.50 | 5.00 | < .001 |
ההבדל לא השתנה, רק גודל המדגם. עם 10 תלמידים הוא לא מובהק, ועם 100 הוא מובהק מאוד. וזה עובד גם הפוך: במדגם ענק גם הבדל זניח יוצא מובהק. לכן מדווחים תמיד את שניהם: ערך p, וגודל אפקט.
הסימנים של כהן (0.2 קטן, 0.5 בינוני, 0.8 גדול) הם סימני דרך ולא חוק. השאלה החשובה היא אם ההבדל משמעותי בהקשר: האם חצי נקודה בסולם של 1 עד 5 חשובה לבית הספר? על זה הסטטיסטיקה לא עונה לבד.
d שמחושב ממדגם נוטה להיות קצת גדול מדי, במיוחד במדגמים קטנים. לכן יש לו גרסה מתוקנת, g של הדג׳ס (Hedges' g), שמכווצת אותו מעט. בכיתה 1, 0.52 הופך ל־0.51. עם 200 תלמידים ההבדל כבר זניח. SPSS מציג את שניהם, בטבלת One-Sample Effect Sizes.JASP מציג את d.באקסל מחשבים אותם בנוסחה.
וגם ל־d יש רווח סמך. בכיתה 1 הוא בין 0.12 ל־0.92: האפקט יכול להיות קטן מאוד, ויכול להיות גדול. 27 תלמידים לא מספיקים כדי לדעת. כשמשווים בין מחקרים, רווח הסמך של d חשוב לפעמים יותר מ־d עצמו.
בדקו את עצמכם3 שאלות
1.במחקר עם 100 תלמידים: ממוצע 82, ערך בדיקה 80, סטיית תקן 10. מהם d ו־t?
2.דווח t(35) = 3.00. מהו d?
3.מחקר עם 5,000 תלמידים מצא שהממוצע שונה מאמצע הסולם, p < .001, עם d = 0.05. מה הייתם אומרים על התוצאה?
הנחות המבחן, ומאיפה בא ערך הבדיקה
שלוש הנחות: אי־תלות בין הנבדקים, סולם רווחInterval scale או מנה, ונורמליות של האוכלוסייה, או מדגם גדול (30 ומעלה). וערך הבדיקה צריך להיות קבוע מראש ובעל משמעות: אמצע הסולם, נורמה מפורסמת, המלצה או תקן. לא ערך שחושב מאותם נתונים.
מאיפה בא ערך הבדיקה?
מבחן t למדגם בודד הוא לא מבחן נפוץ במחקר. כדי לשאול "האם המדגם שלי שונה מהאוכלוסייה?", צריך לדעת משהו על האוכלוסייה, ובדרך כלל אין לנו את זה. מאיפה נדע את רמת החרדה הממוצעת של כל הילדים בישראל? לכן הוא נלמד בעיקר כנקודת מוצא למבחנים של פרק 21. ובכל זאת, יש מצבים שבהם הוא בדיוק מה שצריך:
- אמצע הסולם. בסולם של 1 עד 7 אמצע הסולם הוא (1 + 7) / 2 = 4. אם הממוצע מתחת ל־4 באופן מובהק, אפשר לומר שהנבדקים "לא חרדים" במיוחד. אם מעל, "חרדים". בשאלון הקשיבות שלנו, 1 עד 5, האמצע הוא 3, וגם יש לו שם: "לפעמים".
- נורמה מפורסמת. מבחן מתוקנן עם ממוצע ארצי ידוע, כמו מבחן קריאה עם נורמה של 70.
- המלצה או תקן. 7 שעות שינה, 20 דקות קריאה ביום, המשקל שהיצרן הצהיר עליו.
- ערך שנקבע בתיאוריה. למשל, ניחוש אקראי במבחן אמריקאי עם ארבע תשובות הוא 25% הצלחה.
מה לא? ערך שנבחר אחרי שראיתם את הנתונים, או הממוצע של אותו מדגם. אם הממוצע הוא 3.20 ותבדקו מול 3.19, כמובן שלא תדחו. ואם תחפשו ערך שדווקא כן "יוצא מובהק", גם תמצאו. ערך הבדיקה חייב להגיע מבחוץ.
ההנחות
| הנחה | מה היא אומרת | אם היא לא מתקיימת |
|---|---|---|
| אי־תלות בין הנבדקים | הציון של נבדק אחד לא משפיע על של אחר. בודקים לפי מערך המחקר | המבחן לא מתאים. למשל, אותם אנשים פעמיים: מבחן מזווג (פרק 21) |
| סולם רווח או מנהInterval scale | יש משמעות לממוצע ולסטיית התקן (פרק 6) | פריט בודד בסולם סדר: מבחן א־פרמטרי (פרק 22)Ordinal scale · Nonparametric test |
| נורמליות | הציונים באוכלוסייה מתפלגים נורמלית. בודקים בהיסטוגרמה, בהטיה (פרק 12), בתרשים Q-Q (פרק 14), ובמבחן Shapiro-Wilk | מ־30 נבדקים ומעלה, לא נורא. במדגם קטן ומוטה: מבחן א־פרמטרי (פרק 22) |
למה 30 נבדקים "מצילים" את הנורמליות? כי מה שהמבחן באמת צריך הוא שהממוצעים יתפלגו נורמלית, כלומר התפלגות הדגימהSampling distribution. ולפי משפט הגבול המרכזיCentral limit theorem (פרק 17), עם מדגם גדול מספיק זה קורה כמעט בכל צורה של התפלגות.
מבחן Shapiro-Wilk בודק אם הנתונים סוטים מנורמליות. השערת האפס שלו היא שההתפלגות נורמלית, ולכן תוצאה מובהקתStatistically significant (p < .05) פירושה סטייה מנורמליות. בקשיבות של 200 התלמידים: W = .992, p = .382. אין עדות לסטייה. גם ההטיה קטנה, −0.17.
במדגם גדול, מבחן Shapiro-Wilk מובהק כמעט תמיד, גם על סטיות זעירות. אבל דווקא שם הנורמליות כמעט לא חשובה, בגלל משפט הגבול המרכזי. ובמדגם קטן, שבו הנורמליות באמת חשובה, למבחן אין מספיק עוצמה, והוא מפספס גם סטיות גדולות. המבחן רגיש בדיוק כשלא צריך, ועיוור בדיוק כשצריך. לכן מסתכלים קודם על ההיסטוגרמה ועל תרשים Q-Q, ולא רק על ערך p. דוגמה מהנתונים שלנו: בחרדה של 200 התלמידים, Shapiro-Wilk מובהק (p = .011), אבל ההטיה רק 0.22. עם 200 נבדקים ממשיכים במבחן t בלב שקט. נרחיב על כך בפרק 21. יש עוד מבחן נורמליות, Kolmogorov-Smirnov, שעובד באותו עיקרון, אבל Shapiro-Wilk מזהה סטיות טוב יותר.
ועוד הנחה, שקל לפספס: אי־תלות. במחקר שלנו התלמידים לומדים בכיתות. לתלמידים באותה כיתה יש אותה מורה, אותה אווירה, ואולי גם השפעה זה על זה. לכן הם דומים זה לזה יותר משני ילדים אקראיים, והמדגם "שווה" פחות מ־200 תלמידים בלתי תלויים. כשמתעלמים מזה, טעות התקן יוצאת קטנה מדי. יש לזה פתרונות, כמו מודלים רב־רמתיים, שנפגוש בפרק 36, במודלים מעורביםLinear mixed model. בינתיים, מספיק לזכור לשאול: מי במדגם קשור למי?
ומה עם הסולם? פריט בודד בשאלון, מ"אף פעם" עד "תמיד", הוא בסולם סדר. ממוצע של הרבה פריטים מתנהג כמו סולם רווח, ולכן נהוג "לסלוח" ולהשתמש במבחן t (פרק 6).
בדקו את עצמכם4 שאלות
1.שאלון שביעות רצון מהמורה בסולם של 0 עד 10. מהו אמצע הסולם?
2.מהי השערת האפס של מבחן Shapiro-Wilk?
3.באיזה מצב הנחת אי־התלות של מבחן t למדגם בודד נפגעת בבירור?
4.12 תלמידים, וההיסטוגרמהHistogram של הציונים מוטה מאוד ימינה, עם ערך קיצוני אחד. מה כדאי לעשות?
בתוכנה: כל 200 התלמידים מול "לפעמים"
חוזרים לשאלת הפתיחה. משתנה: mind_pre, הקשיבות לפני התוכנית (ממוצע 15 פריטים, 1 עד 5). ערך הבדיקה: 3. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות. המספרים זהים בשלוש התוכנות.
החישוב ביד
ל־Analysis ToolPak של אקסל אין כלי למבחן t למדגם בודד. לא נורא: בונים אותו בנוסחאות, וכך גם רואים כל שלב. mind_pre היא עמודה AH, שורות 2 עד 201. את החישובים כותבים בעמודה ריקה, למשל BF, ובעמודה BE לידה את השמות.
mind_pre (AH2:AH201), test value = 3
| Cell | Formula | Result |
|---|---|---|
| BF2 (M) | =AVERAGE(AH2:AH201) | 3.2030 |
| BF3 (SD) | =STDEV.S(AH2:AH201) | 0.5464 |
| BF4 (n) | =COUNT(AH2:AH201) | 200 |
| BF5 (test value) | 3 | 3 |
| BF6 (SE) | =BF3/SQRT(BF4) | 0.0386 |
| BF7 (t) | =(BF2-BF5)/BF6 | 5.26 |
| BF8 (df) | =BF4-1 | 199 |
| BF9 (p, two-tailed) | =T.DIST.2T(ABS(BF7),BF8) | 3.79E-07 |
| BF10 (t critical) | =T.INV.2T(0.05,BF8) | 1.972 |
| BF11 (half width) | =CONFIDENCE.T(0.05,BF3,BF4) | 0.0762 |
| BF12 (CI lower) | =BF2-BF11 | 3.1269 |
| BF13 (CI upper) | =BF2+BF11 | 3.2792 |
| BF14 (d) | =(BF2-BF5)/BF3 | 0.37 |
- BF7, BF8
- סטטיסטי tt statistic ודרגות החופש: t(199) = 5.26.
- BF9
- ערך p דו־צדדי, בכתיב מדעי: 0.000000379. כלומר p < .001. בלי
ABS, t שלילי היה נותן שגיאה. - BF12, BF13
- רווח הסמך לממוצע: [3.13, 3.28]. לא כולל את 3.
- BF14
- d של כהןCohen's d: 0.37, בין קטן לבינוני.
היתרון של הגיליון הזה: מחליפים את ערך הבדיקה ב־BF5, או את הטווח, וכל השאר מתעדכן לבד. לכיתה 1 בלבד, למשל, הטווח הוא AH2:AH28.
אם בכל זאת רוצים כלי מוכן: מוסיפים עמודה שבה בכל שורה כתוב ערך הבדיקה, 3, ומריצים Data > Data Analysis > t-Test: Paired Two Sample for Means על mind_pre ועל עמודת ה־3. ההפרשים הם בדיוק x − 3, וסטיית התקן שלהם היא סטיית התקן של mind_pre. לכן t, דרגות החופש וערך p יוצאים זהים. מאותה סיבה גם =T.TEST(AH2:AH201, BG2:BG201, 2, 1), כשעמודה BG מלאה ב־3, נותן את ערך p. זה גם רמז לפרק הבא: המבחן המזווג הוא מבחן t למדגם בודד על ההפרשים.
- Analyze > Compare Means > One-Sample T Test
- Test Variable(s):
mind_pre. ב־Test Value מקלידים 3 (ברירת המחדל היא 0). - מסמנים Estimate effect sizes ולוחצים OK. ב־Options אפשר לשנות את רמת הביטחוןConfidence level של רווח הסמך.
One-Sample Statistics
| N | Mean | Std. Deviation | Std. Error Mean | |
|---|---|---|---|---|
| mind_pre | 200 | 3.2030 | .54642 | .03864 |
One-Sample Test (Test Value = 3)
| t 1 | df | One-Sided p | Two-Sided p 2 | Mean Difference | 95% CI Lower 3 | Upper | |
|---|---|---|---|---|---|---|---|
| mind_pre | 5.255 | 199 | <.001 | <.001 | .20305 | .1269 | .2792 |
One-Sample Effect Sizes
| Standardizer | Point Estimate | 95% CI Lower | Upper | ||
|---|---|---|---|---|---|
| mind_pre | Cohen's d | .54642 | .372 | .228 | .514 |
| Hedges' correction | .54847 | .370 | .227 | .513 |
- 1 · t, df
- t(199) = 5.26.
- 2 · Two-Sided p
- ערך p דו־צדדי. SPSS כותב <.001 כשהוא קטן מאלפית. One-Sided p נקרא רק כשההשערה נקבעה מראש עם כיוון.
- Mean Difference
- הממוצע פחות ערך הבדיקה: 3.2030 − 3 = 0.203. חיובי: הממוצע מעל 3.
- 3 · 95% CI
- רווח הסמך של ההפרש, לא של הממוצע: [0.13, 0.28]. לא כולל 0, ולכן מובהק. כדי לקבל את רווח הסמך לממוצע מוסיפים 3: [3.13, 3.28].
- Cohen's d
- 0.37. Standardizer היא סטיית התקן שבה חילקו, .546. Hedges' correction הוא g של הדג׳ס, כמעט זהה במדגם גדול.
טיפ: כדי לקבל ישר את רווח הסמך לממוצע עצמו, הריצו את אותו מבחן עם Test Value 0. ה־Mean Difference יהיה הממוצע, ורווח הסמך יהיה של הממוצע. את t ואת p של הריצה הזו לא קוראים: הם בודקים אם הממוצע שונה מ־0.
כך נראה הפלט, בגרסה 27 ואילך (בגרסאות ישנות יותר יש עמודה אחת, Sig. (2-tailed), ואין טבלת Effect Sizes).
- T-Tests > One Sample T-Test (Classical).
- Variables:
mind_pre. ב־Test value מקלידים 3. תחת Tests מסומן Student. - תחת Additional Statistics מסמנים Location estimate עם Confidence interval, Effect size ו־Descriptives. תחת Assumption Checks: Normality.
One Sample T-Test
| t | df | p | Mean Difference | 95% CI Lower | Upper | Cohen's d | |
|---|---|---|---|---|---|---|---|
| mind_pre | 5.255 | 199 | < .001 | 0.203 | 0.127 | 0.279 | 0.372 |
Note. For the Student t-test, the alternative hypothesis specifies that the mean is different from 3.
Descriptives
| N | Mean | SD | SE | |
|---|---|---|---|---|
| mind_pre | 200 | 3.203 | 0.546 | 0.039 |
Test of Normality (Shapiro-Wilk)
| W | p | |
|---|---|---|
| mind_pre | 0.992 | .382 |
- t, df, p
- t(199) = 5.26, p < .001. ה־Note מתחת לטבלה מזכיר מה הייתה השערת המחקר: שונה מ־3, כלומר דו־צדדית.
- Mean Difference ו־95% CI
- ההפרש מערך הבדיקה, ורווח הסמך שלו: [0.13, 0.28]. לא כולל 0.
- Cohen's d
- 0.37: בין קטן לבינוני.
- Shapiro-Wilk
- p = .382, לא מובהק: אין עדות לסטייה מנורמליות. ועם 200 תלמידים זה ממילא לא קריטי.
להשערה חד־צדדית בוחרים תחת Alt. Hypothesis את > Test value או < Test value, לפני שמסתכלים על התוצאה. כדי לנתח רק כיתה אחת, לוחצים על כותרת העמודה class_id ומשאירים מסומן רק את הכיתה הרצויה (מסנן).
ב־JASP יש תחת Tests גם אפשרות Z Test. היא מבקשת להקליד את סטיית התקן של האוכלוסייה, σ, כלומר זה מבחן z מפרק 18. מתאים רק כש־σ באמת ידועה.
בגרסאות שונות של JASP סדר העמודות ושמות האפשרויות עשויים להשתנות מעט.
בדקו את עצמכם3 שאלות
1.באקסל בניתם את המבחן בנוסחאות, אבל בתא של ערך הבדיקה, BF5, נשאר 0. יצא t = 82.9. מה קרה?
=(BF2-BF5)/BF6 בדקה אם הממוצע שונה מ־0. בסולם של 1 עד 5 כל ממוצע רחוק מאוד מ־0, ולכן t עצום. התוצאה נכונה מתמטית, אבל עונה על שאלה חסרת משמעות.1.ב־SPSS הריצו One-Sample T Test על mind_pre, ושכחו לשנות את Test Value. יצא t = 82.9. מה קרה?
1.ב־JASP הריצו One Sample T-Test על mind_pre, ושכחו לשנות את Test value. יצא t = 82.9. מה קרה?
2.פלט של מבחן t מול 3: t = −2.30, df = 40, p = .027, Mean Difference = −0.35, Cohen's d = −0.36. כתבו משפט דיווח.
3.באקסל, =T.DIST.2T(-2.1, 30) מחזיר שגיאה. מה הפתרון?
=T.DIST.2T(ABS(-2.1), 30) T.DIST.2T מקבלת רק t חיובי, ולכן עוטפים ב־ABS. T.DIST עם TRUE נותנת את השטח משמאלCumulative area, כלומר ערך p חד־צדדי שמאלי, לא דו־צדדי.3.ב־SPSS, ב־Compute Variable, איזה ביטוי נותן ערך p דו־צדדי ל־t = −2.1 עם 30 דרגות חופש?
2 * (1 - CDF.T(ABS(-2.1), 30)) CDF.T מחזירה את השטח משמאל. עם ABS לוקחים את הזנב שמעבר לערך החיובי, ומכפילים בשתיים. CDF.T(-2.1, 30) לבדה היא p חד־צדדי שמאלי, ו־2 * CDF.T(2.1, 30) גדול מ־1.3.ב־JASP, בעמודה מחושבת בקוד R, איזה ביטוי נותן ערך p דו־צדדי ל־t = −2.1 עם 30 דרגות חופש?
2 * (1 - pt(abs(-2.1), 30)) pt מחזירה את השטח משמאל. עם abs לוקחים את הזנב שמעבר לערך החיובי, ומכפילים בשתיים. pt(-2.1, 30) לבדה היא p חד־צדדי שמאלי, ו־2 * pt(2.1, 30) גדול מ־1. (בחלון One Sample T-Test, JASP נותן את p לבד.)איך מדווחים
משפט אחד, עם כל מה שהקורא צריך: הממוצע וסטיית התקן, ערך הבדיקה ומאיפה הוא בא, הכיוון במילים, t עם דרגות החופש, ערך p, גודל אפקט, ואם אפשר רווח סמך.
ממוצע הקשיבות של התלמידים לפני התוכנית (M = 3.20, SD = 0.55) היה גבוה באופן מובהק מאמצע הסולם, 3 ("לפעמים"), וגודל האפקט בין קטן לבינוני, t(199) = 5.26, p < .001, d = 0.37, 95% CI [3.13, 3.28].
בכיתה 2 לא נמצא הבדל מובהק בין ממוצע הקשיבות (M = 3.06, SD = 0.55) לבין אמצע הסולם, t(24) = 0.58, p = .565, d = 0.12, 95% CI [2.84, 3.29].
כמה כללים של APA: t ו־p באותיות נטויות. ערך p בלי אפס לפני הנקודה, וכשהוא קטן מאלפית, p < .001 ולא p = .000. t ו־d בשתי ספרות אחרי הנקודה. ואם t יצא שלילי, אפשר לכתוב אותו עם המינוס או בלי, כל עוד הכיוון כתוב במילים. רווח הסמך כאן הוא של הממוצע. אם מדווחים את רווח הסמך של ההפרש, כפי שהוא מופיע בפלט, כותבים זאת במפורש.
טעויות נפוצות
- משתמשים ב־1.96 כש־σ לא ידועה. כשסטיית התקן נאמדה מהמדגם, הערך הקריטי בא מהתפלגות t, עם n − 1 דרגות חופש.
- מחלקים בסטיית התקן במקום בטעות התקן. ב־t המכנה הוא SD / √n. מי שמחלק ב־SD מקבל את d, לא את t.
- דרגות חופש = n. במדגם בודד, df = n − 1.
- T.DIST.2T על t שלילי. אקסל מחזיר שגיאה. עוטפים ב־
ABS. - בוחרים חד־צדדי אחרי שרואים את הנתונים. הכיוון נקבע מראש, לפי שאלת המחקר.
- "לא דחינו, ולכן הממוצע שווה ל־3." לא דחינו רק אומר שלא מצאנו ראיה מספיקה. רווח הסמך מראה כמה רחוק הממוצע עוד יכול להיות.
- קוראים את רווח הסמך בפלט כרווח של הממוצע. SPSS ו־JASP מדפיסים את רווח הסמך של ההפרש מערך הבדיקה. בודקים אם הוא כולל 0, לא את ערך הבדיקה.
- בוחרים ערך בדיקה מהנתונים. ערך הבדיקה מגיע מבחוץ: אמצע הסולם, נורמה, המלצה.
בדקו את עצמכם
סיכום
- מתי t: כשמשווים ממוצע של מדגם אחד לערך קבוע, וסטיית התקן באוכלוסייה לא ידועה. זה המצב הנפוץ.
- הסטטיסטי: כמו z, עם SD במקום σ. המחיר: התפלגות t, עם זנבות עבים יותר.
- דרגות חופש: n − 1. ככל שיש יותר, t קרובה יותר לנורמלית, והערך הקריטי מתקרב ל־1.96.
- חמשת השלבים כמו במבחן z. ערך p וערך קריטי מהתפלגות t.
- רווח סמך: M ± tcrit · SE. ערך הבדיקה מחוצה לו = דוחים.
- גודל אפקט: d = (M − μ0) / SD, ו־t = d · √n. מדווחים תמיד את שניהם.
- הנחות: אי־תלות, סולם רווח, נורמליות או מדגם של 30 ומעלה. ערך הבדיקה קבוע מראש.
מונחים חדשים
שאלות לדוגמה, עם פתרונות
שאלות בסגנון מבחן, מהקלה אל הקשה. נסו לפתור לבד, ורק אז פתחו את הפתרון.
לכל מצב, קבעו אם מתאים מבחן z או מבחן t למדגם בודד, וכמה דרגות חופש יש (אם יש). א. 40 ילדים עברו מבחן אינטליגנציה מתוקנן (ממוצע 100, סטיית תקן 15 באוכלוסייה), ובודקים אם הממוצע שלהם שונה מ־100. ב. 40 ילדים דירגו את שביעות הרצון שלהם מבית הספר בסולם של 1 עד 7, ובודקים אם הממוצע שונה מ־4. ג. אותם 40 ילדים, אבל החוקרת השתמשה בסטיית התקן של המדגם, 14.2, במבחן האינטליגנציה.
בדיקת התשובה
א. מבחן z: סטיית התקן באוכלוסייה ידועה, 15, ולכן אין צורך לאמוד אותה. אין דרגות חופש. ב. מבחן t, עם 40 − 1 = 39 דרגות חופש: לסולם הזה אין סטיית תקן ידועה באוכלוסייה. ג. כשמשתמשים בסטיית התקן של המדגם, זה מבחן t עם 39 דרגות חופש. אבל כשהמבחן מתוקנן ו־σ ידועה, עדיף מבחן z: הוא משתמש במידע המדויק, ואין צורך לשלם על אומדן.
הממוצע הארצי בשאלון מסוגלות של מורים הוא 3.8. 16 מורות שסיימו השתלמות קיבלו ממוצע 4.2, עם סטיית תקן 0.6. א. האם המורות שונות מהממוצע הארצי? (α = .05, דו־צדדי) ב. בנו רווח סמך של 95% לממוצע. ג. חשבו את d.
בדיקת התשובה
H0: μ = 3.8 H1: μ ≠ 3.8SE = 0.6 / √16 = 0.6 / 4 = 0.15t = (4.2 − 3.8) / 0.15 = 0.4 / 0.15 = 2.67, df = 15tcrit = 2.131, 2.67 > 2.131 → דוחים, p = .018CI = 4.2 ± 2.131 · 0.15 = 4.2 ± 0.32 → [3.88, 4.52] ב.d = 0.4 / 0.6 = 0.67 ג.המסוגלות של המורות גבוהה באופן מובהק מהממוצע הארצי, באפקט בינוני עד גדול. רווח הסמך לא כולל את 3.8, בהתאם למבחן. אבל זה לא מוכיח שההשתלמות העלתה את המסוגלות: אולי נרשמו אליה מלכתחילה מורות עם מסוגלות גבוהה.
ההמלצה היא שתלמידים יקראו לפחות 20 דקות ביום. שישה תלמידים רשמו כמה דקות קראו ביום, בממוצע: 25, 18, 30, 22, 27, 28. המורה רוצה לבדוק אם הם קוראים יותר מההמלצה, וקבעה את הכיוון מראש. א. נסחו השערות. ב. חשבו t, דרגות חופש ו־d. ג. מה ההחלטה, חד־צדדית ודו־צדדית?
בדיקת התשובה
H0: μ ≤ 20 H1: μ > 20 א.M = 150 / 6 = 250, −7, 5, −3, 2, 3 הסטיות מהממוצעSS = 0 + 49 + 25 + 9 + 4 + 9 = 96SD = √(96 / 5) = √19.2 = 4.382SE = 4.382 / √6 = 4.382 / 2.449 = 1.789t = (25 − 20) / 1.789 = 2.80, df = 5, d = 5 / 4.382 = 1.14 ב.חד־צדדי: tcrit = 2.015, p = .019 → דוחים ג.דו־צדדי: tcrit = 2.571, p = .038 → דוחיםבשתי הדרכים דוחים: התלמידים קוראים יותר מההמלצה, באפקט גדול. אבל שישה תלמידים הם מדגם זעיר. ובמדגם כזה הנורמליות חשובה: עם שישה ערכים קשה מאוד לבדוק אותה.
האם התלמידים במחקר חרדים, או רגועים? שאלון החרדה הוא בסולם של 1 (אף פעם) עד 4 (תמיד). קראו את הפלט של SPSS וענו: א. מהו ערך הבדיקה, ולמה דווקא הוא? ב. מה המסקנה, ולאיזה כיוון? ג. מהו רווח הסמך של 95% לממוצע עצמו? ד. חשבו את d מהטבלאות. ה. מבחן Shapiro-Wilk על
anx_preיצא p = .011. האם צריך לוותר על מבחן t?One-Sample Statistics
N Mean Std. Deviation Std. Error Mean anx_pre 200 2.2356 .51886 .03669 One-Sample Test (Test Value = 2.5)
t df One-Sided p Two-Sided p Mean Difference 95% CI Lower Upper anx_pre -7.206 199 <.001 <.001 -.26438 -.3367 -.1920 בדיקת התשובה
א. 2.5, אמצע הסולם: (1 + 4) / 2 = 2.5. ממוצע מעליו פירושו נטייה לחרדה, ומתחתיו נטייה לרוגע.
ב. t(199) = −7.21, p < .001. ה־Mean Difference שלילי: הממוצע, 2.24, נמוך מ־2.5. החרדה של התלמידים נמוכה באופן מובהק מאמצע הסולם. בממוצע, הם קרובים יותר ל"לפעמים" מאשר ל"לעיתים קרובות".
[−0.3367 + 2.5, −0.1920 + 2.5] = [2.16, 2.31] ג. מוסיפים את ערך הבדיקה לשני הקצוותd = −0.26438 / 0.51886 = −0.51 ד. Mean Difference חלקי Std. Deviationt = −0.26438 / 0.03669 = −7.21 בדיקה: חלקי Std. Error Mean מקבלים את tאפקט בינוני. ה. לא. עם 200 תלמידים, מבחן Shapiro-Wilk רגיש מאוד, גם לסטיות זעירות. ההטיה של
anx_preקטנה (0.22), ולפי משפט הגבול המרכזי הממוצעים מתפלגים נורמלית בכל מקרה. ממשיכים במבחן t.דיווח: "החרדה של התלמידים לפני התוכנית (M = 2.24, SD = 0.52) הייתה נמוכה באופן מובהק מאמצע הסולם, 2.5, t(199) = −7.21, p < .001, d = −0.51, 95% CI [2.16, 2.31]."
במאמר נכתב רק: "בקבוצה של 25 תלמידים, רווח הסמך של 95% לממוצע הקשיבות היה [2.84, 3.29]". א. האם הממוצע שונה באופן מובהק מ־3 (דו־צדדי, α = .05)? ומ־2.8? ב. שחזרו את הממוצע, את טעות התקן ואת סטיית התקן. ג. חשבו את t מול 3. ד. כמה תלמידים, בערך, היו צריכים להיות בקבוצה כדי שרווח הסמך יהיה ברוחב חצי?
בדיקת התשובה
א. 3 בתוך הרווח: לא מובהק. 2.8 מחוץ לרווח: מובהק. לא צריך שום חישוב.
M = (2.84 + 3.29) / 2 = 3.065 ב. הממוצע באמצע הרווחחצי רוחב = (3.29 − 2.84) / 2 = 0.225tcrit (24 df) = 2.064 → SE = 0.225 / 2.064 = 0.109SD = SE · √n = 0.109 · 5 = 0.545t = (3.065 − 3) / 0.109 = 0.60 ג. עם המספרים המעוגלים של המאמר. מהנתונים המלאים: 0.58ד. הרוחב פרופורציונלי ל־1 / √n. כדי לחצות אותו צריך להכפיל את √n, כלומר פי 4 תלמידים: בערך 100. (בדיוק קצת פחות, כי עם יותר דרגות חופש גם הערך הקריטי יורד מ־2.064 ל־1.984.)
תרגול עם הנתונים
פתחו את קובץ המחקר ואת מילון המשתנים.
הקבצים עצמם נמצאים גם בתיקיית data בחבילת הספר.
- האם ההרגשה בכיתה לפני התוכנית (
clim_pre, 1 עד 5) שונה מאמצע הסולם? דווחו במשפט אחד.בדיקת התשובה
ערך הבדיקה 3. "ההרגשה בכיתה (M = 3.47, SD = 0.65) הייתה גבוהה באופן מובהק מאמצע הסולם, t(199) = 10.26, p < .001, d = 0.73, 95% CI [3.38, 3.56]." אפקט בינוני עד גדול: התלמידים מרגישים בכיתה טוב יותר מהאמצע.
- ובעיות הקשב לפני התוכנית (
attn_pre, 1 עד 5, ציון גבוה = יותר בעיות)? שימו לב לכיוון.בדיקת התשובה
M = 2.48, SD = 0.71, t(199) = −10.28, p < .001, d = −0.73. הממוצע נמוך מ־3, ובשאלון הזה ציון נמוך פירושו פחות בעיות קשב. כלומר, בממוצע התלמידים מדווחים על מעט בעיות קשב.
- בכמה מתוך שמונה הכיתות ממוצע הקשיבות לפני התוכנית (
mind_pre) גבוה באופן מובהק מ־3? באקסל, שנו את הטווח בגיליון של קטע "בתוכנה" לכל כיתה (הנתונים ממוינים לפיclass_id).ב־SPSS, Data > Split File לפיclass_id, ואז One-Sample T Test.ב־JASP, מסננים כל פעם כיתה אחרת בכותרת העמודהclass_id.בדיקת התשובה
בשלוש: כיתה 1 (t(26) = 2.72, p = .011), כיתה 4 (t(28) = 3.31, p = .003) וכיתה 6 (t(25) = 3.84, p < .001). בכל שאר הכיתות הממוצע מעל 3, אבל לא באופן מובהק. ובכל המדגם יחד, ההבדל מובהק מאוד. זה בדיוק מה ש־t = d · √n אומר: עם 200 תלמידים יש הרבה יותר עוצמה מאשר עם 25.
- בקבוצת הביקורת (
group= 0), בדקו את הקשיבות מול 3 לפני התוכנית ואחריה (mind_pre,mind_post). מה השתנה?בדיקת התשובה
לפני: M = 3.18, t(73) = 2.71, p = .008, d = 0.32. אחרי: M = 3.02, t(73) = 0.27, p = .790, d = 0.03. בקבוצת הביקורת הקשיבות ירדה עד כמעט בדיוק "לפעמים". אבל שימו לב: שני מבחנים נפרדים מול 3 לא בודקים אם הקשיבות השתנתה. לשאלה הזו צריך מבחן מזווג, בפרק 21.
- בדקו את הנורמליות של
mind_pre: היסטוגרמה, הטיה ומבחן Shapiro-Wilk. האם יש בעיה?בדיקת התשובה
ההיסטוגרמה בצורת פעמון בערך, ההטיה −0.17, ו־Shapiro-Wilk לא מובהק: W = .992, p = .382. אין בעיה, וגם אילו הייתה סטייה קטנה, 200 תלמידים הם מדגם גדול מספיק.
בפרק הבא: מבחני t לשני מדגמים. תגלו שהמבחן למדגמים מזווגיםDependent samples הוא בדיוק המבחן של הפרק הזה, על ההפרשים בין "לפני" ל"אחרי", עם ערך בדיקה 0. ובקבוצות בלתי תלויותIndependent samples אותו היגיון של אות חלקי רעש, רק עם שני ממוצעים, ולכן שתי דרגות חופש פחות.
מקורות: Student. (1908). The probable error of a mean. Biometrika, 6(1), 1–25. · Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Erlbaum. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y