סטטיסטיקה מ־0 עד 100בטאתוכנהעומק

חלק ג: מהמדגם לאוכלוסייה · פרק 20

מבחן t למדגם בודד

בפרק 18 בדקנו השערות עם מבחן zz test, והנחנו שאנחנו יודעים את סטיית התקן של האוכלוסייה. בחיים האמיתיים כמעט אף פעם לא יודעים אותה. בפרק הזה נלמד מה עושים במצב הזה: אומדיםEstimator אותה מהמדגם, ומשלמים על כך מחיר קטן. המחיר הזה נקרא התפלגות tt distribution.

שאלת הפתיחה

האם התלמידים במחקר קשובים יותר מ"לפעמים"?

בשאלון הקשיבות התלמידים ענו על כל משפט בסולם של 1 (אף פעם) עד 5 (תמיד). אמצע הסולם הוא 3, "לפעמים". הממוצע של 200 התלמידים לפני התוכנית הוא 3.20. זה מעל 3, אבל אולי רק במקרה? אין לנו סטיית תקן של "כל התלמידים בישראל", רק את המדגם. בסוף הפרק תדעו לענות, ביד ובתוכנה, ותדעו גם כמה גדול ההבדל.

בסוף הפרק תוכלו

למה t ולא z?

במבחן z מחלקים בטעות התקןStandard error σ / √n, ולכן צריך לדעת את σ. כמעט אף פעם לא יודעים אותה. אז אומדים אותה בעזרת של המדגם: t = (M − μ0) / (SD / √n). אותה נוסחה, אבל האומדןEstimate מוסיף אי־ודאות, ולכן הסטטיסטי מתפלג לפי התפלגות t ולא לפי הנורמלית.

נזכיר את מבחן z מפרק 18. רצינו לדעת אם ממוצע המדגם רחוק מדי מהערך שהשערת האפסNull hypothesis צופה, 0. מדדנו את המרחק ביחידות של טעות התקןStandard error (פרק 17):

z = − μ0σ / √n

כדי לחשב את המכנה צריך את σ, סטיית התקן של כל האוכלוסייה. מתי יודעים אותה? כמעט רק במבחנים מתוקננים, שנבדקו על מיליוני אנשים. במבחן אינטליגנציה, למשל, הממוצע 100 וסטיית התקן 15. אבל מה סטיית התקן של הקשיבות של כל ילדי כיתות ד׳ ו־ה׳ בישראל? אף אחד לא יודע.

אז מה יש לנו ביד? את נתוני המדגם. ובפרק 11 ראינו שסטיית התקן של המדגם, עם n − 1 במכנה, היא בדיוק אומדןEstimate של σ. לכן מחליפים את σ ב־SD, וטעות התקן הופכת ל:

= SD√      = M − μ0SD / √n

זה כל ההבדל בנוסחה. אבל יש לו מחיר. σ היא מספר קבוע. SD, לעומת זאת, משתנה ממדגם למדגם, בדיוק כמו הממוצע. נניח שסטיית התקן באוכלוסייה היא 15. במדגם אחד נקבל 14, באחר 16, באחר 17, ובאחר 13. כלומר, עכשיו יש שני מקורות של מקריות: גם המונה, הממוצע, משתנה, וגם המכנה, סטיית התקן. יותר מקריות פירושה יותר ערכים קיצונייםOutlier. ולכן הסטטיסטי כבר לא מתפלג נורמלית, אלא לפי התפלגות t, שהיא רחבה קצת יותר.

שלוש שאלות שכדאי לשאול לפני שבוחרים:

מבחן z למדגם בודד (פרק 18)מבחן t למדגם בודד
סטיית התקן באוכלוסייהידועהלא ידועה, אומדים אותה מהמדגם
במכנהσ / √nSD / √n
ההתפלגות של הסטטיסטינורמלית סטנדרטיתהתפלגות t, עם n − 1 דרגות חופש
ערך קריטי (דו־צדדי, .05)תמיד 1.96תלוי בגודל המדגם. למשל 2.06 עם 27 נבדקים
כמה נפוץ במחקרנדיר מאודנפוץ יותר, אבל גם הוא לא שכיח (סעיף 6)

ומה צריך כן לדעת? את μ0, הערך שמשווים אליו. הוא נקרא ערך הבדיקהTest value, ונראה בסעיף 6 מאיפה הוא מגיע.

הסיפור המלא: למה האומדן יוצר זנבות עבים?

דמיינו מדגם קטן שבמקרה יצא עם תלמידים דומים מאוד זה לזה. סטיית התקן שלו קטנה מדי ביחס לאמת. מה קורה ל־t? המכנה קטן, ו־t מתנפח. זה יכול לקרות גם כשהשערת האפס נכונה לגמרי. במבחן z זה לא קורה, כי המכנה קבוע.

במדגם גדול האומדן של σ מדויק: אם לקחתם כמעט את כל האוכלוסייה, סטיית התקן של המדגם כמעט זהה לאמיתית. במדגם קטן אי אפשר לדעת אם במקרה לקחתם דווקא אנשים דומים. לכן ההבדל בין t ל־z גדול במדגמים קטנים, וכמעט נעלם במדגמים גדולים.

ולמה זה חשוב? אילו השתמשנו בטבלה הנורמלית גם כשאומדים את σ, היינו דוחים את השערת האפס יותר מדי פעמים. רמת המובהקותSignificance level "האמיתית" שלנו הייתה גבוהה מ־.05, בלי שנדע.

בדקו את עצמכם3 שאלות

1.במבחן t למדגם בודדOne-sample t test, מה בא במקום σ שבנוסחה של מבחן z?

2.באיזה מהמצבים הבאים מתאים מבחן z, ולא מבחן t?

3.36 תלמידים, ממוצע 52, סטיית תקן 9. ערך הבדיקהTest value 50. חשבו את טעות התקן ואת t.

התפלגות t ודרגות חופש

התפלגות t סימטרית ופעמונית סביב 0, כמו הנורמלית הסטנדרטית, אבל עם זנבות עבים יותר. הצורה שלה תלויה בדרגות החופש, ובמבחן למדגם בודד df = n − 1. ככל שיש יותר דרגות חופש, היא קרובה יותר לנורמלית, והערך הקריטי יורד לכיוון 1.96.

התפלגות t היא לא התפלגות אחת, אלא משפחה של התפלגויות. לכל מספר של דרגות חופש יש עקומה משלה. כולן סימטריות סביב 0, כולן בצורת פעמון, אבל לכולן יש יותר "מקום" בזנבות מאשר לנורמלית. כלומר, ערכים קיצוניים סבירים בהן יותר.

מה זה דרגות חופש?

בפרק 11 ראינו למה מחלקים ב־n − 1 כשמחשבים סטיית תקן. נחזור על הרעיון בדוגמה קטנה. חמישה תלמידים, והממוצע שלהם ידוע. כל אחד אומר בכמה הוא רחוק מהממוצע. סכום המרחקים מהממוצע הוא תמיד 0. ארבעה אמרו: +2, −1, +2, −6. הסכום שלהם −3. החמישי כבר לא חופשי: הוא חייב לומר +3.

כלומר, אחרי שחישבנו את הממוצע מהנתונים, רק ארבעה מתוך חמשת הערכים חופשיים להשתנות. זה "המחיר" ששילמנו על האומדן. עם n נבדקים יש n − 1 דרגות חופש. בפרק 21 נראה שבשתי קבוצות משלמים שתיים, ובהמשך הספר נפגוש דרגות חופש בכל מבחן.

= n − 1

ערכים קריטיים של tCritical t value

הנה הערך הקריטי הדו־צדדי ברמת מובהקותSignificance level .05, לפי דרגות החופש:

דרגות חופש510203060120אינסוף (z)
ערך קריטי2.5712.2282.0862.0422.0001.9801.960

במדגם קטן צריך ממוצע רחוק יותר מ־μ0 כדי לדחות. ההיגיון: האומדן של סטיית התקן פחות מדויק, ולכן דורשים ראיות חזקות יותר. ומעל 120 דרגות חופש, בערך, אין כמעט הבדל בין t ל־z.

דוגמה פתורה: אותם מספרים, z או t

בקבוצה קטנה של 10 תלמידים, ממוצע הקשיבות 3.6, וסטיית התקן 0.9. האם הממוצע שונה מ־3? ( = .05, דו־צדדי)

SE = 0.9 / √10 = 0.9 / 3.162 = 0.285
t = (3.6 − 3) / 0.285 = 2.11,   df = 10 − 1 = 9
tcrit(9) = 2.262 2.11 קטן ממנו: לא דוחים
p = .064 מהתפלגות t עם 9 דרגות חופש

מה היה קורה אילו טעינו והשתמשנו בטבלה הנורמלית? הערך הקריטי היה 1.96, ו־2.11 גדול ממנו. היינו דוחים, עם p = .035. אותם נתונים בדיוק, ומסקנה הפוכה. בעשרה נבדקים, ההבדל בין t ל־z ממש משנה.

הסיפור המלא: כמה רחבה התפלגות t?

לנורמלית הסטנדרטית יש ממוצע 0 וסטיית תקן 1. גם להתפלגות t יש ממוצע 0, אבל סטיית התקן שלה גדולה מ־1:

SDt = √(df / (df − 2))

עם 5 דרגות חופש: √(5/3) = 1.29. עם 30: √(30/28) = 1.04. עם 120: 1.008. כשדרגות החופש גדלות, השבר מתקרב ל־1, והתפלגות t הופכת לנורמלית. (הנוסחה נכונה מ־3 דרגות חופש ומעלה. עם 1 או 2 הזנבות עבים כל כך, שאין לה סטיית תקן סופית בכלל.)

את ההתפלגות גילה ב־1908 כימאי במבשלת גינס, שפרסם בשם בדוי, Student. את הסיפור שלו נספר בפרק 21. ועוד הערה היסטורית: לפני המחשבים, כל ספר סטטיסטיקה כלל טבלה של ערכים קריטיים של t, כמו הטבלה למעלה, אבל עם הרבה שורות. היום התוכנה נותנת ערך p מדויקExact p-value, והטבלה נשארה בעיקר כדי להבין את הרעיון.

מעבדה: התפלגות t מול הנורמלית

מעבדה: התפלגות t ודרגות חופש. העקומה הכחולה היא הנורמלית, והצהובה היא t. מזיזים את דרגות החופש ורואים את הזנבות ואת הערך הקריטי.פתיחה בחלון נפרד
משימות למעבדה
  1. קבעו דרגת חופש אחת. איפה ההבדל בין שתי העקומות גדול במיוחד: במרכז או בזנבות? מה הערך הקריטי?
  2. הזיזו את המחוון לאט עד 60. מאיזה מספר של דרגות חופש הערך הקריטי כבר קטן מ־2.1? ומ־2.05?
  3. בכיתה 1 של המחקר יש 27 תלמידים. כמה דרגות חופש? מה הערך הקריטי?
בדיקת התשובה

1. עם דרגת חופש אחת העקומה של t נמוכה יותר במרכז, והזנבות שלה גבוהים בהרבה. הערך הקריטי עצום: 12.706. 2. מ־19 דרגות חופש הוא 2.093, ומ־28 הוא 2.048. משם והלאה הוא יורד לאט מאוד, וההבדל מ־1.96 נעשה קטן. 3. 27 − 1 = 26 דרגות חופש, וערך קריטיCritical value 2.056.

בדקו את עצמכם3 שאלות

1.כמה דרגות חופש יש במבחן t למדגם בודד עם 18 נבדקים?

2.עם 1,000 דרגות חופש, מה הערך הקריטי הדו־צדדי של t, ברמת .05, בערך?

3.הסבירו במילים שלכם: למה במדגם קטן צריך t גדול יותר כדי לדחות את השערת האפסNull hypothesis?

המבחן, שלב אחר שלב

אותם חמישה שלבים כמו במבחן z: השערות על μ, רמת מובהקותSignificance level, סטטיסטי המבחןTest statistic, החלטה ומסקנה. רק שני הבדלים: במכנה SD במקום σ, והערך הקריטי וערך pp-value באים מהתפלגות t עם n − 1 דרגות חופש.

אם הבנתם את מבחן z בפרק 18, אתם כבר יודעים כמעט הכול. הנה חמשת השלבים, וההבדלים מודגשים:

  1. השערות. בדיוק כמו במבחן z: H0: μ = μ0 מול H1: μ ≠ μ0 (דו־צדדית), או עם כיוון (חד־צדדית). ההשערות הן תמיד על האוכלוסייה.
  2. רמת מובהקות ודרגות חופש. בדרך כלל α = .05. df = n − 1, והערך הקריטי בא מהתפלגות t.
  3. סטטיסטי המבחןTest statistic. t = (M − μ0) / (SD / √n). את SD מחשבים מהמדגם, עם n − 1.
  4. החלטה. לפי הערך הקריטי: אם |t| גדול ממנו, דוחים. או לפי ערך pp-value: אם p ≤ α, דוחים. שתי הדרכים תמיד מסכימות.
  5. מסקנה. משפט במילים, בהקשר של השאלה, עם הכיוון.
: μ = μ0     : μ ≠ μ0      t = M − μ0SD / √n     df = n − 1
דוגמה מהמחקר: הקשיבות בכיתה 1

בכיתה 1 (כיתה ד׳ בבית הספר של קבוצת הביקורת) יש 27 תלמידים. ממוצע הקשיבות שלהם לפני התוכנית (mind_pre) הוא 3.2928, וסטיית התקן 0.5591. האם הם קשובים יותר, או פחות, מ"לפעמים"? (α = .05, דו־צדדי)

H0: μ = 3    H1: μ ≠ 3 1. השערות. בלי כיוון מראש
df = 27 − 1 = 26,   tcrit = ±2.056 2. רמת מובהקות ודרגות חופש
SE = 0.5591 / √27 = 0.5591 / 5.196 = 0.1076 3. טעות התקן
t = (3.2928 − 3) / 0.1076 = 0.2928 / 0.1076 = 2.72
2.72 > 2.056,   p = .011 < .05 → דוחים 4. החלטה, בשתי הדרכים

5. מסקנה: ממוצע הקשיבות בכיתה 1 גבוה באופן מובהק מאמצע הסולם. התלמידים בכיתה הזו מדווחים, בממוצע, על קשיבות גבוהה מ"לפעמים". המדגם רחוק מ־3 כמעט שלוש טעויות תקן.

איפה מוצאים את ערך p ואת הערך הקריטי?

כשמריצים את המבחן בתוכנה, ערך p מופיע בפלט (בקטע "בתוכנה" בהמשך). כשמחשבים t ביד, צריך עוד צעד אחד:

דוגמה מהמחקר: ומה אם לא דוחים? כיתה 2

באותו בית ספר, בכיתה 2, יש 25 תלמידים. ממוצע הקשיבות 3.0640, וסטיית התקן 0.5482.

SE = 0.5482 / √25 = 0.5482 / 5 = 0.1096
t = (3.0640 − 3) / 0.1096 = 0.0640 / 0.1096 = 0.58,   df = 24
0.58 < 2.064,   p = .565 → לא דוחים

מסקנה: לא נמצא הבדל מובהק בין ממוצע הקשיבות בכיתה 2 לבין אמצע הסולם. שימו לב לניסוח. לא כתבנו "התלמידים בכיתה 2 קשובים בדיוק 'לפעמים'". לא דחינו את השערת האפס, אבל גם לא הוכחנו אותה. כמו בבית משפט: "לא אשם" זה לא "חף מפשע". אולי יש הבדל קטן, והמדגם קטן מכדי לגלות אותו (פרק 19).

כיתה 1כיתה 2
n2725
M3.293.06
SD0.560.55
t (df)2.72 (26)0.58 (24)
p.011.565

סטיות התקן בשתי הכיתות כמעט זהות, וגם גודל הכיתות. מה שמבדיל ביניהן הוא המרחק של הממוצע מ־3.

השערה חד־צדדיתOne-tailed hypothesis / test

לפעמים יש לחוקרים כיוון צפוי, ויש להם סיבה טובה לקבוע אותו מראש. למשל, מורה מאמינה שתוכנית קריאה חדשה מעלה את הציונים. אז ההשערה היא H1: μ > μ0, וכל אזור הדחייהRejection region נמצא בזנב אחד. הסטטיסטי tt statistic מחושב בדיוק אותו דבר. רק הערך הקריטי וערך p משתנים. ובתנאי אחד: ש־t יצא בכיוון שצפיתם.

דוגמה פתורה: חד־צדדית מול דו־צדדית

הנורמה הארצית במבחן קריאה היא 70. בכיתה שלמדה בתוכנית חדשה, 16 תלמידים, ממוצע 73.5 וסטיית תקן 7. המורה קבעה מראש: התוכנית משפרת. (α = .05)

H0: μ ≤ 70    H1: μ > 70
t = (73.5 − 70) / (7 / √16) = 3.5 / 1.75 = 2.00,   df = 15
חד־צדדי: tcrit = 1.753,   p = .032 → דוחים
דו־צדדי: tcrit = 2.131,   p = .064 → לא דוחים ערך p דו־צדדי הוא פי 2 מהחד־צדדי

אותם נתונים, ושתי מסקנות. לכן הכלל חשוב כל כך: את הכיוון קובעים לפני שרואים את הנתונים, לפי שאלת המחקר. מי שבוחר חד־צדדי רק אחרי שראה ש"זה עוזר", בעצם מכפיל את α. רוב כתבי העת מצפים לדיווח דו־צדדי, גם כשההשערה עם כיוון.

עצרו ונסו

שמונה מורות דירגו כמה הן מרגישות שחוקות, בסולם של 1 עד 7. הציונים: 5, 6, 4, 5, 7, 5, 6, 4. אמצע הסולם הוא 4. האם המורות שחוקות יותר, או פחות, מאמצע הסולם? (α = .05, דו־צדדי)

בדיקת התשובה
M = 42 / 8 = 5.25
−0.25, 0.75, −1.25, −0.25, 1.75, −0.25, 0.75, −1.25 הסטיות מהממוצע
SS = 0.0625 + 0.5625 + 1.5625 + 0.0625 + 3.0625 + 0.0625 + 0.5625 + 1.5625 = 7.5
SD = √(7.5 / 7) = √1.071 = 1.035
SE = 1.035 / √8 = 1.035 / 2.828 = 0.366
t = (5.25 − 4) / 0.366 = 3.42,   df = 7,   tcrit = 2.365
p = .011

3.42 גדול מ־2.365, ו־p קטן מ־.05: דוחים. המורות מדווחות על שחיקה גבוהה מאמצע הסולם. אבל זהירות: שמונה מורות, שלא נבחרו באקראי, הן לא "המורות בישראל".

מעבדה: מבחן t למדגם בודד

מעבדה: מבחן t למדגם בודד. מזיזים את ערך הבדיקה, הממוצע, סטיית התקן וגודל המדגם, ורואים את t, את אזור הדחייה, את ערך p ואת רווח הסמך.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו "כיתה 1". בדקו שהמעבדה נותנת את מה שחישבנו ביד. עכשיו הקטינו את המדגם ל־10 תלמידים, עם אותם ממוצע וסטיית תקן. מה השתנה?
  2. בחרו "כיתה 2". עד כמה צריך להגדיל את המדגם, עם אותם ממוצע וסטיית תקן, כדי שההבדל יהיה מובהק?
  3. בחרו "כיתה 1" ועברו להשערה שמאלית (H1: μ < 3). מה קרה לערך p, ולמה?
בדיקת התשובה

1. עם 27 תלמידים: t = 2.72, p = .011. עם 10: טעות התקן גדלה ל־0.177, t יורד ל־1.66, הערך הקריטי עולה ל־2.262, ו־p = .132. לא דוחים. אותו הבדל, פחות ראיות. 2. בערך 285 תלמידים. ההבדל קטן מאוד, 0.06, ולכן צריך מדגם ענק. וגם אז הוא יישאר הבדל קטן. 3. ערך p קפץ לכמעט 1 (.994). השערה שמאלית מחפשת ממוצע נמוך מ־3, והממוצע דווקא גבוה. זו הסיבה שבוחרים כיוון מראש: אם הכיוון שגוי, המבחן לא יכול לגלות את ההבדל.

בדקו את עצמכם4 שאלות

1.9 תלמידים, ממוצע 14, סטיית תקן 3. האם הממוצע שונה מ־12? (α = .05, דו־צדדי. הערך הקריטי עם 8 דרגות חופש: 2.306)

2.חוקר קבע מראש H1: μ > μ0, וקיבל t(15) = −2.50. מה ההחלטה ברמת .05?

3.במבחן t דו־צדדי יצא p = .08, והממוצע יצא בכיוון שהחוקרת צפתה. אילו היא הייתה קובעת השערה חד־צדדית מראש, מה היה ערך p?

4.מבחן t מול 4 יצא לא מובהק, p = .31. סטודנט כתב: "הוכחנו שממוצע האוכלוסייה הוא 4". מה לא בסדר, ואיך לכתוב נכון?

רווח סמך עם tt confidence interval

כמו בפרק 19, רק עם SD במקום σ, ועם ערך קריטי של tCritical t value במקום 1.96: M ± tcrit · SD / √n. אם ערך הבדיקה מחוץ לרווח הסמך של 95%, המבחן הדו־צדדי ברמת .05 דוחה. אם הוא בפנים, לא דוחה.

בפרק 19 בנינו רווח סמך לממוצע כש־σ ידועה: הממוצע, ועוד ופחות 1.96 טעויות תקן. כש־σ לא ידועה, מחליפים שני דברים: את σ ב־SD, ואת 1.96 בערך הקריטי של t, עם n − 1 דרגות חופש.

95% = M ± tcrit · SD√n
דוגמה מהמחקר: רווח סמך לקשיבות בשתי הכיתות
כיתה 1: 3.2928 ± 2.056 · 0.1076 = 3.2928 ± 0.2212 → [3.07, 3.51]
כיתה 2: 3.0640 ± 2.064 · 0.1096 = 3.0640 ± 0.2263 → [2.84, 3.29]

רווח הסמך של כיתה 1 לא כולל את 3: כל הערכים שבו גבוהים מ־3. ובמבחן דחינו. רווח הסמך של כיתה 2 כולל את 3, ובמבחן לא דחינו. זה לא מקרה. זה אותו מידע, משתי זוויות.

מבחן ורווח סמך: שני צדדים של אותו מטבע

המבחן שואל: אם הממוצע באוכלוסייה הוא 3, האם המדגם שלנו מפתיע? רווח הסמך שואל שאלה אחרת: אילו ערכים של ממוצע האוכלוסייה מתיישבים עם המדגם שלנו? המבחן מתחיל מ־μ0 והולך לממוצע. רווח הסמך מתחיל מהממוצע והולך החוצה. הכלל:

אבל רווח הסמך נותן יותר. בכיתה 2 הוא אומר לא רק "לא מובהק", אלא גם שהממוצע האמיתי יכול להיות בין 2.84 ל־3.29: קצת מתחת ל"לפעמים" או קצת מעליו. ובכיתה 1 הוא אומר שהממוצע האמיתי גבוה מ־3, אבל אולי רק ב־0.07. לכן יש היום חוקרים רבים שמעדיפים לדווח רווחי סמך, ולא רק ערך p.

רווח הסמך של ההפרש

SPSS ו־JASP מדפיסים רווח סמך להפרש בין הממוצע לערך הבדיקה, ולא לממוצע עצמו. זה אותו רווח, רק מוזז: מחסירים את ערך הבדיקה משני הקצוות. בכיתה 1, [3.07, 3.51] לממוצע הופך ל־[0.07, 0.51] להפרש. והכלל משתנה בהתאם: אם רווח הסמך של ההפרש לא כולל אפס, דוחים.

עצרו ונסו

במדגם של 9 נבדקים הממוצע 30, וסטיית התקן 6. הערך הקריטי, עם 8 דרגות חופש, הוא 2.306.   א. מהו רווח הסמך של 95% לממוצע?   ב. בלי לחשב t: האם מבחן דו־צדדי ברמת .05 ידחה את H0: μ = 26? ואת H0: μ = 35?

בדיקת התשובה
SE = 6 / √9 = 6 / 3 = 2
30 ± 2.306 · 2 = 30 ± 4.61 → [25.39, 34.61] א.

ב. 26 בתוך הרווח: לא דוחים. 35 מחוץ לרווח: דוחים. ומי שהשתמש ב־1.96 קיבל רווח צר מדי, [26.08, 33.92].

באקסל יש פונקציה שנותנת ישר את חצי הרוחב של רווח הסמך: =CONFIDENCE.T(0.05, SD, n). בכיתה 1: =CONFIDENCE.T(0.05, 0.5591, 27) נותן 0.2212. הארגומנט הראשון הוא α, לא רמת הביטחוןConfidence level. לרווח של 99% כותבים 0.01. ושימו לב לא לבלבל עם CONFIDENCE.NORM מפרק 19, שמשתמשת ב־1.96.

הסיפור המלא: למה רווח הסמך של t רחב יותר?

בכיתה 1, אילו היינו משתמשים ב־1.96, חצי הרוחב היה 1.96 · 0.1076 = 0.211 במקום 0.221. ההבדל קטן, כי 26 דרגות חופש הן כבר לא מעט. אבל בקבוצה של 10 תלמידים, 2.262 במקום 1.96 מרחיב את הרווח ב־15%. זה המחיר על האומדן של σ: פחות ודאות, רווח רחב יותר.

ועוד הערה על הפירוש. "רווח סמך של 95%" לא אומר שיש סיכוי של 95% שהממוצע האמיתי נמצא ברווח הזה. הממוצע האמיתי הוא מספר קבוע: הוא בפנים או לא. הפירוש הנכון הוא על השיטה: אילו חזרנו על המחקר הרבה פעמים, ובכל פעם בנינו רווח באותה דרך, כ־95% מהרווחים היו כוללים את הממוצע האמיתי. ראינו את זה בפרק 19.

בדקו את עצמכם3 שאלות

1.16 תלמידים, ממוצע 20, סטיית תקן 4. מהו רווח הסמך של 95% לממוצע? (הערך הקריטי עם 15 דרגות חופש: 2.131)

2.בפלט של מבחן t מול ערך בדיקה 4: Mean Difference = 0.15, ו־95% CI להפרש [−0.10, 0.40]. מה נכון?

3.רווח הסמך של 95% לממוצע לא כולל את ערך הבדיקה. האם רווח הסמך של 99% בטוח לא יכלול אותו? הסבירו.

כמה גדול ההבדל? d למדגם בודד

d = (M − μ0) / SD: ההבדל ביחידות של סטיית תקן. ב־t מחלקים בטעות התקן, וב־d בסטיית התקן, ולכן t = d · √n. אותו d נותן t גדול יותר במדגם גדול. בערך: 0.2 קטן, 0.5 בינוני, 0.8 גדול.

ערך p עונה על שאלה אחת: האם סביר שההבדל נוצר במקרה. הוא לא אומר כמה ההבדל גדול. בפרק 19 הכרנו את גודל האפקטEffect size, והנה הגרסה שלו למבחן t למדגם בודד: d של כהןCohen's d.

= M − μ0SD

בכיתה 1: d = (3.2928 − 3) / 0.5591 = 0.52. הממוצע של הכיתה גבוה מאמצע הסולם בחצי סטיית תקן בערך. אפקט בינוני. בכיתה 2: d = 0.0640 / 0.5482 = 0.12. אפקט זניח.

שימו לב לקשר בין t ל־d. ב־t מחלקים בטעות התקן, SD / √n. ב־d מחלקים בסטיית התקן עצמה. לכן:

t = d · √n

מה זה אומר? אותו אפקט בדיוק נותן t גדול יותר, ו־p קטן יותר, כשהמדגם גדל. הנה אפקט בינוני, d = 0.50, בשלושה גדלי מדגם:

ndtp (דו־צדדי)
100.501.58.148
270.502.60.015
1000.505.00< .001

ההבדל לא השתנה, רק גודל המדגם. עם 10 תלמידים הוא לא מובהק, ועם 100 הוא מובהק מאוד. וזה עובד גם הפוך: במדגם ענק גם הבדל זניח יוצא מובהק. לכן מדווחים תמיד את שניהם: ערך p, וגודל אפקט.

הסימנים של כהן (0.2 קטן, 0.5 בינוני, 0.8 גדול) הם סימני דרך ולא חוק. השאלה החשובה היא אם ההבדל משמעותי בהקשר: האם חצי נקודה בסולם של 1 עד 5 חשובה לבית הספר? על זה הסטטיסטיקה לא עונה לבד.

הסיפור המלא: d במדגם קטן, ורווח סמך ל־d

d שמחושב ממדגם נוטה להיות קצת גדול מדי, במיוחד במדגמים קטנים. לכן יש לו גרסה מתוקנת, g של הדג׳ס (Hedges' g), שמכווצת אותו מעט. בכיתה 1, 0.52 הופך ל־0.51. עם 200 תלמידים ההבדל כבר זניח. SPSS מציג את שניהם, בטבלת One-Sample Effect Sizes.JASP מציג את d.באקסל מחשבים אותם בנוסחה.

וגם ל־d יש רווח סמך. בכיתה 1 הוא בין 0.12 ל־0.92: האפקט יכול להיות קטן מאוד, ויכול להיות גדול. 27 תלמידים לא מספיקים כדי לדעת. כשמשווים בין מחקרים, רווח הסמך של d חשוב לפעמים יותר מ־d עצמו.

בדקו את עצמכם3 שאלות

1.במחקר עם 100 תלמידים: ממוצע 82, ערך בדיקה 80, סטיית תקן 10. מהם d ו־t?

2.דווח t(35) = 3.00. מהו d?

3.מחקר עם 5,000 תלמידים מצא שהממוצע שונה מאמצע הסולם, p < .001, עם d = 0.05. מה הייתם אומרים על התוצאה?

הנחות המבחן, ומאיפה בא ערך הבדיקה

שלוש הנחות: אי־תלות בין הנבדקים, סולם רווחInterval scale או מנה, ונורמליות של האוכלוסייה, או מדגם גדול (30 ומעלה). וערך הבדיקה צריך להיות קבוע מראש ובעל משמעות: אמצע הסולם, נורמה מפורסמת, המלצה או תקן. לא ערך שחושב מאותם נתונים.

מאיפה בא ערך הבדיקה?

מבחן t למדגם בודד הוא לא מבחן נפוץ במחקר. כדי לשאול "האם המדגם שלי שונה מהאוכלוסייה?", צריך לדעת משהו על האוכלוסייה, ובדרך כלל אין לנו את זה. מאיפה נדע את רמת החרדה הממוצעת של כל הילדים בישראל? לכן הוא נלמד בעיקר כנקודת מוצא למבחנים של פרק 21. ובכל זאת, יש מצבים שבהם הוא בדיוק מה שצריך:

מה לא? ערך שנבחר אחרי שראיתם את הנתונים, או הממוצע של אותו מדגם. אם הממוצע הוא 3.20 ותבדקו מול 3.19, כמובן שלא תדחו. ואם תחפשו ערך שדווקא כן "יוצא מובהק", גם תמצאו. ערך הבדיקה חייב להגיע מבחוץ.

ההנחות

הנחהמה היא אומרתאם היא לא מתקיימת
אי־תלות בין הנבדקיםהציון של נבדק אחד לא משפיע על של אחר. בודקים לפי מערך המחקרהמבחן לא מתאים. למשל, אותם אנשים פעמיים: מבחן מזווג (פרק 21)
סולם רווח או מנהInterval scaleיש משמעות לממוצע ולסטיית התקן (פרק 6)פריט בודד בסולם סדר: מבחן א־פרמטרי (פרק 22)Ordinal scale · Nonparametric test
נורמליותהציונים באוכלוסייה מתפלגים נורמלית. בודקים בהיסטוגרמה, בהטיה (פרק 12), בתרשים Q-Q (פרק 14), ובמבחן Shapiro-Wilkמ־30 נבדקים ומעלה, לא נורא. במדגם קטן ומוטה: מבחן א־פרמטרי (פרק 22)

למה 30 נבדקים "מצילים" את הנורמליות? כי מה שהמבחן באמת צריך הוא שהממוצעים יתפלגו נורמלית, כלומר התפלגות הדגימהSampling distribution. ולפי משפט הגבול המרכזיCentral limit theorem (פרק 17), עם מדגם גדול מספיק זה קורה כמעט בכל צורה של התפלגות.

מבחן Shapiro-Wilk בודק אם הנתונים סוטים מנורמליות. השערת האפס שלו היא שההתפלגות נורמלית, ולכן תוצאה מובהקתStatistically significant (p < .05) פירושה סטייה מנורמליות. בקשיבות של 200 התלמידים: W = .992, p = .382. אין עדות לסטייה. גם ההטיה קטנה, −0.17.

הסיפור המלא: פרדוקס מבחני הנורמליות, ותלמידים שלומדים יחד

במדגם גדול, מבחן Shapiro-Wilk מובהק כמעט תמיד, גם על סטיות זעירות. אבל דווקא שם הנורמליות כמעט לא חשובה, בגלל משפט הגבול המרכזי. ובמדגם קטן, שבו הנורמליות באמת חשובה, למבחן אין מספיק עוצמה, והוא מפספס גם סטיות גדולות. המבחן רגיש בדיוק כשלא צריך, ועיוור בדיוק כשצריך. לכן מסתכלים קודם על ההיסטוגרמה ועל תרשים Q-Q, ולא רק על ערך p. דוגמה מהנתונים שלנו: בחרדה של 200 התלמידים, Shapiro-Wilk מובהק (p = .011), אבל ההטיה רק 0.22. עם 200 נבדקים ממשיכים במבחן t בלב שקט. נרחיב על כך בפרק 21. יש עוד מבחן נורמליות, Kolmogorov-Smirnov, שעובד באותו עיקרון, אבל Shapiro-Wilk מזהה סטיות טוב יותר.

ועוד הנחה, שקל לפספס: אי־תלות. במחקר שלנו התלמידים לומדים בכיתות. לתלמידים באותה כיתה יש אותה מורה, אותה אווירה, ואולי גם השפעה זה על זה. לכן הם דומים זה לזה יותר משני ילדים אקראיים, והמדגם "שווה" פחות מ־200 תלמידים בלתי תלויים. כשמתעלמים מזה, טעות התקן יוצאת קטנה מדי. יש לזה פתרונות, כמו מודלים רב־רמתיים, שנפגוש בפרק 36, במודלים מעורביםLinear mixed model. בינתיים, מספיק לזכור לשאול: מי במדגם קשור למי?

ומה עם הסולם? פריט בודד בשאלון, מ"אף פעם" עד "תמיד", הוא בסולם סדר. ממוצע של הרבה פריטים מתנהג כמו סולם רווח, ולכן נהוג "לסלוח" ולהשתמש במבחן t (פרק 6).

בדקו את עצמכם4 שאלות

1.שאלון שביעות רצון מהמורה בסולם של 0 עד 10. מהו אמצע הסולם?

2.מהי השערת האפס של מבחן Shapiro-Wilk?

3.באיזה מצב הנחת אי־התלות של מבחן t למדגם בודד נפגעת בבירור?

4.12 תלמידים, וההיסטוגרמהHistogram של הציונים מוטה מאוד ימינה, עם ערך קיצוני אחד. מה כדאי לעשות?

בתוכנה: כל 200 התלמידים מול "לפעמים"

חוזרים לשאלת הפתיחה. משתנה: mind_pre, הקשיבות לפני התוכנית (ממוצע 15 פריטים, 1 עד 5). ערך הבדיקה: 3. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות. המספרים זהים בשלוש התוכנות.

החישוב ביד
M = 3.2030,   SD = 0.5464,   n = 200
SE = 0.5464 / √200 = 0.5464 / 14.142 = 0.0386
t = (3.2030 − 3) / 0.0386 = 0.2030 / 0.0386 = 5.26,   df = 199
tcrit = 1.972,   p < .001
CI95% = 3.2030 ± 1.972 · 0.0386 = 3.2030 ± 0.0762 → [3.13, 3.28]
d = 0.2030 / 0.5464 = 0.37
עגלו רק בסוף. עם 0.0386 מעוגל יוצא 5.26, וזה גם מה שהתוכנה מקבלת (5.255).

ל־Analysis ToolPak של אקסל אין כלי למבחן t למדגם בודד. לא נורא: בונים אותו בנוסחאות, וכך גם רואים כל שלב. mind_pre היא עמודה AH, שורות 2 עד 201. את החישובים כותבים בעמודה ריקה, למשל BF, ובעמודה BE לידה את השמות.

mind_pre (AH2:AH201), test value = 3

CellFormulaResult
BF2 (M)=AVERAGE(AH2:AH201)3.2030
BF3 (SD)=STDEV.S(AH2:AH201)0.5464
BF4 (n)=COUNT(AH2:AH201)200
BF5 (test value)33
BF6 (SE)=BF3/SQRT(BF4)0.0386
BF7 (t)=(BF2-BF5)/BF65.26
BF8 (df)=BF4-1199
BF9 (p, two-tailed)=T.DIST.2T(ABS(BF7),BF8)3.79E-07
BF10 (t critical)=T.INV.2T(0.05,BF8)1.972
BF11 (half width)=CONFIDENCE.T(0.05,BF3,BF4)0.0762
BF12 (CI lower)=BF2-BF113.1269
BF13 (CI upper)=BF2+BF113.2792
BF14 (d)=(BF2-BF5)/BF30.37
BF7, BF8
סטטיסטי tt statistic ודרגות החופש: t(199) = 5.26.
BF9
ערך p דו־צדדי, בכתיב מדעי: 0.000000379. כלומר p < .001. בלי ABS, t שלילי היה נותן שגיאה.
BF12, BF13
רווח הסמך לממוצע: [3.13, 3.28]. לא כולל את 3.
BF14
d של כהןCohen's d: 0.37, בין קטן לבינוני.

היתרון של הגיליון הזה: מחליפים את ערך הבדיקה ב־BF5, או את הטווח, וכל השאר מתעדכן לבד. לכיתה 1 בלבד, למשל, הטווח הוא AH2:AH28.

הסיפור המלא: טריק עם Data Analysis

אם בכל זאת רוצים כלי מוכן: מוסיפים עמודה שבה בכל שורה כתוב ערך הבדיקה, 3, ומריצים Data > Data Analysis > t-Test: Paired Two Sample for Means על mind_pre ועל עמודת ה־3. ההפרשים הם בדיוק x − 3, וסטיית התקן שלהם היא סטיית התקן של mind_pre. לכן t, דרגות החופש וערך p יוצאים זהים. מאותה סיבה גם =T.TEST(AH2:AH201, BG2:BG201, 2, 1), כשעמודה BG מלאה ב־3, נותן את ערך p. זה גם רמז לפרק הבא: המבחן המזווג הוא מבחן t למדגם בודד על ההפרשים.

  1. Analyze > Compare Means > One-Sample T Test
  2. Test Variable(s): mind_pre. ב־Test Value מקלידים 3 (ברירת המחדל היא 0).
  3. מסמנים Estimate effect sizes ולוחצים OK. ב־Options אפשר לשנות את רמת הביטחוןConfidence level של רווח הסמך.

One-Sample Statistics

NMeanStd. DeviationStd. Error Mean
mind_pre2003.2030.54642.03864

One-Sample Test (Test Value = 3)

t 1dfOne-Sided pTwo-Sided p 2Mean Difference95% CI Lower 3Upper
mind_pre5.255199<.001<.001.20305.1269.2792

One-Sample Effect Sizes

StandardizerPoint Estimate95% CI LowerUpper
mind_preCohen's d.54642.372.228.514
Hedges' correction.54847.370.227.513
1 · t, df
t(199) = 5.26.
2 · Two-Sided p
ערך p דו־צדדי. SPSS כותב <.001 כשהוא קטן מאלפית. One-Sided p נקרא רק כשההשערה נקבעה מראש עם כיוון.
Mean Difference
הממוצע פחות ערך הבדיקה: 3.2030 − 3 = 0.203. חיובי: הממוצע מעל 3.
3 · 95% CI
רווח הסמך של ההפרש, לא של הממוצע: [0.13, 0.28]. לא כולל 0, ולכן מובהק. כדי לקבל את רווח הסמך לממוצע מוסיפים 3: [3.13, 3.28].
Cohen's d
0.37. Standardizer היא סטיית התקן שבה חילקו, .546. Hedges' correction הוא g של הדג׳ס, כמעט זהה במדגם גדול.

טיפ: כדי לקבל ישר את רווח הסמך לממוצע עצמו, הריצו את אותו מבחן עם Test Value 0. ה־Mean Difference יהיה הממוצע, ורווח הסמך יהיה של הממוצע. את t ואת p של הריצה הזו לא קוראים: הם בודקים אם הממוצע שונה מ־0.

כך נראה הפלט, בגרסה 27 ואילך (בגרסאות ישנות יותר יש עמודה אחת, Sig. (2-tailed), ואין טבלת Effect Sizes).

  1. T-Tests > One Sample T-Test (Classical).
  2. Variables: mind_pre. ב־Test value מקלידים 3. תחת Tests מסומן Student.
  3. תחת Additional Statistics מסמנים Location estimate עם Confidence interval, Effect size ו־Descriptives. תחת Assumption Checks: Normality.

One Sample T-Test

tdfpMean Difference95% CI LowerUpperCohen's d
mind_pre5.255199< .0010.2030.1270.2790.372

Note. For the Student t-test, the alternative hypothesis specifies that the mean is different from 3.

Descriptives

NMeanSDSE
mind_pre2003.2030.5460.039

Test of Normality (Shapiro-Wilk)

Wp
mind_pre0.992.382
t, df, p
t(199) = 5.26, p < .001. ה־Note מתחת לטבלה מזכיר מה הייתה השערת המחקר: שונה מ־3, כלומר דו־צדדית.
Mean Difference ו־95% CI
ההפרש מערך הבדיקה, ורווח הסמך שלו: [0.13, 0.28]. לא כולל 0.
Cohen's d
0.37: בין קטן לבינוני.
Shapiro-Wilk
p = .382, לא מובהק: אין עדות לסטייה מנורמליות. ועם 200 תלמידים זה ממילא לא קריטי.

להשערה חד־צדדית בוחרים תחת Alt. Hypothesis את > Test value או < Test value, לפני שמסתכלים על התוצאה. כדי לנתח רק כיתה אחת, לוחצים על כותרת העמודה class_id ומשאירים מסומן רק את הכיתה הרצויה (מסנן).

ב־JASP יש תחת Tests גם אפשרות Z Test. היא מבקשת להקליד את סטיית התקן של האוכלוסייה, σ, כלומר זה מבחן z מפרק 18. מתאים רק כש־σ באמת ידועה.

בגרסאות שונות של JASP סדר העמודות ושמות האפשרויות עשויים להשתנות מעט.

בדקו את עצמכם3 שאלות

1.באקסל בניתם את המבחן בנוסחאות, אבל בתא של ערך הבדיקה, BF5, נשאר 0. יצא t = 82.9. מה קרה?

1.ב־SPSS הריצו One-Sample T Test על mind_pre, ושכחו לשנות את Test Value. יצא t = 82.9. מה קרה?

1.ב־JASP הריצו One Sample T-Test על mind_pre, ושכחו לשנות את Test value. יצא t = 82.9. מה קרה?

2.פלט של מבחן t מול 3: t = −2.30, df = 40, p = .027, Mean Difference = −0.35, Cohen's d = −0.36. כתבו משפט דיווח.

3.באקסל, =T.DIST.2T(-2.1, 30) מחזיר שגיאה. מה הפתרון?

3.ב־SPSS, ב־Compute Variable, איזה ביטוי נותן ערך p דו־צדדי ל־t = −2.1 עם 30 דרגות חופש?

3.ב־JASP, בעמודה מחושבת בקוד R, איזה ביטוי נותן ערך p דו־צדדי ל־t = −2.1 עם 30 דרגות חופש?

איך מדווחים

משפט אחד, עם כל מה שהקורא צריך: הממוצע וסטיית התקן, ערך הבדיקה ומאיפה הוא בא, הכיוון במילים, t עם דרגות החופש, ערך p, גודל אפקט, ואם אפשר רווח סמך.

ממוצע הקשיבות של התלמידים לפני התוכנית (M = 3.20, SD = 0.55) היה גבוה באופן מובהק מאמצע הסולם, 3 ("לפעמים"), וגודל האפקט בין קטן לבינוני, t(199) = 5.26, p < .001, d = 0.37, 95% CI [3.13, 3.28].

בכיתה 2 לא נמצא הבדל מובהק בין ממוצע הקשיבות (M = 3.06, SD = 0.55) לבין אמצע הסולם, t(24) = 0.58, p = .565, d = 0.12, 95% CI [2.84, 3.29].

כמה כללים של APA: t ו־p באותיות נטויות. ערך p בלי אפס לפני הנקודה, וכשהוא קטן מאלפית, p < .001 ולא p = .000. t ו־d בשתי ספרות אחרי הנקודה. ואם t יצא שלילי, אפשר לכתוב אותו עם המינוס או בלי, כל עוד הכיוון כתוב במילים. רווח הסמך כאן הוא של הממוצע. אם מדווחים את רווח הסמך של ההפרש, כפי שהוא מופיע בפלט, כותבים זאת במפורש.

טעויות נפוצות

בדקו את עצמכם

סיכום

t = (M − μ0) / (SD / √n),   df = n − 1
CI95% = M ± tcrit · SD / √n
d = (M − μ0) / SD,   t = d · √n

מונחים חדשים

מבחן t למדגם בודדהתפלגות tדרגות חופשסטטיסטי tערך קריטי של tערך הבדיקהרווח סמך עם td של כהןמבחן Shapiro-Wilkמבחן Kolmogorov-SmirnovT.DIST.2TT.DIST.RTT.DISTT.INV.2TCONFIDENCE.T

שאלות לדוגמה, עם פתרונות

שאלות בסגנון מבחן, מהקלה אל הקשה. נסו לפתור לבד, ורק אז פתחו את הפתרון.

  1. לכל מצב, קבעו אם מתאים מבחן z או מבחן t למדגם בודד, וכמה דרגות חופש יש (אם יש). א. 40 ילדים עברו מבחן אינטליגנציה מתוקנן (ממוצע 100, סטיית תקן 15 באוכלוסייה), ובודקים אם הממוצע שלהם שונה מ־100. ב. 40 ילדים דירגו את שביעות הרצון שלהם מבית הספר בסולם של 1 עד 7, ובודקים אם הממוצע שונה מ־4. ג. אותם 40 ילדים, אבל החוקרת השתמשה בסטיית התקן של המדגם, 14.2, במבחן האינטליגנציה.

    בדיקת התשובה

    א. מבחן z: סטיית התקן באוכלוסייה ידועה, 15, ולכן אין צורך לאמוד אותה. אין דרגות חופש. ב. מבחן t, עם 40 − 1 = 39 דרגות חופש: לסולם הזה אין סטיית תקן ידועה באוכלוסייה. ג. כשמשתמשים בסטיית התקן של המדגם, זה מבחן t עם 39 דרגות חופש. אבל כשהמבחן מתוקנן ו־σ ידועה, עדיף מבחן z: הוא משתמש במידע המדויק, ואין צורך לשלם על אומדן.

  2. הממוצע הארצי בשאלון מסוגלות של מורים הוא 3.8. 16 מורות שסיימו השתלמות קיבלו ממוצע 4.2, עם סטיית תקן 0.6. א. האם המורות שונות מהממוצע הארצי? (α = .05, דו־צדדי) ב. בנו רווח סמך של 95% לממוצע. ג. חשבו את d.

    בדיקת התשובה
    H0: μ = 3.8    H1: μ ≠ 3.8
    SE = 0.6 / √16 = 0.6 / 4 = 0.15
    t = (4.2 − 3.8) / 0.15 = 0.4 / 0.15 = 2.67,   df = 15
    tcrit = 2.131,   2.67 > 2.131 → דוחים,   p = .018
    CI = 4.2 ± 2.131 · 0.15 = 4.2 ± 0.32 → [3.88, 4.52] ב.
    d = 0.4 / 0.6 = 0.67 ג.

    המסוגלות של המורות גבוהה באופן מובהק מהממוצע הארצי, באפקט בינוני עד גדול. רווח הסמך לא כולל את 3.8, בהתאם למבחן. אבל זה לא מוכיח שההשתלמות העלתה את המסוגלות: אולי נרשמו אליה מלכתחילה מורות עם מסוגלות גבוהה.

  3. ההמלצה היא שתלמידים יקראו לפחות 20 דקות ביום. שישה תלמידים רשמו כמה דקות קראו ביום, בממוצע: 25, 18, 30, 22, 27, 28. המורה רוצה לבדוק אם הם קוראים יותר מההמלצה, וקבעה את הכיוון מראש. א. נסחו השערות. ב. חשבו t, דרגות חופש ו־d. ג. מה ההחלטה, חד־צדדית ודו־צדדית?

    בדיקת התשובה
    H0: μ ≤ 20    H1: μ > 20 א.
    M = 150 / 6 = 25
    0, −7, 5, −3, 2, 3 הסטיות מהממוצע
    SS = 0 + 49 + 25 + 9 + 4 + 9 = 96
    SD = √(96 / 5) = √19.2 = 4.382
    SE = 4.382 / √6 = 4.382 / 2.449 = 1.789
    t = (25 − 20) / 1.789 = 2.80,   df = 5,   d = 5 / 4.382 = 1.14 ב.
    חד־צדדי: tcrit = 2.015,   p = .019 → דוחים ג.
    דו־צדדי: tcrit = 2.571,   p = .038 → דוחים

    בשתי הדרכים דוחים: התלמידים קוראים יותר מההמלצה, באפקט גדול. אבל שישה תלמידים הם מדגם זעיר. ובמדגם כזה הנורמליות חשובה: עם שישה ערכים קשה מאוד לבדוק אותה.

  4. האם התלמידים במחקר חרדים, או רגועים? שאלון החרדה הוא בסולם של 1 (אף פעם) עד 4 (תמיד). קראו את הפלט של SPSS וענו: א. מהו ערך הבדיקה, ולמה דווקא הוא? ב. מה המסקנה, ולאיזה כיוון? ג. מהו רווח הסמך של 95% לממוצע עצמו? ד. חשבו את d מהטבלאות. ה. מבחן Shapiro-Wilk על anx_pre יצא p = .011. האם צריך לוותר על מבחן t?

    One-Sample Statistics

    NMeanStd. DeviationStd. Error Mean
    anx_pre2002.2356.51886.03669

    One-Sample Test (Test Value = 2.5)

    tdfOne-Sided pTwo-Sided pMean Difference95% CI LowerUpper
    anx_pre-7.206199<.001<.001-.26438-.3367-.1920
    בדיקת התשובה

    א. 2.5, אמצע הסולם: (1 + 4) / 2 = 2.5. ממוצע מעליו פירושו נטייה לחרדה, ומתחתיו נטייה לרוגע.

    ב. t(199) = −7.21, p < .001. ה־Mean Difference שלילי: הממוצע, 2.24, נמוך מ־2.5. החרדה של התלמידים נמוכה באופן מובהק מאמצע הסולם. בממוצע, הם קרובים יותר ל"לפעמים" מאשר ל"לעיתים קרובות".

    [−0.3367 + 2.5,   −0.1920 + 2.5] = [2.16, 2.31] ג. מוסיפים את ערך הבדיקה לשני הקצוות
    d = −0.26438 / 0.51886 = −0.51 ד. Mean Difference חלקי Std. Deviation
    t = −0.26438 / 0.03669 = −7.21 בדיקה: חלקי Std. Error Mean מקבלים את t

    אפקט בינוני. ה. לא. עם 200 תלמידים, מבחן Shapiro-Wilk רגיש מאוד, גם לסטיות זעירות. ההטיה של anx_pre קטנה (0.22), ולפי משפט הגבול המרכזי הממוצעים מתפלגים נורמלית בכל מקרה. ממשיכים במבחן t.

    דיווח: "החרדה של התלמידים לפני התוכנית (M = 2.24, SD = 0.52) הייתה נמוכה באופן מובהק מאמצע הסולם, 2.5, t(199) = −7.21, p < .001, d = −0.51, 95% CI [2.16, 2.31]."

  5. במאמר נכתב רק: "בקבוצה של 25 תלמידים, רווח הסמך של 95% לממוצע הקשיבות היה [2.84, 3.29]". א. האם הממוצע שונה באופן מובהק מ־3 (דו־צדדי, α = .05)? ומ־2.8? ב. שחזרו את הממוצע, את טעות התקן ואת סטיית התקן. ג. חשבו את t מול 3. ד. כמה תלמידים, בערך, היו צריכים להיות בקבוצה כדי שרווח הסמך יהיה ברוחב חצי?

    בדיקת התשובה

    א. 3 בתוך הרווח: לא מובהק. 2.8 מחוץ לרווח: מובהק. לא צריך שום חישוב.

    M = (2.84 + 3.29) / 2 = 3.065 ב. הממוצע באמצע הרווח
    חצי רוחב = (3.29 − 2.84) / 2 = 0.225
    tcrit (24 df) = 2.064   →   SE = 0.225 / 2.064 = 0.109
    SD = SE · √n = 0.109 · 5 = 0.545
    t = (3.065 − 3) / 0.109 = 0.60 ג. עם המספרים המעוגלים של המאמר. מהנתונים המלאים: 0.58

    ד. הרוחב פרופורציונלי ל־1 / √n. כדי לחצות אותו צריך להכפיל את √n, כלומר פי 4 תלמידים: בערך 100. (בדיוק קצת פחות, כי עם יותר דרגות חופש גם הערך הקריטי יורד מ־2.064 ל־1.984.)

תרגול עם הנתונים

פתחו את קובץ המחקר ואת מילון המשתנים.

הקבצים עצמם נמצאים גם בתיקיית data בחבילת הספר.

  1. האם ההרגשה בכיתה לפני התוכנית (clim_pre, 1 עד 5) שונה מאמצע הסולם? דווחו במשפט אחד.
    בדיקת התשובה

    ערך הבדיקה 3. "ההרגשה בכיתה (M = 3.47, SD = 0.65) הייתה גבוהה באופן מובהק מאמצע הסולם, t(199) = 10.26, p < .001, d = 0.73, 95% CI [3.38, 3.56]." אפקט בינוני עד גדול: התלמידים מרגישים בכיתה טוב יותר מהאמצע.

  2. ובעיות הקשב לפני התוכנית (attn_pre, 1 עד 5, ציון גבוה = יותר בעיות)? שימו לב לכיוון.
    בדיקת התשובה

    M = 2.48, SD = 0.71, t(199) = −10.28, p < .001, d = −0.73. הממוצע נמוך מ־3, ובשאלון הזה ציון נמוך פירושו פחות בעיות קשב. כלומר, בממוצע התלמידים מדווחים על מעט בעיות קשב.

  3. בכמה מתוך שמונה הכיתות ממוצע הקשיבות לפני התוכנית (mind_pre) גבוה באופן מובהק מ־3? באקסל, שנו את הטווח בגיליון של קטע "בתוכנה" לכל כיתה (הנתונים ממוינים לפי class_id).ב־SPSS, Data > Split File לפי class_id, ואז One-Sample T Test.ב־JASP, מסננים כל פעם כיתה אחרת בכותרת העמודה class_id.
    בדיקת התשובה

    בשלוש: כיתה 1 (t(26) = 2.72, p = .011), כיתה 4 (t(28) = 3.31, p = .003) וכיתה 6 (t(25) = 3.84, p < .001). בכל שאר הכיתות הממוצע מעל 3, אבל לא באופן מובהק. ובכל המדגם יחד, ההבדל מובהק מאוד. זה בדיוק מה ש־t = d · √n אומר: עם 200 תלמידים יש הרבה יותר עוצמה מאשר עם 25.

  4. בקבוצת הביקורת (group = 0), בדקו את הקשיבות מול 3 לפני התוכנית ואחריה (mind_pre, mind_post). מה השתנה?
    בדיקת התשובה

    לפני: M = 3.18, t(73) = 2.71, p = .008, d = 0.32. אחרי: M = 3.02, t(73) = 0.27, p = .790, d = 0.03. בקבוצת הביקורת הקשיבות ירדה עד כמעט בדיוק "לפעמים". אבל שימו לב: שני מבחנים נפרדים מול 3 לא בודקים אם הקשיבות השתנתה. לשאלה הזו צריך מבחן מזווג, בפרק 21.

  5. בדקו את הנורמליות של mind_pre: היסטוגרמה, הטיה ומבחן Shapiro-Wilk. האם יש בעיה?
    בדיקת התשובה

    ההיסטוגרמה בצורת פעמון בערך, ההטיה −0.17, ו־Shapiro-Wilk לא מובהק: W = .992, p = .382. אין בעיה, וגם אילו הייתה סטייה קטנה, 200 תלמידים הם מדגם גדול מספיק.

בפרק הבא: מבחני t לשני מדגמים. תגלו שהמבחן למדגמים מזווגיםDependent samples הוא בדיוק המבחן של הפרק הזה, על ההפרשים בין "לפני" ל"אחרי", עם ערך בדיקה 0. ובקבוצות בלתי תלויותIndependent samples אותו היגיון של אות חלקי רעש, רק עם שני ממוצעים, ולכן שתי דרגות חופש פחות.

מקורות: Student. (1908). The probable error of a mean. Biometrika, 6(1), 1–25. · Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Erlbaum. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y