סטטיסטיקה מ־0 עד 100בטאתוכנהעומק

חלק ג: מהמדגם לאוכלוסייה · פרק 21

מבחני t לשני מדגמים

כמעט כל מחקר בחינוך משווה שני דברים: לפני מול אחרי, תוכנית מול ביקורת, בנות מול בנים. בפרק הזה נלמד את שני המבחנים שעונים על השאלות האלה, ואת השאלה הראשונה שצריך לשאול לפניהם.

שאלת הפתיחה

האם תוכנית הקשיבות באמת הורידה את החרדה של התלמידים?

ובאותו מחקר, עוד שאלה: האם בנות חרדות יותר מבנים? בסוף הפרק תדעו לענות על שתיהן, ביד ובתוכנה, ותדעו גם מה אי אפשר להסיק מהתשובות.

בסוף הפרק תוכלו

המחקר שילווה אותנו

200 תלמידים בכיתות ד׳ ו־ה׳, בשמונה כיתות, בשלושה בתי ספר. בבית ספר אחד המורות השתתפו בתוכנית קשיבות וחמלה, והתלמידים לא: זו התוכנית העקיפה. בבית ספר שני השתתפו גם המורות וגם התלמידים: התוכנית המשולבת. והשלישי היה קבוצת ביקורת. התלמידים מילאו שאלונים לפני התוכנית, מיד אחריה, וחצי שנה אחריה: שביעות רצון מהחיים, קשיבות, חרדה, בעיות קשב, תלונות גופניות, הקשר עם המורה וההרגשה בכיתה. הנתונים מדומים, אבל מבנה המחקר בהשראת מחקר אמיתי שנערך בבתי ספר בישראל (Tarrasch & Berger, 2022).

אותו קובץ ילווה אתכם גם בפרקים הבאים: בניתוח שונותOne-way ANOVA, במתאםCorrelation וברגרסיה. הוא נמצא בסוף הפרק, בקטע תרגול עם הנתונים.

השאלה הראשונה: אותם אנשים, או אנשים אחרים?

לפני שבוחרים מבחן שואלים: האם כל ערך בקבוצה אחת מזווג לערך מסוים בקבוצה השנייה? אם כן, המדגמים תלויים (מזווגים). אם לא, הם בלתי תלויים.

שתי השאלות מהפתיחה נשמעות דומות: בשתיהן משווים שני ממוצעים. אבל הן שונות באופן מהותי.

בשאלה על החרדה, אותם תלמידים נמדדו פעמיים: לפני התוכנית ואחריה. לכל ציון "אחרי" יש בן זוג אחד ויחיד, הציון "לפני" של אותו תלמיד. מדגמים כאלה נקראים מדגמים תלוייםDependent samples, או מזווגים.

בשאלה על בנות ובנים משווים שתי קבוצות של ילדים שונים. אין שום סיבה לחבר בת מסוימת לבן מסוים. אלה מדגמים בלתי תלוייםIndependent samples.

מבחן קטן שעובד כמעט תמיד: דמיינו את קובץ הנתונים. האם אפשר לחבר כל שורה בקבוצה א׳ לשורה מסוימת בקבוצה ב׳? אם כן, תלויים. אם לא, בלתי תלויים.

מדגמים תלויים (מזווגים)מדגמים בלתי תלויים
מי נמדדאותם אנשים פעמיים, או זוגות טבעיים: תאומים, הורה וילדשתי קבוצות של אנשים שונים
גודל הקבוצותתמיד שווהיכול להיות שונה
בקובץ הנתוניםשתי עמודות, ותלמיד אחד בכל שורהעמודה אחת לציון, ועמודה אחת לקבוצה
דוגמה מהמחקרחרדה לפני ואחרי התוכניתחרדה: בנות מול בנים
הסיפור המלא

"תלויים" כאן אינו מושג פסיכולוגי. הוא אומר שהמדידות קשורות זו לזו: מי שהיה חרד לפני התוכנית כנראה יהיה חרד יחסית גם אחריה. הקשר הזה הוא בדיוק מה שהמבחן המזווג מנצל, ותכף נראה איך. ולכן גם זוגות טבעיים נחשבים תלויים: לתאומים יש הרבה במשותף, והמדידות שלהם דומות יותר משל שני ילדים אקראיים.

בדקו את עצמכם3 שאלות

1.מחנכת משווה את הציונים במבחן הבנת הנקרא של התלמידים בכיתה ד׳1 לציונים של התלמידים בכיתה ד׳2. אילו מדגמים אלה?

2.כל תלמיד דירג את עצמו בקשב בשיעור, מ־1 עד 5, והמורה דירגה כל תלמיד באותו סולם. משווים בין ממוצע הדירוג העצמי לממוצע הדירוג של המורה. אילו מדגמים אלה?

3.קיבלתם קובץ עם 31 ציונים בקבוצה אחת ו־28 בשנייה. חבר מציע להריץ מבחן למדגמים מזווגיםDependent samples. מה תענו לו?

מדגמים מזווגים: מכל זוג עושים מספר אחד

לכל נבדק מחשבים הפרש, = לפני − אחרי. מעכשיו יש מדגם אחד של הפרשים, ובודקים אם ממוצע ההפרשים שונה מאפס. זה מבחן t למדגם בודדOne-sample t test, על ההפרשים.

הטריק של המבחן המזווג פשוט מאוד. לכל תלמיד מחשבים הפרש: הציון לפני, פחות הציון אחרי. עכשיו אין לנו שתי עמודות, אלא עמודה אחת של הפרשים. והשאלה הופכת לשאלה שכבר מכירים מהפרק הקודם: האם ממוצע ההפרשים שונה מאפס?

אם התוכנית לא שינתה כלום, חלק מההפרשים יהיו חיוביים, חלק שליליים, והממוצע שלהם יהיה קרוב לאפס. זו השערת האפסNull hypothesis.

: D = 0     : D ≠ 0
t = MDSDD / √n     df = n − 1

כאן הוא ממוצע ההפרשים, היא סטיית התקן של ההפרשים, ו־ הוא מספר הזוגות. במכנה, טעות התקןStandard error של ממוצע ההפרשים, בדיוק כמו בפרק 20.

דוגמה פתורה: שישה משתתפים בסדנה

שישה משתתפים מילאו שאלון חרדה לפני סדנה ואחריה. האם הסדנה שינתה את החרדה? ( = .05)

משתתףלפניאחריD = לפני − אחרי
11082
212111
3990
415123
511101
613103
MD = 10 / 6 = 1.667 ממוצע ההפרשים
SDD = 1.211 סטיית התקן של ששת ההפרשים, עם n − 1
SE = 1.211 / √6 = 1.211 / 2.449 = 0.494 טעות התקן של ממוצע ההפרשים
t = 1.667 / 0.494 = 3.37,   df = 6 − 1 = 5
p = T.DIST.2T(3.37, 5) = .020 ערך p דו־צדדי, באקסל
d = MD / SDD = 1.667 / 1.211 = 1.38 גודל האפקט (בהמשך הפרק)

מסקנה: ערך pp-value קטן מ־.05, ולכן דוחים את השערת האפסNull hypothesis. החרדה השתנתה אחרי הסדנה. לאיזה כיוון? ממוצע ההפרשים חיובי, ו־D הוא לפני פחות אחרי, ולכן החרדה ירדה.

שימו לב לכיוון החיסור

אפשר לחשב לפני פחות אחרי, ואפשר אחרי פחות לפני. התוצאה זהה, רק הסימן מתהפך. בספר נחשב תמיד המדידה הראשונה פחות השנייה, כי כך עושות גם SPSS ו־JASP כשמכניסים את "לפני" ראשון. ובכל מקרה, את כיוון ההבדל קובעים מהממוצעים, לא מהסימן של t.

הסיפור המלא: למה זה עובד כל כך טוב?

השונות של ההפרש בין שתי מדידות תלויה בקשר ביניהן:

SDD² = SD1² + SD2² − 2r · SD1 · SD2

ככל שהמתאם בין "לפני" ל"אחרי" גבוה יותר, האיבר שמחסירים גדול יותר, וסטיית התקן של ההפרשים קטנה יותר. כלומר, ההבדלים הקבועים בין התלמידים (מי חרד יותר באופן כללי) יוצאים מהחישוב. כל תלמיד משמש ביקורת של עצמו, ונשאר רק השינוי. נראה את זה במספרים בקטע הבא.

בדקו את עצמכם4 שאלות

1.חמישה תלמידים רשמו כמה דקות קראו ביום, לפני תוכנית עידוד קריאה ואחריה. לפני: 20, 15, 30, 25, 10. אחרי: 25, 18, 32, 31, 14. חשבו את t, עם D = לפני − אחרי.

2.מה בדיוק אומרת השערת האפס במבחן t למדגמים מזווגיםPaired-samples t test?

3.משווים את הקשב של 12 זוגות תאומים: אחד מכל זוג למד בכיתה קטנה, והשני בכיתה רגילה. כמה דרגות חופש יש במבחן?

4.בתוכנית המשולבת, 75 תלמידים מילאו את שאלון בעיות הקשב לפני ואחרי. ממוצע ההפרשים (לפני פחות אחרי) הוא 0.2800, וסטיית התקן שלהם 0.4817. חשבו את t ואת דרגות החופש. מה קרה לבעיות הקשב?

למה לא פשוט להשוות את שני הממוצעים?

אם מנתחים נתונים מזווגים כאילו היו שתי קבוצות נפרדות, מאבדים עוצמה. בתוכנית העקיפה: המבחן הנכון נותן t(50) = 3.55, p < .001. המבחן השגוי נותן t(100) = 1.73, p = .086.

בתוכנית העקיפה, שבה רק המורות התאמנו, ירדה החרדה של התלמידים בממוצע מ־2.17 ל־1.98, ירידה של כחמישית נקודה. מה היה קורה אילו היינו מתעלמים מכך שאלה אותם תלמידים, ומשווים את שני הממוצעים כאילו היו שתי קבוצות?

המבחן המזווג (נכון)כאילו שתי קבוצות (שגוי)
הפרש הממוצעים0.190.19
טעות התקן0.0550.112
t3.551.73
df50100
p< .001.086

אותו הפרש בדיוק, אבל המבחן השגוי לא מוצא אותו. הסיבה במכנה: טעות התקן במבחן השגוי גדולה פי שניים. בניתוח השגוי, ההבדלים הגדולים בין התלמידים, מי חרד יותר ומי פחות, נכנסים לרעש. במבחן המזווג הם מתבטלים, כי כל תלמיד מושווה רק לעצמו. המתאם בין "לפני" ל"אחרי" בתוכנית העקיפה הוא r = .77: מי שהיה חרד לפני נשאר חרד יחסית גם אחרי.

מעבדה: למה מחשבים הפרשים? כל קו מחבר את שתי המדידות של אותו אדם.פתיחה בחלון נפרד
משימות למעבדה
  1. כמה מהקווים יורדים? מה זה אומר על הסדנה?
  2. השוו את ערך tt statistic בניתוח עם זיווג ובלי זיווג. למה ההבדל כל כך גדול?
  3. מה היה קורה אילו ההבדלים בין האנשים היו קטנים? (רמז: חשבו על המתאם.)
בדקו את עצמכם3 שאלות

1.חוקר ניתח את החרדה לפני ואחרי בתוכנית העקיפה כאילו היו שתי קבוצות, קיבל p = .086, וכתב: "התוכנית העקיפה לא שינתה את החרדה." באיזו טעות הוא מסתכן?

2.בתוכנית המשולבת המתאם בין anx_pre ל־anx_post הוא r = .72. מה המשמעות שלו?

3.בשתי מדידות, לפני ואחרי, סטיית התקן היא 0.50 בכל אחת, ויש 50 תלמידים. חשבו את סטיית התקן של ההפרשים ואת טעות התקן שלהן, פעם כשהמתאם בין המדידות הוא .80, ופעם כשהוא 0. היעזרו בנוסחה מהסיפור המלא בסעיף הקודם.

קבוצות בלתי תלויות: אות מול רעש

t = (M1 − M2) / SE. במונה הפרש הממוצעים, במכנה טעות התקן של ההפרש, שמחושבת מסטיית התקן המשוקללתPooled standard deviation. df = n1 + n2 − 2.

כשהקבוצות שונות, אין מה לזווג. משווים ישירות את שני הממוצעים. המבחן בנוי כמו כל מבחן t: אות חלקי רעש.

האות, במונה, הוא ההפרש בין ממוצעי הקבוצות. הרעש, במכנה, הוא טעות התקן של ההפרש: כמה ההפרש הזה היה משתנה אילו חזרנו על המחקר עם תלמידים אחרים. הרעש גדל כשהציונים בתוך כל קבוצה מפוזרים, וקטן כשהקבוצות גדולות.

כדי לחשב את הרעש מאחדים קודם את שתי סטיות התקן לאחת, : ממוצע משוקלל שלהן לפי גודל הקבוצות, שבו לקבוצה גדולה יותר יש משקל גדול יותר.

SDpooled = √(n1 − 1)SD1² + (n2 − 1)SD2²n1 + n2 − 2
SE = SDpooled · √(1/n1 + 1/n2)     t = M1 − M2SE     df = n1 + n2 − 2
הסיפור המלא: למה פחות 2?

בפרק 20 ראינו שבכל פעם שמחשבים ממוצע מהנתונים "משלמים" דרגת חופש אחת: אחרי שיודעים את הממוצע, הערך האחרון כבר לא חופשי. כאן חישבנו שני ממוצעים, אחד לכל קבוצה, ולכן משלמים שתיים.

ולמה משקללים לפי n − 1 ולא לפי n? כי (n − 1) · SD² הוא בדיוק סכום הריבועיםSum of squares של הקבוצה, SS. כלומר SDpooled² הוא כל סכומי הריבועים יחד, חלקי כל דרגות החופש יחד.

הסיפור המלא: למה הרעשים מתחברים, ומה זה קשור לזוגות נשואים

ההפרש בין שני ממוצעים מושפע מהמקריות של שני המדגמים, ולכן הפיזורMeasure of dispersion שלו גדול מהפיזור של כל ממוצע לבד. כמה גדול? תחשבו על זוגות נשואים, ועל המצב הכלכלי של הזוג. אם אין שום קשר בין המצב של בן הזוג לבין המצב של בת הזוג, הפיזור בין הזוגות הוא פשוט סכום הפיזורים. אבל אם עשירים מתחתנים עם עשירים, ועניים עם עניים (מתאם חיוביPositive relationship), יהיו זוגות עשירים מאוד וזוגות עניים מאוד, והפיזור יגדל. ואם עשירים מתחתנים עם עניים (מתאם שליליNegative relationship), הזוגות יהיו דומים יותר זה לזה, והפיזור יקטן.

Var(X − Y) = Var X + Var Y − 2Cov(X, Y)

בקבוצות בלתי תלויות אין קשר בין שתי הקבוצות, ולכן השונויות פשוט מתחברות: SE² = SD1²/n1 + SD2²/n2. ומה קורה במדגמים מזווגים? שם המתאם בין "לפני" ל"אחרי" חיובי, והוא מקטין את השונות של ההפרש. זו בדיוק הסיבה שבמדידה חוזרת הרעש קטן, כמו שראינו בסעיף 3. ועוד דבר: בשביל מה בכלל לפתח את הנוסחה? המטרה היא לא לחשב, אלא להבין. שתי הנחות יושבות בשורש שלה: אי־תלות, ושוויון שונויותHomogeneity of variance. מי שמבין אותן ישים לב כשבמדגם יש אחים, או כשקבוצה אחת מפוזרת הרבה יותר, ואז כל תוכנה תיתן תוצאה שגויה.

דוגמה פתורה: שתי שיטות לימוד

בשיטה א׳ למדו 10 תלמידים, ממוצע 78 ושונות 36. בשיטה ב׳ למדו 12 תלמידים, ממוצע 72 ושונות 49. האם השיטות שונות?

SDpooled² = (9 · 36 + 11 · 49) / 20 = 863 / 20 = 43.15 השונות המשוקללת
SE = √(43.15 · (1/10 + 1/12)) = √7.911 = 2.813
t = (78 − 72) / 2.813 = 2.13,   df = 10 + 12 − 2 = 20
p = T.DIST.2T(2.13, 20) = .045
d = 6 / √43.15 = 6 / 6.57 = 0.91

מסקנה: p = .045, קטן מ־.05: דוחים. הממוצע בשיטה א׳ גבוה יותר, וההבדל גדול: כמעט סטיית תקן שלמה.

בדקו את עצמכם4 שאלות

1.בשתי כיתות של 16 תלמידים נבדקה שיטת לימוד חדשה. בכיתה א׳: M = 82, SD = 6. בכיתה ב׳: M = 77, SD = 8. מה התוצאה, ב־α = .05, דו־צדדי?

2.בקבוצה אחת 10 תלמידים, SD = 4. בשנייה 30 תלמידים, SD = 8. מהי SDpooled?

3.מה מהבאים יקטין את טעות התקן של ההפרש בין שתי קבוצות בלתי תלויות?

4.לפני התוכנית, האם החרדה בבית הספר של קבוצת הביקורת הייתה שונה מבבית הספר של התוכנית המשולבת? ביקורת: n = 74, M = 2.3243, SD = 0.5279. משולבת: n = 75, M = 2.1914, SD = 0.4930. הניחו שוויון שונויותHomogeneity of variance, וחשבו t ודרגות חופש.

ומה אם הפיזור בקבוצות שונה? לוין ו־Welch

השונות המשוקללת מניחה ששונויות האוכלוסיות שוות. בודקים זאת במבחן לוין: לא מובהק, קוראים את שורת Student. מובהק, קוראים את שורת Welch, שלא מניחה שוויון.

כשמאחדים את שתי סטיות התקן לאחת, מניחים בשקט שבשתי האוכלוסיות הפיזור דומה. אם בקבוצה אחת הציונים צפופים ובשנייה מפוזרים מאוד, ההנחה הזו לא סבירה, והמבחן עלול להטעות. במיוחד כשגם גודלי הקבוצות שונים.

לכן יש למבחן שתי גרסאות:

הסיפור המלא: מי היה Student?

Student הוא לא תואר, אלא שם בדוי. מאחוריו עמד ויליאם גוסט (William Sealy Gosset), כימאי וסטטיסטיקאי במבשלת הבירה גינס בדבלין, שבדק בניסוייםExperiment קטנים אילו חומרי גלם נותנים בירה טובה יותר. המבשלה לא אפשרה לעובדים לפרסם בשמם, ולכן ב־1908 הוא פרסם את המבחן בשם Student. מאוחר יותר רונלד פישר פיתח את הרעיון והפך אותו למוכר, והשם נשאר.

ועוד משהו מפתיע: מבחן t לשתי קבוצות בלתי תלויותIndependent-samples t test הוא מקרה פרטי של ניתוח שונות. אם מריצים ניתוח שונות על אותן שתי קבוצות, ערך p יוצא זהה בדיוק, ו־F = t². אז למה בכלל לומדים t? כי הוא פשוט יותר לחישוב ולהבנה, כי הוא הומצא קודם, וכי כולם התרגלו אליו. נראה את זה בפרק 26.

איך יודעים איזו גרסה לקרוא? SPSS ו־JASP מריצים מבחן לוין, שבודק אם השונויות שוות. שימו לב להיגיון ההפוך: השערת האפס של לוין היא שהשונויות שוות. לכן לוין מובהק (p < .05) אומר שהן שונות, ואז קוראים את שורת Welch. לוין לא בודק הבדל בין ממוצעים, ותוצאה מובהקתStatistically significant שלו היא לא סיבה לעצור.

באקסל אין מבחן לוין. מי שעובד באקסל יכול להסתפק בכלל אצבע שמשווה ישירות בין שתי השונויות (תמצאו אותו בקטע "בתוכנה" שבהמשך). זה לא קריטי: מי שמגיע לבדוק שוויון שונויות עובד בדרך כלל בתוכנה סטטיסטית, ובה יש לוין. לחישוב באקסל, כלל האצבע מספיק טוב.

דוגמה מהמחקר: בעיות קשב אצל בנים ובנות

האם יש הבדל בבעיות הקשב בין בנים לבנות, לפני התוכנית? (ציון גבוה = יותר בעיות קשב.)

קבוצהnMSD
בנים962.440.79
בנות1042.520.64

מבחן לוין מובהק: F(1, 198) = 5.65, p = .018. אצל הבנים הפיזור גדול יותר: יש ביניהם יותר תלמידים עם הרבה בעיות קשב, וגם יותר עם מעט מאוד. לכן קוראים את שורת Welch: t(182.6) = 0.83, p = .409. אין הבדל מובהק בממוצעים. שימו לב: שתי הקבוצות שונות בפיזור, אבל לא בממוצע.

F הוא הסטטיסטי של מבחן לוין. נכיר אותו לעומק בפרק 26, בניתוח שונות. כאן מספיק לקרוא את ערך p שלו.

הסיפור המלא: שלוש דרכים להחליט

מבחן לוין הוא הדרך של הספר, ושל SPSS ו־JASP. איך הוא עובד? לכל נבדק מחשבים את המרחק שלו מממוצע הקבוצה שלו, בערך מוחלט. בקבוצה מפוזרת המרחקים גדולים. ואז משווים את ממוצעי המרחקים בין הקבוצות. בשתי קבוצות זה בדיוק מבחן t על המרחקים, ו־F של לוין הוא t בריבוע. לכן אפשר לבנות אותו גם באקסל (ראו בקטע "בתוכנה", בלשונית Excel).

כלל אצבע: מחלקים את השונות הגדולה בקטנה. אם היחס עד 2, מניחים שוויון. מעל 2, Welch. זה הכלל של קורסי המבוא, והוא נוח כשמחשבים ביד.

תמיד Welch: יש חוקרים שממליצים לוותר על ההחלטה ולקרוא תמיד את שורת Welch. כשהשונויות שוות, Welch כמעט לא מפסיד עוצמה, וכשהן שונות, הוא מגן מטעויות (Delacre, Lakens, & Leys, 2017).

הדרכים לא תמיד מסכימות. בדוגמה הזו יחס השונויותVariance ratio הוא 0.79² / 0.64² = 1.54, פחות מ־2. לפי כלל האצבע היינו מניחים שוויון, אבל לוין מובהק. מי צודק? כאן זה לא משנה: שתי השורות נותנות כמעט אותו t ואותו p (.405 ו־.409). כשהקבוצות קרובות בגודלן, Student ו־Welch כמעט תמיד מסכימים. ההחלטה חשובה בעיקר כשגם הגדלים וגם השונויות שונים.

בדקו את עצמכם4 שאלות

1.במבחן t לקבוצות בלתי תלויותIndependent-samples t test, מבחן לוין יצא p = .27. איזו שורה קוראים?

2.סטיית התקן בקבוצה אחת: SD = 1.2. בשנייה: SD = 0.7. לפי כלל האצבע, מה היחס, ואיזו גרסה מתאימה?

3.התחושה שהמורה זמינה ומקבלת, teach_pre, בנים מול בנות לפני התוכנית. בנים: M = 5.40, SD = 1.03. בנות: M = 5.66, SD = 0.85. לוין: F(1, 198) = 4.63, p = .033. בפלט: Student t(198) = −1.92, p = .056, ‏Welch t(185.2) = −1.90, p = .058. מה מדווחים?

4.מבחן לוין יצא p = .62. חברה כותבת בעבודה: "הוכחנו שהשונויות בשתי הקבוצות שוות." מה לא מדויק?

כמה גדול ההבדל? d של כהןCohen's d

הוא ההבדל ביחידות של סטיית תקן. בקבוצות בלתי תלויות: ההפרש חלקי SDpooled. במזווגים: MD / SDD. בערך: 0.2 קטן, 0.5 בינוני, 0.8 גדול.

ערך p עונה על שאלה אחת בלבד: האם סביר שההבדל נוצר במקרה. הוא לא אומר כמה ההבדל גדול. במדגם ענק, גם הבדל זעיר יהיה מובהק. לכן מדווחים תמיד גם גודל אפקטEffect size.

ההבדל בין t ל־d נמצא במכנה. ב־t מחלקים בטעות התקן, שקטנה ככל שהמדגם גדל. ב־d מחלקים בסטיית התקן, שלא תלויה בגודל המדגם. לכן אותו הבדל ייתן t גדול יותר במדגם גדול, אבל אותו d.

d = M1 − M2SDpooled      d = MDSDD

הסימנים המקובלים של כהן: בערך 0.2 אפקט קטן, 0.5 בינוני, 0.8 גדול. אלה סימני דרך ולא חוק. בחינוך, תוכנית שמשפרת הישגים ב־0.2 סטיות תקן יכולה להיות הצלחה גדולה.

הסיפור המלא: שני סוגים של d במזווגים

במבחן המזווג יש שתי דרכים לחשב d. הדרך שבספר, MD / SDD, היא גם זו ש־SPSS ו־JASP מחשבות. יש חוקרים שמחלקים דווקא בסטיית התקן של המדידות עצמן, כדי שאפשר יהיה להשוות לניסוי עם קבוצות נפרדות. כשמשווים מחקרים, בדקו איזה d כל אחד דיווח.

בדקו את עצמכם4 שאלות

1.חזרו לשתי הכיתות מסעיף 4: M = 82 ו־M = 77, SDpooled = √50. מה d של כהן, ואיך מתארים אותו?

2.בתוכנית המשולבת, בבעיות הקשב: ממוצע ההפרשים 0.2800, וסטיית התקן של ההפרשים 0.4817. מה גודל האפקט?

3.תוכנית קריאה ארצית שיפרה את הציונים ב־d = 0.20. מה התיאור המדויק?

4.מחקר א׳ מצא t = 6.3, ומחקר ב׳ מצא t = 2.1. חוקרת מסיקה שהאפקט במחקר א׳ גדול יותר. למה זה לא בהכרח נכון?

הנחות המבחן

אי־תלות בין המשתתפים, נורמליות (או מדגם גדול), סולם רווחInterval scale או מנה, ושוויון שונויות בגרסת Student. כשהן לא מתקיימות: Welch, או מבחן א־פרמטריNonparametric test (פרק 22).

הנחהאיך בודקיםאם היא לא מתקיימת
אי־תלות בין המשתתפיםלפי מערך המחקראם אותם אנשים נמדדו פעמיים: מבחן מזווג
נורמליות בכל קבוצה (במזווגים: של ההפרשים)היסטוגרמה, הטיה וגבנוניות (פרק 12), תרשים Q-Q (פרק 14), ומבחן Shapiro-WilkHistogram · Skewness · Kurtosis · Q-Q plotמ־30 ומעלה בכל קבוצה לא נורא. במדגם קטן ומוטה: מבחן א־פרמטרי (פרק 22)Nonparametric test
סולם רווח או מנהInterval scaleלפי המשתנה (פרק 6)פריט בודד בסולם סדר: מבחן א־פרמטריOrdinal scale
שוויון שונויות (רק Student)מבחן לויןשורת Welch
הסיפור המלא: איך בודקים נורמליות בפועל?

קודם כול, מה בדיוק צריך להיות נורמלי? לא הציונים של כל המדגם יחד, אלא הציונים בתוך כל קבוצה. ובמבחן המזווג, ההפרשים. אם מסתכלים על כל המדגם יחד, הבדל גדול בין הקבוצות יכול ליצור התפלגות דו־שיאיתBimodal distribution, גם כשבכל קבוצה ההתפלגות נורמליתNormal distribution לגמרי. ולמען הדיוק: מה שהמבחן באמת צריך הוא שהתפלגות הדגימהSampling distribution של ההפרש בין הממוצעים תהיה נורמלית. נורמליות של הציונים היא דרך אחת להבטיח את זה, ומדגם גדול היא דרך אחרת.

יש ארבעה כלים, ואף אחד מהם לא מספיק לבד:

וכאן יש פרדוקס. במדגם גדול, מבחן הנורמליות מובהק כמעט תמיד, גם על סטיות זעירות. אבל דווקא שם הנורמליות כמעט לא חשובה, כי עם 30 ומעלה בכל קבוצה התפלגות הדגימה של הממוצע נורמלית בכל מקרה (משפט הגבול המרכזיCentral limit theorem). ובמדגם קטן, שבו הנורמליות באמת חשובה, למבחן אין מספיק עוצמה, והוא מפספס גם סטיות גדולות. כלומר המבחן רגיש בדיוק כשלא צריך, ועיוור בדיוק כשצריך.

אז מה עושים בפועל?

ובדיווח? משפט אחד מספיק, למשל: "בשתי הקבוצות ההתפלגות הייתה סימטרית בקירוב (הטיה בין −0.5 ל־0.5)". אם עברתם למבחן א־פרמטרי בגלל הטיה, כתבו את זה ואת הסיבה.

בדקו את עצמכם3 שאלות

1.במחקר על תוכנית קריאה, מכל זוג תאומים אחד השתתף בתוכנית והשני לא. החוקרת הריצה מבחן לקבוצות בלתי תלויות. איזו הנחה הופרה?

2.משווים בנים ובנות בפריט a4 בלבד, "אני דואג/ת לפני מבחנים", מ־1 עד 4. איזו הנחה הכי בעייתית כאן?

3.בניסויExperiment קטן יש 10 תלמידים בכל קבוצה, וההיסטוגרמהHistogram בקבוצה אחת מוטה מאוד: רוב התלמידים קיבלו ציון נמוך, ושניים קיבלו ציון גבוה מאוד. מה תעשו?

בתוכנה: שתי השאלות מהפתיחה

עכשיו נריץ את שני המבחנים על קובץ המחקר. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות של כל קטע. המספרים זהים בשלוש התוכנות.

האם בנות חרדות יותר מבנים?

104 בנות ו־96 בנים. משתנה תלויDependent variable: anx_pre, החרדה לפני התוכנית (ממוצע שאלון, 1 עד 4). משתנה הקבוצה: gender (1 = בן, 2 = בת). קבוצות בלתי תלויות.

החישוב ביד
Mבנות = 2.3917,   Mבנים = 2.0666,   הפרש = 0.3251
SDpooled = √((95 · 0.4884² + 103 · 0.4989²) / 198) = 0.4939
SE = 0.4939 · √(1/96 + 1/104) = 0.0699
t = 0.3251 / 0.0699 = 4.65,   df = 198,   d = 0.3251 / 0.4939 = 0.66
עגלו רק בסוף. עיגול באמצע הדרך יכול להזיז את התוצאה בספרה האחרונה.
  1. מיינו את הנתונים לפי gender: Data > Sort. עכשיו הבנים בשורות 2–97 והבנות בשורות 98–201. anx_pre היא עמודה AI.
  2. שוויון שונויות, בכלל אצבע: =VAR.S(AI98:AI201)/VAR.S(AI2:AI97) (השונות הגדולה חלקי הקטנה) נותן 1.04. עד 2 מניחים שוויון, ולכן סוג 2. מעל 2 בוחרים סוג 3, Welch.
  3. לסקרנים: אפשר להריץ באקסל גם את מבחן לוין עצמו. בעמודת עזר BD מחשבים את המרחק של כל תלמיד מממוצע הקבוצה שלו: בשורה 2 =ABS(AI2-AVERAGE($AI$2:$AI$97)) עד שורה 97, ובשורה 98 =ABS(AI98-AVERAGE($AI$98:$AI$201)) עד 201. ואז =T.TEST(BD2:BD97, BD98:BD201, 2, 2) נותן .934, בדיוק כמו ב־SPSS.
  4. ערך p של מבחן t: =T.TEST(AI2:AI97, AI98:AI201, 2, 2). הארגומנט השלישי, 2, הוא דו־צדדי. הרביעי הוא סוג המבחן: 1 מזווגים, 2 שונויות שוות (Student), 3 Welch.
  5. אפשר גם בלי נוסחאות: Data > Data Analysis > t-Test: Two-Sample Assuming Equal Variances. בפעם הראשונה צריך להפעיל את התוסף Analysis ToolPak.

t-Test: Two-Sample Assuming Equal Variances

BoysGirls
Mean2.06662.3917
Variance0.23850.2489
Observations96104
Pooled Variance0.2439
Hypothesized Mean Difference0
df198
t Stat-4.65
P(T<=t) one-tail3.03E-06
t Critical one-tail1.653
P(T<=t) two-tail6.05E-06
t Critical two-tail1.972
t Stat
סטטיסטי t. שלילי, כי אקסל מחסיר את הטווח השני מהראשון: בנים פחות בנות.
P(T<=t) two-tail
ערך p דו־צדדי: 0.00000605, כלומר p < .001.
Pooled Variance
השונות המשוקללת. השורש שלה הוא SDpooled = 0.494.

את d אקסל לא מחשב. בתא ריק: =(AVERAGE(AI98:AI201)-AVERAGE(AI2:AI97))/SQRT((95*VAR.S(AI2:AI97)+103*VAR.S(AI98:AI201))/198) נותן 0.66.

  1. Analyze > Compare Means > Independent-Samples T Test
  2. Test Variable(s): anx_pre. Grouping Variable: gender, ובכפתור Define Groups מקלידים 1 ו־2.
  3. מסמנים Estimate effect sizes ולוחצים OK.

Group Statistics

GenderNMeanStd. DeviationStd. Error Mean
Boy962.07.49.050
Girl1042.39.50.049

Independent Samples Test

F 1Sig.tdfOne-Sided pTwo-Sided pMean DifferenceStd. Error Difference95% CI LowerUpper
Equal variances assumed 2.01.934-4.65198<.001<.001-.33.070-.46-.19
Equal variances not assumed-4.65197.31<.001<.001-.33.070-.46-.19

Independent Samples Effect Sizes

StandardizerPoint Estimate
Cohen's d.494-.658
Hedges' correction.496-.656
1 · Levene's Test
שתי העמודות הראשונות. Sig. = .934, לא מובהק: השונויות דומות.
2 · השורה העליונה
לכן קוראים את Equal variances assumed: t(198) = −4.65, p < .001.
Mean Difference
קבוצה 1 פחות קבוצה 2, כלומר בנים פחות בנות. הסימן השלילי אומר שהבנות גבוהות יותר.
One-Sided p
ערך p למבחן חד־צדדיOne-tailed hypothesis / test. קוראים אותו רק אם ההשערה נקבעה מראש עם כיוון.
Cohen's d
‎−0.66‎, אפקט בינוני. Standardizer הוא SDpooled.
Hedges' correction
תיקון קטן ל־d במדגמים קטנים. במדגם שלנו כמעט זהה, ‎−0.656‎.

כך נראה הפלט, בגרסה 27 ואילך (בגרסאות ישנות יותר יש עמודה אחת, Sig. (2-tailed), ואין טבלת Effect Sizes).

  1. T-Tests > Independent Samples T-Test
  2. Dependent Variables: anx_pre. Grouping Variable: gender.
  3. מסמנים Student וגם Welch, Effect size, Descriptives, ותחת Assumption Checks: Equality of variances.

Independent Samples T-Test

TesttdfpCohen's d
anx_preStudent-4.65198< .001-0.66
Welch-4.65197.31< .001-0.66

Test of Equality of Variances (Levene's)

Fdf1df2p
anx_pre0.011198.934

Group Descriptives

GroupNMeanSDSE
anx_pre1962.070.490.05
21042.390.500.05
Levene p = .934
לא מובהק, ולכן קוראים את שורת Student.
t = −4.65
JASP מחסיר את קבוצה 2 מקבוצה 1: בנים פחות בנות. את הכיוון קובעים מטבלת הממוצעים.
Cohen's d
‎−0.66‎: אפקט בינוני.

האם החרדה ירדה בתוכנית המשולבת?

75 תלמידים בתוכנית המשולבת, שבה התאמנו גם המורות וגם התלמידים, נמדדו פעמיים: anx_pre ו־anx_post. מדגמים מזווגים. ממוצע ההפרשים (לפני פחות אחרי) הוא 0.2831, וסטיית התקן שלהם 0.3892.

החישוב ביד
SE = 0.3892 / √75 = 0.3892 / 8.660 = 0.0449
t = 0.2831 / 0.0449 = 6.30,   df = 74,   d = 0.2831 / 0.3892 = 0.73
  1. מיינו לפי group. התוכנית המשולבת (2) בשורות 127–201.
  2. =T.TEST(AI127:AI201, AP127:AP201, 2, 1). הסוג 1 הוא מזווגים, והטווחים הם anx_pre ו־anx_post.
  3. או: Data Analysis > t-Test: Paired Two Sample for Means.

t-Test: Paired Two Sample for Means

anx_preanx_post
Mean2.19141.9083
Variance0.24310.2983
Observations7575
Pearson Correlation0.724
Hypothesized Mean Difference0
df74
t Stat6.30
P(T<=t) one-tail9.64E-09
t Critical one-tail1.666
P(T<=t) two-tail1.93E-08
t Critical two-tail1.993
Pearson Correlation
המתאם בין לפני לאחרי, .72. בגללו המבחן המזווג כל כך רגיש.
P(T<=t) two-tail
ערך p: p < .001.

d: עמודת עזר =AI127-AP127, גוררים למטה, ואז =AVERAGE(...)/STDEV.S(...) על העמודה. מקבלים 0.73.

  1. כדי לבחור רק את התוכנית המשולבת: Data > Select Cases, If: group = 2. (או Data > Split File לפי group, כדי לקבל את שלוש הקבוצות.)
  2. Analyze > Compare Means > Paired-Samples T Test
  3. Paired Variables: anx_pre ב־Variable1, anx_post ב־Variable2. מסמנים Estimate effect sizes.

Paired Samples Correlations

NCorrelationTwo-Sided p
anx_pre & anx_post75.724<.001

Paired Samples Test

MeanStd. DeviationStd. Error Mean95% CI LowerUppertdfOne-Sided pTwo-Sided p
anx_pre - anx_post.283.389.045.194.3736.3074<.001<.001
Mean
ממוצע ההפרשים, לפני פחות אחרי: חיובי, כלומר החרדה ירדה.
Correlation
המתאם בין שתי המדידות. גבוה, ולכן סטיית התקן של ההפרשים קטנה.
Cohen's d
בטבלת Effect Sizes: Standardizer .389 (זו SDD), ו־Point Estimate .727.

בסוף מחזירים את כל הנתונים: Select Cases > All cases.

  1. כדי לנתח רק את התוכנית המשולבת: לוחצים על כותרת העמודה group ומבטלים את הסימון של 0 ושל 1 (מסנן).
  2. T-Tests > Paired Samples T-Test. מכניסים את anx_pre ואז anx_post, באותה שורה.
  3. מסמנים Student, Effect size, Descriptives, ו־Normality תחת Assumption Checks.

Paired Samples T-Test

Measure 1Measure 2tdfpCohen's d
anx_pre-anx_post6.3074< .0010.73
Measure 1 − Measure 2
JASP מחסיר את המדידה השנייה מהראשונה: לפני פחות אחרי. t חיובי: החרדה ירדה.
Normality
JASP בודק נורמליות של ההפרשים, לא של כל מדידה בנפרד. זה נכון: ההנחה היא על ההפרשים.
אז התוכנית עבדה?

לא בהכרח, עדיין. החרדה ירדה בתוכנית המשולבת, אבל מה עוד השתנה באותה שנת לימודים? התלמידים התבגרו, התרגלו לשאלון, אולי הכיתה התגבשה. בשביל זה יש קבוצת ביקורת. ובקבוצת הביקורת החרדה כמעט לא זזה: מ־2.32 ל־2.31 (t(73) = 0.26, p = .796).

השאלה הנכונה היא אם השינוי בתוכנית גדול יותר מהשינוי בביקורת. אפשר לבדוק את זה במבחן t לקבוצות בלתי תלויות על ציון השינוי (אחרי פחות לפני). לוין יצא מובהק (p = .034), ולכן Welch: t(137.3) = 3.63, p < .001, d = 0.60. השינוי גדול יותר בתוכנית המשולבת. את הדרך המלאה לנתח מחקר כזה, עם שלוש קבוצות ושלוש מדידות, נלמד בפרקים 27 ו־35.

בדקו את עצמכם3 שאלות

1.בבעיות הקשב, בנים מול בנות, מבחן לוין מובהק. אתם רוצים את ערך p באקסל, עם =T.TEST(…, …, 2, ?). מה הארגומנט האחרון?

1.בבעיות הקשב, בנים מול בנות, מבחן לוין מובהק. מאיזו שורה בטבלת Independent Samples Test של SPSS קוראים את t ואת p?

1.בבעיות הקשב, בנים מול בנות, סימנתם ב־JASP גם Student וגם Welch, ומבחן לוין מובהק. איזו שורה מדווחים?

2.בפלט של מבחן t, ערך p הדו־צדדי מוצג כ־6.05E-06. איך מדווחים?

3.האם בנים ובנות שונים בשביעות הרצון מהחיים, sat_pre, לפני התוכנית? בנים: n = 96, M = 5.1333, SD = 0.9706. בנות: n = 104, M = 5.0000, SD = 1.0327. לוין: p = .234. חשבו ביד t, דרגות חופש ו־d, ונסחו מסקנה.

איך מדווחים

משפט אחד, עם כל המספרים: כיוון ההבדל, ממוצעים וסטיות תקן, t ודרגות החופש, ערך p, גודל אפקט, ואם אפשר רווח סמךConfidence interval.

נמצא הבדל מובהק בחרדה בין בנות לבנים לפני התוכנית: החרדה של הבנות (M = 2.39, SD = 0.50) הייתה גבוהה מזו של הבנים (M = 2.07, SD = 0.49), וגודל האפקט בינוני, t(198) = 4.65, p < .001, d = 0.66, 95% CI [0.19, 0.46].

בתוכנית המשולבת החרדה ירדה באופן מובהק, מ־2.19 (SD = 0.49) ל־1.91 (SD = 0.55), t(74) = 6.30, p < .001, d = 0.73, 95% CI [0.19, 0.37].

שימו לב: בדיווח כותבים את t חיובי ואת הכיוון במילים, גם כשהתוכנה הדפיסה מינוס. ערך p נכתב בלי אפס לפני הנקודה, וכש־p קטן מאלפית כותבים p < .001 ולא p = .000.

תורכם

תרגיל 1: מזווגים

שמונה סטודנטים כתבו מבחן לפני קורס ואחריו. ממוצע ההפרשים (אחרי פחות לפני) הוא 4, וסטיית התקן של ההפרשים 4. האם הקורס משפר את הציונים? (השערה חד־צדדית, α = .05)

בדיקת התשובה
H0: μD ≤ 0    H1: μD > 0 כאן D הוא אחרי פחות לפני, ולכן שיפור = הפרש חיובי
t = 4 / (4 / √8) = 4 / 1.414 = 2.83,   df = 7
p = T.DIST.RT(2.83, 7) = .013 חד־צדדי ימני
d = 4 / 4 = 1.00

ערך p קטן מ־.05: דוחים. הקורס משפר את הציונים, ובאפקט גדול.

תרגיל 2: קבוצות בלתי תלויות

בקבוצה 1 יש 8 נבדקים, ממוצע 30 ושונות 16. בקבוצה 2 יש 10 נבדקים, ממוצע 25 ושונות 20. מבחן לוין לא היה מובהק. איזו גרסה מתאימה? חשבו את t, דרגות החופש, ערך p הדו־צדדי ו־d.

בדיקת התשובה
Student לוין לא מובהק: מניחים שוויון שונויות, ומשתמשים בשונות המשוקללת
SDpooled² = (7 · 16 + 9 · 20) / 16 = 292 / 16 = 18.25
t = 5 / √(18.25 · (1/8 + 1/10)) = 5 / 2.026 = 2.47,   df = 16
p = T.DIST.2T(2.47, 16) = .025,   d = 5 / √18.25 = 1.17

דוחים: הממוצע בקבוצה 1 גבוה יותר, באפקט גדול.

מעבדה: שתי הגרסאות של המבחן לקבוצות בלתי תלויות

מעבדה: מבחן t למדגמים בלתי תלויים. משנים ממוצעים, סטיות תקן וגדלים, ומשווים בין שתי הגרסאות.פתיחה בחלון נפרד
משימות למעבדה
  1. הגדילו את סטיות התקן בשתי הקבוצות. מה קרה ל־t, ולמה?
  2. קבעו סטיות תקן שונות מאוד, וגדלי קבוצות שונים מאוד. מתי שתי הגרסאות, Student ו־Welch, נותנות t שונה?
  3. הקטינו את ההפרש בין הממוצעים. מתי מפסיקים לדחות את השערת האפס?
בדיקת התשובה

1. סטיית התקן גדלה, הרעש גדל, ו־t קטן. 2. כשגם השונויות וגם הגדלים שונים, הגרסאות נפרדות. כשהגדלים קרובים, הן כמעט זהות גם אם השונויות שונות. 3. כש־t יורד מתחת לערך הקריטי (בערך 2 בדוגמאות האלה), ערך p עולה מעל .05.

מעבדה: שתי קבוצות, או אותם תלמידים פעמיים

המעבדה הבאה מתחילה מהנתונים שלנו: החרדה של בנות ובנים לפני התוכנית, בעיות הקשב, והחרדה לפני ואחרי בתוכנית המשולבת. המספרים מעוגלים, ולכן התוצאות קרובות לפלט, אבל לא זהות לו.

מעבדה: מבחני t. בוחרים מצב, ומזיזים ממוצעים, פיזור, גודל מדגם ומתאם.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו "חרדה: בנות מול בנים". הקטינו את מספר התלמידים עד שערך p עולה מעל .05. בערך באיזה גודל זה קורה? האם גודל האפקט d השתנה?
  2. בחרו "בעיות קשב: בנות מול בנים". ההבדל קטן. הגדילו את מספר התלמידים עד הסוף. האם ההבדל מובהק?
  3. בחרו "חרדה: לפני ואחרי". הורידו את המתאם בין שתי המדידות לאפס, ואחר כך העלו אותו ל־0.9. מה קורה ל־t?
בדיקת התשובה

1. כשיש פחות מכ־20 תלמידים בכל קבוצה. גודל האפקט לא משתנה, כי הוא לא תלוי בגודל המדגם. ערך p כן תלוי בו. 2. גם עם 300 בכל קבוצה הוא לא מובהק (p בערך .17). כדי שהבדל כזה יהיה מובהק, צריך כ־620 תלמידים בכל קבוצה. ובכל זאת, עם מדגם ענק מספיק גם הבדל זניח יוצא מובהק. לכן מדווחים תמיד גם את גודל האפקט. 3. ככל שהמתאם גבוה יותר, סטיית התקן של ההפרשים קטנה, ו־t גדל. זה היתרון של מערך לפני ואחרי: כל תלמיד משמש ביקורת לעצמו.

הסיפור המלא

מעבדה: התפלגות t, ולמה המתאם עוזרt distribution

למעלה רואים איך התפלגות t מתקרבת לנורמלית כשדרגות החופש עולות. למטה רואים את אותו רעיון כמו במשימה 3, בנוסחה: סטיית התקן של ההפרשים קטנה ככל שהמתאם בין שתי המדידות גבוה.

מעבדה: התפלגות t ומדגמים תלויים.פתיחה בחלון נפרד

כל המעבדות של הספר, לפי הפרקים, נמצאות בעמוד כל המעבדות.

טעויות נפוצות

בדקו את עצמכם

סיכום

t = MD / (SDD / √n),   df = n − 1,   d = MD / SDD
t = (M1 − M2) / (SDpooled · √(1/n1 + 1/n2)),   df = n1 + n2 − 2
d = (M1 − M2) / SDpooled

מונחים חדשים

מדגמים תלויים (מזווגים)מדגמים בלתי תלוייםציון הפרשסטיית תקן משוקללתשוויון שונויותמבחן לויןמבחן Welchd של כהן

שאלות לדוגמה, עם פתרונות

  1. לכל אחת מהשאלות הבאות, בחרו מבחן ונמקו במשפט אחד. א. האם הקשיבות של 75 התלמידים בתוכנית המשולבת עלתה מתחילת השנה לסופה? ב. האם ההרגשה בכיתה שונה בין תלמידי כיתה ד׳ לתלמידי כיתה ה׳? ג. כל תלמיד דירג את החרדה של עצמו, ואחד ההורים דירג את החרדה של אותו תלמיד. האם ההורים מעריכים את החרדה נמוך יותר מהילדים? ד. האם הירידה בחרדה (אחרי פחות לפני) גדולה יותר בתוכנית המשולבת מאשר בקבוצת הביקורת? ה. האם החרדה הממוצעת של 200 התלמידים שונה מ־2.5, אמצע הסולם?

    בדיקת התשובה

    א. מזווגים: אותם תלמידים נמדדו פעמיים. ב. בלתי תלויים: אלה ילדים שונים, ואין דרך לחבר תלמיד מכיתה ד׳ לתלמיד מסוים מכיתה ה׳. ג. מזווגים: כל דירוג של הורה מזווג לדירוג של הילד שלו. זה זוג טבעי, כמו תאומים, גם אם המדרגים שונים. ד. בלתי תלויים, על ציון השינוי: לכל תלמיד מחשבים ציון אחד, אחרי פחות לפני, ומשווים בין שתי קבוצות של ילדים שונים. ה. זו לא השוואה בין שני מדגמים בכלל: מבחן t למדגם בודד מול 2, מפרק 20.

    הכלל: קודם שואלים כמה מדגמים יש. אם שניים, שואלים אם אפשר לחבר כל שורה בקבוצה אחת לשורה מסוימת בשנייה.

  2. מורה ספרה כמה פעמים כל אחד משבעה תלמידים הצביע בשיעור, בשבוע שלפני תרגול קשיבות קצר בתחילת כל שיעור, ובשבוע שאחריו. לפני: 3, 5, 2, 4, 6, 3, 5. אחרי: 5, 6, 5, 4, 8, 6, 8. האם מספר ההצבעות השתנה? (α = .05, דו־צדדי. חשבו D = לפני − אחרי.)

    בדיקת התשובה
    D = −2, −1, −3, 0, −2, −3, −3 לפני פחות אחרי, לכל תלמיד
    MD = −14 / 7 = −2.00
    SS = 0 + 1 + 1 + 4 + 0 + 1 + 1 = 8,   SDD = √(8 / 6) = 1.1547 סכום ריבועי הסטיות מממוצע ההפרשים
    SE = 1.1547 / √7 = 1.1547 / 2.6458 = 0.4364
    t = −2.00 / 0.4364 = −4.58,   df = 7 − 1 = 6
    p = T.DIST.2T(4.58, 6) = .004
    d = −2.00 / 1.1547 = −1.73

    מסקנה: p = .004, דוחים. הממוצע עלה מ־4 הצבעות ל־6, ולכן התלמידים הצביעו יותר אחרי התרגול. t ו־d שליליים רק כי חיסרנו לפני פחות אחרי, והמספרים עלו. האפקט גדול מאוד, אבל שימו לב: שבעה תלמידים זה מדגם קטן מאוד, ואין כאן קבוצת ביקורת. אולי בשבוע השני פשוט נלמד נושא מעניין יותר.

  3. שתי כיתות נבחנו במבחן הבנת הנקרא. בכיתה שלמדה בשיטה חדשה: n = 9, M = 24, SD = 4. בכיתה שלמדה בשיטה הרגילה: n = 11, M = 20, SD = 5. א. באיזו גרסה של המבחן תשתמשו, לפי כלל האצבע? ב. חשבו t, דרגות חופש, ערך p דו־צדדי ו־d. ג. מה המסקנה, ומה הייתם אומרים למורה שמסיקה "השיטה לא עובדת"?

    בדיקת התשובה
    5² / 4² = 25 / 16 = 1.56 < 2 → Student א. השונות הגדולה חלקי הקטנה
    SDpooled² = (8 · 16 + 10 · 25) / 18 = 378 / 18 = 21.00
    SE = √(21 · (1/9 + 1/11)) = √(21 · 0.2020) = √4.242 = 2.060
    t = (24 − 20) / 2.060 = 1.94,   df = 9 + 11 − 2 = 18
    p = T.DIST.2T(1.94, 18) = .068 הערך הקריטי: 2.10
    d = 4 / √21 = 4 / 4.583 = 0.87

    ג. p = .068, גדול מ־.05: לא דוחים את השערת האפס. אבל d גדול, כמעט סטיית תקן שלמה. השילוב הזה אופייני למדגם קטן: העוצמה נמוכה (פרק 19), וגם הבדל אמיתי וגדול עלול לא לצאת מובהק. למורה הייתי אומר: "לא מצאנו ראיה מספיקה" זה לא "הוכחנו שאין הבדל". כדאי לחזור על הבדיקה עם יותר תלמידים. ועוד דבר: שתי כיתות שלמות, עם שתי מורות שונות, הן לא באמת קבוצות שהוגרלו.

  4. האם יש הבדל בבעיות הקשב במעקב, חצי שנה אחרי התוכנית (attn_fu), בין תלמידי כיתה ד׳ (grade = 4) לתלמידי כיתה ה׳ (grade = 5)? קראו את הפלט של SPSS וענו: א. איזו שורה קוראים, ולמה? ב. דווחו את התוצאה במשפט, כולל d. ג. למה כאן שתי השורות נותנות תוצאות שונות יותר מאשר בבעיות הקשב של בנים ובנות בסעיף 5? ד. חבר שם לב שב־One-Sided p של Welch כתוב .049, ומציע לדווח תוצאה מובהקתStatistically significant. מה תענו?

    Group Statistics

    GradeNMeanStd. DeviationStd. Error Mean
    41332.38.86.075
    5672.20.64.078

    Independent Samples Test

    FSig.tdfOne-Sided pTwo-Sided pMean DifferenceStd. Error Difference95% CI LowerUpper
    Equal variances assumed5.28.0231.52198.066.131.18.119-.05.42
    Equal variances not assumed1.67170.24.049.097.18.108-.03.39
    בדיקת התשובה

    א. מבחן לוין מובהק (Sig. = .023): השונויות שונות, ולכן קוראים את השורה התחתונה, Equal variances not assumed (Welch).

    ב. d לא מופיע בטבלה הזו. מחשבים ביד, או מסמנים Estimate effect sizes:

    SDpooled = √((132 · 0.86² + 66 · 0.64²) / 198) = √(124.66 / 198) = 0.79 מהמספרים בטבלה הראשונה
    d = 0.18 / 0.79 = 0.23

    "לא נמצא הבדל מובהק בבעיות הקשב במעקב בין תלמידי כיתה ד׳ (M = 2.38, SD = 0.86) לתלמידי כיתה ה׳ (M = 2.20, SD = 0.64), t(170.2) = 1.67, p = .097, d = 0.23." רווח הסמך, [−0.03, 0.39], כולל את האפס, כמו שמצופה כש־p גדול מ־.05.

    ג. כאן גם הגדלים שונים מאוד (133 מול 67) וגם השונויות. ובנוסף, הקבוצה הגדולה היא המפוזרת. השונות המשוקללת נותנת לה משקל גדול, ולכן "מדביקה" גם לקבוצה הקטנה פיזור גדול מדי. טעות התקן בשורת Student גדולה (.119 מול .108), ו־t קטן. בבנים ובנות הגדלים היו כמעט שווים (96 ו־104), ולכן שתי השורות כמעט זהות.

    ד. לא. One-Sided p מותר רק כשההשערה נקבעה מראש עם כיוון. לבחור חד־צדדי אחרי שרואים את הנתונים, רק כי הוא "עובר" את .05, זה בעצם להכפיל את α. וגם אילו היה מובהק: d = 0.23 הוא הבדל קטן.

  5. בתוכנית המשולבת נבדקו התלונות הגופניות (כאבי בטן, כאבי ראש) לפני התוכנית ואחריה, soma_pre ו־soma_post. לפני: M = 1.87, SD = 0.57. אחרי: M = 1.66, SD = 0.54. א. חשבו את d מהפלט. ב. כתבו משפט דיווח בסגנון APA. ג. סטודנטית כתבה: "התוכנית המשולבת הפחיתה את התלונות הגופניות, t = 4.97, p = .000." מצאו בו ארבע בעיות.

    Paired Samples Test

    MeanStd. DeviationStd. Error Mean95% CI LowerUppertdfOne-Sided pTwo-Sided p
    soma_pre - soma_post.211.367.042.126.2954.9774<.001<.001
    בדיקת התשובה
    d = MD / SDD = 0.2107 / 0.3675 = 0.57 א. ממוצע ההפרשים חלקי סטיית התקן שלהם
    0.2107 / 0.0424 = 4.97 בדיקה: t = ממוצע ההפרשים חלקי טעות התקן

    ב. "בתוכנית המשולבת התלונות הגופניות ירדו באופן מובהק, מ־1.87 (SD = 0.57) ל־1.66 (SD = 0.54), t(74) = 4.97, p < .001, d = 0.57, 95% CI [0.13, 0.30]." אפקט בינוני.

    ג. 1. חסרות דרגות החופש: t(74). 2. p = .000 לא קיים. כותבים p < .001. 3. חסרים גודל אפקט וממוצעים, ולכן הקורא לא יודע כמה התלונות ירדו. 4. "הפחיתה" הוא טענה סיבתית. המבחן מראה רק שהתלונות ירדו. בקבוצת הביקורת הן כמעט לא זזו (t(73) = 0.90, p = .370), וזה מעודד, אבל כדי לייחס את הירידה לתוכנית צריך להשוות את השינוי בין הקבוצות, כמו בשאלה הבאה.

  6. מנהלת בית הספר של התוכנית המשולבת מדווחת: "הקשיבות של התלמידים עלתה באופן מובהק, t(74) = −4.43, p < .001, ולכן התוכנית עובדת." חוקר מחשב לכל תלמיד ציון שינויDifference score בקשיבות, אחרי פחות לפני, ומשווה לקבוצת הביקורת. משולבת: n = 75, M = 0.2231, SD = 0.4361. ביקורת: n = 74, M = −0.1627, SD = 0.4654. א. איזה מבחן, ובאיזו גרסה? ב. חשבו t, דרגות חופש ו־d. ג. מה המסקנה, ומה היא מוסיפה על הטענה של המנהלת?

    בדיקת התשובה

    א. מבחן t לקבוצות בלתי תלויות על ציוני השינוי: אלה ילדים שונים בשני בתי ספר. יחס השונויות קטן מ־2, ולכן Student. (ב־SPSS מבחן לוין לא מובהק, p = .649.)

    0.4654² / 0.4361² = 0.2166 / 0.1902 = 1.14 < 2 כלל האצבע
    SDpooled = √((74 · 0.1902 + 73 · 0.2166) / 147) = √(29.885 / 147) = √0.2033 = 0.4509
    SE = 0.4509 · √(1/75 + 1/74) = 0.4509 · 0.1639 = 0.0739
    t = (0.2231 − (−0.1627)) / 0.0739 = 0.3858 / 0.0739 = 5.22,   df = 75 + 74 − 2 = 147
    p = T.DIST.2T(5.22, 147) < .001,   d = 0.3858 / 0.4509 = 0.86

    ג. השינוי בקשיבות בתוכנית המשולבת גדול באופן מובהק מהשינוי בקבוצת הביקורת, ובאפקט גדול. זו ראיה חזקה יותר מזו של המנהלת: היא השוותה את התלמידים רק לעצמם, ולא יכלה לשלול שהקשיבות עולה בכל מקרה במהלך השנה. ההשוואה לביקורת מראה שלא: בביקורת הקשיבות דווקא ירדה, באופן מובהק (t(73) = 3.01, p = .004, לפני פחות אחרי). ובכל זאת, ההגרלה הייתה של בתי ספר ולא של תלמידים, וכל קבוצה היא בית ספר אחד. ייתכן שמשהו אחר באחד מבתי הספר השתנה באותה שנה. את הניתוח המלא של מערך כזה נלמד בפרקים 27 ו־35.

תרגול עם הנתונים

קובץ המחקר: 200 תלמידים, 55 משתנים. החרדה והקשיבות לפני התוכנית מופיעות גם כפריטים, וגם כציון מחושב (anx_pre, mind_pre). ערך 99 מסמן נתון חסרMissing value בפריטים ובמשתני הרקע.

הקבצים עצמם, care_school.csv ומילון המשתנים, נמצאים גם בתיקיית data בחבילת הספר.

  1. האם שביעות הרצון מהחיים (sat_pre, sat_post) עלתה בתוכנית המשולבת?
    בדיקת התשובה

    כן: מ־5.05 ל־5.53, t(74) = −6.45, p < .001, d = −0.75. הסימן שלילי כי חיסרנו לפני פחות אחרי, והציון עלה.

  2. עכשיו אותו מבחן בקבוצת הביקורת. מה זה אומר על התשובה הקודמת?
    בדיקת התשובה

    גם בביקורת שביעות הרצון עלתה באופן מובהק: מ־4.94 ל־5.21, t(73) = −3.15, p = .002, d = −0.37. כנראה חלק מהעלייה קורה בכל מקרה, במהלך השנה. העלייה בתוכנית גדולה יותר, וזו השאלה שצריך לבדוק. גם במאמר עצמו קבוצת הביקורת השתפרה בשביעות הרצון, אבל פחות.

  3. האם התחושה שהמורה זמינה ומקבלת (teach_pre) הייתה שונה לפני התוכנית בין התוכנית העקיפה למשולבת? בדקו קודם את לוין.
    בדיקת התשובה

    לוין לא מובהק (F(1, 124) = 0.69, p = .407), ולכן Student. אין הבדל: עקיפה M = 5.74 (SD = 0.89), משולבת M = 5.56 (SD = 1.03), t(124) = 0.99, p = .324, d = 0.18. הקבוצות היו דומות בהתחלה.

בפרק הבא: מה עושים כשההנחות של מבחן t לא מתקיימות. מבחנים א־פרמטריים, שעובדים על דירוגים במקום על הציונים עצמם.

מקורות: Delacre, M., Lakens, D., & Leys, C. (2017). Why psychologists should by default use Welch's t-test instead of Student's t-test. International Review of Social Psychology, 30(1), 92–101. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y · Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Erlbaum.