סטטיסטיקה מ־0 עד 100בטאתוכנהעומק

חלק ג: מהמדגם לאוכלוסייה · פרק 22

מבחנים א־פרמטריים

מבחני t עובדים מצוין, כל עוד ההנחות שלהם מתקיימות. אבל מה עושים עם פריט בודד בשאלון, עם כיתה אחת קטנה ומוטה, או עם תלמיד אחד שהתוצאה שלו רחוקה מכל השאר? בפרק הזה נלמד שני מבחנים שעובדים על הסדר של הערכים, ולא על הערכים עצמם.

שאלת הפתיחה

האם בנות נלחצות יותר מבנים כשהמורה שואלת אותן שאלה?

בשאלון החרדה של המחקר יש פריט אחד בדיוק על זה: "אני לחוץ/ה כשהמורה שואלת אותי שאלה", עם ארבע תשובות, מ"אף פעם" עד "תמיד". זה פריט בודד, בסולם סדרOrdinal scale. ושאלה שנייה: בכיתה ד׳ אחת בתוכנית העקיפה, 29 תלמידים, האם החרדה ירדה? הכיתה קטנה, וההפרשים מוטים בגלל תלמיד אחד שהחרדה שלו קפצה. בשתי השאלות מבחן t לא בטוח. בסוף הפרק תדעו מה לעשות במקומו.

בסוף הפרק תוכלו

מתי מבחן t לא מתאים?

מבחן t מניח סולם רווחInterval scale, ונורמליות או מדגם גדול. כשהמשתנה בסולם סדר, כשהמדגם קטן ומוטה, או כשיש ערכים קיצונייםOutlier, משתמשים במבחן א־פרמטריNonparametric test: מחליפים את הערכים בדירוגים, ובודקים את הדירוגים. לכל מבחן t יש מקביל: וילקוקסון למדגמים תלוייםDependent samples, ומאן־ויטני לקבוצות בלתי תלויות.

בפרק 21 סיימנו בטבלת ההנחות של מבחן t. שתיים מהן חשובות כאן. הראשונה: המשתנה בסולם רווחInterval scale או מנה, כי מבחן t עובד עם ממוצעים, וממוצע מניח שהמרחקים בין הערכים שווים (פרק 6). השנייה: התפלגות הדגימה של הממוצעSampling distribution נורמלית. זה קורה כשהציונים עצמם נורמליים, או כשהמדגם גדול מספיק (פרק 17).

יש שלושה מצבים טיפוסיים שבהם ההנחות האלה בבעיה:

במצבים האלה משתמשים במבחן שלא מניח התפלגות מסוימת באוכלוסייה. הרעיון המשותף פשוט: מחליפים כל ערך בדירוג שלו, כמו שעשינו במתאם ספירמןSpearman correlation (פרק 15), ובודקים את הדירוגים. לדירוג לא אכפת אם הערך הגבוה ביותר הוא 14 או 35. הוא יודע רק שזה הגבוה ביותר.

המצבהמבחן הפרמטריהמבחן הא־פרמטרי המקביל
אותם אנשים פעמיים, או זוגותמבחן t למדגמים תלוייםPaired-samples t testמבחן וילקוקסון למדגמים תלויים
שתי קבוצות של אנשים שוניםמבחן t למדגמים בלתי תלוייםIndependent-samples t testמבחן מאן־ויטני (נקרא גם וילקוקסון למדגמים בלתי תלויים)
שלוש קבוצות ויותרניתוח שונות (פרק 26)One-way ANOVAמבחן קרוסקל־וואליס (פרק 26)Kruskal-Wallis test

ומה המחיר? כשההנחות של t כן מתקיימות, מבחן t עדיף מעט: הוא משתמש בכל המידע שבמרחקים בין הערכים, ולכן העוצמה שלו קצת גבוהה יותר. נחזור לזה בסעיף 6.

הסיפור המלא: למה "א־פרמטרי"?

פרמטר הוא מספר שמתאר את האוכלוסייה (פרק 10). מבחן t מניח שהאוכלוסייה מתוארת היטב על ידי שני פרמטרים, ממוצע וסטיית תקן, כמו בהתפלגות נורמליתNormal distribution, ובודק השערה על אחד מהם, . לכן הוא נקרא מבחן פרמטריParametric test. מבחן א־פרמטריNonparametric test לא מניח צורה מסוימת להתפלגות, ולכן נקרא לפעמים גם "מבחן חופשי מהתפלגות" (distribution-free). השם קצת מטעה: גם למבחנים האלה יש הנחות, למשל אי־תלות בין המשתתפים. הם פשוט מניחים פחות.

וקצת היסטוריה. פרנק וילקוקסון, כימאי בחברת כימיקלים אמריקאית, פרסם ב־1945 מאמר קצר, של ארבעה עמודים, ובו שני המבחנים: אחד לזוגות ואחד לשתי קבוצות. שנתיים אחר כך הנרי מאן ותלמידו דונלד ויטני פרסמו מבחן לשתי קבוצות שמבוסס על ספירת זוגות, ומתברר שהוא אותו מבחן בניסוח אחר. לכן לאותו מבחן יש שני שמות. יש לו גם "אחים גדולים" ליותר משתי קבוצות: קרוסקל־וואליס לקבוצות בלתי תלויות (פרק 26), ומבחן פרידמן למדידות חוזרות. וכן, פרידמן הוא מילטון פרידמן, הכלכלן שזכה אחר כך בפרס נובל.

עצרו ונסו

לכל מחקר, בחרו מבחן: א. ציוני מבחן במתמטיקה (0 עד 100) של 80 תלמידים בשתי שיטות לימוד, וההתפלגות סימטריתSymmetric distribution בערך. ב. 12 מורות דירגו את שביעות הרצון שלהן מהשתלמות, בפריט אחד מ־1 עד 5, לפני ההשתלמות ואחריה. ג. 9 תלמידים בכיתה קטנה מול 11 בכיתה רגילה, במספר הימים שנעדרו בשנה. רוב התלמידים נעדרו יום או יומיים, ושניים נעדרו יותר מחודש.

בדיקת התשובה

א. מבחן t למדגמים בלתי תלוייםIndependent-samples t test. סולם רווח, מדגם גדול וסימטרי: אין סיבה לוותר על t. ב. וילקוקסון למדגמים תלוייםDependent samples. אותן מורות פעמיים, פריט בודד בסולם סדר, ומדגם קטן. ג. מאן־ויטני. שתי קבוצות של ילדים שונים, מדגם קטן, התפלגות מוטה מאוד ושני ערכים קיצוניים. ימי היעדרות הם אמנם סולם מנהRatio scale, אבל שני התלמידים שנעדרו חודש היו "מושכים" את מבחן t.

בדקו את עצמכם3 שאלות

1.מה הכוונה במילה "א־פרמטרי"?

2.באיזה מהמצבים הבאים אין סיבה לוותר על מבחן t?

3.תלמידה שואלת: "בפריט מ־1 עד 4 אפשר לחשב ממוצע. אז למה בכלל צריך מבחן אחר?" מה תענו?

דירוגים וערכים חוזרים

מסדרים את הערכים מהקטן לגדול, והקטן מקבל דירוג 1. ערכים שווים (ערכים חוזרים) מקבלים את ממוצע המקומות שהם תופסים. בדיקה: סכום כל הדירוגים של ערכים הוא תמיד N(N + 1) / 2.

את הדירוג פגשנו כבר בפרק 15, במתאם ספירמן. נזכיר בקצרה, כי כל הפרק בנוי עליו. שבעה תלמידים רשמו כמה דקות הקדישו לשיעורי בית ביום מסוים:

דקות203515355035240
דירוג2414647

הערך הקטן ביותר, 15, מקבל 1, ו־20 מקבל 2. שלושה תלמידים כתבו 35. הם תופסים יחד את המקומות 3, 4 ו־5, ולכן כל אחד מקבל את הממוצע, 4. הערך הבא, 50, ממשיך מהמקום 6, ו־240 מקבל 7.

בדיקה שכדאי לעשות תמיד: סכום הדירוגים של 7 ערכים הוא 7 · 8 / 2 = 28. ואכן: 2 + 4 + 1 + 4 + 6 + 4 + 7 = 28. אם הסכום לא יוצא, טעיתם בדירוג.

הדירוג לא יודע כמה רחוק

התלמיד שכתב 240 דקות כנראה טעה, או הגזים. הוא מושך את הממוצע ל־430 / 7 = 61.4 דקות, אף שרק תלמיד אחד מתוך שבעה עבד יותר מ־50 דקות. אילו כתב 60, הממוצע היה יורד ל־35.7. אבל הדירוג שלו היה נשאר 7, וכל הדירוגים האחרים לא היו זזים. זו בדיוק העמידות של המבחנים בפרק: ערך קיצוני משפיע עליהם כמו כל ערך גבוה אחר, לא יותר.

ערכים חוזרים בפריט של שאלון

בפריט בודד עם ארבע תשובות, ערכים חוזרים הם לא מקרה נדיר, אלא כמעט כל הנתונים. בפריט "אני לחוץ/ה כשהמורה שואלת אותי שאלה" (a7), 31 מתוך 200 התלמידים ענו 1. הם תופסים את המקומות 1 עד 31, וכל אחד מקבל (1 + 31) / 2 = 16. 75 ענו 2, במקומות 32 עד 106, וכל אחד מקבל 69.

התשובה ב־a7כמה תלמידיםהמקומותהדירוג של כל אחד
1 = אף פעם311–3116
2 = לפעמים7532–10669
3 = לעיתים קרובות68107–174140.5
4 = תמיד26175–200187.5

ארבע תשובות, ולכן רק ארבעה דירוגים שונים. בדיקה: 31 · 16 + 75 · 69 + 68 · 140.5 + 26 · 187.5 = 20,100 = 200 · 201 / 2. נשתמש בטבלה הזו בסעיף 4.

הסיפור המלא: מאיפה הנוסחה N(N + 1) / 2?

הסיפור המפורסם מספר על קרל פרידריך גאוס, שבגיל צעיר התבקש לסכם את המספרים מ־1 עד 100. הוא כתב אותם פעמיים, פעם מההתחלה ופעם מהסוף, וחיבר זוגות: 1 + 100, 2 + 99, וכן הלאה. כל זוג שווה 101, ויש 100 זוגות, אבל כל מספר נספר פעמיים. לכן הסכום הוא 100 · 101 / 2 = 5050. וממוצע לערכים חוזרים לא משנה את הסכום: הוא רק מחלק אותו אחרת בין הערכים השווים.

עצרו ונסו

דרגו את הערכים 9, 4, 7, 4, 12, 4, 9, 15. בדקו בעזרת סכום הדירוגים.

בדיקת התשובה
4, 4, 4 → המקומות 1, 2, 3 → כל אחד 2
7 → 4,   9, 9 → המקומות 5, 6 → כל אחד 5.5,   12 → 7,   15 → 8
בסדר המקורי: 5.5, 2, 4, 2, 7, 2, 5.5, 8
5.5 + 2 + 4 + 2 + 7 + 2 + 5.5 + 8 = 36 = 8 · 9 / 2 ✓
בדקו את עצמכם4 שאלות

1.מהם הדירוגים של הערכים 12, 7, 12, 3, 12, 20, בסדר המקורי?

2.מה סכום כל הדירוגים כשמדרגים 25 ערכים, כולל כמה ערכים חוזרים?

3.200 תלמידים ענו על פריט מ־1 עד 3: 60 ענו 1, 90 ענו 2, ו־50 ענו 3. איזה דירוג מקבל כל תלמיד שענה 2?

4.בקבוצה של 9 תלמידים, הציון הגבוה ביותר הוא 50. מתברר שהיה צריך להיות 500. מה קורה לדירוגים?

מבחן וילקוקסון למדגמים תלויים

לכל נבדק מחשבים הפרש, D = לפני − אחרי. מוחקים הפרשים של אפס, מדרגים את הערכים המוחלטים, וסוכמים בנפרד את הדירוגים של ההפרשים החיוביים ושל השליליים. הוא הסכום הקטן. דוחים את השערת האפסNull hypothesis כש־T קטן מהערך הקריטי או שווה לו. במדגם גדול: ציון zz-score.

המבחן מתחיל בדיוק כמו מבחן t המזווג: לכל נבדק מחשבים הפרש. אבל במקום לחשב את ממוצע ההפרשים, שואלים שאלה אחרת: האם ההפרשים הגדולים נוטים להיות בכיוון אחד?

אם אין שינוי (השערת האפסNull hypothesis), הפרשים חיוביים ושליליים צפויים להופיע באותה מידה, וגם בגדלים דומים. לכן סכום הדירוגים של החיוביים וסכום הדירוגים של השליליים צפויים להיות דומים. אם כמעט כל השינויים, ובמיוחד הגדולים, הם בכיוון אחד, אחד הסכומים יהיה גדול מאוד, והשני קטן מאוד.

דוגמה פתורה: כמה זמן לוקח להירגע?

מורה מדדה כמה דקות לוקח לכל אחד מעשרה ילדים להירגע ולהתחיל לעבוד אחרי ההפסקה. אחר כך הכניסה דקה של נשימות בתחילת כל שיעור, ומדדה שוב. האם משך ההירגעות השתנה? (דו־צדדי, = .05)

ילדלפניאחריD|D|דירוגהסימן
163336+
24400נמחק
395448+
454111.5+
564223.5+
634−111.5−
785336+
8126669+
952336+
1053223.5+
  1. הפרשים. D = לפני − אחרי. הפרש חיובי פירושו שהילד נרגע מהר יותר.
  2. מוחקים אפסים. ילד 2 לא השתנה, ולכן הוא לא מלמד אותנו כלום על הכיוון. נשארו = 9 הפרשים.
  3. מדרגים את |D|, בלי הסימן. הערכים המוחלטים: 1, 1, 2, 2, 3, 3, 3, 4, 6. שני ערכי 1 מקבלים 1.5, שני ערכי 2 מקבלים 3.5, שלושה ערכי 3 מקבלים 6, ו־4 ו־6 מקבלים 8 ו־9.
  4. מחזירים את הסימן וסוכמים בנפרד.
T− = 1.5 רק ילד 6, שההפרש שלו שלילי
T+ = 6 + 8 + 1.5 + 3.5 + 6 + 9 + 6 + 3.5 = 43.5
43.5 + 1.5 = 45 = 9 · 10 / 2 ✓ בדיקה: סכום כל הדירוגים
T = min(43.5, 1.5) = 1.5 הסכום הקטן
Tcrit(9) = 5   →   1.5 ≤ 5 → דוחים מהטבלה למטה, דו־צדדי, .05

מסקנה: משך ההירגעות השתנה. ברוב הילדים ההפרש חיובי, כלומר הוא התקצר. ילד אחד בלבד נרגע לאט יותר, ובדקה אחת בלבד.

ערכים קריטיים: כאן דוחים כשהסטטיסטי קטן

שימו לב להיגיון ההפוך. במבחני zz test ו־t דחינו כשהסטטיסטי גדול. כאן T הוא הסכום הקטן, ו־T קטן פירושו שכמעט כל ההפרשים, ובמיוחד הגדולים, בכיוון אחד. לכן דוחים כש־T קטן מהערך הקריטי או שווה לו. הטבלה נותנת את הערך הקריטי לפי מספר ההפרשים שנשארו אחרי מחיקת האפסים:

n67891011121314151617181920
דו־צדדי, .050235810131721252934404652

עם 5 הפרשים או פחות אי אפשר לדחות בכלל ברמה הזו: גם אם כל ההפרשים חיוביים, T = 0, והסיכוי לזה בלי שום השפעה הוא 2 · (1/2)5 = .0625.

קירוב נורמלי, כשהמדגם גדול יותר

מעל 20 הפרשים בערך, משתמשים בקירוב נורמלי. אם השערת האפס נכונה, ל־T יש ממוצע צפוי וסטיית תקן ידועים, ו־T מתפלג בקירוב נורמלית. ממירים אותו לציון תקןz-score, כמו בפרק 18:

μT = n(n + 1)4     σT = √n(n + 1)(2n + 1)24     = T − μTσT

הממוצע הצפוי הוא בדיוק חצי מסכום כל הדירוגים, n(n + 1) / 2: אם אין שינוי, כל צד צפוי לקבל חצי. ומכיוון ש־T הוא תמיד הסכום הקטן, z יוצא שלילי, וערך pp-value הדו־צדדי הוא פעמיים השטח משמאלCumulative area לו.

דוגמה מהמחקר: החרדה בכיתה ד׳ אחת בתוכנית העקיפה

בכיתה 4 (class_id = 4) יש 29 תלמידים. היא אחת משתי הכיתות בבית הספר של התוכנית העקיפה, שבה רק המורות התאמנו. החרדה (anx_pre, anx_post) ירדה בממוצע מ־2.32 ל־2.15. אבל התפלגות ההפרשים מוטה: רוב התלמידים ירדו מעט, ותלמיד אחד עלה בנקודה שלמה, מ־2.25 ל־3.25. ההטיה של ההפרשים היא −1.02, יותר מפי שניים מטעות התקןStandard error שלה (0.43), ו־Shapiro-Wilk מובהק (p = .045). מדגם קטן ומוטה: מקרה מתאים לוילקוקסון.

מתוך 29 התלמידים, אצל 2 החרדה לא השתנתה כלל. נשארו 27 הפרשים: 20 חיוביים (החרדה ירדה) ו־7 שליליים (החרדה עלתה). T+ = 286 ו־T− = 92.

μT = 27 · 28 / 4 = 189
σT = √(27 · 28 · 55 / 24) = √1732.5 = 41.62
z = (92 − 189) / 41.62 = −2.33,   p = 2 · NORM.S.DIST(−2.33, TRUE) = .020

מסקנה: החרדה בכיתה ירדה באופן מובהק. ותלמיד 79, שהחרדה שלו עלתה בנקודה שלמה? הוא מקבל את הדירוג הגבוה ביותר, 27, וזהו. גם אילו החרדה שלו הייתה מגיעה ל־4, הקצה של הסולם, הדירוג שלו היה נשאר 27, והמבחן לא היה זז. מבחן t, לעומת זאת, היה צונח מ־t(28) = 2.26, p = .032 ל־t(28) = 1.58, p = .126. נסו את זה במעבדה למטה.

החישוב ביד

27 הפרשים, אבל רק שמונה ערכים מוחלטים שונים. לכן נוח לדרג בקבוצות: כמה תלמידים יש בכל ערך, איזה מקומות הם תופסים, וכמה מהם שליליים.

|D|כמה תלמידיםהמקומותהדירוגמהם שלילייםתרומה ל־T−
0.10711111
0.12552–6414
0.2557–11919
0.375512–1614228
0.5417–2018.500
0.625521–2523123
0.751262600
112727127
T− = 1 + 4 + 9 + 28 + 23 + 27 = 92
T+ = 27 · 28 / 2 − 92 = 378 − 92 = 286
הערך 0.107 שייך לתלמיד שדילג על פריט אחד בשאלון "לפני", ולכן הציון שלו הוא ממוצע של 7 פריטים: 2.143 − 2.25.

התוכנות הסטטיסטיות מוסיפות תיקון לערכים חוזריםTie correction, שמקטין מעט את σT. כאן מקבלים σ = 41.49 ו־z = −2.34 במקום −2.33, ו־p = .019. ההבדל זניח. נראה אותו בקטע "בתוכנה".

הסיפור המלא: תיקון לערכים חוזרים, ולמה מוחקים אפסים

כשכמה הפרשים חולקים דירוג, הפיזורMeasure of dispersion של הדירוגים קטן מעט, ולכן גם סטיית התקן של T. התיקון מחסיר מהשונות Σ(t³ − t) / 48, כש־t הוא מספר ההפרשים בכל קבוצת ערכים חוזרים. בכיתה 4: ארבע קבוצות של 5 ואחת של 4, כלומר 4 · 120 + 60 = 540, ו־σ² = 1732.5 − 540 / 48 = 1721.25. כשיש מעט ערכים חוזרים, התיקון כמעט לא מורגש.

ולמה מוחקים אפסים? הפרש של אפס לא תומך באף כיוון. וילקוקסון עצמו הציע למחוק אותם, וכך עושות התוכנות הסטטיסטיות. יש גם שיטה שמדרגת את האפסים ומחלקת אותם בין הצדדים (Pratt), ובמדגם עם הרבה אפסים התוצאות עשויות להיות שונות מעט. כדאי לדעת שזה קיים, לא יותר.

ועוד פרט: וילקוקסון לזוגות בודק בעצם אם החציוןMedian של ההפרשים באוכלוסייה הוא אפס, בתנאי שהתפלגות ההפרשים סימטרית. כשהיא מוטה מאוד, נכון יותר לנסח את המסקנה כ"ההפרשים נוטים להיות חיוביים", ולא במילים על חציון.

מעבדה: מבחן וילקוקסון למדגמים תלויים. הפרשים, דירוגים, שני הסכומים, ערך קריטי וקירוב נורמלי. אפשר לשנות כל מספר.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו "דוגמה מהפרק" ובדקו את הדירוגים ואת T מול הדוגמה הפתורה.
  2. בחרו "כיתה 4 בתוכנית העקיפה". בשורה של התלמיד שהחרדה שלו עלתה מ־2.25 ל־3.25, שנו את ה"אחרי" ל־4. מה קרה ל־T ולערך pp-value? ומה היה קורה למבחן t?
  3. חזרו לדוגמה מהפרק, ושנו את ה"אחרי" של ילד 8 מ־6 ל־18. מה קרה לסכומים, ולמה השינוי כל כך גדול?
בדיקת התשובה

1. T₊ = 43.5, T₋ = 1.5, n = 9: בדיוק כמו בטבלה. 2. שום דבר לא זז: T = 92, p = .020. ההפרש של התלמיד גדל מ־1 ל־1.75, אבל הוא היה הגדול ביותר גם קודם, והדירוג שלו נשאר 27. מבחן t, לעומת זאת, יורד ל־t(28) = 1.58, p = .126, ולא מובהק. 3. ההפרש של ילד 8 הופך מ־6 ל־−6. הוא עדיין הגדול ביותר בערך מוחלט, ולכן הדירוג שלו, 9, עובר מהסכום החיובי לשלילי: T₊ = 34.5, T₋ = 10.5, ו־T כבר גדול מהערך הקריטי, 5. ההפרש הגדול ביותר "שווה" הכי הרבה, אבל רק 9, גדול ככל שיהיה.

בדקו את עצמכם4 שאלות

1.שמונה תלמידים, וההפרשים (לפני − אחרי) הם: 4, −2, 0, 5, 3, −1, 6, 2. מה T, ומה ההחלטה? (הערך הקריטי לשבעה הפרשים, דו־צדדי, .05: 2)

2.למה במבחן וילקוקסון למדגמים תלויים מדרגים את הערכים המוחלטים של ההפרשים, ולא את ההפרשים עצמם?

3.במבחן וילקוקסון למדגמים תלויים נשארו 30 הפרשים שאינם אפס, ו־T = 120. חשבו z וערך p דו־צדדי בקירוב נורמלי.

4.במבחן וילקוקסון למדגמים תלויים, ההפרש הגדול ביותר בערך מוחלט הוא 3. מתברר שהוא היה צריך להיות 30, באותו כיוון. מה קורה?

מבחן מאן־ויטני: שתי קבוצות בלתי תלויות

מדרגים את כל הנבדקים משתי הקבוצות יחד (דירוג משותףJoint ranking), וסוכמים את הדירוגים של קבוצה 1: W1. 1 =W1 − n1(n1 + 1)/2 הוא מספר הזוגות שבהם נבדק מקבוצה 1 גבוה מנבדק מקבוצה 2. אם אין הבדל, U צפוי להיות חצי מכל הזוגות. משווים בציון z.

כשהקבוצות שונות, אין מה לזווג. מדרגים את כולם יחד, כאילו היו קבוצה אחת, ואז בודקים איפה נמצאים הדירוגים של כל קבוצה. אם אין הבדל, הדירוגים "מעורבבים": לכל קבוצה יש גם נמוכים וגם גבוהים, והממוצע של הדירוגים דומה בשתיהן. אם קבוצה אחת גבוהה יותר, הדירוגים שלה מתרכזים בקצה העליון.

דוגמה פתורה: כמה ספרים קראתם בקיץ?

כיתה אחת השתתפה ב"אתגר קריאה" בחופש הגדול, וכיתה אחרת לא. בכל כיתה נשאלו 7 תלמידים כמה ספרים קראו. האם יש הבדל? (דו־צדדי, α = .05)

מספר הספרים, ובסוגריים הדירוג המשותףסכום
בלי אתגר2 (2)3 (3)1 (1)5 (5)4 (4)7 (7)35 (14)36
עם אתגר6 (6)9 (9)8 (8)10 (10)12 (12)11 (11)14 (13)69

הממוצעים: 8.14 מול 10.00. כמעט אין הבדל, ומבחן t אומר בדיוק את זה: t(12) = −0.40, p = .696. אבל הסתכלו על הנתונים. חמישה מתוך שבעה התלמידים בלי האתגר קראו פחות מכל התלמידים בכיתה עם האתגר, ועוד אחד קרא 7, יותר מתלמיד אחד בלבד שם. ואז יש תלמיד אחד, תולעת ספרים, שקרא 35. הוא לבד מושך את הממוצע של הכיתה שלו מ־3.67 ל־8.14.

W1 = 2 + 3 + 1 + 5 + 4 + 7 + 14 = 36 סכום הדירוגים של קבוצה 1
36 + 69 = 105 = 14 · 15 / 2 ✓ בדיקה: כל הדירוגים
U1 = 36 − 7 · 8 / 2 = 36 − 28 = 8
μU = 7 · 7 / 2 = 24.5 הצפוי אם אין הבדל: חצי מ־49 הזוגות
σU = √(7 · 7 · 15 / 12) = √61.25 = 7.83
z = (8 − 24.5) / 7.83 = −2.11,   p = 2 · NORM.S.DIST(−2.11, TRUE) = .035

מסקנה: p = .035, דוחים. התלמידים שהשתתפו באתגר נוטים לקרוא יותר. מבחן t "פספס" את ההבדל בגלל ערך קיצוני אחד: בלי תולעת הספרים הוא היה נותן t(11) = −4.67, p < .001. מאן־ויטני לא צריך להחליט אם להוציא אותו. מבחינתו, 35 הוא פשוט הדירוג הגבוה ביותר.

מה זה U? ספירה של "ניצחונות"

U הוא מספר פשוט להבנה. בונים את כל הזוגות האפשריים של תלמיד מקבוצה 1 ותלמיד מקבוצה 2: 7 · 7 = 49 זוגות. בכל זוג בודקים מי קרא יותר. U1 הוא מספר הזוגות שבהם "ניצח" התלמיד מקבוצה 1 (תיקו נספר כחצי). בדוגמה: תולעת הספרים מנצחת את כל השבעה, והתלמיד שקרא 7 מנצח רק את מי שקרא 6. סך הכול 7 + 1 = 8, בדיוק כמו בנוסחה. ו־U2, הניצחונות של קבוצה 2, הם 49 − 8 = 41.

אם אין הבדל בין הקבוצות, כל צד צפוי לנצח בערך בחצי מהזוגות. לכן הממוצע הצפוי של U הוא n₁n₂ / 2. וכמה רחוק ממנו הוא יכול לצאת במקרה? זו סטיית התקן:

U1 = W1 − n1(n1 + 1)2     μU = n1n22     σU = √n1n2(N + 1)12     z = U1 − μUσU

אפשר לחשב את z גם ישירות מסכום הדירוגים: הסכום הצפוי של קבוצה 1 הוא μW = n₁(N + 1) / 2, עם אותה סטיית תקן. בדוגמה: μW = 7 · 15 / 2 = 52.5, ו־z = (36 − 52.5) / 7.83 = −2.11. אותו z בדיוק, כי U הוא רק W פחות מספר קבוע. התוכנות מדפיסות את שניהם.

ומה עם מדגמים קטנים? הקירוב הנורמלי סביר כבר כשיש כ־8 בכל קבוצה. בדוגמה, עם 7, הוא קרוב מאוד לחישוב המדויק: .035 מול .038. התוכנות הסטטיסטיות מחשבות במדגמים קטנים גם ערך p מדויקExact p-value, שמבוסס על כל הסידורים האפשריים של הדירוגים. אם יש ערך כזה בפלט, קוראים אותו.

דוגמה מהמחקר: לחץ כשהמורה שואלת

חוזרים לשאלת הפתיחה: a7, "אני לחוץ/ה כשהמורה שואלת אותי שאלה", 1 = אף פעם עד 4 = תמיד. 96 בנים ו־104 בנות. בסעיף 2 ראינו את הדירוג המשותף: ארבע תשובות, ארבעה דירוגים.

1 (16)2 (69)3 (140.5)4 (187.5)החציוןממוצע הדירוגים
בנים (96)1644306289.92
בנות (104)153138203110.27

בכותרת: התשובה, ובסוגריים הדירוג שלה. בתאים: כמה תלמידים ענו כל תשובה. כמעט חמישית מהבנות ענו "תמיד", לעומת 6 בנים בלבד. ממוצע הדירוגים של הבנות גבוה בכ־20 מקומות.

W1 = 16 · 16 + 44 · 69 + 30 · 140.5 + 6 · 187.5 = 8632 סכום הדירוגים של הבנים
U1 = 8632 − 96 · 97 / 2 = 8632 − 4656 = 3976
μU = 96 · 104 / 2 = 4992,   σU = √(96 · 104 · 201 / 12) = 408.94
z = (3976 − 4992) / 408.94 = −2.48,   p = .013
עם תיקון לערכים חוזרים: σU = 388.40,   z = −2.62,   p = .009 מה שהתוכנות הסטטיסטיות מדפיסות

מסקנה: הבנות נלחצות יותר מהבנים כשהמורה שואלת אותן שאלה. החציוןMedian של הבנות הוא "לעיתים קרובות", ושל הבנים "לפעמים".

בדיקת התיקון לערכים חוזרים

כאן כמעט כל הנתונים הם ערכים חוזרים, ולכן התיקון כבר לא זניח: z עובר מ־−2.48 ל־−2.62. התיקון מחשב, לכל ערך, t³ − t, כש־t הוא מספר התלמידים שענו אותו:

Σ(t³ − t) = (31³ − 31) + (75³ − 75) + (68³ − 68) + (26³ − 26) = 29,760 + 421,800 + 314,364 + 17,550 = 783,474
σU² = (96 · 104 / 12) · (201 − 783,474 / (200 · 199)) = 832 · (201 − 19.685) = 832 · 181.315 = 150,854
σU = 388.40,   z = −1016 / 388.40 = −2.62,   p = 2 · NORM.S.DIST(−2.62, TRUE) = .009
הסיפור המלא: וילקוקסון, מאן, ויטני, ושלושה מספרים

בגלל שני המאמרים, מבחן אחד מופיע בשלושה שמות ובכמה סטטיסטיים. וילקוקסון סכם דירוגים, ולכן W. מאן וויטני ספרו "ניצחונות", ולכן U. ותוכנות מדפיסות לפעמים גם z. שלושתם נותנים את אותו ערך p, כי הם רק גרסאות של אותו מידע. שימו לב לאיזה מספר התוכנה שלכם קוראת בשם מה. SPSS מדפיס את U הקטן מבין השניים, ו־W הוא סכום הדירוגים של הקבוצה ששייכת לו. JASP מדפיס את U של הקבוצה הראשונה, גם אם הוא הגדול. באקסל אתם מחשבים בעצמכם, ולכן אתם בוחרים: בספר U1 הוא של קבוצה 1. כך או כך, U₁ + U₂ = n₁n₂, ואפשר תמיד לעבור מאחד לשני.

ועוד הבדל קטן: JASP, שמחשב בעזרת התוכנה R, מוסיף לקירוב הנורמלי גם "תיקון לרציפותContinuity correction" של חצי נקודה. לכן לפעמים ערך p שלו שונה בספרה השלישית מזה של תוכנות אחרות.

מעבדה: מבחן מאן־ויטני (וילקוקסון לבלתי תלויים). שתי הקבוצות על ציר אחד של דירוגים.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו "ספרים בקיץ". איפה על הציר נמצאת תולעת הספרים? כמה זוגות היא "מנצחת"?
  2. בחרו "a7: בנים ובנות". למה הנקודות נערמות רק בארבעה מקומות על הציר? השוו את z בלי תיקון ועם תיקון לערכים חוזרים.
  3. עברו בין "הבדל גדול" ל"אין הבדל". מה קורה ל־U ביחס לערך הצפוי, ל־z ולגודל האפקט?
בדיקת התשובה

1. בקצה הימני, דירוג 14. היא מנצחת את כל 7 התלמידים מהכיתה השנייה, ולכן תורמת 7 מתוך U₁ = 8. 2. בפריט יש רק ארבע תשובות, ולכל תשובה דירוג אחד, ממוצע המקומות. בלי תיקון: z = −2.48. עם תיקון: z = −2.62, כמו בתוכנות. כשרוב הנתונים הם ערכים חוזרים, התיקון חשוב. 3. ב"הבדל גדול" הדירוגים של קבוצה 1 כמעט כולם בצד השמאלי, U רחוק מאוד מהצפוי, z גדול בערך מוחלט, וגודל האפקט קרוב ל־1. ב"אין הבדל" הנקודות מעורבבות, U קרוב לצפוי, z קרוב ל־0, וגם גודל האפקט.

בדקו את עצמכם4 שאלות

1.במבחן מאן־ויטני יש 5 תלמידים בקבוצה 1 ו־6 בקבוצה 2. סכום הדירוגים של קבוצה 1 הוא 20. מה U1 ומה U2?

2.בקבוצה א׳ הציונים 3 ו־8. בקבוצה ב׳ הציונים 5, 6 ו־9. ספרו "ניצחונות": מה U של קבוצה א׳?

3.בשתי קבוצות של 10 תלמידים יצא U1 = 23. חשבו z וערך p דו־צדדי בקירוב נורמלי.

4.סטודנט דירג את התלמידים בכל קבוצה בנפרד: בכל קבוצה הנמוך קיבל 1. מה הבעיה?

כמה גדול ההבדל? המתאם הדו־טורי של הדירוגים

גודל האפקט של שני המבחנים הוא המתאם הדו־טורי של הדירוגים, rrb. בקבוצות בלתי תלויות: (U₂ − U₁) / (n₁n₂), אחוז הזוגות שבהם קבוצה 2 גבוהה, פחות אחוז הזוגות שבהם קבוצה 1 גבוהה. במזווגים: (T₊ − T₋) / (T₊ + T₋). הוא נע בין −1 ל־1. בערך: .10 קטן, .30 בינוני, .50 גדול.

כמו בפרק 21, ערך p לבד לא מספיק. צריך לדעת גם כמה ההבדל גדול. ל־d של כהן אין כאן משמעות, כי הוא מבוסס על ממוצעים וסטיות תקן. במקומו משתמשים במדד שמבוסס על אותם דירוגים: המתאם הדו־טורי של הדירוגים (rank-biserial correlation). בשתי הגרסאות הרעיון זהה: כמה "בעד" פחות כמה "נגד".

rrb = U2 − U1n1n2 = 2(R̄2 − R̄1)N      rrb = T+ − T−T+ + T−

בקבוצות בלתי תלויות, U2 / n1n2 הוא אחוז הזוגות שבהם קבוצה 2 "ניצחה", ו־U1 / n1n2 אחוז הזוגות שבהם קבוצה 1 ניצחה. ההפרש ביניהם הוא rrb. ובצורה השנייה, R̄ הוא ממוצע הדירוגים של כל קבוצה. נוח מאוד, כי SPSS מדפיס אותו.

במזווגים, T+ + T− הוא סכום כל הדירוגים, n(n + 1) / 2. המדד הוא החלק של הדירוגים שבצד החיובי, פחות החלק שבצד השלילי.

הסימן תלוי בכיוון החיסור ובסדר הקבוצות, בדיוק כמו ב־t. לכן כמו שם, בדיווח כותבים את הערך המוחלט ואת הכיוון במילים. וסימני הדרך הם של מתאם (פרק 15): בערך .10 קטן, .30 בינוני, .50 גדול. גם כאן, אלה סימני דרך ולא חוק.

הסיפור המלא: r = z / √N, ולמה יש שני מדדים בשם r

בהרבה מאמרים תמצאו גודל אפקט אחר למבחנים האלה: r = z / √N (Rosenthal). מחלקים את ציון התקן של המבחן בשורש מספר התצפיות. למדד הזה אין פירוש פשוט של "זוגות", והוא יוצא בדרך כלל קטן יותר. בלחץ כשהמורה שואלת: 2.62 / √200 = .18, לעומת rrb = .20. במזווגים הפער גדול יותר. כשאתם משווים מחקרים, בדקו איזה r כל אחד דיווח. בספר נשתמש ב־rrb, כי JASP מדפיס אותו, ויש לו פירוש ברור (Kerby, 2014).

ועוד מדד קרוב: ההסתברות לעליונות, (1 + rrb) / 2, הסיכוי שנבדק אקראי מקבוצה 2 גבוה מנבדק אקראי מקבוצה 1. זה אולי המדד הכי קל להסביר להורים או למנהלת: "ב־60% מהזוגות הבת לחוצה יותר".

עצרו ונסו

בתוכנית העשרה השתתפו 10 תלמידים, ובקבוצת ההשוואה 12. בדירוג המשותף של ציוני הסקרנות, סכום הדירוגים של תוכנית ההעשרה (קבוצה 1) הוא 150. חשבו את U1, את U2 ואת rrb. איזו קבוצה גבוהה יותר?

בדיקת התשובה
U1 = 150 − 10 · 11 / 2 = 150 − 55 = 95
U2 = 10 · 12 − 95 = 25
rrb = (25 − 95) / 120 = −.58

הסימן שלילי, ולכן קבוצה 1, תוכנית ההעשרה, היא הגבוהה. ב־95 מתוך 120 הזוגות (79%) התלמיד מתוכנית ההעשרה סקרן יותר. אפקט גדול. בדיווח: rrb = .58, והכיוון במילים.

בדקו את עצמכם3 שאלות

1.במבחן מאן־ויטני עם 10 תלמידים בכל קבוצה, U1 = 30 ו־U2 = 70. מה גודל האפקט?

2.במבחן וילקוקסון למדגמים תלויים עם 20 הפרשים שאינם אפס, T+ = 150 ו־T− = 60. מה rrb?

3.חוקרת מדווחת: "rrb = .30, הבנות גבוהות יותר". איך תסבירו את זה למנהלת בית הספר, במשפט אחד בלי מונחים?

מה המבחנים האלה בודקים, ואיך בוחרים?

המבחנים בודקים אם ערכים מקבוצה אחת נוטים להיות גבוהים מערכים מהשנייה, לא אם הממוצעים או החציונים שווים. מדווחים חציונים, ומפרשים במילים של "נוטים להיות גבוהים". כשההנחות של t מתקיימות, t עדיף מעט. כשהן לא, המבחן הא־פרמטרי בטוח יותר, ולפעמים עוצמתי בהרבה. בוחרים מבחן לפי הנתונים והמערך, לפני שרואים את התוצאה.

לא מבחן של חציונים, בדיוק

קל לחשוב שמאן־ויטני הוא "מבחן t של החציונים". זה לא מדויק. השערת האפס שלו היא שבאוכלוסייה, נבדק מקבוצה 1 ונבדק מקבוצה 2 גבוהים זה מזה באותה הסתברות: בערך חצי מהזוגות לכל צד. דוגמה מהמחקר: בפריט "אני דואג/ת לפני מבחנים" (a4) החציון של הבנים ושל הבנות הוא אותו חציון, 2. ובכל זאת מאן־ויטני מובהק: U = 4064.5, z = −2.40, p = .016.

a41 = אף פעם2 = לפעמים3 = לעיתים קרובות4 = תמידהחציון
בנים23%43%30%4%2
בנות13%42%30%15%2

החציון זהה, כי אצל שני המגדרים "לפעמים" באמצע. אבל אצל הבנות יש פחות "אף פעם" ופי שלושה ויותר "תמיד". ההתפלגות שלהן מוזזת כלפי מעלה, והמבחן רואה את זה. לכן במסקנה כותבים "הבנות נוטות לדאוג יותר לפני מבחנים", ולא "לבנות יש חציון גבוה יותר". רק כששתי ההתפלגויות דומות בצורתן, ורק אחת מוזזת, מותר לנסח את המסקנה במילים של חציונים.

גם למבחנים א־פרמטריים יש הנחות

מה מפסידים, ומה מרוויחים

כשהנתונים באמת נורמליים, מבחן t עוצמתי מעט יותר: מאן־ויטני צריך בערך 5% יותר נבדקים כדי להגיע לאותה עוצמה. זה מחיר קטן. וכשההתפלגות מוטה או שיש ערכים קיצוניים, המצב מתהפך, והמבחן הא־פרמטרי יכול להיות עוצמתי בהרבה, כמו שראינו בספרים בקיץ. בנתונים שלנו:

השאלהמבחן tהמבחן הא־פרמטרי
לחץ כשהמורה שואלת (a7), בנים ובנותp = .009p = .009
"מפחד/ת שאטעה מול כולם" (a2), בנים ובנותp = .069p = .046
החרדה בכיתה 4, לפני ואחריp = .032p = .019
ספרים בקיץ (ערך קיצוני)p = .696p = .035

במדגם גדול, בלי ערכים קיצוניים, שני המבחנים מגיעים כמעט תמיד לאותה תוצאה. ההבדלים מופיעים במדגמים קטנים, בהתפלגויות מוטות ובערכים קיצוניים, כלומר בדיוק במצבים שבהם t לא מתאים.

אז איך בוחרים?

  1. מי נמדד? אותם אנשים פעמיים, או זוגות: וילקוקסון או t למזווגים. שתי קבוצות של אנשים שונים: מאן־ויטני או t לבלתי תלויים. שלוש קבוצות ויותר: פרק 26.
  2. באיזה סולם? פריט בודד, דירוג, מקום: מבחן א־פרמטרי. ציון של שאלון שלם, זמן, מבחן הישגים: אפשר t.
  3. כמה נבדקים, ואיך נראית ההתפלגות? 30 ומעלה בכל קבוצה, בלי ערכים קיצוניים בולטים: t. מדגם קטן עם הטיה ברורה או ערך קיצוני: מבחן א־פרמטרי.

ובעיקר: מחליטים לפני שמסתכלים על ערך p. להריץ את שני המבחנים ולדווח את זה שיצא מובהק זו בחירה לפי התוצאה, והיא מגדילה את הסיכוי לטעות מסוג ראשוןType I error. מותר, ואפילו רצוי, להריץ את שניהם כבדיקת יציבות, אבל אז מדווחים מראש איזה מהם הוא העיקרי, ומציינים אם השני מסכים.

הסיפור המלא: עוצמה, ועוד דרכים לצאת מהבעיה

המספר "5% יותר נבדקים" בא מחישוב של הודג׳ס ולהמן (Hodges & Lehmann, 1956): כשההתפלגות נורמלית, היעילות של מאן־ויטני ביחס ל־t היא 3/π ≈ .955. הם גם הוכיחו משהו מפתיע: לכל התפלגות רציפה שהיא, היעילות לא יורדת מתחת ל־.864. כלומר המבחן הא־פרמטרי אף פעם לא מפסיד הרבה, ולפעמים מרוויח הרבה מאוד. יש סטטיסטיקאים שמסיקים מכך שאפשר להשתמש בו כמעט תמיד. אחרים מעדיפים את t, כי ממוצעים ורווחי סמךConfidence interval לממוצע קלים יותר להבנה ולהשוואה בין מחקרים.

ומבחנים א־פרמטריים הם לא הדרך היחידה. בפרק 35 נכיר טרנספורמציותTransformation, כמו לוגריתם, שהופכות התפלגות מוטה לסימטרית יותר, ואז אפשר לחזור למבחן t. ויש גם מבחני תמורות (permutation tests), שמערבבים את הנתונים אלפי פעמים במחשב ובונים מהם את התפלגות הדגימה. מאן־ויטני הוא בעצם מבחן תמורות על דירוגים: ערך p המדויק שלו נספר מכל הדרכים לחלק את הדירוגים בין שתי הקבוצות.

בדקו את עצמכם3 שאלות

1.בשתי קבוצות החציון זהה, 3, אבל מבחן מאן־ויטני מובהק. איך זה ייתכן?

2.חוקר הריץ על אותם נתונים גם מבחן t וגם מאן־ויטני, ודיווח רק את זה שיצא מובהק. מה הבעיה?

3.מורה השוותה בעזרת מאן־ויטני את התלמידים של שתי כיתות, 25 בכל אחת, בכמה פעמים כל תלמיד השתתף בדיון. במהלך השנה כל כיתה למדה עם מורה אחרת. איזו הנחה נשארת גם במבחן הזה, ולמה היא רלוונטית כאן?

בתוכנה: שתי השאלות מהפתיחה

עכשיו נריץ את שני המבחנים על קובץ המחקר. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות של כל קטע. באקסל בונים את המבחן בנוסחאות, וב־SPSS וב־JASP הוא מוכן.

מאן־ויטני: האם בנות נלחצות יותר כשהמורה שואלת?

משתנה תלויDependent variable: a7 (1 עד 4). משתנה הקבוצה: gender (1 = בן, 2 = בת). את החישוב ביד ראיתם בסעיף 4.

באקסל אין מבחן מאן־ויטני מובנה. בונים אותו בשלוש פונקציות: RANK.AVG לדירוג המשותף, SUMIF לסכום הדירוגים של קבוצה, ו־NORM.S.DIST לערך p. בקובץ, gender היא עמודה F ו־a7 היא עמודה P, בשורות 2 עד 201. העמודה הריקה הראשונה היא BD.

  1. בתא BD2: =RANK.AVG(P2,$P$2:$P$201,1), וגוררים עד BD201. הארגומנט האחרון, 1, מדרג מהקטן לגדול. ערכים חוזרים מקבלים לבד את ממוצע המקומות.
  2. את החישובים כותבים בעמודה BF:

Mann-Whitney: a7 (P2:P201) by gender (F2:F201), ranks in BD

CellFormulaResult
BF2 (n1, boys)=COUNTIF(F2:F201,1)96
BF3 (n2, girls)=COUNTIF(F2:F201,2)104
BF4 (W1)=SUMIF(F2:F201,1,BD2:BD201)8632
BF5 (U1)=BF4-BF2*(BF2+1)/23976
BF6 (mean of U)=BF2*BF3/24992
BF7 (SD of U)=SQRT(BF2*BF3*(BF2+BF3+1)/12)408.94
BF8 (z)=(BF5-BF6)/BF7-2.48
BF9 (p, two-tailed)=2*NORM.S.DIST(-ABS(BF8),TRUE)0.0130
BF10 (r rank-biserial)=1-2*BF5/(BF2*BF3)0.20
BF4, BF5
סכום הדירוגים של הבנים, ו־U שלהם: בכמה זוגות של בן ובת הבן לחוץ יותר (תיקו כחצי).
BF8, BF9
ציון התקן וערך p, בלי תיקון לערכים חוזרים: z = −2.48, p = .013. SPSS ו־JASP נותנים p = .009, כי הם מתקנים.
BF10
המתאם הדו־טורי של הדירוגים. חיובי, כי 1 − 2U₁/(n₁n₂) = (U₂ − U₁)/(n₁n₂): הבנות גבוהות יותר.
הסיפור המלא: התיקון לערכים חוזרים באקסל

בפריט עם ארבע תשובות כדאי לתקן. מוסיפים שלושה תאים: =SUMPRODUCT(COUNTIF(P2:P201,{1,2,3,4})^3-COUNTIF(P2:P201,{1,2,3,4})) ב־BF11 נותן 783474. ב־BF12, סטיית התקן המתוקנת: =SQRT(BF2*BF3/12*((BF2+BF3+1)-BF11/((BF2+BF3)*(BF2+BF3-1)))) נותן 388.40. וב־BF13: =2*NORM.S.DIST(-ABS((BF5-BF6)/BF12),TRUE) נותן 0.0089, כמו בתוכנות.

חציונים לכל קבוצה: =MEDIAN(IF(F2:F201=1,P2:P201)) נותן 2 לבנים, ועם 2 במקום 1 נותן 3 לבנות. בגרסאות ישנות של אקסל מאשרים את הנוסחה ב־Ctrl+Shift+Enter.

  1. Analyze > Nonparametric Tests > Legacy Dialogs > 2 Independent Samples
  2. Test Variable List: a7. Grouping Variable: gender, ובכפתור Define Groups מקלידים 1 ו־2.
  3. תחת Test Type מסומן Mann-Whitney U (ברירת המחדל). לוחצים OK.

Ranks

genderNMean Rank 1Sum of Ranks
a7Boy9689.928632.00
Girl104110.2711468.00
Total200

Test Statisticsa

a7
Mann-Whitney U 23976.000
Wilcoxon W8632.000
Z 3-2.616
Asymp. Sig. (2-tailed).009

a. Grouping Variable: gender

1 · Mean Rank
ממוצע הדירוגים בכל קבוצה. כאן רואים את הכיוון: הבנות גבוהות יותר. ומכאן גם גודל האפקט: 2 · (110.27 − 89.92) / 200 = .20.
2 · Mann-Whitney U, Wilcoxon W
SPSS מדפיס את ה־U הקטן מבין השניים, כאן של הבנים, ואת סכום הדירוגים של אותה קבוצה. שניהם נותנים את אותו z.
3 · Z, Asymp. Sig.
ציון התקן, עם תיקון לערכים חוזרים, וערך p הדו־צדדי של הקירוב הנורמלי: z = −2.62, p = .009.

SPSS לא מחשב כאן גודל אפקט, ולכן מחשבים אותו ממוצעי הדירוגים, כמו למעלה. לחציונים: Analyze > Descriptive Statistics > Explore, עם a7 ב־Dependent List ו־gender ב־Factor List.

יש ב־SPSS גם תפריט חדש יותר: Analyze > Nonparametric Tests > Independent Samples. הוא מציג טבלת Hypothesis Test Summary עם החלטה ("Reject the null hypothesis"), ובלחיצה כפולה עליה נפתח חלון עם U, W, ציון התקן (Standardized Test Statistic) וערך p. המספרים זהים. בספר משתמשים ב־Legacy Dialogs, כי הפלט שלהם מלא וקל לקריאה.

אם הוגדרו תוויות ערכים ל־gender, יופיעו Boy ו־Girl. אחרת יופיעו 1 ו־2. במדגם קטן SPSS מוסיף שורה של Exact Sig.

  1. T-Tests > Independent Samples T-Test (Classical).
  2. Dependent Variables: a7. Grouping Variable: gender. אם JASP קרא את a7 כמשתנה סדר, ייתכן שתצטרכו להגדיר אותו כ־Scale. זה לא משנה את המבחן: הוא משתמש רק בסדר.
  3. תחת Tests מבטלים את Student ומסמנים Mann-Whitney. תחת Additional Statistics מסמנים Effect size.

Independent Samples T-Test

UdfpRank-Biserial CorrelationSE Rank-Biserial Correlation
a73976.000.009-0.2040.082

Note. Mann-Whitney U test.

U
U של הקבוצה הראשונה, הבנים (gender = 1): בכמה זוגות של בן ובת הבן לחוץ יותר. 3976 מתוך 96 · 104 = 9984 זוגות.
p
ערך p דו־צדדי: .009. אין עמודת df, כי זה לא מבחן t.
Rank-Biserial Correlation
−0.20. JASP מחשב אותו מצד הקבוצה הראשונה, ולכן הסימן השלילי אומר שהבנים נמוכים יותר, כלומר הבנות לחוצות יותר. בדיווח: rrb = .20, והכיוון במילים.

לחציונים: Descriptives, עם a7 ב־Variables ו־gender ב־Split, ותחת Statistics מסמנים Median. אפשר לסמן ב־T-Test גם Student וגם Mann-Whitney, ואז שני המבחנים יופיעו באותה טבלה, וכותרת העמודה תשתנה ל־Statistic.

בגרסאות שונות של JASP שמות האפשרויות ומיקומן עשויים להשתנות מעט.

וילקוקסון: האם החרדה ירדה בכיתה 4?

29 התלמידים של כיתה 4 (class_id = 4), anx_pre ו־anx_post. את החישוב ביד ראיתם בסעיף 3.

הקובץ ממוין לפי מספר התלמיד, ולכן כיתה 4 נמצאת בשורות 76 עד 104. anx_pre היא עמודה AI, ו־anx_post היא עמודה AP. שלוש עמודות עזר, כל אחת בשורה 76 וגוררים עד 104:

  1. BD, ההפרש: =AI76-AP76
  2. BE, הערך המוחלט, ותא ריק אם ההפרש אפס: =IF(BD76=0,"",ABS(BD76))
  3. BF, הדירוג: =IF(BE76="","",RANK.AVG(BE76,$BE$76:$BE$104,1)). RANK.AVG מתעלם מהתאים הריקים, וכך האפסים נמחקים.

Wilcoxon: anx_pre (AI) − anx_post (AP), rows 76–104

CellFormulaResult
BH2 (n)=COUNT(BF76:BF104)27
BH3 (T+)=SUMIF(BD76:BD104,">0",BF76:BF104)286
BH4 (T−)=SUMIF(BD76:BD104,"<0",BF76:BF104)92
BH5 (T)=MIN(BH3,BH4)92
BH6 (mean of T)=BH2*(BH2+1)/4189
BH7 (SD of T)=SQRT(BH2*(BH2+1)*(2*BH2+1)/24)41.62
BH8 (z)=(BH5-BH6)/BH7-2.33
BH9 (p, two-tailed)=2*NORM.S.DIST(BH8,TRUE)0.0198
BH10 (r rank-biserial)=(BH3-BH4)/(BH3+BH4)0.51
BH2
מספר ההפרשים שאינם אפס. COUNT סופר רק מספרים, ולכן מדלג על התאים הריקים.
BH3, BH4
סכום הדירוגים של ההפרשים החיוביים (החרדה ירדה) ושל השליליים (עלתה). בדיקה: 286 + 92 = 378 = 27 · 28 / 2.
BH8, BH9
z = −2.33, p = .020, בלי תיקון לערכים חוזרים. SPSS נותן .019.
  1. כדי לנתח רק את כיתה 4: Data > Select Cases, If: class_id = 4.
  2. Analyze > Nonparametric Tests > Legacy Dialogs > 2 Related Samples
  3. Test Pairs: anx_pre ב־Variable1, anx_post ב־Variable2. תחת Test Type מסומן Wilcoxon (ברירת המחדל). OK.

Ranks

NMean RankSum of Ranks 1
anx_post - anx_preNegative Ranks20a14.30286.00
Positive Ranks7b13.1492.00
Ties2c
Total29

a. anx_post < anx_pre   b. anx_post > anx_pre   c. anx_post = anx_pre

Test Statisticsa

anx_post - anx_pre
Z 2-2.338b
Asymp. Sig. (2-tailed).019

a. Wilcoxon Signed Ranks Test   b. Based on positive ranks.

anx_post - anx_pre
שימו לב: SPSS מחסיר את המשתנה הראשון מהשני, אחרי פחות לפני. לכן Negative Ranks הם התלמידים שהחרדה שלהם ירדה, 20 תלמידים, עם סכום דירוגים 286.
1 · Sum of Ranks
שני הסכומים, T+ ו־T− שלנו, רק בשמות הפוכים. T הוא הקטן, 92. גודל האפקט: (286 − 92) / 378 = .51.
Ties
2 תלמידים שהחרדה שלהם לא השתנתה. הם לא נכנסים לחישוב.
2 · Z, Asymp. Sig.
z = −2.34, p = .019, עם תיקון לערכים חוזרים. ההערה "Based on positive ranks" אומרת שהחישוב נעשה מהסכום הקטן, של העליות.

בסוף מחזירים את כל הנתונים: Select Cases > All cases. גם כאן יש תפריט חדש, Analyze > Nonparametric Tests > Related Samples, עם אותם מספרים בתצוגה אחרת.

  1. כדי לנתח רק את כיתה 4: לוחצים על כותרת העמודה class_id ומשאירים מסומן רק את 4 (מסנן).
  2. T-Tests > Paired Samples T-Test. מכניסים את anx_pre ואז anx_post, באותה שורה.
  3. תחת Tests מבטלים את Student ומסמנים Wilcoxon signed-rank. תחת Additional Statistics מסמנים Effect size.

Paired Samples T-Test

Measure 1Measure 2WzdfpRank-Biserial CorrelationSE Rank-Biserial Correlation
anx_pre-anx_post286.0002.330.0200.5130.217

Note. Wilcoxon signed-rank test.

W
JASP מחסיר את Measure 2 מ־Measure 1, לפני פחות אחרי, ומדפיס את סכום הדירוגים של ההפרשים החיוביים: T+ = 286. את T של הספר מקבלים ממנו: 378 − 286 = 92.
z, p
z = 2.33 מחושב בלי תיקון, מצד T+, ולכן חיובי. ערך p, .020, כולל תיקון לערכים חוזרים ותיקון לרציפותContinuity correction, ולכן שונה מעט מ־SPSS.
Rank-Biserial Correlation
0.51, חיובי: רוב משקל הדירוגים בצד של לפני גבוה מאחרי, כלומר ירידה בחרדה.
בדקו את עצמכם3 שאלות

1.באקסל, בעמודת העזר BE של מבחן וילקוקסון כתבתם =IF(BD76=0,"",ABS(BD76)), כש־BD הוא ההפרש. למה צריך את ה־IF?

1.בפלט Ranks של SPSS, במבחן וילקוקסון עם anx_pre כ־Variable1 ו־anx_post כ־Variable2, השורה הראשונה היא "anx_post - anx_pre: Negative Ranks". מי התלמידים בשורה הזו?

1.ב־JASP, במבחן Wilcoxon signed-rank עם anx_pre ב־Measure 1 ו־anx_post ב־Measure 2, יצא W = 286. מה זה המספר הזה?

2.בכיתה 4, חישוב בנוסחאות של הספר נותן z = −2.33, p = .020, ותוכנה סטטיסטית נותנת z = −2.34, p = .019. מה ההסבר?

3.בפלט של מאן־ויטני, ממוצע הדירוגים של קבוצה 1 הוא 40, ושל קבוצה 2 הוא 55. בשתי הקבוצות יחד יש 94 נבדקים. חשבו את rrb.

איך מדווחים

כמו במבחן t: משפט אחד, עם כיוון ההבדל וכל המספרים. ההבדלים: במקום ממוצעים וסטיות תקן מדווחים חציונים (), ולפעמים גם את הטווח הבין־רבעוני. במקום t ודרגות חופשDegrees of freedom מדווחים את סטטיסטי המבחןTest statistic (U או T) ואת z. וגודל האפקט הוא rrb.

הבנות דיווחו על לחץ רב יותר מהבנים כשהמורה שואלת אותן שאלה (Mdn = 3 לעומת Mdn = 2). ההבדל מובהק, וגודל האפקט קטן־בינוני, U = 3976, z = −2.62, p = .009, rrb = .20.

בכיתה 4 החרדה ירדה באופן מובהק מלפני התוכנית (Mdn = 2.38) לאחריה (Mdn = 2.13), מבחן וילקוקסון למדגמים תלויים, T = 92, z = −2.34, p = .019, rrb = .51. בחרנו במבחן א־פרמטרי בגלל מדגם קטן והתפלגות הפרשים מוטה (הטיה −1.02).

שימו לב: כתבו תמיד את שם המבחן, כי W ו־T מופיעים בספרות במשמעויות שונות. מי שעובד ב־JASP יכול לדווח W = 286, ובלבד שיכתוב שזה סכום הדירוגים של הירידות. ואם עברתם למבחן א־פרמטרי בגלל ההנחות, כתבו את הסיבה, כמו בדוגמה השנייה.

טעויות נפוצות

בדקו את עצמכם

סיכום

μT = n(n + 1) / 4,   σT = √(n(n + 1)(2n + 1) / 24),   rrb = (T+ − T−) / (T+ + T−)
U1 = W1 − n1(n1 + 1) / 2,   μU = n1n2 / 2,   σU = √(n1n2(N + 1) / 12)
z = (סטטיסטי − ממוצע צפוי) / סטיית תקן,   rrb = (U2 − U1) / (n1n2)

מונחים חדשים

מבחן פרמטרימבחן א־פרמטריערכים חוזריםדירוג משותףמבחן וילקוקסון למדגמים תלוייםהסטטיסטי T של וילקוקסוןמבחן מאן־ויטניקירוב נורמליתיקון לערכים חוזריםהמתאם הדו־טורי של הדירוגים

שאלות לדוגמה, עם פתרונות

  1. לכל מחקר, בחרו מבחן ונמקו במשפט. א. 40 תלמידים דירגו פעמיים, בתחילת השנה ובסופה, את המשפט "אני אוהב/ת לבוא לבית הספר", מ־1 עד 5. ב. ציון שאלון הקשיבות (ממוצע 15 פריטים) של 75 תלמידים בתוכנית המשולבת מול 74 בביקורת. ג. משך הזמן, בשניות, שלקח ל־8 ילדים עם קשיי קשב ול־9 ילדים בלי קשיים לפתור חידה. אחד הילדים בקבוצה הראשונה ויתר אחרי 20 דקות. ד. שלוש כיתות דירגו את מידת ההנאה מהטיול השנתי, מ־1 עד 5.

    בדיקת התשובה

    א. וילקוקסון למדגמים תלויים: אותם תלמידים פעמיים, ופריט בודד בסולם סדר. ב. מבחן t למדגמים בלתי תלויים: ציון של שאלון שלם, קבוצות גדולות. מאן־ויטני לא שגוי כאן, אבל אין סיבה לוותר על t. ג. מאן־ויטני: קבוצות קטנות של ילדים שונים, וזמני פתרון מוטים מטבעם, עם ערך קיצוני אחד ברור. ד. שלוש קבוצות: לא מבחן מהפרק הזה. המקביל הא־פרמטרי לניתוח שונותOne-way ANOVA הוא קרוסקל־וואליסKruskal-Wallis test (פרק 26).

  2. בתחילת כל בוקר, 12 תלמידים דירגו את מצב הרוח שלהם מ־1 עד 7. אחרי חודש של "מעגל בוקר" דירגו שוב. לפני: 3, 4, 2, 5, 3, 4, 2, 6, 3, 4, 5, 4. אחרי: 5, 4, 4, 6, 5, 3, 4, 7, 6, 4, 6, 6. האם מצב הרוח השתנה? חשבו D = לפני − אחרי, השתמשו בטבלת הערכים הקריטיים (דו־צדדי, .05), וחשבו את גודל האפקט.

    בדיקת התשובה
    D = −2, 0, −2, −1, −2, 1, −2, −1, −3, 0, −1, −2
    מוחקים 2 אפסים → n = 10
    |D|: ארבעה ערכי 1 → המקומות 1–4 → 2.5;   חמישה ערכי 2 → המקומות 5–9 → 7;   3 → 10
    T+ = 2.5 רק תלמיד 6, שמצב הרוח שלו ירד
    T− = 55 − 2.5 = 52.5 סכום כל הדירוגים: 10 · 11 / 2 = 55
    T = 2.5 ≤ Tcrit(10) = 8 → דוחים
    rrb = (2.5 − 52.5) / 55 = −.91

    מסקנה: מצב הרוח השתנה. ההפרשים כמעט כולם שליליים, וחיסרנו לפני פחות אחרי, ולכן מצב הרוח עלה. גודל האפקט גדול מאוד, rrb = .91. ובכל זאת, בלי קבוצת ביקורת אי אפשר לדעת אם זה בזכות מעגל הבוקר.

  3. בוחנת חיצונית נתנה ציון מ־1 עד 10 לחיבורים של שתי קבוצות. קבוצה רגילה: 5, 6, 4, 7, 6, 5, 8, 3. קבוצה שעבדה עם משוב עמיתים: 7, 8, 6, 9, 9, 7, 10, 8. א. דרגו את כל 16 הציונים יחד, וחשבו את W ואת U של הקבוצה הרגילה. ב. חשבו z וערך p דו־צדדי בקירוב נורמלי. ג. חשבו את rrb ופרשו אותו במילים של זוגות.

    בדיקת התשובה
    3 → 1, 4 → 2, 5, 5 → 3.5, 6, 6, 6 → 6, 7, 7, 7 → 9, 8, 8, 8 → 12, 9, 9 → 14.5, 10 → 16
    W1 = 3.5 + 6 + 2 + 9 + 6 + 3.5 + 12 + 1 = 43,   W2 = 136 − 43 = 93 16 · 17 / 2 = 136
    U1 = 43 − 8 · 9 / 2 = 43 − 36 = 7,   U2 = 64 − 7 = 57
    μU = 8 · 8 / 2 = 32,   σU = √(8 · 8 · 17 / 12) = √90.67 = 9.52
    z = (7 − 32) / 9.52 = −2.63,   p = 2 · NORM.S.DIST(−2.63, TRUE) = .009
    rrb = (57 − 7) / 64 = .78

    דוחים: החיבורים של הקבוצה עם משוב העמיתים קיבלו ציונים גבוהים יותר. מתוך 64 הזוגות של חיבור רגיל וחיבור עם משוב, החיבור עם המשוב קיבל ציון גבוה יותר ב־57 (תיקו כחצי), כלומר ב־89% מהזוגות. אפקט גדול.

  4. בפריט "אני מפחד/ת שאטעה מול כולם" (a2, 1 עד 4) הושוו בנים ובנות. א. מה הכיוון, ואיך יודעים? ב. חשבו את rrb מהטבלה הראשונה. ג. כתבו משפט דיווח. ד. מבחן t על אותם נתונים נותן t(198) = 1.83, p = .069. חבר מציע: "נדווח את מאן־ויטני, כי הוא יצא מובהק". מה תענו?

    Ranks

    genderNMean RankSum of Ranks
    a2Boy9692.468876.00
    Girl104107.9211224.00
    Total200

    Test Statisticsa

    a2
    Mann-Whitney U4220.000
    Wilcoxon W8876.000
    Z-1.999
    Asymp. Sig. (2-tailed).046

    a. Grouping Variable: gender

    בדיקת התשובה

    א. ממוצע הדירוגים של הבנות גבוה יותר (107.92 מול 92.46): הבנות נוטות לפחד יותר לטעות מול כולם. את הכיוון קובעים מ־Mean Rank, לא מהסימן של Z.

    rrb = 2 · (107.92 − 92.46) / 200 = 2 · 15.46 / 200 = .15 ב. מממוצעי הדירוגים
    בדיקה: U2 = 9984 − 4220 = 5764,   (5764 − 4220) / 9984 = .15

    ג. "הבנות דיווחו על פחד רב יותר לטעות מול הכיתה מאשר הבנים (Mdn = 3 לעומת Mdn = 2), U = 4220, z = −2.00, p = .046, rrb = .15." אפקט קטן.

    ד. לא כך מחליטים. בחירה לפי ערך p היא בחירה לפי התוצאה. כאן דווקא יש סיבה טובה מראש למאן־ויטני: a2 הוא פריט בודד בסולם סדר. אם זה היה התכנון, מדווחים אותו. אבל ההבדל בין .046 ל־.069 צריך להזכיר לנו ששתי התוצאות קרובות לגבול, ושהאפקט קטן. מסקנה הוגנת: "יש עדות חלשה לכך שבנות מפחדות יותר", לא "נמצא הבדל ברור".

  5. בקבוצת הביקורת (74 תלמידים) נבדק אם שביעות הרצון מהחיים השתנתה במהלך השנה (sat_pre, sat_post). קראו את הפלט של JASP וענו: א. כמה תלמידים לא השתנו בכלל, אם ידוע שיש 62 הפרשים שאינם אפס? ב. מה סכום הדירוגים של ההפרשים השליליים? ג. האם שביעות הרצון עלתה או ירדה? ד. דווחו במשפט.

    Paired Samples T-Test

    Measure 1Measure 2WzdfpRank-Biserial CorrelationSE Rank-Biserial Correlation
    sat_pre-sat_post569.000-2.857.004-0.4170.145

    Note. Wilcoxon signed-rank test.

    בדיקת התשובה
    74 − 62 = 12 א. הפרשים של אפס נמחקו
    62 · 63 / 2 = 1953,   T− = 1953 − 569 = 1384 ב. W הוא סכום הדירוגים של ההפרשים החיוביים
    rrb = (569 − 1384) / 1953 = −.42 בדיקה מול הפלט

    ג. JASP מחסיר את Measure 2 מ־Measure 1, לפני פחות אחרי. רוב משקל הדירוגים בצד השלילי, כלומר אחרי גדול מלפני: שביעות הרצון עלתה. ד. "בקבוצת הביקורת שביעות הרצון מהחיים עלתה באופן מובהק במהלך השנה, מבחן וילקוקסון למדגמים תלויים, T = 569, z = −2.86, p = .004, rrb = .42." זו אותה מסקנה כמו במבחן t בפרק 21, ומאותה סיבה היא חשובה: חלק מהעלייה קורה גם בלי תוכנית.

  6. חוקר משווה את מספר הפעמים שתלמידים נשלחו ליועצת במהלך השנה, בין 12 תלמידים בבית ספר עם תוכנית חברתית ל־12 בלי. רוב התלמידים נשלחו 0 עד 3 פעמים, אבל שני תלמידים בבית הספר בלי התוכנית נשלחו 25 ו־40 פעמים. א. מה צפוי לקרות למבחן t, ולמה? ב. סכום הדירוגים של בית הספר עם התוכנית (קבוצה 1) הוא 108. חשבו U1, z, ערך p ו־rrb. ג. מה עוד צריך לבדוק לפני שמסיקים שהתוכנית עובדת?

    בדיקת התשובה

    א. שני הערכים הקיצוניים מנפחים את הממוצע של בית הספר בלי התוכנית, אבל גם, ואף יותר, את סטיית התקן שלו. המכנה של t גדל, ולכן t עלול לצאת קטן ולא מובהק, אף שרוב התלמידים בבית הספר הזה נשלחו יותר פעמים. וגם ההנחה של נורמליות לא סבירה: ספירות של אירועים נדירים מוטות מטבען.

    U1 = 108 − 12 · 13 / 2 = 108 − 78 = 30,   U2 = 144 − 30 = 114
    μU = 12 · 12 / 2 = 72,   σU = √(12 · 12 · 25 / 12) = √300 = 17.32
    z = (30 − 72) / 17.32 = −2.42,   p = .015
    rrb = (114 − 30) / 144 = .58

    ב. דוחים. התלמידים בבית הספר עם התוכנית נשלחו פחות פעמים ליועצת, ובאפקט גדול. (עם הרבה אפסים ואחדים יש כאן ערכים חוזרים רבים, ולכן התוכנה, עם התיקון, תיתן z גדול מעט יותר בערך מוחלט.) ג. אלה שני בתי ספר, לא תלמידים שהוגרלו. אולי בבית הספר בלי התוכנית יש יועצת זמינה יותר, או מדיניות אחרת לשליחת תלמידים. וגם: האם תלמידים מאותה כיתה באמת בלתי תלויים זה בזה? המבחן מתאים, אבל המערך לא מאפשר מסקנה סיבתיתCausality.

תרגול עם הנתונים

קובץ המחקר: 200 תלמידים, 55 משתנים. פריטי החרדה a1 עד a8 הם פריטים בודדים מ־1 עד 4, שנמדדו לפני התוכנית. ערך 99 מסמן נתון חסר בחלק מהפריטים ובמשתני הרקע.

הקבצים עצמם, care_school.csv ומילון המשתנים, נמצאים גם בתיקיית data בחבילת הספר.

  1. האם בנות ובנים שונים בפריט "אני דואג/ת לגבי דברים" (a1)? מה החציונים, ואיך ייתכן שהם זהים והמבחן מובהק?
    בדיקת התשובה

    כן. הבנות נוטות לדאוג יותר: ממוצע הדירוגים 113.84 מול 86.05, U = 3604.5, z = −3.58, p < .001, rrb = .28. החציון של שני המגדרים הוא 2. המבחן לא משווה חציונים: אצל הבנות פחות "אף פעם" ויותר "לעיתים קרובות" ו"תמיד", כלומר כל ההתפלגות מוזזת כלפי מעלה, גם אם האמצע נשאר באותה קטגוריה.

  2. האם מספר האחים (siblings) שונה בין בנים לבנות? היזהרו מ־99. מה היה קורה בלי לסנן אותו, במאן־ויטני ובמבחן t?
    בדיקת התשובה

    אחרי שמגדירים את 99 כחסר נשארים 92 בנים ו־103 בנות. לא נמצא הבדל: U = 4659.5, z = −0.20, p = .838, rrb = .02, וחציון 2 בשני המגדרים. בלי הסינון, מאן־ויטני כמעט לא זז (p = .839), כי חמשת ה־99 הופכים פשוט לדירוגים הגבוהים ביותר. אבל הממוצע של הבנים קופץ ל־6.32 אחים, ו־t משתנה מאוד. זה בדיוק הפח: הדירוג "מסתיר" את הטעות, והתוצאה עדיין שגויה, כי חמישה תלמידים נכנסו עם ערך שאינו מספר אחים.

  3. האם החרדה ירדה בכיתה 8 (class_id = 8), כיתה ה׳ בתוכנית המשולבת? הריצו וילקוקסון וחשבו את גודל האפקט.
    בדיקת התשובה

    כן. 23 תלמידים, 2 בלי שינוי, 21 הפרשים: 18 ירידות ו־3 עליות. T = 22, z = −3.26, p = .001 (ב־JASP: W = 209, p = .001), rrb = (209 − 22) / 231 = .81. אפקט גדול מאוד. החציון ירד מ־2.38 ל־2.00.

  4. בפרק 21 מצאנו שבתוכנית העקיפה כולה (51 תלמידים) החרדה ירדה, t(50) = 3.55, p < .001. הריצו וילקוקסון על אותם נתונים. האם המסקנה משתנה?
    בדיקת התשובה

    לא. 4 תלמידים בלי שינוי, 47 הפרשים, T = 252.5, z = −3.31, p < .001, rrb = .55. עם 51 תלמידים שני המבחנים מסכימים. בכיתה 4 לבדה, עם 29 תלמידים ותלמיד קיצוני אחד, ההבדל ביניהם בלט יותר.

בפרק הבא: מה עושים כשאין בכלל סדר? כשהמשתנה הוא קטגוריות, כמו "התנדב" ו"לא התנדב", אין מה לדרג. סופרים כמה נבדקים יש בכל תא, ומשווים למה שהיינו מצפים אילו לא היה קשר: מבחן חי בריבועChi-square test of independence.

מקורות: Hodges, J. L., & Lehmann, E. L. (1956). The efficiency of some nonparametric competitors of the t-test. Annals of Mathematical Statistics, 27(2), 324–335. · Kerby, D. S. (2014). The simple difference formula: An approach to teaching nonparametric correlation. Comprehensive Psychology, 3, 11.IT.3.1. · Mann, H. B., & Whitney, D. R. (1947). On a test of whether one of two random variables is stochastically larger than the other. Annals of Mathematical Statistics, 18(1), 50–60. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y · Wilcoxon, F. (1945). Individual comparisons by ranking methods. Biometrics Bulletin, 1(6), 80–83.