חלק ג: מהמדגם לאוכלוסייה · פרק 23
חי בריבוע
עד עכשיו בדקנו השערות על ממוצעים. אבל הרבה שאלות בחינוך הן על קטגוריות: התנדב או לא, בן או בת, באיזו קבוצה. לקטגוריות אין ממוצע, אבל אפשר לספור אותן. בפרק הזה נלמד מבחן שעובד על ספירות: משווים את מה שנספר בפועל למה שהיינו מצפים לספור אילו לא היה שום קשר.
האם בבתי הספר של התוכנית התנדבו יותר תלמידים לעזור?
בסוף שנת הלימודים בדקו במחקר שלנו אם כל תלמיד התנדב לעזור, כן או לא (vol_post). התשובה היא קטגוריה, לא ציון. בפרק 5 ראינו שבמדגם ההתנדבות עלתה הכי הרבה בתוכנית המשולבת, והשארנו פתוחה את השאלה אם ההבדל גדול מכדי להיות מקרי. בסוף הפרק תדעו לענות עליה, ביד ובתוכנה.
בסוף הפרק תוכלו
- לבנות טבלת שילובContingency table של שני משתנים שמיים, ולבחור אם לחשב אחוזים בשורהRow percentage או בעמודה.
- לחשב שכיחויות צפויותExpected frequency, את הסטטיסטי חי בריבועChi-square statistic ואת דרגות החופשDegrees of freedom, ולהחליט בעזרת ערך .
- להבחין בין מבחן חי בריבוע לאי־תלותChi-square test of independence לבין מבחן חי בריבוע לטיב התאמהChi-square goodness-of-fit test.
- לחשב את V של קרמרCramér's V ואת מקדם פיPhi coefficient, ולהסביר למה חי בריבוע לבדו לא מספיק.
- לבדוק את ההנחות, ולדעת מה עושים כשהשכיחויות הצפויות קטנות מדי.
- להריץ את המבחן באקסל, ב־SPSS וב־JASP, ולדווח עליו בסגנון APA.
שני משתנים שמיים בטבלה אחת
כשהמשתנים שמיים, סופרים כמה נבדקים יש בכל צירוף של קטגוריות. כך מקבלים טבלת שילוב: כל נבדק נספר בתא אחד בדיוק. סכומי השורות והעמודות הם השכיחויות השוליות. כדי להשוות בין הקבוצות מחשבים אחוזים בתוך כל קבוצה.
בפרק 9 בנינו טבלת שכיחויותFrequency table למשתנה אחד. עכשיו יש לנו שניים: קבוצת המחקר (group) וההתנדבות בסוף השנה (vol_post). שניהם בסולם שמיNominal scale. אי אפשר לחשב ביניהם מתאם פירסוןPearson correlation coefficient, וגם אין טעם לחשב ממוצע של "קבוצה". מה שכן אפשר לעשות: לספור.
בונים טבלה שבשורות שלה הקטגוריות של משתנה אחד, ובעמודות הקטגוריות של המשתנה השני. כל תלמיד נכנס לתא אחד בדיוק, לפי הקבוצה שלו ולפי התשובה שלו. טבלה כזו נקראת טבלת שילוב. באקסל בונים אותה בטבלת ציר (פרק 9), או בפונקציה COUNTIFS (בקטע "בתוכנה" בהמשך).ב־SPSS בונים אותה ב־Crosstabs (בקטע "בתוכנה" בהמשך).ב־JASP בונים אותה ב־Contingency Tables (בקטע "בתוכנה" בהמשך).
| קבוצה | לא התנדבו | התנדבו | סה״כ | אחוז המתנדבים |
|---|---|---|---|---|
| ביקורת | 47 | 27 | 74 | 36.5% |
| תוכנית עקיפה | 23 | 28 | 51 | 54.9% |
| תוכנית משולבת | 27 | 48 | 75 | 64.0% |
| סה״כ | 97 | 103 | 200 | 51.5% |
איך קוראים את הטבלה? 27 תלמידים בקבוצת הביקורת התנדבו. 48 תלמידים בתוכנית המשולבת התנדבו. העמודה "סה״כ" והשורה "סה״כ" הן השכיחויות השוליות, כי הן יושבות בשולי הטבלה: 74 תלמידים בביקורת, 51 בתוכנית העקיפה ו־75 במשולבת. ובסך הכול 103 התנדבו ו־97 לא. בפינה, 200: מספר התלמידים כולו, .
אחוזים בשורה, או בעמודה?
הספירות לבדן מטעות, כי הקבוצות לא באותו גודל. 28 מתנדבים מתוך 51 זה יותר מ־27 מתוך 74, גם אם המספרים כמעט שווים. לכן מחשבים אחוזים. אבל יש שתי דרכים, והן עונות על שתי שאלות שונות:
- בתוך השורה: מתוך תלמידי הביקורת, כמה התנדבו? 27 מתוך 74, כלומר 36.5%.
- בתוך העמודה: מתוך כל המתנדבים, כמה מהם מקבוצת הביקורת? 27 מתוך 103, כלומר 26.2%.
כלל האצבע: מחשבים אחוזים בתוך הקטגוריות של המשתנה שמשווים לפיו, ואז משווים ביניהן. כאן משווים בין הקבוצות, ולכן אחוזים בתוך כל קבוצה, בשורה. והתמונה ברורה: 36.5% בביקורת, 54.9% בתוכנית העקיפה, 64.0% במשולבת.
במדגם יש הבדל. אבל אנחנו כבר יודעים שגם כשבאוכלוסייה אין שום הבדל, מדגמים לא יוצאים זהים. השאלה של הפרק היא אם ההבדל הזה גדול מכדי להיות מקרי.
בפרק 9 ראינו את אותה טבלה לפני התוכנית (vol_pre): 33.8% התנדבו בביקורת, 43.1% בתוכנית העקיפה ו־38.7% במשולבת. כלומר, בתוכנית העקיפה היו קצת יותר מתנדבים כבר בהתחלה. זה חשוב: אם קבוצה התחילה גבוה, אולי היא פשוט נשארה גבוהה, בלי קשר לתוכנית. נחזור לזה בסעיף 7, ונראה איך בודקים אם הקבוצות היו דומות בהתחלה.
מתוך 103 המתנדבים בסוף השנה, כמה אחוז הגיעו מהתוכנית המשולבת? ולמה האחוז הזה לא עונה על שאלת הפתיחה?
בדיקת התשובה
48 מתוך 103, כלומר 46.6%. זה אחוז בתוך העמודה. הוא תלוי גם בגודל הקבוצה: אילו בתוכנית המשולבת היו 150 תלמידים, היא הייתה "תורמת" יותר מתנדבים גם בלי שום השפעה. השאלה שלנו היא אם הסיכוי של תלמיד להתנדב תלוי בקבוצה שלו, ולכן משווים אחוזים בתוך כל קבוצה: 36.5%, 54.9% ו־64.0%.
בדקו את עצמכם3 שאלות
1.בטבלת השילוב של הקבוצה וההתנדבות בסוף השנה, 23 מתוך 51 תלמידי התוכנית העקיפה לא התנדבו. איזה אחוז מתאר את התלמידים בתוכנית העקיפה שלא התנדבו?
2.בחטיבת ביניים 30% מהבנות בחרו במגמת תיאטרון, ו־60% מתלמידי התיאטרון הם בנות. איזה מהנתונים עונה על השאלה "האם בנות בוחרות בתיאטרון יותר מבנים?"
3.בטבלת שילוב של 2 × 2 יש 120 תלמידים. בשורה הראשונה 70 תלמידים, בעמודה הראשונה 50, ובתא המשותף לשתיהן 30. השלימו את שלושת התאים האחרים.
מה היינו מצפים לראות אילו לא היה קשר?
השערת האפסNull hypothesis: שני המשתנים בלתי תלוייםIndependent variable, כלומר בכל קבוצה אותו אחוז מתנדבים. לפי השערה זו מחשבים לכל תא שכיחות צפויה: סכום השורה כפול סכום העמודה, חלקי N. מה שנספר בפועל נקרא השכיחות הנצפית.
כמו בכל מבחן, מתחילים מהעולם שבו השערת האפסNull hypothesis נכונה (פרק 18). כאן השערת האפס אומרת שאין קשר בין הקבוצה להתנדבות. בשפה של חי בריבוע אומרים שהמשתנים בלתי תלויים, ומכאן שם המבחן: חי בריבוע לאי־תלות.
שימו לב שלהשערה החלופית אין כיוון. היא לא אומרת איזו קבוצה גבוהה יותר, רק שהקבוצות לא כולן שוות. עם שלוש קבוצות אין דרך לנסח השערה חד־צדדיתOne-tailed hypothesis / test אחת.
השכיחות הצפויה
אם אין קשר, מה היינו מצפים לראות בכל תא? בסך הכול התנדבו 103 מתוך 200, כלומר 51.5%. אילו הקבוצה לא הייתה משנה כלום, גם בתוך כל קבוצה היו מתנדבים 51.5%. בקבוצת הביקורת יש 74 תלמידים, ו־51.5% מהם הם 38.11. זו השכיחות הצפויה בתא "ביקורת, התנדבו". ומה שנספר בפועל, 27, הוא השכיחות הנצפית.
במקום לחשב אחוז ואז לכפול, יש קיצור: סכום השורה, כפול סכום העמודה, חלקי המספר הכולל.
האותיות באות מאנגלית: O לשכיחות הנצפית (Observed), ו־E לשכיחות הצפויה (Expected). כך מחשבים את כל ששת התאים:
| קבוצה | לא התנדבו: O (E) | התנדבו: O (E) | סה״כ |
|---|---|---|---|
| ביקורת | 47 (35.890) | 27 (38.110) | 74 |
| תוכנית עקיפה | 23 (24.735) | 28 (26.265) | 51 |
| תוכנית משולבת | 27 (36.375) | 48 (38.625) | 75 |
| סה״כ | 97 | 103 | 200 |
שלושה דברים לשים לב אליהם:
- שכיחות צפויה לא חייבת להיות מספר שלם. אין 38.11 תלמידים, אבל משאירים את השבר כמו שהוא, ולא מעגלים באמצע החישוב.
- הסכומים נשמרים. סכום השכיחויות הצפויות בכל שורה ובכל עמודה שווה לסכום הנצפות: 35.890 + 38.110 = 74. השוליים לא משתנים. משתנה רק החלוקה בתוך הטבלה.
- בתוכנית העקיפה הנצפה קרוב מאוד לצפוי, ובביקורת ובמשולבת הוא רחוק ממנו, בכיוונים הפוכים: בביקורת התנדבו פחות מהצפוי, ובמשולבת יותר.
הנוסחה באה מכלל הכפל בהסתברות. אם שני מאורעות בלתי תלויים, ההסתברות ששניהם יקרו היא מכפלת ההסתברויות. ההסתברות שתלמיד אקראי מהמדגם יהיה בקבוצת הביקורת היא 74 / 200 = .37. ההסתברות שהוא התנדב היא 103 / 200 = .515. אם הקבוצה וההתנדבות בלתי תלויות, ההסתברות לשניהם יחד היא .37 × .515 = .19055. ומתוך 200 תלמידים, מצפים ל־.19055 × 200 = 38.11. אם מצמצמים, מקבלים בדיוק את הקיצור: (74 / 200) × (103 / 200) × 200 = 74 × 103 / 200.
בשכבה של 120 תלמידים יש 50 בנים ו־70 בנות. 36 תלמידים בסך הכול נרשמו לחוג רובוטיקה. אילו אין קשר בין מגדר להרשמה, כמה בנות היינו מצפים לראות בחוג?
בדיקת התשובה
30% מכל התלמידים נרשמו לחוג (36 מתוך 120). אילו אין קשר, גם 30% מהבנות היו נרשמות: 30% מ־70 הן 21. ולבנים: 50 × 36 / 120 = 15. ביחד 36, כמו שצריך.
בדקו את עצמכם4 שאלות
1.בטבלת שילוב של 150 תלמידים, סכום השורה "כיתה ה׳" הוא 60, וסכום העמודה "קוראים ספר בשבוע" הוא 45. מהי השכיחות הצפויה בתא "כיתה ה׳, קוראים"?
2.מה בדיוק אומרת השערת האפס במבחן חי בריבוע לאי־תלות על הקבוצה וההתנדבות?
3.בכיתה של 80 תלמידים, ההסתברות שתלמיד אקראי הוא בן היא .40, וההסתברות שהוא משחק בנבחרת היא .25. אילו מגדר ומשחק בנבחרת בלתי תלויים, כמה בנים בנבחרת הייתם מצפים לראות? הסבירו את החישוב.
4.בטבלת שילוב, האחוזים בכל השורות זהים לגמרי. מה אפשר לומר על השכיחויות הנצפות והצפויות?
הסטטיסטי חי בריבוע ודרגות החופש
בכל תא מחשבים (O − E)² / E, ומחברים את כל התאים. התוצאה היא . דרגות החופש: (שורות − 1) × (עמודות − 1). ככל ש־χ² גדול יותר, הנתונים רחוקים יותר מאי־תלות. במחקר שלנו: χ²(2) = 11.61, p = .003, ולכן דוחים את השערת האפס.
יש לנו שש שכיחויות נצפותObserved frequency ושש צפויות. צריך מספר אחד שיגיד כמה הנצפה רחוק מהצפוי בכל הטבלה יחד. בונים אותו בשלושה צעדים, וכל צעד עונה על בעיה:
- מחסירים: O − E בכל תא. אבל אם נחבר את ההפרשים, נקבל תמיד אפס, כי הנצפות והצפויות מסתכמות לאותו מספר. הפרשים חיוביים ושליליים מבטלים זה את זה.
- מעלים בריבוע: כמו בסטיית התקן (פרק 11), הריבוע מבטל את הסימן. אין הבדל אם יש יותר מדי או פחות מדי. פער הוא פער.
- מחלקים בשכיחות הצפויה: פער של 6 כשמצפים ל־22 זה הרבה, כמעט שליש. פער של 6 כשמצפים ל־2,200 זה כלום. לכן מודדים כל פער יחסית לגודל הצפוי בתא.
את התוצאה של כל תא מחברים על פני כל התאים. האות אומרת "סכום של".
החי בריבוע תמיד אפס או יותר. הוא אפס רק כשכל שכיחות נצפית שווה בדיוק לצפויה, כלומר כשהאחוזים בכל השורות זהים. ככל שהנתונים רחוקים יותר מאי־תלות, הוא גדל.
האם יש קשר בין קבוצת המחקר להתנדבות בסוף השנה? ( = .05)
| קבוצה | לא התנדבו | התנדבו |
|---|---|---|
| ביקורת | (47 − 35.890)² / 35.890 = 3.439 | (27 − 38.110)² / 38.110 = 3.239 |
| תוכנית עקיפה | (23 − 24.735)² / 24.735 = 0.122 | (28 − 26.265)² / 26.265 = 0.115 |
| תוכנית משולבת | (27 − 36.375)² / 36.375 = 2.416 | (48 − 38.625)² / 38.625 = 2.275 |
מסקנה: ערך pp-value קטן מ־.05, ולכן דוחים את השערת האפס. יש קשר בין הקבוצה להתנדבות: אחוז המתנדבים לא זהה בשלוש הקבוצות.
איפה הקשר? התרומות מספרות. כמעט כל החי בריבוע מגיע מקבוצת הביקורת (6.68) ומהתוכנית המשולבת (4.69). בביקורת התנדבו פחות מהצפוי, ובמשולבת יותר. בתוכנית העקיפה הנצפה כמעט שווה לצפוי, והתרומה שלה זניחה.
למה דרגות החופש הן שורות פחות אחת כפול עמודות פחות אחת?
בפרק 20 ראינו שדרגות חופש הן מספר הערכים שחופשיים להשתנות. בטבלת שילוב השוליים קבועים: 74, 51 ו־75 תלמידים בקבוצות, 97 ו־103 בעמודות. נניח שאתם יודעים רק שבביקורת התנדבו 27. האם צריך לשאול כמה בביקורת לא התנדבו? לא: 74 פחות 27, כלומר 47. ואם יודעים גם שבתוכנית העקיפה התנדבו 28, כל השאר נקבע מהשוליים. 103 פחות 27 פחות 28 נותן 48 מתנדבים במשולבת, וכן הלאה. רק שני תאים חופשיים. ובאופן כללי: בכל שורה התא האחרון נקבע, ובכל עמודה התא האחרון נקבע. נשארים (3 − 1) × (2 − 1) = 2 תאים חופשיים.
זו גם הסיבה שבכל שורה של הדוגמה הפער זהה בגודלו ובסימן הפוך: 11.11 פחות מהצפוי בצד אחד, ו־11.11 יותר בצד השני. השוליים "מחייבים" את זה.
התפלגות חי בריבועChi-square distribution
אילו השערת האפס הייתה נכונה, והיינו חוזרים על המחקר שוב ושוב, היינו מקבלים בכל פעם χ² אחר. ההתפלגות של כל הערכים האלה היא התפלגות חי בריבוע, עוד אחת במשפחה שכבר מכירים: z, t, ועכשיו χ². כמו התפלגות tt distribution, גם לה יש צורה אחרת לכל מספר של דרגות חופש. היא מתחילה באפס, אין בה ערכים שליליים, והיא מוטה ימינה. הממוצע שלה שווה למספר דרגות החופש. כלומר, כשאין קשר, χ² סביב 2 בטבלה של שתי דרגות חופש הוא בדיוק מה שמצפים לראות.
בגלל שרק χ² גדול מעיד על קשר, המבחן נעשה תמיד בזנב הימני, גם כשההשערה החלופיתResearch hypothesis בלי כיוון. ערך p הוא השטח מימיןUpper-tail area ל־χ² שקיבלנו.
| df | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| ערך קריטי, α = .05 | 3.84 | 5.99 | 7.81 | 9.49 | 11.07 | 12.59 |
תחשבו על תא אחד. אילו חזרנו שוב ושוב על מדגם של 200 תלמידים מאוכלוסייה בלי קשר, בתא "ביקורת, התנדבו" היינו מקבלים לרוב בסביבות 38, לפעמים 36 או 41, ולעיתים רחוקות 27. ההתפלגות של הספירה בתא, במדגם גדול מספיק, קרובה לנורמלית סביב השכיחות הצפויה. לכן (O − E) / √E הוא בערך ציון zz-score, והתרומה של כל תא היא בערך z בריבוע. התפלגות חי בריבוע היא בדיוק זה: ההתפלגות של סכום ריבועיםSum of squares של ציוני z בלתי תלויים, ומספר דרגות החופש אומר כמה מהם באמת חופשיים.
המבחן פורסם ב־1900 על ידי קרל פירסון, אותו פירסון של מקדם המתאםCorrelation. אבל פירסון טעה בדרגות החופש של טבלת שילוב: הוא ספר את מספר התאים פחות אחד. ב־1922 הראה רונלד פישר שהשוליים קובעים חלק מהתאים, ושדרגות החופש הן (שורות − 1) × (עמודות − 1). השניים התווכחו על כך בחריפות שנים, ופישר צדק. בטבלה שלנו ההבדל לא קטן: 5 דרגות חופש במקום 2, וערך קריטיCritical value של 11.07 במקום 5.99.
ועוד שאלה שנשארה פתוחה: איפה בדיוק הקשר? בטבלה גדולה, χ² מובהק אומר רק שבמקום כלשהו האחוזים שונים. התרומות של התאים נותנות כיוון. ב־SPSS אפשר לבקש גם Adjusted standardized residuals (בחלון Cells), מעין ציון z לכל תא. ערך מעבר ל־1.96 בערך מוחלט מסמן תא שרחוק מהצפוי.ב־JASP אפשר לבקש גם שאריותResidual מתוקננות לכל תא (בלשונית Cells), מעין ציון z לכל תא. ערך מעבר ל־1.96 בערך מוחלט מסמן תא שרחוק מהצפוי.באקסל אפשר לחשב לכל תא (O − E) / √E, מעין ציון z. ערכים גדולים בערך מוחלט מסמנים תאים שרחוקים מהצפוי. בדוגמה שלנו, השאריות המתוקננות המותאמות של תא "ביקורת, התנדבו" ושל "משולבת, התנדבו" הן −3.26 ו־2.74. של התוכנית העקיפה, 0.56 בלבד.
- בדוגמה "פקולטה והעדפת למידה": באיזה תא התרומה לחי בריבוע הכי גדולה? מה זה אומר על הסטודנטים בפקולטה הזו?
- בחרו "בלי קשר". למה חי בריבוע הוא אפס בדיוק? בדקו את האחוזים בכל שורה.
- חזרו ל"קשר חזק" והקטינו את כל המספרים עד שמופיעה אזהרה על שכיחות צפויה קטנה. מה קרה לערך p בדרך?
בדיקת התשובה
1. מדעי הרוח: התרומות 3.68 ו־4.50, מתוך χ² = 13.25. שם רק 13 מתוך 40 מעדיפים למידה מקוונת, הרבה פחות מ־22 הצפויים. 2. בשתי השורות בדיוק 60% אמרו "כן" (30 מתוך 50, ו־45 מתוך 75). כשהאחוזים זהים, כל שכיחות נצפיתObserved frequency שווה לצפויה, ואין שום פער. 3. ככל שהמדגם קטן, χ² קטן איתו וערך p עולה, גם כשהאחוזים כמעט לא משתנים. כשתא צפוי יורד מתחת ל־5, הקירוב של התפלגות חי בריבועChi-square distribution כבר לא אמין. נראה מה עושים אז בסעיף 6.
80 תלמידים, 40 בנים ו־40 בנות. 12 בנים ו־22 בנות הצטרפו למקהלת בית הספר. האם יש קשר בין מגדר להצטרפות? (α = .05)
בדיקת התשובה
דוחים: יש קשר בין מגדר להצטרפות למקהלה. 55% מהבנות הצטרפו, לעומת 30% מהבנים.
בדקו את עצמכם4 שאלות
1.בתא אחד של טבלת שילוב נצפו 30 תלמידים, והשכיחות הצפויה הייתה 20. מה התרומה של התא הזה לחי בריבוע?
2.100 תלמידים: 50 קיבלו שיעורי עזר, ומהם 40 עברו את המבחן. 50 לא קיבלו, ומהם 30 עברו. חשבו את χ², את דרגות החופש ואת ערך p. האם יש קשר בין שיעורי העזר להצלחה? (α = .05)
3.חוקרת בודקת קשר בין מגדר (2 קטגוריות) לבין סוג הפעילות האהובה בהפסקה (5 קטגוריות). כמה דרגות חופש יש למבחן?
4.במבחן חי בריבוע לאי־תלות התקבל χ²(3) = 6.50. הערך הקריטי ב־α = .05 הוא 7.81. מה המסקנה?
כמה חזק הקשר? V של קרמר ומקדם פי
חי בריבוע גדל עם גודל המדגם: אם מכפילים את כל התאים, האחוזים לא זזים, אבל χ² מוכפל. לכן מדווחים גם גודל אפקטEffect size: של קרמר, V = √(χ² / (N × (k − 1))), כש־k הוא הקטן מבין מספר השורות ומספר העמודות. V נע בין 0 ל־1. בטבלה של 2 × 2 הוא מקדם פי. אצלנו V = .24.
בפרקים הקודמים ראינו שערך p לא אומר כמה האפקט גדול. בחי בריבוע רואים את זה בצורה הכי ישירה. נכפיל את כל השכיחויות בטבלה שלנו פי 2, כאילו בדקנו 400 תלמידים עם אותם אחוזים בדיוק:
| N | אחוזי המתנדבים | χ² | p | V | |
|---|---|---|---|---|---|
| הנתונים שלנו | 200 | 36.5%, 54.9%, 64.0% | 11.61 | .003 | .24 |
| כל תא פי 2 | 400 | 36.5%, 54.9%, 64.0% | 23.21 | < .001 | .24 |
אותו קשר בדיוק, אבל χ² כפול, וערך p קטן בהרבה. כל פער O − E גדל פי 2, הריבוע שלו פי 4, והמכנה E רק פי 2. לכן χ² גדל באותו יחס כמו המדגם. במדגם ענק גם קשר זניח יוצא מובהק. כדי לדעת כמה הקשר חזק, צריך מדד שלא תלוי ב־N.
זה V של קרמר. מחלקים את χ² ב־N, ומבטלים בכך את ההשפעה של גודל המדגם. ומחלקים גם ב־k − 1, כדי ש־V יהיה תמיד בין 0 (אין קשר) ל־1 (קשר מושלם), בכל גודל של טבלה. בטבלה שלנו יש 3 שורות ו־2 עמודות. הקטן הוא 2, ולכן k − 1 = 1:
בטבלה של 2 × 2 תמיד k − 1 = 1, והמדד נקרא מקדם פי, = √(χ² / N). מקדם פי הוא בעצם מקדם המתאם של פירסון מפרק 15, כשמחשבים אותו על שני משתנים שמקודדים 0 ו־1. למשל, המתאםCorrelation בין ההתנדבות בתחילת השנה להתנדבות בסופה הוא r = .33, ובדיוק כך יוצא גם φ מטבלת השילוב שלהם.
איך יודעים אם V גדול? לכהן יש סימני דרך, והם תלויים ב־k − 1:
| k − 1 | קטן | בינוני | גדול |
|---|---|---|---|
| 1 (כולל 2 × 2) | .10 | .30 | .50 |
| 2 | .07 | .21 | .35 |
| 3 | .06 | .17 | .29 |
אצלנו k − 1 = 1, ו־V = .24 נמצא בין קטן לבינוני. בחינוך, הבדל של כמעט 28 נקודות אחוז בהתנדבות בין הביקורת לתוכנית המשולבת הוא לא מעט. כמו תמיד, אלה סימני דרך, לא חוק (פרק 19).
גודל האפקטEffect size שכהן עצמו הגדיר לחי בריבוע הוא מדד אחר, w של כהן: w = √(χ² / N), עם 0.10, 0.30 ו־0.50. בטבלה גדולה, w יכול להיות גדול מ־1, ולכן קרמר חילק גם ב־k − 1. אבל החלוקה הזו מקטינה את V בטבלאות גדולות, ולכן גם סימני הדרך שלו קטנים יותר: מחלקים את סימני הדרך של w ב־√(k − 1). למשל, .30 / √2 = .21. ועוד דבר: φ בטבלה של 2 × 2 יכול להיות שלילי, כי הוא מתאם בין שני משתנים מקודדים. SPSS מציג אותו עם סימן, לפי סדר הקודים.JASP מציג אותו לפי סדר הרמות של המשתנים.באקסל, CORREL על שתי עמודות של 0 ו־1 נותן אותו עם סימן. הסימן תלוי רק בדרך שבה קודדו את הקטגוריות. את הכיוון קוראים מהאחוזים.
- בחרו "קבוצה × התנדבות אחרי". השוו את התרומות לחישוב שעשינו ביד. איזו שורה תורמת הכי הרבה?
- הכפילו את כל ששת המספרים. מה קרה ל־χ², לערך p, ל־V ולגרף האחוזים?
- בחרו "מגדר × התנדבות אחרי". האם יש קשר? כמה פעמים צריך להכפיל את כל התאים עד שהקשר יוצא מובהק, ומה V אז?
בדיקת התשובה
1. אותם מספרים: 3.44 ו־3.24 בביקורת, 2.42 ו־2.28 במשולבת. השורה של הביקורת תורמת הכי הרבה. 2. χ² מוכפל ל־23.21, ערך p יורד מתחת ל־.001, ו־V נשאר .241. גם הגרף לא משתנה: האחוזים זהים. 3. לא: χ²(1) = 0.53, p = .468, V = .051. כדי לעבור את 3.84 צריך להכפיל בערך פי 8 (1,600 תלמידים), ו־V עדיין .051, קשר זניח. מובהק לא אומר חשוב.
בדקו את עצמכם3 שאלות
1.בטבלת שילוב של 3 × 3 עם 200 נבדקים התקבל χ² = 18. מהו V של קרמר?
2.למה מדווחים על V של קרמר, ולא מסתפקים ב־χ² ובערך p?
3.בטבלה של 2 × 2 עם 90 תלמידים התקבל χ² = 8.10. חשבו את מקדם פי, והעריכו את עוצמת הקשר.
משתנה אחד מול התפלגות ידועה: חי בריבוע לטיב התאמה
לפעמים יש משתנה שמי אחד, ורוצים לדעת אם ההתפלגות שלו במדגם מתאימה להתפלגות שנקבעה מראש: אחוזים ידועים מהאוכלוסייה, או חלוקה שווה. השכיחות הצפויה היא האחוז הצפוי כפול N, החישוב של χ² זהה, ו־df = k − 1, כש־k הוא מספר הקטגוריות.
עד עכשיו היו שני משתנים, ושאלנו אם יש ביניהם קשר. אבל לחי בריבוע יש גרסה שנייה, למשתנה אחד. היא עונה על שאלה שהכרנו במבחן zz test ובמבחן t למדגם בודדOne-sample t test: האם המדגם מתאים לאוכלוסייה מסוימת? רק שכאן המשתנה שמי, ובמקום ממוצע משווים התפלגות של קטגוריות. זה מבחן חי בריבוע לטיב התאמה.
דוגמה מתחוםRange ההתפתחות. לפי תיאוריית ההתקשרות של מרי איינסוורת׳, לכל ילד יש סגנון התקשרות אחד מתוך שלושה: בטוח, נמנע או חרד. נניח, לצורך הדוגמה, שבאוכלוסייה 55% בטוחים, 25% נמנעים ו־20% חרדים. חוקרת דגמה 40 ילדים במעון אחד. האם ההתפלגות במעון שונה מזו שבאוכלוסייה?
| בטוח | נמנע | חרד | סה״כ | |
|---|---|---|---|---|
| האחוז באוכלוסייה | 55% | 25% | 20% | 100% |
| צפוי, E | .55 × 40 = 22 | .25 × 40 = 10 | .20 × 40 = 8 | 40 |
| נצפה, O | 16 | 14 | 10 | 40 |
| O − E | −6 | 4 | 2 | 0 |
| (O − E)² / E | 36 / 22 = 1.636 | 16 / 10 = 1.600 | 4 / 8 = 0.500 | 3.736 |
מסקנה: לא דוחים. אין מספיק עדות לכך שההתפלגות במעון שונה מזו שבאוכלוסייה. שימו לב: ההפרשים מסתכמים לאפס, כמו שאמרנו, ולכן מעלים בריבוע.
למה כאן df = k − 1? כי N קבוע. אם ידוע שמתוך 40 ילדים 16 בטוחים ו־14 נמנעים, לא צריך לשאול כמה חרדים: 10. רק שתי קטגוריות חופשיות.
ומאיפה באים האחוזים הצפויים? מתיאוריה, מנתונים ארציים, או מחלוקה שווה. למשל, במחקר שלנו יש 96 בנים ו־104 בנות. האם זה שונה מחלוקה של חצי־חצי? הצפוי הוא 100 ו־100, ו־χ² = 16/100 + 16/100 = 0.32, עם דרגת חופש אחת: p = .572. החלוקה מתאימה לחצי־חצי.
שימו לב להיגיון ההפוך. במבחן לטיב התאמה, השערת האפס היא שההתפלגות מתאימה. לכן "לא דחינו" פירושו שלא מצאנו סטייה, ולא שהוכחנו התאמה. כמו במבחן לויןLevene's test בפרק 21.
טיב התאמה עובד מול כל התפלגות, גם מול הנורמלית. מחלקים את הציונים לקטגוריות, כמו בהיסטוגרמהHistogram (פרק 9). מחשבים איזה אחוז מהשטח של התפלגות נורמליתNormal distribution, עם הממוצע וסטיית התקן של המדגם, נופל בכל קטגוריה (פרק 14). כופלים ב־N ומקבלים שכיחויות צפויות. ואז χ² כרגיל. כאן השערת האפס היא שההתפלגות נורמלית, ולכן רוצים לא לדחות.
שתי הערות. ראשית, כשהממוצע וסטיית התקן נאמדים מהמדגם, משלמים על כל אחד מהם דרגת חופש נוספת: df = k − 1 − 2. שנית, Shapiro-Wilk ו־Kolmogorov-Smirnov מפרק 12 אינם מבחני חי בריבוע. ההיגיון דומה, השוואה בין מה שיש למה שמצפים, אבל החישוב שונה. ובמשתנה עם שתי קטגוריות בלבד, כמו בנים ובנות, חי בריבוע לטיב התאמה נותן כמעט אותה תוצאה כמו בדיקת פרופורציה בעזרת הקירוב הנורמלי.
רכזת החינוך החברתי מניחה ש־120 תלמידי השכבה מתחלקים שווה בשווה בין ארבעה חוגים. בפועל נרשמו: ספורט 38, אמנות 34, מדע 28, מוזיקה 20. האם החלוקה שונה מחלוקה שווה? (α = .05)
בדיקת התשובה
לא דוחים: 6.13 קטן מ־7.81. ההבדלים בין החוגים יכולים להיות מקריים. כשכל השכיחויות הצפויות שוות, אפשר לחבר את ריבועי ההפרשים ולחלק פעם אחת.
בדקו את עצמכם3 שאלות
1.חוקר בודק אם התלמידים מתחלקים שווה בשווה בין שש מגמות. כמה דרגות חופש יש במבחן חי בריבוע לטיב התאמה?
2.לפי נתונים ארציים (מדומים), 50% מהתלמידים מגיעים לבית הספר ברגל, 30% בהסעה ו־20% ברכב פרטי. בבית ספר אחד נשאלו 60 תלמידים: 24 ברגל, 22 בהסעה, 14 ברכב. האם בית הספר שונה מההתפלגות הארצית? חשבו את χ² וערך p.
3.מה השערת האפס במבחן חי בריבוע לטיב התאמה?
הנחות המבחן, ומה עושים כשהן לא מתקיימות
כל נבדק נספר פעם אחת, בתא אחד. מריצים על שכיחויות, לא על אחוזים. והשכיחויות הצפויות לא קטנות מדי: בטבלה של 2 × 2 כולן 5 לפחות, ובטבלה גדולה יותר לא יותר מ־20% מהתאים מתחת ל־5, ואף אחד מתחת ל־1. אם לא: מאחדים קטגוריות, או משתמשים במבחן פישר המדויקFisher's exact test.
| הנחה | למה | אם היא לא מתקיימת |
|---|---|---|
| כל נבדק נספר פעם אחת, בתא אחד, והתצפיות בלתי תלויות | החישוב מניח שכל ספירה היא אדם נפרד | אם אותם אנשים נמדדו פעמיים: מבחן אחר (מקנמר, בהמשך הסעיף) |
| הקטגוריות זרות וממצות | כל נבדק שייך לקטגוריה אחת בדיוק | מוסיפים קטגוריה "אחר", או מגדירים מחדש |
| שכיחויות, לא אחוזים | χ² תלוי ב־N. על אחוזים, N "נעלם" | חוזרים לספירות |
| שכיחויות צפויות לא קטנות מדי | הקירוב להתפלגות חי בריבוע נשבר בתאים קטנים | מאחדים קטגוריות, מגדילים מדגם, או מבחן פישר המדויקFisher's exact test |
שכיחויות צפויות, לא נצפות
זו הנחת השכיחות הצפויה המינימליתMinimum expected count assumption, וזו ההנחה שהכי קל לפספס. היא על השכיחויות הצפויות, לא על הנצפות. תא שבו נספרו 2 נבדקים יכול להיות בסדר גמור, אם הצפוי בו 7. ולהפך: תא עם 9 נצפים יכול להיות בעייתי, אם הצפוי 3. לכן תמיד מחשבים את הצפויות מהשוליים, ובודקים אותן. הכללים המקובלים:
- בטבלה של 2 × 2: כל ארבע השכיחויות הצפויות 5 לפחות.
- בטבלה גדולה יותר, ובטיב התאמה: לא יותר מ־20% מהתאים עם שכיחות צפויה מתחת ל־5, ואף תא מתחת ל־1. בשלושה תאים, אפילו אחד קטן הוא כבר 33%. בחמישה תאים, אחד מותר.
SPSS עושה את הבדיקה בשבילכם: מתחת לטבלת Chi-Square Tests כתוב כמה תאים, ואיזה אחוז, עם שכיחות צפויה מתחת ל־5.JASP מוסיף הערה מתחת לטבלת המבחן כשיש תאים עם שכיחות צפויה מתחת ל־5. כדי לראות את הצפויות עצמן, מסמנים Expected בלשונית Cells.באקסל בודקים בעצמכם: =MIN(BF8:BG10) על טבלת הצפויות נותן את הקטנה ביותר, ו־=COUNTIF(BF8:BG10,"<5") סופר כמה תאים מתחת ל־5. בטבלה שלנו, הצפויה הקטנה ביותר היא 24.7. אין בעיה.
מה עושים כשהשכיחויות הצפויות קטנות?
- מאחדים קטגוריות, אם זה הגיוני. למשל, "לקות למידה" ו"הפרעת קשב" לקטגוריה אחת, "צרכים מיוחדים". לא מאחדים קטגוריות שאין ביניהן שום קשר רק כדי לעבור את הכלל.
- מגדילים את המדגם, אם עוד אפשר.
- בטבלה של 2 × 2: מבחן פישר המדויק. במקום להשתמש בקירוב של התפלגות חי בריבוע, הוא מחשב בדיוק את ההסתברות לקבל טבלה כזו, או קיצונית יותר, כשהשוליים קבועים. הוא עובד בכל גודל של מדגם. SPSS מדפיס אותו אוטומטית בכל טבלה של 2 × 2, בשורה Fisher's Exact Test.ב־JASP מסמנים אותו בחלון Contingency Tables, בלשונית Statistics.באקסל אין לו פונקציה מוכנה, אבל אפשר לחשב אותו בעזרת
HYPGEOM.DIST, כמו בדוגמה שבהמשך.
בפיילוט בכיתה אחת, 8 תלמידים השתתפו בסדנה קצרה, ו־8 לא. אחר כך בדקו מי התנדב לעזור.
| התנדבו | לא התנדבו | סה״כ | |
|---|---|---|---|
| בסדנה | 6 | 2 | 8 |
| בלי סדנה | 2 | 6 | 8 |
| סה״כ | 8 | 8 | 16 |
כל השכיחויות הצפויות הן 8 × 8 / 16 = 4, כולן מתחת ל־5. אם מריצים בכל זאת חי בריבוע, מקבלים χ²(1) = 4.00, p = .046, "מובהק". מבחן פישר המדויק נותן p = .132. לא מובהק. במדגם כזה הקירוב של חי בריבוע אופטימי מדי, וכאן הוא היה מוביל למסקנה שגויה. המסקנה הנכונה: 75% מול 25% זה הבדל מעניין, אבל 16 תלמידים לא מספיקים כדי לשלול מקריות.
החישוב ביד
פישר שואל: אם 8 המתנדבים היו מתחלקים באקראי בין שתי הקבוצות, מה ההסתברות שלפחות 6 מהם ייפלו בקבוצת הסדנה? מספר הדרכים לבחור 8 תלמידים מתוך 16 הוא 12,870. מספר הדרכים לקבל בדיוק 6 מתנדבים בסדנה: לבחור 6 מתוך 8 המתנדבים, וגם 2 מתוך 8 הלא־מתנדבים.
באקסל: =1-HYPGEOM.DIST(5, 8, 8, 16, TRUE) נותן את החד־צדדי, .066. כלומר: 1 פחות ההסתברות לקבל 5 מתנדבים או פחות בקבוצת הסדנה.
אותם תלמידים פעמיים. במחקר שלנו ההתנדבות נמדדה פעמיים אצל אותם תלמידים. אפשר לבנות טבלת שילוב של vol_pre מול vol_post: 76 לא התנדבו בשתי הפעמים, 55 התנדבו בשתיהן, 48 התחילו "לא" וסיימו "כן", ו־21 להפך. חי בריבוע על הטבלה הזו (χ²(1) = 21.37, p < .001, φ = .33) עונה על שאלה אחת: האם מי שהתנדב בהתחלה נוטה להתנדב גם בסוף? כן. אבל הוא לא עונה על השאלה אם ההתנדבות עלתה. לזה צריך מבחן לנתונים מזווגים, כמו בפרק 21. מבחן מקנמרMcNemar's test מסתכל רק על מי שהשתנה: χ² = (48 − 21)² / (48 + 21) = 729 / 69 = 10.57, p = .001. יותר תלמידים עברו מ"לא" ל"כן" מאשר להפך.
תיקון ייטסContinuity correction. בטבלה של 2 × 2, SPSS מדפיס גם שורה בשם Continuity Correction.ב־JASP אפשר לסמן בלשונית Statistics את Χ² continuity correction.באקסל אין לו פונקציה, ומי שרוצה מחסיר 0.5 מכל פער מוחלט לפני ההעלאה בריבוע. זה תיקון של פרנק ייטס (1934), שמקטין כל פער ב־0.5 לפני ההעלאה בריבוע, כי ספירות הן מספרים שלמים והתפלגות חי בריבוע רציפה. התיקון שמרני מדי, והיום ממליצים לרוב להשתמש בחי בריבוע הרגיל, של פירסון, כשהשכיחויות הצפויות מספיקות, ובמבחן פישר כשלא.
תלמידים באותה כיתה. הנחת אי־התלות קשה במיוחד במחקרים בבתי ספר. התנדבות היא התנהגות חברתית: אם חבר מתנדב, גם אני. ובמחקר שלנו הקבוצה היא בית ספר שלם. תלמידים מאותה כיתה דומים זה לזה יותר משני תלמידים אקראיים, ולכן יש בנתונים פחות מידע ממה ש־200 ספירות נפרדות מרמזות. ערך p האמיתי כנראה גדול יותר מ־.003. איך מתחשבים בזה, נלמד בפרק 36.
בטבלה של 2 × 2 עם 60 תלמידים, סכומי השורות הם 50 ו־10, וסכומי העמודות 42 ו־18. בתא הקטן ביותר נספרו 6 תלמידים. האם אפשר להריץ חי בריבוע?
בדיקת התשובה
לא. השכיחות הצפויה בתא אחד היא 3, מתחת ל־5. זה שנספרו בו 6 לא משנה: הכלל הוא על הצפויות. בטבלה של 2 × 2 מריצים במקום זאת את מבחן פישר המדויק.
בדקו את עצמכם3 שאלות
1.בטבלה של 3 × 3 יש שני תאים עם שכיחות צפויה מתחת ל־5: האחת 3.2 והשנייה 4.1. כל השאר מעל 5. מה נכון?
2.באיזה מצב מתאים במיוחד מבחן פישר המדויק?
3.בשאלון נשאלו 50 מורות "באילו אמצעים את משתמשת בשיעור?", והן יכלו לסמן כמה תשובות. חוקר ספר את כל הסימונים, 130 בסך הכול, ובנה טבלה של ותק × אמצעי. מה הבעיה בהרצת חי בריבוע על הטבלה?
שימוש חשוב: האם הקבוצות היו דומות בהתחלה?
כשהקבוצות לא הוגרלו ברמת התלמיד, בודקים אם הן דומות במשתני הרקע. אצלנו הקבוצות דומות בהתנדבות לפני התוכנית, במגדר ובהשכלת ההורים. הבדל לא מובהק לא מוכיח שהקבוצות זהות, אבל הוא מחזק את הפירוש של ההבדל בסוף.
במחקר שלנו הוגרלו בתי ספר, לא תלמידים (פרק 7). לכן אין ערובה שהקבוצות דומות. אם בקבוצת התוכנית היו מלכתחילה יותר מתנדבים, ההבדל בסוף השנה לא היה אומר הרבה. חי בריבוע הוא הכלי הרגיל לבדוק את זה במשתנים שמיים:
| משתנה רקע | ביקורת | עקיפה | משולבת | המבחן |
|---|---|---|---|---|
| התנדבו בתחילת השנה | 33.8% | 43.1% | 38.7% | χ²(2, N = 200) = 1.14, p = .565, V = .08 |
| בנות | 52.7% | 51.0% | 52.0% | χ²(2, N = 200) = 0.04, p = .982, V = .01 |
| הורה עם תואר אקדמי | 72.2% | 57.1% | 53.4% | χ²(6, N = 194) = 7.16, p = .306, V = .14 |
בשלושת המשתנים אין הבדל מובהק. בהשכלת ההורים, שעליה שאלנו בפרק 12, יש בקבוצת הביקורת יותר הורים אקדמאים, אבל ההבדל לא גדול מכדי להיות מקרי. המבחן הורץ על ארבע רמות ההשכלה, ולכן df = (3 − 1) × (4 − 1) = 6. ששת התלמידים עם ערך 99, "לא ידוע", הוצאו מהניתוח, ולכן N = 194.
ועכשיו אפשר לחזור לשאלת הפתיחה בביטחון גדול יותר. בתחילת השנה אחוזי ההתנדבות היו דומים, p = .565. בסוף השנה הם שונים, p = .003. ההבדל נוצר במהלך השנה.
החי בריבוע של ההשכלה לא מובהק, אבל ההבדל בין 72% ל־53% אינו קטן. עם 200 תלמידים, למבחן אין הרבה עוצמה לגלות הבדלים בינוניים בטבלה של 12 תאים. לכן גם כשאין הבדל מובהק, מסתכלים על האחוזים ועל V, וזוכרים את ההבדל כשמפרשים את התוצאות. ובכל מקרה, גם שקילות בכל המשתנים שמדדנו לא אומרת כלום על משתנים שלא מדדנו. רק הגרלה של תלמידים הייתה מבטיחה את זה.
בדקו את עצמכם3 שאלות
1.בבדיקה אם הקבוצות דומות בהתחלה, יצא p = .306 בהשכלת ההורים. מה נכון לומר?
2.בעמודה parent_edu יש 6 תלמידים עם ערך 99 (לא ידוע). מה היה קורה אילו בנינו את טבלת השילוב בלי להוציא אותם?
3.למה במחקר שלנו חשוב לבדוק שהקבוצות היו דומות בהתנדבות כבר בתחילת השנה?
בתוכנה: קבוצה והתנדבות
עכשיו נריץ את המבחן על קובץ המחקר: group בשורות, vol_post בעמודות. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות. המספרים זהים בשלוש התוכנות. אחרי מבחן האי־תלות תמצאו גם את מבחן טיב ההתאמה, על המגדר.
חי בריבוע לאי־תלות
בקובץ, group בעמודה D ו־vol_post בעמודה BC, בשורות 2 עד 201. BC היא העמודה האחרונה, ולכן נבנה את הטבלאות מימין לה, מעמודה BE.
- טבלת הנצפות. בתאים BE2, BE3, BE4 מקלידים את קודי הקבוצות: 0, 1, 2. בתאים BF1 ו־BG1 את קודי ההתנדבות: 0, 1. בתא BF2:
=COUNTIFS($D$2:$D$201, $BE2, $BC$2:$BC$201, BF$1), וגוררים עד BG4. הפונקציה סופרת שורות שעומדות בשני התנאים יחד. סימני הדולר שומרים את הטווחים, את עמודת הקודים ואת שורת הכותרות. - השוליים. בתא BH2:
=SUM(BF2:BG2), וגוררים עד BH4. בתא BF5:=SUM(BF2:BF4), וגוררים עד BH5. ב־BH5 צריך לצאת 200. - טבלת הצפויות. בתא BF8:
=$BH2*BF$5/$BH$5, וגוררים עד BG10. סכום השורה כפול סכום העמודה, חלקי N. - ערך p.
=CHISQ.TEST(BF2:BG4, BF8:BG10)נותן 0.0030. הפונקציה מקבלת את הנצפות ואת הצפויות, ומחזירה ישר את ערך p, לא את χ². - χ² עצמו.
=SUMPRODUCT((BF2:BG4-BF8:BG10)^2/BF8:BG10)נותן 11.61. ואז=CHISQ.DIST.RT(11.61, 2)נותן שוב 0.003, ו־=CHISQ.INV.RT(0.05, 2)את הערך הקריטי, 5.99. - V של קרמר.
=SQRT(11.61/(200*1))נותן 0.24.
BE1:BH10
| BE | BF | BG | BH | |
|---|---|---|---|---|
| 1 | 0 | 1 | Total | |
| 2 | 0 | 47 | 27 | 74 |
| 3 | 1 | 23 | 28 | 51 |
| 4 | 2 | 27 | 48 | 75 |
| 5 | Total | 97 | 103 | 200 |
| 8 | 0 | 35.89 | 38.11 | |
| 9 | 1 | 24.735 | 26.265 | |
| 10 | 2 | 36.375 | 38.625 |
- שורות 2–4
- השכיחויות הנצפות. שורה לכל קבוצה, עמודה לכל תשובה.
- שורות 8–10
- השכיחויות הצפויות. הסכומים שלהן זהים לסכומי הנצפות.
- CHISQ.TEST
- מחזירה ערך p בלבד: .003. את דרגות החופש היא קובעת לבד מגודל הטבלה.
אפשר לבנות את טבלת הנצפות גם בלי נוסחאות, בטבלת ציר (פרק 9): group ב־Rows, vol_post ב־Columns, ו־id ב־Values עם Count. באותה טבלת ציר, Show Values As > % of Row Total נותן את אחוזי ההתנדבות בכל קבוצה.
- Analyze > Descriptive Statistics > Crosstabs
- Row(s):
group. Column(s):vol_post. - בכפתור Statistics מסמנים Chi-square, ו־Phi and Cramer's V.
- בכפתור Cells מסמנים Observed ו־Expected תחת Counts, ו־Row תחת Percentages.
- אפשר לסמן גם Display clustered bar charts, לגרף של הטבלה. לוחצים OK.
Study group * Volunteered, post Crosstabulation
| No | Yes | Total | ||
|---|---|---|---|---|
| Control | Count | 47 | 27 | 74 |
| Expected Count | 35.9 | 38.1 | 74.0 | |
| % within Study group | 63.5% | 36.5% | 100.0% | |
| Indirect | Count | 23 | 28 | 51 |
| Expected Count | 24.7 | 26.3 | 51.0 | |
| % within Study group | 45.1% | 54.9% | 100.0% | |
| Combined | Count | 27 | 48 | 75 |
| Expected Count | 36.4 | 38.6 | 75.0 | |
| % within Study group | 36.0% | 64.0% | 100.0% | |
| Total | Count | 97 | 103 | 200 |
| % within Study group | 48.5% | 51.5% | 100.0% |
Chi-Square Tests
| Value | df | Asymptotic Significance (2-sided) | |
|---|---|---|---|
| Pearson Chi-Square 1 | 11.606a | 2 | .003 |
| Likelihood Ratio | 11.744 | 2 | .003 |
| Linear-by-Linear Association | 11.220 | 1 | <.001 |
| N of Valid Cases | 200 | ||
| a. 0 cells (0.0%) have expected count less than 5. The minimum expected count is 24.74. 2 | |||
Symmetric Measures
| Value | Approximate Significance | ||
|---|---|---|---|
| Nominal by Nominal | Phi | .241 | .003 |
| Cramer's V | .241 | .003 | |
| N of Valid Cases | 200 |
- % within Study group
- אחוזים בתוך כל קבוצה, בשורה. כאן קוראים את התשובה התיאורית: 36.5%, 54.9%, 64.0%.
- 1 · Pearson Chi-Square
- השורה שקוראים: χ²(2) = 11.61, p = .003.
- 2 · הערה a
- בדיקת ההנחה: אין אף תא עם שכיחות צפויה מתחת ל־5. הקטנה ביותר 24.74.
- Likelihood Ratio
- סטטיסטי אחר לאותה שאלה. במדגם גדול הוא כמעט זהה ל־Pearson. בספר לא נשתמש בו.
- Linear-by-Linear Association
- מניח שלקטגוריות יש סדר. לקבוצות שלנו אין סדר, ולכן מתעלמים מהשורה הזו.
- Cramer's V
- .241. בטבלה שבה אחד המשתנים עם שתי קטגוריות, Phi ו־V שווים.
כך נראה הפלט, בגרסה 28 ואילך.
- Frequencies > Contingency Tables
- Rows:
group. Columns:vol_post. שני המשתנים צריכים להיות מוגדרים Nominal. - בלשונית Statistics: Χ² מסומן מראש. תחת Nominal מסמנים Phi and Cramer's V.
- בלשונית Cells: מסמנים Expected תחת Counts, ו־Row תחת Percentages.
Contingency Tables
| group | 0 | 1 | Total | |
|---|---|---|---|---|
| 0 | Count | 47.00 | 27.00 | 74.00 |
| Expected count | 35.89 | 38.11 | 74.00 | |
| % within row | 63.5 % | 36.5 % | 100.0 % | |
| 1 | Count | 23.00 | 28.00 | 51.00 |
| Expected count | 24.74 | 26.27 | 51.00 | |
| % within row | 45.1 % | 54.9 % | 100.0 % | |
| 2 | Count | 27.00 | 48.00 | 75.00 |
| Expected count | 36.38 | 38.63 | 75.00 | |
| % within row | 36.0 % | 64.0 % | 100.0 % | |
| Total | Count | 97.00 | 103.00 | 200.00 |
Chi-Squared Tests
| Value | df | p | |
|---|---|---|---|
| Χ² | 11.61 | 2 | .003 |
| N | 200 |
Nominal
| Value | |
|---|---|
| Cramer's V | 0.24 |
- Expected count
- השכיחויות הצפויות, כמו שחישבנו ביד.
- Χ²
- χ²(2) = 11.61, p = .003. אם יש תאים עם שכיחות צפויה מתחת ל־5, JASP מוסיף הערה מתחת לטבלה.
- Cramer's V
- גודל האפקטEffect size, .24.
אם המשתנים לא מוגדרים עם תוויות, בטבלה יופיעו הקודים, 0, 1 ו־2. אפשר להוסיף תוויות בלחיצה על כותרת העמודה בקובץ.
חי בריבוע לטיב התאמה: האם חצי בנים וחצי בנות?
genderבעמודה F. בתאים BJ2 ו־BJ3:=COUNTIF($F$2:$F$201, 1)ו־=COUNTIF($F$2:$F$201, 2). מקבלים 96 ו־104.- בתאים BK2 ו־BK3 השכיחויות הצפויות:
=200*0.5, כלומר 100 בכל תא. לאחוזים אחרים, כופלים את N באחוז הצפוי. =CHISQ.TEST(BJ2:BJ3, BK2:BK3)נותן 0.572. כשהטבלה היא עמודה אחת, הפונקציה משתמשת ב־k − 1 דרגות חופש.
- Analyze > Nonparametric Tests > Legacy Dialogs > Chi-square
- Test Variable List:
gender. תחת Expected Values: All categories equal. לאחוזים אחרים בוחרים Values, ומוסיפים את הערכים לפי סדר הקודים.
Gender
| Observed N | Expected N | Residual | |
|---|---|---|---|
| Boy | 96 | 100.0 | -4.0 |
| Girl | 104 | 100.0 | 4.0 |
| Total | 200 |
Test Statistics
| Gender | |
|---|---|
| Chi-Square | .320a |
| df | 1 |
| Asymp. Sig. | .572 |
| a. 0 cells (0.0%) have expected frequencies less than 5. The minimum expected cell frequency is 100.0. | |
- Residual
- נצפה פחות צפוי, בכל קטגוריה.
- Asymp. Sig.
- ערך p: .572. לא דוחים: החלוקה מתאימה לחצי־חצי.
- Frequencies > Multinomial Test
- Factor:
gender. תחת Test Values: Equal proportions. לאחוזים אחרים בוחרים Expected proportions (χ²), ומקלידים את האחוזים. - מסמנים Descriptives, כדי לראות את השכיחויות הנצפות והצפויות.
Multinomial Test
| χ² | df | p | |
|---|---|---|---|
| H₀ (a) | 0.32 | 1 | .572 |
- H₀ (a)
- השערת האפס, כאן חלוקה שווה. p = .572: לא דוחים.
בדקו את עצמכםשאלה אחת
1.באקסל, =CHISQ.TEST(BF2:BG4, BF8:BG10) החזיר 0.0030. מה המספר הזה?
1.בפלט Chi-Square Tests של SPSS יש כמה שורות. איזו מהן קוראים במבחן חי בריבוע לאי־תלות על הקבוצה וההתנדבות?
1.ב־JASP, באיזה ניתוח מריצים מבחן חי בריבוע לאי־תלות?
1.באקסל, כתבו נוסחה שבודקת אם 96 הבנים ו־104 הבנות מתאימים לחלוקה של 45% בנים ו־55% בנות. הנצפות בתאים BJ2:BJ3. מה תקלידו בתאים BK2 ו־BK3, ומה הנוסחה למבחן?
1.ב־SPSS, איך מריצים מבחן חי בריבוע לטיב התאמה על gender, מול 45% בנים ו־55% בנות? ומה יוצא?
1.ב־JASP, איך מריצים מבחן חי בריבוע לטיב התאמה על gender, מול 45% בנים ו־55% בנות? ומה יוצא?
איך מדווחים
קודם האחוזים, כדי שהקורא יבין מה נמצא, ואחריהם המבחן: χ² עם דרגות החופש ו־N בסוגריים, ערך p, ו־V. הסימנים χ², p ו־V נכתבים באות נטויה.
נמצא קשר מובהק בין קבוצת המחקר לבין ההתנדבות בסוף השנה, בעוצמה בין קטנה לבינונית. שיעור המתנדבים היה 36.5% בקבוצת הביקורת, 54.9% בתוכנית העקיפה ו־64.0% בתוכנית המשולבת, χ²(2, N = 200) = 11.61, p = .003, V = .24. בתחילת השנה לא נמצא הבדל מובהק בין הקבוצות (33.8%, 43.1% ו־38.7%), χ²(2, N = 200) = 1.14, p = .565.
ובטיב התאמה: "מספר הבנים (96) והבנות (104) לא היה שונה באופן מובהק מחלוקה שווה, χ²(1, N = 200) = 0.32, p = .572." ואם השתמשתם במבחן פישר המדויק, כותבים זאת במפורש, למשל: "מבחן פישר המדויק, p = .132".
טעויות נפוצות
- מריצים חי בריבוע על אחוזים. χ² תלוי ב־N. על אחוזים, כאילו כל קבוצה היא 100 נבדקים, התוצאה חסרת משמעות. תמיד על ספירות.
- בודקים את הכלל של 5 על השכיחויות הנצפות. הכלל הוא על הצפויות. מחשבים אותן מהשוליים.
- סופרים נבדק יותר מפעם אחת. למשל, שאלה שאפשר לסמן בה כמה תשובות, וכל סימון נכנס לטבלה. או אותם תלמידים לפני ואחרי, באותה טבלה. כל נבדק בתא אחד בלבד.
- מסיקים קשר חזק מ־χ² גדול. χ² גדל עם המדגם. את העוצמה מודדים ב־V.
- משווים אחוזים בכיוון הלא נכון. כדי להשוות קבוצות, מחשבים אחוזים בתוך כל קבוצה.
- דרגות חופש = מספר התאים פחות 1. בטבלת שילוב: (שורות − 1) × (עמודות − 1). מספר התאים פחות 1 נכון רק בטיב התאמה.
- "לא מובהק" = "הקבוצות שקולותGroup equivalence". תוצאה לא מובהקת אומרת רק שלא מצאנו הבדל.
- χ² מובהק בטבלה גדולה, ומסיקים שכל הקבוצות שונות זו מזו. המבחן אומר רק שבמקום כלשהו יש הבדל. כאן, הביקורת והמשולבת שונות, והעקיפה באמצע.
בדקו את עצמכם
סיכום
- טבלת שילוב: כל נבדק בתא אחד, לפי שני משתנים שמיים. השוליים הם סכומי השורות והעמודות. אחוזים מחשבים בתוך הקבוצות שמשווים.
- שכיחות צפויה: מה שהיינו רואים אילו אין קשר. שורה כפול עמודה, חלקי N.
- חי בריבוע: סכום של (נצפה פחות צפוי) בריבוע, חלקי צפוי. תמיד בזנב הימני.
- דרגות חופש: באי־תלות, (שורות − 1) × (עמודות − 1). בטיב התאמה, מספר הקטגוריות פחות 1.
- גודל אפקט: V של קרמר, ובטבלה של 2 × 2 מקדם פי.
- הנחות: כל נבדק פעם אחת, ספירות ולא אחוזים, שכיחויות צפויות לא קטנות מדי. אחרת: לאחד קטגוריות, או פישר.
מונחים חדשים
שאלות לדוגמה, עם פתרונות
לכל מחקר, בחרו מבחן ונמקו במשפט אחד. א. האם שיעור התלמידים שעוברים בגרות במתמטיקה שונה בין שלושה בתי ספר? ב. האם התפלגות השפות המדוברות בבית בכיתה מסוימת שונה מהתפלגותן בעיר? ג. האם יש קשר בין מספר שנות הוותק של מורות לבין ציון השחיקה שלהן? ד. אותם 40 תלמידים נשאלו בספטמבר וביוני אם הם אוהבים לקרוא, כן או לא. האם שיעור האוהבים עלה?
בדיקת התשובה
א. חי בריבוע לאי־תלות: שני משתנים שמיים, בית ספר ועבר או לא עבר, בטבלה של 3 × 2. ב. חי בריבוע לטיב התאמה: משתנה שמי אחד, מול התפלגות ידועה. ג. מתאם פירסון (פרק 15): שני המשתנים כמותייםQuantitative variable. את המובהקות שלו נלמד בפרק הבא. ד. לא חי בריבוע רגיל: אותם תלמידים נמדדו פעמיים, וכל תלמיד היה נספר פעמיים. מבחן לנתונים מזווגים, כמו מבחן מקנמרMcNemar's test, שמסתכל על מי שהשתנה.
בסקר של 150 תלמידים, 50 מכל שכבה, נשאלו אם הם משתתפים בחוג ספורט אחרי הלימודים. כיתה ו׳: 30 כן, 20 לא. כיתה ז׳: 25 כן, 25 לא. כיתה ח׳: 15 כן, 35 לא. א. חשבו את השכיחויות הצפויות. ב. חשבו את χ², דרגות החופש וערך p. ג. חשבו את V ופרשו. (α = .05)
בדיקת התשובה
כן: 70, לא: 80, N = 150 סכומי העמודותEכן = 50 × 70 / 150 = 23.333, Eלא = 50 × 80 / 150 = 26.667 א. זהה בכל שכבה, כי בכל שכבה 50ו׳: (30 − 23.333)² / 23.333 + (20 − 26.667)² / 26.667 = 1.905 + 1.667ז׳: (25 − 23.333)² / 23.333 + (25 − 26.667)² / 26.667 = 0.119 + 0.104ח׳: (15 − 23.333)² / 23.333 + (35 − 26.667)² / 26.667 = 2.976 + 2.604χ² = 9.375 ≈ 9.38, df = (3 − 1)(2 − 1) = 2, p = CHISQ.DIST.RT(9.375, 2) = .009V = √(9.375 / (150 × 1)) = √0.0625 = .25ב. 9.38 גדול מ־5.99: דוחים. יש קשר בין השכבה להשתתפות בחוג. ג. ההשתתפות יורדת עם הגיל: 60% בכיתה ו׳, 50% בכיתה ז׳, 30% בכיתה ח׳. V = .25, עם k − 1 = 1: קשר בין קטן לבינוני. רוב החי בריבוע מגיע מכיתות ו׳ וח׳.
יועצת בית הספר רשמה את מספר הפניות של תלמידים אליה בכל יום בשבוע, במשך חודש: ראשון 30, שני 22, שלישי 18, רביעי 16, חמישי 14. האם הפניות מתחלקות שווה בין הימים? חשבו את χ², דרגות החופש וערך p, וכתבו מסקנה.
בדיקת התשובה
N = 30 + 22 + 18 + 16 + 14 = 100, E = 100 / 5 = 20 בכל יוםO − E = 10, 2, −2, −4, −6 הסכום 0, כמו תמידχ² = (100 + 4 + 4 + 16 + 36) / 20 = 160 / 20 = 8.00df = 5 − 1 = 4, ערך קריטי 9.49, p = CHISQ.DIST.RT(8, 4) = .092לא דוחים: 8.00 קטן מ־9.49. אמנם ביום ראשון היו יותר פניות, אבל עם 100 פניות בלבד, אי אפשר לשלול שזה מקרי. "χ²(4, N = 100) = 8.00, p = .092". שימו לב: אם אותו תלמיד פנה כמה פעמים, הפניות אינן בלתי תלויות, וזו בעיה בהנחות.
האם בנים ובנות שונים בהתנדבות בסוף השנה? קראו את הפלט של SPSS וענו: א. מה אחוז המתנדבים בכל מגדר? ב. איזו שורה בטבלת המבחן קוראים, ולמה? ג. דווחו את התוצאה במשפט, כולל גודל אפקט. ד. למה Phi שלילי?
Gender * Volunteered, post Crosstabulation (Count)
No Yes Total Boy 44 52 96 Girl 53 51 104 Total 97 103 200 Chi-Square Tests
Value df Asymptotic Significance (2-sided) Exact Sig. (2-sided) Exact Sig. (1-sided) Pearson Chi-Square .526a 1 .468 Continuity Correctionb .340 1 .560 Likelihood Ratio .526 1 .468 Fisher's Exact Test .482 .280 Linear-by-Linear Association .523 1 .470 N of Valid Cases 200 a. 0 cells (0.0%) have expected count less than 5. The minimum expected count is 46.56. b. Computed only for a 2x2 table Symmetric Measures
Value Approximate Significance Nominal by Nominal Phi -.051 .468 Cramer's V .051 .468 בדיקת התשובה
בנים: 52 / 96 = 54.2%, בנות: 51 / 104 = 49.0% א. אחוזים בתוך כל מגדרEmin = 96 × 97 / 200 = 46.56 בדיקה של הערה aב. Pearson Chi-Square. השכיחויות הצפויות גדולות (הקטנה 46.56), ולכן אין צורך בפישר. Continuity Correction הוא תיקון ייטס, שמרני מדי. כאן כל השורות מסכימות: לא מובהק.
ג. "לא נמצא קשר מובהק בין מגדר להתנדבות בסוף השנה. 54.2% מהבנים ו־49.0% מהבנות התנדבו, χ²(1, N = 200) = 0.53, p = .468, φ = .05." קשר זניח.
ד. בטבלה של 2 × 2 SPSS מחשב את φ כמתאםCorrelation בין שני המשתנים, לפי הקודים. ככל שהמגדר "עולה" מ־1 (בן) ל־2 (בת), ההתנדבות קצת יורדת, ולכן הסימן שלילי. את הכיוון קוראים מהאחוזים, ובדיווח כותבים את הערך המוחלט.
במחקר על 30 תלמידים בכיתה אחת נבדק הקשר בין מגדר לצרכים מיוחדים. בנים: 9 ללא צרכים מיוחדים, 3 עם לקות למידה, 4 עם הפרעת קשב (16). בנות: 12 ללא, 1 עם לקות למידה, 1 עם הפרעת קשב (14). א. האם אפשר להריץ חי בריבוע על הטבלה כמו שהיא? ב. אחדו את שתי קטגוריות הצרכים המיוחדים ובדקו שוב. ג. מה עושים?
בדיקת התשובה
סכומי העמודות: ללא 21, לקות למידה 4, הפרעת קשב 5בנים: 16 × 21 / 30 = 11.2, 16 × 4 / 30 = 2.13, 16 × 5 / 30 = 2.67בנות: 14 × 21 / 30 = 9.8, 14 × 4 / 30 = 1.87, 14 × 5 / 30 = 2.334 מתוך 6 תאים מתחת ל־5: 67% א. הרבה מעל 20%אחרי איחוד: צרכים מיוחדים 9. בנים: 16 × 9 / 30 = 4.8, בנות: 14 × 9 / 30 = 4.2 ב. טבלה של 2 × 2א. לא. ארבעה מתוך ששת התאים עם שכיחות צפויה מתחת ל־5. ב. גם אחרי האיחוד, שני תאים מתחת ל־5, ובטבלה של 2 × 2 כל התאים צריכים להיות 5 לפחות. ג. מבחן פישר המדויק על הטבלה המאוחדת: p = .118. לא מובהק. 43.8% מהבנים ו־14.3% מהבנות עם צרכים מיוחדים, הבדל לא קטן, אבל בכיתה אחת של 30 תלמידים אין מספיק מידע. (אילו הרצנו חי בריבוע בכל זאת, היינו מקבלים χ²(1) = 3.09, p = .079.)
שני מחקרים בדקו את הקשר בין השתתפות בתוכנית מנטורינג (כן או לא) לבין סיום התיכון (כן או לא). חוקרת א׳ דגמה 50 תלמידים וקיבלה χ²(1) = 3.20. חוקר ב׳ דגם 500 תלמידים וקיבל χ²(1) = 9.00. א. מה ערך p בכל מחקר? ב. באיזה מחקר הקשר חזק יותר? ג. אילו חוקרת א׳ הייתה דוגמת 100 תלמידים, עם אותם אחוזים בדיוק, מה היה יוצא?
בדיקת התשובה
א׳: p = CHISQ.DIST.RT(3.2, 1) = .074, ב׳: p = CHISQ.DIST.RT(9, 1) = .003א׳: φ = √(3.20 / 50) = √0.064 = .25, ב׳: φ = √(9.00 / 500) = √0.018 = .13אותם אחוזים, N כפול: χ² = 2 × 3.20 = 6.40, p = .011, φ = √(6.40 / 100) = .25א. רק המחקר של חוקר ב׳ מובהק. ב. דווקא אצל חוקרת א׳ הקשר חזק כמעט פי 2: φ = .25 מול .13. המחקר של ב׳ מובהק בגלל המדגם הגדול. ג. χ² מוכפל, הקשר הופך מובהק, ו־φ לא משתנה. זו בדיוק הסיבה שמדווחים תמיד גם גודל אפקט, ושתוצאה לא מובהקת במדגם קטן אינה "אין קשר".
תרגול עם הנתונים
קובץ המחקר: 200 תלמידים, 55 משתנים. משתני ההתנדבות (vol_pre, vol_post) מקודדים 0 = לא, 1 = כן. ערך 99 מסמן נתון חסרMissing value בהשכלת ההורים ובמספר האחים, וצריך להוציא אותו לפני שבונים טבלה.
הקבצים עצמם, care_school.csv ומילון המשתנים, נמצאים גם בתיקיית data בחבילת הספר.
- האם יש קשר בין מגדר להתנדבות בתחילת השנה (
vol_pre)?בדיקת התשובה
לא. 39.6% מהבנים ו־36.5% מהבנות התנדבו, χ²(1, N = 200) = 0.20, p = .658, φ = .03. כל השכיחויות הצפויות מעל 36.
- האם בשלוש הקבוצות יש אותו שיעור של תלמידי כיתה ד׳ ו־ה׳ (
grade)?בדיקת התשובה
אין הבדל מובהק: תלמידי כיתה ה׳ הם 29.7% בביקורת, 43.1% בתוכנית העקיפה ו־30.7% במשולבת, χ²(2, N = 200) = 2.87, p = .238, V = .12. שימו לב שהשכבה נקבעת לפי כיתות שלמות, ולכן "תלמידים" כאן אינם באמת תצפיות בלתי תלויות.
- במדגם 133 תלמידי כיתה ד׳ ו־67 תלמידי כיתה ה׳. האם זה שונה מחלוקה שווה בין השכבות? ולמה המבחן הזה לא מעניין במיוחד?
בדיקת התשובה
שונה מאוד: χ²(1, N = 200) = 21.78, p < .001. אבל זה לא ממצא: החוקרים בחרו חמש כיתות ד׳ ושלוש כיתות ה׳. מבחן טיב התאמה שימושי רק כשיש סיבה אמיתית לצפות להתפלגות מסוימת.
- בנו טבלת שילוב של
vol_preמולvol_post, וחשבו גם את המתאם של פירסון בין שני המשתנים. מה הקשר בין φ ל־r? והאם הטבלה הזו עונה על השאלה אם ההתנדבות עלתה?בדיקת התשובה
χ²(1, N = 200) = 21.37, p < .001, φ = .33, ו־r = .33, אותו מספר. מי שהתנדב בהתחלה נטה להתנדב גם בסוף: 72.4% לעומת 38.7%. אבל זה קשר, לא שינוי. כדי לבדוק אם ההתנדבות עלתה צריך מבחן לנתונים מזווגים. מבחן מקנמר: 48 עברו מ"לא" ל"כן" ו־21 להפך, χ²(1) = 10.57, p = .001.
בפרק הבא: מקדם פי הוא בעצם מתאם. בפרק 15 חישבנו מתאמים ותיארנו אותם, אבל לא שאלנו אם הם גדולים מכדי להיות מקריים. בפרק 24 נבדוק השערות על מקדם המתאם של פירסון, ונראה איך לקרוא מטריצת מתאמיםCorrelation matrix.
מקורות: Cochran, W. G. (1954). Some methods for strengthening the common χ² tests. Biometrics, 10(4), 417–451. · Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Erlbaum. · Fisher, R. A. (1922). On the interpretation of χ² from contingency tables, and the calculation of P. Journal of the Royal Statistical Society, 85(1), 87–94. · Pearson, K. (1900). On the criterion that a given system of deviations from the probable in the case of a correlated system of variables is such that it can be reasonably supposed to have arisen from random sampling. Philosophical Magazine, 50(302), 157–175. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y · Yates, F. (1934). Contingency tables involving small numbers and the χ² test. Supplement to the Journal of the Royal Statistical Society, 1(2), 217–235.