סטטיסטיקה מ־0 עד 100בטאתוכנהעומק

חלק ג: מהמדגם לאוכלוסייה · פרק 23

חי בריבוע

עד עכשיו בדקנו השערות על ממוצעים. אבל הרבה שאלות בחינוך הן על קטגוריות: התנדב או לא, בן או בת, באיזו קבוצה. לקטגוריות אין ממוצע, אבל אפשר לספור אותן. בפרק הזה נלמד מבחן שעובד על ספירות: משווים את מה שנספר בפועל למה שהיינו מצפים לספור אילו לא היה שום קשר.

שאלת הפתיחה

האם בבתי הספר של התוכנית התנדבו יותר תלמידים לעזור?

בסוף שנת הלימודים בדקו במחקר שלנו אם כל תלמיד התנדב לעזור, כן או לא (vol_post). התשובה היא קטגוריה, לא ציון. בפרק 5 ראינו שבמדגם ההתנדבות עלתה הכי הרבה בתוכנית המשולבת, והשארנו פתוחה את השאלה אם ההבדל גדול מכדי להיות מקרי. בסוף הפרק תדעו לענות עליה, ביד ובתוכנה.

בסוף הפרק תוכלו

שני משתנים שמיים בטבלה אחת

כשהמשתנים שמיים, סופרים כמה נבדקים יש בכל צירוף של קטגוריות. כך מקבלים טבלת שילוב: כל נבדק נספר בתא אחד בדיוק. סכומי השורות והעמודות הם השכיחויות השוליות. כדי להשוות בין הקבוצות מחשבים אחוזים בתוך כל קבוצה.

בפרק 9 בנינו טבלת שכיחויותFrequency table למשתנה אחד. עכשיו יש לנו שניים: קבוצת המחקר (group) וההתנדבות בסוף השנה (vol_post). שניהם בסולם שמיNominal scale. אי אפשר לחשב ביניהם מתאם פירסוןPearson correlation coefficient, וגם אין טעם לחשב ממוצע של "קבוצה". מה שכן אפשר לעשות: לספור.

בונים טבלה שבשורות שלה הקטגוריות של משתנה אחד, ובעמודות הקטגוריות של המשתנה השני. כל תלמיד נכנס לתא אחד בדיוק, לפי הקבוצה שלו ולפי התשובה שלו. טבלה כזו נקראת טבלת שילוב. באקסל בונים אותה בטבלת ציר (פרק 9), או בפונקציה COUNTIFS (בקטע "בתוכנה" בהמשך).ב־SPSS בונים אותה ב־Crosstabs (בקטע "בתוכנה" בהמשך).ב־JASP בונים אותה ב־Contingency Tables (בקטע "בתוכנה" בהמשך).

קבוצהלא התנדבוהתנדבוסה״כאחוז המתנדבים
ביקורת47277436.5%
תוכנית עקיפה23285154.9%
תוכנית משולבת27487564.0%
סה״כ9710320051.5%

איך קוראים את הטבלה? 27 תלמידים בקבוצת הביקורת התנדבו. 48 תלמידים בתוכנית המשולבת התנדבו. העמודה "סה״כ" והשורה "סה״כ" הן השכיחויות השוליות, כי הן יושבות בשולי הטבלה: 74 תלמידים בביקורת, 51 בתוכנית העקיפה ו־75 במשולבת. ובסך הכול 103 התנדבו ו־97 לא. בפינה, 200: מספר התלמידים כולו, .

אחוזים בשורה, או בעמודה?

הספירות לבדן מטעות, כי הקבוצות לא באותו גודל. 28 מתנדבים מתוך 51 זה יותר מ־27 מתוך 74, גם אם המספרים כמעט שווים. לכן מחשבים אחוזים. אבל יש שתי דרכים, והן עונות על שתי שאלות שונות:

כלל האצבע: מחשבים אחוזים בתוך הקטגוריות של המשתנה שמשווים לפיו, ואז משווים ביניהן. כאן משווים בין הקבוצות, ולכן אחוזים בתוך כל קבוצה, בשורה. והתמונה ברורה: 36.5% בביקורת, 54.9% בתוכנית העקיפה, 64.0% במשולבת.

במדגם יש הבדל. אבל אנחנו כבר יודעים שגם כשבאוכלוסייה אין שום הבדל, מדגמים לא יוצאים זהים. השאלה של הפרק היא אם ההבדל הזה גדול מכדי להיות מקרי.

הסיפור המלא: גם התחלה צריך לבדוק

בפרק 9 ראינו את אותה טבלה לפני התוכנית (vol_pre): 33.8% התנדבו בביקורת, 43.1% בתוכנית העקיפה ו־38.7% במשולבת. כלומר, בתוכנית העקיפה היו קצת יותר מתנדבים כבר בהתחלה. זה חשוב: אם קבוצה התחילה גבוה, אולי היא פשוט נשארה גבוהה, בלי קשר לתוכנית. נחזור לזה בסעיף 7, ונראה איך בודקים אם הקבוצות היו דומות בהתחלה.

עצרו ונסו

מתוך 103 המתנדבים בסוף השנה, כמה אחוז הגיעו מהתוכנית המשולבת? ולמה האחוז הזה לא עונה על שאלת הפתיחה?

בדיקת התשובה

48 מתוך 103, כלומר 46.6%. זה אחוז בתוך העמודה. הוא תלוי גם בגודל הקבוצה: אילו בתוכנית המשולבת היו 150 תלמידים, היא הייתה "תורמת" יותר מתנדבים גם בלי שום השפעה. השאלה שלנו היא אם הסיכוי של תלמיד להתנדב תלוי בקבוצה שלו, ולכן משווים אחוזים בתוך כל קבוצה: 36.5%, 54.9% ו־64.0%.

בדקו את עצמכם3 שאלות

1.בטבלת השילוב של הקבוצה וההתנדבות בסוף השנה, 23 מתוך 51 תלמידי התוכנית העקיפה לא התנדבו. איזה אחוז מתאר את התלמידים בתוכנית העקיפה שלא התנדבו?

2.בחטיבת ביניים 30% מהבנות בחרו במגמת תיאטרון, ו־60% מתלמידי התיאטרון הם בנות. איזה מהנתונים עונה על השאלה "האם בנות בוחרות בתיאטרון יותר מבנים?"

3.בטבלת שילוב של 2 × 2 יש 120 תלמידים. בשורה הראשונה 70 תלמידים, בעמודה הראשונה 50, ובתא המשותף לשתיהן 30. השלימו את שלושת התאים האחרים.

מה היינו מצפים לראות אילו לא היה קשר?

השערת האפסNull hypothesis: שני המשתנים בלתי תלוייםIndependent variable, כלומר בכל קבוצה אותו אחוז מתנדבים. לפי השערה זו מחשבים לכל תא שכיחות צפויה: סכום השורה כפול סכום העמודה, חלקי N. מה שנספר בפועל נקרא השכיחות הנצפית.

כמו בכל מבחן, מתחילים מהעולם שבו השערת האפסNull hypothesis נכונה (פרק 18). כאן השערת האפס אומרת שאין קשר בין הקבוצה להתנדבות. בשפה של חי בריבוע אומרים שהמשתנים בלתי תלויים, ומכאן שם המבחן: חי בריבוע לאי־תלות.

: הקבוצה וההתנדבות בלתי תלויות. בכל קבוצה, אותו אחוז מתנדבים.
: יש קשר. אחוז המתנדבים שונה לפחות באחת הקבוצות.

שימו לב שלהשערה החלופית אין כיוון. היא לא אומרת איזו קבוצה גבוהה יותר, רק שהקבוצות לא כולן שוות. עם שלוש קבוצות אין דרך לנסח השערה חד־צדדיתOne-tailed hypothesis / test אחת.

השכיחות הצפויה

אם אין קשר, מה היינו מצפים לראות בכל תא? בסך הכול התנדבו 103 מתוך 200, כלומר 51.5%. אילו הקבוצה לא הייתה משנה כלום, גם בתוך כל קבוצה היו מתנדבים 51.5%. בקבוצת הביקורת יש 74 תלמידים, ו־51.5% מהם הם 38.11. זו השכיחות הצפויה בתא "ביקורת, התנדבו". ומה שנספר בפועל, 27, הוא השכיחות הנצפית.

במקום לחשב אחוז ואז לכפול, יש קיצור: סכום השורה, כפול סכום העמודה, חלקי המספר הכולל.

E = סכום השורה × סכום העמודהN     ביקורת, התנדבו: E = 74 × 103200 = 38.11

האותיות באות מאנגלית: O לשכיחות הנצפית (Observed), ו־E לשכיחות הצפויה (Expected). כך מחשבים את כל ששת התאים:

קבוצהלא התנדבו: O (E)התנדבו: O (E)סה״כ
ביקורת47 (35.890)27 (38.110)74
תוכנית עקיפה23 (24.735)28 (26.265)51
תוכנית משולבת27 (36.375)48 (38.625)75
סה״כ97103200

שלושה דברים לשים לב אליהם:

הסיפור המלא: למה דווקא שורה כפול עמודה?

הנוסחה באה מכלל הכפל בהסתברות. אם שני מאורעות בלתי תלויים, ההסתברות ששניהם יקרו היא מכפלת ההסתברויות. ההסתברות שתלמיד אקראי מהמדגם יהיה בקבוצת הביקורת היא 74 / 200 = .37. ההסתברות שהוא התנדב היא 103 / 200 = .515. אם הקבוצה וההתנדבות בלתי תלויות, ההסתברות לשניהם יחד היא .37 × .515 = .19055. ומתוך 200 תלמידים, מצפים ל־.19055 × 200 = 38.11. אם מצמצמים, מקבלים בדיוק את הקיצור: (74 / 200) × (103 / 200) × 200 = 74 × 103 / 200.

עצרו ונסו

בשכבה של 120 תלמידים יש 50 בנים ו־70 בנות. 36 תלמידים בסך הכול נרשמו לחוג רובוטיקה. אילו אין קשר בין מגדר להרשמה, כמה בנות היינו מצפים לראות בחוג?

בדיקת התשובה
E = 70 × 36 / 120 = 2520 / 120 = 21

30% מכל התלמידים נרשמו לחוג (36 מתוך 120). אילו אין קשר, גם 30% מהבנות היו נרשמות: 30% מ־70 הן 21. ולבנים: 50 × 36 / 120 = 15. ביחד 36, כמו שצריך.

בדקו את עצמכם4 שאלות

1.בטבלת שילוב של 150 תלמידים, סכום השורה "כיתה ה׳" הוא 60, וסכום העמודה "קוראים ספר בשבוע" הוא 45. מהי השכיחות הצפויה בתא "כיתה ה׳, קוראים"?

2.מה בדיוק אומרת השערת האפס במבחן חי בריבוע לאי־תלות על הקבוצה וההתנדבות?

3.בכיתה של 80 תלמידים, ההסתברות שתלמיד אקראי הוא בן היא .40, וההסתברות שהוא משחק בנבחרת היא .25. אילו מגדר ומשחק בנבחרת בלתי תלויים, כמה בנים בנבחרת הייתם מצפים לראות? הסבירו את החישוב.

4.בטבלת שילוב, האחוזים בכל השורות זהים לגמרי. מה אפשר לומר על השכיחויות הנצפות והצפויות?

הסטטיסטי חי בריבוע ודרגות החופש

בכל תא מחשבים (O − E)² / E, ומחברים את כל התאים. התוצאה היא . דרגות החופש: (שורות − 1) × (עמודות − 1). ככל ש־χ² גדול יותר, הנתונים רחוקים יותר מאי־תלות. במחקר שלנו: χ²(2) = 11.61, p = .003, ולכן דוחים את השערת האפס.

יש לנו שש שכיחויות נצפותObserved frequency ושש צפויות. צריך מספר אחד שיגיד כמה הנצפה רחוק מהצפוי בכל הטבלה יחד. בונים אותו בשלושה צעדים, וכל צעד עונה על בעיה:

  1. מחסירים: O − E בכל תא. אבל אם נחבר את ההפרשים, נקבל תמיד אפס, כי הנצפות והצפויות מסתכמות לאותו מספר. הפרשים חיוביים ושליליים מבטלים זה את זה.
  2. מעלים בריבוע: כמו בסטיית התקן (פרק 11), הריבוע מבטל את הסימן. אין הבדל אם יש יותר מדי או פחות מדי. פער הוא פער.
  3. מחלקים בשכיחות הצפויה: פער של 6 כשמצפים ל־22 זה הרבה, כמעט שליש. פער של 6 כשמצפים ל־2,200 זה כלום. לכן מודדים כל פער יחסית לגודל הצפוי בתא.

את התוצאה של כל תא מחברים על פני כל התאים. האות אומרת "סכום של".

χ² = (O − E)²E      = (מספר השורות − 1) × (מספר העמודות − 1)

החי בריבוע תמיד אפס או יותר. הוא אפס רק כשכל שכיחות נצפית שווה בדיוק לצפויה, כלומר כשהאחוזים בכל השורות זהים. ככל שהנתונים רחוקים יותר מאי־תלות, הוא גדל.

דוגמה פתורה: קבוצה והתנדבות

האם יש קשר בין קבוצת המחקר להתנדבות בסוף השנה? ( = .05)

קבוצהלא התנדבוהתנדבו
ביקורת(47 − 35.890)² / 35.890 = 3.439(27 − 38.110)² / 38.110 = 3.239
תוכנית עקיפה(23 − 24.735)² / 24.735 = 0.122(28 − 26.265)² / 26.265 = 0.115
תוכנית משולבת(27 − 36.375)² / 36.375 = 2.416(48 − 38.625)² / 38.625 = 2.275
χ² = 3.439 + 3.239 + 0.122 + 0.115 + 2.416 + 2.275 = 11.61 סכום התרומות של ששת התאים
df = (3 − 1) × (2 − 1) = 2 שלוש שורות, שתי עמודות
ערך קריטי: CHISQ.INV.RT(0.05, 2) = 5.99 11.61 גדול ממנו
p = CHISQ.DIST.RT(11.61, 2) = .003

מסקנה: ערך pp-value קטן מ־.05, ולכן דוחים את השערת האפס. יש קשר בין הקבוצה להתנדבות: אחוז המתנדבים לא זהה בשלוש הקבוצות.

איפה הקשר? התרומות מספרות. כמעט כל החי בריבוע מגיע מקבוצת הביקורת (6.68) ומהתוכנית המשולבת (4.69). בביקורת התנדבו פחות מהצפוי, ובמשולבת יותר. בתוכנית העקיפה הנצפה כמעט שווה לצפוי, והתרומה שלה זניחה.

למה דרגות החופש הן שורות פחות אחת כפול עמודות פחות אחת?

בפרק 20 ראינו שדרגות חופש הן מספר הערכים שחופשיים להשתנות. בטבלת שילוב השוליים קבועים: 74, 51 ו־75 תלמידים בקבוצות, 97 ו־103 בעמודות. נניח שאתם יודעים רק שבביקורת התנדבו 27. האם צריך לשאול כמה בביקורת לא התנדבו? לא: 74 פחות 27, כלומר 47. ואם יודעים גם שבתוכנית העקיפה התנדבו 28, כל השאר נקבע מהשוליים. 103 פחות 27 פחות 28 נותן 48 מתנדבים במשולבת, וכן הלאה. רק שני תאים חופשיים. ובאופן כללי: בכל שורה התא האחרון נקבע, ובכל עמודה התא האחרון נקבע. נשארים (3 − 1) × (2 − 1) = 2 תאים חופשיים.

זו גם הסיבה שבכל שורה של הדוגמה הפער זהה בגודלו ובסימן הפוך: 11.11 פחות מהצפוי בצד אחד, ו־11.11 יותר בצד השני. השוליים "מחייבים" את זה.

התפלגות חי בריבועChi-square distribution

אילו השערת האפס הייתה נכונה, והיינו חוזרים על המחקר שוב ושוב, היינו מקבלים בכל פעם χ² אחר. ההתפלגות של כל הערכים האלה היא התפלגות חי בריבוע, עוד אחת במשפחה שכבר מכירים: z, t, ועכשיו χ². כמו התפלגות tt distribution, גם לה יש צורה אחרת לכל מספר של דרגות חופש. היא מתחילה באפס, אין בה ערכים שליליים, והיא מוטה ימינה. הממוצע שלה שווה למספר דרגות החופש. כלומר, כשאין קשר, χ² סביב 2 בטבלה של שתי דרגות חופש הוא בדיוק מה שמצפים לראות.

בגלל שרק χ² גדול מעיד על קשר, המבחן נעשה תמיד בזנב הימני, גם כשההשערה החלופיתResearch hypothesis בלי כיוון. ערך p הוא השטח מימיןUpper-tail area ל־χ² שקיבלנו.

df123456
ערך קריטי, α = .053.845.997.819.4911.0712.59
הסיפור המלא: מאיפה באה ההתפלגות, ומי טעה בדרגות החופש

תחשבו על תא אחד. אילו חזרנו שוב ושוב על מדגם של 200 תלמידים מאוכלוסייה בלי קשר, בתא "ביקורת, התנדבו" היינו מקבלים לרוב בסביבות 38, לפעמים 36 או 41, ולעיתים רחוקות 27. ההתפלגות של הספירה בתא, במדגם גדול מספיק, קרובה לנורמלית סביב השכיחות הצפויה. לכן (O − E) / √E הוא בערך ציון zz-score, והתרומה של כל תא היא בערך z בריבוע. התפלגות חי בריבוע היא בדיוק זה: ההתפלגות של סכום ריבועיםSum of squares של ציוני z בלתי תלויים, ומספר דרגות החופש אומר כמה מהם באמת חופשיים.

המבחן פורסם ב־1900 על ידי קרל פירסון, אותו פירסון של מקדם המתאםCorrelation. אבל פירסון טעה בדרגות החופש של טבלת שילוב: הוא ספר את מספר התאים פחות אחד. ב־1922 הראה רונלד פישר שהשוליים קובעים חלק מהתאים, ושדרגות החופש הן (שורות − 1) × (עמודות − 1). השניים התווכחו על כך בחריפות שנים, ופישר צדק. בטבלה שלנו ההבדל לא קטן: 5 דרגות חופש במקום 2, וערך קריטיCritical value של 11.07 במקום 5.99.

ועוד שאלה שנשארה פתוחה: איפה בדיוק הקשר? בטבלה גדולה, χ² מובהק אומר רק שבמקום כלשהו האחוזים שונים. התרומות של התאים נותנות כיוון. ב־SPSS אפשר לבקש גם Adjusted standardized residuals (בחלון Cells), מעין ציון z לכל תא. ערך מעבר ל־1.96 בערך מוחלט מסמן תא שרחוק מהצפוי.ב־JASP אפשר לבקש גם שאריותResidual מתוקננות לכל תא (בלשונית Cells), מעין ציון z לכל תא. ערך מעבר ל־1.96 בערך מוחלט מסמן תא שרחוק מהצפוי.באקסל אפשר לחשב לכל תא (O − E) / √E, מעין ציון z. ערכים גדולים בערך מוחלט מסמנים תאים שרחוקים מהצפוי. בדוגמה שלנו, השאריות המתוקננות המותאמות של תא "ביקורת, התנדבו" ושל "משולבת, התנדבו" הן −3.26 ו־2.74. של התוכנית העקיפה, 0.56 בלבד.

מעבדה: מבחן חי בריבוע לאי־תלות. מקלידים שכיחויות נצפות, ורואים את הצפויות, את התרומה של כל תא ואת ערך p.פתיחה בחלון נפרד
משימות למעבדה
  1. בדוגמה "פקולטה והעדפת למידה": באיזה תא התרומה לחי בריבוע הכי גדולה? מה זה אומר על הסטודנטים בפקולטה הזו?
  2. בחרו "בלי קשר". למה חי בריבוע הוא אפס בדיוק? בדקו את האחוזים בכל שורה.
  3. חזרו ל"קשר חזק" והקטינו את כל המספרים עד שמופיעה אזהרה על שכיחות צפויה קטנה. מה קרה לערך p בדרך?
בדיקת התשובה

1. מדעי הרוח: התרומות 3.68 ו־4.50, מתוך χ² = 13.25. שם רק 13 מתוך 40 מעדיפים למידה מקוונת, הרבה פחות מ־22 הצפויים. 2. בשתי השורות בדיוק 60% אמרו "כן" (30 מתוך 50, ו־45 מתוך 75). כשהאחוזים זהים, כל שכיחות נצפיתObserved frequency שווה לצפויה, ואין שום פער. 3. ככל שהמדגם קטן, χ² קטן איתו וערך p עולה, גם כשהאחוזים כמעט לא משתנים. כשתא צפוי יורד מתחת ל־5, הקירוב של התפלגות חי בריבועChi-square distribution כבר לא אמין. נראה מה עושים אז בסעיף 6.

עצרו ונסו

80 תלמידים, 40 בנים ו־40 בנות. 12 בנים ו־22 בנות הצטרפו למקהלת בית הספר. האם יש קשר בין מגדר להצטרפות? (α = .05)

בדיקת התשובה
הצטרפו: 34, לא הצטרפו: 46 סכומי העמודות
Eהצטרפו = 40 × 34 / 80 = 17,   Eלא = 40 × 46 / 80 = 23 זהה בשתי השורות, כי בשתיהן 40
בנים: (12 − 17)² / 17 + (28 − 23)² / 23 = 1.471 + 1.087
בנות: (22 − 17)² / 17 + (18 − 23)² / 23 = 1.471 + 1.087
χ² = 2 × (1.471 + 1.087) = 5.12,   df = 1 × 1 = 1
5.12 > 3.84,   p = CHISQ.DIST.RT(5.12, 1) = .024

דוחים: יש קשר בין מגדר להצטרפות למקהלה. 55% מהבנות הצטרפו, לעומת 30% מהבנים.

בדקו את עצמכם4 שאלות

1.בתא אחד של טבלת שילוב נצפו 30 תלמידים, והשכיחות הצפויה הייתה 20. מה התרומה של התא הזה לחי בריבוע?

2.100 תלמידים: 50 קיבלו שיעורי עזר, ומהם 40 עברו את המבחן. 50 לא קיבלו, ומהם 30 עברו. חשבו את χ², את דרגות החופש ואת ערך p. האם יש קשר בין שיעורי העזר להצלחה? (α = .05)

3.חוקרת בודקת קשר בין מגדר (2 קטגוריות) לבין סוג הפעילות האהובה בהפסקה (5 קטגוריות). כמה דרגות חופש יש למבחן?

4.במבחן חי בריבוע לאי־תלות התקבל χ²(3) = 6.50. הערך הקריטי ב־α = .05 הוא 7.81. מה המסקנה?

כמה חזק הקשר? V של קרמר ומקדם פי

חי בריבוע גדל עם גודל המדגם: אם מכפילים את כל התאים, האחוזים לא זזים, אבל χ² מוכפל. לכן מדווחים גם גודל אפקטEffect size: של קרמר, V = √(χ² / (N × (k − 1))), כש־k הוא הקטן מבין מספר השורות ומספר העמודות. V נע בין 0 ל־1. בטבלה של 2 × 2 הוא מקדם פי. אצלנו V = .24.

בפרקים הקודמים ראינו שערך p לא אומר כמה האפקט גדול. בחי בריבוע רואים את זה בצורה הכי ישירה. נכפיל את כל השכיחויות בטבלה שלנו פי 2, כאילו בדקנו 400 תלמידים עם אותם אחוזים בדיוק:

Nאחוזי המתנדביםχ²pV
הנתונים שלנו20036.5%, 54.9%, 64.0%11.61.003.24
כל תא פי 240036.5%, 54.9%, 64.0%23.21< .001.24

אותו קשר בדיוק, אבל χ² כפול, וערך p קטן בהרבה. כל פער O − E גדל פי 2, הריבוע שלו פי 4, והמכנה E רק פי 2. לכן χ² גדל באותו יחס כמו המדגם. במדגם ענק גם קשר זניח יוצא מובהק. כדי לדעת כמה הקשר חזק, צריך מדד שלא תלוי ב־N.

V = √χ² × (k − 1)     k = הקטן מבין מספר השורות ומספר העמודות

זה V של קרמר. מחלקים את χ² ב־N, ומבטלים בכך את ההשפעה של גודל המדגם. ומחלקים גם ב־k − 1, כדי ש־V יהיה תמיד בין 0 (אין קשר) ל־1 (קשר מושלם), בכל גודל של טבלה. בטבלה שלנו יש 3 שורות ו־2 עמודות. הקטן הוא 2, ולכן k − 1 = 1:

V = √(11.606 / (200 × 1)) = √0.0580 = .24

בטבלה של 2 × 2 תמיד k − 1 = 1, והמדד נקרא מקדם פי, = √(χ² / N). מקדם פי הוא בעצם מקדם המתאם של פירסון מפרק 15, כשמחשבים אותו על שני משתנים שמקודדים 0 ו־1. למשל, המתאםCorrelation בין ההתנדבות בתחילת השנה להתנדבות בסופה הוא r = .33, ובדיוק כך יוצא גם φ מטבלת השילוב שלהם.

איך יודעים אם V גדול? לכהן יש סימני דרך, והם תלויים ב־k − 1:

k − 1קטןבינוניגדול
1 (כולל 2 × 2).10.30.50
2.07.21.35
3.06.17.29

אצלנו k − 1 = 1, ו־V = .24 נמצא בין קטן לבינוני. בחינוך, הבדל של כמעט 28 נקודות אחוז בהתנדבות בין הביקורת לתוכנית המשולבת הוא לא מעט. כמו תמיד, אלה סימני דרך, לא חוק (פרק 19).

הסיפור המלא: למה הסימנים משתנים עם k?

גודל האפקטEffect size שכהן עצמו הגדיר לחי בריבוע הוא מדד אחר, w של כהן: w = √(χ² / N), עם 0.10, 0.30 ו־0.50. בטבלה גדולה, w יכול להיות גדול מ־1, ולכן קרמר חילק גם ב־k − 1. אבל החלוקה הזו מקטינה את V בטבלאות גדולות, ולכן גם סימני הדרך שלו קטנים יותר: מחלקים את סימני הדרך של w ב־√(k − 1). למשל, .30 / √2 = .21. ועוד דבר: φ בטבלה של 2 × 2 יכול להיות שלילי, כי הוא מתאם בין שני משתנים מקודדים. SPSS מציג אותו עם סימן, לפי סדר הקודים.JASP מציג אותו לפי סדר הרמות של המשתנים.באקסל, CORREL על שתי עמודות של 0 ו־1 נותן אותו עם סימן. הסימן תלוי רק בדרך שבה קודדו את הקטגוריות. את הכיוון קוראים מהאחוזים.

מעבדה: חי בריבוע, נצפה מול מצופה. ארבע טבלאות מקובץ המחקר שלנו. בכל תא: נצפה, צפוי, והתרומה לחי בריבוע.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו "קבוצה × התנדבות אחרי". השוו את התרומות לחישוב שעשינו ביד. איזו שורה תורמת הכי הרבה?
  2. הכפילו את כל ששת המספרים. מה קרה ל־χ², לערך p, ל־V ולגרף האחוזים?
  3. בחרו "מגדר × התנדבות אחרי". האם יש קשר? כמה פעמים צריך להכפיל את כל התאים עד שהקשר יוצא מובהק, ומה V אז?
בדיקת התשובה

1. אותם מספרים: 3.44 ו־3.24 בביקורת, 2.42 ו־2.28 במשולבת. השורה של הביקורת תורמת הכי הרבה. 2. χ² מוכפל ל־23.21, ערך p יורד מתחת ל־.001, ו־V נשאר .241. גם הגרף לא משתנה: האחוזים זהים. 3. לא: χ²(1) = 0.53, p = .468, V = .051. כדי לעבור את 3.84 צריך להכפיל בערך פי 8 (1,600 תלמידים), ו־V עדיין .051, קשר זניח. מובהק לא אומר חשוב.

בדקו את עצמכם3 שאלות

1.בטבלת שילוב של 3 × 3 עם 200 נבדקים התקבל χ² = 18. מהו V של קרמר?

2.למה מדווחים על V של קרמר, ולא מסתפקים ב־χ² ובערך p?

3.בטבלה של 2 × 2 עם 90 תלמידים התקבל χ² = 8.10. חשבו את מקדם פי, והעריכו את עוצמת הקשר.

משתנה אחד מול התפלגות ידועה: חי בריבוע לטיב התאמה

לפעמים יש משתנה שמי אחד, ורוצים לדעת אם ההתפלגות שלו במדגם מתאימה להתפלגות שנקבעה מראש: אחוזים ידועים מהאוכלוסייה, או חלוקה שווה. השכיחות הצפויה היא האחוז הצפוי כפול N, החישוב של χ² זהה, ו־df = k − 1, כש־k הוא מספר הקטגוריות.

עד עכשיו היו שני משתנים, ושאלנו אם יש ביניהם קשר. אבל לחי בריבוע יש גרסה שנייה, למשתנה אחד. היא עונה על שאלה שהכרנו במבחן zz test ובמבחן t למדגם בודדOne-sample t test: האם המדגם מתאים לאוכלוסייה מסוימת? רק שכאן המשתנה שמי, ובמקום ממוצע משווים התפלגות של קטגוריות. זה מבחן חי בריבוע לטיב התאמה.

דוגמה מתחוםRange ההתפתחות. לפי תיאוריית ההתקשרות של מרי איינסוורת׳, לכל ילד יש סגנון התקשרות אחד מתוך שלושה: בטוח, נמנע או חרד. נניח, לצורך הדוגמה, שבאוכלוסייה 55% בטוחים, 25% נמנעים ו־20% חרדים. חוקרת דגמה 40 ילדים במעון אחד. האם ההתפלגות במעון שונה מזו שבאוכלוסייה?

דוגמה פתורה: סגנונות התקשרות
בטוחנמנעחרדסה״כ
האחוז באוכלוסייה55%25%20%100%
צפוי, E.55 × 40 = 22.25 × 40 = 10.20 × 40 = 840
נצפה, O16141040
O − E−6420
(O − E)² / E36 / 22 = 1.63616 / 10 = 1.6004 / 8 = 0.5003.736
χ² = 1.636 + 1.600 + 0.500 = 3.74
df = 3 − 1 = 2 שלוש קטגוריות
3.74 < 5.99,   p = CHISQ.DIST.RT(3.74, 2) = .154

מסקנה: לא דוחים. אין מספיק עדות לכך שההתפלגות במעון שונה מזו שבאוכלוסייה. שימו לב: ההפרשים מסתכמים לאפס, כמו שאמרנו, ולכן מעלים בריבוע.

למה כאן df = k − 1? כי N קבוע. אם ידוע שמתוך 40 ילדים 16 בטוחים ו־14 נמנעים, לא צריך לשאול כמה חרדים: 10. רק שתי קטגוריות חופשיות.

ומאיפה באים האחוזים הצפויים? מתיאוריה, מנתונים ארציים, או מחלוקה שווה. למשל, במחקר שלנו יש 96 בנים ו־104 בנות. האם זה שונה מחלוקה של חצי־חצי? הצפוי הוא 100 ו־100, ו־χ² = 16/100 + 16/100 = 0.32, עם דרגת חופש אחת: p = .572. החלוקה מתאימה לחצי־חצי.

שימו לב להיגיון ההפוך. במבחן לטיב התאמה, השערת האפס היא שההתפלגות מתאימה. לכן "לא דחינו" פירושו שלא מצאנו סטייה, ולא שהוכחנו התאמה. כמו במבחן לויןLevene's test בפרק 21.

הסיפור המלא: חי בריבוע כמבחן נורמליות

טיב התאמה עובד מול כל התפלגות, גם מול הנורמלית. מחלקים את הציונים לקטגוריות, כמו בהיסטוגרמהHistogram (פרק 9). מחשבים איזה אחוז מהשטח של התפלגות נורמליתNormal distribution, עם הממוצע וסטיית התקן של המדגם, נופל בכל קטגוריה (פרק 14). כופלים ב־N ומקבלים שכיחויות צפויות. ואז χ² כרגיל. כאן השערת האפס היא שההתפלגות נורמלית, ולכן רוצים לא לדחות.

שתי הערות. ראשית, כשהממוצע וסטיית התקן נאמדים מהמדגם, משלמים על כל אחד מהם דרגת חופש נוספת: df = k − 1 − 2. שנית, Shapiro-Wilk ו־Kolmogorov-Smirnov מפרק 12 אינם מבחני חי בריבוע. ההיגיון דומה, השוואה בין מה שיש למה שמצפים, אבל החישוב שונה. ובמשתנה עם שתי קטגוריות בלבד, כמו בנים ובנות, חי בריבוע לטיב התאמה נותן כמעט אותה תוצאה כמו בדיקת פרופורציה בעזרת הקירוב הנורמלי.

עצרו ונסו

רכזת החינוך החברתי מניחה ש־120 תלמידי השכבה מתחלקים שווה בשווה בין ארבעה חוגים. בפועל נרשמו: ספורט 38, אמנות 34, מדע 28, מוזיקה 20. האם החלוקה שונה מחלוקה שווה? (α = .05)

בדיקת התשובה
E = 120 / 4 = 30 בכל חוג
χ² = (8² + 4² + 2² + 10²) / 30 = (64 + 16 + 4 + 100) / 30 = 184 / 30 = 6.13
df = 4 − 1 = 3,   ערך קריטי 7.81,   p = .105

לא דוחים: 6.13 קטן מ־7.81. ההבדלים בין החוגים יכולים להיות מקריים. כשכל השכיחויות הצפויות שוות, אפשר לחבר את ריבועי ההפרשים ולחלק פעם אחת.

בדקו את עצמכם3 שאלות

1.חוקר בודק אם התלמידים מתחלקים שווה בשווה בין שש מגמות. כמה דרגות חופש יש במבחן חי בריבוע לטיב התאמה?

2.לפי נתונים ארציים (מדומים), 50% מהתלמידים מגיעים לבית הספר ברגל, 30% בהסעה ו־20% ברכב פרטי. בבית ספר אחד נשאלו 60 תלמידים: 24 ברגל, 22 בהסעה, 14 ברכב. האם בית הספר שונה מההתפלגות הארצית? חשבו את χ² וערך p.

3.מה השערת האפס במבחן חי בריבוע לטיב התאמה?

הנחות המבחן, ומה עושים כשהן לא מתקיימות

כל נבדק נספר פעם אחת, בתא אחד. מריצים על שכיחויות, לא על אחוזים. והשכיחויות הצפויות לא קטנות מדי: בטבלה של 2 × 2 כולן 5 לפחות, ובטבלה גדולה יותר לא יותר מ־20% מהתאים מתחת ל־5, ואף אחד מתחת ל־1. אם לא: מאחדים קטגוריות, או משתמשים במבחן פישר המדויקFisher's exact test.

הנחהלמהאם היא לא מתקיימת
כל נבדק נספר פעם אחת, בתא אחד, והתצפיות בלתי תלויותהחישוב מניח שכל ספירה היא אדם נפרדאם אותם אנשים נמדדו פעמיים: מבחן אחר (מקנמר, בהמשך הסעיף)
הקטגוריות זרות וממצותכל נבדק שייך לקטגוריה אחת בדיוקמוסיפים קטגוריה "אחר", או מגדירים מחדש
שכיחויות, לא אחוזיםχ² תלוי ב־N. על אחוזים, N "נעלם"חוזרים לספירות
שכיחויות צפויות לא קטנות מדיהקירוב להתפלגות חי בריבוע נשבר בתאים קטניםמאחדים קטגוריות, מגדילים מדגם, או מבחן פישר המדויקFisher's exact test

שכיחויות צפויות, לא נצפות

זו הנחת השכיחות הצפויה המינימליתMinimum expected count assumption, וזו ההנחה שהכי קל לפספס. היא על השכיחויות הצפויות, לא על הנצפות. תא שבו נספרו 2 נבדקים יכול להיות בסדר גמור, אם הצפוי בו 7. ולהפך: תא עם 9 נצפים יכול להיות בעייתי, אם הצפוי 3. לכן תמיד מחשבים את הצפויות מהשוליים, ובודקים אותן. הכללים המקובלים:

SPSS עושה את הבדיקה בשבילכם: מתחת לטבלת Chi-Square Tests כתוב כמה תאים, ואיזה אחוז, עם שכיחות צפויה מתחת ל־5.JASP מוסיף הערה מתחת לטבלת המבחן כשיש תאים עם שכיחות צפויה מתחת ל־5. כדי לראות את הצפויות עצמן, מסמנים Expected בלשונית Cells.באקסל בודקים בעצמכם: =MIN(BF8:BG10) על טבלת הצפויות נותן את הקטנה ביותר, ו־=COUNTIF(BF8:BG10,"<5") סופר כמה תאים מתחת ל־5. בטבלה שלנו, הצפויה הקטנה ביותר היא 24.7. אין בעיה.

מה עושים כשהשכיחויות הצפויות קטנות?

דוגמה: כשחי בריבוע ופישר לא מסכימים

בפיילוט בכיתה אחת, 8 תלמידים השתתפו בסדנה קצרה, ו־8 לא. אחר כך בדקו מי התנדב לעזור.

התנדבולא התנדבוסה״כ
בסדנה628
בלי סדנה268
סה״כ8816

כל השכיחויות הצפויות הן 8 × 8 / 16 = 4, כולן מתחת ל־5. אם מריצים בכל זאת חי בריבוע, מקבלים χ²(1) = 4.00, p = .046, "מובהק". מבחן פישר המדויק נותן p = .132. לא מובהק. במדגם כזה הקירוב של חי בריבוע אופטימי מדי, וכאן הוא היה מוביל למסקנה שגויה. המסקנה הנכונה: 75% מול 25% זה הבדל מעניין, אבל 16 תלמידים לא מספיקים כדי לשלול מקריות.

החישוב ביד

פישר שואל: אם 8 המתנדבים היו מתחלקים באקראי בין שתי הקבוצות, מה ההסתברות שלפחות 6 מהם ייפלו בקבוצת הסדנה? מספר הדרכים לבחור 8 תלמידים מתוך 16 הוא 12,870. מספר הדרכים לקבל בדיוק 6 מתנדבים בסדנה: לבחור 6 מתוך 8 המתנדבים, וגם 2 מתוך 8 הלא־מתנדבים.

P(6) = C(8,6) × C(8,2) / C(16,8) = 28 × 28 / 12870 = 784 / 12870 = .0609
P(7) = C(8,7) × C(8,1) / 12870 = 64 / 12870 = .0050
P(8) = 1 / 12870 = .0001
חד־צדדי: (784 + 64 + 1) / 12870 = 849 / 12870 = .066
דו־צדדי: 2 × .066 = .132 ההתפלגות כאן סימטרית, כי כל השוליים 8

באקסל: =1-HYPGEOM.DIST(5, 8, 8, 16, TRUE) נותן את החד־צדדי, .066. כלומר: 1 פחות ההסתברות לקבל 5 מתנדבים או פחות בקבוצת הסדנה.

הסיפור המלא: מקנמר, ייטס, ותלמידים באותה כיתה

אותם תלמידים פעמיים. במחקר שלנו ההתנדבות נמדדה פעמיים אצל אותם תלמידים. אפשר לבנות טבלת שילוב של vol_pre מול vol_post: 76 לא התנדבו בשתי הפעמים, 55 התנדבו בשתיהן, 48 התחילו "לא" וסיימו "כן", ו־21 להפך. חי בריבוע על הטבלה הזו (χ²(1) = 21.37, p < .001, φ = .33) עונה על שאלה אחת: האם מי שהתנדב בהתחלה נוטה להתנדב גם בסוף? כן. אבל הוא לא עונה על השאלה אם ההתנדבות עלתה. לזה צריך מבחן לנתונים מזווגים, כמו בפרק 21. מבחן מקנמרMcNemar's test מסתכל רק על מי שהשתנה: χ² = (48 − 21)² / (48 + 21) = 729 / 69 = 10.57, p = .001. יותר תלמידים עברו מ"לא" ל"כן" מאשר להפך.

תיקון ייטסContinuity correction. בטבלה של 2 × 2, SPSS מדפיס גם שורה בשם Continuity Correction.ב־JASP אפשר לסמן בלשונית Statistics את Χ² continuity correction.באקסל אין לו פונקציה, ומי שרוצה מחסיר 0.5 מכל פער מוחלט לפני ההעלאה בריבוע. זה תיקון של פרנק ייטס (1934), שמקטין כל פער ב־0.5 לפני ההעלאה בריבוע, כי ספירות הן מספרים שלמים והתפלגות חי בריבוע רציפה. התיקון שמרני מדי, והיום ממליצים לרוב להשתמש בחי בריבוע הרגיל, של פירסון, כשהשכיחויות הצפויות מספיקות, ובמבחן פישר כשלא.

תלמידים באותה כיתה. הנחת אי־התלות קשה במיוחד במחקרים בבתי ספר. התנדבות היא התנהגות חברתית: אם חבר מתנדב, גם אני. ובמחקר שלנו הקבוצה היא בית ספר שלם. תלמידים מאותה כיתה דומים זה לזה יותר משני תלמידים אקראיים, ולכן יש בנתונים פחות מידע ממה ש־200 ספירות נפרדות מרמזות. ערך p האמיתי כנראה גדול יותר מ־.003. איך מתחשבים בזה, נלמד בפרק 36.

עצרו ונסו

בטבלה של 2 × 2 עם 60 תלמידים, סכומי השורות הם 50 ו־10, וסכומי העמודות 42 ו־18. בתא הקטן ביותר נספרו 6 תלמידים. האם אפשר להריץ חי בריבוע?

בדיקת התשובה
E = 10 × 18 / 60 = 3 השורה הקטנה כפול העמודה הקטנה

לא. השכיחות הצפויה בתא אחד היא 3, מתחת ל־5. זה שנספרו בו 6 לא משנה: הכלל הוא על הצפויות. בטבלה של 2 × 2 מריצים במקום זאת את מבחן פישר המדויק.

בדקו את עצמכם3 שאלות

1.בטבלה של 3 × 3 יש שני תאים עם שכיחות צפויה מתחת ל־5: האחת 3.2 והשנייה 4.1. כל השאר מעל 5. מה נכון?

2.באיזה מצב מתאים במיוחד מבחן פישר המדויק?

3.בשאלון נשאלו 50 מורות "באילו אמצעים את משתמשת בשיעור?", והן יכלו לסמן כמה תשובות. חוקר ספר את כל הסימונים, 130 בסך הכול, ובנה טבלה של ותק × אמצעי. מה הבעיה בהרצת חי בריבוע על הטבלה?

שימוש חשוב: האם הקבוצות היו דומות בהתחלה?

כשהקבוצות לא הוגרלו ברמת התלמיד, בודקים אם הן דומות במשתני הרקע. אצלנו הקבוצות דומות בהתנדבות לפני התוכנית, במגדר ובהשכלת ההורים. הבדל לא מובהק לא מוכיח שהקבוצות זהות, אבל הוא מחזק את הפירוש של ההבדל בסוף.

במחקר שלנו הוגרלו בתי ספר, לא תלמידים (פרק 7). לכן אין ערובה שהקבוצות דומות. אם בקבוצת התוכנית היו מלכתחילה יותר מתנדבים, ההבדל בסוף השנה לא היה אומר הרבה. חי בריבוע הוא הכלי הרגיל לבדוק את זה במשתנים שמיים:

משתנה רקעביקורתעקיפהמשולבתהמבחן
התנדבו בתחילת השנה33.8%43.1%38.7%χ²(2, N = 200) = 1.14, p = .565, V = .08
בנות52.7%51.0%52.0%χ²(2, N = 200) = 0.04, p = .982, V = .01
הורה עם תואר אקדמי72.2%57.1%53.4%χ²(6, N = 194) = 7.16, p = .306, V = .14

בשלושת המשתנים אין הבדל מובהק. בהשכלת ההורים, שעליה שאלנו בפרק 12, יש בקבוצת הביקורת יותר הורים אקדמאים, אבל ההבדל לא גדול מכדי להיות מקרי. המבחן הורץ על ארבע רמות ההשכלה, ולכן df = (3 − 1) × (4 − 1) = 6. ששת התלמידים עם ערך 99, "לא ידוע", הוצאו מהניתוח, ולכן N = 194.

ועכשיו אפשר לחזור לשאלת הפתיחה בביטחון גדול יותר. בתחילת השנה אחוזי ההתנדבות היו דומים, p = .565. בסוף השנה הם שונים, p = .003. ההבדל נוצר במהלך השנה.

זהירות: "לא מובהק" אינו "שקול"

החי בריבוע של ההשכלה לא מובהק, אבל ההבדל בין 72% ל־53% אינו קטן. עם 200 תלמידים, למבחן אין הרבה עוצמה לגלות הבדלים בינוניים בטבלה של 12 תאים. לכן גם כשאין הבדל מובהק, מסתכלים על האחוזים ועל V, וזוכרים את ההבדל כשמפרשים את התוצאות. ובכל מקרה, גם שקילות בכל המשתנים שמדדנו לא אומרת כלום על משתנים שלא מדדנו. רק הגרלה של תלמידים הייתה מבטיחה את זה.

בדקו את עצמכם3 שאלות

1.בבדיקה אם הקבוצות דומות בהתחלה, יצא p = .306 בהשכלת ההורים. מה נכון לומר?

2.בעמודה parent_edu יש 6 תלמידים עם ערך 99 (לא ידוע). מה היה קורה אילו בנינו את טבלת השילוב בלי להוציא אותם?

3.למה במחקר שלנו חשוב לבדוק שהקבוצות היו דומות בהתנדבות כבר בתחילת השנה?

בתוכנה: קבוצה והתנדבות

עכשיו נריץ את המבחן על קובץ המחקר: group בשורות, vol_post בעמודות. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות. המספרים זהים בשלוש התוכנות. אחרי מבחן האי־תלות תמצאו גם את מבחן טיב ההתאמה, על המגדר.

חי בריבוע לאי־תלות

בקובץ, group בעמודה D ו־vol_post בעמודה BC, בשורות 2 עד 201. BC היא העמודה האחרונה, ולכן נבנה את הטבלאות מימין לה, מעמודה BE.

  1. טבלת הנצפות. בתאים BE2, BE3, BE4 מקלידים את קודי הקבוצות: 0, 1, 2. בתאים BF1 ו־BG1 את קודי ההתנדבות: 0, 1. בתא BF2: =COUNTIFS($D$2:$D$201, $BE2, $BC$2:$BC$201, BF$1), וגוררים עד BG4. הפונקציה סופרת שורות שעומדות בשני התנאים יחד. סימני הדולר שומרים את הטווחים, את עמודת הקודים ואת שורת הכותרות.
  2. השוליים. בתא BH2: =SUM(BF2:BG2), וגוררים עד BH4. בתא BF5: =SUM(BF2:BF4), וגוררים עד BH5. ב־BH5 צריך לצאת 200.
  3. טבלת הצפויות. בתא BF8: =$BH2*BF$5/$BH$5, וגוררים עד BG10. סכום השורה כפול סכום העמודה, חלקי N.
  4. ערך p. =CHISQ.TEST(BF2:BG4, BF8:BG10) נותן 0.0030. הפונקציה מקבלת את הנצפות ואת הצפויות, ומחזירה ישר את ערך p, לא את χ².
  5. χ² עצמו. =SUMPRODUCT((BF2:BG4-BF8:BG10)^2/BF8:BG10) נותן 11.61. ואז =CHISQ.DIST.RT(11.61, 2) נותן שוב 0.003, ו־=CHISQ.INV.RT(0.05, 2) את הערך הקריטי, 5.99.
  6. V של קרמר. =SQRT(11.61/(200*1)) נותן 0.24.

BE1:BH10

BEBFBGBH
101Total
20472774
31232851
42274875
5Total97103200
8035.8938.11
9124.73526.265
10236.37538.625
שורות 2–4
השכיחויות הנצפות. שורה לכל קבוצה, עמודה לכל תשובה.
שורות 8–10
השכיחויות הצפויות. הסכומים שלהן זהים לסכומי הנצפות.
CHISQ.TEST
מחזירה ערך p בלבד: .003. את דרגות החופש היא קובעת לבד מגודל הטבלה.

אפשר לבנות את טבלת הנצפות גם בלי נוסחאות, בטבלת ציר (פרק 9): group ב־Rows, vol_post ב־Columns, ו־id ב־Values עם Count. באותה טבלת ציר, Show Values As > % of Row Total נותן את אחוזי ההתנדבות בכל קבוצה.

  1. Analyze > Descriptive Statistics > Crosstabs
  2. Row(s): group. Column(s): vol_post.
  3. בכפתור Statistics מסמנים Chi-square, ו־Phi and Cramer's V.
  4. בכפתור Cells מסמנים Observed ו־Expected תחת Counts, ו־Row תחת Percentages.
  5. אפשר לסמן גם Display clustered bar charts, לגרף של הטבלה. לוחצים OK.

Study group * Volunteered, post Crosstabulation

NoYesTotal
ControlCount472774
Expected Count35.938.174.0
% within Study group63.5%36.5%100.0%
IndirectCount232851
Expected Count24.726.351.0
% within Study group45.1%54.9%100.0%
CombinedCount274875
Expected Count36.438.675.0
% within Study group36.0%64.0%100.0%
TotalCount97103200
% within Study group48.5%51.5%100.0%

Chi-Square Tests

ValuedfAsymptotic Significance (2-sided)
Pearson Chi-Square 111.606a2.003
Likelihood Ratio11.7442.003
Linear-by-Linear Association11.2201<.001
N of Valid Cases200
a. 0 cells (0.0%) have expected count less than 5. The minimum expected count is 24.74. 2

Symmetric Measures

ValueApproximate Significance
Nominal by NominalPhi.241.003
Cramer's V.241.003
N of Valid Cases200
% within Study group
אחוזים בתוך כל קבוצה, בשורה. כאן קוראים את התשובה התיאורית: 36.5%, 54.9%, 64.0%.
1 · Pearson Chi-Square
השורה שקוראים: χ²(2) = 11.61, p = .003.
2 · הערה a
בדיקת ההנחה: אין אף תא עם שכיחות צפויה מתחת ל־5. הקטנה ביותר 24.74.
Likelihood Ratio
סטטיסטי אחר לאותה שאלה. במדגם גדול הוא כמעט זהה ל־Pearson. בספר לא נשתמש בו.
Linear-by-Linear Association
מניח שלקטגוריות יש סדר. לקבוצות שלנו אין סדר, ולכן מתעלמים מהשורה הזו.
Cramer's V
.241. בטבלה שבה אחד המשתנים עם שתי קטגוריות, Phi ו־V שווים.

כך נראה הפלט, בגרסה 28 ואילך.

  1. Frequencies > Contingency Tables
  2. Rows: group. Columns: vol_post. שני המשתנים צריכים להיות מוגדרים Nominal.
  3. בלשונית Statistics: Χ² מסומן מראש. תחת Nominal מסמנים Phi and Cramer's V.
  4. בלשונית Cells: מסמנים Expected תחת Counts, ו־Row תחת Percentages.

Contingency Tables

group01Total
0Count47.0027.0074.00
Expected count35.8938.1174.00
% within row63.5 %36.5 %100.0 %
1Count23.0028.0051.00
Expected count24.7426.2751.00
% within row45.1 %54.9 %100.0 %
2Count27.0048.0075.00
Expected count36.3838.6375.00
% within row36.0 %64.0 %100.0 %
TotalCount97.00103.00200.00

Chi-Squared Tests

Valuedfp
Χ²11.612.003
N200

Nominal

Value
Cramer's V0.24
Expected count
השכיחויות הצפויות, כמו שחישבנו ביד.
Χ²
χ²(2) = 11.61, p = .003. אם יש תאים עם שכיחות צפויה מתחת ל־5, JASP מוסיף הערה מתחת לטבלה.
Cramer's V
גודל האפקטEffect size, .24.

אם המשתנים לא מוגדרים עם תוויות, בטבלה יופיעו הקודים, 0, 1 ו־2. אפשר להוסיף תוויות בלחיצה על כותרת העמודה בקובץ.

חי בריבוע לטיב התאמה: האם חצי בנים וחצי בנות?

  1. gender בעמודה F. בתאים BJ2 ו־BJ3: =COUNTIF($F$2:$F$201, 1) ו־=COUNTIF($F$2:$F$201, 2). מקבלים 96 ו־104.
  2. בתאים BK2 ו־BK3 השכיחויות הצפויות: =200*0.5, כלומר 100 בכל תא. לאחוזים אחרים, כופלים את N באחוז הצפוי.
  3. =CHISQ.TEST(BJ2:BJ3, BK2:BK3) נותן 0.572. כשהטבלה היא עמודה אחת, הפונקציה משתמשת ב־k − 1 דרגות חופש.
  1. Analyze > Nonparametric Tests > Legacy Dialogs > Chi-square
  2. Test Variable List: gender. תחת Expected Values: All categories equal. לאחוזים אחרים בוחרים Values, ומוסיפים את הערכים לפי סדר הקודים.

Gender

Observed NExpected NResidual
Boy96100.0-4.0
Girl104100.04.0
Total200

Test Statistics

Gender
Chi-Square.320a
df1
Asymp. Sig..572
a. 0 cells (0.0%) have expected frequencies less than 5. The minimum expected cell frequency is 100.0.
Residual
נצפה פחות צפוי, בכל קטגוריה.
Asymp. Sig.
ערך p: .572. לא דוחים: החלוקה מתאימה לחצי־חצי.
  1. Frequencies > Multinomial Test
  2. Factor: gender. תחת Test Values: Equal proportions. לאחוזים אחרים בוחרים Expected proportions (χ²), ומקלידים את האחוזים.
  3. מסמנים Descriptives, כדי לראות את השכיחויות הנצפות והצפויות.

Multinomial Test

χ²dfp
H₀ (a)0.321.572
H₀ (a)
השערת האפס, כאן חלוקה שווה. p = .572: לא דוחים.
בדקו את עצמכםשאלה אחת

1.באקסל, =CHISQ.TEST(BF2:BG4, BF8:BG10) החזיר 0.0030. מה המספר הזה?

1.בפלט Chi-Square Tests של SPSS יש כמה שורות. איזו מהן קוראים במבחן חי בריבוע לאי־תלות על הקבוצה וההתנדבות?

1.ב־JASP, באיזה ניתוח מריצים מבחן חי בריבוע לאי־תלות?

1.באקסל, כתבו נוסחה שבודקת אם 96 הבנים ו־104 הבנות מתאימים לחלוקה של 45% בנים ו־55% בנות. הנצפות בתאים BJ2:BJ3. מה תקלידו בתאים BK2 ו־BK3, ומה הנוסחה למבחן?

1.ב־SPSS, איך מריצים מבחן חי בריבוע לטיב התאמה על gender, מול 45% בנים ו־55% בנות? ומה יוצא?

1.ב־JASP, איך מריצים מבחן חי בריבוע לטיב התאמה על gender, מול 45% בנים ו־55% בנות? ומה יוצא?

איך מדווחים

קודם האחוזים, כדי שהקורא יבין מה נמצא, ואחריהם המבחן: χ² עם דרגות החופש ו־N בסוגריים, ערך p, ו־V. הסימנים χ², p ו־V נכתבים באות נטויה.

נמצא קשר מובהק בין קבוצת המחקר לבין ההתנדבות בסוף השנה, בעוצמה בין קטנה לבינונית. שיעור המתנדבים היה 36.5% בקבוצת הביקורת, 54.9% בתוכנית העקיפה ו־64.0% בתוכנית המשולבת, χ²(2, N = 200) = 11.61, p = .003, V = .24. בתחילת השנה לא נמצא הבדל מובהק בין הקבוצות (33.8%, 43.1% ו־38.7%), χ²(2, N = 200) = 1.14, p = .565.

ובטיב התאמה: "מספר הבנים (96) והבנות (104) לא היה שונה באופן מובהק מחלוקה שווה, χ²(1, N = 200) = 0.32, p = .572." ואם השתמשתם במבחן פישר המדויק, כותבים זאת במפורש, למשל: "מבחן פישר המדויק, p = .132".

טעויות נפוצות

בדקו את עצמכם

סיכום

E = (סכום השורה × סכום העמודה) / N
χ² = Σ (O − E)² / E,   df = (R − 1)(C − 1),   בטיב התאמה df = k − 1
V = √(χ² / (N(k − 1))),   φ = √(χ² / N)

מונחים חדשים

טבלת שילובשכיחויות שוליותשכיחות נצפיתשכיחות צפויההסטטיסטי חי בריבועהתפלגות חי בריבועמבחן חי בריבוע לאי־תלותמבחן חי בריבוע לטיב התאמהV של קרמרמקדם פיהנחת השכיחות הצפויה המינימליתמבחן פישר המדויק

שאלות לדוגמה, עם פתרונות

  1. לכל מחקר, בחרו מבחן ונמקו במשפט אחד. א. האם שיעור התלמידים שעוברים בגרות במתמטיקה שונה בין שלושה בתי ספר? ב. האם התפלגות השפות המדוברות בבית בכיתה מסוימת שונה מהתפלגותן בעיר? ג. האם יש קשר בין מספר שנות הוותק של מורות לבין ציון השחיקה שלהן? ד. אותם 40 תלמידים נשאלו בספטמבר וביוני אם הם אוהבים לקרוא, כן או לא. האם שיעור האוהבים עלה?

    בדיקת התשובה

    א. חי בריבוע לאי־תלות: שני משתנים שמיים, בית ספר ועבר או לא עבר, בטבלה של 3 × 2. ב. חי בריבוע לטיב התאמה: משתנה שמי אחד, מול התפלגות ידועה. ג. מתאם פירסון (פרק 15): שני המשתנים כמותייםQuantitative variable. את המובהקות שלו נלמד בפרק הבא. ד. לא חי בריבוע רגיל: אותם תלמידים נמדדו פעמיים, וכל תלמיד היה נספר פעמיים. מבחן לנתונים מזווגים, כמו מבחן מקנמרMcNemar's test, שמסתכל על מי שהשתנה.

  2. בסקר של 150 תלמידים, 50 מכל שכבה, נשאלו אם הם משתתפים בחוג ספורט אחרי הלימודים. כיתה ו׳: 30 כן, 20 לא. כיתה ז׳: 25 כן, 25 לא. כיתה ח׳: 15 כן, 35 לא. א. חשבו את השכיחויות הצפויות. ב. חשבו את χ², דרגות החופש וערך p. ג. חשבו את V ופרשו. (α = .05)

    בדיקת התשובה
    כן: 70, לא: 80, N = 150 סכומי העמודות
    Eכן = 50 × 70 / 150 = 23.333,   Eלא = 50 × 80 / 150 = 26.667 א. זהה בכל שכבה, כי בכל שכבה 50
    ו׳: (30 − 23.333)² / 23.333 + (20 − 26.667)² / 26.667 = 1.905 + 1.667
    ז׳: (25 − 23.333)² / 23.333 + (25 − 26.667)² / 26.667 = 0.119 + 0.104
    ח׳: (15 − 23.333)² / 23.333 + (35 − 26.667)² / 26.667 = 2.976 + 2.604
    χ² = 9.375 ≈ 9.38,   df = (3 − 1)(2 − 1) = 2,   p = CHISQ.DIST.RT(9.375, 2) = .009
    V = √(9.375 / (150 × 1)) = √0.0625 = .25

    ב. 9.38 גדול מ־5.99: דוחים. יש קשר בין השכבה להשתתפות בחוג. ג. ההשתתפות יורדת עם הגיל: 60% בכיתה ו׳, 50% בכיתה ז׳, 30% בכיתה ח׳. V = .25, עם k − 1 = 1: קשר בין קטן לבינוני. רוב החי בריבוע מגיע מכיתות ו׳ וח׳.

  3. יועצת בית הספר רשמה את מספר הפניות של תלמידים אליה בכל יום בשבוע, במשך חודש: ראשון 30, שני 22, שלישי 18, רביעי 16, חמישי 14. האם הפניות מתחלקות שווה בין הימים? חשבו את χ², דרגות החופש וערך p, וכתבו מסקנה.

    בדיקת התשובה
    N = 30 + 22 + 18 + 16 + 14 = 100,   E = 100 / 5 = 20 בכל יום
    O − E = 10, 2, −2, −4, −6 הסכום 0, כמו תמיד
    χ² = (100 + 4 + 4 + 16 + 36) / 20 = 160 / 20 = 8.00
    df = 5 − 1 = 4,   ערך קריטי 9.49,   p = CHISQ.DIST.RT(8, 4) = .092

    לא דוחים: 8.00 קטן מ־9.49. אמנם ביום ראשון היו יותר פניות, אבל עם 100 פניות בלבד, אי אפשר לשלול שזה מקרי. "χ²(4, N = 100) = 8.00, p = .092". שימו לב: אם אותו תלמיד פנה כמה פעמים, הפניות אינן בלתי תלויות, וזו בעיה בהנחות.

  4. האם בנים ובנות שונים בהתנדבות בסוף השנה? קראו את הפלט של SPSS וענו: א. מה אחוז המתנדבים בכל מגדר? ב. איזו שורה בטבלת המבחן קוראים, ולמה? ג. דווחו את התוצאה במשפט, כולל גודל אפקט. ד. למה Phi שלילי?

    Gender * Volunteered, post Crosstabulation (Count)

    NoYesTotal
    Boy445296
    Girl5351104
    Total97103200

    Chi-Square Tests

    ValuedfAsymptotic Significance (2-sided)Exact Sig. (2-sided)Exact Sig. (1-sided)
    Pearson Chi-Square.526a1.468
    Continuity Correctionb.3401.560
    Likelihood Ratio.5261.468
    Fisher's Exact Test.482.280
    Linear-by-Linear Association.5231.470
    N of Valid Cases200
    a. 0 cells (0.0%) have expected count less than 5. The minimum expected count is 46.56. b. Computed only for a 2x2 table

    Symmetric Measures

    ValueApproximate Significance
    Nominal by NominalPhi-.051.468
    Cramer's V.051.468
    בדיקת התשובה
    בנים: 52 / 96 = 54.2%,   בנות: 51 / 104 = 49.0% א. אחוזים בתוך כל מגדר
    Emin = 96 × 97 / 200 = 46.56 בדיקה של הערה a

    ב. Pearson Chi-Square. השכיחויות הצפויות גדולות (הקטנה 46.56), ולכן אין צורך בפישר. Continuity Correction הוא תיקון ייטס, שמרני מדי. כאן כל השורות מסכימות: לא מובהק.

    ג. "לא נמצא קשר מובהק בין מגדר להתנדבות בסוף השנה. 54.2% מהבנים ו־49.0% מהבנות התנדבו, χ²(1, N = 200) = 0.53, p = .468, φ = .05." קשר זניח.

    ד. בטבלה של 2 × 2 SPSS מחשב את φ כמתאםCorrelation בין שני המשתנים, לפי הקודים. ככל שהמגדר "עולה" מ־1 (בן) ל־2 (בת), ההתנדבות קצת יורדת, ולכן הסימן שלילי. את הכיוון קוראים מהאחוזים, ובדיווח כותבים את הערך המוחלט.

  5. במחקר על 30 תלמידים בכיתה אחת נבדק הקשר בין מגדר לצרכים מיוחדים. בנים: 9 ללא צרכים מיוחדים, 3 עם לקות למידה, 4 עם הפרעת קשב (16). בנות: 12 ללא, 1 עם לקות למידה, 1 עם הפרעת קשב (14). א. האם אפשר להריץ חי בריבוע על הטבלה כמו שהיא? ב. אחדו את שתי קטגוריות הצרכים המיוחדים ובדקו שוב. ג. מה עושים?

    בדיקת התשובה
    סכומי העמודות: ללא 21, לקות למידה 4, הפרעת קשב 5
    בנים: 16 × 21 / 30 = 11.2,   16 × 4 / 30 = 2.13,   16 × 5 / 30 = 2.67
    בנות: 14 × 21 / 30 = 9.8,   14 × 4 / 30 = 1.87,   14 × 5 / 30 = 2.33
    4 מתוך 6 תאים מתחת ל־5: 67% א. הרבה מעל 20%
    אחרי איחוד: צרכים מיוחדים 9. בנים: 16 × 9 / 30 = 4.8,   בנות: 14 × 9 / 30 = 4.2 ב. טבלה של 2 × 2

    א. לא. ארבעה מתוך ששת התאים עם שכיחות צפויה מתחת ל־5. ב. גם אחרי האיחוד, שני תאים מתחת ל־5, ובטבלה של 2 × 2 כל התאים צריכים להיות 5 לפחות. ג. מבחן פישר המדויק על הטבלה המאוחדת: p = .118. לא מובהק. 43.8% מהבנים ו־14.3% מהבנות עם צרכים מיוחדים, הבדל לא קטן, אבל בכיתה אחת של 30 תלמידים אין מספיק מידע. (אילו הרצנו חי בריבוע בכל זאת, היינו מקבלים χ²(1) = 3.09, p = .079.)

  6. שני מחקרים בדקו את הקשר בין השתתפות בתוכנית מנטורינג (כן או לא) לבין סיום התיכון (כן או לא). חוקרת א׳ דגמה 50 תלמידים וקיבלה χ²(1) = 3.20. חוקר ב׳ דגם 500 תלמידים וקיבל χ²(1) = 9.00. א. מה ערך p בכל מחקר? ב. באיזה מחקר הקשר חזק יותר? ג. אילו חוקרת א׳ הייתה דוגמת 100 תלמידים, עם אותם אחוזים בדיוק, מה היה יוצא?

    בדיקת התשובה
    א׳: p = CHISQ.DIST.RT(3.2, 1) = .074,   ב׳: p = CHISQ.DIST.RT(9, 1) = .003
    א׳: φ = √(3.20 / 50) = √0.064 = .25,   ב׳: φ = √(9.00 / 500) = √0.018 = .13
    אותם אחוזים, N כפול: χ² = 2 × 3.20 = 6.40,   p = .011,   φ = √(6.40 / 100) = .25

    א. רק המחקר של חוקר ב׳ מובהק. ב. דווקא אצל חוקרת א׳ הקשר חזק כמעט פי 2: φ = .25 מול .13. המחקר של ב׳ מובהק בגלל המדגם הגדול. ג. χ² מוכפל, הקשר הופך מובהק, ו־φ לא משתנה. זו בדיוק הסיבה שמדווחים תמיד גם גודל אפקט, ושתוצאה לא מובהקת במדגם קטן אינה "אין קשר".

תרגול עם הנתונים

קובץ המחקר: 200 תלמידים, 55 משתנים. משתני ההתנדבות (vol_pre, vol_post) מקודדים 0 = לא, 1 = כן. ערך 99 מסמן נתון חסרMissing value בהשכלת ההורים ובמספר האחים, וצריך להוציא אותו לפני שבונים טבלה.

הקבצים עצמם, care_school.csv ומילון המשתנים, נמצאים גם בתיקיית data בחבילת הספר.

  1. האם יש קשר בין מגדר להתנדבות בתחילת השנה (vol_pre)?
    בדיקת התשובה

    לא. 39.6% מהבנים ו־36.5% מהבנות התנדבו, χ²(1, N = 200) = 0.20, p = .658, φ = .03. כל השכיחויות הצפויות מעל 36.

  2. האם בשלוש הקבוצות יש אותו שיעור של תלמידי כיתה ד׳ ו־ה׳ (grade)?
    בדיקת התשובה

    אין הבדל מובהק: תלמידי כיתה ה׳ הם 29.7% בביקורת, 43.1% בתוכנית העקיפה ו־30.7% במשולבת, χ²(2, N = 200) = 2.87, p = .238, V = .12. שימו לב שהשכבה נקבעת לפי כיתות שלמות, ולכן "תלמידים" כאן אינם באמת תצפיות בלתי תלויות.

  3. במדגם 133 תלמידי כיתה ד׳ ו־67 תלמידי כיתה ה׳. האם זה שונה מחלוקה שווה בין השכבות? ולמה המבחן הזה לא מעניין במיוחד?
    בדיקת התשובה

    שונה מאוד: χ²(1, N = 200) = 21.78, p < .001. אבל זה לא ממצא: החוקרים בחרו חמש כיתות ד׳ ושלוש כיתות ה׳. מבחן טיב התאמה שימושי רק כשיש סיבה אמיתית לצפות להתפלגות מסוימת.

  4. בנו טבלת שילוב של vol_pre מול vol_post, וחשבו גם את המתאם של פירסון בין שני המשתנים. מה הקשר בין φ ל־r? והאם הטבלה הזו עונה על השאלה אם ההתנדבות עלתה?
    בדיקת התשובה

    χ²(1, N = 200) = 21.37, p < .001, φ = .33, ו־r = .33, אותו מספר. מי שהתנדב בהתחלה נטה להתנדב גם בסוף: 72.4% לעומת 38.7%. אבל זה קשר, לא שינוי. כדי לבדוק אם ההתנדבות עלתה צריך מבחן לנתונים מזווגים. מבחן מקנמר: 48 עברו מ"לא" ל"כן" ו־21 להפך, χ²(1) = 10.57, p = .001.

בפרק הבא: מקדם פי הוא בעצם מתאם. בפרק 15 חישבנו מתאמים ותיארנו אותם, אבל לא שאלנו אם הם גדולים מכדי להיות מקריים. בפרק 24 נבדוק השערות על מקדם המתאם של פירסון, ונראה איך לקרוא מטריצת מתאמיםCorrelation matrix.

מקורות: Cochran, W. G. (1954). Some methods for strengthening the common χ² tests. Biometrics, 10(4), 417–451. · Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Erlbaum. · Fisher, R. A. (1922). On the interpretation of χ² from contingency tables, and the calculation of P. Journal of the Royal Statistical Society, 85(1), 87–94. · Pearson, K. (1900). On the criterion that a given system of deviations from the probable in the case of a correlated system of variables is such that it can be reasonably supposed to have arisen from random sampling. Philosophical Magazine, 50(302), 157–175. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y · Yates, F. (1934). Contingency tables involving small numbers and the χ² test. Supplement to the Journal of the Royal Statistical Society, 1(2), 217–235.