סטטיסטיקה מ־0 עד 100בטאתוכנהעומק

חלק ג: מהמדגם לאוכלוסייה · פרק 25

איזה מבחן? מפת דרכים ראשונה

בכל פרק עד עכשיו למדנו מבחן אחד, והכותרת של הפרק כבר אמרה לכם במה להשתמש. במחקר אמיתי אין כותרת: יש קובץ נתונים ויש שאלה. בפרק הזה נאסוף את כל מה שלמדנו לעץ החלטהDecision tree אחד, ונתרגל את הצעד שקודם לכל חישוב: לבחור את המבחן הנכון.

שאלת הפתיחה

קיבלתם את קובץ המחקר ושש שאלות מהמנהלת. איך יודעים איזה מבחן מתאים לכל אחת?

האם בנות לחוצות יותר מבנים כשהמורה שואלת אותן שאלה? האם בתוכנית המשולבת יותר תלמידים התנדבו לעזור? האם תלמידים קשובים יותר מרוצים יותר מהחיים? האם הקשר עם המורה השתפר בתוכנית העקיפה? האם החרדה של התלמידים שלנו שונה מאמצע הסולם? והאם השינוי בחרדה שונה בשלוש הקבוצות? שש שאלות על אותו מחקר, וכמעט לכל אחת מבחן אחר. בסוף הפרק תדעו לבחור את המבחן לכל אחת, ולהסביר למה.

בסוף הפרק תוכלו

שלוש שאלות לפני שבוחרים מבחן

לפני כל ניתוח שואלים שלוש שאלות. מה שואלים: הבדל או קשר? באיזה סולם נמדד המשתנה התלוי: שמי, סדר, או רווח ומנה? ומה מבנה הנתונים: כמה קבוצות או מדידות, והאם אותם אנשים נמדדו יותר מפעם אחת? רק בסוף בודקים את ההנחות של המבחן שנבחר.

המטרה של הפרק הזה היא לא שתזכרו בעל פה עשרה מבחנים. המטרה היא שתהיה לכם מפה. מבחן זוכרים באמת רק אחרי שמשתמשים בו פעמיים או שלוש במחקר משלכם, בעבודה סמינריונית או בתזה. עד אז, מספיק לדעת איפה הוא נמצא במפה, ולחזור אליו כשצריך.

המפה בנויה על שלוש שאלות, תמיד באותו סדר.

1. מה שואלים: הבדל או קשר?

כמעט כל שאלה בסטטיסטיקה שייכת לאחת משתי משפחות. שאלת הבדל: האם קבוצה שונה מערך ידוע, האם שתי קבוצות שונות זו מזו, או האם אותם אנשים השתנו בין שתי מדידות. שאלת קשר: האם שני משתנים "הולכים יחד", כמו קשיבות ושביעות רצון.

כדי לענות, מזהים קודם את המשתנה התלוי: מה מדדנו, מה התוצאה (פרק 5). בשאלת הבדל יש גם משתנה שמחלק לקבוצות, כמו מגדר או קבוצת מחקר, או משתנה של זמן, לפני ואחרי.

2. באיזה סולם נמדד המשתנה התלוי?

בפרק 6 הכרנו ארבעה סולמות: שמי, סדר, רווח ומנה. מבחינה סטטיסטית אין הבדל בין רווח למנה, ולכן נשארות שלוש משפחות. הסולם קובע מה מותר לחשב:

3. מה מבנה הנתונים?

כמה קבוצות או מדידות יש? קבוצה אחת מול ערך ידוע, שתיים, או שלוש ויותר? אם יש שתיים: האם אלה אותם אנשים, או זוגות טבעיים, או קבוצות של אנשים שונים (פרק 21)? ואם משווים קבוצה אחת לערך ידוע: האם סטיית התקן באוכלוסייה, σ, ידועה?

אחרי שלוש השאלות כבר יש מבחן מועמד. רק אז שואלים שאלה רביעית: האם ההנחות שלו מתקיימות? אם לא, עוברים לחלופה. נחזור לזה בסעיף 5.

כדי לראות כמה השאלה, ולא המשתנה, קובעת את המבחן, הנה המשתנה הכי מוכר שלנו, החרדה, בשש שאלות שונות:

השאלההבדל או קשרסולם ומבנההמבחן
האם החרדה של 200 התלמידים שונה מ־2.5, אמצע הסולם?הבדלרווח · קבוצה אחת מול ערך, σ לא ידועהt למדגם בודד (פרק 20)
האם בנות חרדות יותר מבנים?הבדלרווח · שתי קבוצות בלתי תלויותIndependent samplest למדגמים בלתי תלויים (פרק 21)
האם החרדה ירדה בתוכנית העקיפה?הבדלרווח · אותם תלמידים פעמייםt למדגמים תלויים (פרק 21)Dependent samples
האם בנות לחוצות יותר מבנים, לפי הפריט הבודד "אני לחוץ/ה כשהמורה שואלת אותי שאלה" (1 עד 4)?הבדלסדר (פריט בודד) · שתי קבוצות בלתי תלויותמאן־ויטני (פרק 22)
האם תלמידים חרדים יותר קשובים פחות?קשרשני משתנים בסולם רווחמתאם פירסון (פרקים 15 ו־24)
האם השינוי בחרדה שונה בשלוש הקבוצות?הבדלרווח · שלוש קבוצותניתוח שונות (פרק 26)One-way ANOVA

אותו משתנה, שישה מבחנים שונים. המבחן נקבע לפי השאלה ולפי מבנה הנתונים, ולא לפי שם המשתנה.

הסיפור המלא: שאלת הקשר מכילה את שאלת ההבדל

השאלה "האם בנים מעשנים יותר מבנות?" נשמעת כמו שאלת הבדל. אבל אפשר לנסח אותה גם כך: "האם יש קשר בין מגדר לעישון?". וכך גם "האם בנות חרדות יותר מבנים?" היא בעצם שאלה על הקשר בין מגדר לחרדה. כלומר, שאלת הקשר כללית יותר, והיא מכילה בתוכה את שאלת ההבדל. מכאן נובע משהו מפתיע, שנראה בחלק ד: כל המבחנים של משפחת ההבדלים, כולל מבחן t וניתוח שונות, הם מקרים פרטיים של רגרסיה, שהיא הכלי של משפחת הקשרים (פרק 30).

ועוד עיקרון שכדאי לזכור מפרק 6: את הסולם קובעת המדידה, לא התכונה. לחץ אפשר למדוד ב"כן או לא" (שמי), בדירוג 1 עד 5 (סדר), או ברמת הקורטיזול ברוק (מנה). ותמיד אפשר לרדת בסולם, למשל להפוך ציון לקבוצות "גבוה" ו"נמוך", אבל אף פעם לא לעלות. לכן כדאי לתכנן את המדידה בסולם הגבוה ביותר שאפשר: בירידה בסולם מאבדים מידע ועוצמה.

עצרו ונסו

לכל שאלה, ענו על שלוש השאלות: הבדל או קשר? איזה משתנה תלויDependent variable ובאיזה סולם? ומה מבנה הנתונים?

  1. האם ההרגשה בכיתה (clim_post) של תלמידי כיתה ד׳ שונה מזו של תלמידי כיתה ה׳?
  2. האם יש קשר בין מספר האחים (siblings) לבין החרדה לפני התוכנית?
בדיקת התשובה

1. הבדל. המשתנה התלוי הוא ההרגשה בכיתה, ממוצע של 12 פריטים: סולם רווחInterval scale. השכבה מחלקת לשתי קבוצות של ילדים שונים: בלתי תלויות. המועמד: מבחן t למדגמים בלתי תלוייםIndependent-samples t test.

2. קשר. שני המשתנים כמותייםQuantitative variable: מספר אחים הוא סולם מנהRatio scale, והחרדה סולם רווח. המועמד: מתאם פירסוןPearson correlation coefficient. אבל זהירות: ב־siblings הערך 99 מסמן נתון חסרMissing value, וצריך להגדיר אותו כחסר לפני החישוב. ואם יש כמה משפחות גדולות במיוחד, שהן ערכים קיצונייםOutlier, כדאי לשקול ספירמן.

בדקו את עצמכם4 שאלות

1.בשאלה "האם תלמידים שישנים יותר שעות מקבלים ציונים גבוהים יותר במבחן?", מה המשתנה התלוי?

2.פריט בודד בשאלון: "כמה את/ה נהנה/ית בבית הספר?", מ־1 (בכלל לא) עד 5 (מאוד). באיזה סולם הוא נמדד?

3.האם יש הבדל בין סולם רווח לסולם מנה, כשבוחרים מבחן?

4.מורה אומרת: "החרדה היא משתנה כמותי, ולכן תמיד בודקים אותה במבחן t". מה תענו לה?

עץ ההחלטה

העץ מתחיל בשאלה "הבדל או קשר?". בענף ההבדלים שואלים על הסולם, על מספר הקבוצות ועל התלות ביניהן. בענף הקשרים שואלים על הסולם של שני המשתנים. כל ענף מסתיים במבחן ובפרק שבו למדנו אותו. ענפים של שלוש קבוצות ויותר, או של כמה מנבאים, מובילים לחלק ד.

מתחילים למעלה, עונים על כל שאלה, ויורדים בענף המתאים עד שמגיעים למבחן. ליד כל מבחן כתוב הפרק שבו למדנו אותו. מבחנים במסגרת מקווקוות שייכים לחלק ד, ונלמד אותם בהמשך.

מסגרת מלאה: נלמד עד עכשיו. מסגרת מקווקוות: חלק ד. את המפה המלאה, לכל הספר, נבנה בפרק 41.

שימו לב לשלוש מלכודות שהעץ עוזר להימנע מהן. הראשונה: "קשר" בין משתנה שמי, כמו מגדר, למשתנה כמותי, כמו חרדה, הוא שאלת הבדל, והוא הולך למבחן t ולא למתאםCorrelation. השנייה: השוואת שכיחויות בין קבוצות, למשל שיעור המתנדבים בשלוש הקבוצות, היא חי בריבוע ולא מבחן t, כי המשתנה התלוי שמי. והשלישית: לפני שבוחרים בין t לבין מבחן על דירוגים, בודקים את ההנחות, ולא את התוצאה.

הסיפור המלא: מה לא נכנס לעץ

העץ כולל רק את מה שלמדנו עד עכשיו. כמה מבחנים מוכרים נשארו בחוץ. המבחן הבינומי בודק משתנה עם שתי קטגוריות בלבד, למשל אם שיעור הבנים בבית ספר שונה מחצי. בספר נשתמש במקומו בחי בריבוע לטיב התאמה, שנותן כמעט אותה תוצאה. ליתר דיוק, הוא זהה לקירוב הנורמלי של המבחן הבינומי, ובמדגם קטן מאוד הגרסה המדויקת עדיפה. מבחן פרידמן הוא החלופה הא־פרמטרית כשאותם אנשים נמדדו שלוש פעמים ויותר בסולם סדר. ועוד דבר: כשאותם אנשים נמדדים פעמיים במשתנה שמי, למשל "התנדב או לא" בתחילת השנה ובסופה, חי בריבוע לאי־תלות לא מתאים, כי התצפיות לא בלתי תלויות. לזה יש מבחן מיוחד, מבחן מקנמרMcNemar's test, שהכרנו בקצרה בפרק 23.

מעבדה: איזה מבחן? עונים על שאלות קצרות, ומגיעים למבחן, לפרק שבו נלמד ולפונקציה באקסל.פתיחה בחלון נפרד
משימות למעבדה
  1. עברו על העץ עם השאלה "האם הקשיבות של התלמידים בתוכנית המשולבת עלתה מלפני התוכנית לאחריה?". לאיזה מבחן הגעתם, ובאיזו פונקציה באקסל?
  2. עכשיו עם "האם שיעור הבנות שונה בשלוש הקבוצות?". באיזו תשובה לשאלה הראשונה צריך לבחור, ולמה?
  3. מצאו במעבדה שני מסלולים שמגיעים לאותה פונקציה באקסל, אבל למבחנים שונים. מה מבדיל ביניהם?
בדיקת התשובה

1. הבדל, שתי מדידות, אותם תלמידים, וההנחות מתקיימות (75 תלמידים): מבחן t למדגמים תלויים, פרק 21. באקסל: T.TEST מסוג 1. 2. המשתנה התלוי, מגדר, הוא שמי, ומשווים שכיחויות בין קבוצות. במעבדה בוחרים "קשר בין שני משתנים", ואז "שניהם שמיים": חי בריבוע לאי־תלות, פרק 23. 3. למשל וילקוקסון למדגמים תלויים ומאן־ויטני: בשניהם RANK.AVG ו־SUMIF. ההבדל הוא במבנה הנתונים: במזווגים מדרגים את ההפרשים של כל זוג, ובקבוצות נפרדות מדרגים את כל הציונים יחד. גם חי בריבוע לאי־תלות וחי בריבוע לטיב התאמה מגיעים שניהם ל־CHISQ.TEST, אבל השכיחויות הצפויות מחושבות בכל אחד אחרת.

בדקו את עצמכם3 שאלות

1.לפי עץ ההחלטה: שאלת הבדל, משתנה תלוי בסולם רווח, שתי קבוצות של אנשים שונים, ההנחות מתקיימות, ומבחן לוין לא מובהק. לאן מגיעים?

2.חוקרת משווה את שיעור הילדים שמגיעים לבית הספר ברגל בשתי שכונות. איזה מבחן מתאים לפי העץ?

3.בענף הקשרים בעץ, השילוב "משתנה אחד שמי, משתנה אחד כמותי" מפנה חזרה לענף ההבדלים. למה?

ענף ההבדלים: מ־z ועד Welch

משתנה תלוי בסולם רווח: קבוצה מול ערך ידוע, z אם σ ידועה ו־t אם לא. אותם אנשים פעמיים: t למדגמים תלויים. שתי קבוצות נפרדות: t לבלתי תלויים, ולוין מחליט בין Student ל־Welch. מדגם קטן ומוטה, או סולם סדר: וילקוקסון למזווגים, ומאן־ויטני לקבוצות נפרדות.

רוב השאלות במחקר חינוכי הן שאלות הבדל על משתנה כמותי. כל המבחנים בענף הזה בנויים באותו היגיון, שהכרנו בפרק 18: אות חלקי רעש. במונה ההבדל שמצאנו, ובמכנה טעות התקןStandard error (), כמה ההבדל הזה היה משתנה במקרה. ההבדל בין המבחנים הוא רק במה משווים, ואיך מחשבים את הרעש.

המבחןמה משוויםסטטיסטי המבחןדרגות חופשגודל אפקט
z (פרק 18)ממוצע מול μ0, σ ידועהz = (M − μ0) / (σ / √n)איןd = (M − μ0) / σ
t למדגם בודד (פרק 20)ממוצע מול μ0, σ לא ידועהt = (M − μ0) / (SD / √n)n − 1d = (M − μ0) / SD
t למדגמים תלויים (פרק 21)ממוצע ההפרשים מול 0t = MD / (SDD / √n)n − 1d = MD / SDD
t לבלתי תלויים, Student (פרק 21)שני ממוצעים, שונויות שוותt = (M1 − M2) / SEn1 + n2 − 2d = (M1 − M2) / SDpooled
t לבלתי תלויים, Welch (פרק 21)שני ממוצעים, שונויות שונותכמו Student, וכל קבוצה עם השונות שלהבנוסחה מיוחדת, לרוב לא מספר שלםd
וילקוקסון למדגמים תלויים (פרק 22)דירוגי ההפרשים, חיוביים מול שלילייםT, ובמדגם גדול zאיןrrb = (T+ − T−) / (T+ + T−)
מאן־ויטני (פרק 22)הדירוגים בשתי הקבוצות, בדירוג משותףJoint rankingU, ובמדגם גדול zאיןrrb = (U2 − U1) / (n1n2)

z או t?

השאלה היחידה כאן היא אם σ ידועה. זה קורה בעיקר במבחנים עם נורמות ארציות, כמו מבחן אינטליגנציה (μ = 100, σ = 15). כמעט בכל מחקר אחר σ לא ידועה, ומעריכים אותה מסטיית התקן של המדגם. ולכן t. ככל שהמדגם גדל, שני המבחנים מתקרבים.

מזווגים או בלתי תלויים?

המבחן הקטן מפרק 21: האם אפשר לחבר כל שורה בקבוצה אחת לשורה מסוימת בקבוצה השנייה? אותו תלמיד לפני ואחרי, ילד והורה, תאומים: מזווגים. בנים ובנות, כיתה ד׳ וכיתה ה׳, תוכנית וביקורת: בלתי תלויים. הטעות כאן יקרה: מבחן לבלתי תלויים על נתונים מזווגים מאבד הרבה עוצמה, כמו שראינו בפרק 21.

Student או Welch?

רק בקבוצות בלתי תלויות. הכלל של הספר: מבחן לוין לא מובהק, Student. מובהק, Welch. התוכנה מריצה את לוין לבד, ליד מבחן t. באקסל אין מבחן לוין, ואפשר להסתפק בכלל האצבע: אם השונות הגדולה חלקי הקטנה גדולה מ־2, Welch.

מתי עוברים לדירוגים?

כשהמשתנה התלוי בסולם סדר, או כשהמדגם קטן וההתפלגות מוטה בבירור (פרק 22). במדגם גדול, 30 ומעלה בכל קבוצה, מבחן t עמידRobustness לסטיות מנורמליות, ובדרך כלל נשארים איתו.

דוגמה מהמחקר: הקשר עם המורה, בנים מול בנות

האם יש הבדל בין בנים לבנות בתחושה שהמורה זמינה ומקבלת, לפני התוכנית (teach_pre, ממוצע של 17 פריטים, 1 עד 7)?

שלוש השאלות: הבדל. סולם רווח. שתי קבוצות של ילדים שונים. מכאן מבחן t למדגמים בלתי תלויים, ונשאר להחליט על הגרסה.

קבוצהnMSD
בנים965.401.03
בנות1045.660.85

מבחן לוין מובהק, F(1, 198) = 4.63, p = .033: אצל הבנים הפיזורMeasure of dispersion גדול יותר. לכן Welch: t(185.2) = 1.90, p = .058, d = 0.27. ההבדל לא מובהק.

ומה אומר כלל האצבע? יחס השונויותVariance ratio הוא 1.026² / 0.852² = 1.45, פחות מ־2, ולכן לפי כלל האצבע Student: t(198) = 1.92, p = .056. שתי הדרכים מגיעות לאותה מסקנה, כי הקבוצות קרובות בגודלן.

דוגמה מהמחקר: פריט בודד, סולם סדר

הפריט "אני לחוץ/ה כשהמורה שואלת אותי שאלה" (a7) נענה בארבע דרגות: 1 אף פעם, 2 לפעמים, 3 לעיתים קרובות, 4 תמיד. האם בנות לחוצות יותר מבנים?

זה פריט בודד, בסולם סדר: ההבדל בין "לפעמים" ל"לעיתים קרובות" לא בהכרח שווה להבדל בין "לעיתים קרובות" ל"תמיד". לכן לא מחשבים ממוצע, אלא מדרגים. שתי קבוצות נפרדות: מאן־ויטני.

החציוןMedian אצל הבנים הוא 2 ("לפעמים"), ואצל הבנות 3 ("לעיתים קרובות"). הדירוג הממוצע של הבנים 89.92, ושל הבנות 110.27. ההבדל מובהק: U = 3976, z = −2.62, p = .009. הבנות מדווחות על יותר לחץ כשהמורה פונה אליהן.

עצרו ונסו

משרד החינוך פרסם נורמה ארצית לשביעות רצון מהחיים, בשאלון שלנו: μ = 5.0, σ = 1.0. בכיתה 4, בתוכנית העקיפה, 29 תלמידים, והממוצע לפני התוכנית 5.30. איזה מבחן מתאים? חשבו אותו.

בדיקת התשובה

הבדל, סולם רווח, קבוצה אחת מול ערך ידוע, ו־σ ידועה מהנורמה: מבחן z.

SE = 1.0 / √29 = 1.0 / 5.385 = 0.1857
z = (5.2966 − 5.0) / 0.1857 = 1.60 הממוצע המדויק בקובץ: 5.2966
p = 2 · (1 − NORM.S.DIST(1.60, TRUE)) = .110

p = .110, גדול מ־.05: לא דוחים. שביעות הרצון בכיתה הזו לא שונה באופן מובהק מהנורמה. אילו הנורמה הייתה כוללת רק ממוצע, בלי σ, היינו משתמשים בסטיית התקן של הכיתה, ובמבחן t למדגם בודד.

בדקו את עצמכם4 שאלות

1.בכיתה של 36 תלמידים, הממוצע במבחן אינטליגנציה הוא 106. לפי הנורמה, μ = 100, σ = 15. איזה מבחן, ומה ערך סטטיסטי המבחןTest statistic?

2.בפלט של מבחן t כתוב df = 172.4. מה אפשר להסיק?

3.בשתי קבוצות נפרדות, סטיית התקן היא 6 בקבוצה אחת ו־3 בשנייה. אתם עובדים באקסל, בלי מבחן לוין. באיזו גרסה של מבחן t תשתמשו?

4.מתי כדאי לעבור ממבחן t למדגמים תלויים למבחן וילקוקסון?

ענף הקשרים, ומשתנים שמיים

שני משתנים בסולם רווח: מתאם פירסון. לפחות אחד בסולם סדר, או ערכים קיצוניים: ספירמן. המובהקות של מתאםCorrelation נבדקת ב־ עם n − 2 דרגות חופש. שני משתנים שמיים: חי בריבוע לאי־תלות, וגודל האפקטEffect size של קרמר. משתנה שמי אחד מול התפלגות צפויה: חי בריבוע לטיב התאמה.

פירסון או ספירמן?

פירסון () מודד קשר קווי בין שני משתנים בסולם רווח או מנה (פרק 15). ספירמן הוא פירסון על הדירוגים: הוא מתאים כשלפחות אחד המשתנים בסולם סדר, כשיש ערכים קיצוניים שמושכים את פירסון, או כשהקשר עולה כל הזמן אבל לא בקו ישר. לפני שבוחרים, מסתכלים על דיאגרמת הפיזור.

בשני המקרים, השאלה אם המתאם מובהק נבדקת במבחן t (פרק 24):

= √( − 2)√(1 − r²)     = n − 2

למשל, בין הקשיבות לשביעות הרצון מהחיים לפני התוכנית (mind_pre, sat_pre), r = .33, ב־200 תלמידים. t(198) = .3311 · √198 / √(1 − .3311²) = 4.94, p < .001. ו־r² = .11: לשני המשתנים 11% שונות משותפתShared variance.

שני משתנים שמיים: חי בריבוע

כשהמשתנה התלוי שמי, אין ממוצע. סופרים כמה תלמידים יש בכל תא של טבלת שילובContingency table, ומשווים לשכיחויות שהיינו מצפים להן אילו לא היה קשר (פרק 23). שני מבחנים שונים נקראים "חי בריבוע", וכדאי לא לבלבל ביניהם:

שתי הנחות חשובות במיוחד: חי בריבוע עובד על שכיחויות, לא על אחוזים ולא על ממוצעים. וכל תלמיד נמצא בתא אחד בלבד, כלומר התצפיות בלתי תלויות.

דוגמה מהמחקר: מי התנדב לעזור?

בסוף השנה נבדק אם כל תלמיד התנדב לעזור, כלומר מילא את טופס ההתנדבות (vol_post: 0 לא, 1 כן, פרק 5). האם שיעור המתנדבים שונה בשלוש הקבוצות?

שלוש השאלות: המשתנה התלוי שמי (כן או לא), והקבוצה שמית. השוואת שכיחויות בין קבוצות היא קשר בין שני משתנים שמיים: חי בריבוע לאי־תלות.

קבוצהלא התנדבהתנדבסך הכולאחוז המתנדבים
ביקורת47277436.5%
עקיפה23285154.9%
משולבת27487564.0%
סך הכול9710320051.5%
בדיקת התשובה: החישוב ביד
E = סכום השורה · סכום העמודה / N השכיחות הצפויה בכל תא, אילו לא היה קשר
ביקורת: 74 · 97 / 200 = 35.89   74 · 103 / 200 = 38.11
עקיפה: 51 · 97 / 200 = 24.74   51 · 103 / 200 = 26.27
משולבת: 75 · 97 / 200 = 36.38   75 · 103 / 200 = 38.63
χ² = Σ (O − E)² / E = 3.439 + 3.239 + 0.122 + 0.115 + 2.416 + 2.275 = 11.61
df = (3 − 1) · (2 − 1) = 2,   p = CHISQ.DIST.RT(11.61, 2) = .003
V = √(11.61 / (200 · 1)) = .24 V של קרמר: מחלקים ב־N כפול (המספר הקטן מבין שורות ועמודות, פחות 1)

מסקנה: χ²(2, N = 200) = 11.61, p = .003, V = .24. יש קשר בין הקבוצה להתנדבות: בתוכנית המשולבת 64% התנדבו, ובביקורת 36.5%. ובתחילת השנה (vol_pre)? אז לא היה הבדל מובהק בין הקבוצות, χ²(2) = 1.14, p = .565. כלומר הקבוצות התחילו דומות.

בוחרים את המבחן לפני שמסתכלים על התוצאה

בין החרדה לקשיבות לפני התוכנית, מתאם פירסון הוא r = −.13, p = .061, ומתאם ספירמן הוא rs = −.16, p = .021. מפתה לדווח את ספירמן, כי הוא "יצא". אבל אם מריצים כמה מבחנים ומדווחים את זה שיצא מובהק, הסיכוי לטעות מסוג ראשוןType I error כבר לא 5%. את המבחן בוחרים לפי השאלה, הסולם והנתונים, לפני שרואים את ערך pp-value. כאן שני המשתנים בסולם רווח, ופירסון הוא הבחירה הטבעית. ומי שהחליט מראש על ספירמן, למשל בגלל ערכים קיצוניים, צריך להסביר למה.

הסיפור המלא: אותם תלמידים, פעמיים, בכן או לא

מה אם רוצים לדעת אם יותר תלמידים התנדבו בסוף השנה מאשר בתחילתה? זה נראה כמו טבלת שילוב: vol_pre מול vol_post. אבל אלה אותם 200 תלמידים, פעמיים. כל תלמיד מופיע בשתי המדידות, והתצפיות לא בלתי תלויות. חי בריבוע לאי־תלות בודק כאן שאלה אחרת: האם מי שהתנדב בהתחלה נוטה להתנדב גם בסוף. וזה כמובן נכון. השאלה על השינוי נמצאת בשני התאים שבהם תלמידים שינו את התשובה: 48 שלא התנדבו בהתחלה והתנדבו בסוף, מול 21 שהפסיקו. את השאלה הזו בודק מבחן מקנמר, שהכרנו בקצרה בפרק 23: χ²(1) = 10.57, p = .001. זה בדיוק הרעיון של מבחן מזווג, בגרסה למשתנה שמי.

בדקו את עצמכם4 שאלות

1.במדגם של 27 תלמידים נמצא מתאם של r = .40 בין זמן הקריאה בבית לבין אוצר המילים. חשבו את t ואת דרגות החופש. האם המתאם מובהק ב־α = .05?

2.בטבלת שילובContingency table של מגדר (2 קטגוריות) מול סוג פעילות אחרי בית הספר (4 קטגוריות), כמה דרגות חופש יש למבחן חי בריבוע לאי־תלותChi-square test of independence?

3.מה ההבדל בין חי בריבוע לאי־תלות לבין חי בריבוע לטיב התאמה?

4.בדיאגרמת פיזורScatter plot של שני משתנים כמותיים, תלמיד אחד רחוק מאוד מכל השאר. איזה מתאם עדיף?

ההנחות: הסינון האחרון

לכל מבחן יש הנחות. החשובה מכולן היא אי־תלות בין התצפיותIndependence of observations, וכפתור בתוכנה לא בודק אותה: היא נובעת ממערך המחקר. נורמליות חשובה בעיקר במדגם קטן. שוויון שונויותHomogeneity of variance חשוב רק ל־Student. בחי בריבוע, שכיחות צפויהExpected frequency של 5 לפחות בכל תא.

אחרי שלוש השאלות יש מבחן מועמד. עכשיו בודקים אם ההנחות שלו סבירות. אם לא, כמעט תמיד יש חלופה, והעץ כבר מראה אותה.

הנחהאילו מבחניםאיך בודקיםאם היא לא מתקיימת
אי־תלות בין התצפיותIndependence of observationsכולםלפי מערך המחקר, לא בתוכנהאותם אנשים פעמיים: מבחן מזווג. תלמידים מקובצים בכיתות: מודלים מעורבים (פרק 36)Linear mixed model
סולם רווח או מנהz, t, פירסוןלפי המשתנה (פרק 6)וילקוקסון, מאן־ויטני, ספירמן
נורמליות, או מדגם גדולt, ומובהקות של פירסוןהיסטוגרמה, הטיה, תרשים Q-Q (פרקים 12, 14)מ־30 ומעלה בכל קבוצה: בדרך כלל ממשיכים. מדגם קטן ומוטה: מבחן על דירוגים
שוויון שונויותHomogeneity of varianceרק t לבלתי תלויים, Studentמבחן לוין, או יחס השונויותWelch
קשר קווי, בלי ערכים קיצוניים חריגיםפירסוןדיאגרמת פיזורספירמן
שכיחות צפויה של 5 לפחות בכל תאExpected frequencyחי בריבועטבלת השכיחויות הצפויותFrequency tableאיחוד קטגוריות, או מבחן פישר המדויק בטבלה 2 × 2 (פרק 23)Fisher's exact test
דוגמה מהמחקר: הנחה שלא מתקיימת, ומה זה משנה

בפרק 21 ראינו שהחרדה ירדה בתוכנית העקיפה, t(50) = 3.55, p < .001. אבל ההתפלגות של 51 ההפרשים מוטה שמאלה: הטיה −0.87, ו־Shapiro-Wilk מובהק (p = .008). האם צריך לעבור לוילקוקסון?

עם 51 תלמידים, משפט הגבול המרכזיCentral limit theorem (פרק 17) עובד בשבילנו, ומבחן t עמיד. ואכן, וילקוקסון למדגמים תלויים נותן את אותה מסקנה: z = −3.31, p < .001. במדגם גדול שני המבחנים כמעט תמיד מסכימים. ההחלטה חשובה באמת במדגם קטן, למשל קבוצה של 12 תלמידים עם הפרש קיצוני אחד או שניים.

הסיפור המלא: כשהגרילו בתי ספר, ולא תלמידים

במחקר שלנו לא הוגרלו תלמידים לקבוצות, אלא בתי ספר. כל קבוצה היא בית ספר אחד, עם שתיים או שלוש כיתות. תלמידים באותה כיתה חולקים מורה, אווירה וחוויות, ולכן הציונים שלהם דומים יותר מציונים של שני תלמידים אקראיים. כלומר, הם לא באמת בלתי תלויים. אם מתעלמים מזה, כאילו יש לנו 200 תצפיות נפרדות, טעות התקן יוצאת קטנה מדי, והסיכוי לטעות מסוג ראשון גדל. במחקרים אמיתיים בבתי ספר משתמשים לכן במודלים שמתחשבים בכיתות ובבתי הספר, מודלים לינאריים מעורבים (פרק 36). בפרקים הבאים נמשיך לנתח את התלמידים כתצפיות נפרדות, כדי ללמוד את הכלים, אבל כדאי לזכור את ההסתייגות הזו כשקוראים את התוצאות.

בדקו את עצמכם3 שאלות

1.איזו הנחה אי אפשר לבדוק בלחיצת כפתור בתוכנה?

2.בטבלת חי בריבוע 2 × 2, השכיחות הצפויה באחד התאים היא 3.2. מה עושים?

3.השוויתם שתי קבוצות, 80 ו־90 תלמידים, במבחן t. Shapiro-Wilk מובהק בשתיהן, אבל ההיסטוגרמות נראות כמעט סימטריות, וההטיה קטנה מ־0.5 בערך מוחלט. מה תעשו?

תרגול: שתים־עשרה שאלות מהמחקר שלנו

הדרך היחידה ללמוד לבחור מבחן היא לתרגל שאלות מעורבבות, בלי לדעת מראש מאיזה פרק הן. לכל שאלה: הבדל או קשר, סולם, מבנה, ורק אז מבחן.

בכל פרק עד עכשיו ידעתם מראש איזה מבחן מתאים, כי כל השאלות היו מאותו פרק. במבחן ובמחקר זה לא כך. לכן כאן השאלות מעורבבות. לכל שאלה, נסו לענות לבד על שלוש השאלות, ורק אחר כך פתחו את הפתרון. שמות המשתנים לקוחים מקובץ המחקר.

עצרו ונסו: איזה מבחן?
  1. האם ההרגשה בכיתה לפני התוכנית (clim_pre) שונה מ־3, אמצע הסולם?
    בדיקת התשובה

    הבדל, סולם רווח, קבוצה אחת מול ערך, σ לא ידועה: t למדגם בודד (פרק 20).

  2. האם הקשר עם המורה (teach_pre, teach_post) השתנה בתוכנית העקיפה?
    בדיקת התשובה

    הבדל, סולם רווח, אותם 51 תלמידים פעמיים: t למדגמים תלויים (פרק 21).

  3. האם שיעור הבנות שונה בשלוש הקבוצות?
    בדיקת התשובה

    המשתנה התלוי, מגדר, שמי, והקבוצה שמית: חי בריבוע לאי־תלות (פרק 23). זו בדיקה חשובה: האם הקבוצות היו דומות לפני התוכנית (פרק 23, סעיף 7).

  4. האם יש קשר בין הקשר עם המורה להרגשה בכיתה, אחרי התוכנית?
    בדיקת התשובה

    קשר בין שני משתנים בסולם רווח: מתאם פירסון, ובדיקת המובהקות שלו (פרקים 15 ו־24). קודם מסתכלים על דיאגרמת הפיזור.

  5. האם יש קשר בין השכלת ההורה (parent_edu: 1 עד 12 שנות לימוד, 2 על־תיכונית, 3 תואר ראשון, 4 תואר שני ומעלה) לבין בעיות הקשב?
    בדיקת התשובה

    קשר. השכלת ההורה היא סולם סדר: יש סדר, אבל המרווחים בין הדרגות לא שווים. לכן מתאם ספירמן (פרקים 15 ו־24). ולפני כן מגדירים את 99 כנתון חסר.

  6. האם בנים ובנות שונים בפריט "אני מפחד/ת שאטעה מול כולם" (a2, 1 עד 4)?
    בדיקת התשובה

    הבדל, פריט בודד בסולם סדר, שתי קבוצות נפרדות: מאן־ויטני (פרק 22).

  7. בכיתה אחת, 14 תלמידים עם הרבה תלונות גופניות השתתפו בקבוצת הרפיה. התלונות נמדדו לפני ואחרי, והתפלגות ההפרשים מוטה מאוד: רוב התלמידים כמעט לא השתנו, ושניים השתפרו מאוד.
    בדיקת התשובה

    הבדל, אותם תלמידים פעמיים, אבל מדגם קטן והתפלגות מוטה: וילקוקסון למדגמים תלויים (פרק 22).

  8. במבחן קשב ממוחשב יש נורמה ארצית לכיתה ד׳: ממוצע 50 וסטיית תקן 10. האם 52 תלמידי כיתה ד׳ בתוכנית המשולבת שונים מהנורמה?
    בדיקת התשובה

    הבדל, קבוצה אחת מול ערך ידוע, ו־σ ידועה: מבחן z (פרק 18).

  9. האם התלמידים מתחלקים שווה בשווה בין ארבע רמות השכלת ההורה?
    בדיקת התשובה

    משתנה אחד, שמתייחסים כאן לרמות שלו כאל קטגוריות, מול התפלגות שקבענו מראש (רבע בכל רמה): חי בריבוע לטיב התאמה (פרק 23).

  10. האם הבנים והבנות שונים בתלונות הגופניות לפני התוכנית (soma_pre)? בדקתם, ומבחן לוין מובהק.
    בדיקת התשובה

    הבדל, סולם רווח, שתי קבוצות נפרדות, ולוין מובהק: t לבלתי תלויים, בגרסת Welch (פרק 21). (בנתונים שלנו לוין דווקא לא מובהק, p = .281, ולכן שם קוראים את Student.)

  11. האם השינוי בקשיבות, אחרי פחות לפני, שונה בין התוכנית העקיפה, התוכנית המשולבת והביקורת?
    בדיקת התשובה

    הבדל, סולם רווח, שלוש קבוצות: ניתוח שונות חד־כיווני (פרק 26). לא שלושה מבחני t, ובסעיף הבא נראה למה.

  12. האם אפשר לנבא את החרדה בסוף השנה מהחרדה בתחילת השנה, מהמגדר ומהקבוצה, יחד?
    בדיקת התשובה

    ניבוי משתנה אחד מכמה משתנים, חלקם שמיים: רגרסיה מרובהMultiple regression, עם משתני דמהDummy variable לקבוצה (פרקים 29 ו־30). זה כבר חלק ד.

ובחזרה לשאלת הפתיחה

שש השאלות של המנהלת, ושישה מבחנים:

  1. האם בנות לחוצות יותר כשהמורה שואלת אותן שאלה? פריט בודד בסולם סדר, שתי קבוצות: מאן־ויטני. כן, p = .009 (סעיף 3).
  2. האם בתוכנית המשולבת יותר תלמידים התנדבו? שני משתנים שמיים: חי בריבוע לאי־תלות. כן, 64% מול 36.5% בביקורת, p = .003 (סעיף 4).
  3. האם תלמידים קשובים יותר מרוצים יותר? קשר בין שני משתנים בסולם רווח: פירסון. כן, r = .33, p < .001 (סעיף 4).
  4. האם הקשר עם המורה השתפר בתוכנית העקיפה? אותם תלמידים פעמיים: t למדגמים תלויים. את התשובה תמצאו בעצמכם, בתרגול עם הנתונים.
  5. האם החרדה שונה מאמצע הסולם? קבוצה אחת מול 2.5, σ לא ידועה: t למדגם בודד. כן, החרדה נמוכה מאמצע הסולם: M = 2.24, t(199) = −7.21, p < .001.
  6. האם השינוי בחרדה שונה בשלוש הקבוצות? שלוש קבוצות: ניתוח שונות. את זה נשאיר לפרק 26.
בדקו את עצמכם3 שאלות

1.האם הקשיבות בסוף השנה (mind_post) שונה בין תלמידי כיתה ד׳ לתלמידי כיתה ה׳?

2.האם יש קשר בין הגיל בשנים (age) לבין הקשיבות לפני התוכנית?

3.כתבו שאלת מחקר משלכם על קובץ המחקר, שהמבחן המתאים לה הוא מאן־ויטני. נמקו.

שלוש קבוצות ויותר, או כמה משתנים: מבט לחלק ד

עם שלוש קבוצות ויותר לא מריצים כמה מבחני t, כי הסיכוי לטעות מסוג ראשון מצטבר: בשלוש השוואות הוא כבר 1 − .95³ = .14. משתמשים בניתוח שונות. כשיש שני גורמים, ניתוח שונות דו־כיווניTwo-way ANOVA. וכשמנבאים משתנה אחד מכמה משתנים, רגרסיה.

במחקר שלנו יש שלוש קבוצות. השאלה המרכזית, אם התוכנית עבדה, היא בעצם השוואה בין שלושתן. למה לא פשוט להריץ שלושה מבחני t: ביקורת מול עקיפה, ביקורת מול משולבת, ועקיפה מול משולבת?

בכל מבחן, הסיכוי לטעות מסוג ראשון הוא = 5%, כלומר 95% לא לטעות. אם מריצים שלושה מבחנים, והשערת האפסNull hypothesis נכונה בכולם, הסיכוי לא לטעות באף אחד הוא .95 · .95 · .95 = .857. כלומר, הסיכוי לטעות לפחות פעם אחת הוא כ־14%, ולא 5%. זו טעות מסוג ראשון מצטברתFamilywise error rate, וככל שיש יותר קבוצות היא גדלה: בארבע קבוצות יש שש השוואות, והיא מגיעה ל־26%.

αמצטברת = 1 − (1 − )m     m = מספר ההשוואות

הפתרון הוא מבחן אחד שמשווה את כל הקבוצות יחד: ניתוח שונות. והוא רק הראשון מהכלים של חלק ד:

השאלהדוגמה מהמחקרהניתוחפרק
שלוש קבוצות ויותר, משתנה תלוי כמותיהאם השינוי בחרדה שונה בשלוש הקבוצות?ניתוח שונות חד־כיווני, ומבחני המשך. בסולם סדר: קרוסקל־וואליסPost hoc tests26
שני משתנים מחלקים יחדהאם ההשפעה של התוכנית שונה אצל בנים ובנות?ניתוח שונות דו־כיווני ואינטראקציהTwo-way ANOVA27
ניבוי מנבא כמותי אחדכמה שביעות הרצון עולה עם כל נקודה בקשיבות?רגרסיה פשוטהLinear regression28
ניבוי מכמה מנבאיםמה מנבא את החרדה בסוף השנה?רגרסיה מרובה29
מנבא שמי ברגרסיהקבוצת המחקר כמנבאמשתני דמה30
תרומה מעבר לבקרההאם הקבוצה מנבאת את הקשיבות בסוף, מעבר לקשיבות בהתחלה?רגרסיה היררכיתHierarchical regression31
קשר שתלוי במשתנה שלישיThird variableהאם הקשר בין חרדה לקשב תלוי בקשר עם המורה?מיתון32
הסיפור המלא: הכול הוא מודל אחד

בפרק 24 ראינו שמבחן t לשתי קבוצות הוא בעצם מבחן של מתאם. בפרק 26 נראה שהוא גם מקרה פרטי של ניתוח שונות: עם שתי קבוצות ערך p זהה, ו־F = t². וניתוח שונות הוא מקרה פרטי של רגרסיה, עם משתני דמה (פרק 30). כלומר, רוב המבחנים בעץ הם גרסאות של מודל אחד, המודל הלינארי הכלליGeneral linear model. אז למה לומדים את כולם? כי הם פשוטים יותר להבנה ולחישוב, כי הם הומצאו בנפרד, בתקופות שונות, וכי כך מדווחים עליהם במאמרים. אבל מי שמבין את ההיגיון המשותף, אות חלקי רעש, ימצא את דרכו גם במבחן שלא ראה מעולם.

בדקו את עצמכם3 שאלות

1.חוקרת הריצה חמש השוואות, כל אחת ב־α = .05. אם השערת האפסNull hypothesis נכונה בכולן, מה הסיכוי שלפחות אחת תצא מובהקת?

2.חוקר רוצה לבדוק אם ההשפעה של התוכנית על החרדה שונה אצל בנים ובנות. איזה ניתוח מתאים?

3.למה עם שלוש קבוצות לא מריצים פשוט שלושה מבחני t?

בתוכנה: איפה נמצא כל מבחן

המפה הזו מסדרת את כל המבחנים לפי התוכנה. אחריה, דוגמה אחת מלאה: שאלת ההתנדבות מסעיף 4. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות.

המבחןבאקסל
zמחשבים z בנוסחה, ואז NORM.S.DIST
t למדגם בודדמחשבים t בנוסחה, ואז T.DIST.2T
t למדגמים תלוייםT.TEST מסוג 1, או Data Analysis: t-Test: Paired Two Sample for Means
t לבלתי תלוייםT.TEST מסוג 2 (Student) או 3 (Welch)
וילקוקסון, מאן־ויטניRANK.AVG ו־SUMIF, ובמדגם גדול קירוב נורמלי עם NORM.S.DISTNormal approximation
חי בריבועCOUNTIFS לטבלה, CHISQ.TEST לערך p
פירסוןCORREL, ולמובהקות t בנוסחה ו־T.DIST.2T
ספירמןRANK.AVG לכל משתנה, ואז CORREL על הדירוגים

הדוגמה: התנדבות בשלוש הקבוצות

  1. הקובץ ממוין לפי group (עמודה D): ביקורת בשורות 2 עד 75, עקיפה 76 עד 126, משולבת 127 עד 201. vol_post היא עמודה BC.
  2. טבלת הנצפות: בתאים BE2:BE4 כותבים 0, 1, 2 (הקבוצות), ובתאים BF1:BG1 כותבים 0, 1 (לא, כן). בתא BF2: =COUNTIFS($D$2:$D$201,$BE2,$BC$2:$BC$201,BF$1), וגוררים עד BG4.
  3. טבלת הצפויות, בתאים BF7:BG9: בתא BF7 =SUM($BF2:$BG2)*SUM(BF$2:BF$4)/200, וגוררים עד BG9.
  4. ערך p: =CHISQ.TEST(BF2:BG4,BF7:BG9). ואת χ² עצמו: =CHISQ.INV.RT(BF11,2), כש־BF11 הוא התא של ערך p.

Chi-square: group × vol_post

Cell01
BF2:BG2Observed, group 04727
BF3:BG3Observed, group 12328
BF4:BG4Observed, group 22748
BF7:BG7Expected, group 035.8938.11
BF8:BG8Expected, group 124.73526.265
BF9:BG9Expected, group 236.37538.625
BF11=CHISQ.TEST(BF2:BG4,BF7:BG9)0.0030
BF12=CHISQ.INV.RT(BF11,2)11.61
BF13=SQRT(BF12/(200*1))0.24
Expected
השכיחויות שהיינו מצפים להן אילו לא היה קשר. הקטנה ביותר 24.74, הרבה מעל 5: ההנחה מתקיימת.
CHISQ.TEST
ערך p ישירות, בלי χ². p = .003.
CHISQ.INV.RT
מחזירה את χ² שמתאים לערך p, עם 2 דרגות חופש: 11.61.
BF13
V של קרמר. בטבלה 3 × 2, המספר הקטן מבין שורות ועמודות הוא 2, ופחות 1 זה 1.
המבחןב־SPSS
zאין חלון מוכן: Descriptives לממוצע, ו־Transform > Compute Variable עם CDF.NORMAL (פרק 18)
t למדגם בודדAnalyze > Compare Means > One-Sample T Test
t למדגמים תלוייםAnalyze > Compare Means > Paired-Samples T Test
t לבלתי תלוייםAnalyze > Compare Means > Independent-Samples T Test (לוין ושתי השורות באותו פלט)
וילקוקסוןAnalyze > Nonparametric Tests > Legacy Dialogs > 2 Related Samples
מאן־ויטניAnalyze > Nonparametric Tests > Legacy Dialogs > 2 Independent Samples
חי בריבוע לאי־תלותAnalyze > Descriptive Statistics > Crosstabs, ובכפתור Statistics: Chi-square, Phi and Cramer's V
חי בריבוע לטיב התאמהAnalyze > Nonparametric Tests > Legacy Dialogs > Chi-square
פירסון, ספירמןAnalyze > Correlate > Bivariate, ומסמנים Pearson או Spearman

הדוגמה: התנדבות בשלוש הקבוצות

  1. Analyze > Descriptive Statistics > Crosstabs. Row(s): group. Column(s): vol_post.
  2. בכפתור Statistics מסמנים Chi-square, ו־Phi and Cramer's V. בכפתור Cells מסמנים, מלבד Observed, גם Expected ו־Row (אחוזים בשורהRow percentage).

Study group * Volunteered, post Crosstabulation

NoYesTotal
ControlCount472774
% within Study group63.5%36.5%100.0%
IndirectCount232851
% within Study group45.1%54.9%100.0%
CombinedCount274875
% within Study group36.0%64.0%100.0%
TotalCount97103200

Chi-Square Tests

ValuedfAsymptotic Significance (2-sided)
Pearson Chi-Square 111.606a2.003
Likelihood Ratio11.7442.003
Linear-by-Linear Association11.2201<.001
N of Valid Cases200

a. 0 cells (0.0%) have expected count less than 5. The minimum expected count is 24.74. 2

Symmetric Measures

ValueApproximate Significance
Nominal by NominalPhi.241.003
Cramer's V.241.003
N of Valid Cases200
1 · Pearson Chi-Square
השורה שקוראים: χ²(2) = 11.61, p = .003. שתי השורות שמתחתיה הן מבחנים אחרים, ולא נשתמש בהן.
2 · הערת השוליים
בודקת את ההנחה: אין תאים עם שכיחות צפויה מתחת ל־5.
% within Study group
אחוז המתנדבים בכל קבוצה. בהם משתמשים כדי לתאר את הקשר במילים.
Cramer's V
גודל האפקטEffect size, .24. בטבלה שאינה 2 × 2 קוראים את V ולא את Phi.
המבחןב־JASP
zT-Tests > One Sample T-Test, ומסמנים Z Test עם סטיית התקן של האוכלוסייה (פרק 18)
t למדגם בודדT-Tests > One Sample T-Test
t למדגמים תלויים, וילקוקסוןT-Tests > Paired Samples T-Test: Student, או Wilcoxon signed-rank
t לבלתי תלויים, מאן־ויטניT-Tests > Independent Samples T-Test: Student, Welch, או Mann-Whitney
חי בריבוע לאי־תלותFrequencies > Contingency Tables
חי בריבוע לטיב התאמהFrequencies > Multinomial Test
פירסון, ספירמןRegression > Correlation, ומסמנים Pearson או Spearman

שימו לב: ב־JASP המבחן הפרמטרי והחלופה שלו נמצאים באותו חלון. נוח, אבל גם מפתה לסמן את שניהם ולבחור את מי ש"יצא". החליטו לפני שאתם מסמנים.

הדוגמה: התנדבות בשלוש הקבוצות

  1. Frequencies > Contingency Tables. Rows: group. Columns: vol_post.
  2. תחת Statistics: χ² מסומן מראש. מסמנים גם Phi and Cramer's V. תחת Cells: Expected, ו־Row percentages.

Contingency Tables

group01Total
0Count472774
% within row63.5 %36.5 %100.0 %
1Count232851
% within row45.1 %54.9 %100.0 %
2Count274875
% within row36.0 %64.0 %100.0 %
TotalCount97103200

Chi-Squared Tests

Valuedfp
Χ²11.612.003
N200

Nominal

Value
Cramer's V0.24
Χ²
סטטיסטי חי בריבוע, עם דרגות החופש וערך p: χ²(2) = 11.61, p = .003.
% within row
אחוז המתנדבים בכל קבוצה: 36.5% בביקורת, 64.0% במשולבת.
Cramer's V
גודל האפקט, .24.
בדקו את עצמכם2 שאלות

1.באקסל, איזו פונקציה מחזירה ישירות את ערך p של מבחן חי בריבוע, מטבלת הנצפות ומטבלת הצפויות?

1.ב־SPSS הרצתם Crosstabs על טבלה 3 × 2. מאיזו שורה בטבלת Chi-Square Tests קוראים את המבחן, ואיזה גודל אפקט מדווחים?

1.ב־JASP, באיזה חלון נמצא מבחן מאן־ויטניMann-Whitney U test?

2.בשאלת ההתנדבות, השכיחות הצפויה הקטנה ביותר היא 24.74. מה זה אומר על ההנחות של חי בריבוע?

טעויות נפוצות

בדקו את עצמכם

סיכום

t = r √(n − 2) / √(1 − r²),   df = n − 2
αמצטברת = 1 − (1 − α)m

מונחים חדשים

עץ החלטהטעות מסוג ראשון מצטברת

שאלות לדוגמה, עם פתרונות

  1. לכל מחקר, בחרו מבחן ונמקו במשפט אחד. א. יועצת שואלת אם יש קשר בין מגמת הלימוד בתיכון (ריאלית, הומניסטית, טכנולוגית) לבין רצון ללמוד באוניברסיטה (כן או לא). ב. 18 מורים דירגו את השחיקה שלהם בתחילת השנה ובסופה, וההתפלגות של ההפרשים מוטה מאוד. ג. האם הציונים במתמטיקה של 120 תלמידים בבית ספר שונים מהממוצע הארצי, 75, כשסטיית התקן הארצית לא פורסמה? ד. האם יש קשר בין מספר הספרים בבית לבין הציון בהבנת הנקרא, אצל 80 תלמידים? ה. האם ממוצע זמן השינה שונה בין תלמידים שמשחקים במחשב בערב לבין תלמידים שלא?

    בדיקת התשובה

    א. שני משתנים שמיים: חי בריבוע לאי־תלות, בטבלת שילוב 3 × 2. ב. אותם מורים פעמיים, מדגם קטן ומוטה: וילקוקסון למדגמים תלויים. ג. קבוצה אחת מול ערך ידוע, ו־σ לא ידועה: t למדגם בודד. ד. שני משתנים בסולם מנה: מתאם פירסון, אחרי שבודקים בדיאגרמת פיזור שאין ערכים קיצוניים, כמו בית עם אלפי ספרים. ה. שתי קבוצות נפרדות, סולם מנה: t לבלתי תלויים, ולוין יחליט בין Student ל־Welch.

  2. בעיר יש ארבעה בתי ספר יסודיים. חוקר השווה את שביעות הרצון של התלמידים בכל זוג בתי ספר, במבחני t נפרדים, כל אחד ב־α = .05. א. כמה מבחנים הריץ? ב. מה הסיכוי שלפחות אחד מהם יצא מובהק, אם בפועל אין שום הבדל בין בתי הספר? ג. מה הייתם מציעים לו?

    בדיקת התשובה
    m = 4 · 3 / 2 = 6 א. מספר הזוגות מתוך ארבעה בתי ספר
    .956 = .735 הסיכוי לא לטעות באף אחד מששת המבחנים
    αמצטברת = 1 − .735 = .265 ב.

    ב. כ־26.5%, ולא 5%. כמעט פעם אחת מכל ארבע, החוקר "ימצא" הבדל שלא קיים. ג. ניתוח שונות חד־כיווני, מבחן אחד שמשווה את ארבעת בתי הספר יחד (פרק 26). רק אם הוא מובהק, בודקים אילו בתי ספר שונים, במבחני המשךPost hoc tests ששומרים על α. דרך פשוטה אחת היא לחלק את α במספר ההשוואות: .05 / 6 = .0083, כלומר כל מבחן נחשב מובהק רק אם p < .0083 (תיקון בונפרוניBonferroni correction, פרק 26).

  3. האם יש קשר בין מגדר להתנדבות בסוף השנה? א. איזה מבחן מתאים? ב. השלימו את החישוב מהטבלה, כולל השכיחויות הצפויות, χ², דרגות החופש וערך p. ג. מה המסקנה?

    לא התנדבהתנדבסך הכול
    בנים445296
    בנות5351104
    סך הכול97103200
    בדיקת התשובה

    א. שני משתנים שמיים: חי בריבוע לאי־תלות.

    E = 96 · 97 / 200 = 46.56,   96 · 103 / 200 = 49.44 בנים
    E = 104 · 97 / 200 = 50.44,   104 · 103 / 200 = 53.56 בנות
    (44 − 46.56)² / 46.56 = 6.5536 / 46.56 = 0.141
    (52 − 49.44)² / 49.44 = 0.133,   (53 − 50.44)² / 50.44 = 0.130,   (51 − 53.56)² / 53.56 = 0.122
    χ² = 0.141 + 0.133 + 0.130 + 0.122 = 0.53,   df = (2 − 1)(2 − 1) = 1
    p = CHISQ.DIST.RT(0.53, 1) = .468 הערך הקריטי: 3.84
    φ = √(0.53 / 200) = .05

    ג. χ²(1, N = 200) = 0.53, p = .468. לא נמצא קשר בין מגדר להתנדבות: 54.2% מהבנים ו־49.0% מהבנות התנדבו. שימו לב שכל הפרשי O − E בטבלה 2 × 2 שווים בערכם המוחלט, 2.56. זה לא מקרה: סכומי השורות והעמודות קבועים, ולכן תא אחד קובע את כל השאר. מכאן גם דרגת חופש אחת.

  4. חוקרת הריצה ב־SPSS את הפלט הבא. א. איזה מבחן היא הריצה, ועל אילו משתנים? ב. אילו מתאמים מובהקים? ג. כתבו משפט דיווח על הקשר בין שביעות הרצון לחרדה, וחשבו את t ואת r². ד. החוקרת שמה לב שהמתאם בין קשיבות לחרדה "כמעט מובהק", הריצה גם ספירמן, וקיבלה p = .021. מה תגידו לה?

    Correlations

    mind_presat_preanx_pre
    mind_prePearson Correlation1.331**-.133
    Sig. (2-tailed)<.001.061
    N200200200
    sat_prePearson Correlation.331**1-.218**
    Sig. (2-tailed)<.001.002
    N200200200
    anx_prePearson Correlation-.133-.218**1
    Sig. (2-tailed).061.002
    N200200200

    **. Correlation is significant at the 0.01 level (2-tailed).

    בדיקת התשובה

    א. מטריצת מתאמי פירסון (פרק 24) בין הקשיבות, שביעות הרצון והחרדה לפני התוכנית. המטריצה סימטרית: כל מתאם מופיע פעמיים, מעל האלכסון ומתחתיו.

    ב. שניים: קשיבות עם שביעות רצון (r = .33, p < .001) ושביעות רצון עם חרדה (r = −.22, p = .002). הקשר בין קשיבות לחרדה לא מובהק (p = .061).

    t = −.218 · √198 / √(1 − .218²) = −.218 · 14.071 / 0.976 = −3.14,   df = 198
    r² = .218² = .048 כ־5% שונות משותפת

    ג. "נמצא מתאם שליליNegative relationship מובהק, חלש, בין שביעות הרצון מהחיים לבין החרדה לפני התוכנית, r(198) = −.22, p = .002: תלמידים מרוצים יותר נטו להיות חרדים פחות."

    ד. שאת המבחן בוחרים לפני שרואים את ערך p, לפי הסולם ולפי דיאגרמת הפיזור. שני המשתנים בסולם רווח, ואם אין ערכים קיצוניים או קשר לא קווי, פירסון הוא המבחן. להריץ מבחן נוסף רק כי הראשון "כמעט יצא" מגדיל את הסיכוי לטעות מסוג ראשון. ואם כבר: r = −.13 הוא קשר חלש מאוד, פחות מ־2% שונות משותפתShared variance, גם אילו היה מובהק.

  5. מנהלת בית הספר של התוכנית המשולבת רוצה לבדוק אם התוכנית עבדה. היא מציעה את התוכנית הבאה: "נבדוק את השינוי בחרדה, אחרי פחות לפני, בשלושה מבחני t: ביקורת מול עקיפה, ביקורת מול משולבת, ועקיפה מול משולבת. כל תלמיד הוא תצפית אחת, ויש לנו 200 תצפיות". מצאו בתוכנית שתי בעיות, הסבירו כל אחת, וחשבו את הסיכוי לטעות מסוג ראשון מצטברת בתוכנית שלה. מה הייתם עושים במקום?

    בדיקת התשובה
    αמצטברת = 1 − .95³ = 1 − .857 = .143
    .05 / 3 = .0167 סף לכל השוואה, אם מתקנים בבונפרוני

    בעיה 1: שלושה מבחנים במקום אחד. הסיכוי לטעות מסוג ראשון לפחות פעם אחת הוא כ־14%. במקום זה: ניתוח שונות חד־כיווני על ציון השינוי, ואחריו מבחני המשך (פרק 26).

    בעיה 2: התלמידים לא באמת בלתי תלויים. הוגרלו בתי ספר, ולא תלמידים, ובכל קבוצה יש בית ספר אחד. תלמידים באותה כיתה חולקים מורה ואווירה. אם מתייחסים אליהם כ־200 תצפיות נפרדות, טעות התקן קטנה מדי, והסיכוי לטעות מסוג ראשון גדל עוד. הדרך המלאה היא מודל שמתחשב בכיתות (פרק 36). ובכל מקרה, כדאי לנסח בזהירות: ההבדל הוא בין בתי ספר, ולא רק בין תוכניות.

תרגול עם הנתונים

בכל שאלה: קודם בחרו מבחן, ונמקו לעצמכם. רק אחר כך הריצו. ערך 99 מסמן נתון חסר ב־parent_edu, ב־siblings ובחלק מהפריטים.

הקבצים עצמם, care_school.csv ומילון המשתנים, נמצאים גם בתיקיית data בחבילת הספר.

  1. האם ההרגשה בכיתה לפני התוכנית (clim_pre) שונה מ־3, אמצע הסולם?
    בדיקת התשובה

    t למדגם בודד: M = 3.47, SD = 0.65, t(199) = 10.26, p < .001, d = 0.73. התלמידים מרגישים בכיתה טוב יותר מאמצע הסולם.

  2. האם הקשר עם המורה (teach_pre, teach_post) השתנה בתוכנית העקיפה (group = 1)?
    בדיקת התשובה

    t למדגמים תלויים: הקשר השתפר, מ־5.74 (SD = 0.89) ל־6.12 (SD = 0.84), t(50) = −4.36, p < .001, d = −0.61. הסימן שלילי כי חיסרנו לפני פחות אחרי. זה הגיוני: בתוכנית העקיפה דווקא המורות התאמנו.

  3. האם בנים ובנות שונים בפריט "אני מפחד/ת שאטעה מול כולם" (a2)?
    בדיקת התשובה

    מאן־ויטני, כי זה פריט בודד בסולם סדר. החציון אצל הבנים 2 ואצל הבנות 3. הדירוג הממוצע: בנים 92.46, בנות 107.92. U = 4220, z = −2.00, p = .046: הבנות מפחדות מעט יותר לטעות מול כולם, וההבדל בקושי מובהק.

  4. האם יש קשר בין השכלת ההורה (parent_edu) לבין בעיות הקשב לפני התוכנית (attn_pre)?
    בדיקת התשובה

    ספירמן, כי השכלת ההורה בסולם סדר. קודם מגדירים את 99 כחסר: נשארים 194 תלמידים. rs = .08, p = .266. אין קשר מובהק. ומה אם שוכחים להגדיר את 99 כחסר? בספירמן ששת התלמידים האלה נחשבים פשוט ל"השכלה הגבוהה ביותר", והתוצאה כמעט לא זזה (rs = .08, p = .289), אבל היא שגויה. בפירסון הנזק היה גדול יותר: הערך 99 רחוק מאוד מכל השאר, והמתאם אפילו מחליף סימן, מ־r = .06 ל־r = −.02.

  5. האם שיעור הבנות שונה בשלוש הקבוצות?
    בדיקת התשובה

    חי בריבוע לאי־תלות, group מול gender: χ²(2, N = 200) = 0.04, p = .982. שיעור הבנות כמעט זהה בשלוש הקבוצות, בין 51% ל־53%. כאן הדמיון נראה בעיקר באחוזים עצמם: ערך p לבדו לא היה מוכיח שהקבוצות שקולותGroup equivalence (פרק 23).

בפרק הבא מתחיל חלק ד: מודלים. נתחיל בענף שנשאר פתוח בעץ, שלוש קבוצות ויותר. נלמד ניתוח שונות חד־כיווני, שבודק את כל הקבוצות במבחן אחד, ונראה שגם הוא בנוי על אות חלקי רעש: השונות בין הקבוצותBetween-groups variance, חלקי השונות בתוכן.

מקורות: Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y