סטטיסטיקה מ־0 עד 100בטאתוכנהעומק

חלק ג: מהמדגם לאוכלוסייה · פרק 24

מובהקות של מתאם

בפרק 15 למדנו לתאר קשר בין שני משתנים: דיאגרמת פיזורScatter plot, מקדם המתאםCorrelation ו־r². אבל כל המתאמים שם תיארו רק את התלמידים שבקובץ. בפרק הזה נשאל את השאלה של חלק ג: האם הקשר קיים גם באוכלוסייה, או שיצא במקרה? נלמד לבדוק השערה על מתאם, לבנות לו רווח סמךConfidence interval, לקרוא מטריצת מתאמיםCorrelation matrix בלי ליפול במלכודת של הרבה מבחנים, ולתכנן כמה נבדקים צריך.

שאלת הפתיחה

בקבוצת הביקורת ובתוכנית המשולבת הקשיבות קשורה לשביעות הרצון מהחיים. בתוכנית העקיפה המתאם הוא רק .14. האם בתוכנית העקיפה אין קשר?

ראינו את המספרים האלה בסוף פרק 15: .38 בקבוצת הביקורת, .14 בתוכנית העקיפה ו־.43 בתוכנית המשולבת. נראה שהקשר בתוכנית העקיפה חלש בהרבה. אבל בתוכנית העקיפה יש רק 51 תלמידים. בסוף הפרק תדעו לבדוק אם כל מתאם מובהק, כמה אפשר לסמוך עליו, והאם שני מתאמים באמת שונים זה מזה. התשובה תפתיע אתכם.

בסוף הפרק תוכלו

מתאם במדגם, מתאם באוכלוסייה

r מתאר את המדגם. את המתאם באוכלוסייה מסמנים באות היוונית (רו). השערת האפסNull hypothesis היא ρ = 0: באוכלוסייה אין קשר לינאריLinear relationship. גם כשהיא נכונה, r במדגם כמעט אף פעם לא יוצא אפס בדיוק, וככל שהמדגם קטן יותר, הוא יכול לצאת רחוק יותר מאפס במקרה.

בפרק 15 מצאנו מתאם של .33 בין הקשיבות לשביעות הרצון מהחיים, אצל 200 התלמידים שבקובץ. האם זה אומר שגם בכל תלמידי כיתות ד׳ ו־ה׳ יש קשר כזה? זו בדיוק השאלה ששאלנו על ממוצעים בפרקים 18 עד 21. אנחנו רואים מדגם, ורוצים לדעת משהו על האוכלוסייה.

הסימון בנוי כמו בממוצעים. הוא הממוצע במדגם, ו־ הוא הממוצע באוכלוסייה. באותו אופן, הוא המתאם במדגם, ו־ρ הוא המתאם באוכלוסייה. אות לטינית למדגם, אות יוונית לאוכלוסייה. והשערת האפסNull hypothesis, כמו תמיד, אומרת "אין כלום": אין קשר.

: ρ = 0     : ρ ≠ 0

מתאם של .90 הוא חזק? תלוי בכמה נקודות. שלוש נקודות יכולות להסתדר במקרה כמעט על קו ישר. מאה נקודות שמסתדרות על קו, כמעט בוודאות לא עשו את זה במקרה. ושתי נקודות? שם המתאם תמיד 1 או −1, כי דרך שתי נקודות עובר תמיד קו ישר. כלומר, השאלה אם מתאם הוא מקרי תלויה גם בגודלו וגם בגודל המדגם.

איך נראה עולם בלי קשר? מערבבים

כדי לבדוק השערה צריך לדעת מה היה קורה אילו השערת האפס הייתה נכונה. במתאם יש דרך פשוטה ויפה לבנות עולם כזה מהנתונים עצמם. משאירים את ציוני הקשיבות במקומם, ומערבבים את ציוני שביעות הרצון בין התלמידים: הציון של נועה עובר לעומר, של עומר לדנה, וכן הלאה. הממוצע וסטיית התקן של כל משתנה לא השתנו בכלל. רק השיוך נהרס: מי שקשוב כבר לא "מחזיק" את שביעות הרצון שלו. בעולם כזה אין שום קשר. מחשבים מתאם. ושוב מערבבים, ושוב מחשבים, 10,000 פעמים.

דוגמה: 10,000 ערבובים של 200 התלמידים
מה מצאנו בערבוביםהמתאם
2.5% מהערבובים נתנו מתאם נמוך מ־−.14
2.5% מהערבובים נתנו מתאם גבוה מ־.14
המתאם הגבוה ביותר מכל 10,000 הערבובים.26
כמה ערבובים הגיעו ל־.33 או יותר, בערך מוחלטאף אחד

המתאמים בעולם בלי קשר מתפזרים סביב אפס. 95% מהם בין −.14 ל־.14. המתאם האמיתי שלנו, .33, רחוק מאוד מכל מה שיוצא בערבוב. לכן לא סביר שהוא מקרי: דוחים את השערת האפס. זה בדיוק ההיגיון של פרק 18. בונים את ההתפלגות של התוצאה בעולם שבו השערת האפס נכונה, ובודקים אם התוצאה שלנו נדירה בה.

ומה קורה במדגם קטן? חמישה תלמידים, שעות קריאה בשבוע (1, 2, 3, 4, 5) וציון במבחן (60, 70, 65, 80, 85). המתאם .91, חזק מאוד. אבל לחמישה ציונים יש רק 120 סדרים אפשריים, ו־8 מהם נותנים מתאם של .91 או יותר, בערך מוחלט. כ־7%. כלומר, עם חמישה תלמידים גם מתאם של .91 יכול לצאת במקרה, יותר מפעם אחת ב־20. עם 200 תלמידים, מתאם של .33 כבר לא.

הסיפור המלא: מבחן תמורות

הערבוב הוא לא רק תרגיל מחשבתי. זה מבחן אמיתי, שנקרא מבחן תמורותPermutation test. ערך pp-value שלו הוא פשוט אחוז הערבובים שנתנו מתאם קיצוני לפחות כמו שלנו. היתרון הגדול: הוא לא מניח שום דבר על צורת ההתפלגות של המשתנים. הוא מניח רק שבעולם של השערת האפס, כל שיוך של ציון לתלמיד סביר באותה מידה.

אז למה לא משתמשים בו תמיד? כי לפני המחשבים אי אפשר היה לערבב 10,000 פעמים. לכן פיתחו נוסחה שנותנת כמעט את אותה תשובה בלי לערבב: מבחן t למתאם, בסעיף הבא. במדגם גדול שתי הדרכים מסכימות כמעט תמיד. במדגם זעיר, כמו חמשת התלמידים, הן יכולות להיות שונות, כי מבחן t נשען על הנחות על צורת ההתפלגות, ומבחן התמורות לא.

עצרו ונסו

חוקר מדד שני משתנים אצל ארבעה ילדים, וקיבל r = .80. "מתאם חזק מאוד", הוא כותב, "ולכן ברור שיש קשר". א. נסחו את השערת האפס ואת ההשערה החלופיתResearch hypothesis. ב. מה תענו לו?

בדיקת התשובה

א. H0: ρ = 0, H1: ρ ≠ 0. ההשערות הן על האוכלוסייה, לא על ארבעת הילדים. ב. עם ארבע נקודות, מתאם גבוה יכול לצאת במקרה בקלות. בסעיף 3 נראה שעם ארבעה נבדקים צריך מתאם של .95 לפחות כדי לדחות את השערת האפס. המתאם עצמו גבוה, אבל אין לנו ראיה מספיקה שהקשר קיים באוכלוסייה.

בדקו את עצמכם3 שאלות

1.מה מסמלת האות היוונית ρ בפרק הזה?

2.כדי לבנות עולם שבו אין קשר, מערבבים את ציוני שביעות הרצון בין התלמידים, ומשאירים את ציוני הקשיבות במקומם. מה משתנה בעקבות הערבוב?

3.סטודנט חישב מתאם בין גובה למשקל אצל שני חברים, וקיבל r = 1. הוא שואל אם המתאם מובהק. מה תענו?

מבחן t למתאם

כשהשערת האפס נכונה, ההתפלגות של r היא התפלגות tt distribution. סטטיסטי המבחןTest statistic הוא t = r√(n − 2) / √(1 − r²), עם df = n − 2. את ערך pp-value מוצאים בהתפלגות t, בדיוק כמו בפרק 20. אותו מתאם יכול להיות מובהק במדגם גדול ולא מובהק במדגם קטן.

בכל מבחן שראינו עד עכשיו, סטטיסטי המבחןTest statistic בנוי אותו דבר: מה שמצאנו, פחות מה שהשערת האפס אומרת, חלקי טעות התקןStandard error. כך גם כאן. מצאנו r, השערת האפס אומרת 0, וטעות התקן של r היא:

r = √1 − r²n − 2      = r − 0SEr = r √(n − 2)√(1 − r²)      = n − 2

כמו בפרק 20, את טעות התקן אומדיםEstimator מהמדגם עצמו, ולכן ההתפלגות היא t ולא נורמלית. מה מגדיל את t? שני דברים. מתאם חזק יותר: r במונה גדל, ו־1 − r² במכנה קטן. ומדגם גדול יותר: √(n − 2) במונה. זו הנוסחה של המשפט "המובהקות תלויה גם בגודל המתאם וגם בגודל המדגם".

למה n − 2?

בפרק 20 ראינו שכל ערך שמחשבים מהנתונים "עולה" דרגת חופש. המתאם מודד עד כמה הנקודות קרובות לקו ישר, וקו ישר נקבע על ידי שני מספרים: איפה הוא חותךIntercept את הציר, ומה השיפועSlope שלו (נכיר אותם ברגרסיה, בפרק 28). לכן משלמים שתי דרגות חופש. ויש דרך לראות את זה בעין: דרך שתי נקודות עובר תמיד קו ישר. שתי הנקודות הראשונות לא מלמדות שום דבר על הקשר, והמידע מתחיל רק מהנקודה השלישית.

דוגמה פתורה: אותו מתאם, שני מדגמים

שתי חוקרות מצאו אותו מתאם, r = .40, בין שעות שינה לבין ציון במבחן קשב. לאחת יש 20 תלמידים, ולשנייה 50. האם המתאם מובהק? ( = .05, דו־צדדי)

n = 20:   t = 0.40 · √18 / √(1 − 0.16) = 0.40 · 4.243 / 0.917 = 1.85,   df = 18
p = T.DIST.2T(1.85, 18) = .081 גדול מ־.05: לא דוחים
n = 50:   t = 0.40 · √48 / √(1 − 0.16) = 0.40 · 6.928 / 0.917 = 3.02,   df = 48
p = T.DIST.2T(3.02, 48) = .004 קטן מ־.05: דוחים

מסקנה: אותו קשר בדיוק, ושתי מסקנות שונות. אצל החוקרת עם 50 התלמידים המתאם מובהק, ואצל זו עם 20 לא. זה לא אומר שהקשר אצלה חלש יותר. זה אומר שעם 20 תלמידים אין מספיק מידע כדי לשלול מקריות. ובשני המחקרים השונות המשותפת זהה: .40² = .16.

דוגמה מהמחקר: קשיבות ושביעות רצון, לפי קבוצה
קבוצהnrtdfp
ביקורת74.383.4472< .001
תוכנית עקיפה51.140.9649.342
תוכנית משולבת75.434.0673< .001
כל התלמידים200.334.94198< .001

בקבוצת הביקורת, בתוכנית המשולבת ובכל התלמידים יחד, המתאם מובהק. בתוכנית העקיפה הוא לא מובהק: t(49) = 0.96, p = .342. האם זה עונה על שאלת הפתיחה, כלומר בתוכנית העקיפה אין קשר? עוד לא. "לא מובהק" אומר שלא מצאנו ראיה מספיקה, לא שהוכחנו שאין קשר. בסעיף 5 נראה כמה מעט יודעים על המתאם בקבוצה הזו, ובסעיף 6 נבדוק אם הוא באמת שונה מהמתאם בתוכנית המשולבת.

החישוב ביד, לתוכנית העקיפה
r = 0.1358,   n = 51 עגלו רק בסוף
t = 0.1358 · √49 / √(1 − 0.1358²) = 0.1358 · 7 / √0.9816 = 0.9503 / 0.9908 = 0.96
df = 51 − 2 = 49,   p = T.DIST.2T(0.96, 49) = .342
הסיפור המלא: מבחן t לשתי קבוצות הוא מבחן של מתאם

בפרק 21 השווינו את החרדה של בנים ובנות, וקיבלנו t(198) = 4.65. עכשיו ניסויExperiment: מחשבים מתאם פירסוןPearson correlation coefficient בין עמודת המגדר (gender, 1 = בן, 2 = בת) לבין anx_pre. יוצא r = .31. נציב בנוסחה של הסעיף הזה:

t = 0.3138 · √198 / √(1 − 0.3138²) = 0.3138 · 14.071 / 0.9495 = 4.65,   df = 198

בדיוק אותו t, אותן דרגות חופש ואותו ערך p. מתאם בין משתנה עם שתי קבוצות לבין משתנה כמותיQuantitative variable נקרא מתאם נקודתי־דו־טוריPoint-biserial correlation. אין הבדל אם הקידוד הוא 1 ו־2, 0 ו־1, או 1 ו־100: הערך המוחלט של המתאם זהה. כלומר מבחן t לשתי קבוצות בלתי תלויותIndependent-samples t test ומבחן של מתאם הם שתי דרכים לשאול אותה שאלה. "נסו את זה בבית, זה לא מסוכן." הרעיון הזה, שהשוואת קבוצות היא מקרה פרטי של קשר בין משתנים, יחזור ברגרסיה עם משתני דמהDummy variable, בפרק 30.

עצרו ונסו

במחקר על 27 מורות נמצא מתאם של −.45 בין מספר התלמידים בכיתה לבין תחושת המסוגלות של המורה. חשבו את t, את דרגות החופש ואת ערך pp-value הדו־צדדי. מה המסקנה?

בדיקת התשובה
t = −0.45 · √25 / √(1 − 0.2025) = −2.25 / 0.893 = −2.52,   df = 25
p = T.DIST.2T(2.52, 25) = .019 T.DIST.2T מקבלת רק ערך חיובי

דוחים את השערת האפס. נמצא קשר שליליNegative relationship מובהק: במדגם, מורות בכיתות גדולות יותר מדווחות על תחושת מסוגלות נמוכה יותר. וזה מתאם, לא סיבתיותCausality (פרק 15).

בדקו את עצמכם3 שאלות

1.במחקר על 18 תלמידים נמצא מתאם של .50 בין שעות קריאה לבין אוצר מילים. מהם t וערך p הדו־צדדי?

2.מה מהבאים יגדיל את ערך tt statistic של מתאם, אם כל השאר נשאר קבוע?

3.בקובץ המחקר, המתאם בין החרדה לבין התלונות הגופניות לפני התוכנית הוא r = .26 (המדויק: .2614), עם 200 תלמידים. חשבו t, דרגות חופש וערך p, וכתבו מסקנה.

הערך הקריטי של r

אפשר לשאול מראש: מאיזה מתאם, בערך מוחלט, דוחים את השערת האפס? זה הערך הקריטי של r: rcrit = tcrit / √(tcrit² + df). ברמה .05, דו־צדדי: עם 20 נבדקים .44, עם 200 נבדקים .14, ועם 1,000 רק .06.

בפרק 20 הכרנו את הערך הקריטי של t. אם מחלצים את r מנוסחת ה־t, מקבלים את הערך הקריטי של המתאם עצמו:

rcrit = tcrit√(tcrit² + df)
מספר הנבדקים n5102030501002005001000
r קריטי.878.632.444.361.279.197.139.088.062

רמת מובהקותSignificance level .05, דו־צדדי. מובהק אם הערך המוחלט של r גדול מהמספר בטבלה.

הטבלה מספרת את כל הסיפור של הסעיף הקודם. עם חמישה נבדקים צריך כמעט .88. עם 200 מספיק .14. ושימו לב: ±.139 הוא בדיוק הטווח של 95% מהערבובים בסעיף 1, שם קיבלנו בין −.14 ל־.14. הנוסחה והערבוב מספרים אותו סיפור.

בספרים ישנים יש טבלה ארוכה של ערכים קריטייםCritical value של r, וכך עבדו לפני המחשבים: מחשבים r, מחפשים בטבלה, ומשווים. היום התוכנה נותנת ערך p מדויקExact p-value. אבל כדאי לזכור שלושה מספרים בערך: עם 30 נבדקים צריך כ־.36, עם 100 כ־.20, ועם 200 כ־.14. זה עוזר לבדוק במהירות טבלה במאמר.

דוגמה פתורה: הערך הקריטי לקובץ שלנו
df = 200 − 2 = 198,   tcrit = T.INV.2T(0.05, 198) = 1.972
rcrit = 1.972 / √(1.972² + 198) = 1.972 / √201.89 = 1.972 / 14.209 = .139

בקובץ המחקר, כל מתאם שגדול מ־.139 בערך מוחלט מובהק ברמה .05. החרדה והקשיבות, r = −.13: ממש מתחת לקו, לא מובהק (p = .061). החרדה וההרגשה בכיתה, −.29: מובהק.

מעבדה: פירסון וספירמן, הפעם עם עין על המובהקות

את המעבדה הזו הכרתם בפרק 15. היא לא מציגה ערך p, אבל עם הערך הקריטי אפשר להחליט לבד.

מעבדה: פירסון וספירמן. ארבעה זוגות משתנים מקובץ המחקר. לחיצה על הגרף מוסיפה תלמיד מומצא.פתיחה בחלון נפרד
משימות למעבדה
  1. עברו בין ארבעת הזוגות. לפי הערך הקריטי, .139 בערך (ב"אחים וקשב" יש 195 תלמידים, והערך הקריטי .141), אילו מתאמים מובהקים?
  2. בזוג "אחים וקשב", הוסיפו בלחיצות כמה תלמידים מומצאים בפינה הימנית העליונה: הרבה אחים, הרבה בעיות קשב. כמה תלמידים צריך עד שהמתאם עובר את הערך הקריטי? מה זה מלמד?
  3. הסירו את הנקודות. בזוג "קשיבות ושביעות רצון", הוסיפו תלמיד אחד בפינה הימנית התחתונה. האם המתאם עדיין מובהק?
בדיקת התשובה

1. קשיבות ושביעות רצון (.33), חרדה והרגשה בכיתה (−.29) וחרדה לפני ואחרי (.71) מובהקים. אחים וקשב (−.04) לא. 2. בדרך כלל מספיקים שלושה או ארבעה תלמידים קיצוניים, תלוי איפה לוחצים. כמה ערכים קיצונייםOutlier יכולים "לייצר" מתאם מובהק בקשר שלא קיים. לכן מסתכלים תמיד על הדיאגרמה לפני ערך p. 3. המתאם יורד מעט, אבל עם 201 תלמידים הוא עדיין רחוק מעל .14. במדגם גדול, תלמיד אחד משנה פחות.

עצרו ונסו

יועצת מצאה מתאם של .33 בין שעות שינה לבין ריכוז, אצל 30 תלמידים. בלי לחשב t, האם המתאם מובהק ברמה .05, דו־צדדי? ומה אם היו לה 100 תלמידים עם אותו מתאם?

בדיקת התשובה

עם 30 תלמידים הערך הקריטי הוא .361, ו־.33 קטן ממנו: לא מובהק (בחישוב: t(28) = 1.85, p = .075). עם 100 תלמידים הערך הקריטי .197, ואותו מתאם כבר מובהק.

בדקו את עצמכם3 שאלות

1.עם 50 נבדקים, הערך הקריטי של r (דו־צדדי, .05) הוא .279. במחקר כזה התקבל r = −.30. מה המסקנה?

2.חשבו את הערך הקריטי של r לרמה .05, דו־צדדי, עם 15 נבדקים. (T.INV.2T(0.05, 13) = 2.160)

3.מה קורה לערך הקריטי של r כשהמדגם גדל?

מובהק זה לא חזק: r² וגודל המדגם

ערך p עונה על השאלה אם יש קשר באוכלוסייה. r ו־r² עונים על השאלה כמה הוא חזק. r² הוא השונות המשותפת: איזה חלק מההבדלים בין הנבדקים במשתנה אחד משותף למשתנה השני. במדגם ענק גם קשר זניח מובהק, ובמדגם קטן גם קשר חזק יכול לצאת לא מובהק. לכן מדווחים תמיד את r עצמו, ולא רק אם הוא מובהק.

בפרק 15 ראינו שהמתאם בריבוע הוא אחוז השונות המשותפת. המתאם בין הקשיבות לשביעות הרצון, .33, משתף .33² = .11: 11% מההבדלים בשביעות הרצון בין התלמידים משותפים לקשיבות. כלומר, ידיעת הקשיבות של תלמיד "מסבירה" 11% מהשונות בשביעות הרצון. "מסבירה" במובן הסטטיסטי: יש להם שונות משותפת. זה לא אומר שהקשיבות גורמת לשביעות הרצון.

המתאם הוא בעצמו גודל אפקטEffect size (פרק 19). המובהקות לא. ארבעה מתאמים מהקובץ:

זוג המשתניםnrr²p
קשיבות ושביעות רצון200.33.11< .001
מספר אחים וזמינות המורה195.15.02.038
חרדה וקשיבות200−.13.02.061
קשיבות ושביעות רצון, בתוכנית העקיפה51.14.02.342

שלושת המתאמים האחרונים כמעט באותו גודל, בערך 2% שונות משותפת. אחד מהם מובהק, השני "כמעט", והשלישי רחוק מאוד ממובהקות. ההבדל בין "מובהק" ל"לא מובהק" כאן לא אומר כלום על עוצמת הקשרStrength of a relationship. הוא נובע מגודל המדגם, וקצת ממזל.

ביג דאטה: כשהכול מובהק

בימים של פירסון, מדגם היה 20 עד 200 איש. היום חוקרים מקבלים נתונים של מיליוני משתמשים ברשתות חברתיות. עם מיליון נבדקים, מתאם של .01 נותן t = 10, ו־p קטן מאחד חלקי מיליארד. "מובהק ביותר". אבל השונות המשותפת היא .01² = .0001, מאית האחוז. כשקוראים בעיתון על "קשר מובהק" שנמצא בנתוני עתק, תמיד שואלים: כמה גדול המתאם?

ואיך יודעים אם מתאם גדול? כהן (Cohen, 1988) הציע: .10 קטן, .30 בינוני, .50 גדול. במדעי החברה ובחינוך, רוב המתאמים שמתפרסמים הם בסביבות .20 עד .30. מתאם מתחת ל־.10 כמעט אף פעם לא מעניין תיאורטית, גם אם הוא מובהק.

שתי טעויות הפוכות

"מובהק, ולכן חזק." לא. ערך p קטן אומר שהקשר כנראה לא אפס. הוא לא אומר שהוא גדול. במדגם גדול גם r = .10 מובהק, ומשתף רק אחוז אחד מהשונות.

"לא מובהק, ולכן אין קשר." גם לא. במדגם קטן גם r = .40 יכול לצאת לא מובהק, כמו בדוגמה עם 20 התלמידים. לא מצאנו ראיה, ולא הוכחנו שאין.

הסיפור המלא: למה דווקא בריבוע?

למה השונות המשותפת היא r² ולא r? כי שונות נמדדת ביחידות בריבוע (פרק 11). בפרק 28 נפרק את השונות של משתנה אחד לשני חלקים: החלק שאפשר לנבא מהמשתנה השני, והחלק שנשאר. החלק המנובא יוצא בדיוק r² מהשונות. ולכן גם מתאם "גדול" של .50 משאיר 75% מהשונות בלי הסבר. זה לא אומר שהמחקר נכשל. התנהגות של ילדים מושפעת מהמון דברים, ואף משתנה אחד לא יסביר את רובה.

עצרו ונסו

א. בסקר של משרד החינוך על 2,500 הורים נמצא מתאם של .07 בין שעות ההתנדבות של ההורה בבית הספר לבין שביעות הרצון שלו מבית הספר. חשבו t ו־p, ואת השונות המשותפת. ב. במחקר של 15 תלמידים נמצא מתאם של .45 בין זמן הקריאה לבין אוצר המילים. חשבו t ו־p, ואת השונות המשותפת. ג. איזה מהקשרים "חשוב" יותר?

בדיקת התשובה
א. t = 0.07 · √2498 / √(1 − 0.0049) = 3.499 / 0.998 = 3.51,   df = 2498,   p < .001,   r² = .0049
ב. t = 0.45 · √13 / √(1 − 0.2025) = 1.623 / 0.893 = 1.82,   df = 13,   p = .092,   r² = .20

א. מובהק מאוד, אבל משותף פחות מחצי אחוז מהשונות: קשר זניח. ב. לא מובהק, אבל 20% שונות משותפת: אם הקשר אמיתי, הוא חזק. ג. לפי גודל האפקטEffect size, הקשר במחקר הקטן מעניין יותר. אבל אי אפשר לסמוך עליו, כי 15 תלמידים זה מעט מדי. כדאי לחזור עליו במדגם גדול יותר.

בדקו את עצמכם3 שאלות

1.המתאם בין שני שאלונים הוא −.50. מה השונות המשותפת?

2.במחקר של 3,000 תלמידים נמצא מתאם של .05 בין גובה לבין ציון בהבעה בכתב, p = .006. מה התיאור הנכון?

3.במחקר א׳: r = .48, 14 נבדקים, p = .082. במחקר ב׳: r = .15, 400 נבדקים, p = .003. באיזה מחקר הקשר חזק יותר, ובאיזה הראיה לקשר חזקה יותר?

רווח סמך למתאם: טרנספורמציית פישר

כשהמתאם באוכלוסייה רחוק מאפס, ההתפלגות של r מוטה, כי הוא לא יכול לעבור את 1. לכן לא בונים רווח סמך בצורה r ± 1.96 · SE. במקום זה ממירים את r בטרנספורמציית פישר, z′ = FISHER(r), שההתפלגות שלה נורמלית בקירובApproximate normality, עם SE = 1/√(n − 3). בונים רווח סמך ל־z′, ומחזירים את שני הגבולות למתאמים, FISHERINV.

בפרק 19 בנינו רווח סמך () לממוצע: האומדןEstimate, פלוס מינוס בערך שתי טעויות תקן. למה לא לעשות אותו דבר גם למתאם? ננסה. עשרה נבדקים, r = .90. טעות התקן מהסעיף הקודם היא √((1 − .81)/8) = .154, ו־.90 + 1.96 · .154 = 1.20. רווח סמך שהגבול העליון שלו 1.20? מתאם לא יכול לעבור את 1.

הבעיה היא שההתפלגות של r סימטרית רק כשהמתאם באוכלוסייה הוא אפס. נניח שבאוכלוסייה ρ = .80. כמה "מקום" יש ל־r לזוז במדגם? כלפי מעלה רק עד 1, כלומר .20. כלפי מטה עד −1, כלומר 1.80. ההתפלגות נדחסת אל הקיר שב־1, ונמתחת בזנב ארוך שמאלה. בגרף משמאל רואים את זה, בעשרה נבדקים:

−1−.50.51−1012rz′ = FISHER(r)המתאם במדגםאחרי טרנספורמציית פישרρ = 0ρ = .80
משמאל: התפלגות הדגימהSampling distribution של r בעשרה נבדקים. כשהמתאם באוכלוסייה הוא 0 (בסגול) היא סימטרית. כשהוא .80 (בטורקיז, והקו המקווקו מסמן את .80) היא מוטה מאוד: נדחסת אל 1, עם זנב ארוך שמאלה. מימין: אותן שתי התפלגויות אחרי טרנספורמציית פישר. שתיהן סימטריות, ובאותו רוחב.

הפתרון של פישר

רונלד פישר הציע להמיר כל מתאם במספר אחר, בעזרת לוגריתם:

z′ = ½ · ln1 + r1 − r      SEz′ = 1√(n − 3)

אין צורך לזכור את הנוסחה. את ההמרה נסמן FISHER(r), ואת ההמרה חזרה FISHERINV(z′), כמו שמות הפונקציות באקסל, וכל התוכנות עושות אותה לבד. מה שחשוב להבין זה מה הלוגריתם עושה. לוגריתם בבסיס 10 שואל: בכמה צריך להעלות את 10 בחזקה כדי לקבל את המספר? של 10 התשובה 1, של 100 היא 2, ושל 1000 היא 3. מה קרה ל־1000 הרחוק? "משכנו אותו פנימה". טרנספורמציית פישר עושה את ההפך בקצוות: ליד אפס היא כמעט לא משנה כלום, וליד 1 היא מותחת את המרחקים. הסיבה: היא לוקחת לוגריתם של היחס (1 + r)/(1 − r), והיחס הזה מזנק כש־r מתקרב ל־1. בטבלה למטה רואים את זה: הצעד מ־.10 ל־.30 נשאר בערך באותו גודל אחרי ההמרה (.21), אבל הצעד הקטן מ־.90 ל־.99 הופך לצעד ענק, מ־1.47 ל־2.65. כך הצד הדחוס של ההתפלגות נפתח, וההתפלגות נעשית סימטרית.

r.10.30.50.70.80.90.95.99
z′.100.310.549.8671.0991.4721.8322.647

ושני בונוסים. ההתפלגות של z′ נורמלית בקירובApproximate normality, ולכן עובדים עם 1.96 של ההתפלגות הנורמלית. וטעות התקן שלה, 1/√(n − 3), לא תלויה במתאם בכלל, רק בגודל המדגם. שימו לב: z′ אינו ציון תקןz-score. הוא רק נקרא בשם דומה. הסימן עם התג, z′, נועד להזכיר את זה.

דוגמה פתורה: רווח סמך למתאם בין קשיבות לשביעות רצון

r = .331, n = 200. נבנה רווח סמך של 95%.

z′ = FISHER(0.331) = 0.344 1. ממירים
SE = 1 / √(200 − 3) = 1 / 14.036 = 0.0712 2. טעות התקן
0.344 ± 1.96 · 0.0712 = 0.344 ± 0.140 → [0.205, 0.484] 3. רווח הסמך, ביחידות של z′
FISHERINV(0.205) = .20,   FISHERINV(0.484) = .45 4. מחזירים למתאמים

מסקנה: 95% CI [.20, .45]. אנחנו בטוחים ברמה של 95% שהמתאם באוכלוסייה בין קשר חלש לקשר בינוני. האפס לא ברווח, וזה מתאים לכך שהמתאם מובהק. ושימו לב: הרווח לא סימטרי סביב .33. כלפי מטה הוא ארוך יותר (.13) מאשר כלפי מעלה (.12), כי כלפי מעלה יש פחות מקום.

ולמה בכלל לחזור למתאמים? כי "אנשים מבינים את השפה של מתאם, לא את השפה של טרנספורמציה לוגריתמיתLog transformation של מתאם". את רווח הסמך מדווחים תמיד ביחידות של r.

ובחזרה לשאלת הפתיחה

קבוצהnr95% CI
ביקורת74.38[.16, .56]
תוכנית עקיפה51.14[−.15, .40]
תוכנית משולבת75.43[.22, .60]

בתוכנית העקיפה רווח הסמך כולל את האפס. זה מתאים למבחן הלא מובהק בסעיף 2. אבל הוא כולל גם את .38, המתאם בקבוצת הביקורת, ואפילו קרוב ל־.43. כלומר, הנתונים של התוכנית העקיפה מתיישבים גם עם "אין קשר" וגם עם "קשר בינוני". אנחנו פשוט לא יודעים. זה מה שרווח סמך מוסיף על ערך p: הוא מראה כמה מעט אנחנו יודעים. רווח ברוחב .55 אומר "המדגם קטן מדי כדי לומר הרבה".

הסיפור המלא: למה צריך התפלגות מוכרת?

סטודנטית שאלה בשיעור: "אני מבינה מה פישר עושה, אבל לא למה זה עוזר". התשובה חוזרת לפרק 14. ציון תקן אפשר לחשב בכל התפלגות: כמה טעויות תקן אני רחוק מהמרכז. אבל כדי להפוך אותו לאחוזוןPercentile או לערך p, צריך לדעת מה השטח שמעבר לנקודה. את השטח הזה יודעים לחשב, או למצוא בטבלה, רק בהתפלגויות מוכרות: נורמלית, t, F, חי בריבועChi-square statistic. להתפלגות מוטה של r סביב .80 אין טבלה. לכן מעבירים את הבעיה לעולם מוכר, ההתפלגות הנורמלית, עושים בו את החישוב, ומחזירים את התשובה.

וקצת היסטוריה. פישר מצא ב־1915 את ההתפלגות המדויקת של r, ובה ראה כמה היא מסובכת כשהמתאם באוכלוסייה אינו אפס. ב־1921 הוא הציע את הטרנספורמציהTransformation, דווקא כדי לעקוף את הנוסחה המסובכת שלו עצמו (Fisher, 1915, 1921). מאה שנה אחרי, SPSS ו־JASP עדיין בונות כך את רווח הסמך למתאם.

ולמה n − 3 ולא n − 2? זו תוצאה מתמטית של פישר: השונות של z′ היא בקירוב 1/(n − 3). אין לה פירוש פשוט של "דרגות חופש". כמו שאמרתי בשיעור, היא "יורדת מהשמיים".

עצרו ונסו

בנו רווח סמך של 95% למתאם של .40 עם 50 תלמידים, מהדוגמה בסעיף 2. האם הוא מתאים למסקנה שם?

בדיקת התשובה
z′ = FISHER(0.40) = 0.424,   SE = 1 / √47 = 0.146
0.424 ± 1.96 · 0.146 = 0.424 ± 0.286 → [0.138, 0.710]
FISHERINV(0.138) = .14,   FISHERINV(0.710) = .61

95% CI [.14, .61]. האפס לא ברווח, וזה מתאים לכך שהמתאם היה מובהק (p = .004). ועם 20 תלמידים? הרווח היה [−.05, .72]: כולל את האפס, ורחב מאוד.

בדקו את עצמכם3 שאלות

1.מהי טעות התקןStandard error של z′ במדגם של 103 נבדקים?

2.בנו רווח סמך של 95% למתאם בין החרדה לתלונות הגופניות, r = .2614, עם 200 תלמידים.

3.מישהו קורא את z′ = 1.10, שהתקבל מ־r = .80, ואומר: "התלמיד נמצא 1.10 סטיות תקן מעל הממוצע". מה הבעיה?

עוד שתי שאלות שפישר פותר: ערך שאינו אפס, ושני מתאמים

מול מתאם ידוע ρ0: z = (z′ − z′0) · √(n − 3). שני מתאמים משתי קבוצות נפרדות: z = (z′1 − z′2) / √(1/(n1 − 3) + 1/(n2 − 3)). בשני המקרים ערך p מההתפלגות הנורמלית. והלקח: מתאם מובהק ומתאם לא מובהק אינם בהכרח שונים זה מזה.

1. האם המתאם גבוה מערך ידוע?

מבחן t בודק רק מול אפס. לפעמים השאלה היא אחרת: יודעים מה המתאם באוכלוסייה, ושואלים אם בקבוצה מסוימת הוא שונה. זה נדיר, כי כמעט אף פעם לא יודעים את המתאם באוכלוסייה. אבל זה מכין אותנו לשאלה הנפוצה, השוואה בין שני מתאמים. מול ערך שאינו אפס, ההתפלגות של r מוטה, ולכן עוברים לפישר.

דוגמה פתורה: כיתות קטנות

נניח שמחקרים גדולים מצאו מתאם של .30 בין הקשר עם המורה לבין שביעות הרצון מבית הספר (מספר לדוגמה). חוקרת משערת שבכיתות קטנות הקשר חזק יותר. אצל 30 תלמידים מכיתות קטנות היא מצאה r = .60. האם המתאם גבוה מ־.30? (השערה חד־צדדיתOne-tailed hypothesis / test, α = .05)

H0: ρ ≤ .30    H1: ρ > .30
FISHER(0.60) = 0.693,   FISHER(0.30) = 0.310 ממירים את שני המתאמים
z = (0.693 − 0.310) · √(30 − 3) = 0.383 · 5.196 = 1.99
p = 1 − NORM.S.DIST(1.99, TRUE) = .023 חד־צדדי ימני

מסקנה: דוחים את השערת האפס. בכיתות קטנות הקשר חזק יותר מ־.30. רווח סמך של 95% למתאם הזה: [.31, .79]. רחב, כי יש רק 30 תלמידים.

2. האם שני מתאמים שונים זה מזה?

זו השאלה הנפוצה יותר. יש שני מדגמים נפרדים, ובכל אחד מתאם בין אותם שני משתנים. בנים ובנות, שתי ארצות, שתי תוכניות. האם הקשר שונה? כאן בונים התפלגות דגימה של ההפרש בין שני המתאמים. גם היא מוטה כשהמתאמים לא אפס, ולכן תמיד עוברים לפישר. טעות התקן של ההפרש מחברת את שתי השונויות, כמו בפרק 21:

z = z′1 − z′2√(1/(n1 − 3) + 1/(n2 − 3))
דוגמה מהמחקר: שאלת הפתיחה

קשיבות ושביעות רצון: בתוכנית העקיפה r = .136 (n = 51, לא מובהק). בתוכנית המשולבת r = .429 (n = 75, מובהק). האם המתאמים שונים?

z′1 = FISHER(0.136) = 0.137,   z′2 = FISHER(0.429) = 0.459
SE = √(1/48 + 1/72) = √(0.0208 + 0.0139) = √0.0347 = 0.186
z = (0.137 − 0.459) / 0.186 = −1.73
p = 2 · (1 − NORM.S.DIST(1.73, TRUE)) = .083 דו־צדדי

מסקנה: ההבדל בין שני המתאמים לא מובהק. אחד מובהק, השני לא, ובכל זאת אין לנו ראיה שהם שונים. זו התשובה לשאלת הפתיחה, והיא מפתיעה הרבה חוקרים: ההבדל בין "מובהק" ל"לא מובהק" אינו בעצמו מובהק (Gelman & Stern, 2006). מי שרוצה לטעון שהקשר שונה בין קבוצות, חייב לבדוק את ההבדל ישירות.

ועצה ממני, כסטטיסטיקאי וכחבר: כשאפשר, נסחו את ההשערות שלכם כהבדלים בין ממוצעים, ולא כהבדלים בין מתאמים. למבחן להשוואת מתאמים יש עוצמה נמוכה. גם הבדל שנראה עצום, .60 מול .30, כלומר 36% שונות משותפת מול 9%, יוצא לא מובהק עם 35 ו־60 נבדקים (z = 1.74, p = .082). כדי לגלות הבדלים כאלה צריך מדגמים גדולים בהרבה.

באקסל, ההשוואה בתא אחד: =(FISHER(0.136)-FISHER(0.429))/SQRT(1/48+1/72) נותן −1.73, ו־=2*(1-NORM.S.DIST(ABS(...),TRUE)) נותן את ערך p.

בתפריטי Correlate של SPSS אין מבחן פשוט להשוואת שני מתאמים מקבוצות נפרדות. מחשבים את שני המתאמים ב־SPSS (למשל עם Split File לפי הקבוצה, פרק 16), ואת ההשוואה עושים באקסל או ביד, לפי הנוסחה.

בחלון Correlation של JASP אין מבחן קלאסי להשוואת שני מתאמים מקבוצות נפרדות. מחשבים את שני המתאמים ב־JASP (עם מסנן על הקבוצה), ואת ההשוואה עושים באקסל או ביד, לפי הנוסחה.

הסיפור המלא: ומה אם שני המתאמים מאותו מדגם?

הנוסחה כאן מתאימה רק למתאמים משתי קבוצות נפרדות של אנשים. לפעמים השאלה היא על אותם אנשים: האם הקשיבות קשורה לשביעות הרצון יותר מאשר לחרדה? שני המתאמים מחושבים על אותם 200 תלמידים, ויש להם משתנה משותף, ולכן הם תלויים זה בזה. כמו בפרק 21, תלות משנה את טעות התקן, וצריך מבחן אחר, שמשתמש גם במתאם בין שני המשתנים האחרים (Steiger, 1980). לא נלמד אותו בספר, אבל חשוב לדעת שהנוסחה של הסעיף הזה לא מתאימה למקרה כזה.

עצרו ונסו

השוו את המתאם בין קשיבות לשביעות רצון בקבוצת הביקורת (r = .376, n = 74) לזה של התוכנית העקיפה (r = .136, n = 51).

בדיקת התשובה
FISHER(0.376) = 0.395,   FISHER(0.136) = 0.137
SE = √(1/71 + 1/48) = √(0.0141 + 0.0208) = 0.187
z = (0.395 − 0.137) / 0.187 = 1.38,   p = .166

לא מובהק. גם כאן, מתאם מובהק מול מתאם לא מובהק, ואין ראיה להבדל ביניהם.

בדקו את עצמכם3 שאלות

1.חוקרת רוצה לבדוק אם הקשר בין חרדה לציונים שונה בין תלמידי חטיבה לתלמידי תיכון (שתי קבוצות נפרדות). באיזה מבחן תשתמש?

2.בבית ספר אחד, עם 53 תלמידים, המתאם בין קשיבות לשביעות רצון הוא .50. בבית ספר אחר, עם 63 תלמידים, הוא .20. האם המתאמים שונים? (דו־צדדי, α = .05)

3.אצל 200 התלמידים, הקשיבות מתאמת .33 עם שביעות הרצון ו־−.13 עם החרדה. אפשר להשוות את שני המתאמים בנוסחה של קבוצות נפרדות, עם n1 = n2 = 200?

מטריצת מתאמים, והבעיה של הרבה מבחנים

מטריצת מתאמים מציגה את כל המתאמים בין כמה משתנים בטבלה אחת. עם k משתנים יש k(k − 1)/2 מתאמים. כשבודקים הרבה מתאמים, הסיכוי שלפחות אחד יצא מובהק במקרה גדל: עם 15 מתאמים שבאף אחד מהם אין קשר, 54%. אפשר להחמיר, למשל בתיקון בונפרוניBonferroni correction: בודקים כל מתאם ברמה α חלקי מספר המבחנים.

כמעט בכל מאמר כמותי יש, לפני בדיקת ההשערות, טבלה של כל המתאמים בין משתני המחקר. כך היא נראית בסגנון APA, עם ששת מדדי המחקר שלנו לפני התוכנית:

משתנהMSD12345
1. שביעות רצון5.061.00—
2. קשיבות3.200.55.33***—
3. חרדה2.240.52−.22**−.13—
4. בעיות קשב2.480.71−.18**−.24***.22**—
5. תלונות גופניות1.850.50−.18*−.25***.26***.23**—
6. הרגשה בכיתה3.470.65.32***.25***−.29***−.15*−.23**

N = 200. * p < .05. ** p < .01. *** p < .001.

איך קוראים? כל תא הוא המתאם בין המשתנה שבשורה למשתנה שבעמודה. המספרים בכותרות העמודות הם מספרי המשתנים מהשורות. מספיק חצי טבלה, כי המתאם בין א׳ לב׳ זהה למתאם בין ב׳ לא׳. האלכסון ריק, כי מתאם של משתנה עם עצמו תמיד 1. והכוכביות אומרות באיזו רמה המתאם מובהק. המתאם החזק ביותר: קשיבות ושביעות רצון, .33. הלא מובהק היחיד: קשיבות וחרדה, −.13.

15 מבחנים בבת אחת

בטבלה הזו בדקנו 15 השערות, ולא אחת. עם 6 משתנים יש 6 · 5 / 2 = 15 זוגות. וכאן חוזרת הבעיה שפגשנו בפרק 18: α הוא הסיכוי לטעות מסוג ראשוןType I error במבחן אחד. אילו באף אחד מ־15 הזוגות לא היה קשר באוכלוסייה, הסיכוי שלפחות מתאם אחד ייצא מובהק במקרה הוא בערך:

1 − (1 − .05)15 = 1 − .9515 = 1 − .463 = .54

יותר מחצי. עם 10 משתנים כבר יש 45 מתאמים, והסיכוי מגיע ל־90%. מי שמחשב מטריצה גדולה ומדווח רק את "הממצאים המעניינים", כמעט בטוח ידווח גם קשר מקרי. ככל ששואלים יותר שאלות, צריך להחמיר יותר.

הדרך הפשוטה ביותר להחמיר היא תיקון בונפרוניBonferroni correction: מחלקים את α במספר המבחנים. כאן .05 / 15 = .0033, ומתאם נחשב מובהק רק אם ערך p שלו קטן מזה. בטבלה שלנו 14 מתוך 15 המתאמים מובהקים ברמה .05. אחרי התיקון נשארים 11. שלושה נופלים: שביעות רצון ובעיות קשב (p = .009), שביעות רצון ותלונות גופניות (p = .010), ובעיות קשב והרגשה בכיתה (p = .030). את תיקון בונפרוני, ודרכים חכמות ממנו, נלמד לעומק בפרק 26, כשנשווה הרבה זוגות של ממוצעים.

אז מה עושים בפועל? שלושה כללים. 1. קובעים מראש, לפי התיאוריה, אילו קשרים הם ההשערות של המחקר. אותם בודקים ברמה הרגילה. 2. את שאר המטריצה מציגים כתיאור, ומדווחים את כל המתאמים, לא רק את המובהקים. 3. כשבודקים הרבה קשרים בלי השערה מראש, מחמירים: בונפרוני, או לפחות α של .01.

הסיפור המלא: כמה מתאמים "צריכים" לצאת מובהקים במקרה?

אם באף אחד מ־15 הזוגות אין קשר, מצפים בממוצע ל־15 · .05 = 0.75 מתאמים מובהקים במקרה. אצלנו יצאו 14. ברור שרובם לא מקריים: שאלוני רווחה נפשית קשורים זה לזה. הבעיה של הרבה מבחנים לא אומרת שכל ממצא במטריצה חשוד. היא אומרת שאי אפשר לדעת איזה מהם הוא המקרי, ושהממצאים החלשים, עם p קרוב ל־.05, הם המועמדים הראשונים.

בונפרוני שמרני: הוא מגן מטעות מסוג ראשון, אבל מוריד את העוצמה, במיוחד כשיש הרבה מבחנים. יש תיקונים פחות קשוחים, כמו תיקון הולם (Holm), שבודק את ערכי p מהקטן לגדול ומקל בהדרגה. נכיר אותם בפרק 26.

עצרו ונסו

חוקרת מחשבת מטריצת מתאמים של 10 שאלונים. א. כמה מתאמים יש במטריצה? ב. אם באוכלוסייה אין שום קשר בין השאלונים, מה הסיכוי שלפחות מתאם אחד ייצא מובהק ברמה .05? ג. מה רמת המובהקותSignificance level לכל מתאם אחרי תיקון בונפרוני?

בדיקת התשובה
10 · 9 / 2 = 45 א
1 − .9545 = 1 − .099 = .90 ב
.05 / 45 = .0011 ג

בעולם בלי שום קשר, כמעט בוודאות יופיע לפחות מתאם "מובהק" אחד. לכן צריך להחמיר.

בדקו את עצמכם3 שאלות

1.במטריצת מתאמים של 5 משתנים, אם באוכלוסייה אין שום קשר ביניהם, מה הסיכוי שלפחות מתאם אחד ייצא מובהק ברמה .05?

2.באותה מטריצה של 10 מתאמים, מתאם אחד יצא עם p = .004 ואחר עם p = .02. מה קורה להם אחרי תיקון בונפרוני?

3.מאמר מדווח: "חישבנו מתאמים בין 12 משתנים, ונמצאו שלושה קשרים מובהקים (כל אחד עם p בין .02 ל־.04)". המאמר לא מציג את שאר המתאמים. מה מטריד בדיווח הזה?

ספירמן, הנחות המבחן וכיוון ההשערה

גם למתאם ספירמן בודקים מובהקות. השערת האפס: אין קשר מונוטוניMonotonic relationship באוכלוסייה. התוכנות מחשבות את ערך p, במדגם בינוני וגדול באותה נוסחת t. מבחן פירסון מניח תצפיות בלתי תלויות, קשר לינארי, ונורמליות של שני המשתנים (או מדגם גדול). כשיש ערכים קיצוניים או סולם סדרOrdinal scale, ספירמן הוא הגיבוי. השערה חד־צדדית רק אם הכיוון נקבע מראש.

מובהקות של מתאם ספירמן

בפרק 15 ראינו שספירמן הוא פירסון על הדירוגים, ושבקובץ שלנו המתאם בין הפריט "המחשבות שלי נודדות כשהמורה מדברת" (m14) לבין שאלון בעיות הקשב (attn_pre) הוא = .19. האם הוא מובהק? השערת האפס כאן היא שבאוכלוסייה אין קשר מונוטוניMonotonic relationship. במדגם בינוני וגדול, מ־10 נבדקים בערך, ערך p מחושב באותה נוסחה בדיוק, עם rs במקום r:

דוגמה פתורה: ספירמן
t = 0.187 · √198 / √(1 − 0.187²) = 2.630 / 0.982 = 2.68,   df = 198
p = T.DIST.2T(2.68, 198) = .008

קשר חיוביPositive relationship, קטן ומובהק: rs(198) = .19, p = .008. במדגם קטן מאוד הקירוב הזה פחות מדויק, ומשתמשים בטבלאות מיוחדות של ספירמן. התוכנות בוחרות את השיטה לבד.

ומלכודת של שמות: בפלט של SPSS ושל JASP מתאם ספירמן נקרא Spearman's rho, כלומר ρ. אבל בספר, וב־APA, ρ הוא המתאם באוכלוסייה. בדיווח כותבים rs.

הנחות המבחן של פירסון

הנחהמה זה אומראיך בודקים, ומה עושים
תצפיות בלתי תלויותכל נבדק מופיע פעם אחת, והנבדקים לא משפיעים זה על זהלפי מערך המחקר. תלמידים מאותה כיתה דומים זה לזה, ובמחקר גדול מתייחסים לזה (פרק 36)
קשר לינאריLinear relationshipהמתאם מודד רק את החלק הישר של הקשרדיאגרמת פיזור, תמיד, לפני כל מבחן
נורמליות של שני המשתנים יחדענן הנקודות בצורת אליפסה, צפוף במרכז ודליל בשולייםבמדגם גדול לא נורא. ערכים קיצוניים מסוכנים בכל גודל מדגם: בודקים אותם, או עוברים לספירמן
סולם רווח או מנהInterval scaleבשני המשתניםפריט בודד בסולם סדר: ספירמןOrdinal scale

שימו לב: ההנחות האלה נחוצות למבחן, כלומר לערך p ולרווח הסמך. כדי לתאר את המדגם, r הוא פשוט מספר, והוא נכון תמיד. אבל אם הקשר עקום, או שתלמיד אחד מושך את כל הענן, ערך p יענה בצורה מדויקת על שאלה לא נכונה.

חד־צדדי או דו־צדדי?

כמו בפרק 18: אם קבעתם מראש, לפי התיאוריה, שהקשר חיובי, מותר לבדוק השערה חד־צדדית, H1: ρ > 0, וערך p קטן בחצי. אסור לבחור חד־צדדי אחרי שראיתם את הנתונים. ברירת המחדל בכל התוכנות היא דו־צדדי, וכך גם בספר.

עצרו ונסו

שתי גננות דירגו 12 ילדים לפי המוכנות שלהם לכיתה א׳, וקיבלו מתאם ספירמן של .62. חשבו ערך p בקירוב, בנוסחת t. למה כאן ספירמן, ולא פירסון?

בדיקת התשובה
t = 0.62 · √10 / √(1 − 0.3844) = 1.961 / 0.785 = 2.50,   df = 10
p = T.DIST.2T(2.50, 10) = .032

מובהק ברמה .05: הגננות מסכימות. הנתונים הם דירוגים, כלומר סולם סדר, ולכן ספירמן. עם 12 ילדים בלבד הקירוב לא מושלם, והתוכנה עשויה לתת ערך p מעט שונה.

בדקו את עצמכם3 שאלות

1.בפלט מופיע Spearman's rho = .41. איך מדווחים אותו בסגנון APA?

2.מה מהבאים אינו הנחה של מבחן המובהקות של מתאם פירסוןPearson correlation coefficient?

3.חוקרת קבעה מראש, לפי תיאוריה, שהקשר בין הקשיבות לבין הקשר עם המורה חיובי. אצל 80 תלמידים היא מצאה r = .20. חשבו t, ואת ערך p הדו־צדדי והחד־צדדי. מה המסקנה?

כמה נבדקים צריך כדי לגלות מתאם?

לפני המחקר קובעים α, עוצמה רצויה ומתאם צפוי. אז n = ((zα + zβ) / z′ρ)² + 3, ומעגלים כלפי מעלה. בבדיקה דו־צדדיתTwo-tailed hypothesis / test ברמה .05 ובעוצמה .80: למתאם של .10 צריך 783 נבדקים, ל־.30 צריך 85, ול־.50 צריך 30.

בפרק 19 חישבנו כמה נבדקים צריך כדי לגלות הבדל בין ממוצעים. ההיגיון כאן זהה. מחליטים מראש על שלושה דברים: רמת המובהקות α, העוצמה הרצויה (בדרך כלל .80), והמתאם הקטן ביותר שחשוב לנו לגלות. מטרנספורמציית פישר אנחנו יודעים ש־z′ מתפלג נורמלית, עם טעות תקן 1/√(n − 3). מכאן, בדיוק כמו בפרק 19:

n = (zα + zβ)²(z′ρ)² + 3
דוגמה פתורה: כמה תלמידים כדי לגלות מתאם של .30?
zα = 1.96,   zβ = 0.842 דו־צדדי, α = .05, עוצמה .80
z′ρ = FISHER(0.30) = 0.3095
n = (2.802 / 0.3095)² + 3 = 9.051² + 3 = 81.93 + 3 = 84.93
n = 85 מעגלים כלפי מעלה, תמיד
המתאם שרוצים לגלות.10.20.30.40.50
עוצמה .80783194854730
עוצמה .9010472591136238

בדיקה דו־צדדיתTwo-tailed hypothesis / test, α = .05. G*Power, שמחשבת בשיטה מדויקת יותר, נותנת מספרים זהים או קטנים באחד (למשל 84 במקום 85).

מתאם קטן דורש מדגם ענק. מתאמים של .20 עד .30, הנפוצים בחינוך, דורשים 85 עד 194 נבדקים. ובחזרה לתוכנית העקיפה: עם 51 תלמידים, אילו המתאם באוכלוסייה היה .30, העוצמה הייתה רק .57. כמעט הטלת מטבע. אז "לא מובהק" שם הוא בדיוק מה שצריך לצפות גם אם יש קשר בינוני. וזו עוד סיבה לא להסיק ממנו ש"אין קשר".

באקסל, בתא אחד: =ROUNDUP(((NORM.S.INV(0.975)+NORM.S.INV(0.8))/FISHER(0.3))^2+3,0) נותן 85. מחליפים את 0.3 במתאם הצפוי ואת 0.8 בעוצמה הרצויה.

ב־SPSS, מגרסה 27: Analyze > Power Analysis > Correlations > Pearson Product-Moment. ב־Estimate בוחרים Sample size, מקלידים עוצמה 0.8, מתאם 0.3 ו־Null value 0, ובודקים ש־Significance level הוא 0.05. התוצאה קרובה מאוד לנוסחה. אפשר גם לבחור Power, ולהקליד גודל מדגם, כדי לקבל את העוצמה של מחקר קיים.

ב־JASP יש מודול Power, שמפעילים בכפתור ה־+. אם בגרסה שלכם אין בו מבחן מתאם, השתמשו בתוכנה החינמית G*Power: Exact > Correlation: Bivariate normal model, עם A priori, ‏Correlation ρ H1 = 0.3, ‏Correlation ρ H0 = 0. מתקבל N = 84.

הסיפור המלא: מאיפה הנוסחה?

כמו בפרק 19: כדי שהעוצמה תהיה 1 − β, המרחק בין ההתפלגות של השערת האפס (סביב z′ = 0) לבין ההתפלגות האמיתית (סביב z′ρ) צריך להיות zα + zβ טעויות תקן. כלומר z′ρ = (zα + zβ) / √(n − 3). מחלצים את n, ומקבלים את הנוסחה. ה־3 בסוף בא מטעות התקן של פישר.

ומאיפה יודעים איזה מתאם לצפות? ממחקרים קודמים, ממחקר חלוץ, או מהשאלה "מהו הקשר הקטן ביותר שהיה מעניין אותנו?". וזהירות עם מחקרים קודמים קטנים: מתאמים שפורסמו במדגמים קטנים נוטים להיות מוגזמים, כי מתפרסמים בעיקר המובהקים. לכן כדאי לתכנן לפי מתאם צנוע מעט מזה שפורסם.

עצרו ונסו

חוקר מתכנן מחקר על הקשר בין זמן מסך לבין שעות שינה. במחקרים קודמים נמצא מתאם של כ־.20. כמה תלמידים הוא צריך לעוצמה של .80, בבדיקה דו־צדדית ברמה .05? ומה אם הוא מסתפק בגילוי מתאם של .40?

בדיקת התשובה
FISHER(0.20) = 0.2027,   n = (2.802 / 0.2027)² + 3 = 13.82² + 3 = 190.97 + 3 = 193.97 → 194
FISHER(0.40) = 0.4236,   n = (2.802 / 0.4236)² + 3 = 6.614² + 3 = 43.73 + 3 = 46.73 → 47

194 תלמידים כדי לגלות מתאם של .20, ורק 47 למתאם של .40. מתאם קטן פי 2 דורש מדגם גדול פי 4 בערך.

בדקו את עצמכם3 שאלות

1.כדי לגלות מתאם של .30 בעוצמה .80 צריך 85 נבדקים. בערך כמה צריך כדי לגלות מתאם של .15, באותם תנאים?

2.מה העוצמה של מחקר עם 200 תלמידים לגלות מתאם של .20 באוכלוסייה (דו־צדדי, α = .05)?

3.מאיפה בא ה־3 בנוסחה n = ((zα + zβ) / z′ρ)² + 3?

בתוכנה: מתאמים עם ערך p ורווח סמך

נבדוק את המתאמים בין קשיבות (mind_pre), שביעות רצון (sat_pre) וחרדה (anx_pre), עם ערכי p ורווחי סמך. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות.

באקסל אין פונקציה אחת שנותנת ערך p למתאם, אבל כל שלב הוא נוסחה קצרה. בקובץ המחקר sat_pre בעמודה AG ו־mind_pre בעמודה AH, בשורות 2 עד 201. העמודות BD ו־BE פנויות: בעמודה BD כותבים שמות, ובעמודה BE את הנוסחאות.

  1. המתאם ומספר הנבדקים: בתא BE2 =CORREL(AH2:AH201, AG2:AG201), ובתא BE3 =COUNT(AH2:AH201). אם יש ערכים חסריםMissing value, n הוא מספר השורות שיש בהן ערך בשני המשתנים.
  2. t וערך p: בתא BE4 =BE2*SQRT(BE3-2)/SQRT(1-BE2^2), ובתא BE5 =T.DIST.2T(ABS(BE4), BE3-2). ה־ABS חשוב: T.DIST.2T מחזירה שגיאה על t שלילי.
  3. הערך הקריטי של r: בתא BE6 =T.INV.2T(0.05, BE3-2)/SQRT(T.INV.2T(0.05, BE3-2)^2+BE3-2).
  4. רווח סמך: בתא BE7 =FISHER(BE2), בתא BE8 =1/SQRT(BE3-3), ואז הגבולות: בתא BE9 =FISHERINV(BE7-NORM.S.INV(0.975)*BE8), ובתא BE10 =FISHERINV(BE7+NORM.S.INV(0.975)*BE8).

תוצאות הנוסחאות

BDBE
2r0.3311
3n200
4t4.9375
5p1.68E-06
6r crit0.1388
7z'0.3441
8SE z'0.0712
9CI lower0.2016
10CI upper0.4492
p = 1.68E-06
כתיב מדעי: 0.00000168. בדיווח: p < .001.
r crit
כל מתאם בקובץ שגדול מ־.139 בערך מוחלט מובהק ברמה .05.
CI lower, CI upper
רווח הסמך, [.20, .45], כבר ביחידות של מתאם.

אפשר להחליף את הטווחים בתא BE2 ולקבל את אותו ניתוח לכל זוג. למטריצה שלמה: Data > Data Analysis > Correlation נותן את כל המתאמים בבת אחת, אבל בלי ערכי p. את ערכי p מחשבים לכל תא בנוסחאות של שלבים 2 ו־3. ולספירמן: מחשבים rs מהדירוגים (פרק 15), ומשתמשים באותן נוסחאות של שלב 2.

  1. Analyze > Correlate > Bivariate. מעבירים את mind_pre, sat_pre ו־anx_pre ל־Variables.
  2. מסמנים Pearson, ‏Two-tailed ו־Flag significant correlations. (One-tailed רק אם הכיוון נקבע מראש.)
  3. לרווח סמך, בגרסה 29 ואילך: כפתור Confidence interval, מסמנים Estimate confidence interval of bivariate correlation parameter, ומשאירים 95%. אל תסמנו Apply bias adjustment, כדי לקבל את רווח הסמך הרגיל של פישר.

Correlations

mind_presat_preanx_pre
mind_prePearson Correlation1.331**-.133
Sig. (2-tailed)<.001.061
N200200200
sat_prePearson Correlation.331**1-.218**
Sig. (2-tailed)<.001.002
N200200200
anx_prePearson Correlation-.133-.218**1
Sig. (2-tailed).061.002
N200200200
**. Correlation is significant at the 0.01 level (2-tailed).

Confidence Intervals

Pearson CorrelationSig. (2-tailed)95% CI Lower aUpper
mind_pre - sat_pre.331<.001.202.449
mind_pre - anx_pre-.133.061-.267.006
sat_pre - anx_pre-.218.002-.346-.082
a. Estimation is based on Fisher's r-to-z transformation.
Sig. (2-tailed)
ערך p הדו־צדדי של מבחן t למתאם. בין קשיבות לשביעות רצון: <.001.
** והערה בתחתית
שתי כוכביות: מובהק ברמה .01. כוכבית אחת: ברמה .05. החרדה והקשיבות, −.133, בלי כוכבית: p = .061.
N
מספר התלמידים עם ערך בשני המשתנים. דרגות החופש לדיווח: N − 2 = 198. SPSS לא מדפיס אותן.
Confidence Intervals
רווח הסמך של פישר, כבר ביחידות של מתאם: [.202, .449]. ובין החרדה לקשיבות הרווח כולל את האפס, [−.267, .006], כמו שמצופה כש־p גדול מ־.05.

לספירמן מסמנים באותו חלון גם Spearman. בטבלת Correlations (Nonparametric) מתקבל, בין m14 ל־attn_pre, ‏.187 עם Sig. = .008.

כפתור Confidence interval וטבלת Confidence Intervals קיימים מגרסה 29. בגרסאות קודמות מחשבים את רווח הסמך באקסל, בנוסחאות של לשונית Excel.

  1. Regression > Correlation (בקבוצה Classical).
  2. מעבירים את mind_pre, sat_pre ו־anx_pre ל־Variables. Pearson's r מסומן מראש, וגם Report significance.
  3. תחת Additional Options מסמנים Display pairwise (טבלה של זוגות במקום מטריצה), Confidence intervals (95%), ו־Sample size.
  4. Alt. Hypothesis נשאר Correlated, כלומר דו־צדדי. Correlated positively או negatively רק אם הכיוון נקבע מראש.

Pearson's Correlations

nPearson's rpLower 95% CIUpper 95% CI
mind_pre-sat_pre2000.331< .0010.2020.449
mind_pre-anx_pre200-0.1330.061-0.2670.006
sat_pre-anx_pre200-0.2180.002-0.346-0.082
Pearson's r ו־p
המתאם וערך p הדו־צדדי. JASP כותבת את המתאם עם 0 לפני הנקודה. בדיווח APA כותבים .33.
Lower, Upper 95% CI
רווח הסמך, ביחידות של מתאם. בין קשיבות לשביעות רצון [.20, .45].
n
מספר התלמידים בכל זוג. דרגות החופש: n − 2.

בלי Display pairwise מתקבלת מטריצה, כמו בפרק 15, ועם Flag significant correlations נוספות כוכביות. לספירמן מסמנים Spearman's rho: בין m14 ל־attn_pre מתקבל 0.187, p = .008.

כך נראה הפלט, בגרסה 0.19. סדר העמודות ושמותיהן עשויים להשתנות מעט בין גרסאות.

בדקו את עצמכם3 שאלות

1.באקסל, בתא עם =T.DIST.2T(BE4, 198) מופיעה השגיאה #NUM!. בתא BE4 יש t שלילי, −4.27. מה הפתרון?

1.ב־SPSS, איפה מבקשים רווח סמך למתאם פירסון?

1.ב־JASP, בחלון Correlation, מה מסמנים כדי לקבל טבלה של זוגות עם רווח סמך לכל מתאם?

2.בפלט מתאמים, ליד מתאם בין מספר האחים לבין משתנה אחר, כתוב N = 195. כמה דרגות חופש תכתבו בדיווח?

3.באקסל קיבלתם =FISHER(BE2) = 0.3441, וגבולות של רווח סמך ביחידות z′: 0.2045 ו־0.4837. מה עוד צריך לעשות לפני הדיווח?

3.ב־SPSS, בטבלת Correlations, ליד מתאם של −.133 אין כוכבית, וב־Sig. (2-tailed) כתוב .061. מה זה אומר, ואיך תדווחו?

3.ב־JASP, Pearson's r מופיע כ־-0.133, ו־p כ־0.061. איך כותבים את זה בדיווח APA?

איך מדווחים

במתאם, דרגות החופש נכתבות בסוגריים אחרי r, כמו אחרי t. ובגלל שמתאם לא יכול לעבור את 1, כותבים אותו בלי אפס לפני הנקודה, בדיוק כמו ערך p.

נמצא קשר חיובי ומובהק בין הקשיבות לבין שביעות הרצון מהחיים, r(198) = .33, p < .001, 95% CI [.20, .45]: תלמידים קשובים יותר דיווחו על שביעות רצון גבוהה יותר.

הקשר בין הקשיבות לבין החרדה לא היה מובהק, r(198) = −.13, p = .061, 95% CI [−.27, .01].

בתוכנית העקיפה המתאם בין הקשיבות לשביעות הרצון לא היה מובהק, r(49) = .14, p = .342, 95% CI [−.15, .40], אך הוא לא היה שונה באופן מובהק מהמתאם בתוכנית המשולבת, r(73) = .43, z = 1.73, p = .083.

ועוד כמה כללים. 1. כותבים "קשר בין" או "קשור ל", לא "משפיע על". 2. מדווחים את r גם כשהוא לא מובהק. 3. כשיש הרבה מתאמים, מציגים טבלה כמו בסעיף 7, עם N, ממוצעים, סטיות תקן והערה שמסבירה את הכוכביות. 4. לספירמן כותבים rs(198) = .19, p = .008.

טעויות נפוצות

בדקו את עצמכם

סיכום

t = r√(n − 2) / √(1 − r²),   df = n − 2,   rcrit = tcrit / √(tcrit² + df)
z′ = ½ ln((1 + r)/(1 − r)),   SE = 1/√(n − 3),   CI: FISHERINV(z′ ± 1.96 · SE)
z = (z′1 − z′2) / √(1/(n1 − 3) + 1/(n2 − 3)),   n = ((zα + zβ) / z′ρ)² + 3

מונחים חדשים

מתאם באוכלוסייהמבחן תמורותערך קריטי של rשונות משותפתטרנספורמציית פישרהשוואה בין שני מתאמים בלתי תלוייםמטריצת מתאמיםתיקון בונפרונימתאם נקודתי־דו־טורי

שאלות לדוגמה, עם פתרונות

  1. לכל אחד מהמשפטים הבאים, קבעו אם הוא נכון, ונמקו במשפט אחד. א. "r = .25 עם 400 נבדקים מובהק, ולכן זה קשר חזק." ב. "במחקר של 12 נבדקים יצא r = .50, p = .098, ולכן אין קשר." ג. "אם המתאם מובהק ברמה .05, רווח הסמך של 95% לא כולל את האפס." ד. "השערת האפס במבחן של מתאם היא שהמתאם במדגם הוא אפס."

    בדיקת התשובה

    א. לא נכון. מובהק, אבל .25² = .06: 6% שונות משותפת, קשר חלש עד בינוני. המובהקות נובעת בעיקר מגודל המדגם. ב. לא נכון. עם 12 נבדקים העוצמה נמוכה, ו־.50 הוא מתאם גדול. לא מצאנו ראיה, ולא הוכחנו שאין קשר. ג. נכון, בקירוב טוב: המבחן ורווח הסמך הם שני צדדים של אותו מטבע (פרק 19). (מבחן t ורווח הסמך של פישר מחושבים בדרכים מעט שונות, ולכן ממש על הגבול הם יכולים לחלוק.) ד. לא נכון. ההשערה היא על האוכלוסייה: ρ = 0.

  2. במחקר על 30 תלמידי חטיבת ביניים נמצא מתאם של .35 בין מספר ספרי הקריאה שקראו בשנה לבין הציון בהבנת הנקרא. א. חשבו t, דרגות חופש וערך p דו־צדדי. ב. מהו הערך הקריטי של r? ג. מה המסקנה, ומה הייתם ממליצים?

    בדיקת התשובה
    t = 0.35 · √28 / √(1 − 0.1225) = 0.35 · 5.292 / 0.937 = 1.852 / 0.937 = 1.98,   df = 28
    p = T.DIST.2T(1.98, 28) = .058
    tcrit = 2.048,   rcrit = 2.048 / √(2.048² + 28) = 2.048 / 5.674 = .361

    ג. .35 קטן מ־.361, ו־p = .058: לא דוחים את השערת האפס. אבל המתאם בינוני, 12% שונות משותפת. עם 30 תלמידים אין מספיק עוצמה. לגילוי מתאם של .35 בעוצמה .80 צריך כ־62 תלמידים. ההמלצה: לחזור על המחקר במדגם גדול יותר.

  3. אצל 40 מורות נמצא מתאם של .50 בין שנות הוותק לבין תחושת המסוגלות בניהול כיתה. בנו רווח סמך של 95% למתאם. מה אפשר לומר על עוצמת הקשרStrength of a relationship באוכלוסייה?

    בדיקת התשובה
    z′ = FISHER(0.50) = 0.549 1. ממירים
    SE = 1 / √37 = 0.164 2. טעות התקן
    0.549 ± 1.96 · 0.164 = 0.549 ± 0.322 → [0.227, 0.872] 3. ביחידות z′
    FISHERINV(0.227) = .22,   FISHERINV(0.872) = .70 4. מחזירים

    95% CI [.22, .70]. האפס לא ברווח, ולכן המתאם מובהק. אבל הרווח רחב מאוד: מקשר חלש עד קשר חזק מאוד. ושימו לב שהוא לא סימטרי סביב .50: .28 כלפי מטה, ורק .20 כלפי מעלה.

  4. קראו את הפלט, מאותו מחקר, מיד אחרי התוכנית. א. איזה מתאם הוא החזק ביותר, ומה השונות המשותפת שלו? ב. אילו מתאמים מובהקים ברמה .05? ג. כמה מבחנים יש בטבלה, ואילו מתאמים נשארים מובהקים אחרי תיקון בונפרוני? ד. דווחו את הקשר בין החרדה לבין ההרגשה בכיתה בסגנון APA.

    Correlations

    sat_postmind_postanx_postclim_post
    sat_postPearson Correlation1.349**-.190**.284**
    Sig. (2-tailed)<.001.007<.001
    mind_postPearson Correlation.349**1-.164*.308**
    Sig. (2-tailed)<.001.020<.001
    anx_postPearson Correlation-.190**-.164*1-.233**
    Sig. (2-tailed).007.020<.001
    clim_postPearson Correlation.284**.308**-.233**1
    Sig. (2-tailed)<.001<.001<.001
    N = 200 בכל התאים. **. p < .01. *. p < .05 (2-tailed).
    בדיקת התשובה

    א. שביעות רצון וקשיבות, .349. שונות משותפת: .349² = .12, כ־12%.

    ב. כל שישת המתאמים מובהקים. חמישה ברמה .01, ואחד, קשיבות וחרדה (p = .020), ברמה .05.

    4 · 3 / 2 = 6 מבחנים,   .05 / 6 = .0083 ג. רמת המובהקות לכל מתאם

    ג. נופל רק הקשר בין קשיבות לחרדה (.020 > .0083). שביעות רצון וחרדה (.007) נשאר, ממש על הגבול. השאר מובהקים בבירור.

    ד. "נמצא קשר שלילי ומובהק בין החרדה לבין ההרגשה בכיתה אחרי התוכנית, r(198) = −.23, p < .001: תלמידים חרדים יותר הרגישו פחות טוב בכיתה." ואם רוצים רווח סמך: 95% CI [−.36, −.10].

  5. בקובץ המחקר, המתאם בין החרדה לבין התלונות הגופניות לפני התוכנית הוא .44 אצל 96 הבנים (p < .001), ו־.12 אצל 104 הבנות (p = .208). א. האם הקשר שונה בין בנים לבנות? ב. השוו לשאלת הפתיחה של הפרק. מה שונה כאן?

    בדיקת התשובה
    FISHER(0.439) = 0.471,   FISHER(0.125) = 0.125
    SE = √(1/93 + 1/101) = √(0.01075 + 0.00990) = √0.02065 = 0.1437
    z = (0.471 − 0.125) / 0.1437 = 2.40
    p = 2 · (1 − NORM.S.DIST(2.40, TRUE)) = .016

    א. כן. ההבדל מובהק: אצל הבנים החרדה קשורה לתלונות גופניות חזק יותר מאשר אצל הבנות. ב. גם בשאלת הפתיחה היה מתאם מובהק מול לא מובהק, אבל שם ההבדל לא היה מובהק (p = .083). ביחידות של z′ ההבדל כאן דומה לזה שבשאלת הפתיחה (.35 כאן, .32 שם), אבל המדגמים גדולים יותר, ולכן טעות התקן של ההבדל קטנה יותר (0.144 לעומת 0.186). זו בדיוק ההמחשה: את ההבדל בודקים ישירות, ותוצאתו תלויה בגודל ההבדל ובגודל המדגמים, לא בשאלה איזה מתאם "עבר" את .05.

  6. חוקרת מתכננת מחקר המשך לתוכנית העקיפה. היא רוצה לדעת אם הקשיבות קשורה לשביעות הרצון גם בתוכנית כזו, ומניחה שהמתאם באוכלוסייה הוא כ־.25. א. כמה תלמידים היא צריכה לעוצמה .80, בבדיקה דו־צדדית ברמה .05? ב. בבית ספר אחד יש לה רק 51 תלמידים, כמו במחקר שלנו. מה העוצמה? ג. מה תמליצו לה?

    בדיקת התשובה
    FISHER(0.25) = 0.2554 א
    n = (2.802 / 0.2554)² + 3 = 10.97² + 3 = 120.32 + 3 = 123.32 → 124
    0.2554 · √48 − 1.96 = 0.2554 · 6.928 − 1.96 = 1.770 − 1.96 = −0.19 ב. המרחק בטעויות תקן, פחות הערך הקריטי
    עוצמה = NORM.S.DIST(−0.19, TRUE) = .42

    א. 124 תלמידים. ב. עם 51 תלמידים העוצמה כ־.42: פחות מחצי סיכוי לגלות קשר שקיים. ג. לגייס עוד בתי ספר, כדי להגיע ל־124 לפחות, ולהוסיף כמה אחוזים לנשירה. אם זה לא אפשרי, לדווח מראש שהמחקר יכול לגלות רק קשרים חזקים, ולהציג רווחי סמך ולא רק ערך p.

תרגול עם הנתונים

הקבצים עצמם, care_school.csv ומילון המשתנים, נמצאים גם בתיקיית data בחבילת הספר. ערך 99 מסמן נתון חסר בפריטים ובמשתני הרקע.

  1. האם התחושה שהמורה זמינה ומקבלת (teach_pre) קשורה להרגשה בכיתה (clim_pre)? דווחו r, דרגות חופש, ערך p ורווח סמך.
    בדיקת התשובה

    כן: r(198) = .28, p < .001, 95% CI [.14, .40]. קשר חיובי, בין קטן לבינוני: כ־8% שונות משותפת.

  2. חשבו את המתאם בין הקשיבות לשביעות הרצון לפני התוכנית בנפרד לבנים ולבנות, כמו שלמדנו בפרק 16. האם כל מתאם מובהק? והאם הם שונים זה מזה?
    בדיקת התשובה

    בנים: r(94) = .26, p = .010. בנות: r(102) = .40, p < .001. שניהם מובהקים. ההבדל ביניהם: z = (0.425 − 0.269) / √(1/93 + 1/101) = 1.09, p = .278. לא מובהק: אין ראיה שהקשר שונה בין בנים לבנות.

  3. בתוכנית המשולבת, האם תלמידים שהקשיבות שלהם עלתה יותר הם גם אלה ששביעות הרצון שלהם עלתה יותר? חשבו לכל תלמיד ציון שינויDifference score (אחרי פחות לפני) בשני המשתנים, ומתאם בין ציוני השינוי. ומה בקבוצת הביקורת?
    בדיקת התשובה

    בתוכנית המשולבת: r(73) = .35, p = .002, 95% CI [.13, .54]. מי שהקשיבות שלו עלתה יותר, גם שביעות הרצון שלו עלתה יותר. בקבוצת הביקורת: r(72) = .20, p = .089, לא מובהק. אבל זכרו את סעיף 6: כדי לטעון שהקשר שונה בין הקבוצות צריך לבדוק את ההבדל ישירות, והוא לא מובהק (z = 0.98, p = .327). וכמובן, גם המתאם בתוכנית לא מוכיח שהקשיבות היא שגרמה לעלייה בשביעות הרצון.

  4. חשבו מטריצת מתאמים של שבעת המדדים לפני התוכנית (sat_pre עד clim_pre). כמה מתאמים יש? כמה מובהקים ברמה .05, וכמה אחרי תיקון בונפרוני?
    בדיקת התשובה

    7 · 6 / 2 = 21 מתאמים. 19 מובהקים ברמה .05: כל המתאמים חוץ מקשיבות וחרדה (p = .061) וקשיבות וזמינות המורה (r = .12, p = .090). אחרי בונפרוני (.05 / 21 = .0024) נשארים 14.

  5. האם יש קשר בין השכלת ההורה (parent_edu, בלי ערכי 99) לבין הקשיבות של הילד (mind_pre)? באיזה מתאם תשתמשו?
    בדיקת התשובה

    השכלת ההורה היא סולם סדר, ולכן ספירמן: rs(192) = −.02, p = .822, אצל 194 תלמידים. לא נמצא קשר. ושימו לב לדרגות החופש: 194 פחות 2.

בפרק הבא: איזה מבחן? עד עכשיו למדנו מבחן z, מבחני t למדגם בודד ולשני מדגמים, מבחנים א־פרמטרייםNonparametric test, חי בריבועChi-square statistic ומתאם. ראינו גם שלפעמים אותה שאלה נשאלת בשני מבחנים, כמו מבחן t ומתאם נקודתי־דו־טוריPoint-biserial correlation. בפרק 25 נסדר את כולם בעץ החלטהDecision tree אחד, לפי סוג המשתנים ומספר הקבוצות.

מקורות: Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Erlbaum. · Faul, F., Erdfelder, E., Buchner, A., & Lang, A.-G. (2009). Statistical power analyses using G*Power 3.1: Tests for correlation and regression analyses. Behavior Research Methods, 41(4), 1149–1160. https://doi.org/10.3758/BRM.41.4.1149 · Fisher, R. A. (1915). Frequency distribution of the values of the correlation coefficient in samples from an indefinitely large population. Biometrika, 10(4), 507–521. · Fisher, R. A. (1921). On the "probable error" of a coefficient of correlation deduced from a small sample. Metron, 1, 3–32. · Gelman, A., & Stern, H. (2006). The difference between "significant" and "not significant" is not itself statistically significant. The American Statistician, 60(4), 328–331. https://doi.org/10.1198/000313006X152649 · Steiger, J. H. (1980). Tests for comparing elements of a correlation matrix. Psychological Bulletin, 87(2), 245–251. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y