חלק ב: תיאור נתונים · פרק 15
מתאם: תיאור הקשר
עד עכשיו תיארנו כל משתנה לבדו: איפה המרכז שלו, כמה הוא מפוזר, ומה הצורה שלו. בפרק הזה מתחילים לשאול על שני משתנים יחד. האם תלמידים קשובים יותר מרוצים יותר מהחיים? האם מי שהיה חרד לפני התוכנית נשאר חרד גם אחריה? נכיר את דיאגרמת הפיזורMeasure of dispersion, את מקדם המתאם של פירסוןPearson correlation coefficient ואת מתאם ספירמןSpearman correlation, ונלמד מתי המספר הזה מטעה.
בקובץ המחקר, תלמידים עם ציון קשיבות גבוה מדווחים בממוצע על שביעות רצון גבוהה יותר מהחיים. האם זה אומר שהקשיבות מגבירה את שביעות הרצון?
לא בהכרח. אולי ילדים מרוצים פשוט פנויים יותר להיות קשובים. ואולי משהו שלישי, כמו בית תומך, משפיע על שניהם. בסוף הפרק תדעו למדוד כמה חזק הקשר, ותדעו גם מה המספר לא אומר.
בסוף הפרק תוכלו
- לקרוא דיאגרמת פיזורScatter plot: כיוון, עוצמה וצורה.
- להסביר למה מקדם המתאםCorrelation הוא ממוצע המכפלות של ציוני התקן, ולחשב אותו ביד.
- לפרש את ואת r², ולדעת מתי עדיף מתאם ספירמן.
- לזהות ארבע מלכודות: קשר לא לינארי, ערך קיצוניOutlier, קיצוץ תחוםRestriction of range וסיבתיותCausality.
- להפיק דיאגרמת פיזור ומתאמים באקסל, ב־SPSS וב־JASP.
שני משתנים יחד: דיאגרמת פיזור
בדיאגרמת פיזור כל נקודה היא נבדק אחד: המיקום האופקי לפי משתנה אחד, והאנכי לפי השני. על כל דיאגרמה שואלים שלוש שאלות: כיוון (עולים יחד או בכיוונים הפוכים), עוצמה (כמה הנקודות קרובות לקו ישר), וצורה (קו ישר או עקומה).
לפני כל מספר, מסתכלים. בדיאגרמת פיזור כל תלמיד הוא נקודה אחת. תלמיד עם קשיבות 3.9 ושביעות רצון 5.2 יושב בנקודה שמעל 3.9 בציר האופקי ומול 5.2 בציר האנכי. 200 תלמידים, 200 נקודות. מקובל לשים על הציר האופקי את המשתנה שנראה לנו "המסביר", ועל האנכי את "המוסבר". במתאם זו רק מוסכמה: כמו שנראה, המתאם בין X ל־Y זהה למתאם בין Y ל־X.
שלוש שאלות על כל דיאגרמה:
- כיוון. חיובי: הנקודות עולות משמאל לימין, ושני המשתנים עולים יחד. שלילי: כשאחד עולה, השני נוטה לרדת.
- עוצמה. כמה הנקודות צמודות לקו ישר. חזק: ענן צר ומוארך. חלש: ענן רחב, כמעט עגול.
- צורה. האם הקשר נראה כמו קו ישר (קשר לינאריLinear relationship), או כמו עקומה. זה חשוב, כי מקדם המתאם של פירסון מודד רק את החלק הישר של הקשר.
ארבע דיאגרמות מקובץ המחקר:
החרדה לפני התוכנית ואחריה: ענן צר ועולה. מי שהיה חרד לפני, נשאר חרד יחסית גם אחרי. קשיבות ושביעות רצון: עדיין עולה, אבל הענן רחב בהרבה. חרדה והרגשה בכיתה: הענן יורד מעט. וגיל וקשיבות: אין שום כיוון. שימו לב שגם בקשר החזק ביותר יש תלמידים שלא "מצייתים" למגמה. מתאם מתאר נטייה כללית, לא חוק שחל על כל תלמיד.
המספרים מעל כל דיאגרמה הם מקדמי המתאם. בקטע הבא נראה מאיפה הם באים.
בדיאגרמת פיזור של "שעות מסך ביום" (אופקי) ו"שעות שינה" (אנכי) של תלמידי כיתה ה׳, הנקודות יורדות משמאל לימין ויוצרות ענן צר. איך תתארו את הקשר? ומה הייתם מצפים לראות בדיאגרמה של "מספר נעליים" ו"ציון במתמטיקה" באותה כיתה?
בדיקת התשובה
שלילי וחזק: יותר מסך הולך עם פחות שינה, והנקודות צמודות לקו. במספר נעליים וציון במתמטיקה, בתוך כיתה אחת, מצפים לענן בלי כיוון. (בכל בית הספר יחד התמונה משתנה. נחזור לזה במלכודות.)
בדקו את עצמכם3 שאלות
1.בדיאגרמת פיזור של קשיבות ושביעות רצון יש 200 נקודות. מה מייצגת כל נקודה?
2.הנקודות בדיאגרמה יוצרות פס צר שיורד משמאל לימין. איך מתארים את הקשר?
3.מקובל לשים את המשתנה ה"מסביר" על הציר האופקי. אם נחליף בין הצירים, מה יקרה למתאם?
מקדם המתאם של פירסון: ממוצע המכפלות של ציוני התקן
לכל נבדק מחשבים ציון תקןz-score בשני המשתנים, ומכפילים. גבוה בשניהם או נמוך בשניהם: מכפלה חיובית. גבוה באחד ונמוך בשני: מכפלה שלילית. מקדם המתאם של פירסון הוא (כמעט) ממוצע המכפלות: r = Σ(zx · zy) / (n − 1).
הרעיון שמאחורי המתאם הוא קיצוניות משותפת. זוכרים את ציוני התקן מפרק 13? ציון תקןz-score אומר כמה סטיות תקן ערך נמצא מעל הממוצע או מתחתיו. אם הקשר בין שני משתנים מושלם, הקיצוניות של כל תלמיד במשתנה אחד שווה בדיוק לקיצוניות שלו במשתנה השני: מי שנמצא 1.5 סטיות תקן מעל הממוצע בקשיבות, נמצא 1.5 סטיות תקן מעל הממוצע גם בשביעות הרצון. ואם אין קשר, הקיצוניות באחד לא אומרת כלום על הקיצוניות בשני.
איך הופכים את זה למספר? מכפילים, לכל תלמיד, את שני ציוני התקן שלו:
- מעל הממוצע בשניהם: חיובי כפול חיובי, המכפלה חיובית.
- מתחת לממוצע בשניהם: שלילי כפול שלילי, גם המכפלה חיובית.
- מעל באחד ומתחת בשני: המכפלה שלילית.
ולמה דווקא מכפלה? כי היא "מתגמלת" קיצוניות משותפת. תלמיד עם ציון תקן 3 בשני המשתנים תורם 3 · 3 = 9. תלמיד עם 3 באחד ו־1 בשני תורם רק 3. אחר כך מחברים את כל המכפלות. בקשר חיוביPositive relationship רוב המכפלות חיוביות והסכום גדול. בקשר שלילי הסכום שלילי. ובלי קשר, המכפלות החיוביות והשליליות מקזזות זו את זו, והסכום קרוב לאפס.
נשארה בעיה אחת: הסכום גדל ככל שיש יותר נבדקים. לכן מחלקים. במקום ב־, מחלקים ב־n − 1, מאותה סיבה שבגללה סטיית התקן בספר מחלקת ב־n − 1 (פרק 11). ציוני התקן מחושבים עם אותה סטיית תקן, ולכן החלוקה צריכה להתאים לה.
בדיאגרמה של קשיבות ושביעות רצון, הקווים המקווקווים עוברים בממוצעים, ומחלקים את הגרף לארבעה רביעים. ברביע הימני העליון ובשמאלי התחתון המכפלות חיוביות. בשני האחרים, שליליות. אצלנו 135 מתוך 200 התלמידים נמצאים ברביעים החיוביים. סכום כל המכפלות הוא 65.89, וחלקי 199 זה r = .33.
לחמישה תלמידים נרשם מספר הספרים שקראו בחודש (X), וציון במבחן הבנת הנקרא, מ־1 עד 5 (Y). מהו מקדם המתאם?
| תלמיד | x | y | zx | zy | zx · zy |
|---|---|---|---|---|---|
| 1 | 1 | 1 | −1.26 | −1.26 | 1.6 |
| 2 | 2 | 3 | −0.63 | 0 | 0 |
| 3 | 3 | 2 | 0 | −0.63 | 0 |
| 4 | 4 | 5 | 0.63 | 1.26 | 0.8 |
| 5 | 5 | 4 | 1.26 | 0.63 | 0.8 |
| Σ | 15 | 15 | 3.2 |
מסקנה: קשר חיוביPositive relationship וחזק. תלמידים שקוראים יותר ספרים נוטים לקבל ציון גבוה יותר בהבנת הנקרא. שימו לב לתלמידים 2 ו־3: כל אחד מהם בדיוק בממוצע באחד המשתנים, ולכן לא תרם כלום למתאם.
ניסוי קטן: מה המתאם מודד?Experiment
נניח שנשאיר את כל 200 ציוני שביעות הרצון בדיוק כמו שהם, אבל נחלק אותם לתלמידים באקראי, כמו שמערבבים חפיסת קלפים. הממוצע של שביעות הרצון לא ישתנה. גם סטיית התקן לא. אבל המתאם עם הקשיבות יצנח לקרוב לאפס, כי עכשיו המכפלות החיוביות והשליליות יקזזו זו את זו. המסקנה: המתאם לא מתאר אף משתנה לבדו. הוא מתאר את השיוך: האם הקיצוניים במשתנה אחד הם אותם תלמידים כמו הקיצוניים בשני.
בהרבה ספרי מבוא כתוב r = Σ zxzy / n. גם זה נכון, אם ציוני התקן חושבו עם סטיית תקן שמחלקת ב־n. מה שחשוב הוא העקביות: אותו מכנה בסטיית התקן ובחלוקת הסכום. בשני המקרים יוצא בדיוק אותו r. בספר, כמו ב־SPSS, ב־JASP ובפונקציה STANDARDIZE של אקסל, סטיית התקן מחלקת ב־n − 1, ולכן גם הסכום מחולק ב־n − 1.
ועוד שאלה שאני שואל בכיתה: מה המספר המינימלי של נבדקים? עם שני נבדקים בלבד, המתאם תמיד 1 או −1: דרך שתי נקודות תמיד עובר קו ישר. צריך לפחות שלושה כדי שהמספר יגיד משהו, והרבה יותר כדי לסמוך עליו.
מעבדה: מתאם פירסון דרך ציוני תקן
- בחרו "קשר חיובי". באילו רביעים נמצאות הנקודות? בדקו בטבלה שהמתאם הוא סכום המכפלותSum of products חלקי 4.
- בחרו "קשר שלילי". למה כמעט כל המכפלות שליליות?
- בחרו "בלי קשר". מה קורה לסכום המכפלות?
בדיקת התשובה
1. ברביע הימני העליון ובשמאלי התחתון. סכום המכפלות 3.373, חלקי 4 (חמש נקודות פחות אחת): .843. 2. כי מי שגבוה ב־X נמוך ב־Y, ולהפך: ציון תקן חיובי כפול שלילי. המתאם −.941. 3. מכפלות חיוביות ושליליות מקזזות זו את זו. הסכום 0.258, והמתאם .065, כמעט אפס.
ארבעה תלמידים. X: 2, 4, 6, 8. Y: 3, 1, 7, 5. הממוצעים 5 ו־4, וסטיית התקן בשני המשתנים 2.582. חשבו את ציוני התקן, את המכפלות ואת r.
בדיקת התשובה
קשר חיובי. יש לו עוצמה, אבל הוא רחוק ממושלם: תלמידים 1 ו־2 "מחליפים מקומות" ב־Y.
בדקו את עצמכם3 שאלות
1.לתלמידה ציון תקן 2 בקשיבות ו־−0.5 בשביעות רצון. מה המכפלה שלה, ולאן היא "מושכת" את המתאם?
2.שלושה תלמידים. ציוני התקן במשתנה הראשון: −1, 0, 1. במשתנה השני: −1, 1, 0. חשבו את r.
3.מערבבים באקראי את ציוני שביעות הרצון בין 200 התלמידים, ומשאירים את הקשיבות במקומה. מה יקרה לסטיית התקן של שביעות הרצון, ומה למתאם?
מקו־וריאנס למתאם
הקו־וריאנס (Covariance) הוא ממוצע המכפלות של הסטיות מהממוצע, בלי לחלק בסטיות התקן: cov = Σ(x − Mx)(y − My) / (n − 1). הוא תלוי ביחידות המדידה, ולכן קשה לפרש אותו. המתאם הוא הקו־וריאנס אחרי תקנון: r = cov / (SDx · SDy).
אם מציבים בנוסחת המתאם את ההגדרה של ציון התקן, סטיות התקן יוצאות החוצה, ובפנים נשאר משהו חדש: סכום המכפלות של הסטיות מהממוצע, חלקי n − 1. זה הקו־וריאנס.
שימו לב כמה הקו־וריאנס דומה לשונות. בשונות מכפילים כל סטייה בעצמה: (x − M)(x − M). בקו־וריאנס מכפילים את הסטייה ב־X בסטייה ב־Y של אותו תלמיד. השם אומר את זה: co־variance, שונות ש"משותפת" לשני המשתנים. ואם מחשבים את הקו־וריאנס של משתנה עם עצמו, מקבלים בדיוק את השונות שלו.
אז למה לא להסתפק בקו־וריאנס? כי אין לו קנה מידה. הקו־וריאנס בין הקשיבות לשביעות הרצון בקובץ שלנו הוא 0.18. הרבה או מעט? אי אפשר לדעת. אילו מדדנו שביעות רצון בסולם 0 עד 100 במקום 1 עד 7, הקו־וריאנס היה גדל פי כמה, והקשר עצמו לא היה משתנה. הקו־וריאנס יכול לקבל כל ערך, מאינסוף שלילי ועד אינסוף. החלוקה במכפלת סטיות התקן מתקננת אותו: 0.1815 / (0.5464 · 1.0031) = .33. עכשיו יש מספר בין −1 ל־1, בלי יחידות. כמו שאני אומר בכיתה: קו־וריאנס ומתאם הם אותו דבר, בשתי שפות שונות.
ומה אם לכל התלמידים אותו ציון במשתנה אחד? סטיית התקן שלו אפס, ומחלקים באפס. המתאם פשוט לא מוגדר. סטטיסטיקה מניחה שאנשים שונים זה מזה: בלי הבדלים, אין מה לתאם.
בספרים ישנים תמצאו נוסחה נוספת, שנראית אחרת לגמרי:
SS הוא סכום הריבועיםSum of squares מפרק 11, ו־SP הוא סכום המכפלות. בדוגמה: 8 / √(10 · 10) = 0.80. זו אותה נוסחה בדיוק: ה־n − 1 מצטמצם. היא נולדה בשנות השלושים, כשחישבו ביד, כדי לחסוך את חישוב ציון התקן של כל נבדק. היום אין בה צורך, אבל היא מסבירה מאיפה הגיע הביטוי "סכום המכפלות" שתפגשו ברגרסיה.
ועוד הערה היסטורית: המקדם קרוי על שם קרל פירסון (Karl Pearson), שפיתח אותו בסוף המאה ה־19. אל תבלבלו עם בנו, אגון פירסון, גם הוא סטטיסטיקאי חשוב.
בדקו את עצמכם3 שאלות
1.הקו־וריאנס בין שני מבחנים הוא 6. סטיות התקן הן 2 ו־5. מהו המתאם?
2.מה מקבלים כשמחשבים את הקו־וריאנס של משתנה עם עצמו?
3.במחקר על כיתה ה׳ בבית ספר אחד, כל התלמידים בני 10 בדיוק, לפי השנה. חוקר מבקש מהתוכנה מתאם בין הגיל לבין ציון בחשבון. מה הוא יקבל, ולמה?
כיוון ועוצמה: איך קוראים את r
נע בין −1 ל־1. הסימן הוא הכיוון, והערך המוחלט הוא העוצמה. כלל אצבע של כהן: .10 קטן, .30 בינוני, .50 גדול, אבל בכל תחוםRange הנורמות שונות. r² הוא השונות המשותפת: איזה חלק מהשונות במשתנה אחד "מוסבר" על ידי השני.
| המתאם | המשמעות |
|---|---|
| 1 | קשר לינארי חיובי מושלם: כל הנקודות על קו ישר עולה |
| בין 0 ל־1 | קשר חיובי. ככל שקרוב יותר ל־1, חזק יותר |
| 0 | אין קשר לינארי |
| בין −1 ל־0 | קשר שלילי. ככל שקרוב יותר ל־−1, חזק יותר |
| −1 | קשר לינארי שלילי מושלם |
הסימן אומר רק את הכיוון. לכן r = −.47 הוא קשר חזק יותר מ־r = .30. העוצמה נקבעת לפי הערך המוחלט.
כמה זה הרבה?
מקדם המתאם הוא בעצמו גודל אפקטEffect size: הוא אומר כמה חזק הקשר, ללא תלות בגודל המדגם (נרחיב על גדלי אפקט בפרק 19). כהן (Cohen, 1988) הציע סימני דרך: בערך .10 קשר קטן, .30 בינוני, ו־.50 גדול. אבל אלה סימני דרך כלליים מאוד, וכהן עצמו כתב שעדיף להשתמש בנורמות של התחוםRange. במדעי החברה ובחינוך, מתאם של .30 הוא לא רע בכלל: התנהגות של ילדים מושפעת מהמון דברים, ואף משתנה אחד לא יסביר את רובה. לעומת זאת, כשבודקים אם שתי גרסאות של אותו מבחן נותנות ציונים דומים, .70 הוא מאכזב.
| זוג המשתנים בקובץ | r | r² | תיאור |
|---|---|---|---|
| חרדה לפני ואחרי התוכנית | .71 | .51 | חיובי, גדול |
| קשיבות ושביעות רצון | .33 | .11 | חיובי, בינוני |
| חרדה והרגשה בכיתה | −.29 | .08 | שלילי, קרוב לבינוני |
| חרדה ותלונות גופניות | .26 | .07 | חיובי, בין קטן לבינוני |
| גיל וקשיבות | .00 | .00 | אין קשר |
r בריבוע: השונות המשותפת
מעלים את המתאם בריבוע, ומקבלים מספר שקל לפרש באחוזים. המתאם בין הקשיבות לשביעות הרצון הוא .33, ובריבוע .11. כלומר, 11% מהשונות בשביעות הרצון "משותפים" לקשיבות. אפשר לומר זאת גם כך: אם נדע את ציון הקשיבות של תלמיד, נוכל להסביר בעזרתו 11% מההבדלים בשביעות הרצון בין התלמידים. לכן r² נקרא גם אחוז השונות המוסברתR squared. 89% הנותרים קשורים לדברים אחרים.
r² מלמד גם צניעות. מתאם של .50, "גדול" לפי כהן, משתף רק 25% מהשונות. ומתאם של .10 משתף אחוז אחד בלבד. ומילה על המילה "מוסברת": היא סטטיסטית, לא סיבתית. 11% "מוסברים" לא אומר שהקשיבות גורמת ל־11% משביעות הרצון. נשוב לזה במלכודות.
כל המתאמים בפרק הזה מתארים את 200 התלמידים שבקובץ. האם הקשר קיים גם באוכלוסייה, או שיצא במקרה? זו שאלה של מובהקות, ונענה עליה בפרק 24. ותזכורת מראש: במדגם גדול מאוד גם מתאם זעיר יוצא מובהק. לכן מדווחים תמיד את r עצמו, ולא רק אם הוא מובהק.
א. איזה מתאם מתאר קשר חזק יותר: −.60 או .40? ב. כמה שונות משותפתShared variance יש בכל אחד? ג. המתאם בין שביעות הרצון לפני התוכנית ואחריה הוא .79. כמה אחוזים מהשונות משותפים?
בדיקת התשובה
א. −.60 חזק יותר. ב. 36% ו־16%. ג. 62% (מהמתאם המדויק: .7859² = .618).
בדקו את עצמכם3 שאלות
1.במחקר אחד r = −.40, ובאחר r = .35. מה נכון?
2.המתאם בין ההרגשה בכיתה לבין התחושה שהמורה זמינה ומקבלת (clim_pre, teach_pre) הוא .28. כמה שונות משותפת יש ביניהם?
3.במחקר על 3,000 תלמידים נמצא מתאם מובהק של .08 בין שעות שינה לציון. איך הייתם מתארים אותו?
מה לא משנה את המתאם
המתאם לא תלוי ביחידות. טרנספורמציה לינאריתLinear transformation (הוספת קבועAdding a constant, הכפלה בקבועMultiplying by a constant חיובי) לא משנה אותו. הכפלה בקבוע שלילי הופכת רק את הסימן: r = −.29 הופך ל־.29. המתאם גם סימטרי: בין X ל־Y כמו בין Y ל־X.
המתאם בין גובה למשקל זהה בישראל, שבה מודדים בסנטימטרים ובקילוגרמים, ובארצות הברית, שבה מודדים באינצ׳ים ובפאונדים. למה? כי המעבר בין היחידות הוא טרנספורמציה לינאריתLinear transformation, y = a + b·x (פרק 6). טרנספורמציהTransformation כזו מזיזה את הממוצע ומשנה את סטיית התקן באותו יחס (פרק 11), ולכן ציוני התקן לא משתנים. ואם ציוני התקן לא משתנים, גם ממוצע המכפלות שלהם לא משתנה.
דוגמה מהקובץ: הקשיבות נמדדת מ־1 עד 5. אם נמיר אותה לסולם 0 עד 100, y = 25 · (x − 1), המתאם עם שביעות הרצון יישאר .33. חיסור, הוספה, הכפלה וחלוקה במספר חיובי: כולם לא נוגעים במתאם.
ומה עם מכפיל שלילי? נניח שבמקום חרדה רוצים לדבר על "רוגע": רוגע שווה 5 פחות החרדה, כך שתלמיד עם חרדה 1 מקבל רוגע 4. כל ציון תקן מחליף סימן, ולכן כל מכפלה מחליפה סימן. העוצמה נשמרת, והכיוון מתהפך: המתאם בין חרדה להרגשה בכיתה הוא −.29, והמתאם בין רוגע להרגשה בכיתה הוא .29. זה בדיוק מה שקורה כשהופכים פריט בשאלון, ונראה את זה בפרק הבא.
לעומת זאת, טרנספורמציה לא לינארית, כמו העלאה בריבוע, שורש או לוגריתם, כן משנה את המתאם. לפעמים זו בדיוק המטרה, כמו שנראה במלכודת הראשונה.
המתאם בין גובה בסנטימטרים למשקל בקילוגרמים הוא .65. מה יהיה המתאם אם: א. נמיר את הגובה למטרים? ב. נמיר את המשקל לפאונדים (כפול 2.2)? ג. נחשב "חוסר גובה" = 200 פחות הגובה בסנטימטרים?
בדיקת התשובה
א. .65: חלוקה במאה היא מכפיל חיובי. ב. .65: הכפלה ב־2.2. ג. −.65: חיסור מ־200 הוא הכפלה ב־−1 והוספת קבועAdding a constant. העוצמה נשמרת, והסימן מתהפך.
בדקו את עצמכם3 שאלות
1.המתאם בין טמפרטורת הכיתה במעלות צלזיוס לבין ריכוז התלמידים הוא −.25. מה יהיה המתאם אם נמדוד בפרנהייט (32 + 1.8·C)?
2.המתאם בין החרדה (anx_pre, 1 עד 4) לבין שביעות הרצון הוא −.22. חוקרת מחשבת "רוגע" = 5 פחות החרדה, ואחר כך ממירה את הרוגע לסולם 0 עד 100. מה המתאם בין הסולם החדש לשביעות הרצון?
3.איזו מהטרנספורמציותTransformation הבאות עשויה לשנות את הערך המוחלט של המתאם?
מתאם ספירמן: מתאם על דירוגיםRank
מתאם ספירמן הוא מתאם פירסון על הדירוגים. מחליפים כל ערך בדירוג שלו בתוך המשתנה (ערכים שווים מקבלים את ממוצע הדירוגים), ומחשבים מתאם. משתמשים בו כשמשתנה בסולם סדרOrdinal scale, כשיש ערכים קיצוניים, או כשהקשר עולה אבל לא בקו ישר (קשר מונוטוניMonotonic relationship).
מתאם פירסון דורש ששני המשתנים יהיו בסולם רווחInterval scale או מנה (פרק 6). מה עושים כשאחד מהם הוא פריט בודד בשאלון, בסולם סדרOrdinal scale? או מקום בתחרות? אז לא משתמשים בערכים עצמם, אלא רק בסדר שלהם. מסדרים את התלמידים מהנמוך לגבוה בכל משתנה, נותנים דירוג 1 לנמוך ביותר, 2 לבא אחריו, וכן הלאה, ומחשבים מתאם פירסון על הדירוגים.
ערכים חוזריםTies. ערכים שווים מקבלים את ממוצע הדירוגים שהיו מקבלים. אם שני ערכים של 12 תופסים את המקומות 2 ו־3, כל אחד מקבל 2.5, והערך הבא מקבל 4. בפריט m14 בקובץ ("המחשבות שלי נודדות כשהמורה מדברת"), 23 תלמידים ענו 1. הם תופסים את המקומות 1 עד 23, וכל אחד מקבל את הממוצע, 12.
מה ספירמן מודד? לא קשר לינארי, אלא קשר מונוטוניMonotonic relationship: האם כשמשתנה אחד עולה, השני נוטה לעלות (או לרדת), גם אם לא בקו ישר. כל קשר לינארי הוא מונוטוני, אבל לא כל קשר מונוטוני הוא לינארי.
חישוב ביד, כשאין ערכים חוזרים
כשאין ערכים חוזרים, יש נוסחה קצרה. d הוא ההפרש בין שני הדירוגים של אותו נבדק:
| עוגה | שופט א | שופט ב | d | d² |
|---|---|---|---|---|
| א | 1 | 2 | −1 | 1 |
| ב | 2 | 1 | 1 | 1 |
| ג | 3 | 4 | −1 | 1 |
| ד | 4 | 3 | 1 | 1 |
| ה | 5 | 6 | −1 | 1 |
| ו | 6 | 5 | 1 | 1 |
| Σ | 6 |
השופטים מסכימים מאוד. עם ערכים חוזריםTies הנוסחה הקצרה כבר לא מדויקת, ומחשבים מתאם פירסון על הדירוגים. בתוכנה זה קורה לבד.
בקובץ המחקר
האם תלמידים שמדווחים שהמחשבות שלהם נודדות בשיעור (m14, פריט בודד, סולם סדר) מקבלים ציון גבוה יותר בשאלון בעיות הקשב (attn_pre)? פריט בודד הוא סולם סדר, ולכן ספירמן: rs = .19. קשר חיובי, קטן. ופירסון על אותם נתונים? .18. כמעט אותו דבר. זה קורה הרבה: כשאין ערכים קיצוניים והקשר בערך לינארי, שני המקדמים קרובים. בקשיבות ושביעות רצון: פירסון .33, ספירמן .35.
אז מתי ההבדל חשוב? כשיש ערך קיצוני. ספירמן "לא יודע" כמה רחוק הערך הקיצוני. הוא יודע רק שהוא הגבוה ביותר, ולכן הוא יציב בהרבה. נראה את זה בקטע הבא.
חמישה תלמידים, המקום של כל אחד בתחרות ריצה ובתחרות שחייה (1 = הכי מהיר). ריצה: 1, 2, 3, 4, 5. שחייה: 2, 1, 3, 5, 4. חשבו את מתאם ספירמן. ומה המסקנה?
בדיקת התשובה
קשר חיובי חזק: מי שמהיר בריצה נוטה להיות מהיר גם בשחייה. שימו לב: כאן מקום 1 הוא "הכי טוב", אבל בשני המשתנים, ולכן הסימן נשאר חיובי.
בדקו את עצמכם3 שאלות
1.ארבעה ערכים: 4, 7, 7, 9. מה הדירוגים שלהם, מהקטן לגדול?
2.שני מורים דירגו ארבעה תלמידים. סכום ריבועי ההפרשים בין הדירוגים הוא 2. חשבו את מתאם ספירמן.
3.בסקר של הכנסה משפחתית יש שלוש משפחות עשירות מאוד, הרחק מכל השאר. רוצים לבדוק את הקשר בין ההכנסה לבין מספר החוגים של הילד. מה מתאים יותר?
מלכודות: מתי המתאם מטעה
ארבע מלכודות. קשר לא לינארי: קשר מושלם בצורת פרבולה יכול לתת r = 0. ערך קיצוני אחד יכול ליצור קשר שלא קיים, או להעלים קשר קיים. קיצוץ תחום מחליש את המתאם. ומתאם אינו סיבתיותCorrelation is not causation: ייתכן כיוון הפוך או משתנה שלישיThird variable. לכן תמיד מסתכלים על דיאגרמת הפיזור.
1. קשר לא לינארי
חמש נקודות: X הוא −2, −1, 0, 1, 2, ו־Y הוא X בריבוע: 4, 1, 0, 1, 4. יש כאן קשר? יש קשר מושלם: מי שיודע את X יודע בדיוק את Y. אבל מקדם המתאם הוא בדיוק 0. כשהדגמתי את זה באקסל בהרצאה, CORREL החזירה מספר כמו −2.7E−17, כלומר אפס עם טעות עיגול. למה? כי בצד שמאל של הפרבולה הקשר שלילי, ובצד ימין חיובי, והמכפלות מקזזות זו את זו. פירסון מודד רק קשר לינארי. r = 0 פירושו "אין קשר לינארי", לא "אין קשר".
והפוך: מתאם גבוה לא מוכיח שהקשר לינארי. אם X הוא רק 1 עד 5, ו־Y הוא X בריבוע, המתאם .98. גבוה מאוד, אבל הקשר הוא עקומה. במקרים כאלה אפשר לפעמים "ליישר" את הקשר בטרנספורמציה: המתאם בין Y לבין X² הוא 1. ודוגמה מהחיים: הקשר בין רמת עוררות לביצוע במבחן. מעט מדי עוררות, ישנוניות. יותר מדי, לחץ. הביצוע הטוב ביותר באמצע.
2. ערך קיצוני
עשרה תלמידים, בלי שום קשר: r = .00. מוסיפים תלמיד אחד, רחוק מכל השאר בשני המשתנים, והמתאם קופץ ל־.82. תלמיד אחד "ייצר" קשר חזק. למה? כי המכפלה של ציוני התקן שלו ענקית, והיא שולטת בסכום. ספירמן על אותם 11 תלמידים: .26. הוא יודע רק שהתלמיד הזה הוא הגבוה ביותר, לא כמה הוא רחוק.
ובקובץ שלנו יש ערכים קיצוניים "מובנים": קודי החסר 99. המתאם בין מספר האחים לבין התחושה שהמורה זמינה ומקבלת (teach_pre) הוא .15 אצל 195 התלמידים שמספר האחים שלהם ידוע. אם שוכחים להגדיר את 99 כחסר, חמישה "תלמידים עם 99 אחים" הופכים את המתאם ל־−.05. הכיוון התהפך. מה עושים עם ערך קיצוני אמיתי? קודם בודקים שאין טעות הקלדה. אחר כך אפשר לדווח את המתאם עם הערך ובלעדיו, או להשתמש בספירמן. ולא מוחקים תצפיות רק כי הן לא נוחות.
3. קיצוץ תחום
המתאם בין החרדה לפני התוכנית לחרדה אחריה הוא .71, אצל כל 200 התלמידים. עכשיו ניקח רק את 77 התלמידים שהחרדה שלהם לפני התוכנית הייתה בין 2 ל־2.5, הפס הצבוע בדיאגרמה. אצלם המתאם הוא .34. אותו קשר בדיוק, אבל בתחום צר. כשכמעט כל התלמידים דומים במשתנה אחד, אין להבדלים הקטנים ביניהם הרבה מה "לנבא". ובקשיבות ושביעות רצון: .33 אצל כולם, ורק .08 אצל 96 התלמידים שהקשיבות שלהם מעל החציוןMedian.
הדוגמה הקלאסית שאני נותן בהרצאה: רוצים לבדוק אם הבחינה הפסיכומטרית מנבאת הצלחה בלימודים, ומחשבים מתאם בין הציון בבחינה לבין ממוצע התואר. אבל למדו רק מי שהתקבלו, כלומר רק בעלי ציונים גבוהים. המתאם יוצא נמוך, ומישהו מציע לבטל את הבחינה. טעות: קיצצנו את התחום. או שאלה שאני שואל בכיתה: איזה ציון בגרות מנבאPredictor הצלחה בלימודי רפואה? האינטואיציה אומרת ביולוגיה. אבל כל מי שהתקבל קיבל בביולוגיה ציון כמעט מושלם, ולכן אין בציון הזה שונות, ואין לו מה לנבא. מכאן כלל לתכנון מחקר: כשרוצים למצוא הבדל בין קבוצות, טוב שהפיזור בתוך הקבוצות קטן. כשרוצים למצוא מתאם, צריך פיזור גדול בשני המשתנים.
4. מתאם אינו סיבתיותCorrelation is not causation
זו המלכודת הגדולה מכולן, וכבר פגשנו אותה בפרק 5. גם מתאם חזק מאוד לא אומר מי גורם למי. יש תמיד לפחות שני הסברים חלופיים:
- כיוון הפוך. נמצא מתאם חיובי בין מספר הפגישות עם היועצת לבין החרדה של התלמידים. האם הפגישות מגבירות חרדה? סביר יותר שתלמידים חרדים נפגשים יותר עם היועצת.
- משתנה שלישיThird variable. בבית ספר יסודי, מספר הנעליים קשור מאוד לידע במתמטיקה. האם רגליים גדולות עוזרות בחשבון? לא: הגיל משפיע על שניהם. בתוך שכבה אחת, הקשר כמעט נעלם. קשר כזה, שנובע כולו ממשתנה שלישי, נקרא קשר מדומהSpurious relationship.
ובחזרה לשאלת הפתיחה: המתאם בין הקשיבות לשביעות הרצון, .33, לא אומר שהקשיבות מגבירה את שביעות הרצון. אולי ילדים מרוצים קשובים יותר, ואולי בית תומך משפיע על שניהם. בשביל מסקנה סיבתית צריך ניסוי, עם הקצאה אקראיתRandom assignment, וזו בדיוק הסיבה שבמחקר שלנו בתי הספר הוגרלו לתוכניות. לכן בדיווח על מתאם כותבים "נמצא קשר בין", או "קשור ל", ולא "משפיע על" או "גורם ל".
מלכודת קרובה למשתנה השלישי: כשמחברים כמה קבוצות לקובץ אחד, הקשר בתוך כל קבוצה יכול להיות שונה מאוד מהקשר בכל הקובץ. בדוגמת הנעליים, בתוך כל שכבה אין קשר, אבל השכבות עצמן שונות גם בגודל הרגל וגם בידע, והחיבור שלהן יוצר מתאם חזק. בקובץ שלנו, המתאם בין קשיבות לשביעות רצון הוא .38 בקבוצת הביקורת, .14 בתוכנית העקיפה ו־.43 במשולבת. ההבדלים האלה יכולים להיות מקריים (את זה נבדוק בהמשך הספר), אבל הם מזכירים לבדוק את המתאם גם בתוך הקבוצות. איך מריצים ניתוח לכל קבוצה בנפרד? בפרק הבא, עם Split File.
ועוד הסבר שלישי לקשר, שאינו סיבתי: מקריות. במדגם קטן, מתאם בינוני יכול לצאת גם כשאין שום קשר באוכלוסייה. בשביל זה יש בדיקת מובהקות, בפרק 24.
מעבדה: מתאם חי
- הזיזו את המחוון מ־1 עד −1. איך משתנה הענן? בערך מאיזה ערך אתם כבר רואים כיוון בעין?
- קבעו קשר של 0.70, והפעילו "קיצוץ תחום". מה קורה למתאם?
- קבעו קשר קרוב ל־0, והוסיפו תצפית חריגה. ואחר כך נסו "קשר בצורת U".
בדיקת התשובה
1. ככל שהמתאם קרוב יותר ל־1 או ל־−1, הענן צר יותר. מתחת ל־.30 בערך קשה לראות כיוון בעין, ולכן מחשבים. 2. המתאם יורד בהרבה: אותו קשר, תחום צר. 3. נקודה אחת רחוקה מקפיצה את המתאם. ובצורת U יש קשר חזק, אבל המתאם קרוב לאפס, כי פירסון מודד רק קשר לינאריLinear relationship.
מעבדה: פירסון וספירמן, בנתונים שלנו
- עברו בין ארבעת הזוגות. באיזה מהם הקשר החזק ביותר, ובאיזה החלש ביותר? מה אחוז השונות המשותפת בכל אחד?
- בזוג "קשיבות ושביעות רצון", לחצו כדי להוסיף תלמיד אחד בפינה הימנית התחתונה: קשיבות גבוהה מאוד ושביעות רצון נמוכה מאוד. מי זז יותר, פירסון או ספירמן?
- בזוג "אחים וקשב", למה הנקודות מסודרות בעמודות?
בדיקת התשובה
1. החזק ביותר: חרדה לפני ואחרי, .71, שונות משותפת 50.5%. החלש ביותר: אחים וקשב, −.04, כמעט אפס. 2. פירסון יורד יותר. ספירמן רואה רק שהתלמיד הזה ראשון בקשיבות ואחרון בשביעות הרצון, ולא כמה הוא רחוק. 3. כי מספר האחים הוא משתנה בדידDiscrete variable: 0, 1, 2 וכן הלאה. גם המעבדה מוציאה את חמשת קודי ה־99.
בדקו את עצמכם3 שאלות
1.בדיאגרמת פיזור של שעות שינה וריכוז, הנקודות יוצרות קשת: הריכוז הגבוה ביותר אצל מי שישן כשמונה שעות, ונמוך יותר אצל מי שישן מעט מאוד או הרבה מאוד. r = .03. מה נכון?
2.נמצא מתאם חיובי בין מספר השעות שתלמיד מבלה עם מורה פרטי לבין מספר הנכשלים שלו בתעודה. מה ההסבר הסביר ביותר?
3.בקובץ, המתאם בין החרדה לפני התוכנית לחרדה אחריה הוא .71. אצל 77 התלמידים שהחרדה שלהם לפני הייתה בין 2 ל־2.5, הוא רק .34. האם הקשר אצלם חלש יותר "באמת"? הסבירו.
בתוכנה: דיאגרמת פיזור ומתאמים
נפיק את דיאגרמת הפיזור של קשיבות (mind_pre) ושביעות רצון (sat_pre), ומטריצת מתאמיםCorrelation matrix של ארבעה משתנים. המספרים זהים בשלוש התוכנות.
בקובץ המחקר: sat_pre בעמודה AG, mind_pre בעמודה AH, anx_pre בעמודה AI, ו־clim_pre בעמודה AM. הנתונים בשורות 2 עד 201.
- דיאגרמת פיזור: מסמנים את שתי העמודות, ובוחרים Insert > Charts > Scatter. אקסל שם על הציר האופקי את העמודה השמאלית מבין השתיים, כאן
sat_pre. כדי שהקשיבות תהיה על הציר האופקי: לחיצה ימנית על הגרף, Select Data > Edit, ובשדה Series X values מקלידיםAH2:AH201, וב־Series Y valuesAG2:AG201. - קו מגמה: לחיצה ימנית על אחת הנקודות, Add Trendline, ומסמנים Display R-squared value on chart. על הגרף יופיע R² = 0.1096.
- פירסון:
=CORREL(AH2:AH201, AG2:AG201). אותה תוצאה בדיוק נותנת=PEARSON(AH2:AH201, AG2:AG201). הטווחים חייבים להיות באותו אורך. - קו־וריאנס:
=COVARIANCE.S(AH2:AH201, AG2:AG201), עם n − 1 כמו בספר. (COVARIANCE.Pמחלקת ב־n.) - ספירמן בשלושה צעדים, למשל בין
m14(עמודה AE) ל־attn_pre(עמודה AJ): בעמודה הפנויה BD, בשורה 2,=RANK.AVG(AE2, $AE$2:$AE$201, 1). בעמודה BE,=RANK.AVG(AJ2, $AJ$2:$AJ$201, 1). גוררים עד שורה 201. ואז=CORREL(BD2:BD201, BE2:BE201). המספר 1 בסוףRANK.AVGאומר לדרג מהקטן לגדול, והפונקציה נותנת לערכים שווים את ממוצע הדירוגים.
תוצאות הנוסחאות
| הנוסחה | התוצאה |
|---|---|
| =CORREL(AH2:AH201, AG2:AG201) | 0.3311 |
| =COVARIANCE.S(AH2:AH201, AG2:AG201) | 0.1815 |
| =RSQ(AG2:AG201, AH2:AH201) | 0.1096 |
| =CORREL(AI2:AI201, AM2:AM201) | -0.2901 |
| =CORREL(BD2:BD201, BE2:BE201) | 0.1869 |
- CORREL
- מתאם פירסון, .33.
- RSQ
- המתאם בריבוע, כמו ה־R² שעל קו המגמה: 11% שונות משותפת.
- CORREL על הדירוגים
- מתאם ספירמן, .19. אקסל לא מחשב ספירמן ישירות.
לסקרנים: אפשר לבנות את r גם מציוני תקן. בעמודה BF, =STANDARDIZE(AH2, AVERAGE($AH$2:$AH$201), STDEV.S($AH$2:$AH$201)), ובעמודה BG אותו דבר ל־AG. ואז =SUMPRODUCT(BF2:BF201, BG2:BG201)/199 נותן 0.3311, בדיוק כמו CORREL.
- דיאגרמת פיזור: Graphs > Legacy Dialogs > Scatter/Dot > Simple Scatter. Y Axis:
sat_pre. X Axis:mind_pre. (אפשר גם דרך Graphs > Chart Builder, בגלריה Scatter/Dot.) - קו מגמה: לחיצה כפולה על הגרף פותחת את Chart Editor. שם: Elements > Fit Line at Total. ליד הקו מופיע R² Linear = 0.110.
- מתאמים: Analyze > Correlate > Bivariate. מעבירים את
mind_pre,sat_pre,anx_preו־clim_pre. מסמנים Pearson, ולספירמן גם Spearman. Two-tailed ו־Flag significant correlations.
Correlations
| mind_pre | sat_pre | anx_pre | clim_pre | ||
|---|---|---|---|---|---|
| mind_pre | Pearson Correlation | 1 | .331** | -.133 | .254** |
| Sig. (2-tailed) | <.001 | .061 | <.001 | ||
| N | 200 | 200 | 200 | 200 | |
| sat_pre | Pearson Correlation | .331** | 1 | -.218** | .315** |
| Sig. (2-tailed) | <.001 | .002 | <.001 | ||
| N | 200 | 200 | 200 | 200 | |
| anx_pre | Pearson Correlation | -.133 | -.218** | 1 | -.290** |
| Sig. (2-tailed) | .061 | .002 | <.001 | ||
| N | 200 | 200 | 200 | 200 | |
| clim_pre | Pearson Correlation | .254** | .315** | -.290** | 1 |
| Sig. (2-tailed) | <.001 | <.001 | <.001 | ||
| N | 200 | 200 | 200 | 200 | |
| **. Correlation is significant at the 0.01 level (2-tailed). | |||||
- Pearson Correlation
- המתאם. כל מתאם מופיע פעמיים, מעל האלכסון ומתחתיו, כי המתאם סימטרי. על האלכסון 1: מתאם של משתנה עם עצמו.
- N
- מספר התלמידים שיש להם ערך בשני המשתנים. תמיד בודקים אותו: אם קוד חסר לא הוגדר, הוא ייכנס לחישוב.
- Sig. (2-tailed) והכוכביות
- ערך pp-value של בדיקת המובהקות. נלמד לקרוא אותו בפרק 24. בינתיים, קוראים את המתאם עצמו.
וספירמן, באותו חלון, על m14 ו־attn_pre:
Correlations (Nonparametric)
| m14 | attn_pre | |||
|---|---|---|---|---|
| Spearman's rho | m14 | Correlation Coefficient | 1.000 | .187** |
| Sig. (2-tailed) | .008 | |||
| N | 200 | 200 |
כך נראה הפלט, בגרסה 28 ואילך.
- Regression > Correlation (בקבוצה Classical).
- מעבירים את
mind_pre,sat_pre,anx_preו־clim_preל־Variables. Pearson's r מסומן מראש. לספירמן מסמנים גם Spearman's rho. - תחת Plots מסמנים Scatter plots: JASP מצייר דיאגרמת פיזור לכל זוג, עם קו.
Pearson's Correlations
| Variable | mind_pre | sat_pre | anx_pre | clim_pre | |
|---|---|---|---|---|---|
| 1. mind_pre | Pearson's r | — | |||
| p-value | — | ||||
| 2. sat_pre | Pearson's r | 0.331 | — | ||
| p-value | < .001 | — | |||
| 3. anx_pre | Pearson's r | -0.133 | -0.218 | — | |
| p-value | 0.061 | 0.002 | — | ||
| 4. clim_pre | Pearson's r | 0.254 | 0.315 | -0.290 | — |
| p-value | < .001 | < .001 | < .001 | — |
- חצי טבלה
- JASP מציג רק את המשולש התחתון: המתאם בין א׳ לב׳ זהה למתאם בין ב׳ לא׳.
- Pearson's r
- המתאם. 0.331 בין קשיבות לשביעות רצון.
- p-value
- ערך p של בדיקת המובהקות, בפרק 24. אפשר לבטל את התצוגה שלו בתיבה Report significance.
עם Spearman's rho מסומן, נוספות שורות Spearman's rho. בין m14 ל־attn_pre: 0.187.
כך נראה הפלט, בגרסה 0.19.
בדקו את עצמכם3 שאלות
1.באקסל, איזו פונקציה נותנת את מתאם פירסון?
CORREL (או PEARSON, שנותנת אותה תוצאה). COVARIANCE.S נותנת קו־וריאנס, RSQ את המתאם בריבוע, ו־RANK.AVG דירוג, לספירמן.1.ב־SPSS, איפה מקבלים מתאם פירסון?
1.ב־JASP, איפה מקבלים מתאם פירסון?
2.בטבלת המתאמים, בתא של siblings ו־teach_pre, כתוב N = 195, ובשאר התאים 200. למה?
3.סימנתם באקסל את העמודות AG (sat_pre) ו־AH (mind_pre) ויצרתם דיאגרמת פיזור. איזה משתנה על הציר האופקי, ואיך משנים?
sat_pre. כדי לשנות: לחיצה ימנית, Select Data > Edit, ומחליפים בין הטווחים ב־Series X values וב־Series Y values. המתאם עצמו לא משתנה.3.ב־SPSS, ב־Simple Scatter, הכנסתם את sat_pre ל־Y Axis ואת mind_pre ל־X Axis. איזה משתנה על הציר האופקי, ואיך מוסיפים קו מגמה?
mind_pre, כי X Axis הוא הציר האופקי. קו מגמה: לחיצה כפולה על הגרף פותחת את Chart Editor, ושם Elements > Fit Line at Total. ליד הקו יופיע R² Linear = 0.110. המתאם עצמו לא תלוי בציר שבו נמצא כל משתנה.3.ב־JASP, בחלון Correlation עם ארבעה משתנים, סימנתם Scatter plots. מה תקבלו, והאם הסדר שבו הכנסתם את המשתנים משנה את המתאמים?
טעויות נפוצות
- מסיקים סיבתיות ממתאם. כותבים "נמצא קשר בין", לא "משפיע על".
- "r = 0, אז אין קשר". אין קשר לינארי. פרבולה מושלמת נותנת אפס.
- שופטים עוצמה לפי הסימן. −.47 חזק יותר מ־.30.
- מחשבים מתאם בלי להסתכל בדיאגרמה. ערך קיצוני אחד, או קוד 99 שלא הוגדר, יכול להפוך את התמונה.
- "המדגם קטן, אז המתאם יהיה קטן". גודל המדגם לא קובע את גודל r. הוא קובע כמה אפשר לסמוך עליו.
- מסיקים שמבחן לא מנבאPredictor, ממדגם שעבר סינון. קיצוץ תחום מחליש את המתאם.
- פירסון על פריט בודד בסולם סדר. לפריט בודד מתאים ספירמן.
- חושבים ש־r = .50 מסביר חצי. השונות המשותפת היא r², כלומר 25%.
בדקו את עצמכם
סיכום
- דיאגרמת פיזור: נקודה לכל נבדק. בודקים כיוון, עוצמה וצורה, לפני כל מספר.
- פירסון: ממוצע המכפלות של ציוני התקן, Σzxzy / (n − 1). קיצוניות משותפת.
- קו־וריאנס: אותו רעיון בלי תקנון. r = cov / (SDx·SDy).
- פירוש: בין −1 ל־1. סימן: כיוון. ערך מוחלט: עוצמה. כהן: .10, .30, .50, בזהירות. r²: שונות משותפת.
- טרנספורמציה לינארית לא משנה את r. מכפיל שלילי הופך את הסימן.
- ספירמן: פירסון על דירוגים. לסולם סדר, לערכים קיצוניים ולקשר מונוטוני.
- מלכודות: קשר לא לינארי, ערך קיצוני, קיצוץ תחום, ומתאם אינו סיבתיות.
מונחים חדשים
שאלות לדוגמה, עם פתרונות
לפניכם ארבעה מקדמי מתאם ממחקרים שונים: .25, −.55, .48, −.08. א. איזה מהם מתאר את הקשר החזק ביותר? ב. איזה קרוב ביותר לאפס? ג. לפי כהן, איך מתארים כל אחד?
בדיקת התשובה
א. −.55: הערך המוחלט הגדול ביותר. הסימן מעיד רק על הכיוון. ב. −.08. ג. .25: בין קטן לבינוני. −.55: גדול, שלילי. .48: בינוני, קרוב לגדול. −.08: זניח, מתחת ל"קטן". וזכרו שבכל תחום הנורמות שונות.
לחמש מורות נרשמו שנות הוותק (X: 1, 3, 5, 7, 9) וציון שביעות הרצון מהעבודה (Y: 2, 6, 4, 8, 10). חשבו את הקו־וריאנס ואת מקדם המתאם של פירסון.
בדיקת התשובה
Mx = 25 / 5 = 5, My = 30 / 5 = 6X: −4, −2, 0, 2, 4 Y: −4, 0, −2, 2, 4 הסטיות מהממוצעSP = 16 + 0 + 0 + 4 + 16 = 36, cov = 36 / 4 = 9SSx = 40, SSy = 40, SDx = SDy = √(40 / 4) = 3.162r = 9 / (3.162 · 3.162) = 9 / 10 = 0.90קשר חיובי חזק מאוד. השונות המשותפת: 0.90² = 0.81, כלומר 81%.
שתי מורות דירגו שש עבודות של תלמידים, מהטובה (1) לחלשה (6). מורה א: 1, 2, 3, 4, 5, 6. מורה ב: 3, 1, 2, 6, 4, 5. חשבו את מתאם ספירמן. למה לא פירסון על הציונים?
בדיקת התשובה
d = −2, 1, 1, −2, 1, 1, Σd² = 4 + 1 + 1 + 4 + 1 + 1 = 12rs = 1 − 6 · 12 / (6 · 35) = 1 − 72 / 210 = 1 − 0.343 = 0.66הסכמה טובה, אבל לא מלאה. הנתונים הם דירוגים, כלומר סולם סדר: אין לנו מידע על המרחקים בין העבודות. לכן ספירמן.
קראו את הפלט ממחקר על 200 תלמידים, וענו: א. בין איזה זוג משתנים הקשר החזק ביותר? ב. מה אחוז השונות המשותפת שלו? ג. תלמידה טוענת: "המורה הזמינה גורמת לתלמידים פחות בעיות קשב". מה תענו לה?
Correlations
attn_pre soma_pre teach_pre attn_pre Pearson Correlation 1 .226** -.216** N 200 200 200 soma_pre Pearson Correlation .226** 1 -.171* N 200 200 200 teach_pre Pearson Correlation -.216** -.171* 1 N 200 200 200 בדיקת התשובה
א. בעיות קשב ותלונות גופניות, .226. הוא רק מעט חזק יותר מ־−.216: משווים ערכים מוחלטים. ב. 0.226² = 0.05, בערך 5%. ג. המתאם שלילי, כלומר תלמידים שמרגישים שהמורה זמינה מדווחים על פחות בעיות קשב. אבל זה מתאם. ייתכן כיוון הפוך: מורה מגיבה בחום רב יותר לתלמידים בלי בעיות קשב. וייתכן משתנה שלישי. ובכל מקרה הקשר קטן: כ־5% שונות משותפת.
חוקר מצא מתאם של −.30 בין חרדה (1 עד 4) לבין ציון במבחן (0 עד 100), אצל 120 תלמידים. א. הוא ממיר את הציון לסולם 0 עד 10 (מחלק ב־10). מה יקרה למתאם ולקו־וריאנס? ב. במקום חרדה הוא מחשב "רוגע" = 5 פחות החרדה. מה המתאם עכשיו? ג. עמית מציע לבדוק את הקשר רק אצל 30 התלמידים החרדים ביותר, "כי הם המעניינים". מה צפוי לקרות?
בדיקת התשובה
א. המתאם נשאר −.30: חלוקה בקבוע חיובי לא משנה ציוני תקן. הקו־וריאנס כן משתנה: הסטיות של הציון קטנות פי 10, ולכן גם הקו־וריאנס קטן פי 10. זו בדיוק הסיבה שמתקננים. ב. .30: מכפיל שלילי הופך את הסימן, והעוצמה נשמרת. ג. קיצוץ תחום: בקבוצה צרה של חרדים, הפיזור בחרדה קטן, והמתאם צפוי לצאת חלש יותר. אם יצא חלש, זה לא אומר שאצל החרדים אין קשר.
תרגול עם הנתונים
הקבצים עצמם נמצאים גם בתיקיית data בחבילת הספר.
- מהו המתאם בין החרדה (
anx_pre) לתלונות הגופניות (soma_pre) לפני התוכנית? תארו את הכיוון ואת העוצמה, וחשבו את השונות המשותפת.בדיקת התשובה
r = .26: קשר חיובי, בין קטן לבינוני. תלמידים חרדים יותר נוטים לדווח על יותר כאבי בטן וראש. השונות המשותפת: .26² = .07, כ־7%.
- שביעות הרצון נמדדה לפני התוכנית ומיד אחריה (
sat_pre,sat_post). מה המתאם ביניהן? ואיך זה מתיישב עם זה שבתוכנית המשולבת שביעות הרצון עלתה (ראינו את זה בפרק 10)?בדיקת התשובה
r = .79, קשר חזק מאוד. המתאם אומר שהתלמידים שמרו על המיקום היחסי שלהם: המרוצים נשארו מרוצים יחסית. הוא לא אומר כלום על הממוצע. אם כל התלמידים עולים בחצי נקודה, המתאם לא משתנה בכלל: זו הוספת קבוע.
- חשבו את מתאם פירסון בין מספר האחים (
siblings) לביןteach_pre: פעם כשה־99 מוגדר כחסר, ופעם כשהוא לא מוגדר. מה קרה? ומה נותן ספירמן בשני המקרים?בדיקת התשובה
עם הגדרת החסר (195 תלמידים): r = .15. בלי (200 תלמידים): r = −.05, הכיוון התהפך. חמישה ערכי 99 הם ערכים קיצוניים ענקיים. ספירמן: .18 ו־.15. גם הוא זז, אבל הרבה פחות, כי לגביו 99 הוא רק "הגבוה ביותר". המסקנה: N, מינימום ומקסימום, לפני כל מתאם.
- מהו מתאם ספירמן בין השכלת ההורה (
parent_edu, בלי ערכי 99) לבין שביעות הרצון לפני התוכנית? למה ספירמן ולא פירסון?בדיקת התשובה
rs = −.02, אצל 194 תלמידים: אין קשר. השכלת ההורה היא סולם סדר (פרק 6): תואר ראשון הוא יותר מעל־תיכונית, אבל המרווחים בין הרמות לא ידועים. לכן ספירמן.
- בדקו את קיצוץ התחום בעצמכם: מה המתאם בין
mind_preל־sat_preאצל כל התלמידים, ומה אצל התלמידים שהקשיבות שלהם מעל החציוןMedian (3.2)?בדיקת התשובה
אצל כולם: .33. אצל 96 התלמידים שמעל החציון: .08. אותם נתונים, תחום צר. באקסל: ממיינים לפי
mind_pre, ומחשביםCORRELרק על השורות שמעל 3.2. ב־SPSS: Select Cases, בפרק הבא.
בפרק הבא: הכנת נתונים ומהימנותReliability. איך הופכים פריטים, מחשבים ציון שאלון מהפריטים, ובודקים בעזרת אלפא של קרונבךCronbach's alpha אם הפריטים באמת מודדים דבר אחד. ונראה שאלפא בנויה כולה על המתאמים בין הפריטים.
מקורות: Cohen, J. (1988). Statistical power analysis for the behavioral sciences (2nd ed.). Erlbaum. · Pearson, K. (1896). Mathematical contributions to the theory of evolution. III. Regression, heredity, and panmixia. Philosophical Transactions of the Royal Society of London, Series A, 187, 253–318. · Spearman, C. (1904). The proof and measurement of association between two things. American Journal of Psychology, 15(1), 72–101. · Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y