חלק ב: תיאור נתונים · פרק 10
מדדי מרכז
בפרק הקודם סידרנו את הנתונים בטבלאות ובגרפים. עכשיו נרצה לתאר אותם במספר אחד: מה הערך הטיפוסי? נכיר את שלושת מדדי המרכז, שכיח, חציוןMedian וממוצעMean, נראה את התכונות של הממוצע, ונלמד לבחור את המדד המתאים לכל משתנה. ובסוף נחשב ממוצע לכל קבוצה בטבלת ציר.
חישבתם באקסל את הממוצע של עמודת מספר האחים בקובץ המחקר, וקיבלתם 4.75. האם לתלמיד טיפוסי בכיתות ד׳ ו־ה׳ יש כמעט חמישה אחים?
לא. בעמודה יש חמישה ערכים של 99, הקוד של "לא ידוע" מפרק 8, ואקסל חיבר אותם כאילו היו חמישה תלמידים עם 99 אחים. בלעדיהם הממוצע הוא 2.33. ומה עם החציון? הוא 2, עם ה־99 ובלעדיהם. בסוף הפרק תבינו למה הממוצע קפץ והחציון לא זז, ותדעו איזה מהם לדווח.
בסוף הפרק תוכלו
- להבחין בין סטטיסטי לפרמטרParameter, ולסמן כל אחד נכון.
- לחשב שכיח, חציון וממוצע, מרשימת ערכים ומטבלת שכיחויותFrequency table.
- להסביר את תכונות הממוצע: נקודת האיזוןBalance point, הרגישות לערכים קיצונייםOutlier, ומה עושה לו טרנספורמציה לינאריתLinear transformation.
- לבחור מדד מרכזMeasure of central tendency לפי סולם המדידה ולפי צורת ההתפלגות.
- לחשב ממוצע לכל קבוצה בטבלת ציר, ולהימנע ממלכודת ה־99.
מספר אחד לכל הנתונים: סטטיסטי ופרמטר
מדד מרכז הוא מספר אחד שמתאר את הערך הטיפוסי של הנתונים. מדד שמחושב על מדגם נקרא סטטיסטי, ומדד של כל האוכלוסייה נקרא פרמטר. כלל אצבע: אותיות לטיניות למדגם (), ויווניות לאוכלוסייה (). תוחלתExpected value היא שם נוסף לממוצע האוכלוסייה.
טבלת שכיחויות מראה הכול, אבל היא ארוכה. כשרוצים לומר במשפט אחד "כמה אחים יש לתלמיד טיפוסי", צריך מספר אחד. מספר כזה נקרא מדד מרכז, כי הוא מתאר איפה נמצא המרכז של ההתפלגות. יש שלושה מדדי מרכז עיקריים: שכיח, חציון וממוצע. כל אחד עונה על השאלה "מה הערך הטיפוסי" בדרך אחרת.
אבל קודם, מילה על השם של המספר. בפרק 7 הבחנו בין אוכלוסייה למדגם, ופגשנו כבר את שני השמות. נזכיר אותם, כי מעכשיו נשתמש בהם כל הזמן. אותו מדד יכול לקבל שני שמות, לפי מה שחישבנו אותו עליו:
- סטטיסטי הוא מדד שמחושב על המדגם. למשל, ממוצע החרדה של 200 התלמידים במחקר. אפשר לחשב אותו, כי הנתונים בידינו.
- פרמטר הוא מדד של כל האוכלוסייה. למשל, ממוצע החרדה של כל תלמידי כיתות ד׳ ו־ה׳ בישראל. בדרך כלל הוא לא ידוע, ומנסים לאמוד אותו מהמדגם.
| המדד | במדגם (סטטיסטי) | באוכלוסייה (פרמטר) |
|---|---|---|
| ממוצע | (מיו) | |
| סטיית תקן (פרק 11) | σ (סיגמה קטנה) | |
| חציון | Mdn | אין סימן מקובל |
| שכיח | Mo | אין סימן מקובל |
כלל אצבע לזכור: אותיות לטיניות למדגם, ואותיות יווניות לאוכלוסייה. בספר אנחנו כותבים לפי APA: לממוצע המדגם, Mdn לחציון, ו־Mo לשכיח. בספרים אחרים תפגשו גם x̄ (איקס גג) לממוצע, ו־Md לחציון. זה אותו דבר.
ועוד מושג אחד שנפגוש בהמשך: תוחלתExpected value. התוחלת של משתנה היא הממוצע שלו באוכלוסייה כולה, הערך שמצפים לקבל "בממוצע". מסמנים אותה ב־, ולפעמים באות E. בספר לא נחשב תוחלת בעזרת הסתברויות. מספיק לזכור: תוחלת היא ממוצע האוכלוסייה.
בפרקים 10 עד 16 אנחנו מתארים את המדגם, ולכן כמעט כל מה שנחשב הוא סטטיסטי. מפרק 17 נשאל מה מותר להסיק מהסטטיסטי על הפרמטר.
ההבדל בסימון הוא לא קישוט. ממוצע של מדגם משתנה ממדגם למדגם: אילו בחרנו 200 תלמידים אחרים, היינו מקבלים ממוצע קצת אחר. ממוצע האוכלוסייה הוא מספר אחד וקבוע, גם אם אנחנו לא יודעים אותו. לכן הוא משתנה, ו־ הוא קבוע. כל ההסקה הסטטיסטית, מפרק 17 ואילך, בנויה על השאלה כמה "קופץ" סביב . ושימו לב לאות : בספרים ישנים היא מספר הפרטים באוכלוסייה. ב־APA, ובספר הזה, הוא מספר הנבדקים במחקר כולו, ו־ מספר הנבדקים בקבוצה.
סטטיסטי או פרמטר? א. ממוצע שביעות הרצון של 75 התלמידים בתוכנית המשולבת. ב. הגיל הממוצע של כל תלמידי כיתה ה׳ בישראל, לפי נתוני משרד החינוך. ג. החציון של מספר האחים בקובץ המחקר.
בדיקת התשובה
א. סטטיסטי: 75 תלמידים הם מדגם, ומסמנים . ב. פרמטר: מדד של כל האוכלוסייה, . כאן, באופן יוצא דופן, הוא ידוע, כי משרד החינוך מחזיק נתונים על כולם. ג. סטטיסטי: חושב על 195 התלמידים שבקובץ.
בדקו את עצמכם3 שאלות
1.משרד החינוך פרסם שהגיל הממוצע של כל תלמידי כיתה ד׳ בארץ הוא 9.6. איך מסמנים את המספר הזה?
2.מה ההבדל בין סטטיסטי לפרמטר, ואיזה מהם בדרך כלל אנחנו יודעים?
3.חוקרת כותבת: "התוחלת של זמן התגובה היא 450 אלפיות שנייה". על מה היא מדברת?
שכיח, חציון וממוצע
שכיח (Mo): הערך שמופיע הכי הרבה פעמים. יכולים להיות כמה, או אף אחד. חציון (Mdn): הערך האמצעי אחרי שמסדרים מהקטן לגדול. המיקום שלו (n + 1) / 2. כשמספר הערכים זוגי, ממצעים את שני האמצעיים. ממוצע (): סכום הערכים חלקי מספרם, M = Σx / n.
שבעה תלמידים סיפרו כמה ספרים קראו בחופש הגדול:
שכיח
השכיח הוא הערך שמופיע הכי הרבה פעמים. כאן 3 מופיע שלוש פעמים, וכל ערך אחר פעם אחת. לכן Mo = 3.
שלושה מקרים מיוחדים. אפשר כמה שכיחים: בנתונים 1, 1, 2, 3, 3 גם 1 וגם 3 מופיעים פעמיים, וההתפלגות נקראת דו־שכיחית. אפשר שאין שכיח: בנתונים 1, 2, 3, 4 כל ערך מופיע פעם אחת. והשכיח מתאים לכל סולם, גם לשמי: הקבוצה השכיחה בקובץ היא התוכנית המשולבת, עם 75 תלמידים.
ושימו לב, כמו שראינו בפרק 9: השכיח הוא ערך, לא שכיחות. בקבוצת המחקר השכיח הוא "התוכנית המשולבת", או הקוד 2. המספר 75 הוא השכיחות שלו.
חציון
החציון הוא הערך שבאמצע, אחרי שמסדרים את הערכים מהקטן לגדול. חצי מהערכים שווים לו או קטנים ממנו, וחצי שווים לו או גדולים ממנו. שני שלבים:
ומה אם מספר הערכים זוגי? מצטרף תלמיד שמיני, שקרא 6 ספרים. עכשיו המיקום הוא (8 + 1) / 2 = 4.5: בין הערך הרביעי לחמישי. לוקחים את הממוצע של שניהם:
שתי טעויות נפוצות כאן. הראשונה: לשכוח לסדר. החציון של הרשימה המקורית הוא לא הערך הרביעי שבה (8). השנייה: לבלבל בין המיקום לערך. הנוסחה (n + 1) / 2 אומרת איפה החציון, לא מה הוא. החציון דורש סדר בין הערכים, ולכן הוא מתאים לסולם סדרOrdinal scale ומעלה.
ממוצע
את הממוצע אתם מכירים מפרק 2: סכום הערכים חלקי מספר הערכים.
לממוצע שתי תכונות שקובעות מתי משתמשים בו. הוא משתמש בכל הערכים, וכל ערך תורם לו לפי הגודל שלו. זה יתרון, כי לא מוותרים על אף פיסת מידע. וזה גם חיסרון, כי ערך קיצוני אחד מזיז אותו, כמו שנראה בקטע 4. והוא דורש מרווחים שווים: חיבור וחלוקה מניחים שהמרחק בין 2 ל־3 שווה למרחק בין 7 ל־8. לכן הממוצע מתאים לסולם רווחInterval scale ומנה, כמו שראינו בפרק 6.
שימו לב גם שבדוגמה שלנו שלושת המדדים לא שווים: השכיח 3, החציון 3, והממוצע 4. התלמיד שקרא 8 ספרים "מושך" את הממוצע למעלה. נחזור לזה.
ב־siblings יש 195 ערכים תקפים, אחרי שמוציאים את חמשת ה־99. שלושת המדדים:
הממוצע גבוה מהחציון ומהשכיח. הסיבה רואים בגרף: הזנב הארוך פונה ימינה, לתלמידים עם חמישה, שישה ושבעה אחים. הם מושכים את הממוצע למעלה, ואת החציון כמעט לא. ומה יוצא אם שוכחים את ה־99? (455 + 5 · 99) / 200 = 950 / 200 = 4.75, המספר מהשאלה הפותחת. והחציון עדיין 2.
תשעה תלמידים דיווחו כמה דקות הם הולכים ברגל לבית הספר: 12, 5, 20, 8, 5, 15, 5, 10, 92. חשבו את השכיח, החציון והממוצע. איזה מהם מתאר הכי טוב תלמיד טיפוסי?
בדיקת התשובה
הממוצע, 19.11, גבוה משמונה מתוך תשעה תלמידים, בגלל תלמיד אחד שהולך 92 דקות. ואולי בכלל הוקלד 9 או 29. החציון, 10 דקות, מתאר טוב יותר תלמיד טיפוסי. וגם כדאי לבדוק את ה־92 בקובץ.
בדקו את עצמכם3 שאלות
1.מהו השכיח של 4, 7, 4, 9, 7, 2?
2.מהו החציון של 11, 2, 8, 5, 14?
3.חשבו את הממוצע ואת החציון של 3, 4, 4, 6, 8, 11.
מדדי מרכז מתוך טבלת שכיחויות
מטבלת שכיחויות: השכיח הוא הערך עם השכיחות הגבוהה ביותר. החציון נמצא לפי השכיחות המצטברת: הערך הראשון שהשכיחות המצטברת שלו מגיעה למיקום (n + 1) / 2. הממוצע: מוסיפים עמודה של ערך כפול שכיחות, x · f, ומחלקים את הסכום שלה ב־: M = Σxf / n.
כשיש 195 תלמידים, לא כותבים רשימה של 195 מספרים. את שלושת המדדים אפשר לחשב ישר מטבלת השכיחויות של פרק 9. נוסיף לה רק עמודה אחת:
| מספר אחים (x) | f | cf | x · f |
|---|---|---|---|
| 0 | 17 | 17 | 0 |
| 1 | 46 | 63 | 46 |
| 2 | 54 | 117 | 108 |
| 3 | 37 | 154 | 111 |
| 4 | 23 | 177 | 92 |
| 5 | 12 | 189 | 60 |
| 6 | 4 | 193 | 24 |
| 7 | 2 | 195 | 14 |
| סה״כ | 195 | 455 |
- השכיח: השכיחות הגבוהה ביותר היא 54, בשורה של 2. לכן Mo = 2. לא 54.
- החציון: המיקום הוא (195 + 1) / 2 = 98. עוברים על השכיחות המצטברת: עד 0 אחים יש 17 תלמידים, ועד אח אחד 63. התלמיד ה־98 עוד לא הגיע. עד שני אחים יש 117, ולכן התלמיד ה־98 נמצא בשורה של 2. Mdn = 2.
- הממוצע: השורה של 1 אומרת ש־46 תלמידים עם אח אחד תורמים 46 אחים לסכום. השורה של 3 אומרת ש־37 תלמידים תורמים 3 · 37 = 111. עמודת x · f חוסכת לחבר את אותו ערך שוב ושוב. הסכום שלה, 455, הוא סכום כל הערכים, ו־455 / 195 = 2.33.
מטבלת השכיחויות של פרק 9 (28, 47, 74, 45 מתוך 194 תקפים):
כשמספר הערכים זוגי, והשניים האמצעיים נופלים באותה שורה, החציון הוא הערך של השורה. אילו נפלו בשתי שורות שונות, למשל 2 ו־3, החציון במשתנה כמותיQuantitative variable היה 2.5. במשתנה בסולם סדרOrdinal scale, כמו השכלה, "2.5" אין לו פירוש, ומדווחים ששתי הרמות באמצע.
בטבלה מקובצת, כמו טבלת הגיל של פרק 9, לא יודעים את הערכים המדויקים. אפשר רק להניח שכל הערכים בקטגוריה נמצאים באמצע שלה, ולחשב ממוצע מאמצעי הקטגוריות: (9.2 · 35 + 9.7 · 52 + 10.2 · 61 + 10.7 · 36 + 11.2 · 16) / 200 = 2013 / 200 = 10.065. הממוצע האמיתי, מהנתונים הגולמיים, הוא 10.054. קרוב מאוד, אבל לא זהה: זה המחיר של הקיבוץ. לפני עידן המחשב חישבו כך ממוצעים של אלפי ערכים. היום, כשיש קובץ, מחשבים מהנתונים עצמם.
בשאלון של 40 תלמידים נשאלו כמה פעמים השבוע הם תרגלו נשימה מודעת. התשובות: 0 פעמים: 6, פעם אחת: 10, פעמיים: 14, שלוש: 8, ארבע: 2. מצאו את השכיח, החציון והממוצע.
בדיקת התשובה
בדקו את עצמכם3 שאלות
1.בטבלת שכיחויות של 30 תלמידים, השכיחויות המצטברות של הערכים 1, 2, 3, 4 הן 5, 12, 24, 30. מהו החציון?
2.ערכים 1, 2, 3 עם שכיחויות 10, 5, 5. מה הממוצע?
3.למה מוסיפים עמודה של x · f כשמחשבים ממוצע מטבלת שכיחויות?
תכונות הממוצע
הממוצע הוא נקודת האיזון של הנתונים: סכום הסטיות ממנו הוא תמיד אפס, Σ(x − M) = 0. הוא רגיש לערכים קיצוניים, והחציון עמידRobustness להם. ערך שמצטרף מעל הממוצע מעלה אותו, ומתחת לממוצע מוריד אותו. טרנספורמציה לינארית y = a + b · x פועלת על כל מדדי המרכז באותה דרך: My = a + b · Mx. וממוצע של קבוצות בגדלים שונים הוא ממוצע משוקלל, לא ממוצע של הממוצעים.
נקודת האיזון
בפרק 2 ראינו שסכום המרחקים מהממוצע הוא תמיד אפס. עכשיו נבין למה זה חשוב. הנה חמישה ערכים, והממוצע שלהם 5:
| x | x − M |
|---|---|
| 2 | −3 |
| 4 | −1 |
| 4 | −1 |
| 5 | 0 |
| 10 | 5 |
| Σ = 25 | 0 |
ההפרש בין ערך לממוצע נקרא סטייה מהממוצעDeviation from the mean. מי שמעל הממוצע מקבל סטייה חיובית, ומי שמתחתיו שלילית. ותמיד, בכל רשימה של מספרים, הסטיות החיוביות והשליליות מקזזות זו את זו בדיוק: −3 − 1 − 1 + 0 + 5 = 0.
לכן קוראים לממוצע נקודת האיזון. דמיינו קרש, ועליו משקולות שוות במקומות 2, 4, 4, 5 ו־10. אם שמים את נקודת התמיכה ב־5, הקרש מתאזן. המרחקים לצד אחד, 3 ועוד 1 ועוד 1, שווים בסכומם למרחק לצד השני, 5. ושימו לב לערך 10: הוא לבד בצד ימין, ובכל זאת מאזן שלושה ערכים. הוא רחוק, ולכן הוא "שוקל" הרבה. זה בדיוק כמו בנדנדה: ילד קטן שיושב בקצה יכול לאזן ילד גדול שיושב קרוב למרכז.
והחציון? כאן הוא 4. הוא לא מתעניין במרחקים בכלל, רק בסדר: שני ערכים מתחתיו ושניים מעליו. אם הערך 10 היה 100, החציון היה נשאר 4.
יש עוד דרך לתאר את הממוצע. נניח שאתם צריכים לנחש מספר אחד לכל התלמידים, ובכל ניחוש "משלמים" את ריבוע הטעות. איזה ניחוש יעלה הכי פחות? מתברר שהממוצע: סכום ריבועי הסטיותSum of squares ממנו קטן יותר מאשר מכל מספר אחר. ואם משלמים את הטעות עצמה, בלי ריבוע? אז הניחוש הזול ביותר הוא החציון. ברשימה 2, 4, 4, 5, 10: סכום ריבועי הסטיות מהממוצע 5 הוא 9 + 1 + 1 + 0 + 25 = 36, ומהחציון 4 הוא 4 + 0 + 0 + 1 + 36 = 41. סכום הסטיות המוחלטות מהחציון הוא 2 + 0 + 0 + 1 + 6 = 9, ומהממוצע 3 + 1 + 1 + 0 + 5 = 10. הרעיון של "סכום ריבועי הסטיות" יחזור בפרק 11, ושם הוא יהיה הבסיס לשונות.
רגישות לערכים קיצוניים
חמישה עובדים במשרד קטן. השכר החודשי שלהם, באלפי שקלים: 9, 10, 11, 12, 13. הממוצע 11, והחציון 11. עכשיו מחליפים את העובד החמישי במנכ״ל, שמרוויח 60:
| הנתונים | Mdn | |
|---|---|---|
| 9, 10, 11, 12, 13 | 11 | 11 |
| 9, 10, 11, 12, 60 | 11 | 20.4 |
החציון לא זז. הממוצע קפץ ל־20.4, אף שארבעה מתוך חמישה עובדים מרוויחים 12 או פחות. בהרצאה אני מספר על הדיווחים בעיתון על "השכר הממוצע במשק": רוב האנשים מרוויחים פחות ממנו, כי מעטים שמרוויחים מאות אלפים בחודש מושכים אותו למעלה. במקרים כאלה החציון מייצג טוב יותר. אומרים שהחציון עמידRobustness לערכים קיצוניים, כי הוא תלוי רק בסדר. ובקובץ שלנו ראינו את אותו דבר עם ה־99: הממוצע קפץ מ־2.33 ל־4.75, והחציון נשאר 2.
הוספת תצפית
מה קורה לממוצע כשמצטרף ערך חדש? הסכום החדש, חלקי מספר הערכים החדש:
לתשעה תלמידים בקבוצה יש ממוצע חרדה 2.0, כלומר סכום 18. מצטרף תלמיד עשירי. אם הציון שלו 3.0, מעל הממוצע: (18 + 3) / 10 = 2.1. הממוצע עלה. אם הציון שלו 2.0, בדיוק הממוצע: (18 + 2) / 10 = 2.0. הממוצע לא השתנה. הכלל: ערך שמעל הממוצע מעלה אותו, ערך שמתחתיו מוריד אותו, וערך ששווה לו לא משנה אותו. וזה הגיוני לפי נקודת האיזון: ערך שנוסף בדיוק בנקודת האיזון לא מטה את הקרש.
הוספת קבוע והכפלה בקבועAdding a constant · Multiplying by a constant
בפרק 6 פגשנו את הטרנספורמציהTransformation הלינארית, y = a + b · x: מכפילים כל ערך ב־b ומוסיפים a. מה היא עושה למדדי המרכז? בדיוק את אותו דבר:
המורה הוסיפה 5 נקודות פקטור לכל התלמידים? הממוצע עולה ב־5. המרנו גובה מסנטימטרים למטרים, כלומר הכפלנו ב־0.01? הממוצע מוכפל ב־0.01. והכלל נכון גם לחציון ולשכיח: מפעילים את הטרנספורמציה על המדד עצמו. כשכל הערכים זזים יחד, גם המרכז זז איתם.
ציון החרדה, anx_pre, הוא ממוצע של פריטים מ־1 עד 4. בדוח לבית הספר רוצים אותו בסולם של 0 עד 100. הטרנספורמציהTransformation: מורידים 1, כך שהסולם מתחיל ב־0, ומכפילים ב־100 / 3, כך שהציון 4 הופך ל־100. בקובץ M = 2.24 (המדויק 2.2356), ו־Mdn = 2.25.
אין צורך לחשב מחדש את כל 200 הציונים. ושימו לב שחישבנו מהממוצע המדויק, לא מ־2.24. מ־2.24 היה יוצא 41.33: מעגלים רק בסוף (פרק 2). ומה קורה לפיזורMeasure of dispersion בטרנספורמציה כזו? בפרק 11.
ממוצע של קבוצות: ממוצע משוקלל
בכיתה א׳ 10 תלמידים, והממוצע שלהם במבחן 80. בכיתה ב׳ 30 תלמידים, והממוצע 60. מה הממוצע של כל 40 התלמידים? התשובה המהירה, (80 + 60) / 2 = 70, שגויה. בכיתה ב׳ יש פי שלושה תלמידים, והם צריכים לקבל פי שלושה משקל. חוזרים להגדרה: סכום כל הערכים חלקי מספרם. הסכום של כל כיתה הוא הממוצע שלה כפול מספר התלמידים בה:
זה ממוצע משוקלל: כל ממוצע מקבל משקל לפי מספר הנבדקים שלו. בהרצאה אני שואל: אם יש לנו את הגובה הממוצע של תושבי תל אביב ואת הגובה הממוצע של כל שאר תושבי ישראל, האם הממוצע של כל ישראל הוא פשוט הממוצע של שני המספרים? לא, כי תושבי תל אביב הם רק כ־5% מהאזרחים. ממוצע של ממוצעים נכון רק כשהקבוצות באותו גודל.
ובקובץ שלנו: ממוצע החרדה בקבוצות הוא 2.32 (74 תלמידים), 2.17 (51) ו־2.19 (75). הממוצע של שלושת הממוצעים הוא 2.23. הממוצע של כל 200 התלמידים הוא 2.24. ההבדל קטן, כי הקבוצות לא שונות מאוד בגודלן. אבל הוא קיים, ורק המספר השני הוא הממוצע האמיתי.
מעבדה: הממוצע כנקודת האיזון
- בחרו "דוגמת הפרק" ולחצו פעם אחת על "הוסיפו ערך קיצוני (30)". מה הממוצע ומה החציון עכשיו? ומה סכום הסטיות בטבלה?
- בחרו "ימי מחלה (10 עובדים)". למה הממוצע גבוה כל כך מהחציון?
- הקלידו 2, 4, 4, 5, 10, 5. האם הממוצע השתנה לעומת "דוגמת הפרק"? למה?
בדיקת התשובה
1. הממוצע 9.17, והחציון 4.5. הממוצע זז ביותר מ־4, והחציון בחצי. סכום הסטיות עדיין 0: השליליות מסתכמות ל־−21.67, והחיוביות ל־21.67. 2. הממוצע 3.2, החציון 1.5, והשכיח 0. רוב העובדים נעדרו מעט, ושני עובדים, עם 7 ו־14 ימים, מושכים את הממוצע לכיוון הזנב. 3. לא, הממוצע נשאר 5: הערך שהוספנו שווה לממוצע, ולכן הסטייה שלו 0 והוא לא מטה את הקרש. החציון השתנה מ־4 ל־4.5, כי עכשיו יש שישה ערכים.
מעבדה: מי רגיש למה?
- בחרו "מספר אחים" (תשעה תלמידים) והזיזו את הערך הגבוה עד 99. מה קרה לשכיח, לחציון ולממוצע?
- בחרו "ימי תרגול" והוסיפו 5 לכל ערך. מה קרה לשלושת מדדי המרכז?
- החזירו את התוספת ל־0, והכפילו כל ערך פי 2. מה קרה עכשיו?
בדיקת התשובה
1. השכיח והחציון נשארו 2, והממוצע קפץ מ־2.00 ל־12.56. בדיוק מה שקורה בקובץ כש־99 לא מוגדר כחסר. 2. כל השלושה עלו מ־3 ל־8: הוספת קבוע מזיזה את כל מדדי המרכז באותו קבוע. 3. כל השלושה הוכפלו, מ־3 ל־6. ואם תציצו במדדי הפיזור: בהוספה הם לא השתנו, ובהכפלה הם הוכפלו. נבין את זה בפרק 11.
לעשרה תלמידים ממוצע 20 בשאלון. א. מה סכום הציונים? ב. מצטרף תלמיד עם ציון 42. מה הממוצע החדש? ג. במקום זה, כל ציון מוכפל פי 3. מה הממוצע? ד. ובמקום זה, מורידים מכל ציון 4. מה הממוצע?
בדיקת התשובה
בדקו את עצמכם4 שאלות
1.הערכים 1, 3, 5, 11. הממוצע 5. מה סכום הסטיות מהממוצעDeviation from the mean?
2.בטבלה של 9 משכורות, משכורת המנכ״ל עולה מ־40 ל־80 אלף. מה יקרה לממוצע ולחציון?
3.ממוצע הציונים בכיתה הוא 72, החציון 75, והשכיח 80. המורה מוסיפה 6 נקודות פקטור לכולם. מה המדדים החדשים?
4.בקבוצה אחת 20 תלמידים עם ממוצע 4.0, ובשנייה 5 תלמידים עם ממוצע 6.0. מה הממוצע של כל 25 התלמידים?
איזה מדד לבחור?
הבחירה תלויה בשני דברים. סולם המדידה: שמי, שכיח. סדר, חציון. רווח ומנה, ממוצע. בכל סולם בוחרים את המדד החזק ביותר שמותר. צורת ההתפלגות: בהתפלגות סימטריתSymmetric distribution שלושת המדדים קרובים, ומדווחים ממוצע. בהתפלגות מוטה, או עם ערכים קיצוניים, הממוצע נמשך לכיוון הזנב, ומדווחים חציון. הטיה חיוביתPositive skew: בדרך כלל Mo < Mdn < M. הטיה שליליתNegative skew: הסדר הפוך.
לפי סולם המדידה
כל מדד דורש תכונה אחרת של הסולם, כמו שראינו בפרק 6. השכיח צריך רק לדעת מה שווה למה, ולכן מתאים לכל סולם. החציון צריך סדר. הממוצע צריך מרווחים שווים.
| הסולם | שכיח | חציון | ממוצע | מה מדווחים | דוגמה מהקובץ |
|---|---|---|---|---|---|
| שמי | ✓ | — | — | שכיח | קבוצה: Mo = המשולבת |
| סדר | ✓ | ✓ | — | חציון | השכלת ההורה: Mdn = תואר ראשון |
| רווח ומנה | ✓ | ✓ | ✓ | ממוצע, או חציון כשההתפלגות מוטה מאוד | חרדה: M = 2.24 |
הכלל: בכל סולם בוחרים את המדד החזק ביותר שמותר. בהשכלת ההורה מותרים שכיח וחציון. החציון חזק יותר, כי הוא משתמש גם בסדר. אז מדווחים Mdn = 3, תואר ראשון. ואם בכל זאת תחשבו ממוצע? תקבלו 2.70, ואקסל לא יתלונן. אבל "2.70" מניח שהמרחק בין תיכון לעל־תיכונית שווה למרחק בין תואר ראשון לתואר שני, ואין לנו שום סיבה להניח את זה. ובקבוצת המחקר, ממוצע הקודים הוא 1.005. מספר בלי שום משמעות, כמו ממוצע המגדר בפרק 6.
לפי צורת ההתפלגות
בפרק 9 ראינו שהתפלגות יכולה להיות סימטרית, או מוטה, עם זנב ארוך לצד אחד. בהתפלגות סימטרית עם שיא אחד, שלושת המדדים נמצאים באותה נקודה, באמצע. ימי התרגול של שישה תלמידים, 1, 2, 3, 3, 4, 5, הם דוגמה: השכיח, החציון והממוצע כולם 3.
בהתפלגות מוטה, הממוצע נמשך לכיוון הזנב. השכיח נשאר בשיא, והחציון באמצע, ביניהם. לכן:
- הטיה חיוביתPositive skew, זנב ימינה, לערכים הגבוהים: Mo < Mdn < M. כמו מספר האחים: 2, 2, 2.33. או שכר, או זמני המתנה.
- הטיה שליליתNegative skew, זנב שמאלה, לערכים הנמוכים: M < Mdn < Mo. למשל, ציונים במבחן קל: רובם גבוהים, ומעטים נכשלו.
את הסדר קוראים כמו על ציר מספרים: הקטן משמאל. והכלל עובד גם בכיוון ההפוך: אם הממוצע גבוה בהרבה מהחציון, זה רמז להטיה חיובית. אם נמוך ממנו בהרבה, להטיה שלילית. בפרק 12 נלמד למדוד הטיה במספר.
ומה מדווחים? בהתפלגות סימטריתSymmetric distribution, את הממוצע, כי הוא משתמש בכל המידע. בהתפלגות מוטה מאוד, או כשיש ערכים קיצוניים, את החציון, ולעיתים קרובות את שניהם, כדי שהקורא יראה את הפער. במספר האחים הייתי כותב: Mdn = 2, M = 2.33.
ב־anx_pre השכיח הוא 1.75: 23 תלמידים קיבלו בדיוק את הציון הזה. אבל הממוצע 2.24 והחציון 2.25. האם ההתפלגות מוטה? לא בהכרח. בציון שהוא ממוצע של שמונה פריטים יש עשרים וכמה ערכים אפשריים, והשכיח הוא פשוט הערך שבמקרה יצא הכי הרבה פעמים. תלמיד אחד יותר או פחות, והשכיח עובר למקום אחר לגמרי. במשתנה עם הרבה ערכים, השכיח לא מדד מרכז שימושי. מסתכלים על ההיסטוגרמהHistogram, שבה הקטגוריה השכיחה היא 2.0 עד 2.5 (פרק 9).
הסדר "שכיח, חציון, ממוצע" בהטיה חיובית מופיע כמעט בכל ספר, והוא נכון ברוב ההתפלגויות שתפגשו. אבל הוא כלל אצבע, לא משפט מתמטי. בהתפלגויות בדידות, או עם יותר משיא אחד, הוא יכול להיכשל (von Hippel, 2005). בקובץ שלנו יש דוגמה: ב־anx_pre הזנב הארוך מעט יותר פונה לחרדה הגבוהה, ובכל זאת הממוצע, 2.2356, נמוך קצת מהחציון, 2.25. ההבדל זעיר, ולא אומר כלום על הצורה. לכן: כשהממוצע והחציון רחוקים זה מזה, זה רמז טוב להטיה. כשהם קרובים, לא מסיקים מהם כלום, ומסתכלים בגרף.
מעבדה: מדדי מרכז וצורת ההתפלגות
- התחילו מ"סימטרית". איפה שלושת המדדים?
- בחרו "מוטה חיובית". מה הסדר בין המדדים משמאל לימין? ואיזה מהם רחוק הכי הרבה מהשיא של העקומה?
- הזיזו את המחוון מ־+0.4 ל־+1. מה קורה למרחק בין השכיח לממוצע?
בדיקת התשובה
1. שלושתם כמעט באותה נקודה, סביב 50. 2. שכיח (45.1), חציון (48.4), ממוצע (49.9). השכיח נמצא בשיא, והממוצע הכי רחוק ממנו, לכיוון הזנב הימני. במעבדה הזו הממוצע נשאר בערך במקום, וההתפלגות "נבנית" סביבו, לכן נראה שדווקא השכיח זז. מה שחשוב הוא הסדר והמרחק ביניהם. 3. המרחק גדל: ב־+0.4 השכיח 47.6 והממוצע 50.0, וב־+1 השכיח 44.1 והממוצע 49.9. ככל שההטיה חזקה יותר, המדדים מתרחקים זה מזה.
איזה מדד מרכז מתאים? א. שפת האם של התלמידים (עברית, ערבית, רוסית, אמהרית, אחרת). ב. דירוג "כמה נהנית מהתוכנית" מ־1 עד 5. ג. גובה של 200 תלמידים, בהתפלגות סימטרית. ד. מחירי דירות בעיר, עם כמה דירות יקרות מאוד. ה. בהתפלגות מסוימת הממוצע 52 והחציון 45. מה כנראה הצורה?
בדיקת התשובה
א. שכיח: סולם שמיNominal scale. ב. חציון: פריט בודד הוא סולם סדר (פרק 6). ג. ממוצע: סולם מנהRatio scale, והתפלגות סימטרית. ד. חציון: הדירות היקרות מושכות את הממוצע למעלה. ה. הממוצע גבוה בהרבה מהחציון: כנראה הטיה חיובית, זנב לערכים הגבוהים.
בדקו את עצמכם3 שאלות
1.חוקרת רוצה לתאר את דרגת הצבא של המשתתפים: טוראי, רב״ט, סמל, סמ״ר. איזה מדד מרכז הכי מתאים?
2.בציונים של מבחן קל מאוד, רוב התלמידים קיבלו בין 85 ל־100, ומעטים נכשלו. מה הסדר הצפוי בין המדדים?
3.הכנסה חודשית של משקי בית: הממוצע 21,000 ש״ח והחציון 15,500. האם לפחות מחצית ממשקי הבית מרוויחים פחות מהממוצע? איזה מדד מתאר טוב יותר משק בית טיפוסי?
ממוצעים לפי קבוצה בטבלת ציר
באותה טבלת ציר של פרק 9: את משתנה הקבוצה גוררים ל־Rows, ואת המשתנה הכמותי ל־Values. ב־Value Field Settings מחליפים את Sum ב־Average. ה־Grand Total הוא הממוצע של כל הנבדקים, ממוצע משוקלל, ולא ממוצע הממוצעים. וטבלת ציר לא יודעת ש־99 הוא חסר: מסננים אותו ב־Filters.
בפרק 9 ספרנו בטבלת ציר כמה תלמידים יש בכל קבוצה. עכשיו נשאל שאלה אחרת: מה ממוצע החרדה בכל קבוצה, לפני התוכנית ואחריה? זו שאלה שחוקרים שואלים כמעט בכל מחקר, והתשובה מתקבלת בכמה גרירות.
- לוחצים על תא בתוך הנתונים, ו־Insert > PivotTable.
- גוררים את
groupל־Rows. - גוררים את
anx_preל־Values. ברירת המחדל, כמו בפרק 9, היא Sum: סכום החרדה של כל התלמידים בקבוצה. זה לא מה שאנחנו רוצים. - לוחצים על Sum of anx_pre, בוחרים Value Field Settings, ובלשונית Summarize value field by בוחרים Average.
- גוררים גם את
anx_postל־Values, ושוב מחליפים ל־Average. בכפתור Number Format שבאותו חלון אפשר לקבוע שתי ספרות אחרי הנקודה.
PivotTable: Average of anx_pre, Average of anx_post, by group
| Row Labels | Average of anx_pre | Average of anx_post |
|---|---|---|
| 0 | 2.32 | 2.31 |
| 1 | 2.17 | 1.98 |
| 2 | 2.19 | 1.91 |
| Grand Total | 2.24 | 2.07 |
- 0, 1, 2
- ביקורת, תוכנית עקיפה, תוכנית משולבת.
- Average of anx_pre
- ממוצע החרדה בתחילת השנה. שלוש הקבוצות דומות: 2.32, 2.17, 2.19.
- Average of anx_post
- ממוצע החרדה בסוף השנה. בקבוצת הביקורת כמעט לא השתנה. בשתי קבוצות התוכנית ירד, בעיקר במשולבת: מ־2.19 ל־1.91.
- Grand Total
- הממוצע של כל 200 התלמידים: 2.24. זה ממוצע משוקלל. הממוצע של שלושת הממוצעים יוצא 2.23.
הטבלה הזו מראה תמונה מעניינת: נראה שהחרדה ירדה בקבוצות התוכנית ולא בביקורת. אבל האם הירידה גדולה מכדי להיות מקרית? על זה נענה בהמשך הספר, במבחני t (פרק 21) ובניתוח שונותOne-way ANOVA (פרק 26). בינתיים, זה בדיוק "הרושם הראשוני" שטבלת ציר נותנת, לפני שפותחים תוכנה סטטיסטית.
גררו את siblings ל־Values, עם Average, ו־group ל־Rows. התוצאה:
PivotTable: Average of siblings (wrong: 99 included)
| Row Labels | Average of siblings |
|---|---|
| 0 | 5.07 |
| 1 | 4.00 |
| 2 | 4.95 |
| Grand Total | 4.75 |
חמישה אחים בממוצע? טבלת ציר, כמו AVERAGE, לא יודעת ש־99 הוא קוד חסר. התיקון: גוררים את siblings גם ל־Filters, ובתפריט שנפתח מעל הטבלה מסמנים Select Multiple Items ומבטלים את הסימון של 99. עכשיו:
PivotTable: Average of siblings, filter siblings ≠ 99
| Row Labels | Average of siblings |
|---|---|
| 0 | 2.46 |
| 1 | 2.10 |
| 2 | 2.37 |
| Grand Total | 2.33 |
דרך אחרת, בטוחה יותר: להחליף מראש את ה־99 בתאים ריקים, כמו בפרק 8. טבלת ציר מתעלמת מתאים ריקים בממוצע.
שורות מול עמודות, וסטיית תקן
כמו בפרק 9, אפשר לשים משתנה שני ב־Columns. עם group ב־Rows, gender ב־Columns ו־Average of anx_pre ב־Values, כל תא הוא ממוצע החרדה של קבוצה ומגדר יחד. בכל שלוש הקבוצות הבנות מדווחות על חרדה גבוהה יותר: בסך הכול 2.07 אצל הבנים ו־2.39 אצל הבנות. ובחלון Value Field Settings יש גם StdDev, סטיית תקן, שנלמד בפרק 11. ממוצע ליד סטיית תקן, לכל קבוצה, הוא הטבלה הראשונה כמעט בכל מאמר.
בטבלת ציר עם grade ב־Rows ו־Average of anx_pre ב־Values, יצא בכיתה ד׳ 2.22 (133 תלמידים) ובכיתה ה׳ 2.27 (67 תלמידים). מה יופיע ב־Grand Total? ולמה הוא לא 2.245?
בדיקת התשובה
ב־Grand Total יופיע 2.24, הממוצע של כל 200 התלמידים. 2.245 הוא ממוצע של שני הממוצעים, שנותן לכיתה ה׳, הקטנה בחצי, אותו משקל כמו לכיתה ד׳. (חישבנו מהממוצעים המעוגלים. מהנתונים המדויקים יוצא 2.2356, וגם הוא 2.24.)
בדקו את עצמכם3 שאלות
1.גררתם את anx_post ל־Values, והטבלה מראה בקבוצה 2 את המספר 143.125. מה קרה?
2.בטבלת ציר של ממוצעים לפי קבוצה, האם ה־Grand Total הוא הממוצע של ממוצעי הקבוצות?
3.איך מוציאים את ערכי ה־99 של parent_edu מחישוב הממוצע בטבלת ציר, בלי לשנות את הקובץ?
בתוכנה: שכיח, חציון וממוצע
נחשב את שלושת מדדי המרכז של מספר האחים, ואת ממוצע החרדה לפי קבוצה. בחרו את התוכנה שלכם.
שלוש פונקציות, כולן בנויות כמו SUM: שם הפונקציה, ובסוגריים הטווח. siblings בעמודה I, ו־anx_pre בעמודה AI, בשורות 2 עד 201.
Measures of central tendency
| Formula | Result | Note |
|---|---|---|
=AVERAGE(I2:I201) | 4.75 | wrong: the five 99s are included |
=AVERAGEIF(I2:I201,"<>99") | 2.333333 | mean without the 99s |
=MEDIAN(I2:I201) | 2 | the same with or without the 99s |
=MODE.SNGL(I2:I201) | 2 | |
=AVERAGE(AI2:AI201) | 2.235625 | anx_pre, no missing |
=MEDIAN(AI2:AI201) | 2.25 |
- AVERAGE
- הממוצע. מתעלם מתאים ריקים, אבל לא מ־99. לכן 4.75.
- AVERAGEIF
- ממוצע רק של התאים שעומדים בתנאי.
"<>99"פירושו "שונה מ־99". אם החלפתם את ה־99 בתאים ריקים לפי פרק 8, מספיק AVERAGE. - MEDIAN
- החציון. הפונקציה מסדרת את הערכים לבד. ה־99 הם חמישה ערכים גבוהים בקצה, ולכן הם כמעט לא מזיזים את האמצע. אבל אל תסמכו על זה: כשיש הרבה ערכי 99, גם החציון ייפגע.
- MODE.SNGL
- השכיח. אם יש כמה שכיחים, היא מחזירה רק את הראשון שהופיע בנתונים.
MODE.MULTמחזירה את כולם. ואם אין שכיח, כל ערך מופיע פעם אחת, מתקבלת השגיאה #N/A.
ממוצע מטבלת שכיחויות: אם בעמודה BN הערכים 0 עד 7 (שורות 2 עד 9), ובעמודה BO השכיחויות שלהם, עם =COUNTIF($I$2:$I$201,BN2) כמו בפרק 9, אז =SUMPRODUCT(BN2:BN9,BO2:BO9)/SUM(BO2:BO9) נותן 2.333333. SUMPRODUCT מכפילה כל ערך בשכיחות שלו ומחברת: בדיוק עמודת x · f, בתא אחד.
אזהרה: במשתנה שמי עם קודים, כמו group, אקסל יחשב בשמחה גם ממוצע וגם חציון. רק השכיח בעל משמעות.
לפי קבוצה: טבלת ציר עם Average, כמו בקטע 6. או בנוסחה: =AVERAGEIF(D2:D201,2,AI2:AI201) נותן את ממוצע החרדה בקבוצה 2, 2.191428. הארגומנט הראשון הוא עמודת התנאי, group בעמודה D. השני הוא התנאי. והשלישי העמודה שממצעים.
שלושת המדדים למשתנה אחד:
- ודאו ש־99 מוגדר כחסר ב־
siblings(Variable View, עמודה Missing, פרק 8). - Analyze > Descriptive Statistics > Frequencies. מעבירים את
siblingsל־Variable(s). - בכפתור Statistics, בחלק Central Tendency, מסמנים Mean, Median ו־Mode. Continue.
- אם לא צריך שוב את טבלת השכיחויות, מבטלים את Display frequency tables. OK.
Statistics
| Number of siblings | ||
|---|---|---|
| N | Valid | 195 |
| Missing 1 | 5 | |
| Mean | 2.33 | |
| Median | 2.00 | |
| Mode | 2 | |
- N Valid, 1 · Missing
- 195 תלמידים עם ערך, ו־5 עם 99 שהוגדר כחסר. אם Missing הוא 0 ו־Mean הוא 4.75, הקוד לא הוגדר.
- Mean, Median, Mode
- 2.33, 2 ו־2. כשיש כמה שכיחים, SPSS מציג את הקטן שבהם ומוסיף הערה: Multiple modes exist. The smallest value is shown.
ממוצע לפי קבוצה: Analyze > Compare Means > Means (בגרסאות החדשות התפריט נקרא Compare Means and Proportions). מעבירים את anx_pre ל־Dependent List, ואת group ל־Independent List. ב־Options אפשר להוסיף גם Median.
Report: Anxiety, pre
| Study group | Mean | N | Std. Deviation |
|---|---|---|---|
| Control | 2.3243 | 74 | .52787 |
| Indirect (teachers only) | 2.1719 | 51 | .53498 |
| Combined (teachers and pupils) | 2.1914 | 75 | .49301 |
| Total | 2.2356 | 200 | .51886 |
- Mean
- ממוצע החרדה בכל קבוצה. בשורה Total, הממוצע של כל 200 התלמידים: ממוצע משוקלל.
- Std. Deviation
- סטיית התקן של כל קבוצה. נלמד אותה בפרק 11.
מספר הספרות אחרי הנקודה תלוי בהגדרת המשתנה.
- Descriptives > Descriptive Statistics. גוררים את
siblingsואתanx_preלחלון Variables. ודאו ש־99 מוגדר כחסר ב־siblings(פרק 8). - בחלק Statistics, תחת Central Tendency, מסמנים Mean, Median ו־Mode.
- לממוצע לפי קבוצה: גוררים את
groupלחלון Split. כל מדד יחושב לכל קבוצה בנפרד.
Descriptive Statistics
| siblings | anx_pre | |
|---|---|---|
| Valid | 195 | 200 |
| Missing | 5 | 0 |
| Mode | 2.000 | 1.750 |
| Median | 2.000 | 2.250 |
| Mean | 2.333 | 2.236 |
| Std. Deviation | 1.512 | 0.519 |
| Minimum | 0.000 | 1.125 |
| Maximum | 7.000 | 3.750 |
- Mode
- 2 אחים. ב־
anx_pre, 1.750: הערך שיצא במקרה הכי הרבה פעמים, רחוק מהמרכז. ראו את המסגרת "השכיח של ציון רציף" בקטע 5. כשיש כמה שכיחים, JASP מוסיף הערה ומציג רק אחד מהם. - Median, Mean
- 2 ו־2.333 אחים. 2.25 ו־2.236 בחרדה. JASP מציג שלוש ספרות. בדוח מעגלים לשתיים: M = 2.24.
- Std. Deviation, Minimum, Maximum
- מופיעים כברירת מחדל. סטיית התקן בפרק 11.
עם group ב־Split, הטבלה מראה את אותם מדדים לכל קבוצה: ב־anx_pre ממוצעים של 2.324, 2.172 ו־2.191, כמו בטבלת הציר.
בגרסאות שונות של JASP הטבלה יכולה להיות מסובבת: משתנים בשורות ומדדים בעמודות.
בדקו את עצמכם3 שאלות
1.בעמודה של 30 ציונים יש שני ערכים שמופיעים ארבע פעמים כל אחד: 70 ו־85. 85 מופיע ראשון בעמודה. מה תחזיר MODE.SNGL?
1.בעמודה של 30 ציונים יש שני ערכים שמופיעים ארבע פעמים כל אחד: 70 ו־85. 85 מופיע ראשון בקובץ. מה יציג SPSS בשורה Mode של Frequencies?
1.בעמודה של 30 ציונים יש שני ערכים שמופיעים ארבע פעמים כל אחד: 70 ו־85. מה יעשה JASP בשורה Mode של Descriptive Statistics?
2.בפלט של siblings מופיעים: N תקף 200, חסרים 0, ממוצע 4.75. מה הבעיה?
3.מה מחזירה הנוסחה =AVERAGEIF(D2:D201,0,AI2:AI201)?
3.ב־SPSS, ב־Analyze > Compare Means > Means, העברתם את anx_pre ל־Dependent List ואת group ל־Independent List. מה המספר בשורה Total, בעמודה Mean?
3.ב־JASP, ב־Descriptive Statistics, גררתם את anx_pre ל־Variables ואת group ל־Split. מה תראו?
טעויות נפוצות
- מבלבלים בין השכיח לשכיחות שלו. בטבלה עם שכיחויות 6, 9, 5 לערכים 1, 2, 3, השכיח הוא 2, לא 9.
- מחשבים חציון בלי לסדר. או מדווחים את המיקום, (n + 1) / 2, במקום את הערך שנמצא בו.
- ממוצע של קודים. ממוצע הקבוצה, 1.005, או ממוצע השכלת ההורה, לא אומרים דבר. בשמי, שכיח. בסדר, חציון.
- שוכחים את ה־99. AVERAGE וטבלת ציר מחברים אותו כמו כל מספר. בודקים תמיד את ה־Missing ואת הערך המקסימלי.
- ממוצע של ממוצעים, כשהקבוצות בגדלים שונים. משקללים לפי מספר הנבדקים.
- ממוצע להתפלגות מוטה מאוד. בשכר, במחירי דירות ובזמני המתנה, מדווחים חציון, או את שניהם.
- מסיקים צורה מהבדל זעיר בין הממוצע לחציון. כשהם קרובים, מסתכלים בגרף.
בדקו את עצמכם
סיכום
- סטטיסטי ופרמטר: סטטיסטי מחושב על מדגם (M), פרמטר מתאר אוכלוסייה (μ). תוחלת היא ממוצע האוכלוסייה.
- שלושה מדדים: שכיח, הנפוץ ביותר. חציון, האמצעי אחרי סידור, במיקום (n + 1) / 2. ממוצע, Σx / n.
- מטבלת שכיחויות: שכיח לפי השכיחות הגבוהה, חציון לפי השכיחות המצטברת, וממוצע Σxf / n.
- תכונות הממוצע: נקודת האיזון, Σ(x − M) = 0. רגיש לערכים קיצוניים, והחציון עמיד. טרנספורמציה לינארית פועלת על כל המדדים. קבוצות בגדלים שונים: ממוצע משוקלל.
- בחירת מדד: שמי, שכיח. סדר, חציון. רווח ומנה, ממוצע, או חציון כשיש הטיה חזקה. הטיה חיובית: בדרך כלל Mo < Mdn < M.
- טבלת ציר: Average במקום Sum, ו־99 מסננים ב־Filters.
מונחים חדשים
שאלות לדוגמה, עם פתרונות
שמונה תלמידים דיווחו כמה שעות ישנו בלילה שלפני מבחן: 7, 6, 8, 5, 7, 9, 7, 3. חשבו שכיח, חציון וממוצע. מה הסדר ביניהם רומז על הצורה?
בדיקת התשובה
3, 5, 6, 7, 7, 7, 8, 9 מסדריםMo = 7 שלוש פעמים(8 + 1) / 2 = 4.5 → Mdn = (7 + 7) / 2 = 7 הרביעי והחמישי= 52 / 8 = 6.5הממוצע, 6.5, נמוך מהחציון ומהשכיח, 7. רמז להטיה שלילית: תלמיד אחד ישן רק 3 שעות, והוא מושך את הממוצע למטה.
בסקר של 50 הורים נשאלו כמה ילדים יש להם בבית הספר: 1 ילד: 22 הורים, 2: 18, 3: 8, 4: 2. חשבו את החציון ואת הממוצע.
בדיקת התשובה
(50 + 1) / 2 = 25.5 בין ה־25 ל־26cf: 22, 40, 48, 50 → Mdn = 2 ה־25 וה־26 בשורה של 21 · 22 + 2 · 18 + 3 · 8 + 4 · 2 = 22 + 36 + 24 + 8 = 90 Σxf= 90 / 50 = 1.8בבית ספר שתי שכבות. בשכבה ד׳ 60 תלמידים, וממוצע הקשיבות שלהם 3.1. בשכבה ה׳ 40 תלמידים, וממוצע 3.4. א. מה ממוצע הקשיבות של כל 100 התלמידים? ב. הקשיבות נמדדה בסולם 1 עד 5, והמנהלת מבקשת אותה בסולם 0 עד 100, לפי y = (x − 1) · 25. מה יהיה הממוצע הכללי בסולם החדש?
בדיקת התשובה
(60 · 3.1 + 40 · 3.4) / 100 = (186 + 136) / 100 = 3.22 ממוצע משוקלל, לא 3.25(3.22 − 1) · 25 = 2.22 · 25 = 55.5 מפעילים את הטרנספורמציה על הממוצעלפניכם פלט של SPSS לשאלה על השכלת ההורה. מה לא בסדר, ומה צריך לדווח?
Statistics: Parent education
Value N Valid 200 Missing 0 Mean 5.59 Median 3.00 Mode 3 בדיקת התשובה
שני דברים. ראשית, Missing הוא 0 ו־Valid הוא 200, אבל אצל 6 תלמידים ההשכלה לא ידועה: הקוד 99 לא הוגדר כחסר. זו הסיבה שהממוצע, 5.59, גבוה מהערך הגבוה ביותר בסולם, 4. שנית, גם אחרי התיקון לא מדווחים ממוצע: השכלה היא סולם סדר. מדווחים את החציון, 3, תואר ראשון. אחרי שמגדירים את 99 כחסר, N Valid יהיה 194, והחציון יישאר 3.
חוקרת מדדה את זמן התגובה, באלפיות שנייה, של 30 נבדקים. השכיח 320, החציון 350, והממוצע 410. א. מהי כנראה צורת ההתפלגות? ב. האם לפחות מחצית מהנבדקים הגיבו מהר מהממוצע? ג. מוסיפים נבדק עם זמן תגובה 410. מה יקרה לממוצע?
בדיקת התשובה
א. הטיה חיובית: Mo < Mdn < M. כמה נבדקים איטיים מאוד מושכים את הממוצע ימינה. ב. כן. לפחות חצי מהנבדקים הגיבו ב־350, החציון, או מהר יותר, ולכן גם מהר מהממוצע, 410. ג. הממוצע לא ישתנה: (30 · 410 + 410) / 31 = 410. ערך ששווה לממוצע לא מזיז אותו.
תרגול עם הנתונים
הקבצים עצמם נמצאים גם בתיקיית data בחבילת הספר.
- חשבו שכיח, חציון וממוצע לפריט החרדה הראשון,
a1(1 עד 4). איזה מדד מתאים לדווח, ולמה?בדיקת התשובה
שכיח 2 ("לפעמים", 75 תלמידים), חציון 2, ממוצע 2.04. פריט בודד הוא סולם סדר, ולכן מדווחים את החציון: "לפעמים". הממוצע מניח שהמרחק בין "אף פעם" ל"לפעמים" שווה למרחק בין "לעיתים קרובות" ל"תמיד".
- חשבו את הממוצע ואת החציון של שביעות הרצון בסוף השנה,
sat_post(1 עד 7). ומה השכיח? מה מוזר בו?בדיקת התשובה
ממוצע 5.45, חציון 5.4, ושכיח 7. 33 תלמידים, יותר מכל ערך אחר, סימנו את הציון המקסימלי בכל חמשת הפריטים. השכיח נמצא בקצה הסולם, ולא במרכז. זו "תקרה": תלמידים שהיו רוצים לסמן יותר לא יכולים. גם כאן רואים שבציון עם הרבה ערכים השכיח לא מתאר את המרכז.
- בטבלת ציר, חשבו את ממוצע שביעות הרצון לפני התוכנית ואחריה (
sat_pre,sat_post) בכל קבוצה. באיזו קבוצה העלייה הגדולה ביותר?בדיקת התשובה
ביקורת: מ־4.94 ל־5.21, עלייה של 0.27. עקיפה: מ־5.27 ל־5.68, עלייה של 0.41. משולבת: מ־5.05 ל־5.53, עלייה של 0.48. העלייה הגדולה ביותר בתוכנית המשולבת. גם בביקורת יש עלייה: לכן צריך קבוצת ביקורת, כדי לדעת כמה מהשינוי קורה גם בלי תוכנית (פרק 7).
- חשבו את ממוצע הגיל באקסל בשתי דרכים:
=AVERAGE(G2:G201), ו־ממוצע של ממוצעי הקבוצות מטבלת ציר. האם יוצא אותו דבר?בדיקת התשובה
AVERAGE נותן 10.05 (10.054). ממוצעי הקבוצות הם 10.00, 10.20 ו־10.01, והממוצע שלהם 10.07. לא אותו דבר: הקבוצה העקיפה, עם התלמידים המבוגרים יותר, קטנה מהאחרות, וממוצע הממוצעים נותן לה משקל גדול מדי. ה־Grand Total בטבלת הציר הוא 10.05, הממוצע הנכון.
- מה ממוצע ההתנדבות בסוף השנה,
vol_post(0 לא, 1 כן), בכל קבוצה? מה המספר הזה אומר?בדיקת התשובה
ביקורת 0.36, עקיפה 0.55, משולבת 0.64. במשתנה של 0 ו־1, הממוצע הוא שיעור ה־1: סכום האחדים הוא מספר המתנדבים, וחלקי n זה החלק שלהם. כלומר, 64% מתלמידי התוכנית המשולבת התנדבו בסוף השנה, לעומת 36% בביקורת. זה יוצא דופן: למשתנה שמי עם שני ערכים, 0 ו־1, לממוצע יש משמעות.
בפרק הבא: מדדי פיזור. שתי כיתות יכולות להיות עם אותו ממוצע, ובכל זאת שונות מאוד. כמה התלמידים שונים זה מזה? תחוםRange, רבעוניםQuartile, שונות וסטיית תקן.
מקורות: Tarrasch, R., & Berger, R. (2022). Mindfulness. https://doi.org/10.1007/s12671-022-01955-y · von Hippel, P. T. (2005). Mean, median, and skew: Correcting a textbook rule. Journal of Statistics Education, 13(2). https://doi.org/10.1080/10691898.2005.11910556