חלק ב: תיאור נתונים · פרק 9
טבלאות שכיחויות וגרפים
קובץ המחקר מוכן: 200 שורות, 55 עמודות. אבל אף אחד לא יכול להבין 11,000 מספרים במבט אחד. הצעד הראשון בכל ניתוח הוא לסדר אותם: לספור כמה פעמים מופיע כל ערך, לקבץ ערכים כשיש הרבה מהם, ולצייר. בפרק הזה נבנה טבלת שכיחויותFrequency table, נלמד לקבץ לקטגוריות, נבחר את הגרף המתאים לכל משתנה, ונכיר את טבלת הציר של אקסל, הכלי המהיר ביותר לכל זה.
רציתם לדעת כמה תלמידים יש בכל קבוצה. יצרתם באקסל טבלת ציר, והיא ענתה: בקבוצת הביקורת 0, בתוכנית העקיפה 51, ובתוכנית המשולבת 150. מה קרה?
אקסל לא ספר את התלמידים. הוא חיבר את הקודים שלהם. בקבוצת הביקורת הקוד הוא 0, ו־74 אפסים הם 0. בתוכנית המשולבת הקוד הוא 2, ו־75 פעמים 2 הן 150. בסוף הפרק תדעו לבנות טבלת שכיחויות נכונה, ביד ובתוכנה, ולזהות מיד מתי מספר בטבלה לא יכול להיות נכון.
בסוף הפרק תוכלו
- לבנות טבלת שכיחויות מלאה: שכיחותFrequency, שכיחות יחסיתRelative frequency, שכיחות מצטברתCumulative frequency ואחוז מצטברCumulative percent.
- לקבץ ערכים לקטגוריות, ולחשב גבולות אמיתייםReal limits, רוחב ואמצע של קטגוריה.
- לבחור בין עוגה, דיאגרמת עמודותBar chart והיסטוגרמהHistogram לפי סולם המדידה.
- לבנות באקסל טבלת ציר: ספירה, סינון, ושורות מול עמודות.
מרשימה לטבלה: שכיחות
שכיחות (f) של ערך היא מספר הפעמים שהוא מופיע בנתונים. טבלת שכיחויות מציגה כל ערך ואת השכיחות שלו. סכום השכיחויות הוא תמיד מספר הנבדקים, .
הנה התשובות של 20 התלמידים הראשונים בקובץ לפריט החרדה הראשון, "אני דואג/ת לגבי דברים" (1 אף פעם, 2 לפעמים, 3 לעיתים קרובות, 4 תמיד):
מה אפשר להבין מהרשימה? קשה לומר. ועכשיו נספור כמה פעמים מופיע כל ערך:
| התשובה | הקוד | שכיחות (f) |
|---|---|---|
| אף פעם | 1 | 11 |
| לפעמים | 2 | 6 |
| לעיתים קרובות | 3 | 2 |
| תמיד | 4 | 1 |
| סה״כ | 20 |
עכשיו רואים מיד: יותר ממחצית התלמידים עונים "אף פעם", ורק אחד עונה "תמיד". המספר שספרנו נקרא שכיחות, ומסמנים אותו באות f, מהמילה frequency. וטבלה שמציגה כל ערך ואת השכיחות שלו נקראת טבלת שכיחויות.
שתי בדיקות פשוטות לכל טבלה כזו. הראשונה: סכום השכיחויות הוא מספר הנבדקים, כאן 20. אם יצא פחות, שכחתם ערך. אם יצא יותר, ספרתם מישהו פעמיים. השנייה: כל ערך שמופיע בנתונים מופיע בטבלה, גם אם הוא מוזר. אם בטבלה של פריט מ־1 עד 4 מופיעה שורה של 33, או של 99, גיליתם טעות הקלדה או קוד חסר. זו בדיוק הבדיקה שהבטחנו בפרק 8.
ובאיזה סדר כותבים את השורות? כשיש סדר בין הערכים, כמו כאן, לפי הסדר, מהנמוך לגבוה. כשאין סדר, כמו בקבוצת המחקר, אפשר בכל סדר. נוח לפי הקוד, או מהשכיח לנדיר.
עשרה תלמידים דיווחו בכמה חוגים הם משתתפים: 0, 2, 1, 1, 3, 0, 1, 2, 1, 1. בנו טבלת שכיחויות. מה הערך הנפוץ ביותר, ומה סכום השכיחויות?
בדיקת התשובה
| חוגים | f |
|---|---|
| 0 | 2 |
| 1 | 5 |
| 2 | 2 |
| 3 | 1 |
| סה״כ | 10 |
הערך הנפוץ ביותר הוא חוג אחד, עם שכיחות 5. שימו לב להבדל: הערך הוא 1, והשכיחות שלו היא 5. סכום השכיחויות הוא 10, מספר התלמידים.
בדקו את עצמכם3 שאלות
1.שישה תלמידים דירגו כמה הם אוהבים מתמטיקה, מ־1 עד 3: 3, 1, 3, 2, 3, 1. מה השכיחות של הערך 3?
2.במחקר השתתפו 200 תלמידים, אבל סכום השכיחויות בטבלה של פריט מסוים הוא 198. מה ההסבר הסביר ביותר?
3.בטבלת השכיחויות של פריט שהתשובות בו 1 עד 4 מופיעה שורה של הערך 22, עם שכיחות 1. מה עושים?
ארבע העמודות של טבלת שכיחויות
לטבלה המלאה ארבע עמודות. שכיחות: כמה. שכיחות יחסית (אחוז): f / n · 100. שכיחות מצטברת: כמה קיבלו את הערך הזה או ערך נמוך ממנו. אחוז מצטבר: אותו דבר באחוזים. צוברים רק כשיש סדר בין הערכים, כלומר מסולם סדרOrdinal scale ומעלה. כשיש ערכים חסרים, מדווחים את האחוז התקף, מתוך מי שענה.
כל עמודה בטבלה עונה על שאלה אחרת:
- שכיחות (f): כמה נבדקים קיבלו את הערך הזה? סופרים.
- שכיחות יחסית, או אחוז: איזה חלק מהנבדקים קיבלו את הערך? שכיחות חלקי , כפול 100. בזכותה אפשר להשוות בין מדגמים בגדלים שונים: 30 מתוך 50 ו־120 מתוך 200 הם אותם 60%.
- שכיחות מצטברת: כמה נבדקים קיבלו את הערך הזה או ערך נמוך ממנו? מחברים את השכיחות של השורה לשכיחות המצטברת של השורה הקודמת.
- אחוז מצטבר: אותה שאלה, באחוזים. שכיחות מצטברת חלקי , כפול 100.
בספרים ובקורסים רבים מסמנים את השכיחות המצטברת באות F גדולה. בספר נכתוב cf (cumulative frequency), כדי לא להתבלבל עם סטטיסטי , שנפגוש בפרק 26.
בעמודה parent_edu רשומה ההשכלה של ההורה המשכיל יותר: 1 עד 12 שנות לימוד, 2 על־תיכונית, 3 תואר ראשון, 4 תואר שני ומעלה. אצל 6 תלמידים ההשכלה לא ידועה, ורשום 99. לכן יש 194 ערכים תקפים, ואותם סופרים.
| השכלת ההורה | f | אחוז | cf | אחוז מצטבר |
|---|---|---|---|---|
| עד 12 שנות לימוד | 28 | 14.4 | 28 | 14.4 |
| על־תיכונית | 47 | 24.2 | 75 | 38.7 |
| תואר ראשון | 74 | 38.1 | 149 | 76.8 |
| תואר שני ומעלה | 45 | 23.2 | 194 | 100.0 |
| סה״כ | 194 | 100.0 |
ושימו לב לפרט קטן: אם מחברים את שלושת האחוזים המעוגלים, 14.4 ועוד 24.2 ועוד 38.1, מקבלים 76.7, ולא 76.8. ואם מחברים את ארבעתם, יוצא 99.9. אין כאן טעות: כל אחוז עוגל לבד. לכן מחשבים את האחוז המצטבר מהשכיחות המצטברת, ולא מחיבור של אחוזים מעוגלים. כמו שראינו בפרק 2: מעגלים רק בסוף.
איך קוראים שכיחות מצטברת
המילים "לכל היותר" ו"לפחות" הן הרמז. כמה הורים בלי תואר אקדמי, כלומר לכל היותר על־תיכונית? זו השכיחות המצטברת של "על־תיכונית": 75, שהם 38.7%. ואיזה אחוז מההורים בעלי תואר ראשון לפחות? כל השאר: 100 − 38.7 = 61.3, כלומר 61.3%. שכיחות מצטברת צוברת מהערך הנמוך לגבוה, ולכן הסדר של השורות חשוב.
מתי מותר לצבור?
שכיחות מצטברת שואלת "עד הערך הזה", ו"עד" דורש סדר. בסולם סדרOrdinal scale ומעלה, כמו השכלה, מספר אחים או ציון, "לכל היותר על־תיכונית" הוא משפט עם משמעות. אבל בסולם שמיNominal scale אין לה שום משמעות. "עד התוכנית העקיפה" לא אומר כלום, כי את הקבוצות אפשר לסדר בכל סדר שרוצים. לכן במשתנה שמי ממלאים רק שכיחות ואחוז.
אחוז, או אחוז תקף?Valid percent
בדוגמה חילקנו ב־194, ולא ב־200. למה? כי על ששת ההורים שהשכלתם לא ידועה אין לנו מידע. אילו חילקנו ב־200, האחוז של "תואר ראשון" היה 37.0%, וסכום ארבע השורות היה 97%: בדיוק כאילו 3% מההורים "נעלמו". האחוז מתוך מי שענה נקרא אחוז תקף (Valid Percent), ואותו מדווחים. התוכנות הסטטיסטיות מציגות את שניהם, כמו שנראה בקטע "בתוכנה". הם שונים רק כשיש ערכים חסרים.
כמה הם שונים? תלוי בכמה חסרים. בשאלון שמילאו 144 סטודנטים, שניים דילגו על אחת השאלות, ותשעה סימנו בה את התשובה 1. מתוך כולם: 9 / 144 = 6.25%. מתוך מי שענה: 9 / 142 = 6.34%. הבדל זניח. אבל כשחסרים רבים, כמו בשאלה רגישה שרבע מהנבדקים לא ענו עליה, ההבדל כבר גדול, והאחוז מתוך כולם פשוט מטעה. לכן ההרגל הוא תמיד אותו הרגל: מדווחים את האחוז התקף, ואומרים כמה חסרו.
בדוח מחקר אפשר לראות טבלה שבה האחוזים מסתכמים ל־99.9 או ל־100.1. יש שתי דרכים להתמודד. הראשונה, המקובלת במדעי החברה: להשאיר את האחוזים כפי שעוגלו, ולהוסיף הערה "האחוזים אינם מסתכמים ל־100 בגלל עיגול". השנייה, בעיתונות ובגרפים: "לתקן" את האחוז שהעיגול שלו היה הכי קרוב לגבול. הדרך הראשונה ישרה יותר, כי כל מספר בטבלה נשאר נכון. ומה שאסור: לתקן אחוז בלי לומר.
מעבדה: טבלת שכיחויות חיה
- בחרו "מצב רוח" והוסיפו שלושה סטודנטים "שמחים". אילו עמודות השתנו, ובאילו שורות?
- בחרו "פקולטה". למה העמודות המצטברות נעלמו?
- בחרו "מספר אחים". איזה אחוז מהסטודנטים עם שני אחים לכל היותר? ועברו בין עמודות לעוגה: לאיזה משתנה העוגה מתאימה פחות?
בדיקת התשובה
1. השכיחות השתנתה רק בשורה של "שמח". אבל האחוזים השתנו בכל השורות, כי n גדל מ־40 ל־43 והמכנה השתנה. השכיחות המצטברת השתנתה מהשורה של "שמח" ומטה: לשורות שמעליה לא נוסף אף אחד. 2. פקולטה היא משתנה שמי. אין סדר בין הפקולטות, ולכן "עד מדעי הרוח" חסר משמעות. 3. (5 + 12 + 11) / 40 · 100 = 70%, האחוז המצטבר של "2". העוגה מתאימה פחות למצב רוח ולמספר אחים: בעוגה אין סדר, והסדר בין הערכים הוא בדיוק המידע שחשוב בהם.
בקובץ המחקר, מספר האחים של 195 תלמידים (בלי חמשת ערכי ה־99): 0 אחים: 17, 1: 46, 2: 54, 3: 37, 4: 23, 5: 12, 6: 4, 7: 2. מה השכיחות המצטברת של 3 אחים? איזה אחוז מהתלמידים עם שלושה אחים לכל היותר? וכמה תלמידים עם ארבעה אחים לפחות?
בדיקת התשובה
בדקו את עצמכם4 שאלות
1.12 מתוך 48 תלמידים בכיתה משתתפים בחוג ספורט. מה השכיחות היחסית?
2.בטבלה של ערכים 1 עד 4, השכיחויות הן 5, 10, 15, 20 (n = 50). מהו האחוז המצטבר של הערך 3?
3.מתי העמודות Percent ו־Valid Percent בפלט שונות זו מזו?
4.בטבלת השכלת ההורה (28, 47, 74, 45 מתוך 194 תקפים): איזה אחוז מההורים בעלי השכלה על־תיכונית לפחות?
קיבוץ לקטגוריות
כשיש הרבה ערכים שונים, מקבצים אותם לקטגוריות ברוחב שווה, בדרך כלל 5 עד 10. הגבולות הנראים הם המספרים שבטבלה (9.0–9.4). הגבולות האמיתיים רחוקים מהם חצי יחידת מדידה (8.95–9.45). רוחב הקטגוריהClass width: עליון אמיתי פחות תחתון אמיתי. אמצע הקטגוריהClass midpoint: הממוצע של שני הגבולות.
בעמודת הגיל בקובץ יש 21 ערכים שונים, מ־9.2 ועד 11.2. טבלת שכיחויות עם שורה לכל ערך תהיה ארוכה, ורוב השכיחויות בה יהיו קטנות. קשה לראות ממנה תמונה. הפתרון: מחלקים את התחוםRange לקטגוריות ברוחב שווה, וסופרים כמה ערכים נופלים בכל אחת. בספרים אחרים תפגשו לקטגוריה כזו גם את השם מחלקהClass interval. המחיר: לא רואים יותר את הערכים המדויקים. היתרון: רואים את הצורה הכללית.
כמה קטגוריות? בדרך כלל בין 5 ל־10. מעט מדי, והכול נבלע בשתיים־שלוש עמודות. יותר מדי, וחוזרים לטבלה ארוכה עם שכיחויות של 0 ו־1. ושני כללים: הקטגוריות לא חופפות, כדי שכל ערך ייכנס לקטגוריה אחת בדיוק, ומכסות את כל הערכים, בלי חורים ביניהן.
גבולות נראים וגבולות אמיתייםApparent limits
נקבץ את הגיל לקטגוריות של חצי שנה: 9.0–9.4, 9.5–9.9, 10.0–10.4, וכן הלאה. המספרים האלה, שכתובים בטבלה, הם הגבולות הנראים. שימו לב שאין ביניהם חפיפה: אילו כתבנו 9.0–9.5 ו־9.5–10.0, תלמיד בן 9.5 היה שייך לשתי קטגוריות.
אבל הגיל הוא משתנה רציףContinuous variable. נניח שהיינו מודדים בדיוק רב יותר, ומקבלים 9.47. לאיזו קטגוריה הוא שייך? בקובץ, שבו הגיל רשום בדיוק של עשירית, 9.47 נרשם אחרי עיגול כ־9.5, ולכן הוא שייך לקטגוריה השנייה. ו־9.43 נרשם כ־9.4, ושייך לראשונה. כלומר, נקודת המעבר האמיתית בין הקטגוריות היא 9.45: חצי יחידת מדידה מעל הגבול הנראה. אלה הגבולות האמיתיים: 8.95–9.45, 9.45–9.95, וכן הלאה. בגבולות האמיתיים כל קטגוריה מתחילה בדיוק במקום שבו הקודמת נגמרת, ולכן אין ביניהן חורים.
הכלל: הגבול האמיתי רחוק חצי יחידת מדידה מהגבול הנראה. יחידת המדידה היא הדיוק שבו נרשמו הערכים: בציון שלם היא 1, וחצי יחידה הוא 0.5. בגיל בעשיריות היא 0.1, וחצי יחידה הוא 0.05. ומכאן שני מספרים שנשתמש בהם בהיסטוגרמה:
- רוחב הקטגוריהClass width: הגבול העליון האמיתי פחות התחתון האמיתי. 9.45 − 8.95 = 0.5.
- אמצע הקטגוריהClass midpoint: הממוצע של שני הגבולות. (9.0 + 9.4) / 2 = 9.2. יוצא אותו דבר עם הגבולות האמיתיים: (8.95 + 9.45) / 2 = 9.2.
| גבולות נראים | גבולות אמיתיים | אמצע | f | אחוז | cf |
|---|---|---|---|---|---|
| 9.0–9.4 | 8.95–9.45 | 9.2 | 35 | 17.5 | 35 |
| 9.5–9.9 | 9.45–9.95 | 9.7 | 52 | 26.0 | 87 |
| 10.0–10.4 | 9.95–10.45 | 10.2 | 61 | 30.5 | 148 |
| 10.5–10.9 | 10.45–10.95 | 10.7 | 36 | 18.0 | 184 |
| 11.0–11.4 | 10.95–11.45 | 11.2 | 16 | 8.0 | 200 |
| סה״כ | 200 | 100.0 |
חמש קטגוריות, כולן ברוחב 0.5. הקטגוריה הנפוצה היא 10.0–10.4, עם 61 תלמידים. ומהשכיחות המצטברת: 87 תלמידים, 43.5%, צעירים מ־10, כלומר עד הגבול האמיתי 9.95.
בהרצאה אני שואל את הסטודנטים: יש קטגוריות 21–25 ו־26–30, ומגיע מישהו בן 25.4. לאן הוא שייך? התשובה הרגילה היא הגבול האמיתי, 25.5. אבל יש כאן גם שיעור על יחידת המדידה: מי שאומר "בן 25.4" מדד את הגיל שלו בחודשים, לא בשנים. כשמשנים את הרזולוציה, משתנים גם הגבולות.
ויש בגיל עוד דקות אחת, שכדאי להכיר. כששואלים "בן כמה אתה?", אנשים לא מעגלים, אלא קוטמים: מי שנולד לפני 25 שנה ו־11 חודשים יענה "25". אם הגיל נאסף כך, בשנים שלמות שמלאו, הגבולות האמיתיים של הקטגוריה 21–25 הם 21 ו־26, ולא 20.5 ו־25.5. כלל חצי היחידה מניח עיגול. בקובץ שלנו הגיל רשום בעשיריות ומעוגל, ולכן הכלל הרגיל מתאים.
זמן ההגעה לבית הספר נרשם בדקות שלמות. אחת הקטגוריות בטבלה היא 10–14 דקות. מהם הגבולות האמיתיים? מהו הרוחב, ומהו האמצע? ותלמיד שהגיע אחרי 14.6 דקות: לאיזו קטגוריה הוא שייך אחרי שנרשם?
בדיקת התשובה
14.6 דקות נרשמות אחרי עיגול כ־15, ולכן התלמיד שייך לקטגוריה הבאה, 15–19. הוא עבר את הגבול האמיתי 14.5.
בדקו את עצמכם3 שאלות
1.זמני ריצה נרשמו בדיוק של עשירית שנייה. מהם הגבולות האמיתיים של הקטגוריה 12.5–12.9?
2.ציונים שלמים קובצו לקטגוריה 20–29. מה הרוחב ומה האמצע שלה?
3.חוקרת קיבצה ציונים לקטגוריות 0–10, 10–20, 20–30, וכן הלאה. מה הבעיה?
גרפים: עוגה, עמודות והיסטוגרמה
הגרף נבחר לפי סולם המדידה ומספר הערכים. עוגה: חלקים מהשלם, במשתנה שמי. דיאגרמת עמודות: משתנה שמי, סדר, או בדיד עם מעט ערכים. יש רווח בין העמודות. היסטוגרמה: משתנה רציףContinuous variable, או בדיד עם הרבה ערכים, אחרי קיבוץ. העמודות נוגעות זו בזו, בגבולות האמיתיים.
טבלה מדויקת, אבל גרף מראה את התמונה במבט אחד. שלושה גרפים מכסים כמעט את כל מה שצריך בתיאור של משתנה אחד:
עוגה
כל פרוסה היא קטגוריה, והגודל שלה הוא האחוז שלה. יחד, הפרוסות הן 100%. העוגה מתאימה כשרוצים להראות חלקים מתוך השלם במשתנה שמי: 37.0% מהתלמידים בביקורת, 25.5% בתוכנית העקיפה, ו־37.5% במשולבת. יש לה שתי מגבלות. בעוגה אין סדר, ולכן היא פחות מתאימה למשתנה בסולם סדר. והעין משווה גבהים טוב בהרבה מזוויות: נסו לומר, בלי המספרים, איזו פרוסה גדולה יותר, הביקורת או המשולבת. עם יותר מחמש או שש פרוסות, העוגה כבר לא קריאה.
דיאגרמת עמודות
לכל ערך יש עמודה, והגובה שלה הוא השכיחות, או האחוז. מתאימה למשתנה שמי, למשתנה בסולם סדר, ולמשתנה בדידDiscrete variable עם מעט ערכים, כמו מספר אחים. במשתנה בסולם סדר, כמו השכלת ההורה, מסדרים את העמודות לפי הסדר של הערכים. ושימו לב שבין העמודות יש רווח. למה? כי הערכים נפרדים: אין ערכים "בין" על־תיכונית לתואר ראשון.
היסטוגרמה
מתאימה למשתנה רציף, או לבדיד עם הרבה ערכים, אחרי קיבוץ לקטגוריות. כאן העמודות נוגעות זו בזו: כל עמודה מתחילה ונגמרת בגבולות האמיתיים של הקטגוריה, ולכן אין רווח. הערכים רציפים: קטגוריה אחת נגמרת ב־9.45, והבאה מתחילה בדיוק שם. וציר הערכים הוא ציר מספרי, ולכן הוא עולה משמאל לימין, גם בספר בעברית.
ועוד דבר שאני אוהב לומר בהרצאה: בהיסטוגרמה, השטח של כל עמודה מייצג את מספר האנשים בקטגוריה. כשכל הקטגוריות באותו רוחב, השטח והגובה מספרים את אותו סיפור. הרעיון הזה, שטח שווה אנשים, יחזור בגדול בפרק 14, בהתפלגות הנורמלית.
| המשתנה | דוגמה מהקובץ | גרף מתאים |
|---|---|---|
| שמי | קבוצה, מגדר, התנדבות | עוגה או דיאגרמת עמודות |
| סדר | השכלת ההורה, פריט חרדה בודד | דיאגרמת עמודות, לפי הסדר |
| בדיד עם מעט ערכים | מספר אחים | דיאגרמת עמודות |
| רציף, או בדיד עם הרבה ערכים | גיל, ציון חרדה | היסטוגרמה, אחרי קיבוץ |
הצצה: צורת ההתפלגות
מהיסטוגרמה רואים מיד את הצורה של ההתפלגות. בגיל, למשל, השיא באמצע, והשכיחויות יורדות לשני הצדדים. כשהצדדים דומים, ההתפלגות סימטרית. כשצד אחד נמשך הרחק, ב"זנב" ארוך, ההתפלגות מוטה. מספר האחים הוא דוגמה: רוב התלמידים עם אח אחד עד שלושה, וזנב ארוך ודליל עד שבעה אחים. לזה קוראים הטיה חיוביתPositive skew, כי הזנב פונה לערכים הגבוהים. בפרק 10 נראה מה ההטיה עושה לממוצע, ובפרק 12 נלמד לתאר צורות במספרים.
מעבדה: היסטוגרמה וצורת ההתפלגות
- בחרו "ציונים" (40 סטודנטים) ורוחב 10. כמה ציונים בקטגוריה 70–79, ומהם הגבולות האמיתיים שלה?
- שנו את הרוחב ל־5 ול־20. מה קורה לצורה? איזה רוחב נותן את התמונה הברורה ביותר?
- בחרו "שעות מסך". מהי יחידת המדידה, ומה קורה לגבולות האמיתיים?
בדיקת התשובה
1. 11 ציונים. הגבולות האמיתיים: 69.5 עד 79.5. 2. ברוחב 5 יש 12 קטגוריות, והצורה "רועדת": שכיחויות של 1, 2 ו־3 קופצות למעלה ולמטה, בעיקר במקרה. ברוחב 20 נשארות רק שלוש עמודות, 6, 18 ו־16, ורוב המידע על הצורה נבלע. רוחב 10, עם שש קטגוריות, מראה את התמונה: שיא סביב 70–89, וזנב לכיוון הציונים הנמוכים. 3. שעות המסך רשומות בעשיריות, ולכן יחידת המדידה היא 0.1 והגבול האמיתי רחוק 0.05 מהגבול הנראה.
איזה גרף מתאים? א. בית הספר שבו לומד התלמיד (שלושה בתי ספר) ב. תשובות לפריט "אני דואג/ת לגבי דברים" (1 עד 4) ג. ציון שביעות הרצון מהחיים, ממוצע של 5 פריטים, 1 עד 7 ד. מספר הפעמים שהתלמיד התנדב השנה (0 עד 3)
בדיקת התשובה
א. עוגה או עמודות: משתנה שמי. ב. עמודות, לפי הסדר מ"אף פעם" עד "תמיד": סולם סדר, ארבעה ערכים. ג. היסטוגרמה: ציון עם הרבה ערכים שונים, אחרי קיבוץ. ד. עמודות: בדיד עם ארבעה ערכים. עמודה לכל ערך, עם רווחים.
בדקו את עצמכם3 שאלות
1.למה עדיף להציג את השכלת ההורה בדיאגרמת עמודות ולא בעוגה?
2.בהיסטוגרמה של זמני תגובה רוב העמודות הגבוהות בצד שמאל, ומשם השכיחויות יורדות לאט עד ערכים גבוהים מאוד. איך נקראת הצורה?
3.בהיסטוגרמת הגיל שבפרק, כל הקטגוריות ברוחב 0.5. מה מייצג השטח של כל עמודה, ולמה אפשר כאן להסתכל רק על הגובה?
טבלת ציר באקסל (Pivot Table)
טבלת ציר בונה טבלת שכיחויות, או טבלת ממוצעים, בכמה גרירות. בשורה הראשונה של הנתונים חייבות להיות כותרות. גוררים את המשתנה ל־Rows, ושוב ל־Values, ומשנים את Sum ל־Count: ברירת המחדל מחברת את הקודים במקום לספור אותם. Filters מסנן נבדקים, ו־Columns יוצר טבלה של שורות מול עמודות.
אקסל לא יודע מה הסולם של המשתנים (פרק 6), אבל יש בו כלי נהדר לסטטיסטיקה תיאוריתDescriptive statistics ראשונית: טבלת ציר, Pivot Table. התוצר שלה הוא טבלת שכיחויות, או טבלה של ממוצעים, סטיות תקן (פרקים 10 ו־11) וסטטיסטיים פשוטים אחרים, לכל קבוצה בנפרד. היא נוחה במיוחד בשני מצבים: כשרוצים רושם ראשוני על הנתונים בלי לפתוח תוכנה סטטיסטית, וכשרוצים לוודא שהקלדנו נכון ושאין בקובץ קודים מוזרים.
תנאי אחד הכרחי: בשורה הראשונה של הנתונים צריכות להיות כותרות, כלומר שמות המשתנים. בלעדיהן טבלת הציר לא תעבוד, כי היא מתייגת כל משתנה לפי השם שבראש העמודה. בקובץ שבנינו לפי פרק 8, זה כבר המצב.
שלב אחר שלב: כמה תלמידים בכל קבוצה?
- לוחצים על תא כלשהו בתוך הנתונים, או מסמנים את כל הטבלה.
- Insert > PivotTable (בעברית: הוספה > טבלת ציר). אקסל מציע את הטווח, ושואל איפה לשים את התוצאה. New Worksheet יוצר גיליון חדש. Existing Worksheet שם אותה בגיליון הנוכחי, במקום שבוחרים, כך שהנתונים והתוצאה מול העיניים.
- בצד נפתחת רשימת השדות: למעלה שמות המשתנים, ולמטה ארבעה אזורים: Filters, Columns, Rows ו־Values.
- גוררים את
groupל־Rows. אקסל מוצא את הערכים השונים: 0, 1, 2. - גוררים את
groupשוב, הפעם ל־Values. זה נראה מוזר להביא אותו משתנה פעמיים, אבל לכל פעם תפקיד אחר: ב־Rows הוא נותן את שמות השורות, וב־Values אנחנו רוצים לספור כמה תלמידים יש בכל שורה.
כשגוררים משתנה מספרי ל־Values, ברירת המחדל של אקסל היא Sum, סכום. כלומר, הוא לא סופר כמה תלמידים יש בכל קבוצה, אלא מחבר את הערכים שלהם. בשיעור הראשון שבו הראיתי את זה, בקובץ דוגמה עם 8 אנשים בקבוצה 1 ו־12 בקבוצה 2, הטבלה הראתה 8 ו־24. ה־8 נראה נכון, ובדיוק זו הסכנה: לחבר שמונה אחדים ולספור שמונה אחדים זה אותו דבר. אבל 12 פעמים 2 הן 24.
בקובץ שלנו המלכודת בולטת עוד יותר, כי קוד הביקורת הוא 0:
PivotTable: Sum of group (wrong)
| Row Labels | Sum of group |
|---|---|
| 0 | 0 |
| 1 | 51 |
| 2 | 150 |
| Grand Total | 201 |
התיקון: לוחצים על Sum of group באזור Values, בוחרים Value Field Settings, ובלשונית Summarize value field by בוחרים Count. עכשיו:
PivotTable: Count of group
| Row Labels | Count of group |
|---|---|
| 0 | 74 |
| 1 | 51 |
| 2 | 75 |
| Grand Total | 200 |
והבדיקה שתמיד עוזרת: Grand Total חייב להיות מספר הנבדקים. 201 תלמידים בקובץ של 200 הוא נורה אדומה.
סינון: רק חלק מהנבדקים
אזור Filters מסנן את הנבדקים לפני החישוב. גוררים לשם את grade, ובתפריט שנפתח מעל הטבלה בוחרים 4. עכשיו הטבלה סופרת רק את תלמידי כיתה ד׳: 52 בביקורת, 29 בעקיפה, 52 במשולבת, ובסך הכול 133. המשתנה שבפילטר יכול להיות רשום כמספרים, כמו כאן, או כמילים, למשל שם העיר. אבל כמו שראינו בפרק 8, מספרים בטוחים יותר.
שורות מול עמודות
ועכשיו הכוח האמיתי: משתנה אחד בשורות ומשתנה אחר בעמודות. משאירים את group ב־Rows, גוררים את gender ל־Columns, ו־Count of group נשאר ב־Values. כל תא סופר את התלמידים שיש להם את שני הערכים יחד:
PivotTable: Count of group, group × gender
| Count of group | 1 | 2 | Grand Total |
|---|---|---|---|
| 0 | 35 | 39 | 74 |
| 1 | 25 | 26 | 51 |
| 2 | 36 | 39 | 75 |
| Grand Total | 96 | 104 | 200 |
- שורות 0, 1, 2
- הקבוצות: ביקורת, עקיפה, משולבת.
- עמודות 1, 2
- המגדר: 1 בן, 2 בת. טבלת הציר מראה קודים, לא תוויות. את המשמעות לוקחים ממילון המשתנים.
- 35
- 35 בנים בקבוצת הביקורת.
- Grand Total
- השורה והעמודה האחרונות הן טבלאות השכיחויות של כל משתנה לבד: 96 בנים ו־104 בנות, ו־74, 51, 75 בקבוצות.
רוצים אחוזים במקום ספירות? בחלון Value Field Settings יש לשונית Show Values As: % of Grand Total מחלק כל תא ב־200, ו־% of Row Total נותן את אחוז הבנות בתוך כל קבוצה. טבלה כזו, של שני משתנים שמיים, תהיה נקודת המוצא של מבחן חי בריבועChi-square test of independence, בפרק 23. ובפרק 10 נשתמש באותה טבלת ציר כדי לחשב ממוצע לכל קבוצה.
ועוד דבר שכדאי לדעת מההתחלה: טבלת ציר היא תמונה של הנתונים ברגע שבו בניתם אותה, לא נוסחה. תיקנתם טעות הקלדה בקובץ? הטבלה לא תשתנה לבד. לוחצים עליה לחיצה ימנית ובוחרים Refresh, או בלשונית PivotTable Analyze > Refresh (קיצור: Alt+F5). ואם הוספתם שורות מתחת לטווח המקורי, צריך גם לעדכן את הטווח, ב־Change Data Source באותה לשונית.
טבלת ציר היא גם הדרך המהירה ביותר לבדוק את הקובץ אחרי ההקלדה. גוררים משתנה ל־Rows ול־Values (עם Count), ורואים מיד את כל הערכים שבו. ב־parent_edu, למשל, יופיעו חמש שורות: 1, 2, 3, 4, ו־99 עם 6 תלמידים. שורה של 99 היא קוד חסר. שורה של 33 היא טעות הקלדה, ואפשר לחפש אותה בקובץ. ושימו לב: טבלת ציר לא יודעת ש־99 הוא חסר. אם תבקשו ממנה ממוצע, הוא ייכנס לחישוב, כמו בפרק 8. ואחרי שמתקנים בקובץ את הטעויות שמצאתם: Refresh, ובודקים שוב.
שכחתם לשנות ל־Count, וגררתם את gender (1 בן, 2 בת) ל־Values, כשב־Rows נמצא group. בקבוצת הביקורת 35 בנים ו־39 בנות. איזה מספר יופיע בשורה של הביקורת? ואיך תזהו שזו טעות?
בדיקת התשובה
יופיע 113: סכום הקודים. אפשר לזהות את הטעות בשתי דרכים: 113 גדול ממספר התלמידים בקבוצה, 74, וזה בלתי אפשרי בספירה. וב־Grand Total יופיע 304, בקובץ של 200 תלמידים. הכותרת עצמה אומרת את זה: Sum of gender.
בדקו את עצמכם4 שאלות
1.רוצים לדעת כמה בנים וכמה בנות בכל שכבה. איך בונים את טבלת הציר?
2.באיזה אזור של טבלת הציר שמים משתנה כדי לחשב רק על חלק מהנבדקים, למשל רק על תלמידי בית ספר 1?
3.גררתם את vol_pre (0 לא התנדב, 1 התנדב) ל־Values, ושכחתם לשנות מ־Sum. ב־Rows נמצא group. האם המספרים בטבלה חסרי משמעות?
4.בקובץ קטן, group מקודד 1 ו־2. בניתם טבלת ציר עם group ב־Rows וב־Values, וקיבלתם 10 בשורה של 1 ו־30 בשורה של 2. כמה אנשים יש בקבוצה 2?
בתוכנה: טבלת שכיחויות וגרף
נבנה את טבלת השכיחויות של השכלת ההורה, עם גרף. בחרו את התוכנה שלכם.
מלבד טבלת הציר, אפשר לבנות את הטבלה בנוסחאות. כך רואים כל עמודה נבנית, והטבלה מתעדכנת לבד כשהנתונים משתנים. parent_edu בעמודה H, בשורות 2 עד 201. נבנה את הטבלה בעמודות הריקות מימין לנתונים:
- בתאים BE2 עד BE5 כותבים את הערכים 1, 2, 3, 4.
- שכיחות: בתא BF2
=COUNTIF($H$2:$H$201, BE2), וגוררים עד BF5. הדולרים מקבעים את טווח הנתונים, ו־BE2 יחסי, ולכן בכל שורה סופרים ערך אחר (פרק 3). ה־99 לא נספרים, כי אין להם שורה. - אחוז תקף: בתא BG2
=BF2/SUM($BF$2:$BF$5)*100, וגוררים. המכנה הוא סכום השכיחויות, 194, ולא 200. - שכיחות מצטברת: בתא BH2
=BF2, ובתא BH3=BH2+BF3, וגוררים: הקודמת ועוד השכיחות של השורה. - אחוז מצטבר: בתא BI2
=BH2/$BH$5*100, וגוררים.
Frequency table with formulas (columns BE–BI)
| BE | BF | BG | BH | BI | |
|---|---|---|---|---|---|
| 1 | parent_edu | f | % | cf | cum % |
| 2 | 1 | 28 | 14.4 | 28 | 14.4 |
| 3 | 2 | 47 | 24.2 | 75 | 38.7 |
| 4 | 3 | 74 | 38.1 | 149 | 76.8 |
| 5 | 4 | 45 | 23.2 | 194 | 100.0 |
קיבוץ עם FREQUENCY: לגיל (עמודה G), כותבים בתאים BK2 עד BK6 את הגבולות העליונים הנראים: 9.4, 9.9, 10.4, 10.9, 11.4. בתא BL2: =FREQUENCY(G2:G201, BK2:BK6), ו־Enter. באקסל עדכני התוצאות "נשפכות" לבד לתאים שמתחת: 35, 52, 61, 36, 16, ועוד 0 בתא השישי. התא הנוסף סופר ערכים שגבוהים מהגבול האחרון, ו־0 בו הוא בדיקה שלא שכחנו אף אחד. FREQUENCY סופרת כל ערך שקטן או שווה לגבול, וגדול מהגבול הקודם. בגרסאות ישנות מסמנים קודם את BL2 עד BL7, מקלידים את הנוסחה, ולוחצים Ctrl+Shift+Enter.
גרף: מסמנים את עמודת הערכים ואת עמודת השכיחות, ובוחרים Insert > Charts: Column לדיאגרמת עמודות, או Pie לעוגה. להיסטוגרמה: יוצרים דיאגרמת עמודות מטבלת הקיבוץ, לוחצים לחיצה ימנית על עמודה, בוחרים Format Data Series, ומשנים את Gap Width ל־0. העמודות נוגעות. ומוסיפים כותרת לגרף ולצירים: מה נמדד, ובאיזו יחידה.
באקסל יש גם סוג גרף בשם Histogram (Insert > Insert Statistic Chart), שבוחר קטגוריות לבד. אפשר לשנות בו את Bin width, אבל קשה לשלוט בגבולות. בספר נעדיף לבנות את הקטגוריות בעצמנו.
- ודאו ש־99 מוגדר כחסר ב־
parent_edu(Variable View, עמודה Missing, פרק 8), ושיש תוויות לערכים (Values). - Analyze > Descriptive Statistics > Frequencies. מעבירים את
parent_eduלחלון Variable(s). Display frequency tables מסומן כברירת מחדל. - בכפתור Charts בוחרים Bar charts (או Pie charts), ובתחתית, ב־Chart Values, Percentages. למשתנה רציף בוחרים Histograms.
- OK. או Paste, כדי לשמור את הפקודה כסינטקס, ואז מריצים.
Parent education
| Frequency | Percent | Valid Percent 1 | Cumulative Percent | ||
|---|---|---|---|---|---|
| Valid | Up to 12 years | 28 | 14.0 | 14.4 | 14.4 |
| Post-secondary | 47 | 23.5 | 24.2 | 38.7 | |
| Bachelor | 74 | 37.0 | 38.1 | 76.8 | |
| Master or higher | 45 | 22.5 | 23.2 | 100.0 | |
| Total | 194 | 97.0 | 100.0 | ||
| Missing 2 | Unknown | 6 | 3.0 | ||
| Total | 200 | 100.0 |
- Frequency
- השכיחות, f.
- Percent
- האחוז מתוך כל 200 התלמידים, כולל החסרים.
- 1 · Valid Percent
- האחוז מתוך 194 התקפים. אותו מדווחים: 38.1% מההורים בעלי תואר ראשון.
- Cumulative Percent
- האחוז המצטבר, מחושב מהאחוז התקף.
- 2 · Missing
- 6 תלמידים עם הקוד 99, שהתווית שלו Unknown. השורה הזו היא עוד דרך לבדוק שהגדרתם את החסרים נכון. אם היא לא מופיעה, ו־99 מופיע כשורה בתוך Valid, הקוד לא הוגדר.
מתחת לטבלה מופיע הגרף. בפלט מופיעה גם טבלה קטנה בשם Statistics, עם N Valid ו־Missing: 194 ו־6.
- Descriptives > Descriptive Statistics. גוררים את
parent_eduלחלון Variables. ודאו שהסמל שלו הוא Ordinal (פרק 6). - בחלק Tables מסמנים Frequency tables.
- בחלק Basic plots מסמנים Distribution plots: למשתנה שמי או סדר JASP מצייר דיאגרמת עמודות, ולמשתנה Scale היסטוגרמה. יש שם גם Pie charts.
Frequencies for parent_edu
| parent_edu | Frequency | Percent | Valid Percent | Cumulative Percent |
|---|---|---|---|---|
| 1 | 28 | 14.000 | 14.433 | 14.433 |
| 2 | 47 | 23.500 | 24.227 | 38.660 |
| 3 | 74 | 37.000 | 38.144 | 76.804 |
| 4 | 45 | 22.500 | 23.196 | 100.000 |
| Missing | 6 | 3.000 | ||
| Total | 200 | 100.000 |
- Valid Percent
- האחוז מתוך 194 התקפים, ואותו מדווחים. JASP מציג שלוש ספרות אחרי הנקודה. בדוח מעגלים לאחת: 38.1%.
- Missing
- 6 תלמידים. השורה מופיעה רק אם 99 הוגדר כחסר. אם לא, תראו שורה של 99 בתוך הטבלה, ו־Missing 0: סימן לחזור לפרק 8, ולהחליף את ה־99 בתאים ריקים באקסל, או להגדיר אותו כחסר למשתנה הזה.
- 1, 2, 3, 4
- אם תתנו תוויות לערכים (לחיצה על שם המשתנה), הן יופיעו כאן במקום הקודים.
למה הסמל קובע מה תקבלו? JASP מחליט אילו טבלאות וגרפים להציע לפי הסוג של המשתנה. למשתנה Scale, כמו גובה, לא מעניין אותנו כמה תלמידים גובהם בדיוק 1.41 מטר, ולכן JASP מצייר לו היסטוגרמה. לפחות בחלק מהגרסאות, טבלת שכיחויות מוצעת רק למשתנים Nominal ו־Ordinal. ומכאן תקלה נפוצה: JASP רואה מספרים, 1, 2, 3, 4, ומנחש Scale. אם לא קיבלתם טבלת שכיחויות, או קיבלתם היסטוגרמה במקום דיאגרמת עמודות, בדקו את הסמל בראש העמודה ושנו אותו. אותו טריק עובד גם לבדיקת הקובץ (פרק 8): מגדירים את id כ־Nominal, מבקשים לו טבלת שכיחויות, ובודקים שכל מספר נבדק מופיע פעם אחת בלבד.
בדקו את עצמכם3 שאלות
1.כתבתם =FREQUENCY(G2:G201, BK2:BK6), עם חמישה גבולות עליונים. כמה תאים מתמלאים בתוצאות?
1.ב־SPSS, בטבלת Frequencies של parent_edu, השורה התחתונה Total מראה 200. ממה מורכב המספר הזה?
1.ב־JASP, בטבלת השכיחויות של parent_edu, מופיעות השורות Missing 6 ו־Total 200. מתוך כמה תלמידים מחושבת העמודה Valid Percent?
2.בטבלת השכיחויות של siblings מופיעה שורה של הערך 99 עם שכיחות 5, ואין שורה של ערכים חסרים. מה זה אומר, ומה עושים?
3.כתבתם בתא BF2 =COUNTIF(H2:H201, BE2), בלי דולרים, וגררתם למטה. מה יקרה בתא BF4?
3.ב־SPSS העברתם את parent_edu ואת gender יחד לחלון Variable(s) של Frequencies. מה תקבלו?
3.ב־JASP גררתם את parent_edu ואת gender לחלון Variables, וסימנתם Frequency tables. מה תקבלו?
טעויות נפוצות
- Sum במקום Count בטבלת ציר. הטבלה מחברת קודים. בדקו תמיד שה־Grand Total הוא מספר הנבדקים.
- אחוז מתוך כל המדגם כשיש חסרים. מדווחים את האחוז התקף, מתוך מי שענה, ואומרים כמה חסרו.
- שכיחות מצטברת למשתנה שמי. "עד התוכנית העקיפה" לא אומר כלום.
- מבלבלים בין ערך לשכיחות. הערך הנפוץ הוא 2 אחים. 54 היא השכיחות שלו.
- קטגוריות חופפות או עם חורים. 20–30 ו־30–40 חופפות. בגבולות הנראים אין חפיפה, ובגבולות האמיתיים אין חורים.
- היסטוגרמה עם רווחים, או דיאגרמת עמודות למשתנה רציף. עמודה לכל ערך של ציון חרדה היא עשרות עמודות נמוכות.
- עוגה עם הרבה פרוסות, או למשתנה בסולם סדר. בעוגה אין סדר, והעין גרועה בהשוואת זוויות.
בדקו את עצמכם
סיכום
- טבלת שכיחויות: שכיחות (f), אחוז, שכיחות מצטברת (cf) ואחוז מצטבר. סכום השכיחויות הוא n.
- צוברים רק כשיש סדר: מסולם סדר ומעלה. "לכל היותר" ו"לפחות" נקראים מהעמודות המצטברות.
- אחוז תקף: מתוך מי שענה. אותו מדווחים.
- קיבוץ: 5 עד 10 קטגוריות ברוחב שווה. הגבול האמיתי רחוק חצי יחידת מדידה מהנראה. רוחב: עליון אמיתי פחות תחתון אמיתי. אמצע: ממוצע הגבולות.
- גרפים: עוגה לשמי, עמודות לשמי, לסדר ולבדיד, והיסטוגרמה לרציף, עם עמודות שנוגעות.
- טבלת ציר: כותרות בשורה הראשונה, Count ולא Sum, Filters לסינון, ושורות מול עמודות.
מונחים חדשים
שאלות לדוגמה, עם פתרונות
15 תלמידים ספרו כמה מחברות יש להם בתיק: 3, 1, 2, 2, 4, 3, 2, 1, 2, 3, 2, 5, 2, 3, 1. בנו טבלת שכיחויות מלאה. איזה אחוז מהתלמידים עם שלוש מחברות לכל היותר?
בדיקת התשובה
מחברות f אחוז cf אחוז מצטבר 1 3 20.0 3 20.0 2 6 40.0 9 60.0 3 4 26.7 13 86.7 4 1 6.7 14 93.3 5 1 6.7 15 100.0 סה״כ 15 100.0 13 / 15 · 100 = 86.7% האחוז המצטבר של 3בדיקה: סכום השכיחויות 15. והאחוזים המעוגלים מסתכמים ל־100.1, בגלל עיגול. האחוז המצטבר מחושב מהשכיחות המצטברת, ולכן הוא יוצא בדיוק 100.
בסקר שביעות רצון השתתפו 250 הורים. 10 לא ענו על השאלה "האם אתם מרוצים מהתקשורת עם המחנכת?", ו־96 ענו "מרוצים מאוד". מה האחוז ומה האחוז התקף של "מרוצים מאוד"? איזה מהם מדווחים?
בדיקת התשובה
96 / 250 · 100 = 38.4% אחוז מכל ההורים (Percent)250 − 10 = 240 מספר העונים96 / 240 · 100 = 40.0% אחוז תקף (Valid Percent)מדווחים את האחוז התקף, 40.0%, ומציינים ש־10 הורים לא ענו.
ציוני מבחן, במספרים שלמים, קובצו לקטגוריות 40–49, 50–59, וכן הלאה עד 90–100. א. מהם הגבולות האמיתיים, הרוחב והאמצע של 70–79? ב. מה לא בסדר בקטגוריה האחרונה? ג. תלמיד קיבל 69.6 לפני עיגול. לאיזו קטגוריה הוא שייך?
בדיקת התשובה
69.5–79.5 חצי יחידה מכל צד79.5 − 69.5 = 10 הרוחב(70 + 79) / 2 = 74.5 האמצעב. 90–100 כוללת 11 ערכים שלמים, ושאר הקטגוריות 10: הרוחב לא שווה. בהיסטוגרמה העמודה האחרונה תיראה גבוהה מדי. אפשר לכתוב 90–99, ולהוסיף קטגוריה של 100, או להשאיר אותה ולציין את זה. ג. 69.6 נרשם כ־70, ולכן הוא שייך ל־70–79. הוא עבר את הגבול האמיתי 69.5.
לפניכם פלט של SPSS לפריט החרדה השלישי,
a3, "הלב שלי דופק מהר בלי סיבה". ענו: א. כמה תלמידים ענו על הפריט? ב. איזה אחוז מהעונים ענו "לעיתים קרובות"? ג. איזה אחוז מהעונים ענו "לפעמים" לכל היותר? ד. למה Percent ו־Valid Percent שונים?Anxiety 3: heart beats fast
Frequency Percent Valid Percent Cumulative Percent Valid Never 77 38.5 38.9 38.9 Sometimes 77 38.5 38.9 77.8 Often 33 16.5 16.7 94.4 Always 11 5.5 5.6 100.0 Total 198 99.0 100.0 Missing No answer 2 1.0 Total 200 100.0 בדיקת התשובה
א. 198: השורה Total בתוך Valid. שני תלמידים לא ענו (הקוד 99, שהוגדר כחסר). ב. 16.7%, מהעמודה Valid Percent: 33 / 198 · 100. ג. 77.8%, האחוז המצטבר של "Sometimes": (77 + 77) / 198 · 100. ד. Percent מחושב מתוך כל 200 התלמידים, כולל השניים שלא ענו, ו־Valid Percent מתוך 198 העונים. אילו לא היו חסרים, שתי העמודות היו זהות.
בטבלת ציר שמתם את
school(1, 2, 3) ב־Rows וגם ב־Values, ושכחתם לשנות מ־Sum. הטבלה מראה 74, 102, 225, ו־Grand Total 401. כמה תלמידים יש בכל בית ספר? ואיך הייתם מזהים את הטעות גם בלי לדעת מה הקודים?בדיקת התשובה
74 / 1 = 74 בית ספר 1: סכום של אחדים שווה למספרם102 / 2 = 51 בית ספר 2225 / 3 = 75 בית ספר 374 + 51 + 75 = 200 בדיקההסימן הברור: Grand Total של 401, בקובץ של 200 תלמידים. ספירה לא יכולה להיות גדולה ממספר הנבדקים. וגם הכותרת אומרת Sum of school. התיקון: Value Field Settings > Count.
תרגול עם הנתונים
הקבצים עצמם נמצאים גם בתיקיית data בחבילת הספר.
- בנו טבלת שכיחויות מלאה לפריט החרדה הראשון,
a1, לכל 200 התלמידים. איזה אחוז עונים "לפעמים" לכל היותר?בדיקת התשובה
שכיחויות: 64, 75, 50, 11. אחוזים: 32.0, 37.5, 25.0, 5.5. שכיחות מצטברת: 64, 139, 189, 200. "לפעמים" לכל היותר: 139 / 200 · 100 = 69.5%. אין חסרים בפריט הזה, ולכן האחוז והאחוז התקף זהים.
- בטבלת ציר, שימו את
parent_eduב־Rows וב־Values, עם Count. כמה שורות יש בטבלה, ומה ה־Grand Total? מה צריך לעשות לפני שמחשבים אחוזים?בדיקת התשובה
חמש שורות: 1 (28), 2 (47), 3 (74), 4 (45), ו־99 (6). Grand Total: 200. ה־99 הוא קוד חסר, ולכן מחשבים אחוזים מתוך 194. אפשר להשמיט אותו מהטבלה בחץ שליד Row Labels, ולבטל את הסימון של 99.
- בטבלת ציר, שימו את
groupב־Rows ואתvol_pre(0 לא, 1 כן) ב־Columns, עם Count. בכל קבוצה, איזה אחוז מהתלמידים התנדבו בתחילת השנה? איזו אפשרות של Show Values As נותנת את זה?בדיקת התשובה
% of Row Total. ביקורת: 25 מתוך 74, 33.8%. עקיפה: 22 מתוך 51, 43.1%. משולבת: 29 מתוך 75, 38.7%. בסך הכול 76 מתוך 200, 38.0%. שימו לב: זו המדידה לפני התוכנית. האם ההבדלים בין הקבוצות גדולים מכדי להיות מקריים? על זה עונה מבחן חי בריבועChi-square test of independence, בפרק 23.
- קבצו את ציון החרדה,
anx_pre, לקטגוריות ברוחב 0.5, מ־1 ועד מתחת ל־4. באקסל: FREQUENCY עם הגבולות 1.49, 1.99, 2.49, 2.99, 3.49, 3.99. ציירו היסטוגרמה. מה הצורה?בדיקת התשובה
השכיחויות: 10, 56, 64, 50, 18, 2.
=FREQUENCY(AI2:AI201, BK2:BK7), כשהגבולות בתאים BK2 עד BK7. השיא בקטגוריה 2.0 עד מתחת ל־2.5, והצורה כמעט סימטרית, עם זנב מעט ארוך יותר לכיוון החרדה הגבוהה. למה 1.49 ולא 1.5? כי הציון הוא ממוצע של 8 פריטים, ולכן הוא קופץ בשמיניות: אחרי 1.375 בא 1.5, ואין ערך ביניהם. הגבול 1.49 מבטיח ש־1.5 ייכנס לקטגוריה השנייה. שני תלמידים שדילגו על פריט קיבלו ממוצע של 7 פריטים (2.1429 ו־2.8571), וגם הם נופלים בבירור בתוך קטגוריה. - בטבלת ציר עם
groupב־Rows ו־Count, הוסיפו אתgradeל־Filters ובחרו 5. כמה תלמידי כיתה ה׳ בכל קבוצה?בדיקת התשובה
22 בביקורת, 22 בעקיפה, 23 במשולבת: 67 תלמידים. ובכיתה ד׳: 52, 29, 52, כלומר 133. יחד 200.
בפרק הבא: מדדי מרכזMeasure of central tendency. איך מתארים את כל הטבלה הזו במספר אחד? שכיח, חציוןMedian וממוצע: מה כל אחד אומר, ואיך בוחרים ביניהם.
מקורות: Tarrasch, R., & Berger, R. (2022). Mindfulness. https://doi.org/10.1007/s12671-022-01955-y