סטטיסטיקה מ־0 עד 100בטאתוכנהעומק

חלק ב: תיאור נתונים · פרק 9

טבלאות שכיחויות וגרפים

קובץ המחקר מוכן: 200 שורות, 55 עמודות. אבל אף אחד לא יכול להבין 11,000 מספרים במבט אחד. הצעד הראשון בכל ניתוח הוא לסדר אותם: לספור כמה פעמים מופיע כל ערך, לקבץ ערכים כשיש הרבה מהם, ולצייר. בפרק הזה נבנה טבלת שכיחויותFrequency table, נלמד לקבץ לקטגוריות, נבחר את הגרף המתאים לכל משתנה, ונכיר את טבלת הציר של אקסל, הכלי המהיר ביותר לכל זה.

שאלת הפתיחה

רציתם לדעת כמה תלמידים יש בכל קבוצה. יצרתם באקסל טבלת ציר, והיא ענתה: בקבוצת הביקורת 0, בתוכנית העקיפה 51, ובתוכנית המשולבת 150. מה קרה?

אקסל לא ספר את התלמידים. הוא חיבר את הקודים שלהם. בקבוצת הביקורת הקוד הוא 0, ו־74 אפסים הם 0. בתוכנית המשולבת הקוד הוא 2, ו־75 פעמים 2 הן 150. בסוף הפרק תדעו לבנות טבלת שכיחויות נכונה, ביד ובתוכנה, ולזהות מיד מתי מספר בטבלה לא יכול להיות נכון.

בסוף הפרק תוכלו

מרשימה לטבלה: שכיחות

שכיחות (f) של ערך היא מספר הפעמים שהוא מופיע בנתונים. טבלת שכיחויות מציגה כל ערך ואת השכיחות שלו. סכום השכיחויות הוא תמיד מספר הנבדקים, .

הנה התשובות של 20 התלמידים הראשונים בקובץ לפריט החרדה הראשון, "אני דואג/ת לגבי דברים" (1 אף פעם, 2 לפעמים, 3 לעיתים קרובות, 4 תמיד):

1, 2, 1, 1, 2, 2, 1, 2, 2, 1, 1, 3, 1, 1, 1, 1, 1, 2, 4, 3

מה אפשר להבין מהרשימה? קשה לומר. ועכשיו נספור כמה פעמים מופיע כל ערך:

התשובההקודשכיחות (f)
אף פעם111
לפעמים26
לעיתים קרובות32
תמיד41
סה״כ20

עכשיו רואים מיד: יותר ממחצית התלמידים עונים "אף פעם", ורק אחד עונה "תמיד". המספר שספרנו נקרא שכיחות, ומסמנים אותו באות f, מהמילה frequency. וטבלה שמציגה כל ערך ואת השכיחות שלו נקראת טבלת שכיחויות.

שתי בדיקות פשוטות לכל טבלה כזו. הראשונה: סכום השכיחויות הוא מספר הנבדקים, כאן 20. אם יצא פחות, שכחתם ערך. אם יצא יותר, ספרתם מישהו פעמיים. השנייה: כל ערך שמופיע בנתונים מופיע בטבלה, גם אם הוא מוזר. אם בטבלה של פריט מ־1 עד 4 מופיעה שורה של 33, או של 99, גיליתם טעות הקלדה או קוד חסר. זו בדיוק הבדיקה שהבטחנו בפרק 8.

ובאיזה סדר כותבים את השורות? כשיש סדר בין הערכים, כמו כאן, לפי הסדר, מהנמוך לגבוה. כשאין סדר, כמו בקבוצת המחקר, אפשר בכל סדר. נוח לפי הקוד, או מהשכיח לנדיר.

עצרו ונסו

עשרה תלמידים דיווחו בכמה חוגים הם משתתפים: 0, 2, 1, 1, 3, 0, 1, 2, 1, 1. בנו טבלת שכיחויות. מה הערך הנפוץ ביותר, ומה סכום השכיחויות?

בדיקת התשובה
חוגיםf
02
15
22
31
סה״כ10

הערך הנפוץ ביותר הוא חוג אחד, עם שכיחות 5. שימו לב להבדל: הערך הוא 1, והשכיחות שלו היא 5. סכום השכיחויות הוא 10, מספר התלמידים.

בדקו את עצמכם3 שאלות

1.שישה תלמידים דירגו כמה הם אוהבים מתמטיקה, מ־1 עד 3: 3, 1, 3, 2, 3, 1. מה השכיחות של הערך 3?

2.במחקר השתתפו 200 תלמידים, אבל סכום השכיחויות בטבלה של פריט מסוים הוא 198. מה ההסבר הסביר ביותר?

3.בטבלת השכיחויות של פריט שהתשובות בו 1 עד 4 מופיעה שורה של הערך 22, עם שכיחות 1. מה עושים?

ארבע העמודות של טבלת שכיחויות

לטבלה המלאה ארבע עמודות. שכיחות: כמה. שכיחות יחסית (אחוז): f / n · 100. שכיחות מצטברת: כמה קיבלו את הערך הזה או ערך נמוך ממנו. אחוז מצטבר: אותו דבר באחוזים. צוברים רק כשיש סדר בין הערכים, כלומר מסולם סדרOrdinal scale ומעלה. כשיש ערכים חסרים, מדווחים את האחוז התקף, מתוך מי שענה.

כל עמודה בטבלה עונה על שאלה אחרת:

בספרים ובקורסים רבים מסמנים את השכיחות המצטברת באות F גדולה. בספר נכתוב cf (cumulative frequency), כדי לא להתבלבל עם סטטיסטי , שנפגוש בפרק 26.

דוגמה פתורה: השכלת ההורה

בעמודה parent_edu רשומה ההשכלה של ההורה המשכיל יותר: 1 עד 12 שנות לימוד, 2 על־תיכונית, 3 תואר ראשון, 4 תואר שני ומעלה. אצל 6 תלמידים ההשכלה לא ידועה, ורשום 99. לכן יש 194 ערכים תקפים, ואותם סופרים.

השכלת ההורהfאחוזcfאחוז מצטבר
עד 12 שנות לימוד2814.42814.4
על־תיכונית4724.27538.7
תואר ראשון7438.114976.8
תואר שני ומעלה4523.2194100.0
סה״כ194100.0
74 / 194 · 100 = 38.1% האחוז של "תואר ראשון": שכיחות חלקי מספר הערכים התקפים
28 + 47 + 74 = 149 השכיחות המצטברת של "תואר ראשון": מחברים עד השורה הזו, כולל
149 / 194 · 100 = 76.8% האחוז המצטבר
בדיקות: סכום השכיחויות 194, השכיחות המצטברת האחרונה 194, והאחוז המצטבר האחרון 100.

ושימו לב לפרט קטן: אם מחברים את שלושת האחוזים המעוגלים, 14.4 ועוד 24.2 ועוד 38.1, מקבלים 76.7, ולא 76.8. ואם מחברים את ארבעתם, יוצא 99.9. אין כאן טעות: כל אחוז עוגל לבד. לכן מחשבים את האחוז המצטבר מהשכיחות המצטברת, ולא מחיבור של אחוזים מעוגלים. כמו שראינו בפרק 2: מעגלים רק בסוף.

איך קוראים שכיחות מצטברת

המילים "לכל היותר" ו"לפחות" הן הרמז. כמה הורים בלי תואר אקדמי, כלומר לכל היותר על־תיכונית? זו השכיחות המצטברת של "על־תיכונית": 75, שהם 38.7%. ואיזה אחוז מההורים בעלי תואר ראשון לפחות? כל השאר: 100 − 38.7 = 61.3, כלומר 61.3%. שכיחות מצטברת צוברת מהערך הנמוך לגבוה, ולכן הסדר של השורות חשוב.

מתי מותר לצבור?

שכיחות מצטברת שואלת "עד הערך הזה", ו"עד" דורש סדר. בסולם סדרOrdinal scale ומעלה, כמו השכלה, מספר אחים או ציון, "לכל היותר על־תיכונית" הוא משפט עם משמעות. אבל בסולם שמיNominal scale אין לה שום משמעות. "עד התוכנית העקיפה" לא אומר כלום, כי את הקבוצות אפשר לסדר בכל סדר שרוצים. לכן במשתנה שמי ממלאים רק שכיחות ואחוז.

אחוז, או אחוז תקף?Valid percent

בדוגמה חילקנו ב־194, ולא ב־200. למה? כי על ששת ההורים שהשכלתם לא ידועה אין לנו מידע. אילו חילקנו ב־200, האחוז של "תואר ראשון" היה 37.0%, וסכום ארבע השורות היה 97%: בדיוק כאילו 3% מההורים "נעלמו". האחוז מתוך מי שענה נקרא אחוז תקף (Valid Percent), ואותו מדווחים. התוכנות הסטטיסטיות מציגות את שניהם, כמו שנראה בקטע "בתוכנה". הם שונים רק כשיש ערכים חסרים.

כמה הם שונים? תלוי בכמה חסרים. בשאלון שמילאו 144 סטודנטים, שניים דילגו על אחת השאלות, ותשעה סימנו בה את התשובה 1. מתוך כולם: 9 / 144 = 6.25%. מתוך מי שענה: 9 / 142 = 6.34%. הבדל זניח. אבל כשחסרים רבים, כמו בשאלה רגישה שרבע מהנבדקים לא ענו עליה, ההבדל כבר גדול, והאחוז מתוך כולם פשוט מטעה. לכן ההרגל הוא תמיד אותו הרגל: מדווחים את האחוז התקף, ואומרים כמה חסרו.

הסיפור המלא: למה הסכום לא תמיד 100

בדוח מחקר אפשר לראות טבלה שבה האחוזים מסתכמים ל־99.9 או ל־100.1. יש שתי דרכים להתמודד. הראשונה, המקובלת במדעי החברה: להשאיר את האחוזים כפי שעוגלו, ולהוסיף הערה "האחוזים אינם מסתכמים ל־100 בגלל עיגול". השנייה, בעיתונות ובגרפים: "לתקן" את האחוז שהעיגול שלו היה הכי קרוב לגבול. הדרך הראשונה ישרה יותר, כי כל מספר בטבלה נשאר נכון. ומה שאסור: לתקן אחוז בלי לומר.

מעבדה: טבלת שכיחויות חיה

מעבדה: טבלת שכיחויות חיה. משנים שכיחויות, ורואים את הטבלה ואת הגרף מתעדכנים יחד.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו "מצב רוח" והוסיפו שלושה סטודנטים "שמחים". אילו עמודות השתנו, ובאילו שורות?
  2. בחרו "פקולטה". למה העמודות המצטברות נעלמו?
  3. בחרו "מספר אחים". איזה אחוז מהסטודנטים עם שני אחים לכל היותר? ועברו בין עמודות לעוגה: לאיזה משתנה העוגה מתאימה פחות?
בדיקת התשובה

1. השכיחות השתנתה רק בשורה של "שמח". אבל האחוזים השתנו בכל השורות, כי n גדל מ־40 ל־43 והמכנה השתנה. השכיחות המצטברת השתנתה מהשורה של "שמח" ומטה: לשורות שמעליה לא נוסף אף אחד. 2. פקולטה היא משתנה שמי. אין סדר בין הפקולטות, ולכן "עד מדעי הרוח" חסר משמעות. 3. (5 + 12 + 11) / 40 · 100 = 70%, האחוז המצטבר של "2". העוגה מתאימה פחות למצב רוח ולמספר אחים: בעוגה אין סדר, והסדר בין הערכים הוא בדיוק המידע שחשוב בהם.

עצרו ונסו

בקובץ המחקר, מספר האחים של 195 תלמידים (בלי חמשת ערכי ה־99): 0 אחים: 17, 1: 46, 2: 54, 3: 37, 4: 23, 5: 12, 6: 4, 7: 2. מה השכיחות המצטברת של 3 אחים? איזה אחוז מהתלמידים עם שלושה אחים לכל היותר? וכמה תלמידים עם ארבעה אחים לפחות?

בדיקת התשובה
17 + 46 + 54 + 37 = 154 השכיחות המצטברת של 3
154 / 195 · 100 = 79.0% שלושה אחים לכל היותר
195 − 154 = 41 ארבעה לפחות: כל השאר
בדקו את עצמכם4 שאלות

1.12 מתוך 48 תלמידים בכיתה משתתפים בחוג ספורט. מה השכיחות היחסית?

2.בטבלה של ערכים 1 עד 4, השכיחויות הן 5, 10, 15, 20 (n = 50). מהו האחוז המצטבר של הערך 3?

3.מתי העמודות Percent ו־Valid Percent בפלט שונות זו מזו?

4.בטבלת השכלת ההורה (28, 47, 74, 45 מתוך 194 תקפים): איזה אחוז מההורים בעלי השכלה על־תיכונית לפחות?

קיבוץ לקטגוריות

כשיש הרבה ערכים שונים, מקבצים אותם לקטגוריות ברוחב שווה, בדרך כלל 5 עד 10. הגבולות הנראים הם המספרים שבטבלה (9.0–9.4). הגבולות האמיתיים רחוקים מהם חצי יחידת מדידה (8.95–9.45). רוחב הקטגוריהClass width: עליון אמיתי פחות תחתון אמיתי. אמצע הקטגוריהClass midpoint: הממוצע של שני הגבולות.

בעמודת הגיל בקובץ יש 21 ערכים שונים, מ־9.2 ועד 11.2. טבלת שכיחויות עם שורה לכל ערך תהיה ארוכה, ורוב השכיחויות בה יהיו קטנות. קשה לראות ממנה תמונה. הפתרון: מחלקים את התחוםRange לקטגוריות ברוחב שווה, וסופרים כמה ערכים נופלים בכל אחת. בספרים אחרים תפגשו לקטגוריה כזו גם את השם מחלקהClass interval. המחיר: לא רואים יותר את הערכים המדויקים. היתרון: רואים את הצורה הכללית.

כמה קטגוריות? בדרך כלל בין 5 ל־10. מעט מדי, והכול נבלע בשתיים־שלוש עמודות. יותר מדי, וחוזרים לטבלה ארוכה עם שכיחויות של 0 ו־1. ושני כללים: הקטגוריות לא חופפות, כדי שכל ערך ייכנס לקטגוריה אחת בדיוק, ומכסות את כל הערכים, בלי חורים ביניהן.

גבולות נראים וגבולות אמיתייםApparent limits

נקבץ את הגיל לקטגוריות של חצי שנה: 9.0–9.4, 9.5–9.9, 10.0–10.4, וכן הלאה. המספרים האלה, שכתובים בטבלה, הם הגבולות הנראים. שימו לב שאין ביניהם חפיפה: אילו כתבנו 9.0–9.5 ו־9.5–10.0, תלמיד בן 9.5 היה שייך לשתי קטגוריות.

אבל הגיל הוא משתנה רציףContinuous variable. נניח שהיינו מודדים בדיוק רב יותר, ומקבלים 9.47. לאיזו קטגוריה הוא שייך? בקובץ, שבו הגיל רשום בדיוק של עשירית, 9.47 נרשם אחרי עיגול כ־9.5, ולכן הוא שייך לקטגוריה השנייה. ו־9.43 נרשם כ־9.4, ושייך לראשונה. כלומר, נקודת המעבר האמיתית בין הקטגוריות היא 9.45: חצי יחידת מדידה מעל הגבול הנראה. אלה הגבולות האמיתיים: 8.95–9.45, 9.45–9.95, וכן הלאה. בגבולות האמיתיים כל קטגוריה מתחילה בדיוק במקום שבו הקודמת נגמרת, ולכן אין ביניהן חורים.

הכלל: הגבול האמיתי רחוק חצי יחידת מדידה מהגבול הנראה. יחידת המדידה היא הדיוק שבו נרשמו הערכים: בציון שלם היא 1, וחצי יחידה הוא 0.5. בגיל בעשיריות היא 0.1, וחצי יחידה הוא 0.05. ומכאן שני מספרים שנשתמש בהם בהיסטוגרמה:

דוגמה פתורה: הגיל בקטגוריות של חצי שנה
גבולות נראיםגבולות אמיתייםאמצעfאחוזcf
9.0–9.48.95–9.459.23517.535
9.5–9.99.45–9.959.75226.087
10.0–10.49.95–10.4510.26130.5148
10.5–10.910.45–10.9510.73618.0184
11.0–11.410.95–11.4511.2168.0200
סה״כ200100.0

חמש קטגוריות, כולן ברוחב 0.5. הקטגוריה הנפוצה היא 10.0–10.4, עם 61 תלמידים. ומהשכיחות המצטברת: 87 תלמידים, 43.5%, צעירים מ־10, כלומר עד הגבול האמיתי 9.95.

הסיפור המלא: הגיל בשנים שלמות, ומה אומר 25.4

בהרצאה אני שואל את הסטודנטים: יש קטגוריות 21–25 ו־26–30, ומגיע מישהו בן 25.4. לאן הוא שייך? התשובה הרגילה היא הגבול האמיתי, 25.5. אבל יש כאן גם שיעור על יחידת המדידה: מי שאומר "בן 25.4" מדד את הגיל שלו בחודשים, לא בשנים. כשמשנים את הרזולוציה, משתנים גם הגבולות.

ויש בגיל עוד דקות אחת, שכדאי להכיר. כששואלים "בן כמה אתה?", אנשים לא מעגלים, אלא קוטמים: מי שנולד לפני 25 שנה ו־11 חודשים יענה "25". אם הגיל נאסף כך, בשנים שלמות שמלאו, הגבולות האמיתיים של הקטגוריה 21–25 הם 21 ו־26, ולא 20.5 ו־25.5. כלל חצי היחידה מניח עיגול. בקובץ שלנו הגיל רשום בעשיריות ומעוגל, ולכן הכלל הרגיל מתאים.

עצרו ונסו

זמן ההגעה לבית הספר נרשם בדקות שלמות. אחת הקטגוריות בטבלה היא 10–14 דקות. מהם הגבולות האמיתיים? מהו הרוחב, ומהו האמצע? ותלמיד שהגיע אחרי 14.6 דקות: לאיזו קטגוריה הוא שייך אחרי שנרשם?

בדיקת התשובה
10 − 0.5 = 9.5,   14 + 0.5 = 14.5 הגבולות האמיתיים: 9.5 עד 14.5
14.5 − 9.5 = 5 הרוחב
(10 + 14) / 2 = 12 האמצע

14.6 דקות נרשמות אחרי עיגול כ־15, ולכן התלמיד שייך לקטגוריה הבאה, 15–19. הוא עבר את הגבול האמיתי 14.5.

בדקו את עצמכם3 שאלות

1.זמני ריצה נרשמו בדיוק של עשירית שנייה. מהם הגבולות האמיתיים של הקטגוריה 12.5–12.9?

2.ציונים שלמים קובצו לקטגוריה 20–29. מה הרוחב ומה האמצע שלה?

3.חוקרת קיבצה ציונים לקטגוריות 0–10, 10–20, 20–30, וכן הלאה. מה הבעיה?

גרפים: עוגה, עמודות והיסטוגרמה

הגרף נבחר לפי סולם המדידה ומספר הערכים. עוגה: חלקים מהשלם, במשתנה שמי. דיאגרמת עמודות: משתנה שמי, סדר, או בדיד עם מעט ערכים. יש רווח בין העמודות. היסטוגרמה: משתנה רציףContinuous variable, או בדיד עם הרבה ערכים, אחרי קיבוץ. העמודות נוגעות זו בזו, בגבולות האמיתיים.

טבלה מדויקת, אבל גרף מראה את התמונה במבט אחד. שלושה גרפים מכסים כמעט את כל מה שצריך בתיאור של משתנה אחד:

37.0%ביקורת (74)25.5%עקיפה (51)37.5%משולבת (75)
עוגה: קבוצת המחקר, = 200
02040608028עד 12 שנים47על־תיכונית74תואר ראשון45תואר שני+השכלת ההורהשכיחות
דיאגרמת עמודות: השכלת ההורה, = 194
020406035526136168.959.459.9510.4510.9511.45גיל (שנים), גבולות אמיתייםשכיחות
היסטוגרמה: הגיל, בקטגוריות של חצי שנה

עוגה

כל פרוסה היא קטגוריה, והגודל שלה הוא האחוז שלה. יחד, הפרוסות הן 100%. העוגה מתאימה כשרוצים להראות חלקים מתוך השלם במשתנה שמי: 37.0% מהתלמידים בביקורת, 25.5% בתוכנית העקיפה, ו־37.5% במשולבת. יש לה שתי מגבלות. בעוגה אין סדר, ולכן היא פחות מתאימה למשתנה בסולם סדר. והעין משווה גבהים טוב בהרבה מזוויות: נסו לומר, בלי המספרים, איזו פרוסה גדולה יותר, הביקורת או המשולבת. עם יותר מחמש או שש פרוסות, העוגה כבר לא קריאה.

דיאגרמת עמודות

לכל ערך יש עמודה, והגובה שלה הוא השכיחות, או האחוז. מתאימה למשתנה שמי, למשתנה בסולם סדר, ולמשתנה בדידDiscrete variable עם מעט ערכים, כמו מספר אחים. במשתנה בסולם סדר, כמו השכלת ההורה, מסדרים את העמודות לפי הסדר של הערכים. ושימו לב שבין העמודות יש רווח. למה? כי הערכים נפרדים: אין ערכים "בין" על־תיכונית לתואר ראשון.

היסטוגרמה

מתאימה למשתנה רציף, או לבדיד עם הרבה ערכים, אחרי קיבוץ לקטגוריות. כאן העמודות נוגעות זו בזו: כל עמודה מתחילה ונגמרת בגבולות האמיתיים של הקטגוריה, ולכן אין רווח. הערכים רציפים: קטגוריה אחת נגמרת ב־9.45, והבאה מתחילה בדיוק שם. וציר הערכים הוא ציר מספרי, ולכן הוא עולה משמאל לימין, גם בספר בעברית.

ועוד דבר שאני אוהב לומר בהרצאה: בהיסטוגרמה, השטח של כל עמודה מייצג את מספר האנשים בקטגוריה. כשכל הקטגוריות באותו רוחב, השטח והגובה מספרים את אותו סיפור. הרעיון הזה, שטח שווה אנשים, יחזור בגדול בפרק 14, בהתפלגות הנורמלית.

המשתנהדוגמה מהקובץגרף מתאים
שמיקבוצה, מגדר, התנדבותעוגה או דיאגרמת עמודות
סדרהשכלת ההורה, פריט חרדה בודדדיאגרמת עמודות, לפי הסדר
בדיד עם מעט ערכיםמספר אחיםדיאגרמת עמודות
רציף, או בדיד עם הרבה ערכיםגיל, ציון חרדההיסטוגרמה, אחרי קיבוץ

הצצה: צורת ההתפלגות

מהיסטוגרמה רואים מיד את הצורה של ההתפלגות. בגיל, למשל, השיא באמצע, והשכיחויות יורדות לשני הצדדים. כשהצדדים דומים, ההתפלגות סימטרית. כשצד אחד נמשך הרחק, ב"זנב" ארוך, ההתפלגות מוטה. מספר האחים הוא דוגמה: רוב התלמידים עם אח אחד עד שלושה, וזנב ארוך ודליל עד שבעה אחים. לזה קוראים הטיה חיוביתPositive skew, כי הזנב פונה לערכים הגבוהים. בפרק 10 נראה מה ההטיה עושה לממוצע, ובפרק 12 נלמד לתאר צורות במספרים.

מעבדה: היסטוגרמה וצורת ההתפלגות

מעבדה: היסטוגרמה וצורת ההתפלגות. משנים את רוחב הקטגוריה, ורואים את ההיסטוגרמה, את הגבולות הנראים ואת הגבולות האמיתיים.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו "ציונים" (40 סטודנטים) ורוחב 10. כמה ציונים בקטגוריה 70–79, ומהם הגבולות האמיתיים שלה?
  2. שנו את הרוחב ל־5 ול־20. מה קורה לצורה? איזה רוחב נותן את התמונה הברורה ביותר?
  3. בחרו "שעות מסך". מהי יחידת המדידה, ומה קורה לגבולות האמיתיים?
בדיקת התשובה

1. 11 ציונים. הגבולות האמיתיים: 69.5 עד 79.5. 2. ברוחב 5 יש 12 קטגוריות, והצורה "רועדת": שכיחויות של 1, 2 ו־3 קופצות למעלה ולמטה, בעיקר במקרה. ברוחב 20 נשארות רק שלוש עמודות, 6, 18 ו־16, ורוב המידע על הצורה נבלע. רוחב 10, עם שש קטגוריות, מראה את התמונה: שיא סביב 70–89, וזנב לכיוון הציונים הנמוכים. 3. שעות המסך רשומות בעשיריות, ולכן יחידת המדידה היא 0.1 והגבול האמיתי רחוק 0.05 מהגבול הנראה.

עצרו ונסו

איזה גרף מתאים?   א. בית הספר שבו לומד התלמיד (שלושה בתי ספר)   ב. תשובות לפריט "אני דואג/ת לגבי דברים" (1 עד 4)   ג. ציון שביעות הרצון מהחיים, ממוצע של 5 פריטים, 1 עד 7   ד. מספר הפעמים שהתלמיד התנדב השנה (0 עד 3)

בדיקת התשובה

א. עוגה או עמודות: משתנה שמי.   ב. עמודות, לפי הסדר מ"אף פעם" עד "תמיד": סולם סדר, ארבעה ערכים.   ג. היסטוגרמה: ציון עם הרבה ערכים שונים, אחרי קיבוץ.   ד. עמודות: בדיד עם ארבעה ערכים. עמודה לכל ערך, עם רווחים.

בדקו את עצמכם3 שאלות

1.למה עדיף להציג את השכלת ההורה בדיאגרמת עמודות ולא בעוגה?

2.בהיסטוגרמה של זמני תגובה רוב העמודות הגבוהות בצד שמאל, ומשם השכיחויות יורדות לאט עד ערכים גבוהים מאוד. איך נקראת הצורה?

3.בהיסטוגרמת הגיל שבפרק, כל הקטגוריות ברוחב 0.5. מה מייצג השטח של כל עמודה, ולמה אפשר כאן להסתכל רק על הגובה?

טבלת ציר באקסל (Pivot Table)

טבלת ציר בונה טבלת שכיחויות, או טבלת ממוצעים, בכמה גרירות. בשורה הראשונה של הנתונים חייבות להיות כותרות. גוררים את המשתנה ל־Rows, ושוב ל־Values, ומשנים את Sum ל־Count: ברירת המחדל מחברת את הקודים במקום לספור אותם. Filters מסנן נבדקים, ו־Columns יוצר טבלה של שורות מול עמודות.

אקסל לא יודע מה הסולם של המשתנים (פרק 6), אבל יש בו כלי נהדר לסטטיסטיקה תיאוריתDescriptive statistics ראשונית: טבלת ציר, Pivot Table. התוצר שלה הוא טבלת שכיחויות, או טבלה של ממוצעים, סטיות תקן (פרקים 10 ו־11) וסטטיסטיים פשוטים אחרים, לכל קבוצה בנפרד. היא נוחה במיוחד בשני מצבים: כשרוצים רושם ראשוני על הנתונים בלי לפתוח תוכנה סטטיסטית, וכשרוצים לוודא שהקלדנו נכון ושאין בקובץ קודים מוזרים.

תנאי אחד הכרחי: בשורה הראשונה של הנתונים צריכות להיות כותרות, כלומר שמות המשתנים. בלעדיהן טבלת הציר לא תעבוד, כי היא מתייגת כל משתנה לפי השם שבראש העמודה. בקובץ שבנינו לפי פרק 8, זה כבר המצב.

שלב אחר שלב: כמה תלמידים בכל קבוצה?

  1. לוחצים על תא כלשהו בתוך הנתונים, או מסמנים את כל הטבלה.
  2. Insert > PivotTable (בעברית: הוספה > טבלת ציר). אקסל מציע את הטווח, ושואל איפה לשים את התוצאה. New Worksheet יוצר גיליון חדש. Existing Worksheet שם אותה בגיליון הנוכחי, במקום שבוחרים, כך שהנתונים והתוצאה מול העיניים.
  3. בצד נפתחת רשימת השדות: למעלה שמות המשתנים, ולמטה ארבעה אזורים: Filters, Columns, Rows ו־Values.
  4. גוררים את group ל־Rows. אקסל מוצא את הערכים השונים: 0, 1, 2.
  5. גוררים את group שוב, הפעם ל־Values. זה נראה מוזר להביא אותו משתנה פעמיים, אבל לכל פעם תפקיד אחר: ב־Rows הוא נותן את שמות השורות, וב־Values אנחנו רוצים לספור כמה תלמידים יש בכל שורה.
המלכודת: Sum במקום Count

כשגוררים משתנה מספרי ל־Values, ברירת המחדל של אקסל היא Sum, סכום. כלומר, הוא לא סופר כמה תלמידים יש בכל קבוצה, אלא מחבר את הערכים שלהם. בשיעור הראשון שבו הראיתי את זה, בקובץ דוגמה עם 8 אנשים בקבוצה 1 ו־12 בקבוצה 2, הטבלה הראתה 8 ו־24. ה־8 נראה נכון, ובדיוק זו הסכנה: לחבר שמונה אחדים ולספור שמונה אחדים זה אותו דבר. אבל 12 פעמים 2 הן 24.

בקובץ שלנו המלכודת בולטת עוד יותר, כי קוד הביקורת הוא 0:

PivotTable: Sum of group (wrong)

Row LabelsSum of group
00
151
2150
Grand Total201

התיקון: לוחצים על Sum of group באזור Values, בוחרים Value Field Settings, ובלשונית Summarize value field by בוחרים Count. עכשיו:

PivotTable: Count of group

Row LabelsCount of group
074
151
275
Grand Total200

והבדיקה שתמיד עוזרת: Grand Total חייב להיות מספר הנבדקים. 201 תלמידים בקובץ של 200 הוא נורה אדומה.

סינון: רק חלק מהנבדקים

אזור Filters מסנן את הנבדקים לפני החישוב. גוררים לשם את grade, ובתפריט שנפתח מעל הטבלה בוחרים 4. עכשיו הטבלה סופרת רק את תלמידי כיתה ד׳: 52 בביקורת, 29 בעקיפה, 52 במשולבת, ובסך הכול 133. המשתנה שבפילטר יכול להיות רשום כמספרים, כמו כאן, או כמילים, למשל שם העיר. אבל כמו שראינו בפרק 8, מספרים בטוחים יותר.

שורות מול עמודות

ועכשיו הכוח האמיתי: משתנה אחד בשורות ומשתנה אחר בעמודות. משאירים את group ב־Rows, גוררים את gender ל־Columns, ו־Count of group נשאר ב־Values. כל תא סופר את התלמידים שיש להם את שני הערכים יחד:

PivotTable: Count of group, group × gender

Count of group12Grand Total
0353974
1252651
2363975
Grand Total96104200
שורות 0, 1, 2
הקבוצות: ביקורת, עקיפה, משולבת.
עמודות 1, 2
המגדר: 1 בן, 2 בת. טבלת הציר מראה קודים, לא תוויות. את המשמעות לוקחים ממילון המשתנים.
35
35 בנים בקבוצת הביקורת.
Grand Total
השורה והעמודה האחרונות הן טבלאות השכיחויות של כל משתנה לבד: 96 בנים ו־104 בנות, ו־74, 51, 75 בקבוצות.

רוצים אחוזים במקום ספירות? בחלון Value Field Settings יש לשונית Show Values As: % of Grand Total מחלק כל תא ב־200, ו־% of Row Total נותן את אחוז הבנות בתוך כל קבוצה. טבלה כזו, של שני משתנים שמיים, תהיה נקודת המוצא של מבחן חי בריבועChi-square test of independence, בפרק 23. ובפרק 10 נשתמש באותה טבלת ציר כדי לחשב ממוצע לכל קבוצה.

ועוד דבר שכדאי לדעת מההתחלה: טבלת ציר היא תמונה של הנתונים ברגע שבו בניתם אותה, לא נוסחה. תיקנתם טעות הקלדה בקובץ? הטבלה לא תשתנה לבד. לוחצים עליה לחיצה ימנית ובוחרים Refresh, או בלשונית PivotTable Analyze > Refresh (קיצור: Alt+F5). ואם הוספתם שורות מתחת לטווח המקורי, צריך גם לעדכן את הטווח, ב־Change Data Source באותה לשונית.

הסיפור המלא: טבלת ציר כבדיקת נתונים

טבלת ציר היא גם הדרך המהירה ביותר לבדוק את הקובץ אחרי ההקלדה. גוררים משתנה ל־Rows ול־Values (עם Count), ורואים מיד את כל הערכים שבו. ב־parent_edu, למשל, יופיעו חמש שורות: 1, 2, 3, 4, ו־99 עם 6 תלמידים. שורה של 99 היא קוד חסר. שורה של 33 היא טעות הקלדה, ואפשר לחפש אותה בקובץ. ושימו לב: טבלת ציר לא יודעת ש־99 הוא חסר. אם תבקשו ממנה ממוצע, הוא ייכנס לחישוב, כמו בפרק 8. ואחרי שמתקנים בקובץ את הטעויות שמצאתם: Refresh, ובודקים שוב.

עצרו ונסו

שכחתם לשנות ל־Count, וגררתם את gender (1 בן, 2 בת) ל־Values, כשב־Rows נמצא group. בקבוצת הביקורת 35 בנים ו־39 בנות. איזה מספר יופיע בשורה של הביקורת? ואיך תזהו שזו טעות?

בדיקת התשובה
35 · 1 + 39 · 2 = 35 + 78 = 113

יופיע 113: סכום הקודים. אפשר לזהות את הטעות בשתי דרכים: 113 גדול ממספר התלמידים בקבוצה, 74, וזה בלתי אפשרי בספירה. וב־Grand Total יופיע 304, בקובץ של 200 תלמידים. הכותרת עצמה אומרת את זה: Sum of gender.

בדקו את עצמכם4 שאלות

1.רוצים לדעת כמה בנים וכמה בנות בכל שכבה. איך בונים את טבלת הציר?

2.באיזה אזור של טבלת הציר שמים משתנה כדי לחשב רק על חלק מהנבדקים, למשל רק על תלמידי בית ספר 1?

3.גררתם את vol_pre (0 לא התנדב, 1 התנדב) ל־Values, ושכחתם לשנות מ־Sum. ב־Rows נמצא group. האם המספרים בטבלה חסרי משמעות?

4.בקובץ קטן, group מקודד 1 ו־2. בניתם טבלת ציר עם group ב־Rows וב־Values, וקיבלתם 10 בשורה של 1 ו־30 בשורה של 2. כמה אנשים יש בקבוצה 2?

בתוכנה: טבלת שכיחויות וגרף

נבנה את טבלת השכיחויות של השכלת ההורה, עם גרף. בחרו את התוכנה שלכם.

מלבד טבלת הציר, אפשר לבנות את הטבלה בנוסחאות. כך רואים כל עמודה נבנית, והטבלה מתעדכנת לבד כשהנתונים משתנים. parent_edu בעמודה H, בשורות 2 עד 201. נבנה את הטבלה בעמודות הריקות מימין לנתונים:

  1. בתאים BE2 עד BE5 כותבים את הערכים 1, 2, 3, 4.
  2. שכיחות: בתא BF2 =COUNTIF($H$2:$H$201, BE2), וגוררים עד BF5. הדולרים מקבעים את טווח הנתונים, ו־BE2 יחסי, ולכן בכל שורה סופרים ערך אחר (פרק 3). ה־99 לא נספרים, כי אין להם שורה.
  3. אחוז תקף: בתא BG2 =BF2/SUM($BF$2:$BF$5)*100, וגוררים. המכנה הוא סכום השכיחויות, 194, ולא 200.
  4. שכיחות מצטברת: בתא BH2 =BF2, ובתא BH3 =BH2+BF3, וגוררים: הקודמת ועוד השכיחות של השורה.
  5. אחוז מצטבר: בתא BI2 =BH2/$BH$5*100, וגוררים.

Frequency table with formulas (columns BE–BI)

BEBFBGBHBI
1parent_eduf%cfcum %
212814.42814.4
324724.27538.7
437438.114976.8
544523.2194100.0

קיבוץ עם FREQUENCY: לגיל (עמודה G), כותבים בתאים BK2 עד BK6 את הגבולות העליונים הנראים: 9.4, 9.9, 10.4, 10.9, 11.4. בתא BL2: =FREQUENCY(G2:G201, BK2:BK6), ו־Enter. באקסל עדכני התוצאות "נשפכות" לבד לתאים שמתחת: 35, 52, 61, 36, 16, ועוד 0 בתא השישי. התא הנוסף סופר ערכים שגבוהים מהגבול האחרון, ו־0 בו הוא בדיקה שלא שכחנו אף אחד. FREQUENCY סופרת כל ערך שקטן או שווה לגבול, וגדול מהגבול הקודם. בגרסאות ישנות מסמנים קודם את BL2 עד BL7, מקלידים את הנוסחה, ולוחצים Ctrl+Shift+Enter.

גרף: מסמנים את עמודת הערכים ואת עמודת השכיחות, ובוחרים Insert > Charts: Column לדיאגרמת עמודות, או Pie לעוגה. להיסטוגרמה: יוצרים דיאגרמת עמודות מטבלת הקיבוץ, לוחצים לחיצה ימנית על עמודה, בוחרים Format Data Series, ומשנים את Gap Width ל־0. העמודות נוגעות. ומוסיפים כותרת לגרף ולצירים: מה נמדד, ובאיזו יחידה.

באקסל יש גם סוג גרף בשם Histogram (Insert > Insert Statistic Chart), שבוחר קטגוריות לבד. אפשר לשנות בו את Bin width, אבל קשה לשלוט בגבולות. בספר נעדיף לבנות את הקטגוריות בעצמנו.

  1. ודאו ש־99 מוגדר כחסר ב־parent_edu (Variable View, עמודה Missing, פרק 8), ושיש תוויות לערכים (Values).
  2. Analyze > Descriptive Statistics > Frequencies. מעבירים את parent_edu לחלון Variable(s). Display frequency tables מסומן כברירת מחדל.
  3. בכפתור Charts בוחרים Bar charts (או Pie charts), ובתחתית, ב־Chart Values, Percentages. למשתנה רציף בוחרים Histograms.
  4. OK. או Paste, כדי לשמור את הפקודה כסינטקס, ואז מריצים.

Parent education

FrequencyPercentValid Percent 1Cumulative Percent
ValidUp to 12 years2814.014.414.4
Post-secondary4723.524.238.7
Bachelor7437.038.176.8
Master or higher4522.523.2100.0
Total19497.0100.0
Missing 2Unknown63.0
Total200100.0
Frequency
השכיחות, f.
Percent
האחוז מתוך כל 200 התלמידים, כולל החסרים.
1 · Valid Percent
האחוז מתוך 194 התקפים. אותו מדווחים: 38.1% מההורים בעלי תואר ראשון.
Cumulative Percent
האחוז המצטבר, מחושב מהאחוז התקף.
2 · Missing
6 תלמידים עם הקוד 99, שהתווית שלו Unknown. השורה הזו היא עוד דרך לבדוק שהגדרתם את החסרים נכון. אם היא לא מופיעה, ו־99 מופיע כשורה בתוך Valid, הקוד לא הוגדר.

מתחת לטבלה מופיע הגרף. בפלט מופיעה גם טבלה קטנה בשם Statistics, עם N Valid ו־Missing: 194 ו־6.

  1. Descriptives > Descriptive Statistics. גוררים את parent_edu לחלון Variables. ודאו שהסמל שלו הוא Ordinal (פרק 6).
  2. בחלק Tables מסמנים Frequency tables.
  3. בחלק Basic plots מסמנים Distribution plots: למשתנה שמי או סדר JASP מצייר דיאגרמת עמודות, ולמשתנה Scale היסטוגרמה. יש שם גם Pie charts.

Frequencies for parent_edu

parent_eduFrequencyPercentValid PercentCumulative Percent
12814.00014.43314.433
24723.50024.22738.660
37437.00038.14476.804
44522.50023.196100.000
Missing63.000
Total200100.000
Valid Percent
האחוז מתוך 194 התקפים, ואותו מדווחים. JASP מציג שלוש ספרות אחרי הנקודה. בדוח מעגלים לאחת: 38.1%.
Missing
6 תלמידים. השורה מופיעה רק אם 99 הוגדר כחסר. אם לא, תראו שורה של 99 בתוך הטבלה, ו־Missing 0: סימן לחזור לפרק 8, ולהחליף את ה־99 בתאים ריקים באקסל, או להגדיר אותו כחסר למשתנה הזה.
1, 2, 3, 4
אם תתנו תוויות לערכים (לחיצה על שם המשתנה), הן יופיעו כאן במקום הקודים.

למה הסמל קובע מה תקבלו? JASP מחליט אילו טבלאות וגרפים להציע לפי הסוג של המשתנה. למשתנה Scale, כמו גובה, לא מעניין אותנו כמה תלמידים גובהם בדיוק 1.41 מטר, ולכן JASP מצייר לו היסטוגרמה. לפחות בחלק מהגרסאות, טבלת שכיחויות מוצעת רק למשתנים Nominal ו־Ordinal. ומכאן תקלה נפוצה: JASP רואה מספרים, 1, 2, 3, 4, ומנחש Scale. אם לא קיבלתם טבלת שכיחויות, או קיבלתם היסטוגרמה במקום דיאגרמת עמודות, בדקו את הסמל בראש העמודה ושנו אותו. אותו טריק עובד גם לבדיקת הקובץ (פרק 8): מגדירים את id כ־Nominal, מבקשים לו טבלת שכיחויות, ובודקים שכל מספר נבדק מופיע פעם אחת בלבד.

בדקו את עצמכם3 שאלות

1.כתבתם =FREQUENCY(G2:G201, BK2:BK6), עם חמישה גבולות עליונים. כמה תאים מתמלאים בתוצאות?

1.ב־SPSS, בטבלת Frequencies של parent_edu, השורה התחתונה Total מראה 200. ממה מורכב המספר הזה?

1.ב־JASP, בטבלת השכיחויות של parent_edu, מופיעות השורות Missing 6 ו־Total 200. מתוך כמה תלמידים מחושבת העמודה Valid Percent?

2.בטבלת השכיחויות של siblings מופיעה שורה של הערך 99 עם שכיחות 5, ואין שורה של ערכים חסרים. מה זה אומר, ומה עושים?

3.כתבתם בתא BF2 =COUNTIF(H2:H201, BE2), בלי דולרים, וגררתם למטה. מה יקרה בתא BF4?

3.ב־SPSS העברתם את parent_edu ואת gender יחד לחלון Variable(s) של Frequencies. מה תקבלו?

3.ב־JASP גררתם את parent_edu ואת gender לחלון Variables, וסימנתם Frequency tables. מה תקבלו?

טעויות נפוצות

בדקו את עצמכם

סיכום

מונחים חדשים

שכיחותטבלת שכיחויותשכיחות יחסיתשכיחות מצטברתאחוז מצטבראחוז תקףקיבוץ לקטגוריותגבולות נראיםגבולות אמיתייםרוחב קטגוריהאמצע קטגוריהדיאגרמת עוגהדיאגרמת עמודותהיסטוגרמהטבלת ציר (Pivot Table)COUNTIFFREQUENCY

שאלות לדוגמה, עם פתרונות

  1. 15 תלמידים ספרו כמה מחברות יש להם בתיק: 3, 1, 2, 2, 4, 3, 2, 1, 2, 3, 2, 5, 2, 3, 1. בנו טבלת שכיחויות מלאה. איזה אחוז מהתלמידים עם שלוש מחברות לכל היותר?

    בדיקת התשובה
    מחברותfאחוזcfאחוז מצטבר
    1320.0320.0
    2640.0960.0
    3426.71386.7
    416.71493.3
    516.715100.0
    סה״כ15100.0
    13 / 15 · 100 = 86.7% האחוז המצטבר של 3

    בדיקה: סכום השכיחויות 15. והאחוזים המעוגלים מסתכמים ל־100.1, בגלל עיגול. האחוז המצטבר מחושב מהשכיחות המצטברת, ולכן הוא יוצא בדיוק 100.

  2. בסקר שביעות רצון השתתפו 250 הורים. 10 לא ענו על השאלה "האם אתם מרוצים מהתקשורת עם המחנכת?", ו־96 ענו "מרוצים מאוד". מה האחוז ומה האחוז התקף של "מרוצים מאוד"? איזה מהם מדווחים?

    בדיקת התשובה
    96 / 250 · 100 = 38.4% אחוז מכל ההורים (Percent)
    250 − 10 = 240 מספר העונים
    96 / 240 · 100 = 40.0% אחוז תקף (Valid Percent)

    מדווחים את האחוז התקף, 40.0%, ומציינים ש־10 הורים לא ענו.

  3. ציוני מבחן, במספרים שלמים, קובצו לקטגוריות 40–49, 50–59, וכן הלאה עד 90–100. א. מהם הגבולות האמיתיים, הרוחב והאמצע של 70–79? ב. מה לא בסדר בקטגוריה האחרונה? ג. תלמיד קיבל 69.6 לפני עיגול. לאיזו קטגוריה הוא שייך?

    בדיקת התשובה
    69.5–79.5 חצי יחידה מכל צד
    79.5 − 69.5 = 10 הרוחב
    (70 + 79) / 2 = 74.5 האמצע

    ב. 90–100 כוללת 11 ערכים שלמים, ושאר הקטגוריות 10: הרוחב לא שווה. בהיסטוגרמה העמודה האחרונה תיראה גבוהה מדי. אפשר לכתוב 90–99, ולהוסיף קטגוריה של 100, או להשאיר אותה ולציין את זה. ג. 69.6 נרשם כ־70, ולכן הוא שייך ל־70–79. הוא עבר את הגבול האמיתי 69.5.

  4. לפניכם פלט של SPSS לפריט החרדה השלישי, a3, "הלב שלי דופק מהר בלי סיבה". ענו: א. כמה תלמידים ענו על הפריט? ב. איזה אחוז מהעונים ענו "לעיתים קרובות"? ג. איזה אחוז מהעונים ענו "לפעמים" לכל היותר? ד. למה Percent ו־Valid Percent שונים?

    Anxiety 3: heart beats fast

    FrequencyPercentValid PercentCumulative Percent
    ValidNever7738.538.938.9
    Sometimes7738.538.977.8
    Often3316.516.794.4
    Always115.55.6100.0
    Total19899.0100.0
    MissingNo answer21.0
    Total200100.0
    בדיקת התשובה

    א. 198: השורה Total בתוך Valid. שני תלמידים לא ענו (הקוד 99, שהוגדר כחסר). ב. 16.7%, מהעמודה Valid Percent: 33 / 198 · 100. ג. 77.8%, האחוז המצטבר של "Sometimes": (77 + 77) / 198 · 100. ד. Percent מחושב מתוך כל 200 התלמידים, כולל השניים שלא ענו, ו־Valid Percent מתוך 198 העונים. אילו לא היו חסרים, שתי העמודות היו זהות.

  5. בטבלת ציר שמתם את school (1, 2, 3) ב־Rows וגם ב־Values, ושכחתם לשנות מ־Sum. הטבלה מראה 74, 102, 225, ו־Grand Total 401. כמה תלמידים יש בכל בית ספר? ואיך הייתם מזהים את הטעות גם בלי לדעת מה הקודים?

    בדיקת התשובה
    74 / 1 = 74 בית ספר 1: סכום של אחדים שווה למספרם
    102 / 2 = 51 בית ספר 2
    225 / 3 = 75 בית ספר 3
    74 + 51 + 75 = 200 בדיקה

    הסימן הברור: Grand Total של 401, בקובץ של 200 תלמידים. ספירה לא יכולה להיות גדולה ממספר הנבדקים. וגם הכותרת אומרת Sum of school. התיקון: Value Field Settings > Count.

תרגול עם הנתונים

הקבצים עצמם נמצאים גם בתיקיית data בחבילת הספר.

  1. בנו טבלת שכיחויות מלאה לפריט החרדה הראשון, a1, לכל 200 התלמידים. איזה אחוז עונים "לפעמים" לכל היותר?
    בדיקת התשובה

    שכיחויות: 64, 75, 50, 11. אחוזים: 32.0, 37.5, 25.0, 5.5. שכיחות מצטברת: 64, 139, 189, 200. "לפעמים" לכל היותר: 139 / 200 · 100 = 69.5%. אין חסרים בפריט הזה, ולכן האחוז והאחוז התקף זהים.

  2. בטבלת ציר, שימו את parent_edu ב־Rows וב־Values, עם Count. כמה שורות יש בטבלה, ומה ה־Grand Total? מה צריך לעשות לפני שמחשבים אחוזים?
    בדיקת התשובה

    חמש שורות: 1 (28), 2 (47), 3 (74), 4 (45), ו־99 (6). Grand Total: 200. ה־99 הוא קוד חסר, ולכן מחשבים אחוזים מתוך 194. אפשר להשמיט אותו מהטבלה בחץ שליד Row Labels, ולבטל את הסימון של 99.

  3. בטבלת ציר, שימו את group ב־Rows ואת vol_pre (0 לא, 1 כן) ב־Columns, עם Count. בכל קבוצה, איזה אחוז מהתלמידים התנדבו בתחילת השנה? איזו אפשרות של Show Values As נותנת את זה?
    בדיקת התשובה

    % of Row Total. ביקורת: 25 מתוך 74, 33.8%. עקיפה: 22 מתוך 51, 43.1%. משולבת: 29 מתוך 75, 38.7%. בסך הכול 76 מתוך 200, 38.0%. שימו לב: זו המדידה לפני התוכנית. האם ההבדלים בין הקבוצות גדולים מכדי להיות מקריים? על זה עונה מבחן חי בריבועChi-square test of independence, בפרק 23.

  4. קבצו את ציון החרדה, anx_pre, לקטגוריות ברוחב 0.5, מ־1 ועד מתחת ל־4. באקסל: FREQUENCY עם הגבולות 1.49, 1.99, 2.49, 2.99, 3.49, 3.99. ציירו היסטוגרמה. מה הצורה?
    בדיקת התשובה

    השכיחויות: 10, 56, 64, 50, 18, 2. =FREQUENCY(AI2:AI201, BK2:BK7), כשהגבולות בתאים BK2 עד BK7. השיא בקטגוריה 2.0 עד מתחת ל־2.5, והצורה כמעט סימטרית, עם זנב מעט ארוך יותר לכיוון החרדה הגבוהה. למה 1.49 ולא 1.5? כי הציון הוא ממוצע של 8 פריטים, ולכן הוא קופץ בשמיניות: אחרי 1.375 בא 1.5, ואין ערך ביניהם. הגבול 1.49 מבטיח ש־1.5 ייכנס לקטגוריה השנייה. שני תלמידים שדילגו על פריט קיבלו ממוצע של 7 פריטים (2.1429 ו־2.8571), וגם הם נופלים בבירור בתוך קטגוריה.

  5. בטבלת ציר עם group ב־Rows ו־Count, הוסיפו את grade ל־Filters ובחרו 5. כמה תלמידי כיתה ה׳ בכל קבוצה?
    בדיקת התשובה

    22 בביקורת, 22 בעקיפה, 23 במשולבת: 67 תלמידים. ובכיתה ד׳: 52, 29, 52, כלומר 133. יחד 200.

בפרק הבא: מדדי מרכזMeasure of central tendency. איך מתארים את כל הטבלה הזו במספר אחד? שכיח, חציוןMedian וממוצע: מה כל אחד אומר, ואיך בוחרים ביניהם.

מקורות: Tarrasch, R., & Berger, R. (2022). Mindfulness. https://doi.org/10.1007/s12671-022-01955-y