סטטיסטיקה מ־0 עד 100בטאתוכנהעומק

חלק ב: תיאור נתונים · פרק 14

ההתפלגות הנורמלית

בפרק הקודם, כדי לדעת כמה תלמידים חרדים פחות מתלמידה מספר 5, מיינו 200 ציונים וספרנו. בפרק הזה נכיר עקומה אחת, בצורת פעמון, שמאפשרת לענות על שאלות כאלה בלי למיין אף ציון: מספיקים הממוצע, סטיית התקן, ופונקציה אחת באקסל. ונלמד גם מתי מותר להשתמש בה, ומתי היא תטעה אותנו.

שאלת הפתיחה

בשאלון הקשיבות, ציון התקן של תלמידה מספר 5 הוא 2.31. כמה תלמידים, מתוך 200, צפויים לקבל יותר ממנה?

אם ההתפלגות בצורת פעמון, התשובה היא כ־2 תלמידים, ואפשר לחשב אותה משתי עובדות בלבד: הממוצע וסטיית התקן. בסוף הפרק תדעו לעשות את החישוב הזה בשורה אחת באקסל, ותדעו גם לבדוק אם ההנחה "בצורת פעמון" בכלל מתקיימת. (ומה קרה בפועל? בסעיף 4.)

בסוף הפרק תוכלו

הסתברות כשטח

הסתברות היא אחוז המקרים: מספר המקרים המתאימים, חלקי מספר המקרים הכולל. היא מספר בין 0 ל־1. בהיסטוגרמה, כל עמודה מייצגת חלק מהנבדקים. כשיש הרבה נבדקים, ההיסטוגרמה נראית כמו עקומה חלקה, והשטח מתחת לעקומה בין שני ערכים הוא אחוז המקרים שביניהם. השטח כולו הוא 1, כלומר 100%.

כל ההסתברות שנצטרך בספר הזה מתחילה בשאלה אחת: אם בוחרים תלמיד אחד באקראי, מה הסיכוי שהוא יקיים תנאי מסוים? התשובה: מספר התלמידים שמקיימים את התנאי, חלקי מספר התלמידים הכולל. למשל, בשאלון החרדה, 20 מתוך 200 התלמידים קיבלו 3 ומעלה. ההסתברות שתלמיד אקראי קיבל 3 ומעלה:

20 / 200 = 0.10 = 10%

שתי דרכים לכתוב את אותו דבר: הסתברות היא מספר בין 0 ל־1, וכופלים ב־100 כדי לקבל אחוזים. בספר, "ההסתברות", "הסיכוי" ו"אחוז המקרים" הם אותו דבר.

מהיסטוגרמה לעקומה

בפרק 9 בנינו היסטוגרמות. בגרף שלמטה, ההיסטוגרמה של הקשיבות לפני התוכנית, mind_pre. כל עמודה מייצגת חלק מהתלמידים: ארבע העמודות הצבעוניות, מתחת ל־2.5, מייצגות 18 תלמידים, כלומר 9% מהמדגם. ככל שהעמודה גבוהה ורחבה יותר, היא "תופסת" יותר תלמידים. כלומר, השטח של העמודות הוא שמספר כמה תלמידים יש בהן.

עכשיו דמיינו שהיו לנו לא 200 תלמידים אלא 200,000, והיינו מציירים עמודות צרות מאוד. הקצוות המדורגים של העמודות היו מתמזגים לקו חלק, לעקומה. ובעקומה, כמו בעמודות, השטח מתחת לעקומה בין שני ערכים הוא אחוז המקרים שביניהם. והשטח כולו מתחת לעקומה, מקצה לקצה, הוא 1: כל המקרים, 100%.

0102030405012872521403533101262.51.522.533.544.5קשיבות לפני התוכניתשכיחות
הקשיבות לפני התוכנית (mind_pre, n = 200), בקטגוריות של רבע נקודה, ועליה העקומה הנורמליתNormal distribution עם אותו ממוצע ואותה סטיית תקן. מתחת ל־2.5: 18 תלמידים, 9.0%. השטח מתחת לעקומה משמאל ל־2.5: 9.9%.

שימו לב לשני המספרים בכיתוב. העמודות אומרות 9.0%, והעקומה אומרת 9.9%. קרוב, אבל לא זהה: העקומה היא מודל, תיאור מוחלק של הנתונים. בסעיפים הבאים נכיר את העקומה המסוימת הזו, ונלמד לחשב שטחים מתחתיה. ובסעיף 6 נשאל מתי מותר להחליף את הנתונים בעקומה.

הסיפור המלא: למה גובה העקומה אינו הסתברות

בהיסטוגרמה רגילה, גובה העמודה הוא מספר התלמידים. בעקומה זה כבר לא עובד: כמה תלמידים קיבלו בדיוק 3.20000 בקשיבות? במשתנה רציףContinuous variable, הסיכוי לערך מדויק אחד הוא 0. לכן בעקומה רק לשטח יש משמעות. הגובה נקרא צפיפות: הוא אומר איפה הערכים צפופים, ולא כמה יש מהם. מתמטית, השטח מתחת לעקומה מחושב באינטגרל, וזה בדיוק מה שאקסל יעשה בשבילנו בסעיף 4. בספר לא נצטרך לחשב אינטגרל אף פעם.

עצרו ונסו

בשביעות הרצון מהחיים לפני התוכנית, 18 מתוך 200 התלמידים קיבלו יותר מ־6.5.   א. מה ההסתברות שתלמיד אקראי קיבל יותר מ־6.5?   ב. ומה ההסתברות שתלמיד אקראי קיבל 6.5 או פחות?   ג. מה השטח כולו מתחת לעקומה של שביעות הרצון?

בדיקת התשובה
א. 18 / 200 = 0.09 = 9%
ב. 1 − 0.09 = 0.91 = 91% כל מי שלא מעל 6.5
ג. 1, כלומר 100%, כמו בכל עקומה של התפלגות
בדקו את עצמכם3 שאלות

1.בסקר של 150 הורים, 45 אמרו שהילד שלהם קורא כל ערב. מה ההסתברות שהורה אקראי מהסקר אמר זאת?

2.בעקומה של התפלגות ציוני מבחן, מה מייצג השטח מתחת לעקומה בין הציון 60 לציון 80?

3.בכיתה 25 תלמידים. 5 קיבלו פחות מ־60, ו־15 קיבלו בין 60 ל־80. מה ההסתברות שתלמיד אקראי קיבל 80 ומעלה?

העקומה הנורמליתNormal distribution

ההתפלגות הנורמלית היא עקומה בצורת פעמון: סימטרית, עם הממוצע, החציוןMedian והשכיח במרכז, וזנבות שמתקרבים לציר ולא נוגעים בו. היא נקבעת לגמרי על ידי שני מספרים: הממוצע μ קובע איפה המרכז, וסטיית התקן σ קובעת כמה היא רחבה. אחרי מעבר לציוני תקןz-score, כל התפלגות נורמלית הופכת לאותה עקומה: ההתפלגות הנורמלית הסטנדרטיתStandard normal distribution, עם ממוצע 0 וסטיית תקן 1.

יש הרבה עקומות בצורת פעמון. ההתפלגות הנורמלית היא אחת מסוימת מאוד, עם נוסחה מתמטית מדויקת, והיא ההתפלגות החשובה ביותר בסטטיסטיקה. לא נצטרך את הנוסחה. נצטרך את התכונות:

בדרך כלל משתמשים בהתפלגות הנורמלית כדי לתאר אוכלוסייה שלמה: כל הילדים בגיל מסוים, כל הנבחנים במבחן ארצי. לכן את הממוצע שלה מסמנים ואת סטיית התקן שלה σ, כמו שהכרנו בפרק 11. כשנשתמש בה לתאר את המדגם שלנו, נציב במקומם את ו־.

מתי פוגשים אותה?

כשתכונה היא סכום של הרבה גורמים קטנים ובלתי תלויים. חשבו על ציון במבחן ארוך: הוא תלוי בידע, בשינה בלילה שלפני, במצב הרוח, במזל בניחוש, בכמה השאלות התאימו למה שלמדתם. כל גורם מושך קצת למעלה או קצת למטה. אצל רוב התלמידים ההשפעות מתקזזות, ולכן רוב הציונים באמצע. כדי להגיע לקצה, הרבה גורמים צריכים למשוך לאותו כיוון, וזה נדיר. התוצאה: פעמון. כך גם בגובה, בלחץ דם, ובטעויות מדידהMeasurement error. ונפגוש אותה שוב, בתפקיד הראשי, בפרק 17: ממוצעים של מדגמים מתפלגים נורמלית כמעט תמיד.

ההתפלגות הנורמלית הסטנדרטיתStandard normal distribution

בפרק 13 ראינו שציוני תקןz-score תמיד בעלי ממוצע 0 וסטיית תקן 1, ושהם לא משנים את צורת ההתפלגות. מכאן מסקנה חשובה: אם הופכים ציונים מהתפלגות נורמלית לציוני תקן, מקבלים התפלגות נורמלית עם ממוצע 0 וסטיית תקן 1. היא נקראת ההתפלגות הנורמלית הסטנדרטית, או התפלגות z.

למה זה כל כך שימושי? כי כל התפלגות נורמלית, עם כל ממוצע וכל סטיית תקן, הופכת לאותה עקומה בדיוק. מספיק להכיר את השטחים של עקומה אחת. למשל, 79.95% מהשטח של הנורמלית הסטנדרטית נמצא משמאל לציון התקן 0.84. ולכן, בכל התפלגות נורמלית, 79.95% מהמקרים נמצאים מתחת לממוצע ועוד 0.84 סטיות תקן: בגובה, בלחץ דם, ובמבחן קריאה.

הסיפור המלא: עקומת גאוס, ולמה "נורמלית"

את העקומה תיאר לראשונה המתמטיקאי אברהם דה־מואבר במאה ה־18, כקירוב לחישובי הסתברות בהטלות מטבע. קרל פרידריך גאוס השתמש בה בתחילת המאה ה־19 לתיאור טעויות מדידה באסטרונומיה, ולכן היא נקראת גם "עקומת גאוס". במאה ה־19 גילו שהיא מתארת היטב גם מדידות של בני אדם, כמו היקף החזה של חיילים, ומכאן נולד השם "נורמלית", כאילו זו ההתפלגות ה"רגילה" של כל דבר. השם מטעה: הרבה משתנים אינם נורמליים בכלל, כמו הכנסה, זמן תגובה, או מספר אחים. נראה זאת בסעיף 6.

עצרו ונסו

ציוני מבחן ארצי מתפלגים נורמלית. בשנה שעברה הממוצע היה 500 וסטיית התקן 100. השנה הממוצע 520 וסטיית התקן 80.   א. איזה פעמון נמצא יותר ימינה?   ב. איזה גבוה וצר יותר?   ג. באיזו שנה החציון גבוה יותר, ומה הוא?

בדיקת התשובה

א. השנה: הממוצע, המרכז של הפעמון, גבוה יותר. ב. השנה: סטיית התקן קטנה יותר, ולכן הפעמון צר יותר. והשטח כולו נשאר 1, ולכן פעמון צר חייב להיות גבוה יותר. ג. השנה. בהתפלגות נורמלית החציון שווה לממוצע: 520, לעומת 500 בשנה שעברה.

בדקו את עצמכם3 שאלות

1.מה אינו נכון לגבי התפלגות נורמלית?

2.לשתי התפלגויות נורמליות אותו ממוצע. לאחת סטיית תקן 5, ולשנייה 10. מה נכון?

3.ציונים מתפלגים נורמלית, עם ממוצע 50 וסטיית תקן 10. איזה אחוז מהציונים נמוכים מ־50? למה לא צריך לזה טבלה או תוכנה?

כלל 68־95־99.7

בכל התפלגות נורמלית, בערך: 68% מהמקרים נמצאים עד סטיית תקן אחת מהממוצע, 95% עד שתי סטיות תקן, ו־99.7% עד שלוש. בגלל הסימטריה, כל חלק מתחלק שווה בין שני הצדדים: 34% בין הממוצע לסטיית תקן אחת מעליו, 13.5% בין אחת לשתיים, 2.35% בין שתיים לשלוש, ו־0.15% מעבר לשלוש.

זה הכלל השימושי ביותר בפרק, והוא עובד בלי מחשבון. שלושה מספרים לזכור:

z = −3μ − 3σz = −2μ − 2σz = −1μ − σz = 0μz = 1μ + σz = 2μ + 2σz = 3μ + 3σ34%34%13.5%13.5%2.35%2.35%0.15%0.15%
כלל 68־95־99.7. הכהה ביותר: עד סטיית תקן אחת מהממוצע (34% + 34% = 68%). עם הבינוני: עד שתיים (95%). עם הבהיר: עד שלוש (99.7%).

כדי לענות על שאלה, מציירים פעמון, מסמנים את הממוצע ואת סטיות התקן, וצובעים את השטח המבוקש. אחר כך מחברים את החלקים מהציור.

דוגמה פתורה: מבחן בשטף קריאה

ציוני מבחן בשטף קריאה מתפלגים נורמלית באוכלוסייה, עם ממוצע 100 וסטיית תקן 15. כלומר, 85 ו־115 הם סטיית תקן אחת מכל צד, 70 ו־130 הן שתיים, ו־55 ו־145 הן שלוש.

בין 85 ל־115:   סטיית תקן אחת מכל צד → 68%
מעל 130:   (100% − 95%) / 2 = 2.5% מה שמחוץ לשתי סטיות התקן, מתחלק בין שני הזנבות
מתחת ל־85:   (100% − 68%) / 2 = 16%
בין 100 ל־130:   95% / 2 = 47.5% מהממוצע עד שתי סטיות תקן מעליו
בין 70 ל־115:   47.5% + 34% = 81.5% שתי סטיות תקן מתחת, ואחת מעל
דוגמה מהמחקר: האם הקשיבות "מצייתת" לכלל?

בקשיבות לפני התוכנית, M = 3.20 ו־SD = 0.55. אם ההתפלגות נורמלית, כ־68% מהתלמידים צפויים להיות בין 2.66 ל־3.75. בדקנו בקובץ:

הטווחהגבולותמספר התלמידיםבפועללפי הכלל
סטיית תקן אחת2.66 עד 3.7514170.5%68%
שתי סטיות תקן2.11 עד 4.3018894.0%95%
שלוש סטיות תקן1.56 עד 4.84200100%99.7%

קרוב מאוד. בסעיף 6 נראה שזו אחת משלוש בדיקות פשוטות לשאלה אם משתנה נורמלי בקירוב, וגם שהיא לבדה לא מספיקה. איך סופרים את זה באקסל? בקטע "בתוכנה".

הסיפור המלא: המספרים המדויקים

68, 95 ו־99.7 הם עיגולים. המספרים המדויקים הם 68.27%, 95.45% ו־99.73%. והחלקים: 34.13%, 13.59%, 2.14% ו־0.13%. שימו לב: 95% בדיוק נמצאים עד 1.96 סטיות תקן מהממוצע, לא עד 2. את 1.96 נפגוש שוב ושוב, החל מפרק 18. ועוד שני חלקים קטנים, שימושיים לחישוב בראש: מהממוצע עד חצי סטיית תקן יש 19.15%, ומחצי סטיית תקן עד סטיית תקן שלמה יש עוד 14.99%. יחד, 34.13%.

ובכל התפלגות? אי־שוויון צ׳בישב

כלל 68־95־99.7 נכון רק להתפלגות נורמלית. יש כלל חלש יותר, שנכון לכל התפלגות, בכל צורה: אי־שוויון צ׳בישבChebyshev's inequality. לפי צ׳בישב, לפחות 1 − 1/k² מהערכים נמצאים עד k סטיות תקן מהממוצע, לכל k גדול מ־1:

k = 2:   1 − 1/4 = 0.75 → לפחות 75% מהערכים עד שתי סטיות תקן מהממוצע
k = 3:   1 − 1/9 = 0.889 → לפחות 88.9% מהערכים עד שלוש סטיות תקן מהממוצע

שלוש הערות כדי להשתמש בו נכון. אחת: זה גבול מינימלי, "לפחות". הוא לא אומר שבהתפלגות לא נורמלית יש 75%. בדרך כלל יש הרבה יותר. שתיים: הוא לא אומר כלום על סטיית תקן אחת: עם k = 1 מקבלים "לפחות 0%". שלוש: אפשר להפוך אותו: לכל היותר 25% מהערכים רחוקים מהממוצע יותר משתי סטיות תקן, ולכל היותר 11.1% יותר משלוש. ולכן, בכל התפלגות שהיא, ציון תקן של 3 ומעלה הוא כבר ערך די קיצוני.

בקשיבות: צ׳בישב מבטיח לפחות 75% בטווח של שתי סטיות תקן. העקומה הנורמלית צופה כ־95%. ובפועל 94%. כשההתפלגות פעמונית, הכלל הנורמלי מדויק הרבה יותר. כשאין לנו מושג על הצורה, צ׳בישב הוא מה שנשאר.

מעבדה: ציון תקן והתפלגות נורמלית

מעבדה: ציון תקן וההתפלגות הנורמלית. קובעים ממוצע, סטיית תקן וערך, ורואים את ציון התקן ואת אחוז הערכים מתחתיו ומעליו. בכפתור "טווחי סטיות תקן" רואים את הכלל.פתיחה בחלון נפרד
משימות למעבדה
  1. לחצו על "טווחי סטיות תקן". השוו לאיור שלמעלה.
  2. בחרו "מבחן: איתי" (ממוצע 77.1, סטיית תקן 10.04, ציון 86). מה ציון התקן של איתי, וכמה אחוזים צפויים לקבל יותר ממנו?
  3. בחרו "מבחן IQ" (ממוצע 100, סטיית תקן 15) והזיזו את הערך. מאיזה ערך נשארים מעליו 2.5% בלבד, או פחות? למה דווקא שם?
בדיקת התשובה

2. z = (86 − 77.1) / 10.04 = 0.89. מתחתיו 81.2%, ומעליו 18.8%. 3. בערך 129.5: מעליו 2.46%. החישוב המדויק הוא 100 + 1.96 · 15 = 129.4. זה המקום שבו 95% נמצאים עד שם מכל צד של הממוצע, ו־2.5% נשארים בכל זנב. לפי הכלל המעוגל היינו אומרים 130, שתי סטיות תקן, ומעליו 2.28%.

עצרו ונסו

הזמן שלוקח לתלמידים לקרוא קטע מתפלג נורמלית: ממוצע 120 שניות, סטיית תקן 15. בלי מחשבון:   א. איזה אחוז קוראים בין 105 ל־135 שניות?   ב. בין 90 ל־150?   ג. יותר מ־135?   ד. בין 120 ל־150?   ה. פחות מ־75?

בדיקת התשובה
א. סטיית תקן אחת מכל צד → 68%
ב. שתי סטיות תקן מכל צד → 95%
ג. (100% − 68%) / 2 = 16%
ד. מהממוצע עד שתי סטיות תקן מעליו: 95% / 2 = 47.5%
ה. 75 הוא שלוש סטיות תקן מתחת לממוצע: (100% − 99.7%) / 2 = 0.15%
בדקו את עצמכם3 שאלות

1.משתנה מתפלג נורמלית, עם ממוצע 20 וסטיית תקן 4. לפי כלל 68־95־99.7, איזה אחוז מהערכים נמצאים בין 24 ל־28?

2.משתנה מוטה מאוד, עם זנב ימני ארוך. מה אפשר לומר בוודאות על אחוז הערכים שנמצאים עד שתי סטיות תקן מהממוצע?

3.בהרגשה בכיתה (clim_pre) הממוצע 3.4725 וסטיית התקן 0.6512. מהם הגבולות של שתי סטיות תקן מהממוצע? כמה אחוזים צפויים בתוכם לפי העקומה הנורמלית, וכמה לפי צ׳בישב? (בפועל: 186 תלמידים.)

מציון לאחוז

כשהציון לא נופל על סטיות תקן שלמות, משתמשים באקסל. שלושה צעדים: מציירים עקומה וצובעים את השטח, מחשבים ציון תקן, ומוצאים את השטח משמאל עם =NORM.S.DIST(z, TRUE). או ישירות, בלי ציון תקן: =NORM.DIST(x, M, SD, TRUE). אקסל תמיד נותן את השטח משמאל. מעל ציון: 1 פחות השטח משמאל. בין שני ציונים: שטח פחות שטח.

הכלל מהסעיף הקודם עובד רק כשהציון נמצא בדיוק סטיית תקן אחת, שתיים או שלוש מהממוצע. מה עושים עם ציון שנמצא 1.2 סטיות תקן מהממוצע? פעם היו פותחים טבלה בסוף ספר הסטטיסטיקה. היום פותחים אקסל.

דוגמה פתורה: אחוז מתחת לציון

ציוני שטף הקריאה מתפלגים נורמלית, עם ממוצע 100 וסטיית תקן 15. תלמיד קיבל 118. איזה אחוז מהתלמידים קוראים פחות טוב ממנו?

1. מציירים פעמון, מסמנים את 118 מימין לממוצע, וצובעים את כל מה שמשמאלו.
2. ציון תקן:   z = (118 − 100) / 15 = 18 / 15 = 1.2
3. השטח משמאל:   =NORM.S.DIST(1.2, TRUE) → 0.8849
או בצעד אחד:   =NORM.DIST(118, 100, 15, TRUE) → 0.8849

התשובה: כ־88.5% מהתלמידים מקבלים פחות מ־118. כלומר, התלמיד נמצא בערך באחוזוןPercentile ה־88. המילה TRUE פירושה "השטח המצטבר", כל מה שמשמאל לציון. (אפשר לכתוב גם 1 במקומה.)

שימו לב להבדל בין שתי הפונקציות. NORM.S.DIST, עם S, היא הנורמלית הסטנדרטית: היא מקבלת ציון תקן, ולכן צריך לחשב אותו קודם. NORM.DIST, בלי S, מקבלת את הציון עצמו, ואת הממוצע ואת סטיית התקן, ומחשבת את ציון התקן בעצמה. שתי הדרכים נותנות אותה תשובה.

מעל ציון, ובין שני ציונים

אקסל תמיד נותן את השטח משמאל. את כל השאר מחשבים ממנו:

דוגמה פתורה: מעל, ובין
מעל 118:   1 − 0.8849 = 0.1151 → 11.5% השלם, פחות השטח משמאל
בין 85 ל־118:   ציון התקן של 85: (85 − 100) / 15 = −1   →   =NORM.S.DIST(-1, TRUE) → 0.1587
0.88493 − 0.15866 = 0.72627 → 72.6% השטח משמאל לגבוה, פחות השטח משמאל לנמוך
באקסל, בשורה אחת:   =NORM.DIST(118,100,15,TRUE)-NORM.DIST(85,100,15,TRUE) → 0.7263

עצה: תמיד ציירו את העקומה וסמנו את השטח לפני החישוב. כך ברור אם צריך "השלם פחות", או "שטח פחות שטח". וגם קל לבדוק אם התשובה הגיונית: שטח צבוע קטן לא יכול להיות 80%.

סימטריה

השטח משמאל לציון תקן שלילי שווה לשטח מימיןUpper-tail area לציון התקן החיובי המקביל. למשל, =NORM.S.DIST(-1.2, TRUE) נותן 0.1151, בדיוק כמו השטח מעל 1.2. וגם: השטח משמאל לאפס הוא בדיוק 0.5, כי הממוצע הוא גם החציון.

דוגמה מהמחקר: התשובה לשאלת הפתיחה

בקשיבות, ציון התקן של תלמידה מספר 5 הוא 2.31. אם ההתפלגות נורמלית:

=NORM.S.DIST(2.31, TRUE) → 0.9896 98.96% צפויים לקבל פחות ממנה
1 − 0.9896 = 0.0104   →   0.0104 · 200 = 2.08 כשני תלמידים צפויים לקבל יותר

ובפועל? אף תלמיד. הציון שלה, 4.47, הוא הגבוה ביותר במדגם. התחזית לא רחוקה: "בערך 2" ו־0 הם שני מספרים קטנים מאוד, ובזנבות, כשמדובר בתלמידים בודדים, הסטיות מהתחזית גדולות יחסית. מה לגבי שטח גדול יותר? =NORM.DIST(2.5, 3.203, 0.5464, TRUE) נותן 0.0991, כלומר 9.9% מתחת ל־2.5. בפועל: 18 תלמידים, 9.0%. זה בדיוק ההבדל שראינו באיור של סעיף 1.

הסיפור המלא: טבלאות z הן היסטוריה

עד לפני שנים לא רבות, כל ספר סטטיסטיקה הסתיים בטבלה ארוכה: לכל ציון תקן, מ־0.00 עד 4.00, השטח שמשמאלו. לטבלה הזו בדיוק אנחנו חייבים את הרגל המעבר לציוני תקן. אילו לא היינו מתקננים, היינו צריכים טבלה נפרדת לכל ממוצע ולכל סטיית תקן אפשריים, כלומר אינסוף טבלאות. התקנון היה פשוט דרך לעבוד עם טבלה אחת.

לאקסל אין את הבעיה הזו. הוא מחשב את השטח, כלומר את האינטגרל, לכל ממוצע וכל סטיית תקן, בדיוק של הרבה ספרות. לכן בספר אין טבלת z. אם תפגשו טבלה כזו בספר אחר, היא נותנת את אותם מספרים בדיוק כמו NORM.S.DIST, רק בעיגול לארבע ספרות, ולפעמים את השטח בין 0 לציון התקן במקום משמאלו. ציון תקן עדיין שימושי מאוד, להשוואה ולהבנה (פרק 13), אבל לא כדי לחפש בטבלה.

ועוד הערה לגבי גרסאות: באקסל ישן הפונקציות נקראו NORMSDIST ו־NORMDIST. הן עדיין עובדות, אבל השמות החדשים, עם הנקודות, הם המומלצים. שימו לב שב־NORMSDIST הישנה אין ארגומנט TRUE, וב־NORM.S.DIST החדשה הוא חובה.

עצרו ונסו

שעות השינה של תלמידים בלילה מתפלגות נורמלית: ממוצע 9 שעות, סטיית תקן 0.75. השתמשו באקסל.   א. איזה אחוז ישנים פחות מ־8 שעות?   ב. איזה אחוז ישנים יותר מ־10 שעות?   ג. איזה אחוז ישנים בין 8.5 ל־10 שעות?

בדיקת התשובה
א. z = (8 − 9) / 0.75 = −1.33   →   =NORM.DIST(8, 9, 0.75, TRUE) → 0.0912 → 9.1%
ב. z = (10 − 9) / 0.75 = 1.33   →   =1-NORM.DIST(10, 9, 0.75, TRUE) → 0.0912 → 9.1%
ג. =NORM.DIST(10,9,0.75,TRUE)-NORM.DIST(8.5,9,0.75,TRUE) → 0.9088 − 0.2525 = 0.6563 → 65.6%

א ו־ב יצאו שווים בגלל הסימטריה: 8 ו־10 נמצאים באותו מרחק מהממוצע, משני הצדדים.

בדקו את עצמכם3 שאלות

1.מה תחזיר הנוסחה =NORM.DIST(110, 100, 15, TRUE)?

2.מה מחשבת הנוסחה =NORM.S.DIST(1.5, TRUE)-NORM.S.DIST(-1.5, TRUE)?

3.ציוני מבחן ארצי מתפלגים נורמלית, עם ממוצע 500 וסטיית תקן 100. איזה אחוז מהנבחנים קיבלו בין 450 ל־650? כתבו גם את הנוסחה באקסל.

מאחוז לציון

בכיוון ההפוך מחפשים ציון לפי אחוז. מתרגמים את השאלה ל"שטח משמאל", מוצאים את ציון התקן עם =NORM.S.INV(p), וחוזרים לציון: x = M + z · SD. או בצעד אחד: =NORM.INV(p, M, SD). ציוני תקן שכדאי להכיר: 1.28 (90% משמאל), 1.645 (95%), 1.96 (97.5%), 2.33 (99%).

עד עכשיו ידענו את הציון ושאלנו על האחוז. לפעמים יודעים את האחוז ושואלים על הציון. למשל: בית הספר רוצה לתת תגבור ל־10% התלמידים שקוראים הכי לאט. מאיזה ציון ומטה? זו בדיוק השאלה על האחוזון מפרק 13, אבל עכשיו נענה עליה בלי למיין, בהנחה שההתפלגות נורמלית.

דוגמה פתורה: מאחוז לציון

שטף הקריאה, שוב עם ממוצע 100 וסטיית תקן 15.

10% התחתונים: השטח משמאל הוא 0.10.
ציון התקן:   =NORM.S.INV(0.1) → −1.2816
הציון:   x = 100 + (−1.2816) · 15 = 100 − 19.22 = 80.78
או בצעד אחד:   =NORM.INV(0.1, 100, 15) → 80.78
5% העליונים, לתוכנית העשרה: 5% מימין פירושו 95% משמאל.   =NORM.INV(0.95, 100, 15) → 124.67

תלמידים שקיבלו פחות מ־80.78 יוזמנו לתגבור, ותלמידים שקיבלו יותר מ־124.67 לתוכנית ההעשרה. שימו לב לצעד בשאלה על 5% העליונים: הפונקציות ההפוכות, כמו הרגילות, עובדות תמיד עם השטח משמאל. "5% העליונים" צריך להפוך ל־0.95 לפני שמכניסים לפונקציה.

כמה ציוני תקן חוזרים שוב ושוב, וכדאי להכיר אותם. בפרקים 18 ו־19 הם יהפכו ל"ערכים קריטייםCritical value":

השטח משמאלציון התקןמה הוא אומרבאקסל
50%0הממוצע הוא גם החציון=NORM.S.INV(0.5)
84%1אחוזון 84 נמצא סטיית תקן אחת מעל הממוצע=NORM.S.DIST(1, TRUE)
90%1.2810% העליונים=NORM.S.INV(0.9)
95%1.6455% העליונים=NORM.S.INV(0.95)
97.5%1.9695% באמצע, 2.5% בכל זנב=NORM.S.INV(0.975)
99%2.331% העליונים=NORM.S.INV(0.99)

ובגלל הסימטריה, לשטחים הקטנים מ־50% ציוני התקן שליליים: לאחוזון ה־10, −1.28. לאחוזון ה־2.5, −1.96.

דוגמה מהמחקר: העקומה מול המיון

מאיזה ציון קשיבות מתחילים 10% העליונים? שתי דרכים:

לפי העקומה הנורמלית:   =NORM.INV(0.9, 3.203, 0.5464) → 3.90
לפי מיון הנתונים (פרק 13):   =PERCENTILE.INC(AH2:AH201, 0.9) → 3.87

הפרש של שלוש מאיות נקודה. כשההתפלגות נורמלית בקירוב, שתי הדרכים כמעט מסכימות. ההבדל ביניהן: האחוזון מתאר את 200 התלמידים האלה, והעקומה היא מודל, שאפשר להשתמש בו גם כשאין לנו את כל הנתונים, רק ממוצע וסטיית תקן מתוך מאמר.

מעבדה: שטחים מתחת לעקומה הנורמלית

מעבדה: שטחים מתחת לעקומה הנורמלית. בוחרים התפלגות וסוג שאלה: אחוז מתחת, מעל, בין שני ציונים, או מאחוז לציון. המעבדה צובעת את השטח ומראה את הנוסחה באקסל.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו "גובה" (ממוצע 170, סטיית תקן 8) ו"אחוז מתחת לציון", והזיזו את הציון ל־180. מה אחוז המקרים, ומה הנוסחה באקסל?
  2. עברו ל"אחוז בין שני ציונים", עם 162 ו־180. איך מחושב השטח?
  3. עברו ל"מאחוז לציון". מהו הגובה שמעליו נמצאים 5% הגבוהים ביותר? ולמה בנוסחה כתוב 0.95?
בדיקת התשובה

1. z = (180 − 170) / 8 = 1.25, והשטח משמאל 89.44%: =NORM.DIST(180, 170, 8, TRUE). 2. 162 הוא סטיית תקן אחת מתחת, והשטח משמאלו 0.1587. 0.8944 − 0.1587 = 0.7357, כלומר 73.57%. 3. 183.16 ס״מ. 5% מימין הם 95% משמאל, והפונקציה NORM.INV עובדת תמיד עם השטח משמאל.

עצרו ונסו

שוב שעות השינה: ממוצע 9, סטיית תקן 0.75.   א. מהו מספר שעות השינה שמתחתיו נמצאים 25% הישנים הכי מעט?   ב. בין אילו שני ערכים נמצאים 90% האמצעיים?

בדיקת התשובה
א. =NORM.INV(0.25, 9, 0.75) → 8.49 שעות זה הרבעון הראשון
ב. 90% באמצע משאירים 5% בכל זנב:   =NORM.INV(0.05, 9, 0.75) → 7.77   ו־   =NORM.INV(0.95, 9, 0.75) → 10.23
או דרך ציון התקן:   9 ± 1.645 · 0.75 = 9 ± 1.23
בדקו את עצמכם3 שאלות

1.מה תחזיר הנוסחה =NORM.INV(0.3, 50, 10)?

2.מחפשים את שני הציונים שביניהם נמצאים 80% האמצעיים של התפלגות נורמלית. אילו שטחים מכניסים ל־NORM.INV?

3.ציוני שטף הקריאה מתפלגים נורמלית, עם ממוצע 100 וסטיית תקן 15. מהו הרבעוןQuartile השלישי, כלומר האחוזון ה־75?

האם ההתפלגות נורמלית?

כל החישובים בפרק נכונים רק אם ההתפלגות נורמלית, ונתונים אמיתיים הם לכל היותר נורמליים בקירוב. בודקים בארבע דרכים: היסטוגרמה (פעמונית וסימטרית?), מדד ההטיה (קרוב לאפס?), האחוזים בפועל (קרובים ל־68 ול־95?), ותרשים Q-Q (הנקודות על הקו?). לא כל פעמון הוא נורמלי, ומעבר לציוני תקן לא הופך התפלגות לנורמלית.

ההתפלגות הנורמלית היא צורה מתמטית מסוימת מאוד. אף משתנה אמיתי אינו נורמלי בדיוק: לשאלון החרדה יש מינימום 1 ומקסימום 4, ולעקומה הנורמלית אין קצוות. השאלה המעשית היא אם הנתונים קרובים מספיק, כך שהשטחים לפי העקומה יהיו קרובים לאחוזים האמיתיים. ארבע בדיקות:

  1. היסטוגרמה. האם היא פעמונית וסימטרית, עם שיא אחד באמצע? מציירים עליה את העקומה הנורמלית עם אותו ממוצע ואותה סטיית תקן, כמו באיור של סעיף 1, ובודקים שהן דומות.
  2. מדד ההטיה. בפרק 12 הכרנו את SKEW. בהתפלגות נורמלית הוא 0. מדד חיובי פירושו זנב ימני ארוך, ושלילי, זנב שמאלי ארוך. כלל אצבע: מעל 1 או מתחת ל־−1, ההטיה ברורה. בקשיבות: −0.17, קרוב לאפס.
  3. האחוזים בפועל. סופרים כמה ערכים נמצאים עד סטיית תקן אחת ועד שתיים מהממוצע, ומשווים ל־68% ול־95%. בקשיבות: 70.5% ו־94%.
  4. תרשים Q-Q. הסבר בהמשך הסעיף.
דוגמה מהמחקר: מספר האחים

מספר האחים, siblings, בלי חמשת ערכי ה־99: n = 195, M = 2.33, SD = 1.51, ומדד ההטיה 0.63. זנב ימני: רוב התלמידים עם אח אחד עד שלושה, ומעטים עם שישה או שבעה. ומה העקומה הנורמלית אומרת?

=NORM.DIST(-0.5, 2.33, 1.51, TRUE) → 0.030   →   0.030 · 195 = 5.9

−0.5 הוא הגבול האמיתי בין 0 ל־−1 (פרק 9). כלומר, העקומה "צופה" שכ־6 תלמידים יהיו עם מינוס אח אחד, או פחות. זה כמובן בלתי אפשרי. העקומה לא יודעת שמספר אחים לא יכול להיות שלילי.

020406017465437231242−3−2−1012345678פחות מאפס אחיםמספר האחים, בלי ערכי 99שכיחות
מספר האחים (n = 195) ועליו העקומה הנורמלית עם אותו ממוצע ואותה סטיית תקן. השטח האדום, משמאל ל־−0.5, הוא כ־3% מהעקומה: תלמידים "עם פחות מאפס אחים".

ועכשיו משהו מפתיע. במספר האחים, 70.3% מהתלמידים נמצאים עד סטיית תקן אחת מהממוצע, ו־96.9% עד שתיים. כמעט בדיוק לפי הכלל! כלומר, האחוזים לבדם יכולים להיראות "נורמליים" גם כשההתפלגות מוטה ובדידה. לכן לא מסתפקים בבדיקה אחת. מסתכלים על התמונה, על מדד ההטיה, ועל האחוזים, יחד.

תרשים Q-Q

הבדיקה הרגישה ביותר מהארבע היא תרשים. מסדרים את הערכים מהקטן לגדול, והופכים כל אחד לציון תקן. לכל ערך שואלים: איזה ציון תקן היינו מצפים לו במקום הזה ברשימה, אילו ההתפלגות הייתה נורמלית? למשל, הערך הקטן ביותר מתוך 200 צפוי להיות סביב ציון תקן −2.7, והערך שבאמצע הרשימה צפוי להיות סביב 0. ואז מציירים נקודה לכל ערך: ציון התקן הצפוי על הציר האופקי, וציון התקן בפועל על הציר האנכי. זה תרשים Q-Q (Quantile-Quantile, אחוזון מול אחוזון).

אם ההתפלגות נורמלית, הצפוי ובפועל שווים בערך, וכל הנקודות יושבות על הקו האלכסוני. כל סטייה שיטתית מהקו היא סימן: נקודות שמתעקמות מעל הקו בקצה הימני הן זנב ימני ארוך. "מדרגות" אופקיות הן משתנה עם מעט ערכים אפשריים.

−2−20022קשיבותציון תקן צפוי (נורמלית)ציון תקן בפועל−2−20022מספר אחיםציון תקן צפוי (נורמלית)ציון תקן בפועל
תרשימי Q-Q. מימין, הקשיבות: הנקודות יושבות על הקו, נורמלית בקירוב. משמאל, מספר האחים: מדרגות (רק 8 ערכים אפשריים), נקודות מעל הקו בשני הקצוות (זנב ימני ארוך, וזנב שמאלי "חתוך" ב־0).

לא כל פעמון הוא נורמלי

עוד מלכודת: התפלגות יכולה להיות סימטרית ופעמונית, עם מדד הטיה 0, ועדיין לא נורמלית. למשל, פעמון עם זנבות עבים יותר: יותר ערכים קיצונייםOutlier, ויותר ערכים צמודים למרכז, ופחות "בכתפיים". בהתפלגות כזו, אחוז הערכים עד סטיית תקן אחת יכול להיות 77% ולא 68%, וכל חישוב לפי העקומה הנורמלית יטעה. את עובי הזנבות מודד מדד הגבנוניותKurtosis, שהכרנו בפרק 12. ובקצה השני, בהתפלגות שטוחה לגמרי, שבה כל הערכים שכיחים באותה מידה, רק 57.7% נמצאים עד סטיית תקן אחת.

ציוני תקן לא מתקנים

האם אפשר "לתקן" התפלגות לא נורמלית על ידי מעבר לציוני תקן? לא. בפרק 13 ראינו שציון תקן משנה רק את הממוצע ואת סטיית התקן. הצורה נשארת. הגמל נשאר גמל, עם שתי דבשות, רק עם ממוצע 0 וסטיית תקן 1. ולכן גם לא כל ציון תקן מתפלג לפי הנורמלית הסטנדרטית: רק ציוני תקן של משתנה שהוא עצמו נורמלי.

הסיפור המלא: מבחנים לנורמליות

יש גם מבחנים סטטיסטיים שבודקים אם ההתפלגות שונה מנורמלית. המוכרים ביותר הם מבחן Shapiro-Wilk ומבחן Kolmogorov-Smirnov, שפגשנו בפרק 12. מה זה בדיוק ערך pp-value נלמד בפרק 18. כאן נחזור על שתי הערות. ראשונה: הם בנויים הפוך מרוב המבחנים. השערת האפסNull hypothesis שלהם היא "ההתפלגות נורמלית", ולכן אנחנו בדרך כלל מקווים לא לדחות אותה. שנייה: במדגם גדול הם מגלים גם סטיות זעירות וחסרות חשיבות, ובמדגם קטן הם מפספסים גם סטיות גדולות. לכן חוקרים מנוסים תמיד מסתכלים גם על התרשימים. ובפרק 17 נגלה עוד דבר חשוב: רוב המבחנים בספר לא דורשים שהמשתנה עצמו יהיה נורמלי, אלא שהתפלגות הממוצעים תהיה נורמלית. וזה כמעט תמיד מתקיים כשהמדגם גדול מספיק.

מעבדה: האם ההתפלגות נורמלית?

מעבדה: האם ההתפלגות נורמלית? שלושה משתנים, 150 נבדקים בכל אחד. לכל אחד: היסטוגרמה, ועליה העקומה הנורמלית, מדד ההטיה, והאחוזים בפועל עד סטיית תקן אחת ושתיים.פתיחה בחלון נפרד
משימות למעבדה
  1. בחרו "לחץ דם". האם ההיסטוגרמה קרובה לעקומה? מה מדד ההטיה, ומה האחוזים בפועל?
  2. בחרו "חשבון טלפון". לאיזה כיוון הזנב, והאם הסימן של מדד ההטיה מתאים? ועכשיו הסתכלו על האחוזים בפועל. מה מפתיע?
  3. בחרו "מבחן קל". למה דווקא במבחן קל הזנב הארוך נמצא בצד של הציונים הנמוכים?
בדיקת התשובה

1. כן. מדד ההטיה −0.25, קרוב לאפס, והאחוזים 69.33% ו־94%, קרובים ל־68 ול־95. נורמלי בקירוב. 2. זנב ימני ארוך: מעט אנשים עם חשבונות גבוהים מאוד, ומדד ההטיה 1.09, חיובי וגדול מ־1. המפתיע: האחוזים, 72.67% ו־96%, לא רחוקים מהכלל. בדיוק כמו במספר האחים, האחוזים לבדם לא מספיקים. 3. רוב הנבחנים מקבלים ציונים גבוהים, ואי אפשר לעבור את 100. מעטים נכשלים, והם יוצרים זנב שמאלי: מדד ההטיה −1.11. (הערה: סטיית התקן שהמעבדה מציגה מחושבת עם חלוקה ב־n. עם n − 1, כמו בספר, ההבדל ב־150 נבדקים זניח: 10.75 לעומת 10.79 בלחץ הדם.)

עצרו ונסו

לכל אחד מהמשתנים, האם סביר שהוא נורמלי בקירוב?   א. גובה של בנות בכיתה ו׳   ב. מספר הפעמים שתלמיד איחר השנה   ג. ציון במבחן שבו רוב הכיתה קיבלה 95 עד 100   ד. ציון בשאלון ארוך של 40 פריטים, בקבוצה גדולה

בדיקת התשובה

א. כן, סביר: גובה הוא דוגמה קלאסית לסכום של הרבה גורמים קטנים. ב. לא: ספירה של אירועים נדירים, לרוב 0, 1 או 2, ומעטים עם הרבה איחורים. זנב ימני ארוך, כמו מספר האחים. ג. לא: "תקרה" ב־100, וזנב שמאלי של מעטים שנכשלו. ד. כנראה כן: ציון של הרבה פריטים הוא סכום של הרבה גורמים. אבל תמיד בודקים בנתונים עצמם.

בדקו את עצמכם3 שאלות

1.איזה מהמשתנים הבאים הכי פחות סביר שיתפלג נורמלית?

2.בתרשים Q-Q של משתנה, הנקודות יוצרות "מדרגות" אופקיות לאורך הקו. מה הסיבה הסבירה?

3.חבר כתב: "בחרדה, 68.5% מהתלמידים עד סטיית תקן אחת ו־97.5% עד שתיים. לכן ההתפלגות נורמלית, בוודאות." מה הייתם עונים לו?

בתוכנה: שטחים ובדיקת נורמליות

בכל התוכנות נשתמש בקשיבות לפני התוכנית, mind_pre. נחשב שטחים לפי העקומה, נשווה לנתונים, ונבדוק אם ההתפלגות נורמלית בקירוב.

ארבע פונקציות, ושתי שאלות שצריך לשאול: האם אני הולך מציון לשטח או משטח לציון? והאם יש לי ציון תקן, או ציון רגיל עם ממוצע וסטיית תקן?

הפונקציהמקבלתמחזירה
NORM.S.DIST(z, TRUE)ציון תקןהשטח משמאל
NORM.DIST(x, M, SD, TRUE)ציון, ממוצע, סטיית תקןהשטח משמאל
NORM.S.INV(p)שטח משמאלציון תקן
NORM.INV(p, M, SD)שטח משמאל, ממוצע, סטיית תקןציון

בקובץ המחקר, mind_pre בעמודה AH. את הממוצע שמים בתא AH202 ואת סטיית התקן בתא AH203, כמו בפרק 13:

mind_pre (AH2:AH201)

FormulaResult
AH202 (mean)=AVERAGE(AH2:AH201)3.2030
AH203 (SD)=STDEV.S(AH2:AH201)0.5464
Skewness=SKEW(AH2:AH201)-0.17
Normal: below 2.5=NORM.DIST(2.5, AH202, AH203, TRUE)0.0991
Actual: below 2.5=COUNTIF(AH2:AH201, "<2.5")/2000.09
Normal: 90th percentile=NORM.INV(0.9, AH202, AH203)3.9033
Actual: 90th percentile=PERCENTILE.INC(AH2:AH201, 0.9)3.8667
Actual: within 1 SD=COUNTIFS(AH2:AH201, ">="&AH202-AH203, AH2:AH201, "<="&AH202+AH203)/2000.705
Normal: within 1 SD=NORM.S.DIST(1, TRUE)-NORM.S.DIST(-1, TRUE)0.6827
-0.17
מדד ההטיה קרוב לאפס: אין הטיה ברורה.
0.0991 מול 0.09
העקומה צופה 9.9% מתחת ל־2.5, ובפועל 9%. כך משווים מודל לנתונים: אותה שאלה, פעם עם NORM.DIST ופעם עם COUNTIF.
0.705
70.5% מהתלמידים עד סטיית תקן אחת מהממוצע, לעומת 68.27% בעקומה. ב־COUNTIFS יש שני תנאים: גדול או שווה לגבול התחתון, וקטן או שווה לעליון. הסימן & מצרף את התנאי לתוצאה של חישוב. החליפו את AH203 ב־2*AH203 כדי לבדוק שתי סטיות תקן.

טעות נפוצה: לכתוב FALSE במקום TRUE. עם FALSE מקבלים את הגובה של העקומה בנקודה, ולא את השטח. למשל, =NORM.S.DIST(0, FALSE) מחזיר 0.3989, ולא 0.5. בספר תמיד TRUE.

היסטוגרמה: בוחרים את העמודה, Insert > Charts > Histogram, כמו בפרק 9. לאקסל אין כפתור שמוסיף עליה את העקומה הנורמלית, ואין בו תרשים Q-Q מוכן. את שניהם קל יותר לקבל ב־SPSS וב־JASP.

היסטוגרמה עם עקומה נורמלית: Analyze > Descriptive Statistics > Frequencies. מעבירים את mind_pre, מורידים את הסימון מ־Display frequency tables, ובכפתור Charts בוחרים Histograms ומסמנים Show normal curve on histogram. ליד הגרף SPSS כותב את הממוצע, את סטיית התקן ואת N.

תרשים Q-Q ומדדי צורה: Analyze > Descriptive Statistics > Explore. מעבירים את mind_pre ל־Dependent List, ובכפתור Plots מסמנים Normality plots with tests. בפלט: טבלת Descriptives, טבלת Tests of Normality (פגשנו אותה בפרק 12), ותרשים Normal Q-Q Plot. ב־SPSS הציר האופקי של התרשים הוא הערך עצמו, והאנכי הוא הערך הצפוי בנורמלית. הקריאה זהה: נקודות על הקו.

Descriptives (חלק מהטבלה)

StatisticStd. Error
mind_preMean3.2030.03864
Median3.2000
Std. Deviation.54642
Minimum1.73
Maximum4.47
Skewness-.166.172
Kurtosis-.151.342
Mean, Median
3.20 ו־3.20: כמעט שווים, כמו שמצפים בהתפלגות סימטריתSymmetric distribution.
Skewness, Kurtosis
שניהם קרובים לאפס. איך משתמשים בעמודת Std. Error כדי להחליט אם הם "רחוקים מאפס", ראינו בפרק 12.

שטחים: ל־SPSS אין חלון לחישוב שטח בודד, אבל אפשר לחשב בעמודה חדשה: Transform > Compute Variable. בקבוצת הפונקציות CDF & Noncentral CDF יש CDF.NORMAL(x, mean, sd), שמחזירה את השטח משמאל, כמו NORM.DIST. ובקבוצה Inverse DF יש IDF.NORMAL(p, mean, sd), כמו NORM.INV. למשל CDF.NORMAL(2.5, 3.203, 0.5464) נותן .0991. בפועל, לחישוב בודד נוח יותר אקסל.

Descriptives > Descriptive Statistics. מעבירים את mind_pre ל־Variables. תחת Statistics, באזור Distribution, מסמנים Skewness ו־Kurtosis. תחת Basic plots מסמנים Distribution plots, כדי לקבל היסטוגרמה, ו־Q-Q plots.

Descriptive Statistics

mind_pre
Valid200
Mean3.203
Std. Deviation0.546
Skewness-0.166
Std. Error of Skewness0.172
Kurtosis-0.151
Std. Error of Kurtosis0.342
Minimum1.733
Maximum4.467
Skewness, Kurtosis
אותם מספרים כמו ב־SPSS, בעיגול לשלוש ספרות.
Q-Q plot
ב־JASP הציר האופקי הוא Theoretical quantiles, ציוני התקן הצפויים, והאנכי הוא הערכים בפועל, בציוני תקן, בדיוק כמו באיור בסעיף 6. בקשיבות, הנקודות על הקו.

שטחים: ב־JASP יש מודול בשם Distributions, שמוסיפים דרך כפתור ה־+ בסרגל המודולים. בוחרים בו Normal, קובעים ממוצע וסטיית תקן, ומבקשים את ההסתברות מתחת לערך, מעליו או בין שני ערכים. JASP מצייר את העקומה וצובע את השטח, כמו המעבדות בפרק.

בדקו את עצמכם3 שאלות

1.בתא B1 הממוצע ובתא B2 סטיית התקן של משתנה נורמלי. איזו נוסחה נותנת את הציון שמעליו נמצאים 10% העליונים?

1.ממוצע 100 וסטיית תקן 15. איזה ביטוי ב־Transform > Compute Variable של SPSS נותן את הציון שמעליו נמצאים 10% העליונים?

1.ממוצע 100 וסטיית תקן 15. בעמודה מחושבת של JASP כותבים בקוד R. איזה ביטוי נותן את הציון שמעליו נמצאים 10% העליונים?

2.גובה העקומה הנורמלית הסטנדרטית בנקודה 0 הוא 0.3989. למה זה לא 0.5, השטח משמאל ל־0?

3.איך מקבלים באקסל תרשים Q-Q של משתנה?

3.איפה ב־SPSS מקבלים תרשים Q-Q של משתנה?

3.איפה ב־JASP מקבלים תרשים Q-Q של משתנה?

טעויות נפוצות

בדקו את עצמכם

סיכום

מונחים חדשים

הסתברותשטח מתחת לעקומההתפלגות נורמליתהתפלגות נורמלית סטנדרטיתכלל 68־95־99.7אי־שוויון צ׳בישבשטח משמאלשטח מימיןשטח בין שני ציוניםנורמליות בקירובתרשים Q-QNORM.S.DISTNORM.DISTNORM.S.INVNORM.INV

שאלות לדוגמה, עם פתרונות

שאלות בסגנון מבחן, מהקלה אל הקשה. נסו לפתור לבד, ורק אז פתחו את הפתרון.

  1. ציוני מבחן מתפלגים נורמלית, עם ממוצע 100 וסטיית תקן 15. בלי מחשבון:   א. איזה אחוז מהנבחנים קיבלו בין 70 ל־130?   ב. איזה אחוז קיבלו יותר מ־115?   ג. איזה אחוז קיבלו בין 85 ל־130?

    בדיקת התשובה
    א. 70 ו־130 הן שתי סטיות תקן מכל צד → 95%
    ב. 115 היא סטיית תקן אחת מעל: (100% − 68%) / 2 = 16%
    ג. מ־85 עד 100: 34%. מ־100 עד 130: 47.5%. יחד: 81.5%
  2. ציוני מבחן במתמטיקה בשכבה מתפלגים נורמלית: ממוצע 72, סטיית תקן 9.   א. איזה אחוז מהתלמידים קיבלו פחות מ־60?   ב. איזה אחוז קיבלו בין 65 ל־85? כתבו את הנוסחאות באקסל.

    בדיקת התשובה
    א. z = (60 − 72) / 9 = −1.33   →   =NORM.DIST(60, 72, 9, TRUE) → 0.0912 → 9.1%
    ב. =NORM.DIST(85, 72, 9, TRUE) → 0.9257    =NORM.DIST(65, 72, 9, TRUE) → 0.2184
    0.9257 − 0.2184 = 0.7073 → 70.7% שטח פחות שטח
  3. באותה שכבה (ממוצע 72, סטיית תקן 9), 15% התלמידים עם הציונים הגבוהים ביותר יקבלו תעודת הצטיינות, ו־20% עם הנמוכים ביותר יוזמנו לתגבור. מהם שני ציוני הסף? פתרו דרך ציון התקן, ובדקו עם NORM.INV.

    בדיקת התשובה
    הצטיינות: 15% מימין = 85% משמאל.   =NORM.S.INV(0.85) → 1.0364
    x = 72 + 1.0364 · 9 = 81.33    בדיקה: =NORM.INV(0.85, 72, 9) → 81.33
    תגבור: 20% משמאל.   =NORM.S.INV(0.2) → −0.8416
    x = 72 + (−0.8416) · 9 = 64.43    בדיקה: =NORM.INV(0.2, 72, 9) → 64.43
  4. קראו את הפלט של JASP, לשני משתנים מקובץ המחקר: ההרגשה בכיתה (clim_pre) ומספר האחים (siblings, אחרי שערכי ה־99 הוגדרו כחסרים).

    Descriptive Statistics

    clim_presiblings
    Valid200195
    Missing05
    Mean3.4732.333
    Std. Deviation0.6511.512
    Skewness-0.0550.631
    Kurtosis0.4180.122
    Minimum1.5830.000
    Maximum5.0007.000

    א. לאיזה משתנה מתאים יותר לחשב שטחים לפי העקומה הנורמלית? נמקו בשני נימוקים מהטבלה.   ב. לפי העקומה, איזה אחוז מהתלמידים צפויים לקבל יותר מ־4.5 בהרגשה בכיתה? כמה תלמידים זה? (בפועל: 11.)   ג. במספר האחים, כמה סטיות תקן מתחת לממוצע נמצא הערך 0, ומה הבעיה בזה?

    בדיקת התשובה

    א. להרגשה בכיתה. מדד ההטיה שלה כמעט אפס, לעומת 0.631 במספר האחים. ומספר האחים הוא ספירה עם 8 ערכים אפשריים בלבד, ובלי ערכים שליליים.

    ב. =1-NORM.DIST(4.5, 3.473, 0.651, TRUE) → 0.0573   →   0.0573 · 200 = 11.5 תלמידים
    ג. z = (0 − 2.333) / 1.512 = −1.54

    ב. התחזית, כ־11 או 12 תלמידים, קרובה מאוד ל־11 בפועל. ג. הערך הנמוך ביותר האפשרי נמצא רק 1.54 סטיות תקן מתחת לממוצע. בהתפלגות נורמלית, כ־6% מהשטח נמצא עוד יותר שמאלה, כלומר בערכים שליליים, שאינם קיימים במספר אחים. זו עוד סיבה לא להשתמש כאן בעקומה.

  5. על משתנה מסוים ידוע רק שהממוצע שלו 50 וסטיית התקן 10. צורת ההתפלגות לא ידועה.   א. מה אפשר לומר על אחוז הערכים בין 30 ל־70?   ב. מה אפשר לומר על אחוז הערכים מעל 80?   ג. איך היו משתנות התשובות, אילו היה ידוע שההתפלגות נורמלית?

    בדיקת התשובה
    א. 30 ו־70 הן שתי סטיות תקן מכל צד. צ׳בישב: 1 − 1/2² = 0.75 → לפחות 75%
    ב. 80 הוא שלוש סטיות תקן מעל. מחוץ לשלוש סטיות תקן, בשני הצדדים יחד: לכל היותר 1/3² = 11.1%
    ג. בנורמלית: בין 30 ל־70 כ־95%, ומעל 80 כ־0.15% בלבד

    שימו לב לסעיף ב: התשובה היא "לכל היותר 11.1%", ולא חצי מזה. צ׳בישב לא מניח סימטריה, ולכן ייתכן שכל הערכים הרחוקים נמצאים בצד אחד. כשלא יודעים את הצורה, מקבלים רק גבולות. כשיודעים שהיא נורמלית, מקבלים מספרים מדויקים.

  6. ציונים מתפלגים נורמלית. 16% מהנבחנים קיבלו פחות מ־88, ו־2.5% קיבלו יותר מ־136. השתמשו בכלל 68־95־99.7 כדי למצוא את הממוצע ואת סטיית התקן.

    בדיקת התשובה

    לפי הכלל, 16% נמצאים מתחת לסטיית תקן אחת מתחת לממוצע, ו־2.5% מעל שתי סטיות תקן מעליו. כלומר:

    M − SD = 88    וגם    M + 2 · SD = 136
    מחסירים: 3 · SD = 136 − 88 = 48   →   SD = 16
    M = 88 + 16 = 104    בדיקה: 104 + 2 · 16 = 136 ✓

תרגול עם הנתונים

פתחו את קובץ המחקר ואת מילון המשתנים.

הקבצים עצמם נמצאים גם בתיקיית data בחבילת הספר.

  1. בחרדה לפני התוכנית (anx_pre, עמודה AI): כמה תלמידים נמצאים עד סטיית תקן אחת מהממוצע, וכמה עד שתיים? השוו לכלל.
    בדיקת התשובה

    עד סטיית תקן אחת: 137 תלמידים, 68.5%. עד שתיים: 195, 97.5%. הראשון כמעט בדיוק לפי הכלל, והשני קצת גבוה מ־95%: מעט מדי תלמידים בזנבות, כי לשאלון יש תקרה של 4 ורצפה של 1. באקסל: COUNTIFS עם הגבולות M ± SD ו־M ± 2SD, כמו בקטע "בתוכנה".

  2. בשביעות הרצון (sat_pre): לפי העקומה הנורמלית, עם הממוצע וסטיית התקן של הנתונים, איזה אחוז צפוי לקבל יותר מ־6.5? וכמה קיבלו בפועל?
    בדיקת התשובה

    =1-NORM.DIST(6.5, 5.064, 1.0031, TRUE) נותן 0.0761, כלומר 7.6%, כ־15 תלמידים. בפועל 18 תלמידים, 9%. קרוב, אבל העקומה מעריכה קצת בחסר. (את 18 התלמידים בפועל פגשנו בתרגיל "עצרו ונסו" של סעיף 1.)

  3. בבעיות קשב (attn_pre): מאיזה ציון מתחילים 5% התלמידים עם הכי הרבה בעיות קשב? חשבו לפי העקומה ולפי הנתונים.
    בדיקת התשובה

    לפי העקומה: =NORM.INV(0.95, 2.4805, 0.7145) נותן 3.66. לפי הנתונים: =PERCENTILE.INC(AJ2:AJ201, 0.95) נותן 3.73. בקצוות ההבדל בין המודל לנתונים גדול יותר מאשר באמצע.

  4. בקשיבות, ציון התקן של תלמיד מספר 1 הוא −2.32 (פרק 13). לפי העקומה, איזה אחוז מהתלמידים צפויים לקבל פחות ממנו? ומה הדירוג האחוזוני שלו בפועל?
    בדיקת התשובה

    =NORM.S.DIST(-2.32, TRUE) נותן 0.0102, כלומר כ־1%, כשניים מתוך 200. בפועל, רק תלמיד אחד קיבל פחות ממנו: 1 / 199 = 0.5%. שוב, בזנבות מדובר בתלמידים בודדים.

  5. חשבו את מדד ההטיה של מספר האחים (siblings, עמודה I) פעמיים: עם ערכי ה־99 ובלעדיהם. מה למדתם?
    בדיקת התשובה

    בלי ערכי ה־99: 0.63, זנב ימני מתון. עם ערכי ה־99, אקסל חושב שחמישה תלמידים עם 99 אחים, ומדד ההטיה מזנק ל־6.04. ערכים חסריםMissing value שלא סומנו כחסרים הורסים גם את בדיקת הנורמליות. לפני כל בדיקה, מנקים את הקודים (פרק 8).

בפרק הבא: מתאםCorrelation. עד עכשיו תיארנו כל משתנה לבדו. עכשיו נשאל איך שני משתנים "הולכים יחד", ונגלה שמתאם פירסוןPearson correlation coefficient הוא בעצם ממוצע של מכפלות ציוני תקן. כל מה שלמדנו על ציוני תקן ישמש אותנו שם.

מקורות: Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y