חלק ג: מהמדגם לאוכלוסייה · פרק 25
איזה מבחן? מפת דרכים ראשונה
בכל פרק עד עכשיו למדנו מבחן אחד, והכותרת של הפרק כבר אמרה לכם במה להשתמש. במחקר אמיתי אין כותרת: יש קובץ נתונים ויש שאלה. בפרק הזה נאסוף את כל מה שלמדנו לעץ החלטהDecision tree אחד, ונתרגל את הצעד שקודם לכל חישוב: לבחור את המבחן הנכון.
קיבלתם את קובץ המחקר ושש שאלות מהמנהלת. איך יודעים איזה מבחן מתאים לכל אחת?
האם בנות לחוצות יותר מבנים כשהמורה שואלת אותן שאלה? האם בתוכנית המשולבת יותר תלמידים התנדבו לעזור? האם תלמידים קשובים יותר מרוצים יותר מהחיים? האם הקשר עם המורה השתפר בתוכנית העקיפה? האם החרדה של התלמידים שלנו שונה מאמצע הסולם? והאם השינוי בחרדה שונה בשלוש הקבוצות? שש שאלות על אותו מחקר, וכמעט לכל אחת מבחן אחר. בסוף הפרק תדעו לבחור את המבחן לכל אחת, ולהסביר למה.
בסוף הפרק תוכלו
- לזהות בשאלת מחקרResearch question את המשתנה התלוי, את סולם המדידה שלו ואת מבנה הנתונים.
- לעבור על עץ ההחלטה ולהגיע למבחן המתאים מבין המבחנים של פרקים 13 עד 24.
- לבדוק את ההנחות של המבחן שבחרתם, ולדעת לאן עוברים כשהן לא מתקיימות.
- לזהות שאלות שדורשות כלים של חלק ד: שלוש קבוצות ויותר, או כמה מנבאיםPredictor.
שלוש שאלות לפני שבוחרים מבחן
לפני כל ניתוח שואלים שלוש שאלות. מה שואלים: הבדל או קשר? באיזה סולם נמדד המשתנה התלוי: שמי, סדר, או רווח ומנה? ומה מבנה הנתונים: כמה קבוצות או מדידות, והאם אותם אנשים נמדדו יותר מפעם אחת? רק בסוף בודקים את ההנחות של המבחן שנבחר.
המטרה של הפרק הזה היא לא שתזכרו בעל פה עשרה מבחנים. המטרה היא שתהיה לכם מפה. מבחן זוכרים באמת רק אחרי שמשתמשים בו פעמיים או שלוש במחקר משלכם, בעבודה סמינריונית או בתזה. עד אז, מספיק לדעת איפה הוא נמצא במפה, ולחזור אליו כשצריך.
המפה בנויה על שלוש שאלות, תמיד באותו סדר.
1. מה שואלים: הבדל או קשר?
כמעט כל שאלה בסטטיסטיקה שייכת לאחת משתי משפחות. שאלת הבדל: האם קבוצה שונה מערך ידוע, האם שתי קבוצות שונות זו מזו, או האם אותם אנשים השתנו בין שתי מדידות. שאלת קשר: האם שני משתנים "הולכים יחד", כמו קשיבות ושביעות רצון.
כדי לענות, מזהים קודם את המשתנה התלוי: מה מדדנו, מה התוצאה (פרק 5). בשאלת הבדל יש גם משתנה שמחלק לקבוצות, כמו מגדר או קבוצת מחקר, או משתנה של זמן, לפני ואחרי.
2. באיזה סולם נמדד המשתנה התלוי?
בפרק 6 הכרנו ארבעה סולמות: שמי, סדר, רווח ומנה. מבחינה סטטיסטית אין הבדל בין רווח למנה, ולכן נשארות שלוש משפחות. הסולם קובע מה מותר לחשב:
- רווח או מנה: מותר לחשב ממוצע () וסטיית תקן (). מכאן מבחני zz test ו־t ומתאם פירסוןPearson correlation coefficient. ציון שאלון שהוא ממוצע של כמה פריטים, כמו
anx_pre, מטופל בספר כסולם רווחInterval scale. - סדר: יש סדר, אבל המרווחים לא בהכרח שווים. עובדים עם דירוגים: מבחני וילקוקסון ומאן־ויטני, ומתאם ספירמןSpearman correlation. פריט בודד בשאלון, כמו "אף פעם, לפעמים, לעיתים קרובות, תמיד", הוא סולם סדרOrdinal scale.
- שמי: קטגוריות בלי סדר. אפשר רק לספור כמה יש בכל קטגוריה: מבחני חי בריבועChi-square test of independence.
3. מה מבנה הנתונים?
כמה קבוצות או מדידות יש? קבוצה אחת מול ערך ידוע, שתיים, או שלוש ויותר? אם יש שתיים: האם אלה אותם אנשים, או זוגות טבעיים, או קבוצות של אנשים שונים (פרק 21)? ואם משווים קבוצה אחת לערך ידוע: האם סטיית התקן באוכלוסייה, σ, ידועה?
אחרי שלוש השאלות כבר יש מבחן מועמד. רק אז שואלים שאלה רביעית: האם ההנחות שלו מתקיימות? אם לא, עוברים לחלופה. נחזור לזה בסעיף 5.
כדי לראות כמה השאלה, ולא המשתנה, קובעת את המבחן, הנה המשתנה הכי מוכר שלנו, החרדה, בשש שאלות שונות:
| השאלה | הבדל או קשר | סולם ומבנה | המבחן |
|---|---|---|---|
| האם החרדה של 200 התלמידים שונה מ־2.5, אמצע הסולם? | הבדל | רווח · קבוצה אחת מול ערך, σ לא ידועה | t למדגם בודד (פרק 20) |
| האם בנות חרדות יותר מבנים? | הבדל | רווח · שתי קבוצות בלתי תלויותIndependent samples | t למדגמים בלתי תלויים (פרק 21) |
| האם החרדה ירדה בתוכנית העקיפה? | הבדל | רווח · אותם תלמידים פעמיים | t למדגמים תלויים (פרק 21)Dependent samples |
| האם בנות לחוצות יותר מבנים, לפי הפריט הבודד "אני לחוץ/ה כשהמורה שואלת אותי שאלה" (1 עד 4)? | הבדל | סדר (פריט בודד) · שתי קבוצות בלתי תלויות | מאן־ויטני (פרק 22) |
| האם תלמידים חרדים יותר קשובים פחות? | קשר | שני משתנים בסולם רווח | מתאם פירסון (פרקים 15 ו־24) |
| האם השינוי בחרדה שונה בשלוש הקבוצות? | הבדל | רווח · שלוש קבוצות | ניתוח שונות (פרק 26)One-way ANOVA |
אותו משתנה, שישה מבחנים שונים. המבחן נקבע לפי השאלה ולפי מבנה הנתונים, ולא לפי שם המשתנה.
השאלה "האם בנים מעשנים יותר מבנות?" נשמעת כמו שאלת הבדל. אבל אפשר לנסח אותה גם כך: "האם יש קשר בין מגדר לעישון?". וכך גם "האם בנות חרדות יותר מבנים?" היא בעצם שאלה על הקשר בין מגדר לחרדה. כלומר, שאלת הקשר כללית יותר, והיא מכילה בתוכה את שאלת ההבדל. מכאן נובע משהו מפתיע, שנראה בחלק ד: כל המבחנים של משפחת ההבדלים, כולל מבחן t וניתוח שונות, הם מקרים פרטיים של רגרסיה, שהיא הכלי של משפחת הקשרים (פרק 30).
ועוד עיקרון שכדאי לזכור מפרק 6: את הסולם קובעת המדידה, לא התכונה. לחץ אפשר למדוד ב"כן או לא" (שמי), בדירוג 1 עד 5 (סדר), או ברמת הקורטיזול ברוק (מנה). ותמיד אפשר לרדת בסולם, למשל להפוך ציון לקבוצות "גבוה" ו"נמוך", אבל אף פעם לא לעלות. לכן כדאי לתכנן את המדידה בסולם הגבוה ביותר שאפשר: בירידה בסולם מאבדים מידע ועוצמה.
לכל שאלה, ענו על שלוש השאלות: הבדל או קשר? איזה משתנה תלויDependent variable ובאיזה סולם? ומה מבנה הנתונים?
- האם ההרגשה בכיתה (
clim_post) של תלמידי כיתה ד׳ שונה מזו של תלמידי כיתה ה׳? - האם יש קשר בין מספר האחים (
siblings) לבין החרדה לפני התוכנית?
בדיקת התשובה
1. הבדל. המשתנה התלוי הוא ההרגשה בכיתה, ממוצע של 12 פריטים: סולם רווחInterval scale. השכבה מחלקת לשתי קבוצות של ילדים שונים: בלתי תלויות. המועמד: מבחן t למדגמים בלתי תלוייםIndependent-samples t test.
2. קשר. שני המשתנים כמותייםQuantitative variable: מספר אחים הוא סולם מנהRatio scale, והחרדה סולם רווח. המועמד: מתאם פירסוןPearson correlation coefficient. אבל זהירות: ב־siblings הערך 99 מסמן נתון חסרMissing value, וצריך להגדיר אותו כחסר לפני החישוב. ואם יש כמה משפחות גדולות במיוחד, שהן ערכים קיצונייםOutlier, כדאי לשקול ספירמן.
בדקו את עצמכם4 שאלות
1.בשאלה "האם תלמידים שישנים יותר שעות מקבלים ציונים גבוהים יותר במבחן?", מה המשתנה התלוי?
2.פריט בודד בשאלון: "כמה את/ה נהנה/ית בבית הספר?", מ־1 (בכלל לא) עד 5 (מאוד). באיזה סולם הוא נמדד?
3.האם יש הבדל בין סולם רווח לסולם מנה, כשבוחרים מבחן?
4.מורה אומרת: "החרדה היא משתנה כמותי, ולכן תמיד בודקים אותה במבחן t". מה תענו לה?
עץ ההחלטה
העץ מתחיל בשאלה "הבדל או קשר?". בענף ההבדלים שואלים על הסולם, על מספר הקבוצות ועל התלות ביניהן. בענף הקשרים שואלים על הסולם של שני המשתנים. כל ענף מסתיים במבחן ובפרק שבו למדנו אותו. ענפים של שלוש קבוצות ויותר, או של כמה מנבאים, מובילים לחלק ד.
מתחילים למעלה, עונים על כל שאלה, ויורדים בענף המתאים עד שמגיעים למבחן. ליד כל מבחן כתוב הפרק שבו למדנו אותו. מבחנים במסגרת מקווקוות שייכים לחלק ד, ונלמד אותם בהמשך.
- מה שואלים?
- הבדל באיזה סולם המשתנה התלוי?
- רווח או מנה כמה קבוצות או מדידות?
- קבוצה אחת, מול ערך ידוע σ באוכלוסייה ידועה?
- כן מבחן zz test · פרק 18
- לא מבחן t למדגם בודדOne-sample t test · פרק 20
- שתיים אותם אנשים, או זוגות?
- כן: מזווגים ההנחות מתקיימות?
- כן מבחן t למדגמים תלוייםPaired-samples t test · פרק 21
- לא: מדגם קטן ומוטה וילקוקסון למדגמים תלוייםDependent samples · פרק 22
- לא: קבוצות נפרדות ההנחות מתקיימות?
- כן מבחן לויןLevene's test מובהק?
- לא t לבלתי תלויים, Student · פרק 21
- כן t לבלתי תלויים, Welch · פרק 21
- לא: מדגם קטן ומוטה מאן־ויטני · פרק 22
- כן מבחן לויןLevene's test מובהק?
- כן: מזווגים ההנחות מתקיימות?
- שלוש ויותר ניתוח שונות · פרק 26
- קבוצה אחת, מול ערך ידוע σ באוכלוסייה ידועה?
- סדר כמה קבוצות או מדידות?
- שתיים, מזווגים וילקוקסון למדגמים תלויים · פרק 22
- שתיים, נפרדות מאן־ויטני · פרק 22
- שלוש ויותר, נפרדות קרוסקל־וואליסKruskal-Wallis test · פרק 26
- שמי מה משווים?
- משתנה אחד, מול התפלגות צפויה חי בריבועChi-square statistic לטיב התאמה · פרק 23
- שכיחויות בין קבוצות חי בריבוע לאי־תלות · פרק 23השוואת קבוצות במשתנה שמי היא בעצם קשר בין שני משתנים שמיים.
- רווח או מנה כמה קבוצות או מדידות?
- קשר בין שני משתנים באיזה סולם שני המשתנים?
- שניהם רווח או מנה מתאם פירסון · פרקים 15 ו־24בתנאי שהקשר קוויLinear relationship ואין ערכים קיצוניים חריגים.
- לפחות אחד בסולם סדר מתאם ספירמןSpearman correlation · פרקים 15 ו־24גם כשיש ערכים קיצוניים, או קשר עולה שאינו קווי.
- שניהם שמיים חי בריבוע לאי־תלות, V של קרמרCramér's V · פרק 23
- אחד שמי, אחד כמותי זו בעצם שאלת הבדל בין קבוצות: חזרו לענף ההבדלים.
- ניבוי, מכמה משתנים רגרסיה · פרקים 28 עד 31
- הבדל באיזה סולם המשתנה התלוי?
שימו לב לשלוש מלכודות שהעץ עוזר להימנע מהן. הראשונה: "קשר" בין משתנה שמי, כמו מגדר, למשתנה כמותי, כמו חרדה, הוא שאלת הבדל, והוא הולך למבחן t ולא למתאםCorrelation. השנייה: השוואת שכיחויות בין קבוצות, למשל שיעור המתנדבים בשלוש הקבוצות, היא חי בריבוע ולא מבחן t, כי המשתנה התלוי שמי. והשלישית: לפני שבוחרים בין t לבין מבחן על דירוגים, בודקים את ההנחות, ולא את התוצאה.
העץ כולל רק את מה שלמדנו עד עכשיו. כמה מבחנים מוכרים נשארו בחוץ. המבחן הבינומי בודק משתנה עם שתי קטגוריות בלבד, למשל אם שיעור הבנים בבית ספר שונה מחצי. בספר נשתמש במקומו בחי בריבוע לטיב התאמה, שנותן כמעט אותה תוצאה. ליתר דיוק, הוא זהה לקירוב הנורמלי של המבחן הבינומי, ובמדגם קטן מאוד הגרסה המדויקת עדיפה. מבחן פרידמן הוא החלופה הא־פרמטרית כשאותם אנשים נמדדו שלוש פעמים ויותר בסולם סדר. ועוד דבר: כשאותם אנשים נמדדים פעמיים במשתנה שמי, למשל "התנדב או לא" בתחילת השנה ובסופה, חי בריבוע לאי־תלות לא מתאים, כי התצפיות לא בלתי תלויות. לזה יש מבחן מיוחד, מבחן מקנמרMcNemar's test, שהכרנו בקצרה בפרק 23.
- עברו על העץ עם השאלה "האם הקשיבות של התלמידים בתוכנית המשולבת עלתה מלפני התוכנית לאחריה?". לאיזה מבחן הגעתם, ובאיזו פונקציה באקסל?
- עכשיו עם "האם שיעור הבנות שונה בשלוש הקבוצות?". באיזו תשובה לשאלה הראשונה צריך לבחור, ולמה?
- מצאו במעבדה שני מסלולים שמגיעים לאותה פונקציה באקסל, אבל למבחנים שונים. מה מבדיל ביניהם?
בדיקת התשובה
1. הבדל, שתי מדידות, אותם תלמידים, וההנחות מתקיימות (75 תלמידים): מבחן t למדגמים תלויים, פרק 21. באקסל: T.TEST מסוג 1. 2. המשתנה התלוי, מגדר, הוא שמי, ומשווים שכיחויות בין קבוצות. במעבדה בוחרים "קשר בין שני משתנים", ואז "שניהם שמיים": חי בריבוע לאי־תלות, פרק 23. 3. למשל וילקוקסון למדגמים תלויים ומאן־ויטני: בשניהם RANK.AVG ו־SUMIF. ההבדל הוא במבנה הנתונים: במזווגים מדרגים את ההפרשים של כל זוג, ובקבוצות נפרדות מדרגים את כל הציונים יחד. גם חי בריבוע לאי־תלות וחי בריבוע לטיב התאמה מגיעים שניהם ל־CHISQ.TEST, אבל השכיחויות הצפויות מחושבות בכל אחד אחרת.
בדקו את עצמכם3 שאלות
1.לפי עץ ההחלטה: שאלת הבדל, משתנה תלוי בסולם רווח, שתי קבוצות של אנשים שונים, ההנחות מתקיימות, ומבחן לוין לא מובהק. לאן מגיעים?
2.חוקרת משווה את שיעור הילדים שמגיעים לבית הספר ברגל בשתי שכונות. איזה מבחן מתאים לפי העץ?
3.בענף הקשרים בעץ, השילוב "משתנה אחד שמי, משתנה אחד כמותי" מפנה חזרה לענף ההבדלים. למה?
ענף ההבדלים: מ־z ועד Welch
משתנה תלוי בסולם רווח: קבוצה מול ערך ידוע, z אם σ ידועה ו־t אם לא. אותם אנשים פעמיים: t למדגמים תלויים. שתי קבוצות נפרדות: t לבלתי תלויים, ולוין מחליט בין Student ל־Welch. מדגם קטן ומוטה, או סולם סדר: וילקוקסון למזווגים, ומאן־ויטני לקבוצות נפרדות.
רוב השאלות במחקר חינוכי הן שאלות הבדל על משתנה כמותי. כל המבחנים בענף הזה בנויים באותו היגיון, שהכרנו בפרק 18: אות חלקי רעש. במונה ההבדל שמצאנו, ובמכנה טעות התקןStandard error (), כמה ההבדל הזה היה משתנה במקרה. ההבדל בין המבחנים הוא רק במה משווים, ואיך מחשבים את הרעש.
| המבחן | מה משווים | סטטיסטי המבחן | דרגות חופש | גודל אפקט |
|---|---|---|---|---|
| z (פרק 18) | ממוצע מול μ0, σ ידועה | z = (M − μ0) / (σ / √n) | אין | d = (M − μ0) / σ |
| t למדגם בודד (פרק 20) | ממוצע מול μ0, σ לא ידועה | t = (M − μ0) / (SD / √n) | n − 1 | d = (M − μ0) / SD |
| t למדגמים תלויים (פרק 21) | ממוצע ההפרשים מול 0 | t = MD / (SDD / √n) | n − 1 | d = MD / SDD |
| t לבלתי תלויים, Student (פרק 21) | שני ממוצעים, שונויות שוות | t = (M1 − M2) / SE | n1 + n2 − 2 | d = (M1 − M2) / SDpooled |
| t לבלתי תלויים, Welch (פרק 21) | שני ממוצעים, שונויות שונות | כמו Student, וכל קבוצה עם השונות שלה | בנוסחה מיוחדת, לרוב לא מספר שלם | d |
| וילקוקסון למדגמים תלויים (פרק 22) | דירוגי ההפרשים, חיוביים מול שליליים | T, ובמדגם גדול z | אין | rrb = (T+ − T−) / (T+ + T−) |
| מאן־ויטני (פרק 22) | הדירוגים בשתי הקבוצות, בדירוג משותףJoint ranking | U, ובמדגם גדול z | אין | rrb = (U2 − U1) / (n1n2) |
z או t?
השאלה היחידה כאן היא אם σ ידועה. זה קורה בעיקר במבחנים עם נורמות ארציות, כמו מבחן אינטליגנציה (μ = 100, σ = 15). כמעט בכל מחקר אחר σ לא ידועה, ומעריכים אותה מסטיית התקן של המדגם. ולכן t. ככל שהמדגם גדל, שני המבחנים מתקרבים.
מזווגים או בלתי תלויים?
המבחן הקטן מפרק 21: האם אפשר לחבר כל שורה בקבוצה אחת לשורה מסוימת בקבוצה השנייה? אותו תלמיד לפני ואחרי, ילד והורה, תאומים: מזווגים. בנים ובנות, כיתה ד׳ וכיתה ה׳, תוכנית וביקורת: בלתי תלויים. הטעות כאן יקרה: מבחן לבלתי תלויים על נתונים מזווגים מאבד הרבה עוצמה, כמו שראינו בפרק 21.
Student או Welch?
רק בקבוצות בלתי תלויות. הכלל של הספר: מבחן לוין לא מובהק, Student. מובהק, Welch. התוכנה מריצה את לוין לבד, ליד מבחן t. באקסל אין מבחן לוין, ואפשר להסתפק בכלל האצבע: אם השונות הגדולה חלקי הקטנה גדולה מ־2, Welch.
מתי עוברים לדירוגים?
כשהמשתנה התלוי בסולם סדר, או כשהמדגם קטן וההתפלגות מוטה בבירור (פרק 22). במדגם גדול, 30 ומעלה בכל קבוצה, מבחן t עמידRobustness לסטיות מנורמליות, ובדרך כלל נשארים איתו.
האם יש הבדל בין בנים לבנות בתחושה שהמורה זמינה ומקבלת, לפני התוכנית (teach_pre, ממוצע של 17 פריטים, 1 עד 7)?
שלוש השאלות: הבדל. סולם רווח. שתי קבוצות של ילדים שונים. מכאן מבחן t למדגמים בלתי תלויים, ונשאר להחליט על הגרסה.
| קבוצה | n | M | SD |
|---|---|---|---|
| בנים | 96 | 5.40 | 1.03 |
| בנות | 104 | 5.66 | 0.85 |
מבחן לוין מובהק, F(1, 198) = 4.63, p = .033: אצל הבנים הפיזורMeasure of dispersion גדול יותר. לכן Welch: t(185.2) = 1.90, p = .058, d = 0.27. ההבדל לא מובהק.
ומה אומר כלל האצבע? יחס השונויותVariance ratio הוא 1.026² / 0.852² = 1.45, פחות מ־2, ולכן לפי כלל האצבע Student: t(198) = 1.92, p = .056. שתי הדרכים מגיעות לאותה מסקנה, כי הקבוצות קרובות בגודלן.
הפריט "אני לחוץ/ה כשהמורה שואלת אותי שאלה" (a7) נענה בארבע דרגות: 1 אף פעם, 2 לפעמים, 3 לעיתים קרובות, 4 תמיד. האם בנות לחוצות יותר מבנים?
זה פריט בודד, בסולם סדר: ההבדל בין "לפעמים" ל"לעיתים קרובות" לא בהכרח שווה להבדל בין "לעיתים קרובות" ל"תמיד". לכן לא מחשבים ממוצע, אלא מדרגים. שתי קבוצות נפרדות: מאן־ויטני.
החציוןMedian אצל הבנים הוא 2 ("לפעמים"), ואצל הבנות 3 ("לעיתים קרובות"). הדירוג הממוצע של הבנים 89.92, ושל הבנות 110.27. ההבדל מובהק: U = 3976, z = −2.62, p = .009. הבנות מדווחות על יותר לחץ כשהמורה פונה אליהן.
משרד החינוך פרסם נורמה ארצית לשביעות רצון מהחיים, בשאלון שלנו: μ = 5.0, σ = 1.0. בכיתה 4, בתוכנית העקיפה, 29 תלמידים, והממוצע לפני התוכנית 5.30. איזה מבחן מתאים? חשבו אותו.
בדיקת התשובה
הבדל, סולם רווח, קבוצה אחת מול ערך ידוע, ו־σ ידועה מהנורמה: מבחן z.
p = .110, גדול מ־.05: לא דוחים. שביעות הרצון בכיתה הזו לא שונה באופן מובהק מהנורמה. אילו הנורמה הייתה כוללת רק ממוצע, בלי σ, היינו משתמשים בסטיית התקן של הכיתה, ובמבחן t למדגם בודד.
בדקו את עצמכם4 שאלות
1.בכיתה של 36 תלמידים, הממוצע במבחן אינטליגנציה הוא 106. לפי הנורמה, μ = 100, σ = 15. איזה מבחן, ומה ערך סטטיסטי המבחןTest statistic?
2.בפלט של מבחן t כתוב df = 172.4. מה אפשר להסיק?
3.בשתי קבוצות נפרדות, סטיית התקן היא 6 בקבוצה אחת ו־3 בשנייה. אתם עובדים באקסל, בלי מבחן לוין. באיזו גרסה של מבחן t תשתמשו?
4.מתי כדאי לעבור ממבחן t למדגמים תלויים למבחן וילקוקסון?
ענף הקשרים, ומשתנים שמיים
שני משתנים בסולם רווח: מתאם פירסון. לפחות אחד בסולם סדר, או ערכים קיצוניים: ספירמן. המובהקות של מתאםCorrelation נבדקת ב־ עם n − 2 דרגות חופש. שני משתנים שמיים: חי בריבוע לאי־תלות, וגודל האפקטEffect size של קרמר. משתנה שמי אחד מול התפלגות צפויה: חי בריבוע לטיב התאמה.
פירסון או ספירמן?
פירסון () מודד קשר קווי בין שני משתנים בסולם רווח או מנה (פרק 15). ספירמן הוא פירסון על הדירוגים: הוא מתאים כשלפחות אחד המשתנים בסולם סדר, כשיש ערכים קיצוניים שמושכים את פירסון, או כשהקשר עולה כל הזמן אבל לא בקו ישר. לפני שבוחרים, מסתכלים על דיאגרמת הפיזור.
בשני המקרים, השאלה אם המתאם מובהק נבדקת במבחן t (פרק 24):
למשל, בין הקשיבות לשביעות הרצון מהחיים לפני התוכנית (mind_pre, sat_pre), r = .33, ב־200 תלמידים. t(198) = .3311 · √198 / √(1 − .3311²) = 4.94, p < .001. ו־r² = .11: לשני המשתנים 11% שונות משותפתShared variance.
שני משתנים שמיים: חי בריבוע
כשהמשתנה התלוי שמי, אין ממוצע. סופרים כמה תלמידים יש בכל תא של טבלת שילובContingency table, ומשווים לשכיחויות שהיינו מצפים להן אילו לא היה קשר (פרק 23). שני מבחנים שונים נקראים "חי בריבוע", וכדאי לא לבלבל ביניהם:
- לאי־תלות: שני משתנים שמיים, למשל קבוצת מחקר והתנדבות. השאלה: האם הם קשורים? זה גם המבחן להשוואת שיעורים בין קבוצות.
- לטיב התאמה: משתנה שמי אחד, מול התפלגות שקבענו מראש. למשל: האם התלמידים מתחלקים שווה בשווה בין כיתה ד׳ לכיתה ה׳?
שתי הנחות חשובות במיוחד: חי בריבוע עובד על שכיחויות, לא על אחוזים ולא על ממוצעים. וכל תלמיד נמצא בתא אחד בלבד, כלומר התצפיות בלתי תלויות.
בסוף השנה נבדק אם כל תלמיד התנדב לעזור, כלומר מילא את טופס ההתנדבות (vol_post: 0 לא, 1 כן, פרק 5). האם שיעור המתנדבים שונה בשלוש הקבוצות?
שלוש השאלות: המשתנה התלוי שמי (כן או לא), והקבוצה שמית. השוואת שכיחויות בין קבוצות היא קשר בין שני משתנים שמיים: חי בריבוע לאי־תלות.
| קבוצה | לא התנדב | התנדב | סך הכול | אחוז המתנדבים |
|---|---|---|---|---|
| ביקורת | 47 | 27 | 74 | 36.5% |
| עקיפה | 23 | 28 | 51 | 54.9% |
| משולבת | 27 | 48 | 75 | 64.0% |
| סך הכול | 97 | 103 | 200 | 51.5% |
בדיקת התשובה: החישוב ביד
מסקנה: χ²(2, N = 200) = 11.61, p = .003, V = .24. יש קשר בין הקבוצה להתנדבות: בתוכנית המשולבת 64% התנדבו, ובביקורת 36.5%. ובתחילת השנה (vol_pre)? אז לא היה הבדל מובהק בין הקבוצות, χ²(2) = 1.14, p = .565. כלומר הקבוצות התחילו דומות.
בין החרדה לקשיבות לפני התוכנית, מתאם פירסון הוא r = −.13, p = .061, ומתאם ספירמן הוא rs = −.16, p = .021. מפתה לדווח את ספירמן, כי הוא "יצא". אבל אם מריצים כמה מבחנים ומדווחים את זה שיצא מובהק, הסיכוי לטעות מסוג ראשוןType I error כבר לא 5%. את המבחן בוחרים לפי השאלה, הסולם והנתונים, לפני שרואים את ערך pp-value. כאן שני המשתנים בסולם רווח, ופירסון הוא הבחירה הטבעית. ומי שהחליט מראש על ספירמן, למשל בגלל ערכים קיצוניים, צריך להסביר למה.
מה אם רוצים לדעת אם יותר תלמידים התנדבו בסוף השנה מאשר בתחילתה? זה נראה כמו טבלת שילוב: vol_pre מול vol_post. אבל אלה אותם 200 תלמידים, פעמיים. כל תלמיד מופיע בשתי המדידות, והתצפיות לא בלתי תלויות. חי בריבוע לאי־תלות בודק כאן שאלה אחרת: האם מי שהתנדב בהתחלה נוטה להתנדב גם בסוף. וזה כמובן נכון. השאלה על השינוי נמצאת בשני התאים שבהם תלמידים שינו את התשובה: 48 שלא התנדבו בהתחלה והתנדבו בסוף, מול 21 שהפסיקו. את השאלה הזו בודק מבחן מקנמר, שהכרנו בקצרה בפרק 23: χ²(1) = 10.57, p = .001. זה בדיוק הרעיון של מבחן מזווג, בגרסה למשתנה שמי.
בדקו את עצמכם4 שאלות
1.במדגם של 27 תלמידים נמצא מתאם של r = .40 בין זמן הקריאה בבית לבין אוצר המילים. חשבו את t ואת דרגות החופש. האם המתאם מובהק ב־α = .05?
2.בטבלת שילובContingency table של מגדר (2 קטגוריות) מול סוג פעילות אחרי בית הספר (4 קטגוריות), כמה דרגות חופש יש למבחן חי בריבוע לאי־תלותChi-square test of independence?
3.מה ההבדל בין חי בריבוע לאי־תלות לבין חי בריבוע לטיב התאמה?
4.בדיאגרמת פיזורScatter plot של שני משתנים כמותיים, תלמיד אחד רחוק מאוד מכל השאר. איזה מתאם עדיף?
ההנחות: הסינון האחרון
לכל מבחן יש הנחות. החשובה מכולן היא אי־תלות בין התצפיותIndependence of observations, וכפתור בתוכנה לא בודק אותה: היא נובעת ממערך המחקר. נורמליות חשובה בעיקר במדגם קטן. שוויון שונויותHomogeneity of variance חשוב רק ל־Student. בחי בריבוע, שכיחות צפויהExpected frequency של 5 לפחות בכל תא.
אחרי שלוש השאלות יש מבחן מועמד. עכשיו בודקים אם ההנחות שלו סבירות. אם לא, כמעט תמיד יש חלופה, והעץ כבר מראה אותה.
| הנחה | אילו מבחנים | איך בודקים | אם היא לא מתקיימת |
|---|---|---|---|
| אי־תלות בין התצפיותIndependence of observations | כולם | לפי מערך המחקר, לא בתוכנה | אותם אנשים פעמיים: מבחן מזווג. תלמידים מקובצים בכיתות: מודלים מעורבים (פרק 36)Linear mixed model |
| סולם רווח או מנה | z, t, פירסון | לפי המשתנה (פרק 6) | וילקוקסון, מאן־ויטני, ספירמן |
| נורמליות, או מדגם גדול | t, ומובהקות של פירסון | היסטוגרמה, הטיה, תרשים Q-Q (פרקים 12, 14) | מ־30 ומעלה בכל קבוצה: בדרך כלל ממשיכים. מדגם קטן ומוטה: מבחן על דירוגים |
| שוויון שונויותHomogeneity of variance | רק t לבלתי תלויים, Student | מבחן לוין, או יחס השונויות | Welch |
| קשר קווי, בלי ערכים קיצוניים חריגים | פירסון | דיאגרמת פיזור | ספירמן |
| שכיחות צפויה של 5 לפחות בכל תאExpected frequency | חי בריבוע | טבלת השכיחויות הצפויותFrequency table | איחוד קטגוריות, או מבחן פישר המדויק בטבלה 2 × 2 (פרק 23)Fisher's exact test |
בפרק 21 ראינו שהחרדה ירדה בתוכנית העקיפה, t(50) = 3.55, p < .001. אבל ההתפלגות של 51 ההפרשים מוטה שמאלה: הטיה −0.87, ו־Shapiro-Wilk מובהק (p = .008). האם צריך לעבור לוילקוקסון?
עם 51 תלמידים, משפט הגבול המרכזיCentral limit theorem (פרק 17) עובד בשבילנו, ומבחן t עמיד. ואכן, וילקוקסון למדגמים תלויים נותן את אותה מסקנה: z = −3.31, p < .001. במדגם גדול שני המבחנים כמעט תמיד מסכימים. ההחלטה חשובה באמת במדגם קטן, למשל קבוצה של 12 תלמידים עם הפרש קיצוני אחד או שניים.
במחקר שלנו לא הוגרלו תלמידים לקבוצות, אלא בתי ספר. כל קבוצה היא בית ספר אחד, עם שתיים או שלוש כיתות. תלמידים באותה כיתה חולקים מורה, אווירה וחוויות, ולכן הציונים שלהם דומים יותר מציונים של שני תלמידים אקראיים. כלומר, הם לא באמת בלתי תלויים. אם מתעלמים מזה, כאילו יש לנו 200 תצפיות נפרדות, טעות התקן יוצאת קטנה מדי, והסיכוי לטעות מסוג ראשון גדל. במחקרים אמיתיים בבתי ספר משתמשים לכן במודלים שמתחשבים בכיתות ובבתי הספר, מודלים לינאריים מעורבים (פרק 36). בפרקים הבאים נמשיך לנתח את התלמידים כתצפיות נפרדות, כדי ללמוד את הכלים, אבל כדאי לזכור את ההסתייגות הזו כשקוראים את התוצאות.
בדקו את עצמכם3 שאלות
1.איזו הנחה אי אפשר לבדוק בלחיצת כפתור בתוכנה?
2.בטבלת חי בריבוע 2 × 2, השכיחות הצפויה באחד התאים היא 3.2. מה עושים?
3.השוויתם שתי קבוצות, 80 ו־90 תלמידים, במבחן t. Shapiro-Wilk מובהק בשתיהן, אבל ההיסטוגרמות נראות כמעט סימטריות, וההטיה קטנה מ־0.5 בערך מוחלט. מה תעשו?
תרגול: שתים־עשרה שאלות מהמחקר שלנו
הדרך היחידה ללמוד לבחור מבחן היא לתרגל שאלות מעורבבות, בלי לדעת מראש מאיזה פרק הן. לכל שאלה: הבדל או קשר, סולם, מבנה, ורק אז מבחן.
בכל פרק עד עכשיו ידעתם מראש איזה מבחן מתאים, כי כל השאלות היו מאותו פרק. במבחן ובמחקר זה לא כך. לכן כאן השאלות מעורבבות. לכל שאלה, נסו לענות לבד על שלוש השאלות, ורק אחר כך פתחו את הפתרון. שמות המשתנים לקוחים מקובץ המחקר.
- האם ההרגשה בכיתה לפני התוכנית (
clim_pre) שונה מ־3, אמצע הסולם?בדיקת התשובה
הבדל, סולם רווח, קבוצה אחת מול ערך, σ לא ידועה: t למדגם בודד (פרק 20).
- האם הקשר עם המורה (
teach_pre,teach_post) השתנה בתוכנית העקיפה?בדיקת התשובה
הבדל, סולם רווח, אותם 51 תלמידים פעמיים: t למדגמים תלויים (פרק 21).
- האם שיעור הבנות שונה בשלוש הקבוצות?
בדיקת התשובה
המשתנה התלוי, מגדר, שמי, והקבוצה שמית: חי בריבוע לאי־תלות (פרק 23). זו בדיקה חשובה: האם הקבוצות היו דומות לפני התוכנית (פרק 23, סעיף 7).
- האם יש קשר בין הקשר עם המורה להרגשה בכיתה, אחרי התוכנית?
בדיקת התשובה
קשר בין שני משתנים בסולם רווח: מתאם פירסון, ובדיקת המובהקות שלו (פרקים 15 ו־24). קודם מסתכלים על דיאגרמת הפיזור.
- האם יש קשר בין השכלת ההורה (
parent_edu: 1 עד 12 שנות לימוד, 2 על־תיכונית, 3 תואר ראשון, 4 תואר שני ומעלה) לבין בעיות הקשב?בדיקת התשובה
קשר. השכלת ההורה היא סולם סדר: יש סדר, אבל המרווחים בין הדרגות לא שווים. לכן מתאם ספירמן (פרקים 15 ו־24). ולפני כן מגדירים את 99 כנתון חסר.
- האם בנים ובנות שונים בפריט "אני מפחד/ת שאטעה מול כולם" (
a2, 1 עד 4)?בדיקת התשובה
הבדל, פריט בודד בסולם סדר, שתי קבוצות נפרדות: מאן־ויטני (פרק 22).
- בכיתה אחת, 14 תלמידים עם הרבה תלונות גופניות השתתפו בקבוצת הרפיה. התלונות נמדדו לפני ואחרי, והתפלגות ההפרשים מוטה מאוד: רוב התלמידים כמעט לא השתנו, ושניים השתפרו מאוד.
בדיקת התשובה
הבדל, אותם תלמידים פעמיים, אבל מדגם קטן והתפלגות מוטה: וילקוקסון למדגמים תלויים (פרק 22).
- במבחן קשב ממוחשב יש נורמה ארצית לכיתה ד׳: ממוצע 50 וסטיית תקן 10. האם 52 תלמידי כיתה ד׳ בתוכנית המשולבת שונים מהנורמה?
בדיקת התשובה
הבדל, קבוצה אחת מול ערך ידוע, ו־σ ידועה: מבחן z (פרק 18).
- האם התלמידים מתחלקים שווה בשווה בין ארבע רמות השכלת ההורה?
בדיקת התשובה
משתנה אחד, שמתייחסים כאן לרמות שלו כאל קטגוריות, מול התפלגות שקבענו מראש (רבע בכל רמה): חי בריבוע לטיב התאמה (פרק 23).
- האם הבנים והבנות שונים בתלונות הגופניות לפני התוכנית (
soma_pre)? בדקתם, ומבחן לוין מובהק.בדיקת התשובה
הבדל, סולם רווח, שתי קבוצות נפרדות, ולוין מובהק: t לבלתי תלויים, בגרסת Welch (פרק 21). (בנתונים שלנו לוין דווקא לא מובהק, p = .281, ולכן שם קוראים את Student.)
- האם השינוי בקשיבות, אחרי פחות לפני, שונה בין התוכנית העקיפה, התוכנית המשולבת והביקורת?
בדיקת התשובה
הבדל, סולם רווח, שלוש קבוצות: ניתוח שונות חד־כיווני (פרק 26). לא שלושה מבחני t, ובסעיף הבא נראה למה.
- האם אפשר לנבא את החרדה בסוף השנה מהחרדה בתחילת השנה, מהמגדר ומהקבוצה, יחד?
בדיקת התשובה
ניבוי משתנה אחד מכמה משתנים, חלקם שמיים: רגרסיה מרובהMultiple regression, עם משתני דמהDummy variable לקבוצה (פרקים 29 ו־30). זה כבר חלק ד.
שש השאלות של המנהלת, ושישה מבחנים:
- האם בנות לחוצות יותר כשהמורה שואלת אותן שאלה? פריט בודד בסולם סדר, שתי קבוצות: מאן־ויטני. כן, p = .009 (סעיף 3).
- האם בתוכנית המשולבת יותר תלמידים התנדבו? שני משתנים שמיים: חי בריבוע לאי־תלות. כן, 64% מול 36.5% בביקורת, p = .003 (סעיף 4).
- האם תלמידים קשובים יותר מרוצים יותר? קשר בין שני משתנים בסולם רווח: פירסון. כן, r = .33, p < .001 (סעיף 4).
- האם הקשר עם המורה השתפר בתוכנית העקיפה? אותם תלמידים פעמיים: t למדגמים תלויים. את התשובה תמצאו בעצמכם, בתרגול עם הנתונים.
- האם החרדה שונה מאמצע הסולם? קבוצה אחת מול 2.5, σ לא ידועה: t למדגם בודד. כן, החרדה נמוכה מאמצע הסולם: M = 2.24, t(199) = −7.21, p < .001.
- האם השינוי בחרדה שונה בשלוש הקבוצות? שלוש קבוצות: ניתוח שונות. את זה נשאיר לפרק 26.
בדקו את עצמכם3 שאלות
1.האם הקשיבות בסוף השנה (mind_post) שונה בין תלמידי כיתה ד׳ לתלמידי כיתה ה׳?
2.האם יש קשר בין הגיל בשנים (age) לבין הקשיבות לפני התוכנית?
3.כתבו שאלת מחקר משלכם על קובץ המחקר, שהמבחן המתאים לה הוא מאן־ויטני. נמקו.
a3)?" פריט בודד, 1 עד 4, הוא סולם סדר, ושתי השכבות הן קבוצות של ילדים שונים: מאן־ויטני. ואל תשכחו להגדיר את 99 כנתון חסר ב־a3. כל פריט בודד מול מגדר, שכבה, או שתיים מהקבוצות, יתאים.שלוש קבוצות ויותר, או כמה משתנים: מבט לחלק ד
עם שלוש קבוצות ויותר לא מריצים כמה מבחני t, כי הסיכוי לטעות מסוג ראשון מצטבר: בשלוש השוואות הוא כבר 1 − .95³ = .14. משתמשים בניתוח שונות. כשיש שני גורמים, ניתוח שונות דו־כיווניTwo-way ANOVA. וכשמנבאים משתנה אחד מכמה משתנים, רגרסיה.
במחקר שלנו יש שלוש קבוצות. השאלה המרכזית, אם התוכנית עבדה, היא בעצם השוואה בין שלושתן. למה לא פשוט להריץ שלושה מבחני t: ביקורת מול עקיפה, ביקורת מול משולבת, ועקיפה מול משולבת?
בכל מבחן, הסיכוי לטעות מסוג ראשון הוא = 5%, כלומר 95% לא לטעות. אם מריצים שלושה מבחנים, והשערת האפסNull hypothesis נכונה בכולם, הסיכוי לא לטעות באף אחד הוא .95 · .95 · .95 = .857. כלומר, הסיכוי לטעות לפחות פעם אחת הוא כ־14%, ולא 5%. זו טעות מסוג ראשון מצטברתFamilywise error rate, וככל שיש יותר קבוצות היא גדלה: בארבע קבוצות יש שש השוואות, והיא מגיעה ל־26%.
הפתרון הוא מבחן אחד שמשווה את כל הקבוצות יחד: ניתוח שונות. והוא רק הראשון מהכלים של חלק ד:
| השאלה | דוגמה מהמחקר | הניתוח | פרק |
|---|---|---|---|
| שלוש קבוצות ויותר, משתנה תלוי כמותי | האם השינוי בחרדה שונה בשלוש הקבוצות? | ניתוח שונות חד־כיווני, ומבחני המשך. בסולם סדר: קרוסקל־וואליסPost hoc tests | 26 |
| שני משתנים מחלקים יחד | האם ההשפעה של התוכנית שונה אצל בנים ובנות? | ניתוח שונות דו־כיווני ואינטראקציהTwo-way ANOVA | 27 |
| ניבוי מנבא כמותי אחד | כמה שביעות הרצון עולה עם כל נקודה בקשיבות? | רגרסיה פשוטהLinear regression | 28 |
| ניבוי מכמה מנבאים | מה מנבא את החרדה בסוף השנה? | רגרסיה מרובה | 29 |
| מנבא שמי ברגרסיה | קבוצת המחקר כמנבא | משתני דמה | 30 |
| תרומה מעבר לבקרה | האם הקבוצה מנבאת את הקשיבות בסוף, מעבר לקשיבות בהתחלה? | רגרסיה היררכיתHierarchical regression | 31 |
| קשר שתלוי במשתנה שלישיThird variable | האם הקשר בין חרדה לקשב תלוי בקשר עם המורה? | מיתון | 32 |
בפרק 24 ראינו שמבחן t לשתי קבוצות הוא בעצם מבחן של מתאם. בפרק 26 נראה שהוא גם מקרה פרטי של ניתוח שונות: עם שתי קבוצות ערך p זהה, ו־F = t². וניתוח שונות הוא מקרה פרטי של רגרסיה, עם משתני דמה (פרק 30). כלומר, רוב המבחנים בעץ הם גרסאות של מודל אחד, המודל הלינארי הכלליGeneral linear model. אז למה לומדים את כולם? כי הם פשוטים יותר להבנה ולחישוב, כי הם הומצאו בנפרד, בתקופות שונות, וכי כך מדווחים עליהם במאמרים. אבל מי שמבין את ההיגיון המשותף, אות חלקי רעש, ימצא את דרכו גם במבחן שלא ראה מעולם.
בדקו את עצמכם3 שאלות
1.חוקרת הריצה חמש השוואות, כל אחת ב־α = .05. אם השערת האפסNull hypothesis נכונה בכולן, מה הסיכוי שלפחות אחת תצא מובהקת?
2.חוקר רוצה לבדוק אם ההשפעה של התוכנית על החרדה שונה אצל בנים ובנות. איזה ניתוח מתאים?
3.למה עם שלוש קבוצות לא מריצים פשוט שלושה מבחני t?
בתוכנה: איפה נמצא כל מבחן
המפה הזו מסדרת את כל המבחנים לפי התוכנה. אחריה, דוגמה אחת מלאה: שאלת ההתנדבות מסעיף 4. בחרו את התוכנה שלכם בסרגל למעלה, או בלשוניות.
| המבחן | באקסל |
|---|---|
| z | מחשבים z בנוסחה, ואז NORM.S.DIST |
| t למדגם בודד | מחשבים t בנוסחה, ואז T.DIST.2T |
| t למדגמים תלויים | T.TEST מסוג 1, או Data Analysis: t-Test: Paired Two Sample for Means |
| t לבלתי תלויים | T.TEST מסוג 2 (Student) או 3 (Welch) |
| וילקוקסון, מאן־ויטני | RANK.AVG ו־SUMIF, ובמדגם גדול קירוב נורמלי עם NORM.S.DISTNormal approximation |
| חי בריבוע | COUNTIFS לטבלה, CHISQ.TEST לערך p |
| פירסון | CORREL, ולמובהקות t בנוסחה ו־T.DIST.2T |
| ספירמן | RANK.AVG לכל משתנה, ואז CORREL על הדירוגים |
הדוגמה: התנדבות בשלוש הקבוצות
- הקובץ ממוין לפי
group(עמודה D): ביקורת בשורות 2 עד 75, עקיפה 76 עד 126, משולבת 127 עד 201.vol_postהיא עמודה BC. - טבלת הנצפות: בתאים BE2:BE4 כותבים 0, 1, 2 (הקבוצות), ובתאים BF1:BG1 כותבים 0, 1 (לא, כן). בתא BF2:
=COUNTIFS($D$2:$D$201,$BE2,$BC$2:$BC$201,BF$1), וגוררים עד BG4. - טבלת הצפויות, בתאים BF7:BG9: בתא BF7
=SUM($BF2:$BG2)*SUM(BF$2:BF$4)/200, וגוררים עד BG9. - ערך p:
=CHISQ.TEST(BF2:BG4,BF7:BG9). ואת χ² עצמו:=CHISQ.INV.RT(BF11,2), כש־BF11 הוא התא של ערך p.
Chi-square: group × vol_post
| Cell | 0 | 1 | |
|---|---|---|---|
| BF2:BG2 | Observed, group 0 | 47 | 27 |
| BF3:BG3 | Observed, group 1 | 23 | 28 |
| BF4:BG4 | Observed, group 2 | 27 | 48 |
| BF7:BG7 | Expected, group 0 | 35.89 | 38.11 |
| BF8:BG8 | Expected, group 1 | 24.735 | 26.265 |
| BF9:BG9 | Expected, group 2 | 36.375 | 38.625 |
| BF11 | =CHISQ.TEST(BF2:BG4,BF7:BG9) | 0.0030 | |
| BF12 | =CHISQ.INV.RT(BF11,2) | 11.61 | |
| BF13 | =SQRT(BF12/(200*1)) | 0.24 |
- Expected
- השכיחויות שהיינו מצפים להן אילו לא היה קשר. הקטנה ביותר 24.74, הרבה מעל 5: ההנחה מתקיימת.
- CHISQ.TEST
- ערך p ישירות, בלי χ². p = .003.
- CHISQ.INV.RT
- מחזירה את χ² שמתאים לערך p, עם 2 דרגות חופש: 11.61.
- BF13
- V של קרמר. בטבלה 3 × 2, המספר הקטן מבין שורות ועמודות הוא 2, ופחות 1 זה 1.
| המבחן | ב־SPSS |
|---|---|
| z | אין חלון מוכן: Descriptives לממוצע, ו־Transform > Compute Variable עם CDF.NORMAL (פרק 18) |
| t למדגם בודד | Analyze > Compare Means > One-Sample T Test |
| t למדגמים תלויים | Analyze > Compare Means > Paired-Samples T Test |
| t לבלתי תלויים | Analyze > Compare Means > Independent-Samples T Test (לוין ושתי השורות באותו פלט) |
| וילקוקסון | Analyze > Nonparametric Tests > Legacy Dialogs > 2 Related Samples |
| מאן־ויטני | Analyze > Nonparametric Tests > Legacy Dialogs > 2 Independent Samples |
| חי בריבוע לאי־תלות | Analyze > Descriptive Statistics > Crosstabs, ובכפתור Statistics: Chi-square, Phi and Cramer's V |
| חי בריבוע לטיב התאמה | Analyze > Nonparametric Tests > Legacy Dialogs > Chi-square |
| פירסון, ספירמן | Analyze > Correlate > Bivariate, ומסמנים Pearson או Spearman |
הדוגמה: התנדבות בשלוש הקבוצות
- Analyze > Descriptive Statistics > Crosstabs. Row(s):
group. Column(s):vol_post. - בכפתור Statistics מסמנים Chi-square, ו־Phi and Cramer's V. בכפתור Cells מסמנים, מלבד Observed, גם Expected ו־Row (אחוזים בשורהRow percentage).
Study group * Volunteered, post Crosstabulation
| No | Yes | Total | ||
|---|---|---|---|---|
| Control | Count | 47 | 27 | 74 |
| % within Study group | 63.5% | 36.5% | 100.0% | |
| Indirect | Count | 23 | 28 | 51 |
| % within Study group | 45.1% | 54.9% | 100.0% | |
| Combined | Count | 27 | 48 | 75 |
| % within Study group | 36.0% | 64.0% | 100.0% | |
| Total | Count | 97 | 103 | 200 |
Chi-Square Tests
| Value | df | Asymptotic Significance (2-sided) | |
|---|---|---|---|
| Pearson Chi-Square 1 | 11.606a | 2 | .003 |
| Likelihood Ratio | 11.744 | 2 | .003 |
| Linear-by-Linear Association | 11.220 | 1 | <.001 |
| N of Valid Cases | 200 |
a. 0 cells (0.0%) have expected count less than 5. The minimum expected count is 24.74. 2
Symmetric Measures
| Value | Approximate Significance | ||
|---|---|---|---|
| Nominal by Nominal | Phi | .241 | .003 |
| Cramer's V | .241 | .003 | |
| N of Valid Cases | 200 |
- 1 · Pearson Chi-Square
- השורה שקוראים: χ²(2) = 11.61, p = .003. שתי השורות שמתחתיה הן מבחנים אחרים, ולא נשתמש בהן.
- 2 · הערת השוליים
- בודקת את ההנחה: אין תאים עם שכיחות צפויה מתחת ל־5.
- % within Study group
- אחוז המתנדבים בכל קבוצה. בהם משתמשים כדי לתאר את הקשר במילים.
- Cramer's V
- גודל האפקטEffect size, .24. בטבלה שאינה 2 × 2 קוראים את V ולא את Phi.
| המבחן | ב־JASP |
|---|---|
| z | T-Tests > One Sample T-Test, ומסמנים Z Test עם סטיית התקן של האוכלוסייה (פרק 18) |
| t למדגם בודד | T-Tests > One Sample T-Test |
| t למדגמים תלויים, וילקוקסון | T-Tests > Paired Samples T-Test: Student, או Wilcoxon signed-rank |
| t לבלתי תלויים, מאן־ויטני | T-Tests > Independent Samples T-Test: Student, Welch, או Mann-Whitney |
| חי בריבוע לאי־תלות | Frequencies > Contingency Tables |
| חי בריבוע לטיב התאמה | Frequencies > Multinomial Test |
| פירסון, ספירמן | Regression > Correlation, ומסמנים Pearson או Spearman |
שימו לב: ב־JASP המבחן הפרמטרי והחלופה שלו נמצאים באותו חלון. נוח, אבל גם מפתה לסמן את שניהם ולבחור את מי ש"יצא". החליטו לפני שאתם מסמנים.
הדוגמה: התנדבות בשלוש הקבוצות
- Frequencies > Contingency Tables. Rows:
group. Columns:vol_post. - תחת Statistics: χ² מסומן מראש. מסמנים גם Phi and Cramer's V. תחת Cells: Expected, ו־Row percentages.
Contingency Tables
| group | 0 | 1 | Total | |
|---|---|---|---|---|
| 0 | Count | 47 | 27 | 74 |
| % within row | 63.5 % | 36.5 % | 100.0 % | |
| 1 | Count | 23 | 28 | 51 |
| % within row | 45.1 % | 54.9 % | 100.0 % | |
| 2 | Count | 27 | 48 | 75 |
| % within row | 36.0 % | 64.0 % | 100.0 % | |
| Total | Count | 97 | 103 | 200 |
Chi-Squared Tests
| Value | df | p | |
|---|---|---|---|
| Χ² | 11.61 | 2 | .003 |
| N | 200 |
Nominal
| Value | |
|---|---|
| Cramer's V | 0.24 |
- Χ²
- סטטיסטי חי בריבוע, עם דרגות החופש וערך p: χ²(2) = 11.61, p = .003.
- % within row
- אחוז המתנדבים בכל קבוצה: 36.5% בביקורת, 64.0% במשולבת.
- Cramer's V
- גודל האפקט, .24.
בדקו את עצמכם2 שאלות
1.באקסל, איזו פונקציה מחזירה ישירות את ערך p של מבחן חי בריבוע, מטבלת הנצפות ומטבלת הצפויות?
CHISQ.TEST CHISQ.TEST מקבלת את שתי הטבלאות ומחזירה את ערך p. CHISQ.INV.RT עושה את הדרך ההפוכה, מערך p אל χ². COUNTIFS בונה את טבלת הנצפות.1.ב־SPSS הרצתם Crosstabs על טבלה 3 × 2. מאיזו שורה בטבלת Chi-Square Tests קוראים את המבחן, ואיזה גודל אפקט מדווחים?
1.ב־JASP, באיזה חלון נמצא מבחן מאן־ויטניMann-Whitney U test?
2.בשאלת ההתנדבות, השכיחות הצפויה הקטנה ביותר היא 24.74. מה זה אומר על ההנחות של חי בריבוע?
טעויות נפוצות
- בוחרים מבחן לפי שם המשתנה. החרדה יכולה ללכת לשישה מבחנים שונים. את המבחן קובעים השאלה, הסולם ומבנה הנתונים.
- מבחן לקבוצות בלתי תלויותIndependent samples על אותם אנשים. לפני ואחרי הם תמיד מזווגים. הטעות מאבדת עוצמה.
- מבחן t על משתנה שמי. שיעור מתנדבים, אחוז בנות: אלה שכיחויות, ומבחן חי בריבוע.
- חי בריבוע על אחוזים. החישוב נעשה תמיד על השכיחויות עצמן.
- מתאם בין משתנה שמי למשתנה כמותי. "הקשר בין מגדר לחרדה" נבדק במבחן t, כי זו בעצם שאלת הבדל.
- כמה מבחני t במקום ניתוח שונות. עם שלוש קבוצות הטעות מסוג ראשון מצטברתFamilywise error rate לכ־14%.
- מריצים כמה מבחנים ומדווחים את זה שיצא מובהק. את המבחן בוחרים לפני שמסתכלים על ערך p.
- עוברים למבחן א־פרמטריNonparametric test בגלל Shapiro-Wilk מובהק במדגם גדול. עם 30 ומעלה בכל קבוצה, מבחן t עמיד, ובדרך כלל שני המבחנים מסכימים.
בדקו את עצמכם
סיכום
- שלוש שאלות, תמיד באותו סדר: הבדל או קשר? באיזה סולם המשתנה התלוי? מה מבנה הנתונים? ובסוף: ההנחות.
- הבדל, סולם רווח: z אם σ ידועה, אחרת t. מזווגים: t למדגמים תלויים. קבוצות נפרדות: t לבלתי תלויים, ולוין בוחר בין Student ל־Welch.
- סולם סדר, או מדגם קטן ומוטה: וילקוקסון למזווגים, מאן־ויטני לקבוצות נפרדות.
- קשר: פירסון לשני משתנים בסולם רווח, ספירמן לסולם סדר או לערכים קיצוניים. שני משתנים שמיים: חי בריבוע לאי־תלות.
- שלוש קבוצות ויותר, או כמה מנבאים: ניתוח שונות ורגרסיה, בחלק ד. לא כמה מבחני t.
מונחים חדשים
שאלות לדוגמה, עם פתרונות
לכל מחקר, בחרו מבחן ונמקו במשפט אחד. א. יועצת שואלת אם יש קשר בין מגמת הלימוד בתיכון (ריאלית, הומניסטית, טכנולוגית) לבין רצון ללמוד באוניברסיטה (כן או לא). ב. 18 מורים דירגו את השחיקה שלהם בתחילת השנה ובסופה, וההתפלגות של ההפרשים מוטה מאוד. ג. האם הציונים במתמטיקה של 120 תלמידים בבית ספר שונים מהממוצע הארצי, 75, כשסטיית התקן הארצית לא פורסמה? ד. האם יש קשר בין מספר הספרים בבית לבין הציון בהבנת הנקרא, אצל 80 תלמידים? ה. האם ממוצע זמן השינה שונה בין תלמידים שמשחקים במחשב בערב לבין תלמידים שלא?
בדיקת התשובה
א. שני משתנים שמיים: חי בריבוע לאי־תלות, בטבלת שילוב 3 × 2. ב. אותם מורים פעמיים, מדגם קטן ומוטה: וילקוקסון למדגמים תלויים. ג. קבוצה אחת מול ערך ידוע, ו־σ לא ידועה: t למדגם בודד. ד. שני משתנים בסולם מנה: מתאם פירסון, אחרי שבודקים בדיאגרמת פיזור שאין ערכים קיצוניים, כמו בית עם אלפי ספרים. ה. שתי קבוצות נפרדות, סולם מנה: t לבלתי תלויים, ולוין יחליט בין Student ל־Welch.
בעיר יש ארבעה בתי ספר יסודיים. חוקר השווה את שביעות הרצון של התלמידים בכל זוג בתי ספר, במבחני t נפרדים, כל אחד ב־α = .05. א. כמה מבחנים הריץ? ב. מה הסיכוי שלפחות אחד מהם יצא מובהק, אם בפועל אין שום הבדל בין בתי הספר? ג. מה הייתם מציעים לו?
בדיקת התשובה
m = 4 · 3 / 2 = 6 א. מספר הזוגות מתוך ארבעה בתי ספר.956 = .735 הסיכוי לא לטעות באף אחד מששת המבחניםαמצטברת = 1 − .735 = .265 ב.ב. כ־26.5%, ולא 5%. כמעט פעם אחת מכל ארבע, החוקר "ימצא" הבדל שלא קיים. ג. ניתוח שונות חד־כיווני, מבחן אחד שמשווה את ארבעת בתי הספר יחד (פרק 26). רק אם הוא מובהק, בודקים אילו בתי ספר שונים, במבחני המשךPost hoc tests ששומרים על α. דרך פשוטה אחת היא לחלק את α במספר ההשוואות: .05 / 6 = .0083, כלומר כל מבחן נחשב מובהק רק אם p < .0083 (תיקון בונפרוניBonferroni correction, פרק 26).
האם יש קשר בין מגדר להתנדבות בסוף השנה? א. איזה מבחן מתאים? ב. השלימו את החישוב מהטבלה, כולל השכיחויות הצפויות, χ², דרגות החופש וערך p. ג. מה המסקנה?
לא התנדב התנדב סך הכול בנים 44 52 96 בנות 53 51 104 סך הכול 97 103 200 בדיקת התשובה
א. שני משתנים שמיים: חי בריבוע לאי־תלות.
E = 96 · 97 / 200 = 46.56, 96 · 103 / 200 = 49.44 בניםE = 104 · 97 / 200 = 50.44, 104 · 103 / 200 = 53.56 בנות(44 − 46.56)² / 46.56 = 6.5536 / 46.56 = 0.141(52 − 49.44)² / 49.44 = 0.133, (53 − 50.44)² / 50.44 = 0.130, (51 − 53.56)² / 53.56 = 0.122χ² = 0.141 + 0.133 + 0.130 + 0.122 = 0.53, df = (2 − 1)(2 − 1) = 1p = CHISQ.DIST.RT(0.53, 1) = .468 הערך הקריטי: 3.84φ = √(0.53 / 200) = .05ג. χ²(1, N = 200) = 0.53, p = .468. לא נמצא קשר בין מגדר להתנדבות: 54.2% מהבנים ו־49.0% מהבנות התנדבו. שימו לב שכל הפרשי O − E בטבלה 2 × 2 שווים בערכם המוחלט, 2.56. זה לא מקרה: סכומי השורות והעמודות קבועים, ולכן תא אחד קובע את כל השאר. מכאן גם דרגת חופש אחת.
חוקרת הריצה ב־SPSS את הפלט הבא. א. איזה מבחן היא הריצה, ועל אילו משתנים? ב. אילו מתאמים מובהקים? ג. כתבו משפט דיווח על הקשר בין שביעות הרצון לחרדה, וחשבו את t ואת r². ד. החוקרת שמה לב שהמתאם בין קשיבות לחרדה "כמעט מובהק", הריצה גם ספירמן, וקיבלה p = .021. מה תגידו לה?
Correlations
mind_pre sat_pre anx_pre mind_pre Pearson Correlation 1 .331** -.133 Sig. (2-tailed) <.001 .061 N 200 200 200 sat_pre Pearson Correlation .331** 1 -.218** Sig. (2-tailed) <.001 .002 N 200 200 200 anx_pre Pearson Correlation -.133 -.218** 1 Sig. (2-tailed) .061 .002 N 200 200 200 **. Correlation is significant at the 0.01 level (2-tailed).
בדיקת התשובה
א. מטריצת מתאמי פירסון (פרק 24) בין הקשיבות, שביעות הרצון והחרדה לפני התוכנית. המטריצה סימטרית: כל מתאם מופיע פעמיים, מעל האלכסון ומתחתיו.
ב. שניים: קשיבות עם שביעות רצון (r = .33, p < .001) ושביעות רצון עם חרדה (r = −.22, p = .002). הקשר בין קשיבות לחרדה לא מובהק (p = .061).
t = −.218 · √198 / √(1 − .218²) = −.218 · 14.071 / 0.976 = −3.14, df = 198r² = .218² = .048 כ־5% שונות משותפתג. "נמצא מתאם שליליNegative relationship מובהק, חלש, בין שביעות הרצון מהחיים לבין החרדה לפני התוכנית, r(198) = −.22, p = .002: תלמידים מרוצים יותר נטו להיות חרדים פחות."
ד. שאת המבחן בוחרים לפני שרואים את ערך p, לפי הסולם ולפי דיאגרמת הפיזור. שני המשתנים בסולם רווח, ואם אין ערכים קיצוניים או קשר לא קווי, פירסון הוא המבחן. להריץ מבחן נוסף רק כי הראשון "כמעט יצא" מגדיל את הסיכוי לטעות מסוג ראשון. ואם כבר: r = −.13 הוא קשר חלש מאוד, פחות מ־2% שונות משותפתShared variance, גם אילו היה מובהק.
מנהלת בית הספר של התוכנית המשולבת רוצה לבדוק אם התוכנית עבדה. היא מציעה את התוכנית הבאה: "נבדוק את השינוי בחרדה, אחרי פחות לפני, בשלושה מבחני t: ביקורת מול עקיפה, ביקורת מול משולבת, ועקיפה מול משולבת. כל תלמיד הוא תצפית אחת, ויש לנו 200 תצפיות". מצאו בתוכנית שתי בעיות, הסבירו כל אחת, וחשבו את הסיכוי לטעות מסוג ראשון מצטברת בתוכנית שלה. מה הייתם עושים במקום?
בדיקת התשובה
αמצטברת = 1 − .95³ = 1 − .857 = .143.05 / 3 = .0167 סף לכל השוואה, אם מתקנים בבונפרוניבעיה 1: שלושה מבחנים במקום אחד. הסיכוי לטעות מסוג ראשון לפחות פעם אחת הוא כ־14%. במקום זה: ניתוח שונות חד־כיווני על ציון השינוי, ואחריו מבחני המשך (פרק 26).
בעיה 2: התלמידים לא באמת בלתי תלויים. הוגרלו בתי ספר, ולא תלמידים, ובכל קבוצה יש בית ספר אחד. תלמידים באותה כיתה חולקים מורה ואווירה. אם מתייחסים אליהם כ־200 תצפיות נפרדות, טעות התקן קטנה מדי, והסיכוי לטעות מסוג ראשון גדל עוד. הדרך המלאה היא מודל שמתחשב בכיתות (פרק 36). ובכל מקרה, כדאי לנסח בזהירות: ההבדל הוא בין בתי ספר, ולא רק בין תוכניות.
תרגול עם הנתונים
בכל שאלה: קודם בחרו מבחן, ונמקו לעצמכם. רק אחר כך הריצו. ערך 99 מסמן נתון חסר ב־parent_edu, ב־siblings ובחלק מהפריטים.
הקבצים עצמם, care_school.csv ומילון המשתנים, נמצאים גם בתיקיית data בחבילת הספר.
- האם ההרגשה בכיתה לפני התוכנית (
clim_pre) שונה מ־3, אמצע הסולם?בדיקת התשובה
t למדגם בודד: M = 3.47, SD = 0.65, t(199) = 10.26, p < .001, d = 0.73. התלמידים מרגישים בכיתה טוב יותר מאמצע הסולם.
- האם הקשר עם המורה (
teach_pre,teach_post) השתנה בתוכנית העקיפה (group= 1)?בדיקת התשובה
t למדגמים תלויים: הקשר השתפר, מ־5.74 (SD = 0.89) ל־6.12 (SD = 0.84), t(50) = −4.36, p < .001, d = −0.61. הסימן שלילי כי חיסרנו לפני פחות אחרי. זה הגיוני: בתוכנית העקיפה דווקא המורות התאמנו.
- האם בנים ובנות שונים בפריט "אני מפחד/ת שאטעה מול כולם" (
a2)?בדיקת התשובה
מאן־ויטני, כי זה פריט בודד בסולם סדר. החציון אצל הבנים 2 ואצל הבנות 3. הדירוג הממוצע: בנים 92.46, בנות 107.92. U = 4220, z = −2.00, p = .046: הבנות מפחדות מעט יותר לטעות מול כולם, וההבדל בקושי מובהק.
- האם יש קשר בין השכלת ההורה (
parent_edu) לבין בעיות הקשב לפני התוכנית (attn_pre)?בדיקת התשובה
ספירמן, כי השכלת ההורה בסולם סדר. קודם מגדירים את 99 כחסר: נשארים 194 תלמידים. rs = .08, p = .266. אין קשר מובהק. ומה אם שוכחים להגדיר את 99 כחסר? בספירמן ששת התלמידים האלה נחשבים פשוט ל"השכלה הגבוהה ביותר", והתוצאה כמעט לא זזה (rs = .08, p = .289), אבל היא שגויה. בפירסון הנזק היה גדול יותר: הערך 99 רחוק מאוד מכל השאר, והמתאם אפילו מחליף סימן, מ־r = .06 ל־r = −.02.
- האם שיעור הבנות שונה בשלוש הקבוצות?
בדיקת התשובה
חי בריבוע לאי־תלות,
groupמולgender: χ²(2, N = 200) = 0.04, p = .982. שיעור הבנות כמעט זהה בשלוש הקבוצות, בין 51% ל־53%. כאן הדמיון נראה בעיקר באחוזים עצמם: ערך p לבדו לא היה מוכיח שהקבוצות שקולותGroup equivalence (פרק 23).
בפרק הבא מתחיל חלק ד: מודלים. נתחיל בענף שנשאר פתוח בעץ, שלוש קבוצות ויותר. נלמד ניתוח שונות חד־כיווני, שבודק את כל הקבוצות במבחן אחד, ונראה שגם הוא בנוי על אות חלקי רעש: השונות בין הקבוצותBetween-groups variance, חלקי השונות בתוכן.
מקורות: Tarrasch, R., & Berger, R. (2022). Comparing indirect and combined effects of mindfulness and compassion practice among schoolchildren on inter- and intra-personal abilities. Mindfulness. https://doi.org/10.1007/s12671-022-01955-y