Tweede beweging · Verschillen koppelen
Oefening 7.1 · Betrouwbaarheid en Cronbachs α
Interne consistentie · internal consistency
In deze oefening
Data bij deze oefening — bigfive.csv de Big Five-vragenlijst · diamantjes.csv de twaalf steentjes uit het boek · wat elke kolom betekent
prikkel
Vijf vragen die samen één ding willen meten
vragenlijst-items · samen één ding meten · Cronbachs α
Tweeduizend zeshonderd mensen vulden ooit een persoonlijkheidsvragenlijst in — de Big Five, echt afgenomen, vrij beschikbaar.1 Vijf van die vragen willen samen één ding meten: neuroticisme, hoe snel iemand van slag raakt. “Ik word makkelijk boos.” “Ik voel me vaak somber.” Vijf losse vraagjes, en de hoop dat ze samen iets samenhangends aftasten.
Maar hoe wéét je of die vijf vragen samen één ding meten, en niet vijf verschillende dingen? Daar is één getal voor, en het heet Cronbachs α (alpha). Trek even mee — we rekenen ’m uit, en daarna laat ik je een valkuil zien waar deze echte data zelf inloopt.
speel het
Dit is de enige oefening zonder diamantjes vooraf: Cronbachs α vraagt meerdere metingen van hetzelfde — losse items die samen één ding willen meten — en twaalf steentjes met elk één glans-getal zijn dat niet.
Bereken α in SPSS
itemanalyse · item-rest-correlatie · samenhang tussen items
Bij dit blok hoort bigfive.csv: 2634 rijen (de mensen) en 29 kolommen. Je gebruikt er hier tien: N1–N5 (neuroticisme) en O1–O5 (openheid), elk een antwoord van 1 tot 6. De andere vijftien uitspraken en de drie kolommen met leeftijd, sekse en opleiding laat je in dit blok met rust — wat ze allemaal betekenen staat op de datasetbladzij.
- Open
bigfive.csvin SPSS: File → Open → Data, bestandstype CSV. - Ga naar Analyze → Scale → Reliability Analysis.
- Voeg
N1tot en metN5toe aan het vak Items;iden de O-items laat je staan. Zet Model op Alpha. - Klik op Statistics en vink Item-total correlations aan (in de output heet die kolom Corrected Item-Total Correlation).
Bovenaan verschijnt Cronbach’s α = 0.81. α loopt van 0 tot 1, en .81 is hoog: de vijf neuroticisme-vragen bewegen flink samen op en neer. Wie op de ene hoog scoort, scoort op de andere ook hoog.
Kijk dan naar de kolom item-rest correlation in de itemtabel: hoe sterk hangt elk item samen met de som van de andere vier. Ze lopen van .48 (N5) tot .67 (N1 en N3) — allemaal ruim positief, geen enkel item hangt er dood bij. Zo ziet een schaal eruit waarvan de onderdelen echt samen één ding aftasten. SPSS rekent; jij leest.
snap het
Wat α wél en niet zegt
consistentie is geen validiteit · omgekeerde items · negatieve α
Waarom hier geen “schud het”? Omdat α geen waar-of-toeval?-vraag stelt — het is geen toets maar een maat voor hoe eensgezind de items zijn. Er is niets om los te schudden. Maar er zijn wél drie dingen die je erin kunt lezen die er níét in staan.
α is niet hetzelfde als validiteit. Dit is de belangrijkste. α zegt of je items consistent zijn — of ze hetzelfde blijven aanwijzen. Niet of ze het juiste aanwijzen. Vijf vragen kunnen prachtig samenhangen en met z’n allen iets ánders meten dan je denkt (hoe sociaal wenselijk iemand antwoordt, bijvoorbeeld). Een keukenweegschaal die altijd 3 kilo te veel toont, is volmaakt consistent en volstrekt fout. α meet de consistentie-kant, en alleen die.
α groeit vanzelf met de lengte. Meer items → hogere α, bijna gratis. Een lange lijst haalt bijna vanzelf een mooie α; dat bewijst niet dat elk item goed is, alleen dat er véél zijn.
En dan de valkuil waar deze echte data zelf inloopt. Draai dezelfde analyse op de vijf openheid-items, en er komt iets vreemds uit:
Draai Reliability Analysis op O1–O5 en bovenaan staat een negatieve α (rond de −.16) — onmogelijk. Aan de negatieve Corrected Item-Total Correlation zie je welke items omgekeerd zijn: O2 en O5. SPSS draait die niet vanzelf om — dat moet je eerst zelf doen: Transform → Recode into Different Variables, en keer voor die twee items de schaal om (1↔︎6, 2↔︎5, 3↔︎4). Draai de betrouwbaarheid opnieuw met de gedraaide items, en de α springt naar 0.60. (Sla je het recoderen over, dan blijft die negatieve, kapotte α staan — dat is juist de les.)
Een negatieve α — onmogelijk als maat, dus er is iets stuk. En dat iets is: sommige openheid-vragen zijn omgekeerd gesteld (reverse-scored). “Ik heb weinig fantasie” hoort bij lage openheid, terwijl “Ik zit vol ideeën” bij hóge openheid hoort. Tel je ze op zonder de omgekeerde eerst te draaien, dan werken ze elkaar tegen en stort α in. Draai je die twee items goed, dan komt er .60 uit — lager dan neuroticisme, en een eerlijker beeld van een bredere, lossere dimensie.
De les: α gaat ervan uit dat je items dezelfde kant op staan. Een getal onder de nul is geen slechte schaal maar een waarschuwing dat je iets vergat te draaien — en precies daarom kijk je nooit alleen naar de α, maar altijd ook naar de item-rest correlaties eronder. Die verklappen een dood of omgekeerd item; het ene totaalgetal verstopt het.
Voor wie verder wil — de andere drie manieren om te herhalen
De oefening is compleet zonder dit kader; sla het gerust over.
Je vond het menu onder Scale, en dat woord is ruimer dan α. Wat alle betrouwbaarheidsmaten gemeen hebben is de vraag of een tweede meting hetzelfde oplevert als de eerste; wat ze scheidt is alleen wát er dan herhaald wordt. Bij α zijn de items de herhaling, binnen één afname. Drie andere invullingen:
- test-hertest — je herhaalt de meetlat in de tijd: dezelfde lijst, dezelfde mensen, een paar weken later, en dan de correlatie tussen de twee momenten.
- parallelvorm — je herhaalt de meetlat in een andere gedaante: twee gelijkwaardige versies, tegelijk afgenomen. Dat is er niet voor de sier — bij test-hertest kent de tweede afname het leereffect, en dat drukt je getal een kant op die niets met je meetlat te maken heeft.
- interbeoordelaar — je herhaalt niet het instrument maar de beoordelaar: hetzelfde object, hetzelfde moment, dezelfde meetlat, iemand anders die oordeelt.
Bij alle drie ligt de correlatie voor de hand, en precies daar wacht een val — en net als bij de omgekeerde items zal SPSS je er niet op wijzen. Stel: twee beoordelaars geven twaalf objecten een cijfer, en de tweede is stelselmatig drie punten milder dan de eerste. Waar de eerste een 2 geeft, geeft de tweede een 5; waar de eerste een 8 geeft, geeft de tweede een 11. Twaalf objecten, twaalf keer oneens. Vraag SPSS om de correlatie tussen die twee kolommen en er staat 1.000 in de output, zonder één woord erbij.
Samenhang is geen overeenstemming. Wat een correlatie meet is of de twee beoordelaars dezelfde ordening aanbrengen. Wat je wilde weten was of ze hetzelfde cijfer geven. Dat zijn twee vragen, het eerste antwoord is hier volmaakt, het tweede is nul keer — en die 1.000 in je output houdt dat verschil onzichtbaar.
Rangordenen repareert dat niet. De rangen zijn identiek, dus de rangcorrelatie van Spearman — Pearson, maar dan over de rangen — komt óók op 1.00 uit. Wat je er wél mee wint is eerlijkheid: een rangcorrelatie beweert alleen iets over volgorde. Wil je weten of twee beoordelaars hetzelfde getal noemen, dan vraag je om een overeenstemmingsmaat — het percentage waarop ze exact gelijk zaten, of een intraklasse-correlatie in zijn overeenstemmings-vorm. Die rekent die drie punten wél als verschil.
En ook een hoge rangcorrelatie laat één ding onbesproken: over de uitersten zijn beoordelaars het meestal wel eens, en in het midden lopen ze uiteen. Eén getal over twaalf objecten zegt niet waar de onenigheid zat — dezelfde reden dat je onder je α altijd de itemtabel opendoet.
jouw beurt
De schaal-dokter
omgedraaide items · zwakste item · α na schrappen
De schaal-dokter. De openheid-schaal is hierboven al gered met check.keys = TRUE, maar helemaal gezond is hij nog niet. Zoek uit waar het zeurt. De laatste vraag heet Z): de aannames staan altijd achteraan, en die letter is met opzet geen volgletter.
Deze oefening ziet er anders uit dan de rest van de boekjes, en dat hoort zo: α vraagt om items — meerdere metingen van hetzelfde — waar de andere blokken twee variabelen tegen elkaar zetten. De vragen gaan dus over een tabel met tien kolommen en niet over een model.
Open bigfive.csv. Je hebt straks twee groepjes van vijf nodig: O1–O5 (openheid) en N1–N5 (neuroticisme).
In de statusbalk hoort 2634 rijen te staan en 29 kolommen. Van die 29 gebruik je er hier tien; de rest staat er voor andere oefeningen.
a) Draai Analyze → Scale → Reliability Analysis op O1–O5. Welke items moeten er om? Je herkent ze aan een negatieve item-total correlatie. (hoeveel het er zijn en welke)
b) Kijk wat α doet zolang je die twee items níét hebt omgedraaid. Waarom is die uitkomst geen slechte schaal maar een foutmelding in vermomming? (het getal, en één zin over wat er stukging)
c) Lees in Item-Total Statistics de kolom Corrected Item-Total Correlation — de samenhang van elk item met de som van de andere vier. Welk item hangt het slechtst samen? (de naam en zijn item-total correlatie)
d) En de andere vier? (het bereik waarbinnen ze liggen)
e) Lees in Item-Total Statistics de kolom Cronbach’s Alpha if Item Deleted en kijk wat er met α gebeurt als je precies dát item weggooit. Reken het daarna na door de analyse te draaien met één item minder. (de oude en de nieuwe α, en of de tabel en je eigen herberekening het eens zijn)
f) Doe hetzelfde bij neuroticisme, op N1–N5. Welk item is daar het zwakst? (de naam en zijn item-total correlatie)
g) Wat gebeurt er met α van neuroticisme als je dát item schrapt? Kijk goed naar de derde decimaal. (de oude en de nieuwe α op drie decimalen, en welke kant het op ging)
h) Bij openheid stijgt α van het schrappen, bij neuroticisme niet. Hoe kan hetzelfde trucje twee kanten op werken? (één zin, waarin zowel de sterkte van het item als de lengte van de schaal voorkomt)
i) Mag je dat openheid-item nu zomaar weggooien? (over de vragenlijst, niet over het getal)
j) α groeit vanzelf met de lengte van een schaal. Wat betekent dat voor iemand die alleen naar α kijkt om te beoordelen of een vragenlijst deugt? (één zin, en zeg erbij wat je dan wél moet bekijken)
Z) Mag je alles hierboven geloven? α leunt erop dat je vijf items vijf verschillende happen uit hetzelfde ding nemen. Kijk daarom niet alleen naar het ene totaalgetal maar ook naar de items onderling: vraag via Analyze → Correlate → Bivariate de correlatiematrix van N1–N5 op. Zoek het hoogste paar op en vergelijk het met de rest van de tabel.
a) Twee: O2 en O5.
b) Dan komt er α = −.161 uit. Een negatieve α is onmogelijk als maat — je kunt niet mínder dan niets samenhangen — en dus is het geen slechte schaal maar een melding dat er iets stuk is. Wat er stuk was: O2 en O5 zijn omgekeerd gesteld (“Ik heb weinig fantasie” hoort bij lage openheid), en opgeteld zonder eerst te draaien werken ze de andere drie tegen.
c) O4, met een item-total correlatie van .22.
d) De andere vier liggen tussen .34 en .46 — O2 op .34, O1 op .40, O5 op .42 en O3 op .46. O4 valt daar dus flink onder.
e) α gaat van .60 naar .62. De tabel en je eigen herberekening geven hetzelfde: zonder O4 komt er .6165 uit, tegen .6043 met alle vijf. Dat narekenen is de moeite waard — de tabel rekent hetzelfde, maar nu heb je het zélf gezien.
f) N5, met .48. Dat is het zwakste van de vijf, maar het ligt nog altijd ruim bóven het beste openheid-item.
g) α gaat van .812 naar .811 — hij zakt dus een piepklein beetje, in plaats van te stijgen. Op twee decimalen zie je er niets van: .81 blijft .81. Het zwakste item weggooien maakt een schaal niet vanzelf beter.
h) Twee dingen trekken aan het touw: schrappen maakt de schaal eensgezinder maar ook korter, en α beloont allebei. Bij openheid draagt O4 met .22 zo weinig bij dat de winst aan eensgezindheid de verloren lengte ruim goedmaakt; bij neuroticisme draagt N5 met .48 nog genoeg om die lengte te verdienen, en dan wint het verlies net.
i) Nee, niet op grond van dit getal alleen. α meet consistentie, niet validiteit: het zegt of de items hetzelfde blijven aanwijzen, niet of ze het júíste aanwijzen. Misschien tast O4 juist een hoekje van openheid af dat de andere vier laten liggen — dan koop je een mooier getal met een smallere vragenlijst. De vraag “wat vraagt O4 eigenlijk?” ga je niet met een correlatie beantwoorden maar met de vragenlijst erbij.
j) Dan kan hij een lange lijst voor een goede lijst aanzien: meer items geeft bijna gratis een hogere α, ook als elk afzonderlijk item slap is. Kijk dus altijd óók naar de item-rest correlaties eronder — die verklappen een dood of omgekeerd item, en het ene totaalgetal verstopt dat juist.
Z) Bijna, maar er zit een addertje bij neuroticisme, en je vindt hem in de correlatiematrix.
α gaat ervan uit dat de items vijf verschillende happen uit hetzelfde ding nemen. Neem je twee keer bijna dezelfde hap, dan hangen die twee items met elkaar samen om een reden die niets met de schaal te maken heeft — dezelfde woorden, dezelfde formulering — en dat duwt α omhoog zonder dat de schaal méér meet. Kijk: N1 en N2 correleren .71, terwijl geen enkel ander paar in die tabel boven de .56 komt. Die twee lijken verdacht veel op elkaar. Een deel van die mooie .81 is dus geleend van een dubbeling, en niet verdiend met bereik.
Twee andere dingen die α niet kan zien. Hij controleert niet of je items één ding meten of stiekem twee — een schaal die uit twee halve schalen bestaat kan een keurige α halen. En hij gaat ervan uit dat alle items even sterk meedoen; is dat niet zo, dan is α een ondergrens en niet de betrouwbaarheid zelf.
De weg terug:
- Blijft staan: alle item-total correlaties bij c), d) en f). Dat zijn gewone correlaties, beschrijvingen van deze 2634 mensen, en daar verandert geen aanname iets aan.
- Doe je over: de lezing van de .81 bij f) en g) als “deze schaal is betrouwbaar”. Met een dubbelend itempaar erin is dat getal te vriendelijk; de eerlijke stap is de twee items naast elkaar leggen en je afvragen of ze werkelijk twee vragen zijn.
En let op wat er níét bij hoeft: de α van openheid. Dáár is het hoogste paar .40 (O1 met O3), en dat is gewone samenhang binnen één ding. De zwakte van die schaal zit in O4 en niet in een dubbeling.
rapportage
Schrijf het op als een onderzoeker
APA-rapportage · Griekse letters rechtop · verleden tijd
Bij het gemiddelde was de rapportage een boodschappenlijstje van twee dingen: waar ligt het, hoe verspreid. Bij α is het lijstje nauwelijks langer — je vertelt wélke schaal je bekeek, bij wie, en hoe eensgezind de items waren:
De vijf neuroticisme-items vormden bij 2634 respondenten samen een schaal met een hoge interne consistentie (Cronbachs α = .81).
Let op twee dingen. Ten eerste de tijd: de items vormden, de consistentie was hoog — een rapportage vertelt wat je vónd, dus verleden tijd. Ten tweede iets geks met het cursief: M en SD schreef je schuin, maar α staat rechtop. Dat is echt de afspraak: Latijnse letters (M, SD, N, p) cursief, Griekse letters (α, en straks χ² en η²) rechtop. Klein weetje, groot gevoel-van-verzorgd.
Jouw beurt: schrijf de zin voor de openheid-schaal. Twee dingen verdienen daar een plek: dat twee items eerst zijn omgeschaald (reverse-scored), en de α die er daarna uitkwam (.60 met alle vijf de items, of .62 zonder het zwakste — kies er één en zeg welke je koos). Startzin mag je lenen: “Twee van de vijf openheid-items werden eerst omgeschaald; daarna …”
◠ Zelfde vorm in het boek
Hier: één getal dat zegt hoe eensgezind de items van een schaal samen één ding meten.
In het boek: W5 — Deugt je vragenlijst?
Daar draait het niet om de knop maar om de vraag eronder: wanneer mag een bundel losse items als één maat gelden — en wanneer verstopt dat ene getal wat de items apart je zouden vertellen?
Voetnoten
De
bfi-dataset uit het R-pakketpsych(Revelle) — 2800 respondenten op een Big-Five-vragenlijst (International Personality Item Pool). Wij nemen de 2634 mensen die alle tien de neuroticisme- en openheid-items invulden. Alle getallen zijn op die échte data nagerekend.↩︎