Samenvatting van GENMA08MVO voor het tentamen van 12 oktober 2026:
per thema de kern, de formules, een uitgewerkt voorbeeld en de valkuilen
uit oude tentamens. Elk thema heeft een eigen tabblad.
Tentamen en leerdoelen
Het tentamen is één digitaal tentamen met gesloten vragen (meerkeuze)
over kennis én begrip. Het formuleblad met tabellen krijg je erbij, dus
je moet vooral weten wanneer je welke formule gebruikt
en hoe je de tabellen afleest.
Leerdoel
Wat je moet kunnen
Tabblad
G1
Frequentiematen (prevalentie, incidentie, cumulatieve incidentie) en
associatiematen (RR, OR, HR, NNT) beschrijven en berekenen
1
G2
Een onderzoek beoordelen op validiteit en precisie: selectiebias,
informatiebias, confounding, effectmodificatie, regressie naar het
gemiddelde, (non-)differentiële misclassificatie
2
G3
Sensitiviteit en specificiteit berekenen, Bayes toepassen,
uitrekenen wanneer een test geïndiceerd is (testdrempels)
3
G4
Bij een vraagstelling het juiste design kiezen: cross-sectioneel,
cohort (pro-/retrospectief), case-control, (non-)gerandomiseerd
experiment, systematic review en meta-analyse
1 en 6
G5
Principes van onderzoeksopzet toepassen in eenvoudige
praktijksituaties
1, 2, 6 en 7
G6
Een geschikte analysemethode kiezen: risicoanalyse, survivalanalyse,
diagnostische en beslisanalyse, therapeutisch onderzoek; SPSS-output
lezen
3, 4 en 5
De cursus loopt in drie weken van vraagstelling naar analyse: week 1
risico en diagnose (plus basisstatistiek), week 2 prognose (overleving,
regressie, bias), week 3 therapie (RCT, ethiek).
Bron: Telling per vraag uit de dekkingscheck van de drie oude tentamens
(06_oefententamens)
Ruim de helft van de oude tentamenvragen is statistiek: een
betrouwbaarheidsinterval of toets uitrekenen met het formuleblad, of
SPSS-output van regressie, logistische regressie en Cox interpreteren.
Diagnostiek (Bayes, drempels, ROC) en RCT-designs leveren elk ongeveer 6
van de 40 vragen op. Ethiek en designkeuze zijn met 2–3 vragen per
tentamen klein, maar snel te leren.
De oude tentamens (2016–2017) hadden 39 of 40 vragen, meestal met 4
tot 6 antwoordopties; combinatievragen (“alleen 1 en 3”) hadden er tot
10. Het format van 2026 is ‘gesloten vragen’; reken op hetzelfde type
vragen.
Een deel van de RCT-vragen (Zelen, pseudo-randomisatie, sham) is
leerboekstof. Die staat in tabblad 6.
Formules in één oogopslag
Het formuleblad bevat de statistiek- en diagnostiekformules en alle
tabellen. De definities van de epidemiologische maten en
testeigenschappen staan er niet op: die moet je uit je
hoofd kennen.
Wat op het formuleblad staat (14 pagina’s; volledige
transcriptie in 07_formuleblad)
Pagina
Inhoud
Typische vraag
1
Gemiddelde, SD, referentie-interval, z-score, BI voor gemiddelde (z
of t), proportie en verschil van proporties; algemene regel Z = (X −
ω)/se(X) en de log-regel voor ratio’s
95%-BI voor een gemiddelde; referentie-interval vs BI
De drempels van pagina 7 (H = netto schade van behandelen bij
niet-zieken, B = netto baat bij zieken):
Wat je zelf paraat moet hebben (2×2-tabel met a =
blootgesteld/test+ én ziek, b = blootgesteld/test+ niet ziek, c = niet
blootgesteld/test− ziek, d = niet blootgesteld/test− niet ziek)
Grootheid
Formule
Let op
Prevalentie
zieken / totale populatie op één moment
Geen tijdseenheid
Cumulatieve incidentie
nieuwe gevallen / populatie at risk aan het begin
Altijd met periode (“5-jaars”)
Incidentiedichtheid
nieuwe gevallen / persoonstijd
Wel op p6 als IC = I/PJ
Prevalentie vs incidentie
P ≈ I × D
Stabiele situatie, zeldzame ziekte
Relatief risico
[a/(a+b)] / [c/(c+d)]
Alleen bij cohort en RCT
Odds ratio
ad / bc
Enige maat bij case-control; ≈ RR bij zeldzame uitkomst
Risicoverschil, NNT
ARR = p₀ − p₁; NNT = 1/ARR
NNT naar boven afronden
Attributieve fractie (blootgestelden)
(RR − 1)/RR
Populatie-attributieve fractie
pₑ(RR − 1) / [1 + pₑ(RR − 1)]
pₑ = aandeel blootgesteld in de populatie (Levin)
Sensitiviteit, specificiteit
a/(a+c); d/(b+d)
Kolom-kansen, prevalentie-onafhankelijk
PPV, NPV
a/(a+b); d/(c+d)
Rij-kansen, prevalentie-afhankelijk
Likelihood ratio
LR+ = sens/(1 − spec); LR− = (1 − sens)/spec
LR = 1: test zegt niets
Kans ↔︎ odds
odds = p/(1 − p); p = odds/(1 + odds)
Standaardfout
SE = SD/√n
SD beschrijft data, SE de schatting
Regressie-uitkomst
logistisch: OR = e^b; Cox: HR = e^b
Per eenheid toename van x
Verwachte waarde
Σ (kans × uitkomst) per tak
Terugrekenen van rechts naar links
Keuzehulp: design, maat en
toets
Begin altijd bij het type vraag: dat bepaalt het design, het design
bepaalt welke maat je mag berekenen, en het meetniveau van de uitkomst
bepaalt de toets.
Type vraag
Voorbeeld
Design
Maat
Analyse
Etiologie / risico
Verhoogt roken het risico op COPD?
Cohort; case-control bij zeldzame ziekte of lange latentietijd
RR, IC-ratio, HR; bij case-control alleen OR
χ², logistische regressie, Cox
Diagnose
Hoe goed sluit CT-angiografie CAD uit?
Cross-sectioneel: indextest én referentiestandaard bij iedereen
Sens, spec, LR, PPV/NPV, AUC
2×2-tabel, ROC
Prognose
Hoe groot is de 5-jaarsoverleving na diagnose?
Cohort (bij voorkeur inceptiecohort)
S(t), mediane overleving, HR
Kaplan-Meier, log-rank, Cox
Therapie
Is middel A beter dan B?
RCT; observationeel alleen met aandacht voor confounding by
indication
RR, ARR, NNT, verschil in gemiddelden, HR
t-toets, χ², Cox; intention-to-treat
Bewijs samenvatten
Wat zeggen alle trials samen?
Systematic review met meta-analyse
Gepoolde RR/OR/verschil
Forest plot
Welke toets? Volg het stroomschema op pagina 14 van
het formuleblad. Per vakje staat links de parametrische toets (bij
normaal verdeelde data of grote n), rechts het non-parametrische
alternatief.
Fisher exact gebruik je als een verwachte celwaarde kleiner is dan
5.
Welk regressiemodel? Hangt af van de uitkomst, niet
van de determinanten.
Uitkomst
Model
Coëfficiënt b betekent
Effectmaat
Continu (bloeddruk)
Lineaire regressie
Verandering in gemiddelde y per eenheid x
b zelf
Dichotoom (wel/niet ziek)
Logistische regressie
Verandering in log-odds
OR = e^b
Tijd tot event (met censurering)
Cox proportional hazards
Verandering in log-hazard
HR = e^b
Samenhang twee continue variabelen
Pearson (normaal) of Spearman (rangen)
Sterkte en richting, −1 tot 1
r, r²
Bronnen in je kennisbank
Alles hieronder staat in
~/Desktop/GENMA08MVO/_kennisbank/; begin bij
00_INDEX.md.
Tabblad
Belangrijkste bronnen
Oefenen
1 · Maten & designs
01_colleges/MvO1_WL2 (risico- en associatiematen),
MvO1_WL3 (opzet van onderzoek)
Statistiekopgaven 11–14, 17
2 · Validiteit
01_colleges/MvO2_WL3-4 (gevaren in studieopzet),
04_epidemiologie/MvO2_ZO3
ZO3 observationele studies
3 · Diagnostiek
02_diagnose/ZO2.1–ZO6.1 en de
Excel-oplossingen
Canvas-assignments en post-session quizzen, Q&A-oefenvragen
Oude tentamens met antwoorden: 06_oefententamens/ (feb
2016, feb 2017, her 2017).
Hoofdstuk 1 van 7
1 · Frequentie- en associatiematen, studiedesigns
Frequentiematen
Een frequentiemaat zegt hoe vaak een ziekte voorkomt. Prevalentie
telt bestaande gevallen op één moment; cumulatieve
incidentie en incidentiedichtheid tellen nieuwe
gevallen over een periode.
Badkuipmodel. De kraan is de incidentie, het water
in de kuip de prevalentie. De kuip loopt leeg door herstel en
sterfte.
In een stabiele situatie geldt daarom P ≈ I × D (D =
gemiddelde ziekteduur). Een ziekte die vaak voorkomt maar snel geneest
(verkoudheid) heeft een hoge incidentie en een lage prevalentie. Een
chronische ziekte met goede overleving (diabetes) heeft een hoge
prevalentie bij een lage incidentie.
Rekenvoorbeeld (college WL2). Tien personen worden 6
jaar gevolgd. Vier krijgen de ziekte, twee overlijden; samen leveren ze
47 persoonsjaren follow-up.
Prevalentie op t = 0 is 0/10 = 0; op t = 6 is 3/8 =
0.375 (3 levende zieken onder de 8 nog levenden).
Incidentiedichtheid = 4/47 = 0.085 per persoonsjaar = 8.5
per 100 persoonsjaren. Volg je 100 mensen één jaar, dan
verwacht je 8.5 nieuwe gevallen.
Volg je dezelfde mensen langer (62 persoonsjaren) met dezelfde 4
events, dan daalt de IR naar 4/62 = 6.5 per 100 PJ. De noemer telt dus
mee.
Van incidentiedichtheid naar risico (formuleblad
p6): CI_t = 1 − exp(−IR × t). Met IR = 0.085 per jaar is het 5-jaars
risico 1 − e^(−0.425) = 0.35, iets minder dan 0.085 × 5
= 0.425. Het verschil ontstaat doordat wie al ziek is, niet opnieuw ziek
kan worden.
Kans en odds. Van 100 mensen zijn er 10 ziek: kans p
= 10/100 = 0.10, odds = 10/90 = 0.11. Bij zeldzame uitkomsten liggen
kans en odds dicht bij elkaar; bij vaak voorkomende uitkomsten niet (p =
0.5 geeft odds = 1).
Associatiematen
Een associatiemaat vergelijkt de uitkomst tussen blootgestelden en
niet-blootgestelden. Ratio’s (RR, OR, HR) zeggen hoeveel keer zo groot
het risico is; verschillen (RD, ARR, NNT) zeggen hoeveel extra of minder
gevallen dat oplevert.
Event
Geen event
Totaal
Blootgesteld / behandeld
a
b
a + b
Niet blootgesteld / controle
c
d
c + d
Maat
Formule
Interpretatie
Design
Relatief risico (RR)
[a/(a+b)] / [c/(c+d)]
Risico blootgestelden gedeeld door risico niet-blootgestelden
Cohort, RCT
Odds ratio (OR)
(a/b)/(c/d) = ad/bc
Odds blootgestelden gedeeld door odds niet-blootgestelden
Alle designs; de enige bij case-control
Hazard ratio (HR)
h₁(t)/h₀(t), uit Cox: e^b
Verhouding van de momentane incidentie, over de hele follow-up
Cohort, RCT met tijd-tot-event
Risicoverschil (RD)
a/(a+b) − c/(c+d)
Extra risico door blootstelling (negatief = beschermend)
Cohort, RCT
Absolute risicoreductie (ARR)
c/(c+d) − a/(a+b) = −RD
Risico dat de behandeling wegneemt
RCT
Relatieve risicoreductie (RRR)
1 − RR
Welk deel van het risico verdwijnt
RCT
Number needed to treat (NNT)
1/ARR
Aantal te behandelen om één event te voorkomen, in een gegeven
periode
RCT
Ratio’s: > 1 = verhoogd risico (of schadelijke behandeling), = 1 =
geen verband, < 1 = verlaagd risico (of effectieve behandeling). Bij
verschillen ligt het nulpunt op 0.
Rekenvoorbeeld: aspirine en hartinfarct (10 jaar, college
WL2). Aspirine: 50 infarcten bij 500 mensen; geen aspirine: 100
bij 500.
Risico’s: 50/500 = 0.10 en 100/500 = 0.20.
RR = 0.10/0.20 = 0.50, dus RRR = 50%.
ARR = 0.20 − 0.10 = 0.10, dus NNT = 1/0.10 =
10: behandel 10 mensen 10 jaar om één infarct te
voorkomen.
OR = (50/450)/(100/400) = 0.111/0.25 = 0.44. Die
ligt verder van 1 dan de RR, omdat de uitkomst niet zeldzaam is.
95%-BI (formuleblad p6): se(log OR) = √(1/50 + 1/450 + 1/100 +
1/400) = 0.186, dus 0.44 × e^(±1.96 × 0.186) = 0.31 tot
0.64. Voor de RR: se(log RR) = 0.161, BI 0.36 tot 0.69.
RRR en ARR vertellen een ander verhaal. Een RRR van 50% klinkt even
indrukwekkend bij een basisrisico van 20% (ARR 0.10, NNT 10) als bij
0.2% (ARR 0.001, NNT 1000). Voor klinische beslissingen tellen ARR en
NNT.
Waarom de OR? De OR benadert de RR alleen als de
uitkomst zeldzaam is (vuistregel: onder de 10%). Daarboven ligt de OR
verder van 1 dan de RR.
Bron: Berekend: OR = 2(1 − p₀)/(1 − 2p₀) bij RR = 2
In een case-controlstudie kies je zelf hoeveel cases en controles je
neemt. De rijtotalen (a + b, c + d) zijn dan kunstmatig en een RR is
zinloos. De OR kan wel, want die is symmetrisch: de odds op
blootstelling bij cases gedeeld door die bij controles is gelijk aan de
odds op ziekte bij blootgestelden gedeeld door die bij
niet-blootgestelden.
College-voorbeeld (heel Rotterdam)
RR
OR
Cohort: 15.000/150.000 blootgesteld vs 25.000/450.000 niet
1.80
1.89
Case-control uit dezelfde populatie, 1000 cases en 1000
controles
‘RR’ = 1.35 (fout)
1.90
De OR uit de case-controlstudie (1.90) klopt dus met de OR van het
cohort. De ‘RR’ uit de case-controlstudie niet.
Attributieve maten
Attributieve maten vertalen een verband naar volksgezondheidswinst:
hoeveel ziekte komt door de blootstelling, en hoeveel verdwijnt als je
de blootstelling wegneemt? Het verschil zit in de noemer: de
blootgestelden of de hele populatie.
Maat
Formule
Vraag die het beantwoordt
Attributief risico (risicoverschil)
Iₑ − I₀
Hoeveel extra gevallen per blootgestelde?
Attributieve fractie bij blootgestelden (etiologische fractie)
(Iₑ − I₀)/Iₑ = (RR − 1)/RR
Welk deel van de ziekte bij blootgestelden komt
door de blootstelling?
Populatie-attributieve fractie (PAF, PAR%)
(Iₚ − I₀)/Iₚ = pₑ(RR − 1) / [1 + pₑ(RR − 1)]
Welk deel van alle gevallen in de populatie komt
door de blootstelling?
Iₑ, I₀, Iₚ = incidentie bij blootgestelden, niet-blootgestelden en in
de hele populatie; pₑ = aandeel blootgestelden in de populatie.
Rekenvoorbeeld: roken en longkanker (verzonnen,
ronde getallen). Incidentie bij rokers 100, bij niet-rokers 10 per
100.000 persoonsjaren; 25% van de populatie rookt.
Zou niemand meer roken, dan verdwijnt dus 69% van alle longkanker in
de populatie.
De PAF hangt af van twee dingen: de sterkte van het verband (RR) én
hoe vaak de blootstelling voorkomt. Een zwakke maar zeer veelvoorkomende
risicofactor (hoge bloeddruk) kan een grotere PAF hebben dan een sterke
maar zeldzame (een erfelijke mutatie).
Oud tentamen 2016, vraag 35: “de proportie longkankerpatiënten in de
algemene populatie die longkanker krijgt vanwege roken” = het
populatie-attributief risico.
Studiedesigns
De eerste vraag bij elk design is: wie bepaalt de blootstelling? Doet
de onderzoeker dat, dan is het experimenteel; doen de natuur of de
deelnemers het, dan is het observationeel. Daarna telt het startpunt:
begin je bij de blootstelling (cohort) of bij de uitkomst
(case-control)?
Tijdsvolgorde; absolute én relatieve risico’s; meerdere uitkomsten;
zeldzame blootstellingen
Duur, lang; ongeschikt voor zeldzame ziekten; loss to follow-up
Case-control
Uitkomst op T0 (cases en controles), terugkijken naar blootstelling
(T−1)
Alleen OR
Zeldzame ziekten, lange latentietijd; efficiënt
Geen incidentie of absoluut risico; recall bias; keuze van controles
(selectiebias)
RCT
Loting op T0, uitkomst later
RR, ARR, NNT, HR
Voorkomt confounding (ook onbekende)
Duur; niet altijd ethisch of haalbaar; strenge selectie beperkt
generaliseerbaarheid
Before-after / historische controle
Uitkomst vóór en na de interventie
Verschil
Haalbaar als loting niet kan
Tijdtrends, regressie naar het gemiddelde, andere zorg
Systematic review en meta-analyse
Bestaande studies samengevat
Gepoolde maat
Hoogste bewijsniveau, meeste precisie
Zo goed als de studies erin; publicatiebias
Prospectief of retrospectief gaat over wanneer de
gegevens verzameld worden, niet over de richting van het design. Een
prospectief cohort meet de blootstelling nu en wacht op de uitkomsten.
Een retrospectief (historisch) cohort gebruikt bestaande dossiers waarin
blootstelling én uitkomst al vastliggen, maar redeneert nog steeds van
blootstelling naar uitkomst (voorbeeld uit ZO3: Kendzerska, slaapapneu
en cardiovasculaire events, een ‘decade-long historical cohort’).
Gesloten of open cohort. In een gesloten cohort
start iedereen tegelijk en kan het aantal alleen dalen; je kunt CI en IR
direct berekenen. In een open (dynamisch) cohort komen en gaan
deelnemers op verschillende momenten; dan kun je alleen de IR
berekenen.
Designherkenning uit oude tentamens
Kinderen met en zonder autisme worden op de kinderpsychiatrie
geïncludeerd; daarna vraagt men de moeders naar vitamine D in de
zwangerschap. Start bij de uitkomst: case-control
(2016, v36).
Onderzoekers registreren telefoongebruik tijdens colleges en delen
na het tentamen in naar geslaagd of gezakt; ze rapporteren een RR = 2.
Start bij de blootstelling, uitkomst later: cohort
(2017, v35). Dat er een RR wordt gerapporteerd, is een extra hint.
Onderzoek naar de oorzaken van een ziekte heet
etiologisch onderzoek (2017, v37).
Bewijshiërarchie voor een vraag over effect of
oorzaak: systematic review van RCT’s > RCT > cohort >
case-control > cross-sectioneel > case series en expertopinie.
Kies altijd het design dat de vraag én de praktische situatie past: voor
een zeldzame ziekte is een case-controlstudie vaak de beste haalbare
optie.
Valkuilen en typische
tentamenvragen
Valkuil
Hoe het wel zit
Een RR berekenen uit een case-controlstudie
Je kiest zelf het aantal cases en controles, dus de rijtotalen zijn
kunstmatig. Alleen de OR is geldig.
OR en RR als uitwisselbaar zien
Alleen bij een zeldzame uitkomst (< 10%). Daarboven ligt de OR
verder van 1.
Een cumulatieve incidentie zonder periode
“Risico 0.2” zegt niets zonder “in 5 jaar”. Een IR heeft een
eenheid: per persoonsjaar.
Prevalentie en incidentie verwarren
Prevalentie = bestaande gevallen, incidentie = nieuwe. Een snel
genezende ziekte: hoge I, lage P. Betere overleving bij gelijke
incidentie: hogere prevalentie (ZO.D v9 en v12).
NNT uitrekenen met de RRR
NNT = 1/ARR, altijd bij een gegeven periode. Rond naar boven af (NNT
24.3 wordt 25).
Elke schatting kan op twee manieren fout zitten: door toeval
(onprecies) of door een systematische fout (niet valide, bias). Een
grotere steekproef maakt een schatting preciezer, maar lost bias niet
op.
Wat is het?
Vraag
Oplossing
Precisie (betrouwbaarheid)
Afwezigheid van toevallige fout
Krijg ik hetzelfde resultaat als ik de studie herhaal?
Grotere n, preciezere metingen
Interne validiteit
Afwezigheid van systematische fout in deze studie
Meet ik wat ik wil meten, in deze populatie?
Goed design: selectie-, informatie- en confoundingbias
voorkomen
Externe validiteit (generaliseerbaarheid)
Geldigheid buiten de studiepopulatie
Geldt dit ook voor mijn patiënt?
Representatieve populatie, pragmatische opzet
In het college is dit een dartbord: pijlen dicht bij elkaar maar
naast de roos = precies, niet valide. Pijlen verspreid rond de roos =
valide, niet precies.
Bron: Illustratie, verzonnen getallen
In het derde scenario ligt het hele smalle BI naast de ware waarde:
je bent zeker van een fout antwoord. Dat maakt bias gevaarlijker dan
toeval.
Interne validiteit kent drie bedreigingen, die de
volgende secties behandelen: selectiebias, informatiebias en
confounding. Voor externe validiteit geldt: een aselecte steekproef is
nuttig voor beschrijvend onderzoek (hoe vaak komt iets voor?). Voor
onderzoek naar verbanden is een homogene populatie vaak juist beter,
omdat die minder ruis en confounding geeft.
Voorbeeld (ZO.D, vraag 2). In Enschede, de stad met
het laagste gemiddelde inkomen, is het gemiddelde geboortegewicht van
1000 baby’s 3165 g tegen 3420 g landelijk; 53% is een jongen tegen 50%
landelijk.
Het gewichtsverschil van 255 g is bij n = 1000 veel te groot voor
toeval en past bij sociaaleconomische verschillen: een
systematisch verschil.
Het geslachtsverschil is 3 procentpunt, bij een SE van 1.6
procentpunt, en er is geen mechanisme via inkomen:
toeval.
Selectiebias
Selectiebias ontstaat als de kans om in de studie te komen (of te
blijven) verschilt tussen blootgestelden en niet-blootgestelden
én samenhangt met de uitkomst. Bij case-control is het
omgekeerd: de selectie van cases of controles hangt samen met de
blootstelling. Eenmaal in je data is het bijna niet te repareren; je
voorkomt het met het design.
Vorm
Design
Mechanisme
Voorbeeld
Self-referral / zelfselectie
Case-control
Controles melden zich zelf aan en zijn gezondheidsbewuster dan de
bronpopulatie
Longkanker: cases uit de kliniek, controles via een
krantenadvertentie (minder rokers)
Healthy worker effect
Cohort
Wie werkt (en in het cohort komt), is gezonder dan wie ziek thuis
zit
Fabrieksarbeiders met toxische blootstelling vs
kantoorpersoneel
Loss to follow-up
Cohort, RCT
Uitval verschilt tussen de groepen en hangt samen met de
uitkomst
Patiënten met ernstige COPD én hart- en vaatziekten komen minder
naar vervolgmetingen
Non-respons
Alle
Wie meedoet, verschilt van wie weigert
Vragenlijstonderzoek met 30% respons
Keuze van controles
Case-control
Controles komen niet uit dezelfde bronpopulatie als de cases
Ziekenhuiscontroles met andere ziekten die met de blootstelling
samenhangen
Rekenvoorbeeld 1: self-referral (college WL3–4). 100
cases en 100 controles.
Rokers bij cases
Rokers bij controles
OR
Werkelijkheid
80 van 100 (odds 4)
20 van 100 (odds 0.25)
4/0.25 = 16
Controles via de krant
80 van 100 (odds 4)
10 van 100 (odds 0.11)
4/0.11 = 36
De gezondheidsbewuste controles roken minder, dus het verband lijkt
veel sterker dan het is.
Rekenvoorbeeld 2: healthy worker effect. In
werkelijkheid krijgt de helft van zowel de blootgestelden als de
niet-blootgestelden COPD (20/40 en 20/40, RR = 1). Maar alleen de
gezonde blootgestelde werkers komen in het cohort. Dan wordt de CI bij
blootgestelden 5/20 = 0.25 en bij niet-blootgestelden 12.5/30 = 0.42: RR
= 0.60 (het college rondt 0.42 af naar 0.4 en komt zo
op 0.63). De toxische blootstelling lijkt beschermend.
Oplossingen
Het design: cases en controles uit dezelfde bronpopulatie, een
interne vergelijkingsgroep (werkers met vs zonder blootstelling in
hetzelfde bedrijf).
Loss to follow-up zo klein mogelijk houden.
Geavanceerde statistiek (inverse probability weighting) vraagt
informatie over wie niet meedeed, en die ontbreekt meestal.
In een RCT ontstaat selectiebias bij de start alleen als de
toewijzing voorspelbaar is (geen allocation concealment). Tijdens de
studie kan hij nog ontstaan door selectieve uitval.
Informatiebias en
misclassificatie
Informatiebias ontstaat door fouten in het meten van de
blootstelling, de uitkomst of een confounder. Het belangrijkste
onderscheid is of de meetfout afhangt van de andere
variabele. Zo niet, dan is de fout non-differentieel en verdunt het
effect richting 1. Zo wel, dan is hij differentieel en kan het effect
alle kanten op.
Non-differentieel (random)
Differentieel (niet-random)
Definitie
De meetfout is even groot bij zieken en niet-zieken (of bij
blootgestelden en niet-blootgestelden)
De meetfout in de blootstelling hangt samen met de uitkomst, of
andersom
Effect op RR/OR
Verdunning richting 1 (onderschatting)
Over- óf onderschatting
Voorbeelden
Onnauwkeurige vragenlijst over roken, bij iedereen even slecht;
bloeddrukmeter die willekeurig afwijkt
Blinderen, symmetrisch verzamelen, objectieve bronnen (dossiers in
plaats van herinnering)
Vormen van differentiële misclassificatie (college
WL3–4)
Recall bias: patiënten met een hartziekte
herinneren zich hun dieet anders dan gezonde controles. Typisch voor
case-controlstudies. Voorbeeld: moeders van kinderen met autisme denken
langer na over wat ze in de zwangerschap slikten.
Niet-blinderen: een onderzoeker die weet wie het
middel kreeg, beoordeelt de uitkomst (onbewust) anders.
Diagnostic suspicion: een arts die weet dat iemand
rookt, zoekt eerder naar longkanker en vindt die dus vaker.
Asymmetrische dataverzameling: de ene groep wordt
grondiger onderzocht dan de andere.
Rekenvoorbeeld: non-differentiële misclassificatie van
roken (naar het college, met ronde getallen). In werkelijkheid
krijgen 200 van de 400 rokers longkanker (0.50) en 100 van de 400
niet-rokers (0.25): RR = 2.0. Nu wordt een kwart van elke groep verkeerd
geregistreerd, los van of ze ziek zijn: 100 rokers (50 zieken) als
niet-roker, 100 niet-rokers (25 zieken) als roker.
Wie zitten erin
Zieken
Risico
Geregistreerd als roker
300 echte rokers + 100 niet-rokers
150 + 25 = 175
175/400 = 0.44
Geregistreerd als niet-roker
300 echte niet-rokers + 100 rokers
75 + 50 = 125
125/400 = 0.31
De gemeten RR is 0.44/0.31 = 1.4 in plaats van 2.0:
het verband wordt verdund richting 1. In het college zakte de RR op
dezelfde manier van 2 naar 1.2.
Een nuance uit het college: misclassificatie van alleen de
uitkomst in een cohort verandert de RR niet, zolang er
alleen gemiste gevallen zijn (sensitiviteit < 1) en geen
fout-positieven. Mis je bij beide groepen 20% van de gevallen, dan
krimpen beide risico’s met dezelfde factor en blijft de ratio gelijk.
Het risicoverschil wordt wel kleiner.
Confounding
Confounding is een vertekening door een gedeelde
oorzaak van blootstelling en uitkomst. Het verband dat je ziet,
komt dan (deels) door die derde variabele en niet door de blootstelling
zelf.
Een variabele is een confounder als hij aan drie voorwaarden
voldoet:
Hij is een risicofactor voor de uitkomst (ook bij
niet-blootgestelden).
Hij hangt samen met de blootstelling.
Hij ligt niet op het causale pad tussen
blootstelling en uitkomst (geen intermediair of mediator).
Bovenste rij: foliumzuur hangt samen met vitamine D-gebruik en met
autisme. Het is dus een confounder (oud tentamen 2016, v37). Onderste
rij: hoge bloeddruk ligt op het pad van overgewicht naar een beroerte.
Dat is een mediator en daarvoor corrigeer je niet, tenzij je juist het
mechanisme wilt ontrafelen.
Rekenvoorbeeld (college WL3–4). Ruw krijgt 20 van de
40 blootgestelden de uitkomst (0.50) tegen 10 van de 40
niet-blootgestelden (0.25): RR = 2.0. Nu splits je naar de
confounder:
Stratum
Blootgesteld
Niet blootgesteld
RR
Confounder aanwezig
18/30 = 0.60
5/10 = 0.50
1.2
Confounder afwezig
2/10 = 0.20
5/30 = 0.17
1.2
Ruw (samen)
20/40 = 0.50
10/40 = 0.25
2.0
Bron: College MvO2 WL3–4, slides 39–40
De confounder komt veel vaker voor bij blootgestelden (30 van 40) dan
bij niet-blootgestelden (10 van 40) én verhoogt zelf het risico.
Daardoor lijkt de blootstelling schadelijker dan ze is. Binnen elk
stratum is de RR 1.2: dat is het gecorrigeerde effect. De vuistregel:
verandert de schatting na correctie met meer dan ongeveer 10%, dan was
er relevante confounding.
Confounding by indication. Een cohortstudie vindt
dat statinegebruikers vaker hart- en vaatziekten krijgen. Dat komt niet
door de statine, maar doordat artsen juist mensen met een hoog risico
een statine voorschrijven. De indicatie voor de behandeling is de
confounder. Dit is het grote probleem van observationeel onderzoek naar
behandeleffecten.
Hoe pak je confounding aan?
Moment
Methode
Hoe het werkt
Nadeel
Design
Randomisatie
Verdeelt bekende én onbekende confounders gelijk over de
groepen
Alleen bij interventies; niet altijd ethisch
Design
Restrictie
Alleen één categorie van de confounder insluiten (bijv. alleen
niet-rokers)
Minder generaliseerbaar, kleinere n
Design
Matching
Per case een controle met dezelfde waarde van de confounder (vaak
leeftijd en geslacht)
Het effect van de matchingvariabele kun je niet meer schatten
Analyse
Stratificatie
Effect per stratum schatten, daarna gewogen samenvoegen
(Mantel-Haenszel)
Werkt slecht bij veel confounders tegelijk
Analyse
Multivariabele regressie
Confounder als extra variabele in het model: lineair, logistisch,
Cox
Alleen voor gemeten confounders, en goed gemeten
Analyse
Instrumentele variabele
Een variabele die alleen via de blootstelling op de uitkomst
werkt
Geschikte instrumenten zijn zeldzaam
Alleen randomisatie corrigeert ook voor confounders die je niet kent
of niet gemeten hebt. Alle andere methoden werken alleen voor wat je
hebt gemeten; er blijft altijd kans op ‘residuele confounding’.
Effectmodificatie en
interactie
Er is effectmodificatie als het effect van de blootstelling
verschilt tussen subgroepen van een derde variabele.
Dat is geen fout om weg te werken, maar een bevinding: je rapporteert
het effect per subgroep.
Voorbeeld (oud tentamen 2017, v35–36). Veel
telefoongebruik tijdens college verdubbelt de kans om te zakken. Maar
bij een smartphone is de OR 4, bij een ouderwetse telefoon 1. Het soort
telefoon is een effectmodificator.
Het verschil zie je na stratificeren
Ruwe RR
RR stratum 1
RR stratum 2
Conclusie
2.0
1.2
1.2
Strata gelijk aan elkaar, maar anders dan ruw:
confounding. Rapporteer de gecorrigeerde (gepoolde)
RR.
2.0
4.0
1.0
Strata verschillen van elkaar: effectmodificatie.
Rapporteer per stratum; een gepoolde RR is misleidend.
2.0
2.0
2.0
Geen confounding, geen effectmodificatie.
Confounding
Effectmodificatie
Wat is het?
Vertekening door een gedeelde oorzaak
Echt verschil in effect tussen subgroepen
Wat doe je ermee?
Wegwerken (corrigeren)
Beschrijven en rapporteren
Hangt af van de studie?
Ja: van hoe de variabele in deze populatie verdeeld is
Nee: een biologisch of klinisch gegeven
Kan randomisatie het oplossen?
Ja
Nee, en dat hoeft ook niet
In een regressiemodel heet effectmodificatie
interactie. Je voegt een productterm toe, bijvoorbeeld leeftijd
× geslacht. Is de coëfficiënt van die term significant, dan verschilt
het effect van leeftijd tussen mannen en vrouwen (hertentamen 2017,
v16–20; zie tabblad 5).
Een variabele kan tegelijk confounder en effectmodificator zijn.
Stratificeer dan en rapporteer per stratum.
Regressie
naar het gemiddelde en van verband naar oorzaak
Regressie naar het gemiddelde. Selecteer je mensen
op een extreme meting, dan ligt hun volgende meting gemiddeld dichter
bij het populatiegemiddelde, ook zonder enige behandeling. Elke meting
bevat toevallige variatie (meetfout, dag-tot-dagvariatie). Wie net op
een ‘hoge dag’ werd gemeten, komt in de extreme groep en meet de
volgende keer normaler.
Voorbeeld (verzonnen)
Meting 1
Meting 2, zonder behandeling
Hele populatie
130 mmHg
130 mmHg
Geselecteerd omdat meting 1 ≥ 160 was
168 mmHg
158 mmHg
In een before-after-studie zonder controlegroep lijkt een nieuwe
bloeddrukpil dan 10 mmHg te werken, terwijl dat verschil er ook zonder
pil was.
Voorkomen: een (gerandomiseerde) controlegroep, die
hetzelfde regressie-effect heeft; meerdere metingen bij inclusie; een
aparte baselinemeting na de selectiemeting.
Herken het in vragen met “patiënten met een extreem hoge waarde
werden geselecteerd” en “voor en na” zonder controlegroep.
Vijf verklaringen voor een gevonden verband. Voordat
je tot oorzaak concludeert, sluit je de andere vier uit.
Verklaring
Vraag
Zie
Toeval
Is het BI smal, is de p-waarde klein, is er niet op tientallen
dingen getoetst?
Tabblad 4
Bias
Selectie- of informatiebias?
Hierboven
Confounding
Een gedeelde oorzaak?
Hierboven
Omgekeerde causaliteit
Veroorzaakt de uitkomst de blootstelling? (Mensen met beginnende
ziekte gaan minder bewegen.)
Designs, tabblad 1
Oorzaak
Pas als het bovenstaande is uitgesloten
Hill-criteria
Hill-criteria (1965) helpen bij het beoordelen van
causaliteit:
Sterkte: een sterk verband is minder makkelijk weg
te verklaren door bias of confounding.
Consistentie: hetzelfde in verschillende studies en
populaties.
Specificiteit: deze blootstelling leidt vooral tot
deze uitkomst.
Temporaliteit: de blootstelling gaat vooraf aan de
uitkomst. Dit is het enige absoluut noodzakelijke criterium.
Biologische gradiënt: meer blootstelling geeft meer
effect (dosis-respons).
Plausibiliteit: er is een geloofwaardig
mechanisme.
Coherentie: past bij wat we al weten.
Experiment: wegnemen van de blootstelling verandert
de uitkomst.
Analogie: vergelijkbare blootstellingen hebben
vergelijkbare effecten.
Multiple testing. Toets je 20 hypotheses met α =
0.05, dan verwacht je er één ‘significant’ door toeval. Een GWAS toetst
miljoenen varianten en gebruikt daarom p < 5 × 10⁻⁸ (college WL3–4).
De eenvoudigste correctie is Bonferroni: α gedeeld door het aantal
toetsen.
Valkuilen en typische
tentamenvragen
Valkuil
Hoe het wel zit
“Met een grotere steekproef verdwijnt de bias”
Een grotere n verkleint alleen de toevallige fout. Selectie-,
informatie- en confoundingbias blijven (hertentamen 2017, v34).
“Randomisatie voorkomt alle bias”
Randomisatie voorkomt confounding. Voor informatiebias heb je
blindering nodig; voor selectiebias allocation concealment en weinig
uitval (2017, v34).
Corrigeren voor een mediator
Een variabele op het causale pad is geen confounder. Corrigeren
haalt een deel van het echte effect weg.
Confounding en effectmodificatie verwarren
Strata gelijk aan elkaar maar anders dan ruw = confounding. Strata
verschillend van elkaar = effectmodificatie.
“Non-differentieel = geen probleem”
Non-differentiële misclassificatie verdunt het effect richting 1:
een echt effect kan onzichtbaar worden.
Recall bias in een cohort zoeken
Recall bias hoort vooral bij case-controlstudies: de blootstelling
wordt achteraf gevraagd, ná de diagnose.
Een before-after-effect geloven
Zonder controlegroep kunnen regressie naar het gemiddelde,
tijdtrends en het natuurlijk beloop het ‘effect’ verklaren.
Selectiebias en confounding verwarren
Selectiebias gaat over wie in de studie komt; confounding over een
derde variabele die ook in de volledige populatie meespeelt.
Zo worden deze onderwerpen gevraagd
Een casus met een derde variabele en de vraag: confounding,
effectmodificatie, informatiebias of selectiebias? Kijk of de variabele
een gedeelde oorzaak is (confounding), het effect verandert
(effectmodificatie), met meten te maken heeft (informatie) of met wie
meedoet (selectie).
Welke methode corrigeert voor confounding in design of analyse?
In welke richting vertekent deze bias de RR of OR?
Hoofdstuk 3 van 7
3 · Diagnostiek en besliskunde
Kansen, odds en de 2×2-tabel
Sensitiviteit en specificiteit beschrijven de test: ze kijken
per kolom (zieken, niet-zieken) en hangen niet af van
de prevalentie. De voorspellende waarden beschrijven de patiënt: ze
kijken per rij (test+, test−) en hangen sterk af van de
prevalentie.
Ziek (D+)
Niet ziek (D−)
Totaal
Test positief (T+)
a = echt-positief (TP)
b = fout-positief (FP)
a + b
Test negatief (T−)
c = fout-negatief (FN)
d = echt-negatief (TN)
c + d
Totaal
a + c
b + d
N
Maat
Formule
Kans
In de cursus ook
Sensitiviteit
a/(a+c)
P(T+ | D+)
TPR, true positive ratio
Specificiteit
d/(b+d)
P(T− | D−)
TNR
Fout-positief ratio
b/(b+d) = 1 − spec
P(T+ | D−)
FPR
Fout-negatief ratio
c/(a+c) = 1 − sens
P(T− | D+)
FNR
Positief voorspellende waarde
a/(a+b)
P(D+ | T+)
PPV, posterior bij T+
Negatief voorspellende waarde
d/(c+d)
P(D− | T−)
NPV
Prevalentie (prior)
(a+c)/N
P(D+)
Pre-test kans
Oude tentamens vragen vaak wat een losse breuk betekent. c/(c+d) =
P(D+ | T−) = 1 − NPV: de kans op ziekte ondanks een negatieve test
(2016, v23). b/(a+b) = P(D− | T+) = 1 − PPV (2017, v23).
Rekenvoorbeeld (Assignment 3.1). Vrouw met typische
pijn op de borst, geen risicofactoren. Prior kans op coronairlijden
(CAD) 11%. Stress-ECG bij vrouwen: sensitiviteit 0.61, specificiteit
0.70. Maak de tabel met N = 10.000:
Ondanks een positief ECG heeft ze dus maar 20% kans op CAD, omdat er
bij een lage prior veel meer fout-positieven dan echt-positieven
zijn.
Bron: Berekend met Bayes, sens = spec = 0.90
Bij een lage prevalentie (screening) is de PPV laag, ook bij een
goede test. Bij een hoge prevalentie daalt juist de NPV. Daarom is een
test met dezelfde sensitiviteit en specificiteit in de
huisartsenpraktijk minder ‘positief voorspellend’ dan in het
ziekenhuis.
Kans en odds. Diagnostiek rekent graag in odds: odds
= p/(1 − p) en p = odds/(1 + odds). Een kans van 0.20 is odds 0.25 (1 op
4); een kans van 0.50 is odds 1.
Bayes en likelihood ratio’s
De regel van Bayes rekent een pre-test kans om naar een post-test
kans. In odds is dat één vermenigvuldiging: post-test odds =
pre-test odds × LR. De likelihood ratio (LR) zegt hoeveel keer
waarschijnlijker een uitslag is bij zieken dan bij niet-zieken.
LR
Betekenis
> 10
Uitslag maakt de ziekte veel waarschijnlijker (rule in)
2 – 10
Matig tot redelijk informatief
1
De uitslag verandert niets: post-test = pre-test. Een nutteloze
uitslag (2016, v21)
0.1 – 0.5
Matig tot redelijk informatief voor uitsluiten
< 0.1
Uitslag maakt de ziekte veel onwaarschijnlijker (rule out)
∞
De uitslag komt alleen bij zieken voor (FPR = 0): post-test kans = 1
(2017, v21)
Bron: Berekend; testkenmerken uit Assignment 3 en 4 (ECG bij vrouwen
sens 0.61/spec 0.70; CTCA 0.90/0.96)
De grafiek laat twee dingen zien. Ten eerste: hoe verder de LR van 1,
hoe verder de curve van de diagonaal. Ten tweede: bij een heel lage of
heel hoge prior verandert zelfs een goede test weinig. Bij een prior
onder 1% blijft de post-test kans laag, wat de uitslag ook is
(Assignment 3.2).
Rekenvoorbeelden, stap voor stap
Casus
Prior
Test
Stap 1: prior odds
Stap 2: × LR
Post-test kans
Vrouw, pijn op de borst, positief ECG (Assignment 3.2)
0.20
sens 0.61, spec 0.70, positief
0.20/0.80 = 0.25
LR+ = 2.03 → 0.51
0.51/1.51 = 0.34
Man van 65, inspanningspijn, positieve inspanningstest (ZO.D
v11)
Het laatste voorbeeld laat zien waarom een zeer specifieke test bij
een zeer lage prior toch veel fout-positieven geeft.
Ezelsbruggetjes. SpPIn: een
Specifieke test die Positief is, sluit
In. SnNOut: een
Sensitieve test die
Negatief is, sluit Out.
Meerdere tests na elkaar. De post-test kans van de
eerste test is de pre-test kans van de tweede. Je mag de LR’s alleen
vermenigvuldigen als de tests conditioneel onafhankelijk zijn (bij
zieken en bij niet-zieken).
Beslisbomen en de
behandeldrempel
Een beslisboom zet de keuze (behandelen of niet) tegen de onzekerheid
(ziek of niet) en de gevolgen. Je rekent van rechts naar links: per tak
vermenigvuldig je kans × uitkomst en tel je op (averaging out and
folding back). De strategie met de hoogste verwachte waarde
wint.
Knoop
Symbool
Betekenis
Beslisknoop
Vierkant □
Jij kiest (behandelen, testen, niets doen). Staat altijd links, vóór
wat je nog niet weet
Kansknoop
Rondje ○
Het toeval beslist (CAD ja of nee, event ja of nee); de kansen
tellen op tot 1
Eindknoop
Driehoek ◁
De uitkomst, bijv. overleving, eventvrije overleving of QALY’s
Casus (Assignment 2 en ZO2.4). Een vrouw met pijn op
de borst. Zonder behandeling is het 10-jaars risico op een event 0.10
met CAD en 0.01 zonder. Preventieve behandeling halveert het CVD-risico,
maar geeft 0.02 extra risico op een ernstige bijwerking.
Met behandeling: eventrisico bij CAD 0.10 × 0.5 + 0.02 = 0.07,
eventvrij 0.93. Zonder CAD 0.01 × 0.5 + 0.02 = 0.025, eventvrij
0.975.
Net benefit (B) = winst van behandelen bij zieken =
0.93 − 0.90 = 0.03.
Net harm (H) = verlies door behandelen bij
niet-zieken = 0.99 − 0.975 = 0.015.
De drempel ligt waar beide strategieën even goed
zijn: p × B = (1 − p) × H, dus p/(1 − p) = H/B en
Bron: Assignment 2 en ZO2.4; lijnen berekend uit de vier eindwaarden
Bij p = 0 is de afstand tussen de lijnen de net harm; bij p = 1 de
net benefit. Is de kans op CAD groter dan 33%, dan behandel je;
daaronder niet.
Hoe hangt de drempel af van H en B? (post-session
quiz 2)
H
B
H/B
Drempel
Interpretatie
0.01
0.25
0.04
0.038
Grote baat: al bij een lage kans behandelen
0.01
0.031
0.32
0.244
Kleine baat: je moet zekerder zijn van de diagnose
Een veilige behandeling met veel effect (antibiotica bij verdenking
op meningitis) heeft een lage drempel. Een riskante behandeling met
weinig winst (chemotherapie) een hoge.
Testdrempels
Een test is alleen zinvol als de uitslag je beslissing kan
veranderen. Met twee drempels verdeel je de kansschaal in drie gebieden:
onder de no treat–test drempel doe je niets, tussen de
drempels test je, boven de test–treat drempel behandel
je direct.
Stap 1: een perfecte test. Een test zonder fouten en
zonder risico is altijd minstens zo goed als niet testen. Zijn
meerwaarde (de expected value of perfect information, EVPI) is
het grootst precies bij de behandeldrempel, en nul bij p = 0 en p =
1.
Stap 2: een perfecte test met een risico (een ‘tol’,
bijvoorbeeld complicaties van angiografie). De drempels worden dan p =
tol/B en p = (H − tol)/H. Hoe groter de tol, hoe smaller het testgebied.
Bij coronairangiografie met 1% complicaties is testen in de CAD-casus
vrijwel nooit de beste keuze (ZO4.1).
Stap 3: een imperfecte test (formuleblad p7).
Fout-positieven kosten H, gemiste zieken kosten B:
Om de drempels te berekenen heb je dus nodig: TPR en
FPR (sensitiviteit en specificiteit) van de test, H en B van de
behandeling, en eventueel het risico van de test. De prior hoort daar
niet bij: de drempels zijn juist grenswaarden vóór de
prior (oud tentamen 2016, v30: sens, spec, net harm, net benefit). Om te
beslissen of je bij deze patiënt test, vergelijk je
daarna de prior met de drempels (post-session quiz 4, v2).
CAD-casus: welke test bij een prior van 0.11?
(Assignment 4, H = 0.015, B = 0.03)
Test
Sens
Spec
LR+
LR−
No treat–test
Test–treat
Bij prior 0.11
Stress-ECG (vrouwen)
0.61
0.70
2.0
0.56
0.197
0.473
Niet testen, niet behandelen
CT-calciumscore (CTCS)
0.99
0.30
1.4
0.03
0.261
0.938
Niet testen, niet behandelen
Perfusie-MRI
0.91
0.80
4.6
0.11
0.099
0.816
Testen
CT-angiografie (CTCA)
0.90
0.96
22.5
0.10
0.022
0.828
Testen: breedste testgebied
Bron: Berekend uit de CAD-casus (H = 0.015, B = 0.03) en de
testkenmerken uit Assignment 4
De testlijn ligt tussen zijn twee drempels boven beide andere lijnen.
CTCA wint van MRI door de lagere FPR (0.04 tegen 0.20): minder onnodige
behandelingen, dus een lagere no treat–test drempel (Assignment 4.2,
v4).
Twee uitgewerkte examenvragen (post-session quiz
4)
Chronische mesenteriale ischemie. Stent: sterfte 5% bij
ziekte, waarvan 0.4% door de ingreep; zonder stent 9%. CTA: sens 0.90,
spec 0.80.
Meisje van 12 met koorts, hoofdpijn en braken; kans op
meningokokkenmeningitis 3%. Sneltest: sens 0.70, spec 0.75. Sterfte
bij direct behandelen 0.5%, bij te laat behandelen 10%, bij onnodig
opnemen 0.1%.
H = 0.001 en B = 0.10 − 0.005 = 0.095; behandeldrempel = 0.001/0.096
= 0.01.
De prior (0.03) ligt boven de test–treat drempel: direct
opnemen. Ook na een negatieve sneltest (LR− = 0.4) blijft de
kans 1.2%, nog boven de behandeldrempel.
Meerdere
testuitslagen, ROC-curve en AUC
Veel tests hebben meer dan twee uitslagen (laag, middel, hoog) of een
continue waarde. Dan krijgt elke uitslag zijn eigen LR,
en toont de ROC-curve hoe goed de test over alle mogelijke afkappunten
zieken van niet-zieken scheidt.
LR per uitslagcategorie = P(uitslag | ziek) /
P(uitslag | niet ziek). PIOPED-studie, V/Q-scan bij verdenking op
longembolie (LE):
V/Q-uitslag
LE+ (n = 252)
LE− (n = 635)
P(uitslag | LE+)
P(uitslag | LE−)
LR
High probability
103
15
0.409
0.024
17.3
Intermediate
104
241
0.413
0.380
1.09
Low
40
256
0.159
0.403
0.39
Normal
5
123
0.020
0.194
0.10
Een ‘intermediate’ uitslag (LR 1.09) zegt dus bijna niets; ‘high’ en
‘normal’ zijn wel informatief.
De ROC-curve zet de sensitiviteit (TPR, y-as) uit
tegen 1 − specificiteit (FPR, x-as) voor elk mogelijk afkappunt. Je
begint linksonder (niets positief) en schuift het afkappunt op: eerst
alleen ‘high’ positief, dan ‘high + intermediate’, enzovoort. Elk punt
is cumulatief.
Bron: Assignment 5.1 en de Excel-oplossing (PIOPED, 252 met en 635
zonder longembolie)
De helling van elk lijnstuk is de LR van die
categorie. Steil begin = hoge LR.
AUC (area under the curve, c-statistic) = de kans
dat een willekeurige zieke een ‘ziekere’ uitslag heeft dan een
willekeurige niet-zieke. AUC 1 = perfecte discriminatie; 0.5 = geen (de
diagonaal).
De AUC bereken je met trapezia: per lijnstuk (breedte in FPR) ×
(gemiddelde hoogte in TPR). PIOPED: V/Q-scan 0.793,
klinische inschatting 0.682.
De AUC is niet gelijk aan sens + spec − 1 (dat is
de Youden-index) en ook niet aan sens × spec (post-session quiz 5,
v3).
Twee tests vergelijken (post-session quiz 5, v4). CT
voor ovariumcarcinoom (uitslag I/II/III: kanker 98/37/5, geen kanker
5/32/245) tegen een nieuwe bloedtest (A/B/C: 65/32/33 en 22/34/72). De
CT-uitslagen scheiden de groepen veel beter (LR van uitslag I = 39, van
III = 0.04). AUC CT ≈ 0.95 tegen ≈ 0.70: CT
discrimineert beter.
LR van een klinisch teken (post-session quiz 5, v1).
Nitroglycerine verlicht de pijn bij 35% met en 41% zonder
coronairlijden. LR = 0.35/0.41 = 0.85: pijnverlichting maakt
coronairlijden iets minder waarschijnlijk, geen bewijs
ervoor.
Optimaal
positiviteitscriterium
Waar leg je het afkappunt van een test? Reken een uitslag als
positief zolang zijn LR groter is dan de drempel-LR uit het formuleblad
(p7):
Dit volgt direct uit de behandeldrempel: na de uitslag moet de
post-test odds boven H/B liggen, dus prior odds × LR > H/B. Op de
ROC-curve is dit het punt waar de helling gelijk is aan die
drempel-LR.
Je hebt dus nodig: de LR’s bij de afkappunten, de prior én de
gevolgen van fout-positief (H) en fout-negatief (B). Het risico van de
test zelf doet er niet toe, want de test wordt hoe dan ook gedaan
(post-session quiz 6, v2).
Bij FOBT-screening op darmkanker is de prior laag: kies het criterium
linksonder (post-session quiz 6, v3).
Uitgewerkt: CT-calciumscore (Assignment 6).
Atypische pijn op de borst, prior CAD 0.324. Het 10-jaars CVD-risico is
0.10 bij CAD en 0 zonder; behandeling verlaagt het risico met 30% maar
geeft 1% complicaties.
B = 0.10 − (0.07 + 0.01) = 0.02; H = 0.01 − 0 =
0.01; H/B = 0.5.
Prior odds = 0.324/0.676 = 0.479.
Drempel-LR = (1/0.479) × 0.5 = 1.04.
LR per segment (= helling): ≥ 400: 8.38; 100–400: 1.91; 10–100:
0.99; 0–10: 0.03.
Alleen de segmenten boven 100 hebben LR > 1.04, dus het criterium
is score > 100.
Bron: Assignment 6 en de Excel-oplossing
Uitgewerkt: D-dimeer bij longembolie (post-session quiz 6,
v4). Prior 1%, geen vervolgtest mogelijk. H = 0.003 (sterfte
door onnodige behandeling), B = 0.16 − 0.01 = 0.15.
Drempel-LR = 99 × 0.003/0.15 = 1.98.
LR per categorie: > 1000 ng/mL oneindig (0 zonder LE); 700–1000:
(43/134)/(7/158) = 7.2; 500–700: (36/134)/(31/158) = 1.4; < 500:
0.03.
Positief zijn alleen de categorieën met LR > 1.98: boven de 700.
Afkappunt 700.
Bias in diagnostisch
onderzoek
De ideale studie naar testaccuratesse is
cross-sectioneel: een opeenvolgende reeks patiënten met
de klinische verdenking krijgt de indextest én de referentiestandaard,
beoordeeld door mensen die de andere uitslag niet kennen. Elke afwijking
daarvan geeft bias, meestal een te rooskleurige test.
Bias
Wat gebeurt er
Effect
Partial verification (work-up, referral bias)
Alleen patiënten met een positieve test of een zichtbare afwijking
krijgen de referentiestandaard
Fout-negatieven worden nooit gevonden: sensitiviteit
overschat
Differential verification
Positieven krijgen een betere referentie (biopsie) dan negatieven
(follow-up)
Meestal overschatting
Incorporation bias
De indextest is onderdeel van de referentiestandaard
Sensitiviteit én specificiteit overschat
Review / interpretation bias
De beoordelaar kent de uitslag van de andere test of van de
referentie
Uitslagen lijken meer op elkaar dan ze zijn
Spectrum bias
Duidelijk zieken vergeleken met gezonde vrijwilligers, in plaats van
het klinische spectrum
Sensitiviteit en specificiteit overschat; niet generaliseerbaar
Imperfecte referentiestandaard
De ‘gouden standaard’ maakt zelf fouten
Beide kanten op; per afspraak rekenen we de referentie als 100%
juist
Twee oude tentamenvragen
Leverlaesies (2017, v24). Histologie wordt alleen gedaan
bij afwijkingen die op CT en/of echo te zien zijn. Laesies die beide
tests missen, worden nooit geverifieerd. Partial verification: de
sensitiviteit kan overschat worden.
CT tegen MRI (2016, v24). Één radioloog beoordeelt CT en
MRI van dezelfde patiënt direct na elkaar. De beoordelingen beïnvloeden
elkaar (review bias): het verschil tussen CT en MRI lijkt
kleiner dan het is. Oplossing: onafhankelijke,
geblindeerde beoordelaars.
Diagnostische strategieën randomiseren. Je kunt ook
patiënten loten tussen twee teststrategieën en de patiëntuitkomsten
vergelijken (overleving, complicaties). Dat is vooral zinvol als er
geen goede referentiestandaard is: accuratesse kun je
dan niet meten, het effect op de patiënt wel (ZO.D, v18).
Valkuilen en typische
tentamenvragen
Valkuil
Hoe het wel zit
PPV gebruiken als testeigenschap
PPV en NPV hangen af van de prior. Sens, spec en LR zijn (min of
meer) eigenschappen van de test.
Sensitiviteit en PPV verwarren
Sens = P(T+ | D+), per kolom. PPV = P(D+ | T+), per rij.
Bayes met kansen in plaats van odds
Eerst naar odds, dan × LR, dan terug naar kans. Of vul een 2×2-tabel
met 10.000 patiënten.
De verkeerde LR pakken
Bij een negatieve uitslag gebruik je LR− = (1 − sens)/spec.
H en B omdraaien
H = schade van behandelen bij niet-zieken; B = baat
van behandelen bij zieken. Beide als verschil in de
uitkomst (risico of overleving).
FPR en TNR door elkaar in de drempelformules
No treat–test: H · FPR en B · TPR. Test–treat: H · TNR en B · FNR.
Staan op het formuleblad.
Denken dat testen altijd helpt
Buiten het testgebied verandert de uitslag je beleid niet; dan kost
een test alleen fout-positieven, fout-negatieven en risico.
AUC verwarren met sens + spec
AUC = kans dat een zieke een hogere score heeft dan een niet-zieke;
over alle afkappunten samen.
Screening met een ruim afkappunt
Lage prior: streng criterium (linksonder, hoge specificiteit).
Zo worden deze onderwerpen gevraagd
Posterior berekenen uit prior, sensitiviteit en specificiteit (bijna
elk tentamen, vaak na een negatieve uitslag).
Wat een losse breuk als c/(c + d) of b/(a + b) voorstelt.
Wat LR = 1 of LR = ∞ betekent.
Drempels uitrekenen of benoemen in een drempelfiguur, en dan kiezen:
niets doen, testen of behandelen.
Welke test het breedste testgebied heeft, of wat er met de drempels
gebeurt als de test riskanter wordt.
Wat de AUC betekent; welke test beter discrimineert.
Een bias in een diagnostische studie herkennen en de richting van de
fout aangeven.
Hoofdstuk 4 van 7
4 · Statistiek: beschrijven, schatten, toetsen
Meetniveaus en
beschrijvende statistiek
Het meetniveau van een variabele bepaalt hoe je hem beschrijft en
welke toets je gebruikt. Beschrijvende statistiek vat de steekproef
samen; inferentiële statistiek trekt conclusies over de populatie.
Meetniveau
Kenmerk
Voorbeelden (ZO.D v20–24)
Beschrijven met
Categorisch, nominaal
Categorieën zonder volgorde
Bloedgroep, diagnose (GHD, Turner, …)
Frequenties, percentages, modus
Categorisch, ordinaal
Categorieën met volgorde, afstanden onbekend
Puberteitsstadium 1–5; klachtfrequentie ‘nooit’ tot ‘> 4× per
week’
Frequenties, mediaan
Numeriek, discreet
Alleen gehele getallen
Aantal ziekenhuisopnames, aantal kinderen
Gemiddelde of mediaan, SD of IQR
Numeriek, continu
Elke waarde mogelijk
Testuitslag in nmol/L, lengte, bloeddruk
Gemiddelde of mediaan, SD of IQR
Let op: een getal als code (1 = GHD, 2 = Turner) maakt een variabele
niet numeriek.
Centrummaten en spreidingsmaten
Maat
Wat
Wanneer
Gemiddelde
Som / n
Symmetrische verdeling
Mediaan
Middelste waarde na ordenen
Scheve verdeling of uitschieters; ongevoelig voor extreme
waarden
Modus
Meest voorkomende waarde
Categorische variabelen
Standaarddeviatie (SD)
Ongeveer de gemiddelde afstand tot het gemiddelde: s = √[Σ(x −
x̄)²/(n − 1)]
Bij het gemiddelde
Interkwartielafstand (IQR)
Van het 25e tot het 75e percentiel: de middelste 50%
Bij de mediaan
Range
Minimum tot maximum
Aanvulling; gevoelig voor uitschieters
Rekenvoorbeeld (college WL4). Scores 7, 8, 8, 7, 3,
1, 6, 9, 3, 8. Gemiddelde = 60/10 = 6. Geordend: 1, 3,
3, 6, 7, 7, 8, 8, 8, 9; bij 10 waarden is de mediaan het gemiddelde van
de 5e en 6e: (7 + 7)/2 = 7. De modus is
8. Waarom kwadrateer je bij de SD? De afwijkingen van
het gemiddelde tellen altijd op tot 0.
Vorm van de verdeling. Bij een symmetrische
verdeling liggen gemiddelde en mediaan op dezelfde plek. Bij een
rechtsscheve verdeling (lange staart naar rechts: opnameduur, inkomen,
triglyceriden) trekt de staart het gemiddelde naar rechts:
gemiddelde > mediaan. Bij linksscheef andersom.
Bron: Verzonnen voorbeeld
Vuistregel om scheefheid te herkennen zonder figuur: als gemiddelde −
2 × SD onder een onmogelijke waarde uitkomt (bijvoorbeeld onder 0 bij
een opnameduur), is de verdeling vrijwel zeker rechtsscheef.
Normale
verdeling, standaardfout en betrouwbaarheidsintervallen
De SD beschrijft hoe individuen verschillen; de
standaardfout (SE = SD/√n) beschrijft hoe precies een
schatting is. Een referentie-interval gebruikt de SD,
een betrouwbaarheidsinterval de SE.
Normale verdeling N(μ, σ): symmetrisch, klokvormig.
Ongeveer 68% ligt binnen μ ± 1σ, 95% binnen μ ± 1.96σ en 99.7% binnen μ
± 3σ. Via z = (x − μ)/σ reken je elke normale verdeling om naar de
standaardnormale N(0, 1) en lees je kansen af in de tabel.
Voorbeeld (college WL4). Systolische bloeddruk X ~
N(180, 12). Welk deel heeft meer dan 200 mmHg? z = (200 − 180)/12 =
1.67. De tabel geeft een tweezijdige overschrijdingskans van 0.0949, dus
eenzijdig 0.0949/2 = 0.047, ongeveer 5%.
Centrale limietstelling. Steekproefgemiddelden zijn
normaal verdeeld rond μ met spreiding SE = σ/√n. Dat geldt ook als de
individuele waarden niet normaal verdeeld zijn, mits n redelijk groot is
(vuistregel n ≥ 30). Een grotere n maakt de SE kleiner, de SD niet.
Bron: Berekend uit de normale verdeling
Referentie-interval tegen
betrouwbaarheidsinterval
Referentie-interval (RI)
95%-betrouwbaarheidsinterval (BI)
Formule
μ ± 1.96 × SD
x̄ ± 1.96 × SE (of t bij kleine n)
Zegt iets over
Individuen: waar 95% van de waarden ligt (‘normaalwaarden’)
De schatting: waar het populatiegemiddelde waarschijnlijk ligt
Bij grotere n
Blijft even breed
Wordt smaller
Voorbeeld (ZO.D v3). 100 meisjes, gemiddelde
menarcheleeftijd 12.8 jaar, SD 1.6. RI = 12.8 ± 1.96 × 1.6 = 9.7 tot
15.9 jaar. SE = 1.6/√100 = 0.16, dus 95%-BI = 12.8 ± 1.96 × 0.16 =
12.5 tot 13.1 jaar.
Betrouwbaarheidsintervallen (formuleblad p1)
Voor
Formule
Voorwaarde
Gemiddelde, grote n
x̄ ± z × s/√n
n ≥ 50
Gemiddelde, kleine n
x̄ ± t(df = n − 1) × s/√n
Data ongeveer normaal
Proportie
p ± z × √[p(1 − p)/n]
Genoeg events
Verschil van twee proporties
(p₁ − p₂) ± z × √[p₁(1 − p₁)/n₁ + p₂(1 − p₂)/n₂]
Onafhankelijke groepen
Ratio (RR, OR, IC-ratio)
ratio × exp(±z × se(log ratio))
Reken op de log-schaal; het BI is asymmetrisch
z-waarden: 90% → 1.64; 95% → 1.96; 99% → 2.58.
Proportie (college WL5). 11 van de 300 55-plussers hebben
diabetes type 2: p = 0.037, SE = √(0.037 × 0.963/300) = 0.011, 95%-BI =
0.016 tot 0.058.
Kleine steekproef. n = 16, x̄ = 5.2, s = 1.2: SE = 0.30,
t(15) = 2.131, 95%-BI = 4.56 tot 5.84. Met z (1.96) zou
het BI te smal zijn.
Wat betekent een 95%-BI? Als je de studie heel vaak
herhaalt, bevat 95% van de zo berekende intervallen de ware waarde.
Bevat een 95%-BI de nulwaarde niet (0 voor een verschil, 1 voor een
ratio), dan is p < 0.05.
Logica van het toetsen
Een toets vraagt: stel dat de nulhypothese klopt, hoe waarschijnlijk
is dan een resultaat dat minstens zo extreem is als wat ik vond? Die
kans is de p-waarde. Is p kleiner dan het significantieniveau α (meestal
0.05), dan verwerp je H₀.
Stappenplan (college WL5)
Formuleer H₀ (geen verschil, geen verband) en H₁ (wel verschil;
meestal tweezijdig).
Verzamel de gegevens.
Bereken de toetsingsgrootheid, meestal (schatting − waarde onder H₀)
/ SE.
Zoek de p-waarde op in de tabel (z, t, χ² of F).
p < α: H₀ verwerpen. p ≥ α: H₀ niet verwerpen (dat is iets anders
dan bewijzen dat H₀ klopt).
Voorbeeld. Is de gemiddelde leeftijd in Nederland 48
jaar? n = 121, x̄ = 50, σ = 11. SE = 11/√121 = 1, z = (50 − 48)/1 = 2.0.
Tabel: tweezijdig p = 0.046 < 0.05, dus H₀ verwerpen.
Twee soorten fouten
H₀ is waar
H₀ is niet waar
H₀ verworpen
Type I-fout (kans α): een effect ‘vinden’ dat er
niet is
Juist (kans = power = 1 − β)
H₀ niet verworpen
Juist (kans 1 − α)
Type II-fout (kans β): een echt effect missen
α = 0.05 betekent: de kans dat je H₀ verwerpt
terwijl hij waar is, is 5% (ZO.D v7). Het is niet de
kans dat H₀ onwaar is.
Power = de kans om een effect dat er echt is, ook
te vinden. De power is hoger bij een grotere n, een groter werkelijk
effect, minder spreiding en een hogere α.
Een grotere steekproef verkleint vooral de kans op een type II-fout
(ZO.D v8; oud tentamen 2016, v34).
De p-waarde goed lezen
Uitspraak bij p = 0.3
Klopt?
“Er is geen significant verschil tussen de groepen.”
Ja (ZO.D v5)
“Er is geen verschil.”
Nee: afwezigheid van bewijs is geen bewijs van afwezigheid
“Er is een verschil met 30% zekerheid.”
Nee
“De kans dat H₀ waar is, is 30%.”
Nee: p is de kans op de data als H₀ waar is, niet andersom
Eenzijdig of tweezijdig. Tweezijdig toets je op een
verschil in beide richtingen; dat is de standaard. Een eenzijdige
p-waarde is de helft van de tweezijdige, maar mag alleen als een
verschil in de andere richting vooraf onmogelijk of irrelevant is.
Toets en BI zeggen hetzelfde. Een 95%-BI zonder de
nulwaarde hoort bij p < 0.05. Het BI zegt daarnaast hoe groot het
effect is en hoe precies. Daarom is een BI informatiever dan alleen een
p-waarde.
Statistisch significant is niet hetzelfde als klinisch
relevant. In een enorme studie is een bloeddrukverschil van 1
mmHg significant maar klinisch onbelangrijk. In een kleine studie kan
een relevant verschil niet significant zijn.
Toetsen voor continue
uitkomsten
Bij een numerieke uitkomst vergelijk je gemiddelden met een t-toets
(of ANOVA bij meer dan twee groepen). Is de verdeling scheef of ordinaal
én de steekproef klein, dan neem je het non-parametrische alternatief,
dat met rangnummers werkt. Elke t-toets heeft dezelfde vorm: t =
(verschil − 0)/SE.
Situatie
Parametrisch
df
Non-parametrisch (H₀ over de mediaan of verdeling)
1 groep vs een vaste waarde
One-sample t: t = (x̄ − μ₀)/(s/√n)
n − 1
Tekentoets
2 gepaarde metingen (voor/na, zelfde patiënt)
Gepaarde t: t = d̄/(s_d/√n)
n − 1
Wilcoxon rangtekentoets
2 onafhankelijke groepen
Ongepaarde t: t = (x̄₁ − x̄₂)/[s_p √(1/n₁ + 1/n₂)]
n₁ + n₂ − 2
Wilcoxon rangsomtoets = Mann-Whitney U
3 of meer onafhankelijke groepen
One-way ANOVA (F-toets)
k − 1 en n − k
Kruskal-Wallis
Uitgewerkte voorbeelden (ZO7)
One-sample t. Calciuminname van 100 Rotterdamse
jongeren: x̄ = 901 mg, s = 446 mg. H₀: μ = 1000.
SE = 446/√100 = 44.6; t = (901 − 1000)/44.6 = −2.22; df = 99; p =
0.029.
H₀ verworpen. 95%-BI voor het verschil: −99 ± 1.96 × 44.6 = −186 tot
−12 mg.
Ongepaarde t. Vetvrije massa (LBM): mannen 60.8 kg
(s = 6.78, n = 30), vrouwen 42.8 kg (s = 4.90, n = 70).
Levene-toets p = 0.052: varianties gelijk, dus de rij ‘equal
variances assumed’.
t = 18.09/1.21 = 15.0; df = 98; p < 0.001. 95%-BI: 15.7 tot 20.5
kg.
Gepaarde t. Botdichtheid lumbaal vs totaal lichaam
bij 100 patiënten: gemiddeld verschil −0.029, SD van de verschillen
0.100.
SE = 0.100/10 = 0.010; t = −2.90; df = 99; p = 0.005.
Een gepaarde t-toets is precies een one-sample t-toets op de
verschilscores.
Wilcoxon rangtekentoets. 14 patiënten voor en na; 2
zonder verschil vallen af (n′ = 12).
Rangnummers van de absolute verschillen; gelijke waarden krijgen hun
gemiddelde rang.
Som negatieve rangen = 30, positieve = 48; T = de kleinste =
30.
T ligt binnen de grenzen van tabel A8: p > 0.05, H₀ niet
verworpen.
ANOVA. H₀: alle groepsgemiddelden zijn gelijk. F =
variantie tussen groepen / variantie binnen groepen. Een significante F
zegt alleen dat er érgens een verschil is. Welke groepen verschillen,
zoek je uit met post-hoc paarsgewijze vergelijkingen met correctie voor
multiple testing. Bonferroni vermenigvuldigt elke p met het aantal
vergelijkingen: bij 4 groepen 4 × 3/2 = 6 (ZO7 v41–43).
SPSS-output lezen
Independent Samples Test heeft twee rijen. Kijk eerst naar
Levene: p > 0.05, lees de rij ‘equal variances assumed’; p < 0.05,
lees ‘not assumed’.
Sig. (2-tailed) is de tweezijdige p-waarde. SPSS schrijft
0.000 als p < 0.0005: rapporteer p < 0.001.
De kolom ‘95% Confidence Interval of the Difference’ bevat 0 precies
als p > 0.05.
Toetsen voor dichotome
uitkomsten
Bij een ja/nee-uitkomst vergelijk je proporties. De χ²-toets
vergelijkt de waargenomen aantallen (O) met de aantallen die je onder H₀
zou verwachten (E). Voor de grootte van het verschil bereken je een OR,
RR of RD met een BI.
Situatie
Toets
Toetsingsgrootheid (formuleblad p4)
1 proportie vs een vaste waarde
z-toets voor een proportie
z = (|p − π₀| − 1/2n) / √[π₀(1 − π₀)/n]
2 onafhankelijke groepen
χ²-toets (2×2, met Yates-correctie)
χ² = Σ(|O − E| − ½)²/E, df = 1
2 groepen, kleine aantallen
Fisher exact
Als een verwachte celwaarde < 5 is
2 gepaarde metingen (voor/na, gematchte paren)
McNemar
χ² = (|x − y| − 1)²/(x + y), alleen de discordante paren
Meer groepen of categorieën
χ²-toets r × c
df = (r − 1)(c − 1)
Geordende groepen (geen, weinig, veel)
χ² trendtoets
Toetst een oplopend verloop
Uitgewerkt (ZO8): calciumtekort bij 30 mannen en 70
vrouwen.
Tekort
Geen tekort
Totaal
Mannen
8 (E = 13.5)
22 (E = 16.5)
30
Vrouwen
37 (E = 31.5)
33 (E = 38.5)
70
Totaal
45
55
100
Verwachte aantallen: E = rijtotaal × kolomtotaal / N, bijv. 30 ×
45/100 = 13.5.
OR = (8 × 33)/(22 × 37) = 0.32; se(log OR) = √(1/8
+ 1/22 + 1/37 + 1/33) = 0.477; BI 0.13 tot 0.83.
RR = 0.267/0.529 = 0.51; BI 0.27 tot 0.96.
RD = 0.267 − 0.529 = −0.26; se = 0.100; BI −0.46
tot −0.07.
Alle drie de BI’s sluiten de nulwaarde uit (1 voor ratio’s, 0 voor
het verschil), in lijn met p < 0.05.
McNemar (gepaard). Bij gepaarde data tellen alleen
de paren die van mening verschillen. Voorbeeld: 100 patiënten krijgen
twee tests; 15 zijn alleen op test A positief, 5 alleen op test B. χ² =
(|15 − 5| − 1)²/20 = 4.05, df = 1, p = 0.044.
Incidentiecijfers (formuleblad p6). Bij persoonstijd
reken je op de log-schaal.
IC = events/persoonsjaren. se(log IC) = 1/√I.
Voorbeeld: 30 events in 1500 PJ geeft IC = 0.020 per PJ; 95%-BI =
0.020 × exp(±1.96/√30) = 0.014 tot 0.029.
Ratio van twee IC’s: 30/1500 tegen 15/1800 geeft IC-ratio = 2.4;
se(log) = √(1/30 + 1/15) = 0.316; 95%-BI = 1.3 tot
4.5.
SPSS Crosstabs lezen. Bij een 2×2-tabel rapporteer
je de ‘Continuity Correction’-rij (Yates) of Fisher’s Exact Test als een
verwachte waarde < 5 is (voetnoot b onder de tabel). Onder ‘Risk
Estimate’ staan de OR en de RR (‘for cohort …’) met hun BI.
Toetskeuze,
steekproefgrootte en multiple testing
De toetskeuze volgt uit drie vragen (zie het stroomschema op het
tabblad Overzicht):
Wat voor uitkomst? Numeriek of categorisch
(dichotoom).
Hoeveel groepen? Eén groep tegen een vaste waarde,
twee groepen of meer.
Gepaard of onafhankelijk? Gepaard = dezelfde
personen twee keer gemeten, of bewust gematchte paren (tweelingen, voor
en na, links en rechts oog).
Daarna: parametrisch als de data (ongeveer) normaal verdeeld zijn of
de steekproef groot is; non-parametrisch bij een kleine steekproef met
een scheve of ordinale uitkomst. Non-parametrische toetsen hebben iets
minder power, maar minder aannames.
Casus uit oude tentamens
Toets
Twee onafhankelijke groepen, uitkomst duidelijk niet normaal
verdeeld (2017, v9)
Wilcoxon rangsomtoets
Percentage in één groep vergelijken met een landelijk percentage
(2016, v20; 2017, v14)
z-toets voor één proportie
Gemiddelde in één groep vergelijken met een bekende waarde (2017,
v13)
One-sample t-toets
Drie of meer groepen, numerieke uitkomst (2016, v19)
One-way ANOVA
Gecorrigeerde OR voor een dichotome uitkomst (2016, v9; 2017,
v6)
Logistische regressie (tabblad 5)
Steekproefgrootte. Vooraf bereken je hoeveel
patiënten je nodig hebt. Daarvoor heb je nodig (de eerste drie zijn de
‘essentiële’ antwoorden van Interventie-oefenvraag I.3):
α (meestal 0.05, tweezijdig);
de gewenste power (meestal 80% of 90%);
het kleinste klinisch relevante verschil Δ dat je
wilt kunnen aantonen;
de spreiding van de uitkomst (SD), of bij een dichotome uitkomst het
verwachte percentage in de controlegroep.
Voor twee gemiddelden is n per groep ≈ 2(zα + zβ)² × SD²/Δ². Met SD =
10 en Δ = 5 is dat 2 × (1.96 + 0.84)² × 100/25 = 63 per
groep. Omdat Δ in het kwadraat in de noemer staat, heb je voor
een half zo groot effect vier keer zoveel patiënten nodig.
Bron: Berekend: n = 2(zα + zβ)²σ²/Δ²
Multiple testing. Doe je veel toetsen, dan neemt de
kans op minstens één fout-positief resultaat snel toe: bij 20
onafhankelijke toetsen met α = 0.05 is dat 1 − 0.95²⁰ = 64%.
Oplossingen: vooraf één primaire uitkomst kiezen, Bonferroni-correctie
(α gedeeld door het aantal toetsen, of elke p vermenigvuldigen met het
aantal toetsen), en subgroepanalyses als hypothesegenererend
presenteren.
Valkuilen en typische
tentamenvragen
Valkuil
Hoe het wel zit
SD en SE verwarren
SD = spreiding van individuen (referentie-interval); SE = SD/√n =
precisie van het gemiddelde (BI).
Referentie-interval en BI verwarren
RI: waar 95% van de patiënten ligt. BI: waar het populatiegemiddelde
waarschijnlijk ligt. Het RI wordt niet smaller bij een grotere n.
z gebruiken bij een kleine steekproef
Bij n < 50 en een gemiddelde: t met df = n − 1 (tabel A2).
De tabel eenzijdig lezen
De tabellen op het formuleblad geven tweezijdige
overschrijdingskansen. Voor één staart deel je door 2.
“p > 0.05, dus geen verschil”
Alleen: geen bewijs voor een verschil. Kijk naar het BI: misschien
is de studie te klein.
Een gepaarde opzet ongepaard toetsen
Dezelfde patiënten voor en na = gepaard (gepaarde t, Wilcoxon
rangteken, McNemar).
BI van een OR of RR symmetrisch maken
Reken op de log-schaal: OR × exp(±1.96 × se). Het BI ligt niet
symmetrisch om de OR.
SE van een verschil = verschil van de SE’s
se(X₁ − X₂) = √(se₁² + se₂²) (formuleblad p1).
Terugrekenen vergeten
Uit een BI haal je de SE: SE = (bovengrens − ondergrens)/(2 × 1.96),
en daarmee z en p (2017, v19). De SD kun je alleen terugrekenen als n
bekend is: SD = SE × √n (oud 2016, v2: zonder n kan het niet).
Zo worden deze onderwerpen gevraagd
Een 95%-BI of referentie-interval uitrekenen uit gemiddelde, SD en
n.
Een p-waarde opzoeken bij een gegeven z of t, of vanuit een BI
terugrekenen.
Kiezen welke toets past bij een beschreven situatie.
De juiste interpretatie van p, α, power of een BI kiezen uit vier
beweringen.
Een χ² of OR met BI uitrekenen uit een 2×2-tabel.
Hoofdstuk 5 van 7
5 · Regressie en overlevingsanalyse
Correlatie
De correlatiecoëfficiënt r (−1 tot +1) meet hoe sterk twee numerieke
variabelen samen een rechte lijn volgen. Hij zegt niets over hoe steil
die lijn is, en niets over oorzaak en gevolg.
Pearson r
Spearman rₛ
Meet
Lineair verband
Monotoon verband (steeds stijgend of dalend), op rangnummers
Voorwaarden
Beide variabelen (ongeveer) normaal verdeeld; geen uitschieters
Ook bij scheve of ordinale data en uitschieters
Toets H₀: ρ = 0
Tabel A10 (n ≤ 150) of t = r√[(n − 2)/(1 − r²)], df = n − 2
Tabel A11
Interpretatie
r = 0: geen lineair verband. Er kan wel een ander
verband zijn (zie rechts in de grafiek).
r² = de fractie van de variatie in Y die door het lineaire verband
met X verklaard wordt. r = 0.8 geeft r² = 0.64: 64% verklaarde
variatie.
Voorbeeld uit het college (n = 18): % lichaamsvet tegen leeftijd r =
0.79; tegen gewicht r = 0.03.
Een correlatie verandert niet als je X en Y omwisselt of van eenheid
verandert (cm of m).
Bron: Illustratie, gesimuleerde data
BI voor r (formuleblad p5). Omdat r begrensd is
tussen −1 en 1, transformeer je eerst naar Fisher-z.
z = 0.5 × ln[(1 + r)/(1 − r)]. Voor r = 0.80: z = 1.099.
z₁,₂ = z ± 1.96/√(n − 3). Voor n = 20: 1.099 ± 0.475 = 0.623 en
1.574.
Terugrekenen met (e^(2z) − 1)/(e^(2z) + 1): 95%-BI = 0.55
tot 0.92.
Het BI is asymmetrisch rond r. Vraag je naar een 90%-BI, gebruik dan
1.645 (oud tentamen 2017, v7).
Correlatie is geen causaliteit. Een sterke
correlatie kan komen door confounding (ijsverkoop en verdrinkingen
hangen allebei af van het weer), door omgekeerde causaliteit of door
toeval.
Lineaire regressie
Lineaire regressie voorspelt een numerieke uitkomst Y uit een of meer
variabelen X met een rechte lijn: Ŷ = a + b₁X₁ + b₂X₂ + …. De
coëfficiënt b is de verandering in de gemiddelde Y per eenheid X, bij
gelijke waarden van de andere variabelen.
Enkelvoudig (college WL2). Vetpercentage tegen
leeftijd (SPSS-output uit het college, R = 0.82): vet% = 2.51 + 0.55 ×
leeftijd.
b = 0.55: per jaar ouder gemiddeld 0.55 procentpunt meer
lichaamsvet.
a = 2.51: het voorspelde vet% bij leeftijd 0; buiten het bereik van
de data, dus zonder betekenis.
De lijn gaat altijd door (x̄, ȳ) en is gevonden met de
kleinste-kwadratenmethode: de som van de gekwadrateerde residuen
(verticale afstanden tot de lijn) is minimaal.
R² = 0.66: 66% van de variatie in vet% wordt door leeftijd
verklaard. Bij één X is R² = r² (oud 2017, v8).
+5.4 g per pond, bij gelijke leeftijd en hypertensie
Hypertensie (0/1)
−591
217
−2.72
0.007
−1018 tot −165
591 g lichter bij hypertensie, gecorrigeerd voor leeftijd en
gewicht
De toets per coëfficiënt: t = b/SE met df = n − aantal X’en − 1 =
189 − 3 − 1 = 185 (formuleblad p5). Bij df > 50 mag je 1.96 gebruiken
voor het BI.
De F-toets in de ANOVA-tabel toetst H₀: alle b’s = 0 (hier p =
0.002).
Voorspellen: moeder van 22 jaar, 120 pond, met
hypertensie: 2140 + 6.37 × 22 + 5.35 × 120 − 591 = 2330
g. Weegt het kind 3100 g, dan is het residu 3100 − 2330 = 770
g.
Zonder correctie (t-toets) was het hypertensie-effect 436 g; na
correctie 591 g. Het verschil komt door de andere variabelen: dat is
confounding.
R² = 0.075: slechts 7.5% van de variatie in geboortegewicht wordt
verklaard. Een model kan significante coëfficiënten hebben en toch
weinig verklaren.
Dummyvariabelen. Een dichotome X codeer je 0/1; b is
dan het verschil in gemiddelde Y tussen de twee groepen. Een
categorische X met k categorieën (etniciteit: 3) krijgt k − 1 dummy’s,
elk vergeleken met de referentiecategorie.
Interactie. Voeg een productterm toe als het effect
van X₁ afhangt van X₂. In ZO2 is het effect van het gewicht van de
moeder +5.51 g per pond zonder alcohol, maar 5.51 − 5.69 = −0.18 g per
pond met alcohol.
Let op: de aanname gaat over de residuen, niet over
X of Y zelf.
Logistische regressie
Logistische regressie gebruik je bij een dichotome
uitkomst (ziek/niet ziek). Het model voorspelt de log-odds:
log[p/(1 − p)] = b₀ + b₁X₁ + b₂X₂ + …. Elke coëfficiënt is een log-OR,
dus OR = e^b, gecorrigeerd voor de andere variabelen in
het model. Zo krijg je een gecorrigeerde OR (oud 2017, v6).
Stap
Formule
Voorbeeld: roken en laag geboortegewicht (ZO2)
Coëfficiënt → OR
OR = e^b
e^0.704 = 2.02 (alleen roken in het model)
BI voor b
b ± 1.96 × SE
0.704 ± 1.96 × 0.32 = 0.077 tot 1.331
BI voor de OR
e^(ondergrens) tot e^(bovengrens)
e^0.077 tot e^1.331 = 1.08 tot 3.78
Continue X
OR per eenheid; voor k eenheden OR^k = e^(k·b)
Gewicht moeder OR 0.982 per pond; per 10 pond 0.982¹⁰ = 0.83
Roken: OR = e^1.072 = 2.92 (95%-BI 1.37 tot 6.25),
gecorrigeerd voor ras, gewicht en hypertensie. Het BI bevat 1 niet:
significant.
Hypertensie: OR = 5.75. Ras: twee dummy’s, vergeleken met de
referentiecategorie ‘wit’.
Voorspelde kans voor een niet-rokende moeder van ras ‘anders’, 105
pond, met hypertensie: log-odds = 0.352 + 0.944 − 0.018 × 105 + 1.749 =
1.155. p = e^1.155/(1 + e^1.155) = 0.76.
Bron: Berekend uit de coëfficiënten in ZO2, vraag 32
Classificatie. SPSS voorspelt ‘laag gewicht’ als p
boven een afkapwaarde ligt (standaard 0.5). Bij 0.5 was de sensitiviteit
27% en de specificiteit 95%; bij afkapwaarde 0.3 werd dat 73% en 59%.
Het is hetzelfde principe als het afkappunt van een diagnostische test
(tabblad 3).
Wanneer lineair en wanneer logistisch? Kijk alleen
naar de uitkomst: continu = lineair, dichotoom = logistisch (oud 2016,
v9). De verklarende variabelen mogen in beide modellen continu of
categorisch zijn.
Overlevingsanalyse
Bij tijd-tot-event-data (overlijden, recidief, transplantatie) kun je
geen gewoon gemiddelde of t-toets gebruiken. Niet iedereen heeft het
event al gehad (censurering) en de tijden zijn scheef
verdeeld. Survivalanalyse gebruikt voor iedereen de tijd die hij
event-vrij gevolgd is.
Censurering (college WL1).Rechts
gecensureerd = je weet alleen dat het event ná de laatste
waarneming valt: de studie eindigt, de patiënt verhuist of trekt zich
terug. Aanname: wie gecensureerd wordt, heeft dezelfde prognose als wie
in de studie blijft (niet-informatieve censurering). Links
gecensureerd = het event gebeurde al vóór de start van de
observatie.
Begrip
Betekenis
Overlevingsfunctie S(t)
Kans om na tijd t nog event-vrij te zijn. Begint op 1 en daalt
Cumulatieve incidentie
1 − S(t)
Hazard h(t)
Momentane kans op het event op tijd t, gegeven dat je het tot dan
toe niet had. De ‘snelheid’ van events
Mediane overleving
Tijd waarop S(t) onder 0.5 zakt
Kaplan-Meier. Bij elk tijdstip met een event bereken
je de kans om dat moment te overleven, en je vermenigvuldigt die
kansen:
Vergelijkt de hele curves: waargenomen vs verwachte events op elk
eventtijdstip
Standaard voor ‘verschillen de overlevingscurves?’ (oud 2016,
v13)
Verschil in S(t) op één tijdstip
z = [S₁(t) − S₂(t)] / √(se₁² + se₂²)
Als je één moment wilt vergelijken, bijv. 1-jaarsoverleving (oud
2016, v14)
Cox-regressie
Hazard ratio, gecorrigeerd voor andere variabelen: log h(t) = log
h₀(t) + b₁X₁ + …
Meerdere determinanten of confounders
Voorbeeld uit het college (AIDS-data): na 15 maanden is S = 0.66 bij
ddC en 0.57 bij ddI. De log-rank-toets kijkt naar het hele verloop in
plaats van naar dat ene moment.
Voorbeeld (ZO2, voedselvergiftiging): leeftijd b = 0.013, dus HR =
1.013 per jaar; per 10 jaar 1.013¹⁰ = 1.14. Voor een
categorische variabele (hygiëne) vergelijkt elke dummy met de
referentiecategorie.
Aanname: proportionele hazards. De HR is over de
hele follow-up constant, dus de KM-curves kruisen niet.
Actuariële levenstafel (ZO1). Een variant met vaste
intervallen. Wie in een interval gecensureerd wordt, telt voor de helft
mee als at risk: at risk = aantal bij de start − gecensureerd/2.
Voorbeeld: 170 − 25/2 = 157.5; 85 events geeft een kans van 85/157.5 =
0.54 in jaar 1.
Van incidentiecijfers naar risico (formuleblad p6).
S(t) = exp(−Σ ICᵢ × Δtᵢ). Tel je de 10-jaars incidentiecijfers van
borstkanker van 20 tot 80 jaar op (samen 0.115), dan is het risico 1 −
e^(−0.115) = 0.109.
Etiologisch en
prognostisch onderzoek
Hetzelfde regressiemodel kan twee heel verschillende doelen dienen.
Bij etiologisch onderzoek wil je één oorzakelijk effect
zuiver schatten; bij prognostisch onderzoek wil je de
uitkomst zo goed mogelijk voorspellen, ongeacht waarom een variabele
voorspelt.
Etiologisch
Prognostisch
Vraag
Veroorzaakt X de ziekte?
Wie krijgt de uitkomst, en hoe groot is de kans?
Voorbeeld
Verhoogt roken in de zwangerschap het risico op laag
geboortegewicht?
Hoe groot is de 5-jaarsoverleving van deze patiënt met
borstkanker?
Rol van andere variabelen
Confounders: corrigeren om het effect van X zuiver te krijgen
Voorspellers: alles wat helpt, ook als het niet causaal is
Design
Cohort, case-control, RCT
Cohort, liefst een inceptiecohort: alle patiënten vanaf hetzelfde
moment in het ziektebeloop (bijv. de diagnose)
Resultaat
Gecorrigeerde RR, OR of HR voor X
Voorspelde kans per patiënt; kwaliteit via discriminatie
(AUC/c-statistic) en calibratie
Designherkenning in de praktijk (ZO3). Zeven NEJM-
en andere abstracts, elk een ander observationeel design:
Studie
Design
Maat
Early repolarization en plotse hartstilstand (Haïssaguerre)
Case-control, retrospectief
Verschil in prevalentie
Hartfalen bij ouders en bij kinderen (Lee)
Cross-sectioneel + prospectief cohort
Verschil in gemiddelden; HR
Slaapapneu en cardiovasculaire events (Kendzerska)
Historisch (retrospectief) cohort
HR
Tandheelkundige röntgenfoto’s en vestibulair schwannoom (Han)
Case-control
OR
Koffie en hartinfarct (Sesso)
Case-control
OR
Koffie en hartfalen bij vrouwen (Levitan)
Prospectief cohort
HR
Herpes zoster en cardiovasculaire events (Wu)
Cohort
HR
Het patroon: case-control levert een OR; een cohort met
follow-up-tijd levert meestal een HR uit Cox-regressie. Kendzerska laat
zien dat een cohort ook retrospectief kan zijn: de gegevens lagen al in
dossiers vast.
Een prognostische factor hoeft geen oorzaak te zijn.
Grijs haar voorspelt sterfte, omdat het met leeftijd samenhangt, maar
haarverf verlengt het leven niet.
Valkuilen en typische
tentamenvragen
Valkuil
Hoe het wel zit
r = 0 lezen als ‘geen verband’
Alleen geen lineair verband; een U-vormig verband
geeft ook r ≈ 0.
r en b verwarren
r zegt hoe strak de punten rond de lijn liggen, b hoe steil de lijn
is. Een steile lijn kan een lage r hebben.
De coëfficiënt van een logistisch model als OR lezen
b is een log-OR; de OR is e^b. Het BI voor de OR: e^(b ± 1.96 ×
SE).
df voor de toets van b
df = n − aantal verklarende variabelen − 1, niet n − 1.
Aannames over X of Y toetsen
Bij lineaire regressie gaan de aannames over de residuen.
Gecensureerde patiënten weglaten
Ze tellen mee zolang ze gevolgd zijn; weglaten maakt de overleving
te pessimistisch of te optimistisch.
Log-rank en een verschil op één tijdstip verwarren
Log-rank vergelijkt de hele curves; een z-toets op S(t) vergelijkt
één moment.
Een HR als RR lezen
Een HR vergelijkt de momentane kans op het event (hazard), over de
hele follow-up; geen cumulatief risico.
Een continue variabele per 10 eenheden
Vermenigvuldig b met 10 en neem dan e^: OR of HR per 10 eenheden =
(OR per eenheid)¹⁰.
Zo worden deze onderwerpen gevraagd
Uit SPSS-output een voorspelde waarde uitrekenen (lineair), of een
kans (logistisch).
Een p-waarde of BI voor een coëfficiënt bepalen uit b en SE, of
andersom (oud 2016, v6–7; 2017, v18–20).
Een regressiemodel met interactieterm interpreteren (hertentamen
2017, v16–20).
Een coëfficiënt uit een logistisch model omzetten naar een OR, of de
kans uitrekenen (oud 2016, v16–18).
Een BI voor een correlatiecoëfficiënt met Fisher-z (oud 2016, v10;
2017, v7).
Log-rank tegenover een toets op één tijdstip; een verschil in S(t)
toetsen (oud 2016, v13–14; 2017, v15).
Hoofdstuk 6 van 7
6 · Interventieonderzoek (RCT) en meta-analyse
Waarom een
gecontroleerde studie, en welke vraag?
Het probleem (college Bos WL1). Een patiënt met een
bloeddruk van 190/100 krijgt middel X; bij de volgende controle is het
130/80. Dat kan komen door het middel, maar ook door het natuurlijke
beloop, door meetfout of door regressie naar het gemiddelde. Een
controlegroep zonder middel X heeft die andere verklaringen ook, zodat
het verschil tussen de groepen alleen nog door het middel, toeval, bias
of confounding kan komen. Randomisatie haalt de confounding weg.
Efficacy of effectiveness?
Efficacy
Effectiveness
Vraag
Werkt de behandeling onder ideale omstandigheden?
Werkt het aanbieden of adviseren van de behandeling
in de dagelijkse praktijk?
Type trial
Explanatory: strenge selectie, placebo of sham, blindering,
goede therapietrouw
Pragmatic: brede populatie, vergelijking met gebruikelijke
zorg, vaak niet geblindeerd
Past bij
Per-protocol-analyse (met het risico op selectiebias)
Intention-to-treat
Validiteit
Hoge interne validiteit
Hoge externe validiteit (generaliseerbaar)
Oud tentamen 2016, v27: een open (niet geblindeerde) RCT van PCI
tegen optimale medicatie, geanalyseerd volgens intention-to-treat, meet
de effectiviteit van het adviseren van PCI.
Specifieke en niet-specifieke effecten
(Interventie-oefenvragen I.1–I.2)
Specifiek effect: het effect via het werkzame mechanisme
(dexamethason remt de ontsteking bij COVID-19).
Niet-specifiek effect: alles rondom de behandeling:
verwachting, aandacht, het ritueel, de arts-patiëntrelatie. Samen heet
dat het placebo-effect.
Een placebo of sham moet het niet-specifieke deel precies nabootsen
(uiterlijk, toedieningsvorm, aantal bezoeken). Het verschil tussen de
armen is dan het specifieke effect.
Equipoise. Randomiseren is alleen ethisch als
deskundigen oprecht onzeker zijn welke behandeling beter is. Weet je al
dat één arm beter is, dan mag je patiënten niet bewust de slechtere
laten krijgen (zie ook tabblad 7).
Wat een RCT wel en niet goed kan. Een RCT is sterk
voor de bedoelde effecten (sterfte, morbiditeit), maar vaak te klein en
te kort voor zeldzame of late bijwerkingen. Die komen uit observationeel
onderzoek na de registratie.
Randomisatie,
concealment en blindering
Elke stap in een RCT beschermt tegen een eigen vorm van bias.
Randomisatie tegen confounding, verborgen toewijzing tegen selectiebias,
blindering tegen informatiebias en een goede follow-up tegen uitval.
Randomisatie verdeelt bekende én onbekende
prognostische factoren gelijk over de groepen. Daardoor is er geen
confounding (oud 2017, v34). Toeval blijft; dat verklein je met een
grotere n.
Goede methoden: een computergegenereerde reeks of een tabel met
toevalsgetallen. Met blokken krijg je gelijke
groepsgroottes; met stratificatie balans op een sterke
prognostische factor (bijv. ziekenhuis, ernst).
Pseudo-randomisatie (geboortedatum even of oneven,
dossiernummer, dag van de week, om en om) is voorspelbaar. De arts kan
dan sturen wie waar terechtkomt. Het is geen echte randomisatie (oud
2016, v25).
Allocation concealment houdt de toewijzing geheim
tot de patiënt definitief is geïncludeerd: centrale randomisatie via
telefoon of internet, of genummerde, ondoorzichtige, verzegelde
enveloppen. Draagt de onderzoeker de randomisatielijst in zijn zak, dan
kan hij kiezen wie hij includeert. Dat geeft selectiebias, ook als de
lijst door een computer gemaakt is (oud 2017, v25). Concealment kan
altijd; blindering niet altijd.
Blindering
Wie weet het niet?
Voorkomt
Patiënt
Ander gedrag, andere rapportage van klachten (performance bias)
Behandelaar of zorgverlener
Andere zorg of bijbehandeling (performance bias)
Uitkomstbeoordelaar
Andere meting of beoordeling (detection bias)
Data-analist
Keuzes in de analyse die de uitkomst sturen
Kun je patiënt en behandelaar niet blinderen (operatie tegen PCI,
leefstijl), blindeer dan tenminste de uitkomstbeoordelaar en de analist,
en kies harde uitkomsten zoals sterfte (oud 2017, v27).
Een sham-procedure bootst een ingreep na zonder het
werkzame deel. Bij renale denervatie ondergaat iedereen een
nierangiografie onder sedatie; de controlegroep krijgt alleen die
angiografie, die dus als sham dient (oud 2016, v26).
Risk of bias in een RCT (Cochrane, gebruikt in
ZO1)
Domein
Vraag
Oplossing
Selectiebias
Echte randomisatie? Toewijzing verborgen?
Computerrandomisatie, centrale toewijzing
Performance bias
Patiënten en personeel geblindeerd?
Placebo, sham
Detection bias
Uitkomstbeoordelaar geblindeerd?
Onafhankelijke beoordelaars, harde uitkomsten
Attrition bias
Uitval of ontbrekende data, verschillend per arm?
Weinig loss to follow-up, ITT
Reporting bias
Alleen gunstige uitkomsten gerapporteerd?
Protocol en uitkomsten vooraf registreren
RCT-designs
De standaard is de parallelle RCT. Kies een variant als de vraag, de
interventie of het risico op contaminatie daarom vraagt. Tentamenvragen
geven een casus en vragen welk design het best past.
Design
Kern
Past bij
Let op
Parallel (individueel gerandomiseerd)
Elke patiënt krijgt één arm
De meeste individuele interventies: medicatie, een app, een
leefstijlprogramma (oud 2017, v29; her 2017, v22)
Contaminatie als patiënten elkaar beïnvloeden
Cross-over
Elke patiënt krijgt beide behandelingen in gelote volgorde en is
zijn eigen controle: efficiënt
Chronische, stabiele aandoening,
symptoombehandeling, reversibel
effect: IBS-dieet of -medicatie, symptomatische pijnstilling (oud 2016,
v29; 2017, v33; her v31)
Wash-out nodig, geen carry-over. Ongeschikt voor genezing of
blijvend effect (operatie, chemo, educatie)
Factorieel (2×2)
Twee interventies tegelijk: A+B, A+placebo, B+placebo,
placebo+placebo
Twee vragen in één trial (Physicians’ Health Study II: vitamine E en
C)
Aanname: geen interactie tussen A en B
Cluster-RCT
Groepen worden geloot: praktijk, ziekenhuis, regio, gezin
Groeps- en leefstijlinterventies, scholing, implementatie; als
contaminatie dreigt (oud 2016, v32; 2017, v32)
Randomiseer op het niveau waar contaminatie ontstaat (her 2017, v30:
het gezin). Meer patiënten nodig
Stepped-wedge (cluster)
Alle clusters beginnen als controle en stappen in gelote volgorde
over
Implementatie die niet overal tegelijk kan, of die je niemand wilt
onthouden: Mobiele Stroke Unit per regio (I.5)
Tijdtrends kunnen confounden; lange duur
Zelen (pre-randomisatie)
Loten vóór de informed consent; alleen de
interventiegroep wordt gevraagd (single consent) of beide groepen horen
hun arm (double consent)
Nieuwe aanpak tegen gebruikelijke zorg, als kennis van de andere arm
teleurstelling of contaminatie geeft (leefstijl met educatie, oud 2016,
v28)
Ethische bezwaren (consent na loting); meet het effect van het
aanbieden, niet van de behandeling zelf (I.4)
Cohort multiple RCT (TwiCs)
Binnen een lopend cohort wordt een willekeurig deel geloot om de
interventie aangeboden te krijgen; de rest is
controle
Pragmatisch, efficiënt, meerdere trials in één cohort (her 2017,
v29)
Weigeren van het aanbod verdunt het effect; consent-ethiek zoals bij
Zelen
Non-inferiority
Aantonen dat de nieuwe behandeling niet slechter is dan de
standaard, binnen een vooraf vastgestelde marge
Goedkoper, veiliger of minder belastend alternatief
ITT is hier niet conservatief: analyseer ook per-protocol
Before-after / historische controles
Uitkomst vóór tegen ná invoering (ZO1: NHS Health Check)
Alleen als loten niet kan
Tijdtrends, regressie naar het gemiddelde, andere zorg: zwak bewijs
(oud 2017, v26)
Bron: Schema, naar Bos WL2 en Interventie-oefenvraag I.5
Vuistregel bij casusvragen. Stel drie vragen. Is het
effect omkeerbaar en de ziekte stabiel? Dan cross-over. Werkt de
interventie op groepsniveau of besmet de ene patiënt de andere? Dan
cluster. Kan de invoering niet overal tegelijk? Dan stepped-wedge.
Anders: parallel. Staat er als antwoord “alle designs zijn te overwegen,
elk met voor- en nadelen”, dan kan dat zelf het goede antwoord zijn (her
2017, v28).
Analyse en effectmaten
Na de randomisatie houdt niet iedereen zich aan de toegewezen
behandeling. Hoe je daarmee omgaat, bepaalt welke vraag je beantwoordt
en welke bias je riskeert.
Analyse
Wie tellen mee, en in welke groep?
Schat
Risico
Intention-to-treat (ITT)
Iedereen, in de arm waarin hij geloot is
Effect van het toewijzen of aanbieden (effectiveness). Behoudt de
randomisatie
Verdunt het effect bij non-compliance (meestal onderschatting)
Per-protocol (PP)
Alleen wie de toegewezen behandeling kreeg
Effect bij optimale therapietrouw (richting efficacy)
Selectiebias: de randomisatie is doorbroken
As-treated (AT)
Iedereen, naar de werkelijk ontvangen
behandeling
Effect van de ontvangen behandeling
Confounding by indication
Modified ITT
ITT zonder wie vóór de start van de behandeling uitviel
Tussenvorm
Kan ongemerkt een verkapte PP worden
Voorbeeld uit het college (Bos WL2). Zeven
patiënten, uitkomst 1 = event:
ID
Geloot
Gekregen
Event
1
A
A
1
2
A
A
0
3
B
A
1
4
B
A
1
5
A
B
0
6
B
B
1
7
A
A
0
ITT (naar geloot): A = 1/4 (ID 1, 2, 5, 7), B = 3/3 (ID 3, 4,
6).
Per-protocol (alleen wie kreeg wat geloot was: 1, 2, 6, 7): A = 1/3,
B = 1/1.
As-treated (naar gekregen): A = 3/5 (ID 1, 2, 3, 4, 7), B = 1/2 (ID
5, 6).
Dezelfde data geven dus heel verschillende conclusies. ITT is de
primaire analyse van een superiority-RCT; bij een non-inferiority-trial
kijk je ook naar PP.
Effectmaten bij een dichotome uitkomst (zie ook
tabblad 1). Voorbeeld: 10% events in de controlegroep, 7% in de
interventiegroep.
Maat
Berekening
Uitkomst
Zegt
RR
0.07/0.10
0.70
Risico is 70% van dat in de controlegroep
RRR
1 − 0.70
30%
30% van het risico verdwijnt
ARR
0.10 − 0.07
0.03
3 van de 100 events voorkomen
NNT
1/0.03 = 33.3
34
34 patiënten behandelen om 1 event te voorkomen
NNH
1/(toename bijwerking)
Aantal te behandelen voor 1 extra bijwerking
Bij tijd-tot-event-uitkomsten rapporteer je een HR uit Cox-regressie
met Kaplan-Meiercurves; bij een continue uitkomst het verschil in
gemiddelden met een BI (tabblad 4 en 5).
Steekproefgrootte
en observationeel onderzoek naar behandeleffecten
Steekproefgrootte (uitgewerkt in tabblad 4).
Essentieel voor de berekening zijn α en β (de power) en het kleinste
klinisch relevante effect (Interventie-oefenvraag I.3: alleen die twee
antwoorden waren goed; een eerder gerapporteerd effect of het verwachte
aantal events niet). Daarnaast gebruik je de spreiding van de uitkomst
of het eventpercentage in de controlegroep. Een cluster-RCT heeft meer
patiënten nodig, omdat patiënten binnen een cluster op elkaar lijken.
Een cross-over-trial heeft er minder nodig, omdat elke patiënt zijn
eigen controle is. Een grotere n verkleint het toeval, niet de bias (her
2017, v34).
Fasen van geneesmiddelenonderzoek (college WL3)
Fase
Doel
Wie
I
Veiligheid, dosering, farmacokinetiek
Kleine groep, vaak gezonde vrijwilligers
II
Eerste werkzaamheid, optimale dosis
Kleine groep patiënten
III
Werkzaamheid tegen placebo of standaard: gerandomiseerd,
dubbelblind
Grote groep patiënten; basis voor registratie
IV
Bijwerkingen en effect in de praktijk na registratie
Observationeel, zeer grote aantallen
Waarom observationeel onderzoek naar behandelingen lastig
is. Artsen behandelen niet willekeurig: wie een behandeling
krijgt, is vaak zieker (of juist gezonder) dan wie hem niet krijgt. Dat
is confounding by indication: statinegebruikers krijgen
vaker hart- en vaatziekten, omdat juist mensen met een hoog risico een
statine krijgen (college WL3).
Correctie met regressie helpt alleen voor gemeten factoren. De ernst
van de ziekte zoals de arts die inschat, staat zelden goed in de
data.
Voor bedoelde effecten (werkt het middel?) is een
RCT daarom het design van keuze.
Voor onbedoelde effecten (zeldzame bijwerkingen) is
observationeel onderzoek wel geschikt. De indicatie hangt meestal niet
samen met die onverwachte bijwerking, dus confounding by indication
speelt minder. Bovendien zijn RCT’s te klein en te kort om zeldzame
bijwerkingen te zien.
Een before-after-studie of historische controlegroep is alleen een
optie als randomiseren echt niet kan. Die zijn gevoelig voor tijdtrends
en regressie naar het gemiddelde (ZO1: NHS Health Check-evaluatie).
Systematic review en
meta-analyse
Een systematic review zoekt en beoordeelt alle
studies over één vraag volgens een vooraf vastgelegd protocol. Een
meta-analyse combineert daarna de resultaten
statistisch tot één gewogen schatting. Samen staan ze bovenaan de
bewijshiërarchie, maar ze zijn nooit beter dan de studies die erin
zitten.
Stappen van een systematic review
Een scherpe vraag (PICO: patiënt, interventie, vergelijking,
uitkomst) en een protocol, vooraf geregistreerd.
Systematisch zoeken in meerdere databases, reproduceerbaar.
Selectie op vooraf vastgestelde in- en exclusiecriteria, door twee
beoordelaars onafhankelijk.
Kwaliteit per studie beoordelen (risk of bias).
Data extraheren en, als de studies genoeg op elkaar lijken, poolen
in een meta-analyse.
De forest plot. Elke studie is een punt met haar BI;
grotere studies wegen zwaarder (inverse-variantieweging). De ruit of het
onderste punt is de gepoolde schatting.
Bron: Verzonnen data; gepoold met inverse-variantieweging (berekend)
Het voordeel van poolen is precisie: het
gecombineerde BI is smaller dan dat van elke losse studie (ZO.D v15).
Poolen maakt de schatting niet valider: bias in de afzonderlijke studies
blijft.
Probleem
Wat het is
Hoe je het ziet of aanpakt
Heterogeniteit
De studies geven meer verschillende resultaten dan je door toeval
verwacht
Q-toets en I² (0% = geen; > 50% = veel). Aanpak: random-effects
model, subgroepanalyse, of niet poolen
Publicatiebias
Kleine studies zonder effect worden niet gepubliceerd
Asymmetrische funnel plot: rechtsonder of
linksonder ontbreken kleine studies. Aanpak: trialregisters, grijze
literatuur
Slechte studies
Garbage in, garbage out
Risk-of-bias-beoordeling, gevoeligheidsanalyse zonder de zwakke
studies
Fixed of random effects. Een fixed-effect model
neemt aan dat alle studies hetzelfde ware effect schatten. Een
random-effects model staat toe dat het ware effect per studie verschilt;
het BI wordt dan breder. Bij duidelijke heterogeniteit kies je random
effects.
Valkuilen en typische
tentamenvragen
Valkuil
Hoe het wel zit
Allocation concealment en blindering verwarren
Concealment: niemand weet de volgende toewijzing vóór inclusie
(tegen selectiebias). Blindering: niemand weet de arm tijdens de studie
(tegen informatiebias).
Geboortedatum of dossiernummer als randomisatie accepteren
Pseudo-randomisatie: voorspelbaar, dus geen echte randomisatie.
Per-protocol als ‘zuiverste’ analyse zien
Per-protocol doorbreekt de randomisatie: selectiebias. ITT is de
primaire analyse.
ITT overschat het effect
Bij non-compliance onderschat ITT het effect meestal (verdunning
richting 1).
Cross-over voor een genezende of blijvende behandeling
Cross-over alleen bij een stabiele, chronische aandoening en een
omkeerbaar effect.
Cluster te klein kiezen
Randomiseer op het niveau waar contaminatie ontstaat: het gezin, de
praktijk, de regio.
Zelen verwarren met een gewone RCT
Bij Zelen wordt geloot vóór de toestemming; het meet het effect van
het aanbieden en is ethisch omstreden.
Meta-analyse maakt bias ongedaan
Poolen vergroot alleen de precisie.
Randomisatie lost alles op
Niet: blindering, concealment en weinig uitval blijven nodig.
Zo worden deze onderwerpen gevraagd
Een casus (dieet bij prikkelbare darm, beweegprogramma in
huisartspraktijken, stroke-ambulance per regio) en de vraag welk design
het beste past.
Beweringen over Zelen of het cohort-multiple-RCT-design
beoordelen.
Welke bias ontstaat bij een zichtbare randomisatielijst, en welke
blindering in een chirurgische trial realistisch is.
Wat het voordeel en de beperking van een meta-analyse is.
Hoofdstuk 7 van 7
7 · Ethiek van wetenschappelijk onderzoek
Wet- en regelgeving:
WMO, METC en CCMO
In Nederland regelt de Wet medisch-wetenschappelijk onderzoek
met mensen (WMO, 1999) onderzoek met mensen. De ethische kern
is een dubbele toestemming: eerst een positief oordeel van een
toetsingscommissie over het protocol, daarna de toestemming van elke
deelnemer.
Wanneer is onderzoek WMO-plichtig? Als aan
beide voorwaarden is voldaan:
Het is medisch-wetenschappelijk onderzoek (een
vraag op het gebied van ziekte en gezondheid, met een wetenschappelijke
methode).
Deelnemers worden onderworpen aan handelingen of er
wordt hun een gedragswijze opgelegd (bloedafname, een
scan, een middel, een dieet, een belastende vragenlijst).
Oud tentamenprotocol
WMO-plichtig?
Waarom
Normaalwaarden bij gezonde vrijwilligers via enkele
venapuncties
Ja (2016, v39; 2017, v40; her 2017, v40)
Medisch-wetenschappelijk én een handeling
Normaalwaarden bij kinderen via dossieronderzoek
(statusonderzoek)
Nee
Geen handeling; alleen bestaande gegevens
Vragenlijst over communicatie op de afdeling of tevredenheid over
voorzieningen
Nee
Geen medisch-wetenschappelijke vraag, geen belastende handeling
Interventie gericht op taalontwikkeling bij kinderen van 3–12
maanden
Nee (volgens de sleutel)
Gedragswetenschappelijk, niet medisch-wetenschappelijk
Wie toetst?
METC (ongeveer 15 in Nederland): toetst het
protocol vooraf. Samenstelling: arts, methodoloog, jurist, ethicus, lid
namens de deelnemers (lekenlid), en bij geneesmiddelen of hulpmiddelen
een apotheker of klinisch farmacoloog, respectievelijk een deskundige
medische hulpmiddelen.
De METC geeft een bindend oordeel, geen advies: bij
een negatief oordeel mag het onderzoek niet worden uitgevoerd.
CCMO (Centrale Commissie Mensgebonden Onderzoek):
erkent en houdt toezicht op de METC’s, behandelt beroep tegen
METC-oordelen en toetst zelf enkele bijzondere categorieën onderzoek
(bijvoorbeeld gentherapie en onderzoek onder de Embryowet).
Voor geneesmiddelen- en hulpmiddelenonderzoek gelden ook de Europese
verordeningen (CTR en MDR).
Andere kaders naast de WMO. De AVG voor
persoonsgegevens, de WGBO voor het gebruik van dossiergegevens, de
Embryowet, en internationaal de Verklaring van Helsinki.
Niet-WMO-plichtig onderzoek (alleen data, dierproeven, puur
gedragswetenschappelijk) gaat naar andere commissies, zoals een
niet-WMO-commissie of een dierexperimentencommissie.
Waarom al deze regels? De geschiedenis: de medische
experimenten in de Tweede Wereldoorlog (Code van Neurenberg, 1947), de
Tuskegee-syfilisstudie in de VS (Belmont Report) en de Verklaring van
Helsinki (1964, herzien in 2024).
Informed consent en
kwetsbare deelnemers
“Het is verboden wetenschappelijk onderzoek te verrichten zonder de
schriftelijke toestemming van de betrokkene” (WMO, art. 6). Informed
consent is geen handtekening maar een proces dat de
hele studie doorloopt.
Eisen aan informed consent
Schriftelijke informatie (de proefpersoneninformatie, PIF) in
begrijpelijke taal: doel, wat er gebeurt, belasting, risico’s, mogelijke
voor- en nadelen, verzekering, vergoeding.
Een mondelinge toelichting (volgens het college optioneel) en
voldoende bedenktijd.
Vrijwillig, en je kunt je altijd zonder opgaaf van reden
terugtrekken, zonder gevolgen voor je zorg.
Een door deelnemer én onderzoeker ondertekend
toestemmingsformulier.
Wat ging er mis in het filmfragment ‘Wit’
(hoorcollege)?
Diagnose en de vraag om mee te doen in één gesprek.
Geen onderscheid tussen behandeling en onderzoek.
Geen bedenktijd en geen schriftelijke informatie.
Pas ná de handtekening nog informatie gegeven.
Moeilijk taalgebruik en druk om deel te nemen.
Waarom deelnemers kwetsbaar zijn. Beperkt begrip,
emoties, tijdsdruk, een ongelijke relatie met de arts-onderzoeker,
loyaliteit, afhankelijkheid, geldprikkels en de therapeutische
misvatting: het idee dat deelname vooral een behandeling voor
jezelf is. Scheid als arts-onderzoeker daarom je twee rollen en wees
realistisch over voor- en nadelen.
Bijzondere groepen (WMO)
Groep
Wie geeft toestemming
Extra voorwaarden
Kinderen jonger dan 12
Ouders of voogd
Verzet van het kind respecteren
Kinderen van 12 tot 16
Ouders én het kind
16 jaar en ouder
De jongere zelf
Wilsonbekwame volwassenen
Wettelijk vertegenwoordiger
Verzet respecteren
Onderzoek zonder direct voordeel bij minderjarigen of
wilsonbekwamen
Zoals hierboven
Alleen als het niet met wilsbekwame volwassenen kan (groepsgebonden)
en met verwaarloosbaar risico en minimale belasting
Spoedeisend onderzoek (reanimatie, trauma)
Uitgesteld: zo snel mogelijk achteraf, van de patiënt of
vertegenwoordiger
Alleen als het onderzoek niet anders kan en de METC het
goedkeurt
Deelnemers moeten verplicht verzekerd zijn tegen schade door het
onderzoek; de METC beoordeelt ook de verzekering en de hoogte van
vergoedingen, zodat geld niet de reden wordt om risico’s te nemen.
Ethische afwegingen
De METC zoekt de balans tussen twee belangen: vooruitgang in de
geneeskunde (gezondheidswinst voor toekomstige patiënten) en de
bescherming van de deelnemer tegen risico’s en belasting.
Vier ethische principes
Principe
In onderzoek betekent het
Weldoen
Het onderzoek moet kunnen leiden tot nieuwe inzichten en mogelijk
gezondheidswinst voor de populatie (her 2017, v38).
Direct voordeel voor de deelnemer zelf is niet vereist.
Niet schaden
Risico’s en belasting zo klein mogelijk maken. Nul risico is niet
vereist.
Respect voor autonomie
Vrijwillige, geïnformeerde toestemming.
Rechtvaardigheid
Eerlijke selectie van deelnemers (niet alleen kwetsbare of makkelijk
bereikbare groepen), toegang tot de behandeling na de trial.
De toetsingscriteria van de METC (WMO art. 3)
Criterium
Vraag van de METC
Nieuwe inzichten
Kan het onderzoek leiden tot nieuwe wetenschappelijke kennis?
Juiste methodologie
Is de opzet goed genoeg om de vraag te beantwoorden? Slecht
onderzoek belast deelnemers voor niets en is daarom onethisch.
Proportionaliteit
Wegen de belasting en risico’s voor de deelnemer op
tegen het belang van het onderzoek (her 2017,
v39)?
Subsidiariteit
Kan het ook op een minder ingrijpende manier: in
het laboratorium, met proefdieren, met minder belastende metingen, of
bij een minder kwetsbare groep (2017, v39)?
Werving en informed consent
Is de werving eerlijk en de informatie begrijpelijk?
Verzekering en vergoeding
Zijn deelnemers verzekerd? Is de vergoeding geen lokkertje?
Oud tentamen 2016, v38 en 2017, v38 (zelfde vraag): de METC geeft een
negatief oordeel als het onderzoek niet tot nieuwe
wetenschappelijke inzichten kan leiden of
methodologisch niet goed is. Dat het onderzoek tot een
nieuwe behandeling moet leiden, is geen eis.
Equipoise en placebo. Randomiseren mag alleen bij
oprechte onzekerheid onder deskundigen over welke behandeling beter is.
Een placebo is volgens de Verklaring van Helsinki alleen aanvaardbaar
als er geen bewezen effectieve behandeling is, of als er dwingende
methodologische redenen zijn en deelnemers daardoor geen ernstige of
blijvende schade oplopen.
De ‘poorten’ die een deelnemer beschermen
(hoorcollege): wet- en regelgeving → de onderzoeksopzet door de
onderzoeker → toetsing door de METC → werving → informed consent door de
deelnemer zelf.
Valkuilen en typische
tentamenvragen
Valkuil
Hoe het wel zit
Proportionaliteit en subsidiariteit verwarren
Proportionaliteit: weegt de last op tegen het belang?
Subsidiariteit: kan het minder ingrijpend?
“Weldoen = de deelnemer moet er zelf beter van worden”
Weldoen gaat om mogelijke gezondheidswinst voor de populatie.
Niet-therapeutisch onderzoek kan dus ethisch zijn.
“Deelnemers mogen geen enkel risico lopen”
Risico’s moeten klein en proportioneel zijn, niet nul.
“De METC geeft een advies”
Het is een bindend oordeel: zonder positief oordeel geen
onderzoek.
“Al het onderzoek met patiënten is WMO-plichtig”
Alleen bij een medisch-wetenschappelijke vraag én handelingen of
opgelegd gedrag. Dossieronderzoek en eenvoudige vragenlijsten niet.
“Onderzoek moet tot een nieuwe behandeling leiden”
Nieuwe wetenschappelijke inzichten zijn genoeg.
Zo worden deze onderwerpen gevraagd. Elk oud
tentamen sloot af met 2 of 3 ethiekvragen, bijna altijd uit deze
vier:
Welk protocol is WMO-plichtig? (Zoek de handeling: bloedafname bij
gezonde vrijwilligers.)
Wanneer geeft een METC een negatief oordeel? (Geen nieuwe inzichten
of slechte methodologie.)
Wat is subsidiariteit, wat is proportionaliteit?
Wat betekent het principe van weldoen in onderzoek?