Causalitat i grafs acíclics dirigits en estudis observacionals
Abstract
Hom vol introduir-se dins de l’àmbit de la inferència causal i dels grafs acíclics dirigits a fi de millorar l’anàlisi estadística i causal en estudis observacionals, la seva especificació i reproductibilitat. Hom tria dos problemes per tal d’aplicar-hi el corpus teòric après dels estudiosos en inferència causal Anne Brumback i Judea Pearl: el primer problema és una revisió crítica d’un article clínic sobre la pervivència de pacients de càncer i símptomes de COVID i el segon és un problema d’enginyeria astronàutica, l’estudi de l’accident del Challenger.
Full text
1 Grau en Estadística Títol: Causalitat i Grafs Acíclics Dirigits en estudis observacionals Autor: David Graupere Villà Codirectors: Erik Cobo Valeri Xavi Puig Oriol Departament: Departament d'Estadística i Investigació Operativa UPC (Campus Nord i ETSEIB) Convocatòria: Juliol 2023
2 «…δεν πιστεύουμε ότι γνωρίζουμε ένα πράγμα πριν συλλάβουμε το γιατί , ήτοι το “διὰ τί” του (πριν δηλαδή συλλάβουμε την πρώτη αιτία)…» (Φυσικά, 194 b 17 – 20) Αριστοτέλης (350 π.Χ.) «Hom pensa que no té coneixement d'una cosa fins que no se n'ha copsat el perquè, és a dir, la seva causa» Aristòtil (350 aC) «El desenvolupament de la ciència occidental es basa en dos grans èxits: la invenció del sistema lògic formal (en geometria euclidiana) pels filòsofs grecs, i el descobriment de la possibilitat d'esbrinar relacions causals mitjançant experiments sistemàtics (durant el Renaixement)» Albert Einstein (1953) A la meva mare, Teresa Als pacients codirectors, Erik Cobo i Xavier Puig Als amics i professors, Joan Carles Lario, Antonio Lubary i Natalia Sadovskaia
3 Resum Hom vol introduir-se dins de l’àmbit de la inferència causal i dels grafs acíclics dirigits a fi de millorar l’anàlisi estadística i causal en estudis observacionals, la seva especificació i reproductibilitat. Hom tria dos problemes per tal d’aplicar-hi el corpus teòric après dels estudiosos en inferència causal Anne Brumback i Judea Pearl: el primer problema és una revisió crítica d’un article clínic sobre la pervivència de pacients de càncer i símptomes de COVID i el segon és un problema d’enginyeria astronàutica, l’estudi de l’accident del Challenger. Paraules clau: Causalitat, inferència, diagrama acíclic dirigit, graf, reproductibilitat, ajustament, estandardització, the lancet, challenger Summary The aim is to enter the field of causal inference and acyclic graphs aimed at improving statistical and causal analysis in observational studies, their specification and reproducibility. Two problems are chosen to apply the theoretical corpus learned from causal inference scholars Anne Brumback and Judea Pearl: the first problem is a critical review of a clinical article on cancer patient survival and COVID symptoms and the second is an astronautical engineering problem, the study of the Challenger accident. Keywords: causality, inference, directed acyclic diagram, graph, reproducibility, adjustment, standardization, the lancet, challenger Classificació AMS: 94C15 Applications of graph theory 62P99 Applications of statistics 62Fxx Parametric inference
4 ÍNDEX I. INTRODUCCIÓ ......................................................................................................................................................... 6 1. Estructura del TFG ............................................................................................................................................. 6 2. Objectius ............................................................................................................................................................. 6 3. Nota històrica: de la causació d’Aristòtil als grafs de camins de Sewall Wright .......................................... 7 II. MÈTODE ................................................................................................................................................................ 10 1. La causalitat en els estudis observacionals .................................................................................................. 10 2. L’aprenentatge metodològic ............................................................................................................................ 11 I.3.1 Apartat1_introducció: primer i segon llibre de Física d’Aristòtil ...................................................................... 13 III. PROBLEMA 1: UN ESTUDI DE COHORT PROSPECTIU .................................................................................. 15 Mortalitat per covid-19 en pacients amb quimioteràpia o altres tractaments anticancerígens ..................... 15 0.Introducció ......................................................................................................................................................... 15 1. Associació (causal) entre tractament i mortalitat ..................................................................................... 17 2.Interacció estadística i l’efecte-modificador segons cada mesura (RD,RR,RR*,OR): determinar si la comorbilitat modifica l’efecte del tractament en la resposta. ........................................................................... 21 3.Interacció causal: interacció estadística versus interacció causal .............................................................. 24 4. Conclusions ...................................................................................................................................................... 26 Apartat1_problema1 ............................................................................................................................................... 27 Apartat2_problema1 ............................................................................................................................................... 30 Apartat3_problema1 ............................................................................................................................................... 31 IV. PROBLEMA 2: L’ACCIDENT DEL CHALLENGER ............................................................................................ 33 El problema de segellatge de les juntures dels coets de propulsió ................................................................ 33 1. Context .............................................................................................................................................................. 33 2. Wade Robinson,filòsof, versus Edward R. Tufte, estadístic ........................................................................ 34 5. Possibles qüestions a respondre i/o possibles conclusions a verificar ..................................................... 38 6. Buidatge i taula de dades definitiva ................................................................................................................ 39 7. DAG teòric versus DAG pràctic (història de les dades versus registre de les dades) ............................... 42 8. Bastiment del DAG parcialment fet segons el mètode ESC-DAGs .............................................................. 45 9. Validació del DAG versus la base de dades ................................................................................................... 50 10. Ajustament per confonedors: kriterion de rere-porta per mitjà d’un dels mètodes de l’estandardització (per mitjà de la modelització dels resultats) ...................................................................................................... 52 11. Conclusions .................................................................................................................................................... 56 V. ANNEX 1: CONCEPTES ESSENCIALS .............................................................................................................. 57 (sobretot en clau de bases de dades binàries) .................................................................................................. 57 VI. ANNEX 2: APROFUNDIMENT ............................................................................................................................ 65 (sobretot en termes de Grafs Acíclics Dirigits) .................................................................................................. 65 VII. CODI R PROBLEMA 1: A PROSPECTIVE COHORT STUDY ........................................................................... 74 0. Tests .............................................................................................................................................................. 74 1. Dades definitives............................................................................................................................................ 76 2. Efecte-modificador i interacció causal............................................................................................................ 79 VIII. CODI R PROBLEMA 2: L’ACCIDENT DEL CHALLENGER ................................................................................ 89 0. DAGs teòric i fàctics, validació DAG final ...................................................................................................... 89 1. Estandardització amb la variable sortint collisio1_b fuita1_b ......................................................................... 98 2. Càlcul de les mesures causals .................................................................................................................... 108 IX. BIBLIOGRAFIA PROBLEMA 1: UN ESTUDI DE COHORT PROSPECTIU ..................................................... 114 Treballs acadèmics: TFG, TFM, Tesis, Seminaris ............................................................................................ 114
5 Llibres constitutius ............................................................................................................................................ 114 Llibres consultius ............................................................................................................................................... 114 Articles ................................................................................................................................................................ 115 X. BIBLIOGRAFIA PROBLEMA 2: L’ACCIDENT DEL CHALLENGER ................................................................. 116 Treballs acadèmics: TFG, TFM, Tesis, Seminaris ............................................................................................ 116 Llibres constitutius ............................................................................................................................................ 116 Llibres consultius ............................................................................................................................................... 116 Articles, Reports, Manuals/Guies, Seminaris ................................................................................................... 117
6 I. INTRODUCCIÓ 1. Estructura del TFG Aquest TFG sorgeix de la necessitat d’anar més enllà de l’associació, d’anar de l’associació a la causalitat, d’abordar-la amb l’ajut de la teoria de grafs, concretament de grafs acíclics dirigits i de fer-ho de manera aplicada a partir de dos exemples reals, dos estudis observacionals. Un TFG estructurat doncs a partir de la resolució d’aquests dos problemes observacionals, dels quals en sorgeixen diferents apartats i annexos. En detall, a més a més d’aquesta introducció que consta d’un apartat, hi ha un primer problema que sorgeix de la revisió d’un article científic i un segon problema en què directament hom treballa un cas real, l’accident del Challenger; el primer té 3 subapartats i un annex terminològic i el segon té un altre annex també teòric. En cadascun dels dos problemes hi ha una mateixa seqüència de tres fases: Hi ha una fase inicial de recollida de dades, sobretot de la informació que hi ha rere les dades i la natura de l’estudi (hi han dos blocs clars: assaig aleatori o estudi observacional). En aquesta fase inicial hom recull i agença les dades: si les dades d’un article científic no són accessibles, això afecta directament la reproductibilitat dels resultats (vegeu problema1); si les variables observades són reportades, hom pot construir-ne una base de dades (vegeu problema2) Hi ha una segona fase de bastiment i validació del graf acíclic dirigit o DAGs candidats respecte de les dades observades (DAG, en anglès, és una col·lecció de vèrtexs (o nodes) i arestes. Els nodes a un graf són connectats per arestes. Cada model d’estructura causal és associat a un model de gràfic causal o DAG, vegeu Annex2 per a més detalls). Si és un estudi crític d’un treball ja fet, hom pot fer-hi l’empelt d’un graf candidat (vegeu problema1); si és un estudi nou, hom basteix el DAG segons la informació que hi ha rere de les dades i pot procedir a la seva validació (vegeu problema2) I una tercera fase d’aplicació d’un mètode per tal de fer inferència causal (per exemple l’estandardització, introduïda en el punt 2.1 del mètode). Cal establir en quin grau els resultats són concloents, però sobretot si hom sols pot parlar en termes d’associació estadística o bé s’ateny a parlar en termes de causalitat. Depèn de diversos factors: no sols hi han les assumpcions teòriques de la inferència (estadística i/o causal), sinó l’evidència empírica que reporta la història que hi ha rere les dades 2. Objectius Fer inferència causal a partir de grafs acíclics dirigits en estudis observacionals
7 L’ajut dels grafs acíclics dirigits en la reproductibilitat dels estudis científics publicats En el marc d’aquest TFG, hom vol aplicar les eines de la inferència causal i les propietats del DAG en el primer problema per tal de determinar en quin grau hi ha evidència empírica si el tractament té o no efecte en la pervivència dels pacients; en el segon problema, per tal determinar si hi ha evidència empírica d’una única causa imputable a l’accident del transbordador Challenger o, altrament, n’hi ha més d’una. 3. Nota històrica: de la causació d’Aristòtil als grafs de camins de Sewall Wright La justificació d’aquesta introducció des d’un punt de vista sincrònic és clara: la ciència es basa en models, segons la qualitat d’aquests models hom entén no sols la realitat sinó que pot predir-la amb més o menys justesa; entendre com entenien la causalitat els clàssics permet d’entendre la causalitat d’avui dins d’un marc més holístic. El diàleg entre la ciència d’ahir i d’avui, entenc que és un cercle virtuós, sense el qual la ciència pot devenir sols una eina sense fonaments, una ciència dislocada, sense coneixement d’ella mateixa i, per tant, incompleta. De la noció de causació, el primer a parlar-ne va esser Aristòtil (350 aC), encara que diferenta, la seva noció de causalitat assenyala el punt de partença de la concepció moderna de causalitat. Fonamentalment, la idea d'Aristòtil de causes es refereix a les quatre maneres d'explicar els canvis per mitjà dels quals qualque cosa arriba a esser com és. Tècnicament, llavors, les causes són maneres en què hom conceptualitza els canvis que es produeixen a les coses naturals o en la natura totes juntes. Abans d'esmentar les quatre causes, convé mirar els principis o fonaments sobre els quals es construeix la seva idea de causes: el canvi és un element clau per a debatre sobre la noció de causes d'Aristòtil perquè la mateixa noció de causa es va originar per tal d’explicar el canvi. En conseqüència, el canvi (metàbol) en Aristòtil és el gènere de tres tipus particulars de canvi: generació, destrucció i moviment (kinèsia). La generació i la destrucció són canvis en virtut de la substància; en ells, una cosa o comença a existir o deixa d'existir. El moviment, per la seva banda, és de quatre tipus: alteració (qualitat), escreix o minva (quantitat), locomoció (lloc). El canvi segons la qualitat (o alteració) és el que es produeix en els casos següents: (i) una persona de pell bruna després d'anar a la platja; (ii) el sòl eixut que es mulla per la pluja; (iii) en el cas d'una espelma encesa on la cera es fon. El canvi segons la quantitat s'ocupa més del creixement o de la disminució d'objectes o elements: això passa sempre que s’observa que les coses afegeixen o perden en nombre o en un tret determinat. També s'observa sempre que un ésser humà adquireix o perd pes corporal. El canvi segons la locomoció, com el seu nom assenyala, connota moviment del punt A al punt B. El canvi també té una categoria més àmplia. Pot ser físic o natural, i pot ser artificial: el primer és allò que l’arkhé (el primer principi o l’acció originària que domina el canvi) del canvi és intern o dins de la cosa canviant. Els pensadors grecs previs han demostrat que aquest canvi és lligat a aquelles coses que tenen el principi del seu moviment dins.
8 El natural canvia com a desenvolupament fins al seu compliment o perfecció (telos, fi o finalitat); el canvi artificial, en canvi, és allò que l’arkhé del canvi és sense o fora de l’ens canviant, el qual és dirigit o guiat per techne (habilitat o art). Esquema_introducció1 (esquema propi que resumeix com Aristòtil basteix el seu corpus de conceptes de caràcter jeràrquic) Assereix que la causa es diu de moltes maneres; quatre maneres, per ser exactes, a saber: causes formals, finals, eficients i materials. Per tant, a Aristòtil, les causes són una de les quatre maneres a través de les quals hom explica les coses responent al seu perquè. És imprescindible que s’entengui quines són aquestes causes i per què citar-les és necessari i suficient per tal de respondre a la qüestió del "perquè" de les coses. Un tractament satisfactori d'aquesta qüestió s'apropa sens dubte a un tractament de tot el sistema filosòfic d'Aristòtil: les quatre causes són els elements constitutius del relat d'Aristòtil de l'existència, la substància, el canvi, la comprensió científica, l'ànima, els fenòmens biològics, el bé, l'estat, el el cel, Déu, el bell, la generació, la destrucció, etc. Així, les quatre causes abasten tota l'arquitectura de la filosofia d'Aristòtil. Les quatre causes d'Aristòtil són material (reporta de què és feta una cosa), formal (fa que una cosa sigui el que és), com a primera font del canvi o eficient (la causa que produeix o crea una cosa), de fi assolida o final (explica per què una cosa ha estat creada). En resum, les quatre causes d'Aristòtil són una teoria que malda per entendre la natura de les coses a partir de les seves causes materials, formals, eficients i finals. A més, la noció de causalitat –que l'ésser i l'activitat d'una cosa és responsable de l'ésser i l'activitat d'una altra– no es capta tan fàcilment des de l'experiència sensorial com són les nocions de quantitat i qualitat. Sinó que és més lligada a les nocions de forma i natura que l'intel·lecte engrana en un intent d'entendre el que s'experimenta. Hom experimenta canvis en el nostre entorn cada dia i hom cerca a tothora explicacions adients per a aquests canvis. Aristòtil, en la seva teoria de la causalitat, dedica el seu temps a oferir una explicació intel·ligible a les qüestions del "perquè" sobre els nombrosos canvis a la natura. Aristòtil defineix la causa com el procés d'esdevenir o finir (arribar a esser i deixar d’esser) de les coses naturals i altres menes de canvis. La idea de causa o causalitat no és sols un element proposicional. Una causa en el significat aristotèlic és quelcom real, una entitat, o millor encara un element ontològic. Per aquesta raó, Aristòtil, proposa quatre causes com a principi explicatiu de la multiplicitat de canvis en la natura. La declaració canònica d'aquestes causes es troba al Llibre II de l'obra d'Aristòtil sobre filosofia natural, la Física. Al Llibre I de Física, Aristòtil presenta la seva idea del principi [archai, com s’és vist a d'altres filòsofs grecs]
9 de les ciències naturals. Aproximadament, la qüestió dels principis és la de la natura i el nombre de conceptes o factors als quals hem de recórrer per explicar els fenòmens naturals. És en aquesta part de la seva obra on parla de la filosofia natural d'altres filòsofs grecs abans que no ell, com ara Parmènides, Empèdocles, Melissos de Samos i Demòcrit. És aquí que defensa la distinció entre matèria i forma, fent-ho a fi de presentar un relat del canvi que sigui impermeable als arguments de Parmènides que el canvi i la pluralitat són impossibles alhora (per a més detalls del primer i segon llibre de Física, vegeu apartat1_introducció). Hom salta fins al 1738 amb el principi de causa i efecte de David Hume, en què assereix que causa i efecte no són gaire més que una constant conjunció o associació d’esdeveniments. Encara no comença a distingir entre associació i causació, de fet, avui hom sap que l’associació entre una exposició i un resultat pot esser produïda per diferentes estructures causals (en termes de grafs acíclics dirigits, n’hi han tres de canòniques: la cadena, la forca i el col·lididor, vegeu Annex 2). James Lind és qui emprèn el primer assaig clínic com a mètode per tal de provar un lligam causal entre el fet de menjar taronges i llimones i el fet que els pacients es refacin de l’escorbut. Però no és fins al 1846 que Mill canonitza un mètode científic d’inducció per tal de provar la causalitat; a partir de 5 cànons (de concordança, de la diferència, de concordança i diferència conjunt, dels residus i el darrer de les variacions concomitants). Durant el segle XX hom comença a veure l’aplicació de gràfics de diferentes menes al món real que menen cap a nous conceptes dins de l’àmbit de la inferència: Jerzy Neyman, el primer estadístic a pensar en termes de resultats potencials (concepte clau d’una de les dues línies d’inferència causal segons Ruiz de Villa Robert), a partir de la divisió en parcelles d’un terreny a fi d’avaluar-ne el rendiment, s’adona que sols pot plantar una única varietat per parcel·la, la impossibilitat de plantar-ne diverses dins d’una mateixa parcel·la duu al Problema Fonamental de la Inferència Causal (hom en parla més endavant). Sewall Wright empra uns models gràfics a fi de codificar assumpcions causals en anàlisis regressives (els diagrames de camins com el primer antecedent dels actuals grafs acíclics dirigits). El graf mostra les causes directes V1 i V2 de l’efecte V0 ; com també les causes indirectes V4 ,V5 i V6 ; així com una variable deslligada causalment V3 . Esquema_introducció2 (cap. 1 a Fundamentals of Causal Inference Babette A.Brumback, vegeu bibliografia problema1 o 2)
16 com la Sra Macías Piguave tradueix el quadre de resultats de l’article de The Lancet a un seu quadre de 3 variables binàries). Imatge Problema1_2 (taula esquerra a la pàg. 1921 de l’article COVID-19 mortality in patients with cancer on hemotherapy or other anticancer treatments: A prospective cohort study. The Lancet, 395(10241), pàg. 1919– pàg. 1926, hom hi veu la taula de variables i els seus valors) Imatge Problema1_3 (taula dreta feta per la Sra. Macías Piguave al seu TFM, pàg. 15, hom hi veu els valors marginals) A més a més de no saber quantes de variables hi han en total, ni com s’estructuren, hi ha el problema que les dades de l’estudi no són públiques, avui hi han molts de mitjans per tal d’anonimitzar-les, així com software que genera dades sintètiques; per exemple, la funció syn permet la generació de dades sintètiques que imiten o clonen les reals tot permetent que es pugui posar a disposició del públic sense problemes de confidencialitat (vegeu Nowok B, Raab GM, Dibben C. synthpop: Bespoke creation of synthetic data in R. J Stat Softw 2016;74(11):1-26). Sense dades hom no pot reproduir els resultats i conclusions a què arriba aquest estudi observacional, els autors no reporten numèricament la relació entre el tractament i la comorbilitat, no reporten cap col·linealitat (interconnexió), sí que n’esmenten els resultats (com ara d’una regressió múltiple a la seva taula tercera i figura quarta de la pàg 1924). En resum, per a la reproductibilitat de l’estudi calen la base de dades (sintètica) i un DAG. En aquest estudi, en un primer terme, hom malda per salvar l’escull de la reproductibilitat a partir del requadre de marginals reportat al TFM per la Sra Macías Piguave a fi d’obtenir una taula aproximada no sols dels valors marginals sinó també amb les seves interaccions de les tres variables binàries ja esmentades. Així, hom pot trobar la interacció entre tractament de càncer i comorbilitat; segons un model lineal, amb: 𝑌𝑌=𝛼𝛼0+𝛼𝛼1𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡+𝛼𝛼2𝑡𝑡𝑐𝑐𝑐𝑐+𝛼𝛼3𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡∗𝑡𝑡𝑐𝑐𝑐𝑐 (on <Y> és la variable resposta binària, <tract> és la variable binària tractament, <com> és la variable binària comorbilitat i <tract*com> és la interacció entre les variables binàries tractament i comorbilitat; i les 𝛼𝛼𝑖𝑖 són els coeficients d’aquest model regressiu. I en un segon terme, havent obtingut una taula aproximada, fer inferència causal a partir d’un DAG senzill de tres nodes reportat per l’autora del TFM a tall d’il·lustració.
17 Y=0 Com=1 Com=0 Total fila Tract=1 134-α α 134 Tract=0 65+α 27-α 92 Total columna 199 27 226 Y=1 Com=1 Com=0 Total fila Tract=1 394-β β 394 Tract=0 38+β 142-β 180 Total columna 432 142 574 Com=1 Y=1 Y=0 Total fila Tract=1 394-106=288 134-17=117 402 Tract=0 38+106=144 65+17=82 229 Totalcolumna 432 199 631 Com=0 Y=1 Y=0 Total fila Tract=1 106 17 126 Tract=0 142-106=36 27-17=10 43 Total columna 142 27 169 Imatge Problema1_4 (taula damunt pròpia que reporta el valor marginal de cada variable de la taula feta per la Sra Macías Piguave, vegeu Imatge Problema1_3) Imatge Problema1_5 (taula dessota pròpia, vegeu l’apartat1_problema1 a fi de veure’n com és obtinguda, és el punt d’arribada, havent trobat una alpha i beta que siguin compatibles amb les dades originals amagades) En els tres punts següents, hom veu que (1) l'associació condicional estimada entre tractament i pervivència es troba al límit de l’evidència empírica (cosa que no contradiu els resultats publicats a The Lancet: no hi ha efecte de tractament en la pervivència); (2) la comorbilitat no sembla que modifiqui gens l’efecte del tractament en la resposta (el tractament podria no interactuar amb la comorbilitat); i (3) no semblaria (tot acceptant unes determinades assumpcions) que hi hagin pacients per a qui Comorbilitat i Tractament sinergitzin a fi d’acréixer la possibilitat de perviure. 1. Associació (causal) entre tractament i mortalitat Així, amb els resultats dels tests a la imatge Problema1_11 (vegeu apartat1_problema1), hom pot dir que no hi ha gens d’associació entre tractament i mortalitat, però a partir del graf del TFM de la Sra. Macías Piguave, pàgina 16 del seu TFM, hom es pot demanar si tampoc no n’hi ha, d’associació (causal), entre tractament i mortalitat o si hi ha cap lligam (causal) entre comorbilitat i tractament: Imatge Problema1_12 (DAG del TFM de Sra. Macías Piguave) Per tal d’estudiar-ne la inferència causal, cal introduir el concepte de resultat potencial (és aquell que hom pot observar si l'esdeveniment causal passa abans, altrament hom no el pot observar; vegeu punt 16 annex1): Y(T=1) i Y(T=0) es defineixen com les variables de resultat que hom observaria sota els tractaments T=1 i T=0 (tot simplificant hom les formalitza Y(T=1) com a Y(1) i Y(T=0) com a Y(0), conegudes com a resultats potencials). L’efecte-modificador o la interacció causal impliquen intrínsecament resultats potencials: hom empra l'efecte causal poblacional del tractament si
18 P(Y(1)=1)≠P(Y(0)=1). Així, el resultat potencial és denotat com a Y(0) i Y(1) i el resultat observat és denotat senzillament com a Y. Aleshores si hom vol comparar el risc de mortalitat amb el tractament de càncer versus el risc de mortalitat sense tractament de càncer; això és, en termes de resultats potencials fóra comparar el resultat potencial Y(1) amb tractament T=1 amb el resultat potencial de Y(0) sense tractament T=0. Tanmateix, fer un contrast entre els resultats potencials Y(1) i Y(0) amb el resultat observat Y implica que hom accepti l’assumpció de consistència, el nexe entre el resultat potencial Y(t) i el resultat observat Y, i que accepti la resolució estadística del Problema Fonamental de la Inferència Causal (per a més detalls vegeu vegeu l’apartat2_problema1) Adoptant la solució estadística2 al Problema Fonamental de la Inferència Causal, la independència condicionada, (vegeu esquema_18 del punt 18 i punt 19 Annex1), ara hom contrasta les mitjanes condicionades (no pas individu a individu, sinó esperança versus esperança): 𝐸𝐸(𝑌𝑌(1)|𝐻𝐻) 𝑣𝑣𝑣𝑣𝑡𝑡𝑠𝑠𝑣𝑣𝑠𝑠 𝐸𝐸(𝑌𝑌(0)|𝐻𝐻). Així hom es demana si l’efecte del tractament és més fort dins de l’estrat amb comorbilitats que no pas sense comorbilitats; d’aquí que calgui primer triar la comorbilitat com a efecte-modificador i després comparar l’efecte del tractament al llarg dels dos estrata de comorbilitat. A partir de la taula final de la Imatge Problema1_5, hom calcula 𝐸𝐸(𝑌𝑌(0)|𝐶𝐶= 0) 𝑡𝑡𝑐𝑐𝑎𝑎 𝐸𝐸�(𝑌𝑌(0)|𝐶𝐶= 0) i hom 𝑣𝑣𝑠𝑠𝑡𝑡𝑒𝑒𝑐𝑐𝑡𝑡 𝐸𝐸(𝑌𝑌(1)|𝐶𝐶= 0) 𝑡𝑡𝑐𝑐𝑎𝑎 𝐸𝐸�(𝑌𝑌(0)|𝐶𝐶= 1): �𝐸𝐸�(𝑌𝑌(0)|𝐶𝐶= 0)=𝐸𝐸�(𝑌𝑌|𝐶𝐶= 0, 𝑇𝑇𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡= 0)=36 36 +10 =36 46 = 0.783 𝐸𝐸�(𝑌𝑌(1)|𝐶𝐶= 0)=𝐸𝐸�(𝑌𝑌|𝐶𝐶= 0, 𝑇𝑇𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡= 1)=106 106 +17 =106 123 = 0.862 Així, per al grup basal amb comorbilitat zero (C=0), amb tractament hi ha un lleuger acreix de la mitjana de supervivència (del 78.3% al 86.2%) 𝐸𝐸(𝑌𝑌(0)|𝐶𝐶= 1) 𝑡𝑡𝑐𝑐𝑎𝑎 𝐸𝐸�(𝑌𝑌(0)|𝐶𝐶= 1) i hom 𝑣𝑣𝑠𝑠𝑡𝑡𝑒𝑒𝑐𝑐𝑡𝑡 𝐸𝐸(𝑌𝑌(1)|𝐶𝐶= 1) 𝑡𝑡𝑐𝑐𝑎𝑎 𝐸𝐸�(𝑌𝑌(1)|𝐶𝐶= 1), �𝐸𝐸�(𝑌𝑌(0)|𝐶𝐶= 1)=𝐸𝐸�(𝑌𝑌|𝐶𝐶= 1, 𝑇𝑇𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡= 0)=144 144 +82 =144 226 = 0.637 𝐸𝐸�(𝑌𝑌(1)|𝐶𝐶= 1)=𝐸𝐸�(𝑌𝑌|𝐶𝐶= 1, 𝑇𝑇𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡= 1)=288 288 +117 =288 405 = 0.711 Així, per al grup basal amb comorbilitat u (C=1), amb tractament hi ha un lleuger acreix de la mitjana de supervivència (del 63.7% al 71.1%). 2 Hom suposa que el tractament és aleatoritzat de forma independenta de qualssevol dades existents; com a resultat hom obté una mitjana independenta I amb aquesta mitjana hom fa inferència (tot i així cal tenir en compte que la diferència de resultats amb o sense el tractament pot encara haver estat causat per atzar; pot esdevenir-se que la populació d’estudi no sigui rellevant mai més; extrapolar un resultat mitjà a un individu concret pot esser problemàtic)
19 La diferència a dins de cada estratum de comorbilitat, amb i sense tractament, és aproximadament la mateixa (0.079, 0.074), si aquetes diferències són al llindar de l’evidència empírica, fóra coherent amb els resultats que van treure els autors de l’estudi observacional a The Lancet. En canvi, la diferència a dins de cada estratum de tractament, amb o sense comorbilitat, també és aproximadament la mateixa (0.146, 0.151) però en termes de magnitud (0.146, 0.151) és molt més gran que no (0.079, 0.074), és a dir, tenir o no tenir-ne, de comorbilitats, té força impacte; en canvi, tenir o no tenir-ne, de tractament, no en té gaire. �𝐸𝐸�(𝑌𝑌(0)|𝐶𝐶= 0)=𝐸𝐸�(𝑌𝑌|𝐶𝐶= 0, 𝑇𝑇𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡= 0)= 36 36 +10 = 36 46 = 0.783 𝐸𝐸�(𝑌𝑌(0)|𝐶𝐶= 1)=𝐸𝐸�(𝑌𝑌|𝐶𝐶= 1, 𝑇𝑇𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡= 0)=144 144 +82 =144 226 = 0.637 �𝐸𝐸�(𝑌𝑌(1)|𝐶𝐶= 0)=𝐸𝐸�(𝑌𝑌|𝐶𝐶= 0, 𝑇𝑇𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡= 1)= 106 106 +17 = 106 123 = 0.862 𝐸𝐸�(𝑌𝑌(1)|𝐶𝐶= 1)=𝐸𝐸�(𝑌𝑌|𝐶𝐶= 1, 𝑇𝑇𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡= 1)=288 288 +117 =288 405 = 0.711 Havent estimat E(Y(0)) i E(Y(1)), hi han diverses mesures de l’efecte (vegeu els punts 21 i 22 de l’Annex1) a fi de contrastar-les; per a una Y binària, E(Y(0))=p0 i E(Y(1))=p1 són probabilitats, de fet aquí havent estimat p0=E(Y|T=0,M=1), p1=E(Y|T=1,M=1), p2=E(Y|T=0,M=0) i p3=E(Y|T=1,M=0), a voltes hom s’hi refereix com a riscs. És més intuïtiu treballar en termes de riscs que no pas d’odds. Per a una Y binària, les més emprades 3mesures d’efecte són Risc de la Diferència, Risc Relatiu, Risc Relatiu secundari i Odds Ràtio, les quals sempre coincideixen qualitativament en termes de la direcció del canvi en risc si hi ha causalitat; també són emprades com a mesures d’associació entre dues variables binàries. Si a un Assaig Clínic Aleatoritzat (ACA) l’assumpció (Y(0),Y(1))∐T es compleix, llavors les mesures d’associació i les mesures d’efecte causal són iguales. Però a dins d’un estudi observacional cal distingir entre les mesures d’associació i les mesures causals, hom hi afegeix l’adjectiu causal quan s’hi escau. Essent un estudi observacional, per força sols es pot ajustar per confonedors, és a dir, hom no pot assumir (Y(0),Y(1))∐Tract, però sí (Y(0),Y(1))∐Tract|C, on C és l’aplec de confonedors (aquí sols n’hi ha un, la comorbilitat); hom assumeix que la recepció del tractament segueix un assaig aleatori estratificat (vegeu punt 19 Annex1). Hom estima doncs les mesures d’efecte condicional sota l’assumpció (Y(0),Y(1))∐Tract|C (amb C=Comorbilitat); per tant, s’estima l’efecte condicional per a pacients amb o sense 3 ⎩ ⎪ ⎪ ⎨ ⎪ ⎪ ⎧ 𝑅𝑅𝑒𝑒𝑠𝑠𝑡𝑡 𝑑𝑑𝑣𝑣 𝑙𝑙𝑡𝑡 𝐷𝐷𝑒𝑒𝐷𝐷𝑣𝑣𝑡𝑡è𝑛𝑛𝑡𝑡𝑒𝑒𝑡𝑡 𝑅𝑅𝐷𝐷 (𝑡𝑡𝑡𝑡𝑣𝑣𝑠𝑠𝑡𝑡𝑙𝑙) = 𝑝𝑝1−𝑝𝑝0=p1 = E(Y|T = 1, M = 0) −E(Y|T = 0, M = 0) 𝑅𝑅𝑒𝑒𝑠𝑠𝑡𝑡 𝑅𝑅𝑣𝑣𝑙𝑙𝑡𝑡𝑡𝑡𝑒𝑒𝑣𝑣 𝑅𝑅𝑅𝑅 (𝑡𝑡𝑡𝑡𝑣𝑣𝑠𝑠𝑡𝑡𝑙𝑙)=𝑝𝑝1 𝑝𝑝0=E�Y�T = 1, M = 0� E�Y�T = 0, M = 0� 𝑅𝑅𝑒𝑒𝑠𝑠𝑡𝑡 𝑅𝑅𝑣𝑣𝑙𝑙𝑡𝑡𝑡𝑡𝑒𝑒𝑣𝑣 𝑆𝑆𝑣𝑣𝑡𝑡𝑣𝑣𝑛𝑛𝑑𝑑𝑡𝑡𝑡𝑡𝑒𝑒 𝑅𝑅𝑅𝑅∗(𝑡𝑡𝑡𝑡𝑣𝑣𝑠𝑠𝑡𝑡𝑙𝑙) = 1−𝑝𝑝0 1−𝑝𝑝1=1−E(Y|T=1,M=0) 1−E�Y�T = 0, M = 0� 𝑂𝑂𝑑𝑑𝑑𝑑𝑠𝑠 𝑅𝑅à𝑡𝑡𝑒𝑒𝑐𝑐 𝑂𝑂𝑅𝑅 (𝑡𝑡𝑡𝑡𝑣𝑣𝑠𝑠𝑡𝑡𝑙𝑙) = �𝑝𝑝1 1−𝑝𝑝1� �𝑝𝑝0 1−𝑝𝑝0�=E(Y|T=1,M=0) 1−E(Y|T=1,M=0) E�Y�T = 0, M = 0� 1−E�Y�T = 0, M = 0�
20 comorbilitats. En esser un resposta Y binària (mort o pervivència), hom tria ajustar per un model paramètric logístic, on tots els coeficients tenen base empírica: Estimate Std. Error z value Pr(>|z|) (Intercept) 1.4026 0.2380 5.893 3.78e-09 *** T 0.3663 0.1643 2.230 0.025735 * M -0.8570 0.2275 -3.767 0.000165 *** Tot seguit, hom empra el bootstrap per tal d’estimar les distribucions de mostratge per a p0=E(Y|T=0,M=1) i p1=E(Y|T=1,M=1) i les quatre mesures d'efecte (hom no agafa p2=E(Y|T=0,M=0) i p3=E(Y|T=1,M=0) i les seves quatre mesures d’efecte perquè el model perdria M que té base empírica) DESSOTA ESTIMACIÓ DAMUNT p1ci 0.6712456 p1hat 0.7133804 p1ci 0.7555153 p0ci 0.5720012 p0hat 0.6331015 p0ci 0.6942017 rdci 0.006801067 rdhat 0.08027896 rdci 0.153756855 rrci 1.007356 rrhat 1.126803 rrci 1.260412 rrstarci 1.025199 rrstarhat 1.280089 rrstarci 1.598351 orci 1.034142 orhat 1.442408 orci 2.011851 Imatge Problema1_13(subtaula i figura pròpies; els IC són calculats a partir dels resultats d’aplicat la funció boot(), és a dir: valor estimat ± 1.96 * SE del valor estimat) Així, amb unes estimacions de 0.713 i 0.631, els pacients amb comorbilitats sembla que tinguin més probabilitat de perviure si hi ha tractament; si hom assumeix Y(0),Y(1)) ∐ Tract|C (els resultats potencials Y(0) i Y(1) són condicionalment independents del tractament donada la comorbilitat, ∐ vol dir ‘condicionalment independent’), llavors el tractament és causa de més pervivència en aquest estràtum. Però les quatre mesures d’efecte o d’associació (que exclouen l’associació nul·la si és inclòs el 0 a dins de l’IC de RD i si és inclòs l’1 dins els IC de les tres restantes, és a dir, quan l’IC inclou el 0 en la diferència de risc o l’1 en la resta de mesures implica que la non-relació és un valor compatible amb aquestes dades tot havent acceptat com a raonables totes les assumpcions) reflecteixen uns intervals de confiança que exclouen lleugerament l'associació nul·la. Així, l'associació condicional estimada entre tractament i pervivència es troba al límit de l’evidència empírica, fet que no contradiu gaire les conclusions dels autors de The Lancet (sense associació entre tractament i variable resposta) . Per tal d’interpretar aquestes estimacions causalment, cal assumir: l’assumpció de (Y(0),Y(1))∐Tract|C), la qual requereix l’assumpció de consistència, de positivitat i aleatorització estratificada la correctesa d’aquest model logístic paramètric i que els resultats tenen base empírica
21 la suficiència d’aquest aplec de confonedors (dins del graf simplificat, Imatge Problema1_12, sols n’hi ha un, la comorbilitat) Vegeu punt 18 Annex1 Per a un Estudi Observacional cal ajustar obligatòriament per una o més de variables confonedores i assumir que la recepció del tractament segueix un assaig aleatoritzat estratificat i que (Y(0),Y(1))∐A|H �𝑙𝑙′𝑡𝑡𝑙𝑙𝑣𝑣𝑡𝑡𝑡𝑡𝑐𝑐𝑡𝑡𝑒𝑒𝑡𝑡𝑎𝑎𝑡𝑡𝑡𝑡𝑒𝑒ó 𝑣𝑣𝑠𝑠𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑒𝑒𝐷𝐷𝑒𝑒𝑡𝑡𝑡𝑡𝑑𝑑𝑡𝑡 𝑙𝑙′𝑡𝑡𝑠𝑠𝑠𝑠𝑣𝑣𝑐𝑐𝑝𝑝𝑡𝑡𝑒𝑒ó 𝑑𝑑𝑣𝑣 𝑡𝑡𝑐𝑐𝑛𝑛𝑠𝑠𝑒𝑒𝑠𝑠𝑡𝑡è𝑛𝑛𝑡𝑡𝑒𝑒𝑡𝑡 𝑙𝑙𝑡𝑡 𝑝𝑝𝑐𝑐𝑠𝑠𝑒𝑒𝑡𝑡𝑒𝑒𝑣𝑣𝑒𝑒𝑡𝑡𝑡𝑡𝑡𝑡 𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊 � � � � � (𝒀𝒀(𝟎𝟎),𝒀𝒀(𝟏𝟏))∐𝑨𝑨|𝑯𝑯𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊 � � � � � 𝑬𝑬(𝒀𝒀(𝟎𝟎)|𝑯𝑯)= 𝑬𝑬(𝒀𝒀|𝑯𝑯,𝑨𝑨=𝟎𝟎) 𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊𝒊 � � � � � 4�𝐡𝐡𝐡𝐡𝐡𝐡𝒆𝒆𝒆𝒆𝒆𝒆𝒊𝒊𝒊𝒊𝒊𝒊 𝑬𝑬(𝒀𝒀(𝟎𝟎)|𝑯𝑯) 𝒊𝒊𝒊𝒊𝒂𝒂 𝑬𝑬�(𝒀𝒀|𝑯𝑯,𝑨𝑨=𝟎𝟎) 𝐡𝐡𝐡𝐡𝐡𝐡𝒆𝒆𝒆𝒆𝒆𝒆𝒊𝒊𝒊𝒊𝒊𝒊 𝑬𝑬(𝒀𝒀(𝟏𝟏)|𝑯𝑯) 𝒊𝒊𝒊𝒊𝒂𝒂 𝑬𝑬�(𝒀𝒀|𝑯𝑯,𝑨𝑨=𝟏𝟏) Esquema_18.2 (taula pròpia) 2.Interacció estadística i l’efecte-modificador segons cada mesura (RD,RR,RR*,OR): determinar si la comorbilitat modifica l’efecte del tractament en la resposta. Amb interacció al model logístic per mitjà de la funció glm(), cap dels coeficients té base empírica (llevat potser de comorbilitat, vegeu codi R Problema 1_ A prospective cohort study) i, per tant, no fóra un model vàlid. Hom anomena la comorbilitat com a efecte-modificador perquè la mesura de l’efecte del tractament pot diferir de M=0 a M=1 (vegeu punt 23 Annex1); és natural que hom es demani si l’efecte del tractament és més fort dins d’un estràtum que no pas dins d’un altre i fer-ne la comparança segons les quatre mesures d’efecte abans esmentades. Encara que les 4 mesures d’efecte sempre concorden qualitativament dins d’un únic estràtum (per exemple, RD>0, RR>1, RR*>1 i OR>1) si hi ha causalitat, no totes ho són en el mateix grau. Una altra possibilitat és que mentre una mesura de l’efecte del tractament no sembla tenir base empírica entre estrata, una altra assenyala una diferència. La taula que segueix calculada mitjançant les funcions bootinside.r i boot.r (vegeu codi R Problema 1_ A prospective cohort study), mesura la modificació per una diferència (per a E(Y (1)), E (Y (0)) i RD �) o per una proporció o ràtio (per a 𝑅𝑅𝑅𝑅 �,𝑅𝑅𝑅𝑅∗ � 𝑒𝑒 OR �). Hom veu que l’efecte del tractament és força semblant als dos estrata de comorbilitat: la diferència de diferències de risc és gairebé zero i el seu IC inclou el zero (l’efecte del tractament ni acreix ni decreix la pervivència dels pacients per a tots dos estrata), les diferències de les tres mesures restants mostren una tendència semblanta en termes qualitatius (les diferències de totes tres mesures de ràtio són pels volts d’u i inclouen l’u dins dels seus IC). L’efecte del tractament no sembla esser empíricament més fort o feble amb comorbilitat o sense comorbilitat si hom pren com a referència els IC de les diferències de les mesures. 4 Així, hom contrasta més aviat la mitjana de resultats d’E(Y(1)|H) i E(Y(0)|H)
22 term .lower .estimate .upper .alpha .method EYT0.M0 0.64330929 0.77258477 0.880500000 0.05 percentile EYT0.M1 0.56103815 0.63454614 0.699292541 0.05 percentile EYT0.diff -0.25233652 -0.13803863 -0.001704374 0.05 percentile EYT1.M0 0.79822404 0.86164849 0.929997878 0.05 percentile EYT1.M1 0.67090141 0.71348970 0.756939253 0.05 percentile EYT1.diff -0.21241632 -0.14815879 -0.075601316 0.05 percentile RD.M0 -0.03568910 0.08906371 0.208053852 0.05 percentile RD.M1 0.00263821 0.07894356 0.154892385 0.05 percentile RD.diff -0.17076648 -0.01012016 0.114005684 0.05 percentile RR.M0 0.95893387 1.11769844 1.304063081 0.05 percentile RR.M1 1.00372442 1.12569174 1.260401993 0.05 percentile RR.diff 0.80108311 1.00715157 1.181304043 0.05 percentile RR*.M0 0.78735905 1.63716384 3.247242974 0.05 percentile RR*.M1 1.00913302 1.27319670 1.636796432 0.05 percentile RR*.diff 0.36206642 0.77768435 1.597117434 0.05 percentile OR.M0 0.74883327 1.82985547 4.200154454 0.05 percentile OR.M1 1.01289145 1.43322701 2.092122084 0.05 percentile OR.diff 0.29851584 0.78324602 1.927683056 0.05 percentile Imatge Problema1_14 (subtaula i figura pròpia; els IC són calculats a partir dels resultats d’aplicar la funció boot(), és a dir: valor estimat ± 1.96 * SE del valor estimat; vegeu codi R Problema 1_ A prospective cohort study) El tractament podria no interactuar amb la comorbilitat. La interpretació en clau causal d’aquests resultats requereix de l’assumpció d’esser davant d’un assaig aleatori estratificat (Y(0),Y(1))∐Tract|C; això és, que els resultats potencials són independents del tractament condicionat a la comorbilitat. Aquesta assumpció fóra violada, per exemple, si entre els pacients amb comorbilitats hi hagués un subgrup que fossin
23 malalts terminals. Però havent vist que les quatre mesures podrien no anar en la mateixa direcció en termes qualitatius, aquesta assumpció no em sembla del tot fonamentada: sembla que l’efecte del tratament actua al marge dels estrata. Potser caldria trobar d’altres possibles confonedors com ara el sexe o l’edat (vegeu figura1 DAG del TFM de la Sra Macías pàg. 15) que siguin també efecte-modificadors. Imatge Problema1_15(vegeu figura1 DAG del TFM de la Sra Macías pàg. 15) L’efecte-modificador és molt lligat a la interacció estadística. Per al model logístic, 𝑙𝑙𝑐𝑐𝑙𝑙𝑒𝑒𝑡𝑡�𝐸𝐸(𝑌𝑌|𝑇𝑇,𝑀𝑀)�=𝛽𝛽0+𝛽𝛽1𝑇𝑇+𝛽𝛽2𝐶𝐶+𝛽𝛽3𝑇𝑇∗𝐶𝐶, on 𝛽𝛽3 és el log del ràtio dels odds ràtios. Hom computa 𝛽𝛽3 fent servir la funció gee() o glm() d’R i veu si l’efecte-modificador té base empírica, 𝛽𝛽3 és estimat com a coeficient de T*C (vegeu codi R Problema 1_ A prospective cohort study): amb 𝛽𝛽3=exp(-0.2116)=0.809 i no sembla tenir base empírica; l’efecte del tractament no té gens d’efecte per als pacients amb comorbilitat a jutgar pels valors estimats i l’error estàndard del coeficient de T al model; tampoc per als qui no en tenen, de comorbilitat. Una altra manera de presentar la mateixa informació per tal de veure com dues de les quatre mesures entre estrata es comporten diferentament és a partir d’una taula final aproximada (Imatge Problema1_16 taula a l’esquerra) a la taula prèvia (Imatge Problema1_14) i presentar-ne el contingut gràficament (Imatge Problema1_16 gràfic a la dreta): RR i RD són del tot horitzontals i RR* i OR tenen un pendent raonable. Segons la mesura que hom prengui, l’efecte-modificador té una significança diferenta. Per tant, atès que l’efecte del tractament divergeix en dos grups entre els nivells d’un efecte-modificador, no és gaire concloent si hi ha interacció estadística o si no n’hi ha. És a dir: mentre a RR* i OR l’efecte del tractament sembla més fort a l’estràtum sense comorbilitat, RD i RR suggereixen un efecte semblant a tots dos estrata. Si una interpretació causal fos possible, hom observaria que totes quatre mesures suggereixen que sense comorbilitat l’efecte del tractament és més fort que no pas amb comorbiliat (per a més detalls sobre les quatre mesures de l’efecte vegeu apartat3_problema1).
24 Imatge Problema1_16 (taula a l’esquerra i gràfic a la dreta vegeu codi R Problema 1_ A prospective cohort study) 3.Interacció causal: interacció estadística versus interacció causal I d’interacció causal, n’hi ha? Cal aclarir primer que el concepte d’interacció estadística concerneix si un efecte causal difereix entre els estrata d’un efecte-modificador; en canvi, amb la interacció causal hom se centra en dues causes, si hi ha o no o bé sinergia o bé antagonisme en produir els seus efectes. Amb dues causes, cada individu té 4 resultats potencials denotats com Y(t1, t2), per a t1=0,1 i t2=0,1 (cadascun dels 2 tractaments binaris). Per a una Y binària, cada individu pertany a un dels setze tipus causals (vegeu taula de la Imatge Problema1_18): el tipus 2 és sinergístic perquè si tots dos són 1, t1=1 i t2=1, causen Y=1 però de forma isolada cada ti és insuficient per a establir Y=1. Els tipus 1,2,4,6,8 i 16 són monotònics perquè canviant t1 de 0 a 1 i t2 de 0 a 1 no pot pas decréixer Y(t1 , t2) Tipus causals Y(0,0) Y(0,1) Y(1,0) Y(1,1) 1 0 0 0 0 2 0 0 0 1 3 0 0 1 0 4 0 0 1 1 5 0 1 0 0 6 0 1 0 1 7 0 1 1 0 8 0 1 1 1 9 1 0 0 0 10 1 0 0 1 11 1 0 1 0 12 1 0 1 1 13 1 1 0 0 14 1 1 0 1 15 1 1 1 0 16 1 1 1 1 Imatge Problema1_18 (taula del llibre Brumback, Babette A., 2022, Fundamentals of Causal Inference: With R) Imatge Problema1_20 (diagrama de Venn representant probabilitats del llibre Brumback, Babette A., 2022, Fundamentals of Causal Inference: With R) T1 i T2 denoten els indicadors per a les dues causes i sigui Y qui denota el resultat. Si hom assumeix que {𝑌𝑌(0,0);𝑌𝑌(0,1);𝑌𝑌(1,0);𝑌𝑌(1,1);}∐𝑇𝑇1,𝑇𝑇2 (cosa que és força probable si les dues Ti tenen un comportament aleatori, propi d’un assaig aleatori; així, la independència entre resultats potencials i variables no és compromesa) i s’assumeix
25 també la monotonicitat, llavors hom estima 𝐸𝐸(𝑌𝑌(𝑇𝑇1,𝑇𝑇2)) amb l’estimació de 𝐸𝐸�(𝑌𝑌(𝑇𝑇1= 𝑡𝑡1,𝑇𝑇2=𝑡𝑡2)). En aquest estudi en esser observacional, cal emprar l’assumpció {𝑌𝑌(0,0);𝑌𝑌(0,1);𝑌𝑌(1,0);𝑌𝑌(1,1);}∐𝑇𝑇1,𝑇𝑇2|𝑀𝑀, cosa que obliga a modificar la condició suficient per a sinergia, tal com proposo per a cada estràtum (Imatge Problema1_19). Tipus causals Y(0,0,m=0) Y(0,1,m=0) Y(1,0,m=0) Y(1,1,m=0) Y(0,0,m=1) Y(0,1,m=1) Y(1,0,m=1) Y(1,1,m=1) 2 0 0 0 1 0 0 0 1 Imatge Problema1_19 (taula pròpia) Difícilment les dues Ti d’aquest estudi observacional tindran un comportament aleatori, però si hom omet aquest obstacle i sols a tall d’il·lustració o aproximació esbiaixada hom empra la taula de la Imatge Problema1_21 a fi d’estimar la fita dessota de 5𝑃𝑃(𝐴𝐴∩𝐵𝐵�∩𝐶𝐶)≥𝑃𝑃(𝐴𝐴)−𝑃𝑃(𝐵𝐵)−𝑃𝑃(𝐶𝐶)+𝑃𝑃(𝐷𝐷),𝑐𝑐𝑛𝑛 D és un subconjunt de (A ∩B∩C) (vegeu Imatge Problema1_20), que és de -0.269; atès que la proporció de pacients del tipus causal2 no és pas més gran que zero, hom estima que no n’existeixen a la població, d’aquests pacients. Atesa la grandària mostral, aquesta estimació fóra probable que tingués prou base empírica igual a zero, hom podria estar-ne prou segur. Co Tr Y n 0 1 0 17 0 1 1 106 0 0 0 10 0 0 1 36 1 1 0 117 1 1 1 288 1 0 0 82 1 0 1 144 ⇒ Co=T1 6(1-Tr)=T2 Y n 0 0 0 17 0 0 1 106 0 1 0 10 0 1 1 36 1 0 0 117 1 0 1 288 1 1 0 82 1 1 1 144 ⇒ Co=T1 T2 E(Y|T1,T2) n 0 0 𝐸𝐸(𝑌𝑌= 1|𝑇𝑇1= 0, 𝑇𝑇2= 0)= 106 106 +17 = 0.862 123 0 1 𝐸𝐸(𝑌𝑌= 1|𝑇𝑇1= 0, 𝑇𝑇2= 1)= 36 36 +10 = 0.783 46 1 0 𝐸𝐸(𝑌𝑌= 1|𝑇𝑇1= 1, 𝑇𝑇2= 0)= 288 288 +117 = 0.711 405 1 1 𝐸𝐸(𝑌𝑌= 1|𝑇𝑇1= 1, 𝑇𝑇2= 1)= 82 82 +144 = 0.663 226 Imatge Problema1_21 (subtaules adaptades a aquest problema del llibre Brumback, Babette A., 2022, Fundamentals of Causal Inference: With R) Així, en termes de causalitat, hom es demana si les dades tenen evidència empírica de l’existència del tipus causal2 a la populació, és a dir, si hi ha persones per a qui Comorbilitat i Tractament sinergitzen a fi d’acréixer la possibilitat de perviure. Amb aquest resultat 0.363 −0.711 −0.783 + 0.862 =−0.269, les dades suggeririen que no hi ha aital sinergia entre les dues variables Tractament i Comorbilitat. 5 Sigui l'esdeveniment A que Y (1,1)=1, l'esdeveniment B sigui Y(0,1)=1, l'esdeveniment C sigui Y(1,0)=1 i l'esdeveniment D sigui Y=(0,0)=1 (vegeu Imatge Problema1_20). Per a un esdeveniment F, denota F el seu oposat. 6 (1-Tractament) perquè així hom assumeix la monotonicitat
32 Amb constricció & Beta(1,1) Sense constricció & Beta(1,1) Suma de tots=1 Suma de tots=1 Imatge Problema1_16(vegeu codi R Problema 1_ A prospective cohort study; material complementari del llibre Brumback, Babette A., 2022, Fundamentals of Causal Inference: With R) Amb constricció & Beta(α,β) Sense constricció & Beta(α,β) 0.5785627, 0.8730862 0.7924, 0.9306 Imatge Problema1_17(vegeu codi R Problema 1_ A prospective cohort study; material complementari del llibre Brumback, Babette A., 2022, Fundamentals of Causal Inference: With R)
33 IV. PROBLEMA 2: L’ACCIDENT DEL CHALLENGER El problema de segellatge de les juntures dels coets de propulsió 1. Context Els coets de propulsió de reforç emprats per tal d’enlairar les llançadores consten de segments que s'apilen els uns damunt dels altres. A fi d’entendre el problema que crea aquest disseny, hom pot imaginar uns gots de paper, el fons estret dels quals, llevat del darrer, és tallat perquè encaixin entre si en una pila ordenada, llevat del darrer. Però si hom hi aboca un líquid en aquest got allargassat, el líquid surt per les articulacions. Per tal d’evitar fuites, hom segella tot fent un sagnats o canals en cercle per a ficar-hi unes anelles flexibles, però en abocar-hi un líquid encara hi ha una pressió a les articulacions, a causa de la qual pot haver-hi fuites (vegeu Figura2_1). De manera semblanta, cada segment del coet propulsius’asseu al segment dessota i la juntura segellada amb dues anelles flexibles de viton (un material semblant al cautxú). La juntura més en contacte amb el combustible se’n diu primària i la que fa de suport hom l’anomena secundària. A més a més, hom fica màstic a dins de les articulacions per tal d’oferir-los més de protecció. els coets propulsius de reforç creen una alta pressió (1004 psi) i les juntures han de segellar i evitar que els gasos calents del combustible bufin a través de les juntes i comprometin la integritat d'un segment de reforç, posant en perill el vol. Al llançament del Colúmbia STS-51C, el 24 de gener de 1985, la junta principal de dues de les articulacions de la llançadora va resultar compromesa i erosionada pel combustible que s’hi escolava; sols la secundària va romandre operativa, evitant així l’accident. Aquest vol va esser precedit de l’anomenat "fred de 100 anys", un temps esperat a Florida sols una volta cada 100 anys, i encara que la temperatura ambient en el llançament era de 18°C, Roger Boisjoly, enginyer de Morton Thiokol, empresa dissenyadora i constructora dels coets de propulsió o propulsors, sospitava que el fred podia afectar la resilència dels anells de Viton (d’ara endavant anomenats també O-ring en anglès), tot fent que els anells fossin menys flexibles i, per tant, amb menys capacitat de segellar o segellar amb prou rapidesa com per evitar l'explosió. Hom va calcular que els anells de Viton van esser escalfats fins a sols 11.6°C durant el llançament.
34 Figura2_1 (figura a la pàg. 13 de l’article Pioneers in Propulsion—A History of CSD Pratt & Whitney’s Solid Rocket Company de Charles A. Chase, vegeu bibligrafia problema 2; s’hi pot veure la descomposició de cada peça, és d’utilitat per tal de saber de què hom parla per exemple a la base de dades) A la previsió meteorològica per a la nit abans del llançament del Challenger va esdevenir-se el mateix: aquell gener va fer un fred fora mesura, potser fins a -7.7°C, un altre “fred de 100 anys” amb una temperatura ambient en el moment de l'enlaiarament projectada en el rang de -3.3°C a -1.6°C. A una teleconferència el vespre abans del llançament, Els enginyers de Morton Thiokol van suggerir que les llançadores no s’enlairessin per sota de 11.6°C. 2. 9Wade Robinson,filòsof, versus Edward R. Tufte, estadístic En aquest TFG, hom ha maldat per reconstruir la història (causal) que hi ha rere les dades (emprant la terminologia de Judea Pearl), d’aquí que hi hagin autors amb descripcions i anàlisis contraposades com ara les de Wade Robinson Edward R Tufte que empenyen el lector a prendre-hi partit, a posicionar-se (de fet, el report causal dels enginyers de la NASA difereix del report causal dels enginyers de l’empresa fabricant Thiokol). Tanmateix, gràcies a ells i a les seves diferències, pots entendre millor l’objecte d’estudi i veure hi ha més d’una causa potencial. És a dir, per exemple, Roger Boisjoly, enginyer de Thiokol, versus Richard Feynman, físic llorejat amb un nobel; les seves anàlisis i conclusions són diferentes, el primer des d’un punt de vista holístic i diacrònic, el segon des d’un punt de vista concret i sincrònic. La temperatura sembla clar que és una causa assignable, però per si sola no s’expliquen tots els casos, és a dir, hi han casos en què la temperatura és dins d’un interval de normalitat però hi han fuites, sols fuites, no pas erosió. Per tant, què causa les fuites quan la temperatura ambient és la normal (i, per tant, també normal la de les O-ring) per als llançaments sense problemes? Això, sense tenir en compte el disseny industrial, perquè si els coet de propulsiós haguessin estat fets d’un sol bloc, cap accident en el llançament hagués passat. 3. Causa i efecte Fuita no és sutge(erosió), l’efecte de la fuita és el sutge; la fuita s’esdevé quan els gasos calents s’escolen per l’anella, la qual no segella del tot. Quan una junta no segella del tot, hi ha un espai a través del qual s’escolen els gasos calents del coet de propulsió, cremant el greix de l'anell i col·lidint contra l'anell secundari, tot dipositant-hi el que resta de la combustió i el greix cremat, és a dir, el sutge. El sutge és un efecte causal dels gasos calents que bufen per una junta i escalfen el greix que els recobreix. La fuita no és pas sutge i, com saben els enginyers, els efectes de la fuita són potencialment catastròfics (no pas la fuita en si). Una junta que no segella és subjecta tant a l'erosió per impacte/col·lisió com a l'erosió per fricció/fregament en passar-hi a través, en la qual el material de la junta s'elimina molt més ràpid. 9 De fonts d’informació, n’hi han moltes, una tirallonga de llibres, tesis i articles. A la bibliografia us remeto.
35 Figura2_2 (figura a la pàg. 5 de la tesi Space Shuttle Challenger January 28, 1986 Tragedy 36 Years Later A retrospective on Causation and Moral Injuries de Martin Ditkof; també a Report of the PRESIDENTIAL COMMISSION on the Space Shuttle Challenger Accident cap. IV, vegeu bibligrafia problema 2; imatge molt útil perquè el loctor es situï d’on hi ha el problema: els dos anells, aquí anomenats O-ring, tallats al pla transversal, són situats a la clevis en anglès, muntura; també és important situar el màstic, putty en anglès) 4. Anàlisi de les dades de camp i possibles causes i efectes Els enginyers tenen totes dues menes de dades; un dels aplecs de dades de camp són els llançaments fets abans del Challenger 51L: o bé hi ha un problema de fuita a l’O- ring (recodeu que són els anells de Viton que hi ha a cada juntura de cada cos cilíndric, vegeu Figura2_1 i Figura2_2) o bé d’erosió al màstic o bé totes dues, aquest fóra la bifurcació essencial dels reports tècnics. A dins de cada clau (vegeu Figura2_3), hi ha la seqüència dels esdeveniments, per exemple, a dins de la clau de l’O-ring, en haver-hi una fuita, hi ha un escalf de l’O-ring, segons la durada i el grau de la fuita, de l’escalf de l’Oring es passa a l’erosió, segons el grau de l’erosió una quantitat de sutge i coloració i finalment la flama passa al costat extern de la cuirassa del coet de propulsió. 𝑑𝑑𝑣𝑣𝑣𝑣𝑠𝑠 𝑠𝑠𝑣𝑣𝑠𝑠üè𝑛𝑛𝑡𝑡𝑒𝑒𝑣𝑣𝑠𝑠⎩ ⎪ ⎪ ⎨ ⎪ ⎪ ⎧ 𝑂𝑂−𝑡𝑡𝑒𝑒𝑛𝑛𝑙𝑙�fuita O −ring fuita O −ring ⟹escalf O −ring escalf O −ring ⟹erosió O −ring ⇒sutge ⇒flama màstic �erosió màstic erosió màstic ⟹escalf 1a O −ring erosió màstic ⟹erosió 1a O −ring ⟹sutge ⇒flama Figura2_3 (figura pròpia; aquí hom pretén que s’entengui la seqüència temporal dels fets segons quina mena d’orisió es produeixi, quan més de durada té la fuita o l’erosió al màstic, més greu és el resultat, d aquí les restes de sutge)
36 Els efectes molests que els enginyers veuen a la història dels vols amb llançadora semblen aleatoris de dues maneres diferentes: Primer, hi intervenen diferentes articulacions de diferentes juntures: l’articulació nozzle és el tram circular final i l’articulació field és estesa al llarg del cos (davanter, central i darrer; vegeu Figura2_1). A voltes, el problema es produeix a dalt de tot, a l’encenedor o igniter; a una articulació del cos davantera, de vegades en una articulació del cos central, de vegades en una articulació del cos darrerana i, de vegades, en l'articulació del broquet (vegeu Figura2_1). 𝐸𝐸𝑙𝑙𝑠𝑠 𝑡𝑡𝑐𝑐𝑠𝑠𝑠𝑠𝑐𝑐𝑠𝑠 𝑡𝑡𝑒𝑒𝑙𝑙í𝑛𝑛𝑑𝑑𝑡𝑡𝑒𝑒𝑡𝑡𝑠𝑠 𝑠𝑠𝑣𝑣𝑣𝑣 𝑡𝑡𝑐𝑐𝑐𝑐𝑝𝑝𝑐𝑐𝑛𝑛𝑣𝑣𝑛𝑛 𝑣𝑣𝑙𝑙 𝑡𝑡𝑐𝑐𝑣𝑣𝑡𝑡 𝑝𝑝𝑡𝑡𝑐𝑐𝑝𝑝𝑣𝑣𝑙𝑙𝑠𝑠𝑒𝑒𝑣𝑣⎩ ⎪ ⎨ ⎪ ⎧ 𝑁𝑁: 𝑛𝑛𝑐𝑐𝑎𝑎𝑎𝑎𝑙𝑙𝑣𝑣 (𝑎𝑎𝑡𝑡𝑐𝑐𝑠𝑠𝑣𝑣𝑣𝑣𝑡𝑡) 𝐷𝐷𝑒𝑒𝑣𝑣𝑙𝑙𝑑𝑑(𝑡𝑡𝑐𝑐𝑠𝑠)�𝐴𝐴𝐴𝐴𝑇𝑇: 𝑡𝑡𝐷𝐷𝑡𝑡𝑣𝑣𝑡𝑡 (𝑑𝑑𝑡𝑡𝑡𝑡𝑡𝑡𝑣𝑣𝑡𝑡) 𝐶𝐶𝑇𝑇𝑅𝑅:𝑡𝑡𝑣𝑣𝑛𝑛𝑡𝑡𝑡𝑡𝑡𝑡𝑙𝑙 𝐴𝐴𝐹𝐹𝐷𝐷:𝐷𝐷𝑐𝑐𝑡𝑡𝑓𝑓𝑡𝑡𝑡𝑡𝑑𝑑 (𝑑𝑑𝑡𝑡𝑣𝑣𝑡𝑡𝑛𝑛𝑡𝑡𝑣𝑣𝑡𝑡) 𝐼𝐼𝐼𝐼: 𝑒𝑒𝑙𝑙𝑛𝑛𝑒𝑒𝑡𝑡𝑣𝑣𝑡𝑡 (𝑣𝑣𝑛𝑛𝑡𝑡𝑣𝑣𝑛𝑛𝑣𝑣𝑑𝑑𝑐𝑐𝑡𝑡 ) Figura2_4 (figura pròpia; aquí hi han les diferentes seccions circulars del coet propulsor, aquest esquema és complementari a la Figura 2_1 ) En segon lloc, diferentes posicions de cada articulació són implicades; així, cap ubicació de la secció transversal conjunta va ser assenyalada com a problemàtica durant els vols observats. Als gràfics de la Figura2_3 mostren que tant els segments de broquet com els segments del cos tenen una freqüència semblanta d’anomalies amb el test de pressió a 50psi i 200psi, però sí que difereixen amb el de 100psi. Figura2_5 (figura a l’article Lessons Learned from the Space Shuttle Challenger Disaster for the Nuclear Industry de Robert Eugene Austin, vegeu bibligrafia problema 2; aquests dos gràfics són molt informatius, amb el test de pressurització a 100psi (a fi de comprovar que les O-ring siguin al seu lloc) sembla que afecta de forma diferenta les juntures de Field, el cos, de les Nozzle, broquet)
37 Figura2_6 (figura al Report of the PRESIDENTIAL COMMISSION on the Space Shuttle Challenger Accident, vegeu bibligrafia problema 2; aquí hi ha la mateixa informació que a la figura2_5 però en format de taula) És interessant de comprovar que tots els coets propulsius que són a una temperatura alta però amb problemes de segellatge (41C, 41D, STS-2, 61A) o bé no duen asbest al màstic o bé hi tenen camins de gas, al màstic (vegeu Figura2_7). Per tant, la temperatura no pot esser una única causa general, hi han més de variables primigènies que hi actuen amb o sense interacció amb la temperatura. Figura2_7 (figura a la pàg. 5 de la tesi Space Shuttle Challenger January 28, 1986 Tragedy 36 Years Later A Retrospective on Causation and Moral Injuries de Martin Ditkof, vegeu bibligrafia problema 2; també al Report of the PRESIDENTIAL COMMISSION on the Space Shuttle Challenger Accident cap. VI, vegeu bibligrafia problema2; aquest gràfic també és molt instructiu justament perquè la tesi més estudiada i difosa -hi ha una gran quantitat de llibres publicats sobre les O-ring- és que el problema de segellatge de les juntures dels coets de propulsió és a causa de les O-ring quan són a una temperatura baixa, però hi han enlairaments a temperatures acceptades com a normals que també registren incidents) De fet, a partir del vol STS 51-C, quan hi ha el segon exemple de damnatge de l'anell tòric, on hi ha evidència de dues menes d'erosió: una per fuita i una segona per impacte; hi ha doncs dues vies d’erosió, per fuita i per col·lisió; és a dir, la primera és lligada a un defecte de segellatge de les O-rings (sigui o bé per causa de la temperatura, el test de pressurització o l’efecte de rotació), la segona és lligada als camins de gas al màstic (sigui o bé a causa del test de pressurització, o bé per causa de l’efecte de la humitat al màstic o bé la composició química del màstic).
38 𝑐𝑐𝑣𝑣𝑛𝑛𝑣𝑣𝑠𝑠 𝑑𝑑′𝑣𝑣𝑡𝑡𝑐𝑐𝑠𝑠𝑒𝑒ó�L′erosió d′impacte es produeix a un anell ben segellat,però un raig focalitzat de gas calent colpeix la super�ície de l′anell i n′elimina una part L′erosió de fuita de l′anell es produeix quan l′anell encara no segella la bretxa de la junta i la vora de l′anell s′erosiona a mesura que el gas calent �lueix al seu voltant Aquesta distinció és aquí bàsica perquè si bé no hi ha una única variable causa primigènia, tampoc hi ha una única variable resposta. D’aquí que el DAG tingui una configuració, una estructura com a mínim bifurcada, diverses causes interrelacionades i diversos efectes. La causa més probable dels problemes, que no crec que n’hi hagi cap de comuna, aparentament hauria d’esser qualque cosa que pot variar a mesura que varien els problemes. Un potencial sospitós comú de les fallades que pot coincidir amb l'aleatorietat dels efectes és el màstec, atès que té un comportament variable. Si el màstec falla en qualsevol punt, tota la pressió interna es concentra en aquest punt en lloc de distribuir-se uniformement pel perímetre intern del coet de propulsió. De fet, en un moment hom va suggerir que s'eliminés el màstec a fi de garantir l'equiparació de la pressió interna. Les formulacions del màstec va canviar durant els vols a causa de la prohibició de l'Agència de Protecció del Medi Ambient de l'amiant del màstec original. Però, per exemple, el màstec amb una humitat alta al cap Kennedy cal col·locar-la als congeladors i fer-la servir sols abans d'emprar-la perquè, altrament, es torna massa suau i enganxosa per posar-la al seu lloc. Quan hom la utilitza a Utah, però, amb una baixa humitat, no calen aquestes precaucions. En qualsevol cas, tampoc no és gaire clar, per exemple, si el màstec va variar d'un lot a un altre o si la forma en què s'aplicava el màstec va variar d'un vol a un altre, o si la temperatura o la humitat afecten el màstec en un vol. Els enginyers van demanar de fer un test al màstic, però mai no es va aprovar cap prova. 5. Possibles qüestions a respondre i/o possibles conclusions a verificar Per part de Thiokol, determinar si el desbordament i l'erosió van esser el resultat de: l'augment a 200 psi quan hom fa el test per tal de determinar si les O-ring són el seu lloc correcte; la variabilitat del màstic depèn si té o no asbest dins de la seva composició química; qualque combinació de les dues o algun altre factor. Per part dels recercadors de la NASA sobre l’accident del 51L arriba a unes conclusions; el rendiment de segellat de les juntures és sensible als factors següents, de manera independenta o combinada: damnatges a les juntures o generació de contaminants a mesura que hom les encaixa (per toleràncies de fabricació, per causa de la reutilització dels coets propulsors...); obertura de la bretxa de l'estella o forca a causa de la pressió del motor i altres, compressió estàtica de la juntura; temperatura de la juntura perquè afecta la resposta de l'o-ring en condicions dinàmiques (resiliència) i duresa; temperatura de l'articulació pel que fa a la formació de gel per la intrusió d'aigua a l'articulació; efectes de rendiment del màstic sobre l’o-ring... La natura de les qüestions canvia segons la institució: Thiokol es demana per tot allò que no és directament competència seva; en canvi, la NASA es demana o posa més
39 d’èmfasi en el disseny i estructura dels coets propulsors; en termes legals poder respondre aquestes qüestions permetria saber de qui són les responsabilitats. 6. Buidatge i taula de dades definitiva D’aquí que (o bé segons els enginyers de Thiokol o bé segons els acadèmics de la NASA) hi hagin dos aplecs de variables sense un marc de referència comú, que tant poden actuar de forma aïllada com de forma aplegada, cosa que dificulta fer-ne un anàlisi global. Tanmateix, fent-ne una cerca el màxim d’exhaustiva (la recerca d’informació mai no s’enllesteix, hom l’abandona), n’he fet el buidatge de totes aquelles que han estat mesurades i n’he bastit la taula següenta de 45 files (Taula2_8): Taula2_8 (figura pròpia i corregida amb el Report of the PRESIDENTIAL COMMISSION on the Space Shuttle Challenger Accident, vegeu bibligrafia problema 2; una base de dades mai no s’enllesteix, hom l’abandona)
40 Taula de dades binària de treball a R: cada fila representa o bé cadascuna de les juntures de cada coet de propulsió que ha tingut problemes (35 files) o bé un coet de propulsió que no ha tingut cap problema a cap juntura (10 files ); Taula2_9 (figura pròpia, tota la taula de la Taula2_8 ha estat transformada a binària) T_aire_C Pressio_At_C T_Oring_C Humitat_C Collisio1_B Collisio2_B Fuita1_B Fuita2_B Test_B Asbest_B Disloc_B C_gas_B Rot_B V_vel_C V_dir_C Junt_Field 0.000 0.000 0.000 0.00 1.000 1.000 1.000 1.000 200.000 0.000 1.000 1.000 1.000 1.000 1.000 1.000 0.000 0.000 0.000 0.00 1.000 0.000 1.000 1.000 200.000 0.000 1.000 1.000 1.000 1.000 1.000 1.000 0.000 0.000 0.000 0.00 0.000 0.000 1.000 0.000 50.000 0.000 0.000 0.000 1.000 1.000 1.000 0.000 0.000 0.000 0.000 0.00 1.000 0.000 1.000 0.000 200.000 0.000 1.000 1.000 1.000 1.000 1.000 1.000 0.000 0.000 0.000 0.00 0.000 0.000 1.000 0.000 50.000 0.000 0.000 0.000 1.000 1.000 1.000 0.000 0.000 0.000 0.000 1.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 1.000 1.000 1.000 0.000 0.000 0.000 0.000 1.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 1.000 1.000 1.000 1.000 0.000 1.000 0.000 1.00 1.000 0.000 0.000 0.000 200.000 0.000 0.000 0.000 1.000 1.000 1.000 0.000 0.000 1.000 0.000 1.00 1.000 0.000 0.000 0.000 200.000 0.000 0.000 0.000 1.000 1.000 1.000 1.000 0.000 1.000 0.000 1.00 0.000 0.000 1.000 0.000 200.000 0.000 0.000 0.000 1.000 1.000 1.000 0.000 0.000 0.000 0.000 0.00 1.000 0.000 0.000 0.000 200.000 0.000 0.000 1.000 1.000 1.000 1.000 0.000 0.000 0.000 0.000 0.00 0.000 0.000 1.000 0.000 0.000 0.000 1.000 1.000 1.000 0.000 0.000 0.000 0.000 0.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 1.000 1.000 1.000 1.000 0.000 1.000 0.000 1.00 0.000 0.000 0.000 0.000 50.000 1.000 0.000 0.000 0.000 0.000 0.000 1.000 1.000 1.000 0.00 1.000 0.000 0.000 0.000 50.000 1.000 0.000 1.000 1.000 1.000 1.000 0.000 1.000 1.000 1.000 0.00 1.000 0.000 0.000 0.000 50.000 1.000 0.000 1.000 1.000 1.000 1.000 0.000 0.000 1.000 1.000 0.00 0.000 0.000 0.000 0.000 0.000 0.000 0.000 1.000 1.000 0.000 1.000 1.000 0.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 1.000 1.000 1.000 0.000 0.000 1.000 1.000 0.00 1.000 0.000 0.000 0.000 0.000 0.000 0.000 1.000 1.000 0.000 0.000 1.000 1.000 0.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 1.000 1.000 1.000 0.000 0.000 1.000 1.000 0.00 1.000 0.000 0.000 0.000 0.000 0.000 1.000 1.000 1.000 0.000 1.000 1.000 1.000 0.00 0.000 0.000 0.000 0.000 50.000 1.000 0.000 0.000 0.000 1.000 0.000 1.000 0.000 1.000 1.00 50.000 1.000 0.000 0.000 1.000 0.000 1.000 0.000 1.000 0.00 1.000 0.000 0.000 0.000 50.000 1.000 0.000 1.000 1.000 1.000 1.000 1.000 1.000 0.000 1.000 1.00 0.000 0.000 0.000 0.000 50.000 1.000 0.000 0.000 0.000 1.000 0.000 1.000 0.000 1.000 1.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 0.000 0.000 1.000 1.000 1.000 0.000 1.000 1.00 0.000 0.000 1.000 0.000 0.000 0.000 0.000 0.000 1.000 0.000 1.000 0.000 1.000 1.00 1.000 0.000 1.000 0.000 200.000 0.000 1.000 1.000 0.000 0.000 1.000 1.000 1.000 1.000 1.000 1.00 1.000 0.000 1.000 0.000 200.000 0.000 1.000 1.000 0.000 0.000 0.000 0.000 1.000 1.000 1.000 1.00 1.000 0.000 1.000 0.000 200.000 0.000 1.000 1.000 0.000 0.000 0.000 0.000 1.000 1.000 1.000 1.00 0.000 0.000 1.000 0.000 0.000 0.000 0.000 0.000 0.000 0.000 1.000 0.000 1.000 1.00 0.000 0.000 0.000 0.000 50.000 1.000 0.000 0.000 0.000 0.000 1.000 1.000 0.000 1.000 1.00 0.000 0.000 0.000 0.000 50.000 1.000 0.000 0.000 0.000 0.000 0.000 1.000 0.000 1.000 0.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 0.000 0.000 0.000 0.000 1.000 0.000 1.000 0.00 1.000 0.000 1.000 0.000 200.000 0.000 1.000 1.000 0.000 0.000 0.000 0.000 1.000 0.000 1.000 1.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 0.000 0.000 0.000 0.000 1.000 0.000 1.000 1.00 0.000 0.000 1.000 0.000 200.000 0.000 0.000 0.000 0.000 0.000 0.000 1.000 1.000 0.000 1.000 1.00 0.000 0.000 1.000 0.000 200.000 0.000 0.000 0.000 0.000 0.000 0.000 1.000 1.000 1.000 1.000 1.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 0.000 0.000 0.000 0.000 1.000 1.000 1.000 1.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 0.000 0.000 1.000 0.000 1.000 1.000 1.000 1.00 1.000 0.000 1.000 0.000 200.000 0.000 0.000 0.000 0.000 0.000 1.000 0.000 1.000 1.000 1.000 0.00 0.000 0.000 0.000 0.000 1.000 0.000 0.000 0.000 0.000 1.000 1.000 1.000 1.00 0.000 0.000 0.000 0.000 200.000 0.000 0.000 0.000 0.000 0.000 1.000 1.000 1.000 1.000 1.00 50.000 1.000 0.000 0.000 0.000 0.000 1.000 0.000 1.000 1.00 1.000 0.000 0.000 0.000 200.000 0.000 1.000 1.000 0.000 0.000 0.000 0.000
41 Les variables contínues (T_aire_C és temperatura de l’aire contínua, T_Oring_C és temperatura O-ring, Pressio_At_C és pressió atmosfèrica, Humitat_C, V_vel_C és velocitat del vent a 15000 metres) hom posa u si és per damunt de la mitjana i zero dessota; les variables binàries romanen igual (Collisio1_B, Collisio2_B,Fuita1_B, Fuita2_B, Junt_field és si és una secció del coet de mena field o no n’és i Test_B és test de pressurització de les O-ring o anelles, Asbest_B és si hi ha asbest al màstic, C_gas_B és camí de bombolles de gas al màstic) hom posa u si correspon a “amb” i zero correspon a “sense”; la variable categòrica Junt_Field, les seccions circulars de field amb u versus les seccions tant de nozzle com d’igniter amb zero; la variable contínua V_dir_C (direcció del vent), u si pertany a l’interval [263, 289] i zero si no hi correspon; i dues non-observades que hom les ha definides a partir d’altres variables registrades: Disloc_B (dislocació de l’O-ring; 50 sempre correspon a 50, 100 es correspon a 50 si no hi han traces de camí de gas però correspon a 200 si n’hi han, 200 sempre correspon a 200) i Rot_B (Rotació del galze a la juntura; sols és u si tant la velocitat com la direcció, totes dues són u, altrament és zero). Hom fa una breu descripció de cada variable (*variables non-observades; **variables resposta): Test pressurització O-rings: un test per a comprovar que les O-ring són al seu lloc. Més d’informació vegeu la nota [𝛾𝛾] corresponent a la Figura2_10. Humitat ambient Asbest màstic: si la composició química del segellatge entre les juntures del coet, el màstic, de propulsió conté asbest o no en conté. Més d’informació vegeu la nota [δ] corresponent a la Figura2_10 Temperatura ambient Temperatura O_rings per a més d’informació vegeu la nota [α] corresponent a la Figura2_10 Pressió atmosfèrica Vent direcció Vent velocitat a 15.000 metres Field Juntura: si les seccions circulars del coet propulsiusón del tipus field o no en són. Camí gas a dins del màstic: si n’hi ha o no n’hi ha , de camins de gas a dins del màstic *Dislocació O-rings: les o-rings són fora del seu canal o solc a la juntura, és a dir, fora de la seva ranura. *Pressurització dins del coet de propulsió: quina pressió interna exerceix el gas píric al llarg del cos intern del coet. *Rotació del cos del coet de propulsió: hom la defineix a partir de la composició d’altres variables observades: si hi ha una velocitat per damunt de la mediana de 36.27 i ensems si hi ha una direcció de vent entre 263 i 289 hom pren com a probable l’efecte de rotaci. Més d’informació [β] de la Figura2_10. *Pressurització interna: la pressió interna que exerceixen els gasos pírics Aquí les variables resposta: hi ha una relació temporal entre fuita1 i fuita2 i també entre collisió1 i collisio2.
48 En termes de variables: hom treu Fuita2_B i Collisio2_B perquè tenen una freqüència d'aparició baixíssima i atesa una correlació de totes dues amb les resta de variables és entre de -0.2 i 0.2. Per tant, les úniques variables resposta són dues al model pràctic: Fuita1_B i Collisio1_B. Es treu també la variable Junt_Field perquè segons els reports té un caràcter aleatori. En termes d'estructura: hom manté l'estructura del model teòric amb "dos centres de gravetat" (dues variables resposta); hom connecta totes les variables regressores sols a totes dues respostes (hom ja veurà en la validació del model-DAG en quina mesura el model teòric i pràctic coincideixen segons les dades observades) i hom connecta les tres variables parentes de Rot_B també sols a les dues variables respostes. Fent una regressió logística amb dues variables regressores, és a dir, explorant totes les combinacions d’una regressora amb tota la resta, de dues en dues, cercant models vàlids de forma sistemàtica: hom pot veure que el DAG amb dues variables resposta, amb dos centres de gravetat, es manté; la resposta Fuita1_B lligada sobretot a l’O-ring; la resposta Collisio1_B lligada Rot_B i Asbest_B; i Test_B a totes dues, però sobretot a Collisio1_B. Hom prioritza la inclusió al DAG de la regressió Collisio1_B ~ Rot_B + Test_B amb relació a aquesta altra Collisio1_B ~ Asbest_B + Rot_B. Amb la variable resposta Fuita1_B Amb la variable resposta Collisio1_B Fuita1_B ~ V_vel_C + T_Oring_C (Intercept) 1.939 1.219 1.590 0.1117 V_vel_C -2.054 1.127 -1.823 0.0683 T_Oring_C -2.230 1.156 -1.929 0.0538 Collisio1_B ~ Asbest_B (Intercept) 0.8754687 0.3763861 2.32599 0.020019 Asbest_B -1.8562980 0.7745961 -2.39647 0.016554 Collisio1_B ~ Rot_B (Intercept) -0.154 0.393 -0.39 0.695 Rot_B 1.476 0.687 2.15 0.032 Collisio1_B ~ C_gas_B (Intercept) -0.0606 0.2463 -0.25 0.8056 C_gas_B 1.0621 0.3696 2.87 0.0041 Collisio1_B ~ Test_B + Rot_B Test_B Pr(>|z|) =0.00657 Rot_B Pr(>|z|) =0.0243 Fuita1_B ~ T_Oring_C + V_vel_C (Intercept) 1.939 1.219 1.590 0.1117 T_Oring_C -2.230 1.156 -1.929 0.0538 V_vel_C -2.054 1.127 -1.823 0.0683 Collisio1_B ~ Test_B + V_vel_C Test_B Pr(>|z|) = 0.00445 V_vel_C Pr(>|z|) = 0.1155 Collisio1_B ~ Humitat_C + Test_B Humitat_C Pr(>|z|)=0.125 Test_B Pr(>|z|)=0.00556 Collisio1_B ~ Rot_B + Test_B (Intercept) -2.96960 1.19632 -2.48 0.0131 Rot_B 1.94003 0.86109 2.25 0.0243 Test_B 0.01672 0.00615 2.72 0.0066 Collisio1_B ~ V_dir_C + Test_B (Intercept) -2.742422 1.272136 -2.156 0.03110 V_dir_C 1.451142 0.941991 1.541 0.0859 Test_B 0.018338 0.006444 2.846 0.01098 Collisio1_B ~ Asbest_B + Rot_B (Intercept) 0.3271479 0.4581674 0.71404 0.475205 Asbest_B -1.7603310 0.8110811 -2.17035 0.029980 Rot_B 1.3787357 0.7295589 1.88982 0.058782 Fuita1_B ~ Test_B + Collisio1_B Collisio1_B ~ Fuita1_B + Test_B
49 Test_B Pr(>|z|) =0.0655 Collisio1_B Pr(>|z|)=0.0543 Fuita1_B Pr(>|z|)=0.0543 Test_B Pr(>|z|)=0.00886 Collisio1_B ~ Fuita1_B + Asbest_B Fuita1_B Pr(>|z|)=0.0211 Asbest_B Pr(>|z|)=0.00715 Collisio1_B ~ Humitat_C + Asbest_B Humitat_C Pr(>|z|) =0.182 Asbest_B Pr(>|z|) =0.01482 Collisio1_B ~ V_dir_C + Asbest_B V_dir_C 0.1675 Asbest_B 0.0444 Fuita1_B~C_gas_B+ Junt_Field C_gas_B amb Pr(>|z|) =0.0282 Junt_Field amb Pr(>|z|)=0.2811 Collisio1_B ~Junt_Field + Pressio_At_C Junt_Field Pr(>|z|) =0.300 Pressio_At_C Pr(>|z|)=0.142 Taula2_16 (figura pròpia, vegeu annex codi d’R; en aquesta taula hom recull no pas de forma exhaustiva regressions logístiques vàlides, en general fan costat a un DAG amb dues variables resposta i fan trellat amb la causació teòrica dels diversos enginyers; en concret crida l’atenció que la millor regressió d’humitat trobada sigui anant amb la variable asbest, el model no acaba d’esser del tot vàlid però sí que hom pot veure-hi una tendència, hom en deixa constància perquè des d’un punt de vista teòric oisí que fa trellat. Un altre cas a comentar és C_gas_B amb Pr(>|z|)=0.0282 i Junt_Field amb Pr(>|z|)=0.2811 a la regressió Fuita1_B~C_gas_B+ Junt_Field, amb un p-valor força més alt que 0.2, però que les dues variables juntes doni per a C_gas_B un p-valor per sota de 0.05, més encara, C_gas_B per si sola no té un coeficient vàlid amb relació a la variable resposta Fuita1_B, però amb Junt_Field sí; i Junt_field obté gairebé el més baix p-valor amb relació a totes les combinacions de dos regressores possibles. Això sobta perquè els teòrics no creuen que el tipus de juntura tingui res a veure amb cap de les dues variables resposta). DAG-0 teòric DAG-1 fàctic de resposta-saturat de partença DAG-2 fàctic Figura2_17 (figures pròpies, vegeu annex codi d’R; el primer DAG és construït a partir de la informació bibliogràfica d’aquest cas; el segon és un DAG saturat sols amb relació a les variables resposta, aquesta disseny de DAG saturat sols per les variables resposta és d’inventiva pròpia, perquè el model del tot saturat implica una matriu de correlacions ingovernable donada una base de dades més aviat petita) Havent vistes les regressions logístiques significatives, el següent pas és analitzar la taula de correlacions i veure quines tenen un lligam més robust (lineal o non-lineal); sobretot interessa saber quines correlacions hi han entre les variables d'exposició i les dues de resposta Fuita1_B i Collisio1_B: hom treu les que tenen una correlació dessota 0.5 o damunt -0.5. També hom pot veure que hi ha una certa correlació entre les dues variables resposta, cosa que es pot traduir en unir les dues variables resposta, sembla que hi podria haver un doble sentit de collisio1_B a Fuita1_B justificat per la regressió logística Fuita1_B ~ Test_B + Collisio1_B i de Fuita1_B a collisio1_B justificat per la regressió logística collisio1_B ~ Fuita1_B+Test_B (vegeu Figura2_12), que en
50 totes dues hi hagi el regressor Test_B fa coherència amb la teoria exposada pels enginyers. Entre les variables d’exposició hom agafa les que tenen una correlació màxima (màxima si la relació és lineal) i també mínima (si la regressió logística és significativa, vegeu Figura2_12, atès que hom pot suposar que una correlació a prop del zero pot voler dir que no hi ha gens de relació però també pot significar que existeix una relació non-lineal). Hom afegeix les arestes entre {Test_B Disloc_B C_gas_B Rot_B } i Collisio1_B; Rot_B hi és inclosa perquè hi ha evidència empírica a la regressió logística Collisio1_B ~ Rot_B + Test_B. Hom afegeix les arestes entre { Asbest_B Test_B T_Oring_C V_vel_C} i Fuita1_B (hom hi afegeix Asbest_B i Test_B perquè en són les dues correlacions màximes i la primera ja s'acosta a 0.5; també T_Oring_C i V_vel_C perquè és significativa a la regressió logística Fuita1_B ~ T_Oring_C + V_vel_C) Test_B i Rot_B surt com a mínima correlació, però hom la introdueix perquè la regressió logística així ho assenyala; la correlació entre Test_B i C_gas_B és a prop del 0.5 i la incloc perquè des d'un punt de vista teòric és més que justificada. Pressio_At_C és treta del dag pràctic perquè és desaparellada en els resultats de correlació màxima i de regressió logística. Matriu2_18 (figura pròpia, vegeu annex codi d’R, matriu de correlacions) 9. Validació del DAG versus la base de dades Amb aquestes dades hom ja pot afegir totes les arestes (que uneixen les variables d'exposició amb les variables resposta) quan la correlació entre cada parell sigui aproximadament damunt damunt de 0.5 i dessota -0.5, però si n’hi han moltes, directament les dues màximes. També hom pot veure que hi ha una certa correlació entre les dues variables resposta, cosa que es pot traduir en unir les dues variables resposta sense saber-ne el sentit tanmateix o si són connectades per una altra variable desconeguda (<->), hom opta per connectar amb una aresta de sentit de Test_B a Rot_B.
51 El DAG-0 és millor que no el DAG-1, però el DAG-2 és semblant al DAG-0 teòric: gairebé tots els seus punts són dins de l’interval [-1,0.5] (però es manté una certa cua a la dreta) Gràfics de validació DAG respecte a les dades DAG-0 teòric DAG-1 fàctic de resposta-saturat de partença DAG-2 fàctic Figura2_19 (figura pròpia, vegeu annex codi d’R, seqüència dels gràfics de validació al llarg del procés de validació) Però encara hom pot anar refinant qualque aresta més a partir dels resultats dela funció localTest() d’R (vegeu l’annex d’R), per tal d’enllestir la validació del DAG amb les dades, hom empra les funcions Dins del gràfic de validació gairebé tots els seus punts són dins de l’interval [-0.5,0.5], més leptokúrtica que no pas els restants, vegeu que la piràmide invertida que dibuixen els IC és més llarga (i la cua de la dreta gairebé és corregida, per tant, simètrica). Interessa veure que els IC s’encavalquen tot dibuixant una piràmide invertida fins a esdevenir una rectangle, aquí el cos de la piràmide ja no és tan punxeguda. DAG-3 fàctic final Validació DAG-3 fàctic final respecte a les dades Figura2_20 (figura pròpia, vegeu annex codi d’R, DAG final i gràfic de validació final, la piràmida invertida del qual ja comença a tenir els laterals arrodonits)
52 10. Ajustament per confonedors: 10kriterion de rere-porta per mitjà d’un dels mètodes de l’estandardització (per mitjà de la modelització dels resultats) L’estandardització estima una associació mitjana d’una població estandarditzada, altrament dit efecte causal. Amb aquesta, hom compara grups amb una distribució de confonedors idèntica a aquella distribució de la populació estàndard. L’estandardització per mitjà de la modelització dels resultats és una de les tres maneres d’estimar E(Y(t)) tot respectant les tres assumpcions ja esmentades al primer problema: l’assumpció d’intercanviabilitat condicional {𝑌𝑌(𝑡𝑡)}𝑡𝑡∈𝜏𝜏∐𝑇𝑇|𝐻𝐻}, en termes binaris {𝑌𝑌(0),𝑌𝑌(1)∐𝑇𝑇|𝐻𝐻 }, n’és la condició clau que dels assaigs aleatoris condicionals (on H és un confonedor suficient determinat pel teorema de rere-porta a fi d’estimar l’efecte de T en Y, on τ és l’aplec de possibles valors per a T). l’assumpció de positivitat: 1>P(T=t)>0 per a tots els possibles valors de t de T. La probabilitat d’esser assignat a qualsevol grup de tractament segons els valors de la covariable C ha de ser més gran de 0. Altrament dit, P(T=t|C=c)>0 per a tots els valors de c amb P(C=c)>0. La positivitat garanteix que l'efecte causal avaluable a dins de la subpoblació si C=c. Si hom viola la condició de positivitat en qulaque cas en què C=c, la subpoblació amb C=c pot esser eliminar de la població objectiu a fi d’avaluar l'estimació causal d'interès. Hom pot violar la positivitat de dues maneres: violacions estructurals (si el tractament no es pot assignar a persones en determinades condicions, per exemple, quan els metges assignen el tractament Y a individus amb C=1, la positivitat s'ha violat estructuralment) i violacions aleatòries (si l'esdeveniment 0 del tractament es produeix aleatòriament dins dels estrats de tractament i covaria quan la probabilitat dins de la població no és realment 0). l’assumpció de consistència: el resultat potencial és lligat de forma natural al resultat observat Y com a Y=Y(1) per al grup de tractament i Y=Y(0) per al grup control. Aquesta condició és coneguda com a consistència en inferència causal. En el nostre cas binari, la consistència suggereix Y=Y(1)·1(T=1)+Y(0)·1(T=0), on 1() assenyala la funció indicadora que resulta igual a 1 quan l'esdeveniment entre parèntesis és cert. Hom estima aleshores: 𝐸𝐸�𝑌𝑌(𝑡𝑡)�=[1]𝐸𝐸𝐻𝐻𝐸𝐸(𝑌𝑌(𝑡𝑡)|𝐻𝐻)=[2]𝐸𝐸𝐻𝐻𝐸𝐸(𝑌𝑌(𝑡𝑡)|𝑇𝑇=𝑡𝑡,𝐻𝐻)=[3]𝐸𝐸𝐻𝐻𝐸𝐸(𝑌𝑌|𝑇𝑇=𝑡𝑡,𝐻𝐻)=[4]𝐸𝐸𝐻𝐻𝐸𝐸(𝑌𝑌|𝑑𝑑𝑐𝑐(𝑇𝑇=𝑡𝑡), 𝐻𝐻) Aquesta equació és la base per a l’aproximació de la modelització dels resultats en l’estandardització. Per a aquest problema, amb una base de dades binària, hom pot reescriure: 𝐸𝐸𝐻𝐻𝐸𝐸(𝑌𝑌|𝑑𝑑𝑐𝑐(𝑇𝑇=𝑡𝑡), 𝐻𝐻)=𝐸𝐸(𝑌𝑌|𝑑𝑑𝑐𝑐(𝑇𝑇=𝑡𝑡), 𝐻𝐻= 0)𝑃𝑃(𝐻𝐻= 0)+(𝑌𝑌|𝑑𝑑𝑐𝑐(𝑇𝑇=𝑡𝑡), 𝐻𝐻= 1)𝑃𝑃(𝐻𝐻= 1). 10 Kriterion de rere-porta (vegeu annex2 punt 37): si donat un parell de variables (X,Y) ordenat dins d’un graf acíclic directe G, un aplec de variables Z satisfà el kriteri de rere-porta relatiu a (X,Y), (vegeu Annex 1: problema Challenger), això és si cap node dins Z és un descendent d’X i Z bloca cada camí entre X i Y que contingui un camí dirigit o aresta (segeta) cap a X.
53 Així hom pot estimar E(Y(t)) tant fent servir estimadors non-paramètrics com paramètrics per a les componentes de la dreta de l’equació (si H fos contínua o amb moltes de variables, llavors per força cal que sigui paramètric). Així, quan hom estima i compara E(Y(1)) i E(Y(2)), hom ho fa per la distribució dels confonedors H donada per la població sencera, això és per a tots aquells amb T=1 i T=0 combinats. Així, hom coneix com a modelització dels resultats l’expressió E(Y|do(T=t),H). On [1] és justificada pel teorema de l’esperança doble o llei de la probabilitat total 𝐸𝐸(𝑌𝑌|𝑇𝑇)=[1]𝐸𝐸𝐻𝐻|𝑇𝑇𝐸𝐸(𝑌𝑌|𝐻𝐻,𝑇𝑇)=∑�∑𝑦𝑦𝑃𝑃(𝑌𝑌=𝑦𝑦|𝐻𝐻=ℎ,𝑇𝑇) 𝑦𝑦�𝑃𝑃(𝐻𝐻=ℎ|𝑇𝑇) ℎ; on [2] és justificada per l’assumpció susdita {𝑌𝑌(𝑡𝑡)}𝑡𝑡∈𝜏𝜏∐𝑇𝑇|𝐻𝐻, la qual implica la independència mitjana de Y(t) i T donada H; on [3] és justificada per l’assumpció de consistència, la qual permet reemplaçar Y(t) per Y quan hom condiciona per T=t. on [4] en aquest cas és millor fer servir aquí la formalització de Judea Pearl que no pas la d’Anne Brumback, perquè T=t no vol dir pas condicionar per T=t, és a dir, no és pas una condició, no implica en cap cas fer un filtre a les dades; amb l’operador do() és clar que T=t no és una condició sinó una intervenció mentre que H oisí que és una condició. Figura2_21 (figura pròpia, vegeu annex codi d’R, aplec d’un únic confonedor com a ajust mínim i suficient per tal d'estimar l'efecte directe de Rot_B sobre Collisio1_B) El sentit de l’aresta entre Rot_B i Test_B no és clara, potser hi podria haver una variable mitjancera entre totes dues variables, aquí hom formalitzi el lligam entre Rot_B i Test_B en un sentit; però, sigui quina sigui la solució presa (R<->T mitjancera [hom entén que pot haver-hi una variable entre elles non-observada], R--T aresta [aresta sense cap sentit], R->T aresta en sentit dret [la variable de la dreta és causada per la de l’esquerre], R<-T aresta en sentit esquerre [la variable de l’esquerra és causada per la de la dreta]), l’aplec mínim i suficient d’ajustament per tal d’estimar tant l’efecte directe com l’efecte total de Rotació dins de la col·lisió és sempre el mateix, és ajustar pel Test_B. Per tant, Test_B és un confonedor suficient a fi d’estimar Rot_B dins Collisio1_B tot assumint que compleix {𝑌𝑌(𝑡𝑡)}𝑡𝑡∈𝜏𝜏∐𝑇𝑇|𝐻𝐻 Fent l’estandardització per modelització dels resultats de tipus paramètric (amb H=Test_B) dóna les taules següentes (codis diferents però que convergeixen en resultats molt propers, hom pren dos camins per tal d’evitar errors de càlcul):
54 Mesura Estimació SE IC 95% 𝐸𝐸�(Y(0)|Test_B=1) 0.463 0.0918 (0.2829, 0.643) 𝐸𝐸�(Y(1)|Test_B=1) 0.788 0.0934 (0.6047, 0.971) 𝑅𝑅𝐷𝐷 � 0.325 0.1258 (0.0786, 0.572) 𝑅𝑅𝑅𝑅 � exp(0.532)= 1.70 exp(0.2339)= 1.26 (exp(0.0736)= 1.08, exp(0.990)= 2.69) Taula2_22 (figura pròpia, vegeu annex codi d’R, mesures causals amb un únic confonedor calculades amb el codi adaptat de Brumback) Segons la taula feta amb el codi d’Anne Brumback adaptat a aquest problema la proporció d’O-rings que haguessin patit una erosió per col·lisió si tots els coets propulsors haguessin tingut un efecte de rotació hauria estat del 0.788 versus el 0.463 si tots no n’haguessin tingut cap d’efecte, de rotació. Totes dues mesures (la diferència de risc, el risc relatiu) assenyalen un efecte de Rotació en l’erosió per col·lisió, totes dues es mouen en bloc en el mateix sentit (s’allunyen del zero i l’u respectivament en sentit positiu o creixent), d’aquí que hom pugui parlar de causalitat. Assenyalen un efecte de Rotació en l’erosió de col·lisió. Si no hi han més de confonedors i la modelització dels resultats és correcte, hom conclou que sotmetre la nau propulsora a un efecte de rotació acreix la probabilitat de patir una erosió per col·lisió. Els IC són coherents amb cada mesura perquè es mouen en bloc en el mateix sentit, el risc de la diferència no inclou pas el zero i el risc relatiu no inlcou pas l’u. Funció d’estandardització 95% IC segons la Normal(Mean,SE) Funció stdGlm 95% IC segons percentils 0.025 i 0.975 Estimand mean se Lower1 Upper1 Lower2 Upper2 𝑅𝑅𝐷𝐷 � 0.325 0.126 0.079 0.572 0.07 0.567 𝑅𝑅𝑅𝑅 � 1.702 0.442 0.836 2.569 1.129 2.805 𝑂𝑂𝑅𝑅 � 4.311 125788397.353 -246540724.173 246540732.795 1.344 22.695 Taula2_23 (figura pròpia, vegeu annex codi d’R, mesures causals amb un únic confonedor calculades amb el codi adaptat del paquet stdGlm) Totes tres mesures (la diferència de risc, el risc ràtio i l’odds ràtio) assenyalen un efecte de Rotació en l’erosió per col·lisió, totes tres es mouen en bloc en el mateix sentit positiu o creixent, d’aquí que un altre cop hom pugui parlar en termes de causalitat. Si no hi han més de confonedors i la modelització dels resultats és correcte, hom conclou que aplicar l’efecte de rotació acreix la probabilitat de patir una erosió per col·lisió. Els IC fets amb percentils són coherents amb l’estimació de les tres mesures, el risc de la diferència no inclou pas el zero, ni les mesures restantes no inlouen pas l’u; els IC fets amb la Normal(mean,se) segueixen essent coherents amb l’estimació de les tres mesures pel que fa al risc de la diferència (tampoc no inclou pas el zero) i també el risc relatiu (si bé el risc relatiu admetria l’u com a cas extrem); un comentari a banda mareix l’odds ràtio que sembla que presenti o bé una anomalia de càlcul o bé que la normal no sigui l’adienta per al càlcul dels IC. Caldria emprar el segon mètode d’estandardització, la modelització de l’exposició, i comparar-ne els resultats (la modelització dels resultats versus la modelització de l’exposició), si fossin coherents els resultats de tots dos mètodes d’estandardització, llavors les conclusions encara serien més robustes.
55 De fet, si hom considera també la regressió Collisio1_B ~ Rot_B + Test_B + Asbest_B (vegeu Taula2_13) com a significativa, hom tindria la situació prèvia però amb dos confonedors: Test_B i Asbest_B per a l’efecte directe (no importa el sentit de l’aresta entre Rot_B i Asbest_B, o bé R->A o bé A<-R o bé A<->R o bé sense saber-ne el sentit formalitzat com a R--A); també amb aquests dos confonedors per a l’efecte total (el sentit de l’aresta cal que sigui o bé R<-A o bé R<->A) però sols caldria el confonedor Test_B per al càlcul de l’efecte total de Rot_B a Collisio1_B si el sentit de l’aresta és R- >A; i en el darrer cas, quan hom no en sap el sentit de l’aresta, R--A, hom no en pot calcular l’efecte total. Figura2_24 (figura pròpia, vegeu annex codi d’R, aplec de dos confonedors com a ajust mínim i suficient per tal d'estimar l'efecte directe de Rot_B sobre Collisio1_B) Llevat del coeficient d’Asbest, la resta de termes de la regressió logística segueixen essent vàlids, tanmateix si hom procedeix a calcular-ne les diverses mesures causals, fins i tot sembla que els resultats milloren una mica: Mesura Estimació SE IC 95% 𝐸𝐸�(Y(0)|Test_B=1) 0.459 0.0933 (0.2757, 0.641) 𝐸𝐸�(Y(1)|Test_B=1) 0.797 0.0985 (0.6043, 0.990) 𝑅𝑅𝐷𝐷 � 0.339 0.1326 (0.0787, 0.599) 𝑅𝑅𝑅𝑅 � exp(0.553)= 1.74 exp(0.2447)= 1.28 (exp(0.0736)= 1.08, exp(1.033)= 2.81) Taula2_25 (figura pròpia, vegeu annex codi d’R, mesures causals amb dos confonedors calculades amb el codi adaptat de Brumback) Funció d’estandardització 95% IC segons la Normal(Mean,SE) Funció stdGlm 95% IC segons percentils 0.025 i 0.975 Estimand mea n se Lower1 Upper1 Lower2 Upper2 𝑅𝑅𝐷𝐷 � 0.339 0.133 0.079 0.599 0.061 0.579 𝑅𝑅𝑅𝑅 � 1.739 0.463 0.831 2.646 1.103 2.931 𝑂𝑂𝑅𝑅 � 4.644 115255110.543 -225895861.054 225895870.343 1.339 31.459 Taula2_26 (figura pròpia, vegeu annex codi d’R, mesures causals amb dos confonedors calculades amb el codi adaptat del paquet stdGlm
56 11. Conclusions En general, si hom accepta les assumpcions teòriques i les mancances que pugui tenir el model, totes quatre taules convergeixen en uns mateixos resultats, tant amb un confonedor amb les taules de la Figura2_22 i Figura2_23 com amb dos confonedors amb les taules Figura2_25 i Figura2_26, hom pot asserir que sí que sembla que hi hagi un augment de la probabilitat de patir una erosió per col·lisió quan la nau propulsora és sotmesa a un efecte de rotació (podria esser encara més robust si aquest efecte de rotació sinergitzés amb l’efecte de qualque altre variable que ara hom no la té en compte).
57 V. ANNEX 1: CONCEPTES ESSENCIALS (sobretot en clau de bases de dades binàries) 1. 𝑠𝑠𝑒𝑒 𝑃𝑃(𝑌𝑌=𝑡𝑡|𝑇𝑇=𝑎𝑎,𝐻𝐻=𝑑𝑑)=𝑃𝑃(𝑌𝑌=𝑡𝑡|𝑇𝑇=𝑡𝑡,𝐻𝐻=𝑑𝑑)𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙 � � � � � 𝑌𝑌∐𝑇𝑇|𝐻𝐻=𝑑𝑑 (𝑌𝑌 é𝑠𝑠 𝑡𝑡𝑐𝑐𝑛𝑛𝑑𝑑𝑒𝑒𝑡𝑡𝑒𝑒𝑐𝑐𝑛𝑛𝑡𝑡𝑙𝑙𝑐𝑐𝑣𝑣𝑛𝑛𝑡𝑡 𝑒𝑒𝑛𝑛𝑑𝑑𝑣𝑣𝑝𝑝𝑣𝑣𝑛𝑛𝑑𝑑𝑣𝑣𝑛𝑛𝑡𝑡𝑡𝑡 𝑑𝑑𝑣𝑣 𝑇𝑇 𝑑𝑑𝑐𝑐𝑛𝑛𝑡𝑡𝑑𝑑𝑡𝑡 𝐻𝐻=𝑑𝑑,∐≈ 𝑡𝑡𝑐𝑐𝑛𝑛𝑑𝑑𝑒𝑒𝑡𝑡𝑒𝑒𝑐𝑐𝑛𝑛𝑡𝑡𝑙𝑙𝑐𝑐𝑣𝑣𝑛𝑛𝑡𝑡 𝑒𝑒𝑛𝑛𝑑𝑑𝑣𝑣𝑝𝑝𝑣𝑣𝑛𝑛𝑑𝑑𝑣𝑣𝑛𝑛𝑡𝑡𝑡𝑡 ) 𝑠𝑠𝑒𝑒 𝑃𝑃(𝑌𝑌=𝑡𝑡|𝑇𝑇=𝑎𝑎,𝐻𝐻)=𝑃𝑃(𝑌𝑌=𝑡𝑡|𝑇𝑇=𝑡𝑡,𝐻𝐻)𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙 � � � � � 𝑌𝑌∐𝑇𝑇|𝐻𝐻 (𝑌𝑌 é𝑠𝑠 𝑡𝑡𝑐𝑐𝑛𝑛𝑑𝑑𝑒𝑒𝑡𝑡𝑒𝑒𝑐𝑐𝑛𝑛𝑡𝑡𝑙𝑙𝑐𝑐𝑣𝑣𝑛𝑛𝑡𝑡 𝑒𝑒𝑛𝑛𝑑𝑑𝑣𝑣𝑝𝑝𝑣𝑣𝑛𝑛𝑑𝑑𝑣𝑣𝑛𝑛𝑡𝑡𝑡𝑡 𝑑𝑑𝑣𝑣 𝑇𝑇 𝑑𝑑𝑐𝑐𝑛𝑛𝑡𝑡𝑡𝑡 𝑠𝑠𝑣𝑣𝑡𝑡𝑙𝑙𝑠𝑠𝑣𝑣𝑣𝑣𝑐𝑐𝑙𝑙 𝑣𝑣𝑡𝑡𝑙𝑙𝑐𝑐𝑡𝑡 𝑑𝑑′𝐻𝐻) 𝑠𝑠𝑒𝑒 𝑃𝑃(𝑌𝑌=𝑡𝑡|𝑇𝑇=𝑎𝑎,𝐻𝐻)=𝑃𝑃(𝑌𝑌=𝑡𝑡|𝑇𝑇=𝑡𝑡)𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙𝑙 � � � � � 𝑌𝑌∐𝑇𝑇 (𝑌𝑌 é𝑠𝑠 (𝑐𝑐𝑡𝑡𝑡𝑡𝑙𝑙𝑒𝑒𝑛𝑛𝑡𝑡𝑙𝑙𝑐𝑐𝑣𝑣𝑛𝑛𝑡𝑡∗)𝑒𝑒𝑛𝑛𝑑𝑑𝑣𝑣𝑝𝑝𝑣𝑣𝑛𝑛𝑑𝑑𝑣𝑣𝑛𝑛𝑡𝑡𝑡𝑡 𝑑𝑑𝑣𝑣 𝑇𝑇) * é𝑠𝑠 𝑡𝑡 𝑑𝑑𝑒𝑒𝑡𝑡,𝑙𝑙𝑡𝑡 𝑝𝑝𝑡𝑡𝑐𝑐𝑎𝑎𝑡𝑡𝑎𝑎𝑒𝑒𝑙𝑙𝑒𝑒𝑡𝑡𝑡𝑡𝑡𝑡 𝑐𝑐𝑡𝑡𝑡𝑡𝑙𝑙𝑒𝑒𝑛𝑛𝑡𝑡𝑙𝑙 𝑃𝑃(𝑌𝑌= 1) é𝑠𝑠 𝑙𝑙𝑡𝑡 𝑐𝑐𝑡𝑡𝑡𝑡𝑣𝑣𝑒𝑒𝑚𝑚𝑡𝑡 𝑡𝑡 𝑡𝑡𝑐𝑐𝑡𝑡𝑠𝑠 𝑑𝑑𝑐𝑐𝑠𝑠 𝑡𝑡𝑡𝑡𝑠𝑠𝑐𝑐𝑠𝑠 Ob: recordeu que la independència condicional NO implica independència marginal; per exemple, Si Y∐T|H ⇎Y∐T 2. 𝑃𝑃(𝐴𝐴|𝐵𝐵)=∑𝑃𝑃(𝐴𝐴|𝐵𝐵,𝐻𝐻=ℎ)·𝑃𝑃(𝐻𝐻=ℎ|𝐵𝐵) ℎ és la llei de la probabilitat total 𝑃𝑃(𝐴𝐴|𝐵𝐵,𝐶𝐶)·𝑃𝑃(𝐵𝐵|𝐶𝐶)=𝑃𝑃(𝐴𝐴,𝐵𝐵|𝐶𝐶) és la regla de multiplicació 𝑐𝑐𝑎𝑎: (on P(A,B|C) n’és la probabilitat conjunta, atès que A i B s’esdevenen conjuntament condicionades en C) 𝑐𝑐𝑎𝑎1: si C sempre s’esdevé 𝑃𝑃(𝐴𝐴|𝐵𝐵)·𝑃𝑃(𝐵𝐵)=𝑃𝑃(𝐴𝐴,𝐵𝐵) 𝑐𝑐𝑎𝑎2: per manipulació algebraica 𝑃𝑃(𝐴𝐴|𝐵𝐵,𝐶𝐶)·𝑃𝑃(𝐵𝐵|𝐶𝐶)=𝑃𝑃(𝐴𝐴,𝐵𝐵|𝐶𝐶) 𝑃𝑃(𝐴𝐴|𝐵𝐵,𝐶𝐶)=𝑃𝑃(𝐵𝐵|𝐴𝐴,𝐶𝐶)·𝑃𝑃(𝐵𝐵|𝐶𝐶) 3. L’esperança condicionada té un lligam fort amb la probabilitat condicionada amb un aplec de dades binàries. L’esperança condicionada quantifica què hom espera que passi tot havent condicionat que uns fets s’esdevinguin abans. Amb dades binàries, la mitjana és la proporció d’us. �𝑦𝑦 𝑡𝑡𝑐𝑐𝑛𝑛𝑡𝑡í𝑛𝑛𝑣𝑣𝑡𝑡[1]⟹𝐸𝐸�𝑌𝑌�𝑇𝑇[2]�=∫𝑦𝑦 𝑦𝑦·𝑃𝑃(𝑌𝑌=𝑦𝑦|𝑇𝑇) 𝑣𝑣𝑛𝑛 𝑡𝑡𝑣𝑣𝑡𝑡𝑐𝑐𝑣𝑣𝑠𝑠 𝑣𝑣𝑠𝑠𝑡𝑡𝑡𝑡𝑑𝑑í𝑠𝑠𝑡𝑡𝑒𝑒𝑡𝑡𝑠𝑠 𝑒𝑒 𝑐𝑐𝑛𝑛 𝑦𝑦 𝑡𝑡𝑣𝑣𝑡𝑡𝑐𝑐𝑡𝑡𝑡𝑡𝑣𝑣 𝑝𝑝𝑣𝑣𝑡𝑡 𝑡𝑡𝑐𝑐𝑡𝑡𝑠𝑠 𝑣𝑣𝑙𝑙𝑠𝑠 𝑠𝑠𝑣𝑣𝑣𝑣𝑠𝑠 𝑝𝑝𝑐𝑐𝑠𝑠𝑠𝑠𝑒𝑒𝑎𝑎𝑙𝑙𝑣𝑣𝑠𝑠 𝑣𝑣𝑡𝑡𝑙𝑙𝑐𝑐𝑡𝑡𝑠𝑠 𝑦𝑦 𝑣𝑣𝑛𝑛𝑡𝑡𝑣𝑣𝑡𝑡𝑡𝑡⟹ 𝐸𝐸(𝑌𝑌|𝑇𝑇)=∑𝑦𝑦 𝑦𝑦·𝑃𝑃(𝑌𝑌|𝑇𝑇) 𝑦𝑦 𝑎𝑎𝑒𝑒𝑛𝑛à𝑡𝑡𝑒𝑒𝑡𝑡⟹ 𝐸𝐸(𝑌𝑌= 1|𝑇𝑇)=∑(𝑦𝑦= 1) 𝑦𝑦=1 ·𝑃𝑃(𝑌𝑌= 1|𝑇𝑇)=𝑃𝑃(𝑌𝑌= 1|𝑇𝑇) [1]aquí és una densitat de probabilitat més que no pas una funció de massa de probabilitat [2]l’aplec de dades condicionants pot esser més llarg 𝐸𝐸(𝑌𝑌|𝑇𝑇,𝐻𝐻)=∑𝑦𝑦 𝑦𝑦·𝑃𝑃(𝑌𝑌=𝑦𝑦|𝑇𝑇,𝐻𝐻) Ob: l’esperança condicionada és un operador lineal (cosa que permet treure de l’esperança qualsevol funció de T, a(·) i b(·) , per exemple 𝑡𝑡(𝑇𝑇)=𝛼𝛼0+𝛼𝛼1𝑇𝑇+ 𝛼𝛼2𝑇𝑇2,𝑐𝑐𝑛𝑛 𝛼𝛼0 é𝑠𝑠 𝑣𝑣𝑛𝑛𝑡𝑡 𝑡𝑡𝑐𝑐𝑛𝑛𝑠𝑠𝑡𝑡𝑡𝑡𝑛𝑛𝑡𝑡): 𝐸𝐸(𝑡𝑡(𝑇𝑇)𝑌𝑌1+𝑎𝑎(𝑇𝑇)𝑌𝑌2|𝑇𝑇)= 𝑡𝑡(𝑇𝑇)𝐸𝐸(𝑌𝑌1|𝑇𝑇) + 𝑎𝑎(𝑇𝑇)𝐸𝐸(𝑌𝑌2|𝑇𝑇) 4. Llei de l’esperança total o també anomenat teorema de la doble esperança
64 Quan el Risc Relatiu i el Risc Relatiu Secundari canvien alhora en la mateixa direcció (per exemple, s’acreixen) des d’un estràtum del modificador a un altre 𝒊𝒊𝒊𝒊𝒊𝒊𝒐𝒐𝒉𝒉𝒕𝒕𝒆𝒆 � � � � � � també ho ha de fer el Risc de la Diferència i l’Odds Ràtio. 25. Les tres més importantes mesures causals són: i) El Risc de la Diferència (RD) perquè es correspon al Nombre que Cal Tractar (NCT) ii) El risc relatiu (RR) perquè es correspon a la Probabilitat de Necessitat (PN) iii) El risc relatiu secundari (RR*) perquè es correspon a la Probabilitat de suficiència (PS) Si el risc relatiu i el risc relatiu secundari són més forts dins d’un estràtum del modificador que no l’altre 𝒊𝒊𝒊𝒊𝒊𝒊𝒐𝒐𝒉𝒉𝒕𝒕𝒆𝒆 � � � � � � totes tres mesures causals són més fortes dins d’aquest estràtum. 26. La interacció causal: aquest concepte és diferent d’interacció estadística, aquesta darrera té a veure amb el fet si un efecte causal difereix entre els nivells d’un efectemodificador; en canvi, amb la interacció causal hom es fixa en dues causes i veure’n si aquestes dues sinergitzen o antagonitzen.
65 VI. ANNEX 2: APROFUNDIMENT (sobretot en termes de Grafs Acíclics Dirigits) 1. Història que hi ha rere les dades: de la paradoxa de Simpson hom n’ha après que certes decisions no poden pas esser preses sols únicament sobre la base d’unes dades, sinó que una presa de decisió també depèn <de la història sotsjacent a les mateixes dades>. Hom arranja un llenguatge matemàtic, teoria de grafs, en què aquestes històries poden esser ‘traduïdes’. La teoria de grafs ens forneix d’un llenguatge matemàtic útil que permet d’afaiçonar problemes de causalitat amb senzilles operacions semblantes a aquelles que hom fa servir per tal de resoldre problemes aritmètics. 2. Grafs (també anomenat Model Causal Gràfic o Model Gràfic o senzillament Graf): encara que en un registre col·loquial ‘graf’ sigui referit a un aplec d’ajuts visuals, en matemàtiques, un graf és un objecte formalment ben definit: una col·lecció de vèrtexs (o nodes) i arestes. Els nodes a un graf són connectats (o no) per arestes. Graf non-dirigit: quan els nodes X i Y són adjacents i els nodes Y i Z també en són, però no pas entre X i Z: 3. Nodes adjacents: dos nodes són adjacents si hi ha cap aresta entre tots dos 4. Graf complet: un graf és complet si hi ha una aresta per cada parell de nodes al graf 5. Camí: un camí entre dos nodes X i Y és una seqüència de nodes començant per X i acabant per Y, en què cada node és connectat al següent per una aresta. Al graf_1, per exemple, hi ha un camí de X a Z perquè X és connectat a Y i ensems Y és connectat a Z. 6. Dirigit/Non-dirigit: un graf en què totes les arestes són dirigides és un graf dirigit; el graf_2 dessota: A és una aresta dirigida d’X a Y i B és una aresta dirigida d’Y a Z. 7. Node pare: el node d’on comença una aresta dirigida és pare del node en què l’aresta hi va cap dins. Al graf_2, el node X és el pare del node Y, i el node Y és el pare del node Z.
66 8. Node fill: inversament al node pare, el node on hi entra l’aresta dirigida és el fill del node d’on prové l’aresta. Al mateix graf_2, d’acord amb la definició, el node Y és el fill del node X, i el node Z és el fill del node Y. 9. Camí/graf dirigit: un camí entre dos nodes és un camí dirigit si pot esser traçat per mitjà d’una única sageta, és a dir: si cap node del camí no té dues (o més d’) arestes en el camí dirigit cap endins al mateix node si cap node del camí no té dues (o més d’) arestes en el camí dirigit cap enfora del mateix node 10. Avantpassat: si dos nodes són connectats per un camí dirigit, aleshores el primer node és l’avantpassat de cada node al llarg del camí. Al graf_2, el node X és l’avantpassat de tots dos Y i Z. 11. Descendent: si dos nodes són connectats per un camí dirigit, aleshores cada node del camí és el descendent del primer node. Al graf_2, els nodes Y i Z són descendents d’X. 12. Camí/graf cíclic: un camí és cíclic quan un camí dirigit va d’un node cap a ell mateix. 13. Camí/graf acíclic: un camí dirigit sense cicles, per exemple, el graf_3(a) és acíclic: no hi n’ha cap camí dirigit de cap node a si mateix; tanmateix el graf_3(b) és cíclic: hi han camins dirigits que surten del node X i retornen cap al node X. 14. Causació: una variable X és una causa directa d’una variable Y si X apareix dins de la funció que assigna el valor d’Y. X és una causa d’Y si X és una causa directa (o d’una causa qualsevol) d’Y. 15. Variables exògenes: les variables dins d’U són exògenes, externes al model (no importa per quina raó com han estat aquestes causades, hom ho assumeix). 16. Variables endògenes: les variables dins de W són endògenes, cadascuna de les quals: no pot esser descendent de cap altra variable, concretament de cap endògena no pot tenir cap avantpassat és representada com a node al graf
67 Per exemple, hom vol saber el lligam causal entre un tractament X i la funció pulmonar Y per a pacients amb asma. S’assumeix que Y també [depèn de/ és causat per] els nivells de pol·lució mesurats per una variable Z: X i Y són endògenes i Z exògena (la pol·lució a l’aire és un factor extern perquè no pot esser causat per un tractament individual o per la seva funció pulmonar). 17. Graf (ampliació de la definició susdita): cada model d’estructura causal és associat a un model de gràfic causal (o model gràfic o senzillament graf), el qual consisteix en: un conjunt de nodes que representen les variables d’U i W, i un conjunt d’arestes entre els nodes que representen les funcions a f. Per exemple, el graf G per a un model d’estructura causal, M conté un node per a cada variable dins M; si a dins M, la funció 𝐷𝐷𝑋𝑋 per a la variable X conté a dins seu la variable Y, altrament dit, si X depèn d’Y per prendre el seu valor, aleshores al graf G hi haurà una aresta dirigida d’Y a X. 18. Causació (a causa del lligam entre el model i el graf, emergeix una definició gràfica de causació definició complementària de la pàg.2 i 16): o si, a dins d’un graf, una variable X és la filla d’una altra variable Y, aleshores Y és una causa directa d’X; o si X és un descendent d’Y, aleshores Y és una causa potencial d’X (no hi han gaires casos intransitius en què Y no serà causa d’X) 1r avantatge: però els grafs forneixen d’una comprensió de la causalitat més intuïtiva que no pas els models parcialment especificats. Si es considera un model i el seu graf associat de l’exemple del graf_4: malgrat que el model i el seu graf contenen la mateixa informació (X causa Z i Y causa Z), aquesta informació és més fàcilment i ràpid copsable sols fent un cop d’ull al graf. 2n avantatge: els grafs respecte els models permeten expressar les distribucions conjuntes molt eficientament; fins ara, les distribucions conjuntes han estat presentades de dues maneres: Fent servir taules, on s’assigna una probabilitat a cada possible combinació de valors; cosa que és senzill d’analitzar, però en models amb moltes de variables pot prendre moltíssim d’espai (10 variables binàries suposen una taula de 1024 files). En un model d’estructura causal del tot especificat, hom pot representar les distribucions conjuntes d’n variables amb més gran eficiència per mitjà de la regla de la descomposició pel producte. 19. Regla de la descomposició pel producte: per a qualsevol model el graf del qual sigui acíclic, la distribució conjunta de les variables dins del model és donat pel producte de les distribucions condicionals P(fill | pares) sobre totes les ‘famílies’ dins del graf. Formalment, hom escriu aquesta regla com: 𝑃𝑃(𝑚𝑚1,𝑚𝑚2, … , 𝑚𝑚𝑖𝑖)=∏𝑃𝑃(𝑚𝑚𝑖𝑖|𝑝𝑝𝑡𝑡𝑖𝑖) 𝑖𝑖 on 𝑝𝑝𝑡𝑡𝑖𝑖 hi és per als valors dels pares de la variable 𝑋𝑋𝑖𝑖, i el Π𝑒𝑒 recorre totes les i, d’1 a n.
68 20. Cadenes i forques Hom s’ha referit als models causals com a representacions de la “història causal” sotsjacent a les dades. Una altra manera de veure-ho és que els models causals representen el mecanisme per mitjà del qual les dades són generades. Els models causals són una mena de plànol de les parts rellevants de l’univers, i hom pot fer-lo servir a fi de simular dades d’aquest univers. 21. Cadena: la configuració de variables estructurada com a tres nodes i dues arestes, amb una aresta dirigida cap endins i amb una aresta dirigida cap enfora d’una mateixa variable mitjana (medial). 22. Regla_1 (independència condicional en cadenes): en qualsevol graf, donades dues variables X i Y, si l’únic camí entre X i Y és compost sols per cadenes, aleshores X i Y són independentes si es condicionen en qualsevol variable intermèdia d’aquest camí. 23. Forca (fork): aquesta configuració de variables – tres nodes, amb totes dues arestes dirigides sortint d’una variable mitjana. La variable mitjana o del mig a una forca és la causa comuna de les altres dues variables. 24. Regla_2 (independència condicional en forques): si dues variables comparteixen una causa comuna i si aquesta causa comuna pertany a l’únic camí entre elles, aleshores, aquestes dependències i independències condicionades són veritables per a aquestes variables si una variable X és una causa comuna de les variables Y i Z, i hi ha sols un únic camí entre Y i Z, llavors Y i Z són variables independentes condicionant en X. 25. Col·lididor (collider): fins ara hem examinat dues senzilles configuracions d’arestes i nodes que poden esdevenir-se a un camí entre dues variables: cadenes i forques. Hi ha una tercera configuració que conté un node col·lididor, i aquest s’esdevé quan un node rep arestes de dos altres nodes. El graf més senzill que contingui un node col·lididor representant un efecte comú, Z, de dues causes X i Y és el graf_C. Com és el cas amb cada graf, tots els models que tinguin el graf_C comparteixen un aplec de dependències i independències que hom pot determinar partint sols del mateix graf_C –tot assumint la independència de 𝑈𝑈𝑋𝑋,𝑈𝑈𝑌𝑌 𝑒𝑒 𝑈𝑈𝑍𝑍– aquestes (in)dependències són: Graf_C X Y A Z 𝑈𝑈 𝑋𝑋 𝑈𝑈 𝑍𝑍 𝑈𝑈 𝑌𝑌
69 1. X i Z són variables dependentes per un {x,z}, P(X=x|Z=z)≠P(X=x) 2. Y i Z són variables dependentes per un {y,z}, P(Y=y|Z=z)≠P(Y=y) 3. X i Y són variables independentes per tots {x,y}, P(X=x|Y=y) = P(X=x) 4. X i Y són variables dependentes tot condicionant en Z per un {x,y,z}, P(X=x |Y=y, Z=z) ≠P(X=X|Z=z) 26. Regla_3 (independència condicional en col·lididors): si una variable Z és el node de col·lisió entre dues variables X i Y, i sols hi ha un únic camí entre X i Y, aleshores X i Y són incondicionalment independentes però són dependentes condicionant en Z i en qualsevol dels descendents de Z. La regla_3 és pregonament importanta per a l’estudi de la causalitat, perquè permet de testar si un model causal podria haver estat generat per un aplec de dades, permet de descobrir models partint de les dades, permet de resoldre del tot la paradoxa de Simpson tot determinant quines variables cal mesurar i com estimar els efectes causals amb soroll o sota confusió (per què generen confusió a molta de gent el fet que les dependències associades amb condicionament en un col·lididor com és el cas de Monty Hall? Perquè s’inclina a associar dependència a causació, és a dir, s’assumeix erròniament que la dependència estadística entre dues variables pot sols existir si hi ha un mecanisme causal que generi tal semblanta dependència, és a dir: o bé una de les variables causa l’altra (cadena o pont) o bé una tercera causa totes dues (forca) o bé el cas d’un col·lididor, hom se sorprèn de trobar una dependència que és creada per una tercera via, violant d’aquesta manera l’assumpció que no hi ha correlació sense causació). 27. d-separat/d-connectat: aquest procés o kriterion és bastit sobre les tres regles susdites; d-separació (la ‘d’ és per ‘direccional’) permet de determinar, per cada parell de nodes, si els nodes són o bé d-connectats, hi ha un camí connectant-los, bé dseparats, no n’hi ha cap, de camí, entre ells. 28. Dos nodes d-separats: les variables que representen aquests nodes són d’una manera definitiva independentes. Dos nodes X i Y són d-separats si cada camí entre tots dos (si n’hi ha cap) és blocat, tots. Els camins entre variables poden esser entesos com a canonades i l’aigua que flueix per mitjà d’ells com la dependència: si cap dels dos extrems d’una canonada és blocat l’aigua no hi flueix, amb això hom entén que amb un únic node es bloca el passatge de dependència del camí sencer. 29. Dos nodes d-connectats: les variables que representen aquests nodes són molt probablement dependentes les variables d-connectades són dependentes per a
70 gairebé tot aplec de funcions assignat a camins dirigits (sageta) dins del graf, en són l’excepció els casos intransitius abans explicats. Dos nodes X i Y són d-connectats si com a mínim hi ha un camí entre tots dos (si n’hi ha cap) que sigui desblocat, sols que n’hi hagi un. Seguint l’analogia de l’aigua, la dependència és com l’aigua, si tan sols una única canonada és desblocada, l’aigua s’hi esmuny, d’un lloc a l’altre, i si un únic camí és net, les variables a tots dos extrems són dependentes. 30. Assajant el model i cerca causal Fins ara hom ha demostrat que els models causals tenen implicacions analitzables en aplecs de dades que els mateixos models generen. Hi han diversos mètodes per a saber el grau de justesa d’un model: �1.𝑝𝑝𝑣𝑣𝑡𝑡 𝑐𝑐𝑒𝑒𝑡𝑡𝑚𝑚à 𝑑𝑑𝑣𝑣 𝑙𝑙𝑡𝑡 𝑡𝑡𝑣𝑣𝑙𝑙𝑡𝑡𝑣𝑣𝑠𝑠𝑠𝑠𝑒𝑒ó 2.𝑠𝑠𝑐𝑐𝑡𝑡𝑐𝑐𝑣𝑣𝑡𝑡𝑡𝑡𝑣𝑣 𝑡𝑡 𝑡𝑡𝑣𝑣𝑠𝑠𝑡𝑡 𝑡𝑡𝑐𝑐𝑡𝑡 𝑣𝑣𝑙𝑙 𝑐𝑐𝑐𝑐𝑑𝑑𝑣𝑣𝑙𝑙 𝑝𝑝𝑣𝑣𝑡𝑡 𝑐𝑐𝑒𝑒𝑡𝑡𝑚𝑚à 𝑑𝑑’ℎ𝑒𝑒𝑝𝑝ò𝑡𝑡𝑣𝑣𝑠𝑠𝑒𝑒𝑠𝑠 𝑣𝑣𝑠𝑠𝑡𝑡𝑡𝑡𝑑𝑑í𝑠𝑠𝑡𝑡𝑒𝑒𝑠𝑠𝑣𝑣𝑣𝑣𝑠𝑠 3. 𝑑𝑑−𝑠𝑠𝑣𝑣𝑝𝑝𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑡𝑒𝑒ó 4.𝑑𝑑’𝑡𝑡𝑙𝑙𝑡𝑡𝑡𝑡𝑣𝑣𝑠𝑠 𝑐𝑐è𝑡𝑡𝑐𝑐𝑑𝑑𝑣𝑣𝑠𝑠 𝑑𝑑𝑣𝑣 𝑡𝑡𝑣𝑣𝑡𝑡𝑡𝑡𝑡𝑡 𝑡𝑡𝑡𝑡𝑣𝑣𝑠𝑠𝑡𝑡𝑙𝑙 1.per mitjà de la regressió: hom pot demostrar el grau de justesa en el model causal del graf_10; enmig de moltes d’independències condicionals explicitades pel model, hom troba que Z1 i W són independentes condicionant en X (una cadena és blocada si es condiciona en el seu node mitjà, en aquest cas X) perquè X d-separa W de Z1. Ara se suposa que hom fa la regressió de W en X i Z1 (predir W tot basant-nos en els valors d’X i Z1), és a dir, trobar la línia 𝑓𝑓=𝑡𝑡𝑋𝑋·𝑚𝑚+𝑡𝑡𝑍𝑍1·𝑎𝑎1 que millor ajusti les dades. Si acaba amb el resultat que 𝑡𝑡𝑍𝑍1 no és igual a zero, hom sap que W depèn de Z1 tot condicionant en X i, conseqüentment, que el model (gràfic) és erroni. [Recordatori: correlació condicional [implica] dependència condicional ]. 2. sotmetre a test tot el model per mitjà d’hipòtesis estadístiques: la manera estàndard d’avaluar la justesa d’un model comporta hipòtesis estadístiques per a testar tot el model, això és, avaluar com n’és de probable per a mostres observades d’haver estat generades per l’hipotetitzat model, en oposició amb un pur atzar. Tanmateix, atès que el model no és plenament especificat, cal primer estimar els seus paràmetres abans d’avaluar-ne la probabilitat. 3.d-separació: aquest mètode té més d’avantatges amb relació al test global. Primer, és non-paramètric, cosa que vol dir que no depèn de funcions específiques que connectin variables; enlloc d’això, fa servir sols el graf del model en qüestió. Segon, testa el model localment, més que no pas globalment. Això permet d’identificar àrees específiques, on el model hipotetitzat és espatllat, i per reparar-los, més que no pas començar del no-res a partir d’un model del tot nou. 4.hi han d’altres mètodes de cerca causal, també de testació global d’un model (Pearl 2000)
71 31. Intervencions Un dels darrers objectius en estudis estadístics és predir els efectes de les intervencions. Do-operador: en notació, hom distingeix entre els casos on una variable X pren un valor x de forma natural i casos en què hom fixa X=x tot denotant aquesta darrera do(X=x). Per tant, P(Y=y|X=x) és la probabilitat que Y=y tot condicionant en trobar X=x (senzillament s’agafa una submostra) P(Y=y| do(X=x)) és la probabilitat que Y=y quan s’intervé per fer X=x (com si tota la mostra prengués el valor X=x) En la terminologia distribucional, P(Y=y|X=x) reflecteix la distribució de la població d’Y entre els individus, el valor d’X dels quals és x P(Y=y| do(X=x)) representa la distribució de la població d’Y si tothom dins de la populació té el valor de la seva X fixada a x. De forma semblant, hom escriu P(Y=y| do(X=x), Z=z) per a denotar la probabilitat condicional d’Y=y, donat Z=z, dins la creada distribució per la intervenció do(X=x). Fent servir les do-expressions i cirurgia de grafs, hom pot començar a deslligar les relacions causals de les correlatives. 32. Diferència Efecte Causal o altrament dit Efecte Causal Mitjà (ECM): ==>denotant la primera intervenció per do(X=1) i ==>la segona per do(X=0) La tasca és estimar la diferència: P(Y=1| do(X=1)) – P(Y=1| do(X=0)) 33. En general, tanmateix, si X i Y poden cadascuna començar a prendre més d’un valor, hom desitjaria predir l’Efecte Causal General P(Y=y| do(X=x)), on x i y són dos valors qualssevol que X i Y poden començar a prendre. Per exemple, x podria esser el dosatge de la droga i y la pressió sanguínia del pacient. 34. Fórmula d’ajustament: ∑𝑃𝑃 𝑧𝑧(𝑌𝑌=𝑦𝑦|𝑋𝑋=𝑚𝑚,𝑍𝑍=𝑎𝑎)·𝑃𝑃(𝑍𝑍=𝑎𝑎) computa l’associació entre X i Y per a cada valor de Z, aleshores fa la mitjana per sobre d’aquells valors. Aquest procediment és anomenat com ‘ajustant per Z’ o també ‘controlant per Z’. L’expressió final pot esser estimada directament partint de les dades, atès que sols consisteix en probabilitats condicionades, cadascuna de les quals pot esser computada pel procediment de filtratge susdit. 35. Diferència Efecte Causal o altrament dit Efecte Causal Mitjà (ECM) és la diferència entre {la fracció de la població que es refà de la malaltia si tothom pren el fàrmac} i {la fracció de la població que es refà de la malaltia si ningú no pren el fàrmac}. Quina variable o aplec de variables Z poden legítimament esser incloses dins la fórmula d’ajustament? El procediment d’intervenció, el qual mena cap a la fórmula d’ajustament, dicta que Z hauria de coincidir amb els pares d’X, perquè és la influència d’aquests
72 pares que es neutralitza quan hom fixa X per mitjà d’una manipulació externa. Denotant els pares d’X per PA(X), hom pot per tant escriure una fórmula d’ajustament general i resumir-la com a regla: 36. Regla_4 (la regla de l’efecte causal): donat un graf G en què un aplec de variables PA són designades com a pares d’X, l’efecte causal d’X en Y és donat per la fórmula dessota, la qual explícitament exhibeix el rol jugat pels pares d’X en predir els resultats de les intervencions (el factor 𝑃𝑃(𝑋𝑋=𝑚𝑚|𝑃𝑃𝐴𝐴=𝑎𝑎) és conegut com a ‘puntuació de propensió’). 𝑃𝑃(𝑌𝑌=𝑦𝑦| 𝑑𝑑𝑐𝑐(𝑋𝑋=𝑚𝑚))=�𝑃𝑃 𝑧𝑧(𝑌𝑌=𝑦𝑦|𝑋𝑋=𝑚𝑚,𝑃𝑃𝐴𝐴=𝑎𝑎)·𝑃𝑃(𝑃𝑃𝐴𝐴=𝑎𝑎) =�𝑃𝑃 𝑧𝑧(𝑌𝑌=𝑦𝑦|𝑋𝑋=𝑚𝑚,𝑃𝑃𝐴𝐴=𝑎𝑎)·𝑃𝑃(𝑃𝑃𝐴𝐴=𝑎𝑎)·𝑃𝑃(𝑋𝑋=𝑚𝑚|𝑃𝑃𝐴𝐴=𝑎𝑎) 𝑃𝑃(𝑋𝑋=𝑚𝑚|𝑃𝑃𝐴𝐴=𝑎𝑎) = �𝑃𝑃(𝑋𝑋=𝑚𝑚,𝑌𝑌=𝑦𝑦,𝑃𝑃𝐴𝐴=𝑎𝑎) 𝑃𝑃(𝑋𝑋=𝑚𝑚|𝑃𝑃𝐴𝐴=𝑎𝑎) 𝑧𝑧 37. El kriterion de rere-porta Donat un parell de variables (X,Y) ordenat dins d’un graf acíclic directe G, un aplec de variables Z satisfà el kriteri de rere-porta relatiu a (X,Y) si: cap node dins Z és un descendent d’X i Z bloca cada camí entre X i Y que contingui un camí dirigit o aresta (segeta) cap a X. Formalitzat a la manera d’Anne Brumback: {𝑌𝑌(𝑡𝑡)}𝑙𝑙∈𝐴𝐴∐𝑋𝑋|𝑍𝑍 Si un aplec de variables Z satisfà el kriteri de rere-porta per a X i Y, llavors l’efecte causal d’X en Y és donat per la fórmula: 𝑃𝑃(𝑌𝑌=𝑦𝑦| 𝑑𝑑𝑐𝑐(𝑋𝑋=𝑚𝑚)) = 𝑃𝑃(𝑌𝑌=𝑦𝑦|𝑋𝑋=𝑚𝑚,𝑍𝑍=𝑎𝑎)· 𝑃𝑃(𝑍𝑍=𝑎𝑎) just com quan hom ajusta per PA(X), el qual sempre satisfà el kriterion de rere-porta. La lògica que hi ha darrere del kriterion de rere-porta és directe; en general, es vol condicionar en un aplec de nodes Z tals que compleixin aquestes tres requestes: 1. Hom bloca tots els camis espuris o falsos entre X i Y (quan no hi ha cap camí causal entre X i Y, el graf reflecteix les variables-nodes sense unir-les amb cap aresta) 2. Hom deixa tots els camins dirigits d’X a Y impertorbables 3. Hom no crea cap nou camí espuri 38. El kriterion d’avant-porta Un aplec de variables Z satisfà el kriterion d’avant-porta amb relació a un parell ordenat de variables (X,Y): 1. Si Z intercepta tots els camins directes d’X a Y 2. Si no hi ha cap camí desblocat/obert d’X a Z
73 3. Tots els camins de rere-porta de Z a Y són blocats per X Aquesta definició és massa conservadora, qualque camí de rere-porta exclòs per la segona o tercera condició pot, de fet, esser permès tot establint que sigui blocat per una altra variable. 39. Do-càlcul: hi ha una potenta maquinària simbòlica que permet anàlisis d’unes tals estructures complexes. De fet, el do-càlcul descobreix tots els efectes causals que puguin esser identificats a partir d’un graf donat. Aquí, hom tracta sols la combinació de la fórmula d’ajustament, el kriterion de rere-porta i el kriterion d’avant-porta que tots tres ja abasten un gran ventall d’escenaris. Cosa que prova el poder que tenen els grafs causals no sols per a representar sinó també per a descobrir informació causal.
80 EY0.0 <- mean(dat0$Y[dat0$M == 0]) EY0.1 <- mean(dat0$Y[dat0$M == 1]) EY1.0 <- mean(dat1$Y[dat1$M == 0]) EY1.1 <- mean(dat1$Y[dat1$M == 1]) # estimate the effect measures RD.0 <- EY1.0 - EY0.0 RD.1 <- EY1.1 - EY0.1 logRR.0 <- log(EY1.0 / EY0.0) logRR.1 <- log(EY1.1 / EY0.1) logRRstar.0 <- log((1 - EY0.0) / (1 - EY1.0)) logRRstar.1 <- log((1 - EY0.1) / (1 - EY1.1)) logOR.0 <- logRR.0 + logRRstar.0 logOR.1 <- logRR.1 + logRRstar.1 EY0diff <- EY0.1 - EY0.0 EY1diff <- EY1.1 - EY1.0 RDdiff <- RD.1 - RD.0 logRRdiff <- logRR.1 - logRR.0 logRRstardiff <- logRRstar.1 - logRRstar.0 logORdiff <- logOR.1 - logOR.0 # return all of the estimates c( EY0.0, EY0.1, EY0diff, EY1.0, EY1.1, EY1diff, RD.0, RD.1, RDdiff, logRR.0, logRR.1, logRRdiff, logRRstar.0, logRRstar.1, logRRstardiff, logOR.0, logOR.1, logORdiff ) } boot.r <- function ()
81 { # estimate bootstrap confidence intervals and return the point estimates EM.out <- boot(data = data_ids,statistic = bootinside.r,R = 1000) EM.est <- summary(EM.out)$original EM.expest <- exp(EM.est) EM.SE <- summary(EM.out)$bootSE EM.lci <- EM.est - 1.96 * EM.SE EM.explci <- exp(EM.lci) EM.uci <- EM.est + 1.96 * EM.SE EM.expuci <- exp(EM.uci) EM.est <- data.frame(EM.est) EM.expest <- data.frame(EM.expest) EM.lci <- data.frame(EM.lci) EM.explci <- data.frame(EM.explci) EM.uci <- data.frame(EM.uci) EM.expuci <- data.frame(EM.expuci) dimnames(EM.est)[[1]] <- c( "EY0.0", "EY0.1", "EY0diff", "EY1.0", "EY1.1", "EY1diff", "RD.0", "RD.1", "RDdiff", "logRR.0", "logRR.1", "logRRdiff", "logRRstar.0", "logRRstar.1", "logRRstardiff", "logOR.0", "logOR.1", "logORdiff" ) dimnames(EM.expest)[[1]] <- c( "EY0.0", "EY0.1", "EY0diff", "EY1.0", "EY1.1",
82 "EY1diff", "RD.0", "RD.1", "RDdiff", "logRR.0", "logRR.1", "logRRdiff", "logRRstar.0", "logRRstar.1", "logRRstardiff", "logOR.0", "logOR.1", "logORdiff" ) dimnames(EM.lci)[[1]] <- c( "EY0.0", "EY0.1", "EY0diff", "EY1.0", "EY1.1", "EY1diff", "RD.0", "RD.1", "RDdiff", "logRR.0", "logRR.1", "logRRdiff", "logRRstar.0", "logRRstar.1", "logRRstardiff", "logOR.0", "logOR.1", "logORdiff" ) dimnames(EM.explci)[[1]] <- c( "EY0.0", "EY0.1", "EY0diff", "EY1.0", "EY1.1", "EY1diff", "RD.0",
83 "RD.1", "RDdiff", "logRR.0", "logRR.1", "logRRdiff", "logRRstar.0", "logRRstar.1", "logRRstardiff", "logOR.0", "logOR.1", "logORdiff" ) dimnames(EM.uci)[[1]] <- c( "EY0.0", "EY0.1", "EY0diff", "EY1.0", "EY1.1", "EY1diff", "RD.0", "RD.1", "RDdiff", "logRR.0", "logRR.1", "logRRdiff", "logRRstar.0", "logRRstar.1", "logRRstardiff", "logOR.0", "logOR.1", "logORdiff" ) dimnames(EM.expuci)[[1]] <- c( "EY0.0", "EY0.1", "EY0diff", "EY1.0", "EY1.1", "EY1diff", "RD.0", "RD.1", "RDdiff",
84 "logRR.0", "logRR.1", "logRRdiff", "logRRstar.0", "logRRstar.1", "logRRstardiff", "logOR.0", "logOR.1", "logORdiff" ) list( EM.est = EM.est, EM.expest = EM.expest, EM.lci = EM.lci, EM.explci = EM.explci, EM.uci = EM.uci, EM.expuci = EM.expuci ) } data.out <- boot.r() data.out <- data.frame(data.out) data.out$term <- row.names(data.out) group = c("M0", "M1","diff", "M0", "M1","diff", "M0", "M1","diff", "M0", "M1", "diff","M0", "M1", "diff", "M0", "M1", "diff") data.out$group <- group data.out ``` Hom computa β_3 que no és estadísticament significatiu coef(summary(beta3 <- glm(formula = Y ~ T+M+T*M, data=data_ids, family="binomial")) ) exp(beta3$coefficients[4]) Una taula de resultats semblants a la prèvia però amb menys de codi library(fciR) set.seed(333) the_terms <- c( "EYT0.M0", "EYT0.M1", "EYT0.diff", "EYT1.M0", "EYT1.M1", "EYT1.diff", "RD.M0", "RD.M1", "RD.diff", "RR.M0", "RR.M1", "RR.diff", "RR*.M0", "RR*.M1", "RR*.diff", "OR.diff", "OR.M0", "OR.M1") data.out1 <- boot_est(data=data_ids, func=meas_effect_modif, times=100, alpha=0.05,terms = the_terms, trans="exp", formula = Y ~ T + M, exposure.name =
85 "T",modifier.name = "M") data.out1 1. Grau de concordança o de desacord de les mesures en l’efecte-modificador via simulacre Sense constricció amb Beta(1,1) que equival a una Uniforme(0,1) knitr::opts_chunk$set(echo = T,results = "hide") set.seed(333) is_rerun <- TRUE gridsim <- xfun::cache_rds({ fciR::mc_beta_effect_measures(shape1 = 1, shape2 = 1, nrep = 5000) }, file = "data_ids", rerun= is_rerun) unlist(gridsim) totes les cel·les sumen 1 c("simulation" = sum(unlist(gridsim))) set.seed(333) is_rerun <- TRUE gridsim_const <- xfun::cache_rds({ fciR::mc_beta_effect_measures(shape1 = 1, shape2 = 1, nrep = 5000, constrained = TRUE) }, file = "data_ids", rerun= is_rerun) unlist(gridsim_const) totes les cel·les sumen 1 c("simulation" = sum(unlist(gridsim))) Codi original simplificat i adaptat a aquest estudi observacional library(ggvenn) pre_venn <- function(data, n = 1000, fill_colr = c("blue", "yellow", "green", "red"), title = "Venn diagram of effect measure modifications") { the_events <- c("RD_RR", "RD_RRstar", "RD_OR", "RR_RRstar", "RR_OR", "RRstar_OR", "RD_RR_RRstar", "RD_RR_OR", "RD_RRstar_OR", "RR_RRstar_OR", "RD_RR_RRstar_OR") dfs <- vector(mode = "list", length = length(the_events)) names(dfs) <- the_events dfs <- list() id <- "RD_RR" nreps <- data[[id]] * n df <- data.frame("RD" = T, "RR" = T, "RRstar" = F, "OR" = F) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RD_RRstar"
86 nreps <- data[[id]] * n df <- data.frame("RD" = T, "RR" = F, "RRstar" = T, "OR" = F) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RD_OR" nreps <- data[[id]] * n df <- data.frame("RD" = T, "RR" = F, "RRstar" = F, "OR" = T) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RR_RRstar" nreps <- data[[id]] * n df <- data.frame("RD" = F, "RR" = T, "RRstar" = T, "OR" = F) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RR_OR" nreps <- data[[id]] * n df <- data.frame("RD" = F, "RR" = T, "RRstar" = F, "OR" = T) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RRstar_OR" nreps <- data[[id]] * n df <- data.frame("RD" = F, "RR" = F, "RRstar" = T, "OR" = T) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RD_RR_vs_RRstar_OR" nreps <- data[[id]] * n * 0.5 df <- data.frame("RD" = T, "RR" = T, "RRstar" = F, "OR" = F) dfs[["RD_RR_vs_RRstar_OR_1"]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) df <- data.frame("RD" = F, "RR" = F, "RRstar" = T, "OR" = T) dfs[["RD_RR_vs_RRstar_OR_2"]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RD_RRstar_vs_RR_OR" nreps <- data[[id]] * n * 0.5 df <- data.frame("RD" = T, "RR" = F, "RRstar" = T, "OR" = F) dfs[["RD_RRstar_vs_RR_OR_1"]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) df <- data.frame("RD" = F, "RR" = T, "RRstar" = F, "OR" = T) dfs[["RD_RRstar_vs_RR_OR_2"]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RD_OR_vs_RR_RRstar" p <- data[[id]] nreps <- data[[id]] * n * 0.5
87 df <- data.frame("RD" = T, "RR" = F, "RRstar" = F, "OR" = T) dfs[["RD_OR_vs_RR_RRstar_1"]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) df <- data.frame("RD" = F, "RR" = T, "RRstar" = T, "OR" = F) dfs[["RD_OR_vs_RR_RRstar_2"]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RD_RR_RRstar" nreps <- data[[id]] * n df <- data.frame("RD" = T, "RR" = T, "RRstar" = T, "OR" = F) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RD_RR_OR" nreps <- data[[id]] * n df <- data.frame("RD" = T, "RR" = T, "RRstar" = F, "OR" = T) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RD_RRstar_OR" nreps <- data[[id]] * n df <- data.frame("RD" = T, "RR" = F, "RRstar" = T, "OR" = T) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RR_RRstar_OR" nreps <- data[[id]] * n df <- data.frame("RD" = F, "RR" = T, "RRstar" = T, "OR" = T) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) id <- "RD_RR_RRstar_OR" nreps <- data[[id]] * n df <- data.frame("RD" = T, "RR" = T, "RRstar" = T, "OR" = T) dfs[[id]] <- do.call(rbind, replicate(nreps, df, simplify = FALSE)) df <- do.call(rbind, dfs) } asdd <- pre_venn(gridsim) asddt <- as_tibble(asdd) asddtt <- asddt %>% mutate_if(is.numeric, as.logical) asddtt$valors <- c(1:nrow(asddtt)) asddtt <- asddtt %>% relocate(valors) ggvenn(asddtt) asdd_const <- pre_venn(gridsim_const) asddt_const <- as_tibble(asdd_const)
88 asddtt_const <- asddt_const %>% mutate_if(is.numeric, as.logical) asddtt_const$valors <- c(1:nrow(asddtt_const)) asddtt_const <- asddtt_const %>% relocate(valors) ggvenn(asddtt_const) round(priorsim[["RD_RR_RRstar_OR"]], 2) library(tidyr) ## Warning: package 'tidyr' was built under R version 4.1.3 ggp_betasim <- function(sim, var = "RD_RR_RRstar_OR", colr = list("low" = "cadetblue1", "high" = "cadetblue4"), title = "Monte Carlo simulation with beta distribution") { mat <- sim[[var]] df <- mat %>% as.data.frame() %>% mutate(shape2 = rownames(.)) %>% pivot_longer(cols = starts_with("s1"), names_to = "shape1", values_to = "value") ggplot(df, aes(x = shape1, y = shape2, fill = value)) + geom_tile() + geom_text(aes(label = round(value, 2)), color = "floralwhite", fontface = "bold", size = 5) + scale_fill_gradient(low = colr$low, high = colr$high) + theme_minimal() + theme(legend.position = "none") + labs(title = title, subtitle = sprintf("Event = %s", var)) } ggp_betasim(priorsim, var = "RD_RR_RRstar_OR", colr = list("low" = "deepskyblue1", "high" = "deepskyblue4")) range(priorsim[["RD_RR_RRstar_OR"]]) ara amb dades constretes round(priorsim_const[["RD_RR_RRstar_OR"]], 2) ggp_betasim(priorsim_const, var = "RD_RR_RRstar_OR", colr = list("low" = "lightsalmon1", "high" = "lightsalmon4"), title = "Monte Carlo simulation. Constrained data.") range(priorsim_const[["RD_RR_RRstar_OR"]])
89 VIII. CODI R PROBLEMA 2: L’ACCIDENT DEL CHALLENGER 0. DAGs teòric i fàctics, validació DAG final library(readxl) Taula_FINAL_Challenger_Binaria <- read_excel("C:/Users/graupere/Desktop/TFG/Problema1_Xavi challenger/Taula_FINAL_Challenger_Binaria.xlsx") Per tal de poder treballar amb les funcions LocalTest() i plotLocalTestResults() que són les que permeten de validar el model-DAG amb les dades library(dagitty) library(lavaan) library(readxl) Taula_FINAL_Challenger_Binaria1 <- read_excel("C:/Users/graupere/Desktop/TFG/Problema1_Xavi challenger/Taula_FINAL_Challenger_Binaria.xlsx") Taula_FINAL_Challenger_Binaria1$Test_B <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$Test_B )) Taula_FINAL_Challenger_Binaria1$Humitat_C <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$Humitat_C )) Taula_FINAL_Challenger_Binaria1$T_Oring_C <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$T_Oring_C )) Taula_FINAL_Challenger_Binaria1$Pressio_At_C <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$Pressio_At_C )) Taula_FINAL_Challenger_Binaria1$V_vel_C <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$V_vel_C )) Taula_FINAL_Challenger_Binaria1$T_aire_C <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$T_aire_C )) Taula_FINAL_Challenger_Binaria1$Asbest_B <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$Asbest_B )) Taula_FINAL_Challenger_Binaria1$C_gas_B <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$C_gas_B )) Taula_FINAL_Challenger_Binaria1$Fuita1_B <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$Fuita1_B )) Taula_FINAL_Challenger_Binaria1$Collisio1_B <- as.integer(as.factor(Taula_FINAL_Challenger_Binaria1$Collisio1_B )) Taula_FINAL_Challenger_Binaria1$V_dir_C <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$V_dir_C )) Taula_FINAL_Challenger_Binaria1$Fuita2_B <- as.integer(as.factor( Taula_FINAL_Challenger_Binaria1$Fuita2_B )) Taula_FINAL_Challenger_Binaria1$Collisio2_B <-
96 Humitat_C -> V_vel_C Rot_B -> Collisio1_B Rot_B -> Test_B T_Oring_C -> Fuita1_B T_aire_C -> T_Oring_C Test_B -> Asbest_B Test_B -> C_gas_B Test_B -> Collisio1_B Test_B -> Fuita1_B V_dir_C -> Rot_B V_vel_C -> Fuita1_B V_vel_C -> Rot_B }' ) plot(g_practic1) cal verificar que el graf sigui acíclic isAcyclic(g_practic1) is.dagitty(g_practic1) testsortida_g_practic1<-localTests( g_practic1, sample.cov = corr, sample.nobs = nrow(Taula_FINAL_Challenger_Binaria), ) testsortida_g_practic1 Hom grafica g_practic1 plotLocalTestResults(localTests(g_practic1, sample.cov = corr, sample.nobs = nrow(Taula_FINAL_Challenger_Binaria))) Hom pot filtrar les files que disten més entre el DAG i les dades observades, i així, anar apropant el model DAG amb les dades registrades. library(dplyr) vec_g_practic1<-round(as.numeric(format(testsortida_g_practic1$estimate, scientific=FALSE)),4) which(between(vec_g_practic1, 0.4, 1)|between(vec_g_practic1, -1, -0.4)) which(between(vec_g_practic1, 0.3, 0.4)|between(vec_g_practic1, -0.4, -0.3)) which(between(vec_g_practic1, 0.2, 0.3)|between(vec_g_practic1, -0.3, -0.2)) which(between(vec_g_practic1, 0.1, 0.2)|between(vec_g_practic1, -0.2, -0.1)) which(between(vec_g_practic1, 0.05, 0.1)|between(vec_g_practic1, -0.1, -0.05) ) which(between(vec_g_practic1, 0, 0.05)|between(vec_g_practic1, -0.05, 0)) #testsortida_ultrasenzill1$estimate[7] #testsortida_ultrasenzill1[c(7),] testsortida_g_practic1$estimate[c(3, 13, 19, 43, 61, 62, 64, 65, 67, 68, 70, 71)]
97 testsortida_g_practic1[c(3, 13, 19, 43, 61, 62, 64, 65, 67, 68, 70, 71),] Si hom corregeix amb arestes els tres més allunyats del zero (vegeu el plotLocalTestResults) del DAG g_practic1), en surt el g_practic2. Rt_B._.._.T_O_ - 0.6789622 8.286388e-08 -0.8461864 Rt_B._.._.T__C -0.7806256 1.159722e-11 - 0.9330346 T__C._.._.V__C.1 -0.6865744 4.947270e-08 -0.8524076 També hom hi inclou l’aresta d’Asbest_B a Collisio1_B perquè és justificat per la regressió logística Collisio1_B ~ Asbest_B g_practic2 <- dagitty( 'dag Challenger { Asbest_B [pos="3.562,1.865"] C_gas_B [pos="5.362,0.678"] Collisio1_B [outcome,pos="6.000,3.000"] Disloc_B [pos="4.757,1.492"] Fuita1_B [outcome,pos="1.000,3.000"] Humitat_C [pos="1.631,0.227"] Rot_B [pos="2.973,0.800"] T_Oring_C [pos="1.000,2.000"] T_aire_C [pos="1.071,-0.488"] Test_B [pos="5.966,-0.319"] V_dir_C [pos="3.064,-0.450"] V_vel_C [pos="1.580,1.055"] Asbest_B -> Fuita1_B C_gas_B -> Collisio1_B C_gas_B -> Disloc_B Collisio1_B -> Fuita1_B Disloc_B -> Collisio1_B Humitat_C -> V_vel_C Rot_B -> Collisio1_B Test_B -> Rot_B T_Oring_C -> Fuita1_B T_Oring_C -> Rot_B T_aire_C -> Rot_B T_aire_C -> T_Oring_C T_aire_C -> V_dir_C Test_B -> Asbest_B Test_B -> C_gas_B Test_B -> Collisio1_B Test_B -> Fuita1_B V_dir_C -> Rot_B V_vel_C -> Fuita1_B V_vel_C -> Rot_B Asbest_B -> Collisio1_B }'
98 ) plot(g_practic2) cal verificar que el graf sigui acíclic isAcyclic(g_practic2) is.dagitty(g_practic2) testsortida_g_practic2<-localTests( g_practic2, sample.cov = corr, sample.nobs = nrow(Taula_FINAL_Challenger_Binaria)) testsortida_g_practic2 Ara sols en són 6 que veritablement s’allunyen, del 0.4 library(dplyr) vec_g_practic2<-round(as.numeric(format(testsortida_g_practic2$estimate, scientific=FALSE)),4) which(between(vec_g_practic2, 0.4, 1)|between(vec_g_practic2, -1, -0.5)) which(between(vec_g_practic2, 0.3, 0.4)|between(vec_g_practic2, -0.4, -0.3)) which(between(vec_g_practic2, 0.2, 0.3)|between(vec_g_practic2, -0.3, -0.2)) which(between(vec_g_practic2, 0.1, 0.2)|between(vec_g_practic2, -0.2, -0.1)) which(between(vec_g_practic2, 0.05, 0.1)|between(vec_g_practic2, -0.1, -0.05) ) which(between(vec_g_practic2, 0, 0.05)|between(vec_g_practic2, -0.05, 0)) #testsortida_ultrasenzill1$estimate[7] #testsortida_ultrasenzill1[c(7),] testsortida_g_practic2[c(2, 20, 21, 31, 47, 49, 52),] Hom grafica g_practic2. El model definitiu plotLocalTestResults(localTests(g_practic2, sample.cov = corr, sample.nobs =nrow(Taula_FINAL_Challenger_Binaria))) 1. Estandardització amb la variable sortint collisio1_b fuita1_b aplec d’ajust mínim i suficient per tal d’estimar l’efecte directe d’Asbest_B sobre Collisio1_B library(boot) library(lavaan) library(dplyr) estandarditzacio_Asbest_B <- function( dades, indexs ) { taula_Challenger_est0 <- dades[indexs, ] # [1]-1. expansió de les dades # original taula_Challenger_est0$data.class <- 'original' # 2a còpia taula_Challenger_est2 <- taula_Challenger_est0 %>% mutate (data.class = 'A0', Asbest_B = 0, Collisio1_B = NA) # 3a còpia
99 taula_Challenger_est3 <- taula_Challenger_est0 %>% mutate (data.class = 'A1', Asbest_B = 1, Collisio1_B = NA) # hom aplega totes les dades mostra_total <- rbind ( taula_Challenger_est0, taula_Challenger_est2, taula_Challenger_est3)} taula_sortint_Asbest_B <- estandarditzacio_Asbest_B(Taula_FINAL_Challenger_Binaria) #Asbest_B+Rot_B # [1]-2. hom ajusta el model amb collisio1_B com a variable resposta i Asbest_B com a variable d'exposició fit_Asbest_B <- glm ( Collisio1_B ~ Asbest_B, family = 'binomial', data = taula_sortint_Asbest_B ) summary(fit_Asbest_B) fit_Asbest_B <- glm ( Collisio1_B ~ Asbest_B+Rot_B, family = 'binomial', data = taula_sortint_Asbest_B ) summary(fit_Asbest_B) Asbest_B sobre Collisio1_B library(boot) library(lavaan) library(dplyr) estandarditzacio_Asbest_B <- function( dades, indexs ) { taula_Challenger_est0 <- dades[indexs, ] # [1]-1. expansió de les dades # original taula_Challenger_est0$data.class <- 'original' # 2a còpia taula_Challenger_est2 <- taula_Challenger_est0 %>% mutate (data.class = 'A0', Asbest_B = 0, Collisio1_B = NA) # 3a còpia taula_Challenger_est3 <- taula_Challenger_est0 %>% mutate (data.class = 'A1', Asbest_B = 1, Collisio1_B = NA) # hom aplega totes les dades
100 mostra_total <- rbind ( taula_Challenger_est0, taula_Challenger_est2, taula_Challenger_est3) } taula_sortint_Asbest_B <- estandarditzacio_Asbest_B(Taula_FINAL_Challenger_Binaria) df.buit<-data.frame() aplecvar <- c( "T_aire_C" , "Pressio_At_C" ,"T_Oring_C" , "Humitat_C" , "Collisio2_B", "Fuita1_B" , "Fuita2_B" , "Test_B" , "Disloc_B" , "C_gas_B" , "Rot_B" , "V_vel_C" , "V_dir_C" , "Junt_Field" ) for (H in seq_along(aplecvar)) { modd <- as.formula(sprintf("Collisio1_B ~ Asbest_B+%s", aplecvar[H])) fit_Asbest_B <- summary(glm (formula=modd,family = 'binomial',data = taula_sortint_Asbest_B)) df.buit[H,1] <- names(coef(fit_Asbest_B)[,1])[2] df.buit[H,2] <- names(coef(fit_Asbest_B)[,1])[3] df.buit[H,3] <- coef(fit_Asbest_B)[2,4] df.buit[H,4] <- coef(fit_Asbest_B)[3,4] ## } aplec d’ajust mínim i suficient per tal d’estimar l’efecte directe de Rot_B sobre Collisio1_B estandarditzacio_Rot_B<- function( dades, indexs ) { taula_Challenger_est0 <- dades[indexs, ] # [1]-1. expansió de les dades # original taula_Challenger_est0$data.class <- 'original' # 2a còpia taula_Challenger_est2 <- taula_Challenger_est0 %>% mutate (data.class = 'R0', Rot_B = 0, Collisio1_B = NA) # 3a còpia taula_Challenger_est3 <- taula_Challenger_est0 %>% mutate (data.class = 'R1', Rot_B = 1, Collisio1_B = NA) # hom aplega totes les dades mostra_total <- rbind ( taula_Challenger_est0, taula_Challenger_est2, taula_Challenger_est3)}
101 taula_sortint_Rot_B <-estandarditzacio_Rot_B(Taula_FINAL_Challenger_Binaria) # [1]-2. hom ajusta el model amb collisio1_B com a variable resposta i Asbest_B com a variable d'exposició fit_Rot_B <- glm ( Collisio1_B ~ Rot_B+Test_B, family = 'binomial', data = taula_sortint_Rot_B ) summary(fit_Rot_B) fit_Rot_B <- glm ( Collisio1_B ~ Rot_B+Asbest_B, family = 'binomial', data = taula_sortint_Rot_B ) summary(fit_Rot_B) Rot_B + 2a variable sobre Collisio1_B estandarditzacio_Rot_B<- function( dades, indexs ) { taula_Challenger_est0 <- dades[indexs, ] # [1]-1. expansió de les dades # original taula_Challenger_est0$data.class <- 'original' # 2a còpia taula_Challenger_est2 <- taula_Challenger_est0 %>% mutate (data.class = 'R0', Rot_B = 0, Collisio1_B = NA) # 3a còpia taula_Challenger_est3 <- taula_Challenger_est0 %>% mutate (data.class = 'R1', Rot_B = 1, Collisio1_B = NA) # hom aplega totes les dades mostra_total <- rbind ( taula_Challenger_est0, taula_Challenger_est2, taula_Challenger_est3) } taula_sortint_Rot_B <-estandarditzacio_Rot_B(Taula_FINAL_Challenger_Binaria) df.buit<-data.frame() aplecvar <- c( "T_aire_C" , "Pressio_At_C" ,"T_Oring_C" , "Humitat_C" , "Collisio2_B", "Fuita1_B" , "Fuita2_B" , "Test_B" , "Asbest_B" , "Disloc_B" , "C_gas_B" , "V_vel_C" , "V_dir_C" , "Junt_Field" ) for (H in seq_along(aplecvar))
102 { modd <- as.formula(sprintf("Collisio1_B ~ Rot_B+%s", aplecvar[H])) fit_Rot_B <- summary(glm (formula=modd,family = 'binomial',data = taula_sortint_Rot_B)) df.buit[H,1] <- names(coef(fit_Rot_B)[,1])[2] df.buit[H,2] <- names(coef(fit_Rot_B)[,1])[3] df.buit[H,3] <- coef(fit_Rot_B)[2,4] df.buit[H,4] <- coef(fit_Rot_B)[3,4] ## } aplec d’ajust mínim i suficient per tal d’estimar l’efecte directe de Pressio_At_C respecte de Collisio1_B estandarditzacio_Pressio_At_C <- function( dades, indexs ) { taula_Challenger_est0 <- dades[indexs, ] # [1]-1. expansió de les dades # original taula_Challenger_est0$data.class <- 'original' # 2a còpia taula_Challenger_est2 <- taula_Challenger_est0 %>% mutate (data.class = 'PA0',Pressio_At_C = 0, Collisio1_B = NA) # 3a còpia taula_Challenger_est3 <- taula_Challenger_est0 %>% mutate (data.class = 'PA1',Pressio_At_C = 1, Collisio1_B = NA) # hom aplega totes les dades mostra_total <- rbind ( taula_Challenger_est0, taula_Challenger_est2, taula_Challenger_est3) } taula_sortint_Pressio_At_C<- estandarditzacio_Pressio_At_C(Taula_FINAL_Challenger_Binaria) df.buit<-data.frame() aplecvar <- c( "T_aire_C" ,"T_Oring_C" , "Humitat_C" , "Collisio2_B", "Fuita1_B" , "Fuita2_B" , "Test_B" , "Asbest_B" , "Disloc_B" , "C_gas_B" , "Rot_B" , "V_vel_C" , "V_dir_C" , "Junt_Field" ) for (H in seq_along(aplecvar)) { #Pressio_At_C + Junt_Field # [1]-2. hom ajusta el model amb collisio1_B com a variable resposta i Pressio_At_C com a variable d'exposició modd <- as.formula(sprintf("Collisio1_B ~ Pressio_At_C+%s", aplecvar[H]))
103 fit_Pressio_At_C <- summary(glm (formula=modd,family = 'binomial', data = taula_sortint_Pressio_At_C)) df.buit[H,1] <- names(coef(fit_Pressio_At_C)[,1])[2] df.buit[H,2] <- names(coef(fit_Pressio_At_C)[,1])[3] df.buit[H,3] <- coef(fit_Pressio_At_C)[2,4] df.buit[H,4] <- coef(fit_Pressio_At_C)[3,4] ## } Humitat_C+ 2a variable en Collisio1_B estandarditzacio_Humitat_C <- function( dades, indexs ) { taula_Challenger_est0 <- dades[indexs, ] taula_Challenger_est0$data.class <- 'original' taula_Challenger_est2 <- taula_Challenger_est0 %>% mutate (data.class = 'gas0', Humitat_C = 0, Collisio1_B = NA) taula_Challenger_est3 <- taula_Challenger_est0 %>% mutate (data.class = 'gas1', Humitat_C = 1, Collisio1_B = NA) mostra_total <- rbind ( taula_Challenger_est0, taula_Challenger_est2, taula_Challenger_est3) } taula_sortint_Humitat_C<- estandarditzacio_Humitat_C(Taula_FINAL_Challenger_Binaria) df.buit<-data.frame() aplecvar <- c( "T_aire_C" ,"Junt_Field" , "T_Oring_C" , "Collisio2_B", "Fuita1_B" , "Fuita2_B" , "Test_B" , "Asbest_B" , "Disloc_B" , "Pressio_At_C", "Rot_B" , "V_vel_C" , "V_dir_C" , "C_gas_B" ) for (H in seq_along(aplecvar)) { modd <- as.formula(sprintf("Collisio1_B ~ Humitat_C+%s", aplecvar[H])) fit_Pressio_Humitat_C <- summary(glm (formula=modd,family = 'binomial', data = taula_sortint_Humitat_C)) df.buit[H,1] <- names(coef(fit_Pressio_Humitat_C)[,1])[2]
104 df.buit[H,2] <- names(coef(fit_Pressio_Humitat_C)[,1])[3] df.buit[H,3] <- coef(fit_Pressio_Humitat_C)[2,4] df.buit[H,4] <- coef(fit_Pressio_Humitat_C)[3,4] ## } df.buit Fuita1_B+2a variable en Collisio1_B estandarditzacio_Fuita1_B<- function( dades, indexs ) { taula_Challenger_est0 <- dades[indexs, ] taula_Challenger_est0$data.class <- 'original' taula_Challenger_est2 <- taula_Challenger_est0 %>% mutate (data.class = 'gas0', Fuita1_B = 0, Collisio1_B = NA) taula_Challenger_est3 <- taula_Challenger_est0 %>% mutate (data.class = 'gas1', Fuita1_B = 1, Collisio1_B = NA) mostra_total <- rbind ( taula_Challenger_est0, taula_Challenger_est2, taula_Challenger_est3) } taula_sortint_Fuita1_B<- estandarditzacio_Fuita1_B(Taula_FINAL_Challenger_Binaria) df.buit<-data.frame() aplecvar <- c( "Disloc_B" ,"Junt_Field" , "T_Oring_C" , "Collisio2_B", "V_dir_C" , "Fuita2_B" , "Test_B" , "Asbest_B" , "Humitat_C" , "Pressio_At_C", "Rot_B" , "V_vel_C" , "T_aire_C" , "C_gas_B" ) for (H in seq_along(aplecvar)) { modd <- as.formula(sprintf("Collisio1_B ~ Fuita1_B+%s", aplecvar[H])) fit_Pressio_Fuita1_B <- summary(glm (formula=modd,family = 'binomial', data = taula_sortint_Fuita1_B)) df.buit[H,1] <- names(coef(fit_Pressio_Fuita1_B)[,1])[2] df.buit[H,2] <- names(coef(fit_Pressio_Fuita1_B)[,1])[3] df.buit[H,3] <- coef(fit_Pressio_Fuita1_B)[2,4] df.buit[H,4] <- coef(fit_Pressio_Fuita1_B)[3,4]
105 ## } df.buit AMB LA VARIABLE SORTINT Fuita1_B Test_B+2a variable en Fuita1_B estandarditzacio_Test_B <- function( dades, indexs ) { taula_Challenger_est0 <- dades[indexs, ] # [1]-1. expansió de les dades # original taula_Challenger_est0$data.class <- 'original' # 2a còpia taula_Challenger_est2 <- taula_Challenger_est0 %>% mutate (data.class = 'Te0', Test_B = 0, Fuita1_B = NA) # 3a còpia taula_Challenger_est3 <- taula_Challenger_est0 %>% mutate (data.class = 'Te1', Test_B = 1, Fuita1_B = NA) # hom aplega totes les dades mostra_total <- rbind ( taula_Challenger_est0, taula_Challenger_est2, taula_Challenger_est3) } taula_sortint_Test_B<-estandarditzacio_Test_B(Taula_FINAL_Challenger_Binaria) #Test_B + Pressio_At_C #Test_B + C_gas_B #===>>>Test_B + Collisio1_B df.buit<-data.frame() aplecvar <- c( "T_aire_C" , "Pressio_At_C" ,"T_Oring_C" , "Humitat_C" , "Collisio1_B", "Collisio2_B", "Fuita2_B" , "Asbest_B" , "Disloc_B" , "C_gas_B" , "Rot_B" , "V_vel_C" , "V_dir_C" , "Junt_Field" ) for (H in seq_along(aplecvar)) { modd <- as.formula(sprintf("Fuita1_B ~Test_B +%s", aplecvar[H])) fit_Test_B <- summary(glm (formula=modd,family = 'binomial', data = taula_sortint_Test_B)) df.buit[H,1] <- names(coef(fit_Test_B)[,1])[2] df.buit[H,2] <- names(coef(fit_Test_B)[,1])[3] df.buit[H,3] <- coef(fit_Test_B)[2,4]
112 #RR #OR standardization(Taula_FINAL_Challenger_Binaria) ## [1] 0.339 1.739 4.644 library(boot) # [2] Hom genera els IC # [2]-1. Hom calcula el 95% IC set.seed(1234) results <- boot(data=Taula_FINAL_Challenger_Binaria, statistic=standardization, R=1000, parallel = "multicore") se <- c(sd(results$t[, 1]), sd(results$t[, 2]),sd(results$t[, 3])) mean <- results$t0 # 95% IC segons la normal emprant SE ll1 <- mean - qnorm(0.975) * se ul1 <- mean + qnorm(0.975) * se # 95% IC segons percentils 0.025 i 0.975 ll2 <- c (quantile (results$t[,1], 0.025), quantile (results$t[,2], 0.025), quantile (results$t[,3], 0.025)) ul2 <- c (quantile (results$t[,1], 0.975), quantile (results$t[,2], 0.975), quantile (results$t[,3], 0.975)) # [2]-2. hom presenta el resultat bootstrap <- data.frame(cbind(c("ATE", "RR", "OR"), round (mean, 3), round (se, 3), round (ll1, 3), round (ul1 , 3), round (ll2 , 3), round (ul2, 3)), row.names=NULL) colnames (bootstrap) <- c("Estimand", "mean", "se", "Lower1", "Upper1", "Lower2", "Upper2") bootstrap set.seed(1234) options(digits=3) stand.r <- function () { stand.out <- boot(dat = Taula_FINAL_Challenger_Binaria,statistic = standout,R = 1000, parallel = "multicore") stand.est <- stand.out$statistic() stand.SE <- c(sd(stand.out$t[,1]),sd(stand.out$t[,2]),sd(stand.out$t[,3]),sd(stand.out$t[,4])) stand.lci <- stand.est - 1.96 * stand.SE stand.uci <- stand.est + 1.96 * stand.SE list(stand.est = stand.est, stand.SE = stand.SE, stand.lci = stand.lci, stand.uci = stand.uci) } standout <- function(data = Taula_FINAL_Challenger_Binaria, ids = c(1:nrow(data)))
113 { dat <- data[ids,] # hom ajusta la sortida del model paramètric lmod <- glm(Collisio1_B ~ Rot_B+Test_B+Asbest_B, family = binomial, data = dat) dat0 <- dat1 <- dat # hom crea un dataset amb tothom sense tractament dat0$Rot_B <- 0 # hom crea un dataset amb tothom amb tractament dat1$Rot_B <- 1 # hom calcula el resultat potencial esperat per a cada participant si no es tracta EYhat0 <- na.omit(predict(lmod, newdata = dat0, type = "response")) # hom calcula el resultat potencial esperat per a cada participant si es tracta EYhat1 <- na.omit(predict(lmod, newdata = dat1, type = "response")) # hom estima els resultats potencials mitjans EY0 <- mean(EYhat0) EY1 <- mean(EYhat1) # hom estima les mesures d'efecte rd <- EY1 - EY0 logrr <- log(EY1 / EY0) c(EY0, EY1, rd, logrr) } result <- stand.r() result exp(c(0.553,0.2447,0.0736,1.033)) ## [1] 1.74 1.28 1.08 2.81
114 IX. BIBLIOGRAFIA PROBLEMA 1: UN ESTUDI DE COHORT PROSPECTIU Treballs acadèmics: TFG, TFM, Tesis, Seminaris Bougioukas Konstantinos I., 2023, Practical Statistics in Medicine with R https://bougioukas-medstats-r.netlify.app/ Macías Piguave, d’Amanda Elizabeth, 2022, TFM Grafs Acíclics Dirigits (DAGs) i reproductibilitat d’estudis observacionals https://upcommons.upc.edu/handle/2117/362818 Llibres constitutius Babette A.Brumback, , 2022, Fundamentals of Causal Inference: With R (Chapman & Hall/CRC Texts in Statistical Science) Brumback, Babette A., Odd Exercises Solutions Manual for Fundamentals of Causal Inference (versió gairebé completa 59 pàg.) François Lefebvre, 2022, Study project Brumback: Fundamentals of Causal Inferences With R Tidyverse, https://franklef.github.io/FundamentalsCausalInference/index.html Madelyn Glymour, Judea Pearl, Nicholas P. Jewell, 2016, Causal Inference in Statistics A Primer Judea Pearl, Madelyn Glymour, and Nicholas Jewell (Text Authors) & Judea Pearl, Ang Li, Andrew Forney, and Johannes Textor (Solution Authors) Causal Inference in Statistics: A Primer Solution Manual (versió completa 76 pàg.) Rocafort Alfredo & Amat Oriol, 2017, Com fer recerca (treball de fi de grau, tesi de màster, tesi doctoral i altres projectes de recerca) Llibres consultius Bostock David, 2006, Space, Time, Matter, and Form Essays on Aristotle’s Physics Charlton William, 2006, Aristotle Physics books I and II Translated with Introduction, Commentary, Mote on Recent Work, and Revised Bibliography Cobo Erik et al., 2007, Bioestadística Para no Estadísticos. Bases Para Interpretar Artículos Científicos Cunningham Scott, 2021, Causal Inference The Mixtape Lash Timothy L. et al., 2021, Modern Epidemiology
115 Nguyen Mike, 2023, A Guide on Data Analysis https://bookdown.org/mike/data_analysis/ Rosenbaum Paul R., 2017, Observation and Experiment An Introduction to Causal Inference Shipley Bill, 2016, Cause and Correlation in Biology Articles Lee Lennard Yw, 2020, COVID-19 mortality in patients with cancer on chemotherapy or other anticancer treatments: A prospective cohort study https://pubmed.ncbi.nlm.nih.gov/32473682/ Puig Xavier et. al, 2022, Alcohol as a trigger of migraine attacks in people with migraine. Results from a large prospective cohort study in English-speaking countries https://headachejournal.onlinelibrary.wiley.com/doi/epdf/10.1111/head.14428 Tennant Peter WG et al., 2019, Use of directed acyclic graphs (DAGs) in applied health research: review and recommendations https://pubmed.ncbi.nlm.nih.gov/33330936/
116 X. BIBLIOGRAFIA PROBLEMA 2: L’ACCIDENT DEL CHALLENGER Treballs acadèmics: TFG, TFM, Tesis, Seminaris Ditkof Martin, Gener 28 de 2022, Tesi, Space Shuttle Challenger January 28, 1986 Tragedy 36 Years Later. A Retrospective on Causation and Moral Injuries, University of Colorado at Colorado Springs https://theasbestosblog.com/wp-content/uploads/2022/01/Space-Shuttle-Challenger- Thesis-1282022.pdf Fuqua Don, 1986, Investigation Of the Challenger Accident Report of the Committee on Science and Technology House of Representatives Ninety-Ninth Congress Second Session https://ntrs.nasa.gov/api/citations/19870002391/downloads/19870002391.pdf Textor Johannes, 2022, Seminari, Causal Inference using the R package DAGitty (https://youtu.be/LCC4BkLZo-g) William P. Rogers, 1986, Report, Report of the PRESIDENTIAL COMMISSION on the Space Shuttle Challenger Accident (capítols I, II , III, IV, V, VI, VII, VIII, IX, apèndixs; https://sma.nasa.gov/SignificantIncidents/assets/rogers_commission_report.pdf) Llibres constitutius Babette A.Brumback, 2022, Fundamentals of Causal Inference: With R (Chapman & Hall/CRC Texts in Statistical Science) Brumback, Babette A., Odd Exercises Solutions Manual for Fundamentals of Causal Inference (versió gairebé completa 59 pàg.) François Lefebvre, 2022, Study project Brumback: Fundamentals of Causal Inferences With R Tidyverse, https://franklef.github.io/FundamentalsCausalInference/index.html Madelyn Glymour, Judea Pearl, Nicholas P. Jewell, 2016, Causal Inference in Statistics A Primer Judea Pearl, Madelyn Glymour, and Nicholas Jewell (Text Authors) & Judea Pearl, Ang Li, Andrew Forney, and Johannes Textor (Solution Authors) Causal Inference in Statistics: A Primer Solution Manual (versió completa 76 pàg.) Rocafort Alfredo & Amat Oriol, 2017, Com fer recerca (treball de fi de grau, tesi de màster, tesi doctoral i altres projectes de recerca) Llibres consultius Boisjoly Roger, 2002, Representation and Misrepresentation: Tufte and the Morton Thiokol Engineers on the Challenger
117 https://www.taylorfrancis.com/chapters/edit/10.4324/9781315256474-12/representationmisrepresentation-tufte-morton-thiokol-engineers-challenger-wade-robison-roger- boisjoly-david-hoeker-stefan-young Comellas Francesc et al., Matemática discreta Diestel Reinhard, 2005, Graph Theory Dormann Carsten F., 2017, Parametrische Statistik Verteilungen, maximum likelihood und GLM in R Evans Ben, 2007, Space Shuttle Challenger, Ten Journeys into the Unknown Mahler Julianne G., 2009, Organizational Learning at NASA, The Challenger and Columbia Accidents McDonald Allan J., 2009, Truth, Lies, and O-rings Inside the Space Shuttle Challenger Disaster Murty U.S.R., 2008, Graph Theory Ruiz de Villa Robert Aleix, 2023, Causal Inference for Data Science Peters Jonas et al., 2017, Elements of Causal Inference Foundations and Learning Algorithms Pearl Judea, 2009, Causality Models, Reasoning, and Inference Pearl Judea, 2010, An Introduction to Causal Inference Pearl Judea, 2018, the Book of Why Kleinbaum David G. et al., 2002, Logistic Regression Trias Pairó Joan, 2001, Matemàtica discreta. Problemes resolts Tufte Edward R., 1997, pàgs 38-54, Visual Explanations Images and Quantities, Evidence and Narrative Vaughan Diane, 1996, The Challenger Launch Decision Articles, Reports, Manuals/Guies, Seminaris Anyanwu Franklin Okechukwu, 2023, An Exposition of Aristotle’s Idea of Causation University of Portharcourt
118 Ankan Ankur et al., 2021, Testing Graphical Causal Models Using the R Package “dagitty” https://pubmed.ncbi.nlm.nih.gov/33592130/ Barrett Malcolm, 2022, An Introduction to Directed Acyclic Graphs https://ggdag.netlify.app/articles/intro-to-dags.html Chase Charles A., Pioneers in Propulsion—A History of CSD Pratt & Whitney’s Solid Rocket Company (https://gobluechase.files.wordpress.com/2014/08/pioneers-in-propulsion-final.pdf) Ditkof Martin, 2021, Let’s talk Asbestos. Let’s talk the Space Shuttle Challenger Explosion. Let’s talk both. https://theasbestosblog.com/ Eugene Austin Robert, 2019, Lessons Learned from the Space Shuttle Challenger Disaster for the Nuclear Industry (https://www.linkedin.com/pulse/lessons-learned-from-space-shuttle-challenger-nuclear- austin-iii) Ferguson Karl D. et al., 2019, Evidence synthesis for constructing directed acyclic graphs (ESC-DAGs): a novel and systematic method for building directed acyclic graphs (https://pubmed.ncbi.nlm.nih.gov/31325312/) Huntington-Klein Nick, 2020, Causal Diagrams Cheat Sheet https://nickchk.github.io/introcausality/Cheat%20Sheets/Causal_Diagrams_Cheat_Shee t.pdf Jasper G. L. et al., April 1985, Nasa Technical Memorandum, NASA TM -86508 Atmospheric Environment For Space Shuttle (STS-51C) LAUNCH https://ntrs.nasa.gov/citations/19850022235 Jasper G. L. et al., July 1985, Nasa Technical Memorandum, NASA TM -86525 Atmospheric Environment For Space Shuttle (STS-51B) LAUNCH https://ntrs.nasa.gov/citations/19860003449 Jasper G. L. et al., December 1986, Nasa Technical Memorandum, NASA TM -86577 Atmospheric Environment For Space Shuttle (STS-51L) LAUNCH https://ntrs.nasa.gov/citations/19870009517 Jasper G. L. et al., November 1990, Nasa Technical Memorandum, NASA TM -103525 Atmospheric Environment For Space Shuttle (STS-41) LAUNCH https://ntrs.nasa.gov/api/citations/19910010216/downloads/19910010216.pdf Atmospheric Environment For Space Shuttle (STS-1) LAUNCH Johnson D. L. et al., July 1981, Nasa Technical Memorandum, NASA TM -82436 https://ntrs.nasa.gov/citations/19810023200 Atmospheric Environment For Space Shuttle (STS-2) LAUNCH
119 Johnson D. L. et al., December 1981, Nasa Technical Memorandum, NASA TM -82463 https://ntrs.nasa.gov/citations/19820012931 Atmospheric Environment For Space Shuttle (STS-3) LAUNCH Johnson D. L. et al., April 1982, Nasa Technical Memorandum, NASA TM -82480 https://ntrs.nasa.gov/citations/19820020037 Atmospheric Environment For Space Shuttle (STS-4) LAUNCH Johnson D. L. et al., July 1982, Nasa Technical Memorandum, NASA TM -82498 https://ntrs.nasa.gov/citations/19830001838 Atmospheric Environment For Space Shuttle (STS-5) LAUNCH Johnson D. L. et al., March 1983, Nasa Technical Memorandum, NASA TM -82515 https://ntrs.nasa.gov/citations/19830014637 Atmospheric Environment For Space Shuttle (STS-6) LAUNCH Johnson D. L. et al., May 1983, Nasa Technical Memorandum, NASA TM -82529 https://ntrs.nasa.gov/citations/19830021655 Atmospheric Environment For Space Shuttle (STS-7) LAUNCH Johnson D. L. et al., July 1983, Nasa Technical Memorandum, NASA TM -82542 https://ntrs.nasa.gov/citations/19830025658 Atmospheric Environment For Space Shuttle (STS-8 ) LAUNCH Johnson D. L. et al., October 1983, Nasa Technical Memorandum, NASA TM -82560 https://ntrs.nasa.gov/citations/19840006568 Atmospheric Environment For Space Shuttle (STS-9) LAUNCH Johnson D. L. et al., January 1984, Nasa Technical Memorandum, NASA TM -82572 https://ntrs.nasa.gov/citations/19840015979 Atmospheric Environment For Space Shuttle (STS-13) LAUNCH Johnson D. L. et al., May 1984, Nasa Technical Memorandum, NASA TM -82588 https://ntrs.nasa.gov/citations/19840021327 Atmospheric Environment For Space Shuttle (STS-41G) LAUNCH Johnson D. L. et al., November 1984, Nasa Technical Memorandum, NASA TM -86486 https://ntrs.nasa.gov/citations/19850008011 Atmospheric Environment For Space Shuttle (STS-51A) LAUNCH Johnson D. L. et al., December 1984, Nasa Technical Memorandum, NASA TM -86497 https://ntrs.nasa.gov/citations/19850013565 Lee Sangwon et al., 2022, Application of Standardization for Causal Inference in Observational Studies: A Step-by-step Tutorial for Analysis Using R Software https://pubmed.ncbi.nlm.nih.gov/35391523/ Mora Giné Mercè, 2012, Apunts de Matemàtica Discreta https://upcommons.upc.edu/handle/2117/190743 NASA Scientific and Technological Program Reviews Commission on Engineering and Technical Systems National Research Council, 1986, Post-Challenger Assessment of Space Shuttle Flight Rates and Utilization Prepared by a Panel Convened
120 National Aeronautics and Space Administration (NASA), Space Shuttle Weather Launch Commit Criteria and KSC End of Mission Weather Landing Criteria https://nap.nationalacademies.org/catalog/10615/post-challenger-assessment-of-space- shuttle-flight-rates-and-utilization Nowok Beata et al., 2016, synthpop: Bespoke Creation of Synthetic Data in R https://www.jstatsoft.org/article/view/v074i11 Pearl Judea, 2011, The Mediation Formula: A guide to the assessment of causal pathways in nonlinear models https://ftp.cs.ucla.edu/pub/stat_ser/r363.pdf Pearl Judea, 2017, The Seven Tools of Causal Inference with Reflections on Machine Learning https://ftp.cs.ucla.edu/pub/stat_ser/r481.pdf Rohrer Julia M., 2017, Thinking Clearly About Correlations and Causation: Graphical Causal Models for Observational Data https://journals.sagepub.com/doi/full/10.1177/2515245917745629 Shrier Ian et al., 2008, Reducing bias through directed acyclic graphs https://pubmed.ncbi.nlm.nih.gov/18973665/ Textor Johannes, 2015, Drawing and Analyzing Causal DAGs with DAGitty https://www.researchgate.net/publication/281144839_Drawing_and_Analyzing_Causal_ DAGs_with_DAGitty Textor Johannes et al., 2015, Learning from Pairwise Marginal Independencies https://arxiv.org/abs/1508.00280 Textor Johannes et al., 2022, Package ‘dagitty’ http://dagitty.net/ William H. Greene et al., 1986, Structural Behavior of the Space Shuttle SRM Tang- Clevis Joint https://ntrs.nasa.gov/citations/19870001744 Shpitser Ilya et al., 2009, Effects of Treatment on the Treated: Identification and Generalization https://arxiv.org/abs/1205.2615