Conte´ udo I
Introdu¸c˜ ao e Modela¸c˜ ao Probabil´ıstica
1 Introdu¸ c˜ ao
3
1.1
No¸co˜es preliminares sobre dados categorizados e exemplos . . . . . . .
3
1.2
Nota¸c˜ao . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
14
1.3
Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
15
2 Modelos probabil´ısticos
II
1
19
2.1
Processos de amostragem . . . . . . . . . . . . . . . . . . . . . . . . .
19
2.2
Rela¸c˜ao probabil´ıstica entre os esquemas amostrais b´asicos . . . . . . .
26
2.3
Modelos hipergeom´etricos . . . . . . . . . . . . . . . . . . . . . . . . .
32
2.4
Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
35
2.5
Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
36
Modela¸c˜ ao Estrutural
3 Modelos estruturais lineares
43 45
3.1
Introdu¸c˜ao . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
45
3.2
Modelos de simetria . . . . . . . . . . . . . . . . . . . . . . . . . . . .
46
3.3
Modelos de homogeneidade marginal . . . . . . . . . . . . . . . . . . .
48
3.4
Modelo linear geral . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
50
3.5
Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
52
3.6
Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
55
4 Modelos log-lineares para tabelas sem vari´ aveis explicativas 4.1
Reparametriza¸c˜ao log-linear do modelo probabil´ıstico . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4.1.1
Formula¸c˜ao sobreparametrizada do modelo saturado e sua identifica¸c˜ao . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
59 60 60
´ CONTEUDO
ii 4.1.2
Interpreta¸c˜ao dos parˆametros log-lineares . . . . . . . . . . . .
64
4.1.3
Formula¸c˜ao log-linear com incorpora¸c˜ao da restri¸c˜ao natural . .
67
4.1.4
Modelos log-lineares reduzidos . . . . . . . . . . . . . . . . . .
68
Modelos log-lineares para tabelas bidimensionais . . . . . . . . . . . .
70
4.2.1
Modelos para diferentes padr˜oes de associa¸c˜ao
. . . . . . . . .
70
4.2.2
Modelos de simetria . . . . . . . . . . . . . . . . . . . . . . . .
72
Modelos log-lineares para tabelas tridimensionais . . . . . . . . . . . .
74
4.3.1
O modelo log-linear saturado . . . . . . . . . . . . . . . . . . .
74
4.3.2
Interpreta¸c˜ao dos parˆametros log-lineares . . . . . . . . . . . .
76
4.3.3
Modelos com diferentes padr˜oes de associa¸c˜ao . . . . . . . . . .
78
Modelos log-lineares para tabelas tetradimensionais e de dimens˜ao superior . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
82
4.5
Identidade entre associa¸c˜oes parciais e associa¸c˜oes marginais
. . . . .
86
4.6
Modelos para vari´aveis ordinais . . . . . . . . . . . . . . . . . . . . . .
89
4.6.1
Tabelas bidimensionais
. . . . . . . . . . . . . . . . . . . . . .
89
4.6.2
Tabelas tridimensionais . . . . . . . . . . . . . . . . . . . . . .
92
4.7
Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
95
4.8
Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
98
4.2
4.3
4.4
5 Modelos log-lineares para tabelas com vari´ aveis explicativas
113
5.1
As v´arias formula¸c˜oes log-lineares . . . . . . . . . . . . . . . . . . . . . 113
5.2
Tabelas bidimensionais . . . . . . . . . . . . . . . . . . . . . . . . . . . 117
5.3
Tabelas tridimensionais . . . . . . . . . . . . . . . . . . . . . . . . . . 122
5.4
5.3.1
Tabelas com um factor . . . . . . . . . . . . . . . . . . . . . . . 122
5.3.2
Tabelas com dois factores . . . . . . . . . . . . . . . . . . . . . 126
Tabelas tetradimensionais . . . . . . . . . . . . . . . . . . . . . . . . . 133 5.4.1
Tabelas com um factor . . . . . . . . . . . . . . . . . . . . . . . 134
5.4.2
Tabelas com dois factores . . . . . . . . . . . . . . . . . . . . . 136
5.4.3
Tabelas com trˆes factores . . . . . . . . . . . . . . . . . . . . . 139
5.5
Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 141
5.6
Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 142
6 Modelos funcionais lineares 6.1
147
Modelos log-lineares generalizados . . . . . . . . . . . . . . . . . . . . 147 6.1.1
Outros modelos log-lineares ordin´arios . . . . . . . . . . . . . . 148
6.1.2
Modelos log-lineares n˜ao ordin´arios . . . . . . . . . . . . . . . . 159
´ CONTEUDO
6.2
6.3
iii
Outros modelos funcionais lineares . . . . . . . . . . . . . . . . . . . . 161 6.2.1
Modelos lineares nos logitos de raz˜oes continuadas . . . . . . . 162
6.2.2
Modelos lineares nos logitos cumulativos . . . . . . . . . . . . . 164
6.2.3
Modelos de concordˆancia . . . . . . . . . . . . . . . . . . . . . 168
Modelos lineares generalizados . . . . . . . . . . . . . . . . . . . . . . 170 6.3.1
Defini¸c˜ao . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 171
6.3.2
Alternativas ao modelo de regress˜ao log´ıstica . . . . . . . . . . 174
6.4
Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 178
6.5
Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 183
7 A metodologia de m´ axima verosimilhan¸ ca
193
7.1
Estima¸c˜ao param´etrica . . . . . . . . . . . . . . . . . . . . . . . . . . . 193
7.2
Testes de ajustamento dos modelos . . . . . . . . . . . . . . . . . . . . 196
7.3
Testes condicionais de hip´oteses redutoras de modelos . . . . . . . . . 202
7.4
Resultados assint´oticos . . . . . . . . . . . . . . . . . . . . . . . . . . . 206
7.5
Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 218
7.6
Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 221
8 An´ alise de modelos lineares
225
8.1
Modelos de simetria . . . . . . . . . . . . . . . . . . . . . . . . . . . . 225
8.2
Modelos de homogeneidade marginal . . . . . . . . . . . . . . . . . . . 228
8.3
Modelo linear geral . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 232
8.4
Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 235
8.5
Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 237
9 An´ alise de modelos log-lineares 9.1
9.2
9.3
245
Descri¸c˜ao gen´erica da an´alise em tabelas sem vari´aveis explicativas . . 246 9.1.1
Estat´ısticas suficientes e estima¸c˜ao param´etrica . . . . . . . . . 246
9.1.2
Ajustamento e redu¸c˜ao de modelos . . . . . . . . . . . . . . . . 251
9.1.3
Caso do cen´ario poissoniano . . . . . . . . . . . . . . . . . . . . 254
Modelos log-lineares bidimensionais . . . . . . . . . . . . . . . . . . . . 257 9.2.1
Modelo de independˆencia e an´alise de associa¸c˜ao entre vari´aveis nominais . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 257
9.2.2
Modelos de simetria . . . . . . . . . . . . . . . . . . . . . . . . 261
9.2.3
Modelos ordinais . . . . . . . . . . . . . . . . . . . . . . . . . . 266
Modelos log-lineares multidimensionais . . . . . . . . . . . . . . . . . . 270 9.3.1
Modelos hier´arquicos tridimensionais . . . . . . . . . . . . . . . 270
´ CONTEUDO
iv
9.4
9.5
9.6
9.3.2
Modelos de simetria . . . . . . . . . . . . . . . . . . . . . . . . 275
9.3.3
Modelos ordinais . . . . . . . . . . . . . . . . . . . . . . . . . . 277
9.3.4
Modelos hier´arquicos tetradimensionais . . . . . . . . . . . . . 280
M´etodos iterativos de estima¸c˜ao log-linear . . . . . . . . . . . . . . . . 288 9.4.1
M´etodo de Newton-Raphson . . . . . . . . . . . . . . . . . . . 288
9.4.2
M´etodo do ajustamento proporcional iterativo . . . . . . . . . 289
An´alise log-linear em tabelas com vari´aveis explicativas
. . . . . . . . 292
9.5.1
Estima¸c˜ao e ajustamento . . . . . . . . . . . . . . . . . . . . . 294
9.5.2
Aplica¸c˜oes com a formula¸c˜ao log-linear generalizada . . . . . . 299
9.5.3
Compara¸c˜ao com o cen´ario Multinomial . . . . . . . . . . . . . 308
Selec¸c˜ao de modelos log-lineares . . . . . . . . . . . . . . . . . . . . . . 313 9.6.1
T´acticas de selec¸c˜ao preliminar . . . . . . . . . . . . . . . . . . 313
9.6.2
M´etodos “stepwise” . . . . . . . . . . . . . . . . . . . . . . . . 316
9.6.3
Avalia¸c˜ao dos modelos seleccionados . . . . . . . . . . . . . . . 321
9.7
Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 326
9.8
Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 327
10 An´ alise de modelos funcionais lineares
345
10.1 Modelos log-lineares generalizados . . . . . . . . . . . . . . . . . . . . 345 10.2 Outros modelos funcionais lineares . . . . . . . . . . . . . . . . . . . . 350 10.2.1 Modelos lineares nos logitos de raz˜oes continuadas . . . . . . . 350 10.2.2 Modelos lineares nos logitos cumulativos . . . . . . . . . . . . . 353 10.3 Modelos de concordˆancia . . . . . . . . . . . . . . . . . . . . . . . . . . 357 10.4 Modelos lineares generalizados . . . . . . . . . . . . . . . . . . . . . . 358 10.5 Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 365 11 Metodologia de M´ınimos Quadrados Generalizados
369
11.1 Descri¸c˜ao geral da metodologia . . . . . . . . . . . . . . . . . . . . . . 370 11.2 Aplica¸c˜ao `a an´alise de modelos lineares . . . . . . . . . . . . . . . . . . 379 11.3 Aplica¸c˜ao `a an´alise de modelos log-lineares . . . . . . . . . . . . . . . 384 11.4 Aplica¸c˜ao `a an´alise de modelos funcionais lineares
. . . . . . . . . . . 390
11.5 Detalhes t´ecnicos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 400 11.5.1 Distribui¸c˜ao assint´otica do estimador MQG e da estat´ıstica de Wald . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 400 11.5.2 Equivalˆencia entre duas estat´ısticas para teste de ajustamento de modelos estruturais . . . . . . . . . . . . . . . . . . . . . . . 402
´ CONTEUDO
v
11.5.3 Utiliza¸c˜ao do m´etodo Delta para obten¸c˜ao de distribui¸c˜oes assint´oticas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 403 11.5.4 Rela¸c˜ao entre as metodologias de MQG e MQN . . . . . . . . . 405 11.6 Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 407 11.7 Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 408 12 An´ alise de dados categorizados longitudinais
413
12.1 Introdu¸c˜ao . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 413 12.2 An´alise por meio de m´ınimos quadrados generalizados . . . . . . . . . 420 12.3 An´alise por meio de m´axima verosimilhan¸ca e de equa¸c˜oes de estima¸c˜ao generalizadas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 429 12.4 Nota de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 441 12.5 Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 442 13 An´ alise de dados incompletos
445
13.1 Descri¸c˜ao do problema . . . . . . . . . . . . . . . . . . . . . . . . . . . 445 13.2 Modela¸c˜ao . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 447 13.3 An´alise por m´axima verosimilhan¸ca sob omiss˜ao aleat´oria . . . . . . . 452 13.4 Concretiza¸c˜ao a modelos lineares e log-lineares . . . . . . . . . . . . . 455 13.5 An´alise por m´ınimos quadrados generalizados sob omiss˜ao completamente aleat´oria . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 458 13.5.1 Metodologia dos m´ınimos quadrados generalizados em uma fase 459 13.5.2 Metodologia dos m´ınimos quadrados generalizados em duas fases460 13.6 Aplica¸c˜oes . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 462 13.7 Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 474 13.8 Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 477 14 M´ etodos de Inferˆ encia Condicional
489
14.1 Introdu¸c˜ao `a inferˆencia condicional exacta e assint´otica . . . . . . . . . 490 14.2 Testes de simetria
. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 493
14.2.1 Tabelas 2 × 2 . . . . . . . . . . . . . . . . . . . . . . . . . . . . 493 14.2.2 Extens˜oes a tabelas maiores . . . . . . . . . . . . . . . . . . . . 494 14.3 Inferˆencias sobre associa¸c˜ao em tabelas 2 × 2 . . . . . . . . . . . . . . 496 14.4 Testes de independˆencia em tabelas I × J . . . . . . . . . . . . . . . . 502 14.5 Testes de modelos log-lineares em tabelas tridimensionais . . . . . . . 507 14.5.1 Inferˆencias exactas sobre associa¸c˜ao em tabelas I × 2 × 2 . . . 508 14.5.2 Testes exactos de ajustamento em tabelas I × J × K . . . . . . 514
´ CONTEUDO
vi
14.6 Compara¸c˜ao de I tabelas 2 × 2 por m´etodos condicionais assint´oticos . 516 14.6.1 Inferˆencias sobre homogeneidade das RPC parciais . . . . . . . 517 14.6.2 Testes de independˆencia condicional . . . . . . . . . . . . . . . 521 14.7 Aplica¸c˜ao ao quadro de modelos de aleatoriza¸c˜ao e extens˜ao a tabelas I × J × K . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 523 14.8 Notas de Cap´ıtulo . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 530 14.9 Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 533
III
Apˆ endice
´ A Conceitos e resultados de Algebra Linear
545 547
A.1 Alguns resultados sobre espa¸cos vectoriais . . . . . . . . . . . . . . . . 547 A.2 Algumas breves no¸c˜oes sobre matrizes . . . . . . . . . . . . . . . . . . 551 A.3 Sistemas de equa¸c˜oes lineares . . . . . . . . . . . . . . . . . . . . . . . 558 A.4 Projec¸c˜oes de subespa¸cos . . . . . . . . . . . . . . . . . . . . . . . . . 560 A.5 Formas quadr´aticas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 563 A.6 Alguns resultados envolvendo diferencia¸c˜ao matricial . . . . . . . . . . 566 A.7 Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 569 B Conceitos e resultados de Teoria Assint´ otica
579
B.1 Ordens de magnitude de sequˆencias estoc´asticas . . . . . . . . . . . . . 579 B.2 Modos de convergˆencia estoc´astica e Leis dos Grandes N´ umeros . . . . 582 B.3 Teorema Limite Central e aplica¸c˜oes . . . . . . . . . . . . . . . . . . . 589 B.4 Exerc´ıcios . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 591 C Meios Computacionais
593
Parte I
Introdu¸c˜ ao e Modela¸c˜ ao Probabil´ıstica
Cap´ıtulo 1
Introdu¸c˜ ao 1.1
No¸c˜ oes preliminares sobre dados categorizados e exemplos
Este livro debru¸ca-se sobre m´etodos que foram desenvolvidos para an´alise de dados discretos relativos a uma ou, mais frequentemente, duas ou mais vari´aveis definidas qualitativamente atrav´es de um n´ umero finito de valores designados por n´ıveis ou categorias. Da´ı as designa¸c˜oes de vari´ aveis categorizadas e de dados categorizados. Consoante o n´ umero de categorias for 2, 3 ou maior que 3, as vari´aveis se dizem dicot´omicas (ou bin´arias), tricot´omicas ou polit´omicas, respectivamente. A An´ alise de Dados Categorizados ´e assim uma parte integrante da An´alise Multivariada, que visa evidenciar e interpretar a informa¸c˜ao relevante que est´a contida em dados discretos provenientes de contagens de eventos ou de unidades (pessoas, lugares, objectos) possuindo certas caracter´ısticas ou atributos definidos pela combina¸c˜ao das categorias de duas ou mais vari´aveis de interesse (ou apenas categorias de uma vari´avel). A an´alise de dados discretos univariados (e.g., gerados dos modelos binomial, hipergeom´etrico, binomial negativo, Poisson), descrita na larga maioria dos textos de Estat´ıstica e de Inferˆencia Estat´ıstica, surge como uma particulariza¸c˜ao dos m´etodos multivariados que ser˜ao aqui abordados. A importˆancia desta ´area da Estat´ıstica est´a relacionada com o facto de o seu objecto surgir frequentemente nos mais variados dom´ınios cient´ıficos (Agronomia, Ciˆencias Biom´edicas, Biologia, Gen´etica, Psicologia, Ciˆencias da Educa¸c˜ao, Economia, Ciˆencias Sociais e Pol´ıticas, etc). Descrevem-se em seguida algumas situa¸c˜oes pr´aticas onde os m´etodos considerados neste texto poder˜ao ser utilizados. Exemplo 1.1 (Problema dos acidentes de via¸c˜ ao): Durante 18 semanas de 1961 contaram-se os acidentes de via¸c˜ao registados na Su´ecia avaliando-se o tipo de estrada e o facto de haver ou n˜ao um limite de velocidade de 90 km/h no dia em que ocorreram. Pretendia-se saber, nomeadamente, se a imposi¸c˜ao do limite de velocidade influenciava a ocorrˆencia de acidentes de um modo diferente consoante o tipo de estrada. Os n´ umeros observados est˜ao apresentados na Tabela 1.1.
Cap´ıtulo 2
Modelos probabil´ısticos Neste cap´ıtulo descrevem-se os modelos probabil´ısticos usualmente assumidos para explicar a ocorrˆencia dos dados obtidos (de acordo com algum esquema amostral), na base dos quais s˜ao tra¸cadas as inferˆencias de interesse. Destacam-se ainda as interrela¸c˜oes existentes entre eles dada a sua relevˆancia para a formula¸c˜ao dos objectivos anal´ıticos e explica¸c˜ao de certos resultados inferenciais, mencionados em cap´ıtulos posteriores.
2.1
Processos de amostragem
A escolha de um determinado modelo probabil´ıstico depende n˜ao s´o do delineamento amostral mas tamb´em dos objectivos de an´alise. Se, por um lado, existem esquemas amostrais incompat´ıveis com os fins anal´ıticos pretendidos, por outro, certos prop´ositos inferenciais podem ser atingidos atrav´es de v´arios tipos de delineamento. Para ilustrar estas afirma¸c˜oes, suponha que se pretende realizar uma sondagem numa determinada regi˜ao a fim de se ter uma ideia da for¸ca eleitoral de um determinado candidato presidencial nesse meio. Em particular, pretende-se saber se a atitude de apoio ao candidato est´a ou n˜ao relacionada com a faixa et´aria da popula¸c˜ao dessa regi˜ao. Para isso decide-se abordar os transeuntes inquirindo se apoiam ou n˜ao o referido candidato e se a sua idade ´e ou n˜ao inferior a 40 anos. Sejam X1 (X1k ) e X2 (X2k ) as vari´aveis indicadoras (para o elemento k), respectivamente, do apoio (X1 = 1) ou n˜ao (X1 = 2) ao candidato e da idade do inquirido categorizada em “menos de 40 anos” (X2 = 1) e “pelo menos 40 anos” (X2 = 2). As frequˆencias observ´aveis {nij } (note-se que nij ´e o n´ umero de elementos para os quais X1 = i e X2 = j , i, j = 1, 2) podem ser assim dispostas numa tabela bidimensional 0 22 . Seja n = (n11 , n12 , n21 , n22 ) o vector dessas frequˆencias ordenadas lexicograficamente (i.e., com o u ´ltimo ´ındice a variar mais rapidamente do que os restantes, neste caso, o primeiro). Apresentam-se a seguir trˆes estrat´egias de amostragem. Estrat´ egia I. Uma estrat´egia poss´ıvel para tal sondagem ´e tentar entrevistar tantas pessoas quanto poss´ıvel, por exemplo, em 4 horas. Os resultados observados poder˜ao
´ 2.3 MODELOS HIPERGEOMETRICOS
32
produtos cruzados correspondente a qualquer par de vari´aveis n˜ao depende do n´ıvel da terceira vari´avel. Esta observa¸c˜ao, aliada ao facto de que ∆A(i) =
θ(i)11 θ(i)22 θ(i1)1 /θ(i1)2 = θ(i)12 θ(i)21 θ(i2)1 /θ(i2)2
(2.29)
P (note-se que k θ(ij)k = 1, i, j = 1, 2), permite compreender que as inferˆencias sobre HN I s˜ao compat´ıveis n˜ao s´o com os modelos condicionais definidos em (2.16) e (2.17), mas tamb´em com todos os modelos Produto de Multinomiais associados com a fixa¸c˜ao dos restantes totais marginais uni ou bivariados. Desnecess´ario ser´a dizer que todas as hip´oteses atr´as consideradas sobre os parˆametros do modelo Multinomial s˜ao tamb´em compat´ıveis com o modelo Produto de distribui¸c˜oes de Poisson.
2.3
Modelos hipergeom´ etricos
´ interessante notar que ainda se podem obter novas factoriza¸c˜oes de (2.12) e (2.13) E levando a um modelo associado `a tabela com ambas as margens P consideradas fixas. Com efeito, usando por comodidade θi(j) = µij /µ·j , i, j = 1, 2 ( i θi(j) = 1, j = 1, 2.), o factor ¡ ¢ f n11 , n12 | n·∗ , {θi(j) } referido com a forma de (2.6) pode exprimir-se, atendendo a que n11 + n12 = n1· , por Y ½µ n·j ¶ n n −n ¾ 1j ·j 1j θ1(j) θ2(j) = n 1j j=1,2 µ ¶µ ¶µ Á ¶ µ ¶ θ1(1) θ1(2) n11 θ1(2) n1· n·2 n·1 n·1 n·2 = θ2(2) θ2(1) n11 n1· − n11 θ2(1) θ2(2) θ2(2) ·µ ¶µ ¶ ¸ n·1 n·2 −n −n = ∆n11 φn1· (1 + φ) ·2 (1 + ∆φ) ·1 (2.30) n11 n1· − n11 em que ∆ = [θ1(1) θ2(2) ]/[θ1(2) θ2(1) ] e φ = θ1(2) /θ2(2) definem conjuntamente uma transforma¸c˜ao biun´ıvoca de (θ1(1) , θ1(2) ) ∈ (0, 1)2 sobre (IR+ )2 – note-se que θ2(1) = 1 − θ1(1) e θ2(2) = 1 − θ1(2) . Normalizando o primeiro factor (entre parˆenteses rectos) de modo a convertˆe-lo numa fun¸c˜ao de probabilidade e observando que t1 ≡ max (0, n1· − n·2 ) ≤ n11 ≤ min (n·1 , n1· ) ≡ t2 obt´em-se
f (n11 , n12 | n·∗ , ∆, φ)
µ ¶µ ¶ n n ·1 ·2 n11 ∆ n n1· − n11 11 = µ ¶µ ¶ t 2 X n·1 n·2 u ∆ u n − u 1· u=t1 " t µ ¶µ # ¶ 2 X n·1 n·2 × ∆u u n − u 1· u=t 1
−n·2
× φn1· (1 + φ)
−n·1
(1 + ∆φ)
(2.31)
Parte II
Modela¸c˜ ao Estrutural
Cap´ıtulo 3
Modelos estruturais lineares 3.1
Introdu¸c˜ ao
No cap´ıtulo anterior foi dada j´a uma ideia de algumas quest˜oes que s˜ao consideradas relevantes na an´alise de dados categorizados, atrav´es de exemplos concretos. De uma forma geral, as quest˜oes de interesse est˜ao relacionadas com uma redu¸c˜ao do n´ umero de parˆametros do modelo probabil´ıstico adoptado, exprimindo, pois, uma simplifica¸c˜ao da estrutura param´etrica do modelo. Da´ı o nome de modelos estruturais para a express˜ao matem´atica dessas quest˜oes. Conv´em observar, desde j´a, que a esses modelos estruturais devem ser associadas as restri¸c˜oes (naturais) eventualmente impostas pelo delineamento amostral, como sucede com o modelo Produto de Multinomiais (e, em particular, com o modelo Multinomial). Para a sua explicita¸c˜ao, considere-se que o conjunto das c celas da tabela esteja particionado em s subconjuntos Cq , q = 1, . . . s, em cada um dos quais a soma das probabilidades das celas correspondentes ´e 1. Esta parti¸c˜ao pode ser definida pela matriz D = (d1 , . . . , ds ), onde cada vector dq , q = 1, . . . , s de dimens˜ao igual a c, indica as celas de Cq da seguinte forma: as suas componentes s˜ao 1 ou 0 consoante as celas correspondentes pertencem ou n˜ao a Cq . Note-se que, por defini¸c˜ao, as colunas de D s˜ao ortogonais e, por conseguinte, o subespa¸co M(D) gerado por elas ´e um subespa¸co s-dimensional de IRc . 0
Sendo π = (π 01 , . . . , π 0s ) , onde π q ´e o vector das probabilidades associado `as celas de Cq , q = 1, . . . , s, as restri¸c˜oes naturais ficam expressas por 0
D0 π ≡ (d01 π, . . . , d0s π) = 1s .
(3.1)
A parametriza¸c˜ao alternativa do modelo probabil´ıstico em quest˜ao em termos do 0 vector µ = (µ01 , . . . , µ0s ) , onde µq = Nq π q , com Nq , q = 1, . . . , s, denotando o total dos elementos pertencentes `as celas de Cq , conduz a que as restri¸c˜oes naturais passem a ser expressas por 0 D0 µ = (N1 , . . . , Ns ) ≡ N. (3.2) c O conjunto dos valores de µ ´e ent˜ao {µ ∈ IR+ : D0 µ = N}.
50
3.4 MODELO LINEAR GERAL
para i, j = 1, . . . , I traduz o modelo de homogeneidade marginal referente `as margens ´ ´obvio que estes dois modelos s˜ao lineares e que HHM 1 cont´em HHM 2 bivariadas. E que, por sua vez, engloba o modelo de simetria completa (3.7). Note-se, contudo, que (3.12) n˜ao implica (3.13) que, por sua vez, n˜ao implica (3.7). Deve ainda observar-se que (3.12) P e (3.13) est˜ao numa forma sobreparametrizada em virtude da restri¸c˜ao natural i,j,k θijk = 1. Veja-se o Exerc´ıcio 3.1 para o n´ umero de restri¸c˜oes linearmente independentes definidoras destes modelos. Como foi referido para o caso de simetria, talvez a extens˜ao mais directa deste conceito de homogeneidade a tabelas I 2 × K seja definida pelo modelo de homogeneidade marginal condicional a cada n´ıvel da terceira vari´avel, i.e., HHM P : θi·k = θ·ik ,
(3.14)
para i = 1, . . . , I; k = 1, . . . , K. Este modelo ´e coerente com uma amostragem quer Multinomial quer produto de Multinomiais com os totais das camadas (n´ıveis da terceira vari´avel) fixos. Para generaliza¸c˜ao dos modelos de homogeneidade marginal e de simetria a tabelas multidimensionais veja-se a Nota de Cap´ıtulo 3.1.
3.4
Modelo linear geral
Nas estruturas de simetria e de homogeneidade marginal, a linearidade ´e definida no pr´oprio parˆametro indexante do modelo probabil´ıstico. Casos h´a, nos quais a relevˆancia est´a numa estrutura linear para fun¸c˜oes lineares desse parˆametro. Uma ilustra¸c˜ao poss´ıvel ´e fornecida no contexto do Exemplo 1.9 nos termos que se passa a descrever. Exemplo 3.3 (Problema do tamanho da ninhada): Admita-se que as frequˆencias da Tabela 1.11 podem ser descritas por um Produto de Multinomiais, M3 (nij· , π (ij) ), independentes, uma para cada amostra de ovelhas relativa a cada par (i, j) da quinta e ra¸ca a que est˜ao associadas. A compara¸c˜ao das subpopula¸c˜oes determinadas pela combina¸c˜ao dos n´ıveis das vari´ aveis definidoras de quinta e ra¸ca poder´a ser feita sensatamente em termos do tamanho m´edio da ninhada. A defini¸c˜ao desta quantidade neste caso levanta alguns problemas j´a que a u ´ltima categoria da vari´avel tomada como resposta resultou da fus˜ao das categorias representadas pelos inteiros ≥ 3. Desbloquear-se-´a a quest˜ao admitindo que o score atribu´ıdo a essa categoria ´e 3, com a justificativa de que partos com mais de trˆes borregos s˜ao raros. P Sendo π (ij) = (θ(ij)k , k = 0, 1, 2, 3)0 , k θ(ij)k = 1, o tamanho m´edio da ninhada 0 para a subpopula¸c˜ao (i, j) ´e dado por a0 π (ij) , onde a = (0, 1, 2, 3) . Definido π como o vector composto dos π (ij) , i, j = 1, 2, 3, onde as categorias A,B e C da ra¸ca foram identificadas por 1, 2 e 3, respectivamente, a fun¸c˜ao vectorial de interesse ´e ent˜ao F (π) ≡ (Fij ) = Aπ, onde A = I9 ⊗ a0 . O modelo que traduz uma ac¸c˜ao aditiva das duas vari´aveis explicativas (ou seja, a ausˆencia de interac¸c˜ao) no tamanho m´edio da ninhada pode ser definido por ½ F12 − F11 = F22 − F21 = F32 − F31 HN I : (3.15) F13 − F11 = F23 − F21 = F33 − F31
Cap´ıtulo 4
Modelos log-lineares para tabelas sem vari´ aveis explicativas Muitas das hip´oteses de relevˆancia para a an´alise de dados categorizados envolvem rela¸c˜oes multiplicativas entre os parˆametros dos modelos probabil´ısticos usualmente adoptados. Este ´e o caso das hip´oteses de multiplicatividade (2.3) e de independˆencia (2.5) descritas no Cap´ıtulo 2 no contexto dos modelos Produto de distribui¸c˜oes de Poisson e Multinomial. Tendo por base a maior facilidade no tratamento matem´atico de estruturas lineares em oposi¸c˜ao `as estruturas n˜ao lineares, a lineariza¸c˜ao dos modelos mencionados acima d˜ao margem aos chamados modelos log-lineares que s˜ao o objecto deste cap´ıtulo. Mais especificamente, trata-se aqui de modelos com estrutura linear no logaritmo das m´edias ou das probabilidades das celas de tabelas de contingˆencia envolvendo apenas vari´aveis respostas com o intuito de descrever padr˜oes de associa¸c˜ao entre elas. Deixa-se para o Cap´ıtulo 5 o tratamento de modelos com este tipo de estrutura apropriados para tabelas envolvendo alguma vari´avel explicativa. A Sec¸c˜ao 4.1 introduz a formula¸c˜ao log-linear do modelo probabil´ıstico sob diversas reparametriza¸c˜oes e o decorrente significado dos parˆametros log-lineares. As Sec¸c˜oes 4.2 - 4.4 descrevem detalhadamente a estrutura e o significado de diversos modelos loglineares apropriados para tabelas de dimens˜ao dois, trˆes, quatro ou superior, definidas unicamente por vari´aveis respostas. Estas estruturas, constru´ıdas `a semelhan¸ca dos modelos de An´alise de Variˆancia, incluem os modelos especiais tradutores de diferentes tipos de independˆencia probabil´ıstica. Neste contexto, retoma-se o modelo de simetria explicitando o seu enquadramento log-linear. Na Sec¸c˜ao 4.5 discute-se a quest˜ao da identidade entre associa¸c˜ao marginal e a correspondente associa¸c˜ao parcial quando controlada por vari´aveis adicionais. Na Sec¸c˜ao 4.6 a ordinalidade de algumas vari´aveis ´e explorada atrav´es de novos modelos log-lineares estruturados de forma an´aloga `a dos modelos de An´alise de Regress˜ao e/ou de An´alise de Covariˆancia.
70
4.2 MODELOS PARA TABELAS BIDIMENSIONAIS
dente a qualquer grupo de t vari´aveis neles inclu´ıdo, conterem todos os parˆametros de ordem inferior associados a qualquer subgrupo dessas t vari´aveis. Esta classe especial de modelos log-lineares tem a vantagem de usufruir frequentemente uma maior simplicidade interpretativa e anal´ıtica. A maioria dos modelos log-lineares analisados neste cap´ıtulo s˜ao hier´arquicos, embora lide-se por vezes, como na Subsec¸c˜ao 4.2.4, com modelos n˜ao hier´arquicos. Atendendo `a enorme variedade de modelos log-lineares para tabelas multidimensionais, existem modelos que s˜ao casos particulares de outros no sentido em que estes se reduzem `aqueles por remo¸c˜ao de termos. Diz-se ent˜ao que os primeiros est˜ao encaixados (nested, na literatura anglo-sax´onica) nos segundos. Formalizando: Defini¸ c˜ ao 4.2: Dados dois modelos log-lineares M1 e M2 , diz-se que M1 est´a encaixado em M2 se os parˆametros de M1 s˜ao um subconjunto dos parˆametros de M2 . Exemplificando com os modelos em (4.21), M2 est´a encaixado em qualquer dos restantes, e M1 est´a encaixado em M4 . Qualquer deles est´a naturalmente encaixado no modelo log-linear saturado.
4.2
Modelos log-lineares para tabelas bidimensionais
Esta sec¸c˜ao ser´a confinada a tabelas I × J (no formato da tabela gen´erica do Cap´ıtulo 1, s = 1 e r = IJ) sob modela¸c˜ ao Multinomial de parˆametros N (conhecido) e θ. O caso do modelo Produto de distribui¸c˜oes de Poisson suscita um tratamento, em termos de m´edias n˜ao vinculadas a qualquer restri¸c˜ao natural, essencialmente idˆentico, como tamb´em acontece em tabelas de dimens˜ao superior, desde que se inclua a coluna 1r nas matrizes de especifica¸c˜ao dos modelos log-lineares correspondentes.
4.2.1
Modelos para diferentes padr˜ oes de associa¸c˜ ao
Na estrutura saturada definida em (4.11) existem, como foi visto, (I −1) (J −1) interac¸c˜oes linearmente independentes. Considerar-se-´a ent˜ao o modelo log-linear reduzido resultante do anulamento de todas essas interac¸c˜oes (o modelo M1 em (4.21)), i.e., em termos de θ B ln θij = λ + uA (4.24) i + uj , P A P B para i = 1, . . . , I, j = 1, . . . , J com i ui = j uj = 0. Numa forma compacta, (4.24) ´e expresso por µ ¶ λ ln θ = (1c , X) (4.25) β onde c = IJ, β ´e o vector de p = I +J −2 efeitos principais linearmente independentes e X ´e a matriz c × p de especifica¸c˜ao associada. Esta matriz ´e obtida da matriz de
82
4.4 MODELOS PARA TABELAS TETRADIMENSIONAIS
(e, bem entendido, dos dois tipos de conjuntos de RPC restantes). Esta condi¸c˜ao C(k) de {∆ij , i 6= I, j 6= J} serem funcionalmente independentes de k, pode ser expressa pelas rela¸c˜oes C(k)
∆ij
C(K)
/∆ij
= 1,
(4.42)
para i = 1, . . . , I − 1, j = 1, . . . , J − 1, k = 1, . . . , K, o que deixa transparecer mais facilmente o anulamento dos termos uABC quando os parˆametros loglineares tˆem a interpreta¸c˜ ao (4.35).
4.4
Modelos log-lineares para tabelas tetradimensionais e de dimens˜ ao superior
Como foi visto anteriormente, o modelo log-linear saturado para uma tabela tridimensional pode ser constru´ıdo a partir dos correspondentes modelos para tabelas bidimensionais definidas pela fixa¸c˜ao das categorias de qualquer uma das vari´aveis envolvidas. A constru¸c˜ao do modelo log-linear saturado para uma tabela de dimens˜ao d > 3 pode processar-se de um modo an´alogo com base em modelos para tabelas parciais de dimens˜ao d − 1. Para uma ilustra¸c˜ao deste procedimento considerar-se-´a o caso da tabela I × J × K × L de probabilidades {θijkl }, definida pelas vari´aveis respostas Xi , i = 1, 2, 3, 4. Designe-se o modelo log-linear para a tabela tridimensional definida pelo n´ıvel l (l = 1, . . . , L) de X4 por A(l)
ln θijkl = λ(l) +ui
B(l)
+uj
C(l)
+uk
AB(l)
+uij
AC(l)
+uik
BC(l)
+ujk
ABC(l)
+uijk
,
(4.43)
para i = 1, . . . , I, j = 1, . . . , J, k = 1, . . . , K, l = 1, . . . , L, onde os termos do segundo membro indexados inferiormente satisfazem as restri¸c˜oes de identificabilidade de soma nula usuais. Tomando m´edias dos parˆametros log-lineares de (4.43) obtˆem-se os termos do modelo tetradimensional que n˜ao envolvem a vari´avel X4 , i.e., λ, uA , uB , uC , uAC , uBC e uABC . Por exemplo uA i
=
L
−1
L
−1
L X
A(l)
ui
l=1
uAB ij uABC ijk
= =
L−1
L X l=1 L X
AB(l)
(4.44)
uij
ABC(l)
uijk
.
l=1
Os termos envolvendo X4 s˜ao obtidos como desvios entre os termos de (4.43) e as
´ 4.6 MODELOS PARA VARIAVEIS ORDINAIS
92
4.6.2
Tabelas tridimensionais
Os modelos log-lineares ordinais para uma tabela bidimensional podem ser prontamente generalizados a tabelas de dimens˜ao superior, como se evidenciar´a agora atrav´es da ilustra¸c˜ao a tabelas tridimensionais I × J × K. Devido `a liberdade de explora¸c˜ao da ordinalidade nos termos de interac¸c˜ao, considerar-se-´a sem quebra de generalidade a situa¸c˜ao em que todas as vari´ aveis s˜ao ordinais. Deste modo, alguns dos modelos que se descrever˜ao revelam-se naturalmente apropriados para o caso em que uma ou duas das vari´aveis s˜ao nominais. Designar-se-˜ao os scores de X1 , X2 e X3 por {ai }, {bj } e {ck }, respectivamente, sempre ordenados de forma crescente. Devido ao car´acter assumidamente ordinal das vari´aveis, optou-se por descrever as associa¸c˜oes condicionais entre duas vari´aveis, dentro de um n´ıvel fixo da terceira, C(k) B(j) A(i) atrav´es das RPC locais {ψij }, {ψik } e {ψjk }, onde exemplificadamente C(k)
ψij
=
µijk µi+1,j+1,k , µi,j+1,k µi+1,j,k
(4.54)
para 1 ≤ i ≤ I − 1, 1 ≤ j ≤ J − 1, 1 ≤ k ≤ K. Por sua vez, o termo de interac¸c˜ao de segunda ordem ´e tamb´em definido localmente atrav´es da raz˜ao dessas RPC locais em dois n´ıveis consecutivos C(k+1)
ψijk =
ψij
C(k)
ψij
A(i+1)
B(j+1)
≡
ψik
B(j)
ψik
≡
ψjk
A(i)
ψjk
.
(4.55)
Deste modo, {ψijk , 1 ≤ i ≤ I −1, 1 ≤ j ≤ J −1, 1 ≤ k ≤ K −1} descrevem a interac¸c˜ao de segunda ordem em subtabelas 23 consistindo de linhas, colunas e camadas todas adjacentes. A explora¸c˜ao da ordena¸c˜ao das categorias de uma ou mais vari´aveis no termo {uABC ijk } do modelo log-linear saturado permite construir modelos encaixados entre este e o modelo de associa¸c˜ao parcial (AB, AC, BC). Por exemplo, definindo uABC = v ABC (ai − a)(bj − b)(ck − c), ijk para i = 1, . . . , I, j = 1, . . . , J, k = 1, . . . , K , uma das estruturas mais simples (linear por linear × linear) para a interac¸c˜ao de segunda ordem, obt´em-se um modelo que tem apenas mais um parˆametro do que o modelo (AB, AC, BC) e que ´e reduzido sempre que I, J ou K s˜ao maiores do que 2. O facto de C(k)
ln ψij
=
AB AB AB uAB ij − ui,j+1 − ui+1,j + ui+1,j+1
+v ABC (ai+1 − ai )(bj+1 − bj )(ck − c) para 1 ≤ i ≤ I − 1, 1 ≤ j ≤ J − 1 com express˜oes semelhantes para os outros dois conjuntos de RPC parciais, mostra que o logaritmo de toda a RPC para qualquer par de vari´aveis ´e uma fun¸c˜ao linear dos n´ıveis da terceira vari´avel. Consequentemente ln ψijk = v ABC (ai+1 − ai )(bj+1 − bj )(ck+1 − ck ),
Cap´ıtulo 5
Modelos log-lineares para tabelas com vari´ aveis explicativas Na sequˆencia do cap´ıtulo anterior, este cap´ıtulo continua a debru¸car-se sobre o tipo log-linear de modelos estruturais mas agora inseridos em tabelas em que algumas das vari´aveis s˜ao explicativas, de especial relevˆancia para modelos Produto de Multinomiais. Estes modelos log-lineares, constru´ıdos `a semelhan¸ca do descrito no cap´ıtulo anterior, s˜ao formulados equivalentemente como modelos lineares em logaritmos de chances das probabilidades das celas e postos em correspondˆencia com apropriados modelos log-lineares para um quadro Multinomial ou Produto de distribui¸c˜oes de Poisson, referidos nas v´arias sec¸c˜oes do Cap´ıtulo 4.
5.1
As v´ arias formula¸co ˜es log-lineares
Em conformidade com o Cap´ıtulo 2, a estrutura das tabelas com alguma vari´avel considerada explicativa, seja por delineamento ou por condicionamento, vai ser enquadrada no modelo Produto de Multinomiais. Em termos da tabela gen´erica s × r descrita no Cap´ıtulo 1, este modelo ´e definido pela fam´ılia de distribui¸c˜oes Multinomiais independentes, Mr−1 (nq· , π q ), onde π q = (θ(q)m , m = 1, . . . , r)0 com 10r π q = 1, para q = 1, . . . , s. Em face deste modelo, o modo mais natural e directo de introduzir a estrutura log-linear ´e atrav´es da conjuga¸c˜ao de modelos log-lineares para todas as Multinomiais. Seja ent˜ao ln π q = 1r λq + X0q β 0q (5.1) o modelo log-linear saturado para a linha q (q = 1, . . . , s) da tabela, onde X0q ´e uma matriz r × (r − 1) de caracter´ıstica m´axima tal que r([1r , X0q ]) = r, q = 1, . . . , s. Por
122
5.3 TABELAS TRIDIMENSIONAIS
B AB para 1 ≤ i ≤ s, 1 ≤ j ≤ r − 1 com γj = uB j − uj+1 e δ(i)j = wi (bj − bj+1 ).
Usando scores igualmente espa¸cados, o parˆametro −wiAB (respectivamente wiAB ) pode ser visto como o efeito da linha i no logito de qualquer categoria de resposta relativamente `a categoria adjacente seguinte (respectivamente anterior), por distˆancia entre os correspondentes scores. Neste caso, os gr´aficos dos r −1 logitos adjacentes em fun¸c˜ao de i s˜ao paralelos, caracter´ıstica que leva Goodman (1983) a designar (5.21) como o modelo de chances paralelas. O recurso `a Proposi¸c˜ao 5.1 permite comprovar que o modelo linear (5.21) ´e efetivamente uma formula¸c˜ao equivalente do modelo log-linear global (5.20). Para uma comprova¸c˜ao exemplificativa retome-se o contexto do Exemplo 5.1: Exemplo 5.1 (continua¸ c˜ ao): O modelo (5.21) exprime-se matricialmente por (5.10) com 1 −1 b1 − b2 µ ¶ 1 1 −1 0 2 b2 − b3 A = I2 ⊗ e XG = 0 1 −1 1 −1 b2 − b1 1 2 b3 − b2 AB 0 B associada ao parˆametro β = (uB 1 , u2 , w1 ) . Como µ ¶ 1 0 2 1 1 2 1 1 × I2 ⊗ A0 (AA0 )−1 = I2 ⊗ −1 = I2 ⊗ −1 1 2 3 3 0 −1 −1
1 1 −2
resulta que £ 0 ¤0 0 −1 A (AA ) XG =
1 0 b1 − b
0 1 b2 − b
−1 −1 b3 − b
1 0 b − b1
0 1 b − b2
−1 −1 b − b3
cuja transposta ´e precisamente a matriz X de especifica¸c˜ao do modelo (5.20) na sua formula¸c˜ao matricial global, pretendia-se mostrar.
5.3
Tabelas tridimensionais
Numa tabela I × J × K o modelo Produto de Multinomiais pode revestir uma de duas formas consoante haja apenas uma ou duas vari´aveis explicativas. Discutir-se-˜ao os dois casos separadamente j´a que deles depende, em certa medida, o pr´oprio tipo de quest˜oes de interesse e, em consonˆancia, a sua representa¸c˜ao log-linear.
5.3.1
Tabelas com um factor
Seja X1 a u ´nica vari´avel explicativa definidora de s = I subpopula¸c˜oes. O modelo loglinear saturado para esta tabela ´e a s´ıntese dos s modelos log-lineares bidimensionais
´ 5. MODELOS LOG-LINEARES COM VARIAVEIS EXPLICATIVAS
133
Sob este modelo A(i)
= v BC (bj+1 − bj )(ck+1 − ck )
B(j)
AC = (wi+1 − wiAC )(ck+1 − ck )
L(ij)k − L(i,j+1)k = ln ψjk L(ij)k − L(i+1,j)k = ln ψik
mostrando que os efeitos de X2 e de X1 na resposta n˜ao dependem, respectivamente, de X1 e de X2 , e que as correspondentes distribui¸c˜oes condicionais da resposta dado X2 (em qualquer n´ıvel de X1 ) e dado X1 (em qualquer n´ıvel de X2 ) s˜ao estocasticamente ordenadas de acordo com o sinal de v BC e com a ordena¸c˜ao dos {wiAC }, respectivamente. Estas caracter´ısticas de (5.40) s˜ao perfilhadas como se viu na Subsec¸c˜ao 4.6.2, pelo modelo tridimensional (4.58), o que n˜ao ´e de espantar j´a que este implica (5.40). Contudo, ´e incorrecto afirmar que (5.40) corresponde a (4.58), j´a que existem outros modelos tridimensionais que s˜ao compat´ıveis com aquele. O modelo mais geral nestas condi¸c˜oes ´e definido por B C AB AC BC ln θijk = u + uA (bj − b)(ck − c) i + uj + uk + uij + wi (ck − c) + v
(5.41)
com as restri¸c˜oes usuais, diferindo de (4.58) por n˜ao atribuir uma estrutura especial ao termo de associa¸c˜ao parcial X1 −X2 . Como no contexto em quest˜ao n˜ao faz sentido definir esse termo, o que se reflecte na express˜ao dos modelos log-lineares apropriados, afigura-se mais l´ogico pˆor (5.40) em correspondˆencia formal com (5.41), por ser este o modelo log-linear tridimensional mais geral que induz aquele. Raz˜oes adicionais de ordem inferencial, que ser˜ao avan¸cadas no Cap´ıtulo 9, justificam esta escolha para o estabelecimento de uma correspondˆencia entre modelos lineares em logitos e apropriados modelos log-lineares que tratam todas as vari´aveis como respostas.
5.4
Tabelas tetradimensionais
A deriva¸c˜ao das v´arias formula¸c˜oes log-lineares em tabelas de dimens˜ao 2 e 3 com alguma vari´avel explicativa fornece j´a os instrumentos essenciais para a extens˜ao desse procedimento a 4 ou mais dimens˜oes. Nesta sec¸c˜ao vai-se ainda considerar explicitamente o caso de uma tabela tetradimensional, uma vez que nesta ´e poss´ıvel deparar-se com uma situa¸c˜ao envolvendo mais de um factor e de uma resposta, o que ´e imposs´ıvel em tabelas de dimens˜ao inferior. O tratamento das trˆes situa¸c˜oes distintas numa tabela tetradimensional poder´a seguir uma via idˆentica `a usada prioritariamente nas Sec¸c˜oes 5.2 e 5.3, assente na parametriza¸c˜ao usual de tipo ANOVA associada com restri¸c˜oes de soma nula. Contudo, optar-se-´a aqui pelo uso da parametriza¸c˜ao da cela de referˆencia por raz˜oes que se prendem com a conveniˆencia de uma mais detalhada ilustra¸c˜ao desta via, secundarizada nas subsec¸c˜oes anteriores, e com a menor morosidade que elas proporcionam na consecu¸c˜ao dos objectivos que se tem vindo a perseguir.
´ 5. MODELOS LOG-LINEARES COM VARIAVEIS EXPLICATIVAS
139
A simplifica¸c˜ao adicional deste u ´ltimo modelo linear nos logitos atrav´es da remo¸c˜ao de {γkl } do termo wCD equivale `a factoriza¸c˜ao θ(ij)kl = θ(ij)k· θ(ij)·l , para i = 1, . . . , I, j = 1, . . . , J, k = 1, . . . , K, l = 1, . . . , L, representando pois a independˆencia condicional das respostas em cada subpopula¸c˜ao (traduzida pelo modelo (ABC, ABD)). Antes de terminar-se este caso deve-se chamar a aten¸c˜ao de que os modelos tetradimensionais sem algum termo que envolva exclusivamente as vari´aveis X1 ou X2 (e.g., uAB ) n˜ao tˆem aqui qualquer significado.
5.4.3
Tabelas com trˆ es factores
Sendo X1 , X2 e X3 as vari´aveis definidoras das s = IJK subpopula¸c˜oes, o modelo loglinear saturado ´e o conjunto dos s modelos unidimensionais para as r = L categorias de resposta. ln θ(ijk)l = λijk + uD (5.50) (ijk)l , para i = 1, . . . , I, j = 1, . . . , J, k = 1, . . . , K , onde, sob a parametriza¸c˜ao face `a cela de referˆencia L em cada subpopula¸c˜ao, se tem λijk = ln θ(ijk)L e uD (ijk)l = ln [θ(ijk)l /θ(ijk)L ] ≡ L(ijk)l . Cada um dos parˆametros, λijk e uD (ijk)l , para cada l, pode reparametrizado em termos de desvios relativamente `a subpopula¸c˜ao de referˆencia (I, J, K) numa extens˜ao do processo descrito no caso II. Este processo equivale a uma reparametriza¸c˜ao de tipo (4.35) nas quantidades {ln θ(ijk)l } com l considerado fixo, definida para 1 ≤ l ≤ L por ln θ(ijk)l = ln θ(IJK)l + ln [θ(iJK)l /θ(IJK)l ] + ln [θ(IjK)l /θ(IJK)l ] + ln [θ(IJk)l /θ(IJK)l ] θ
θ
θ
θ
θ
θ
(iJk)l (IJK)l (ijK)l (IJK)l + ln [ θ(iJK)l θ(IjK)l ] + ln [ θ(iJK)l θ(IJk)l ]
(5.51)
(IJK)l + ln [ θ(Ijk)l ] + ln [ρijkl /ρijKl ] (IjK)l θ(IJk)l
em que ρijkl =
θ(ijk)l θ(IJk)l , θ(iJk)l θ(Ijk)l
para 1 ≤ i ≤ I − 1, 1 ≤ j ≤ J − 1, k = 1, . . . , K, l = 1, . . . , L. Deste modo, os parˆametros de (5.50) podem exprimir-se por λijk
=
ABC BC AB AC + wijk + wjk + wik w + wiA + wjB + wkC + wij
uD (ijk)l
=
AD BD CD wlD + wil + wjl + wkl ABCD BCD ACD ABD + wijkl + wjkl + wikl +wijl
(5.52)
Cap´ıtulo 6
Modelos funcionais lineares Neste cap´ıtulo considera-se uma ampla classe de modelos estruturais que engloba aqueles discutidos anteriormente. Inicia-se a exposi¸c˜ao descrevendo-se alguns modelos log-lineares cujas particularidades n˜ao justificam a sua inclus˜ao no Cap´ıtulo 5; al´em disso apresentam-se algumas extens˜oes desses modelos denominadas modelos log-lineares generalizados. Aborda-se em seguida a classe dos modelos funcionais lineares, que essencialmente engloba todos aqueles descritos at´e aqui. Evidentemente focam-se apenas aquelas subclasses de modelos mais comuns, deixando para os exemplos dos demais cap´ıtulos a descri¸c˜ao de casos mais espec´ıficos. Termina-se o cap´ıtulo com uma breve exposi¸c˜ao sobre os chamados modelos lineares generalizados numa classe ainda mais abrangente (sob o ponto de vista estrutural) que tem atra´ıdo a aten¸c˜ao de in´ umeros pesquisadores nas u ´ltimas duas d´ecadas.
6.1
Modelos log-lineares generalizados
Na Sec¸c˜ao 5.1 demonstrou-se (Proposi¸c˜ao 5.1) que a formula¸c˜ao ordin´aria do modelo log-linear no cen´ario Produto de Multinomiais, ln π = (Is ⊗ 1r )λ + Xβ, definida em (5.8), ´e equivalente `a formula¸c˜ao (5.10) A ln π = XG β
(6.1)
em que A ´e uma matriz s(r − 1) × sr de caracter´ıstica m´axima cujo espa¸co nulo cont´em os vectores gerados pelas colunas de D = Is ⊗ 1r , i.e., tal que AD = 0. Este resultado abrange os modelos Multinomial e Produto de distribui¸c˜oes de Poisson (fa¸ca-se s = 1), desde que neste u ´ltimo a estrutura log-linear seja definida no vector de m´edias e inclua o vector 1r . A formula¸c˜ao (6.1) ´e particularmente adequada quando se considera pelo menos uma das vari´aveis definidoras da tabela a desempenhar um papel explicativo da variabilidade das restantes (em n´ umero de pelo menos uma), encaradas como vari´aveis
6. MODELOS FUNCIONAIS LINEARES
6.2
161
Outros modelos funcionais lineares
No cen´ario Produto de Multinomiais, a substitui¸c˜ao do primeiro membro de (6.1) por uma fun¸c˜ao vectorial gen´erica de π conduz `a classe geral dos modelos funcionais lineares. O modelo funcional linear pode assim ser definido por F(π) = Xβ
(6.19)
em que F(π) = (Fk (π), k = 1, . . . , u)0 ´e um vector de u ≤ s(r − 1) fun¸c˜oes param´etricas de interesse e a matriz X de especifica¸c˜ao do modelo, associada a um vector β, de dimens˜ao p × 1, de parˆametros, ´e uma matriz u × p de caracter´ıstica p ≤ u. A substitui¸c˜ao em (6.19) de π pelo vector das m´edias ou das taxas de ocorrˆencia por unidade de exposi¸c˜ao do modelo Produto de distribui¸c˜oes de Poisson define o modelo funcional linear para este contexto. Por raz˜oes que se prendem com a viabiliza¸c˜ao da sua an´alise estat´ıstica, e que se tornar˜ao claras na Parte III do livro, as fun¸c˜oes F(π) em (6.19) devem satisfazer certas condi¸c˜oes de regularidade, que se resumem em seguida: a) Definindo em que
π = (π i , i = 1, . . . , s)0 , π i = (θ(i)j , j = 1, . . . , r − 1)0 ,
e denotando por G(·), o vector u × 1 que resulta de F(·) quando em cada π i se Pr−1 substitui θ(i)r pela express˜ao 1 − j=1 θ(i)j [pelo que G(π) = F(π)], as fun¸c˜oes Gk (π), k = 1, . . . , u tˆem derivadas parciais cont´ınuas at´e segunda ordem num conjunto aberto contendo π. b) Sendo V(π) = diag [Vi (π i ), i = 1, . . . , s], em que Vi (π i ) = [Dπi − π i π 0i ] /ni· ´e a matriz de covariˆancias do vector de propor¸c˜oes amostrais (sem o u ´ltimo elemento de cada subpopula¸c˜ao) (ni1 , . . . , ni(r−1) )0 /ni· , i = 1, . . . , s, a matriz das primeiras derivadas de G em ordem a π, H(π) = ∂G(z)/∂z |z=π , ´e tal que a matriz H(π)V(π)[H(π)]0 ´e n˜ao singular. Observe-se que (6.19), ao traduzir que F(π) ´e um vector do subespa¸co p-dimensional de IRu , M(X), equivale em termos de restri¸c˜oes a UF(π) = 0(u−p)
(6.20)
em que U0 ´e uma matriz u × (u − p) base do complemento ortogonal de M(X), pelo que X0 U0 = 0(p,u−p) .
170
6.3 MODELOS LINEARES GENERALIZADOS
µ A3 =
1 0
−1 0
−1 −1 0 0 0 0 0 1 1 1 ¡ ¢ A4 = 1 −1 .
¶ ,
Numa situa¸c˜ao em que existe uma tabela quadrada do tipo mencionado para v´arias subpopula¸c˜oes definidas por uma ou mais vari´aveis explicativas (por exemplo, na situa¸c˜ao do Exemplo 1.2 poder-se-ia imaginar uma estratifica¸c˜ao pelo sexo, entre outras vari´aveis) tem interesse n˜ao s´o analisar o n´ıvel de concordˆancia medido por (6.38) em cada subpopula¸c˜ao, como tamb´em saber se h´a diferen¸cas entre eles. Sendo agora π o vector composto das probabilidades π i de classifica¸c˜ao cruzada para as s subpopula¸c˜oes, o vector das s medidas Kapa ´e definido por uma express˜ao do tipo de (6.39) com θ e Aq substitu´ıdos por π e Is ⊗ Aq , q = 1, . . . , 4, respectivamente. O operador escalar exp ´e evidentemente substitu´ıdo pelo correspondente operador vectorial. Deste modo, interessa analisar modelos funcionais lineares (6.19), em que a parte linear Xβ descreve efeitos dos factores nas medidas de concordˆancia Kapa. Landis & Koch (1977) consideram modelos deste tipo para an´alise da concordˆancia entre dois observadores. A representa¸c˜ao da estrutura de concordˆancia/discordˆancia pela medida Kapa ou qualquer func˜ao param´etrica alternativa (vide Nota de Cap´ıtulo 6.5 para a generaliza¸c˜ao dessa medida) ´e sempre restritiva pela perda de informa¸c˜ao envolvida no resumo de uma tabela de probabilidades por um n´ umero. Da´ı a necessidade de desenvolvimento de modelos estruturais que consigam descrever mais minuciosamente as rela¸c˜oes entre os dois processos de classifica¸c˜ao. Agresti (2002) refere trabalhos relevantes nesta direc¸c˜ao e descreve alguns modelos apropriados.1
6.3
Modelos lineares generalizados
Todos os modelos estruturais referidos na Parte II do texto tˆem a particularidade de serem lineares nalguma fun¸c˜ao do parˆametro indexante dos modelos probabil´ısticos b´asicos para dados categorizados. Esta caracter´ıstica, rotulada como funcional linear, pode ser captada alternativamente pela designa¸c˜ao linear generalizada e, deste modo, tais modelos estat´ısticos constituir˜ao uma parte estrita (pela particulariza¸c˜ao do seu suporte probabil´ıstico) da larga classe dos, assim chamados, modelos lineares generalizados. N˜ao ´e neste sentido mais lato que se entende a designa¸c˜ao atribu´ıda a esta sec¸c˜ao, mas sim no sentido restrito em que vem sendo copiosamente usada na literatura es´ devido ao facto de a teoria tat´ıstica, particularmente desde o in´ıcio da d´ecada de 80. E dos modelos lineares generalizados, introduzida por Nelder & Wedderburn (1972) e extensivamente tratada em McCullagh & Nelder (1989), entre outros, constituir desde 1 Dentre eles, destacam-se os modelos de qu´ asi-simetria (4.28) e os modelos de qu´ asiindependˆ encia, objetos da Nota de Cap´ıtulo 4.?.
174
6.3.2
6.3 MODELOS LINEARES GENERALIZADOS
Alternativas ao modelo de regress˜ ao log´ıstica
Viu-se na Subsec¸c˜ao 6.1.1 que o modelo de regress˜ao log´ıstica, em particular com uma u ´nica vari´avel explicativa cont´ınua, exprime a probabilidade de sucesso em fun¸c˜ao de x, π(x), como π(x) = F (α + βx) (6.48) em que onde F (·) ´e a fun¸c˜ao de distribui¸c˜ao log´ıstica reduzida. Por outras palavras, se β > 0, (respectivamente, β < 0) π(x) (1 − π(x)) representa a fun¸c˜ao de distribui¸c˜ao log´ıstica de parˆametro de localiza¸c˜ao λ = −α/β e parˆametro de escala δ = 1/|β|. O gr´afico da fun¸c˜ao (6.48), denominada fun¸c˜ao de regress˜ao log´ıstica, tem uma forma de S, crescente ou decrescente consoante β > 0 ou β < 0. Veja-se Nota de Cap´ıtulo 6.6 para mais detalhes sobre a curva de regress˜ao log´ıstica. Sendo ni1 o n´ umero de sucessos em ni. observa¸c˜oes correspondentes ao valor xi de x, a constru¸c˜ao dos gr´aficos dos logitos amostrais, ln[ni1 /(ni. − ni1 )], ou dos denominados logitos emp´ıricos ln
ni1 + 1/2 , ni. − ni1 + 1/2
(6.49)
que visam obviar os problemas surgidos com Pos primeiros quando ni1 = 0, ni. (quando o n´ umero de valores de x ´e da ordem de i ni. , deve-se primeiro agrupar os dados para a constru¸c˜ao dos gr´aficos), permite ter uma ideia da razoabilidade ou n˜ao do modelo. Em v´arios problemas este gr´afico revela desvios significativos da linearidade, particularmente nos extremos da gama de valores de π(x). A procura de novos modelos mais adequados pode ser feita em v´arias direc¸c˜oes (veja-se a Nota de Cap´ıtulo 6.2). Uma das vias consiste em procurar novas fun¸c˜oes de distribui¸c˜ao F , cont´ınuas e estritamente crescentes tais que (6.48), ou seja, F −1 [π(x)] = α + βx
(6.50)
possa traduzir razoavelmente bem o comportamento dos dados. A express˜ao (6.50) revela que tais modelos no mesmo contexto probabil´ıstico (Produto de Binomiais) s˜ao lineares generalizados onde a fun¸c˜ao de liga¸c˜ao, que transforma [0, 1] em IR, ´e a inversa da fun¸c˜ao de distribui¸c˜ao F . Note-se que no modelo de regress˜ao log´ıstica, a inversa da fun¸c˜ao de distribui¸c˜ao log´ıstica reduzida ´e a fun¸c˜ao logito. Em experiˆencias toxicol´ogicas ´e comum usar-se para F (·) a fun¸c˜ao de distribui¸c˜ao Normal reduzida pelo facto de se verificar que a distribui¸c˜ao de tolerˆancia para o logaritmo da dosagem ´e aproximadamente Normal. Deste modo, utilizando o s´ımbolo Φ para denotar a fun¸c˜ao de distribui¸c˜ao da N (0, 1), a estrutura Φ−1 [π(x)] = α + βx
(6.51)
em que α = −µ/σ e β = 1/σ, com µ e σ designando a m´edia e o desvio padr˜ao da distribui¸c˜ao de tolerˆancia Normal, representa um novo modelo de dose-resposta que ´e tamb´em linear generalizado com fun¸c˜ao de liga¸c˜ao Φ−1 (·). Denominar-se-´a esta liga¸c˜ao de probito, em referˆencia ao termo anglo-sax´onico probit, e, em decorrˆencia, o modelo (6.51) ser´a rotulado como um modelo linear no probito.
Cap´ıtulo 7
A metodologia de m´ axima verosimilhan¸ ca Considere-se uma tabela gen´erica formada por c celas com vector de frequˆencias n = (n1 , . . . , nc )0 , descrito por um modelo probabil´ıstico indexado pelo vector de c m´edias µ = (µ1 , . . . , µc )0 ∈ IR+ , cuja fun¸c˜ao de probabilidade ´e denotada por f (n|µ). O objectivo central da an´alise da tabela ´e procurar um modelo estrutural interpretativamente t˜ao simples quanto poss´ıvel que propicie um bom ajustamento aos dados. Exprima-se um modelo estrutural a ajustar a µ, em termos gerais, por H:
µ = µ(β)
(7.1)
c em que β ´e um vector de p ≤ c parˆametros desconhecidos. O subconjunto de IR+ de valores de µ considerado admiss´ıvel por este modelo ´e gerado pela varia¸c˜ao de β ao longo do espa¸co correspondente (IRp ) atrav´es da fun¸c˜ao µ(β), suposta bem comportada no sentido de ser identific´avel (recorde-se a Nota de Cap´ıtulo 4.1) e continuamente diferenci´avel (at´e `a ordem dois) com matriz jacobiana c × p, M(β) = ∂µ/∂β 0 (com linhas ∂µi /∂β 0 , i = 1, . . . , c), de caracter´ıstica p.
7.1
Estima¸c˜ ao param´ etrica
O primeiro passo para a prossecu¸c˜ao do objectivo mencionado consiste na estima¸c˜ao de β (ou de µ sob H) que, na abordagem em causa, ´e efectuada vulgarmente pela aplica¸c˜ao do m´etodo da m´axima verosimilhan¸ca (MV), consistindo na maximiza¸c˜ao da fun¸c˜ao de verosimilhan¸ca L(β|n) = f (n|µ(β)). Recorde-se desde j´a que se mant´em a conven¸c˜ao, por motivos de simplicidade notacional, de usar o mesmo s´ımbolo para fun¸c˜oes relacionadas mas distintas, em que a distin¸c˜ao ´e explicitada pelo respectivo argumento. Assim, e para simplifica¸c˜ao, a fun¸c˜ao de verosimilhan¸ca ´e sempre designada pelo s´ımbolo L(.), servindo o argumento para indicar qual a parametriza¸c˜ao usada, e.g., µ ou β.
´ 7. A METODOLOGIA DE MAXIMA VEROSIMILHANC ¸A
195
Quando em cada itera¸c˜ao se substitui a matriz hessiana (encarada como fun¸c˜ao de n) pelo sim´etrico do seu valor esperado para cada β, a denominada matriz de informa¸ c˜ ao de Fisher em β IN (β) = E[−J(β; n)|β] = [M(β)]0 IN [µ(β)]M(β),
(7.7)
em que IN (µ) ´e a matriz de informa¸c˜ao de Fisher correspondente a µ, obt´em-se uma variante do m´etodo de Newton-Raphson β (q) = β (q−1) + [IN (β (q−1) )]−1 U(β (q−1) ; n),
q = 1, 2, . . .
(7.8)
conhecida por m´ etodo scoring de Fisher. Estes dois m´etodos tˆem a particularidade de fazer com que o movimento de um ponto para outro seja definido ao longo da direc¸c˜ao indicada pelo vector gradiente de ln L(β|n) multiplicado `a esquerda por −[J(β; n)]−1 ou por [IN (β)]−1 . O uso das segundas derivadas justifica uma r´apida taxa de convergˆencia para o extremo local procurado de ln L(β|n) que, no entanto, pode ainda ser acelerada com a altera¸c˜ao do comprimento do passo na direc¸c˜ao indicada, entre cada par de pontos sucessivos. Esse facto constitui uma vantagem desses m´etodos sobre aqueles procedimentos de maximiza¸c˜ao num´erica de ln L(β|n) baseados apenas no seu gradiente, como aqueb n) = 0, quando postas na forma les que resolvem directamente as equa¸c˜oes U(β; b b β = h(β). Contudo, a simplicidade destes u ´ltimos torna-os muitas vezes prefer´ıveis aos m´etodos do tipo Newton-Raphson, pelo facto de em cada etapa destes haver necessidade de avalia¸c˜ao das segundas derivadas e/ou do seu valor esperado e da invers˜ao de uma matriz associada. Como o processo de determina¸c˜ao das estimativas MV ´e um problema de optimiza¸c˜ao (restringida ou n˜ao restringida), geralmente n˜ao linear, s˜ao aplic´aveis outros m´etodos da chamada programa¸c˜ao n˜ao linear. Em particular, os eficientes m´etodos do gradiente conjugado tˆem a vantagem de serem mais convenientes computacionalmente do que os m´etodos do tipo Newton-Raphson de que os estat´ısticos se socorrem frequentemente. Como uma exposi¸c˜ao desses m´etodos n˜ao cabe dentro dos limites deste texto, sugere-se ao leitor eventualmente interessado neles a consulta a algum dos in´ umeros textos sobre m´etodos de optimiza¸c˜ao ou de programa¸c˜ao n˜ao linear. Sob condi¸c˜oes de regularidade apropriadas, o estimador MV de β, a que se atribui b possui em grandes amostras, uma distribui¸c˜ao aproximada Normal agora o s´ımbolo β, p-variada com vector de m´edias β e matriz de covariˆancias N −1 [IN (β)]−1 , como ser´a demonstrado na Sec¸c˜ao 7.4. O estimador MV de qualquer fun¸c˜ao de β ´e facilmente obtido atrav´es da propriedade de invariˆancia dos estimadores de m´axima verosimilhan¸ca. Por exemplo, b ´e o estimador MV do vector das frequˆencias esperadas. Tendo em conta b = µ(β) µ b o recurso ao m´etodo Delta (vide Sec¸c˜ao 7.4) pera distribui¸c˜ao assint´otica de β, mite mostrar que o estimador MV de qualquer fun¸c˜ao (escalar ou vectorial) bem comportada de β ´e, sob H, igualmente assintoticamente distribu´ıdo conforme uma b possui sob H uma distribui¸c˜ao aproximada distribui¸c˜ao Normal. Exemplificando, µ Normal com vector de m´edias µ e matriz de covariˆancias −1 0 Vµ b (β) = M(β)[IN (β)] [M(β)] .
´ 8. ANALISE DE MODELOS LINEARES
227
da parte triangular superior, iguais aos da parte triangular inferior, s˜ao dados por µ b12 = 1.5, µ b13 = 8.0, e µ b23 = 8.5. Os valores observados das estat´ısticas de ajuste, calculados por (8.3) s˜ao QV = 5.616, QP = 5.466 e QN = 6.464. O n´ıvel cr´ıtico aproximado (calculado com base numa distribui¸c˜ao χ2(3) ) desses testes ´e inferior a 15% e superior a 7.5% (sendo superior a 10% para os testes baseados em QV e QP ). A conclus˜ao a tirar ´e que n˜ao h´a evidˆencia significativa contra a igualdade das probabilidades de mudan¸ca da inten¸c˜ao de voto nos dois sentidos (na base de um n´ıvel de significˆancia menor ou igual a 7.5%, pelo menos). Contudo, o valor moderadamente baixo do n´ıvel cr´ıtico ´e indicativo de que esse modelo n˜ao explica particularmente bem os dados observados. A estima¸c˜ao adequada das diferen¸cas entre probabilidades de celas sim´etricas ´e uma quest˜ao pertinente, mormente quando o teste de simetria apresenta um resultado deveras significativo. No caso mais simples de uma tabela 22 , que se abordar´a, a u ´nica fun¸c˜ao param´etrica desse tipo, δ = θ12 − θ21 , ´e igualmente uma diferen¸ca entre duas probabilidades marginais. Para a constru¸c˜ao de um intervalo de confian¸ca para δ, em grandes amostras, parece razo´avel pensar no seu estimador centrado e consistente, δb = (n12 − n21 )/N , que ´e assim uma diferen¸ca entre duas propor¸c˜oes binomiais correlacionadas. A sua distribui¸c˜ao assint´otica ´e f´acil de ser derivada se se atender a que se pode definir n12 − n21 =
N X
Zi ,
i=1
em que {Zi } s˜ao vari´aveis aleat´orias independentes e identicamente diatribuidas com resultados poss´ıveis 1, 0 e −1 assumidos com probabilidades θ12 , θ11 + θ22 e θ21 , respectivamente. O Teorema Limite Central assegura ent˜ao que √ a N (δb − δ) ∼ N (0, λ − δ 2 ) b = (n12 + n21 )/N ´e um estimador consistente do em que λ = θ12 + θ21 . Como λ p √ b − δb2 ´e uma parˆametro perturbador λ, segue-se (Sec¸c˜ao 7.4) que N (δb − δ)/ λ vari´avel fulcral (pivot) para δ, com distribui¸c˜ao assint´otica N (0, 1), utiliz´avel, pois, em contextos de grandes amostras. Veja-se a Nota de Cap´ıtulo 8.1 para outros m´etodos de constru¸c˜ao de intervalos de confian¸ca para δ. Em tabelas multidimensionais I d , d ≥ 3, uma das generaliza¸c˜oes do conceito de simetria consiste na invariˆancia das probabilidades conjuntas das celas face a qualquer permuta¸c˜ao dos seus ´ındices, traduzida por vezes na designa¸c˜ao de simetria completa. Recorde-se (3.7) para o caso d = 3. A aplica¸c˜ao do procedimento atr´as descrito para o ajuste deste tipo de modelo n˜ao oferece qualquer dificuldade. Por exemplo, para uma tabela I 3 sob o modelo Multinomial, o logaritmo da fun¸c˜ao de verosimilhan¸ca, com a incorpora¸c˜ao da estrutura de simetria completa HSC em (3.7), pode ser expresso por X XX ln L(β|n) = κ(n) + niii ln θiii + (niik + niki + nkii ) ln θiik i
+
XX X
i
k6=i
(nijk + nikj + njik + njki + nkji + nkij ) ln θijk
i j6=i k6=j,i
´ 9. ANALISE DE MODELOS LOG-LINEARES
247
originando a estat´ıstica suficiente m´ınima X0 n = (n1. −n2. , n.1 −n.2 )0 . Esta estat´ıstica ´e claramente equivalente a (n1. , n.1 )0 , que ´e a estat´ıstica suficiente m´ınima que obterse-ia usando a parametriza¸c˜ao alternativa da cela de referˆencia definida por (14 , X), onde µ ¶ 1 1 0 0 0 0 X = XCR ≡ . 1 0 1 0 Da´ı a afirma¸c˜ao usual de o conjunto formado por {ni. } e {n.j } constituir uma estat´ıstica suficiente m´ınima com respeito ao modelo de independˆencia, o que a torna comodamente aplic´avel a qualquer tabela bidimensional. Este conjunto representa a estat´ıstica suficiente que obter-se-ia se a formula¸c˜ao sobreparametrizada do modelo sem as restri¸c˜oes de identificabilidade fosse utilizada, como decorre da express˜ao X X l(β) = b(n) + N u + ni. uA n.j uB i + j . i
j
Como um segundo exemplo, tome-se o modelo (AB, AC) de independˆencia condicional numa tabela 23 . Com a parametriza¸c˜ao de desvios de m´edias 1 1 1 1 −1 −1 −1 −1 1 1 −1 −1 1 1 −1 −1 0 0 1 −1 1 −1 1 −1 X = XDM ≡ 1 −1 , 1 1 −1 −1 −1 −1 1 1 1 −1 1 −1 −1 1 −1 1 a estat´ıstica suficiente m´ınima, X0 n, ´e o vector (n1.. −n2.. , n.1. −n.2. , n..1 −n..2 , n11. − n12. − n21. + n22. , n1.1 − n1.2 − n2.1 + n2.2 )0 obviamente equivalente a (n1.. , n.1. , n..1 , n11. , n1.1 )0 , metriza¸c˜ao da cela de referˆencia definida por 1 1 1 1 0 1 1 0 0 1 X0 = X0CR ≡ 1 0 1 0 1 1 1 0 0 0 1 0 1 0 0
estat´ıstica esta associada `a para0 1 0 0 0
0 0 1 0 0
0 0 0 0 0
.
Facilmente se obtˆem por transforma¸c˜oes biun´ıvocas outras estat´ısticas suficientes m´ınimas como (n11. , n12. , n1.1 , n1.2 , n2.1 )0 , o que permite concluir que o conjunto dos totais marginais bivariados {nij. } e {ni.k } configura uma estat´ıstica suficiente m´ınima sob o modelo (AB, AC). Esta conclus˜ao ´e v´alida independentemente da configura¸c˜ao da tabela tridimensional, j´a que X X X n..k uC l(β) = b(n) + N u + ni.. uA n.j. uB k i + j + i
+
X i,j
j
nij. uAB ij
+
X
k
ni.k uAC ik .
i,k
Para o caso especial deste modelo obtido por elimina¸c˜ao da quinta coluna de XDM (ou de XCR ) e do respectivo termo uAC – o modelo (AB, C) – a estat´ıstica suficiente
´ 10. ANALISE DE MODELOS FUNCIONAIS LINEARES
347
Exemplo 10.2 (Problema do risco de c´ arie dent´ aria): Em princ´ıpio, a an´alise dos dados do Exemplo 6.3 sob o modelo (6.12) n˜ao apresenta maiores problemas, dada a sua natureza log-linear. Apesar disso, a sua implementa¸c˜ao computacional exige alguns cuidados adicionais em fun¸c˜ao de os principais pacotes de software estat´ıstico adoptarem formula¸c˜oes baseadas em logitos de referˆencia. Em particular, para utiliza¸ca˜o desses pacotes, conv´em re-expressar o modelo (6.12) na forma A∗ ln π = X∗ β ∗ com A∗ = [I8 , −18 ], X∗ = A∗ [Y, X] e β ∗ = [u0 v AB ]0 . O ajustamento do modelo pode ser considerado adequado com base no valor da estat´ıstica QV = 0.91 (gl = 3, P = 0.34) e o valor comum das RPC locais (v AB ) ´e estimado por 1.46 com erro padr˜ao estimado por 0.33 (IC 95% ' [0.81; 2.11]). Exemplo 10.3 (Problema do uso de fio dental): Sob a perspectiva de ajustamento, a identifica¸c˜ao do modelo (6.15) como um modelo log-linear tetradimensional sem interac¸c˜ao de terceira ordem facilita sobremaneira a an´alise dos dados do Exemplo 6.4. O recurso a praticamente qualquer dos pacotes computacionais dispon´ıveis comercialmente permite verificar que QV = 0.98 (gl = 1) sugerindo um ajustamento aceit´avel (P = 0.32). No entanto, a parametriza¸c˜ao usualmente adoptada, pode n˜ao permitir a mesma clareza na interpreta¸c˜ao dos resultados. Com a finalidade de preservar os parˆametros do modelo (6.15) e consequentemente a clareza interpretativa, um artif´ıcio similar `aquele considerado no exemplo anterior pode ser empregado, multiplicando-se ambos os membros do modelo em sua express˜ao matricial por A∗ = I4 ⊗ [I3 − 13 ]. Obviamente, essa reformula¸c˜ao n˜ao afeta o ajustamento do modelo. As estimativas dos parˆametros de interesse (juntamente com os respectivos erros padr˜oes estimados) s˜ao α b = 2.76 (1.23), δb1 = 0.67 (1.10) e γb1 = −2.48 (1.30), sugerindo que as chances de habilidade razo´avel (versus inabilidade) para crian¸cas do sexo feminino e faixa et´aria 9 − 12 anos e frequˆencia boa de uso de fio dental s˜ao exp(2.76) = 15.80 (IC 95% ' [1.42; 176.06]) vezes as chances correspondentes para crian¸cas de mesmo sexo e mesma faixa et´aria mas com frequˆencia insuficiente de uso de fio dental. Al´em disso, pode-se concluir que essa raz˜ao de chances deve ser multiplicada por exp(0.67) = 1.95 quando se consideram crian¸cas do sexo masculino de mesma faixa et´aria ou por exp(−2.48) = 0.08 se forem consideradas crian¸cas de mesmo sexo por´em mais jovens (i.e., na faixa et´aria 5 − 8 anos). Dada a natureza aditiva do modelo log-linear em quest˜ao, para crian¸cas de sexo masculino e faixa et´aria 5 − 8 anos, a raz˜ao de chances original deve ser multiplicada por exp(−2.48 + 0.67) = 0.16. Analizem-se agora os modelos log-lineares n˜ao ordin´arios. Como esses modelos n˜ao tˆem a estrutura log-linear definida para o cen´ario Produto de Multinomiais em fun¸c˜ao de a matriz A em (6.16) n˜ao ser ortogonal `a matriz D utilizada para definir as restri¸c˜oes naturais, os resultados obtidos no Cap´ıtulo 9 n˜ao podem ser aqui empregados. Como consequˆencia, resultados espec´ıficos precisam de ser obtidos, em geral, com o recurso aos multiplicadores de Lagrange. Tendo em vista a formula¸c˜ao (6.17)
11. METODOLOGIA DE M´INIMOS QUADRADOS GENERALIZADOS
371
Utilizando as regras de deriva¸c˜ao matricial apresentadas no Apˆendice A.6, n˜ao ´e dif´ıcil verificar que ∂Q(β) e −1 Xβ − X0 V e −1 F} e (11.3) = 2{X0 V e e F F ∂β e que ∂ 2 Q(β) e −1 X. (11.4) = 2X0 V e F ∂β∂β 0 Resolvendo o sistema ∂Q(β)/∂β = 0 e observando que (11.4) ´e definida positiva, conclui-se que o estimador MQG de β ´e b = (X0 V e −1 X)−1 X0 V e −1 F. e β e e F F
(11.5)
e pode-se demonstrar (ver Sec¸c˜ao 11.5) Partindo da distribui¸c˜ao assint´otica de F, b pode ser aproximada por uma que, para N suficientemente grande, a distribui¸c˜ao de β e −1 X)−1 , distribui¸c˜ao Normal com vector de m´edias β e matriz de covariˆancias (X0 V e F ou seja, b ≈ Np {β, (X0 V e −1 X)−1 }. (11.6) β e F
Como a matriz de covariˆancias da distribui¸c˜ao aproximada (11.6) ´e (essenciale e ), esse resultado pode ser facilmente emmente) conhecida (a partir da estimativa V F pregado para inferˆencias sobre β. Tendo em vista a equivalˆencia entre a formula¸c˜ao (11.1) para o modelo estrutural em quest˜ao e a formula¸c˜ao em termos de restri¸c˜oes a que se aludiu na Sec¸c˜ao 6.2 para o caso do modelo Produto de Multinomiais e na Sec¸c˜ao 7.2 para casos mais gerais, a sua adequa¸c˜ao aos dados (relativamente ao modelo saturado, i.e., em que r(X) = p = u) pode ser avaliada em termos de um teste da hip´otese definida por UF(θ) = 0, (11.7) em que U0 ´e uma matriz de dimens˜ao u × (u − p), base do complemento ortogonal de e o teste de M(X). Novamente trazendo `a tona a distribui¸c˜ao assint´otica do vector F, Wald correspondente ´e baseado na estat´ıstica e 0 U0 (UV e e U0 )−1 UF, e QU = F F
(11.8)
cuja distribui¸c˜ao pode ser aproximada (para N suficientemente grande) por uma distribui¸c˜ao χ2(u−p) quando o modelo definido por (11.1) ou (11.7) ´e v´alido. A express˜ao simb´olica para esse resultado cuja demonstra¸c˜ao est´a indicada na Sec¸c˜ao 11.5 ´e a
QU | [F(θ) = Xβ] ∼ χ2(u−p) .
(11.9)
b A b = Xβ. ` luz de (11.5) e Estimadores de F(θ) sob o modelo (11.1) s˜ao dados por F (11.6) e utilizando as t´ecnicas consideradas em detalhe na Sec¸c˜ao 11.5, demonstra-se tamb´em que a b∼ b = Xβ e −1 X)−1 X0 }. F Nu {F(θ), X(X0 V (11.10) e F e a Esses estimadores tˆem interesse pr´atico, j´a que eliminam do vector “observado”, F, varia¸c˜ao estranha ao modelo estrutural adoptado. Al´em disso, poder˜ao ser utilizados
´ 12. ANALISE DE DADOS CATEGORIZADOS LONGITUDINAIS
415
(e em que, consequentemente, d ´e grande) devem ser estruturadas de outra forma, a ser discutida na Sec¸c˜ao 12.3. No contexto de dados longitudinais, em geral, os objectivos anal´ıticos envolvem: i) a identifica¸c˜ao do efeito de subpopula¸c˜oes, de condi¸c˜oes de avalia¸c˜ao e de sua interac¸c˜ao quanto `as correspondentes distribui¸c˜oes marginais (de primeira ordem) das respostas, no esp´ırito da an´alise de perfis usualmente empregada para dados cont´ınuos (ver Singer & Andrade (2000), por exemplo); ii) a avalia¸c˜ao do padr˜ao de varia¸c˜ao das distribui¸c˜oes marginais (de primeira ordem) de respostas correspondentes `as diferentes subpopula¸c˜oes ao longo das condi¸c˜oes de avalia¸c˜ ao, no esp´ırito da an´alise de curvas de crescimento comummente considerada para dados cont´ınuos (ver Singer & Andrade (2000), por exemplo); iii) o estudo do padr˜ao de varia¸c˜ao de transi¸c˜ao entre categorias de respostas ao longo das condi¸c˜oes de avalia¸c˜ao para as diferentes subpopula¸c˜oes. Nesse caso o interesse recai nas distribui¸c˜oes marginais de ordem 2 ou superior. Para evitar confus˜ao com o termo modelos de transi¸ c˜ ao comummente empregado na literatura estat´ıstica, ver a Nota de Cap´ıtulo na Sec¸c˜ao 12.4. Um caso concreto com s = 1, d = 3 e L = 4 ´e ilustrado pelo seguinte exemplo. Exemplo 12.1 (Problema da infec¸ca ˜o urin´ aria): Os dados da Tabela 12.2 s˜ao oriundos de um estudo cujo objectivo era avaliar a efic´acia de um tratamento para infec¸c˜ao urin´aria no que concerne ao desaparecimento de um de seus sintomas. Cinquenta pacientes com esse tipo de infec¸c˜ao foram examinadas em trˆes instantes: no dia de in´ıcio do tratamento e 14 e 21 dias ap´os essa primeira avalia¸c˜ao. A caracter´ıstica observada foi o n´ıvel de corrimento vaginal, classificado como ausente (0), leve (1), moderado (2) ou intenso (3). Observa¸c˜oes omissas, bastante comuns neste tipo de problema, est˜ao representadas por pontos. Mais especificamente, as quest˜oes de interesse s˜ao: i) avaliar se a distribui¸c˜ao da resposta se altera favoravelmente com o tratamento, i.e., se apresenta menores frequˆencias de pacientes com corrimento vaginal de maior intensidade 14 dias ap´os o in´ıcio do tratamento e ii) em caso afirmativo, saber se o tratamento pode ser interrompido ap´os 14 dias, ou seja, se alguma caracter´ıstica relevante (e.g., a propor¸c˜ao de pacientes com corrimento vaginal moderado ou intenso) das distribui¸c˜oes da resposta se mant´em inalterada da segunda para a terceira avalia¸c˜ao. ` partida, ´e necess´ario avaliar o impacto das respostas omissas na estrat´egia de A an´alise. Embora seja comum analisar apenas as unidades amostrais com dados completos, desprezando as demais, a validade dos resultados obtidos sob esse enfoque depende de suposi¸c˜oes que nem sempre s˜ao aceit´aveis na pr´atica. A incorpora¸c˜ao das unidades com dados omissos na an´alise, por sua vez, exige modelos mais complexos do que aqueles que aqui se pretende descrever e s˜ao o objecto de uma discuss˜ao detalhada no Cap´ıtulo 13. Para n˜ao desprezar essas unidades amostrais, adopta-se uma estrat´egia alternativa que envolve a imputa¸c˜ao de dados e a sua an´alise como
´ 12. ANALISE DE DADOS CATEGORIZADOS LONGITUDINAIS
417
Tabela 12.3: N´ıvel de corrimento vaginal em trˆes avalia¸c˜oes atribu´ıdo `as unidades amostrais com respostas omissas Avalia¸c˜ao Avalia¸c˜ao Paciente inicial 14 dias 21 dias Paciente inicial 14 dias 21 dias 2 2 0 0 31 3 2 0 5 2 1 1 32 0 0 0 6 2 2 2 43 2 2 2 7 2 2 2 44 2 2 2 27 2 3 3 46 2 2 0
Embora seja comum dispor dados oriundos de estudos longitudinais no formato individual como ilustra a Tabela 12.2, para uma an´alise segundo os moldes adoptados neste texto, conv´em reexpress´a-los em forma agrupada como na Tabela 1.7, que, neste caso, ´e especificada com s = 1 subpopula¸c˜ao e r = Ld = 43 = 64 categorias de resposta, conforme indica a Tabela 12.4. Tabela 12.4: Representa¸c˜ao dos dados do Exemplo 12.1 na forma da Tabela 1.7 N´ıvel de corrimento vaginal na avalia¸c˜ao N´ umero de inicial 14 dias 21 dias pacientes Ausente Ausente Ausente 0 Ausente Ausente Leve 2 Ausente Ausente Moderado 0 Ausente Ausente Intenso 0 .. .. .. .. . . . . Moderado Moderado Leve 3 .. .. .. .. . . . . Intenso
Intenso
Intenso
0
Admitindo-se que as 50 pacientes correspondem a uma amostra aleat´oria simples obtida de uma popula¸c˜ao (conceptual) para a qual se quer tirar conclusˆoes, um modelo Multinomial pode ser adoptado para efeitos inferenciais. O facto de haver apenas 50 pacientes classificadas nas 64 (= Ld ) categorias de resposta gera uma tabela esparsa, o que n˜ao ´e uma caracter´ıstica exclusiva do problema sob investiga¸c˜ao, mas aponta para um padr˜ao bastante comum neste tipo de estudo. Como consequˆencia, an´alises centradas no terceiro objectivo mencionado acima podem ficar prejudicadas e o foco deve ser dirigido para os demais, que dependem essencialmente de fun¸c˜oes dos 12 (= L × d) parˆametros das distribui¸c˜oes marginais de primeira ordem. Exemplo 12.2 (Problema da sensibilidade dentin´ aria): Na Tabela 12.5 est˜ao resumidos os dados de um estudo realizado na Faculdade de Odontologia da Universidade de Mogi das Cruzes, SP, para avaliar o efeito de dois adesivos dentin´arios (Single Bond) e (Prime bond NT) e de duas condi¸c˜oes de aplica¸c˜ao (dentina seca ou h´ umida) na varia¸c˜ao (pr´e e p´os-operat´oria) da sensibilidade dentin´aria (presente ou ausente)
´ 13. ANALISE DE DADOS INCOMPLETOS
449
para N condicionalmente a um padr˜ao de omiss˜ao definido intencionalmente com n o Pmt Nt· = j=1 ntj previamente fixados por delineamento. O n´ ucleo desta distribui¸c˜ao respeitante a tal processo de omiss˜ao determin´ıstico coincide ent˜ao por (13.6) com a verosimilhan¸ca relevante para inferˆencias sobre θ no quadro de um processo de omiss˜ao MAR (mas n˜ao no quadro de um processo geral de omiss˜ao devido `a forma de (13.1)). Deste modo, fazer inferˆencias sobre θ com base na verosimilhan¸ © ª ca L2 significa ignorar o mecanismo aleat´orio de omiss˜ao. Ora, desde que θ e αt(j) sejam distintos (no sentido de o seu espa¸co conjunto de valores poss´ıveis ser o produto cartesiano das gamas de varia¸c˜ao dos dois tipos de parˆametros), como acontece geralmente, a factoriza¸c˜ao (13.6) da distribui¸c˜ao amostral dos dados mostra que o processo de omiss˜ao M1 ´e ignor´ avel do ponto de vista das inferˆencias sobre θ baseadas directamente na verosimilhan¸ca2 . O panorama ´e diferente do ponto de vista das inferˆencias frequencistas sobre θ. E ´e-o pela simples raz˜ao de o n´ ucleo da distribui¸c˜ao condicional de N dado o padr˜ao de omiss˜ao observado (i.e., dado {Nt· }) sob M1 n˜ao coincidir com o da distribui¸c˜ao marginal dos dados observados definido por L2 (Exerc´ıcio 13.1). Isto vai implicar que a distribui¸c˜ao amostral condicional de uma estat´ıstica delineada para se inferir sobre θ (estimador, pivˆo, estat´ıstica do teste) seja geralmente diferente da que resulta do modelo Produto de Multinomiais de n´ ucleo L2 3 . Um caso especial de um mecanismo de omiss˜ao MAR resulta da imposi¸c˜ao mais restritiva de uma u ´nica probabilidade condicional de omiss˜ao por tipo de omiss˜ao, i.e., por cada Pt , sendo pois definido por M2 : λt(i) = αt , i = 1, . . . , m, t = 1, . . . , T.
(13.8)
Este processo indica assim que as probabilidades condicionais de omiss˜ao n˜ao dependem em nenhum aspecto das categorias de perten¸ca das unidades, i.e., dos resultados (observados ou omissos) do processo de categoriza¸c˜ao, sendo por vezes denominado de processo de omiss˜ ao completamente aleat´ oria (ou completamente ao acaso), MCAR (acr´onimo de Missing Completely At Random). ´ f´acil agora constatar (Exerc´ıcio 13.2) que este processo de omiss˜ao j´a ´e ignor´avel E do ponto de vista das inferˆencias frequencistas sobre θ, as quais devem apoiar-se na distribui¸c˜ao condicional Produto de Multinomiais Mmt −1 (Nt· , Z0t θ). O processo de omiss˜ao MCAR ´e uma estrutura geralmente r´ıgida e pouco realista encaixada num processo MAR que, por sua vez, imp˜oe uma estrutura saturada (m + l − 1 parˆametros funcionalmente independentes) e identific´avel ao modelo estat´ıstico. Naturalmente que estes u ´ltimos objectivos podem igualmente ser atingidos por um n´ umero adequado de restri¸c˜oes em λt(i) que mantenham, de algum modo, a dependˆencia destes de resultados n˜ao observados. Um processo com esta u ´ltima caracter´ıstica diz-se de omiss˜ ao informativa ou, por vezes, de omiss˜ ao n˜ ao aleat´ oria, 2E ´ o caso das inferˆ encias verosimilhancistas e bayesianas (aqui com o requisito adicional de independˆ encia a priori entre os dois tipos de parˆ ametros). A quest˜ ao de ignorabilidade no presente contexto de dados omissos foi estendida para dados grosseiros (coarse data) – contemplando nomeadamente os dados censurados t´ıpicos da An´ alise de Sobrevivˆ encia – em Heitjan & Rubin (1991) e Heitjan (1993, 1994, 1997). 3 Veja-se, e.g., Kenward & Molenberghs (1998) para um estudo pr´ atico da n˜ ao ignorabilidade do processo MAR para testes (cl´ assicos) sobre θ.
´ ˆ 14. METODOS DE INFERENCIA CONDICIONAL
14.2
493
Testes de simetria
Em consonˆancia com o disposto no Cap´ıtulo 3, o facto de as quest˜oes tratadas nesta sec¸c˜ao envolverem modelos de simetria, conduz fundamentalmente `a considera¸c˜ao do modelo Multinomial M (N, θ) para a tabela de contingˆencia em causa n, onde a barra nos s´ımbolos pretende significar a elimina¸c˜ao neles da componente redundante (que se toma como a u ´ltima, a n˜ao ser que se explicite algo em contr´ario).
14.2.1
Tabelas 2 × 2
Considere-se ent˜ao o caso de uma tabela 2 × 2 gerada pelo modelo M3 (N, θ) para o vector de frequˆencias n = (n11 , n12 , n21 ), em que θ = (θ11 , θ12 , θ21 ). Tendo em conta que a hip´otese de simetria H0 : θ12 = θ21 pode ser equivalentemente formulada por H0 : γ ≡ θ12 /(θ12 + θ21 ) = 1/2, o vector param´etrico θ pode pˆor-se em correspondˆencia biun´ıvoca com o vector (θ11 , θ12 + θ21 , γ) ≡ (φ, γ), em que γ desempenha assim o papel de parˆametro de interesse. Denotando T = (n11 , n12 + n21 ) ≡ (n11 , U ), ´e f´acil constatar (Exerc´ıcio 14.1) que a distribui¸c˜ao amostral de T ´e uma Multinomial bivariada de ´ındice N e parˆametro φ e que a distribui¸c˜ao condicional de n dado T = t (que n˜ao representa mais do que a distribui¸c˜ao de n12 condicional em U = u) ´e uma Binomial de ´ındice u e parˆametro γ. Ou seja, T (ou mais simplesmente, U ) pode servir para a constru¸c˜ao de um teste condicional exacto de simetria (ou homogeneidade marginal) baseado na distribui¸c˜ao f (n|t; θ) = f (n12 |u; γ) que, sob H0 , corresponde `a distribui¸c˜ao sim´etrica Bi(u, 1/2). Como estat´ıstica de teste condicional pode-se tomar a pr´opria vari´avel n12 (ou n21 ), ou a vers˜ao n˜ao padronizada da estat´ıstica de McNemar, V = n12 − n21 , que ´e uma fun¸c˜ao linear de n12 (V = 2n12 − u), ou ainda a pr´opria estat´ıstica de McNemar, V 2 /u (recorde-se 8.3). O teste baseado em qualquer destas estat´ısticas equivalentes define a vers˜ao exacta do teste assint´otico de McNemar (Exerc´ıcio 14.1). O correspondente n´ıvel cr´ıtico, calculado da distribui¸c˜ao nula Bi(u, 1/2), depende naturalmente da forma da hip´otese alternativa. Ele deve incluir os valores de n12 ou de V iguais ou superiores (respectivamente, iguais ou inferiores) ao respectivo valor observado se H1 : θ12 > θ21 (respectivamente, H1 : θ12 < θ21 ). O n´ıvel cr´ıtico do teste bilateral (H1 : θ12 6= θ21 ) resulta da duplica¸c˜ao do m´ınimo dos n´ıveis cr´ıticos dos dois testes unilaterais. Exemplo 14.1 (Problema da esquistossom´ıase): Singer, Correia & Paschoalinoto (1989) descrevem um estudo sobre t´ecnicas serol´ogicas de diagn´ostico da esquistossom´ıase, tendo como objectivo a compara¸c˜ao de uma dada t´ecnica padr˜ao (rotulada por A), conhecida pela sua rapidez e precis˜ao nos resultados, com outras t´ecnicas alternativas (rotuladas por B, C e D). A amostra envolveu dois grupos de 50 indiv´ıduos, um constitu´ıdo por pacientes com esquistossom´ıase comprovada (casos) e outro por
´ A. CONCEITOS E RESULTADOS DE ALGEBRA LINEAR
549
´ f´acil constatar que se os vectores n˜ao nulos x1 , . . . , xk s˜ao mutuamente ortoE gonais, eles s˜ao necessariamente LIN (Exerc´ıcio A.2 a)). Como consequˆencia, eles definem uma base dita ortogonal do subespa¸co por eles gerado. Se adicionalmente os vectores tiverem norma unit´aria (i.e., ||xi || ≡ (x0i xi )1/2 = 1, i = 1, . . . , k), a base diz-se ortonormada (ou ortonormal). ´ sempre poss´ıvel construir uma base ortonormada para qualquer subespa¸co n˜ao E nulo de dimens˜ao finita, como indica o seguinte resultado (Teorema de Gram-Schmidt) – vide Exerc´ıcio A.2 b): Proposi¸ c˜ ao A.3: Sendo U um subespa¸co com base {x1 , . . . , xp }, existe um conjunto {y1 , . . . , yp }, onde yk ∈ M([x1 , . . . , xk ]), k = 1, . . . , p, que constitui uma base ortonormada de U. Seja U um subespa¸co de V. Um elemento de V que ´e ortogonal a todos os elementos de U diz-se ortogonal a U. O conjunto de todos os elementos de V ortogonais a U, definido por U ⊥ = {y ∈ V : y0 x = 0 , ∀x ∈ U} chama-se complemento ortogonal de U (relativamente a V). Proposi¸ c˜ ao A.4: Seja V um espa¸co vectorial de dimens˜ao c e U um seu subespa¸co de dimens˜ao p ≤ c. Ent˜ ao U ⊥ ´e um subespa¸co de V, tal que qualquer vector x de V pode ser expresso de forma u ´nica por x = u + y com u ∈ U e y ∈ U ⊥ , e a sua dimens˜ao ´e dada por dim (V) − dim (U ) = c − p. Prova: Sejam y1 , y2 ∈ U ⊥ . Como toda a combina¸c˜ao linear de y1 e y2 tamb´em ´e ortogonal a qualquer vector de U, ent˜ao U ⊥ ´e um subespa¸co de V (Proposi¸c˜ao A.1). Seja {y1 , . . . , yp } uma base para U e complete-se-a com os vectores w1 , . . . , wc−p de modo que o conjunto resultante constitua uma base de V. Aplicando o processo de ortogonaliza¸c˜ao de Gram-Schmidt, obt´em-se a base ortonormada de V, ∗ } com a particularidade de {y1∗ , . . . , yp∗ } formar uma base {y1∗ , . . . , yp∗ , w1∗ , . . . , wc−p ortonormada de U. Ent˜ao, ∀x ∈ V , x =
p X
ai yi∗ +
i=1
onde u =
Pp i=1
c−p X
bj wj∗ ≡ u + y
j=1
ai yi∗ ∈ U e y ∈ U ⊥ .
Note-se que, por constru¸c˜ao, os wj∗ ’s pertencem a U ⊥ e s˜ao LIN. A representa¸c˜ao acima de x ∈ V tamb´em ´e v´alida para qualquer vector de U ⊥ . Contudo, se x ∈ U ⊥ , tem-se x0 yi∗ = ai = 0, i = 1, . . . , p, donde ∀x ∈ U ⊥ , x =
c−p X
bj wj∗ .
j=1 ∗ Este resultado evidencia que {w1∗ , . . . , wc−p } ´e um conjunto gerador, e portanto, uma ⊥ ⊥ base de U . Logo, dim U = c − p = dim V − dim U.
´ A. CONCEITOS E RESULTADOS DE ALGEBRA LINEAR
551
n´ ucleo) de X0 , denotado por N (X0 ), para o complemento ortogonal de M(X). A sua dimens˜ao, igual a c − r(X), ´e ent˜ao denominada de nulidade de X0 . Enquanto que o subespa¸co gerado por uma matriz X ´e definido atrav´es de equa¸c˜oes lineares, o seu complemento ortogonal (ou seja, o espa¸co nulo da sua transposta) ´e ´ poss´ıvel, contudo, definir equivalentemente M(X) [respectraduzido por restri¸c˜oes. E 0 tivamente, N (X )] atrav´es de restri¸c˜oes (respectivamente, equa¸c˜oes lineares), como estabelece o seguinte resultado: Proposi¸ c˜ ao A.7: Seja X uma matriz c × p de caracter´ıstica r ≤ p ≤ c. Ent˜ao, M(X) = N (W0 ), onde W ´e uma matriz c × (c − r) base do complemento ortogonal de M(X), i.e., X0 W = 0(p,c−r) . Prova: Tomem-se r vectores colunas LIN de X e e sejam eles denotados por xi , i = 1, . . . , r. Determinem-se c − r vectores LIN de IRc , {wj , j = 1, . . . , c − r} que sejam ortogonais a cada xi . Por construc¸c˜ao, o conjunto dos wj ’s ´e uma base do subespa¸co N (X0 ) e, como tal, tem-se para todo o v ∈ N (X0 ) que v=
c−r X
βj wj = Wβ
para algum β = (β1 , . . . , βc−r )0 ∈ IRc−r
j=1
onde W = (w1 , · · · , wc−r ) ´e tal que X0 W = 0(p,c−r) . Assim, tem-se N (X0 ) ⊂ M(W). Reciprocamente, se W ´e tal que as suas colunas s˜ao ortogonais `as colunas de X, ∀v = Wβ para algum β ∈ IRc−r ⇒ X0 v = X0 Wβ = 0 ⇔ v ∈ N (X0 ) . Por conseguinte, N (X0 ) = M(W), o que equivale `a identidade entre os seus complementos ortogonais, i.e., M(X) = N (W0 ).
A.2
Algumas breves no¸c˜ oes sobre matrizes
Sejam A e B matrizes com dimens˜oes u × P c e c × p, respectivamente. O produto c C = AB ´e a matriz u × p de elementos cij = k=1 aik bkj , i = 1, . . . , u; j = 1, . . . , p. As linhas (respectivamente, colunas) de C s˜ao assim combina¸c˜oes lineares das linhas de B (respectivamente, colunas de A). Como consequˆencia, a caracter´ıstica de C n˜ao pode ser superior `a de A nem `a de B, i.e., Proposi¸ c˜ ao A.8: Nas condi¸c˜oes acima, r(AB) ≤ min(r(A), r(B)). Seja agora E uma outra matriz u × k e amplie-se com ela a matriz A de modo a obter a matriz particionada [A E] de dimens˜ao u × (c + k). Como o n´ umero de colunas LIN desta nova matriz n˜ao pode ser superior `a soma do n´ umero de colunas LIN de A e E, tem-se: Proposi¸ c˜ ao A.9: Nas condi¸c˜oes acima, r([A E]) ≤ r(A) + r(E), verificando-se a igualdade no caso em que as colunas de E s˜ao ortogonais `as de A.
´ B. CONCEITOS E RESULTADOS DE TEORIA ASSINTOTICA
583
todo o n´ umero real ² > 0, e para todo o n´ umero real η > 0, existir um n´ umero inteiro positivo n0 = n0 (η, ²) tal que P (|Xn − X| > ²) < η quando n ≥ n0 . Para indicar que {Xn }n≥1 converge em probabilidade para X usa-se a nota¸c˜ao P
Xn −→X. Essencialmente, essa afirma¸c˜ao significa que, para todo o n suficientemente grande, a diferen¸ca entre Xn e X ´e pequena com probabilidade arbitrariamente alta; P pela Defini¸c˜ao B.17, tamb´em pode-se notar que Xn −→X ´e equivalente a Xn − X = op (1). Defini¸ c˜ ao B.20: Uma sequˆencia de vari´aveis aleat´orias {Xn }n≥1 converge quase certamente ou quase em toda a parte para uma vari´avel aleat´oria X se para quaisquer n´ umeros reais positivos η e ², existir um n´ umero inteiro positivo n0 = n0 (η, ²) tal que P (|XN − X| > ² para algum N ≥ n) < η quando n ≥ n0 . Para indicar que {Xn }n≥1 converge quase certamente para X usa-se a nota¸c˜ao q.c. Xn −→X. Essencialmente, essa afirma¸c˜ao quer dizer que, para n suficientemente grande, o conjunto de pontos em que Xn e X diferem tem probabilidade zero. Nos dois casos, a generaliza¸c˜ao para o caso vectorial ´e imediata e pode ser resumida atrav´es da seguinte defini¸c˜ao: Defini¸ c˜ ao B.21: Uma sequˆencia de vectores aleat´orios {Xn }n≥1 converge em probabilidade (quase certamente) para um vector aleat´orio X0 (possivelmente degenerado), se a sequˆencia de vari´aveis aleat´orias {||Xn − X0 ||}n≥1 convergir em probabilidade (quase certamente) para zero. Do ponto de vista pr´atico, o seguinte resultado ´e u ´til para a constata¸c˜ao da convergˆencia (em probabilidade ou quase certa) de uma sequˆencia de vectores aleat´orios. Proposi¸ c˜ ao B.34: Sejam {Xn }n≥1 uma sequˆencia de vectores aleat´orios e X0 um vector aleat´orio (possivelmente degenerado). Ent˜ao P,q.c.
P,q.c.
Xn −→ X0 se e somente se Xnj −→ X0j , para j = 1, 2, . . . , p. Embora os conceitos de convergˆencia estoc´astica discutidos acima sejam definidos para sequˆencias quaisquer de vari´aveis aleat´orias, a sua aplica¸c˜ao a problemas concretos, em geral, requer a considera¸c˜ao de casos mais espec´ıficos. Dentre eles, destacam-se aqueles para os quais s˜ao v´alidas as Leis dos Grandes N´ umeros, que essencialmente s˜ao resultados sobre a convergˆencia em probabilidade ou quase certa de sequˆencias de estat´ısticas que podem ser expressas como m´edias de vari´aveis aleat´orias (ou vectores aleat´orios). Uma justificativa para tal particulariza¸c˜ao est´a no facto de que esse tipo de estat´ıstica ocorre com grande frequˆencia em muitos modelos
BIBLIOGRAFIA
597
Basu, D. (1980). Randomization analysis of the experimental data: the fisher randomization test (with discussion), Journal of the American Statistical Association 75: 575–594. Becker, M. (1989). Models for the analysis of association in multivariate contingency tables, Journal of the American Statistical Association 84: 1014–1019. Bedrick, E. (1983). Adjusted chi-square tests for cross-classified tables of survey data, Biometrika 70: 591–595. Bemis, K. & Bhapkar, V. (1982). On the equivalence of some test criteria based on ban estimators for the multivariate exponential family, Journal of Statistical Planning and Inference 6: 277–286. Benedetti, J. & Brown, M. (1978). Strategies for the selection of loglinear models, Biometrics 34: 680–686. Berkson, J. (1944). Application of the logistic function to bio-assay, Journal of the American Statistical Association 39: 357–365. Berkson, J. (1978). In dispraise of the exact test, Journal of Statistical Planning and Inference 2: 27–42. Bhapkar, V. (1966). A note on the equivalence of two test criteria for hypotheses in categorical data, Journal of the American Statistical Association 61: 228–235. Bhapkar, V. (1979). On tests of marginal symmetry and quasi-symmetry in two and three-dimensional contingency tables, Biometrics 35: 417–426. Bhapkar, V. & Koch, G. (1968). Hypotheses of no interaction in multidimensional contingency tables, Technometrics 10: 107–123. Birch, M. (1963). Maximum likelihood in three-way contingency tables, Journal of the Royal Statistical Society, B 25: 220–233. Birch, M. (1964). The detection of partial association. i: The 2 × 2 case, Journal of the Royal Statistical Society, B 26: 313–324. Bishop, Y., Fienberg, S. & Holland, P. (1975). Discrete Multivariate Analysis: Theory and Practice, Cambridge, MA: MIT Press. Bliss, C. (1934). The method of probits, Science 79: 38–39, correction: 409–410. Bloch, D. & Kraemer, H. (1989). 2 × 2 kappa coefficients: measures of agreement or association, Biometrics 45: 269–287. Boos, D. (1992). On generalized score tests, The American Statistician 46: 327–333. Booth, J. & Butler, R. (1999). Monte carlo approximation of exact conditional tests for log-linear models, Biometrika 86: 321–332.