1.4 CÁLCULO DAS PROBABILIDADES
316
Pรกgina em branco
ADVERTÊNCIA PRÉVIA
Com o capítulo relativo a populações finitas, inicia-se a publicação das nossas lições de Cálculo das Probabilidades no Instituto Superior de Agronomia. Os capítulos seguintes serão publicados à medida que a experiência nos indicar qual a melhor orientação a seguir no ensino desta matéria, tendo sempre em conta a finalidade prática desse ensino e as condições especiais em que tem de ser realizado. Na preparação das nossas lições serviram-nos de base, principalmente, as seguintes obras: G. CASTELNUOVO - Calcolo delle probabilita, Zanichelli, Bologna, 1933. D. J. FINNEY - An introduction to statistical science in Agriculture, John Wiley Sons, New York, 1953. " CRAMER - Mathematical methods oi Statistics, Princeton University Press, Princeton, 1951. G. UDNY YULE and M. G. KENDALL - An introduction to the Theory oi Statistics, Charles Griffin, Londres, 1937. P. de VARENNES E MENDONÇA - Noções de Cálculo das Probabilidades, Instituto Superior de Agronomia, Lisboa, 1950. Convirá, no entanto, precisar, desde já, que tanto a orientação geral do curso, como muitos dos pormenores didácticos têm carácter pessoal. Lisboa, Maio de 1955 J. Sebastião e Silva
318
Pรกgina em branco
1.4.3 ADITAMENTO ÀS LiÇÕES DE CÁLCULO DAS PROBABILIDADES
A - Regressões. Ajustamentos. Correlação
1. Formulação geral do problema Consideremos uma distribuição de frequência absoluta v (x, y) de duas variáveis casuais x, y, que tomem um número finito de pares de valores (Xi' Yk)' i =1, 2, ... , R, k =1, 2, ... , S. Cada par (Xi' Yk) terá a frequência absoluta v(x i ' y k ), que pode, em particular, ser nula, o que significa simplesmente que esse par não chegou a ser observado. Daqui se deduzem as frequências marginais R
S
v(x)
= L V(X i' yk), k= 1
V(Yk)
= LV(X i' Yk) i= 1
e o número total de pares observados, N = LV (x) = LV(Yk). A distribuição pode ser representada por uma tabela de contingência, que neste caso se chama, mais vulgarmente, tabela de correlação:
472
~
Xl
Y1
v(xl' Yl)
Y2
V (Xl
,y)
.. . Ys
V(X 1 '
v(x 1)
Total
y
k
Ys)
xR
Total
...
v(xR , Yl)
V(Yl)
...
V(X R , Y2)
v(y)
.. .
.. .
...
...
V(XR , Ys)
v(Ys)
...
v(xR )
N
----------------,. . . '~-.,~ .." '.
. . .- .'.. . . .'. . .
.:... :
Fig. 1
ou por meio dum gráfico (Fig. 1), em que se marquem os pontos representativos dos pares observados (Xi' Yk) e se aponte, junto de cada um deles, a respectiva frequência v(x i ' Yk) (serão omitidos, naturalmente, os pares de frequência não observados). Em vez das frequências absolutas, poderão usar-se, também, as frequências relativas dadas pelas fórmulas fr(x i , Yk)
= v(x
i
'
N
Yk) ,i =1, ... , R, k
=1, ... , s.
473
Serão estas as frequências preferidas nas considerações teóricas. Por sua vez, as frequências absolutas são usadas, de preferência, nas aplicações práticas.
IX
\O
tr)
r.
......c
00 tr)
r.
......c
o
\Or. ......c
N \Or. ......c
-.::t
\Or. ......c
\O \Or. ......c
00
o
\Or.
l--r.
......c
......c
N ~ ......c
1,56
1
1,58
1
1
1
1
1
1
1,60
1
2
2
3
2
1
1
-.::t
l--r. ......c
\O l--r. ......c
00
l--r. ......c
o00
N
";j
......c
......c
~
r.
00r.
1
.....
2 6 12
1,62
1
2
3
2
4
2
3
1
1
19
1,64
1
2
2
2
5
5
4
4
2
27
1
2
4
5
6
3
2
2
1
1,68
1
3
4
5
5
4
2
1
1
26
1,70
1
1
2
6
6
4
3
2
1
26
1,72
3
3
4
4
4
2
1,74
1
2
2
3
2
2
1
2
1
1
2
1
1
1
1
1
1
1
5
8 12 15 29 34 30 25 19 10 5
2
1 192
1,66
1,76 1,78 Total
O 2
26
20 1
1
15 8
Tabela 1 - Alturas x, y de pai e de filho, em 192 pares de pessoas observadas. As alturas são agrupadas em classes de comprimento 0,02 m.
Inúmeros são os exemplos de tais distribuições de frequência que se apresentam na prática. As variáveis x e y podem ser, por exemplo, o comprimento e a largura das folhas numa dada espécie na variedade de plantas, a produtividade do trigo (em unidades de massa por unidade de área) e o respectivo teor em proteína ou em hidratos de carbono, a altura dos pais e dos respectivos filhos numa dada população (ver Tabela 1), etc., etc.
474 Quando os pares de valores observados são bastante numerosos, o gráfico (Fig. 1) apresenta-se com o aspecto duma "nebulosa" de pontos. Muitas vezes, nenhuma ordem, nenhum esboço de lei se vislumbra nesse aglomerado de pontos, que aparece, então, como um "caos". Outras vezes, porém, a "nebulosa" é mais densa em certas zonas do que noutras, de tal modo que os pontos parecem acumular-se de preferência à volta de uma curva ou de certas curvas privilegiadas do plano. Tal circunstância sugere naturalmente, com maior ou menor intensidade, a existência de uma lei ou relação funcional aproximada, Y=f(x), entre as variáveis x e y, e até, algumas vezes, a hipótese duma relação de causa a efeito entre ambas. Essa função f(x) terá por gráfico, evidentemente, uma das referidas curvas privilegiadas, à volta das quais se adensam os pontos do gráfico. Pois bem, um dos problemas centrais da Estatística consiste em determinar uma tal função e de avaliar em que medida ela se ajusta aos pares de pontos observados: chama-se regressão precisamente essa redução do conjunto de pares (Xi' Yk) a uma espécie de função central, Y = f(x), que traduza aproximadamente, num traço dominante, o aspecto geral da distribuição dos pontos representativos (I). Convém, desde já, notar que o simples método de interpolação, tal como foi estudado, não resolve o problema, pois não corresponde à sua natureza. Basta notar, por exemplo, que um mesmo valor x i de x pode aparecer associado a diversos valores, Yh' Yk"'" de valores de Y, em pares (Xi' Yh)' (Xi' Yk)"'" de frequências não nulas (isto é, geometricamente, pode haver vários pontos representativos, com uma mesma abcissa x); nestas condições, pelo método da interpolação, a função f(x) não poderia ser unívoca. Dizer que f(x) se "ajusta bem" aos pares de valores observados não significa, de modo nenhum, que, para cada valor Xi de x, o valor f(x) da função seja um valor de Y observado com X i (isto é, não significa que o gráfico
(1) -
o termo "regressão" foi introduzido por GALTON, que, tendo estudado a correlação entre alturas de pais e de filhos, enunciou a célebre "lei de regressão": a estatura dos filhos tende a regressar à estatura média da raça (apesar da forte influência hereditária dos pais). Mais precisamente, se a altura média de um extenso grupo de pais se afasta cm da média da raça, a altura média dos filhos afasta-se só (2/3)0 cm da média da raça.
o
475
da função passe exactamente pelos pontos representativos dos pontos observados), mas, apenas, que os desvios Yk - f(x) são "pequenos", podendo os desvios não nulos ser atribuídos a erros ou a factores casuais da perturbação .
.f(x .) ________ J\
I
I
I
- - - - ~ v(X i 'Yk ) I I
x;
Fig. 2
Assim, o que se pretende no problema da regressão é conciliar as duas seguintes condições: 1) - que a função f(x) seja tão simples quanto possível; 2) - que os desvios Yk - f(x) entre os valores Yk de Y observados e os valores f(x) calculados (valores teóricos ou valores esperados) sejam, no seu conjunto, tão pequenos quanto possível. É claro, desde já, que, quanto mais atendermos a uma destas condições, mais nos afastaremos, em geral, da outra e, portanto, do objectivo em vista. Além disso, as duas condições ainda não têm um enunciado matemático preciso; há em ambas uma grande margem de subjectividade, que autoriza várias interpretações. Se, por exemplo, restringirmos a função f(x) à classe dos polinómios, a condição 1) adquire um significado preciso: a função f(x) será tanto mais simples quanto menor for o grau do polinómio. Mas, se dos polinómios passarmos para as funções de tipo exponencial, logarítmico, etc., já não dispomos de um critério tão seguro; em todo o caso, uma função do tipo CeaX, com C e ex. constantes, será mais simples que um polinómio (completo) de grau elevado e pode ser que se ajuste muito melhor ao conjunto de pares observados.
476 Por outro lado, a condição 2) pode receber várias interpretações precisas: pretende-se que seja mínima a soma dos módulos IYk-f(x)1 dos desvios, ou a soma dos quadrados [Y k- f(x)]2 dos desvios, ou ainda outra função adequada dos desvios; subentendendo-se que, nas referidas somas, cada parcela seja multiplicada pela frequência absoluta do par (Xi' Yk) a que corresponde. Se, em vez da frequência absoluta, utilizarmos a frequência relativa, a soma dos módulos dos desvios, a soma dos quadrados dos desvios, etc., virão substituídas pelos correspondentes valores médios, que se obtêm dividindo essas somas pelo número total N de pares observados. Em geral, é a soma (ou a média) dos quadrados dos desvios que se procura minimizar (método dos mínimos quadrados). Assim restringido, o problema da regressão pode enunciar-se nos seguintes termos precisos: Escolhida previamente uma classe ~ de funções, determinar uma função f desta classe, de modo que seja mínimo o valor médio dos quadrados dos desvios, dado pela fórmula: M{ [y - f(x)]2}
=L [Yk -
f(x i )]2 fr(x i , Yk)'
i, k
Diz-se, então, que se trata de ajustar uma função da classe ~ ao conjunto dos pares de valores observados. Em particular, ~ pode ser a classe das funções lineares: neste caso, a regressão diz-se linear. Outras vezes, é necessário recorrer a funções não lineares, cujos gráficos são curvas, e por isso se diz que a regressão é curvilínea. 2. Ajustamentos pelo método dos mínimos quadrados
O método dos mínimos quadrados aplica-se comodamente a uma classe ~ qualquer de funções que se possam apresentar sob a forma de combinações lineares de funções dadas, isto é, sob a forma (1)
477
sendo U o' UI' ... ' u n funções de x dadas (por exemplo, potências de x, exponenciais, logaritmos, etc., etc.) e ao' a!, ... , a n coeficientes a determinar pela condição de mínimo atrás enunciada. Seja então: (2)
Up
= <p/x), p = 0, 1, ... , n,
e convencionemos designar por para x =x i' isto é, ponhamos (3)
~i
= <p/x)
p
~i
o valor que a variável u p toma
= 0, 1, ... , n, i = 1, 2, ... , R.
Nestas condições, cada desvio Yk - f(x) entre o valor observado Yk de Y e o valor calculado f(x) de Y será, em virtude de (1), (2) e (3):
Yk- f(x) =Yk-aoUoi-aIUli - ... -anUni'
i =1, 2, ... , R, k =1, 2, ... , s. Então, visto que [Yk - f(x)F= [f(x)-ykF, o valor médio dos quadrados dos desvios, que representamos por Q, será Q=M{[f(x)-y]2}, ou seja, por extenso· (4)
L (aOUOi + alUli + ... + anUni -Yk)2 fr(xi, Yk)'
Q=
i,k
em que i = 1, 2, ... R, k = 1, 2, ... , S. O valor médio Q é visivelmente uma função de ao' aI , ... , a n; pode mesmo reconhecer-se que o desenvolvimento do 2~ membro conduz a um polinómio do 2~ grau em ao' aI' ... ' a n. O método dos mínimos quadrados consiste pois, aqui, em determinar os coeficientes ao' aI'.'.' a n' de modo que o valor de Q seja mínimo. Ora, para isso, devemos, segundo a teoria dos máximos e mínimos, começar por achar os possíveis pontos de estacionaridade da função Q, isto é, os sistemas de valores de
ao' ... ,a n que anulam todas as derivadas parciais aQ ,p=O, 1, ... , n.
aa
p
478
Atendendo a que os valores de fr(x i , Yk) são constantes, e a que, no quadrado que figura em (4), o coeficiente de ap é ~i' virá, aplicando as regras de derivação:
visto que: M{ uoup} = L. UOi Upi fr(xi' Yk)' i, k
M{unu p} = L. UniUpi fr(x i, y k), i, k
M{yu p} = L.YkUpjfr(xj, Yk)' i, k
onde p
= 0, 1, ... , n, i = 1, 2, ... , R,
e k
= 1, 2, ... , S.
Por conseguinte, o sistema de equações em ao' a j ,
-dQ = 0, dap
p
••• ,
an
= 0, 1, ... , n,
cujas soluções são os pontos de estacionaridade procurados, será equivalente ao sistema de equações: M{uouo}a o + M{ujuo}a j + ... + M{unuo}a n = M{yu o} M{ UOu j }ao + M{ UjU j}a j + ... + M{ unu j }an = M{yu j }
chamadas equações normais. É claro que, por ser upu q=uqu p, quaisquer que sejam p e q, a matriz deste sistema é simétrica.
479
Notemos, por outro lado, que se tem ()2Q
- - - = 2 M{upu q }, dapda q
para p, q = 0,1, ... , n,
e que os valores médios M{upu q } são, precisamente, os coeficientes da forma quadrática em ao' aI' ... , an , que se obtem desenvolvendo
L (aOUOi + aI U Ii + ... + a U )2 fr(xi , Yk)· n
n
i, k
Mas esta só pode tomar valores não negativos, e será mesmo, em geral, uma forma definida positiva, quando R> n (l). Neste caso, como o seu discriminante é, precisamente, o determinante do anterior sistema de equações normais, segue-se que este é um sistema de CRAMER, cuja solução (ponto de estacionaridade) é um ponto de mínimo local e, portanto, de mínimo absoluto (por ser único). Designando por (ao' al' ... ' a n ) essa solução, a função procurada será, pois:
Reciprocamente, é fácil ver que, se o determinante do sistema (discriminante da forma) é :;tO, o ponto de estacionaridade (único) é um ponto de mínimo absoluto. 3. Outra forma das equações normais
Muitas vezes, na prática, em vez dos valores médios M{ upuq } e M {y U p }, introduzem-se nas equações normais as somas dos valores / de cada uma das variáveis upuq e yu p (p, q=O, 1, ... , n). E claro que n
(1) - Recordemos que uma forma quadrática
L
C);iÇk nas variáveis çp ... , Çn (com Cik=Ck )
i, k=1
se diz definida positiva, quando, para todo o sistema de valores de Çl' ... , Çll não simultaneamente nulos, toma valor> O. Chama-se discriminante da forma o determinante Icikl, i, k= 1, ... , n. A forma será definida positiva, se e só se forem positivos todos os termos duma cadeia própria de menores do discriminante.
480
isto equivale a trabalhar com frequências absolutas v(x i ' Yk)' em vez de frequências relativas, fr(x i , y k ). Como se tem
1 ... , S, f r (x i' Yk ) = V(Xi' Yk) , para l. = 1, ... , R , k =, N se designarmos por [upU q ], em geral, a soma dos valores da variável up U q' isto é, se pusermos
para p, q = 0, 1, ... , n, e, analogamente: [Upy] =
.L UpiYkV(Xi'Yk)' i, k
será: M{up Uq } =
[U U] pq N
,
M{yup } =
[yU] p.
N
Então, multiplicando ambos os membros de cada equação normal por N, os coeficientes M { upUq} e os termos independentes M { YUp} resultam substituídos por [upu q] e [upy], respectivamente, e é agora evidente que o sistema obtido é equivalente ao primeiro. 4. Regressão polinomial
Em particular, as funções uo' UI' ••• , un de x podem ser as próprias potências de x:
Neste caso, a função f(x) = Iapu p reduz-se ao polinómio:
481
cujos coeficientes serão determinados pelo sistema de equações ao+M{x}a l + ... +M{xn}an=M{y} M{x} ao + M{x 2 } ai + ... + M{xn+l} an =M{xy}
visto que x O = 1 e M{ I} = 1. Pelo que se disse no n? anterior, estas equações normais também podem ser escritas sob a forma Na o + [x] ai + ... + [xn]a n = [y] [x] ao + [x 2] ai + ... + [xn+l]a n = [xy]
5. Regressão linear. Correlação
Mais particularmente, ainda pode ter-se n =1, Então, f(x) é uma função linear (5)
y
Uo
=1 e UI =x.
=a + bx,
onde, para simplificar, pusemos ao =a e ai =b. Os coeficientes a e b serão determinados pelo sistema a + M{x}b
=M{y}
(6)
M{x}a +M{x 2 }b =M{xy}.
Eliminando a entre as duas equações pelo método de redução, obtem-se
482
M{xy} -M{x}M{y} b=-------M{x2} - (M{X})2
ou seja,
C{x, y}
b=--V{x} ,
(7)
em virtude de propriedades conhecidas da covariância C {x, y} e da variância V{ x }. Por outro lado, a primeira equação do sistema (6) dá
a =M{y}-M{x}b, donde, substituindo em (5) e pondo, para simplificar, M{x} M{y} = y:
=x,
y=y-bx + bx,
ou seja, y-y=b(x-x).
(8)
Substituindo finalmente b pelo valor dado por (7) (coeficiente de regressão), obtem-se a equação de regressão procurada. O seu gráfico é, manifestamente, uma recta (recta de regressão) que passa pelo ponto (x, y), centro da distribuição considerada, visto serem x e y os valores médios de x e de y. À fórmula (7) pode dar-se um outro aspecto, que interessa particularmente na prática. Chama-se coeficiente de correlação das duas variáveis casuais x, y e representa-se por Px,y' ou simplesmente por P, à covariância dos respectivos desvios reduzidos -
h=
x-x O'x
e k=
y-yO'y
,
483
onde (Jx e (Jy designam, respectivamente, o desvio padrão de x e o desvio padrão de y. Será, pois,
portanto,
c {x, y}
p =- - -
(9)
-
C {x, y} ----:;::==== VV{x} V{y}
o coeficiente de correlação mede o grau de associação das duas variáveis. Como sabemos, tem-se C {x, y} = O se as variáveis casuais x e y são independentes, isto é, se fr(x, y) = fr(x) fr(y); mas a recíproca não é verdadeira. Daqui e da fórmula (9) deduz-se que: O coeficiente de correlação de duas variáveis casuais é nulo, quando as variáveis são independentes. Porém, a recíproca não é verdadeira: correlação nula não significa, necessariamente, independência casual. Posto isto, deduz-se de (9) que (10)
o que, por substituição em (7), atendendo a que V{ x} =(J; , dá (J
(11)
b=p-Y, (Jx
fórmula esta que permite calcular o coeficiente de regressão b a partir do coeficiente de correlação p. Observemos, agora, que, para cada valor Xi de x, o valor de y calculado pela equação (8) de regressão é
e, portanto, o valor médio dos quadrados dos desvios
484
entre os valores observados Yk de Y e os valores calculados Yi será Q = M{[y-y - b(x-i)F} = M{(y_y)2 + b2(x-i)2_2b(x-i)(y-y)} = M{(y_y)2} + b2M{(x-i)2} -2bM{(x-i)(y-y)}
=V{y} + b2V{x}-2bC{x, y}, donde, atendendo a (10) e (11):
ou seja, visto que (12)
O'~
= V{ y}:
Q = V{y}(1_p2).
°
Como é sempre Q > e V{ y } ~ 0, daqui se deduz logo que também será sempre 1- p2 > 0, ou seja,
-l<p<l. Quando se tem p =1 ou P =- 1, será Q=0, o que significa que são nulos todos os desvios Yk - Yi entre os valores observados e os valores calculados por meio de (8) e (11). Por conseguinte: Quando Ipi = 1, todos os pares de valores observados (Xi' Yk) (com frequência não nula) representam pontos situados sobre a recta de regressão. Diz-se, neste caso, que as variáveis x e y estão completamente correlacionadas. Mas este é um caso limite que, em geral, não se verifica rigorosamente na prática: as variáveis apresentam-se, apenas, mais ou menos correlacionadas, positivamente se p > 0, negativamente se p < O. O caso oposto é aquele em que p = (variáveis não correlacionadas), de que é um caso particular, como vimos, o das variáveis casualmente independentes.
°
485
Notemos ainda que, geralmente, os pares (xi' Yk) constituem uma amostra de pares de valores de duas variáveis x, y, contínuas. Assim, o coeficiente p determinado e a equação de regressão estabelecida referem-se a essa amostra e não à totalidade dos pares de valores possíveis. Para se ter uma ideia justa do significado de p relativamente a essa totalidade, efectua-se sobre este coeficiente uma prova de significação (ou teste de significância), em que se toma para número de graus de liberdade, precisamente, o número N de pares observados diminuído de 1. (Sobre este ponto e sobre um exemplo concreto de regressão linear, ver as folhas anteriores). 6. Segunda recta de regressão E'" claro que, assim como procurámos exprimir y como função linear de x (regressão linear de y sobre x), assim, também, poderíamos procurar exprimir x como função linear de y (regressão de x sobre y). Trocando os papéis de x e de y, imediatamente se acha a equação de regressão de x sobre y :
em que bxy (coeficiente de regressão de x sobre y) é dado pela fórmula
Para evitar confusões, o coeficiente de regressão de y sobre x passará a ser designado por byx' tendo-se, como vimos,
Mostram estas fórmulas que, se for p > 0, será também byx > O e bXY>O: y cresce com x e x cresce com y (correlação directa ou positiva); se for p <O, será byX <O e bxy<O (correlação inversa ou negativa). E'" claro que a segunda equação de regressão é a que toma mínima a soma dos quadrados dos desvios Xi - Xk entre os valores de x observados e os valores de x calculados.
486
Como ambas as rectas de regressão passam pelo ponto (x, y), centro da distribuição de x e y, é fácil ver que tais rectas coincidem, se e só se for Ip I=I, caso em que, segundo vimos, todos os pontos representativos estão sobre a primeira (e, portanto, sobre a segunda) recta de regressão (correlação completa). Excluído este caso, o ângulo das rectas será tanto maior quanto menor for Ipi, sendo igual a 90° se p = O (rectas paralelas aos eixos).
l.a recta de regressão y -
2.a recta de regressão
y =b
yx
(x - x)
x-x =bXY(Y -y)
487
7. Organização prática dos cálculos
Visto que se tem C{x,y} =M{a,y} -M{x} M{y}, V{x} =M{X2}_(M{X})2, V{y} =M{y2} -(M{y})2, o coeficiente de correlação pode ser calculado pela fórmula
-1
L n .x.-x
2-2
Ni
I
I
-
1 ~
N
2-2
.L...JmkYk - y k
em que, para simplificar, pusemos
Muitas vezes, é aconselhável fazer uma mudança de origem e uma mudança de unidade de medida, para simplificar os cálculos, de modo análogo ao que se indicou para o cálculo do valor médio e da variância. Se pusermos
sendo a, ~, Xo e Yo constantes (Xo e Yo chamadas médias arbitrárias), virá x -:x = a(u - u), y - y = ~(v - v), donde C{x, y} =a~C{u, v},
V{x} =a2V{u},
V{y} = ~2V{ v}
e, portanto, -2 v
(13)
lL N
-
i
n.u~I
I
u2
488
Por exemplo, se quisermos aplicar estes resultados à tábua de correlação apresentada no n.o 1, podemos tomar para médias arbitrárias os valores
Então, pondo a = p= 1, a mudança de variáveis será
x = u+ 1,70,
y = v+ 1,68.
Posto isto, deverão calcular-se sucessivamente, por um lado, os valores de
n i , Ui' niu i , niu;, Ui
L nikvk, k
bem como as respectivas somas, e, por outro lado,
mk, Vk' mkvk, mkv;, Vk
L nikui · i
É claro que deve ter-se
o que fornece uma verificação. Feitos estes cálculos, resta só aplicar a fórmula (13). Note-se como, por este processo, ficam calculados u, V, V{ U}, V{ v}, o que permite achar rapidamente x = au + X o' Y= pv + Yo' V{x} =a 2V{u}, V{y} =P2V{V} e, portanto, as rectas de regressão.
489
Para a regressão polinomial pode seguir-se um processo análogo. Suponhamos, por exemplo, que se pretende ajustar um polinómio ao seguinte conjunto de pares: x
1,0
1,5
2,0
2,5
3,0
3,5
4,0
y
1,1
1,3
1,6
2,0
2,7
3,4
4,1
Começaremos, então, por representar estes pares graficamente e observar qual o tipo de parábola (isto é, o grau de polinómio) que convém escolher. Neste caso, o gráfico sugere uma parábola do 2~ grau,
Para achar os seus coeficientes, convém fazer a mudança de variável u=2x-5, que dá, para os valores de x atrás indicados, os valores de u
-3,
-2,
-1,
0,
1,
2,
3.
Os cálculos dispõem-se no seguinte quadro:
x
u
Y
1,0 1,5 2,0 2,5 3,0 3,5 4,0
-3 -2 -1
1,1 1,3 1,6 2,0 2,7 3,4 4,1
°21 3
°
16,2
u2
9 4 1
u4
uy
u2 y
81 -3,3 9,9 16 -2,6 5,2 , 1,6 1 -16 0,0 0,0 1 2,7 2,7 6,8 13,6 16 81 12,3 36,9
°41 ° 9 28
196
14,3 69,9
490 2
Daqui, para achar y = bo + blu + b2 u , deduzem-se as equações normais em bo' bl' b2 :
28b o + Ob l + 196b2 = 69,9
Obtém-se, então, y = 2,07 -0,51Iu + 0,061u 2 ,
donde, passando à variável inicial, x: y = 6,15 -2,24x + 0,24x2 •
8. Ajustamentos com mudanças não lineares de variáveis Muitas vezes, o gráfico dos pares de valores observados, ou o conhecimento que se tem a priori do fenómeno a estudar, aconselham um tipo de funções que não se exprime como combinação linear de funções conhecidas uo' ul' ... , u n (cf. n? 2), mas que se converte numa função desse tipo por conveniente passagem a logaritmos. Tal é, por exemplo, o caso das funções do tipo
y = Ca
x
(exponencial)
com C e a constantes. Passando a logaritmos e pondo ao = log C, aI = log a, virá
Poderá, então, aplicar-se o método dos mínimos quadrados a log y, em vez de o fazer para y. Note-se que, mediante esta transformação, a função foi linearizada. Na prática, usa-se nestes casos papel semi-logarítmico, com escala logarítmica no eixo dos yy e escala natural
491
no eixo dos .xx, começando por fazer a marcação dos pontos neste papel: se os pontos se apresentarem aproximadamente em linha recta, é recomendável a regressão linear para log y. Pode acontecer que o gráfico no papel semi-Iogarítmico aconselhe uma parábola de grau igualou superior a 2, imagem dum polinómio P(x). E" claro que, neste caso, o ajustamento de logy
=10gC + P(x) Ioga
equivale ao de y
=
CaP(x).
Além do papel semi-Iogarítmico, pode também utilizar-se papel logarítmico (com escalas logarítmicas em ambos os eixos). Então, se os pontos marcados estiverem aproximadamente em linha recta, toma-se aconselhável para y uma expressão do tipo y
= cxa
(potência de expoente real a),
pois que, por logaritmização, se passa a logy
=10gC + alogx,
relação linear entre log y e log x. O método dos mínimos quadrados será pois, neste caso, aplicado às variáveis log x, log y, e não às va." . navelS x, y. Outras mudanças de variáveis poderão ainda impor-se em diversos casos. Seja, por exemplo, uma função do tipo
1
y=---,
a+bx
cujo gráfico, como sabemos, é uma hipérbole de assimptotas y =0, x=-a/b, visto tratar-se duma jUnção homográfica. Neste caso, por ser
1
-=a+bx, y
492
o método dos mínimos quadrados poderá ser aplicado às variáveis x e l/y, para determinação de a e b. Consideremos, ainda, uma função do tipo Y =k- Ce-cu, com a > O,
sendo k uma constante conhecida e C, a constantes a determinar. Como se tem lim y = k, X~+OO
k -------------------------------------- .
a recta y = k é uma assimptota da curva geralmente conhecida a priori (este tipo de função é comum em fenómenos biológicos de crescimento). Ora, por ser log(k-y) = logC-ax,
o que está indicado, neste caso, é uma regressão linear entre as variáveis x e log(k-y), tomando-se, ainda aqui, aconselhável o uso do papel semi-Iogarítmico. 1 Seja, finalmente, uma função do tipo y = , sendo a uma a + Ce-ax constante conhecida, C e a constantes a determinar (a > O).
-
1
a
493
Como lim y = 1 a
X-7+OO
,
lim y = 0, X-7- 00
a curva tem por assimptotas as rectas y= lia e y=O; é fácil ver ainda que apresenta um ponto de inflexão: dá-se-Ihe o nome de curva logística, e é especialmente indicada para a interpretação de certos fenómenos. Uma curva com análoga configuração (de S deformado), tendo por assimptotas as rectas y = e y = 1, é a que representa a cumulante da distribuição normal; porém, a sua expressão analítica é diversa. Por ser neste caso
°
log
G-
a)
= log C -
(lX,
o que haverá a fazer é aplicar o método dos mínimos quadrados às variáveis x e log (~ - a ) , podendo ainda usar-se, com vantagem, o papel semi-Iogarítmico. ,
9. Regressão múltipla. Indice de correlação, em geral
Suponhamos agora que, em vez de duas, se trata, enl geral, de m + 1 variáveis casuais
das quais se observaram N sistemas de valores
tendo cada um deles uma determinada frequência (absoluta ou relativa) não nula, e que se pretende exprimir aproximadamente y como função de XI' x 2 ' ••• , xm. Se essa função for da forma
sendo u o' ui' ... ' u n funções conhecidas de xi' ... ' x m e ao' ai'···' a n parâmetros a determinar, continua aplicável, mutatis mutandis, tudo o que foi dito no n? 2.
494 Em particular, pode ter-se, precisamente, m = n e
A função a ajustar será então uma função linear das n variáveis Xl'· .. ' Xn (regressão linear múltipla):
em que os coeficientes ao' aI' ... , an serão determinados pelo método dos núnimos quadrados, que, neste caso, conduz às equações normais:
... + [xn]a n = [y] [xl]a O + [xna l + [Xl x 2]a 2 + ... + [Xl xn]a n = [Xl y]
Na o + [xl]a l + [x 2]a 2 + [x 2]a O + [xlxJa l
+ [Xna 2 + ... + [x 2x n]a n = [X2y]
Pode ainda, com vantagem, recorrer-se na prática a mudanças de variáveis que se traduzam por mudança de origem e mudanças de unidade nos diversos eixos. A imagem geométrica da equação de regressão é um hiperplano (um plano, se n = 3). Prova-se facilmente que o hiperplano de regressão passa pelo centro da distribuição dada, isto é, pelo ponto
cujas coordenadas em Rn+ I são os valores médios das variáveis Xl' X 2 , ••• , X n , y.
Em vez da regressão linear (múltipla), é muitas vezes necessário considerar uma regressão não linear, polinomial ou não. Por exemplo, no caso de três variáveis X, y, z, pode tomar-se aconselhável ajustar, aos sistemas de valores observados, um polinómio do tipo (14)
z=a
+ bx + cy + dX2 + exy + fy2,
495
cuja imagem é um parabolóide, elíptico ou hiperbólico. A determinação dos coeficientes será, então, feita pelas seis equações normais seguintes: Na + [x]b + [y]c + [x2]d + [xy]e + [y2]f = [z] [x]a + [x 2]b + [xy]c + [x 3]d + [x2y]e + [xy2]f = [xz]
[y]a + [xy]b + [y2]C + [x 2y]d + [xy2]e + [y3]f = [yz]
visto que, neste caso, se pode tomar
Note-se como as equações normais se deduzem de (14) segundo uma lei simples, que se toma variável reparando primeiro nos segundos membros das equações escritas. Convem ainda lembrar, aqui, que os colchetes com uma só variável representam somatórios simples, os colchetes com duas variáveis, somatórios duplos, os colchetes com três variáveis, somatórios triplos, etc. O coeficiente de correlação p foi definido no n~ 5 apenas para o caso da regressão linear simples; mas vimos que se tem
sendo Q o valor médio dos quadrados residuais, isto é, dos quadrados dos desvios entre os valores de y observados e os valores de y calculados. Desta fórmula se deduz
496
donde a ideia de tomar para índice de correlação, no caso geral (regressão linear ou não linear, simples ou múltipla), o número R dado pela fórmula
R2 = 1 - S/2
'
com SY =
VoQ
,
(jy
em que S} ( :::::; (j ~ ) representa a parte da variância, (j ~ , de y, que não pode ser explicada pela regressão, isto é, pela relação funcional estabelecida entre as variáveis, e que poderá atribuir-se a factores casuais da perturbação (no caso de uma correlação elevada) ou a outras variáveis que possam influir significativamente em y e que não foram consideradas. Muitas vezes, ao estudar a correlação (linear ou não linear) entre três ou mais variáveis xl' x2' • • • , x m ' y, considera-se não só a correlação total, mas também as correlações parciais destas variáveis duas a duas, três a três, etc., para avaliar a influência das variáveis Xl'·.·' X m sobre y (variável que se pretende exprimir como função das primeiras) e daquelas entre si. Pode acontecer que y seja "praticamente" independente de alguma ou algumas das variáveis xl' ... , x m' ou algumas destas se exprimam significativamente como função das restantes, o que tomará aconselhável a supressão de tais variáveis ou a sua substituição por funções das outras, na fórmula final. Note-se que existem provas de significação, não só para os coeficientes de correlação, como ainda para os de regressão, atendendo a que os sistemas de valores observados constituem, apenas, amostras de populações, nos casos correntes da prática. Pode, finalmente, acontecer que a função a ajustar não seja do tipo geral
atrás considerado. Neste caso, podem ainda ensaiar-se mudanças de variáveis, tais como as que foram apresentadas em exemplos no n? anterior.
497
10. Nota sobre as notações Como se disse há pouco, os sistemas de valores observados nos casos correntes da prática constituem apenas amostras duma população base. É então aconselhável representar os diversos parâmetros por letras latinas, para os distinguir dos valores dos parâmetros na população, designados pelas letras gregas correspondentes; por exemplo, Sx (em vez de a x )' para o desvio padrão de x; r (em vez de p), para o coeficiente de correlação, etc.
B - Distribuições de STUDENT e de FISHER. Suas aplicações 1. A melhor estimativa do desvio padrão deduzida duma amostra Consideremos n valores casuais independentes (possivelmente repetidos) de uma variável x, normalmente distribuída com valor médio f.! e desvio padrão a. O sistema (xl' x2 , ••• , x) constitui, pois, uma amostra casual de uma população normal N(f.!, a) (essa população pode ser constituída, nos casos da prática, pelas árvores dum povoamento homogéneo, pelas percentagens da gordura do leite numa raça de vacas, etc., etc.). Considerando a amostra como nova variável (no espaço Rn das amostras de tamanho n), as variáveis casuais xl' ... , xn terão todas a distribuição de x, isto é, serão variáveis N(f.!, a). Então, segundo a propriedade reprodutiva da distribuição normal, a média x+x+···+x 1 1 1 x =} 2 n = -x + -x + ... +-x } 2 n' n n n n (junção linear de x}' ... , x n ) será também normalmente distribuída, com o valor médio M{i} =!M{x}} +!M{xJ + ... +!M{xJ n n n 1 = - nM{x} = M{x} = 11, n
visto que M{x}}
= ... =M{xn } =M{x}, e com a variância
498
V{i} =
~ V{X I } + ... + ~ V{Xnl
n n 1 (52 =-nV{x}=-, n2 n
donde o desvio padrão
=~ vn·
a-x = YV{i}
A distribuição de i será, pois,
e o desvio reduzido da variável i será 't-
-
-
X-IIr _ X-fl - X-fl ...vn i
- ai - a/Vn -
a
'
com a distribuição normal estandardizada, N(O, 1). Em muitas questões da prática é desconhecido (ou até hipotético) o desvio padrão, a, da população base, e é-se tentado a substituí-lo pelo desvio padrão, s, duma amostra (Xl' ... , x n ) da população. Tem-se, então, s=
(Xl -i)2 + (X2 -i)2 + ... + (Xn _i)2
onde, como vimos, i
n
=! (Xl + ... + x
n ).
Porém, um cálculo simples
n mostra que a esperança matemática (ou valor médio) de S2 é E{s2} =
Assim, o valor esperado de ção. Por isso, como se tem
n-l a 2. n
S2
não é a variância a 2 da popula-
E{ n-l n S2} = a 2,
499
toma-se como a melhor estimativa de a 2 (na amostra considerada) o valor (x I _X)2 +
... + (xn _X)2 n-1
n
_ _ S2=
n-1
e, portanto, como a melhor estimativa de a (na amostra), o valor s
g
n-1
-
Dum modo geral, a melhor estimativa dum parâmetro da população, deduzida de uma ou mais amostras, é representada pela letra grega que designa esse parâmetro, encimada dum acento circunflexo. Será, pois,
-g a=s
Este factor
n-1
.
rn, que permite passar de s para a melhor
~~
estimativa de a, é chamado de correcção de BESSEL, a qual pode ser dispensada quando n é bastante grande, por ser então praticamente igual a 1. 2. Distribuição de t de STUDENT
Como vimos atrás, o desvio reduzido de X, ou seja, -
't
X-fl =_--.:...,
a/Vii
é uma variável N(O, 1). Porém, se substituirmos a pela sua melhor estimativa, calculada na amostra (Xl' X 2' ••• , x n ), obtém-se a seguinte variável, estimativa de 't: -
t=
X-fl
a/Vii
-
=
X-fl
s/v'n - 1
,
500
que depende de xl' ... , x n ' não só por intermédio de X, como também por intermédio de s e que, por isso, já não segue a distribuição normal, embora desta se aproxime, com valor médio O e desvio padrão 1, quando n é bastante elevado. Foi STUDENT quem primeiro abordou e resolveu o problema da distribuição exacta da referida variável t, função das n variáveis xl' ... ' x n ' todas N(f.!, a); obteve, assim, a chamada distribuição de STUDENT com n -1 graus de liberdade, cuja função de densidade é
que, como se vê, não depende dos parâmetros da população inicial. (N ote-se como aqui intervem a função r de EULER, o que sucede em várias distribuições estudadas em Estatística). Como era de esperar, o gráfico de S/t) assemelha-se à curva de GAUSS; é, como esta, simétrica em relação ao eixo das ordenadas, mas um pouco mais achatada, tanto mais quanto menor for n. N o que se segue, designaremos genericamente por P uma probabilidade e por p o número 1OOP. Será, assim,
P=~=p%. 100
Ora, a probabilidade P de o desvio t exceder em módulo um certo limite t p (onde p = 100 P) é dada pela fórmula
visto que o gráfico de S/t) é simétrico em relação ao eixo das ordenadas. Este valor de P representa, com efeito, a área do domínio ilimitado que se indica a tracejado na figura:
501
t
No final destes apontamentos é dada uma tabela em que, para diferentes valores de v (número de graus de liberdade) se indicam os valores de tp correspondentes às probabilidades P =0,05 (5%), P=O,Ol (l %), P=O,OOl (0,1 %). A tabela está, pois, construída para afunção inversa da anterior. 3. A melhor estimativa de ()" deduzida a partir de várias amostras
Suponhamos agora que, em vez de uma, se trata de k amostras de uma mesma população N(J..L, a). Sejam np n2 , ••• , nk , os tamanhos dessas amostras, e sI' S2' •.• ' Sk' os respectivos desvios padrão. Prova-se então, como para o caso duma só amostra, que a melhor estimativa de a baseada nessas amostras é dada pela fórmula
querendo-se com isto dizer que o valor esperado de 8 2 é a 2, isto é, que
502
4. Distribuição da diferença entre duas médias
Consideremos duas amostras casuais independentes
de uma mesma população normal N(Jl, 0'), e sejam i, vas médias. O valor esperado para i - Yserá, então, M{i - y}
=M{i} -
M{y}
y as respecti-
= /l- /l = O.
Por outro lado, já sabemos que serão O'/Vm e O'/Vn os desvios padrão, respectivamente, de i e y, donde _
(52
_
(52
V{x} = - , V{y} = -
m
n
e, portanto, visto que i e y são independentes, V{i - y} = V{i + (-l)y}
=V{i} + (-1)2V{y}
O desvio padrão de i -
Yserá, pois.
a{i-y} =YV{X-y} =aJ 1 + 1 . m
n
Notemos, ainda, que por ser
(função linear das variáveis normais xl' x 2 , ... , x m ' Yl''''' também i - Yuma variável normal, cujo desvio reduzido,
yJ,
será
503 (1)
1=
(i -
y) - M(i - y) a{i - y}
x- y
[!;?;;1
=----
a -+m
n
terá, portanto, a distribuição N(O, 1). Desconhecendo-se o valor de a, é-se levado a substituir a pela sua melhor estimativa, â, baseada nas duas amostras consideradas. Tem-se, pelo que vimos no n.o anterior,
sendo SI e S2 os desvios padrão de cada uma das amostras. Substituindo, então, a por â em (1), o desvio reduzido 1 resulta substituído pelo estatístico
x-y
t =------'-----
--[!;?;;1 -+a
m
n
x-y
m+n-2 1 1 -+m n
Pois bem, demonstra-se que a distribuição desta variável é ainda a distribuição de STUDENT com m+n-2 graus de liberdade.
5. Prova do t (de significação)
Os importantes resultados anteriores aplicam-se em provas de significação, correntemente usadas na prática e das quais distinguiremos dois tipos: a) - Determinou-se a média i duma amostra de n valores duma variável normal x e pretende-se saber se, em face desse resultado, é ou não aceitável a hipótese de que a média 1-1 na população base tem um certo valor 1-10. A "hipótese nula" consiste, pois, neste caso, em supor 1-1 = 1-10· Para aplicar a prova do t, há que fixar, previamente, um nível de significação p% (geralmente 5%, 1% ou 0,1 %). Ora, já sabemos que o estatístico (I) (1) - Convem ter presente que t é uma estimativa do desvio reduzido 'to
504 -
-
X-Il
(2)
x-Il s/Yn -1
t=---
a/Vii
tem a distribuiçao de STUDENT com n -1 graus de liberdade. A prova de significação consiste, então, em substituir Jl por 110 em (2), calcular o valor de t correspondente, -
t=
X-II
1"'0
a/Vii '
e procurar, na tabela do t de STUDENT, para n-l graus de liberdade(l) o valor t p correspondente ao nívelp% escolhido (P=p/l00). Já sabemos que é, então,
Pr(ltl~t)=~. p
100
Portanto, se o valor de t calculado é superior a tp ' rejeita-se a hipótese nula ao nível de p% escolhido (visto que a probabilidade de um desvio > t em módulo é tanto menor quanto maior for t). Se o valor de t calculado for inferior a t p ' aceita-se a hipótese nula ao nível de p% ou aguarda-se ulterior informação. Quando a amostra é bastante grande, a distribuição de t aproxima-se da normal, podendo, então, ser substituída por esta. Exemplo - Uma amostra de 9 homens de uma grande cidade deu, para as suas alturas, uma média de 1,72 m, e uma variância corrigida (8 2) de 0,13 m2 • Deseja-se saber se este resultado é compatível, ao nível de 5%, com a hipótese de que a média na cidade é 1,70 (admitindo que a distribuição das alturas na cidade é sensivelmente normal). Então:
x 3 - °17 vn- xa- 11 "c - 0,02 0,36 - , .
t-
(1) - Ver tabela final. Não esquecer que nesta tabela v indica o número de graus de liberda-
de, que no caso da fórmula é n - 1.
505
Ora, o valor t5 da t correspondente ao nível de 50/0, para 9-1 = 8 graus de liberdade, é 2,306; como o valor de t calculado (0,17) é muito inferior a t5 , a hipótese é confirmada ao nível de 5% (visto que a probabilidade de um valor casual de t igualou superior em módulo aO, 17 é bastante superior a 0,05). b) - Determinaram-se as médias x e y de duas amostras, de tamanhos m e n de populações normais, e pretende-se saber se estas médias são significativamente diversas, isto é, se são, na realidade, diferentes as médias /-1 1e /-12 das respectivas populações. A hipótese nula consiste em supor /-11 =/-12' o que, supondo também iguais os desvios padrão 0'1 e 0'2' equivale a supor que as amostras foram extraídas da mesma população normal. Então, pelo que vimos no número anterior, basta calcular
t=
x-y
_~1 O' -+m
n
x-y
m+n-2
Yms 1 + ns2
1 1 -+m n
- ~==::::;==::::::;2 2
e procurar na tabela o valor de t p correspondente ao nível de significação de p% escolhido. Se t for superior ou igual a t p ' rejeita-se a hipótese nula, se não, aceita-se a hipótese nula ou aguarda-se nova informação. Exemplo - Uma amostra das alturas de 9 habitantes de uma grande cidade deu os valores x = 1,70 m e s~ = 90 cm 2 • Outra amostra de 10 alturas de outra grande cidade deu y = 1,69 m e s~ = 105 cm 2 • Pretende-se saber se é aceitável a hipótese de que nas duas cidades a estatura média é sensivelmente a mesma (admitindo que a distribuição das alturas nas duas cidades é normal, com iguais desvios padrão). Neste caso, o valor de t calculado é 0,208 e, como o valor t5 de t, correspondente a 5% para 17 graus de liberdade (9+10-2=17), é 2,110, bastante superior a 0,208, segue-se que a hipótese é admissível ao nível estabelecido.
506
OBSERVAÇÃO IMPORTANTE. Nem sempre é necessário que as variáveis x, y, ... consideradas nas questões práticas sejam normais para que se possam aplicar as provas de significação anteriores. Com efeito, há um teorema muito importante do Cálculo das Probabilidades, chamado teorema central do limite, do qual se deduz como corolário o seguinte: Qualquer que seja a distribuição duma variável casual x, se for ).l o seu valor médio e a o seu desvio padrão, a distribuição da variável
ç=
-
x-~
a/Vii
converge para a distribuição normal estandardizada quando n ~ 00. Na prática, basta que a amostra seja de tamanho n > 30 para que a distribuição de ç se possa considerar, sem erro apreciável, idêntica a N(O, 1).
6. Intervalos de tolerância e intervalos de confiança Suponhamos que é conhecido o desvio padrão a duma variável normal x e que se pretende saber se é legítimo ou não tomar para valor médio ).l de x um dado número ).lo' Consideremos, então, uma amostra casual
de valores independentes de x; já sabemos (n? 1) que a média - = -;; 1~ . / I N ( ~'Vii' P ortanto, na h'lpotese).l / X ~ Xi e/ uma varlave =).lo
a)
(hipótese nula), o estatístico -
(3)
't
=
X-II
ro
a/Vii
deverá ser uma variável N(O, 1), e, assim, a probabilidade P de que I't I exceda um certo limite 'tp (onde p = 100 P) é dada pela fórmula P = Pr(1 't I ~ 'tp ) =
2I
+00
'Lp
<p(x)dx ,
507
onde
(função de densidade da distribuição normal estandardizada). Por conseguinte, a hipótese J.l= J.lo será admitida ao nível de p%, se e só se l'tl <'tp' isto é, se (4)
Ora, como de (3) se deduz
-
x=Jlo+'t
a
vn ,
podemos concluir de (4) que os valores de x tolerados pela hipótese nula são os que verificam a condição (5)
isto é, os valores do intervalo
] !lo -
~p ~
,
!lo +
~p ~
[
,
chamado intervalo de tolerância. A probabilidade de que x esteja fora deste intervalo é P = p/I 00 e, portanto, a probabilidade de que x esteja dentro deste intervalo é l-P (área do domínio tracejado na figura).
508
Mas a questão pode ainda pôr-se da maneira inversa, embora equivalente. A fórmula (5) mostra que os valores f..l o que merecem confiança ao nível considerado, em face da média x achada na amostra, são todos os que verificam a condição isto é, são os valores !lo do intervalo ]
x- 't
p ..
x- "Cp
~ < ~o < X + 't .. ~
vn
p
vn
,
::n 'x ::n [ + "Cp
cha-
mado intervalo de confiança. Neste caso, sendo x variável, l-P dá-nos a probabilidade de que o intervalo de confiança contenha o verdadeiro valor médio f..l de x e recebe o nome de grau de confiança desse intervalo (I). Na prática, toma-se geralmente para nível de significação nestas questões o de 5% (p =5) e, portanto, para grau de confiança, o de 95%. Ora, como se pode ver numa tabela relativa à distribuição N(O, 1), tem-se 'ts = 1,96,
valor próximo de 2. Assim, a probabilidade de um desvio superior em módulo ao dobro do desvio padrão é um pouco menor que 5 % (já sabemos que a probabilidade de um desvio superior em módulo ao triplo do desvio padrão é cerca de 0,003 =0,3%). Exemplo - Um fabricante produz lâmpadas eléctricas cuja duração média f..l é de 2000 kw/h, com o desvio padrão (j = 300 kw/h. Examinando uma amostra de 100 lâmpadas obtidas por um novo método de fabrico, encontra a média x = 2080 kw/h. Admitindo que o novo método de fabrico não altera o desvio padrão desta variável, achar o intervalo de confiança correspondente à média obtida (com o grau l-P=0,95) e compará-lo com o primeiro valor médio. Neste caso será (ver OBSERVAÇÃO IMPORTANTE do n? 5) (j
'tp
c = 1,96 vn
..
300
v100 = 60, 100
(1) - Não seria correcto dizer que l-P é a probabilidade de J..l estar naquele intervalo, visto que J..l é fixo.
509
donde os extremos do intervalo de confiança: 2080 - 60 =2020,
2080 + 60 =2140.
o intervalo de confiança pedido será, pois, ] 2020 , 2140 [ . Vê-se assim que o primeiro valor médio não cai neste intervalo. Também se vê que, por exemplo, é razoável admitir como duração média das novas lâmpadas o número redondo 2100 kw/h. 7. Intervalos de confiança quando não é conhecido o (F da população
As considerações anteriores foram desenvolvidas na hipótese de ser conhecido o desvio padrão (j da população base. Se este não for conhecido, poderá ser substituído pela sua melhor estimativa, â, deduzida da amostra. Mas então, em vez do desvio reduzido 't, só podemos utilizar a sua estimativa t dada pela fórmula -
_ X-Il t-
â/Vfi .
Portanto, uma vez fixado um nível P=p%, o valor t p correspondente é, como vimos, dado pela tabela da distribuição de STUDENT para n -1 graus de liberdade. Somos assim, naturalmente, induzidos a chamar intervalo de confiança para J.l, com o grau l-P= 100-p%, ao intervalo
Obtêm-se, deste modo, com um mesmo nível p%, intervalos de confiança mais largos (logo, menos precisos) do que no caso anterior. Mas não esqueçamos que, quando n é muito grande, a distribuição de STUDENT confunde-se praticamente com a normal.
510
Exemplo - Retomemos o primeiro exemplo do número 5. Trata-se duma amostra de alturas de 9 homens (n=9), com a média x =1,72 e o desvio padrão corrigido â= 0,36. Fixado o nível de significação 5%, acha-se, para 8 (=9-1) graus de liberdade, o valor t5
::::::
2,31 (superior a "C5 = 1,96).
Portanto, os extremos do intervalo de confiança com o grau 95% serão 1,72 + 2,31 x 0,36 3
= 1,72 + 0,28.
Como se vê, o valor 1,70 proposto no n? 5 para média da população está perfeitamente incluído neste intervalo. É claro que todas estas considerações se podem aplicar, mutatis mutandis, ao caso da medição de grandezas (TEORIA DOS ERROS). 8. Aplicações agronómicas
A prova do t é de uso correntíssimo na prática agronómica. Pode usar-se, por exemplo, para comparar a percentagem média da gordura do leite em duas espécies, raças ou sub-raças de mamíferos, a produtividade média do trigo em duas variedades deste cereal, _ etc., etc. Assim, o dizer-se que o leite de cabra é (em média) mais gordo que o leite de vaca é uma afirmação cujo valor só pode ser avaliado estatisticamente usando, por exemplo, a prova do t. De resto, já o dizer que a percentagem média da gordura em tal espécie ou tal raça é um certo número /-l é uma afirmação que, para ser verdadeiramente útil, deve vir acompanhada da indicação do desvio padrão ou ser substituída pela indicação dum intervalo de confiança (no caso de se conhecer, apenas, uma amostra pequena). Importa ainda salientar o seguinte: nem sempre é razoável admitir que a distribuição duma variável biométrica, numa dada população, é normal; mas, neste caso, bastará ter presente a OBSERVAÇÃO IMPORTANTE do n? 5.
511
9. Distribuição de F e de z de FISHER Já sabemos que, dadas m variáveis independentes e normais estandardizadas, XI' x 2 ' ••• , x m ' sendo m > 1, a variável
não segue a distribuição normal, mas sim a distribuição do X2 de PEARSON, cuja função de densidade já foi indicada neste curso. Consideremos agora, mais geralmente, m + n variáveis independentes e normais estandardizadas, XI' x 2'···' x m ' YI' Y2' ... , Yn , e ponhamos
Então, a variável
seguirá uma nova distribuição, chamada por SNEDECOR distribuição de F para. (m, n) graus de liberdade, e tabelada por aquele estatístico para os níveis de 5% e 1% e para diferentes pares de valores (m, n). A letra F foi escolhida em homenagem a FISHER, que primeiramente tinha estudado a distribuição da variável
1 2
z =-logF
deduzindo matematicamente a expressão analítica da função da densidade dessa distribuição, expressão que nos abstemos de apresentar aquI. Estas distribuições intervêm essencialmente na análise de variância, método estatístico criado por FISHER, de grande importância em investigações agronómicas, usando-se, por exemplo, para comparar simultaneamente diversas variedades de trigo, os efeitos de diversos factores fertilizantes ou tratamentos de plantas, etc., etc. Infelizmente, não podemos, sequer, abordar o estudo deste assunto, relativo ao DELINEAMENTO E ANÁLISE DE EXPERIÊNCIAS, o grande problema central da Estatística Agronómica.
512
TÁBUA DA DISTRIBUIÇÃO NORMAL
'tp
p
como função de p
p como função de 'tp
= 100P
'tp
'tp
P = 100P
100 95 90 85 80 75 70 65 60 55 50 45 40 35 30 25 20 15 10 5 1 0,1 0,01
0,0000 0,0627 0,1257 0,1891 0,2533 0,3186 0,3853 0,4538 0,5244 0,5978 0,6745 0,7554 0,8416 0,9346 1,0364 1,1603 1,2816 1,4395 1,6449 1,9600 2,5758 3,2905 3,8906
0,0 0,2 0,4 0,6 0,8 1,0 1,2 1,4 1,6 1,8 2,0 2,2 2,4 2,6 2,8 3,0 3,2 3,4 3,6 3,8 4,0
100,000 84,148 68,916 54,851 42,371 31,731 23,014 16,151 10,960 7,186 4,550 2,781 1,640 0,932 0,511 0,270 0,137 0,067 0,032 0,014 0,006
513
TÁBUA DA DISTRIBUIÇÃO DE t DE STUDENT (I)
v 1 2 3 4 5 6 7 8 9 10 11 12
13 14 15 16 17 18 19 20 21 22 23 24 25
p=5 tp =
p=1 tp =
12,706 4,303 3,182 2,776 2,571 2,447 2,365 2,306 2,262 2,228 2,201 2,179 2,160 2,145 2,131 2,120 2,110 2,101 2,093 2,086 2,080 2,074 2,069 2,064 2,060
63,657 9,925 5,841 4,604 4,032 3,707 3,499 3,355 3,250 3,169 3,106 3,055 3,012 2,977 2,947 2,921 2,898 2,878 2,861 2,845 2,831 2,819 2,807 2,797 2,787
p=O,1 tp =
v
636,619 26 31,598 27 12,941 28 29 8,610 6,859 30 5,959 35 5,405 40 5,041 45 4,781 50 4,587 60 4,437 70 4,318 80 4,221 90 4,140 100 4,073 120 4,015 140 3,965 160 3,922 180 3,883 200 3,850 300 3,819 400 3,792 500 3,767 3,745 1000 00 3,725
p=5 tp =
p=1 tp =
p = 0,1 tp =
2,056 2,052 2,048 2,045 2,042 2,030 2,021 2,014 2,008 2,000 1,994 1,990 1,987 1,984 1,980 1,977 1,975 1,973 1,972 1,968 1,966 1,965
2,779 2,771 2,763 2,756 2,750 2,724 2,704 2,689 2,678 2,660 2,648 2,638 2,631 2,626 2,617 2,611 2,607 2,603 2,601 2,592 2,588 2,586
3,707 3,690 3,674 3,659 3,646 3,592 3,551 3,521 3,496 3,460 3,435 3,416 3,402 3,390 3,373 3,361 3,352 3,346 3,340 3,324 3,315 3,310
1,962 1,960
2,581 2,576
3,300 3,291
v = número de graus de liberdade.
(1) - Comparar t p com 'tp.na tábua da distribuição normal, para valores pequenos e para valores grandes de v (cf. v =00).
514 2
TÁBUA DA DISTRIBUIÇÃO DO X DE PEARSON PROBABILIDADE (P) n
0,90
0,80
0,70
0,50
0,30
0,20
0,10
0,05
0,02
1 2 3 4 5 6 7 8 9 10 12 14 16 18 20 22 24 26 28 30
0,016 0,21 0,58 1,06 1,61 2,20 2,83 3,49 4,17 4,87 6,30 7,79 9,31 10,87 12,44 14,04 15,66 17,29 18,94 20,60
0,064 0,45 1,01 1,65 2,34 3,07 3,82 4,59 5,38 6,18 7,81 9,47 11,15 12,86 14,58 16,31 18,06 19,82 21,59 23,36
0,15 0,71 1,42 2,20 3,00 3,83 4,67 5,53 6,39 7,27 9,03 10,82 12,62 14,44 16,27 18,10 19,94 21,79 23,65 25,51
0,46 1,39 2,37 3,36 4,35 5,35 6,35 7,34 8,34 9,34 11,34 13,34 15,34 17,34 19,34 21,34 23,34 25,34 27,34 29,34
1,07 2,41 3,67 4,88 6,06 7,23 8,38 9,52 10,66 11,78 14,01 16,22 18,42 20,60 22,78 24,94 27,10 29,25 31,39 33,53
1,64 3,22 4,64 5,99 7,29 8,56 9,80 11,03 12,24 13,44 15,81 18,15 20,47 22,76 25,04 27,30 29,55 31,80 34,03 36,25
2,71 4,61 6,25 7,78 9,24 10,65 12,02 13,36 14,68 15,99 18,55 21,06 23,54 25,99 28,41 30,81 33,20 35,56 37,92 40,26
3,84 5,99 7,82 9,49 11,07 12,59 14,07 15,51 16,92 18,31 21,03 23,69 26,30 28,87 31,41 33,92 36,42 38,89 41,34 43,77
5,41 7,82 9,84 11,77 13,39 15,03 16,62 18,17 19,68 21,16 24,05 26,87 29,63 32,35 35,02 37,66 40,27 42,86 45,42 47,96
0,01 0,001 6,64 9,21 11,34 13,28 15,09 16,81 18,48 20,09 21,67 23,21 26,22 29,14 32,00 34,81 37,57 40,29 42,98 45,64 48,28 50,89
10,83 13,82 16,27 18,47 20,52 22,46 24,32 26,13 27,88 29,59 32,91 36,12 39,25 42,31 45,32 48,27 51,18 54,05 56,89 59,70
INDICAÇÕES BIBLIOGRÁFICAS São particularmente recomendáveis, aos alunos do Instituto Superior de Agronomia, as três seguintes obras, além das que já foram anteriormente indicadas. M. LAMOTTE - Initiation aux Méthodes Statistiques en Biologie. Masson & Cie. Paris, 1957. M. J. MORONEY - Facts from Figures. Penguin Books, Londres, 1954. SIXTO RIOS - Métodos de la Estatística. Madrid, 1952. As duas primeiras fornecem uma excelente e agradável iniciação nos métodos estatísticos, com grande número e variedade de exemplos de aplicação. A terceira é uma obra de nível mais elevado, com larga informação que inclui os aspectos mais modernos da Estatística. Desse livro foram extraídos vários dos exemplos que figuram nestes apontamentos.
íNDICE CÁLCULO DAS PROBABILIDADES
ADVERTÊNCIA PRÉVIA.. .. ..... .......... ............
317
1.4.1 INTRODUÇÃO AO CÁLCULO DAS PROBABILIDADES: POPULAÇÕES FINITAS
319
A - Frequências .. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
319
1. Primeiros exemplos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2. Populações. Álgebra dos atributos. . . . . . . . . . . . . . . . . . . . . . . 3. Álgebra dos acontecimentos. . . . . . . . . . . . . . . . . . . . . . . . . . . . 4. Acontecimentos expressos em forma proposicional. . . . . . . . . 5. Frequência dum atributo numa população. . . . . . . . . . . . . . . . . 6. Frequência de um acontecimento numa série de provas . . . . . . 7. Partições. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8. Corpos de conjuntos, corpos de atributos, corpos de acontecimentos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9. Distribuição em universos finitos. . . . . . . . . . . . . . . . . . . . . . . . 10. Soma de conjuntos não disjuntos (atributos ou acontecimentos compatíveis) ................ 11. Atributos quantitativos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12. Representação gráfica das distribuições: histogramas e polígonos de frequência.. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13. Independência e associação de atributos. Distribuições de duas ou mais variáveis. . . . . . . . . . . . . . . . . . .
319 322 325 326 328 330 331 333 337 339 341 345 348
518 14. Associação e independência de partições múltiplas. . Ta/b uas de contmgencIa .............................. . 15. Associações parciais de atributos. Independência de atributos no caso em que o seu número é superior a dois ..... 16. Interpretação de uma tábua de contingência. Testes de significância ............................... . A
•
355 359 363
B - Probabilidades .................................... .
373
/· ln . d utlva . ..................................... 1. Loglca 2. Lógica dedutiva .................................... 3. Conceito natural de probabilidade ...................... 4. Axiomatização do conceito de probabilidade .............. 5. Alguns exemplos de cálculo de prodabilidades a priori . .... 6. Independência e associação de acontecimentos ............ 7. Sistema de duas experiências .......................... 8. Sistema de várias experiências ......................... 9. Distribuição binomial ou de Bernoulli ................... 10. Conceito de moda. Caso da distribuição normal ........... 11. Distribuição polinomial. Amostras casuais ............... BIBLIOGRAFIA ......................................
. . . . . . . . . . . .
373 376 378 382 385 396 398 403 404 409 411 414
1.4.2 APONTAMENTOS DE CÁLCULO DAS PROBABILIDADES .............................. .
415
A - Distribuições de uma variável contínua real ............ .
415
B - Valores médios para distribuições de uma variável real .. .
425
C - Valores médios para distribuições de mais de uma variável real ...................................... .
438
D - Aplicação à distribuição binomial. Teorema de BERNOULLI ..................................... .
451
E - Distribuição normal ................................ .
455
F - Convergência de distribuições. Relação entre as distribuições normal e binomial ........ .
464
G - A distribuição de X2 de PEARSON ................... .
465
NOTA SOBRE A AVALIAÇÃO DA VARIÂNCIA .......... .
469
519
1.4.3 ADITAMENTO ÀS LIÇÕES DE CÁLCULO DE PROBABILIDADES. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
471
A - Regressões. Ajustamentos. Correlação . . . . . . . . . . . . . . . . .
471
1. Formulação geral do problema. . . . . . . . . . . . . . . . . . . . . . . . . . 2. Ajustamentos pelo método dos mínimos quadrados. . . . . . . . . 3. Outra forma das equações normais. . . . . . . . . . . . . . . . . . . . . . . 4. Regressão polinomial. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5. Regressão linear. Correlação . . . . . . . . . . . . . . . . . . . . . . . . . . . 6. Segunda recta de regressão. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7. Organização prática dos cálculos . . . . . . . . . . . . . . . . . . . . . . . . 8. Ajustamentos com mudanças não lineares de variáveis. . . . . . . 9. Regressão múltipla. Índice de correlação em geral. . . . . . . . . . 10. Nota sobre as notações. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
471 476 479 480 481 485 487 490 493 497
B - Distribuições de STUDENT e de FISHER. Suas aplicações. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
497
1. A melhor estimativa do desvio padrão deduzida duma amostra . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2. Distribuição t de STUDENT . . . . . . . . . . . . . . . . . . . . . . . . . . . 3. A melhor estimativa de (J deduzida a partir de várias amostras . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4. Distribuição da diferença entre duas médias . . . . . . . . . . . . . . . 5. Prova do t (de significação) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6. Intervalos de tolerância e intervalos de confiança . . . . . . . . . . . 7. Intervalos de confiança quando não é conhecido o (J da população. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8. Aplicações agronómicas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9. Distribuição de Fez de FISHER . . . . . . . . . . . . . . . . . . . . . . . .
497 499 501 502 503 506 509 510 511
TÁBUA DA DISTRIBUIÇÃO NORMAL. . . . . . . . . . . . . . . . . . .
512
TÁBUA DA DISTRIBUIÇÃO DE t DE STUDENT . . . . . . . . . . .
513
TÁBUA DA DISTRIBUIÇÃO DE X2 DE PEARSON . . . . . . .. ..
514
INDICAÇÕES BIBLIOGRÁFICAS. . . . . . . . . . . . . . . . . . . . .. ..
515