1.4 CÁLCULO DAS PROBABILIDADES
316
Pรกgina em branco
ADVERTÊNCIA PRÉVIA
Com o capítulo relativo a populações finitas, inicia-se a publicação das nossas lições de Cálculo das Probabilidades no Instituto Superior de Agronomia. Os capítulos seguintes serão publicados à medida que a experiência nos indicar qual a melhor orientação a seguir no ensino desta matéria, tendo sempre em conta a finalidade prática desse ensino e as condições especiais em que tem de ser realizado. Na preparação das nossas lições serviram-nos de base, principalmente, as seguintes obras: G. CASTELNUOVO - Calcolo delle probabilita, Zanichelli, Bologna, 1933. D. J. FINNEY - An introduction to statistical science in Agriculture, John Wiley Sons, New York, 1953. " CRAMER - Mathematical methods oi Statistics, Princeton University Press, Princeton, 1951. G. UDNY YULE and M. G. KENDALL - An introduction to the Theory oi Statistics, Charles Griffin, Londres, 1937. P. de VARENNES E MENDONÇA - Noções de Cálculo das Probabilidades, Instituto Superior de Agronomia, Lisboa, 1950. Convirá, no entanto, precisar, desde já, que tanto a orientação geral do curso, como muitos dos pormenores didácticos têm carácter pessoal. Lisboa, Maio de 1955 J. Sebastião e Silva
318
Pรกgina em branco
1.4.2 APONTAMENTOS DE CÁLCULO DAS PROBABILIDADES
A - Distribuições de uma variável contínua (real)
Consideremos na recta real, R, um intervalo U de extremos a, b, que, para fixar ideias, vamos supor limitado e fechado: U = [a, b]. Seja x uma variável casual (comprimento, densidade, percentagem ou qualquer outra espécie de grandeza) que toma todos os seus valores no intervalo [a, b]. Trata-se, pois, agora, duma variável casual contínua (variável real). Suponhamos que, para cada intervalo J contido em U, existe uma determinada probabilidade de que o valor de x esteja em J. Essa probabilidade representa-se por qualquer dos símbolos Pr(x E J) ou Pr (J).
Em particular, se for J = [xl' x 2 ], poderá, ainda, escrever-se
se for J = [xl' x 2 [, poderá escrever-se Pr(J) = Pr (Xl
< x < xJ, etc.
416
É claro que Pr(I), função numérica do intervalo variável I CU, deve satisfazer às seguintes condições (ou axiomas): I. Pr(I) > 0, qualquer que seja 1. II. Pr(I) = 1, se 1= U. III. Pr(II + 12) =Pr(II) + Pr(I), se II e 12 forem intervalos contíguos mas disjuntos. Note-se que esta última condição pode apresentar-se com vários aspectos. Assim, se forem xl' x 2 ' x 3 três pontos de U, tais que Xl < x 2 < x 3 ' pode ter-se: Pr(x I < X <x3 ) = Pr(xI < X < x) + Pr(x2 < x <x3 ) = Pr (Xl < X < x 2 ) + Pr (x2 < X < x 3 )
Pr(x I < X < x 3) = Pr(xI < X < X) + Pr(x2 < X < x 3), etc. Dum modo geral, quando Xl =x2' identificaremos o intervalo com o ponto Xl e escreveremos
[Xl' X 2]
Verificadas as referidas condições, diremos que a função Pr(I) é uma distribuição de X definida sobre o intervalo U (universo infinito, visto ser formado por uma infinidade de pontos). Das condições I, II e III, resulta que é sempre
°<
Pr (1) < 1.
Também é fácil ver que, por exemplo:
Outras consequências poder-se-iam deduzir, ainda, de tais axiomas. NOTA. Às condições anteriores pode juntar-se, para fins teóricos, uma outra (axioma de continuidade), que enunciaremos nos seguintes termos:
417
IV. Dada uma sucessão infinita (1,) de intervalos tais que
sendo J a reunião de todos estes intervalos, ter-se-á Pr(J)
= lim Pr(1,). n--7
00
Em estudos de nível mais elevado, os axiomas III e IV são substítuidos por um outro, mais geral, relativo à soma de sucessões infinitas de conjuntos Cn disjuntos dois a dois. O axioma traduz-se, simplesmente, pela fórmula
Os conjuntos Cn podem ser intervalos ou quaisquer outros conjuntos que se possam construir a partir dos intervalos pela aplicação sucessiva ou alternada do símbolo 00
L 1
e de passagens ao complementar: dá-se-Ihes o nome de conjuntos borelianos ou conjuntos de BOREL.
Fig. 1
Exemplo - Numa roleta "perfeita", cada ponto P da sua circunferência é determinado por um número real 8, igualou superior a O e
418
menor que 2n, que é o arco Po P, medido em radianos num sentido prefixo, tomando como origem um ponto P o' É claro que a correspondência P ~ 8 assim estabelecida, entre os pontos da circunferência e os pontos do intervalo [O, 2n[, é biunívoca. As probabilidades correspondentes a dois arcos iguais serão também iguais (na hipótese de a roleta ser perfeita). Por sua vez, a probabilidade correspondente à circunferência será Pr(O < 8 < 2n) = 1. Então, atendendo à condição III, é fácil ver que Pr (8 1 < 8 < 8) =Pr (8 1 < 8 < 8 2) _
8 2 -8 1 2n
Em particular, tem-se
isto é, a probabilidade de cada valor particular 8 1 de 8 é nula; não quer isto dizer, porém, que qualquer dos acontecimentos individuais 8 = 8 1 seja impossível, pois que um deles há-de realizar-se, necessariamente, em cada prova. O que podemos dizer, ainda aqui, é que se trata de acontecimentos praticamente impossíveis. Dada uma distribuição de probabilidade, Pr(J), sobre o intervalo U = [a, b], o número Pr (x < u)
=Pr([a, u])
é, manifestamente, uma função de u, a que chamaremos cumulant da distribuição. Representamo-la por <l>(u) ou, mesmo, por <l>(x), tomando x para variável independente, em vez de u. É claro que, aumentando u, <l> (u) não pode diminuir, em virtude das condições I, II, III: afunção <l>(x) é, pois, crescente em sentido lato no intervalo U.
419
NOTA. Do axioma IV deduz-se que Pr (x < u) = lim <p(x) = <p(u-). x~u-
Com efeito, dada uma sucessão crescente de pontos x n ' convergente para u, o intervalo [a, u [ será a reunião de todos os intervalos [a, x n ] e, portanto, a probabilidade de x estar em [a, u[, ou seja, Pr(x < u), será o limite, quando n ~ 00, da probabilidade de x estar em [a, x n ]. Tem-se, pois, lim Pr (x < x n ) =lim Pr (x < u) =<P(u-). n~oo
x~u-
Então, será
e, analogamente, Pr(x1 < x < x 2) = <P(x2- ) Pr(x1 < x <x2 ) = <P(x2) Pr(x}
<P(x1)
-
-
,
<P(x}) ,
< x < x 2) = <P(x2-) -
<P(x}-) .
Assim, toda a distribuição Pr(I) é determinada pela suafunção cumulante, <p(x).
É claro que será Pr(x) = <p(x) - <p(x-), para todo o x EU. <p(b)
= Pr(U) = 1.
A função <p(x) será contínua à direita em todos os pontos, isto é: <P(x+) = <p(x), qualquer que seja x. Em particular, pode suceder que, num ponto x o' se tenha <P(xo-) = = <P(xo)' Então, a função <p(x) é contínua em Xo e a probabilidade deste ponto é nula, visto que <P(xo) - <P(xo-) = O. Um caso particular importante é aquele em que a função Pr(x) do ponto x é nula, excepto num número finito de pontos x}' x 2' ••• , x n do intervalo U: recaímos, então, no caso já estudado das variáveis casuais descontínuas, com um número finito de valores. Neste caso, a
420
probabilidade Pr(J), correspondente a um dado intervalo 1, será a soma L Pr(x) das probabilidades dos valores Xi situados em J. A função cumulante <I>(x) será, pois, neste caso, <I>(x) =
L Pr (x), Xi$;X
sendo fácil ver que uma tal função <I>(x) apresenta uma descontinuidade de la espécie em cada um dos pontos Xi' com um salto positivo igual a Pr (x):
--------------------------r------:--------------Pr(xj Pr (X
2
)
{
:
---------------,
)
I
CD
I
a
b
Fig. 2
Fique, pois, assente que o caso das variáveis descontínuas, com um número finito de valores xl' x 2 ' ••• , x r ' se pode sempre englobar no caso das variáveis contínuas, desde que se atribua probabilidade nula a todo o valor de X diferente daqueles.
Um outro caso particular importante, mas que já não se reduz ao caso dos universos finitos, é aquele em que a cumulante <I>(x) admite derivada contínua no intervalo U. Procuremos o significado desta derivada. Comecemos por notar que, sendo neste caso <I> (x) uma função contínua, não apresenta saltos. Então, a probabilidade de cada valor de X *" a é nula, (1) tendo-se, pois, sempre:
(1) - Veja-se nota precedente.
421
Suponhamos que é também Pr(a) para todo o ponto Xo de U:
=O. Nestas condições, tem-se,
<I>(x + h) _ <I>(x ) ={pr(xo < x <xo + h), para h > O o o Pr(xo + h <x< x o)' para h < O À razão incremental
podemos, então, chamar densidade média de probabilidade no intervalo de extremos x o' Xo + h. Por sua vez, à derivada <1>' (xo), limite da razão incremental quando h ~ O (que existe, por hipótese), será natural chamar a densidade de probabilidade no ponto xo. Representemos por <p(x) a derivada de <I>(x) no intervalo U. Então, segundo o teorema fundamental do cálculo integral, será
<I>(u) =<I>(a) +
f
q>(x)dx =
f
q>(x)dx.
É claro que o diferencial d<l> =<p(x)dx (probabilidade elementar), representa, a menos de um infinitésimo de ordem superior à de dx, a probabilidade correspondente ao intervalo infinitésimo [x, x + dx]. Será, ainda, evidentemente:
f
q>(x)dx =<I>(b)
=1.
Estas considerações tomam-se mais intuitivas, se imaginarmos a função Pr(J) como indicando uma distribuição de matéria, de massa total 1, sobre o intervalo [a, b]: então, <p(x) representará a densidade (ou melhor, a massa específica) no ponto variável x.
422
Exemplos - 1) No caso duma roleta perfeita, tem-se cI>(u)
e, portanto, <p(u)
=Pr(O < E> < u) =-u
2n
= cI>/(u) = _1_ . A densidade de probabilidade é, 2n
portanto, a mesma em todos os pontos. Mas basta que a roleta não esteja bem centrada ou que não seja homogénea, para que a densidade varie de ponto para ponto. 2) Vejamos, agora, um outro exemplo sugestivo que se apresenta na teoria dos seguros. A probabilidade de que uma criança recém-nascida venha a falecer antes duma certa idade x pode considerar-se como função da variável contínua x, definida num intervalo [0, L], em que L representa um majorante da duração possível da vida humana. Supondo que esta função admite derivada contínua, a probabilidade de que a criança venha a viver até uma idade compreendida entre XI e x 2 será
mas, neste caso, a densidade <p(x) é função decrescente de x. Por sua vez, a probabilidade de que uma pessoa de idade a venha a viver até uma idade x entre XI e x 2 (com XI> a) será:
f
<p(x)dx
probabilidade condicional do acontecimento XI < X < x 2 a respeito do acontecimento X > a (substituição do universo [0, L], pelo universo [a, L]).
423
As precedentes considerações generalizam-se imediatamente ao caso dum intervalo não limitado, por exemplo, o intervalo ]-00, +00[. Será, então, U =R. Neste caso, se a cumulante <D(u) = Pr(x < u) admite derivada contínua <p(u) em todos os pontos, ter-se-á, ainda, Pr(v < x < u)
=<I>(u) -
<I>(v)
f
=
<p(x)dx.
Como se deve ter, além disso(l), Pr(x < u)
= lim
Pr(v < x < u),
v~-oo
será <I>(u)
=I~ <p(x)dx.
<p (x)
v
u
x
Fig. 3
Se for C a curva representativa da função <p(x), o valor de <D(u) será a área do domínio limitado por C e pelo eixo dos xx, à esquerda da recta x = u. A região a tracejado indica na figura a probabilidade de x estar fora do intervalo [v, u], probabilidade esta igual a 1 - Pr (v < x < u), sendo, por sua vez,
f
Pr(v < x <u) =
<p(x)dx (região a branco).
(1) - Em virtude do axioma IV, enunciado numa nota precedente.
424
É claro que(2)
i~~ q>(x)dx = Pr(U) = 1
(domínio total).
Note-se, ainda, que toda a distribuição de probabilidade sobre um intervalo [a, b] se pode conceber como distribuição sobre a recta inteira, considerando como nula a probabilidade correspondente a qualquer intervalo contido no complementar de [a, b]. NOTA. Dum modo geral, sendo Pr(l) uma distribuição sobre um intervalo U, ter-se-á, naturalmente: (1)
Pr(l} + 12 + ... + ln>
=Pr(l}) + Pr(l) + ... + Pr(ln>
para todo o sistema finito de intervalos l}, 12 , ••• , ln' disjuntos dois a dois, mesmo que estes não sejam contíguos. Se representarmos por ~ a totalidade dos conjuntos C contidos em U, que são somas de intervalos, em número finito, disjuntos dois a dois, e se incluirmos em ~ o conjunto vazio, é fácil ver que: 1) - A soma lógica (ou produto lógico) de dois quaisquer conjuntos da família ~ ainda é um conjunto desta família. 2) - O complementar de qualquer conjunto de ~ a respeito de U ainda é um conjunto de ~ (por exemplo, o complementar dum intervalo é, geralmente, a soma de dois intervalos disjuntos). Exprimiremos este facto dizendo que a fannlia ~ é um corpo de conjuntos (o que não sucede com a fannlia dos intervalos, pois que a soma de dois intervalos ou o complementar dum intervalo pode não ser um intervalo). Chamaremos distribuição em ~ a toda a função real não negativa J.l(C), definida em ~, de modo que se tenha:
quando Cp C2 são conjuntos disjuntos da fannlia
(2) - Este facto é, ainda, uma consequência do axioma IV.
~.
425
Deste modo, a função Pr(C) será uma distribuição em cge a qual verifica a condição suplementar seguinte: Pr(D) = 1 (distribuição relativa). É claro que, para definir uma distribuição em cge, basta defini-la na família dos intervalos contidos em U, atendendo à fórmula (1). Mas ao contrário do que sucede com os corpos finitos, não é agora suficiente, em geral, conhecer a distribuição nas células do corpo, que são, neste caso, os pontos de U. Como vimos, pode até acontecer que as probabilidades dos pontos sejam todas nulas sem que o sejam a dos intervalos não nulos: é o que sucede nos casos em que existe em cada ponto uma densidade de probabilidade finita e diferente de O. Note-se, ainda, que a toda a função não negativa <l>(x), definida em U, crescente em sentido lato e contínua à direita, corresponde uma distribuição j.!(C) sobre U de que <l>(x) é a cumulante, isto é, tal que <l>(u)
= j.!(x < u).
De resto, além do corpo cge, existem outros corpos de conjuntos aos quais se pode prolongar qualquer distribuição definida na família dos intervalos; por exemplo, o corpo dos conjuntos borelianos, citado numa nota precedente. B - Valores médios para distribuições duma variável real
Comecemos por um exemplo: suponhamos que se trata de calcular a média j.! das classificações de todos os alunos num exame. A fórmula a usar será, então, J..l=
LXV(X) N '
em que N representa o número total dos alunos, x cada uma das classificações 0, 1, ... , 20 e v(x) o número de alunos que tiveram a classificação x. É claro que será, também, ~
V (x)
~
J..l = "'-' x - - = "'-' x fr(x), N
em que fr(x) designa a frequência relativa de x.
426
Consideremos, agora, em geral, uma qualquer variável numérica x, susceptível dum número finito de valores Xl' X 2 , ••• , X,., com uma dada distribuição de frequência fr(x). Chama-se valor médio da variável X ao número Jl dado pela fórmula r
f.l =
L
Xi
fr(x).
i=l
o valor médio de X também se designa por M {x}
ou, até, abreviadamente, por x. Importa salientar que M {x} não é propriamente uma função da variável x, mas sim uma função da distribuição fr (x )(1). Por isso mesmo se diz, também, (com mais propriedade) que Jl é o valor médio da distribuição. Ainda com o mesmo significado se usa a expressão centro da distribuição, por analogia com o conceito mecânico de centro da gravidade; com efeito, se assimilarmos cada valor Xi de X a um ponto material de abcissa Xi e massa fr(x), o conjunto de tais valores será um sistema material que tem por centro de gravidade o ponto Jl. O conceito do valor médio traduz-se, naturalmente, em termos de probabilidade. Sendo X uma variável numérica de valores xi' x2 ' ... , x r ' com uma distribuição da probabilidade Pr(x), chamaremos valor médio de X ao número r
f.l =
L
Xi
Pr (x).
i=l
Alguns autores usam, neste caso, a expressão esperança matemática, em vez de valor médio, e a notação E{x} em vez de M{x}. Por exemplo, se for X a variável casual cujos valores são os números que se obtêm nos lançamentos dum dado, a esperança matemática de X será E{x}
1 1 1 1 21 = 1-1 + 2-1 + 3-+ 4-+ 5-+ 6- =- .
6
6
6
6
6
6
6
É claro que tudo o que dissermos sobre valores médios para distribuições de frequência se aplica, mutatis mutandis, a distribuições (1) - É aquilo a que, modernamente, se chama funcional.
427
de probabilidade. Também deve, desde já, ficar assente que todas as variáveis a que faremos agora referência são sempre variáveis numéricas, com um número finito ou infinito de valores reais. Seja x uma variável casual contínua definida num intervalo [a, b], com uma função de probabilidade <p(x) (densidade). É natural chamar, neste caso, valor médio ou esperança matemática de x ao número J.l dado pela fórmula /l
f
=
xcp(x)dx,
em que o somatório foi substituído por um integral. O valor deste integral é, ainda, designado por M{x} (ou por E{x}). Exemplo - Sendo <p(x)dx a probabilidade de um recém-nascido viver até uma idade compreendida entre x e x + dx, o valor médio de x (que neste caso se chama esperança de vida média) será: M{x}
=
f
xcp(x)dx,
em que L é um majorante da duração possível da vida. Para uma pessoa de idade a, a esperança de vida média será o integral de x <p(x) entre Oe L dividido pelo integral de <p(x) entre a e L. Na prática usam-se, apenas, valores aproximados destes integrais, obtidos pela regra do trapézio. Por exemplo, a tábua de mortalidade alemã, já citada, dá, para esperança de vida média dum recém-nascido, o valor 44,9 (anos); para um rapaz de 20 anos, o valor 42,6; para um homem de 50 anos, o valor 19,4, etc. A anterior definição estende-se ao caso dum intervalo infinito, substituindo o integral próprio por um integral impróprio de 2.a espécie. Todas as demonstrações que faremos mais adiante acerca de valores médios pressupõem que a variável toma só um número finito de valores. Mas podem facilmente estender-se ao caso das variáveis casuais contínuas, com uma dada densidade de probabilidade <p(x). Basta atender às propriedades dos integrais que generalizam as dos somatórios. Cálculo prático do valor médio - Na prática, quando é muito grande o número de valores possíveis de x, o cálculo dos valores médios
428
deve subordinar-se a certas normas. Suponhamos que é dada uma tabela de frequências com intervalos-classes de comprimento h. Neste caso, obtém-se um valor aproximado de M{x}, com erro inferior a h, multiplicando o ponto médio de cada classe pela frequência relativa dessa classe e somando os resultados obtidos. Para facilitar os cálculos, procede-se do modo seguinte: 1) - Toma-se para a unidade o comprimento h das classes, para que os valores das variáveis sejam inteiros. 2) - Escolhe-se, arbitrariamente, um valor c próximo do centro do intervalo em que varia x e calcula-se o valor médio da variável x - c. Como se tem, por definição, M{x - c} = L (Xi - c) fr(x), será M{x-c} = Lxifr(x)-c Lfr(x)=M{x} -c, donde M{x} =c+M{x-c}.
o valor c diz-se média arbitrária; o valor "{ = M {x -
c} diz-se
correcção da média arbitrária. A vantagem do processo está em que os números Xi - c são, geralmente, mais pequenos do que os correspondentes valores Xi . 3) - Exprime-se, finalmente, a média M {x} na primitiva unidade. Veremos adiante um exemplo de aplicação. Valores médios de funções de x - Seja, ainda, x uma variável susceptível dum número finito de valores xl' x 2 , ••• , x r ' com uma dada distribuição de frequência, fr(x). Qualquer variável y, que seja função unívoca de x, terá também uma distribuição de frequência que se deduz facilmente da primeira: a frequência dum dado valor de y será, evidentemente, a soma das frequências dos valores de x a que corresponde esse valor de y. Seja y = g(x); então, o valor médio de y será dado pela fórmula
429
M{y} =
L g(x) fr(x).
Com efeito, se tivermos, por exemplo, YI = g(x 1) = g(x2) = ... =g (xn ), a frequência relativa de Y1 será fr*(y 1) =fr(x I ) + fr(x2) + ... + fr (xn ) , donde
= -I-
e, analogamente, para os outros valores de y, o que justifica a fórmula precedente. Desta definição resultam, desde logo, as seguintes proposições: PROPOSIÇÃO 1. O valor médio da soma de duas variáveis u, v funções de x é igual à soma dos valores médios dessas variáveis: M{u+v} =M{u} +M{v}. Com efeito, se for u = g(x), v = h(x), será M{u + v}
=L [g(x) + h (x)] fr(x) = =
L g(x) fr(x) + L h (Xi) fr(x) =M{u} + M{ v}.
PROPOSIÇÃO 2. O valor médio duma constante (1) k é essa mesma constante k. Com efeito, tem-se
M{k}
= L k fr(x) =k L fr(x) = k.
PROPOSIÇÃO 3. O valor médio do produto duma constante k por uma função u de x é igual ao produto da constante pelo valor médio da função. (1) - Isto é, duma função g(x) cujos valores g(x), ... , g(x) sejam todos iguais a k.
430
Com efeito, se for u = g(x), será M{ku}
= L k g(x) fr(x) =k L g(x) fr(x) =kM{u}.
As proposições 1 e 3 exprimem-se dizendo que o símbolo M representa um operador linear. As três propriedades anteriores combinadas entre si conduzem à proposição mais geral seguinte: PROPOSIÇÃO 4. Dadas n variáveis Yl" .. , yn,!unções da variável x e n + 1 constantes ao' aI' ... , an, tem-se:
Como já se disse previamente, estas considerações generalizam-se, imediatamente, ao caso das distribuições de probabilidade duma variável discreta ou duma variável contínua. Seja, por exemplo, x uma variável casual contínua definida no intervalo [a, b] com uma densidade de probabilidade <p(x), e seja Y = f(x) uma função de x integrável em [a, b]; então, o valor médio de Y será dado pela fórmula M{y}
L b
Como se tem
f
=
<p(x)dx
f(x) <p(x)dx.
= 1, o teorema da média pennite-nos
afirmar que o valor médio de f(x), ou seja, M{ y}, é um número k compreendido entre os extremos inferior e superior de f(x) em [a, b]. As propriedades elementares do integral de RIEMANN habilitam-nos a demonstrar que se tem, ainda,
sendo ao' ... , an constantes, e YI' ... , Yn funções de x.
431
Momentos - Entre as funções da variável x apresentam-se-nos, desde logo, as potências de expoente inteiro > O. Chamam-se momen~ tos de x os vaI ores me"d'lOS d as funçoes x o, x I , x 2 , ... , x n , ... p~oe-se,
habitualmente: ~n=
M{x n} (momento de ordem n).
É claro que ~o = M { I} = 1, ~l = M {x} = ~. Em vez de "momentos da variável x" também se diz (e até com mais propriedade) "momentos da distribuição de x". Dado um número c qualquer, chama-se desvio de x a respeito de c à variável x-c. Os desvios a respeito da média dizem-se, simplesmente, desvios ou discrepâncias, sem qualquer outra referência. Os momentos da variável x - c (chamados momentos a respeito de c) são comparáveis aos momentos dum sistema material a respeito dum ponto ou dum eixo. Interessam, especialmente, os momentos a respeito do centro (isto é, a respeito do valor médio). São estes: (l)M{x-~}
=M{x} -M{~} =~-~=O,
(2)M{(x-~)2} =M{X2_2~+~2}
= M{x2 } (3) M{ (x -
~)3}
= M{x 3 -
-
2~2
+
~2
=M{X2}
=
3X2~+ 3X~2
-2~M{x} +~2=
~2 _ ~2,
_
~3}
=
= ~3 - 3~2~ + 3~~2 - ~3 = ~3 + 2~3 - 3~~2'
etc.
É particularmente importante o segundo momento a respeito do centro, análogo ao momento de inércia dum sistema material: dá-se-lhe o nome de variância de x (ou da distribuição considerada) e representa-se por V{ x }. Tem-se, pois, por definição, V{x} =M{(x-M{x})2}.
Como já se viu em (2), é V{x} =
~2
-
~2
= M{x 2} - (M{X})2,
432
isto é: PROPOSIÇÃO 5. A variância duma variável x é igual à diferença entre o valor médio do seu quadrado e o quadrado do seu valor médio. Daqui e das proposições 2 e 3 resultam logo, as seguintes consequências: PROPOSIÇÃO 6. A variância duma constante é nula. PROPOSIÇÃO 7. A variância do produto de x por uma constante k é igual ao produto k 2pela variância de x:
V{kx} = k 2V{x}. Uma outra propriedade fundamental da variância é a seguinte: PROPOSIÇÃO 8. Qualquer que seja a constante a, a variância de x + a é igual à variância de x:
V{x+a} = V{x}. Com efeito, V{ x + a} é, por definição, o valor médio do quadrado de x + a - M{x + a}; mas, como M{x + a} =M{x} + a, tem-se:
x+a-M{x+a} =x+a-(M{x} +a)=x-M{x}, donde,
V{x+a} =M{(x-M{x})2} = V{x}. Cálculo prático da variância - As proposições 5 e 8 são úteis na prática para o cálculo da variância. Com efeito, uma vez escolhida a "média arbitrária" c, tem-se, em virtude daquelas proposições, V{x} = V{x-c} =M{(X-C)2} -(M{X-C})2,
V{x} =M{(X-C)2} _y2, pondo y =M {x - c} (correcção da média arbitrária).
433
Basta, portanto, calcular o valor médio de (x - C)2 e subtrair-lhe o quadrado de y. Suponhamos, por exemplo, que se trata de achar o centro e a variância da distribuição de frequência dada pela tabela n.o 4 do capítulo anterior. Tomando para média arbitrária c o valor 22,5 (ponto médio do intervalo [22, 23]), podemos dispor os cálculos preliminares no seguinte quadro, em que v (x) designa afrequência absoluta de x: x
v(x)
x-c
14,5
1
-8
-
15,5
2
-7
16,5 17,5
2
18,5 19,5 20,5
(x - C)2 v(x)
(x- c) v(x)
64
-
8 14
-6
-
12
72
9
-5
- 45
225
11 20
-4
- 44
176
-3 -2
- 60
180
-150
300
-1
- 84
84
98
21,5
75 84
22,5
95
O
O
O
23,5
1 2
60 40
60
24,5
60 20
25,5
14
42
26,5
3
3 4
80 126
12
48
27,5
2
5
10
50
28,5
1
6
6
29,5
1
7
7
36 49
L v(x) =400
-
L (x-c) v(x) =-240
L (X-C)2 v(x)=1648
Será, então: y=
L (x - c) v(x) =--=-060 240 N
400'
e, portanto, o valor médio de x será
x= c + y= 22,5 + (- 0,60) = 21,90.
434
Por sua vez, o segundo momento de x - c é M{(x _ C)2} =
L (x - C)2 v(X) = 1.648 = 4 12 N
400"
donde, V{x} = M{ (x - C)2} - y2 = 4,12 - 0,36 = 3,76.
Dum modo geral, no cálculo da variância por este método, o erro proveniente de se agruparem os valores de x por classes pode ser reduzido subtraindo ao valor calculado a quantidade h2/12, sendo h o comprimento das classes. Nisto consiste a chamada correcção de SHEPPARD. Uma distribuição diz-se mais ou menos concentrada, conforme os valores da variável se acumulam mais ou menos à volta do valor médio. O oposto de concentração é dispersão. Para dar uma ideia do grau de dispersão, poderia utilizar-se a média dos módulos dos desvios, isto é, o valor M{ Ix - Jlll (a média dos desvios não nos diz nada, visto ser nula). Uma medida de dispersão de grande interesse, teórico e prático, é a raiz quadrada da variância: dá-se-Ihe o nome de desvio padrão de x ("standard deviation", em inglês), também chamado desvio quadrático médio, e representa-se por a {x}, e por a x ou, simplesmente, por a, quando estiver subentendida a variável de que se trata. Ter-se-á, pois, por definição:
,
E claro que, assim como a se pode tomar para índice de dispersão, assim, também, o seu inverso l/a se pode tomar para índice de concentração. O valor máximo de l/a só é atingido, evidentemente, quando x assume um único valor, que será, então, a média Jl: diz-se, neste caso, que toda a massa de distribuição está concentrada em Jl. Neste caso será V{x} = O e, portanto, lia = 00. Dá-se o nome de desvio reduzido de x ao desvio de x dividido pelo desvio padrão. O desvio reduzido de x será, pois, a variável
435 h=X-J.l, O'
que dá a medida do desvio de x, tomando para unidade o desvio padrão. É claro que, por sua vez:
1
1
O'
O'
M{h} = -M{x- J.l} = - (M{x} - J.l) = 0,
O'{h} = VV{h} =
J
- 1 V{x - J.l} = VV{x} = 1, 0'2
O'
isto é: PROPOSIÇÃO 9. O desvio reduzido duma variável x tem sempre o valor médio igual a e o desvio padrão igual a 1.
°
Dum modo geral, dada uma distribuição de frequência ou de probabilidade, podemos sempre substituí-la pela distribuição do desvio reduzido, tomando para nova origem dos eixos o valor médio J.l e para unidade dos valores da variável o desvio padrão. Diremos, então, que a distribuição foi estandardizada ou reduzida. A estandardização consiste, pois, na mudança de variável x~h=
X-II t"".
O'
Convém registar a seguinte PROPOSIÇÃO 10. Se for <P(X) a cumulante da distribuição dada, será
\f(h) = <P(J.l + O'h) a cumulante da distribuição estandardizada. Reciprocamente, se for \f(h) a cumulante da distribuição estandardizada, será
a cumulante da distribuição dada.
436
Assim, em resumo, o valor médio e o desvio padrão constituem duas características fundamentais duma distribuição: o primeiro indica sumariamente a posição ou localização da distribuição; o segundo quantifica a dispersão dos valores da variável à volta do valor médio. Teorema de TCHEBICHEFF - O poder representativo do desvio padrão é posto em evidência por um teorema de TCHEBICHEFF, que podemos enunciar do seguinte modo: Qualquer que seja a distribuição de probabilidade de x, a probabilidade de que o módulo do desvio x - /-1 seja igualou superior a k vezes o desvio padrão (sendo k um número qualquer) é sempre igualou inferior a 1/k2 • Isto é, simbolicamente: Pr(lx - /-11 > ka) :s;
~2 . k
Faremos a demonstração apenas para o caso em que x toma um número finito de valores xl' x 2 ' •• • , x ,. , com probabilidades que designaremos, respectivamente, por PI' P 2' ... , Pr· Pondo c i = Xi /-1, tem-se, por definição, ....!.
a 2= V{x}
=Plc~+P2ci+
... +Prc~.
Sejam ca' c b, ... os desvios de módulo inferior a ka e sejam Cm' c n , •• . os desvios de módulo superior ou igual a ka. É claro que, substituindo na soma I.Pic; os números ca' cb' ... por O e os números Cm' Cn' ••• por ka, se obtém o resultado
Mas a soma p m + Pn + ... é a probabilidade dum desvio de módulo igualou superior a ka. Designando essa probabilidade por p, virá
como queríamos demonstrar.
437
Este teorema costuma também ser apresentado com o seguinte aspecto: A probabilidade dum desvio de módulo inferior a kcr é igualou superior a 1 - l/k 2 • Simbolicamente:
1 Pr(lx-f.l1 <kcr) > 1--. 2
k
Para reconhecer a equivalência dos dois enunciados, basta notar que o acontecimento Ix - f.ll < kcr é o contrário do acontecimento Ix - f.ll > kcr. A sua probabilidade é, pois, complemento para 1 da probabilidade p deste último. Como p < l/k2 , será 1 - p > 1 - l/k2 •
NOTAS IMPORTANTES A RESPEITO DA TERMINOLOGIA E DAS NOTAÇÕES Dum modo geral, chama-se parâmetro duma distribuição de x toda a constante numérica associada a essa distribuição. Assim, serão parâmetros da distribuição os valores médios, não só de x, como de qualquer função de x; e, ainda, as funções desses valores médios (como, por exemplo, o desvio padrão). Muitas vezes, para estudar a distribuição duma variável (atributo quantitativo) numa determinada população, é-se obrigado a substituir a população por uma amostra, tão representativa quanto possível da população, e a considerar os parâmetros da distribuição dessa variável na amostra, como valores aproximados dos parâmetros da distribuição da mesma variável na população total. (É o que se faria, por exemplo, para estudar a distribuição da variável "diâmetro do tronco" numa extensa mata de eucaliptos). N esta ordem de ideias, é costume designar os parâmetros da distribuição, na amostra, pelas letras latinas correspondentes às letras gregas com as quais se representam os mesmos parâmetros na população considerada: por exemplo, a média por m, o segundo
438
momento por m 2 , o desvio padrão por s, etc., etc. É, ainda, nas amostras que, de preferência, se usa a notação para designar o valor médio de x. Aos parâmetros da distribuição na amostra daremos, ainda, o nome de constantes estatísticas da mesma (em inglês, statistics). Importa, finalmente, observar que a distribuição da variável considerada na população tem, muitas vezes, de ser concebida como distribuição de probabilidade. Sucede isto, primeiro que tudo, quando se trata duma população que esteja constantemente a ser acrescida de novos indivíduos, podendo, assim, considerar-se praticamente infinita (por exemplo, uma espécie, uma raça, uma variedade, etc.). Nestes casos, é corrente atribuir à distribuição de probabilidade uma determinada expressão analítica, com base em considerações de carácter teórico-experimental. A distribuição de frequência relativa da variável na amostra deverá, então, tender para a distribuição de probabilidade pressuposta na população quando o número de elementos da amostra aumenta indefinidamente. Este ponto visto é, ainda, aplicado a populações que, embora circunscritas no tempo e no espaço, sejam muito numerosas. Todas estas considerações se aplicam, mutatis mutandis, ao caso das distribuições de duas ou mais variáveis numéricas, que passamos a estudar.
x
c - Valores médios para distribuições de mais de uma variável real Comecemos por considerar um sistema (x, y) de duas variáveis reais, susceptível dum número finito de valores, (xi' Yk)'
i =1,2, ... , r,
k =1,2, ... , s,
e suponhamos dada uma distribuição de frequências, fr(x, y), sobre o universo destes valores. Nestas condições, qualquer variável z que seja função unívoca de (x, y) terá, também, uma distribuição de frequência que se deduz da primeira do seguinte modo: a frequência dum dado valor de z será a soma das frequências dos valores de (x, y) a que corresponde esse valor de z. Seja z = g(x, y); então, é
439
fácil reconhecer, como para as distribuições duma só variável, que o valor médio de z é dado pela fórmula M{z} = L g(xi , Yk) fr(x i , Yk)· i, k
Entre as possíveis funções de (x, y) aparecem-nos, primeiro que tudo, as próprias variáveis x, y. Será, então,
visto que fr(x)
=L
fr(x i , Yk) (lafrequência marginal).
k
Analogamente, M{ y}
= LYkfr(Yk)' k
com fr(Yk)
=L
fr (Xi , Yk) (2a frequência marginal)(I).
i
U ma outra função simples de (x, y) é a sua soma x + y. A proposição 1 de B, pode agora generalizar-se do seguinte modo: PROPOSIÇÃO 1. O valor médio da soma das duas variáveis x, Y é igual à soma dos valores médios de x e de y. Com efeito, tem-se, por definição: M{x + y}
=L
(Xi
+ Yk) fr(x i , Yk)
i, k
i, k
i, k
=M{x} +M{y}, em virtude do que se disse, há pouco, sobre M {x} e M {y} . (1) - As duas funções fr(x), fr(y) tomam, geralmente, valores diferentes para valores iguais das variáveis x, y. Seria, por isso, mais correcto designá-las por símbolos diferentes, por exemplo, fr l (x) , fr 2 (y). Não o fazemos para não sobrecarregar as notações.
440 Chamam-se momentos de distribuição fr (x, y) os valores médios das funções .xmyn, sendo m, n números inteiros não negativos. Dum modo geral, põe-se
Em particular, f.11,O= M{x}, f.1 0,1 = M{ y}, f.12,O= M{x2}, f.10,2= M{ y2} (primeiros e segundos momentos das variáveis x, y, isoladas). Ao par (f.1l,O' f.1o) dá-se o nome de centro da distribuição, ainda por analogia com o centro da gravidade dum sistema de pontos materiais (Xi' Yk) que tivessem massas iguais a fr(x i , Yk)' respectivamente. O primeiro momento misto é f.11,1 = M{xy}. Algumas vezes, para simplificar as notações, representaremos por x o valor médio de x e por y o valor médio de Y (isto é, pomos x = f.11,O' Y= f.1 o,l' embora as notações x, y se devam usar, de preferência, para as amostras). PROPOSIÇÃO 2. Se as variáveis x, y são independentes (a respeito da distribuição considerada), tem-se M{xy} = M{x} M{ y}, ou seja, f.11,1 = f.11,O f.10,1.
Com efeito, dizer que x, y são independentes equivale a dizer que fr(xy) =fr(x) . fr(y). Então, será
i, k
=L
i, k
Xi
fr(x)· LYk fr(Yk) = M{x} M{y}.
i
k
São particularmente importantes os momentos a respeito do centro,
Entre estes, destacaremos o valor médio do produto dos desvios x - x, y - y. Dá-se-Ihe o nome de covariância das variáveis x, y e designa-se por C {x, y}. Portanto: C {x, y}
=M { (x -
x) (y -
y) }.
441
Será, então:
c {x, y} = M {xy -
x y - yx
+ yx}
= M{xy} -yM{x} -xM{y} +xy=M{xy} -yx-xy+xy = M { xy} - M { x} M { y} =
f.ll,l -
f.l1,0 . f.l 0,1'
isto é: PROPOSIÇÃO 3. A covariância das variáveis x, y é igual à diferença entre o valor médio do produto dessas variáveis e o produto dos valores médios das mesmas. Daqui e da proposição 2 deduz-se, logo, o seguinte COROLÁRIO. Se as variáveis x, y são independentes, a sua covariância é nula (a recíproca, porém, não é verdadeira). Por sua vez, tem-se PROPOSIÇÃO 4. A variância da soma das duas variáveis x, y é igual à soma das respectivas variâncias mais o dobro da sua covariância, isto é: V{x
+ y} = V{x} + V{y} + 2C{x, y}.
Comecemos por notar que o desvio de x + y é x
+ y - M{x + y}
=x + y -
(x
+ y)
= (x -
x)
+ (y - y),
o que se pode exprimir dizendo que o desvio da soma é igual à soma dos desvios das parcelas. O quadrado do desvio de x + y será, pois,
donde, pela definição de variância e pela proposição 1: V{x
+ y} = M{ (x - X)2 + (y - y)2 + 2(x - x) . (y - y)} =M{(X-X)2} +M{(y_y)2} + 2M{(x-x)· (y-y)} = V{x} + V{y} + 2C{x, y}.
Daqui e do corolário anterior vem logo este outro
442
COROLÁRIO. Se as variáveis x, y são independentes, tem-se V{x + y} = V{x} + V{y}.
Registem-se, ainda, as seguintes propriedades, cuja demonstração é imediata:
c {x, x} = V{ x},
C {ax, by}
=ab C {x, y}
sendo a, b constantes quaisquer. Será, então, em virtude das propriedades já demonstradas da variância (1)
V{ax + by + c} = a2 V{x} + b2 V{y} + 2abC{x, y}
em que a, b, c são constantes quaisquer. Correlação e regressão - Já vimos que se tem C {x, y} = O quando x, y são independentes. Para avaliar o grau de dependência ou associação das variáveis x, y, usa-se o seguinte índice: p=
C {x, y}
_ C {x, y}
YV{x} V{y}
0x Oy
chamado coeficiente de correlação ou, apenas, correlação de x e y. Vamos ver que é sempre
e que se tem p = 1 ou P =-1, se, e só se, a variável y é função linear de x, estando, então, os pontos (Xi' Yk) sobre uma recta. Chega-se a esta conclusão mediante as seguintes considerações: Se as variáveis x, y, não são independentes, pode presumir-se a existência duma relação funcional entre elas, isto é, duma lei natural, que, em primeira aproximação, se procurará exprimir por meio duma função linear, y
=a + bx.
443
É claro que, só num caso excepcional, teórico, se poderá ter Yk = a + bxi, ou seja, Yk - a - bXi = 0, para todos os pontos (Xi' Yk) de frequência não nula. Em geral, estes pontos não estão em linha recta. O que se procura, então, é determinar a, b de modo que os desvios Yk - a - bXi (distâncias verticais dos pontos (Xi' Yk) à recta Y = a + bx) sejam llÚnimos; mais precisamente, procura-se tomar llÚnima a média
i, k
dos quadrados dos referidos desvios (método dos mínimos quadrados). Ora, tem-se, desenvolvendo [(y - bx) - aF e atendendo à linearidade do operador M: y
X.
x
l
Fig. 4
E = M{ (y - bX)2} - 2M{a(y - bx)} + M{a 2}
=M {y2} - 2b M {xy} + b2M {x2} - 2aM{y} + 2ab M {x} + a2 =1-10,2 - 2b 1-11,1 + b21-12,0- 2a y + 2ab X + a2, onde, para simplificar as notações, pusemos x em vez de 1-11,0 e Y em vez de 1-10,1. Trata-se, pois, de minimizar a função E de a, b. Virá, então,
dE = 2a + 2(bx - y), dE = 2bl-120 + 2(ax - 1-111)' da db"
444 donde, o sistema de equações nas incógnitas a, b:
{
a +ib =y ia + J-l2,O b = J-l1,I
que, resolvido, dá o ponto de estacionaridade (aI' b l ) definido pelas fórmulas: bI
= J-ll,l - x Y J-l2,O -
-2
'
ai
X
=Y- -
bIX.
Notemos, ainda, que J-lI,I-iy=M{xy} -M{x}M{y}
=C{x, y}
e
o que permite escrever b l sob a forma b - C {x, y} _ (jy I V{x} - p (jx
'
visto que C {x, y} = p YV{x} V{y} = p(jx (jy (pondo
(jx
= YV{x} ,
(jy= YV{y} ).
É fácil verificar que se trata, efectivamente, dum mínimo (absoluto). A recta pedida será, pois, Y = y- + b I (x - i) ,
com b = C {x, y} = p ~ I
V{x}
(jx
Dá-se-Ihe o nome de recta de regressão de y sobre x. Analogamente, a recta
445
é chamada recta de regressão de x sobre y. Como se vê, estas duas rectas passam pelo ponto (X, y), centro da distribuição. Os coeficientes b I , b2 dizem-se coeficientes de regressão, ou, apenas, regressões. Note-se que, para a =aI' b =b I , vem E =M{[y-y- b I (x-x)]2} =M{(y_y)2} -2b I M{(x-x)(y-y)} + b~ M{(x- X)2} = V{y} - 2b I C{x, y} + b~ V{x}
=V{y} -
2 p2V{y} + p2 V{y}
=V{y} (1- p2), visto que C{x, y} = pcrx cry e b I = pcr/crx • Portanto, o valor mínimo de E será V{y} (1 - p2). Ora, é evidente que este mínimo (valor médio dos quadrados dos desvios verticais a respeito da la recta) só será nulo, se os pontos (Xi' Yk) de frequência não nula estiverem sobre aquela recta. Vê-se, pois, que, como tínhamos afirmado, os referidos pontos estão em linha recta, se, e só se, 1 - p2 =0, ou seja, p2 = 1. Neste caso, as duas rectas de regressão coincidem, pois que será b2 = 1/b I • As variáveis x, y dizem-se, então, perfeitamente correlacionadas (positivamente, se p = + 1, negativamente, se p =-1). Mas este é um caso ideal, que nunca se verifica exactamente na prática. Vê-se, entretanto, que, se o valor de p2 for bastante próximo de 1, as duas rectas se aproximam bastante uma da outra, ajustando-se ambas, com boa aproximação, ao conjunto dos pontos (xi' Yk) considerados (regressão linear). Casos há, todavia, em que a linearidade está longe de traduzir uma possível relação funcional entre as variáveis x, Y em questão. Recorre-se, então, a funções mais complicadas - polinómios, exponenciais, etc. - para tentar traduzir a dita relação. Trata-se, portanto, de ajustar o mais possível, ao conjunto dos pontos (xi' Yk)' uma curva de dado tipo, usando, por exemplo, o método dos mínimos quadrados. Assim, a regressão linear cede o lugar à regressão curvilínea, cuja teoria não podemos expor aqui.
446
o exemplo que
damos a seguir, extraído da citada obra de FINNEY(l), refere-se ao estudo da correlação entre a densidade de produção de trigo (variável x) e o teor do trigo em proteína (variável y), sendo os dados relativos alO talhões. A densidade de produção é medida em cwt por acre (o cwt, abreviatura de "hundred weight", equivale a 50,802 kg, e o acre equivale, aproximadamente, a 0,40467 ha).
TABELAN.O 1 N. O do talhão
x = Produção em cwt por acre y = Proteína %
14,3 12,8 12,7 10,6 10,7 13,0 14,4 12,5 8,7 12,2
1 2 3 4 5 6 7 8 9
10
10,8 11,4 13,0 14,6 13,8 12,2 10,7 12,8 16,2 11,8
o coeficiente de correlação é, neste caso: p=_
26,33 = _ 0,955. Y27,65 x 27,52
Por sua vez, tem-se
x= 12,19, Y= 12,73,
b1 = - 26,33 = - 0,952, 27,65
(1) - Importa salientar que, na referida obra, este exemplo é, por sua vez, uma adaptação de resultados expostos pelo Engenheiro Augusto José de Oliveira, num trabalho publicado em "Agronomia Lusitana", voI. 8 (1946), pp. 147-159 (Estação Agronómica Nacional).
447 donde, a equação de regressão Y = 12,73 - 0,952 (x - 12,19),
ou seja, Y =24,3 - 0,95 x.
Esta recta está representada na figura junta, em que os pontos marcados indicam os pares (xi' Yk) observados. E visível que o teor das sementes em proteínas diminui quando a densidade de produção aumenta, seguindo esta variação uma lei sensivelmente linear. ~
17
16 15
•
14 13
• 12
•
••
11 10 8
9
10
11 Fig. 5
12
13
14
15
448
Para ter uma ideia mais precisa do significado dos valores de p, institui-se sobre este índice um teste de significância, que dependerá, naturalmente, do número de pontos (xi' Yk) observados: é a esse número, diminuído de 2 unidades, que, neste caso, se dá o nome de número de graus de liberdade. A hipótese nula consiste, agora, em supor p =O; para averiguar em que medida o valor de p observado é ou não atribuível ao acaso, recorre-se às tábuas que dão valores de ~ correspondentes a diversos níveis de significância. Da mesma obra extraímos a seguinte tabela: TABELAN.02 Probabilidade
N° de graus de liberdade
N° de pares
1
0,1
0,05
0,01
3
0.988
0.9969
0.9999
2
4
0.90
0.95
0.99
3
5
0.81
0.88
0.96
4
6
0.73
0.81
0.92
6
8
0.62
0.71
0.83
8
10
0.55
0.63
0.76
10
12
0.50
0.58
0.71
15
17
0.41
0.48
0.61
20
22
0.36
0.42
0.54
30
32
0.30
0.35
0.45
60
62
0.21
0.25
0.32
Não esquecer que a tabela dá valores de Ip I. No caso anterior, o número de graus de liberdade é 8, sendo Ip I = 0,955. Ora, este valor excede o limite 0,76 que marca o nível 0,01: quer isto dizer que, sendo válida a hipótese nula, a probabilidade dum p igualou superior a 0,955 (em módulo) é bastante inferior a 1%. O valor de p obtido pode, pois, considerar-se altamente significante contra a hipótese nula. Neste exemplo, o número de pares observados é pequeno. Quando esse número for grande, torna-se necessário repartir os valores de x, Y por intervalos de classe, como foi indicado para as
449
tábuas de frequências, e organizar uma tábua de contingência que, neste caso (atributos quantitativos) se dirá uma tábua de correlação. Do próprio exame da tábua se pode já inferir se os dados tendem ou não a acumular-se à volta duma recta. Caso das distribuições de probabilidade de duas variáveis reais É claro que todas as considerações precedentes, relativas a distribuições de frequência de duas variáveis x, y, se podem estender, mutatis mutandis, ao caso das probabilidades. Poderão, ainda, considerar-se variáveis contínuas em vez de variáveis discretas. Para isso, haverá que estender os conceitos definidos em A) ao caso de duas variáveis contínuas x, y, substituindo os intervalos J por rectângulos ~ de lados paralelos aos eixos coordenados. Assimilando a distribuição de probabilidade a uma distribuição de massa, chega-se, intuitivamente, ao conceito de densidade (superficial) de probabilidade <p(x, y)<1). Então, a probabilidade correspondente a um dado rectângulo ~ será dada pelo integral duplo Pr(8)
=
I1
<p(x, y)dxdy.
y
o
x
Fig. 6
(1) - Note-se que o conhecido conceito de densidade de população se refere a uma densidade
superficial de frequência absoluta (número de habitantes por unidade de área). O próprio conceito de massa específica se confunde, na escala atómica, com o de densidade de população (de partículas materiais).
450
É claro que, se for U o domínio da distribuição, será Pr(U)
IL
=
<p(x,y)dxdy= 1.
Por sua vez, o valor médio duma função U, será M{z}
IIJ(X,
=
z =f (x, y), integrável em
y) <p(x,y)dxdy,
e, pelo teorema da média, tem-se
sendo LI e L 2 os extremos inferior e superior de f(x, y) em U. Todas as anteriores proposições se podem, então, generalizar a este caso, atendendo às propriedades elementares do integral duplo. Distribuição de n variáveis reais - Somos, finalmente, conduzidos, na mesma ordem de ideias, a considerar distribuições de n variáveis Xl' X 2 ' ••• ,xn ' discretas ou contínuas. É claro que o caso das variáveis contínuas obriga a considerar domínios do espaço Rn e a utilizar integrais múltiplos (duplos, triplos, quádruplos, etc., conforme for n =2, 3, 4, ... ). Quanto a valores médios em Rn, a sua teoria é perfeitamente análoga à precedente. Suponhamos, por exemplo, que o sistema de variáveis (Xl' X2 ' ••• , Xn ) só pode tomar um número finito de valores. Então, dada uma distribuição de frequência, fr (xl' x 2 , ••• , x n ), destas variáveis, e uma função y = g (Xl' X2 ' ••• , xn ) das mesmas, o valor médio de y, será, por definição,
451
Todas as anteriores proposições se generalizam a este caso. Mas bastará registar as seguintes fórmulas:
I M{x I + x, + ... + Xn}
= M{x l } + M{x,} + ... + M{x.)
V{X I + X2 + ... + XJ
= L V{xJ + 2 L C{x
i,
Xk }
i<k
i
Em particular, se Xl' ... ' X n são independentes, será C{xi , x k } para i k e a anterior fórmula simplifica-se:
'* I
V{x I +x,+ ... +xn }
=O
= V{x l } + V{x,} + ... + V{x.)
Não esquecer, ainda, que se tem V{XJ = M{x;} - (M{xJ )2,
C{xi , Xk } M { ay}
=M{xi X
=a M { y},
k} -
V{ ay
M{xJ M{xk },
+ b}
=a
2
V{ y},
sendo y uma função qualquer de Xl , ... , xn ' e a, b constantes arbitrárias. E claro que estas fórmulas se aplicam, igualmente, às distribuições de probabilidade, podendo, nesse caso, substituir-se a notação M{x} por E{x} (esperança matemática de x). /
D - Aplicação à distribuição binomial. Teorema de BERNOULLI
Como se sabe, a distribuição de BERNOULLI Pr(x)
=
C) pXqn-x
dá a probabilidade de que um acontecimento ex, de probabilidade p, se realize X vezes em n provas
452
Para determinar o centro e o desvio padrão desta distribuição, vamos recorrer a um artifício, em que se utilizam as propriedades precedentes, e que consiste no seguinte: Designemos por x(i) a variável casual assim definida:
.{= 1, se a se realiza na prova
X(l)
= O, se
CJPj ,
a não se realiza na prova CJP
j ,
(para i = 1, 2, ... , n). Então, qualquer que seja i, será p a probabilidade de ser x(i) = 1 e será 1 - p a probabilidade de ser x(i) =O. Pondo q = 1 - p, virá, portanto, M {x(i)} = 1· p + O. q = p.
(1)
o desvio de x(i) será, pois, x(i) -
p, com os valores 1 - p, O - p de probabilidades p, q, respectivamente. Portanto: (2)
V{x(i)} = M{ (x (i) - p)2} = (1 _ p)2 P + (_ p)2 q =
=q2p + p2q =pq (p + q) =pq. Notemos, agora, que a soma x(1) + X(2) + ... + x(n) tem tantas parcelas iguais a 1 quantas as vezes que a se realiza, sendo as restantes parcelas nulas; a soma será, pois, igual ao número de realizações de a nas n provas, ou seja, x. Tem-se, pois, x
=
x(l)
+ X(2) + ... + x(n).
Além disso, já sabemos que as variáveis casuais x(i) são independentes. Logo, atendendo a (1), vem: M{x}
=M{X<l)} + ... + M{X<n)} =np,
e atendendo a (2): V{x} = V{x(l)} + ... + V{x(n)} = npq.
453
Serão, pois, Jl =np, cr =Vnpq , o valor médio e o desvio padrão da frequência absoluta x de ex. A frequência relativa de ex nas n provas é x
f=-· n
Aplicando os resultados anteriores, tem-se M{f}
=!M{x} =p, n
V{f}
=~ V{x} = pq ~
n
.
o valor médio e o desvio padrão da frequência relativa de ex são, pois, respectivamente,
P e
Jpnq·
Diz-se que uma sucessão
de números reais converge estocasticamente (ou converge em probabilidade) para um número real a, quando, dado um número 8 > 0, por menor que ele seja, a probabilidade de
tende para 1 quando n tende para 00. Podemos, agora, enunciar o TEOREMA DE BERNOULLI. Seja ex um acontecimento de probabilidade p. A frequência relativa de ex em n provas converge estocasticamente para p, quando n ~ 00.
454
Demonstração. Designemos, agora, mais precisamente por f n a frequência relativa de a nas n provas. Como se viu atrás, tem-se M{fn } =p, cr{fn } = ypqi;z. Então, segundo o teorema de Tchebicheff atrás demonstrado, a probabilidade Pn de que se terá
satisfaz à condição P > 1n
~ k
2 '
J
em que k =~ =õ n . cr pq
Ora, quando n -7 00, também k -7 00 e, portanto, 1-1/ k2 tende para 1. Como se tem, por outro lado, Pn < 1, virá pois, lim Pn = 1,
n-7
OO
o que, segundo a definição anterior, é a tese do teorema. Este teorema vem lançar nova luz sobre as relações entre os conceitos de frequência relativa e de probabilidade. Como vemos, a frequência relativa, f n , converge estocasticamente para a probabilidade p, quando n -7 00. Daqui resulta que, dado um número positivo D, tão pequeno quanto quisermos, existe sempre uma ordem a partir da qual é praticamente certo que f n - p < D. É praticamente certo, mas não certo! Não será, portanto, lícito escrever
conforme o conceito de limite da análise matemática, embora, na prática, as coisas se passem, de certo modo, como tal. A variável f n converge para p de maneira casual, irrégular, não se podendo, em absoluto, negar a existência de desvios grandes para valores de n elevados. A probabilidade Pn que intervem na demonstração diz-se de segunda ordem a respeito de p. É nas probabilidades de segunda ordem que se baseia a técnica dos chamados resseguros, usada entre companhias de seguros, para garantir um maior grau de segurança.
455
E - Distribuição normal
Uma grande parte das distribuições que se encontram na prática aproxima-se mais ou menos duma distribuição que, em cada ponto x do intervalo] -00, +00 [, tem uma densidade <I> (x) tal que
<I> (x)
(x -1..1.)2
1
= v2n 2n
O
20-2
e
sendo f.l, o constantes. A uma tal distribuição dá-se o nome de distribuição normal, de GAUSS ou LAPLACE-GAUSS, de parâmetros f.l, o; ou, abreviadamente, distribuição (N; f.l, o). Demonstra-se que é:
1+
1 (1)
(2)
ov2n 1
ov2n
00
_
(X _J..l.)2 2
e
20-
dx = 1,
-00
1+
00
_
X
e
(X _J..l.)2 2
20-
dx = f.l ,
-00
(3)
Para a demonstração, veja-se, por exemplo, CASTELNUOVO, obra citada, pp. 253-255 (feita a mudança de variáveis h=(x-f.l)/o). A segunda fórmula diz-nos que o centro da distribuição é f.l. A terceira diz-nos que a variância da distribuição é 0 2, sendo, portanto, o o desvio padrão. Fica, assim, justificado o uso das letras f.l, o, como parâmetros da distribuição. Convém registar, desde já, este facto: a distribuição normal é completamente determinada pelo centro e pelo desvio padrão.
456
Substituindo x pelo desvio reduzido x-Jl h = ---'--, (j
obtém-se a distribuição normal estandardizada ou distribuição (N; 0,1), cuja função de densidade é <p(h)
=
1
e
V2n
2 •
(É claro que podemos passar a usar aqui x no papel de h). Interpretemos esta distribuição como distribuição de probabilidade. A probabilidade dum desvio reduzido compreendido entre dois limites, À1 , À 2 , será dada pelo integral
Se pusermos <I>(Â.)
-
1 i~ = V2n
2
e
A
21t
x 2
rix,
_00
será <P(À) a cumulante da distribuição e o valor do anterior integral será <P(À 2) - <P(À 1). Note-se que existem tabelas com os valores de <P(À) para diferentes valores de À. Estudemos a função <p(x) =
1
V2n
xl --
e
2.
Comecemos por notar que esta função é definida e positiva em todo o intervalo] -00, +00 [ e que se tem <pC-x) =<p(x) (curva simétrica a respeito do eixo dos yy).
457
Por outro lado, tem-se
<p'(x) =-
~ 2n
e
x2f2
Como se tem sempre e> 0, a função <p'(x) é nula para x = 0, positiva para x < e negativa para x > O. Por sua vez, a função <p"(x) tem o sinal de x 2 - 1, sendo, portanto, negativa para - 1 < x < 1, positiva para x < - 1 ou x > 1 e nula para x = + 1. Temos, então, os seguintes esquemas:
°
°
-00 <p'(x) <p(x)
+00
I;I~I Máximo
-00 <p"(x) <p(x)
-1
+1
+
u
+00
+
n
u
inflexão inflexão
Note-se, finalmente, que lim <p(x)
=0,
o que significa que o eixo dos xx é assimptota do gráfico de <p. É fácil ver que não há outras assimptotas. A curva representativa da função <p(x) considerada, terá, pois, o aspecto indicado na figura.
458
0,30 0,25 0,20 0,15 0,10 0,05
-3
-2,5
-2
-1,5
-1
-0,5
°
0,5
1
1,5
2
2,5
3
Fig. 7
Dá-se-Ihe O nome de curva de GAUSS ou curva em sino. Note-se que os pontos de inflexão têm as abcissas -1, 1 correspondentes ao desvio padrão (unitário neste caso). Daqui se deduz, logo, que o gráfico da função mais geral
1
V21t
<p(x) = (j
2n
e
acusará um máximo no ponto da abcissa J..L, será simétrico a respeito da recta x = J..L, terá inflexões nos pontos J..L - (j, J..L + (j, e admitirá o eixo dos xx como assimptota. Por sua vez, a função <p(x) , cumulante da distribuição normal estandardizada, será crescente em todo o intervalo] - 00, + 00 [ , o seu
459
1
x
o
Fig. 8
gráfico terá uma inflexão no ponto de abcissa 0, a respeito do qual é simétrico, e admitirá como assimptotas as rectas y = 0, y = 1, visto que lim <I>(x) = 0, lim <I>(x) = 1(1). x-?-oo
x-?
+
00
Costuma, ainda, escrever-se 8(u)
=
1
V21t
lU e
2
x 2
dx.
o ,-
A função 8(u) também se encontra tabelada. E claro que para cada valor y de u, 8(y) é a área do trapezóide determinado pela curva de GAUSS no intervalo [O , À], igual à área do trapezóide correspondente ao intervalo [0, - À], visto a curva ser simétrica a respeito do eixo dos yy. Deste modo, a probabilidade dum desvio reduzido h compreendido entre - À e À será Pr(-À < h < À) = 28(À) e a probabilidade dum desvio reduzido superior a À, em valor absoluto, será 1 - 28 (À). Por exemplo, a tabela n.o 3 reproduzida em YULE and KENDALL (loc. cit., pág. 533), dá os valores de 1 - 28(À) a menos de 0,00001, (1) - É claro que o facto de as rectas y = 0, y = 1 serem assimptotas do gráfico se verifica para a cumulante de qualquer distribuição definida no intervalo] -00, +00 [.
460 com primeiras e segundas diferenças. Para À = 3, o valor registado é 0,00270; quer isto dizer que: Em qualquer distribuição normal, a probabilidade dum desvio de módulo superior ao triplo do desvio padrão é um pouco inferior a3%. (O teorema de TCHEBICHEFF, que, como vimos, é aplicável a qualquer distribuição, dá para um tal desvio uma probabilidade inferior ou igual a 113 2 ::::: 11 %). Para À = 4, a mesma tabela dá o valor 0,00006 e, para À = 4,5, o valor de 0,00001. Exemplos - Numerosos são os exemplos concretos de variáveis casuais que seguem aproximadamente a lei normal. Assim, é-se geralmente induzido a considerar como normalmente distribuídas as variáveis: altura, numa espécie, raça ou variedade de animais ou plantas (dentro de certos limites de idade); diâmetro do tronco, numa conveniente população de árvores; comprimento duma espiga, teor em proteínas, produtividade, etc., numa dada variedade de trigo; teores em gordura, em proteínas e em hidratos de carbono do leite produzido por vacas duma determinada raça; etc., etc. Note-se que os agrupamentos biológicos, tais como as espécies, as raças e as variedades, constituem populações praticamente infinitas, que vêm do passado e se prolongam no futuro, com uma certa constância de caracteres. (Muitas vezes, em vez de populações praticamente infinitas como estas, consideram-se população que, embora numerosas e homogéneas, estão bem delimitadas no tempo e no espaço: por exemplo, uma mata constituída por indivíduos duma mesma variedade). Entre as constantes biométricas duma tal população, figuram, precisamente, os valores médios e os desvios padrões de atributos quantitativos como os precedentes. À semelhança do que sucede para as grandezas físicas, idealizam-se para esses parâmetros valores exactos, dos quais se calculam valores aproximados em amostras casuais extraídas da população: a aproximação
461
obtida considera-se tanto melhor quanto mais representativa, e portanto, mais numerosa for a amostra(1). (Convém recordar aqui as considerações que fizemos a propósito do conceito de probabilidade). Nessas constantes biométricas e nos seus valores aproximados baseiam-se novos testes de significância, relativos, por exemplo, à comparação de duas variedades de trigo do ponto de vista de produtividade, ao efeito dum adubo ou dum insecticida, etc., etc. Trata-se, como se pode imaginar, de assuntos de maior interesse para o agrónomo e para o silvicultor, mas não é possível desenvolver neste curso. Erros de observação - Invocámos há pouco o exemplo das grandezas físicas. Como se sabe, efectuando várias medições duma mesma grandeza, os resultados não concordam geralmente entre si. Admitida a existência duma medida exacta da grandeza, as diferenças x - Xo entre os valores obtidos, x, e o valor exacto, xo' chamam-se erros de observação. Estes classificam-se em sistemáticos (devidos a uma causa bem determinada, que pode ser um defeito do instrumento de medida ou do observador) e acidentais, fortuitos ou casuais (dependentes do "acaso"). Suponhamos eliminados os erros sistemáticos. Então, admitidos certos axiomas, demonstra-se que os resultados de medição duma grandeza se distribuem segundo a lei normal, com centro no valor exacto da grandeza. Esta conclusão é confirmada pela experiência, de maneira satisfatória. É claro que, sendo assim, os erros de observação também se distribuem normalmente, sendo O o seu valor médio. O desvio padrão O' chama-se, agora, erro padrão ou erro quadrático médio. Dá-se o nome de parâmetro de precisão ao número 1/ (0'Y2), que permite avaliar o grau de concentração da distribuição considerada. E'" claro que, na prática, se trabalha apenas com um número finito de valores aproximados,
da grandeza medida, alguns dos quais podem aparecer repetidos. (1) - A teoria da avaliação dos parâmetros duma distribuição, a partir de amostra da população, constitui um dos mais importantes capítulos da Estatística.
462 Estes valores constituem, por assim dizer, uma amostra dos possíveis resultados x da medição. Os parâmetros da distribuição de x na amostra, nomeadamente, o valor médio,
x=
Xl
+ X 2 + ... + XN N
e o desvio padrão,
s=
(Xl
_X)2 + (X 2 _X)2 + ... + (XN -X)2 N
constituem valores aproximados, respectivamente, do valor exacto X o da grandeza, e do desvio padrão (J da distribuição normal considerada. Propriedade reprodutiva da distribuição normal - Uma importante propriedade das distribuições normais é a seguinte, chamada PROPRIEDADE REPRODUTIVA ou TEOREMA DA ESTABILIDADE, que não demonstraremos: Dadas n variáveis casuais Xl' X 2 , ••• , x n ' independentes e normalmente distribuídas, toda a função linear
daquelas variáveis segue ainda a lei normal.
As proposições estabelecidas em C permitem-nos determinar o valor médio e o desvio padrão da variável y a que se refere este enunciado, em função dos valores médios e dos desvios padrões de Xl' X 2 ' ••. , xn. Deverá ter-se, com efeito,
V{y}
=a~V{xI} + ... + a,;V{xJ,
463
donde, designando por a o desvio padrão de y e por ai' a2 , ••• , an , os desvios padrões de Xl ' x 2 ' ••• , xn :
Como exemplo de aplicação, consideremos o caso duma amostra casual constituída por N valores independentes, Xl' X 2 ' ••• , xN ' duma mesma variável casual X, normalmente distribuída, com o valor médio Jl e o desvio padrão a. É claro que a média daqueles valores
- LXi =-x 1 1 1 +-x + ... +-x
x=
N
N
I
N
2
NN
é uma função linear das variáveis casuais Xl , x2 ' ••• , xN ' independentes e normalmente distribuídas com os parâmetros Jl, a. Então, segundo o teorema anterior, a média i será, também, uma variável normalmente distribuída, tendo por valor médio M{i}
=J... ~ M{x.} = NJl = N~ N I
II, l"'"
isto é, M{i}
=M{x},
e por desvio padrão
isto é,
o desvio padrão da média i
obtém-se, pois, a partir do desvio
padrão de x, dividindo este por VN.
464
Estes resultados são de grande importância, não só em estatística agronómica como, ainda, na teoria dos erros. F - Convergência de distribuições. Relação entre as distribuições normal e binomial Consideremos uma sucessão infinita de distribuições sobre a recta, cujas funções cumulantes sejam
<PI (x), <P2(x), ... , <Pn (x), .... Diz-se que esta sucessão de distribuições converge para uma determinada distribuição, cuja cumulante seja ",(x), se a sucessão de funções <Pn(x) converge uniformemente para ",(x) em todo o intervalo limitado J da recta. Consideremos, em particular, o caso da distribuição binomial de x, que dá a probabilidade de que um acontecimento de probabilidade p se verifique x vezes em n provas. Supondo a probabilidade p fixa, e atribuindo a n os valores 1, 2, 3, ... , obtém-se uma sucessão de distribuições cujo termo geral é
Prn(x) =(:) pX qn-x, com q = 1 - p. É claro que cada uma destas distribuições é definida apenas para os valores inteiros de x tais que O < x < n; mas podemos supô-la prolongada a toda a recta, atribuindo a probabilidade O a cada valor de x que não seja inteiro ou não verifique a condição O < x < n. A cumulante da distribuição Prn(x) acusará, então, saltos positivos nos pontos
O, 1, 2, ... , n - 1, n, sendo constante no interior dos intervalos determinados por estes pontos: em particular, será nula no intervalo] - 0 0 , O[ e igual a 1 no intervalo [n, + 00 [. O valor médio e o desvio padrão de Prn(x) são, respectivamente, como V1mos,
Jln =np,
(J'n
=VniCJ. .
465
Efectuando em Prn(x) a mudança de variável x
~
h = x - J..ln = x - np
vnpq ,
(Jn
obtém-se a distribuição binomial estandardizada. Pois bem, demonstra-se o seguinte teorema, de importância fundamental em Cálculo das Probabilidades e Estatística: TEOREMA. A distribuição binomial estandardizada converge para a distribuição normal estandardizada quando n ~ 00. Para a demonstração, deveras delicada, pode ver-se, por exemplo, ,a obra de CRAMER já citada. Na prática, o anterior resultado interpreta-se do seguinte modo: Para valores de n elevados, a distribuição binomial aproxima-se da normal. A aproximação aumenta quando n cresce, mas diminui quando o desvio reduzido aumenta. 2
G - A distribuição de X de PEARSON Vimos que toda a função linear de variáveis independentes normalmente distribuídas também é normalmente distribuída. Porém, uma função não linear de variáveis independentes normalmente distribuídas não tem, geralmente, distribuição normal. Com efeito, demonstra-se o seguinte teorema: Dadas n variáveis casuais Xl' X 2 , ••• , X n' independentes e com distribuição normal estandardizada, a raiz quadrada da soma dos seus quadrados, que costuma ser designada por X:
tem uma distribuição cuja densidade é uma função de Xda forma X2
<p(X) = C e
sendo C uma constante.
2
Xn-l,
466
Para a demonstração, veja-se, por exemplo, P. de VARENNES E MENDONÇA, obra citada. Note-se que, sendo a raiz aritmética de LX/, o valor de X será sempre não negativo: o domínio de distribuição é, pois, o intervalo [0, + 00 [. Deverá ter-se, então,
o que permite determinar a constante C: C= 1
f+
:Jo
2
X
00
e
2
Xn-l dX.
Deste modo, a probabilidade de que X2 seja superior a um dado valor X~ (igual à probabilidade de que seja X > Xo)' será dada pela fórmula
com o valor de C dado pela fórmula anterior. O que interessa, na prática, não é propriamente a distribuição de X, mas sim a distribuição de X2, que, evidentemente, se reduz imediatamente à anterior como mostra a última fórmula. . Como se vê, a anterior distribuição de X2 (chamada distribuição de PEARSON) tem como único parâmetro a variável n, que recebe aqui o nome de número de graus de liberdade da distribuição. Para indicar a distribuição de X2 com n graus de liberdade, usa-se a notação (X2; n). O teorema atrás enunciado admite a seguinte generalização: TEOREMA. Dadas M variáveis Xl' X 2 , ••• , X M ' todas com distribuição normal estandardizada, sendo n dessas variáveis independentes (estocasticamente) e as restantes funções lineares homogéneas das primeiras, a variável
tem a distribuição de PEARSON com n graus de liberdade.
467
Para a demonstração, veja-se o trabalho do Prof. P. de VARENNES E MENDONÇA, "Das distribuições estatísticas mais usadas em provas de significação", publicado na Revista Agronómica XXVIII (1940). Este importante resultado permite ver como a distribuição considerada pode ser usada em testes de significância (ou provas de significação) aplicáveis a tábuas de contingência, ajustamento de curvas ou superfícies, etc. Consideremos, por exemplo, uma partição em M atributos aI' a 2 , ••• , a M , num universo infinito U, e seja Pi a probabilidade de que um indivíduo escolhido ao acaso tenha o atributo a i (i = 1, 2, ... , M). Consideremos, por outro lado, uma amostra casual constituída por N indivíduos. Será, então, sensivelmente,
o valor esperado da frequência absoluta do atributo ai na amostra (supondo N bastante grande). Designemos por m i este valor e por 0i o valor observado (da referida frequência absoluta). A discrepância
b.=o.-m . I
I
I
terá, então, o valor médio M{ bJ =O. Além disso, supondo N bastante grande e nenhum dos Pi demasiado pequeno, demonstra-se que cada uma das variáveis bi se distribui normalmente em torno de 0, com um desvio padrão ai tal que
a/ = mi. Então, supondo que n dos desvios bisão independentes estocasticamente, sendo os restantes função linear homogénea dos primeiros (como sucede nas tábuas de contingência), o anterior teorema habilita-nos a afirmar que a variável
468
tem aproximadamente a distribuição de PEARSON para n graus de liberdade, visto que cada uma das variáveis Õ/(Ji tem valor médio nulo e desvio padrão unitário. E assim ficam esboçados os fundamentos teóricos do teste do X2. A falta de tempo impede-nos de aprofundar este assunto e de abordar o estudo de outras distribuições de grande interesse em Estatística agronómica. Para complementos, lembramos as obras de Estatística já citadas, bem como o referido trabalho do Prof. Varennes e Mendonça. A obra de R. A. FISHER e F. YATES, "Statistical Tables for Biological, Agricultural and Medical Research" (Oliver and Boyd, Edinburgh and London) contém tábuas referentes a várias distribuições importantes; a tábua IV desta obra fornece, para diferentes valores de n e de p, o valor de X6 tal que Pr(X2 > X6) =p, na distribuição de X2 de PEARSON com n graus de liberdade.
NOTA SOBRE A AVALIAÇÃO DA VARIÂNCIA Embora não possamos aqui abordar o estudo da teoria da avaliação, convém, desde já, esclarecer um ponto. É fácil ver que o valor esperado da variância, S2, numa amostra com N elementos, está relacionada com a variância, (J' 2, na população, por meio da fórmula
Daqui, o considerar o valor (N/ N _l)S2 como a melhor avaliação da variância (J' 2, a partir da amostra. Este valor é representado por 8 2 • Será, portanto, 8=S
jfr
'.j~
a melhor avaliação do desvio padrão, (J'. Dum modo geral, o acento circunflexo sobre um símbolo é usado para indicar a melhor avaliação do parâmetro designado por esse símbolo. Na fórmula anterior, o coeficiente N/N -1 é chamado correcção de BESSEL. É claro que, para valores de N elevados, aquele coeficiente é sensivelmente igual ai; a correcção só é, portanto, necessária para pequenas amostras.
470
Pรกgina em branco
íNDICE CÁLCULO DAS PROBABILIDADES
ADVERTÊNCIA PRÉVIA.. .. ..... .......... ............
317
1.4.1 INTRODUÇÃO AO CÁLCULO DAS PROBABILIDADES: POPULAÇÕES FINITAS
319
A - Frequências .. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
319
1. Primeiros exemplos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2. Populações. Álgebra dos atributos. . . . . . . . . . . . . . . . . . . . . . . 3. Álgebra dos acontecimentos. . . . . . . . . . . . . . . . . . . . . . . . . . . . 4. Acontecimentos expressos em forma proposicional. . . . . . . . . 5. Frequência dum atributo numa população. . . . . . . . . . . . . . . . . 6. Frequência de um acontecimento numa série de provas . . . . . . 7. Partições. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8. Corpos de conjuntos, corpos de atributos, corpos de acontecimentos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9. Distribuição em universos finitos. . . . . . . . . . . . . . . . . . . . . . . . 10. Soma de conjuntos não disjuntos (atributos ou acontecimentos compatíveis) ................ 11. Atributos quantitativos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12. Representação gráfica das distribuições: histogramas e polígonos de frequência.. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13. Independência e associação de atributos. Distribuições de duas ou mais variáveis. . . . . . . . . . . . . . . . . . .
319 322 325 326 328 330 331 333 337 339 341 345 348
518 14. Associação e independência de partições múltiplas. . Ta/b uas de contmgencIa .............................. . 15. Associações parciais de atributos. Independência de atributos no caso em que o seu número é superior a dois ..... 16. Interpretação de uma tábua de contingência. Testes de significância ............................... . A
•
355 359 363
B - Probabilidades .................................... .
373
/· ln . d utlva . ..................................... 1. Loglca 2. Lógica dedutiva .................................... 3. Conceito natural de probabilidade ...................... 4. Axiomatização do conceito de probabilidade .............. 5. Alguns exemplos de cálculo de prodabilidades a priori . .... 6. Independência e associação de acontecimentos ............ 7. Sistema de duas experiências .......................... 8. Sistema de várias experiências ......................... 9. Distribuição binomial ou de Bernoulli ................... 10. Conceito de moda. Caso da distribuição normal ........... 11. Distribuição polinomial. Amostras casuais ............... BIBLIOGRAFIA ......................................
. . . . . . . . . . . .
373 376 378 382 385 396 398 403 404 409 411 414
1.4.2 APONTAMENTOS DE CÁLCULO DAS PROBABILIDADES .............................. .
415
A - Distribuições de uma variável contínua real ............ .
415
B - Valores médios para distribuições de uma variável real .. .
425
C - Valores médios para distribuições de mais de uma variável real ...................................... .
438
D - Aplicação à distribuição binomial. Teorema de BERNOULLI ..................................... .
451
E - Distribuição normal ................................ .
455
F - Convergência de distribuições. Relação entre as distribuições normal e binomial ........ .
464
G - A distribuição de X2 de PEARSON ................... .
465
NOTA SOBRE A AVALIAÇÃO DA VARIÂNCIA .......... .
469
519
1.4.3 ADITAMENTO ÀS LIÇÕES DE CÁLCULO DE PROBABILIDADES. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
471
A - Regressões. Ajustamentos. Correlação . . . . . . . . . . . . . . . . .
471
1. Formulação geral do problema. . . . . . . . . . . . . . . . . . . . . . . . . . 2. Ajustamentos pelo método dos mínimos quadrados. . . . . . . . . 3. Outra forma das equações normais. . . . . . . . . . . . . . . . . . . . . . . 4. Regressão polinomial. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5. Regressão linear. Correlação . . . . . . . . . . . . . . . . . . . . . . . . . . . 6. Segunda recta de regressão. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7. Organização prática dos cálculos . . . . . . . . . . . . . . . . . . . . . . . . 8. Ajustamentos com mudanças não lineares de variáveis. . . . . . . 9. Regressão múltipla. Índice de correlação em geral. . . . . . . . . . 10. Nota sobre as notações. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
471 476 479 480 481 485 487 490 493 497
B - Distribuições de STUDENT e de FISHER. Suas aplicações. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .
497
1. A melhor estimativa do desvio padrão deduzida duma amostra . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2. Distribuição t de STUDENT . . . . . . . . . . . . . . . . . . . . . . . . . . . 3. A melhor estimativa de (J deduzida a partir de várias amostras . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4. Distribuição da diferença entre duas médias . . . . . . . . . . . . . . . 5. Prova do t (de significação) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6. Intervalos de tolerância e intervalos de confiança . . . . . . . . . . . 7. Intervalos de confiança quando não é conhecido o (J da população. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8. Aplicações agronómicas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9. Distribuição de Fez de FISHER . . . . . . . . . . . . . . . . . . . . . . . .
497 499 501 502 503 506 509 510 511
TÁBUA DA DISTRIBUIÇÃO NORMAL. . . . . . . . . . . . . . . . . . .
512
TÁBUA DA DISTRIBUIÇÃO DE t DE STUDENT . . . . . . . . . . .
513
TÁBUA DA DISTRIBUIÇÃO DE X2 DE PEARSON . . . . . . .. ..
514
INDICAÇÕES BIBLIOGRÁFICAS. . . . . . . . . . . . . . . . . . . . .. ..
515