Skip to main content

Introdução ao cálculo das probabilidades: populações finitas, por José Sebastião e Silva

Page 1

1.4 CÁLCULO DAS PROBABILIDADES


316

Pรกgina em branco


ADVERTÊNCIA PRÉVIA

Com o capítulo relativo a populações finitas, inicia-se a publicação das nossas lições de Cálculo das Probabilidades no Instituto Superior de Agronomia. Os capítulos seguintes serão publicados à medida que a experiência nos indicar qual a melhor orientação a seguir no ensino desta matéria, tendo sempre em conta a finalidade prática desse ensino e as condições especiais em que tem de ser realizado. Na preparação das nossas lições serviram-nos de base, principalmente, as seguintes obras: G. CASTELNUOVO - Calcolo delle probabilita, Zanichelli, Bologna, 1933. D. J. FINNEY - An introduction to statistical science in Agriculture, John Wiley Sons, New York, 1953. " CRAMER - Mathematical methods oi Statistics, Princeton University Press, Princeton, 1951. G. UDNY YULE and M. G. KENDALL - An introduction to the Theory oi Statistics, Charles Griffin, Londres, 1937. P. de VARENNES E MENDONÇA - Noções de Cálculo das Probabilidades, Instituto Superior de Agronomia, Lisboa, 1950. Convirá, no entanto, precisar, desde já, que tanto a orientação geral do curso, como muitos dos pormenores didácticos têm carácter pessoal. Lisboa, Maio de 1955 J. Sebastião e Silva


318

Pรกgina em branco


1.4.1 INTRODUÇÃO AO CÁLCULO DAS PROBABILIDADES: POPULAÇÕES FINITAS

A - Frequências

1. Primeiros exemplos

Comecemos por um exemplo que nos é bem familiar. Suponhamos que, numa dada época de exames finais duma cadeira, se apresentaram a exame 189 alunos e os resultados foram os que constam da seguinte tabela: TABELAN.O 1 Classificações

N. ° de Alunos

Classificações

N.o de Alunos

O

O O O O

11

45 28 17 9 12 7 5 2 1

1 2 3 4 5 6 7 8 9 10

2 1 5 11

7 O

37

12 13 14 15 16 17 18 19 20

O


320

Diremos então que, nestas provas, a frequência da classificação 3 foi O, afrequência da classificação 10 foi 37, etc. Todavia, para ter uma ideia de conjunto destes resultados, nas suas relações mútuas, é preferível indicar a frequência de cada classificação em percentagem, tal como se observa na seguinte tabela deduzida da precedente: TABELAN.O 2 Classificações

Percentagens

Classificações

Percentagens

°

0,0%

10 11

19,6% 23,8%

12

14,8%

1

2

0,0% 0,0%

3

0,0%

13

9,0%

4

1,1%

14

5

0,5%

15

4,8% 6,3%

6

2,6%

16

3,8%

7

5,8%

2,6%

8

3,7%

17 18

9

0,0%

19

0,5%

20

0,0%

1,1%

NO primeiro caso, diz-se que se trata de frequências absolutas e, no segundo, de frequências relativas. Assim, a frequência relativa da classificação 2 foi 0%, a frequência relativa da classificação 10 foi 19,6%, etc. E" claro que, designando por n o número total de alunos e por v o número de alunos que obtiveram uma dada classificação x (frequência absoluta de x), a frequência relativa de x, em percentagem, será o número fr (x) dado pela fórmula

fr(x)

= 100v %. n

Mas uma percentagem não é mais do que uma maneira especial, usada na prática, de designar um número, geralmente compreendido entre O e 1. Em considerações puramente teóricas será preferível


321

designar esse número à maneira usual, e então, a fórmula que dá a frequência relativa toma o aspecto: fr(x)

v =-. n

Observe-se ainda que, na prática, o cálculo das percentagens conduz geralmente a dízimas, das quais não interessam todos os algarismos decimais. Escolhem-se valores aproximados desses números, por defeito ou por excesso, com o grau de aproximação que se considere suficiente. Mas, por coerência lógica, convirá escolher esses valores de modo que a sua soma seja exactamente 100. (No exemplo anterior tomaram-se valores aproximados a menos de 0,1). Os conceitos de frequência absoluta e de frequência relativa são usados a cada passo na vida corrente. Indicaremos mais alguns: 1) - Numa dada cidade com 23.528 habitantes, 9.253 pertencem ao sexo masculino e os restantes 14.275 ao sexo feminino. Estes dois últimos números dão, pois, as frequências absolutas do sexo masculino e do sexo feminino entre os habitantes da referida cidade. As frequências relativas dos mesmos atributos, serão, respectivamente, de 39% e de 61 %. 2) - Num dado país, 82% dos habitantes têm os cabelos castanhos ou pretos, 14% têm os cabelos louros e 4% têm os cabelos ruivos. São estas, pois, as frequências relativas daqueles atributos entre os habitantes do referido país. 3) - Numa série de 5.000 viagens efectuadas por uma dada companhia de aviação, houve desastres em 2 viagens. Nesta série, a frequência relativa dos desastres foi, portanto, de 0,04%, ou seja, de 0,0004. 4) - Numa série de competições, um dado clube desportivo teve 10 vitórias, 2 derrotas e O empates. Nesta série, as frequências relativas das vitórias, derrotas e empates foram, pois, respectivamente, iguais a 0,8, a 0,2 e a O (a menos de uma décima).


322 ,

2. Populações. AIgebra dos atributos

Entre os exemplos anteriores, distinguem-se dois grupos principais. Num dos grupos apresentam-se-nos frequências de atributos; no outro, aparecem-nos frequências de acontecimentos. Em qualquer dos casos as considerações restringem-se a um determinado conjunto, que pode ser constituído por entidades das mais diversas naturezas (seres humanos, competições desportivas, viagens de aviação, etc.). Este conjunto fundamental, a que se refere um dado inquérito estatístico, é chamado, conforme os autores, população, universo lógico, universo do discurso ou, simplesmente, universo; os seus elementos são chamados os indivíduos (desse universo)<1). Consideremos uma dada população U. Em U podem estar definidos diferentes atributos (em vez do termo "atributo" usam-se, ainda, como sinónimos, "propriedade", "predicado", "carácter", etc.). A cada atributo fi. corresponde um determinado conjunto ou classe A, constituída por todos os indivíduos (elementos de U), que possuem o atributo fi.. A presença simultânea de dois atributos fi., ~ num mesmo indivíduo constitui um novo atributo, que se chama conjunção (ou produto lógico) dos primeiros e se representa por fi. (J ~ ou, simplesmente, por fi.~. Claro está que, se for A o conjunto dos indivíduos com o atributo fi., e se for B o conjunto dos indivíduos com o atributo ~, será A (J B (intersecção de A com B) o conjunto dos indivíduos com o atributo fi. ~ (ler "fi. e ~"). Por exemplo, pode acontecer que, numa dada população de seres humanos, o atributo "masculino" e o atributo "ruivo" coexistam num mesmo indivíduo: a totalidade dos indivíduos que os possuem simultaneamente será a intersecção do conjunto dos indivíduos do sexo masculino com o conjunto dos indivíduos ruivos; mas também pode acontecer que, numa outra população, esta intersecção seja o conjunto vazio, isto é, que não haja nessa população homens ruivos. O facto de um indivíduo possuir um, pelo menos, dos atributos fi., ~ (podendo ter ambos ao mesmo tempo) exprime-se por um novo (1) - Note-se que as designações universo lógico e universo do discurso já tinham sido adoptadas em lógica matemática com um sentido equivalente. De resto, as noções de lógica matemática introduzidas em Matemáticas Gerais vão ser também aqui utilizadas.


323

atributo, que se chama disjunção (ou soma lógica) dos primeiros e se representa por a u p ou por a + p (ler "a ou P"). Se forem A e B os conjuntos correspondentes a a e p, será A u B (reunião de A com B) o conjunto correspondente a a u p. Exemplo: entre os seres humanos, o atributo "casado ou viúvo" é a disjunção dos atributos "casado" e "viúvo". De modo análogo, se define a conjunção e a disjunção de vários atributos a, p, y, ... Por exemplo, o símbolo apy significa a presença simultânea dos atributos a, p, y num indivíduo: designa, pois, a conjunção desses atributos. Note-se que as operações da conjunção e disjunção são ambas associativas e comutativas (mas não reversíveis) e qualquer delas é distributiva em relação à outra, isto é, tem-se a(p +y) = ap + ay,

a+ py= (a+

P) (a+y).

A ausência dum atributo a num dado indivíduo constitui um novo atributo, que se chama contrário (ou negação) de a e se representa por -a ou por ii (ler "não a"). É claro que o conjunto dos indivíduos com o atributo ii é o complementar do conjunto dos indivíduos com o atributo a. Por exemplo, nos resultados dum exame, o atributo "aprovado" é contrário do atributo "reprovado". Tem-se, ainda, como é fácil ver: - (- a)

-Cap)

=(-a) + (-P),

=a

(Lei da dupla negação)

-(a + P)

=(-a)(-p)

(la lei de Morgan).

Um atributo diz-se universal, quando se verifica em todos os indivíduos; o conjunto correspondente é pois o universo considerado, U. Um atributo diz-se impossível, quando não se verifica em nenhum indivíduo (elemento de U); o conjunto correspondente é o conjunto vazio. Dois atributos a e p dizem-se incompatíveis quando a sua conjunção é um atributo impossível, isto é, quando os conjuntos correspondentes são disjuntos. Assim, por exemplo, no universo dos seres humanos, o atributo "solteiro" é incompatível com o atributo "casado".


324

Dois atributos a e p contrários são sempre incompatíveis. Mas dois atributos podem ser incompatíveis sem serem contrários; exemplos: os atributos "solteiro" e "casado" entre seres humanos, os atributos "medíocre" e "bom" nos resultados dum exame, etc. Para dois atributos serem contrários, é necessário e suficiente que a sua conjunção seja um atributo impossível e a sua disjunção um atributo universal. Dados dois atributos a, p, diz-se que a implica p e escreve-se a C p, quando todos os indivíduos que possuem a também possuem p. Exemplos: "medíocre" implica "reprovado", "casado" implica "não solteiro". Os atributos a e p dizem-se equivalentes quando a C p e pC a; exemplo: "medíocre ou mau" equivale a "reprovado". De tudo o que precede ressalta que a álgebra dos atributos é perfeitamente análoga à álgebra das funções proposicionais (numa variável) e ambas se traduzem directamente na álgebra dos conjuntos. E que, a bem dizer, entre atributos e funções proposicionais existe apenas uma diferença de forma. Seja, por exemplo, a função proposicional /

"x é agrónomo ou silvicultor" definida entre indivíduos portugueses; trata-se, como se vê, duma fórmula que se converte em proposição verdadeira para certas determinações de x e em proposição falsa para outras determinações de x. Exprime, pois, um atributo que se concretiza na reunião de duas classes: a dos engenheiros agrónomos e a dos engenheiros silvicultores (classes não necessariamente disjuntas). Uma classe pode ser determinada de dois modos diversos: - ou dando um sistema de atributos ou regras que a caracterizem completamente (ponto de vista da compreensão); - ou indicando um por um os indivíduos que a compõem (ponto de vista de extensão) . Conforme o ponto de vista adoptado, assim o conceito de classe se aproxima do conceito de atributo ou do conceito de conjunto. A distinção entre tais conceitos tem sempre um carácter mais ou menos subjectivo. Note-se que, na linguagem comum, os adjectivos exprimem normalmente atributos, enquanto os substantivos comuns se referem a classes e os substantivos próprios a indivíduos.


325

Convém, ainda, lembrar que os atributos (ou as classes) que a Natureza nos apresenta nunca são nitidamente definidos, como os conceitos abstractos da Matemática. Entre um atributo e os atributos vizinhos há geralmente zonas fronteiriças, em que a distinção acaba sempre por ser feita de modo mais ou menos artificial ou arbitrário. Por exemplo, ao classificar os habitantes duma cidade segundo a cor dos cabelos, muitas vezes se hesita entre os atributos "castanho" e "loiro" ou "ruivo", para um dado indivíduo. " 3. AIgebra dos acontecimentos

Recordemos que, entre os exemplos do n.o 1, alguns se referem, não propriamente a atributos, mas sim a acontecimentos. Não pretendemos aqui definir "acontecimento", assim como não tentámos definir "atributo": tratam-se de conceitos psicologicamente primitivos. O que será possível e conveniente é esclarecer tais conceitos e precisar, tanto quanto possível, a terminologia que lhes diz respeito. Comecemos por notar que, em vez de "acontecimento", se usam com significado semelhante os termos "facto", "fenómeno", "eventualidade", etc. Imaginemos uma prova ou experiência, que se possa repetir várias vezes em condições idênticas, conduzindo, de,- cada vez, a um ou mais resultados, entre vários que são possíveis. E a cada um desses resultados que, em cálculo das probabilidades e em estatística, se costuma dar o nome acontecimento. Assim, antes de efectuar a prova, vários acontecimentos são de esperar: cada um deles é, então, apenas uma eventualidade ou hipótese (acontecimento em potência); efectuada a prova, apenas alguma ou algumas dessas hipóteses se realizam (acontecimento em acto). São inúmeros os exemplos que, neste sentido, se podem apresentar. Por enquanto, recordaremos apenas os que foram citados no n.o 1: desastre ou ausência de desastre numa viagem aérea, resultados duma prova desportiva, etc. Mas convém desde já observar que, muitas vezes, os acontecimentos se exprimem por meio de atributos (e vice-versa). Tal é, por exemplo, o caso dos resultados dum exame (ou o caso análogo duma competição desportiva); assim, ao atributo "reprovado" corresponde o acontecimento "ficar reprovado", ao atributo "vitorioso" corresponde


326

o acontecimento "vencer" (na linguagem comum, os acontecimentos são geralmente expressos por verbos, enquanto os atributos são expressos por adjectivos). Ainda aqui, portanto, há, de certo modo, uma questão de ponto de vista psicológico. Podemos, portanto, desde já, prever que para os acontecimentos, exista uma álgebra perfeitamente análoga à dos atributos. Com efeito, sejam a e ~ dois acontecimentos a esperar numa dada prova rzp: 1) - Chama-se conjunção (ou produto lógico) de a e ~, e representa-se por a~, o acontecimento que consiste na realização simultânea de a e de ~. 2) - Chama-se disjunção (ou soma lógica) de a e ~, e representa-se por a + ~, o acontecimento que consiste em se realizar um, pelo menos, dos acontecimentos a e ~. 3) - Chama-se contrário (ou negação) de a, e representa-se"'" a ou por ii, o acontecimento que consiste em não se realizar a. 4) - Diz-se que a implica ~, e escreve-se a C ~, quando ~ se realiza todas as vezes que a se realiza. 5) - Dois acontecimentos a, ~ dizem-se equivalentes, e escreve-se a = ~, quando a C ~ e ~ C a. 6) - Um acontecimento diz-se certo quando já se sabe a priori, com certeza absoluta, que se realizará na prova rzp, todas as vezes que esta for efectuada. Um acontecimento diz-se impossível, quando é certo o seu contrário. Por exemplo, no exame final dum aluno é certo o acontecimento "aprovação ou reprovação" (excluem-se os casos de falta ou desistência) e é impossível o acontecimento "obter 21 valores" (em escolas portuguesas). 7) - Dois acontecimentos dizem-se incompatíveis, quando a sua conjunção é um acontecimento impossível. As operações de conjunção, disjunção e negação entre acontecimentos gozam das mesmas propriedades que entre atributos, tornando-se, pois, supérfluo mencioná-las aqui. 4. Acontecimentos expressos em forma proposicional

A maior parte dos acontecimentos estudados em cálculo das probabilidades apresentam-se, naturalmente, sob a forma de funções proposicionais. Vejamos dois exemplos:


327

a) Imaginemos uma urna que contenha bolas brancas e bolas pretas. Designando por U o universo das bolas contidas na urna, por B o conjunto das bolas brancas e por P o conjunto das bolas pretas, teremos duas funções proposicionais xEB, xEP definidas em U. A variável x toma, pois, cada um dos seus valores em U. Ora, o valor de x pode ser determinado, extraindo ao acaso uma bola de U. Nesta prova (extracção da bola) realiza-se, então, um dos seguintes acontecimentos contrários: x E B, (a bola x que sai é branca), x E P (a bola x que sai é preta). Vê-se, pois, como as funções proposicionais consideradas passam a exprimir acontecimentos. b) Sej a x a classificação dum aluno numa prova CZP a realizar. Os resultados "mau" , "medíocre" , "suficiente" " "bom" "distinto" e "muito bom", segundo convenções frequentemente adoptadas, são expressos, respectivamente, pelas funções proposicionais seguintes: x<6, 6<x< 10, 10<x< 14, 14<x< 16, 16<x<18, 18<x.

O resultado "aprovado", soma lógica de "suficiente", "bom", "distinto" e "muito bom", é expresso pela função proposicional x > 1O. Assim, nestes casos, os acontecimentos a que pode dar lugar a prova CZP considerada aparecem directamente sob a forma de funções proposicionais a (x) definidas num dado universo U, sendo o valor da variável x (elemento de U) determinado em cada realização da prova CZP. A variável x recebe, nos casos como o considerado em a), o nome de variável casual ou variável aleatória, atendendo a que .na sua determinação, intervém, mais ou menos, o acaso (1). E claro (1) - É impossível definir logicamente o termo "acaso". Numa primeira aproximação, poderíamos dizer que este termo designa ausência de causa, ou, pelo menos, de causa conhecida. Para certos autores, o acaso consistiria na acumulação de um grande número de pequenas causas desconhecidas que actuam em"diversos sentidos, tornando praticamente impossível a previsão do efeito global. Sobre este ponto, aconselhamos a leitura do prefácio do livro de CASTELNUOVO, citado na Bibliografia.


328

que a conjunção de dois acontecimentos a e ~ será expressa pela conjunção das funções proposicionais que exprimem a e ~ e analogamente para a disjunção, para a negação, etc. Deste modo, a cada acontecimento a (x) ficará a corresponder um determinado subconjunto A de U: o conjunto de indivíduos que verificam a(x); reciprocamente, a cada conjunto A de U corresponde o acontecimento expresso pela função proposicional x E A. (A dois acontecimentos corresponde o mesmo conjunto, quando, e só quando, os acontecimentos são equivalentes). A álgebra dos acontecimentos poderá, pois, traduzir-se na álgebra dos conjuntos. Mesmo no caso geral, a redução dos acontecimentos à forma de função proposicional é sempre possível, pelo menos de modo indirecto.

5. Frequência dum atributo numa população Chama-se frequência absoluta dum atributo a (num dado universo U) ao número de indivíduos que possuem esse atributo, isto é, ao número de elementos do conjunto A correspondente ao atributo a. Designaremos esse número por (a). Chama-se frequência relativa do atributo a ao quociente de (a) pelo número total de indivíduos (elementos de U). Designaremos por N esse número e por fr(a) a frequência relativa de a. Ter-se-á, pois, por definição: fr(a)

= (a)

.

N

A frequência relativa costuma também ser expressa em tantos por cento e, algumas vezes, em tantos por mil, devendo usar-se, então, respectivamente, as fórmulas:

fr(a)

= 100· (a) N

%,

1.000 . (a) fr(a) = N %0.

Já no n.o 1 demos vários exemplos de frequências absolutas e de frequências relativas. Resulta logo da definição que se tem O< fr (a) < 1, qualquer que seja o atributo a.


329

Em particular, será fr(a) = 1 [isto é, (a) = N], quando é atributo universal, e fr(a)=O [ou seja (a)=O], quando é atributo impossível. Além disso, tem-se o TEOREMA DA SOMA. Dados p atributos aI' a 2 , ••• , a p ' incompatíveis dois a dois, a frequência absoluta [resp. relativa] da soma lógica desses atributos é sempre igual à soma das frequências absolutas [resp. relativas] dos mesmos atributos; isto é, em fórmulas: (aI + a 2 + ... + a p ) = (aI) + (a 2 ) + ... + (ap )' (5.1)

fr(a l + a 2 + ... + a p ) = fr(a l ) + fr(a 2) + ... + fr(ap ).

Com efeito, sendo cada um dos atributos a i incompatível com qualquer dos outros, os conjuntos correspondentes são disjuntos dois a dois e, portanto, a sua reunião, correspondente ao atributo aI + a 2 + ... + a p ' tem um número de elementos igual à soma dos elementos dos primeiros, isto é,

e, portanto, (aI + a 2 + ... + a (aI) (a 2) (a -----_....:.....=-+ - - + ... + ----"-p)

N

p)

N

N

N '

que é, precisamente, o que exprime a fórmula (5.1). Note-se que, na aplicação deste teorema, é essencial que esses atributos considerados sejam incompatíveis, dois a dois. Por exemplo, suponhamos que, numa certa cidade, 8% dos habitantes são empregados do Estado e 34% são empregados de empresas particulares; não se pode daí concluir, sem mais, que 42% dos habitantes são empregados (do Estado ou de empresas particulares), pois pode haver habitantes que sejam ao mesmo tempo empregados do Estado e de empresas particulares. Vemos mais adiante como proceder, de modo sistemático, em casos tais. Entretanto, observemos que do teorema anterior (ou mesmo da definição) se deduz logo o


330

COROLÁRIO. Se for fr a frequência relativa dum dado atributo, será 1- fr a frequência relativa do atributo contrário; isto é, em fórmula fr(ã)

=1 -

fr(a).

Com efeito, os atributos a, ã são incompatíveis e, como a sua soma lógica é atributo universal, tem-se fr(a) + fr(ã)

= fr(a + ã) = 1,

donde, fr(ã)

= 1- fr(a).

6. Frequência dum acontecimento numa série de provas

Consideremos n realizações, C!P l' C!P 2' ... , C!Pn , duma prova genérica C!P e seja a um acontecimento a provar em cada realização de C!P. Suponhamos que o acontecimento a se realiza em v destas provas e que, portanto, o seu contrário se realiza nas n - v provas restantes. Diremos, então, que v é a frequência absoluta do acontecimento a na série de provas consideradas. Por outro lado, chamaremos frequência relativa de a na referida série ao cociente de v por n, isto é, ao número f dado pela fórmula

v f=-, n

número este que depende não só do acontecimento, como, ainda, do número n das provas. É claro que se terá sempre

O<f<l. Mas o caso f = 1 não habilita em absoluto a concluir que o acontecimento a é certo, assim como o caso f = O não habilita em absoluto concluir que o acontecimento é impossível. Entretanto, importa observar que o teorema da soma, bem como o respectivo corolário, subsistem para os acontecimentos, bastando substituir nos enunciados a palavra "atributo" pela palavra "acontecimento ". As demonstrações são perfeitamente análogas às anteflores. NOTA. Se tomarmos para universo lógico o conjunto {C!P 1 , C!P 2 , ••• C!Pn }, a função proposicional de


331

" rzp é uma prova em que se realizou a" exprime visivelmente um atributo, cuja frequência (absoluta ou relativa) é por definição a frequência (absoluta ou relativa) do acontecimento a na série considerada. 7. Partições

Chama-se partição (ou classificação) dum universo U a toda a decomposição de U num conjunto {Cp C2 , ••• , Cm} de conjuntos disjuntos dois a dois, cuja reunião seja U, isto é, de conjuntos C i tais que Ci Ck = 0 para i =1= k e

m

L Ci = U. i = 1

Os conjuntos Ci dir-se-ão elementos ou células da partição (1). Paralelamente, chamaremos partição em atributos a todo o conjunto {aI' a 2 , ••• , a n } de atributos incompatíveis, dois a dois, cuja soma lógica seja o atributo universal. Uma partição diz-se dupla, tripla, etc., conforme o número m dos seus elementos for 2, 3, .... Sempre que esse número é superior a dois, a partição diz-se múltipla (excluimos o caso sem interesse m= 1). O caso mais simples será o das classificações duplas, também chamadas classificações dicotómicas ou dicotomias. Estas podem sempre ser determinadas em U, por um atributo a e pelo seu contrário ã (é claro que não interessa o caso em que a é impossível ou universal). Dados vários atributos a, B, y, ... , sobre U, as operações de negação e de conjunção efectuadas sobre esses atributos e sobre os resultados obtidos conduzem necessariamente a uma partição em atributos. Ora, ~ssa partição pode sempre ser atingida por sucessivas dicotomias, como vamos ver. Para fixar ideias, limitemo-nos ao caso de 3 atributos a, B, y. As sucessivas dicotomias podem ser esquematizadas do seguinte modo: (1) - Supõe-se nesta definição que o universo é finito, mas é claro que a definição se pode es-

tender imediatamente ao caso dos universos infinitos e das partições com uma infinidade de células.


332

~

________

ex

u ~A~

________

~

ex-

. . . - -_ _A " - - _ - . . ,

Obtivemos assim, como é fácil verificar, uma partição constituída pelos 23 atributos ex ~ 'Y, ex ~ 'Y, ex ~ y,

ã ~ 'Y, ã ~ y, ã ~ 'Y, ã ~ y, ex ~ y,

entre os quais, porém, pode haver algum repetido ou impossível, o que reduz o seu efectivo. Estes resultados estão sugestivamente figurados no diagrama junto, em que as classes correspondentes aos atributos ex, ~, 'Y são representadas por círculos e o universo por um rectângulo.

u


333

Suponhamos, por exemplo, que o universo U é constituído pelos portugueses, sendo a o atributo "casado", Po atril?.uto "empregado" e 'Y o atributo "com menos de 35 anos". Então, a P'Y será o atributo "casado, desempregado, com menos de 35 anos", ãP;Y o atributo "não casado, empregado, com idade não inferior a 35 anos", etc. Toda a partição U* dum universo U (em conjuntos ou em atributos) pode ser tomada para novo universo, dando-se, por assim dizer' uma condensação do universo primitivo. Os novos indivíduos serão, é claro, as células da partição U*. Este processo de condensação é muitas vezes usado em Estatística para resumir dados. Por exemplo, na Tabela n.o 1 fez-se uma partição dos alunos em classes, conforme as notas obtidas no exame, substituindo-se o universo dos alunos pelo universo das notas; este, por sua vez, pode ser condensado no universo constituído pelos atributos "mau", "medíocre", "suficiente", "bom", "distinto" e "muito bom", o qual, por sua vez, pode ser substituído pelo universo {"aprovado", "reprovado"}. Estas considerações aplicam-se mutatis mutandis ao caso dos acontecimentos. Chamaremos partição dum acontecimento certo a todo o sistema de acontecimentos incompatíveis, dois a dois, cuja soma lógica seja um acontecimento certo. (Esta definição, torna-se mais sugestiva, se em vez do termo "acontecimento" usarmos o termo "eventualidade").

8. Corpos de conjuntos, corpos de atributos, corpos de acontecimentos Consideremos um universo U (finito). Diz-se que uma famI1ia {C1 ' C 2 , ••• , Cr } de conjuntos de elementos de U é um corpo, quando se verificam as duas seguintes condições: 1) - a soma ou o produto lógico de dois (ou mais) conjuntos da famI1ia ainda é um conjunto da famI1ia; 2) - o complemento de cada conjunto da famI1ia ainda pertence à mesma. Analogamente, se define "corpo de atributos" e "corpo de acontecimentos". Neste último caso, devemos supor que se trata dum sistema finito de acontecimentos a prever numa dada prova CJP. A famI1ia de todos os possíveis conjuntos de elementos de U é, manifestamente, um corpo de conjuntos. Mas há outros exemplos de corpos.


334

um corpo mde conjuntos e seja C um desses conjuntos. Então, C ta~bém pertence a m. ~ogo, também pertencem a mo conjunto C + C = U e o conjunto CC = 0; isto é, entre os conjuntos dum corpo figuram sempre o universo e o conjunto vazio. Chamam-se células do corpo m os conjuntos não vazios de m que não contêm nenhum outro conjunto de m, a não ser o conjunto vazio. Dado um indivíduo a, a intersecção de todos os conjuntos de mque contêm a é manifestamente uma célula de m; o menor conjunto de mque contém a. Tem-se, além disso, o seguinte Considere~os

TEOREMA. Sejam A e B duas células de m. Então, de duas uma: ou os conjuntos A e B coincidem ou são disjuntos. Com efeito, suponhamos que os conjuntos A, B não coincidem, isto é, que A "# B, mas que a intersecção AB não é vazia. A

B

Então, visto ser A "# B, podemos garantir que um, pelo menos, destes conjuntos não estará contido no outro: seja, por exemplo, A esse conjunto. Nesta hipótese, tanto AB como AR são conjuntos de m diferentes de A e contidos em A e, como A =AB + AR, nenhum deles será vazio. Mas isto é impossível, porque então não seria A uma célula. Logo, ou A e B são disjuntos (isto é, AB = 0) ou coincidem (isto é, A = B). Daqui se deduzem logo os seguintes corolários: ,-

COROLARIO I. As células dum corpo de conjuntos formam uma partição do universo.


335 '" COROLARIO II. Para todo o conjunto A pertencente a um dado corpo C!ft de conjuntos, existe um e só um conjunto de células de C!ft, de que A é soma lógica.

Posto isto, consideremos uma classe ~ qualquer de subconjuntos de P. Efectuando operações de intersecção, reunião e passagem ao complementar, de todos os modos possíveis, a partir dos conjuntos de ~, os resultados obtidos constituem um corpo de conjuntos; ao menor corpo que contem ~, dá-se-lhe o nome de corpo de conjuntos gerado por ~. É claro que as células deste corpo são as células da partição determinada por ~, a qual se pode obter por sucessivas dicotomias como foi indicado no n.o anterior. Os restantes conjuntos do corpo (além do conjunto vazio) são reuniões de células, como indica o Corolário II. Todas estas considerações se aplicam, mutatis mutandis, aos corpos de atributos e de acontecimentos. Consideremos, por exemplo, entre os resultados normais dum desafio de futebol entre dois grupos A e B, os dois seguintes: vitória de A (que designaremos por V) e empate (que designaremos por E). O corpo de acontecimentos gerado por V e E é formado pelos seguintes elementos: V + E (vitória de A ou empate), V + E (derrota de A - acontecimento que designaremos por D), V + D (vitória ou derrota de A), E + D (empate ou derrota de A), V + D + E (vitória ou derrota de A, ou empate - acontecimento certo, que designaremos por I), VD (vitória e derrota de A - acontecimento impossível, que designaremos por O). Este corpo de eventualidades pode ser representado pelo seguinte esquema, em que usamos a seta como símbolo de implicação:

-


336 ,-

E claro que V, E, D (células do corpo considerado) ainda podem exprimir-se como somas de acontecimentos elementares (indecomponíveis), não pertencentes a este corpo. Com efeito, todo o resultado dum jogo se pode exprimir por um par ordenado (m, n) de números inteiros não negativos, sendo m o número de golos marcados por A e n o número de golos marcados por B. Então, por exemplo, o acontecimento V será a soma dos acontecimentos representados pelos pares (m, n) com m > n. Por sua vez, os acontecimentos E e D são expressos, respectivamente, pelas funções proposicionais m =nem < n. Dum modo geral, a totalidade dos acontecimentos a considerar numa dada prova ou experiência CZP constitui um corpo, desde que se convencione (como é uso) incluir nessa totalidade o acontecimento impossível (1).

Esta convenção é adoptada para comodidade de linguagem. Na mesma ordem de ideias se convenciona que o acontecimento impossível implica qualquer outro acontecimento - convenção, de resto, natural, pois que, só admitindo-a, será inteiramente válida a seguinte propriedade intuitiva: Se a C~, então

pC ã

Com efeito, designando por I o acontecimento certo, tem-se a C!, qualquer que seja a, e portanto, J C ã, qualquer que seja ã. Se isto não fosse verdade, a propriedade anterior não seria válida. Consideremos agora um corpo de atributos e sejam aI' a 2 , · · · , a m as suas células. Qualquer outro atributo a do corpo se exprime como soma de células. Ora, como estas são incompatíveis duas a duas, deduz-se do teorema da soma, este outro TEOREMA. A frequência (absoluta ou relativa) de qualquer atributo a dum corpo ffi de atributos é igual à soma das frequências (absolutas ou relativas) das células de ffi cuja soma é a. Conclusão análoga para os corpos de acontecimentos. (1) - Subentende-se que a totalidade é finita. Note-se, porém, que o conceito de corpo se

pode generalizar ao caso dos conjuntos infinitos (de conjuntos, de atributos ou de acontecimentos).


337

NOTA. É preciso não confundir um conjunto de conjuntos com a reunião desses conjuntos. Por exemplo, o conjunto V dos vertebrados está classificado em vários conjuntos parciais: mamíferos, aves, etc.; porém, V não é o conjunto desses conjuntos, mas sim a sua reunião ou soma. Ora, vimos atrás que, para todo o conjunto C pertencente a um corpo CJt de conjuntos, existe um, e um só, conjunto C* de células de CJt cuja soma é C; reciprocamente, todo o conjunto C* de células de CJt determina um conjunto C E CJt. Portanto, se designarmos por U* a partição de U constituída pelas células de CJt, fica, assim, estabelecida uma correspondência biúnivoca C H C* entre os conjuntos C de CJt e os subconjuntos de U*. Além disso, é fácil ver que à soma C1 + C2 de dois conjuntos C 1 ' C2 de CJt corresponde, deste modo, a soma C 1* + C2 * dos subconjuntos correspondentes de U*, ao produto C 1 C2 corresponde o produto C1* C2 *, e ao complementar de C corresponde o complementar de C*. Exprime-se este facto dizendo que a referida correspondência é um isomorfismo entre o corpo CJt e o corpo dos subconjuntos de U*; diz-se, também, que esses dois corpos são isomorfos. Analogamente, se conclui o seguinte facto: Se Ef é um corpo (finito) de acontecimentos e cg o conjunto das células de Ef, o corpo Ef é isomorfo a um corpo de conjuntos, que é precisamente o corpo dos subconjuntos de cg. Por exemplo, o corpo gerado pelos acontecimentos V, E atrás considerados é isomorfo ao corpo dos subconjuntos de {V, E, D}, que são: este próprio conjunto, o conjunto vazio e, ainda, os conjuntos {V}, {E}, {D}, {V, E}, {V, D}, {E, D}. Ficam assim completadas as considerações do n. o 3: o isomorfismo em questão traduz exactamente a álgebra dos acontecimentos na álgebra dos conjuntos. 9. Distribuição em universos finitos

Consideremos um corpo CJt de conjuntos (num universo U finito). Suponhamos que, a cada conjunto C C CJt, se faz corresponder um determinado número real e designemos esse número por <I>(C): fica assim definida em CJt a função <I> (C), do conjunto variável C.


338

Pois bem, chamaremos distribuição em ffi toda a função de conjunto, <P(C), definida em ffi, que verifique as duas seguintes condições: 1) - <p(C) > 0, para todo o C E ffi. 2) - Se C1 , C2 são conjuntos disjuntos de ffi, então

Em particular, se ffi é formado por todos os subconjuntos de U, diremos, então, que <P (C) é uma distribuição sobre U. ,E fácil reconhecer a veracidade da seguinte proposição: TEOREMA. Sejam Cp C2 , ••• , Cm as células do corpo ffi. Se associarmos a cada conjunto Ci , arbitrariamente, um número real Yi > 0, existe sempre uma, e uma só, distribuição <p(A) em ffi que, para cada conjunto Ci' toma o valor Yi (i = 1, 2, ... , m). O valor de <p(A) para cada A C ffi é, então, a soma dos valores que a função toma nas células cuja soma é A. Em particular, se ffi é formado por todos os subconjuntos de U, as suas células reduzem-se aos indivíduos (elementos de U) e tem-se: ,-

eOROLARIO. Toda a função não negativa definida em U é prolongável numa (e numa só) distribuição sobre U. Daqui o chamar-se também, algumas vezes, distribuição em U a qualquer função real não negativa definida em U. É claro que o conceito de "distribuição num corpo de conjuntos" se estende imediatamente ao caso dos corpos de atributos e dos corpos de acontecimentos. Exemplos de distribuições são-nos oferecidos pelas frequências, tais como atrás foram definidas, tendo em vista o teorema da soma. Mas, além das distribuições de frequência, apresentam-se ainda na prática muitos outros exemplos de distribuições: distribuições de probabilidade (que estudaremos mais adiante), distribuições de massa, distribuições de carga eléctrica, etc., etc.


339

Chamaremos distribuição relativa (num corpo C!lt) a toda a distribuição <I>(A) em C!lt que verifique a condição suplementar seguinte: 3) - <I>(U) = 1 (sendo U o universo, como já foi dito). É fácil ver que, de cada distribuição <I>(A) em C!lt, se deduz uma distribuição relativa, <\> (A), em C!lt, pondo <\> (A)

= <I>(A) ,sendo U o universo. <I>(U)

Do teorema anterior deduz-se o seguinte " COROLARIO. Se <I>(A) é uma distribuição relativa, tem-se sempre ,..,

<I> (A ) = 1 - <I>(A). A dedução faz-se exactamente como no caso particular das frequências relativas (n. o 5). 10. Soma de conjuntos não disjuntos (atributos ou acontecimentos compatíveis)

Seja Jl(A) uma distribuição definida num corpo C!lt de conjuntos. Sendo A, B dois conjuntos de C!lt, o uso da fórmula Jl(A

+ B) =Jl(A) + Jl(B)

exige a restrição de que A e B sejam disjuntos. Como proceder, porém, no caso geral? Já atrás (n.o 5) se nos pôs esta questão a propósito dum exemplo comezinho. Basta notar que se tem, necessariamente, """-I

,...,

,...,,...,,,

A =AB +AB, B =AB +AB, A

+ B =AB +AB +AB.

,..,

,..,

Como os conjuntos AB, AB, AB são disjuntos dois a dois, ter-se-á: A

B


340 ~

~

Jl(A) = Jl(AB) + Jl(AB), Jl(B) = Jl(AB) + Jl(AB), Jl(A + B) = Jl(AB) + Jl(AB) + Jl(AB) ~

~

~

~

donde Jl(AB) = Jl(A) - Jl(AB), Jl(AB) = Jl(B) - Jl(AB) e, portanto, Jl(A

+ B) = Jl(A) + Jl(B) - Jl(AB).

Para o caso de 3 conjuntos A, B, C, bastará aplicar esta fórmula duas vezes: Jl(A

+ B + C) = Jl[A + (B + C)] = Jl(A) + Jl(B + C) - Jl[A (B + C)] = Jl(A) + Jl(B) + Jl(C) - Jl(BC) - Jl(AB + AC).

Como Jl(AB

+ AC) =Jl(AB) + Jl(AC) - Jl(ABC),

virá, por último Jl(A

+ B + C) = Jl(A) + Jl(B) + Jl(C) - Jl(AB)- Jl(AC) - Jl(BC) + Jl(ABC).

Consideremos agora, em geral, p conjuntos quaisquer, AI' A2' ... , Ap' de m. Por indução, chega-se à fórmula seguinte:

que, no seu domínio inicial foi descoberta pelo matemático português DANIEL DA SILVA, que a indica no seu trabalho "Propriedades gerais e resolução directa das congruências binómias: Introdução ao estudo da teoria dos números". É claro que estes resultados se aplicam, mutatis mutandis, ao caso dos atributos ou acontecimentos compatíveis.


341

11. Atributos quantitativos

Entre os atributos considerados em inquéritos estatísticos, há que distinguir duas espécies principais- os que são grandezas e os que o não são. Os primeiros são traduzíveis em números, resultados de medições, enquanto para os segundos não faz sentido falar de medida. Estes são chamados atributos qualitativos ou qualidades, e aqueles, atributos quantitativos ou quantidades (ou, ainda, grandezas). Como sempre sucede, quando se trata de entes do mundo empírico, a fronteira entre as duas espécies é imprecisa. Há casos intermédios, dúbios, em que se fala de avaliação ou correcção dum atributo (em vez de medição): tal é o caso da escala de Mohs relativa à dureza dos minerais, tal é, ainda, o caso das cotações que se atribuem aos alunos nos exames etc. De resto, dada uma partição em atributos (finita), qualquer que ela seja, é sempre possível, com critério mais ou menos convencional, distinguir esses atributos por meio de números. Em particular, no caso da partição dicotómica {a, ii}, formada por um atributo e pelo seu contrário, é natural designar ii Ror O (ausência) e a por 1 (presença) ou por -1 e + 1, etc. Em correspondência às duas espécies de atributos, apresentam-se, naturalmente, duas modalidades de estatística: a qualitativa e a quantitativa. A primeira é, também, chamada estatística de atributos e a segunda, estatística de variáveis; mas estas designações não condizem com a nossa terminologia precedente. Entre os atributos quantitativos (ou, melhor, entre as partições em tais atributos) há, ainda, que distinguir duas categorias: a dos que formam escalas contínuas (variáveis contínuas) e a dos que se dispõem conforme a sucessão de números naturais (variáveis discretas). Pertencem à primeira categoria, por exemplo, os comprimentos, as massas, as densidades, etc. Pertencem à segunda categoria por exemplo, os números de pétalas de uma flor, de grãos de uma espiga, etc., etc. O caso das variáveis contínuas só poderá ser estudado devidamente nos capítulos seguintes, em que trataremos de universos infinitos. Todavia, numa primeira fase, que é a da recolha e classificação dos dados, trabalha-se ainda com universos finitos, tal como vamos ver.


342

Consideremos uma variável contínua x (variável real), atributo quantitativo definido numa dada população U finita: por exemplo, a altura dos indivíduos. Em vez de considerar a frequência de cada um dos valores de x em U (valores estes que são em número infinito), o que há a fazer, na prática, é agrupar esses valores em classes e considerar a frequência de cada uma dessas classes. Por outras palavras, o que há a fazer é uma classificação dos valores possíveis de x, ou seja, uma partição do conjunto dos números reais. De resto, sendo a população U finita, nem é necessário considerar toda a recta real, visto que, para além de certos limites, a frequência se toma nula. Por exemplo, sendo x a variável "altura" numa população de seres humanos e tomando para unidade o metro, não será necessário, geralmente, sair do intervalo [0, 2], a não ser em casos excepcionais de gigantismo. Quanto às células da partição, convém que sejam, evidentemente, intervalos, em número finito. Tudo se resume, portanto, na partição dum intervalo limitado [a, b] em intervalos, por meio dum número finito de pontos, a < Xl < x 2 < ... < xn _ l < b. Todavia, para que se trate efectivamente duma partição, não podem os intervalos ser todos abertos ou todos fechados. Adoptaremos, em regra, intervalos fechados à esquerda e abertos à direita (excepto o último que poderá ser fechado). Assim, para o intervalo [a, b], dividido pelos pontos Xl' X 2 ' ••• , X n ' teremos a partição

A tais intervalos dá-se, em Estatística, o nome de intervalos de classe ou simplesmente, classes. Haverá vantagem, é claro, em que todos esses intervalos tenham o mesmo comprimento e que os pontos de divisão correspondam a números inteiros da unidade escolhida ou dum submúltiplo decimal da mesma. Posto isto, consideremos, de novo, o atributo quantitativo X relativo à população U. Supondo que se efectuou a medição dessa grandeza em cada um dos indivíduos, os resultados serão recolhidos numa primeira tabela, em que, à frente do número de ordem de cada indivíduo, se indica o valor correspondente de x, por exemplo, a altura desse indivíduo com o grau de aproximação adoptado.


343

Em seguida, feita a escolha dos intervalos de classe, as observações podem ser classificadas contando, para cada intervalo, o número total de indivíduos a que correspondem valores de x situados nesse intervalo (frequência absoluta). Organiza-se, deste modo, uma segunda tabela, que é já uma tabela de frequências. O universo U é, então, substituído pelo universo U* das classes e a tabela de frequência define, manifestamente, uma distribuição de frequência sobre U* (recorde-se o que, a este respeito, se disse no n. o 8). Para ilustrar estas considerações, citaremos um exemplo extraído do trabalho de Daniel N agore, Biometria, nociones sobre este método de investigacion en genetica, Ministerio de Agricultura, Madrid, 1941. O exemplo refere-se a uma sub-variedade de trigo, denominado vulgarmente "Catalão compacto", classificado cientificamente entre os Triticum vulgare crythrospermum (Percival) e obtido em campos de estudo por selecção genealógica. Desse trigo foi constituída uma população de 400 espigas, na qual se determinou directamente, em cada indivíduo, o número de grãos e o comprimento da espiga (em milímetros). Destes caracteres biométricos, que designaremos, respectivamente por g e c, se deduziram os valores duma outra grandeza: o número de grãos por 10 cm de comprimento. Esta grandeza, denominada densidade de espiga, é definida em função das primeiras pela fórmula d= 100g. c

Estes dados foram registados numa tabela (que não reproduzimos), na qual, à direita do número da ordem de cada espiga se indica, numa coluna, o valor de g, noutra, o valor de c, e na última, o valor de d, calculado este a partir dos primeiros a menos de 0,01. Em seguida, escolheram-se os intervalos de classe, e daquela primeira tabela deduziu-se a seguinte tabela de frequência:


344 TABELAN? 3

Densidade 14,5 < d < 15 15 < d < 15,5 15,5 < d < 16 16 < d < 16,5 16,5 < d < 17 17 < d < 17,5 17,5 < d < 18 18 < d < 18,5 18,5<d<19 19 < d < 19,5 19,5<d<20 20 < d < 20,5 20,5 < d < 21 21 < d < 21,5 21,5 < d < 22 22 < d < 22,5

Frequência absoluta 1 1 1 1 1 4 5 5 6 14 6 44 31 34 50 43

Densidade 22,5 < d < 23 23 < d < 23,5 23,5 < d < 24 24 < d < 24,5 24,5 < d < 25 25 < d < 25,5 25,5 < d < 26 26 < d < 26,5 26,5 < d < 27 27 < d < 27,5 27,5 < d < 28 28 < d < 28,5 28,5 < d < 29 29 < d < 29,5 29,5 < d < 30

Frequência absoluta 52 41 19 14 6 12 2 2 1 1 1

° ° 1 1

Ao olhar para esta tábua pode haver um equívoco, que é preciso evitar. Por exemplo, à direita da função proposicional 19 < d < 19,5 escreveu-se 14. Ora, isto não significa que, para todo o valor de d pertencente àquele intervalo, a frequência é 14, mas, sim, que é esta a frequência do atributo "densidade maior ou igual a 19 e menor que 19,5" na população considerada. O número 14 corresponde, pois, ao intervalo [19; 19, 5[ e não a cada ponto deste intervalo. Por outras palavras: é uma função de conjunto - uma distribuição - e não uma função de ponto (isto é, uma função da variável d). Estas observações vêm, assim, esclarecer o conceito de distribuição introduzido no n. o 9. No trabalho a que nos referimos faz-se, depois, para determinado efeito, uma condensação dos dados, substituindo os intervalos de comprimento 0,5 por intervalos de comprimento 1 e aplicando a propriedade aditiva das distribuições. Obtém-se, deste modo, a seguinte tabela:


345 TABELAN~4

Densidade

Frequência absoluta

Densidade

Frequência absoluta

14<d<15 15 < d < 16 16<d<17 17<d<18 18<d<19 19 < d < 20 20 < d < 21 21 < d < 22

1 2 2 9 11 20 75 84

22 < d < 23 23 < d < 24 24 < d < 25 25 < d < 26 26 < d < 27 27 < d < 28 28 < d < 29 29 < d < 30

95 60 20 14 3 2 1 1

Note-se que muitas vezes, para se designar cada intervalo de classe, se indica o ponto médio desse intervalo. Assim, na tábua anterior, o intervalo [14, 15[ seria designado como a classe 14,5, etc. Nestes casos, convém escolher os intervalos de modo que os pontos médios sejam números inteiros de unidades ou de submúltiplos decimais da unidade. Recordemos que é este o critério usado no arredondamento das médias de notas de alunos; assim, quando se diz que a média é de 12 valores, está-se a indicar, resumidamente, que a média é um número x tal que 11,5 < x < 12,5; analogamente, dizendo que a média é de 14,3, pretende-se dizer que a média verifica a condição 14,35 < x < 14,36, etc. O mesmo critério é ainda usado pelas companhias de seguros na atribuição da idade para o pagamento do prémio, em seguros de vida. 12. Representação gráfica das distribuições: histogramas e polígonos de frequência Para ter uma visão mais directa e sugestiva duma distribuição de frequência, procede-se à sua representação gráfica, começando por fixar no plano um sistema de eixos coordenados rectangulares, com escalas geralmente diferentes. Uma vez marcados no eixo das abcissas os sucessivos intervalos de classe (não sendo indispensável que o ponto de abcissa O coincida com o cruzamento dos eixos), a representação gráfica pode, na prática, ser feita de dois modos diversos:


346

1. ° processo - Sobre o segmento representativo de cada classe, constrói-se um rectângulo de altura (positiva) correspondente à frequência dessa classe. A reunião dos rectângulos assim obtidos é chamada o histograma ou diagrama de colunas de distribuição considerada. (Na Fig. 1 é dado o histograma correspondente à Tabela n.o 4).

100

90

-

80 r--

70 60

-

50 40 30

-

;--

'-;--;--

o

r1

L

I

~ ~

Densidade de Espigas

Fig. 1

E" claro que as áreas dos diferentes rectângulos são proporcionais às frequências das respectivas classes, de modo que a área do histograma representa, na mesma escala, o número total de indivíduos. Em particular, o quociente da área dum rectângulo (OU duma reunião de rectângulos) pela área do histograma dá a frequência relativa da respectiva classe (ou da respectiva reunião de classes).


347

2.° processo - Pelo ponto médio da cada intervalo de classe conduz-se uma perpendicular ao eixo das abcissas, sobre a qual se marca o ponto de ordenada igual à frequência dessa classe. Traçam-se, depois, segmentos de recta, unindo entre si os pontos consecutivos assim obtidos e unindo o primeiro e o último destes pontos, respectivamente, com o primeiro e o último extremo dos intervalos marcados. Obtém-se, deste modo, uma linha poligonal, à qual se dá o nome de polígono de frequência ou polígono de Johannsen da distribuição considerada. Na Fig. 2 são dados os polígonos de frequência correspondentes à Tabela n. ° 3 (a traço fino) e à Tabela n. ° 4 (a traço cheio). 100 90 80 70

.~

c:s

60

(,.)

~

~<::u

;::s

50

~

~

~

40 30 20 10 O Densidade de espigas

Fig. 2

Observe-se que a primeira poligonal é mais sinuosa, mais irregular do que a segl1nda.


348

Dum modo geral, não convém que os intervalos de classe sejam demasiado grandes, pois que, então, se obtém uma informação grosseira da distribuição. Mas também não convém que os intervalos sejam demasiado pequenos, porque, então, se tomam mais sensíveis às influências individuais, rompendo-se aquela regularidade estatística, aquele possível esboço duma lei simples que se colhe da visão dum conjunto, mas que se desvanece ao aproximarmo-nos dos indivíduos, dos casos isolados. " E, ainda, manifesto que, uma tal regularidade estatística será tanto maior quanto maior for o número de indivíduos, podendo, então, reduzir-se cada vez mais a amplitude dos intervalos. Deste modo, a poligonal acabará por se confundir, sensivelmente, com uma curva. E, assim, a intuição nos vai aproximando do conceito de distribuição duma variável contínua, que será estudado em rigor a partir do capítulo seguinte. Só depois disso poderemos tirar conclusões dos exemplos agora citados. 13. Independência e associação de atributos. Distribuições de duas ou mais variáveis

Quando se pretende averiguar em que medida dois atributos ou dois fenómenos andam ligados, numa população ou num tipo de experiências, o que há a fazer é um inquérito estatístico de que vamos indicar as formas preliminares. Suponhamos, por exemplo, que se trata de saber se, entre seres humanos, o atributo "ser míope" está, de qualquer modo, associado ao atributo "ter olhos azuis" . O que, ocorre desde logo, é indagar, numa população tão numerosa e variada quanto possível, qual a percentagem de míopes: 1.0 - entre indivíduos com olhos azuis; 2. o - entre indivíduos com olhos não azuis. Se as duas percentagens são sensivelmente iguais, há razão para pensar que os atributos considerados são independentes; se as percentagens se afastam consideravelmente uma da outra, seremos inclinados a admitir que os dois atributos estão associados ou correlacionados: em sentido positivo, se a primeira percentagem é maior que a segunda, em sentido negativo, no caso oposto. Analogamente se procederia para averiguar, por exemplo, se o fumar está ou não ligado com doenças de estômago, se um insecti-


349

cida é ou não eficaz no tratamento de certas plantas, etc., etc. Nestes exemplos, começa a desenhar-se a hipótese duma relação de causalidade entre dois fenómenos. Estas considerações podem ser teorizadas do seguinte modo. Sejam a, ~ dois atributos definidos num dado universo U, composto de N indivíduos. Para indicar as frequências destes atributos e dos seus contrários, pode fazer-se uso duma tabela de duas entradas, do seguinte tipo:

~

-~

a

(a~)

(a~)

-

(a)

a-

(ã~)

(ã~)

(ã)

Total

(~)

(~)

-

N

Total

Para brevidade de linguagem diremos "os a" em vez de "os indivíduos com o atributo a" , e, analogamente, para ~. A proporção dos a em U é (a)/N (frequência relativa de a). A proporção dos a entre os ~ será (a~)/(~); chamar-Ihe-emosfrequência condicional de a relativa a ~ e representá-Ia-emos por fr(al ~). Ter-se-á, pois, por definição:

(13.1)

o atributo a

dir-se-á independente de ~ em U se a proporção dos a entre os ~ é igual à proporção dos a entre os não ~, isto é, se

-

fr(al~) = fr(al ~), ou seja, se (a~) = (a!) (~)

(~)

.


350

Mas, recordemos a seguinte propriedade das fracções: a c - a+c a. (1) Se - = -, entao = -, e reczprocamente. b+d b b d

Ter-se-á, portanto:

Se

(a~)

_

(~)

-

=

(a~)

-

_ (a~) + (a~)

, entao

~

_

(~)

=

(a~)

+ (~)

-

. , e reczprocamente.

(~)

- =N. Portanto, dizer que a

Mas (a~) + (a~) = (a) e (~) + (~) independente de ~ equivale a dizer que

é

(13.2) isto é, que a proporção dos a entre os ~ é igual à proporção dos a na população total. A fórmula precedente, pode ainda, escrever-se fr(al~)

=fr(a).

Logo, dizer que a é independente de ~ equivale a dizer que a frequência condicional de a relativa a ~ é igual àfrequência relativa de a (em U). Uma outra maneira de escrever (13.2) é a seguinte: (13.3) fórmula esta que, pela sua simetria em a e mente que:

(1) - Com efeito, se pusermos

~

nos mostra imediata-

!!.- =~ =k, virá a =bk, c =dk, a + c = (b + d)k e, portanto, b

d


351

Se a é independente de ~, também ~ é independente de a. Diremos, então, simplesmente, que os atributos a, ~ são independentes (em U). Mas a fórmula (13.3) ainda se pode escrever com o aspecto

(a~) N

= (a) . (~) ,ou seja, N N

fr(a~) = fr(a) . fr(~),

donde o TEOREMA DO PRODUTO. Se dois atributos a, ~ são independentes, a frequência relativa de a ~ é igual ao produto das frequências relativas de a e de ~. Reciprocamente, se esta condição se verifica, os dois atributos são independentes. Mais geralmente, da definição (13.1) de frequência condicional, deduz-se fr(a~)

=fr(~) . fr(al~)

ou, ainda, trocando os papéis de a e de

~

fr(a ~) = fr(a) . fr(~la), o que se exprime dizendo que: A frequência relativa de a ~ é igual ao produto da frequência relativa de a pela frequência condicional de ~ relativa a a ou (vice-versa). E'" claro que o teorema do produto se obtém como caso particular desta última proposição, pois que se tem fr(~la) = fr(~), se e só se, a e ~ são independentes. Suponhamos, agora, que a e Então, de duas uma: 1) ou

(a~)

~

não são independentes em U.

> (a) (isto é, a proporção dos a é maior entre os (~) N no universo inteiro),

~ que


352

2) ou (aP) < (a) (isto é, a proporção dos a é menor entre os p que (P) N no universo inteiro). No primeiro caso, tem-se, mais simetricamente, (13.4)

(aP) > (a) (P) ou fr(ap) > fr(a) fr(p) N

e diz-se que os atributos a, p estão associados positivamente, ou, simplesmente, associados (em U). No segundo caso, também se pode escrever (ap) < (a) (P) ou fr(ap) < fr(a) fr(p), N e diz-se que a, p estão associados negativamente ou desassociados (em U). Os casos extremos são aqueles em que a associação ou a desassociação é completa. Diremos que os atributos a, p estão completamente associados (em U) quando um deles, pelo menos, implica o outro, isto é, quando se tem: ou a C p (todo o a é um P) ou P C a (todo o p é um a), podendo, em particular, verificar-se as duas hipóteses (será, então, a equivalente a P). É claro, que se tem a C p ou p C a conforme for (a) = (a P) ou (P) = (a P). Portanto, dizer que os atributos a, p são completamente associados equivale a dizer que (a P) é igual ao menor dos números (a), (P). OS atributos a, p dizem-se completamente desassociados em U quando se verifica uma, pelo menos, das seguintes condições: ap=0,

ã~=0,

isto, é quando são incompatíveis os atributos a, p (nenhum a é P) ou os seus contrários (todo o ã é P). Deste modo, é natural considerar a diferença entre (ap) e o valor (a) (P)/N (chamado valor de independência) como um índice da


353

intensidade da associação ou desassociação. É costume designar por () esta diferença e por (a~)o o valor de independência. Tem-se, pois:

No entanto, para ter uma ideia comparativa dos graus de associação, é necessário substituir () por um índice relativo. Entre os vários índices que têm sido propostos para este efeito, o mais simples é o seguinte, chamado coeficiente de associação: Q

= (a~) (ã~) - (a~) (ã~) = (a~) (ã~)

+ (a~) (ã~)

~N () ~ (a~) (ã~)

+ (a~)(ã~)

É claro que se tem Q =O se e só se os atributos são independentes (o que equivale a ser () =O). Os valores extremos de Q são +1 e-I: Tem-se Q = + 1, se e só se os atributos estão completamente as(ã~) se sociados, pois que, só nesse caso um dos factores (a anula. Tem-se Q =- 1, se e só se os atributos estão completamente desassociados, pois que, só então, se tem (a~) = O ou (ãP) = o. N os dois números seguintes, estudaremos um outro índice de associação, de grande interesse estatístico. E fácil ver, ainda, que a condição (13.4) de associação positiva (simétrica em a e ~) é equivalente a qualquer das seguintes (assimétricas):

P),

/

~

(a~)

(a~)

(~)

(~)

(a~)

(ã~)

(a)

(ã)

(13.6)

-->

(13.7)

-->--

~

e, analogamente, para a associação negativa. Ora, na prática, qualquer destas comparações é, geralmente, mais elucidativa do que a


354

primeira para dar uma ideia do tipo de associação. Segundo a disposição adoptada na tabela-tipo atrás considerada, a fórmula (13.6) corresponde a uma comparação por colunas e a fórmula (13.7) a uma comparação por linhas. Qual das duas deve ser preferida? Isso depende da hipótese que se tiver em mente ao pôr o problema. Se a relação suposta entre os atributos é assimétrica, próxima duma das implicações a C ~ ou ~ C a , deve preferir-se a comparação por linhas ou por colunas, conforme for a ou ~ que se presume no papel de antecedente ou causa. Se, porém, a relação suposta for de reciprocidade, vizinha da equivalência a = ~, é preferível a comparação entre (a~) e (a~)o' como se faz nas fórmulas (13.4) e (13.5). Consideremos o seguinte exemplo indicado por YULE e KENDALL (obra citada, p. 40). Trata-se de investigar a associação entre inoculação contra a cólera e a isenção do ataque; obtiveram-se os seguintes resultados: TABELAN.O 5 Não atacados

Atacados

Total

Inoculados Não inoculados

276 473

3 66

279 539

Total

749

69

818

Pressupõe-se, é claro, uma relação assimétrica, com a no papel de causa. Convirá, pois, fazer uma comparação por linhas: 1) - Percentagem de inoculados que não foram atacados:

(a~) (a)

= 276 = 98 9% 279

'

2) - Percentagem de não inoculados que não foram atacados:

(ã~) = 473 = 87,9% (ã)

539


355

São, talvez, mais sugestivos (embora equivalentes) as proporções complementares: 1') - Percentagem de inoculados que foram atacados: 1,1 2') - Percentagem de não inoculados que foram atacados: 12,2 Em qualquer das formas é visível a associação positiva entre a inoculação e a isenção do ataque (ou associação negativa entre inoculação e ataque). A comparação por colunas indica, igualmente, uma associação apreciável, mas é claro que não responde directamente à questão implícita no inquérito: 1") - Percentagem de não atacados que foram inoculados: 36,8 2") - Percentagem de atacados que foram inoculados: 4,3

14. Associação e independência de partições múltiplas. Tábuas de contingência Consideremos, agora, mais geralmente, duas partições em atributos

num mesmo universo U com N indivíduos. Seja a a variável que toma por valores 0.,1' 0.,2' ... , a p e seja ~ a variável que toma por valores ~l' ~2' ••• , ~q. As duas partições, cruzadas sobre U, determinam uma nova partição, mais fina, constituída pelos p. q atributos ai ~k (i = 1, 2, ... , p; k = 1, 2, ... , q); em particular, alguns destes atributos, podem ser impossíveis, o que reduz o seu número efectivo. As frequências dos atributos ai' ~k podem ser indicadas numa tabela de duas entradas do seguinte tipo:

~

~l

~2

.........

~q

Totais

ai a2

(ai ~l)

(ai ~2)

.........

(ai ~q)

(ai)

(a2 ~l)

(a2 ~2)

.........

(a2 ~q)

(a2)

...... ...

... ... ...

.........

...... ...

... ......

. ........

ap

(ap ~l)

(ap ~2)

.........

(ap ~p)

(ap )

Totais

(~l)

(~2)

.........

(~q)

N


356

Trata-se, manifestamente, duma generalização do tipo de tábuas consideradas no número precedente, para o caso de duas partições dicotómicas (p = q = O). Dá-se-Ihe o nome de tábuas de contingência. Como exemplo, indicaremos, a seguinte tabela apresentado por YULE e KENDALL (obra citada, p. 66), relativa às 2 variáveis "cor dos olhos" e "cor dos cabelos", numa população constituída por 6.800 habitantes masculinos de Baden. TABELAN.O 6

~

Louro

Castanho

Preto

Ruivo

Total

olhos Azul Cinzento ou verde Castanho

1.768 946 115

807 1.387 438

189 746 288

47 53 16

2.811 3.132 857

Total

2.829

2.632

1.223

116

6.800

Cor dos

cabelos

Aqui, como se vê, a variável "cor dos olhos" é susceptível de três valores ("azul", "cinzento ou verde" e "castanho"), enquanto a variável "cor dos cabelos" é susceptível de quatro valores ("louro", "castanho, "preto" e "ruivo"). Dum modo geral, diremos que a variável a é independente da variável ~ (em U), quando cada um dos valores de a é independente de cada um dos valores de ~, no sentido precisado no número precedente; isto é, quando se tiver

para todos os valores possíveis de i e de k. É claro, que se a é independente de ~, também ~ é independente de a: diremos, então, simplesmente, que as variáveis, a, ~ são independentes em U. Se tal não acontecer, poremos, ainda, ( rIIl' u,

Rk)O J-I

= (a)N(~k) ,

1 2 ... , q, para l. = 1, 2, ... , p , k ="


357

e chamaremos aos números (ai ~k)O valores de independência. Por sua vez, chamaremos discrepâncias às diferenças entre os valores observados e os valores de independência, isto é, aos números

Desde já, convém salientar que as discrepâncias não são algebricamente independentes. Tem-se, com efeito, para cada valor de i: Õ.

tl

+ Õ.12 + ... + Õ.Iq..L...i = 'f k=l

[(a.r.~ ) _ (a)N(~k)] IJJk

Mas q

L(a i ~k) = (ai ~l) + (ai ~2) +. ... + (ai ~q) = (a) k=l

e

Logo Õil + Õi2 + ... + Õiq

= 0,

para i = 1, 2, ... , p;

isto é, a soma das discrepâncias em cada linha é igual a zero. Analogamente se conclui que é nula a soma das discrepâncias em cada coluna, isto é, que: Õlk + Õ2k + ... + Õpk = 0, para k = 1, 2, ... , q.

o número total dos Õik é pq. Mas é claro que basta conhecer os valores das discrepâncias em p - 1 linhas e em q - 1 colunas, pois


358

os valores correspondentes à linha e à coluna restantes se determinam por meio das relações estabelecidas. É fácil ver, agora, que não existem outras relações obrigatórias entre as discrepâncias; o número total dos Oik independentes é, pois, (p-I) (q-l). Dá-se-Ihe o nome de número de graus de liberdade da tábua em questão. O conjunto das discrepâncias dá uma ideia do grau de associação entre os diferentes valores de a e de ~. Mas convém resumir esses dados num índice único, de maneira tão simples e elucidativa quanto possível. A soma dos Oik não serve, visto ser nula, como vimos. Um índice independente dos sinais dos Oik é o que se obtém dividindo o quadrado de cada discrepância pelo correspondente valor de independência e somando os resultados obtidos. Este índice que se representa por X2 (qui quadrado) e se chama contingência quadrática, apresenta, como veremos, um grande interesse em ciências experimentais. Será, pois, por definição,

(Segundo um hábito corrente em Estatística, omitiremos as indicações relativas aos índices nos somatórios, quando não houver perigo de confusão. Note-se que muitos autores usam a letra S em vez de L como símbolo de somatório). N a prática, procede-se do seguinte modo para a determinação dos Oik e do X2 • Começa-se por deduzir da't ábua inicial uma segunda tábua com os valores de independência nos lugares dos valores observados. Em seguida, constroi-se a tabela das discrepâncias por simples subtracção entre os valores da primeira e os correspondentes da segunda. Finalmente, calcula-se o X2 segundo a definição deste índice. No cálculo dos valores de independência convém, ainda, observar certos preceitos práticos. Visto que se tem


359

pode-se começar por calcular, por exemplo, a frequência relativa de cada ~ e multiplicá-la, depois, pelas frequências absolutas de todos os <X (ou vice-versa); sem esquecer que a soma das frequências relativas de todos os ~ ou de todos os <X é 1, isto é: fr(<x 1) + fr(<x 2) + ... + fr(<xp) = 1, fr(~l)

+ fr(~2) + ... + fr(~q) = 1;

portanto, uma vez calculadas todas as frequências relativas menos uma, a restante obtém-se por subtracção da unidade. Daremos exemplos de cálculo do X2 no n.O 16, em que abordaremos o estudo interpretativo deste índice. 15. Associações parciais de atributos. Independência de atributos no caso em que o seu número é superior a dois

Suponhamos agora, mais geralmente, que no universo U são dadas várias partições em atributos. Podemos limitar-nos ao caso em que as partições são dicotómicas. Consideremos, pois, as partições determinadas em U por vários atributos <X, ~,

y, 8, ...

e pelos seus contrários (em número finito). Além da frequência condicional de <X a respeito de ~, podemos, agora, considerar: 1) - A frequência condicional de y a respeito de <X e ~':

2) - A frequência condicional de 8 a respeito de <x, ~ e y:

fr(81<x~y) = (<x~y8) = fr(<x~y8) ; ( <x~y)

etc., etc.

fr ( <x~y)


360

Destas definições resulta, desde logo, que se tem, em geral, a fórmula do produto: (15.1)

fr(a~r8 ... ) =fr(a) fr(~la) fr(rla~) fr(8Ia~r) .. ·,

fórmula esta que continua a ser válida permutando entre si, de todos os modos possíveis, as letras a, ~, r, 8, ... Os atributos ~, r dizem-se parcialmente independentes a respeito de a, se fr(]a~) = fr(rla)

isto é, se (a~r)

_ (ar)

(a~) - (a) ,

ou, ainda, o que é equivalente, se:

(a~r) = (a~) (ar) . (a)

Caso contrário, os atributos ~, r dir-se-ão parcialmente associados a respeito de a - positivamente ou negativamente, conforme for(l) (aAr.) > (a~) (ar) . P

<

(a)

O caso da independência parcial também se pode conceber como associação parcial nula. Analogamente, se define associação parcial de 3 ou mais atributos a respeito de um ou mais atributos.

(1) -

o conceito de associação parcial a respeito de a corresponde, assim, a substituir o universo inicial U pelo universo dos ai' isto é, pelo conjunto dos indivíduos com o atributo a.


361

Note-se que, para 3 atributos a, ~, y, se têm ao todo 3 associações totais (de a com ~, de a com y e de ~ com y) e 6 associações parciais (de a com ~ a respeito de y, de a com ya respeito de ~,etc.). Os atributos a, ~, y, ô, ... , dizem-se independentes em U, se são nulas todas as possíveis associações (totais e parciais) entre estes atributos e seus contrários. Da fórmula (15.1) deduz-se a seguinte generalização do TEOREMA DO PRODUTO. Se os atributos a, pendentes, tem-se fr(a~y

(15.2)

... ) = fr(a)

fr(~)

~,

y, ... , são inde-

fr(y) ...

Todavia, pode reconhecer-se com exemplos que a recíproca não é, agora, verdadeira. Também importa salientar que o facto de os atributos serem independentes dois a dois não implica a fórmula (15.2), ao contrário do que poderia pensar-se à primeira vista. ,E, porém, verdadeiro o seguinte teorema, que contém o anterior como caso particular: TEOREMA. Para que os atributos a, ~, y, ... sejam independentes, é necessário e suficiente que sejam válidas, não só a fórmula fr(a~y

... ) = fr(a)

fr(~)

fr(y) ...

como todas as que se deduzem desta, substituindo um ou mais dos atributos a, ~, y, ... , pelos seus contrários. A condição é, evidentemente, necessária: se os atributos dados são independentes, a frequência condicional de cada atributo (ou do seu contrário) a respeito de um ou mais dos restantes atributos (ou dos seus contrários) é igual à frequência relativa do primeiro no universo. Então, a fórmula (15.1) simplifica-se tomando o aspecto (15.2), pois que fr(~la)

= fr(~),

fr(yla~)

= fr(~a) =fr(y), etc.;


362

e o mesmo se pode dizer da fórmula que se deduz de (15.1), substituindo um ou mais dos atributos pelos seus contrários. Demonstremos agora que a condição é suficiente. Limitar-nos-emos ao caso de 3 atributos a, ~, y, pois que, no caso geral, a demonstração é análoga. Por se ter

será fr(a~) = fr(a~y)

+ fr(aWY).

Então, se forem verdadeiras as igualdades fr(a~y) =

fr(a).

fr(~).

fr(y),

fr(a~y) =

fr(a).

fr(~).

fr(y),

virá fr(a~)

= fr(a). fr(~). fr(y) + fr(a). fr(~). fr(y) =fr(a). fr(~),

donde

fr(al~) = fr(a~) =fr(~), fr(a)

fr(yl a~)

= fr(a~y) = fr(y) , fr(a~)

e, analogamente, para os restantes casos. Para complementos e exemplos sobre este ponto, veja-se a citada obra de YULE e KENDALL. Note-se, ainda, que todas as considerações deste número e dos dois precedentes se estendem, mutatis mutandis, ao caso dos acontecimentos.


363

16. Interpretação duma tábua de contingência. Testes de significância Vamos, agora, abordar o problema da interpretação duma tábua de contingência, aproximando-nos do conceito de probabilidade. Como primeiro exemplo, consideremos o seguinte, extraído da obra de FINNEY citada na advertência prévia: Trata-se duma experiência hipotética relativa à protecção de animais contra determinada doença. Supõe-se que o experimentador dispõe de 300 animais, e que decide submeter 100 destes a um certo tratamento, reservando os outros 200 para controle. Supõe-se, além disso, que são os seguintes os resultados obtidos: TABELAN.O7

Sobreviventes

Mortos

Total

Mortos %

Não tratados Tratados

152 88

48 12

200 100

24 12

Total

240

60

300

20

É claro que se pretende averiguar em que medida estes resultados autorizam a admitir uma real influência do tratamento na doença. Para isso, começa-se por adoptar uma atitude psicológica, que faz lembrar o método de demonstração por redução ao absurdo usado em Matemática, e que consiste em admitir precisamente o contrário do que se pretende estabelecer: suponhamos que o tratamento não influi na doença nem num sentido nem noutro. Nisto consiste a chamada hipótese nula. Admitida esta hipótese, seria natural esperar que os resultados obtidos fossem aqueles a que, no n.o 13, chamámos valores de independência e que constam da seguinte tabela:


364 TABELAN? 8

Sobreviventes

Mortos

Total

Mortos %

Não tratados Tratados

160 80

40 20

200 100

20 20

Total

240

60

300

20

Observe-se como foi construída esta tabela: De acordo com as instruções práticas do n.o 14, calculou-se a frequência relativa dos mortos, ou seja,

60 -=02=20%' 300' , multiplicou-se depois, este resultado, pelos totais de animais não tratados e de animais tratados, obtendo-se

0,2 x 200 = 40, 0,2 x 100 = 20. As frequências dos sobreviventes entre animais não tratados e animais tratados são, respectivamente,

160 = 200 - 40, 80 = 100 - 20. Posto isto, subtraindo os valores da tabela n.O 8 (valores de independência ou valores esperados de acordo com a hipótese nula) dos valores correspondentes da tabela n.o 7 (valores observados), obtém-se a tabela das discrepâncias. TABELAN.O 9

Não tratados Tratados Total

Sobreviventes

Mortos

Total

-8 +8

+8 -8

O O

O

O

O


365

Verificam-se, é claro, as relações algébricas entre os Õi k indicadas no n.o 14 (o número de graus de liberdade é aqui igual aI). Mas pergunta-se agora: Estão estes resultados em contradição com a hipótese nula? A resposta exige reflexão. E" claro que o facto de o tratamento não influir na doença não obriga, de nenhum modo, a uma rígida confirmação dos valores de independência: pode haver discrepâncias não nulas devidas ao acaso; só se as discrepâncias excederem um "certo limite" haverá motivo para refutar a hipótese nula. Tudo está, portanto, em avaliar esse limite para além do qual a hipótese nula é insustentável. Note-se que uma questão análoga se nos apresenta, quando se lança ao ar uma moeda, várias vezes seguidas, e se regista de cada vez o lado que fica para cima: coroa ou face. Se a moeda estiver bem balançada (isto é, se os dois lados forem sensivelmente iguais do ponto de vista da gravidade) é de esperar que, por exemplo, em 100 lançamentos sucessivos, se apresente coroa 50 vezes, isto é, que seja 1/2 a frequência relativa deste acontecimento. Mas é bem possível (e até mais provável) que, nos 100 lançamentos, se apresente coroa mais ou menos de 50 vezes: simplesmente, a frequência absoluta do acontecimento será tanto menos de esperar (tanto menos provável), quanto mais se afastar do valor esperado, isto é, quanto maior for a discrepância. Este exemplo sugere o seguinte procedimento para averiguar em que medida as discrepâncias observadas no caso em estudo são atribuíveis ao acaso: Tomem-se 300 bocados de cartão, sensivelmente iguais em substância, forma e dimensões, e distingam-se 100 desses cartões com a cor vermelha (representativos dos 100 animais tratados) e os 200 restantes com a cor branca (representativos dos animais não tratados). Execute-se, depois, um grande número de vezes seguidas, a prova CZP que consiste nas seguintes operações: 1.0 - Fechar todos os cartões numa mesma caixa. 2. ° - Agitar esta várias vezes. 3.° - Tirar da caixa ao acaso 60 cartões (representativos dos animais mortos).


366

4.° - Registar o número de cartões vermelhos existentes nessa amostra de 60 cartões.

É claro que a repetição (jp implica a reposição dos cartões retirados na prova anterior. A cada realização da prova corresponderá, assim, uma tábua de contingência de valores observados e, portanto, uma outra de discrepâncias. O que está agora naturalmente indicado é verificar a frequência relativa com que se registam discrepâncias iguais ou superiores em valor absoluto às da tabela n. o 9, isto é, iguais ou superiores a 8 (em valor absoluto). Ora, quem tiver a paciência de efectuar um número muito grande de tais provas (pelo menos 1.000), verificará que só em cerca de 2 por cento das provas se apresentam discrepâncias iguais ou superiores a 8, em valor absoluto. A raridade de tais discrepâncias, embora não autorize, em absoluto, a rejeitar a hipótese nula, torna já bastante plausível a hipótese da eficácia do tratamento. Convém, desde já, registar este facto: a frequência relativa com que, numa série de realizações da prova (jp, se apresentam discrepâncias cujo valor absoluto é igualou superior a um dado limite L, tende a estabilizar-se num valor determinado, à medida que o número de realizações aumenta. Ao tratar do conceito de probabilidade, veremos, mais precisamente, em que consiste essa estabilização. Entretanto, podemos já dizer que o referido valor se chama probabilidade duma discrepância igualou superior a L (em valor absoluto)Cl). Ora, como teremos ocasião de ver, tal valor pode ser calculado por dedução puramente matemática, que dispensa as longas e fastidiosas séries de provas com cartões a que fizemos referência. Por este simples exemplo se pode já fazer uma ideia da utilidade e do alcance do Cálculo das probabilidades. O critério de interpretação atrás descrito pertence à categoria dos chamados testes de significância. Para averiguar se dado tratamento é eficaz, começa-se por formular a hipótese nula, que consiste em (1) - Nesta antecipação, que nos parece útil do ponto de vista didáctico (fazendo preceder a

teoria de exemplos concretos) seguimos a orientação da citada obra de FINNEY.


367

supor o contrário, isto é, que o tratamento não tem efeito nenhum. Da tabela dos valores observados, deduz-se, então, a dos valores esperados (de acordo com a hipótese nula) e, em seguida, a das discrepâncias. Posto isto, investiga-se a frequência relativa com a qual, sendo válida a hipótese nula, se apresentariam discrepâncias tão grandes ou maiores (em valor absoluto) do que os desvios observados. Tal investigação poderia ser feita directamente, pelo processo empírico, laborioso, de amostragem casual de cartões, segundo o esquema atrás descrito; mas a Matemática permite evitar esse trabalho, por meio do Cálculo das probabilidades. Se a frequência relativa (ou melhor, a probabilidade) de tais desvios for muito pequena, então, sim, haverá razão para rejeitar a hipótese nula, admitindo como real a influência do tratamento. Os desvios observados dizem-se, então, estatisticamente significantes ou apenas significantes. De contrário, continuará de pé a hipótese nula, enquanto novas experiências não vierem enriquecer o material de dados, para que o investigador se possa pronunciar num ou noutro sentido. Mas o que se entende aqui por frequência relativa "muito pequena" e por frequência relativa "não muito pequena"? Haverá, necessariamente, uma extensa margem de subjectividade no emprego destes termos. O critério a adoptar no seu uso depende não só da experiência realizada, como, ainda, da intuição do experimentador, que neste campo dispõe de ampla liberdade. Em investigações agronómicas é usual considerar já como "muito pequena", em casos tais, a frequência relativa de 1 por 20 (0,05), embora, por vezes, se prefira considerar como "muito pequena" a frequência de 1 por 100 (0,01), sem esquecer que se trata aqui das frequências respeitantes a um grande número de provas (ou melhor, de probabilidades). Para distinguir aqueles dois graus de significância (ou níveis de significância, como usa dizer-se nestes casos), convenciona-se chamar ao primeiro, "significante" (sem qualquer restritivo) e ao segundo, "altamente significante". Convém salientar que se trata aqui apenas duma convenção de linguagem, reconhecida como apropriada por estatísticos e experimentadores. De resto, não são estes os únicos níveis de significância empregados: casos há em que uma probabilidade de 1 por 10 é já considerada signifi-


368

cante (especialmente em investigações médicas, em que o tratamento consista numa ligeira alteração de regime, pouco dispendiosa e sem risco para o doente); e casos há, pelo contrário, em que se requer um nível de 1 por 1.000 (quando se trate de alterações de regime que sejam profundas e dispendiosas). Em síntese, podemos dizer que a aplicação dum teste de significância comporta os seguintes passos: 1) - Formular a hipótese nula, contraditória do facto experimental a estabelecer. 2) - Escolher o nível de probabilidade que pareça mais adequado à natureza da experiência e ao tipo de decisão a tomar. 3) - Empregando o cálculo das probabilidades ou efectuando uma longa série de provas com cartões no género das que foram descritas, avaliar a probabilidade de que, sendo válida a hipótese nula, as discrepâncias casuais sejam pelo menos tão grandes (em módulo) como aquelas observadas na experiência. 4) - Se a probabilidade obtida em 3) é inferior à probabilidade escolhida em 2), rejeitar a hipótese nula; de contrário, deixar suspensa a conclusão. É, agora, o momento de mostrar o partido que se pode tirar da função X2 dos desvios, como teste de significância aplicado a uma experiência, cujos resultados estejam inscritos numa tábua de contingência. Mostra a análise matemática o seguinte: a probabilidade de que, sendo válida a hipótese nula, o valor de X2 exceda um dado limite, pode, sob certas restrições, ser calculada com suficiente aproximação, sem fazer intervir os números de indivíduos observados, mas, unicamente, o número n de graus de liberdade da tábua em questão. Deste modo, será possível calcular, uma vez por todas, para cada valor de n, as probabilidades correspondentes a diversos valores de X2 e registar os resultados numa tábua de duas entradas, que pode ser usada pelo investigador, com enorme economia de esforço e de tempo(1). (1) - Só ao tratar das distribuições de variáveis contínuas, podemos referir-nos aos funda-

mentos teóricos deste método.


369

Assim, por exemplo, para n = 2, sendo válida a hipótese nula, está calculado que se tem:

x > 0,5 em cerca de 50 % dos casos, 2

°

X2 > 2,7 em cerca de 1 % dos casos, X2 > 3,8 em cerca de 5 % dos casos, X2 > 6,6 em cerca de 1% dos casos, X2 > 10,8 em cerca de 1% dos casos. Por outras palavras, a probabilidade de se ter X2 > 0,5 é aproximadamente igual a 0,5, o que também se exprime escrevendo Pr(x2 > 0,5) = 0,5 e, analogamente: Pr(x2 > 2,7) = 0,1; Pr(x2 > 3,8) = 0,05, etc. Estes resultados podem ser confirmados, experimentalmente pelo processo das provas repetidas atrás descrito, calculando o valor de X2 correspondente aos resultados de cada prova e determinando, no final, a frequência relativa dos valores > 0,5, a dos valores > 2,7, etc. Ora, tornando ao exemplo das tabelas nOs 7, 8 e 9, verifica-se " que e: 2

X=

(-8)2 160

82

82

(-8)2

40

80

20

+-+-+

=600. '

Segundo a doutrina exposta, a probabilidade de que seja X2 > 6,6 deve ser um pouco superior a 1% (mais precisamente 0,0143), o que concorda com a frequência de cerca de 2% que se obteria numa longa série de provas com cartões. Mas é preciso notar que o uso do X2 e dos respectivos níveis de probabilidade envolve aproximações que só são aceitáveis quando os números de indivíduos são grandes. Uma regra prática que costuma ser recomendada é a de que nenhum dos valores esperados (ver tabela n? 8) deve ser inferior a 5. Contudo, a aproximação pode ser melhorada consideravelmente, em qualquer caso, por um simples artifício, que consiste em diminuir 0,5 ao módulo de cada discrepância, antes de calcular o X2 (correcção de YATES). Assim, no caso em estudo, viria


370

2= (- 7,5)2 + (7,5)2 + (7,5)2 + (-7,5)2 = 5 27. X 160 40 80 20 '

o valor da Pr(x

> 5,27), no caso ideal a que se refere a teoria matemática, é 0,0217, em vez de 0,0143 - bastante mais próximo do verdadeiro valor que é, no caso considerado, 0,0210 (a menos de 0,0001). Da mesma obra extraímos um segundo exemplo, relativo a uma tábua de contingência com 3 graus de liberdade. Trata-se de colheitas de cevada em 260 campos, feitas em 1942. No inverno e primavera precedentes, tinha-se avaliado em cada campo a população da larva dum coleóptero, comum em Inglaterra, com o nome de "wireworm" (alfinete). Segundo determinado critério, classificou-se a infestação dos diferentes campos em "baixa", "moderada", "alta" e "muito alta". Por sua vez, o resultado das colheitas foi classificado em "satisfatório" e "não satisfatório". Os resultados são os que constam da seguinte tabela: 2

TABELAN~

10

Infestação

Resultados das colheitas

Total

Baixa

Moderada

Alta

Muito alta

Satisfatórios Não satisfatórios

94 15

62 15

31 17

15 11

202 58

Total

109

77

48

26

260

Daqui se deduziu uma tabela de valores de independência e uma outra de discrepâncias (tabelas que não reproduzimos), achando-se o seguinte valor: 2 (9,3)2

x=

+

84,7

+

(2,2)2 59,9

+

(-6,3)2 37,3

+

(-5,2)2 20,2

+

(-9,3)2 (-2,2)2 (6,3)2 (5,2)2 157 + + + =,. 24,3 17,2 10,7 5,8


371

A tabela n? 11, em que são indicados alguns níveis de significância para X2 , mostra-nos que o valor 15,7 calculado é sensivelmente superior ao valor 11,3, que, para 3 graus de liberdade, marca o nível "altamente significante". Há, pois, razão suficiente para excluir a hipótese nula. TABELA N.o 11 Graus de liberdade 1 2 3 4 6 8 10 15 20 25 30

Frequências relativas 0,1

.. ................. ... ..

.... .. ..... ............. .. ..... ............ .....

.... ....... ............. .. ...................... ................... .....

.... .. .................. ........................ ............ ........... .

..... .... ... ............ ........................

2,7 4,6 6,3 7,8 10,6 13,4 16,0 22,3 28,4 34,4 40,3

Limites 0,05

(Probabilidades) 0,01

3,8 6,0 7,8 9,5 12,6 15,5 18,3 25,0 31,4 37,7 43,8

6,6 9,2 11,3 13,3 16,8 20,1 23 ,2 30,6 37,6 44,3 50,9

Convem notar que: 1) Dum modo geral, o teste do X2, como foi descrito, não deve

aplicar-se quando algum dos valores esperados for demasiado pequeno, exigindo-se, nesse caso, uma análise estatística especial. 2) A correcção de Yates é somente aplicável nas tábuas de 2 x 2 (com 1 grau de liberdade).

Há, ainda, certos pormenores, relativos à realização da experiência, que precisam de ser observados, para que o teste de significância não resulte ilusório. Tornando ao primeiro exemplo citado neste número, é óbvio, que, se os animais tratados tiverem uma proveniência diferente da dos animais não tratados, as diferenças registadas podem muito bem não ser devidas ao tratamento. Para atenuar o mais possível os factores estranhos ao tratamento, o que há a fazer é destacar os 300 animais duma população tão homogénea quanto


372

possível, e, entre esses, escolher, completamente ao acaso, os 100 animais a serem tratados, dando a todos os 300 igual probabilidade de serem escolhidos. Esta operação, chamada casualização, tem de ser efectuada estritamente por um processo objectivo, em que não intervenha qualquer factor pessoal na escolha. Um tal processo pode consistir no seguinte: numerar os animais de 1 a 300, deitar numa caixa 300 cartões iguais, numerados de 1 a 300, e tirar 100 à sorte; os números saídos serão os dos animais a tratar. Nunca é demais encarecer a importância da casualização, nestes e noutros tipos de experiência, como base duma investigação estatística bem orientada. Não podemos, contudo, indicar aqui os pormenores da técnica, a que por vezes tem de obedecer uma tal operação. Note-se que o papel do estatístico não se limita à interpretação dos resultados experimentais: ele pode contribuir, com grande vantagem, para o planeamento da experiência. Não pertence ao âmbito do nosso curso o estudo deste assunto de alto interesse. Limitar-nos-emos, por isso, a breves indicações sobre a natureza da questão, no caso particular do tratamento hipotético atrás considerado. Suponhamos, por exemplo, que se tinham escolhido, apenas, 2 ou 3 animais para serem tratados, reservando os restantes para controle (ou vice-versa); é manifesto, mesmo a priori, que os resultados não autorizariam um juízo seguro. Deve, portanto, haver uma proporção óptima para revelar a eficácia do tratamento, caso este tenha, de facto, efeito. Porém, essa proporção não é, como poderia parecer à primeira vista, a de 50% para os dois grupos. Na Tabela n? 12, estão indicados os valores do X2 para diferentes proporções de animais tratados, entre os 300, na hipótese de a percentagem de mortos entre animais tratados ser em todos os casos a mesma que se observa na Tabela n? 7 (12%). Vê-se que o máximo valor do X2 é atingido na proporção de 175 animais tratados para 125 não tratados. Será, portanto, essa proporção ideal para a experiência. E claro que, quanto maior for o número total de casos individuais estudados, melhor informação fornecem os resultados obtidos; mas esse número é forçosamente limitado por razões de ordem económica, e, por isso, mais necessário se toma tirar o maior rendimento possível do material de que se dispõe. /


373

TABELA N° 12 N~

de animais tratados

X2 para 12% de mortalidade

25 50 100 125 150 175 200 250 275

1,2 2,8 5,3 6,1 6,5 6,6 6,3 4,0 2,0

Muito mais haveria a dizer sobre testes de significância, mas, embora o assunto seja de grande interesse para agrónomos, não pode ser desenvolvido nesta cadeira. E, se nos alongámos um pouco a respeito do teste do X2 , foi sobretudo para dar uma ideia de como o Cálculo das Probabilidades pode intervir nas aplicações de carácter '" . agronOIll1Co. B - Probabilidades

1. Lógica indutiva

Suponhamos que, em n realizações, duma mesma prova çp, um dado acontecimento a se realizou n vezes: então, a frequência relativa do acontecimento a, na referida série de provas, será f =n/ n =1. Como já tivemos ocasião de observar, este facto não habilita a concluir que a seja um acontecimento certo. No entanto, se o "número n de provas realizadas for muito grande, é-se levado a admitir que o acontecimento é praticamente certo, embora não se possa concluir que seja certo (em absoluto). Nisto consiste, esquematicamente, a indução ou raciocínio indutivo, que se encontra na base de toda a ciência experimental. E'" bem sabido que as leis físicas ou, melhor, as leis da Natureza, têm carácter contingente: não se pode garantir que sejam absolutamente infalíveis. Seja, por exemplo, a seguinte experiência: aproximar uma chama dum frasco, com a boca para baixo, no qual se tenha introduzido


374

uma mistura de hidrogénio e oxigénio, em proporções convenientes. " E, então, praticamente certo que se verifica o fenómeno "explosão". Trata-se, aqui, duma lei química qualitativa, de cuja contingência nos apercebemos, sobretudo, se não tiverem sido definidas, com certa precisão, as condições em que a experiência deve ser realizada. Muitos outros exemplos poderíamos citar, de leis qualitativas, com o mesmo carácter contingente. As leis quantitativas correspondem a um grau mais elevado de conhecimento, a uma fase mais avançada da ciência: mas nelas subsiste o carácter de contingência. Primeiro que tudo, devemos lembrar-nos de que as medidas das grandezas físicas nunca podem ser exactas (não faz, mesmo, sentido falar de medida exacta duma grandeza empírica - seja comprimento, seja velocidade, seja carga eléctrica, seja um pR, seja qualquer outra). Já daqui resulta uma certa margem de incerteza, isto é, de contingência. Consideremos, por exemplo, esta experiência: aquecer um pedaço de chumbo a uma temperatura de cerca de 335 graus centígrados, em condições normais. E" praticamente certo que se verifica o fenómeno fusão. Mas no próprio carácter aproximativo da temperatura indicada, bem como no significado da expressão "condições normais", há uma origem de incerteza, que pode ser reduzida (indicando, por exemplo, uma vizinhança de 335 na qual se prevê o acontecimento), mas nunca eliminada. Recordemos, ainda, leis físicas, de nível mais elevado: a lei da gravitação, as leis da termodinâmica, as leis do electro-magnetismo, etc. Como é sabido, nenhuma destas leis se adapta exactamente à realidade: assentam todas em hipóteses simplificadoras, que só aproximadamente se podem realizar. Essas leis são, pois, apenas esquematizações duma realidade que é sempre demasiado complexa, demasiado mutável, para se deixar traduzir fielmente na simplicidade dos nossos símbolos. Assim, a lei dos gases perfeitos deve o seu nome ao facto de se ter convencionado chamar "gases perfeitos" aos gases que a seguem rigorosamente, o que imprime a essa lei um certo carácter de definição ou de postulado. A verdade, porém, é que não há gases perfeitos: há, apenas, gases que se aproximam, mais ou menos, dessa forma


375

ideal. Uma lei que substitui aquela, dando uma melhor aproximação da realidade, é a de Van der Waals; mas nem mesmo essa poderá ser exacta. Porque é lei metafísica das leis físicas, o serem contingentes. O método experimental, e com ele o método matemático, tem-se estendido progressivamente, do âmbito restrito das ciências físico-químicas, ao das ciências biológicas, ao das ciências sociais, etc. Nestes novos domínios, mais acentuado se torna o carácter contingente das leis naturais. No entanto, algumas se apresentam com visos de certeza inabalável, como aquela que tem servido de premissa a um exemplo clássico de silogismo: "Todos os homens são mortais" . Há aqui, de certo modo, uma lei biológica qualitativa. Mas se tentarmos precisá-la quantitativamente, afirmando, por exemplo: "Todos os homens morrem antes dos 300 anos de idade" , já não sentiremos o mesmo grau de segurança. Conhecemos nós, suficientemente, o passado da espécie humana? E que sabemos nós sobre o futuro? O que pode dizer-se é que, nas condições actuais, é extremamente improvável, praticamente impossível que um ser humano atinja a idade de 300 anos. Um outro exemplo análogo é o que se refere a alturas: é praticamente impossível que um ser humano cresça até atingir a altura de 4 metros. Se formos baixando estes limites, o grau de incerteza aumentará - e entraremos, abertamente, no campo das probabilidades. E de salientar que o Cálculo das Probabilidades e a Estatística se têm desenvolvido principalmente no sector das ciências biológicas e das ciências sociais. Mas certo é, também, que, por um movimento de retrocesso, acabaram por invadir o campo das ciências físicas, principalmente no que se refere ao estudo do átomo. A física moderna tem carácter probabilista. /


376

NOTA. Uma fonte primária de contingência está na impossibilidade que há em definir exactamente os conceitos relativos ao mundo empírico, - em delimitar com precisão os atributos dos entes naturais. Esta impossibilidade tem sido origem constante de especulações filosóficas através dos séculos. Platão resolvia a dificuldade, distinguindo duas formas de existência: a realidade sensível ou mundo dos fenómenos, que conhecemos por meio dos sentidos, e a realidade inteligível ou mundo das Ideias, que conhecemos por meio da razão e da qual a primeira é, apenas, imitação grosseira. Recorde-se, ainda, a querela que, na Idade Média, dividiu os filósofos em realistas e nominalistas, os primeiros proclamando a realidade dos universais (isto é, das classes, dos entes abstractos) e a sua supremacia sobre o contingente e o transitório; os segundos afirmando que os conceitos abstractos são, apenas, nomes, ficções cómodas, e que só os indivíduos existem. No fundo, trata-se de duas tendências complementares, inerentes ao nosso espírito, com predomínio duma ou doutra conforme as pessoas e as situações. Assim, o matemático assume geralmente a atitude platónica (realista), reportando ao mundo dos seres ideais, de maneira mais ou menos consciente, os conceitos abstractos que são objecto do seu pensamento. Por sua vez, o experimentador tende para a atitude nominalista (ou empirista). Do equilíbrio das duas tendências, segundo o bom-senso, é que pode resultar o êxito da actividade intelectual: toda a teoria deve ser controlada pela experiência, assim como a prática deve sempre ser guiada pela teoria. 2. Lógica dedutiva

Ao raciocínio indutivo das ciências experimentais contrapõe a " Matemática o raciocínio dedutivo. A contingência física das leis físicas opõe-se a certeza matemática das deduções matemáticas. Considerem-se, por exemplo, os seguintes teoremas: "O quadrado dum número ímpar é sempre um número ímpar" . "Toda a equação de coeficientes complexos admite pelo menos uma solução no campo complexo" . "Toda a série de potências de x é derivável, termo a termo (em ordem a x), no seu intervalo de convergência".


377

Encontramos aqui um carácter de certeza e precisão que contrasta vivamente com a natureza dúbia e aproximativa das leis naturais. Contudo, já se nota diferença, quando se passa da matemática pura para as matemáticas aplicadas. A própria Geometria é, sob certo aspecto, um ramo da Física. Consideremos, por exemplo, o bem conhecido teorema da geometria euclideana: "A soma dos ângulos dum triângulo (plano) é sempre igual a um ângulo raso" . Dois métodos diferentes se podem seguir para estabelecer a veracidade desta proposição:

I? - Método indutivo ou experimental - Medem-se os ângulos internos de vários triângulos e verifica-se que a soma dos ângulos de cada triângulo se aproxima bastante de 180°, tanto mais quanto mais perfeito for o traçado dos triângulos e mais precisa for a medi, ção. E este o método seguido na primeira fase do ensino da Matemática no liceu. 2? - Método dedutivo ou racional - Demonstra-se a proposição, deduzindo-a logicamente de proposições mais simples, cuja veracidade se considera evidente. Estas proposições evidentes são os chamados axiomas ou postulados da geometria euclideana. No teorema em questão, o postulado que intervém de maneira essencial é precisamente o postulado de Euclides: "Dados um ponto e uma recta, existe sempre uma recta, e uma só, que passa pelo ponto dado e é paralela à recta dada". Mas o declarar evidentes os postulados é uma atitude cómoda, que exige reflexão. Têm eles, de facto, carácter de certeza absoluta? Um dos grandes progressos da história do pensamento, realizado no século passado, foi precisamente o de reconhecer que os postulados da geometria euclideana têm a natureza contingente e aproximativa das leis naturais. Nem leis se podem dizer, propriamente, mas sim hipóteses, cuja legitimidade se avalia indirectamente pelas suas consequências lógicas. Insinuam-se no nosso espírito, por um longo processo indutivo, dificilmente controlável, que se desenvolve na experiência quotidiana, no exercício constante da nossa actividade neuro-muscular. É esta uma forma de indução que se confunde com aquele processo directo de conhecimento a que se dá o nome de intuição.


378

Mas a nossa experiência quotidiana refere-se a uma região limitada do espaço. A teoria da relatividade veio mostrar, precisamente, que, nos espaços astronómicos, não é a geometria euclideana a que mais se aproxima da realidade: aí, a soma dos ângulos internos dum triângulo pode tomar-se sensivelmente superior a 180 0 • O que se disse a respeito do teorema citado aplica-se a qualquer outro. A contingência dos postulados transmite-se a todos os teoremas. O que é matematicamente certo não é o teorema, mas, sim, o facto de o teorema ser consequência lógica dos postulados. Entretanto registem-se as vantagens do método racional. Enquanto o método empírico exige um grande número de verificações fastidiosas, o método racional, com elegante simplicidade e perfeito rigor, reduz a veracidade do teorema à de proposições já reconhecidas como verdadeiras. Estas vantagens patenteiam-se, em particular, no Cálculo das Probabilidades. 3. Conceito natural de probabilidade As considerações precedentes mostram que os termos "verda~ deiro" e "falso", aplicados a proposições, se tornam insuficientes, quando, da realidade inteligível da Matemática, se passa à realidade sensível dos fenómenos. Os conceitos de "verdadeiro" e "falso" cedem, então, o lugar ao conceito de "probabilidade", correlativo do de "incerteza" ou "contingência": um facto dir-se-á tanto mais provável quanto menos contingente for. O conceito de probabilidade, como todos os conceitos relativos ao mundo empírico, não é susceptível de definição lógica: gera-se no nosso espírito por um processo indutivo. Mais até, faz parte intrínseca do próprio mecanismo da indução. É o que vamos ver, tentando esclarecer este conceito. Seja a um dos acontecimentos a prever numa certa experiência CJP e suponhamos que esta experiência foi efectuada em várias séries de provas, todas em grande número: Série 1 - CJP 1, l' CJP 1,2' Série 2 - CJP 2,1' CJP 2,2' Série m - CJP m,1 ' CJP m,2'

provas) (n 2 provas)

••••••••• ,

CJP l ' nl (n l

••••••••• ,

CJP 2 'n2

••••••••• ,

CJP m' nm (n m

provas).


379

Se forem, respectivamente, v l' v 2 ' ... , V m as frequências absolutas do acontecimento a nestas séries de provas, serão , ...,

as correspondentes frequências relativas. Suponhamos, ainda, que se verificou uma sensível concordância entre estas frequências, isto é, que todas se localizaram num pequeno intervalo ] f o- E, f o+ E [ :

f o-

E

<

v. < f o+ E, n.

_I

para i

= 1, 2, ... , m.

1

Aplicando o raciocínio indutivo, exactamente como se faz ao estabelecer as leis naturais, seremos levados a admitir, como praticamente certo, que: Em toda a série formada por muitas realizações de CZP (em número não inferior ao maior dos números n 1 , n2 , ••• , nm ) afrequência relativa de aficará situada entre fo- E e fo + E. E, então, natural dizer que f o é um valor aproximado da probabilidade de a, com erro inferior a E (ou a menos de E). Por exemplo, se em tais séries de provas se registou sempre uma frequência relativa de a entre 7% e 11 % (ou seja, entre 0,09-0,02 e 0,09 + 0,02), dir-se-á que 0,09 é um valor aproximado, a menos de 0,02, da probabilidade de a. Suponhamos, agora, que se efectuaram novas séries de realizações de CZP, em números bastante maiores que os anteriores, e que passou a registar-se uma frequência relativa de a, entre /

dir-se-á, então, que fi é valor aproximado da probabilidade de a, a menos de E/10. Analogamente, poderíamos imaginar valores f 2 , f 3 , ••• , aproximados da probabilidade de a a menos de E/I 02 , de E/I 03 , etc. A probabilidade aparece-nos, assim, como grandeza que se mede, tal como se fosse uma grandeza física (uma velocidade, um ponto


380

de fusão, uma densidade, etc.), com o carácter contingente e aproximativo que revestem todas as medições empíricas. Já as expressões "grandes números", "números bastante maiores" , atrás usadas, envolvem a aplicação de critérios subjectivos, humanos, a que falta rigor matemático, mas que são inevitáveis. Tal como sucede com as grandezas físicas, é-se levado a idealizar, para cada acontecimento a (em certos tipos de experiências), um valor exacto, p, da probabilidade de a, que seria, por assim dizer, o limite da sucessão dos valores aproximados f o' fI' f 2' ••• Mas é claro que um tal valor exacto não existe nos casos concretos - assim como não existe o valor exacto duma grandeza física: trata-se apenas de convenções cómodas, que o nosso espírito transporta para o mundo platónico dos entes ideais, para sobre as mesmas poder construir uma teoria racional - uma teoria matemática (1). Note-se, ainda, que a unidade adoptada para medir a probabilidade do acontecimento a é a probabilidade do acontecimento certo - isto é, a certeza (2). Por sua vez, ao acontecimento impossível é atribuída a probabilidade O. Deste modo, a probabilidade p de a deverá ser um número tal que

o<p< 1. Se p for aproximadamente igual a 1, dir-se-á que a é praticamente certo. Se p for aproximadamente igual a O, dir-se-á que a é praticamente impossível. Mas o grau de aproximação a partir do qual se dirá uma ou outra coisa é questão manifestamente subjectiva. Registe-se, entretanto, que, para um acontecimento ser considerado praticamente certo, não é necessário que se realize em todas as provas que tenham sido efectuadas: admite-se a possibilidade de excepções, contanto que estas sejam extremamente raras. E, analogamente, no caso oposto. (l)-Esta concepção da probabilidade como constante física dos acontecimentos é devida ao matemático francês MAURICE FRÉCHET. (2)-Recorde-se que, na medida dos arcos, se pode tomar unidade a circunferência. Uma das maneiras sugestivas de indicar graficamente as probabilidades (ou as frequências relativas) de vários acontecimentos incompatíveis, consiste em representá-los por meio de sectores dum círculo, de amplitudes proporcionais a essas probabilidades (ou frequências).


381

o termo

"probabilidade", tal como acabamos de o precisar, é usado na prática com maior ou menor propriedade. Recordemos o exemplo das tábuas de mortalidade, sobre as quais os actuários das companhias de seguros baseiam o cálculo dos prémios a pagar em seguros de vida. Essas tábuas são, no fundo, estatísticas, isto é, tabelas de frequência, relativas a populações numerosas. Assim, por exemplo, a tábua de mortalidade alemã para homens, correspondente ao decénio 1901-1910, indica que, entre 10.000 crianças com menos de 1 ano, 3.608 chegaram à idade de 65 anos. Deste modo, a probabilidade de que um recém-nascido venha a atingir os 65 anos será, aproximadamente: 3.608 ~ 36%. 10.000 Por sua vez, a mesma tábua mostra que, entre 10.000 crianças com menos de 1 ano, 7.065 chegam aos 20 anos. Daqui se deduz que a probabilidade de um rapaz de 20 anos chegar aos 65 anos é 3.608 ~ 51 % 7.065 ' maior que a precedente. A mesma tábua dá para crianças de menos de 1 ano, a probabilidade 0,68% de chegar aos 90 anos, a probabilidade 0,0038% de atingir os 100 anos, etc. Mas note-se que as tábuas de mortalidade têm de ser revistas de tempos a tempos e não devem ser as mesmas para todas as regiões, para todas as raças, para os dois sexos, etc. A probabilidade dum acontecimento pode, assim, estar sujeita a uma evolução irp-previsível no tempo e no espaço. E" este um facto que, pelo menos aparentemente, está em contradição com o conceito de probabilidade, tal como foi atrás explanado. O mesmo é dizer que as leis físicas evoluem de maneira imprevisível no tempo e no espaço - deixando, portanto, de ser leis. A explicação do facto está, ainda, no carácter contingente do raciocínio indutivo, que impõe sempre a seguinte norma prudencial ao experimentador: as induções


382

só merecem confiança em regiões limitadas do espaço e do tempo; não podem ser extrapoladas muito para além do domínio das experiências efectuadas. Portanto, só quando a evolução for lenta será lícito falar de probabilidades. Recordemos, ainda, o exemplo dos desastres de avião: é hoje menor ·do que há vinte anos a frequência relativa dos desastres de aviação em percursos iguais. Neste caso, embora seja mais rápida a evolução, ainda, de certo modo, é lícito falar de probabilidade no sentido atrás considerado (1). Casos há, porém, em que o emprego desta palavra escapa, de todo, a critérios quantitativos, que lhe confiram interesse científico. 4. Axiomatização do conceito de probabilidade

Viu-se no número anterior que, para fundar uma teoria matemática das probabilidades, se idealiza para cada acontecimento, em certos tipos de experiências, um valor exacto da sua probabilidade. Contudo, seja esse valor uma convenção ou uma realidade, o que interessa para o desenvolvimento lógico da teoria não é, propriamente, o conceito em si, mas, antes, o conjunto das suas propriedades formais que intervêm nos cálculos e nos raciocínios. O que há a fazer, então, é escolher, entre essas propriedades, algumas mais simples, das quais se possam deduzir logicamente todas as outras. As propriedades escolhidas dir-se-ão propriedades fundamentais ou axiomas e o seu conjunto terá o nome de axiomática. Já em Matemáticas Gerais foi estudada uma axiomática dos grupos contínuos de grandezas. Trata-se, agora, de estabelecer uma axiomática do conceito de probabilidade, no caso dos corpos finitos de acontecimentos, considerando aquele conceito como primitivo, isto é, não definível logicamente à custa de outros. Seja, pois, CZIt um corpo finito de eventualidades a considerar numa dada prova rzp, e suponhamos que a cada eventualidade ex E CZIt, corresponde uma determinada probabilidade, que designaremos pelo (1) - Nos seguros relativos a acidentes de aviação, as companhias americanas fazem hoje o

cálculo dos prémios como se houvesse morte de um passageiro em 20.000 viagens de ida e volta.


383

símbolo Pr(a). Tomaremos como fundamentais as propriedades seguintes (1): AXIOMA 1. A probabilidade de a é sempre um número real não negativo, isto é: Pr(a) > 0, qualquer que seja a E C!lt. AXIOMA 2. Se a e p são acontecimentos incompatíveis de C!lt, tem-se: Pr(a + P)

= Pr(a) + Pr(p).

(Convém aqui rever, cuidadosamente, as noções do n. o 2 e do n. o 3 relativas às álgebras de atributos e de acontecimentos). AXIOMA 3. A probabilidade do acontecimento certo é 1; isto é, tem-se: Pr(a)

= 1, se a

é certo.

Estas propriedades concordam com o conceito empírico de probabilidade, tal como foi atrás introduzido. Sendo as probabilidades, por assim dizer, limites de frequências relativas, é natural que se conservem as propriedades das frequências relativas que não mudam na passagem ao limite. Os axiomas 1 e 2 dizem-nos, simplesmente, que a função Pr(a) é uma distribuição definida no corpo C!lt. O axioma 3 acrescenta que essa distribuição é relativa. Diremos, então, que se trata duma distribuição de probabilidade definida em C!lt. Mas só nas aplicações concretas será'possível distinguir uma distribuição de probabilidade duma distribuição de frequência, pois que a anterior axiomática se limita a dar os caracteres duma distribuição abstracta. (1) - Vários autores consideram, ainda, como axioma a propriedade relativa àprobabilidade

do produto. Mas essa propriedade pode considerar-se como definição ou como consequência de definição de probabilidade condicional, como veremos.


384

Da anterior axiomática deduzem-se, desde logo, as seguintes consequências (que se estendem a qualquer distribuição): TEOREMA 1. Se a implica p, então Pr(a) < Pr(p). Com efeito, se a C p, tem-se p incompatíveis, vem, pelo axioma 2, Pr(p)

=a

+ ii P e, como a e ii p são

=Pr(a) + Pr(iiP)

donde se conclui, pelo axioma 1, que Pr(p) > Pr(a). COROLÁRIO. Qualquer que seja a E CZ/t, tem-se: Pr(a) < 1. Com efeito, todo o acontecimento a de CZ/t implica o acontecimento certo: isto é, em fórmula:

a C I, donde, pelo teorema 1 e pelo axioma 3: Pr(a) < 1. TEOREMA 2(1). Se ai' a 2 , ••• , a n são acontecimentos (de CZ/t) incompatíveis dois a dois, a probabilidade de que se realize um dos acontecimentos ai' a 2 , ••• , a n é a soma das probabilidades destes acontecimentos, isto é, tem-se: Pr(I a)

=I

Pr(a), se aja k =0 para i"# k.

Basta aplicar, repetidamente, o axioma 2, observando que é ai + Uz + ~ =(ai + Uz) +~, ai + Uz + ~ + a 4 =(ai + Uz +~) + a 4 , etc.,

(1) - Também conhecido por princípio das probabilidades totais.


385

e que, se aI' a 2 , ••• , a n são incompatíveis dois a dois, também a 3 é incompatível com aI + a 2 , a 4 com aI + a 2 + a 3 , etc. TEOREMA 3. Quaisquer que sejam a, p Em, tem-se Pr(a + P)

=Pr(a) + Pr(p) -

Pr(aP).

Basta notar que a + p = a ~ + ã P + ap e aplicar o teorema 2, notando que Pr(a) = Pr(a~) + Pr(a~), Pr(p) = Pr(ãp) + Pr(ap). O teorema pode generalizar-se ao caso de vários acontecimentos, obtendo-se a fórmula de DANIEL DA SILVA (cf. A-lO). TEOREMA 4. A probabilidade do acontecimento contrário de a é a diferença para I da probabilidade de a; isto é: Pr(ã) = I - Pr(a). Consequência imediata dos axiomas 2, 3 e da definição de contrário (a + ã =/, aã =0), conforme já se viu para as distribuições em geral. " COROLARIO. Se a é acontecimento impossível, tem-se

Pr(a) = O. Basta lembrar que o acontecimento impossível é contrário do acontecimento certo e aplicar o teorema 4 com o axioma 3. E" claro que, em virtude do teorema 2, uma distribuição de probabilidade num corpo finito mfica determinada, logo que se conheçam as probabilidades das células de m: a probabilidade dum acontecimento a E m será a soma das probabilidades dos acontecimentos celulares de que a é a soma. Tudo está, pois, em determinar as probabilidades das células. 5. Alguns exemplos de cálculo de probabilidades a priori

Por vezes, a distribuição de probabilidade num corpo finito pode ser determinada a priori (isto é, antes de qualquer experiência deliberada) por simples considerações ditadas pelo senso-comum.


386

Um dos exemplos clássicos, já atrás invocados, é o que se refere à extracção casual de bolas ou de cartões duma caixa. Consideremos o caso duma urna com N bolas, que designaremos por Xl' X 2 ' ••• , X N • Seja U o conjunto destas bolas e seja CZP a experiência que consiste em tirar ao acaso uma bola da uma. Os acontecimentos elementares que se podem verificar nesta experiência são: "sair a bola x/', "sair a bola x 2", ••• , "sair a bola x N " ; ou, em notação proposicional:

(Como se disse atrás, X é neste caso uma variável casual, que toma, em cada prova, um e um só dos valores Xl' X 2 ' ••• , xN ). Estes acontecimentos elementares geram um corpo de que são as células. Os acontecimentos que formam o corpo serão, além das células e do acontecimento impossível, todos aqueles que se exprimem como somas lógicas de células (1), por exemplo: (X

=Xl) + (X =x

2)

(sair Xl ou x 2 )

(X = Xl) + (X = x 3) + (X = x s) (sair Xl ou x 3 ou x s)' etc.

Entre estes está incluído o acontecimento certo: p

L (x =x) (sair uma das bolas xl'

X2 '···'

xN ).

i=l

E" claro, agora, que se conhecermos as probabilidades dos acontecimentos elementares, estamos aptos a conhecer a probabilidade de qualquer outro acontecimento do corpo, por simples aplicação do teorema 2. Designemos por PI' P2' ... , PN , respectivamente, as probabilidades de "sair Xl'" de "sair x 2", ••• , de "sair x N", isto é, ponhamos Pi = Pr (x = X), para i = 1, 2, ... , N.

(1) - É evidente que os acontecimentos considerados são incompatíveis dois a dois, uma vez estabelecido que se tira uma só bola de cada vez.


387

Então, a probabilidade de "sair XI ou x/' será

a probabilidade de "sair XI ou x 3 ou x s" será PI + P3 + Ps' Como a probabilidade do acontecimento certo é igual à soma das probabilidades de todas as células, deverá ter-se

Suponhamos que as bolas XI' x 2 ' ••• Xv são vermelhas e as restantes brancas. Designando por Vo conjunto das bolas vermelhas e por B o conjunto das bolas brancas, a probabilidade de sair bola vermelha será Pr (x E V)

=PI + P2 + ... + Pv

e a de sair bola branca Pr(xEB)

=Pv+1 + PV+2 + ... + PN = 1- Pr (x E V)

Mas como determinar as probabilidades elementares Pi' P2' ... , PN , se é que existem? Para isso, há que introduzir hipóteses suplementares. Suponhamos, por exemplo, que as bolas são sensivelmente iguais, em substância, forma e dimensões. Então, para dar a todas as bolas igual probabilidade de serem extraídas (casualização) , ocorre a ideia de fechar a urna e agitá-la várias vezes antes de tirar a bola. Esta ideia, ou melhor, esta intuição, é confirmada pela experiência: efectuando muitas vezes a prova nas condições indicadas (com reposição da bola retirada), serão sensivelmente iguais as frequências relativas com que aparecem as diferentes bolas (I). (1) - Donde nos vem esta intuição? É, na verdade, anterior a qualquer esperiência? Não pare-

ce que o seja. Será, antes, o produto de inúmeras experiências que fazemos, sem dar por isso, no decurso da nossa existência. Qualquer coisa de semelhante à intuição que nos leva a admitir os postulados da geometria euc1ideana.


388

Uma vez admitido que todas as bolas têm a mesma probabilidade de saída, isto é, que:

como se tem PI + P2 + ... + PN = 1, será

a probabilidade de saída de qualquer bola. Então, a probabilidade de sair bola vermelha, será

1 1 1 v Pr(xEV)=-+-+ ... +- (vvezes)=-. N N N N Este último resultado corresponde directamente à definição clássica de probabilidade: "A probabilidade dum acontecimento é o quociente do número de casos favoráveis ao acontecimento (1) pelo número total de casos possíveis, supondo que estes são todos igualmente prováveis". Segundo o ponto de vista adoptado nesta definição, considera-se como primitivo, não o conceito de probabilidade, mas, sim, o de "igualmente provável". E" claro que a hipótese de as bolas serem iguais (em substância, forma e dimensões) nunca se realiza exactamente na prática: podem ser, apenas, aproximadamente iguais e, então, as respectivas probabilidades, pp P2' ... ' PN , serão aproximadamente iguais, com um grau de aproximação correspondente. Se as bolas diferem entre si de maneira sensível, as probabilidades elementares pp P2' ... ' PN serão, também, sensivelmente diferentes e só poderão ser avaliadas a poste rio ri, efectuando numerosas extracções com reposição e registando as frequências relativas dos acontecimentos x = Xl' X = X 2 ' ••• , X = X N • Por comodidade, em tudo o que segue, ao tratar de problemas de bolas numa urna, supomos verificada a hipótese da igualdade. (1) - Aqui a palavra "caso" é empregada na acepção de acontecimento celular. Chamam-se "casos favoráveis ao acontecimento" os casos que implicam o acontecimento.


389

Recordemos que a extracção casual de bolas com números constitui a base de certos jogos, como o loto ou a lotaria. O cálculo das probabilidades nasceu precisamente das reflexões de certos matemáticos, nomeadamente PASCAL, sobre questões relativas a jogos de azar(l). Um jogo de azar conhecido desde a antiguidade é o dos dados. Em princípio, um dado deve ser um cubo formado de substância homogénea (dado peifeito), mas é claro que, na prática, estas condições só aproximadamente se realizam. As faces do cubo estão numeradas de 1 a 6. Admite-se que, lançando o dado, depois de o agitar dentro dum copo (casualização), todas as faces têm igual probabilidade de se apresentar em cima e será, pois, 1/6 a probabilidade correspondente a cada face. Esta hipótese é, geralmente, confirmada pela experiência: quando não houver confirmação, a experiência vem, apenas, revelar imperfeições que tenham passado despercebidas. Recordemos, ainda, os jogos de cartas, alguns dos quais são puramente de azar. Nestes jogos, a casualização consiste em baralhar as cartas. " E, ainda, de citar o jogo da roleta - círculo dividido em sectores numerados, que roda em torno dum eixo que passa pelo centro. A casualização consiste em imprimir à roleta um impulso que a faça dar várias voltas: se os sectores foram iguais, a probabilidade de parar num dado ponto é a mesma para todos. Se os sectores forem diferentes, as probabilidades serão proporcionais às respectivas amplitudes, de modo que, se foram 8 1 , 8 2 , ••• , 8 N , essas amplitudes em radianos, serão 8 _8 l p _8 2 p_N P1 - - ' 2 - - ' · · · ' N - - ' 2n 2n 2n as respectivas probabilidades, pois que se deve ter PI + P2 + ... + PN = 1.

(Este exemplo conduz, naturalmente, à consideração de probabilidade no contínuo). (1) - Aqui "azar" não é usado como sinónimo de "pouca sorte", mas, simplesmente, como

sinónimo de "acaso" (tal como o francês "hasard").


390

Recordemos, por último, o mais simples de todos os jogos de azar: o lançamento duma moeda ao ar. Se a moeda for bem balançada, as duas eventualidades "sair coroa" e "sair face" terão igual probabilidade, ou seja, 1/2. Se não, haverá uma diferença de probabilidade que a experiência acusará. Para ilustrar as considerações precedentes, convém apresentar aqui alguns exemplos numéricos, que, no fundo, se reduzem geralmente a problemas de Cálculo Combinatório. Exemplo 1 - Determinar a probabilidade de que, no lançamento dum dado perfeito, se obtenha um múltiplo de 3. São 2 os casos favoráveis ao acontecimento: x = 3, x = 6. Visto haver ao todo 6 casos possíveis (igualmente prováveis), a probabilidade pedida será

2 6

1 3

---

Exemplo 2 - Determinar a probabilidade de que, em dois lançamentos sucessivos dum dado perfeito, se obtenham 2 números pares. As células, neste caso, podem ser representadas pelos pares ordenados (x, y), em que x designa o número saído no 1.° lançamento e y o número saído no 2.° lançamento. Estes pares são em número de 6 2 =36 e todos igualmente prováveis, como é evidente. Os casos que implicam o acontecimento "saída de dois números pares" são: (2,2), (2,4), (2,6), (4,2), (4,4), (4,6), (6,2), (6,4), (6,6), em número de 9. A probabilidade pedida será, pois,

9 36

1 4

---

NOTA. Como se disse em Matemáticas Gerais, chama-se produto cartesiano dum conjunto A por um conjunto B, e designa-se por A x B, o conjunto de todos os pares ordenados (a, b) que se obtém tomando um elemento a em A e um elemento b em B; o número de elementos de A x B será, então, o produto dos números de elementos de A e de B. Analogamente, chama-se produto cartesiano de 3


391

conjuntos A, B, C, na ordem por que estão escritos, e designa-se por A x B x C, o conjunto de todos os ternos ordenados (a, b, c) com a E A, b E B, c E C; o número destes ternos é igual ao produto dos números de elementos de A, B, e C. E assim por diante. Também convencionámos escrever A 2 como abreviatura de A xA, A 3 como abreviatura de A x A x A, etc. Deste modo, os casos possíveis, no exemplo 2, serão os elementos do produto cartesiano {I, 2, 3,4,5, 6} x {I, 2, 3,4,5, 6} = {I, 2,3,4,5, 6F

e os casos que implicam o acontecimento considerado serão os elementos do produto cartesiano {2, 4, 6} 2 • Note-se que os pares ordenados, os ternos ordenados, etc., também se chamam arranjos com repetição (dois a dois, três a três, etc.). Exemplo 3 - Determinar a probabilidade de que, em dois lançamentos sucessivos dum dado perfeito, saia pelo menos uma vez nú.mero lmpar. O acontecimento "sair pelo menos uma vez número ímpar" é o contrário do acontecimento "sair duas vezes número par" cuja probabilidade, há pouco calculada, é 1/4. A probabilidade pedida será, pOIS,

1 3 1--=-.

4

4

Exemplo 4 - Determinar a probabilidade de que, em dois lançamentos sucessivos dum dado perfeito, saia primeiro um número par e depois um múltiplo de 3. Os casos possíveis (células) são os mesmos que no exemplo 2 e no exemplo 3. Os casos favoráveis ao acontecimento considerado obtêm-se desenvolvendo o produto cartesiano {2, 4, 6} x {3, 6},

cujos elementos são em número de 3 x 2 = 6. A probabilidade pedida será, pois, 6/36 = 1/6.


392

Exemplo 5 - Determinemos a probabilidade de que, em dois lançamentos sucessivos dum dado perfeito, saia uma vez um número par e outra vez um múltiplo de 3. O acontecimento considerado é a soma lógica dos dois seguintes: "sair primeiro número par e depois um múltiplo de 3" e "sair primeiro um múltiplo de 3 e depois um número par". Estes dois acontecimentos, que designaremos por aI e a 2 , têm ambos a probabilidade 1/6 (exemplo 4), mas não são incompatíveis. O acontecimento aI a 2 equivale a "sair 6 duas vezes"; como se trata de um só caso entre 36 possíveis, a sua probabilidade é de 1/36. A probabilidade pedida será, pois (teorema 3):

NOTA. Nos exemplos anteriores, excepto o primeiro, as considerações ficam essencialmente as mesmas, se substituirmos a expressão "em dois lançamentos sucessivos dum dado perfeito" pela expressão "num lançamento simultâneo de dois dados perfeitos". Exemplo 6 - Duma urna que contem 12 bolas, das quais 4 são brancas e 8 pretas, tiram-se duas bolas à sorte, uma após a outra, sem reposição. Calcular a probabilidade de que: a) sejam ambas brancas; b) sejam ambas pretas; c) sejam da mesma cor; d) sejam de cores diferentes; e) sejam a l.a branca e a 2.apreta; f) sejam a 2.a preta e a l.a branca. Suponhamos as bolas numeradas de 1 a 12, sendo as 4 primeiras brancas; designemos por x o primeiro número saído e por y o segundo. Neste caso, os acontecimentos celulares são representados pelos pares ordenados, (x, y), com x;t:y; trata-se, portanto, de arranjos (sem repetição!) de 12 elementos 2 a 2; o número desses arranjosé 12x11=132. O acontecimento considerado em a) corresponde aos pares (x, y), em que x e y variam de 1 a 4, mas sendo x;t:y. Trata-se, portanto, de arranjos de 4 elementos 2 a 2, cujo número é 4 x 3 = 12. A probabilidade pedida será, pois, 12/132.


393

Analogamente, se reconhece que a probabilidade pedida em b) é

8x7 132

56 132

o acontecimento considerado em c) é a soma lógica dos acontecimentos anteriores, que são incompatíveis. Portanto, a probabilidade pedida em c) será

12 132

56 132

68 132

--+--=--.

o acontecimento considerado em d)

é o contrário do anterior.

Logo, a sua probabilidade será

68 _ 64 1-----132 132 /

E fácil reconhecer, finalmente, que as probabilidades pedidas em e) e f) são ambas iguais a

8 x4 32 . 132 - 132 '

---

a sua soma dá a anterior, como era de esperar. Exemplo 7 - Duma uma que contem N bolas, sendo a brancas e b pretas, extrai-se, ao acaso, uma amostra de n bolas (tiradas, por exemplo, uma após outra, sem reposição). Achar a probabilidade de que, na amostra obtida, haja v bolas brancas e n - v bolas pretas. Comecemos por notar que a ordem pela qual são tiradas as bolas não interessa à questão. Os casos possíveis (todos igualmente prováveis) serão, pois, as combinações das N bolas tomadas n a n, cujo número é (:). Por sua vez, as amostras com v bolas brancas e n-v bolas pretas podem obter-se, sem omissão nem repetição, do seguinte modo:


394

1) - Formando, por um lado, as combinações das a bolas brancas tomadas v a v I cujo número é ( ~) . 2) - Formando, por outro lado, as combinações das b bolas pre.numero ,,( b ) . tas tomad as n-V a n-v, cUJo e n-v 3) - Arranjando todos os possíveis pares Av Bn_v constituídos por uma combinação Av obtida em 1) e uma combinação Bn_v obtida

em 2). Como o número destes pares é

(~) (n b v ), a probabilidade

pedida será

Esta distribuição de variável casual v é chamada distribuição hipergeométrica. Exemplo 8 - Duma uma que contem N bolas, sendo a brancas e b pretas, tiram-se, ao acaso, sucessivamente, n bolas, repondo a bola retirada após cada extracção. Achar a probabilidade de que saia v vezes bola branca e n - v vezes bola preta. Discorrendo como há pouco, seríamos levados a considerar, agora, os casos possíveis sob a forma de combinações com repetição. Porém, esses casos já não são igualmente prováveis, como é fácil ver. Suponhamos, por exemplo, n =3; neste caso, a combinação Xl X 2 X 3 será mais provável que a combinação Xl Xl X 3 ' pois que a primeira se pode apresentar com as seguintes ordens de saída de bolas:

ao passo que a segunda se pode apresentar só dos seguintes modos:


395

Este exemplo mostra, bem, o cuidado que é necessário ter na escolha dos acontecimentos celulares, para que sejam igualmente prováveis. Neste caso, há que tomar para células os arranjos com repetição das N bolas n a n (isto é, sistema de n bolas). Veremos, mais adiante, como se resolve este problema, considerado sob um aspecto mais geral (distribuição de BERNOULLI). Exemplo 9 - Nas condições do exemplo 7, achar a probabilidade de que, numa amostra, o número V de bolas brancas: a) não seja inferior a um dado número LI nem superior a um dado número L 2 ; b) seja inferior a LI ou superior a L 2 • Em a) trata-se de achar a probabilidade do acontecimento

o qual é a soma lógica dos acontecimentos V

=LI' V =LI + 1, ... , v =L

2 -

1, v

=L

2,

incompatíveis dois a dois. Ter-se-á, portanto,

ou sej a, atendendo ao resultado do exemplo 7: L2

Pr(L I <v <L2)

=L v=L,

Em b) pede-se a probabilidade do acontecimento (v < LI) + (L 2 < v) (v inferior a LI ou L 2 inferior a v) que é o contrário do acontecimento L I < V < L 2 • Será, pois,


396

Eis como se poderiam calcular exactamente as probabilidades que fomos levados a considerar em A-16, a propósito da experiência hipotética sobre animais. Porém, estas fórmulas, embora simples na aparência, exigem cálculos muito laboriosos. E" possível substituí-las por outras que, com muito menos trabalho, fornecem boas aproximações quando o número n excede um certo limite. NOTA IMPORTANTE RELATIVA ÀS NOTAÇÕES E TERMINOLOGIA Convencionámos no n~ 4 designar por Pr (a) a probabilidade do acontecimento a. Nesta ordem de ideias, representámos, atrás, por Pr(x=x l ) a probabilidade de "sair a bola Xl'" por Pr (x E V) a probabilidade de "sair bola vermelha", etc. Mas poderíamos, igualmente, para abreviar, designar por Pr(x l ), Pr(V), etc., aquelas probabilidades, dizendo "a probabilidade do elemento Xl'" a "probabilidade do conjunto V", etc. Assim, a distribuição de probabilidade passa a conceber-se como distribuição definida, não num corpo de acontecimentos, mas, sim, num corpo de conjuntos: todos os possíveis conjuntos de bolas da uma (cf. A-4). Poderíamos, também, conceber esta distribuição como função Pr(x) da variável casual X, tendo-se, na hipótese de as bolas serem iguais, Pr(x)

1 =-, para todo o valor de x. N

Estas considerações estendem-se, mutatis mutandis, a qualquer distribuição de probabilidade.

6. Independência e associação de acontecimentos Sendo as probabilidades valores ideais de frequências relativas, as definições de independência e associação que demos para o caso das frequências traduzem-se, imediatamente, em termos de probabilidade. Seja um corpo de eventualidades a considerar numa dada prova CZP, com determinadas probabilidades. Dados dois acontecimentos a, ~, chama-se probabilidade condicional de ~ em relação a a e designa-se por Pr(PI a) ao número dado pela fórmula

m


397

Pr(PI a)

(6.1)

= Pr(aP)

.

Pr (a)

Para avaliar Pr(PI a) empiricamente, o processo a seguir consistiria em efectuar a prova C!f um grande número de vezes e registar: 1) a frequência absoluta (a) de a; 2) a frequência absoluta (ap) de ap. O quociente de (ap) por (a) dar-nos-ia, então, um valor aproximado de Pr(Pla). E'" claro que, da definição (6.1), resulta, logo, afórmula do produto: (6.2)

Pr(aP)

=Pr(a) . Pr(PI a) =Pr(p) . Pr(al P),

a qual nos diz que: a probabilidade de se verificarem ao mesmo tempo os acontecimentos a e Pé o produto da probabilidade de a pela probabilidade condicional de P na hipótese de se verificar a (ou vice-versa). Os acontecimentos a, P dizem-se estocasticamente independentes ou, apenas, independentes, quando Pr(PI a) =Pr(p) ou, o que é equivalente, quando Pr(al P) =Pr(a); no caso contrário, dizem-se associados. Desta definição e da fórmula do produto deduz-se, logo, o TEOREMA DO PRODUTO. Se os acontecimentos a, P são independentes (e só neste caso), a probabilidade de realização simultânea de a e Pé igual ao produto das probabilidades de a e de p. Suponhamos, por exemplo, que uma uma contém 8 bolas brancas e 24 pretas, estando 6 bolas brancas marcadas com o sinal +, 18 bolas pretas com este mesmo sinal, e todas as restantes com o sinal-o Então, como existem na uma 32 bolas, ao todo, sendo 24 marcadas com o sinal +, a probabilidade (incondicional) de aparecer o sinal + é 24/32 = 3/4. Por sua vez, a probabilidade de aparecer o sinal + em bola branca é 6/8 = 3/4, igual à primeira. Os acontecimentos "sair bola branca" e "sair sinal +" são, pois, independentes; deste modo, a probabilidade de "sair bola branca e sinal +" é:


398

8 3 1 3 3 _._-_._-32 4

4

4

16

(probabilidade de sair bola branca vezes probabilidade de sair sinal +). Um exemplo mais sugestivo, embora menos rigoroso, será o seguinte. Consideremos a prova que consiste em semear uma certa quantidade de trigo num certo campo. Seja p a probabilidade (incondicional) de colher então uma quantidade de sementes superior a um dado limite L e seja p' a probabilidade do mesmo acontecimento, na hipótese de a altura pluviométrica, nos meses de outono e inverno, ser inferior a um dado limite À. Será, então, p' uma probabilidade condicional do primeiro acontecimento em relação ao segundo; e é natural que seja p' *p, isto é, que a eventualidade "colher trigo em quantidade superior a L" depende da eventualidade "chover em quantidade inferior a À". Mas, geralmente, dados vários acontecimentos a, corpo mtem-se, como é fácil ver, (6.3)

Pr(a~y ... )

y, ... do

=Pr (a) Pr(~ Ia) Pr(yl a~) ....

Os acontecimentos a, deira, não só a igualdade Pr(a~y

~,

~,

y, ... são independentes, se for verda-

... ) = Pr(a) Pr(~) Pr(y) ...

como todas as que resultam desta substituindo um ou mais dos acontecimentos a, ~, y, ... pelos seus contrários (cf. A -15) (1). 7. Sistema de duas experiências

Os conceitos de associação e independência de acontecimentos têm interesse, principalmente, quando se trata de várias experiências combinadas. Comecemos por considerar o caso das duas experiências CJP, CJP', iguais ou diferentes, e sejam CZIt e CZIt' dois corpos de eventualidades a considerar, respectivamente, nas provas CJP e CJP'. A realização destas duas provas, ao mesmo tempo ou uma após a outra, pode (1) - Pode considerar-se esta proposição como definição de independência, no caso de vários acontecimentos.


399

conceber-se como experiência composta, única, que designaremos por (~, ~'). Sejam aI' a 2 , ••• a mas células de me PI' P2' ... , Pn as células de m'. Designaremos, então, por

o acontecimento que consiste em realizar-se ai na prova ~ e Pk na prova ~' (acontecimento composto de ai e Pk). Todos estes acontecimentos (ai' Pk) são resultados possíveis da prova (~, ~'), são as células dum novo corpo, que designaremos por mx m'. Note-se que cada acontecimento ai pode ser considerado como elemento do corpo mx m', pondo

visto que,

PI + P2 + ... + Pn =I. Analogamente:

Nesta ordem de ideias, podemos identificar o acontecimento composto (ai' Pk) com o produto lógico ai Pk' desde que não haja perigo de confusão(l). Suponhamos, agora, definido no corpo mx m' uma distribuição de probabilidade. Esta poderá indicar-se numa tábua do seguinte tipo (cf. tabela-tipo de A-14):

lO

~I

~2

0.1

Pr(a l ~I)

0.2

Pr(a2 ~I)

•••••

• ••• lO.

~n

Total

•••••

Pr(a l ~n)

Pr(a l )

lO

•••••

Pr(a2 ~n)

Pr (0. 2 )

lO

•••••

lO

•••••

lO

••

lO

••••

Pr(a l ~2)

lO

Pr(a2 ~2) •

lO

••••

am

Pr(am ~I)

Pr(am ~2)

Total

Pr(~l)

Pr(~2)

lO

•

,.

•

lO

•••••

. .....

Pr(am ~)

Pr (am )

Pr(~)

1

(1) - A confusão pode surgir quando rzp' é apenas a repetição de rzp. Neste caso, um acontecimento a deverá ser designado por dois símbolos diferentes, conforme se realize em rzp ou em rzp'. Um outro modo de evitar a confusão é chamar a (ai' ~k) o produto cartesiano de ai por ~k. Este produto, que não é comutativo, será designado por ai x ~k para o

distinguir do produto lógico vulgar ai~k.


400

Note-se que, para i = 1, ... , m, k = 1, 2, ... , n, se tem:

Como estas probabilidades estão registadas à margem (sob a indicação "total"), dá-se-Ihes, também, o nome de probabilidades marginais da distribuição considerada. Pode acontecer, em particular, que se tenha

quaisquer que sejam i, k. Então, é fácil ver que a probabilidade de qualquer acontecimento a~, composto dum acontecimento a de e dum acontecimento Pde m' será igual ao produto das probabilidades de a e de ~(l). Os acontecimentos de m dir-se-ão, neste caso, independentes dos acontecimentos de m'. De contrário, terá de usar-se a fórmula (6.2). Estas considerações tornam-se mais intuitivas quando se fala em termos de variáveis casuais. Consideremos um par (x, y) de variáveis casuais com uma determinada distribuição de probabilidade, Pr (x, y). Chama-se probabilidade condicional dum valor Xi de x a respeito dum valor Yk de y, e representa-se por Pr(xiIYk)' o número dado por

m

As variáveis x, y dizem-se independentes (estocasticamente), se for Pr(xly) =Pr (x) para todos os valores de x e y. Tem-se, pois, nesta hipótese Pr(x, y) = Pr(x) Pr(y).

(1) - Esta regra, ou, mais geralmente, a fórmula (6.3), é conhecida tradicionalmente, como

princípio das probabilidades compostas.


401

NOTA. Seria mais correcto designar por símbolos diferentes as distribuições de probabilidade de x e y: por exemplo, a primeira por PrI(x) e a segunda por Pr2(y). Mas, para não sobrecarregar as notações, e não havendo perigo de confusão, usamos aqui, para ambas as distribuições, o mesmo símbolo. Exemplos - Consideremos uma urna que contenha M bolas xl' x 2 ' · · · ' x M ' sendo as v primeiras vermelhas e as b últimas brancas. E consideremos uma outra urna, que contenha N bolas YI' Y2' ... , YN , sendo as v' primeiras vermelhas e as b' últimas brancas. Sejam r;} , r;} , , respectivamente, as experiências que consistem em tirar à sorte uma bola da primeira uma e tirar à sorte uma bola da segunda uma. Neste caso, os resultados elementares da experiência composta (r;}, r;}') serão expressos pelos diferentes valores (Xi' Yk) da variável casual (x, y). Como estes valores são em número de MN e todos igualmente prováveis, a probabilidade de cada par (xi' Yk) será 1 MN

1

=M

1 .N

=Pr(x) Pr(Yk)'

o que significa que as duas variáveis casuais x, Y são independentes (estocasticamente). Os resultados da prova r;}' são pois independentes dos resultados da prova r;}. Por exemplo, a probabilidade do acontecimento sair bola branca em r;} e bola vermelha em r;}', será b v' bv' _ ._--M

N

MN

Casos análogos ao anterior serão, ainda, todos aqueles em que r;}' é simplesmente a repetição de r;}. Suponhamos, por exemplo, que se trata de duas extracções sucessivas duma bola da l.a uma, com reposição. A probabilidade de sair, em primeiro lugar, bola vermelha e, depois, bola branca será v _ . b_ -bv -

M

M

M2

igual à probabilidade de sair, primeiro, branca e, depois, vermelha (será, portanto, 2bv/M2 a probabilidade do acontecimento "sairem cores diferentes").


402

Mas suponhamos, agora, que CZP consiste em tirar uma bola da l.a uma, e CZP' em tirar uma segunda bola da mesma uma sem repor a primeira bola tirada. Os resultados elementares da prova composta (CZP, CZP') serão, ainda, os valores da variável casual (x, y), mas com a condição suplementar x::/:. y. Isto basta para ver que, neste caso, as variáveis casuais x, y não são independentes. Por exemplo, a probabilidade (condicional) de sair bola vermelha na 2. a extracção, tendo saído branca na l.a, é v

M-I

ao passo que a probabilidade (condicional) de sair vermelha na 2. a , tendo saído vermelha na l.a é

v-I M-I

Assim, a probabilidade de sair vermelha duas vezes é

v

v-I

M

M-I

-

v(v-I) M(M-I)

e a de sair primeiro branca e depois vermelha: b

v

bv

------M M-I M(M-I)

Estes resultados podem recolher-se na seguinte tabela: TABELA N.o 13

~ l.a

Vermelha

Branca

Total

Total

Vermelha

Branca

v(v - 1) M(M-l)

vb M(M-1)

-

bv M(M-1)

b(b - 1) M(M-1)

-

v M

-

b M

-

v M b M 1


403

N a margem direita estão indicadas as probabilidades de sair bola vermelha e a de sair bola branca na 2. a extracção, respectivamente, iguais às probabilidades de sair vermelha e de sair branca na 1. a extracção (registadas na margem inferior). A tabela patenteia, assim, a associação dos acontecimentos considerados.

8. Sistema de várias experiências Podemos, agora, conceber, mais geralmente, uma experiência t de vanas ". expenenclas . '" . ';T, ';T , ';T , ••• , ';T, ';T , ';T , ••• , compos a (em número finito). Sendo a, p, y, ... eventualidades a considerar em cada uma destas experiências, designaremos por (a, p, y, ... ) a eventualidade que consiste em acontecer a em Ç), p em Ç)', y em Ç)", etc., e diremos que (a, p, y, ... ) é o acontecimento composto de a, p, y, .... Porém, segundo o ponto de vista explanado no número anterior, podemos considerar este novo acontecimento como o produto lógico dos acontecimentos a, p, y, ... , desde que se tomem as devidas precauções (1). Suponhamos que, a todo o acontecimento a considerar na prova (Ç), Ç)', Ç)", ... ), corresponde uma determinada probabilidade. Então, o que se disse em B-6 é aqui aplicável: os acontecimentos a, p, y, ... dizem-se independentes (estocasticamente), se for verdadeira não só a igualdade (Í])

(Í]) ,

(Í])")

(Í])

(Í]) ,

(Í])"

(

(8.1)

Pr(apy ... ) = Pr(a) Pr(p) Pr(y) ... ,

como todas as que se deduzem desta substituindo um ou mais dos acontecimentos a, p, y, ... pelos seus contrários. Não sendo assim, terá de usar-se a fórmula geral do produto, com as probabilidades condicionais. Poderíamos, de novo, dar aqui exemplos de tiragens de bolas de uma ou várias umas, com ou sem reposição, mas as considerações do número seguinte bastam para esclarecer as precedentes.

(1) - Isto é, se ClP', ClP", ... consistem apenas na repetição de ClP, um mesmo acontecimento

deverá ser designado de modos diversos, conforme as provas em que se realiza. É o que faremos mais adiante.


404 9. Distribuição binomial ou de BERNOULLI Seja a um acontecimento a esperar com determinada probabilidade numa certa prova CZP e consideremos n realizações CZP I' CZP2 , ••• , CZPn , da prova genérica CZP (1). Estas provas particulares constituem uma experiência composta (CZP l' CZP 2' ... , CZP Tendo em vista o conceito empírico de probabilidade, é fácil reconhecer que a probabilidade do acontecimento a deverá ser a mesma em cada uma das provas, quaisquer que sejam os resultados das restantes provas. Por outras palavras: Os acontecimentos a esperar na repetição duma dada prova são independentes dos resultados das provas já efectuadas. E" claro que este facto não se deduz da anterior axiomática das probabilidades. Poderia, sim, assumir-se como novo axioma, porém com carácter bem diverso do dos primeiros. Um exemplo típico é o das sucessivas extracções casuais de bolas de uma urna, com reposição da bola após cada extracção. Pode, pois, aplicar-se nestes casos a fórmula (8.1). Proponhamo-nos, então, resolver o seguinte problema: Determinar a probabilidade de que, em n realizações da prova CZP, um acontecimento a de probabilidade p se realize x vezes. (Para concretizar, podemos supor que a consiste em tirar à sorte uma bola duma uma com bolas brancas e pretas, sendo a o acontecimento "sair bola branca". Porém, as considerações que se seguem são de todo gerais). Representemos por q a probabilidade de ã, isto é, ponhamos q =1- p. Para evitar confusões, designaremos por ai o acontecimento particular que consiste em realizar-se a na prova CZP i (i = 1, 2, ... , n); é claro que será sempre Il

).

=p, Pr(ã) = q. Suponhamos, por exemplo, n =3 e x =2. Três são os modos de a Pr(a)

se realizar 2 vezes numa série de 3 provas: na 3. a ou na 2. a e na 3. a ; isto é, em símbolos:

(1) - Dizendo que CZP l ' CZP 2' CZP I' CZP 2'

... ,

CZP"

l.a

e na 2.a, na

... , CZP" são realizações da mesma prova se realizam em condições idênticas.

CZP,

l.a

e na

fica implícito que


405

o acontecimento que consiste em a

se realizar 2 vezes nas 3

provas, será, pois, a soma lógica ,...,

,...,

,...,

a l a 2a 3 + a l a 2a 3 + a l a 2a 3 • Ora, as três modalidades consideradas são incompatíveis duas a duas e têm todas as mesmas probabilidades; por exemplo:

X

A probabilidade pedida será, pois, neste caso, 3p2q. Passemos, agora, ao caso geral. Um dos modos de a se realizar vezes nas n provas sera /

a la 2

,...,

•••

axa x+ l

,...,

•••

an•

Qualquer outra modalidade se obtém escolhendo, entre as n provas, as x provas em que se realize a. As modalidades possíveis correspondem, pois, às combinações das n provas x a x. Como o número total destas combinações é (:), o acontecimento que consiste em a se realizar x vezes nas n provas é a soma lógica de (:) eventualidades, incompatíveis duas a duas e todas com a mesma probabilidade, que é

A probabilidade pedida será, pois,

fórmula esta muito importante. Note-se que a variável casual x representa, aqui, a frequência absoluta de a numa série de n provas. A distribuição de probabilidade desta variável, dada pela fórmula anterior, tem o nome de distribuição de BERNOULLI. Também se


406

lhe chama distribuição binominal, atendendo a que os diferentes valores de Pr(x) são os termos do desenvolvimento da potência n do binómio p + q:

É claro que (p + q)n = 1. Procuremos, agora, a probabilidade de que a frequência absoluta de ex seja inferior ou igual a um dado limite L (com L < n). Como o acontecimento x < L é a soma lógica dos acontecimentos incompatíveis x = 0, x = 1, ... , x =L, virá: Pr (x < L)=Pr(x = O) + Pr (x = 1)+

000

+ Pr (x = L)=

±(n)

x=O

p Xqn -x.

X

Analogamente, se reconhece que

(Confrontar com os exemplos 7,8 e 9 do n.o 5). Se pusermos é, =xln (frequência relativa de ex nas n provas), a distribuição da variável é, será, manifestamente:

A tabela n. ° 14 representa a distribuição binominal para p =1/2, n = 10. Por exemplo, a probabilidade de que em 10 lançamentos sucessivos duma moeda "correcta" se apresente 3 vezes coroa, é

(!)3(!)7 = (10.9.8) . (_1) =~ 2 3.2.1 2 128 '

Pr(3) = (10) 3 2

10

valor que concorda com o correspondente da tabela (a menos de 0,001).


407 TABELA N.o 14 x

Pr (x)

x

Pr (x)

°

0,001

6

0,205

1

0,010

7

0,117

2

0,044

8

0,044

3 4 5

0,117

9

0,010

0,205

10

0,001

0,246

Na Fig. 3 é dado o histograma desta distribuição.

o

1 2 3 4 5 6 7 8 910

Fig. 3

Note-se que o histograma é simétrico a respeito da recta x = 5 e que a função Pr(x) atinge um máximo no ponto 5. Podemos ver um exemplo curioso desta distribuição no campo da genética. Sabe-se que, no cruzamento dum touro avermelhado do Shorthom com uma vaca malhada da mesma raça, há a probabilidade 1/2 de se óbter um vitelo avermelhado sem malhas (1). Então, a probabilidade de que, em 10 destes cruzamentos, se obtenham x vitelos avermelhados (sem malhas), é dada pela tabela n.o 14. (1) - Traduz-se por "touro avermelhado" a expressão inglesa "red bull" e por "vaca malha-

da" a expressão "roan cow" . Neste caso, "malhado" significa "avermelhado, com malhas brancas ou cinzentas dispersas" .


408

Por sua vez, sabe-se que a probabilidade de que, no cruzamento dum touro malhado Shorthorn com uma vaca malhada da mesma raça se obtenha um vitelo avermelhado (sem malhas) é 1/4. Então, destes cruzamentos, se obtenham x a probabilidade de que, em vitelos avermelhados (sem malhas) será:

10

_(10) (1 )X(3)1O- X

Pr(x) -

--

4

x

4

Na Fig. 4 é dado o histograma desta distribuição, que já não apresenta simetria. 0.3 0.2

0.1 O~~~~~~~~==------

O 1 2 3 4 5 6 7 8 9 10

x

Fig. 4

Os dois casos extremos na distribuição binominal são os seguintes: 1) x

=n (o acontecimento a realiza-se nas n provas)

2) x =

O(o acontecimento a não se realiza em nenhuma das provas).

A probabilidade do primeiro caso é (como se poderia reconhecer mesmo directamente):

A probabilidade do segundo caso é:

Pr(O)

=qn.

Note-se, porém, que a negação do acontecimento x =O não é o acontecimentos x =n, mas sim o acontecimento que consiste em a se realizar pelo menos uma vez em n provas.


409 A probabilidade deste acontecimento será, pois, Pr(x

* O) = l- qn= 1-(I-p)/1 = i

(_I)X-1 (n)px.

x=l

X

Exemplo - Calcular a probabilidade de que, jogando 1.000 vezes num número duma lotaria com 30.000 números, se tenha pelo menos uma vez a sorte grande. A probabilidade de, em cada extracção, se ter a sorte grande, é, manifestamente, 1/30.000. Então, a probabilidade pedida será 1- (1-

1 )1.000 = 1.000 _ (1.000) 1 + ... ::::: O 0328 2 (30.000)2 ' 30.000 30.000

probabilidade esta ainda muito fraca, apesar do grande número de tentativas. 10. Conceito de moda. Caso da distribuição normal

Chama-se moda duma distribuição de probabilidade duma variável x (com um número finito de valores) todo o valor de x, cuja probabilidade seja superior ou igual à de qualquer outro valor de x. Há distribuições com uma só moda, distribuições com mais de uma moda e distribuições sem moda. Vamos ver que a distribuição binominal Pr(x)

=

n'.

x!(n -x)!

pxqn-x (com q = 1- p)

apresenta uma ou, quando muito, duas modas. Considerando três valores consecutivos, X-I, X, X + 1 da variável x, tem-se n!

Pr(X-l) =

pX-l qn-X+I

(X-I)! (n -X+ I)!

Pr(X)

=

Pr(X + 1) =

n'.

pX qn-X

X! (n -X)!

n'. (X+l)! (n-X-l)!

pX+I qn-X-l.


410

Então, virá, como é fácil verificar, Pr(X)

---Pr(X -1)

Pr(X) Pr(X + 1)

_ (n-X + l)p Xq

(X + l)q

--------

(n - X)p

Por conseguinte, para que X seja uma moda, deve ser, simultaneamente, (n-X+l)p>Xq,

(X + l)q > (n -X)p.

Ora, esta dupla condição equivale à seguinte np - q < X <np + p.

Como a diferença entre np + p e np - q é igual a p + q =1, a anterior condição será verificada por um só valor inteiro de X (a moda), a não ser que np + p e np - q sejam números inteiros, que serão, nesse caso, as duas modas existentes. Assim, a moda ou as modas da distribuição binominal são sempre números inteiros que diferem de np menos de uma unidade. No primeiro exemplo atrás considerado (p = 1/2, n = 10), a moda é precisamente np= 10.1/2=5. No segundo exemplo (p= 1/4, n= 10), a moda X deve verificar a condição

1 3 1 1 1 75 = 10· ---<X< 10· -+-= 2 75· , 44 44" só poderá, então, ser X =2. Mas, se em vez de n =10, tivéssemos tomado n= 15, comp= 1/4, já teríamos duas modas: Xl =3, X 2 = 4.


411

11. Distribuição polinomial. Amostras casuais Consideremos agora, mais geralmente, uma partição formada por r acontecimentos aI' a 2, "" ar' a prever numa certa prova çp, com probabilidades PI' P2' "" Pr respectivamente (1), Pergunta-se: Qual a probabilidade de que, em n realizações da prova çp, as frequências absolutas dos acontecimentos aI' a 2, .. " ar' sejam, res, pectlvamente, xl' x 2' ' , " x r ?' E" claro que, sendo as eventualidades aI' a 2, ' , " ar' por hipótese, incompatíveis duas a duas, e sendo a sua soma lógica o acontecimento certo, deverá ter-se

= '1 P I +p2 + .. , +pr Suponhamos que os acontecimentos aI' a 2, "" ar se verificam numa determinada ordem, por exemplo:

ar nas provas Çpn-x r ; Çpn-x r +1' "" Çpn ' .

Obtém-se, então, um acontecimento composto, cuja probabilidade é Pl xl p/2 .. , p/r, E" claro que, qualquer que seja a ordem de realização, a probabilidade será esta; a probabilidade pedida será, pois, o produto de Pl xl P2 x2 '" p/r pelo número total de ordens possíveis, Mas este número não é n! (permutações das n provas), como poderia parecer, visto que, permutando entre si as Xl provas em que se verifica aI' as x 2 provas em que se verifica a 2 , "" as x r provas em que se verifica ar' se obtém sempre o mesmo acontecimento, Como se vê facilmente, o número das ordens possíveis será n! dividido por " entao, Xl'" X 2 ' '" X r ", e a pro b ab'l'd 11 ade pe d'd 1 a sera, Pr(xl' X2' .. , X) =

"

n!

Xl' X 2 ' '"

(1) - As eventualidades aI'

a 2,

••• ,

, PI xI P2 X2

.. ,

p/r.

Xr'

ar serão pois incompatíveis duas a duas e a sua soma ló-

gica será o acontecimento certo.


412

Temos aqui, pois, um exemplo duma distribuição de r variáveis casuais xl' X 2 ' ••• , Xr' E" claro que, por ser Xl + X 2 + ... + X r = n, estas variáveis não são independentes, nem sequer algebricamente. A referida distribuição diz-se polinominal, atendendo a que os valores de Pr (Xl' X2 ' ••• , X,) são os termos do desenvolvimento da potência n do polinómio PI + P2 + ... + Pr' Tem-se, com efeito, segundo a fórmula de LEIBNIZ: (p + P + ... + p ) n = r

12

xl

~ +

~ 000

"

n'.

p

Xl

P

X 2 •••

,12

+xr=n Xl' X 2 • ••• Xr'

p Xr

r·

Note-se que a distribuição binominal é um caso particular desta, correspondente a r = 2 (partição dicotómica). Tem-se, então, x 2 = n - Xl ' donde

Este resultado aplica-se em questões de amostragem casual. Chama-se amostra casual a todo o sistema (uI' u2 , ••• , un ) de n indivíduos tirados ao acaso duma dada população U. Como já tivemos ocasião de verificar em exemplos, a amostragem casual pode fazer-se de dois modos: com reposição ou sem reposição. No primeiro caso, cada um dos indivíduos uI' u2 ' ••• , un é tirado e, em seguida, reposto na população, antes de se tirar o seguinte: pode assim acontecer que um mesmo indivíduo apareça repetido na amostra. No segundo caso, os indivíduos são tirados sucessivamente, sem regressarem à população após as tiragens. Suponhamos dada no universo U uma partição em r atributos a!, a 2 , ••• , ar e sejam aI' a 2 , ••• , ar' respectivamente, as frequências absolutas de aI' a 2 , ••• , ar em U. Suponhamos, ainda, que todos os indivíduos têm igual probabilidade de ser tirados. Então, a probabilidade de aparecer um indivíduo com o atributo ai será, manifestamente, Pi =-ai N

em que N

=

aI

, l. = 1, 2, ... , r ,

+ a 2 + ... + ar (número de elementos de U).


413

Qual é, neste caso, a probabilidade de que, numa amostragem casual de n elementos, com reposição, as frequências absolutas de . . ? aI' a 2,···, ar sejam, respectlvamente, Xl' X 2 ,···, xr· A resposta é, segundo o que vimos,

Mas seja, agora, este outro problema: Qual é a probabilidade de que, numa amostragem casual de n elementos, sem reposição, as frequências absolutas de aI' a 2 ,···, ar' . . sejam, respectlvamente, Xl' X 2 , ••• , xr.? Raciocinando como no exemplo 7 do n. o 21, chega-se, agora, ao resultado

Eis aqui um novo exemplo de distribuição de r variáveis casuais, que, no caso particular r = 2, tem o nome de distribuição hipergeométrica. E" fácil ver que, se n é bastante pequeno em relação a N (isto é, se a razão n/N é bastante pequena), esta distribuição coincide, sensivelmente, com a anterior. Note-se, ainda, que, na prática, as fórmulas obtidas exigem cálculos muito laboriosos quando n é grande. Têm de ser então substituídas por outras que, embora não sejam exactas, se adaptam muito melhor ao cálculo numérico, dando uma boa aproximação, para valores de n elevados.


BIBLIOGRAFIA

Além das obras indicadas na advertência prévia, recomendamos, ainda, as seguintes: A. C. AITKEN - Statistical Mathematics. University Mathematical Texts. Oliver and Boyd; Edimburg and London, 1944. A. HALD - Statistical Theory with Engineering Application, New York (John Wiley & Sons Inc.) and London (Chapman & Hall, Ld.), 1952. P. LEVY - Calcul des probabilités, Gauthiers - Villars, Paris.


íNDICE CÁLCULO DAS PROBABILIDADES

ADVERTÊNCIA PRÉVIA.. .. ..... .......... ............

317

1.4.1 INTRODUÇÃO AO CÁLCULO DAS PROBABILIDADES: POPULAÇÕES FINITAS

319

A - Frequências .. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

319

1. Primeiros exemplos . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2. Populações. Álgebra dos atributos. . . . . . . . . . . . . . . . . . . . . . . 3. Álgebra dos acontecimentos. . . . . . . . . . . . . . . . . . . . . . . . . . . . 4. Acontecimentos expressos em forma proposicional. . . . . . . . . 5. Frequência dum atributo numa população. . . . . . . . . . . . . . . . . 6. Frequência de um acontecimento numa série de provas . . . . . . 7. Partições. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8. Corpos de conjuntos, corpos de atributos, corpos de acontecimentos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9. Distribuição em universos finitos. . . . . . . . . . . . . . . . . . . . . . . . 10. Soma de conjuntos não disjuntos (atributos ou acontecimentos compatíveis) ................ 11. Atributos quantitativos. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 12. Representação gráfica das distribuições: histogramas e polígonos de frequência.. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 13. Independência e associação de atributos. Distribuições de duas ou mais variáveis. . . . . . . . . . . . . . . . . . .

319 322 325 326 328 330 331 333 337 339 341 345 348


518 14. Associação e independência de partições múltiplas. . Ta/b uas de contmgencIa .............................. . 15. Associações parciais de atributos. Independência de atributos no caso em que o seu número é superior a dois ..... 16. Interpretação de uma tábua de contingência. Testes de significância ............................... . A

•

355 359 363

B - Probabilidades .................................... .

373

/· ln . d utlva . ..................................... 1. Loglca 2. Lógica dedutiva .................................... 3. Conceito natural de probabilidade ...................... 4. Axiomatização do conceito de probabilidade .............. 5. Alguns exemplos de cálculo de prodabilidades a priori . .... 6. Independência e associação de acontecimentos ............ 7. Sistema de duas experiências .......................... 8. Sistema de várias experiências ......................... 9. Distribuição binomial ou de Bernoulli ................... 10. Conceito de moda. Caso da distribuição normal ........... 11. Distribuição polinomial. Amostras casuais ............... BIBLIOGRAFIA ......................................

. . . . . . . . . . . .

373 376 378 382 385 396 398 403 404 409 411 414

1.4.2 APONTAMENTOS DE CÁLCULO DAS PROBABILIDADES .............................. .

415

A - Distribuições de uma variável contínua real ............ .

415

B - Valores médios para distribuições de uma variável real .. .

425

C - Valores médios para distribuições de mais de uma variável real ...................................... .

438

D - Aplicação à distribuição binomial. Teorema de BERNOULLI ..................................... .

451

E - Distribuição normal ................................ .

455

F - Convergência de distribuições. Relação entre as distribuições normal e binomial ........ .

464

G - A distribuição de X2 de PEARSON ................... .

465

NOTA SOBRE A AVALIAÇÃO DA VARIÂNCIA .......... .

469


519

1.4.3 ADITAMENTO ÀS LIÇÕES DE CÁLCULO DE PROBABILIDADES. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

471

A - Regressões. Ajustamentos. Correlação . . . . . . . . . . . . . . . . .

471

1. Formulação geral do problema. . . . . . . . . . . . . . . . . . . . . . . . . . 2. Ajustamentos pelo método dos mínimos quadrados. . . . . . . . . 3. Outra forma das equações normais. . . . . . . . . . . . . . . . . . . . . . . 4. Regressão polinomial. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 5. Regressão linear. Correlação . . . . . . . . . . . . . . . . . . . . . . . . . . . 6. Segunda recta de regressão. . . . . . . . . . . . . . . . . . . . . . . . . . . . . 7. Organização prática dos cálculos . . . . . . . . . . . . . . . . . . . . . . . . 8. Ajustamentos com mudanças não lineares de variáveis. . . . . . . 9. Regressão múltipla. Índice de correlação em geral. . . . . . . . . . 10. Nota sobre as notações. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

471 476 479 480 481 485 487 490 493 497

B - Distribuições de STUDENT e de FISHER. Suas aplicações. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

497

1. A melhor estimativa do desvio padrão deduzida duma amostra . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 2. Distribuição t de STUDENT . . . . . . . . . . . . . . . . . . . . . . . . . . . 3. A melhor estimativa de (J deduzida a partir de várias amostras . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 4. Distribuição da diferença entre duas médias . . . . . . . . . . . . . . . 5. Prova do t (de significação) . . . . . . . . . . . . . . . . . . . . . . . . . . . . 6. Intervalos de tolerância e intervalos de confiança . . . . . . . . . . . 7. Intervalos de confiança quando não é conhecido o (J da população. . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 8. Aplicações agronómicas . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9. Distribuição de Fez de FISHER . . . . . . . . . . . . . . . . . . . . . . . .

497 499 501 502 503 506 509 510 511

TÁBUA DA DISTRIBUIÇÃO NORMAL. . . . . . . . . . . . . . . . . . .

512

TÁBUA DA DISTRIBUIÇÃO DE t DE STUDENT . . . . . . . . . . .

513

TÁBUA DA DISTRIBUIÇÃO DE X2 DE PEARSON . . . . . . .. ..

514

INDICAÇÕES BIBLIOGRÁFICAS. . . . . . . . . . . . . . . . . . . . .. ..

515


Turn static files into dynamic content formats.

Create a flipbook
Introdução ao cálculo das probabilidades: populações finitas, por José Sebastião e Silva by Casa Ciências - Issuu