Documente Academic
Documente Profesional
Documente Cultură
275
BIBLIOGRAFA.................................................................................................................................... 293
CAPITULO 8.
MUESTRA
En este captulo se estudia uno de los problemas habituales del muestreo: la recomposicin de
la muestra. En una investigacin economtrica basada en fuentes de informacin primaria,
luego de realizar el muestreo es importante ajustar la estimacin inicial de los parmetros.
Para ello, generalmente, se dispone de informacin adicional que se puede utilizar para llevar
a cabo dicho ajuste. Esto deviene en una mejor estimacin de los parmetros poblacionales, ya
sea que estos representen medidas obtenidas sobre variables cualitativas o cuantitativas de las
unidades de observacin. En el proceso de investigacin economtrica, se realiz el muestreo
aleatorio y se calcul el estimador usual y de la media de la variable de inters Y. Pero, se
dispone sobre la poblacin de una informacin auxiliar sobre una media de una variable
cuantitativa X o sobre la forma de la distribucin de la poblacin segn una variable categrica
y no se vuelve a encontrar sobre la muestra la misma media o la misma distribucin. Se
proponen entonces nuevos estimadores de con mejores propiedades que las del estimador
usual. Para la mayora de ellos se trata de ponderar, otra vez, las unidades de observacin de
la muestra. Esta es la razn por la cual esos mtodos se llaman mtodos de recomposicin.
Existen diferentes mtodos para llevar a cabo el proceso de recomposicin pero en la mayora
de ellos se trata de ponderar otra vez a los individuos de la muestra. En muestreo es frecuente
usar informacin adicional para mejorar la precisin de las estimaciones, a estos se los conoce
como mtodos indirectos y los ms comunes son los de razn (o cociente) y los de mnimos
cuadrados. Estos mtodos requieren la observacin de una variable auxiliar ( ) que se
encuentra correlacionada con la variable de estudio ( ) y adems conocer el total de . La
correlacin entre e es lo que permite el incremento de precisin al estimar los parmetros
de .
276
Droesbeke y Fine (1997) establecen que si se conociera, mediante la base del muestreo, el
valor de X sobre todos los individuos de la poblacin, se podra realizar un muestreo con
probabilidades desiguales proporcionales a X, o tambin, un muestreo estratificado sobre la
variable X discretizada; como slo se conoce la media de X sobre la poblacin, solo se puede
utilizar un mtodo de recomposicin denominado de la razn.
Recomposicin de la media
El estimador de razn para la media ( ), se define por:
= = (8.1)
= + (8.2)
Donde
= = =
Si la cantidad que se quiere estimar es el valor de la media de la poblacin para una variable
, la estimacin de razn es
277
y
Y = (8.3)
x
= =
(8.4)
Donde
R= (8.5)
= +
Ejemplo. El objetivo es estimar el total de Poblacin del Departamento Ro Cuarto a partir de una
muestra de localidades.
Se trabaja con una situacin hipottica donde no se conoce el resultado del Censo de Poblacin
de 2001 sino el resultado de una muestra de 10 localidades. La informacin disponible da cuenta
de la cantidad de poblacin en el ao 2001 y en el ao 1991, para cada uno de los asentamientos
urbanos integrantes de la muestra. Adems, se conoce el total de poblacin existente en el
Departamento Ro Cuarto en el ao 1991 y en el resto de asentamientos urbanos que no integran
la muestra.
En la Figura 8.2 se tiene la tabla de datos con la totalidad de localidades del Departamento Ro
Cuarto. La variable X representa la cantidad de poblacin en cada localidad segn el Censo de
Poblacin del ao 1991.
279
Las localidades 1, 11,12, 13, 18, 23, 25, 27, 28 y 32 integran la muestra que fue seleccionada del
conjunto de asentamientos urbanos; a partir de esta muestra se debe calcular el total de
poblacin del Departamento para el ao 2001.
Poblaci Muestra
Observacin Localidad Departamento
nX y x
1 Ro Cuarto Ro Cuarto 134.355 144.021 134.355
2 Las Higueras Ro Cuarto 4.498
3 Vicua Mackenna Ro Cuarto 7.181
4 Coronel Moldes Ro Cuarto 7.695
5 Sampacho Ro Cuarto 7.160
6 Berrotarn Ro Cuarto 6.187
7 Adelia Mara Ro Cuarto 5.294
8 Alcira (Est. Gigena) Ro Cuarto 4.948
9 Santa Catalina (Est. Holmberg) Ro Cuarto 3.035
10 San Basilio Ro Cuarto 2.510
11 Elena Ro Cuarto 2.670 2.815 2.670
12 Achiras Ro Cuarto 2.123 2.173 2.123
13 Las Acequias Ro Cuarto 1.984 2.116 1.984
14 Coronel Baigorria Ro Cuarto 1.147
15 Bulnes Ro Cuarto 802
16 Las Vertientes Ro Cuarto 671
17 Alpa Corral Ro Cuarto 344
18 La Cautiva Ro Cuarto 663 685 663
19 Chajn Ro Cuarto 484
20 Washington Ro Cuarto 511
21 Monte de los Gauchos Ro Cuarto 376
22 Tosquitas Ro Cuarto 378
23 Las Albahacas Ro Cuarto 183 292 183
24 Suco Ro Cuarto 290
25 Chucul Ro Cuarto 176 236 176
26 Malena Ro Cuarto 129
27 La Carolina Ro Cuarto 158 165 158
28 Las Peas Ro Cuarto 148 139 148
29 Villa El Chacay Ro Cuarto 37
30 Paso del Durazno Ro Cuarto
31 La Gilda Ro Cuarto 80
32 Villa Santa Eugenia Ro Cuarto 58
Sumas 196.217 152.700 142.460
Figura 8.2. Poblacin en el Departamento Ro Cuarto
Para las localidades que integran la muestra se tiene informacin de la cantidad de habitantes:
280
= =
152700
= 196217 = 210321
142460
La media de la muestra es de
152700
= = = 15270
10
El Departamento tiene 32 asentamientos. Aplicando el clculo tradicional:
= = 15270 32 = 488640
El Censo de Poblacin del ao 2001 arroj una poblacin total para el Departamento de 215541.
Ejemplo. La Figura 8.3 informa el nmero de habitantes (en miles) para 49 ciudades, extradas en
una muestra aleatoria simple de la poblacin de 196 ciudades de un pas. El problema es estimar
el nmero total de habitantes en las 196 ciudades en el momento t. Se conoce el total para el
perodo t-1, X = 22919.
La mayora de las ciudades en la muestra presentan un aumento en tamao de t-1 a t del orden
de 20%. De los datos de la muestra se tiene que
= = 6262 = = 5054
La estimacin de razn del total del perodo t para las 196 ciudades es:
y 6262
Y = X= 22919 = 28397
x 5054
La estimacin basada en la media de la muestra por ciudad es
6262
Y = Ny = 196 = 25048
49
CIUDAD , ,
1 76 80
2 138 143
3 67 67
4 29 50
5 381 464
6 23 48
7 37 63
8 120 115
9 61 69
10 387 459 Contina
281
.
Continuacin
CIUDAD , ,
11 93 104
12 172 183
13 78 106
14 66 86
15 60 57
16 46 65
17 2 50
18 507 634
19 179 260
20 121 113
21 50 64
22 44 58
23 77 89
24 64 63
25 64 77
26 56 142
27 40 60
28 40 64
29 38 52
30 136 139
31 116 130
32 46 53
33 243 291
34 87 105
35 30 111
36 71 79
37 256 288
38 43 61
39 25 57
40 94 85
41 43 50
42 298 317
43 36 46
44 161 232
45 74 93
46 45 53
47 36 54
48 50 58
49 48 75
Figura 8.3. Tamao de ciudades (en miles) en el perodo t y en el perodo t-1
282
La estimacin de razn es consistente. Tiene sesgo, excepto para algunos tipos especiales de
poblaciones, aunque el sesgo es despreciable en muestras grandes. La distribucin lmite de la
estimacin de razn, conforme n se hace grande, es normal, sujeta a algunas restricciones
menores sobre el tipo de poblacin de la cual se est muestreando. En muestras de tamao
moderado la distribucin presenta una tendencia hacia asimetra positiva en las clases de
poblaciones para las cuales se usa el mtodo ms a menudo.
No existen frmulas exactas para el sesgo y la varianza de muestreo de la estimacin sino slo
aproximaciones que son vlidas en muestras grandes.
=
, =
, R=
En una muestra aleatoria simple de tamao n, donde n es grande, las varianzas se definen
como:
(1 ) ( )
= (8.6)
1
(1 ) ( )
( )= (8.7)
1
1 f [(y Rx )]
V R = (8.8)
nX N1
283
Observacin: Si las variables e son medidas para cada unidad de observacin de una
muestra aleatoria simple de tamao n grande, el error cuadrtico medio (ECM) y la varianza de
son, aproximadamente, iguales a
(1 ) ( )
(8.9)
1
RR = R=
RR =
Al tomar esperanza matemtica, el promedio entre todas las muestras aleatorias simples de
tamao n es
E(y Rx) Y RX
E(R R) = =
X X
Pero R = E RR = = = 0
1
ECM (R) = E(R R) E(y Rx)
X
1 1 S
V(R) = E(y Rx) = (1 f)
X X n
284
Como consecuencia de los motivos esgrimidos en esta observacin, la varianza de los otros dos
estimadores por el cociente o razn son las siguientes
(1 ) ( )
= (8.10)
1
(1 ) ( )
( )= (8.11)
1
Hay varias formas alternativas del resultado; dado Y = RX, se puede escribir
(1 )
( )= [( ) ( )]
( 1)
(1 )
( )= ( ) + ( ) 2 ( )( )
( 1)
( )( )
=
( 1)
(1 )
= + 2 (8.12)
2
= (1 ) + (8.13)
= (1 ) + 2 (8.14)
285
( ) (1 )
( ) = = + 2 (8.15)
Esta ltima cantidad recibe el nombre de varianza relativa, su uso evita la repeticin de las
frmulas de varianza para cantidades relacionadas como la media o el total de poblacin
estimados.
W. Cochran (1987) estudia el caso de los estimadores por el producto. Si una variable auxiliar X
tiene correlacin negativa con Y, donde ambas variables slo toman valores positivos, un
anlogo del estimador por el cociente es el estimador por el producto, para el cual
x
y =y
Por expansin usual en serie de Taylor, el anlogo de (8.16) para el estimador por el producto
en una muestra aleatoria simple, de tamao grande, es
(1 f)
cv = (C +C + 2C ) (8.17)
n
( ) .
Sin embargo, cuando la muestra es grande, el sesgo resulta insignificante. En otras palabra, en
la medida que ; 1. Por lo que es un estimador consistente aunque
sesgado.
En el estimador por razn -de un total de una poblacin- de manera separada se debe conocer
el valor poblacional de la variable auxiliar para cada estrato,
= = = (8.18)
En el estimador de razn del total de manera combinada, se obtiene una sola razn combinada
con datos muestrales y se multiplica por el total poblacional de la variable auxiliar,
= = (8.19)
En el caso de que la muestra sea grande es conveniente utilizar el primer mtodo. Para
muestras pequeas conviene utilizar el estimador por razn combinada.
287
= + = ( ) + (8.20)
= +
Si el valor de es prximo a 1 (o a -1) lo que est indicando alta correlacin entre las
variables- entonces y es un estimador de la media de la poblacin ( ) mucho ms preciso
que y.
Si =
= ( ) + =
+ =
= , la estimacin de razn.
= + ++ + (8.21)
para calcular por mnimos cuadrados los valores de , , , y . Tanto los valores de
como los de , provienen del relevamiento muestral.
= + + + + = + (8.22)
= + = ( )+ (8.23)
= (8.24)
n = (8.25)
= (8.26)
290
(8.27)
= 1 (8.28)
Si se hubiera considerado el resultado arrojado por la muestra, sin corregir por el tamao del
estrato en la poblacin, se habra incurrido en una subestimacin.
Cuando en una encuesta se tiene varias variables categricas y se conoce cul es la frecuencia
en la poblacin, de cada modalidad integrante de cada variable, es posible construir una nica
variable categrica donde las modalidades se originan a partir de la combinacin de
modalidades de las variables originales. A partir de aqu, el proceso de recomposicin de la
muestra se aplica utilizando la post estratificacin sobre esta variable.
Ejemplo. Una muestra aleatoria de 1200 casos presenta la distribucin conjunta de las variables
Sexo y Grupo de edad con la frecuencia observada en la Figura 8.6. Se anexa tambin, la
frecuencia esperada en la poblacin de acuerdo a la composicin demogrfica conocida.
291
Para recomponer la muestra se utiliza el mtodo iterativo RAS (Raking Adjusted Statistics)
consistente en:
1. Ajuste sobre las lneas
Con los datos de la Figura 8.6, se multiplica la primer lnea por 600/500 y la segunda por 600/700;
es decir, se multiplica por la frecuencia de la poblacin y se divide por la hallada en la muestra. El
resultado es la Figura 8.7.
Edad Frecuencia
<25 25 a 65 >65 Muestra Poblacin
Hombre 180 180 240 600 600
Sexo
Edad Frecuencia
<25 25 a 65 >65 Muestra Poblacin
Hombre 161.5 244.2 193.1 598.8 600
Sexo
Edad Frecuencia
<25 25 a 65 >65 Muestra Poblacin
Hombre 161.8 244.7 193.5 600 600
Sexo
Mujer 138.2 255.3 206.5 600 600
Muestra 300 500 400 1200
Frec
La Figura 8.9 indica la cantidad de personas que debieron ser encuestadas en cada grupo y en la
Figura 8.6 la cantidad que efectivamente ha sido entrevistada. Esta diferencia hace que las
opiniones de algunos grupos estn sobredimensionadas y las de otros subdimensionadas. Para
darle a las opiniones de cada grupo el peso que le corresponden, se asignar un peso en funcin
de la clase a la cual pertenece cada uno de los 1200 individuos de la muestra. Este peso, que
relaciona la participacin del estrato en la muestra y en la poblacin, combina los resultados de la
Figura 8.9 y la Figura 8.6:
Clase Peso
Hombres de menos de 25 aos 161.8/150=1.07867
Hombres de 25 a 65 aos 244.7/150=1.63133
Hombres de ms 65 aos 193.5/200=0.9675
Mujeres de menos de 25 aos 138.2/180=0.76778
Mujeres de 25 a 65 aos 255.3/220=1.16045
Mujeres de ms 65 aos 206.5/300=0.68833
La suma de los pesos sobre los 1200 individuos es igual a 1200 y el estimador de la media
poblacional por recomposicin RAS es:
1
= (8.29)
1200
Estos mtodos son muy utilizados por los politlogos para estimar las intenciones de votos. Los
resultados en bruto de los muestreos tendran un alto error al no utilizar las informaciones
auxiliares conocidas. Droesbeke y Fine (1997) advierten que las personas encuestadas que
tienen opiniones extremas no confiesan sus intenciones reales de voto a un encuestador.
Bibliografa
Cochran, William G. Tcnicas De Muestreo. Editorial CECSA, 1987.
Droesbeke, Jean-Jacques y Fine, Jeanne. "Metodologa De La Encuesta," L. d. M. d. T. d. D.
Universit Libre de Bruxelles, Belgique, Programme de Recherche et denseignement en
Statistique Applique. Concepcin, Chile: Universidad de Concepcin, 1997.
Rodriguez, Norberto. "Curso Taller Sobre Diseo De Muestras Probabilsticas," XXIII Coloquio
Argentino de Estadstica. Cordoba: Sociedad Argentina de Estadstica, 1995.
Scheaffer, Richard; William Mendenhall III y R.Lyman Ott. Elementos De Muestreo. Madrid:
Editorial Thomson, 2007.