Buscar

Mostrando entradas con la etiqueta normal. Mostrar todas las entradas
Mostrando entradas con la etiqueta normal. Mostrar todas las entradas

sábado, 13 de abril de 2013

Cuestiones sobre distribución muestral I



En esta entrada vamos a plantear dos cuestiones tipo test:


Primera, una empresa tiene unos costes variables totales (X) que se distribuyen normalmente, con media 5 y varianza 25. Sus costes fijos (C) se estiman en 3 y los ingresos (Y) se distribuyen también como una variable normal con media 10 y desviación típica 9. Cuál será la probabilidad que su beneficio (B) sea positivo? (Nota: el beneficio se obtiene restando los costes variables y fijos a los ingresos)


a) 0,5753  
b) 0,4247
c) 0,6054
d) 0,3946


Segunda, se ha de razonar cuál de las siguientes afirmaciones es falsa:


a) Por aplicación del Teorema Central del Límite (TCL), la distribución de la media muestral basada en una muestra de medida suficientemente grande será siempre aproximadamente normal.
b) La desviación estándar poblacional de una variable binaria es igual a  raiz cuadrada de pi * ( 1- pi)
.
c) La media muestral,
,_x, obtenida de una población que no se distribuye según una ley normal, no tiene que seguir necesariamente una ley normal.
d) La media muestral obtenida a partir de una variable binaria y con una medida muestral no está normalmente distribuida.

Para la primera cuestión la solución: a)

Si ingresos=Y, costes variables=X y beneficios=B, tenemos que B=Y-X-3. Se pide encontrar P(B > 0).

Para hacerlo, en primer lugar hay que determinar la distribución de la variable aleatoria beneficio (B):
E(B) = E(Y − X − 3) = E(Y ) − E(X )− 3 = 10 − 5 − 3 = 2
V (B) =V (Y − X − 3) =V (Y )+V (X ) = 81+ 25 = 106

Así, B N(2; 106). Por lo tanto, la probabilidad buscada es:

P(B>0) = P ( Z > ( 0 – 2 / SQR (106)) ; P  ( Z > - 0,19) = P ( Z < 0,19) = 0,5753

Para la segunda cuestión la solución
: d)

La respuesta a) es cierta puesto que el TCL dice que las medias muestrales a partir de cualquier distribución acontecen normalmente distribuidas a medida que aumenta la medida de la muestra.

La respuesta b) es cierta puesto que la desviación estándar de una variable binaria de media π es π (1 −π ) .

La respuesta c) es cierta puesto que por aplicación del TCL para que la media muestral de una distribución no normal siga una distribución normal hace falta que la medida de la muestra sea grande.

La respuesta d) es falsa puesto que cuando n>100, la media o proporción muestral de una variable binaria está normalmente distribuida.

jueves, 11 de abril de 2013

Problema de estandarización de una variable



En esta entrada vamos a exponer un problema que dice así, una facultad recibe solicitudes de ingreso para el siguiente curso. Los aspirantes se someten a pruebas selectivas puntuadas entre 0 y 1000. Se considera que la calificación obtenida por un estudiante elegido al azar entre los que hacen la prueba selectiva sigue una distribución normal de media 550 y desviación típica 100.

a) Si la facultad decide admitir el 25% de los aspirantes con calificaciones más altas de la distribución total, ¿cuál será la nota de corte?
b) Se ha de determinar el porcentaje de estudiantes que obtienen una puntuación entre 620 y 740.
c) Sabemos que en la convocatoria de este año, 350 estudiantes han obtenido una puntuación entre 400 y 450 puntos. Entonces, ¿cuántos aspirantes obtuvieron una puntuación entre 620 y 740?

Indicación: para resolver este apartado es conveniente que primero determines el número de estudiantes que se han presentado a la convocatoria.

a) Sea X la nota obtenida en la prueba selectiva por un estudiante elegido al azar entre los que hacen la prueba. Del enunciado tenemos que X se distribuye según una N(550,100). La nota de corte tiene que ser un valor x0 tal que 0,25=P(X > x0) pues la facultad decide admitir sólo el 25% de los estudiantes con calificación más alta. Al estandarizar, podemos formular equivalentemente la condición como 0,25 = P(Z > (x0-550)/100) = P(Z < (550-x0)/100), donde Z denota una distribución N(0,1) y en la última igualdad se ha hecho uso de la simetría de la normal estándar. Si consultamos la tabla de la N(0,1) tenemos que (550-x0)/100 ≈ -0,675 y por lo tanto x0 ≈ 550 + 0,675•100 = 617,5 puntos y la nota de corte es 618 puntos.

b) Para determinar el porcentaje de estudiantes que obtienen una puntuación entre 620 y 740 puntos necesitamos calcular P(620 < X < 740) = P((620-550)/100 < Z < (740-550)/100) = P(0,7 < Z < 1,9) donde nuevamente se ha aplicado estandarización. De la mesa de la N(0,1) vemos que P(Z ≤ 0,7) = 0,75804 y que P(Z ≤ 1,9) = 0,97128. Por lo tanto P(0,7 < Z < 1,9) = 0,97128 - 0,75804 = 0,21324 y el porcentaje pedido es del 21% de los estudiantes.

c) El número total de estudiantes N que se han presentado a la prueba se puede deducir del hecho que 350 aspirantes han obtenido una puntuación entre 400 y 450 puntos. Con similares argumentos a los del apartado anterior, se tiene que P(400 < X < 450) = P(-1,5 < Z < -1) = 0,15866 - 0,06681 = 0,09185. Tiene que ser 350/N ≈ 0,09185 y por lo tanto N ≈ 350/0,09185 = 3810,5607 ≈ 3811 personas. Cómo del apartado anterior sabemos que el 21% de los presentados obtienen una puntuación entre 620 y 740, podemos afirmar que en esta convocatoria han sido 3811∙0,21324 = 812,65764 ≈ 812 personas.

miércoles, 10 de abril de 2013

Cuestiones sobre distribución normal estándar



En esta entrada vamos a considerar que los beneficios anuales (medidos en miles de euros) de las empresas de un cierto sector siguen una distribución aproximadamente normal de media 10 y desviación estándar 2. Si denotamos por Z una distribución normal estándar, ¿qué porcentaje aproximado de empresas obtienen beneficios por encima de 7000 euros?
a) 7%, que podemos calcular como P( Z < (10-7)/2 ) = 0,06681
b) 7%, que podemos calcular como P( Z < (7-10)/2 ) = 0,06681
c) 93%, que podemos calcular como P( Z < (10-7)/2 ) = 0,93319
d) 93%, que podemos calcular como P( Z < (7-10)/2 ) = 0,93319

Segundo, para una distribución N(µ, σ), qué de las siguientes afirmaciones es falsa. Aproximadamente,

a) el 95% de las observaciones se encuentran a una distancia menor a 2∙σ de µ
b) el 5% de las observaciones se encuentran a una distancia superior a 2∙σ de µ
c) el 97,5% de las observaciones se encuentran a una distancia menor a 2 ∙σ de µ
d) el 2,5% de las observaciones resultan superiores a µ + 2∙σ

 Solución primera cuestión: c)

Sea X la variable que mide (en miles de euros) los beneficios de las empresas del sector; del enunciado conocemos que X se distribuye según una ley N(10, 2). Estamos interesados en P(X > 7).

Las opciones a) y b) tienen que ser descartadas inicialmente pues 7 es inferior a la media de la distribución y, por lo tanto P(X > 7), es superior a P(X > 10) = 0,5 y por lo tanto el porcentaje pedido es superior al 50%.
Estandarizando tenemos que P(X > 7) = P(Z > (7-10)/2) donde Z es una variable distribuida según una N(0,1). Si recordamos la simetría de la distribución normal estándar, P(Z > (7-10)/2) = P(Z < (10-7)/2) = 0,9332 y por lo tanto la opción correcta es la c).

A la segunda cuestión: c)

Según la regla del 68-95-99,7, el 95% de las unidades de la población tienen valores entre la media menos dos desviaciones estándar y la media más dos desviaciones estándar, el que valida la opción a). Observamos que por la misma razón la opción b) es cierta pues el 5% de las observaciones restantes quedarían , o bien por sobre µ + 2∙σ o bien por debajo de µ - 2∙σ. Esta repartición del 5% restante es simétrica resultando el 2,5% de las unidades de la población por sobre µ + 2∙σ y el 2,5% por debajo de µ - 2∙σ con el que la opción d) también es cierta. La afirmación falsa era pues la c)

Observamos que si que sería cierto el hecho que el 97,5% de las observaciones resulta inferior a µ + 2∙σ pero no todas estas se encuentran a una distancia menor a 2∙σ de µ: por ejemplo µ - 3∙σ es claramente inferior a µ + 2∙σ pero su distancia a µ es igual a 3∙σ.