Buscar

Mostrando entradas con la etiqueta distribución. Mostrar todas las entradas
Mostrando entradas con la etiqueta distribución. Mostrar todas las entradas

miércoles, 24 de abril de 2013

Probabilidad de aceptación o no de una propuesta



En esta entrada veremos que en un próximo referéndum se vota a favor o en contra de una ordenanza municipal que prohíbe la utilización de reproductores musicales a la calle. Se lleva a cabo un sondeo entre 75 personas elegidas al azar para estimar cuál es el grado de aceptación de la medida y el 60% se muestra a favor de la prohibición.

Primero se va a calcular la probabilidad que el ordenanza municipal sea rechazada usando el programa Minitab en lugar de las tablas (Nota: para rechazar las propuestas legislativas hacen falta como mínimo un 50% de los votos).

Para una muestra grande, la probabilidad de rechazo sigue una distribución aproximadamente normal con una media π = 0,6 y una desviación estándar SQR((pi(1 – pi)/ n) = SQR(( 0,6 * ( 1- 0,6)/75) = 0,0565

Para que la medida sea rechazada hay que determinar la probabilidad de que esta opción obtenga un valor inferior a 0,5 (menos del 50% de los votos)

P ( x <= 0,5) = P ( Z <= 0,5 – 0,6 / 0,0565 = P ( Z < - 1,7668 = 0,0386

Usando el minitab vemos que esta probabilidad es del 4%.

Cumulative Distribution Function
Normal with mean = 0,6 and standard deviation = 0,0566
x P( X <= x )
0,5 0,0386322










Segundo, Sin hacer ningún cálculo con el Minitab, razonáis como se vería afectada la probabilidad de rechazar el ordenanza municipal si en lugar de encuestar 75 personas se hubieran encuestado 150 y también el 60% se hubiera mostrado partidario del ordenanza municipal?


Si la encuesta se hubiera hecho a 150 personas en lugar de a 75, la media seguiría siendo 0,6 pero la desviación estándar sería más pequeña puesto que


SRQ ( 0,6 * (1 – 0,6) / 150 < SQR ( 0,6 * ( 1 – 0,6) / 75 = 0,0566

Por lo tanto, al ser más pequeño el denominador, el valor tipificado obtenido será más grande en valor absoluto pero cómo tendrá signo negativo la probabilidad a la izquierda de este valor será ahora más pequeña. Es decir, al tener una muestra más grande, nos fiamos más del resultado de la encuesta, por lo cual la probabilidad de que el resultado final contradiga la encuesta será menor.
 






miércoles, 17 de abril de 2013

Problema sobre distribución de media muestral


En  una entidad bancaria saben que el número de días de retraso en el pago de las cuotas de los créditos hipotecarios sigue una distribución de media 5 días y desviación estándar 30 días. Elegimos al azar una muestra de 225 clientes con crédito hipotecario.

a) Qué distribución de probabilidad sigue la media de la muestra de 225 clientes?

La distribución de la media de la muestra seguirá una ley normal, aunque la distribución de la población fuera no normal, puesto que la distribución de la media muestral basada en una medida n será aproximadamente normal y cuando n es más grande más normal es la distribución. Está claro, que si la distribución de la población es normal, la distribución de la media muestral también lo será.

Es decir. Con esta premisa podemos decir cuál es la distribución de la media muestral puesto que tenemos que la media de la distribución es 5 días y el error estándar de la muestra es el cociente entre la desviación estándar de la distribución y la raíz cuadrada de la medida muestral, es decir, N(30 / SQR (225)) = 2, o el que es el mismo _N(5,2).



b) Calcular la probabilidad que la media muestral oscile entro 8 y 10 días.

Es decir, el área que queda por debajo de la curva normal definida por los parámetros que caracterizan la distribución de la media muestral: 



; P ( 1,5 < Z < 2,5) à 0,93319 < Z < 0,99379

Es decir, la diferencia entre 0,99379 y 0,93319 es la probabilidad que la media oscile  entre 8 y 10 días.

Y esta es 0,0606. 


c) ¿Cuál es la medida muestral necesaria para garantizar que la probabilidad que la media muestral supere los 10 días sea del 9,68%?

Primero tenemos que buscar el valor de la variable estandarizada Z a las mesas y este es – 1,3.

Segundo, conocemos que la desviación de la media muestral o error estándar es el cociente entre la desviación típica de la distribución y la raíz de la medida de la muestra que buscamos


P ( _X>10) = P ((_X - 5) / (30 / Sqr(n)) > ( 10 - 5 / 30 /sqr(n)) = P (Z > srq(n) / 30 ) = 1 - P ( Z <= sqr (n) /30 = 0,0968

entonces,

P (Z <= 5 * sqr(n) / 30 ) = 1 - 0,0968 = 0,9032 --> sqr (n) / 30 = 1,3 

en donde n = ( 30 * 1,3 / 5) al cuadrado dando 60,84 que representa que 61 días será el tamaño muestral.

 

sábado, 13 de abril de 2013

Cuestiones sobre distribución muestral II



En esta entrada vamos a seguir con dos cuestiones tipo test sobre distribución muestral

Primero, el número de llamadas de teléfonos fijos a móviles al día en un país nórdico tiene una media de 3 y una desviación estándar de 14. Cuál es la probabilidad que la media de las llamadas de fijos a móviles a un municipio con 70 teléfonos fijos sea de 5 llamadas al día o más?

a) 88,4
b) 11,6
c) 100%
d) 2,79%

Segundo, en la tabla  siguiente se muestra la distribución de rentas brutas anuales de una población de 10000 habitantes por intervalos:

Rentas (miles €)
Núm. habitantes
Menos de 20
10%
Entre 20 i 40
40%
Entre 40 i 60
30%
Más de 60
20%


Si se quiere obtener una muestra de 450 personas mediante un muestreo estratificado, cuántos habitantes con rentas entre 20 y 40 mil euros anuales habría que entrevistar?

a) 30.
b) 180
c) 225
d) 135


Para la primera cuestión la solución: b)

Consideramos la variable aleatoria X=”número de llamadas de fijos a móviles al día”. Por el enunciado se sabe que X tiene una media = 3 =X μ y una desviación estándar = 14 =X σ . Se pide calcular una probabilidad sobre la variable aleatoria media muestral y sabemos que, por aplicación del TCL, la media de una muestra grande, n>30, obtenida de una distribución no normal sigue una distribución N(μ;σ/sqr( n) ). Como la medida de la muestra es n=70, la distribución que sigue es N(3;14/sqr( 70))= N(3;1,6733).

Entonces, la probabilidad buscada es del 11,6%:

P ( _X>= 5 ) = P ( (_X – 3 / 1,6733) >= ( 5- 3 ) / 1,6733)) = P ( Z >= 1,2) = 1 – P (Z < 1,2) = 1 – 0,88 = 0,116

Para la segunda solución: b)

El número de habitantes con rentas entre 20 y 40 mil euros anuales que habría que entrevistar es el 40 % de las 450:

40 / 100 * 450 = 180 habitantes.

Cuestiones sobre distribución muestral I



En esta entrada vamos a plantear dos cuestiones tipo test:


Primera, una empresa tiene unos costes variables totales (X) que se distribuyen normalmente, con media 5 y varianza 25. Sus costes fijos (C) se estiman en 3 y los ingresos (Y) se distribuyen también como una variable normal con media 10 y desviación típica 9. Cuál será la probabilidad que su beneficio (B) sea positivo? (Nota: el beneficio se obtiene restando los costes variables y fijos a los ingresos)


a) 0,5753  
b) 0,4247
c) 0,6054
d) 0,3946


Segunda, se ha de razonar cuál de las siguientes afirmaciones es falsa:


a) Por aplicación del Teorema Central del Límite (TCL), la distribución de la media muestral basada en una muestra de medida suficientemente grande será siempre aproximadamente normal.
b) La desviación estándar poblacional de una variable binaria es igual a  raiz cuadrada de pi * ( 1- pi)
.
c) La media muestral,
,_x, obtenida de una población que no se distribuye según una ley normal, no tiene que seguir necesariamente una ley normal.
d) La media muestral obtenida a partir de una variable binaria y con una medida muestral no está normalmente distribuida.

Para la primera cuestión la solución: a)

Si ingresos=Y, costes variables=X y beneficios=B, tenemos que B=Y-X-3. Se pide encontrar P(B > 0).

Para hacerlo, en primer lugar hay que determinar la distribución de la variable aleatoria beneficio (B):
E(B) = E(Y − X − 3) = E(Y ) − E(X )− 3 = 10 − 5 − 3 = 2
V (B) =V (Y − X − 3) =V (Y )+V (X ) = 81+ 25 = 106

Así, B N(2; 106). Por lo tanto, la probabilidad buscada es:

P(B>0) = P ( Z > ( 0 – 2 / SQR (106)) ; P  ( Z > - 0,19) = P ( Z < 0,19) = 0,5753

Para la segunda cuestión la solución
: d)

La respuesta a) es cierta puesto que el TCL dice que las medias muestrales a partir de cualquier distribución acontecen normalmente distribuidas a medida que aumenta la medida de la muestra.

La respuesta b) es cierta puesto que la desviación estándar de una variable binaria de media π es π (1 −π ) .

La respuesta c) es cierta puesto que por aplicación del TCL para que la media muestral de una distribución no normal siga una distribución normal hace falta que la medida de la muestra sea grande.

La respuesta d) es falsa puesto que cuando n>100, la media o proporción muestral de una variable binaria está normalmente distribuida.

viernes, 12 de abril de 2013

Estadísticos descriptivos de una variable



En esta entrada se expone el siguiente problema:

La línea aérea LA quiere optimizar el rendimiento de su trayecto Barcelona – Madrid en hora punta (de las 7:00 a las 9:00). Concretamente querría minimizar el número de asientos vacíos en este trayecto y franja horaria. A tal efecto, se ha contabilizado el número de asientos vacíos en 30 vuelos de estas características (franja horaria y línea aérea) de Barcelona en Madrid. La información obtenida es la siguiente:

5, 6, 9, 8, 8, 5, 9, 9, 7, 6, 6, 7, 6, 7, 7 9, 9, 8, 9, 8, 6, 6, 5, 7, 6, 7, 7, 8, 7, 9

Se pide:

a) Calcular con Minitab los estadísticos descriptivos de la variable número de asientos vacíos y representáis los datos con un diagrama de caja. Engancháis los resultados obtenidos en vuestro documento de respuestas.
b) ¿Teniendo en cuenta los resultados del apartado anterior, qué número de asientos vacíos sería más representativo del trayecto estudiado?
c) Disponemos de otro conjunto de datos, correspondiendo al número de personas que viajan (en un vuelo de las características examinadas) con alguno sentando vacío al lado, del cual sabemos que la desviación típica muestral es s = 10,9. ¿Podemos afirmar que estos segundos datos son más dispersas que las primeras?


a) La opción de menú de Minitab, Stat > Basic Statistics > Display Descriptive Statistics, nos permitirá obtener los estadísticos descriptivos. Hemos creado una variable que se llama Asientos, donde se encuentra la información, en términos de asientos vacíos, del enunciado. Pasamos la columna Asientos a la caja Variables y validamos, obteniendo
Variable N Mean Median TrMean StDev SE Mean

Asientos 30 7,200 7,000 7,214 1,324 0,242

Variable Minimum Maximum Q1 Q3
Asientos 5,000 9,000 6,000 8,000

Para construir el gráfico haremos uso de las opciones de menú Graph > Box Plot. Pasamos la variable Asientos a la columna 1, hila 1 y validamos. Obtendremos, 




b) Es una distribución prácticamente simétrica, tal y cómo se observa a la representación gráfica anterior. Así pues podemos afirmar que tanto la mediana como la media serán medidas de centralidad representativas de la distribución. Diremos que el número de asientos vacíos más representativo de este trayecto es 7, pues la mediana es igual a 7 y la media es igual a 7,2 asientos vacíos.


c) No podemos afirmar que los datos con desviación típica sean más dispersas que las descritas anteriormente pues las muestras se expresan en unidades diferentes: el grupo de observaciones que analizamos cuenta el número de asientos vacíos pero este segundo grupo examina el número de personas que viajan con alguno sentando vacío. Necesitaríamos  la media de la segunda muestra porque así, mediante el coeficiente de Variación de Pearson, poder compararlas.

jueves, 11 de abril de 2013

Problema de estandarización de una variable



En esta entrada vamos a exponer un problema que dice así, una facultad recibe solicitudes de ingreso para el siguiente curso. Los aspirantes se someten a pruebas selectivas puntuadas entre 0 y 1000. Se considera que la calificación obtenida por un estudiante elegido al azar entre los que hacen la prueba selectiva sigue una distribución normal de media 550 y desviación típica 100.

a) Si la facultad decide admitir el 25% de los aspirantes con calificaciones más altas de la distribución total, ¿cuál será la nota de corte?
b) Se ha de determinar el porcentaje de estudiantes que obtienen una puntuación entre 620 y 740.
c) Sabemos que en la convocatoria de este año, 350 estudiantes han obtenido una puntuación entre 400 y 450 puntos. Entonces, ¿cuántos aspirantes obtuvieron una puntuación entre 620 y 740?

Indicación: para resolver este apartado es conveniente que primero determines el número de estudiantes que se han presentado a la convocatoria.

a) Sea X la nota obtenida en la prueba selectiva por un estudiante elegido al azar entre los que hacen la prueba. Del enunciado tenemos que X se distribuye según una N(550,100). La nota de corte tiene que ser un valor x0 tal que 0,25=P(X > x0) pues la facultad decide admitir sólo el 25% de los estudiantes con calificación más alta. Al estandarizar, podemos formular equivalentemente la condición como 0,25 = P(Z > (x0-550)/100) = P(Z < (550-x0)/100), donde Z denota una distribución N(0,1) y en la última igualdad se ha hecho uso de la simetría de la normal estándar. Si consultamos la tabla de la N(0,1) tenemos que (550-x0)/100 ≈ -0,675 y por lo tanto x0 ≈ 550 + 0,675•100 = 617,5 puntos y la nota de corte es 618 puntos.

b) Para determinar el porcentaje de estudiantes que obtienen una puntuación entre 620 y 740 puntos necesitamos calcular P(620 < X < 740) = P((620-550)/100 < Z < (740-550)/100) = P(0,7 < Z < 1,9) donde nuevamente se ha aplicado estandarización. De la mesa de la N(0,1) vemos que P(Z ≤ 0,7) = 0,75804 y que P(Z ≤ 1,9) = 0,97128. Por lo tanto P(0,7 < Z < 1,9) = 0,97128 - 0,75804 = 0,21324 y el porcentaje pedido es del 21% de los estudiantes.

c) El número total de estudiantes N que se han presentado a la prueba se puede deducir del hecho que 350 aspirantes han obtenido una puntuación entre 400 y 450 puntos. Con similares argumentos a los del apartado anterior, se tiene que P(400 < X < 450) = P(-1,5 < Z < -1) = 0,15866 - 0,06681 = 0,09185. Tiene que ser 350/N ≈ 0,09185 y por lo tanto N ≈ 350/0,09185 = 3810,5607 ≈ 3811 personas. Cómo del apartado anterior sabemos que el 21% de los presentados obtienen una puntuación entre 620 y 740, podemos afirmar que en esta convocatoria han sido 3811∙0,21324 = 812,65764 ≈ 812 personas.

miércoles, 10 de abril de 2013

Cuestiones sobre distribución normal estándar



En esta entrada vamos a considerar que los beneficios anuales (medidos en miles de euros) de las empresas de un cierto sector siguen una distribución aproximadamente normal de media 10 y desviación estándar 2. Si denotamos por Z una distribución normal estándar, ¿qué porcentaje aproximado de empresas obtienen beneficios por encima de 7000 euros?
a) 7%, que podemos calcular como P( Z < (10-7)/2 ) = 0,06681
b) 7%, que podemos calcular como P( Z < (7-10)/2 ) = 0,06681
c) 93%, que podemos calcular como P( Z < (10-7)/2 ) = 0,93319
d) 93%, que podemos calcular como P( Z < (7-10)/2 ) = 0,93319

Segundo, para una distribución N(µ, σ), qué de las siguientes afirmaciones es falsa. Aproximadamente,

a) el 95% de las observaciones se encuentran a una distancia menor a 2∙σ de µ
b) el 5% de las observaciones se encuentran a una distancia superior a 2∙σ de µ
c) el 97,5% de las observaciones se encuentran a una distancia menor a 2 ∙σ de µ
d) el 2,5% de las observaciones resultan superiores a µ + 2∙σ

 Solución primera cuestión: c)

Sea X la variable que mide (en miles de euros) los beneficios de las empresas del sector; del enunciado conocemos que X se distribuye según una ley N(10, 2). Estamos interesados en P(X > 7).

Las opciones a) y b) tienen que ser descartadas inicialmente pues 7 es inferior a la media de la distribución y, por lo tanto P(X > 7), es superior a P(X > 10) = 0,5 y por lo tanto el porcentaje pedido es superior al 50%.
Estandarizando tenemos que P(X > 7) = P(Z > (7-10)/2) donde Z es una variable distribuida según una N(0,1). Si recordamos la simetría de la distribución normal estándar, P(Z > (7-10)/2) = P(Z < (10-7)/2) = 0,9332 y por lo tanto la opción correcta es la c).

A la segunda cuestión: c)

Según la regla del 68-95-99,7, el 95% de las unidades de la población tienen valores entre la media menos dos desviaciones estándar y la media más dos desviaciones estándar, el que valida la opción a). Observamos que por la misma razón la opción b) es cierta pues el 5% de las observaciones restantes quedarían , o bien por sobre µ + 2∙σ o bien por debajo de µ - 2∙σ. Esta repartición del 5% restante es simétrica resultando el 2,5% de las unidades de la población por sobre µ + 2∙σ y el 2,5% por debajo de µ - 2∙σ con el que la opción d) también es cierta. La afirmación falsa era pues la c)

Observamos que si que sería cierto el hecho que el 97,5% de las observaciones resulta inferior a µ + 2∙σ pero no todas estas se encuentran a una distancia menor a 2∙σ de µ: por ejemplo µ - 3∙σ es claramente inferior a µ + 2∙σ pero su distancia a µ es igual a 3∙σ.

martes, 9 de abril de 2013

Cuestiones sobre desviación estándar y distribución asimétrica



En esta entrada vamos a exponer dos ejemplos tipo test sobre desviación estándar y sobre distribución asimétrica a la derecha.

 Un arquitecto no conoce con certeza el número de días necesario para finalizar un cierto proyecte “tipo” (por ejemplo, la reforma completa de un baño) pero estima que en media se necesitan 15 días con una varianza de 4 días2 . Si los costes de la mano de obra ascienden a 200 euros al día, cuál será la desviación estándar σ del coste en mano de obra necesario para finalizar el proyecto?

a)      σ = 100 euros
b) σ = 400 euros
c) σ = 800 euros
d) σ = 3000 euros

 Solución: b)

Para determinar el coste necesario para finalizar lo proyecto tipo, estamos realizando una transformación de los datos que consiste a multiplicar el número de días necesarios por el coste diario en mano de obra, es decir por 200. Por otra banda, del enunciado conocemos que la desviación estándar del número de días necesarios es 2. Así, la desviación estándar de los costes necesarios en mano de obra para finalizar el proyecto es 200•2 = 400 y la opción correcta es la b).


Segundo,  Es conocido que la distribución de una cierta variable es asimétrica a la derecha. Al calcular las medidas de centro se han obtenido los valores 2,8 y 3,4 pero no hemos anotado cuál corresponde a la media aritmética y qué a la mediana. Entonces, cuáles de las siguientes afirmaciones es cierta:

a) 2,8 es la media aritmética y 3,4 es la mediana
b) 2,8 es la mediana y 3,4 es la media aritmética
c) No puede ser que la mediana y la media aritmética sean diferentes
d) Es imposible responder sin tener la representación gráfica de la distribución


Solución: b)

Cuando la distribución es asimétrica, la media aritmética siempre es arrastrada hacia la cola de la distribución. En el caso de una distribución que es asimétrica hacia la derecha, la media aritmética es más alta que la mediana y la respuesta correcta es la b).