Contenido dedicado a explicar el uso de diversas herramientas de la calidad para gestionar procesos y compartir metodologías de trabajo que promuevan la mejora continua.

Con la tecnología de Blogger.

lunes, 6 de noviembre de 2017

Estadística Descriptiva



A continuación se va a desarrollar un ejemplo utilizando la herramienta Excel para obtener información estadística a partir de un conjunto de datos e interpretar los resultados de la información.

Se debe aclarar la estadística descriptiva se caracteriza por establecer conclusiones a partir de un conjunto de datos extraído de la población.




Ejemplo:



Tenemos las ventas mensuales de cinco años de la empresa BURAN S.A.C., conforme se muestra en la siguiente tabla , expresado en unidades monetarias (UM):





 
En excel debemos activar la opción de Análisis de Datos , para ello se deberá seguir la siguiente secuencia:
 
En excel 2016, Ir al menú Archivo y hacer click en Opciones,  les aparecerá la siguiente pantalla:





Luego elegir la opción Complementos  y hacer click en el botón Ir...  , les aparecerá la siguiente ventana , colocar check en Herramientas para análisis y con ello se podrá visualizar en el menú datos la opción Análisis de Datos.




A partir de aquí podemos utilizar la herramienta Análisis de Datos , nos vamos al menú Datos y activamos la opción Análisis de Datos, elegimos la opción Estadística Descriptiva.




Luego seleccionamos el rango de datos y realizamos un check a la opción Resumen de Estadísticas y finalmente damos en aceptar y nos brindará la siguiente información:












Interpretación

- En promedio las ventas mensuales serán de 68,650 UM. Que sería nuestro parámetro poblacional.
- La mediana es de 68,000 UM . Este resultado se ubica exactamente en el centro de mis datos. Lo que significa que el 50% de mis datos tendrán valores  por encima y/o debajo de este parámetro.
- La moda es de 66,000 UM, lo que significa que la mayoría de ventas que se han realizado en el mes han sido de 66,000 UM
- La desviación estándar nos indica el grado de precisión de nuestro parámetro poblacional que en este caso es 4189.67

- El coeficiente de curtosis  es mayor a 1 , por lo tanto la dispersión de los datos de nuestra distribución normal  se asemeja a una curva de campana esbelta.
- El coeficiente de asimetría,  es mayor a 0 por lo que nos indica que nuestros datos ligeramente están sesgados a la derecha.

- El valor mínimo de las ventas mensuales fue de 60,000 UM
- El valor máximo de las ventas mensuales fue de 81,000 UM
- El rango de las ventas es de 21,000 UM.

- Para nuestro caso el error típico no aplica puesto que estamos utilizando todos los datos de la población.
Se considera este estadístico cuando se utiliza una muestra representativa y se quiere evaluar el grado de error de nuestros datos que representan a la población.

lunes, 30 de octubre de 2017

Distribución normal


Al recolectar los datos de una variable que puede ser continua, como por ejemplo la medición del peso, altura, dimensiones de un producto o una variable discreta cuando establecemos si un producto o servicio es conforme o no, la frecuencia de los datos tiende a acercarse hacia el centro y  si lo representamos gráficamente forma una curva de campana ( Distribución normal).

La variación de los datos se encuentran distribuidos a lo largo de la curva de campana como se puede apreciar en la gráfica anterior, sin embargo una proporción considerable de los datos tienden a centrarse en la gráfica.
Esta característica especial nos indica que en general cuando analizamos una muestra de datos significativa, todos tienden a acercarse  a una medida central, que nos permitirá entender el comportamiento de la variable.

La distribución normal tiene como elementos principales a la media y la desviación estándar.
La media (μ) es una medida de tendencia central , que representa el promedio de todos los datos del estudio.

La desviación estándar ( σ ) representa la dispersíón de los datos , es decir nos da una idea de cuánto puede variar alrededor de la media  los datos.

La notación que se suele utilizar para representar una distribución normal es la siguiente: N ( μ ,  σ )
Para establecer el rango de datos que puede variar nuestra medida central que representa a una población, en estadística se utiliza los niveles de confianza:

 +/ - 1σ  representa un nivel de confianza del 68% 
 +/ - 2σ  representa un nivel de confianza del 95%
 +/ - 3σ  representa un nivel de confianza del 99.7% 


 



Como se puede apreciar en la gráfica anterior para hallar el rango que representa nuestra dispersión de datos se resta y se suma la desviación estándar a la media poblacional.

A continuación, para desarrollar los conceptos que se están tratando se resolverá el siguiente ejercicio.

Los resultados de un examen siguen una distribución normal con media 78 y varianza 36. Se pide:
a) ¿Cuál es la probabilidad de que una persona que se presenta el examen obtenga una calificación superior a 72?
b) Si se sabe que la calificación de un estudiante es mayor que 72 ¿cuál es la probabilidad de que su calificación sea, de hecho, superior a 84?


Para empezar a resolver la pregunta "a" , desarrollaremos el concepto del estadístico Z.
Como pudieron apreciar en la curva de campana de la primera gráfica se observa que la medida central de los datos es cero y alrededor del mismo se distribuyen los datos.
En realidad el estadístico Z lo que hace es estandarizar los datos para que tengan una media = 0 y el Z de los datos en sí represente el número de desviaciones estándar que puede estar ubicado detrás o delante de la media.

Z = (observación - media ) / ( Desviación estándar ) 

a) En tal caso resolviendo: 

Z = ( 72 - 78 ) / 6  = - 1

Como podemos observar se está evaluando la calificación de 72 respecto de la media que es 78.
El problema nos da como dato la varianza que es 36 , para hallar la desviación estándar solo se deberá calcular la raíz cuadrada.

El valor de Z obtenido es -1.

Ahora vamos a calcular la probabilidad que representa este valor de Z respecto a nuestra distribución para poder contestar a la pregunta:
p ( x > 72 ) =  P ( Z > -1) 

Observando nuestra tabla Z acumulada podemos determinar el porcentaje:


Para nuestro caso p( Z > -1 ) =  1 - P (Z <= - 1)  =   P ( Z <= 1)
 
p ( x > 72 ) =  P ( Z > -1)  = 0.841



Es decir hay una probabilidad de  84.1 % de que un estudiante obtenga una calificación superior a 72.

b)  La probabilidad de que los resultados del examen sean mayor a 84 , si se sabe que la calificación de un estudiante es mayor a 72.

P ( x > 84 / x > 72) = ?

Primero calcularemos: 
P ( x > 84) 

Z = ( 84 - 78 ) / 6 = 1

es decir P ( x > 84)  = P (Z > 1) = 1 - P (Z < = 1),

Observando nuestra tabla Z acumulado podemos observar que P ( Z <= 1) = 0.841

Entonces la P (Z >1) = 1- 0.841 = 0.159


 Ahora aplicamos teorema de Bayes:

P (A / B ) = P (A y B ) / P (B)

P (x > 84 / x > 72 ) = P ( x > 84 y  x > 72 ) / P (x > 72) 

Resolviendo :
La intersección de  P ( x > 84 y  x > 72 ) = P (x > 84)

P (x > 84 / x > 72 ) = P ( x  > 84 ) / P ( x > 72) = 0.159 / 0.841 = 0.189

Por tanto concluimos que la probabilidad de que un estudiante supere la puntuación de 84 , sabiendo que el resultado de un estudiante es mayor a 72 es 18.9 %


lunes, 23 de octubre de 2017

Estandarización y Regresión Lineal



Resulta valioso tener un modelo que nos ayude a predecir el comportamiento de una variable , es por ello que muchas veces se utiliza como una  herramienta de pronóstico el modelo de regresión lineal.

Para entender su utilidad se desarrollará el siguiente ejemplo:

Se llevó a cabo un estudio para determinar la relación entre el número de años de experiencia (X) y el salario mensual , en miles de pesetas  (Y) ,entre los informáticos de una región española. Se tomó una muestra aleatoria de 17 informáticos y se obtuvieron los siguientes datos:


Se utilizará el software R para determinar la ecuación de regresión lineal del modelo.

En primer lugar se registran los datos históricos de las variables, en este caso la variable independiente ( X)  que sería los años de experiencia y la variable dependiente (Y) que sería el salario mensual en miles de pesetas.


Como se puede apreciar en la imagen anterior se ha creado en R la variable pronostico que se utilizará para determinar los coeficientes del modelo de regresión lineal.

Ahora colocamos el comando summary (pronostico) y seleccionamos todas las lineas programadas y le damos click en  Run y nos aparecerá la siguiente información:



La información mostrada nos indica el que el coeficiente de determinación R^2 (Multiple R- squared) es 0.8639 , lo que significa que en un 86%  la variación del salario puede ser explicado por  la variación de la variable : Años de experiencia.

Esta medida  de bondad es fuerte por lo tanto podemos utilizar los datos del modelo de regresión lineal que son:

Intercepto ( bo) = 17.87
pendiente (b1) = 0.72

Por tanto el modelo de regresión lineal sería :  Y= 17.87 + 0.72 X
Prácticamente lo que se ha hecho es estandarizar bajo un modelo matemático la predicción de la variable y , que antes para nosotros era incierta.

La gráfica que representa esta ecuación se puede mostrar en R con la siguiente linea de comandos:

plot (x,y)
abline(pronostico)



Es tambien necesario considerar la suma de los cuadrados del Error , que representa la variación dentro de nuestro modelo, es decir la diferencia que existe entre el Y pronosticado vs Y real.
Mientras la diferencia entre nuestro Y pronosticado y Y real es menor significa que seremos más precisos a la hora de predecir el comportamiento de la variable dependiente.

La suma de cuadrados del error  del modelo es calculado como la sumatoria de todos los
( Ydato - Y pronosticado ) ^2

Lo idea es minimizar la suma de cuadrados del error.
Para revisar la comparación de nuestro modelo vs los datos reales se puede apreciar en la siguiente gráfica en R con la siguiente linea de comando:

plot(pronostico)


La manera de ajustar nuestro modelo para que sea más preciso es incorporar otras variables que tambien  tengan impacto significativo en el salario , y evaluar los resultados como el coeficiente de determinación y analisis anova. Ya estaríamos hablando de un modelo de regresión múltiple.