martes, 27 de noviembre de 2018

rueba de hipótesis de la varianza

  1. 1. Pruebas de Hipótesis Prueba de Hipótesis para la Varianza Hernández Gayosso Alfonso Javier
  2. 2. Introducción En situaciones como control estadístico de la calidad, de antemano se conocen los parámetros de referencia del proceso bajo control. La actividad central para decidir si en un momento dado, el proceso esta bajo control, es la confrontación permanente de los datos obtenidos con la hipótesis sobre la centralidad del proceso (media) y sobre la magnitud de su variabilidad (varianza). La varianza como medida de dispersión es importante dado que nos ofrece una mejor visión de dispersión de datos.
  3. 3. Si se desea probar una hipótesis acerca de la varianza se puede hacer utilizando las medidas estadísticas con las que se construyo el intervalo de confianza σ2, esto es con la distribución ji- cuadrada. Así podremos determinar una franja de confianza, con base en la cual podríamos tomarse decisiones al respecto.
  4. 4. Para esto entonces debemos conocer nuestro estadístico de prueba considerando que la población sigue una distribución normal: • X2 = -------- • gl=n-1 ( n – 1 ) S2 σ2
  5. 5. Problema Considerando que el arribo de un metrobus a la estación Iztacalco es en promedio de 45 segundos y su variabilidad (varianza) debiera ser de 5 segundos. ¿Muestran los siguientes datos suficiente evidencia de que esta varianza ha cambiado? Use un α = 0.05 Tomamos el tiempo de una muestra periódica de 16 autobuses para controlar la periodicidad de arribo y se obtienen los siguientes datos en segundos:
  6. 6. 46.2 45.2 44.3 51.7 47.5 41.6 46.4 49.0 43.6 42.2 44.0 47.8 43.7 47.8 41.8 44.2 Datos dados en segundos Datos: X = 45.4375 S = 2.81 S2 = 7.91 1.-Ensayo de Hipótesis H0:σ 2 = 5 H1:σ2 > 5 2.-Nivel de significancia α= 0.05 3.-Regla de decisión Se rechaza H0 si y solo si X2 > 24.996
  7. 7. 4.-Tomamos la muestra y la aplicamos a nuestro estadístico de prueba: X 2 = ( n – 1 ) S2 σ2 = ( 16 – 1 ) 7.91 5 = 23.73 5.-la Hipótesis se acepta ya que se encuentra en la región de aceptación y podemos afirmar que nuestra variabilidad no ha cambiado de 5 segundos, pero se acerca mucho al valor critico y es complicado tomar una decisión.
- INTRODUCCION
Dentro del estudio de la inferencia estadística, se describe como se puede tomar una muestra aleatoria y a partir de esta muestra estimar el valor de un parámetro poblacional en la cual se puede emplear el método de muestreo y el teorema del valor central lo que permite explicar como a partir de una muestra se puede inferir algo acerca de una población, lo cual nos lleva a definir y elaborar una distribución de muestreo de medias muestrales que nos permite explicar el teorema del limite central y utilizar este teorema para encontrar las probabilidades de obtener las distintas medias maestrales de una población.
Pero es necesario tener conocimiento de ciertos datos de la población como la media, la desviación estándar o la forma de la población, pero a veces no se dispone de esta información.
En este caso es necesario hacer una estimación puntual que es un valor que se usa para estimar un valor poblacional. Pero una estimación puntual es un solo valor y se requiere un intervalo de valores a esto se denomina intervalote confianza y se espera que dentro de este intervalo se encuentre el parámetro poblacional buscado. También se utiliza una estimación mediante un intervalo, el cual es un rango de valores en el que se espera se encuentre el parámetro poblacional
En nuestro caso se desarrolla un procedimiento para probar la validez de una aseveración acerca de un parámetro poblacional este método es denominado Prueba de hipótesis para una muestra.
2.- HIPOTESIS Y PRUEBA DE HIPOTESIS
Tenemos que empezar por definir que es una hipótesis y que es prueba de hipótesis.
Hipótesis es una aseveración de una población elaborado con el propósito de poner aprueba, para verificar si la afirmación es razonable se usan datos.
En el análisis estadístico se hace una aseveración, es decir, se plantea una hipótesis, después se hacen las pruebas para verificar la aseveración o para determinar que no es verdadera.
Por tanto, la prueba de hipótesis es un procedimiento basado en la evidencia muestral y la teoría de probabilidad; se emplea para determinar si la hipótesis es una afirmación razonable.
Prueba de una hipótesis: se realiza mediante un procedimiento sistemático de cinco paso:
Siguiendo este procedimiento sistemático, al llegar al paso cinco se puede o no rechazar la hipótesis, pero debemos de tener cuidado con esta determinación ya que en la consideración de estadística no proporciona evidencia de que algo sea verdadero. Esta prueba aporta una clase de prueba más allá de una duda razonable. Analizaremos cada paso en detalle
Objetivo de la prueba de hipótesis.
El propósito de la prueba de hipótesis no es cuestionar el valor calculado del estadístico (muestral), sino hacer
un juicio con respecto a la diferencia entre estadístico de muestra y un valor planteado del parámetro.
3.- Procedimiento sistemático para una prueba de hipótesis de una muestra
.Paso 1: Plantear la hipótesis nula Ho y la hipótesis alternativa H1.
Cualquier investigación estadística implica la existencia de hipótesis o afirmaciones acerca de las poblaciones que se estudian.
La hipótesis nula (Ho) se refiere siempre a un valor especificado del parámetro de población, no a una estadística de muestra. La letra H significa hipótesis y el subíndice cero no hay diferencia. Por lo general hay un "no" en la hipótesis nula que indica que "no hay cambio" Podemos rechazar o aceptar Ho.
La hipótesis nula es una afirmación que no se rechaza a menos que los datos maestrales proporcionen evidencia convincente de que es falsa. El planteamiento de la hipótesis nula siempre contiene un signo de igualdad con respecto al valor especificado del parámetro.
La hipótesis alternativa (H1) es cualquier hipótesis que difiera de la hipótesis nula. Es una afirmación que se acepta si los datos maestrales proporcionan evidencia suficiente de que la hipótesis nula es falsa. Se le conoce también como la hipótesis de investigación. El planteamiento de la hipótesis alternativa nunca contiene un signo de igualdad con respecto al valor especificado del parámetro.
Paso 2: Seleccionar el nivel de significancia.
Nivel de significacia: Probabilidad de rechazar la hipótesis nula cuando es verdadera. Se le denota mediante la letra griega α, tambiιn es denominada como nivel de riesgo, este termino es mas adecuado ya que se corre el riesgo de rechazar la hipótesis nula, cuando en realidad es verdadera. Este nivel esta bajo el control de la persona que realiza la prueba.

Si suponemos que la hipótesis planteada es verdadera, entonces, el nivel de significación indicará la probabilidad de no aceptarla, es decir, estén fuerade área de aceptación. El nivel de confianza (1-α), indica la probabilidad de aceptar la hipótesis planteada, cuando es verdadera en la población.

viernes, 9 de noviembre de 2018

¿Qué es un método no paramétrico?

Una prueba no paramétrica es una prueba de hipótesis que no requiere que la distribución de la población sea caracterizada por ciertos parámetros. Por ejemplo, muchas pruebas de hipótesis parten del supuesto de que la población sigue una distribución normal con los parámetros μ y σ. Las pruebas no paramétricas no parten de este supuesto, de modo que son útiles cuando los datos son considerablemente no normales y resistentes a transformaciones.
En la estadística paramétrica, se presupone que las muestras provienen de distribuciones totalmente especificadas caracterizadas por uno o más parámetros desconocidos sobre los cuales se desea hacer inferencias. En un método no paramétrico, se presupone que la distribución de la que proviene la muestra no está especificada y, con frecuencia, se desea hacer inferencias sobre el centro de la distribución. Por ejemplo, muchas pruebas de la estadística paramétrica, como la prueba t de 1 muestra, se realizan bajo el supuesto de que los datos provienen de una población normal con una media desconocida. En un estudio no paramétrico, se elimina el supuesto de normalidad.
Los métodos no paramétricos son útiles cuando no se cumple el supuesto de normalidad y el tamaño de la muestra es pequeño. Sin embargo, las pruebas no paramétricas no están completamente libres de supuestos acerca de los datos. Por ejemplo, es fundamental presuponer que las observaciones de las muestras son independientes y provienen de la misma distribución. Además, en los diseños de dos muestras, se requiere el supuesto de igualdad de forma y dispersión.
La prueba de Kolmogorov es una prueba de bondad de ajuste, es decir, del grado en que la distribución observada difiere de otra distribución. Es una alternativa a la prueba Ji Cuadrado de bondad de ajuste cuanto el número de datos es pequeño. La prueba no debe ser aplicada si hay muchos empates.
a) Supuestos. Los datos están medidos al menos a nivel ordinal.
b) Hipótesis Nula: No hay diferencias entre las distribuciones comparadas.
c) Estadístico de contraste: D (mayor diferencia entre las frecuencias relativas de las distribuciones).
d) Distribución del estadístico de contraste: Específico dependiendo de la distribución con que se compare la distribución observada.

Ejemplo
Desean saber si una muestra de debe datos pertenece a una población normalmente distribuida. Los datos (ordenados de menor a mayor) son:
b) Hipótesis Nula: No hay diferencia estadísticamente significativa entre la distribución de la población a que pertenece la muestra y la distribución Normal.
Hipótesis Alternativa: Hay diferencia estadísticamente significativa entre la distribución de la población a que pertenece la muestra y la distribución Normal.
c) Estadístico de contraste. Obtención del estadístico de contraste:
Tipificar la muestra:


Pruebas de bondad de ajuste y pruebas no parametricas

  1. 1. Estadística Inferencial I Unidad 4 Página 1 PRUEBAS DE BONDAD DE AJUSTE Y PRUEBAS NO PARAMETRICAS
  2. 2. Estadística Inferencial I Unidad 4 Página 2 4.1 BONDAD DE AJUSTE Las pruebas de bondad de ajuste tratan de verificar si el conjunto de datos se puede ajustar o afirmar que proviene de una determinada distribución. Las pruebas básicas que pueden aplicarse son: la ji-cuadrada y la prueba de Smirnov-Kolmogorov. Ambas pruebas caen en la categoría de lo que en estadística se denominan pruebas de “Bondad de Ajuste” y miden, como el nombre lo indica, el grado de ajuste que existe entre la distribución obtenida a partir de la muestra y la distribución teórica que se supone debe seguir esa muestra. Ambas pruebas están basadas en la hipótesis nula de que no hay diferencias significativas entre la distribución muestral y la teórica, H0 es la distribución que se supone sigue la muestra aleatoria. La hipótesis alternativa siempre se enuncia como que los datos no siguen la distribución supuesta. Hablamos de bondad de ajuste cuando tratamos de comparar una distribución de frecuencia observada con los valores correspondientes de una distribución esperada o teórica. Algunos estudios producen resultados sobre los que no podemos afirmar que se contribuyen normalmente, es decir con forma acampanada concentradas sobre la media. Su fórmula es la siguiente: 𝑓𝑜𝑖= Valor observado en la i-ésimo dato. 𝑓𝑒𝑖= Valor esperado en la i-ésimo dato. 𝑘 = Categorías o celdas. 𝑚 = Parámetros estimados sobre la base de los datos de la muestra Los grados de libertad vienen dados por: gl= K-m-1.      k i e eo i ii f ff 1 2 2 
  3. 3. Estadística Inferencial I Unidad 4 Página 3 Criterio de decisión es el siguiente: Se rechaza H0 cuando 2 1; 2  mKt . En caso contrario se acepta. Donde t representa el valor proporcionado por las tablas, según el nivel de significación elegido. Cuanto más se aproxima a cero el valor de chi-cuadrada, más ajustadas están ambas distribuciones.
  4. 4. Estadística Inferencial I Unidad 4 Página 4 4.1.1 ANALISIS JI-CUADRADA Es considerada como una prueba no paramétrica que mide la discrepancia (bondad de ajuste) entre una distribución observada a partir de la muestra y otra teórica que se supone debe seguir esa muestra, indicando en qué medidas las diferencias existentes entre ambas se deben al azar en el contraste de la hipótesis. Esta prueba se basa en la hipótesis nula H0 de que no hay diferencias significativas entre la distribución muestral y la teórica. La estructura básica de la prueba para la bondad de ajuste se muestra en la siguiente tabla: Clases Frecuencia observada Frecuencia esperada 1 Foi1 Fe1 2 Foi2 Fe2 . . . . . . k Foik Fek Total n n Donde para calcular la Frecuencia esperada se tiene: 𝜒2 = ( 𝑓𝑜𝑖 − 𝑓𝑒𝑖)2 𝑓𝑒𝑖 Fórmula para el análisis de ji-cuadrada 𝜒2 = ∑ ( 𝑓𝑜𝑖−𝑓𝑒𝑖)2 𝑓𝑒𝑖 𝑘 𝑖−1 Interpretación: cuanto mayor sea el valor de ji-cuadrada menos creíble es la hipótesis nula H0. De la misma forma, cuanto más se aproximan acero el valor de 𝜒2 , más ajustadas están las distribuciones. 𝜒2 = 0 H0 se acepta 𝜒2 > 0 H0 se rechaza 𝑓𝑜𝑖 = 𝑡𝑜𝑡𝑎𝑙 𝑑𝑒 𝑣𝑎𝑙𝑜𝑟𝑒𝑠 𝑑𝑒𝑙 𝑖𝑛𝑡𝑒𝑟𝑣𝑎𝑙𝑜 𝑓𝑒𝑖 = 𝑛𝑢𝑚𝑒𝑟𝑜 𝑒𝑠𝑝𝑒𝑟𝑎𝑑𝑜 𝑑𝑒 𝑣𝑎𝑙𝑜𝑟𝑒𝑠 𝑒𝑛 𝑒𝑙 𝑖𝑛𝑡𝑒𝑟𝑣𝑎𝑙𝑜 𝑘 = 𝑛𝑢𝑚𝑒𝑟𝑜 𝑑𝑒 𝑖𝑛𝑡𝑒𝑟𝑣𝑎𝑙𝑜𝑠 𝑑𝑒 𝑐𝑙𝑎𝑠𝑒 𝑚 = 𝑛𝑢𝑚𝑒𝑟𝑜 𝑑𝑒 𝑚𝑢𝑒𝑠𝑡𝑟𝑎𝑠 𝑝𝑎𝑟𝑎 𝑒𝑙 𝑒𝑠𝑡𝑢𝑑𝑖𝑜
  5. 5. Estadística Inferencial I Unidad 4 Página 5 4.1.2 PRUEBA DE INDEPENDENCIA La prueba de independencia trata de la comparación de dos situaciones en las cuales podemos esperar que sean dependientes o independientes, esto quiere decir que, pueden o no estar relacionados sus datos debido a muchos factores que pueden influir en ellos, o bien, un problema no tenga relación con otro. Su objetivo es determinar si alguna situación es afectada por otra, basándose en datos estadísticos y valores probabilístico obtenidos de la fabulación de datos o de pronósticos por medio de formulas y tablas, para esto se basa en un nivel de significancia en un caso y en el otro a comparar, valiéndonos de tablas de contingencia para obtener frecuencias esperadas y poder aplicarlas, para así obtener datos comparativos que son determinantes en la decisión de independencia. Para todas las pruebas de independencia, las hipótesis son: H0: las dos variables de clasificación son independientes. H1: las dos variables de clasificación son dependientes. Los métodos para poner a prueba H0 contra H1 son idénticos a los usados para poner a prueba las diferencias entre proporciones poblacionales basados en la prueba de 𝝌2. De nuevo compararemos las frecuencias observadas con las esperadas, las obtenidas bajo el supuesto de que H0, para determinar que tan grande debe ser el alejamiento permitido para que la hipótesis de independencia pueda rechazarse. Si el valor del estadístico de prueba 𝝌2 es mayor o igual que el valor critico calculado, ya no podremos suponer que pueda resultar de dos variables de clasificación independientes, siendo esta la razón de que todas las pruebas de 𝝌2 sobre independencia sean de cola derecha.

miércoles, 26 de septiembre de 2018

La prueba de hipótesis que incluye la diferencia entre las medias de dos poblaciones o muestras se utiliza con más frecuencia para determinar si es razonable o no concluir que ambas son distintas entre sí; sin embargo, debe recordarse la definición de muestra, en que el interés se centra en quiénes (en los sujetos u objetos de estudio), que corresponde a un subgrupo de la población y depende del planteamiento inicial de la investigación. Para seleccionar una muestra, primero se debe definir la unidad de análisis (a quiénes se va a medir); por ello, se deben precisar con claridad el problema a investigar y los objetivos de la investigación.
Los tipos de muestra se dividen en dos ramas: muestras no probabilísticas y muestras probabilísticas. En las primeras, la elección de los elementos no depende de la probabilidad, sino de causas relacionadas con las características del investigador o del que selecciona la muestra, de modo que el procedimiento no es mecánico, ni se basa en fórmulas de probabilidad.
En las muestras probabilísticas, todos los elementos de la población tienen la misma posibilidad de ser escogidas. Esto se obtiene definiendo los siguientes elementos:
  1. Las características de la población.
  2. El tamaño de la muestra.
  3. La selección aleatoria de las unidades de análisis.
Es muy frecuente que en la investigación médica o de ciencias relacionadas con la salud se bua partir de muestras pareadas o no pareadas.
La media o promedio es la medida de tendencia central más utilizada y puede definirse como el promedio aritmético de una distribución. Se simboliza con X y es la suma de todos los valores dividida entre el número de casos.
Sólo se aplica a mediciones por intervalos o de razón. Carece de sentido para variables medidas en un nivel nominal u ordinal. La fórmula para la proporción muestral, como estimación de la proporción p de la población, es:

cursos mooc


jueves, 13 de septiembre de 2018

Distribución muestral de Proporciones

Existen ocasiones en las cuales no estamos interesados en la media de la muestra, sino que queremos investigar la proporción de artículos defectuosos o la proporción de alumnos reprobados en la muestra. La distribución muestral de proporciones es la adecuada para dar respuesta a estas situaciones. Esta distribución se genera de igual manera que la distribución muestral de medias, a excepción de que al extraer las muestras de la población se calcula el estadístico proporción (p=x/n en donde "x" es el número de éxitos u observaciones de interés y "n" el tamaño de la muestra) en lugar del estadísitico media.
Una población binomial está estrechamente relacionada con la distribución muestral de proporciones; una población binomial es una colección de éxitos y fracasos, mientras que una distribución muestral de proporciones contiene las posibilidades o proporciones de todos los números posibles de éxitos en un experimento binomial, y como consecuencia de esta relación, las afirmaciones probabilísticas referentes a la proporción muestral pueden evaluarse usando la aproximación normal a la binomial, siempre que np5 y 
n(1-p)
 5. Cualquier evento se puede convertir en una proporción si se divide el número obtenido entre el número de intentos.

Generación de la Distribución Muestral de ProporcionesSuponga que se cuenta con un lote de 12 piezas, el cual tiene 4 artículos defectuosos. Se van a seleccionar 5 artículos al azar de ese lote sin reemplazo. Genere la distribución muestral de proporciones para el número de piezas defectuosas.
Como se puede observar en este ejercicio la Proporción de artículos defectuosos de esta población es 4/12=1/3. Por lo que podemos decir que el 33% de las piezas de este lote están defectuosas.
El número posible de muestras de tamaño 5 a extraer de una población de 12 elementos es 12C5=792, las cuales se pueden desglosar de la siguiente manera:
Artículos Buenos
Artículos Malos
Proporción de artículos defectuoso
Número de maneras en las que se puede obtener la muestra
1
4
4/5=0.8
8C1*4C4=8
2
3
3/5=0.6
8C2*4C3=112
3
2
2/5=0.4
8C3*4C2=336
4
1
1/5=0.2
8C4*4C1=280
5
0
0/5=0
8C5*4C0=56
Total
792
Para calcular la media de la distribución muestral de proporciones se tendría que hacer la sumatoria de la frecuencia por el valor de la proporción muestral y dividirla entre el número total de muestras. Esto es:

Como podemos observar la media de la distribución muestral de proporciones es igual a la Proporción de la población.
p = P
También se puede calcular la desviación estándar de la distribución muestral de proporciones:
La varianza de la distribución binomial es 2= npq, por lo que la varianza de la distribución muestral de proporciones es 2p =(Pq)/n. Si se sustituten los valores en esta fórmula tenemos que:
 , este valor no coincide con el de 0.1681, ya que nos falta agregar el factor de corrección para una población finita y un muestreo sin reemplazo:
La fórmula que se utilizará para el cálculo de probabilidad en una distribución muestral de proporciones está basada en la aproximación de la distribución normal a la binomial . Esta fórmula nos servirá para calcular la probabilidad del comportamiento de la proporción en la muestra.

A esta fórmula se le puede agregar el factor de corrección de  si se cumple con las condiciones necesarias.
Ejemplo:
Se ha determinado que 60% de los estudiantes de una universidad grande fuman cigarrillos. Se toma una muestra aleatoria de 800 estudiantes. Calcule la probabilidad de que la proporción de la muestra de la gente que fuma cigarrillos sea menor que 0.55.

Solución:
Este ejercicio se puede solucionar por dos métodos. El primero puede ser con la aproximación de la distribución normal a la binomial y el segundo utilizando la fórmula de la distribución muestral de proporciones.

Aproximación de la distribución normal a la binomial:

Datos:
n=800 estudiantes
p=0.60
x= (.55)(800) = 440 estudiantes
p(x< 440) = ?
Media= np= (800)(0.60)= 480

p(x< 440) = 0.0017. Este valor significa que existe una probabilidad del 0.17% de que al extraer una muestra de 800 estudiantes, menos de 440 fuman cigarrillos.



Distribución Muestral de Proporciones

Datos:
n=800 estudiantes
P=0.60
p= 0.55
p(p< 0.55) = ?


 Observe que este valor es igual al obtenido en el método de la aproximación de la distribución normal a la binomial, por lo que si lo buscamos en la tabla de "z" nos da la misma probabilidad de 0.0017. También se debe de tomar en cuenta que el factor de corrección de 0.5 se esta dividiendo entre el tamaño de la muestra, ya que estamos hablando de una proporción.
La interpretación en esta solución, estaría enfocada a la proporción de la muestra, por lo que diríamos que la probabilidad de que al extraer una muestra de 800 estudiantes de esa universidad, la proporción de estudiantes que fuman cigarrillos sea menor al 55% es del 0.17%.

Ejemplo:
Un medicamento para malestar estomacal tiene la advertencia de que algunos usuarios pueden presentar una reacción adversa a él, más aún, se piensa que alrededor del 3% de los usuarios tienen tal reacción. Si una muestra aleatoria de 150 personas con malestar estomacal usa el medicamento, encuentre la probabilidad de que la proporción de la muestra de los usuarios que realmente presentan una reacción adversa, exceda el 4%.

  1. Resolverlo mediante la aproximación de la normal a la binomial


  2. Resolverlo con la distribución muestral de proporciones


  1. Aproximación de la distribución normal a la binomial:

  2. Datos:
    n=150 personas
    p=0.03
    x= (0.04)(150) = 6 personas
    p(x>6) = ?
    Media = np= (150)(0.03)= 4.5


    p(x>6) = 0.1685. Este valor significa que existe una probabilidad del 17% de que al extraer una muestra de 150 personas, mas de 6 presentarán una reacción adversa.


  3. Distribución Muestral de Proporciones
Datos:
n=150 personas
P=0.03
p= 0.04
p(p>0.04) = ?



Observe que este valor es igual al obtenido y la interpretación es: existe una probabilidad del 17% de que al tomar una muestra de 150 personas se tenga una proporción mayor de 0.04 presentando una reacción adversa.

Ejemplo:
Se sabe que la verdadera proporción de los componentes defectuosos fabricadas por una firma es de 4%, y encuentre la probabilidad de que una muestra aleatoria de tamaño 60 tenga:

  1. Menos del 3% de los componentes defectuosos.


  2. Más del 1% pero menos del 5% de partes defectuosas.

Solución:



  1. Datos:

  2. n= 60 artículos
    P=0.04
    p= 0.03
    p(p<0.03) = ?


    La probabilidad de que en una muestra de 60 artículos exista una proporción menor de 0.03 artículos defectuosos es de 0.2327.


  3. Datos:
n= 60 artículos
P=0.04
p= 0.01 y 0.05
p(0.01<p<0.05) = ?

 


prueba de hipotesis

http://www.geociencias.unam.mx/~ramon/EstInf/Clase13.pdf