Super Sale WeekClaude Skills — 20% OFF
Tips

Cómo encontrar valores atípicos en un conjunto de datos sin escribir código (Guía 2026)

Powerdrill Team·
Cómo encontrar valores atípicos en un conjunto de datos sin escribir código (Guía 2026)

Puede encontrar valores atípicos sin escribir código utilizando la regla del IQR, las puntuaciones z o un diagrama de caja; los tres métodos funcionan en una hoja de cálculo. La regla del IQR marca los valores que están a más de 1.5 rangos intercuartílicos de los cuartiles; las puntuaciones z marcan los valores a más de tres desviaciones estándar de la media. Con frecuencia no coinciden, y saber por qué es la verdadera habilidad.

Encontrar un valor atípico es la parte fácil. Decidir qué hacer con él es la parte que determina si su análisis es honesto, y ningún método responderá eso por usted.

Esta guía explica por qué los dos métodos estándar no coinciden y presenta tres formas de detectar valores atípicos sin código. Luego, aborda cómo decidir si un valor determinado debe eliminarse, conservarse o reportarse por separado.

Por qué los valores atípicos son más complejos que un simple "elimínelos"

Los dos métodos estándar no coinciden por diseño

La regla del IQR funciona a partir de los cuartiles, que son posicionales. No le importa qué tan extremo sea un valor, sino únicamente dónde se ubica en el orden jerárquico. Esto hace que sea resistente a ser distorsionada por los mismos valores atípicos que intenta buscar.

Las puntuaciones z funcionan a partir de la media y la desviación estándar, y ambas se ven arrastradas por los valores extremos. Un solo valor enorme infla la desviación estándar, lo que reduce cada puntuación z, incluida la suya propia. En un conjunto de datos de tamaño reducido, un único valor atípico drástico puede ocultarse de esta manera.

Por eso, una misma columna puede mostrar cuatro valores atípicos según el IQR y solo uno según las puntuaciones z. Los métodos no son inconsistentes; simplemente miden cosas diferentes.

La decisión no es estadística

Una transacción de $2 millones en un archivo de pedidos de $200 será marcada por todos los métodos. Si debe eliminarse o no depende de hechos a los que ningún método tiene acceso.

Si se trata de un error de ingreso de datos con un punto decimal mal colocado, elimínelo. Si es un acuerdo comercial legítimo, eliminarlo borraría de su análisis a su cliente más importante. Si es una transacción de prueba que alguien olvidó borrar, elimínela y busque otras similares. Tres acciones diferentes para una misma alerta.

La forma de la distribución rompe los supuestos

Ambos métodos estándar asumen una distribución aproximadamente en forma de campana. Los ingresos, las visitas a páginas, los valores de los pedidos y la duración de las sesiones suelen estar sesgados con una cola larga hacia la derecha, donde los valores altos son normales en lugar de excepcionales.

Si aplica la regla de la puntuación z a ese tipo de columnas, marcará una parte sustancial de datos perfectamente normales. La solución es verificar primero la forma de la distribución y considerar una transformación logarítmica o utilizar un corte basado en percentiles.

Lo que esto le cuesta

Promedios que no describen a nadie. Un solo valor extremo puede desplazar la media lo suficiente como para situarla fuera del rango donde realmente se encuentra la mayoría de sus datos. Y las decisiones se toman basándose en ese número.

Gráficos con un eje ilegible. Un valor diez veces mayor que el resto comprime todo lo demás en una línea plana cerca de la parte inferior. El gráfico es técnicamente correcto, pero no comunica nada.

Eliminación silenciosa. El peor escenario es que alguien elimine discretamente las filas inconvenientes antes de compartir el archivo. Nadie más adelante sabrá que la base de datos cambió, y el resultado no se podrá reproducir.

Tres formas de encontrar valores atípicos sin código

Option 1: La regla del IQR

Use QUARTILE para obtener el primer y tercer cuartil, y luego réstelos para obtener el rango intercuartílico. Marque cualquier valor por debajo de Q1 menos 1.5 × IQR o por encima de Q3 más 1.5 × IQR.

Este es el método predeterminado por una razón: es resistente a los valores extremos y no requiere supuestos sobre la distribución. En datos muy sesgados, aun así marcará en exceso la cola derecha, por lo que debe verificar la forma antes de confiar en el recuento.

Option 2: Puntuaciones z

Calcule la media y la desviación estándar con STDEV.P, y luego calcule a cuántas desviaciones estándar se encuentra cada valor de la media. El umbral habitual es más de tres.

Esto funciona bien en datos aproximadamente simétricos y le ofrece una magnitud en lugar de una simple marca de sí o no, lo cual es útil para realizar clasificaciones. No es confiable en muestras pequeñas ni en columnas sesgadas.

Option 3: Un diagrama de caja

Grafique la columna como un diagrama de caja y observe los puntos que quedan más allá de los bigotes. El diagrama de caja de Excel utiliza la misma convención de 1.5 × IQR, por lo que el resultado coincide con la Opción 1. La diferencia es que, al mismo tiempo, puede ver la forma de la distribución.

Esta es la forma más rápida de verificar si los otros dos métodos son adecuados. Si la caja se sitúa muy pegada a un extremo con una cola larga, desconfíe de cualquier regla de umbral.

Donde los tres métodos chocan con el mismo límite

Cada método devuelve una lista de filas marcadas. Ninguno de ellos le dice cuáles alertas son errores, cuáles son extremos reales y cuáles simplemente indican que la columna está sesgada en lugar de contener datos erróneos.

Responder a eso requiere analizar las filas marcadas en su contexto: qué más hay en esa fila, si se agrupan en un período de tiempo o sistema de origen específico, o si el mismo cliente aparece repetidamente. Eso es investigación, no cálculo, y ahí es donde realmente se va el tiempo.

Cómo encontrar valores atípicos con Powerdrill Bloom

Step 1: Suba sus datos

Suba el archivo de Excel o CSV. Powerdrill Bloom analiza el perfil de cada columna al recibirla, por lo que la forma de la distribución y los valores extremos son visibles antes de que elija un método de detección.

Subir una hoja de cálculo para encontrar valores atípicos en un conjunto de datos con Powerdrill Bloom

Step 2: Describa la comprobación en lenguaje natural

Pregunte directamente: marque los valores fuera de 1.5 rangos intercuartílicos en esta columna y luego muéstreme las filas completas para poder ver el contexto. Continúe con las preguntas que realmente resuelven la decisión: si las filas marcadas se agrupan por fecha o fuente, si se repite el mismo identificador y cómo cambian las estadísticas de resumen si se excluyen.

Step 3: Exporte el gráfico, informe o presentación

Extraiga el diagrama de caja, una tabla de las filas marcadas con su contexto o una nota escrita que registre qué filas se excluyeron y por qué.

Diagrama de caja con filas de valores atípicos marcadas exportado desde Powerdrill Bloom

Por qué esto supera a una revisión de detección manual

Ruta de la hoja de cálculo Powerdrill Bloom
Comparar los resultados de IQR y puntuación z Dos conjuntos de fórmulas, conciliación manual Solicitar ambos
Ver el contexto alrededor de un valor marcado Filtrar y desplazarse Se devuelve junto con la fila
Verificar primero la forma de la distribución Crear un histograma Perfil analizado al subir el archivo
Probar el impacto de la exclusión Duplicar la hoja Solicitar ambas versiones

La última fila es la más importante. La forma honesta de manejar un valor atípico ambiguo es reportar el resultado con y sin él. Permita que el lector vea si la conclusión depende de una sola fila. Esa comparación requiere reconstruir todo en una hoja de cálculo, razón por la cual casi nunca se hace.

Buenas prácticas: decidir qué hacer con un valor atípico

Investigue antes de excluir. Analice la fila completa. Un decimal mal colocado, un registro de prueba y un cliente grande real se ven idénticos en una sola columna.

Nunca elimine de forma silenciosa. Si excluye filas, indique cuántas y por qué en el mismo documento que contiene el resultado. Un análisis cuya base de datos cambió sin una anotación no es reproducible.

Reporte ambas versiones cuando sea importante. Si una conclusión cambia por completo dependiendo de un solo valor, ese es el hallazgo clave, no un inconveniente que deba ocultarse.

Verifique la forma antes de elegir un umbral. Las columnas sesgadas requieren cortes basados en percentiles o una transformación logarítmica, no una regla de puntuación z.

Esté atento a las agrupaciones. Varios valores atípicos que llegan en la misma fecha o desde la misma fuente suelen indicar un problema en el flujo de datos en lugar de clientes genuinamente inusuales. Nuestra guía para limpiar y eliminar duplicados de datos aborda este caso.

Conclusión

Encontrar valores atípicos sin código se reduce a tres herramientas. La regla del IQR es una opción predeterminada y resistente, las puntuaciones z se adaptan a datos aproximadamente simétricos cuando se desea conocer la magnitud, y un diagrama de caja verifica si se cumple alguno de los supuestos. Espere que no coincidan y trate esa discrepancia como información útil.

La parte que ningún método cubre es la toma de decisiones. Si su trabajo con valores atípicos se detiene en una columna marcada porque investigar cada fila es demasiado lento, pruebe Powerdrill Bloom con su archivo. Consulte también nuestra página de limpieza de datos con IA, la guía para ejecutar estadísticas descriptivas y cómo convertir un archivo CSV en un gráfico.

Preguntas frecuentes

¿Qué se considera un valor atípico en un conjunto de datos?

Por convención, un valor que se encuentra a más de 1.5 rangos intercuartílicos del primer o tercer cuartil, o a más de tres desviaciones estándar de la media. Ambas son convenciones más que leyes, y cuál se adapte mejor dependerá de si sus datos son aproximadamente simétricos o sesgados.

¿Cómo encuentro valores atípicos en Excel sin código?

Use QUARTILE para establecer los límites del IQR y marcar los valores que queden fuera de ellos, o calcule las puntuaciones z con la media y STDEV.P. Un diagrama de caja ofrece el mismo resultado del IQR de forma visual y muestra la forma de la distribución al mismo tiempo.

¿Debería eliminar los valores atípicos de mi análisis?

Solo después de determinar qué los causó. Los errores de ingreso de datos y los registros de prueba deben eliminarse; por lo general, los valores extremos reales no deben quitarse, ya que eliminarlos borra información real. Cuando sea ambiguo, reporte el resultado de ambas maneras.

¿Por qué el IQR y la puntuación z marcan valores diferentes?

El IQR funciona a partir de los cuartiles, los cuales no pueden ser distorsionados por los valores extremos. Las puntuaciones z funcionan a partir de la media y la desviación estándar, que sí se ven distorsionadas por los valores extremos. Un valor lo suficientemente grande infla la desviación estándar y puede llegar a enmascararse a sí mismo.

What if my data is skewed rather than bell-shaped?

Los umbrales estándar marcan en exceso la cola larga en columnas sesgadas, como los ingresos o el valor de los pedidos. Utilice cortes basados en percentiles o aplique primero una transformación logarítmica a la columna, y verifique la forma de la distribución antes de elegir cualquier regla.