Как найти выбросы в наборе данных без написания кода (Руководство 2026)

Вы можете находить выбросы без написания кода, используя правило IQR, z-оценки или диаграмму «ящик с усами» — все три метода работают в электронных таблицах. Правило IQR отмечает значения, которые выходят за пределы квартилей более чем на 1,5 межквартильного размаха; z-оценки отмечают значения, отклоняющиеся от среднего более чем на три стандартных отклонения. Они часто расходятся в результатах, и понимание причин этого — и есть настоящее мастерство.
Найти выброс — это лишь простая половина дела. Решение о том, что с ним делать, определяет, насколько честным будет ваш анализ, и ни один метод не даст вам готового ответа.
В этом руководстве объясняется, почему два стандартных метода расходятся в результатах, и описываются три способа обнаружения выбросов без кода. Затем мы рассмотрим, как решить, стоит ли удалить конкретный выброс, оставить его или представить в отчете отдельно.
Почему работа с выбросами сложнее, чем простое «удалите их»
Два стандартных метода расходятся по своей сути
Правило IQR работает на основе квартилей, которые привязаны к позиции. Ему не важно, насколько экстремально значение, важна лишь его позиция в отсортированном ряду. Это делает метод устойчивым к искажениям со стороны тех самых выбросов, которые он ищет.
Z-оценки рассчитываются на основе среднего значения и стандартного отклонения, а на оба этих показателя сильно влияют экстремальные значения. Одно огромное значение раздувает стандартное отклонение, что уменьшает каждую z-оценку — включая его собственную. На небольшом наборе данных один резкий выброс может таким образом «замаскироваться».
Вот почему в одном и том же столбце может быть обнаружено четыре выброса по методу IQR и только один по z-оценке. Эти методы не противоречат друг другу — они просто измеряют разные вещи.
Решение не является чисто статистическим
Транзакция на сумму $2 млн в файле с заказами по $200 будет отмечена любым методом. Но нужно ли ее удалять, зависит от фактов, к которым ни у одного алгоритма нет доступа.
Если это ошибка ввода данных с неверно поставленной запятой, удалите ее. Если это реальная корпоративная сделка, то, удалив ее, вы исключите из анализа своего самого важного клиента. Если это тестовая транзакция, которую забыли очистить, удалите ее и проверьте наличие других подобных записей. Три разных действия при абсолютно одинаковом сигнале системы.
Форма распределения нарушает исходные допущения
Оба стандартных метода предполагают распределение, близкое к колоколообразному. Однако доходы, просмотры страниц, стоимость заказов и длительность сессий обычно имеют асимметричное распределение с длинным правым хвостом, где высокие значения являются нормой, а не исключением.
Если применить правило z-оценки к такому столбцу, вы пометите как выбросы значительную часть совершенно обычных данных. Решение состоит в том, чтобы сначала проверить форму распределения и рассмотреть возможность логарифмического преобразования или использования отсечения по перцентилям.
Чем вы за это платите
Средние показатели, которые никого не описывают. Одно экстремальное значение может сдвинуть среднее арифметическое настолько сильно, что оно окажется за пределами диапазона, в котором на самом деле находится большая часть ваших данных. А ведь решения принимаются именно на основе этого числа.
Графики с нечитаемой осью. Одно значение, которое в десять раз больше остальных, сжимает все остальные данные в плоскую линию у самого низа. График технически верен, но не несет никакой информации.
Тихое удаление. Худший сценарий — когда кто-то молча удаляет «неудобные» строки перед отправкой файла. Никто из последующих пользователей не узнает, что база данных изменилась, а результат будет невозможно воспроизвести.
Три способы найти выбросы без кода
Вариант 1: Правило IQR
Используйте функцию QUARTILE, чтобы получить первый и третий квартили, а затем вычтите один из другого для расчета межквартильного размаха. Помечайте все, что ниже Q1 минус 1,5 × IQR или выше Q3 плюс 1,5 × IQR.
Этот метод используется по умолчанию не просто так: он устойчив к экстремальным значениям и не требует допущений о характере распределения. На сильно асимметричных данных он все же может избыточно помечать правый хвост, поэтому обязательно проверяйте форму распределения, прежде чем доверять полученным результатам.
Вариант 2: Z-оценки
Вычислите среднее значение и стандартное отклонение с помощью функции STDEV.P, а затем рассчитайте, на сколько стандартных отклонений каждое значение отстоит от среднего. Обычно пороговым значением считается отклонение более чем на три.
Этот метод хорошо работает на относительно симметричных данных и дает вам величину отклонения, а не просто бинарную метку «да/нет», что полезно для ранжирования. Однако он ненадежен на малых выборках и асимметричных столбцах.
Вариант 3: Диаграмма «ящик с усами»
Постройте диаграмму «ящик с усами» для нужного столбца и посмотрите на точки за пределами «усов». В Excel для построения этой диаграммы используется то же правило 1,5 × IQR, поэтому результат совпадет с Вариантом 1. Разница в том, что вы одновременно видите и форму распределения.
Это самый быстрый способ проверить, применимы ли вообще два других метода. Если «ящик» вплотную прижат к одному из краев и имеет длинный хвост, относитесь к любым пороговым правилам с подозрением.
В чем все три метода упираются в один и тот же потолок
Каждый метод возвращает список отмеченных строк. Но ни один из них не скажет вам, какие из меток указывают на ошибки ввода, какие — на реальные экстремальные значения, а какие просто свидетельствуют об асимметрии данных, а не об их «загрязненности».
Чтобы ответить на этот вопрос, нужно изучить отмеченные строки в контексте. Что еще содержится в этой строке? Группируются ли они в один период времени или поступают из одной исходной системы? Появляется ли один и тот же клиент неоднократно? Это уже исследование, а не вычисления, и именно на него уходит основное время.
Как находить выбросы с помощью Powerdrill Bloom
Шаг 1: Загрузите данные
Загрузите файл Excel или CSV. Powerdrill Bloom профилирует каждый столбец сразу после загрузки, поэтому форма распределения и экстремальные значения видны еще до того, как вы выберете метод обнаружения.
Шаг 2: Опишите проверку на естественном языке
Спросите напрямую: «отметь значения за пределами 1,5 межквартильного размаха в этом столбце, а затем покажи мне строки целиком, чтобы я мог видеть контекст». Задавайте уточняющие вопросы, которые помогут принять окончательное решение: группируются ли отмеченные строки по дате или источнику, повторяется ли один и тот же идентификатор и как изменятся сводные статистические показатели, если исключить эти строки.
Шаг 3: Экспортируйте график, отчет или презентацию
Выгрузите диаграмму «ящик с усами», таблицу отмеченных строк с их контекстом или текстовую заметку с указанием того, какие строки были исключены и почему.
Почему это лучше ручного поиска выбросов
| Работа в таблицах | Powerdrill Bloom | |
|---|---|---|
| Сравнение результатов IQR и z-оценки | Два набора формул, сопоставление вручную | Просто запросите оба варианта |
| Просмотр контекста вокруг отмеченного значения | Фильтрация и прокрутка | Выводится вместе со строкой |
| Предварительная проверка формы распределения | Построение гистограммы | Профилируется при загрузке |
| Тестирование влияния исключения данных | Дублирование листа | Запрос обеих версий |
Последняя строка важнее всего. Честный способ работы с неоднозначными выбросами — представить результаты как с ними, так и без них. Пусть читатель сам увидит, зависит ли вывод от одной-единственной строки. В электронных таблицах для такого сравнения приходится перестраивать все заново, поэтому обычно этого никто не делает.
Лучшие практики: как решить, что делать с выбросом
Проведите расследование перед исключением. Изучите строку целиком. Ошибка в знаках после запятой, тестовая запись и реальный крупный клиент выглядят абсолютно одинаково, если смотреть только на один столбец.
Никогда не удаляйте данные молча. Если вы исключаете строки, укажите их количество и причину в том же документе, где приводится результат. Анализ, база которого изменилась без каких-либо пояснений, невозможно воспроизвести.
Представляйте обе версии, если это важно. Если выводы меняются на противоположные из-за одного значения, то именно это и является главным открытием, а не досадной помехой, которую нужно поскорее убрать.
Проверяйте форму распределения перед выбором порога. Для асимметричных столбцов требуются отсечения по перцентилям или логарифмическое преобразование, а не правило z-оценки.
Следите за скоплениями данных. Несколько выбросов, зафиксированных в один день или поступивших из одного источника, обычно указывают на проблему в процессе передачи данных, а не на действительно уникальных клиентов. Этот случай подробно описан в нашем руководстве по очистке и дедупликации данных.
Заключение
Поиск выбросов без написания кода сводится к трем инструментам. Правило IQR — это надежный вариант по умолчанию; z-оценки подходят для относительно симметричных данных, когда важна величина отклонения; а диаграмма «ящик с усами» позволяет проверить, выполняются ли эти допущения. Будьте готовы к тому, что результаты разойдутся, и воспринимайте это расхождение как ценную информацию.
Но то, что не может сделать ни один метод — это принять решение. Если ваша работа с выбросами заканчивается на этапе разметки столбца, потому что изучать каждую строку вручную слишком долго, попробуйте Powerdrill Bloom для анализа вашего файла. Также посетите нашу страницу, посвященную очистке данных с помощью ИИ, ознакомьтесь с руководством по расчету описательной статистики и тем, как превратить CSV в график.
Часто задаваемые вопросы
Что считается выбросом в наборе данных?
Традиционно это значение, выходящее за пределы 1,5 межквартильного размаха от первого или третьего квартиля, либо отклоняющееся более чем на три стандартных отклонения от среднего значения. Оба этих правила являются скорее соглашениями, чем строгими законами, и выбор подходящего зависит от того, являются ли ваши данные относительно симметричными или асимметричными.
Как найти выбросы в Excel без написания кода?
Используйте функцию QUARTILE для построения границ IQR и пометки значений за их пределами, либо рассчитайте z-оценки с помощью среднего значения и функции STDEV.P. Диаграмма «ящик с усами» визуально дает тот же результат IQR, одновременно показывая форму распределения.
Стоит ли удалять выбросы из анализа?
Только после того, как вы установите причину их появления. Ошибки ввода данных и тестовые записи следует удалить; реальные же экстремальные значения обычно удалять не стоит, так как это приведет к потере важной информации. В неоднозначных ситуациях представляйте результаты в обоих вариантах.
Почему IQR и z-оценка отмечают разные значения?
Метод IQR основан на квартилях, которые экстремальные значения не могут исказить. Z-оценки рассчитываются на основе среднего значения и стандартного отклонения, которые как раз подвержены искажению из-за экстремальных значений. Достаточно большая величина раздувает стандартное отклонение и тем самым может «замаскировать» саму себя.
Что делать, если мои данные асимметричны, а не имеют колоколообразную форму?
Стандартные пороговые значения избыточно помечают длинный хвост в асимметричных столбцах (например, при анализе доходов или стоимости заказов). Используйте отсечения по перцентилям или предварительно выполните логарифмическое преобразование столбца, а также обязательно проверяйте форму распределения перед выбором любого правила.