Ящик с усами в статистике что такое
Как понимать Boxplot?
Чтобы характеризовать распределение числового признака часто используют среднеарифметическое. Но среднее указывает только на центр распределения и ничего не сообщает о форме, размахе вариации и наличии выбросов.
Боксплот — это способ визуализации о которым договорились статистики, чтобы в простой картинке передать всю необходимую информацию о распределении числовых переменных.
Вот, что показывает боксплот:
Медиана – это значение элемента в центре ранжированного ряда.
Например, если всех осьминогов выставить в порядке возрастания их оценок, то медианой будет та оценка, которую поставил осьминог в середине. А это значит, что половина осьминогов справа оценили вероятность покупки ниже, а другая половина (слева) выше, чем медианный.
Медиана меньше подвержена влиянию выбросов, поэтому в центре отображается именно она, а не среднеарифметическое.
Верхний квартиль – это такая оценка, выше которой только 25% оценок.
Нижний квартиль – это такое значение, ниже которого только 25% оценок.
Межквартильный размах (МКР) – это разница между 75% и 25% квартилем. Внутри этого диапазона лежит 50% наблюдений. Если диапазон узкий (как в случае с осьминогами), значит члены подгруппы единогласны в своих оценках. Если широкий – значит однородного мнения нет (как у цыплят).
Коротко: если p-value меньше 0.05, значит различия между подгруппами НЕ случайны (т.е. различия между подгруппам статистически значимы).
Диаграмма «ящик с усами» в статистике
Содержание:
Диаграмма «ящик с усами»
Построение диаграммы «Ящик с усами» рассмотрим на следующем примере
Задача пример №154
15 работников фирмы при сдаче экзамена по технике безопасности, получили следующие баллы:
13 9 18 15 14 21 7 10 11 20 5 18 37 16 17.
Представьте данную информацию в виде диаграммы «ящик с усами».
Решение:
1. Расположите данные в порядке возрастания, определите медиану и отметьте ее через .
3. Медианы половинок, называемые квартилями (здесь = 10,
= 18), разбивают данные на 4 части.
Разница длин левого и правого «уса» зависит от разницы значений данных в соответствующих частях.
Для построении диаграммы «ящик с усами» из заданной совокупности выделяют 5 значений:
Медиану , квартиль
, значение которого меньше медианы и является медианой нижней половины, квартиль
, значение которого больше медианы и является медианой верхней половины множества данных, наибольшее и наименьшее значения.
Шаги построения диаграммы «ящик с усами»
1. Проводится горизонтальная прямая.
2. В зависимости от диапазона изменения данных проводится деление.
4. От до
рисуется ящик.
5. Рисуем «усы» от : до минимального значения и от
до максимального значения.
Задача пример №155
Ниже представлены данные возраста участниц женской паралимпийской команды по волейболу
24, 30, 30, 22, 25, 22, 18, 25, 28, 30, 25, 27. Представьте данные в виде диаграммы «ящик с усами».
Решение:
1. Расположим данные и найдем медиану и квартили.
2. Изобразим числовую ось и отметим эти следующие данные.
Эта лекция взята из раздела решения задач по математике, там вы найдёте другие лекци по всем темам математики:
Другие темы которые вам помогут понять математику:
Присылайте задания в любое время дня и ночи в ➔
Официальный сайт Брильёновой Натальи Валерьевны преподавателя кафедры информатики и электроники Екатеринбургского государственного института.
Все авторские права на размещённые материалы сохранены за правообладателями этих материалов. Любое коммерческое и/или иное использование кроме предварительного ознакомления материалов сайта natalibrilenova.ru запрещено. Публикация и распространение размещённых материалов не преследует за собой коммерческой и/или любой другой выгоды.
Создание блочной диаграммы с ограничителями выбросов
Диаграмма «ящик с усами» показывает распределение данных по квартилям, выделяя их выбросы. В полях могут быть линии, протянутые вертикально под названием «усы». Эти линии указывают на отклонение за пределами верхнего и нижнего квартилей, и любая точка за пределами этих линий (усов) считается выбросом.
Диаграмма «ящик с усами» чаще всего используется в статистическом анализе. Например, с помощью нее можно сравнить результаты медицинских испытаний или экзаменационные баллы учащихся.
Создание диаграммы «ящик с усами»
Выделите данные (один или несколько рядов).
Значения на изображении ниже являются частью набора данных, на основе которого был создан показанный выше образец диаграммы.
В Excel выберите команды Вставка > Вставить диаграмму статистики > Ящик с усами, как показано на рисунке ниже.
Важно: В Word, Outlook и PowerPoint порядок действий немного другой.
На вкладке Вставка в группе Иллюстрации нажмите кнопку Диаграмма.
В диалоговом окне Вставка диаграммы на вкладке Все диаграммы выберите элемент Ящик с усами.
На вкладках Конструктор и Формат можно настроить внешний вид диаграммы.
Если они не отображаются, щелкните в любом месте диаграммы «ящик с усами», чтобы добавить на ленту область Работа с диаграммами.
Параметры диаграммы «ящик с усами»
Щелкните правой кнопкой мыши одно из полей на диаграмме, чтобы выбрать его, а затем в контекстном меню выберите пункт Формат ряда данных.
В области Формат ряда данных, выбрав Параметры ряда, внесите необходимые изменения.
(Руководствуйтесь информацией в таблице под приведенным ниже рисунком.)
Управление зазором между категориями.
Показывать внутренние точки
Показывать точки выбросов
Показывать маркеры медиан
Отображение маркеров медианы выбранного ряда.
Показывать линию медиан
Отображение линии, соединяющей медианы блоков в выбранном ряде.
Выберите метод вычисления медиан.
Инклюзивная медиана Медиана включается в вычисления, если N (число значений в данных) — нечетное число.
Исключающая медиана Медиана исключается из вычислений, если N (число значений в данных) — нечетное число.
Совет: Дополнительные сведения о диаграммах «ящик с усами», а также их пользе для визуализации статистических данных см. в этой записи о гисторамме, диаграммах Парето и «ящик с усами» блога группы разработчиков Excel. Дополнительные сведения о других новых типах диаграмм приведены в этой записи блога.
Создание диаграммы «ящик с усами»
Выделите данные (один или несколько рядов).
Значения на изображении ниже являются частью набора данных, на основе которого был создан показанный выше образец диаграммы.
На ленте на вкладке «Вставка» щелкните (значок статистической диаграммы) и выберите «Ящик с усами».
На вкладке «Конструктор диаграмм» и «Формат» можно настроить внешний вид диаграммы.
Если вкладки «Конструктор диаграмм» и «Формат» не вы видите, щелкните в любом месте диаграммы «ящик с усами», чтобы добавить их на ленту.
Параметры диаграммы «ящик с усами»
Щелкните одно из полей на диаграмме, чтобы выбрать его, а затем на ленте нажмите кнопку «Формат».
Внести нужные изменения можно с помощью инструментов на вкладке «Формат».
Диаграмма «ящик с усами» (boxplot) в Excel 2016
Excel 2016, как известно, обогатился новыми типами диаграмм. Одна такая, которая диаграмма Парето, уже была показана. В этот раз рассмотрим другую, чисто статистическую. Называется «ящик с усами» или «коробчатая диаграмма» (box-and-whiskers plot или boxplot).
Раньше я такие видел только в специализированных ПО, типа STATISTICA, и для того, чтобы нарисовать подобную диаграмму в Excel, нужно было изрядно потрудиться. Теперь она есть в стандартном наборе Excel.
Зачем нужна такая диаграмма? Допустим, есть выборка для анализа. А еще лучше несколько выборок, которые нужно сравнить. Для этого рассчитывают различные показатели. Однако к любому расчету всегда хочется добавить наглядности, чтобы мозг перешел в режим образного представления, а не довольствовался сухими цифрами и формулами. Поэтому основные характеристики ловко изображают на рисунке. Отличным вариантом будет как раз диаграмма «ящик с усами».
На рисунке показан формат по умолчанию. Как видно, сравниваются две выборки путем изображения двух «ящиков с усами».
Что здесь что обозначает?
Крестик посередине – это среднее арифметическое по выборке.
Линия чуть выше или ниже крестика – медиана.
Нижняя и верхняя грань прямоугольника (типа ящика) соответствует первому и третьему квартилю (значениям, отделяющим ¼ и ¾ выборки). Расстояние между 1-м и 3-м квартилем – это межквартильный размах (или расстояние).
Горизонтальные черточки на конце «усов» – максимальное и минимальное значение (без учета выбросов, см. ниже).
Отдельные точки – это выбросы, которые показываются по умолчанию. Если значение выходит за пределы 1,5 межквартильных размаха от ближайшего квартиля, то оно считается аномальным. Их можно скрыть (см. ниже настройки).
Во всей красе «ящик с усами» проявляется при сравнении выборок, в которых данные делятся на категории. Допустим, провели некоторый эксперимент среди мужчин и женщин. Есть данные до и после эксперимента по обоим полам. Для анализа потребуется вычислить различные показатели. А если к этому добавить диаграмму «ящик с усами», то результат будет весьма наглядным.
Отлично видно, что после проведения эксперимента данные по мужчинам в целом уменьшились, а данные среди женщин наоборот, увеличились. Это не значит, что выборки больше не нужно анализировать (сравнивать, проверять гипотезы и т.д.). Но наглядность сильно улучшает понимание. Перейдем к настройкам.
Настройки диаграммы «ящик с усами»
Общий вид диаграммы настраивается стандартно. Можно менять цвет, добавлять подписи и т.д. Для этого есть две контекстные вкладки на ленте (Конструктор и Формат). Но есть настройки, предназначенные специально для этой диаграммы.
Выбираем какой-либо ряд и жмем Ctrl+1. Либо два раза кликаем по какому-нибудь «ящику». Можно через правую кнопку Формат ряда данных…. Справа вылазит панель настроек.
Рассмотрим по порядку.
Боковой зазор – регулирует ширину ящиков и расстояние между ними.
Показывать внутренние точки. Если поставить галочку, то на оси, где расположены «усы», точками будут показаны все значения. Так хорошо видно распределение внутри групп.
Показывать точки выбросов – отражать экстремальные значения.
Выбросы – это точки, выходящие за пределы 1,5 межквартильных размаха.
Показать средние метки – среднее арифметическое (крестики). Стоят по умолчанию, но можно скрыть.
Показать среднюю линию – только для различных категорий. Показывает изменения по категориям.
Если добавить линии, то изменения после эксперимента станут видны еще лучше. В справке написано, что соединяются медианы, но на графике почему-то соединяются средние. Чудеса.
Своевременное использование диаграммы «ящик-усы» может дать весьма ценную и наглядную информацию. Аналитику, который использует специализированные программы или трудоемкие настройки Excel, будет очень приятно иметь такую диаграмму под рукой.
Как показано в ролике ниже, все делается очень быстро и просто.
Ящик с усами
Ящик с усами (англ. box-and-whiskers diagram or plot, box plot ) — график, использующийся в описательной статистике, компактно изображающий одномерное распределение вероятностей.
Такой вид диаграммы в удобной форме показывает медиану, нижний и верхний квартили, минимальное и максимальное значение выборки и выбросы. Несколько таких ящиков можно нарисовать бок о бок, чтобы визуально сравнивать одно распределение с другим, их можно рисовать горизонтально, либо вертикально. Расстояния между различными частями ящика позволяют определить степень распространения (дисперсии) и асимметрии в данных, и выявить выбросы.
Содержание
Компактность представления информации
График ящик с усами или ящичковая диаграмма был разработан Джоном Тьюки в 1970-х годах. По сути, ящик с усами — это быстрый способ изучения одного или нескольких наборов данных в графическом виде. Этот график может показаться более примитивным, чем, например, оценка гистограммы, но он имеет некоторые преимущества. Он занимает меньше места, и поэтому особенно полезен для сравнения распределений между несколькими группами или наборами данных. Кроме того, ящик с усами в своей первоначальной форме прост для построения.
Если на третьем графике, где показаны плотности распределения, нельзя толком ничего рассмотреть и сравнить, то на четвертом графике, отображающем ящики с усами, легко можно оценить медианы, квартили, степень распространения (дисперсии) и асимметрии в данных, и выявить выбросы. Асимметрию данных можно увидеть не только по медиане, смещенной к какому-либо концу ящика, но и по разной длине усов, выходящих из ящика.
График ящик с усами очень прост для понимания и именно поэтому часто используется в различных публикациях для отображения данных.
Построение
Все данные,выходящие за границы усов являются выбросами и отображаются на графике в виде точек, маленьких кружков или звездочек. Иногда на графике также отмечают среднее арифметическое.
В связи с тем, что не существует единого общего согласия относительно того, что считать основным графиком ящика с усами, при виде такого графика необходимо искать информацию в сопроводительном тексте относительно того, по каким параметрам ящик с усами строился.
Модификации ящика с усами
Следующая модификация получила название Histplot (График 6)
Теперь на графике отображаются плотности распределения по 3 точкам: медиане, первому и третьему квартилю. Соответственно вместо прямоугольника «ящик» теперь представляет собой 2 равнобедренные трапеции, имеющие смежное основание.
Дальнейшее изменение получило название Vaseplot от сравнения ящика с вазой (График 7)
На данном графике происходит отображение всех плотностей вероятностей от первого до третьего квартиля. Серые области представляют собой доверительный интервал медианы.
Ссылки
Полезное
Смотреть что такое «Ящик с усами» в других словарях:
ящик-с-усами — Способ визуализации множества данных, измеренных в интервальной шкале. Часто применяется в разведочном анализе данных. Выглядит как прямоугольник, на котором представлены максимальное и минимальное значения выборки, ее нижний и верхний квартили,… … Словарь социологической статистики
Статистика — Гистограмма (метод графических изображений) У этого термина существуют и другие значения, с … Википедия
Среднее значение — Среднее значение числовая характеристика множества чисел или функций; некоторое число, заключённое между наименьшим и наибольшим из их значений. Содержание 1 Основные сведения 2 Иерархи … Википедия
Среднее степенное — У этого термина существуют и другие значения, см. среднее значение. Среднее степени d (или просто среднее степенное) набора положительных вещественных чисел определяется как При этом по непрерывности доопределяются следующие величины … Википедия
Среднее геометрическое — Средним геометрическим нескольких положительных вещественных чисел называется такое число, которым можно заменить каждое из этих чисел так, чтобы их произведение не изменилось. Более формально: Среднее геометрическое двух чисел также называется… … Википедия
Мода (статистика) — У этого термина существуют и другие значения, см. Мода (значения). Мода значение во множестве наблюдений, которое встречается наиболее часто. Случайная величина может не иметь моды. Иногда в совокупности встречается более чем одна мода (например … Википедия
Медиана (статистика) — В этой статье не хватает ссылок на источники информации. Информация должна быть проверяема, иначе она может быть поставлена под сомнение и удалена. Вы можете … Википедия
Моменты случайной величины — Момент случайной величины числовая характеристика распределения данной случайной величины. Содержание 1 Определения 2 Замечания … Википедия
Генеральная совокупность — Генеральная совокупность, генеральная выборка (от лат. generis общий, родовой)(в англ. терминологии population) совокупность всех объектов (единиц), относительно которых учёный намерен делать выводы при изучении конкретной проблемы.… … Википедия