📊 Из жизниКаким тиражом следует выпустить учебник по алгебре для 9 класса? Сколько килограммов рыбы и морепродуктов потребляет в среднем за год один житель России? Выгодно ли для концерта данного артиста арендовать стадион? На эти и многие другие вопросы помогает отвечать статистика.

Что такое статистика

📘 Статистика(от лат. status — «состояние») — это наука о сборе, обработке и анализе количественных данных, которые характеризуют массовые явления.

Статистическое исследование состоит из нескольких этапов: сбор данных → обработка данных и их представление в удобной форме → анализ данных → выводы и рекомендации.

Сбор данных: выборка

В статистике совокупность объектов, на основании которых проводят исследование, называют выборкой.

Статистический вывод, основанный лишь на численности выборки, не всегда достоверен. Например, если, исследуя популярность артиста, ограничиться опросом людей, пришедших на его концерт, то полученные выводы не будут объективными. Статистики говорят, что выборка должна быть репрезентативной (от франц. représentatif — «показательный»).

Одним из условий формирования репрезентативной выборки является случайный выбор её элементов. При этом должна быть обеспечена одинаковая вероятность попадания в выборку любого объекта из множества исследуемых.

Иногда выборка может совпадать с множеством всех объектов, исследование которых проводится. Тогда её называют генеральной совокупностью. Примером такого исследования является проведение Единого государственного экзамена по математике для выпускников 11 класса.

Способы представления данных

Собранную информацию (совокупность данных) удобно представлять в виде таблиц, графиков, диаграмм.

Данные часто представляют в виде столбчатой диаграммы, которую ещё называют гистограммой (от греч. histos — «столб» и gramma — «написание»). Такая информация легко воспринимается и хорошо запоминается. Столбчатые диаграммы и графики обычно используют тогда, когда хотят продемонстрировать, как с течением времени изменяется некоторая величина.

Для отображения распределения совокупности данных по категориям (например, распределения медалей по предметам) используют круговую диаграмму: круг представляет общее количество данных, а каждой категории соответствует некоторый сектор круга.

Среднее значение

Часто вычисляют, сколько в среднем приходится некоторой величины на единицу (например, сколько в среднем золотых медалей в год завоёвывали школьники на олимпиадах) — для этого сумму всех значений делят на их количество.

Однако среднее значение не всегда точно (адекватно) отображает ситуацию. Например, если в стране доходы разных слоёв населения очень различаются, то средний доход на одного человека для большинства жителей может не отображать их материальное состояние. Допустим, в какой-то стране 100 жителей — очень богатые, а остальные 5 млн — очень бедные. Тогда показатель среднего дохода может оказаться не низким, а следовательно, не будет адекватно отображать общую бедность населения. В подобных случаях для анализа данных используют другие характеристики.

⚠️ Частая ошибкаУченики часто считают, что среднее значение всегда хорошо описывает «типичный» элемент выборки. Это не так: если в выборке есть очень большие или очень маленькие значения (как доходы 100 богатых жителей на фоне 5 млн бедных), среднее «перетягивается» в их сторону и перестаёт отражать реальную картину. В таких случаях используют моду или медиану.

Частотная таблица и мода

Если для совокупности данных подсчитать, сколько раз встречается каждое значение (или категория), получится частотная таблица, а числа, отражающие количество повторений, — частотами.

📘 МодаЗначение (или категория), которое встречается в выборке чаще всего, т. е. имеет наибольшую частоту, называют модой полученных данных.

Мода является важнейшей характеристикой тогда, когда полученная совокупность данных не является числовым множеством (например, размер одежды).

Отношение частоты к величине (объёму) всей выборки, записанное в процентах, называют относительной частотой. Например, если частота значения равна 61 из выборки объёмом 500, то относительная частота равна $$\dfrac{61}{500}\cdot 100 = 12{,}2\ \%$$

Заметим, что если в таблице две частоты равны и принимают наибольшие значения, то модой являются оба соответствующих значения.

Медиана

Рассмотрим упорядоченную по возрастанию совокупность данных с нечётным количеством значений. Число, которое стоит посередине этого упорядоченного ряда, называют медианой этой выборки. В последовательности из 11 чисел, например, есть пять значений, меньших медианы, и пять — бо́льших.

Если упорядоченная совокупность данных состоит из чётного количества чисел, то «серединой» выборки являются сразу два числа. Медианой такой выборки считают их среднее арифметическое.

Размах

📘 РазмахРазность между наибольшим и наименьшим значениями выборки называют размахом этой совокупности данных.

Среднее значение, моду и медиану называют мерами центральной тенденции полученной совокупности данных. В зависимости от собранной информации и способа её получения для анализа применяют различные из этих характеристик — они могут дополнять друг друга, какая-то из них может более точно (адекватно), чем другие, отражать конкретную ситуацию. Чем богаче арсенал методик обработки данных, тем более объективный вывод можно получить.

Запомни

🧠 Меры центральной тенденции выборки
  • Среднее значение — сумма всех значений выборки, делённая на их количество;
  • Мода — значение с наибольшей частотой (может быть несколько, если частоты равны);
  • Медиана — среднее упорядоченного (по возрастанию) ряда: если значений нечётное число — центральное значение, если чётное — среднее арифметическое двух центральных;
  • Размах — разность между наибольшим и наименьшим значениями выборки;
  • Ни одна из характеристик не «правильнее» других — их выбирают в зависимости от того, что нужно показать.
Перетаскивай точки — задай баллы 7 участников (от 0 до 10), характеристики выборки пересчитаются сразу