Откуда берутся наши данные
Все числа на этих страницах пересчитываются из базы, а не набраны руками. Здесь описано, откуда они приходят, как считаются и — что важнее — какие выводы из них делать нельзя.
Четыре источника
Справа — объём каждого источника: попыток отклика, резюме, пар «профессия + город», прогонов поиска.
Что мы сохраняем и чего не сохраняем
Сохраняется то, что hh возвращает в ответ на действие: сколько откликов уже подано на вакансию, требуется ли тест, как называется вакансия и кто работодатель. Из статистики резюме — четыре счётчика: показы, просмотры, приглашения и исходы откликов. Всё это агрегируется до чисел; ни один текст резюме, ни одно письмо и ни одно имя на страницы не попадают.
Не сохраняется и не публикуется ничего, что позволяет узнать конкретного человека или соотнести цифры с ним. В разборе разброса между резюме строки обезличены полностью: без профессии, города и любых других признаков. Названия компаний мы тоже не публикуем — только структуру распределения.
Три правила счёта
Медиана вместо среднего. Почти все величины здесь имеют длинный хвост: одна вакансия с тысячей откликов сдвигает среднее так, что оно перестаёт описывать типичный случай. Медиана к таким выбросам устойчива, поэтому в текстах стоит она.
Последний снимок вместо суммы по дням. Счётчики hh накопительные или скользящие. Сложение по дням посчитало бы одно и то же событие много раз, поэтому берётся последнее состояние по каждому резюме.
Потолки показываются отдельно. Счётчик откликов hh останавливается на тысяче. Мы не подставляем вместо него оценку и не прячем такие случаи в среднем: доля вакансий, упёршихся в потолок, всегда указывается отдельной цифрой.
Где выборка смещена
Чего в данных мало
Рабочих и массовых профессий, регионов кроме крупных городов, вакансий без цифровой составляющей. Отклики делают пользователи сервиса, а это преимущественно аналитика, тестирование и IT, преимущественно Москва.
Что это меняет
Абсолютные значения переносить на весь рынок нельзя. Соотношения и механизмы — можно: то, что тишина преобладает над ответом, а очередь длиннее в узком рынке, устроено одинаково везде.
Какие выводы мы намеренно не делаем
Мы не связываем текст сопроводительного письма с исходом отклика. hh не сообщает, читали ли письмо, и в данных такой связи попросту нет — любое утверждение вида «письма длиной N работают лучше» было бы выдумкой.
Мы не публикуем зарплатную динамику по месяцам: медиана в замерах скачет от снимка к снимку слишком сильно, чтобы её движение можно было называть трендом. Публиковать саму нестабильность честно, а выдавать её за динамику рынка — нет.
И мы не превращаем совпадения в причины. Например, в области, где тесты встречаются чаще всего, очередь откликов короче — но из этого не следует, что тест является причиной. Мы говорим о совпадении двух измерений и объясняем механизм как правдоподобный, а не доказанный.
Как это посчитано и чего цифры не показывают
- Все страницы этого раздела пересчитывают числа из базы при обращении, с кэшем в несколько часов. Ни одна цифра не зашита в текст.
- Если база недоступна, страница показывает сообщение об этом, а не старые или выдуманные значения.
- Данные о рынке (число вакансий и вилки) собираются с публичной выдачи hh медленно и по очереди, чтобы не создавать нагрузку: поэтому часть пар обновляется не каждый день.
- Выборка растёт: с ней меняются и числа на страницах. Значения, названные в текстах словами, могут слегка расходиться с текущими цифрами в блоках.
- Вопросы к методике и замеченные расхождения присылайте — мы правим их в источнике, а не в тексте страницы.