HeadHunter завершил проект по внедрению Arenadata Catalog (ADC) — системы управления корпоративными данными, которая выстраивает процессы Data Governance. Каталог стал операционной системой для аналитиков, дата-инженеров и внутренних ИИ-сервисов компании. Через него проходят ключевые процессы поиска, описания и сопровождения данных, а также сценарии работы с искусственным интеллектом.
Потребность в инструментах Data Governance команда по работе с данными HeadHunter зафиксировала ещё в 2022 году. Объём данных на платформе и число сотрудников росли, аналитические задачи усложнялись, и компании требовалось единое пространство для работы пользователей. На первом этапе HeadHunter развивал собственный каталог метаданных силами внутренней команды. Однако к 2024 году стало очевидно, что стратегию развития необходимо пересмотреть. Команда продолжила доработку внутреннего решения и параллельно начала оценивать зрелость продуктов на рынке. Для выбора оптимального варианта в HeadHunter создали рабочую группу и подготовили сравнительную таблицу решений — как open source, так и коммерческих. Ряд из них к тому моменту уже не был доступен в России, а часть продуктов не удовлетворяла команду из-за интерфейса, неудобного для бизнес-пользователей, отсутствия нужного функционала и вендорской поддержки.
| Параметр | Значение |
|---|---|
| Объём аналитического хранилища | 5,8 ПБ |
| Метаданные систем-источников | около 40 ТБ |
| Описано таблиц | 99 590 |
| Отсканировано баз данных | 487 |
| Kafka-топиков | 1203 |
| Airflow DAG | 405 |
| Задач Airflow | 40 783 |
| Дашбордов | 1768 |
| KPI и бизнес-терминов | более 200 |
| Классификаторов | более 100 |
| Бизнес-пользователей | около 800 |
| Команд | 45 |
| Активных пользователей каталога | около 100 |
| DAU | более 30 |
«Когда мы поняли, что потребности в компании в дата-каталоге всё время растут, развивать свой продукт стало нерационально. В итоге экономически эффективнее оказалось взять решение с рынка. Для нас было важно не только закрыть текущие потребности, но и выбрать решение с понятной перспективой развития», — сказал Селим Алкадарский, руководитель направления Data Platform HeadHunter. По итогам сравнительного анализа Arenadata Catalog оказался максимально близок к ожиданиям HeadHunter по функциональности и дорожной карте развития. Ключевым аргументом стало то, что инструмент будет развиваться синхронно с внутренним дата-ландшафтом.
Активная фаза внедрения заняла около трёх месяцев. Проект команда HeadHunter реализовывала своими силами, точечно привлекая техническую поддержку Arenadata. После запуска каталог начали постепенно наполнять данными и продвигать внутри компании. Сначала к нему подключили аналитиков и технических пользователей, затем расширили использование: ADC стали применять для описания данных, поиска владельцев и навигации по взаимосвязям между объектами.
На текущий момент Arenadata Catalog покрывает ландшафт данных аналитического хранилища объёмом 5,8 ПБ. Дополнительно в систему загружены метаданные систем-источников суммарным объёмом около 40 ТБ, а также kafka-топики, которые помогают находить первоисточники таблиц и определять зоны ответственности за исправления. На практике это делает каталог удобной точкой входа в дата-ландшафт компании, где легче ориентироваться в структуре и связях между объектами.
Около 800 бизнес-пользователей объединены в 45 команд, среди которых около 100 активных пользователей каталога. Команды одновременно являются владельцами данных. В системе описано 99 590 таблиц, отсканировано 487 баз данных, 1203 kafka-топика, каталогизировано и автоматически обновляется информация о 405 Airflow DAG и 40 783 задачах Airflow. Существенную часть каталога составляют объекты аналитического слоя хранилища: в ADC отражены 1768 дашбордов, описано более 200 KPI и бизнес-терминов. Объекты помечаются кастомизируемыми классификаторами, число которых уже превысило 100.
В HeadHunter каталог используют аналитики, технические специалисты и команды, отвечающие за качество данных. Аналитики обращаются к нему за описаниями таблиц, схем, колонок, терминов и метрик. Технические специалисты просматривают информацию о владельцах, стюардах и связях между объектами. В процессах, связанных с качеством данных, каталог стал узловой точкой, через которую проходят алерты и назначение ответственных. На протяжении всего проекта DAU стабильно составляет более 30 сотрудников.
Есть и более прикладные сценарии. Если дата-инженерам нужно поставить задачу на переливку таблицы или kafka-топика в аналитическое хранилище, ссылка на соответствующий объект в каталоге теперь обязательна. Аналитики используют Arenadata Catalog для обмена описаниями метрик вместе со скриптом их подсчёта, что помогает поддерживать единую методологию в разных командах. После того как в компании начали активнее развивать ИИ-сценарии, роль каталога усилилась. Документация теперь ведётся в отдельном репозитории в Git, после чего описания попадают в каталог и становятся доступны ИИ-агентам.
Кейс HeadHunter показывает, как крупная компания переходит от собственной разработки к рыночному решению в области Data Governance. Это отражает общий тренд: по мере роста объёмов данных и усложнения аналитики поддержка внутренних каталогов метаданных становится дороже, чем покупка готового продукта с вендорской поддержкой и понятной дорожной картой. Для Arenadata это ещё один крупный заказчик, подтверждающий спрос на импортозамещающие инструменты управления данными в России.

