HeadHunter завершил проект по внедрению Arenadata Catalog (ADC) — системы управления корпоративными данными, которая выстраивает процессы Data Governance. Каталог стал операционной системой для аналитиков, дата-инженеров и внутренних ИИ-сервисов компании. Через него проходят ключевые процессы поиска, описания и сопровождения данных, а также сценарии работы с искусственным интеллектом.

Потребность в инструментах Data Governance команда по работе с данными HeadHunter зафиксировала ещё в 2022 году. Объём данных на платформе и число сотрудников росли, аналитические задачи усложнялись, и компании требовалось единое пространство для работы пользователей. На первом этапе HeadHunter развивал собственный каталог метаданных силами внутренней команды. Однако к 2024 году стало очевидно, что стратегию развития необходимо пересмотреть. Команда продолжила доработку внутреннего решения и параллельно начала оценивать зрелость продуктов на рынке. Для выбора оптимального варианта в HeadHunter создали рабочую группу и подготовили сравнительную таблицу решений — как open source, так и коммерческих. Ряд из них к тому моменту уже не был доступен в России, а часть продуктов не удовлетворяла команду из-за интерфейса, неудобного для бизнес-пользователей, отсутствия нужного функционала и вендорской поддержки.

ПараметрЗначение
Объём аналитического хранилища5,8 ПБ
Метаданные систем-источниковоколо 40 ТБ
Описано таблиц99 590
Отсканировано баз данных487
Kafka-топиков1203
Airflow DAG405
Задач Airflow40 783
Дашбордов1768
KPI и бизнес-терминовболее 200
Классификаторовболее 100
Бизнес-пользователейоколо 800
Команд45
Активных пользователей каталогаоколо 100
DAUболее 30

«Когда мы поняли, что потребности в компании в дата-каталоге всё время растут, развивать свой продукт стало нерационально. В итоге экономически эффективнее оказалось взять решение с рынка. Для нас было важно не только закрыть текущие потребности, но и выбрать решение с понятной перспективой развития», — сказал Селим Алкадарский, руководитель направления Data Platform HeadHunter. По итогам сравнительного анализа Arenadata Catalog оказался максимально близок к ожиданиям HeadHunter по функциональности и дорожной карте развития. Ключевым аргументом стало то, что инструмент будет развиваться синхронно с внутренним дата-ландшафтом.

Активная фаза внедрения заняла около трёх месяцев. Проект команда HeadHunter реализовывала своими силами, точечно привлекая техническую поддержку Arenadata. После запуска каталог начали постепенно наполнять данными и продвигать внутри компании. Сначала к нему подключили аналитиков и технических пользователей, затем расширили использование: ADC стали применять для описания данных, поиска владельцев и навигации по взаимосвязям между объектами.

На текущий момент Arenadata Catalog покрывает ландшафт данных аналитического хранилища объёмом 5,8 ПБ. Дополнительно в систему загружены метаданные систем-источников суммарным объёмом около 40 ТБ, а также kafka-топики, которые помогают находить первоисточники таблиц и определять зоны ответственности за исправления. На практике это делает каталог удобной точкой входа в дата-ландшафт компании, где легче ориентироваться в структуре и связях между объектами.

Около 800 бизнес-пользователей объединены в 45 команд, среди которых около 100 активных пользователей каталога. Команды одновременно являются владельцами данных. В системе описано 99 590 таблиц, отсканировано 487 баз данных, 1203 kafka-топика, каталогизировано и автоматически обновляется информация о 405 Airflow DAG и 40 783 задачах Airflow. Существенную часть каталога составляют объекты аналитического слоя хранилища: в ADC отражены 1768 дашбордов, описано более 200 KPI и бизнес-терминов. Объекты помечаются кастомизируемыми классификаторами, число которых уже превысило 100.

В HeadHunter каталог используют аналитики, технические специалисты и команды, отвечающие за качество данных. Аналитики обращаются к нему за описаниями таблиц, схем, колонок, терминов и метрик. Технические специалисты просматривают информацию о владельцах, стюардах и связях между объектами. В процессах, связанных с качеством данных, каталог стал узловой точкой, через которую проходят алерты и назначение ответственных. На протяжении всего проекта DAU стабильно составляет более 30 сотрудников.

Есть и более прикладные сценарии. Если дата-инженерам нужно поставить задачу на переливку таблицы или kafka-топика в аналитическое хранилище, ссылка на соответствующий объект в каталоге теперь обязательна. Аналитики используют Arenadata Catalog для обмена описаниями метрик вместе со скриптом их подсчёта, что помогает поддерживать единую методологию в разных командах. После того как в компании начали активнее развивать ИИ-сценарии, роль каталога усилилась. Документация теперь ведётся в отдельном репозитории в Git, после чего описания попадают в каталог и становятся доступны ИИ-агентам.

Кейс HeadHunter показывает, как крупная компания переходит от собственной разработки к рыночному решению в области Data Governance. Это отражает общий тренд: по мере роста объёмов данных и усложнения аналитики поддержка внутренних каталогов метаданных становится дороже, чем покупка готового продукта с вендорской поддержкой и понятной дорожной картой. Для Arenadata это ещё один крупный заказчик, подтверждающий спрос на импортозамещающие инструменты управления данными в России.