Анализ данных • 10 июня 2026 • 5 мин чтения

Data catalog. DataHub/Amundsen, бизнес‑глоссарий, ownership

Рассказываем, что такое Data catalog, что в него входит и как он помогает аналитикам.

Что такое data catalog

Когда данных становится много, возникает непростая проблема: таблицы есть, отчёты есть, витрины есть, но непонятно, где искать нужные данные, кто за них отвечает и можно ли им доверять. Data catalog помогает решить эту задачу.

Data catalog — это каталог данных компании. В нём собирается информация о таблицах, витринах, дашбордах, колонках, источниках, владельцах, качестве данных и связях между объектами. По сути, это справочник, который помогает найти нужные данные, понять их смысл и оценить, подходят ли они для анализа.

Работать с данными учат на курсе «Бизнес-аналитик». За восемь месяцев на нём изучают с нуля основные нотации — в том числе BPMN, а также работу с данными при помощи SQL, Excel и Google Sheets. После обучения выпускники получают диплом о профессиональной переподготовке.

Что входит в data catalog

Каталог данных содержит несколько основных блоков информации. Эти блоки помогают пользователям ориентироваться в данных, понимать их смысл и происхождение. Ниже перечислены ключевые компоненты каталога данных.

  • Технические метаданные — названия таблиц, схемы, типы колонок, источники, дата последнего обновления, связи с пайплайнами и BI-отчётами.
  • Бизнес-описания — пояснения, что означает поле client_id, кто считается активным пользователем или какие продажи попадают в выручку. Без таких описаний два пользователя могут взять одну таблицу и получить разные выводы.
  • Происхождение данных (Lineage) — информация о том, откуда пришли данные и куда они дальше попали. Lineage помогает понять, почему сломался отчёт или какие дашборды затронет изменение в таблице.
  • Владельцы (Ownership) — человек или команда, отвечающие за смысл, качество и актуальность. У каждого важного набора данных указан владелец, к нему обращаются с вопросами, если что-то пошло не по плану.
  • Теги, классификации и признаки чувствительности — отметки о персональных данных, финансовых показателях, экспериментальных витринах или проверенных источниках для отчётности.

Перечисленные компоненты создают полную картину данных в компании. Без технических метаданных невозможно найти нужную таблицу, без бизнес-описаний — правильно интерпретировать цифры. Lineage и ownership обеспечивают прозрачность и ответственность за качество данных.

Содержимое data catalog

Чтобы разные люди одинаково понимали ключевые понятия, существует бизнес-глоссарий — это словарь терминов компании: например, «клиент», «заявка», «конверсия», «выручка», «отток», «активный пользователь». В хорошем глоссарии у термина есть понятное определение, владелец, связанные термины и ссылки на реальные таблицы или колонки.

В DataHub бизнес-глоссарий описан как способ задать общий словарь понятий и связать эти понятия с физическими объектами в экосистеме данных. Для этого в DataHub используются термины и группы терминов, у которых могут быть документация и владельцы. Глоссарий особенно полезен, когда одни и те же слова разные команды используют по-разному. Например, маркетинг считает лидом одну сущность, продажи — другую, финансы — третью. Без общего словаря такие расхождения быстро превращаются в споры в отчётах.

Обзор популярных решений

На рынке давно появилось много решений для управления метаданными. Среди них есть продукты с открытым исходным кодом и корпоративные разработки мировых технологических компаний. Расскажем про основные решения.

  • DataHub — популярная open-source-платформа для управления метаданными. Инструмент используют для поиска, описания, построения lineage, назначения ownership, ведения глоссариев и интеграции с разными источниками данных. В DataHub удобно искать по наборам данных, колонкам, дашбордам, пайплайнам, ML-моделям, тегам, glossary terms, owners и domains.
  • Amundsen — open source data discovery and metadata engine, созданный в Lyft. Идея продукта близка к поисковой системе по данным. Amundsen индексирует таблицы, дашборды, стримы и другие ресурсы, а поиск учитывает паттерны использования данных.
  • OpenMetadata — ещё одно open-source-решение с функциями каталогизации, lineage, контроля качества данных, ownership и глоссариев. В документации OpenMetadata глоссарий описан как controlled vocabulary, который создаёт общее понимание терминов и связывает их с data assets.
  • Collibra и Alation — коммерческие решения, часто встречающиеся в продакшен-средах. Они ориентированы на более широкий контур data governance: политики, роли, согласования, классификацию данных и работу с бизнес-пользователями.

Функциональность у этих решений частично пересекается: поиск по данным, описание объектов, владельцы, теги и работа с метаданными. При выборе инструмента важнее смотреть на стек компании, доступные интеграции, требования к lineage, data governance, quality checks, поддержку, стоимость владения и удобство для пользователей.

Ownership (ответственность за данные)

Ownership отвечает на вопрос, кому писать, если в данных что-то непонятно или что-то сломалось. Владелец данных может отвечать за несколько вещей. Он понимает бизнес-смысл данных, следит за описанием, помогает с доступами, принимает решения об изменениях и участвует в разборе инцидентов. В крупных компаниях ownership часто задают на разных уровнях, например для домена, схемы, таблицы, витрины, метрики или дашборда.

Важно, чтобы owner был реальным. Если у таблицы в качестве владельца обозначен уволившийся сотрудник, общая почта или команда без понятного ответственного, такой ownership почти бесполезен. Каталог работает лучше, когда владельцы регулярно обновляются и участвуют в жизни данных.

Внедрение Data Catalog

Внедрение data catalog лучше начинать с малого. Сначала выбирают самые важные источники, например DWH, BI-систему и основные витрины. Затем автоматически загружают технические метаданные, добавляют владельцев и описывают наиболее используемые таблицы.

  • Выбрать ключевые источники: DWH, BI-систему, основные витрины.
  • Автоматически загрузить технические метаданные.
  • Добавить владельцев и описать наиболее используемые таблицы.
  • Подключить глоссарий, начав с 20–50 ключевых терминов, которые чаще всего вызывают споры: «клиент», «сделка», «выручка», «активность», «заказ», «продукт».
  • Для каждого термина назначить владельца и связать термин с конкретными таблицами или колонками.

Data catalog — это не разовая документация. Если каталог заполнили один раз и забыли, он быстро устареет. Его нужно встроить в процессы: в создание новой витрины, изменение схемы, запуск нового отчёта, разбор инцидентов, выдачу доступов. В зрелых процессах часть описаний можно ускорять с помощью автоматизации, но финальная ответственность за смысл данных остаётся за владельцами.

Работать с данными учат на курсе «Бизнес-аналитик». За восемь месяцев на нём изучают с нуля основные нотации — в том числе BPMN, а также работу с данными при помощи SQL, Excel и Google Sheets. После обучения выпускники получают диплом о профессиональной переподготовке.

Как Data Catalog помогает аналитикам

Data catalog экономит время аналитика. Он помогает находить нужную информацию, видеть владельца данных и т. д. Перечислим основные возможности:

  • находит нужную таблицу через поиск;
  • позволяет просматривать описания колонок;
  • позволяет просматривать владельца данных;
  • проверяет свежесть данных;
  • позволяет понять, какие отчёты уже используют этот источник.

Каталог снижает риск взять неправильную таблицу. Например, в компании может быть несколько витрин с продажами: сырые события, операционная витрина, финансовая витрина и экспериментальная версия для новой модели расчёта. Без каталога новичок легко выберет неподходящую таблицу.

Data catalog помогает быстрее входить в предметную область. Новый аналитик видит термины, связи между таблицами, популярные источники и ответственных людей. В результате аналитик тратит меньше времени на разведку и больше — на сам анализ. Data catalog создаёт слой навигации и доверия поверх данных компании. Для новичка это карта, для опытного аналитика — способ быстрее работать, для компании — основа зрелого управления данными.

Статью подготовили:
Кирилл Дикалин
Яндекс Практикум
Автор и ревьювер курса DE, тимлид команды дата-инженеров в Альфа-Банке, преподаватель инжиниринга данных ВШЭ
Валентина Бокова
Яндекс Практикум
Редактор
Полина Овчинникова
Яндекс Практикум
Иллюстратор

Подпишитесь на наш ежемесячный дайджест статей —
а мы подарим вам полезную книгу про обучение!

Поделиться
Помогите Алисе попасть в страну IT и получите в подарок гайд, полезные книги и скидку 10%