Дайджест докладов: Константин Сергеев, Олег Кочергин, Татьяна Колмакова и Максим Стаценко, Ольга Татаринова и Алексей Махоткин, Дмитрий Зуев

Дайджест докладов: Константин Сергеев, Олег Кочергин, Татьяна Колмакова и Максим Стаценко, Ольга Татаринова и Алексей Махоткин, Дмитрий Зуев, image #1

Константин Сергеев, СМП Банк

«Использование Pentaho DI»

ETL Pentaho может решить несколько задач — быстро загружать данных и проводить их аналитику. А также у Pentaho есть несколько фишек, которые помогают перегружать большое количество таблиц в DWH. Константин расскажет, как пользоваться этим инструментом — покажет примеры трансформации и загрузки данных, аналитики и работы с JS, Java и Bash,

Олег Кочергин, СберЗдоровье

«Ingest-слой платформы данных: смешать, но не взбалтывать»

Вы узнаете о том, как построить Ingest-слой для внутренних и внешних источников — не забывая про работу с чувствительными данными. Олег разберет архитектуру, которую придумала его команда и расскажет про DSL, который управляет всеми компонентами платформы в СберЗдоровье.

Татьяна Колмакова и Максим Стаценко, Яндекс

«Путь к модели данных для ежедневного апдейта 100 прошлых дней»

Каждый день в Яндекс после обработки, сжатии и упаковки приходят до 10 терабайт данных. Обновления приходят на данные до 100 дней в прошлое, и их используют сотни скриптов и внутренних пользователей. Татьяна и Максим расскажут, почему Data Vault не подошел для работы с такими данными, как ради экономии пришлось отказаться от других красивых решений. Вас ждет история, после которой вы поймете, как выбрать архитектуру и лучший подход, не повторив ошибки команды Яндекса.

Ольга Татаринова (AGIMA.AI) и Алексей Махоткин (MinimalModeling.com)

«Как моделирование данных помогает повысить качество данных и отчетов и снизить требования к опыту аналитиков»

Почему этап создания и документирования модели — самый важный для аналитического стека? От этого проект получит несколько бонусов — к нему можно подключить любое количество аналитиков, а новый аналитик может выйти на эффективность за полдня.

Татьяна и Алексей расскажут про эволюцию подхода к разработке клиентских аналитических проектов. Вы узнаете, как задокументировать датасет «по построению» и сделать документацию частью процесса работы с данными.

Дмитрий Зуев, Тинькофф

«Как построить data lineage. Обзор решений и опыт нашей команды»

О хорошем data lineage мечтают все: пользователи, системные аналитики, разработчики и даже безопасники. И все хотят, чтобы data lineage строился без участия человека: для предостережения ошибок и ускорения времени разработки. Дмитрий расскажет, какие решения для этого доступны в индустрии, какие есть сложности и ограничения, и каким путем пошли в его команде.

Подробности и билеты на SmartData 2022: https://bit.ly/3RI3Taz

25 views·2 shares