Дайджест докладов: Александр Боргардт, Денис Ефаров, Антон Виноградов, Владимир Озеров, Игорь Мосягин, Валентин Пановский
Александр Боргардт, duckstax.com
«Колонки и векторные инструкции»
Если верить определению из Википедии, то векторизация применяется только в колоночных СУБД. На самом деле, она окружает дата-инженера повсюду: NumPy, pandas, Apache Spark, Numba. Александр расскажет, в каких случаях ее использование будет эффективным
Денис Ефаров, Одноклассники
«100 миллиардов сообщений в Kafka: загрузил и забыл»
Apache Kafka — прекрасный инструмент для передачи сообщений между сервисами. Но возможностей Apache Spark не хватило, чтобы выгрузить из него 100 миллиардов сообщений для офлайн-аналитики. Денис расскажет о собственном решении команды, которое позволило выгружать этот объем данных каждый день из Apache Kafka в HDFS без лишних сложностей.
Антон Виноградов, Apache Software Foundation
«Восстановление распределенной базы данных после аварии»
Удаленный документ можно восстановить откатом и парой дополнений по памяти. Сгоревший сервер восстанавливается из бэкапа. А что делать с распределенной БД, где ошибка в коде стерла каждое миллионное изменение в каждом кластере?
Антон ответит на этот вопрос и расскажет, что делать, когда код-ревью, failover и сертификация не помогли избежать аварии распределенной базы данных.
Владимир Озеров, Querify Labs
«Как устроено выполнение SQL-запросов в Trino»
Trino — это распределенный SQL-движок с serverless-архитектурой, который позволяет выполнять федеративные запросы по данным произвольного объема. Владимир расскажет, как устроено выполнение таких вопросов — от получения запроса на узле-координаторе до выдачи результата пользователю
Игорь Мосягин, Klarna
«Хранилище есть, а дальше что? Документация и другие способы улучшить DX ваших коллег»
Какие доки нужны и зачем? Как организовать демо и общение между командами, работающими с вашим хранилищем? Как в этом бардаке сделать так, чтобы аналитики понимали, чего от них хотят инженеры, а менеджеры понимали, какие проблемы у аналитиков?
Игорь расскажет про стили кода, улучшение документации и про то, как сделать так, чтобы все дружили друг с другом в контексте работы с хранилищем данных.
Валентин Пановский, more.tv
«Использование платформы GrowthBook для управления ML-экспериментами»
Поговорим об одном из способов организации пайплайна экспериментов на основе открытой платформы GrowthBook, когда ответственность за запуск и тестирование фич лежит на команде ML-разработчиков. Подход, который представит Валентин, призван уменьшить количество интеграций на стороне основной команды разработки и повысить скорость вывода в продакшен новых версий моделей машинного обучения.
Подробности и билеты на SmartData 2022: https://bit.ly/3T8jAcd
