Сегодня рассмотрим важную для обучения администраторов кластера Apache Kafka тему про удаление брокеров. Что происходит, когда администратор удаляет брокер Kafka из кластера, какие сложности при этом могут возникнуть и как…
Метка: Kafka
Анализ данных Youtube в реальном времени с Apache NiFi, Kafka и Spark Streaming
Автор Анна ВичуговаКатегория Kafka, NiFi, Spark, СтатьиВ этой статье для дата-инженеров рассмотрим пример конвейера анализа потокового видео с Youtube-каналов на Kafka, Spark Streaming и Elasticsearch c Kibana, связанных через процессоры Apache NiFi. Постановка задачи: ETL-конвейер анализа…
Apache Kafka в Walmart для масштабируемого пополнения запасов в реальном времени
Автор Анна ВичуговаКатегория Kafka, СтатьиПроблема своевременного пополнения товарных запасов актуальна для любого ритейлера. Разбираемся, как торговый гигант США Walmart построил свою платформу планирования и пополнения продукции в реальном времени на базе Apache Kafka: ключевые…
Feature Store на Apache HBase с Phoenix, RonDB и Kafka: кейс Dream11
Автор Анна ВичуговаКатегория Machine Learning, СтатьиСовременные ML-системы представляют собой сложные комплексные платформы из множества компонентов, одним из которых является хранилище фичей для моделей машинного обучения. Индийская gamedev-компания Dream11 делится своим опытом, как построить такое Feature…
3 режима вывода в Apache Spark Structured Streaming
Автор Анна ВичуговаКатегория Spark, СтатьиКакие бывают режимы вывода в структурированной потоковой передаче Spark, чем они отличаются и как их использовать на практике: разбираемся на практическом примере. Краткий ликбез по output modes в Apache Spark…
Больше или быстрее: ищем компромисс пропускной способности Apache Kafka
Автор Анна ВичуговаКатегория Kafka, СтатьиПропускная способность информационной системы на базе Apache Kafka говорит о том, сколько данных могут быть обработаны за определенный период времени. Несмотря на потоковую передачу событий, здесь работает классический закон обратной…
Отказы в Kafka-приложениях и FMECA-анализ: определить и устранить сбои
Автор Анна ВичуговаКатегория Kafka, СтатьиХотя Apache Kafka является надежной платформой потоковой обработки событий, что особенно важно для распределенных приложений, отказы случаются и в ней. Сегодня разберем важную для обучения разработчиков и дата-инженеров тему про…
Интеграционное тестирование Kafka-приложений: 4 полезных библиотеки
Автор Анна ВичуговаКатегория Kafka, СтатьиПродолжая важную для обучения разработчиков распределенных приложений и дата-инженеров тему про тестирование Big Data систем на базе Apache Kafka, сегодня рассмотрим некоторые средства для создания интеграционных тестов. Краткий ликбез по…
Модульное тестирование Kafka-приложений
Автор Анна ВичуговаКатегория Kafka, СтатьиЧтобы сделать наши курсы по Apache Kafka еще полезнее, сегодня разберем, как тестировать распределенные приложения на базе этой платформы потоковой обработки событий. Краткий ликбез для разработчика Kafka Streams и дата-инженера:…
Как реестр схем помогает снизить нагрузку на запись сообщений в топики Apache Kafka
Автор Анна ВичуговаКатегория Kafka, СтатьиМы уже рассказывали, что такое реестр схема Apache Kafka и зачем он нужен. Чтобы глубже разобраться с этой темой, важной для обучения разработчиков распределенных приложений и дата-инженеров, сегодня заглянем под…