Яндекс открыл движок для обработки потоков данных без потерь и дублей

Яндекс выложил исходный код YTsaurus Flow — движка потоковой обработки данных с сохранением состояния и восстановлением после сбоев. Он работает внутри платформы YTsaurus и по умолчанию обеспечивает exactly-once: каждое событие учитывается в результате один раз, что особенно важно для аналитики, рекомендаций и обнаружения мошенничества.

По данным компании, в Яндекс Рекламе Flow обрабатывает более 100 ГБ данных в секунду. Инженеры описывают сокращение задержки подготовки данных для дообучения моделей с десяти–двадцати часов примерно до двух. Лицензия Apache 2.0 допускает коммерческое использование; опубликованные показатели относятся к инфраструктуре Яндекса.

«Flow — часть YTsaurus»
Инженерная публикация Яндекса.

Архитектура и результаты внедрения YTsaurus Flow

#новости #opensource #разработка
@digitaltimeslv

Original in Telegram: https://t.me/digitaltimeslv/10864

Поделиться

TelegramFacebookLinkedInWhatsAppX