Data Platform jamoasiga Data Engineer
Toshkent • Masofaviy ish • 3 yildan boshlab
Uzum — bu yirik ekotizim, ma’lumotlar ham ekotizimlilikni talab qiladi, shu sababli biz Data Mesh yondashuvi asosida ishlaymiz. Ma’lumotlarga ularni yaratuvchi domenlar — jamoalar egalik qiladi. Domen o‘z ma’lumotlarini aniq kontrakt, SLA va sifat metrikalariga ega data product sifatida taqdim etadi. Domen ushbu ma’lumotlar uchun ularning iste’molchilari oldida javob beradi.
Buning uchun biz noldan ikkita yo‘nalishni qurmoqdamiz. Birinchisi — self-serve platforma: bu vositalar, shablonlar va avtomatlashtirishlar to‘plami bo‘lib, ular yordamida domen bizning jamoamizga alohida so‘rov yubormasdan o‘z data product’ini mustaqil ishga tushiradi. Ikkinchisi — federativ governance: kontraktlar, sifat, kirish huquqlari, metama’lumotlar va so‘rovlar qiymati bo‘yicha yagona qoidalar. Ushbu qoidalar platforma darajasida avtomatik qo‘llaniladi.
Nima bilan shug‘ullanasiz:
Self-serve platformani noldan loyihalash va qurish: domenning manbani ulashdan boshlab, bizning jamoamiz ishtirokisiz data product’ni nashr etishgacha bo‘lgan yo‘lini avtomatlashtirish;
Data kontraktlarining hayotiy siklini avtomatlashtirish: sxemani tavsiflash, versiyalash, CI’da backward compatibility’ni tekshirish, production’da ma’lumotlarni validatsiya qilish, kontrakt asosida DDL va pipeline’larni generatsiya qilish;
Ma’lumotlar katalogi va OpenMetadata’ni modelimizga moslashtirish: o‘z entity’lari va custom properties, data product’larni avtomatik ro‘yxatdan o‘tkazish, manbadan vitrinagacha lineage, katalogni kontraktlar, sifat va kirish huquqlari bilan bog‘lash, ichki ssenariylarga mos ravishda API va UI’ni takomillashtirish;
Sifat va observability’ni platformaning bir qismiga aylantirish: ma’lumotlarni tekshirish, data product’lar uchun SLA, alertlar, yangiligi va to‘liqligi metrikalari, so‘rovlar va storage qiymatini nazorat qilish;
Domenlarga kirib, ularning jamoalari bilan birgalikda ishlash: ma’lumotlar modelini tahlil qilish, data product’larni loyihalash, mavjud pipeline’larni platformaga ko‘chirish va production’gacha yetkazish;
Domenlarni o‘qitish va onboarding’dan o‘tkazish: workshop’lar, hujjatlar, guideline’lar, tipik xatolarni tahlil qilish, dastlabki iteratsiyalarda jamoalarni qo‘llab-quvvatlash;
Production muhitida batch va streaming pipeline’lar bilan ishlash.
Stek: PySpark, Airflow, ClickHouse, Trino, PostgreSQL, Kafka Connect, Debezium, Kubernetes, Iceberg, dbt, OpenMetadata.
Biz uchun nimalar muhim:
Data Engineering sohasida amaliy tajriba: Python, SQL, orchestration va production data pipeline’lar;
Airflow yoki boshqa orchestrator’lar bilan ishlash tajribasi;
Batch va streaming processing’ni tushunish, Spark / PySpark bilan ishlash tajribasi;
Lakehouse va analitik stek bilan ishlash tajribasi: Trino/Presto, ClickHouse, Iceberg/Parquet/DeltaLake;
Kafka, Kafka Connect, Debezium yoki boshqa event streaming vositalari bilan ishlash tajribasi;
Faqat pipeline’lar emas, balki ichki vositalar va servislarni ishlab chiqish tajribasi: toza kod, testlar, CI/CD, Kubernetes;
Muhandislik tafakkuri: ishonchlilik, xarajat, ma’lumotlar sifati, qo‘llab-quvvatlash va o‘zgarishlarning foydalanuvchilarga ta’siri haqida fikrlay olish;
Ichki foydalanuvchilar bilan ishlay olish: domendan talablarni yig‘ish, yechimni tushuntirish, trening o‘tkazish va jamoalar foydalanadigan hujjatlarni tayyorlash;
Ustunlik bo‘ladi: data contracts, ma’lumotlar kataloglari (OpenMetadata, DataHub, Amundsen), data quality framework’lari, dbt bilan ishlash tajribasi, shuningdek Data Mesh yoki shunga o‘xshash markazlashmagan modelni joriy etishda ishtirok etgan bo‘lish.
Nima uchun bu qiziqarli:
Platforma, kontraktlar, avtomatlashtirish va governance hozir loyihalashtirilmoqda va siz ularning qanday shakllanishiga ta’sir ko‘rsatasiz;
Keng mas’uliyat doirasini beramiz va arxitektura qarorlari, platformaviy yondashuvlar hamda kompaniya ichidagi jamoalarning ma’lumotlar bilan qanday ishlashiga ta’sir qilish imkoniyatini taqdim etamiz;
Bu yerda ko‘plab murakkab muhandislik vazifalari mavjud: ishonchli streaming, CDC, Spark, Iceberg/Trino/ClickHouse, ma’lumotlar sifati, observability, so‘rovlar qiymati va production reliability;
Bizda zamonaviy stek mavjud: PySpark, Airflow, ClickHouse, Trino, PostgreSQL, Kafka Connect, Debezium, Kubernetes, Iceberg, dbt, OpenMetadata;
Biz startapning tezkorligi va tashabbuskorligini saqlab qolganmiz, shu bilan birga yetuk jarayonlarni yo‘lga qo‘yganmiz: tushunarli maqsadlar, production yondashuvi, natija uchun mas’uliyat va shaffof kommunikatsiya;
Butun jamoa bilan birgalikda o‘lchab bo‘ladigan maqsadlarni shakllantiramiz va nafaqat vazifalarning bajarilganiga, balki ularning biznesga, ma’lumotlardan foydalanuvchilarga va mahsulot jamoalarining ishlash tezligiga ta’siriga ham e’tibor qaratamiz;
Chuqur ekspertiza, muhandislik tafakkuri va takomillashtirishlarni taklif qila olish qadrlanadigan kuchli mutaxassislardan iborat jamoada ishlaymiz;
Jamoalar bir-birini tinglaydi va eshitadi: biz biznes, analitiklar va mahsulot jamoalari bilan hamkor sifatida ishlaymiz.