Principal Data Engineer
Remote · Full-time · Перетин із робочими годинами ЄС · Principal level
Шукаємо досвідченого Data-інженера в технологічну компанію, що поєднує OSINT і сучасну аналітику даних, допомагаючи урядам отримувати критично важливу інформацію про технологічне та економічне середовище росії й Китаю. Наша платформа перетворює відкриті дані на практичну аналітику щодо оборонно-промислових комплексів і ширших технологічних екосистем цих країн.
Про роль
Ви приєднаєтеся до Data Processing Team, яка перетворює необроблені дані на чисті, структуровані та надійні датасети, що лежать в основі аналітики Datenna.
Ви відповідатимете за весь життєвий цикл data pipelines: від bronze-рівня з даними, отриманими нашими колекторами, через entity resolution і enrichment — до gold-датасетів, які використовуються продуктом, knowledge graph і комерційними експортами даних.
Це роль із високим рівнем відповідальності: ви проєктуватимете pipelines і data models, визначатимете технічні стандарти та підходи, на які спиратиметься команда.
Масштаб задач
Наша платформа обробляє понад 1 млрд data points, об’єднаних у knowledge graph із більш ніж 50 млн китайських компаній, людей, закупівель і зв’язків між ними.
Головний виклик — робити це правильно, повторювано, інкрементально та з оптимальними витратами. Ця роль підійде інженеру, який сприймає data modelling і pipeline design як ключові інженерні задачі та хоче відповідати за всю систему, а не лише за окремі трансформації.
Ваші завдання
- Розробляти та підтримувати pipelines у межах Medallion Architecture: bronze → silver → gold.
- Перетворювати необроблені дані на структуровані датасети з перевіреною якістю.
- Відповідати за моделі компаній, людей і зв’язків між ними на всіх рівнях даних.
- Розвивати схеми без порушення роботи продукту, аналітики та експорту даних.
- Перевести обробку даних від повних оновлень до incremental processing, щоб нові дані потрапляли до користувачів протягом днів, а не наступних релізних циклів.
- Створювати та підтримувати data assets і models у Dagster, dbt, Trino та Databricks.
- Забезпечувати зрозумілий data lineage і належне покриття тестами.
- Відповідати за gold-датасети, що використовуються продуктом, метриками та комерційними експортами.
- Співпрацювати з командою, яка завантажує дані в Neo4j та Elasticsearch.
- Розвивати аналітичний рівень і датасети для метрик та дашбордів у Metabase.
- Покращувати якість даних, надійність, observability та вартість виконання pipelines.
- Проводити змістовні code review, менторити менш досвідчених інженерів і допомагати формувати інженерну культуру команди.
Наш стек
Python · SQL · Dagster+ · dbt · Trino · Databricks · Apache Iceberg · Medallion Lakehouse · Azure Data Lake Storage · Neo4j · Elasticsearch · Metabase · Azure · GitLab CI · Grafana · Claude Code · Codex
Процес найму
4 етапи інтерв'ю англійською.